註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Ren
@Ryrenz
加入 March 2025
0 正在關注    0 粉絲
🕷️ 做 RAG 和 agent 的抓数据神器 Crawl4AI,丢个网址进去,吐出来的就是大模型能直接读的干净 Markdown。 GitHub 狂揽 8.2 万 star,直接封神了。作者 UncleCode 是新加坡 Kidocode 的创始人,仓库 2024 年 5 月才建,fork 也有 8400 多个,项目现在还拿到了 Peak XV 的投资。 以前给 AI 喂网页资料,得先把 HTML 扒下来,再手动清掉导航栏、广告和脚本,最后才敢塞进上下文,一个站点折腾半天,还白白浪费 token。 Crawl4AI 把这一步做成了现成工具:命令行和 Python 异步接口都能直接用,想要结构化数据,按 CSS 选择器、正则或者让大模型帮你抽都行,要长期跑还有带监控面板和浏览器池的 Docker 部署。8 月底刚发的 0.9.3 专门补了一批安全问题。 围着它做 MCP 封装的周边仓库也不止一个,其中 mcp-crawl4ai-rag 就有 2200 多 star。 给 AI 喂网页这件事,终于不用自己手搓清洗脚本了。 GitHub:
顯示更多