注册并分享邀请链接,可获得视频播放与邀请奖励。

Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
加入 March 2025
678 正在关注    10.8K 粉丝
🕷️ 做 RAG 和 agent 的抓数据神器 Crawl4AI,丢个网址进去,吐出来的就是大模型能直接读的干净 Markdown。 GitHub 狂揽 8.2 万 star,直接封神了。作者 UncleCode 是新加坡 Kidocode 的创始人,仓库 2024 年 5 月才建,fork 也有 8400 多个,项目现在还拿到了 Peak XV 的投资。 以前给 AI 喂网页资料,得先把 HTML 扒下来,再手动清掉导航栏、广告和脚本,最后才敢塞进上下文,一个站点折腾半天,还白白浪费 token。 Crawl4AI 把这一步做成了现成工具:命令行和 Python 异步接口都能直接用,想要结构化数据,按 CSS 选择器、正则或者让大模型帮你抽都行,要长期跑还有带监控面板和浏览器池的 Docker 部署。8 月底刚发的 0.9.3 专门补了一批安全问题。 围着它做 MCP 封装的周边仓库也不止一个,其中 mcp-crawl4ai-rag 就有 2200 多 star。 给 AI 喂网页这件事,终于不用自己手搓清洗脚本了。 GitHub:
显示更多