兄弟们,分享一个真正的高频工具——Crawl4AI,GitHub 7万 星,目前最火的开源爬虫没有之一。
一句话:把任何网页变成干净的 Markdown,专门为喂给 LLM 设计的。
用AI爬内容的时都会遇到的病,有时抓回来是一坨屎,乱的 HTML,表格、广告、导航栏全混在一起;
扔进AI里token 烧了一大半,提取出来的内容还是一团糟。
Crawl4AI 就是解这个问题的:
(1)LLM 友好的 Markdown 输出——标题、表格、代码块、引用,结构干干净净,直接进 RAG 或 Agent 流水线,不用再手动清洗
(2)异步并发 + 浏览器池——速度快,能处理 JS 渲染页面,动态内容也能抓,不是那种只能跑静态页面的玩具
(3)全控制——Session、代理、Cookie、自定义脚本、Hook 全支持,复杂登录场景、反爬场景都能处理
(4)深度爬取——BFS / DFS / BestFirst 三种策略,崩溃后能恢复继续跑,长任务不怕中断
(5)命令行直接用——crwl 一行命令,不用写代码:
#
抓一页转 Markdown#
crwl
#
BFS 深度爬取整站,最多 10 页#
crwl
#
带问题提取,直接 LLM 抽信息#
crwl "提取所有产品价格"
(6)零 API Key,随处部署——pip 装完就跑,也有 Docker,不需要注册任何账号
安装两行:
pip install -U crawl4ai
crawl4ai-setup
做 RAG、做 Agent、做数据管道、做竞品监控——只要你需要把网页内容喂给 AI,这个工具省的时间和 token 费用,用几次就回本了。
70100 个 Star 不是刷出来的,是真的有用。
#
AI爬虫# #
RAG# #
老杨啊分享#