🔥太强了,firecrawl 这个项目能把整个互联网直接变成喂给 AI 的干净数据。
GitHub 揽获 14.8 万 Star,是 AI 爬虫这条赛道里最强的开源项目。
以前自己写爬虫,光是搞定代理轮换、反爬限流、JS 渲染这些坑就要折腾好几天,抓下来的 HTML 还得再花时间清洗才能喂给模型。
现在一个 Scrape 接口调用,直接吐出干净的 Markdown 或结构化 JSON,网页上挂的 PDF、DOCX 也能顺带解析出来。
想抓整站就用 Crawl,一个请求把全站内容收回来;
只想先摸清站点结构就用 Map,秒级发现所有 URL;
批量任务丢给 Batch Scrape 异步跑,几千个 URL 也不用自己管队列。
遇到需要先点击、滚动、输入才能看到内容的页面,也能先执行完动作再抓取。
官网注册拿到 API key,一条 curl 命令就能跑起来,也能一条命令直接接入 MCP,让任何 AI agent 自己联网找资料。
顯示更多