PDF 直接丢给大模型,表格乱码、公式崩溃、扫描件还认不出字。
这 5 个工具帮你把文档转成 AI 能读的干净格式。
1、Stirling-PDF — 本地 PDF 全能工具箱,85k star
合并、拆分、压缩、加水印、转格式,几十种操作全在本地跑,文件不出本机,隐私敏感的文档放心用。
2、MinerU — 复杂文档转 Markdown,71.7k star
PDF、Office 里的表格、公式、图片精准抠出来转成 AI 可读的 Markdown,喂给大模型做问答前必备的一步。
3、docling — 文档为生成式 AI 做准备,62.3k star
IBM 出品,把各种格式文档统一转成结构化输出,接 RAG 流程很顺,企业文档处理的热门选择。
4、marker — PDF 高精度转 Markdown,36.6k star
速度快、还原准,长文档、论文转 Markdown 加 JSON,排版和结构保留得好。
5、OCRmyPDF — 给扫描件加文字层,34k star
扫描的 PDF 没法选字搜字,它自动 OCR 加上文字层,扫描件秒变可搜索可复制。
顯示更多
PDF 工具别急着付费。
这个开源项目普通人真的很容易用上:
Stirling PDF
它能做很多高频 PDF 操作:
合并。
拆分。
压缩。
转换。
加水印。
图片转 PDF。
PDF 转图片。
OCR。
很多人平时不是不会处理 PDF。
是每次遇到都要临时找网站。
然后又担心文件上传到不靠谱的平台。
Stirling PDF 的价值就在这里:
你可以自己部署一个 PDF 工具箱。
常见需求基本都能在里面解决。
它目前 GitHub 7.8 万+ Star,算是开源 PDF 工具里非常能打的项目。
适合学生、办公党、自由职业者、小团队。
尤其适合经常处理合同、报告、发票、扫描件的人。
GitHub:
顯示更多
用 PDF 编辑器改个批注加个签名,动不动就要订阅,免费版功能又砍了一半。
于是找到 Open PDF Studio 这款开源的 PDF 编辑器,批注、标注、签名、页面管理等功能都有。
并且支持并排对比两版 PDF 差异,改动自动标出来,审图改稿方便。
GitHub:
原生应用,体积不大,提供 Windows、macOS、Linux、Android 平台安装包。
经常要处理 PDF 批注和审批的朋友可以试试,省得年年续费商业工具。
顯示更多
把 PDF、Office 文件、扫描件、截图、图表、公式和流程图转成 AI 可检索、可引用、可推理的 Markdown
模型用你自己配的 OpenAI 兼容端点(本地或私有部署均可),不用单独搭 OCR、版面、表格、公式一整套模型栈。
顯示更多
将 PDF 转成文本,遇到扫描件、多栏排版、复杂表格和公式,传统 OCR 经常识别错乱。
olmOCR,一款基于视觉语言模型的 PDF 转 Markdown 工具,已斩获了 17900+ Star!
能处理公式、表格、手写体和复杂版式,还会自动去掉页眉页脚。
并且按自然阅读顺序输出,哪怕多栏排版也不会读串行。
GitHub:
单 GPU 本地跑之外也支持接入远程推理服务,处理成本能压到每百万页不到 200 美元。
需要批量处理 PDF、扫描件转成可编辑文本的朋友,尤其是做数据处理或者知识库搭建的,这个工具可以试试。
顯示更多
读 PDF、记笔记、找资料,这三件事很多人一直在瞎折腾。
论文放一个软件,网页收藏放一个软件,笔记又放另一个软件。
最后结果就是:资料越存越多,真正用的时候一个都找不到。
note.md 这个工具我觉得很适合 Mac 用户试试。
它把阅读、Markdown 笔记、引用、资料管理放到了一起。
你可以一边看 PDF,一边做笔记;看到有用的内容,直接整理成引用;后面忘了写在哪,还能靠搜索把相关内容翻出来。
以前你以为自己缺的是更多收藏夹,其实你缺的是一个能把资料重新找回来的地方。
收藏不是本事,用得上才是本事。
🔗
顯示更多
以往处理复杂 PDF 格式,多栏混排、手写字、数学公式一转乱成一锅粥。GPT-4o 确实能看懂,但转 100 万页能直接吞掉你 6000 多美金,谁用谁肉疼。
知名 AI 机构 Allen AI 搞的 olmOCR,用开源 7B 视觉语言大模型(VLM)专门用来“洗 PDF”。管你是什么刁钻多栏、页眉页脚干扰、手写混排还是复杂公式,统统给你拉成极度干净的 Markdown,而且天然保持正确的阅读顺序!
排版魔术手:多栏报纸、论文混排自动识别逻辑顺序,绝不串行
公式手写全包:数学 LaTeX 公式、表格、甚至手写笔记全自动提取
噪音自动洗掉:重复的页眉、页脚、无用插图自动清空,只留干货
批量吞吐极快:原生支持 vLLM 加速与多卡集群,百万级文档直接跑批
这玩意搞 LLM 预训练数据清洗、大模型 RAG 知识库构建,简直就是开挂。
项目链接:
在线 Demo:
顯示更多
给大模型喂 PDF 文档,常见做法是先跑 OCR 再提文字,但实际上有一半多的 PDF 本来就是文字版,根本不需要 OCR。
Firecrawl 团队最近开源的 pdf-inspector,能自动判断 PDF 是文字版还是扫描版,文字版的直接提取并转成 Markdown。
最快 200 毫秒内提取完成,支持表格检测、多栏排版识别、标题层级还原,输出的 Markdown 结构干净。
GitHub:
提供 Python、Node.js、Rust 和浏览器端四套接口,浏览器里通过 WebAssembly 直接跑,不用后端服务。
做文档处理相关开发的朋友,拿来做 PDF 前置分类和提取挺合适的。
顯示更多
直接上传PDF给AI多烧3倍的Token
下面是解决方法