以往处理复杂 PDF 格式,多栏混排、手写字、数学公式一转乱成一锅粥。GPT-4o 确实能看懂,但转 100 万页能直接吞掉你 6000 多美金,谁用谁肉疼。
知名 AI 机构 Allen AI 搞的 olmOCR,用开源 7B 视觉语言大模型(VLM)专门用来“洗 PDF”。管你是什么刁钻多栏、页眉页脚干扰、手写混排还是复杂公式,统统给你拉成极度干净的 Markdown,而且天然保持正确的阅读顺序!
排版魔术手:多栏报纸、论文混排自动识别逻辑顺序,绝不串行
公式手写全包:数学 LaTeX 公式、表格、甚至手写笔记全自动提取
噪音自动洗掉:重复的页眉、页脚、无用插图自动清空,只留干货
批量吞吐极快:原生支持 vLLM 加速与多卡集群,百万级文档直接跑批
这玩意搞 LLM 预训练数据清洗、大模型 RAG 知识库构建,简直就是开挂。
项目链接:
在线 Demo:
顯示更多