如果你经常需要处理各类文档,或者想把文档内容喂给 AI 做进一步分析
开源项目 Zerox OCR
它把 PDF、Word 等文档转成图片序列,让视觉模型“看图说话”,输出 Markdown
这样既提高了文字识别准确率,又保留了表格和图表格式
工作流程很直接:上传文档,转为图片,每张图交给视觉模型识别,汇总 Markdown
支持 PDF、DOCX、Excel、PPT 等几十种格式
你能接入 OpenAI、Azure、AWS Bedrock、Google Gemini 等多家模型服务商,还能自定义提示词和数据提取规则
内置的结构化数据提取功能,可以按你定义的 JSON Schema 直接从文档中抽取信息,不用再手动整理。
GitHub
顯示更多