注册并分享邀请链接,可获得视频播放与邀请奖励。

Ren
@Ryrenz
加入 March 2025
0 正在关注    0 粉丝
📕 扫描版的老书,能整本转成 Markdown 或 EPUB GitHub 上 6.2K stars 手上有一堆扫描版的旧书和资料,问题是它们本质上是一叠图片:搜不了、复制不了、在手机上看要不停放大挪位置。想转成电子书,普通 OCR 一碰到表格就散、遇到公式就废,转出来还得手工修半天。 PDF Craft 专门冲着扫描书籍去的。它基于 DeepSeek OCR 做识别,表格和公式都在处理范围内。转 Markdown 或 EPUB 时,封面、脚注、目录识别、表格渲染和公式渲染都能配置。EPUB 这边给的选项很细:表格可以用 HTML 也可以直接裁原图,公式可以走 MathML、SVG 或者原图裁剪,识别不准的时候至少还能保留原样。 OCR 有本地和云端两条路,本地跑需要支持 CUDA 的 PyTorch 环境,模型从 Hugging Face 下载,支持自定义缓存目录和离线加载;不想折腾环境就接兼容 OpenAI 接口的云端服务。PDF 解析和渲染默认依赖 Poppler 和 pdf2image。 版本上有个变化要注意:v1.0.0 起移除了 LLM 文本纠错,改用 DeepSeek OCR,还想要旧版纠错功能的话用 v0.2.8。MIT 协议。 书数字化了才算真正属于你。 GitHub:
显示更多