가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
가입 March 2025
678 팔로잉 중    10.8K 팬
📕 扫描版的老书,能整本转成 Markdown 或 EPUB GitHub 上 6.2K stars 手上有一堆扫描版的旧书和资料,问题是它们本质上是一叠图片:搜不了、复制不了、在手机上看要不停放大挪位置。想转成电子书,普通 OCR 一碰到表格就散、遇到公式就废,转出来还得手工修半天。 PDF Craft 专门冲着扫描书籍去的。它基于 DeepSeek OCR 做识别,表格和公式都在处理范围内。转 Markdown 或 EPUB 时,封面、脚注、目录识别、表格渲染和公式渲染都能配置。EPUB 这边给的选项很细:表格可以用 HTML 也可以直接裁原图,公式可以走 MathML、SVG 或者原图裁剪,识别不准的时候至少还能保留原样。 OCR 有本地和云端两条路,本地跑需要支持 CUDA 的 PyTorch 环境,模型从 Hugging Face 下载,支持自定义缓存目录和离线加载;不想折腾环境就接兼容 OpenAI 接口的云端服务。PDF 解析和渲染默认依赖 Poppler 和 pdf2image。 版本上有个变化要注意:v1.0.0 起移除了 LLM 文本纠错,改用 DeepSeek OCR,还想要旧版纠错功能的话用 v0.2.8。MIT 协议。 书数字化了才算真正属于你。 GitHub:
더 보기