登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
参加 March 2025
678 フォロー中    10.8K ファン
🗂️ 兄弟们,又挖到一个能把家里一堆纸质文件管起来的开源系统 GitHub 上 2.3K stars 合同、发票、保单、说明书这些东西的通病是:需要的时候永远找不到。扫描件堆在一个文件夹里,名字是 `scan_0043.pdf`,你根本不记得哪一份是去年的房屋保险。 Docspell 就是干这件事的。文件可以从扫描仪、邮箱和其他来源汇进来,进来之后它会自己动:需要时先做 OCR 把图片里的字变成可搜索的文本,再用机器学习和自然语言处理去猜这份文件的通信方是谁、该打什么标签、日期是哪天。你确认一下就归好档了,之后靠全文搜索直接捞。 标签、通信方、预定义元数据和自定义元数据这套体系是完整的,邮件集成也做了。界面默认是适配手机的单页 Web 应用,另外还有安卓客户端和命令行客户端,全部功能都通过 REST API 暴露出来,想自己接别的流程也行。 后端 Scala 写的,用了 Cats、FS2、Doobie、Http4s 这套函数式栈,前端是 Elm 配 Tailwind,文件处理依赖 Tesseract、unoconv 和 OCRmyPDF。机器学习那部分用的是 Stanford CoreNLP,注意它是 GPL 协议。 存下来只是第一步,能搜到才叫归档。 GitHub:
もっと見る