🗂️ 兄弟们,又挖到一个能把家里一堆纸质文件管起来的开源系统
GitHub 上 2.3K stars
合同、发票、保单、说明书这些东西的通病是:需要的时候永远找不到。扫描件堆在一个文件夹里,名字是 `scan_0043.pdf`,你根本不记得哪一份是去年的房屋保险。
Docspell 就是干这件事的。文件可以从扫描仪、邮箱和其他来源汇进来,进来之后它会自己动:需要时先做 OCR 把图片里的字变成可搜索的文本,再用机器学习和自然语言处理去猜这份文件的通信方是谁、该打什么标签、日期是哪天。你确认一下就归好档了,之后靠全文搜索直接捞。
标签、通信方、预定义元数据和自定义元数据这套体系是完整的,邮件集成也做了。界面默认是适配手机的单页 Web 应用,另外还有安卓客户端和命令行客户端,全部功能都通过 REST API 暴露出来,想自己接别的流程也行。
后端 Scala 写的,用了 Cats、FS2、Doobie、Http4s 这套函数式栈,前端是 Elm 配 Tailwind,文件处理依赖 Tesseract、unoconv 和 OCRmyPDF。机器学习那部分用的是 Stanford CoreNLP,注意它是 GPL 协议。
存下来只是第一步,能搜到才叫归档。
GitHub:
顯示更多