TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
参加 March 2025
678
フォロー中
10.8K
ファン
Ren
@Ryrenz
2026.08.21 01:02
🗂️ 兄弟们,又挖到一个能把家里一堆纸质文件管起来的开源系统 GitHub 上 2.3K stars 合同、发票、保单、说明书这些东西的通病是:需要的时候永远找不到。扫描件堆在一个文件夹里,名字是 `scan_0043.pdf`,你根本不记得哪一份是去年的房屋保险。 Docspell 就是干这件事的。文件可以从扫描仪、邮箱和其他来源汇进来,进来之后它会自己动:需要时先做 OCR 把图片里的字变成可搜索的文本,再用机器学习和自然语言处理去猜这份文件的通信方是谁、该打什么标签、日期是哪天。你确认一下就归好档了,之后靠全文搜索直接捞。 标签、通信方、预定义元数据和自定义元数据这套体系是完整的,邮件集成也做了。界面默认是适配手机的单页 Web 应用,另外还有安卓客户端和命令行客户端,全部功能都通过 REST API 暴露出来,想自己接别的流程也行。 后端 Scala 写的,用了 Cats、FS2、Doobie、Http4s 这套函数式栈,前端是 Elm 配 Tailwind,文件处理依赖 Tesseract、unoconv 和 OCRmyPDF。机器学习那部分用的是 Stanford CoreNLP,注意它是 GPL 协议。 存下来只是第一步,能搜到才叫归档。 GitHub:
もっと見る
0
0
2
43
14
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K ファン
TVer新着
@TVer_info
101K ファン
New York Post
@nypost
4.2M ファン
吴说区块链
@wublockchain12
181.5K ファン
Reuters
@Reuters
26.4M ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.3K ファン
ファミ通.com
@famitsu
1.4M ファン
モデルプレス
@modelpress
2.1M ファン
First Squawk
@FirstSquawk
569.5K ファン
Bloomberg
@business
10.5M ファン
billboard
@billboard
16.8M ファン
MANTANWEB/毎日キレイ
@mantanweb
68.9K ファン
一劍浣春秋
@chee828
0 ファン
空空道人
@Kongkongda5882
34.3K ファン