TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
参加 March 2025
678
フォロー中
10.8K
ファン
Ren
@Ryrenz
2026.08.24 14:40
🔍 扫描件里的文字和表格,它能连结构一起扒出来 俄罗斯科学院系统编程研究所出品,有两篇学术论文支撑 处理一堆合同、报告、发票的时候,光把文字 OCR 出来不够用。你要的是"这份文件有哪几个章节、哪一段属于哪个标题下、这张表第三行第二列是什么",普通 OCR 给你一大坨纯文本,结构全丢了,后面还得人来重排。 Dedoc 的定位是文档解析,不只是识别。它输出文本、表格、格式、元数据和逻辑结构,标题和列表用树形结构表示,父子关系是保留的。格式吃得很杂:DOC、DOCX、ODT、XLS、XLSX、CSV、TXT、JSON、HTML、PDF、图像和压缩包都行,带文本层的 PDF、扫描图像和没有文本层的 PDF 都能处理,扫描件走 Tesseract OCR 配合机器学习和图像处理,方向歪了能自动校正。 接入方式给了三种:REST API、Docker 镜像和 Python 包,做成流水线里的一环很方便。 边界也说明了:扫描表格只能识别有明确边界的那种,扫描文档处理范围限于黑白文档。项目来自俄罗斯科学院系统编程研究所,2022 年拿过俄罗斯创新援助基金会的 AI 项目资助,2023 和 2024 年各发了一篇论文。Apache 2.0 协议。 识别出字只是开始,还原出结构才有用。 GitHub:
もっと見る
0
0
0
2
1
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K ファン
TVer新着
@TVer_info
101K ファン
New York Post
@nypost
4.2M ファン
吴说区块链
@wublockchain12
181.5K ファン
Reuters
@Reuters
26.4M ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.3K ファン
ファミ通.com
@famitsu
1.4M ファン
モデルプレス
@modelpress
2.1M ファン
First Squawk
@FirstSquawk
569.6K ファン
Bloomberg
@business
10.5M ファン
billboard
@billboard
16.8M ファン
MANTANWEB/毎日キレイ
@mantanweb
68.9K ファン
空空道人
@Kongkongda5882
34.3K ファン
一劍浣春秋
@chee828
0 ファン