註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 扫描件
扫描件 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 扫描件 的搜尋結果
🔍 扫描件里的文字和表格,它能连结构一起扒出来 俄罗斯科学院系统编程研究所出品,有两篇学术论文支撑 处理一堆合同、报告、发票的时候,光把文字 OCR 出来不够用。你要的是"这份文件有哪几个章节、哪一段属于哪个标题下、这张表第三行第二列是什么",普通 OCR 给你一大坨纯文本,结构全丢了,后面还得人来重排。 Dedoc 的定位是文档解析,不只是识别。它输出文本、表格、格式、元数据和逻辑结构,标题和列表用树形结构表示,父子关系是保留的。格式吃得很杂:DOC、DOCX、ODT、XLS、XLSX、CSV、TXT、JSON、HTML、PDF、图像和压缩包都行,带文本层的 PDF、扫描图像和没有文本层的 PDF 都能处理,扫描件走 Tesseract OCR 配合机器学习和图像处理,方向歪了能自动校正。 接入方式给了三种:REST API、Docker 镜像和 Python 包,做成流水线里的一环很方便。 边界也说明了:扫描表格只能识别有明确边界的那种,扫描文档处理范围限于黑白文档。项目来自俄罗斯科学院系统编程研究所,2022 年拿过俄罗斯创新援助基金会的 AI 项目资助,2023 和 2024 年各发了一篇论文。Apache 2.0 协议。 识别出字只是开始,还原出结构才有用。 GitHub:
顯示更多
将 PDF 转成文本,遇到扫描件、多栏排版、复杂表格和公式,传统 OCR 经常识别错乱。 olmOCR,一款基于视觉语言模型的 PDF 转 Markdown 工具,已斩获了 17900+ Star! 能处理公式、表格、手写体和复杂版式,还会自动去掉页眉页脚。 并且按自然阅读顺序输出,哪怕多栏排版也不会读串行。 GitHub: 单 GPU 本地跑之外也支持接入远程推理服务,处理成本能压到每百万页不到 200 美元。 需要批量处理 PDF、扫描件转成可编辑文本的朋友,尤其是做数据处理或者知识库搭建的,这个工具可以试试。
顯示更多
0
19
79
14
轉發到社區
有黑客在暗网Nexus出售美加两国身份证件扫描件,包括1.53亿份驾照、超1000万张普通身份证、300万张旅行/国际证件、57.9万张医疗卡,甚至还包含大麻药房卡、商业驾照、政府通用访问卡(CAC)等,连美国国防部长赫格塞斯的驾照也在其中。 Nexus背后的团队声称,这些扫描图像来自“一家大型身份验证公司”。 消息来源的博主KrebsOnSecurity通过分析数发现,许多记录都指向曾使用过Hertz租车服务,而Nexus记录上的时间戳通常与这些租车发生的日期相吻合。
顯示更多
据 KrebsOnSecurity,暗网身份盗窃服务 Nexus 被发现出售逾 1.53 亿份美国和加拿大驾照扫描件,另包括逾 1000 万份身份证件、300 万份旅行或国际证件及约 57.9 万份医疗卡。部分数据甚至涉及美国国防部长 Pete Hegseth 的驾照等相关记录。KrebsOnSecurity 认为,相关数据可能来自总部位于新奥尔良的身份验证服务商 IDScan net;FBI 新奥尔良办公室已就该公司疑似数据泄露启动正式调查。IDScan net 表示正在调查,但尚未公布实质性结论。
顯示更多
PDF、Word、扫描件、截图,文件格式五花八门,想丢给 AI 还得先手动整理一遍。 doc7 把这些东西统一转成 Markdown,AI 可以直接检索、引用和推理。 有意思的是,它把每一页渲染成图片,再交给能看图的 AI 模型去理解,不用单独的文字识别工具。 GitHub: 模型用自己本地部署的就行,没有按页收费,跑多少文档看机器性能。 PDF、Office、邮件、电子书、Jupyter 笔记本、网页截图都能处理,格式覆盖得很全。 经常要把各种文档喂给 AI 的朋友可以试试。
顯示更多
0
26
65
19
轉發到社區
把 PDF、Office 文件、扫描件、截图、图表、公式和流程图转成 AI 可检索、可引用、可推理的 Markdown 模型用你自己配的 OpenAI 兼容端点(本地或私有部署均可),不用单独搭 OCR、版面、表格、公式一整套模型栈。
顯示更多
0
11
38
3
轉發到社區
每次遇到那种死板的审核系统或甲方,明明有高清电子版文档,对方却非要你提交“纸质扫描件”证明真实性?为了这个还要苦哈哈地专门跑去找打印机,打出来再用手机扫描,甚至还要刻意拍得歪一点来假装真实? 推荐一款专治各种死板流程、能把普通电子 PDF 一键“做旧”伪装成真实扫描件的在线核武:Make Look Scanned!不用你碰一下打印机,纯靠魔法打败魔法。 彻底物理超度排队打印和手动扫描的痛苦,把办证、走流程的效率直接拉满。想要随时随地白嫖“扫描件”的老哥们,赶紧去把它狠狠焊死在你的浏览器收藏夹里👇 🔗 AppMiao 推荐 / 极速“做旧”直达: #MakeLookScanned# #网站# #PDF# #扫描件# #PDF处理# #效率工具# #黑科技# #打工人必备#
顯示更多
#全民开盒# 美国身份验证服务商 #IDScan# 出现超大规模数据泄露,黑客成功拿到高达 1.53 亿份驾照 / 护照 / 身份证件 / 医疗卡扫描件。 已经有网络安全从业者进行验证,通过对家人和朋友信息进行验证后基本确认数据是真实的。 黑客自称花费数年才从目标系统里拿到数据,按照 500KB 计算,数据总规模也超过 70TB。 查看全文:
顯示更多
0
25
116
9
轉發到社區
法国青年马库斯、白士杰与中国青年钟灏松向中国人民抗日战争胜利受降纪念馆捐赠了一批法国官方解密抗战档案扫描件,记录了日军侵略罪证和湖南人民在反法西斯战争中做出的英勇抗争和贡献。
顯示更多
PDF 直接丢给大模型,表格乱码、公式崩溃、扫描件还认不出字。 这 5 个工具帮你把文档转成 AI 能读的干净格式。 1、Stirling-PDF — 本地 PDF 全能工具箱,85k star 合并、拆分、压缩、加水印、转格式,几十种操作全在本地跑,文件不出本机,隐私敏感的文档放心用。 2、MinerU — 复杂文档转 Markdown,71.7k star PDF、Office 里的表格、公式、图片精准抠出来转成 AI 可读的 Markdown,喂给大模型做问答前必备的一步。 3、docling — 文档为生成式 AI 做准备,62.3k star IBM 出品,把各种格式文档统一转成结构化输出,接 RAG 流程很顺,企业文档处理的热门选择。 4、marker — PDF 高精度转 Markdown,36.6k star 速度快、还原准,长文档、论文转 Markdown 加 JSON,排版和结构保留得好。 5、OCRmyPDF — 给扫描件加文字层,34k star 扫描的 PDF 没法选字搜字,它自动 OCR 加上文字层,扫描件秒变可搜索可复制。
顯示更多