註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 OCR
OCR 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 OCR 的搜尋結果
Mistral OCR 4 说盲测 72% 超竞品,百度 DSC 用 AI 识别 800+ 数据类型。一个在读文档,一个在识别数据。这个对企业是真刚需。我们这种被 PDF、Word、历史资料、合规字段埋过的人最懂,AI 不怕不会做md总结,最怕材料还没吃进去就先噎死。老旧文档入口一旦打通,很多办公室体力活就开始进入倒计时。
顯示更多
多数人觉得 OCR 卷到头了,无非拍照转文字。但腾讯混元刚开源的 HyOCR-1.5 跳出了这套路子——1B 参数纯视觉端到端模型,在 OmniDocBench v1.6 上以 94.74 分拿下端到端第一,推理速度还提了 6.37 倍。 传统 OCR 流水线要拼接检测、识别、版面分析多个模型,慢且重。HyOCR-1.5 一个模型端到端输出,还用了 DFlash 投机解码:并行猜测多条解码路径,快速筛最优结果,让推理大幅加速。在 Transformers 上快 6.37 倍,vLLM 快 2.14 倍,最后单页文档端到端推理只要 1.408 秒。原先处理百页要几分钟,现在半分钟搞定,成本跟着跳水。 更关键的是全栈开源。模型权重、训练代码、推理流程全部开放,没有 API 调用费,数据不离开本地。对天天要处理合同、发票、古籍的团队来说,这种又快又省还不泄露数据的方案,每月可能省出一个人力成本。 它的适用面也没局限在中英文。通过 Agentic Data Flow,HyOCR-1.5 扩展到了 331 种语言、古文字识别,还能做多图问答。128K 上下文窗口加上 4K 分辨率,长图、竖排文档都能直接处理,不用切块、不用额外对齐。 当然,开源不等于「无脑能用」。虽然 1B 参数消费级显卡就跑得动,但装环境、跑 Demo 还是需要一点技术底子。社区已经有热心人封装一键包,不过暂时不够傻瓜化;追求「上传即得结果」的朋友,可以蹲一下腾讯混元后续的云服务。 但我觉得,这款模型最大的价值不是技术指标——而是它把「高质量、低成本、全栈可控」这三件事同时装进了一个能跑在任何机器上的 1B 小模型中,让普通团队也能用上以前大厂才烧得起的 OCR 能力。开源给了杠杆,试错的门槛已经很低。 怎么踩上这个杠杆?👉 普通用户:关注腾讯混元公众号,先看技术细节,把云服务上线消息存下来。开发者:去 GitHub 搜 JevenYu/HyOCR,拉模型跑 Demo,立刻替换掉项目里那条慢速 OCR 管道。产品经理/创业者:拿几张你最痛苦的文档测一测速度、精度和成本,说不定下一个垂直文档处理工具的原型就出来了。
顯示更多
0
48
231
47
轉發到社區
可以跑在浏览器器的 OCR 模型: PP-OCRv6 它的 Tiny 版本只有 1.5M 参数, 专门面向浏览器和边缘设备场景做了优化, 可以基于 ONNX Runtime Web 在浏览器端直接运行, 用 Electron 做客户端的朋友,这个方向可以冲一波了
顯示更多
兄弟们,我一直有个判断:OCR 这种活,早晚会被多模态大模型给吃掉。 这周看到百度发的 PP-OCRv6,我改主意了。 一个 1.5MB 的模型,能直接塞进浏览器里跑,单图最快 97 毫秒就能出结果,逐字识别的准确率还反超了 GPT-5.5、Gemini-3.1-Pro 和 235B 参数的 Qwen3-VL,我有点震惊了! 对做产品的人来说,这比「又一个 SOTA」重要得多。我有测试,先往下看 👇
顯示更多
0
19
102
16
轉發到社區
给大模型喂 PDF 文档,常见做法是先跑 OCR 再提文字,但实际上有一半多的 PDF 本来就是文字版,根本不需要 OCR。 Firecrawl 团队最近开源的 pdf-inspector,能自动判断 PDF 是文字版还是扫描版,文字版的直接提取并转成 Markdown。 最快 200 毫秒内提取完成,支持表格检测、多栏排版识别、标题层级还原,输出的 Markdown 结构干净。 GitHub: 提供 Python、Node.js、Rust 和浏览器端四套接口,浏览器里通过 WebAssembly 直接跑,不用后端服务。 做文档处理相关开发的朋友,拿来做 PDF 前置分类和提取挺合适的。
顯示更多
0
20
75
20
轉發到社區
Paster:免费剪贴板增强工具,支持截图 OCR 与局域网共享 👉
杨立昆都转发了! Unlimited-OCR 为什么这么火? 百度的 Unlimited-OCR 再次冲上 HuggingFace 趋势榜,目前全球第三,又一次排在 GLM-5.2 前面。 上个月它横扫 GitHub、HF 四榜第一,我以为这波热度就过去了,结果图灵奖得主一转发,又把它送回了前三。 GitHub star 破 1.65 万,HF 下载 224 万,还在涨。 传统 OCR 有个老毛病:把文档一页页切开处理,跨两页的表格直接断掉,阅读顺序也丢了。 Unlimited-OCR 用 R-SWA 机制,几十页文档当一个整体连续解析,解码时 KV Cache 恒定——文档再厚,显存占用不涨。 海外博主 Mario Nawfal 实测:100 页 PDF 一次解析完,40 页之后错误率还在 0.11 以下,其他 OCR 到这个长度已经干不动了。 3B 参数,自己电脑就能跑,关键免费。 如果你经常要处理几十上百页的 PDF——论文、合同、扫描件,以前要么手动切页,要么掏钱买 OCR SaaS,现在这两样都省了。 项目地址👇 HuggingFace: #无限OCR# #UnlimitedOCR# #百度# #文心大模型# #文心#
顯示更多
0
104
1.1K
216
轉發到社區
如果你经常需要处理各类文档,或者想把文档内容喂给 AI 做进一步分析 开源项目 Zerox OCR 它把 PDF、Word 等文档转成图片序列,让视觉模型“看图说话”,输出 Markdown 这样既提高了文字识别准确率,又保留了表格和图表格式 工作流程很直接:上传文档,转为图片,每张图交给视觉模型识别,汇总 Markdown 支持 PDF、DOCX、Excel、PPT 等几十种格式 你能接入 OpenAI、Azure、AWS Bedrock、Google Gemini 等多家模型服务商,还能自定义提示词和数据提取规则 内置的结构化数据提取功能,可以按你定义的 JSON Schema 直接从文档中抽取信息,不用再手动整理。 GitHub
顯示更多