TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
阿川 | AI thinking
@AI_jacksaku
前大厂多面手|AI 专业搞钱玩家| 关注 AI 产品&工具、LLM迭代,搞钱信息差 欢迎链接&咨询&合作
Joined August 2022
948
Following
26.7K
Followers
阿川 | AI thinking
@AI_jacksaku
2026.07.18 16:38
OCR这个方向上,推荐大家了解下这个开源项目,确实是用下来相对能打的
阿川 | AI thinking
@AI_jacksaku
2026.07.17 10:50
多数人觉得 OCR 卷到头了,无非拍照转文字。但腾讯混元刚开源的 HyOCR-1.5 跳出了这套路子——1B 参数纯视觉端到端模型,在 OmniDocBench v1.6 上以 94.74 分拿下端到端第一,推理速度还提了 6.37 倍。 传统 OCR 流水线要拼接检测、识别、版面分析多个模型,慢且重。HyOCR-1.5 一个模型端到端输出,还用了 DFlash 投机解码:并行猜测多条解码路径,快速筛最优结果,让推理大幅加速。在 Transformers 上快 6.37 倍,vLLM 快 2.14 倍,最后单页文档端到端推理只要 1.408 秒。原先处理百页要几分钟,现在半分钟搞定,成本跟着跳水。 更关键的是全栈开源。模型权重、训练代码、推理流程全部开放,没有 API 调用费,数据不离开本地。对天天要处理合同、发票、古籍的团队来说,这种又快又省还不泄露数据的方案,每月可能省出一个人力成本。 它的适用面也没局限在中英文。通过 Agentic Data Flow,HyOCR-1.5 扩展到了 331 种语言、古文字识别,还能做多图问答。128K 上下文窗口加上 4K 分辨率,长图、竖排文档都能直接处理,不用切块、不用额外对齐。 当然,开源不等于「无脑能用」。虽然 1B 参数消费级显卡就跑得动,但装环境、跑 Demo 还是需要一点技术底子。社区已经有热心人封装一键包,不过暂时不够傻瓜化;追求「上传即得结果」的朋友,可以蹲一下腾讯混元后续的云服务。 但我觉得,这款模型最大的价值不是技术指标——而是它把「高质量、低成本、全栈可控」这三件事同时装进了一个能跑在任何机器上的 1B 小模型中,让普通团队也能用上以前大厂才烧得起的 OCR 能力。开源给了杠杆,试错的门槛已经很低。 怎么踩上这个杠杆?👉 普通用户:关注腾讯混元公众号,先看技术细节,把云服务上线消息存下来。开发者:去 GitHub 搜 JevenYu/HyOCR,拉模型跑 Demo,立刻替换掉项目里那条慢速 OCR 管道。产品经理/创业者:拿几张你最痛苦的文档测一测速度、精度和成本,说不定下一个垂直文档处理工具的原型就出来了。
Show more
0
0
12
7
0
Forward to community
Most Popular Users
New York Post
@nypost
4.1M Followers
Serenity
@aleabitoreddit
1M Followers
billboard
@billboard
16.5M Followers
オリコンニュース
@oricon
1.9M Followers
Reuters
@Reuters
26.3M Followers
BTS_official
@bts_bighit
45.3M Followers
First Squawk
@FirstSquawk
556.5K Followers
Hello! Project Link
@UpFrontLink
15.5K Followers
一劍浣春秋
@chee828
0 Followers
BLACKPINKOFFICIAL
@BLACKPINK
11.6M Followers
Pirat_Nation 🔴
@Pirat_Nation
341.9K Followers
i-dle (아이들)
@official_i_dle
2.4M Followers
ENHYPEN OFFICIAL
@ENHYPEN
8.4M Followers
ATEEZ(에이티즈)
@ATEEZofficial
4.8M Followers
INI
@official__INI
510.1K Followers