註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 UnlimitedOCR
UnlimitedOCR 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 UnlimitedOCR 的搜尋結果
杨立昆都转发了! Unlimited-OCR 为什么这么火? 百度的 Unlimited-OCR 再次冲上 HuggingFace 趋势榜,目前全球第三,又一次排在 GLM-5.2 前面。 上个月它横扫 GitHub、HF 四榜第一,我以为这波热度就过去了,结果图灵奖得主一转发,又把它送回了前三。 GitHub star 破 1.65 万,HF 下载 224 万,还在涨。 传统 OCR 有个老毛病:把文档一页页切开处理,跨两页的表格直接断掉,阅读顺序也丢了。 Unlimited-OCR 用 R-SWA 机制,几十页文档当一个整体连续解析,解码时 KV Cache 恒定——文档再厚,显存占用不涨。 海外博主 Mario Nawfal 实测:100 页 PDF 一次解析完,40 页之后错误率还在 0.11 以下,其他 OCR 到这个长度已经干不动了。 3B 参数,自己电脑就能跑,关键免费。 如果你经常要处理几十上百页的 PDF——论文、合同、扫描件,以前要么手动切页,要么掏钱买 OCR SaaS,现在这两样都省了。 项目地址👇 HuggingFace: #无限OCR# #UnlimitedOCR# #百度# #文心大模型# #文心#
顯示更多
0
104
1.1K
216
轉發到社區
炸场了兄弟们🔥 HuggingFace 全球模型榜前排,直接被中国开源模型包了。 ✅ 月之暗面 Kimi K3:开源权重冲上全球模型趋势榜 ✅ 百度 Unlimited OCR:从 GitHub 到 HuggingFace 一路霸榜,发布一个多月热度还在往上冲 这俩现在基本可以叫:中国开源模型「双子星」。 更有意思的是,Unlimited OCR 不是单纯刷榜好看,它真打到行业痛点了:长文档 OCR。 过去解析书籍、论文、报告,都得一页页拆、再拼起来。页数一多,上下文丢、表格断、显存涨、速度慢,全是老毛病。 百度这次搞了个 R-SWA 机制,让模型像人读长文档一样:一直盯着原文,只留最近一段内容当工作记忆。结果就是几十页文档一次连续解析,KV Cache 还能保持恒定。 所以你会看到它被杨立昆转发,被海外 AI 博主刷屏,GitHub Star 冲到 1.97 万,HF 下载量 265 万。 另一边 Kimi K3 也很猛:2.8 万亿参数 MoE,原生多模态,百万 token 上下文。马斯克一句 "Impressive",Vercel CEO 说它网页工程评测综合第一。 ✅ 一个长上下文多模态,一个长文档解析 ✅ 一个冲模型能力,一个打真实场景 这波不是"国产替代"的老叙事了。 是中国 AI 开源,真的开始在全球开发者社区拿话语权了。 中国开源模型,已经不是追赶者了。
顯示更多
神了,杨立昆 @ylecun 居然转发了百度的项目?? 刚刷推的时候居然发现杨立昆的号里面居然有Unlimited-OCR?? 他转发了一条介绍 Unlimited-OCR 的帖子。 Unlimited-OCR这个项目我之前介绍过。 没想到发布一个月后,还能再次冲上 HuggingFace 全球模型趋势榜第三。 目前 GitHub Star 已经突破 16.5 k,HuggingFace 下载量达到 224 万。 Unlimited OCR 真正有意思的地方,是它试图解决 OCR 长文档解析最麻烦的问题。 传统 OCR 通常把 PDF 拆成一页页处理,再把结果拼起来。 遇到跨页表格、公式和复杂阅读顺序,很容易丢失上下文。 Unlimited OCR 的做法是把 DeepSeek-OCR 的全部解码器注意力,替换成一套叫 R-SWA 的机制。 模型始终可以查看全部原始图像,但对于自己已经生成的内容,只保留最近128个Token作为工作记忆。这样一来,KV Cache 不再随着输出不断膨胀,解析到后面也不会越来越慢。 按照论文数据,它可以在32K上下文内一次连续解析数十页文档,输入超过40页后,编辑距离依然低于0.11。 在6000个输出Token时,理论吞吐量比DeepSeek-OCR高35%。 并且一个中国团队开源的3B模型,发布一个月后仍在持续获得海外社区适配并重新冲回全球热榜,还能被杨立昆主动转发。 @Baidu_Inc 你们这次确实做出了一个全球开发者愿意自己传播的东西啊
顯示更多