杨立昆转发了,百度 Unlimited OCR 又回到 HuggingFace Models Trending 第二。
这个 3B 开源模型发布刚满一个月,GitHub 已有约 1.66 万 Star,HuggingFace 近月下载超过 223 万次。我翻了下 HuggingFace Trending 榜单,它竟然还排在 GLM-5.2 前面。
我去读了论文。开发者持续讨论它,核心原因是长 PDF 终于有机会不再逐页识别、最后硬拼成一份结果。
它的 R-SWA 会一直看着原文里的视觉信息,只保留最近 128 个输出 Token 作为“工作记忆”。像抄一本书:眼睛一直看着原文,脑子只记刚刚抄到哪儿。
官方给出的边界是:标准 32K 最大长度下,一次前向推理可连续解析数十页,解码阶段的 KV Cache 保持恒定。海外帖子里流传的“100 页”更猛,但那不是论文给出的通用承诺。
我的判断是,OCR 下一轮要卷的已经不止单页识别率,还包括整份文档能否连续读完,以及页数增加后成本会不会跟着失控。
项目地址:
#
无限OCR# #
UnlimitedOCR# #
百度# #
文心大模型# #
文心#