Register and share your invite link to earn from video plays and referrals.

凡人小北
@frxiaobei
个人 观点|商业与管理|AI 实战派
Joined September 2024
710 Following    26K Followers
我把刚开源的 PP-OCRv6 考了一遍,34.5M 居然跑赢了 235B。 这两年大模型越做越大,好像连读张图上的字,都得丢给一个几百 B 的多模态大模型。可我一直有个疑问,OCR 这件最朴素的事,未来真得越做越大吗。 百度上周开源的 PP-OCRv6 给了个反过来的答案。它一次出了三档,按官方定位,Tiny 只有 1.5M,给浏览器和端侧用;Small 7.7M,对手机和桌面;Medium 34.5M,对服务器,也是三档里最准的一档。三档都认五十种语言,tiny 是四十九种。我挑了最准的 Medium,装进自己 Mac,纯 CPU 跑了一遍。 先说结论,这么小的模型,日常这些图读得又准又稳。 一张洇着红污渍的旧登机牌,航班、姓名、长票号一字不差;手机截图里的状态栏、搜索框、一长串地名也都挑了出来;印刷的课本表格更不在话下,规整的手写它也能认对。真正难倒它的,只有那种连我肉眼都认不全的连笔草书。毕竟它是老老实实读字的,不替你瞎猜。
Show more