万万没想到奥特曼昨夜放了大招,有一种王者归来的气势。原来我一直以为 OpenAI 的 Whisper 已经到了语音识别的天花板了。看来是我认知太浅薄了。
由于老婆就是川渝那边的,方言的味道绝对十足。如果走在街上,加上外界环境的嘈杂声,我之前用的 Whisper 测试过简直就是个瞎子,识别出来叽里呱啦的一大串乱七八糟的字符真的有点神奇。
这两天无意间看到了这个开源的模型,Hojo-ASR-Multi-V1,据说是语音识别领域的新星。
🔥 Hugging Face Open ASR Leaderboard 多语言榜全球第 7,开源多语言 ASR 第 1。
🎉五语种平均 WER 3.54%,模型权重开放、评测公开、结果可复现。
😄同时支持普通话、英语、粤语和四川话等多语言、多方言识别。
特意找来测试了一下,发现真的有意思。
更有意思的是 Hojo 的处理过程:声音 → Qwen3-Omni 音频编码器听懂声音 → Adapter 转换特征 → Qwen3-4B 生成文字。
通俗一点的讲就是:声音进来 → 音频编码器先“听懂”声音 → Adapter 把声音信息翻译成大模型能理解的格式 → Qwen3-4B 再把它变成文字。
而 Whisper:声音进来 → 转成频谱图 → Whisper 编码器提取声音信息 → Whisper 解码器直接生成文字
两者对比就是Whisper 的重点是 听声音 → 写文字,而 Hojo 则更偏向 听声音 → 理解声音 → 再根据理解生成文字。
所以最后我在本机做了一个测试结果还是非常不错的。
先解释一个百分比,CER = Character Error Rate,字符错误率,百分比越小越好。
然后可以看看我的视频 hojo 和 whisper的对比,做了三个例子,川渝话、广东话、普通话。
川渝话:hojo CER= 0%, whisper CER=42.9%
广东话:hojo CER=18.8%, whisper CER=43.8%
普通话:hojo CER=16.7%, whisper CER=25.0%
应该说 hojo这一套效果还是非常不错的。
最后附上他们的开源模型,有兴趣的可以本地部署玩玩看:
顯示更多