가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

AI少年
@aehyok
📖 全栈独立开发者|喜欢编程和爱折腾AI   🚀 AI实战|AI工具评测|AI教程 🧠我的个人武器库: 🛰 vx:aehyok ✉️ 我的公众号: 那个曾经的AI少年
가입 December 2014
433 팔로잉 중    10.9K 팬
万万没想到奥特曼昨夜放了大招,有一种王者归来的气势。原来我一直以为 OpenAI 的 Whisper 已经到了语音识别的天花板了。看来是我认知太浅薄了。 由于老婆就是川渝那边的,方言的味道绝对十足。如果走在街上,加上外界环境的嘈杂声,我之前用的 Whisper 测试过简直就是个瞎子,识别出来叽里呱啦的一大串乱七八糟的字符真的有点神奇。 这两天无意间看到了这个开源的模型,Hojo-ASR-Multi-V1,据说是语音识别领域的新星。 🔥 Hugging Face Open ASR Leaderboard 多语言榜全球第 7,开源多语言 ASR 第 1。 🎉五语种平均 WER 3.54%,模型权重开放、评测公开、结果可复现。 😄同时支持普通话、英语、粤语和四川话等多语言、多方言识别。 特意找来测试了一下,发现真的有意思。 更有意思的是 Hojo 的处理过程:声音 → Qwen3-Omni 音频编码器听懂声音 → Adapter 转换特征 → Qwen3-4B 生成文字。 通俗一点的讲就是:声音进来 → 音频编码器先“听懂”声音 → Adapter 把声音信息翻译成大模型能理解的格式 → Qwen3-4B 再把它变成文字。 而 Whisper:声音进来 → 转成频谱图 → Whisper 编码器提取声音信息 → Whisper 解码器直接生成文字 两者对比就是Whisper 的重点是 听声音 → 写文字,而 Hojo 则更偏向 听声音 → 理解声音 → 再根据理解生成文字。 所以最后我在本机做了一个测试结果还是非常不错的。 先解释一个百分比,CER = Character Error Rate,字符错误率,百分比越小越好。 然后可以看看我的视频 hojo 和 whisper的对比,做了三个例子,川渝话、广东话、普通话。 川渝话:hojo CER= 0%, whisper CER=42.9% 广东话:hojo CER=18.8%, whisper CER=43.8% 普通话:hojo CER=16.7%, whisper CER=25.0% 应该说 hojo这一套效果还是非常不错的。 最后附上他们的开源模型,有兴趣的可以本地部署玩玩看:
더 보기