TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
AI少年
@aehyok
📖 全栈独立开发者|喜欢编程和爱折腾AI 🚀 AI实战|AI工具评测|AI教程 🧠我的个人武器库: 🛰 vx:aehyok ✉️ 我的公众号: 那个曾经的AI少年
Joined December 2014
433
Following
10.9K
Followers
AI少年
@aehyok
2026.09.04 08:06
万万没想到奥特曼昨夜放了大招,有一种王者归来的气势。原来我一直以为 OpenAI 的 Whisper 已经到了语音识别的天花板了。看来是我认知太浅薄了。 由于老婆就是川渝那边的,方言的味道绝对十足。如果走在街上,加上外界环境的嘈杂声,我之前用的 Whisper 测试过简直就是个瞎子,识别出来叽里呱啦的一大串乱七八糟的字符真的有点神奇。 这两天无意间看到了这个开源的模型,Hojo-ASR-Multi-V1,据说是语音识别领域的新星。 🔥 Hugging Face Open ASR Leaderboard 多语言榜全球第 7,开源多语言 ASR 第 1。 🎉五语种平均 WER 3.54%,模型权重开放、评测公开、结果可复现。 😄同时支持普通话、英语、粤语和四川话等多语言、多方言识别。 特意找来测试了一下,发现真的有意思。 更有意思的是 Hojo 的处理过程:声音 → Qwen3-Omni 音频编码器听懂声音 → Adapter 转换特征 → Qwen3-4B 生成文字。 通俗一点的讲就是:声音进来 → 音频编码器先“听懂”声音 → Adapter 把声音信息翻译成大模型能理解的格式 → Qwen3-4B 再把它变成文字。 而 Whisper:声音进来 → 转成频谱图 → Whisper 编码器提取声音信息 → Whisper 解码器直接生成文字 两者对比就是Whisper 的重点是 听声音 → 写文字,而 Hojo 则更偏向 听声音 → 理解声音 → 再根据理解生成文字。 所以最后我在本机做了一个测试结果还是非常不错的。 先解释一个百分比,CER = Character Error Rate,字符错误率,百分比越小越好。 然后可以看看我的视频 hojo 和 whisper的对比,做了三个例子,川渝话、广东话、普通话。 川渝话:hojo CER= 0%, whisper CER=42.9% 广东话:hojo CER=18.8%, whisper CER=43.8% 普通话:hojo CER=16.7%, whisper CER=25.0% 应该说 hojo这一套效果还是非常不错的。 最后附上他们的开源模型,有兴趣的可以本地部署玩玩看:
Show more
0
0
38
90
17
Forward to community
Most Popular Users
Tibo
@thsottiaux
771.5K Followers
Donald J. Trump
@realDonaldTrump
111.9M Followers
Serenity
@aleabitoreddit
1M Followers
Elon Musk
@elonmusk
241.7M Followers
Sam Altman
@sama
6.3M Followers
zerohedge
@zerohedge
3.4M Followers
Wall St Engine
@wallstengine
197.7K Followers
OpenAI
@OpenAI
5.4M Followers
New York Post
@nypost
4.2M Followers
Polymarket
@Polymarket
2M Followers
Kalshi
@Kalshi
472.2K Followers
Bitcoin Archive
@BitcoinArchive
1.8M Followers
SpaceXAI
@SpaceXAI
2.1M Followers
Anthropic
@AnthropicAI
1.8M Followers
First Squawk
@FirstSquawk
569.2K Followers