TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
AI少年
@aehyok
📖 全栈独立开发者|喜欢编程和爱折腾AI 🚀 AI实战|AI工具评测|AI教程 🧠我的个人武器库: 🛰 vx:aehyok ✉️ 我的公众号: 那个曾经的AI少年
参加 December 2014
433
フォロー中
10.9K
ファン
AI少年
@aehyok
2026.09.04 08:06
万万没想到奥特曼昨夜放了大招,有一种王者归来的气势。原来我一直以为 OpenAI 的 Whisper 已经到了语音识别的天花板了。看来是我认知太浅薄了。 由于老婆就是川渝那边的,方言的味道绝对十足。如果走在街上,加上外界环境的嘈杂声,我之前用的 Whisper 测试过简直就是个瞎子,识别出来叽里呱啦的一大串乱七八糟的字符真的有点神奇。 这两天无意间看到了这个开源的模型,Hojo-ASR-Multi-V1,据说是语音识别领域的新星。 🔥 Hugging Face Open ASR Leaderboard 多语言榜全球第 7,开源多语言 ASR 第 1。 🎉五语种平均 WER 3.54%,模型权重开放、评测公开、结果可复现。 😄同时支持普通话、英语、粤语和四川话等多语言、多方言识别。 特意找来测试了一下,发现真的有意思。 更有意思的是 Hojo 的处理过程:声音 → Qwen3-Omni 音频编码器听懂声音 → Adapter 转换特征 → Qwen3-4B 生成文字。 通俗一点的讲就是:声音进来 → 音频编码器先“听懂”声音 → Adapter 把声音信息翻译成大模型能理解的格式 → Qwen3-4B 再把它变成文字。 而 Whisper:声音进来 → 转成频谱图 → Whisper 编码器提取声音信息 → Whisper 解码器直接生成文字 两者对比就是Whisper 的重点是 听声音 → 写文字,而 Hojo 则更偏向 听声音 → 理解声音 → 再根据理解生成文字。 所以最后我在本机做了一个测试结果还是非常不错的。 先解释一个百分比,CER = Character Error Rate,字符错误率,百分比越小越好。 然后可以看看我的视频 hojo 和 whisper的对比,做了三个例子,川渝话、广东话、普通话。 川渝话:hojo CER= 0%, whisper CER=42.9% 广东话:hojo CER=18.8%, whisper CER=43.8% 普通话:hojo CER=16.7%, whisper CER=25.0% 应该说 hojo这一套效果还是非常不错的。 最后附上他们的开源模型,有兴趣的可以本地部署玩玩看:
もっと見る
0
0
38
90
17
コミュニティへ転送
人気のあるユーザー
GIGA特撮ヒロイン【公式】
@giga_web
63K ファン
New York Post
@nypost
4.2M ファン
オリコンニュース
@oricon
1.9M ファン
TVer新着
@TVer_info
100.9K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K ファン
Reuters
@Reuters
26.4M ファン
First Squawk
@FirstSquawk
569.1K ファン
Bloomberg
@business
10.5M ファン
billboard
@billboard
16.8M ファン
ファミ通.com
@famitsu
1.4M ファン
モデルプレス
@modelpress
2.1M ファン
吴说区块链
@wublockchain12
181.5K ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.2K ファン
一劍浣春秋
@chee828
0 ファン
MANTANWEB/毎日キレイ
@mantanweb
68.9K ファン