登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
参加 May 2026
279 フォロー中    412 ファン
TL;DR 音声LLMのエンコーダを18層から14層まで削っても精度がほぼ落ちない、XPengの圧縮手法「X-AuT」が公開されました。むしろ16層構成では精度が向上しています。 タイトル: X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation URL: ポイント ✂️ 音声エンコーダの層を18→16→14と段階的に削減する「プログレッシブプルーニング」を採用しています 🔍 個々の層の削減スコアだけでは最適なペアが分からず、層同士の相互作用まで評価しているのが面白い点です 🎓 0.6Bの学生モデルを1.7Bの大きな教師モデルで蒸留する「クロススケール蒸留」で自己蒸留より大きく精度を改善しています 📈 16層構成ではパラメータ10.35%削減しつつマクロ平均エラー率5.61%→5.27%に改善 📉 14層構成でもパラメータ20.70%削減で精度低下はわずか+0.14ptに抑えられています 🚗 車載チップ上でエンコーダ処理時間を21.4%、全体レイテンシを4.7%削減しています 🔓 コードとモデルはGitHub・Hugging Faceで公開済み(CC BY-NC 4.0) 層を削るだけでなく「どう賢く削って回復させるか」の設計がよく練られていると感じました。 #音声LLM# #モデル圧縮#
もっと見る