TL;DR 音声LLMのエンコーダを18層から14層まで削っても精度がほぼ落ちない、XPengの圧縮手法「X-AuT」が公開されました。むしろ16層構成では精度が向上しています。
タイトル: X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation
URL:
ポイント
✂️ 音声エンコーダの層を18→16→14と段階的に削減する「プログレッシブプルーニング」を採用しています
🔍 個々の層の削減スコアだけでは最適なペアが分からず、層同士の相互作用まで評価しているのが面白い点です
🎓 0.6Bの学生モデルを1.7Bの大きな教師モデルで蒸留する「クロススケール蒸留」で自己蒸留より大きく精度を改善しています
📈 16層構成ではパラメータ10.35%削減しつつマクロ平均エラー率5.61%→5.27%に改善
📉 14層構成でもパラメータ20.70%削減で精度低下はわずか+0.14ptに抑えられています
🚗 車載チップ上でエンコーダ処理時間を21.4%、全体レイテンシを4.7%削減しています
🔓 コードとモデルはGitHub・Hugging Faceで公開済み(CC BY-NC 4.0)
層を削るだけでなく「どう賢く削って回復させるか」の設計がよく練られていると感じました。
#
音声LLM# #
モデル圧縮#