TL;DR: オンポリシー蒸留で教師モデルを超えようとする既存手法は出力空間でのノイズ増幅により不安定になりがちでしたが、RL前後の表現変化を「表現空間」で直接外挿する新手法RIDEが、4つのモデルペア全てで教師超えを達成しました。
タイトル: The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation
URL:
ポイント
🎯 教師を「目的地」ではなく「方向」として捉え、RL前後の隠れ状態の差分(残差)をさらに外挿したターゲットへ生徒を回帰させる
⚠️ 出力ヘッドは異方性ゆえに変化の大部分を減衰させる。弱い512方向が隠れ状態エネルギーの79.8%を占めるのに出力空間では30.0%しか残らない
📉 出力空間での外挿は分散が(λ-1)²で増幅し不安定化。RIDEの勾配分散はExOPD比12.6倍小さい
📊 4モデルペア全てで教師超え:R1-Distill-1.5Bで56.38、Qwen3-4Bで66.07など、OPRD比+0.97〜4.06ポイント改善
❌ 出力空間での外挿手法ExOPDは4ペア全てで教師にもOPRDにも劣る結果に
🔬 ランダム方向や逆方向への外挿では性能が伸びず、RL誘発方向そのものが効いていることをアブレーションで確認
「教師を超える」という目標に対し、どこで差分を測るかという設計一つで結果がここまで変わるのは興味深いです。
#
蒸留# #
強化学習#