再帰構造のTransformerが生成する「途中経過」、実はそのまま捨てられていました。これをデコード時にただで活用する手法が登場です。
タイトル: Decoding Looped Transformers Better for (Almost) Free
URL:
📝 概要
共有ブロックを繰り返し実行することでパラメータ効率を高める「ループ型Transformer」向けに、学習フリーのコントラスティブ・デコーディング手法LoopCDを提案。補助モデルも再学習も不要です。
❗ 解決する課題
既存のデコード手法は、ループの途中段階の隠れ状態を捨てて最終予測だけを使っていました。反復を通じて自然に生まれる「弱い予測→強い予測」という整合したペアの情報が無駄になっていたのです。
🛠️ 方法論・提案手法
出力層の後でコントラストを取るLoopCD-Logits(出力パスを1回追加)と、coda層の前でコントラストを取り追加コストがほぼゼロのLoopCD-Hiddenの2種類を用意。初回ループと最終ループの差分を誘導強度ωで拡張し、モデルが不確実な場面ほど強く誘導する適応的な設定も可能です。
📊 実験結果
Ouro-2.6B-ThinkingのAIME 2024でpass
@1が61.88%→73.33%に向上。HuginnのHumanEvalも22.56%→31.71%に改善しました。反復回数を半分にしてLoopCDを使っても元の精度を維持・上回り、フォワードFLOPsを22.5〜48.2%削減できています。
🏢 ユースケース
Ouro・Huginn・Parcaeなど既存のループ型Transformerへそのまま適用でき、追加学習なしで推論コストを抑えながら推論性能を底上げできます。
#
Transformer# #
デコーディング#