モデルを切り替えるたびに会話の文脈を再計算し直すの、実はもったいないかもしれません。
タイトル: Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse
URL:
❓ そもそも何をする研究?
💡 NVIDIAの研究チームが、あるサイズのLLMが計算したKVキャッシュを、別サイズの同系統モデルにそのまま「翻訳」して使い回す手法を提案しました。学習不要、閉形式のリッジ回帰だけで変換できます。
❓ なぜモデルサイズをまたいで使い回したいの?
💡 実運用ではコストと品質のバランスを取るために、小さいモデルから大きいモデルへエスカレーションしたり、会話途中でモデルを切り替えたりします。そのたびにゼロから文脈を再計算(re-prefill)するのは無駄が多いためです。
❓ 精度は落ちないの?
💡 良い組み合わせでは元モデル単体の73〜98%の精度を維持します。相性の悪いペアでは大きく劣化しますが、小さなMLPを追加するだけでHellaSwagが最大36.8ポイント回復しました。
❓ どれくらい速くなるの?
💡 再prefillと比べて2.7〜25倍高速。32Kトークンの長い文脈では最大25倍の差がつき、10ターン程度の会話でも精度の劣化はごくわずかでした。
#
LLM# #
KVキャッシュ#