登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
参加 May 2026
280 フォロー中    415 ファン
モデルを切り替えるたびに会話の文脈を再計算し直すの、実はもったいないかもしれません。 タイトル: Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse URL: ❓ そもそも何をする研究? 💡 NVIDIAの研究チームが、あるサイズのLLMが計算したKVキャッシュを、別サイズの同系統モデルにそのまま「翻訳」して使い回す手法を提案しました。学習不要、閉形式のリッジ回帰だけで変換できます。 ❓ なぜモデルサイズをまたいで使い回したいの? 💡 実運用ではコストと品質のバランスを取るために、小さいモデルから大きいモデルへエスカレーションしたり、会話途中でモデルを切り替えたりします。そのたびにゼロから文脈を再計算(re-prefill)するのは無駄が多いためです。 ❓ 精度は落ちないの? 💡 良い組み合わせでは元モデル単体の73〜98%の精度を維持します。相性の悪いペアでは大きく劣化しますが、小さなMLPを追加するだけでHellaSwagが最大36.8ポイント回復しました。 ❓ どれくらい速くなるの? 💡 再prefillと比べて2.7〜25倍高速。32Kトークンの長い文脈では最大25倍の差がつき、10ターン程度の会話でも精度の劣化はごくわずかでした。 #LLM# #KVキャッシュ#
もっと見る