🚀 100万トークンのコンテキストを扱いながら、KVキャッシュを従来の4分の1まで絞り込んだモデルが登場しました。DeepSeekの新作です。
タイトル: DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
URL:
💡 概要
552Bパラメータのマルチモーダルなミクスチャー・オブ・エキスパート(MoE)モデルで、長時間稼働するエージェント向けの「入力ヘビー」なワークロードを見据え、アーキテクチャと精度の両面からKVキャッシュを徹底的に圧縮しています。
🎯 解決する課題
長いコンテキストを扱うエージェントでは、プレフィル計算だけでなく、永続的なKVキャッシュがGPUメモリ・SSD・I/O帯域幅を圧迫し、デプロイコストの主なボトルネックになっていました。
🛠 方法論と提案手法
前半20層をエンコーダ、後半20層をデコーダとするCausal Encoder-Decoder構造でプレフィル計算量を半減。3モードで層間KVを再利用するCompressed Sparse Attention 2、候補プールに絞った階層型疎インデクサ、FP4量子化などを組み合わせています。
📊 実験結果
グローバルKVフットプリントは1トークンあたり890バイトでV4-Flashの約4分の1、永続KVは約8分の1に削減。コンテキストを4Kから100万へ256倍拡張してもデコードFLOPsは1/4しか増えません。HumanEval 79.4%など主要ベンチマークでも性能向上を確認しています。
#
LLM# #
KVキャッシュ#