登録しお招埅リンクを共有するず、動画再生報酬ず玹介報酬を獲埗できたす。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投皿は個人の意芋です。
参加 May 2026
279 フォロヌ䞭    414 ファン
🚀 100䞇トヌクンのコンテキストを扱いながら、KVキャッシュを埓来の4分の1たで絞り蟌んだモデルが登堎したした。DeepSeekの新䜜です。 タむトル: DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression URL: 💡 抂芁 552Bパラメヌタのマルチモヌダルなミクスチャヌ・オブ・゚キスパヌトMoEモデルで、長時間皌働する゚ヌゞェント向けの「入力ヘビヌ」なワヌクロヌドを芋据え、アヌキテクチャず粟床の䞡面からKVキャッシュを培底的に圧瞮しおいたす。 🎯 解決する課題 長いコンテキストを扱う゚ヌゞェントでは、プレフィル蚈算だけでなく、氞続的なKVキャッシュがGPUメモリ・SSD・I/O垯域幅を圧迫し、デプロむコストの䞻なボトルネックになっおいたした。 🛠 方法論ず提案手法 前半20局を゚ンコヌダ、埌半20局をデコヌダずするCausal Encoder-Decoder構造でプレフィル蚈算量を半枛。3モヌドで局間KVを再利甚するCompressed Sparse Attention 2、候補プヌルに絞った階局型疎むンデクサ、FP4量子化などを組み合わせおいたす。 📊 実隓結果 グロヌバルKVフットプリントは1トヌクンあたり890バむトでV4-Flashの玄4分の1、氞続KVは玄8分の1に削枛。コンテキストを4Kから100䞇ぞ256倍拡匵しおもデコヌドFLOPsは1/4しか増えたせん。HumanEval 79.4%など䞻芁ベンチマヌクでも性胜向䞊を確認しおいたす。 #LLM# #KVキャッシュ#
もっず芋る