💾 TL;DR: 別ノードのGPUが計算したKVキャッシュを、CXLメモリ経由でそのまま使い回して最大36.6倍高速化。SeagateがKubernetesネイティブな共有CXLメモリの仕組みを提案しました。
タイトル: Composable CXL Memory as a Kubernetes-Native Shared Memory for LLM Serving
URL:
📌 ポイント
🧩 Kubernetes DRAドライバでCXLリージョンをスケジュール可能なリソース化
🗂 Redis等の外部調整なし、リージョン内蔵のスロットディレクトリでKV管理
🚀 32Kトークンのプレフィックスでクロスノード再利用が再計算比36.6倍高速
🎯 ヒット率は95.4〜99.5%を達成
⚖️ クロスノードと同一ノードの遅延差はわずか1〜4%
🐢 同一ノードのGPU VRAMキャッシュと比べると1.15〜1.70倍のペナルティあり
🔧 実測帯域は5.8GB/sでファブリック上限27GB/sの一部、ゼロコピーDMAに伸びしろ
複数GPUノードでプレフィックスを使い回したいときの、地味だけど効く実用的な選択肢だと思います。
#
LLM推論# #
Kubernetes#