61億リクエスト・9,174モデル・1年間の非サンプリング本番トレースでLLMサービングの実態を解明——LLM基盤の設計者なら必読の論文です。
A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing
🔍 概要
Chutesの本番環境から1年間(2025年4月〜2026年4月)のリクエストレベルトレースを収集。61.2億リクエスト・31.5万ユーザー・9,174モデルという規模で、LLMサービングの実態を初めて包括的に可視化しました。
⚠️ 解決する課題
既存研究は短期間・サンプリング済み・単一モデルという制約を抱えていました。本論文はその空白を埋め、プレフィックスキャッシュの再利用・ルーティング・負荷分散を実データで検証します。
🔬 主要な発見
・ワークロードは非定常: リクエスト数と実際のコストは別のトレンドで変化する(短期観測では容量計画が不正確になる)
・出力トークンは短縮傾向: 年初の数百トークンから年末は100以下へ下降
・キャッシュ再利用の 99% は前回リクエストから 15分以内に到着(80% は 0.1秒以内)
・LRU は多くの場合に複雑アルゴリズムと同等以上、ARC は中間サイズで大幅劣化
・Cache-first ルーティングはラウンドロビン・ロードファーストを大幅に上回り、負荷不均衡は 5〜7% 以内に収まる
・Sticky ルーティングは最高ヒット率だが負荷不均衡が桁違いに大きく非現実的
📊 実験結果
100K トークンの MiniMax-M2.5 リクエストは約27GB のKV状態を占有し、インスタンス間転送には約20.4GB が必要。ルーティングの変動がKV複製を招き、キャッシュ局所性と負荷分散は本質的なトレードオフを持ちます。Cache-first は局所性を保ちつつ、単一ターンセッションが多いという性質のため負荷不均衡が抑制されます。
#
LLM# #
MLシステム#