エージェントのLLMコール、本当に全部フロンティアモデルが必要ですか?NVIDIAのSwitchyardで実測してみたら、驚きの結果が出ました。
タイトル: Switchyard Agent Routing Benchmark
URL:
TL;DR
145件のマルチステップエージェントタスク(1タスク平均6.3コール)を検証。93%のLLMコールは小型モデルで処理でき、74%のコスト削減を達成。精度の低下はわずか6ポイントでした。
ポイント
🎯 フロンティアモデルは7%のコールのみ
全LLMコールのうち、Claude Opus 4.8が必要だったのはたった7%。残り93%はNemotron 3.5 Lightningで処理可能でした。
💰 コストは74%削減
タスクあたりコストが$0.092(Opus単体)→ $0.026(ルーティング)→ $0.006(Lightning単体)に。精度80%を確保しながら大幅な削減を実現。
📊 コスト内訳の意外な事実
フロンティアモデルはコール件数わずか7%なのに、総支出の68.4%を占有。加えてジャッジモデル自体のコストが21.2%を消費する点に注意が必要です。
🔢 ルーティングが割に合うかの公式
「最小オフロード率 = ジャッジコスト ÷ (高額モデルコスト - 安価モデルコスト)」で判断できます。モデル間の価格差が小さいと導入メリットが薄れます。
⚡ 2つのデプロイ方式
NVIDIAのSwitchyardをプロキシサーバーとして独立起動するか、LangChainのDeep Agentsミドルウェアとして組み込むかを選択できます。
タスクが比較的簡単だった(難しいタスクならルーティング効果はさらに大きい可能性あり)という留意点はあるものの、1タスク複数コールのエージェントには非常に実践的な知見です。
#
AIエージェント# #
LLMコスト#