簡単なタスクに最上位モデルを使い続けて、コストが膨らんでいませんか。LangChainが自社のコーディングエージェントで実践したコスト削減策を公開しました。
タイトル: How to Build a Model Router in the Harness
URL:
コーディングエージェント「Open SWE」の月額費用急増に直面したLangChainが、ハーネス内にモデルルーターを組み込んでコストと品質を両立させた事例です。注目ポイントを3つ紹介します。
📊 タスク分析から始める設計
過去のトレースを分析すると、コード変更の22%が新機能、17%がバグ修正で、トークン消費量にも大きな幅がありました。この複雑さの多様性こそが、選択的なルーティングを有効にする土台になっています。
🎯 パレートフロンティア上の3モデル選定
コストと知能のバランスで、高速(GLM-5.3-Flash)・バランス(GPT-5.6 Sol)・高性能(GPT-6 Astra)の3ティアを選定。スレッド開始時に1回だけモデルを判定し、そのまま使い続けます。
💰 品質を落とさず64%のコスト削減
973スレッドのA/Bテストで、マージ率はルーター使用時29.2%、常に最上位モデル使用時27.3%とほぼ同等(p=0.49)でしたが、コスト中央値は2.61ドルから0.94ドルへ下がりました。
常に最安モデルだけを使うテストはわずか1日で中止されており、「ちょうど良い落としどころ」を探す価値が際立ちます。
#
AIエージェント# #
コスト最適化#