💡 このタスクはあのモデルなら解ける、でも単価が合わない。そう言って見送った案件が、誰にでも一つや二つあるのではないでしょうか。
フロンティアモデルの実運用を阻んできたのは、多くの場合その性能ではなく価格でした。エージェントにコードを書かせ、長い文書を読ませ、コンピュータを操作させる。どれも大量のトークンを吐き出す仕事で、最高性能のモデルを使えば解けると分かっていても、1タスクあたりの単価が本番投入の前に立ちはだかります。
OpenAIが公開したGPT-6.1 Solは、この壁に「性能を上げる」ではなく「同じ性能を安くする」というかたちで応えたモデルです。最上位のGPT-6 Astraに対し、コーディングのDeepSWE v1.1では同等のスコアを5分の1のコストで達成し、コンピュータ操作のOSWorld 2.0では差を2.1ポイントまで詰めたうえでコストは7分の1。ハルシネーション率も4.5%から4.1%へ改善し、Astraの4.0%に肉薄しています。API価格は100万トークンあたり入力$2・出力$10で、キャッシュ入力は$0.10と標準比95%引きです。
変化が現れるのは「最高性能でしか解けなかったタスク」ではなく、「コストが理由で見送られていたタスク」のほうです。科学研究のTerminal-Bench Science 0.1では、Astraなら1タスク$23.80かかるところが$5.47。採算が合わずに棚上げしていたワークロードが、そのまま検討対象に戻ってきます。同じ文脈を毎ターン読み直すエージェント用途なら、キャッシュ入力の安さがさらに効いてくるはずです。
もっとも、最後の数ポイントを必要とする用途ではAstraの出番が残ります。当面はタスクの難度と単価で両者を使い分ける設計が現実的でしょう。
タイトル: GPT-6.1 Sol のご紹介
URL:
#
GPT6# #
LLM#