註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
加入 May 2026
280 正在關注    422 粉絲
💡 このタスクはあのモデルなら解ける、でも単価が合わない。そう言って見送った案件が、誰にでも一つや二つあるのではないでしょうか。 フロンティアモデルの実運用を阻んできたのは、多くの場合その性能ではなく価格でした。エージェントにコードを書かせ、長い文書を読ませ、コンピュータを操作させる。どれも大量のトークンを吐き出す仕事で、最高性能のモデルを使えば解けると分かっていても、1タスクあたりの単価が本番投入の前に立ちはだかります。 OpenAIが公開したGPT-6.1 Solは、この壁に「性能を上げる」ではなく「同じ性能を安くする」というかたちで応えたモデルです。最上位のGPT-6 Astraに対し、コーディングのDeepSWE v1.1では同等のスコアを5分の1のコストで達成し、コンピュータ操作のOSWorld 2.0では差を2.1ポイントまで詰めたうえでコストは7分の1。ハルシネーション率も4.5%から4.1%へ改善し、Astraの4.0%に肉薄しています。API価格は100万トークンあたり入力$2・出力$10で、キャッシュ入力は$0.10と標準比95%引きです。 変化が現れるのは「最高性能でしか解けなかったタスク」ではなく、「コストが理由で見送られていたタスク」のほうです。科学研究のTerminal-Bench Science 0.1では、Astraなら1タスク$23.80かかるところが$5.47。採算が合わずに棚上げしていたワークロードが、そのまま検討対象に戻ってきます。同じ文脈を毎ターン読み直すエージェント用途なら、キャッシュ入力の安さがさらに効いてくるはずです。 もっとも、最後の数ポイントを必要とする用途ではAstraの出番が残ります。当面はタスクの難度と単価で両者を使い分ける設計が現実的でしょう。 タイトル: GPT-6.1 Sol のご紹介 URL: #GPT6# #LLM#
顯示更多