登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 TerminalBench
TerminalBench コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
TerminalBench を含む検索結果
TL;DR: エージェントが失敗するのはモデルの賢さ不足ではなく「実行を取り巻く仕組み」の欠陥。重みを触らず実行環境だけを鍛える「ハーネススケーリング」で、Terminal-Bench 2.1に95.3%・約$15で到達しました。 タイトル: StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling URL: ポイント 🧠 モデルではなくハーネスを拡張。再訓練なしで失敗から学習させる新パラダイム 📌 永続状態でエピソードをまたいで発見を保持 🎯 フェーズ局所の文脈で意思決定点に関連情報だけを提示 ✅ 検査付き遷移で事前条件を検証し連鎖失敗を防止 📖 回復可能ランブックで失敗を照会可能な知識として再利用 🕒 バージョン管理された手順で戦略を更新・ロールバック 💰 GPT-5.6が95.3%(445試行/全89タスク成功)、$574.68の実行を約$15に圧縮 失敗を毎回「実行可能な事前条件」に変え、信頼性を運用基盤から底上げする一本です。 #AIAgents# #TerminalBench#
もっと見る
ターミナルエージェントの訓練データ、実は「指示・環境・解答・検証器」がバラバラで解けないタスクが量産されがち——その根本を絶つ合成フレームワークが登場しました。 タイトル: FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis URL: 📌 概要 関連スキルを情報豊かなシナリオへ再構成し、環境を先に構築してその実行状態を共有の土台に。指示・解答・検証器を同じ状態に接地して生成します。 🧩 解決する課題 ・多段生成で元素材の依存や中間状態が失われる ・指示/環境/解答/検証器が食い違い、解けない・評価できないタスクになる ⚙️ 提案手法 ・7万件超のスキルを収集し5次元シナリオへ再構成 ・Dockerで環境をビルドし実状態を共有チャネルに ・指示→解答→検証器を順次生成し、失敗箇所だけをルーターが特定して修復 📊 実験結果 ・平均22.77テスト/タスクの検証済み6,078件を合成 ・Qwen3.5を微調整し4B +40.5%、9B +30.1%、27B +16.5% ・27B(47.57)が約15倍大の397B(49.06)に肉薄 ・エンドツーエンド歩留まり70%で競合の15〜28%を圧倒 質の高い実行可能タスクは、量産ではなく丁寧な状態接地から生まれる、と示す一本です。 #LLMAgents# #TerminalBench#
もっと見る
🖥️ エージェントの学習用「実行環境」は軌跡の何百分の一しかない、という不均衡をひっくり返す発想の論文です。 タイトル: Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments URL: 蓄積済みのコードエージェント軌跡からファイル操作履歴を読み解き、実行可能な検証環境を自動で逆算復元し、そこから新たな学習タスクを大量に合成するフレームワークです。 注目ポイント 🔄 軌跡から環境を逆算復元 軌跡内のread/write/edit操作をリプレイして部分的なワークスペースを再現し、補完エージェントが欠けているファイルや依存関係を補います。さらに読み取り専用ツールで充分性を判定し、質の低い環境を除外します。 🌐 幅と深さの二軸でタスクを拡張 複数リポジトリの依存関係を使うCross-WS合成で「幅」を、ユーザーからの追加要望に応じるMulti-Round対話で「深さ」を広げます。Multi-Roundは平均4.51ラウンド、失敗から修正するパターンが69.6%を占めます。 📈 二桁ポイントの性能向上を実証 Qwen3.5-27Bをこのデータで学習させ、Terminal-Bench 2.1で+11.9pt、EvoCode-Bench v2で+13.8ptと大幅に改善。同規模の既存手法もすべて上回りました。 蓄積された軌跡という「余っているリソース」を検証可能な学習環境に転換する、地に足のついたスケーリング手法だと感じます。 #エージェント学習# #LLM#
もっと見る
🖥 たった9Bのオープンモデルが、ターミナル操作ベンチでClaude Haiku 4.5に迫る。しかもデータもモデルもコードも全公開です。 タイトル:Tmax: A simple recipe for terminal agents URL: ターミナルエージェントのRL学習に、シンプルで再現可能なレシピを与えたAi2/UWの研究です。注目ポイントを3つに絞って紹介します。 🧩 構成的なデータ生成パイプライン ドメイン・スキル・検証器・ペルソナ・難易度など9つの軸の組み合わせでタスクを大量合成し、Gemini-3-ProがDockerfileとユニットテストまで生成します。高コストな品質検証は省き、RL側でpass率0を弾くだけ。結果として従来比2.5倍超・14,600環境のTmax-15Kを安価に構築し、汚染ゼロかつ最も難しいデータになりました。 ⚙️ シンプルなoutcome-only RLレシピ 報酬は「タスク達成したか」だけ。素朴なGRPOは長期エージェントで崩壊するため、logprobの乖離をマスクするDPPO、FP32のLMヘッド、大きなグループサイズ(32)で安定化します。Qwen 3.5 9BをこのレシピでTerminal-Bench 2.0で27%まで引き上げました。 📈 強さと汎化、そして全公開 2B〜27Bの全サイズでQwenベースラインを改善。さらにSWE-Bench Verifiedが44→53.5、AIMEが73→91と非ターミナル評価でも向上し、ハーネスやモデルファミリを越えて汎化します。データ・モデル・コードはGitHubで完全公開。 オープンなターミナルエージェント研究の強力な土台になりそうです。 #ターミナルエージェント# #強化学習#
もっと見る
TL;DR: 長期エージェントの3大問題(誤差蓄積・コンテキスト腐敗・状態消失)を、Manager-Execute-Audit(MEA)ループで構造的に解決。WeaveBenchで51.8%→80.7%を達成しました。 LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks ポイント 🔧 Manager: 実行軌跡の外でタスク状態を明示管理。ゴール・受け入れ基準・制約を含む「サブタスクコントラクト」を生成する ⚡ Executor: 過去の軌跡を持ち込まない、バジェット有界の新鮮コンテキストで各サブタスクを実行する 🔍 Auditor: 実行後に読み取り専用で独立検査。完了・整合性・状態更新を3分類でレポートし、ラウンド間の永続メモリとして機能する 🖥️ GUI/CLIハイブリッド: Managerがタスクに応じてインターフェースを選択。AgentAdapterでClaude Code・Codex CLI等を差し替え可能 📊 WeaveBench: PassRate 51.8%→80.7%、Design+60pp・Spatial/3D+50ppの大幅改善 🤖 OSWorld 2.0: Qwen 3.7-Plusで2.8%→8.3%(3倍)、Claude Opus 4.7で20.6%→35.3% 💻 Terminal-Bench: 69.7%→77.2%、かつトークン消費24%減(オーバーヘッドなし) 💡 Manager cost: 総トークンのたった2〜8%。Auditorが19〜38%でほとんどの追加コストを担う 「エージェント能力はモデル単体でなく、モデル+ハーネス全体の性質」——この視点が長期エージェント設計の出発点になると思います。 #AIAgents# #LLM#
もっと見る
💡NVIDIA 、Poolside と60億ドルの非独占ライセンス契約 | 10億ドル出資と109名への採用オファーを同時実行 $NVDA NVIDIA $NVDA が、AIコーディングモデルを開発する Poolside との間で60億ドル規模の非独占ライセンス契約を締結した。米ニュースレター Newcomer が8月20日、Poolside が投資家宛に送付したレターを入手したとして報じ、The Information も追随して報じている。契約は単独ではなく、プレマネー評価額120億ドルでの10億ドルの出資、および Poolside 社員109名に対する NVIDIA からの採用オファーとセットで構成される。共同創業者の Jason Warner と Eiso Kant は残留し、Poolside は独立企業として存続すると報じられている。現時点で NVIDIA 側からの公式発表やSEC開示は確認されていない。 ライセンス対象について、The Information は「AIモデル開発ソフトウェア」と表現している。単なる学習済みモデルの重みではなく、学習パイプラインそのものが取得対象である可能性が高い。 Poolside は7月2日に Laguna XS 2.1(33BのMoE、アクティブ3B)と Laguna M.1(225B、アクティブ23B)、7月21日に Laguna S 2.1(118BのMoE、アクティブ8B、コンテキスト100万トークン)をオープンウェイトで公開しており、Terminal-Bench 2.1 で70.2%、SWE-Bench Multilingual で78.5%を記録した。特筆すべきは学習効率で、5月22日に H200 4,096基で事前学習を開始し、30兆トークンを9週間未満で完走している。強化学習をFP8精度で回した初のモデルでもある。NVFP4チェックポイントは DGX Spark 1台(128GB統合メモリ)で動作し、NVIDIA自身が8月のローカルAI関連ブログで同モデルを紹介していた。つまり NVIDIA は、自社ハードウェアの世代交代に最適化された学習・推論スタックと、それを短期間で回せるチームを丸ごと取り込む形になる。 この取引形態は、NVIDIA が過去1年で反復してきた手法の延長線上にある。 2025年9月に Enfabrica のネットワーク技術を9億ドル超でライセンスしてCEOらを採用、同年12月には Groq と非独占ライセンス契約を結び、CNBC報道ベースで約200億ドル、創業者 Jonathan Ross と社長 Sunny Madra を含む人材を獲得した。株式が移転しないためHSR法に基づく事前届出が不要となり、独占禁止法の審査プロセスを回避できる。Bernstein の Stacy Rasgon は Groq の件について、非独占ライセンスという建て付けが競争の外形を維持する機能を果たしていると指摘していた。なお Groq はその後、8月17日に35億ドルの評価額で3.5億ドルを調達しており、契約前の69億ドルからほぼ半減している。IPと人材を抜かれた後の「残された会社」がどう評価されるかの実例として、Poolside の株主にとっては無視できない先行事例である。 Poolside 側の事情も今回の条件を規定している。同社は2025年10月、CoreWeave $CRWV をアンカーテナントとする西テキサスの2ギガワット級データセンター Project Horizon を発表し、120億ドル評価で20億ドルの調達を進めていた。しかし2026年4月初旬、CoreWeave が15年契約の250MWリースから撤退し、NVIDIA の約10億ドルを含む調達ラウンド自体が崩壊したとFTが報じている。400MWへの規模縮小と代替テナント探しは7月末時点でも決着しておらず、Google との交渉も終了したとされる。今回の120億ドルというプレマネー評価額は、10億ドル規模の一次調達が成立していれば2025年10月時点で付いていたはずの水準と同じである。10か月分のインフレも成長も乗っていない。109名という人数は、Revelio Labs が2026年3月時点で推計した従業員数264名に対して約4割に相当する。 この動きの観点は、NVIDIA の買い物の対象がシリコンからソフトウェアとモデルの層へ移動している点にある。 Enfabrica でネットワーク、Groq で推論シリコン、そして Poolside で学習スタックとオープンウェイトモデル。GPU を売る会社が、GPU の上で動くものを自ら押さえに来ている。オープンウェイト陣営で中国系ラボが優位に立つ構図に対し、西側の対抗軸を自社の内部に確保する狙いも読める。一方で、120億ドルの評価額を付けられ140億ドル規模のインフラ構想を掲げた企業が、1年経たずにIPのライセンスアウトと人材の4割流出という結末に至った事実は、フロンティアモデルを自前で追う独立系ラボの資本効率について冷徹な材料を提供している。 NVIDIA $NVDA の公式開示と、Poolside に残る事業がどのような形で継続するかを注視したい。
もっと見る
半額。OpenAIのサム・アルトマンCEOが7月14日、Xでこう投稿しました。新型モデルGPT-5.6 SolはAnthropicのClaude Fable 5に対して価格が半分で、条件次第では4分の1まで下げる用意もあると付け加えています。 実際の価格を並べると差は明確です。GPT-5.6 Solは百万トークンあたり入力5ドル、出力30ドル。対するClaude Fable 5は入力10ドル、出力50ドルです。トークンとはAIが文章を読み書きする際の処理単位で、利用料金はこの単位ごとに積み上がっていきます。 GPT-5.6 Solの一般提供が始まったのは7月9日です。OpenAIによれば、同じ作業をこなす際に消費する出力トークン数はAnthropic製モデルより最大54パーセント少ないとされています。カフェの注文アプリを同一条件で作らせた開発者の報告では、費用はSol側が7ドル、Fable 5側が62ドルだったといいます。 性能面では差が縮まっています。第三者機関Artificial Analysisの総合指数によれば、Fable 5が60点、Solが59点とほぼ並びました。コーディング特化のベンチマークではSolが上回る一方、難易度の高いソフトウェア修正タスクの指標ではFable 5が首位です。Terminal-Bench 2.1と呼ばれる作業遂行テストでも、Solは88.8パーセントとFable 5の83パーセント台を上回っています。 値下げ競争の背景には両社が意識する株式上場があります。Anthropicは6月にSECへ非公開でIPO関連書類を提出したと報じられ、2026年第2四半期には創業以来初の営業黒字を計上する見通しだとされています。OpenAI側は依然として大幅な赤字が続いており、黒字化は2030年ごろとの見方が業界で出ています。 Claude Fable 5は6月9日の登場直後、米国の輸出規制により約3週間利用できなくなり、7月1日に復旧したばかりのモデルでもあります。値下げ競争の渦中に、ようやく世界展開が戻った状態です。OpenAIの投稿を受け、Anthropicも全ユーザー向けのレート制限を緩和する対応を取ったと報じられています。
もっと見る