登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 SWEBench
SWEBench コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
SWEBench を含む検索結果
コーディングエージェントの「ハーネス」って、計画機能もツール設計も文脈管理も、実はモデルの強さ次第で最適解が真逆になるんです。176通りの実験でそれを丁寧に検証した論文です。 タイトル: An Empirical Study of Harness Design for Coding Agents URL: 🧠 注目ポイント1: 文脈管理は資源が少ないほど効く 32kトークンのウィンドウでは、文脈管理ありと管理なしでSWE-Benchの成功率差が35.7ポイントにも達しました。しかも複雑なリコール機構はほぼ使われず、精度にも寄与しないことが判明しています。 📋 注目ポイント2: 計画機能の効果はモデルの強さで真逆になる 弱いモデル(30B)は計画を与えると成功率が+11.6ポイント向上しました。編集を試さず終了してしまう割合も69%から28%に激減しています。逆に強いモデル(550B)は計画なしでも十分で、計画を入れるとコストが約30%下がりました。 🔧 注目ポイント3: ツール設計もモデル・タスク次第 弱いモデルは専用ツール一式が必要ですが、強いモデルはbashコマンドだけの方が高性能かつ低コストになるケースが目立ちました。同じモデルでもタスクの種類によって最適解が逆転することもあります。 自分たちのモデルとタスクに合わせて、ハーネスの各要素を個別にチューニングする発想が大事だと実感しました。 #コーディングエージェント# #LLM#
もっと見る
💡NVIDIA 、Poolside と60億ドルの非独占ライセンス契約 | 10億ドル出資と109名への採用オファーを同時実行 $NVDA NVIDIA $NVDA が、AIコーディングモデルを開発する Poolside との間で60億ドル規模の非独占ライセンス契約を締結した。米ニュースレター Newcomer が8月20日、Poolside が投資家宛に送付したレターを入手したとして報じ、The Information も追随して報じている。契約は単独ではなく、プレマネー評価額120億ドルでの10億ドルの出資、および Poolside 社員109名に対する NVIDIA からの採用オファーとセットで構成される。共同創業者の Jason Warner と Eiso Kant は残留し、Poolside は独立企業として存続すると報じられている。現時点で NVIDIA 側からの公式発表やSEC開示は確認されていない。 ライセンス対象について、The Information は「AIモデル開発ソフトウェア」と表現している。単なる学習済みモデルの重みではなく、学習パイプラインそのものが取得対象である可能性が高い。 Poolside は7月2日に Laguna XS 2.1(33BのMoE、アクティブ3B)と Laguna M.1(225B、アクティブ23B)、7月21日に Laguna S 2.1(118BのMoE、アクティブ8B、コンテキスト100万トークン)をオープンウェイトで公開しており、Terminal-Bench 2.1 で70.2%、SWE-Bench Multilingual で78.5%を記録した。特筆すべきは学習効率で、5月22日に H200 4,096基で事前学習を開始し、30兆トークンを9週間未満で完走している。強化学習をFP8精度で回した初のモデルでもある。NVFP4チェックポイントは DGX Spark 1台(128GB統合メモリ)で動作し、NVIDIA自身が8月のローカルAI関連ブログで同モデルを紹介していた。つまり NVIDIA は、自社ハードウェアの世代交代に最適化された学習・推論スタックと、それを短期間で回せるチームを丸ごと取り込む形になる。 この取引形態は、NVIDIA が過去1年で反復してきた手法の延長線上にある。 2025年9月に Enfabrica のネットワーク技術を9億ドル超でライセンスしてCEOらを採用、同年12月には Groq と非独占ライセンス契約を結び、CNBC報道ベースで約200億ドル、創業者 Jonathan Ross と社長 Sunny Madra を含む人材を獲得した。株式が移転しないためHSR法に基づく事前届出が不要となり、独占禁止法の審査プロセスを回避できる。Bernstein の Stacy Rasgon は Groq の件について、非独占ライセンスという建て付けが競争の外形を維持する機能を果たしていると指摘していた。なお Groq はその後、8月17日に35億ドルの評価額で3.5億ドルを調達しており、契約前の69億ドルからほぼ半減している。IPと人材を抜かれた後の「残された会社」がどう評価されるかの実例として、Poolside の株主にとっては無視できない先行事例である。 Poolside 側の事情も今回の条件を規定している。同社は2025年10月、CoreWeave $CRWV をアンカーテナントとする西テキサスの2ギガワット級データセンター Project Horizon を発表し、120億ドル評価で20億ドルの調達を進めていた。しかし2026年4月初旬、CoreWeave が15年契約の250MWリースから撤退し、NVIDIA の約10億ドルを含む調達ラウンド自体が崩壊したとFTが報じている。400MWへの規模縮小と代替テナント探しは7月末時点でも決着しておらず、Google との交渉も終了したとされる。今回の120億ドルというプレマネー評価額は、10億ドル規模の一次調達が成立していれば2025年10月時点で付いていたはずの水準と同じである。10か月分のインフレも成長も乗っていない。109名という人数は、Revelio Labs が2026年3月時点で推計した従業員数264名に対して約4割に相当する。 この動きの観点は、NVIDIA の買い物の対象がシリコンからソフトウェアとモデルの層へ移動している点にある。 Enfabrica でネットワーク、Groq で推論シリコン、そして Poolside で学習スタックとオープンウェイトモデル。GPU を売る会社が、GPU の上で動くものを自ら押さえに来ている。オープンウェイト陣営で中国系ラボが優位に立つ構図に対し、西側の対抗軸を自社の内部に確保する狙いも読める。一方で、120億ドルの評価額を付けられ140億ドル規模のインフラ構想を掲げた企業が、1年経たずにIPのライセンスアウトと人材の4割流出という結末に至った事実は、フロンティアモデルを自前で追う独立系ラボの資本効率について冷徹な材料を提供している。 NVIDIA $NVDA の公式開示と、Poolside に残る事業がどのような形で継続するかを注視したい。
もっと見る
🐡 もう「どのLLMが最強か」を一つに絞って悩む時代は、終わるのかもしれません。 タイトル: Sakana Fugu Technical Report URL: Sakana AI の Fugu は、複数のフロンティア LLM を部下として束ね、タスクに応じて最適な布陣を自動で組む「指揮官(オーケストレータ)モデル」です。注目ポイントを3つに絞って紹介します。 🧭 学習された司令塔 Fugu は事前学習済みバックボーンに軽量な選択ヘッドを載せ、隠れ状態から最適なワーカーモデルをロジットで直接選びます。自己回帰生成を挟まないため、単一のフロンティアモデルを呼ぶのと同等の低遅延を保てるのが巧みです。 🕸️ ワークフローを動的に自作(Fugu-Ultra) 上位版はタスクを自然言語のワークフローとして書き下し、サブタスク分割・担当割り当て・通信戦略まで設計します。最大5ステップで討論型・逐次連鎖・木構造といった多エージェント協調を、問題ごとに組み立てます。 📊 単体モデルを超える成績 SWE-Bench Pro で 73.7 点(Claude Opus 4.8 の 69.2 を上回る)、GPQA-Diamond 95.5、LiveCodeBench 93.2 など主要ベンチで公開モデル最高水準。エージェント型コーディングでは「世代交代級」の 5〜6% の相対改善を達成しました。 巨大化ではなく賢い"指揮"で最先端へ。新しいスケーリング軸を示した一本です。 #SakanaAI# #LLM#
もっと見る
🖥 たった9Bのオープンモデルが、ターミナル操作ベンチでClaude Haiku 4.5に迫る。しかもデータもモデルもコードも全公開です。 タイトル:Tmax: A simple recipe for terminal agents URL: ターミナルエージェントのRL学習に、シンプルで再現可能なレシピを与えたAi2/UWの研究です。注目ポイントを3つに絞って紹介します。 🧩 構成的なデータ生成パイプライン ドメイン・スキル・検証器・ペルソナ・難易度など9つの軸の組み合わせでタスクを大量合成し、Gemini-3-ProがDockerfileとユニットテストまで生成します。高コストな品質検証は省き、RL側でpass率0を弾くだけ。結果として従来比2.5倍超・14,600環境のTmax-15Kを安価に構築し、汚染ゼロかつ最も難しいデータになりました。 ⚙️ シンプルなoutcome-only RLレシピ 報酬は「タスク達成したか」だけ。素朴なGRPOは長期エージェントで崩壊するため、logprobの乖離をマスクするDPPO、FP32のLMヘッド、大きなグループサイズ(32)で安定化します。Qwen 3.5 9BをこのレシピでTerminal-Bench 2.0で27%まで引き上げました。 📈 強さと汎化、そして全公開 2B〜27Bの全サイズでQwenベースラインを改善。さらにSWE-Bench Verifiedが44→53.5、AIMEが73→91と非ターミナル評価でも向上し、ハーネスやモデルファミリを越えて汎化します。データ・モデル・コードはGitHubで完全公開。 オープンなターミナルエージェント研究の強力な土台になりそうです。 #ターミナルエージェント# #強化学習#
もっと見る