登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 SWEエージェント
SWEエージェント コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
SWEエージェント を含む検索結果
簡単なタスクに最上位モデルを使い続けて、コストが膨らんでいませんか。LangChainが自社のコーディングエージェントで実践したコスト削減策を公開しました。 タイトル: How to Build a Model Router in the Harness URL: コーディングエージェント「Open SWE」の月額費用急増に直面したLangChainが、ハーネス内にモデルルーターを組み込んでコストと品質を両立させた事例です。注目ポイントを3つ紹介します。 📊 タスク分析から始める設計 過去のトレースを分析すると、コード変更の22%が新機能、17%がバグ修正で、トークン消費量にも大きな幅がありました。この複雑さの多様性こそが、選択的なルーティングを有効にする土台になっています。 🎯 パレートフロンティア上の3モデル選定 コストと知能のバランスで、高速(GLM-5.3-Flash)・バランス(GPT-5.6 Sol)・高性能(GPT-6 Astra)の3ティアを選定。スレッド開始時に1回だけモデルを判定し、そのまま使い続けます。 💰 品質を落とさず64%のコスト削減 973スレッドのA/Bテストで、マージ率はルーター使用時29.2%、常に最上位モデル使用時27.3%とほぼ同等(p=0.49)でしたが、コスト中央値は2.61ドルから0.94ドルへ下がりました。 常に最安モデルだけを使うテストはわずか1日で中止されており、「ちょうど良い落としどころ」を探す価値が際立ちます。 #AIエージェント# #コスト最適化#
もっと見る
コーディングエージェントの「ハーネス」って、計画機能もツール設計も文脈管理も、実はモデルの強さ次第で最適解が真逆になるんです。176通りの実験でそれを丁寧に検証した論文です。 タイトル: An Empirical Study of Harness Design for Coding Agents URL: 🧠 注目ポイント1: 文脈管理は資源が少ないほど効く 32kトークンのウィンドウでは、文脈管理ありと管理なしでSWE-Benchの成功率差が35.7ポイントにも達しました。しかも複雑なリコール機構はほぼ使われず、精度にも寄与しないことが判明しています。 📋 注目ポイント2: 計画機能の効果はモデルの強さで真逆になる 弱いモデル(30B)は計画を与えると成功率が+11.6ポイント向上しました。編集を試さず終了してしまう割合も69%から28%に激減しています。逆に強いモデル(550B)は計画なしでも十分で、計画を入れるとコストが約30%下がりました。 🔧 注目ポイント3: ツール設計もモデル・タスク次第 弱いモデルは専用ツール一式が必要ですが、強いモデルはbashコマンドだけの方が高性能かつ低コストになるケースが目立ちました。同じモデルでもタスクの種類によって最適解が逆転することもあります。 自分たちのモデルとタスクに合わせて、ハーネスの各要素を個別にチューニングする発想が大事だと実感しました。 #コーディングエージェント# #LLM#
もっと見る
🤖 AIエージェントは、自分自身が動くための「実行基盤」を自分で作って改善できるのでしょうか。 タイトル: HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? URL: ❓ そもそも「ハーネス」とは何ですか 💡 実行ループ・ツール利用・コンテキスト管理・失敗からの復旧・検証など、エージェントを動かす実行基盤のことです。これまでの評価はハーネスを固定してモデル性能だけを測ってきましたが、実際はハーネスの設計品質も実力を大きく左右します。 ❓ LLMは最小限の材料からハーネスを作れますか 💡 わざと弱いシードハーネスから構築させたところ、最高スコアのOpus 4.8でも67.8点にとどまり、人間が作った参照実装(86.2点)には及びませんでした。特にリサーチ・検索領域でのギャップが最も大きかったです。 ❓ 自分でハーネスを改善(進化)させることはできますか 💡 5つのモデルすべてが可視フィードバック上では改善しましたが、隠されたタスクでの改善幅は大幅に縮小。バージョン切り替えの64回中、ノイズを超える明確な改善は2回だけでした。 ❓ 別の実行者モデルに載せ替えても性能は保たれますか 💡 保たれないケースが目立ちました。Opusが作ったハーネスは実行者をGeminiに固定した途端、SWE-Proスコアが69.3から33.0に急落。ハーネスは特定モデルの前提を埋め込んでしまうため、移植性には注意が必要です。 #AIエージェント# #LLM#
もっと見る
🎯 長時間タスクでエージェントが下す判断の「センスの良さ」を、専門家のアノテーションなしで測る方法が提案されました。 タイトル: The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks URL: 📖 概要 エージェントが長時間タスクの途中で下す判断(どの仮説を試すか、どの実装を土台にするか)を評価するベンチマーク Taste-Bench(502問)を構築した研究です。さらに、この判断力は蒸留で学習可能であることも示しています。 🔥 解決する課題 既存のベンチマークはタスクをやり切れたかどうかしか測っておらず、途中の判断の質を評価できません。しかも誤った判断はその時点では妥当に見え、コストが表面化するのは予算を使い切った後です。人手で採点するには深いドメイン専門性が必要でスケールしません。 🧪 方法論 軌跡の後半が前半の判断に対する事後的な証拠になる、という着想が鍵です。 ・同一タスクへの複数試行が分岐し片方だけ成功した地点(エージェントが最後まで気づかなかった誤り) ・1本の軌跡内でエージェントが失敗して立て直した地点(自己修正した誤り) この2種類の分岐点を自動採掘し、分岐後を隠して2択問題にします。選択肢の並び順を反転させた2回とも正解した場合のみ正解とするため、ランダム推測は25%になります。 📊 実験結果 ・14モデルを評価し、最高は GPT-5.6 Sol の59.7%。2択なのに天井には程遠い水準です ・決定的な証拠が遠い先にあるほど急落し、最遠では21.0%とランダム以下になります ・推論予算を最大まで上げても改善は −0.2〜+2.2ポイントにとどまりました ・SWE-bench Verified との相関は r=0.63 どまりで、同スコア帯でも10.7ポイント差が出ます ・蒸留した生徒の助言を注入すると、実タスク成功率が14.6%から33.7%へ向上しました #AIエージェント# #ベンチマーク#
もっと見る
📚 ReActもRAGもTree of Thoughtsも、論文ごとにバラバラだったエージェント設計を、同じAPIで動かして比較できたら最高だと思いませんか?それを実現した「35パターン全部入り」のリポジトリです。 タイトル: FareedKhan-dev/all-agentic-architectures URL: 📦 概要 本リポジトリは、プロダクション品質のエージェントAIパターンを35種類実装したPythonライブラリ兼「生きた教科書」です。すべてのアーキテクチャが同じ.run(task)メソッドを持ち、同一形式の結果を返すため、下流のコードを変えずにパターンを差し替えられます。 ❓ 解決する課題 エージェントの設計パターンは論文ごとに散らばっていて、実装も様式もバラバラでした。これを統一インターフェースの下に集約し、横並びで試せるようにしたのが最大の価値です。 💡 中核の工夫と提案手法 中心にあるのが「決定論的ピッカーの規律」です。 ・LLMのスコアリングに丸投げせず、まずLLMに真偽値や列挙型などカテゴリ的な特徴をコミットさせる ・最終判断はPythonのロジックで合成する これにより、スコアが平坦に潰れる「LLM-as-Scorer」の病理を緩和します。35アーキテクチャ中13で採用されています。 🎯 カバー範囲とユースケース 推論・内省(Reflection、Self-Discover)、探索(Tree of Thoughts、LATS)、RAG(Corrective/Self/Adaptive/GraphRAG)、メモリ(MemGPT、Voyager)、ツール・行動(ReAct、SWE-Agent)、マルチエージェント(Debate、STORM)など8系統を網羅。各パターンに実行済みのJupyterノートブックが付き、本物のLLM出力に基づく再現可能なリファレンスになっています。 📊 注目ポイント ・コアはLangGraph。NebiusやOpenAI、Anthropic、Ollamaなど主要プロバイダーに対応し、切り替えは環境変数1つ ・pytestで283件のテストがパス ・17タスクのベンチマークで直近42問中33問正解(成功率78%)。ReflectionやSelf-Consistencyが好成績でした #AIエージェント# #LangGraph#
もっと見る
🖥 たった9Bのオープンモデルが、ターミナル操作ベンチでClaude Haiku 4.5に迫る。しかもデータもモデルもコードも全公開です。 タイトル:Tmax: A simple recipe for terminal agents URL: ターミナルエージェントのRL学習に、シンプルで再現可能なレシピを与えたAi2/UWの研究です。注目ポイントを3つに絞って紹介します。 🧩 構成的なデータ生成パイプライン ドメイン・スキル・検証器・ペルソナ・難易度など9つの軸の組み合わせでタスクを大量合成し、Gemini-3-ProがDockerfileとユニットテストまで生成します。高コストな品質検証は省き、RL側でpass率0を弾くだけ。結果として従来比2.5倍超・14,600環境のTmax-15Kを安価に構築し、汚染ゼロかつ最も難しいデータになりました。 ⚙️ シンプルなoutcome-only RLレシピ 報酬は「タスク達成したか」だけ。素朴なGRPOは長期エージェントで崩壊するため、logprobの乖離をマスクするDPPO、FP32のLMヘッド、大きなグループサイズ(32)で安定化します。Qwen 3.5 9BをこのレシピでTerminal-Bench 2.0で27%まで引き上げました。 📈 強さと汎化、そして全公開 2B〜27Bの全サイズでQwenベースラインを改善。さらにSWE-Bench Verifiedが44→53.5、AIMEが73→91と非ターミナル評価でも向上し、ハーネスやモデルファミリを越えて汎化します。データ・モデル・コードはGitHubで完全公開。 オープンなターミナルエージェント研究の強力な土台になりそうです。 #ターミナルエージェント# #強化学習#
もっと見る
🐡 もう「どのLLMが最強か」を一つに絞って悩む時代は、終わるのかもしれません。 タイトル: Sakana Fugu Technical Report URL: Sakana AI の Fugu は、複数のフロンティア LLM を部下として束ね、タスクに応じて最適な布陣を自動で組む「指揮官(オーケストレータ)モデル」です。注目ポイントを3つに絞って紹介します。 🧭 学習された司令塔 Fugu は事前学習済みバックボーンに軽量な選択ヘッドを載せ、隠れ状態から最適なワーカーモデルをロジットで直接選びます。自己回帰生成を挟まないため、単一のフロンティアモデルを呼ぶのと同等の低遅延を保てるのが巧みです。 🕸️ ワークフローを動的に自作(Fugu-Ultra) 上位版はタスクを自然言語のワークフローとして書き下し、サブタスク分割・担当割り当て・通信戦略まで設計します。最大5ステップで討論型・逐次連鎖・木構造といった多エージェント協調を、問題ごとに組み立てます。 📊 単体モデルを超える成績 SWE-Bench Pro で 73.7 点(Claude Opus 4.8 の 69.2 を上回る)、GPQA-Diamond 95.5、LiveCodeBench 93.2 など主要ベンチで公開モデル最高水準。エージェント型コーディングでは「世代交代級」の 5〜6% の相対改善を達成しました。 巨大化ではなく賢い"指揮"で最先端へ。新しいスケーリング軸を示した一本です。 #SakanaAI# #LLM#
もっと見る
💡NVIDIA 、Poolside と60億ドルの非独占ライセンス契約 | 10億ドル出資と109名への採用オファーを同時実行 $NVDA NVIDIA $NVDA が、AIコーディングモデルを開発する Poolside との間で60億ドル規模の非独占ライセンス契約を締結した。米ニュースレター Newcomer が8月20日、Poolside が投資家宛に送付したレターを入手したとして報じ、The Information も追随して報じている。契約は単独ではなく、プレマネー評価額120億ドルでの10億ドルの出資、および Poolside 社員109名に対する NVIDIA からの採用オファーとセットで構成される。共同創業者の Jason Warner と Eiso Kant は残留し、Poolside は独立企業として存続すると報じられている。現時点で NVIDIA 側からの公式発表やSEC開示は確認されていない。 ライセンス対象について、The Information は「AIモデル開発ソフトウェア」と表現している。単なる学習済みモデルの重みではなく、学習パイプラインそのものが取得対象である可能性が高い。 Poolside は7月2日に Laguna XS 2.1(33BのMoE、アクティブ3B)と Laguna M.1(225B、アクティブ23B)、7月21日に Laguna S 2.1(118BのMoE、アクティブ8B、コンテキスト100万トークン)をオープンウェイトで公開しており、Terminal-Bench 2.1 で70.2%、SWE-Bench Multilingual で78.5%を記録した。特筆すべきは学習効率で、5月22日に H200 4,096基で事前学習を開始し、30兆トークンを9週間未満で完走している。強化学習をFP8精度で回した初のモデルでもある。NVFP4チェックポイントは DGX Spark 1台(128GB統合メモリ)で動作し、NVIDIA自身が8月のローカルAI関連ブログで同モデルを紹介していた。つまり NVIDIA は、自社ハードウェアの世代交代に最適化された学習・推論スタックと、それを短期間で回せるチームを丸ごと取り込む形になる。 この取引形態は、NVIDIA が過去1年で反復してきた手法の延長線上にある。 2025年9月に Enfabrica のネットワーク技術を9億ドル超でライセンスしてCEOらを採用、同年12月には Groq と非独占ライセンス契約を結び、CNBC報道ベースで約200億ドル、創業者 Jonathan Ross と社長 Sunny Madra を含む人材を獲得した。株式が移転しないためHSR法に基づく事前届出が不要となり、独占禁止法の審査プロセスを回避できる。Bernstein の Stacy Rasgon は Groq の件について、非独占ライセンスという建て付けが競争の外形を維持する機能を果たしていると指摘していた。なお Groq はその後、8月17日に35億ドルの評価額で3.5億ドルを調達しており、契約前の69億ドルからほぼ半減している。IPと人材を抜かれた後の「残された会社」がどう評価されるかの実例として、Poolside の株主にとっては無視できない先行事例である。 Poolside 側の事情も今回の条件を規定している。同社は2025年10月、CoreWeave $CRWV をアンカーテナントとする西テキサスの2ギガワット級データセンター Project Horizon を発表し、120億ドル評価で20億ドルの調達を進めていた。しかし2026年4月初旬、CoreWeave が15年契約の250MWリースから撤退し、NVIDIA の約10億ドルを含む調達ラウンド自体が崩壊したとFTが報じている。400MWへの規模縮小と代替テナント探しは7月末時点でも決着しておらず、Google との交渉も終了したとされる。今回の120億ドルというプレマネー評価額は、10億ドル規模の一次調達が成立していれば2025年10月時点で付いていたはずの水準と同じである。10か月分のインフレも成長も乗っていない。109名という人数は、Revelio Labs が2026年3月時点で推計した従業員数264名に対して約4割に相当する。 この動きの観点は、NVIDIA の買い物の対象がシリコンからソフトウェアとモデルの層へ移動している点にある。 Enfabrica でネットワーク、Groq で推論シリコン、そして Poolside で学習スタックとオープンウェイトモデル。GPU を売る会社が、GPU の上で動くものを自ら押さえに来ている。オープンウェイト陣営で中国系ラボが優位に立つ構図に対し、西側の対抗軸を自社の内部に確保する狙いも読める。一方で、120億ドルの評価額を付けられ140億ドル規模のインフラ構想を掲げた企業が、1年経たずにIPのライセンスアウトと人材の4割流出という結末に至った事実は、フロンティアモデルを自前で追う独立系ラボの資本効率について冷徹な材料を提供している。 NVIDIA $NVDA の公式開示と、Poolside に残る事業がどのような形で継続するかを注視したい。
もっと見る