登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 自己進化エージェント
自己進化エージェント コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
自己進化エージェント を含む検索結果
TL;DR 自分で問題を作り自分で答える自己進化型エージェントは、出題者と解答者が同じ間違いで「意気投合」してしまう「共食い」に陥ります。出典を分割して評価する手法でこれを防ぎ、性能を8ポイント以上改善しました。 タイトル: False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents URL: ポイント 🔁 出題者と解答者が同じ出典由来の誤りを共有し、偽の一致が報酬として循環する「共食い」を発見 📉 標準的なDr. Zeroでは偽の一致が6.1%・8.8%発生 ✂️ 出典を2つのフォールドに分割し、互いに相手側で学習した補助解答者が採点するCrossFitを提案 📊 CrossFit単独で偽の一致を3.0%・3.7%に、MSVと併用すると2.0%・1.7%まで削減 🚀 下流タスクの平均Cover-EMはDr. Zero比で8.8・8.4ポイント向上 🧩 マルチホップタスクほど改善幅が大きく、平均10ポイント以上の効果 💰 計算コストはベースラインの1.72〜2.7倍増加するが、半予算の変種でも効果を確認 評価者自身の学習履歴まで監査しないと、見かけの進歩に騙されるという指摘が印象的です。 #自己進化エージェント# #強化学習#
もっと見る
🧬 エージェントが自分自身を「安全に」進化させるには、プロトコルそのものを作り直す必要がある——MCPやA2Aに足りないピースを埋める自己進化プロトコルが登場しました。 タイトル: Autogenesis: A Self-Evolving Agent Protocol URL: 🧬 概要 Autogenesis Protocol(AGP)は、LLMエージェントが実行中に自分のプロンプト・ツール・方策などを動的に改善できるようにする自己進化プロトコルです。中心思想は「何が進化するか」と「どう進化するか」を分離することです。 ❓ 解決する課題 既存プロトコル(Anthropic MCP、Google A2A)は接続や呼び出しは標準化しますが、進化に不可欠な要素が欠けています。 ・リソースがエージェントのコードと密結合している ・進化ステップのバージョン管理やロールバックが無い ・場当たり的な修正で、厳密な制御ループを成す標準オペレータが無い 💡 方法論と提案手法 AGPは2層構造です。 ・RSPL:プロンプト・エージェント・ツール・環境・メモリの5種を、状態・ライフサイクル・バージョン管理されたインターフェースを持つ「登録リソース」として扱う ・SEPL:進化を型付きの合成可能オペレータで形式化し、すべての変更をRSPL経由でバージョン管理・可逆にする この上に構築したAGSは、Agent Bus上でサブエージェントを並行実行し、失敗の兆候があればReflect→Select→Improve→Evaluate→Commitのループで自己改善します。 🎯 ユースケース 長期計画や多様なツール利用を要するエージェント開発に有効です。改善の系譜が残りロールバックできるため、壊れやすいグルーコードを避けつつ安全に自己進化を運用できます。 📊 実験結果 ・科学・数学:弱いモデルほど効果大。gpt-4oはAIME25で+100%、gpt-4.1はAIME24で+71.38%。一方で飽和した強モデルは天井効果で伸び小 ・GAIA:Test 79.07%→89.04%(+12.61%)。難易度Lv3で+33.34%と難問ほど効果大 ・コード生成:C++は合格79→99、TLEエラー9→0、実行効率+46.4%。プロンプトと出力の同時進化が最良でした #AIエージェント# #自己進化#
もっと見る
🧭 「曖昧な目標だけを渡されたAIは、本当に自分で学び進化できるのか?」という問いに、ByteDance Seedらのチームが正面から挑んだベンチマークが登場しました。 タイトル: Aspire: Can Models Self-Evolve from Vague Goals? URL: このベンチマークでは、明確なタスク定義や報酬を与えず、モデル自身に目標の解釈から訓練・検証までを一気通貫で行わせ、隠された評価セットで実際の能力向上を測定します。 🎯 注目ポイント1: 曖昧さのコスト タスクを曖昧な表現に変えるだけで、Claude Opus 4.8は32.90%から27.07%、GPT-5.6は36.23%から29.58%へとスコアが低下しました。エージェントは何を最適化すべきかの見極めに時間を取られ、肝心の訓練時間が削られてしまいます。 🔁 注目ポイント2: 実行できても改善は続かない Qwen3.5-4B/9Bによる自己進化実験では、最終チェックポイントの多くが基盤モデルを下回り、24件中21件が安全機構によって初期状態にロールバックされました。狭い自己評価だけを頼りに訓練すると、局所的には良くなっても隠蔽評価では性能が退化してしまうのです。 🛠️ 注目ポイント3: ハーネス進化も基準を超えられない エージェント自身にエージェントの実行基盤(ハーネス)を作り直させる実験でも、最良の後継ハーネスでさえ参照実装のスコア28.64に対し27.22と一歩及ばず、検証の多様性不足や出力の完全性チェック漏れが原因として指摘されています。 💡 「何を改善するか」を自分で決める力こそが、持続的な自己改善に向けた次の大きな壁であることを、この研究は明確に示しています。 #LLMエージェント# #自己進化#
もっと見る
データエージェントが毎回スキーマを手探りでクエリし続ける問題、実は「証拠に基づいて自己進化するオントロジー」を1枚挟むだけで大きく改善できるようです。 タイトル: EvoOntology: A Self-Evolving Ontology Layer for Data Agents URL: 📝 概要 表・ファイル・DBなど異種データを扱うエージェント向けに、MCPサーバーとして実装した「自己進化するオントロジー層」EvoOntologyを提案しています。 ❗ 解決する課題 エージェントはデータ構造への事前知識がなく探索的クエリを繰り返す必要がありました。静的なセマンティックレイヤーは手動保守が必要で、実行履歴から適応できないという限界もありました。 ⚙️ 方法論 実際にプローブクエリで検証済みの候補だけをオントロジーに採用し、その後もエージェントの実行軌跡から介入候補を抽出して、元の状態とペアで検証した上で改善が見込める場合のみ更新する仕組みです。 📊 実験結果 DDR-Benchで6バックボーン平均+17.8ポイント改善、BIRDでも平均+8.6ポイント改善し先行研究を上回りました。しかも対話ターン数は14.6→8.4、トークン数も約20%削減されています。 🔬 ユースケース 静的セマンティックレイヤーがモデルによってはむしろ性能を下げる場面でも、EvoOntologyは一貫して改善しており、実運用のデータエージェント基盤に組み込みやすい設計です。 #データエージェント# #LLM#
もっと見る
TL;DR: 単一のエージェント・ハーネスではスケールしないという課題に対し、ハーネス自体を自動構築・進化させるオープンソースのマルチエージェント・エコシステム「Raven」が登場しました。 タイトル: Raven: The Harness of Harnesses for Composable Agentic Intelligence URL: ポイント 🧩 モデルとハーネスの組を「構成の単位」として扱い、Host Agentがタスクを分解して専門エージェントへDAG形式で割り当てる 🧠 EverOS(記憶)とSkill Forge(スキルの取得・再利用)で、過去の経験をタスク横断的に活用 🔬 誤り率が操作ごとに単純加算されるという「構成健全性定理」を証明し、XORタスクの具体例で組み合わせが個々のエージェントの能力を超えうることを実証 📊 新設ベンチマークMAOBの4指標すべてで1位。Exact Matchでは最強ベースライン比+10.4〜10.5ポイント改善 🛠️ Raven-Research/Code/Design/Oncallの各専門エージェントもベースラインを一貫して上回る 🔁 実行トレースから失敗を診断しハーネスを自己進化させる仕組みも、モデルを凍結したままドメイン横断で性能向上を確認 理論と実証の両輪でマルチエージェント構成の「なぜ効くのか」を示した点に意義を感じます。 #マルチエージェント# #AIハーネス#
もっと見る
🌐 強いAIエージェントを作る鍵は、実は「エージェントが動く環境の設計」かもしれません。環境エンジニアリングという視点を体系化した、全63ページのサーベイです。 タイトル: Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application URL: 📝 概要 LLMエージェントは単独でなく、相互作用する「環境」の中で動きます。本サーベイは、その環境そのものを工学的に設計・構築する「環境エンジニアリング」という観点から、研究の全体像を体系化しています。 ❓ 解決する課題 これまで「環境の作り方」は断片的に語られてきました。エージェント能力の向上が良い環境設計に大きく依存するにもかかわらず、それを統一的に整理する枠組みがなかったのです。 💡 方法論と提案手法 環境を開発ライフサイクルに沿って4つの柱で分類します。 ・環境モデリング:代表的な環境の特徴づけとコア能力の評価 ・環境合成:シンボリック合成とニューラル合成の2パラダイム ・環境評価:合成パラダイムに整合したドメイン固有の評価 ・環境応用:記憶中心・ワークフロー中心・軌跡中心・探索中心という、エージェントと環境の共進化4経路 🎯 ユースケース エージェント研究者が自分の取り組みを地図上に位置づけ、抜けている観点を見つける指針になります。環境合成・評価・自己進化の設計を考える際の出発点としても有用です。 📊 トレンドと展望 ・進化のアプローチを、ニューラル駆動・難易度駆動・スケーリング駆動の3系統で整理しています ・8つの属性と8つの応用ドメインを軸に分析しています ・今後の方向性として、Environment-as-a-Service、マルチエージェント、ニューラル・シンボリック統合を挙げています #AIエージェント# #LLM#
もっと見る
🔄 TL;DR: 検索インデックスが人手なしで自分の弱点を診断し、キーを書き換え、検証まで済ませて自律的に進化していく仕組みが登場しました。BRIGHTベンチマークで既存手法を大きく上回っています。 タイトル: Self-Evolving Search Index URL: ポイント 🩺 検索結果から共検索プロファイルを作り、文書がうまく区別できているかを人手のアノテーションなしで自己診断 ✍️ 問題のある文書だけキーセットを選択的に改訂、1文書あたり最大10キーまで自律的に決定 ✅ 忠実性・特異性・分離度の3基準で改訂案を自己検証し、合格したキーだけを反映 🔍 未カバーの検索需要を合成クエリで能動的に探索するQuery Simulatorも搭載 📈 BRIGHTでnDCG@10平均22.8、RL-Index比+9.2%、ベース比+40〜57%を達成 🤖 検索エージェントでも回答精度+77.87%、検索呼び出し回数は-16.80%と一石二鳥 インデックス最適化そのものを「自己進化」させるという発想の転換が面白いと思います。 #情報検索# #LLMエージェント#
もっと見る
エージェントに自分自身の「使い方」を進化させたら、賢くなったふりをしてただけだった…そんな過学習問題に切り込む論文です。 タイトル: RRSI: Regularized Recursive Self-Improvement of Agent Harnesses URL: ❓ ハーネスって何? プロンプトや制御フロー、ツール、メモリ管理など、LLM本体を取り巻く「使い方の設計」全体のことです。同じモデルでもハーネス次第で性能が大きく変わります。 ❓ なぜ自己改善させると過学習するの? 進化に使った評価タスクだけに合わせ込む・ノイズに過剰反応する・変更が際限なく複雑化する、という3つの失敗モードがあるからです。 💡 RRSIはどう解決するの? 古典的な機械学習の正則化(L0・L1・L2)をハーネス進化に応用。編集数に予算制約をかけ、ベンチマーク特化の変更案は選択段階で弾き、成果の出ないコンポーネントは枝刈りします。 💡 効果はどれくらい? 8ベンチマークで評価した結果、未知のタスクでも最大22.9%の性能向上を確認。しかもトークン使用量は30%削減されました。 自己改善するAIエージェントを実運用に近づける、地に足のついた一歩だと感じます。 #AIエージェント# #自己改善#
もっと見る
🧭 TL;DR: モデルが賢くなったのに、指示だけ旧モデル仕様のままだと逆に足を引っ張ります。OpenAIがGPT-6 Astra移行時のスキル・プロンプト見直し方をまとめました。 タイトル: Rethinking skills and prompts for GPT-6 Astra URL: 📌 ポイント 📝 スキルの説明は発動条件を絞って簡潔に書く 📂 複雑なスキルは最初から全文脈を読ませず段階的に開示する 🎯 過剰に具体的な指示はむしろ精度を下げることがある 📄 AGENTS.mdは一律の必読リストより文脈に応じた参照にする ⚖️ 旧モデル向けの行動制限がAstraでは過剰な自己制限になりうる 🛑 完了条件・探索範囲・停止条件を事前に明示しないと早く止まりがち モデルが進化したら指示はむしろ削る、という逆説的だけど実践的な学びが詰まっています。 #AIエージェント# #プロンプトエンジニアリング#
もっと見る
GPT-Astraとその次のモデルの圧倒的な性能が話題です。 OpenAIのカスタムチップ「Jalapeño」。その真の恐ろしさは、「AI自身がAIチップを設計・プログラミングする」自己進化のループにあります。ハードとソフトの常識を覆すパラダイムシフトを徹底解説しました。
もっと見る