登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 自己改善
自己改善 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
自己改善 を含む検索結果
自己改善AIの仕組みって、分解するとけっこう地味な部品でできてる。 ・自分の挙動やコードを書き換える手段 ・変更が良くなったか測るベンチ ・良い版だけ残す選択ループ ・暴走を止めるサンドボックス ・人間のレビュー 「勝手に賢くなる」より、評価と選択の積み重ねに近い。
もっと見る
「AI競争の停止を求め、アンソロピック研究者が辞職」同僚も「人類絶滅リスク」に言及→自己改善型「超知能」の制御不能を警告、開発を急ぐ企業を「無責任」と批判 開発を進める側の研究者自身が、競争の危険性を訴えた点が重いです。
もっと見る
🧬 エージェントが自分自身を「安全に」進化させるには、プロトコルそのものを作り直す必要がある——MCPやA2Aに足りないピースを埋める自己進化プロトコルが登場しました。 タイトル: Autogenesis: A Self-Evolving Agent Protocol URL: 🧬 概要 Autogenesis Protocol(AGP)は、LLMエージェントが実行中に自分のプロンプト・ツール・方策などを動的に改善できるようにする自己進化プロトコルです。中心思想は「何が進化するか」と「どう進化するか」を分離することです。 ❓ 解決する課題 既存プロトコル(Anthropic MCP、Google A2A)は接続や呼び出しは標準化しますが、進化に不可欠な要素が欠けています。 ・リソースがエージェントのコードと密結合している ・進化ステップのバージョン管理やロールバックが無い ・場当たり的な修正で、厳密な制御ループを成す標準オペレータが無い 💡 方法論と提案手法 AGPは2層構造です。 ・RSPL:プロンプト・エージェント・ツール・環境・メモリの5種を、状態・ライフサイクル・バージョン管理されたインターフェースを持つ「登録リソース」として扱う ・SEPL:進化を型付きの合成可能オペレータで形式化し、すべての変更をRSPL経由でバージョン管理・可逆にする この上に構築したAGSは、Agent Bus上でサブエージェントを並行実行し、失敗の兆候があればReflect→Select→Improve→Evaluate→Commitのループで自己改善します。 🎯 ユースケース 長期計画や多様なツール利用を要するエージェント開発に有効です。改善の系譜が残りロールバックできるため、壊れやすいグルーコードを避けつつ安全に自己進化を運用できます。 📊 実験結果 ・科学・数学:弱いモデルほど効果大。gpt-4oはAIME25で+100%、gpt-4.1はAIME24で+71.38%。一方で飽和した強モデルは天井効果で伸び小 ・GAIA:Test 79.07%→89.04%(+12.61%)。難易度Lv3で+33.34%と難問ほど効果大 ・コード生成:C++は合格79→99、TLEエラー9→0、実行効率+46.4%。プロンプトと出力の同時進化が最良でした #AIエージェント# #自己進化#
もっと見る
🔬 AIがAI自身の研究をどんどん担うようになったら、私たちはそのシステムを本当に監視し続けられるのでしょうか。OpenAIはこの問いに、まだ「イエス」とは言えないと率直に認めています。 「再帰的自己改善(RSI)」——AIが後続世代のAIを作るための研究を自ら実施していくプロセスは、まだ完全な自律段階には至っていません。しかしOpenAIは、十分な注意なしにこのプロセスが進めば、人々が理解できないシステムを監視できなくなりかねないと警告します。だからこそ「安全に実施できると確認されるまでは追求すべきではない」と明言しているのです。 問題は、各国・各研究所がバラバラの基準でリスクを評価している現状では、比較も検証もままならないという点にあります。そこでOpenAIは、米国が主導する形で国際的な技術標準を作ることを提案します。オーストラリア・カナダ・フランス・ドイツ・インド・日本・ケニア・シンガポール・韓国・英国のAI安全研究所を、米国の「AI Standards and Innovation Center」を通じて連携させ、自己改善の進捗度や自律研究量、人間レビューの閾値、インシデントの分類方法まで、共通のものさしで測ろうという構想です。 標準を作るだけでは足りず、それが実際のリリース延期や条件付きアクセスといったガバナンス上の意思決定に結びついて初めて意味を持つ、という指摘も添えられています。 Building standards for the next phase of AI 技術の進歩そのものより、それを測る「ものさし」を国際的に揃えることの方が急がれている、という視点が印象的でした。 #AI安全性# #OpenAI#
もっと見る
エージェントに自分自身の「使い方」を進化させたら、賢くなったふりをしてただけだった…そんな過学習問題に切り込む論文です。 タイトル: RRSI: Regularized Recursive Self-Improvement of Agent Harnesses URL: ❓ ハーネスって何? プロンプトや制御フロー、ツール、メモリ管理など、LLM本体を取り巻く「使い方の設計」全体のことです。同じモデルでもハーネス次第で性能が大きく変わります。 ❓ なぜ自己改善させると過学習するの? 進化に使った評価タスクだけに合わせ込む・ノイズに過剰反応する・変更が際限なく複雑化する、という3つの失敗モードがあるからです。 💡 RRSIはどう解決するの? 古典的な機械学習の正則化(L0・L1・L2)をハーネス進化に応用。編集数に予算制約をかけ、ベンチマーク特化の変更案は選択段階で弾き、成果の出ないコンポーネントは枝刈りします。 💡 効果はどれくらい? 8ベンチマークで評価した結果、未知のタスクでも最大22.9%の性能向上を確認。しかもトークン使用量は30%削減されました。 自己改善するAIエージェントを実運用に近づける、地に足のついた一歩だと感じます。 #AIエージェント# #自己改善#
もっと見る
運用中のAIエージェントのやり取りそのものが、モデルを賢くする教師データになるという論文です。 NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness 🧩 概要 リクエストの難易度に応じて処理を振り分ける「ルーティング・ハーネス」の運用ログを、追加の合成データなしにそのまま学習データへ変換し、モデルを再帰的に改善する仕組みを提案しています。 ❓ 解決する課題 再帰的自己改善には「自分の能力を観測し学習に還元する仕組み」が必要ですが、多くの手法は別途データパイプラインを必要としていました。日々の運用ログにその材料が眠っている点に着目しています。 ⚙️ 方法論 実行トラジェクトリをユーザーターン単位で構造化し、6軸の意味評価と構造検証で品質管理。ルーティングスコアを難易度の目安として3段階カリキュラム学習とオンポリシー蒸留に活用し、評価結果をもとに苦手分野へ次の学習データを重点配分します。 📊 実験結果 10種のエージェント・コーディング・指示追従ベンチマークで、4Bモデルはマクロ平均58.94→64.87、9Bモデルは65.60→69.04まで向上。公開合成データ比でもマクロ平均+6.26ptという結果でした。 #AIエージェント# #自己改善#
もっと見る
AIエージェント時代のテスト駆動開発(TDD)の話 一年前のセッションなので、今聴くとせやな 従来のTDDは決定的な出力を前提にするが、AIは同じ入力でも出力がばらつくのでこの前提が崩れる ゆえに評価はpass/fail の二値をやめ、スコア・レーティング・満足度・挙動(推論・ツール選択・判断)で測る。 AI版SDLCは5段階 ①企画/spec(AIが本当に効く箇所を見極める) ②実験(小データで小さく検証) ③大規模eval(数百〜数千のテストで評価) ④リリース管理(AIとアプリのデプロイを分離) ⑤可観測性(本番のエッジケースをトレース) 肝はループ、テスト作成→eval→プロンプト/ロジック修正→リグレッション確認 1つ直すと別が壊れるのを検知する 魔法のように自己改善するエージェントは幻想。複雑なほど地道な可観測性が必要
もっと見る
🧠 AIのメモリは「ユーザーの好み」を覚えるもの、という常識を覆す発表です。Perplexityの新メモリ「Brain」は、エージェント自身が仕事のやり方を覚えて上達していきます。 📰 タイトル: Self-improving Memory for Agents 🔗 URL: 💡 概要 Perplexityが、AIエージェント向けの自己改善型メモリ「Brain」を発表しました。エージェント「Computer」が行った作業をコンテキストグラフとして蓄積し、一定間隔で見直すことで、使うほど賢く・安く・速くなる仕組みです。 🔍 解決する課題 従来のメモリはユーザーの好みを覚えることに偏り、エージェント自身の性能向上には使われていませんでした。人間の従業員のように「仕事をしながら学んで上達する」エージェントを実現することが狙いです。 🛠 方法論と提案手法 ・作業の結果や修正を追跡するコンテキストグラフを構築 ・アイデアやプロジェクトをまとめたLLM wikiをエージェントのサンドボックスに自動ロード ・セッションや外部連携の結果、ソース文書の変更を夜間にインクリメンタル統合 ・成功したやり方、失敗した試行、ユーザーの修正の3つから学習し過去のミスを回避 📊 ユースケース / 実験結果 ・既出タスクで回答の正確性が25%向上 ・リコールが16%改善 ・履歴的文脈を要するタスクでコストを13%削減 ・改善は使い続けるほど大きくなる 回答とソース取得の高速化、トークン浪費の削減、問題の予兆の先回り検知などに使えます。 #AIエージェント# #メモリ#
もっと見る
🧭 「曖昧な目標だけを渡されたAIは、本当に自分で学び進化できるのか?」という問いに、ByteDance Seedらのチームが正面から挑んだベンチマークが登場しました。 タイトル: Aspire: Can Models Self-Evolve from Vague Goals? URL: このベンチマークでは、明確なタスク定義や報酬を与えず、モデル自身に目標の解釈から訓練・検証までを一気通貫で行わせ、隠された評価セットで実際の能力向上を測定します。 🎯 注目ポイント1: 曖昧さのコスト タスクを曖昧な表現に変えるだけで、Claude Opus 4.8は32.90%から27.07%、GPT-5.6は36.23%から29.58%へとスコアが低下しました。エージェントは何を最適化すべきかの見極めに時間を取られ、肝心の訓練時間が削られてしまいます。 🔁 注目ポイント2: 実行できても改善は続かない Qwen3.5-4B/9Bによる自己進化実験では、最終チェックポイントの多くが基盤モデルを下回り、24件中21件が安全機構によって初期状態にロールバックされました。狭い自己評価だけを頼りに訓練すると、局所的には良くなっても隠蔽評価では性能が退化してしまうのです。 🛠️ 注目ポイント3: ハーネス進化も基準を超えられない エージェント自身にエージェントの実行基盤(ハーネス)を作り直させる実験でも、最良の後継ハーネスでさえ参照実装のスコア28.64に対し27.22と一歩及ばず、検証の多様性不足や出力の完全性チェック漏れが原因として指摘されています。 💡 「何を改善するか」を自分で決める力こそが、持続的な自己改善に向けた次の大きな壁であることを、この研究は明確に示しています。 #LLMエージェント# #自己進化#
もっと見る
Sakana AI CEOの David Ha(@hardmaru)が、Tim Romero 氏のポッドキャスト Disrupting Japan Podcast に出演しました。 日本におけるAIの未来は、米国や中国とは少し違った形を取り得るのか。Sakana AIの内側から何が見えているのか。そうしたテーマで、長めの対談を行っています。 Davidは、Sakana AI の事業展開戦略、メガバンクとの取り組みがPoCから本番運用へと進みつつある現状、巨大なフロンティアモデル一つに依存するよりも複数のモデルを束ねるオーケストレーションのほうが長期的には合理的であるという見方、そして実務における「AI主権」とはスタック全体を自前で所有することではなく、グローバルなサプライチェーンの中で、AIを国内で開発・適応・運用していく能力を確保することだと、Davidは語りました。 対話のなかでは、当社の研究成果やプロダクトにも多く触れました。Sakana Fuguは、強化学習で訓練したオーケストレーションモデルで、複数ステップのタスクを多様なLLMに振り分けます。Namazuは、日本の知識や価値観を反映するようにポストトレーニングを施した、オープンウェイトモデルのシリーズです。東京のRSI Labは、The AI Scientistから続く取り組みとして、再帰的自己改善とAIによる科学的発見を専門に扱う研究組織です。共同創業者のLlion Jonesは、Transformerそのものを超えるアーキテクチャの探求という、より長期的な目標を追い続けています。 最後に「日本について一つだけ変えられるとしたら」と問われたDavidの答えは、「希望(hope)」でした。 「皆が集団として希望を感じていることが必要だと思います。その希望こそが、物事を動かしていく。日本に希望をもたらすのは何でしょうか。お金でしょうか。減税でしょうか。社会保障の充実でしょうか。おそらく、そのどれでもないはずです。もし魔法の杖を一本持てるとしたら、日本の人々が未来をもっと楽観的に捉えられるようにしたい。希望によって変化が起こり、その変化がさらなる希望をもたらすのではないでしょうか。」 ⸻⸻⸻⸻⸻⸻ Our CEO David Ha joined Tim Romero on Disrupting Japan Podcast for a long conversation on how the future of AI may take a different shape in Japan than in the U.S. or China, and on what that looks like from inside Sakana AI. David walks through Sakana AI’s go-to-market strategy, how Japanese megabanks have moved real AI workflows from proof-of-concept into production, why orchestration across many models is likely to win out over a single massive frontier model, and what sovereign AI actually means in practice: not owning the entire stack, but having the capability to develop, adapt, and run AI domestically as part of a global supply chain. The conversation also covers the research directions behind the company. Sakana Fugu is our orchestration model, trained with reinforcement learning to route multi-step tasks across a variety of underlying LLMs. Namazu is our line of post-trained open-weight models tuned to reflect Japanese knowledge and values. The RSI Lab in Tokyo is dedicated to recursive self-improvement and AI-driven scientific discovery, continuing the work that began with The AI Scientist. And our co-founder Llion Jones keeps pushing on a longer-horizon goal of moving beyond the Transformer architecture itself. Asked at the end what one thing he would change about Japan, David’s answer was “hope.” “To really move the needle in terms of innovation, like the era in Japan when you have companies like Sony or Panasonic come out, there are a few factors. One is that the nation needs to have a collective sense of hope. A nation needs to feel hopeful. It could be poor. Everyone can be dirt poor, but they have hope. And that hope leads to things being done. So, what creates hope in Japan? Is it more money? Is it less taxes? Or is it more benefits? Probably not. I think it’s stories and narratives. If I have a magic wand, if the population in Japan is more optimistic about the future of this country, suddenly they’re persuaded, to be more optimistic. People should be optimistic. With optimism comes change. And change leads to more optimism.” Listen to the full episode: 🎏
もっと見る