註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
加入 May 2026
270 正在關注    313 粉絲
🧭 「曖昧な目標だけを渡されたAIは、本当に自分で学び進化できるのか?」という問いに、ByteDance Seedらのチームが正面から挑んだベンチマークが登場しました。 タイトル: Aspire: Can Models Self-Evolve from Vague Goals? URL: このベンチマークでは、明確なタスク定義や報酬を与えず、モデル自身に目標の解釈から訓練・検証までを一気通貫で行わせ、隠された評価セットで実際の能力向上を測定します。 🎯 注目ポイント1: 曖昧さのコスト タスクを曖昧な表現に変えるだけで、Claude Opus 4.8は32.90%から27.07%、GPT-5.6は36.23%から29.58%へとスコアが低下しました。エージェントは何を最適化すべきかの見極めに時間を取られ、肝心の訓練時間が削られてしまいます。 🔁 注目ポイント2: 実行できても改善は続かない Qwen3.5-4B/9Bによる自己進化実験では、最終チェックポイントの多くが基盤モデルを下回り、24件中21件が安全機構によって初期状態にロールバックされました。狭い自己評価だけを頼りに訓練すると、局所的には良くなっても隠蔽評価では性能が退化してしまうのです。 🛠️ 注目ポイント3: ハーネス進化も基準を超えられない エージェント自身にエージェントの実行基盤(ハーネス)を作り直させる実験でも、最良の後継ハーネスでさえ参照実装のスコア28.64に対し27.22と一歩及ばず、検証の多様性不足や出力の完全性チェック漏れが原因として指摘されています。 💡 「何を改善するか」を自分で決める力こそが、持続的な自己改善に向けた次の大きな壁であることを、この研究は明確に示しています。 #LLMエージェント# #自己進化#
顯示更多