登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 AgentHarness
AgentHarness コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
AgentHarness を含む検索結果
🤖 AIエージェントは、自分自身が動くための「実行基盤」を自分で作って改善できるのでしょうか。 タイトル: HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? URL: ❓ そもそも「ハーネス」とは何ですか 💡 実行ループ・ツール利用・コンテキスト管理・失敗からの復旧・検証など、エージェントを動かす実行基盤のことです。これまでの評価はハーネスを固定してモデル性能だけを測ってきましたが、実際はハーネスの設計品質も実力を大きく左右します。 ❓ LLMは最小限の材料からハーネスを作れますか 💡 わざと弱いシードハーネスから構築させたところ、最高スコアのOpus 4.8でも67.8点にとどまり、人間が作った参照実装(86.2点)には及びませんでした。特にリサーチ・検索領域でのギャップが最も大きかったです。 ❓ 自分でハーネスを改善(進化)させることはできますか 💡 5つのモデルすべてが可視フィードバック上では改善しましたが、隠されたタスクでの改善幅は大幅に縮小。バージョン切り替えの64回中、ノイズを超える明確な改善は2回だけでした。 ❓ 別の実行者モデルに載せ替えても性能は保たれますか 💡 保たれないケースが目立ちました。Opusが作ったハーネスは実行者をGeminiに固定した途端、SWE-Proスコアが69.3から33.0に急落。ハーネスは特定モデルの前提を埋め込んでしまうため、移植性には注意が必要です。 #AIエージェント# #LLM#
もっと見る