登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 エージェントハーネス
エージェントハーネス コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
エージェントハーネス を含む検索結果
AIエージェントの性能はモデルだけで決まらない——ハーネスの設計次第で大きく変わります。 TL;DR JIT-Agentはタスクの特性に応じてエージェントハーネス(スキャフォールド)をジャストインタイムで自動生成・修復・進化させる専用モデルです。GLM-5.2で+7.7pt、DeepSeek-V4-Flashで+8.8ptの平均向上を達成し、9ベンチマーク中8つでGPT-5.6を含む全フロンティアモデルを上回りました。 タイトル: Scaling Harness Intelligence via Just-in-Time Harness Evolution URL: ポイント 🧩 ハーネスを「学習可能なアーティファクト」として定式化 メモリ・計画・アクション・能力オーケストレーションの4モジュールプロトコル h = (M, P, A, F) でハーネスを形式化。生成空間を制約しつつ13種類の既存ハーネスを全て表現できる設計です。 🎓 教師あり→修復→進化の3段階訓練 ステージIで教師生成ハーネスを学習、ステージIIで実行失敗時の修復を学習(最大2反復)、ステージIIIのEvo-GDPOでパレートフロンティアを前進させる新規ハーネスを進化的に探索します。 📊 精度向上とコスト削減を同時達成 xBench-DeepSearchでスコア78→82(+4pt)の一方、トークン消費は527K→212K(▲60%)、コストは$0.075→$0.039(▲48%)。9ベンチマーク平均で固定ハーネス比36%のトークン削減を実現しています。 ⚡ 複数モデルファミリーに転移可能 JIT生成ハーネスはDeepSeek V4(+10.2pt平均)、Mimo V2.5(+8.6pt)、Qwen 3.6(+4.0pt)でいずれもReActを上回り、ハーネス生成器を再訓練せずに転移できます。 🔄 ストリーミングモードで運用中も進化 デプロイ後もタスクシーケンスをまたいでハーネスを蓄積・更新する「オンライン進化」を実装。静的生成より全評価ベンチマークで上回ります。 ベースモデルのスケーリングと独立した「ハーネス知性」という新たなスケーリング軸の提案として注目です。 #AIエージェント# #LLMスケーリング#
もっと見る
TL;DR: 単一のエージェント・ハーネスではスケールしないという課題に対し、ハーネス自体を自動構築・進化させるオープンソースのマルチエージェント・エコシステム「Raven」が登場しました。 タイトル: Raven: The Harness of Harnesses for Composable Agentic Intelligence URL: ポイント 🧩 モデルとハーネスの組を「構成の単位」として扱い、Host Agentがタスクを分解して専門エージェントへDAG形式で割り当てる 🧠 EverOS(記憶)とSkill Forge(スキルの取得・再利用)で、過去の経験をタスク横断的に活用 🔬 誤り率が操作ごとに単純加算されるという「構成健全性定理」を証明し、XORタスクの具体例で組み合わせが個々のエージェントの能力を超えうることを実証 📊 新設ベンチマークMAOBの4指標すべてで1位。Exact Matchでは最強ベースライン比+10.4〜10.5ポイント改善 🛠️ Raven-Research/Code/Design/Oncallの各専門エージェントもベースラインを一貫して上回る 🔁 実行トレースから失敗を診断しハーネスを自己進化させる仕組みも、モデルを凍結したままドメイン横断で性能向上を確認 理論と実証の両輪でマルチエージェント構成の「なぜ効くのか」を示した点に意義を感じます。 #マルチエージェント# #AIハーネス#
もっと見る
エージェントの本番運用で開発者を消耗させるのは、サンドボックスやセッション永続化といった「差別化にならない土台」でした🏗️ それをまるごと肩代わりするプラットフォームの登場です。 タイトル: The evolution of agentic surfaces: building with Claude Managed Agents URL: 🏗️ 概要 Claude Managed Agentsは、本番品質のAIエージェントを大規模にデプロイするためのAnthropicのプラットフォームです。最適化されたエージェントハーネスとホスト型インフラを組み合わせたコンポーザブルなAPIで、プロトタイプから本番への移行を素早く行えます。 ❓ 解決する課題 エージェントを本番運用するチームは、多くのインフラ課題に直面してきました。 ・サンドボックスのホスティングとスケーリング、中断をまたぐセッション永続化 ・認証情報の安全な管理、実行の隔離、包括的な可観測性 これらは製品の差別化に直結しないのに開発リソースを消費します。 💡 方法論とアーキテクチャ ・核心は、エージェントの推論エンジンとコード実行環境を分離すること ・セッションは追記専用のイベントログとして、コンテナとは独立にサーバー側で永続化されます ・この分離で、サンドボックス初期化と並行してClaudeがすぐ推論を開始でき、レイテンシを削減します ・3つのコアリソース:Agents(設定)、Environments(隔離実行コンテキスト)、Sessions(個々の実行) 🌍 主な機能 ・クレデンシャルボールト:トークンをサンドボックスと別にエンベロープ暗号化で保管 ・永続的なセッション:完全なイベント履歴の再構成で再開可能 ・柔軟なホスティング:Anthropic管理または自社VPC内のセルフホスト ・Memory & Dreaming:セッションログからパターンを抽出 ・タイムライン可視化とステップ単位のデバッグ #AIエージェント# #Claude#
もっと見る
ハーネスを自動最適化する手法は増えていますが、どのシナリオで学習するかは最初に固定されたまま。この「カリキュラム」自体を動かす発想が登場です。 タイトル: ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization URL: 📝 概要 エージェントハーネスの自動最適化において、学習に使うシナリオの選択自体を「自動カリキュラム学習問題」として定式化し、最適化の進行とともに動的に適応させる手法ActiveSaddlerを提案しています。 ❗ 解決する課題 固定されたシナリオ順では、未解決の弱点を早々に見捨てたり、すでに修復済みの課題へロールアウトを浪費したりしてしまいます。既知の弱点を再訪する価値と新たな失敗を探索する価値のバランスも最適化中に変化しますが、静的なスケジュールでは対応できません。 🛠️ 方法論・提案手法 カリキュラム選択を「動的にインスタンス化されるアームを持つ非定常バンディット」としてモデル化。個々のシナリオではなく「失敗パターン」をアームとし、LLMベースの優先順位付け器が深刻度・修正可能性・波及範囲・副作用リスクの4要因から学習ポテンシャルを毎イテレーション再計算。既知の弱点を活用するか未見のシナリオを探索するかを、残存する実行可能な弱点の有無に応じて適応的に判断します。 📊 実験結果 GAIA2でPass@1が59.8%(固定ランダム順比+4.4ポイント)、Terminal-Bench 2.0で80.0%(+7.5ポイント)を達成。コスト効率も優れ、GAIA2では298ドルで他手法が1,360ドルかけて届く精度に到達しました。 #エージェント最適化# #カリキュラム学習#
もっと見る
# Antigravityの機能と実践的な使い方 🚀 たった1回の API 呼び出しで、コードを書き・実行し・Web を見るエージェントを起動できたら。SDK と Managed Agents はそれを現実にします。 📌 タイトルと機能のURL タイトル: SDK / Managed Agents URL: 📝 概要 Antigravity SDK は、Google 製品を支えるものと同じエージェントハーネスへプログラムからアクセスする手段です。Managed Agents は Gemini API の一機能として提供され、1回の API 呼び出しで隔離された Linux サンドボックス上にエージェントを立ち上げ、推論・ツール呼び出し・コード実行を行わせます。 🔧 機能の説明 SDK と Managed Agents は、エージェントを「組み込み可能な部品」として扱えるようにします。 ・隔離実行環境: 各インタラクションは専用サンドボックスを生成し、その中でコードが安全に実行されます ・ステートフルな永続環境: 生成された環境はファイルや状態を保持したまま、後続の呼び出しで再開でき、マルチターンの作業を初期化なしで継続できます ・カスタムエージェント定義: Markdown ファイルで挙動を記述し、Google AI Studio Playground のテンプレートから素早く始められます ・基盤モデルは並列実行に最適化された Gemini 3.5 Flash で、Interactions API や AI Studio と統合されます 🛠 実践的な使い方 ・Managed Agents は Gemini API 経由で呼び出し、1コールでエージェント環境を起動します ・SDK を使えば独自のエージェント挙動を定義し、自分たちのインフラ上にホストできます ・AI Studio Playground のカスタムエージェントテンプレートを土台に、用途に合わせて拡張します ・前回の環境を再開して、ファイルや作業状態を引き継いだまま処理を続けます 🎯 ユースケース ・1コールで隔離サンドボックスのエージェントを起動し、デプロイ自動化エージェントを構築する ・コード実行・ファイル操作・Web 閲覧を伴うバックエンド処理を、社内ツールに組み込む ・ステートフル環境を活かし、複数ターンにわたる調査やビルド作業を継続実行する ・SDK で定義したエージェントを自社インフラにホストし、運用要件に合わせて配置する ⚠️ 注意点 ・Managed Agents は Gemini API のサーフェスであり、利用には API キーと課金有効なプロジェクトが前提です ・各インタラクションが環境を生成するため、サンドボックスのライフサイクルとコストを意識した設計が必要です ・コード実行・Web 閲覧を伴う以上、権限と入力の検証を怠らないでください #Antigravity# #Agents#
もっと見る
# Antigravityの機能と実践的な使い方 🚀 ブラウザもIDEも開かず、ターミナルだけでエージェントに開発を任せたい。そんな願いに応えるのが Antigravity CLI(agy)です。 📌 タイトルと機能のURL タイトル: Antigravity CLI URL: 📝 概要 Antigravity CLI は、Antigravity 2.0 と同じエージェントハーネスをコマンドラインから利用できる軽量サーフェスです。GUI を立ち上げずに新しいエージェントを即座に作成でき、SSH 越しのリモートサーバーやコンテナ内でも高速に動作します。コマンドは agy で呼び出します。 🔧 機能の説明 agy は IDE 版と同じ中核を共有しつつ、ターミナルに特化した拡張性を備えています。 ・AGENTS.md をリポジトリ直下に置くことで、プロジェクト共通の指示をエージェントへ読み込ませます(従来の .gemini/ 規約を置き換える新しい仕組みです) ・Agent Skills は ~/.gemini/antigravity-cli/skills/ のグローバルスコープと .agents/skills/ のワークスペーススコープから読み込まれます ・Hooks はツール実行の前後やループ停止条件などのライフサイクルに割り込み、整形や検査を自動化します ・MCP サーバーはローカルプロセス・リモートホストの双方を設定でき、外部データやツールへ接続します ・Subagents や Plugins も第一級の拡張要素として扱われます 🛠 実践的な使い方 ・インストールは macOS/Linux なら curl -fsSL | bash、Windows は PowerShell から実行します ・初回は agy を起動し、Google アカウントまたは GCP プロジェクトで認証します ・agy inspect を実行すると、読み込み中の AGENTS.md・スキル・プラグイン・フック・接続済み MCP サーバーが一覧表示され、想定通りの文脈が入っているか確認できます ・/goal で自律実行、/grill-me で着手前の質問、/schedule で定期実行、/browser でブラウザ機能を明示的に有効化できます 🎯 ユースケース ・SSH やリモート環境で IDE を立てられない場面で、ターミナルから直接エージェントを走らせる ・agy inspect で「なぜスキルが効かないのか」「どの MCP が読み込まれたか」を切り分けてデバッグする ・CI コンテナ内で軽量にエージェント処理を起動する ・AGENTS.md とチーム共通スキルを組み合わせ、リポジトリごとの作法を統一する ⚠️ 注意点 ・既定モデルは Gemini 3.5 Flash(High)で、プレビュー期間の無料枠は寛大ですが、本番ワークロードには課金有効な GCP プロジェクトが必要です ・スキルやフックが効かないときは、まず agy inspect で実際の読み込み状態を確認してから設定を疑うのが定石です ・グローバルスコープとワークスペーススコープでスキルの探索先が異なる点に注意してください #Antigravity# #DevTools#
もっと見る
コーディングエージェントの「ハーネス」って、計画機能もツール設計も文脈管理も、実はモデルの強さ次第で最適解が真逆になるんです。176通りの実験でそれを丁寧に検証した論文です。 タイトル: An Empirical Study of Harness Design for Coding Agents URL: 🧠 注目ポイント1: 文脈管理は資源が少ないほど効く 32kトークンのウィンドウでは、文脈管理ありと管理なしでSWE-Benchの成功率差が35.7ポイントにも達しました。しかも複雑なリコール機構はほぼ使われず、精度にも寄与しないことが判明しています。 📋 注目ポイント2: 計画機能の効果はモデルの強さで真逆になる 弱いモデル(30B)は計画を与えると成功率が+11.6ポイント向上しました。編集を試さず終了してしまう割合も69%から28%に激減しています。逆に強いモデル(550B)は計画なしでも十分で、計画を入れるとコストが約30%下がりました。 🔧 注目ポイント3: ツール設計もモデル・タスク次第 弱いモデルは専用ツール一式が必要ですが、強いモデルはbashコマンドだけの方が高性能かつ低コストになるケースが目立ちました。同じモデルでもタスクの種類によって最適解が逆転することもあります。 自分たちのモデルとタスクに合わせて、ハーネスの各要素を個別にチューニングする発想が大事だと実感しました。 #コーディングエージェント# #LLM#
もっと見る
💰 同じモデルなのに、包むソフトウェア(ハーネス)を変えるだけでコストが5倍変わる。でも成功率はほぼ同じ。そんな結果が出ました。 タイトル: HarnessTax: How Much Does the Harness Matter for Coding Agents? URL: UC BerkeleyとArenaが、Claude Code・Codex CLI・Piという3つのコーディングエージェント用ハーネスを、7モデル・21のモデル-ハーネスペアで比較しました。注目ポイントを3つ紹介します。 📊 成功率への影響は統計的にほぼゼロ モデル内でのハーネス比較42件のうち、統計的に有意だったのはわずか1件(偶然の水準は約2件)。多重比較補正後は有意な差は1件も残りませんでした。 💸 コストは同じ成功率で最大5倍差 GPT-5.6 Lunaでは、Claude Codeが1タスク0.15ドル・成功率55.6%、Piが0.03ドル・成功率53.3%と、成功率はほぼ同じでもコストは5倍違いました。 🪶 最小構成のオープンソースハーネスPiが十分強い 12件のモデル比較のうち9件で、ベンダー製ではないハーネスが最高の成功率を記録し、シンプルなハーネスでも十分戦えることが示されました。 派手な機能より、まずコストと信頼性を見るべきという実用的な結論だと思います。 #コーディングエージェント# #LLMコスト最適化#
もっと見る
🧩 「外側は裁量、内側は決定論」。プロンプトだけで手順を守らせると脆い——という課題を、Skillsと埋め込み型インタプリタを統合し、実行可能なコードで解くアプローチです。 タイトル: Building workflows for agents with Skills and Interpreter URL: 📝 概要 本記事は、再利用可能な振る舞いパッケージ「Skills」と、エージェントのハーネスと並んで動く埋め込み型TypeScriptランタイム「Interpreter」を統合したInterpreter Skillsを解説します。SKILL.mdが「いつ使うか」を、index.tsが「どう実行するか」を担い、エージェントは適用判断と入力だけを決め、モジュールが決定論的な実行を担います。 ❓ 解決する課題 エージェントは裁量的な判断は得意でも、決定論的な手順の遂行は苦手です。プロンプトだけの手順遵守は脆く、ステップを飛ばしたり順序を入れ替えたりします。300以上の項目を処理するような複雑な多段ルーチンでは、コンテキストをまたいで一貫性を保たせると「コンテキスト不安」が生じていました。 💡 方法論と提案手法 ・Skillsは段階的開示を用い、コンパクトなスキル一覧を見て関連するものだけ詳細を読み、プロンプトから分離してバージョン管理・共有可能な単位にします ・Interpreterはデフォルトでアクセスが制限され、ファイルシステム・ネットワーク・ツール・サブエージェントは明示的に公開した分だけ使えます ・スキルモジュールはサブエージェントをコードからプログラム的に生成・管理し、モデル介在のステップでなくコードから複雑なタスクグラフを編成します ・パースやフィルタ、グルーピングといったローカル操作はTypeScriptコードで表し、ツール面を絞ってモデルが扱いやすくします 🎯 ユースケース GitHubのIssue・PR・ディスカッションを取得し、項目ごとにサブエージェントで要約を作り、別のサブエージェントで分類・クラスタリングするトリアージなど、状態の多い多段ワークフローに向きます。 📊 評価と意義 ・「概ね指示に従ったか」ではなく「期待した関数を呼んだか」という具体的な問いを立てられ、必要な手順が正しい入力で実行されたかを測定できます ・モデルは一度呼び出すだけで、モジュールがワークフロー全体を決定論的に編成し、コンパクトな構造化オブジェクトを返します ・モデルは戦略的制御を保ちつつ、重要な手順はレビュー可能・テスト可能なコードで実行され、エージェントの作業をバージョン管理・テスト・コードレビューといったソフトウェア工学の実践へ移行させます #AIエージェント# #DevTools#
もっと見る
ハーネスエンジニアリングの肝は、モデルを賢くすることじゃない。同じ失敗を二度とさせない構造を作ることだ。エージェント=モデル+ハーネス。モデルは凍った計算機として扱い、安全性も精度も外側の設計で担保する。賢さ待ちをやめた瞬間に、再現性が手に入る。
もっと見る