登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 エージェント最適化
エージェント最適化 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
エージェント最適化 を含む検索結果
ハーネスを自動最適化する手法は増えていますが、どのシナリオで学習するかは最初に固定されたまま。この「カリキュラム」自体を動かす発想が登場です。 タイトル: ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization URL: 📝 概要 エージェントハーネスの自動最適化において、学習に使うシナリオの選択自体を「自動カリキュラム学習問題」として定式化し、最適化の進行とともに動的に適応させる手法ActiveSaddlerを提案しています。 ❗ 解決する課題 固定されたシナリオ順では、未解決の弱点を早々に見捨てたり、すでに修復済みの課題へロールアウトを浪費したりしてしまいます。既知の弱点を再訪する価値と新たな失敗を探索する価値のバランスも最適化中に変化しますが、静的なスケジュールでは対応できません。 🛠️ 方法論・提案手法 カリキュラム選択を「動的にインスタンス化されるアームを持つ非定常バンディット」としてモデル化。個々のシナリオではなく「失敗パターン」をアームとし、LLMベースの優先順位付け器が深刻度・修正可能性・波及範囲・副作用リスクの4要因から学習ポテンシャルを毎イテレーション再計算。既知の弱点を活用するか未見のシナリオを探索するかを、残存する実行可能な弱点の有無に応じて適応的に判断します。 📊 実験結果 GAIA2でPass@1が59.8%(固定ランダム順比+4.4ポイント)、Terminal-Bench 2.0で80.0%(+7.5ポイント)を達成。コスト効率も優れ、GAIA2では298ドルで他手法が1,360ドルかけて届く精度に到達しました。 #エージェント最適化# #カリキュラム学習#
もっと見る
# OpenAI Agent SDKの便利で実践的な使い方 🌍 handoff時に引き継ぐ履歴が長すぎたり、不要なツール呼び出し履歴が混ざっていませんか? Input filtersと推奨プロンプトで、引き継ぎ先エージェントに最適な入力を渡しましょう。 📌 タイトル:Handoffs – Input filters / Recommended prompts 🔗 URL: 🧩 概要 Handoff時のinput filterは、引き継ぎ先エージェントに渡す会話履歴を加工する仕組みです。`remove_all_tools`で前のエージェントのツール呼び出し履歴を除去したり、`nest_handoff_history`(beta)で複数handoffの履歴を要約メッセージに圧縮できます。また、`RECOMMENDED_PROMPT_PREFIX`を使うとLLMがhandoffの仕組みを正しく理解できます。 🛠 使い方 `Agent(name="faq", instructions="よくある質問に回答してください。シンプルに回答します。")` と `Agent(name="specialist", instructions="専門的な技術質問に回答してください。")` を定義します。トリアージエージェントは `Agent(name="triage", instructions=RECOMMENDED_PROMPT_PREFIX + "\n顧客の問い合わせを分類し、適切な担当に引き継いでください。", handoffs=[...])` として、FAQへのhandoffには `Handoff(agent=faq_agent, input_filter=handoff_filters.remove_all_tools, handoff_description="一般的なFAQへの回答")` でツール履歴を除去し、専門エージェントへのhandoffには `Handoff(agent=specialist_agent, input_filter=handoff_filters.nest_handoff_history, handoff_description="専門的な技術質問")` で履歴を圧縮します。`RECOMMENDED_PROMPT_PREFIX` は `agents.extensions.handoff_prompt` からインポートします。 🏗 実践的な使い方 **remove_all_toolsでクリーンな引き継ぎ** トリアージエージェントがDB検索やAPI呼び出しなど複数のツールを使った後にFAQエージェントに引き継ぐ場合、ツール呼び出しの履歴はFAQエージェントにとってノイズです。`remove_all_tools`を適用すると、ツール関連のメッセージがすべて除去され、引き継ぎ先エージェントがクリーンな会話履歴だけを受け取れます。トークン消費の削減にもなります。 **nest_handoff_history(beta)で履歴圧縮** A→B→Cと複数回handoffが発生する場合、履歴が膨大になります。`nest_handoff_history`は過去のhandoff履歴を1つの要約メッセージに圧縮し、最新のhandoff先エージェントに渡します。コンテキストウィンドウの効率的な利用に繋がります。 **RECOMMENDED_PROMPT_PREFIXの活用** `prompt_with_handoff_instructions()`または`RECOMMENDED_PROMPT_PREFIX`をエージェントの`instructions`に含めると、LLMがhandoffの仕組み(利用可能なhandoff先、いつhandoffすべきか)を正しく理解します。これがないと、handoffツールを呼ばずに自分で回答しようとする場合があります。 **カスタムフィルタの作成** 組み込みフィルタで足りない場合は、カスタムフィルタを作成できます。例えば「直近5メッセージだけ残す」「機密情報を含むメッセージを除去する」「特定のツール呼び出しだけ残す」など、ユースケースに合わせた加工が可能です。 💡 ユースケース 🧹 トリアージ後のFAQエージェントにツール履歴を渡さずクリーンな入力を提供 📦 多段handoffの履歴を圧縮してトークン消費を最適化 🤖 RECOMMENDED_PROMPT_PREFIXでhandoff判断の精度を向上 🔒 機密情報を含むメッセージを引き継ぎ前にフィルタリング ⚠️ 注意点 - `remove_all_tools`はすべてのツール関連メッセージを除去します。引き継ぎ先エージェントがツールの結果を参照する必要がある場合は使用しないでください。 - `nest_handoff_history`はbeta機能です。圧縮の挙動が将来変更される可能性があります。 - `RECOMMENDED_PROMPT_PREFIX`を使う場合、既存の`instructions`の先頭に追加してください。末尾に追加すると効果が薄れる場合があります。 - カスタムフィルタでメッセージの順序を変えたり、roleを変更したりすると、モデルの挙動が予測不能になります。メッセージの削除と追加に留めてください。 ✨ Input filtersでhandoff時の入力を最適化し、各エージェントが最高のパフォーマンスを発揮できるようにしましょう! #OpenAIAgentSDK# #AIAgent#
もっと見る
簡単なタスクに最上位モデルを使い続けて、コストが膨らんでいませんか。LangChainが自社のコーディングエージェントで実践したコスト削減策を公開しました。 タイトル: How to Build a Model Router in the Harness URL: コーディングエージェント「Open SWE」の月額費用急増に直面したLangChainが、ハーネス内にモデルルーターを組み込んでコストと品質を両立させた事例です。注目ポイントを3つ紹介します。 📊 タスク分析から始める設計 過去のトレースを分析すると、コード変更の22%が新機能、17%がバグ修正で、トークン消費量にも大きな幅がありました。この複雑さの多様性こそが、選択的なルーティングを有効にする土台になっています。 🎯 パレートフロンティア上の3モデル選定 コストと知能のバランスで、高速(GLM-5.3-Flash)・バランス(GPT-5.6 Sol)・高性能(GPT-6 Astra)の3ティアを選定。スレッド開始時に1回だけモデルを判定し、そのまま使い続けます。 💰 品質を落とさず64%のコスト削減 973スレッドのA/Bテストで、マージ率はルーター使用時29.2%、常に最上位モデル使用時27.3%とほぼ同等(p=0.49)でしたが、コスト中央値は2.61ドルから0.94ドルへ下がりました。 常に最安モデルだけを使うテストはわずか1日で中止されており、「ちょうど良い落としどころ」を探す価値が際立ちます。 #AIエージェント# #コスト最適化#
もっと見る
⚙️ TL;DR: モデルを変えずに「エージェントを動かすソフトウェア」だけを自動で改良して、トークンコストを約半分に削減しました。 タイトル: SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness URL: 📌 ポイント 🔍 約500の実行環境で150方向を探索し3,000回超の実行で効率化手法を発見 🧩 ファイル変更とテスト実行を1リクエストに統合する「Action Fusion」など4メカニズム 📉 EdgeBenchでトークン流量を49.0%、コストを33.2%削減(性能は93.7%維持) 🔄 追加学習なしでOpus 5に適用してもトークン44.7%・コスト33.5%削減を維持 💰 Terminal-Bench 4では解決タスク1件あたりのコストを11.6%削減 ⏱ Codex比で時間あたり8.75〜13.50ドルのコスト削減効果を推定 モデルではなくハーネス自体を自動探索で鍛えるという発想が、地味だけど実運用に直結する効率化だと思います。 #AIエージェント# #LLMコスト最適化#
もっと見る
# OpenAI Agent SDKの便利だけど知られていない機能 🌍 ユーザーの権限やプランに応じて、使えるツールを動的に切り替えたいと思いませんか? `is_enabled` パラメータを使えば、ツールの有効/無効を条件付きで制御し、コンテキストに応じたツールセットを提供できます。 📌 タイトル:ツールの条件付き有効化 🔗 URL: 🧩 概要 `as_tool()` の `is_enabled` パラメータに `True`/`False` のブール値、またはコンテキストとエージェントを受け取るコールバック関数 `(ctx, agent) -> bool` を渡すことで、ツールの有効/無効を動的に制御できます。無効化されたツールはモデルのツールリストに表示されず、トークン消費も発生しません。フィーチャーフラグや権限ベースのアクセス制御に最適です。 🛠 使い方 ```python from agents import Agent, function_tool, RunContextWrapper @function_tool def admin_tool(command: str) -> str: return execute_admin(command) @function_tool def basic_tool(query: str) -> str: return basic_search(query) # コールバックで動的判定 def is_admin(ctx: RunContextWrapper, agent: Agent) -> bool: return ctx.context.user_role == "admin" agent = Agent( name="assistant", tools=[ admin_tool.as_tool(is_enabled=is_admin), basic_tool, ], ) ``` 🏗 本番システムへの組み込み方 ・SaaSのプランに応じてプレミアム機能のツールを出し分ける ・ユーザーのロール(admin/member/viewer)でツールのアクセス権を制御する ・フィーチャーフラグと連携し、新機能のA/Bテストやカナリアリリースに活用する ・コンテキスト情報(リージョン、時間帯など)に基づいてツールセットを最適化する 💡 ユースケース 🔐 管理者のみが使える運用ツールの制御 💎 有料プランユーザー向け高機能ツールの出し分け 🚀 新機能のフィーチャーフラグ連動 🌏 リージョンごとに利用可能なサービスの切り替え ⚠️ 注意点 `is_enabled` が `False` の場合、ツールはモデルに提示されないため、モデルはそのツールの存在自体を知りません。セキュリティ上の制御としては有効ですが、ユーザーに「この機能は利用できません」と案内したい場合は、別途メッセージングの仕組みが必要です。 ✨ 条件付きツール有効化で、ユーザーごとに最適なエージェント体験を提供しましょう。 #OpenAIAgentSDK# #AIAgent#
もっと見る
💰 同じモデルなのに、包むソフトウェア(ハーネス)を変えるだけでコストが5倍変わる。でも成功率はほぼ同じ。そんな結果が出ました。 タイトル: HarnessTax: How Much Does the Harness Matter for Coding Agents? URL: UC BerkeleyとArenaが、Claude Code・Codex CLI・Piという3つのコーディングエージェント用ハーネスを、7モデル・21のモデル-ハーネスペアで比較しました。注目ポイントを3つ紹介します。 📊 成功率への影響は統計的にほぼゼロ モデル内でのハーネス比較42件のうち、統計的に有意だったのはわずか1件(偶然の水準は約2件)。多重比較補正後は有意な差は1件も残りませんでした。 💸 コストは同じ成功率で最大5倍差 GPT-5.6 Lunaでは、Claude Codeが1タスク0.15ドル・成功率55.6%、Piが0.03ドル・成功率53.3%と、成功率はほぼ同じでもコストは5倍違いました。 🪶 最小構成のオープンソースハーネスPiが十分強い 12件のモデル比較のうち9件で、ベンダー製ではないハーネスが最高の成功率を記録し、シンプルなハーネスでも十分戦えることが示されました。 派手な機能より、まずコストと信頼性を見るべきという実用的な結論だと思います。 #コーディングエージェント# #LLMコスト最適化#
もっと見る
AIエージェント経由の買い物にしたら、百円均一やスーパーマーケットで要らないもの買わないし、通信費、保険なども最低限に誰でも最適化出来そう 簡単にコスパの良い生き方は手に入りそうですね そこからは各自の生き方になるんでしょうけど まずは引き算が捗る
もっと見る
エージェントの本番運用で開発者を消耗させるのは、サンドボックスやセッション永続化といった「差別化にならない土台」でした🏗️ それをまるごと肩代わりするプラットフォームの登場です。 タイトル: The evolution of agentic surfaces: building with Claude Managed Agents URL: 🏗️ 概要 Claude Managed Agentsは、本番品質のAIエージェントを大規模にデプロイするためのAnthropicのプラットフォームです。最適化されたエージェントハーネスとホスト型インフラを組み合わせたコンポーザブルなAPIで、プロトタイプから本番への移行を素早く行えます。 ❓ 解決する課題 エージェントを本番運用するチームは、多くのインフラ課題に直面してきました。 ・サンドボックスのホスティングとスケーリング、中断をまたぐセッション永続化 ・認証情報の安全な管理、実行の隔離、包括的な可観測性 これらは製品の差別化に直結しないのに開発リソースを消費します。 💡 方法論とアーキテクチャ ・核心は、エージェントの推論エンジンとコード実行環境を分離すること ・セッションは追記専用のイベントログとして、コンテナとは独立にサーバー側で永続化されます ・この分離で、サンドボックス初期化と並行してClaudeがすぐ推論を開始でき、レイテンシを削減します ・3つのコアリソース:Agents(設定)、Environments(隔離実行コンテキスト)、Sessions(個々の実行) 🌍 主な機能 ・クレデンシャルボールト:トークンをサンドボックスと別にエンベロープ暗号化で保管 ・永続的なセッション:完全なイベント履歴の再構成で再開可能 ・柔軟なホスティング:Anthropic管理または自社VPC内のセルフホスト ・Memory & Dreaming:セッションログからパターンを抽出 ・タイムライン可視化とステップ単位のデバッグ #AIエージェント# #Claude#
もっと見る
エージェントの記憶は、アプリのコードを複雑にするのではなく設定を詰めることで効くようになる。Weaviateの実践ガイドです。 タイトル: Agent Memory with Engram: A Practical Guide URL: 会話データを投げて検索するだけの状態から、記憶の質とトークンコストを同時に最適化するところまで引き上げる手順が解説されています。 注目ポイントは3つあります。 📝 トピックの記述は「除外」で書く 記憶のカテゴリごとに書く説明文が、そのまま抽出プロンプトとして働きます。記憶してほしい例を列挙するより「イベントや一時的な状態は記録しない」といった除外ルールを1つ置くほうが、想定外のケースにもうまく汎化したと報告されています。出力の形を原子的な事実にするか散文にするかも、ここで明示します。 🔒 単数の事実はboundedで固定する boundedを設定すると1スコープあたり記憶が最大1件に制限され、累積ではなく更新されます。新規ユーザー5人での検証では、boundedなUserProfileが5回すべてでちょうど1件を保った一方、boundedでないUserKnowledgeは毎回2〜4件に揺れました。 💰 記憶の置き場所が課金額を決める 検索結果は毎ターン変わるため、システムプロンプトに貼るとキャッシュが毎回壊れて全体が課金されます。常時必要な記憶はセッション開始時に一度取得してシステムプロンプト直後へ、検索結果はユーザーメッセージの後ろへ置くのが正解です。25ターンの検証では、最終リクエスト約3,500トークンのうちキャッシュ未ヒットは約100トークンだけに収まりました。 記憶レイヤーを自前で書くか委ねるかを検討しているなら、判断材料としても読み応えがあります。 #AIエージェント# #メモリ管理#
もっと見る
AIエージェントをエンタープライズシステムに組み込むプラクティス 【スーパーバイザ / ルーター】 💡 全社AIに「何でも聞ける」を実現するカギは、裏側の賢い交通整理。安価な分類器がリクエストを最適なドメインエージェントへ瞬時に振り分けます。 🔥 解決する課題 - すべての機能を1つの巨大プロンプトに詰め込むと品質が劣化する - ドメインごとに最適化されたプロンプト・ツール・モデルを使い分けられない - 全リクエストを最高性能モデルで処理するとコストが破綻する - 分類不能なリクエストが迷子になる 🏗️ 提案パターン 安価で高速な小型分類器がユーザーの意図を判定し、営業・IT・人事・開発などの専門エージェントに委譲します。曖昧な入力には聞き返しで意図を確定させてから振り分けます。委譲先には権限上限・コスト上限・タイムアウトを引き継ぎ暴走を防止。分類不能な場合はデフォルトエージェントまたは人間へのフォールバック経路を必ず用意します。 ✅ 選定条件 - 向き:多様な業務をカバーする全社展開、複数のドメインエージェントが存在する環境 - 不向き:単一ドメインで完結するエージェント(ルーティング不要) ⚠️ 落とし穴 - ルーティング誤りのコストを過小評価しがち(小型モデルで複雑タスクを処理→品質劣化) - 分類精度を実測せず固定ルールだけに頼ると、業務変化に追従できない - フォールバック経路がないと、未知のリクエストが無限ループに陥る 🛠️ 実装方針 1. 意図分類にはファインチューニング済み軽量モデル(distilBERT等)またはルールベース分類器を使い、レイテンシとコストを最小化します 2. ルーティングテーブルを設定ファイル(YAML/JSON)で管理し、ドメインエージェントの追加・変更をコード変更なしで対応できるようにします 3. 分類不能時のフォールバック経路(デフォルトエージェントまたはSlack経由で人間へエスカレーション)を必ず実装します 4. 委譲先エージェントには権限上限・コスト上限・タイムアウトをパラメータとして引き継ぎ、OPA/Cedarでポリシーを一元管理します 5. 分類精度をA/Bテストと週次レポートで継続計測し、誤ルーティング率に応じて分類器を再学習します #AIエージェント# #エンタープライズアーキテクチャ#
もっと見る