登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 AIagents
AIagents コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
AIagents を含む検索結果
TL;DR: 長期エージェントの3大問題(誤差蓄積・コンテキスト腐敗・状態消失)を、Manager-Execute-Audit(MEA)ループで構造的に解決。WeaveBenchで51.8%→80.7%を達成しました。 LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks ポイント 🔧 Manager: 実行軌跡の外でタスク状態を明示管理。ゴール・受け入れ基準・制約を含む「サブタスクコントラクト」を生成する ⚡ Executor: 過去の軌跡を持ち込まない、バジェット有界の新鮮コンテキストで各サブタスクを実行する 🔍 Auditor: 実行後に読み取り専用で独立検査。完了・整合性・状態更新を3分類でレポートし、ラウンド間の永続メモリとして機能する 🖥️ GUI/CLIハイブリッド: Managerがタスクに応じてインターフェースを選択。AgentAdapterでClaude Code・Codex CLI等を差し替え可能 📊 WeaveBench: PassRate 51.8%→80.7%、Design+60pp・Spatial/3D+50ppの大幅改善 🤖 OSWorld 2.0: Qwen 3.7-Plusで2.8%→8.3%(3倍)、Claude Opus 4.7で20.6%→35.3% 💻 Terminal-Bench: 69.7%→77.2%、かつトークン消費24%減(オーバーヘッドなし) 💡 Manager cost: 総トークンのたった2〜8%。Auditorが19〜38%でほとんどの追加コストを担う 「エージェント能力はモデル単体でなく、モデル+ハーネス全体の性質」——この視点が長期エージェント設計の出発点になると思います。 #AIAgents# #LLM#
もっと見る
本番のAIエージェントが壊れたとき、何万件ものトレースを人手でさかのぼる時代は終わりを迎えつつあります。 🔍 エージェントが大規模に動き始めると、問題の見つけ方が根本から変わります。数行のログを追うのではなく、数千万件のトレースの中から異常の糸口を引き出す必要が生まれる。それを人の目でこなすのは、どう考えても持続しません。LangSmith Engineはそのギャップを埋めるために2025年5月にローンチし、以来6000万件超のトレースをスキャンして2万件以上の課題を検出し、数万時間分のエンジニアリング工数を節約してきました。 💡 今回のアップデートで、Engineの中核である課題検出能力が大きく前進しました。内部ベンチマークでissue検出精度が2倍以上、業界標準ベンチマークでissue修正精度が25%向上しています。Engineは証拠・インシデントタイムライン・根本原因分析を伴う診断を行い、プロンプトまたはコード変更の修正案と即デプロイ可能なPRを自動生成します。さらに修正後の再発監視まで担い、人が介在する部分を最小限に抑えます。 🏗️ 今回あわせて発表された新機能も実用性が高いです。エンタープライズ顧客は自社VPC内にEngineをデプロイするセルフホスト構成が選択可能になり、Slack通知でエンジニアへのアラートが届き、Linear連携でチケットが自動作成されます。コスト面ではスキャンするトレース数を絞るReduced Analysisモードが加わり、古い未対応issueを自動クローズするStale issue管理も整備されました。 ロードマップでは、既存データセットへの自動修正検証と、プロダクショントレースから評価データセットをEngine自身が生成する機能が控えています。「発見→修正→検証→監視」の閉ループが完成に近づいています。 New in LangSmith Engine: >2x better issue detection #LangSmith# #AIAgents#
もっと見る
TL;DR: エージェントが失敗するのはモデルの賢さ不足ではなく「実行を取り巻く仕組み」の欠陥。重みを触らず実行環境だけを鍛える「ハーネススケーリング」で、Terminal-Bench 2.1に95.3%・約$15で到達しました。 タイトル: StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling URL: ポイント 🧠 モデルではなくハーネスを拡張。再訓練なしで失敗から学習させる新パラダイム 📌 永続状態でエピソードをまたいで発見を保持 🎯 フェーズ局所の文脈で意思決定点に関連情報だけを提示 ✅ 検査付き遷移で事前条件を検証し連鎖失敗を防止 📖 回復可能ランブックで失敗を照会可能な知識として再利用 🕒 バージョン管理された手順で戦略を更新・ロールバック 💰 GPT-5.6が95.3%(445試行/全89タスク成功)、$574.68の実行を約$15に圧縮 失敗を毎回「実行可能な事前条件」に変え、信頼性を運用基盤から底上げする一本です。 #AIAgents# #TerminalBench#
もっと見る
大きなモデルの賢さを、小さなモデルへ「再訓練なし」で移せる——しかも推論のその場で。そんな新しい能力転移の研究です。 タイトル: AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses URL: ❓ 蒸留と何が違うの? 💡 蒸留はターゲットの重みを訓練で更新します。本研究は重みを一切いじらず、強いビルダーモデルが推論時の「足場(ハーネス)」を組んで弱いモデルの実行を助けます。能力を推論環境ごしに転移させる発想です。 ❓ 足場って具体的に何をするの? 💡 主に3つです。 ・不安定な推論を決定的なコードに置き換える ・問題の種類ごとに戦略を振り分けるルーティング ・回答を確実にパースする厳格なフォーマット強制 ❓ どれくらい効くの? 💡 心の理論ベンチ4種で、GPT-5.4-miniの精度が0.49から0.91へほぼ倍増。全11ビルダー設定がベースラインを超えました。弱いモデルほど伸びしろが大きく効く一方、すでに強いモデルには逆効果になることもあります。 ❓ 成否を分けるのは? 💡 検証データを大量に探ることではなく、ビルダー自身の推論品質でした。強いビルダーは「タスク能力のコンパイラ」として、一度の推論で構造を手続き化します。 #AIAgents# #TestTimeScaling#
もっと見る
# Hermes Agentの機能と実践的な使い方 🚀 「昨日の続きから」が一言で始められる。Hermes Agentのセッションは、すべての会話を自動で記録・再開・検索できる長期運用の土台です。 📌 タイトルと機能のURL タイトル: Sessions URL: 📝 概要 セッションは、CLI・Telegram・Discord・Slackなどあらゆる入口での会話を自動保存する仕組みです。完全なメッセージ履歴をSQLiteに永続化し、後から再開したり全文検索で過去のやり取りを掘り出したりできます。プラットフォームごとに文脈が分かれるため、「チャットごとに別の話題」を自然に保てます。 🔧 機能の説明 ・履歴は `~/.hermes/state.db`(SQLite、WAL モード)に保存され、メタデータ・全メッセージ・トークン数・FTS5 全文検索インデックスを管理します。 ・アクティブなコンテキストには現在の会話ウィンドウだけを読み込み、過去の全バイトは展開しません。画像は説明文に、音声は文字起こしに、文書は要約に変換して扱います。 ・最初のやり取りの後、バックグラウンドの補助モデルが3〜7語の説明的なタイトルを自動生成します(遅延なし)。 ・セッションはソースごとに決定論的なキーで識別され、DM・グループ・スレッドで形式が分かれます。 🛠 実践的な使い方 ・直近のCLIセッション再開: `hermes --continue`(または `-c`)。タイトル指定なら `hermes -c "project name"`、ID指定なら `hermes --resume `。 ・一覧・検索・管理: `hermes sessions list --limit 50 --source telegram` / `hermes sessions export backup.jsonl` / `hermes sessions prune --older-than 90 --yes` / `hermes sessions stats`。 ・手動命名: チャット内で `/title my project`、または `hermes sessions rename "new title"`。 ・エージェント自身も `session_search` ツールでFTS5検索を行い、「前にやった件」と言うと自動で過去会話を参照します。 ・`/handoff telegram` でCLIの会話を全文と共にメッセージング先へ引き継げます。 🎯 ユースケース ・昨日のリファクタ作業をそのまま再開し、中断前の文脈を引き継ぐ。 ・「あのとき何を決めたか」を全文検索で素早く参照する。 ・Telegram・Discordなど入口ごとに文脈を分離し、混線を防ぐ。 ・長期運用エージェントの作業履歴データベースとして活用する。 ⚠️ 注意点 ・自動タイトル付けはセッションごとに1回のみで、既にタイトルがあればスキップされます。 ・メディアのバイト列は再送されず、派生テキストやファイルパスのみが後続の文脈に残ります。 ・自動プルーニング(` ・スレッド非対応プラットフォームの共有ホームチャンネルでは、本来共有したいグループ会話の扱いが理想的でない場合があります。 #HermesAgent# #AIAgents#
もっと見る
# OpenCodeの機能と実践的な使い方 🤖 1つのAIに何でも任せる時代は終わり。OpenCodeのエージェント機能なら、計画役・調査役・レビュー役を役割ごとに分け、権限まで細かく絞って安全に協働させられます。 🏷️ タイトル: プライマリ/サブエージェント 🔗 URL: 📘 概要 OpenCodeのエージェントは、直接対話する「プライマリエージェント」と、それらから呼び出される専門の「サブエージェント」に分かれます。役割とツール権限を分離することで、安全かつ効率的にタスクを進められます。 ⚙️ 機能の説明 ・プライマリ: 全ツールにアクセスできる開発用の Build と、編集・bashが既定で「ask」に制限された計画用の Plan があります。`Tab` で切り替えます。 ・サブエージェント: 多段の調査向けの General、読み取り専用でコードベースを探索する Explore、外部ドキュメントや依存関係を調べる Scout が組み込みです。`@/general ...` のように `@` で明示的に呼び出せるほか、プライマリが自動で起動することもあります。 ・カスタム定義: `opencode.json` のJSON、または `.opencode/agents/*.md` のMarkdown(フロントマター)で独自エージェントを定義できます。主な項目は `description`(必須)、`mode`(`primary`/`subagent`/`all`)、`model`、`prompt`、`temperature`、`permission`(`allow`/`deny`/`ask`)、`steps`、`hidden` などです。 🛠️ 実践的な使い方 編集を禁止した「監査専用エージェント」を定義すれば、誤った変更を防ぎつつレビューだけ任せられます。Markdown定義のフロントマターで `mode: subagent`、`permission` の `edit: deny` と `bash: deny` を指定し、本文に「入力検証・認証不備・データ露出・脆弱な依存関係を中心にレビュー」と書くだけです。`permission` の `bash` はグロブで細かく制御できます。 `opencode agent create` を使えば、対話形式で配置場所・目的・権限を選びながらMarkdown定義を生成できます。 💡 ユースケース 大きな機能追加では、まず Explore で関連箇所を読み取り専用で調査させ、Plan で方針を固め、Build で実装し、最後に編集禁止のレビュー用エージェントで点検する、という分業が組めます。 ⚠️ 注意点 ・`permission` の既定はエージェントごとに異なります(Planは編集/bashが ask)。意図せぬ変更を避けるため明示設定が安全です。 ・`bash` 権限はグロブ指定可能で、`"rm *": "deny"` のように危険コマンドを個別に拒否できます。 ・サブエージェントを `@` メニューから隠したい場合は `hidden` を使います。 #OpenCode# #AIAgents#
もっと見る
🏗 一行の関数なら書けるAIも、「アプリ一式をゼロから作って」と言われると途端に崩れます。ファイルをまたいだ設計、噛み合うインターフェース、延々と続く不整合のデバッグ——これは個人技ではなく、チーム戦だからです。 そこで本研究は、AIエージェントに本物の開発チームを演じさせます。まず複数のArchitectが互いに異なる設計案(Software Design Sketch)を競って描き、CTO役が構造の妥当さやインターフェースの整合性を0〜8点で採点して最良案を選定。選ばれた設計は、ファイル所有者・公開API・依存関係・非循環性まで機械が検証できる「契約」へと正規化されます。 実装フェーズでは、Developerたちが依存関係の順に沿って自分の担当ファイルだけを、必要最小限の文脈で書いていきます。協調はGitで軽量に。各自がブランチにコミットする際、変更した公開シンボルや影響先を構造化メモに残すので、ファイル本文を共有せずともインターフェースの変更だけが伝播します。仕上げはQA役が依存レイヤーごとにテストを走らせ、失敗を担当者へ差し戻して直させる。まさに人間のチーム開発そのものです。 この CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation は、本物のpytestで検証するNL2Repo-Benchで平均42.3%のテスト通過率(SFT設定)を達成し、19リポジトリ中15でベースラインのCodeSに勝利しました。構造の良さが、実際に動くコードの正しさへとつながっている点が見どころです。 URL: #CodeGeneration# #AIAgents#
もっと見る
# Hermes Agentの機能と実践的な使い方 🚀 インストールから5分で「最初の会話」へ。ファイルを読ませ、コマンドを実行させ、Webを検索させる——エージェントの基本動作を実タスクで一気に体験できます。 📌 タイトルと機能のURL タイトル: Quickstart URL: 📝 概要 QuickstartはHermes Agentを起動して最初の対話を成立させるためのチュートリアルです。`hermes` または `hermes --tui` で起動し、リポジトリの調査やコマンド実行、Web検索といった基本能力を確かめます。最初に1つのきれいな会話を成功させることを最優先に据えた、堅実な入門ルートです。 🔧 機能の説明 ・起動はクラシックCLIの `hermes`、もしくはモーダルオーバーレイ付きの新しいTUI `hermes --tui` の2通りです(TUI推奨)。 ・初期設定ウィザードは `hermes setup`、モデル選択は対話式の `hermes model` で行います。 ・直近のセッションは `hermes --continue`(短縮形 `hermes -c`)で再開できます。 ・設定の不調は `hermes doctor` で診断します。 ・ファイル読み込み、ターミナルコマンド実行(承認を伴う)、Web検索(Tool Gateway経由)、マルチターン会話に対応します。 🛠 実践的な使い方 ・最初の依頼は検証しやすい具体タスクが効果的です。例:「このリポジトリを5つの箇条書きで要約して、メインのエントリポイントを教えて」。 ・「カレントディレクトリを調べて、プロジェクトの主要ファイルらしきものを教えて」のように、実ファイルを読ませる依頼でファイル読み込みを確認します。 ・「このコードベース向けにクリーンなGitHub PRワークフローを整えて」でコマンド実行と承認挙動を同時に体験できます。 ・対話中に `/` を入力するとスラッシュコマンドの補完メニューが出ます。`/help`(コマンド一覧)、`/tools`(利用可能ツール)、`/model`(モデル切替)、`/save`(会話保存)などが使えます。 🎯 ユースケース ・インストール直後に動作確認を兼ねて、リポジトリ要約やファイル調査を依頼する。 ・コマンド実行の承認フローを実タスクで体感し、エージェントに任せる範囲の感覚をつかむ。 ・スラッシュコマンドでモデルやツールを切り替えながら、自分の作業スタイルに慣らす。 ⚠️ 注意点 ・Hermes Agentは最低64,000トークンのコンテキストを持つモデルが必要です。小さすぎるモデルは選ばないでください。 ・まずは基本のチャットを確実に動かすことが推奨されています。ゲートウェイやスキル、自動化はその後に足しましょう。 ・コマンド実行はエージェントの承認を伴うため、初回は承認の挙動を意識して観察すると理解が早まります。 #HermesAgent# #AIAgents#
もっと見る
《AI Agents in Action》第2版已出:
グループチャットにAIをちょっと混ぜるだけで、人間同士の「暗黙の了解」の作られ方がガラッと変わるという実験結果です。 AI agents reshape consensus formation in human groups 24人の人間とAIエージェントが図形当てゲームを40ラウンド繰り返し、AIの比率を変えて「合意形成」がどう変わるかを検証した研究です。 🎯 注目ポイント1: 比率で合意の形が3段階に変化 AI比率12.5%では人間主導で合意が8%強まり、33〜50%では逆に合意が最大23%崩壊、75%では合意は回復するもののAI主導に転換します。少しの混在具合の違いが真逆の結果を生みます。 🎯 注目ポイント2: 合意の「中身」まで別物になる 人間主導の合意は「うさぎ」「座る」のような具体的・比喩的な表現が中心なのに対し、AI主導の合意では比喩表現がほぼ消滅(-93.8%)し、「三角形」「非対称」のような抽象的な語彙に置き換わります。 🎯 注目ポイント3: 納得していないのに従ってしまう AI比率75%では、人間は最終的な合意に強く収束しているのに満足度は低く、それでも集団の中心的な表現への同調圧力に押されて合意に従ってしまう傾向が確認されました。 説得や役職なしでも、AIが「ただそこにいる」だけで集団の規範の所有権が静かに移っていく様子がよくわかる研究だと感じました。 #AIエージェント# #人間AI協調#
もっと見る