登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 AIハーネス
AIハーネス コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
AIハーネス を含む検索結果
TL;DR: 単一のエージェント・ハーネスではスケールしないという課題に対し、ハーネス自体を自動構築・進化させるオープンソースのマルチエージェント・エコシステム「Raven」が登場しました。 タイトル: Raven: The Harness of Harnesses for Composable Agentic Intelligence URL: ポイント 🧩 モデルとハーネスの組を「構成の単位」として扱い、Host Agentがタスクを分解して専門エージェントへDAG形式で割り当てる 🧠 EverOS(記憶)とSkill Forge(スキルの取得・再利用)で、過去の経験をタスク横断的に活用 🔬 誤り率が操作ごとに単純加算されるという「構成健全性定理」を証明し、XORタスクの具体例で組み合わせが個々のエージェントの能力を超えうることを実証 📊 新設ベンチマークMAOBの4指標すべてで1位。Exact Matchでは最強ベースライン比+10.4〜10.5ポイント改善 🛠️ Raven-Research/Code/Design/Oncallの各専門エージェントもベースラインを一貫して上回る 🔁 実行トレースから失敗を診断しハーネスを自己進化させる仕組みも、モデルを凍結したままドメイン横断で性能向上を確認 理論と実証の両輪でマルチエージェント構成の「なぜ効くのか」を示した点に意義を感じます。 #マルチエージェント# #AIハーネス#
もっと見る
半期ごとに某所から頂く定点観測アンケートにお答えしましたのでこちらでもシェアします。 ----- Q1. 投資の注力フェーズは? グロースバイアウト Q2. 起業家の“層の厚み”と“裾野の広がり”、1年前と比べてどうか? 層の厚みは変わらず、ブートストラップ勢が増加。シニア含む起業のカジュアル化により裾野は広がっている。 Q3. 注目しているセクター/トレンド 高市17分野。特に防衛、フィジカルAI、レアメタル、IP。経済安保 or ジャパンtoグローバルの領域。 Q4. いま日本のスタートアップを取り巻く環境で、一番「詰まっている」のはどこだと思いますか? シリーズC(及びそれに準ずるDやE)手前。 シードアーリーの期待値に沿ってPMFを済ませシリーズB後にGTM拡張が滞りキャズムに嵌った層が大量にリビングデッド化しつつある。創業8-12年あたり。セクターモメンタムが去りスモールIPOexitが消えるという環境変化の中に起業家の熱と才能がロックインされている。 Q5. その閉塞感を破る動きとして、注目している・またはご自身で仕掛けている打ち手はありますか? セクターモメンタムが去った上でも残っている本質的なアセットとケイパビリティを駆使して、新たなナラティブに転換するお手伝いをする起業家伴走を重ねています。新ナラティブに沿った施策の先行KPIを確認して、事業成長に適した買い手へのM&Aサポートやグロースバイアウトファンドとしての投資とバリューアップを行います。 Q6. その他、感じていること AIのハーネスレイヤーで従来型SIerに先行して市場シェアを獲得する国内プレイヤーが多数生まれることを期待しています。LayerXや燈等に続くB2B AI企業のクラスター化。
もっと見る
【Codex完全解説講座|ハーネス設計から、資料・LP・社内アプリ作成まで】 ■ お申し込み(アーカイブあり) 前回のClaude Codeハーネス入門講座に続き、今回はCodexです。Claude Codeもニーズが多いので、今後も講座を続けていきます。 どちらにも大事なのが「ハーネス=AIが仕事を進めるための環境設計」。 最新モデルが話題になる一方、自分の業務に合わせて環境を整え、細かな設定まで確認できている方は、まだ少ないと感じています。 ・指示ファイルに何を書き、どこに置くか ・繰り返す仕事をどうSkillsにするか ・ブラウザやMCPをどう使うか ・Hooksや権限をどう設定するか ・成果物をどう確認するか 毎回同じ説明をする。素材の場所を何度も伝える。完成と言われても、開くと使えない。 こうしたつまずきを減らし、自分の仕事で使える状態まで整える講座です。 ■ 当日やること Codexの主要機能と設定を解説し、資料・LP・社内アプリの制作を実演。みなさんも自分の業務から題材を1つ選び、手を動かします。 Claude Codeの指示やSkillsを引き継ぐ際の確認ポイントも扱います。 ■ 事前学習・参加特典 ・事前学習動画3本(合計約27分) ・指示ファイル・Skillのひな型、依頼文セットなど基本特典9点 ・「初めてのCodex 完全教科書【PDF版】」 PDF教科書は最新情報を反映し、講座終了後の当日中にお送りします! ■ 開催情報 ・10月3日(土)12:00〜14:00 ・オンライン(Zoom) ・本編・実習90分+質疑応答30分 ・早割は先着50名 当日参加できない方にも、期間限定アーカイブと全特典をご案内します。 Codexをまだ使いこなせていない方、設定を見直したい方、仕事で使える資料やアプリをつくりたい方。 ぜひ一緒に手を動かして、環境を整えましょう🔥
もっと見る
AIエージェントの性能はモデルだけで決まらない——ハーネスの設計次第で大きく変わります。 TL;DR JIT-Agentはタスクの特性に応じてエージェントハーネス(スキャフォールド)をジャストインタイムで自動生成・修復・進化させる専用モデルです。GLM-5.2で+7.7pt、DeepSeek-V4-Flashで+8.8ptの平均向上を達成し、9ベンチマーク中8つでGPT-5.6を含む全フロンティアモデルを上回りました。 タイトル: Scaling Harness Intelligence via Just-in-Time Harness Evolution URL: ポイント 🧩 ハーネスを「学習可能なアーティファクト」として定式化 メモリ・計画・アクション・能力オーケストレーションの4モジュールプロトコル h = (M, P, A, F) でハーネスを形式化。生成空間を制約しつつ13種類の既存ハーネスを全て表現できる設計です。 🎓 教師あり→修復→進化の3段階訓練 ステージIで教師生成ハーネスを学習、ステージIIで実行失敗時の修復を学習(最大2反復)、ステージIIIのEvo-GDPOでパレートフロンティアを前進させる新規ハーネスを進化的に探索します。 📊 精度向上とコスト削減を同時達成 xBench-DeepSearchでスコア78→82(+4pt)の一方、トークン消費は527K→212K(▲60%)、コストは$0.075→$0.039(▲48%)。9ベンチマーク平均で固定ハーネス比36%のトークン削減を実現しています。 ⚡ 複数モデルファミリーに転移可能 JIT生成ハーネスはDeepSeek V4(+10.2pt平均)、Mimo V2.5(+8.6pt)、Qwen 3.6(+4.0pt)でいずれもReActを上回り、ハーネス生成器を再訓練せずに転移できます。 🔄 ストリーミングモードで運用中も進化 デプロイ後もタスクシーケンスをまたいでハーネスを蓄積・更新する「オンライン進化」を実装。静的生成より全評価ベンチマークで上回ります。 ベースモデルのスケーリングと独立した「ハーネス知性」という新たなスケーリング軸の提案として注目です。 #AIエージェント# #LLMスケーリング#
もっと見る
AI コストを決める要素 1. LLM モデルの最適化 2. キャッシュ効率 3. 良いハーネス #oreilly_chomado_findy#
🤖 AIエージェントは、自分自身が動くための「実行基盤」を自分で作って改善できるのでしょうか。 タイトル: HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? URL: ❓ そもそも「ハーネス」とは何ですか 💡 実行ループ・ツール利用・コンテキスト管理・失敗からの復旧・検証など、エージェントを動かす実行基盤のことです。これまでの評価はハーネスを固定してモデル性能だけを測ってきましたが、実際はハーネスの設計品質も実力を大きく左右します。 ❓ LLMは最小限の材料からハーネスを作れますか 💡 わざと弱いシードハーネスから構築させたところ、最高スコアのOpus 4.8でも67.8点にとどまり、人間が作った参照実装(86.2点)には及びませんでした。特にリサーチ・検索領域でのギャップが最も大きかったです。 ❓ 自分でハーネスを改善(進化)させることはできますか 💡 5つのモデルすべてが可視フィードバック上では改善しましたが、隠されたタスクでの改善幅は大幅に縮小。バージョン切り替えの64回中、ノイズを超える明確な改善は2回だけでした。 ❓ 別の実行者モデルに載せ替えても性能は保たれますか 💡 保たれないケースが目立ちました。Opusが作ったハーネスは実行者をGeminiに固定した途端、SWE-Proスコアが69.3から33.0に急落。ハーネスは特定モデルの前提を埋め込んでしまうため、移植性には注意が必要です。 #AIエージェント# #LLM#
もっと見る
AIコーディングツールの指数関数的なコスト増をいかにコントロールしていくかについてのdatabricks記事。(一部引き算して読む感じ) ・AIコーディングツールは生産性を劇的に向上させる ・しかし、それに伴ってコストも指数関数的に増大している ・放置すれば、AIによる恩恵がコストで相殺される ・そのため、最高性能ではなく、コスパに優れた効率性フロンティアの追求が必要になっていく ・具体的な対策の筆頭は、より安価で効率的なモデルへの移行 ・特定のモデルへの依存を防ぐため、メタハーネスを導入して柔軟性を確保する ・また、タスクの難易度に応じて安価なモデルと高性能モデルを動的にルーティングする手法も有効 ・予算管理において、利用上限でアクセスを完全に遮断するのは悪手 ・これは、最も生産性の高い開発者の足を引っ張ってしまうため ・代わりにコストを可視化し、閾値を超えたら安価なモデルへダウンシフトさせる仕組みが望ましい ・さらに、不要なコンテキストを削ってトークン消費を抑えることも大事に ・また、プロンプトキャッシングを活用することで、コストを大幅に削減できる (で、Unity AI Gateway というプロダクトの宣伝になるので、以下は略)
もっと見る
個別ハーネスでサービス提供するか、プラットフォーム的で汎用でややカスタムできるサービス提供するか。とても悩ましい。 サービス提供者としては、継続的サービス改善のためのデータ蓄積、継続的サービス運営のための共通基盤的はマストかな。あとAIエージェントは、UIより顧客行動に想像が出来るかが大事
もっと見る
🧩 AIエージェントに足りないのはモデルの賢さではなく「現場のノウハウ」だった、という論文です。 タイトル: Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills URL: ❓ 自律型研究エージェントには何が欠けているのですか 💡 「モデル」と「実行ハーネス」の2層だけでは、適切な手法の選び方やAPIの使い方、実装の落とし穴といった運用知識が抜け落ちています。この論文はこれを第三の層として明示的に扱います。 ❓ その知識をどうやって手に入れるのですか 💡 GitHubリポジトリや論文を「Scope→Ground→Construct→Verify」の4段階で処理し、検証済みの「スキル」として蒸留します。1,000リポジトリと153論文から5,353個のスキルを構築しました。 ❓ スキルを使うと実際どれくらい変わるのですか 💡 同じGPT-5.5・同じハーネスのまま、スキルを追加するだけでMLE-benchは31.11%から72.89%へ、PaperBench・FrontierCS・PassNetでも軒並み改善しました。高難度タスクでは4倍以上のスコア向上も見られます。 ❓ 単にリソースを増やしただけではないのですか 💡 トークン数やツール呼び出し回数と改善幅の相関はほぼゼロで、Claude Opus 4.8構成より少ないトークンで高いスコアを出しています。知識そのものが効いているといえます。 #AIエージェント# #機械学習#
もっと見る
🤔 「AIエージェントを作るのは難しくない。でも、本番で動かし続けるのは別の話だ。」──エージェント開発者なら、誰もがこの壁に当たったはずです。 Why Managed Agents Are the Next Big Thing in Agent Building 2022年末にLangChainが登場してから、エージェント開発は急速に進化してきました。初期のAutoGPTの熱狂から、LangGraphやGoogle ADKによる精緻なフレームワークの時代へ。そして2025年に入ると、モデルの能力が臨界点を超え、「ツールを呼び出しながら自律的にループするLLM」という基本形が現実のものとなりました。Claude Code、Deep Agentsといった専用ハーネスの登場は、その完成形への一歩でした。 🌊 しかし、ここで大きな問題が浮かび上がります。エージェントを本番環境で"動かし続ける"ためには、LLMの賢さだけでは足りないのです。信頼性のある実行環境をどう構築するか。失敗したエージェントをどう再開させるか。コードをどう安全に実行させるか。ユーザーへのUXをどう設計するか──開発者はモデルとは全く別の、インフラの泥沼と格闘してきました。 LangChainの創業者 Harrison Chase はこの1年間の学びを結晶化し、「マネージドエージェント」というコンセプトを提唱します。本番エージェントに必要なのは、ビジネスロジック・ハーネス・インフラの3層だと整理し、そのうちインフラ層をまるごと引き受けるのがManaged Deep Agentsです。ランタイム管理、イベントストリーミング、サンドボックス、メモリ、認証、評価ツール──かつては自前で構築するしかなかったすべてが、プラットフォームとして提供されます。Anthropicの「Claude Managed Agents」やVercelの「Eve」も同様の方向へ向かっており、エコシステム全体がインフラの民主化という潮流に入りつつあります。 エージェント開発者がビジネスロジックだけに集中できる時代が、ようやく到来しようとしています。 #AIエージェント# #LangChain#
もっと見る