登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 harness
harness コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
harness を含む検索結果
Recursive Language ModelとContinual Harnessをコアな概念として設計されているコーディングエージェント。
白浜さんがharness でLIVEやってるのは知ってました。会いに行くべきだった。後悔。
【9~11月/Webセミナー】Microsoft Copilot Studio徹底解説 Standard harnessとGitHub Copilot harnessの違いを開...
🗓 発売日:2026年7月2日(木)18:00 DARK OUTLINE HARNESS 黒は、隠す色ではない。 身体の輪郭を、より鮮明に浮かび上がらせる色。 胸元を走る一本一本のラインが、 肌の上に新しいシルエットを描いていく。 見せるためではなく、 気づかれるための輪郭。 DARK OUTLINE は、 身体そのものをデザインの一部へと変えるハーネスです。 🤵 @SASUKE_DARU 📷 packychong
もっと見る
ハーネスエンジニアリングのアンチパターン AP9. 健忘症のハーネス(The Amnesiac Harness) 🎯 ポイント 毎セッション同じ地雷を踏み、同じ説明をされ、同じ訂正を受ける。複利が効くべきところで単利すら積まれていません——競争優位の最大の源泉を捨てています。 ❗ 発生する課題 ハーネスがセッション間で知識を蓄積しないため、同じ学習コストを無限に再支払いし続けます。エージェントは毎回同じ試行錯誤を繰り返し、組織のハーネスは時間とともに賢くなりません。 🔍 メカニズムと症状 このアンチパターンが見過ごされやすいのは、個々のセッションは「うまくいっている」ように見えるからです。「ビルドにはフラグXが要る」と学んだセッションは成功しますが、次のセッションで同じ発見を一からやり直します。知識固定という地道な作業は後回しにされがちで、「今回は動いたからOK」で終わります。しかし、学習コストの再支払いは1回なら些細でも数十回重なると膨大な浪費です。複利が効くべきところで単利すら積まれない——これは競争優位の最大の源泉を捨てているのと同じです。症状としては、「また同じエラーか」という既視感、毎回同じ環境設定でつまずく、チームが同じ情報をエージェントに何度も教える、といった現象が見られます。 📋 シナリオ ・エージェントが「このプロジェクトではDockerが必要」と3回のセッションで3回学び直す。毎回5分のビルドエラーとデバッグが発生し、合計15分を浪費。 ・レガシーコードの「このモジュールは廃止予定、代わりにYを使え」という知識を、5人の開発者がそれぞれのセッションでエージェントに教え直す。 ・インシデント対応で「このサービスのログはCloudWatchではなくDatadogにある」をエージェントが毎回発見し直し、初動の5分を無駄にする。 🛡 回避方法 ・エージェントが試行錯誤で学んだ知識を永続指示ファイル(AGENTS.md等)に即座に書き出すフックを実装します ・「一時的な情報」と「不変の知識」を区別し、後者だけを永続化するガイドラインを定めます ・指示ファイルの定期的な棚卸しサイクルを設け、古くなった知識を削除します ・知識が複利で積み上がるべき資産であることを認識し、「発見した瞬間の固定」を習慣化してください #HarnessEngineering# #KnowledgeManagement#
もっと見る
エージェントに自分自身の「使い方」を進化させたら、賢くなったふりをしてただけだった…そんな過学習問題に切り込む論文です。 タイトル: RRSI: Regularized Recursive Self-Improvement of Agent Harnesses URL: ❓ ハーネスって何? プロンプトや制御フロー、ツール、メモリ管理など、LLM本体を取り巻く「使い方の設計」全体のことです。同じモデルでもハーネス次第で性能が大きく変わります。 ❓ なぜ自己改善させると過学習するの? 進化に使った評価タスクだけに合わせ込む・ノイズに過剰反応する・変更が際限なく複雑化する、という3つの失敗モードがあるからです。 💡 RRSIはどう解決するの? 古典的な機械学習の正則化(L0・L1・L2)をハーネス進化に応用。編集数に予算制約をかけ、ベンチマーク特化の変更案は選択段階で弾き、成果の出ないコンポーネントは枝刈りします。 💡 効果はどれくらい? 8ベンチマークで評価した結果、未知のタスクでも最大22.9%の性能向上を確認。しかもトークン使用量は30%削減されました。 自己改善するAIエージェントを実運用に近づける、地に足のついた一歩だと感じます。 #AIエージェント# #自己改善#
もっと見る
💰 同じモデルなのに、包むソフトウェア(ハーネス)を変えるだけでコストが5倍変わる。でも成功率はほぼ同じ。そんな結果が出ました。 タイトル: HarnessTax: How Much Does the Harness Matter for Coding Agents? URL: UC BerkeleyとArenaが、Claude Code・Codex CLI・Piという3つのコーディングエージェント用ハーネスを、7モデル・21のモデル-ハーネスペアで比較しました。注目ポイントを3つ紹介します。 📊 成功率への影響は統計的にほぼゼロ モデル内でのハーネス比較42件のうち、統計的に有意だったのはわずか1件(偶然の水準は約2件)。多重比較補正後は有意な差は1件も残りませんでした。 💸 コストは同じ成功率で最大5倍差 GPT-5.6 Lunaでは、Claude Codeが1タスク0.15ドル・成功率55.6%、Piが0.03ドル・成功率53.3%と、成功率はほぼ同じでもコストは5倍違いました。 🪶 最小構成のオープンソースハーネスPiが十分強い 12件のモデル比較のうち9件で、ベンダー製ではないハーネスが最高の成功率を記録し、シンプルなハーネスでも十分戦えることが示されました。 派手な機能より、まずコストと信頼性を見るべきという実用的な結論だと思います。 #コーディングエージェント# #LLMコスト最適化#
もっと見る
⚙️ TL;DR: モデルを変えずに「エージェントを動かすソフトウェア」だけを自動で改良して、トークンコストを約半分に削減しました。 タイトル: SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness URL: 📌 ポイント 🔍 約500の実行環境で150方向を探索し3,000回超の実行で効率化手法を発見 🧩 ファイル変更とテスト実行を1リクエストに統合する「Action Fusion」など4メカニズム 📉 EdgeBenchでトークン流量を49.0%、コストを33.2%削減(性能は93.7%維持) 🔄 追加学習なしでOpus 5に適用してもトークン44.7%・コスト33.5%削減を維持 💰 Terminal-Bench 4では解決タスク1件あたりのコストを11.6%削減 ⏱ Codex比で時間あたり8.75〜13.50ドルのコスト削減効果を推定 モデルではなくハーネス自体を自動探索で鍛えるという発想が、地味だけど実運用に直結する効率化だと思います。 #AIエージェント# #LLMコスト最適化#
もっと見る
学習に数日かかるレコメンドモデルの研究を、AIエージェントに自律的に回させたらどうなるかという論文です。 Auto-RecSys: Harnessing Autonomous Research Agents for Industry-Scale Recommender Systems ❓ なぜ既存の自律AI研究エージェントでは足りないのでしょうか 💡 既存システムは数分〜数時間で結果が出る小規模実験を前提にしていますが、産業用レコメンドモデルは1回の学習に数日かかり、設定も数千行に及びます。逐次試行が現実的でないため、複数のアイデアを分散サーバーで並行に走らせ、失敗からも復旧できる全く別の設計が必要になります。 ❓ どうやって並行実験と障害復旧を両立させているのでしょうか 💡 アイデアごとに独立した状態ファイルを持たせ、発案→実装→検証→学習→分析という工程を管理します。セッションが再起動しても、共有ストレージ上のグローバルレジストリと軌跡ログを読み直すことで、サーバーをまたいでシームレスに作業を再開できます。 ❓ 本当にシステムは「学習」していくのでしょうか 💡 実験の軌跡をモデル固有のプレイブックに蒸留し、失敗を「やってはいけないこと」として蓄積します。31回の反復のうち、1反復あたりの主要な修正回数は4.0件から0.5件まで減り、無修正で完了する反復の割合は83%に達しました。 ❓ 実際にどれくらい自律的に動けるのでしょうか 💡 970件連続のログエントリを人の介入なしで実行し、公開の失敗が続いた際には学習フローを自ら切り替えるといった適応も観察されています。 #AIエージェント# #機械学習#
もっと見る