가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
가입 May 2026
270 팔로잉 중    313
TL;DR: 長期エージェントの3大問題(誤差蓄積・コンテキスト腐敗・状態消失)を、Manager-Execute-Audit(MEA)ループで構造的に解決。WeaveBenchで51.8%→80.7%を達成しました。 LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks ポイント 🔧 Manager: 実行軌跡の外でタスク状態を明示管理。ゴール・受け入れ基準・制約を含む「サブタスクコントラクト」を生成する ⚡ Executor: 過去の軌跡を持ち込まない、バジェット有界の新鮮コンテキストで各サブタスクを実行する 🔍 Auditor: 実行後に読み取り専用で独立検査。完了・整合性・状態更新を3分類でレポートし、ラウンド間の永続メモリとして機能する 🖥️ GUI/CLIハイブリッド: Managerがタスクに応じてインターフェースを選択。AgentAdapterでClaude Code・Codex CLI等を差し替え可能 📊 WeaveBench: PassRate 51.8%→80.7%、Design+60pp・Spatial/3D+50ppの大幅改善 🤖 OSWorld 2.0: Qwen 3.7-Plusで2.8%→8.3%(3倍)、Claude Opus 4.7で20.6%→35.3% 💻 Terminal-Bench: 69.7%→77.2%、かつトークン消費24%減(オーバーヘッドなし) 💡 Manager cost: 総トークンのたった2〜8%。Auditorが19〜38%でほとんどの追加コストを担う 「エージェント能力はモデル単体でなく、モデル+ハーネス全体の性質」——この視点が長期エージェント設計の出発点になると思います。 #AIAgents# #LLM#
더 보기