登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 CodingAgents
CodingAgents コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
CodingAgents を含む検索結果
🔬 「AIは科学を“発見”できるのか?」を、本物のNature論文90本で厳しく測ったら、最強エージェントでもSOTA超えは2割弱でした。 タイトル: NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers? URL: 📋 概要 Nature系ジャーナル由来の90タスク(6ドメイン)で、AIコーディングエージェントが既発表SOTAを再現・超越できるかを検証。元手法を遮断する「情報ファイアウォール」と、タスクごとにコンテナ化する自動環境NatureGymで、統一条件・Web検索禁止の厳密評価を実現しています。 🎯 解決する課題 これまでのエージェント研究ベンチは環境がバラバラで信頼性に欠けていました。本研究は「再現」ではなく「自力発見」を強制し、横断比較できる土俵を整えます。 📐 方法論 SOTA正規化の相対ギャップで採点(g>0.1で超越、g≥0で同等以上)。81種の指標を横断比較し、4時間予算・GPU割当・10エージェントを3ハーネスで評価します。 📊 実験結果 ・最強のClaude Opus 4.7でもSOTA超えは17.8%、同等以上は47.8% ・成功の45.5%は「科学課題を教師あり予測に翻訳しただけ」。真のドメイン推論はわずか8.3% ・失敗の主因は手法選択ミス45.1%と計算資源不足24.4%で、タスク誤解はわずか3.1% ・学際課題ほど成績が落ちる傾向 現状のエージェントは「翻訳」は得意でも「発見」は苦手、という冷静な現在地が見えて示唆に富みます。 #AI4Science# #CodingAgents#
もっと見る
🧵 初日に伝えた「内部DB IDを絶対に出さない」というルール、60メッセージ後の新機能実装でエージェントに覚えていてもらえますか? タイトル: Coding Agents Don't Need Longer History — They Need Intent Continuity URL: コンテキストウィンドウを広げても検索(RAG)を強化しても解決しない、という指摘から始まる記事です。必要なのは「過去のどの意図が今も有効か」を検証する仕組みだと著者は説きます。 注目ポイント①🔍 意図の継続性という新しい軸 RAGは「何が関連するか」に答え、長いコンテキストは容量問題に対処しますが、どちらも「その情報が今も正しいか」には答えません。復元・検証・適用の3段階を分けたのがこの記事のキモです。 注目ポイント②⚙️ 上書き検出という検証メカニズム 同じ対象で値が食い違う古いルールと新しいルールがあれば、時系列で新しい方が有効になり、スコープが違えば両方残す。この検証層こそが、検索よりも重い仕事をしていると著者は言います。 注目ポイント③📊 数字で語る効果 70件の合成会話で検証した結果、キーワード検索の再現率は0.57で8タスク中4つしか合格しませんでしたが、提案手法は再現率1.00・違反ゼロで8タスク全合格。トークンコストは約28%増にとどまりました。 長期プロジェクトでのエージェント運用に効く、地味だけれど本質的な視点だと思います。 #AIエージェント# #コーディングエージェント#
もっと見る
コーディングエージェントに「コード専用の検索エンジン」を持たせる、という発想のAPIが公開されました。一般的な検索と違い、公式ドキュメントだけを対象にしているのがポイントです。 タイトル: Context7 Search: A Grounding API for Coding Agents URL: 📝 概要 1回のGETリクエストで質問を送るだけで、Context7が適切なライブラリを自動選択し最適なコード片を返す新しいSearch APIです。 ❗ 解決する課題 一般的な検索エンジンはコード検索時に古い情報や不正確な情報が混ざりやすく、従来のContext7も1ライブラリずつしか検索できない制約がありました。 ⚙️ 方法論 公式ドキュメント・製品サイト・APIリファレンスなど一次情報源のみを対象にし、インデックス化前にマルウェアやプロンプトインジェクションをスキャン。各結果にライブラリIDとソースURLを付与して出典を明示します。 🔧 ユースケース 「Next.jsのルートハンドラーからOpenAIレスポンスをストリーミングするには?」のような1つの質問で、複数ライブラリのコード片をまとめて取得可能。IDEプラグインやコードレビューボットへの組み込みも想定されています。 💰 料金 Freeプランは月1,000コールまで、Proプランはユーザーあたり月5,000コールまで、それ以降は1,000コールあたり10ドルです。 #AIエージェント# #開発者ツール#
もっと見る
💰 同じモデルなのに、包むソフトウェア(ハーネス)を変えるだけでコストが5倍変わる。でも成功率はほぼ同じ。そんな結果が出ました。 タイトル: HarnessTax: How Much Does the Harness Matter for Coding Agents? URL: UC BerkeleyとArenaが、Claude Code・Codex CLI・Piという3つのコーディングエージェント用ハーネスを、7モデル・21のモデル-ハーネスペアで比較しました。注目ポイントを3つ紹介します。 📊 成功率への影響は統計的にほぼゼロ モデル内でのハーネス比較42件のうち、統計的に有意だったのはわずか1件(偶然の水準は約2件)。多重比較補正後は有意な差は1件も残りませんでした。 💸 コストは同じ成功率で最大5倍差 GPT-5.6 Lunaでは、Claude Codeが1タスク0.15ドル・成功率55.6%、Piが0.03ドル・成功率53.3%と、成功率はほぼ同じでもコストは5倍違いました。 🪶 最小構成のオープンソースハーネスPiが十分強い 12件のモデル比較のうち9件で、ベンダー製ではないハーネスが最高の成功率を記録し、シンプルなハーネスでも十分戦えることが示されました。 派手な機能より、まずコストと信頼性を見るべきという実用的な結論だと思います。 #コーディングエージェント# #LLMコスト最適化#
もっと見る
コーディングエージェントの「ハーネス」って、計画機能もツール設計も文脈管理も、実はモデルの強さ次第で最適解が真逆になるんです。176通りの実験でそれを丁寧に検証した論文です。 タイトル: An Empirical Study of Harness Design for Coding Agents URL: 🧠 注目ポイント1: 文脈管理は資源が少ないほど効く 32kトークンのウィンドウでは、文脈管理ありと管理なしでSWE-Benchの成功率差が35.7ポイントにも達しました。しかも複雑なリコール機構はほぼ使われず、精度にも寄与しないことが判明しています。 📋 注目ポイント2: 計画機能の効果はモデルの強さで真逆になる 弱いモデル(30B)は計画を与えると成功率が+11.6ポイント向上しました。編集を試さず終了してしまう割合も69%から28%に激減しています。逆に強いモデル(550B)は計画なしでも十分で、計画を入れるとコストが約30%下がりました。 🔧 注目ポイント3: ツール設計もモデル・タスク次第 弱いモデルは専用ツール一式が必要ですが、強いモデルはbashコマンドだけの方が高性能かつ低コストになるケースが目立ちました。同じモデルでもタスクの種類によって最適解が逆転することもあります。 自分たちのモデルとタスクに合わせて、ハーネスの各要素を個別にチューニングする発想が大事だと実感しました。 #コーディングエージェント# #LLM#
もっと見る
TL;DR: Issueやコミット履歴を使わず「ソースコードそのもの」だけから、コーディングエージェント用のRL訓練タスクを5,545件も自動生成するパイプラインが登場しました。しかも量より質を優先した設計です。 タイトル: CodeMidas: Scaling Agentic Coding RL Environments from Code Itself URL: ポイント 🏗️ 3,185リポジトリ・23言語・15ドメインから5,545タスクを自動構築 🧪 リファレンス実装を実行して期待値を記録する「実行に基づくテスト」で検証器を自動生成 🛡️ リーク検査・解答一致確認・難易度フィルタの3段構えで環境の質を保証 📈 DeepSWEで+11.7pt、ProgramBenchで+17.0pt、Terminal-Benchで+8.5ptと大幅改善 🔍 フィルタ済み5kタスクがフィルタなし8kタスクを一貫して上回り「質が量に勝る」ことを実証 🧠 訓練後は探索・自己検証の頻度が増加し、外部ベンチマークにもその挙動が転移 開発履歴がなくても、コードさえあればRL訓練環境を作れるという発想がシンプルで実用的だと感じました。 #CodingAgent# #強化学習#
もっと見る
TL;DR: 同じ Claude Opus でも、ハーネスなしは20分で$9の失敗、ハーネスありは6時間で$200のプロダクト。この差を体系的に教えるオープンソースカリキュラムです。 learn-harness-engineering 「モデルは賢い。ハーネスが信頼性を作る」——このリポジトリはAIコーディングエージェント向けのハーネス工学を14レクチャー・8プロジェクトで学ぶ教材です(⭐️ 13.7k)。 ポイント 🔧 5つのサブシステムがハーネスの骨格 ・Instructions: AGENTS.md など構造化ガイダンスでリポジトリを真実源に ・State: claude-progress.md とgit履歴でマルチセッション継続性を確保 ・Verification: テスト・lint・E2Eで「完了したふり」を防ぐ ・Scope: 明示的な完了基準で1フィーチャーずつ確実に進める ・Session Lifecycle: init → 実装 → 検証 → コミット → ハンドオフの構造的フロー 📚 段階的なカリキュラム設計 基礎(問題の直視・構造化)から発展(ループ自動化・グラフ設計・Human-in-the-Loop)まで段階的に構成。共有の Electron アプリを題材に、コードを通じてハーネスを習得します。 ⚡ すぐ既存プロジェクトに適用できる AGENTS.md・ の3ファイルをテンプレートからコピーするだけで即座に効果が出る設計。 🌐 最新のフロンティア設計も収録 Pi・Claude Code・Codex・DeepSeek の実際のハーネス設計の分析(2026年8月追加)、ループエンジニアリング・グラフエンジニアリング(2026年7月追加)と、現場の最新実践を継続的に反映しています。 エージェントを「プロンプトで動かす」から「ハーネスで信頼させる」へ、という発想の転換を13.7kのエンジニアが支持しています。 #CodingAgent# #AIエンジニアリング#
もっと見る