登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 CodingAgent
CodingAgent コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
CodingAgent を含む検索結果
TL;DR: Issueやコミット履歴を使わず「ソースコードそのもの」だけから、コーディングエージェント用のRL訓練タスクを5,545件も自動生成するパイプラインが登場しました。しかも量より質を優先した設計です。 タイトル: CodeMidas: Scaling Agentic Coding RL Environments from Code Itself URL: ポイント 🏗️ 3,185リポジトリ・23言語・15ドメインから5,545タスクを自動構築 🧪 リファレンス実装を実行して期待値を記録する「実行に基づくテスト」で検証器を自動生成 🛡️ リーク検査・解答一致確認・難易度フィルタの3段構えで環境の質を保証 📈 DeepSWEで+11.7pt、ProgramBenchで+17.0pt、Terminal-Benchで+8.5ptと大幅改善 🔍 フィルタ済み5kタスクがフィルタなし8kタスクを一貫して上回り「質が量に勝る」ことを実証 🧠 訓練後は探索・自己検証の頻度が増加し、外部ベンチマークにもその挙動が転移 開発履歴がなくても、コードさえあればRL訓練環境を作れるという発想がシンプルで実用的だと感じました。 #CodingAgent# #強化学習#
もっと見る
TL;DR: 同じ Claude Opus でも、ハーネスなしは20分で$9の失敗、ハーネスありは6時間で$200のプロダクト。この差を体系的に教えるオープンソースカリキュラムです。 learn-harness-engineering 「モデルは賢い。ハーネスが信頼性を作る」——このリポジトリはAIコーディングエージェント向けのハーネス工学を14レクチャー・8プロジェクトで学ぶ教材です(⭐️ 13.7k)。 ポイント 🔧 5つのサブシステムがハーネスの骨格 ・Instructions: AGENTS.md など構造化ガイダンスでリポジトリを真実源に ・State: claude-progress.md とgit履歴でマルチセッション継続性を確保 ・Verification: テスト・lint・E2Eで「完了したふり」を防ぐ ・Scope: 明示的な完了基準で1フィーチャーずつ確実に進める ・Session Lifecycle: init → 実装 → 検証 → コミット → ハンドオフの構造的フロー 📚 段階的なカリキュラム設計 基礎(問題の直視・構造化)から発展(ループ自動化・グラフ設計・Human-in-the-Loop)まで段階的に構成。共有の Electron アプリを題材に、コードを通じてハーネスを習得します。 ⚡ すぐ既存プロジェクトに適用できる AGENTS.md・ の3ファイルをテンプレートからコピーするだけで即座に効果が出る設計。 🌐 最新のフロンティア設計も収録 Pi・Claude Code・Codex・DeepSeek の実際のハーネス設計の分析(2026年8月追加)、ループエンジニアリング・グラフエンジニアリング(2026年7月追加)と、現場の最新実践を継続的に反映しています。 エージェントを「プロンプトで動かす」から「ハーネスで信頼させる」へ、という発想の転換を13.7kのエンジニアが支持しています。 #CodingAgent# #AIエンジニアリング#
もっと見る
🔬 「AIは科学を“発見”できるのか?」を、本物のNature論文90本で厳しく測ったら、最強エージェントでもSOTA超えは2割弱でした。 タイトル: NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers? URL: 📋 概要 Nature系ジャーナル由来の90タスク(6ドメイン)で、AIコーディングエージェントが既発表SOTAを再現・超越できるかを検証。元手法を遮断する「情報ファイアウォール」と、タスクごとにコンテナ化する自動環境NatureGymで、統一条件・Web検索禁止の厳密評価を実現しています。 🎯 解決する課題 これまでのエージェント研究ベンチは環境がバラバラで信頼性に欠けていました。本研究は「再現」ではなく「自力発見」を強制し、横断比較できる土俵を整えます。 📐 方法論 SOTA正規化の相対ギャップで採点(g>0.1で超越、g≥0で同等以上)。81種の指標を横断比較し、4時間予算・GPU割当・10エージェントを3ハーネスで評価します。 📊 実験結果 ・最強のClaude Opus 4.7でもSOTA超えは17.8%、同等以上は47.8% ・成功の45.5%は「科学課題を教師あり予測に翻訳しただけ」。真のドメイン推論はわずか8.3% ・失敗の主因は手法選択ミス45.1%と計算資源不足24.4%で、タスク誤解はわずか3.1% ・学際課題ほど成績が落ちる傾向 現状のエージェントは「翻訳」は得意でも「発見」は苦手、という冷静な現在地が見えて示唆に富みます。 #AI4Science# #CodingAgents#
もっと見る
Waku 可能是 Linux 上最好的 coding agent GUI 了
便利だけど知られていないGemini APIの機能 💻 コーディングエージェントをGeminiで構築したい。何から始めればいい? Geminiの「コーディングエージェントのセットアップ(Coding agent setup)」は、コード生成・修正タスクを自動化するエージェント向けのスキルとセットアップガイドです。 📌 タイトル:コーディングエージェントのセットアップ(Coding agent setup) 🔗 URL: 🧩 概要 コーディングエージェントとは、コードの生成、修正、テスト、デバッグを自律的に行うAIエージェントのこと。Geminiのコーディングエージェントガイドは、このようなエージェントを構築するためのスキル定義、プロンプト設計、ツール連携のベストプラクティスを提供します。Code executionやfunction callingと組み合わせて、実際にコードを書いて動かすエージェントを作れます。 🛠 使い方 ガイドに沿ってエージェントのスキル(コード生成、ファイル操作、テスト実行等)を定義し、Geminiのツール機能と連携します。Code executionでコードを実行し、function callingでファイルシステムやGit操作を呼び出す構成が基本です。プロンプトにはコーディング規約やリポジトリ構造の情報を含めると精度が上がります。 🏗 本番システムへの組み込み方 ・CI/CDパイプライン:PRごとにコーディングエージェントがレビュー・修正提案を自動生成。 ・バグ修正の自動化:エラーログとスタックトレースを渡して、修正パッチを自動生成・テスト。 ・コードマイグレーション:フレームワーク/言語バージョンの移行を、エージェントが段階的に実行。 ・ドキュメント生成:コードを読んでAPIドキュメントやREADMEを自動生成。 💡 ユースケース 🔧 自動バグ修正・パッチ生成 📝 PRの自動レビュー・修正提案 🔄 コードベースのマイグレーション 📚 コードからのドキュメント自動生成 ⚠️ 注意点 エージェントが生成するコードは必ずレビューとテストが必要です。本番コードへの自動マージは人間の承認ステップを挟みましょう。また、エージェントがファイルシステムにアクセスする場合のセキュリティ境界(サンドボックス化)も重要です。 ✨ コーディングの自動化は段階的に。まずはレビュー補助や定型的な修正から始めて、信頼性が確認できた範囲で権限を広げていくのがおすすめです。 #Gemini# #LLM#
もっと見る
なんかプロンプトはもう古い、これからは自律ループだ!みたいな話がありますが、これ、これまでCoding Agentに向き合ってきた人の一部が試行錯誤の末にたどり着いたやり方なので、それまでの積み重ねがないと事故りやすいやり方に見える、というのが現状の見解です
もっと見る
コーディングエージェントは1タスクで数十回もAPIを叩くので、誰にも気づかれず週に数千ドル溶かしてしまう——LangChainがこの「支出の予測不能性」を社内でどう潰したかの話です💸 鍵は予算管理をオブザーバビリティと同じ場所に統合することでした。 タイトル: How LangChain Made Coding Agent Spend Predictable URL: 💸 概要 LangSmithに統合した「LLM Gateway」で、全社のモデル支出を分単位で俯瞰し、予算を中央集権的に管理する仕組みです。外付けプロキシではなく、既存のトレース・評価・ユーザー管理と同じ基盤の上に乗せた点が特徴です。 ❓ 解決する課題 モデル利用が一部チームから全社に拡大し、プレミアムモデルの値上げも重なってコストが急増。 ・コーディングエージェントは1タスクで数十回のAPI呼び出しを発生させます ・個々の開発者が気づかぬうちに週数千ドルを使い、月末まで誰も気づけませんでした 💡 方法論と提案手法 予算を多階層で設定できます。 ・組織/ワークスペース/ユーザー/APIキーの単位で上限を設定 ・月次・週次・日次・時間単位の既定ウィンドウを全従業員に適用し、高負荷プロジェクトには例外を許可 ・Claude Code・Codex・LangChain Deep Agents経由のエージェントをカバー ・MDMで配布し各自のセットアップを不要に ・実行はトレースされユーザーとAPIキーに紐づき、超過時は該当トレースを評価データで診断できます 🌍 ユースケース チーム単位で上限を設定しつつ、サプライズ請求の不安なくエージェント利用を許可できます。月末の請求ショックを、リアルタイム監視に置き換えるのが実用的な価値です。 📊 教訓と成果 ・モデル価格は静的な表ではすぐ陳腐化するため、キャッシュやティア差を含め動的に扱う必要がありました ・CursorやClaude DesktopはきれいにルーティングできずGateway捕捉分と提供側設定の差分を計測して補正 ・ハードリミットだけでは業務が止まるため、早期警告アラートと監査可能な増額申請に進化 ・社内展開以降、LLMコストは予算内に収まっています #コーディングエージェント# #LLMOps#
もっと見る