登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 AI4Science
AI4Science コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
AI4Science を含む検索結果
🔬 最上位のAIエージェントでも、科学計算コードの修復タスクは約1/3が1時間以内に解けないという結果が出ました。 タイトル: ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments URL: 🧩 概要 AItonomy・Qwen・PhAI-Labsが、天体物理・海洋モデリングなど27の科学コードベースを、AIエージェントが学習できる実行可能な環境へ変換するインフラ「ScienceIDE」を構築しました。64環境・2,812タスクを整備しています。 ⚙️ 解決する課題 科学コードには数十年分の専門知識が詰まっていますが、断片化したツールチェーンや文書化されていない数値慣習のせいで、信頼できる学習経験に変換するのが困難でした。 🛠 方法論と提案手法 数値許容誤差や保存量を比較する「科学的チェック」でタスクの正当性を検証し、修復・実装など7分類のタスクを生成。強化学習では予算切り捨てへの不当なペナルティを防ぐ「切り捨てマスキング」という工夫も導入しています。 📊 実験結果 1時間予算でのエージェント比較ではFable 5.1が67.1%で最高、Astraが63.1%。ScienceIDEの経験で学習したPhAI-IDEモデルは科学コード修復タスクで最大+33.33ポイント、強化学習ではLAPSタスクの報酬が2.4倍に向上しました。 #AIエージェント# #AI4Science#
もっと見る
🔬 「AIは科学を“発見”できるのか?」を、本物のNature論文90本で厳しく測ったら、最強エージェントでもSOTA超えは2割弱でした。 タイトル: NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers? URL: 📋 概要 Nature系ジャーナル由来の90タスク(6ドメイン)で、AIコーディングエージェントが既発表SOTAを再現・超越できるかを検証。元手法を遮断する「情報ファイアウォール」と、タスクごとにコンテナ化する自動環境NatureGymで、統一条件・Web検索禁止の厳密評価を実現しています。 🎯 解決する課題 これまでのエージェント研究ベンチは環境がバラバラで信頼性に欠けていました。本研究は「再現」ではなく「自力発見」を強制し、横断比較できる土俵を整えます。 📐 方法論 SOTA正規化の相対ギャップで採点(g>0.1で超越、g≥0で同等以上)。81種の指標を横断比較し、4時間予算・GPU割当・10エージェントを3ハーネスで評価します。 📊 実験結果 ・最強のClaude Opus 4.7でもSOTA超えは17.8%、同等以上は47.8% ・成功の45.5%は「科学課題を教師あり予測に翻訳しただけ」。真のドメイン推論はわずか8.3% ・失敗の主因は手法選択ミス45.1%と計算資源不足24.4%で、タスク誤解はわずか3.1% ・学際課題ほど成績が落ちる傾向 現状のエージェントは「翻訳」は得意でも「発見」は苦手、という冷静な現在地が見えて示唆に富みます。 #AI4Science# #CodingAgents#
もっと見る