🔬 最上位のAIエージェントでも、科学計算コードの修復タスクは約1/3が1時間以内に解けないという結果が出ました。
タイトル: ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments
URL:
🧩 概要
AItonomy・Qwen・PhAI-Labsが、天体物理・海洋モデリングなど27の科学コードベースを、AIエージェントが学習できる実行可能な環境へ変換するインフラ「ScienceIDE」を構築しました。64環境・2,812タスクを整備しています。
⚙️ 解決する課題
科学コードには数十年分の専門知識が詰まっていますが、断片化したツールチェーンや文書化されていない数値慣習のせいで、信頼できる学習経験に変換するのが困難でした。
🛠 方法論と提案手法
数値許容誤差や保存量を比較する「科学的チェック」でタスクの正当性を検証し、修復・実装など7分類のタスクを生成。強化学習では予算切り捨てへの不当なペナルティを防ぐ「切り捨てマスキング」という工夫も導入しています。
📊 実験結果
1時間予算でのエージェント比較ではFable 5.1が67.1%で最高、Astraが63.1%。ScienceIDEの経験で学習したPhAI-IDEモデルは科学コード修復タスクで最大+33.33ポイント、強化学習ではLAPSタスクの報酬が2.4倍に向上しました。
#
AIエージェント# #
AI4Science#