🧩 AIエージェントに足りないのはモデルの賢さではなく「現場のノウハウ」だった、という論文です。
タイトル: Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
URL:
❓ 自律型研究エージェントには何が欠けているのですか
💡 「モデル」と「実行ハーネス」の2層だけでは、適切な手法の選び方やAPIの使い方、実装の落とし穴といった運用知識が抜け落ちています。この論文はこれを第三の層として明示的に扱います。
❓ その知識をどうやって手に入れるのですか
💡 GitHubリポジトリや論文を「Scope→Ground→Construct→Verify」の4段階で処理し、検証済みの「スキル」として蒸留します。1,000リポジトリと153論文から5,353個のスキルを構築しました。
❓ スキルを使うと実際どれくらい変わるのですか
💡 同じGPT-5.5・同じハーネスのまま、スキルを追加するだけでMLE-benchは31.11%から72.89%へ、PaperBench・FrontierCS・PassNetでも軒並み改善しました。高難度タスクでは4倍以上のスコア向上も見られます。
❓ 単にリソースを増やしただけではないのですか
💡 トークン数やツール呼び出し回数と改善幅の相関はほぼゼロで、Claude Opus 4.8構成より少ないトークンで高いスコアを出しています。知識そのものが効いているといえます。
#
AIエージェント# #
機械学習#