🏗 一行の関数なら書けるAIも、「アプリ一式をゼロから作って」と言われると途端に崩れます。ファイルをまたいだ設計、噛み合うインターフェース、延々と続く不整合のデバッグ——これは個人技ではなく、チーム戦だからです。
そこで本研究は、AIエージェントに本物の開発チームを演じさせます。まず複数のArchitectが互いに異なる設計案(Software Design Sketch)を競って描き、CTO役が構造の妥当さやインターフェースの整合性を0〜8点で採点して最良案を選定。選ばれた設計は、ファイル所有者・公開API・依存関係・非循環性まで機械が検証できる「契約」へと正規化されます。
実装フェーズでは、Developerたちが依存関係の順に沿って自分の担当ファイルだけを、必要最小限の文脈で書いていきます。協調はGitで軽量に。各自がブランチにコミットする際、変更した公開シンボルや影響先を構造化メモに残すので、ファイル本文を共有せずともインターフェースの変更だけが伝播します。仕上げはQA役が依存レイヤーごとにテストを走らせ、失敗を担当者へ差し戻して直させる。まさに人間のチーム開発そのものです。
この CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation は、本物のpytestで検証するNL2Repo-Benchで平均42.3%のテスト通過率(SFT設定)を達成し、19リポジトリ中15でベースラインのCodeSに勝利しました。構造の良さが、実際に動くコードの正しさへとつながっている点が見どころです。
URL:
#
CodeGeneration# #
AIAgents#