ゲームAIの実力を測るのに、たった数回のプレイ試行で優劣を語っていませんか?その再現性の低さに一石を投じるデータセット兼ベンチマークが登場しました。
タイトル: GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
URL:
GameHorizon Suiteは、21のAAAタイトルから集めた5,000時間分のプレイ映像に、短期・中期・長期の3階層の言語命令を密に付与し、行動の実行力と計画力の両方を統一的に評価できるようにした取り組みです。注目ポイントを3つ紹介します。
🎬 密な多階層データセット
5,000時間・21タイトル、4.1億件の操作イベントに対し、平均2.63秒に1つの命令が対応するほど密なアノテーションを実現。1フレームが短期・中期・長期すべての命令と同時に紐づいている点が特徴です。
🧩 ボトムアップ×トップダウンの評価設計
アノテーションはキー操作から具体的行動を積み上げるボトムアップ方式、評価はゴールを分解させるトップダウン方式。両者の精度差が28.9ポイントにも達し、「認識」と「計画」が別モノであることを裏付けました。
📊 オフライン×オンラインの二段評価
5,000問の再現性重視なオフライン試験と、失敗のたびにリセットして原因を切り分けるオンライン試験を両輪で用意。44モデルの平均正答率は64.7%で、トップのGPT-6-Astraは80.2%を記録しました。
行動を「見て分かる」ことと「先を計画できる」ことの間には、まだ大きな溝があることを数字で示した点に意義を感じます。
#
ゲームAI# #
ベンチマーク#