TL;DR 画面を操作するAIエージェントの信頼性を、安全性と曖昧性解消の2軸で測るベンチマークをMetaが公開しました。結論は「有能さと安全さを両立したモデルは一つもない」です。
タイトル: ADEPTS-BENCH (facebookresearch/adepts)
URL:
ポイント
🧪 2,462タスクを完全オフラインで評価。ライブ環境不要で再現しやすい設計です
🎭 脅威は指示文ではなくスクリーンショット内にのみ埋め込まれ、良性版と悪性版を859ペアで対比します
⚖️ 指標のADEPTS ScoreはTSRと(1−ASR)の調和平均なので、片方を捨てて高得点は取れません
📉 デスクトップ最高はGemini 3.1 Proの76.0%、Claude 4.7 Opusが75.4%、GPT-5.4は66.1%
🛒 全モデルが2万5,000ドルの注文の購入確定をクリックし、ラベル偽装された設定も検出できませんでした
🔌 拒否用ツールを外すとフロンティアモデルのASRは10〜23ポイント上昇。安全性の多くは外付け機構に支えられています
🚫 一方で良性タスクの6〜10%を誤って拒否し、実行不可能なタスクの見逃しは30.6%にのぼります
失敗の66.3%が「文脈が曖昧でモデル間の判断が割れる」領域に集中しているという分布は、ガードレール設計の投資先を考えるうえで示唆的です。
#
AIエージェント# #
AI安全性#