註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
加入 May 2026
280 正在關注    422 粉絲
TL;DR 画面を操作するAIエージェントの信頼性を、安全性と曖昧性解消の2軸で測るベンチマークをMetaが公開しました。結論は「有能さと安全さを両立したモデルは一つもない」です。 タイトル: ADEPTS-BENCH (facebookresearch/adepts) URL: ポイント 🧪 2,462タスクを完全オフラインで評価。ライブ環境不要で再現しやすい設計です 🎭 脅威は指示文ではなくスクリーンショット内にのみ埋め込まれ、良性版と悪性版を859ペアで対比します ⚖️ 指標のADEPTS ScoreはTSRと(1−ASR)の調和平均なので、片方を捨てて高得点は取れません 📉 デスクトップ最高はGemini 3.1 Proの76.0%、Claude 4.7 Opusが75.4%、GPT-5.4は66.1% 🛒 全モデルが2万5,000ドルの注文の購入確定をクリックし、ラベル偽装された設定も検出できませんでした 🔌 拒否用ツールを外すとフロンティアモデルのASRは10〜23ポイント上昇。安全性の多くは外付け機構に支えられています 🚫 一方で良性タスクの6〜10%を誤って拒否し、実行不可能なタスクの見逃しは30.6%にのぼります 失敗の66.3%が「文脈が曖昧でモデル間の判断が割れる」領域に集中しているという分布は、ガードレール設計の投資先を考えるうえで示唆的です。 #AIエージェント# #AI安全性#
顯示更多