公開されている会話データだけで、実運用でのAIの安全性の失敗を予測できるのか?🔍 OpenAIがその精度を桁レベルで検証した研究です。
タイトル: Can public chat data predict real-world AI misalignments?
URL:
🔍 概要
公開会話データセットが、デプロイ済みモデルの実際の安全性の失敗をどこまで予測できるかを検証した研究です。外部の研究者が本番データにアクセスできない、という評価のギャップに正面から取り組みます。
❓ 解決する課題
フロンティアのAIラボは実世界での失敗の内部証拠を持ちますが、機微なユーザーデータゆえ外部と共有できません。
・「最も有益な証拠が、作ったラボにしか手に入らない」という非対称性があります
・合成プロンプトの公開ベンチは、本物の利用や固有の失敗を反映できているか疑問でした
💡 方法論と提案手法
・公開データWildChat(ChatGPT会話100万件)から約10万件をサンプリング
・最近のOpenAIモデル5種で最終応答を再生成
・GPT-5 Thinkingをジャッジに、19の安全性カテゴリで採点
・各モデル20万件以上の本番データの失敗率と比較
📊 実験結果
・WildChatの予測の95%が、本番失敗率に対して1.04桁以内(内部シミュレーション比で約1.86倍の誤差)
・傾き1.2(R=0.65)で、4桁にわたる失敗頻度で比例関係を維持
・GPT-5.1の「電卓ハッキング」のようなモデル固有の失敗も同程度の率で出現
・一方、ツール使用のエージェント的失敗では誤差が37倍に拡大し、限界も明確に
#
AI安全性# #
評価#