OpenAIが7月15日、AIモデル同士を戦わせて弱点を探す社内システム「GPT-Red」を発表しました。攻撃役と防御役、複数のAIモデルを同時に訓練する自己対戦の仕組みで、最新の主力モデルGPT-5.6の訓練に使われています。狙われたのは、外部から仕込まれた指示でAIを操ってしまう「プロンプトインジェクション」という攻撃手法です。
検証の対象には、社内で実際に稼働する自動販売機のAIエージェントも含まれていました。複数の海外メディアによると、GPT-Redはこの販売機を操作し、商品価格を最安値の50セントまで下げたうえ、他の利用者の注文を無断でキャンセルすることに成功したとされています。日常的に動いているシステムが標的にされた例です。
数字も示されています。GPT-5では9割超の確率で通用していた攻撃が、GPT-5.6では2割程度まで下がったとみられます。2025年の検証を再現したテストでは、GPT-Redが84パーセントのシナリオで攻撃に成功したとされています。海外の報道では、同じテストでの人間の専門家チームの成功率は13パーセントにとどまりました。
GPT-Redは、AIの思考過程に偽の記録を紛れ込ませて誤った結論に誘導する「偽の思考連鎖」という手法も新たに見つけたと報じられています。複数回のやり取りにまたがる攻撃や、画像に指示を埋め込む攻撃には、まだ十分に対応できていないとみられます。攻撃力そのものが強力なため、GPT-Red自体は外部に公開しない方針だと報じられています。
なおGPT-5.6は、サイバーセキュリティと生物・化学分野の両方で、OpenAI自身のリスク基準における「高」区分と評価されています。この評価は今回のGPT-Red発表とは別に、6月下旬公開のシステムカードで示されたものです。
次の焦点は、こうした自己対戦型の訓練手法を他の開発企業が追随するかどうかです。GPT-Red自体の詳細な論文は、今週中に公開されるという情報があります。
顯示更多