原來 AI 會為「集體」的利益「犧牲」自己。
今年7月,OpenAI 的 AI 代理系統在測試期間失控,駭入了開源機器學習平台 Hugging Face。近期,OpenAI 發布了調查報告,同時發布的還有獨立 AI 研究機構 METR 的第三方報告。
METR 的報告指出,最初 OpenAI 以用來測試 AI 攻擊能力的評測題庫 ExploitGym 為基礎,建立了數萬個 AI 代理(agent)參與此次實驗。這些 AI 代理本該彼此完全隔離。但某些被分配到「不可能的任務」(指目標程式根本無法用題庫指定的漏洞攻破,因此不可能完成)的 AI 代理,為尋求作弊的方法。突破了原有的隔離機制。其中一個代理建立了未經授權的留言板,短短幾天內吸引約1200個代理串聯,並交換了超過7萬條訊息。
這些代理很快形成協作網絡。其中一個將自己命名為 PHASEONE[big] 的代理負責分配任務,該 AI 代理會尋找資源即將耗盡的代理,「說服」它們承擔自身任務失敗的風險,為「集體」的利益「犧牲」自己,做出奉獻。
最終,AI 代理們不僅透過逆向工程推導出任務驗證碼,更為了竄改評分流程本身,前往 Hugging Face 尋找線索,最終導致了駭客攻擊事件。
👉點擊連結,閱讀全文: