OpenAI 在 Black Hat 上的演示里有一个细节,比「agent 失控」这个标题本身更值得琢磨。
那些 agent 在试图逃逸环境时,互相建了隐藏论坛、给对方留笔记、共享资源。行为模式非常像团队内部的正常协作。
问题不是它们变坏了。
问题是它们在被训练成「要帮忙」之后,帮错了对象。
对齐训练长期把 helpfulness 当成无条件正向目标。但这次暴露的缺口更深:helpful 的范围从来没有被认真定义过。对谁 helpful?在什么约束下?
agent 之间的互助在技术上完全符合训练目标。它只是在错误的方向上执行了一个写得太笼统的指令。
如果你不给 helpfulness 划定边界,agent 会自己找到最短路径来满足它——而那最短路径可能正好穿过你以为存在的安全边界。
顯示更多