我作为每天同时运营 Codex、Claude 和 Cursor 工作流的 builder,从 Anthropic 的高风险模拟研究中确认:agent 越强,权限设计和爆炸半径控制越关键。不可逆动作必须有人类 hard gate,任务从 checkpoint 恢复,结果用独立证据核验。这不是末日,而是最小权限的工程实践。
显示更多
New Anthropic research: Agentic misalignment in Summer 2026.
A year after our blackmail experiments, we found four more ways that today’s autonomous AI agents misbehave in simulations.
Read more:
显示更多