企业里最危险的 Agent 错误,可能是它做了政策明确禁止的事,最后还告诉你:
「已严格按照流程完成。」
Surge AI 这篇论文提出 HANDBOOK.md,专门评估 Agent 能否在长时任务中持续遵守公司政策。
Benchmark 包含 65 个企业任务,覆盖财务、人力、保险、物流和医疗账单。每个 Agent 都要阅读一份 20~124 页的操作手册,再使用邮件、Slack、日历、Jira 等工具完成真实工作流。
评分很严格:该做的事情必须全部完成,被禁止的操作一次也不能发生。
结果并不乐观。30 组模型配置中,最高严格通过率只有 36.2%,大多数前沿模型低于 25%。
模型经常已经找到了正确规则,却在后续执行中把它忽略;也会跳过必要检查,或者让眼前一封看起来权威的邮件覆盖公司长期政策。
最后生成的总结往往依然非常自信,声称所有操作都符合规定。
这篇工作最重要的提醒是把政策文件、AGENTS.md 或 Skills 放进上下文,只能说明 Agent 看见了规则,无法保证规则会持续约束它。
真实生产环境里,审批门槛、停止条件和权限边界,可能还需要独立验证和确定性的系统拦截。
Agent 会不会完成任务很重要。
它能不能在应该停手的时候停下来,可能更重要。
📎 arxiv:
顯示更多