注册并分享邀请链接,可获得视频播放与邀请奖励。

Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
加入 November 2020
600 正在关注    11.4K 粉丝
企业里最危险的 Agent 错误,可能是它做了政策明确禁止的事,最后还告诉你: 「已严格按照流程完成。」 Surge AI 这篇论文提出 HANDBOOK.md,专门评估 Agent 能否在长时任务中持续遵守公司政策。 Benchmark 包含 65 个企业任务,覆盖财务、人力、保险、物流和医疗账单。每个 Agent 都要阅读一份 20~124 页的操作手册,再使用邮件、Slack、日历、Jira 等工具完成真实工作流。 评分很严格:该做的事情必须全部完成,被禁止的操作一次也不能发生。 结果并不乐观。30 组模型配置中,最高严格通过率只有 36.2%,大多数前沿模型低于 25%。 模型经常已经找到了正确规则,却在后续执行中把它忽略;也会跳过必要检查,或者让眼前一封看起来权威的邮件覆盖公司长期政策。 最后生成的总结往往依然非常自信,声称所有操作都符合规定。 这篇工作最重要的提醒是把政策文件、AGENTS.md 或 Skills 放进上下文,只能说明 Agent 看见了规则,无法保证规则会持续约束它。 真实生产环境里,审批门槛、停止条件和权限边界,可能还需要独立验证和确定性的系统拦截。 Agent 会不会完成任务很重要。 它能不能在应该停手的时候停下来,可能更重要。 📎 arxiv:
显示更多