推荐这篇文章。一个 agent 评测系统被自己的评分骗了整整一周——两个标准在互相拉扯,总分却看起来正常。
Similarweb 的高级 AI 工程师 Liora Korni 在 7 月 29 日 LangChain 博客上分享了一篇实战文章:如何评估一个生成长篇研究报告的 agent 系统。文章的价值不在方法论本身——LLM-as-judge 和 rubric 都不是新概念——而在他们把评估当作产品架构的一部分来做的具体教训。
两种输出,两种评估方式
Similarweb Data Studio 是一个 agent 系统:用户用自然语言提问,agent 规划、调用数据工具、检索数字、写出答案。它要处理两类完全不同的输出:
普通对话:聚焦问题,答案形状可预期。评估方法简单——golden answer + semantic judge 判断"是否表达了同样的意思"。
深度研究报告:长文输出,包含来源、解读、建议、风险提示和叙事结构。同一问题可能有多种好的答案。Golden answer 不适用——匹配 gold answer 只会奖励相似性而不是质量。
Rubric 方案
深度研究报告的评估用 rubric prompts:每个质量维度有自己的评分锚点。例如 source_integration 标准:
• 0.0:纯粹依赖单一数据 API,无外部上下文
• 0.3:模糊引用"行业报告"但不点名
• 0.8:引用多个带名称、日期、数字的来源
• 1.0:广泛使用归因明确、融入叙事的来源
每个维度返回分数 + 解释 + 差距说明。不只是一个数字。
除此之外还加了 faithfulness check:每个声明是否真的来自检索数据?还是 agent 夸大了来源支持的内容?
最贵的教训:花了整整一周跟自己的评估打架
文章里最值得读的部分:一次 prompt 的小改动让总体评分下降。 他们花了一周反复 revert、调整、re-run。报告每次看起来都很好,但数一直在说不。最后有人打开逐标准评论才发现——新版报告引用了更多来源(提高了 source breadth),但这些来源都是模糊的(拉低了 attribution)。两个标准互相拉扯,总分隐藏了冲突。
修复了评分锚点后(从"引用更多来源"改为"引用命名、可验证的来源"),同一个报告的分数从 0.7 降到了 0.3,数值终于匹配了评论一直在说的东西。
核心教训:一个校准错误的评估比没有评估更糟糕,因为它给你虚假的信心。
最终的评估循环
1. 从假设开始
2. 跑一个小评估获取信号
3. 检查反馈评论和 traces
4. 跑完整 benchmark 并重复
5. 与 baseline 或 A/B 输出对比
6. 决定合并、迭代还是重新校准
原文:
#
AgentEvaluation# #
LLMasJudge# #
LangSmith#