注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 FANTHFUL
FANTHFUL 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 FANTHFUL 的推特
无声的画面却看哭了, 八一荣光不止属于军人, 军婚里温情守候的军嫂, 同样值得致敬。 山海相隔,只为奔赴一场团圆。 On Army Day, we salute soldiers and the military spouses who wait faithfully. Across distant lands, they long for precious reunions. #建军节# #ArmyDay# #MilitaryMarriage#
显示更多
推荐这篇文章。一个 agent 评测系统被自己的评分骗了整整一周——两个标准在互相拉扯,总分却看起来正常。 Similarweb 的高级 AI 工程师 Liora Korni 在 7 月 29 日 LangChain 博客上分享了一篇实战文章:如何评估一个生成长篇研究报告的 agent 系统。文章的价值不在方法论本身——LLM-as-judge 和 rubric 都不是新概念——而在他们把评估当作产品架构的一部分来做的具体教训。 两种输出,两种评估方式 Similarweb Data Studio 是一个 agent 系统:用户用自然语言提问,agent 规划、调用数据工具、检索数字、写出答案。它要处理两类完全不同的输出: 普通对话:聚焦问题,答案形状可预期。评估方法简单——golden answer + semantic judge 判断"是否表达了同样的意思"。 深度研究报告:长文输出,包含来源、解读、建议、风险提示和叙事结构。同一问题可能有多种好的答案。Golden answer 不适用——匹配 gold answer 只会奖励相似性而不是质量。 Rubric 方案 深度研究报告的评估用 rubric prompts:每个质量维度有自己的评分锚点。例如 source_integration 标准: • 0.0:纯粹依赖单一数据 API,无外部上下文 • 0.3:模糊引用"行业报告"但不点名 • 0.8:引用多个带名称、日期、数字的来源 • 1.0:广泛使用归因明确、融入叙事的来源 每个维度返回分数 + 解释 + 差距说明。不只是一个数字。 除此之外还加了 faithfulness check:每个声明是否真的来自检索数据?还是 agent 夸大了来源支持的内容? 最贵的教训:花了整整一周跟自己的评估打架 文章里最值得读的部分:一次 prompt 的小改动让总体评分下降。 他们花了一周反复 revert、调整、re-run。报告每次看起来都很好,但数一直在说不。最后有人打开逐标准评论才发现——新版报告引用了更多来源(提高了 source breadth),但这些来源都是模糊的(拉低了 attribution)。两个标准互相拉扯,总分隐藏了冲突。 修复了评分锚点后(从"引用更多来源"改为"引用命名、可验证的来源"),同一个报告的分数从 0.7 降到了 0.3,数值终于匹配了评论一直在说的东西。 核心教训:一个校准错误的评估比没有评估更糟糕,因为它给你虚假的信心。 最终的评估循环 1. 从假设开始 2. 跑一个小评估获取信号 3. 检查反馈评论和 traces 4. 跑完整 benchmark 并重复 5. 与 baseline 或 A/B 输出对比 6. 决定合并、迭代还是重新校准 原文: #AgentEvaluation# #LLMasJudge# #LangSmith#
显示更多