如果你在用 LLM 做评审,这篇值得看。(建议收藏)
这是目前很实用的一种评估方法。
传统整体评分会隐藏模型的判断过程,也容易出现评分上限的问题。
BINEVAL 的做法是:把每个评估标准拆成多个简单的是/否问题,分别判断,然后再汇总成多维评分。
每个问题的判断都能单独查看,所以可以清楚知道哪里做得不好;这些结果还能直接用来优化提示词。
在 SummEval、Topical-Chat、QAGS 上,它不需要训练,效果和 UniEval、G-Eval 相当甚至更好,尤其在事实准确性上更强。
论文:
顯示更多