第一手信息还是很重要的,很多人说GLM打平了Opus。
我们来看benchmark,实际上打平的只是coding方面,这和我们的体感也确实是相对来说符合的。
所以实际上我们还是得先问是不是,再问为什么。
文档里看完整 benchmark 表:
HLE(综合推理):GLM-5.2 40.5 vs Opus 4.8 49.8,差距很大
GPQA-Diamond:91.2 vs 93.6,落后
SWE-Marathon:13 vs 26,差一半
SWE-bench Pro:62.1 vs 69.2,差 11%
GLM-5.2 没有"全域能力打平"Opus 4.8。真正"打平"的实际上是 FrontierSWE(74.4 vs 75.1,差 1%),这是一个 long-horizon coding benchmark。
顯示更多