註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

kabikabi
@jakevin7
Building & & AI enthusiast ! Love open source! ExDatabaseer. Apache Arrow/Datafusion/Doris PMC member
加入 November 2018
702 正在關注    20.9K 粉絲
第一手信息还是很重要的,很多人说GLM打平了Opus。 我们来看benchmark,实际上打平的只是coding方面,这和我们的体感也确实是相对来说符合的。 所以实际上我们还是得先问是不是,再问为什么。 文档里看完整 benchmark 表: HLE(综合推理):GLM-5.2 40.5 vs Opus 4.8 49.8,差距很大 GPQA-Diamond:91.2 vs 93.6,落后 SWE-Marathon:13 vs 26,差一半 SWE-bench Pro:62.1 vs 69.2,差 11% GLM-5.2 没有"全域能力打平"Opus 4.8。真正"打平"的实际上是 FrontierSWE(74.4 vs 75.1,差 1%),这是一个 long-horizon coding benchmark。
顯示更多
0
88
231
12
轉發到社區