抽空做了个 Eval,评估下最近比较火的 GLM-5.2 能力
先说结论: GLM-5.2 的模型能力(理解 + 写代码)不输 Opus 4.6,真正的差距在"如何在真实环境里高效干活"——而这恰恰是最吃 harness / RL 训练的部分,也是 Cursor Composer 重度使用的方式。harness 调好了,这模型的威力还能再放出不少。
方法:同一道 Rust bug(serde_json #
979#),给 evot / claude-code / pi 三个 agent ,分别换 GLM-5.2 和 Opus 4.6 两个模型跑,对比它们的执行轨迹。
结果:
两个模型、6 个 session 全部 PASS,GLM-5.2 在"做对"这件事上没问题,bug 理解和最终代码质量都过关。
但代价差了一个量级:
• Opus 4.6:三个 agent 齐刷刷 18 轮收工,~80s
• GLM-5.2:38 / 43 / 61 轮,慢约 7 倍
拆 trace 看清楚了,差距不在懂不懂 bug,而在 agentic 执行这层:
1. 环境处理是软肋——GLM 有十几轮卡在 cargo 上反复试错(CARGO_HOME、cargo metadata、翻 serde 源码),Opus 一轮就绕过去了
2. 不收敛、爱反复验证——写完还手搓临时测试文件建了又删,thinking 字符数是 Opus 的几十倍
3. 但代码品味在线——GLM 最终的 fix 反而更克制地道,一个 match 合并三个 case,注释把设计意图讲清楚了,比 Opus 那版还干净