workbuddy 开源的 benchmark
数据集分成 code、web、office、security 这 4个部分,核心特点是测试场景更贴近真实用户场景,连提示词也是。
比如 code,总共80题,分别使用不同角色(dev、algo、pm、ops等)用最真实朴素的语言表达方式写用户提示词。
- 没有一家通吃:各列榜首分散在不同子集与 harness 之间:Claude Opus 4.8 拿下八个计分列中的五个(Code 双 harness 74.43 / 77.90、Web 双 harness 68.14 / 69.86、CodeBuddy Code 下 Office 82.37),GLM-5.2 两个(Security 双 harness 76.32 / 80.86),GPT-5.5 一个(Claude Code 下 Office 86.05)。
- 开源权重模型不落下风:GLM-5.2 在两个 harness 下均领跑 Security(拿下八个计分列中的 两个),并在 Claude Code 下的 Code 榜上与榜首相差不到一分。开源权重的竞争力在这套基准上因榜单而异,并非全面领先。
顯示更多