註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Fox
@indie_maker_fox
🔥 TanStack 模板: 🚀 Nextjs 模板: 🎉 AI 生图 模板: 👨‍💻 主业大厂高工,副业独立开发 📚 公开构建,专注 AI 相关技术分享 🤑 产品出海,2 年收入破 10 万美刀
加入 December 2024
1.2K 正在關注    15.7K 粉絲
workbuddy 开源的 benchmark 数据集分成 code、web、office、security 这 4个部分,核心特点是测试场景更贴近真实用户场景,连提示词也是。 比如 code,总共80题,分别使用不同角色(dev、algo、pm、ops等)用最真实朴素的语言表达方式写用户提示词。 - 没有一家通吃:各列榜首分散在不同子集与 harness 之间:Claude Opus 4.8 拿下八个计分列中的五个(Code 双 harness 74.43 / 77.90、Web 双 harness 68.14 / 69.86、CodeBuddy Code 下 Office 82.37),GLM-5.2 两个(Security 双 harness 76.32 / 80.86),GPT-5.5 一个(Claude Code 下 Office 86.05)。 - 开源权重模型不落下风:GLM-5.2 在两个 harness 下均领跑 Security(拿下八个计分列中的 两个),并在 Claude Code 下的 Code 榜上与榜首相差不到一分。开源权重的竞争力在这套基准上因榜单而异,并非全面领先。
顯示更多