註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Bohu
@BohuTANG
Founder @DatabendLabs & @Evot_AI. Building the data harness infrastructure for the AI frontier.
134 正在關注    3.4K 粉絲
抽空做了个 Eval,评估下最近比较火的 GLM-5.2 能力 先说结论: GLM-5.2 的模型能力(理解 + 写代码)不输 Opus 4.6,真正的差距在"如何在真实环境里高效干活"——而这恰恰是最吃 harness / RL 训练的部分,也是 Cursor Composer 重度使用的方式。harness 调好了,这模型的威力还能再放出不少。 方法:同一道 Rust bug(serde_json #979#),给 evot / claude-code / pi 三个 agent ,分别换 GLM-5.2 和 Opus 4.6 两个模型跑,对比它们的执行轨迹。 结果: 两个模型、6 个 session 全部 PASS,GLM-5.2 在"做对"这件事上没问题,bug 理解和最终代码质量都过关。 但代价差了一个量级: • Opus 4.6:三个 agent 齐刷刷 18 轮收工,~80s • GLM-5.2:38 / 43 / 61 轮,慢约 7 倍 拆 trace 看清楚了,差距不在懂不懂 bug,而在 agentic 执行这层: 1. 环境处理是软肋——GLM 有十几轮卡在 cargo 上反复试错(CARGO_HOME、cargo metadata、翻 serde 源码),Opus 一轮就绕过去了 2. 不收敛、爱反复验证——写完还手搓临时测试文件建了又删,thinking 字符数是 Opus 的几十倍 3. 但代码品味在线——GLM 最终的 fix 反而更克制地道,一个 match 合并三个 case,注释把设计意图讲清楚了,比 Opus 那版还干净
顯示更多
0
22
87
11
轉發到社區
上周六分享了「Trace 即 Evals」,聊了一个问题:Agent 改了 prompt、换了模型、加了 tool,到底变好还是变差? 几个关键点: - Agent 是链式反应,一步偏了后面全偏,只看 pass/fail 没用 - 同任务同模型,换 harness,token 消耗差 3 倍,成本差 67% - 轨迹存下来才有归因的可能——哪一步选错 tool、哪一步上下文炸了,展开就能看到 - Anthropic、OpenAI这种头部模型公司迭代 agent 靠的就是 trace 驱动的量化闭环,这套方法不该只有大厂能用 Slides 👉
顯示更多
0
8
110
19
轉發到社區
Cursor 还是有两下子的,危机感非常强,训 Composer 2.5 的做法: 1. 把全部权重押在一个任务上。不做通用编程,只做"Cursor 里的软件工程"。模型就像一块存储盘,容量有限,那就把所有权重都喂给这一个任务 —— Composer 比 Opus 便宜一个数量级 2. 基座用 Kimi(1T MoE,30B active),先做接近预训练规模的 mid-training 灌代码 token,把分布铺宽;再上大规模 RL 把分布削尖。mid-training 让它会写代码,RL 让它写"对"的代码 3. 让模型直接在自己的 harness 里 RL。工具怎么调、环境怎么导航,全部烤进权重,不靠 prompt 描述 —— "prompt engineering 有上限,想做好产品就得改模型本身"。连上下文压缩都塞进 RL loop(self-summarization):200K 窗口的模型,实际能连续跑到百万 token 4. 不用第三方 RL 环境厂商,直接拿生产环境(隔离副本)训;再加 real-time RL —— 从用户 happy/sad 的信号里,每几小时更新一次模型 Cursor × Fireworks · Sequoia Podcast 2026.05
顯示更多
0
11
137
15
轉發到社區
为什么 deepseek 要出自己的 code agent,估计是看不下去了😂。别的 agent 确实很难发挥出他们模型的威力。 比如 claude code 在 deepseek v4 pro 上效果其实很差劲,感觉都在浪费 token和时间🤣
顯示更多
0
46
317
13
轉發到社區