注册并分享邀请链接,可获得视频播放与邀请奖励。

Melissa Pan
@melissapan
CS PhD @UCBerkeley Sky Lab 🐻 Systems & AI & Sustainability 🌍 Prev: @google, @ibm, @CarnegieMellon🐕‍🦺, @UofT🇨🇦
708 正在关注    5.2K 粉丝
都是 Fable 5,放进 Claude Code,成本接近 Pi 的两倍。成功率只多了 1.1 个百分点。 看着有点难以置信。 Arena 发布的这项 HarnessTax 研究,把 7 个模型分别接进 Claude Code、Codex CLI 和 Pi,跑了两套编程测试。 其中,SWE-bench Lite 抽样测试上,Fable 5 的结果是: Claude Code:成功率 97.8%,平均每次尝试 $1.33。 Pi:成功率 96.7%,平均每次尝试 $0.67。 更有意思的是,两边平均都跑了 15 轮左右。Claude Code 并没有多干多少轮,但每轮花的钱不一样。 不过这里算的是 API 成本,跟订阅费是两回事。Claude 订阅里的额度,A➗也不让你随便拿去接第三方 harness。 其他模型的 harness,我一直推荐 Pi。就我自己的使用来说,目前还是它最均衡。 完整测评报告👇
显示更多