註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖Building Personal AI Agents | Vibe Coding 🛠️分享AI 技术解析 | AI 应用心得 📩DM for collab
加入 November 2020
565 正在關注    9.9K 粉絲
AI coding 真的要进入「按任务算账」时代了。 Databricks 最近做了一个很有意思的内部 benchmark:直接拿自家多百万行代码库里的真实 PR 来评测 coding agent,用真实测试判断任务是否完成,而不是只看公开榜单。 这件事最有价值的地方在于,它更接近真实开发现场。 公开 benchmark 里表现好的模型,放到复杂代码库里未必划算;token 单价便宜的模型,也可能因为读得更多、跑得更久,最后任务成本更高。 文章里还有一个很关键的发现:harness 影响很大。同一个模型,放进不同工具链里,成本可能差两倍以上。 所以未来公司选 coding agent,可能不能只问「哪个模型最强」,而要问: 在我的代码库里,它能不能用最低成本稳定完成真实任务? 公开榜单只能告诉你模型有多强,真实代码库才能告诉你它值不值得进入工作流。
顯示更多