가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
가입 November 2020
600 팔로잉 중    11.4K
最近用 Opus 5 写代码,我也一直被一个问题困扰: 模型明明更强了,但有时候反而更难一起工作。 刚好看到一篇文章也在聊这个。作者发现 Opus 5 遇到模糊需求时,更容易自己做假设,然后一路往下执行,甚至会悄悄扩大任务范围、重新解释原来的计划。 以前 Opus 4.8 或 Fable 有些时候会停下来问一句:「你这里到底想要 A 还是 B?」 Opus 5 更喜欢自己选一个,然后继续干。 更有意思的是,Anthropic 自己的 Opus 5 Prompting Guide 也专门提醒了这个问题:它可能主动扩大 scope、加入没要求的步骤,所以窄任务需要明确告诉它不要擅自扩展。 文章里给了一个挺有意思的猜测: Benchmark 和 RLVR 更容易奖励「大胆做出假设然后把任务完成」的模型。但真实的软件工程里,很多信息永远写不完整。业务背景、隐含约束、架构取舍,经常没有唯一正确答案。 Agent 更自主当然很好,但如果每次都要盯着它别跑偏,这种 autonomy 的价值就要重新算了。 原文:
더 보기