最近 DeepSeek 和 K3 的发布,让大家开始认真看 Agent benchmark 后面的 harness。
Karpathy 这条正好补上了另一半:harness 并不是换一套 prompt 和工具,就能无限放大模型。前提是环境能够把结果反馈给 Agent。
写代码有 compiler、tests 和 logs。
但在动态的 3D 世界里,Opus 5 只能缓慢地截取几张图。它看不到连续的状态变化,也很难判断动作、碰撞和叙事是否真的成立。
所以它能用两小时写出 5500 行 Three.js,却还不能可靠地审计自己的作品。
下一步缺的可能不只是更会生成的模型,而是能让 Agent 真正“看见结果”的 environment 和 verifier。
没有可读的反馈,self-improvement 就没有闭环。
显示更多