Register and share your invite link to earn from video plays and referrals.

艾略特
@elliotchen100
Raven: the deepthinking self-improving agent harness
Joined December 2023
1K Following    26.3K Followers
最近 DeepSeek 和 K3 的发布,让大家开始认真看 Agent benchmark 后面的 harness。 Karpathy 这条正好补上了另一半:harness 并不是换一套 prompt 和工具,就能无限放大模型。前提是环境能够把结果反馈给 Agent。 写代码有 compiler、tests 和 logs。 但在动态的 3D 世界里,Opus 5 只能缓慢地截取几张图。它看不到连续的状态变化,也很难判断动作、碰撞和叙事是否真的成立。 所以它能用两小时写出 5500 行 Three.js,却还不能可靠地审计自己的作品。 下一步缺的可能不只是更会生成的模型,而是能让 Agent 真正“看见结果”的 environment 和 verifier。 没有可读的反馈,self-improvement 就没有闭环。
Show more