가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

艾略特
@elliotchen100
Raven: the deepthinking self-improving agent harness
가입 December 2023
1K 팔로잉 중    26.3K 팬
最近 DeepSeek 和 K3 的发布,让大家开始认真看 Agent benchmark 后面的 harness。 Karpathy 这条正好补上了另一半:harness 并不是换一套 prompt 和工具,就能无限放大模型。前提是环境能够把结果反馈给 Agent。 写代码有 compiler、tests 和 logs。 但在动态的 3D 世界里,Opus 5 只能缓慢地截取几张图。它看不到连续的状态变化,也很难判断动作、碰撞和叙事是否真的成立。 所以它能用两小时写出 5500 行 Three.js,却还不能可靠地审计自己的作品。 下一步缺的可能不只是更会生成的模型,而是能让 Agent 真正“看见结果”的 environment 和 verifier。 没有可读的反馈,self-improvement 就没有闭环。
더 보기