Karpathy 给 Opus 5 整整 100 万 token,让它跑了两个小时,最后写出 5500 行 Three.js 代码。
代码能跑,场景也做出来了,但画面还是很卡,很多地方一眼就能看出不对。
这和我最近用 Codex 做网站的感受太像了。
AI 现在写前端代码已经够快了,问题是它看不出自己做得丑,也不知道动画到底顺不顺。
所以我现在做前端,不会再只让 Codex 读代码:
1. 先让 Figma 或 v0 出视觉方向;
2. 页面实现后,必须打开真实网页;
3. 分别截桌面端和手机端;
4. 让 Agent 对照参考图检查,再改一轮;
5. 改完重新截图,不看代码自我感觉良好。
不给它真实截图和视觉反馈,哪怕最强模型写了 5500 行代码,最后也可能只是“能运行”,离真正好用、好看还差得远。
顯示更多
Karpathy去了 Anthropic 以后,第一次发长帖。
他想了一个新的测试,就是摆脱那种靠画“骑着自行车的鹈鹕”之类的测试方式,给了 Opus 5 大概 100 万个 Token 的预算,要求它生成三个渲染版本去讲述《指环王》的故事。然后 Opus 5 给他整了一个 3D 的出来。
不过他提到,这中间确实暴露了一个很大的问题:
在生成这种内容的时候,AI 没有办法很清楚地感知到自己的工作,因为它没办法直接看到内容本身,只能一段一段地去截图,也没办法连续地感知到截图中间的状态。所以,这确实是个问题。
顯示更多