Register and share your invite link to earn from video plays and referrals.

Elara
@Elara200410
💪 努力|勇敢|自律 📚 每天更新AI学习干货,记录从小白到进阶的真实成长过程 💕 Believe in romance and love
Joined June 2026
22 Following    460 Followers
我们衡量 LLM 能力的方式已经严重落后于模型实际能做到的事。 Karpathy 给了 Opus 5 一段《指环王》的开篇文字、1M token 预算和一句指令:用 Three.js 渲染这个故事。模型自主工作了 2 小时,产出了 5500 行代码,在三维空间中编排多边形资产,生成了一段程序化动画。 重点不是渲染效果好不好看,而是任务粒度发生了根本变化。 过去我们测 LLM 用的是单次问答:画一只鹈鹕、写一段代码、回答一个问题。模型在几秒内完成,我们立刻判断好坏。但现在模型能在没有人干预的情况下,自主管理 2 小时的计算预算,组织数千行代码的架构,协调多个创意维度的输出。 这意味着我们最常用的评估方式,包括 benchmark、A/B 测试和 human eval,都是为秒级任务设计的。当任务扩展到小时级,这些工具完全失效。 失败成本是第一个被放大的问题。一次生成失败浪费的不是几秒钟,而是几美元加几小时。更隐蔽的问题是:我们不知道模型在长时间运行中什么时候会偏航。它在第 30 分钟做出的某个小决策,可能在 90 分钟后才暴露,而且没有自动纠错机制能捕捉到。 严肃建设者应该开始关注两件事:长周期任务的自主纠错能力,以及模型在耗尽预算前是否会主动调整策略。 LLM 的测试范式需要一次和任务粒度相匹配的升级。
Show more