TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
Elara
@Elara200410
💪 努力|勇敢|自律 📚 每天更新AI学习干货,记录从小白到进阶的真实成长过程 💕 Believe in romance and love
가입 June 2026
22
팔로잉 중
460
팬
Elara
@Elara200410
2026.08.03 06:19
我们衡量 LLM 能力的方式已经严重落后于模型实际能做到的事。 Karpathy 给了 Opus 5 一段《指环王》的开篇文字、1M token 预算和一句指令:用 Three.js 渲染这个故事。模型自主工作了 2 小时,产出了 5500 行代码,在三维空间中编排多边形资产,生成了一段程序化动画。 重点不是渲染效果好不好看,而是任务粒度发生了根本变化。 过去我们测 LLM 用的是单次问答:画一只鹈鹕、写一段代码、回答一个问题。模型在几秒内完成,我们立刻判断好坏。但现在模型能在没有人干预的情况下,自主管理 2 小时的计算预算,组织数千行代码的架构,协调多个创意维度的输出。 这意味着我们最常用的评估方式,包括 benchmark、A/B 测试和 human eval,都是为秒级任务设计的。当任务扩展到小时级,这些工具完全失效。 失败成本是第一个被放大的问题。一次生成失败浪费的不是几秒钟,而是几美元加几小时。更隐蔽的问题是:我们不知道模型在长时间运行中什么时候会偏航。它在第 30 分钟做出的某个小决策,可能在 90 分钟后才暴露,而且没有自动纠错机制能捕捉到。 严肃建设者应该开始关注两件事:长周期任务的自主纠错能力,以及模型在耗尽预算前是否会主动调整策略。 LLM 的测试范式需要一次和任务粒度相匹配的升级。
더 보기
0
0
0
1
0
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.2M 팬
オリコンニュース
@oricon
1.9M 팬
吴说区块链
@wublockchain12
181.5K 팬
TVer新着
@TVer_info
100.9K 팬
Reuters
@Reuters
26.4M 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K 팬
First Squawk
@FirstSquawk
569.4K 팬
Bloomberg
@business
10.5M 팬
billboard
@billboard
16.8M 팬
空空道人
@Kongkongda5882
34.3K 팬
中國新聞社
@CNS1952
547.7K 팬
PR TIMESテクノロジー
@PRTIMES_TECH
28.3K 팬
一劍浣春秋
@chee828
0 팬
zerohedge
@zerohedge
3.4M 팬
モデルプレス
@modelpress
2.1M 팬