TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
Xiuyu Li
@sheriyuo
Researcher
@StepFun_ai
| Working on long-horizon tasks | Prev
@RUC1937
| Opinions are my own
가입 February 2026
1.8K
팔로잉 중
13.4K
팬
Xiuyu Li
@sheriyuo
2026.09.04 18:16
读知乎回答有感,浅谈一下后训练 benchmark Any benchmark will be saturated,而随着工业界后训练的发展,reasoning / coding 的 benchmark 越来越泛化 / 众包化。其实 LLM eval 一直是个草台班子,每家都可以有自己的 setting,而任何 setting 只要不被强行统一就存在操作的空间,最早可以调 temperature / top_p / length,后来可以调 harness / setting。 AA 给出了一个相对“规范”的 setting,让大家都听它的而不是野蛮生长,但这并不 make sense。只要评测非中心化就一定存在 noise,任何结果都可以是 cherry pick 后的,而 AA 官方的 95% 置信度结果就成了 judge 模型能力的标杆。 代价是什么呢?模型如果没有很亮眼的 AA 分数,即使精心打磨体感 / working / CUA,无人在意,这本质也是模型要 sell 就要迎合表面主流的评测中心化组织。 至少我们可以从每家基模厂、每个新模型的发榜看出来大家并不会被 AA 所局限,而 OSWorld v2、ALE、TB4 / TB-Sci 等 frontier 众包 benchmark 已经告诉我们:最 frontier 的能力一定是最通用的能力,而 agent 已经站在了单 domain 能力的肩膀上。 现在的职业任务分为三类,已经被 AI 训练好的,无法被 AI 训练的,还在被 AI 训练的。所有能归纳在 Computer Use 的都是第三类,而模型如何解决第三类职业任务仍需要数年的进化。 这些众包 benchmark 越来越变成第三类任务的闭包,决定了未来数个月内基模团队的优化方向,而越是 frontier 的 benchmark 就越有 noise。如果 benchmark 团队不为自己的错题率负责,只会诞生越来越多的错题 benchmark:GPQA-Diamond,HLE,充斥大街的弱模型 judge。 为了消灭 LLM-judge 所引发的不确定性,众包 benchmark 一定会越来越商业化,而 evaluation 一定会在短暂的时间内迎来大洗盘。
더 보기
0
0
42
310
35
커뮤니티로 전달
인기 있는 사용자
オリコンニュース
@oricon
1.9M 팬
New York Post
@nypost
4.1M 팬
TVer新着
@TVer_info
100K 팬
空空道人
@Kongkongda5882
30.6K 팬
브라운더스트2 공식트위터
@BROWNDUST2_KR
21.5K 팬
「승리의 여신: 니케」 x 「P3R」, 「P4G」, 「P5R」 콜라보 진행 중
@NIKKE_kr
79.4K 팬
中國新聞社
@CNS1952
547.1K 팬
Girls' Generation
@GirlsGeneration
3.3M 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K 팬
一劍浣春秋
@chee828
230.9K 팬
吴说区块链
@wublockchain12
180.5K 팬
乐老爺 #JAV
@HappyLok1157
206.9K 팬
TPE48
@official_TPE48
11K 팬
看中國
@kanzhongguo
348.3K 팬
아이유(IU)
@_IUofficial
1.8M 팬