TwiScan
热门
社区
账号集合
登录
注册
English
日本語
한국의
简体中文
繁体中文
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
Xiuyu Li
@sheriyuo
Researcher
@StepFun_ai
| Working on long-horizon tasks | Prev
@RUC1937
| Opinions are my own
加入 February 2026
1.8K
正在关注
13.4K
粉丝
Xiuyu Li
@sheriyuo
2026.09.04 18:16
读知乎回答有感,浅谈一下后训练 benchmark Any benchmark will be saturated,而随着工业界后训练的发展,reasoning / coding 的 benchmark 越来越泛化 / 众包化。其实 LLM eval 一直是个草台班子,每家都可以有自己的 setting,而任何 setting 只要不被强行统一就存在操作的空间,最早可以调 temperature / top_p / length,后来可以调 harness / setting。 AA 给出了一个相对“规范”的 setting,让大家都听它的而不是野蛮生长,但这并不 make sense。只要评测非中心化就一定存在 noise,任何结果都可以是 cherry pick 后的,而 AA 官方的 95% 置信度结果就成了 judge 模型能力的标杆。 代价是什么呢?模型如果没有很亮眼的 AA 分数,即使精心打磨体感 / working / CUA,无人在意,这本质也是模型要 sell 就要迎合表面主流的评测中心化组织。 至少我们可以从每家基模厂、每个新模型的发榜看出来大家并不会被 AA 所局限,而 OSWorld v2、ALE、TB4 / TB-Sci 等 frontier 众包 benchmark 已经告诉我们:最 frontier 的能力一定是最通用的能力,而 agent 已经站在了单 domain 能力的肩膀上。 现在的职业任务分为三类,已经被 AI 训练好的,无法被 AI 训练的,还在被 AI 训练的。所有能归纳在 Computer Use 的都是第三类,而模型如何解决第三类职业任务仍需要数年的进化。 这些众包 benchmark 越来越变成第三类任务的闭包,决定了未来数个月内基模团队的优化方向,而越是 frontier 的 benchmark 就越有 noise。如果 benchmark 团队不为自己的错题率负责,只会诞生越来越多的错题 benchmark:GPQA-Diamond,HLE,充斥大街的弱模型 judge。 为了消灭 LLM-judge 所引发的不确定性,众包 benchmark 一定会越来越商业化,而 evaluation 一定会在短暂的时间内迎来大洗盘。
显示更多
0
0
42
310
35
转发到社区
热门用户
狱
@Wx1n11124
191.4K 粉丝
オリコンニュース
@oricon
1.9M 粉丝
New York Post
@nypost
4.1M 粉丝
Gxtimer 原创
@GxtimerTv
194.2K 粉丝
空空道人
@Kongkongda5882
30.6K 粉丝
乐老爺 #JAV
@HappyLok1157
206.9K 粉丝
一劍浣春秋
@chee828
230.9K 粉丝
吴说区块链
@wublockchain12
180.5K 粉丝
李李Momo💋
@Lili33O49
23.7K 粉丝
中國新聞社
@CNS1952
547.1K 粉丝
华尔街观察 Xtrader
@cnfinancewatch
126.4K 粉丝
TVer新着
@TVer_info
99.9K 粉丝
彭博商業周刊 / 中文版
@BloombergBWCN
41.6K 粉丝
看中國
@kanzhongguo
348.2K 粉丝
狗D和小桃(主页完整)
@Wx1n111124
52.1K 粉丝