TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Xiuyu Li
@sheriyuo
Researcher
@StepFun_ai
| Working on long-horizon tasks | Prev
@RUC1937
| Opinions are my own
参加 February 2026
1.8K
フォロー中
13.4K
ファン
Xiuyu Li
@sheriyuo
2026.09.04 18:16
读知乎回答有感,浅谈一下后训练 benchmark Any benchmark will be saturated,而随着工业界后训练的发展,reasoning / coding 的 benchmark 越来越泛化 / 众包化。其实 LLM eval 一直是个草台班子,每家都可以有自己的 setting,而任何 setting 只要不被强行统一就存在操作的空间,最早可以调 temperature / top_p / length,后来可以调 harness / setting。 AA 给出了一个相对“规范”的 setting,让大家都听它的而不是野蛮生长,但这并不 make sense。只要评测非中心化就一定存在 noise,任何结果都可以是 cherry pick 后的,而 AA 官方的 95% 置信度结果就成了 judge 模型能力的标杆。 代价是什么呢?模型如果没有很亮眼的 AA 分数,即使精心打磨体感 / working / CUA,无人在意,这本质也是模型要 sell 就要迎合表面主流的评测中心化组织。 至少我们可以从每家基模厂、每个新模型的发榜看出来大家并不会被 AA 所局限,而 OSWorld v2、ALE、TB4 / TB-Sci 等 frontier 众包 benchmark 已经告诉我们:最 frontier 的能力一定是最通用的能力,而 agent 已经站在了单 domain 能力的肩膀上。 现在的职业任务分为三类,已经被 AI 训练好的,无法被 AI 训练的,还在被 AI 训练的。所有能归纳在 Computer Use 的都是第三类,而模型如何解决第三类职业任务仍需要数年的进化。 这些众包 benchmark 越来越变成第三类任务的闭包,决定了未来数个月内基模团队的优化方向,而越是 frontier 的 benchmark 就越有 noise。如果 benchmark 团队不为自己的错题率负责,只会诞生越来越多的错题 benchmark:GPQA-Diamond,HLE,充斥大街的弱模型 judge。 为了消灭 LLM-judge 所引发的不确定性,众包 benchmark 一定会越来越商业化,而 evaluation 一定会在短暂的时间内迎来大洗盘。
もっと見る
0
0
42
310
35
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
TVer新着
@TVer_info
99.9K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K ファン
New York Post
@nypost
4.1M ファン
一劍浣春秋
@chee828
230.9K ファン
モデルプレス
@modelpress
2M ファン
ファミ通.com
@famitsu
1.4M ファン
AKB48公式
@AKB48_staff
289.4K ファン
NMB48 Official
@nmb48_official
133.7K ファン
フレッシュ撮影会【公式】
@fresh_akiba
94.3K ファン
乃木坂46
@nogizaka46
2M ファン
HKT48
@hkt48_official_
150.8K ファン
STU48
@STU48_official_
103.9K ファン
INI
@official__INI
508.3K ファン
22/7(ナナブンノニジュウニ)
@227_staff
64.3K ファン