TwiScan
热门
社区
账号集合
登录
注册
English
日本語
한국의
简体中文
繁体中文
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
Oldeng
@dengdry
🇩🇪 现居德国|汽车工程师|AI 应用实践者 ⚙️ 写技术转型、产业观察与海外留学 🔬 用第一性原理拆 AI 和硬科技产业链
加入 April 2026
409
正在关注
5.1K
粉丝
Oldeng
@dengdry
2026.08.05 11:05
一篇研究翻了 60 个语言模型基准,发现近一半已经快“测不出差别”了:模型分数都很高,榜单再涨也未必说明它更会干活。 对开发者来说,拿一套老题测出的高分,可能只是模型越来越熟悉出题方式。论文发现,专家持续设计题目与基准更不容易失效有关;测试集是否公开反而不是关键因素。 但这只是对基准特征的系统分析,不等于新题就一定更接近真实工作。至少以后看模型榜单,先问一句:这套题还有没有区分度?
显示更多
0
0
0
0
0
转发到社区
热门用户
狱
@Wx1n11124
0 粉丝
New York Post
@nypost
4.2M 粉丝
オリコンニュース
@oricon
1.9M 粉丝
TVer新着
@TVer_info
101K 粉丝
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K 粉丝
吴说区块链
@wublockchain12
181.6K 粉丝
玉米棒棒
@fljjx61
0 粉丝
Reuters
@Reuters
26.4M 粉丝
空空道人
@Kongkongda5882
34.4K 粉丝
Bloomberg
@business
10.5M 粉丝
First Squawk
@FirstSquawk
569.7K 粉丝
看中國
@kanzhongguo
348.9K 粉丝
华尔街观察 Xtrader
@cnfinancewatch
130.8K 粉丝
中國新聞社
@CNS1952
547.7K 粉丝
billboard
@billboard
16.8M 粉丝