註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Oldeng
@dengdry
🇩🇪 现居德国|汽车工程师|AI 应用实践者 ⚙️ 写技术转型、产业观察与海外留学 🔬 用第一性原理拆 AI 和硬科技产业链
加入 April 2026
409 正在關注    5.1K 粉絲
一篇研究翻了 60 个语言模型基准,发现近一半已经快“测不出差别”了:模型分数都很高,榜单再涨也未必说明它更会干活。 对开发者来说,拿一套老题测出的高分,可能只是模型越来越熟悉出题方式。论文发现,专家持续设计题目与基准更不容易失效有关;测试集是否公开反而不是关键因素。 但这只是对基准特征的系统分析,不等于新题就一定更接近真实工作。至少以后看模型榜单,先问一句:这套题还有没有区分度?
顯示更多