TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖Building Personal AI Agents | Vibe Coding 🛠️分享AI 技术解析 | AI 应用心得 📩DM for collab
Joined November 2020
565
Following
9.9K
Followers
Xudong Han
@Xudong07452910
2026.07.12 03:35
如果 Research Agent 只能把 leaderboard 分数刷高,那它离真正做研究还差很远。 真正有价值的 ML 方法,需要换设置、换规模后依然成立,也要经得起复现和泛化检验。 这篇论文提出的 MLS-Bench,就是为了评估这个能力。 它覆盖 12 个核心 ML 领域、140 个任务。每个任务都放在受控 scaffold 里,让 Agent 改进一个具体 ML 系统,并在多个泛化设置下评测,最后和同一环境里复现的人类 SOTA 方法直接比较。 这样做的重点是防止 Agent 走捷径:比如改 evaluator、改数据管线、扩大模型容量,或者只在可见验证集上刷分。 结果很现实: 即使强 baseline 已经给到模型,当前 frontier agents 依然没有超过最强 human SOTA。Human SOTA 平均分是 42.6,最好的 Agent 是 Claude Opus 4.6,分数为 36.0;Gemini 3.1 Pro 是 34.9。 更多迭代和更大 test-time search 可以缩小差距,但很难真正弥合差距。模型目前更擅长调参、工程优化和重组已有组件;一旦要求它提出能稳定泛化的新机制,短板就会明显出现。 我觉得这篇论文把 Auto-Research 的门槛讲清楚了。 低成本 verifier 下的大规模搜索,可以帮模型找到更高分的候选方案,但真正的科研还需要科学判断力:知道该验证什么、怎么分配有限算力,以及如何把局部结果变成可信证据。 未来 Research Agent 的核心能力,可能会从「生成 idea」走向「构建证据」。 能写出一个 proposal 只是开始。能在昂贵、不完整、需要复现的验证条件下,把一个方法真正证明出来,才更接近机器学习研究。 📎 arxiv:
Show more
0
0
0
4
0
Forward to community
Most Popular Users
New York Post
@nypost
4.1M Followers
Serenity
@aleabitoreddit
1M Followers
billboard
@billboard
16.5M Followers
オリコンニュース
@oricon
1.9M Followers
Reuters
@Reuters
26.3M Followers
First Squawk
@FirstSquawk
556.5K Followers
BTS_official
@bts_bighit
45.3M Followers
Hello! Project Link
@UpFrontLink
15.5K Followers
Elon Musk
@elonmusk
241.4M Followers
一劍浣春秋
@chee828
0 Followers
Pirat_Nation 🔴
@Pirat_Nation
342K Followers
BLACKPINKOFFICIAL
@BLACKPINK
11.6M Followers
i-dle (아이들)
@official_i_dle
2.4M Followers
吴说区块链
@wublockchain12
179.2K Followers
INI
@official__INI
510.1K Followers