TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
参加 November 2020
625
フォロー中
12.3K
ファン
Xudong Han
@Xudong07452910
2026.07.12 03:35
如果 Research Agent 只能把 leaderboard 分数刷高,那它离真正做研究还差很远。 真正有价值的 ML 方法,需要换设置、换规模后依然成立,也要经得起复现和泛化检验。 这篇论文提出的 MLS-Bench,就是为了评估这个能力。 它覆盖 12 个核心 ML 领域、140 个任务。每个任务都放在受控 scaffold 里,让 Agent 改进一个具体 ML 系统,并在多个泛化设置下评测,最后和同一环境里复现的人类 SOTA 方法直接比较。 这样做的重点是防止 Agent 走捷径:比如改 evaluator、改数据管线、扩大模型容量,或者只在可见验证集上刷分。 结果很现实: 即使强 baseline 已经给到模型,当前 frontier agents 依然没有超过最强 human SOTA。Human SOTA 平均分是 42.6,最好的 Agent 是 Claude Opus 4.6,分数为 36.0;Gemini 3.1 Pro 是 34.9。 更多迭代和更大 test-time search 可以缩小差距,但很难真正弥合差距。模型目前更擅长调参、工程优化和重组已有组件;一旦要求它提出能稳定泛化的新机制,短板就会明显出现。 我觉得这篇论文把 Auto-Research 的门槛讲清楚了。 低成本 verifier 下的大规模搜索,可以帮模型找到更高分的候选方案,但真正的科研还需要科学判断力:知道该验证什么、怎么分配有限算力,以及如何把局部结果变成可信证据。 未来 Research Agent 的核心能力,可能会从「生成 idea」走向「构建证据」。 能写出一个 proposal 只是开始。能在昂贵、不完整、需要复现的验证条件下,把一个方法真正证明出来,才更接近机器学习研究。 📎 arxiv:
もっと見る
0
0
0
4
0
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
New York Post
@nypost
4.2M ファン
TVer新着
@TVer_info
100.9K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K ファン
吴说区块链
@wublockchain12
181.5K ファン
Reuters
@Reuters
26.4M ファン
First Squawk
@FirstSquawk
569.4K ファン
ファミ通.com
@famitsu
1.4M ファン
Bloomberg
@business
10.5M ファン
モデルプレス
@modelpress
2.1M ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.3K ファン
billboard
@billboard
16.8M ファン
一劍浣春秋
@chee828
0 ファン
MANTANWEB/毎日キレイ
@mantanweb
68.9K ファン
Yahoo!ニュース
@YahooNewsTopics
2.1M ファン