TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
Joined November 2020
630
Following
12.5K
Followers
Xudong Han
@Xudong07452910
2026.07.31 03:30
给前沿 Agent 六天、3000 美元 API 额度和 GPU,它能独立做出一篇 NeurIPS 级论文吗? 这篇论文给出的早期答案很冷静: 代码能写,实验能跑,真正的研究问题却没有被推进。 作者提出了一种「影子评估」:拿两篇尚未公开的 NeurIPS 2026 投稿,只把核心研究问题交给 Agent。由于原论文还未公开,它无法直接检索答案,最后再由原作者按顶会标准评审。 Agent 独立完成了工程工作,但两篇最终都被明确拒稿,总评分分别只有 2/6 和 1/6。 最关键的问题集中在科学判断上。 它们很难判断证据是否足够,遇到研究设计问题时缺少新的解法,也不擅长从已经投入很多时间的错误方向中彻底退出。 更有意思的是,AI 自评其实多次指出了这些问题。Agent 往往只会补充限制说明,继续沿着原来的路线推进,很少真正重做研究设计。 我觉得这篇最有价值的地方,是它把科研 Agent 从「优化一个明确指标」,拉回了真正开放的研究过程。 样本目前只有两个案例,结论还很早。但它至少提醒我们: 今天的 Agent 已经很像执行力很强的研究助理。距离独立研究者,仍然差研究品味、证据标准和及时推倒重来的能力。 会做实验,和知道什么实验值得做,中间还隔着真正的科研能力。 📎 arxiv:
Show more
0
0
40
103
11
Forward to community
Most Popular Users
Tibo
@thsottiaux
781.3K Followers
Serenity
@aleabitoreddit
1.1M Followers
Elon Musk
@elonmusk
241.7M Followers
Donald J. Trump
@realDonaldTrump
111.9M Followers
Sam Altman
@sama
6.3M Followers
OpenAI
@OpenAI
5.4M Followers
New York Post
@nypost
4.2M Followers
zerohedge
@zerohedge
3.4M Followers
Wall St Engine
@wallstengine
199.1K Followers
SpaceXAI
@SpaceXAI
2.1M Followers
First Squawk
@FirstSquawk
569.5K Followers
Anthropic
@AnthropicAI
1.8M Followers
Ansem 🐂🀄️
@blknoiz06
1.4M Followers
Polymarket
@Polymarket
2M Followers
Kalshi
@Kalshi
472.9K Followers