给前沿 Agent 六天、3000 美元 API 额度和 GPU,它能独立做出一篇 NeurIPS 级论文吗?
这篇论文给出的早期答案很冷静:
代码能写,实验能跑,真正的研究问题却没有被推进。
作者提出了一种「影子评估」:拿两篇尚未公开的 NeurIPS 2026 投稿,只把核心研究问题交给 Agent。由于原论文还未公开,它无法直接检索答案,最后再由原作者按顶会标准评审。
Agent 独立完成了工程工作,但两篇最终都被明确拒稿,总评分分别只有 2/6 和 1/6。
最关键的问题集中在科学判断上。
它们很难判断证据是否足够,遇到研究设计问题时缺少新的解法,也不擅长从已经投入很多时间的错误方向中彻底退出。
更有意思的是,AI 自评其实多次指出了这些问题。Agent 往往只会补充限制说明,继续沿着原来的路线推进,很少真正重做研究设计。
我觉得这篇最有价值的地方,是它把科研 Agent 从「优化一个明确指标」,拉回了真正开放的研究过程。
样本目前只有两个案例,结论还很早。但它至少提醒我们:
今天的 Agent 已经很像执行力很强的研究助理。距离独立研究者,仍然差研究品味、证据标准和及时推倒重来的能力。
会做实验,和知道什么实验值得做,中间还隔着真正的科研能力。
📎 arxiv:
显示更多