注册并分享邀请链接,可获得视频播放与邀请奖励。

Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖Building Personal AI Agents | Vibe Coding 🛠️分享AI 技术解析 | AI 应用心得 📩DM for collab
加入 November 2020
565 正在关注    9.9K 粉丝
给前沿 Agent 六天、3000 美元 API 额度和 GPU,它能独立做出一篇 NeurIPS 级论文吗? 这篇论文给出的早期答案很冷静: 代码能写,实验能跑,真正的研究问题却没有被推进。 作者提出了一种「影子评估」:拿两篇尚未公开的 NeurIPS 2026 投稿,只把核心研究问题交给 Agent。由于原论文还未公开,它无法直接检索答案,最后再由原作者按顶会标准评审。 Agent 独立完成了工程工作,但两篇最终都被明确拒稿,总评分分别只有 2/6 和 1/6。 最关键的问题集中在科学判断上。 它们很难判断证据是否足够,遇到研究设计问题时缺少新的解法,也不擅长从已经投入很多时间的错误方向中彻底退出。 更有意思的是,AI 自评其实多次指出了这些问题。Agent 往往只会补充限制说明,继续沿着原来的路线推进,很少真正重做研究设计。 我觉得这篇最有价值的地方,是它把科研 Agent 从「优化一个明确指标」,拉回了真正开放的研究过程。 样本目前只有两个案例,结论还很早。但它至少提醒我们: 今天的 Agent 已经很像执行力很强的研究助理。距离独立研究者,仍然差研究品味、证据标准和及时推倒重来的能力。 会做实验,和知道什么实验值得做,中间还隔着真正的科研能力。 📎 arxiv:
显示更多
0
40
103
11
转发到社区