Command Palette
Search for a command to run...
AI 智能体能否开展开放式 AI 研究?来自两项案例研究的早期证据
AI 智能体能否开展开放式 AI 研究?来自两项案例研究的早期证据
摘要
关于 AI 能力将爆发式进步的预测,取决于 AI 智能体能否实现 AI 研究的自动化。然而,关于智能体是否能够开展开放式 AI 研究的证据仍然薄弱。当前的评估方法要么在狭窄、可验证的任务上测试智能体,从而排除了开放式研究;要么将 AI 生成的论文提交给盲审,但这种方式负担过重、充满随机性且审稿质量低下。我们引入了第三种衡量 AI 研发自动化进展的方法:让智能体承担一篇高质量未发表论文的核心、开放式研究问题,并由该论文的原作者对其产出进行评分。我们称这种方法为影子评估。我们对两篇未发表的 NeurIPS 2026 投稿进行了影子评估,为前沿智能体提供了六天时间和价值数千美元的计算资源。这些智能体在没有人类帮助的情况下完成了所有工程工作,但未能在回答研究问题方面取得实质性进展。因此,两篇论文均被作者明确拒稿。我们识别出五种反复出现的失败模式:对可发表研究的门槛判断不佳、对研究设计缺陷的回应缺乏创造性、从死胡同中无效回溯、资源意识薄弱以及指令漂移。使用第二个模型和框架进行的稳健性检验复现了这些失败。我们公开了专家评审、问卷回复、智能体代码库和运行日志。我们的结果提供了早期证据,表明当今的智能体能够完成 AI 研究的工程部分,但在研究生命周期的关键环节上仍面临困难。
一句话总结
来自普林斯顿大学、Cornflower Labs、英国AI安全研究所等机构的团队提出了影子评估,在评估中,前沿AI agents尝试解决未发表论文的核心研究问题,并发现尽管agents能自主完成工程任务,但由于五个反复出现的失败模式,它们未能取得实质性的研究进展,这表明当前的agents还无法进行开放式的AI研究。
核心贡献
- 本文提出了影子评估,这是一种新的评估范式,其中agent处理高质量未发表论文的开放式研究问题,而原论文作者对其输出进行评分。
- 将影子评估应用于两份NeurIPS 2026投稿,前沿agents自主完成了所有工程任务,但未能在核心研究问题上取得实质性进展,导致作者明确拒稿。
- 该工作识别出五种反复出现的失败模式(对可发表性判断力差、对设计缺陷的回应缺乏创意、无效回溯、资源意识差和指令漂移),并在第二个模型和scaffold上复现了这些模式,同时发布了所有相关产物,包括专家评审、agent仓库和日志。
引言
AI agents能否自主进行AI研究是快速自我改进预测的核心问题,但现有的评估方法要么局限于具有固定指标的可验证任务,要么依赖于嘈杂的盲审同行评审,使得开放式研究技能在很大程度上未被衡量。作者提出了影子评估,这种方法将前沿agent赋予一篇高质量未发表论文的研究问题,并提供充裕的计算和时间预算,然后由原论文作者像会议审稿人一样对生成的论文进行评分。将这种方法应用于两篇NeurIPS 2026论文后,作者发现即使资源充足的agents也无法在顶级会议水平上产出原创性工作,它们表现出判断力差、资源意识有限、无法创造性地回应反馈,以及未能从无前景的方向上回溯。
方法
作者提出了一种名为影子评估的新评估协议,旨在衡量AI agents在开放式任务上的研究能力,并接受专家级的审查。与基于自动验证器的基准测试和盲审同行评审不同,影子评估要求agent回答一个真实的、未发表的研究问题,然后由该问题的原论文作者如同对会议投稿一样对agent的输出进行评分。这一设计避免了训练数据记忆的污染风险,能够对新颖性和正确性进行深入的定性评估,并反映了许多递归自我改进预测所设想的委托场景。
核心工作流程首先从一篇尚未公开的论文中选取一个研究问题。在实验中,作者使用了两个这样的问题:一个关于LLM角色的结构与可控性,另一个关于为表格基础模型设计分布偏移检测器。原始研究人员为agent制定了问题,但没有暗示任何有前景的方向,并设定了足以实质性解决问题的资源预算,随后依据顶级AI期刊的标准对生成的论文进行评分。这种设置将原论文作者定位为唯一合格的评审人,他们兼具深厚的主题专业知识,并能判断agent是否在他们花费数月研究的问题上取得了真正的进展。
Agent的设置尽可能通用,以避免对特定任务过度拟合。实验在OpenClaw scaffold上运行Claude Opus 4.8,并启用了超高推理能力。Agent可以完全访问Linux虚拟机,能够监控自身的API支出、计算预算和剩余时间,并允许将工作委托给subagents,同时维护一份持续更新的研究日志。一个self-review subagent被限制只能查看最终的PDF和NeurIPS审稿模板,并被要求像合格的审稿人一样评估论文。Agent还被引导使用三个外部AI审稿工具以获得额外反馈。Scaffold仅针对通用机器学习研究的可用性进行了修改,每次人工干预均有记录。在运行过程中,仅需三次干预:修复测试框架中的一个bug、将截止时间延长24小时以便agent在已识别出薄弱之处的草稿上进行迭代,以及要求重写论文以提高可读性。这些干预均不针对任何一个研究问题。
该方法解决了先前评估方法的若干弱点。由于研究结果未在网上公开,评估不会受到污染。由专家主导的深入评分能够捕捉到自动指标或负担过重的会议审稿人常常忽略的研究质量维度。该设计具有可重复性:新的未发表论文可作为未来的测试案例,而相同的模板可被更强大的模型和scaffolds复用。尽管该方法存在局限性:非盲审可能引入偏见,且每次评估需要大量专家时间,限制了规模,但作者认为,影子评估是对可验证基准测试和盲审的补充,为AI研发自动化提供了一个独特的视角。
实验
该研究通过影子评估评估了前沿AI agents能否自主进行新颖的AI研究:agents获得了两篇真实论文同样的未发表研究问题,并由原论文作者审查其输出。在使用Claude Opus 4.8的实验以及GPT-5.6 Sol的稳健性测试中,agents未能生成达到顶级会议标准的论文,表现出了过早承诺弱假设、无法有效整合反馈以及研究质量校准不佳等问题,尽管它们成功完成了GPU调试和大规模实验等工程任务。结果表明,尽管当前的AI agents能够处理AI研发的工程先决条件,但仍缺乏创造性判断、有效回溯和上下文感知能力,而这些正是真正的研究贡献所必需的。
专家评审人对两篇AI生成的论文进行了评估,并认为二者均为明确的拒稿,在质量、清晰度、重要性和总体评估等方面的得分均较低。评审意见指出实验选择缺乏原则、推理能力差、行文冗长密实,表明当前agents在开放式AI研发任务中难以产出连贯且论证充分的研究。两篇论文均被评为明确拒稿,评审人对其判断充满信心。评估认为,实验选择缺乏原则、对先前工作的论证薄弱以及行文冗长不清晰是主要弱点。
先前关于AI研发评估的工作大致分为两类:通过固定指标评分的可自动验证任务,以及由人类同行评审判断的开放式任务。像MLE-Bench和RE-Bench这样的可验证基准测试提供了客观、可重复的评估,但仅限于可简化为单一数字的任务。相比之下,对完全自主研究的盲审虽然允许开放式工作,但随机性高,无法可靠地区分真正的进展与侥幸提交。大多数AI研发评估要么在狭窄指标上使用自动验证器,要么在开放式研究上使用人类盲审。可自动验证的任务客观且易于扩展,但将评估限制于具有单一数字得分的问题。AI会议的同行评审高度可变,一半的评分差异是主观的,委员会对大约四分之一的论文存在分歧。大量提交AI生成的论文并仅报告被接受的论文会夸大表面上的成功,因为盲审不要求披露失败的尝试。
影子评估通过专家评分和未受污染的任务,在开放式研究问题上评估AI agents,但受限于样本量小、非盲审以及问题选择范围窄,这限制了研究结果的普适性。Agents在未发表的研究问题上进行了测试,防止了训练数据的记忆。专家评审人知道论文是AI生成的,这引入了非盲审可能带来的偏见。
Agents的最终自我评审指出了许多与人类专家相同的局限性,但并未对最严重的缺陷进行优先排序。人类专家强调了人工挑选的特征选择和缺乏支持的泛化等根本性问题,而agents的自我评审将这些与次要问题并列,等同视之。这揭示了一个生成器-验证器差距:agents能够识别问题,但无法有效判断其相对重要性。人类专家和agent自我评审都注意到了人工挑选的、几乎正交的特征,但agents并未将其视为比其他不那么关键的问题更严重。Agents的自我评审与人类的批评相呼应,例如指出了缺乏阳性对照的主张,但它们仍未重新考虑整体的实验方法。
专家评审人在影子评估中评估了两篇AI生成的论文,使用未发表的问题以防止记忆,但评审是非盲的。两篇论文均因实验选择缺乏原则、论证薄弱和行文冗长而被一致拒绝,这表明当前agents无法产出连贯的开放式研究。Agents的自我评审指出了类似的缺陷,但未能优先处理最关键的问题,揭示了一个生成器-验证器差距。这些发现凸显了AI研究能力和现有评估方法的局限性,这些方法要么过于狭窄,要么过于随机。