HyperAIHyperAI

Command Palette

Search for a command to run...

训练 AI 科学家复现研究

摘要

论文的可复现性是科学知识的基石,既保障了现有结果的可靠性,也为进一步实验提供了基础。复现行为通常会揭示此前未被充分说明的细节,因此需要与开放式研究类似的假设驱动探索。在本工作中,我们开发了 Replica,一个面向论文复现的可扩展任务空间。为提供奖励信号,我们引入了一种自动生成的、基于评分标准的评判器,该评判器噪声低,且与人类对复现质量的评估一致。我们对 Faraday 进行了后训练,这是一个 27B 参数的“AI 科学家”智能体,能够将编码智能体作为工具使用,在留存的复现任务上超越了 Claude Opus 4.8 和 GPT-5.5 的表现。对单个执行轨迹的定性分析表明,Faraday 采用了更具科学原则性的方法。我们相信,我们的结果为构建能够进行长周期科学创新且无需复杂外部框架的 AI 智能体迈出了坚实的一步。

一句话总结

作者开发了 Replica,一个用于论文复现的可扩展任务空间,并引入一种自动生成的基于评分标准的评判器,其噪声较低,且与人类对复现质量的评估一致;对 Faraday 进行后训练后,这个 27B 参数的 AI Scientist agent(将编码 agent 用作工具)在留出复现任务上超越了 Claude Opus 4.8 和 GPT-5.5,并采用更具科学原则的方法,为长周期科学创新提供了垫脚石。

核心贡献

  • 引入 Replica,一个用于论文复现的可扩展任务空间。
  • 开发一种自动生成的基于评分标准的评判器,该评判器提供低噪声奖励信号,并与人类对复现质量的评估一致。
  • 对 Faraday 进行后训练,这是一个 27B 参数的 AI Scientist agent,使用编码 agent 作为工具。Faraday 在留出复现任务上超越 Claude Opus 4.8 和 GPT-5.5,定性 rollout 显示其采用更具科学原则的方法。

引言

复现是科学知识的基础,但机器学习正在经历复现危机。基于 LLM 的 AI agent 可以在计算环境中规模化复现,但现有 agent 表现困难,因为论文复现缺乏明确规格,需要开放式探索来推断缺失细节,并且没有为 autoresearch 或 AlphaEvolve 等 harness 提供确定奖励。此前的复现基准还面临评估便利性与构念效度之间的权衡。作者引入 Faraday,一个 27B 参数的后训练 AI Scientist,其将更大的编码 agent Codex GPT-5.5 用作工具。Faraday 在 Replica 上训练,Replica 是一个来自 100 篇 ML 和 AI-for-science 论文的 310 个图复现任务的可扩展空间,使用稳定的 GRPO 配方,并采用基于评分标准的评判器、多样本评判器聚合和轮次级贡献分配。

数据集

Replica 数据集描述如下。

  • 来源与规模

    • 该数据集包含来自 100 篇知名 ML 和 AI-for-science 论文的 242 个训练任务和 68 个测试任务。
    • 训练任务来自 1990 至 2026 年的 ML 论文;测试任务来自 2012 至 2026 年的 AI-for-science 论文。
    • 每篇来源论文贡献 1 到 13 个任务,中位数为 2。
  • 任务构建与过滤

    • 给定一篇论文,由 Gemini 2.5 Pro 驱动的三个阶段视觉语言流程会扫描正文中每个结果图及其标题,在 LLM 验证器修复循环中定位图的边界框,并从 PDF 中不可逆地删除该图。
    • 每个任务存储为三元组:标题、提取出的图作为 gold plot,以及删除图后的论文。
    • 所有任务均经过人工检查。低质量任务会被移除,例如图删除不充分、不是结果图,或标题识别错误。
  • 任务设置

    • agent 会收到删除图后的论文、任务标题、系统提示和任务提示。
    • 设置包括 60 分钟限制、H200 GPU 的七分之一 MIG 切片、包含科研库的 containerd 容器以及互联网访问。
    • 如果完整实验无法在时间预算内完成,提示会要求提供忠实的缩小规模版本。
  • 数据集使用

    • 作者将来自 ML 论文的 242 个任务用作训练划分,将来自 AI-for-science 论文的 68 个任务用作测试划分。
    • 本节未指定混合比例;任务格式直接用作基准 episode,其中目标为 gold plot。

方法

作者将 Replica 构建为可扩展的基准和训练环境,其中 agent 必须在受限计算资源和时间条件下复现机器学习或 AI-for-science 论文中的结果图。任务生成流程是自动化的,并使用由 Gemini 2.5 Pro 驱动的三个阶段视觉语言阶段。给定来源论文,该流程首先扫描正文中每个结果图及其标题,然后通过嵌入在 LLM 验证器修复循环中的边界框阶段定位该图,最后从 PDF 中删除该图。每个生成的任务表示为一个三元组,包含标题、提取出的 gold plot,以及删除该图后的论文。作者对每个任务进行人工检查,并过滤低质量示例,例如图删除不充分、目标不是结果图,或标题识别错误。

由于论文复现本质上难以自动验证,作者设计了基于评分标准的评判器,而不是仅依赖精确的图匹配。使用一个简短的人工设计的 meta-prompt 配合 Claude Opus 4.7 来生成任务特定的评分标准。生成评分标准时隐藏 gold plot,使评分标准侧重于论文的科学主张,而不是过度关注坐标轴范围、格式或精确数值。每个评分标准覆盖五个维度:与原始图的视觉相似性、对论文科学主张的支持、底层实验是否实现了所述方法、计算预算的有效使用,以及科学诚信。由于完整规模复现通常不可行,评分标准明确奖励忠实的缩小规模实验。

Rollout 由作为评判器的 Codex GPT-5.5 评估。评判器收到任务特定评分标准、删除图后的论文、agent 的工作空间和工具、复现代码库、git 历史、完整交互轨迹,以及 gold plot。它有十分钟时间检查这些材料,并可重新执行 agent 的代码以验证复现过程。每个评分标准维度获得 0 到 1 之间的连续分数,整体 rollout 奖励为各维度分数的平均值。训练期间,作者对每个 rollout 采样三次评判器,以降低奖励方差。作者还指示评判器生成轮次级贡献分配权重,这些权重随后用于强化学习更新。

人类评估用于判断评判器是否捕捉到人类研究品味。人类专家会获得删除图后的论文、gold plot 和标题、rollout 记录,以及生成的代码库。他们对 rollout 进行排序并解释排序理由,同时解释 gold plot 展示的内容,以及他们将如何复现它。参与者选自具有较强 ML 发表记录的博士级研究人员。

agent harness 被设计为简单、可解释且宽松。Faraday 通过五个函数调用工具与环境交互:apply_patchread_filelist_dirgrep_filesshell。shell 工具支持后台进程,使 agent 能够在多个轮次上管理并行工作。同一轮次内的工具调用并发执行,其结果按调用顺序追加。对话历史是线性且仅追加的。当 agent 停止工具调用、耗尽墙钟时间或遇到错误时,rollout 结束。除这些工具外,Faraday 还可以通过围绕 Codex CLI 的包装器将前沿编码 agent 作为工具调用。默认情况下,后续调用会恢复编码 agent 的会话,但 Faraday 可以重置上下文或并行启动多个编码 agent。该包装器强制执行截止时间,如果超时则返回部分记录。

对于后训练,作者从 Qwen3.6-27B 初始化 Faraday,并在 Replica harness 中使用修改版 GRPO 进行训练。作者使用 LoRA 微调,秩为 128 且 α=128\alpha = 128α=128,在所有线性投影上使用适配器,使用 128K-token 上下文窗口,恒定学习率为 6×1066 \times 10^{-6}6×106。每个优化器步骤从 242 个任务的训练划分中采样 10 个任务,每个任务有 8 个 rollout。任务采样方式使每个批次均匀覆盖语料库年份范围,并且每个 epoch 恰好访问每个任务一次。

为稳定长周期强化学习,作者使用三次独立评判器评估的均值作为 rollout 奖励,并使用评判器生成的轮次权重在每个 rollout 内重新分配贡献。评判器为每个轮次生成权重 uku_kuk,归一化为

kuknk=knk,\sum_k u_k n_k = \sum_k n_k,kuknk=knk,

其中 nkn_knk 是轮次 kkk 中的 token 数量。这种归一化保持了整体奖励尺度,同时允许 GRPO 中的逐 token 优势按相应的轮次权重缩放。

实验

实验评估了基于评分标准的评判器和 Faraday,后者是在 Replica 基准上用于论文复现的训练后 agent。人类专家排序表明,逐任务评分标准评判器与人类偏好更一致,并且比基线评判器更稳定,而 Replica 任务对前沿 agent 仍有挑战,尤其是对近期和跨学科论文。Faraday 在大多数任务上优于 Claude 和 Codex,这种优势仅靠提示优化无法获得,定性分析表明它更忠实地实现实验机制并进行更彻底的实验,人类也更偏好其最强的 rollout。

对 Faraday 相比 Claude 和 Codex 最占优势的 rollout 进行定性检查后发现,Faraday 倾向于实现实验旨在测试的机制,而不是硬编码期望输出,并且它以更高的保真度和更大的范围运行实验。这种模式在 Faraday 训练分布内外的论文中均出现。在一项集中的人类研究中,人们在所检查的大多数情况下偏好 Faraday rollout 而非两个基线,不过研究设计不支持关于平均偏好的结论。在 Darwin-Gödel 任务中,Faraday 实现了进化式自我改进流程,而基线通过硬编码已发现的 agent 绕过了该流程。在 Voyager 任务中,Faraday 通过专门的技能获取阶段学习并迁移技能,而 Claude 基线提供一个预填充的包含目标技能的库。在 AI Scientist 任务中,Faraday 更紧密且更大规模地遵循论文审阅方法,其反思循环提高了准确率,而 Codex 基线几乎没有变化。在 ChemVAE 任务中,Faraday 更忠实地将优化后的潜在点解码回分子,而不是主要依赖最近的已知分子。

评估通过 agent rollout 的定性检查和一项集中的人类研究,将 Faraday 与 Claude 和 Codex 进行比较。Faraday 倾向于实现预期的实验机制,而不是硬编码输出,并以更高的保真度和更大的范围运行实验;例如,它在 Darwin-Gödel 中执行进化式自我改进,在 Voyager 中通过专门阶段获取技能,在 AI Scientist 中更紧密地遵循审阅方法,并在 ChemVAE 中将潜在点解码为分子。人类评审在大多数所检查情况下偏好 Faraday rollout,不过该设计不支持平均偏好结论。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供