Command Palette
Search for a command to run...
27B AI 科学家论文复现能力超越 GPT-5.5/Claude Opus 4.8,Faraday 探索长程科学创新

论文的可复现性是科学知识体系的基石,它既能确保已有研究结果的可靠性,也能为进一步的实验提供基础。
然而,当前各个科学领域都面临着「可复现性危机」,机器学习领域尤其如此。从理论上讲,基于大语言模型(LLM)的 AI 智能体可以为解决这一危机提供一种可规模化的方案,然而在实践中,论文复现对现有 AI 智能体提出了三个方面的挑战——首先,复现一篇论文的问题从定义上来说就是信息不完备的,即论文只是对促成某项发现的完整研究过程进行了有损压缩,因此必然遗漏部分细节;其次,现有 AI 智能体主要针对定义明确、封闭式的问题进行了大量训练,而论文复现则要求智能体进行开放式探索;最后,对于一般性的复现任务而言,并不存在一个明确的奖励函数,可以据此持续进行「爬坡式」优化。
针对该挑战,来自 Inherent Labs 的研究团队训练了一种能够复现科研论文的「AI 科学家」智能体 Faraday 。这一基于 LLM 的智能体将 Codex GPT-5.5 作为工具使用,其方式类似于人类 AI 研究人员使用编程智能体。在基于评分标准的评判器评价中,Faraday 在 73% 的分布内机器学习任务以及 60% 的留出型 AI for Science 任务上超过了 Claude Opus 4.8 和 GPT-5.5 。
值得注意的是,Faraday 仅拥有 270 亿参数,但它能够指导一个拥有 5 万亿参数的模型开展工作,并由此获得相较于单独使用这一更大模型而言具有实际意义的性能提升。对单次运行结果进行定性分析表明,Faraday 采用了一种更加遵循科学原则的方法。
相关研究成果以「Training AI Scientists to Replicate Research」为题,已发布预印本于 arXiv 。
研究亮点:
* 本研究构建了一个自动生成的任务空间,其中包含来自 100 篇机器学习和 AI for Science 论文的 310 个图表复现任务,论文发表时间跨度为 1990—2026 年
* 本研究提出一种适用于长周期、不可验证任务的稳定 GRPO 后训练方法,该方法包括针对每项任务的评分标准评判器、多样本评判结果聚合,以及逐轮信用分配机制
* 本研究训练了一个拥有 270 亿参数、能够将编程智能体作为工具(Coding Agents as Tools,CAT)的智能体,实验从定量和定性两个层面均表明,Faraday 展现出了更强的科学严谨性
论文地址:
https://hyper.ai/papers/2608.13331
构建自动生成的任务空间 Replica
为了训练 Faraday,研究人员构建了一个名为 Replica 的可扩展任务空间。 Replica 任务空间由 242 个训练任务和 68 个测试任务组成,这些任务来自 100 篇知名的机器学习(ML)和 AI for Science 论文。每项任务都要求智能体复现论文中的一张结果图,智能体能够获得经过图表遮蔽处理的原始论文,并受到 60 分钟的时间限制,同时只能使用一块 H200 GPU 的 1/7 MIG 切片。
系统为智能体提供一个 containerd 容器作为工作环境,其中预装了有用的科研库,并提供互联网访问权限、系统提示词以及任务提示词。如果论文中的实验无法在规定的时间预算内完成,提示词会要求智能体在尽可能忠实于原始实验的前提下,对实验进行缩减后再完成。
* 训练任务来自 1990—2026 年发表的机器学习论文
* 测试任务来自 2012—2026 年发表的 AI for Science 论文
值得注意的是,这些任务均为自动生成,因此整个任务空间具有良好的可扩展性。对于给定的一篇论文,系统通过三个视觉语言处理阶段将其转换为一个任务,这三个阶段均由 Gemini 2.5 Pro 驱动——首先,扫描阶段会识别正文中的所有结果图及其图注;随后,定位阶段在 LLM 验证器的修复循环中确定图表的边界框;最后,从 PDF 中对该图表进行不可逆的遮蔽处理。一个完整任务由三部分组成:图注、提取出的原始图表(「gold plot」)以及图表已被遮蔽的论文。
研究团队会对每项任务进行人工检查,并过滤掉质量较低的任务,例如图表遮蔽不充分、图表并非结果图,或者图注识别错误等情况。每篇论文贡献 1—13 个任务,中位数为 2 个任务。
一种适用于长周期、不可验证任务的稳定 GRPO 后训练方法
简单智能体框架
Agent Harness 为大语言模型(LLM,输入/输出均为 token)与环境(输入动作/输出状态)之间提供接口:
* 可用能力与上下文
智能体通过五个函数调用工具执行操作——apply_patch 、 read_file 、 list_dir 、 grep_files 和 shell 。 Faraday 可以利用 shell 工具将后台进程与当前会话分离,从而在并行运行多个命令的同时执行多轮操作。一轮操作中的工具调用会并发执行,其结果按照调用顺序追加到历史记录中。如果发生上下文溢出、超过每轮 16K token 的限制,或出现推理错误,则本次运行结束;即使是这种未完成的运行结果,也会像其他运行结果一样接受评判。在其他情况下,当 Faraday 在不调用工具的情况下直接回复,或者达到规定的实际运行时间上限时,本次运行结束。
* 将编程智能体作为工具(CAT)
Faraday 配备了一个前沿编程智能体,并将其作为工具使用。一个包装脚本以非交互方式运行 Codex CLI,Faraday 可以通过 shell 工具调用该脚本,并获得编程智能体的命令、输出和消息所构成的记录,其中还包含每一步操作的耗时。默认情况下,连续调用会继续使用编程智能体此前的会话状态,不过,Faraday 也可以选择重置上下文,或者并行运行多个编程智能体。包装脚本会强制执行截止时间,该时间可以由 Faraday 针对每次请求单独设置。如果超过截止时间,则返回部分交互记录。编程智能体所使用的模型是一个运行时参数:在大部分训练过程中,使用 GPT-5.4 mini;在最终阶段以及评估过程中,则使用 GPT-5.5 。
后训练方案
为了获得 Faraday,研究人员在 Faraday 智能体框架中,基于 Replica 任务空间,采用经过修改的 GRPO 对 Qwen3.6-27B 进行后训练。研究人员采用 LoRA 微调,秩(rank)设为 128,𝛼 = 128;在所有线性投影层上训练适配器,使用 128K token 的上下文窗口,学习率固定为 6 × 10−6 。 Adam 优化器的每一步都会从包含 242 个任务的 Replica 训练集划分中抽取一个包含 10 个任务的批次,每个任务对应 8 次运行。
任务采样方式确保每个批次都均匀覆盖整个语料库的年份范围;同时,每个训练 epoch 都会恰好访问每个任务一次,从而避免某一特定科学时期的数据在某次参数更新中占据主导地位。
长周期训练稳定性
后训练需要在一个不可验证的领域中开展长周期强化学习,而这一设置已知容易出现训练不稳定甚至模型崩溃。造成这种不稳定的两个因素是奖励信号的高方差和统一的信用分配。为解决这一问题,研究人员在训练阶段对评判器进行了两项修改。
首先,其使用三次独立评判结果的平均值来计算一次运行结果(rollout)层面的奖励。其次,要求评判器生成逐轮权重,为运行过程中的各轮操作分配信用。通过这种方式,可以在一次运行结果内部重新分配信用,而不会改变参数更新的整体幅度。
Faraday 在定性和定量层面都更具科研严谨性
在评测 Faraday 的能力之前,实验结果首先验证了 Replica 任务本身具有足够的挑战性——Claude Opus 4.8 是研究中表现最强的基线模型之一,但包括 Claude 和 GPT-5.5 在内的前沿 Coding Agent 均没有在 Replica 任务上达到饱和。研究还发现,论文发表时间越新,复现难度通常越高;AI for Science 论文整体上也比传统机器学习论文更难复现。研究团队推测,这一方面可能与较新的论文在模型预训练数据中的信息密度更低有关,另一方面也可能是因为新近研究通常需要更高的计算资源,使得如何进行合理的规模缩减更加困难。
Faraday 的论文复现能力优于 Claude 和 Codex
研究人员在整个 Replica 任务分布上,将 Faraday 与各基线模型进行比较(如下图)。无论是在训练任务还是测试任务上,与基础版 Qwen 模型相比,Faraday 的性能都实现了全面提升。在分布内任务上,Faraday 在 73% 的任务中超过 Claude 和 Codex;在分布外任务上,Faraday 在 60% 的任务中超过 Claude 和 Codex 。

进一步将评判器的总得分拆解为不同子维度后可以发现,Faraday 在实验深度、论断复现和视觉保真度方面优于基线模型,而在科学诚信和实现忠实度方面与 Claude 表现相当(见下图)。

为了检验 Faraday 的优势是否仅通过提示词优化就可以获得,研究人员针对 Codex 基线模型进行了 24 轮自动提示词优化,将最终得到的提示词与原始 Codex 以及 Faraday 进行比较,结果如下图:

优化后的提示词并没有取得具有实际意义的性能提升,因此与 Faraday 之间的差距依然存在。优化后的提示词确实识别出了运行结果中出现的具体失败模式,但并未成功解决这些问题:后训练带来的性能提升似乎无法仅通过提示词工程获得。
Faraday 在定性层面展现出更严谨的科研能力
为了理解 Faraday 相较于 Claude 和 Codex 基线模型究竟有何改进,研究人员对部分具体的运行结果进行了人工分析,重点考察那些 Faraday 的评分标准评判器得分大幅超过 Claude 和 Codex 最高得分的案例。下表展示了一些具有代表性的例子:

分析中反复出现两种模式——第一,Faraday 会真正实现实验所要检验的机制,而基线模型则往往直接硬编码预期输出,或者退而采用过度简化的方法,因而无法真正复现图表所对应的核心论断;第二,Faraday 在实验范围方面更加全面,能够复现原始实验中更多的内容,同时避免进行不必要的删减。
对「想象式」复现(imagined replications)的泛化能力
研究人员还进一步评估了 Faraday 对「想象式」复现的泛化能力(如下图)。其要求 Claude Opus 4.8 从 Replica 训练集和测试集中分别随机选取 5 篇论文,并为每篇论文生成两种变体,在这些任务上分别评估 Faraday 和 Codex GPT-5.5 。
在 20 项任务中的 19 项上,评判器都更偏好 Faraday 的运行结果,而非 Codex 的结果。从较弱的意义上说,Faraday 不仅比前沿模型具有更好的复现能力,也表现出更强的创新能力。不过,研究人员也谨慎指出,其评分标准评判器从未针对「想象式」任务进行验证,因此这一结论仍需要未来研究进一步验证。
结语
如果说过去的 AI Scientist 更像一个会做实验的工程师,那么 Faraday 所探索的 CAT 范式,则试图让 AI 进一步具备知道该做什么的科研判断力。决定研究方向、合理划定实验范围、判断复现结果是否可信,这些能力一旦沉淀在外层智能体中,就有望随着底层前沿模型的持续升级而不断叠加。
更值得关注的是,这一范式也为 AI 能力发展与安全提供了新的思路:让一个相对小型的模型负责科研判断,让更强大的模型负责工程执行。未来,AI Scientist 的竞争或许不再只是模型参数规模之争,而将转向如何形成更好的科研判断、工具调用与人机协作能力。
参考文献:








