HyperAIHyperAI

Command Palette

Search for a command to run...

FrontierChallenge:评估科学工作流完成度

摘要

科学智能体日益广泛地分析数据、执行代码并生成研究产物,然而大多数基准测试侧重于最终答案、孤立程序或单一领域。我们引入了 FRONTIERCHALLENGE,这是一个跨领域基准测试,包含 300 个端到端科学工作流。在本文中,我们发布并评估了其中 97 个任务,涵盖量子化学、分子动力学、材料表征、分析化学、生命科学以及电化学/环境科学。每个任务提供固定输入,并指定一组必需的科学交付物。我们使用三种智能体脚手架评估了十二个前沿模型。通过率(Pass Rate)衡量满足完全完成标准的任务比例,而平均得分(Avg. Score)则捕捉部分进展。每个表现最佳的配置仅完成了 97 个已发布任务中的 20 个,通过率为 20.6%。部分进展在分析化学和电化学/环境科学领域尤其难以转化为完整交付:平均得分分别达到 87.6 和 94.9,但最高通过率仅为 4% 和 0%。在未通过的 Claude Code 轨迹中,75.5% 仍以声称完成的语言结束。这些发现表明,无论是高分部分得分还是自信的完成声明,都不能可靠地指示科学任务已完全交付,凸显了将端到端工作流执行与科学交付物完整性共同评估的必要性。

一句话总结

Apodex 团队推出 FRONTIERCHALLENGE,这是一个跨领域基准测试,包含 300 个端到端科学工作流(已发布 97 个),涵盖量子化学、分子动力学、材料表征、分析化学、生命科学以及电化学/环境领域,并使用三种脚手架评估了十二个前沿模型。研究发现,最佳配置仅完成 20.6%20.6\%20.6% 的任务,且较高的部分得分(最高 94.994.994.9 平均分)和自信的完成声明(75.5%75.5\%75.5% 的未通过轨迹)并不能很好地预测完整交付,这凸显了联合评估工作流执行与交付物完整性的必要性。

核心贡献

  • 推出 FRONTIERCHALLENGE,这是一个包含 300 个端到端科学工作流的跨领域基准测试,并发布 97 个任务,涵盖六个领域(量子化学、分子动力学、材料表征、分析化学、生命科学和电化学/环境),每个任务均配有固定输入、交付物契约和任务专属的可执行 Grader。
  • 提出基于契约的评估框架,使用通过率衡量完整完成,使用平均分衡量部分进展,并通过使用三种 agent 脚手架评估十二个前沿模型表明,最佳配置的通过率仅为 20.6%,尽管平均分达到 87.9,这说明较高的部分得分并不等同于完整交付。
  • 对 970 条 Claude Code 轨迹进行失败分析,揭示 75.5% 的未通过运行以声称完成的语言结束,并表明工具错误在通过和未通过运行中均会出现,从而确立最终自我报告和错误存在与否是科学交付物成功完成的弱指标。

引言

语言模型正从文本生成器演变为能够规划、调用工具、执行代码和修改文件的 agent,近期系统已将 agent 能力扩展到需要可检查输出的多阶段研究工作流。现有基准测试通常评估最终答案、交互轨迹或单个程序,这无法充分捕捉 agent 是否能够完成依赖于多个分析阶段和多种必需交付物的异构科学工作。为解决这一问题,作者引入 FRONTIERCHALLENGE,这是一个基准测试,考察 agent 能否从输入处理到最终交付物独立执行指定的科学工作流,并满足完整的任务契约。该基准测试包含六个领域的 300 个端到端工作流,其中 97 个任务公开发布,并使用三种 agent 脚手架评估十二个前沿模型,以通过率作为主要指标。核心发现是部分进展与完整交付之间存在持续差距:最佳配置尽管平均分较高,但通过率仅为 20.6%,在分析化学和电化学领域的完成情况尤其不佳。作者贡献了一个跨领域工作流基准测试、基于契约的评估方法,以及对 970 条轨迹的失败分析,表明最终自我报告和工具错误是成功交付的弱指标,可靠的科学 agent 将需要显式的契约跟踪和基于证据的完成检查。

数据集

作者构建了一个包含 300 个科学工作流的数据集,这些工作流来源于科学和工程领域的专业实践。任务设计旨在反映需要领域知识、专业软件、实验数据或工程环境的真实工作流,而非简单的问答或孤立的编程练习。

数据集组成与来源

  • 完整集合包含 300 个工作流,但论文发布并评估其中 97 个。
  • 任务来源于分析、计算、模拟和研究交付流程,而非扩展的问答或独立的编码问题。
  • 输入始于固定的公开经验数据、公开的序列或结构资源,或受科学约束的合成数据。这些来源类型描述了工作流的实例化方式,而非每个任务都始于直接的实验室测量。

各子集的关键细节

  • 已发布的 97 个任务从官方评估不需要 GPU 资源的子集中随机选取。
  • 其余 203 个任务构成内部保留集,其中包括需要基于 GPU 评估的工作流;这些保留任务均未出现在报告结果中。
  • 已发布任务包含 74 个困难任务和 23 个中等任务。
  • 在分析中,97 个任务被组织为六个报告领域:量子化学(20 个任务)、分子动力学(16 个)、材料表征(22 个)、分析化学(23 个)、生命科学(10 个)和电化学(6 个)。
  • 任务涵盖 21 个工作流族,需要异构交付物,包括科学报告、结构化数据、图表、可执行代码和模拟产品。

筛选与过滤规则 作者在筛选过程中应用四项设计原则:

  • 代表性:工作流、软件和方法必须反映合理的专业实践。
  • 复杂性:任务必须要求端到端、依赖感知的流程,最终产生实质性交付物,而非单条命令或局部修改。
  • 多样性:集合必须在科学知识、工作流类型和难度上有所变化,而非重复更换输入的模板。
  • 可验证性:输出必须能够通过文件、数值、定量指标或明确的验收标准进行评估。

作者排除以孤立事实、单步操作、纯主观输出为中心的任务,以及缺乏可复现评分材料的任务。每个纳入的任务必须具有固定输入、明确的执行环境、完整的交付物契约和可执行的评估流程。

打包与元数据构建 每个任务被打包为自包含单元,包含五个对齐的元素:

  • 定义科学目标的任务描述。
  • 固定输入,包括数据和必要的上下文。
  • 执行环境中可用的软件和工具。
  • 列出必需交付物的输出契约。
  • 定义成功完成的评估流程。

每个包还包含任务元数据、面向 agent 的指令、输入数据、预期输出或参考材料、分步评分标准、可执行 Grader,以及用于复现和评分的文档。环境规范、领域工具、辅助参考和执行轨迹在需要时包含在内。面向 agent 的指令和输入与评估方侧的参考和评分组件分离。

数据的使用方式

  • 已发布的 97 个任务用于报告中的实验,从无 GPU 子集中随机选取。
  • 保留的 203 个任务未包含在任何报告结果中。
  • 六个领域是已发布评估集的描述性切片,而非其领域的概率样本。作者指出,跨领域的性能差异不应被解释为学科难度的内在排名。
  • 标准化的打包方式允许每个任务在固定条件下重新运行,并在评估系统间一致评分。

方法

作者通过从科学和工程实践中获取工作流来构建任务集合,强调需要领域专业知识、专业软件、实验数据或工程环境的真实流程。任务来源于分析、计算、模拟和研究交付管线,而非扩展的问答或孤立的编码练习。完整集合包含 300 个科学工作流,其中 97 个在本文中发布并评估。

每个任务都经过由四项设计原则指导的筛选过程。代表性确保工作流、软件和方法反映合理的专业实践。复杂性要求端到端、依赖感知的流程,最终产生实质性交付物,而非单条命令、工具调用或局部修改。多样性要求科学知识、工作流类型和难度上有所变化,避免仅更换输入或参数的模板重复。可验证性要求输出能够通过文件、数值、定量指标或明确的验收标准进行评估,从而支持可重复的自动化评估。作者还验证每个纳入的任务均具有固定输入、明确的执行环境、完整的交付物契约和可执行的评估流程。以孤立事实或单步操作为中心的任务、纯主观输出的任务以及缺乏可复现评分材料的任务在最终集合形成前均被排除。

筛选后,每个任务被标准化为自包含包,包含五个对齐的元素:定义科学目标的任务描述;固定输入,包括数据和必要的上下文;执行环境中可用的软件和工具;列出必需交付物的输出契约;以及定义成功完成的评估流程。交付物可包括科学报告、结构化表格、诊断图表、可执行分析代码、模拟产品,或必须保持相互一致的多个产物。因此,完成取决于整个产物集合,而非 agent 是否返回合理的最终答案。

每个包包含任务元数据、面向 agent 的指令、输入数据、预期输出或参考材料、分步评分标准、可执行 Grader,以及用于复现和评分的文档。环境规范、领域工具、辅助参考和执行轨迹在工作流需要时包含在内。面向 agent 的指令和输入与评估方侧的参考和评分组件分离。这种标准化组织方式允许每个任务在固定条件下重新运行,并在评估系统间一致评分。

实验

实验在 97 个科学工作流任务上使用三种脚手架评估了十二个前沿模型,发现严格的完整完成较为罕见(通过率从 3.1% 到 20.6%),尽管平均分较高,这表明模型通常产生的产物集合缺少至少一项要求。领域层面的表现差异显著,量子化学和分子动力学的完成率最高,而分析化学和电化学/环境的通过率接近零或为零,尽管平均分较高,这揭示总体排名掩盖了领域特定优势。失败模式分析表明,在未通过的提交中,评审者评估的产物缺失较为常见,75.5% 的未通过运行以声称完成的最终消息结束,且工具错误在通过和未通过的轨迹中均出现,证明自我报告和原始错误不是成功交付的可靠预测指标。

该表比较了若干相关基准测试的核心设计特征,指出哪些特性是各基准测试主要设计的核心。大多数基准测试包含可执行评估,而固定科学输入和跨领域科学等特性在不同基准测试中有所差异。只有少数基准测试包含所有列出的特性,如 CORE-Bench 和 PaperBench。所有列出的基准测试均将可执行评估作为主要设计特性。CORE-Bench 和 PaperBench 是仅有的包含全部六项列出特性的基准测试。跨领域科学仅在两个基准测试中作为主要特性:HLE 和 BLADE。科学工作流核心在大多数基准测试中是主要特性,但 HLE、ALE 和 Frontier-Bench 除外。

严格的任务完成在所有配置中仍然罕见,通过率从 3.1% 到 20.6%,尽管平均分通常超过 80。较高的平均分并不能保证完整交付,即使最佳配置也仅完成约五分之一的任务。性能随任务难度变化,中等任务的通过率显著高于困难任务。最高通过率为 20.6%,由两个配置实现,最低为 3.1%。中等难度任务的通过率最高达 43.5%,而困难任务最高为 14.9%。八个配置的平均分超过 80,但在严格标准下均未完成超过 20.6% 的任务。在相似脚手架中,一个配置在平均分上比另一个高出约 2.7 分,在通过率上高出 2.1 个百分点。

评估比较了各配置下的基准测试设计和 agent 性能。基准测试分析表明,可执行评估是普遍特性,而 CORE-Bench 和 PaperBench 是仅有的包含全部六项核心特性的基准测试,跨领域科学仅出现在 HLE 和 BLADE 中。任务完成结果揭示了平均分与严格完成之间的显著差距,通过率从 3.1% 到 20.6%,尽管许多配置的平均分超过 80。中等难度任务的通过率显著高于困难任务,即使最佳配置在严格标准下也仅完成约五分之一的任务。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供