Command Palette
Search for a command to run...
ASI-Bench:迈向人工超级智能的黎明
ASI-Bench:迈向人工超级智能的黎明
摘要
人工超级智能(ASI)要求 AI 超越对现有知识的掌握,转向探索未知、创造新知识,并将新想法转化为可验证的成果。然而,当今 AI 系统的能力在很大程度上仍建立在学习、压缩和应用现有人类知识的基础上。相应地,现有基准主要测试 AI 能否基于已学知识给出正确答案,或能否在大量人类指导下完成任务。为此,我们引入了 ASI-Bench,这是首个在通用研究领域中联合评估 AI 系统创新探索能力与自主科学执行能力的基准,也是首个在同一研究项目内逐步撤除人类方法学指导、以测试 AI 能够独立推进到何种程度的基准。ASI-Bench 由 40 余位专家构建,投入超过 31000 人时,包含覆盖 11 个科学领域的 60 个项目级研究任务,并逐步减少方法学指导,以测试 AI 能否独立选择方法、开展研究并产出可验证的结果。所有任务均经过专家评审、AI 辅助审计、沙箱执行和评分器验证。在 18 种最先进的智能体—模型配置中,平均得分从提供完整方法学指导时的 50.91 降至仅指定方法时的 29.10,再降至智能体必须自行确定方法时的 26.62。这一显著下降表明,当前系统仍然高度依赖人类指导,距离自主完成端到端、项目级科学研究仍有很大差距。ASI-Bench 向全世界开放。我们诚邀全球研究者和构建者提交新任务,挑战当今 AI 的极限,共同加速人类迈向人工超级智能的进程,详见 https://asibench.apexin.ai/submit。
一句话总结
来自清华大学、麻省理工学院、哈佛大学等机构的研究者推出 ASI-Bench,这是首个在 11 个科学学科的 60 个项目级研究任务中,通过逐步撤销方法论指导,联合评估创新探索与自主科学执行的基准。18 种 Agent-模型配置的平均表现从完整指导下的 50.91 降至仅指定方法时的 29.10,再降至 Agent 必须自行确定方法时的 26.62。
核心贡献
- 提出 ASI-Bench,这是首个在通用研究领域联合评估创新探索与自主科学执行的基准,包含 60 个项目级研究任务,覆盖 11 个科学领域,由 40 多位专家和超过 31000 个人工小时构建。
- 增加渐进式指导撤销设计,在同一研究项目内减少人类方法论指导,以测试 AI 系统能否独立选择方法、开展研究并产生可验证结果,并通过专家评审、AI 辅助审计、沙箱执行和评分器验证进行确认。
- 报告 18 种当前最优 Agent-模型配置的评估结果,平均表现从完整方法论指导下的 50.91 降至仅指定方法时的 29.10,再降至 Agent 必须自行确定方法时的 26.62,表明当前系统仍高度依赖人类指导。
引言
在迈向超级人工智能的过程中,AI 系统必须超越对现有人类知识的应用,开始探索具有可验证结果的开放式科学问题。先前基准倾向于评估已知答案任务、人类指定流程或孤立的单个研究组件,因此对自主端到端发现提供的证据有限。作者推出 ASI-Bench,一个包含 60 个项目级科学任务、覆盖 11 个领域并带有可执行环境和可验证研究产物的基准。其 B1 到 B4 指导梯度逐步撤销方法论支持,对 18 种当前最优 Agent 和模型配置的评估显示,平均表现从完整指导下的 50.91 降至 Agent 必须自行确定方法时的 26.62,揭示科学执行与自主研究之间存在显著差距。
数据集
ASI-Bench 数据集描述
作者将 ASI-Bench 定位为评估基准,而非训练集。其构建目的是在人类方法论指导逐步减少的情况下测试端到端科学研究能力。
构成与来源
- ASI-Bench 包含 60 个项目级研究任务。
- 任务覆盖 11 个科学领域:数学、物理学、化学、生物学、天文学、材料科学、地球科学、医学与生物统计学、计算机科学、机器人学和电气工程。
- 候选任务来自从科学来源收集的 1300 多个研究想法。
- 所提供的章节未报告每个领域的任务数量。
指导变体与任务结构
- 每个任务在匹配的指导条件下呈现,同时保持底层任务、数据、所需输出和评分标准不变。
- B1 给出完整的控制方程、数值形式和求解流程。
- B2 移除完整流程,但给出关于问题类别和适合的数值方法的方法论指导。
- B3 移除方法论指导,仅给出观测数据、科学目标和所需输出。
- B4 保持 B3 设置,但加入看似合理却与任务无关的信息,以测试 Agent 能否忽略干扰。
- 每个任务都涉及问题理解、方法选择、实现、实验、失败诊断、迭代改进和结果验证。
处理与筛选
- 构建从 1300 多个候选研究想法开始。
- 流程包括五轮评审、超过 1100 项评审任务和超过 2000 次任务修订。
- 评审者检查科学表述、任务说明、B1-B4 信息设计、参考结果、评价标准、信息泄漏和非预期捷径。
- 构建和验证投入超过 31000 个人工小时。
- 保留的任务通过超过 1500 次沙箱运行验证运行时稳定性、参考可复现性、产物生成和评分一致性。
- 存在未解决科学错误、执行不稳定、评估不一致或非预期求解路径的任务会被修订或剔除。
使用方式
- ASI-Bench 用于评估,而非作为训练语料库。
- 所提供的章节未描述训练集划分或混合比例。
- 系统在相同底层任务、数据、所需输出和评分标准下接受评估,只有指导级别发生变化。
- 该基准可以比较同一 Agent 框架内的不同骨干模型,或同一模型下的不同 Agent。
- 在 18 种当前最优 Agent × 模型配置中,B3 平均分为 26.62。
裁剪与元数据
- 所提供的章节未描述图像或文本裁剪策略。
- 任务使用特定于任务的数据集和项目级输入,而非统一裁剪。
- 主要元数据构建是 B1-B4 指导设计、所需输出和评分标准。
方法
作者设计 ASI-Bench,用于评估随着人类方法论指导逐步撤销,AI 能够在多大程度上开展科学研究。该基准包含 60 个项目级研究任务,覆盖 11 个科学领域。每个项目在匹配的指导条件下接受评估,同时保持底层任务、数据、所需输出和评分标准不变。
ASI-Bench 的构建遵循严格的大规模迭代流程,而不是单次收集流程。如下方框架图所示:
该流程从不同科学来源收集问题开始,产生超过 1300 个候选研究想法。这些候选经过大规模专家评审,包括五轮评审、超过 1100 项评审任务和超过 2000 次任务修订。评审者检查科学表述、任务说明、信息设计、参考结果和评价标准。他们还检查可能导致高分但未正确求解任务的信息泄漏和非预期捷径。该构建与验证过程投入超过 31000 个人工小时。
评审流程之后,每个保留任务都会在隔离沙箱中通过端到端执行进行验证。作者执行超过 1500 次沙箱运行,以验证运行时稳定性、参考可复现性、产物生成和评分一致性。存在未解决科学错误、执行不稳定、评估不一致或非预期求解路径的任务会被修订或剔除,最终形成由 60 个项目级任务组成的基准。
为了衡量科学自主性,该基准逐步减少人类方法论指导。每个任务被设计为复杂的项目级科学调查,而不是孤立问题。Agent 从研究目标和任务特定数据出发,必须执行长时间跨度的多阶段研究流程,包括问题理解、方法选择、实现、实验、失败诊断、迭代改进和结果验证。在 60 个任务中,完成这些研究流程涉及超过 2600 个交互轮次和 2400 个执行步骤。
指导递进将科学责任从人类转移到 AI。在最完整的指导条件下,控制方程、数值形式和求解流程被明确给出,Agent 主要负责实现和执行指定方案。在随后的条件中,完整流程被移除,只留下关于问题类别和适合方法的方法论指导。在最弱指导条件下,Agent 只收到观测数据、科学目标和所需输出,必须自行确定底层模型、选择适当数值方法、实现并验证最终预测。最后一个条件保留这种最弱指导,但加入看似合理却与任务无关的信息,以测试 Agent 能否在干扰下保持研究方向。
该基准覆盖基础科学、生命科学、计算和工程,要求同一 Agent 和模型系统跨不同数据类型、科学方法和验证标准进行泛化。这种广度测试自主研究能否跨学科迁移,而不是局限于单一领域。
实验
ASI-Bench 在 60 个项目级研究任务、11 个科学领域、四种指导条件(B1-B4)下评估 18 种代表性 Agent × 模型配置,其中人类方法论指导被逐步撤销。主要结果表明,当前系统距离可靠的自主科学发现仍然很远,只有最强配置的 B3 分数超过 50,并且从 B1 到 B2 的急剧下降表明主要瓶颈在于将选定方法转化为完整研究流程,而不是方法选择或干扰。结果还表明,科学能力来自骨干模型与 Agent 框架之间的交互。计算成本实验进一步发现,完整指导会降低 token 和时间成本,而不完整的方法论指导可能增加开销,并且更高花费并不总能可靠转化为更好的科学表现。
面向高级 AI 能力的代表性基准各自强调自主研究的不同方面,例如广泛学术知识、科学编码、基于工具的终端任务或研究复现。跨领域通用性、方法自主性和端到端研究很少在单个基准中被同时覆盖,并且所比较的基准均未明确评估在逐步减少方法论支持情况下的指导梯度。这留下了一个空白,即对通用智能、独立方法选择和自主执行的联合评估。现有大多数基准只覆盖自主研究的一个或两个维度,明确的跨领域通用性仅限于少数设置。端到端研究覆盖出现在关注研究复现、机器学习工程和 AI 研发的基准中,而大多数其他基准中的方法自主性不完整或缺失。在比较范围内,没有一个代表性基准明确评估改变人类方法论指导水平的指导梯度。
当详细流程指导被移除时,性能下降最为剧烈;而当移除方法选择时,额外下降要小得多,无关上下文几乎没有影响。即使最强配置也只能达到中等自主性能,不过更强的推理时推理带来明显提升。框架选择可能显著改变同一模型的能力,但该影响因模型-框架组合而异。平均下降最剧烈的是失去逐步流程指导,而不是失去方法选择。更强的推理时推理改善自主方法选择,但最佳配置仍然处于中等水平,框架选择可以显著改变模型分数。
第一项分析比较了代表性自主研究基准,发现它们很少同时具备跨领域通用性、方法自主性和端到端研究,且没有一个明确评估具有不同方法论支持水平的指导梯度。第二项实验在指导减少时测量模型性能,显示当详细流程指导被移除时下降最大,再移除方法选择时出现较小的额外下降,而无关上下文影响很小。更强的推理时推理改善自主方法选择,但最佳配置仍处于中等性能水平,框架选择可以显著改变模型能力。