Command Palette
Search for a command to run...
覆盖 11 个学科/60 项科研任务,清华/MIT/哈佛等提出 ASI-Bench 测试 AI 自主科研能力

近年来,大语言模型与智能体技术快速演进,AI 参与科学研究的边界也在不断扩大。从文献梳理、代码编写到数据分析,越来越多标准化科研环节已经能够由 AI 辅助完成,一些智能体系统甚至开始尝试独立承担特定科研子任务。但一个更关键的问题仍缺乏系统回答:当研究者不再提供明确的方法和执行路径,只给出一个待解决的科学问题时,AI 究竟能在多大程度上自主完成研究?
现有科研类基准很难回答这一问题。一类评测主要考察模型对既有科学知识的掌握,本质上仍接近「已知答案的知识问答」;另一类虽然引入了代码执行和工具调用,却往往预先规定研究方法或操作步骤,主要测试 AI 能否按照既定流程完成任务。这些基准能够衡量知识理解和科研执行能力,却很难进一步区分:AI 是真正能够自主设计研究方案,还是只是在复现人类已经给出的解决路径。
为此,来自清华大学、麻省理工学院、哈佛大学、卡内基梅隆大学、微软研究院等十余家机构的 40 余位领域专家,累计投入超过 31,000 小时,共同构建了自主科研能力基准 ASI-Bench 。其核心思路并不是简单增加题目难度,而是针对同一个科研项目逐级减少人类提供的方法信息,观察 AI 的表现如何变化,从而量化系统对人类指导的依赖程度。
相关研究成果以「ASI-Bench: At the Dawn of Artificial Superintelligence」为题,已发表于预印本平台 arXiv 。

查看论文:
https://hyper.ai/papers/2608.17271
数据集:覆盖 11 大学科的项目级科研任务库
ASI-Bench 的基础是一套以真实科研问题为原型构建的项目级任务集。与传统基准中的知识问答或标准化习题不同,每项任务都被设计成一个相对完整的微型科研项目,要求智能体经历问题理解、方法选择、代码实现、实验运行、错误排查和结果迭代等多个环节。
任务最初来自 1,300 余个学术文献和前沿研究问题,覆盖基础科学、生命科学和工程技术等多个方向。研究团队首先由领域专家筛选具有代表性的候选课题,再对其进行工程化改造和可行性验证,使原本开放的研究问题能够在统一环境下执行和评分。存在科学逻辑缺陷、结果难以复现、运行条件不稳定或难度明显失衡的任务,则会在这一过程中被淘汰。
最终,ASI-Bench 保留了 60 项科研任务,覆盖数学、物理学、化学、生物学、天文学、材料科学、地球科学、医学生物统计学、计算机科学、机器人学和电气工程 11 个领域。不同任务涉及的数据形式、研究方法和验证标准并不相同,因此可以在一定程度上避免基准被某一特定学科或固定解题套路主导。

ASI-Bench 中涵盖物理学、天文学、电气工程和计算机科学等领域的代表性项目级任务
每项任务都包含完整的研究目标、专属输入数据、可执行环境、明确的产出要求以及量化评分规则。智能体进入任务后,需要根据获得的信息自行规划研究流程,并通过代码和工具完成实验。 60 项任务累计涉及超过 2,600 轮智能体交互和 2,400 次代码执行,单个智能体完整运行全部任务的累计时间超过 35 小时。
由于科研任务本身具有较强的开放性,如何保证基准「真的能做」以及「评分确实有效」尤为重要。为此,研究团队进行了五轮专家交叉评审,累计完成 1,100 余次评审分配和 2,000 余次任务修订。在此基础上,所有任务还在隔离沙盒中进行了超过 1,500 次端到端运行验证,以确认参考方案可以复现、评分程序能够稳定运行,最终形成一套兼顾科学合理性和工程可执行性的项目级科研任务库。
逐级撤去方法指导,量化科研自主性
ASI-Bench 最具辨识度的设计,在于它没有为不同能力分别设计不同题目,而是让智能体面对完全相同的科研项目,只改变人类提供的方法信息。研究目标、输入数据、运行环境、最终产物和评分标准均保持不变,唯一变化的是系统能够获得多少研究指导。通过观察信息逐步减少后模型得分的变化,可以进一步判断 AI 的困难究竟来自执行、方法落地,还是自主选择研究路径。

ASI-Bench 将每项任务设置为 B1 、 B2 、 B3 和 B4 四个等级。
B1:完整方法指导。系统可以获得较为完整的研究方案,包括控制方程、数值方法、关键实现步骤和参数设定等信息。智能体主要需要将已有方案转化为代码并完成运行,因此更接近对科研执行能力的考察。
B2:仅提供方法类别。详细实现步骤被删除,系统只能获得方法类别和核心原理。例如,系统可能知道某个问题适合使用谱方法求解,但如何离散、采用何种积分策略以及怎样设置参数,都需要自行确定。这一级主要考察 AI 能否把抽象方法转化为真正可运行的研究流程。
B3:仅提供研究目标与数据。所有方法提示均被撤去,智能体只能看到原始数据、研究目标和产出要求,需要自行判断问题性质、选择研究方法、设计计算流程并完成实验。这也是 ASI-Bench 衡量自主科研能力的核心等级。
B4:加入无关和干扰信息。在 B3 的基础上额外加入事实正确但与任务无关的背景材料、未经验证的方法猜测以及其他场景信息,用于测试系统面对复杂信息环境时,能否识别真正与研究相关的内容并维持正常研究过程。
这种设置使「自主科研」不再只是一个笼统概念,而可以被拆解成多个连续环节。例如,如果模型在 B1 表现良好、进入 B2 后明显下降,说明问题可能并不在执行代码,而在于能否自行补全研究方案;如果 B2 到 B3 再次大幅下降,则说明方法选择和研究设计是新的主要障碍。
为了尽量减少外部因素干扰,ASI-Bench 将所有任务放在隔离沙盒中执行。智能体只能访问任务预先提供的数据与工具,无法联网搜索或调用外部知识库,因此最终结果更多反映模型自身的推理、规划和执行能力,而不是检索能力。
在四级信息梯度的基础上,ASI-Bench 还可以进一步分析不同能力之间的差异:B1 与 B2 的变化反映将方法转化为具体流程的能力,B2 与 B3 的变化反映自主选取方法和设计研究方案的能力,而 B3 与 B4 的变化则反映系统面对冗余信息时的鲁棒性。
实验验证:18 套前沿系统的表现与能力边界
基于 ASI-Bench,研究团队评测了 18 套由「智能体框架 + 底座大模型」组成的前沿系统,涵盖 Codex 、 Claude Code 、 Kimi Code 、 MiMo Code 、 OpenHands 等智能体框架,以及 GPT-5.5 、 GPT-5.6 Sol 、 Claude Opus 、 GLM 、 DeepSeek 、 Kimi 、 MiMo 、 MiniMax 等系列模型。所有系统均在隔离环境中运行,每项任务独立执行三次并取平均结果。
实验结果显示,人类指导减少后,AI 的科研表现迅速下降。 18 套系统在 B1 完整方法指导下的平均得分为 50.91 分;进入仅提供方法类别的 B2 后,平均分降至 29.10 分;完全撤去方法提示的 B3 中,平均分进一步降至 26.62 分。表现最好的 Codex + GPT-5.6 Sol(ultra)在 B3 中获得 51.60 分,也是唯一超过 50 分的配置。提高推理强度能够改善结果,例如 GPT-5.6 Sol 从 xhigh 升至 ultra 后,B3 得分提高 10.74 分,但总体来看,当前系统距离稳定完成开放式自主科研仍有明显差距。

不同信息等级之间的得分变化揭示了更具体的能力短板。从 B1 到 B2,系统平均得分下降 21.82 分;而从 B2 到 B3,在进一步撤掉方法类别提示后,平均分只下降 2.48 分。这意味着,当前 AI 的主要困难并不一定是判断「应该使用什么方法」,而是如何将已有的方法思路进一步转化为参数选择、代码实现、实验运行和结果验证组成的完整流程。同时,B4 在加入无关和干扰信息后平均得分为 26.99 分,与 B3 的 26.62 分基本持平,说明至少在当前任务设置下,信息噪声并不是主要限制因素。
实验还发现,自主科研能力并不完全由底座模型决定。同一个模型搭配不同智能体框架时,最终结果可能出现明显差异。例如,MiMo V2.5 Pro 搭配 Claude Code 后,综合得分相比 MiMo Code 提升超过 40%;Kimi K2.7 在 Claude Code 框架下的表现也高于 Kimi Code 。这表明,任务规划、工具调用、错误修复和流程调度等智能体机制,同样会直接影响科研任务的完成质量。
最后,不同系统的成本与性能之间也不存在简单的线性关系。例如,Codex + GPT-5.6 Sol(xhigh)的单轮运行成本约为 Claude Opus 5 的四分之一,但二者在 B3 中的得分接近;表现最优的 GPT-5.6 Sol(ultra)单轮成本则约为 1550 美元。因此,在实际科研应用中,模型能力之外还需要考虑计算效率。更高的推理投入可以提升能力上限,但能否以合理成本稳定完成科研任务,同样是自主科研系统走向实际应用必须面对的问题。

写在最后
长久以来,对 AI 科研能力的评价,多集中于解答科学问题、复现论文结果或完成指定实验。 ASI-Bench 则进一步追问:当人类不再提供具体方法和执行路径时,AI 能够独立完成多少科研工作? 评测结果显示,AI 已能较好地完成路径明确的任务,但距离稳定开展开放式自主研究仍有明显差距。未来科研智能体的提升,也不能只依赖更强的模型和更多算力,还需要增强任务规划、实验反馈利用和错误修正等能力。对 AI 科研能力的衡量,也将逐渐从「答对多少问题」转向「能够独立完成多少真实科研任务」。








