Command Palette
Search for a command to run...
OmniScientist:一个全模态、全学科的 AI 科学家
OmniScientist:一个全模态、全学科的 AI 科学家
Bobo Li Hao Fei Tianjie Ju Mong-Li Lee Wynne Hsu
摘要
基础模型的最新进展使 AI 科学家能够自动化日益完整的研究工作流,从假设生成、代码执行到论文撰写。然而,仅覆盖工作流并不能提供科学发现所依赖的全部证据。现有系统通常基于文本、代码、标签或预先计算的摘要进行推理,导致对科学上具有决定性意义的时空关系、跨通道关系和过程性关系无法被智能体获取。我们提出 OmniScientist,一个端到端的全模态 AI 科学家,能够直接基于异构原始证据开展多学科研究。一个感知层和三个分别负责构思、实验与撰写的自主智能体在确定性流水线中协同工作,使观察结果能够在整个研究生命周期中影响研究问题、实验决策和最终结论。通过在代码中执行构思检查、严谨性检查和论断检查,该系统强制实施新颖性筛选、统计有效性、执行溯源和数值可追溯性。我们在 36 个真实数据案例上对 OmniScientist 进行了评估,这些案例涵盖 5 个学科族、4 类科学证据,以及图像、信号、音频、视频、三维结构、轨迹、表格、公式和图等多种模态。该系统在全部 36 个案例中完成了从原始数据到成稿论文的完整流程,并在参考推理骨干下取得了 6.3 的平均论文总分。在与仅接收预计算标量特征的盲测变体的配对比较中,直接感知在所有 7 个评估维度上均有提升,并在 85% 的逐项对比评判中胜出。这些结果表明,贯穿整个生命周期的感知对于基于证据的科学发现至关重要,并为构建具有广泛能力的 AI 科学家提供了一条切实可行的路径。
一句话总结
新加坡国立大学和牛津大学的研究人员提出 OmniScientist,一个端到端的全模态 AI 科学家,将感知层与三个自主 Agent 相结合,分别用于构思、实验和撰写,同时执行新颖性、有效性、来源和可追溯性检查,在 36 个真实数据案例中平均论文总分为 6.3,并且在与仅使用标量感知的对比中赢得 85% 的直接比较。
核心贡献
- OmniScientist 是一个端到端、全模态的 AI 科学家,能够直接基于异构原始证据开展多学科研究,包括图像、信号、音频、视频、三维结构、轨迹、表格、公式和图。
- 多模态感知层和三个用于构思、实验和撰写的自主 Agent 在确定性的代码控制流水线中运行,并通过 idea、rigour 和 claim 检查执行新颖性筛选、统计有效性、执行来源和数值可追溯性。
- 在涵盖 5 个学科族的 36 个真实数据案例中,OmniScientist 完成了所有案例从原始数据到论文稿的流程,使用参考推理主干获得平均论文总分 6.3,并在全部 7 个评估维度上优于盲预计算特征变体,在直接对比评审中赢得 85% 的判定。
引言
近期基础模型的进展已经催生出能够自动化大部分研究流程的 AI 科学家,从假设生成、实验到论文草稿撰写,但这些系统仍然受到科学证据如何到达它们的限制。它们通常通过文本、代码、标签或预计算摘要来消费数据,这可能在研究开始之前就抹去了空间、时间、统计和程序关系。现有的多模态科学基准也会事先固定观察对象和问题,而基于 Agent 的系统只在孤立阶段使用感知,因此原始观察很少改变研究方向。作者提出 OmniScientist,一个端到端、全模态的 AI 科学家,它在构思、实验和撰写的整个过程中保持原始证据可用,并将开放式 Agent 推理与代码强制检查相结合,用于新颖性、统计有效性、来源和 anti-HARKing。该系统在 36 个多学科案例上进行了评估,涵盖图像、波形、音频、视频、3D 结构、轨迹、表格、公式和图。
数据集
作者描述了一个用于评估科学 AI 系统的演示套件。
证据分类:
- 感知类:图像、显微照片、光谱、波形、三维结构。
- 符号类:自然语言或形式化符号,包括文档、公式、序列、知识图谱。
- 定量统计类:表格、测量值、分布。
- 程序类:轨迹、模拟、agent 轨迹。
数据集套件组成:
- 5 个顶级学科类别和 36 个二级案例。
- 每个案例使用一个真实、可公开下载的数据集,并带有规范引用。
- 规模从 12 个符号回归方程到具有 500 万条边的生物医学知识图谱。
- 模态包括图像、光谱、波形、音频、视频、三维结构、表格和符号图。
- 感知类证据覆盖 36 个案例中的 28 个。
- 其余 8 个案例是横跨符号、定量统计和程序族的广度对照。
任务模式:
- 每个任务是单个规范文件,包含数据集、科学主题、目标属性和对应的原始数据。
- 不提供任何其他内容,方法论完全留给模型决定。
数据如何被使用:
- 模型接收规范文件和原始数据,然后生成有证据基础的论文。
- 该套件用于通过端到端运行评估跨学科能力。
- 扩展到新学科只需要增加一个规范文件,无需更改特定领域的代码。
处理说明:
- 感知类和程序类证据可以被序列化为 token。
- 作者提醒,标题和无序标量摘要可能会消除局部空间或时间结构。
- 该套件使用原始记录,以便科学结论所需的结构线索仍然可用。
所提供的摘录未描述过滤规则、裁剪或训练/验证/测试划分。
方法
作者介绍 OmniScientist 框架,一个为多学科发现而设计的端到端 AI 科学家系统。该架构将生命周期范围的感知层与三个负责构思、实验和撰写的自主 Agent 集成在一起。
感知层
为了在多样化学科中有效运作,系统必须直接感知原始工件,而不是依赖预计算摘要。感知层按层次组织观察结果,并根据所需推理范式将工件分类为证据族。在一个族内,具体模态定义表示形式,例如图像、表格或时间序列信号。为了在彻底性和计算效率之间取得平衡,该框架优先采用原生数值分析,直接从原始数据中提取 FFT 峰值或趋势点等属性。仅当空间或结构模式必要时才调用视觉渲染,并且视觉感知受到预算约束,以防止不必要的处理。
构思
构思阶段要求 Agent 根据所提供数据提出一个具体、新颖且可证伪的问题。在 ReAct 循环驱动下,Agent 通过清点材料并决定是否检查原始观察来建立基础。随后,它通过 OpenAlex 检索文献来对发现进行背景化,并使用 Crossref 作为后备。Agent 开发多个候选想法,评估新颖性风险和可行性,并选择最强候选。为了减轻幻觉和过度自信,输出会通过代码强制检查,验证结构完整性,要求清晰的研究问题、假设、实验草图和证伪标准。系统还强制进行泄漏检查和视觉审计,以防止方法论缺陷。
实验
在实验过程中,Agent 将最终确定的想法转化为方法设计,并在受控的 run_python 环境中通过迭代代码生成实现它。Agent 在持续调试循环中运行,分析执行错误并重新生成脚本,直到成功。它利用感知层检查原始输入数据或验证生成图表中的结构模式。实验设计包含一整套分析,将主假设检验与基线、消融研究或敏感性扫描等对照相结合。
执行结束后,代码强制退出检查会验证结果来源和统计有效性。该 rigour 检查确认 Agent 确实访问了数据集,并生成了与原始执行轨迹匹配的图表。它强制执行严格的多重比较校正,以考虑调试循环中尝试过的每一项检验,防止校正分母被人为缩小。
撰写
撰写阶段根据具体学科调整结构,利用结构规范确定每种发表风格的整体骨架和长度。例如,机器学习论文包括相关工作与局限性,而化学论文将结果与讨论合并。草稿从章节级大纲发展为完整段落,每个章节仅从结构化实验记录的相应部分扩展而成。这确保方法细节进入方法章节,关键数字进入结果章节。
论文规划器从有支持的分析中选取核心论断,并将其他结果分配为支持证据或稳健性检查。参考文献通过 OpenAlex API 获取。最后,元审计执行 claim 检查,将报告的数字和论断与实验记录进行比对,以确保稿件包含完全可追溯的数字和有支持的论断,然后编译最终 PDF。
实验
评估在 36 个数据集上测试该框架,使用多个推理主干、固定的感知模型、外部评审,以及七个指标,涵盖同行评审质量、多模态基础和事实准确性。主要结果显示,跨学科和跨模态的论文质量始终较高,其中事实准确性得分最高;消融实验表明,直接多模态感知优于仅使用标量的基线,并且先前研究检索、迭代式 agent 循环和来源执行有显著贡献。机制分析确认,感知改变了研究轨迹,而不只是改善风格;两个案例研究说明原始波形和放射影像观察如何在地震学和医学影像中产生稳健且经过验证的发现。
该演示套件旨在评估跨五个顶级学科类别和 36 个案例的全模态科学发现,每个案例以一个真实、可公开下载的数据集为基础。其规模跨越多个数量级,从十几个符号回归方程到具有五百万条边的生物医学知识图谱。该套件覆盖全部四个证据族和多种观察模态,包括图像、光谱、波形、音频、视频、三维结构、轨迹、表格、序列、场和图。该套件跨越五个顶级学科类别和 36 个案例,每个案例使用一个真实、可公开下载的数据集。数据集大小跨越多个数量级,从十几个符号回归方程到具有五百万条边的图。覆盖范围包括感知、符号、定量统计和程序证据,横跨多种模态,包括图像、光谱、波形、音频、视频、三维结构、轨迹、表格、序列、场和图。
科学证据被组织为四个与学科无关的族:感知、符号、定量统计以及程序或动态。感知族包括图像、音频和三维结构,而程序证据涵盖实验步骤、代码执行、模拟和协议。当前的 AI 科学家系统主要处理文本和数值数据,使得感知和程序证据相对未被充分研究。该分类将需要空间、时间或跨通道解释的证据归入感知和程序族,与符号和定量统计形式区分开。当前系统更常处理符号和定量统计证据,而感知和程序工件尽管可序列化,仍然较少被研究。当工件被简化为标题、摘要或标量表示时,原始感知和程序关系可能丢失。
在所评估的推理主干中,Claude Sonnet 5、GLM-5.2 和 Kimi K2.7 形成高表现集群,在同行评审和整体质量上差异较小,而 Qwen3.5 主干明显落后。对于每个列出的主干,事实准确性是最强维度,事实准确性和健全性是最能反映主干能力的维度。清晰度在不同主干之间的退化最小。Claude Sonnet 5、GLM-5.2 和 Kimi K2.7 在整体和同行评审得分上接近顶部,而 Qwen3.5 主干明显落后。事实准确性是所有列出主干中得分最高的维度,而清晰度随着主干能力变化保持相对稳定。
主推理主干完成了它尝试的每个案例,并保持最高综合得分之一。GLM 5.2 获得了略高的平均得分,但完成运行的数量少得多,而多个开放权重主干尝试了大部分套件,但平均得分较低。较小的开放权重模型完成的案例较少,平均得分最低。Sonnet 5 完成了每个尝试的案例,并取得相对较高的平均综合得分。开放权重主干通常表现出较低的平均综合得分,其中最小模型完成案例更少,得分最低。
聚合的主干质量在证据模态和学科族之间保持稳定,综合得分集中在一个较窄的区间内。在案例级置换检验下,跨领域差异不具有统计显著性。短横线表示某主干在相应类别中没有产生可评分论文。综合得分在证据模态和学科族之间保持紧密聚集。在案例级置换检验下,跨领域差异在统计上可忽略。得分最高的论文广泛分布在多个领域类别中,表明具有较强的泛化能力。
该评估套件测试跨五个顶级学科和 36 个真实数据案例的全模态科学发现,涵盖感知、符号、定量统计和程序证据模态,如图像、音频、三维结构、轨迹和图。对推理主干的比较表明,Claude Sonnet 5、GLM-5.2 和 Kimi K2.7 形成高表现集群,事实准确性是最强维度,清晰度在不同主干之间最稳定。主推理主干完成了每个尝试的案例,并获得较高综合得分,而较小的开放权重模型完成案例更少,得分更低。聚合质量在证据模态和学科族之间保持稳定,没有统计显著的跨领域差异,表明具有广泛的泛化能力。