Command Palette
Search for a command to run...
Intern-S2-Preview:科学智能体基础模型
Intern-S2-Preview:科学智能体基础模型
摘要
科学发现日益需要能够对异构模态的科学证据进行推理、与科学工具和环境交互,并在长任务跨度上持续推进的 AI 系统。我们提出 Intern-S2-Preview,这是一系列科学智能体基础模型,旨在支持多模态科学理解、推理、生成和长时程任务。其训练流程首先在渲染后的科学文档、图文交错数据以及多样化的科学语料上进行科学多模态预训练。从预训练检查点出发,我们采用统一的训练后流程,包括监督微调、可扩展的多任务强化学习(RL)、黑盒与白盒智能体强化学习,以及在策略蒸馏。该流程由一系列提升 rollout 与训练稳定性和效率的实用技术支撑,包括带离策略校正的部分 rollout、自适应长度正则化、在线投机解码、鲁棒多任务优化,以及面向智能体任务的轨迹感知经验组装。在架构层面,Intern-S2-Preview-397B 将时间序列建模从高效长序列理解扩展到数值预测,同时研究了 Memory Decoder 作为独立的记忆增强路径,用于在不修改冻结的 397B 主干网络的情况下实现快速科学领域适配。在科学、多模态、智能体和通用基准上的评估表明,Intern-S2-Preview-397B 在多种设置下取得了具有竞争力或领先的结果。时间序列模块提升了在 SciTS 上的科学信号理解与预测能力,而独立的 Intern-MemDec-4B 扩展在不修改冻结的 397B 主干网络的情况下,将 Biology-Instructions 平均得分从 56.92 提升至 60.32。
一句话总结
上海人工智能实验室的 Intern-S2-Preview 团队提出了 Intern-S2-Preview,一个科学 agentic 基础模型系列。该系列将渲染科学文档、交错图文数据以及多样科学语料上的多模态预训练,与监督微调、多任务强化学习、黑盒与白盒 agentic 强化学习以及同策略蒸馏相结合,并使用带离策略校正的 partial rollout 和自适应长度正则化,以实现稳定且高效的长程任务。Intern-S2-Preview-397B 在科学、多模态、agentic 和通用基准上取得有竞争力或领先的结果,而 Intern-MemDec-4B 在不修改冻结的 397B 主干的情况下,将 Biology-Instructions 平均分从 56.92 提升到 60.32。
核心贡献
- 本文提出 Intern-S2-Preview,一个科学 agentic 基础模型系列。该系列通过对渲染文档、交错图文数据以及多样科学语料进行科学多模态预训练,再经过统一后训练流程,该流程结合监督微调、可扩展多任务强化学习、黑盒和白盒 agentic RL 以及同策略蒸馏。
- 该工作引入面向长程和异构任务混合的后训练系统与优化技术,包括带离策略校正的 partial rollout、自适应长度正则化、在线推测解码、Group-level Entropy-Controlled Policy Optimization 和 trace-aware 经验组装。同时引入 harness × task 抽象,将 agent 运行时与可执行任务分布解耦。
- Intern-S2-Preview-397B 在科学、多模态、agentic 和通用基准上取得有竞争力或领先的结果。时间序列模块改善了 SciTS 上的科学信号理解和预测。独立的 Intern-MemDec-4B 记忆增强扩展在不修改冻结的 397B 主干的情况下,将 Biology-Instructions 平均分从 56.92 提升到 60.32。
引言
科学 AI 正在从基于文本的推理扩展到多模态工作流,这些工作流需要在长程范围内进行持续规划、工具使用以及与异构证据的交互。先前的通用 LLM 提供了广泛的指令遵循能力,但缺乏对科学模态、领域协议和可验证工具交互的专门化,而科学多模态模型通常被评估为静态问答系统,而非长程 agents。作者通过 Intern-S2-Preview 这一科学 agentic 基础模型系列来应对这一空白,重点关注 Intern-S2-Preview-397B 作为主要评估系统。该模型在长序列时间序列理解中加入了数值预测分支,并探索将参数化记忆模块附加到冻结主干上,以在不损失通用能力的前提下实现领域专门化。其训练流程将科学文档和多模态预训练与多任务强化学习以及 agentic RL 框架相结合,以支持迭代式、基于工具的科学问题求解。
数据集
作者使用了多个数据集构建和处理流水线:
-
交错图文预训练数据:
- 来源:聚焦生命科学、化学和材料科学的 PDF 文档。
- 处理:MinerU2.5-Pro 执行 OCR 和布局感知的结构化解析。普通图像、行间公式和表格按边界框坐标从 PDF 页面中裁剪,并保存为标准化子图像。
- 页面级序列根据布局阅读顺序和边界框顺序构建,使用文本块和视觉单元。
- 质量过滤:视觉增益计算为纯文本条件与图像/表格/公式条件之间的语言模型困惑度差异。仅当视觉增益超过领域特定阈值并通过人工审核时,页面才会被保留。
- 文档分块:过滤后的页面序列按原 PDF 顺序拼接,并切分为最多 256k tokens 的块,块之间有 512 个 token 的重叠。
- 用途:长上下文 VLM 预训练,帮助模型学习视觉单元如何出现在文档叙述和推理链中。
-
图像检索增强数据:
- 来源:所交付的图像数据源。
- 处理:提取图像和关键元数据,然后按 SHA256 图像值去重。一个 8B 嵌入模型将图像编码为 1024 维向量,并存储在分片的 Milvus 向量数据库集合中。
- 检索支持文到图和图到图模式。
- 对于图像输入,图像被直接编码,同时一个 caption 模型生成文本并嵌入,从而实现视觉和语义联合检索。对于文本输入,文本被嵌入以进行跨模态检索。
- 后处理包括重复过滤、基于质量分数的重排序以及基于分数的最终过滤。
- 用途:召回高质量图像数据,并在训练中提高其采样比例。
-
监督微调数据:
- 组成:通用对话、指令遵循、安全对齐、代码生成与推理、图文理解、视觉感知与空间定位、工具使用、专门科学任务以及长程 agentic 轨迹。
- 处理:进行大规模过滤、清洗和去重。思维链演示通过使用 Intern-S1-Pro 和其他领先开源模型的拒绝采样构建,然后由语言模型和人类领域专家验证。
- 用途:首个后训练阶段,在强化学习之前将预训练模型转换为可控助手。
-
agentic 任务构建数据:
- 来源:公共编程和终端任务集合,以及以社区贡献技能为种子的自进化合成系统。
- 共同约定:每个任务包括一个初始化的执行环境、一个自然语言目标和自动验证器。
- 处理:公共编程任务通过实体化仓库或容器来映射,将 issue 陈述转换为目标,并保留测试或奖励程序作为验证器。自进化任务会经过可行性、安全性、质量和冗余过滤,然后进行领域平衡重采样。技能状态图将技能组合为不同时间跨度的能力路径。每条路径通过带可执行和语义验证器的渐进式流水线转换为环境、任务和验证器。离线轨迹按结果过滤,并按行为类型进行步骤级整理;错误步骤可被屏蔽为 skip。
- 用途:部署在在线 agentic 强化学习中,并展开以构建可复用的离线训练数据。执行失败会反馈以更新技能采样权重和合成提示。
方法
作者通过用于时间序列建模的专门模块和用于持续领域专门化的 Memory Decoder 来扩展 Intern-S2-Preview-397B 模型。Memory Decoder 作为一个单独的扩展模型运行,将外部参数化记忆附加到冻结主干上。如下图所示,在每个解码步骤中,冻结主干和 memory decoder 并行处理输入,以生成单独的 next-token 分布。一个轻量级 token 级路由器使用隐藏状态和不确定性特征来预测动态融合权重,控制每个分布对最终预测的贡献。这种设计允许模型在不修改通用主干核心参数的情况下集成领域特定知识。
为了加强科学数据基础,作者在常规文本预训练之外引入了视觉预训练(VP)。参考框架图,文本通路从解析后的 PDF 内容预测 tokens,而视觉通路从渲染页面预测前景视觉潜变量。这种双通路方法改善了文本和视觉文档表示之间的对齐,无需 OCR 或人工标注。
为了进一步增强多模态理解,作者从 PDF 文档中构建交错图文数据。如下图所示,该流水线包括 PDF 布局解析、视觉单元裁剪和页面级交错序列构建。基于视觉增益的质量过滤机制比较纯文本与交错条件下的困惑度,以保留视觉内容提供有意义支持的页面。这些序列随后被组织为文档级块,用于长上下文预训练。
此外,引入了一个大规模图像检索流水线来召回高质量数据。参考框架图,该过程包括使用嵌入模型构建向量、在线跨模态检索,以及通过重排序和过滤进行后处理,以增强模型的多模态能力。
后训练流程通过多阶段过程整合通用能力和科学能力。如下图所示,从预训练检查点开始,模型在高质量多模态数据上进行监督微调,以建立基本的推理和工具使用模式。随后进行专门策略学习,其中多任务强化学习提升科学推理和通用推理,而 agentic RL 培养长程工具交互能力。最后,同策略蒸馏将推理策略和 agentic 策略的优势合并到一个统一模型中。
实验
实验在纯文本和多模态设置下评估 Intern-S2-Preview-397B 模型在科学和通用基准上的表现,同时考察后训练效率和架构扩展。自适应长度正则化通过仅在模型基本掌握某个查询后对正向响应重新加权,来减少输出长度而不牺牲奖励性能。主要结果表明,该模型在许多科学和通用基准上取得了领先的开源性能,并具备强大的 agentic 能力。架构研究表明,memory decoder 在提升目标生物学性能的同时不损害跨领域行为,专用时间序列模块相对于通用文本和视觉语言模型改善了时间序列理解和预测。
七个公共集合提供可执行编程和终端任务,任务数量从约两千到八万不等。环境数量从一个共享环境到超过三万二千不等,反映了不同的复用策略。一些集合将许多合成任务集中在少数环境中,而另一些则将任务分布在许多不同环境中。NVIDIA Nemotron-Terminal-Synthetic-Tasks 集合的任务数量最多,为 80,000 个任务,但只使用八个环境。Nebius SWE-rebench-V2 提供最多的环境,约有 32,000 个任务和几乎相同数量的环境。RUC-AIBOX ClawGym-Task 是极端复用案例,将 13,500 个任务映射到单一环境。
Intern-S2-Preview-397B 在多个科学基准上领先对比模型,包括生物学指令遵循、生物分子指令任务、科学推理、材料结构生成和生物分子相互作用设计。它还在多个分子、多模态和通用基准上取得了最强的开源结果,在面向科学的 agentic 任务上仅次于 GLM-5.2。Intern-S2-Preview-397B 在 Biology-Instructions、Mol-Instructions、SciReasoner、MP20 和 ProteinBinder-9 上创下了所有对比模型中的最佳整体性能。它是 MolecularIQ、TOMG-Bench、XLRS-Bench、MicroVQA、MMLU-Pro、SimpleQA-Verified、MMMU-Pro 和 ChartQAPro 上最强的开源模型。
Intern-S2-Preview-397B 在通用基准上表现强劲,在 MMLU-Pro、SimpleQA-Verified、MMMU-Pro 和 ChartQAPro 上取得最佳开源结果。它在 AdvancedIF 和 HMMT-2026 上的表现则较为参差,其他模型处于领先。Intern-S2-Preview-397B 是 MMLU-Pro、SimpleQA-Verified、MMMU-Pro 和 ChartQAPro 上领先的开源模型。在 SimpleQA-Verified 和 ChartQAPro 上,Intern-S2-Preview-397B 仅次于 Gemini-3.1-Pro 排名第二,而在 AdvancedIF 或 HMMT-2026 上并非顶级开源模型。
Intern-S2-Preview-397B 在 SciTS 时间序列理解任务上持续优于所评估的通用文本 LLM 和视觉语言 LLM,且通常优势明显。它还在九个共享任务中的七个上超过 Intern-S1-Pro,尽管使用的参数量不到后者的一半,尤其在 ASU03、BIU03、MEU01 和 PHU01 上增益显著。该模型进一步将覆盖范围扩展到雷达编码方案分类和模式与调制分类,在这些任务上取得了远高于基线模型的 F1。Intern-S2-Preview-397B 在每个 SciTS 时间序列理解任务上都优于所有列出的通用文本和视觉语言模型,通常差距很大。它在九个共享任务中的七个上超过 Intern-S1-Pro,同时使用的参数量不到一半,并且在两个 Intern-S1-Pro 不支持的雷达相关任务上表现强劲。
将 memory decoder 添加到冻结的 Intern-S2-Preview-397B 主干上,将 Biology-Instructions 平均分从 56.92 提升到 60.32。大多数所报告的 DNA 相关任务都有提升,尤其是 DNA-cpd 和 DNA-tf-m,而 DNA-tf-h 则出现小幅下降。记忆增强模型在跨领域基准上仍与主干接近,表明其实现了有针对性的生物学专门化,而非广泛的行为变化。记忆增强变体将 Biology-Instructions 平均分从 56.92 提升到 60.32。大多数列出的 DNA 任务都有改善,其中 DNA-cpd 和 DNA-tf-m 提升尤其显著。DNA-tf-h 是轻微例外,相对于冻结主干有小幅下降。跨领域性能保持与冻结主干接近,同时目标生物学性能有所提升。
实验覆盖了环境复用差异很大的大规模编程和终端任务集合,以及 Intern-S2-Preview-397B 在科学、通用和时间序列理解任务上的基准评估。Intern-S2-Preview-397B 在多个科学和通用基准上取得领先的开源结果,并在时间序列任务上持续优于基线。添加到冻结主干上的 memory decoder 改善了生物指令性能,尤其是在 DNA 相关任务上,同时使跨领域行为保持接近原始模型。