Command Palette
Search for a command to run...
Apodex 1.1:面向复杂工作的智能体能力规模化扩展
Apodex 1.1:面向复杂工作的智能体能力规模化扩展
摘要
通用语言模型能够进行推理和知识综合,但复杂工作还需要与文件、信息源和可执行代码进行持续交互,同时具备状态维护、故障恢复和可验证交付的能力。我们将这种能力称为工作能力:即朝着现实世界目标取得持续、可验证的进展。Apodex 1.1 沿着两个互补的维度发展这种能力。环境规模化扩展(Environment Scaling)提升了可执行文件、搜索和代码环境的多样性与可验证性,而智能体协调规模化扩展(Agentic Coordination Scaling)则训练智能体分解长周期任务、委派并行工作、整合异步结果并重新规划。一个共享的执行框架和 AgentOS 在工具和智能体之间维护任务状态与溯源信息,训练过程则将环境轨迹和协调轨迹转化为可靠的行为。在复杂的专业工作、金融、科学研究、数学、编程和搜索任务中,Apodex 1.1 尽管使用的模型规模远小于许多前沿系统,仍达到了领先的性能水平。350 亿参数的 Apodex 1.1 Mini 进一步以可本地部署的形式保留了强大的工作能力。这些结果将智能体智能建立在随时间完成的有用、可验证的工作之上,并推动我们实现构建一个面向雄心勃勃、长时间运行任务的“重型求解器”的目标。
一句话总结
由 Apodex 团队开发,Apodex 1.1 通过环境扩展(Environment Scaling)和 Agent 协调扩展(Agentic Coordination Scaling)推进了 agentic 工作能力,能够在专业工作、金融、研究、数学、编码和搜索领域实现持续且可验证的任务完成,而其 35B 参数的 Mini 模型在本地保留了强劲性能,超越了许多更大的前沿系统。
核心贡献
- Apodex 1.1 通过环境扩展(扩展可执行文件、搜索和代码环境)以及 Agent 协调扩展(训练 agent 在长周期任务中进行分解、委派、整合和重新规划)来发展工作能力。
- 共享的执行框架和 AgentOS 维护任务状态和来源,结合环境、工件和语句级验证,并通过训练将环境轨迹和协调轨迹转化为可靠行为。
- 在专业工作、金融、科学研究、数学、编码和搜索领域,Apodex 1.1 以显著更小的模型达到了领先性能水平,而 35B 的 Apodex 1.1 Mini 在本地可部署的形式下保留了强大的工作能力,并从训练的 agent 团队协调中获益。
引言
通用语言模型在孤立的知识、推理、数学和编码方面已经变得强大得多,但许多专业和科学工作流程仍然需要持续的长周期执行:查找和解释证据、操作异构文件、编写和调试代码、维护计划、从失败中恢复以及生成可检查的工件。先前的推理与行动、工具使用和交互式 agent 评估表明,仅靠答案质量并不能可靠地转化为行动,而现有的多 agent 系统往往改善了协调,却没有完全解决在不断变化的环境中将推理转化为可验证工作的挑战。作者将 Apodex 1.1 作为一个以工作能力为中心的通用模型和执行系统。其主要贡献是环境扩展,它扩展了可执行文件、搜索和代码世界以供学习,以及 Agent 协调扩展,它改善了工作如何在 agent 和时间之间进行分解、委派、整合和修正,两者通过一个共同的执行框架连接,并通过监督微调和 agentic 强化学习进行训练。
数据集
作者使用可执行环境族作为核心数据生成和评估基底。这三个族共享一个任务合约,并且可以在单个轨迹中组合。
-
文件世界
- 来源与构成: 从底层业务状态、权限关系、推导逻辑和交付需求构建,然后投影到工作区。
- 规模: 一个以职业为条件的注册表涵盖 33 个领域、318 个职业和 1,208 个交付物集群,并通过角度层在职业内产生不同的任务。
- 模式: 初始工作区 W0 包含提供的文件和初始化的运行时。Agent 动作包括检查、解析、计算和写入。轨迹状态持久化编辑和可执行状态。观察仅暴露动作所请求的内容。
- 筛选与验证: 任务只有在独立推导一致时才被接纳,而不是因为生成的答案看起来合理。分级量必须通过代码从权威来源重新推导,或通过记录的来源与实际文档连接。
- 处理细节: 难度通过改变贡献系统及其历史、业务逻辑链的长度以及交付合约中有多少必须从上下文中推断来控制。文件数量本身不会增加难度。
-
搜索世界
- 来源与构成: 将开放网络研究建模为发现、获取和证据综合。
- Agent 交互: Agent 使用结构化搜索和获取来检查选定的页面,并通过受限的 shell 路径获取普通搜索和获取无法恢复的信息。
- 元数据与金标准对象: 金标准对象比最终答案更丰富,包括相关来源集、声明到证据的对齐,以及在来源冲突时的显式不确定性。
- 验证: 检索来源保持精确。语义支持可能涉及有界的基于模型的审查。
- 处理细节: 扩展改变了获取问题的结构,而不仅仅是增加语料库大小。证据可能分布在多个来源中,与初始查询分离,混合了看似合理的非权威候选,或通过异构访问路径暴露。
-
代码世界
- 来源与构成: 结合了基于真实拉取请求的收集世界和超出仓库分布的合成世界。
- 合成任务构建: 任务从经过验证的种子通过组合、抽象转移、请求变化和对抗性输入变化扩展而来。
- 筛选规则: 验证器强化先于任务扰动,因为转换可能使现有的评分器失效。否则,结果是一个损坏的任务而不是新的可执行世界。
- 验证: 使用沙盒执行。对于收集的世界,失败到通过的测试必须在基础状态下失败,并在参考更改后通过。通过到通过的测试必须在两种状态下都成功。
- 奖励攻击防御: 合成世界没有外部预言机,因此通过参考解决方案是不够的。作者测试求解器是否可以在未完成任务的情况下获得奖励。只有在沙盒中成功的攻击才被视为验证器失败。评分与求解器隔离。
- 失败诊断: 在修复前通过的测试表明测试选择不正确。修复后失败的测试表明容器、依赖项或运行命令存在问题。
-
训练和 rollout 使用
- 提供的摘录未指定明确的训练划分或混合比例。训练使用通过 rollout 资格、隔离和重放过滤来描述。
- 每个 rollout 接收一个不可变的世界清单和一个新的可变沙盒。框架初始化初始状态,在会话期间保留它,并在关闭或空闲超时时回收沙盒。
- 学习服务构建对话和奖励,而框架拥有物理执行。求解器观察、隐藏的验证器状态和事后标签保持分离。
- 仅当其初始状态可重建、工具执行被隔离且验证器可重放时,轨迹才被保留。
- 重放记录包括世界种子和生成器版本、工具版本、动作/观察序列、文件增量、验证器版本和终止原因。
- 构建原则是“正向廉价,逆向昂贵”:生成器使用潜在状态或参考程序廉价地构建和解决世界,而 agent 仅看到渲染的工作区,必须在约束下恢复相关路径。
-
FrontierResearchBench
- 来源与规模: 内部 FrontierChallenge 基准集合,包含 97 个可执行任务,涵盖材料科学、化学、化学工程、生命科学、生物信息学、医学影像、环境分析、计算化学、分子模拟和物理建模。
- 任务设置: 每个任务在特定任务的 Docker 环境中有一个固定目标和输入数据。Agent 必须交付一组相互一致的研究工件,如可执行代码、结构化数据、图表、领域特定文件和书面报告。
- 评分: 每个任务有一个自定义评分器,检查所需文件、数值结果、格式、可执行输出和跨工件一致性。确定性规则与来自 GPT-5.6-Sol 的基于评分标准的语义判断相结合,当需要定性科学评估时。最终结果由任务评分器计算,而非 Judge 模型。
- 指标: 通过率是获得满分的任务比例。任何未满足的要求都会导致不通过。
未描述单独的图像裁剪或共享预处理阶段。处理和保证是特定于族的,并与每个环境的验证机制相关联。
方法
作者围绕一个核心观察设计 Apodex 1.1:高质量推理对于复杂的、长周期的工作是必要但不充分的。扩展 agentic 智能需要模型在环境中行动、保留权威状态、将中间结果转化为更好的决策、在不丢失有效进展的情况下恢复,并满足可检查的交付目标。系统围绕一个统一的任务合约组织,定义为 E=(W,W0,q,A,T,Ω,B,D,VD)。这里,W 代表工作区状态空间,q 是目标,A 是可用动作集,T 是状态转移算子,Ω 是观察接口,B 是资源预算向量,D 是交付合约,VD 是任务级验证器。这个公式确保成功既需要有用的结果,也需要从输入到交付的可辩护路径。
为了构建一个重型求解器,作者引入了两个主要的扩展维度:环境扩展和 Agent 协调扩展。环境扩展扩展了跨文件、搜索和代码世界的可执行任务合约的分布。文件环境教会模型检查、转换和保留异构工件。搜索环境侧重于信息获取和在信息不完整下的调和。代码环境教授可执行的转换、测试和恢复。Agent 协调扩展解决了长周期工作所需的分解、委派、结果整合和重新规划。这种联合训练与运行时范式扩展了工作跨 agent、任务分支和时间的组织。
作者利用一个受控的能力发展循环,将这些扩展维度转化为模型能力。环境扩展产生具有显式状态转移和验证器的可执行轨迹,而 Agent 协调扩展产生分解、委派、阶段性返回、整合、重新规划和恢复的轨迹。统一的监督微调(SFT)混合建立了共同的任务执行和协调行为,而 agentic 强化学习(RL)改善了跨两种轨迹族的长周期决策。运行时失败和基准错误决定了接下来应构建哪些环境和协调示例,确保训练将努力重新分配给已识别的能力差距。
该系统的执行基底是 AgentOS,它维护持久的工作区和工具状态。工作区实例化为 Wt=(Ft,Qt,Ct,It,Gt,Kt),其中 Ft 是文件状态,Qt 是检索到的证据,Ct 是可执行状态和日志,It 是工件索引,Gt 是依赖图,Kt 是可选的运行时控制状态。长周期执行需要稳定的名称和显式的可见性规则。每次运行接收三个文件系统命名空间:/inputs 用于只读的任务提供的文件,/workspace 用于中间计算和候选工件,/outputs 作为最终交付物的收集根目录。
Agent 团队架构在此共享基底之上构建了一个显式的协调层。主 agent 全局推理问题并将其分解为可研究的子问题,将其分解写入外部任务板。该板存储协调器拥有的解决状态,超出模型消息历史,而 Agent 总线暴露运行时执行状态,用于异步扇出和扇入。agent 读取不可变输入和可选的跨运行文档库,在后端相关的工作区中生成候选,并通过单一授权分配发布声明的清单。这种设计支持异步人工干预,用户消息可以更新实时任务板,而不会丢弃因果上有效的已完成工作。
为了确保可靠性,系统采用非对称验证。验证器不是复现整个解决方案,而是接收一个具体的声明、其支持证据以及适用的交付约束。其任务是通过搜索反例或检查原子细节来攻击该声明。这产生可操作的反馈,主 agent 可以用它重新打开特定的板项并分派有针对性的后续工作。此外,系统利用自适应最大团队努力,主 agent 仅对薄弱、有争议或关键声明分配额外的、独立范围的调查。最后,一个基于证据的综合阶段消费终端任务板和子 agent 报告,构建声明-证据图,确保最终交付物保留决定性细节和来源。
训练过程从一个提供行为冷启动的 SFT 阶段开始。混合涵盖通用推理、agentic 工具使用、搜索、文件交互、编码和多 agent 协调。过滤通过移除具有无效工具交互或不一致状态的轨迹来优先考虑行为有效性。为了平衡专业化与通用能力,作者在主要能力领域训练 SFT 变体,并通过模型汤合并将它们组合。
强化学习阶段针对长周期 agentic 任务中的持续进展。主要的算法挑战是在终端结果几乎不揭示哪些中间决策应改变的轨迹内分配有用的信用。作者引入了 PIVOT-RL,它使用基于后见之明的轨迹定位。回顾性分析识别出模型开始遵循无效策略的关键决策点,即枢轴点。在每个枢轴点,有用的前缀被保留,并构建一个带有简短纠正提示的局部延续任务。这将片段级信用分配转化为有针对性的策略优化。完成的轨迹异步进入优化,以处理长周期任务的不规则 rollout 流。
由此产生的 RL 训练动态表明,随着强化学习计算规模的扩大,搜索、知识和科学任务持续改进。这种方法允许模型从环境和 agent 协调扩展维度所扩展的世界和协调结构中学习,从有能力的语言模型迈向稳健的重型求解器。
实验
评估比较了 Apodex 1.1 在最小 ReAct 脚手架和具有动态子 agent、协调验证和任务分解的 Agent 团队模式下的表现。公共基准和能力分析验证了在专业工作、科学研究、推理与搜索、数学和软件工程方面的广度,其中 Agent 团队始终优于 ReAct,并且 35B mini 模型展现了前沿级别的效率。内部评估分别验证了结构化搜索交付和具有可执行跨工件检查的端到端科学工作流程,而 HDS6 确认了在分解、验证、证据保真度和假设管理方面的过程级收益。
三个环境族共享一个任务合约,并可在同一轨迹中组合,但强调不同的瓶颈。文件世界以权限和转换为中心,通过代码导出的值或记录的来源进行验证;搜索世界以发现和证据对齐为中心,需要来源和声明审查;代码世界以可执行转换为中心,通过测试和工件检查进行验证。精确保证意味着证据是代码导出的或独立调和的,而不是仅从语言模型法官接受。文件世界以权限和转换为中心,验证与代码导出的值或记录的来源相关联。搜索世界以发现和证据对齐为中心,需要来源和声明审查。代码世界以可执行转换为中心,通过测试和工件检查进行验证。
AgentOS 1.1 添加了运行时机制,针对工作区状态、引用完整性、协调、实时干预、上下文压力、预算执行和共享交付中的特定失败模式。该设计强调显式所有权、故障关闭边界和调和,以便中间和最终工件保持可审计。共享交付由单一发布者租约、精确清单、范围写入和基线调和来管理,而不是靠惯例。一个稳定的三区域命名空间,具有显式的私有和共享拓扑,减少了模糊的工作区所有权和后端相关的可见性。只读的 /shares 挂载防止持久用户文档被 agent 修改。外部任务板、周期性重新注入和最终化门防止计划和完成状态在压缩期间消失。消息可寻址队列、可中断等待、交付确认和租约续期使得实时干预成为可能,而不会出现长时间的扇入阻塞或报告竞争。共享交付通过单一发布者租约、精确清单、范围写入策略和基线调和,阻止并发、未声明、过时或不完整的输出文件。
Apodex 1.1 在从 ReAct 切换到 Agent 团队时,在科学研究和 agentic 评估中表现出持续的增益,尤其是在生物医学和前沿科学任务上提升显著。35B mini 配置在选定的基准上已经达到或接近更大的前沿参考,并通过 agentic 协调进一步改进,表明模型规模效率。在列出的通用推理和深度搜索参考模型中,分数紧密聚集,Kimi-K2.6 在 Humanity's Last Exam 上最高,GPT-5.5 在 DeepSearchQA 上最高。Agent 团队在 FrontierScience-Research 和 BioMysteryBench 上优于 ReAct,在生物医学任务上增益尤其大。35B mini 模型仅使用 ReAct 就在 FrontierFinance、FrontierScience-Research 和 APEX-Agents 上达到有竞争力的分数,而 Agent 团队进一步增加收益。在报告的参考行中,Kimi-K2.6 在 Humanity's Last Exam 上排名最高,而 GPT-5.5 在 DeepSearchQA 上排名最高。
35B Apodex mini 模型使用 ReAct 已经在 FrontierFinance、FrontierScience-Research 和 APEX-Agents 上达到了强大的工作策略,在重叠评估中比之前的 mini 模型有所改进。添加 Agent 团队协调带来进一步增益,其中 FrontierFinance 的提升最大。由此产生的系统在选定的 FrontierFinance 比较中领先,在 FrontierScience-Research 上接近一个前沿参考,并在 APEX-Agents 上匹配一个开放权重参考的性能水平。仅 ReAct 就在 FrontierFinance 和 APEX-Agents 上比 Apodex 1.0 mini 有所改进。Agent 团队在 FrontierFinance 上产生了最大的增益,并将 35B 系统提升到超过最强的选定专有参考。35B 模型与更大的参考系统保持竞争力,在 FrontierFinance 上领先,在 FrontierScience-Research 上接近前沿参考,并在 APEX-Agents 上匹配开放权重性能水平。
Apodex 1.1 使用 Agent 团队在竞赛级证明任务上比 Apodex 1.0 使用 Agent 团队有巨大的代际改进,在所有三个评估的竞赛集上从低于声明的参考阈值移动到高于它们。在 Apodex 1.1 内,Agent 团队在竞赛集和 IMO-ProofBench 上也始终优于 ReAct,在更高级的证明基准上相对增益最大。Agent 团队将 Apodex 1.1 提升到所有三个竞赛集的参考阈值之上,而 Apodex 1.0 使用 Agent 团队得分远低于它们。在 IMO-ProofBench 上,Apodex 1.1 使用 Agent 团队在 Basic 性能上接近完美,在 Advanced 性能上比 ReAct 显著更高。在 Apodex 1.1 内从 ReAct 切换到 Agent 团队在竞赛级证明任务和证明基准上都产生持续的增益。
三个环境族(文件、搜索、代码)定义了一个共享的任务合约,同时强调不同的验证瓶颈,精确保证要求代码导出或调和的证据。AgentOS 1.1 引入了运行时机制,强制显式所有权、故障关闭边界和单一发布者共享交付,保持中间工件可审计。在科学、agentic 和证明基准上,使用 Agent 团队协调的 Apodex 1.1 始终优于 ReAct 和先前版本,通常匹配或超过更大的前沿模型,在生物医学、金融和竞赛级证明任务上增益尤其大。