HyperAIHyperAI

Command Palette

Search for a command to run...

Atria Dawn:智能体超级智能的黎明——人机协作中不断演变的角色

摘要

随着 AI 智能体参与其继任者的开发,它们既重塑了智能的生产方式,也改变了人类研究者的角色。我们推出 Atria Dawn Preview,一个面向科学研究和工程工作流的基础智能体语言模型,旨在拓展智能体在现实世界中生产力的前沿。该模型通过可验证经验管道(Verifiable Experience Pipeline)进行训练,该管道将工具介导的交互与可执行环境及外部验证结果相连接。在涵盖现实研究、工程和数字工作的 16 项基准测试中,Atria Dawn Preview 与前沿智能体相比具有竞争力,并在其中五项上取得了最高报告分数。除了独立性能之外,我们将该模型背后的真实研发过程作为人机协作的案例研究,分析了来自 56 名参与者的 769 条任务记录以及智能体日志。当被要求在可比条件下评估已完成任务时,参与者将约三分之一的已完成 AI 辅助任务评为在没有 AI 的情况下不可行。更引人注目的是,智能体经常提出方法和实施修订,而人类保留大多数最终决策,并通过判断和反馈引导探索。这些观察表明,从任务级执行向项目级伙伴关系的转变,人类的努力集中在什么值得追求以及证据应如何指导研究上。因此,迈向更自主的 AI 研究必须同时提升发现能力和有意义的人类监督能力,在持续发展的风险和方向上保持负责任的人类权威。

一句话总结

复旦大学研究人员推出 Atria Dawn Preview,这是一个面向科学研究与工程的基础 agent 语言模型,通过可验证经验流水线进行训练,该流水线将工具介导的交互与可执行环境及外部验证结果相连接。该模型在 16 项基准测试中达到前沿 agent 水平,在其中五项取得最高报告分数。在一项涵盖 56 名参与者、769 条任务记录的案例研究中,结果显示 agent 频繁提出方法并实施修订,而人类保留最终决策权并引导探索方向,这标志着从任务级执行向项目级协作的转变,既要求更强的发现能力,也要求有意义的人类监督。

核心贡献

  • 推出 Atria Dawn Preview,一个 7440 亿参数的混合专家 agent 语言模型,通过可验证经验流水线训练,将任务锚定在可执行环境中,并以外部信号检验结果,在 16 项基准测试中取得具有竞争力的表现,其中五项取得最高报告分数。
  • 在模型开发过程中呈现一项人机协作案例研究,分析了来自 56 名参与者的 769 条任务记录和 agent 日志,发现 AI 提出了 64.6% 的方法和决策,而人类在 85.5% 的情况下做出最终选择,且人类干预推动了 76.0% 的困难任务进展。
  • 报告了监督动态的实证证据,显示参与者将约三分之一的已完成 AI 辅助任务评为无 AI 则不可行,且每日每位人类提示对应的 agent 动作中位数在四周内从 11.0 升至 28.5,表明从任务级执行向项目级协作转变,人类保留最终权威。

引言

随着语言模型 agent 在软件工程和研究中承担持续的工具使用,一个关键问题浮现:在真实的模型开发项目中,由谁决定哪些问题值得解决、采用哪些方法,以及如何解读结果?已有工作聚焦于任务级能力,但未阐明 agent 与人类之间的责任划分,也未说明 agent 是否能强化研究过程本身,而不仅仅是执行任务。

作者推出 Atria Dawn Preview,一个 7440 亿参数的混合专家 agent 语言模型,专为科学研究与工程工作流训练。该模型使用可验证经验流水线,将任务和 agent 轨迹与外部检验的结果相连接。在 16 项基准测试中,该模型在其中五项取得最高分数,尽管表现存在差异。作者还将 Atria Dawn 自身的开发过程作为案例研究进行分析,基于来自 56 名参与者的 769 条任务记录。他们发现,agent 提出了 64.6% 的方法和决策,而人类在 85.5% 的情况下做出最终选择,76.0% 的任务因人类干预而取得进展。这揭示了一种转变:agent 发起方法并执行修改,而人类专注于评估、选择和方向引导。作者认为,持续的递归自我改进需要超越任务级能力,包括识别有价值的方向、设计信息丰富的实验,以及决定何时调整投入,这些领域中人类判断仍然至关重要。

方法

作者推出 Atria Dawn Preview,一个 7440 亿参数的混合专家基础模型,专为复杂研究与工程任务而设计。其架构强调持续推理、工具利用以及与外部环境的动态交互。

核心训练方法依赖于可验证经验流水线。该框架将任务目标与工具介导的推理及外部验证结果紧密耦合,以培养可泛化的行为。在 rollout 过程中,agent 观察环境状态,选择并调用工具,检查产生的输出,并根据反馈迭代调整其行动。

最终结果通过领域特定信号进行严格检查,包括可执行测试、实验指标、文件和应用程序状态、几何检查以及源码支持。执行后,轨迹筛选通过移除不完整、矛盾、重复或行为无效的样本来过滤数据。这确保只有将任务与其轨迹、产物和验证证据相连接的高质量经验被整合到模型的可复用能力中。

该系统采用持续的失败分析来驱动后续任务构建和环境改进。反复出现的问题,如无效的工具选择、不完整的验证、缺失的证据以及不成功的恢复,会促使生成额外的任务和质量检查。当失败运行的输出被独立确认时,这些运行会被重新用作诊断案例,教会模型用于状态检查、反馈解读和错误恢复的可复用行为。

在实际部署中,系统设计明确了人类研究人员与 AI agent 之间的分工。人类保留定义目标、为失败运行补充缺失上下文以及指定必要变更的责任,而 agent 生成选项并产出大部分代码、文本和修订。这种协作动态反映在运行指标中,随着研究人员将更多执行任务委托出去,agent 动作与人类提示的比率显著上升。

如下图所示:

不断上升的比率表明,每一次人类判断现在都会通过更多的 agent 动作传播,显示出向更深层执行委托的转变,而非自主性的增长。

实验

Atria Dawn Preview 在 16 项基准测试中进行了评估,涵盖工具使用、搜索、研究、工作区生产力、软件工程和网络安全,在其中五项取得最高报告分数,三项取得第二高分数,在通用 agent 任务和安全相关编码方面表现尤为突出。案例研究展示了在科学研究、软件创建、报告交付和漏洞修复方面的具体能力,包括从零构建 MiniOS 以及训练大型天气预报模型。开发过程中人机协作的分析显示,96.5% 的任务涉及 AI,33.2% 的 AI 辅助任务被评定为无 AI 则不可行,而人类在 85.5% 的方法或参数选择中保留最终决策权,在最依赖 AI 的任务中,95.4% 的目标由人类决定。当困难出现时,人类干预主要是信息性的,提供上下文或诊断而非直接编辑,在实质性修订的任务中,AI 在人类反馈后修改输出的比例为 75.4%。

Atria Dawn Preview 在广泛的 agent 基准测试中领先或紧追现有最佳模型,在工具使用、搜索和网络安全方面取得最高分数。其优势在通用 agent 任务中保持一致,而在编码方面则展现出特定的安全能力,并在软件工程和终端任务上具有竞争力。Atria Dawn Preview 在五项基准测试中取得最高报告分数,包括 AutomationBench、BFCL v4、DeepSearchQA、BrowseComp 和 CyberGym。在三个通用 agent 基准测试(SkillsBench、Workspace-Bench、Workspace-Bench-Lite)中,它排名第二,与领先者的差距均小于两分。在网络安全(CyberGym)方面,它领先第二名 2.0 分,表明在漏洞分析和安全任务方面具有显著优势。在编码基准测试中,它在 SWE-bench Pro 和 Terminal-Bench 2.1 上与顶级模型相当,同时在已报告分数中领先 MLE-bench Lite。在其余通用任务中,它保持在领先梯队,在搜索和专业基准测试中经常匹配或超越多个对比模型。

Atria Dawn Preview 在广泛的 agent 基准测试中持续匹配或超越领先模型,在工具使用、搜索和网络安全方面取得最高分数,并在五项基准测试中排名第一,包括 AutomationBench、BFCL v4、DeepSearchQA、BrowseComp 和 CyberGym。它在三个通用 agent 基准测试中排名第二,差距均小于两分,并在漏洞分析方面表现出显著优势。在编码方面,它在软件工程和终端任务上具有竞争力,同时在已报告分数中领先 MLE-bench Lite,并在其余通用任务中保持在领先梯队。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供