Command Palette
Search for a command to run...
AREX:迈向深度研究的递归自改进智能体
AREX:迈向深度研究的递归自改进智能体
摘要
深度研究要求智能体找到同时满足多重约束的答案。发现此类答案成本高昂,而验证候选答案通常可分解为易于处理的逐约束检查。这种发现–验证的不对称性表明,研究型智能体不应仅仅延长搜索时间:它应通过验证中间结果并利用部分已验证状态来指导后续优化,从而递归地改进其当前答案。我们提出 AREX,一个递归自改进(RSI)深度研究智能体家族。AREX 在内层研究循环(收集证据并构建临时答案)与外层自改进循环(逐约束审计答案、识别未解决的断言并发起针对性后续研究)之间交替进行。为在长周期内维持 RSI,AREX 学习了一种自主上下文更新工具,将不断增长的交互历史压缩为紧凑的改进状态,保留已验证证据和未解决约束,且无需依赖外部模型。我们通过智能体中训练和长周期强化学习,在已验证的合成任务和高质量轨迹上训练 AREX。为缓解长周期学习中稀疏最终奖励的问题,我们强调获取决定性证据或纠正错误研究方向的关键步骤。我们实例化了一个稠密 4B 模型和一个 122B-A10B 混合专家模型。在 BrowseComp、WideSearch、DeepSearchQA、Humanity’s Last Exam(HLE)以及其他推理和工具使用基准测试中,AREX 显著优于同等规模的基线模型,并与使用显著更多激活参数的模型保持竞争力。
一句话总结
北京智源人工智能研究院的研究人员提出 AREX,一个递归自我改进的 agent 家族,它们交替进行证据收集和逐约束审计,学会自主将交互历史压缩为紧凑的改进状态,而无需外部模型,并通过 agentic 中间训练和长时强化学习进行训练,强调获取决定性证据或纠正错误方向的关键步骤,在 BrowseComp、WideSearch、DeepSearchQA 和 Humanity’s Last Exam (HLE) 上取得强劲表现,使用的模型包括一个密集 4B 模型和一个 122B-A10B 混合专家 (MoE) 模型,同时与规模大得多的模型保持竞争力。
核心贡献
- 将多约束深度研究建模为递归自我改进的过程,利用代价高昂的发现与易处理的验证之间的不对称性,递归地将部分验证的解决方案转变为目标更明确的研究问题。
- AREX agent 架构将内部研究循环与外部自我改进循环配对,后者验证约束、标记未解决的声明,并使用学习到的上下文更新工具将交互历史自主压缩为紧凑的改进状态。
- 多阶段训练框架强调获取决定性证据或纠正错误的关键区间,AREX 的密集 4B 和 122B-A10B MoE 实例在深度搜索、广域搜索、推理和工具使用基准测试上优于同等规模的基线模型。
引言
深度研究任务要求 agent 同时满足多个约束,因此仅靠延长单次搜索轨迹难以解决。以前的系统增加更多推理或工具调用,但这常常重新引入早期错误、重复探索已穷尽的方向,或过早接受部分有效的答案。更深层的挑战不在于搜索更长时间,而在于识别哪些约束尚未解决,并利用这一诊断推动有针对性的跟进调查。作者观察到发现–验证的不对称性:验证候选答案可以分解为更简单的、约束层面的检查,揭示无依据或相互矛盾的陈述。他们利用这一点构建了 AREX,一个递归自我改进的 agent,将验证视为主动控制信号。AREX 交替运行内部研究循环和外部循环:内部循环构建临时答案,外部循环逐约束审计这些答案,保留已验证的证据,并将未解决的差距转化为更精细的研究问题。自主上下文更新工具将 agent 的历史压缩为结构化的改进状态,多阶段训练管线配合步骤级奖励分配支持长时递归改进。
数据集
作者构建了一个专门的训练数据集,以教授 AREX 递归研究行为。该数据集分两个阶段构建:首先,生成具有挑战性的研究任务;其次,从在相同环境中运行的强教师模型收集高质量求解轨迹。
-
任务数据集 (D_task)
- 数据源与模板:人类专家为三类问题定义模板——浏览密集型、推理密集型和科学文献问题。具体实例由真实世界的网页、学术论文、结构化知识库和公共仓库生成。
- 合成过程:对于每个任务,隐藏答案会与多个可验证的约束(如时间、数值、关系约束)配对。这些约束被转换为间接的多跳描述,以防止浅层关键词匹配。
- 过滤:自动检查强制确保正确性、唯一性、证据可得性和难度。含糊、约束不一致、可通过简单检索解决,或在大量 rollout 后仍未解决的任务会被丢弃。
- 结果:D_task = {(x, y)},其中 x 是研究查询,y 是真实答案。
-
教师轨迹数据集 (D_traj)
- 收集:对于每个合成任务,教师模型使用与 AREX 相同的工具进行交互,并采样完整的研究轨迹(动作、工具调用、检索到的观察、中间推理和最终答案)。
- 质量控制:
- 只保留展示迭代调查、连贯状态维护和适应新证据的轨迹。丢弃立即猜测、忽略观察或未能修正错误假设的轨迹。
- 丢弃工具交互无效、观察被忽略或引用无依据的轨迹。
- 要求最终答案能从收集的证据中重建;移除那些在充分证据之前就给出答案、包含无依据声明、与检索信息矛盾或依赖无根据假设的轨迹。
- 应用置信度阈值:低于预设水平的轨迹将被丢弃。
- 结果:D_traj = {(x, τ)},其中 τ 是经验证、以证据为基础的轨迹。
-
用途:轨迹数据集直接监督 AREX 的递归技能——迭代式证据获取、研究状态维护、以证据为基础的回答构建和自适应持续。正文中未提供明确的训练划分或混合比例;构建过程注重质量而非数量,未报告具体规模。这些数据用于训练模型在研究的双循环框架中运行。
方法
作者提出了 AREX,一个实现分层式、双层递归自我改进过程的深度研究框架。该架构包含内部研究循环和外部自我改进循环,以迭代方式收集证据、综合答案并优化研究轨迹。
给定输入查询,系统首先推导出初始研究目标。内部研究循环执行研究动作、整合检索到的证据并更新当前答案,直到目标得到充分处理。然后输出临时答案,附带支持证据和答案级置信度分数。外部自我改进循环评估这一临时结果。如果置信度分数超过预定义阈值,则接受该答案。否则,该循环评估当前研究轨迹是否可恢复。有用的发现将被保留并转换为有针对性的细化目标,而噪声大或无信息的轨迹将触发从原始问题重新开始。
内部研究循环通过分析当前研究目标、调用搜索或浏览工具并整合返回的证据来逐步构建答案。在每一步中,交互轨迹作为模型的工作研究状态。研究策略随着新证据的积累而适应,引导模型关注剩余约束,或在来源冲突时重新定向调查。为了管理长时研究而不丢失关键信息,作者引入了一种自主上下文更新机制。模型不是依赖固定的启发式规则,而是自主调用更新上下文工具,将累积的轨迹整合为刷新后的研究状态。该状态保留已验证的发现、当前候选、未解决的约束和下一步计划,同时移除冗余的观察。一旦目标得到充分调查,模型调用结构化完成接口,外部化临时答案、支持证据以及反映答案完整性和一致性的置信度分数。
外部自我改进循环接收结构化的结果,决定是终止、细化还是重启。如果置信度分数低于阈值,模型评估轨迹的可恢复性。对于可恢复的轨迹,外部循环保留可靠的发现,识别剩余问题,并为下一轮递归制定有针对性的目标,从刷新状态初始化内部循环。如果轨迹被认为过于嘈杂或误导,则丢弃,下一轮仅从原始问题初始化。此过程重复进行,直到答案达到置信度阈值或超出最大轮数。
为了实现这种递归研究能力,作者通过递归研究任务合成和教师轨迹收集构建了专门的训练数据集。任务合成通过将约束抽象为间接描述,生成需要多源证据整合和自适应规划的可验证问题。教师轨迹收集则让强模型与研究环境交互,随后进行严格的质量控制,只保留具有有意义的迭代调查、有效工具交互和以证据为基础的答案的轨迹。
训练管线包括多阶段 agentic 中间训练和步骤感知强化学习。中间训练过程通过浏览密集型任务逐步建立基本的工具使用和证据获取能力,随后通过专家级推理任务加强长篇思考。为减轻能力干扰,混合能力巩固阶段会重放长时轨迹中的关键步骤,并融入复杂的学术研究任务。作者引入了关键步骤聚焦监督,识别关键研究决策,例如发现与答案相关的证据或重新定向搜索。通过仅对这些高价值决策点施加损失,同时保留前序上下文,模型能更好地学习轨迹中最具信息量的部分。
在此基础上,步骤感知强化学习设计解决了长时轨迹的异质性。作者不是均匀传播序列级奖励,而是采用回合级策略优化公式,配合分层步骤平衡归一化,防止较长轨迹主导训练目标。此外,引入步骤级奖励塑造,以强调信息量大的中间决策。成功轨迹中标注的关键步骤会获得有界的辅助奖励,为决策关键步骤提供高精度监督,同时保持最终答案的正确性作为主要优化目标。
实验
AREX 在六个基准测试上进行评估,涵盖深度研究、agentic 任务完成、广域检索和使用工具的高阶推理,使用统一的 agent 接口,支持迭代搜索、上下文更新和结构化最终答案。该框架在对比更大的模型和专门研究 agent 时取得了强劲的结果,自主上下文更新主动整合已验证的发现和未解决的约束,外部自我改进循环优化低置信度输出,大幅提升准确率。消融研究证实,渐进式多轮能力训练、集中在决策关键步骤上的监督,以及步骤感知强化学习各自在建立模型的长时研究行为和整体性能方面发挥了关键作用。
AREX-Base 在深度搜索和 agentic 推理任务上取得有竞争力的性能,超越多个更大的开源模型,并与专有前沿系统匹敌。它在 GAIA 和 WideSearch-en 上优于 Kimi-K2.6,在 DeepSearchQA 和纯文本 HLE 上与 MiroThinker-H1 和 DeepSeek-V4-Pro 等专门 agent 持平或超越。像 Gemini-3.1-Pro 和 Opus-4.6 这样的前沿模型在 BrowseComp 和 DeepSearchQA 上仍处于领先地位。AREX-Base 仅使用 10B 活跃参数就在 GAIA 和 WideSearch-en 上超过 Kimi-K2.6。前沿模型如 Gemini-3.1-Pro (85.9) 和 Opus-4.6 (83.7) 取得了最高的 BrowseComp 分数。AREX-Base 尽管参数少得多,但优于 Qwen3.5-397B 模型。Kimi-K2.6 展示了强大的开源结果,尤其在 xbench-2510 (90.0) 和 WideSearch-en (80.8) 上。
AREX 在 80.3% 的 BrowseComp 案例中调用了 update_context,更新时的平均上下文大小为 25,721 个 token,远低于 128K 窗口限制。最主要的触发因素是修正搜索策略(66.9%),更新后的状态几乎总是保留未解决的约束(95.5%)和下一步计划(96.4%),同时也捕捉已验证的发现(72.1%)和被拒绝的候选(81.5%)。这一模式表明 agent 主动更新上下文以整合研究,而非等到上下文满后才更新。上下文更新被主动触发:更新时的中位上下文大小为 25,386 个 token,远低于 128K 的硬限制,只有 0.01% 的更新发生在该限制或以上。更新后的上下文可靠地保留未解决的约束(95.5%)和下一步计划(96.4%),并频繁包含已验证的发现(72.1%)和被拒绝的候选(81.5%),反映了结构化的研究状态。
移除自主上下文更新 (ACU) 或外部自我改进循环均会严重降低 BrowseComp 准确率。仅添加 ACU 可将准确率从 59.6 提升至 71.4,而没有 ACU 但添加外部循环则提升至 69.8;两者结合将准确率推至 82.5,表明存在互补增益。在没有 ACU 的情况下启用外部循环,准确率提升 10.2 点 (59.6 到 69.8)。若已激活 ACU,再加入外部循环额外带来 11.1 点增益 (71.4 到 82.5)。
移除 AREX 训练方案中任一组件都会降低 BrowseComp 准确率,证实渐进式多轮能力训练、关键步骤聚焦监督和步骤感知强化学习各自带来了有意义的增益。当关键步骤监督被替换为随机步骤重放时,降幅最大,凸显了将监督集中在困难的关键中间动作上的重要性。渐进排序和步骤感知 RL 进一步贡献,完整方案取得了最强结果。以同等预算的随机步骤重放替代关键步骤聚焦监督造成最大准确率下降,表明常规步骤容易学习,而学习不足的、决策关键步骤从定向监督中获益不成比例。渐进式多轮训练(先浏览密集型、后推理密集型)优于混合训练,说明阶段化获取减少了工具使用与推理目标之间的干扰。
AREX-Base 在深度搜索和 agentic 推理任务上取得有竞争力的性能,尽管活跃参数少得多,仍超越了更大的开源模型,并与专有前沿系统匹敌。其自主上下文更新机制主动触发以整合研究状态,外部自我改进循环则提供互补增益。消融实验证实,训练方案中的渐进式多轮能力构建、关键步骤聚焦监督和步骤感知强化学习各自贡献显著,其中对决策关键步骤的定向监督尤为重要。