Command Palette
Search for a command to run...
AREX-2:通过长程反思任务推进自我改进智能体
AREX-2:通过长程反思任务推进自我改进智能体
摘要
我们提出 AREX-2,旨在推进 LLM 智能体的自我改进能力;该能力指在测试时迭代地改进方案的能力。该能力依赖两项互补能力:反思,即产生比当前方案更好的方案;以及长程执行,使迭代在多个轮次中保持有效。我们假设这两项能力均与领域无关,因此可以在适合监督的场景中学习。据此,我们从机器学习和算法编程任务中合成长程改进轨迹;这两个领域能提供可验证反馈,并奖励持续迭代。基于这些数据训练后,我们的智能体(基于 Qwen3.8-27B 构建)在 MLE-bench Lite(81.8)和 Frontier-CS(70.7)上取得了强劲结果,并迁移至深度研究任务,在 BrowseComp 上达到 84.0、HLE 上达到 52.6、GAIA 上达到 92.2、DeepSearchQA 上达到 93.8,同时随着轮次预算增加持续改进。这些结果表明,长程反思数据是通向自我改进智能体的有效路径。
一句话总结
北京智源人工智能研究院(BAAI)的 AREX 团队推出 AREX-2,这是一个基于 Qwen3.8-27B 构建的自我改进 LLM agent,并在机器学习与算法编程的合成长程反思轨迹上训练,在 MLE-bench Lite 上达到 81.8,在 Frontier-CS 上达到 70.7,同时迁移到深度研究任务,在 BrowseComp 上达到 84.0,HLE 上 52.6,GAIA 上 92.2,DeepSearchQA 上 93.8。
核心贡献
- 本文提出 AREX-2,一个基于 Qwen3.8-27B 构建的自我改进 agent,在机器学习工程和算法编程的合成长程改进轨迹上训练,并按最终结果选择轨迹,因此失败运行和性能回退仍保留在数据中。
- 该方法在 MLE-bench Lite 上达到 81.8,在 Frontier-CS 上达到 70.7;在所比较的开放权重模型中,Frontier-CS 结果报告为最高。
- 在未增加深度研究训练数据的情况下,AREX-2 迁移到深度研究任务,在 BrowseComp 上达到 84.0,HLE 上 52.6,GAIA 上 92.2,DeepSearchQA 上 93.8,并且随着轮次预算增加性能持续提升;分阶段消融实验将收益归因于操作知识、训练和更大的预算。
引言
困难问题通过“尝试、测量、修正”的迭代循环解决,但在大多数系统中,这个循环是在脚手架中实现,而不是由模型学习得到。当前用于 agent 的训练数据大多按单次尝试构建,丢弃中间的尝试、反馈和修正,因此模型学到的是正确解的样子,而不是如何在多轮中逐步改进它们。作者将自我改进定义为模型依靠自身判断,在任务上把更多轮次转化为更好解的能力,并将其分解为反思和长程执行。为了监督这些能力,作者在机器学习工程和算法编程中构造长轨迹,保留按最终结果选择的完整轨迹,而不是按单步成功选择。他们基于这些数据从 Qwen3.8-27B 训练得到 AREX-2,在 MLE-bench Lite 上达到 81.8,在 Frontier-CS 上达到 70.7,并表明学到的长程反思能力在没有新增训练数据的情况下迁移到深度研究任务。
数据集
作者从两类来源构建环境:
- GitHub 仓库:提供机器学习任务。教师模型读取仓库,识别其衡量的指标,并编写一个改进该指标的任务。它还会创建一个评分脚本,在 agent 无法访问的留出划分上计算该指标,并提供一个沙箱,其中已安装仓库且数据就位。
- 在线评测系统:提供算法编程任务。任务是问题陈述,沙箱包含编译器和样例用例,评分来自隐藏测试。在允许的情况下,评分采用分级而非二值,例如通过测试的比例,或启发式解相对于已知最优解的质量。
每个来源只有通过两项基于执行的检查后,才会被转换为环境:
- 参考解,即仓库自带的模型或评测系统接受的提交,必须在评分设置下运行并获得分数。
- 简单基线必须远低于参考分,表明该环境留有改进空间。
- 未通过第二项条件的环境会被丢弃,因为它们无法产生持续改进的轨迹。
对于每个被接纳的环境,作者在专为长程反思设计的条件下运行教师 agent 来构造轨迹:
- 更多轮次:agent 获得较大的轮次和墙钟时间预算,每个任务可达数小时和数百次工具调用,并被告知预算大小。
- 操作知识:agent 通过阅读源代码和文档、搜索相关论文和库、运行小规模实验来学习环境如何运作。部分知识以技能形式提供:通用技能预先从机器学习代码库中准备,任务特定技能通过搜索相关信息构建,同时排除与任务本身有关的内容。
- 循环中的反馈:每轮以一次提交结束,agent 在决定下一步之前会看到分数和环境报告。降低分数的轮次会被保留,因为 agent 对失败的响应正是模型应当学习的一部分。
由此得到的轨迹数据包含一个能力较强的 agent 在单个任务上工作时记录的许多轮推理、搜索、失败、恢复和提交。在训练中,模型从这些轨迹中学习如何调查环境、使用技能,以及将更大的轮次预算转化为累积改进。技能在测试时仍然可用,轮次预算与测试时被扩展的资源相同。
所提供的节选未明确说明具体数据集规模、训练划分比例、混合比例或裁剪策略。
方法
作者将自我改进形式化为测试时扩展问题。环境定义为一对 e=(σ,S),其中 σ 是任务,S 是将候选解 y 映射到标量分数 S(y) 的评分函数。agent 在多个轮次中工作。在第 t 轮,它提交解 yt 并收到反馈 ft,其中包含分数以及任何环境报告,例如日志、错误或耗时。一个包含 n 轮的轨迹为
τ=(y0,f0,y1,f1,…,yn,fn),经过 t 轮后达到的最佳分数为
st=k≤tmaxS(yk).在策略 πθ 下,第 t 轮的期望增益为
rt=Eπθ[st−st−1].对于固定的初始分数 s0 和 T 轮测试时预算,期望总改进是这些逐轮增益之和:
Eπθ[sT]−s0=t=1∑Trt.因此预算 T 是在测试时被扩展的资源。策略控制该预算中有多少能被有效利用。对于较小的阈值 ϵ,作者将有效轮数和这些轮上的平均增益定义为
T∗=∣{t≤T:rt>ϵ}∣,rˉ=T∗1t≤T:rt>ϵ∑rt.总改进近似为 rˉT∗。反思决定平均增益 rˉ,而长程执行决定 T∗。因此,更大的预算只有在额外轮次仍能产生有意义增益时才有效。
核心假设是,长程反思是一种元技能。产生持续改进的行为,包括利用反馈、获取操作知识和从挫折中恢复,即使任务和评分函数不同,也能跨环境迁移。作者通过在这些行为轨迹上进行模仿来训练策略。
环境构建从两类来源开始:用于机器学习任务的 GitHub 仓库和用于算法编程任务的在线评测系统。教师模型将每个来源转换为环境 (σ,S)。对于仓库,教师读取代码,识别正在衡量的指标,编写要求 agent 改进该指标的任务,并创建在留出划分上计算该指标的评分脚本。它还会构建一个沙箱,其中已安装仓库且数据就位。对于在线评测问题,任务是问题陈述,沙箱包含编译器和样例用例,评分是评测系统的隐藏测试结果。在可能的情况下,评测分数采用分级而非二值,例如通过测试的比例,或启发式解相对于已知最优解的质量,以便每一轮都提供信息。
一个环境只有在通过两项基于执行的检查后才被接纳。首先,来源自带的参考解必须在评分函数下运行并获得有效分数。其次,简单基线必须远低于参考分,以确保环境留有改进空间。未通过第二项检查的环境会被丢弃,因为它们无法产生持续改进的轨迹。
为了构造轨迹,作者在三种旨在引发出长程反思的条件下运行教师 agent。第一种是较大的轮次和墙钟时间预算,每个任务可达数小时和数百次工具调用。agent 被告知预算大小,这使其能够建立基线,在早期轮次进行测量,并在后期轮次进行修正。第二种条件是操作知识获取。agent 必须通过阅读源代码和文档、搜索相关论文和库、运行小规模实验来学习环境如何运作。部分操作知识还通过放置在 agent 上下文中的紧凑技能文档提供。通用技能从机器学习代码库和常见实践中准备,任务特定技能从与任务相关的搜索结果构建,同时排除与任务本身有关的内容。第三种条件是反馈循环。每轮以一次提交结束,agent 在决定下一步之前会看到分数和环境报告。反思正是在此处发生:agent 将观察到的结果与预期进行比较,保留或回退更改,并形成下一个假设。降低分数的轮次不会被移除,因为对失败的响应恰恰是模型应当学习的内容。
在训练中,轨迹以完整单元为单位进行选择。如果轨迹的最终分数相对参考分足够高,并且过程格式良好,即遵循 user-assistant-tool 格式、每次工具调用后都有观察、正确终止且未违反任务规则,则保留该轨迹。对单个轮次不设条件,因此保留的轨迹可能包含失败运行、性能回退和被放弃的方法。
在监督过程中,整个轨迹作为上下文保留,损失仅应用于推动解向前发展的决策。输出被分组为步骤,其中每个步骤是一次决策以及在下一个观察之前发出的动作。损失应用于诊断失败、修复失败、改变策略、运行下一实验或提交改进解的决策。未产生进展的步骤、重复轮询、没有新观察的调用、近似重复的轮次、系统消息、环境报告和被检索到的文档不参与损失计算。因此,模型学会如何响应挫折并将其转化为后续改进,而失败本身在上下文中仍然可见。所选轨迹与之前的深度研究数据混合,Qwen3.8-27B 在该混合数据上微调得到最终模型。
实验
AREX-2 在涵盖算法编程、机器学习工程、深度研究和通用 agent 推理的六项基准上进行了评估。整体结果表明,在源训练领域表现强劲,并在没有新增研究特定训练数据的情况下明显跨领域迁移到深度研究任务,支持了长程反思是一种可迁移元技能的观点。后续扩展实验表明,无论是否有外部正确性反馈,agent 在更大的计算预算下都会继续改进,同时消融实验确认操作技能、模型训练和额外轮次各自对性能有显著贡献。
AREX-2 在比较系统中取得了最高的 MLE-Lite Any Medal 率,以明显优势超过最强开放权重基线和最强闭源权重模型。它在 Frontier-CS 上也具有竞争力,超过开放权重替代方案,并接近最佳闭源权重系统。在 27B 参数规模下,它将领先的机器学习工程结果与强大的算法编程性能结合在一起。AREX-2 在 MLE-Lite 上领先所有比较系统,超过最强开放权重和最强闭源权重基线。在 Frontier-CS 上,AREX-2 超过最强开放权重基线,并在仅使用 27B 参数的情况下接近顶级闭源模型。
AREX-2 在大多数深度研究基准上取得了已报告小模型中的最强结果,同时仍可与大得多的系统竞争。它还在全部四项基准上超过两个早期 AREX 模型,尽管深度研究训练数据未变。前沿规模模型仍在 BrowseComp 和 HLE 上保持更高分数。AREX-2 在 BrowseComp、纯文本 HLE 和 DeepSearchQA 上领先所有已报告的不超过 40B 参数的模型。在 GAIA 上,它排在 XYZ-Aquila-mini 和 Agents-A1 之后,但高于其余有报告结果的小模型。它在使用相同深度研究训练数据的情况下,在全部四项基准上超过两个此前训练方案的 AREX 模型。它与更大的系统具有竞争力,在 BrowseComp 上超过 DeepSeek-V4-Pro 和 Kimi-K2.6,并在 DeepSearchQA 上排名第三。
实验在机器学习工程、算法编程任务以及深度研究基准上评估了 AREX-2,一个 27B 参数模型。在第一类设置中,AREX-2 在所有比较系统中取得最高的 MLE-Lite Any Medal 率,并超过强开放权重和闭源权重基线,同时在 Frontier-CS 上保持竞争力。在深度研究基准中,它在 BrowseComp、纯文本 HLE 和 DeepSearchQA 上领先大多数已报告的不超过 40B 参数的模型,在全部四项基准上超过两个早期 AREX 模型且训练数据未变,并与更大的系统保持竞争力,不过前沿规模模型在 BrowseComp 和 HLE 上仍得分更高。