Command Palette
Search for a command to run...
Agentic ESOpt:以最小 GPU 内存需求微调长时程 LLM 智能体
Agentic ESOpt:以最小 GPU 内存需求微调长时程 LLM 智能体
Zhi Zheng Rongsheng Chen Yunpeng Ba Zhenkun Wang Yee Whye Teh Wee Sun Lee
摘要
强化学习(RL)在单轮 LLM 微调中已展现出潜力。然而,长时程智能体推理引入了日益增多的分支交互和稀疏奖励,暴露出 RL 的若干局限:其沉重的反向传播使得微调更大规模的 LLM 变得不切实际,而更长的时程轨迹使信用分配显著更加困难。本文认为,进化策略(ES)是微调长时程 LLM 智能体的更优选择。与智能体 RL 相比,ES 具有三个关键优势:1)模型可扩展性:ES 能够仅以最小的推理级 GPU 内存实现全参数优化,从而使微调大型 LLM 成为可能。2)灵活性:其轻量级、黑盒反馈接口使 ES 微调易于与提示空间进化(例如技能优化和测试时计算)组合;3)长时程可扩展性:ES 在轨迹层面进行参数归因,无需跨时程分解奖励,随着时程长度增长,其可扩展性优于智能体 RL。基于这一见解,我们提出了 Agentic ESOpt,一个面向灵活参数—上下文协同进化的全参数智能体微调框架。在每一步中,Agentic ESOpt 在当前 LLM 参数周围采样扰动,用奖励评估所得智能体,并应用在线奖励加权更新。为改善探索—适应权衡,Agentic ESOpt 进一步引入了扰动尺度 σ 的余弦衰减调度。我们在训练时微调和智能体测试时计算两种设置下评估了 Agentic ESOpt。在长时程数独任务上,Agentic ESOpt 使用 Qwen3.5-4B 比 RL 方法高出 12.50%。在 WebArena-Lite 上,对 Qwen3.5-27B 的全参数优化比 No Skill 基线提高了 6.69%,将 Agentic ESOpt 与 Trace2Skill 结合进一步比 Trace2Skill 基线提高了 2.42%。在测试时自动启发式设计中,Agentic ESOpt 执行在线提示—参数协同进化,在 36 个设置中的 28 个上改善了其匹配基线。
一句话总结
来自新加坡国立大学、南方科技大学和牛津大学的研究人员提出了 Agentic ESOpt,这是一种面向长时程 LLM agent 的全参数进化策略微调框架,使用扰动采样、在线奖励加权更新和扰动尺度 σ 的余弦衰减调度,同时仅需推理级 GPU 显存;在长时程 Sudoku 上,使用 Qwen3.5-4B 时该方法比 RL 高 12.50%,在 WebArena-Lite 上,对 Qwen3.5-27B 进行全参数优化将 No Skill 基线提高 6.69%,而将 Agentic ESOpt 与 Trace2Skill 结合则将 Trace2Skill 基线提高 2.42%。
核心贡献
- 提出了 Agentic ESOpt,一种面向长时程 LLM agent 的全参数进化策略微调框架,该框架采样参数扰动,用轨迹级奖励评估得到的 agent,并在线应用奖励加权更新,无需反向传播,也无需显式的逐动作信用分配,仅需推理级 GPU 显存。
- 该方法包含针对扰动尺度的余弦衰减调度,以管理探索与自适应之间的权衡,并支持参数与上下文协同演化,可与技能优化和测试时计算等提示空间优化相结合。
- 实验表明,在长时程 Sudoku 上,使用 Qwen3.5-4B 时 Agentic ESOpt 比 agentic RL 基线高 12.50%;在 WebArena-Lite 上,对 Qwen3.5-27B 进行全参数优化将 No Skill 基线提高 6.69%,将 Agentic ESOpt 与 Trace2Skill 结合则将 Trace2Skill 基线提高 2.42%;在测试时自动启发式设计中,Agentic ESOpt 在 36 个设置中的 28 个上优于其匹配基线。其推理级显存占用使得在四块 H100 GPU 上对 Qwen3.5-27B WebArena agent 进行全参数自适应成为可能。
引言
Qwen3、DeepSeek-R1 和 Gemini 2.5 等先进大语言模型可以作为通用 agent,使用工具、处理长上下文并协调多步骤软件工作流,但它们在面对不常见的工具 API 和专门的科学或算法任务时仍有困难,因此高效的特定任务微调仍然重要。此前的 agentic 强化学习方法需要重量级激活和优化器状态、通过长分支轨迹进行反向传播,以及在稀疏奖励下进行轮次级或基于 critic 的信用分配,随着时程变长,这些会变得越来越不切实际。此前针对单轮推理的进化策略工作大多内存效率较高,但通常略弱于 RL。作者认为,对于长时程 agentic 推理,进化策略在结构上变得更可取,而不仅仅是成本更低。他们提出了 Agentic ESOpt,一种全参数进化策略框架,该框架采样参数扰动,用环境奖励评估 agent,并在不进行反向传播的情况下应用奖励加权更新。它同时支持训练时微调和测试时计算,使用余弦扰动调度来平衡探索与自适应,并且仅需推理级 GPU 显存即可实现全参数优化。
方法
作者提出 Agentic ESOpt,一种对大语言模型 (LLM) 执行全参数进化策略 (ES) 优化的方法。该框架的运作方式是:在当前 LLM 周围采样参数扰动,使用标量环境奖励评估受扰动的 agent,并应用奖励加权参数更新。这一仅前向过程只需存储噪声种子,并使用原地加法和减法,确保 GPU 显存需求保持最小且与标准推理相当。此外,生成的黑盒轨迹反馈可以被技能空间优化器或测试时计算流程复用。
如框架图所示:
形式上,令 τ=(o0,a0,…,oH,aH) 表示由策略 πθ 诱导的交互轨迹,令 R(τ) 表示其标量轨迹回报。对于固定的外部 agent 状态 c,目标定义为:
J(θ;c)=Eτ∼πθ(⋅∣c)[R(τ)]Agentic ESOpt 通过在 θ 周围搜索参数空间来优化该目标。令 ϵ∈Rd 为 d 维参数上的全参数扰动。高斯平滑目标表示为:
Jσ(θ;c)=Eϵ∼N(0,I)[J(θ+σϵ;c)]据此推导出 ES 伪梯度:
∇θJσ(θ;c)=σ1Eϵ[J(θ+σϵ;c)ϵ]这些 ES 梯度是从标量分数中估计得到的,无需对 agent 与环境的交互进行微分。在实现中,为了估计梯度,作者采样 G 个扰动 ϵ1,…,ϵG,评估相应的受扰动 agent,并获得奖励 Ri=R(τi)。为了降低方差,使用 z-score 对种群内的奖励进行归一化:
R^i=sR+εRi−μR,whereμR=G1j=1∑GRj,sR2=G1j=1∑G(Rj−μR)2实践中,显式的 1/σ 因子被省略,由 α 作为有效更新尺度。实际使用的更新规则为:
θt+1=θt+Gαi=1∑GR^iϵi该方法还支持提示空间组合以及提示与参数的协同演化。与保持 LLM 参数固定的测试时计算和提示空间优化方法不同,Agentic ESOpt 的轻量黑盒更新允许参数自适应与提示空间搜索同时进行。令 Dt 表示第 t 次迭代收集的轨迹和分数,UES 表示 Agentic ESOpt 参数更新,Uc 表示针对提示 ct 的外部更新规则。一个通用的交替外循环按如下方式更新这两个空间:
θt+1=UES(θt;ct,Dt),ct+1=Uc(ct;Dt)为了管理探索与目标偏差之间的权衡,作者对扰动半径 σ 引入余弦衰减。高斯平滑目标会引入一种平滑偏差,其特征是二阶项 Tr(∇θ2J),该项作为正则化项惩罚尖锐的局部最优。较大的 σ 会增加这种正则化,但也会增加相对原始目标的偏差。半径在 T 个更新步骤中按如下方式逐渐减小:
σt=σT+(σ0−σT)21+cos(πt/T),t=0,…,T对于训练时 Agentic ESOpt,保留非零的 σT,以平衡利用、探索和正则化。相比之下,对于测试时计算,其关注当前任务的无偏结果而非泛化性,因此 σT 会衰减到零,以在优化接近结束时最小化目标偏差。
实验
实验在受控长时程任务、训练时微调、测试时计算和种群规模扩展方面评估了 Agentic ESOpt。在多轮 Sudoku 中,参数空间搜索相比动作空间策略梯度表现出依赖时程的优势,因为它避免了逐步骤信用分配,同时仅需推理级 GPU 显存。对于 ReAct 风格 Math 和 DocVQA 微调,Agentic ESOpt 在匹配的 Agentic GRPO 基线上持续表现更好,并与 Trace2Skill 有效组合;WebArena 结果证实,对 27B agent 进行全参数自适应是可行的。在自动启发式设计方面,Agentic ESOpt 在匹配预算下改进了大多数 Sample 和 EoH 对比,种群规模扩展实验表明,更强的骨干模型对小种群规模不太敏感。
随着最小所需规划时程的增加,所有方法的成功率都会下降。带有 sigma 衰减的 Agentic ESOpt 在最长的时程上保持最高成功率,并将 GPU 显存维持在轻量 4B 骨干模型水平,而 Agentic PPO 的成功率降为零,并且需要更多显存。在测试的各个时程上,从 ES 运行中移除 sigma 衰减会降低相对于 Agentic ESOpt 的成功率。随着最小成功时程的增长,每个被评估方法的成功率都会下降。Agentic ESOpt 在最长的时程上表现最强,且 GPU 显存使用远低于 Agentic PPO 和 Agentic GRPO。Agentic PPO 在最短时程上表现良好,但在最长时程上失败。没有 sigma 衰减的 vanilla ES 在所有测试时程上均落后于 Agentic ESOpt。
在测试的 agentic Sudoku 时程上,使用 Agentic ESOpt 的 Qwen3.5-4B 相比使用 Agentic GRPO 在同一四 GPU 硬件上需要更少的训练计算量和更少的墙钟时间。在最短时程上计算优势较小,并随时程延长而扩大,而墙钟时间始终保持明显更低。Agentic ESOpt 在每个测试时程上相对 Agentic GRPO 降低了训练 FLOPs,且节省量随时程增长而增加。Agentic ESOpt 的墙钟时间在较长时程上约为 Agentic GRPO 的一半,并且在最短时程上仍然更低,尽管两种方法都完全使用相同的四块 H100 GPU。
在数学推理和 DocVQA 上,Agentic ESOpt 持续改进 Qwen3.5-4B 基础模型以及匹配的 Agentic GRPO 基线。收益在 DAPO、AIME 2026 和 DocVQA Mean@4 上最强,并且该方法与 Trace2Skill 组合后可达到最强的 Qwen3.5-4B Mean@4 结果。Pass@4 和 Max@4 指标也更倾向于 Agentic ESOpt 而非 Agentic GRPO,而 DAPO Pass@4 与 No Skill 基线持平。Agentic ESOpt 加 No Skill 在 DAPO 和 AIME 2026 上带来两位数的 Mean@4 收益,并相对 Qwen3.5-4B No Skill 基线大幅提高 DocVQA 准确率。Agentic ESOpt 加 No Skill 在 DAPO、AIME 2026 以及 DocVQA 的 mean 和 best-of-four 指标上均优于匹配的 Agentic GRPO 加 No Skill,其中 AIME 2026 Pass@4 和 DocVQA Max@4 收益尤其大。
在 WebArena-Lite 上,Agentic ESOpt 在数据集平均值和大多数主要站点类别上改进了 Qwen3.5-27B No Skill 基线,其中在 OSS、GitLab、CMS 和 Map 上收益尤其大。Reddit 类别略有例外,自适应后的模型没有超过其基线。将 Agentic ESOpt 与 Trace2Skill 结合可得到最高的 Qwen3.5-27B 平均值,表明其与技能空间优化兼容。Agentic ESOpt 在数据集平均值和五个主要站点类别中的四个上改进了 Qwen3.5-27B No Skill 基线,而 Reddit 出现小幅下降。相对 No Skill 基线最大的类别收益依次出现在 OSS、GitLab、CMS 和 Map 中。将 Agentic ESOpt 与 Trace2Skill 结合可取得最强的 Qwen3.5-27B 数据集平均值,超过 No Skill 和 Trace2Skill 基线。
在大多数构造性问题设置中,Agentic ESOpt 改进了现有的启发式设计搜索方法。当与 EoH 配对时,它在两个评估预算下改进了全部六个构造性测试集;当与 Sample 配对时,它改进了十二个匹配对比中的九个。在构造性和 ACO 风格设置中,该方法改进了 36 个匹配对比中的 28 个。Agentic ESOpt + EoH 在两个评估预算下改进了全部六个构造性启发式设计测试集。Agentic ESOpt + Sample 改进了十二个匹配对比中的九个,有一个持平,两个退化。在两个构造性基线上,Agentic ESOpt 改进了 24 个匹配对比中的 21 个。在 T=1000 结果中,Agentic ESOpt + Sample 在 TSP 实例上显示最大的相对收益,在 KP 和 ASP 实例上变化较小且方向不一。
在 agentic Sudoku、数学推理、网页导航和启发式设计任务中,Agentic ESOpt 与 PPO、GRPO 以及基线技能或搜索方法进行了评估对比。它在长规划时程上保持更高成功率,同时相比 PPO 和 GRPO 使用显著更少的 GPU 显存、训练计算量和墙钟时间,sigma 衰减对这一优势有所贡献。Agentic ESOpt 还改进了 Qwen3.5-4B 在数学推理和 DocVQA 上的结果,改进了 Qwen3.5-27B 在 WebArena-Lite 上的表现,尤其是与 Trace2Skill 结合时,并在大多数匹配对比中增强了现有启发式设计搜索方法。