HyperAIHyperAI

Command Palette

Search for a command to run...

EvoHarness-RL:面向长程 LLM 智能体的自演化运行时挂载策略学习

摘要

长程大语言模型(LLM)智能体日益依赖外部执行支持来维护状态、追踪进度、调用工具、验证结果并在交互间复用经验。然而,有效使用挂载机制带来了两个相互耦合的挑战:从含噪交互轨迹中形成状态,以及对访问外部状态进行运行时控制。现有智能体通常通过提示、启发式规则或领域特定惯例来处理这两者,导致外部工作空间及其使用策略仍需人工设计。为此,我们研究了挂载策略学习问题,即智能体离线学习挂载策略,并在运行时任务执行过程中在线部署这些策略以构建和更新外部挂载状态。我们提出了 EvoHarness-RL,该方法将信念(Belief)、进度(Progress)和经验(Experience)作为面向策略的挂载状态暴露出来。有监督挂载微调教会基座智能体挂载动作空间以及如何构建有用的外部状态,而成本感知的 GRPO 则探索协调策略,以便在长程交互中有选择地读取、更新和整合这些状态。在 ALFWorld 上基于 Qwen3-8B LLM 的实例化中,EvoHarness-RL 达到了 96.9% 的成功率,并揭示了两个关键动态:挂载退火,即训练将反复出现的挂载使用模式内化到模型策略中,使智能体从频繁调用挂载转向有选择地访问外部状态;以及挂载演化,即进度更新和经验整合将挂载提炼为一个紧凑、任务自适应的状态基底。这些结果表明,长程智能体能够从用于构建和协调外部挂载工作空间的可训练策略中获益,而不仅仅是添加更强大的工具或更大的记忆。

一句话总结

伊利诺伊大学厄巴纳-香槟分校和Meta AI的研究人员提出EvoHarness-RL,一种通过监督式harness微调和成本感知GRPO,学习长程LLM agent的自演化运行时harness策略的方法,协调对Belief、Progress和Experience(BPE)状态的选择性访问,在使用Qwen3-8B的ALFWorld上达到96.9%的成功率,并揭示了harness退火和演化现象。

核心贡献

  • 提出EvoHarness-RL作为一个可训练的协调层,将外部工作空间结构化为Belief、Progress和Experience(BPE),并定义用于运行时状态构建和更新的harness元动作。
  • 两阶段训练方案:首先在专家演示上进行监督式harness微调以引导harness使用,然后通过成本感知GRPO优化对外部状态的选择性读取、更新和整合策略。
  • 在使用Qwen3-8B模型的ALFWorld上,EvoHarness-RL达到96.9%的成功率,分析揭示了harness退火(将harness使用模式内化为选择性外部状态访问)和harness演化(经验整合创建紧凑、任务自适应的状态基底)。

引言

执行长程任务的LLM agent依赖工具、记忆、验证器和状态跟踪器等外部harness来维持上下文、跟踪进度并从错误中恢复。尽管这些组件日益复杂,但agent访问它们的策略通常由提示或启发式方法固定,导致agent无法将何时读取、更新或整合外部状态作为自身决策的一部分来学习。作者提出EvoHarness-RL,一个可训练的协调层,将harness统一为Belief、Progress和Experience工作空间,并为agent配备紧凑的元动作来查询和修改它。两阶段训练方案首先从演示中引导harness使用,然后通过成本感知强化学习,优化任务成功与harness动作消耗的交互预算之间的权衡,将harness访问从静态支架转变为学习到的运行时策略。

方法

作者引入EvoHarness-RL,一个可训练的协调层,使agent能够在长程任务中主动管理外部harness工作空间。该系统包含统一的BPE状态抽象、紧凑的agent-harness动作协议、将抽象具体化到特定领域的环境适配器,以及两阶段成本感知训练流水线。这些组件共同使策略能够决定何时从harness读取或写入,在信息访问与交互成本之间进行权衡。

harness状态被结构化为三个功能角色:Belief、Progress和Experience(BPE)。在每个步骤ttt,harness呈现

Ht=(Bt,Pt,Et),\mathcal{H}_t = (B_t, P_t, E_t),Ht=(Bt,Pt,Et),

其中BtB_tBt存储从交互中推断出的任务相关事实(例如物体状态和位置),PtP_tPt维护一个子目标状态记录列表(gi,σi)(g_i, \sigma_i)(gi,σi),将已完成和待完成的任务外部化,EtE_tEt保存跨回合知识,如技能、失败模式和搜索先验。这种紧凑表示解决了长程执行中反复出现的失败模式:丢失当前环境状态的跟踪、忘记进度,以及重复发现已知程序。

为了与BPE工作空间交互,策略使用一小组元动作

Abpe={track,commit,recall,note},\mathcal{A}_{\mathrm{bpe}} = \{\text{track}, \text{commit}, \text{recall}, \text{note}\},Abpe={track,commit,recall,note},

分别从BtB_tBt读取、更新PtP_tPt中的子目标状态、从EtE_tEt中检索可复用知识,以及记录新见解以供后续整合。步骤ttt的完整动作空间是环境动作和harness动作的并集,A=AenvAbpe\mathcal{A} = \mathcal{A}_{\mathrm{env}} \cup \mathcal{A}_{\mathrm{bpe}}A=AenvAbpe。给定观察oto_tot、渲染后的harness状态Ht\mathcal{H}_tHt和任务上下文ctc_tct,策略采样

atπθ(ot,Ht,ct).a_t \sim \pi_\theta(\cdot \mid o_t, \mathcal{H}_t, c_t).atπθ(ot,Ht,ct).

所有动作消耗相同的交互预算,因此agent必须学习何时查询harness是值得其成本的。

BPE接口是功能性的而非实现特定的,因此环境适配器将领域信号桥接到通用抽象。适配器处理观察、动作结果和验证器反馈,维护belief、progress和experience的内部存储,并渲染面向策略的三元组(Bt,Pt,Et)(B_t, P_t, E_t)(Bt,Pt,Et)。它还将四个harness动作具体化到目标领域。在ALFWorld实例化中,Belief是一个世界状态存储,在每个环境步骤后更新;策略发出track[object]或track[world]来按需检查它。Progress是一个有界的子目标状态条目列表,通过commit[subgoal]来外部化执行步骤。Experience是一个跨回合技能存储,组织为通用技能、任务特定技能、常见错误和物体位置搜索先验。策略使用recall[query]访问先验知识,使用note[insight]排队新经验。在并行rollout收集期间,主技能存储在一个批次内保持固定,整合模型在epoch边界将累积的笔记和轨迹摘要合并到存储中。

策略分两个阶段训练。首先,监督微调(SFT)在混合环境动作和BPE harness动作的教师轨迹上引导模型。教师演示教会模型任务解决行为以及何时track、commit、recall或note的基本语义,而在教师rollout期间收集的经验初始化技能存储。其次,使用分组相对策略优化(GRPO)优化策略,采用成本感知奖励,将稀疏成功信号与辅助塑造项结合:

R(τ)=Rsucc(τ)task success+λeffReff(τ)efficiency bonus+λdiv(u)Rdiv(τ)action diversityλspamRspam(τ)spam penaltyλinvRinv(τ)format penalty.R(\tau) = \underbrace{R_{\mathrm{succ}}(\tau)}_{\text{task success}} + \underbrace{\lambda_{\mathrm{eff}} R_{\mathrm{eff}}(\tau)}_{\text{efficiency bonus}} + \underbrace{\lambda_{\mathrm{div}}(u) R_{\mathrm{div}}(\tau)}_{\text{action diversity}} - \underbrace{\lambda_{\mathrm{spam}} R_{\mathrm{spam}}(\tau)}_{\text{spam penalty}} - \underbrace{\lambda_{\mathrm{inv}} R_{\mathrm{inv}}(\tau)}_{\text{format penalty}}.R(τ)=task successRsucc(τ)+efficiency bonusλeffReff(τ)+action diversityλdiv(u)Rdiv(τ)spam penaltyλspamRspam(τ)format penaltyλinvRinv(τ).

任务完成仅在回合解决时提供101010的稀疏奖励。效率奖励Reff(τ)=max(0,1τ/Tmax)R_{\mathrm{eff}}(\tau) = \max(0, 1 - |\tau| / T_{\max})Reff(τ)=max(0,1τ∣/Tmax)仅在成功时授予,惩罚冗余的harness查询。为防止策略崩溃为忽略harness动作或陷入重复循环,应用时间依赖的词汇多样性奖励:

Rdiv(τ)={verb(at):atτ}τ,λdiv(u)=λdivmax2(1+cosπuU),R_{\mathrm{div}}(\tau) = \frac{|\{\mathrm{verb}(a_t): a_t \in \tau\}|}{|\tau|}, \quad \lambda_{\mathrm{div}}(u) = \frac{\lambda_{\mathrm{div}}^{\max}}{2} \left(1 + \cos \frac{\pi u}{U}\right),Rdiv(τ)=τ{verb(at):atτ},λdiv(u)=2λdivmax(1+cosUπu),

其中uuu是当前RL epoch,UUU是退火范围。这种课程安排在训练早期鼓励广泛探索harness动作,并逐渐衰减以强制专业化。固定惩罚RspamR_{\mathrm{spam}}RspamRinvR_{\mathrm{inv}}Rinv抑制退化性重复和格式错误。

实验

在ALFWorld上的实验评估EvoHarness-RL与冻结和可训练基线的对比,消融其belief-progress-experience harness,并测试对未见环境的泛化。结果证实所有三个harness组件协同工作,对长程任务至关重要,而RL优化使策略能够内化常规支架,减少昂贵的harness调用,并稳健地泛化到训练分布之外。跨回合experience存储从快速积累演化为紧凑、任务自适应的记忆,强化了harness成为学习到的协调机制而非静态记忆的观点。

使用Qwen3-8B的EvoHarness-RL在ALFWorld seen split上达到最先进性能,大幅超越所有基线,并匹敌顶级前沿模型。BPE框架在不同模型规模上普遍提升成功率,对较弱的前沿模型增益最大。从提示支架到监督微调再到强化学习的两阶段训练逐步提升性能,验证了该流水线。使用Qwen3-8B的EvoHarness-RL达到96.9%的平均成功率,匹敌Claude Opus 4.5,并决定性地超越SkillOS和SkillRL等可训练agent。应用显式harness使GPT-4.1提升超过22个绝对百分点,GPT-5提升超过25个百分点,展示了对挣扎中的前沿模型的广泛益处。即使已经接近性能上限的Claude Opus 4.5,也从harness中获得+2.1个百分点的提升,达到98.5%。从提示时支架(56.4%)到监督微调(68.6%)再到强化学习(96.9%)的进展验证了两阶段训练流水线。BPE框架在所有模型规模上提供一致改进,证实外部化belief、progress和experience对长程任务执行至关重要。

消融任何单个BPE组件都会降低整体成功率,表明belief、progress和experience协同作用。移除belief跟踪对物体定位任务打击最大,禁用progress降低长程多步骤任务的表现,而丢弃可复用experience导致最大的平均降幅,尤其是对复杂状态变更任务。没有belief时,Clean和Cool的成功率急剧下降,而Heat不受影响,表明显式物体跟踪对定位和状态验证最为重要。禁用experience产生最低的整体平均成功率(48.6%),并严重影响Heat等复杂状态变更任务。消融progress不成比例地损害Pick2等长程依赖子目标的任务。

在ALFWorld unseen任务上,提示时harness将ReAct的平均成功率从50.0%提升到77.6%,但监督微调模仿harness调用将泛化降低到69.4%。使用成本感知GRPO训练的RL优化策略达到86.6%,表明它学习选择性使用harness以在新环境中获得稳健性能。提示时harness在大多数任务上相比ReAct有显著提升,但SFT在Cool和Heat上降低性能,表明模仿过度拟合了已见的harness使用模式。RL优化策略在Look(94.4%)、Cool(95.2%)和Pick2(88.2%)上达到近乎完美的分数,大幅超越所有其他变体。

在ALFWorld seen和unseen任务上的实验评估EvoHarness-RL,它通过BPE harness外部化belief、progress和experience,并通过以成本感知强化学习结束的两阶段流水线进行训练。harness在不同模型规模上普遍提升成功率,消融实验揭示每个组件都至关重要,belief、progress和experience协同解决定位、长程规划和复杂状态变更。在unseen任务上,RL优化策略学习选择性调用harness,实现稳健泛化,而模仿则过度拟合,证实显式状态跟踪和选择性工具使用是长程执行的关键。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供