Command Palette
Search for a command to run...
CAST:以游戏求解器作为回合级教师指导 LLM 智能体
CAST:以游戏求解器作为回合级教师指导 LLM 智能体
摘要
训练大语言模型(LLM)在长时域游戏中行动是迈向通用决策的重要一步,然而基于可验证奖励的强化学习(RLVR)依赖稀疏的最终奖励,这些奖励几乎无法揭示哪些决策决定了成功。更密集的过程信号本可以提供这种缺失的回合级归因,但现有来源难以同时保持低成本和准确性。我们观察到,游戏求解器状态值的变化能够揭示一个动作是否推动状态走向成功。基于这一洞察,我们提出 CAST(Credit Assignment from Solver Teachers,基于求解器教师的信用分配),将这些值变化转化为求解器优势,并将其作为回合级信号注入 RLVR。我们进一步证明,在软最优求解器假设下,最大化求解器优势等价于从求解器进行在线策略蒸馏,且仅需标量值而非教师 logits。在推箱子、扫雷和 Rush Hour 游戏中,CAST 在域内和未见难度评估下均在所有游戏上优于所有经过训练的基线方法,并在 ALFWorld 和 WebShop 上取得了最高的平均零样本性能。我们的代码已开源,地址为 § github.com/Wloner0809/CAST。
一句话总结
中国科学技术大学等提出CAST(从求解器教师进行信用分配),该方法从游戏求解器的值变化中推导出回合级别的信用,作为RLVR的求解器优势,并证明在软最优求解器下,这种仅标量信号等价于无教师logits的在线策略蒸馏,且CAST在Sokoban、Minesweeper、Rush Hour、ALFWorld和WebShop上优于所有训练基线。
核心贡献
- CAST将游戏求解器状态值的每次动作变化转化为求解器优势,为使用可验证奖励的强化学习提供细粒度的回合级别信用,无需教师logits。
- 最大化求解器优势在理论上等价于从求解器进行在线策略蒸馏,并通过asinh压缩和批次级RMS归一化稳定信号,形成高效的无需logits的蒸馏目标。
- 在Sokoban、Minesweeper和Rush Hour上,CAST在域内和未见难度设置下均优于所有训练基线,以少1.7–2.0倍的步数达到DAPO的峰值验证性能,并在ALFWorld和WebShop上取得最高的平均零样本性能。精确求解器查询带来的额外开销可忽略不计。
引言
作者致力于解决在Sokoban、Minesweeper和Rush Hour等环境中训练通用LLM agent进行交互式决策的挑战,这些环境中稀疏的终端奖励造成了严重的信用分配问题:不清楚轨迹中的哪些动作导致了成功或失败。先前的方法试图通过昂贵的搜索、学习的过程奖励模型或跨轨迹比较来密集化信号,但每种方法都在计算、监督质量或可靠性方面存在权衡。作者利用经典的游戏求解器作为回合级别的教师,引入CAST(从求解器教师进行信用分配),该方法通过比较每个LLM动作前后的求解器估计状态值来计算求解器优势。这个标量优势作为细粒度的过程监督注入到使用可验证奖励的强化学习中,并证明在软最优求解器下,最大化该优势等价于在线策略蒸馏,无需求解器的完整动作分布。通过轻量级的信号稳定化,CAST取得了最先进的域内和泛化性能,同时增加的训练开销可忽略不计。
方法
作者通过引入求解器引导的回合级别信用机制,解决了基于结果监督的可验证奖励强化学习(RLVR)中的信用分配瓶颈。传统方法如GRPO为每个token分配单一的轨迹级别优势,这对于长时域游戏是不够的。为了细化这一点,作者利用特定游戏的求解器作为回合级别的教师,对每个动作单独评分,将稀疏的终端奖励转化为密集的每步过程信号。
为了对每个动作评分,该方法利用求解器的代价函数 N(s),它表示从状态 s 到达胜利所需的最小工作量。作者定义了一个辅助的最短路径目标,并计算求解器优势为:
AπSolver(st,at)=−1+N(st)−Est+1[N(st+1)].在求解器最优策略下,期望的下一状态代价等于 N(st)−1,使得原始优势为非正。为了将进展映射为正信用,作者将优势平移+1,得到平移后的求解器优势:
AπSolver(st,at)=N(st)−Est+1[N(st+1)].这个平移后的分数直接反映了动作导致的代价下降,为最优进展分配+1,无进展分配0,有害动作分配负值。
由于原始平移后的优势可能具有重尾分布且在不同游戏中尺度变化很大,作者应用了两种轻量级变换来塑造信号以实现稳定训练。首先,使用asinh压缩 g(x)=ln(x+x2+1) 来保留小进展值,同时对罕见且大的死局惩罚进行对数压缩。其次,批次级RMS归一化将压缩后的信号按批次内所有回合的均方根幅度重新缩放,确保一致的尺度而不移动编码中性进展的零点。
结合这些信号的总体流程如下所示。
然后,经过整形的求解器信号被集成到GRPO训练流程中。对于轨迹 i 在回合 t,最终优势将轨迹级别的结果优势与回合级别的整形求解器优势相结合:
A^i,t=A^ioutcome+αh(Ai,tπSolver),其中 α 控制求解器引导的强度。这个组合优势替换了裁剪GRPO替代目标中的标准结果优势,使得终端奖励锚定全局胜负信用,而求解器信号逐步细化它。
最后,作者证明这种求解器优势在数学上等价于在线策略蒸馏(OPD)。通过将求解器视为软最优教师策略,求解器优势对应于教师对某个动作的对数偏好。因此,策略梯度更新隐式地最大化任务回报,同时最小化学生策略到求解器策略的交叉熵。这种无需logits的OPD公式允许学生策略将求解器分布作为先验,根据任务优势对其进行指数倾斜,从而使学生有可能超越教师的表现。
实验
评估使用三个经典游戏(Sokoban、Minesweeper、Rush Hour),包含域内和未见难度设置,以及向ALFWorld和WebShop的零样本迁移,将Qwen3-4B-Instruct-2507基础策略与无需训练的ReAct提示、闭源模型以及仅结果或过程级别的RL基线进行比较。实验证实,求解器导出的回合级别信号持续提升性能,在训练游戏上带来更高的成功率,对更难的关卡和保留领域有更好的泛化能力,并加快训练收敛。消融实验表明,每个设计组件(求解器优势权重、asinh变换、批次RMS归一化)都对增益有贡献,同时分析显示求解器查询带来的训练开销可忽略不计,并且用学习到的价值网络替代精确求解器能保留大部分收益,证明了该方法的实用性。
在使用ReAct提示的闭源模型中,Sonnet-4.6总体领先,在三个训练游戏的域内和未见难度级别上均取得最高的平均成功率。Gemini 2.5 Pro排名第二,而所有模型在从域内转向未见级别时都出现明显下降,下降幅度因游戏而异。Sonnet-4.6在域内和未见划分上均获得最佳平均成功率,其次是Gemini 2.5 Pro。每个模型从域内到未见难度都出现性能下降,在Minesweeper等某些游戏中下降尤为剧烈。
在零样本分布外迁移中,CAST在两个领域都取得了最高的成功率,优于所有RL训练基线和无需训练的ReAct提示。在ALFWorld上达到37.9%(比最佳训练基线高5.8个百分点),在WebShop上达到22.7%(比最佳训练基线高4.8个百分点),总体平均为30.3%,比次优方法高5.6个百分点。CAST取得最高的领域平均值:ALFWorld 37.9%,WebShop 22.7%,明显超过最强的RL训练基线(GSPO为32.1%,GiGPO为17.9%)。无需训练的ReAct基线在ALFWorld上得分为30.2%,在WebShop上为18.8%,而CAST的总体平均30.3%远高于ReAct的24.5%和所有其他方法。
两个实验评估了不同条件下agent的性能。第一个实验比较了使用ReAct提示的闭源模型在训练游戏上的表现,其中Sonnet-4.6取得了最高的成功率,但所有模型在未见难度级别上都出现明显下降,在Minesweeper等游戏中下降尤为剧烈。第二个实验评估了零样本分布外迁移,表明CAST在ALFWorld和WebShop上显著优于RL训练基线和无需训练的ReAct提示。