Command Palette
Search for a command to run...
奖励结构塑造了强化学习中情景探索与神经记忆之间的交互
奖励结构塑造了强化学习中情景探索与神经记忆之间的交互
Jai Malegaonkar Rohan Patil Henrik I. Christensen
摘要
在部分可观测的强化学习中,智能体面临双重瓶颈:它们必须进行探索以遭遇奖励状态,并将该经验保留在记忆中,从而优化策略。探索奖励和记忆架构通常被孤立地评估,导致它们之间的交互未被测量,而稀疏奖励的标准概念则将时间信号密度与奖励实际监督的内容混为一谈。我们呈现了一项受控研究,在三个因记忆内容获取方式而异的环境中,将情景探索奖励与多种神经记忆架构进行交叉。相同的奖励信号产生了三种截然不同的交互模式:在记忆内容必须被主动发现并以无监督方式保留的情况下,它放大了架构容量的差异;在内容一旦被找到便成为单一奖励监督线索的情况下,它将各种架构拉平至一个共同的上限;在观测流完全按计划给出的情况下,该奖励无效。受控的奖励操纵验证了这些模式追踪的是奖励结构而非密度:密集奖励只有在直接监督所需的潜在记忆时才会抵消奖励的效果;而对探索动作施加一个小的、可避免的惩罚(不改变最优解)会导致策略收敛至次优的稳态,而两种奖励均能解决此问题。我们随后利用以观测为锚点的奖励机形式化了奖励稀疏性,将结构稀疏性(自动机无需任务所需的历史即可重现回报)与潜在稀疏性(单步奖励对局部探索动作的错误定价)区分开来;由此产生的词汇表根据每个任务所暴露的记忆保持负担,对这三种机制进行了组织。这些结果共同表明,探索与记忆是互补品,而非替代品:奖励诱导了接触,而只有记忆才能将接触转化为回报。
一句话总结
加州大学圣地亚哥分校的研究者表明,情节性探索奖励与神经记忆架构以三种受奖励结构而非密度支配的不同模式相互作用,并通过基于观测锚定的奖励机形式化稀疏性,将结构稀疏性与潜在稀疏性分离开来,从而证明探索与记忆是互补关系,而非替代关系。
核心贡献
- 相同的情节性探索奖励会根据环境的奖励结构如何监督记忆内容的获取,与神经记忆架构产生三种不同的交互模式:放大能力差异、拉平性能或不产生任何效果。
- 基于观测锚定的奖励机将奖励稀疏性形式化为结构稀疏性(奖励是否直接监督所需的潜在记忆)和潜在稀疏性(局部探索动作是否被错误定价),从而按其保留负担而非时间信号密度来组织任务机制。
- 受控奖励操纵表明,密集奖励仅在直接监督必要的潜在表征时才会中和探索奖励,而对探索动作施加一个小的可避免惩罚会导致收敛到次优策略,探索奖励通过诱导状态覆盖来解决这一问题,而记忆架构则将其转化为回报。
引言
作者研究了情节性探索奖励如何与强化学习中的神经记忆架构相互作用,这对于需要 agent 随时间保留信息的任务而言是一个关键问题。先前的工作通常将探索和记忆视为独立的设计选择,未能明确环境的奖励结构如何调节它们对性能的综合影响。核心贡献在于提出了一个框架,表明相同的探索信号可以根据奖励本质上监督的内容,放大、中和或不对架构能力差异产生影响。作者引入了基于观测锚定的奖励机来刻画这种依赖关系,区分了结构稀疏性(控制保留是否受到监督)和潜在稀疏性(决定是否存在探索缺陷)。
实验
评估在单一训练框架下,比较了六种记忆架构和两种情节性奖励在三个环境中的表现,揭示了相同的奖励可以根据环境的记忆需求产生放大、拉平或无效的效果。这些不同的结果可追溯至两种稀疏性属性:结构稀疏性控制保留是否受到奖励监督,而潜在稀疏性决定 agent 是否必须主动发现需要记住的内容。受控奖励操纵证实,是奖励结构而非密度驱动了奖励的有效性,而惩罚变体表明,奖励通过打破停滞而非超越成本来恢复探索。
在 MysteryPath-Grid 上的成功率表明,是奖励结构而非密度支配着探索奖励的有效性。具有更强序列建模能力的架构在稀疏奖励下从奖励中获益更多,而对齐的奖励使奖励变得多余甚至有害,惩罚奖励会导致停滞,奖励通过打破而非超越这种停滞来发挥作用。在稀疏奖励下,GatedDeltaNet 和 RetNet 借助探索奖励取得了最高的成功率,大幅优于 GRU、LSTM 和 Mamba-2。在惩罚奖励下,所有循环架构在没有奖励时成功率几乎降为零,但 E3B 和 NovelD 恢复了性能,表明奖励解决了停滞问题,而不仅仅是抵消了惩罚。对齐的奖励在大多数架构中产生了最高的无奖励成功率,而添加奖励通常会降低性能,这与奖励变得多余或有害的情况一致。干扰奖励无论架构或奖励如何,成功率都几乎为零,证实了无信息的密集奖励无法替代基于记忆的探索。无记忆 agent 在所有奖励条件下均失败,成功率为零或接近零,这强调了序列建模能力对于探索奖励的任何恢复效果都是必要的。
探索奖励显著提高了相对于基线的成功率,其效果取决于记忆架构和视野条件。在受限视野以及稀疏或惩罚奖励下,奖励使若干循环模型实现了近乎完美的性能,而无记忆基线仍停留在随机水平。干扰和惩罚操纵证实,奖励主要是打破探索停滞,而非简单地超越负奖励信号。在没有奖励的情况下,除了 Mamba-2 和 GatedDeltaNet 之外,所有架构在受限的 3×3 稀疏条件下都接近随机水平。E3B 和 NovelD 奖励将 GRU、LSTM 和 GatedDeltaNet 在大多数 3×3 奖励变体中的成功率提升至接近上限。无记忆架构在任何配置下,无论奖励或视野如何,成功率均未超过 50%。在 7×7 稀疏设置下,GatedDeltaNet 在没有奖励时取得了 94% 的成功率,远超相同条件下的其他架构。惩罚和干扰奖励保留了奖励的恢复效果,表明奖励解决的是停滞问题,而非仅仅补偿负奖励。
记忆增强架构 GRU 和 LSTM 无论奖励或奖励密度如何,都能可靠地实现高精确回忆成功率,而 GatedDeltaNet 则显示出中等但噪声较大的恢复效果,并随奖励有所改善。相比之下,RetNet、Mamba-2 和无记忆变体在所有条件下完全失败,且探索奖励和密集奖励均未改变架构之间的排名。GRU 和 LSTM 在所有奖励和奖励密度组合下的尾部均值成功率约为 0.90–0.93,其中 LSTM 在稀疏设置下略占优势。GatedDeltaNet 取得了 0.31–0.40 的适中成功率,奖励在稀疏和密集奖励下均提供了小幅提升,但高方差持续存在。RetNet、Mamba-2 和无记忆架构在所有条件下成功率几乎为零,未从探索奖励或密集奖励中获得任何益处。
本评估考察了探索奖励如何在三个任务中与奖励结构和记忆架构相互作用。在 MysteryPath-Grid 上,奖励在稀疏奖励下对具有强序列建模能力的架构最为有效,但在对齐奖励下变得多余或有害,而惩罚奖励会导致停滞,奖励则能解决这一问题。在受限视野下,奖励在稀疏和惩罚条件下为若干循环模型恢复了近乎完美的性能,而无记忆 agent 则普遍失败。在精确回忆任务中,GRU 和 LSTM 无论奖励或奖励密度如何都能可靠成功,而其他架构完全失败,且奖励和密集奖励均未改变模型之间的排名。