Command Palette
Search for a command to run...
机器人学习中的进度奖励建模:综述
机器人学习中的进度奖励建模:综述
摘要
机器人学习发生在行为空间庞大的动态环境中。终端成功信号仅告知机器人任务是否完成,却无法说明当前行为是在取得进展、停滞不前,还是在抵消先前的进展。为此,近期研究越来越多地探索在任务执行过程中提供反馈的进度奖励。然而,现有文献缺乏统一的框架。不同方法使用的观测信息、目标规格、输出信号、监督来源和评估协议各异,导致难以相互比较,也难以理解其结果究竟验证了什么。本综述为机器人学习中的进度奖励建模提供了一个统一视角。我们将该领域组织为三个相互关联的步骤。首先,我们研究进度模型的接口,通过考察模型接收何种信息以及产生何种形式的进度信号,从外部定义问题。然后,我们深入模型内部,研究构建该信号的方法,揭示进度估计与奖励生成背后的不同假设和机制。最后,我们审视支撑这些方法的数据与基准,展示进度监督如何获取,以及不同评估实际衡量的是什么。这三个视角共同将进度模型是什么、如何构建以及如何验证其质量联系起来。我们进一步总结了当前方法的主要局限性,并讨论了未来的研究方向。
一句话总结
来自西北大学、卡内基梅隆大学及其他机构的研究者提出了一项统一的综述,将机器人学习中的进度奖励建模组织为三个相互依赖的步骤:模型接口(模型接收什么信息以及产生什么形式的进度信号)、构建方法(进度估计和奖励生成背后的假设与机制),以及验证基准(如何获取进度监督以及评估衡量什么),旨在提供一个比较框架,识别当前的局限性,并指明未来的研究方向。
核心贡献
- 本文引入了一个基于接口的框架,通过任务状态表示、目标规格和输出形式来组织进度模型。
- 提出了一种分类法,系统梳理了构建进度奖励的主要机制,并阐明了每种方法背后的假设。
- 将数据构建流程与评估协议相关联,说明不同基准能够和不能够验证进度奖励质量的哪些方面。
引言
作者综述了机器人学习中的进度奖励建模。在该领域,由于稀疏的最终成功信号难以为长周期、序列化的行为提供足够指导,因此需要关于任务推进的密集反馈。估计进度本质上具有困难:它需要推断一个隐式的、依赖于历史的状态,该状态无法直接从单张图像中读取,而且相同的观测在不同任务下可能指示不同的阶段。尽管与进度相关的方法快速增长,但先前的工作仍然零散——各解决方案在问题表述、输入输出接口和评估实践上存在差异,难以进行直接比较并得出清晰的结论。为了统一这一领域,作者引入了一种基于接口的分类法,将进度模型按任务状态表示、目标规格和输出类型进行归类;随后,其剖析了将进度信号转化为奖励的构建机制,并将数据生成流程与评估协议联系起来,以阐明现有基准能够和不能够评估的内容。
数据集
论文中描述的数据集包含带有进度监督标注的机器人轨迹,基于三种人工参与程度不同的范式构建而成。每种范式产生一种不同类型的进度数据,从小规模的人工标注序列到大规模自动标注的集合均有涵盖。
-
人工驱动的数据
- 来源: 遥操作机器人演示或人类执行任务的录像。
- 处理/标注: 人工标注者分配密集的进度分数,标记成功截止点,识别关键帧和子任务边界,勾勒奖励曲线,或标记不良行为。
- 规模与特征: 小到中等规模(受标注成本限制);具有高语义基础(能够捕捉抓取稳定性、可接受的接触、隐式偏好),但具有主观性,且难以扩展至长周期任务。
-
人机协同的数据
- 来源: 稀疏的人工输入与自动插值或生成的结合。
- 处理/标注: 仅由人工标注成功帧、关键帧或阶段边界;随后在这些锚点之间插值出密集的进度标签。另一种方式是由模型提出标签,由人类验证和修正。在某些流程中,人类设计提示、词汇表或奖励规格,由LLM或脚本大规模生成标注,并辅以人工检查以修改错误。
- 规模与特征: 中等规模;以可承受的标注工作量提供语义控制,但稀疏验证可能会遗漏系统性的标注错误。
-
全自动数据
- 来源: 成功轨迹的时间结构、模拟器状态、真实奖励、专家/噪声策略以及基础模型。
- 处理/标注:
- 时序方法:将成功演示中的较晚帧视为更接近完成,产生归一化进度、目标接近度目标或成对排序。
- 结构化环境:模拟器状态、物体位姿、几何谓词和原生奖励生成成功标签、阶段索引、连续进度或偏好对。专家策略提供成功轨迹;噪声策略制造失败案例。
- 基础模型:LLM和VLM产生子目标分解、阶段边界、进度分数和成对偏好。
- 行为覆盖增强:对成功轨迹进行截断、反转、与不匹配的指令配对,或注入动作噪声,以创建部分完成、回退和失败的样例。过滤操作确保合成的失败案例在物理上合理,以避免可利用的伪影。
- 规模与特征: 大规模、低成本;依赖于时间与进度相关的假设,并继承来自环境或标注模型的偏差。
论文使用这种多来源的进度监督来训练进度模型。尽管未给出明确的混合比例,数据很可能被组合使用以平衡语义丰富性和规模。诸如归一化进度分数、阶段边界、成功/失败标签以及成对偏好排序等元数据在标注过程中被构建。在自动数据上应用了增强策略(截断、反转、噪声注入),以减少仅成功案例的偏差并提高鲁棒性,同时过滤掉物理上不合理的样例。
方法
作者围绕三个核心问题来组织进度模型的接口:当前任务状态如何表示,任务目标如何指定,以及模型输出采用何种形式。
对于输入接口,当前任务状态可以通过多种方式表示。单次观测输入提供最低的延迟,但可能难以区分视觉上相似但基于执行历史具有不同含义的状态。时序上下文通过对模型输入一段观测序列来解决这一问题,例如在在线估计中使用最近的窗口,或在离线评分中使用完整轨迹。关系比较接口通过比较两个或多个参考状态(例如动作前后)来估计进度,将进度转化为关系判断。最后,状态访问接口利用环境代码、模拟器API或本体感知特征,这在可接入测量工具的环境中非常有效,但在开放世界场景中不太实用。
任务目标通常通过语言、视觉或结构化格式来指定。语言条件目标因其与现有模型的兼容性而被广泛使用,但可能会在物理细节上约束不足。视觉条件目标,如目标图像或演示轨迹,提供更丰富的物理基础,但需要精心整理的数据,并且对视觉变化敏感。结构化或程序化目标使用谓词和约束,能够在仿真中提供精确的奖励构建,但依赖于显式表示的状态变量。
输出接口决定了模型预测如何被解释为进度。最常见的输出是表示任务进度、成功可能性或目标相似度的状态级标量分数。进度差值输出预测一个转移是否改进了任务状态,这与强化学习天然对齐,但需要在时间上进行累积。排序输出通过对状态或轨迹的排序来定义进度,这种方式更容易监督,但必须转化为标量奖励。程序化方法输出可执行的奖励函数,提供灵活性和可解释性,但依赖于生成代码的质量和可用的状态变量。
作者根据进度信号的获取方式及转化为可用奖励的方式,将进度奖励的构建归类为四种主要范式。
第一种范式利用冻结的基础模型作为语义奖励评分器。这些方法不训练专用的奖励模型,而是直接从预训练模型中提取类奖励信号。例如,CLIP类方法计算当前观测与语言目标之间的图像-文本相似度。其他方法用任务完成问题提示一个冻结的视觉语言模型,并使用特定token的概率作为隐式奖励。虽然这些方法提供零样本可用性,但这些分数通常需要归一化或提示工程才能作为校准过的进度奖励使用。
第二种范式从时间和相对监督中学习奖励。这类方法利用成功演示中的时间顺序,假设较后的状态更接近完成,从而构建奖励。其他方法依赖偏好或排序信息,比较两个状态或轨迹以确定哪个展现了更多进度。一个冻结的视觉语言模型可以生成成对偏好,用于训练一个标量奖励模型。相对监督比绝对分数更容易收集,但需要将学习到的比较结果转化为可用的奖励函数。
第三种范式将进度估计表述为指令微调的预测任务。这些方法不依赖隐式的视觉表示,而是通过任务特定的提示明确定义进度判断,并微调视觉语言模型以遵循这些指令。训练样例将视觉观测与明确的进度相关指令和目标回答配对。模型可被训练来预测绝对进度、任务成功、相对改进,或具有推理基础的进度分数,从而将进度估计作为一项专门的能力来习得。
第四种范式涉及程序化奖励构建。这些方法不直接估计奖励值,而是将进度估计任务转化为可执行程序、谓词或结构化的奖励逻辑。自然语言任务描述被转换为可执行的奖励函数,并可以利用策略训练的反馈进行精炼。当任务可以分解为显式子目标或几何关系时,这种方法尤为有效,尽管它将挑战转移到了任务分解和可靠的状态访问上。
实验
评估设置将基准分为三个目标:进度忠实度(校准、时序一致性、任务基础性和不确定性),鲁棒性与泛化性(跨任务、视角、具身形式和非单调执行),以及下游效用(策略学习、重新标注、过滤和规划)。这些实验验证了进度模型是否忠实地表示任务进度,是否在不依赖捷径的情况下将其理解迁移到新场景,以及即使不完全校准,是否能为机器人控制提供有用的信号。总体结论是,进度估计必须在多个维度上进行评估,因为一个模型可能在不严格校准的情况下仍对决策有用,而仅凭高策略性能并不能证明进度估计的忠实性。