Command Palette
Search for a command to run...
Embodied-Navigator:面向高效导航的点选、思考、记忆与对齐
Embodied-Navigator:面向高效导航的点选、思考、记忆与对齐
摘要
尽管大型视觉语言模型(VLM)已显著推动具身导航的发展,但其直接部署仍面临挑战,因为现有方法往往迫使 VLM 进入与其 2D 预训练先验不匹配的非自然动作空间,同时受限于僵化的推理调度和低效的记忆管理。为克服这些局限,我们提出 TAMP-Nav,一个面向高效具身导航的统一框架。首先,我们引入像素到 3D 的动作表示(Point),将导航重新表述为 2D 视觉提示。具体而言,VLM 仅需选择 2D 像素,随后将其投影为 3D 坐标,交由底层 SLAM 控制器执行。该设计使具身执行与 VLM 固有的 2D 视觉能力自然对齐。其次,我们提出集成的选择性推理与锚点轨迹记忆机制(Think and Memorize),动态触发思维链,并仅在关键节点保留高保真记忆,将冗余轨迹压缩为轻量级时空指示符,从而保留关键历史信息并增强时空感知。最后,我们通过分组相对策略优化(GRPO)设计了一种高效的两级对齐范式(Align)。通过将全局结果奖励与细粒度过程奖励叠加,这种密集监督使智能体的认知规划与物理环境反馈紧密对齐,赋予模型自适应推理能力。实验表明,TAMP-Nav 在 R2R-CE 上取得了最先进的性能(如 66.2% 的成功率),同时具备较高的运行效率和样本效率(仅需 90k 条训练轨迹)。
一句话总结
浙江大学和浙江人形机器人创新中心有限公司的研究人员提出了 TAMP-Nav,一个统一的具身导航框架,结合了 Pixel-to-3D 动作表示、选择性推理与锚点轨迹记忆,以及基于 GRPO 的两级对齐,在 R2R-CE 上达到 66.2% 的成功率,同时仅需 90k 条训练轨迹。
核心贡献
- TAMP-Nav 引入了 Pixel-to-3D 动作表示,将导航重新表述为 2D 像素选择,所选像素被投影为 3D 坐标供底层 SLAM 控制器使用,从而使动作空间与 VLM 的 2D 视觉预训练对齐。
- 集成的选择性推理与锚点轨迹记忆机制在关键节点动态触发 Chain-of-Thought,并将冗余轨迹压缩为轻量的时空指示符(Space-Time Indicators),保留关键历史信息并增强时空感知。
- 两级 GRPO 对齐范式将全局结果奖励与细粒度过程奖励相结合,以提供密集监督;实验报告了最先进性能,例如在 R2R-CE 上达到 66.2% SR 以及仅用 90k 条训练轨迹即获得高样本效率。
引言
具身导航要求 agents 遵循自然语言指令穿越复杂的 3D 环境。此前基于视觉语言模型的导航器通常迫使模型预测底层动作或 3D 坐标,这可能导致空间幻觉和较差的样本效率。密集的 chain-of-thought 推理可以改进规划,但会显著增加推理延迟;而长时程记忆系统要么因冗余视觉特征而溢出,要么丢弃关键的时空信息。作者提出了 TAMP-Nav,其引入了一个 Pixel-to-3D 动作空间,使模型能够指示通过 SLAM 投影到 3D 的 2D 像素位置;一个选择性推理与锚点轨迹记忆,仅在关键节点触发深度推理;以及一个两级 GRPO 对齐框架,结合全局结果奖励与细粒度过程奖励。该设计旨在弥合视觉语言推理与物理执行之间的差距,同时提高推理效率、记忆控制和样本高效的导航性能。
数据集
- 来源与组成:MultiNav-CoT 基于 VLN-CE 构建,包含 90k 条轨迹。作者对样本进行过滤,删除黑图等渲染伪影,并丢弃由 Gemini 标识的低质量指令。
- 选择性推理标注:该数据集包含选择性 Chain-of-Thought 标注。这些标注用于监督稀疏推理,并帮助解决 TAMP-Nav 的强化学习冷启动问题。
- 关键节点挖掘:对于每条轨迹,作者计算重要性分数 S(t)=Ssem(t)+Svis(t),其中 Ssem 衡量当前视觉观测与指令之间的 CLIP 相似度,Svis 通过视觉特征差异捕捉场景转换。他们应用基于距离的贪心过滤,并设置最小空间距离 Dmin 和最大间隔的时间填充 Dmax。由此产生覆盖轨迹约 30% 的稀疏推理锚点。
- CoT 生成:作者在多阶段提示流程中使用 Gemini 2.5 Flash。他们不一次性生成完整推理链,而是分别生成任务阶段定位、当前观测分析和未来动作推理,然后将其融合为连贯叙述。这减少了幻觉并稳定了标注质量。
- 用途:MultiNav-CoT 用于为 TAMP-Nav 提供高层逻辑推理和空间理解。其选择性 CoT 标注监督稀疏推理。所提供部分未指定确切的训练、验证或测试划分、混合比例或裁剪特定处理。
方法
为实现高层推理与底层执行的无缝衔接,同时获得较高的样本效率与推理效率,作者提出了 TAMP-Nav。
该框架通过持续交互循环运行。在每个导航步骤,agent 首先将当前视觉观测与锚点轨迹记忆(Anchor-Trajectory Memory)整合,以保持长时程空间感知。然后,它自主决定是否触发选择性推理以分析复杂场景。随后,模型采用 Pixel-to-3D 动作表示直接预测一个像素航点,该像素随后被转换为 3D 空间坐标并传递给底层规划器执行。整个决策过程通过 Two-Level GRPO 进行优化,使 agent 在最大化导航成功的同时最小化计算开销。
在 Pixel-to-3D 动作表示中,TAMP-Nav 充当视觉指针。在第 t 步,agent 接收四个第一视角观测 Vt={vt,1,vt,2,vt,3,vt,4},以覆盖 360 度视场。VLM 首先选择最优视图 vt,i,随后输出一个指向目标航点的 2D 像素 at=(u,v)。该像素被投影到局部 3D 点 Pt:
Pt=Dt,i(u,v)⋅K−1[u,v,1]T其中 Dt,i 表示深度图,K 表示相机内参矩阵。该 3D 坐标随后被转换到世界坐标系,并发送给底层 SLAM 控制器,由其处理局部运动以到达 Pt。这种表示使 VLM 无需学习复杂的几何变换,从而能够完全专注于视觉语义对齐。
为解决完整存储导致上下文溢出与稀疏采样导致信息丢失之间的两难问题,作者通过两个组件构建锚点轨迹记忆(Anchor-Trajectory Memory):显式锚点(Explicit Anchors)与时空指示符(Space-Time Indicators, STI)。STI 旨在将精确几何位置 (x,y,yaw) 和时间 (t) 因果关系注入上下文流,并采用特征融合方法。具体而言,空间坐标、时间索引和角度信息分别使用 2D 和 1D 旋转位置嵌入(RoPE)编码。这些嵌入被拼接并通过多层感知机(MLP)投影,形成统一的 STI token:
ESTI(t,x,y,yaw)=MLP([RoPE2D(x,y);RoPE1D(t);RoPE2D(sin(yaw),cos(yaw))])其中 [;] 表示拼接操作。为避免 0∘/360∘ 边界处的不连续性,标量 yaw 不直接编码,而是映射为其连续三角函数表示 (sin(yaw),cos(yaw))。当选择性推理机制在关键拓扑节点 tk 触发 Chain-of-Thought (CoT) 时,状态被存储为三元组:
Ak=⟨MSTI(k),Mvis(k),Mstate(k)⟩这里,MSTI(k)=ESTI(tk,xk,yk,yawk) 提供显式的时空坐标;Mvis(k)=vtk 保留高保真原始视觉特征以支持像素级回环检测;Mstate(k) 通过存储 CoT 来扮演规划信标(Planning Beacon)的角色,表示任务阶段定位。对于两个锚点之间的冗余路径区间 τ,模型丢弃冗余视觉特征,仅保留纯时空流:
Tk=[ESTI(t,xt,yt,yawt)∣t∈T]在每个决策步骤,动态输入上下文 Ct 将工作记忆与长期拓扑记忆拼接起来。
为确保模型在强化学习阶段之前具备稳健先验,作者首先在 MultiNav-CoT 数据集上进行短暂的监督微调(SFT)冷启动。冷启动后,他们使用 Group Relative Policy Optimization (GRPO) 进行进一步微调,设计了一个结合分组相对优化的双奖励系统。
局部单步奖励 Rlocal(t) 引导 agent 在每个步骤作出逻辑、安全且及时的推理决策。五个显式组件被定义:目标接近奖励 (rapp(t)) 鼓励持续向目标移动;碰撞避免奖励 (rcoll(t)) 确保物理可通行性;停止动作奖励 (rstop(t)) 为终止提供监督;推理价值奖励 (rrea(t)) 通过将 CoT 指示符与接近分数相关联来评估推理的实际效用;格式遵循奖励 (rfmt(t)) 确保有效的空间约束和 JSON 格式。总局部奖励定义为:
Rlocal(t)=λ1rapp(t)+λ2rcoll(t)+λ3rstop(t)+λ4rrea(t)+λ5rfmt(t)全局奖励评估已完成轨迹的整体质量,聚合三个指标:任务成功奖励 (rsuc) 是主要驱动因素,将严格成功放宽到 oracle 边界;轨迹效率奖励 (rspl) 通过 SPL 优化导航效率;推理密度奖励 (rden) 提供非负效率奖励,抑制过度 CoT 生成。总全局奖励定义为:
Rglobal=ω1rsuc+ω2rspl+ω3rden该奖励设计鼓励 agent 在确保任务成功的同时最小化认知开销,自然引导其识别关键决策节点并消除冗余推理。
与依赖逐步专家轨迹的先前方法不同,GRPO 范式通过叠加两个层级 rollout 的优势来鼓励自主探索。对于给定指令 q,生成一组 G=8 条完整导航轨迹。为构建每条轨迹,在每个决策步骤 t,策略基于当前上下文 Ct 通过基于温度的采样生成包含 M=4 个动作的候选集 At={a1,a2,...,aM}。这些候选者使用局部单步奖励 Rlocal(t) 进行评估。为确保轨迹质量具有健康方差以进行有效梯度更新,在强化学习早期阶段引入了退火引导采样策略。实际选择候选 ai∈At 来执行并继续轨迹的概率被表示为:
Pselect(ai)=∑j=1Mexp(βk⋅Rlocal(t)(aj))exp(βk⋅Rlocal(t)(ai))其中 βk 是全局 RL 训练迭代第 k 次时的引导系数,显式定义为指数衰减计划 βk=β0⋅αk,初始值 β0>0,衰减率 α∈(0,1)。在早期阶段 (βk>0),该机制按局部奖励显式加权选择候选者的概率。随着训练进行且 βk→0,Pselect(ai) 趋向均匀分布 1/M。一旦生成 G 条轨迹,Aglobal 和 Alocal 通过分别标准化计算。具体而言,Aglobal 通过对 G 个 rollout 的全局轨迹奖励进行 Z-score 标准化获得。同时,在每个决策步骤,实际执行动作 ai 的局部优势 Alocal(t) 通过对其局部奖励 Rlocal(t)(ai) 与 At 中 M 个候选者进行 Z-score 标准化得到。通过将两种优势独立归一化到标准正态分布 (N(0,1)),它们的统计尺度被对齐,以便更平衡地整合到叠加的总优势 AS(t) 中:
AS(t)=Aglobal+Alocal(t)策略通过标准 GRPO 损失公式更新。
实验
评估涵盖标准 VLN-CE 基准、长时程导航子集、深度鲁棒性测试、组件消融以及真实机器人部署。TAMP-Nav 取得了最先进的导航结果,并具有较高的样本效率和推理效率;其学习到的推理集中在决策关键位置,如十字路口、门口和目标物体,而非平凡走廊。消融实验确认了 Pixel-to-3D 动作空间、两级 GRPO、带时空指示符的锚点轨迹记忆以及空间一致的 chain-of-thought 监督的贡献;鲁棒性测试和真实机器人部署表明无需真实机器人微调即可实现可靠泛化。
TAMP-Nav 在 R2R-CE 和 RxR-CE 验证未见划分上优于先前方法,在两个基准上取得了最高的报告成功率。在所列基线中,ETPNav 取得了最强的 R2R-CE 成功率和最佳的 RxR-CE 指标,而若干早期方法仅报告 R2R-CE 结果。TAMP-Nav 还使用比可比系统更少的训练轨迹和交互步骤,表明样本效率和计算效率有所提高。TAMP-Nav 在两个基准上均达到 65% 以上的成功率,在 R2R-CE 上比最强所列基线提高约 9 个百分点,在 RxR-CE 上提高约 11 个百分点。在基线中,ETPNav 具有最低的 R2R-CE 导航误差和最高成功率,ScaleVLN 在 R2R-CE 上具有最高 SPL。密集奖励 RL 相对于仅监督训练提高了 TAMP-Nav 的成功率,同时比 DualVLN 和 StreamVLN 使用更少的训练轨迹和交互步骤。
自动推理触发策略在仅使用约四分之一推理预算的情况下,取得了与密集推理基线几乎相等的导航成功率。固定间隔触发降低了推理密度,但相对于密集策略和自动策略,成功率也有所下降。结果表明,在关键决策点进行选择性推理可保持导航性能,同时避免冗余计算。自动触发以低得多的 CoT 比率几乎匹配密集推理的成功率。固定间隔推理在导航成功率上不如密集触发和自动触发。学习到的策略将推理从笔直走廊转移到十字路口和门口等关键节点。
成功率随乘性深度噪声增加而下降。在较低噪声水平下退化较小,在最高测试噪声水平下更为显著。较高的乘性深度噪声与较低的成功率相关。最大性能下降出现在最高噪声水平,而较低噪声水平仅导致轻微退化。
在超过 12.5 米的长时程验证未见路径上,具有锚点轨迹记忆的 TAMP-Nav 在所比较的导航系统中取得了最高的成功率。消融比较表明,这种记忆设计优于均匀采样和完整历史保留,且时空指示符带来了有意义的增益。具有锚点轨迹记忆的 TAMP-Nav 记录了 49.8% 的成功率,在长时程任务上领先于所评估模型。基于均匀采样或完整历史保留的传统记忆策略落后于锚点轨迹设计,其中完整历史仅略高于均匀采样。移除时空指示符使成功率下降超过四个百分点,但消融版本仍优于所比较的基线。
在匹配预算下的受控消融实验表明,用 pixel-to-3D 替代仅 SFT 的航点动作可带来大幅提升,而加入具有全局轨迹优势的 GRPO 可进一步改善结果。具有退火引导采样的完整 Two-Level GRPO 在两个基准上均产生最佳整体导航质量。完整历史记忆也比均匀采样提供了小幅但一致的改进。完整的 Two-Level GRPO 变体在两个基准上均实现了最低导航误差以及最高成功率和路径保真度指标。Pixel-to-3D 相对于仅 SFT 基线带来了显著增益,退火引导采样在无引导的 Two-Level GRPO 基础上进一步改进。
实验在 R2R-CE 和 RxR-CE 基准上评估了 TAMP-Nav,并验证了其样本效率、推理触发、对深度噪声的鲁棒性、长时程记忆和训练消融。TAMP-Nav 在使用更少训练轨迹和交互次数的同时,创下了新的最先进成功率,密集奖励 RL 优于仅监督训练。自动推理触发通过将推理集中在关键决策点,在约四分之一推理预算下保持了接近密集推理的性能,而固定间隔触发则会降低成功率。长时程结果表明,带时空指示符的锚点轨迹记忆最有效,受控消融实验确认 pixel-to-3D 动作、全局轨迹优势和退火引导采样提供了有意义的导航增益。