Command Palette
Search for a command to run...
LightNav-0:激发视觉语言模型空间智能以实现通用具身导航
LightNav-0:激发视觉语言模型空间智能以实现通用具身导航
摘要
具身导航要求智能体将异构目标与视觉观察转化为跨任务、环境和机器人形态的动作。现代视觉语言模型(VLM)已编码了用于视觉定位、空间推理和指向的空间先验,但这些能力很少被直接激发用于机器人控制。现有导航系统反而依赖特定于任务或形态的组件,割裂了感知、推理和动作,且泛化能力有限。本文提出 LightNav-0,一个紧凑的通用具身导航模型,它激发预训练 VLM 的空间智能并将其与导航对齐,无需特定任务的预测头。LightNav-0 通过统一的令牌接口表示多样化的导航任务:双通道指向表达与任务、场景和形态无关的空间意图,而残差向量量化动作分词器将该意图映射为精确的、特定于形态的轨迹。结合时间感知的视觉历史压缩、具身推理中段训练、监督微调和强化学习,这一范式在单一模型内支持指令跟随、开放词汇物体导航和视觉跟踪。导航训练语料库涵盖 2000 多个场景和 4000 多小时具身导航数据。用于初始化 LightNav-0 的具身推理检查点 LightNav-ER,在 8 个具身推理基准上取得了最高的完整集平均分,而 LightNav-0 在所有 10 个公开导航仿真设置中均达到了最先进的单目成功率。真实世界评估进一步展示了跨机器人形态、多样化场景以及静态和动态目标的零样本泛化能力。这些结果确立了紧凑型 VLM 作为通用具身导航的统一且可迁移的骨干。
一句话总结
Light Origins团队提出LightNav-0,一个紧凑的通才具身导航模型,通过统一token接口的双通道指向和残差向量量化动作tokenizer,结合时间感知的视觉历史压缩、ER midtraining、监督微调与强化学习,支持指令跟随、开放词汇物体导航和视觉跟踪,在所有10个公开导航仿真设定中取得最先进的单目成功率,并零样本泛化到真实机器人、多样场景以及静态和动态目标。
核心贡献
- LightNav-0是一个紧凑的通才导航模型,使用双通道指向前缀表达任务无关的空间意图,并采用残差向量量化动作tokenizer,消除了任务特定的预测头。
- 一种训练方案,结合时间感知的视觉历史压缩、具身推理mid-training、监督微调与强化学习,使单一的单目RGB策略能够处理指令跟随、开放词汇物体导航和视觉跟踪,覆盖2000多个场景和4000多个小时的数据。
- LightNav-ER在8个具身推理基准上取得了最高的完整集平均分,LightNav-0在所有10个公开导航仿真设定中实现了最先进的单目成功率,同时零样本迁移到四种真实机器人形态。
引言
具身导航任务,如遵循语言指令、搜索物体和跟踪移动目标,要求agent能够将目标与观测对齐,保持空间上下文,并在多样的环境和机器人平台上行动。大多数现有系统针对单一基准设计,依赖任务特定的组件,如航点预测器、拓扑地图或分离的动作头。这种碎片化阻碍了开放词汇的迁移,使导航无法受益于现代视觉语言模型的扩展优势。
作者提出一种不同的设计原则:一个紧凑的视觉语言模型可以作为通用导航的共享推理骨干。他们引入了LightNav-0,它保留了预训练的VLM,不添加任务特定的预测头。模型通过双通道指向表达空间意图——预测可行运动的affordance点和目标的object点——作为跨任务和形态的统一接口。这种基于空间推理与时间感知视觉压缩和残差向量量化动作tokenizer相结合,从同一个语言模型头生成精确的连续轨迹。在涵盖指令跟随、物体导航和视觉跟踪的大规模语料库上训练,LightNav-0在多个仿真设定中取得了强大的单目性能,并直接迁移到真实机器人,无需任务或机器人特定的适配。
数据集
作者围绕两个耦合的混合体构建训练数据,导航语料库覆盖2000多个场景和4000多个小时的具身轨迹。具身推理(ER)mid-training来自36个来源,以增强空间理解、时间推理和视觉基础。监督微调(SFT)随后结合16个导航来源和33个辅助ER和VQA来源。在主动采样下,77.6%的优化样本携带导航动作监督,22.4%重演ER能力;这些比例描述了任务平衡的优化混合,而非唯一的语料库覆盖。
具身推理数据
- ER mid-training按四个能力组分配采样权重:
- 指向与基础(35.14%):13个来源(RefSpatial-2D/3D、PixMo Points、COCO Pointing、CoSyn Point、RefL4、RoboRefIt、RoboPoint、RoboAfford、HANDAL、FSD Free-Point、FSD Visual-Trace),涵盖指定物体定位、自由空间选择、交互affordance和视觉轨迹追踪。这些教会VLM在图像平面中表达空间决策;在导航SFT中,同样的能力实例化为affordance点和object点token使用的网格。
- 单图像VQA(25.05%):11个来源(SenseNova-SI Spatial、CLEVR Spatial VQA、SAT Spatial VQA、VSTP-SI Depth Comparison/Distance/Scene Caption/Measurement、VSTP-MI Correspondence/Object–Object Relation/Camera Motion/Scene Caption),涵盖相对位置、度量深度、物体关系、相机运动、测量和affordance导向的推理。
- 视频推理(19.81%):9个来源(RoboVQA-Reasoning/Understanding、Robo-FAC Failure-VQA、VSI-590K Spatial、SIMS-VSI Spatial、ViCA-322K、LLaVA-Video-VQA、SQA3D-Situated、SpatialLadder Spatial),片段最长64帧,提供时间顺序、轨迹感知空间关系、规划、affordance预测、未来状态推理和失败理解的监督。
- 抽象具身推理(20.00%):3个来源(LLaVA-OneVision Spatial VQA、Euclid30K-Math、MMIF-23K-Instruct),保留广泛的语言和视觉广度,并从自然图像外观偏差中分离出参考系和多步组合。
- 多图像与自我-外心对应样本同时来自图像VQA和视频池,要求模型关联不同视角的物体,协调自我中心和外心观察,并估计相机运动。
导航数据
- 按任务目标(指令跟随、目标物体导航、具身视觉跟踪)组织,而非机器人平台。
- 生成过程中应用相机随机化:视场采样自[90°,130°],相机高度从[0.5,1.5]米,俯仰角从[−15°,15°]。
- 所有样本转换为统一的输出序列:一个affordance点、一个object点和三个残差向量量化的轨迹token,使得三个任务可以在单个自回归流中交错。
- 指令跟随:来自R2R和RxR的随机相机专家轨迹、自蒸馏路径和ScaleVLN数据。
- 目标物体导航:来自PIRL-Nav、HM3D、MP3D、VLNVerse、Habitat-GS和InteriorGS的语义和专家演示;来自HM3D-OVON和MP3D的自收集探索轨迹;循环中的DAgger样本。
- 具身视觉跟踪:来自EVT-Bench的随机相机跟随人物轨迹。
- 质量控制:stop监督仅在目标可见的最后一帧保留;从未观察到目标的episode被移除。stop样本在混合中占比上限为2%。双通道指向标签使用共享网格格式,每个10个航点的动作块由三个K=256的RVQ层级编码。轨迹簇平衡,最大簇占比为5%。
INSIGHT-Bench
- 一个异构基准,包含1683个训练场景和53090个episode,加上210个评估场景和1097个episode,涵盖基于网格和3D高斯点云的环境。
- 预标注:无标签的Habitat-GS捕获、HM3D/MP3D和VLNVerse使用自动多视图流水线;InteriorGS提供官方真值框。Molmo2对渲染视图执行开放集指向,度量深度将预测提升到3D,跨视图一致性门控仅在至少两个不同视角且定位扩散低于0.6米的观测支持下保留实例。
- 数据生成:采样目标和起始姿态,使得目标在至少一个离线清单视图中可见(策略初始观测中不一定)。在导航网格上规划路径,固定停止位置,渲染带动作标签的自我中心视频帧。
- 指令标注:基于规则的路径使用检测到的相机视图和目标像素水平位置,在视图感知扇区中确定方向措辞。视频条件化的路径提交6个均匀间隔的帧和轨迹摘要给Seed2.0以生成路径级语言。两种路径产生草稿,重写器扩展词汇,同时保留头部名词、隐含方向,从不引入相反方向。视觉到达检查确认目标在最后渲染帧的至少一帧中出现。
- 诊断分类:episode带有场景级标签(公寓、住宅、商业、机构、室外)和指令标签(基础、方向、关系、极值、序数),实现成功模式的细粒度分析。训练和评估场景严格分离;训练分割平均每个场景31.5个episode,评估分割5.2个。
评估基准
- ER检查点在8个基准上评估:Point-Bench、RefSpatial、RoboSpatial(POI和VQA赛道)、Where2Place、CV-Bench、ERQA和Emb-Spatial。
- 导航评估使用10个仿真设定,涵盖指令跟随(R2R、RxR val-unseen)、封闭词汇ObjectNav(MP3D、HM3D v1/v2)、开放词汇ObjectNav(HM3D-OVON)和具身视觉跟踪(EVT-Bench的STT和DT设定)。所有导航基准使用相同的检查点,无需任务特定微调。
方法
作者将异构具身导航任务表述为条件token生成。在每个决策步骤,模型接收自然语言指令和自我中心RGB历史,生成双通道指向前缀,随后是短时域动作序列。解码的动作是10个未来SE(2)航点的轨迹,为低级控制器提供统一的几何接口。
模型从预训练的VLM骨干实例化,包括原生分辨率视觉Transformer和36层语言模型。作者没有引入导航特定模块,而是保留预训练架构,仅通过索引指向和残差向量量化动作token扩充其词汇表。中间空间预测和动作代码都通过原始自回归语言模型头解码。来自时间戳视觉历史、当前观测和指令的token在单个因果序列中交错。
为了处理长时域上下文而不使视觉token无限制增长,作者根据时间近因压缩历史。对于在时间ti获取的历史帧,其年龄定义为ΔTi=t−ti。采样率呈指数衰减:
fs(i)=fsmaxexp(−τsΔTi)选中的帧独立编码。给定得到的块网格Vi,空间池化步长设置为:
si=max{1,⌊exp(τpΔTi)⌋} Vi=Gsi(Vi)其中Gsi表示网格池化。时间上较远的观测贡献更少且更粗糙的token,而当前观测保留最精细的视觉细节。
为了弥合2D token网格与度量空间动作之间的差距,作者将每个投影点编码为通道特定的图像网格token。当前视图被划分为Hg行和Wg列。投影点p=(u,v)被分配一个扁平化的网格索引:
r(p)=min{Hg−1,⌊Hgv⌋} c(p)=min{Wg−1,⌊Wgu⌋} i(p)=r(p)Wg+c(p)
Affordance点pa编码为⟨aposia⟩,表示可行的局部方向或落点。Object点po编码为⟨oposio⟩,定位任务目标。完整的导航输出序列化为:
yt=[⟨aposita⟩,⟨oposito⟩,⟨act_L0k0,t⟩,⟨act_L1k1,t⟩,⟨act_L2k2,t⟩]为了避免token预测与几何精度之间的不匹配,每个包含10个未来SE(2)航点的动作块使用残差向量量化进行token化。
tokenizer包含3个层级特定的码本C(0),C(1),C(2),每个有256个码字。第一层捕获粗轨迹,后续两层依次量化其残差:
kℓ=argkmindJ(r(ℓ),ek(ℓ)) r(ℓ+1)=r(ℓ)−ekℓ(ℓ),r(0)=zt其中dJ是雅可比加权的轨迹距离。轨迹距离定义为:
dtraj(z,z^)=ADE(z,z^)+λ∣Δθ(z)−Δθ(z^)∣其中λ=0.3。对于生成的长度为L的前缀,重建为:
z^t(L)=ℓ=0∑L−1ekℓ(ℓ),L∈{1,2,3}训练流程包括三个阶段:具身推理Mid-training、监督微调和在线RL后训练。
作者首先进行具身推理mid-training,在引入导航动作之前特化骨干。第一阶段使用任务平衡的混合,涵盖空间推理、通用VQA、图像指向、视频QA等。该阶段完全通过原生自回归接口运行。为防止特化削弱通用能力,采用了先特化后保留的课程。在后续监督阶段,重新平衡的混合与导航数据一起重演。
监督微调将检查点与统一的导航token空间对齐。任务平衡的优化混合结合了保留的推理和VQA数据与指令跟随、物体导航和具身视觉跟踪。导航示例使用相同的目标结构序列化:一个⟨aposi⟩ token和一个⟨opos⟩ token,后跟三个RVQ token。辅助推理示例和导航轨迹通过共享的因果语言模型目标进行优化:
LCE=−j∈M∑logpθ(yj∣x,y<j)导航混合还包含DAgger收集的示例,以缩小训练-部署状态分布差距。
最后,在线RL后训练使用Group Relative Policy Optimization针对任务级目标优化完整策略展开。对于每个episode种子,展开G条独立轨迹,并用标量奖励R(τ(g))评分。组内标准化奖励作为优势:
A(g)=σR+ϵnumR(τ(g))−μR代理目标在token级别应用:
LRL=−E[min(ρA,clip(ρ,1−ε,1+ε)A)]+βDKL(πθ∥πref)为具身视觉跟踪、指令跟随和目标物体导航定义了任务特定的终端奖励,分别针对其成功标准。
实验
模型在八个空间推理基准、十个涵盖指令跟随、物体搜索和视觉跟踪的导航设定,以及跨游戏环境和四个机器人平台的零样本部署上进行评估。仅使用单目前向RGB视图,LightNav-0达到或超过依赖深度或全景输入的先前方法,而具身推理初始化和双通道指向被证明对鲁棒的目标到达至关重要。扩展实验表明,更广泛的环境覆盖带来最大的改进,额外数据和超过4B参数的模型规模收益递减。
Insight-Bench评估分割包括1097个episode跨210个场景,按五种场景类型和五种空间指令机制组织。公寓占主导,120个场景和239个episode,而极值和方向机制是最常见的指令类型。分布故意不均衡,序数和关系episode代表不足,特别是在房屋、商业和机构场景中。公寓提供最多的场景(120)和episode(239),而室外场景最少(8)但仍贡献228个episode。极值指令最多(250个episode),序数指令最少(178个),关系episode在房屋(31)、商业(30)和机构(32)场景中急剧下降。
LightNav-ER,一个4B模型,在八个具身推理和空间智能基准上取得了最高的平均分,超越了更大的模型如8B Molmo2-ER。它在四个任务上领先,并在其他任务上具有竞争力,表明强大的空间理解不需要更大规模。8B Molmo2-ER在基于点的基准上表现出色,但在某些空间推理任务上落后,表明参数数量本身并不能保证均匀的收益。LightNav-ER(4B)平均分67.4,超过8B Molmo2-ER(62.8)和其他4B模型。它在RefSpatial、Where2Place、CV-Bench和EmbSpatial上排名第一,在Point-Bench和RoboSpatial VQA上排名第二。Molmo2-ER(8B)在Point-Bench(77.3)上领先,但在RoboSpatial POI上仅得32.0,是所有比较方法中最低的。Qwen3-VL(4B)总体排名第二,RoboSpatial POI得分高达64.8。
在连续视觉-语言导航评估的多视图方法中,Reborn在R2R和RxR未见过分割上取得了最高的成功率和路径效率,而GridMM在R2R上记录了最低的导航误差和最高的oracle成功率。早期方法如CMA和Sim2Sim表现相似,HPN+DN在报告的指标上落后。Reborn在R2R和RxR上优于所有其他比较方法,成功率和SPL显著高于CMA和Sim2Sim,并且RxR成功率翻倍以上。GridMM在R2R上取得了最低的导航误差和最高的oracle成功率,表明其目标定位能力强,尽管任务成功率和路径效率略低于Reborn。
评估使用Insight-Bench分割,包含1097个episode,涵盖五种场景类型和五种指令机制,分布故意不均衡。LightNav-ER,一个4B模型,在具身推理和空间智能任务上超越更大的对应模型,确认强大的空间理解不需要更大规模。在连续视觉-语言导航中,Reborn取得了最高的成功率和路径效率,而GridMM展示了优越的目标定位。