HyperAIHyperAI

Command Palette

Search for a command to run...

多模态
Agent

LightNav-0:激发视觉语言模型空间智能以实现通用具身导航

摘要

具身导航要求智能体将异构目标与视觉观察转化为跨任务、环境和机器人形态的动作。现代视觉语言模型(VLM)已编码了用于视觉定位、空间推理和指向的空间先验,但这些能力很少被直接激发用于机器人控制。现有导航系统反而依赖特定于任务或形态的组件,割裂了感知、推理和动作,且泛化能力有限。本文提出 LightNav-0,一个紧凑的通用具身导航模型,它激发预训练 VLM 的空间智能并将其与导航对齐,无需特定任务的预测头。LightNav-0 通过统一的令牌接口表示多样化的导航任务:双通道指向表达与任务、场景和形态无关的空间意图,而残差向量量化动作分词器将该意图映射为精确的、特定于形态的轨迹。结合时间感知的视觉历史压缩、具身推理中段训练、监督微调和强化学习,这一范式在单一模型内支持指令跟随、开放词汇物体导航和视觉跟踪。导航训练语料库涵盖 2000 多个场景和 4000 多小时具身导航数据。用于初始化 LightNav-0 的具身推理检查点 LightNav-ER,在 8 个具身推理基准上取得了最高的完整集平均分,而 LightNav-0 在所有 10 个公开导航仿真设置中均达到了最先进的单目成功率。真实世界评估进一步展示了跨机器人形态、多样化场景以及静态和动态目标的零样本泛化能力。这些结果确立了紧凑型 VLM 作为通用具身导航的统一且可迁移的骨干。

一句话总结

Light Origins团队提出LightNav-0,一个紧凑的通才具身导航模型,通过统一token接口的双通道指向和残差向量量化动作tokenizer,结合时间感知的视觉历史压缩、ER midtraining、监督微调与强化学习,支持指令跟随、开放词汇物体导航和视觉跟踪,在所有10个公开导航仿真设定中取得最先进的单目成功率,并零样本泛化到真实机器人、多样场景以及静态和动态目标。

核心贡献

  • LightNav-0是一个紧凑的通才导航模型,使用双通道指向前缀表达任务无关的空间意图,并采用残差向量量化动作tokenizer,消除了任务特定的预测头。
  • 一种训练方案,结合时间感知的视觉历史压缩、具身推理mid-training、监督微调与强化学习,使单一的单目RGB策略能够处理指令跟随、开放词汇物体导航和视觉跟踪,覆盖2000多个场景和4000多个小时的数据。
  • LightNav-ER在8个具身推理基准上取得了最高的完整集平均分,LightNav-0在所有10个公开导航仿真设定中实现了最先进的单目成功率,同时零样本迁移到四种真实机器人形态。

引言

具身导航任务,如遵循语言指令、搜索物体和跟踪移动目标,要求agent能够将目标与观测对齐,保持空间上下文,并在多样的环境和机器人平台上行动。大多数现有系统针对单一基准设计,依赖任务特定的组件,如航点预测器、拓扑地图或分离的动作头。这种碎片化阻碍了开放词汇的迁移,使导航无法受益于现代视觉语言模型的扩展优势。

作者提出一种不同的设计原则:一个紧凑的视觉语言模型可以作为通用导航的共享推理骨干。他们引入了LightNav-0,它保留了预训练的VLM,不添加任务特定的预测头。模型通过双通道指向表达空间意图——预测可行运动的affordance点和目标的object点——作为跨任务和形态的统一接口。这种基于空间推理与时间感知视觉压缩和残差向量量化动作tokenizer相结合,从同一个语言模型头生成精确的连续轨迹。在涵盖指令跟随、物体导航和视觉跟踪的大规模语料库上训练,LightNav-0在多个仿真设定中取得了强大的单目性能,并直接迁移到真实机器人,无需任务或机器人特定的适配。

数据集

作者围绕两个耦合的混合体构建训练数据,导航语料库覆盖2000多个场景和4000多个小时的具身轨迹。具身推理(ER)mid-training来自36个来源,以增强空间理解、时间推理和视觉基础。监督微调(SFT)随后结合16个导航来源和33个辅助ER和VQA来源。在主动采样下,77.6%的优化样本携带导航动作监督,22.4%重演ER能力;这些比例描述了任务平衡的优化混合,而非唯一的语料库覆盖。

具身推理数据

  • ER mid-training按四个能力组分配采样权重:
    • 指向与基础(35.14%):13个来源(RefSpatial-2D/3D、PixMo Points、COCO Pointing、CoSyn Point、RefL4、RoboRefIt、RoboPoint、RoboAfford、HANDAL、FSD Free-Point、FSD Visual-Trace),涵盖指定物体定位、自由空间选择、交互affordance和视觉轨迹追踪。这些教会VLM在图像平面中表达空间决策;在导航SFT中,同样的能力实例化为affordance点和object点token使用的网格。
    • 单图像VQA(25.05%):11个来源(SenseNova-SI Spatial、CLEVR Spatial VQA、SAT Spatial VQA、VSTP-SI Depth Comparison/Distance/Scene Caption/Measurement、VSTP-MI Correspondence/Object–Object Relation/Camera Motion/Scene Caption),涵盖相对位置、度量深度、物体关系、相机运动、测量和affordance导向的推理。
    • 视频推理(19.81%):9个来源(RoboVQA-Reasoning/Understanding、Robo-FAC Failure-VQA、VSI-590K Spatial、SIMS-VSI Spatial、ViCA-322K、LLaVA-Video-VQA、SQA3D-Situated、SpatialLadder Spatial),片段最长64帧,提供时间顺序、轨迹感知空间关系、规划、affordance预测、未来状态推理和失败理解的监督。
    • 抽象具身推理(20.00%):3个来源(LLaVA-OneVision Spatial VQA、Euclid30K-Math、MMIF-23K-Instruct),保留广泛的语言和视觉广度,并从自然图像外观偏差中分离出参考系和多步组合。
  • 多图像与自我-外心对应样本同时来自图像VQA和视频池,要求模型关联不同视角的物体,协调自我中心和外心观察,并估计相机运动。

导航数据

  • 按任务目标(指令跟随、目标物体导航、具身视觉跟踪)组织,而非机器人平台。
  • 生成过程中应用相机随机化:视场采样自[90°,130°],相机高度从[0.5,1.5]米,俯仰角从[−15°,15°]。
  • 所有样本转换为统一的输出序列:一个affordance点、一个object点和三个残差向量量化的轨迹token,使得三个任务可以在单个自回归流中交错。
  • 指令跟随:来自R2R和RxR的随机相机专家轨迹、自蒸馏路径和ScaleVLN数据。
  • 目标物体导航:来自PIRL-Nav、HM3D、MP3D、VLNVerse、Habitat-GS和InteriorGS的语义和专家演示;来自HM3D-OVON和MP3D的自收集探索轨迹;循环中的DAgger样本。
  • 具身视觉跟踪:来自EVT-Bench的随机相机跟随人物轨迹。
  • 质量控制:stop监督仅在目标可见的最后一帧保留;从未观察到目标的episode被移除。stop样本在混合中占比上限为2%。双通道指向标签使用共享网格格式,每个10个航点的动作块由三个K=256的RVQ层级编码。轨迹簇平衡,最大簇占比为5%。

INSIGHT-Bench

  • 一个异构基准,包含1683个训练场景和53090个episode,加上210个评估场景和1097个episode,涵盖基于网格和3D高斯点云的环境。
  • 预标注:无标签的Habitat-GS捕获、HM3D/MP3D和VLNVerse使用自动多视图流水线;InteriorGS提供官方真值框。Molmo2对渲染视图执行开放集指向,度量深度将预测提升到3D,跨视图一致性门控仅在至少两个不同视角且定位扩散低于0.6米的观测支持下保留实例。
  • 数据生成:采样目标和起始姿态,使得目标在至少一个离线清单视图中可见(策略初始观测中不一定)。在导航网格上规划路径,固定停止位置,渲染带动作标签的自我中心视频帧。
  • 指令标注:基于规则的路径使用检测到的相机视图和目标像素水平位置,在视图感知扇区中确定方向措辞。视频条件化的路径提交6个均匀间隔的帧和轨迹摘要给Seed2.0以生成路径级语言。两种路径产生草稿,重写器扩展词汇,同时保留头部名词、隐含方向,从不引入相反方向。视觉到达检查确认目标在最后渲染帧的至少一帧中出现。
  • 诊断分类:episode带有场景级标签(公寓、住宅、商业、机构、室外)和指令标签(基础、方向、关系、极值、序数),实现成功模式的细粒度分析。训练和评估场景严格分离;训练分割平均每个场景31.5个episode,评估分割5.2个。

评估基准

  • ER检查点在8个基准上评估:Point-Bench、RefSpatial、RoboSpatial(POI和VQA赛道)、Where2Place、CV-Bench、ERQA和Emb-Spatial。
  • 导航评估使用10个仿真设定,涵盖指令跟随(R2R、RxR val-unseen)、封闭词汇ObjectNav(MP3D、HM3D v1/v2)、开放词汇ObjectNav(HM3D-OVON)和具身视觉跟踪(EVT-Bench的STT和DT设定)。所有导航基准使用相同的检查点,无需任务特定微调。

方法

作者将异构具身导航任务表述为条件token生成。在每个决策步骤,模型接收自然语言指令和自我中心RGB历史,生成双通道指向前缀,随后是短时域动作序列。解码的动作是10个未来SE(2)航点的轨迹,为低级控制器提供统一的几何接口。

模型从预训练的VLM骨干实例化,包括原生分辨率视觉Transformer和36层语言模型。作者没有引入导航特定模块,而是保留预训练架构,仅通过索引指向和残差向量量化动作token扩充其词汇表。中间空间预测和动作代码都通过原始自回归语言模型头解码。来自时间戳视觉历史、当前观测和指令的token在单个因果序列中交错。

为了处理长时域上下文而不使视觉token无限制增长,作者根据时间近因压缩历史。对于在时间tit_iti获取的历史帧,其年龄定义为ΔTi=tti\Delta T_i = t - t_iΔTi=tti。采样率呈指数衰减:

fs(i)=fsmaxexp(ΔTiτs)f_s(i) = f_s^{\mathrm{max}} \exp \left(- \frac{\Delta T_i}{\tau_s}\right)fs(i)=fsmaxexp(τsΔTi)

选中的帧独立编码。给定得到的块网格Vi\mathbf{V}_iVi,空间池化步长设置为:

si=max{1,exp(ΔTiτp)}s_i = \max \left\{1, \left\lfloor \exp \left(\frac{\Delta T_i}{\tau_p}\right) \right\rfloor \right\}si=max{1,exp(τpΔTi)} V~i=Gsi(Vi)\widetilde{\mathbf{V}}_i = \mathcal{G}_{s_i}(\mathbf{V}_i)Vi=Gsi(Vi)

其中Gsi\mathcal{G}_{s_i}Gsi表示网格池化。时间上较远的观测贡献更少且更粗糙的token,而当前观测保留最精细的视觉细节。

为了弥合2D token网格与度量空间动作之间的差距,作者将每个投影点编码为通道特定的图像网格token。当前视图被划分为HgH_gHg行和WgW_gWg列。投影点p=(u,v)\mathbf{p} = (u, v)p=(u,v)被分配一个扁平化的网格索引:

r(p)=min{Hg1,Hgv}r(\mathbf{p}) = \min \{H_g - 1, \lfloor H_g v \rfloor \}r(p)=min{Hg1,Hgv⌋} c(p)=min{Wg1,Wgu}c(\mathbf{p}) = \min \{W_g - 1, \lfloor W_g u \rfloor \}c(p)=min{Wg1,Wgu⌋} i(p)=r(p)Wg+c(p)i(\mathbf{p}) = r(\mathbf{p}) W_g + c(\mathbf{p})i(p)=r(p)Wg+c(p)

Affordance点pa\mathbf{p}^apa编码为aposia\langle \mathrm{apos}_{i^a} \rangleaposia,表示可行的局部方向或落点。Object点po\mathbf{p}^opo编码为oposio\langle \mathrm{opos}_{i^o} \rangleoposio,定位任务目标。完整的导航输出序列化为:

yt=[aposita,oposito,act_L0k0,t,act_L1k1,t,act_L2k2,t]\mathbf{y}_t = [ \langle \mathrm{apos}_{i_t^a} \rangle, \langle \mathrm{opos}_{i_t^o} \rangle, \langle \mathrm{act\_L0}_{k_{0,t}} \rangle, \langle \mathrm{act\_L1}_{k_{1,t}} \rangle, \langle \mathrm{act\_L2}_{k_{2,t}} \rangle ]yt=[⟨aposita,oposito,act_L0k0,t,act_L1k1,t,act_L2k2,t⟩]

为了避免token预测与几何精度之间的不匹配,每个包含10个未来SE(2)航点的动作块使用残差向量量化进行token化。

tokenizer包含3个层级特定的码本C(0),C(1),C(2)\mathcal{C}^{(0)}, \mathcal{C}^{(1)}, \mathcal{C}^{(2)}C(0),C(1),C(2),每个有256个码字。第一层捕获粗轨迹,后续两层依次量化其残差:

k=argminkdJ(r(),ek())k_\ell = \arg \min_k d_J \left(\mathbf{r}^{(\ell)}, \mathbf{e}_k^{(\ell)}\right)k=argkmindJ(r(),ek()) r(+1)=r()ek(),r(0)=zt\mathbf{r}^{(\ell+1)} = \mathbf{r}^{(\ell)} - \mathbf{e}_{k_\ell}^{(\ell)}, \quad \mathbf{r}^{(0)} = \mathbf{z}_tr(+1)=r()ek(),r(0)=zt

其中dJd_JdJ是雅可比加权的轨迹距离。轨迹距离定义为:

dtraj(z,z^)=ADE(z,z^)+λΔθ(z)Δθ(z^)d_{\mathrm{traj}}(\mathbf{z}, \hat{\mathbf{z}}) = \mathrm{ADE}(\mathbf{z}, \hat{\mathbf{z}}) + \lambda |\Delta \theta(\mathbf{z}) - \Delta \theta(\hat{\mathbf{z}})|dtraj(z,z^)=ADE(z,z^)+λ∣Δθ(z)Δθ(z^)

其中λ=0.3\lambda = 0.3λ=0.3。对于生成的长度为LLL的前缀,重建为:

z^t(L)==0L1ek(),L{1,2,3}\hat{\mathbf{z}}_t^{(L)} = \sum_{\ell=0}^{L-1} \mathbf{e}_{k_\ell}^{(\ell)}, \quad L \in \{1, 2, 3\}z^t(L)==0L1ek(),L{1,2,3}

训练流程包括三个阶段:具身推理Mid-training、监督微调和在线RL后训练。

作者首先进行具身推理mid-training,在引入导航动作之前特化骨干。第一阶段使用任务平衡的混合,涵盖空间推理、通用VQA、图像指向、视频QA等。该阶段完全通过原生自回归接口运行。为防止特化削弱通用能力,采用了先特化后保留的课程。在后续监督阶段,重新平衡的混合与导航数据一起重演。

监督微调将检查点与统一的导航token空间对齐。任务平衡的优化混合结合了保留的推理和VQA数据与指令跟随、物体导航和具身视觉跟踪。导航示例使用相同的目标结构序列化:一个aposi\langle \mathrm{apos}_i \rangleaposi token和一个opos\langle \mathrm{opos} \rangleopos token,后跟三个RVQ token。辅助推理示例和导航轨迹通过共享的因果语言模型目标进行优化:

LCE=jMlogpθ(yjx,y<j)\mathcal{L}_{\mathrm{CE}} = - \sum_{j \in \mathcal{M}} \log p_\theta(y_j \mid \mathbf{x}, y_{<j})LCE=jMlogpθ(yjx,y<j)

导航混合还包含DAgger收集的示例,以缩小训练-部署状态分布差距。

最后,在线RL后训练使用Group Relative Policy Optimization针对任务级目标优化完整策略展开。对于每个episode种子,展开GGG条独立轨迹,并用标量奖励R(τ(g))R(\tau^{(g)})R(τ(g))评分。组内标准化奖励作为优势:

A(g)=R(τ(g))μRσR+ϵnumA^{(g)} = \frac{R(\tau^{(g)}) - \mu_R}{\sigma_R + \epsilon_{\mathrm{num}}}A(g)=σR+ϵnumR(τ(g))μR

代理目标在token级别应用:

LRL=E[min(ρA,clip(ρ,1ε,1+ε)A)]+βDKL(πθπref)\mathcal{L}_{\mathrm{RL}} = - \mathbb{E} \left[ \min \left(\rho A, \mathrm{clip}(\rho, 1 - \varepsilon, 1 + \varepsilon) A \right) \right] + \beta D_{\mathrm{KL}}(\pi_\theta \| \pi_{\mathrm{ref}})LRL=E[min(ρA,clip(ρ,1ε,1+ε)A)]+βDKL(πθπref)

为具身视觉跟踪、指令跟随和目标物体导航定义了任务特定的终端奖励,分别针对其成功标准。

实验

模型在八个空间推理基准、十个涵盖指令跟随、物体搜索和视觉跟踪的导航设定,以及跨游戏环境和四个机器人平台的零样本部署上进行评估。仅使用单目前向RGB视图,LightNav-0达到或超过依赖深度或全景输入的先前方法,而具身推理初始化和双通道指向被证明对鲁棒的目标到达至关重要。扩展实验表明,更广泛的环境覆盖带来最大的改进,额外数据和超过4B参数的模型规模收益递减。

Insight-Bench评估分割包括1097个episode跨210个场景,按五种场景类型和五种空间指令机制组织。公寓占主导,120个场景和239个episode,而极值和方向机制是最常见的指令类型。分布故意不均衡,序数和关系episode代表不足,特别是在房屋、商业和机构场景中。公寓提供最多的场景(120)和episode(239),而室外场景最少(8)但仍贡献228个episode。极值指令最多(250个episode),序数指令最少(178个),关系episode在房屋(31)、商业(30)和机构(32)场景中急剧下降。

LightNav-ER,一个4B模型,在八个具身推理和空间智能基准上取得了最高的平均分,超越了更大的模型如8B Molmo2-ER。它在四个任务上领先,并在其他任务上具有竞争力,表明强大的空间理解不需要更大规模。8B Molmo2-ER在基于点的基准上表现出色,但在某些空间推理任务上落后,表明参数数量本身并不能保证均匀的收益。LightNav-ER(4B)平均分67.4,超过8B Molmo2-ER(62.8)和其他4B模型。它在RefSpatial、Where2Place、CV-Bench和EmbSpatial上排名第一,在Point-Bench和RoboSpatial VQA上排名第二。Molmo2-ER(8B)在Point-Bench(77.3)上领先,但在RoboSpatial POI上仅得32.0,是所有比较方法中最低的。Qwen3-VL(4B)总体排名第二,RoboSpatial POI得分高达64.8。

在连续视觉-语言导航评估的多视图方法中,Reborn在R2R和RxR未见过分割上取得了最高的成功率和路径效率,而GridMM在R2R上记录了最低的导航误差和最高的oracle成功率。早期方法如CMA和Sim2Sim表现相似,HPN+DN在报告的指标上落后。Reborn在R2R和RxR上优于所有其他比较方法,成功率和SPL显著高于CMA和Sim2Sim,并且RxR成功率翻倍以上。GridMM在R2R上取得了最低的导航误差和最高的oracle成功率,表明其目标定位能力强,尽管任务成功率和路径效率略低于Reborn。

评估使用Insight-Bench分割,包含1097个episode,涵盖五种场景类型和五种指令机制,分布故意不均衡。LightNav-ER,一个4B模型,在具身推理和空间智能任务上超越更大的对应模型,确认强大的空间理解不需要更大规模。在连续视觉-语言导航中,Reborn取得了最高的成功率和路径效率,而GridMM展示了优越的目标定位。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供