Command Palette
Search for a command to run...
ReferTrack:先指称后跟踪的具身视觉跟踪方法
ReferTrack:先指称后跟踪的具身视觉跟踪方法
Hanjing Ye Tianle Zeng Jiazhao Zhang Shaoan Wang Zibo Zhang Weisi Situ Yuchen Zhou Yonggen Ling Hong Zhang
摘要
具身视觉跟踪(EVT)要求移动智能体仅凭机载视觉,持续跟随一个以自然语言描述的特定目标。近期的视觉-语言-动作(VLA)策略虽统一了目标识别与轨迹规划,但其链式思维(CoT)推理常运作于抽象的空间隐变量中,难以监督且与显式的图像空间检测对齐较弱。为此,我们提出 ReferTrack,一种“先指称后跟踪”的范式,利用单个前向摄像头为 EVT 提供图像空间锚定。模型首先从一组带索引的边界框中选定目标,然后基于这一图像锚定决策解码跟踪路径点。为保留目标随时间变化的运动线索,ReferTrack 维护一个滑动窗口队列,存储先前选定的边界框,并通过时序-视角-边界框指示符(TVBI)令牌将其几何特征注入视觉历史。我们进一步通过在一个定制的 Refer-QA 数据集上进行协同训练来增强目标识别能力。在 EVT-Bench 上,ReferTrack 取得了最先进的单视图性能,在单目标、干扰目标和歧义目标跟踪子集上的成功率分别达到 89.4%、73.3% 和 74.1%,在识别密集型任务上达到甚至超越了多个多摄像头基线方法。最后,在足式和人形机器人上的真实世界部署验证了其稳健的从仿真到现实迁移能力。代码见 https://github.com/MedlarTea/referTrack。
一句话总结
来自南方科技大学、腾讯Robotics X、北京大学和福田实验室的研究者提出了ReferTrack,一种先指向再跟踪的范式:首先利用单个前向摄像头从带索引的边界框中选定目标,再解码跟踪航点,同时通过由时间-视角-边界框指示符(TVBI)token注入的滑动窗口队列保留运动线索,并在自定义的Refer-QA数据集上进行联合训练,在EVT-Bench上取得了领先的单视图性能,并实现了从仿真到真实环境的稳健迁移。
核心贡献
- ReferTrack提出了一种先指向再跟踪的范式,将目标识别建立在对带索引的图像空间边界框的选取之上,避免了抽象的潜在推理,使决策与显式的视觉证据保持一致。
- 该方法引入了一个滑动窗口队列,该队列中保留了先前选取的边界框,并通过时间-视角-边界框指示符(TVBI)token注入视觉流,从而保留目标的运动线索,并将时空索引转化为以目标为条件的记忆。
- 在自定义的Refer-QA数据集上使用相同的索引目录进行联合训练,强化了基于目录的指向能力,在EVT-Bench的单目标、干扰和歧义三个子集上分别达到89.4%、73.3%、74.1%的领先单视图性能,并在足式和人形机器人上成功实现了从仿真到真实的迁移。
引言
具身视觉跟踪使移动机器人仅依靠机载视觉即可在拥挤、动态的环境中持续跟随一个以自然语言描述的人。其成功需要将目标识别与无碰撞轨迹规划紧密结合。早期流程将这些视为独立的阶段,使用视觉基础模型进行识别,并使用学习型规划器进行导航,但识别错误可能会向下游传播。近期的视觉-语言-动作(VLA)模型通过next-token预测统一了识别与规划;与其他导航任务的大规模联合训练可以构建通用先验,而像TrackVLA++这样的专用跟踪器则引入了基于抽象空间编码的思维链推理。然而,在潜在空间中进行推理通常难以将目标精确地建立在视觉场景中,尤其是在杂乱和歧义的环境下。作者提出了一种先指向再跟踪的范式,将目标识别转化为从一组机载检测结果中选取一个带索引的边界框,有效地将该问题转变为一个受限的多项选择任务。他们的模型ReferTrack将当前检测结果组织成一个带索引的目录,发出单个Refer-CoT token来选择目标,并通过一个滑动窗口队列传播选定的边界框,以便在轨迹预测之前提供运动线索。在基于行人重识别数据构建的自定义Refer-QA数据集上进行联合训练,强化了这种基于目录的指向先验。结果是一个端到端的策略,将推理建立在图像空间的证据之上,在足式和人形机器人上取得了领先的单视图跟踪性能和强大的从仿真到真实的迁移能力。
数据集
作者从两个互补的来源构建了ReferTrack的训练数据,两者都围绕一个共享的带索引边界框目录形式进行组织。
-
导航数据(130万条轨迹)
- 来源:从Habitat 3.0仿真器中的EVT-Bench训练集分割中整理出的专家跟踪轨迹。
- 每条样本包含前向视觉观测、一个自然语言目标描述、一个基于检测的候选目录、真实的Refer-CoT步骤索引以及专家航点。
-
Refer-QA数据(130万个样本)
- 来源:从SYNTH-PEDES数据集(早期具身视觉跟踪方法所使用的同一基础数据集)合成得到的自定义指代表达样本。
- 目的:通过静态的指向性问题显式地增强视觉grounding技能。
这两个子集在一个两阶段的监督微调流程中以1:1的混合比例用于联合训练。 第一阶段将视觉投影器与通用的多模态问答数据对齐;第二阶段在导航和Refer-QA任务上联合进行完全微调。由于语言指令、离散目录和视觉token在两个任务中的序列化方式相同,从静态问答监督中学习到的指向能力能够直接迁移到动态的在线跟踪环境中。
方法
作者提出了ReferTrack,一个为具身视觉跟踪(EVT)设计的视觉-语言-动作(VLA)框架。该模型将近期VLA架构扩展成一个能够同时进行导航和问答的双分支系统。给定一个自然语言指令L和一串前向视角的RGB观测O1:T,agent会预测一段以自我为中心位移和航向变化构成的连续轨迹WT。
如下图所示:
该架构通过一个使用SigLIP和DI-NOv2的双编码器设置来处理视觉输入。一个网格池化策略提取当前观测的细节token Vfine∈R64×C和更广泛历史背景的粗略token Vcoarse∈R4×C。为了平衡长程上下文与推理延迟,系统维护一个由最近H帧组成的滑动窗口,组织为VT={VT−Hcoarse,…,VT−1coarse,VTfine}。一个两层MLP投影器Pvision(⋅)将这个流映射到LLM的潜在空间。为了显式地将目标几何信息注入视觉历史,作者在帧视觉token组之间交叉插入了时间-视角-边界框指示符(TVBI)token。对于一个有效的归一化边界框bt,它通过一个共享的两层MLP Pbbox(⋅)进行嵌入,并添加到TVI token上:
ETVBI(t)=ETVI(t)+Pbbox(bt)如果目标未被观测到,则使用一个确定的缺席标记。关键在于,当前帧的细节token严格依赖仅含TVI的指示符,迫使模型利用历史TVBI线索和原始视觉特征来建立目标关联。
对于图像空间的指向,系统利用一个现成的实时目标检测器构建一个离散的候选目录CT={⟨ped1⟩,…,⟨pedK⟩,⟨NO_EXIST⟩}。每个候选项由一个专用的标识符token后跟一个计算为Ebbox=Pbbox(bT(k))的边界框token表示。一个固定的虚拟索引⟨NO_EXIST⟩处理目标完全不在周围环境中的情况。
核心的推理和规划在两个顺序的LLM阶段中进行。在第一阶段,模型通过在一个已注册特殊token的离散词汇表上进行分类,生成单个Refer-CoT token ETrefer。这个严格的单token决策选取了与指令L最匹配的带索引边界框。在第二阶段,LLM利用ETrefer作为条件前缀来生成一个动作token ETA,一个专用的MLP头将其解码为M个航点WT。
为了保持时序一致性,作者实现了一个“被指向目标边界框队列”。一旦ETrefer被解析,对应的边界框将被推入一个容量为H−1的先进先出队列。该队列为后续时间步的历史TVBI流提供条件,通过将跟踪决策传播到几何历史中来闭合推理循环。
该框架使用三个损失函数的加权和进行优化:
L=αLtraj+Lrefer+Ltext其中α设为10。轨迹损失Ltraj最小化预测航点与专家航点之间的均方误差。指向损失Lrefer通过真实目标索引上的交叉熵来监督Refer-CoT步骤。文本损失Ltext对Refer-QA样本的文本token计算标准交叉熵,绕过动作头,完全专注于视觉grounding和语言对齐。
训练利用了共享统一带索引边界框目录形式的两个互补数据集:用于导航的130万条专家跟踪轨迹和用于Refer-QA的130万个自定义构建的指向样本。作者采用了一个两阶段的监督微调方案。第一阶段使用通用的多模态问答数据集对齐视觉投影器。第二阶段在导航和Refer-QA任务上联合进行完全微调,确保强大的指向技能无缝迁移到动态在线跟踪中。
实验
ReferTrack在Habitat 3.0中的EVT-Bench套件上进行评估,使用单个前向摄像头,在存在干扰和歧义的跟踪任务上对比了经典跟踪器、离线方法、基于强化学习的方法以及VLA策略。定量结果表明,一个紧凑的、仅使用SFT的策略若配备了显式的图像空间指向能力,即能优于所有单视图基线,并匹敌多摄像头方法,突显了当目标消歧是主要挑战时,指向比更宽的摄像头覆盖更有效。消融研究证实,在存在干扰的场景中,目标识别是首要瓶颈,而先指向再跟踪的设计(Refer-CoT和TVBI)提供了稳健的目标选择和时序稳定性。在四足机器人和人形机器人上的真实世界部署进一步验证了该方法,展示了在部分视图和多人干扰下可靠的跟随能力。
一个仅使用监督微调在中等规模数据集上训练出的40亿参数紧凑模型,在EVT-Bench上取得了最佳的单视图跟踪性能。它在干扰跟随和交替跟随上大幅超越了最强的单视图基线,并在识别密集型子集上达到或超过了多摄像头参照系统。指向接口并未损害标准跟踪的稳定性,表明显式的指向能力可以弥合通常需要更大模型、额外摄像头或强化学习才能填补的差距。ReferTrack在DT上的SR和TR分别比最强的单视图基线TrackVLA++提高了+6.8和+13.0,在AT上则提高了+22.9和+22.3。在识别密集型的DT和AT子集上,ReferTrack仅使用单个前向摄像头就达到或超过了多摄像头基线的报告性能。
在干扰跟踪子集上的消融实验揭示了目标识别是首要瓶颈。一个具备完美识别能力的oracle变体达到了81.5%的成功率,接近专家策略的85.1%,而完整模型取得了73.3%的成功率。移除显式指向机制导致成功率急剧下降至55.7%,证实了图像空间的目标选择对于在干扰下的鲁棒性至关重要。一个使用真实边界框但无Refer-CoT的oracle达到81.5%的成功率,远高于完整模型的73.3%,表明主要瓶颈在于目标识别而非运动规划。同时移除Refer-CoT和TVBI导致成功率从73.3%降至55.7%,显示显式的图像空间目标选择是抵抗干扰鲁棒性的主要来源。
一个仅使用监督微调训练出的40亿参数紧凑模型在EVT-Bench上取得了领先的单视图跟踪性能,在干扰和交替跟踪上大幅超越了强大的基线,同时仅使用一个前向摄像头就达到了多摄像头系统的水平。消融实验揭示了目标识别是首要瓶颈,而显式的图像空间指向机制对于抵抗干扰的鲁棒性至关重要,移除它会导致性能急剧下降。该方法表明,显式的指向能力可以弥合通常需要更大模型、额外摄像头或强化学习才能填补的差距。