HyperAIHyperAI

Command Palette

Search for a command to run...

N0-VTLA:利用隐式触觉令牌扩展视觉–触觉–语言–动作模型

摘要

我们提出 N0-VTLA,一个视觉–触觉–语言–动作(VTLA)基础模型,具备以下能力:(1)通过触觉感知与触觉反馈控制实现精细的接触密集型操作;(2)利用存储的部署数据进行离线策略改进。为向当前基于视觉的主干架构迈进,我们提出了一套完整的触觉集成训练方案,包括视觉–触觉预训练、分阶段触觉通路整合以及基于优势条件的离线策略改进。在预训练阶段,策略从我们的大规模视觉–触觉机器人数据集 NeoData 中学习广泛的接触先验。据我们所知,N0-VTLA 是首个在大规模触觉数据上进行预训练的 VTLA 模型。在后训练阶段,我们通过一个预测性触觉通路增强策略,将大规模学习到的接触模式蒸馏为下游以触觉为中心的操作中的精细动作调整。针对离线策略改进,我们引入了 ALTER,一种基于优势条件的离线强化学习(RL)方法,该方法将相对进展和轨迹事件比较转化为二值优势标签,用于在固定的部署语料库上进行策略训练。这一过程进一步提升了在接触密集型技能(如可变形物体操作)上的任务特定学习效果。在多个接触密集型基准测试中,N0-VTLA 以显著优势超越强基线:它在全部九项真实机器人 NeoReal 任务中获胜,并在二十项仿真任务套件中达到 63.8% 的平均成功率,而最强基线仅为 44.0%。使用 ALTER 训练的 N0-VTLA 策略在三个长周期真实机器人任务上达到了 75% 至 95% 的成功率。这些结果为构建通用的触觉驱动机器人操作策略奠定了基础。

一句话总结

复旦大学和NeoteAI的研究人员提出了N0-VTLA,这是首个在大规模触觉数据上预训练的视觉-触觉-语言-动作模型,采用在NeoData上进行视觉-触觉预训练、触觉通路集成以及优势条件离线强化学习(ALTER)的训练方案,在20个仿真任务上达到63.8%63.8\%63.8%的平均成功率,在长时域真实机器人接触密集型操作任务上成功率高达95%95\%95%

核心贡献

  • N0-VTLA是一种视觉-触觉-语言-动作基础模型,将触觉感知作为预测目标,基于一个潜在接触预测token来调节流匹配动作专家,而非原始触觉token。在大规模NeoData数据集上预训练后,该潜在token能够以92.3%的top-1准确率检索到匹配的未来触觉目标。
  • 采用三阶段训练方案集成触觉感知:在NeoData上进行视觉-触觉预训练,分阶段触觉通路对齐(冻结感知堆栈并屏蔽视觉-语言通路以使潜在变量与动作专家对齐),以及联合微调。N0-VTLA优于强基线,在所有九个真实机器人任务中获胜,并在二十个任务的仿真套件上达到63.8%的平均成功率,而最佳基线为44.0%。
  • ALTER是一种优势条件离线强化学习方法,将相对进度估计和轨迹事件比较(如触觉检测到的物体掉落和记录的人类修正)转换为二元优势标签,用于在固定部署语料库上改进策略。使用ALTER训练的N0-VTLA策略在三个长时域真实机器人任务上达到75-95%的成功率。

引言

视觉-语言-动作(VLA)模型能够跨任务和具身进行泛化操作,但缺乏触觉感知使得接触密集型操作不可靠。先前加入触觉的尝试要么将触觉token拼接到视觉-语言前缀中,其中稀疏、大多沉默的信号对信息密集的视图贡献甚微,要么将当前触觉读数注入动作通路,这只反映了已经产生的接触,无法预测策略下一步需要执行的接触。作者提出了N₀-VTLA,它将触觉视为预测目标:一个小型预测器读取视觉-语言上下文和当前触觉token,以估计未来动作块上的净触觉变化,得到的潜在变量直接调节动作专家,从而使策略根据其自身动作将引起的接触来行动。

数据集

作者使用NeoData,这是一个大规模精心整理的视觉-触觉语料库,结合了来自单臂和双臂机器人操作器、手持UMI式夹爪的真实世界记录,以及来自UniVTAC模拟器的仿真片段。整个数据集用于N₀-VTLA的预训练,由一个统一的策略接口处理真实和仿真数据。

  • 组成和来源

    • 真实世界数据:单臂和双臂操作器,以及手持收集夹爪。
    • 仿真数据:由UniVTAC视觉-触觉模拟器(NeoSim套件)生成的片段。
    • 每个参与操作任务的夹爪手指都装配了定制的视觉-触觉传感器,因此接触被捕获为触觉图像流,而非低维力信号。
    • 每个平台的具体流数量、帧率和语料库大小记录在附属数据报告(附录A)中。
  • 统一动作和状态模式

    • 所有具身被映射到一个固定的32维容器(继承自π₀.₅)。
    • 前20维分为两个10维槽位,每个手臂一个;剩余12维未使用,始终为零。
    • 每个槽位包含:3D末端执行器位置、6D rot6d旋转、1D夹爪通道。
    • 双臂片段填充两个槽位;单臂片段仅填充第一个槽位,第二个槽位为零。
    • 动作以绝对末端执行器姿态存储。训练时,每个动作块被重写为相对于其自身第一帧的表示,因此模型预测相对运动。归一化统计量基于此块相对表示,针对每个机器人和动作模式对进行计算。
  • 触觉处理

    • 每个夹爪手指提供一个触觉流,与RGB和本体感觉通道同步。
    • 每个片段以短暂的零接触基线开始(夹爪张开,静止至少0.5秒)。该基线帧作为零接触参考,所有后续触觉帧均相对于它进行解释。
  • 质量过滤

    • 训练前,每个转换后的数据存储库都经过完整性、模式一致性和统计量与媒体一致性的验证。
    • 未通过检查的存储库会被修复或排除。不变性集合在附录C中编目。
  • 在模型中的使用

    • 整个经过验证的语料库(真实+仿真)用于预训练N₀-VTLA。
    • 训练期间,绝对动作序列转换为块相对运动目标,模型被训练以预测这些相对块。
    • 部署时,预测的相对块转换回绝对姿态,逆运动学将其解析为机器人的关节指令。

方法

作者提出了N0N_0N0-VTLA,一种用于接触密集型操作的策略,它将预训练的视觉-语言-动作骨干与新颖的潜在触觉通路集成。基础架构将PaliGemma视觉-语言骨干与流匹配动作专家配对。摄像头视图、指令和机器人状态构成模型前缀,而专家在H=50H=50H=50步的视界上去噪动作块。

为了在不破坏预训练策略稳定性的情况下融入触觉,作者引入了一个潜在触觉通路。不将原始触觉帧输入视觉-语言前缀,而是使用一个冻结的自监督视觉编码器处理当前触觉帧与片段起始基线之间的差异。这产生触觉token。然后,一个轻量级预测器在视觉-语言上下文的条件下,将这些token蒸馏为潜在触觉token zzz,用于估计在即将到来的动作块上预期的净接触变化。

该触觉通路的集成遵循三阶段训练方案,以确保稳定的根基。

参考训练第一阶段的框架图:

触觉预测器针对未来触觉目标进行训练。预测器输出zzz被训练以匹配目标zz^*z,该目标通过将相同的触觉编码器应用于接下来HHH步的触觉变化得到。监督结合了对称InfoNCE对比损失和辅助L1L_1L1重建损失。这使得潜在token扎根于实际的接触动力学,而非仅仅是视觉外观。

在第二阶段,动作专家学习使用这些潜在token。

潜在token zzz被投影到动作专家的宽度,并前置于动作后缀。关键的是,在此阶段,视觉-语言上下文在动作专家之前被屏蔽。这迫使动作预测仅依赖潜在触觉token zzz,在完整策略释放之前使专家与新接口对齐。

最后阶段涉及完整策略的端到端训练。

视觉-语言通路上的屏蔽被移除,使专家能够同时看到场景、指令和zzz。除了冻结的触觉编码器骨干外,所有部分都在动作目标下联合训练。这优化了通路,使感知堆栈能够适应专家的需求,同时保留第一阶段建立的触觉根基。

该多平台模型的基础预训练在集群规模上进行。训练过程表现出高稳定性,其特征在于整个训练过程中损失平滑下降,梯度范数平坦。

除了监督训练,作者还引入了ALTER,用于使用部署数据进行离线策略改进。

ALTER构建了一个成对进度模型,基于来自干净演示的密集进度对和来自触觉检测到的物体掉落事件及人类在环修正的稀疏偏好对进行训练。触觉接触变化,连同运动学和视觉线索,为阶段标注提供依据。然后,冻结的进度模型为存储的轨迹估计全局任务阶段和局部执行变化。在每个预测阶段内,样本按局部变化排序以分配二元优势标签,这些标签在策略训练期间附加到任务提示中。部署时,策略在正优势条件下运行。

实验

评估涵盖九个真实机器人任务和二十个仿真任务,在相同协议下比较带触觉通路的视觉-语言-动作模型与强基线。实验验证了通过对比学习预训练的预测性触觉表征,能够实现插入过程中的接触感知重试行为、精密操作中的精细夹爪力调节,以及在接触关键时刻的精确动作偏离。这些优势在离线RL下持续存在,其中触觉预训练骨干始终优于其纯视觉对应物,表明触觉将操作从视觉承诺转变为闭环的接触自适应过程。

集成触觉反馈显著提高了接触密集型操作任务的成功率。所提出的N0-VTLA模型在UniVTAC套件上达到83.1%的平均成功率,远超所有基线,包括最强的外部模型67.1%,并在多个插入任务上几乎达到饱和性能。触觉感知使得能够从受阻插入中闭环恢复,并进行精细的夹爪力控制,当接触决定结果时具有决定性作用。配备触觉的N0-VTLA在UniVTAC上达到83.1%的平均成功率,领先最佳外部基线(InternVLA-A1为67.1%)16个百分点,并且是纯视觉ACT(30.9%)的2.5倍以上。插入任务受益最多:N0-VTLA在插入孔洞和插入管道的得分分别为95%和99%,而纯视觉方法在受阻尝试后经常失败。ACT+UniVTAC(48.0%)比纯视觉ACT(30.9%)有所提升,但VITaL(40.5%)和几个外部模型落后,表明并非所有触觉集成策略都同样有效。在抓取分类任务上,触觉方法VITaL和ACT+UniVTAC达到近乎完美的成功率(100%和99%),而最佳纯视觉模型仅达到50%。外部基线差异很大:InternVLA-A1在几个任务上占主导(例如,举罐90%,插入管道95%),但在插入HDMI(12%)上困难,而Xiaomi-Robotics-0在插入孔洞(96%)和插入管道(98%)上表现出色,但在举罐(13%)上失败。

在NeoSim基准上,N0-VTLA达到50.8%的总体成功率,领先最强基线π0.5的45.8%,而所有其他外部基线介于8.6%至23.4%之间。在四个单臂任务上性能最强,N0-VTLA平均为73.8%,而π0.5为68.8%,在更困难的八个双臂任务中,尽管每种方法的成功率都大幅下降,该方法仍保持领先。触觉通路使得能够从受阻插入尝试中闭环恢复,并进行精细抓取力调节,将接触密集型任务从单一规划动作转变为接触感知过程。N0-VTLA实现了最高的单臂平均成功率(73.8%)和最佳的NeoSim总体平均成功率(50.8%),超过π0.5(68.8%和45.8%),并将其他基线甩在8.6-23.4%的范围内。在八个双臂任务中,成功率骤降:N0-VTLA降至39.4%,而InternVLA-A1降至1.0%,π0.5降至34.3%,表明该领域对所有方法都更具挑战性。N0-VTLA将插入转变为闭环恢复过程:它在接触后抬起并重新对准,在插座插入上达到85%(对比π0.5的60%),在板插入上达到25%,而π0.5得分为0%。基于触觉的夹爪力精细控制使N0-VTLA能够在不过度夹持的情况下稳定物体,在真实机器人竖瓶任务上达到30%,而基线均为0%。在NeoSim上,专门基线严重退化,整体套件平均成功率在8.6%至23.4%之间,突显了当接触决定成功时,触觉通路提供决定性优势。

作者在UniVTAC和NeoSim基准上评估了N0-VTLA模型,这些基准涵盖了插入和抓取等接触密集型操作任务。触觉感知使得能够从受阻插入中闭环恢复,并进行精细的抓取力调节,将这些任务从纯视觉开环尝试转变为接触感知过程。该模型相对于纯视觉和外部基线取得了巨大改进,尤其是在插入任务上,尽管双臂场景仍然具有挑战性。结果表明,有效的触觉集成对于接触主导的操作具有决定性作用,并且并非所有触觉策略都能带来同等益处。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供