HyperAIHyperAI

Command Palette

Search for a command to run...

N0-TWAM:面向接触密集型操作的大规模触觉原生世界-动作模型

摘要

我们提出 N0-TWAM,一个面向接触密集型操作的触觉原生世界-动作模型,能够同时预测未来视觉与接触信息。据我们所知,这是首个大规模训练的触觉世界-动作模型,并在接触密集型任务上展现出强大能力。我们利用覆盖六种机器人形态和 450 项任务的触觉丰富演示数据,通过视觉-触觉联合训练对 N0-TWAM 进行大规模预训练。我们采用 NeoForce,一种统一的基于力的触觉表征,来形成物理层面的接触信号,作为动作生成的条件。为提升长序列与多阶段操作能力,我们引入触觉接触事件进行任务阶段划分,并在执行过程中逐步推进。为实现实时高效推理,我们在 N0-TWAM 上采用非对称混合 Transformer 架构,将全宽专家用于通用视频处理,而将精简架构用于下游动作与触觉专家。在真实与仿真基准上的评估验证了 N0-TWAM 在多种接触密集型任务中的强大能力,并证明了数据规模扩展对精确触觉与动作预测的增益。综上,N0-TWAM 赋予世界-动作模型预见视觉、触觉与动作的预测能力,为开放接触密集型任务的精细操作奠定了坚实基础。N0-TWAM 的代码库与模型检查点将公开发布,以促进触觉赋能机器人操作领域的进一步研究与发展。

一句话总结

NeoteAI 与复旦大学可信具身智能研究院的研究人员提出了 N0-TWAM,一种触觉原生的世界-动作模型。该模型结合大规模视觉-触觉联合训练、NeoForce 统一力触觉表征以及非对称 Mixture-of-Transformers 架构,联合预测接触密集型操作中的未来视觉、接触与动作,在真实与仿真基准上均展现出优异性能。

核心贡献

  • 本文提出 N-TWAM,首个大规模训练的触觉原生世界-动作模型。该模型利用基于力的 NeoForce 触觉表征联合预测未来视觉与接触,并在六个具身形态的 450 个接触密集型任务上进行预训练。
  • 一种非对称 Mixture-of-Transformers 架构,将全容量的预训练视觉专家与轻量级触觉和动作专家配对,形成因果级联。该架构将预测的接触作为动作生成的中间目标,同时保持流式推理的计算开销低廉。
  • 在仿真与真实机器人基准上,N-TWAM 达到最优性能(UniVTAC 84.5,NeoSim 49.4,真实机器人平均成功率 46.3%)。消融实验表明,预测与观测的触觉通路均有贡献,且数据扩展能提升预测精度。

引言

在拧紧螺丝或操作堆叠杯子这类接触密集型操作任务中,关键的控制信号并非来自整体视觉场景,而是来自相机无法分辨的微妙指尖力与接触。面向这些场景的策略既需要触觉感知,也需要预测近期交互未来的能力,但先前的工作往往只提供二者之一。视觉-语言-动作模型直接将观测压缩为低维动作,而不对后续发展进行建模;视频世界-动作模型仅预测视觉未来,忽略触觉演化。近期具备触觉感知的方法,要么将触觉作为被动的输入通道而不进行预测,要么附加一个独立的冻结触觉预测器,要么对 tactile tokens 进行门控以保护视觉流,始终将触觉排除在联合预测的未来之外。

作者通过 N₀-TWAM 弥补了这一差距,这是首个大规模训练的触觉世界-动作模型。他们将视频扩散 Transformer 主干重组为 Mixture-of-Transformers,包含三个模态专属的精简专家(视频、动作、触觉),共享一个自注意力机制,使模型能够在因果级联中协同生成未来视觉和未来接触,然后根据预测和观测的触觉流共同条件化动作。这种非对称设计保持了预训练视觉专家的全容量,同时使训练和推理成本低廉。在同步触觉的数万小时真实机器人数据上预训练后,N₀-TWAM 在仿真与真实接触密集型基准上均创下最先进水平,消融研究证实,预测的预判目标和观测的调节通路都有显著贡献。

数据集

以下是根据所提供段落进行的简明数据集描述,涵盖构成、处理与使用方式。

  • 数据来源与构成 作者在 NeoData 上进行训练,这是一个超过 30,000 小时、涵盖六个具身形态和 450 个接触密集型任务的大型多机器人操作语料库。每个片段包含同步的逐指触觉传感器和多视角 RGB。真实机器人后训练片段使用 InTac S1 视触觉传感器。大规模的触觉覆盖使 NeoData 区别于纯视觉预训练语料库。

  • 潜在编码(离线预处理) 所有输入均转换为 latent tokens 并缓存至磁盘,因此训练期间无需运行编码器。

    • 视觉与触觉:一个冻结的因果视频 VAE 对所有相机视角和触觉流进行编码。触觉流被视作微小的视频,与视觉共享相同的潜在空间。
    • 语言:一个冻结的 umT5 文本编码器嵌入语言指令。 模型实际消费的是生成的潜在表示。
  • 切分为训练窗口 每个片段被切分为固定长度的 33 个潜在帧窗口

    • 以 30 fps 捕获的原始帧被降采样至 10 fps,得到 129 帧,VAE 在时间上对其进行 4 倍压缩,得到 33 个潜在帧。
    • 连续窗口以 24 个潜在帧的步长前进,产生约 27% 的重叠。
    • 尾部窗口与片段末尾右对齐。
    • 一次性验证过程标记出所有必需模态均完整的窗口;仅完整的窗口用于训练。
  • 统一动作空间 为在异构机器人上训练单一策略,每个具身形态的动作被标准化至一个20 维的末端执行器空间(每臂 10 维)。

    • 位置和 6D 旋转目标以块锚定的增量形式构建,而夹爪值保持绝对值。
    • 动作按每个机器人进行归一化,而非全局归一化,并对重尾的夹爪通道应用分位数裁剪。
  • 接触事件阶段切分 对于长程任务链路,作者自动在演示中标记阶段边界。

    • 主要信号:触觉流,因为触觉读数的急剧变化能可靠地指示状态转换(首次接触、脱离接触、滑动、插入就位)。
    • 回溯:当触觉线索较弱时,使用夹爪开度检测抓取和释放。
    • 其余边界通过最终人工检查进行修正。 这产生了基于有意义接触事件的阶段标签,用于子任务标注和推理时调度。
  • 数据在训练中的使用方式 模型直接在缓存的33 潜在帧窗口及相应的动作目标上进行训练。仅所有必需模态完整的窗口纳入训练混合。统一的动作空间、切分方案和接触驱动的阶段切分均已固化在离线数据准备中。

方法

N0\mathcal{N}_0N0-TWAM 是一个世界-动作模型,学习一个生成模型以推演机器人将经历的未来视频和触觉信号,并从预测的未来中解读动作。以语言指令和观察历史为条件,模型以块为单位自回归地预测耦合的未来视频、触觉反馈和动作流。联合分布被分解为:模型首先预测未来视频和触觉信号,然后以这些预期的未来为条件对动作进行去噪。

作者利用 Mixture-of-Transformers (MoT) 主干高效处理多模态输入。该架构将主干拆分为三个模态专属专家:视频、触觉和动作,而非单一的整体 Transformer。这些专家为归一化、调制和前馈网络维护私有权重,但通过每层共享的单一自注意力机制进行交互。这种设计允许视觉和触觉彼此保持完全注意,同时在权重中隔离容量,防止稀疏的触觉信号降低视觉动态质量。为管理计算成本,视频专家以全宽度运行,而动作和触觉专家更精简,并从零开始训练,依赖共享注意力访问视觉先验。

模型在潜在帧粒度上使用条件流匹配目标进行训练。对于每个模态和时间组,向目标添加噪声,网络回归从噪声到干净目标的路径速度。损失结合了 SNR 加权和有效性掩码,以处理单臂具身形态。

为在单次前向传播中强制执行先预测后动作的分解,作者采用由因果掩码控制的扩散强制级联。该掩码按潜在帧位置和噪声状态对 tokens 进行排序。带噪 tokens 关注干净的历史记录,并与位于同一位置的其他带噪 tokens(如视频和触觉)协同生成。动作 tokens 关注刚预测的视频和触觉帧的干净副本。这种结构确保策略在当前块生成期间基于预期的未来而非真实历史来行动。

一个关键创新在于触觉的双重角色:它既作为需要预测的预判目标,也作为条件化动作的反应式观测。

对于预测通路,触觉与视频一同被视作生成目标。触觉流被 VAE 编码至与视频相同的潜在空间,允许在共享注意力中直接比较。模型以相对于初始帧的残差形式预测未来触觉,捕获接触开始和释放时信息丰富的变化。此预测的触觉潜在表示与视频联合去噪,确保预期场景与接触之间的一致性。

对于观测通路,模型在力空间而非潜在空间中读取当前触觉输入。一个冻结的估计器将原始触觉图像转换为密集的三轴表面力图。这些图由 NeoForce 编码器处理以生成表征 tokens,并在动作头之前交叉注意力到动作流中。该通路初始化为无操作,并在后训练期间进行微调,使策略能够对即时接触反馈做出反应,而不破坏预训练的生成能力。

推理时,模型以自回归方式运行,利用滚动键/值缓存和异步流水线实现实时性能。观测触觉通路以传感器速率运行,在块级预测之间刷新,而预测通路以块速率运行。

对于长程任务,作者引入“触觉标点”来结构化执行。由于任务中期的观测可能具有阶段模糊性,模型利用如抓取开始和释放等接触事件,将演示切分为子任务片段。推理期间,一个轻量级调度器基于触觉反馈推进子任务提示队列。预测的未来触觉信号触发提前推进,该信号由观测的触觉流确认,确保机器人在接触事件确切发生时在子任务之间过渡。

实验

评估涵盖公开和自建的仿真基准,以及真实机器人接触密集型任务,在闭环异步控制下,将触觉世界-动作模型与视觉-语言-动作及纯视觉基线进行比较。在视觉无法分辨接触状态的任务中,纳入预测的触觉预判和观测的力反馈带来了巨大增益,且策略在视觉扰动下能够依赖触觉,表现出优雅的性能降级。消融实验证实,大规模预训练和两条触觉通路都至关重要,同时分析表明模型能准确预测未来接触,且预训练的力编码器能有效迁移至逼真的仿真触觉,进一步提升性能。

非对称 Mixture-of-Tokens 主干保持全宽度的视频专家,使用更窄的动作和触觉专家,相对于全宽度设计,总参数量大约减半。视频专家由预训练模型热启动,共享自注意力在所有层以 3072 的隐藏尺寸运行。非对称设计使总参数量下降约一半(7.2B vs 估计的 15B)。动作和触觉专家使用 1024 的隐藏尺寸,而视频专家保持 3072。共享自注意力在全部 30 层中,以 3072 维度、128 维的 24 头运行。视频专家由预训练视频模型热启动;动作和触觉专家从零开始训练。

原生具备触觉的 N-TWAM 世界-动作模型在 UniVTAC 基准上实现了最高的平均成功率(84.5%),超出最佳视觉-语言-动作策略(InternVLA-A1,67.1%)17 个百分点。纯视觉世界-动作基线甚至落后于最弱的 VLA 策略,表明仅预测未来场景对于由接触定义的任务来说是不够的。将触觉预测纳入世界-动作模型弥补了这一差距,在插入、抓取和货架放置任务中实现了强劲性能。N-TWAM 达到 84.5% 的平均成功率,领先最佳 VLA 策略(InternVLA-A1,67.1%)17 个百分点。纯视觉世界-动作模型(例如 GigaWorld-Policy 16.5%,FastWAM 48.0%,LingBot-VA 31.4%)落后于所有 VLA 策略,表明没有接触建模的场景预测在这些任务上失败。在 VLA 策略中,没有单一方法在所有任务中占据主导:Xiaomi-Robotics 在插入 HDMI、插入孔、插入管和拔出钥匙任务中领先;InternVLA-A1 在抓取分类和提起罐子中领先;StarVLA-α 在将瓶子放入货架中领先。

在四个单臂 NeoSim 任务中,表现强烈依赖于任务和模型类型:世界-动作模型 N0-TWAM 在精确插入任务插入 USB 中实现完美成功率,而视觉-语言-动作策略在灵巧的倒球任务中表现出色,并在抓取薯片任务中微弱领先。所有方法均未能可靠地解决拔出与插入充电器任务,最高成功率也仅为 23%。N0-TWAM 在插入 USB 上达到 100%,远超最佳 VLA 策略(π0.5,74%)。在抓取薯片任务中,StarVLA-α(93%)勉强领先 N0-TWAM(92%),两者均远领先于其他方法。对于倒球,π0.5 以 92% 占主导,而 N0-TWAM 仅达到 63%,逆转了插入任务中的趋势。拔出与插入充电器被证明极具挑战性:大多数方法得分为 0%,领先者 π0.5 也仅达到 23%。

泛化性沿三个轴进行评估:未见过的物体、未见过的位置和视觉扰动。触觉模型 N0-TWAM 并非在每个轴上都最强,但通过在视觉变得不可靠时保持鲁棒性,获得了最高的平均成功率,在光照和背景变化下保持其性能。一个大型视觉-语言模型在未见过的物体上领先,但在视觉扰动下性能急剧下降,表明直接的触觉反馈提供了一种互补的、独立于视觉的回退方案。在视觉扰动下,N0-TWAM 保持 45% 的成功率,而基于视觉的方法降至 25–30%,因为触觉感知直接报告接触,提供了一个独立于视觉的信号。在未见过的物体上,视觉-语言模型 π0.5 实现了最高成功率(80%),受益于广泛的语义先验,而 N0-TWAM 得分为 65%。所有方法在未见过的位置上表现持平或接近(π0.5 和 N0-TWAM 均为 45%),使得视觉扰动成为鲁棒性的决定性轴。

在四个对对齐敏感的操作任务上,从增量末端执行器参数化切换到绝对位姿参数化,通过消除累积漂移大幅提升了成功率。增量公式虽然具有平移不变性,但依赖于移动锚点,在每个块中产生微小误差,在需要固定世界坐标系目标的任务中降低了精度。绝对末端执行器参数化将跨任务的平均成功率提升至 82.5%,而增量式为 50.0%。最大增益出现在提起罐子和抓取薯片上,绝对位姿分别将成功率提高了三倍多和两倍多。将瓶子放入货架在两种参数化方法下都达到了较高成功率(86–87%),表明当对齐约束较宽松时,漂移惩罚是轻微的。

评估涵盖接触密集型操作基准和单臂灵巧任务,将能预测触觉的世界-动作模型与视觉-语言-动作策略及纯视觉世界模型进行比较。结果表明,纳入触觉预测对于接触定义的任务至关重要,这使其相对于最佳 VLA 策略取得了显著的整体领先优势,尽管模型优势因任务而异:世界-动作模型在精确插入上表现出色,而 VLA 策略在灵巧倾倒上占据主导。泛化实验表明,触觉感知在光照和背景变化下提供了稳健的、独立于视觉的回退方案,而大型视觉-语言模型则受益于面对未见物体时的广泛语义先验。绝对末端执行器参数化消除了链式增量预测带来的累积漂移,在对齐敏感的操作上将成功率提高了一倍以上。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供