HyperAIHyperAI

Command Palette

Search for a command to run...

5 小时前
多模态

TurboVLA:在 RTX 4090 上以 32 Hz 实时运行且显存占用低于 1 GB 的视觉-语言-动作模型

Hengyi Xie Chenfei Yao Xianjin Wu Xuanyang Xi Yiping Tang Di Xu Yingying Zhu Dingkang Liang Xiang Bai Han Ding

摘要

视觉-语言-动作(VLA)模型通常采用以大型语言模型(LLM)为中心的 VLA 通路,将视觉观测投影到大语言模型的表示空间,再解码为机器人动作。这一设计虽有效,但每次策略调用都会产生大量的计算和内存开销。本文提出 TurboVLA,一种全新的 VLA 范式,将传统的 V → L → A 通路重构为直接的 V + L → A 映射。TurboVLA 不再使用大语言模型作为感知与动作之间的核心接口,而是独立编码视觉观测和语言指令,通过轻量级的双向视觉-语言交互在二者之间直接交换信息,并利用紧凑的解码器预测连续动作块。这一简洁设计直接从视觉和语言特征中构建任务条件化的表示,显著降低了 VLA 推理的计算和内存成本。在 LIBERO 基准上,TurboVLA 仅使用 0.2B 参数,在消费级 RTX 4090 上实现 31.2 ms 推理延迟和 0.9 GB 推理显存占用,平均成功率达到 97.7%,性能与参数量大得多的 VLA 策略相当甚至更优。这些结果确立了 TurboVLA 作为主流 LLM 中心化 VLA 范式的一种简洁而有效的替代方案,为如何连接视觉、语言和动作以实现高效机器人操作提供了新的视角。

一句话总结

TurboVLA 是由华中科技大学与华为技术联合提出的视觉-语言-动作模型,通过轻量级双向视觉-语言交互与紧凑解码器,将传统 VLAV \to L \to AVLA 流程替换为直接 V+LAV + L \to AV+LA 映射,在 LIBERO 上以 0.2B 参数实现 97.7% 成功率,并在 RTX 4090 上达到 31.2 ms 延迟。

核心贡献

  • TurboVLA 将传统 V→L→A 流程重构为直接 V+L→A 映射,用轻量级双向视觉-语言交互替代大型语言模型作为感知到动作的中心桥梁。
  • TurboVLA 独立编码视觉观测和语言指令,通过交叉注意力融合生成任务条件化表示,并通过紧凑解码器解码连续动作片段,显著降低模型规模、推理延迟和内存消耗。
  • 在 LIBERO 基准上,TurboVLA 仅用 0.2B 参数、31.2 ms 推理延迟和 0.9 GB 显存,在消费级 RTX 4090 上达到 97.7% 平均成功率,与规模大得多的 VLA 策略持平或更优。

引言

面向机器人操作的视觉-语言-动作(VLA)模型通常在感知-动作流程中心依赖大型语言模型(LLM),将视觉观测转换为语言对齐的 token,与任务指令结合后解码动作。这种以 LLM 为中心的设计传递了广泛语义知识,但带来了计算瓶颈:通过十亿参数模型处理每个控制步骤导致高推理延迟和内存占用,即使在动作解码并行化时仍限制在资源受限平台上的部署。作者观察到,一旦给定任务指令,执行级控制只需借助指令来约束视觉证据如何引导动作,而不需要 LLM 的完整生成推理能力。由此提出 TurboVLA,一种 V+L→A 范式,移除大型语言骨干,转而用轻量级文本编码器(如 BERT)和紧凑的交叉注意力模块直接融合视觉与语言得到控制导向的表示,并在单次前向传播中预测连续动作片段。这使得在消费级 GPU 上以 0.2B 参数实现超过 30 Hz 的实时操作,同时达到与大规模 VLA 系统相当的成功率。

方法

作者提出 TurboVLA,一种直接且简单的 V+LAV + L \to AV+LA 范式,用于执行级语言条件操作。与以 LLM 为中心的 VLA 模型不同,该方法不在动作预测前将视觉和文本输入通过大型语言模型传递,而是依赖紧凑的模态特定编码器、直接视觉-语言交互模块和动作片段解码器。

如下图所示:

为降低 LLM 中心执行流程的开销并保留足够的指令理解能力,作者使用紧凑的模态特定编码器。执行级指令通常通过物体、属性和空间关系来指定操作技能。因此,指令由轻量级编码器(如 BERT)编码,视觉观测由视觉编码器处理。给定任务指令 xxx,文本编码器提取 token 级的指令特征:

Zl=Pl(ftext(x))RNl×d,Z^l = P_l(f_{\text{text}}(x)) \in \mathbb{R}^{N_l \times d},Zl=Pl(ftext(x))RNl×d,

其中 PlP_lPl 将编码器输出投影到策略维度,NlN_lNl 为指令 token 的数量。完整的 token 序列被保留,使得物体、属性和空间关系仍可用于细粒度视觉条件化。

对于每个相机观测 In(i)I_n^{(i)}In(i),图像编码器提取空间视觉特征,经投影后添加位置和相机视角嵌入:

Znv,(i)=Pv(fimg(In(i)))+Epos(i)+eview(i),Znv=[Znv,(1);;Znv,(K)].Z_n^{v,(i)} = P_v(f_{\text{img}}(I_n^{(i)})) + E_{\text{pos}}^{(i)} + e_{\text{view}}^{(i)}, \quad Z_n^v = [Z_n^{v,(1)}; \dots; Z_n^{v,(K)}].Znv,(i)=Pv(fimg(In(i)))+Epos(i)+eview(i),Znv=[Znv,(1);;Znv,(K)].

此处 Epos(i)E_{\text{pos}}^{(i)}Epos(i) 保留视角内的空间结构,eview(i)e_{\text{view}}^{(i)}eview(i) 标识相机来源。拼接 KKK 个流保留多视角互补线索。机器人状态单独编码为 Zns=fstate(sn)RNs×dZ_n^s = f_{\text{state}}(s_n) \in \mathbb{R}^{N_s \times d}Zns=fstate(sn)RNs×d,其中 fstatef_{\text{state}}fstate 是一个轻量级投影网络。状态特征直接引入动作解码器,使跨模态交互集中于任务条件化的场景理解。

独立编码的视觉和文本特征尚不能确定哪些视觉内容与当前指令相关。作者采用一个简单而高效的视觉-语言交互模块,直接在两个流之间交换信息。令 Vn0=ZnvV_n^0 = Z_n^vVn0=ZnvLn0=ZlL_n^0 = Z^lLn0=Zl 表示初始视觉和指令特征。交互模块通过 NNN 个双向跨模态层逐步更新两者:

(Vn,Ln)=FusionLayer(Vn1,Ln1),=1,,N.(V_n^\ell, L_n^\ell) = \text{FusionLayer}_\ell(V_n^{\ell-1}, L_n^{\ell-1}), \quad \ell = 1, \dots, N.(Vn,Ln)=FusionLayer(Vn1,Ln1),=1,,N.

每层包含层归一化、双向交叉注意力以及带残差连接的模态特定前馈网络。视觉到指令注意力向指令流注入场景上下文,而指令到视觉注意力则使视觉特征以任务语义为条件。在最后一层之后,更新后的两个流被拼接为 Znvl=[VnN;LnN]Z_n^{vl} = [V_n^N; L_n^N]Znvl=[VnN;LnN]

最后,作者使用 ACT 风格的轻量级 Transformer 解码器将融合的多模态表示和机器人状态特征映射为连续动作序列:

A^n=Dθ(Qa,[Znvl;Zns])RH×da,\hat{\mathbf{A}}_n = D_\theta(Q_a, [Z_n^{\text{vl}}; Z_n^s]) \in \mathbb{R}^{H \times d_a},A^n=Dθ(Qa,[Znvl;Zns])RH×da,

其中 Qa=[q1,,qH]Q_a = [q_1, \dots, q_H]Qa=[q1,,qH] 包含 HHH 个可学习动作查询,DθD_\thetaDθ 表示动作片段解码器。所有动作查询并行解码,使策略在单次前向传播中预测完整的 HHH 步动作片段,无需动作 token 化或顺序生成。模型通过行为克隆在专家动作片段上训练。给定目标序列 An=[an,1,,an,H]\mathbf{A}_n^* = [a_{n,1}^*, \ldots, a_{n,H}^*]An=[an,1,,an,H],训练目标为 1\ell_11 损失,无需辅助语言建模目标。

实验

实验在单臂、双臂和真实世界操作基准上评估 TurboVLA,以测试其直接视觉-语言到动作通路相对于以 LLM 为中心的 VLA 策略的表现。结果表明,TurboVLA 在操作成功率上匹配或超越基于大型 LLM 的方法,同时使用极少参数、更低延迟和最低推理内存,证明执行级强控制不需要以 LLM 为核心。消融研究表明,语义语言条件化和双向视觉-语言交互至关重要,但可通过轻量级文本编码器和适度的交互深度实现,验证了 V+L→A 设计的高效性和有效性。

TurboVLA 在 LIBERO 上达到 97.7% 平均成功率,匹配或超越大型 VLA 且资源消耗极低。这证明将 LLM 中心的执行流程替换为直接视觉-语言到动作设计能带来强操作性能和显著效率提升。TurboVLA 取得 97.7% 平均成功率,比 π_0.5 高 0.8 个百分点,仅使用其约 6% 的参数量,推理延迟从 93.6 ms 降至 31.2 ms。它在成功率上超过 VLA-JEPA,同时速度快 3 倍以上,参数仅约 7%。

在 RoboTwin 2.0 干净设置中,各任务方法成功率较低,DP3 领先为 55.2%。所有基线均远低于 TurboVLA 报告的 97.7%,突显了该基准的挑战性以及直接视觉-语言到动作范式的有效性。DP3 在任务方法中成功率最高(55.2%),参数仅 0.3B,延迟 78.4 ms。Diffusion Policy 成功率最低(28.0%)且延迟极高(794.1 ms),表明普通动作扩散在本基准上表现挣扎。尽管具备具身预训练和 3.2B 参数,π0 仅达到 46.4% 成功率,低于更小的 DP3。

移除语言条件化导致严重性能下降,尤其在目标导向任务上,确认仅靠视觉先验不足以应对同一场景下多种行为的需要。用学习的任务 ID 嵌入替代自然语言指令可恢复大部分性能,但仍不及完整语义模型,表明语言提供的信息超越简单任务身份。带语义指令的完整模型在所有任务类型中均实现最高成功率。无语言时,平均成功率从 97.7% 跌至 70.8%,Goal 任务仅 11.6%。任务 ID 嵌入恢复至 95.4% 平均成功率,但仍低于语义指令 2.3 个百分点,显示自然语言提供的信息多于封闭集的任务身份。

比较指令编码器显示,BERT 取得最高平均成功率,而 T5-Small 在以最少参数的情况下实现几乎相同的分数。SigLIP-Base 表现不如其他编码器,尤其在目标与长时域任务上,但所有编码器均保持平均成功率 95% 以上,表明架构不依赖特定文本骨干。T5-Small 尽管模型规模最小,平均成功率仅比最佳编码器 BERT 低 0.6 个百分点。BERT 与 SigLIP 的差距在长时域任务上最大,BERT 领先 5.2 个百分点。

视觉与语言之间的双向交互获得 97.7% 的最高平均成功率,优于直接拼接和不对称交叉注意力变体。允许视觉查询语言和语言查询视觉提供互补信息,尤其对 Goal 和 Long 任务有促进。双向交互相较于直接拼接平均成功率提升 2.5 个百分点(97.7% 对 95.2%)。Visual Queries Language 在 Obj. 任务上达到 100.0%,但 Bidirectional Interaction 在 Spa.、Goal 和 Long 上表现最佳,总体平均最高。

TurboVLA 在 LIBERO 和 RoboTwin 2.0 上接受评估,其直接视觉-语言到动作设计实现 97.7% 平均成功率,且相比基于大型 LLM 的 VLA 显著降低了参数和延迟。消融实验显示,自然语言条件化至关重要,仅视觉或任务 ID 变体显著退化,而视觉与语言间的双向交叉注意力带来最佳总体性能。架构对指令编码器选择具有鲁棒性,所有测试编码器均保持 95% 以上成功率。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供