Command Palette
Search for a command to run...
Show-Harness:仅凭 VLM 智能体即可操控机器人
Show-Harness:仅凭 VLM 智能体即可操控机器人
Yanzhe Chen Zechen Bai Zhijun Cao Wenzheng Zeng Kevin Qinghong Lin Yiqi Lin Guoqiang Liang Kevin Yuchen Ma Qiming Huang Mike Zheng Shou
摘要
基础视觉–语言模型(VLM)展现出关于世界的广泛智能,但将这种智能转化为机器人控制仍具挑战。我们提出 Show-Harness,一种具身化驾驭框架,通过一个连接意图与动作的紧凑语义接口,使 VLM 能够“操控”机器人。Show-Harness 暴露离散的语义动作单元,VLM 可对其进行自然推理,而具身特定的解释器则确定性地将其落地为本地机器人动作,从而让 VLM 直接负责细粒度的物理决策。通过同一接口,Show-Harness 证明了以下两点的可行性:(1)直接解锁闭源前沿 VLM 以实现零样本机器人控制;(2)仅需数 GPU 小时的微调,即可适配小规模开源 VLM 用于低成本部署。我们进一步开发了 GUMI(GUI 操控接口),将相同的语义动作空间扩展到基于 GUI 的演示采集,使人类和智能体无需专用遥操作硬件即可跨具身“操控”机器人。大量实验表明,配备 Show-Harness 的 VLM 智能体能够跨任务、具身和环境实现鲁棒泛化,性能优于代表性的智能体范式和 VLA 范式。这些结果表明,合适的接口能够从基础 VLM 中释放出可观的具身能力,而无需额外的模型容量或昂贵的具身特定预训练。
一句话总结
新加坡国立大学Show Lab的研究人员提出Show-Harness,一种具身化框架,通过离散语义动作单元和具身特定解释器,使视觉-语言模型能够控制机器人,从而解锁闭源VLM的零样本控制能力和开源VLM的低成本微调,并引入基于GUI的演示界面GUMI,实现跨任务和跨具身的鲁棒泛化。
核心贡献
- Show-Harness是一种具身化框架,具有紧凑的语义动作接口,使视觉-语言模型能够通过对离散动作单元进行推理来直接控制机器人,这些单元由具身特定解释器确定性地映射为物理运动。
- GUMI(GUI操控界面)将相同的语义动作空间扩展到基于GUI的演示收集,使人类和agent能够跨具身操作机器人,无需专用遥操作硬件。
- 大量实验表明,配备Show-Harness的VLM agent能够在任务、具身和环境之间鲁棒泛化,优于代表性的agent范式和视觉-语言-动作范式,并且该接口解锁了闭源前沿VLM的零样本控制能力以及小型开源VLM的高效微调能力。
引言
基础视觉-语言模型已经具备物体识别、空间推理和任务分解的能力,但这些知识并不容易转化为物理机器人行为。现有方法要么将VLM微调为视觉-语言-动作模型,回归出具身特定的连续动作,将广泛的语义知识压缩为不透明的感觉运动映射,需要反复适配;要么将VLM保持在高层级,将物理执行委托给手工设计的控制器,削弱了语义意图与精细运动之间的直接联系。作者提出Show-Harness,一种模型无关的具身化框架,它暴露一组离散的语义动作单元(方向移动和夹爪命令),VLM可以原生地进行推理,同时由解释器将每个单元确定性地映射为有界机器人运动。该接口使闭源前沿VLM能够执行零样本操控,并允许轻量级VLM高效微调,在任务、具身和环境上均优于代表性的agent范式和VLA范式。相同的动作空间还驱动GUMI,一种基于GUI的遥操作接口,使人类和agent无需专用硬件即可收集演示。
方法
作者提出Show-Harness,一种具身化框架,旨在将基础视觉-语言模型的智能转化为物理具身的机器人行为。该系统在迭代的感知-推理-动作循环中运行,无缝连接高层语义推理与低层物理控制。如下图所示:
在每个交互步骤中,给定语言指令ℓ,系统捕获观测ot=(It,pt),其中It表示多视角视觉观测,pt表示机器人的本体感知状态。感知阶段将这些原始传感器流处理为适合模型推理的上下文。多视角引导指示模型如何优先处理不同相机视角,例如使用全局视角获取场景级上下文,使用腕部视角进行精细操控。同时,本体感知将机器人内部状态转化为简洁的文本反馈,包括夹爪高度、位移和接触状态。
推理阶段将任务结构化为可执行的中间决策。作者采用一组可配置的推理插件来优化上下文。子任务规划将指令分解为有序的子任务序列及其完成标准,使模型能够自主推进计划。情境规划推迟不确定的决策,仅在所需信息可观测时选择性触发重规划。其他插件包括动作分块以减少开环执行期间的模型查询频率、自适应步长以平衡效率与精度、以及视觉提示将模糊的语言目标转化为视觉参考。这些插件共同产生推理优化后的上下文ct:
ct=ΦP(ℓ,ot,ht)其中ht是紧凑的交互历史。
然后,中心模型基于此优化后的上下文选择语义动作at:
at=π(ct)∈A这里,A是一组紧凑的、细粒度的、可执行单元,定义了模型与机器人之间的语义接口。该词汇表包括增量平移和旋转单元、夹爪命令以及一个完成token。该设计确保动作可解释、具身无关且视觉具身。
为执行这些语义决策,具身特定解释器gE将单元at确定性地映射为可执行的机器人控制ut:
ut=gE(at;st)解释器使用校准的平移和旋转增量更新6自由度笛卡尔位姿设定点st=(xt,Qt),将语义方向映射到特定具身的运动坐标系中。这种将低层控制隔离在解释器内部的做法,使得语义模型接口能够在不同机器人之间保持不变。
动作阶段通过轻量级交互记忆和恢复机制增强执行。动作历史插件将最近的动作带入下一步以提供时序记忆并防止振荡。失败恢复插件自动检测抓取失败,重置夹爪并回退到相关子任务。
共享的语义接口支持两种互补的机器人控制模式。在零样本模式下,前沿模型直接控制机器人而无需微调。在微调模式下,作者适配一个小型开源模型以直接预测语义动作单元。给定演示D,策略最小化目标单元的token级交叉熵:
L(θ)=−(ℓ,o,h,a)∈D∑logπθ(a∣ΦPmin(ℓ,o,h))其中Pmin仅保留最小决策上下文。由于语义动作通过原生词汇表预测,无需专用动作头,这种方法实现了轻量级适配和强大的泛化能力。
为促进微调模式的数据收集,作者开发了GUMI,一种基于图形用户界面的操控接口。由于语义动作空间是离散且可直接操作的,人类和agent可以使用相同的语义单元操作机器人。在每一步,接口记录执行前的观测和所选的语义动作,生成策略就绪的配对数据。由于每个语义单元由解释器确定性地映射,回放保留了相应的低层命令,使得单次演示即可跨不同具身训练语义动作和连续控制策略。
实验
评估涵盖两个机器人平台和十项多样的操控任务,将零样本前沿VLM和微调后的小型VLM与VLA、以VLA为中心以及代码即策略的基线进行比较。Show-Harness agent在任务、环境和具身之间始终展现出更好的泛化能力,语义动作接口无需重新训练即可实现物理适应性(例如精细控制、多臂协调),以及语义适应性,如推理和从演示中进行上下文学习。消融实验证实,显式动作约定、多视角引导和选择性插件对于鲁棒性能至关重要,而该框架能够从大型零样本模型有效扩展到紧凑的微调模型。
具身化框架将基于VLM的机器人控制循环组织为感知、推理和动作插件,分别转换传感器流、管理计划和执行动作。情境规划、动作历史和失败恢复等关键插件通过推迟决策直到有足够证据、防止重复动作循环和检测空抓取,带来了显著的性能提升。动作空间约定提供了大部分具身基础,语义名称作为有用的先验,而相同的接口能够泛化到多样的操控任务而无需重新设计。情境规划推迟不确定的决策,通过实现有针对性的探索而非过早规划,将隐藏物体搜索成功率从35%提升到85%。移除动作历史会降低成功率并因相反动作之间的振荡而增加超时;记录最近的动作可以暴露循环并提供轻量级记忆以实现稳定的闭环控制。失败恢复通过检测空抓取,防止agent在夹爪为空的情况下继续操作,将成功率从72%提升,其中在难以抓取的物体上下降幅度最大。具有显式约定的任意动作符号几乎与语义名称相匹配,而仅使用符号在20次试验中仅成功1次,表明约定避免了从视觉变化推断物理效果的歧义。仅使用语义动作名称仍然可用但效率较低,表明约定提供了大部分具身基础,语义名称作为有用的先验。该框架能够处理新物体、光照变化、杂乱场景、双臂抽屉打开和字母块重排,无需重新设计面向模型的动作空间。
Show-Harness在零样本和微调模式下,在任务、环境和具身变化中始终优于所有基线。配备前沿模型的零样本agent在跨任务评估(包括留存的物体组合)中达到近乎完美的成功率,而微调后的小型模型仅使用仿真演示即可成功完成仿真到真实的迁移。相同的语义接口在不同机器人手臂之间有效迁移,桥接了大型零样本模型和紧凑的微调策略。零样本Show-Harness在所有跨任务评估(包括未见过的物体)中达到完美或近乎完美的成功率,远超专门的VLA和代码即策略agent。使用小型模型微调的Show-Harness在大多数任务上与零样本agent相当,并且唯一成功完成仿真到真实迁移,而可训练的VLA基线则失败。语义接口在Franka和AgileX具身之间泛化,零样本agent通过解释器适配,微调策略则受益于联合训练。
实验评估了一个模块化的基于VLM的机器人控制框架,该框架通过可互换的插件将感知、推理和动作分离。关键设计选择,如情境规划、动作历史跟踪和失败恢复,通过推迟不确定的决策、防止重复动作循环和检测空抓取,显著提高了鲁棒性。相同的语义动作接口能够泛化到多样的操控任务、环境和机器人具身,使大型零样本模型能够实现近乎完美的跨任务性能,而紧凑的微调策略在仿真到真实迁移中独树一帜,其他可训练的VLA基线则失败。