HyperAIHyperAI

Command Palette

Search for a command to run...

4 小时前
多模态
Agent

HumanCLAW:视觉语言模型能否通过身体行动?

摘要

评估视觉语言模型(VLM)能否通过物理身体行动是一项挑战。行动的结果将 VLM 的决策与运动控制耦合在一起。当任务失败时,很难判断是 VLM 做出了错误选择,还是运动控制器未能成功执行,例如失去平衡而摔倒。在本工作中,我们提出了 HumanCLAW,一个将行动决策与底层执行解耦的评估框架。在每一步中,一个受约束的现成 VLM 发出一个原子技能命令,该命令被转化为一段亚秒级的连续全身运动,并产生真实的物理后果,包括重力和碰撞。因此,身体可以在物理世界中自由行动,而执行端的干扰、平衡和运动误差则被排除在外。剩下可衡量的是模型的行动智能:它每时每刻对身体下一步应执行什么的选择。基于此框架,我们构建了 HumanCLAW-Bench:包含 41 个室内场景中的 1218 个长周期、以自我为中心的寻找-导航-交互片段。我们测试了九个最先进的 VLM,发现没有一个能解决该基准;最佳模型仅达到 16.8% 的成功率。识别目标并非瓶颈。当前 VLM 所缺乏的是具身自我意识:它们会丢失对自己身体的追踪,无法判断身体位于何处、是否已到达目标,或是否撞到了障碍物。

一句话总结

来自Meta、南洋理工大学、华盛顿大学、布朗大学和西北大学的研究人员提出了HumanCLAW,这是一个评估框架,通过让受控的VLM发出原子技能命令并将其转换为亚秒级全身运动,从而将视觉语言模型的决策与低级执行解耦,进而隔离出行动智能。一个包含1218个片段的基准测试显示,由于缺乏具身自我意识,最佳模型的成功率仅为16.8%。

核心贡献

  • 本文提出了HumanCLAW,一个评估框架,通过将原子技能命令转换为具有重力和碰撞的亚秒级全身运动,将VLM的行动决策与低级运动执行解耦,从而在避免平衡或跟踪错误的情况下产生物理后果。
  • 本文构建了HumanCLAW-Bench,一个包含1218个长周期、以自我为中心的“寻找-导航-交互”片段的基准测试,覆盖41个室内场景,并测试了九个最先进的VLM,其中最佳模型的成功率仅为16.8%。
  • 实验表明,核心瓶颈并非视觉识别,而是缺乏具身自我意识:模型无法跟踪自身身体的位置、目标状态和碰撞情况,本文将此归因于训练中将身体仅视为像素,而未形成本体感知、能预测后果的内部模型。

引言

视觉语言模型(VLM)展现出强大的场景理解能力,但尚不清楚它们能否将这种理解转化为通过身体执行的实时物理动作——作者将这种能力称为行动智能。以往的评估要么通过使用抽象的、预先编写的动作来回避运动问题,要么将决策与特定具身的运动控制纠缠在一起,导致无法将推理与执行分离。作者提出了HumanCLAW,一个让冻结的、现成的VLM在闭环物理模拟世界中通过选择参数化原子技能(如行走一步或转动一个角度)来控制全身人形机器人的框架。每个决策都被实现为连续运动,并施加其物理后果,但运动失败被排除,因此错误可归因于决策层面。然后,他们构建了HumanCLAW-Bench,一个包含1218个以自我为中心的“寻找-导航-坐下”片段的集合,覆盖41个房屋,并测试了九个前沿VLM。结果表明,虽然感知基本完好,但模型在具身自我意识方面持续失败:不知道身体在哪里,是否已到达,以及刚刚的动作导致了什么后果。

数据集

作者引入了HumanCLAW‑Bench,一个基于HSSD数据集构建的长周期具身基准测试。它围绕一个“寻找-导航-交互”任务展开,其中agent必须定位指定物体,到达该物体,最后坐在上面。该数据仅用于评估,指标按难度分层。

数据集组成与来源

  • 来源场景:来自HSSD的41个验证房屋,这是一个大型、多样化的人工设计室内住宅集合,跨越多个楼层。
  • 片段:总共1218个片段,每个片段指定一个agent起始姿态和一个目标物体类别(椅子、床、沙发、盆栽植物、马桶、电视)。
  • 子集
    • 坐下子集(597个片段):目标为床、沙发、马桶;片段需要完整的寻找→导航→坐下过程。
    • 导航子集(621个片段):目标为椅子、盆栽植物、电视;片段在成功导航后终止(无需交互)。

处理与场景设置

  • 物理:将可能移动的物体(桌面物品、小型家具)转换为动态物体,以便在接触时发生位移;大型固定装置(床、沙发、马桶、墙壁)保持静态。
  • 难度元数据:每个片段根据通往目标的路径的三个几何维度进行评分:
    • 距离:到最近同类目标的最短路径长度。
    • 选择:分支程度,通过简化路径上的重要转弯数加上穿过的房间数来衡量。
    • 障碍物:路径1米范围内障碍物的平均数量。 这些维度通过在每个楼层5厘米占据网格(墙壁和静态家具)上使用A*算法重建最短可导航路径来计算,然后使用固定的物理阈值划分为简单/中等/困难。总体难度是三个等级的平均值,各层级大致分布为23/46/31%。

数据使用方式

  • 评估划分:所有1218个片段用于评估;不从这些房屋中提取训练划分。
  • 指标:寻找和导航指标在所有片段上计算;交互指标仅限于597个坐下子集片段。
  • 难度分层分析:分层难度标签使作者能够分别报告简单、中等和困难片段的性能,从而隔离几何挑战的影响。

方法

作者提出了HumanCLAW,一个使视觉语言模型(VLM)能够通过闭环agent过程在物理环境中控制全身人形机器人的框架。该系统以亚秒级速率运行,在观察、决策、行动和反馈之间形成闭环。

参考框架图:

在每个时间步ttt,agent接收一个2D以自我为中心的RGB观察oto_tot和一个紧凑的文本历史hth_tht。一个技能决策模块H\mathcal{H}H,围绕受控VLM构建,将这些输入连同高级指令ppp映射到一个参数化技能调用:

st,ct=H(p,ot,ht)\langle s _ {t}, c _ {t} \rangle = H (p, o _ {t}, h _ {t})st,ct=H(p,ot,ht)

其中sts_tst是来自固定集合的原子技能,ctc_tct是其连续参数。然后,一个解耦的运动生成器G\mathcal{G}G将该调用实现为未来的运动片段:

x^tfut=G(xt,st,ct)\hat {x} _ {t} ^ {\mathrm{fut}} = G (x _ {t}, s _ {t}, c _ {t})x^tfut=G(xt,st,ct)

以当前身体状态xtx_txt为条件。最后,一个运动解耦的物理模拟器W\mathcal{W}W执行该片段并更新世界状态,以返回下一个观察。

为了使VLM能够从以自我为中心的观察中推断低级运动技能,作者采用了一个上下文推理框架。

如下图所示:

该框架通过引导式推理而非直接运动预测来构建决策过程。它从上下文提示开始,向VLM提供agent身份、任务指令、可用技能以及过去决策的历史,以确保动作连贯性。然后,VLM进行自我感知以外化空间理解,描述可见物体、距离和障碍物。该框架的核心是一个从高到中到低的推理支架。模型首先解读长周期意图,推导出中级目标(例如,接近目标),最后将其转换为结构化JSON格式的低级运动技能及其参数。在执行之前,一个技能特定的空间响应验证器根据安全规则检查提议,以防止碰撞等意外后果,并在必要时修正技能。

运动生成器G\mathcal{G}G将这些符号化的技能调用转换为逼真的全身运动。作者定义了一组有限的原子技能(例如,行走、坐下、转身),具有确定性的文本接口,以确保零样本可靠性。其主干是一个为滚动时域延续而训练的运动基础DiT(扩散Transformer)。它观察最后五个干净的身体状态,并生成接下来的十五帧(30 fps下0.5秒)。输入token由历史帧和带噪声的未来帧拼接而成:

uτ=[xt4:t,x~t+1:t+15(τ)]R20×du _ {\tau} = [ x _ {t - 4: t}, \tilde {x} _ {t + 1: t + 1 5} (\tau) ] \in \mathbb {R} ^ {2 0 \times d}uτ=[xt4:t,x~t+1:t+15(τ)]R20×d

该模型使用AMASS数据上的流匹配进行训练,以预测速度场v^θ\hat{v}_\thetav^θ,最小化未来帧上的损失v^θv22\| \hat { v } _ { \theta } - v ^ { \star } \| _ { 2 } ^ { 2 }v^θv22

为了将这种技能无关的先验与特定命令对齐,作者附加了即插即用的ControlNet适配器。

如架构图所示:

每个技能都有一个专用适配器,而基础DiT保持冻结。在第\ell层,冻结的基础块BB_\ellB和可训练的控制块CC_\ellC通过以下方式组合:

z+1=B(z,τ)+WC(z+es(ct),τ)z _ {\ell + 1} = B _ {\ell} (z _ {\ell}, \tau) + W _ {\ell} C _ {\ell} (z _ {\ell} + e _ {s} (c _ {t}), \tau)z+1=B(z,τ)+WC(z+es(ct),τ)

其中WW_\ellW为零初始化,ese_ses是技能条件编码器(根据参数类型为MLP或傅里叶特征)。这种设计允许通过训练新适配器来添加新技能,而不影响基础模型或现有技能。技能参数与直接从运动几何中读取的物理结果相关联,例如行走时的最终骨盆位移。

由此产生的运动生成既逼真又可控制。

如可视化所示:

基础DiT产生多样但不受约束的轨迹,而附加技能ControlNet则使其收敛到预期行为(例如,特定的步行步幅)。技能与符合人体动力学的自然过渡相结合,连续参数允许精细控制,例如在不同目标高度坐下。

最后,系统利用运动解耦的物理模拟器来评估行动智能。为了防止低级运动控制失败(如失去平衡)掩盖决策失败,模拟器采用半物理方法。世界遵循刚体物理,包括碰撞和重力,但人形机器人由从生成的运动序列中导出的运动学速度驱动:

q˙t=qt+1qtΔt\dot {q} _ {t} = \frac {q _ {t + 1} - q _ {t}}{\Delta t}q˙t=Δtqt+1qt

这确保了agent与环境进行物理交互(例如,撞墙或推动物体),同时抽象掉平衡控制,确保失败可归因于行动层面的决策。

实验

该基准测试使用零样本可控运动先验,在渐进式寻找-导航-交互任务上评估视觉语言模型(VLM),该先验忠实地执行低级技能并隔离高级具身推理。目前没有VLM能解决该任务;成功率在各阶段急剧下降,主要瓶颈是以自我为中心的自我定位和身体意识,而非视觉感知。消融实验表明,验证器、中级目标和紧凑的文本历史对于闭环和维持交互至关重要,而更长的视觉历史会降低性能。最强的开源模型与专有模型表现相当,核心的开放挑战是赋予agent对自身身体和与环境的空间关系的感知。

可控运动先验在所有运动技能上实现了接近1.0的达成率,且方差非常低,每次都忠实地执行命令的幅度。相比之下,文本到运动基线产生的比率与1.0偏差很大,经常使请求的幅度加倍或减半,并且方差大一个数量级,表明它忽略了命令,而是生成了通用运动。对于行走、侧步、转身、后退和坐下,先验的比率在0.97到1.00之间,标准差≤0.12,而基线产生的比率高达2.07,标准差高达1.28。爬楼梯是先验比率明显低于1.0(0.74–0.79)的唯一技能,但保持稳定且可校准;基线的爬楼梯比率不稳定(上0.82,下1.54)且变化大。

没有评估的VLM能可靠地完成整个任务;最佳模型仅在16.8%的片段中成功坐在目标上。成功率从找到目标到导航到目标再到与目标交互急剧下降,各模型的导航成功率与寻找成功率之比大致在0.25到0.65之间。所有模型的碰撞率都很高,身体错位是交互失败的主要原因,凸显了具身空间意识的根本性缺乏。最佳模型Gemini-3.1实现了64.9%的FindSR,但InteractSR仅为16.8%,在不到五分之一的尝试中成功坐在目标上。所有模型的步数碰撞率在37.7%到44.2%之间,Gemini-3.1的步数碰撞率为39.5%,表明普遍无法避免与环境接触。

在HumanClawBench上的消融实验表明,验证器对交互成功至关重要,而将文本历史扩展到紧凑的近期窗口之外则没有益处。移除验证器会导致导航和交互成功率崩溃,文本历史迅速饱和:最小历史在保持输入token较低的同时恢复了大部分性能。验证器将开环技能提议转化为坚定的闭环行为。没有验证器,NavSR从27.0%下降到2.0%,InteractSR从18.9%下降到0.0%,而FindSR仅略有下降(58.0%到51.0%)。文本历史是必要的:没有历史,NavSR降至11.0%,InteractSR降至0.0%,但将历史扩展到10步以上并不能改善导航,甚至可能降低交互成功率。紧凑历史(hist 10)每步使用4.7K输入token;hist 100使用12.9K token,NavSR无增益(26.0%对27.0%),InteractSR更低(11.3%对18.9%)。

该表在每个阶段将几何成功与模型确认的成功分开,揭示了目标识别并非瓶颈:一旦目标出现在视野中,模型几乎总能报告它。相比之下,在导航和交互中,仅几何成功与完全成功之间存在巨大差距,agent经常接近目标或短暂坐在上面,但未能主动停止或保持姿势,这表明在以自我为中心的自我定位和精确身体放置方面存在缺陷。对于最强的模型,仅几何寻找成功(GeoFindSR)与确认寻找成功(FindSR)之间的差距仅为5-10个百分点,表明一旦目标进入自我视野,识别是可靠的。当要求主动停止时,导航成功率急剧下降:对于GPT-5.5,GeoNavSR@20cm为27.7%,但NavSR@20cm仅为13.9%,表明许多片段满足距离标准,但agent未能停止。

在所有评估的VLM中,腿和脚的碰撞最为频繁,其次是手臂和手,而头部几乎从不碰撞。最小的模型Qwen3.6-35B-A3B实现了最低的总体碰撞率,Claude-4.8最高。这种模式反映了身体意识的系统性缺乏,尤其是下肢,这与本体感觉输入的缺失一致。腿和脚的碰撞在所有模型中占主导地位,范围从27.99%(Qwen3.6-35B-A3B)到38.83%(GPT-5.5)。头部碰撞可忽略不计,从未超过6.93%(Claude-4.8),多个模型低于3%。Claude-4.8在手臂/手(28.97%)、躯干(16.90%)和头部(6.93%)的碰撞率最高,而GPT-5.5在腿/脚碰撞中领先(38.83%)。最小的模型Qwen3.6-35B-A3B实现了最低的总体碰撞百分比(34.58%)和最低的腿/脚碰撞率(27.99%)。

该研究在需要空间导航和交互的多阶段任务上评估了具身VLM,发现没有模型能可靠地完成整个任务;成功率从目标寻找、导航到交互急剧下降,高碰撞率和身体错位揭示了具身空间意识的根本性缺乏。验证器对于将开环技能提议转化为闭环行为至关重要,而超出紧凑近期窗口的文本历史没有益处。可控运动先验忠实地执行命令幅度,方差低,而文本到运动基线则忽略命令并生成通用运动。目标识别并非瓶颈;失败源于以自我为中心的自我定位、精确身体放置以及下肢身体意识的系统性缺乏。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供