Command Palette
Search for a command to run...
SONIC:面向自然型人形机器人全身控制的运动跟踪规模化扩展
SONIC:面向自然型人形机器人全身控制的运动跟踪规模化扩展
摘要
尽管拥有数十亿参数的基础模型已在数千块 GPU 上完成训练,类似的规模化收益尚未在人形机器人控制领域得到验证。当前的人形机器人神经控制器规模仍然较小,仅针对有限的行为集合,且仅在少量 GPU 上进行训练。我们证明,扩展模型容量、数据规模和计算资源能够催生一个通用型人形机器人控制器,实现自然、鲁棒的全身运动。我们将运动跟踪定位为人形机器人控制中一项可规模化扩展的任务,利用来自多样化动作捕捉数据的密集监督来习得人体运动先验,而无需人工设计奖励函数。我们通过沿三个轴进行扩展,构建了一个运动跟踪基础模型:网络规模(从 120 万参数扩展至 4200 万参数)、数据集体量(来自 700 小时动作捕捉数据的 1 亿帧以上)以及计算资源(2.1 万 GPU 小时)。除展示规模化的优势外,我们进一步通过以下方面证明了其下游应用价值:(1)一个实时运动学规划器,将运动跟踪桥接至导航等任务,实现自然且可交互的控制;(2)一个统一的 token 空间,支持以单一策略实现 VR 遥操作和视觉-语言-动作(VLA)模型。通过这一接口,我们展示了由 VLA 驱动的自主全身移动操作,该操作需要协调手部和脚部的落点。规模化运动跟踪展现出良好的特性:性能随计算资源和数据多样性的增加而稳步提升,且习得的策略能够泛化至未见过的运动,从而确立了大规模运动跟踪作为人形机器人控制实用基础的地位。
一句话总结
NVIDIA研究人员提出SONIC,一种用于人形机器人运动跟踪的基础模型,该模型扩展了网络规模(高达42M参数)、数据(来自700小时动作捕捉的超过1亿帧)和算力(21,000 GPU小时),从密集的动作捕捉监督中学习自然的全身控制,无需人工奖励工程,从而实现实时运动学规划、VR遥操作以及VLA驱动的移动操作。
核心贡献
- 论文将运动跟踪确定为人形机器人控制的可扩展基础任务,展示了其随算力和数据多样性提升的良好扩展趋势。扩展至21,000 GPU小时和1亿动作帧,得到了一个能够通用跟踪多样化人类行为的控制器。
- 本工作引入了一个用于交互式控制的实时运动学动作生成器,以及一个通用token空间,该空间配备专用编码器,用于处理机器人、人类和混合动作输入,并将所有输入映射到共享的量化表示中。
- 全面的评估展示了扩展趋势、对未见动作的零样本迁移、在物理人形机器人上稳健的仿真到现实部署,以及与基础模型的成功集成。通用token空间进一步实现了VLA驱动的全身移动操作,涵盖需要协调手部抓取和精确脚步放置的任务,并在五个真实世界任务中得到了验证。
引言
作者解决了扩展人形机器人控制的长期挑战。当前最先进的策略仍是在少数GPU上为单一任务训练的小型MLP,并依赖无法在不同行为间迁移的人工设计奖励。尽管语言和视觉领域的基础模型已证明扩展能解锁涌现能力,但人形机器人控制一直受到通用目标设计困难的限制:运动奖励对跳舞或起身不提供信号,而先前的生成式模仿方法在动作数据集多样性增长时会遭遇模式坍塌。为克服这些挑战,作者将基于物理的运动跟踪确定为一个可扩展的基础任务,利用大规模人体动作捕捉数据提供无需奖励工程的密集监督。他们将训练规模扩大到128个GPU和1亿动作帧,实现了对多样化人类行为的通用跟踪。除跟踪外,他们还引入了一个实时运动学动作生成器和一个通用token空间,该空间统一了机器人、人类和混合动作输入,使得同一个控制器能够处理遥操作、交互式角色控制,以及与视觉-语言-动作模型的集成,用于全身移动操作。
数据集
作者从动作捕捉记录中构建了一个大规模人形动作数据集,然后将其重定向并过滤以适应Unitree G1机器人。数据集的构建、处理和使用方式如下:
-
源数据与过滤
- 原始采集:约700小时的动作捕捉片段(1-180秒),涵盖运动、日常活动、手势、格斗等。
- 表演者男女比例均衡,包含数千种独特行为,每个动作有多个受试者和多次拍摄。
- 使用GMR和PyRoki重定向到Unitree G1;移除了物理上不可行的动作(例如,爬楼梯、坐姿活动)。
- 最终训练语料库:611小时,超过1亿帧,频率为50 Hz。
-
数据集划分与多样性
- 33个动作类别(见表2):基本/高级运动、舞蹈风格、手势、格斗、物体操作、工具使用、受伤步态、风格化变体(醉酒、僵尸、潜行)、角色扮演等。
- 所有动作都进行了镜像处理,以生成左/右变体。
- 训练集:8,447个独特的动作子类别(611小时)。
- Test-content划分:训练期间未见过的全新动作子类别。
- Test-repetition划分:已知内容的不同拍摄和演员表演,测试重复泛化能力。
-
公开子集:BONES-SEED
- 在Hugging Face上发布:来自522位演员的142,220个标注序列(288小时)。
- 提供SOMA和Unitree G1格式,包含自然语言描述、时序分割标签和演员元数据。
-
数据使用方式
- 完整的611小时训练集用于学习。
- 两个测试划分分别评估对未见动作内容和已知动作新重复的泛化能力。
- 未指定额外的裁剪或混合比例;主要处理步骤是重定向、可行性过滤和镜像。
方法
作者从动作捕捉集合中构建了一个大规模动作数据集,涵盖广泛的人类行为,包括运动、日常活动、手势和格斗动作。该数据集提供了丰富的受试者内和受试者间差异,如下图所示。
在将源数据重定向到Unitree G1机器人并过滤掉物理上不可行的动作后,作者得到了涵盖33个动作类别的611小时训练数据。构建了明确的训练和测试划分,以隔离新的动作内容和已知内容的新重复。
该方法的核心是SONIC,一个通用人形动作跟踪框架。如下图所示,它采用统一的控制策略来跟踪来自多种输入格式的多样化动作命令,通过共享的潜在表示无缝处理机器人动作、人类动作和混合动作。
人形动作跟踪被建模为一个马尔可夫决策过程 M=⟨S,A,T,R,γ⟩。策略使用近端策略优化(PPO)进行训练,以最大化期望累积折扣回报 E[∑t=1Tγt−1rt]。
状态表示 st 包含本体感知 stp 和动作命令 stg。本体感知信息包括关节姿态、关节速度、根角速度、重力矢量和先前的动作,在10步历史中拼接以提供时序上下文。动作命令可以是机器人动作 gr、人类动作 gh 或混合动作 gm。策略输出目标关节位置 at,由比例-微分控制器进行跟踪。
奖励函数 rt=R(stp,stg)+P(stp,at) 结合了跟踪奖励和惩罚项。跟踪项最小化根位置和方向、身体连杆位置和方向、身体连杆速度以及末端执行器位置的误差。惩罚项应用于抖动和足部加速度。为增强鲁棒性,训练期间对物理参数和动作命令应用系统性域随机化。
通用控制策略利用专用编码器将异构输入处理到共享潜在空间中。三个多层感知机编码器分别处理机器人动作 Er、人类动作 Eh 和混合动作 Em。编码后的潜在表示使用有限标量量化(FSQ)量化为通用token z。选择FSQ是为了避免码本坍塌,并提供与联合PPO优化兼容的清晰直通梯度估计。
两个解码器处理通用token。机器人控制解码器 Dc 获取token和本体感知状态,生成电机命令 at=Dc(z,stp)。辅助机器人动作解码器 Dr 重建机器人动作命令 g^r=Dr(z),以便促进特征学习,并充当隐式重定向模块。
训练在单个端到端循环中联合优化四个损失:
L=Lppo+Lrecon+Ltoken+Lcycle重建损失 Lrecon 确保跨输入模态的保真度,当输入是人类动作时充当重定向损失。token对齐损失 Ltoken 强制所有三个编码器输出之间的成对对齐。循环一致性损失 Lcycle 通过确保从人类动作到机器人动作的翻译及反向过程保留基本特征,强化潜在空间的一致性。采用非对称的actor-critic训练,其中critic观察特权仿真状态,而actor在部署可用的观测上运行。
对于交互式控制,作者使用了一个生成式运动学动作规划器,该规划器被训练为自回归动作补间模型。动作使用骨盆相对关节位置和全局关节旋转来表示。规划在潜在空间中进行,其中连续动作被编码为潜在token。补间过程使用掩码token预测,其中神经骨干根据上下文和目标关键帧迭代预测并确定置信度最高的token。一个临界阻尼弹簧模型从用户命令生成根位置和朝向关键帧,以提高行为的可预测性。
对于涉及视频、文本和音乐的多模态控制,系统集成了GEM,一种基于扩散的模型,可从混合条件生成人体动作序列。这些序列通过人类动作编码器馈入SONIC框架。在Unitree G1平台上的部署采用多速率架构,包含用于策略推理、命令流、操作员输入和运动学规划的并发循环,并在Jetson Orin GPU上运行。
实验
使用Unitree G1人形机器人评估SONIC的动作跟踪、交互式控制、多模态遥操作和移动操作能力,结果表明,扩展数据、模型规模和算力能够对未见过的动作产生强大的泛化能力,并在真实世界中取得高成功率。运动学规划器能够为导航、拳击和其他技能实现响应迅速的全身控制,而通用token空间在无需重新训练的情况下统一了视频、文本、音乐和VR接口。当与VLA模型配对时,系统能够执行复杂任务,如协调的手部和脚部放置,表明扩展后的动作跟踪为自主人形控制提供了多功能的全身先验。
GR00T N1.5 VLA模型在预测通用运动token时,在五个全身移动操作任务上取得了平均75%的成功率。成功率差异很大,从苏打水罐丢弃的60%到拾取洗涤器的95%,较简单的3点接口任务达到90%。该模型成功地将脚用作操纵器,以70%的成功率通过踩踏板打开垃圾桶。在相同的多物体策略和3,900条训练轨迹下,物体拾取成功率差异显著:洗涤器为95%,而胡萝卜为75%,这表明物体特定因素强烈影响性能。打开垃圾桶任务需要精确的脚部放置和单腿平衡以踩下踏板,达到70%的成功率,这证明了VLA将脚作为操纵器进行协调的能力。
训练集包含611小时的动作,涵盖33个主类别中的8,447个独特子类别。Test-content评估了对训练中完全不存在的182个子类别的泛化能力,而Test-repetition评估了对已知动作类型新表现的鲁棒性,其所有1,088个子类别与训练集共享,但没有重叠的片段。训练数据包含8,447个子类别,远超Test-content中的182个新子类别和Test-repetition中的1,088个已知子类别。Test-content与训练集的子类别零重叠,隔离了对未见动作类型的泛化能力。Test-repetition与训练集的子类别100%共享,但使用完全不相交的片段,测试了对新拍摄和演员表演的鲁棒性。
使用FSQ token作为动作空间,与显式SMPL姿态相比,任务完成成功率显著提高,平均提高了42个百分点。这种优势在复杂、长时间跨度的任务上最为明显,在这些任务中SMPL姿态完全失败。紧凑的离散token表示更容易让VLA从演示中学习,避免了高维连续姿态中出现的误差放大。FSQ token相对于SMPL姿态的成功率优势随着任务复杂性的增加而增长,从胡萝卜拾取的+15个百分点到苏打水罐到垃圾桶的+60个百分点。FSQ token提供了一个紧凑的离散动作空间,避免了高维SMPL姿态空间中因小预测误差导致的较大跟踪失败。
FSQ在运动跟踪方面始终优于VQ-VAE,并且增加token维度带来的改进比增加量化级别更大。所有三种编码器类型的成功率均超过99.2%,人类编码器的跟踪误差仅比机器人编码器高0.6毫米,证明了有效的跨编码器对齐。在分布外测试内容上,FSQ相比VQ-VAE将MPJPE-L降低了8.7毫米。Token维度对性能的影响大于量化级别;FSQ-16-32(16个级别,32维)达到29.7毫米MPJPE-L,远低于FSQ-16-16(35.7毫米)。所有编码器的成功率均保持在99.2%以上,人类编码器的MPJPE-L仅比机器人编码器高0.6毫米。
对GR00T N1.5 VLA模型在全身移动操作任务上进行了评估,结果表明,使用FSQ token作为动作空间比显式SMPL姿态平均提高了42个百分点的成功率,这种优势在需要脚部协调的复杂、长时间跨度任务上最为明显。动作tokenizer的比较揭示,FSQ优于VQ-VAE,增加token维度比增加量化级别更重要,并且人类和机器人编码器之间的跨编码器对齐保持强大。泛化测试突出了驱动成功率变化的物体特定因素,并且该模型成功地将脚用作操纵器,用于诸如打开踏板操作的垃圾桶等任务。