Command Palette
Search for a command to run...
RoboTok:面向互联网规模的人类演示检索与灵巧操作学习数据引擎
RoboTok:面向互联网规模的人类演示检索与灵巧操作学习数据引擎
Howard Qian Yiting Chen Yunfei Xie Kejia Ren Podshara Chanrungmaneekul Gaotian Wang Bowen Wen Chen Wei Kaiyu Hang
摘要
机器人学习越来越依赖广泛且多样化的演示数据,但采集机器人数据成本高昂,且难以覆盖现实世界中长尾任务的分布。为解决这一瓶颈,我们提出了 RoboTok,一个互联网规模的数据引擎,其能够根据给定的查询人类操作视频,从网络视频中检索与操作相关的人类演示,用于训练灵巧的机器人策略。具体而言,我们从以估计的动作者为中心参考系表达的三维手部轨迹中学习一个潜在运动空间。该表示使得操作行为能够在相机视角、场景外观和动作者遮挡等变化下进行比较,同时保持足够紧凑,以便在互联网规模的视频集合上进行高效搜索和持续索引。我们在检索基准和下游机器人策略性能上将 RoboTok 与现有的机器人数据检索方法进行了评估。结果表明,RoboTok 能够检索到更相关的操作演示,并提升了下游任务的成功率,从而确立了基于手部姿态轨迹感知的检索方法,使网络视频成为机器人学习可扩展且持续增长的监督来源。
一句话总结
来自莱斯大学和 NVIDIA 的研究人员提出了 RoboTok,一个互联网规模的数据引擎,它通过学习以演示者为中心的参考系中的 3D 手部轨迹的潜在运动空间,从网络视频中检索与操作相关的人类演示,从而实现高效的跨视频比较,并比现有检索方法更好地提升灵巧机器人策略学习。
核心贡献
- RoboTok 通过将行为表示为估计的以演示者为中心的参考系中的规范化 3D 手部轨迹,从网络视频中检索与操作相关的人类演示,将检索重点放在底层运动上,而非场景外观或标签。
- 一个学习到的运动嵌入空间,由时空轨迹对齐度量监督,能够高效地比较不同视角、场景和遮挡下的操作行为,同时支持对互联网规模视频集合的持续索引。
- 在检索基准和下游机器人策略学习上的评估表明,RoboTok 比现有方法检索到更相关的演示,并提高了任务成功率。这确立了手部姿态轨迹感知检索作为一种方法,可将网络视频转化为灵巧操作的可扩展、持续增长的监督来源。
引言
作者们应对扩展机器人操作数据的挑战,通过利用互联网视频,这是人形机器人可以物理再现的人类演示的丰富来源。之前的检索方法局限于固定的机器人数据集,或依赖于视觉外观、语义或相机相对运动,这些方法无法在不同视角和场景下稳健地比较操作行为。主要贡献是 RoboTok,一个数据引擎,它通过将 3D 手部轨迹表示在估计的以躯干为中心的参考系中,并学习一个由时空对齐度量监督的嵌入空间,从网络视频中检索与操作相关的片段,从而实现高效、行为感知的搜索,无需任务标签或场景匹配。
数据集
作者们从大规模 Action100M 互联网视频语料库构建 RoboTok 训练数据集,该语料库已预先过滤出人类动作。最终数据集由自中心 3D 手部姿态轨迹组成,并配有通过动态时间规整(DTW)推导出的运动相似性目标。关键细节如下:
-
来源与过滤
- 片段取自 Action100M,并进一步过滤,保留长度为 4-8 秒、相机近乎静止且最多包含一只左手和一只右手的片段。
- 贪婪地移除重叠片段,优先保留较长的片段以最大化可用内容。
-
手部姿态提取与度量定位
- 使用 WiLoR 以 5 fps 估计 3D 手部关键点,并在帧间稳定手性。
- 使用 MoGe‑2 恢复度量深度,将弱透视手部姿态转换为度量相机坐标系坐标。
- 使用 HaWoR 填补缺失姿态,生成相机坐标系下可变长度的度量 3D 手部姿态序列。
-
自中心规范化
- 一个轻量级的躯干坐标系估计器,仅使用手腕轨迹训练(无需身体可见),将相机坐标系姿态转换为静态的、以演示者为中心的自中心坐标系。
- 这种规范化使得轨迹在不同视角和遮挡下具有可比性。
-
监督信号
- 在自中心轨迹上计算成对 DTW 距离,作为伪真实运动相似性。
- 这些由 DTW 导出的相似性被用作训练 RoboTok 检索编码器的离线监督预言,避免了人工动作标签或语义标注。
处理后的数据集直接用于训练检索模型;论文未报告明确的训练/验证划分大小或混合比例,而是重点介绍将原始互联网片段转化为运动可比较轨迹和相似性标签的流程。
方法
作者将人类演示片段的检索形式化为寻找与查询片段操作行为最相似的片段子集。他们不依赖视觉外观,而是根据手部随时间移动的方式定义相似性。为了比较操作行为,每个片段被表示为规范化的 3D 手部轨迹,并使用动态时间规整(DTW)度量相似性。DTW 对齐两个手部姿态序列,同时适应执行速度的局部差异。形式上,对于 21 个关节的手部姿态轨迹 xi 和 xj,DTW 找到有效的对齐路径 π,使累积姿态距离最小化:
DTW(xi,xj)=π∈Πmin(t,u)∈π∑d(xit,xju)其中 d(xit,xju)=∥xit−xju∥2 是两个手部姿态之间的欧几里得距离。轨迹相似性定义为长度归一化的负对齐代价:
s(i,j)=−21(Li+Lj)DTW(xi,xj)由于在互联网规模的数据集中对查询与每条轨迹计算 DTW 是不切实际的,作者使用 DTW 作为监督信号来学习一个嵌入 Γ:X→Sd−1。该嵌入的训练目标是使嵌入空间中的内积相似性保持 DTW 诱导的排序。
为了准备训练数据,作者处理了来自大规模互联网视频语料库的片段。如下图所示:
该流程首先过滤候选片段,保留手部可见且相机近乎静止的片段。对于每个保留的片段,估计 3D 手部关键点并在帧间稳定。使用度量深度将手部姿态转换为度量相机坐标。为了使轨迹在不同相机配置和任意遮挡下具有可比性,作者将手部姿态转换到自中心坐标系。他们训练了一个轻量级的人体躯干坐标系估计器,仅以手部轨迹的手腕帧作为输入,预测演示者的静态躯干坐标系。经过这种规范化后,使用 DTW 计算轨迹对之间的伪真实运动相似性,作为离线监督预言。
RoboTok 检索模型旨在学习一个嵌入空间,该空间近似这种由 DTW 定义的操作相似性,同时支持大规模的高效最近邻检索。参考框架图:
编码器是一个轻量级的轨迹编码器,直接对自中心 3D 手部表示进行操作。每一帧经过位置编码,并由一个轻量级的交叉注意力网络池化为一个 l2 归一化的 d 维嵌入,以便进行高效的余弦相似度检索。
为了在大规模下有效训练模型,作者从以锚点为中心的组构建批次,而非随机采样。对于一个锚点 a,其相关集定义为 DTW 预言下的前 K=20 个邻居。对于每个锚点,从该相关集中采样两条轨迹作为正例,并从相关集之外紧邻的位置采样一条轨迹作为边界负例。每个批次包含 49 个这样的组。这种采样策略在相关性阈值附近提供了有信息量的监督,同时避免了过于不相似的随机负例。
训练目标结合了集合损失和排序损失:L=Lset+λLrank。集合损失鼓励预言的前 K 个邻居得分高于边界和负轨迹,决定哪些轨迹进入检索邻域。排序损失鼓励采样的正例的相对顺序与 DTW 诱导的排序相匹配,优化检索时最相关的排序部分。
在推理时,检索分两个阶段进行。每条自中心轨迹被编码一次,并离线存储在内积索引中。给定一个查询片段,通过在线余弦相似度搜索直接从该索引中检索最近邻,而无需对整个语料库计算 DTW。这将昂贵的轨迹比较转移到训练阶段,同时使检索能够随语料库大小高效扩展。新收集的片段可以被嵌入并直接添加到索引中,无需重新训练模型。
实验
RoboTok 的检索质量在域内和跨数据集语料库上使用基于 DTW 的伪真实值进行评估,与基线方法对比,RoboTok 始终检索到运动对齐的片段,对齐代价接近预言且排序强,而基线方法表现接近随机。在灵巧操作基准上的下游策略实验表明,RoboTok 检索到的演示显著提高了策略成功率,优于基线方法,无论是在标准任务设定还是更具挑战性的全 3D 控制和稀疏奖励的任务设定下。这些发现表明,高质量的运动驱动检索直接转化为更好的策略学习,即使没有动作标签或机器人演示。
RoboTok 使用以演示者为中心的参考系中的规范化 3D 手部轨迹从互联网人类视频中检索演示,而其他方法依赖于机器人数据或更简单的表示,并针对平行夹爪。在灵巧操作任务中,由 RoboTok 检索引导的策略始终优于使用其他检索方法的策略,当手部运动不受限制且移除密集奖励时,优势变得更加显著。方法的学习速度排序也相同,表明 RoboTok 以运动为中心的检索为下游策略学习提供了更有效的指导。RoboTok 是唯一查询互联网人类视频、使用以演示者为中心的参考系中的显式 3D 手部姿态,并针对灵巧手的方法。在更困难的灵巧操作任务上,RoboTok 引导的策略成功率比次优检索方法高出 17.8 到 59.8 个百分点。检索方法的性能排序在不同任务中保持一致,并且也反映了使用 RoboTok 演示时更快的策略学习。
RoboTok 在 RoboTok 评估语料库上大幅优于所有基线检索方法,实现了对真实 DTW 邻居近乎完美的召回,平均 DTW 代价仅比预言高出 16%。最强的基线 STRAP 仅勉强超过随机表现,而其他方法与随机无异。高排序相关性证实 RoboTok 不仅找到了正确的邻居,还正确地对其排序。RoboTok 实现了近乎完美的召回,在前 20 个中几乎恢复了每个真实邻居,而最佳基线 STRAP 仅恢复了一小部分。RoboTok 检索的平均 DTW 代价接近预言代价,而随机片段的代价高出四倍以上。基线方法 Flow 和 HAND 在所有指标上的表现与随机检索相似,STRAP 仅略好。RoboTok 的肯德尔 τ 系数表明强大的邻居排序,与基线近乎为零的排序形成鲜明对比。
在 AssemblyHands 语料库上,RoboTok 在所有检索指标上均超越所有基线,平均精度均值(mAP@5)达到 0.261,而次优方法 STRAP 为 0.133。其检索片段的 DTW 代价仅比真实最优值高出 13%,而随机检索的代价几乎是最优值的两倍。方法的相对排序与在域内 RoboTok 语料库上观察到的排序一致,证实了跨数据集迁移。RoboTok 的 mAP@5 几乎是 STRAP 的两倍(0.261 vs. 0.133)。RoboTok 检索片段的 DTW 代价仅比真实最优值高出 13%,而随机检索的代价几乎是其两倍。
在原始的 VTDexManip 基准上,由 RoboTok 检索引导的策略在大多数任务上始终优于所有其他基于检索的方法和最佳预训练基线。RoboTok 在瓶盖旋转、水龙头拧动和杠杆滑动任务上,对已见和未见物体均取得了最高的成功率,尤其是在困难的杠杆滑动任务上,原始 PPO 几乎失败,而 RoboTok 的提升尤为显著。仅在桌面重定向任务上,它略逊于预训练基线,但仍超越所有其他检索引导方法。RoboTok 引导的策略在所有六个任务上,已见物体的成功率平均比最佳预训练基线(VT-JointPretrain)高出 7.45%,未见物体高出 5.83%。在杠杆滑动任务上,RoboTok 将已见物体的成功率从 5.8%(基础 PPO)提升至 95.5%,未见物体从 2.2% 提升至 92.0%,远超其他所有方法。随机检索引导已比原始 PPO 有所提升,但 RoboTok 带来了显著的额外增益,证明了高质量检索的价值。原始基准设定已饱和:最佳预训练基线在多个任务上达到 80% 以上,而 RoboTok 将大多数任务的成功率推向接近上限。
在具有全 3D 手部控制且移除密集奖励的更困难灵巧操作任务上,由 RoboTok 检索演示引导的策略显著优于使用其他检索方法的策略。RoboTok 在所有三个任务上均取得了最高成功率,在已见物体上比次优方法高出 17.8 到 59.8 个百分点。基础 PPO 和随机检索无法学习,而 HAND 是最强的基线,但仍远落后于 RoboTok。RoboTok 在瓶盖旋转(已见)上达到 77.3% 的成功率,水龙头拧动为 44.8%,杠杆滑动为 79.3%,优于所有基线。在已见物体上,相对于次优方法(HAND)的提升幅度为 17.8 到 59.8 个百分点。基础 PPO 和随机检索的成功率几乎为零,表明演示引导对于这些更困难的任务至关重要。HAND 是最具竞争力的基线,但 RoboTok 在水龙头拧动和杠杆滑动上的成功率是其两倍以上。在未见物体上,RoboTok 保持明显领先,尽管绝对成功率相比已见物体有所下降。
RoboTok 通过在以演示者为中心的参考系中使用规范化的 3D 轨迹表示手部运动,从互联网人类视频中检索演示,而其他方法依赖于机器人数据或更简单的表示,并针对平行夹爪。在检索基准和跨数据集评估中,RoboTok 始终以低轨迹代价恢复近乎完美的真实邻居,而基线表现接近随机。当用于引导灵巧策略学习时,RoboTok 检索的演示比所有其他检索方法带来显著更高的成功率和更快的学习速度,在移除密集奖励且需要全 3D 手部控制的更困难任务上,优势尤为显著。这些结果表明,从互联网人类视频中获取的高质量以运动为中心的检索为复杂的灵巧操作提供了有效的指导。