HyperAIHyperAI

Command Palette

Search for a command to run...

动态相机姿态及其获取方法

Chris Rockwell Ming-Yu Liu Joseph Tung David F. Fouhey Tsung-Yi Lin Chen-Hsuan Lin

DynPose-100K 动态相机姿态数据集

前往数据集

摘要

在大规模动态互联网视频上标注相机姿态,对于推进逼真视频生成和模拟等领域至关重要。然而,收集此类数据集颇为困难,因为大多数互联网视频不适合进行姿态估计。此外,即使对于最先进的方法而言,标注动态互联网视频也面临重大挑战。本文介绍了 DynPose-100K,这是一个大规模动态互联网视频数据集,带有相机姿态标注。我们的收集流程通过精心组合任务特定模型和通用模型来解决过滤问题。对于姿态估计,我们结合了点跟踪、动态掩蔽和运动恢复结构的最新技朮,相较于现有最先进方法取得了改进。我们的分析和实验表明,DynPose-100K 在多个关键属性上具有大规模性和多样性,为各种下游应用的进步开辟了途径。

一句话总结

NVIDIA、密歇根大学和纽约大学推出了 \text{DynPose-100\text{K}},这是一个包含动态互联网视频的大规模数据集,带有相机位姿标注。该数据集通过结合任务特定模型与通用模型的过滤流水线构建,并采用整合点跟踪、动态掩膜和运动恢复结构的位姿估计方法,在性能上超越现有最先进方法,并支持真实感视频生成和模拟等下游应用。

核心贡献

  • 提出了 DynPose-100K,一个包含 100,000 段动态互联网视频并带有相机位姿标注的大规模数据集,数据来源于 Panda-70M 并公开发布,规模远超同期的 CamCo(12K)和 B-Timer(40K)等数据集。
  • 提出了一种视频过滤流水线,将任务特定的专家模型与视觉语言模型相结合,在视频筛选精度上大幅优于其他替代方案。
  • 提出了一种动态相机位姿估计流水线,整合了 BootsTAP 长期点跟踪、动态掩膜和 Theia-SfM,将位姿误差最多降低 90%,并支持 DUSt3R 的微调,其效果优于使用 MonST3R 合成数据的训练结果。

引言

作者提出了 DynPose-100K,一个包含动态互联网视频并带有相机位姿标注的大规模数据集,旨在推动计算机视觉和机器人领域的应用,如相机控制的生成模型、扩展现实的视角合成以及真实感模拟环境中的模仿学习。此前的数据集分为两类且均受限于特定条件:一类是小规模合成数据集(通常少于 500 段视频),存在仿真到现实的差距且资产成本高昂;另一类是真实世界采集数据,但依赖于受限领域,如第一人称视角、自动驾驶或转盘式拍摄,这些场景通常具备稠密视角、LiDAR 或多相机设置,从而简化了运动恢复结构(SfM)。这些方法限制了数据的多样性,难以适用于不受约束的互联网视频,因为其中的运动物体、后期处理和外观变化会使标准 SfM 变得不可靠。

作者的主要贡献在于提出了一套完整的流水线来克服这些挑战。过滤阶段结合了专门的专家模型来排除不合适的视频(如卡通、重度后期处理、缺少参考帧等),同时使用通用视觉语言模型来捕捉更广泛的问题。将该流水线应用于 Panda-70M 中的 320 万段视频,最终筛选出 100K 段高质量候选视频。在位姿估计方面,作者融合了最先进的运动掩膜、长期对应点跟踪以及带鲁棒全局光束法平差的 SfM,取代了此前方法中较弱的基于光流的对应关系和更简单的掩膜策略。实验表明,该过滤流水线在视频筛选精度上大幅优于其他方案,且位姿估计在各种指标和设置下将误差降低了最多 90%。

数据集

作者提出了 DynPose-100K,这是一个包含动态互联网内容并带有相机位姿标注的大规模视频数据集。该数据集通过对 Panda-70M 数据集中的视频进行过滤和处理而构建。

组成与来源

  • 该数据集从 Panda-70M 数据集的 320 万段视频中筛选而来。
  • 过滤过程从 320 万段视频开始,经过系统化的筛选,最终保留 100,000 段动态视频。
  • 视频的选择基于三个标准:
    • 真实世界质量的视频,无后期处理或非透视失真。
    • 位姿预测的可行性,排除严重变焦、镜头切换或背景过度模糊的视频。
    • 动态相机和动态场景内容,要求相机运动且场景中的主体非静止。

过滤流水线与规模

  • 作者将初始的 320 万段视频依次经过多个阶段的过滤以提高效率:
    • 轻量级过滤器(Hands23、光流、焦距)将视频集缩减至 163 万段。
    • 失真过滤器将数量缩减至 153 万段。
    • 点跟踪将视频集缩减至 679,000 段。
    • 动态物体掩膜留下 462,000 段视频。
    • 视觉语言模型(GPT-4o mini)应用最终严格过滤,留下 137,000 段视频。
  • 对这 137,000 段视频执行位姿估计。作者仅保留至少 80% 帧成功配准的视频,最终得到 100,000 段视频。
  • 该过滤流水线实现了高精度和高召回率。在包含 1,000 段视频的留出测试集(Panda-Test)上,该流水线在数据集收集所用阈值下的精度达到 0.78。

位姿估计与处理细节

  • 动态掩膜通过多个模型的组合来实现:
    • OneFormer 用于常见动态类别的语义分割。
    • Hands23 用于分割手与物体的交互区域。
    • RoDynRF 中的运动分割用于处理常见类别之外的动态物体。
    • SAM2 用于掩膜传播,确保各帧之间的掩膜平滑。
  • 对应点关系使用 BootsTAP 点跟踪方法估计,以滑动窗口方式在点网格上进行。
  • 使用全局光束法平差(Theia-SfM)估计最终的相机位姿,从轨迹中提取对应关系,同时排除点落入动态掩膜范围内的配对。

数据集统计

  • DynPose-100K 包含 100,000 段视频,远超现有的动态相机位姿数据集,后者通常局限于厨房或驾驶等特定场景。
  • 标题分析表明,这些视频涵盖了广泛的名词和动词,内容具有高度多样性。
  • 大多数视频时长在 4 到 10 秒之间,足以提供充分的相机运动。
  • 动态物体的表观尺寸从小到大的范围均有覆盖。动态物体几乎占据整个画面的视频已被排除,因为此时位姿估计不可行。

方法

作者利用最先进的方法来解决动态互联网视频上位姿估计所面临的挑战,例如动态物体的遮挡以及静态场景中的外观变化。整体架构请参考框架图。

该系统通过两个并行分支处理输入视频:点跟踪和动态掩膜。

在点跟踪分支中,系统使用滑动窗口方式估计稠密对应关系。具体来说,该方法利用 BootsTAP 在若干帧上向前跟踪一个点网格。这种滑动窗口策略可确保即使之前的窗口存在遮挡或漂移,每一帧仍能维持足够的对应关系。通过长时间跟踪点,该方法生成了长期对应关系,有助于闭环检测并减少漂移。

与此同时,动态掩膜分支识别并分割包含运动物体的区域,以防止其干扰位姿估计。该掩膜过程由四个互补的组件组成。第一,使用 OneFormer 的语义分割识别常见动态类别,如行人和车辆。第二,使用 Hands23 的物体交互分割对持有的物体进行掩膜。第三,使用 RoDynRF 的运动分割处理语义类别未覆盖的动态区域(如沙沙作响的树叶),通过光流移除具有高 Sampson 误差的区域。最后,使用 SAM2 的掩膜传播确保各帧之间的掩膜平滑且边界精确。

这两条支路在最终阶段汇聚:全局光束法平差。系统从点轨迹中提取对应关系,并明确排除轨迹落在动态掩膜范围内的所有帧对。这些静态对应关系随后输入 Theia-SfM 进行全局光束法平差。该步骤有效应对了互联网视频带来的挑战,从而获得准确的相机位姿。

实验

实验分别验证了视频过滤流水线以及由此生成的 DynPose-100K 数据集在相机位姿估计中的有效性。在 Panda-Test 上,该过滤方法实现了高精度和高召回率,全面优于所有基线,且每个组件均有所贡献,其中 VLM 带来的提升最大。在具有真实位姿标注的逼真 Lightspeed 基准上,该方法将轨迹误差相较最优替代方案降低了 50%;在带有对应点标注的真实动态互联网视频上,在所有方法均成功的序列中,平均误差降低了超过 35%。静态和基于学习的基线方法难以配准动态场景,而所提出的流水线能够稳定处理大范围动态和多样化的外观变化。

DynPose-100K 包含的视频数量远超现有各类数据集,但每段视频较短,因此总帧数较少。该数据集强调高动态性和内容多样性,而许多替代数据集仅限于特定场景或属于私有数据。DynPose-100K 在多样性数据集中拥有最高的视频数量,而现有替代数据集通常局限于厨房、驾驶或行走等狭窄领域。DynPose-100K 中的短视频时长(4 到 10 秒)提供了丰富的动态内容和充分的相机运动,尽管每段视频的总帧数较少。最大的可比数据集要么是私有的,要么局限于统一的采集设置,与 DynPose-100K 多样的互联网视频来源不同。

所提出的位姿估计方法能够稳定配准所有测试序列,与现有的静态和动态方法相比大幅降低了轨迹误差,在所有方法均成功的序列上提升最为显著。静态方法往往无法配准或产生不准确的轨迹,而其他动态方法在部分片段上表现出更高的误差或不稳定性。本文方法在所有视频上将轨迹误差降低了 50%,在所有方法均收敛的序列上降低了 90%。COLMAP 和 DUSt3R 等静态方法无法配准许多具有挑战性的序列,或产生较高的轨迹误差和旋转误差。MonST3R 和 LEAP-VO 等动态替代方法较静态基线有所改进,但产生的轨迹仍不如所提出的方法精确。

使用 DynPose-100K 对 DUSt3R 进行微调,在动态互联网视频上获得的平均重投影误差低于使用 MonST3R 合成数据训练的模型,同时在大多数误差阈值下保持相当或更好的精度。这一改进是在训练帧数大幅减少的情况下实现的,证明了真实世界动态视频监督的高效性。DynPose-100K 微调将平均误差降至 8.78,而 MonST3R 合成数据训练为 9.86,并且将误差在 10 像素和 30 像素阈值内的视频比例进一步提高。训练仅使用了 140K 帧,相比 MonST3R 的 1.3M 帧大幅减少,却取得了相当或更好的配准精度,表明监督效率极高。

实验验证了 DynPose-100K 是一个内容多样、高动态性的视频数据集,尽管片段较短,但视频数量多于现有替代方案,同时证明了其在训练中的有效性。所提出的位姿估计方法能够稳定配准所有测试序列,将整体轨迹误差降低约一半,在所有方法均收敛的序列上降低 90%,优于静态和其他动态基线。在 DynPose-100K 上微调 DUSt3R 所获得的重投影误差和配准精度均优于在 MonST3R 合成数据上训练的结果,即使训练帧数大幅减少,这凸显了真实世界动态监督的高效性。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供