HyperAIHyperAI

Command Palette

Search for a command to run...

4DAnyone:从日常单目视频中创建任意人物的 4D 模型

Yudong Jin Tao Xie Qihang Zhang Zehong Shen Zhen Xu Yujun Shen Hujun Bao Xiaowei Zhou Yinghao Xu

摘要

我们提出 4DAnyone,一个从未标定的单目视频中重建 4D 人体的框架,其核心是生成重建级多视角一致视频并将其提升至 4D 高斯泼溅(4DGS)。现有的相机控制视频扩散模型能合成合理的新视角视频,但当视角数量扩展到 4DGS 重建所需的数十个目标视角时,却无法保持一致性。我们将这一失败归结为有界注意力上下文问题:当目标视角超出单次 DiT 前向传播的容量时,必须将其分组,从而暴露出两个耦合的瓶颈。在参考上下文侧,以所有先前生成的视角为条件,其复杂度增长为 ?? (?? ),削弱了跨视角外观引导。在目标上下文侧,不相交的组无法直接交换信息,导致全局结构漂移。4DAnyone 通过两个互补设计解决这两个瓶颈:参考上下文打包(RCP)将不断增长的参考视图压缩为固定长度的混合分辨率上下文,实现 ?? (1) 的参考上下文复杂度;目标上下文路由(TCR)在去噪过程中轮转目标视图分组,在高噪声步长下跨组共享上下文,并在低噪声步长下稳定细节。我们进一步使用自研游戏引擎构建了 MVGameHuman 数据集,并将其与光场舞台和真实场景视频数据集结合用于训练。在 DNA-Rendering 和 DyMVHumans 上的实验表明,4DAnyone 在新视角视频质量和下游 4DGS 重建方面均优于先前方法,并具有鲁棒的真实场景泛化能力。视频结果和源代码请见项目主页:https://4danyone.github.io

一句话总结

4DAnyone 由浙江大学等机构的研究者提出,从未标定的单目视频中重建 4D 人体,通过生成多视角一致的视频并将其提升为 4D 高斯泼溅,其中 Reference Context Packing 将参考视图压缩为固定长度的上下文,Target Context Routing 在去噪过程中轮换目标视图分组以克服有界注意力上下文失效,在 DNA-Rendering 和 DyMVHumans 上优于先前方法。

核心贡献

  • 论文提出 4DAnyone,一种“先生成再重建”的框架,使用稀疏 3D 骨架作为显式几何条件,从未标定的单目视频合成重建级多视角一致视频,并将其提升为 4D 高斯泼溅以实现人体重建。
  • Reference Context Packing 将不断增长的参考视图压缩为固定长度的混合分辨率上下文,参考上下文复杂度为 O(1);Target Context Routing 在去噪过程中轮换目标视图分组,在高噪声步共享跨组上下文,在低噪声步稳定细节。
  • MVGameHuman 数据集使用自研游戏引擎构建,并与光场舞台和真实场景视频数据集结合用于训练。在 DNA-Rendering 和 DyMVHumans 上的实验表明,4DAnyone 在新视角视频质量和下游 4DGS 重建方面均优于先前方法,并具有鲁棒的真实场景泛化能力。

引言

重建可从任意视角渲染的 4D 人体对具身 AI、沉浸式内容创作和虚拟现实至关重要。最近的 4D 高斯泼溅方法实现了实时逼真的动态渲染,但仍需来自标定静态相机阵列的密集多视角视频。先前使用单目视频或相机控制视频扩散的尝试面临未知相机参数、遮挡身体区域、高保真外观,尤其是生成足够重建视角时的跨视角一致性问题。作者提出 4DAnyone,一种生成辅助框架,利用 3D 骨架条件、Reference Context Packing 将外观引导保持在恒定上下文大小,以及 Target Context Routing 在去噪过程中跨目标视图组共享全局结构,从而从未标定的单目视频生成重建级多视角视频。

方法

作者提出 4DAnyone 框架,从具有未知相机内参和姿态的单一源视频生成重建级多视角人体视频,随后使用这些生成视频训练高保真 4D 高斯泼溅模型。

如下图所示:

流程首先利用人体网格恢复模型从源视频估计 3D 骨架序列,并将其渲染为指定静态目标视角下的深度缓冲骨架视频。随后,3D 感知骨架编码器将这些几何线索注入噪声目标 latent。扩散 Transformer 在源视频、骨架信号和 Reference Context Packing 机制的条件下对 latent 进行去噪。为高效处理数十个视角的生成,Target Context Routing 在目标视图组之间交换上下文,在固定每组内存预算下减少结构漂移。

为提供可靠的几何引导,同时避免深度图等密集信号带来的噪声,作者优先考虑精度而非密度,使用 3D 骨架。为解决 2D 渲染中固有的姿态歧义(如前后遮挡),3D 骨架以逐像素 z 缓冲进行光栅化,无需额外输入通道即可生成遮挡感知渲染。关键点选择采用紧凑的 40 关键点子集,保留身体、脚部和手掌级手部关键点以及辅助颈部、肩部和肘部标记,排除面部和精细手指关键点以防止噪声检测引入伪影,让模型直接从源视频参考学习这些细节。骨架编码器 gϕg_\phigϕ 将骨架条件作为残差注入噪声 latent token:

z~it=zit+gϕ(Si)\tilde{\mathbf{z}}_i^t = \mathbf{z}_i^t + g_\phi(\mathbf{S}_i)z~it=zit+gϕ(Si)

其中 Si\mathbf{S}_iSi 表示目标视角 iii 的深度缓冲骨架视频,zit\mathbf{z}_i^tzit 表示时间步 ttt 的噪声 latent token。编码器的最终投影层进行零初始化,确保从预训练权重稳定训练。

生成高保真 4D 重建需要数十个目标视角视频,但联合去噪计算开销过大。将视角分组会引入外观条件和全局结构漂移方面的一致性瓶颈。作者通过 Reference Context Packing 和 Target Context Routing 解决这些问题。

如下图所示:

Reference Context Packing 提供可扩展的外观上下文。随着早期生成的视图作为后续轮次的参考,跨视图冗余增加。作者没有将每个生成的视图作为完整上下文附加,而是使用多尺度 patchify 层将不断增长的参考集打包为固定数量的 token 槽。使用压缩比 rrr 的 patchify 层 Pr\mathcal{P}_rPr,其核和步长为 (1,2r,2r)(1, 2r, 2r)(1,2r,2r),产生的 token 数量为标准层的 1r2\frac{1}{r^2}r21。打包的参考 token 沿空间维度组装,并沿视图维度与源和目标 token 拼接。固定上下文公式如下:

CR=[P1(Vsrc),{P2(Vaj)}j=13,{P4(Vbj)}j=14]C_{\mathrm{R}} = \big[ \mathcal{P}_1(\mathbf{V}_{\mathrm{src}}), \{\mathcal{P}_2(\mathbf{V}_{a_j})\}_{j=1}^3, \{\mathcal{P}_4(\mathbf{V}_{b_j})\}_{j=1}^4 \big]CR=[P1(Vsrc),{P2(Vaj)}j=13,{P4(Vbj)}j=14]

推理过程中,参考视图通过最远点采样分两轮生成,以最大化视角覆盖。第一轮仅基于源视频生成四个参考视频,第二轮基于源视频和第一轮子集生成另外四个视频。这些视频随后被打包为固定上下文,用于以四视图组生成所有剩余目标视图。

Target Context Routing 解决生成端瓶颈,即独立去噪的组可能发生结构漂移。作者观察到全局结构在高噪声水平时建立。因此,推理根据切换时间步 tst_sts 分为两个阶段。在高噪声阶段(t>tst > t_st>ts),有序视图索引按步长索引循环移位,并在每一步重新划分为四视图组,使视图能够交换上下文并传播全局结构。在低噪声阶段(ttst \leq t_stts),相邻四视图组固定,使相邻视图能够联合细化细节,稳定外观和跨视图过渡。

训练协议遵循三阶段课程。第一阶段在仅前景视频上训练,学习骨架条件相机控制。为解耦姿态和外观,源视图和目标视图片段以 20% 的概率从不同时间窗口采样。第二阶段将训练扩展到所有多视角数据集,不使用前景掩码,防止掩码边界边缘噪声,并让模型从背景中学习光照和阴影线索。第三阶段纳入单目数据集以改善真实场景泛化,期间从骨架输入中移除手指关键点,迫使模型从源视频推断手部细节。模型使用组合损失函数训练:

L=Llatent+λLLPIPS\mathcal{L} = \mathcal{L}_{\mathrm{latent}} + \lambda \mathcal{L}_{\mathrm{LPIPS}}L=Llatent+λLLPIPS

其中 Llatent\mathcal{L}_{\mathrm{latent}}Llatent 是 latent 空间中的标准 MSE flow-matching 损失,LLPIPS\mathcal{L}_{\mathrm{LPIPS}}LLPIPS 是在解码帧上计算的感知重建损失,λ=0.25\lambda = 0.25λ=0.25,以减轻高空间压缩带来的伪影。为减少 GPU 内存消耗,感知损失在身体部位感知语义裁剪上评估。

实验

在 DNA-Rendering 和 DyMVHumans 测试场景中,4DAnyone 通过从单一源视频生成 16 个目标视角进行评估,指标涵盖 4DGS 重建、生成视频一致性和重建质量。定性比较显示,该方法保持了几何精度和一致的跨视图外观,而基线模型存在侧面/背面失真、深度误差或相机未对齐问题。消融实验证实 Reference Context Packing 和 Target Context Routing 相互补充以改善多视角一致性,深度缓冲 3D 骨架条件解决了前后歧义;在真实场景视频上的进一步实验表明,对挑战性姿态、运动和复杂背景具有强泛化能力。

训练集结合了多视角和单目人体中心视频。多视角来源包括合成游戏引擎素材、不同背景片段和真实采集,其中 DNA-Rendering 在多视角来源中视频数量和相机数量领先。单目 TedTalk 和 Pexels 增加了单相机多样性,Pexels 贡献了最大的演员池用于真实场景泛化。多视角来源范围从合成游戏引擎采集到真实录制,DNA-Rendering 在多视角来源中提供最多的视频数量和最高的相机数量。单目来源增加了单相机视频和广泛的演员多样性;Pexels 在所列数据集中贡献了最多的演员数量和最高分辨率。

所提方法在 DNA-Rendering 和 DyMVHumans 的生成视频一致性、4DGS 重建和生成视频重建方面均取得最强结果。TrajectoryCrafter 表现最弱,尤其在 DNA-Rendering 上,归因于深度误差累积和前后变化。微调的 ReCamMaster 是视频一致性方面最接近的基线,但由于相机控制不精确,重建质量仍落后。所提方法在两个数据集的所有三个评估维度上均优于所有基线。TrajectoryCrafter 得分最低,并遭受严重几何失真和前后失效,尤其在 DNA-Rendering 上。微调的 ReCamMaster 实现了最佳基线一致性分数,但由于相机控制不准确,重建保真度仍落后。

该消融研究测量了移除 Reference Context Packing 和 Target Context Routing 的配置下生成视频的一致性。移除任一组件会降低 PSNR 和 SSIM 并提高 LPIPS,同时移除两者导致最大退化。在路由策略中,滑动分组是唯一在所有三个指标上均优于固定分组的策略。同时移除 Reference Context Packing 和 Target Context Routing 导致评估配置中最低的 PSNR 和 SSIM 以及最高的 LPIPS。在此设置中,Reference Context Packing 的贡献大于 Target Context Routing:单独移除 RCP 比单独移除 TCR 显示出更大的指标退化。滑动路由相对于固定分组改善了所有一致性指标,而随机路由未提供可测量的增益,跨步路由则使指标恶化。

评估使用结合多视角和单目人体中心视频的训练集,DNA-Rendering 提供最大的多视角覆盖,Pexels 贡献最广泛的演员多样性用于真实场景泛化。所提方法在 DNA-Rendering 和 DyMVHumans 的视频一致性、4DGS 重建和生成视频重建方面均优于所有基线,而 TrajectoryCrafter 受深度误差影响,微调的 ReCamMaster 受限于不精确的相机控制。消融结果证实,移除 Reference Context Packing 或 Target Context Routing 会降低一致性,其中 Reference Context Packing 贡献更大,滑动分组相对于固定分组改善了所有指标。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供