Command Palette
Search for a command to run...
HOMIE:通过多模态智能增强实现以人物-物体为中心的视频个性化
HOMIE:通过多模态智能增强实现以人物-物体为中心的视频个性化
摘要
以人物-物体为中心的视频个性化(HOCVP)是主体驱动视频生成中的一项核心任务。然而,现有方法存在两个关键局限。第一,大多数关注主体间个性化的方法仍难以在高主体保真度与准确的人物-多样化物体交互模式之间取得平衡,尤其当物体代表抽象概念(如标志)时。第二,虽然主体内参考信息(例如 OCR 地图、多视角输入)有望增强主体保真度,但大多数现有工作缺乏理解此类潜在对应关系的机制。为解决这两个挑战,我们提出了 HOMIE,一个以统一方式处理主体间和主体内输入设置的 HOCVP 框架。与先前方法相比,HOMIE 提出了一种更优的多模态大语言模型(MLLM)集成策略,以提取参考级关系知识,同时不损害文本编码器的可控性,也无需进行代价高昂的重新对齐。具体而言,我们在自注意力机制中引入全局多模态引导,以更好地将 MLLM 衍生的语义特征与 VAE 令牌对齐。此外,我们提出了模态-参考嵌入,以区分来自 MLLM 特征和 VAE 令牌的令牌,并关联主体内参考图像令牌。大量实验验证了我们的方法在多种 HOCVP 任务中均达到了最先进的性能。
一句话总结
香港科技大学的研究者提出 HOMIE,一个人 - 物中心化视频个性化框架,通过整合多模态大语言模型提取参考级关系,在自注意力中应用全局多模态引导将 MLLM 产生的语义特征与 VAE token 对齐,并使用模态 - 参考嵌入区分 MLLM 和 VAE token 的类型并关联主体内参考图像 token,在各类 HOCVP 任务上实现领先性能,统一了主体间和主体内的设定。
核心贡献
- 论文引入 HOMIE,一个统一框架,能同时处理主体间和主体内的人 - 物中心化视频个性化,通过整合 MLLM 知识而不牺牲文本编码器的可控性。
- 一种全局多模态引导机制通过自注意力将 MLLM 产生的语义特征注入视频 token,改善与 VAE token 的对齐,使人类与多样化物体之间的交互建模更精确。
- 模态 - 参考嵌入按输入模态区分 token,同时捕捉主体内参考图像间的关联,增强主体内设定下的身份保真度。实验表明 HOMIE 在各类 HOCVP 任务上达到最先进水平,包括 logo 个性化与多视角视频生成。
引言
人 - 物中心化视频个性化(HOCVP)旨在从参考图像合成多个主体交互的视频,可应用于个性化广告与数字内容创作等。现有方法在处理主体间场景(不同实体)时,随着主体数量的增多变得困难:它们产生复制 - 粘贴伪影,无法准确放置抽象参考物(如 logo),缺乏推断隐含关系的推理能力。在主体内设定(同一实体的多张参考图,如多视角图像)中,它们要么遗漏语义对应关系,要么依赖昂贵的 3D 监督,导致冗余且保真度提升有限。先前尝试整合多模态大语言模型(MLLM)的做法要么将 MLLM 特征对齐到约束的文本嵌入空间,压制了视觉推理能力,要么完全替代文本编码器,迫使 MLLM 承担全部文本到视频的控制负担,从而稀释了它对参考关联的专注。
为克服这些局限,作者提出 HOMIE,一个统一的 HOCVP 框架,它保留标准文本编码器,让 MLLM 专注于提取主体间和主体内关系。HOMIE 引入全局多模态引导,在自注意力过程中用 MLLM 产生的时间交互上下文丰富视频 token,以及模态 - 参考嵌入,它们按模态区分 token,同时联合捕捉主体内关联。这一设计在各种场景中提升了提示遵循、主体一致性和身份保真度,包括 logo 个性化与多视角视频生成。
数据集
作者从两个开源的主体驱动视频数据集 OpenS2V-5M 和 PhantomData 出发,通过多步过滤与策展流程构建训练数据。最终数据集的构建和使用如下:
-
来源与初步过滤 根据通用美学分数清理 OpenS2V-5M 和 PhantomData 中的低质量片段。然后利用原始标注(类别标签和主体区域比例)过滤掉主要关注背景或极小物体的片段,仅保留与人 - 物构图相关的视频。
-
子集组成 清洗后的数据被分为两个视频一致性子集:
- 单主体: 300,000 个只包含人 或 物的样本。
- 多主体: 80,000 个同时包含人 和 物的样本。
-
自策展高质量补充 作者额外策展了 20,000 个高质量的包含人 - 物交互的视频片段。这些片段附有人和物体精确的分割掩码,并被加入多主体子集,将其扩充至 100,000 样本。从扩充后的多主体池中,约 40,000 个高分辨率(720P)片段被选出。
-
主体内参考的特殊处理 在自策展部分,同一物体在不同帧之间被一致地裁剪。这提供了主体内参考对,用于训练以增强模型维持主体外观的能力(即 MRE 训练)。
-
数据使用方式 单主体和多主体子集作为人 - 物构图视频生成模型的主要训练数据。自策展子集凭借其分割掩码和帧间一致的物体裁剪,提供了学习细粒度主体身份和构图所需的监督,尤其是通过主体内参考机制。最终混合子集的训练批次比例未具体说明,但 300K 单主体、100K 多主体(含 40K 高分辨率)以及主体内参考数据均贡献于整体训练流程。
方法
作者在 DiT 架构的文本到视频模型上构建 HOMIE,将其作为骨干网络。该框架整合一个 3D 变分自编码器(3D VAE)将原始视频压缩到紧凑潜空间。文本编码器处理文本提示,并通过交叉注意力机制注入 DiT 骨干,建立文本 - 视频语义对齐。训练采用流匹配范式,学习连续速度场,沿确定性轨迹将样本从简单先验分布变换到目标数据分布。训练目标定义为:
LFM(θ)=Et,z0,z1∥vθ(zt,t,c)−(z1−z0)∥22其中 z0 表示从先验分布抽取的样本,z1 是目标视频样本的潜变量,c 表示条件集。DiT 模型 vθ 接收噪声潜变量 zt=(1−t)z0+tz1,学习预测其在任意点 t 的速度。为实现高保真且可控的人 - 物复杂视频生成,条件集被扩展为 c={ctxt,cimg} 以纳入多模态数据输入。
如下图所示:
HOMIE 接收文本提示 P 和一组参考图像 I={Inm} 作为输入,上标 m 表示主体身份,下标 n 索引图像实例。输入图像通过预训练的 3D VAE 映射到潜空间。为捕捉视觉主体与文本指令间的复杂语义对齐,多模态大语言模型(MLLM)ΦM 同时处理图像和提示,提取多模态特征 FM。一个轻量对齐网络 ϕ 将该条件特征与 3D-VAE token 空间对齐:
FM=ϕ(ΦM(Psys,P,I))其中 Psys 表示系统提示。多模态特征 FM 与目标视频的潜 token Fv 和参考图像 token Fr 拼接,形成统一输入 F=[Fv⊕Fr⊕FM],允许来自不同模态的 token 进行内在交互。
为解决高语义 MLLM 特征与 3D VAE 特征之间的分布差距,作者引入全局多模态引导(GMG)。该机制在自注意力层内显式地将来自 FM 的语义信息注入 Fv 。将查询和键矩阵投影后,它们被分割为对应于视频 token、参考 token 和 MLLM 特征 token 的部分。对 MLLM 查询 QM 和键 KM 沿时间维度进行池化操作,得到全局表示:
Q~M=Pooling(QM,dim=1)∈Rb×1×h K~M=Pooling(KM,dim=1)∈Rb×1×h这些全局表示被馈入两个轻量投影网络 γ 和 β,以得出缩放和平移调制因子。将这些参数广播以匹配视频 token 的序列长度 lv 后,对 Qv 和 Kv 施加逐特征仿射变换:
Q~v=(1+γq(Q~M))×Qv+βq(Q~M) K~v=(1+γk(K~M))×Kv+βk(K~M)然后将分割后的查询和键部分重新拼接进行标准注意力计算,有效地将高层语义多模态引导融入视频 token。
为区分并对齐不同模态的表示,同时捕捉主体间和主体内参考之间的底层关联,作者提出模态 - 参考嵌入(MRE)。该可学习嵌入模块由模态嵌入(ME)和参考嵌入(RE)组成。在 token 投射到堆叠 DiT 块之前,可学习的模态嵌入根据 token 的源模态有选择地集成到每个 token:
Fˉ∗=F∗+ME[Proj(∗)]其中 ∗∈[v,r,M] 表示不同模态类型,Proj 将每种模态类型映射到不同的切片索引。随后,参考嵌入基于原始参考实体分配给来自参考输入的 token:
Fˉrm=Fˉrm+RE[m]其中 m 表示第 m 个唯一参考实体。具有相同标注 m 的参考被分配相同的参考嵌入以共享身份信息,而主体间参考则接收不同的嵌入以表示相异的身份。这有助于在不同模态间实现稳健解耦,并强化身份级一致性。
实验
HOMIE 在 200 个人 - 物组合及多个参考图像上与多种基线模型(包括闭源和开源)进行了评估,以评估视频质量、文本遵循能力和主体一致性。它在视频质量和文本对齐方面达到开源方法中的最先进水平,尤其擅长需要关系推理的复杂多主体生成和 logo 个性化。消融研究表明,GMG 模块对于整合 MLLM 知识以实现此类推理至关重要,而 MRE 模块可防止 OCR 图或多视角参考被误当作独立实体。用户研究进一步证实,HOMIE 在整体质量、文本遵循和主体一致性方面均获得一致偏好。
在比较的基线中,Kling 1.6 在美学和运动质量上领先,VACE 和 SkyReels-V3 在文本遵循和物体相似性上表现突出。HOMIE 在视频质量和文本遵循方面超越所有列举方法,OCR 准确率相对 SkyReels-V3 提升 21.8%。Kling 1.6 获得最高的 AES 和 MS 分数,表示基线中最佳的感知质量和流畅度。VACE 记录 DINO-I 和 OCR 准确率最高,SkyReels-V3 在物体相似性上领先,分别凸显其文本遵循和主体一致性能力。HOMIE 的 OCR 准确率比 SkyReels-V3 高 21.8%,验证了有效利用评估数据集 OCR 图来提升主体一致性。基线方法在视频质量和文本遵循维度上呈现权衡,而 HOMIE 在所有指标上统一表现出强性能。
在主体内多视角 HOCVP 基准上,HOMIE(Ours)在 DINO 重建和准确率两个指标上均设立了新的最先进分数。Wan2.2 变体达到最高重建分,Wan2.1 在准确率上领先,均大幅超过先前方法如 SkyReels-V3 和 VACE。这些定量提升反映了模型在生成多样化物体视角的同时保持强大主体一致性的能力。HOMIE 的 Wan2.2 变体获得最佳 DINO_rec(0.696),比 SkyReels-V3 的相对提升 6.4%,证明多视角重建显著改善。Wan2.1 变体获得所有模型中最高的 DINO_acc(0.582),表明生成视角中的优越主体身份保持。
完整模型超越所有变体,在面部相似性和 OCR 准确率上大幅优于省略多模态输入的简单基线。用将 MLLM 特征直接集成进 UmT5 嵌入替代 GMG 模块降低了总体质量分数,且无法为 logo 个性化提供推理能力;而去除模态 - 参考嵌入导致 OCR 准确率急剧下降,证实了其链接参考模态的作用。没有模态 - 参考嵌入时,OCR 准确率跌至 0.376,参考物体意外出现,说明 MRE 捕捉参考图像间的语义链接。直接馈送 MLLM 特征至 UmT5 嵌入产生最低的 GMEScore(0.675),且无法将 logo 与语义相关物体连接,凸显 GMG 对推理的重要性。
与强基线的评估表明,HOMIE 统一了顶级视频质量、文本遵循和主体一致性,避免了先前方法中观察到的权衡。多视角基准结果进一步展现了 HOMIE 重建多样化物体视角并忠实保持身份的能力,设定了新的最先进分数。消融实验确认,全局 - 局部几何推理模块和模态 - 参考嵌入对于语义上连接参考输入并实现精确个性化都必不可少。