Command Palette
Search for a command to run...
超越文本条件:面向视频生成的 MLLM-DiT 融合系统研究
超越文本条件:面向视频生成的 MLLM-DiT 融合系统研究
摘要
扩散 Transformer(DiT)已成为高保真视频生成的主导范式,但其执行高层语义规划的能力仍然有限。虽然将多模态大语言模型(MLLM)与扩散骨干网络相结合的混合架构已在图像合成中展现出显著优势,但此类设计在视频生成中仍未被充分探索,现有方法往往主要将 MLLM 视为冻结的特征编码器,而非语义生成器。为填补这一空白,我们通过回答三个问题,系统研究了 MLLM 应如何与 DiT 集成以进行视频生成:何种中间表示应作为 MLLM 与 DiT 之间的桥梁,MLLM 应如何生成该表示,以及 DiT 在扩散渲染过程中应如何利用该表示。我们的分析揭示了三个关键发现:(1)由基于 EMA 的分词器产生的离散语义视觉 token 提供了稳定且富有表现力的接口;(2)自回归因果建模能够有效生成这些 token;(3)显式视觉 token 条件化比提示细化或潜在桥接更为有效。基于这些发现,我们提出了 BiVidGen,这是一个混合框架,其中 MLLM 首先生成语义视觉 token,DiT 再通过多层交叉注意力以文本和这些 token 为条件渲染视频。大量实验表明,与微调后的 DiT 基线相比,BiVidGen 在语义对齐和时间一致性方面均有提升,并在 VBench-Long 上取得了更强的性能。这些结果表明,基于 MLLM 的显式视觉规划为超越纯文本条件的文本到视频生成提供了一种有效的中间接口。
一句话总结
中国科学院、微软研究院等机构的研究者提出 BiVidGen,一种混合 MLLM-DiT 视频生成框架,其中 MLLM 基于 EMA tokenizer 自回归生成离散语义视觉 token,DiT 在文本和这些 token 的共同条件下通过多层交叉注意力渲染视频,在 VBench-Long 上提升语义对齐和时间连贯性。
核心贡献
- 对 MLLM 与 DiT 结合用于视频生成的一项系统研究指出,基于 EMA 的 tokenizer 得到的离散语义视觉 token、因果自回归生成以及显式视觉 token 条件化是有效的设计选择。
- BiVidGen 被提出为一种混合框架,其中 MLLM 生成语义视觉 token,DiT 在文本和这些 token 的共同条件下通过多层交叉注意力渲染视频。
- 在 VBench-Long 上的实验表明,与微调后的 DiT 基线相比,BiVidGen 改善了语义对齐和时间连贯性,说明显式 MLLM 视觉规划作为中间接口比仅文本条件化更强。
引言
视频生成已转向以基于扩散的 transformer 作为主要高保真合成骨干,而混合图像模型表明,将多模态大语言模型与扩散解码器耦合可以改善文本理解和视觉对齐。然而,在视频生成中,此类混合设计仍较少被探索:现有统一视频模型通常冻结 MLLM,并依赖轻量适配器或可学习 query token,主要将其作为特征编码器,而未利用其生成能力进行结构化语义规划。作者系统考察三个设计层面:从 MLLM 传递到 DiT 的中间表示应是什么、MLLM 应如何生成它、DiT 应如何消费它。其提出的 BiVidGen 使用来自基于 EMA 的 tokenizer 的离散语义 token、MLLM 中的因果自回归生成,以及 DiT 中显式的多层交叉注意力条件化,在 VBench-Long 上取得更好的时间一致性、因果过渡和语义对齐。
方法
作者构建了一种用于视频生成的混合 MLLM-DiT 架构。给定文本提示 T,不再直接将生成过程建模为 p(X∣T),而是在扩散渲染之前引入由 MLLM 生成的中间表示 D。具体来说,MLLM 根据输入提示生成 D∼pϕ(D∣T),DiT 在 MLLM 生成的表示和原始文本提示的共同条件下建模 X∼pθ(X∣D,T)。
作者将显式视觉 token 作为中间表示 D。由于原始 MLLM 不是为直接生成视觉语义 token 而设计,他们通过将 MLLM 视觉编码器提取的连续语义视觉特征量化为离散视觉 token 来适配其输出空间。
如下图所示:
作者比较了五种量化变体。令 C 表示 MLLM 视觉编码器提取的连续视觉特征序列,{en}n=1N 表示学习到的视觉码本。每个特征向量 Ck 被量化到最近的码本项,即 Dk=edk,其中 dk=argminn∥Ck−en∥2。对于基于 embedding 的 tokenizer,他们优化标准向量量化目标:
LVQ=k∑∥sg[Ck]−Dk∥22+β∥Ck−sg[Dk]∥22其中 sg[⋅] 表示 stop-gradient 算子,β 控制 commitment loss。他们还考虑了辅助监督变体,包括 MLLM 理解损失 LMLLM=−∑j=1Mlogpψ(yj∣y<j,D),其中冻结的 MLLM 从量化特征预测配对文本序列;以及重建损失 Lrec=∥gω(D)−X∥2。或者,他们采用指数移动平均(EMA)更新方案,不进行基于梯度的优化。该方案维护累积特征的指数移动平均 sn 和分配计数 cn:
sn(i)=μsn(i−1)+(1−μ)k:dk=n∑Ck,cn(i)=μcn(i−1)+(1−μ)∣{k:dk=n}∣其中 μ 是衰减因子。码本项更新为 en=cn(i)+δsn(i)。最后,他们探索了分层 token 结构,其中视觉编码器不同层的特征被量化。
为了实现显式视觉 token 生成,作者对 MLLM 进行微调以获得该能力,并研究不同的注意力机制和 token 格式。
如下图所示:
他们设计了四种代表性架构。第一种在 MLLM 中保持因果注意力,将离散文本 token 和视觉 token 视为统一的自回归序列。第二种对离散视觉 token 应用双向注意力,其中被遮蔽位置随机选择,但在各帧之间保持一致。第三种对加入噪声的连续视觉 token 采用双向注意力,在扩散目标下训练模型预测添加的噪声。第四种在多模态 token 处理中保持因果注意力,并引入 flow matching 头,利用 MLLM 视觉输出作为条件生成最终的连续视觉 token。
作者分析了中间 token 如何传递给 DiT 渲染器,将策略分为自然语言提示精炼、隐式潜在桥接和显式视觉 token 条件化。
参考下图:
对于显式视觉 token 条件化,他们研究了 token 格式、注入机制和注入深度。他们比较了离散和连续视觉 token。他们研究了自注意力,其中生成的视觉 token 充当结构蓝图并直接参与去噪动态;以及交叉注意力,其中 token 作为条件信号从外部引导去噪过程。他们还探索了多层注入,将视觉引导引入多个 DiT 块,以便更有效地利用。
在系统分析这些设计选择后,作者提出了最终架构 BiVidGen。
如框架图所示:
BiVidGen 由基于 EMA 的 tokenizer、基于 MLLM 的语义生成器和基于 DiT 的渲染器组成。在 MLLM 训练中,他们在成对的文本-图像或文本-视频数据上微调模型。分辨率-帧前缀被添加到视觉 token 序列之前,以改善控制。来自基于 EMA 的 tokenizer 的视觉 token 被追加在文本 token 之后,并用 和 标记包围。他们使用标准的 next-token prediction 和 teacher forcing 进行优化,仅对视觉 token 和 token 施加交叉熵损失。
在 DiT 训练中,模型以离散视觉 token D 为条件。D 被投影到 DiT 隐藏维度,并通过交叉注意力注入每个 DiT 块:
Xtb+1=Xtb+CrossAttn(Xtb,Proj(D))其中 b 索引 DiT 块。通过在每个块引入视觉引导,DiT 在整个去噪过程中整合语义条件。为保留预训练扩散先验,DiT 骨干网络被冻结,仅训练新增的交叉注意力模块和投影层,采用标准扩散 MSE 损失。推理时,MLLM 以用户提示为条件,从 标记开始自回归生成视觉 token。生成的序列被输入扩散生成器以产生最终视觉内容,并保留原始 3D RoPE 位置编码,以实现稳定的时空建模。
实验
这些实验比较了 MLLM 与视频扩散模型之间的中间表示,使用 Qwen3-VL-2B 和 Wan2.2,在 VBench-Long 上进行生成,在 DAVIS 上进行重建。结果表明,提示精炼有帮助,潜在桥接由于特征不匹配而表现不佳,通过多层交叉注意力注入的显式离散视觉 token 带来最强的语义和生成质量提升。消融实验进一步表明,基于 EMA 的码本最好地平衡了重建与码本利用率,离散 token 的因果自回归建模优于双向注意力,自注意力或交叉注意力融合效果相近。定性分析显示因果过渡和细粒度提示遵循有所改善,效率仍可接受,延迟略有增加,且可通过减少去噪步数来降低。
与仅 DiT 的基线相比,提示精炼主要通过更强的语义保真度和文本对齐带来提升。潜在桥接在质量和语义指标上均低于基线,这与 MLLM 隐藏状态与 DiT 期望条件之间存在不匹配一致。显式离散视觉 token 提供最大增益,尤其是通过多重交叉注意力融合时,可获得最高的语义分数和总分。提示精炼相比仅文本条件的 DiT 基线提高了语义分数和总分。具有多重交叉注意力的离散视觉 token 取得最佳整体性能,而潜在桥接分数低于基线。
该比较通过熵、活跃比例、top-token 集中度和量化误差来评估视觉 token 码本。基于 EMA 的码本取得最佳平衡,量化误差最低且熵最高,表明重建准确且码使用多样。相比之下,仅 embedding 码本利用率有限且误差较高,而加入 LLM 提高了码活跃度但显著增加量化误差。基于 EMA 的码本在评估的各码本中记录最低量化误差和最高熵。仅 embedding 码本的活跃比例很低且量化误差较高,表明码利用率和重建精度较差。embedding 加 LLM 码本获得最高活跃比例,但也具有最高量化误差。
在相同训练预算下,离散视觉 token 输入在 VBench-Long 基准上始终优于连续输入。对视觉 token 使用因果注意力比双向注意力提供更强的语义遵循,视觉质量仅有无可忽略的差异。这些结果支持以自回归方式建模离散视觉 token,从而为扩散生成高质量的中间表示。在各类注意力类型下,离散视觉 token 比连续 token 取得更高的语义分数和总分。因果注意力相比双向注意力改善语义遵循,而视觉质量几乎不变。具有因果注意力的离散 token 提供较强的语义性能和整体质量,支持自回归视觉 token 建模。
基于 EMA 的 tokenizer 在 DAVIS 上的重建效果优于基于 embedding 的方案,其中交叉注意力注入取得最佳 PSNR、SSIM 和 LPIPS。与普通 embedding 基线相比,添加解码器重建损失可改善重建,而将 embedding 码本与 LLM 特征结合表现更差。自注意力和交叉注意力都是可行的融合机制。EMA 加交叉注意力在所有变体中获得最高 PSNR 和 SSIM 以及最低 LPIPS。在相同的自注意力注入下,EMA 在所有重建指标上优于基于 embedding 的码本。添加解码器损失相比普通 embedding 基线改善重建;embedding 加 LLM 的重建最弱。对于 EMA 码本,交叉注意力相比自注意力带来轻微重建提升。
在所有评估配置中,基于 EMA 的 tokenization 取得最强的语义分数和整体生成分数,而基于 embedding 的变体往往视觉质量略高但语义对齐较弱。使用 EMA token 的自注意力和交叉注意力注入表现相当,向 embedding token 添加解码器或 LLM 模块会降低语义分数和总分。EMA tokenization 取得最高语义分数和总分,自注意力和交叉注意力表现相当。与 EMA 相比,基于 embedding 的 tokenization 获得略高的视觉质量但语义分数较低。对于基于 embedding 的 token,添加解码器或 LLM 注入模块会降低语义和整体性能,其中 LLM 变体整体结果最弱。
这些实验评估了不同的视觉条件化策略、码本设计、注意力模式和融合机制如何影响语义对齐、重建质量和生成性能。离散视觉 token,尤其是结合基于 EMA 的码本以及多重交叉注意力或因果注意力,始终提供最强的语义遵循和整体生成质量。提示精炼优于仅文本基线,而潜在桥接和 embedding 加 LLM 变体表现不佳,基于 embedding 的码本往往以略好的视觉质量换取较弱的语义对齐。