Command Palette
Search for a command to run...
DreamX-Creator 1.0:让 2K 分辨率原生音视频生成走向大众化
DreamX-Creator 1.0:让 2K 分辨率原生音视频生成走向大众化
Jiashu Zhu Yanhao Zheng Ruitian Tian Rujing Dang Shen Zhang Bingze Song Jiachen Lei Ruimin Lin Jiahong Wu Xiangxiang Chu
摘要
近期的视频生成器往往省略音频或在单独阶段合成音频,限制了视觉动态与声学事件之间的相互建模。我们提出 DreamX-Creator 1.0,一个以 7B 生成器为核心的紧凑型原生联合音视频生成系统。该生成器以首帧和文本提示为条件,对模态专用的音频流和视频流进行联合去噪。两条流在网络的前半部分独立处理,在后半部分通过门控跨模态注意力进行耦合,其令牌级和头级输出门对每个活跃的跨模态注意力头输出进行调制。统一的音视频数据系统构建并筛选时间一致的片段,生成结构化的多模态标注,并将片段组织为面向能力的数据池。渐进式联合训练包括两个音视频预训练阶段,随后进行高质量微调。音视频强化学习进一步对生成器进行后训练,采用模态感知的多模态反馈,将视频、音频和跨模态反馈分别路由至相应流。为实现高分辨率输出,我们的自回归一步 2K 精炼流程将双向多步教师模型适配为自回归多步精炼器,并将其蒸馏为每个时间块仅需一次去噪评估的学生模型。总体而言,DreamX-Creator 1.0 实现了原生、同步的音视频生成,性能可与最先进的开源系统相媲美。通过发布紧凑的 7B 生成器和 2K 精炼器,我们希望推动原生音视频生成的大众化,并为统一音视频生成建模的未来研究提供可及的基础。
一句话总结
阿里巴巴集团 DreamX 团队推出 DreamX-Creator 1.0,这是一个紧凑的 7B 原生联合音视频生成系统,该系统通过门控跨模态注意力联合去噪模态专用的音频流和视频流,并结合渐进式联合训练、音视频强化学习以及自回归一步 2K 细化流程,生成同步的音视频,性能可与最先进的开源系统相媲美,同时使原生音视频生成更加普及。
核心贡献
- 本文介绍了 DreamX-Creator 1.0,一个 7B 原生联合音视频生成器,以第一帧和文本提示为条件,联合去噪模态专用的音频和视频流,并通过具有 token 级和头级输出门的门控跨模态注意力将它们耦合起来,实现与最先进开源系统相媲美的同步音视频生成。
- 本文提出统一音视频数据系统,该系统过滤时间一致片段、生成结构化多模态标注,并组织面向能力的数据池。本文还提出渐进式联合训练,包括两个音视频预训练阶段,随后是高质量微调,以及使用模态感知多模态反馈的音视频强化学习,反馈路由到视频、音频和跨模态组件。
- 本文贡献了自回归一步 2K 细化流程,该流程将双向多步教师模型适配为自回归多步细化器,并将其蒸馏为一个每个时间块只需一次去噪评估的学生模型,同时开源紧凑的 7B 生成器和 2K Refiner 以供开放研究。
引言
生成视频在视觉保真度、运动和时长方面进展迅速,但音频经常被省略或单独合成,而单向的视频到音频或音频到视频流程将一种模态视为固定条件,在视觉和声学事件共同决定时限制了相互交互。早期的联合音视频模型支持同步采样,但在数据过滤与标注、自适应跨模态交互、感知与同步目标,以及联合潜在生成与高分辨率细化之间不同的计算需求方面仍面临未解决的挑战。许多现有系统还过于庞大、仅提供托管服务,或难以复现。作者提出 DreamX-Creator 1.0,一个紧凑的开放权重原生联合音视频生成器,以 7B 骨干网络为中心,具备门控跨模态注意力、渐进式联合训练、模态感知强化学习和自回归一步 2K 细化器。
数据集
作者从异构的公开和内部来源构建原生音视频生成语料库,随后通过过滤、结构化标注和基于能力的组织对其进行处理。
数据来源
- 结合多个公开数据集和内部收集的数据。
- 公开来源包括 Koala-36M、VGGSound、AudioSet、OpenHumanVid、SpeakerVid-5M、Action-100M 和 Talker-T2AV。
- 这些来源在不同内容领域和音视频交互方面提供互补覆盖。
过滤与预处理
- 原始视频使用 PySceneDetect 在场景边界进行切分。
- 基于音频 RMS 能量去除近静音片段。
- 丢弃无效或低分辨率样本。
- 从每个片段两端各裁掉三帧,以减少边界伪影和跨镜头污染。
- 使用 Q-Align 评估视觉质量。
- 使用基于 UniMatch 的光流估计运动幅度。
- 使用 Audiobox Aesthetics 评估音频质量。
- 使用 Synchformer 衡量一般音视频同步性。
- 对包含可见语音的片段,额外使用 SyncNet 进行细粒度唇音对齐过滤。
结构化标注
- 作者使用 Qwen3-Omni-30B-A3B-Instruct 进行联合视频和音频分析。
- 联合感知使视觉和声学证据能够相互约束,减少幻觉或跨模态不一致的描述。
- 标注捕获主体、动作、场景上下文、镜头视角、语音、音乐、声音事件、环境声、时间事件顺序,以及视觉有依据的音频与画外音频。
- Qwen3-ASR-1.7B 转录语音内容。
- Qwen3.6-27B 将多模态标注和 ASR 转录整合为连贯的描述。
- 生成的描述被用作音视频生成的条件信号。
能力分类与组成
- 标注片段被组织为四个面向能力的数据池。
- Qwen3.6-27B 从每个结构化标注中推断主导的跨模态监督模式。
- 数据池按主导监督信号对片段分组,以支持不同生成能力的有针对性学习。
- 这种组织方式允许根据不同生成目标所需的监督进行数据采样,而不是从异构语料库中均匀采样。
- 内容分布:语音占数据的 45.0%,事件声音占 33.4%,其余包括音乐、自然声音和混合内容。
- 节选未说明每个数据池的具体训练划分大小或混合比例。
方法
DreamX-Creator 1.0 方法被组织为一条流水线,涵盖数据策展、原生联合音视频生成、强化学习后训练和高效高分辨率细化。作者首先构建具有多维度质量过滤和联合音视频标注的数据集。随后训练一个双流扩散 transformer,联合去噪视频和音频 latent,使用双向跨模态注意力和门控条件。预训练后,应用模态感知强化学习阶段,优化分解后的视频、音频和同步奖励。最后,蒸馏一个自回归一步 2K 视频细化器,以提高空间分辨率,同时不改变运动或音频时序。
数据过滤与标注
收集到的视频首先使用 PySceneDetect 在场景边界切分为有效音视频片段。基于音频 RMS 能量去除近静音片段,并丢弃无效或低分辨率样本。由于场景边界定位可能不完美,作者从每个片段两端各裁掉三帧,以减少边界伪影和跨镜头污染。随后,分阶段过滤流水线使用 Q-Align 评估视觉质量,使用基于 UniMatch 的光流估计运动幅度,并使用 Audiobox Aesthetics 评估音频质量。
对于跨模态对齐,Synchformer 对时间相关的音频和视觉事件之间的一般同步性进行评分,而 SyncNet 对包含可见语音的片段提供细粒度唇音评估。一般片段由 Synchformer 过滤,可见语音片段还必须满足 SyncNet 标准。
过滤后,作者构建结构化标注,联合捕获视觉内容、声学事件、跨模态关系和语音文本。Qwen3-Omni-30B-A3B-Instruct 联合分析视频和音频流,而不是独立描述每个模态。联合感知使视觉和声学证据能够相互约束,减少幻觉或跨模态不一致的描述。生成的标注涵盖主体、动作、场景上下文、镜头视角、语音、音乐、声音事件和环境声,同时保留时间事件顺序,并区分视觉有依据的声音与画外音频。语音由 Qwen3-ASR-1.7B 单独转录,多模态标注和 ASR 转录由 Qwen3.6-27B 整合为连贯描述,保留时间结构和语音内容。该描述作为生成的条件。
原生联合音视频生成
原生生成器接受第一帧和文本提示,联合去噪视频和音频 latent 流。每个流保留自己的 token 速率、位置编码和 transformer 骨干网络。文本条件由共享文本编码器通过模态特定的条件路径提供。网络前半部分独立处理两个流。后半部分加入两条跨模态注意力路径:音频到视频(A2V)使用视频 query 与音频 key 和 value,视频到音频(V2A)则交换这些角色。当两条路径均激活时,它们读取相同的融合前状态,并并行计算残差更新。方向掩码在方向模式下选择一条路径,在联合模式下选择两条路径。
由于两个流具有不同的 token 速率,它们的位置被映射到共享的时间坐标系。随后对跨模态 query 和 key 应用时间旋转位置编码,在不重采样任一 latent 序列、不替换模态特定位置编码的情况下提供时间感知注意力。
每个训练样本被分配到 A2V、V2A 或联合模式。令 ma→v,mv→a∈{0,1} 表示方向掩码,令更大的 σ 表示更强的损坏:
A2V:V2A:Joint:σv>σa,(ma→v,mv→a)=(1,0),σa>σv,(ma→v,mv→a)=(0,1),σv=σa,(ma→v,mv→a)=(1,1).因此,A2V 和 V2A 使用噪声更大的目标流和更干净的条件流。两个流均保留其流匹配损失。令 hv 和 ha 表示融合前的隐藏状态。跨模态更新为
Δhv=ma→vAttn(Q(hv),K(ha),V(ha)),Δha=mv→aAttn(Q(ha),K(hv),V(hv)).对于 A2V,ha=sg(ha);对于 V2A,hv=sg(hv);联合模式在两条路径中使用原始隐藏状态。停止梯度在 key 和 value 投影之前应用,防止目标流损失通过跨模态注意力更新条件骨干网络,同时保持注意力参数可训练。
门控跨模态注意力
在后半部分的每个块内,跨模态注意力位于模态特定的自注意力和文本交叉注意力之后。对于从源流 Y 到目标流 X 的一般路径,两个流被归一化并投影到共同的多头注意力空间:
Xˉ=LNx(X),Q=RMSNorm(WQXˉ),Yˉ=LNy(Y),K=RMSNorm(WKYˉ),V=WVYˉ.拆分为注意力头后,使用共享时间坐标系中的坐标 τx 和 τy 应用时间旋转位置编码。注意力计算还会掩盖超出源流有效长度的填充位置。
作者在缩放点积注意力之后、输出投影之前使用 token 级和头级 sigmoid 输出门。与仅依赖 query 的门不同,该门同时依赖目标 token xi 及其跨模态注意力输出 Ci,h:
gi,h=sigmoid([WxLN(xi)]h+wc⊤LN(Ci,h)+bh),Δxi=Wo(Concath[gi,h⊙Ci,h]),xi′=xi+Δxi.这里 Wx 将目标隐藏状态映射为每个头一个 logit,wc 将归一化的头级注意力输出映射为标量,bh 是头特定偏置。该门是一种输出调制机制,而不是 token 路由或路径选择。
渐进式联合训练
训练包括两个音视频预训练阶段,之后是高质量微调。在所有阶段中,作者混合使用内部 A2V、V2A 和联合条件配置。预训练使用固定混合比例,而高质量微调根据训练内容的主要跨模态依赖关系调整它们的相对侧重。
在阶段 1,模型由模态特定的视频和音频骨干网络初始化。两个骨干网络的前半部分保持冻结,后半部分应用 rank-256 LoRA 适配器,并直接优化跨模态注意力模块和输出门。
在阶段 2,LoRA 权重被合并到各自的骨干网络中。训练在广泛覆盖的配对数据上继续,两个扩散 transformer 骨干网络和所有跨模态模块联合优化。
在阶段 3,通过使用音视频同步指标、视频和音频的模态特定美学分数、空间分辨率和片段时长过滤候选片段,构建精选微调子集。OmniShotCut 执行细粒度镜头边界检测和转场标注,包含或跨越检测到转场的候选片段被丢弃。随后在保留的配对数据上对全参数模型进行微调。第一次微调运行继承阶段 2 的分组学习率,后续运行逐步降低学习率。
优化细节
两个流均使用流匹配。对于模态 m∈{v,a},干净 latent z0m 和独立高斯噪声 ϵm 根据模态特定的噪声水平 σm 进行插值:
zσmm=(1−σm)z0m+σmϵm,um∗=ϵm−z0m.token 和特征归一化的流匹配目标为
LFMm=Nmdm1j=1∑Nmuθ,jm−um,j∗22,总损失为
LAV=λvLFMv+λaLFMa.两个流使用独立采样的高斯噪声张量。基础时间步从离散的 1,000 时间步流计划中采样,偏移因子为 5.0,模态特定噪声水平遵循上述方向顺序。两个预训练阶段使用 λv=λa=0.5,而高质量微调使用 λv=0.5 和 λa=0.1。
优化器为 AdamW,(β1,β2)=(0.9,0.99),ϵ=10−10。在阶段 1,LoRA 参数使用 1×10−4 的学习率,跨模态注意力和输出门参数使用 2×10−5。合并适配器后,阶段 2 以 1×10−5 更新骨干网络参数,以 2×10−5 更新跨模态模块。训练使用 bfloat16 混合精度,并将梯度范数裁剪到 1.0。
音视频强化学习
流匹配目标不会直接优化感知质量、提示遵循度、跨模态语义一致性或精确时间对应关系。因此,作者引入音视频强化学习阶段,在保持两个流均位于联合生成器内部的同时,使用多模态反馈对 DreamX-Creator 1.0 进行后训练。
单一全局奖励不够,因为视频质量、音频质量和同步性可能无法一起提升。因此,反馈被分解为视频特定、音频特定和跨模态分量。令 Av、Aa 和 Aav 表示归一化优势。路由到两个生成流的监督为
Av=Av+Aav,Aa=Aa+Aav.模态特定项改进各自对应的流,而共享的跨模态项联合监督两个流及其双向交互模块。
音视频同步主要由少数区域决定,例如可见口型和发声物体。作者使用选定交互块的视频到音频响应来估计每个视频 token 的相关性。分数在每帧内归一化并转换为 token 权重:
wi(e)=1+αesigmoid(σf(i)+ϵsi−μf(i)).这里 si 是视频 token i 的跨模态相关性分数,f(i) 表示包含该 token 的帧。均值和标准差在同一帧内计算。系数 αe 在预热期间从零逐渐增大,因此训练开始时 token 权重接近均匀,随后逐步聚焦于同步相关区域。作者还对音频到视频路径应用深度依赖的梯度缩放。进入音频流的梯度在浅层块中被更强烈地衰减,并在较深的交互块中逐步恢复。
在强化学习中,策略由预训练基础模型初始化。对于每个第一帧和提示条件,当前策略生成一组 G 个联合音视频候选。每个候选使用视频质量、音频质量、提示一致性和音视频同步奖励进行评估。奖励在组内归一化,以获得相对的视频、音频和跨模态优势。训练目标为
LRL=λvLv(Av+λavvAav)+λaLa(Aa+λavaAav)+λregLreg(πθ,πbase).正则化项将更新后的策略约束向预训练基础模型靠拢,以保持多样性并防止奖励过度优化。训练在分组候选生成、多模态奖励评估和策略优化之间交替进行。更新后的策略定期刷新 rollout 模型,形成在线生成-评估-更新循环。后训练模型保留相同的第一帧条件联合生成接口。
自回归一步 2K 细化
高分辨率视频生成需要连贯运动和丰富空间细节。使用联合音视频模型直接生成 2K 视频成本很高。因此,作者引入 2K Refiner,一个自回归一步 2K 细化阶段。联合生成器首先生成连贯的低分辨率视频,2K Refiner 将其增强到 2K 分辨率,同时保留生成内容、运动和音频同步时序。
推理时,2K Refiner 按时间块顺序细化视频。对于每个块,单次去噪评估以低分辨率视频和之前已细化的高分辨率块为条件。这避免了在 2K 分辨率下的多步扩散采样,并使细化可扩展到长视频。音频流不被修改。
细化训练流水线包括三个阶段。首先,训练一个双向多步扩散教师模型,用于高质量视频细化。它在 latent 空间中运行,并使用双向时空注意力来利用过去和未来帧。流匹配训练教师模型预测以低分辨率视频为条件的速度场。训练对通过退化高分辨率视频合成,课程从轻微退化逐步增强到更强的模糊、噪声、压缩、重采样、几何失真和时间相关损坏。时间损坏很重要,因为输入是生成视频,可能包含纹理闪烁、局部运动抖动和不稳定的细节结构。
其次,通过教师强制将双向教师模型适配为自回归多步细化器。当前块以低分辨率视频和真实过去高分辨率块为条件进行去噪。这种因果分解减少了高分辨率计算,同时通过自回归上下文保持时间连续性。
第三,自回归多步细化器使用 Distribution Matching Distillation,遵循 DMD2 公式,被蒸馏为一步学生模型。学生模型从高斯噪声、低分辨率视频和其自身之前细化的块预测当前高分辨率块。为避免曝光偏差,蒸馏使用自 rollout:完整视频由学生模型自身生成,分布匹配目标应用于这些生成的 rollout。蒸馏目标结合分布匹配和像素空间监督。生成的 latent 由冻结的 VAE 解码器解码,并针对高分辨率真值应用 DISTS 感知损失和 ℓ2 重建损失。这种设计实现高效的一步 2K 细化,同时不改变联合生成器产生的运动或音频对齐时序。
实验
模型在 Verse-Bench 上进行评估,该基准覆盖一般音视频事件和以语音为中心的场景,使用从独立视频和音频描述派生的统一提示。定量实验针对若干研究基线和更大的开放权重系统评估视频质量、音频质量、语音生成以及音视频对齐。细化器提高了感知视频质量,同时保持语义一致性和音视频对齐,用户研究显示具有竞争力的视频质量,并且对多个基线具有有利的胜率。然而,7B 模型在音频美学、跨模态语义和唇同步方面仍落后于更大的系统,尤其是在更具挑战性的案例上。
数据系统根据主导跨模态监督信号将标注的音视频片段组织为四个面向能力的数据池。每个数据池支持音频到视频、视频到音频或联合生成的有针对性训练,同时保持内容类型的多样性。语音和事件声音是最大的内容类别,其余包括音乐、自然声音和混合内容。片段按主导监督信号分组,而不是均匀采样,从而支持 A2V、V2A 和联合音视频生成的有针对性学习。语音和对话为 A2V 和联合任务提供细粒度面部和发音线索,而动作和拟音为时间对齐的声音生成提供可见事件线索。
这一初步比较显示,7B 模型在定量指标上具有竞争力,但并非全面领先。它取得了最佳唇同步分数和最低音视频失同步率,同时具有相对较强的视频质量和语音识别准确率,并在内容有用性上得分最高。相比之下,若干音频美学维度和跨模态语义弱于最强基线,表明这是一种权衡而非全面优势。所提模型实现了最佳 LSE-C 和最低 DeSync,表明在所比较系统中具有强唇同步和音视频对齐能力。它还获得了最高 CU 以及有竞争力的 VQ 和 WER,而 CE 和 IB 弱于顶级基线,表明在音频美学和跨模态语义方面仍存在差距。
尽管参数数量少得多,7B 模型及其变体在所比较系统中取得了最佳视频质量和音视频失同步分数。它们在大多数音频美学维度和跨模态语义上落后于更大的开放权重基线,并且在唇同步方面仍落后于 MiniMax-H3。细化器进一步改善视频质量,同时保持音频和语音指标接近 RL 变体。7B 模型的 VQ 高于 22B 和 33B 基线,DeSync 低于这些基线,表明在这些指标上具有更好的视频质量和音视频对齐。AudioBox Aesthetics 中的 CE、CU 和 PQ 更有利于较大的基线,而 7B 模型的 PC 更低,因此更好。通过 LSE-C 衡量的唇同步在 MiniMax-H3 上最高,7B 变体低于它。细化器在所列出模型中实现最高 VQ,并相对于基础模型改善 DeSync,同时音频美学仍与 RL 变体相似。
所有评估的细化方法均相对于基线改善了感知质量指标,特别是 aesthetic、MUSIQ 和 MANIQA,同时相对于基线降低了 LSE-C 和 IB。在细化方法中,所提细化器实现了最佳 MUSIQ、MANIQA、LSE-C 和 IB,并保持较低 DeSync,尽管 DeSync 仍高于基线。这表明在感知增强与音视频和语义一致性保持之间实现了更均衡的权衡。所有细化方法均相对于基线改善了 aesthetic、MUSIQ 和 MANIQA。每种细化方法相对于基线均劣化了 LSE-C 和 IB,反映出唇同步和语义对齐降低。所提细化器在细化器中于 MUSIQ、MANIQA、LSE-C 和 IB 上排名最佳。FlashVSR 在细化器中具有最低 DeSync,而所提细化器具有第二低的 DeSync。
评估使用按主导跨模态监督信号组织的面向能力的数据池,覆盖语音、事件、音乐、自然声音和混合内容,用于音频到视频、视频到音频和联合生成。7B 模型具有竞争力但并非全面领先,在唇同步、音视频对齐、视频质量和内容有用性方面表现强劲,但在若干音频美学和跨模态语义指标上落后于较大的基线。细化方法改善了 aesthetic、MUSIQ 和 MANIQA 等感知质量指标,但降低了唇同步和语义对齐,其中所提细化器在 MUSIQ、MANIQA、LSE-C 和 IB 上提供细化器中的最佳平衡,同时保持相对较低的失同步。总体而言,结果突出了较小模型在视频和一致性方面的优势,以及细化过程中视觉增强与音视频或语义一致性之间的权衡。