Command Palette
Search for a command to run...
Ex-Omni-2D:具备原生视觉呈现的富有表现力的全模态对话模型
Ex-Omni-2D:具备原生视觉呈现的富有表现力的全模态对话模型
Haoyu Zhang Zhipeng Li Xiaoying Tang Tianshu Yu Yiwen Guo
摘要
全模态对话模型能够理解多模态输入并合成语音回复,但其响应在视觉上仍缺乏具身呈现。我们提出 Ex-Omni-2D,一个全模态对话框架,可生成包含文本、个性化语音和基于参考条件的视频的协调响应。给定多模态查询、参考图像和参考音频,模型首先预测一个描述场景、情感和动作的结构化视觉思维计划(VTP),随后生成回复文本和原生多码本语音单元。这些单元构成一个共享的声学-时间接口:它们被解码为语音,并与视频帧在线对齐。该接口使得响应通路和虚拟形象通路能够从异构的语音、对话和虚拟形象视频数据中学习,从而避免了对大规模查询-文本-语音-视频监督的需求。一个全序列视频生成器充当主要教师模型。为实现高效增量生成,我们进一步将其蒸馏为一个少步块因果流式学生模型,其前缀流式机制在连续块之间传递干净的隐变量,以减少后期块的累积退化。通过四步推理,完整的四 GPU 管线在 400×720/720×400 分辨率下实现了 1.293 的端到端实时因子,提供了一个实用的质量-效率平衡点。
一句话总结
香港中文大学(深圳)与LIGHTSPEED的研究人员提出Ex-Omni-2D,一种全模态对话模型,通过预测视觉思维计划(Visual Thought Plan)和共享的声学-时间语音单元,生成文本、个性化语音和基于参考条件的视频,支持从异构数据中训练而无需直接监督,并通过Prefix Streaming将教师视频生成器蒸馏为少步流式学生模型,实时因子达到1.293。
核心贡献
- Ex-Omni-2D是一种对话条件化的响应生成方案,利用视觉思维计划显式描述场景、情感和动作,从而指导文本、个性化语音和基于参考条件的视频的协同生成。
- 原生多码本语音单元接口创建了共享的声学-时间表示,使语音解码与帧级视频条件对齐,并支持在异构语音、对话和数字人视频数据上训练,无需配对视频-响应对话。
- Prefix Streaming机制将全序列视频生成器蒸馏为分块因果流式学生模型,在块间传播干净隐变量以减轻累积的尾部块退化,以四步推理在400×720/720×400分辨率下实现端到端实时因子1.293。
引言
全模态对话系统能够理解语音、文本和视觉输入并生成口语回复,但其响应在视觉上仍缺乏具身呈现。现有的说话数字人和联合音视频生成方法能够产生较强的视觉输出,但它们由完整的波形、外部提供的提示或静态内容参考驱动,而非直接从对话状态中推导出视觉意图。作者引入Ex-Omni-2D,一个首先生成对话原生视频响应的框架,它从对话上下文中推断结构化的视觉思维计划,然后使用共享的多码本语音单元流联合控制语音合成和帧对齐的数字人动画。这种分解方式避免了对大规模对话与目标视频配对数据的需求,使每个模态特定路径都能在其可用的异构数据上训练,而蒸馏后的流式学生模型配合Prefix Streaming,支持高效的增量推理,便于交互式部署。
方法
Ex-Omni-2D接收包含文本、语音或两者兼有的多模态用户查询x=(xt,xs),以及参考图像Iref和参考音频aref。它生成包含文本y、个性化语音和基于参考条件的视频V的全模态响应。该框架围绕两个中间接口组织:结构化的视觉思维计划p,传递高层视觉意图;以及原生多码本语音单元U,提供语音和视频生成共享的声学内容和时序信息。
如下图所示:
作者利用不同的路径进行角色锚定。文本和语音查询被嵌入并投影到共享隐空间,形成多模态查询表示Ex。参考图像由视觉塔处理并投影到对话模型空间,得到zIllm,同时由视频生成器内的3D VAE独立编码,获得外观参考隐变量Rref。参考音频在语音生成器内部处理,由说话人编码器提取声音嵌入sref。
在视觉响应规划方面,对话骨干网络遵循结构化协议,将内部视觉计划与面向用户的响应分开。模型输出一个序列,包含仅限于结构化视觉思维计划的思考块和面向用户文本的响应块。视觉思维计划包含五个字段,描述首帧场景、整体场景、情感、动作风格和详细运动。该文本接口被编码为视频生成器的语义条件Lvtp。响应跨度上的最终层隐状态,记为Hyℓ,被保留用于语音生成。
语音生成器以响应隐状态、响应token和参考声音为条件,预测多码本声学单元序列U∈NN×C。这些单元作为生成语音的共享表示。编解码器将其渲染为波形音频,而适配器将其映射为帧对齐的视频条件特征A。由于单元以12.5 Hz生成,而视频为25 FPS,每个声学特征重复用于两个视频帧,提供显式的时间对齐。
视频生成器有两种实现。全序列教师模型使用双向时间上下文生成主要视频响应。它接收参考隐变量Rref、帧对齐声学条件A和视觉思维计划条件Lvtp。去噪网络以这些输入为条件,声学特征被注入到特定的DiT块中。为实现增量部署,作者将教师模型蒸馏为Prefix-Streaming学生模型。学生模型在四个隐变量去噪窗口内使用双向注意力,在窗口间使用因果注意力。它采用Prefix Streaming机制,将前一个块的最后干净隐变量复用为下一个窗口的一个隐变量前缀,锚定块边界并防止时间漂移。
训练分四个阶段进行。第一阶段使用ASR和TTS数据对齐语音接口。第二阶段通过视觉思维计划-响应协议适配全模态响应。第三阶段在数字人片段上训练全序列视频生成器,以实现语义和声学-时间接口,并将其冻结为教师模型。第四阶段通过流图学习和同策略分布匹配将教师模型蒸馏为流式学生模型。
实验
评估使用CommonEval进行音视频生成评估,使用OmniCharacter进行多轮对话评估,使用VoiceBench进行语音问答评估,将Ex-Omni-2D与共享同一响应控制器的级联基线进行比较。多任务实验表明,该模型能够生成个性化语音和视频,并具有可控的质量-效率权衡,同时保持有竞争力的对话流畅度和连贯性。消融实验证实,响应特定的视觉规划提高了主体一致性和唇音同步,而Prefix Streaming减少了尾部块的主体退化。总体而言,该系统实现了强大的跨模态生成,但在对话和端到端延迟方面揭示了能力权衡,并非所有指标都有一致提升。
对比涵盖了仅视频、联合视频音频和基于对话的全模态生成范式。echomimic和OmniAvatar-1.3B等独立视频渲染器分别在主体一致性、动作和唇音同步方面领先,而Ex-Omni-2D教师模型整合了对话、个性化语音和视觉规划,代价是不在任何单一渲染指标上占优。流式学生模型变体通过去噪步数预算暴露了可控的质量-效率权衡。在仅视频基线中,echomimic实现了最高的主体一致性和动态程度。OmniAvatar-1.3B获得了最强的唇音同步分数。Ex-Omni-2D教师模型增加了对话响应和个性化语音生成,以牺牲独立渲染分数换取全模态能力。将流式学生模型的去噪步数从两步增加到八步,持续提升了视频质量和同步分数。用固定的中性计划替换视觉计划会降低主体一致性和唇音同步,而动作发生率增加,揭示了对规划的敏感性。
Ex-Omni-2D在OmniCharacter的多轮对话基准上,在流畅度、连贯性和一致性方面取得了评估模型中的最高分,超越了其Qwen3-8B骨干网络。其十二维总平均分仅略高于Qwen3-8B,且部分指标下降,表明存在能力权衡而非一致提升。Ex-Omni-2D达到了最高的流畅度、连贯性和一致性评分(平均3.938),而Qwen3-8B为3.537。Ex-Omni-2D的十二维平均分(3.283)与Qwen3-8B(3.264)接近,个别指标有升有降,揭示了权衡。
所提出的模型在所有三个语音问答基准上均取得第二高分,仅次于Qwen2.5-Omni。它以明显优势超越了VITA-1.5、Moshi、Mini-Omni2和SLAM-Omni等其他开源替代方案,在BBH基准上的优势最大。该模型在每项指标上均排名第二,AlpacaEval为4.28,CommonEval为3.71,BBH为58.70。在AlpacaEval上比VITA-1.5提升0.07,在CommonEval上提升0.05,在BBH上提升3.4分。
流式学生模型提供了可调的质量-效率权衡。仅用2个去噪步骤即可实现极高的吞吐量并保持有竞争力的SC分数,但动态程度和同步质量较低。将步骤增加到8步可恢复大部分教师模型的质量,几乎匹配SC和Sync-C,同时仍提供超过10倍的帧率。在2个去噪步骤下,学生模型达到39.5 FPS,端到端实时因子为1.2,而教师模型以1.4 FPS运行,因子为26.9。将学生模型的步骤从2步增加到8步,DD从9.50提升至48.00,Sync-C从3.51提升至4.00,缩小了与教师模型72.00 DD和4.95 Sync-C的差距。
消融响应特定的视觉规划会降低语义一致性和同步性,同时增加运动量指标,特别是在存在个性化语音时。移除个性化参考语音并使用固定的公共话语会提高无参考音频质量和清晰度,但几乎消除了说话人相似度。视觉计划的首帧字段与参考图像的关联性远低于其余字段,后者显示出强跨模态一致性。移除响应特定的视觉规划会降低语义一致性和同步性,同时增加光流运动发生率,尤其是在个性化语音条件下。用固定的公共话语替换个性化参考语音提高了无参考音频质量和清晰度,但导致说话人相似度崩溃。视觉计划的首帧字段与参考图像的关联性(43%)远低于其他字段(平均85%)。协同生成的情感和动作风格字段实现了高跨模态一致性,分数在90–94%左右。
评估比较了仅视频、联合视频音频和全模态对话生成,Ex-Omni-2D教师模型整合了对话和个性化语音,但牺牲了独立渲染指标。该模型在对话流畅度、连贯性和一致性方面取得了最高分,在语音问答基准上排名第二,优于其他开源替代方案。消融实验证实,响应特定的视觉规划和个性化语音对于语义一致性和同步性至关重要,而流式学生模型提供了可调的质量-效率权衡,以超过10倍的帧率恢复接近教师模型的质量。