Command Palette
Search for a command to run...
MOTION-OMNI:面向口语对话的端到端联合语音与全身动作生成
MOTION-OMNI:面向口语对话的端到端联合语音与全身动作生成
Chengqian Ma Wei Tao Haoyu Zhang Yiwen Guo
摘要
一个能够进行对话的虚拟形象应当决定说什么,并在说话的同时做出动作,然而这些能力分属不同的模型家族:口语对话模型生成语音但不包含动作,而共语动作模型仅从提供给它的音频中生成动作。标准的解决方案是采用级联方式,先生成口语回应,再对完整的音频运行动作模型,这需要进行第二次完整推理,并且无法在两者之间进行联合优化。我们提出了 Motion-Omni,一个端到端框架,其中口语对话模型原生地输出显式面部表情以及手部、上半身和下半身的动作,这些动作直接由生成语音的隐藏状态产生。在此,联合训练并非可选:当语音通路被冻结时,动作与音频保持错位,而在两种目标下共同调整 LLM、语音生成器和动作生成器,才能恢复对齐,同时保留口语对话能力。监督信号来自一个可扩展、模型无关的流程,该流程使用可替换的动作教师模型为一致语音的口语回应生成伪标签,从而产生 422,856 个质量排序的配对(1,402 小时)。我们进一步发布了 SwDA-500,并且据我们所知,这是首个针对随机开放式全身口语对话的公开评估协议,它在跨动作系统匹配音频的同时,统一了渲染、自动指标、人工评估和延迟测量。以 Qwen2.5-7B-Instruct 为骨干实例化后,Motion-Omni-Q7 在无参考动作指标上与同音频教师级联的差距在 2% 以内,同时响应速度快 5.4 倍(RTF = 0.78,快于实时),在节拍相关性和多样性上超越了所有非教师级联,并达到了 2.62% 的词错误率,在所比较的全模态模型中为最低。
一句话总结
来自北京大学、LIGHTSPEED、香港中文大学(深圳)以及一位独立研究员的研究者提出了 Motion-Omni,这是一个端到端框架,其中口语对话模型直接从语音隐藏状态原生生成面部表情和全身动作,避免了双阶段级联并实现了联合优化;在冻结语音通路的情况下,使用 422856 个伪标注对进行训练,Motion-Omni-Q7(Qwen2.5-7B-Instruct)在动作指标上与教师级联的差距在 2% 以内,同时运行速度快 5.4 倍(RTF=0.78),词错误率为 2.62%,并发布了 SwDA-500 以及首个面向随机开放式全身口语对话的公开评估协议。
核心贡献
- 提出了 Motion-Omni,这是一个端到端框架,其中口语对话模型原生输出显式面部表情以及手部、上半身和下半身动作,这些动作直接从生成语音的隐藏状态产生,而非从解码后的波形产生。
- 证明了联合训练至关重要:冻结语音通路会导致动作与音频不对齐,而在两种目标下共同调整 LLM、语音生成器和动作生成器则可以恢复对齐并保持口语对话能力,这一过程由模型无关的伪标注流水线支撑,生成了 422,856 个质量排序对(1,402 小时)。
- 结果表明,Motion-Omni-Q7 在无参考动作指标上与同音频教师级联的差距在 2% 以内,同时响应速度快 5.4 倍(RTF = 0.78),在节拍相关性和多样性上超越所有非教师级联系统,词错误率为 2.62%,在所比较的全模态系统中最低;此外还发布了 SwDA-500 以及首个面向随机开放式全身口语对话的公开评估协议。
引言
在人类交流中,语音和全身伴随语音动作紧密耦合,然而大多数口语对话模型(SDM)仅生成音频,而伴随语音动作模型则需要预先提供的语音作为输入。一种朴素的级联方式,即 SDM 生成语音、另一个动作模型为其赋予动画,虽然可行,但会产生两个结构性代价:在音频完成后需要第二次完整推理,且没有任何动作目标能够更新语音或对话参数。此前的集成系统要么将动作限制为面部动画,要么冻结语音通路以防止动作梯度对其造成损害,要么未能将显式的面部、手部、上半身和下半身输出与响应生成通路的共同适应原生结合。作者通过 Motion-Omni 解决了这些不足,这是一个端到端框架,将显式面部和全身动作作为 SDM 的原生输出生成,其条件与生成口语响应的对话上下文相同。为了克服 12.5 Hz 语音单元与 30 Hz 动作之间的速率不匹配,他们引入了双输入条件接口,其中动作生成器关注语音生成器的隐藏状态并消费已发射的语音 token 嵌入,避免了将渲染波形作为中间输入。四阶段训练进程端到端地共同适应所有模块,消融实验证实这种共同适应对于语音与动作的对齐是必要的。在数据方面,他们构建了一个可扩展、模型无关的伪标注流水线,以一致的目标语音生成了 422,856 个教师生成的语音-动作样本(1,402 小时),并使用双指标质量分数对监督进行排序。他们还发布了 SwDA-500 以及一个可复现的评估协议,用于随机开放式全身口语对话,通过在不同动作系统之间匹配音频来隔离动作质量。最终实例 Motion-Omni-Q7 在无参考动作指标上与同音频教师级联的差距在 2% 以内,同时响应速度快于实时 5.4 倍,并在所比较的全模态系统中取得了最低的词错误率。
数据集
作者通过将对话响应与相应的全身动作配对,构建了一个大规模监督数据集,用于训练口语动作模型。由于采集的视听语料库(例如双人无缝交互语料库)包含许多与语音生成器的单一目标语音不匹配的说话人,他们通过伪标注来构建监督。一个通用流水线接收已经与响应音频配对的语音指令语料库,并使用伴随语音动作生成教师模型分两步生成配对的(文本、语音、全身动作)监督。
- 通过教师模型生成动作监督:一个预训练的伴随语音动作生成教师模型(本次运行中使用 LOM)处理每个响应波形,其四个部位各自的 VQ 码流作为动作目标。教师模型是可替换的,因此未来的实现可以使用更强的模型重新生成监督。
- 双指标质量评分与课程学习:每个样本在两个指标上评分:(i) 加权 VQ-VAE 重建误差,用于标记超出码本表达范围的动作;(ii) 节拍相关性分数,用于标记与语音耦合较弱的教师动作。经过稳健的第 5 到第 95 百分位归一化后,每个样本获得一个综合分数(alpha 设为 0.5),该分数驱动第三阶段四个子阶段的课程学习,并选择第四阶段的 S2SM 数据池。
数据集分为四个阶段,具有不同的来源和过滤规则:
- 阶段 1 和阶段 2:从 InstructS2S-200K 和 Ex-Instruct 的英文子集中抽取 ASR 和 TTS 配对。
- 阶段 3:使用 LOM 教师模型将流水线应用于 InstructS2S-200K。直接在完整的未排序语料库上训练会导致发散,因此网络逐步暴露于双指标分数越来越大的分位数(12.5%、25%、50%、100%),每个子阶段从前一个检查点热启动。逐阶段的教师参考 Fréchet Gesture Distance 从阶段 3a 的 0.3974 下降到 0.3040。
- 阶段 4:组装一个包含 ASR、TTS、S2SM 和 T2T 四种任务的混合数据集。T2T 部分约 213K 个样本,来自六个纯文本数据集(SODA、WildChat、Tulu-3、WizardLM、OpenThoughts、NuminaMath-CoT),以在联合微调期间保留通用文本响应规划和多轮对话行为。没有这一部分时,响应更倾向于重复用户的输入。
所有来源均使用 langdetect 进行英文过滤,并将每段对话限制在 10,000 个字符以内。在评估方面,作者使用 SwDA-500,这是一个从 Switchboard Dialog Act Corpus 派生出的外部 500 提示对话文本评估集。该集合覆盖所有 66 个 SwDA 主题描述,每个主题包含 7 或 8 个语义完整的说话人轮次,提示长度适中,并去除了不打算朗读的转录伪影。SwDA-500 提供了真实的对话措辞,但并非配对的真实动作基准;所有动作参考均由教师模型或基线在匹配提示下生成。
方法
作者设计了 Motion-Omni 框架,以从用户语音或文本输入自回归地生成伴随同步全身伴随语音动作的口语响应。该架构包含四个主要组件:语音编码器、大语言模型(LLM)主干、语音生成器和动作生成器。
如框架图所示,语音编码器使用冻结的 Whisper-large-v3 模型将 16 kHz 波形映射为连续表示。随后,一个语音投影器将每五个连续帧拼接,并通过两层 MLP 映射到 LLM 嵌入空间,从而将序列长度降采样五倍。LLM 主干以 Qwen2.5-7B-Instruct 模型实现,处理这些投影后的连续语音片段以及周围的文本 token。对于语音输入,投影后的特征替换 token 序列中指定的占位符。
语音生成器是一个从 Qwen2.5-0.5B-Instruct 初始化的 Qwen2 风格 transformer。它以 12.5 Hz 的频率在 16,384 个单元的词汇表上自回归地发射离散语音单元。为了整合上下文信息,作者引入了 Token-as-Query 门控融合(TQGF)模块。该机制允许 token 嵌入通过学习到的逐头 sigmoid 门控来查询 LLM 的上下文隐藏状态。
动作生成器由四个并行、独立的解码器组成,分别对应特定身体部位:面部、手部、上半身和下半身。每个解码器以 30 Hz 发射 LOM VQ 码,并以语音生成器的最后一层隐藏状态为条件。条件机制依赖于两个输入流。键和值流将语音生成器的隐藏状态 Hs 投影到动作工作维度:
Z=HsWh查询流将离散语音单元 u 的学习嵌入从 12.5 Hz 语音速率插值到 30 Hz 动作速率:
Q=Interp(E[u]We)其中 E 是一个从预训练的流嵌入初始化的查找表。每个解码器堆叠 TQGF 层,后接带有周期性旋转位置编码的自注意力 Transformer。随后,一个部位特定的 MLP 头在 VQ 码本条目上产生逐帧 logits。动作生成使用加权交叉熵损失进行优化:
Lmotion=b∑wbLCE(b)其中权重 wb 与底层 SMPL-X 和 FLAME 特征维度成比例,以确保每个特征维度的重要性相等。
在推理期间,发射的语音单元通过流匹配解码器转换为 mel 频谱,再通过 HiFi-GAN 声码器转换为 22.05 kHz 波形。与此同时,动作码由冻结的 LOM VQ-VAE 解码为 SMPL-X 身体和手部参数以及 FLAME 面部表情系数。
为了有效训练这一复杂系统,作者实施了四阶段渐进式训练课程。在阶段 1 中,仅训练语音投影器,使用自动语音识别监督,LLM 保持冻结。阶段 2 在文本到语音对上训练语音生成器。阶段 3 接入动作生成器,并在文本到语音加动作语料库上将其与语音生成器联合训练。该阶段采用课程学习,逐步将网络暴露于训练数据中更大的质量分位数。最后,阶段 4 同时解冻 LLM 主干、语音投影器和两个生成器,优化自动语音识别、文本到语音、带动作的语音到语音以及文本到文本任务的混合。
动作生成阶段的训练数据通过伪标注流水线构建。一个预训练的伴随语音动作生成教师模型处理响应波形以产生目标 VQ 码流。为确保高质量的监督,每个样本使用双指标质量分数进行评估,该分数结合了 VQ-VAE 重建误差和节拍相关性分数。这一综合分数驱动阶段 3 的课程学习,并选择阶段 4 的数据池,确保模型从对齐良好且富有表现力的动作序列中学习。
实验
实验评估了 Motion-Omni-Q7(一种联合生成语音和伴随语音动作的模型)与级联基线在对话、语音质量、动作生成和延迟方面的表现。在 VoiceBench 上,它在口语对话质量上优于其他全模态 LLM;在 Seed-TTS-Eval 上,它在全模态 LLM 中取得了最低的 WER,同时保持了具有竞争力的语音自然度。在 SwDA-500 上进行的语音到动作自动和人工评估中,它在大多数指标上排名第一或第二,与使用独立音频到动作阶段的级联系统相当或更优,人工评分者更偏好其动作而非 EMAGE,并认为其与 LOM 教师模型相当。最后,它在 4.32 秒内完成完整响应(RTF 0.78),比匹配的 LOM 级联快五倍以上,表明联合生成避免了独立动作推理的延迟代价。
训练数据流水线使用带有伴随语音动作教师模型的伪标注来创建口语动作生成的配对监督,双指标评分系统驱动课程学习,逐步将模型暴露于更大分位数的评分样本。最终混合包含 ASR、TTS、口语动作和文本到文本任务,其中最大的阶段是 TTS,最小的是口语动作阶段。TTS 阶段拥有最多的样本和小时数,而口语动作阶段最小,样本数约为 TTS 阶段的四分之一。直接在完整的未排序口语动作语料库上训练会导致发散,因此采用了四个子阶段的课程学习,逐步增加双指标分数的分位数。逐阶段的教师参考 Fréchet Gesture Distance 从口语动作阶段第一个子阶段的 0.3974 改善到最后一个子阶段的 0.3040。最终混合包含一个从六个数据集抽取的文本到文本组件,以保留通用文本响应规划和多轮对话行为。
在 Seed-TTS-Eval 上,Motion-Omni-Q7 在全模态 LLM 中取得了最低的词错误率 2.62%,尽管几个专用 TTS 系统的 WER 更低。其语音自然度代理分数为 3.77,高于某些专用 TTS 系统但低于其他系统。Motion-Omni-Q7 在全模态 LLM 中取得了最低的 WER,同时还能生成伴随语音动作。在相同的仅语音指标上,几个专用 TTS 系统的 WER 低于 Motion-Omni-Q7。Motion-Omni-Q7 的自然度代理分数超过了几个专用 TTS 系统,但落后于顶尖系统。
Motion-Omni-Q7 在八项指标中的七项上排名第一或第二,在节拍相关性、多样性、面部几何和唇形同步分数上领先所有在动作推理时不调用 LOM 教师模型的系统。唯一优于它的系统是 LOM 教师参考级联,这些级联使用了为其提供训练目标的同一模型,而集成模型避免了独立的音频到动作阶段,同时在动作质量上与强级联相当。在非 LOM 推理系统中,Motion-Omni-Q7 取得了最高的节拍相关性、多样性以及最佳的面部和唇形同步指标。在推理时运行 LOM 的教师参考级联在某些指标上超过集成模型,但它们需要额外的音频到动作阶段。Motion-Omni-Q7 取得了最低的教师参考 FGD,表明其对 LOM 生成的动作分布具有较高的保真度。
所提出的模型在 SwDA-500 评估集上实现了快于实时的响应,在约 4.3 秒内完成语音和动作生成。与将语音和动作阶段分开的级联基线相比,集成方法大幅降低了延迟,最接近的级联也慢了五倍以上。虽然某些级联在速度或质量上接近该模型,但没有一个能在这两个维度上同时匹配。所提出的模型以低于 1 的实时因子快于实时响应,而所有级联都慢于实时。使用相同语音模型但独立动作阶段的级联比所提出的模型慢五倍以上。使用不同动作模型的级联在响应时间上匹配所提出的模型,但牺牲了质量,而另一个级联提高了质量但慢了五倍以上。
评估设置结合了用于口语动作训练的伪标注流水线和双指标课程学习、混合任务最终阶段,以及与专用 TTS 系统和级联动作基线的比较。Motion-Omni-Q7 在全模态 LLM 中取得了最低的词错误率、具有竞争力的语音自然度和一流的伴随语音动作质量,在动作保真度上与教师参考级联相当,同时避免了独立的音频到动作阶段。它还实现了快于实时的响应,与将语音和动作生成分开的级联相比大幅降低了延迟,且没有任何级联能同时在速度和质量上匹配它。