HyperAIHyperAI

Command Palette

Search for a command to run...

SwanTale:面向指令与零样本任务的统一多说话人语音及音频生成模型

Yu Zhang Ruiqi Li Changhao Pan Ke Lei Xiang Yin Cheng Yang

摘要

语音与音频生成在动画配音、有声剧、电影、广告、游戏、播客及短视频制作中需求广泛。在这些场景中,创作者可能需要设计无参考录音的语音、用自然语言控制说话人风格、支持包含环境与音效的声学场景,并在后续复用所设计的语音。因此,同时支持指令任务和零样本任务的多说话人语音与音频生成至关重要。指令任务需要关于环境、说话人风格及细粒度内容的描述,而零样本任务则使用参考音频结合相同的细粒度内容。我们从数据与模型两方面应对这些任务。首先,我们提出 SwanData-Caption,该方案清洗原始语音与音频数据,增加针对性的合成覆盖,并标注多样化且准确的多层级描述。其次,我们提出 SwanTale,一个支持零样本与指令任务的多说话人富有表现力的语音与音频生成模型。我们引入 SwanVAE 以支持高质量的多音频模态生成。随后,我们采用奖励条件质量控制与 Engram 条件化,并结合统一混合专家(Unified MoE)进行多任务与多音频模态建模。此外,我们使用课程学习与 GRPO 后训练,使模型逐步学习并强化其能力。实验结果表明,SwanTale 在多项关键的零样本与指令指标上处于领先地位,在两种任务中均取得最佳表现力得分,并支持涉及多说话人语音与音频的复杂指令生成。

一句话总结

字节跳动与浙江大学的研究人员提出 SwanTale,一个统一的多人语音与音频生成模型,面向指令与零样本任务,融合了 SwanVAE、奖励条件质量控制、Engram 条件、统一混合专家(Unified MoE)、课程学习与 GRPO 后训练,在多项关键零样本与指令指标上领先,取得最佳表现力评分,并支持复杂的多人音频生成。

核心贡献

  • SwanData-Caption 提供一条数据流水线,清洗原始语音与音频,补充定向合成覆盖,并标注涵盖环境、说话人风格与细粒度内容的多层次描述,配合风格-角色库与质量过滤,生成高质量训练数据。
  • SwanTale 是一个统一的多人语音与音频生成模型,通过 SwanVAE 实现多模态生成,支持零样本与指令任务,结合奖励条件质量控制、Engram 条件、带有任务与音频路由器的统一混合专家架构、课程学习与 GRPO 后训练。
  • 实验结果表明,SwanTale 在多项关键零样本与指令遵循基准上领先,在两类任务中均取得最佳表现力评分,并能在单一模型中实现涉及多人语音与音频的复杂指令生成。

引言

近期的零样本文本转语音系统能够从短参考片段克隆说话人,但媒体制作通常需要从零开始设计声音,并通过自然语言指令控制整个声学场景,包括环境与音频效果。现有的指令 TTS 模型仅生成语音,并依赖分解的属性标签,而下游音频流水线可能导致时间与声学漂移。在指令与零样本条件下同时支持富有表现力的多人语音、场景音频、歌唱与音乐生成,仍是一个开放挑战,原因在于数据稀缺、任务兼容性与多模态复杂性。作者通过构建 SwanData-Caption(一条从语音为中心的媒体中生成丰富标注描述的数据流水线)并提出 SwanTale(一个统一模型,结合变分自编码器、带质量控制的基于流的 Transformer 与混合专家路由、课程学习以及 GRPO 后训练,从描述或参考音频生成多样化音频)来应对这一挑战。

数据集

作者构建了 SwanData-Caption,一个包含约 7000 万条细粒度标注音频记录的大规模数据集,用于训练 SwanTale 模型。该数据集结合了真实媒体风格音频与定向合成扩展,并通过多阶段流水线处理,包括分离、说话人日志化、转录、对齐、自动描述标注与严格精炼。

数据集构成与来源

  • 真实媒体风格数据:内部、以语音为中心的语料库,涵盖短剧、广告、动画等类似内容。这些录音包含多样的说话人密度、录音条件、角色风格、场景位置、声场、持续背景效果与局部音频效果。
  • 定向合成子集:由音素感知 TTS 教师生成的三个子集,每个包含 10 万条语句,旨在填补罕见场景的缺口:
    • 老年语音:平均时长约 10 秒;扩展人口年龄覆盖。
    • 中英文短句:单个词、名称与短句;平均时长约 1.5 秒;提升亚秒级口语内容的稳定性。
    • 挑战性发音目标:包含多音字、专有名词、品牌名、英文插入与混合语言短语的中文文本;平均时长约 10 秒;发音提示输入教师模型,目标文本保持不变。

各子集关键细节

  • 真实数据被切分为语音片段:单人片段 1–60 秒,多人片段最长 120 秒(尽可能至少包含两次说话人切换)。过滤后保留的语音集平均每段约 10 秒。
  • 合成老年与发音子集平均约 10 秒;短句平均约 1.5 秒。
  • 所有子集均使用相同的标注流水线自动生成描述,并对动画、短剧/电影/电视剧以及广告/数字人内容应用风格-角色矩阵,以引导更丰富的说话人描述。

数据使用方式

  • 整个 SwanData-Caption 混合数据(约 7000 万条描述记录)用于训练 SwanTale,该模型从结构化描述生成富有表现力的语音与音频。
  • 每条描述记录包含三个字段:Environment(场景位置、声场印象、持续背景声音)、Speakers(每个实际说话人的稳定说话人特征)以及 Content(细粒度局部风格、情感与局部音频效果,并带有说话人标记的文本)。该模式同时支持零样本与基于指令的文本转语音。
  • 未提及明确的训练/验证划分;该数据集作为模型的训练语料。

处理与元数据构建

  • 预处理(SwanData-Speech 主干):对于混合媒体音频,使用 Ultimate Vocal Remover 分离人声与背景流。说话人日志化使用 3D-Speaker 工具包(VAD、CAM++ 嵌入、聚类)生成粗分段。ASR 在人声流上使用 Seed-ASR 2.0 执行;SenseVoice ASR 提供发音检查。SwanAligner 将文本与人声流对齐并存储停顿证据,标点随后由描述标注器提供。
  • 描述标注:Seed2.0 Lite 作为标注器,接收音频、去标点文本与描述提示。提示强制严格的输出格式(连续说话人 ID、语言保留等),并包含针对数据集的示例。风格-角色库为三个媒体族提供软先验,引导描述稳定的说话人特征与瞬时表达,而不引入不可听标签。
  • 数据精炼
    • 波形过滤:若 PESQ < 2.0、STOI < 0.85、SI-SDR < 0 或 MOS < 2.5(使用 DNSMOS 与 torchaudio-SQUIM),则移除语音样本。时长过滤保留 1 至 120 秒的片段。
    • 描述规范化:SwanVerifier 根据人声流检查性别/年龄一致性。利用对齐数据规范化标点,当与停顿证据匹配时保留表达性标记(感叹号、问号)。描述有效性检查强制正确的说话人索引、匹配的片段与文本一致性。
    • 人工验证:审核员检查转录准确性、描述质量、音频质量与表现力。他们纠正 ASR 错误、说话人归属、遗漏效果与过度解读。表现力通过组内最佳-最差比较进行审核,在匹配组内根据自然度、情感强度、韵律变化与上下文适当性选出最具与最不具表现力的候选。

方法

作者利用全面的数据处理流水线,为复杂的多人语音与音频数据生成细粒度描述。如下图所示:

该流水线包含四个主要模块:覆盖设计、SwanData-Speech 预处理、描述标注与数据精炼。覆盖设计融合了媒体风格的真实数据与定向合成子集,以确保多样的说话人密度、录音条件以及老年语音、挑战性发音等罕见场景。在预处理阶段,作者分离人声与残余背景流,进行说话人日志化,并应用 ASR 及随后的对齐,以准备干净的语音片段与可靠的文本锚点。描述标注阶段利用大型多模态模型,将原始音频与文本转换为统一的多层次描述,包含环境、说话人与内容字段,并受风格-角色库引导。最后,数据精炼应用波形过滤、描述规范化与人工验证,以确保高音质与表现力。

SwanTale 在 SwanVAE 生成的连续声学潜变量上运行,SwanVAE 是一个 48 kHz 波形-潜变量自编码器。SwanVAE 的架构如下图所示:

编码路径使用局部抗混叠卷积编码器与高斯 VAE 瓶颈,解码器则采用 Transformer 重采样模块合成波形块。为平衡重建保真度与可学习性,作者应用重建与对抗训练目标,以及潜变量对齐目标(如生成对齐与声学读出),以塑造下游流模型的后验均值。

核心生成主干是一个非因果的基于流的 Transformer,采用流匹配,避免了自回归的不稳定性。如下图所示:

该架构将零样本与指令任务的输入映射到潜音频轨迹。条件堆栈将描述级控制与文本对齐分离,使用 Qwen 系列文本编码器处理描述,轻量级 Transformer 处理口语内容。为处理语音、环境音频与音乐中的异质声学模式,作者引入了 Unified MoE,一个基于描述条件的动态容量稀疏前馈模块。Unified MoE 采用任务路由器进行样本级共享专家分配,音频路由器进行帧级动态 Top-P 路由,根据生成任务、声学状态与扩散时间分配模型容量。

训练过程遵循课程学习策略。作者首先训练一个零样本基模型,然后使用密集前馈层将其适配到干净语音上的密集描述条件。随后,扩展到完整的描述混合数据并引入 Unified MoE,接着在高表现力与高质量子集上进行监督微调。为解决发音与说话人属性控制中反复出现的错误,作者应用奖励引导的 GRPO 后训练。该阶段将确定性流 ODE 转换为边缘保持的 SDE,以进行随机轨迹探索,优化特定任务奖励(如音素准确率与说话人相似度),同时通过监督锚点回放保留多人语音与音频能力。推理时,应用两阶段分解的无分类器引导规则,分别控制内容一致性与声学属性。

实验

评估涵盖 SwanVAE 在语音、歌唱、通用音频与音乐上的重建,零样本 TTS 在独白与对话上的表现,以及通过 InstructTTSEval、SwanBench-Scene 与 SwanBench-Caption 进行的指令生成。SwanVAE 以紧凑的 25 Hz 潜表示提供有竞争力的声音重建,而 SwanTale 在零样本设置中实现了最佳音色一致性与表现力,提升源于表现力数据过滤与 GRPO 后训练。在指令任务中,SwanTale 在显式声学控制与场景适当性上领先,尽管角色扮演仍具挑战性,消融实验证实 Unified MoE 与更大的描述编码器显著提升了指令准确率、音质与表现力。

SwanData-Caption 模式将音频描述组织为三个字段:Environment 描述场景级声学背景与录音上下文,Speakers 列举每个说话人的感知角色与稳定声音习惯,Content 呈现口语对话,并内联标注局部表达风格与音频效果。Environment 包含持续背景声音(如交通或风声)以及录音空间线索(如混响)。Content 将语音包裹在说话人标签中,局部音频效果包裹在效果标签中,并标注情感、音量或节奏的变化。

该表比较了音频自编码器与编解码器的潜变量配置,涵盖连续与离散表示,具有不同的帧率、潜变量大小与标称比特率。SwanVAE 使用 25 Hz 连续潜变量,维度为 96,产生 38.40 kbps,高于大多数连续基线但低于 SAME-L 的 44.10 kbps。离散编解码器通过高帧率与残差矢量量化实现低得多的标称速率(7.75–24.00 kbps)。SwanVAE 在 25 Hz 下生成 96 维连续潜变量,对应标称速率 38.40 kbps。离散编解码器 DAC 与 EnCodec 通过高帧率(86–150 Hz)与多码本量化,达到低至 7.75 kbps 的标称速率。连续表示的帧率从 10.77 Hz 到 25 Hz,标称速率从 12.80 到 44.10 kbps。

在语音上,SwanVAE 取得了最佳 PESQ 与 MCD,同时在 STOI 与 ViSQOL 上接近顶级基线。在歌唱声音上,它在 PESQ、STOI 与 MCD 上排名第一,在 ViSQOL 上排名第二。两个领域持续较低的 MCD 表明 25 Hz 潜表示有效保留了声音频谱结构。SwanVAE 在语音重建中以最高 PESQ(4.17)与最低 MCD(0.96)领先,其 STOI 与 ViSQOL 接近最强竞争者。对于歌唱声音,SwanVAE 获得了最佳 PESQ、STOI 与 MCD,以及第二好的 ViSQOL。语音与歌唱声音上的低 MCD 值表明,尽管帧率低,25 Hz 潜速率仍保留了精细的频谱细节。

在通用音频上,SwanVAE 取得了最高 ViSQOL 与第二低的 LSD,仅 LSD 上落后于 Stable Audio Open 1.0。对于音乐,EnCodec 在两个指标上均领先,而 SwanVAE 在 ViSQOL 上排名第二,LSD 上排名第三。同一 SwanVAE 检查点用于所有领域,未进行领域特定选择。SwanVAE 在通用音频上获得最佳 ViSQOL 与第二好的 LSD,除 LSD 上 Stable Audio Open 1.0 外,优于所有其他系统。在音乐上,SwanVAE 在 ViSQOL 上排名第二,LSD 上排名第三,EnCodec 在两个指标上均取得最高分。

SwanTale 在独白与对话零样本 TTS 中均取得了最佳音色一致性、表现力丰富度与表现力层级,并在对话中 SpeechJudge 领先。然而,其他系统在内容准确度与声音保真度上更优:独白中 FishSpeech,对话中 SoulX-Podcast。相比 SwanVoice 的提升源于训练配方,加入了过滤后的高表现力数据、基于 ASR 的发音检查、奖励条件质量控制与 GRPO。SwanTale 在独白与对话设置中,音色一致性、表现力丰富度与表现力层级均排名第一。在独白中,FishSpeech 在比较系统中取得了最低内容错误与最高声音保真度。在对话中,SoulX-Podcast 在声音保真度与内容错误上表现最佳,而 SwanTale 在 SpeechJudge 上领先。SwanTale 在两个零样本设置的所有五项报告指标上均持续优于 SwanVoice。提升归因于高表现力数据、基于 ASR 的过滤、奖励条件质量控制与 GRPO。

SwanVAE,一个连续音频自编码器,在语音、歌唱、通用音频与音乐的重建上与离散编解码器及其他模型进行比较;它始终保留声音频谱结构,在语音与歌唱声音上达到顶级感知质量,同时在通用音频与音乐上保持竞争力。SwanTale 在独白与对话的零样本 TTS 表现力上接受评估,其在音色一致性与表现力层级上领先,但在内容准确度与声音保真度上落后,提升归因于高表现力数据、基于 ASR 的过滤与奖励条件质量控制。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供