HyperAIHyperAI

Command Palette

Search for a command to run...

GLOBE:面向零样本说话人自适应文本到语音合成的全球口音高质量英语语料库

Wenbin Wang Yang Song Sanjay Jha

摘要

本文介绍了 GLOBE,一个包含全球口音的高质量英语语料库,专门用于解决当前零样本说话人自适应文本到语音合成(TTS)系统在适应带口音说话人时泛化能力差的问题。与常用的英语语料库(如 LibriTTS 和 VCTK)相比,GLOBE 的独特之处在于其包含了来自 23,519 位说话人的话语,覆盖全球 164 种口音,并提供了这些说话人的详细元数据。与其原始语料库(即 Common Voice)相比,GLOBE 通过严格的过滤和增强过程显著提高了语音数据的质量,同时填补了所有缺失的说话人元数据。最终整理的 GLOBE 语料库包含 535 小时的语音数据,采样率为 24 kHz。我们的基准测试结果表明,在 GLOBE 语料库上训练的说话人自适应 TTS 模型能够合成具有更好说话人相似度和可比自然度的语音,优于在其他流行语料库上训练的模型。我们将在论文被接收后公开发布 GLOBE。GLOBE 数据集可在 https://globecorpus.github.io/ 获取。

一句话总结

新南威尔士大学的研究人员推出了GLOBE,这是一个535-hour535\text{-hour}535-hour24kHz24\,\text{kHz}24kHz的英语语料库,包含来自164种全球口音的23,51923{,}51923,519位说话人,通过对Common Voice进行严格过滤和完整元数据整理而成,使得零样本说话人自适应TTS在说话人相似度上优于在LibriTTS或VCTK上训练的模型,同时自然度相当。

核心贡献

  • 推出GLOBE,一个源自Common Voice的精选英语语音语料库,包含来自164种全球口音的23,519位说话人的535小时高质量音频,并对噪声、带宽和转写准确性进行了严格过滤。
  • 为所有说话人提供完整的说话人元数据(口音、年龄、性别),填补了原始Common Voice数据集中的空白,从而支持更个性化的TTS研究和偏差缓解。
  • 基准实验表明,在GLOBE上训练的零样本说话人自适应TTS模型在说话人相似度上优于在LibriTTS或VCTK上训练的模型,自然度相当,并且对口音化声音的泛化能力更强。

引言

深度学习的最新进展推动了文本到语音(TTS)系统生成高度逼真的语音,使研究转向更复杂的任务,如零样本说话人自适应或声音克隆。该技术允许模型仅凭几秒音频模仿新说话人的声音,从而拓宽了TTS的实用性。然而,一个关键限制是对口音化声音的泛化能力较差,这主要是因为流行的英语TTS数据集(如LibriTTS和VCTK)覆盖的口音范围较窄,其中VCTK仅覆盖11种口音。尽管Common Voice数据集提供了超过3,000小时和337种口音,但它存在噪声、信号带宽有限、发音错误以及说话人元数据不完整或混乱的问题。为解决这些问题,作者推出了GLOBE,一个基于Common Voice构建的高质量英语语料库,该语料库过滤了低质量音频、重新对齐文本、清理口音标签并填补缺失的元数据。GLOBE提供了来自164种口音的23,519位说话人的535小时语音,在音频质量上与LibriTTS相当,同时具有更优越的口音多样性和详细的说话人信息,从而提升了零样本说话人自适应TTS模型的泛化能力。

数据集

作者通过组合和处理多个现有的英语多说话人数据集来构建GLOBE语料库。主要来源包括:

  • VCTK:来自109位英语说话人的44小时48 kHz语音,每位说话人朗读约400个新闻句子。包含11种口音的口音和性别标签。
  • LibriTTS:来自2,456位说话人的585小时24 kHz音频,源自LibriSpeech,专为TTS应用设计。
  • LibriTTS-R:LibriTTS的增强版本,音频质量更高,保留相同的585小时和2,456位说话人。
  • Common Voice:来自88,904位志愿说话人的3,347小时48 kHz音频。作者指出,该数据集虽然规模大,但由于音频质量较差,通常不适合TTS,因此需要大量过滤。

数据处理流程包含三个阶段:

  1. 语音样本预处理与过滤:作者使用三个标准去除低质量话语。首先,根据波形幅度分布估计信噪比(SNR),并排除SNR低于0 dB的任何话语。其次,通过查找功率谱中低于峰值平均值至少50 dB的最高频率来确定实际信号带宽,并去除带宽低于12 kHz的话语。第三,使用语音活动检测(VAD)工具识别内部静音,并丢弃包含超过930毫秒连续静音的话语。该阈值源自LibriTTS干净子集中观察到的最大内部静音时长。

  2. 语音文本对齐:由于Common Voice的词错误率较高,作者提高了转写准确性。他们使用Whisper转写所有话语,然后使用加权有限状态转换器系统将原始数据集文本和转写文本都规范化为口语形式。他们计算两个版本之间的词级编辑距离。编辑距离大于1的话语被移除。他们还丢弃因连续单词重复导致编辑距离为1的片段,因为这通常表示对不熟悉单词的重复发音。

  3. 说话人信息细化与语音后处理:作者填补了口音、年龄和性别的缺失元数据。首先,他们合并或移除由少于五位说话人或十个话语表示的口音标签,并移除无意义的标签,如“not bad”和“A'lo”。然后,对于每个元数据类别,他们使用来自11,000位说话人的话语构建训练集,并构建标签平衡的验证集和测试集,每个至少包含1,000位说话人。他们使用这些子集训练三个说话人信息预测模型(每个类别一个),应用平方根采样来处理口音标签的长尾分布。这些模型在测试集上的准确率分别为口音97.22%、年龄99.55%和性别99.95%,并用于填补缺失的说话人元数据。最后,他们对所有话语应用后处理:基于VAD结果去除首尾静音,并使用语音增强工具抑制背景噪声。

生成的GLOBE语料库与源数据集一起总结在表1中,并用作TTS模型的训练数据。

方法

作者提出了一套全面的数据处理流程来构建GLOBE语料库,确保为文本到语音(TTS)模型提供高质量的训练数据。该流程包含三个主要阶段:语音样本预处理与过滤、语音文本对齐、以及说话人信息细化与后处理。

在初始阶段,过滤低质量语音样本,以防止对TTS模型性能产生不利影响。通过波形幅度分布分析估计信噪比(SNR),排除SNR低于0 dB的话语。通过查找功率谱中低于峰值平均值至少-50 dB的最高频率来确定实际信号带宽,去除低于12 kHz的话语。此外,使用语音活动检测工具检测到包含超过930毫秒连续内部静音的话语也会被移除,以避免对时长预测器产生负面影响。

为解决源数据集中的高词错误率问题,作者使用Whisper进行初始转写以提高转写准确性。基于加权有限状态转换器的系统对文本进行规范化,并计算原始文本与转写文本之间的词级编辑距离。编辑距离大于1的话语,或因连续单词重复导致编辑距离为1的话语,均被消除。

最后阶段涉及细化说话人元数据(包括口音、年龄和性别)并应用语音后处理。代表性不足的口音被合并或移除。为填补缺失的元数据,作者开发了三个说话人信息预测模型。参考框架图:

这些模型利用预训练的HuBERT Large模块,后接EPACA-TDNN来预测口音、年龄和性别。由于说话人口音标签的长尾分布,如下图所示:

在训练过程中采用平方根采样方法来缓解类别不平衡。这些模型在测试集上实现了高准确率,并用于填补缺失的元数据。最后,后处理基于语音活动检测结果去除首尾静音,并使用语音增强工具抑制背景噪声。

对于TTS实验,作者使用YourTTS作为基线并进行特定修改。移除语言嵌入以专注于英语。为彻底评估数据集影响并避免预训练模型引入的偏差,将预训练的说话人编码器替换为可训练的EPACA-TDNN编码器。此外,调整模型参数以支持24 kHz音频数据的训练。

实验

第一个实验使用客观指标(NMOS、UT-MOS、WER、SMCS、SEVS)和主观评分评估了GLOBE及多个流行英语数据集中的真实语音质量。结果表明,GLOBE在自然度上与LibriTTS相当,同时优于Common Voice,并且表现出比其他数据集更丰富的说话人多样性。第二个实验在每个数据集上训练了修改后的YourTTS模型,并评估了合成语音。在GLOBE上训练的模型实现了与LibriTTS训练模型相当的自然度,并表现出对多样口音的优越泛化能力,在GLOBE测试集上测试时说话人相似度没有统计显著的下降,而其他数据集训练的模型则不然。

GLOBE是一个大型多说话人语料库,包含来自23,519位说话人的535小时语音,覆盖164种口音,并包含口音、年龄和性别标签,而其他语料库在规模和说话人多样性上各不相同。实验表明,在GLOBE上训练的模型对多样口音的泛化能力更好,在口音丰富的测试集上说话人相似度下降幅度更小,而其他数据集训练的模型则下降更大。GLOBE在所列语料库中总时长排名第二,为535小时,说话人数量排名第二,为23,519,同时覆盖164种口音。Common Voice拥有最多的时长和说话人,但因音频质量差而被认为不适合TTS,GLOBE提供了更均衡的高质量24 kHz音频替代方案。在评估中,GLOBE训练的模型在口音多样的测试集上保持了说话人相似度,没有统计显著的下降,而LibriTTS等其他数据集训练的模型则不然。VCTK语料库仅有109位说话人和11种口音,由于说话人多样性有限,导致说话人相似度得分略低。

在真实语音样本中,大多数数据集在自然度得分上相近,但Common Voice除外,其得分明显较低,且统计上劣于GLOBE。GLOBE还显示出最高的说话人相似度得分,而其词错误率与LibriTTS和LibriTTS-R相当,但高于VCTK。GLOBE的自然度在统计上与LibriTTS无显著差异,但统计上优于Common Voice。Common Voice在所有数据集中自然度最低,词错误率最高。GLOBE实现了最高的说话人相似度得分,而VCTK和Common Voice并列最低。

修改后的YourTTS模型在LibriTTS-R上训练时自然度表现最佳,LibriTTS和GLOBE紧随其后,且无显著差异。在Common Voice上训练导致自然度显著下降,而VCTK因说话人多样性有限而表现出较低的说话人相似度。在口音更多样的测试集上,GLOBE训练的模型表现出最强的泛化能力,说话人相似度下降最小。LibriTTS-R训练在LibriTTS测试集上产生最高的自然度,LibriTTS和GLOBE在统计上并列。Common Voice训练显著降低了自然度,并相比其他数据集增加了词错误率。VCTK训练导致说话人相似度略低,归因于说话人多样性有限。在GLOBE测试集上,所有模型的说话人相似度均有所下降,但GLOBE训练的模型下降最小,表明对口音的适应性更好。

该评估比较了在GLOBE上训练的TTS模型与其他语料库上训练的模型,使用自然度、说话人相似度和词错误率作为指标。GLOBE训练的模型对口音多样的测试集表现出最强的泛化能力,说话人相似度下降最小,而Common Voice因音频质量差而始终产生较低的自然度和较高的词错误率。VCTK由于说话人和口音多样性有限,导致说话人相似度略差。总体而言,GLOBE提供了一个均衡、高质量的替代方案,在口音鲁棒性上匹配或优于其他数据集,同时不牺牲自然度。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供