HyperAIHyperAI

Command Palette

Search for a command to run...

LibriTTS-R:一个经过修复的多说话人文本转语音语料库

Yuma Koizumi Heiga Zen Shigeki Karita Yifan Ding Kohei Yatabe Nobuyuki Morioka Michiel Bacchiani Yu Zhang Wei Han Ankur Bapna

摘要

本文介绍了一个名为“LibriTTS-R”的新语音数据集,专为文本转语音(TTS)应用而设计。该数据集通过对LibriTTS语料库应用语音修复技术而生成,LibriTTS包含来自2,456位说话人的585小时、24 kHz采样率的语音数据及对应的文本。LibriTTS-R的组成样本与LibriTTS完全相同,仅提升了音质。实验结果表明,与LibriTTS相比,LibriTTS-R的真实样本音质显著提高。此外,使用LibriTTS-R训练的神经端到端TTS系统,其语音自然度与真实样本相当。该语料库可免费从http://www.openslr.org/141/下载

一句话总结

来自谷歌和东京农工大学的研究人员推出了 LibriTTS-R,这是一个经过修复的 585-hour585\text{-hour}585-hour24kHz24\,\text{kHz}24kHz 多说话人 TTS 语料库,包含 245624562456 位说话人,通过对 LibriTTS 应用语音修复技术生成,同时保持样本完全一致。该语料库在音质上显著优于 LibriTTS,并使神经端到端 TTS 的自然度可与真实录音相媲美,可在 openslr.org/141 免费获取。

核心贡献

  • 推出了 LibriTTS-R,一个音质提升的语音数据集,通过将基于文本信息的语音修复模型 Miipher(该模型使用 w2v-BERT 特征清理器和 Wave-Fit 神经声码器)应用于 585 小时的 LibriTTS 语料库生成,同时保持样本和文本完全一致。
  • 主观实验表明,LibriTTS-R 的真实录音样本在音质上显著优于 LibriTTS,且基于 LibriTTS-R 训练的神经端到端 TTS 模型所生成的语音自然度可与真实录音样本相媲美。
  • 该语料库在非限制性许可下公开发布于 http://www.openslr.org/141/,可免费下载,以支持可复现的 TTS 研究。

引言

文本到语音(TTS)系统借助深度学习取得了显著进展,在基于录音室质量录音进行训练时,能够实现接近自然的朗读风格合成。然而,一个主要瓶颈依然存在:缺乏大规模、公开可用且高质量的语音数据集。许多最先进的 TTS 模型依赖超过 100 小时的专有录音室数据,这些数据无法公开获取,阻碍了研究的可复现性和更广泛的研究进展。与此同时,语音修复(SR)技术不断进步,利用生成模型将受损音频(如带混响的讲座或历史录音)转换为录音室级质量。

作者通过将 SR 技术应用于现有公开语料库来解决数据稀缺问题。他们推出了 LibriTTS-R,这是 LibriTTS 数据集的音质提升版本,包含来自 2,456 位说话人的 585 小时语音。为清理原始录音,他们利用了名为 Miipher 的基于文本信息的 SR 模型,该模型结合了 w2v-BERT 特征清理器和 Wave-Fit 神经声码器。主观评估表明,基于 LibriTTS-R 训练的 TTS 模型在语音自然度上显著优于基于原始 LibriTTS 训练的模型,达到了与真实录音相当的质量。该语料库在非限制性许可下发布,为加速 TTS 研究提供了宝贵的公共资源。

数据集

数据集构成与来源

作者的工作基于 LibriTTS 语料库,这是一个专为文本到语音(TTS)研究设计的大规模多说话人语音数据集。该数据集包含来自 2,456 位说话人的 585 小时语音,采样率为 24 kHz,并配有相应的文本。音频和文本均重新派生自原始 LibriSpeech 材料,具体为 LibriVox 的 MP3 文件和 Project Gutenberg 的文本,以修复原始语料库中存在的采样率和文本归一化等问题。

各子集的关键细节

  • LibriTTS(基础数据集): 585 小时,2,456 位说话人,24 kHz。它被用作作者数据处理流程的起点。作者指出,与 LJspeech 等较小的高质量数据集相比,LibriTTS 的音质较低,这影响了 TTS 模型输出的质量。
  • 用于语音修复的专有训练数据集: 2,680 小时的成对噪声语音和录音室质量语音。目标语音包括 670 小时来自澳大利亚、英国、印度、尼日利亚和北美说话人的录音室英语录音,采样率为 24 kHz。
  • 噪声来源: TAU Urban Audio-Visual Scenes 2021 数据集、内部收集的噪声片段(模拟咖啡馆、厨房、汽车环境)以及其他噪声源。
  • 增强模式: 噪声语音通过将语音与噪声以 5 dB 至 30 dB 的信噪比(SNR)混合生成。根据是否存在混响和编解码器伪影,创建了四种模式。房间脉冲响应(RIR)使用镜像法随机生成。编解码器伪影通过随机应用 MP3、Vorbis、A-law、自适应多速率宽带(AMR-WB)或 OPUS 并采用随机比特率进行模拟。

数据使用方式

  • 作者将语音修复(SR)模型应用于 LibriTTS,以创建公开、大规模、高质量的 TTS 数据集。
  • 为训练 SR 模型,他们使用上述专有成对数据集。特征清理器预训练 150k 步,WaveFit 神经声码器预训练 1M 步,以从干净的 w2v-BERT 特征重建波形。随后,WaveFit 声码器使用预训练特征清理器生成的清理特征进行 350k 步的微调。

处理与元数据构建

  • 噪声数据集通过将语音与噪声按指定 SNR 范围混合生成。
  • 使用镜像法通过随机 RIR 生成添加混响。
  • 通过随机选择编解码器和比特率引入编解码器伪影。
  • 除为训练修复模型而进行的噪声和干净语音样本配对外,未描述其他元数据构建过程。

方法

作者利用基于文本信息的参数化重合成语音修复(SR)模型 Miipher 来清理含噪 TTS 数据集,并确保对伪影的鲁棒性。该方法专门针对音素掩蔽和音素删除等具有挑战性的退化模式。整体数据处理流程如下图所示:

在该框架中,模型首先从含噪波形中提取 w2v-BERT 特征。与依赖传统 log-mel 频谱图不同,使用在大量退化语音上训练的 w2v-BERT 特征增强了模型的鲁棒性。为进一步提升修复性能,系统引入了以转录文本为条件的语言特征。具体而言,PnG-BERT 从相应文本中提取这些语言特征。随后,基于 DF-Conformer 的特征清理器预测干净波形的 w2v-BERT 特征。最后,WaveFit-5 神经声码器合成修复后的波形。

在训练过程中,作者使用包含 2,680 小时噪声语音和录音室质量语音对的专有数据集。目标数据集包括 670 小时采样率为 24 kHz 的录音室英语录音。噪声语音通过将语音与各种噪声源以 5 dB 至 30 dB 的信噪比混合生成。数据集进一步通过随机房间脉冲响应生成器模拟的混响以及随机应用 MP3、Vorbis 和 OPUS 等格式并以不同比特率引入的编解码器伪影进行增强。

训练过程采用多阶段方法。首先,特征清理器和 WaveFit 神经声码器分别预训练 150,000 步和 1,000,000 步。在此阶段,WaveFit 被训练为直接从干净的 w2v-BERT 特征重建波形。随后,WaveFit 声码器使用预训练特征清理器生成的清理 w2v-BERT 特征进行 350,000 步的微调。

在推理流程中,系统从转录文本计算 PnG-BERT 特征,并通过说话人编码器从原始 24 kHz 波形中提取说话人嵌入。对于短于 2 秒的音频样本,波形会被重复以计算稳定的说话人嵌入。由于 w2v-BERT 模型以 16 kHz 输入运行,原始 LibriTTS 样本在特征提取前会相应地下采样。最终修复后的 24 kHz 波形使用 WaveFit 声码器合成。

实验

以英语母语者为对象的主观听力测试将 LibriTTS-R 与原始 LibriTTS 语料库进行了比较,首先比较真实录音样本,然后比较基于各语料库训练的 TTS 模型输出。虽然真实录音样本的自然度 MOS 得分相近,但并排偏好测试显示 LibriTTS-R 被显著偏好,频谱图分析确认了退化语音得到修复。对于 TTS,基于 LibriTTS-R 训练的模型始终优于基于 LibriTTS 训练的模型,尤其是在使用更大的 Train-960 集合时,这提升了对大多数说话人的自然度和音质。研究结果表明,LibriTTS-R 是更优的训练语料库,能够实现与人类语音相当的高质量 TTS 合成,尽管修复后的数据集中偶尔存在失真的样本。

该表报告了在真实录音样本上比较 LibriTTS 和 LibriTTS-R 的主观评估结果。LibriTTS-R 在两个测试子集上均获得更高的 MOS 得分,尽管自然度差异在统计上不显著。相比之下,并排偏好测试显示 LibriTTS-R 在音质上有显著提升,正得分表明明确的偏好。LibriTTS-R 在 test-clean 和 test-other 上的 MOS 均略有提升,但增益不显著。SxS 偏好得分强烈偏向 LibriTTS-R,其中 test-other 的差距大于 test-clean。显著的 SxS 差异表明,LibriTTS-R 的修复主要增强了感知音质而非自然度。

基于 LibriTTS-R 训练的模型在几乎所有说话人 ID 上均始终优于基于 LibriTTS 训练的模型,使用 Train-960 子集时增益最大。唯一例外是说话人 ID 19,其中 LibriTTS-R Train-460 略优于 Train-960,但差异不显著。使用 LibriTTS Train-960 甚至可能比 Train-460 降低质量,这可能是由于 train-other-500 子集中的退化样本所致。LibriTTS-R 训练数据在几乎所有说话人上均产生显著高于 LibriTTS 的平均意见得分。将 train-other-500 子集添加到 LibriTTS-R(Train-960)可提升大多数说话人相对于 Train-460 的质量,而对 LibriTTS 进行相同添加则无此效果。最佳 LibriTTS-R 模型的平均意见得分超过 4.0,而 LibriTTS 模型在所有说话人上均低于 3.5。

并排偏好测试表明,听者始终更偏好基于 LibriTTS-R 训练的 TTS 输出,而非基于 LibriTTS 训练的 TTS 输出,两个说话人 ID 和两种训练集规模均呈现正得分。使用更大的 Train-960 集合时偏好更强,表明 LibriTTS-R 中的修复语音在自然度之外还提升了输出质量。听者更偏好 LibriTTS-R 训练的输出来自两个测试说话人,偏好得分均为正。使用更大的 Train-960 集合相比 Train-460 增加了对 LibriTTS-R 的偏好。这一偏好趋势与 LibriTTS-R 输出中伪影和背景噪声更少的定性观察结果一致。

主观评估表明,LibriTTS-R 在感知音质上优于 LibriTTS,并排偏好测试显示显著提升,而自然度差异在统计上不显著。基于 LibriTTS-R 训练的模型在几乎所有说话人上均始终优于基于 LibriTTS 训练的模型,Train-960 子集带来的增益最大,最佳 LibriTTS-R 模型的 MOS 超过 4.0,而 LibriTTS 模型低于 3.5。听者同样更偏好基于 LibriTTS-R 训练的 TTS 输出,尤其是在使用更大训练集时,这与更少的伪影和背景噪声相一致。总体而言,修复主要提升了音质而非自然度。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供