HyperAIHyperAI

Command Palette

Search for a command to run...

Diamond:一种基于神经音频编解码器令牌的自回归 RQ-Transformer 序列到序列语音恢复模型

Almaz Zholdoshbek uulu Denis Pavlov Nursultan Bakashov Ulanbek Abdurazakov

Diamond-1.0:自回归语音修复模型

跳转至 Notebook

摘要

我们提出 Diamond,一个序列到序列语音恢复模型,能够将降质音频恢复至 44.1 kHz 录音室(或接近录音室)质量。降质梅尔频谱图经由双向 Transformer 编码器处理;一个带交叉注意力的自回归解码器预测冻结神经音频编解码器( DAC , 9 个 RVQ 码本)的令牌。解码器为 RQ-Transformer:一个时间 Transformer 对帧序列建模,同时一个紧凑的深度 Transformer 对每帧内部的码本轴建模,恢复因果 RVQ 链并分配输出投影(读出)。基于声学令牌的自回归模型此前已被提出 [41],但其中一帧的码本由并行头从单一向量读取;据我们所知,Diamond 是首个读出采用双 Transformer RQ 解码器(一个帧级时间 Transformer 加上一个沿 RVQ 轴的帧局部深度 Transformer)的语音恢复模型。Diamond 从零开始训练(约 1.666 亿参数,无预训练骨干网络),达到了当前最强开源语音恢复系统的水平,同时仍为同类中最佳从头训练恢复器。

一句话总结

nineninesix.ai 的研究者提出 Diamond,一个序列到序列语音修复模型,通过双向 Transformer 编码器和基于 DAC token 的自回归 RQ-Transformer 解码器,将退化音频转换为录音室品质的 44.1 kHz 输出。这是首个采用双 Transformer 读出(帧级时间 Transformer 和沿 RVQ 轴的帧内深度 Transformer)的修复器,在从头训练中取得了最先进性能。

核心贡献

  • Diamond 采用基于神经音频编解码器 token 的双 Transformer RQ 解码器进行语音修复:一个帧级时间 Transformer 和一个沿 RVQ 轴的帧内深度 Transformer,恢复因果 RVQ 链并分散读出,取代了先前自回归编解码器 token 模型的并行头。
  • 论文诊断并解决了从头训练编解码器 token 深度模型的关键不稳定性,包括第 0 层失控、读出发散和曝光偏差级联,并给出了基于文献的机理解释。
  • 结合数据与增强配方(681.5 小时,其中 28% 为原生宽带内容),在真实退化录音上进行双轴评估(DNSMOS-P.835 和 CER),在开放基线中取得感知质量第二(+0.255 OVRL,750 个片段中 657 个改善),同时公开衡量了自回归生成固有的内容保真度权衡。

引言

作者致力于语音修复,即从经历严重有损压缩、带宽限制、削波和噪声的退化录音中恢复录音室品质的 44.1 kHz 音频。这类录音在真实语料库中占主导地位,但因模型会复现退化而无法作为训练数据。修复与去噪有本质不同:缺失的频谱内容和瞬态必须被生成,而非仅被过滤,因此是一个生成性问题。作者引入 Diamond,一个序列到序列模型,利用冻结的 DAC 和双 Transformer RQ 解码器——一个时间 Transformer 加一个深度 Transformer——从 mel 频谱图预测离散编解码器 token,完全从头训练。他们还诊断并解决了深度编解码器 token 训练中的关键不稳定性,并在感知质量和内容保真度上进行了评估,使 Diamond 成为无预训练骨干网络的最强开放修复器之一。

数据集

作者在 681.5 小时的录音室语音数据集上训练 Diamond,该数据集分为 353,075 个片段,来自约 2,500 个说话人。一个关键特性是 28% 的数据(约 190 小时)为 44.1–48 kHz 的原生宽带,提供高达 22 kHz 的真实高频内容,而不仅仅是上采样的 24 kHz 目标。

数据集组成与过滤

  • 所有片段均为录音室或接近录音室的录音。
  • 仅根据时长选择片段:保留 2.5 到 30 秒之间的片段。更短的片段无法覆盖训练裁剪窗口,更长的片段会膨胀内存。
  • 未应用感知质量过滤(如 DNSMOS、VQScore);作者将此留给未来工作,并指出在较不干净的语料库上这会改善结果。
  • 清单文件以固定种子在磁盘上随机打乱。

数据使用方式

  • 录音室片段作为干净目标。目标被预先 token 化。
  • 退化的输入在 DataLoader 中动态合成,因此同一目标在多个 epoch 中会经历数十种不同的退化。
  • 增强管线经过校准,以匹配真实世界退化。它使用一个包含 96,899 个真实退化录音的参考集,通过 8 个通道特征(SNR、底噪、动态范围、频谱滚降、3.4–8 kHz 和 8 kHz 以上的能量比,以及高频不稳定性)构建一个包含 5,000 个 DSP 参数组合的调色板。
  • DSP 链:下采样至 24/32 kHz → 低音增强 → 麦克风染色 → 低通滤波器(截止频率最高 12 kHz)→ 动态范围压缩 → 编解码器(MP3 57%, AAC 23%, OGG 15%, 无编解码器 5%;比特率 16–128 kbps;1–3 次编码,其中 29% 为双重编码,9% 为三重编码)→ 可选高频不稳定性(25%)→ 通过 tanh 饱和到 RMS –16 dB 进行响度归一化 → 真实背景噪声叠加 → 峰值归一化至 0.99。噪声由使用 VAD 从真实录音中切割的背景片段组成。
  • 采样策略:60% 从调色板进行 k‑NN 检索,25% 随机调色板组合,15% 重新生成的更宽分布的参数组合;连续参数抖动 ±40%。5% 的样本绕过退化,以教会模型保留干净音频。
  • 鲁棒性通道以每个样本 0.15 的概率被应用:编解码器之前的混响、编解码器之后的宽带噪声、丢包(0.15)、合成混响(0.10)和硬削波(0.10)。顺序是刻意设计的——混响在编码后依然存在,因此在编解码器之前应用;加性噪声大多被编解码器消除,因此在编解码器之后添加——确保模型同时学习去混响、降噪和编解码器伪影去除。

训练输入总是动态生成;不存储任何固定的退化数据集。

方法

作者设计了一个序列到序列的 Transformer 架构,以单次传递消除未知的复合退化。他们明确避免使用扩散模型,因为这类模型通常以特定退化算子为条件,面对真实录音中复合、不可微分且未知的畸变时变得脆弱。相反,一个带有交叉注意力的双向编码器允许单个条件模块观察整个退化信号,并联合去除非局部伪影。

为防止回归连续目标固有的过度平滑,模型预测离散 token,而不是频谱或波形。在 L1L_1L1L2L_2L2 损失下预测连续目标会收敛到条件均值,这会使嘶擦音和爆破音等精细结构变得模糊。相比之下,从有限词汇中预测 token 是一个分类任务,会选择一种变体而非平均它们。解码器从冻结的 DAC(Descript Audio Codec)解码器生成码索引,然后将码渲染为自然音频。

模型架构通过几个专门模块处理输入。输入被重采样至 24 kHz,并转换为 80 通道的对数 mel 频谱图。该前端馈入一个二十层的双向 Transformer 编码器。编码器使用预归一化 RMSNorm、带有可学习每层尺度的 RoPE 和每个残差分支上的 LayerScale,以在不进行时间下采样的情况下维持稳定的训练动态,保留精细的时间细节。

解码器是一个二十层的因果 Transformer,称为时间 Transformer。它通过因果自注意力关注过去帧,并通过交叉注意力关注完整的编码器输出,为每一帧发出一个隐藏向量。为处理 RVQ 编解码器的九个码本,作者引入了一个紧凑的深度 Transformer。深度 Transformer 不是从单个帧隐藏向量并行读取所有九个码本,这会稀释容量并破坏 RVQ 的因果关系,而是在每一帧内顺序生成九个码本。这恢复了因果链,其中每个码本细化前一个码本留下的残差。

训练使用带有标签平滑的逐帧加权交叉熵损失进行优化。权重分配使得承载语义内容的粗码本获得最大权重,同时提升尾部权重以防止细码本坍缩到众数。添加一个 z-loss 项以防止 logit 膨胀。

训练管线的一个关键组成部分是数据增强策略,旨在模拟观察到的自然伪影,而非施加任意的合成效果。作者将自定义增强器构建为一个拟合问题。他们从大量真实退化录音中提取通道特征,并使用逆校准找到在统计上匹配观察分布的 DSP 参数组合。

作者还分析了伪影空间的结构,以证明其增强策略的合理性。他们证明退化并非落入离散类别,而是形成一个连续体。标准聚类指标未能找到明确的组数,表明模型必须覆盖分布的完整密度,而非少数类别代表。

为确保合成的退化是真实的,作者采用逐样本检索。对于每个训练样本,随机抽取一个真实轮廓,并检索最近的调色板组合。该策略保留了真实传输路径的协方差结构。验证显示,逐样本检索的再现误差低于目标语料库的内在散布,有效缩小了录音室与真实退化录音之间的差距。

在推理过程中,长序列的自回归解码被分块以管理曝光偏差。模型顺序生成 token,通过 KV 缓存和独立块的批处理减轻影响。在每次 argmax 之前应用重复惩罚,以打破自回归重复循环,这对内容保真至关重要。

实验

在 Diamond-Bench(750 个退化录音)上使用感知和内容指标进行的评估表明,从零开始训练、无预训练骨干网络的自回归模型提供了强大的感知质量,但表现出自回归生成固有的内容错误尾部。设计过程显示,传输退化占据一个连续空间,没有离散类别,因此逐样本检索真实轮廓比随机参数采样更好地保留了协方差,加权采样避免了过度强调不真实的尾部。最终配方仅匹配通道特征以防止音色传递,并在推理时而非通过时间轴调度采样来缓解曝光偏差,后者会导致梯度尖峰。

训练数据集总计 681.5 小时,来自多个来源,但只有 28% 是原生宽带录音;其余 72% 是从 24 kHz 上采样得来,这意味着模型必须间接合成 12 kHz 以上的内容。这一有限的规模和带宽构成定义了实验预算,作者将增加原生宽带比例视为最直接的改进杠杆。仅 28% 的 681.5 小时训练集是原生宽带,其余来自 24 kHz 上采样,迫使模型间接合成高频内容。数据集按领域标准偏小(比 RE-USE 训练集小近四倍),作者未将数据或计算推向极限,为未来扩展留有余地。

一系列系统性实验驳斥了七个关于语音修复的直觉假设,包括手工预设、退化聚类和均匀参数采样。最终得到的 Diamond 模型实现了强大的感知质量(六个系统中的第二)和与非自回归修复器相当的中位内容保真度,但其自回归 token 生成引入了一个薄尾的高错误片段,这是一个结构性限制而非调参缺陷。所有七个手工设计假设均被驳斥或失败,使设计从手工预设和退化类别转向学习型增强方法。Diamond 改善了 88% 的片段,平均 OVRL 增益为 +0.255,但其平均 CER(0.131)被罕见脱轨拉高,而中位 CER(0.028)与顶级非自回归系统相当。

Diamond 在评估的修复模型中提供了第二高的感知质量(OVRL 3.829),改善了 88% 的退化片段,平均 OVRL 增益为 0.255。其中位 CER 为 0.028,与其他强系统相当,但生成失败的薄尾将平均 CER 拉高至 0.131,这是其自回归设计的结构性代价。所有结果均以较小的训练预算和无预训练骨干网络实现,使 Diamond 成为同类中最佳的开放修复器。Diamond 改善了 750 个退化片段中的 657 个,将整体感知质量提升至 RE-USE、Resemble Enhance、UniSE 和 VoiceFixer 之上,仅落后于 Sidon。中位 CER 较低(0.028),与 UniSE 和 Resemble Enhance 相当,但平均 CER(0.131)被自回归生成脱轨的少量片段拉高,这一模式也出现在另一个自回归系统 UniSE 中。

使用一个仅有 28% 原生宽带的 681.5 小时训练集,系统性实验驳斥了七个手工设计假设,将模型导向学习型增强策略。最终得到的 Diamond 修复器在评估系统中取得了第二高的感知质量,改善了 88% 的退化片段,但其自回归 token 生成引入了一个薄尾的高错误片段,拉高了平均 CER,这是一个结构性限制而非调参缺陷。总体而言,Diamond 是同类中最佳的开放修复器,进一步改进有望通过增加原生宽带数据比例实现。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供