HyperAIHyperAI

Command Palette

Search for a command to run...

VIBEVOICE-ASR-STREAMING 技术报告

摘要

传统的说话人属性语音识别系统将语音识别和说话人日志视为两个独立的任务。近年来,诸如 VibeVoice-ASR 之类的端到端模型已将这两个任务统一到单个模型中。然而,现有的统一模型仍主要支持离线识别,难以满足实时语音助手和智能体的低延迟要求。为解决此问题,我们提出了 VIBEVOICE-ASR-STREAMING,这是基于 LLM 的端到端流式说话人属性语音识别方法之一。它将固定大小的音频块、少量前瞻音频和先前文本交错输入,使模型能够在语音到达时生成“谁说了什么”,而无需单独的日志分离阶段。在转录准确性方面,我们的 7B 模型在五个评估集上取得了最低的平均 WER/CER。在说话人属性方面,它在 13 个评估设置中的 12 个上取得了最佳或并列最佳的结果。我们发布了 1.5B 和 7B 模型权重及推理代码。

一句话总结

微软研究院、中国科学院大学和上海交通大学提出了 VIBEVOICE-ASR-STREAMING,一种基于 LLM 的端到端流式说话人属性 ASR 系统,通过交错固定大小的音频块、少量前瞻音频和先前文本来实时输出“谁说了什么”,在五个评估集上取得最低的平均 WER/CER,并在 13 个设置中的 12 个上取得最佳或并列最佳的说话人属性结果,同时发布了 1.5B1.5\text{B}1.5B7B7\text{B}7B 模型权重及推理代码。

核心贡献

  • 提出了 VIBEVOICE-ASR-STREAMING,一种基于 LLM 的端到端流式说话人属性 ASR 系统,通过交错固定大小的音频块、少量前瞻音频和先前文本,在单次生成过程中直接输出“谁说了什么”,无需单独的说话人分割阶段。
  • 7B 模型在五个评估集上取得最低的平均 WER/CER(仅识别任务),并在 13 个评估设置中的 12 个上取得最佳或并列最佳的 cpWER/cpCER(说话人属性任务),在会议基准上比 Azure ConversationTranscriber 提升了 2.39 到 12.45 个百分点,在 MLC-Challenge 平均值上从 27.06 提升到 22.75。
  • 发布了 1.5B 和 7B 模型权重、支持 vLLM 的高性能推理代码以及在线演示,使流式说话人属性 ASR 可复现。

引言

流式说话人属性 ASR 必须在对话进行中同时输出词汇和说话人标签,这对于实时与多人交互的语音 Agent 越来越重要。已有工作分为三条路线:基于 LLM 的识别器可单次通过转录长录音,但需要完整音频后才能输出;流式 LLM ASR 系统可增量处理音频并保留上下文,但仅支持单说话人转录;流式多说话人系统延迟低,但通常依赖独立的说话人相关组件,而非直接生成带说话人属性的转录。关键差距在于,说话人属性对保留历史的要求比普通 ASR 更高,因为当前块中出现的说话人可能早在几分钟前就已出现且必须保持相同标签,而流式 Speech-LLM 方案尚未扩展到多说话人场景。

作者提出了 VIBEVOICE-ASR-STREAMING,用单一模型同时满足这两个要求。该方法将输入的音频块与自回归生成的带说话人属性文本交错排列,使未来的声学上下文受块契约约束,同时累积的语音、转录和说话人历史保留在上下文中,从而消除了单独的说话人分割阶段。每个块使用固定的 0.5 秒前瞻,并发布了 22 帧配置下的 1.5B 和 7B 模型权重,预期说话人属性延迟为 2.00 秒。在四种会议条件和 MLC-Challenge 的九种语言上,7B 22 帧配置在 13 个设置中的 12 个上取得最佳或并列最佳的说话人属性错误率,并在比较的流式系统中取得最佳的平均仅识别结果。

数据集

作者从真实和合成录音中构建训练混合数据,所有数据均通过统一流程处理。使用 Qwen3-ForcedAligner-0.6B 为每条录音获取词级时间戳,然后根据附录 A 中定义的规则将参考转录拆分为逐块目标。

  • 合成数据生成:为提升对多说话人声学条件和专业词汇的鲁棒性,作者合成会议风格对话。这些对话包含领域特定术语和专有名词,口语形式和书面形式分开保存。口语形式驱动语音合成,书面形式保留为 ASR 目标,确保数字、缩写和技术术语以自然方式发音但按规范形式转录。
  • 数据增强:合成语音经过波形级增强。说话人之间产生重叠,混合信号与房间冲激响应卷积,该操作在单一步骤中同时应用房间混响和麦克风响应。说话人标签和对齐信息随波形同步更新,确保监督信号在增强后仍然有效。
  • 规模:该流程共生成 50,884 条录音,总计 4,519.6 小时的增强多说话人训练语音。
  • 使用方式:生成的数据集作为模型的训练混合数据,基于对齐转录得到的逐块目标作为监督信号。

方法

作者提出了 VIBEVOICE-ASR-STREAMING,一种旨在将长形式说话人属性转录扩展到流式推理的架构。该系统基于 Qwen2.5 大语言模型主干构建。语音输入由预训练双 tokenizer 的编码器部分处理。声学 tokenizer 对波形应用分层累积下采样以捕获频谱细节,语义 tokenizer 以相同速率运行,生成与文本内容对齐的确定性特征。这些表示沿特征维度拼接,并投影到语言模型的嵌入空间中。

如下图所示:

为实现流式能力,作者将输入语音和生成文本组织为交错序列:

[X1,Y1,X2,Y2,][X_1, Y_1, X_2, Y_2, \dots][X1,Y1,X2,Y2,]

其中 XkX_kXk 表示第 kkk 个语音块,YkY_kYk 表示对应的带说话人属性转录。与独立的逐块解码不同,先前观察到的语音和生成文本保留在上下文中,使每个块能够基于累积的对话历史进行解码。为在块边界附近提供有限的未来声学证据,模型引入了固定的前瞻 L=4L = 4L=4 个潜在帧,对应约 0.5 秒的音频。作者评估了两种块配置:15 个潜在帧(2.0 秒)和 22 个潜在帧(2.9 秒)。

转录任务被建模为单一的自回归生成过程。对于当前块及其前瞻 X~k\tilde{X}_kX~k 对应的文本序列 Yk=(yk,1,,yk,Nk)Y_k = (y_{k,1}, \dots, y_{k,N_k})Yk=(yk,1,,yk,Nk),生成概率定义为:

p(YkX<k,X~k,Y<k)=j=1Nkp(yk,jX<k,X~k,Y<k,yk,<j)p(Y_k \mid X_{<k}, \tilde{X}_k, Y_{<k}) = \prod_{j=1}^{N_k} p(y_{k,j} \mid X_{<k}, \tilde{X}_k, Y_{<k}, y_{k,<j})p(YkX<k,X~k,Y<k)=j=1Nkp(yk,jX<k,X~k,Y<k,yk,<j)

每个生成的文本块以特殊的块结束 token 结尾,该 token 将控制权交还给音频流。模型还支持可选的上下文提示,允许在解码前提供热词和技术术语。说话人身份根据首次出现的顺序分配序数标签。

训练过程分为三个不同阶段,这些阶段在样本构建方式上有所不同,而非模型架构或目标函数。第一阶段,模型在离线设置中进行非流式训练,完整录音可见,建立基础的多说话人识别和属性能力。第二阶段过渡到流式预训练。从初始检查点开始,训练样本被分割为块,并使用带前瞻的交错公式与其转录配对。该阶段利用大规模语料使模型适应受限的未来上下文。最后阶段是在较小的精选公共和合成多说话人数据混合集上进行流式微调。该阶段优化模型在转录规范、一致说话人标签和可靠热词遵循方面的行为。在合成混合数据的准备过程中,作者生成包含领域特定术语的会议风格对话,并应用波形级增强(如说话人重叠和房间冲激响应卷积)以确保监督信号的鲁棒性。

实验

评估将 VIBEVOICE-ASR-STREAMING 与云基线在会议、对话和单说话人基准上进行比较,结果显示该方法在大多数说话人属性设置上领先,且标注延迟更低。消融实验表明,更大的主干模型和更长的块可同时改善转录效果,尤其是说话人属性;头部放置的说话人标签与尾部放置的准确率相当;增加前瞻深度始终有益。系统保持较低的实时因子,证实了其流式可行性。

VIBEVOICE-ASR-STREAMING 在多个会议基准上达到或超过商业流式 API 的水平,尤其在英语和韩语上表现突出,而在日语和德语等语言上差距较大。7B 模型搭配 22 帧块是主要配置,更大的主干规模和更长的块对说话人属性指标的改善幅度大于对纯识别指标的改善。VIBEVOICE-ASR-STREAMING 在英语和韩语上取得最佳或接近最佳的 WER/CER,数值与顶级商业 API 相当。在法语、德语和意大利语上,VIBEVOICE-ASR-STREAMING 优于所有列出的商业 API,而在日语上则落后于最佳 API 较多。将主干规模从 1.5B 扩展到 7B 使平均 cpWER/cpCER 降低超过 12 个百分点,这一提升幅度大于 WER/CER 约 4.5 个百分点的改善。将块大小从 22 帧减少到 15 帧可将预期延迟从 2.00 秒降至 1.53 秒,但会牺牲部分准确率。更长的前瞻始终改善 WER/CER 和 cpWER/cpCER,其中说话人属性从额外右侧上下文中获益更多。

该表比较了多种语言和系统下的流式说话人属性 ASR 性能,显示所提出的 7B 模型搭配 22 帧块在大多数指标上取得最佳或第二佳结果,同时平均延迟远低于商业替代方案。Google STT 的事后说话人标签修订显著改善了其 cpWER,但所提出模型的端到端设计无需此类后处理即可达到竞争性准确率。所提出模型的平均延迟最低,为 2.00 秒,而 Azure CT 为 8.21 秒,Google STT 根据标签时机为 9.12 秒或 51.06 秒。在英语 MLC-Challenge 上,所提出模型的 WER(8.44)和 cpWER(11.99)均低于 Azure CT 和 Google STT。在日语上,所提出模型的 cpCER 与 Google STT 的最终标签结果持平(33.01),尽管仅使用首次发射标签。Google STT 在使用最终修订标签而非首次发射标签时 cpWER 大幅改善,表明存在较大的事后修正效应。所提出模型在多种语言上表现强劲,在识别和说话人属性指标上通常排名第一或第二。

7B 模型搭配 22 帧块在四个基准上取得最佳的平均单说话人识别结果,优于 15 帧变体和所有比较系统。22 帧设置一致降低大多数数据集上的错误率,而 15 帧变体以少量准确率损失换取更低延迟。7B 模型搭配 22 帧块在所有系统中具有最低的平均错误率(5.76)。将块大小从 15 帧增加到 22 帧使平均识别错误率降低 0.61 个百分点。22 帧变体在除 GigaSpeech 外的每个基准上均优于 15 帧变体,在 GigaSpeech 上差异较小。与其他实时系统相比,22 帧模型在 AISHELL-1 和 LibriSpeech test-clean 上排名第一,在 GigaSpeech 上排名第二。

从非流式检查点转换为流式会一致降低所有基准上的转录和说话人属性指标,其中说话人属性的退化幅度大于词错误率。退化模式表明流式设置主要损失说话人证据而非词汇信息。WER 和 cpWER 在每个基准上均上升,cpWER 上升 5.13 到 6.67 个百分点,而 WER 上升 0.75 到 3.53 个百分点。cpWER 相对 WER 更大的退化表明存在与说话人分配相关的额外准确率损失,而非仅转录损失。流式模型的性能差距在中文、英文和混合语言数据集上一致,WER 增幅最小的是 AMI-IHM,最大的是 AMI-SDM。

在固定 4 帧前瞻下,将块大小从 15 帧增加到 22 个潜在帧一致改善所有基准和模型规模上的 WER/CER 和 cpWER/cpCER,其中说话人属性指标的提升更大。类似地,从 1.5B 扩展到 7B 参数在 cpWER/cpCER 上的改善大于 WER/CER,表明更长的块和更大的模型主要增强说话人证据而非词汇准确率。15 帧设置提供更低延迟(1.53 秒对比 2.00 秒),但以准确率为代价,呈现速度与质量之间的权衡。将块从 15 帧增加到 22 帧在每个基准和两种模型规模上均改善两项指标,五个集合的平均增益在 cpWER/cpCER 上大于 WER/CER。在固定块大小下,从 1.5B 扩展到 7B 参数使平均 cpWER/cpCER 在 22 帧时降低 12.76 个百分点,在 15 帧时降低 11.61 个百分点,而 WER/CER 分别降低 4.69 和 4.54 个百分点,显示对说话人属性的影响更强。15 帧块将预期延迟从 2.00 秒降至 1.53 秒,但准确率损失在所有基准上一致,因此块大小的选择是延迟与准确率之间的权衡。

评估将 VIBEVOICE-ASR-STREAMING 与商业 API 及消融实验在多语言会议基准上进行比较。7B 模型搭配 22 帧块在英语和韩语上达到或超过商业系统,在法语、德语和意大利语上领先,但在日语上明显落后。更大的主干规模和更长的块一致改善准确率,其中说话人属性指标(cpWER/cpCER)的增益是纯识别指标的两倍,表明这两个因素主要增强说话人证据而非词汇转录。将块大小从 22 帧减少到 15 帧可将延迟从 2.00 秒降至 1.53 秒,但会带来适度的准确率成本;从非流式检查点转换为流式对说话人属性的退化大于词错误率,证实了说话人分配方面的特定损失而非词汇内容的损失。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供