Command Palette
Search for a command to run...
Full-Duplex-Bench-v3:在真实非流利语音下评测全双工语音智能体的工具使用能力
Full-Duplex-Bench-v3:在真实非流利语音下评测全双工语音智能体的工具使用能力
Guan-Ting Lin Chen Chen Zhehuai Chen Hung-yi Lee
摘要
我们提出了 Full-Duplex-Bench-v3(FDBv3),一个用于在自然语音条件和多步工具使用场景下评测口语语言模型的基准。与以往工作不同,我们的数据集完全由真实人类音频构成,并标注了五类非流利现象,同时配以跨四个任务领域、需要链式 API 调用的场景。我们从准确率、延迟和话轮交替三个维度评估了六种模型配置:GPT-Realtime、Gemini Live 2.5、Gemini Live 3.1、Grok、Ultravox v0.7 以及传统的级联流水线(Whisper→GPT-4o→TTS)。GPT-Realtime 在 Pass@1(0.600)和避免打断(13.5%)上领先;Gemini Live 3.1 实现了最低延迟(4.25 s),但话轮接续率最低(78.0%);级联基线尽管话轮接续率完美,却产生了最高延迟(10.12 s)。在所有系统中,自我纠正处理和高难度场景下的多步推理仍然是最一致的失败模式。演示见 https://daniellin94144.github.io/FDBv3-demo/。
一句话总结
台湾大学和 NVIDIA 的研究人员提出了 Full-Duplex-Bench-v3(FDBv3),这是一个基准,使用真实人类音频,对五类非流利现象进行标注,并跨四个任务领域进行链式 API 调用,以评估六种语音模型配置(GPT-Realtime、Gemini Live 2.5、Gemini Live 3.1、Grok、Ultravox v0.7 以及 Cascaded Whisper→GPT-4o→TTS 流水线),结果发现 GPT-Realtime 在 Pass@1(0.600)和打断避免率(13.5%)上领先,而 Cascaded 基线延迟最高(10.12 秒)。
核心贡献
- 提出了 Full-Duplex-Bench-v3(FDBv3),这是一个开放、可复现的基准,基于真实人类音频构建,针对五类非流利现象进行标注,并配有跨四个任务领域需要链式 API 调用的场景。
- 从准确率、延迟和话轮转换三个方面对六种配置进行了评估:GPT-Realtime、Gemini Live 2.5、Gemini Live 3.1、Grok、Ultravox v0.7 以及级联式 Whisper→GPT-4o→TTS 流水线;GPT-Realtime 在 Pass@1(0.600)和打断避免率(13.5%)上领先,Gemini Live 3.1 延迟最低(4.25 秒)但话轮接取率最低(78.0%),Cascaded 基线尽管话轮转换完美,但延迟最高(10.12 秒)。
- 在所有系统中,自我修正处理和高难度场景下的多步推理是最一致的失败模式,GPT-Realtime 在自我修正场景中的成功率不到 59%。这些结果揭示了快速工具执行与灵活处理不断变化的对话意图之间的权衡。
引言
语音 agent 正日益被期望执行现实世界操作,例如查询机票价格或更新账户设置,但语音交互带来了文本式工具使用所没有的严格延迟要求。此前工作大多依赖级联离线流水线、合成语音、合成训练数据或闭源专有系统,现有基准往往忽略自然非流利现象、话语中途修正以及可复现的多步 API 执行。作者提出了 Full-Duplex-Bench-v3,这是首个在真实人类语音、系统性非流利标注、确定性 API 约束以及四个任务领域中的自我修正/状态回滚场景下评估实时语音 agent 多步工具使用的基准。作者评估了六种主流配置,并表明处理句子中途修正仍然是一个重大开放挑战,揭示了延迟、话轮转换与可靠推理之间的权衡。
数据集
作者描述的是一个基于人类音频录音构建的语音工具使用基准,而不是所提供文本中的训练数据集。
来源与构成
- 来自 12 位说话人的 100 条录音,包括母语和非母语英语说话人,具有韩语和俄语背景以及不同的口音强度。
- 每位说话人贡献了 10 个场景,覆盖四个任务领域,非流利现象按比例呈现。
- 音频在不受控环境中采集,12 个设置中有 11 个主要使用内置麦克风,范围从安静房间到轻度背景噪声。
- 所有录音均经过质量审核。
任务领域与模拟 API
- 该基准覆盖四个任务领域,每个领域都有一小组可调用工具。
- 模拟 API 在本地运行,具有确定性的零延迟响应,消除了网络波动并支持自动评分。
难度层级与标注
- 场景分为三个层级:简单单步、中等两步且具有适度歧义,以及困难多步且带有冲突约束。
- 每条录音都标注五类非流利现象:错误起始、自我修正、填充词、停顿和犹豫。
- 有 21 个场景特别包含自我修正事件,用于测试实时状态回滚。
处理细节
- 对于尾部静音,作者采集每位说话人实际环境中的 30 秒环境声,而不是附加数字静音,以保持声学背景连贯。
- 所提供文本未指定裁剪策略、训练划分或混合比例。
数据使用方式
- 该数据集用作非流利条件下语音工具使用的评估基准。
- 难度层级和非流利标注支持测试过时上下文、动态参数更新和话轮结束检测鲁棒性等失败模式。
方法
作者将该基准构建为一个受控评估框架,而不是线上服务测试平台。系统不是将语音查询路由到真实 Web API,而是使用在本地执行、具有确定性零延迟响应的模拟 API。这种设计将模型推理和参数传递与网络波动、服务停机及外部延迟隔离开来。因此,测得的处理时间只反映模型开销,所有预期输出都可以自动评分。
该基准覆盖四个任务领域,每个领域都有一小组可调用工具。场景根据所需工具调用次数和涉及的推理复杂度分为三个难度层级。简单场景为单步,中等场景需要两步并带有适度歧义,困难场景涉及多步推理和冲突约束。音频从不受控环境中的人类说话人采集,以保留自然语音变化。
每条录音都针对五类非流利现象进行标注,这些现象对应不同的失败模式。错误起始指说话人放弃一个意图并开始另一个意图,用于测试模型是否丢弃过时上下文而不幻觉出工具调用。自我修正指参数在句子中途被更新,用于评估动态状态回滚。诸如“um”和“uh”之类的填充词用于考察冗余 token 是否会降低准确率或增加延迟。停顿和犹豫,包括填充词重复组合,用于测试话轮结束检测的鲁棒性。
除了基准设计之外,作者还分析了一个级联参考流水线,该流水线由用于自动语音识别的 Whisper、用于语言理解的 GPT-4o 和用于语音输出的 OpenAI TTS 组成。该流水线隔离了传统模块化架构的成本。尽管它与 GPT-Realtime 共享相同的底层大语言模型,但其 Pass@1 更低,表明 ASR 引入的错误会向下游传播。这种影响在自我修正上最为明显:级联系统得分显著更低,而 GPT-Realtime 处理回滚的效果要好得多。由于 Whisper 可能在用户纠正到来之前就敲定错误转写,下游模型没有机会修改原始状态。
级联设计提供了可靠的话轮转换,具有完美的参与度且没有静默工作故障。然而,这种可靠性以较高的任务完成延迟为代价,主要来自较大的首字延迟。Whisper、语言模型和 TTS 的顺序链路形成了不可消除的瓶颈,而端到端语音模型可以通过并发处理绕过这一瓶颈。这种对比量化了模块化可靠性与原生语音模型速度之间的权衡。
实验
该基准使用确定性模拟 API 在四个任务领域和三个难度层级上评估实时语音 agent,使用从人类说话人采集的自然非流利语音。比较了六个系统,包括五个端到端模型和一个级联式 Whisper 到 GPT-4o 到 TTS 基线,评估维度包括工具选择、参数准确率、任务完成、响应质量和话轮转换延迟。GPT-Realtime 表现为整体最均衡的系统,而 Cascaded 基线可靠但速度慢,Gemini Live 3.1 速度快但尽管执行了工具调用却经常不产生语音。自我修正对所有系统来说仍然困难,定性案例研究揭示了为了速度而急切调用工具与为了正确性而保守提交之间的根本权衡。
该基准围绕四个任务领域组织,使用本地执行的确定性零延迟模拟 API。每个领域提供一小组可调用函数,用于旅行预订、金融操作、住房搜索和电子商务支持等活动。这一设计隔离了模型推理和参数传递,并支持自动评分。四个任务领域为旅行与身份、金融与账单、住房与位置以及电子商务支持。每个领域提供一小组可调用函数,通常为两到三个,覆盖预订、金融、住房和订单管理任务。所有模拟 API 均在本地运行,具有确定性零延迟响应,这隔离了推理和参数传递,并支持自动评分。
GPT-Realtime 是整体表现最强的系统,在工具选择、参数准确率、响应质量、Pass@1 和最低打断率上领先。Gemini Live 3.1 延迟最快,但话轮接取率最低,在许多场景中没有响应。Cascaded 基线始终响应,但速度最慢;Ultravox 兼具高话轮转换率和最高的打断率、填充率。GPT-Realtime 在整体性能上领先,综合了最高准确率、响应质量和最低打断率。Gemini Live 3.1 实现了最快延迟,但话轮接取率最低,许多场景没有响应。Cascaded 基线保证每个场景都有响应,但延迟最高。Ultravox 并列最高话轮接取率,但打断率和填充率最高,经常以低内容响应打断用户。Gemini Live 2.5 更保守,表现出较高的话轮转换率和低打断率,但整体准确率较低。
GPT-Realtime 在每个非流利类别上均领先或并列领先,尤其在自我修正方面优势显著。Gemini Live 3.1 在错误起始上比 Gemini Live 2.5 更均衡,但在自我修正上较弱;级联流水线的自我修正得分最低。停顿是多个系统共同的弱点,尤其是 Grok 和 Ultravox,表明它们难以检测用户何时说完。GPT-Realtime 在每个非流利类别中均取得最佳或并列最佳的 Pass@1,并在自我修正上领先最为明显。级联流水线在自我修正上明显弱于所有其他系统,这与转写敲定后状态回滚受限一致。停顿是 Grok 和 Ultravox 得分最低的类别,也是多个系统的共同弱点,表明话语结束检测仍然具有挑战性。Gemini Live 3.1 相对 Gemini Live 2.5 提高了错误起始鲁棒性,但在自我修正上落后,表明这次更新提高了整体鲁棒性,而状态回滚有所下降。
随着场景难度增加,所有评估模型的 Pass@1 均下降。GPT-Realtime 在每个难度级别上均取得最高 Pass@1,并在中等难度上与 Gemini Live 3.1 并列最高。Cascaded 在简单任务上相对较强,但在困难任务上急剧下降;Grok 的困难 Pass@1 最低。GPT-Realtime 在每个难度级别均取得领先 Pass@1,在中等难度上与 Gemini Live 3.1 并列。所有系统在任务从简单到中等再到困难时准确率都会下降。Cascaded 在简单任务上具有竞争力,但在困难任务上显著退化。Grok 的困难 Pass@1 在所有模型中最低。
金融是每个模型表现最强的领域,而住房始终是最弱的领域。GPT-Realtime 在四个领域均领先,金融和旅行领域的竞争最为接近。Ultravox 在较强的金融表现和较弱的电子商务表现之间表现出明显不平衡。每个模型的最高 Pass@1 均出现在金融领域,最低出现在住房领域。GPT-Realtime 在四个领域均领先,而住房在所有系统中都保持低位。Gemini Live 3.1 在金融上紧追 GPT-Realtime,但在电子商务和住房上差距更大。Ultravox 表现出明显的领域不平衡,金融得分约为电子商务的两倍。Cascaded 在电子商务上与 Grok 持平,但在旅行上得分较低。
该基准使用四个任务领域,并采用本地执行的确定性模拟 API,从而能够自动评分工具选择和参数传递。GPT-Realtime 是整体最强的模型,在准确率、响应质量、最低打断率以及跨难度级别和领域的表现上领先;Gemini Live 3.1 提供快速延迟,但经常不响应;Ultravox 的打断率和填充率较高。Cascaded 基线响应一致,但速度慢,并且在困难任务上显著退化。各系统中,金融是最容易的领域,住房是最难的领域,停顿处理和自我修正仍然是共同的弱点。