Command Palette
Search for a command to run...
StepAudio 3 实时技术报告
StepAudio 3 实时技术报告
摘要
实时口语交互要求深度推理、快速响应和流畅的轮次转换。我们提出 StepAudio 3 Realtime,一个围绕连续“听-说-思-行”循环组织的音频-语言基础模型。深度感知模块捕获丰富的声学线索以理解用户意图,而无缝双工模块则建模同步音频流,从而自然地处理停顿、反馈语和打断。关键在于,我们通过“边说边想”解决了深度思考与延迟之间的冲突,在口语输出的同时并行执行私有推理。在推理模式下,StepAudio 3 在 StepAudioChat 上达到了 73.0 的宏平均分。借助“边说边想”,它在实时对话的同时,实现了与专用推理模型相当的对话和推理性能。此外,集成的语音代理可执行异步工具调用,而不会中断对话流程。StepAudio 3 Realtime 在关键维度上均达到了顶级性能:在 MMSU 基准上取得了优异的 90.6 分,在 Artificial Analysis 全双工基准上取得了 98.9 的总分,并在 τ-Voice 上实现了 56.0% 的宏任务成功率。
一句话总结
StepFun-Audio 团队推出 StepAudio 3 Realtime,一个围绕持续“听-说-思-行”循环构建的音频语言基础模型,集成了深度感知、无缝全双工和边说边想机制,将私有推理与语音输出并行化,在 StepAudioChat 上取得 73.0 分,在 MMSU 上取得 90.6 分,在 Artificial Analysis Full-Duplex Bench 上取得 98.9 分,并在 τ-Voice 上达到 56.0% 的成功率。
核心贡献
- 推出 StepAudio 3 Realtime,一个围绕持续“听-说-思-行”循环构建的音频语言基础模型,该循环协调感知、对话时序、推理和工具使用,能够在交互推进过程中并发处理用户语音、模型语音和工具结果。
- 提出“边说边想”机制,在语音输出的同时并行运行私有推理,并通过自适应思考和多 token 预测提供支持,在深度思考与实时响应之间取得平衡;该机制在实时说话的同时达到了与专用推理模型相当的对话和推理性能。
- 展示了顶尖的评估结果:在推理模式下 StepAudioChat 的宏平均分为 73.0,MMSU 为 90.6,Artificial Analysis Full-Duplex Bench 总体得分为 98.9,τ-Voice 的宏任务成功率为 56.0%,同时指出了多轮约束遵循和零售工具使用任务中仍存在的差距。
引言
自然的语音交互要求系统在管理自身响应的同时跟随用户,其中停顿和重叠语音会使交互流程变得复杂。此前的音频语言模型在语音识别和生成方面取得了进展,但在对话过程中对感知、推理和行动的实时协调方面存在困难,尤其是在处理超出语音交换范围的复杂请求或外部工具使用时。
作者提出了 StepAudio 3 Realtime,它在 Step-Audio 系列共享的音频语言基础之上,通过持续循环协调听、说、思、行。作者引入了深度感知声学和语言线索的功能、无缝全双工对话轮次管理,以及允许在语音输出的同时进行思考的边说边想能力。该系统还集成了一个流式语音 Agent,将对话意图传递到工具执行中,新的用户输入会动态塑造持续进行的交互。评估显示,系统在音频理解基准和对话轮次管理方面表现强劲,但在多轮约束遵循和零售工具使用任务中仍存在差距。
数据集
-
共享预训练和中训练:StepAudio 3 ASR Max 和 StepAudio 3 Realtime 使用相同的预训练和中训练阶段;它们仅在监督微调阶段产生分化,其中 ASR 分支专注于转录,实时分支则针对语音交互进行调优。
-
用于 ASR 的监督微调:ASR 模型使用打包成最多 32K token 序列的样本进行微调。按照 SpecAugment 应用时频掩码,同时冻结音频编码器,更新音频语言适配器和语言解码器以生成规范化转录文本。上下文感知的识别样本可能包含对话历史、前一条模型响应、场景描述或任务特定术语作为可选证据。目标转录文本始终以输入波形为基础。
-
长短格式 ASR 数据:ASR 混合数据结合了短标签话语和长伪标签录音。多个识别系统对分段音频进行转录,其假设通过识别器输出投票纠错(ROVER)进行对齐和融合。基于一致性的过滤选择可靠的片段,然后将其重组为更长的会话。LLM 恢复标点并改善每个会话内的一致性。
-
长尾术语增强:为了处理经常与常见同音词混淆的稀有名称和技术术语,作者构建了有针对性的合成训练样本。LLM 扩展知识分类体系,以识别富含同音词、生僻字、缩写和产品标识符的类别。候选术语被枚举、去重并放入自然的载体句子中。这些句子被转换为语音,并且仅在其发音与目标文本匹配时才被保留。对于声学上易混淆的术语,示例可能包含对话历史或实体提示。
-
音频理解数据构建:分层分类体系涵盖词汇内容、副语言特征、声学事件、说话者和时间结构、音乐以及基于音频的推理。采样控制平衡了时长和语言覆盖,同时去除重复和不合适的录音。每段录音都被描述并映射到其内容所支持的能力,指导针对片段特定问题的构建。多个模型独立标注每个音频-问题对,输出通过一致性和质量检查进行整合。
-
音频理解的数据选择和质量控制:确定性检查去除空、截断、格式错误或严重重复的输出。纯文本 LLM 评判器评估查询和响应质量,并分配案例价值评分,该评分考虑查询、响应、音频标注中可用的有用信息以及问题的训练价值。接地可靠性通过响应的跨模型一致性进行估计。只有高质量、高案例价值和跨模型一致的候选样本才被保留为 SFT 候选;具有广泛用途的样本可能进入中训练,而有分歧和可修正的案例则被送往重新标注或进一步审查。
-
少即是多的消融研究:一项消融比较了约两百万个随机采样的 SFT 样本与质量控制后保留的约 10 万个高质量样本。质量受控的集合将 MMSU 从 78.78 提升到 89.70,将 MMAR 从 74.70 提升到 84.50,尽管使用的样本数量约为原来的二十分之一,这凸显了数据质量相对于原始 SFT 数量的重要性。
-
StepAudioChat 基准:这是一个封闭的、基于文本的基础对话智能基准。它评估对话行为和通过对话表达出来的推理能力,将文本层面的响应质量与韵律、轮次时序和中断处理分离开来。它使用通用的能力分类体系和新建的项目,以减少对公开测试题目的依赖。
-
StepAudioChat 的能力分类体系:对话能力被组织成层次结构,叶子节点针对可观察行为并定义了评估边界。来自公开基准的任务和示例作为覆盖检查使用,而不重复使用测试问题。重叠的映射细化了能力定义,未映射的示例则识别出覆盖缺口。每个项目针对一个主要能力,只有得到有效项目支持的能力才进入评估套件。
-
StepAudioChat 的自然化项目构建:每个项目包含一个对话提示、可独立检查的标准、一个有效的参考响应和一个刻意设计的有缺陷响应。来自真实交互的去标识话语为提示措辞和局部上下文提供依据,保留了简洁性、碎片化、口语化措辞和转录噪声。个人实体被替换为类型化占位符。场景在适当的情况下被重新构建到日常环境中。
-
StepAudioChat 的质量控制和难度校准:结构验证检查提示是否完整且自包含,有效响应是否满足所有评判标准,有缺陷响应是否至少违反其中一项。语义审计检查前提、参考响应和评判逻辑。难度使用两个能力水平不同的参考系统的响应进行校准,指导基线、判别性和困难样本的混合。评判器使用有效和有缺陷的对照样本单独校准。
-
多轮对话数据:StepAudio 3 Realtime 的训练侧重于跨轮次遵循用户意图和约束、澄清不明确的请求以及适应对话上下文。对话和推理样本的联合训练支持对困难请求进行深入思考,并对常规轮次给出简洁响应。训练样本涵盖多样的主题、人设和交互长度。
-
对话数据的分解式构建:生成遵循四个轴:主题和具体讨论点、带有角色和互动风格的参与者人设、轮次深度,以及诸如上下文回忆和逻辑推理等目标能力。分层轮转调度协调这些选择。轮次深度是一个显式变量,更长的对话通过对讨论点的更深层次参与来推进,允许后续轮次细化约束或改变方向,同时与历史保持一致。
-
对话数据的质量评估和路由:质量控制将三个关注点分开。上下文-查询审查评估对话历史的深度、开场是否自包含以及最终查询是否有实质性内容。能力特定审查检查查询是否实例化了每个要求的能力,以及响应是否满足其要求。响应审查评估答案质量、人设和风格一致性,以及作为口语对话的自然度。确定性检查处理空输出或角色混淆等缺陷。只有通过所有检查并获得高分的样本才被保留用于监督微调。
-
对话式工具使用的训练:训练结合了有针对性的语音 Agent 对话和真实的多步骤 Agent 轨迹。有针对性的对话涵盖请求路由、澄清、私有上下文检索、执行后果性操作前的确认、执行期间的更新、进度查询和结果报告。负面样本阻止不必要的工具调用和对成功执行的无依据宣称。多步骤轨迹经过过滤和规范化,重点关注工具调用结构、参数一致性、证据接地和适合语音交互的程度。
方法
StepAudio 3 Realtime 通过不断演进的对话上下文协调听、说、思、行。用户语音、模型语音和工具结果可以在交互的其他部分仍在进行时到达,形成一个紧密耦合的实时循环。有关这些耦合功能的概述,请参考框架图。
底层系统采用混合专家架构,总参数约 1960 亿,每个 token 的激活参数约 110 亿,构建在 Step 3.7 Flash 语言骨干之上。音频前端使用 Audio Transformer 编码器,并通过适配器将编码器输出映射到语言模型的表示空间。如下方图示,全双工输入路径同时包含用户和模型音频流。音频表示通过编码器和适配器进入 LLM 解码器,而文本 token 则通过单独的输入路径进入,使模型能够同时基于声学信息和文本上下文进行条件建模。语音生成器产生增量流式音频,该音频返回到模型音频流中以供后续交互使用。
为了无缝管理对话轮次,系统实现了用于全双工交互的双流架构。系统通过时间交织的表示增量地跟踪交互状态,其中音频被组织为 320 毫秒的块,每个块后跟一个状态或文本 token。声学证据和语义上下文指导继续监听、发起响应、继续说话或让出对话话权的决策。模型还使用其自身的持续语音,结合用户当前听到的内容来解读重叠的用户话语。有关双流循环架构和时间组织,请参考下图。
对话智能由“边说边想”机制驱动,该机制协调实时推理。对音频模型的两次并发调用分别充当“构思大脑”(生成私有推理轨迹)和“表达大脑”(基于目前可用的推理生成短响应片段)。自适应思考控制某轮次是否使用显式推理,以减少常规轮次上不必要的计算,而多 token 预测加速则加速私有思考流。为了支持这些能力,多轮对话训练样本通过分解式流程构建,涉及讨论点选择、案例规划、自我对弈、末轮查询构建和严格的质量标注。如下方图示,该流程确保主题多样性和人设一致性。
训练过程组织为三个基础预训练阶段:模态对齐以建立声学表示与语言模型之间的接口,大规模多模态混合训练以进行联合音频文本建模,以及一个冷却阶段,将更大权重放在高质量数据上。中训练将上下文长度扩展到 128K token,以容纳更长的对话历史和中间工具结果,并大幅增加音频理解和 Agent 交互数据的占比。最后,专门的教师检查点针对互补能力进行训练,并通过加权参数合并进行整合,使得模型在对话、音频理解和通用文本推理方面保持多样化优势,而无需引入额外的推理时路由。
实验
StepAudio 3 系列在语音识别、音频理解、对话、全双工交互、Agent 任务完成和通用文本方面进行了评估。StepAudio 3 ASR Max 在标准 ASR 基准和所有 ContextASR-Bench 子集上领先。StepAudio 3 Realtime 在八个音频理解基准中的四个上优于基线,其中在 MMSU 和 MMAR 上提升最大,数据质量消融显示约 10 万个高质量 SFT 样本优于两百万个随机样本。模型在 Full Duplex Bench 上取得最高分,并在 tau-Voice 上取得具有竞争力的 Agent 任务完成表现,而自适应思考和 MTP3 揭示选择性推理能改善对话质量,但思考分配尚未完全优化。
StepAudio 3 ASR Max 在标准英语和普通话基准上展示了具有竞争力的 ASR 性能,在大多数子集上领先,同时在 WenetSpeech 上略有落后。在 ContextASR-Bench 上,它在所有四个子集上取得最佳错误率,宏平均改进幅度超过最接近的竞争对手,表明在长格式、富含实体的语音上具有较强的鲁棒性,且无需外部上下文。StepAudio 3 ASR Max 在 LibriSpeech test-clean、test-other 和 AISHELL-1 上优于所有其他模型,其中在 AISHELL-1 上差距最大。在 WenetSpeech 上,StepAudio 3 ASR Max 在两个子集上都排名第二,以微小差距落后于 HY3.0 ASR Preview,但领先于 Doubao 2.0 ASR 和 Seed 2.0 Lite。StepAudio 3 ASR Max 在所有四个 ContextASR-Bench 子集上都是最佳,其英语和普通话的宏平均错误率均显著低于次优模型。
StepAudio 3 Realtime 在八个音频理解基准上展示了广泛的优势,在四个基准上领先,宏平均分接近 Gemini 3.1 Pro。其最大差距出现在 MMSU 和 MMAR 上,而在 AudioMultiChallenge 上明显落后,表明在复杂的多轮音频推理方面仍有改进空间。StepAudio 3 Realtime 在八个基准中的四个上取得最佳分数,其中 MMSU 和 MMAR 比次优系统分别高出 7.0 和 4.8 分。该模型在 MMAU 和 WildSpeech 上与 Gemini 3.1 Pro 具有竞争力,但在 AudioMultiChallenge 上落后 17.7 分。Big Bench Audio 对所有系统来说几乎饱和,每个模型的得分都高于 98。
StepAudio 3 Realtime 在全双工交互基准中取得最高总分,在停顿处理、轮次接管、中断处理和反馈信号处理方面均优于强基线。其在这些类别上的均衡表现表明具有较强的对话话权管理能力,尤其在轮次接管和中断处理方面表现出色,同时保持稳健的反馈信号行为。StepAudio 3 Realtime 以接近 99 的得分领先整体排名,略高于最接近的基线。它在轮次接管上取得满分,在用户中断处理上取得接近满分的成绩。其反馈信号处理得分明显高于一个主要基线,但略低于另一个基线,反映出均衡的交互画像。
推理模式下的 StepAudio 3 Realtime 在 StepAudioChat 上取得 73.0 的宏平均分,优于 Doubao 2.0 Lite 和 DeepSeek-V4-Flash,但落后于 Kimi K3。该模型在推理、记忆、知识、对话语用学和人设一致性方面表现出具有竞争力的性能,其最高分出现在安全与可靠性和知识方面,而指令遵循和对话语用学相对较弱。StepAudio 3 Realtime 在四个模型中总体排名第二,宏平均分为 73.0,高于 Doubao 2.0 Lite 和 DeepSeek-V4-Flash,但低于 Kimi K3。该模型在安全与可靠性方面取得最高分(79.0),优于 Doubao 2.0 Lite 和 DeepSeek-V4-Flash,但落后于 Kimi K3。在推理方面,StepAudio 3 Realtime(73.0)与 Doubao 2.0 Lite 相当,明显领先于 DeepSeek-V4-Flash,但显著低于 Kimi K3。对话语用学是 StepAudio 3 Realtime 的相对弱点,得分低于 Kimi K3,且仅比 Doubao 2.0 Lite 和 DeepSeek-V4-Flash 有微弱优势。
自适应思考选择性地对对话轮次应用推理,在降低推理开销的同时保留了大部分性能。它 consistently 优于无思考基线,并且在某些领域与原始的推理密集型方法持平或更优。自适应思考保留了完整推理的大部分收益,在大多数领域的得分仅略低于完整推理。与强制无思考基线相比,自适应思考显著提高了分数,尤其是在推理、记忆和知识方面。最小的推理预算应用于记忆和安全,而知识和忠实性保持较高的思考率。
StepAudio 3 ASR Max 在标准英语和普通话基准上表现强劲,在大多数子集上领先,并在长格式和富含实体的语音上显示出稳健提升,同时在 WenetSpeech 上略有落后。StepAudio 3 Realtime 在八个音频理解基准中的四个上表现出色,宏平均分接近 Gemini 3.1 Pro,但在 AudioMultiChallenge 上落后,同时在全双工交互中以接近完美的轮次接管和中断处理领先。在推理模式下,它在 StepAudioChat 上总体排名第二,落后于 Kimi K3,优势在于安全和知识,但对话语用学较弱。自适应思考通过选择性应用推理来降低推理开销,在改进无思考基线表现的同时保留了始终推理的大部分性能。