HyperAIHyperAI

Command Palette

Search for a command to run...

英伟达发布Nemotron 3说话人日志模型,实时多人分离

英伟达(NVIDIA)近日正式发布开源模型NVIDIA Nemotron 3 Diarization,专为实时多说话人AI应用提供高精度语音分离能力。该一亿参数级模型支持同时处理多达八人的对话场景,可精准识别语音重叠、静音间隙及流式传输中的说话人切换。在权威评测榜单VoiceArena Diarization-Bench中,该模型以14.72%的错误率(DER)拔得头筹,性能较次席模型相对提升约24%,较英伟达上一代产品准确率平均提高41%。在架构设计上,模型采用Sortformer技术与首次出声排序机制,有效解决了流式推理中说话人标签漂移的难题。系统支持从离线分析到0.32秒超低延迟的多种运行模式,帮助开发者在计算延迟与识别精度间取得最优平衡。通过与自动语音识别技术联动,该方案可直接生成带时间戳的说话人归属文本,大幅提升会议摘要、智能客服及语音记忆库的构建效率。目前,该模型已按开源协议上架,并深度集成至NVIDIA NeMo工具包。头部生态伙伴Argmax亦在最新开发套件中率先完成适配,标志着多说话人实时语音解析能力正加速迈向产业落地。

相关链接