NVIDIA、8話者対応リアルタイム話者識別AI公開
NVIDIAは開放型音声話者特定モデルNemotron 3 Diarizationを公開した。1億パラメータの軽量モデルとして、VoiceArenaのベンチマークでDER 14.72%を記録し首位を獲得。最大8話者対応で重なり音声を高精度に処理し、ストリーミングとオフライン推論を統合した。 技術的には話者出現順によるラベル安定化機構を採用し、逐次チャンク処理時の話者切り替え誤りを解消。16kHzモノラル入力をTransformerエンコーダーで処理後、Conv1D層で復元する。旧モデル比DERを約40%削減し、スループットも大幅向上。4段階のレイテンシー設定により、用途に応じた精度と速度の最適化が可能。 エコシステム面ではArgmax Pro SDK 3とNeMoツールキットに統合され、ASRモデルと連携した話者属性付トランスクリプト生成パイプラインが標準化された。OpenMDWライセンスv1.1で提供され、Ampere以降のNVIDIA GPU環境で迅速に展開できる。 本モデルは、会議録要約、カスタマーサポート分析、ポッドキャスト処理など複数話者が関わる実環境音声AIの精度基準を刷新。文脈依存の会話分析においてリアルタイム対応を可能にし、エンタープライズ向け音声解析基盤として広く採用されることが期待される。開発者は対象環境の音響特性に合わせたパイプライン評価とレイテンシー設定の選定を推奨される。
このニュースは、業界の最新情報を効率的に提供するため、AIによって自動的に集約されています。内容は意見や助言を構成するものではありません。
