إنفيديا تطلق Nemotron 3 لتمييز المتحدثين في الوقت الفعلي
أعلنت شركة إنفينيديا عن إطلاق نموذج نيموترون 3 للتمييز بين المتحدثين، وهو نظام ذكاء اصطناعي مفتوح المصدر يتكون من 100 مليون معامل، مصمم لتحليل المحادثات الصوتية وتحديد هوية كل متحدث بدقة زمنية عالية. يهدف النموذج إلى حل التحدي التقليدي لفصل الأصوات المتداخلة وربط الكلمات بالمتحدثين الأصليين، مما يمكّن التطبيقات من إنشاء نصوص موسومة بأكواد المتحدثين وأختامها الزمنية تلقائياً. يتصدر النموذج حالياً ترتيب لوحة تقييم VoiceArena Diarization-Bench، مسجلاً معدل خطأ تمييز يبلغ 14.72 في المئة، متقدماً بنسبة 24 في المئة على أقرب منافسه، مع الحفاظ على التفوق عبر مختلف بيئات التسجيل وسجلات الاجتماعات والمكالمات الهاتفية. يعتمد النموذج على بنية Sortformer المتطورة التي ترتب قنوات المتحدثين بناءً على وقت ظهورهم الأول، مما يضمن ثبات التسميات عبر مقاطع الصوت المتدفقة ويقضي على الحاجة لإعادة مطابقة المتحدثين في كل مرحلة زمنية. يدعم الإصدار الجديد ما يصل إلى ثمانية متحدثين في وقت واحد، بزيادة كبيرة من الإصدار السابق، مما يجعله مناسباً للاجتماعات الجماعية ومقابلات العملاء المعقدة. يعتمد التدريب على بيانات صوتية عامة ومرخصة من شركة ديفيد إيه آي، تشمل محاكاة ثنائية ومتعددة اللغات تصل إلى 21 لغة، مما ساهم في خفض معدل الخطأ المركب بنقطة مئوية كاملة. يتميز النموذج بمرونة عالية في زمن الاستجابة، حيث يوفر نقاط تشغيل متعددة تتراوح بين المعالجة غير المتزامنة بطول 30.4 ثانية، وحتى وضع البث منخفض الزمن الذي يبدأ عند 0.32 ثانية، مع الحفاظ على توازن دقيق بين الدقة وسرعة المعالجة. يسهل التكامل مع نماذج التعرف التلقائي على الكلام لإنتاج نصوص موسومة بالمتحدثين، ويدعمه حالياً مجموعة من شركاء النشر مثل منصة أركس التي أدمجته في نسخة 3 من حزمة تطوير البرامج الخاصة بها لتمكين التعريف الفوري بالمتحدثين. يعمل النموذج عبر مكتبة نيمو من إنفينيديا، ويتطلب وحدات معالجة رسومات متوافقة من فئات أمبير وهوبار وبلوول، ويخضع لترخيص مفتوح المصدر من نوع OpenMDW. يمثل هذا الإصدار قفزة عملية في معالجة اللغة الصوتية، حيث يوفر أدوات موثوقة لتحليل المحادثات وأتمتة واجهات الصوت وتقارير الاجتماعات الذكية، مما يعزز كفاءة التطبيقات التي تعتمد على فهم سياق الحوارات المتعددة المتحدثين في بيئات العمل والقطاع التجاري.
