HyperAIHyperAI

Command Palette

Search for a command to run...

منذ 5 أيام
Text-to-Speech

نفيديا تطلق ماجبي TTS لوكلاء صوتيين سريعين ومتعددي اللغات

كشفت شركة إنفيديا عن آخر تحديثات لنموذج Magpie التوليدي للنص إلى كلام، الذي صُمم خصيصاً لتمكين مطوري الذكاء الاصطناعي من بناء وكلاء صوتيين منخفضي الكمون وداعمين لعدّة لغات مع الحفاظ على السيطرة الكاملة على البنية التحتية. يهدف هذا الإصدار إلى معالجة فجوة الكمون الحرجة في سلاسل العمل الصوتي، حيث تمثل معالجة تحويل النص إلى كلام آخر عتبة يلاحظها المستخدم مباشرة، لذا فإن إمكانية تشغيل النموذج محلياً ضمن البنية التحتية الخاصة تمنح المطورين مرونة ضبط أدق للكمون وضمان الامتثال لمعايير إقامة البيانات. يعتمد النموذج المحسّن على بنية ثورية تجمع بين تكديس الإطارات والمحولات المحلية، مما يقطع عدد خطوات فك التشفير إلى النصف مع استعادة جودة الصوت الطبيعية عبر نمذجة التبعيات بين الرموز الصوتية. ويصل زمن وصول الصوت الأول إلى 32 ملي ثانية على معالج B200، مع تحقيق إنتاجية تصل إلى 320 ضعف السرعة الحقيقية عند تشغيل 64 تياراً متزامناً. وتسجل الخوادم الأخرى أداءً منافساً، حيث يبلغ الكمون 47 ملي ثانية على H100 و53 ملي ثانية على DGX Spark، مما يضمن بقاء الوقت الكلي لتفاعل المحادثة ضمن النافذة الطبيعية الأقل من 200 ملي ثانية. وسع الإصدار الجديد دعمه للغة ليشمل اثنتي عشرة لغة، بما فيها العربية الفصحى الحديثة والكورية والبرتغالية البرازيلية، مع تعزيز دعم التبديل بين اللغات في الهندية واليابانية عبر قواعد نطق مخصصة ومعالجة الهجاء. كما أظهر النموذج تحسناً ملموساً في جودة التركيب، بانخفاض معدل خطأ الأحرف وتحسن تشابه المتحدث في اللغات الفرنسية والإسبانية والألمانية مقارنة بالإصدار السابق. يبرز قوة النموذج كونه مفتوح الأوزان، مما يتيح للمؤسسات تكييفه مع سياقاتها التقنية والطبية وخدمة العملاء، ومراقبة الكمون بدقة، وتجنب الاعتماد على الخدمات السحابية المغلقة. وهو مدعوم بأدوات NVIDIA NIM المقدمة كحاويات جاهزة للإنتاج، ومتكامل ضمن مثال مطوري وكلاء صوتي Nemotron الذي يقدم بنية مرجعية متكاملة لدمج نماذج الكلام واللغة والاستدلال في نظام صوتي واحد يعمل بشكل مستمر. يمثل هذا التطور خطوة استراتيجية نحو جعل الذكاء الصوتي متعدد اللغات افتراضياً في التطبيقات المؤسسية، حيث يجمع بين السرعة العالية، الجودة العالية، والمرونة التشغيلية الكاملة، مما يمهد الطريق لجيل جديد من الوكلاء التفاعليين الذكيين الذين يتفادون التأخير التكنولوجي ويوفرون تجارب صوتية طبيعية وفورية.

الروابط ذات الصلة

نفيديا تطلق ماجبي TTS لوكلاء صوتيين سريعين ومتعددي اللغات | القصص الرائجة | HyperAI