Whistle يحوّل الكلام إلى نص بحجم 16.9 ميجابايت
أعلنت مجموعة Cactus-Compute عن إطلاق نموذج Whistle المفتوح المصدر للتعرف على الكلام وتحويله إلى نص، وهو نموذج مصمم خصيصاً للأجهزة الطرفية والمضمنة والذكية. يتميز النموذج بحجمه الصغير البالغ 16.9 ميجابايت، وقدرته على التشغيل الكامل على المعالجات المركزية دون الحاجة إلى مكتبات خارجية أو دعم معالجات رسومية، مما يضمن تشغيله على مجموعة واسعة من الأجهزة مثل الهواتف الذكية والأجهزة القابلة للارتداء والروبوتات وأنظمة السيارات والمتحكمات الدقيقة. يعمل النموذج بمعالجة محلية بالكامل لضمان خصوصية البيانات، إذ لا يغادر الصوت الجهاز أثناء المعالجة. يدعم التعرف على سبعة لغات تشمل الإنجليزية والألمانية والفرنسية والإسبانية والإيطالية والهولندية والبولندية، مع إمكانية معالجة مقاطع صوتية تصل إلى 30 ثانية دفعة واحدة. يحقق النموذج استجابة فائقة السرعة حيث يولّد الرمز الأول خلال 11 مللي ثانية تقريباً، ويقدم مخرجات متعددة تشمل النص المترجم، طوابع زمنية دقيقة لكل كلمة مع احتمالاتها، وتمثيلات صوتية للإطارات الزمنية. تعتمد بنية Whistle على خوارزميات مشاركة مع نموذج Needle، حيث يستخدم كتل انتباه بسيطة مشتركة ومكون بحث حزمي خماسي لتحسين الدقة والكفاءة. أظهرت الاختبارات المعيارية تفوق النموذج على نسخة Whisper الأساسية ونموذج Moonshine في مجموعات بيانات متعددة مثل LibriSpeech وSPGISpeech وFLEURS، مع الحفاظ على كفاءة زمنية تفوق النماذج التقليدية ذات الأحجام الأكبر. كما يتضمن محرك الاستدعاء آلية لتحيز الكلمات المفتاحية عبر أتمتة Aho-Corasick لتحسين تفاعلات الأوامر الصوتية المخصصة. تتوفر واجهة برمجة تطبيقات C وC++ جاهزة للاستخدام المباشر، مع ثنائي تنفيذي مسبق البناء مدعوم لـ 17 منصة تشمل أنظمة التشغيل الرئيسية والويب والأنظمة المضمنة. تم نشر أوزان النموذج على منصة Hugging Face والمصدر البرمجي على GitHub، مع توفير أدوات مقارنة وتشغيل تجريبية مباشرة عبر المتصفح أو محطة الأوامر. يُعد إطلاق Whistle خطوة عملية نحو تمكين التقنيات الصوتية المتطورة على نطاق واسع مع الحد الأدنى من متطلبات الموارد والطاقة، مما يفتح آفاقاً جديدة لتطبيقات الذكاء الاصطناعي على حافة الشبكة والأجهزة الذكية منخفضة الاستهلاك.
