يعمل نموذج جيما 4 على 2 جيجابايت رام في ماكبوك
كشف المهندس أندريه ميخاييلوف عن إطلاق مشروع TurboFieldfare، محرك استنتاج مخصص يعتمد على لغتي Swift وتقنية Metal، يتيح تشغيل النموذج اللغوي الكبير Gemma 4 26B-A4B بسعة 26 مليار معلمات على حواسيب Apple Silicon بذاكرة وصول عشوائي لا تتجاوز 8 غيغابايت. ويهدف المشروع إلى تخطي القيود التقليدية لاستهلاك الذاكرة عبر الحفاظ على النواة الأساسية للنموذج (حوالي 1.35 غيغابايت) ومخزن سياق الرموز بصيغة FP16 داخل الذاكرة المباشرة، بينما يتم دفق خبراء التوزيع الذاتي (MoE) المطلوبين لكل رمز نصي مباشرة من محرك التخزين SSD عند الطلب. يعمل هذا التصميم المخصص الذي لا يعتمد على أطر عمل وسيطة مثل MLX أو llama.cpp، على تقليل استهلاك الذاكرة النشط إلى نحو 2 غيغابايت فقط، مع احتلال النسخة المثبتة للنموذج حوالي 14.3 غيغابايت من مساحة التخزين المحلي. من حيث الأداء، سجل المحرك سرعات توليد تتراوح بين 5.1 و6.3 رمزا في الثانية على MacBook Air بمعالج M2 وذاكرة 8 غيغابايت، بينما تصل إلى 31-35 رمزا في الثانية على MacBook Pro بمعالج M5 Pro. يدعم التطبيق نظام macOS الحديث وMetal 4، ويتكامل بالكامل مع بنية المعالجة عبر نوى Metal مخصصة للعمليات الحسابية الكمية، وإدارة مخزن خبراء بحد أقصى 16 خانة، وتقسيم المعالجة المسبقة للسياق إلى كتل، وتوليد الرموز تباعاً بكفاءة عالية. يوفر المشروع ثلاثة مسارات للاستخدام تشمل تطبيقاً أصلياً لسطح المكتب، وواجهة سطر أوامر، وخادما محليا متوافقا مع واجهة برمجة تطبيقات OpenAI يدعم تدفق النصوص ومكالمات الأدوات. يركز المحرك حالياً على الاستنتاج النصي فقط، مع تنسيق محادثة آلي ودعم متقدم لإعدادات أخذ العينات. تم نشر الكود المصدري تحت رخصة Apache 2.0، فيما تظل أوزان النموذج خاضعة لشروط المصدر الأصلي، مع تأكيد استقلالية المشروع عن جوجل. يأتي هذا التطوير كخطوة عملية مهمة نحو تمكين الأجهزة الشخصية منخفضة المواصفات من تشغيل نماذج الذكاء الاصطناعي الضخمة محليا دون اعتماد سحابي، وسط توقعات بمواصلة المطورين توسيع نطاق الدعم الفني عبر المساهمات المجتمعية.
