HyperAIHyperAI

Command Palette

Search for a command to run...

NVIDIA
توليد النص
LLM

إنفيديا تطلق Groq 3 LPX، حيث تتجاوز سرعة الاستدلال للسياقات الطويلة 3400 توكن في الثانية

كشفت إنفيديا عن معجل الاستدلال التفاعلي للذكاء الاصطناعي Groq 3 LPX المخصص لمنصة Vera Rubin، والذي يركز على سيناريوهات استدعاء الوكلاء الذكية التي تتطلب سياقات طويلة وحجماً صغيراً للحزم وزمن استجابة منخفض. أظهرت اختبارات أجرتها هيئة التحليل المستقلة Artificial Analysis باستخدام نموذج Gemma 4 31B أن الوسيط لسرعة إخراج Groq 3 LPX بلغ 3431 رمزاً في الثانية عند سياق إدخال يبلغ 100 ألف رمز؛ ووصل إلى 3382 رمزاً في الثانية عند سياق قدره 10 آلاف رمز، مما يدل على تأثر أدائه بشكل طفيف بطول السياق. وذكرت إنفيديا أنه يستغرق النظام حوالي 1.5 ثانية لتوليد 5000 رمز، بينما يحتاج نظام يعمل بسرعة 100 رمز في الثانية إلى نحو 50 ثانية. يحتوي رف Groq 3 LPX على 256 وحدة معالجة من نوع LP30 وإجمالي سعة ذاكرة وصول عشوائي ثابتة (SRAM) تبلغ 128 جيجابايت، وتزود كل رقاقة بـ 96 رابط اتصال سرعتها 112 غيغابت في الثانية. يمكن للمترجم الخاص به جدولة نقل البيانات بين الرقائق قبل بدء تنفيذ المهمة، والتداخل الدقيق بين العمليات الحسابية والاتصالات، ما يقلل زمن الاتصال الثابت الناتج عن توازي موترات الأبعاد الصغيرة أثناء الاستدلال بالحجوم الصغيرة للحزم. وفي اختبارات البرمجة ضمن SPEED-Bench، وصل وسيط سرعة الإخراج للنظام إلى 4767 رمزاً في الثانية. وتخطط إنفيديا لدمج Groq 3 LPX مع Vera Rubin NVL72، عبر فصل المهام مثل التعبئة المسبقة، وفك الشفرة، وآليات الانتباه، والطبقات الكاملة الرباعية (FFN)، لتقديم قدرة استدلال لأنظمة السياقات الطويلة وأنظمة الوكلاء المتعددة فائقة الحجم.

الروابط ذات الصلة