NVIDIA lance Groq 3 LPX : la vitesse d'inférence sur de longs contextes dépasse les 3400 tokens par seconde
NVIDIA présente l'accélérateur d'inférence IA interactive Groq 3 LPX destiné à la plateforme Vera Rubin, conçu pour les scénarios d’inférence par agents nécessitant de longs contextes, des lots petits et une faible latence. Des tests réalisés par le tiers indépendant Artificial Analysis avec le modèle Gemma 4 31B montrent que, dans un contexte d’entrée de 100 K tokens, la médiane du débit de sortie atteint 3 431 tokens par seconde ; elle est de 3 382 tokens par seconde sur un contexte de 10 K tokens, ce qui indique que ses performances sont peu sensibles à la longueur du contexte. Selon NVIDIA, générer 5 000 tokens prend environ 1,5 seconde, tandis qu’un système offrant 100 tokens/seconde nécessite près de 50 secondes. Le rack Groq 3 LPX intègre 256 unités de traitement LP30 et dispose d’une mémoire SRAM totale de 128 Go, chaque puce étant équipée de 96 liens interconnexions de 112 Gbit/s. Son compilateur planifie les transferts de données entre puces avant l’exécution des tâches et superpose calculs et communications au niveau fin, réduisant ainsi la latente fixe liée aux communications lors de l’inférence en petit lot sous parallélisme tensoriel. Dans les benchmarks de programmation SPEED-Bench, la médiane du débit de sortie du système atteint 4 767 tokens par seconde. NVIDIA prévoit d’intégrer Groq 3 LPX avec Vera Rubin NVL72 afin de fournir des capacités d’inférence adaptées aux très grands contextes et aux systèmes multi-agents à échelle massive, grâce à la séparation des tâches telles que la préremplissage, le décodage, l’attention et FFN.
