HyperAIHyperAI

Command Palette

Search for a command to run...

NVIDIA Vera Rubin : 30x plus d'efficacité pour les agents IA

L'essor des agents d'intelligence artificielle transforme la demande en puissance de calcul. Contrairement aux conversations simples, ces systèmes enchaînent raisonnements, appels d'outils et coordination de sous-agents, ce qui multiplie la consommation de tokens par requête. Selon des données récentes, une tâche agentic utilise en moyenne quinze fois plus de tokens qu'une interaction standard, avec un contexte qui s'accumule sur des centaines de milliers de jetons au fil des étapes. Cette complexité impose aux infrastructures des exigences strictes en matière d'efficacité énergétique et de gestion du contexte étendu. Pour mesurer ces performances dans des conditions réelles, NVIDIA s'appuie sur le benchmark SemiAnalysis AgentX, qui rejoue des sessions de programmation agentic réelles incluant la croissance du contexte et les latences d'outils. Les résultats révèlent que la plateforme Vera Rubin NVL72 offre un débit jusqu'à trente fois supérieur par mégawatt que le modèle précédent GB300 NVL72 sur ce type de charge. Cette amélioration s'accompagne d'une réduction du coût par million de tokens de trente-cinq fois par rapport au GB300. De son côté, le GB300 NVL72 démontre déjà une efficacité nettement supérieure à sa génération précédente, H200, avec un débit par mégawatt supérieur de quinze fois et un coût par million de tokens réduit de dix fois. Ces gains résulcent d'une architecture entièrement repensée pour les charges agentic. La combinaison de cœurs Tensor de cinquième génération, d'un moteur Transformer de troisième génération et d'une quantification NVFP4 permet d'accélérer les phases de préremplissage et de décodage tout en réduisant l'empreinte mémoire. Le réseau d'interconnexion NVLink de sixième génération et le framework de distribution Dynamo optimisent la répartition des calculs et la réutilisation du contexte, garantissant une interactivité fluide même lorsque la demande s'intensifie. La plateforme complète intègre également des processeurs centraux, des accélérateurs dédiés et des connectivités haute performance pour gérer simultanément l'exécution des modèles, le traitement des outils et la gestion des caches. Pour les opérateurs de centres de données confrontés à des limites électriques strictes, cette efficacité se traduit directement par une capacité opérationnelle accrue. Un budget énergétique fixe peut désormais alimenter un nombre nettement supérieur d'agents simultanément, tout en améliorant les marges grâce à la baisse du coût des tokens. Ces mesures, publiées récemment et en cours d'examen indépendant, confirment que l'optimisation logicielle et matérielle conjointe reste la clé pour déployer l'intelligence artificielle agentic à l'échelle industrielle. Les performances continueront de progresser grâce aux mises à jour logicielles continues, positionnant cette nouvelle génération d'infrastructures comme un standard de référence pour les usines d'IA de demain.

Liens associés