NVIDIA GB200 : Presto GPU réduit la latence analytique
Presto, moteur de requêtes SQL distribué open source, gagne en efficacité grâce à son exécution sur les processeurs graphiques NVIDIA. Une série de tests réalisée sur les architectures DGX B200 et GB200 NVL72 démontre une réduction significative de la latence pour les charges analytiques à grande échelle. En exploitant les algorithmes NVIDIA cuDF et la liaison NVLink 5.0 pour les communications inter-GPU, la version accélérée du moteur offre des temps d’exécution nettement inférieurs à ceux des solutions purement matérielles basées sur processeurs centraux. Les benchmarks, inspirés du standard TPC-H, comparent l’exécution sur une seule machine DGX B200 équipée de huit GPU à des grilles de serveurs Intel Xeon composées de huit à dix nœuds. Pour un jeu de données d’environ un téraoctet, l’accélération GPU réduit la durée des requêtes de 2,5 à 8,2 fois selon le nombre de GPU activés. Avec trois téraoctets, le gain oscille entre 3 et 8 fois. Ces résultats confirment que l’architecture unifiée permet de traiter des volumes massifs sans compromettre le temps de réponse, essentiel pour les tableaux de bord interactifs ou les traitements par lots. La scalabilité vers plusieurs nœuds a été validée sur le cluster GB200 NVL72, réunissant dix-huit machines connectées par NVLink et des cartes réseau ConnectX-7 à 400 Gbps. Pour coupler cette puissance de calcul à un stockage robuste, l’équipe a intégré IBM Storage Scale, un système distribué offrant des capacités RDMA compatibles avec le protocole InfiniBand. L’utilisation de NVIDIA GPUDirect Storage (GDS) s’avère alors critique. Cette technologie transfère directement les données du stockage vers la mémoire des GPU, contournant le processeur central et les mémoires tampons système. Comparé aux lectures standard, GDS double les performances en éliminant les transferts redondants et les pénalités liées à l’architecture NUMA. Une série d’optimisations successives a permis de gagner 64 % de temps supplémentaire sur les requêtes à grande échelle. L’activation de GDS, l’augmentation de la taille des tâches d’entrée-sortie et le passage de quatre à seize threads d’I/O ont d’abord saturé plus efficacement la bande passante NVLink. Un réajustement du regroupement des échanges et une restructuration d’une requête spécifique (Q11) ont ensuite abaissé son exécution de cinquante secondes à deux secondes, tout en maintenant un taux d’utilisation des GPU proche de son maximum. À l’avenir, les développeurs visent à améliorer le transfert des résultats vers le nœud coordinateur sans nécessiter de modifications manuelles des requêtes. Disponible en prévisualisation technique via la plateforme IBM watsonx.data, cette version du moteur s’adresse désormais aux entreprises recherchant une analyse de données interactive et performante. Le code source et les images de conteneur sont également accessibles aux développeurs souhaitant tester le déploiement en environnement de production. Cette convergence entre l’écosystème Presto, les infrastructures NVIDIA et les solutions de stockage haute performance marque une étape vers une analytique temps réel plus accessible et économe en ressources.
