NVIDIA ModelExpress accélère le chargement des modèles IA
NVIDIA a présenté ModelExpress, une solution conçue pour accélérer le déploiement des grands modèles d'intelligence artificielle au sein des clusters informatiques. Le transfert de fichiers de poids de modèles, pouvant atteindre plusieurs téraoctets, vers la mémoire des processeurs graphiques constitue un goulot d'étranglement majeur. Ce processus ralentit les démarrages à froid, la mise à l'échelle automatique et les mises à jour continues des réseaux de neurones. ModelExpress résout ce problème en évitant les téléchargements redondants depuis le stockage distant et en optimisant le cycle de vie des données. Le principe fondamental repose sur une logique de partage intelligent. Au lieu de récupérer systématiquement les poids depuis un serveur cloud pour chaque nouveau nœud, le système interroge d'abord la présence d'une copie compatible sur un autre serveur déjà en activité. Lorsqu'un tel nœud est identifié, ModelExpress transfère les données directement de processeur graphique à processeur graphique via un protocole de transfert réseau direct. Cette approche contournant le disque local et la mémoire centrale réduit drastiquement la latence. En l'absence de pair disponible, le système diffuse directement les fichiers depuis le stockage objet vers la mémoire graphique, sans les enregistrer préalablement sur le disque dur. Au-delà des poids du modèle, la technologie optimise également le partage des caches de compilation. Lors de leur premier traitement, les moteurs d'inférence compilent des instructions spécifiques et optimisent des algorithmes. Cette étape, chronophage, est désormais évitée grâce à la distribution de ces artefacts compilés entre les nœuds du réseau. De plus, ModelExpress prend en charge les mises à jour dynamiques de poids pendant l'entraînement par renforcement, permettant aux serveurs d'inférence de synchroniser rapidement les nouvelles données générées par les algorithmes d'entraînement sans interrompre le service. Les tests réalisés sur des configurations multicarte avec le modèle DeepSeek-V4 Pro démontrent une amélioration significative. Le temps de démarrage global est passé de huit minutes à une minute quarante-quatre secondes, avec un transfert pair à pair des poids effectué en moins de dix secondes. La redistribution des caches de compilation accélère encore davantage la mise en service des services d'inférence. Conçue pour rester compatible avec divers matériels et infrastructures réseau, ModelExpress intègre des stratégies de repli automatiques si certains protocoles ne sont pas supportés. Elle s'interface nativement avec des frameworks populaires comme vLLM et SGLang, tout en étant adaptée pour s'intégrer à Dynamo et llm-d. En centralisant et en optimisant le cycle de vie des données modèles, NVIDIA entend réduire les coûts infrastructurels et accélérer le passage à l'échelle des centres de données dédiés à l'intelligence artificielle.
