HyperAIHyperAI

Command Palette

Search for a command to run...

il y a 12 heures
NVIDIA
LLM
GPU

Nvidia Tesla V100 : 32 Go de VRAM pour les LLM locaux

Un passionné d'informatique, Oscar Molnar, a conçu un système hybride économique pour exécuter des modèles de langage locaux en combinant une carte graphique grand public avec un processeur graphique professionnel. En investissant environ 266 dollars, il a réussi à doubler la mémoire vidéo de son ordinateur, atteignant 32 gigaoctets de VRAM, une configuration particulièrement recherchée à une période où les prix de la mémoire grimpent. Le montage associe une GeForce RTX 4080 disposant de 16 gigaoctets de mémoire à une Tesla V100 SXM2 d'entreprise, également équipée de 16 gigaoctets. Comme cette dernière utilise un format de connecteur incompatible avec les plateformes grand public, Molnar a dû intégrer un adaptateur spécifique, coûtant environ 66 dollars. L'opération a également nécessité une modification technique du système de refroidissement. Le ventilateur d'origine de la carte professionnelle est notoirement bruyant, atteignant 82 décibels. Le passionné a contourné ce problème en reconnectant les câbles du ventilateur directement au connecteur de contrôle de la carte mère. Fonctionnant désormais à seulement 10 % de sa puissance maximale, le dissipateur maintient la température sous les 50 degrés tout en réduisant considérablement le bruit ambiant. Pour piloter cette configuration hybride, Molnar a utilisé le système d'exploitation NixOS avec des pilotes graphiques Nvidia hérités, compatibles à la fois avec l'architecture Volta de la Tesla et l'architecture Ada de la RTX 4080. Les résultats sont concluants : le système fait fonctionner un modèle de langage de 27 milliards de paramètres à une vitesse de 32 tokens par seconde. Cette performance, jugée idéale pour une utilisation interactive, se révèle plus rapide et plus économique que de nombreux services d'intelligence artificielle hébergés dans le cloud. Bien que des versions de la Tesla V100 disposant nativement de 32 gigaoctets de mémoire existent, leur prix double actuellement sur les marchés de l'occasion. Cette expérience démontre qu'un assemblage matériel complexe, nécessitant adaptateurs et ajustements logiciels, constitue une alternative viable pour l'inférence locale. Elle illustre également la capacité d'adaptation des utilisateurs face à la raréfaction des mémoires vidéo, proposant une solution accessible tout en repoussant les limites du matériel standard.

Liens associés