OpenAI publie les résultats de sa puce d'inférence Jalapeño
OpenAI a publié le 25 août les premiers résultats de performance de Jalapeño, sa première puce conçue en interne spécifiquement pour l'inférence des grands modèles de langage. Conçue pour réduire la consommation énergétique tout en maximisant le débit et en minimisant la latence, la puce a été testée sur trois modèles open source majeurs et comparée aux infrastructures NVIDIA GB200 et GB300. Les données montrent que Jalapeño offre un rendement énergétique supérieur de 50 à 90 % par rapport aux solutions de référence. Dans des scénarios exigeant une réponse rapide, sa vitesse de génération de tokens atteint jusqu'à quatre fois plus celle des systèmes comparés. Lorsqu'elle doit traiter un volume identique de requêtes simultanées à même vitesse, sa capacité de calcul concurrent est entre cinquante et plus de cent fois supérieure. Le projet, développé en neuf mois, repose sur une collaboration industrielle. OpenAI assure l'architecture des accélérateurs, tandis que Broadcom intervient sur les réseaux et la connectivité, et Celestica gère l'intégration système. L'originalité de Jalapeño réside dans son architecture unifiée capable de traiter à la fois l'analyse des entrées et la génération successive des réponses sur un même circuit, évitant ainsi la surcharge des transferts entre puces spécialisées. L'optimisation logicielle a été grandement accélérée par l'usage de l'IA, certains modules de calcul générés automatiquement affichant des performances 1,5 à 1,8 fois meilleures que les versions conçues manuellement. Les tests publiés concernent une version d'ingénierie précoce, baptisée A0, dont les résultats ont été vérifiés sur site par SemiAnalysis. La version suivante, B0, est déjà en phase de fabrication. Elle exploitera des procédés de gravure avancés, intègrera une mémoire haute bande passante et affichera une puissance théorique de 13,4 téraflops pour une consommation maintenue à 700 watts. OpenAI prévoit d'intégrer la première génération de Jalapeño dans son propre réseau informatique d'ici la fin 2026. La deuxième version est en développement avancé et la troisième est déjà planifiée, bien que l'entreprise ait confirmé qu'elle poursuivrait parallèlement ses achats chez NVIDIA et d'autres partenaires matériels. Ces résultats marquent une étape clé vers l'autonomie technologique d'OpenAI, même si les performances actuelles restent concentrées sur des scénarios de test à tour unique nécessitant encore des validations pour des charges de travail plus complexes.
