Cerebras et Gimlet Labs: inférence IA à 3 000 tokens/sec
Gimlet Labs et Cerebras Systems ont annoncé le 28 septembre 2026 un partenariat visant à proposer une inférence IA ultra rapide à grande échelle. Cette collaboration vise à fournir un cloud dédié à l'inférence, capable de générer jusqu'à 3 000 tokens par seconde pour les applications agentic et en temps réel. Le premier datacenter alimenté par la technologie Cerebras sera opérationnel avant la fin de l'année. Le nouveau service, intégré dans la plateforme Gimlet Cloud, associe les puces wafer-scale de Cerebras aux GPU traditionnels. Grâce à une technologie de désagrégation de l'inférence, chaque étape du traitement des modèles est exécutée sur le matériel le plus adapté à sa tâche. Cette architecture hybride permet d'optimiser la latence, un facteur crucial pour les assistants vocaux, la vidéo en direct et les agents autonomes qui exigent des réponses immédiates pour offrir une expérience fluide. Zain Asgar, co-fondateur et PDG de Gimlet Labs, a souligné que la vitesse d'inférence détermine directement la productivité de l'IA et la qualité des interactions utilisateur. En couplant son logiciel d'orchestration multi-puces au moteur wafer-scale de Cerebras, l'entreprise entend rendre cette performance accessible aux développeurs à l'échelle industrielle. De son côté, Sean Lie, co-fondateur et CTO de Cerebras, a indiqué que cette alliance répond aux besoins économiques des centres de données en combinant la vitesse pure de Cerebras avec le haut débit des GPU. Le partenariat servira également de lancement officiel pour la prochaine génération de puces Cerebras, la CS-4. La coopération repose sur des tests privés menés depuis l'année dernière. Gimlet Labs prévoit d'étendre la collaboration en intégrant des outils de développement, des APIs optimisées et des services de validation en production. Cette initiative s'inscrit dans la stratégie de Gimlet Labs, financée par Andreessen Horowitz et Menlo Ventures, qui cherche à repousser les limites de l'efficacité computationnelle grâce à une orchestration logicielle avancée. De son côté, Cerebras Systems continue de positionner ses infrastructures comme les plus rapides du marché, servant déjà de nombreuses entreprises internationales, instituts de recherche et gouvernements. Cette union marque une étape importante vers une IA temps réel plus réactive et économiquement viable, tout en élargissant l'accès aux infrastructures de pointe pour une communauté de développeurs en pleine expansion.
