HyperAIHyperAI

Command Palette

Search for a command to run...

Tongyi Qianwen
LLM

Cerebras Inference propose des modèles IA non compressés

Cerebras Inference vient de dévoiler le catalogue de ses points de terminaison publics dédiés à l'inférence de modèles d'intelligence artificielle. La plateforme propose actuellement deux modèles open source majeurs, OpenAI GPT OSS et Qwen 3.8, accessibles via des essais gratuits et une facturation à l'usage, sous réserve de limites de débit. Pour les entreprises nécessitant une capacité réservée et des garanties de niveau de service production, Cerebras propose des endpoints dédiés. Le service se distingue par une architecture optimisée pour la vitesse de traitement. Le modèle GPT OSS, comptant 120 milliards de paramètres, atteint environ trois mille tokens par seconde, tandis que Qwen 3.8, avec vingt-sept milliards de paramètres, offre une vitesse d'environ mille cinq cents tokens par seconde. Les contextes de conversation s'étendent jusqu'à cent trente mille mots pour le premier et cent vingt-huit mille pour le second. Un aspect technique central souligné par l'entreprise concerne la gestion de la compression des modèles. Contrairement à certaines pratiques industrielles, Cerebras garantit que tous les modèles hébergés sur ses endpoints publics sont des versions originales, sans élagage ni modification structurelle. L'entreprise s'engage à ne jamais modifier l'architecture d'un modèle hébergé sans préavis. En cas d'adoption future de techniques d'optimisation, des endpoints distincts avec des noms spécifiques seront créés pour préserver la transparence et permettre aux utilisateurs de choisir la version adaptée à leurs besoins. Sur le plan technique, Cerebras utilise une quantification sélective des poids uniquement à des fins de stockage. Les poids sont compressés en formats 16, 8 ou 4 bits, conformément aux normes du secteur. Cependant, la déquantification s'effectue à la volée pendant l'inférence, préservant ainsi une précision totale pour les activations, l'attention et le cache KV. Cette approche garantit une qualité de sortie optimale sans compromis sur la latence ou la précision des calculs. Les recherches menées par Cerebras en matière de compression avancée, comme la méthode REAP, restent exclusivement réservées à la communauté scientifique. Les modèles élagués sont partagés sur la plateforme Hugging Face à des fins expérimentales, mais ne sont pas intégrés à l'API de production. Cette politique vise à séparer clairement les phases de recherche des services commerciaux, permettant aux développeurs de déployer des modèles fiables et pleinement précis tout en soutenant l'innovation académique.

Liens associés