HyperAIHyperAI

Command Palette

Search for a command to run...

il y a un jour
AMD
LLM
GPU

AMD rachète Taalas pour accélérer l'inférence IA

AMD a annoncé l'acquisition de la startup canadienne Taalas, spécialisée dans les processeurs d'intelligence artificielle, dans le but d'accroître ses performances en inférence et de contester la domination de Nvidia sur le marché du matériel dédié aux charges de travail génératives. Cette transaction, officialisée à la clôture des marchés récents, devrait être finalisée au quatrième trimestre sous réserve de l'approbation des autorités de régulation. La technologie unique de Taalas repose sur la gravure directe des poids d'un modèle d'IA dans le silicium, créant ce que l'entreprise qualifie de circuits intégrés spécifiques au modèle. Contrairement aux architectures conventionnelles qui dépendent de la mémoire vive haute bande passante pour stocker les données, cette approche élimine les goulots d'étranglement traditionnels et promet une accélération significative de la génération de tokens. Lors de ses premiers tests en février, la puce initiale de Taalas, fabriquée en technologie six nanomètres, a traité le modèle Llama 3.1 8B à une vitesse de près de dix-sept mille tokens par seconde. La prochaine génération, annoncée pour cet été, vise vingt milliards de paramètres par puce. En utilisant le parallélisme de pipeline, plusieurs accélérateurs peuvent être combinés pour gérer des modèles de grande taille sans surcharge. Selon AMD, cette technologie sera intégrée à sa plateforme de calcul à échelle de rack Helios, basée sur ses processeurs Instinct. L'entreprise envisage une architecture disagrégée où les unités graphiques prendraient en charge le traitement des requêtes initiales, tandis que la génération des réponses serait déléguée aux puces Taalas. Une autre possibilité consisterait à valider les modèles sur les accélérateurs Instinct avant de migrer vers la solution Taalas une fois les performances consolidées. Cette innovation comporte toutefois une contrainte opérationnelle majeure : une fois la puce fabriquée, elle est verrouillée sur un modèle précis. Un changement substantiel exigerait la fabrication d'un nouveau circuit. Taalas assure néanmoins que cette mise à jour ne nécessiterait que la modification de deux couches métalliques, ce qui réduirait considérablement les délais et les coûts par rapport à un nouveau design complet. Ce compromis conviendra principalement aux développeurs de grands modèles, aux fournisseurs d'infrastructure et aux prestataires d'inférence, notamment les acteurs majeurs déjà clients d'AMD comme OpenAI, Anthropic ou Meta. En abaissant le coût par token et en augmentant la vitesse de sortie, cette technologie pourrait également encourager les développeurs à prolonger le temps de raisonnement de leurs modèles, une méthode connue sous le nom de test-time scaling, sans pénalité financière excessive. L'acquisition s'inscrit dans la stratégie de Vamsi Boppana, vice-président chargé de l'intelligence artificielle chez AMD, qui insiste sur la nécessité de proposer une plateforme complète offrant une flexibilité maximale aux clients pour chaque type de charge de travail IA.

Liens associés