HyperAIHyperAI

Command Palette

Search for a command to run...

il y a 3 jours
LLM
IA Générative

Amazon repense Alexa pour réduire ses coûts d'IA

Amazon mène une restructuration profonde du fonctionnement d'Alexa et de sa version augmentée Alexa+, dévoilée en février 2025, afin de maîtriser la hausse exponentielle des coûts liés à l'intelligence artificielle. Selon des documents internes consultés par les médias, l'entreprise s'appuie sur des initiatives de la fin 2024 et du début 2025 pour réduire drastiquement sa dépendance aux modèles de Claude d'Anthropic, malgré des investissements bilionnaires et un partenariat stratégique avec la startup. Le principal défi financier provient du passage aux grands modèles de langage pour générer les réponses d'Alexa+. Ces processus intensifs en puissance de calcul entraînent une augmentation massive des dépenses cloud AWS. Les prévisions internes indiquaient que les coûts liés à Alexa+ auraient atteint environ 1,7 milliard de dollars américains en 2026, soit près du triple de l'année précédente et 60 % au-dessus des objectifs de l'entreprise. Pour corriger cette trajectoire, Amazon a déployé une architecture de routage multicanaux, une pratique qui se généralise rapidement dans le secteur technologique. Cette stratégie consiste à envoyer les requêtes complexes vers des modèles frontaliers sophistiqués, tout en dirigeant les demandes courtes vers des modèles propriétaires moins onéreux ou en exploitant des mécanismes de mise en cache et de traitement déterministe. Ces techniques permettent à l'assistant d'accéder directement à des réponses prédéfinies ou de générer des résultats prévisibles sans solliciter un modèle de langage à chaque interaction. Parallèlement, Amazon cherche à optimiser l'utilisation de ses infrastructures matérielles. Plutôt que de simplement multiplier les GPU Nvidia, l'entreprise prévoit d'augmenter la capacité de traitement d'environ 50 % et de réduire les temps de réponse de 40 % grâce à des améliorations logicielles. Le déploiement de ses propres processeurs Trainium est également à l'étude pour diversifier les sources de calcul. Le dirigeant d'Amazon, Andy Jassy, avait déjà souligné l'urgence de réduire le coût de l'inférence pour rendre l'intelligence artificielle accessible à grande échelle. Selon les analystes, cette approche permet de préserver l'expérience utilisateur tout en maîtrisant les dépenses opérationnelles. Alexa+ a connu un déploiement progressif aux États-Unis en 2025, après plusieurs reports dus à des problèmes d'exactitude des réponses et à des interrogations sur sa maturité technique. Les documents internes révèlent également qu'Amazon a envisagé de ralentir certains projets avancés pour limiter les dépenses IA. En recentrant son architecture sur l'efficacité computationnelle et le routage intelligent des requêtes, Amazon s'inscrit dans une tendance industrielle où la course à la performance pure laisse progressivement place à une optimisation économique. Ces mesures visent à rendre le service viable financièrement tout en maintenant son attrait commercial, marquant un tournant dans la gestion des ressources IA à l'échelle industrielle.

Liens associés