Sarvam lance des modèles IA open-source puissants pour défier les géants américains et chinois
L’entreprise indienne de recherche en intelligence artificielle Sarvam a lancé mardi une nouvelle génération de modèles de langage à grande échelle, marquant une miseépargne stratégique sur la viabilité des modèles d’IA open source. Ce lancement, annoncé lors du India AI Impact Summit à New Delhi, s’inscrit dans une volonté du gouvernement indien de réduire sa dépendance aux plateformes étrangères et de développer des solutions adaptées aux langues locales et aux besoins spécifiques du pays. La nouvelle gamme comprend des modèles de 30 milliards et 105 milliards de paramètres, ainsi qu’un modèle de synthèse vocale, un modèle de reconnaissance vocale et un modèle visuel capable d’analyser des documents. Ces développements représentent une évolution significative par rapport au modèle Sarvam 1, lancé en octobre 2024, qui ne comptait que 2 milliards de paramètres. Les modèles de 30 et 105 milliards de paramètres utilisent une architecture à « mélange d’experts », qui active uniquement une fraction des paramètres à chaque instant, permettant ainsi une réduction importante des coûts informatiques. Le modèle de 30 milliards de paramètres propose une fenêtre contextuelle de 32 000 tokens, idéale pour les échanges conversationnels en temps réel, tandis que le modèle plus puissant, avec une fenêtre de 128 000 tokens, est conçu pour des tâches complexes nécessitant un raisonnement multi-étapes. Sarvam affirme que ces modèles ont été entraînés de zéro, sans être simplement affinés à partir de systèmes open source existants. Le modèle de 30 milliards de paramètres a été pré-entraîné sur environ 16 billions de tokens textuels, tandis que le modèle de 105 milliards a été formé sur des trillions de tokens couvrant plusieurs langues indiennes. Conçus pour des applications en temps réel, ces modèles visent à alimenter des assistants vocaux, des systèmes de chat ou des outils d’entreprise dans les langues locales. Le modèle de 105 milliards de paramètres vise à concurrencer des géants comme OpenAI (GPT-OSS-120B) ou Alibaba (Qwen-3-Next-80B). Le développement a été rendu possible grâce à l’appui du programme gouvernemental IndiaAI Mission, avec une infrastructure fournie par le data center Yotta et un soutien technique de Nvidia. Les dirigeants de Sarvam insistent sur une stratégie de croissance mesurée, centrée sur des applications concrètes plutôt que sur la taille pure des modèles. « Nous voulons être attentifs à la manière dont nous évoluons », a déclaré Pratyush Kumar, co-fondateur de l’entreprise. « Nous ne voulons pas croître de façon aveugle. Nous devons comprendre quelles tâches sont vraiment importantes à grande échelle et construire pour elles. » Sarvam prévoit de rendre open source les modèles de 30 et 105 milliards de paramètres, bien qu’elle n’ait pas précisé si les données d’entraînement ou le code complet seraient également publiés. L’entreprise a également annoncé des projets de développement de systèmes spécialisés, notamment des modèles dédiés au codage et des outils d’entreprise sous la marque Sarvam for Work, ainsi qu’une plateforme d’agents conversationnels baptisée Samvaad. Fondée en 2023, Sarvam a levé plus de 50 millions de dollars auprès d’investisseurs comme Lightspeed Venture Partners, Khosla Ventures et Peak XV Partners (anciennement Sequoia Capital India).
