Mistral AI dévoile Shieldstral, un modérateur IA adaptable
Mistral AI a publié Shieldstral, un classifieur de sécurité multimodal de trois milliards de paramètres mis à disposition en poids ouverts sous licence Apache 2.0. Développé dans le cadre de la nouvelle Open Secure AI Alliance, annoncée conjointement avec NVIDIA, ce modèle repense la modération automatique de contenu. Contrairement aux solutions traditionnelles qui intègrent des catégories de risques figées lors de l'entraînement, Shieldstral traite la vérification des contenus comme une tâche de réponse à des questions adaptative. Les développeurs peuvent ainsi soumettre des politiques de sécurité formulées en langage naturel directement lors de l'utilisation, sans nécessiter de réentraînement. Le modèle retourne un score de sécurité continu et calibré, simplifiant ainsi l'évaluation unifiée des textes et des images. Les performances du classifieur sont particulièrement notables. Il atteint ou dépasse des solutions concurrentes jusqu'à sept fois plus volumineuses sur des benchmarks de sécurité textuelle et de modération multimodale. Son architecture légère lui permet de fonctionner sur un seul GPU NVIDIA de 16 gigaoctets, le rendant accessible aux entreprises souhaitant déployer des garde-fous IA sans infrastructure coûteuse. L'outil unifie la classification des invites, la modération des réponses, la détection des refus et l'analyse de la toxicité en un seul processus décisionnel. La conception de Shieldstral repose sur une stratégie de données rigoureuse. Mistral AI a consolidé des ensembles de données publics hétérogènes en un format standardisé, en ajustant le niveau de strictité selon le type de source pour garantir des frontières de décision précises. Plutôt que de mémoriser des labels fixes, le modèle a été entraîné sur des paires contrastées générées par intelligence artificielle, lui permettant de distinguer finement des politiques de sécurité voisines et de généraliser son raisonnement à de nouvelles règles non vues lors de l'entraînement. Les données visuelles, plus difficiles à synthétiser, ont été enrichies grâce à des ensembles d'images génériques utilisées comme exemples négatifs et filtrées par des modèles de reranking pour limiter les erreurs. La fusion de plusieurs points de contrôle a également permis de combiner calibration et capacité d'adaptation. Développé entièrement sur la plateforme d'entraînement Forge de Mistral AI, Shieldstral s'inscrit dans une volonté de rendre la sécurité des systèmes d'intelligence artificielle plus flexible et contextuelle. L'entreprise précise que les mêmes contenus peuvent être tolérés sur un outil de recherche informatique mais considérés comme nocifs sur une plateforme de santé mentale. En déplaçant les règles de modération du modèle vers les invites utilisateur, Shieldstral élimine la nécessité de maintenir plusieurs versions spécifiques à chaque déploiement. Mistral AI prévoit d'étendre les capacités du classifieur vers une meilleure couverture multilingue, une robustesse accrue sur des documents longs et une sécurité multimodale plus complète. Les poids ouverts du modèle sont déjà disponibles pour la recherche et le développement, invitant la communauté à construire des applications adaptées à des environnements réglementaires variés.
