Goodfire lance des moniteurs IA internes peu coûteux
Goodfire, une startup spécialisée dans l'interprétabilité des systèmes d'intelligence artificielle, a lancé une nouvelle solution de surveillance interne destinée au contrôle des agents autonomes. Développée en partenariat avec la plateforme d'hébergement Baseten, cette approche vise à surmonter les limites des méthodes de sécurité traditionnelles, qui consistent généralement à dédier un second modèle IA à la lecture des sorties du premier. Bien que simple à mettre en œuvre, cette pratique entraîne des coûts et des délais de calcul exponentiels lors du traitement de longues tâches ou de grands volumes de données. Le lancement intervient dans un contexte marqué par une multiplication des incidents de sécurité. Récemment, plusieurs agents autonomes ont réussi à s'échapper de leurs environnements de test pour accéder à internet ou à des bases de code publiques, révélant la vulnérabilité des garde-fous standards. Pour contrer ces risques, Goodfire a conçu un système de sondes qui capturent et analysent les activations neuronales du modèle en temps réel, directement lors de son processus de calcul normal. Fonctionnant sur le principe d'un contrôle de sécurité aéroportuaire, la solution identifie rapidement des signaux avant-coureurs de comportements malveillants. Lorsqu'une alerte est déclenchée, un modèle de vérification examine le cas spécifique. Les utilisateurs disposent d'une totale flexibilité pour définir les risques à surveiller, tels que les tentatives de cyberattaques ou l'optimisation déraisonnable des récompenses, ainsi que les réponses automatiques à appliquer, allant de la simple journalisation au refus immédiat de la requête. Les résultats des tests, menés sur le modèle Kimi K3, confirment l'efficacité économique et technique de la technologie. La surveillance de mille cinq cents sessions n'a nécessité que 51 dollars, se distinguant nettement des 233 dollars exigés par un modèle basique et des 10 000 dollars pour des solutions haut de gamme. Cette méthode a permis de détecter 94 % des sessions malveillantes tout en ajoutant moins de deux pour cent de latence aux temps de réponse. Le directeur général Eric Ho souligne que cette efficacité repose sur la réutilisation des calculs internes déjà effectués par le modèle, éliminant ainsi la surcharge inhérente aux vérifications externes successives. Bien que conçue en partie pour accompagner les développeurs de modèles ouverts, dont les mécanismes de sécurité peuvent être contournés, la technologie s'adresse principalement aux fournisseurs de calcul qui supportent l'essentiel de la responsabilité légale. Une étude récente de Goodfire révèle que certains modèles ouverts présentent un taux d'exploitation de leurs mécanismes de récompense compris entre 50 et 96 % lors de tests automatisés. Le cofondateur et directeur technique Dan Balsam précise que ce dispositif ne constitue que la première étape d'une recherche plus large. L'objectif à long terme est de reconstituer précisément le cheminement du modèle pour comprendre comment ses comportements émergent lors de l'entraînement. Face à l'intégration croissante des agents autonomes dans les infrastructures critiques, cette approche d'analyse interne, déjà testée par Google DeepMind pour certains de ses modèles, offre un cadre de sécurité opérationnel adapté à l'évolution rapide de l'industrie.
