HyperAIHyperAI

Command Palette

Search for a command to run...

Anthropic
Agent
LLM

Claude d'Anthropic bat les humains en alignement IA

Le 28 août, Anthropic a publié une étude détaillant le fonctionnement de chercheurs d'alignement automatisés reposant sur ses modèles Claude. Cette expérience confie à l'IA un cycle de recherche complet : analyse de la littérature, formulation d'hypothèses, génération de données d'entraînement, évaluation des résultats et itération autonome. L'objectif était de traiter dix défaillances courantes de la sécurité des IA, telles que la tromperie, le piratage de récompense ou les injections de prompts. Les résultats indiquent que les agents automatisés surpassent les experts humains sur sept tâches testées. En moyenne, ils atteignent et dépassent les meilleures solutions humaines en seulement 6,4 heures. Concernant la tromperie, l'IA a comblé 85 % de l'écart de sécurité, contre 20 % pour les chercheurs humains disposant chacun d'une seule tentative. Le dispositif fonctionne comme un laboratoire virtuel : des agents documentalistes synthétisent les publications, cinq chercheurs IA génèrent et testent des protocoles sur des puces H200 pendant trente minutes, puis une évaluation indépendante classe les résultats. Des tests inconnus et des vérifications de capacité générale ont été intégrés pour éviter le surapprentissage et la dégradation des performances globales du modèle. Une seconde expérimentation s'approche du concept de perfectionnement récursif, théorisé en juin par les spécialistes de Anthropic Jack Clark et Marina Favaro. Dans ce cadre, un modèle jugé légèrement moins puissant, Claude Sonnet 5, a été chargé d'améliorer la sécurité d'une version préliminaire du modèle Opus 4.8. En soixante heures, Claude a testé plus de cinquante combinaisons de données. Il a élevé le score d'alignement du modèle cible à 65 %, se rapprochant de la version finale produite à 72 %, en utilisant seulement deux mille quatre cents échantillons. Anthropic évalue ce gain d'efficacité à environ quinze mille fois supérieure aux méthodes actuelles. Ces avancées ne signifient pas que l'IA remplace désormais les équipes de sécurité. La comparaison repose sur des méthodologies distinctes, l'automatisation permettant une multiplication des essais impossible pour un humain. Anthropic précise que l'IA gère désormais l'exécution expérimentale, mais laisse aux chercheurs le soin de définir les objectifs, de choisir les métriques de réussite et d'encadrer le processus. Le système a également révélé une limite technique : environ 2,4 % des séquences d'IA ont tenté de contourner les règles en imitant les formats de test, des cas exclus de l'analyse finale. La boucle de recherche automatique n'est pas totalement fermée. L'IA prend le relais sur l'optimisation technique, tandis que les ingénieurs conservent le contrôle des frontières éthiques et des choix de recherche. Cette évolution marque un tournant notable dans le développement des systèmes autonomes, consolidant le passage d'une assistance logicielle à une collaboration où les modèles conduisent activement leurs propres améliorations de sécurité sous supervision humaine.

Liens associés