OpenAI bloque une opération massive d'extraction de raisonnement
OpenAI a divulgué le 30 septembre que l'entreprise a détecté et bloqué une opération massive de « distillation antagoniste ». Les activités associées sont apparues pour la première fois le 1er juillet ; les opérateurs ont tenté d'extraire des raisonnements protégés, non affichés dans les réponses normales, en appelant systématiquement les modèles, afin de les utiliser pour entraîner, copier ou améliorer d'autres modèles. Du 24 au 25 juillet, OpenAI a surveillé environ 16 000 demandes associées provenant de plus de 4 000 utilisateurs ; une enquête plus approfondie a révélé que des schémas de prompts similaires impliquaient plus de 15 000 utilisateurs, et l'entreprise a achevé le traitement avant le 28 juillet. Les techniques d'attaque comprenaient la copie d'un raisonnement chiffré dans une conversation, puis la demande à un modèle dans une autre conversation de déchiffrer et de transcrire son contenu. OpenAI a souligné que les opérateurs n'ont pas contourné le chiffrement, envahi les bases de données ni directement accédé aux conversations stockées des utilisateurs. L'entreprise ne peut pas encore confirmer si toutes les activités proviennent du même acteur, mais elle a attribué l'un des clusters principaux à des personnes associées à Moonshot AI, le développeur de Kimi. OpenAI a interdit ou restreint les comptes concernés, renforcé les contrôles d'inscription, d'infrastructure et de détection des flux de sortie, et corrigé les chemins permettant de rejouer le raisonnement chiffré entre utilisateurs, espaces de travail et modèles. Les informations associées ont également été fournies aux partenaires via le Frontier Model Forum et les canaux de partage d'informations gouvernementaux.
