HyperAIHyperAI

Command Palette

Search for a command to run...

OpenAI entraînait son IA sur des livres piratés

Des documents judiciaires récemment déclassifiés dans l'affaire Authors Guild c. OpenAI et Microsoft révèlent que les dirigeants des deux entreprises étaient conscients de l'illégalité de leur utilisation de livres protégés par le droit d'auteur pour entraîner leurs modèles d'intelligence artificielle. Publiés en septembre 2026 à New York, ces rapports constituent un tournant majeur dans le procès intenté par l'Authors Guild et une centaine d'auteurs reconnus. Les pièces du dossier montrent que dès avril 2019, OpenAI et Microsoft savaient que les développeurs utilisaient LibGen, une plateforme connue pour diffuser des ouvrages sans autorisation. Sam Altman et le directeur de la recherche Dario Amodei en auraient informé Bill Gates et le directeur technique de Microsoft, Kevin Scott, lors de la présentation d'une première version de GPT-3. Plutôt que de s'inquiéter des implications juridiques, les responsables d'OpenAI craignaient principalement les retombées médiatiques, qualifiant la source de peu recommandable sur le plan de l'image publique. Les échanges internes confirment également une volonté assumée de passer outre les préoccupations des créateurs. En mai 2020, le responsable des politiques d'OpenAI, Jack Clark, a déclaré que les systèmes d'IA substitueraient de plus en plus le travail des auteurs et que l'entreprise ignorerait probablement leurs inquiétudes pour lancer ses produits. Par la suite, en 2022, Tarun Gogineni, chargé d'améliorer la qualité rédactionnelle des modèles, a exprimé son intention de voir l'IA compléter les dernières œuvres des sagas littéraires en cours. Face aux protestations des écrivains, il a qualifié les pertes économiques subies de perturbations économiques acceptables. Face à la pression juridique, OpenAI a tenté d'effacer les traces de ces pratiques entre juin et août 2022 dans ce que l'entreprise a nommé le projet Clear. Des messages internes attestent que des cadres supérieurs ont ordonné la suppression systématique des fichiers provenant de cette plateforme des serveurs et des communications internes. Ces révélations renforcent la thèse des plaignants selon laquelle l'entraînement massif de l'IA sur des œuvres protégées constitue une violation délibérée du droit d'auteur, capable de menacer la survie économique des auteurs et l'écosystème éditorial américain. L'affaire, portée à Manhattan par l'avocat Justin A. Nelson, devrait faire l'objet d'une audition début 2027. Ces nouveaux documents pourraient influencer la marche à suivre du procès et relancer le débat sur la régulation de l'intelligence artificielle face aux droits de propriété intellectuelle.

Liens associés