OpenAI : documents révèlent l'usage de livres pour ChatGPT
Des documents judiciaires récemment déclassifiés dans le cadre d'un procès pour violation de droits d'auteur révèlent les échanges internes d'OpenAI concernant la constitution de ses données d'entraînement. Selon ces archives, des employés de l'entreprise ont pesé le pour et le contre entre l'achat légal de livres et le recours à des contenus piratés pour développer les premières versions de ChatGPT. Face aux coûts élevés et à l'urgence de disposer de volumes massifs de texte, certaines conversations ont abordé des pratiques considérées comme éthiquement problématiques par les participants eux-mêmes. Ces divulgations, survenues dans le sillage d'un litige en cours, illustrent les dilemmes économiques et juridiques qui ont marqué la phase initiale de développement des grands modèles de langage. Elles alimentent également les débats sur la transparence des méthodes d'entraînement des IA et renforcent les exigences des éditeurs en matière de respect des droits intellectuels. Alors que la justice examine de près les pratiques du secteur, ces documents rappellent que l'innovation rapide dans l'intelligence artificielle s'accompagne de défis croissants en matière de conformité légale.
