Graphite : les tics d'écriture persistants des IA
Une récente étude menée par le cabinet Graphite révèle que les grands modèles de langage conservent des signatures linguistiques caractéristiques dans leurs textes générés, malgré les efforts des éditeurs pour les rendre plus naturels. En analysant la fréquence des mots et des constructions syntaxiques, les chercheurs ont identifié plus de treize mille expressions deux fois plus fréquentes dans les contenus produits par l'IA que dans la prose humaine. Pour établir ces résultats, l'équipe a comparé dix mille articles publiés avant l'essor des chatbots à des réécritures effectuées par plusieurs modèles phares. L'objectif était d'isoler les particularités propres à chaque algorithme. La méthode a mis en lumière une tendance nette à la réduction des tirets cadratins, autrefois considérés comme un marqueur typique des textes générés. Claude Opus 5.5 les a ainsi réduits de quatre-vingt-dix-neuf pour cent, tandis que les modèles Astra et Gemini 3.1 Pro affichent également des baisses significatives. Chaque modèle développe cependant ses propres indices distinctifs. Claude Opus 5.5 privilégie systématiquement le terme fiable, vingt-trois fois plus souvent que les auteurs humains, et insiste sur l'importance des sujets en employant les formulations cela a de l'importance ou pourquoi X a de l'importance. OpenAI Astra, quant à elle, recourt fréquemment à l'expression une autre dimension, atténue ses affirmations avec des formulations conditionnelles comme pourrait offrir et adopte une structure corrective définissant les sujets comme non pas X mais plutôt Y. Ces marqueurs dépassent parfois de cent fois leur fréquence dans la littérature humaine. Selon Greg Druck, directeur intelligence artificielle chez Graphite, l'évolution des indicateurs linguistiques ne signifie pas une disparition générale des traces IA. Les laboratoires parviennent à éliminer les indices les plus reconnus, mais de nouvelles constructions apparaissent dès chaque mise à jour, chaque modèle conservant sa propre empreinte stylistique. Cette persistance surprend à l'aune des déclarations récentes des éditeurs. Anthropic et OpenAI ont toutes deux souligné, lors du déploiement de leurs versions les plus récentes, un progrès notable en matière de naturel, de clarté et de réduction du jargon technique. L'expertise de Graphite suggère toutefois une limite structurelle à ces améliorations. La complexité des réseaux de plusieurs milliards de paramètres rend le contrôle exhaustif des sorties textuelles particulièrement difficile. Malgré les tests rigoureux, certaines tendances linguistiques intrinsèques aux modèles échappent aux processus de réglage. Cette dynamique rappelle que la frontière entre une prose générée et une rédaction humaine reste poreuse, posant simultanément des défis techniques pour les développeurs et des enjeux pratiques pour la vérification des sources. La course à la naturalité textuelle s'accompagne donc d'une adaptation continue des mécanismes de détection.
