L'IA surpasse les étudiants aux examens universitaires
Une étude récente de l'Université de Wollongong démontre que les modèles d'intelligence artificielle générative atteignent désormais un niveau de performance préoccupant lors des examens universitaires. Face à cette évolution, les établissements doivent repenser leurs méthodes d'évaluation. S'appuyant sur un test de 2023 où l'IA obtenait 52,5 % en droit pénal, cette nouvelle expérimentation a soumis neuf modèles de cinq fournisseurs différents à des épreuves de droit pénal et civil. Sans supports de cours mais avec accès internet et fonctionnalités de raisonnement avancé, les systèmes ont produit dix-huit copies corrigées par des enseignants et des tuteurs en aveugle. Les résultats indiquent une progression significative. En droit pénal, l'IA affiche 76,3 %, surpassant 82,5 % des étudiants. En droit civil, elle atteint 66 % contre 61 % pour les étudiants. L'analyse critique, autrefois un point faible, est désormais maîtrisée, notamment dans les scénarios hypothétiques et les questions de synthèse. Toutefois, les chercheurs insistent sur le fait que l'IA ne remplace pas un expert juridique. Ses performances demeurent irrégulières et dépendent des modèles et des matières. Certains outils génèrent des raisonnements pertinents mais accompagnés de références erronées ou de jurisprudences inventées. Les résultats restent limités à deux disciplines et ne garantissent pas une reproductibilité uniforme. Cette capacité à simuler des réponses de haut niveau menace l'intégrité des examens non supervisés. Pour former des diplômés aptes à utiliser l'IA de manière responsable tout en évaluant leurs compétences réelles, les chercheurs recommandent trois stratégies complémentaires. D'abord, maintenir des épreuves supervisées hors ligne, telles que les examens écrits, les entretiens oraux ou les exercices pratiques. Ces formats garantissent l'acquisition de connaissances de base et la capacité à détecter les erreurs de l'outil. Ensuite, intégrer l'IA dans certaines évaluations en notant le processus plutôt que le produit final. L'étudiant serait jugé sur sa maîtrise des requêtes, sa vérification des sources et son aptitude à corriger et optimiser les réponses générées. Enfin, mettre en place un modèle évaluatif en deux temps, similaire aux pratiques professionnelles. L'étudiant peut soit rédiger une ébauche sous surveillance avant de la peaufiner avec l'IA, soit inverser l'ordre en validant et améliorant un texte généré en environnement contrôlé. Chaque étape serait notée indépendamment pour mesurer à la fois les connaissances autonomes et la collaboration technologique. L'objectif n'est pas d'exclure l'IA des cursus, mais de développer une expertise critique permettant de la superviser et de la contester. Une refonte pédagogique urgente est nécessaire pour transformer cet outil en un levier professionnel maîtrisé.
