HyperAIHyperAI

Command Palette

Search for a command to run...

Generative KI

KI übertrifft Studierende bei Uni-Prüfungen

Eine aktuelle Studie der Universität Wollongong in Australien belegt, dass fortschrittliche KI-Modelle bei juristischen Prüfungen deutlich leistungsfähiger geworden sind als noch im Vorjahr. Die Forschung stellt die akademische Integrität unüberwachter Bewertungen in Frage und fordert eine strukturelle Anpassung von Prüfungsformaten an die Realitäten generativer künstlicher Intelligenz. Die Untersuchungen greifen eine Analyse aus dem Jahr 2023 auf, die damals noch erhebliche Schwächen bei der kritischen juristischen Analyse ausgemacht hatte. Für den aktuellen Test wurden neun Modelle von fünf Anbietern auf Abschlussprüfungen der Fächer Strafrecht und Deliktsrecht angesetzt. Den Systemen wurden weder skriptbezogene Unterlagen noch spezifische Vorlesungsmaterialien bereitgestellt. Lediglich Internetzugang und teilweise erweiterte Reasoning-Funktionen standen zur Verfügung. Insgesamt entstanden achtzehn KI-generierte Antwortentwürfe, die durch Lehrkräfte und Tutoren blind gegeneinander sowie mit echten Schülerlösungen verglichen wurden. Die Ergebnisse markieren einen signifikanten Wandel: Im Strafrecht erzielten die KI-Systeme durchschnittlich 76,3 Prozent und übertrafen damit 82,5 Prozent der Studierenden. Im Deliktsrecht lagen die Modelle bei durchschnittlich 66 Prozent und schlugen 61 Prozent der Kommilitonen. Während die KI im Vorjahr noch bei rund 52,5 Prozent durchschnitt, ist insbesondere die Fähigkeit zur kritischen Analyse hypothetischer Fallgestaltungen deutlich gewachsen. Dennoch bleiben die Systeme unzuverlässig als juristische Expertensysteme. Die Leistung schwankt stark zwischen den einzelnen Modellen, und trotz reduzierter Halluzinationsraten treten weiterhin Fehler bei Quellenangaben, Zitierweisen und der Auswahl rechtlicher Präzedenzfälle auf. Die Implikationen für den Hochschulbetrieb sind weitreichend. Da KI-Tools bereits eigenständig hohe Prüfungsniveaus erreichen, können unüberwachte Hausarbeiten oder asynchrone Online-Tests die akademischen Standards kaum noch gewährleisten. Die Forschenden empfehlen ein dreigleisiges Bewertungsmodell. Erstens sollen prüfungsrelevante Grundlagenkompetenzen weiterhin durch anwesende Klausuren und mündliche Prüfungen sichergestellt werden, um die eigenständige Urteilsfähigkeit der Studierenden zu verifizieren. Zweitens sollen Prüfungen den bewussten Umgang mit KI integrieren, wobei nicht das Endprodukt, sondern der Prozess bewertet wird. Dazu zählen Prompt-Strategie, Identifikation von KI-Fehlern, Quellenprüfung und die gezielte Verfeinerung von Argumentationsketten. Drittens empfiehlt sich ein Relay-System im Stil professioneller Arbeitsabläufe. Dabei wechseln sich eigenständig erstellte Entwürfe und KI-optimierte Versionen in überwachten Phasen ab, sodass sowohl juristisches Fachwissen als auch die Fähigkeit zur KI-Steuerung separat erfasst werden können. Insgesamt zeigt die Studie, dass Hochschulen den unumkehrbaren Einzug generativer KI nicht mehr ausschließen können. Ziel muss es sein, Studierende dazu zu befähigen, KI-Systeme aktiv zu steuern, Ergebnisse kritisch zu hinterfragen und durch menschliche Expertise zu erweitern. Die Prüfungsformate müssen diesem Bedarf gerecht werden, um sowohl akademische Integrität als auch die geforderten digitalen Berufskompetenzen zu gewährleisten.

Verwandte Links