HyperAIHyperAI

Command Palette

Search for a command to run...

Top KI-Coding-Tools irren bei vier von zehn Einsätzen

Eine aktuelle Studie der University of Waterloo zeigt, dass moderne KI-Tools für die Softwareentwicklung nach wie vor erhebliche Schwächen aufweisen. Laut den Forschungsergebnissen machen fortschrittliche KI-Modelle in etwa jedem vierten Fall Fehler, wenn sie mit spezifischen Softwareaufgaben betraut werden. Dies wirft Fragen nach der Zuverlässigkeit von Systemen auf, die zunehmend zur Unterstützung von Entwicklern eingesetzt werden. Das Problem betrifft vor allem die Genauigkeit und Konsistenz von von KI generierten Antworten. Um Entwicklern den Umgang mit Large Language Models (LLMs) zu erleichtern, haben Technologiegiganten wie OpenAI, Google und Anthropic sogenannte „strukturierte Ausgaben" eingeführt. Diese zwingen die Modelle, Antworten in festgelegten Formaten wie JSON, XML oder Markdown zu liefern, anstatt freien Fließtext zu generieren. Diese Strukturen sollen die Verarbeitung sowohl durch Menschen als auch durch andere Softwarekomponenten vereinfachen. Trotz dieser Fortschritte hat eine neue Benchmark-Studie mit dem Titel „StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs" gezeigt, dass die Technologie noch nicht so zuverlässig ist, wie viele erhofften. Die Forschungsergebnisse, die in der Zeitschrift Transactions on Machine Learning Research veröffentlicht wurden und auf der ICLR 2026 vorgestellt werden sollen, deuten darauf hin, dass selbst die leistungsstärksten Modelle nur eine Genauigkeit von etwa 75 Prozent erreichen. Open-Source-Modelle schnitten mit etwa 65 Prozent noch schlechter ab. Die Forscher evaluierten elf verschiedene LLM-Modelle in 18 strukturierten Ausgabetypen und über 44 spezifische Aufgaben, um zu testen, wie zuverlässig die Systeme vorgegebene Regeln einhalten. Dongfu Jiang, ein Doktorand und Ko-Autor der Studie, betonte, dass die Bewertung nicht nur die Syntax des Codes prüfte, sondern auch die faktische Richtigkeit der Ergebnisse für verschiedene Aufgaben. „Wir haben festgestellt, dass Modelle zwar bei textbasierten Aufgaben akzeptable Ergebnisse liefern, aber Schwierigkeiten haben, wenn es um die Generierung von Bildern, Videos oder Webseiten geht", erklärte Jiang. Die Studie ist ein gemeinsames Unterfangen, an dem neben Jiang auch der Student Jialin Yang und Professor Wenhu Chen beteiligt waren. Das Projekt umfasste Annotationen von insgesamt 17 weiteren Forschern weltweit. Professor Chen hob hervor, dass solche Benchmarking-Projekte an der Universität Waterloo Teil des akademischen Lernprozesses seien, bei dem Studierende oft als Erstannotatoren beginnen und später eigene Forschungsprojekte leiten. Die Autoren der Studie kommen zu dem Schluss, dass KI-Modelle für strukturierte Ausgaben zwar ein spannender Schritt in der Softwareentwicklung sind, aber noch nicht ohne menschliche Aufsicht eingesetzt werden sollten. Entwickler, die solche Agenten in ihren Arbeitsablauf integrieren, müssen weiterhin stark in die Überwachung der Ergebnisse eingebunden bleiben, um Fehler zu vermeiden. Die Ergebnisse unterstreichen die Notwendigkeit einer weiteren Entwicklung, bevor KI-Systeme als vollständig zuverlässige Partner in komplexen Entwicklungsprozessen gelten können.

Verwandte Links