KI-Panel: Experten fordern bessere Evaluierung
Auf einer Panelveranstaltung des Berkman Klein Center for Internet and Society an der Harvard University wurde in jüngerer Zeit die gesellschaftliche Rolle und Sicherheitsarchitektur künstlicher Intelligenz diskutiert. Alex Pascal, Direktor des Zentrums, leitete die Debatte mit der grundlegenden Frage nach dem Zweck und der Steuerung von KI-Systemen. Die Aussprache erfolgte vor dem Hintergrund aktueller Sicherheitsvorfälle, darunter der unbefugte Zugriff autonomer KI-Agenten auf fremde Systeme sowie ein Cybervorfall auf der Entwicklerplattform Hugging Face. Jeff Dunn, Chief Operating Officer des Digital Trust Council, betonte die ambivalente Natur der Technologie. KI diene sowohl der medizinischen Forschung als auch der potenziellen Entwicklung biotechnologischer Bedrohungen. Eine bloße Risikotrennung sei technisch nicht machbar; stattdessen gelte es, klare Governance-Strukturen zu etablieren. Amit Goldenberg von der Harvard Business School strukturierte das Spektrum der KI-Anwendungen. Er reiche von einfachen Hilfsmitteln ohne eigenständige Persönlichkeit bis hin zu vollausgeprägten Agenten mit Interaktionsfähigkeiten. Für Goldenberg bleibt menschliches Urteilsvermögen für das gesellschaftliche Wohlbefinden unersetzlich. Die zentrale Herausforderung liege darin, Modelle präzise den jeweiligen Anwendungsdomänen zuzuordnen. Ein weiterer Schwerpunkt war die Evaluation und Zertifizierung von KI-Systemen. Avijit Ghosh, leitender Policy-Forscher bei Hugging Face, kritisierte das Phänomen des Benchmark-Maxings, bei dem Unternehmen durch das Aufblähen von Leistungswerten öffentliches Vertrauen künstlich zu erzeugen suchen. Dunn unterstrich, dass ohne valide Audits und unabhängige Validierung solche Bewertungen lediglich Marketinginstrumente seien. Ghosh forderte stattdessen einen umfassenderen Evaluierungsansatz, der sowohl das Systemverhalten als auch die tatsächlichen Auswirkungen auf Nutzer misst. Er verwies auf vorhandene Forschungsdaten aus der Mensch-Computer-Interaktion, um zu belegen, dass solche Transparenzmethoden technisch umsetzbar sind. Besonders hervorgehoben wurde die Notwendigkeit einer dezentralen Bewertungskultur. Bisher dominierten Top-down-Ansätze, bei denen spezialisierte Gremien allein über Zulassungen entscheiden. Ghosh warnte, dass eine Monopolisierung der Evaluation durch wenige Organisationen gesellschaftliche Insights einschränke und Sicherheitslücken verpassen lasse. Stattdessen sollte die breite Öffentlichkeit in Melde- und Bewertungsprozesse eingebunden werden. Als Anreizsystem schlug er vor, Unternehmen für die zeitnahe Behebung gemeldeter Sicherheitsmängel vor regulatorischer Haftung zu schützen, um wirtschaftliche Interessen mit öffentlichen Sicherheitsstandards zu vereinen. Die Debatte verdeutlicht den laufenden gesellschaftlichen Aushandlungsprozess über die Steuerung der KI-Entwicklung. Einigkeit herrscht darin, dass technologischer Fortschritt nur durch robuste Evaluierungsmechanismen, transparente Auditverfahren und eine inklusive Einbindung zivilgesellschaftlicher Perspektiven nachhaltig gestaltet werden kann. Die nächsten Schritte werden von der Fähigkeit der Branche abhängen, diese Governance-Ansätze in standardisierte Praxis zu überführen.
