UK AISI und EvalEval machen KI-Benchmarks reproduzierbar
Das britische AI Security Institute (AISI) und die EvalEval Coalition haben eine strategische Zusammenarbeit angekündigt, um die Reproduzierbarkeit von KI-Benchmark-Ergebnissen durch offene Dateninfrastrukturen zu stärken. Als Teil dieser Initiative stellt das AISI ausgewählte Evaluierungsmethoden und -ergebnisse auf der EvalEval-Plattform zur Verfügung. Die gemeinsame Forschungsarbeit, die bereits bei einem Workshop im Rahmen der NeurIPS 2025 begann, mündet nun in die praktische Anwendung des Every Eval Ever (EEE)-Datenformats sowie der Evaluation-Cards-Plattform. Ziel des Vorhabens ist es, die derzeitige Fragmentierung von KI-Bewertungen zu überwinden. Da die Veröffentlichung von Evaluierungsergebnissen häufig in unterschiedlichsten Formaten erfolgt und oft entscheidende Metadaten fehlen, ist eine unabhängige Überprüfung der Daten oft weder technisch noch finanziell umsetzbar. Das EEE-Framework sowie die Evaluation Cards strukturieren Benchmark-Metadaten, Durchführungsdaten und Modellinformationen in einer einheitlichen, interpretierbaren Form. Das AISI ergänzt diese Initiative durch eigene Forschungsprojekte wie OptStop für effizientere Evaluierungen und HiBayES für statistisch rigorose Analysen. In der aktuellen Veröffentlichung macht das AISI transparente, verifizierte Ergebnisse zu fünf Kernbenchmarks und zwei verwandten Cybersicherheitsbewertungen öffentlich zugänglich. Die Daten umfassen sechs aktuelle Frontier-Modelle: Claude Opus 4, 4.5 und 4.6 sowie GPT-5, 5.2 und 5.4. Begleitend dazu wird die Studie zur Abhängigkeit von Inference-Compute und Evaluierungsprotokollen veröffentlicht. Die offen zugänglichen Konfigurationsdaten und Kontextinformationen ermöglichen es Forschenden und Entwickler:innen, Ergebnisse unterschiedlicher Studien präzise zu vergleichen und systematische Verzerrungen durch unterschiedliche Setup-Entscheidungen zu identifizieren. Durch die offene Bereitstellung etabliert das AISI verlässliche Referenzpunkte für die Meta-Forschung. Die EvalEval Coalition, ein Netzwerk aus Forschenden, entwickelt diese Infrastruktur mit dem Ziel, wissenschaftlich fundierte Bewertungsstandards zu etablieren, die Anwendbarkeit und Relevanz von KI-Tests für Politik und Gesellschaft zu gewährleisten. Das britische AISI, angesiedelt im Department for Science, Innovation and Technology, zielt mit diesen offenen Daten auf eine evidenzbasierte Risikoeinschätzung fortschrittlicher KI-Systeme ab. Die standardisierte Veröffentlichung von Evaluierungsdaten markiert einen wesentlichen Schritt hin zu einer transparenten und wissenschaftlich robusten KI-Evaluierungslandschaft.
