GPT-5.6 Luna findet 75 % der Bugs günstiger als GPT-6 Astra
Ein aktueller Benchmark-Vergleich zwischen den KI-Modellen GPT-5.6 Luna und GPT-6 Astra untersucht die Effizienz automatisierter Code-Reviews. Das Testsetup umfasste im September 2026 fünfzig öffentliche Pull Requests aus den Projekten Cal.com, Sentry, Discourse, Keycloak und Grafana. Beide Modelle wurden mit identischen Prompts konfiguriert, die explizit auf Korrektheit, Sicherheit, Nebenläufigkeit und Ressourcenmanagement fokussierten und stylistische Anmerkungen ausschlossen. Die Validierung erfolgte durch eine doppelte Judging-Instanz, wobei ein Fehler nur als verifiziert galt, wenn beide Prüfer übereinstimmten. Die Ergebnisse zeichnen ein klares Bild der Kosten-Nutzen-Dynamik. GPT-5.6 Luna detektierte 69 verifizierte Bugs, während GPT-6 Astra 92 identifizierte. Der entscheidende Unterschied liegt in der Präzision: Nur vier von 96 Astra-Ergebnissen hielten der Prüfung nicht stand, was einer Trefferquote von 96 Prozent entspricht. Bei Luna fielen 24 von 93 Ergebnissen durch, was einer Genauigkeit von 74 Prozent entspricht. Die Gesamtkosten für den Durchlauf beliefen sich auf 0,20 US-Dollar für Luna gegenüber 5,66 US-Dollar für Astra, was einer Ersparnis von mehr als 96 Prozent entspricht. Pro einzelner Review kostet Luna etwa 0,004 US-Dollar im Vergleich zu 0,113 US-Dollar für Astra. Eine detaillierte Analyse nach Fehlerkategorien offenbart deutliche Stärken und Schwächen. Bei allgemeinen Daten- und Logikfehlern liegt der Abstand zwischen den Modellen relativ gering. Kritisch wird es jedoch im Bereich der Sicherheits- und Zugriffssteuerung. Luna identifizierte nur 9 von 24 Sicherheitslücken, Astra 19. Besonders bei Keycloak, wo es primär um Authentifizierungs- und Berechtigungsmodule geht, versagte Luna bei der Hälfte seiner Meldungen, während Astra eine Trefferquote von 93 Prozent erzielte. Der rein kontextlose Zugriff auf Code-Diffs entbehrt hier oft die nötige Systemübersicht, um komplexe Autorisierungspfade korrekt zu bewerten. Die Kombination beider Modelle ermöglichte die Identifikation von 117 von 143 verifizierten Bugs für insgesamt 5,86 US-Dollar. Für Entwicklungsteams empfiehlt sich eine gestufte Strategie: GPT-5.6 Luna deckt Routine-Änderungen und offensichtliche Logikfehler kosteneffizient ab, während sicherheitskritische Pfade explizit dem leistungsfähigeren und präziseren GPT-6 Astra überlassen werden sollten. Die Untersuchung unterstreicht, dass rein auf Diffs basierende KI-Reviews systemische Kontextinformationen nicht ersetzen können und eine hybride Bewertungspipeline aktuell die nachhaltigste Lösung für produktive Software-Workflows darstellt.
