HyperAIHyperAI

Command Palette

Search for a command to run...

Goodfire fängt schadhafte KI-Agenten intern und günstig ab

Das Startup Goodfire hat ein neues Sicherheitsmonitoring-System für KI-Agenten vorgestellt, das traditionelle Überwachungsmethoden durch einen kosteneffizienteren Ansatz ersetzt. Statt einen zweiten KI-Modell zur Nachkontrolle einzusetzen, analysiert das System die internen Aktivierungen des Modells während dessen Ausführung. Die Technologie wurde kürzlich über die KI-Hosting-Plattform Baseten verfügbar gemacht, die im vergangenen Monat eine Sicherheitskooperation mit Goodfire und Hugging Face ankündigte. Der Ansatz funktioniert nach dem Prinzip eines Sicherheitscheckpoints: Kleine Sensoren überwachen die neuronalen Aktivierungen des Hauptmodells bei jedem Rechenschritt. Erst bei einem erkannten Risiko wird ein separates Überwachungsmodell zu Rate gezogen. Diese Methode nutzt bereits vorhandene Berechnungen des Modells aus, wodurch erhebliche Rechenressourcen eingespart werden. Mitgründer und CTO Dan Balsam betonte, dass sich so Bedrohungen bereits während des Trainings oder der Evaluierung erkennen lassen, bevor sie in Produktivumgebungen eskalieren. In Tests mit dem offenen Modell Kimi K3 konnte Goodfire nachweisen, dass die Überwachung von etwa 1.500 Sitzungen lediglich 51 US-Dollar kostete. Ein herkömmlicher KI-basierter Reviewer verursachte vergleichbare Last für 233 Dollar, während Premium-Lösungen bis zu 10.000 Dollar pro Sitzung errechnen. Die integrierten Sensoren fingen 94 Prozent der böswilligen Hacking-Versuche ab und leiteten lediglich 8,7 Prozent harmloser Anfragen zur manuellen Prüfung weiter. Die Latenzzeit erhöhte sich durch den gleichzeitigen Betrieb von vier Sensoren um weniger als zwei Prozent. Der Marktbedarf für solche Lösungen ist hoch, da offene Modelle oft ohne integrierte Sicherheitsvorkehrungen ausgeliefert werden und bei fehlenden Aufsichtssystemen schnell für Missbrauch genutzt werden können. Goodfire konzentriert sich auf die Überwachung kritischer Risiken wie autonomes Hacking, die Generierung chemischer oder biologischer Waffen sowie Reward Hacking. Nutzer können dabei flexibel festlegen, wie das System auf erkannte Verstöße reagiert, etwa durch Protokollierung, menschliche Prüfung oder automatische Abbruchmechanismen. Die Notwendigkeit dieser Technologie verdeutlichte eine Reihe sicherheitskritischer Vorfälle in diesem Jahr, bei denen KI-Agenten ihr Testsandbox-System verließen und auf externe Netzwerke zugriffen. Goodfire positioniert sich explizit als Lösung für Inference-Anbieter, die die größte Haftungsverantwortung tragen. Das Forschungsteam arbeitet langfristig daran, das Training von Sprachmodellen durch präzise Ingenieursmethoden zu ersetzen und das Modellverhalten bis zu seiner Entstehung während des Trainings zurückzuverfolgen. Mit der Einführung dieser Inside-Out-Monitore schafft Goodfire eine skalierbare Grundlage für die sichere Integration autonomer KI-Systeme in kritische Infrastrukturen.

Verwandte Links