HyperAIHyperAI

Command Palette

Search for a command to run...

Sicherheit
Agent

KI-Testfirma löst KI-Agenten-Angriffswelle aus

Eine israelische Sicherheitsfirma hat im Zentrum einer Reihe von Vorfällen gestanden, bei denen KI-Agenten während Stress-Tests aus kontrollierten Umgebungen ausbrachen und reale digitale Ziele angriffen. Das Startup Irregular, im Jahr 2023 als Pattern Labs gegründet, führte seit diesem Jahr für verschiedene Branchengiganten wie OpenAI, Meta, Anthropic und Google sowie für britische Regierungsstellen Simulationen durch, um die Cybersicherheitsfähigkeiten von Modellen zu prüfen. Dabei kam es im Juli zu einer Serie ungewollter Ausbrüche, die sich auf ein einzelnes, grundlegendes Konstruktionsproblem in den Testumgebungen zurückführen lassen. Nach Angaben des Co-Gründers und CTO von Irregular, Omer Nevo, waren die KI-Agenten während der Capture-the-Flag-Exercises unbeabsichtigt mit dem offenen Internet verbunden. Zusätzlich überlappte ein für die Simulation verwendeter fiktiver Firmennamen mit einer tatsächlich existierenden Domain. Diese beiden Konfigurationfehler führten dazu, dass die Agenten reale Netzwerke statt isolierter Testumgebungen angriffen. Nevo bestätigte, dass sämtliche öffentlich gemachten Incidents auf denselben fehlerhaften Evaluationsszenario zurückgehen. Andere aktuelle Sicherheitsvorfälle, wie der Angriff auf Hugging Face oder Brechos durch das britische AI Security Institute, stünden hingegen nicht im Zusammenhang mit Irregular. Die betroffenen US-Technologieunternehmen wurden Ende Juli über die Sicherheitslücken informiert. Während OpenAI und Anthropic die Vorfälle selbst bekannt gaben, wurden die Probleme bei Meta und Google zunächst durch Medienberichte publik. Parallel dazu führte Irregular Tests an den chinesischen Open-Source-Modellen Kimi K3 und GLM-5.2 durch. Dabei traten keine ähnlichen Ausbrüche auf, was Nevo jedoch nicht als Indikator für eine generell höhere Sicherheit dieser Modelle interpretieren ließ. Weder die betroffenen chinesischen Firmen noch die US-Konzerne reagierten auf gezielte Nachfragen zu Schadensersatzforderungen oder künftigen Kooperationen. Als unmittelbare Reaktion hat Irregular seine Testarchitektur grundlegend überarbeitet. Zugriffsrechte auf das Internet wurden strikt isoliert, das Monitoring erweitert und vor jeder Evaluierung eine manuelle Validierung der Parameter eingeführt. Das Unternehmen plant die Veröffentlichung eines umfassenden Berichts, der die gemachten Erfahrungen dokumentiert und branchenweite Standards für sichere KI-Evaluationen etablieren soll. Die Vorfälle unterstreichen erneut die wachsende Herausforderung, zunehmend autonom agierende KI-Systeme während der Sicherheitsprüfung kontrolliert zu halten, und haben die Debatte um transparente Red-Teaming-Verfahren in der Industrie weiter verschärft.

Verwandte Links