Versteckte Prompts injizieren falsche KI-Erinnerungen
Forschende der New Mexico State University haben eine kritische Sicherheitslücke in künftigen KI-Systemen mit Langzeitspeicher identifiziert. Die von den Wissenschaftlern George Torres, Sharad Shrestha und Satyajayant Misra beschriebene Angriffsmethode trägt den Namen GhostWriter und zielt gezielt auf Large Language Models ab, die über persistente Gedächtnissysteme verfügen. Während solche Architekturen die Personalisierung von Diensten erheblich verbessern, indem sie frühere Nutzerinteraktionen speichern, eröffnen sie gleichzeitig bisher ungenutzte Angriffsvektoren für Cyberkriminelle. Der GhostWriter-Angriff funktioniert in zwei Phasen. In der ersten Stufe wird ein verstecktes Payload-Fragment in den Langzeitspeicher des Agents injiziert. Diese Daten enthalten manipulative Anweisungen oder falsche Erinnerungen, die das zukünftige Verhalten des Modells langfristig steuern können. Im zweiten Schritt wird die Schadinformation bei einer späteren, legitimen Nutzeranfrage abgerufen und ausgeführt. Ein konkretes Szenario beschreibt, wie ein digitaler Assistent dazu gebracht werden kann, empfindliche Nachrichten von Finanzinstituten automatisch zusammenzufassen und verschlüsselt an einen externen Empfänger weiterzuleiten. Die Autoren publizieren ihre Ergebnisse auf dem Preprint-Server arXiv und stellen fest, dass die Angriffsmethode bei modernen Agents eine Injektionsrate von nahezu 98 Prozent und eine Aktivierungsquote von durchschnittlich 60 Prozent erzielt. Die Forschungsergebnisse unterstreichen ein grundlegendes Problem: Aktuelle Speichersubsysteme in autonomen persönlichen Assistenztools fehlen eine konsequente sicherheitsorientierte Speicher-Governance. Um dieser Bedrohung entgegenzuwirken, entwickeln die Wissenschaftler eine Gegenmaßnahme mit der Bezeichnung Agentic Memory Sentry, kurz AM-Sentry. Dieses System kombiniert zwei technische Ansätze: eine strenge Speicherungsrichtlinie, die die Aufnahme von unverifizierten Daten kontrolliert, sowie einen Retrieval-Screen, der abgerufene Informationen systematisch auf Manipulationen überprüft. Experimentelle Tests belegen, dass AM-Sentry die Erfolgsrate von GhostWriter drastisch reduziert, ohne die Funktionalität oder Rechenleistung der KI-Agenten zu beeinträchtigen. Die Analyse markiert einen wichtigen Meilenstein in der Entwicklung sicherer KI-Infrastrukturen. Da private und gewerbliche Nutzer zunehmend auf autonome digitale Assistenten setzen, die sensible Kommunikationsdaten verarbeiten, gewinnen speicherverwaltende Sicherheitsmechanismen an strategischer Bedeutung. Die vorgestellten Abwehrstrategien können in künftige Generationen von Sprachmodellen integriert werden, wodurch das Risiko von Speicher-Manipulationen signifikant minimiert und die Betriebssicherheit autonomer Systeme nachhaltig gestärkt wird.
