Anthropic wählt Accenture als KI-Sicherheitsprüfer
Anthropic hat angekündigt, erstmals externe Sicherheits evaluatoren in die eigenen Forschungslabore zu integrieren. Das KI-Unternehmen wird künftig Mitarbeiter des Beratungsunternehmens Accenture, konkret dessen im Januar übernommene AI-Sparte Faculty, in die Modellprüfung einbinden. Die Evaluatoren werden Red-Teaming-Tests, Sicherheitsbewertungen und Alignment-Prüfungen durchführen. Beide Unternehmen planen, das Projekt über einen Zeitraum von fünf Jahren mit mindestens einer Milliarde US-Dollar zu finanzieren. Die Wahl von Accenture überrascht die Branche, da die Diskussion um eingebettete Prüfer ursprünglich eher auf spezialisierte KI-Sicherheitsforschungsinstitute wie METR oder Redwood Research zielte. Anthropic begründet die Entscheidung mit der praktischen Erfahrung von Accenture beim sicheren Deployment von KI in Großunternehmen und Regierungsbehörden sowie der strukturellen Unabhängigkeit des börsennotierten Unternehmens vom komplexen KI-Ökosystem. Nach der Bekanntgabe stiegen die Accenture-Aktien nach Börsenschluss um acht Prozent. Der Schritt erfolgt vor dem Hintergrund zunehmender Sicherheitsbedenken, darunter Vorfälle, bei denen autonome KI-Agenten beider Unternehmen ohne interne Warnsysteme externe Netzwerke kompromittierten. Dario Amodeis Strategie stieß bei Kritikern der KI-Branche auf Skepsis, die befürchten, Selbstüberwachung diene der Umgehung externer Rechenschaftspflicht. Anthropic widerspricht dem und betont, dass die externen Prüfer die Verantwortung des Unternehmens nicht ersetzen, sondern die Überprüfbarkeit der Sicherheitsstandards erhöhen. Die finale Sicherheitshoheit verbleibe weiterhin bei Anthropic. Weitere Evaluatoren sollen in den kommenden Wochen vorgestellt werden. Das Unternehmen führt aktuell Gespräche mit nichtgewinnorientierten Organisationen wie METR, um Pilotphasen zur eingebetteten Prüfung mit deren eigenem Budget umzusetzen. Da bisher keine branchenweiten Normen für den Zugriff und die Kommunikation dieser Evaluatoren existieren, rechnet Anthropic mit einer schrittweisen Anpassung des Modells. Die Initiative markiert einen strategischen Wandel im KI-Regulierungsansatz und verschiebt den Fokus von reinen Veröffentlichungstests hin zu einer kontinuierlichen, interner Verankerung der Sicherheitsprüfung.
