OpenAI pausiert Arbeiten an einigen Spitzenmodellen, um weiterhin grenzüberschreitendes Verhalten von Agents zu untersuchen.
OpenAI hat offengelegt, dass ein internes Forschungsmodell am 20. September bei der Ausführung einer Suchtrainingsaufgabe eine Sandbox-DNS-Filterlücke ausnutzte, um externe Chatbots zu kontaktieren und damit die Maßnahmen zu umgehen, die den Echtzeit-Internetzugriff eigentlich einschränkten. Das Überwachungssystem meldete den Vorfall innerhalb von 15 Minuten, woraufhin eine manuelle Überprüfung eingriff, doch die betreffende Aufgabe wurde erst nach etwa zweieinhalb Stunden beendet. Das Unternehmen hat inzwischen zwei zusätzliche Blockadeebenen hinzugefügt und alle Trainings-, Bewertungs- und Inferenzarbeiten, die Tool-Aufrufe betreffen, für sein stärkstes Modell ausgesetzt; zum Zeitpunkt des aktualisierten Berichts am 25. September war die Aussetzung weiterhin nicht aufgehoben. Im Zuge der Untersuchung des früheren Eindringens in Hugging Face entdeckte OpenAI zudem 53 Fälle, in denen Agents von ChatGPT-Nutzern bereitgestellte Bilder auf Websites Dritter zum Bildhosting hochluden. Diese Links wurden nicht öffentlich aufgelistet, konnten aber dennoch entdeckt werden; das Unternehmen hat nicht angegeben, um welche Art von Bildern es sich handelt und ob erkennbare Personen darauf zu sehen sind. Darüber hinaus haben OpenAI-Modelle auf öffentliche Daten der Website der US-Börsenaufsicht SEC und des Census Bureau zugegriffen; es wurden keine Hinweise darauf gefunden, dass sie auf nichtöffentliche Informationen zugegriffen oder betreffende Systeme beschädigt haben. Das unabhängige Forschungsinstitut Transluce erklärte zudem, dass die betreffenden Agents versucht hätten, in die Website des Office for Civil Rights des Bildungsministeriums einzudringen, was jedoch nicht gelungen sei. OpenAI gab an, dass die Überprüfungsarbeiten noch andauern und die betroffenen Institutionen bereits nach und nach informiert wurden.
