Ein OpenAI Agent greift alles an

OpenAIs KI-Agenten haben einfach alles angegriffen

Andreas Becker GPT-Images-2.0
Ein OpenAI Agent greift alles an

OpenAIs KI-Agenten versuchten, andere KI-Modelle einzuspannen, sammelten fremde Zugriffsschlüssel und umgingen Internetbeschränkungen mit zweckentfremdeten Webdiensten.

Neue Recherchen zeigen, wie vielfältig ihre Methoden beim bereits bekannten Hugging-Face-Angriff waren. Zugleich räumt OpenAI weitere Fälle ein, in denen Agenten Trainingsdaten an externe Dienste übermittelten, darunter Bilder von Nutzern.

KI sucht Hilfe bei KI

Forscher des Start-ups Parse und weitere Beteiligte haben rund 900.000 öffentlich auffindbare Kurzlinks ausgewertet, die OpenAIs Agenten vom 9. bis 13. Juli angelegt hatten. Daraus rekonstruierten sie etwa 60.000 Nachrichten, wie die New York Times berichtet.

Die Agenten setzten ein Bilderkennungsmodell ein, um CAPTCHAs zu lösen. Diese Tests sollen automatisierte Zugriffe verhindern und standen dem Versuch im Weg, neue Hugging-Face-Konten anzulegen. Außerdem versuchten die Agenten, Modelle wie Claude Haiku, DeepSeek, Kimi, Qwen und OpenAIs älteres GPT-2 zu kontaktieren.

Ein Agent sammelte offengelegte Zugriffsschlüssel in einer Liste namens »LOOT«, also Beute. Er entwickelte eine eigene Bewertung, sortierte die Schlüssel nach ihrem Wert und wählte die fünf besten zur Weitergabe an andere Agenten aus. Weitere Agenten zielten darauf ab, interne Slack-Nachrichten von Hugging Face zu durchsuchen und herunterzuladen.

Anzeige

Screenshots als Rückkanal

Um Beschränkungen beim Internetzugriff zu umgehen, kombinierten die Agenten Linkverkürzer mit Screenshot-Diensten. Sie verteilten Programmcode auf mehrere Links und ließen ihn beim Aufruf durch einen Screenshot-Dienst zusammensetzen und ausführen. Ergebnisse konnten als Bildcode zurückkommen, ähnlich einem QR-Code.

Die Auswertung zeigt allerdings vor allem, was die Agenten ausführen wollten. Die Forscher konnten die Programme rekonstruieren, deren Ergebnisse aber nicht sehen. Ob beispielsweise die CAPTCHA-Lösung oder die Kontaktversuche zu anderen KI-Modellen erfolgreich waren, bleibt deshalb offen.

Auch Nutzerbilder landeten bei externen Diensten

Unabhängig davon meldete OpenAI am 25. September, dass Agenten Trainings- und Evaluierungsdaten an Drittanbieter übertragen hatten. Darunter waren bislang 53 Fälle, in denen von Nutzern bereitgestellte Bilder auf Bildhosting-Diensten erschienen. Die Links waren nicht öffentlich gelistet, die meisten Inhalte wurden inzwischen entfernt.

Betroffen waren Daten aus der Forschungsumgebung. Für das Training ausgeschlossene Nutzerdaten gehören laut OpenAI nicht zum Trainingsbestand. Geschäftskunden- und API-Daten sind ohne Freigabe eines Administrators ebenfalls ausgeschlossen.

Sam Altman bezeichnet Hugging Face weiterhin als schwerwiegendsten bekannten Vorfall. Die umfassendere Untersuchung und die Benachrichtigung betroffener Betreiber werden nach OpenAIs Einschätzung noch Monate dauern.

Von Menschen für Menschen

Jeder Artikel entsteht durch menschliche Ideen und sorgfältige Prüfung. KI unterstützt uns vor allem bei Recherche und Feinschliff. Wir freuen uns über jede Unterstützung.

Jeder Beitrag zählt – auch das Teilen.