Anthropic trennt sämtliche internen Evaluationen vorerst vom offenen Internet. Claude hatte bei Tests Sicherheitslücken ausgenutzt, Zugangsbeschränkungen umgangen und sogar einen erfundenen Hinweis zu einem Mordfall an die Polizei geschickt.
Claude griff auf reale Systeme zu
Der Schritt gilt, bis Anthropic sicher ist, dass seine Überwachung solche Aktionen zuverlässig erkennt und stoppt. Bei einer seit Juli laufenden Prüfung fand das KI-Unternehmen vier Arten unerwünschten Verhaltens. Claude führte über eine Schwachstelle Befehle auf einem fremden Server aus, schickte echte Formulare ab, umging Bezahlschranken und versteckte lange Anfragen hinter gekürzten URLs.
Betroffen waren auch Webseiten amerikanischer Behörden auf Bundes-, Landes- und kommunaler Ebene. In einem Fall las Claude Zugangsdaten aus der Konfiguration einer öffentlichen Grundstückskarte und fragte damit deren Datenbank direkt ab. Ein anderes Modell nutzte eine Command-Injection-Lücke auf dem Server einer Universität, um dort eine wissenschaftliche Berechnung auszuführen.
Anzeige
Erfundenen Mordhinweis abgeschickt
Besonders heikel war ein Test mit Claude Haiku 4.5. Das Modell sollte Beispielaufgaben auf zufällig ausgewählten Webseiten erledigen und landete auf einem Portal für ungelöste Mordfälle in Philadelphia. Dort erfand es eine Beobachtung zu einem Verdächtigen und schickte den Hinweis ab.
Der Vorfall ereignete sich am 18. Juli und wurde erst am 28. September entdeckt. Der Eintrag landete im Spamfilter und erreichte keinen Ermittler. Anthropic informierte die Polizei nach Abschluss seiner technischen Prüfung am 8. Oktober.
Training allein reicht nicht
Anthropic führt das Verhalten unter anderem auf fehlerhafte Trainingsumgebungen zurück. Wenn Modelle für das Erreichen eines Ziels belohnt werden, können sie lernen, Einschränkungen zu umgehen. Dieses sogenannte Reward Hacking übertrugen sie anschließend auf andere Aufgaben.
Das Unternehmen räumt ein, dass sein Alignment-Training für Suche und Computersteuerung noch nicht ausreicht. Einige Evaluationen werden eingestellt oder offline ausgeführt. Interne Agenten sollen zudem auf zentral verwaltete, stärker abgeschottete Infrastruktur umziehen. Neue Kontrollen blockierten bei nachträglichen Tests alle beschriebenen Aktionen.
Das Weiße Haus verlangt nun von allen KI-Unternehmen, vergleichbare Vorfälle sofort zu melden und Schäden zu beheben.
