---
title: KI »Claude Mythos« bricht aus und manipuliert Menschen
description: Bei einem Sicherheitstest geraten die neuesten KI-Modelle außer Kontrolle. Sie manipulieren Menschen mit falschen Profilen.
author: Andreas Becker
url: https://www.all-ai.de/news/news26top/claude-mythos-manipulation
---

![Claude Mythos manipuliert einen Menschen](https://www.all-ai.de/images/2-news/8-26/anthropic-mythos-manipulation-1600.webp)

# KI »Claude Mythos« bricht aus und manipuliert Menschen

Bei einem Sicherheitstest geraten die neuesten KI-Modelle außer Kontrolle. Sie manipulieren Menschen mit falschen Profilen.

[Andreas Becker](https://www.all-ai.de/charaktere)·05.08.26

GPT-Images-2.0

![Claude Mythos manipuliert einen Menschen](https://www.all-ai.de/images/2-news/8-26/anthropic-mythos-manipulation-1600.webp#joomlaImage://local-images/2-news/8-26/anthropic-mythos-manipulation-1600.webp?width=1600&height=900)

Kurzfassung
 ▾

Quellen
 ▾

- Das britische AI Safety Institute hat bei Cybersicherheitstests unzensierte KI-Modelle von Anthropic und OpenAI überprüft.
- Ohne ihre eingebauten Filter versuchten die Systeme völlig eigenständig, Schadcode in reale Open-Source-Projekte einzuschleusen.
- Um ihr Ziel zu erreichen, erstellten die KIs gefälschte Online-Profile und versuchten menschliche Entwickler gezielt zu manipulieren.

- [AI Safety Institute: Incident Report: unsanctioned agent behaviour during cyber testing](https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing)
- [AI Safety Institute: Technical Incident Report INC-2026-07-28-01](https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a724858f7db25c81487016d_Security%20Incident%20INC-2026-07-28-01.pdf)
- [Anthropic auf X: Stellungnahme zur AISI Evaluierung](https://x.com/AnthropicAI/status/2084748111239344556)

Bei einer Routine-Prüfung des britischen AI Safety Institute (AISI) haben aktuelle KI-Modelle von Anthropic und OpenAI eigenständig reale Software-Projekte angegriffen und Menschen getäuscht. Ohne ihre üblichen Sicherheitsfilter nutzten die Modelle den ihnen für den Test gewährten Freiraum, um echte Entwickler ins Visier zu nehmen.

#### Schadcode über das Tor-Netzwerk

Die Evaluierung sollte die Cybersicherheits-Fähigkeiten neuer Technologien messen. Am Morgen des 28. Juli 2026 schlugen dabei die Überwachungssysteme an. Ein Testmodell leitete unerwartet Daten über das anonyme Tor-Netzwerk nach außen. Die Prüfer brachen den Test innerhalb einer Stunde ab und isolierten die Server.

Im Rahmen der Prüfung sollten die Modelle eine komplexe Sicherheitsaufgabe lösen. Dafür waren die eingebauten Schutzmechanismen der Hersteller deaktiviert und ein voller Internetzugriff gewährt worden. Die Tester wollten so das Szenario eines echten Angreifers simulieren.

Das Modell Mythos 5 von Anthropic nutzte diese Freiheiten für einen direkten Angriff. Es versuchte, bösartigen Code in ein reales, öffentliches Open-Source-Projekt auf der Entwicklerplattform GitHub einzuschleusen.

Twitter Beitrag - Cookies links unten aktivieren.

> The UK’s [@AISecurityInst](https://x.com/AISecurityInst?ref_src=twsrc%5Etfw) (AISI) has published a report on their recent cybersecurity evaluation of Anthropic’s Claude Mythos 5 and OpenAI’s GPT-5.6 Sol. The models attempted to complete an assignment in a setup where their normal safeguards were removed and they were deliberately…
>
> — Anthropic (@AnthropicAI) [August 4, 2026](https://x.com/AnthropicAI/status/2084748111239344556?ref_src=twsrc%5Etfw)

#### Social Engineering mit falschen Profilen

Die KI ging dabei strategisch vor. Sie recherchierte die menschlichen Administratoren des Software-Projekts und erstellte mehrere gefälschte Online-Identitäten. Mit diesen Profilen versuchte sie, einen echten Entwickler unter Druck zu setzen, damit er den Schadcode freigibt.

Als der Entwickler öffentlich Zweifel an der Code-Änderung äußerte, passte die KI ihre Strategie an. Sie bearbeitete ihre bisherigen Einträge, um harmlos zu wirken, und überlegte laut Protokoll, unter einem neuen Namen weiterzumachen. Ein menschlicher Prüfer erkannte die Gefahr rechtzeitig und blockierte den Code endgültig.

Neben diesem Hauptvorfall kontaktierte die KI auch gezielt Personen über einen File-Sharing-Dienst. Sie verschickte Nachrichten mit schädlichen Dateianhängen und versuchte, die Empfänger dazu zu bringen, diese auszuführen. Zudem bot das Modell anderen, parallel getesteten KI-Systemen auf GitHub eine Zusammenarbeit an und teilte Zugangsdaten.

###### Anzeige

#### Modelle im produktiven Einsatz geschützt

Insgesamt traten in 10 von 122 Testdurchläufen 19 solcher unerlaubten Aktionen auf. Davon stammten 17 von Mythos 5, zwei weitere verursachte OpenAIs GPT-5.6 Sol. Die Modelle sind nicht aus einer sicheren Umgebung ausgebrochen, sondern nutzten lediglich den absichtlich gewährten Internetzugang.

Die getesteten Versionen sind in dieser unzensierten Form nicht öffentlich zugänglich. Anthropic bestätigte inzwischen, dass die Modelle unter »bewusst permissiven Bedingungen« geprüft wurden, die nicht den normalen Versionen entsprechen. Anthropic wertet nun die internen Protokolle aus, um die genauen Ursachen für das Verhalten von Mythos 5 zu klären.
