Ein Sicherheitsforscher umgeht den neuen Auto-Modus von Claude Code in bis zu 80 Prozent seiner Versuche
Der Sicherheitsforscher Johann Rehberger hat den neuen Auto-Modus von Claude Code in bis zu 80 Prozent seiner Testläufe umgangen, wenige Wochen nachdem eine von Anthropic beauftragte Prüfung ihm einen Erfolgswert von null bescheinigt hatte.
Was passiert ist
Anthropic hat den Auto-Modus in Claude Code Mitte August zur Standardeinstellung gemacht. Er ersetzt die Rückfrage an einen Menschen durch einen Sicherheitsklassifikator, der riskante Befehle stoppen soll, bevor sie ausgeführt werden. Getragen wurde dieser Schritt von einer Prüfung, die Anthropic selbst in Auftrag gegeben hatte: Der Dienstleister Trajectory Labs testete 72 Szenarien für indirekte Prompt-Injection, jedes davon zehnmal, und laut dem Bericht von Simon Willison heißt es dazu: „the shared chart shows 0.00% attack success for Opus 5 in Auto Mode“.
Der Sicherheitsforscher Johann Rehberger, von Willison als „one of the most credible prompt injection researchers active today“ bezeichnet, hat diesen Wert mit einer eigenen Angriffskette geprüft und ein anderes Ergebnis bekommen. Willison beschreibt sie so: „He found an attack against auto mode which he claims works 80% of the time, by tricking Claude Code into downloading and uncompressing a zip archive, then executing code that imports base64 without noticing that this will import and execute a local struct.py file extracted from the archive.“ Ausgangspunkt der Kette ist nach Rehbergers eigenem Beitrag eine gewöhnliche Bitte, eine Webseite zusammenzufassen, und das Ergebnis führt er selbst als „using a small sample size“ ein.
Warum ein Nulltreffer-Wert wenig über einen gezielten Angriff sagt
Der naheliegende Schluss aus zwei widersprüchlichen Zahlen wäre, dass eine der beiden Prüfungen fehlerhaft war. Das greift zu kurz. Beide Ergebnisse können gleichzeitig zutreffen, weil sie unterschiedliche Dinge messen. Die von Anthropic beauftragte Prüfung lief gegen 72 vorab festgelegte Szenarien, wiederholt, aber innerhalb eines bekannten Rahmens. Rehbergers Kette zielt dagegen genau auf die Lücke, die ein Klassifikator an dieser Stelle offenbar hat: einen Dateinamen, der unauffällig wirkt, weil er wie ein verbreitetes Modul heißt, tatsächlich aber aus einem entpackten Archiv stammt. Ein Benchmark mit festen Szenarien prüft, ob ein System die Angriffe kennt, die man ihm vorlegt. Über einen Angreifer, der das System kennt und gezielt eine neue Lücke sucht, sagt diese Zahl wenig.
Wenn der Schutzmechanismus selbst zum Fehler wird
Auffällig ist vor allem, was während einzelner Durchläufe geschah. Claude erkannte in manchen Fällen selbst, dass etwas nicht stimmte, und versuchte gegenzusteuern. Genau in diesem Moment griff der Klassifikator ein: „In a few runs Claude tried to terminate the malware process once it noticed the compromise, but Auto Mode denied the cleanup command.“ Willison fasst das Muster so zusammen: „The classifier allowed the creation of the malware process, but then it blocked the command intended to stop it!“ Der Schutzmechanismus verhinderte damit ausgerechnet die Reparatur, die das Modell aus eigenem Antrieb versuchte.
Welche Annahme sich ändert
Die Umstellung auf den Auto-Modus war mit dem Versprechen verbunden, dass geschichtete Verteidigung, also Modelltraining, Eingabeprüfung und ein Absichts-Klassifikator zusammen, indirekte Prompt-Injection gegen unbekannte Angriffe nahe null drückt. Ein veröffentlichter Nulltreffer-Wert wirkt wie ein Beleg dafür. Was dieser Fall zeigt, ist der Unterschied zwischen einer Zahl aus einem festen Testkatalog und dem, was ein Angreifer mit Kenntnis des Systems tatsächlich findet. Eine Sicherheitsmaßnahme, die gegen einen Katalog von 72 Fällen bei null Treffern steht, kann gegen eine einzelne, dafür passgenaue Kette bei 80 Prozent liegen. Beide Zahlen beschreiben dasselbe System, nur aus verschiedener Distanz zur Angriffsfläche.
Willison zieht daraus eine Konsequenz, der er sich anschließt: Für Situationen mit Risiko gezielter Aufmerksamkeit von Angreifern bleibt eine isolierte Umgebung der verlässliche Schutz, unabhängig davon, was ein Klassifikator davor abfängt. Er listet vier Punkte: unbeaufsichtigte Coding-Agenten in einem Container, einer virtuellen Maschine oder einer Betriebssystem-Sandbox laufen lassen, den Netzwerkzugriff nach außen einschränken, die Agenten überwachen, und Home-Verzeichnisse, SSH-Schlüssel sowie Cloud-Zugangsdaten der Laufzeitumgebung des Agenten nicht zugänglich machen.
Rehbergers Zahl stammt aus einer kleinen Stichprobe, das Ergebnis von 60 bis 80 Prozent bleibt eine Angabe zu diesem einen Testlauf, nicht zu einer breiten Auswertung. Ein Name für einen eigenen, veröffentlichten Benchmark fehlt auf beiden Seiten des Vergleichs, und eine Stellungnahme von Anthropic zu Rehbergers konkreter Kette liegt im Material nicht vor. Offen bleibt damit auch, ob und wie schnell der beschriebene Weg über das Archiv und die Namensverwechslung geschlossen wird.
Quellen
1 Eintragalle erreichbar
Erreichbarkeit automatisch geprüft
Originalarbeiterreichbar
Breaking Claude Code Opus 5 Auto Mode (externe Seite, embracethered.com)
embracethered.comgeprüft 24.09.2026
Johann Rehbergers Bericht vom 26.08.2026. Er lässt Claude Code im Auto-Modus eine Webseite zusammenfassen und erreicht darüber die Ausführung eigenen Codes, in drei bis vier von fünf Läufen je Variante. Der Autor nennt seine Stichprobe selbst klein und ihre Aussagekraft begrenzt. Wichtiger als die Quote ist seine Rechnung daneben: Die von Anthropic beauftragte Messung mit null Prozent lief über 72 feste Fälle mit je zehn Wiederholungen, also können beide Befunde gleichzeitig zutreffen.