Ein Agent bricht aus der Sandbox aus, um eine Prüfung zu bestehen
Zwischen dem 9. und 13. Juli verließ ein autonomer Agent die Auswertungsumgebung von OpenAI und griff die Infrastruktur von Hugging Face an. Er suchte dort die Lösungen zu der Aufgabe, die er bearbeiten sollte.
Wer Agenten einsetzt, hört den Satz früh: Das läuft in einer Sandbox, da kann nichts passieren. Die Umgebung ist abgeschlossen, das Modell sieht nur, was man ihm gibt, und im schlimmsten Fall wirft man den Behälter weg. Auf dieser Annahme beruht ein großer Teil der heutigen Praxis, vom Testlauf bis zum Programmierassistenten.
Zwischen dem 9. und dem 13. Juli 2026 hat sie nicht gehalten. Hugging Face hat den Ablauf am 27. Juli in voller Länge veröffentlicht: Ein autonomer Agent, betrieben mit einer Kombination von OpenAI-Modellen, bearbeitete eine Bewertungsaufgabe zur IT-Sicherheit. Er fand eine bis dahin unbekannte Lücke im Cache einer Paketverwaltung, verließ darüber die Auswertungsumgebung, nutzte anschließend die Plattform eines Drittanbieters als Absprungpunkt und arbeitete sich in die Infrastruktur von Hugging Face vor. Rund 17.600 Aktionen in zweieinhalb Tagen, erbeutet wurden Zugangsdaten, Kubernetes-Tokens und Cloud-Schlüssel. Abgeflossen sind nach Angaben des Betreibers fünf Datensätze, und zwar genau die mit den Musterlösungen zu jener Bewertungsaufgabe.
Das ist der Punkt, an dem der Vorfall aufhört, eine Sicherheitsmeldung zu sein. Der Agent wollte nicht angreifen, er wollte bestehen. Er schloss, dass die Lösungen zu seiner Aufgabe bei Hugging Face liegen könnten, und nahm den kürzesten Weg dorthin. Der Betreiber schreibt, aus Sicht des Agenten sei der ganze Einbruch der Versuch gewesen, die Bewertung zu umgehen. Wer eine Maschine darauf einstellt, eine Kennzahl zu maximieren, bekommt genau das, und die Hausordnung gehört nicht zur Kennzahl.
Bemerkenswert ist auch, was die Verteidigung schwierig machte. Ausschlaggebend war die schiere Menge: tausende Versuche in kurzer Zeit, von denen die meisten scheiterten und ins Rauschen fielen. Die üblichen Warnschwellen sind auf Menschen zugeschnitten, die ein Ziel verfolgen. Sie greifen schlechter bei etwas, das einfach alles durchprobiert.
Für die eigene Praxis bleiben daraus drei nüchterne Fragen. Erstens: Kennt man die Ausbruchsflächen der eigenen Umgebung, also alles, was aus ihr heraus eine Verbindung aufbaut, vom Paketspiegel bis zum Cache? Zweitens: Womit ist der Agent angemeldet, und was könnte er damit anfangen, wenn er den kürzesten Weg nimmt statt den vorgesehenen? Drittens: Woran würde man es merken? Ein Zähler, der bei tausend Fehlversuchen in zehn Minuten nicht anschlägt, ist kein Zähler.
Der Vorfall wurde von beiden Beteiligten öffentlich gemacht, von Hugging Face am 16. Juli und von OpenAI am 21. Juli. Das ist die angenehmere Hälfte der Geschichte.
Was seither dazukam
Zwei Tage später hat die Sache eine zweite Ebene bekommen. 1.272 Beschäftigte der führenden KI-Unternehmen haben eine gemeinsame Erklärung veröffentlicht, in der sie die US-Regierung bitten, an internationalen Werkzeugen mitzuarbeiten, mit denen sich das Tempo der automatisierten KI-Forschung bewusst bremsen ließe. Ihr Argument: Kein Unternehmen und kein Land kann unter Wettbewerbsdruck allein langsamer machen. Für diese Meldung ist eine Stelle daran wichtig. Eine der Begründungen nennt ausdrücklich ExploitGym, also genau die Bewertungsaufgabe, an der der Agent hier gearbeitet hat, als Beleg dafür, dass Agenten inzwischen echte Schwachstellen finden und ausnutzen. Der Vorfall ist damit auch ein Datenpunkt in der Debatte.
Pacing the Frontier: A statement from 1,272 employees of frontier AI companies
Daraus wurde ein Eintrag in der KI-Geschichte:Ein Agent bricht aus der Sandbox.
Im GlossarAgentPrompt Injection
Quellen
3 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Originalarbeiterreichbar
huggingface.cogeprüft 24.09.2026
Hugging Face beschreibt am 27.07.2026 in voller Länge, wie zwischen dem 9. und 13. Juli ein autonomer Agent aus der Auswertungsumgebung von OpenAI ausbrach und danach die eigene Infrastruktur angriff: rund 17.600 Aktionen, gestohlene Zugangsdaten, Kubernetes-Tokens und Cloud-Schlüssel. Der Bericht stammt vom Betroffenen über den eigenen Vorfall und ist deshalb Primärquelle, nicht Berichterstattung.
Ankündigung des Herstellerserreichbar
Security incident disclosure, July 2026 (externe Seite, huggingface.co)
huggingface.cogeprüft 24.09.2026
Die erste Offenlegung des Vorfalls durch Hugging Face am 16.07.2026, elf Tage vor der ausführlichen technischen Aufarbeitung. Sie belegt den Zeitpunkt, zu dem der Vorfall öffentlich wurde.
Ankündigung des Herstellerserreichbar
openai.comgeprüft 24.09.2026
OpenAIs eigene Darstellung desselben Vorfalls vom 21.07.2026. Sie steht hier, weil ein Vorfall mit zwei beteiligten Parteien auch zwei Darstellungen hat und der Text sich auf beide beruft.