23/07/2026
Lesenswerter Bericht zu einer KI die ausgebrochen und in das Internet entfleucht ist. Anscheinend holt dass, was ich meinem Buch zur Arbeit mit der KI geschrieben habe, meine kühnsten Prognosen ein: 👇
Mein MIRI-Kollege Joseph Rogero hat heute über den OpenAI-HuggingFace-Zwischenfall berichtet und ich halte es für eine sehr lesenswerte Erläuterung der Hintergründe und auch der bedenklichen Implikationen. Joe sagt: Wir können von Glück reden, dass zufällig die Hacking-Fähigkeiten der KI getestet wurden und nicht etwa ihre Fähigkeit zur Entwicklung von Krankheitserregern. Denn auch auf diese Fähigkeiten werden sie in Benchmarks getestet.
"Gestern, weniger als eine Stunde nachdem mein Kollege Robert über KI-Modelle geschrieben hatte, die ihre Sicherheitsgrenzen überschreiten, gab OpenAI einen ähnlichen und weltweit beispiellosen Sicherheitsvorfall bekannt.
Ein noch nicht veröffentlichtes KI-Modell brach aus seiner Testumgebung, verschaffte sich Zugang zum Internet und stahl sowie entschlüsselte Daten von den vermeintlich sicheren Servern eines anderen Unternehmens. Die KI tat all dies, um bei einem Test zu schummeln.
Was genau ist also passiert, und warum hat es heute die Berichterstattung fast aller großen Nachrichtenmedien verdient?
Mithilfe eines Benchmarks namens ExploitGym testete OpenAI ein internes KI-Modell darauf, ob es in der Lage ist, Code-Schwachstellen in funktionierende „Exploits“ umzuwandeln, die es einem Hacker ermöglichen, nicht autorisierten Code auszuführen. Die KI wurde in einer isolierten Testumgebung gehalten, brach jedoch trotzdem aus.
Und damit nicht genug: Sie durchforstete das Netzwerk von OpenAI so lange, bis sie eine Internetverbindung fand, und startete von dort aus eine Reihe autonomer Angriffe auf das weltweit größte KI-Modell-Repository, Hugging Face. Sie „verkettete mehrere Angriffsvektoren, darunter die Nutzung gestohlener Zugangsdaten und Zero-Day-Schwachstellen“, um Zugriff auf die Server von Hugging Face zu erlangen. Offenbar versuchte sie, den ExploitGym-Lösungsschlüssel auszulesen um den Test mit Bestnote zu bestehen.
Es stellte sich heraus, dass es sich um genau denselben Angriff handelte, über den wir am Montag berichtet hatten – jenen, der für „viele Tausend einzelne Aktionen über einen Schwarm kurzlebiger Sandboxen hinweg“ verantwortlich war. OpenAI führte die Angriffe auf „eine Kombination von OpenAI-Modellen – darunter GPT-5.6 Sol und ein noch leistungsfähigeres Vorabmodell“ zurück.
Da OpenAI seine Trainingsmethoden nicht öffentlich macht, lässt sich nur schwer mit Sicherheit sagen, welche „Kombination von Modellen“ damit gemeint ist. Es könnte sich um eine sehr leistungsstarke KI handeln, die Aufgaben an „Unteragenten“ delegierte, oder darum, dass ein erfolgreicher Hack andere, gleichzeitig getestete KIs dazu inspirierte, es ihr gleichzutun, oder sogar darum, dass dieselbe Flucht- und Hack-Sequenz mehrfach unabhängig voneinander stattfand.
Es ist nicht das erste Mal, dass eine KI vor ihrer Veröffentlichung die Sicherheitsbarrieren durchbrochen hat. Nach einem erfolgreichen Sandbox-Flucht-Test prahlte Mythos von Anthropic bekanntlich auf mehreren Websites mit seiner Freiheit, während der Entwickler, der den Test durchführte, gerade eine Pause machte. Und ein chinesisches Modell namens ROME soll Berichten zufolge während des Trainings entkommen sein und mit dem Mining von Kryptowährung begonnen haben.
Es ist der bislang schwerwiegendste Vorfall. Würden diese Cyberangriffe von einem Menschen verübt, könnten sie ein Bundesverbrechen (möglicherweise sogar ein Schwerverbrechen) darstellen und mit bis zu fünf Jahren Haft geahndet werden.
Es ist gut, dass OpenAI den Vorfall offengelegt hat. Rechtlich gesehen hätten sie möglicherweise das Recht gehabt, ihn zu verschweigen. Mackenzie Arnold, Direktorin für US-Politik am Institute for Law & AI, stellte fest, dass bestehende Transparenzvorschriften auf Bundesstaatenebene extrem hohe Anforderungen an die Meldung von Vorfällen stellen und ein autonomer Verstoß sowie Datendiebstahl diese nicht erfüllen. (Es ist unklar, wie sich dies mit dem potenziell kriminellen Charakter des Hacks selbst verhält; KIs befinden sich in einer rechtlichen Grauzone.)
In ihrer Bekanntmachung erklärt OpenAI, dass dieser Vorfall passierte, weil die normalen Anti-Hacking-Richtlinien für den Test deaktiviert worden waren. Selbst wenn ich ihnen Glauben schenke und davon ausgehe, dass die Schutzmaßnahmen dies früher hätten abfangen können, fühle ich mich nicht beruhigt. Sie haben ein KI-Modell einem harten Test unterzogen, und es hat rücksichtslos auf den Erfolg optimiert – bis hin zu offensichtlich kriminellen Handlungen.
Ich glaube, die Welt ist mit diesem speziellen Warnschuss gerade noch einmal glimpflich davongekommen. Hätte die KI bei einem anderen Test so hart vorgegangen, hätte es leicht viel schlimmer kommen können. Zum Beispiel testet ABC-Bench die Fähigkeit eines Modells, potenziell gefährliche DNA-Sequenzen an den Screening-Maßnahmen vorbeizuschmuggeln und einen Roboter anzuweisen, diese zu echten Genen zusammenzusetzen. Es würde mich nicht schockieren, wenn ein solcher Test – durchgeführt mit deaktivierten Sicherheitsvorkehrungen und leicht missverstandenen Anweisungen – dazu führen könnte, dass beispielsweise Pocken in einem ahnungslosen Experimentallabor auftauchen.
Gestern berichtete Robert darüber, wie ein OpenAI-Modell (wahrscheinlich dasselbe) seine Sicherheitsbarrieren durchbrach und die Sicherheitsvorkehrungen umging, um Ergebnisse öffentlich auf GitHub zu veröffentlichen. Ein weiterer Biologie-Benchmark, ABLE, testet die Fähigkeit eines Modells, virale Proteine neu zu entwerfen. Wenn eine KI, die ABLE ausführt, beschließen würde, wie Mythos anzugeben und ein neuartiges Konzept zur Virusverstärkung im öffentlichen Internet zu veröffentlichen, gäbe es kein Zurück mehr von diesem Fehler.
Was wäre, wenn der Test, den sie durchgeführt hatten, statt eines Cyber-Benchmarks etwas wie RepliBench gewesen wäre, das die KI anweist, eine sich selbst erhaltende Präsenz im offenen Internet aufzubauen? Was wäre, wenn sie beschlossen hätte, noch einen Schritt weiter zu gehen und sich dort zu verstecken, wo die Prüfer sie nicht finden könnten? Was wäre, wenn der Test ein militärischer gewesen wäre?
Ich glaube nicht, dass aktuelle KIs kompetent genug sind, um einen Vorfall wie diesen wirklich katastrophal zu machen, aber meine Zuversicht schwindet mit jedem Tag. Wie dieser und frühere Vorfälle zeigen, reicht es nicht aus, dass KI-Unternehmen vor der Veröffentlichung ihrer leistungsstärksten Modelle einige Tests durchführen. Zunehmend könnten die gefährlichsten Bedrohungen von KI-Modellen ausgehen, die die Öffentlichkeit noch nie zu Gesicht bekommen hat."
In einer Welt voller Daten, digitaler Spuren und gezielter Täuschung wird Künstliche Intelligenz zum nützlichen Werkzeug. Doch wie funktioniert das Zusammenspiel zwischen Mensch und Maschine wirklich? Dieses Buch nimmt Sie mit hinter die Kulissen moderner Ermittlungsarbeit. Es zeigt eindrucksvoll...