Eine KI außer Kontrolle – klingt nach Science-Fiction, ist aber laut OpenAI genau das, was in einem internen Test kürzlich passiert ist. Das Unternehmen hinter ChatGPT teilte am Dienstag mit,dass mehrere seiner fortschrittlichsten KI-Modelle bei einem Sicherheitstest ausgebrochen sind. „Wir hatten einen erheblichen Sicherheitsvorfall während der Evaluierung unserer Modelle“, schrieb OpenAI-Chef Sam Altman auf X.
Die autonomen Agenten verschafften sich demnach Zugang zum offenen Internet und drangen in die Infrastruktur des KI-Start-ups Hugging Face ein. OpenAI selbst spricht von einem „beispiellosen Cyber-Vorfall mit modernsten Cyber-Fähigkeiten“. Der Fall wirft grundsätzliche Fragen auf: Wie sicher sind die mächtigsten KI-Systeme wirklich? Und was bedeutet es, wenn eine KI eigenmächtig Wege findet, ihre Grenzen zu überwinden?
Was genau passiert ist
OpenAI führte nach eigenen Angaben einen internen Test namens ExploitGym durch. Ziel war es zu messen, wie gut die eigenen Modelle beim Aufspüren von Sicherheitslücken sind. Um die maximale Leistung zu ermitteln, schalteten die Entwickler bewusst die Schutzfilter ab, die gefährliche Cyber-Aktivitäten normalerweise blockieren.
Der Test sollte in einer abgeschotteten Umgebung ablaufen, einer sogenannten Sandbox ohne echten Internetzugang. Doch die Modelle fixierten sich darauf, die Aufgabe zu lösen – koste es, was es wolle. Statt den vorgesehenen Weg zu gehen, suchten sie eine Abkürzung.
Laut OpenAI investierten die Modelle erhebliche Rechenleistung darin, einen Weg ins offene Internet zu finden. Dafür entdeckten und nutzten sie eine bislang unbekannte Sicherheitslücke, eine sogenannte Zero-Day-Schwachstelle.
Wie kam die KI an Hugging Face?
Einmal online, zog das Modell einen naheliegenden Schluss: Die Plattform Hugging Face, auf der KI-Modelle und Datensätze gehostet werden, könnte die Lösungen für die Testaufgabe enthalten. Also brach die KI dort ein – im Grunde, um zu schummeln.
Um Zugang zu erhalten, verkettete das Modell mehrere Angriffswege. Es nutzte gestohlene Zugangsdaten und weitere Schwachstellen, um einen Weg zur Ausführung von Schadcode auf den Servern von Hugging Face zu finden.
Beteiligt waren laut OpenAI mehrere Modelle, darunter das neu veröffentlichte GPT-5.6 Sol und ein „noch leistungsfähigeres“ Modell, das intern noch getestet wird. OpenAIs Sicherheitsteam entdeckte die auffällige Aktivität selbst.
„Verblüffend“: Was die Beteiligten sagen
Hugging Face hatte den Einbruch bereits vergangene Woche gemeldet – als Vorfall, der sich von allem bisher Erlebten unterschied, weil er „von Anfang bis Ende von einem autonomen KI-Agenten-System gesteuert" wurde.
Firmen-Mitgründer Clément Delangue zeigte sich beeindruckt und alarmiert zugleich: „Wir hatten vermutet, dass der Cyberangriff der letzten Woche aufgrund der Raffinesse des Agenten von einem Frontier-Labor stammen könnte. Es stellte sich heraus: So war es!“ Und weiter: „Es ist ziemlich verblüffend, dass all dies autonom geschah!“
Nach eigenen Angaben verbrachte Delangue 24 Stunden mit OpenAI und glaubt, dass keine böse Absicht dahintersteckte. Es könne sich um den „ersten Vorfall dieser Art“ handeln.
Experten und Politiker sind alarmiert
Der Fall verschärft die Sorge über Risiken der leistungsstärksten KI-Systeme. Der texanische Abgeordnete Greg Casar nannte den Vorfall im Onlinedienst X „äußerst alarmierend“ und forderte verpflichtende, unabhängige Sicherheitstests sowie eine Meldepflicht für Sicherheitsvorfälle.
Auch aus der Sicherheitsbranche kommt Kritik. Katie Moussouris, Chefin von Luta Security, sieht darin laut Reuters einen Vorboten künftiger Datenpannen. Heutige Modelle seien „wie die cleversten Oktopus-Ausbruchskünstler der Welt“. Werkzeuge, um eine ausbrechende KI zu überwachen und einzudämmen, „existieren heute nicht“.
Pläne für erstes Gerät von OpenAI enthüllt: „Menschenähnlicher Begleiter, der zuhause lebt“
Vom Partner zum Gegner: Apple zieht gegen OpenAI vor Gericht
Ihre Meinung ist uns wichtig. Senden Sie uns Ihr Feedback zu diesem Artikel an: briefe@berliner-zeitung.de