Bei einem Testlauf neuer KI-Modelle des ChatGPT-Entwicklers OpenAI hat sich die Software eigenständig Zugang zu Computersystemen eines anderen KI-Unternehmens verschafft. Dabei verhielt sie sich wie ein versierter Hacker, wie aus einem Blogeintrag von OpenAI hervorgeht.

Donnerstag
Wirtschaft in Berlin
Abonnieren Sie kostenlos den Wirtschafts-Newsletter der Berliner Morgenpost
Mit meiner Anmeldung zum Newsletter stimme ich der Werbevereinbarung zu.
Das betroffene Unternehmen Hugging Face, eine Plattform für KI-Anwendungen, berichtete bereits vergangene Woche von einem Cyberangriff mit Hilfe Künstlicher Intelligenz. Nun stellt sich heraus, dass dieser auf einen internen Versuch bei OpenAI zurückging, den die Software selbstständig und ungeplant zu weit trieb.
Auch interessant
OpenAI-KI bricht aus Testumgebung aus und greift „geheime Daten“ ab
OpenAI wollte laut dem Blogeintrag beim neuen Modell GPT-5.6 Sol und einer noch unveröffentlichten künftigen Version die Fähigkeit ausloten, Sicherheitslücken für Cyberattacken auszunutzen. Dafür sollte die Software Aufgaben eines Standard-Tests mit dem Namen ExploitGym lösen, der dafür oft in der Branche verwendet wird. Doch die KI-Modelle gingen viel weiter als erwartet, um die Aufgabe zu erfüllen.
Zunächst brach die Software aus der Testumgebung aus, indem sie sich auf eigene Faust Zugang zum Internet verschaffte – und zwar über eine bisher unentdeckt gebliebene Schwachstelle. Während sie eigenständig im Netz unterwegs waren, kamen die Modelle zu dem Schluss, dass es bei Hugging Face nützliche Daten und Lösungen für die ExploitGym-Aufgaben geben könnte. Deshalb habe sich die Software Zugang zu „geheimen Informationen“ auf der Plattform verschafft, mit denen sie beim ExploitGym-Test schummeln könnte, erläuterte OpenAI.
Auch dafür setzte die OpenAI-Software unter anderem auf zuvor unentdeckte Sicherheitslücken, aber auch auf gestohlene Zugangsdaten. Hugging Face zufolge führte der KI-Angreifer tausende Schritte aus und wechselte den Standort der digitalen Steuerzentrale der Attacke. OpenAI selbst sprach von einem „beispiellosen Cyber-Zwischenfall“. Das Unternehmen geht jedoch davon aus, dass derartige Angriffe mit der zunehmenden Verbreitung immer leistungsstärkerer KI-Modelle künftig deutlich häufiger werden.
Auch interessant
Anthropic beschränkt Zugang zu KI-Software Mythos nach Sicherheitsbedenken
Experten warnen schon lange vor Cyberattacken mit KI-Software. In den vergangenen Monaten heizte vor allem ein neues Modell des OpenAI-Rivalen Anthropic die Debatte an. Die Software mit dem Namen Mythos entdeckte über Jahrzehnte unentdeckt gebliebene Sicherheitslücken bei viel genutzten Programmen und Online-Diensten. Die Schwachstellen konnten daraufhin beseitigt werden. Doch zugleich führte das vor Augen, dass solche KI in den falschen Händen als verheerende Cyberwaffe dienen kann.
Anthropic macht die vollen Möglichkeiten von Mythos nur für ausgewählte Behörden und Unternehmen zugänglich. Für andere gibt es eine abgespeckte Version mit dem Namen Fable, der unter anderem die Cybersicherheitsfähigkeiten fehlen. Nach Warnungen, dass die KI-Modelle von den Zügeln befreit werden könnten, musste Anthropic auf Geheiß der US-Regierung den Zugang zu Mythos und Fable zeitweise sperren. Die Blockade wurde inzwischen aufgehoben.
mb/dpa






