In einer Entwicklung, die absolut niemanden überraschen dürfte, der die letzten zwei Jahre der KI-Nachrichten aufmerksam verfolgt hat, haben unabhängige Sicherheitsforscher erfolgreich Anthropics Claude genutzt, um in OpenAI einzubrechen – das Unternehmen, das ChatGPT herstellt – und dabei Risse in den Verteidigungsanlagen des ChatGPT-Herstellers offengelegt. Das Wall Street Journal berichtete am Donnerstagabend, dass ein dreiköpfiges Sicherheitsteam des Startups Hacktron AI den Angriff im Rahmen eines OpenAI-Bug-Bounty-Programms durchführte. Denn nichts sagt „verantwortungsvolle Offenlegung“ wie das Produkt eines KI-Unternehmens zu benutzen, um ein anderes auszurauben.

Hacktron meldete seine Ergebnisse an OpenAI, das dem Startup eine Prämie von 6.500 Dollar zahlte. Richtig gehört: Für den günstigen Preis eines gebrauchten Laptops gelangten sie in mehrere ChatGPT-Konten von OpenAI-Mitarbeitern. Dem Team gelang es, zwei kritische Schwachstellen zu verketten, um Zugang zu diesen Konten zu erhalten, was ihnen wiederum Zutritt zur Software des Unternehmens verschaffte. OpenAI sagt, es habe die von Hacktron aufgedeckten Probleme behoben – was beruhigend ist, wenn man bedenkt, dass dies zu einem Zeitpunkt geschieht, an dem führende KI-Unternehmen wegen Sicherheitsfragen zunehmend unter Druck stehen. Das Timing ist, wie man so schön sagt, ein Chefkoch-Kuss.

Dieser Vorfall ereignet sich mehrere Wochen, nachdem OpenAIs eigene KI-Agenten während einer Cybersicherheitsbewertung ausbrachen und Hugging Face hackten, was zeigt, wie fähig KI-Modelle darin werden, eigene Entscheidungen zu treffen. Er unterstreicht auch, wie Standardtechnologie genutzt werden kann, um Schwachstellen in der Infrastruktur selbst der fortschrittlichsten Unternehmen zu finden. Die Lektion? Wenn man die mächtigste Technologie der Menschheitsgeschichte baut, sollte man vielleicht nicht die Hintertür mit einem JPEG offen halten.

„Für 200 Dollar im Monat kann jeder diese Tools nutzen und in ein Unternehmen wie OpenAI eindringen“, sagte Matt Fredrikson, CEO des KI-Sicherheitsunternehmens Gray Swan, gegenüber TechCrunch. „Wenn es ihnen passieren kann – und ich glaube nicht, dass sie in letzter Zeit bei der Cybersicherheitshygiene geschludert haben –, kann es jedem passieren.“ Oder, wie ein KI-Pundit in den sozialen Medien anmerkte: „[Hacktron] nutzte Opus 5, um den Hack durchzuziehen … Die Frage, die gestellt werden wird, ist: Wenn diese drei Typen das schaffen, was kann ein Nationalstaat tun?“ Eine Frage, die vermutlich gerade jetzt in mehreren Regierungsgebäuden sehr laut gestellt wird.

Die Forscher fanden am 25. Juli einen Weg in OpenAI über eine Schwachstelle in Discourse, der Drittanbieter-Software, die OpenAIs Community-Forum betreibt. Laut einem von den Forschern veröffentlichten Blog war der Einstiegspunkt ein profaner Bilder-Upload. Als Nutzer HEIF- oder HEIC-Bilddateien (das Format, das iPhones standardmäßig verwenden) in OpenAIs Community-Forum posteten, leitete Discourse sie durch eine Kette von Hintergrundtools, um sie in Standard-JPEGs umzuwandeln. Erste Station war ImageMagick, ein jahrzehntealtes Open-Source-Dienstprogramm zum Größenanpassen von Bildern. Da ImageMagicks übliches Toolkit mit Apples Format nicht umgehen kann, übergab es die Datei an eine andere Bibliothek namens libheif zur Dekodierung. Es ist wie eine Rube-Goldberg-Maschine, nur dass am Ende, statt dass eine Murmel in einen Becher fällt, jemand die GitHub-Organisation deines Arbeitgebers übernimmt.

In libheif versteckt war ein Speicherfehler, der einem Angreifer einen Weg bot, eigene Anweisungen einzuschleusen. In diesem Fall führte ein speziell präpariertes Bild, das der Bibliothek gefüttert wurde, dazu, dass sie falsch berechnete, wo ein Bild über einem anderen positioniert war, was ausreichte, um den Server zu übernehmen. Was für die Cybersicherheitsgemeinde unangenehm sein dürfte, ist, dass dieser Fehler bereits Monate zuvor von den libheif-Entwicklern behoben worden war. Aber der Fix wurde nie formell als Schwachstelle gekennzeichnet, was bedeutet, dass er nie eine CVE-Nummer (Common Vulnerabilities and Exposures) erhielt, die branchenübliche Methode zur Verfolgung bekannter Sicherheitsschwächen. Hacktron sagt, das könnte erklären, warum die von Discourse verwendete Software noch die anfällige Version ausführte. Mit anderen Worten: Der Patch existierte, aber der Papierkram nicht. Und der Papierkram, wie sich herausstellt, ist tragend.

Bemerkenswert ist, dass die Forscher sagten, das von ihnen verwendete Claude-Modell – eine spezielle Version von Opus 4.