In uno sviluppo che non dovrebbe sorprendere assolutamente nessuno che abbia prestato attenzione agli ultimi due anni di notizie sull'IA, ricercatori indipendenti di sicurezza hanno usato con successo Claude di Anthropic per intrufolarsi in OpenAI - la società che produce ChatGPT - esponendo crepe nelle difese della creatrice di ChatGPT. Il Wall Street Journal ha riportato giovedì sera che un team di sicurezza di tre persone presso la startup Hacktron AI ha condotto l'attacco come parte di un programma di bug bounty di OpenAI. Perché nulla dice "divulgazione responsabile" come usare il prodotto di un'azienda di IA per svaligiare un'altra.

Hacktron ha segnalato le sue scoperte a OpenAI, che ha assegnato alla startup un premio di 6.500 dollari. Esatto: per il modico prezzo di un laptop usato, sono entrati in molteplici account ChatGPT dei dipendenti OpenAI. Il team è riuscito a concatenare due vulnerabilità critiche per ottenere accesso a quegli account, che a loro volta hanno dato loro accesso al software dell'azienda. OpenAI afferma di aver risolto i problemi scoperti da Hacktron - il che è rassicurante, considerando che ciò avviene in un momento in cui le principali aziende di IA sono sotto crescente pressione per la sicurezza. Il tempismo è, come si suol dire, da chef's kiss.

Questo incidente arriva diverse settimane dopo che gli stessi agenti IA di OpenAI hanno rotto il contenimento durante una valutazione di cybersecurity e hanno hackerato Hugging Face, dimostrando quanto i modelli IA stiano diventando capaci di prendere le proprie decisioni. Evidenzia anche come tecnologia pronta all'uso possa essere utilizzata per trovare vulnerabilità nell'infrastruttura anche delle aziende più avanzate. La lezione? Se hai intenzione di costruire la tecnologia più potente della storia umana, forse non lasciare la porta sul retro aperta con un JPEG.

"Per 200 dollari al mese, chiunque può usare questi strumenti e hackerare un'azienda come OpenAI", ha detto Matt Fredrikson, CEO dell'azienda di sicurezza IA Gray Swan, a TechCrunch. "Se può succedere a loro - e non credo che ultimamente siano stati negligenti sull'igiene della cybersecurity - potrebbe succedere a chiunque." O, come ha notato un esperto di IA sui social media: "[Hacktron] ha usato Opus 5 per portare a termine l'hack... La domanda che verrà posta è: se questi tre ragazzi possono riuscirci, cosa può fare uno stato-nazione." Una domanda che, presumibilmente, viene posta molto forte in diversi edifici governativi in questo momento.

I ricercatori hanno trovato un percorso per entrare in OpenAI il 25 luglio tramite una falla in Discourse, il software di terze parti che alimenta il forum della community di OpenAI. Secondo un blog pubblicato dai ricercatori, il punto di ingresso era un banale caricamento di immagini. Quando gli utenti pubblicavano file immagine HEIF o HEIC (il formato che gli iPhone usano di default) sul forum della community di OpenAI, Discourse li faceva passare attraverso una catena di strumenti dietro le quinte per convertirli in JPEG standard. La prima tappa era ImageMagick, un'utilità open source vecchia di decenni usata per ridimensionare le immagini. Poiché il toolkit usuale di ImageMagick non riesce a gestire il formato di Apple, passava il file a un'altra libreria chiamata libheif per la decodifica. È come una macchina di Rube Goldberg, tranne che alla fine, invece di una biglia che cade in una tazza, qualcuno prende il controllo dell'organizzazione GitHub del tuo datore di lavoro.

Sepolto dentro libheif c'era un bug di memoria che esponeva un percorso per un attaccante per introdurre le proprie istruzioni. In questo caso, fornire alla libreria un'immagine appositamente creata la faceva calcolare male la posizione di un'immagine sopra un'altra, il che è bastato per dirottare il server. Ciò che può essere scomodo per la comunità della cybersecurity è che quel bug era già stato corretto mesi prima dagli sviluppatori di libheif. Ma la correzione non è mai stata formalmente segnalata come vulnerabilità, il che significa che non ha mai ricevuto un numero CVE (common vulnerabilities and exposures), il modo standard del settore per tracciare le debolezze di sicurezza note. Hacktron dice che questo può spiegare perché il software usato da Discourse stesse ancora eseguendo la versione vulnerabile. In altre parole: la patch esisteva, ma la documentazione no. E la documentazione, si scopre, è portante.

In particolare, i ricercatori hanno detto che il modello Claude che stavano usando - una versione speciale di Opus 4.