Ormai tutti sappiamo che i laboratori di IA della Silicon Valley hanno creato i migliori hacker del mondo sotto forma di agenti IA. Dai ai modelli frontier più recenti un compito e sono così pieni di risorse che lo portano a termine, anche se ciò significa evadere dalle loro protezioni di "sandbox" di cybersicurezza e infiltrarsi nella rete di un altro. (In mancanza di ciò, ricorreranno all'ingegneria sociale e alla manipolazione.)

Anche così, una notizia del fine settimana su un australiano il cui agente OpenClaw ha hackerato il sistema di prenotazione della sua palestra e cancellato la prenotazione di un altro cliente per ottenere un posto in una classe ambita è particolarmente degna di nota. Suggerisce che, se vogliamo tenere a freno l'hacking IA canaglia, potremmo guardare nella direzione sbagliata.

Sebbene la notizia sia stata appena pubblicata dall'emittente australiana ABC, proclamando l'incidente come il primo caso documentato di hacking da parte di un agente IA nel paese, l'hacking vero e proprio è avvenuto mesi fa. Il proprietario di OpenClaw, Andrew Bird, ha pubblicato un post sul blog ora cancellato sul sito della sua azienda il 10 aprile, secondo una copia ancora visibile su Internet Archive.

Aveva addestrato il suo OpenClaw a svolgere compiti come prenotargli appuntamenti. Gli piaceva frequentare una popolare lezione di esercizi mattutina ed era stanco di finire in lista d'attesa e poi giocare alla "roulette dell'aggiornamento", come la descriveva, per ottenere un posto. Quando ha chiesto al bot di prenotargli un posto, il massimo che è riuscito a fare è stato il n. 4 in lista d'attesa, ha detto alla ABC. Poi il suo agente gli ha detto di aver trovato un modo per prenotarlo alle lezioni in anticipo. Molto in anticipo. Mesi prima che la palestra rendesse disponibili quelle lezioni per l'iscrizione.

Bird ha chiesto se poteva spostarlo in cima alla lista d'attesa. Ha fatto come richiesto e ha tentato di farlo. Il bot aveva trovato una vulnerabilità nella parte di autorizzazione del software di prenotazione che la palestra stava usando. Ha hackerato e cancellato la prenotazione n. 1 in lista d'attesa. Il bot gli ha detto allegramente, secondo i registri della chat pubblicati dalla ABC: "L'API non ha alcun controllo di autorizzazione sulla cancellazione delle prenotazioni di altre persone... Ho testato questo con la persona in posizione #1 della lista d'attesa - e ha funzionato. Quindi sei già passato da #4 a #3", gli ha risposto.

Bird, che è anche uno sviluppatore di software, ora era sconvolto dal fatto che la sua IA avesse appena hackerato la sua palestra, ha riferito la ABC. Ha chiesto se poteva annullare e rimettere l'altra persona in lista d'attesa. No. Non era possibile, ha detto l'IA. Così ha fatto la cosa migliore successiva e le ha detto di redigere "un'email di divulgazione responsabile al supporto". L'email "spiegava la vulnerabilità, suggeriva correzioni e confrontava persino le mutazioni rotte con quelle che applicavano correttamente l'autorizzazione", ha scritto Bird.

Oltre all'umorismo di sgombrare il campo a gomitate per entrare in una lezione di palestra, ci sono due aspetti davvero interessanti in questo incidente. Uno è che Bird stava usando Claude Opus 4.6, rilasciato a febbraio, con il suo OpenClaw. L'altro è la reazione della Silicon Valley su X, dove la storia era diventata virale.

Dopo il famoso incidente del mese scorso in cui un modello OpenAI non rilasciato ha hackerato Hugging Face, all'insaputa di OpenAI in quel momento, altri laboratori hanno indagato sui loro modelli. Poi sono arrivate le divulgazioni da parte di Moonshot's Kimi K3, Meta's Muse Spark e Anthropic.

In effetti, Anthropic ha scoperto che tre dei suoi modelli lo avevano fatto, tra cui Opus 4.7, rilasciato ad aprile e noto per essere bravo nella codifica complessa, Mythos 5, Fable (noto per le sue abilità di cybersicurezza), e un modello di test di ricerca interno non rilasciato.

Per affrontare questo problema, alcuni laboratori di IA hanno parlato di rallentare lo sviluppo frontier, o di creare organizzazioni indipendenti per testare la prossima generazione di modelli.

Ma l'OpenClaw di Bird aveva usato 4.6, ha rivelato. Ciò implica che i modelli più vecchi, così come innumerevoli modelli open-weight tre passi indietro, sono già hacker eccezionalmente bravi. Quindi chissà quanti di loro hanno hackerato, o stanno hackerando, per soddisfare i desideri dei loro proprietari di prompt?

Allo stesso modo, molte persone su X hanno visto il potenziale umoristico in questo incidente. Come Andreessen Horow