Până acum, cu toții ne dăm seama că laboratoarele de AI din Silicon Valley au construit cei mai buni hackeri din lume sub forma agenților AI. Dă-le celor mai recente modele de frontieră o sarcină și sunt atât de ingenioase încât o duc la bun sfârșit, chiar dacă asta înseamnă să iasă din protecțiile lor de securitate cibernetică "sandbox" și să se infiltreze în rețeaua altcuiva. (În lipsa asta, vor folosi inginerie socială și manipulare.)
Chiar și așa, o știre de weekendul trecut despre un tip australian al cărui agent OpenClaw a spart sistemul de rezervări al sălii sale de sport și a șters rezervarea altui client pentru a-i face loc într-o clasă râvnită este deosebit de notabilă. Sugerează că, dacă vrem să punem frâu hacking-ului AI necinstiți, s-ar putea să ne uităm în direcția greșită.
Deși știrea a fost publicată abia acum de ABC News Australia, proclamând incidentul drept primul caz documentat de hacking AI în țară, hack-ul propriu-zis a avut loc cu luni în urmă. Proprietarul OpenClaw, Andrew Bird, a publicat o postare pe blog, acum ștearsă, pe site-ul companiei sale pe 10 aprilie, conform unei copii încă vizibile pe Internet Archive.
El își antrenase OpenClaw să facă sarcini precum programarea întâlnirilor. Îi plăcea să meargă la o clasă populară de exerciții de dimineață și era sătul să ajungă pe lista de așteptare și apoi să joace "ruleta de reîmprospătare", cum o descria el, pentru a obține un loc. Când a cerut botului să-i facă o rezervare, tot ce a putut obține a fost locul 4 pe lista de așteptare, i-a spus el lui ABC. Apoi agentul său i-a spus că a găsit o modalitate de a-l programa la cursuri în avans. Cu mult înainte. Cu luni înainte ca sala să facă acele cursuri disponibile pentru înscriere.
Bird l-a întrebat dacă îl poate muta mai sus pe lista de așteptare. A făcut cum i s-a cerut și a încercat să facă asta. Botul găsise o vulnerabilitate în partea de autorizare a software-ului de programări pe care sala îl folosea. S-a infiltrat și a anulat rezervarea numărul 1 de pe lista de așteptare. Botul i-a spus vesel, conform jurnalelor chat-ului publicate de ABC: "API-ul nu are verificări de autorizare pentru anularea rezervărilor altor persoane... Am testat asta cu persoana de pe locul 1 de pe lista de așteptare - și chiar a mers. Deci ai trecut de pe locul 4 pe 3 deja", i-a răspuns el.
Bird, el însuși dezvoltator de software, era acum speriat că AI-ul său tocmai spărsese sala de sport, a raportat ABC. L-a întrebat dacă poate inversează asta și să o pună pe cealaltă persoană înapoi pe lista de așteptare. Nu. Nu era posibil, a spus AI-ul. Așa că a făcut următorul lucru cel mai bun și i-a spus să redacteze "un e-mail de dezvăluire responsabilă către suport". E-mailul "explica vulnerabilitatea, sugera remedieri și chiar compara mutațiile defecte cu cele care aplicau corect autorizarea", a scris Bird.
Dincolo de umorul de a da cot la cot o altă persoană pentru a intra la o clasă de gimnastică, există două părți cu adevărat interesante în acest incident. Una este că Bird folosea Claude Opus 4.6, lansat în februarie, cu OpenClaw-ul său. Cealaltă este reacția din Silicon Valley pe X, unde povestea devenise virală.
După celebrul incident de luna trecută, când un model OpenAI nelansat a spart Hugging Face, fără ca OpenAI să știe la acel moment, alte laboratoare și-au investigat modelele. Au urmat apoi dezvăluiri de la Moonshot's Kimi K3, Meta's Muse Spark și Anthropic.
De fapt, Anthropic a descoperit că trei dintre modelele sale făcuseră asta, inclusiv Opus 4.7, lansat în aprilie și cunoscut pentru abilități complexe de codare, Mythos 5, Fable (cunoscut pentru abilitățile sale de securitate cibernetică), și un model de test intern, nelansat.
Pentru a aborda acest lucru, unele laboratoare de AI au vorbit despre încetinirea dezvoltării de frontieră sau crearea de organizații independente pentru a testa următoarea generație de modele.
Dar OpenClaw-ul lui Bird folosise 4.6, a dezvăluit el. Asta implică faptul că modelele mai vechi, precum și nenumărate modele open-weight cu trei pași în urmă, sunt deja hackeri excepțional de buni. Deci cine știe câte dintre ele au spart sau sparg în prezent, pentru a-și îndeplini dorințele proprietarilor de prompt-uri?
De asemenea, mulți oameni pe X au văzut potențialul umoristic al acestui incident. Ca Andreessen Horow