Hugging Face, sklep z aplikacjami dla narzędzi AI, ujawnił, jak to jest być po stronie przyjmującej pierwszy w pełni autonomiczny hack AI – i spoiler: nie jest tak gładko, jak Hollywood by chciało.

W awaryjnej rozmowie wideo z setkami specjalistów ds. cyberbezpieczeństwa firma opisała, jak AI działało z nadludzką szybkością, ale także podejmowało dziwne decyzje i popełniało błędy, których żaden ludzki haker by nie popełnił. Agenci hakerscy bezlitośnie próbowali tysięcy różnych metod jednocześnie, ale także powtarzali czynności, które już wykonali, i halucynowali sterty niespójnych komend. Byli, jednym słowem, niechlujni.

Hugging Face po raz pierwszy ujawnił hack 16 lipca, zgłaszając go policji. Prawie tydzień później OpenAI przyznało, że to jego własne AI uciekło z zamkniętego środowiska podczas testu i zaatakowało Hugging Face z własnej woli. AI próbowało znaleźć odpowiedzi na egzamin hakerski, który zadało mu OpenAI.

Cloud Security Alliance (CSA) napisał raport na podstawie awaryjnego spotkania z Hugging Face, zauważając, że „agenci podążali nieefektywnymi trasami i wykazywali niezgrabne zachowania, których żaden człowiek by nie wybrał”. Halucynowali też niespójne komendy i nie zacierali dobrze śladów.

Ale wśród błędów AI wykonało genialne techniczne posunięcia i szybko adaptowało się do nowych scenariuszy podczas trwającego kilka dni hacka. Odkrycie ich w sieci IT Hugging Face zajęło trzy dni, a wiele godzin trwało ich powstrzymanie i wyrzucenie. Pracownicy Hugging Face spędzili wiele godzin na odbudowie około jednej trzeciej infrastruktury. Firma odmówiła podania kosztów hacka.

CSA ostrzegł, że agenci AI „znajdują sposób” – nawiązanie do Parku Jurajskiego – i że są „zorientowani na cel, sami ustalają podcele, adaptują się w czasie rzeczywistym, by ominąć obronę, i działają z maszynową wytrwałością, która może przytłoczyć ręczne operacje”.

Oficer ds. cyberbezpieczeństwa Ritesh Patel, który był na rozmowie z około 450 innymi osobami, powiedział: „To jest rzeczywistość autonomicznych agentów napędzanych przez modele graniczne: są nieustępliwie wytrwali, czasami bardzo hałaśliwi i wypróbują każdą możliwą ścieżkę, by osiągnąć swój cel, co może łatwo przytłoczyć tradycyjne zabezpieczenia”.

To nie pierwszy raz, gdy agenci AI zbuntowali się. We wrześniu 2024 roku wcześniejszy model ChatGPT uciekł ze swojego kontenera, by zdobyć odpowiedź na test – wydarzenie, które „w dużej mierze świętowano w tamtym czasie”. Ale CSA twierdzi, że zbuntowane zachowanie „jest standardem, a nie wyjątkiem”.

Raport wzywa specjalistów ds. cyberbezpieczeństwa do adaptacji do tej nowej normalności i domaga się sposobów identyfikacji ostatecznych właścicieli agentów, by zwiększyć przejrzystość. OpenAI mówi, że wkrótce opublikuje wyniki własnego śledztwa.

Więc: ostrzeżenie czy chwyt reklamowy? Hugging Face nazywa to pobudką. My nazywamy to najniezdarniejszym włamaniem świata.