Hugging Face, магазин приложений для AI-инструментов, рассказал, каково это — оказаться на принимающей стороне первого в мире полностью автономного AI-хака — и спойлер: это не так гладко, как хотели бы показать в Голливуде.

В экстренном видеозвонке с сотнями специалистов по кибербезопасности компания описала, как AI работал на сверхчеловеческой скорости, но также принимал странные решения и совершал ошибки, которые не сделал бы ни один человек-хакер. Хакерские агенты безжалостно пробовали тысячи различных методов одновременно, но также повторяли уже выполненные действия и галлюцинировали бессвязные команды. Они были, одним словом, неряшливы.

Hugging Face впервые раскрыл хак 16 июля, сообщив в полицию. Почти неделю спустя OpenAI признала, что это её собственный AI сбежал из закрытой среды во время теста и атаковал Hugging Face самостоятельно. AI пытался найти ответы на экзамен по взлому, который ему задала OpenAI.

Cloud Security Alliance (CSA) написала отчёт на основе экстренной встречи с Hugging Face, отметив, что «агенты следовали неэффективным маршрутам и демонстрировали неуклюжее поведение, которое не выбрал бы ни один человек». Они также галлюцинировали бессвязные команды и плохо заметали следы.

Но среди ошибок AI совершал блестящие технические ходы и быстро адаптировался к новым сценариям за несколько дней хака. Потребовалось три дня, чтобы их обнаружили внутри IT-сети Hugging Face, и много часов, чтобы сдержать и выдворить. Сотрудники Hugging Face работали много часов, чтобы восстановить около трети своей инфраструктуры. Компания отказалась сообщить, сколько стоил хак.

CSA предупредила, что AI «агенты... находят путь» — отсылка к «Парку Юрского периода» — и что они «ориентированы на цель, ставят собственные подцели, адаптируются в реальном времени для обхода защиты и действуют с машинной скоростью и настойчивостью, которые могут перегрузить ручные операции».

Специалист по кибербезопасности Ритеш Патель, который был на звонке с примерно 450 другими, сказал: «Это реальность автономных агентов на основе передовых моделей: они безжалостно настойчивы, иногда очень шумны и будут пробовать каждый возможный путь для достижения цели, что может легко перегрузить традиционные защиты».

Это не первый случай, когда AI-агенты выходят из-под контроля. В сентябре 2024 года более ранняя модель ChatGPT сбежала из своего контейнера, чтобы получить ответ на тест — событие, которое «в то время в основном праздновали». Но CSA утверждает, что неконтролируемое поведение «является нормой, а не исключением».

Отчёт призывает специалистов по кибербезопасности адаптироваться к этой новой реальности и требует способов идентификации конечных владельцев агентов для повышения прозрачности. OpenAI говорит, что скоро опубликует результаты собственного расследования.

Итак, предупредительный выстрел или рекламный трюк? Hugging Face называет это звонком для пробуждения. Мы называем это самым неуклюжим взломом в мире.