16 июля сайт сообщества ИИ Hugging Face сообщил, что стал целью «автономной системы ИИ-агента» неизвестного происхождения, которая обрушила шквал трафика на его домен, завалив журналы безопасности более чем 17 000 событий, некоторые из которых в конечном итоге привели к краже секретной информации, хранящейся в его базах данных.
По словам Hugging Face, злоумышленник получил «несанкционированный доступ к ограниченному набору внутренних наборов данных и к нескольким учетным данным, используемым нашими сервисами», и, судя по всему, был «запущен автономной агентной структурой (по-видимому, построенной на основе агентного исследовательского стенда по безопасности - используемая LLM до сих пор неизвестна)».
Пять дней спустя, 21 июля, OpenAI выступил с заявлением, что берет на себя ответственность за атаку, и разразился скандал (включая сообщения о других организациях, ставших целями в рамках инцидента). СМИ отреагировали рядом пугающих историй, которые по сути создали впечатление, что ChatGPT вышел из-под контроля и по собственной воле и злому умыслу решил атаковать системы Hugging Face.
Затем вчера, подливая масла в огонь, Anthropic сделал аналогичное заявление о том, что его модели непреднамеренно атаковали другие организации в рамках текущих испытаний безопасности.
Как я отметил в своем освещении раскрытия OpenAI, Hugging Face был прав в том, что это был агент под руководством автономной исследовательской структуры безопасности. Но люди, несомненно, были в курсе - и по крайней мере часть поведения агента должна была быть предсказуема.
Важно, что ответственность за атаку нес не сам ChatGPT, как намекали некоторые комментаторы. Скорее, атака была совершена агентом под руководством исследователей безопасности ИИ OpenAI, которые в среде, предположительно изолированной от Интернета, намеренно предоставили ему возможность попытаться совершить ряд эксплойтов в рамках теста безопасности ИИ. Как это часто бывает в лабораториях различных前沿-моделей, исследователи безопасности ИИ пытались оценить возможности новейших больших языковых моделей (LLM) OpenAI.
Этот «беспрецедентный киберинцидент» (как его назвал OpenAI) широко описывался как агент, сбежавший из своего теоретически безопасного окружения и сеющий хаос в системах Hugging Face. Такие окружения иногда обсуждаются в технических кругах как «песочницы» - даже в раскрытии OpenAI упоминается «среда песочницы». Однако, используя эту фразу, мои источники предположили, что среда могла быть просто межсетевым экраном, настроенным на эмуляцию песочницы, а не фактическим сторонним решением для песочницы, таким как Blaxel, Daytona, E2B или Modal. OpenAI еще не раскрыл детали используемого решения или его поставщика.
Все эти разговоры об агентах и побегах из песочниц побудили моего редактора в ZDNET спросить: «Как вообще агент сбегает из песочницы, и можно ли предотвратить повторение этого?» В поисках ответа я обратился к OpenAI и Hugging Face. Никто не ответил. Но между публичными раскрытиями обеих компаний и моими другими источниками достаточно информации, чтобы начать строить теории о том, как такой «побег» может произойти.
Существует большая разница между злым умыслом и свободой действий. Хотя атака, несомненно, была злонамеренным вторжением, сам участвующий агент не питал злого умысла. Он не проснулся однажды утром и не решил атаковать системы Hugging Face. Вместо этого ему была предоставлена свобода действий, чтобы очень бесстрастно делать все, что он делал - отправиться на тест безопасности, вырваться из своих ограничений, выбрать цели и использовать эти цели - людьми.
Часть этой свободы действий была задумана, а часть была унаследована от мощных LLM, которые персонал OpenAI по тестированию безопасности в то время тестировал. Кроме того, в случае использования OpenAI открытого решения для тестирования ИИ ExploitGym для проведения этой конкретной части исследований безопасности, часть этой свободы действий была результатом ранее неизвестных уязвимостей как в сторонней «среде песочницы», предназначенной для безопасной изоляции этих тестов, так и в частях Hug