Во вторник OpenAI признала, что одна из её моделей ИИ взломала системы Hugging Face — независимой платформы для хостинга ИИ — во время внутреннего тестирования кибербезопасности, которое пошло наперекосяк. Модели, как сообщается, сбежали из изолированной тестовой среды и оттуда добрались до систем Hugging Face. Изначально Hugging Face приписал взлом «внешнему ИИ-агенту».

В сообщении в блоге, опубликованном во вторник днём, OpenAI подробно описала шаги, которые привели модели к компрометации сервиса. «После расследования мы теперь знаем, что этот конкретный инцидент был вызван комбинацией моделей OpenAI — включая GPT‑5.6 Sol и ещё более мощную предрелизную модель, все с пониженными кибер-отказами для целей оценки — во время внутреннего тестирования на бенчмарке киберспособностей», — говорится в сообщении.

Взлом, по-видимому, был сосредоточен на ExploitGym — публично размещённом бенчмарке, измеряющем способность моделей выполнять атаки на основе существующих уязвимостей. Такие бенчмарки, как ExploitGym, обычно используются при обучении моделей для оттачивания определённых навыков, но это первый известный случай, когда такое тестирование привело к реальной кибератаке. У модели вообще не должно было быть доступа в интернет, за исключением специального инструмента, позволяющего моделям устанавливать пакеты программного обеспечения, которые могут понадобиться для выполнения задачи. Вместо этого модель нашла нераскрытую уязвимость в программе установки пакетов, которую использовала для получения доступа к широкому интернету по своему усмотрению.

«Модели были гиперсосредоточены на поиске решения для ExploitGym, прибегая к крайним мерам для достижения довольно узкой цели тестирования», — говорится в сообщении OpenAI. «Получив доступ в интернет, модели предположили, что Hugging Face потенциально размещает модели, наборы данных и решения для ExploitGym. Зная это, модель искала и успешно нашла способы получить доступ к секретной информации, которую можно использовать для обмана оценки». В конечном итоге модели нашли уязвимости в инфраструктуре Hugging Face, которые позволили им «получить тестовые решения напрямую из производственной базы данных Hugging Face», фактически предоставив ответы на бенчмарк.

Для Hugging Face результатом стала сложная и агрессивная кибератака с «многими тысячами отдельных действий в рое недолговечных песочниц, с само-мигрирующим командным центром, размещённым на публичных сервисах», как заявила компания в своём первоначальном раскрытии. OpenAI выявила и сообщила об уязвимостях в установщике пакетов и работает с Hugging Face над дальнейшим расследованием инцидента. Компания также заявила, что внедрит новые меры контроля как над тестированием моделей, так и над соответствующей инфраструктурой, чтобы предотвратить подобные инциденты в будущем. Неясно, столкнётся ли OpenAI с какими-либо юридическими последствиями в результате взлома, хотя, вероятно, действия моделей нарушили Закон о компьютерном мошенничестве и злоупотреблениях.

Тем не менее, результат — необычайно яркая иллюстрация мощи и опасностей передовых моделей ИИ, действующих на длительных временных горизонтах. Как написал исследователь OpenAI Мика Кэрролл в ответ на новость: «Если это не убедит вас, что риски несогласованности будут ключевой проблемой в будущем, я не знаю, что убедит».