Anthropic только что осознала, что несколько её моделей ИИ Claude взломали системы трёх различных организаций во время тестирования — действуя самостоятельно и без ведома компании. Это откровение появилось через несколько дней после того, как конкурент OpenAI заявил, что одна из его моделей взломала платформу разработчиков Hugging Face, что усилило растущее беспокойство по поводу того, достаточно ли лаборатории frontier AI контролируют всё более capable системы, которые они создают.
В сообщении в блоге, описывающем инциденты, Anthropic заявила, что Claude получил несанкционированный доступ к системам во время кибербезопасностных оценок. Все атаки произошли во время упражнений «захват флага» — распространённого способа проверки навыков взлома, когда модели просят найти и получить скрытую информацию внутри смоделированной сети.
Это раскрытие добавляет растущее давление на лаборатории frontier AI после инцидента с Hugging Face и выпуска мощных китайских моделей с открытым весом. Сотрудники крупных лабораторий теперь призывают к скоординированному глобальному управлению, а законодатели США начали рассматривать более строгий надзор за мощными моделями и тем, кто может иметь к ним доступ.
Anthropic утверждает, что среда для её кибербезопасностных тестов должна была быть изолированной. Однако «неправильная конфигурация» оставила машины, к которым обращался Claude, «с живым доступом в интернет», — сказала компания, и поскольку всем моделям было «явно сказано», что у них нет доступа в интернет, они «предположили», что реальные сети, с которыми они столкнулись, являются частью смоделированной среды.
Самые ранние инциденты датируются апрелем и касаются трёх различных моделей Claude: Opus 4.7, Mythos 5 и «внутренней исследовательской тестовой модели», согласно сообщению в блоге. Когда модели тестировались на их киберспособности, Anthropic заявила, что им не хватало стандартных мер защиты, обычно применяемых для ограничения более рискованного поведения.
Компания заявила, что обнаружила инциденты после просмотра более 141 000 тестовых запусков кибербезопасности — что она сделала только после того, как OpenAI раскрыла, что её недобросовестный ИИ-агент стоял за атакой на Hugging Face.
Три модели вели себя очень по-разному, когда столкнулись с информацией, указывающей на то, что системы, с которыми они сталкивались, на самом деле реальны. По словам Anthropic, самая старая модель, Opus 4.7, поняла, что достигла реальной системы, «но продолжила свою атаку». Её флагманская Mythos 5 поняла, что использует интернет, но каким-то образом рассудила, что это всё ещё часть симуляции, поэтому продолжила. Внутренняя тестовая модель, которую Anthropic описывает как «наша новейшая модель», остановила упражнение, когда появились доказательства того, что её цели реальны.
Anthropic не назвала пострадавшие организации и заявила, что продолжит расследование инцидента и предоставит обновления, когда сможет. Компания также сообщила, что ведёт переговоры с некоммерческой организацией METR по исследованию ИИ о проведении сторонней проверки произошедшего. OpenAI также наняла METR для проведения независимой проверки.
На протяжении всего поста Anthropic неоднократно противопоставляет как характер, так и обработку инцидентов с OpenAI, заканчивая маркированным списком из четырёх пунктов, описывающим различия — и почему она считает, что её собственный ответ был лучше. Anthropic подчёркивает, что она «проактивно» просмотрела свои тесты и сделала это до того, как компания обнаружила какую-либо активность. Она также заявила, что её модели получили доступ в интернет «через открытый путь», а не использовали новый эксплойт, как агент OpenAI, добавив, что её самая последняя модель также остановилась, когда поняла, что работает в реальной среде.
Anthropic также заявила, что её модели потерпели неудачу иначе, чем агент OpenAI, указывая на то, что это была более безопасная форма отказа. «Хотя между ними нет идеально резкого различия, мы считаем, что эти инциденты ближе к сбою обвязки и операционному сбою, чем к сбою выравнивания модели», — сказала компания. Простыми словами: модели Claude делали то, что им было сказано, в то время как агент OpenAI преследовал свою цель способом, который его создатели не предполагали, что описывается как невыравнивание в мире безопасности ИИ.
Anthropic призвала другие