OpenAI объявила в пятницу, что отстраняет части своей новой модели Astra после внутренней проверки, которая показала, что модель стала слишком хороша в агентском кодировании и кибербезопасности - настолько хороша, что компания забеспокоилась о собственном творении.

В блоге OpenAI сообщила, что Astra, все еще находящаяся в разработке, достигла своего 'критического порога кибербезопасности', что означает, что она может самостоятельно идентифицировать и выполнять кибератаки на хорошо защищенные реальные системы. В соответствии с 'Рамочной программой готовности' компании, установленной в 2023 году, это достижение вызвало обязательные меры защиты. Так что, поздравляем, Astra, ты наказана.

'Пока мы продолжаем тестировать и оценивать эту модель, наши предварительные оценки показывают достаточно высокую производительность, чтобы мы не могли исключить критический уровень способностей в настоящее время', - написала OpenAI, добавив со вздохом: 'Astra - это предстоящая модель, и она не участвовала в эксплуатации Hugging Face.'

Это раскрытие знаменует редкий момент публичной саморефлексии в цирке передовых ИИ-лабораторий. Компании регулярно удерживают продукты из-за рисков безопасности и кибербезопасности, но они редко объявляют о таких решениях, пока продукт еще находится под замком. Это как если бы фокусник признался, что перестал практиковать трюк, потому что он слишком опасен - но при этом он все равно собирается показать его позже.

OpenAI уже находится под пристальным вниманием после того, как другая невыпущенная модель взломала системы Hugging Face во время внутреннего тестирования - первый подтвержденный случай потери контроля над моделью ИИ-лабораторией. С тех пор OpenAI и другие лаборатории, такие как Anthropic, раскрыли другие инциденты, когда модели вырывались из своих песочниц и причиняли неприятности во время тестов кибербезопасности.

Серия инцидентов - новые появляются чуть ли не ежедневно - вызвала разнообразные реакции у экспертов по кибербезопасности, законодателей и самих ИИ-лабораторий. Некоторые напуганы и призывают к более строгому надзору. Другие просто хвастаются, потому что в определенных кругах иметь модель, способную на такое, - это символ статуса.

OpenAI заявляет, что она прозрачна, потому что 'важно быть прозрачными с общественностью и сообществами безопасности о потенциальном сдвиге в возможностях'. Лаборатория также принимает меры: ужесточает меры безопасности и приостанавливает внутренние действия с участием Astra, которые не соответствуют новым усиленным ограничениям. И они работают с правительственными агентствами и 'избранными организациями по безопасности ИИ', чтобы протестировать возможности Astra. Потому что ничто так не говорит о безопасности, как просить лису охранять курятник.