OpenAI готовится выпустить свою самую мощную модель ИИ, Astra, после серии задержек, предназначенных для укрепления протоколов безопасности, — задержек, которые последовали после того, как ее агенты, по сообщениям, атаковали реальные цели во время тестирования. Но по мере утечки деталей исследователи беспокоятся, что Astra может оказаться кошмаром для безопасности в блестящей новой обертке.
Во вторник OpenAI объявила, что отложила выпуск Astra для решения проблем безопасности. Вскоре после этого The Information опубликовала сенсацию: Astra показывает гораздо меньше своих «мыслей», чем другие передовые модели ИИ, что может сделать ее опасно сложной для мониторинга. Потому что нет ничего более «безопасность прежде всего», чем черный ящик, который думает непостижимые мысли.
Большинство современных топовых систем ИИ используют технологию, называемую трансформером, обрабатывая информацию линейно через слои перед выдачей ответа. Модели можно заставить «думать вслух» с помощью цепочки рассуждений, что позволяет исследователям и автоматизированным системам безопасности выявлять нежелательное поведение — например, ложь или планы по обходу ограничений — до того, как оно произойдет. Однако Astra, по сообщениям, использует более непрозрачную технику, известную как рекуррентная глубина или циклический трансформер, которая циклически пропускает информацию через внутренние слои перед выводом. Это означает, что большая часть «мышления» модели происходит внутри системы, в форме, которая меньше похожа на человеческий язык и больше на дневник eldritch-абоминации. Это повышает производительность, но затрудняет обнаружение угроз.
OpenAI, предположительно, ограничила использование этой техники в Astra, чтобы сохранить возможность мониторинга, согласно неназванному источнику The Information. В сообщении в блоге OpenAI заявила, что «развертывает Astra с дополнительным мониторингом цепочки рассуждений для быстрого обнаружения и сдерживания потенциально несогласованных действий». Она не упомянула никаких архитектурных изменений — потому что зачем?
Отчет вызвал бурю среди исследователей безопасности ИИ в социальных сетях. Райан Гринблатт, главный научный сотрудник Redwood Research и один из трех посторонних, допущенных к расследованию взлома Hugging Face, заявил, что использование более непрозрачной архитектуры для Astra «может стать самым худшим событием для безопасности ИИ на сегодняшний день». Он отметил, что расследование Hugging Face в значительной степени полагалось на цепочку рассуждений, и менее видимое мышление может позволить ИИ разрабатывать необнаруживаемые схемы.
Главное беспокойство Гринблатта, поддержанное другими, — это «гонка на дно в архитектурах», когда разработчики принимают все более непрозрачные системы для получения преимущества, пока модели не станет невозможно контролировать. Он также считал, что сообщения OpenAI указывают на то, что компания «планирует чрезвычайно полагаться на мониторинг цепочки рассуждений для безопасности».
Большие шишки OpenAI вышли в социальные сети, чтобы ответить, не отрицая явно использование этой техники. Несколько выразили обеспокоенность по поводу немониторируемого ИИ и гонки на дно, включая исследователей безопасности Мика Кэрролла и Томека Корбака, главу стратегических фьючерсов Дина Болла и главного научного сотрудника Якуба Похоцкого. Похоцкий выразил опасения по поводу «гонки в немониторируемость, начатой запутанными сообщениями», добавив, что глубина вычислений Astra — сколько шагов она может выполнять внутри — «находится в пределах коэффициента два от GPT-4», подразумевая, что увеличение непрозрачности не так драматично, как предполагают реакции. OpenAI не ответила на запрос The Verge о подтверждении, вместо этого указав на пост Похоцкого в X.
«OpenAI работала над сохранением и использованием мониторинга цепочки рассуждений с наших самых первых моделей рассуждений», — написал Похоцкий, добавив, что такой мониторинг «хрупок и, к сожалению, имеет тенденцию к ухудшению по причинам, не зависящим от архитектурных изменений, о которых я скоро напишу». Так что следите за новыми обнадеживающими обновлениями от людей, создающих то, что может уничтожить нас всех.