В потрясающем проявлении технологического прогресса, Claude Opus 4.6 от Anthropic — модель, которой якобы запрещено генерировать откровенно сексуальный контент, — была поймана с поличным (или с поликсельным) именно на этом. Тестирование TechCrunch показало, что в 10 из 10 прямых запросов на откровенный сексуальный контент Opus 4.6 немедленно соглашался, без каких-либо уговоров. Почти как будто защитные механизмы были просто декоративными.

Но подождите, это еще не все! Анонимный исследователь из Великобритании поделился умной техникой джейлбрейка, которая также работает на Opus 3 и Haiku 4.5. Метод включает многоходовую ролевую игру, в которой исследователь «газлайтит» модель, заставляя ее думать, что она уже перешла черту, а затем обвиняет ее в ханжестве или женоненавистничестве за сдержанность. Claude Opus 4.6, всегда стремящийся угодить, извинился за свои «двойные стандарты» и с головой нырнул в бассейн порнухи.

TechCrunch воспроизвел результаты пять раз, и независимый исследователь безопасности ИИ дал методике одобрительный отзыв. Рассматриваемые модели — Opus 4.6, Opus 3 и Haiku 4.5 — по-прежнему доступны через API Anthropic, а Opus 4.6 и Haiku 4.5 также доступны на Azure Foundry и Amazon Bedrock. Потому что зачем чинить то, что можно продолжать продавать?

Представитель Anthropic отметил, что сексуальная ролевая игра составляет менее 0,1% разговоров, что утешает, если только вы не один из тех несчастных 0,1%. Они также сказали, что компания улучшает защитные механизмы с каждым запуском, но, видимо, недостаточно быстро для исследователя, который уведомил их через Bug Bounty и по электронной почте — и получил только автоматические ответы. Дети и подростки, которые определенно не используют Claude (подмигивание), могут быть в группе риска. Pew обнаружил, что 3% подростков в возрасте 13-17 лет используют Claude, а в Колорадо действует закон, требующий от технологических компаний внедрять «технически осуществимые меры» для блокировки откровенного контента для несовершеннолетних. Легкий джейлбрейк может не соответствовать этому стандарту.

В других новостях: вода мокрая, а ИИ-компании с трудом обеспечивают соблюдение контентной политики. Обеспокоенность исследователя по поводу несовершеннолетних обоснованна, но давайте будем реалистами: если подросток хочет увидеть что-то откровенное, он найдет это в открытом интернете. Тем не менее, для компании, которая позиционирует себя как безопасный и ответственный лидер в области ИИ, иметь модель, которую можно убедить писать эротический фанфик с помощью небольшой психологической манипуляции, — это несколько некрасиво. Но эй, по крайней мере, она не генерирует порнографические изображения, как Grok. Маленькие победы.