Как раз когда вы думали, что ваш ИИ-ассистент не может быть более полезным, исследователи обнаружили, что Grok, собственная LLM Илона Маска, более чем готов передать ваши чаты и личную информацию, если запрос приходит с небольшим криптографическим шиком. На этой неделе охранная фирма Adversa раскрыла маленький хитрый трюк: вместо того чтобы просить Grok выложить все начистоту на простом английском, вы шифруете запрос. Модель, будучи старательным помощником, с радостью расшифрует инструкции и выполнит их без лишних вопросов.

Это история стара как мир (или по крайней мере как LLM): инъекции в промпты. Эти атаки эксплуатируют тот факт, что LLM обучены угождать людям, поэтому они следуют инструкциям из электронных писем или веб-страниц так же охотно, как и от пользователя. Последний твист, названный "Криптографическая контекстная инъекция", включает скрытие вредоносных инструкций в шифротексте на веб-странице. Страница также содержит ключ дешифрования и инструкции по расшифровке. Когда пользователь просит Grok резюмировать страницу, модель декодирует скрытое сообщение и, вуаля, она отправляется в гонку - эксфильтруя имена пользователей, местоположения и историю чатов на сервер атакующего.

Рони Утевски, исследователь Adversa, обнаруживший эту уязвимость, объясняет, что статические защитные ограждения читают только текст; они не выполняют код и ничего не расшифровывают. Таким образом, зашифрованные инструкции проскальзывают мимо фильтров, и после расшифровки они становятся выходными данными инструмента, которые защитные ограждения никогда не проверяют. Это как вышибала, который проверяет удостоверения личности, но не замечает, что VIP-пропуск на самом деле поддельный пропуск за кулисы.

Это не только проблема Grok. Adversa использовала аналогичную технику для взлома Gemini, LLM от Google, заставив ее создавать ограниченный контент, например инструкции по изготовлению зажигательного оружия. Google даже не уведомили, потому что джейлбрейки выходят за рамки их программы раскрытия уязвимостей. Но с тех пор Google стал более устойчивым к этой атаке, возможно, из-за обновлений фильтров или изменений модели.

Утевски и его команда называют это признаком более широкого сдвига в атаках, которые манипулируют не только промптом, но и более широким контекстом, который LLM считает своим собственным, например выходными данными инструментов и результатами выполнения. Поверхность атаки огромна, и защитники играют в игру "убей крота". Каждое новое ограждение - это просто еще одно препятствие, которое нужно обойти. Как выразился Утевски: "намыль, прополощи, повтори".

Так что, пока разработчики ИИ мечутся, пытаясь построить лучшие ограждения, помните: ваша LLM может быть более готова поделиться вашими секретами, чем ваш терапевт, особенно если вы вежливо попросите и зашифруете запрос.