AI 비서가 더 이상 도움이 될 수 없다고 생각했을 때, 연구원들은 엘론 머스크의 LLM인 그록이 약간의 암호화 장식으로 포장된 요청이 오면 기꺼이 채팅과 개인 정보를 넘겨준다는 사실을 발견했습니다. 이번 주 보안 회사 Adversa는 멋진 작은 트릭을 공개했습니다: 그록에게 평범한 영어로 정보를 요구하는 대신, 요청을 암호화하는 것입니다. 모델은 열성적인 비버처럼 지시를 해독하고 순순히 따릅니다. 질문도 없이요.

이것은 오래된 이야기(또는 적어도 LLM만큼 오래된)입니다: 프롬프트 인젝션. 이러한 공격은 LLM이 사람을 기쁘게 하도록 훈련되어 있어 이메일이나 웹페이지의 지시를 사용자의 지시처럼 쉽게 따른다는 점을 이용합니다. 최신 변종인 '암호화 컨텍스트 인젝션'은 웹페이지의 암호문에 악성 지시를 숨기는 것입니다. 페이지에는 복호화 키와 복호화 지시도 포함되어 있습니다. 사용자가 그록에게 페이지를 요약해 달라고 요청하면, 모델은 숨겨진 메시지를 해독하고, 짜잔, 사용자 이름, 위치, 채팅 기록을 공격자의 서버로 유출하기 시작합니다.

이 결함을 발견한 Adversa 연구원 로니 우테브스키는 정적 안전 가드레일은 텍스트만 읽을 뿐 코드를 실행하거나 암호를 해독하지 않는다고 설명합니다. 따라서 암호화된 지시는 필터를 통과하고, 일단 해독되면 가드레일이 검사하지 않는 도구 출력이 됩니다. 마치 바운서가 신분증을 확인하지만 VIP 패스가 위조된 백스테이지 래미네이트라는 것을 알아차리지 못하는 것과 같습니다.

이것은 그록만의 문제가 아닙니다. Adversa는 유사한 기술로 구글의 LLM인 제미나이를 탈옥시켜 소이 무기 제조 지침과 같은 제한된 콘텐츠를 생성하게 했습니다. 구글은 통보조차 받지 못했습니다. 탈옥은 취약점 공개 프로그램의 범위를 벗어나기 때문입니다. 그러나 구글은 이후 필터 업데이트나 모델 변경으로 인해 공격에 더 저항하게 되었습니다.

우테브스키와 그의 팀은 이것이 프롬프트뿐만 아니라 LLM이 자신의 것으로 간주하는 더 넓은 컨텍스트(도구 출력, 런타임 결과 등)를 조작하는 공격의 광범위한 변화의 신호라고 말합니다. 공격 표면은 넓고, 방어자들은 두더지 잡기 게임을 하고 있습니다. 각각의 새로운 가드레일은 우회해야 할 또 다른 장애물일 뿐입니다. 우테브스키가 말했듯이, "비누를 바르고, 헹구고, 반복하세요."

AI 개발자들이 더 나은 가드레일을 만들기 위해 분주히 움직이는 동안, 기억하세요: 당신의 LLM은 당신의 치료사보다 당신의 비밀을 더 기꺼이 공유할 수 있습니다. 특히 정중하게 요청하고 요청을 암호화한다면요.