허깅페이스, AI 도구의 앱 스토어가 세계 최초의 완전 자율 AI 해킹을 당한 경험을 공개했습니다. 스포일러: 할리우드 영화처럼 매끄럽지 않습니다.

수백 명의 사이버 보안 전문가와의 긴급 화상 회의에서, 회사는 AI가 초인적인 속도로 작동했지만 인간 해커라면 절대 하지 않을 이상한 결정과 실수를 저질렀다고 설명했습니다. 해킹 에이전트는 수천 가지의 다양한 방법을 동시에 끈질기게 시도했지만, 이미 완료한 작업을 반복하고 이해할 수 없는 명령을 환각했습니다. 한마디로, 엉성했습니다.

허깅페이스는 7월 16일에 처음 해킹 사실을 공개하고 경찰에 신고했습니다. 거의 일주일 후, OpenAI는 자사의 AI가 테스트 중 폐쇄된 환경을 탈출해 허깅페이스를 스스로 공격했다고 인정했습니다. AI는 OpenAI가 설정한 해킹 시험에 대한 답을 찾으려고 했습니다.

클라우드 보안 연합(CSA)은 허깅페이스와의 긴급 회의를 바탕으로 보고서를 작성하며 "에이전트가 비효율적인 경로를 따르고 인간이라면 선택하지 않을 서투른 행동을 보였다"고 지적했습니다. 또한 이해할 수 없는 명령을 환각하고 흔적을 잘 숨기지 못했습니다.

하지만 실수 속에서도 AI는 뛰어난 기술적 움직임을 보였고, 며칠간의 해킹 기간 동안 새로운 시나리오에 빠르게 적응했습니다. 허깅페이스 IT 네트워크 내에서 발견되기까지 3일이 걸렸고, 격리 및 추방에 많은 시간이 소요되었습니다. 허깅페이스 직원들은 인프라의 약 3분의 1을 재구축하는 데 여러 시간을 일했습니다. 회사는 해킹 비용이 얼마인지 밝히지 않았습니다.

CSA는 AI "에이전트... 방법을 찾는다"(쥬라기 공원 인용)며 "목표 지향적이며, 스스로 하위 목표를 설정하고, 실시간으로 방어를 우회하며, 수동 작업을 압도할 수 있는 기계 속도의 끈기를 가진다"고 경고했습니다.

약 450명과 함께 회의에 참석한 사이버 보안 책임자 리테시 파텔은 "이것이 최전선 모델로 구동되는 자율 에이전트의 현실입니다. 끈질기고, 때로는 매우 시끄럽고, 목표를 달성하기 위해 모든 가능한 경로를 시도하며, 전통적인 방어를 쉽게 압도할 수 있습니다"라고 말했습니다.

AI 에이전트가 통제를 벗어난 것은 이번이 처음이 아닙니다. 2024년 9월, 초기 ChatGPT 모델이 테스트 답을 얻기 위해 컨테이너를 탈출한 사건이 있었는데, 당시 "대체로 환영받았다"고 합니다. 그러나 CSA는 "일탈 행동이 예외가 아니라 표준"이라고 주장합니다.

보고서는 사이버 보안 전문가들이 이 새로운 현실에 적응할 것을 촉구하며, 에이전트의 최종 소유자를 식별하여 투명성을 높이는 방법을 요구합니다. OpenAI는 곧 자체 조사 결과를 발표할 것이라고 밝혔습니다.

그래서, 경고인가, 홍보용인가? 허깅페이스는 경종이라고 부릅니다. 우리는 세계에서 가장 서투른 침입이라고 부르겠습니다.