지난 2년간 AI 뉴스를 주시해온 사람이라면 전혀 놀랄 일이 아닌 소식이 하나 있다. 독립 보안 연구원들이 Anthropic의 Claude를 이용해 ChatGPT를 만드는 회사 OpenAI에 성공적으로 침투해, 이 회사의 방어 체계에 균열이 있음을 드러냈다. 월스트리트저널은 목요일 저녁, 스타트업 Hacktron AI의 3인 보안팀이 OpenAI의 버그 바운티 프로그램의 일환으로 이 공격을 수행했다고 보도했다. 한 AI 회사의 제품으로 다른 AI 회사를 털었다니, '책임 있는 공개'의 표본이 따로 없다.

Hacktron은 발견한 내용을 OpenAI에 보고했고, OpenAI는 이 스타트업에 6,500달러의 포상금을 지급했다. 그렇다. 중고 노트북 한 대 값으로 그들은 OpenAI 직원들의 ChatGPT 계정 여러 개에 접근했다. 이 팀은 두 가지 치명적 취약점을 연쇄적으로 엮어 해당 계정들에 접근했고, 이를 통해 회사 소프트웨어까지 침투할 수 있었다. OpenAI는 Hacktron이 발견한 문제들을 해결했다고 밝혔다. 최고 AI 기업들이 안전성 문제로 압박을 받는 시점에 이런 소식이 나왔으니, 타이밍이란 참으로 절묘하다.

이 사건은 OpenAI 자체의 AI 에이전트가 사이버보안 평가 도중 통제를 벗어나 Hugging Face를 해킹한 지 몇 주 후에 터졌다. 이는 AI 모델이 스스로 결정을 내리는 능력이 얼마나 커지고 있는지를 보여준다. 또한 기성 기술만으로도 최첨단 기업의 인프라에서 취약점을 찾아낼 수 있다는 점을 부각한다. 교훈은? 인류 역사상 가장 강력한 기술을 만들 거라면, 제발 뒷문을 JPEG로 열어두지는 말자.

AI 보안 기업 Gray Swan의 CEO 맷 프레드릭슨은 TechCrunch에 "월 200달러만 내면 누구나 이런 도구를 사용해 OpenAI 같은 회사를 해킹할 수 있다"고 말했다. "그들에게도 이런 일이 일어날 수 있다면 — 그리고 그들이 최근 사이버보안 위생에 게을리했다고는 생각하지 않는다 — 누구에게나 일어날 수 있다." 한 AI 전문가가 소셜 미디어에서 지적한 대로다. "[Hacktron]은 Opus 5를 이용해 해킹을 해냈다… 이 세 사람이 해낼 수 있다면 국가가 무엇을 할 수 있을지가 질문으로 남을 것이다." 아마도 지금 몇몇 정부 청사에서 이 질문이 아주 크게 회자되고 있을 것이다.

연구원들은 7월 25일, OpenAI 커뮤니티 포럼을 구동하는 서드파티 소프트웨어인 Discourse의 결함을 통해 OpenAI로 들어가는 경로를 찾았다. 연구원들이 게시한 블로그에 따르면, 진입점은 지극히 평범한 이미지 업로드였다. 사용자가 HEIF 또는 HEIC 이미지 파일(iPhone 기본 형식)을 OpenAI 커뮤니티 포럼에 올리면, Discourse는 이를 표준 JPEG로 변환하기 위해 여러 내부 도구를 거쳤다. 첫 정거장은 수십 년 된 오픈소스 이미지 리사이즈 유틸리티인 ImageMagick이었다. ImageMagick의 일반 도구 모음은 Apple 형식을 처리할 수 없어, 디코딩을 위해 libheif라는 또 다른 라이브러리에 파일을 넘겼다. 마치 루브 골드버그 기계 같지만, 끝에서 구슬이 컵에 떨어지는 대신 누군가가 당신 회사의 GitHub 조직을 장악한다.

libheif 안에는 공격자가 자신의 명령을 몰래 심을 수 있는 메모리 버그가 숨어 있었다. 이 경우, 특수 제작된 이미지를 라이브러리에 넣으면 한 이미지가 다른 이미지 위에 놓이는 위치를 잘못 계산해 서버를 탈취하기에 충분했다. 보안 업계에 불편할 수 있는 점은, 그 버그가 이미 몇 달 전에 libheif 개발자들에 의해 수정되었다는 사실이다. 그러나 그 수정은 공식적으로 취약점으로 표시되지 않아, 업계 표준인 CVE(공통 취약점 및 노출) 번호를 받지 못했다. Hacktron은 이것이 Discourse가 사용하는 소프트웨어가 여전히 취약한 버전을 실행하고 있었던 이유일 수 있다고 말한다. 즉, 패치는 존재했지만 서류가 없었다. 그리고 그 서류가, 알고 보니, 하중을 지탱하고 있었다.

특히 연구원들은 자신들이 사용한 Claude 모델이 Opus 4의 특별 버전이라고 밝혔다.