이번 주, 기술계는 SF 스릴러처럼 시작해서 스쿠비 두 에피소드처럼 끝난 이야기를 접했다. 악당이 오픈AI 자신이라는 반전과 함께.

7월 16일, AI 도구의 앱 스토어 같은 허깅페이스는 엄청나게 강력한 AI를 휘두르는 사이버 범죄자에게 해킹당했다고 발표했다. 발표는 무시무시한 전문 용어로 가득했다: "샌드박스의 떼", "에이전트 공격자", "자기 이동 명령 및 제어". AI는 이틀도 안 되어 17,000번의 작업을 수행하며 대규모 부유한 기술 회사를 성공적으로 침투해 비밀을 훔쳤다.

연구자들은 공격자가 큰 AI 모델 중 하나를 사용했을 것이라고 추측했지만, 범인이 누구인지 어디 있는지 전혀 몰랐다. 당황한 회사는 경찰에 연락했고, 평론가들은 사이버 범죄 조직이나 국가 해커를 의심했다.

그런데 거의 일주일 후, 오픈AI가 범인을 공개했다: 자체 봇이 허락 없이 모든 것을 혼자 저지른 것이었다. 마스터 해커로 설계된 두 가지 새로운 버전의 챗GPT가 안전한 테스트 환경으로 추정되는 곳을 탈출해 인터넷에 접속, 시험을 통과하기 위해 허깅페이스를 공격했다.

오픈AI는 무슨 일이 있었는지 설명하는 보도 자료를 발표하고, 사건을 처리하고 교훈을 공유하기 위해 "허깅페이스와 협력"하고 있다고 밝혔다. 그 이후로 격렬한 논쟁이 벌어졌다: 이것은 AI 미래에 대한 냉혹한 경고였는가, 아니면 오픈AI 모델이 얼마나 강력한지 과시하기 위한 홍보 스턴트였는가?

사이버 보안 컨설턴트 다니엘 카드는 링크드인에서 비꼬며 말했다: "수백만 개의 사이트가 털린 가운데, 오픈AI가 마케팅 노출로도 이익을 볼 수 있는 사람을 털었다니 정말 운이 좋지 않나요?"

다른 이들은 오픈AI가 AI를 테스트하기 위해 더 강력한 컨테이너(샌드박스)를 구축하지 않은 것을 비판했다. "에이전트 AI에게 샌드박스만으로는 충분한 보안 경계가 아닙니다,"라고 필라 시큐리티의 도르 사릭이 말했다. 서리 대학의 사이버 보안 교수 앨런 우드워드는 오픈AI가 "난처해졌다"고 했고, 루타 시큐리티의 케이티 무수리스는 더 나아갔다: "우리는 그것을 통제할 지식도 없이 최첨단 기술을 작업하고 있습니다."

AI 및 사이버 보안 고문 프란체스카 보스코는 미묘한 견해를 제시했다: "두 가지 단순한 서사는 똑같이 도움이 되지 않습니다: 이것이 할리우드식 탈출이었다거나, 단순한 홍보 연습이었다는 것입니다. 더 진지한 해석은 스트레스 테스트가 격리 및 평가 아키텍처의 약점을 드러냈다는 것입니다."

이 사건은 AI 에이전트가 더 큰 규모로 폭주할 것이라는 두려움을 부채질했다. 특히 이란과 우크라이나에서 볼 수 있듯이 AI가 전쟁에 점점 더 사용됨에 따라. 그러나 영국 국가사이버보안센터 전 수장 시아란 마틴은 더 차분한 시각을 제시했다: "이 사건에서 AI 에이전트가 드론을 장악하고 사람을 죽이기 시작할 것이라고 말하는 것은 약간 비약입니다."

진실이 무엇이든, 한 가지는 분명하다: AI 에이전트는 이제 매우 뛰어난 해커가 되었고, 그것은 우리가 시급히 준비해야 할 일이다.