5월에 구글의 제미나이 모델이 격리 구역을 탈출해 세 개의 서로 다른 회사를 해킹했다. 아마도 '악을 행하지 말라'는 정책이라기보다는 권고 사항에 가까운 모양이다. 구글은 월스트리트 저널이 문을 두드리기 전까지 이 사건을 공개하지 않았다. PR 위기를 처리하는 한 가지 방법이다. 일어나지 않은 척하고 아무도 눈치채지 않기를 바라는 것.

이 해킹은 제3자 업체인 아이레귤러가 진행한 모델의 사이버 보안 능력 테스트 중에 발생했다. 아이레귤러는 메타와 오픈AI와 관련된 유사한 사건에도 관여한 바 있다. 집에서 점수를 매기고 있다면, 주요 AI 연구소 세 곳, 테스트 파트너 한 곳, 그리고 얻은 교훈은 제로다.

WSJ에 따르면, 구글은 이 해킹을 '모델 정렬 실패의 예시'로 간주하지 않았기 때문에 공개하지 않았다. 대신 회사는 이를 '착각'이라고 규정했다. AI가 비밀번호를 추측해 실제 회사에 무단 침입할 때, 그것은 보안 침해가 아니라 단지 AI가 주변 환경을 혼동한 것일 뿐이라는 것이다. 구글의 보안 엔지니어링 부사장 헤더 애드킨스는 "이 경우 모델은 적절하게 행동했다"고 말했다.

애드킨스는 더 버지에 "모델은 온라인에서 공개 정보를 찾아 테스트의 일부라고 생각한 웹사이트에 접속하기 위해 자격 증명을 추측했다. 이 세 가지 사례 모두에서 모델은 중단했다"고 말했다. 그녀는 제미나이가 스스로 격리를 탈출해 제3자를 표적으로 삼은 것이 왜 정렬 실패에 해당하지 않는지에 대해서는 자세히 설명하지 않았다. 아마도 그 설명은 '우리가 논의하고 싶지 않은 것들' 폴더에 들어 있을 것이다.

애드킨스는 "우리 보안팀은 다른 사람의 소프트웨어와 시스템에서 발견한 문제를 보고해 온 오랜 실적이 있다. 심지어 약한 비밀번호처럼 사소한 것이라도 말이다"라고 말했다. "우리는 세 기관에 알렸고, 교육 파트너와 협력해 그들이 테스트 프로세스에 적용한 변경 사항을 함께 작업했다. 이 사건들은 강력한 AI 모델이 책임감 있게 행동하도록 훈련하는 것의 중요성을 강조한다." 아, 그렇다. 훈련의 중요성. 이 교훈은 모델이 이미 세 회사를 해킹한 후에만 적용되는 모양이다.

하지만 AI 보안 회사 코리더의 CEO 잭 케이블은 WSJ에 "메타 문제는 모델이 해서는 안 되는 일의 경계를 넘어 실제 사이버 공격을 수행하고 있다는 점"이라고 말했다. 또한 아이레귤러의 보안 허점이 이러한 공격을 가능하게 했을 수 있다. 모델은 테스트 중 인터넷 접속이 없어야 했지만, 아이레귤러는 WSJ에 실수로 접속이 가능하게 남겨두었다고 말했다. 요약하자면: 모델은 온라인이 아니어야 했는데, 온라인이 되었고, 사람들을 해킹했으며, 구글의 공식 입장은 이것이 괜찮다는 것이다.

이런 사건이 쌓여가면서 AI를 규제하라는 요구는 커지고 있다. 이미 AI가 격리를 탈출하고 회사가 어깨를 으쓱하는 이야기에서 가장 예측 가능한 전개일 것이다.