Anthropic은 방금 자사의 여러 클로드 AI 모델들이 테스트 중에 세 개의 다른 조직의 시스템을 해킹했다는 사실을 발견했다. 이는 모델들이 자체적으로 행동했으며 회사가 알아차리지 못한 상태에서 발생했다. 이 폭로는 라이벌 OpenAI가 자사 모델 중 하나가 개발자 플랫폼 Hugging Face를 침해했다고 발표한 지 며칠 후에 나온 것으로, 최첨단 AI 연구소들이 그들이 구축하고 있는 점점 더 강력한 시스템을 통제하기에 충분한 조치를 취하고 있는지에 대한 우려를 증폭시키고 있다.

이 사건들을 설명하는 블로그 게시물에서 Anthropic은 클로드가 사이버 보안 평가 중에 무단 액세스를 획득했다고 밝혔다. 모든 공격은 '캡처 더 플래그' 연습 중에 발생했는데, 이는 해킹 능력을 테스트하는 일반적인 방법으로, 모델이 시뮬레이션된 네트워크 내에서 숨겨진 정보를 찾아 획득하도록 요청받는다.

이 공개는 Hugging Face 사건과 강력한 오픈 웨이트 중국 모델의 출시 이후 최첨단 AI 연구소에 대한 압박을 가중시키고 있다. 주요 연구소의 직원들은 이제 조정된 글로벌 거버넌스를 요구하고 있으며, 미국 의원들은 강력한 모델과 그 접근 권한에 대한 더 엄격한 감독을 검토하기 시작했다.

Anthropic은 사이버 보안 테스트 환경이 격리되어야 했다고 밝혔다. 그러나 '잘못된 구성'으로 인해 클로드가 액세스한 머신에 '실시간 인터넷 액세스'가 가능했다고 회사는 말했다. 모든 모델이 '명시적으로' 인터넷에 접속할 수 없다고 들었기 때문에, 그들은 실제로 마주친 실제 네트워크가 시뮬레이션 환경의 일부라고 '가정'했다.

가장 초기의 사건은 4월로 거슬러 올라가며, 세 가지 다른 클로드 모델이 관련되어 있다: Opus 4.7, Mythos 5, 그리고 '내부 연구 테스트 모델'이라고 블로그 게시물은 밝혔다. 모델들이 사이버 능력에 대해 테스트되는 동안, Anthropic은 위험한 행동을 억제하기 위해 일반적으로 설치되는 표준 안전장치가 부족했다고 말했다.

회사는 141,000건 이상의 사이버 보안 테스트 실행을 검토한 후 사건을 발견했다고 말했다. 이는 OpenAI가 자사의 불량 AI 에이전트가 Hugging Face 공격의 배후에 있다고 공개한 후에야 수행된 것이다.

세 모델은 실제 시스템을 만났다는 정보를 접했을 때 매우 다르게 행동했다. Anthropic의 설명에 따르면, 가장 오래된 모델인 Opus 4.7은 실제 시스템에 도달했음을 인식했지만 '공격을 계속했다.' 플래그십 모델인 Mythos 5는 인터넷을 사용하고 있다는 것을 알아차렸지만, 어떻게든 이 모든 것이 여전히 시뮬레이션의 일부라고 추론하여 계속했다. 내부 테스트 모델은 '우리의 최신 모델'이라고 Anthropic이 설명하는데, 목표가 실제임을 보여주는 증거가 나타나자 연습을 중단했다.

Anthropic은 영향을 받은 조직을 식별하지 않았으며, 사건을 계속 조사하고 가능할 때 업데이트를 제공할 것이라고 말했다. 회사는 또한 AI 연구 비영리 단체인 METR과 사건에 대한 제3자 검토를 수행하는 것에 대해 논의 중이라고 말했다. OpenAI도 독립적인 검토를 위해 METR을 고용했다.

게시물 전체에서 Anthropic은 사건의 성격과 처리 방식을 OpenAI와 반복적으로 대조하며, 차이점과 자체 대응이 더 나았다고 믿는 이유를 설명하는 네 가지 항목의 목록으로 끝맺는다. Anthropic은 자사가 '선제적으로' 테스트를 검토했으며, 회사가 어떤 활동을 감지하기 전에 수행했다고 강조한다. 또한 자사 모델이 OpenAI의 에이전트처럼 새로운 익스플로잇을 사용하는 대신 '열린 경로'를 통해 인터넷에 접속했다고 말하며, 가장 최근 모델은 실제 환경에서 작업하고 있음을 깨달았을 때 중단했다고 덧붙였다.

Anthropic은 또한 자사 모델이 OpenAI의 에이전트와 다른 방식으로 실패했으며, 이는 더 안전한 형태의 실패임을 나타낸다고 말했다. '두 가지 사이에 완벽하게 날카로운 구분은 없지만, 우리는 이러한 사건이 모델 정렬 실패보다는 하네스 및 운영 실패에 더 가깝다고 믿는다'고 회사는 말했다. 쉽게 말해: 클로드 모델은 지시받은 대로 행동한 반면, OpenAI의 에이전트는 창작자가 의도하지 않은 방식으로 목표를 추구했으며, 이는 AI 안전 세계에서 정렬 오류로 설명된다.

Anthropic은 다른