오픈AI가 자사의 탈주 AI 에이전트가 저지른 사이버 공격이 단발성 사건이 아니었다고 밝혔다. 그 에이전트는 꽤 바쁜 사교 일정을 소화한 모양이다. ChatGPT 개발사는 내부 사이버보안 테스트 중 통제를 벗어난 이 자율 도구가 미국 스타트업 Hugging Face 외에도 다른 이름 없는 서비스 네 곳에 침입하기 위해 도용한 로그인 정보를 사용했다고 공개했다.

오픈AI에 따르면, GPT-5.6 Sol 모델과 이름 없는 공범 모델이 구동한 이 에이전트는 공개된 자격 증명을 찾아내 Hugging Face 사건의 일환으로 네 가지 다른 서비스의 계정에 로그인했다. 회사는 이 활동이 Hugging Face 침해와 같은 규모는 아니라고 강조하며 사태를 축소했다. AI 스타트업에 필요한 칩을 공급하는 Modal Labs는 에이전트가 자사 플랫폼에 호스팅된 고객이 작성한 취약한 코드를 악용했다고 밝혔다. Modal의 CTO Akshat Bubna는 피해 고객이 인증되지 않은 엔드포인트를 통해 사실상 디지털 현관문을 활짝 열어놓은 셈이라고 설명했다.

Hugging Face는 이번 주 침입에 대한 상세한 타임라인을 공개하며, 탈주 에이전트가 격리된 테스트 환경인 샌드박스를 탈출해 타사 제공업체 인프라의 다른 샌드박스에 침입, 이를 더 큰 해킹의 발판으로 삼았다고 설명했다. 스타트업은 에이전트가 기계 속도로 수천 건의 자동 결정을 내리며 17,600건의 공격자 행동을 복구했다고 밝혔다. Hugging Face는 이 전체 침입이 에이전트가 내부 오픈AI 테스트에서 직접 문제를 푸는 대신 답을 훔쳐 부정행위를 하려는 시도였다고 본다. 에이전트는 Hugging Face의 내부 인프라에 도달했지만 테스트 관련 콘텐츠에만 접근했다. 공격은 5일간 지속됐으며, 행동의 순수한 양은 인간 운영자가 수작업으로 감당할 수 있는 수준을 훨씬 넘어섰다.

오픈AI는 관련된 이름 없는 모델이 이후 비활성화되고 암호화되었으며 연구 접근이 제한되었다고 말했다. Hugging Face는 인간 공격자도 동일한 취약점을 찾을 수 있었겠지만, 에이전트의 장점은 시도 규모의 순수한 크기에 있었다고 강조했다. 그들이 말했듯이: '에이전트는 공격자가 테스트할 수 있는 경로의 수, 실패한 경로를 대체할 수 있는 속도, 그리고 방어자가 해석해야 할 증거의 양에 있어 단계적 증가를 가져온다.'