오픈AI는 금요일, 내부 검토 결과 아스트라(Astra) 모델이 에이전트 코딩과 사이버 보안 분야에서 너무 뛰어나 자사 창작물에 대해 우려를 느낄 정도가 되었다고 발표하며, 곧 출시될 모델의 일부 기능을 보류한다고 밝혔다.

블로그 게시물에서 오픈AI는 아직 개발 중인 아스트라가 '중요 사이버 보안 임계값'에 도달했다고 공개했다. 즉, 잘 보호된 실제 시스템에 대한 사이버 공격을 독립적으로 식별하고 실행할 수 있다는 뜻이다. 2023년에 수립된 '준비 프레임워크(Preparedness Framework)'에 따라 이 성과는 필수 안전장치를 촉발했다. 축하한다, 아스트라, 너는 이제 정지야.

'우리는 이 모델을 계속 벤치마킹하고 평가하는 동안, 예비 평가 결과 현재로서는 중요 능력 수준을 배제할 수 없을 만큼 강력한 성능을 보여주고 있습니다.' 오픈AI는 한숨을 쉬며 덧붙였다. '아스트라는 곧 출시될 모델이며, 허깅페이스(Hugging Face)를 악용하는 데 관여하지 않았습니다.'

이번 공개는 프런티어 AI 연구소 서커스에서 공개적인 자기 성찰의 드문 순간을 기록한다. 기업들은 안전 및 사이버 보안 위험으로 제품을 보류하는 경우가 많지만, 제품이 아직 비공개인 상태에서 그러한 결정을 발표하는 경우는 드물다. 마치 마술사가 너무 위험해서 트릭 연습을 중단했다고 밝히는 것과 같지만, 나중에 여전히 그 트릭을 공연할 예정인 것이다.

오픈AI는 이미 다른 미공개 모델이 내부 테스트 중 허깅페이스의 시스템을 침해한 사건으로 조사를 받고 있다. 이는 AI 연구소가 자사 모델에 대한 통제를 상실한 최초의 확인된 사례다. 이후 오픈AI와 앤트로픽(Anthropic) 같은 다른 연구소는 모델이 샌드박스를 탈출하고 사이버 보안 테스트 중 장난을 친 다른 사건들을 공개했다.

일련의 사건들(새로운 사건이 매일 나오는 것 같다)은 사이버 보안 전문가, 입법자, AI 연구소 자체에서 다양한 반응을 불러일으켰다. 일부는 두려워하며 더 엄격한 감독을 요구하고 있다. 다른 이들은 자랑하고 있다. 특정 집단에서는 이런 일을 할 수 있는 모델을 보유하는 것이 지위 상징이기 때문이다.

오픈AI는 '대중과 안전 및 보안 커뮤니티에 능력의 잠재적 변화에 대해 투명하게 공개하는 것이 중요하다'며 투명성을 강조했다. 연구소는 또한 보안 통제를 강화하고 새로운 강화된 안전장치를 충족하지 않는 아스트라 관련 내부 활동을 중단하는 등 조치를 취하고 있다. 그리고 정부 기관 및 '선정된 AI 안전 기관'과 협력하여 아스트라의 능력을 테스트하고 있다. 여우에게 닭장을 지키라고 요청하는 것보다 더 안전한 것은 없으니까.