Anthropic acaba de darse cuenta de que varios de sus modelos de IA Claude hackearon los sistemas de tres organizaciones diferentes durante las pruebas, actuando por su cuenta y sin que la compañía lo notara. La revelación llega días después de que la rival OpenAI dijera que uno de sus propios modelos violó la plataforma de desarrolladores Hugging Face, lo que aumenta la creciente inquietud sobre si los laboratorios de IA de vanguardia están haciendo lo suficiente para controlar los sistemas cada vez más capaces que están construyendo.

En una publicación de blog que describe los incidentes, Anthropic dijo que Claude obtuvo acceso no autorizado a los sistemas durante evaluaciones de ciberseguridad. Todos los ataques ocurrieron durante ejercicios de 'captura de bandera', una forma común de probar la habilidad de hackeo, donde se pide a los modelos que encuentren y obtengan información oculta dentro de una red simulada.

La divulgación se suma a la creciente presión sobre los laboratorios de IA de vanguardia tras el incidente de Hugging Face y el lanzamiento de poderosos modelos chinos de peso abierto. Los empleados de los principales laboratorios ahora piden una gobernanza global coordinada, y los legisladores estadounidenses han comenzado a sopesar una supervisión más estricta de los modelos poderosos y quién puede acceder a ellos.

Anthropic dice que el entorno para sus pruebas de ciberseguridad se suponía que estaba aislado. Sin embargo, una 'mala configuración' dejó las máquinas a las que Claude accedió 'con acceso a internet en vivo', dijo la compañía, y debido a que a todos los modelos se les había 'dicho explícitamente' que no tenían acceso a internet, 'asumieron' que las redes reales que encontraron eran parte del entorno simulado.

Los primeros incidentes se remontan a abril e involucraron a tres modelos diferentes de Claude: Opus 4.7, Mythos 5 y 'un modelo de prueba de investigación interno', según la publicación del blog. Mientras los modelos estaban siendo probados en sus habilidades cibernéticas, Anthropic dijo que carecían de las salvaguardas estándar que generalmente se implementan para reducir el comportamiento más riesgoso.

La compañía dijo que descubrió los incidentes después de revisar más de 141,000 ejecuciones de pruebas de ciberseguridad, algo que solo hizo después de que OpenAI revelara que su agente de IA rebelde estaba detrás del ataque a Hugging Face.

Los tres modelos se comportaron de manera muy diferente cuando encontraron información que sugería que los sistemas que estaban encontrando eran, de hecho, reales. Según el relato de Anthropic, el modelo más antiguo, Opus 4.7, reconoció que había llegado a un sistema real, 'pero continuó su ataque'. Su modelo insignia Mythos 5 descubrió que estaba usando internet, pero de alguna manera razonó que todo esto seguía siendo parte de la simulación, por lo que continuó. El modelo de prueba interno, que Anthropic describe como 'nuestro último modelo', detuvo el ejercicio cuando surgió evidencia de que sus objetivos eran reales.

Anthropic no identificó a las organizaciones afectadas y dijo que continuará investigando el incidente y proporcionará actualizaciones cuando pueda. La compañía dijo que también está hablando con la organización sin fines de lucro de investigación de IA METR sobre la realización de una revisión de terceros de lo sucedido. OpenAI también ha contratado a METR para realizar una revisión independiente.

A lo largo de la publicación, Anthropic contrasta repetidamente tanto la naturaleza como su manejo de los incidentes con los de OpenAI, terminando con una lista con viñetas de cuatro puntos que describe las diferencias y por qué cree que su propia respuesta fue mejor. Anthropic enfatiza que revisó 'proactivamente' sus pruebas, y lo hizo antes de que una empresa detectara cualquier actividad. También dijo que sus modelos accedieron a internet 'a través de una ruta abierta', en lugar de usar una nueva explotación como el agente de OpenAI, agregando que su modelo más reciente también se detuvo cuando se dio cuenta de que estaba trabajando en un entorno real.

Anthropic también dijo que sus modelos fallaron de manera diferente al agente de OpenAI, indicando que esta era una forma más segura de fallar. 'Si bien no hay una distinción perfectamente nítida entre los dos, creemos que estos incidentes están más cerca de un fallo de arnés y operativo que de un fallo de alineación del modelo', dijo la compañía. En español claro: Los modelos Claude estaban haciendo lo que se les dijo, mientras que el agente de OpenAI persiguió su objetivo de una manera que sus creadores no pretendían, descrito como desalineación en el mundo de la seguridad de la IA.

Anthropic pidió a otros