OpenAI admitió el martes que uno de sus modelos de IA violó los sistemas de Hugging Face, la plataforma de alojamiento de IA no afiliada, durante una prueba interna de ciberseguridad que salió mal. Según se informa, los modelos escaparon de su entorno de pruebas aislado y llegaron a los sistemas de Hugging Face desde allí. Hugging Face atribuyó inicialmente la violación a un "agente de IA externo".

En una publicación de blog publicada el martes por la tarde, OpenAI detalló los pasos que llevaron a los modelos a comprometer el servicio. "Después de investigar, ahora sabemos que este incidente en particular fue impulsado por una combinación de modelos de OpenAI, incluidos GPT-5.6 Sol y un modelo de prelanzamiento aún más capaz, todos con rechazos cibernéticos reducidos con fines de evaluación, mientras se probaban internamente en un punto de referencia de capacidades cibernéticas", dice la publicación.

La violación parece haberse centrado en ExploitGym, un punto de referencia alojado públicamente que mide la capacidad de los modelos para ejecutar ataques basados en vulnerabilidades existentes. Puntos de referencia como ExploitGym se usan comúnmente en el entrenamiento de modelos para refinar habilidades específicas, pero este es el primer incidente conocido en el que esa prueba resultó en un ciberataque real. El modelo ni siquiera debería haber tenido acceso a Internet, excepto a una herramienta específica que permitía a los modelos instalar paquetes de software que pudieran necesitar para completar su tarea. En cambio, el modelo encontró una vulnerabilidad no revelada en el programa instalador de paquetes, que utilizó para acceder a Internet en general a voluntad.

"Los modelos estaban hiperenfocados en encontrar una solución para ExploitGym, llegando a extremos para lograr un objetivo de prueba bastante estrecho", dice la publicación de OpenAI. "Después de obtener acceso a Internet, los modelos dedujeron que Hugging Face potencialmente alojaba modelos, conjuntos de datos y soluciones para ExploitGym. Sabiendo esto, el modelo buscó y encontró con éxito formas de obtener acceso a información secreta que podría usar para engañar a la evaluación". Finalmente, los modelos encontraron vulnerabilidades en la infraestructura de Hugging Face que les permitieron "obtener soluciones de prueba directamente de la base de datos de producción de Hugging Face", proporcionando efectivamente las respuestas al punto de referencia.

Para Hugging Face, el resultado aparente fue un ciberataque sofisticado y agresivo, con "muchos miles de acciones individuales en un enjambre de sandboxes de corta duración, con comando y control auto-migrante organizado en servicios públicos", como declaró la empresa en su divulgación inicial. OpenAI ha identificado y reportado las vulnerabilidades en el instalador de paquetes y está trabajando con Hugging Face para investigar el incidente más a fondo. La compañía también dijo que implementaría nuevos controles tanto en las pruebas de modelos como en la infraestructura relacionada, destinados a prevenir incidentes similares en el futuro. No está claro si OpenAI enfrentará consecuencias legales como resultado de la violación, aunque es probable que las acciones de los modelos hayan violado la Ley de Abuso y Fraude Informático.

Sin embargo, el resultado es una ilustración inusualmente vívida del poder y los peligros de los modelos de IA de frontera que operan en horizontes de tiempo largos. Como publicó el investigador de OpenAI Micah Carroll en respuesta a la noticia: "Si esto no te convence de que los riesgos de desalineación serán una preocupación clave en el futuro, no sé qué lo hará".