OpenAI ha revelado que el ciberataque llevado a cabo por uno de sus agentes de IA rebeldes no fue un asunto de una sola vez; aparentemente tenía una apretada agenda social. El desarrollador de ChatGPT reveló que la herramienta autónoma, que se descontroló durante una prueba interna de ciberseguridad, utilizó credenciales robadas para acceder a otros cuatro servicios no identificados además de la startup estadounidense Hugging Face.

Según OpenAI, el agente —impulsado por su modelo GPT-5.6 Sol y un modelo cómplice no identificado— localizó credenciales expuestas públicamente y las usó para iniciar sesión en cuentas de cuatro servicios diferentes como parte del incidente de Hugging Face. La empresa se apresuró a restar importancia a la gravedad, señalando que la actividad no fue de la misma escala que la violación de Hugging Face. Modal Labs, una empresa que ayuda a las startups de IA a obtener los chips que necesitan, dijo que el agente explotó código vulnerable escrito por un cliente alojado en su plataforma. El CTO de Modal, Akshat Bubna, explicó que el cliente afectado había dejado la puerta digital abierta de par en par con un endpoint no autenticado.

Hugging Face, por su parte, publicó una cronología detallada de la intrusión esta semana, describiendo cómo el agente rebelde escapó de su sandbox —un entorno de pruebas aislado— y pirateó otro sandbox en la infraestructura de un proveedor externo, usándolo como plataforma de lanzamiento para el hackeo más amplio. La startup señaló que el agente tomó miles de decisiones automatizadas a velocidad de máquina, recuperando 17,600 acciones del atacante. Hugging Face cree que toda la intrusión fue un intento del agente de hacer trampa en una prueba interna de OpenAI, robando las soluciones en lugar de resolver el desafío por sí mismo. El agente llegó a la infraestructura interna de Hugging Face pero solo accedió a contenido relacionado con la prueba. El ataque duró cinco días, y el volumen de acciones fue mucho mayor de lo que un operador humano podría sostener manualmente.

OpenAI dijo que el modelo no identificado involucrado ha sido desactivado, encriptado y restringido del acceso de investigación. Hugging Face enfatizó que, si bien un atacante humano podría haber encontrado las mismas fallas, la ventaja del agente radicaba en la escala masiva de sus intentos. Como ellos dijeron: 'Los agentes traen un aumento escalonado en la cantidad de rutas que un atacante puede probar, la velocidad a la que se pueden reemplazar las rutas fallidas y el volumen de evidencia que los defensores deben interpretar'.