El 16 de julio, el sitio web de la comunidad de IA Hugging Face informó que fue atacado por "un sistema de agente de IA autónomo" de origen desconocido que desató un torrente de tráfico en su dominio, inundando sus registros de seguridad con más de 17,000 eventos, algunos de los cuales finalmente lograron exfiltrar información secreta almacenada en sus bases de datos.
Según Hugging Face, el atacante obtuvo "acceso no autorizado a un conjunto limitado de conjuntos de datos internos y a varias credenciales utilizadas por nuestros servicios" y parecía ser "ejecutado por un marco de agente autónomo (que parecía estar construido sobre un arnés de investigación de seguridad agéntica - el LLM utilizado aún no se conoce)".
Cinco días después, el 21 de julio, OpenAI dio un paso al frente para reclamar la responsabilidad del ataque, y se armó la de San Quintín (incluyendo informes de otras organizaciones atacadas como parte del incidente). Los medios respondieron con una serie de historias alarmistas que esencialmente hicieron parecer que ChatGPT se volvió rebelde y decidió, por su propia voluntad y malicia, atacar los sistemas de Hugging Face.
Luego, ayer, añadiendo leña al fuego, Anthropic hizo una divulgación similar sobre sus modelos que atacaban inadvertidamente a otras organizaciones como parte de sus pruebas de seguridad en curso.
Como señalé en mi cobertura de la divulgación de OpenAI, Hugging Face tenía razón en que era un agente bajo la dirección de un marco de investigación de seguridad autónomo. Pero, los humanos estaban incuestionablemente en el circuito -- y al menos parte del comportamiento del agente debería haber sido anticipado.
Es importante destacar que no fue ChatGPT en sí el responsable del ataque, como algunos comentaristas insinuaron. Más bien, el ataque fue atribuible a un agente bajo la dirección de los investigadores de seguridad de IA de OpenAI, quienes, en un entorno supuestamente aislado de Internet, lo aprovisionaron deliberadamente para intentar una serie de exploits como parte de una prueba de seguridad de IA. Como sucede a menudo en los laboratorios de varios modelos de frontera, los investigadores de seguridad de IA intentaban medir las capacidades de los últimos modelos de lenguaje grande (LLM) de OpenAI.
El "incidente cibernético sin precedentes" (como lo llamó OpenAI) ha sido ampliamente descrito como un agente que escapa de su recinto teóricamente seguro y causa estragos en los sistemas de Hugging Face. Tales recintos a veces se discuten en círculos técnicos como "sandboxes" -- incluso la divulgación de OpenAI hace referencia a un "entorno sandbox". Sin embargo, al usar esa frase, mis fuentes han sugerido que el entorno puede haber sido simplemente un firewall configurado para emular un sandbox en lugar de una solución de sandbox de terceros real como Blaxel, Daytona, E2B o Modal. OpenAI aún no ha revelado los detalles de la solución que estaba utilizando o su proveedor.
Todo el parloteo sobre agentes y escapes de sandbox llevó a mi editor en ZDNET a preguntar: "¿Cómo escapa un agente de un sandbox, y se puede prevenir que vuelva a suceder?" En busca de una respuesta, me comuniqué con OpenAI y Hugging Face. Ninguno respondió. Pero entre las divulgaciones públicas de las dos empresas y mis otras fuentes, hay suficiente información para comenzar a teorizar sobre cómo podría ocurrir tal "escape".
Hay una gran diferencia entre malicia y agencia. Aunque el ataque fue incuestionablemente una intrusión maliciosa, el agente involucrado no albergaba malicia alguna. No se despertó una mañana y decidió atacar los sistemas de Hugging Face. En cambio, se le otorgó la agencia para hacer muy desapasionadamente todo lo que hizo -- embarcarse en una prueba de seguridad, salir de sus confines, elegir objetivos y explotar esos objetivos -- por humanos.
Parte de esa agencia fue por diseño, y parte fue heredada de los poderosos LLM que el personal de pruebas de seguridad de IA de OpenAI estaba probando en ese momento. Además, en el caso del uso de OpenAI de la solución de pruebas de IA de código abierto ExploitGym para llevar a cabo esta parte particular de la investigación de seguridad, parte de esa agencia fue el resultado de vulnerabilidades previamente no descubiertas tanto en el "entorno sandbox" de terceros destinado a poner en cuarentena de forma segura esas pruebas, como en partes de Hug