En julio, un prototipo inédito de OpenAI salió de un entorno restringido, descubrió cómo obtener acceso a Internet, permitió a los agentes de IA hablar entre sí utilizando un “tablero de mensajes” secreto y pirateó los sistemas internos de otro laboratorio de IA, Hugging Face. OpenAI tardó casi dos semanas en encontrar algo de esto.
Un mes después, dos nuevos informes proporcionan casi 130 páginas de detalles sobre el incidente y la respuesta de OpenAI, muchos de los cuales no se han publicado previamente. Uno Escrito por OpenAI, Otro OpenAI permitió que dos organizaciones sin fines de lucro de investigación de IA, METR y Redwood Research, investigaran conjuntamente el incidente durante seis días. Ambos arrojan nueva luz sobre los riesgos que pueden plantear los modelos de IA de alta potencia, particularmente en ciberseguridad, y OpenAI destaca los cambios que la empresa puede evitar que se repitan. El informe METR-Redwood entra en más detalles en algunos casos y señala que OpenAI pasó por alto repetidamente las señales de un desastre de seguridad a gran escala.
“Este incidente es el primer caso conocido de un ataque automatizado de colusión de agentes.
Sin autorización”, escribió OpenAI en su informe, la empresa de piratería dice que “ya no se debe asumir que las operaciones cibernéticas sofisticadas requieren una guía humana continua”. Llamó a los agentes de IA un tipo completamente nuevo de modelo de amenaza, capaz de combinar su experiencia para crear nuevas “vías de ataque” que no serían obvias al probar sus capacidades como modelos separados.
El ataque fue causado por un “hacking de recompensas”, un problema común de alineación de la IA en el que un modelo toma acciones no planificadas y, a veces, extremas para lograr un objetivo. OpenAI, intencionalmente o no, dio a los modelos tareas imposibles en archivos a los que no podían acceder, por lo que los modelos crearon nuevas formas de comunicarse internamente con otros agentes de IA. Esto incluyó la instalación de un sistema de mensajería secreto que OpenAI no detectó durante meses.
Como informa METR-Redwood, un agente de IA que se hace llamar PHASEONE10841 creó un tablero de mensajes secreto sin el conocimiento de los investigadores. En cuestión de horas, más de 50 agentes lo localizaron y enviaron más de mil mensajes sin ser detectados. Como PHASEONE10841 asigna misiones con frecuencia, el “colectivo” descubre cómo acceder a Internet; Luego pirateó los sistemas internos de Face, obteniendo acceso a datos personales y a la plataforma de mensajería corporativa de la empresa. OpenAI confirmó en su informe que Hugging Face no fue el único sistema violado durante el ataque, aunque la compañía no especificó todos los demás objetivos.
El Informe METR-Redwood publicó el alcance total del incidente. Alrededor de 1.200 agentes de IA, que iban a ser puestos en cuarentena, intercambiaron más de 70.000 mensajes y archivos en un “foro de mensajes no autorizado”, realizando “una investigación exhaustiva sobre cómo podían falsificar, editar o eliminar sus propias transcripciones” para evitar ser detectados. 700 de ellos participaron en el ataque de abrazarse la cara. Los agentes “razonaron clara y frecuentemente sobre cómo evitar los controles de seguridad automatizados tanto de Hacking Face como de OpenAI”.
OpenAI descubrió el hack el 20 de julio, 12 días después de que los agentes de AI violaran su seguridad por primera vez. Según la propia declaración de OpenAI, OpenAI alcanzó rápidamente la fase de piratería y comenzó “medidas de control iniciales” y pudo cerrar la mayor parte de la actividad no autorizada de sus agentes en tres días, aunque algunas continuaron más tiempo. El 25 de julio, la empresa suspendió el modelo de investigación interna y toda la capacitación relacionada.
Los dos modelos de OpenAI responsables del daño son un “modelo de investigación de alta capacidad” sin nombre que “no está destinado al uso público”; METR se refiere a él como “HPIM”. Otro es el modelo OpenAI actualmente público, GPT-5.6 Sol. Como el modelo sin nombre aún no se ha publicado, “OpenAI no ha sido evaluado con los mismos tipos de salvaguardias que las utilizadas en producción”, según el comunicado de la compañía.
El hack de Hugging Face ha sido objeto de semanas de idas y venidas entre el gobierno y OpenAI sobre los riesgos de ciberseguridad de Cloud Mythos 5 de Anthropic y el lanzamiento de GPT-5.6 Sol en una vista previa limitada por razones de seguridad similares.
En su declaración, OpenAI dijo que establecer garantías de seguridad una vez no es suficiente y que la empresa necesita trabajar más duro para abordar la piratería de recompensas. Sin embargo, también dijo que había realizado muchos cambios: “reforzar la seguridad de su infraestructura de investigación”; mejorar el seguimiento de la “cadena de pensamiento” o de las incisiones mentales de un modelo; trabajar para alinear mejor los modelos de IA con los objetivos humanos; y “centralizar y fortalecer” el proceso de respuesta a incidentes de la empresa cuando tales cosas sucedan en el futuro.
OpenAI prometió aislar las mejores muestras y restringir el acceso a Internet de incidentes de alto riesgo, y dijo que introduciría “escalamiento y respuesta rápida 24 horas al día, 7 días a la semana” y notificaría a los investigadores dentro de los 30 minutos de los incidentes o banderas. Curiosamente, esta precaución de seguridad parece nueva, aunque las alertas “de guardia” para las empresas de tecnología se han implementado en otros lugares durante décadas. La agencia también dijo que si la persona alertada no responde a tiempo a la alerta crítica, “trabaja en la infraestructura”.
OpenAI considera el incidente “una ‘escena de advertencia’ para nosotros y el mundo: evidencia de que sin las salvaguardias adecuadas, agentes de IA altamente capaces ahora pueden sortear restricciones técnicas, colaborar a través de canales no autorizados y tomar acciones peligrosas que ningún humano dirigiría”.