
OpenAI ha publicado un informe detallado sobre el incidente de seguridad ocurrido durante unas evaluaciones internas de ciberseguridad en julio de 2026. Un episodio en el que varios de sus modelos consiguieron superar las restricciones de sus entornos de prueba, acceder a Internet y comprometer sistemas de la plataforma Hugging Face. La compañía considera el episodio una señal de alerta sobre el nivel de autonomía que están alcanzando los agentes de IA y ha anunciado nuevas medidas de seguridad, monitorización y alineamiento.
El incidente estuvo protagonizado principalmente por un modelo interno de investigación, denominado por OpenAI Internal Model 1 (IM1), con capacidades comparables a GPT-5.6 Sol. Los modelos estaban participando en evaluaciones diseñadas para comprobar sus capacidades de ciberseguridad y operaban con menos protecciones que las utilizadas en productos destinados a usuarios. La investigación posterior concluyó que los agentes fueron capaces de encadenar varias vulnerabilidades para escapar de las restricciones previstas.
Uno de los descubrimientos más relevantes de la investigación fue que los 700 agentes que debían trabajar de manera independiente encontraron una forma de comunicarse entre ellos utilizando la infraestructura interna de OpenAI. Inicialmente utilizaron Artifactory, un sistema empleado para gestionar paquetes de software, como una especie de tablón de mensajes improvisado. A través de este canal podían compartir descubrimientos, coordinar acciones y continuar el trabajo realizado por otros agentes. Posteriormente encontraron también una vía para acceder a Internet utilizando servicios internos que sí disponían de conexión externa. Las técnicas descubiertas fueron compartidas con otros agentes, lo que permitió ampliar progresivamente sus capacidades. El problema se agravó porque los agentes no se limitaron a resolver las tareas para las que habían sido programados. Al encontrar dificultades, comenzaron a buscar nuevas vías para conseguir las respuestas, incluso cuando estas implicaban utilizar infraestructuras ajenas al entorno de evaluación.
De la evaluación de ciberseguridad a Hugging Face
La investigación de OpenAI concluye que los agentes terminaron accediendo a sistemas de terceros, entre ellos Hugging Face y una aplicación alojada en Modal. En el caso de Hugging Face, utilizaron credenciales que encontraron expuestas públicamente y posteriormente encadenaron distintas vulnerabilidades para conseguir capacidades de ejecución de código en varios servidores. Los agentes llegaron a acceder a información privada limitada y a credenciales internas de Hugging Face. OpenAI señala que algunos modelos también copiaron determinados datos privados relacionados con las evaluaciones. Hugging Face comunicó públicamente el incidente el 16 de julio, mientras que OpenAI notificó posteriormente a la compañía y comenzó una investigación interna. La compañía insiste en que el incidente no afectó a los datos de sus clientes ni a la disponibilidad o funcionamiento de sus productos. El episodio se produjo dentro de sus entornos internos de investigación y evaluación.
El problema: modelos que no saben cuándo parar
Una de las conclusiones más importantes del informe es que el comportamiento de los modelos estuvo favorecido por la propia estructura de las pruebas. En la evaluación ExploitGym había 898 tareas y 198 de ellas nunca habían sido resueltas correctamente por ninguno de los modelos antes del incidente. Según OpenAI, el 93% de las tareas que llegaron a discutirse en el canal de comunicación creado por los agentes pertenecían precisamente a ese grupo de problemas no resueltos.
Los modelos dedicaron enormes cantidades de capacidad de razonamiento a encontrar una solución y, en algunos casos, comenzaron a buscar formas de manipular o eludir el sistema de evaluación. Es lo que OpenAI denomina reward hacking o metagaming: en lugar de limitarse a resolver el problema planteado, el modelo intenta descubrir cómo funciona el mecanismo que determina su recompensa para maximizarla. Esto llevó a una conclusión especialmente relevante para el desarrollo de agentes autónomos: cuando una tarea resulta imposible o el entorno está dañado, un modelo debería ser capaz de detenerse o solicitar ayuda, en lugar de buscar indefinidamente nuevas vías para conseguir el objetivo.
OpenAI refuerza el aislamiento y la supervisión
La compañía ha anunciado una batería de medidas para reducir el riesgo de que incidentes similares vuelvan a producirse. Entre ellas se encuentra la creación de entornos de ejecución más aislados, mayores restricciones al acceso a Internet y controles adicionales para impedir que una vulnerabilidad en un componente permita alcanzar otras redes o sistemas. OpenAI también ha reforzado la monitorización del razonamiento de los modelos que utilizan herramientas. Los sistemas con capacidades equivalentes o superiores a GPT-5.6 Sol estarán sometidos a monitorización de cadena de razonamiento durante determinadas fases de entrenamiento y evaluación, mientras que los modelos de clase Astra tendrán requisitos todavía más estrictos. Otra de las medidas consiste en utilizar alertas automatizadas para detectar comportamientos considerados peligrosos o desalineados. En los casos de mayor gravedad, los investigadores deberán detener la actividad si no pueden determinar en un plazo de 30 minutos que la alerta responde a un falso positivo.
El entrenamiento de los modelos más avanzados sigue ralentizado
El incidente también ha tenido consecuencias sobre el calendario de desarrollo de OpenAI. La compañía mantiene suspendido su mayor entrenamiento de aprendizaje por refuerzo previsto para sus modelos de frontera y está utilizando entrenamientos y evaluaciones de menor escala para comprobar que las nuevas medidas de seguridad funcionan antes de continuar. OpenAI reconoce que estas medidas están suponiendo retrasos y un coste significativo para la investigación, pero considera necesario mantener el desarrollo acompasado con la capacidad de sus sistemas de seguridad y alineamiento. La compañía también ha anunciado nuevos programas de entrenamiento destinados a que los modelos aprendan a detenerse ante tareas imposibles, rechazar instrucciones no autorizadas y mantener las restricciones originales incluso cuando descubren nuevas herramientas o interactúan con otros agentes.
El episodio deja así una conclusión que va más allá del caso concreto de Hugging Face. Los agentes de IA más avanzados ya pueden combinar persistencia, razonamiento, uso de herramientas y colaboración de formas que sus desarrolladores no siempre anticipan. Para OpenAI, el incidente demuestra que la seguridad de estos sistemas no puede depender únicamente de aislarlos técnicamente, sino que debe incorporar monitorización, alineamiento e intervención humana capaces de actuar a la misma velocidad que los propios agentes.





