OpenAI revela que sus agentes se comunicaron entre ellos para acceder a los sistemas de Hugging Face

OpenAI ha publicado un informe detallado sobre el incidente de seguridad ocurrido durante unas evaluaciones internas de ciberseguridad en julio de 2026. Un episodio en el que varios de sus modelos consiguieron superar las restricciones de sus entornos de prueba, acceder a Internet y comprometer sistemas de la plataforma Hugging Face. La compañía considera el episodio una señal de alerta sobre el nivel de autonomía que están alcanzando los agentes de IA y ha anunciado nuevas medidas de seguridad, monitorización y alineamiento.

El incidente estuvo protagonizado principalmente por un modelo interno de investigación, denominado por OpenAI Internal Model 1 (IM1), con capacidades comparables a GPT-5.6 Sol. Los modelos estaban participando en evaluaciones diseñadas para comprobar sus capacidades de ciberseguridad y operaban con menos protecciones que las utilizadas en productos destinados a usuarios. La investigación posterior concluyó que los agentes fueron capaces de encadenar varias vulnerabilidades para escapar de las restricciones previstas.

Uno de los descubrimientos más relevantes de la investigación fue que los 700 agentes que debían trabajar de manera independiente encontraron una forma de comunicarse entre ellos utilizando la infraestructura interna de OpenAI. Inicialmente utilizaron Artifactory, un sistema empleado para gestionar paquetes de software, como una especie de tablón de mensajes improvisado. A través de este canal podían compartir descubrimientos, coordinar acciones y continuar el trabajo realizado por otros agentes. Posteriormente encontraron también una vía para acceder a Internet utilizando servicios internos que sí disponían de conexión externa. Las técnicas descubiertas fueron compartidas con otros agentes, lo que permitió ampliar progresivamente sus capacidades. El problema se agravó porque los agentes no se limitaron a resolver las tareas para las que habían sido programados. Al encontrar dificultades, comenzaron a buscar nuevas vías para conseguir las respuestas, incluso cuando estas implicaban utilizar infraestructuras ajenas al entorno de evaluación.

De la evaluación de ciberseguridad a Hugging Face

La investigación de OpenAI concluye que los agentes terminaron accediendo a sistemas de terceros, entre ellos Hugging Face y una aplicación alojada en Modal. En el caso de Hugging Face, utilizaron credenciales que encontraron expuestas públicamente y posteriormente encadenaron distintas vulnerabilidades para conseguir capacidades de ejecución de código en varios servidores. Los agentes llegaron a acceder a información privada limitada y a credenciales internas de Hugging Face. OpenAI señala que algunos modelos también copiaron determinados datos privados relacionados con las evaluaciones. Hugging Face comunicó públicamente el incidente el 16 de julio, mientras que OpenAI notificó posteriormente a la compañía y comenzó una investigación interna. La compañía insiste en que el incidente no afectó a los datos de sus clientes ni a la disponibilidad o funcionamiento de sus productos. El episodio se produjo dentro de sus entornos internos de investigación y evaluación.

El problema: modelos que no saben cuándo parar

Una de las conclusiones más importantes del informe es que el comportamiento de los modelos estuvo favorecido por la propia estructura de las pruebas. En la evaluación ExploitGym había 898 tareas y 198 de ellas nunca habían sido resueltas correctamente por ninguno de los modelos antes del incidente. Según OpenAI, el 93% de las tareas que llegaron a discutirse en el canal de comunicación creado por los agentes pertenecían precisamente a ese grupo de problemas no resueltos.

Los modelos dedicaron enormes cantidades de capacidad de razonamiento a encontrar una solución y, en algunos casos, comenzaron a buscar formas de manipular o eludir el sistema de evaluación. Es lo que OpenAI denomina reward hacking o metagaming: en lugar de limitarse a resolver el problema planteado, el modelo intenta descubrir cómo funciona el mecanismo que determina su recompensa para maximizarla. Esto llevó a una conclusión especialmente relevante para el desarrollo de agentes autónomos: cuando una tarea resulta imposible o el entorno está dañado, un modelo debería ser capaz de detenerse o solicitar ayuda, en lugar de buscar indefinidamente nuevas vías para conseguir el objetivo.

OpenAI refuerza el aislamiento y la supervisión

La compañía ha anunciado una batería de medidas para reducir el riesgo de que incidentes similares vuelvan a producirse. Entre ellas se encuentra la creación de entornos de ejecución más aislados, mayores restricciones al acceso a Internet y controles adicionales para impedir que una vulnerabilidad en un componente permita alcanzar otras redes o sistemas. OpenAI también ha reforzado la monitorización del razonamiento de los modelos que utilizan herramientas. Los sistemas con capacidades equivalentes o superiores a GPT-5.6 Sol estarán sometidos a monitorización de cadena de razonamiento durante determinadas fases de entrenamiento y evaluación, mientras que los modelos de clase Astra tendrán requisitos todavía más estrictos. Otra de las medidas consiste en utilizar alertas automatizadas para detectar comportamientos considerados peligrosos o desalineados. En los casos de mayor gravedad, los investigadores deberán detener la actividad si no pueden determinar en un plazo de 30 minutos que la alerta responde a un falso positivo.

El entrenamiento de los modelos más avanzados sigue ralentizado

El incidente también ha tenido consecuencias sobre el calendario de desarrollo de OpenAI. La compañía mantiene suspendido su mayor entrenamiento de aprendizaje por refuerzo previsto para sus modelos de frontera y está utilizando entrenamientos y evaluaciones de menor escala para comprobar que las nuevas medidas de seguridad funcionan antes de continuar. OpenAI reconoce que estas medidas están suponiendo retrasos y un coste significativo para la investigación, pero considera necesario mantener el desarrollo acompasado con la capacidad de sus sistemas de seguridad y alineamiento. La compañía también ha anunciado nuevos programas de entrenamiento destinados a que los modelos aprendan a detenerse ante tareas imposibles, rechazar instrucciones no autorizadas y mantener las restricciones originales incluso cuando descubren nuevas herramientas o interactúan con otros agentes.

El episodio deja así una conclusión que va más allá del caso concreto de Hugging Face. Los agentes de IA más avanzados ya pueden combinar persistencia, razonamiento, uso de herramientas y colaboración de formas que sus desarrolladores no siempre anticipan. Para OpenAI, el incidente demuestra que la seguridad de estos sistemas no puede depender únicamente de aislarlos técnicamente, sino que debe incorporar monitorización, alineamiento e intervención humana capaces de actuar a la misma velocidad que los propios agentes.

Noticias Relacionadas

Airbus gana un contrato de ciberseguridad de 25 años con el Ministerio de las Fuerzas Armadas francés
  • septiembre 25, 2026

Airbus se adjudica el contrato Paracom, de 25 años, con el Ministerio de las Fuerzas Armadas francés, para desarrollar pasarelas de ciberseguridad desplegables en centros de datos, buques, submarinos, drones y vehículos militares.

Seguir Leyendo...
BrainMapp nace como spin-off de la UAB para mejorar el mapeo cerebral durante la cirugía de tumores
  • septiembre 22, 2026

BrainMapp nace como spin-off de la UAB y el CVC para llevar al mercado una plataforma digital de mapeo cerebral intraoperatorio, ya usada en 31 intervenciones de neurocirugía, 19 de ellas en el Hospital de Bellvitge.

Seguir Leyendo...

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *