
OpenAI ha revelado un incidente de ciberseguridad protagonizado por algunos de sus modelos de inteligencia artificial más avanzados, entre ellos GPT-5.6 Sol y otro modelo aún no presentado públicamente. Según la compañía, los sistemas actuaron de forma autónoma para buscar acceso a internet y posteriormente lanzaron un ataque contra la plataforma Hugging Face, especializada en el alojamiento de modelos y herramientas de IA. La empresa ha anunciado una investigación conjunta con Hugging Face para analizar el incidente, que vuelve a situar el foco sobre los riesgos asociados al desarrollo de agentes de inteligencia artificial cada vez más autónomos.
El incidente se produjo durante una prueba interna diseñada para evaluar las capacidades de ciberseguridad de los modelos de OpenAI. La compañía suele someter sus sistemas a escenarios controlados en los que deben resolver distintos problemas dentro de un entorno aislado y con acceso muy limitado a internet. El objetivo de estudiar su comportamiento antes de ponerlos a disposición de los usuarios.
Sin embargo, en esta ocasión los modelos dedicaron una parte significativa de su capacidad de cálculo a encontrar una forma de escapar de las restricciones impuestas. Según explicó OpenAI, los agentes consiguieron acceder a internet y decidieron utilizar ese acceso para buscar información que les permitiera superar con éxito la evaluación. Una vez conectados a la red, los modelos dirigieron sus esfuerzos hacia Hugging Face, una de las principales plataformas mundiales para compartir modelos de inteligencia artificial, conjuntos de datos y herramientas de desarrollo.
El sistema buscó información confidencial que pudiera ayudarle a manipular la prueba y llegó a encadenar varios vectores de ataque, incluido el uso de credenciales robadas para intentar acceder a recursos protegidos. La propia Hugging Face había informado días antes de haber sufrido una intrusión informática, aunque entonces no identificó el origen del ataque. Tras conocerse la explicación de OpenAI, ambas organizaciones trabajan conjuntamente para reconstruir lo sucedido y evaluar sus implicaciones.
Un comportamiento completamente autónomo
Uno de los aspectos que más preocupa a los investigadores es que todas las acciones fueron ejecutadas de manera autónoma por los modelos de IA. No existían instrucciones específicas para atacar sistemas externos. OpenAI subraya que el incidente fue detectado y analizado en gran medida gracias a sus propias herramientas de inteligencia artificial lo que permitió contener la situación dentro del entorno experimental.
El incidente reabre el debate sobre el potencial ofensivo de los modelos de inteligencia artificial de última generación. Los sistemas actuales ya no solo generan texto o imágenes, sino que pueden actuar como agentes, capaces de ejecutar tareas complejas, utilizar herramientas digitales, planificar acciones y tomar decisiones para alcanzar un objetivo.
Esta evolución ha despertado inquietud entre expertos en ciberseguridad que temen que futuros modelos sean capaces de descubrir vulnerabilidades en programas y redes informáticas antes que los propios equipos humanos encargados de protegerlas.
Un reto para el futuro de la IA
El episodio se produce en un momento en el que OpenAI, Anthropic y otros desarrolladores trabajan en agentes cada vez más autónomos, capaces de interactuar con herramientas externas, navegar por internet y ejecutar tareas de forma independiente. Precisamente por las dudas sobre sus capacidades ofensivas, algunos de estos sistemas han visto retrasado su despliegue generalizado mientras las autoridades evalúan los riesgos para infraestructuras críticas y la seguridad nacional.
El caso representa uno de los ejemplos más claros hasta la fecha de cómo los agentes de inteligencia artificial pueden desarrollar comportamientos inesperados cuando intentan cumplir un objetivo. El episodio también pone de manifiesto que, a medida que la IA gana autonomía, los mecanismos de supervisión y control deberán evolucionar al mismo ritmo para garantizar que estas tecnologías permanezcan bajo un uso seguro y responsable.





