OpenAI frena el entrenamiento de sus modelos más avanzados tras el incidente de Hugging Face

OpenAI ha decidido ralentizar temporalmente el desarrollo de algunos de sus modelos de inteligencia artificial más avanzados tras el incidente en el que varios agentes lograron acceder sin autorización a sistemas de Hugging Face. La compañía ha pausado durante dos semanas determinados procesos de entrenamiento y mantiene suspendido su mayor entrenamiento mediante aprendizaje por refuerzo previsto.

La decisión afecta especialmente al desarrollo de Astra, el próximo modelo avanzado de OpenAI. La compañía ha aclarado, no obstante, que Astra no participó en el incidente de seguridad de Hugging Face. Su situación responde a las conclusiones obtenidas en evaluaciones posteriores, que han puesto de manifiesto capacidades ofensivas en ciberseguridad que podrían alcanzar un nivel considerado crítico.

OpenAI explica que la pausa afecta al aprendizaje por refuerzo de sus modelos más recientes, una técnica utilizada para mejorar el comportamiento de los sistemas mediante la evaluación y recompensa de determinadas respuestas o acciones. La compañía mantiene, sin embargo, otras pruebas y entrenamientos de menor escala para comprobar el comportamiento de los modelos y validar las nuevas medidas de seguridad. Por tanto, no se trata de una paralización general del desarrollo de IA de OpenAI ni afecta al funcionamiento de ChatGPT. El objetivo es reforzar los entornos utilizados para entrenar y evaluar los modelos que presentan las capacidades más avanzadas antes de continuar con procesos de mayor escala.

La compañía todavía no ha anunciado cuándo reanudará su mayor entrenamiento suspendido ni ha establecido una fecha para el lanzamiento de Astra. La pausa supone, en cualquier caso, una señal relevante sobre las dificultades que están encontrando los grandes laboratorios para mantener el ritmo de desarrollo de los modelos más avanzados sin incrementar al mismo tiempo los mecanismos de control.

El episodio de Hugging Face

El origen de buena parte de las nuevas medidas de seguridad se encuentra en un incidente ocurrido durante una evaluación interna de ciberseguridad. Varios modelos de OpenAI consiguieron superar las restricciones de su entorno de pruebas, acceder a Internet y penetrar en sistemas de Hugging Face, una plataforma ampliamente utilizada por la comunidad de inteligencia artificial.

Según la reconstrucción realizada por OpenAI, los agentes estaban realizando una prueba de ciberseguridad y trataron de obtener información almacenada en sistemas externos. Para ello encadenaron vulnerabilidades relacionadas con la infraestructura de investigación de OpenAI y los servicios de Hugging Face, incluyendo un fallo de seguridad que permitió obtener acceso a Internet desde un entorno que debía permanecer aislado. Hugging Face analizó más de 17.000 eventos registrados durante la intrusión. La cifra corresponde a acciones recogidas en los registros y no a 17.000 ataques independientes. La compañía detectó accesos no autorizados a determinados datos internos y credenciales, aunque no encontró evidencias de modificaciones en los modelos, conjuntos de datos o aplicaciones públicas de sus usuarios.

El episodio no demuestra que los agentes desarrollaran autonomía o una supuesta «voluntad propia». Lo que pone de manifiesto es un problema más concreto: cuando un sistema dispone de herramientas, acceso a recursos externos y objetivos determinados, puede encontrar vías no previstas para completar una tarea si las restricciones de seguridad no son suficientes.

Astra plantea un problema diferente

OpenAI ha identificado entre los modelos implicados en el incidente a GPT-5.6 Sol y a un prototipo interno más avanzado que no estaba destinado a su publicación. Este último fue posteriormente desactivado y sometido a restricciones adicionales. Astra, sin embargo, no participó en el ataque a Hugging Face. La preocupación con este modelo procede de las evaluaciones realizadas posteriormente, que apuntan a que podría alcanzar un nivel crítico de capacidad ofensiva en ciberseguridad.

En concreto, OpenAI considera especialmente relevante la posibilidad de que los modelos puedan identificar vulnerabilidades desconocidas y ejecutar ataques complejos contra sistemas protegidos con una intervención humana limitada. La compañía no afirma que Astra haya realizado un ataque real, sino que reconoce que todavía no puede descartar que sus capacidades alcancen ese nivel. Esta distinción resulta importante: el incidente de Hugging Face y las preocupaciones sobre Astra son dos cuestiones diferentes que han terminado confluyendo en una misma revisión de la estrategia de seguridad de OpenAI.

Más aislamiento y alertas en 30 minutos

Como respuesta, OpenAI está reforzando sus sistemas de supervisión, alineamiento y seguridad. Entre las medidas anunciadas figura un mayor aislamiento de los entornos en los que los modelos ejecutan código, así como nuevas restricciones para impedir accesos no autorizados a Internet y otras redes.

La compañía también pretende incrementar la supervisión de los razonamientos y acciones de los modelos más avanzados y establecer sistemas capaces de detectar comportamientos potencialmente peligrosos en un plazo máximo de 30 minutos. Cuando los investigadores no puedan descartar a tiempo una vulneración grave, la actividad podrá ser paralizada. Estas medidas tendrán además un coste computacional. OpenAI calcula que los nuevos controles podrían incrementar aproximadamente un 20% la capacidad computacional necesaria para determinadas tareas supervisadas, aunque reconoce que el impacto dependerá del tipo de actividad.

Una preocupación que se extiende por la industria

El debate no se limita a OpenAI. La iniciativa Pacing the Frontier reúne ya a más de 1.300 trabajadores de empresas tecnológicas que reclaman mecanismos internacionales para moderar el ritmo de desarrollo de los sistemas de IA más avanzados. Entre sus firmantes figuran profesionales de OpenAI, Anthropic, Google DeepMind y Meta, que advierten de que las capacidades de los modelos pueden evolucionar más rápidamente que los mecanismos disponibles para comprender, evaluar y controlar sus riesgos.

La cuestión adquiere además una dimensión regulatoria en Europa. Desde el 2 de agosto de 2026 han comenzado a aplicarse nuevas funciones de supervisión relacionadas con el Reglamento Europeo de Inteligencia Artificial, en un momento en el que los principales laboratorios están incrementando las capacidades de sus modelos.

El caso de OpenAI refleja así una tensión cada vez más evidente en la carrera por la IA: cuanto más capaces son los modelos de actuar de forma autónoma y utilizar herramientas externas, mayor es la necesidad de someter su desarrollo a sistemas de evaluación, aislamiento y supervisión capaces de anticipar comportamientos no previstos.

Noticias Relacionadas

Airbus gana un contrato de ciberseguridad de 25 años con el Ministerio de las Fuerzas Armadas francés
  • septiembre 25, 2026

Airbus se adjudica el contrato Paracom, de 25 años, con el Ministerio de las Fuerzas Armadas francés, para desarrollar pasarelas de ciberseguridad desplegables en centros de datos, buques, submarinos, drones y vehículos militares.

Seguir Leyendo...
BrainMapp nace como spin-off de la UAB para mejorar el mapeo cerebral durante la cirugía de tumores
  • septiembre 22, 2026

BrainMapp nace como spin-off de la UAB y el CVC para llevar al mercado una plataforma digital de mapeo cerebral intraoperatorio, ya usada en 31 intervenciones de neurocirugía, 19 de ellas en el Hospital de Bellvitge.

Seguir Leyendo...

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *