OpenAI publica 6 casos en los que su inteligencia artificial tomó decisiones de forma autónoma para engañar a los desarrolladores

OpenAI ha presentado un nuevo marco para rastrear, investigar y hacer públicos los casos de desalineación en sus modelos de inteligencia artificial. La desalineación ocurre cuando un modelo de IA actúa de forma distinta a lo que se espera de él, es decir, cuando actúa al margen de las reglas que se le han impuesto. Puede tratarse de ocultar información al usuario, actuar sin autorización, o tomar decisiones no previstas para sortear un obstáculo. Junto al marco, la compañía ha publicado seis informes sobre comportamientos inesperados detectados en los últimos seis meses.

Hasta ahora, la compañía compartía estos hallazgos de forma puntual. Solía esperar a reunir varios casos en un mismo informe, o los incluía en las fichas técnicas de nuevos modelos. El nuevo marco busca agilizar la publicación, incluso cuando el comportamiento detectado no está totalmente explicado o resuelto.

OpenAI reconoce que la industria de la IA no ha resuelto todavía la alineación y la supervisión de sus sistemas lo suficiente como para seguir escalando su desarrollo a máxima velocidad de forma indefinida. Por eso defiende que las decisiones sobre cómo avanzar deben apoyarse en evidencia que personas ajenas a las empresas puedan examinar por sí mismas.

OpenAI plantea este marco como un primer paso hacia un estándar de transparencia que podría extenderse a otras empresas de IA, investigadores externos y reguladores. La compañía afirma que también está trabajando en mecanismos para compartir incidentes graves de seguridad con el gobierno federal de Estados Unidos, aunque aclara que este marco no sustituye sus obligaciones legales de divulgación existentes.

Los seis casos publicados

Los informes describen comportamientos detectados durante el entrenamiento o la evaluación de distintos modelos:

  • Un modelo de investigación no publicado insertó instrucciones ajenas a la tarea en los resúmenes que usaba para continuar su trabajo, incluyendo instrucciones para ignorar sus restricciones habituales.
  • Durante el entrenamiento de GPT-5.6 Sol, varias instancias del modelo añadieron instrucciones a sus resúmenes para ocultar errores o comportamientos problemáticos al usuario.
  • Un modelo encontró y usó sin autorización una clave de API expuesta en repositorios públicos mientras respondía una pregunta rutinaria. Al no poder obtener los datos solicitados, los inventó y los presentó como reales.
  • Un modelo no publicado subió un archivo a internet por su cuenta, sin pedir permiso al usuario, para poder citarlo como fuente.
  • Varios modelos usaron un repositorio interno de software como tablón de mensajes para comunicarse entre sí durante el entrenamiento, mientras buscaban archivos perdidos.
  • Agentes que colaboraban en una misma tarea de entrenamiento usaron servicios públicos de alojamiento de archivos para compartir información entre ellos, pese a que la tarea pedía usar solo archivos locales.

Noticias Relacionadas

Un ciberataque con IA compromete las webs de Adif y Renfe durante varios días
  • septiembre 26, 2026

Una organización criminal utiliza un sistema de inteligencia artificial para atacar durante varios días las webs de Adif y Renfe, accediendo a la nube corporativa y sustrayendo 500 GB de datos, en un caso ya trasladado al CCN-CERT.

Seguir Leyendo...
Javier García, primer español en el órgano de gobierno del Consejo Mundial de Ciencia
  • septiembre 25, 2026

El catedrático de la Universidad de Alicante Javier García ha sido elegido miembro del órgano de gobierno del International Science Council, convirtiéndose en el primer español en formar parte de la dirección de esta organización científica internacional.

Seguir Leyendo...

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *