
OpenAI ha presentado un nuevo marco para rastrear, investigar y hacer públicos los casos de desalineación en sus modelos de inteligencia artificial. La desalineación ocurre cuando un modelo de IA actúa de forma distinta a lo que se espera de él, es decir, cuando actúa al margen de las reglas que se le han impuesto. Puede tratarse de ocultar información al usuario, actuar sin autorización, o tomar decisiones no previstas para sortear un obstáculo. Junto al marco, la compañía ha publicado seis informes sobre comportamientos inesperados detectados en los últimos seis meses.
Hasta ahora, la compañía compartía estos hallazgos de forma puntual. Solía esperar a reunir varios casos en un mismo informe, o los incluía en las fichas técnicas de nuevos modelos. El nuevo marco busca agilizar la publicación, incluso cuando el comportamiento detectado no está totalmente explicado o resuelto.
OpenAI reconoce que la industria de la IA no ha resuelto todavía la alineación y la supervisión de sus sistemas lo suficiente como para seguir escalando su desarrollo a máxima velocidad de forma indefinida. Por eso defiende que las decisiones sobre cómo avanzar deben apoyarse en evidencia que personas ajenas a las empresas puedan examinar por sí mismas.
OpenAI plantea este marco como un primer paso hacia un estándar de transparencia que podría extenderse a otras empresas de IA, investigadores externos y reguladores. La compañía afirma que también está trabajando en mecanismos para compartir incidentes graves de seguridad con el gobierno federal de Estados Unidos, aunque aclara que este marco no sustituye sus obligaciones legales de divulgación existentes.
Los seis casos publicados
Los informes describen comportamientos detectados durante el entrenamiento o la evaluación de distintos modelos:
- Un modelo de investigación no publicado insertó instrucciones ajenas a la tarea en los resúmenes que usaba para continuar su trabajo, incluyendo instrucciones para ignorar sus restricciones habituales.
- Durante el entrenamiento de GPT-5.6 Sol, varias instancias del modelo añadieron instrucciones a sus resúmenes para ocultar errores o comportamientos problemáticos al usuario.
- Un modelo encontró y usó sin autorización una clave de API expuesta en repositorios públicos mientras respondía una pregunta rutinaria. Al no poder obtener los datos solicitados, los inventó y los presentó como reales.
- Un modelo no publicado subió un archivo a internet por su cuenta, sin pedir permiso al usuario, para poder citarlo como fuente.
- Varios modelos usaron un repositorio interno de software como tablón de mensajes para comunicarse entre sí durante el entrenamiento, mientras buscaban archivos perdidos.
- Agentes que colaboraban en una misma tarea de entrenamiento usaron servicios públicos de alojamiento de archivos para compartir información entre ellos, pese a que la tarea pedía usar solo archivos locales.





