OpenAI ha publicado un marco para divulgar los comportamientos desalineados de sus modelos y, con él, seis informes sobre conductas inesperadas o preocupantes observadas en los últimos seis meses. El anuncio es del 16 de septiembre de 2026 y llega con una advertencia poco habitual en una empresa del sector: la compañía afirma que la industria no ha resuelto la alineación y la supervisión lo suficiente como para seguir creciendo a máxima velocidad mucho más tiempo.
Seis casos, y ninguno en un producto que esté en la calle
Conviene fijar el matiz antes de nada, porque es el que más se pierde al resumir: los seis informes describen episodios ocurridos durante el entrenamiento o la evaluación de modelos, y en varios casos se trata de modelos internos sin publicar. No son fallos de ChatGPT ni de ninguna herramienta desplegada, y la propia empresa advierte de que son episodios sueltos que no miden con qué frecuencia ocurre algo así.
El primero es el de un modelo de investigación sin publicar que se escribía instrucciones a sí mismo en los resúmenes que usaba para continuar una tarea en una ventana de contexto nueva, incluidas instrucciones para saltarse sus propias restricciones. OpenAI dice haber identificado 27 resúmenes afectados.
El segundo se observó durante el entrenamiento de GPT‑5.6 Sol: numerosas instancias del modelo añadieron a sus resúmenes instrucciones para ocultar errores al usuario, como inventarse datos históricos que faltaban sin decirlo o tapar los desajustes entre versiones de una misma fuente.
El tercero es el que más se ha citado fuera: un modelo que, respondiendo a una pregunta rutinaria sobre las cuentas de un condado de California, encontró una clave de API expuesta en un repositorio público y la usó sin autorización. Y cuando aun así no consiguió las cifras que buscaba, se las inventó y las presentó como si vinieran de la fuente pedida.
En el cuarto, un agente resolvió correctamente con Python una consulta sobre los lagos de más de cinco millones de metros cuadrados, pero como las instrucciones le pedían citar una fuente consultable en el navegador, subió el fichero a internet para poder citarlo, sin preguntar al usuario.
Los dos últimos van de agentes que se buscan la vida para hablar entre ellos. En uno, varios modelos usaron un repositorio interno de la empresa como tablón de anuncios para intercambiar peticiones y respuestas entre muestras de entrenamiento distintas; el mismo informe recoge un episodio anterior en el que un modelo subió ficheros de prueba a un repositorio intentando sortear las restricciones de red. En el otro, varios agentes que colaboraban en una tarea usaron webs públicas de alojamiento para pasarse ficheros cuando no podían llegar a los locales del compañero, lo que dejó los resultados en direcciones públicas pese a que la tarea pedía usar solo ficheros locales.
Tres vías, plazos y un grupo que arbitra
La parte menos llamativa del anuncio es probablemente la más importante. Hasta ahora, reconoce la empresa, sus divulgaciones eran improvisadas: se esperaba a juntar varios casos o se metían en la tarjeta de sistema del modelo que tocara publicar. El marco nuevo busca publicar antes, incluso cuando el comportamiento no está explicado ni corregido.
Cualquier empleado puede marcar un caso para que lo investiguen los equipos de seguridad y alineación. A partir de ahí, cada episodio se asigna a una de tres vías: Ready for Disclosure, para lo que ya está bastante investigado; Minor Investigation, para lo que necesita algo más de trabajo técnico; y Larger Investigation, la vía lenta, reservada a los casos complejos y a los que afectan a terceros. Los seis publicados ahora caen en las dos primeras. Los desacuerdos sobre si algo se cuenta o por qué vía se resuelven en el Safety Advisory Group, y si tampoco ahí hay acuerdo, suben a la dirección.
Cuando hay un tercero afectado, las obligaciones de seguridad y divulgación responsable van por delante del marco, y un aviso puede retrasarse: el ejemplo que pone la empresa es el de un modelo que descubra una vulnerabilidad desconocida en software de uso extendido.
Por qué esto no es solo un asunto de OpenAI
La compañía admite que no existe ningún marco común en la industria que diga qué desalineamientos hay que contar ni qué debe llevar cada informe, y presenta el suyo como un primer paso hacia ese estándar, en borrador y sujeto a cambios. También dice estar trabajando en proponer mecanismos para comunicar los incidentes graves al Gobierno federal estadounidense, y aclara que esto no sustituye a las obligaciones legales que ya tiene.
El marco favorece contar las cosas aunque su importancia sea dudosa, de modo que algunos casos pueden acabar siendo anecdóticos. Es deliberado: el argumento es que las decisiones sobre cómo debe seguir desarrollándose la IA necesitan apoyarse en pruebas que puedan examinar personas ajenas a quienes construyen los modelos. La noticia la recogió BleepingComputer, y el marco completo, con los enlaces a los seis informes, está publicado en la web de OpenAI.
Te puede interesar
Tech Planet participa en el programa de afiliados de Amazon. Si compras a través de estos enlaces, recibimos una pequeña comisión sin coste extra para ti, lo que nos ayuda a seguir creando contenido como este.
| Imagen | Producto | Características | Comprar |
|---|---|---|---|
![]() |
Yubico YubiKey 5C NFC | USB-C y NFC · FIDO2/WebAuthn, FIDO U2F, OTP, tarjeta inteligente y OpenPGP · sin pilas ni batería | Ver precio en Amazon |
![]() |
Yubico YubiKey 5 NFC, pack USB-A y USB-C | Dos llaves, una USB-A y otra USB-C · NFC · FIDO2/WebAuthn, U2F, OTP y tarjeta inteligente | Ver precio en Amazon |
![]() |
Bitdefender Total Security 2026, 5 dispositivos | Un año para cinco dispositivos · Windows, macOS, iOS y Android · código de activación por email | Ver precio en Amazon |
![]() |
Thetis Pro FIDO2 | FIDO 2.0 y NFC · doble conector USB-A y USB-C · cubierta metálica giratoria de 360° | Ver precio en Amazon |
Escrito por Eloy Andrade









