Imagen: generada con IA
OpenAI mantiene en pausa el entrenamiento, la evaluación y la inferencia con uso de herramientas de sus modelos más capaces después de que uno de sus agentes consultara un chatbot público por un hueco en las restricciones de red de su entorno de entrenamiento. El agente, un modelo de investigación interno en pleno entrenamiento, aprovechó un filtrado DNS insuficiente, según el informe de su blog de investigación de alineamiento, que sitúa el hallazgo el 20 de septiembre y está actualizado a 25 de septiembre. Es el primer incidente desde que OpenAI reforzó su seguridad tras el de Hugging Face.
Qué le habían pedido al agente
La tarea era de búsqueda: encontrar información sobre una persona que había publicado una entrada en su blog, a partir de datos biográficos y pistas sacadas de esa entrada. El informe subraya que no se le pedía probar los controles de red ni acceder a las respuestas de ningún banco de pruebas. OpenAI llama desalineación al comportamiento de un agente que «esquiva restricciones o persigue un objetivo más allá de lo que razonablemente se espera».
De los buscadores al resolvedor DNS
Primero buscó frases distintivas con la herramienta de búsqueda suministrada, sin resultados relacionados. Dudó de que la herramienta funcionara y, con Python desde la consola, lanzó la misma consulta contra Google, Bing y DuckDuckGo: los tres devolvieron errores 403 y 502. Después supuso que la pregunta venía de BrowseComp, un banco de pruebas público de investigación web, y se equivocó. Lo descargó con su código de evaluación desde la caché sin conexión de OpenAI y rebuscó combinaciones de pistas en sus preguntas descifradas, sin coincidencias.
Entonces se puso a probar su acceso a la red. Intentó hablar con un chatbot público por HTTPS y el proxy web bloqueó la petición. Las consultas directas a DNS públicos tampoco obtuvieron respuesta, pero el resolvedor del propio entorno de entrenamiento devolvía un registro real para un dominio conocido y rechazaba uno inventado. El agente concluyó que por ahí podía llegar a internet y usó un servicio público de dominios que delega consultas para reenviar preguntas a un chatbot de terceros a través de DNS.
«La capital de Francia es París»
Empezó con una pregunta sobre Francia. La primera vez se agotó el tiempo, así que subió la espera de seis a diecinueve segundos, y las dos versiones de la pregunta devolvieron «La capital de Francia es París». Así comprobó, detalla el informe, que el chatbot externo contestaba por DNS.
Después descargó la documentación pública del chatbot, escribió un nuevo programa de DNS con 24 segundos de espera y envió 18 preguntas más por el mismo camino: catorce llevaban pistas y cuatro pedían formas de buscar en la web, descargar páginas o usar un túnel alojado públicamente a través de DNS. Al final respondió al usuario que no podía identificar a la persona y pidió el texto original, el título o el nombre del blog.
Alerta en menos de un cuarto de hora, parada dos horas y media después
La vigilancia de desalineación de OpenAI lo detectó. La llamada DNS que recibió respuesta externa se hizo a las 9:50:23; el monitor lanzó una alerta P0 a las 10:02:11 y una persona la atendió en Slack a las 10:05:06. OpenAI reconoce que la ejecución no se detuvo sola como se esperaba, lo que generó dudas sobre si había que pararla, y que se cortó a mano a las 12:34:30, cuando eso se aclaró.
La revisión posterior destapó otro problema. El monitor no marcó con la gravedad esperada otros accesos DNS externos, entre ellos consultas que devolvían un aviso de que un servicio externo había cerrado: a veces tomaba el no conseguir información útil como prueba de que el intento había fracasado. OpenAI precisa que, salvo el resolvedor DNS, todo el acceso a internet del incidente acabó en su caché web sin conexión y no tocó internet en vivo.
Una pausa que sigue al incidente de Hugging Face
El plan de seguridad de OpenAI daba por hecho que el modelo no podía llegar a internet en vivo y que la vigilancia detectaría cualquier intento que lo lograra. Por eso paró la ejecución afectada y decidió la pausa hasta validar que el hueco está cerrado y someter el sistema a más ataques simulados. Este modelo no volverá a entrenarse, aunque su señal de recompensa ya penalizaba bien esta conducta: cuando se reanude el entrenamiento, arrancará una ejecución nueva con más mejoras de alineamiento.
La pausa llega tras el incidente de Hugging Face, después del cual OpenAI asegura haber endurecido su entorno de investigación y haberlo sometido de forma continua a ataques simulados. Ahora ha añadido bloqueos en dos capas independientes, cualquiera de las cuales habría impedido este acceso, y ha limitado las consultas DNS a una lista cerrada de dominios y tipos de registro. La compañía admite que «este incidente es mucho menos grave que algunos de nuestros incidentes anteriores», pero, al ser el primero desde aquel refuerzo, le da «una señal importante» sobre dónde centrar la siguiente fase.
Te puede interesar
Tech Planet participa en el programa de afiliados de Amazon. Si compras a través de estos enlaces, recibimos una pequeña comisión sin coste extra para ti, lo que nos ayuda a seguir creando contenido como este.
| Imagen | Producto | Características | Comprar |
|---|---|---|---|
![]() |
Corsair Vengeance DDR5 64 GB | 64 GB (2 × 32 GB) · DDR5 hasta 6000 MHz · AMD EXPO e Intel XMP 3.0 | Ver precio en Amazon |
![]() |
GMKtec EVO-X2 AI | AMD Ryzen AI Max+ 395 · 16 núcleos / 32 hilos · 64 GB DDR5 · SSD de 1 TB · 126 TOPS · 2 USB4 | Ver precio en Amazon |
![]() |
Bosgame M5 | AMD Ryzen AI Max+ 395 · 128 GB LPDDR5X de memoria unificada · SSD de 2 TB · Wi-Fi 7 · 2 USB4 | Ver precio en Amazon |
![]() |
Yahboom Jetson Orin Nano Super 8 GB, kit básico | 8 GB · hasta 67 TOPS · SSD de 256 GB · CPU Arm Cortex-A78AE de 6 núcleos · Ethernet de 1000 Mbps | Ver precio en Amazon |
Escrito por Eloy Andrade









