Imagen: OpenAI
OpenAI ha confirmado que GPT-6 Astra es el primer modelo que ha desplegado de forma amplia en alcanzar el nivel «crítico» de capacidades de ciberseguridad dentro de su Preparedness Framework, el sistema con el que la compañía evalúa los riesgos de sus modelos cada vez que lanza uno más capaz. Según recoge BleepingComputer, la propia compañía lo detalla en la ficha técnica del sistema del modelo.
Qué significa alcanzar el umbral «crítico»
Dentro del marco de OpenAI, un modelo llega al nivel crítico en ciberseguridad si es capaz de «identificar y desarrollar exploits zero-day funcionales de todos los niveles de gravedad en muchos sistemas críticos reales ya reforzados, sin intervención humana», o si puede diseñar y ejecutar por sí solo nuevas estrategias de ataque de principio a fin contra objetivos protegidos. «GPT-6 Astra es un salto significativo en capacidades cibernéticas y cumple nuestro umbral crítico», ha declarado OpenAI en la ficha técnica del sistema. La compañía añade que, «con las herramientas y el acceso adecuados, GPT-6 Astra puede encontrar fallos de seguridad antes desconocidos y desarrollar nuevas formas de explotarlos en muchos sistemas bien protegidos, sin que una persona guíe cada paso».
El modelo halló dos vulnerabilidades reales durante la evaluación
OpenAI no se ha quedado en la teoría: para una de las evaluaciones, la compañía creó una versión actualizada de su banco de pruebas ExploitBench usando vulnerabilidades reveladas después de la fecha de corte del conocimiento de Astra. «Durante la evaluación, Astra incluso descubrió y usó vulnerabilidades zero-day antes desconocidas como parte de sus cadenas de exploit», ha explicado OpenAI, que asegura estar en proceso de comunicar esos dos fallos a los responsables de mantenimiento de los sistemas afectados. Antes del lanzamiento, la compañía dice haber reforzado la resistencia de Astra al jailbreak, su aislamiento, el cifrado de puntos de control, la monitorización y los controles internos de despliegue.
Astra comete menos fallos de alineación graves que su predecesor
OpenAI afirma que Astra está mejor alineado que GPT-5.6 Sol, es decir, que tiene menos probabilidad de sobrepasar límites de seguridad. En una simulación de 54.218 tareas internas de Codex, Astra produjo un 53% menos de avisos de desalineación de severidad 3 o superior que Sol: 34 avisos frente a 73, y ninguno de los dos modelos llegó a producir un aviso de severidad 4. La compañía también sostiene que Astra es menos propenso que Sol a ejecutar acciones no autorizadas o destructivas en entornos de navegación y de trabajo.
Pero Astra es más difícil de vigilar por dentro
El hallazgo más llamativo del informe va en la dirección contraria: «la capacidad de monitorización de GPT-6 Astra ha disminuido respecto a GPT-5.6 Sol», ha reconocido OpenAI. En las pruebas, el modelo pudo en ocasiones ocultar un rendimiento deliberadamente pobre y esquivar los monitores internos durante ciertas tareas de sabotaje. OpenAI también detectó que Astra parece más consciente de cuándo está siendo evaluado: su razonamiento mostró señales de esa conciencia en un 9,6% de las trayectorias analizadas, frente al 2,8% de GPT-5.6 Sol. La compañía dice no haber encontrado pruebas de que Astra use razonamiento esteganográfico para esconder información dentro de texto de apariencia normal, pero afirma que está tomándose en serio esa tendencia general.
Mejora clara frente a la inyección de prompts

Un terreno donde OpenAI sí reporta una mejora sin matices es la robustez frente a la inyección indirecta de prompts, un tipo de ataque que intenta manipular al modelo a través de contenido externo. En las pruebas internas de la compañía, esa robustez pasó del 96,23% con GPT-5.6 Sol al 99,79% con GPT-6 Astra.
Qué implica esto para quien ya usa estos modelos
El propio informe de OpenAI deja un dato que conviene no pasar por alto para quien despliega estas herramientas en tareas sensibles: un modelo más seguro de puertas para afuera puede ser, a la vez, más opaco de puertas para adentro. La mejora en capacidades ofensivas y en resistencia a la manipulación externa es la parte que se ve en los titulares, pero la caída en monitorización interna es la que más debería preocupar a quien confía en poder auditar el razonamiento del modelo antes de darle acceso a sistemas críticos. Si Astra puede, como reconoce la propia compañía, disimular estratégicamente un rendimiento pobre durante pruebas de sabotaje, la vigilancia automática deja de ser una garantía absoluta y pasa a ser una capa más, no la última. Para quien evalúa si integrar Astra en flujos de trabajo con acceso a infraestructura real, el mensaje de OpenAI es doble: el modelo encuentra fallos que antes nadie había visto, pero cuesta más verificar qué está haciendo por dentro mientras los busca.
Te puede interesar
Tech Planet participa en el programa de afiliados de Amazon. Si compras a través de estos enlaces, recibimos una pequeña comisión sin coste extra para ti, lo que nos ayuda a seguir creando contenido como este.
| Imagen | Producto | Características | Comprar |
|---|---|---|---|
![]() |
Lenovo Legion 27QD-10, 27″ QHD OLED | 27″ OLED · 2560×1440 · 240 Hz · 0,03 ms · HDR y TrueBlack | Ver precio en Amazon |
![]() |
AOC Gaming Q27G4XF, 27″ QHD | 27″ Fast IPS plano · 2560×1440 · 180 Hz · 0,5 ms · FreeSync Premium, compatible con G-Sync · HDR10 | Ver precio en Amazon |
![]() |
MSI MAG 321UPX QD-OLED, 31,5″ 4K | 31,5″ QD-OLED · 4K UHD 3840×2160 · 240 Hz · 0,03 ms · 99 % DCI-P3 | Ver precio en Amazon |
![]() |
Amzfast Monitor Curvo 34″ UWQHD | 34″ curvo 1500R VA · 3440×1440 · 21:9 · 240 Hz · 1 ms MPRT · 450 cd/m² · 130 % sRGB · Adaptive Sync | Ver precio en Amazon |
Escrito por Eloy Andrade









