Imagen: Google DeepMind
Google ha presentado Gemini 3.8 Flash y una variante especializada llamada Gemini 3.8 Flash Cyber, según anuncia Google DeepMind en Google DeepMind. Es el tercer lanzamiento de la familia Flash en solo seis semanas, y llega apenas tres semanas después de Gemini 3.7 Flash.
Según la compañía, 3.8 Flash es su mejor modelo de razonamiento y programación hasta la fecha, y mantiene la misma velocidad y el mismo coste bajo que 3.7. Las dos variantes comparten un núcleo de inteligencia común, que Google dice haber acelerado con bucles agénticos de larga duración que evalúan y refinan el propio modelo de forma recursiva. La compañía atribuye buena parte de las mejoras a un entrenamiento intensivo en ciberseguridad, un dominio que describe como especialmente exigente.
3.8 Flash está pensado para agentes autónomos y tareas de programación largas
Google dice que 3.8 Flash aporta mejoras sustanciales respecto a 3.7 Flash y que, en varios casos, se acerca al rendimiento de modelos de vanguardia mucho más caros. En el benchmark DeepSWE v1.1, orientado a ingeniería de software de largo recorrido, la compañía afirma que el modelo supera a la mayoría de modelos de vanguardia de mayor tamaño al resolver problemas complejos de ingeniería de principio a fin, y con una fracción de su coste.
Google también sostiene que el modelo muestra la fiabilidad necesaria para tareas autónomas críticas en entornos empresariales, y que en campos cuantitativos y profesionales supera a 3.7 Flash y a otros modelos de vanguardia en pruebas como Vals Finance Agent V2 y el Legal Agent Benchmark de Harvey. En HLE-Verified, la compañía cita un resultado del 54,9%, que según Google demuestra su capacidad de razonamiento en varios pasos en materias de ciencias, humanidades y campos profesionales.
El modelo trabaja más, lo que puede traducirse en más tokens gastados
Google explica que estas mejoras responden a una decisión de diseño concreta: en tareas complejas, 3.8 Flash ejecuta pasos de razonamiento adicionales y llama a herramientas de forma iterativa. La propia compañía advierte de que, en ciertos casos, el modelo puede usar más tokens para maximizar el rendimiento, sobre todo con niveles de esfuerzo más altos.
Ahí está la decisión práctica para quien ya usa Gemini en producción: no basta con mirar qué modelo rinde mejor, sino qué combinación de esfuerzo y consumo conviene a cada tarea. Google ofrece una salida concreta: los desarrolladores pueden usar niveles de esfuerzo más bajos para minimizar el gasto de tokens, o seguir apoyándose en Gemini 3.7 Flash, que la compañía mantiene disponible para cargas de trabajo centradas en la eficiencia. Es decir, 3.8 Flash no sustituye automáticamente a 3.7 Flash: para quien prioriza el coste por encima de la profundidad de razonamiento, la generación anterior sigue siendo la opción que la propia compañía recomienda mantener.
Flash Cyber busca vulnerabilidades y prioriza parchearlas antes que explotarlas
La variante Gemini 3.8 Flash Cyber está dirigida, de momento, a un grupo reducido de organizaciones defensoras a través del Fairwind Program de Google. La compañía dice que ofrece rendimiento de vanguardia en el descubrimiento autónomo de vulnerabilidades en CyberGym, el benchmark estándar del sector para esta tarea, superando tanto a su predecesor 3.5 Flash Cyber como a modelos de vanguardia significativamente más grandes.
Google también dice haber evaluado el modelo contra un benchmark interno que cubre 20 lenguajes de programación distintos, donde asegura que da un salto notable respecto a sus predecesores y alcanza una tasa de éxito superior al 70%.
En cuanto al parcheo automatizado, la compañía afirma haber priorizado desde el principio la corrección de vulnerabilidades por delante de capacidades ofensivas como la explotación. En CWE-Bench, un benchmark externo gestionado por Collinear, Google sitúa a 3.8 Flash Cyber en la frontera de Pareto, con un pass@1 del 47,2% frente al 47,8% de un modelo de vanguardia líder, a un coste que la compañía describe como significativamente menor. Google añade que ya está usando este modelo para asegurar código de forma interna, aunque no detalla ejemplos concretos.
Google dice haber reforzado la protección frente a inyección de prompts
Ambas variantes incorporan, según Google, salvaguardas frente al uso indebido en dominios como el químico, biológico, radiológico y nuclear (CBRN) y la ofensiva cibernética, en línea con su Frontier Safety Framework. Flash Cyber, al llevar un conjunto de mitigaciones más permisivo en materia de ciberseguridad, solo se ofrece a defensores de confianza que necesiten capacidades más completas.
La compañía asegura además que los modelos 3.8 han dado un salto significativo en robustez frente a ataques de inyección de prompts, medido según Gray Swan, una firma externa dedicada a evaluar este tipo de vulnerabilidades. Google no ha detallado precios concretos, fechas de disponibilidad general ni condiciones de acceso más allá de lo descrito para el Fairwind Program.
Escrito por Eloy Andrade




