Google DeepMind ha anunciado que la comprensión de vídeo «agentic» ya está disponible en Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. Según explica la compañía en un artículo publicado en el blog de Google DeepMind, la nueva capacidad busca mejorar la precisión del análisis de vídeo mientras reduce de forma drástica el consumo de tokens y el coste de cada consulta.
La función funciona de forma parecida a la comprensión de imagen «agentic» que Google ya había introducido, que combina ejecución de código con el entendimiento nativo de imágenes de los modelos Gemini. En el caso del vídeo, Gemini usa sus propias herramientas nativas para buscar, escanear e inspeccionar segmentos concretos del vídeo, tanto en los fotogramas como en el audio y en la transcripción. Esto habilita usos como la localización de momentos con precisión de menos de un segundo, la detección de anomalías más fiable y el recuento preciso de elementos dentro de una grabación.
El sistema decide qué mirar en lugar de procesar todo el vídeo a ciegas
Hasta ahora, el procesamiento «estático» que usan los modelos de Gemini analiza el vídeo a una tasa fija de fotogramas por segundo, 1 FPS por defecto, ajustable a través de la API. Ese método obliga a elegir entre gastar muchos tokens para no perder detalle o recortar la frecuencia de muestreo y arriesgarse a perder información relevante. La comprensión «agentic» cambia el planteamiento: el modelo adopta un papel activo y decide qué mirar, a qué velocidad y a través de qué modalidad —fotogramas, audio o transcripción— en cada momento, en vez de tragarse el vídeo entero de forma uniforme.
Ese comportamiento se ejecuta mediante lo que Google describe como un bucle «agentic»: el modelo invoca una herramienta interna que carga solo la parte del archivo de vídeo que necesita en cada instante. Antes, los desarrolladores podían replicar ese filtrado a mano; ahora, según la compañía, Gemini lo hace de forma automática y reduce de manera notable la carga de desarrollo que exigía construir ese tipo de lógica por su cuenta.
Los ahorros llegan hasta el 88% en tokens en los benchmarks de la propia compañía
Según los datos de Google DeepMind, en los benchmarks estándar de análisis de vídeo, los modelos Gemini con comprensión «agentic» reducen el coste del análisis hasta un 66% y el consumo de tokens hasta un 88%, a la vez que mejoran la precisión hasta un 7%. La compañía precisa que estas ganancias son especialmente marcadas en el vídeo de formato largo, desde guías prácticas de diez minutos hasta clases de 90 minutos o grabaciones de varias horas, donde el procesamiento estático fuerza a elegir entre coste alto o técnicas que sacrifican detalles.
De los tres modelos, Gemini 3.7 Flash con comprensión «agentic» ofrece la mejor calidad general y la mejor combinación de calidad y eficiencia de coste, situándose según la compañía en la frontera de Pareto entre precisión y coste frente al resto de modelos probados. Google DeepMind señala además que sus socios de acceso anticipado registraron un buen rendimiento durante las pruebas, aunque no detalla cifras concretas de esos casos.
Qué cambia para quien ya construye sobre la API de Gemini
La función está disponible desde hoy para vídeos subidos y para vídeos de YouTube a través de la API de Gemini en Google AI Studio y en la Gemini Enterprise Agent Platform. Activarla no exige contratar nada aparte: usa el precio estándar por token de la API de Gemini, sin ningún cargo adicional por la función, y basta con configurar el procesamiento como «agentic» en los parámetros de la llamada.
Eso convierte esta novedad en algo relevante sobre todo para quien ya tiene una aplicación construida sobre análisis de vídeo con Gemini y paga por tokens: si el volumen de vídeo que procesa es largo —clases, reuniones grabadas, contenido de varias horas—, el ahorro de coste y de tokens es donde más se nota, según los propios datos de la compañía. Para quien solo analiza clips cortos, la ganancia no está necesariamente en la misma magnitud, porque el problema que resuelve la función —evitar el procesamiento uniforme y caro de vídeos largos— apenas existe con piezas breves.
La compañía también anuncia que la mejora de eficiencia y calidad llegará «próximamente» a la app de Gemini para el público general, en los modelos Flash y Flash-Lite, y que en los próximos meses impulsará la función «Ask YouTube» en la página de reproducción de vídeos de YouTube, apoyándose en Gemini para dar respuestas ancladas en lo que se ve en pantalla. Ninguna de estas dos expansiones tiene todavía fecha concreta: son, según la propia compañía, planes para «los próximos meses» y para «pronto», sin más precisión.
Para quien ya trabaja con la API de Gemini y procesa vídeo de forma habitual, el cambio no exige rehacer nada: basta con cambiar un parámetro de configuración para pasar de procesamiento estático a «agentic» y beneficiarse de las mismas tarifas de siempre, sin coste añadido por la función.
Escrito por Eloy Andrade





