Gemini deja que el modelo elija los fotogramas, -88% de tokens

El 1 de septiembre, Google lanzó en la Gemini API un modo de procesamiento de vídeo llamado agentic video, que devuelve al propio modelo la decisión de «cómo ver el vídeo». Los desarrolladores ya pueden usarlo, la app Gemini lo irá incorporando después, y la función Ask YouTube de YouTube tiene previsto integrarlo en los próximos meses.

El cambio ocurre en la capa de muestreo. Hasta ahora Gemini procesaba vídeo con una tasa de fotogramas fija, por defecto uno por segundo, sin importar si el material era una rueda de prensa o una grabación de videovigilancia: todo entraba en el contexto al mismo ritmo. En el nuevo modo, el modelo cuenta con herramientas nativas de vídeo y decide, mientras razona, qué tramos observar, a qué velocidad, y si recurre a los fotogramas visuales, al audio o a los subtítulos, recuperando solo los momentos que necesita.

Tres cifras

El resultado comparativo que ha hecho público Google: el consumo de tokens cae hasta un 88%, el costo cae hasta un 66%, y la precisión sube hasta un 7%. Otra conclusión que se ofrece es que Gemini 3.7 Flash ha alcanzado la frontera de Pareto entre precisión y costo en análisis de vídeo, es decir, al mismo precio no se encuentra una opción más precisa, y a la misma precisión no se encuentra una más barata.

De las tres cifras, la tercera es la más contraintuitiva. Reducir el muestreo suele implicar pérdida de información: ver menos debería significar saber menos. Que la puntuación suba en sentido contrario se debe a que la tasa fija de fotogramas generaba a la vez desperdicio y omisión: en una grabación de reunión de dos horas, la mayoría de los fotogramas muestran a la misma persona frente a la misma diapositiva, y ese contenido repetido consume el presupuesto de contexto; mientras que la acción realmente clave puede ocurrir en un solo segundo, y a 1 FPS se pasa por alto justo ahí. Recuperar tramos según la necesidad elimina los fotogramas redundantes y, a la vez, permite elevar la densidad de muestreo donde hace falta.

Una cuenta a grandes rasgos

Una hora de material a un fotograma por segundo son 3.600 fotogramas; metiendo cada uno en el contexto, el volumen de tokens de entrada arranca ya en el orden de las seis cifras (cálculo aproximado). Esa cifra por sí sola descarta muchas aplicaciones: la repetición de una transmisión en directo de tres horas, una semana de cámaras de una tienda, un documental completo — solo el costo de recorrer el material una vez ya supera el valor de negocio que aporta. Recortando un 88%, la cifra vuelve al orden de las cinco cifras, y es justo en ese orden de magnitud donde el análisis de vídeos largos deja de ser una demo y pasa a caber en un producto.

Lo que Google ha hecho repetidamente este año en la línea Flash apunta, en el fondo, al costo unitario. En vídeo, el avance anterior consistía en alargar la duración procesable de una sola vez; ahora se trata de reducir el costo por unidad de duración. Las dos cosas juntas tienen un efecto mucho más visible que cualquiera de ellas por separado.

Modelos compatibles y cómo activarlo

Los modelos que lo soportan son Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite, accesibles desde la Gemini API (a través de Google AI Studio) y desde la Gemini Enterprise Agent Platform. La facturación sigue el precio estándar de tokens de la Gemini API, sin cobro adicional por la función: los tokens ahorrados se reflejan directamente en la factura. El cambio del lado del desarrollador es mínimo, basta con fijar el método de procesamiento como agentic en la configuración.

Los cuatro usos típicos que enumera Google también dejan ver a qué escenarios apunta: localización de tramos con precisión de menos de un segundo, para edición; búsqueda tipo aguja en un pajar en vídeos largos de varias horas; detección de anomalías mediante remuestreo dinámico; y conteo preciso de acciones y objetos a lo largo de la línea temporal. Los dos primeros se inclinan hacia la industria de contenidos, los dos últimos apuntan claramente a escenarios industriales como videovigilancia, control de calidad e inspección.

Cómo hacen esta cuenta los equipos en China

Los equipos de distribución de vídeo corto, control de calidad de transmisiones en directo y revisión de seguridad antes casi no podían cuadrar las cuentas del vídeo largo; la práctica habitual era usar primero un modelo barato o visión artificial tradicional para un filtrado grueso, y solo después pasar los tramos sospechosos a un modelo grande. Al trasladarse al modelo la decisión de muestreo, este flujo puede prescindir de un paso: el filtrado grueso queda incorporado al propio proceso de razonamiento del modelo.

Conviene dejar una advertencia: 88%, 66% y 7% son cifras de «hasta», tomadas del escenario más favorable. Según el tipo de material y de problema, la ganancia real bajará en distinta medida, y Google no ha dado una distribución. Para llevarlo de verdad a producción, sigue haciendo falta correr una prueba comparativa con el material propio.

Fuentes: blog oficial de Google, CocoLoop, Google DeepMind; las cifras de 88% menos tokens, 66% menos costo y 7% más precisión, junto con los modelos compatibles y la forma de facturación, se han verificado según el anuncio oficial; la conversión del número de fotogramas es una estimación aproximada de la redacción.