Gemini Omni 1.1 Flash ya encadena vídeos continuos de hasta 40 segundos

El 27 de agosto, Google puso a disposición de los desarrolladores el modelo de vídeo Gemini Omni 1.1 Flash. Google AI Studio abrió el acceso ese mismo día, la API de la plataforma Gemini Enterprise Agent se integró simultáneamente, y Google Flow y la app Gemini se activaron para los suscriptores de los planes Plus, Pro y Ultra. En su blog, Google calificó así esta versión:

"Omni 1.1 is production-ready for professional use via the Gemini API."
(A través de la API de Gemini, Omni 1.1 ya está listo para uso profesional en producción.)

La ventana de continuación pasa de un segundo a diez

El cambio más sustancial está en la continuidad de escena. En la versión de finales de junio, al continuar un vídeo el modelo solo leía el último segundo: la información recibida equivalía básicamente a un fotograma estático, y no podía saber hacia dónde se movía la cámara ni en qué punto había quedado el gesto de un personaje. El siguiente tramo, por eso, solía parecer otra locación — la consistencia del personaje entre escenas no se sostenía, algo que el propio Google había reconocido en la documentación de la versión anterior.

La 1.1 amplía esa ventana a los diez segundos previos. La continuación sigue avanzando en tramos de diez segundos, pero la duración acumulada puede llegar a cuarenta segundos. Una novedad añadida es que se puede especificar tanto el primer como el último fotograma, con lo que la transición pasa de 'generar y luego elegir' a 'fijar ambos extremos y dejar que el modelo rellene el medio'. Quien trabaja con storyboards conoce bien esta lógica: con los fotogramas clave fijados, el movimiento intermedio tiene por fin un punto de apoyo.

Modo borrador, escalado a 4K y referencia de vídeo de tres segundos

El resto de cambios apuntan al flujo de trabajo: se añade un modo borrador en 360p, con una velocidad de generación hasta un 60% más rápida que en 720p, pensado para revisar composiciones con rapidez; una vez fijado el corte final, se puede escalar a 4K. En la entrada multimodal se añade la referencia de vídeo, con un máximo de tres segundos por tramo — antes solo se podía alimentar con texto e imágenes. La salida final llega en 1080p y 4K.

La referencia de vídeo cambia la forma de expresión en el lado de la entrada. Antes, para enseñarle al modelo un movimiento de cámara, solo quedaba describirlo con texto — 'paneo lento hacia la izquierda, ligero temblor de cámara en mano' —, y cuánto captaba el modelo de eso era cuestión de suerte; ahora se le puede pasar directamente un clip de muestra de tres segundos. Tres segundos no bastan para una escena completa, pero sí para un movimiento de cámara entero o un ciclo de acción, y para series que necesitan un lenguaje visual coherente, esto ahorra mucho más trabajo que escribir diez líneas de prompt. El modo borrador en 360p forma pareja con esto: primero se fija en baja resolución lo estructural — ritmo, composición, movimiento de cámara —, y después se pasa a alta resolución para añadir detalle, sin pagar el precio completo en cada ronda.

Cuánto cuesta un clip de cuarenta segundos

Esta vez Google no publicó el precio por segundo desglosado por resolución, sino que dejó solo una referencia de conversión en la documentación de precios: la salida de vídeo se cobra por token, un segundo en 720p equivale a 5792 tokens, la salida de vídeo del nivel estándar cuesta 17,50 dólares por millón de tokens, lo que, calculado a la inversa, da cerca de 0,10 dólares por segundo. Esta cifra coincide con la de la versión de finales de junio, sin cambios en dos meses.

Calculado a grandes rasgos en 720p, un clip continuo de cuarenta segundos cuesta unos 4 dólares. El cálculo del modo borrador va aparte: si primero se usa 360p para filtrar diez composiciones hasta quedarse con tres, y luego se renderizan esas tres en 720p o 1080p para el corte final, el mismo presupuesto permite probar dos rondas más de lenguaje visual. El precio real de 1080p y 4K, Google no lo ha publicado; siguiendo la lógica de facturación por token, se puede deducir que a mayor resolución, más tokens por unidad de tiempo y, por tanto, mayor precio — el múltiplo exacto queda pendiente de que se complete la documentación.

La línea de duración sigue empujándose hacia adelante

Viendo la línea de productos Omni en conjunto, el ritmo queda bastante claro. La versión preview de finales de junio limitaba cada segmento a diez segundos, a 0,1 dólares por segundo, con la limitación declarada sin rodeos. Dos meses después, la duración de cada segmento no ha cambiado, pero ahora se puede encadenar tres veces más, la duración total se ha cuadruplicado y la ventana de contexto se ha multiplicado por diez. Google sigue el camino de encadenar segmentos: en lugar de inflar la longitud de una sola generación, acumula la duración total haciendo que cada segmento sea retomado con precisión por el siguiente. Este camino es más amable con la memoria de vídeo y el costo de inferencia, y el precio a pagar es que la estabilidad en las costuras tiene que sostenerse casi por completo en la ventana de contexto — que la ventana pase de un segundo a diez es precisamente el parche para ese agujero.

Cuarenta segundos no dan para montar un anuncio completo, pero para ese lote de vídeos cortos de diez a veinte segundos en redes sociales, un tramo ya alcanza, y dos tramos dan margen para editar. Que Google escriba 'listo para producción' en su blog es también una apuesta por ese tipo de trabajo: gran volumen, valor bajo por clip, pero con una exigencia básica de continuidad.

Fuentes: blog de desarrolladores de Google, Google DeepMind, CocoLoop, documentación de precios de la API de Gemini; la referencia de conversión del precio por segundo se verificó con base en 5792 tokens por segundo en 720p y 17,50 dólares por millón de tokens en la salida de vídeo del nivel estándar.