Google ha presentado Gemini Omni 1.1 Flash, la nueva versión de su modelo de generación de vídeo con inteligencia artificial. La actualización permite extender escenas hasta los 40 segundos sin perder la coherencia visual y añade control por fotogramas clave y escalado a 4K, dos funciones que amplían el margen de trabajo para quienes producen contenido audiovisual con IA.
La generación de vídeo con IA llevaba tiempo topándose con la misma limitación que nosotros mismos hemos notado al probar herramientas similares: la memoria del modelo apenas alcanzaba para recordar el último segundo de metraje, así que cualquier continuación acababa rompiendo la iluminación, el movimiento o la identidad de los personajes en pantalla. Con Omni 1.1 Flash, Google amplía esa ventana de análisis a los diez segundos previos del vídeo original, frente al único segundo que procesaba la versión anterior. De ahí que el modelo pueda mantener la física de una escena y la consistencia visual al generar el siguiente tramo, en lugar de improvisar sobre un fotograma suelto.
Extensión de escenas en bloques de diez segundos
El modelo puede construir secuencias de hasta 40 segundos, pero no lo hace de golpe: vamos a ver cómo. Omni 1.1 Flash genera el vídeo en fragmentos de diez segundos que se van encadenando, y cada bloque nuevo toma como referencia el tramo inmediatamente anterior. Este método escalonado deja margen para revisar el resultado antes de seguir generando y frena que un error de un fragmento se arrastre durante el resto de la secuencia.
A esa mejora se suma la interpolación de fotograma inicial y final: basta con subir una imagen que marque el arranque del plano y otra que marque el cierre para que el modelo calcule el movimiento intermedio entre ambas. Google plantea usos como órbitas de cámara, zooms, transiciones entre planos o bucles que deben encajar con un punto de partida y otro de llegada concretos. El sistema conserva además la edición conversacional de versiones anteriores, así que podemos pedir cambios sobre un clip ya generado sin reiniciar el proceso desde cero.
Escalado a 4K y precios por segundo de vídeo
La resolución por defecto sigue siendo 720p, con 360p disponible para pruebas rápidas. Tanto 1080p como 4K se consiguen mediante upscaling a partir de esa base, según recoge la documentación de la API de Gemini: el modelo no genera esos píxeles de forma nativa, los amplía después. Os aconsejamos tener presente esta matización antes de valorar la nitidez real del resultado que vamos a obtener.
Google ha fijado un precio distinto para cada resolución, lo que nos permite ajustar el gasto según la fase del proyecto:
- 360p: 0,03 dólares por segundo, pensado para borradores y pruebas de concepto.
- 720p: 0,10 dólares por segundo.
- 1080p: 0,15 dólares por segundo.
- 4K: la tarifa rondaría los 0,30 dólares por segundo si sigue la misma progresión que el resto de resoluciones, aunque este precio concreto no figura confirmado en la documentación disponible hasta el momento.
De confirmarse esa tarifa, un clip de 40 segundos en 4K rondaría los 12 dólares, frente a 1,20 dólares por la misma duración en 360p. La diferencia deja margen para probar ideas en calidad baja y reservar el gasto en 4K solo para el resultado ya validado, algo especialmente útil si el proyecto exige varias iteraciones antes de dar con la toma definitiva.
Dónde está disponible el nuevo modelo
Omni 1.1 Flash funciona ya a través de la Gemini API y de Google AI Studio, además de la Gemini Enterprise Agent Platform, lo que da acceso a desarrolladores que quieran integrarlo en sus propias herramientas. Para el público final, la actualización llega a Flow para quienes tienen suscripción a Google AI Plus, Pro o Ultra, y la función de extensión de escenas también está disponible para esos suscriptores directamente desde la app de Gemini.
El modelo se está abriendo paso además fuera del catálogo propio de Google. Adobe ha integrado Gemini Omni Flash en Firefly, lo que permite a quienes ya trabajan con esa suite de edición generar y extender vídeo sin salir de su flujo habitual. Google, por su parte, lo ha llevado también a Vids, su herramienta de creación de vídeo corporativo. Ambas integraciones abren la puerta a que la generación sintética de vídeo llegue a flujos de trabajo que hasta ahora dependían de otras aplicaciones de edición externas.
