Gemini Omni 1.1 Flash: vídeos de hasta 40 segundos, contexto ampliado y renderizado en 4K

Gemini Omni 1.1 Flash: vídeos de hasta 40 segundos, contexto ampliado y renderizado en 4K

Google mejora su modelo de generación de vídeo con Gemini Omni 1.1 Flash, una actualización que se enfoca más en resolver uno de los problemas más persistentes de la generación de vídeo: mantener una verdadera continuidad entre varias escenas que en producir un clip espectacular en cuestión de segundos.

El nuevo modelo ahora puede analizar hasta 10 segundos de vídeo previo antes de extender una escena, ampliando un proyecto hasta 40 segundos, generar una transición entre una primera y una última imagen impuestas y producir borradores en 360p a un costo significativamente menor. Google claramente busca llevar a Gemini Omni de ser una mera demostración creativa a convertirse en una verdadera herramienta de producción.

Gemini puede ahora «recordar» los 10 segundos anteriores

La principal mejora consiste en la continuidad temporal. Cuando un usuario pide a Gemini Omni que extienda un vídeo, el modelo puede ahora analizar hasta 10 segundos del contenido anterior. La generación anterior sólo se refería esencialmente al último segundo.

Esta diferencia es significativa.

Un solo segundo permite entender la posición actual de un personaje o la composición del último plano, pero aporta relativamente poca información sobre lo que realmente acaba de suceder.

Diez segundos ofrecen mucho más contexto sobre los movimientos, la dirección de la cámara, la apariencia de los personajes y la evolución narrativa de la escena.

Una respuesta directa al problema de la coherencia en los vídeos IA

La generación de vídeo ha sufrido desde hace tiempo problemas de continuidad. Un personaje puede cambiar ligeramente de rostro, una prenda puede cambiar de color, un objeto puede desaparecer entre dos planos, y la cámara a veces mueve sin considerar lo que ocurrió antes. Google busca precisamente reducir este fenómeno con Omni 1.1.

Al dar más contexto a cada nueva extensión, el modelo posee una mejor comprensión del estado de la escena antes de generar la continuidad. Eso no garantiza, por supuesto, una continuidad perfecta, pero el enfoque se aproxima mucho más a la lógica de una edición real.

Los vídeos pueden alcanzar 40 segundos

Google también ha incrementado significativamente la duración máxima de una secuencia. Un vídeo puede ser extendido en bloques de 10 segundos, hasta alcanzar una duración máxima acumulativa de 40 segundos. Cuarenta segundos siguen siendo extremadamente cortos frente a una producción de vídeo tradicional. Sin embargo, en el mundo de la generación IA, donde muchos clips permanecen limitados a unos pocos segundos, esta duración se vuelve lo suficientemente extensa como para construir una pequeña secuencia narrativa.

Un creador puede imaginar una introducción, varios movimientos de cámara y una conclusión sin tener que ensamblar manualmente una sucesión de clips totalmente independientes.

Las extensiones pueden seguir nuevas instrucciones

Cada prolongación también puede recibir un nuevo prompt. Un usuario puede comenzar con una primera escena, luego pedir a la cámara que retroceda y luego continuar en un nuevo entorno o introducir un personaje.

Gemini conserva el contexto anterior mientras considera la nueva instrucción. Esta lógica permite construir progresivamente una secuencia en lugar de definir todo en un extenso prompt inicial. Se aproxima especialmente a la generación de vídeo a la edición conversacional ya destacada por Google con la primera versión de Omni.

Puedes imponer la primera y la última imagen

Otra novedad particularmente interesante es la interpolación entre dos imágenes clave. El usuario puede proporcionar a Gemini la primera imagen deseada de un plano y la última imagen. Luego, Omni 1.1 se encarga de generar todo lo que debe ocurrir entre ellas.

Esta función da mucho más control sobre el resultado final. En lugar de pedir vagamente «haz girar la cámara alrededor del personaje», el creador puede determinar precisamente la composición inicial y la de llegada.

El modelo debe luego inventar una transición coherente entre estos dos estados.

Movimientos de cámara mucho más controlables

Google menciona específicamente las rotaciones de cámara, los zooms, las transiciones complejas o los planos continuos. El sistema puede, por ejemplo, comenzar con un personaje en primer plano y terminar con una composición mucho más amplia. También puede generar un movimiento alrededor de un sujeto sin necesidad de definir precisamente cada imagen intermedia.

Este principio es similar a los keyframes utilizados durante mucho tiempo en software de animación y edición. La diferencia es que la IA genera automáticamente todo el trayecto visual entre los dos puntos.

Una función especialmente útil para bucles de vídeo

Las dos imágenes también pueden servir para construir un bucle. Si la primera y la última composición son cuidadosamente seleccionadas, Gemini puede producir una transición que regrese visualmente a su punto de partida. Esto podría ser útil para animaciones destinadas a redes sociales, interfaces o fondos.

Los vídeos generativos a menudo tienen dificultades para producir bucles perfectamente fluidos. El control explícito de los dos extremos reduce considerablemente la incertidumbre.

Tres segundos de vídeo pueden servir como referencia

Gemini Omni 1.1 Flash también acepta referencias de vídeo. El creador puede proporcionar hasta tres segundos de un clip existente para transmitir al modelo más contexto visual. Google presenta esta función específicamente como un medio para mejorar la coherencia de los personajes y los movimientos. Una referencia puede, por ejemplo, indicar cómo debe bailar un personaje o la dinámica de un movimiento específico.

El modelo utiliza esta información para generar una nueva escena.

El vídeo de referencia se convierte en el equivalente del «style prompt»

Esta función es especialmente interesante porque un movimiento es difícil de describir solo con palabras. Explicar precisamente una coreografía, un caminar o un movimiento de cámara puede requerir un prompt extremadamente largo. Un breve vídeo transmite esta información de manera mucho más directa.

El modelo multimodal puede entonces analizar el movimiento en lugar de simplemente interpretar una descripción. Esta es precisamente una de las ventajas de Gemini Omni: aceptar múltiples tipos de entradas en el mismo flujo de trabajo.

El modo 360p reduce fuertemente el costo de las pruebas

Google también añade una función menos espectacular, pero probablemente muy importante en producción: los borradores en 360p. Un creador no necesita generar cada prueba inmediatamente en alta definición.

Omni 1.1 puede producir una vista previa de 360p anunciada como hasta un 60% más rápida que la generación estándar en 720p. Google también indica que el costo puede disminuir a aproximadamente un tercio del renderizado en 720p.

Para la fase de prototipado, el ahorro puede ser considerable.

Probar diez ideas antes de pagar por la correcta

La generación de vídeo sigue siendo costosa en recursos. Un creador puede producir fácilmente numerosas versiones antes de obtener el encuadre, el movimiento o el comportamiento del sujeto correctos. Generar cada una de estas iteraciones en alta definición desperdicia tiempo y recursos computacionales. El modo 360p adopta, por lo tanto, una lógica perfectamente clásica en los flujos de trabajo profesionales: trabajar con proxies o vistas previas ligeras antes de la renderización final.

La IA comienza así a integrar métodos utilizados durante mucho tiempo en cine y edición.

Hasta 1080p y 4K para la renderización final

Una vez validado el resultado, Gemini Omni 1.1 puede producir una versión en alta definición. Google anuncia salidas en 1080p, así como un upscale hasta 4K. En Flow, el creador puede comenzar con una versión rápida en 360p, seleccionar el mejor resultado y luego aumentar progresivamente la calidad. El 4K no significa, por supuesto, que cada detalle haya sido generado nativamente con la precisión de una cámara 4K.

Es un proceso de escalado y mejora del renderizado. Sin embargo, para la integración en flujos de trabajo profesionales, contar con un archivo final de esa resolución facilita enormemente la edición y difusión.

Google quiere que Omni sea «apto para la producción»

Esa es precisamente la terminología utilizada por Google. Omni 1.1 Flash se presenta como una evolución destinada a hacer el modelo más adecuado para la producción real. Las novedades van todas en esta dirección. Más continuidad, más control, borradores más baratos, salidas en alta resolución, referencias de vídeo, o incluso keyframes de inicio y fin. Ya no se trata simplemente de demostrar que un modelo puede producir un hermoso vídeo a partir de texto.

Google ahora trabaja en todo lo que hace que este vídeo sea predecible y utilizable.

Flow se convierte en el estudio creativo preferido de Google

Estas funciones están disponibles en Google Flow, la plataforma creativa lanzada en torno a los modelos generativos de Google. Omni 1.1 Flash está accesible a nivel mundial para los suscriptores de Google AI Plus, Pro y Ultra.

Flow se está convirtiendo gradualmente en el laboratorio donde Google ensambla sus modelos de generación y sus herramientas de edición. El objetivo ya no es producir un clip y luego salir de la aplicación. Google quiere permitir a los creadores experimentar, modificar, extender y finalizar una secuencia en el mismo entorno.

No obstante, Google no reserva todas las funciones únicamente para los creadores que utilizan Flow. La extensión de las escenas también llega directamente a la aplicación Gemini para los suscriptores de Google AI Plus, Pro y Ultra. Esto probablemente democratiza una de las funciones más inmediatamente impresionantes del modelo.

Un usuario puede tomar un vídeo existente y simplemente pedir a Gemini que continúe lo que está sucediendo. El resto de las herramientas más avanzadas, por supuesto, se adaptan mejor a Flow o las API.

Probablemente, esta es la lección principal de Gemini Omni 1.1. El fotorrealismo atrae inmediatamente la atención en una demostración. Pero, para contar una historia, la continuidad es mucho más importante. Una escena ligeramente menos espectacular pero coherente durante 30 segundos es a menudo más útil que una sucesión de clips de cinco segundos magníficos pero incompatibles.

Google parece estar optimizando sus modelos en torno a esta realidad. Los diez segundos de memoria contextual constituyen, a este respecto, una evolución mucho más significativa que un simple aumento de resolución.


Scroll al inicio