Crear una imagen con IA ya no es tan sorprendente como antes. Lo que marca la diferencia es la capacidad de modificarlo, darle continuidad y transformar una idea inicial en algo más detallado sin perder el hilo. Con el vídeo, este desafío es mucho mayor: hay movimiento, tiempo, física y personajes que aún necesitan parecer coherentes. Géminis Omni trae consigo la promesa de abordar este problema y hacer que la edición sea una tarea mucho más fácil.
El propio Google DeepMind pide pensar en Géminis Omni como en Nano Banana, pero para vídeo. La referencia tiene sentido ya que Nano Banana fue el generador de imágenes de Google que llevó la creación visual con IA a una escala muy impresionante. La primera versión, lanzada en agosto de 2025, 13 millones de usuarios agregados en cuatro días y había generado más de 5 mil millones de imágenes a mediados de octubre.
Google ahora presenta Gemini Omni Flash como el primer modelo de la familia Gemini Omni. Según la empresa, debería crear algo. Contenido de cada entrada. La idea es que el usuario pueda combinar imágenes, audio, video y texto como punto de partida para crear videos de alta calidad basados en el conocimiento del mundo real de Gemini.
Un modelo de generación de vídeo que se basa en la coherencia
La parte más interesante es cómo Google describe el proceso de edición. Se propone no sólo como una herramienta para generar un clip desde cero, sino también como un sistema que puede trabajar sobre una escena mediante instrucciones encadenadas. La compañía habla de cambiar ciertos elementos o transformar por completo un vídeo de lanzamiento ajustando la estética, la trama, el entorno, el ángulo, el estilo o ciertos detalles. También promete mantener la coherencia de los personajes, mantener la continuidad de la escena y proporcionar una física más coherente.
En su nota muestra cómo Gemini Omni puede partir de una escena y modificarla con instrucciones directas, ya sea para cambiar el material de un objeto, cambiar una acción o transformar una idea compleja en una explicación visual. Veamos algunos ejemplos de indicaciones.
- “Haz la escultura con burbujas”
- «Cuando la persona toca el espejo, el espejo se ondula maravillosamente como un líquido y el brazo de la persona se convierte en un material reflectante».
- “La plastilina explica el plegamiento de las proteínas, todo es de arcilla, sin manos, stop motion, preciso”
En lo logramos on / A Primera prueba con una imagen reconocible.: Puerta de Alcalá, en Madrid. El punto de partida fue una foto estática y el mensaje que utilizamos fue el siguiente:
- «Crea un vídeo a partir de esta imagen. Los coches avanzan y la gente camina». (Cree un video a partir de esta imagen. Los autos avanzan y la gente camina).
La idea era descubrir hasta qué punto Gemini Omni podía transformar una escena real en un pequeño clip en movimiento. Puedes ver exactamente eso en el vídeo de arriba. Intenta animar la imagen original.con coches avanzando, peatones caminando y ruido ambiental que se adapta a la escena. También parece que algunos elementos visibles de la marca permanecerán en los vehículos, en particular el logo de Mercedes-Benz, aunque en otros casos, como el de Fiat, el resultado es menos claro.
Hablemos de disponibilidad. Google está poniendo Gemini Omni Flash a disposición de los suscriptores de Google AI Plus, Pro y Ultra ahora a través de Gemini y Google Flow, mientras que la implementación gratuita en YouTube Shorts y la aplicación YouTube Create comienza esta semana.
Sin embargo, en nuestra prueba con una cuenta corporativa, nos enfrentamos a un límite bastante ajustado: después de generar tres vídeos, el sistema nos advirtió que «habíamos alcanzado nuestro límite de generación de vídeos el 20 de mayo a las 19:59». No es demasiado sorprendente si pensamos en lo que sucede a continuación: crear vídeos con IA requiere muchos recursos, por lo que todo hace pensar que Google limitaría el acceso, al menos en esta primera fase.
Cuando hablamos de generación de vídeos con inteligencia artificial, probablemente Sora sea lo primero que nos viene a la mente. Se vio así una de las grandes promesas de OpenAI para este terreno. Sin embargo, la ruta terminó siendo mucho más corta de lo que sugería el destino original. Su sitio web y su aplicación ya no estaban disponibles a finales de abril de 2026, pero la API seguirá funcionando hasta el 24 de septiembre.
Imágenes | Google |
En | Hay una batalla por el modelo de IA que codifica mejor. Y en él ha aparecido una competidora buena, bonita y muy barata: Cursor

