Google DeepMind ha dado un nuevo paso en la carrera por el liderazgo en generación de video con inteligencia artificial al actualizar Veo 3.1, su modelo más avanzado, incorporando una función clave basada en imágenes de referencia que promete resultados mucho más dinámicos, coherentes y controlables para creadores y desarrolladores.
La gran novedad de esta actualización es la posibilidad de utilizar imágenes de referencia para guiar la generación de video, algo que hasta ahora suponía una de las principales limitaciones de los modelos generativos. Con esta mejora, los usuarios pueden subir una o varias imágenes que sirven como ancla visual para mantener la consistencia de personajes, estilos, objetos y escenarios a lo largo de distintas escenas.
Según la información publicada por medios especializados, Veo 3.1 permite ahora trabajar con hasta tres imágenes de referencia simultáneas, lo que abre la puerta a narrativas más complejas, secuencias con continuidad visual y un mayor control creativo. Esto resulta especialmente relevante para producciones donde la identidad visual es crítica, como storytelling, publicidad, cine experimental o contenido para redes sociales.
Otra mejora destacada es el soporte nativo para video vertical en formato 9:16, una decisión claramente orientada a plataformas como TikTok, YouTube Shorts e Instagram Reels. Hasta ahora, la mayoría de los modelos estaban pensados principalmente para formatos horizontales, obligando a recortes o adaptaciones que reducían la calidad del resultado final. Con Veo 3.1, Google busca alinearse con las necesidades reales del ecosistema de creadores actuales.
La actualización también incluye mejoras en resolución y calidad visual, con capacidades de upscaling que permiten alcanzar hasta 4K, además de movimientos de cámara más naturales, transiciones más suaves y una interpretación más precisa de las indicaciones textuales combinadas con referencias visuales. Todo esto contribuye a que los videos generados se perciban menos “artificiales” y más cercanos a producciones tradicionales.
Desde el punto de vista estratégico, esta evolución refuerza la posición de Google frente a otros actores clave del sector, como OpenAI, Runway o Pika. La apuesta por el uso de imágenes de referencia responde a una demanda creciente del mercado: menos aleatoriedad y más control, especialmente en entornos profesionales donde la coherencia visual es esencial.
Veo 3.1 forma parte del ecosistema de generación multimodal integrado en Gemini, y aunque su acceso sigue siendo limitado, la actualización anticipa el tipo de herramientas que marcarán el futuro de la creación audiovisual asistida por IA. En lugar de simples clips experimentales, Google apunta claramente a producciones más narrativas, reutilizables y orientadas a usos comerciales reales.
Con esta mejora, Google DeepMind deja claro que la próxima fase de la IA generativa no pasa solo por modelos más grandes, sino por herramientas más precisas, controlables y alineadas con el flujo creativo humano. Veo 3.1 es un paso firme en esa dirección.





