Midjourney presenta V1: su primer modelo de vídeo para animar imágenes con inteligencia artificial

La herramienta ya está disponible en la web y entra en competencia directa con Sora (OpenAI), Veo (Google) y Kling (ByteDance)

La inteligencia artificial avanza ahora también en el terreno del vídeo, y Midjourney, una de las plataformas más populares para generar imágenes con IA, ha decidido dar el salto. La compañía ha lanzado su primer modelo de vídeo, conocido como V1, con el que los usuarios pueden transformar una imagen estática en una animación de hasta 20 segundos en cuestión de segundos.

Este lanzamiento no solo representa una nueva funcionalidad dentro de Midjourney, sino que también posiciona a la compañía dentro de una carrera global en la que ya compiten gigantes como OpenAI (con Sora), Google DeepMind (con Veo) y ByteDance (con Kling).

De la imagen al vídeo, sin complicaciones

Midjourney V1 apuesta por la sencillez. El usuario genera o sube una imagen, pulsa el botón Animate, y obtiene cuatro versiones animadas de cinco segundos cada una. Luego, si lo desea, puede prolongar el vídeo en bloques de cuatro segundos, hasta alcanzar los 20 segundos máximos.

Hay dos formas de animar las imágenes:

  • Modo automático, donde la IA interpreta cómo debe moverse la escena.
  • Modo manual, en el que el usuario escribe una breve instrucción sobre el movimiento deseado (por ejemplo: “la cámara gira lentamente mientras el personaje flota hacia arriba”).

Además, existen dos configuraciones según el tipo de escena:

  • Movimiento bajo, pensado para tomas más tranquilas o atmosféricas.
  • Movimiento alto, para escenas más dinámicas, con movimientos de cámara y personajes simultáneos.

Comparación con otros modelos del mercado

Mientras que Midjourney opta por una experiencia directa y visual, sus competidores ofrecen planteamientos más orientados a la generación narrativa o cinematográfica a partir de texto. Estas son algunas diferencias clave:

ModeloEmpresaEntrada principalDuración de vídeoNivel de detalleAcceso actual
V1MidjourneyImagen + promptHasta 20 sEstético, limitadoDisponible (web)
SoraOpenAITextoHasta 1 minNarrativo, realistaCerrado (en pruebas)
VeoGoogle DeepMindTextoHasta 1 minCinematográficoAcceso limitado
KlingByteDanceTexto + imagen2–4 sRealismo facialLimitado (China)

Sora ha sorprendido con vídeos coherentes, largos y con estructuras complejas, simulando incluso escenas de acción o narrativa emocional. Veo, por su parte, destaca por la calidad de imagen y movimientos cinematográficos. Kling ha puesto el foco en el realismo, con animaciones labiales y expresiones faciales muy precisas, aunque de duración muy breve.

Midjourney, en cambio, se diferencia por su acceso inmediato, su integración con su sistema de generación de imágenes y su curva de aprendizaje mucho más baja. Cualquier persona, con o sin experiencia, puede empezar a crear vídeos desde su navegador.

Precio y uso responsable

El modelo V1 tiene un coste estimado ocho veces mayor que el de generar una imagen, lo que se traduce en aproximadamente una imagen por cada segundo de vídeo. Esta tarifa, según la empresa, es más de 25 veces inferior al coste actual de modelos similares en el mercado.

La compañía ha recordado la importancia del uso responsable de la tecnología. “Si se utiliza correctamente, no solo es divertido. También puede ser útil, educativo o incluso inspirador”, indica Midjourney en su anuncio.

Este mensaje cobra especial relevancia en el contexto actual, ya que Disney y Universal han presentado demandas legales contra la empresa, acusándola de haber entrenado su modelo con obras protegidas por derechos de autor. Se han mostrado ejemplos de personajes como Darth Vader y Homer Simpson generados con IA que, según los demandantes, reproducen de forma idéntica materiales originales.

El futuro: mundos vivos y generativos

Midjourney ha adelantado que V1 no es el punto final, sino un primer paso hacia una visión más amplia: la creación de mundos virtuales generativos, donde las imágenes cobren vida, puedan moverse en 3D y reaccionar al usuario en tiempo real.

“La dirección natural de esta tecnología es construir simulaciones abiertas, en tiempo real, donde puedas moverte e interactuar con todo”, explican desde la compañía. “Para eso necesitamos modelos de imagen, vídeo, 3D y velocidad”.

Mientras tanto, el lanzamiento de V1 abre nuevas posibilidades para artistas, diseñadores, creadores de contenido y cualquier usuario curioso que quiera explorar los límites de la creatividad visual impulsada por IA. Y, sobre todo, lo hace con una propuesta clara: que la innovación también puede ser accesible.

Fuente: Noticias inteligencia artificial

Scroll al inicio