Cómo convertir una imagen estática en un video con IA (guía completa)

Cómo convertir una imagen estática en un video con IA (guía completa)

Una guía práctica completa para convertir una imagen estática en un video con IA: elegir la imagen adecuada, planificar el movimiento, escribir prompts, generar y corregir lo que sale mal. Ejemplos reales: un deportivo en la costa, un retrato callejero, un plano aéreo de un cañón y una transformación de personaje.

Crear videos con IA
VidLux8 min de lectura

Image-to-video suena a producción de video complicada, pero el flujo de trabajo central son solo cinco pasos. Primero, la versión resumida:

Inicio rápido (5 pasos):
  1. Elige una imagen con un sujeto claro y espacio para moverse
  2. Decide qué debe moverse: cámara, sujeto o entorno. Un movimiento principal
  3. Escribe el prompt con una fórmula: sujeto + acción + estilo + cámara + luz + bloqueo
  4. Genera una vista previa de 8 segundos y comprueba si el movimiento resulta natural
  5. Si algo falla, cambia una variable y vuelve a generar

Todo lo que sigue proviene de pruebas reales, no de teoría. Ejecuté el ciclo completo en VidLux —elegir imágenes, generar, romper cosas y corregirlas— en cuatro casos que cubren los escenarios más comunes de image-to-video: un coche, un retrato, un paisaje y una transformación de personaje.

Paso 1: elige una imagen que pueda moverse

No cualquier imagen sirve para image-to-video. La IA puede añadir movimiento, pero se le da bien "hacer que una imagen coherente se mueva", no "arreglar una imagen defectuosa".

Las dos imágenes de prueba que usé aquí se crearon con el modelo de generación de imágenes de VidLux:

Descapotable rojo en una carretera costera
Deportivo costero: gran impacto visual y "velocidad" integrada
Vista aérea del Gran Cañón al atardecer
Gran Cañón: composición abierta, espacio natural para que las nubes y la luz se muevan

Tres cosas que comprobar al elegir una imagen:

  1. Sujeto claro, encuadre despejado. Si la imagen está llena de elementos, el modelo no sabe qué mover.
  2. Espacio alrededor del sujeto. Los acercamientos y los paneos necesitan espacio negativo: la carretera del coche y el cielo del cañón son exactamente eso.
  3. Nada roto de antemano. Si las manos, las caras, el texto o las líneas del coche ya están distorsionadas en la imagen fija, solo empeorarán en movimiento.

Una autocomprobación práctica: ¿puedes imaginar qué haría esta imagen en los próximos dos segundos? Si sí, la IA probablemente también puede. Si no, la imagen no tiene una dirección de movimiento clara.

Paso 2: decide qué debe moverse

La mayoría de los fallos de image-to-video no son culpa del modelo: vienen de prompts que piden demasiado. El movimiento se divide en tres tipos; un movimiento principal y todo lo demás contenido:

TipoEjemplosIdeal para
Movimiento de cámarazoom lento, paneo a la izquierda, órbita, travellingRetratos, productos, paisajes: la opción más segura
Movimiento del sujetoel coche acelera, parpadeo, girar la cabeza, el pelo moviéndoseGran impacto, pero la más propensa a errores
Movimiento del entornonubes a la deriva, niebla que se disipa, ondas en el agua, cambios de luzCuando quieres atmósfera sin tocar al sujeto

Paso 3: escribe el prompt con una fórmula

Basándome en la guía oficial de prompts de Google para Veo, esta es una fórmula que funciona para image-to-video:

Fórmula del prompt:

sujeto (quién) + acción (qué) + estilo (aspecto) + cámara (cómo) + iluminación (ambiente) + bloqueo (lo que no debe cambiar)

Este es el prompt completo del caso del deportivo:

Ver el prompt del deportivo

The red convertible car on the coastal road accelerates forward along the winding cliffside, engine roaring as it picks up speed. Cinematic car commercial style. Low-angle tracking shot following the car, camera gliding alongside at road level. Shallow depth of field on the car, background cliffs and ocean softly blurred. Warm golden-hour light, ocean sparkle, dramatic orange sky. Keep the car's shape, color and the coastal road position consistent with the source image. No cuts, no text, no logos.

Desglosado:

  • Sujeto: el descapotable rojo
  • Acción: acelera hacia delante por el acantilado serpenteante
  • Estilo: estilo cinematográfico de anuncio de coches
  • Cámara: plano de persecución a baja altura, cámara deslizándose en paralelo
  • Iluminación: luz cálida de la hora dorada, destellos en el mar
  • Bloqueo: mantener la forma, el color y la posición en la carretera del coche iguales a la imagen original

Esa última frase es la diferencia clave con text-to-video: image-to-video debe fijar la coherencia con la fuente. La imagen es el ancla: el prompt añade movimiento sobre ella, no reinventa la escena.

Plantillas de prompt para distintos tipos de imagen

La misma fórmula aplicada a distintos sujetos. Plantillas que puedes adaptar directamente:

Plantilla para retratos

The woman in the portrait blinks naturally and turns her head slightly, hair moving gently. Cinematic portrait style. Slow push-in, shallow depth of field. Soft natural light. Keep her face, hairstyle and clothing consistent with the source image. No cuts, no text.

Plantilla para productos

The product on the clean surface stays still while the camera slowly orbits and a soft light sweeps across its edges. Premium commercial style. Keep the product shape, logo and label unchanged. No hands, no new objects, no text.

Plantilla para paisajes

The camera gently moves forward through the landscape as clouds drift and light shifts across the ground. Documentary nature style. Keep the composition natural. No people, no text.

Plantilla para ilustraciones / anime

Subtle camera push-in, hair and clothing sway slightly as if in a light breeze. Keep the original art style and character design unchanged. No text.

El hilo común: un movimiento principal + estilo + luz + bloqueo de la fuente. Los retratos y los productos llevan un bloqueo extra (la cara o el logo no deben cambiar); los paisajes y las ilustraciones ganan con la contención.

Paso 4: genera y luego mira los datos (no solo la sensación)

Generé una versión de 8 segundos del coche con Veo 3.1 Fast: 8s constantes, 720p, 16:9.

Veo 3.1 Fast · 720p · 8s · prompt: coche acelerando por la costa

Tras generar, hice dos cosas: ver el metraje y revisar los números. Los números provienen de un análisis fotograma a fotograma (diferencia media de píxeles entre fotogramas), algo más objetivo que el "se ve bien":

MétricaValorQué significa
Nivel de movimiento (media)8.2Movimiento claro, coincide con "el coche en marcha"
Ritmo (4 segmentos)7.7 → 12.9 → 6.3 → 6.0El pico del segmento intermedio (12.9) = el momento de la aceleración

El movimiento se dispara hasta 12.9 en el segundo segmento (el coche acelera), con calma antes y después: el "acelera" del prompt se ejecutó correctamente.

El mismo enfoque con el Gran Cañón (Kling 3.0 Turbo):

Kling 3.0 Turbo · 720p · 8s · prompt: la cámara se adentra en el cañón

La versión del cañón es más contenida (media 2.4): las nubes y la luz cambian lentamente, lo que encaja con la categoría de "movimiento del entorno". En los paisajes, el movimiento del entorno es más estable que las grandes acciones.

Caso retrato: movimiento sutil para un retrato callejero

El image-to-video de retratos es el uso más común y el que más falla. La clave es bloquear la cara. Este es el retrato callejero con el que lo probé:

Imagen de referencia de una mujer con camisa azul claro
Referencia: una mujer con camisa azul claro en una calle soleada
Ver el prompt del retrato

The young woman in the light blue linen shirt looks at the camera, blinks naturally and turns her head slightly with a gentle smile, hair moving softly in a light breeze. Cinematic portrait style. Slow push-in, shallow depth of field. Warm afternoon sunlight. Keep her face, hairstyle, shirt and the street background consistent with the source image. No cuts, no text, no logos.

Veo 3.1 Fast · 720p · 8s · prompt: parpadeo + leve giro de cabeza + acercamiento lento

Conclusiones sobre retratos:

  • Cuanto más ligero el movimiento, más seguro. Solo "parpadeo + leve giro de cabeza", sin movimientos grandes. En cuanto la cara se mueve con fuerza, se rompe.
  • La frase de bloqueo lo es todo. Keep her face, hairstyle, shirt and the street background consistent decide si la cara se mantiene.
  • El acercamiento lento gana a la órbita. Orbitar alrededor de una persona tiende a distorsionar; un acercamiento lento es la opción más estable.

Comprobación posterior fotograma a fotograma: cara intacta, pelo y camisa coherentes: así se hace bien el image-to-video de retratos.

Paso 5: el error que cometí: pedir demasiado

Para probar qué hace la "sobrecarga de prompt", escribí a propósito un prompt descabellado: girar en círculos, derrapar, salirse por el acantilado, hacer un tonel en el aire, aterrizar marcha atrás y luego acelerar sin control mientras la cámara orbita frenéticamente.

Antiejemplo: demasiadas acciones en un solo prompt · 720p · 8s

Los números cuentan la historia:

MétricaPrompt normalPrompt sobrecargado
Nivel de movimiento (media)8.212.7
Pico de movimiento16.826.0

Lo visual es aún más claro: el coche literalmente vuela: despegado del suelo, suspendido en el aire. Un solo fotograma podría pasar por una toma de acrobacia, pero el clip entero es el coche despegando, dando tumbos y descontrolándose una y otra vez. Ni rastro de la sensación de la carretera costera.

Este es el síntoma clásico de pedir demasiado: el sujeto hace cosas físicamente imposibles. Regla general: un prompt normal de "una acción + movimiento de cámara" da resultados de un solo dígito o poco más de diez; si el sujeto despega, da vueltas o se teletransporta, has sobrecargado el prompt.

Paso 6: cómo lo arreglé (el proceso real)

El arreglo en una frase: elimina las acciones extra, quédate con una. Reduje "girar, derrapar, tirarse por el acantilado, dar vueltas, marcha atrás, cámara girando" a "aceleración suave por la carretera":

Ver el prompt corregido

The red convertible car accelerates smoothly forward along the coastal road, engine revving gently. Cinematic car commercial style. Low-angle tracking shot, camera gliding alongside. Shallow depth of field, warm golden-hour light. Keep the car's shape, color and road position consistent with the source image. No cuts, no text, no logos.

Versión corregida: solo se mantuvo la "aceleración" · 720p · 8s

El principio del arreglo: cambia una variable cada vez. Si la dirección es correcta, ajusta un detalle y vuelve a generar; si la dirección es errónea, reescribe la descripción de la acción: no acumules adjetivos.

Los números lo respaldan: el movimiento bajó de 12.7 a 3.4 (aproximadamente una cuarta parte) y el pico, de 26.0 a 5.8: el coche se mantiene en la carretera y la sensación costera ha vuelto.

Lista de comprobación: qué revisar después de generar

Revisa en este orden y no se te escapará casi nada:

  1. ¿Se mantuvo el sujeto? (¿El mismo coche? ¿La misma persona?)
  2. ¿Se rompieron los detalles? (Ruedas, manos, logo, texto: los sospechosos habituales)
  3. ¿Se deformó el fondo?
  4. ¿Apareció algo de la nada?
  5. ¿El ritmo del movimiento es correcto? (Un "acercamiento lento" no debería sentirse como una montaña rusa)

Cuando detectes un problema, nómbralo directamente en el siguiente prompt y corrige una cosa cada vez. Para una carrocería deformada, añade Keep the car shape unchanged.

Cuándo regenerar en lugar de editar

Esta decisión te ahorra mucho tiempo:

  • Regenerar: el movimiento central está mal (la cara cambió demasiado, el cuerpo se deformó, el sujeto hizo lo imposible): no pierdas tiempo editando, simplifica el prompt y vuelve a ejecutarlo
  • Editar: el metraje está básicamente bien y solo necesita pulido (recortar los fotogramas muertos de ambos extremos, etalonar, añadir música y subtítulos)

Editar no puede salvar una generación mala, pero sí completa una buena.

Después de exportar: los últimos retoques

Una vez que la generación es correcta, unos pocos pasos hacen que el clip final quede más pulido:

  • Recorta los fotogramas muertos. Los clips de IA suelen tener 1 o 2 fotogramas con tartamudeos o imágenes fantasma al principio y al final; cortarlos es la jugada más segura
  • Añade música y subtítulos. Casi imprescindible para redes sociales: la música enmascara los artefactos de audio y los subtítulos lo hacen visible sin sonido
  • Recorta por plataforma. El formato vertical (Reels/TikTok) es 9:16, el feed es 1:1 y el web/paisaje es 16:9. Genera primero en horizontal y luego recorta: conservas más opciones de composición que generando directamente en vertical
  • Etalona para mantener la coherencia. Si unes varios clips, unifica el color para que el conjunto se sienta continuo

Avanzado: frames to video: la transformación en la práctica

Una sola imagen te da una única toma. Para contenido "del estado A al estado B", usa frames to video (primer y último fotograma): dale al modelo un "fotograma inicial" y un "fotograma final", y él rellena el resto.

Lo probé con una transformación de personaje: la misma mujer, de su versión informal con camisa azul a su versión con armadura de ciencia ficción (el caso de uso clásico de frames to video):

Primer fotograma: camisa azul informal
Primer fotograma · versión informal (camisa azul)
Último fotograma: versión con armadura de ciencia ficción
Último fotograma · versión transformada (armadura de ciencia ficción)
Ver el prompt de frames to video

The young woman in the light blue linen shirt transforms into her sci-fi armored form: a flash of blue energy sweeps over her body, the high-tech suit with glowing energy lines materializes over her clothes, her hair lifts with static energy, and she raises her head with a determined expression. Smooth, cinematic transformation, consistent face throughout. No cuts, no text, no logos.

Veo 3.1 Fast · frames to video · 720p · 8s · informal → armadura

El resultado: el fotograma 1 es la camisa azul informal, el último es la armadura completa de ciencia ficción, y el barrido de energía, el cambio de vestuario y la elevación del pelo conectan de forma natural en medio: la cara nunca cambia. La transformación añade capas en lugar de sustituir a la persona.

Buenos casos de uso de frames to video:

  • Transformaciones / cambios de vestuario: informal → forma de combate, sin maquillaje → maquillaje completo, ropa vieja → ropa nueva
  • Cambios de estado de producto: cerrado → abierto, vacío → lleno
  • Cambios de momento en la escena: día → noche, soleado → lluvioso

La diferencia con el video a partir de una sola imagen: image-to-video hace que "esta imagen se mueva"; frames to video hace que "esta imagen se convierta en aquella": el modelo rellena el proceso.

Avanzado: unir varias imágenes

Otra forma de crear contenido más largo: genera un clip corto de cada imagen y únelos después en un editor. Unos pocos clips cortos y limpios ganan a un video largo con fallos: así se hace la mayor parte del contenido para redes sociales. El frames to video de VidLux gestiona cambios de estado en una sola toma; la narrativa multipantalla se hace uniendo clips.

Tabla de solución de problemas

SíntomaCausaSolución
Cara/carrocería deformadasMovimiento demasiado fuerte, o la imagen original ya tiene fallosSimplifica la acción + refuerza el bloqueo
Manos/ruedas de másLos detalles se redibujan durante el movimientoAñade Keep hands natural, suaviza el movimiento
El sujeto flota o se teletransportaEl prompt pidió acciones físicamente imposiblesElimina todo lo que rompa la física
El fondo se deformaFondo demasiado complejo, el modelo lo lee malUsa un fondo más simple, o añade Keep background unchanged
Movimiento demasiado salvajeDemasiadas acciones acumuladasMantén un único movimiento principal
Apenas se muevePrompt demasiado tímidoHaz más explícito el "movimiento lento/de cámara"

Buenos casos de uso para image-to-video

  • Contenido para redes sociales: fotos de viajes, looks, fotos de comida: un acercamiento lento les da vida. No te pases; con un movimiento basta
  • Marketing de producto: las imágenes de producto se convierten en anuncios cortos (paneo, barrido de luz). Mucho cuidado con las tomas de producto: el logo, la etiqueta y las líneas de la botella no deben moverse
  • Recuerdos personales: fotos antiguas con movimiento suave (movimiento de cámara lento, parpadeo suave). Cuanto más borrosa sea la foto antigua, más ligero el movimiento
  • Conceptos creativos: mood boards, diseños de personajes, escenas de juegos: ve rápido cómo se siente una escena en movimiento

Lo que el image-to-video con IA aún no puede hacer

Limitaciones honestas:

  • Cuanto mayor es el movimiento, menos control hay. Las caras, las manos, los logos y el texto se rompen primero cuando un prompt exige demasiado
  • No sabe "qué pasó antes". El image-to-video parte de esta imagen; no continúa desde el segundo anterior
  • Los derechos de autor no desaparecen. Usa tus propias imágenes o imágenes con licencia; convertir una imagen en video no te otorga derechos sobre ella
  • La regla práctica: elige el resultado más utilizable, no el más llamativo. Si la identidad central cambió, regenera

Preguntas frecuentes

P: ¿Cuál es la diferencia entre image-to-video y text-to-video? Text-to-video genera desde cero; image-to-video añade movimiento sobre tu imagen. Image-to-video conserva el sujeto que quieres (tu persona, producto o escena), pero con menos libertad de movimiento.

P: ¿Cuánto tiempo debo generar al principio? Empieza con 8 segundos. Basta para ver la dirección sin amplificar los problemas. Para clips cortos en redes, 3 segundos limpios ganan a 8 con fallos.

P: ¿Puedo reutilizar la misma imagen? Sí. Cambia el prompt o el modelo y la misma imagen de entrada da resultados completamente distintos. Esa es la parte que ahorra tiempo en image-to-video: una buena imagen, muchas versiones.

El flujo de trabajo completo (resumen en 5 pasos)

  1. Elige la imagen: sujeto claro, espacio para moverse y una dirección que puedas imaginar
  2. Decide el movimiento: cámara / sujeto / entorno: un movimiento principal
  3. Escribe el prompt: sujeto + acción + estilo + cámara + luz + bloqueo de la fuente
  4. Genera y revisa: mira los datos de movimiento y examina sujeto y detalles fotograma a fotograma
  5. Corrige: cambia una variable cada vez y regenera

Una última reflexión: en la animación de imágenes, la contención vence al espectáculo. Un movimiento suave y estable siempre gana a una versión "todo se mueve" que pierde el control. ¿Quieres grandes acciones? Eso es trabajo de text-to-video: no lleves una imagen estática tan lejos.

Pruébalo ahora en VidLux image-to-video: sube una imagen, escribe un prompt con la fórmula anterior y ve el resultado en 8 segundos.