Image-to-video suena a producción de video complicada, pero el flujo de trabajo central son solo cinco pasos. Primero, la versión resumida:
- Elige una imagen con un sujeto claro y espacio para moverse
- Decide qué debe moverse: cámara, sujeto o entorno. Un movimiento principal
- Escribe el prompt con una fórmula: sujeto + acción + estilo + cámara + luz + bloqueo
- Genera una vista previa de 8 segundos y comprueba si el movimiento resulta natural
- Si algo falla, cambia una variable y vuelve a generar
Todo lo que sigue proviene de pruebas reales, no de teoría. Ejecuté el ciclo completo en VidLux —elegir imágenes, generar, romper cosas y corregirlas— en cuatro casos que cubren los escenarios más comunes de image-to-video: un coche, un retrato, un paisaje y una transformación de personaje.
Paso 1: elige una imagen que pueda moverse
No cualquier imagen sirve para image-to-video. La IA puede añadir movimiento, pero se le da bien "hacer que una imagen coherente se mueva", no "arreglar una imagen defectuosa".
Las dos imágenes de prueba que usé aquí se crearon con el modelo de generación de imágenes de VidLux:


Tres cosas que comprobar al elegir una imagen:
- Sujeto claro, encuadre despejado. Si la imagen está llena de elementos, el modelo no sabe qué mover.
- Espacio alrededor del sujeto. Los acercamientos y los paneos necesitan espacio negativo: la carretera del coche y el cielo del cañón son exactamente eso.
- Nada roto de antemano. Si las manos, las caras, el texto o las líneas del coche ya están distorsionadas en la imagen fija, solo empeorarán en movimiento.
Una autocomprobación práctica: ¿puedes imaginar qué haría esta imagen en los próximos dos segundos? Si sí, la IA probablemente también puede. Si no, la imagen no tiene una dirección de movimiento clara.
Paso 2: decide qué debe moverse
La mayoría de los fallos de image-to-video no son culpa del modelo: vienen de prompts que piden demasiado. El movimiento se divide en tres tipos; un movimiento principal y todo lo demás contenido:
| Tipo | Ejemplos | Ideal para |
|---|---|---|
| Movimiento de cámara | zoom lento, paneo a la izquierda, órbita, travelling | Retratos, productos, paisajes: la opción más segura |
| Movimiento del sujeto | el coche acelera, parpadeo, girar la cabeza, el pelo moviéndose | Gran impacto, pero la más propensa a errores |
| Movimiento del entorno | nubes a la deriva, niebla que se disipa, ondas en el agua, cambios de luz | Cuando quieres atmósfera sin tocar al sujeto |
Paso 3: escribe el prompt con una fórmula
Basándome en la guía oficial de prompts de Google para Veo, esta es una fórmula que funciona para image-to-video:
sujeto (quién) + acción (qué) + estilo (aspecto) + cámara (cómo) + iluminación (ambiente) + bloqueo (lo que no debe cambiar)
Este es el prompt completo del caso del deportivo:
Ver el prompt del deportivo
The red convertible car on the coastal road accelerates forward along the winding cliffside, engine roaring as it picks up speed. Cinematic car commercial style. Low-angle tracking shot following the car, camera gliding alongside at road level. Shallow depth of field on the car, background cliffs and ocean softly blurred. Warm golden-hour light, ocean sparkle, dramatic orange sky. Keep the car's shape, color and the coastal road position consistent with the source image. No cuts, no text, no logos.
Desglosado:
- Sujeto: el descapotable rojo
- Acción: acelera hacia delante por el acantilado serpenteante
- Estilo: estilo cinematográfico de anuncio de coches
- Cámara: plano de persecución a baja altura, cámara deslizándose en paralelo
- Iluminación: luz cálida de la hora dorada, destellos en el mar
- Bloqueo: mantener la forma, el color y la posición en la carretera del coche iguales a la imagen original
Esa última frase es la diferencia clave con text-to-video: image-to-video debe fijar la coherencia con la fuente. La imagen es el ancla: el prompt añade movimiento sobre ella, no reinventa la escena.
Plantillas de prompt para distintos tipos de imagen
La misma fórmula aplicada a distintos sujetos. Plantillas que puedes adaptar directamente:
Plantilla para retratos
The woman in the portrait blinks naturally and turns her head slightly, hair moving gently. Cinematic portrait style. Slow push-in, shallow depth of field. Soft natural light. Keep her face, hairstyle and clothing consistent with the source image. No cuts, no text.
Plantilla para productos
The product on the clean surface stays still while the camera slowly orbits and a soft light sweeps across its edges. Premium commercial style. Keep the product shape, logo and label unchanged. No hands, no new objects, no text.
Plantilla para paisajes
The camera gently moves forward through the landscape as clouds drift and light shifts across the ground. Documentary nature style. Keep the composition natural. No people, no text.
Plantilla para ilustraciones / anime
Subtle camera push-in, hair and clothing sway slightly as if in a light breeze. Keep the original art style and character design unchanged. No text.
El hilo común: un movimiento principal + estilo + luz + bloqueo de la fuente. Los retratos y los productos llevan un bloqueo extra (la cara o el logo no deben cambiar); los paisajes y las ilustraciones ganan con la contención.
Paso 4: genera y luego mira los datos (no solo la sensación)
Generé una versión de 8 segundos del coche con Veo 3.1 Fast: 8s constantes, 720p, 16:9.
Tras generar, hice dos cosas: ver el metraje y revisar los números. Los números provienen de un análisis fotograma a fotograma (diferencia media de píxeles entre fotogramas), algo más objetivo que el "se ve bien":
| Métrica | Valor | Qué significa |
|---|---|---|
| Nivel de movimiento (media) | 8.2 | Movimiento claro, coincide con "el coche en marcha" |
| Ritmo (4 segmentos) | 7.7 → 12.9 → 6.3 → 6.0 | El pico del segmento intermedio (12.9) = el momento de la aceleración |
El movimiento se dispara hasta 12.9 en el segundo segmento (el coche acelera), con calma antes y después: el "acelera" del prompt se ejecutó correctamente.
El mismo enfoque con el Gran Cañón (Kling 3.0 Turbo):
La versión del cañón es más contenida (media 2.4): las nubes y la luz cambian lentamente, lo que encaja con la categoría de "movimiento del entorno". En los paisajes, el movimiento del entorno es más estable que las grandes acciones.
Caso retrato: movimiento sutil para un retrato callejero
El image-to-video de retratos es el uso más común y el que más falla. La clave es bloquear la cara. Este es el retrato callejero con el que lo probé:

Ver el prompt del retrato
The young woman in the light blue linen shirt looks at the camera, blinks naturally and turns her head slightly with a gentle smile, hair moving softly in a light breeze. Cinematic portrait style. Slow push-in, shallow depth of field. Warm afternoon sunlight. Keep her face, hairstyle, shirt and the street background consistent with the source image. No cuts, no text, no logos.
Conclusiones sobre retratos:
- Cuanto más ligero el movimiento, más seguro. Solo "parpadeo + leve giro de cabeza", sin movimientos grandes. En cuanto la cara se mueve con fuerza, se rompe.
- La frase de bloqueo lo es todo.
Keep her face, hairstyle, shirt and the street background consistentdecide si la cara se mantiene. - El acercamiento lento gana a la órbita. Orbitar alrededor de una persona tiende a distorsionar; un acercamiento lento es la opción más estable.
Comprobación posterior fotograma a fotograma: cara intacta, pelo y camisa coherentes: así se hace bien el image-to-video de retratos.
Paso 5: el error que cometí: pedir demasiado
Para probar qué hace la "sobrecarga de prompt", escribí a propósito un prompt descabellado: girar en círculos, derrapar, salirse por el acantilado, hacer un tonel en el aire, aterrizar marcha atrás y luego acelerar sin control mientras la cámara orbita frenéticamente.
Los números cuentan la historia:
| Métrica | Prompt normal | Prompt sobrecargado |
|---|---|---|
| Nivel de movimiento (media) | 8.2 | 12.7 |
| Pico de movimiento | 16.8 | 26.0 |
Lo visual es aún más claro: el coche literalmente vuela: despegado del suelo, suspendido en el aire. Un solo fotograma podría pasar por una toma de acrobacia, pero el clip entero es el coche despegando, dando tumbos y descontrolándose una y otra vez. Ni rastro de la sensación de la carretera costera.
Este es el síntoma clásico de pedir demasiado: el sujeto hace cosas físicamente imposibles. Regla general: un prompt normal de "una acción + movimiento de cámara" da resultados de un solo dígito o poco más de diez; si el sujeto despega, da vueltas o se teletransporta, has sobrecargado el prompt.
Paso 6: cómo lo arreglé (el proceso real)
El arreglo en una frase: elimina las acciones extra, quédate con una. Reduje "girar, derrapar, tirarse por el acantilado, dar vueltas, marcha atrás, cámara girando" a "aceleración suave por la carretera":
Ver el prompt corregido
The red convertible car accelerates smoothly forward along the coastal road, engine revving gently. Cinematic car commercial style. Low-angle tracking shot, camera gliding alongside. Shallow depth of field, warm golden-hour light. Keep the car's shape, color and road position consistent with the source image. No cuts, no text, no logos.
El principio del arreglo: cambia una variable cada vez. Si la dirección es correcta, ajusta un detalle y vuelve a generar; si la dirección es errónea, reescribe la descripción de la acción: no acumules adjetivos.
Los números lo respaldan: el movimiento bajó de 12.7 a 3.4 (aproximadamente una cuarta parte) y el pico, de 26.0 a 5.8: el coche se mantiene en la carretera y la sensación costera ha vuelto.
Lista de comprobación: qué revisar después de generar
Revisa en este orden y no se te escapará casi nada:
- ¿Se mantuvo el sujeto? (¿El mismo coche? ¿La misma persona?)
- ¿Se rompieron los detalles? (Ruedas, manos, logo, texto: los sospechosos habituales)
- ¿Se deformó el fondo?
- ¿Apareció algo de la nada?
- ¿El ritmo del movimiento es correcto? (Un "acercamiento lento" no debería sentirse como una montaña rusa)
Cuando detectes un problema, nómbralo directamente en el siguiente prompt y corrige una cosa cada vez. Para una carrocería deformada, añade Keep the car shape unchanged.
Cuándo regenerar en lugar de editar
Esta decisión te ahorra mucho tiempo:
- Regenerar: el movimiento central está mal (la cara cambió demasiado, el cuerpo se deformó, el sujeto hizo lo imposible): no pierdas tiempo editando, simplifica el prompt y vuelve a ejecutarlo
- Editar: el metraje está básicamente bien y solo necesita pulido (recortar los fotogramas muertos de ambos extremos, etalonar, añadir música y subtítulos)
Editar no puede salvar una generación mala, pero sí completa una buena.
Después de exportar: los últimos retoques
Una vez que la generación es correcta, unos pocos pasos hacen que el clip final quede más pulido:
- Recorta los fotogramas muertos. Los clips de IA suelen tener 1 o 2 fotogramas con tartamudeos o imágenes fantasma al principio y al final; cortarlos es la jugada más segura
- Añade música y subtítulos. Casi imprescindible para redes sociales: la música enmascara los artefactos de audio y los subtítulos lo hacen visible sin sonido
- Recorta por plataforma. El formato vertical (Reels/TikTok) es 9:16, el feed es 1:1 y el web/paisaje es 16:9. Genera primero en horizontal y luego recorta: conservas más opciones de composición que generando directamente en vertical
- Etalona para mantener la coherencia. Si unes varios clips, unifica el color para que el conjunto se sienta continuo
Avanzado: frames to video: la transformación en la práctica
Una sola imagen te da una única toma. Para contenido "del estado A al estado B", usa frames to video (primer y último fotograma): dale al modelo un "fotograma inicial" y un "fotograma final", y él rellena el resto.
Lo probé con una transformación de personaje: la misma mujer, de su versión informal con camisa azul a su versión con armadura de ciencia ficción (el caso de uso clásico de frames to video):


Ver el prompt de frames to video
The young woman in the light blue linen shirt transforms into her sci-fi armored form: a flash of blue energy sweeps over her body, the high-tech suit with glowing energy lines materializes over her clothes, her hair lifts with static energy, and she raises her head with a determined expression. Smooth, cinematic transformation, consistent face throughout. No cuts, no text, no logos.
El resultado: el fotograma 1 es la camisa azul informal, el último es la armadura completa de ciencia ficción, y el barrido de energía, el cambio de vestuario y la elevación del pelo conectan de forma natural en medio: la cara nunca cambia. La transformación añade capas en lugar de sustituir a la persona.
Buenos casos de uso de frames to video:
- Transformaciones / cambios de vestuario: informal → forma de combate, sin maquillaje → maquillaje completo, ropa vieja → ropa nueva
- Cambios de estado de producto: cerrado → abierto, vacío → lleno
- Cambios de momento en la escena: día → noche, soleado → lluvioso
La diferencia con el video a partir de una sola imagen: image-to-video hace que "esta imagen se mueva"; frames to video hace que "esta imagen se convierta en aquella": el modelo rellena el proceso.
Avanzado: unir varias imágenes
Otra forma de crear contenido más largo: genera un clip corto de cada imagen y únelos después en un editor. Unos pocos clips cortos y limpios ganan a un video largo con fallos: así se hace la mayor parte del contenido para redes sociales. El frames to video de VidLux gestiona cambios de estado en una sola toma; la narrativa multipantalla se hace uniendo clips.
Tabla de solución de problemas
| Síntoma | Causa | Solución |
|---|---|---|
| Cara/carrocería deformadas | Movimiento demasiado fuerte, o la imagen original ya tiene fallos | Simplifica la acción + refuerza el bloqueo |
| Manos/ruedas de más | Los detalles se redibujan durante el movimiento | Añade Keep hands natural, suaviza el movimiento |
| El sujeto flota o se teletransporta | El prompt pidió acciones físicamente imposibles | Elimina todo lo que rompa la física |
| El fondo se deforma | Fondo demasiado complejo, el modelo lo lee mal | Usa un fondo más simple, o añade Keep background unchanged |
| Movimiento demasiado salvaje | Demasiadas acciones acumuladas | Mantén un único movimiento principal |
| Apenas se mueve | Prompt demasiado tímido | Haz más explícito el "movimiento lento/de cámara" |
Buenos casos de uso para image-to-video
- Contenido para redes sociales: fotos de viajes, looks, fotos de comida: un acercamiento lento les da vida. No te pases; con un movimiento basta
- Marketing de producto: las imágenes de producto se convierten en anuncios cortos (paneo, barrido de luz). Mucho cuidado con las tomas de producto: el logo, la etiqueta y las líneas de la botella no deben moverse
- Recuerdos personales: fotos antiguas con movimiento suave (movimiento de cámara lento, parpadeo suave). Cuanto más borrosa sea la foto antigua, más ligero el movimiento
- Conceptos creativos: mood boards, diseños de personajes, escenas de juegos: ve rápido cómo se siente una escena en movimiento
Lo que el image-to-video con IA aún no puede hacer
Limitaciones honestas:
- Cuanto mayor es el movimiento, menos control hay. Las caras, las manos, los logos y el texto se rompen primero cuando un prompt exige demasiado
- No sabe "qué pasó antes". El image-to-video parte de esta imagen; no continúa desde el segundo anterior
- Los derechos de autor no desaparecen. Usa tus propias imágenes o imágenes con licencia; convertir una imagen en video no te otorga derechos sobre ella
- La regla práctica: elige el resultado más utilizable, no el más llamativo. Si la identidad central cambió, regenera
Preguntas frecuentes
P: ¿Cuál es la diferencia entre image-to-video y text-to-video? Text-to-video genera desde cero; image-to-video añade movimiento sobre tu imagen. Image-to-video conserva el sujeto que quieres (tu persona, producto o escena), pero con menos libertad de movimiento.
P: ¿Cuánto tiempo debo generar al principio? Empieza con 8 segundos. Basta para ver la dirección sin amplificar los problemas. Para clips cortos en redes, 3 segundos limpios ganan a 8 con fallos.
P: ¿Puedo reutilizar la misma imagen? Sí. Cambia el prompt o el modelo y la misma imagen de entrada da resultados completamente distintos. Esa es la parte que ahorra tiempo en image-to-video: una buena imagen, muchas versiones.
El flujo de trabajo completo (resumen en 5 pasos)
- Elige la imagen: sujeto claro, espacio para moverse y una dirección que puedas imaginar
- Decide el movimiento: cámara / sujeto / entorno: un movimiento principal
- Escribe el prompt: sujeto + acción + estilo + cámara + luz + bloqueo de la fuente
- Genera y revisa: mira los datos de movimiento y examina sujeto y detalles fotograma a fotograma
- Corrige: cambia una variable cada vez y regenera
Una última reflexión: en la animación de imágenes, la contención vence al espectáculo. Un movimiento suave y estable siempre gana a una versión "todo se mueve" que pierde el control. ¿Quieres grandes acciones? Eso es trabajo de text-to-video: no lleves una imagen estática tan lejos.
Pruébalo ahora en VidLux image-to-video: sube una imagen, escribe un prompt con la fórmula anterior y ve el resultado en 8 segundos.
