如何用 AI 把靜態圖片變成影片?完整流程實測

如何用 AI 把靜態圖片變成影片?完整流程實測

從選圖、規劃動作、撰寫提示詞到生成與修復,用 VidLux 把靜態圖片變成 AI 影片的完整實戰流程。附真實生成案例:海邊敞篷跑車、街頭人像、大峽谷空拍、人物變身,以及一次真實的踩雷與修復。

創作 AI 影片
VidLux閱讀時間約 8 分鐘

圖片轉影片聽起來像是很複雜的影片製作,其實核心流程就只有五步。先把結論放在最前面:

快速上手(5 步):
  1. 選一張主體清晰、有運動空間的圖片
  2. 想清楚「哪裡要動」——鏡頭、主體、環境,只保留一個主要運動
  3. 按公式寫提示詞:主體 + 動作 + 風格 + 鏡頭 + 光線 + 鎖定
  4. 生成 8 秒預覽,確認整體運動是否自然
  5. 發現問題時只改一個變數,重新生成

接下來的內容都是我實測的紀錄,不是理論。我在 VidLux 上把整個流程完整跑了一遍——選圖、生成、踩雷到修復——四個案例涵蓋了最常見的圖片轉影片場景:跑車、人像、風景與人物變身。

第一步:選一張「動得起來」的圖片

不是每張圖片都適合做圖片轉影片。 AI 可以加上運動,但它擅長的是「讓一張合理的圖片動起來」,而不是「把有問題的圖片修好」。

這次用的兩張測試圖片,都是用 VidLux 的圖片生成模型做的:

海邊公路上的紅色敞篷跑車
海邊跑車:視覺衝擊力強,天生帶「速度感」
日落時的大峽谷空拍
大峽谷:構圖開闊,雲和光有天然的動態空間

選圖時檢查三件事:

  1. 主體清楚、畫面乾淨不擁擠。 一張圖塞滿東西,模型就不知道該讓誰動。
  2. 主體周圍有空間。 推近和橫移鏡頭都需要留白——跑車的公路、峽谷的天空,就是最好的留白。
  3. 沒有本來就壞掉的地方。 如果手、臉、文字或車身線條在靜態圖裡就已經變形,動起來之後只會更明顯。

一個實用的自測方法:看著這張圖,你能想像它接下來兩秒會怎麼動嗎? 如果可以,AI 大概也做得到;如果不可以,代表這張圖沒有明確的運動方向。

第二步:想清楚「到底哪裡要動」

圖片轉影片失敗,十次有八次不是模型的問題,而是提示詞一次要求太多。運動可以分成三種類型,原則是一個主要運動,其他全部克制

類型例子適合場景
鏡頭運動緩慢推近、向左橫移、環繞、跟拍人像、產品、風景——最安全的選擇
主體運動車加速、眨眼、轉頭、頭髮飄動視覺衝擊力強,但最容易出錯
環境運動雲朵飄移、霧氣散去、水面漣漪、光線變化想要氛圍感、又不想動到主體時

第三步:按公式寫提示詞

參考 Google 官方針對 Veo 的提示詞建議,我整理出一個適用於圖片轉影片的公式:

提示詞公式:

主體(誰)+ 動作(做什麼)+ 風格(什麼調性)+ 鏡頭(怎麼拍)+ 光線氛圍(什麼光)+ 鎖定(什麼不能變)

這是我跑車案例用的完整提示詞:

查看跑車案例的完整提示詞

The red convertible car on the coastal road accelerates forward along the winding cliffside, engine roaring as it picks up speed. Cinematic car commercial style. Low-angle tracking shot following the car, camera gliding alongside at road level. Shallow depth of field on the car, background cliffs and ocean softly blurred. Warm golden-hour light, ocean sparkle, dramatic orange sky. Keep the car's shape, color and the coastal road position consistent with the source image. No cuts, no text, no logos.

拆解一下:

  • 主體:the red convertible car
  • 動作:accelerates forward along the winding cliffside
  • 風格:Cinematic car commercial style
  • 鏡頭:Low-angle tracking shot, camera gliding alongside
  • 光線氛圍:Warm golden-hour light, ocean sparkle
  • 鎖定:Keep the car's shape, color and road position consistent with the source image

注意最後一句——圖片轉影片必須鎖定來源圖一致性。這是它和文字轉影片最大的差別:圖片是錨點,提示詞是在「圖片上加運動」,不是「重新生成畫面」。

不同圖片類型的提示詞模板

同一個公式,套用到不同題材。以下是可以直接改來用的模板:

查看人像模板

The woman in the portrait blinks naturally and turns her head slightly, hair moving gently. Cinematic portrait style. Slow push-in, shallow depth of field. Soft natural light. Keep her face, hairstyle and clothing consistent with the source image. No cuts, no text.

查看產品模板

The product on the clean surface stays still while the camera slowly orbits and a soft light sweeps across its edges. Premium commercial style. Keep the product shape, logo and label unchanged. No hands, no new objects, no text.

查看風景模板

The camera gently moves forward through the landscape as clouds drift and light shifts across the ground. Documentary nature style. Keep the composition natural. No people, no text.

查看插畫/動漫模板

Subtle camera push-in, hair and clothing sway slightly as if in a light breeze. Keep the original art style and character design unchanged. No text.

共同點:都是一個主要運動 + 風格 + 光線 + 鎖定來源圖。人像和產品會多一句鎖定(臉/logo 不能變);風景和插畫則靠「克制」取勝。

第四步:生成,然後看數據(而不是只看感覺)

我用 Veo 3.1 Fast 生成了這張跑車圖的 8 秒版本。統一 8 秒、720p、16:9:

Veo 3.1 Fast · 720p · 8 秒 · 提示詞:跑車沿著海岸加速

生成後我做了兩件事:看畫面 + 看數據。數據來自逐格分析(畫面影格與影格之間像素差異的平均值),比「感覺對了」更客觀:

指標數值說明
畫面運動量(平均值)8.2有明顯運動,符合「車在開」
節奏(4 段)7.7 → 12.9 → 6.3 → 6.0中段峰值 12.9 = 加速瞬間

運動量在第二段衝到 12.9(車加速),前後段都平穩——提示詞裡的「accelerates」被正確執行了,節奏對得上。

同樣的方法,用在美國大峽谷(Kling 3.0 Turbo):

Kling 3.0 Turbo · 720p · 8 秒 · 提示詞:鏡頭俯衝進峽谷

峽谷這版運動量更克制(平均值 2.4)——雲和光影緩慢變化,符合「環境運動」的定位。風景類的圖片,用環境運動比大動作更穩。

人像案例:街頭人像的細微動態

人像圖片轉影片是最常見的用法,也是失敗率最高的。關鍵在於鎖住臉部。這是我用來測試的街頭人像:

身穿淺藍色襯衫的女性的參考圖片
參考圖:淺藍襯衫女性,站在陽光灑落的街道上
查看人像案例的提示詞

The young woman in the light blue linen shirt looks at the camera, blinks naturally and turns her head slightly with a gentle smile, hair moving softly in a light breeze. Cinematic portrait style. Slow push-in, shallow depth of field. Warm afternoon sunlight. Keep her face, hairstyle, shirt and the street background consistent with the source image. No cuts, no text, no logos.

Veo 3.1 Fast · 720p · 8 秒 · 提示詞:眨眼 + 微微轉頭 + 緩慢推近

人像案例的幾個重點:

  • 動作越輕,越不容易出錯。 只做「眨眼 + 微微轉頭」就好,不做大幅度動作——臉一旦劇烈動起來,畫面就會崩壞。
  • 鎖定句是成敗關鍵。 Keep her face, hairstyle, shirt and the street background consistent 這句直接決定臉會不會變。
  • 緩慢推近比環繞鏡頭安全。 繞著人轉容易讓人物變形,緩慢推近是最穩的選擇。

之後逐格檢查:臉部完整、髮型和襯衫都保持一致——這就是人像圖片轉影片的正確做法。

第五步:我踩過的雷——一次要求太多動作

為了測試「提示詞過載」會發生什麼事,我故意寫了一版很誇張的提示詞:原地打轉、漂移、衝下懸崖、空中翻滾、倒著落地、再瘋狂加速,同時鏡頭全程亂轉。

反面案例:一個提示詞塞了太多動作 · 720p · 8 秒

數據說明了一切:

指標正常提示詞過度提示詞
畫面運動量(平均值)8.212.7
運動峰值16.826.0

更直觀的是畫面本身:車直接飛起來了——脫離地面、懸在半空中。單看某一格可能以為是特效,但整段影片就是車子反覆騰空、翻滾、失控亂竄的鬧劇,完全沒有海邊跑車該有的質感。

這就是「一次要求太多」的典型症狀:主體做出違反物理定律的動作。 判斷基準:正常的「一個動作 + 鏡頭運動」提示詞,運動量通常落在個位數到十幾之間;如果主體騰空、翻轉或瞬移,代表提示詞已經過載。

第六步:怎麼修復(真實過程)

修復方法一句話:砍掉多餘的動作,只保留一個。我把「轉圈、漂移、衝崖、翻滾、倒車、鏡頭亂轉」砍成「沿著道路平穩加速」:

查看修復後的提示詞

The red convertible car accelerates smoothly forward along the coastal road, engine revving gently. Cinematic car commercial style. Low-angle tracking shot, camera gliding alongside. Shallow depth of field, warm golden-hour light. Keep the car's shape, color and road position consistent with the source image. No cuts, no text, no logos.

修復版:只保留「加速」一個動作 · 720p · 8 秒

修復原則就一句話:一次只改一個變數。大方向對,就只調整一個細節然後重新生成;大方向不對,就重寫動作描述——不要一直堆形容詞。

數據也印證了這一點:運動量從 12.7 降到 3.4(約剩四分之一),峰值從 26.0 降到 5.8——車子乖乖待在路上,海邊公路的感覺回來了。

檢查清單:生成後要看什麼

照這個順序檢查,大致上不會漏掉:

  1. 主體有沒有維持住?(還是同一台車?還是同一個人?)
  2. 細節有沒有崩壞?(車輪、手、logo、文字——最容易出問題的地方)
  3. 背景有沒有扭曲變形?
  4. 畫面裡有沒有憑空多出東西?
  5. 運動節奏對不對?(「緩慢推近」不該像在坐雲霄飛車)

發現問題時,在下一版提示詞裡直接指名,一次只修一個。例如車身變形,就加上 Keep the car shape unchanged

什麼時候該重新生成,而不是自己修

這個判斷能幫你省下很多時間:

  • 重新生成:核心運動錯了(臉變太多、身體變形、主體做了不可能的動作)——別浪費時間修,直接簡化提示詞重跑
  • 自己修:畫面大體上對了,只需要收尾(剪掉頭尾的廢格、調色、加音樂和字幕)

後製救不了一個壞的生成,但能讓好的生成更完整。

匯出之後:最後的修飾

生成結果對了之後,再補幾步,成片會更完整:

  • 剪掉頭尾的廢格。 AI 影片的開頭和結尾常常有 1–2 格的卡頓或殘影,剪掉最保險
  • 加音樂和字幕。 發社群媒體幾乎是必備——音樂可以蓋掉聲音上的瑕疵,字幕讓內容不開聲音也看得懂
  • 依平台裁切。 直式(Reels/TikTok)用 9:16,動態牆貼文用 1:1,網頁/橫式用 16:9。先產生橫式再裁切,比直接生成直式保留更多構圖彈性
  • 統一調色。 如果要把多段片段接在一起,先統一色調,整體看起來才會連貫

進階:首尾影格(frames to video)實戰

一張圖片只能做出一個鏡頭。想做「從 A 狀態變成 B 狀態」的內容,就用首尾影格(frames to video):給模型一張「開始影格」和一張「結束影格」,它會自動補上中間的過程。

我用「人物變身」做了測試——同一位女性,從日常的藍襯衫形態變成科幻戰甲形態(首尾影格的經典用法):

第一張影格:日常藍襯衫
第一張影格 · 日常形態(藍襯衫)
最後一張影格:科幻戰甲形態
最後一張影格 · 變身形態(科幻戰甲)
查看首尾影格的提示詞

The young woman in the light blue linen shirt transforms into her sci-fi armored form: a flash of blue energy sweeps over her body, the high-tech suit with glowing energy lines materializes over her clothes, her hair lifts with static energy, and she raises her head with a determined expression. Smooth, cinematic transformation, consistent face throughout. No cuts, no text, no logos.

Veo 3.1 Fast · 首尾影格 · 720p · 8 秒 · 日常 → 戰甲

實測結果:第一格是日常藍襯衫,最後一格是完整的科幻戰甲,中間的能量覆蓋、服裝轉變、頭髮揚起都銜接得很自然——臉始終沒有變。整個變身是「加上新的元素」,而不是「換了一個人」。

首尾影格適合的應用場景:

  • 變身/換裝:日常 → 戰鬥形態、素顏 → 全妝、舊衣服 → 新衣服
  • 產品狀態變化:關閉 → 打開、空 → 滿
  • 場景時間變化:白天 → 夜晚、晴天 → 雨天

和單張圖片轉影片的差別:圖片轉影片是「讓這張圖動起來」,首尾影格是「讓這張圖變成那張圖」——中間的過程由模型補全

進階:多張圖片拼接

做長內容還有另一個方法:每張圖片各生成一段短片段,再用剪輯軟體拼起來。幾段乾淨的短片段,勝過一支瑕疵很多的長影片——社群媒體上的內容大多是這樣做出來的。VidLux 的首尾影格負責單一鏡頭的狀態變化,多鏡頭的敘事則靠拼接完成。

常見問題排查對照表

症狀原因解法
臉/車身變形運動太強,或來源圖本身有問題簡化動作 + 加強鎖定句
多出手/多出車輪細節在運動過程中被重新繪製加上 Keep hands natural,動作改輕
主體騰空/瞬移提示詞要求了違反物理定律的動作砍掉任何違反物理的動作
背景扭曲背景太複雜,模型誤讀改用背景更簡單的圖片,或加上 Keep background unchanged
運動太劇烈一個提示詞塞了太多動作只保留一個主要運動
幾乎不動提示詞太保守把「slow/camera move」寫得更明確

適合用圖片轉影片的場景

  • 社群內容:旅遊照片、穿搭照、美食照,加一個緩慢推近就活起來了。別過度——一個動作就夠
  • 產品行銷:產品圖變成短廣告(橫移鏡頭、光線掃過)。產品照要格外小心——logo、標籤、瓶身線條都不能動
  • 個人回憶:老照片加上輕柔的動作(緩慢運鏡、柔和的眨眼)。老照片越模糊,動作就要越輕
  • 創意概念:情緒板、角色設定、遊戲場景——快速看看這個畫面動起來是什麼感覺

AI 圖片轉影片目前還做不到的事

誠實說幾個限制:

  • 動作越大,越難控制。 提示詞要求太多時,臉、手、logo、文字會最先崩壞
  • 它不知道「之前發生了什麼」。 圖片轉影片是「從這張圖開始」,不是「接續上一秒」
  • 版權問題不會消失。 請使用自己的圖片或有授權的圖片;把圖片轉成影片,不代表你就擁有它的版權
  • 最實用的原則:選最「能用」的結果,而不是最「炫」的。如果主體的核心特徵變了,就重新生成

常見問題

Q:圖片轉影片和文字轉影片有什麼差別? 文字轉影片是從無到有生成;圖片轉影片則是在你的圖片上加入運動。圖片轉影片能保住你想要的主體(你的人物、產品、場景),但運動的自由度比較小。

Q:一開始該生成多長? 先從 8 秒開始。這個長度足夠看出方向,又不會把問題放大。做社群短影音的話,乾淨的 3 秒,勝過有瑕疵的 8 秒

Q:同一張圖片可以重複使用嗎? 可以。改提示詞、換模型,同一張輸入圖片就能產出完全不同的結果。這正是圖片轉影片省時間的地方——一張好圖,多種版本。

完整流程(5 步回顧)

  1. 選圖:主體清晰、有運動空間、有「能想像下一秒」的運動方向
  2. 定動作:鏡頭/主體/環境,一個主要運動
  3. 寫提示詞:主體 + 動作 + 風格 + 鏡頭 + 光線 + 鎖定來源圖
  4. 生成並檢查:看運動量數據 + 逐格檢查主體和細節
  5. 修復:一次只改一個變數,重新生成

最後說點心得:靜態圖片動畫化,克制比炫技更重要。 一個動作溫和、穩定流暢的版本,永遠勝過「什麼都要動」卻失去控制的版本。想要大場面?那是文字轉影片的工作——別為難一張靜態圖片。

現在就到 VidLux 圖片轉影片試試看吧——上傳一張圖片,用上面的公式寫提示詞,8 秒後就能看到結果。