这次用同一批输入素材、同一套参数,实测三款模型的真实表现。所有视频统一 8 秒、720p、16:9——在 Veo 3.1 Fast 的能力上限内比,谁强谁弱一目了然。
三个模型档案
开始对比之前,先把三款模型的基本情况说清楚——它们不是"同档次换名字"的关系,定位完全不同。
Veo 3.1 Fast — Google 的"速度优先"版
Google DeepMind 把 Veo 3.1 分成 Quality 和 Fast 两个版本。Fast 版的卖点是在基本一致的规格下更快、更便宜。Curious Refuge 实验室对 Veo 3.1 Fast 的实测总分是 6.9/10,其中指令遵循 7.3/10 是最强项(与 Quality 版同水平),时序一致性 6.5、视觉保真 7.1、运动质量 6.9、电影感 6.5——评测的结论是"与 Quality 版的差距没有想象中那么大,但价格明显更低"。在 VidLux 中,Veo 3.1 Fast 输出 4、6、8 秒片段,最高 1080p。
Kling 3.0 Turbo — 快手的"量产"版
快手在 2026 年 6 月 17 日发布 Kling 3.0 Turbo,是 Kling 3.0 家族的速度优化版。它的两个硬本事:多镜头提示(一条提示词里最多定义 6 个镜头,模型自动处理转场,不用后期拼接)和 vCoT 场景推理(先理解场景逻辑再渲染,运镜、光线、主体行为的指令完成度明显高于 2.x 代)。另外 3.0 代改进了唇形同步和长片段稳定性。在 VidLux 中可选 3–15 秒,720p/1080p。
Seedance 2.0 Mini — 字节的"轻量"版
Seedance 2.0 Mini 是 ByteDance Seedance 2.0 家族的轻量型号,定位是更快、更省积分的日常创作。它和 2.0 标准版共用同一套多模态输入(图片、视频、音频参考),但分辨率档位只有 480p/720p,在 VidLux 中单次可选 4–15 秒。官方资料很少——它是三者里最"新"也最不喧闹的一个,所以这篇实测里它的表现尤其值得看:没有光环,只有成片。
时长档位与成本(为什么选 8 秒对比)
三款模型的单次生成时长上限完全不同,这是选型时最容易被忽略的差异:
| 模型 | 可选时长 | 720p / 8 秒成本 |
|---|---|---|
| Veo 3.1 Fast | 仅 4 / 6 / 8 秒 | 30 积分 |
| Kling 3.0 Turbo | 3–15 秒(13 档) | 120 积分 |
| Seedance 2.0 Mini | 4–15 秒(12 档) | 160 积分 |
Veo 3.1 Fast 单次最多 8 秒,但 8 秒只要 30 积分——比 Kling 3.0 Turbo 便宜 4 倍、比 Seedance 2.0 Mini 便宜 5 倍以上。如果你的素材就是短视频(社媒片段、产品展示、表情包),Veo 3.1 Fast 是性价比最高的选择;需要一条超过 8 秒的连续镜头,才轮到 Kling 3.0 Turbo 和 Seedance 2.0 Mini。
这也是全文所有对比统一用 8 秒的原因:在 Veo 3.1 Fast 的能力上限内比,才有公平可言。
生成模式支持(哪些模型能做什么)
三款模型的输入方式也不一样,选型前先看这张表:
| 生成模式 | Veo 3.1 Fast | Kling 3.0 Turbo | Seedance 2.0 Mini |
|---|---|---|---|
| 文生视频 | ✅ | ✅ | ✅ |
| 图生视频 | ✅ | ✅ | ✅ |
| 参考生视频(图片) | ✅(最多 3 张) | ❌ 不支持 | ✅(最多 9 张) |
| 参考生视频(音频) | ❌ 不支持 | ❌ 不支持 | ✅(最多 3 段) |
| 参考生视频(视频) | ❌ 不支持 | ❌ 不支持 | ✅(最多 3 段) |
两个值得注意的点:
- Kling 3.0 Turbo 没有参考生视频。它只能靠文字和单张图片,如果你需要"照着参考素材生成",它直接出局。
- Seedance 2.0 Mini 是唯一支持音频和视频参考的——除了最多 9 张参考图,还能喂 3 段参考视频和 3 段参考音频。这意味着它可以"参考一段视频的动作/运镜"或"参考一段音频的节奏/风格"来生成,这是 Veo 和 Kling 都给不了的输入维度。后面的参考生视频对比,就是 Veo 3.1 Fast(仅图片参考)和 Seedance 2.0 Mini(多模态参考)之间的较量。
测试方法
为了公平,所有测试遵循同一套规则:
- 统一参数:全部 8 秒、720p、16:9(在 Veo 3.1 Fast 的上限内)
- 统一输入:每个测试组内,三款模型用完全相同的提示词;图生视频用同一张 GPT Image 2 生成的输入图
- 统一评价:每个视频做逐帧客观分析(运动量、转场点、人脸位置稳定性),结合肉眼观察
- 覆盖三种模式:文生视频(2 组)、图生视频(2 组)、参考生视频(1 组)、多段叙事(1 组)
测试素材全部用 VidLux 自己的图片生成模型(GPT Image 2)生成,保证输入可控、可复现。
先看结论
| 测试 | 本次更强 | 关键区别 |
|---|---|---|
| 文生视频:骑手跟拍 | Kling 3.0 Turbo | 后段加速驶离最完整,镜头指令覆盖最全 |
| 文生视频:雨夜人物 | Seedance 2.0 Mini | 停顿→抬头动作节奏最清晰,脸部最稳 |
| 图生视频:球场自拍 | 各有胜负 | Kling 3.0 Turbo 的脸最稳,Veo 3.1 Fast 的动作最足但画面最碎 |
| 图生视频:香水产品 | Kling 3.0 Turbo | 运动量最低,最接近固定机位产品镜头 |
| 参考生视频(双角色 + 场景) | Seedance 2.0 Mini | 双人互动都能稳定生成;Seedance 支持音频/视频参考,输入维度最全 |
| 多段叙事(纸船) | Seedance 2.0 Mini | 三个转场节奏最均匀,节点最清楚 |
一句话总结:要稳选 Kling 3.0 Turbo,要省选 Veo 3.1 Fast,要参考控制选 Seedance 2.0 Mini。下面逐项看证据。
文生视频:骑手跟拍
三款模型用同一条提示词,在 文生视频 模式下完成一个连续跟拍:骑手从市场小巷出现、绕过货车、从摄影机旁经过、摄影机跟上并并行。测的是动作连续性和运镜指令完成度。
查看三款模型共用的骑手提示词
One continuous street-level tracking shot at blue hour. A bicycle courier wearing a faded red jacket turns out of a narrow neighborhood market lane, leans around a slow delivery van, then accelerates past the camera as it pans and keeps pace beside him. Shopkeepers pull down metal shutters and two pedestrians step aside naturally. Wet pavement, ordinary storefront lighting, slight handheld movement, realistic wheel rotation, body balance and motion blur. Keep the same rider, bicycle, jacket and street layout throughout. Ambient traffic, bicycle chain and tires on wet road. No cuts, no slow motion, no text, no logos.
| 指标 | Veo 3.1 Fast | Kling 3.0 Turbo | Seedance 2.0 Mini |
|---|---|---|---|
| 运动均值 | 14.6 | 9.1 | 10.1 |
| 前/中/后段节奏 | 12.2 / 17.2 / 14.6 | 3.1 / 11.4 / 12.8 | 9.6 / 9.7 / 11.0 |
| 脸部 X 漂移 | 78.4% | 71.7% | 58.7% |
Kling 3.0 Turbo 的运动曲线最有"叙事感":前段 3.1(骑手刚出现、动作少)→ 中段 11.4(绕过货车)→ 后段 12.8(加速驶离),三个阶段对应提示词的三步动作,节奏层层推进。Veo 3.1 Fast 运动最猛(均值 14.6),但三段几乎一样快,缺少"出现→加速"的层次。Seedance 2.0 Mini 居中,动作覆盖完整但节奏较平。
这组 Kling 3.0 Turbo 胜在完成度——不是"动得多",而是"该动的时候才动"。
文生视频:雨夜人物
同一条提示词:雨夜穿黄色雨衣的女性走过街道、在红色雨棚下停步、抬头看霓虹倒影。测的是电影感和表演节奏。
查看三款模型共用的雨夜提示词
Medium-wide cinematic shot of a woman in a mustard-yellow raincoat walking through a rainy city side street at night. She pauses under a red awning and looks up as neon reflections ripple across the wet pavement. Slow dolly-in, natural body motion, realistic face, consistent clothing, ambient rain, no text, no logos.
| 指标 | Veo 3.1 Fast | Kling 3.0 Turbo | Seedance 2.0 Mini |
|---|---|---|---|
| 运动均值 | 4.0 | 4.0 | 5.4 |
| 中段节奏 | 5.0 | 4.3 | 8.2 |
| 脸部 X 漂移 | 26.6% | 36.2% | 14.2% |
| 脸部 Y 漂移 | 11.3% | 11.6% | 19.2% |
Seedance 2.0 Mini 的中段运动峰值 8.2,明显高于另外两款——对应的正是"停步 + 抬头"这个关键表演动作,节奏感最强。脸部 X 漂移 14.2% 也是三家最低(镜头推近时人物保持最稳)。Kling 3.0 Turbo 在 3.25 秒处有一个明显转场(画面切换),可能是雨棚下的光线变化;Veo 3.1 Fast 整体平稳但表演动作偏含蓄。
这组 Seedance 2.0 Mini 的表演节奏最清楚,"走到雨棚下、抬头、霓虹倒影"一气呵成。
图生视频:球场自拍
先用 GPT Image 2 生成一张夜间球场女性自拍图,三款模型用同一张图做 图生视频,提示词要求:听到进球后欢呼、把手机转向观众席、再回到自拍。测的是人脸稳定性和身份保持。
查看三款模型共用的球场提示词
The woman hears a goal happen off-camera and the crowd erupts. She reacts instantly with a surprised laugh, jumps slightly, then turns her phone toward the cheering crowd for a moment and back to her face. Natural blinking and arm movement, realistic low-light grain, slight exposure shifts under stadium floodlights, motion blur during the sudden reaction, candid smartphone realism, no cinematic camera movement. Sound: crowd murmur, a sudden loud cheer, and her natural laugh. No cuts, no text, no logos.
| 指标 | Veo 3.1 Fast | Kling 3.0 Turbo | Seedance 2.0 Mini |
|---|---|---|---|
| 运动均值 | 13.3 | 6.5 | 10.7 |
| 明显转场点 | 18 个 | 0 | 12 个 |
| 脸部 X 漂移 | 47.0% | 16.6% | 51.8% |
| 脸部 Y 漂移 | 32.5% | 12.1% | 36.7% |
这组三款模型各有明显短板:
- Veo 3.1 Fast:运动最足(13.3),"欢呼 + 转手机 + 回来自拍"的动作全做了,但画面有 18 个转场点——集中在 3 秒和 5 秒附近,画面碎片化严重,转手机时经常多出异物。动作最完整,画面最不稳。
- Kling 3.0 Turbo:运动最克制(6.5),脸部漂移全场最低(X 16.6% / Y 12.1%),从头到尾脸最稳。代价是动作幅度小,"欢呼"的冲击力不如 Veo。
- Seedance 2.0 Mini:运动居中(10.7),12 个转场点集中在 3.7–4.9 秒(欢呼爆发段),表情冲击力强,但大表情时脸容易变形。
结论:要脸稳选 Kling 3.0 Turbo,要动作完整选 Veo 3.1 Fast(接受画面碎),要情绪冲击选 Seedance 2.0 Mini。
图生视频:香水产品
同一张 GPT Image 2 生成的香水瓶产品图,三款模型做 图生视频 环绕运镜。测的是物体一致性和产品镜头质感。
查看三款模型共用的香水提示词
The camera makes a slow 120-degree orbit around the bottle while a narrow light sweeps across the glass. Keep the bottle shape, cap, reflections, and proportions consistent. Premium commercial lighting, no hands, no text, no logos.
| 指标 | Veo 3.1 Fast | Kling 3.0 Turbo | Seedance 2.0 Mini |
|---|---|---|---|
| 运动均值 | 2.0 | 1.5 | 2.6 |
| 运动峰值 | 2.4 | 2.1 | 4.6 |
产品镜头是最"安静"的测试:三款模型的运动量都很低(1.5–2.6),因为画面主体是静止的瓶子。差异在细节:Kling 3.0 Turbo 运动量最低(1.5),最接近固定机位产品镜头,瓶身最稳;Seedance 2.0 Mini 运动峰值最高(4.6),环绕运镜最明显,有"产品在转"的动感;Veo 3.1 Fast 居中,平稳但环绕幅度最小。
做电商产品视频,要稳选 Kling 3.0 Turbo,要环绕动感选 Seedance 2.0 Mini。
参考生视频:两个角色 + 场景参考
参考生视频这组用了 3 张 GPT Image 2 生成的参考图:角色 A(奶油毛衣女性)、角色 B(眼镜橄榄绿外套男性)、场景(现代咖啡馆室内)。提示词让两个角色在 参考生视频 模式下于这个场景里面对面聊天。
先说清楚参考生视频的工作方式:参考图定义"谁和在哪",提示词定义"发生什么"。模型从角色参考图里提取长相、发型、衣着特征,从场景参考图里提取环境,然后在提示词描述的情节里生成。这组测试的是更难的任务:两个角色的身份都不能搞混,场景还要对得上。
注意:Kling 3.0 Turbo 不支持参考生视频,所以本组只有 Veo 3.1 Fast 和 Seedance 2.0 Mini 参赛。



查看参考生视频的提示词
The young woman in the cream knit sweater and the man with glasses in the dark olive jacket are sitting across from each other at a small wooden table inside a cozy modern cafe with large windows and warm pendant lights, matching the cafe interior in the reference image. She laughs while telling a story, he listens and smiles, then they both raise their coffee cups for a toast. Keep both faces, hairstyles and outfits consistent. Natural conversational movements, warm afternoon light through the window. No text, no logos.
| 指标 | Veo 3.1 Fast | Seedance 2.0 Mini |
|---|---|---|
| 运动均值 | 3.1 | 6.4 |
| 全程检测到人脸 | 100% | 100% |
两个角色 + 场景的复杂度下,两款模型都能稳定生成双人互动。Veo 3.1 Fast 的画面更安静(运动均值 3.1,接近静态对话场景),两个角色和咖啡馆环境都交代得干净;Seedance 2.0 Mini 的动作更足(6.4,包含举杯、大笑等幅度更大的表演),双角色衔接自然。
这印证了档案区那张模式支持表:Seedance 2.0 Mini 的多模态参考是唯一支持音频 + 视频 + 多图片输入的,这种"照着参考素材稳定生成"的能力,是 Veo 和 Kling 都给不了的。如果你需要角色/场景可控的生成,Seedance 2.0 Mini 是三者里唯一认真的选项。
补充:纸船故事(多段叙事)
前两组文生视频(骑手跟拍、雨夜人物)测的是单镜头能力,这组补充测多段叙事:提示词包含三个节点——红纸船躲雨、营救萤火虫、与其他纸船抵达暖色水面。三款模型统一用 8 秒,看谁在相同容量里把三个节点讲得最完整。
查看三款模型共用的纸船提示词
A cinematic animated short in three connected shots about a tiny red paper boat that is afraid of rain. First shot: at blue-hour dusk, the red paper boat hides under a curled green leaf beside a rain-filled street gutter while several blue paper boats race past. The boat trembles as large drops hit the pavement. Second shot: a sudden stream carries a stranded glowing firefly toward a drain. The red boat sails out, catches the firefly beneath its folded paper sail, and turns across the current. Third shot: the storm softens. The red boat and firefly glide into a warm city-square reflection as the other paper boats gather around. The firefly rises and lights the scene; end on the red boat looking proud. Ambient rain and water sounds only. Keep the same red boat shape, fold lines, scale, and painted eyes in every shot. No music, no singing, no text, no logos.
| 指标 | Veo 3.1 Fast | Kling 3.0 Turbo | Seedance 2.0 Mini |
|---|---|---|---|
| 明显转场点 | 1 个(4.2 秒) | 2 个(2.3 秒、5.0 秒) | 3 个(1.8 秒、4.4 秒、7.6 秒) |
| 三段节奏 | 14.1 / 13.7 / 7.2 | 4.9 / 5.3 / 3.3 | 8.0 / 7.7 / 8.8 |
| 运动均值 | 11.6 | 4.5 | 8.2 |
统一 8 秒下,Seedance 2.0 Mini 依然把三个节点分得最清楚:转场点出现在约 1.8 秒、4.4 秒、7.6 秒(三段节奏 8.0 / 7.7 / 8.8,几乎均匀),叶子下躲雨、排水口附近营救、暖色结尾都能直接看懂。
Kling 3.0 Turbo 完成了两个转场(约 2.3 秒、5.0 秒),整体运动最平稳,只比 Seedance 少一个清晰的段落分隔。Veo 3.1 Fast 在同样的 8 秒里只出现一个明显转场(约 4.2 秒),且前段运动密集(14.1 / 13.7)、后段明显放缓(7.2)——三个节点更像被压成"前半段连续动作 + 后半段收尾"。
所以即使排除时长差异(三款都是 8 秒),多段叙事仍是 Seedance 2.0 Mini 的强项,Kling 3.0 Turbo 稳定但分段略少,Veo 3.1 Fast 更适合单个连贯动作而不是塞进多个情节节点。
横向对比
| 对比项 | Veo 3.1 Fast | Kling 3.0 Turbo | Seedance 2.0 Mini |
|---|---|---|---|
| 价格(720p/8s) | 30 积分 | 120 积分 | 160 积分 |
| 时长档位 | 仅 4/6/8 秒 | 3–15 秒 | 4–15 秒 |
| 参考生视频 | 仅图片(≤3 张) | 不支持 | 图片 + 音频 + 视频 |
| 真人表现 | 动作完整但画面碎 | 脸部最稳 | 情绪最强,大表情易变形 |
| 连续运动 | 运动最猛,节奏平 | 完成度最高,有层次 | 稳定,节奏偏平 |
| 产品镜头 | 平稳 | 最接近固定机位 | 环绕动感最强 |
| 多段叙事 | 单段连续动作 | 两转场,平稳 | 三转场,节奏最均匀 |
| 参考角色保持 | 角色漂移明显 | — | 碾压级稳定 |
怎么选
- 预算有限、只要短视频:选 Veo 3.1 Fast——8 秒 30 积分,三家里最便宜,动作和指令遵循都不差。社媒片段、产品展示、表情包首选。
- 要人脸稳、要长镜头:选 Kling 3.0 Turbo——脸部稳定性全场最佳,支持 3–15 秒,运动完成度最高。人物视频、连续跟拍首选。
- 要参考控制、要多模态输入:选 Seedance 2.0 Mini——唯一支持图片+音频+视频参考的模型,参考生视频角色保持碾压,多段叙事节奏最好。需要"照着素材生成"的场景首选。
没有"最好的模型",只有"最合适的用途"。三款覆盖了三条完全不同的路:Veo 3.1 Fast 走性价比,Kling 3.0 Turbo 走稳定性,Seedance 2.0 Mini 走参考控制——按你的场景选,别按名气选。
