
Veo 3 是让视频生成“有了声音”的 Google DeepMind 模型:它于 2025 年 5 月 20 日在 Google I/O 上发布,能与画面一起生成对白、音效和环境声。2025 年 10 月 15 日发布的 Veo 3.1 保留了这一能力,并在此基础上改进。Google 表示,它带来了“更丰富的音频、更强的叙事控制和更高的真实感”“更强的提示词遵循”,以及把图片变成视频时更好的画面与声音。
值得升级吗?对大多数人来说,这个问题其实已经有了答案:Google 已在 Gemini API 中把 Veo 3 列为弃用,并以 Veo 3.1 取而代之,分为三档:Veo 3.1、Veo 3.1 Fast 和 Veo 3.1 Lite。真正值得了解的,是具体改了哪些地方,这样你把提示词迁移过去时,才知道该期待什么。
简短回答
- 声音: 两者都与视频一起生成音频;Google 称 Veo 3.1 的音频更丰富。
- 提示词遵循: Veo 3.1 更贴近你写的内容,从动作顺序到运镜都是如此。
- 图生视频: Google 特别提到,从照片开始生成时,画面和声音都更好。
- 新控制方式: 首尾帧,以及最多三张参考图,都是随 Veo 3.1 推出的。
- 分辨率: Veo 3.1 在 2026 年 1 月加入了 4K 选项;Veo 3 最高 1080p。
- 你的提示词: Veo 3.1 读得懂相同的提示词结构,所以可以直接把 Veo 3 提示词粘贴进来。但要预期得到的是一次新的生成,而不是和之前完全相同的视频。
Veo 3 对比 Veo 3.1 速览
| Veo 3 | Veo 3.1 | |
|---|---|---|
| 发布时间 | 2025 年 5 月 20 日(Google I/O) | 2025 年 10 月 15 日 |
| 在 Google API 中的状态 | 已弃用 | 现行版本,分三档(Veo 3.1、Fast、Lite) |
| 与视频一起生成声音 | 支持 | 支持,且更丰富 |
| 遵循提示词 | 支持 | 比 Veo 3 更贴近 |
| 照片生成视频 | 支持 | 支持,画面和声音更好 |
| 首尾帧 | — | 支持 |
| 参考图 | — | 最多 3 张 |
| Google API 中的单段时长 | 8 秒 | 4、6 或 8 秒(1080p 和 4K 需 8 秒) |
| 分辨率 | 720p、1080p | 720p、1080p、4K(放大) |
| 画面比例 | 16:9;Google 于 2025 年 9 月加入 9:16 | 16:9、9:16 |
| Google 自家工具中的延长 | — | 支持(API 中每次 +7 秒;在 Flow 中可达一分钟或更长) |
声音:Veo 3 带来的能力
在 Veo 3 之前,Veo 生成的视频是无声的,任何人声或音效都得在剪辑时另外加。Veo 3 改变了这一点:角色可以说出提示词里写好的台词,音效和背景声也会随画面一起出现。
Veo 3.1 在每一档都保留原生音频,用 Google 的话说,带来了“更丰富的音频”。请求声音的方法没有变:
- 把台词放在引号里,并说明是谁在说;
- 写出你想要的音效(“a door slams”“rain on the window”);
- 描述环境声(“café chatter”“distant traffic”)。
如果不写声音,模型仍然会为场景配上一条音轨。详细写法请看我们的 Veo 3.1 提示词指南。
更贴近提示词
Google 对 Veo 3.1 最主要的宣传点是“更强的提示词遵循”。实际使用中,这对按顺序描述多件事的提示词最重要:先是一个动作,然后是一个反应;一个特定的运镜;一种指定的风格。镜头写得越精确,生成结果里保留的内容就越多,所以花心思把提示词写精确是值得的。
这也是旧 Veo 3 提示词迁移效果不错的原因。Veo 3.1 读的是同一种提示词,所以你可以原样粘贴,再把 Veo 3 过去常常忽略的部分写得更紧凑。
更好的图生视频
Google 在 Veo 3.1 发布时特别提到“把图片变成视频时,音画质量得到提升”。从照片开始时,这张照片就是第一帧,提示词只需描述动作、镜头和声音。产品镜头、人像,以及任何需要保留原样的静帧,都适合用这个模式。
Veo 3.1 的新控制方式
首尾帧
给 Veo 3.1 一张起始图和一张结束图,它会构建两者之间的动作,并配上声音。当一个镜头必须落在既定构图上时就用它:一次揭晓、一个转向镜头的产品、从一个场景到下一个场景的转场。Veo 3 没有对应的功能。
参考图
最多三张人物、角色或产品的图片,告诉模型它们长什么样;模型再把它们放进新的场景。Google 把这叫作 Ingredients to Video(素材生成视频),并在 2026 年 1 月把它扩展到原生 9:16 竖屏视频。要让角色或产品在多段视频中保持一致,这是最直接的方法。
延长
在 Google 自家的工具中,Veo 3.1 的视频可以延长:Gemini API 在 720p 下每次增加 7 秒,最多 20 次;Flow 的 Extend 功能可以做出一分钟或更长的连续视频。
分辨率:4K 于 2026 年 1 月到来
Veo 3 以 720p 或 1080p 生成;Google 在 2025 年 9 月为 Veo 3 加入了 1080p 和 9:16 竖屏。2026 年 1 月 13 日,Google 为 Veo 3.1 加入 4K 选项,并称之为“业界领先的放大技术”。应当把 4K 理解为适合大屏幕的更清晰母版,而不是额外生成的细节。
值得换到 Veo 3.1 吗?
多数情况下,选择已经替你做好了:Veo 3 在 Google API 中已被弃用,新的工作应该放在 Veo 3.1 上。更有用的问题是:怎样平稳地迁移。
- 复用你的提示词。 结构(场景、镜头、引号里的对白、声音)是一样的,所以把 Veo 3 提示词粘贴进来作为起点。
- 把 Veo 3 忽略的部分写得更紧。 由于 Veo 3.1 更贴近提示词,那些你以前放弃了的细节,比如动作的确切顺序或某个特定运镜,值得重新写回去。
- 试试新的控制方式。 如果镜头必须停在某个特定画面,就加一个结束帧;如果角色在多段视频中必须长得一样,就用参考图。
- 按任务选档位。 用 Veo 3.1 Lite 打草稿,日常视频和参考图用 Veo 3.1 Fast,要发布的那一条用完整版 Veo 3.1。
在 Veo Video 上使用 Veo 3.1
你在 Veo Video 上生成的每一段 Veo 视频都运行在 Veo 3.1 上,包括我们 Veo 3 页面 上的生成器。这里没有单独的 Veo 3.0 模型。每次生成一段带声音的 8 秒视频,可选 16:9 或 9:16,分辨率 720p、1080p 或 4K。你可以从文字或照片开始,并在任何档位上添加结束帧。参考图在 Veo 3.1 Fast 上使用,每段视频最多三张。
新账户可获得 30 免费积分,足够生成一段 720p 的 Veo 3.1 Lite 视频,可以快速看看你的某条旧 Veo 3 提示词在 Veo 3.1 上效果如何。效果满意时,再用 Veo 3.1 以 1080p 或 4K 生成最终版本。
