
Veo 3.1 和 Seedance 2.0 都能生成带声音的视频,但它们解决的是不同的问题。来自 Google DeepMind 的 Veo 3.1,最适合需要一个镜头紧贴详细提示词的场景,还可以用起始帧和结束帧来固定画面。来自字节跳动 Seed 团队的 Seedance 2.0,则面向可以包含多个镜头的更长视频,由一大批图片、视频片段和音频来引导。
谁都不是简单的“赢家”。哪个更好,取决于你的项目是一个精确指导的单镜头,还是一段由参考素材拼起来的多镜头短序列。下文的参数于 2026 年 9 月 28 日依据 Google 和字节跳动的官方页面以及 TechCrunch 的报道核对。
简短回答
- 选 Veo 3.1:适合单个主视觉镜头、产品视频或一句对白,要求提示词、第一帧和最后一帧都得到遵守,并且你可能需要 4K 母版。
- 选 Seedance 2.0:适合一次生成就要覆盖一个更长的片段(最长 15 秒)且包含几次切镜,或者你想用大量参考文件(包括视频和音频)来引导结果。
- 两者 都会和画面一起生成音频,所以做粗剪时都不需要单独配音。
Veo 3.1 对比 Seedance 2.0 参数
| Veo 3.1(Google DeepMind) | Seedance 2.0(字节跳动 Seed) | |
|---|---|---|
| 发布时间 | 2025 年 10 月 15 日(2026 年 1 月 13 日升级 4K 和竖屏) | 2026 年 2 月 12 日 |
| 单段时长 | Google API 中为 4、6 或 8 秒(1080p 和 4K 需 8 秒) | 最长 15 秒 |
| 每段镜头数 | 默认一个连续镜头;在提示词里要求时可以快速切镜 | 多镜头输出是主打功能 |
| 分辨率 | 720p、1080p、4K(Google 说明 4K 为放大) | 字节跳动发布文章未说明 |
| 画面比例 | 16:9、9:16 | 据 TechCrunch 报道,CapCut 中有六种画面比例 |
| 输入 | 文字;一张起始图;起始帧 + 结束帧;最多 3 张参考图 | 文字,外加最多 9 张图片、3 段视频和 3 段音频 |
| 音频 | 与视频一起生成:对白、音效、环境声 | 以双声道音频与视频一起生成:音乐、环境声、旁白 |
| 使用渠道 | Gemini App、Flow、Gemini API、Vertex AI;Veo Video | 剪映(中国)、部分市场的 CapCut、Dreamina、BytePlus |
单段时长与多镜头序列
这是最大的实际差别。字节跳动在发布公告中把 Seedance 2.0 的输出描述为“15 秒高质量多镜头音视频”。因此,一次生成就可以容纳一段短序列(比如一个远景、一个反应镜头和一个特写),而不只是一个镜头。
Veo 3.1 以更短的单位工作。Google 的 API 每次生成提供 4、6 或 8 秒,而 1080p 或 4K 需要完整的 8 秒。Google 自家工具可以延长视频:API 在 720p 下每次延长 7 秒,最多 20 次;Flow 的 Extend 功能可以做出一分钟或更长的连续视频。不过对于较长的作品,通常还是把它规划成几个 Veo 镜头,再剪在一起。
这个限制没有听起来那么大。只要提示词要求,一段 Veo 视频照样可以改变取景,下面的例子就是这样。你得不到的,是 Seedance 那种一次生成就把一个场景按规划好的镜头维持 15 秒的能力。
这对你意味着什么: 如果要交付的是一支用几个镜头讲完的 10–15 秒社交广告,Seedance 2.0 一次生成就能做到。如果你本来就要逐个镜头剪辑,Veo 3.1 的 8 秒视频正好契合这种工作流,而且每个镜头都可以单独重新生成,不影响其他镜头。
参考输入与创作控制
Seedance 2.0 的另一个主打功能,是你可以喂给它多少素材。字节跳动列出的是:一次生成中,除文字提示词外,最多可加 9 张图片、3 段视频和 3 段音频。实际使用中,这意味着你可以给它一组多角度的角色设定图、一段你想借用其运镜的视频,以及一段用来卡动作节奏的音乐。
Veo 3.1 的控制方式范围更窄,但非常直接:
- 文生视频: 提示词描述整个场景、镜头和声音。
- 图生视频: 你的照片成为第一帧。
- 首尾帧: 加一张结束帧,模型会构建两张图之间的动作。对于镜头必须落在特定构图上的揭晓和转场,这很有用。
- 参考图: 最多三张人物、角色或产品的图片,让它们在新场景中保持一致。Google 把这叫作 Ingredients to Video(素材生成视频)。
代价在于准备时间。用 Seedance,花在收集优质参考素材上的功夫越多,效果越好;用 Veo,功夫则要花在写出精确的提示词、挑选一两张有力的画面上。如果你手头有一整个文件夹的品牌素材和参考视频,Seedance 能用上更多。如果你只有一张产品照片和一个清晰的镜头构想,Veo 3.1 用更少的准备就能做到。
音频:对白、音效与音乐
两个模型都会和画面一起生成声音。
Google 表示 Veo 3.1 能生成“音效、环境声,甚至对白”,而且音频比 Veo 3 更丰富。音轨在提示词里指导:台词放在引号里,写明音效,再描述环境声。
字节跳动把 Seedance 2.0 的音频描述为双声道,涵盖背景音乐、环境音效和角色旁白。由于它还接受音频片段作为输入,你可以把现成的音乐或人声交给它作为基础,这是 Veo 3.1 不提供的。字节跳动自己的发布文章也提到,“偶尔出现的音频失真”是它仍在改进的方面。
对于对白场景,如果需要一句简短台词准确落在某个动作上,Veo 3.1 在提示词层面的控制很直接。对于以音乐为主导的作品,如果你已经有了配乐,Seedance 2.0 的音频输入是更直接的路径。
分辨率与交付格式
Veo 3.1 提供 720p、1080p 和 4K,画面比例为 16:9 或 9:16。Google 在 2026 年 1 月 13 日的更新中加入 4K,并称之为“业界领先的放大技术”,所以应把 4K 当作更清晰的母版,而不是生成了更多细节的证据。输出为每秒 24 帧。
字节跳动关于 Seedance 2.0 的发布文章没有说明输出分辨率,你能看到的选项取决于所用的 App 或 API。TechCrunch 报道 CapCut 上线时提供六种画面比例。如果你有固定的交付规格,比如 4K 母版或精确的播出尺寸,请在投入之前先在你打算使用的产品里确认。
使用渠道与可用性
Veo 3.1 可以在 Google 的 Gemini App、Flow、Gemini API 和 Vertex AI 中使用,也可以通过 Veo Video 等独立平台使用。Google 会在 Veo 的输出中加入不可见的 SynthID 水印。
Seedance 2.0 的推出则更参差不齐。TechCrunch 在 2026 年 3 月 26 日报道,字节跳动已开始把它上线到巴西、印度尼西亚、马来西亚、墨西哥、菲律宾、泰国和越南的 CapCut,中国用户则通过剪映使用。此前,因好莱坞电影公司和美国电影协会(Motion Picture Association)在版权问题上的批评,字节跳动暂停过全球推广。CapCut 禁止用真实人脸图片和未经授权的知识产权生成视频,字节跳动要求使用真实人物作为参考时进行身份验证或提供法律授权。企业也可以通过字节跳动的 BytePlus 平台使用它。
如果你不在这些市场,可用性本身可能就替你做了决定。
已知局限
两个模型都有已知的局限:
- Veo 3.1: 单位较短(1080p 和 4K 下为 8 秒),所以较长的作品需要规划或延长;Google 的安全过滤器会拦截部分提示词,基于图片的生成只允许出现成年人。
- Seedance 2.0: 字节跳动表示,该模型“在细节稳定性、超写实度和动态表现力上仍需持续打磨”,并提到在多主体一致性、文字渲染和复杂编辑效果上还有改进空间。
该选哪一个?
| 你的项目 | 更合适 | 原因 |
|---|---|---|
| 单个主视觉镜头或产品视频 | Veo 3.1 | 紧贴提示词,支持首尾帧,有 4K 选项 |
| 用几个镜头讲完的短广告 | Seedance 2.0 | 一次生成最长 15 秒的多镜头输出 |
| 保持角色一致 | 都可以 | Veo 3.1 支持最多 3 张参考图;Seedance 2.0 支持最多 9 张图片外加视频 |
| 按现有音乐卡点的视频 | Seedance 2.0 | 接受音频片段作为输入 |
| 镜头前的一句简短台词 | Veo 3.1 | 在提示词里用引号写出对白 |
| 4K 母版 | Veo 3.1 | 提供 720p、1080p 和 4K 选项 |
很多团队会两者都用:用 Seedance 2.0 做一段序列的多镜头草稿,用 Veo 3.1 做那些在画面和声音上都必须完全到位的单个镜头。
在 Veo Video 上试用 Veo 3.1
Veo Video 不提供 Seedance 2.0,但提供三档 Veo 3.1。每次生成一段带声音的 8 秒视频,可选 16:9 或 9:16,分辨率 720p、1080p 或 4K。你可以从文字或照片开始,并在任何档位上添加结束帧。参考图在 Veo 3.1 Fast 上使用,每段视频最多三张。
一个合理的工作流是:先用 Veo 3.1 Lite 在 720p 下找到合适的提示词,再用完整版 Veo 3.1 生成最终版本。新账户可获得 30 免费积分,足够生成一段 720p 的 Veo 3.1 Lite 视频。每次运行都是一次新的生成,所以最终版本会和草稿很接近,但不会完全相同。
更多对比请看 Veo 3.1 对比 Kling AI 和 Veo 3.1 对比 Wan 2.6。
