
Veo 3.1 和 Wan 2.6 都是能与画面一起生成声音的视频模型,但它们适合不同的任务。来自阿里巴巴的 Wan 2.6(通义万相)能生成更长的视频(最长 15 秒),可以自行把一条提示词拆成多个镜头,还能接受角色的参考视频,连同其声音一起使用。来自 Google DeepMind 的 Veo 3.1 生成的视频更短,但紧贴详细的提示词,支持首尾帧控制,并提供 4K 选项。
本文解释每项差异在实际使用中意味着什么。参数于 2026 年 9 月 28 日依据阿里云和 Google 的官方文档核对。
简短回答
- 选 Wan 2.6:适合 10–15 秒的视频、自动多镜头序列、方形或 4:3 格式,或者你想通过参考视频把角色的外貌和声音带进新场景。
- 选 Veo 3.1:适合单个精确指导的镜头、两个既定画面之间的转场、4K 母版,或者在提示词里逐句写好的对白。
- 两者都不能下载。 Wan 2.6 和 Veo 3.1 一样是托管模型;阿里巴巴公开的权重只到 Wan 2.2 为止。
Veo 3.1 对比 Wan 2.6 参数
| Veo 3.1(Google DeepMind) | Wan 2.6(阿里巴巴) | |
|---|---|---|
| 发布时间 | 2025 年 10 月 15 日(2026 年 1 月 13 日升级 4K 和竖屏) | 2025 年 12 月 16 日 |
| 单段时长 | Google API 中为 4、6 或 8 秒(1080p 和 4K 需 8 秒) | 2–15 秒(参考生视频:2–10 秒) |
| 分辨率 | 720p、1080p、4K(Google 说明 4K 为放大) | 720p、1080p |
| 画面比例 | 16:9、9:16 | 16:9、9:16、1:1、4:3、3:4 |
| 多镜头 | 默认单镜头;只有在提示词里要求时才切镜 | 内置多镜头模式 |
| 起点 | 文字;一张起始图;起始帧 + 结束帧;最多 3 张参考图 | 文字;一张首帧图;最多 5 个参考(最多 3 段视频、最多 5 张图片) |
| 音频 | 与视频一起生成:对白、音效、环境声 | 自动生成,或使用你提供的音轨 |
| 权重 | 无公开权重;由 Google 托管 | 无公开权重(Hugging Face 上最新为 Wan 2.2);由阿里巴巴托管 |
| 使用渠道 | Gemini App、Flow、Gemini API、Vertex AI;Veo Video | 阿里云百炼(Alibaba Cloud Model Studio)、Wan 官网、千问(Qwen)App |
单段时长:8 秒对比最长 15 秒
Wan 2.6 的文生视频模型接受 2 到 15 之间的任意整数秒。多出来的时长,适合需要时间展开的单个连续动作,或者不该拆成几次生成的短广告。它的参考生视频模型最长 10 秒。
Veo 3.1 以更短的单位工作:Google API 中为 4、6 或 8 秒,1080p 和 4K 需要完整的 8 秒。Google 的工具可以延长视频(API 在 720p 下每次加 7 秒,最多 20 次),但大多数较长的 Veo 项目,都是由几个 8 秒镜头剪辑而成。好处是每个镜头都可以单独重新生成,不影响其余部分。
多镜头叙事
阿里巴巴把“智能多镜头叙事”作为 Wan 2.6 的主打功能。在 API 中,你通过多镜头设置(同时开启提示词自动扩写)来启用它,模型会把创意拆成几个镜头,并保持关键细节一致。当你想要一段序列(建立镜头、动作、反应),又不想自己规划每一次切镜时,这很方便。
Veo 3.1 默认生成一个连续镜头。你仍然可以在提示词里要求切镜,模型也常常会在 8 秒内改变取景,但这需要你明确指导,而不是把镜头规划交给模型。
这对你意味着什么: 如果你更愿意让模型来组织一段短序列,Wan 2.6 会替你做更多。如果你想控制每一个镜头,Veo 3.1 每次生成一个镜头的方式更容易驾驭。
参考:视频对比图片
Wan 2.6 的参考生视频模型最多接受五个参考,其中最多三个可以是视频(每段 1–30 秒),最多五个可以是图片。每个参考应只展示一个角色或物体。据阿里巴巴介绍,模型会从中提取“角色外貌和声音(如有)”,所以一段某人说话的短视频,可以把他的样子和声音一起带进新场景。
Veo 3.1 使用静态图片。你可以给它最多三张人物、角色或产品的参考图来保持一致(Google 把这叫作 Ingredients to Video,即素材生成视频),也可以设定第一帧和最后一帧,让模型构建两者之间的动作。静态图片更容易准备;参考视频承载的信息更多,比如一个人怎么动、听起来怎么样。
音频
两个模型都会和视频一起生成声音。
Veo 3.1 生成对白、音效和环境声,你在提示词里指导它们:台词放在引号里,写明音效,描述环境声。
Wan 2.6 要么自动生成匹配的背景音乐和音效,要么使用你上传的音频文件。当音轨已经存在(一段旁白、一段广告歌),而画面必须跟着它走时,第二种方式很有用。
分辨率与格式
Veo 3.1 提供 720p、1080p 和 4K,画面比例为 16:9 或 9:16。Google 把它的 4K 描述为“业界领先的放大技术”,所以可以把它看作适合大屏幕的更清晰母版。
Wan 2.6 提供 720p 和 1080p,但有五种画面形状:16:9、9:16、1:1、4:3 和 3:4。如果你需要模型直接输出方形帖子或 4:3 画面,Wan 2.6 能省掉一次裁切。
开源对比托管
早期的 Wan 版本是开放权重模型,这也是 Wan 常被称为开源模型的原因。但这一点已不适用于 Wan 2.6。阿里巴巴在 Hugging Face 上的 Wan-AI 页面列出的权重只到 Wan 2.2,而 Wan 2.6 通过阿里云百炼、Wan 官网和千问 App 提供。如果你必须在自己的 GPU 上运行模型,那么相关的版本是 Wan 2.2,而不是 Wan 2.6。
Veo 3.1 同样只有托管形式:你需要通过 Google 的产品和 API,或者通过 Veo Video 等平台使用它。
在 Wan 2.6 之后,阿里巴巴还发布了更新的 Wan 版本,包括 Wan 3.0,其文档列出的单次生成最长可达 30 秒。如果你今天要选一个 Wan 模型,也应该和当前版本做比较。
该选哪一个?
| 你的项目 | 更合适 | 原因 |
|---|---|---|
| 一个 10–15 秒的单镜头 | Wan 2.6 | 每段最长 15 秒 |
| 由模型替你规划的短序列 | Wan 2.6 | 内置多镜头模式 |
| 角色的声音必须延续 | Wan 2.6 | 参考视频可以传递外貌和声音 |
| 精确的主视觉镜头或产品视频 | Veo 3.1 | 紧贴提示词,支持首尾帧 |
| 落在既定画面上的转场 | Veo 3.1 | 首尾帧控制 |
| 4K 母版 | Veo 3.1 | 720p、1080p 和 4K |
| 方形或 4:3 社交帖子 | Wan 2.6 | 五种画面比例 |
| 竖屏 Shorts、Reels 或 TikTok | 都可以 | 两者都支持 9:16 |
在 Veo Video 上试用 Veo 3.1
Veo Video 不提供 Wan 2.6,但提供三档 Veo 3.1。每次生成一段带声音的 8 秒视频,可选 16:9 或 9:16,分辨率 720p、1080p 或 4K。你可以从文字或照片开始,并在任何档位上添加结束帧;参考图在 Veo 3.1 Fast 上使用,每段视频最多三张。
先用 Veo 3.1 Lite 在 720p 下打磨提示词,再用完整版 Veo 3.1 生成最终版本。新账户可获得 30 免费积分,足够生成一段 720p 的 Veo 3.1 Lite 视频。
更多对比请看 Veo 3.1 对比 Seedance 2.0 和 Veo 3.1 对比 Kling AI。
