
Veo 3.1とWan 2.6は、どちらも映像と一緒に音声を生成する動画モデルですが、向いている仕事が違います。AlibabaのWan 2.6は、より長い動画(最大15秒)を作れ、プロンプトを自動で複数のショットに分けることができ、キャラクターの参照動画を声ごと取り込めます。Google DeepMindのVeo 3.1は、詳細なプロンプトに忠実に従う短めの動画を作り、開始・終了フレームの制御と4Kの選択肢を備えています。
この記事では、それぞれの違いが実際に何を意味するのかを説明します。仕様は2026年9月28日に、Alibaba CloudとGoogleそれぞれの公式ドキュメントで確認しました。
要点
- Wan 2.6を選ぶのは、 10〜15秒の動画、自動のマルチショット連続映像、正方形や4:3のフォーマットが必要なとき、またはキャラクターの見た目と声を参照動画から引き継ぎたいときです。
- Veo 3.1を選ぶのは、 細かく演出した1ショット、決まった2つのフレームをつなぐ場面転換、4Kのマスター、あるいはプロンプトに1行ずつ書いたセリフが必要なときです。
- どちらもダウンロードはできません。 Wan 2.6はVeo 3.1と同じくホスト型のモデルです。Alibabaが公開している重みはWan 2.2までです。
Veo 3.1 vs Wan 2.6 仕様の比較
| Veo 3.1(Google DeepMind) | Wan 2.6(Alibaba) | |
|---|---|---|
| 公開 | 2025年10月15日(4Kと縦型のアップグレードは2026年1月13日) | 2025年12月16日 |
| 動画の長さ | GoogleのAPIでは4秒・6秒・8秒(1080pと4Kは8秒) | 2〜15秒(参照から動画は2〜10秒) |
| 解像度 | 720p、1080p、4K(Googleは4Kをアップスケールと説明) | 720p、1080p |
| アスペクト比 | 16:9、9:16 | 16:9、9:16、1:1、4:3、3:4 |
| マルチショット | 標準では1ショット。プロンプトで指示した場合のみカット | マルチショットモードを内蔵 |
| 出発点 | テキスト、開始画像、開始+終了フレーム、最大3枚の参照画像 | テキスト、最初のフレーム画像、最大5つの参照(動画は最大3本、画像は最大5枚) |
| 音声 | 映像と一緒に生成:セリフ、効果音、環境音 | 自動生成、または自分の音声トラックを指定 |
| 重み | 公開された重みなし。Googleがホスト | 公開された重みなし(Hugging FaceにあるのはWan 2.2まで)。Alibabaがホスト |
| 利用できる場所 | Geminiアプリ、Flow、Gemini API、Vertex AI、Veo Video | Alibaba Cloud Model Studio、WanのWebサイト、Qwenアプリ |
動画の長さ:8秒か、最大15秒か
Wan 2.6のテキストから動画モデルは、2〜15秒の範囲で秒単位の長さを指定できます。この長さは、展開しきるまでに時間がかかる途切れない1つの動きや、何回もの生成に分けたくない短い広告で役立ちます。参照から動画モデルの上限は10秒です。
Veo 3.1はより短い単位で動きます。GoogleのAPIでは4秒・6秒・8秒で、1080pと4Kにはフルの8秒が必要です。Googleのツールでは動画を延長できますが(APIでは720pで1回7秒、最大20回)、長めのVeoのプロジェクトの多くは、8秒のショットを複数作って編集でつなぐ形で組み立てられます。その利点は、各ショットをほかに手を触れずに生成し直せることです。
マルチショットのストーリーテリング
AlibabaはWan 2.6の看板機能として「インテリジェントなマルチショット・ストーリーテリング」を掲げています。APIではマルチショットの設定を(プロンプトの自動拡張とあわせて)オンにすると、モデルがアイデアを複数のショットに分割し、重要な細部の一貫性を保ちます。状況説明のショット、アクション、リアクションといった連続映像が欲しいけれど、カット割りを自分で1つずつ設計したくない、というときに便利です。
Veo 3.1は標準では途切れない1ショットです。それでもプロンプトでカットを指示することはでき、モデルは8秒の中でフレーミングを変えることもよくありますが、それはショット設計をモデルに任せるのではなく、あなたが明示的に演出しているということです。
あなたにとっての意味: 短い連続映像の構成をモデルに任せたいなら、Wan 2.6のほうがその作業を多く引き受けてくれます。すべてのショットを自分で制御したいなら、1回の生成で1ショットというVeo 3.1のやり方のほうが操りやすいでしょう。
参照:動画か画像か
Wan 2.6の参照から動画モデルは最大5つの参照を受け付け、そのうち最大3つを動画(各1〜30秒)、最大5つを画像にできます。各参照には、1人のキャラクターか1つの物だけを映すようにします。Alibabaによれば、モデルはそこから「キャラクターの見た目と声(ある場合)」を抽出します。つまり、人が話している短い動画があれば、その見た目と声の両方を新しい場面に持ち込めます。
Veo 3.1が使うのは静止画です。人物、キャラクター、商品の参照画像を最大3枚渡して見た目を一貫させる(GoogleはこれをIngredients to Videoと呼んでいます)か、最初のフレームと最後のフレームを設定して、その間の動きをモデルに組み立てさせます。静止画のほうが用意しやすく、参照動画のほうが、人の動き方や声といったより多くの情報を伝えられます。
音声
どちらのモデルも、映像と一緒に音声を生成します。
Veo 3.1はセリフ、効果音、環境音を生成し、それらはプロンプトで演出します。話す言葉は引用符で囲み、効果音を名指しし、環境音を描写します。
Wan 2.6は、場面に合ったBGMと効果音を自動で生成するか、アップロードした音声ファイルを使います。後者は、ナレーションやジングルなどサウンドトラックがすでにあって、映像のほうを音に合わせる必要があるときに役立ちます。
解像度とフォーマット
Veo 3.1は720p、1080p、4Kを、16:9または9:16で提供しています。Googleは4Kを「最先端のアップスケーリング」と説明しているので、大画面向けのより鮮明なマスターと考えてください。
Wan 2.6は720pと1080pですが、16:9、9:16、1:1、4:3、3:4の5つの形に対応しています。正方形の投稿や4:3のフレームをモデルから直接出したいなら、Wan 2.6ならトリミングの手間が省けます。
オープンソースか、ホスト型か
以前のWanのリリースは重みが公開されたモデルだったため、Wanはよくオープンソースと説明されます。しかし、これはWan 2.6には当てはまりません。Hugging FaceにあるAlibabaのWan-AIのページに掲載されている重みはWan 2.2までで、Wan 2.6はAlibaba Cloud Model Studio、WanのWebサイト、Qwenアプリを通じて提供されています。自分のGPUでモデルを動かすことが必須条件なら、対象になるのはWan 2.6ではなくWan 2.2です。
Veo 3.1もホスト型のみで、Googleの製品やAPI、あるいはVeo Videoのようなプラットフォームを通じて利用します。
なお、AlibabaはWan 2.6以降もWanの新しいバージョンを公開しており、その中にはドキュメント上で1回の生成あたり最大30秒とされているWan 3.0も含まれます。今Wanのモデルを選ぶなら、現行バージョンとも比較してみてください。
どちらを選ぶべきか
| あなたの企画 | 向いているモデル | 理由 |
|---|---|---|
| 10〜15秒のワンテイク | Wan 2.6 | 1本あたり最大15秒 |
| モデルに構成を任せる短い連続映像 | Wan 2.6 | マルチショットモードを内蔵 |
| 声も引き継ぐ必要があるキャラクター | Wan 2.6 | 参照動画が見た目と声を引き継ぐ |
| 狙いどおりのメインショットや商品動画 | Veo 3.1 | プロンプトへの高い忠実さ、開始・終了フレーム |
| 決まったフレームで着地する場面転換 | Veo 3.1 | 最初と最後のフレームの制御 |
| 4Kのマスター | Veo 3.1 | 720p、1080p、4K |
| 正方形や4:3のSNS投稿 | Wan 2.6 | 5種類のアスペクト比 |
| 縦型のショート、リール、TikTok | どちらでも | どちらも9:16に対応 |
Veo VideoでVeo 3.1を試す
Veo VideoではWan 2.6は提供していませんが、Veo 3.1は3つのティアで利用できます。生成される動画はすべて8秒・音声付きで、16:9または9:16、720p・1080p・4Kから選べます。テキストまたは写真から始められ、どのティアでも終了フレームを追加できます。参照画像はVeo 3.1 Fastで使え、1本あたり最大3枚です。
Veo 3.1 Liteの720pでプロンプトを下書きし、残したいテイクをフルのVeo 3.1ティアで生成しましょう。新規アカウントには無料の30クレジットが付与され、720pのVeo 3.1 Lite動画を1本作れます。
ほかの比較は、Veo 3.1 vs Seedance 2.0とVeo 3.1 vs Kling AIをご覧ください。
