
Veo 3.1とSeedance 2.0は、どちらも音声付きの動画を生成しますが、応えようとしている問いが違います。Google DeepMindのVeo 3.1が最も力を発揮するのは、詳細なプロンプトに忠実に従う1ショットが欲しいときです。必要に応じて開始フレームと終了フレームで固定することもできます。ByteDanceのSeedチームによるSeedance 2.0は、複数のショットを含められる長めの動画のために作られており、画像、動画クリップ、音声をまとめて大量に渡して結果を操ります。
どちらかが単純に「勝つ」わけではありません。よりよい選択は、あなたの企画が細かく演出した1ショットなのか、参照素材から組み立てる短いマルチショットの連続映像なのかで決まります。以下の仕様は、2026年9月28日に、GoogleとByteDanceそれぞれの公式ページ、およびTechCrunchの報道で確認したものです。
要点
- Veo 3.1を選ぶのは、 プロンプト、最初のフレーム、最後のフレームを守る必要がある1本のメインショット、商品動画、セリフのある場面で、4Kのマスターが必要になるかもしれないときです。
- Seedance 2.0を選ぶのは、 1回の生成で、複数のカットを含む長めの場面(最大15秒)をまかなう必要があるとき、あるいは動画や音声を含む多くの参照ファイルで結果を操りたいときです。
- どちらも映像と一緒に音声を生成するので、ラフ編集の段階で別途音を作る工程は不要です。
Veo 3.1 vs Seedance 2.0 仕様の比較
| Veo 3.1(Google DeepMind) | Seedance 2.0(ByteDance Seed) | |
|---|---|---|
| 公開 | 2025年10月15日(4Kと縦型のアップグレードは2026年1月13日) | 2026年2月12日 |
| 動画の長さ | GoogleのAPIでは4秒・6秒・8秒(1080pと4Kは8秒) | 最大15秒 |
| 1本あたりのショット数 | 標準では途切れない1ショット。プロンプトで指示すれば素早いカット割りも可能 | マルチショット出力が看板機能 |
| 解像度 | 720p、1080p、4K(Googleは4Kをアップスケールと説明) | ByteDanceの公開記事には記載なし |
| アスペクト比 | 16:9、9:16 | TechCrunchによればCapCutで6種類 |
| 入力 | テキスト、開始画像、開始+終了フレーム、最大3枚の参照画像 | テキストに加え、画像最大9枚、動画クリップ3本、音声クリップ3本 |
| 音声 | 映像と一緒に生成:セリフ、効果音、環境音 | 映像と一緒に2チャンネル音声として生成:音楽、環境音、ナレーション |
| 利用できる場所 | Geminiアプリ、Flow、Gemini API、Vertex AI、Veo Video | Jianying(中国)、一部市場のCapCut、Dreamina、BytePlus |
動画の長さとマルチショットの連続映像
これが実用面での最大の違いです。ByteDanceは公開発表で、Seedance 2.0の出力を「15秒の高品質なマルチショット音声付き動画」と説明しています。つまり1回の生成に、1つのテイクではなく短い連続映像(たとえば、引きのショット、リアクション、クローズアップ)を収められます。
Veo 3.1はより短い単位で動きます。GoogleのAPIでは1回の生成につき4秒・6秒・8秒を選べ、1080pや4Kにはフルの8秒が必要です。Google自身のツールでは動画を延長でき、APIでは720pで1回7秒、最大20回まで追加でき、FlowのExtend機能では1分以上の連続した動画を作れます。それでも長めの作品は、通常、複数のVeoのショットとして設計し、編集でつなぎ合わせることになります。
これは見た目ほど大きなハンデではありません。下の例が示すように、Veoの動画1本の中でも、プロンプトで指示すればフレーミングを変えられます。得られないのは、計画したショットを15秒にわたって1回の生成で1つの場面として保つ、Seedanceのような能力です。
あなたにとっての意味: 納品物が数ショットで語る10〜15秒のSNS広告なら、Seedance 2.0は1回の生成でそこまで到達できます。いずれにせよショットごとに編集を組み立てるなら、Veo 3.1の8秒の動画はその進め方に合っており、各ショットをほかに影響を与えずに個別に生成し直せます。
参照入力とクリエイティブの制御
Seedance 2.0のもう1つの看板機能は、渡せる素材の多さです。ByteDanceによれば、1回の生成でテキストプロンプトとともに、画像最大9枚、動画クリップ3本、音声クリップ3本を入力できます。実際には、複数の角度から描いたキャラクターシート、カメラの動きを借りたい動画クリップ、動きのタイミングを合わせたい音楽を渡す、といった使い方ができます。
Veo 3.1の制御手段はより限られていますが、とても直接的です。
- テキストから動画: プロンプトで場面全体、カメラ、音を描写します。
- 画像から動画: あなたの写真が最初のフレームになります。
- 最初と最後のフレーム: 終了フレームを追加すると、モデルが2枚の間の動きを組み立てます。ショットを特定の構図で終わらせる必要がある、何かを見せる演出や場面転換に便利です。
- 参照画像: 人物、キャラクター、商品の画像を最大3枚使い、新しい場面でも見た目を一貫させます。GoogleはこれをIngredients to Videoと呼んでいます。
トレードオフは準備にかかる時間です。Seedanceは、質のよい参照素材を数多く集めるほど応えてくれます。Veoは、正確なプロンプトを書き、強いフレームを1〜2枚選ぶほど応えてくれます。ブランド素材や参照映像のフォルダがあるなら、Seedanceのほうがそれを多く活用できます。商品写真が1枚あって、ショットのイメージがはっきりしているなら、Veo 3.1のほうが少ない準備でそこへ到達できます。
音声:セリフ、効果音、音楽
どちらのモデルも、映像と一緒に音声を生成します。
GoogleはVeo 3.1が「効果音、環境音、さらにはセリフまで」を生成し、その音声はVeo 3より豊かだとしています。サウンドトラックはプロンプトで演出します。話す言葉は引用符で囲み、効果音を名指しし、環境音を描写します。
ByteDanceはSeedance 2.0の音声を2チャンネルと説明しており、BGM、環境の効果音、キャラクターのナレーションをカバーしています。音声クリップも入力として受け付けるため、既存の音楽や声を渡してそれをもとに作らせることができ、これはVeo 3.1にはない機能です。なお、ByteDance自身の公開記事では、「ときおり音声がひずむ」ことを改善中の課題として挙げています。
特定の動きに短いセリフを合わせる必要がある会話の場面なら、プロンプト単位で制御できるVeo 3.1がわかりやすい選択です。すでに楽曲がある音楽主導の作品なら、音声を入力できるSeedance 2.0のほうが直接的です。
解像度と納品フォーマット
Veo 3.1は720p、1080p、4Kを、16:9または9:16で提供しています。Googleは2026年1月13日のアップデートで4Kを追加し、それを「最先端のアップスケーリング」と説明しています。4Kは、より多くのディテールが生成された証拠ではなく、より鮮明なマスターとして捉えてください。出力は24fpsです。
ByteDanceのSeedance 2.0公開記事には出力解像度の記載がなく、選べる選択肢は使うアプリやAPIによって異なります。TechCrunchは、CapCutでの展開で6種類のアスペクト比があると報じています。4Kのマスターや放送用の厳密なサイズなど、決まった納品仕様があるなら、使う予定の製品で確認してから決めましょう。
利用方法と提供状況
Veo 3.1は、GoogleのGeminiアプリ、Flow、Gemini API、Vertex AIのほか、Veo Videoのような独立したプラットフォームでも利用できます。GoogleはVeoの出力に、目に見えないSynthIDの透かしを入れています。
Seedance 2.0の展開はもっとまだらです。TechCrunchは2026年3月26日、ByteDanceがブラジル、インドネシア、マレーシア、メキシコ、フィリピン、タイ、ベトナムのCapCutで提供を始めたこと、中国のユーザーはJianyingから利用できることを報じました。ByteDanceは、著作権をめぐるハリウッドのスタジオや米国映画協会(MPA)からの批判を受けて、グローバル展開をいったん止めていました。CapCutでは、実在の人物の顔や無許可の知的財産を含む画像からの動画生成をブロックしており、ByteDanceは実在の人物を参照に使う際に本人確認または法的な許諾を求めています。企業はByteDanceのBytePlusプラットフォームからも利用できます。
これらの市場の外にいるなら、提供状況が選択を決めることになるかもしれません。
既知の制約
どちらのモデルにも既知の制約があります。
- Veo 3.1: 単位が短い(1080pと4Kでは8秒)ため、長めの作品には設計か延長が必要です。Googleの安全フィルターは一部のプロンプトをブロックし、画像を使った生成で人物を扱えるのは大人のみです。
- Seedance 2.0: ByteDanceは、このモデルが「細部の安定性、超リアリズム、躍動感の面で、まだ継続的な改良を必要としている」と述べており、複数の被写体の一貫性、文字の描画、複雑な編集効果にも改善の余地があるとしています。
どちらを選ぶべきか
| あなたの企画 | 向いているモデル | 理由 |
|---|---|---|
| 1本のメインショットや商品動画 | Veo 3.1 | プロンプトへの高い忠実さ、開始・終了フレーム、4Kの選択肢 |
| 数ショットで語る短い広告 | Seedance 2.0 | 1回の生成で最大15秒のマルチショット出力 |
| キャラクターの一貫性を保つ | どちらでも | Veo 3.1は参照画像最大3枚、Seedance 2.0は画像最大9枚と動画 |
| 既存の音楽に合わせた動画 | Seedance 2.0 | 音声クリップを入力できる |
| カメラに向けた短いセリフ | Veo 3.1 | セリフをプロンプト内で引用符に入れて書ける |
| 4Kのマスター | Veo 3.1 | 720p、1080p、4Kの選択肢 |
多くのチームは両方を使うことになるでしょう。連続映像のマルチショットの下書きにはSeedance 2.0を、映像も音も狙いどおりでなければならない個々のショットにはVeo 3.1を、という使い分けです。
Veo VideoでVeo 3.1を試す
Veo VideoではSeedance 2.0は利用できませんが、Veo 3.1は3つのティアで利用できます。生成される動画はすべて8秒・音声付きで、16:9または9:16、720p・1080p・4Kから選べます。テキストまたは写真から始められ、どのティアでも終了フレームを追加できます。参照画像はVeo 3.1 Fastで使え、1本あたり最大3枚です。
おすすめの進め方は、Veo 3.1 Liteの720pでプロンプトを見つけ、残したいテイクをフルのVeo 3.1ティアで生成することです。新規アカウントには無料の30クレジットが付与され、720pのVeo 3.1 Lite動画を1本作れます。生成するたびに新しいテイクになるため、最終版は下書きとまったく同じではなく、よく似た仕上がりになります。
ほかの比較は、Veo 3.1 vs Kling AIとVeo 3.1 vs Wan 2.6をご覧ください。
