
Veo 3.1 et Seedance 2.0 génèrent tous deux de la vidéo avec son, mais ils répondent à des questions différentes. Veo 3.1, de Google DeepMind, est le meilleur choix quand tu veux un plan unique qui suit fidèlement un prompt détaillé, éventuellement ancré par une image de départ et une image de fin. Seedance 2.0, de l’équipe Seed de ByteDance, est conçu pour des clips plus longs pouvant contenir plusieurs plans, guidés par un grand lot d’images, d’extraits vidéo et d’audio.
Aucun des deux ne « gagne » tout simplement. Le meilleur choix dépend de la nature de ton projet : un plan unique dirigé avec précision, ou une courte séquence multi-plans assemblée à partir de références. Les caractéristiques ci-dessous ont été vérifiées le 28 septembre 2026 sur les pages de Google et de ByteDance et dans les articles de TechCrunch.
La réponse courte
- Choisis Veo 3.1 pour un plan phare unique, un clip produit ou une réplique de dialogue, quand le prompt, la première image et la dernière image doivent être respectés, et quand tu peux avoir besoin d’un master 4K.
- Choisis Seedance 2.0 quand une seule génération doit couvrir un moment plus long (jusqu’à 15 secondes) avec plusieurs coupes, ou quand tu veux orienter le résultat avec de nombreux fichiers de référence, vidéo et audio compris.
- Les deux génèrent l’audio avec l’image : aucun n’a besoin d’une passe son séparée pour un premier montage.
Veo 3.1 vs Seedance 2.0 : les caractéristiques
| Veo 3.1 (Google DeepMind) | Seedance 2.0 (ByteDance Seed) | |
|---|---|---|
| Sortie | 15 octobre 2025 (mises à jour 4K et vertical le 13 janvier 2026) | 12 février 2026 |
| Durée des clips | 4, 6 ou 8 secondes dans l’API de Google (8 s pour la 1080p et la 4K) | Jusqu’à 15 secondes |
| Plans par clip | Un plan continu par défaut ; des coupes rapides sont possibles si tu les demandes dans le prompt | La sortie multi-plans est une fonction phare |
| Résolution | 720p, 1080p, 4K (Google présente la 4K comme une mise à l’échelle) | Non précisée dans l’annonce de lancement de ByteDance |
| Formats | 16:9, 9:16 | Six formats dans CapCut, selon TechCrunch |
| Entrées | Texte ; une image de départ ; images de départ + de fin ; jusqu’à 3 images de référence | Texte plus jusqu’à 9 images, 3 extraits vidéo et 3 extraits audio |
| Audio | Généré avec la vidéo : dialogues, effets, ambiance | Généré avec la vidéo en audio double canal : musique, ambiance, voix off |
| Où l’utiliser | Application Gemini, Flow, API Gemini, Vertex AI ; Veo Video | Jianying (Chine), CapCut sur certains marchés, Dreamina, BytePlus |
Durée des clips et séquences multi-plans
C’est la plus grande différence concrète. Dans son annonce de lancement, ByteDance décrit la sortie de Seedance 2.0 comme une « vidéo multi-plans avec audio de haute qualité de 15 secondes ». Une seule génération peut donc contenir une courte séquence (par exemple un plan large, une réaction et un gros plan) au lieu d’une prise unique.
Veo 3.1 fonctionne par unités plus courtes. L’API de Google propose 4, 6 ou 8 secondes par génération, et la 1080p comme la 4K exigent les 8 secondes complètes. Les outils de Google peuvent prolonger un clip : l’API ajoute 7 secondes par extension, jusqu’à 20 fois, en 720p, et la fonction Extend de Flow construit des vidéos continues d’une minute ou plus. Pour un contenu plus long, cependant, on le prévoit généralement comme plusieurs plans Veo que l’on monte ensemble.
C’est moins pénalisant qu’il n’y paraît. Un seul clip Veo peut tout de même changer de cadrage si le prompt le demande, comme le montre l’exemple ci-dessous. Ce que tu n’obtiens pas, c’est la capacité de Seedance à tenir une scène sur 15 secondes de plans prévus en une seule passe.
Ce que cela signifie pour toi : si le livrable est une publicité de 10 à 15 secondes pour les réseaux, racontée en quelques plans, Seedance 2.0 peut y arriver en une seule génération. Si tu construis de toute façon ton montage plan par plan, les clips de 8 secondes de Veo 3.1 s’intègrent à cette méthode, et chaque plan peut être régénéré seul sans toucher aux autres.
Références en entrée et contrôle créatif
L’autre fonction phare de Seedance 2.0, c’est la quantité de matière que tu peux lui fournir. ByteDance indique jusqu’à 9 images, 3 extraits vidéo et 3 extraits audio, en plus du prompt texte, dans une même génération. En pratique, cela permet de lui donner une fiche personnage sous plusieurs angles, un extrait dont tu veux reprendre le mouvement de caméra et un morceau de musique sur lequel caler le mouvement.
Veo 3.1 propose un ensemble de contrôles plus restreint, mais très direct :
- Texte vers vidéo : le prompt décrit toute la scène, la caméra et le son.
- Image vers vidéo : ta photo devient la première image.
- Première et dernière image : ajoute une image de fin et le modèle construit le mouvement entre les deux. C’est utile pour les révélations et les transitions où le plan doit aboutir à une composition précise.
- Images de référence : jusqu’à trois images d’une personne, d’un personnage ou d’un produit les gardent cohérents dans une nouvelle scène. Google appelle cela Ingredients to Video.
Le compromis, c’est le temps de préparation. Seedance récompense le fait de rassembler beaucoup de bonnes références ; Veo récompense un prompt précis et le choix d’une ou deux images fortes. Si tu disposes d’un dossier de ressources de marque et d’images de référence, Seedance peut en exploiter davantage. Si tu as une seule photo produit et une idée claire du plan, Veo 3.1 t’y mène avec moins de préparation.
Audio : dialogues, effets et musique
Les deux modèles génèrent le son en même temps que l’image.
Google affirme que Veo 3.1 génère « effets sonores, bruit d’ambiance et même dialogues », et que son audio est plus riche que celui de Veo 3. Tu diriges la bande-son dans le prompt : répliques entre guillemets, effets sonores nommés et description de l’ambiance.
ByteDance décrit l’audio de Seedance 2.0 comme double canal, couvrant la musique de fond, les effets sonores d’ambiance et les voix off des personnages. Comme il accepte aussi des extraits audio en entrée, tu peux lui fournir une musique ou une voix existante comme base, ce que Veo 3.1 ne propose pas. L’annonce de lancement de ByteDance mentionne elle-même des « distorsions audio occasionnelles » parmi les points encore en cours d’amélioration.
Pour les scènes de dialogue, où une courte réplique doit tomber sur une action précise, le contrôle au niveau du prompt de Veo 3.1 est simple à utiliser. Pour les contenus portés par la musique, quand tu as déjà le morceau, l’entrée audio de Seedance 2.0 est la voie la plus directe.
Résolution et formats de livraison
Veo 3.1 propose 720p, 1080p et 4K, en 16:9 ou 9:16. Google a ajouté la 4K dans sa mise à jour du 13 janvier 2026 et la présente comme une « mise à l’échelle de pointe » : vois-la comme un master plus net plutôt que comme la preuve de détails supplémentaires réellement générés. La sortie est en 24 images par seconde.
L’annonce de lancement de Seedance 2.0 par ByteDance ne précise pas de résolution de sortie, et les options proposées dépendent de l’application ou de l’API utilisée. TechCrunch a relevé six formats lors du déploiement dans CapCut. Si tu as un cahier des charges de livraison fixe, comme un master 4K ou un format de diffusion précis, vérifie-le dans le produit que tu comptes utiliser avant de t’engager.
Accès et disponibilité
Veo 3.1 est disponible dans l’application Gemini de Google, Flow, l’API Gemini et Vertex AI, ainsi que sur des plateformes indépendantes comme Veo Video. Google ajoute un filigrane invisible SynthID aux vidéos Veo.
Le déploiement de Seedance 2.0 a été plus inégal. TechCrunch a rapporté le 26 mars 2026 que ByteDance avait commencé à l’intégrer à CapCut au Brésil, en Indonésie, en Malaisie, au Mexique, aux Philippines, en Thaïlande et au Vietnam, les utilisateurs chinois y accédant via Jianying. ByteDance avait suspendu le déploiement mondial après des critiques des studios hollywoodiens et de la Motion Picture Association sur le droit d’auteur. CapCut bloque la génération de vidéos à partir d’images de visages réels et de propriété intellectuelle non autorisée, et ByteDance exige une vérification d’identité ou une autorisation légale pour utiliser des personnes réelles comme références. Les entreprises peuvent aussi y accéder via la plateforme BytePlus de ByteDance.
Si tu te trouves hors de ces marchés, la disponibilité peut trancher la question à ta place.
Limites connues
Les deux modèles ont des limites connues :
- Veo 3.1 : des unités courtes (8 secondes en 1080p et en 4K), si bien que les contenus plus longs demandent de la planification ou l’extension ; les filtres de sécurité de Google bloquent certains prompts, et la génération à partir d’images n’autorise que des personnes adultes.
- Seedance 2.0 : ByteDance indique que le modèle « doit encore être affiné en matière de stabilité des détails, d’hyperréalisme et de vitalité dynamique », et reconnaît une marge de progression sur la cohérence entre plusieurs sujets, le rendu du texte et les effets de montage complexes.
Lequel choisir ?
| Ton projet | Le plus adapté | Pourquoi |
|---|---|---|
| Un plan phare unique ou un clip produit | Veo 3.1 | Prompt suivi de près, images de départ et de fin, option 4K |
| Une courte publicité racontée en plusieurs plans | Seedance 2.0 | Jusqu’à 15 secondes de sortie multi-plans en une passe |
| Garder un personnage cohérent | L’un ou l’autre | Veo 3.1 accepte jusqu’à 3 images de référence ; Seedance 2.0 jusqu’à 9 images plus de la vidéo |
| Une vidéo calée sur une musique existante | Seedance 2.0 | Accepte des extraits audio en entrée |
| Une courte réplique face caméra | Veo 3.1 | Dialogue écrit entre guillemets dans le prompt |
| Un master 4K | Veo 3.1 | Options 720p, 1080p et 4K |
Beaucoup d’équipes utiliseront les deux : Seedance 2.0 pour le brouillon multi-plans d’une séquence, Veo 3.1 pour les plans individuels qui doivent être parfaitement justes, à l’image comme au son.
Essayer Veo 3.1 sur Veo Video
Seedance 2.0 n’est pas disponible sur Veo Video ; Veo 3.1 l’est, en trois déclinaisons. Chaque génération produit un clip de 8 secondes avec son, en 16:9 ou 9:16, en 720p, 1080p ou 4K. Tu peux partir d’un texte ou d’une photo et ajouter une image de fin sur n’importe quelle déclinaison. Les images de référence fonctionnent sur Veo 3.1 Fast, avec jusqu’à trois images par clip.
Une méthode raisonnable : trouver le bon prompt sur Veo 3.1 Lite en 720p, puis générer la version définitive sur la déclinaison Veo 3.1 complète. Les nouveaux comptes reçoivent 30 crédits gratuits, de quoi faire un clip Veo 3.1 Lite en 720p. Chaque génération est une nouvelle prise : le résultat final sera proche de ton brouillon, sans lui être identique.
Pour d’autres comparatifs, consulte Veo 3.1 vs Kling AI et Veo 3.1 vs Wan 2.6.
