
Veo 3.1 et Wan 2.6 sont deux modèles vidéo qui génèrent le son avec l’image, mais ils conviennent à des usages différents. Wan 2.6, d’Alibaba, produit des clips plus longs (jusqu’à 15 secondes), peut découper seul un prompt en plusieurs plans et accepte des vidéos de référence d’un personnage, voix comprise. Veo 3.1, de Google DeepMind, produit des clips plus courts qui suivent fidèlement un prompt détaillé, avec un contrôle des images de départ et de fin et une option 4K.
Ce comparatif explique ce que chaque différence signifie en pratique. Les caractéristiques ont été vérifiées le 28 septembre 2026 dans la documentation d’Alibaba Cloud et de Google.
La réponse courte
- Choisis Wan 2.6 pour des clips de 10 à 15 secondes, des séquences multi-plans automatiques, des formats carrés ou 4:3, ou quand tu veux reprendre l’apparence et la voix d’un personnage depuis une vidéo de référence.
- Choisis Veo 3.1 pour un plan unique dirigé avec précision, une transition entre deux images connues, un master 4K, ou un dialogue écrit réplique par réplique dans le prompt.
- Aucun des deux n’est téléchargeable. Wan 2.6 est un modèle hébergé, comme Veo 3.1 ; les poids publics d’Alibaba s’arrêtent à Wan 2.2.
Veo 3.1 vs Wan 2.6 : les caractéristiques
| Veo 3.1 (Google DeepMind) | Wan 2.6 (Alibaba) | |
|---|---|---|
| Sortie | 15 octobre 2025 (mises à jour 4K et vertical le 13 janvier 2026) | 16 décembre 2025 |
| Durée des clips | 4, 6 ou 8 secondes dans l’API de Google (8 s pour la 1080p et la 4K) | 2 à 15 secondes (référence vers vidéo : 2 à 10 secondes) |
| Résolution | 720p, 1080p, 4K (Google présente la 4K comme une mise à l’échelle) | 720p, 1080p |
| Formats | 16:9, 9:16 | 16:9, 9:16, 1:1, 4:3, 3:4 |
| Multi-plans | Un seul plan par défaut ; des coupes seulement si tu les demandes dans le prompt | Mode multi-plans intégré |
| Points de départ | Texte ; une image de départ ; images de départ + de fin ; jusqu’à 3 images de référence | Texte ; une image servant de première image ; jusqu’à 5 références (jusqu’à 3 vidéos, jusqu’à 5 images) |
| Audio | Généré avec la vidéo : dialogues, effets, ambiance | Généré automatiquement, ou fourni par toi sous forme de piste audio |
| Poids | Pas de poids publics ; hébergé par Google | Pas de poids publics (Hugging Face liste jusqu’à Wan 2.2) ; hébergé par Alibaba |
| Où l’utiliser | Application Gemini, Flow, API Gemini, Vertex AI ; Veo Video | Alibaba Cloud Model Studio, le site Wan, l’application Qwen |
Durée des clips : 8 secondes contre jusqu’à 15
Le modèle texte vers vidéo de Wan 2.6 accepte n’importe quel nombre entier de secondes entre 2 et 15. Cette durée supplémentaire est utile pour une action continue qui a besoin de temps pour se dérouler, ou pour une courte publicité qu’on ne veut pas répartir sur plusieurs générations. Son modèle référence vers vidéo plafonne à 10 secondes.
Veo 3.1 fonctionne par unités plus courtes : 4, 6 ou 8 secondes dans l’API de Google, la 1080p et la 4K exigeant les 8 secondes complètes. Les outils de Google peuvent prolonger un clip (l’API ajoute 7 secondes par étape, jusqu’à 20 fois, en 720p), mais la plupart des projets Veo plus longs se construisent comme plusieurs plans de 8 secondes montés ensemble. L’avantage : chaque plan peut être régénéré sans toucher au reste.
Le récit multi-plans
Alibaba présente le « récit multi-plans intelligent » comme une fonction phare de Wan 2.6. Dans l’API, tu l’actives avec un paramètre multi-plans (associé à l’extension automatique du prompt), et le modèle découpe l’idée en plusieurs plans tout en gardant cohérents les détails clés. C’est pratique quand tu veux une séquence — plan d’ensemble, action, réaction — sans avoir à prévoir chaque coupe toi-même.
Veo 3.1 génère par défaut un seul plan continu. Tu peux tout de même demander des coupes dans le prompt, et le modèle change souvent de cadrage au cours des 8 secondes, mais c’est toi qui le diriges explicitement au lieu de confier le découpage au modèle.
Ce que cela signifie pour toi : si tu préfères laisser le modèle structurer une courte séquence, Wan 2.6 fait davantage ce travail. Si tu veux contrôler chaque plan, l’approche « un plan par génération » de Veo 3.1 est plus facile à diriger.
Références : vidéo contre images
Le modèle référence vers vidéo de Wan 2.6 accepte jusqu’à cinq références, dont jusqu’à trois vidéos (de 1 à 30 secondes chacune) et jusqu’à cinq images. Chaque référence doit montrer un seul personnage ou objet. Selon Alibaba, le modèle en extrait « l’apparence du personnage et sa voix (si disponible) » : un court extrait d’une personne qui parle peut donc transmettre à la fois son apparence et sa voix à la nouvelle scène.
Veo 3.1 utilise des images fixes. Tu peux lui fournir jusqu’à trois images de référence d’une personne, d’un personnage ou d’un produit pour les garder cohérents (Google appelle cela Ingredients to Video), ou fixer une première et une dernière image et laisser le modèle construire le mouvement entre les deux. Les images fixes sont plus faciles à préparer ; une vidéo de référence transporte davantage d’informations, comme la façon dont quelqu’un bouge et parle.
Audio
Les deux modèles génèrent le son avec la vidéo.
Veo 3.1 génère dialogues, effets sonores et ambiance, et tu les diriges dans le prompt : répliques entre guillemets, effets nommés, ambiance décrite.
Wan 2.6 génère automatiquement une musique de fond et des effets sonores assortis, ou utilise un fichier audio que tu importes. Cette seconde option est utile quand la bande-son existe déjà — une voix off, un jingle — et que l’image doit la suivre.
Résolution et formats
Veo 3.1 propose 720p, 1080p et 4K, en 16:9 ou 9:16. Google présente sa 4K comme une « mise à l’échelle de pointe » : vois-la comme un master plus net pour les grands écrans.
Wan 2.6 propose 720p et 1080p, mais dans cinq formats : 16:9, 9:16, 1:1, 4:3 et 3:4. Si tu as besoin de publications carrées ou d’images en 4:3 directement en sortie du modèle, Wan 2.6 t’épargne un recadrage.
Open source ou hébergé
Les versions précédentes de Wan étaient des modèles à poids ouverts, ce qui explique pourquoi Wan est souvent présenté comme open source. Ce n’est plus le cas avec Wan 2.6. La page Wan-AI d’Alibaba sur Hugging Face liste les poids jusqu’à Wan 2.2, et Wan 2.6 est proposé via Alibaba Cloud Model Studio, le site Wan et l’application Qwen. Si faire tourner un modèle sur ton propre GPU est une exigence, c’est Wan 2.2 qu’il faut regarder, pas Wan 2.6.
Veo 3.1 est lui aussi uniquement hébergé : tu y accèdes via les produits et l’API de Google, ou via des plateformes comme Veo Video.
Alibaba a par ailleurs sorti des versions de Wan plus récentes que Wan 2.6, dont Wan 3.0, que sa documentation indique avec jusqu’à 30 secondes par génération. Si tu choisis un modèle Wan aujourd’hui, compare aussi avec la version actuelle.
Lequel choisir ?
| Ton projet | Le plus adapté | Pourquoi |
|---|---|---|
| Un plan unique de 10 à 15 secondes | Wan 2.6 | Jusqu’à 15 secondes par clip |
| Une courte séquence découpée par le modèle | Wan 2.6 | Mode multi-plans intégré |
| Un personnage dont la voix doit être conservée | Wan 2.6 | Les vidéos de référence transmettent apparence et voix |
| Un plan phare précis ou un clip produit | Veo 3.1 | Prompt suivi de près, images de départ et de fin |
| Une transition qui aboutit à une image connue | Veo 3.1 | Contrôle de la première et de la dernière image |
| Un master 4K | Veo 3.1 | 720p, 1080p et 4K |
| Des publications carrées ou en 4:3 pour les réseaux | Wan 2.6 | Cinq formats |
| Des Shorts, Reels ou TikTok verticaux | L’un ou l’autre | Les deux prennent en charge le 9:16 |
Essayer Veo 3.1 sur Veo Video
Wan 2.6 n’est pas proposé sur Veo Video ; Veo 3.1 l’est, en trois déclinaisons. Chaque génération produit un clip de 8 secondes avec son, en 16:9 ou 9:16, en 720p, 1080p ou 4K. Tu peux partir d’un texte ou d’une photo et ajouter une image de fin sur n’importe quelle déclinaison ; les images de référence fonctionnent sur Veo 3.1 Fast, avec jusqu’à trois images par clip.
Mets au point le prompt sur Veo 3.1 Lite en 720p, puis génère la version définitive sur la déclinaison Veo 3.1 complète. Les nouveaux comptes reçoivent 30 crédits gratuits, de quoi faire un clip Veo 3.1 Lite en 720p.
Pour d’autres comparatifs, consulte Veo 3.1 vs Seedance 2.0 et Veo 3.1 vs Kling AI.
