
Veo 3.1 und Wan 2.6 sind beide Videomodelle, die den Ton zusammen mit dem Bild erzeugen, eignen sich aber für unterschiedliche Aufgaben. Wan 2.6 von Alibaba macht längere Clips (bis zu 15 Sekunden), kann einen Prompt selbstständig in mehrere Einstellungen aufteilen und nimmt Referenzvideos einer Figur an – inklusive ihrer Stimme. Veo 3.1 von Google DeepMind macht kürzere Clips, die einem detaillierten Prompt eng folgen, mit Steuerung über Start- und Endbild und einer 4K-Option.
Dieser Vergleich erklärt, was jeder Unterschied in der Praxis bedeutet. Die technischen Daten wurden am 28. September 2026 anhand der eigenen Dokumentation von Alibaba Cloud und Google geprüft.
Die kurze Antwort
- Wähle Wan 2.6 für Clips von 10–15 Sekunden, automatische Sequenzen aus mehreren Einstellungen, quadratische oder 4:3-Formate oder wenn Aussehen und Stimme einer Figur aus einem Referenzvideo übernommen werden sollen.
- Wähle Veo 3.1 für eine einzelne, präzise inszenierte Einstellung, einen Übergang zwischen zwei bekannten Bildern, einen 4K-Master oder Dialog, den du Zeile für Zeile in den Prompt schreibst.
- Keines der beiden lässt sich herunterladen. Wan 2.6 ist wie Veo 3.1 ein gehostetes Modell; Alibabas öffentliche Gewichte enden bei Wan 2.2.
Veo 3.1 vs. Wan 2.6: technische Daten
| Veo 3.1 (Google DeepMind) | Wan 2.6 (Alibaba) | |
|---|---|---|
| Veröffentlicht | 15. Oktober 2025 (4K- und Hochformat-Upgrades am 13. Januar 2026) | 16. Dezember 2025 |
| Cliplänge | 4, 6 oder 8 Sekunden in Googles API (8 s für 1080p und 4K) | 2–15 Sekunden (Referenz zu Video: 2–10 Sekunden) |
| Auflösung | 720p, 1080p, 4K (Google beschreibt 4K als hochskaliert) | 720p, 1080p |
| Seitenverhältnisse | 16:9, 9:16 | 16:9, 9:16, 1:1, 4:3, 3:4 |
| Mehrere Einstellungen | Standardmäßig eine Einstellung; Schnitte nur, wenn du sie im Prompt anforderst | Eingebauter Modus für mehrere Einstellungen |
| Ausgangspunkte | Text; ein Startbild; Start- und Endbild; bis zu 3 Referenzbilder | Text; ein Bild als erstes Bild; bis zu 5 Referenzen (bis zu 3 Videos, bis zu 5 Bilder) |
| Audio | Wird mit dem Video erzeugt: Dialog, Effekte, Atmosphäre | Wird automatisch erzeugt, oder du lieferst eine eigene Tonspur |
| Gewichte | Keine öffentlichen Gewichte; von Google gehostet | Keine öffentlichen Gewichte (Hugging Face listet bis Wan 2.2); von Alibaba gehostet |
| Wo nutzbar | Gemini-App, Flow, Gemini API, Vertex AI; Veo Video | Alibaba Cloud Model Studio, die Wan-Website, Qwen-App |
Cliplänge: 8 Sekunden vs. bis zu 15
Das Text-zu-Video-Modell von Wan 2.6 akzeptiert jede ganze Sekundenzahl von 2 bis 15. Die zusätzliche Länge ist nützlich für eine einzelne durchgehende Handlung, die Zeit braucht, um sich zu entfalten, oder für eine kurze Anzeige, die nicht auf mehrere Generierungen verteilt werden soll. Das Referenz-zu-Video-Modell endet bei 10 Sekunden.
Veo 3.1 arbeitet in kürzeren Einheiten: 4, 6 oder 8 Sekunden in Googles API, wobei 1080p und 4K die vollen 8 Sekunden voraussetzen. Googles Werkzeuge können einen Clip verlängern (die API fügt pro Schritt 7 Sekunden hinzu, bis zu 20-mal, in 720p), doch die meisten längeren Veo-Projekte entstehen aus mehreren 8-Sekunden-Einstellungen, die zusammengeschnitten werden. Der Vorteil: Jede Einstellung lässt sich neu generieren, ohne den Rest anzutasten.
Erzählen in mehreren Einstellungen
Alibaba stellt „intelligent multi-shot storytelling“, also intelligentes Erzählen in mehreren Einstellungen, als zentrales Merkmal von Wan 2.6 heraus. In der API schaltest du es über eine Multi-Shot-Einstellung ein (zusammen mit automatischer Prompt-Erweiterung), und das Modell teilt die Idee in mehrere Einstellungen auf, während wichtige Details konsistent bleiben. Das ist praktisch, wenn du eine Sequenz willst – Establishing Shot, Handlung, Reaktion – und nicht jeden Schnitt selbst planen möchtest.
Veo 3.1 erzeugt standardmäßig eine durchgehende Einstellung. Du kannst im Prompt trotzdem Schnitte anfordern, und das Modell wechselt innerhalb der 8 Sekunden oft den Bildausschnitt – aber du inszenierst das ausdrücklich selbst, statt dem Modell die Planung der Einstellungen zu überlassen.
Was das für dich bedeutet: Wenn du lieber das Modell eine kurze Sequenz strukturieren lässt, übernimmt Wan 2.6 mehr von dieser Arbeit. Willst du jede Einstellung kontrollieren, lässt sich der Ansatz von Veo 3.1 – eine Einstellung pro Generierung – leichter steuern.
Referenzen: Video vs. Bilder
Das Referenz-zu-Video-Modell von Wan 2.6 nimmt bis zu fünf Referenzen an, davon bis zu drei Videos (je 1–30 Sekunden) und bis zu fünf Bilder. Jede Referenz sollte eine einzelne Figur oder ein einzelnes Objekt zeigen. Laut Alibaba entnimmt das Modell daraus „character appearance and voice (if available)“, also das Aussehen der Figur und – falls vorhanden – ihre Stimme. Ein kurzer Clip einer sprechenden Person kann so sowohl ihr Aussehen als auch ihre Stimme in die neue Szene tragen.
Veo 3.1 arbeitet mit Standbildern. Du kannst ihm bis zu drei Referenzbilder einer Person, einer Figur oder eines Produkts geben, um sie konsistent zu halten (Google nennt das Ingredients to Video), oder ein erstes und ein letztes Bild festlegen und das Modell die Bewegung dazwischen bauen lassen. Standbilder sind leichter vorzubereiten; ein Referenzvideo transportiert mehr Information, etwa wie sich jemand bewegt und wie er klingt.
Ton
Beide Modelle erzeugen den Ton zusammen mit dem Video.
Veo 3.1 erzeugt Dialog, Soundeffekte und Atmosphäre, und du steuerst sie im Prompt: gesprochene Sätze in Anführungszeichen, benannte Effekte, eine beschriebene Atmosphäre.
Wan 2.6 erzeugt entweder automatisch passende Hintergrundmusik und Soundeffekte oder verwendet eine Audiodatei, die du hochlädst. Die zweite Option ist nützlich, wenn die Tonspur schon existiert – ein Sprechertext, ein Jingle – und das Bild ihr folgen muss.
Auflösung und Formate
Veo 3.1 bietet 720p, 1080p und 4K in 16:9 oder 9:16. Google beschreibt sein 4K als „state-of-the-art upscaling“, also als Hochskalierung auf dem neuesten Stand – betrachte es als schärferen Master für große Bildschirme.
Wan 2.6 bietet 720p und 1080p, dafür aber in fünf Formaten: 16:9, 9:16, 1:1, 4:3 und 3:4. Brauchst du quadratische Posts oder 4:3-Bilder direkt aus dem Modell, ersparst du dir mit Wan 2.6 das Zuschneiden.
Open Source vs. gehostet
Frühere Wan-Versionen waren Modelle mit offenen Gewichten, weshalb Wan oft als Open Source bezeichnet wird. Für Wan 2.6 gilt das nicht mehr. Alibabas Wan-AI-Seite auf Hugging Face listet Gewichte bis Wan 2.2, und Wan 2.6 wird über Alibaba Cloud Model Studio, die Wan-Website und die Qwen-App angeboten. Musst du ein Modell auf deiner eigenen GPU betreiben, ist Wan 2.2 die maßgebliche Version, nicht Wan 2.6.
Auch Veo 3.1 ist ausschließlich gehostet: Du erreichst es über Googles Produkte und API oder über Plattformen wie Veo Video.
Alibaba hat seit Wan 2.6 außerdem neuere Wan-Versionen veröffentlicht, darunter Wan 3.0, das laut Dokumentation bis zu 30 Sekunden pro Generierung erzeugt. Wenn du heute ein Wan-Modell auswählst, vergleiche auch mit der aktuellen Version.
Welches Modell solltest du wählen?
| Dein Projekt | Passt besser | Warum |
|---|---|---|
| Eine Einzelaufnahme von 10–15 Sekunden | Wan 2.6 | Bis zu 15 Sekunden pro Clip |
| Eine kurze Sequenz, die das Modell für dich plant | Wan 2.6 | Eingebauter Modus für mehrere Einstellungen |
| Eine Figur, deren Stimme übernommen werden muss | Wan 2.6 | Referenzvideos übertragen Aussehen und Stimme |
| Eine präzise Hero-Einstellung oder ein Produktclip | Veo 3.1 | Enge Prompt-Treue, Start- und Endbild |
| Ein Übergang, der auf einem bekannten Bild landet | Veo 3.1 | Steuerung über erstes und letztes Bild |
| Ein 4K-Master | Veo 3.1 | 720p, 1080p und 4K |
| Quadratische oder 4:3-Social-Posts | Wan 2.6 | Fünf Seitenverhältnisse |
| Vertikale Shorts, Reels oder TikToks | Beide | Beide unterstützen 9:16 |
Veo 3.1 auf Veo Video ausprobieren
Wan 2.6 wird auf Veo Video nicht angeboten, Veo 3.1 dagegen schon, in drei Stufen. Jede Generierung ist ein 8-Sekunden-Clip mit Ton, in 16:9 oder 9:16, in 720p, 1080p oder 4K. Du kannst mit Text oder einem Foto starten und in jeder Stufe ein Endbild hinzufügen; Referenzbilder laufen auf Veo 3.1 Fast, mit bis zu drei Bildern pro Clip.
Entwirf den Prompt auf Veo 3.1 Lite in 720p und generiere den gelungenen Take dann auf der vollen Stufe Veo 3.1. Neue Konten erhalten 30 kostenlose Credits – genug für einen Clip mit Veo 3.1 Lite in 720p.
Weitere Vergleiche findest du in Veo 3.1 vs. Seedance 2.0 und Veo 3.1 vs. Kling AI.
