
Veo 3.1 und Seedance 2.0 erzeugen beide Video mit Ton, beantworten aber unterschiedliche Fragen. Veo 3.1 von Google DeepMind ist am stärksten, wenn du eine Einstellung willst, die einem detaillierten Prompt eng folgt – optional verankert durch ein Startbild und ein Endbild. Seedance 2.0 vom Seed-Team bei ByteDance ist für längere Clips gebaut, die mehrere Einstellungen enthalten können und über ein großes Paket aus Bildern, Videoclips und Audio gesteuert werden.
Keines der beiden „gewinnt“ einfach. Die bessere Wahl hängt davon ab, ob dein Projekt eine einzelne, präzise inszenierte Einstellung ist oder eine kurze Sequenz aus mehreren Einstellungen, die aus Referenzen zusammengesetzt wird. Die technischen Daten unten wurden am 28. September 2026 anhand der eigenen Seiten von Google und ByteDance sowie der Berichterstattung von TechCrunch geprüft.
Die kurze Antwort
- Wähle Veo 3.1 für eine einzelne Hero-Einstellung, einen Produktclip oder einen Dialogsatz, bei dem Prompt, erstes und letztes Bild eingehalten werden müssen und du womöglich einen 4K-Master brauchst.
- Wähle Seedance 2.0, wenn eine Generierung einen längeren Moment (bis zu 15 Sekunden) mit mehreren Schnitten abdecken muss oder du das Ergebnis mit vielen Referenzdateien steuern willst, auch mit Video und Audio.
- Beide erzeugen den Ton mit dem Bild, sodass keines für einen Rohschnitt einen eigenen Tondurchgang braucht.
Veo 3.1 vs. Seedance 2.0: technische Daten
| Veo 3.1 (Google DeepMind) | Seedance 2.0 (ByteDance Seed) | |
|---|---|---|
| Veröffentlicht | 15. Oktober 2025 (4K- und Hochformat-Upgrades am 13. Januar 2026) | 12. Februar 2026 |
| Cliplänge | 4, 6 oder 8 Sekunden in Googles API (8 s für 1080p und 4K) | Bis zu 15 Sekunden |
| Einstellungen pro Clip | Standardmäßig eine durchgehende Einstellung; schnelle Schnitte sind möglich, wenn du sie im Prompt anforderst | Ausgabe mit mehreren Einstellungen ist ein zentrales Merkmal |
| Auflösung | 720p, 1080p, 4K (Google beschreibt 4K als hochskaliert) | In ByteDances Ankündigung nicht angegeben |
| Seitenverhältnisse | 16:9, 9:16 | Sechs Seitenverhältnisse in CapCut, laut TechCrunch |
| Eingaben | Text; ein Startbild; Start- und Endbild; bis zu 3 Referenzbilder | Text plus bis zu 9 Bilder, 3 Videoclips und 3 Audioclips |
| Audio | Wird mit dem Video erzeugt: Dialog, Effekte, Atmosphäre | Wird mit dem Video als Zweikanal-Audio erzeugt: Musik, Atmosphäre, Sprechertext |
| Wo nutzbar | Gemini-App, Flow, Gemini API, Vertex AI; Veo Video | Jianying (China), CapCut in ausgewählten Märkten, Dreamina, BytePlus |
Cliplänge und Sequenzen aus mehreren Einstellungen
Das ist der größte praktische Unterschied. ByteDance beschreibt die Ausgabe von Seedance 2.0 in seiner Ankündigung als „15-second high-quality multi-shot audio-video“, also als hochwertiges Audio-Video von 15 Sekunden mit mehreren Einstellungen. Eine Generierung kann damit eine kurze Sequenz enthalten – etwa eine Totale, eine Reaktion und eine Nahaufnahme – statt einer einzelnen Aufnahme.
Veo 3.1 arbeitet in kürzeren Einheiten. Googles API bietet 4, 6 oder 8 Sekunden pro Generierung, und 1080p oder 4K setzen die vollen 8 Sekunden voraus. Googles eigene Werkzeuge können einen Clip verlängern: Die API fügt pro Verlängerung 7 Sekunden hinzu, bis zu 20-mal, in 720p, und die Extend-Funktion in Flow baut durchgehende Videos von einer Minute oder mehr. Für ein längeres Stück planst du in der Regel trotzdem mehrere Veo-Einstellungen und schneidest sie zusammen.
Das ist weniger ein Nachteil, als es klingt. Auch ein einzelner Veo-Clip kann den Bildausschnitt wechseln, wenn der Prompt das verlangt, wie das Beispiel unten zeigt. Was du nicht bekommst, ist die Fähigkeit von Seedance, eine Szene über 15 Sekunden geplanter Einstellungen in einem Durchgang zusammenzuhalten.
Was das für dich bedeutet: Ist das Ergebnis eine Social-Media-Anzeige von 10–15 Sekunden, die in wenigen Einstellungen erzählt wird, bringt dich Seedance 2.0 in einer Generierung dorthin. Baust du einen Schnitt ohnehin Einstellung für Einstellung auf, passen die 8-Sekunden-Clips von Veo 3.1 zu diesem Workflow, und jede Einstellung lässt sich einzeln neu generieren, ohne die anderen zu beeinflussen.
Referenz-Eingaben und kreative Kontrolle
Das zweite zentrale Merkmal von Seedance 2.0 ist, wie viel du ihm mitgeben kannst. ByteDance nennt bis zu 9 Bilder, 3 Videoclips und 3 Audioclips zusätzlich zum Text-Prompt in einer Generierung. In der Praxis kannst du ihm damit ein Figurenblatt aus mehreren Blickwinkeln geben, einen Clip, dessen Kamerabewegung du übernehmen willst, und ein Musikstück, auf das die Bewegung getimt werden soll.
Veo 3.1 bietet eine schmalere, aber sehr direkte Auswahl an Steuerungsmöglichkeiten:
- Text zu Video: Der Prompt beschreibt die gesamte Szene, die Kamera und den Ton.
- Bild zu Video: Dein Foto wird zum ersten Bild.
- Erstes und letztes Bild: Füge ein Endbild hinzu, und das Modell baut die Bewegung zwischen beiden. Das ist nützlich für Enthüllungen und Übergänge, bei denen die Einstellung auf einer bestimmten Komposition landen muss.
- Referenzbilder: Bis zu drei Bilder einer Person, einer Figur oder eines Produkts halten diese in einer neuen Szene konsistent. Google nennt das Ingredients to Video.
Der Preis dafür ist Vorbereitungszeit. Seedance belohnt dich dafür, viele gute Referenzen zu sammeln; Veo belohnt dich dafür, einen präzisen Prompt zu schreiben und ein oder zwei starke Bilder auszuwählen. Hast du einen Ordner mit Marken-Assets und Referenzmaterial, kann Seedance mehr davon nutzen. Hast du ein Produktfoto und eine klare Vorstellung von der Einstellung, kommst du mit Veo 3.1 mit weniger Vorbereitung ans Ziel.
Ton: Dialog, Effekte und Musik
Beide Modelle erzeugen den Ton zusammen mit dem Bild.
Laut Google erzeugt Veo 3.1 „sound effects, ambient noise, and even dialogue“ – Soundeffekte, Umgebungsgeräusche und sogar Dialog –, und der Ton sei voller als bei Veo 3. Die Tonspur steuerst du im Prompt: gesprochene Sätze in Anführungszeichen, benannte Soundeffekte und eine Beschreibung der Atmosphäre.
ByteDance beschreibt den Ton von Seedance 2.0 als Zweikanal-Audio mit Hintergrundmusik, Umgebungsgeräuschen und Sprecherstimmen der Figuren. Weil es auch Audioclips als Eingabe annimmt, kannst du ihm vorhandene Musik oder Stimmen als Grundlage geben – das bietet Veo 3.1 nicht. ByteDances eigene Ankündigung nennt „occasional audio distortion“, also gelegentliche Tonverzerrungen, als einen Bereich, an dem noch gearbeitet wird.
Für Dialogszenen, in denen ein kurzer gesprochener Satz auf einer bestimmten Handlung landen muss, ist die Steuerung von Veo 3.1 über den Prompt unkompliziert. Für musikgetriebene Stücke, bei denen du den Track schon hast, ist die Audio-Eingabe von Seedance 2.0 der direktere Weg.
Auflösung und Auslieferungsformate
Veo 3.1 bietet 720p, 1080p und 4K in 16:9 oder 9:16. Google hat 4K mit dem Update vom 13. Januar 2026 eingeführt und beschreibt es als „state-of-the-art upscaling“, also als Hochskalierung auf dem neuesten Stand. Betrachte 4K daher als schärferen Master, nicht als Beleg für mehr generierte Details. Die Ausgabe läuft mit 24 Bildern pro Sekunde.
ByteDances Ankündigung zu Seedance 2.0 nennt keine Ausgabeauflösung, und welche Optionen du siehst, hängt von der App oder API ab, die du nutzt. TechCrunch berichtete von sechs Seitenverhältnissen bei der Einführung in CapCut. Hast du eine feste Auslieferungsvorgabe, etwa einen 4K-Master oder ein exaktes Sendeformat, prüfe sie in dem Produkt, das du nutzen willst, bevor du dich festlegst.
Zugang und Verfügbarkeit
Veo 3.1 ist in Googles Gemini-App, in Flow, in der Gemini API und in Vertex AI verfügbar sowie über unabhängige Plattformen wie Veo Video. Google versieht Veo-Ausgaben mit einem unsichtbaren SynthID-Wasserzeichen.
Die Einführung von Seedance 2.0 verlief ungleichmäßiger. TechCrunch berichtete am 26. März 2026, dass ByteDance damit begonnen hatte, es in CapCut in Brasilien, Indonesien, Malaysia, Mexiko, auf den Philippinen, in Thailand und Vietnam bereitzustellen; Nutzer in China erreichen es über Jianying. ByteDance hatte die weltweite Einführung nach Kritik von Hollywood-Studios und der Motion Picture Association wegen Urheberrechtsfragen pausiert. CapCut blockiert die Videogenerierung aus Bildern echter Gesichter und aus nicht autorisiertem geistigem Eigentum, und ByteDance verlangt eine Identitätsprüfung oder eine rechtliche Genehmigung, um echte Personen als Referenz zu nutzen. Unternehmen können es außerdem über ByteDances Plattform BytePlus nutzen.
Bist du außerhalb dieser Märkte, entscheidet womöglich schon die Verfügbarkeit die Frage für dich.
Bekannte Grenzen
Beide Modelle haben bekannte Grenzen:
- Veo 3.1: kurze Einheiten (8 Sekunden bei 1080p und 4K), sodass längere Stücke Planung oder Verlängerung brauchen; Googles Sicherheitsfilter blockieren manche Prompts, und bildbasierte Generierung erlaubt nur erwachsene Personen.
- Seedance 2.0: ByteDance schreibt, das Modell „still requires ongoing refinement in detail stability, hyper-realism, and dynamic vitality“ – es braucht also weiterhin Verbesserungen bei Detailstabilität, Hyperrealismus und Lebendigkeit der Bewegung; außerdem sieht ByteDance Luft nach oben bei der Konsistenz mehrerer Motive, der Textdarstellung und komplexen Bearbeitungseffekten.
Welches Modell solltest du wählen?
| Dein Projekt | Passt besser | Warum |
|---|---|---|
| Eine einzelne Hero-Einstellung oder ein Produktclip | Veo 3.1 | Enge Prompt-Treue, Start- und Endbild, 4K-Option |
| Eine kurze Anzeige in mehreren Einstellungen | Seedance 2.0 | Bis zu 15 Sekunden mit mehreren Einstellungen in einem Durchgang |
| Eine Figur konsistent halten | Beide | Veo 3.1 nimmt bis zu 3 Referenzbilder an; Seedance 2.0 bis zu 9 Bilder plus Video |
| Video, das auf vorhandene Musik getimt ist | Seedance 2.0 | Nimmt Audioclips als Eingabe an |
| Ein kurzer gesprochener Satz vor der Kamera | Veo 3.1 | Dialog wird in Anführungszeichen in den Prompt geschrieben |
| Ein 4K-Master | Veo 3.1 | Optionen für 720p, 1080p und 4K |
Viele Teams werden beide nutzen: Seedance 2.0 für den Entwurf einer Sequenz aus mehreren Einstellungen, Veo 3.1 für die einzelnen Einstellungen, die exakt richtig aussehen und klingen müssen.
Veo 3.1 auf Veo Video ausprobieren
Seedance 2.0 ist auf Veo Video nicht verfügbar, Veo 3.1 dagegen schon, in drei Stufen. Jede Generierung ist ein 8-Sekunden-Clip mit Ton, in 16:9 oder 9:16, in 720p, 1080p oder 4K. Du kannst mit Text oder einem Foto starten und in jeder Stufe ein Endbild hinzufügen. Referenzbilder laufen auf Veo 3.1 Fast, mit bis zu drei Bildern pro Clip.
Ein sinnvoller Workflow: Finde den Prompt auf Veo 3.1 Lite in 720p und generiere den gelungenen Take dann auf der vollen Stufe Veo 3.1. Neue Konten erhalten 30 kostenlose Credits – genug für einen Clip mit Veo 3.1 Lite in 720p. Jeder Durchlauf ist ein neuer Take, das Endergebnis kommt deinem Entwurf also nahe, ist aber nicht identisch.
Weitere Vergleiche findest du in Veo 3.1 vs. Kling AI und Veo 3.1 vs. Wan 2.6.
