
Veo 3.1 y Seedance 2.0 generan video con sonido, pero responden a preguntas distintas. Veo 3.1, de Google DeepMind, es la mejor opción cuando quieres una toma que siga con fidelidad un prompt detallado, anclada si quieres con un fotograma inicial y otro final. Seedance 2.0, del equipo Seed de ByteDance, está pensado para clips más largos que pueden contener varias tomas, guiados por un gran conjunto de imágenes, clips de video y audio.
Ninguno «gana» sin más. La mejor elección depende de si tu proyecto es una única toma dirigida con precisión o una secuencia corta de varias tomas construida a partir de referencias. Las especificaciones de abajo se revisaron el 28 de septiembre de 2026 con las páginas de Google y de ByteDance y con la información publicada por TechCrunch.
La respuesta corta
- Elige Veo 3.1 para una toma principal, un clip de producto o una frase de diálogo en la que haya que respetar el prompt, el primer fotograma y el último, y en la que quizá necesites un máster en 4K.
- Elige Seedance 2.0 cuando una sola generación tenga que cubrir un momento más largo (hasta 15 segundos) con varios cortes, o cuando quieras guiar el resultado con muchos archivos de referencia, incluidos video y audio.
- Los dos generan el audio junto con la imagen, así que ninguno necesita una pasada de sonido aparte para un primer montaje.
Especificaciones de Veo 3.1 vs Seedance 2.0
| Veo 3.1 (Google DeepMind) | Seedance 2.0 (ByteDance Seed) | |
|---|---|---|
| Lanzamiento | 15 de octubre de 2025 (mejoras de 4K y vertical el 13 de enero de 2026) | 12 de febrero de 2026 |
| Duración del clip | 4, 6 u 8 segundos en la API de Google (8 s para 1080p y 4K) | Hasta 15 segundos |
| Tomas por clip | Una toma continua por defecto; se pueden lograr cortes rápidos si se piden en el prompt | La salida con varias tomas es una de sus funciones estrella |
| Resolución | 720p, 1080p, 4K (Google describe el 4K como reescalado) | No se indica en el anuncio de lanzamiento de ByteDance |
| Relaciones de aspecto | 16:9, 9:16 | Seis relaciones de aspecto en CapCut, según TechCrunch |
| Entradas | Texto; una imagen inicial; fotogramas inicial y final; hasta 3 imágenes de referencia | Texto más hasta 9 imágenes, 3 clips de video y 3 clips de audio |
| Audio | Se genera con el video: diálogo, efectos, ambiente | Se genera con el video como audio de dos canales: música, ambiente, voz en off |
| Dónde usarlo | App Gemini, Flow, API de Gemini, Vertex AI; Veo Video | Jianying (China), CapCut en mercados seleccionados, Dreamina, BytePlus |
Duración del clip y secuencias de varias tomas
Esta es la mayor diferencia práctica. En su anuncio de lanzamiento, ByteDance describe la salida de Seedance 2.0 como audio y video de alta calidad con varias tomas y 15 segundos de duración. Así, una sola generación puede contener una secuencia corta (por ejemplo, un plano general, una reacción y un primer plano) en lugar de una única toma.
Veo 3.1 trabaja con unidades más cortas. La API de Google ofrece 4, 6 u 8 segundos por generación, y 1080p o 4K requieren los 8 segundos completos. Las herramientas de Google permiten ampliar un clip: la API añade 7 segundos por extensión, hasta 20 veces, a 720p, y la función Extend de Flow crea videos continuos de un minuto o más. Aun así, para una pieza más larga lo habitual es planificarla como varias tomas de Veo y montarlas.
Esto limita menos de lo que parece. Un solo clip de Veo puede cambiar de encuadre si el prompt lo pide, como muestra el ejemplo de abajo. Lo que no obtienes es la capacidad de Seedance de sostener una escena a lo largo de 15 segundos de tomas planificadas en una sola pasada.
Qué significa para ti: si el entregable es un anuncio para redes de 10 a 15 segundos contado en unas pocas tomas, Seedance 2.0 puede resolverlo en una sola generación. Si de todos modos vas a montar toma a toma, los clips de 8 segundos de Veo 3.1 encajan en ese flujo, y cada toma se puede volver a generar por separado sin alterar las demás.
Referencias de entrada y control creativo
La otra gran función de Seedance 2.0 es todo lo que puedes darle. ByteDance indica hasta 9 imágenes, 3 clips de video y 3 clips de audio junto con el prompt de texto en una sola generación. En la práctica, eso te permite darle una hoja de personaje desde varios ángulos, un clip cuyo movimiento de cámara quieres imitar y una pieza musical a la que ajustar el ritmo del movimiento.
Veo 3.1 ofrece un conjunto de controles más reducido, pero muy directo:
- Texto a video: el prompt describe toda la escena, la cámara y el sonido.
- Imagen a video: tu foto se convierte en el primer fotograma.
- Primer y último fotograma: añade un fotograma final y el modelo construye el movimiento entre ambos. Es útil para revelaciones y transiciones en las que la toma debe acabar en una composición concreta.
- Imágenes de referencia: hasta tres imágenes de una persona, un personaje o un producto los mantienen coherentes en una escena nueva. Google llama a esto Ingredients to Video.
El precio es el tiempo de preparación. Seedance premia que reúnas muchas buenas referencias; Veo premia que escribas un prompt preciso y elijas uno o dos fotogramas sólidos. Si tienes una carpeta de recursos de marca y material de referencia, Seedance puede aprovechar más de ese material. Si tienes una foto de producto y una idea clara de la toma, Veo 3.1 te lleva hasta ahí con menos preparación.
Audio: diálogo, efectos y música
Los dos modelos generan el sonido junto con la imagen.
Google afirma que Veo 3.1 genera efectos de sonido, ruido ambiente e incluso diálogo, y que su audio es más rico que el de Veo 3. La banda sonora se dirige desde el prompt: frases habladas entre comillas, efectos de sonido con nombre y una descripción del ambiente.
ByteDance describe el audio de Seedance 2.0 como de dos canales, con música de fondo, efectos de sonido ambientales y voces en off de los personajes. Como también acepta clips de audio como entrada, puedes darle música o voz ya existentes como base, algo que Veo 3.1 no ofrece. El propio anuncio de lanzamiento de ByteDance menciona una distorsión ocasional del audio como un aspecto que todavía está mejorando.
Para escenas de diálogo en las que una frase corta tiene que coincidir con una acción concreta, el control desde el prompt de Veo 3.1 es sencillo. Para piezas guiadas por la música en las que ya tienes la pista, la entrada de audio de Seedance 2.0 es el camino más directo.
Resolución y formatos de entrega
Veo 3.1 ofrece 720p, 1080p y 4K en 16:9 o 9:16. Google añadió el 4K en su actualización del 13 de enero de 2026 y lo describe como un reescalado de última generación, así que toma el 4K como un máster más nítido y no como prueba de más detalle generado. La salida es de 24 fotogramas por segundo.
El anuncio de lanzamiento de Seedance 2.0 de ByteDance no indica una resolución de salida, y las opciones que veas dependen de la app o la API que uses. TechCrunch informó de seis relaciones de aspecto en el despliegue de CapCut. Si tienes una especificación de entrega fija, como un máster en 4K o un tamaño exacto para emisión, compruébala en el producto que piensas usar antes de comprometerte.
Acceso y disponibilidad
Veo 3.1 está disponible en la app Gemini de Google, Flow, la API de Gemini y Vertex AI, y a través de plataformas independientes como Veo Video. Google añade una marca de agua invisible SynthID a lo que genera Veo.
El despliegue de Seedance 2.0 ha sido más irregular. TechCrunch informó el 26 de marzo de 2026 de que ByteDance había empezado a llevarlo a CapCut en Brasil, Indonesia, Malasia, México, Filipinas, Tailandia y Vietnam, mientras que los usuarios chinos acceden a través de Jianying. ByteDance había pausado el lanzamiento global tras las críticas de los estudios de Hollywood y de la Motion Picture Association por cuestiones de derechos de autor. CapCut bloquea la generación de video a partir de imágenes de rostros reales y de propiedad intelectual no autorizada, y ByteDance exige verificación de identidad o autorización legal para usar personas reales como referencia. Las empresas también pueden acceder a través de la plataforma BytePlus de ByteDance.
Si estás fuera de esos mercados, la disponibilidad puede decidir por ti.
Limitaciones conocidas
Los dos modelos tienen límites conocidos:
- Veo 3.1: unidades cortas (8 segundos a 1080p y 4K), así que las piezas más largas requieren planificación o extensión; los filtros de seguridad de Google bloquean algunos prompts, y la generación a partir de imágenes solo admite personas adultas.
- Seedance 2.0: ByteDance reconoce que el modelo aún necesita afinarse en estabilidad del detalle, hiperrealismo y viveza del movimiento, y señala margen de mejora en la coherencia con varios sujetos, la representación de texto y los efectos de edición complejos.
¿Cuál deberías elegir?
| Tu proyecto | Mejor opción | Por qué |
|---|---|---|
| Una sola toma principal o un clip de producto | Veo 3.1 | Gran fidelidad al prompt, fotogramas inicial y final, opción 4K |
| Un anuncio corto contado en varias tomas | Seedance 2.0 | Hasta 15 segundos con varias tomas en una sola pasada |
| Mantener coherente un personaje | Cualquiera de los dos | Veo 3.1 admite hasta 3 imágenes de referencia; Seedance 2.0, hasta 9 imágenes más video |
| Video sincronizado con una música ya existente | Seedance 2.0 | Acepta clips de audio como entrada |
| Una frase corta dicha a cámara | Veo 3.1 | Diálogo escrito entre comillas en el prompt |
| Un máster en 4K | Veo 3.1 | Opciones de 720p, 1080p y 4K |
Muchos equipos usarán los dos: Seedance 2.0 para el borrador de una secuencia con varias tomas y Veo 3.1 para las tomas individuales que tienen que verse y sonar exactamente bien.
Probar Veo 3.1 en Veo Video
Seedance 2.0 no está disponible en Veo Video; Veo 3.1 sí, en tres niveles. Cada generación es un clip de 8 segundos con sonido, en 16:9 o 9:16, a 720p, 1080p o 4K. Puedes partir de texto o de una foto y añadir un fotograma final en cualquier nivel. Las imágenes de referencia funcionan con Veo 3.1 Fast, con hasta tres imágenes por clip.
Un flujo de trabajo sensato es dar con el prompt en Veo 3.1 Lite a 720p y luego generar la versión definitiva con el nivel Veo 3.1 completo. Las cuentas nuevas reciben 30 créditos gratis, suficientes para un clip de Veo 3.1 Lite a 720p. Cada generación es una toma nueva, así que el resultado final será muy parecido a tu borrador, no idéntico.
Para más comparativas, consulta Veo 3.1 vs Kling AI y Veo 3.1 vs Wan 2.6.
