
O Veo 3.1 e o Seedance 2.0 geram vídeo com som, mas respondem a perguntas diferentes. O Veo 3.1, do Google DeepMind, é o melhor quando você quer uma tomada que siga de perto um prompt detalhado, ancorada opcionalmente por um quadro inicial e um quadro final. O Seedance 2.0, da equipe Seed da ByteDance, foi feito para clipes mais longos que podem conter várias tomadas, guiados por um grande conjunto de imagens, trechos de vídeo e áudio.
Nenhum dos dois simplesmente "vence". A melhor escolha depende de o seu projeto ser uma única tomada dirigida com precisão ou uma sequência curta de várias tomadas montada a partir de referências. As especificações abaixo foram conferidas nas páginas do Google e da ByteDance e na cobertura do TechCrunch em 28 de setembro de 2026.
A resposta curta
- Escolha o Veo 3.1 para uma tomada principal, um clipe de produto ou uma fala em que o prompt, o primeiro quadro e o último quadro precisam ser respeitados, e em que você pode precisar de uma matriz em 4K.
- Escolha o Seedance 2.0 quando uma única geração precisa cobrir um momento mais longo (até 15 segundos) com vários cortes, ou quando você quer direcionar o resultado com muitos arquivos de referência, incluindo vídeo e áudio.
- Os dois geram áudio junto com a imagem, então nenhum precisa de uma etapa de som separada para um primeiro corte.
Especificações do Veo 3.1 vs Seedance 2.0
| Veo 3.1 (Google DeepMind) | Seedance 2.0 (ByteDance Seed) | |
|---|---|---|
| Lançamento | 15 de outubro de 2025 (melhorias de 4K e vertical em 13 de janeiro de 2026) | 12 de fevereiro de 2026 |
| Duração do clipe | 4, 6 ou 8 segundos na API do Google (8 s para 1080p e 4K) | Até 15 segundos |
| Tomadas por clipe | Uma tomada contínua por padrão; cortes rápidos são possíveis se você pedir no prompt | Saída com várias tomadas é um recurso de destaque |
| Resolução | 720p, 1080p, 4K (o Google descreve o 4K como upscaling) | Não informada no anúncio de lançamento da ByteDance |
| Proporções | 16:9, 9:16 | Seis proporções no CapCut, segundo o TechCrunch |
| Entradas | Texto; uma imagem inicial; quadros inicial + final; até 3 imagens de referência | Texto mais até 9 imagens, 3 trechos de vídeo e 3 trechos de áudio |
| Áudio | Gerado com o vídeo: diálogo, efeitos, ambiente | Gerado com o vídeo em dois canais: música, ambiente, narração |
| Onde usar | App Gemini, Flow, Gemini API, Vertex AI; Veo Video | Jianying (China), CapCut em mercados selecionados, Dreamina, BytePlus |
Duração do clipe e sequências com várias tomadas
Esta é a maior diferença prática. No anúncio de lançamento, a ByteDance descreve a saída do Seedance 2.0 como vídeo com áudio de alta qualidade, com várias tomadas e 15 segundos. Uma única geração pode, portanto, conter uma sequência curta (por exemplo, um plano aberto, uma reação e um close) em vez de uma tomada só.
O Veo 3.1 trabalha com unidades mais curtas. A API do Google oferece 4, 6 ou 8 segundos por geração, e 1080p ou 4K exigem os 8 segundos completos. As ferramentas do próprio Google podem estender um clipe: a API acrescenta 7 segundos por extensão, até 20 vezes, em 720p, e o recurso Extend do Flow cria vídeos contínuos de um minuto ou mais. Para uma peça mais longa, porém, o normal é planejá-la como várias tomadas do Veo e montá-las depois.
Isso atrapalha menos do que parece. Um único clipe do Veo ainda pode mudar de enquadramento se o prompt pedir, como mostra o exemplo abaixo. O que você não tem é a capacidade do Seedance de manter uma cena ao longo de 15 segundos de tomadas planejadas numa única geração.
O que isso significa para você: se a entrega é um anúncio de 10 a 15 segundos para redes sociais contado em algumas tomadas, o Seedance 2.0 pode resolver numa só geração. Se você já está montando uma edição tomada por tomada, os clipes de 8 segundos do Veo 3.1 se encaixam nesse fluxo, e cada tomada pode ser gerada de novo sozinha, sem mexer nas outras.
Entradas de referência e controle criativo
O outro recurso de destaque do Seedance 2.0 é a quantidade de material que você pode fornecer. A ByteDance lista até 9 imagens, 3 trechos de vídeo e 3 trechos de áudio junto com o prompt de texto numa única geração. Na prática, isso permite entregar uma ficha de personagem com vários ângulos, um clipe cujo movimento de câmera você quer aproveitar e uma música para marcar o ritmo do movimento.
O Veo 3.1 oferece um conjunto de controles mais enxuto, mas bem direto:
- Texto para vídeo: o prompt descreve a cena inteira, a câmera e o som.
- Imagem para vídeo: a sua foto vira o primeiro quadro.
- Primeiro e último quadro: acrescente um quadro final e o modelo cria o movimento entre os dois. É útil para revelações e transições em que a tomada precisa terminar numa composição específica.
- Imagens de referência: até três imagens de uma pessoa, personagem ou produto os mantêm consistentes numa cena nova. O Google chama isso de Ingredients to Video.
A contrapartida é o tempo de preparação. O Seedance recompensa quem junta muitas boas referências; o Veo recompensa quem escreve um prompt preciso e escolhe um ou dois quadros fortes. Se você tem uma pasta de materiais da marca e de imagens de referência, o Seedance consegue aproveitar mais disso. Se você tem uma foto de produto e uma ideia clara da tomada, o Veo 3.1 chega lá com menos preparação.
Áudio: diálogo, efeitos e música
Os dois modelos geram o som junto com a imagem.
O Google diz que o Veo 3.1 gera efeitos sonoros, ruído ambiente e até diálogo, e que o áudio é mais rico que o do Veo 3. Você dirige a trilha no prompt: falas entre aspas, efeitos sonoros nomeados e uma descrição do ambiente.
A ByteDance descreve o áudio do Seedance 2.0 como de dois canais, com música de fundo, efeitos de ambiente e narração dos personagens. Como ele também aceita trechos de áudio como entrada, você pode entregar uma música ou uma voz já existente como base, algo que o Veo 3.1 não oferece. No próprio anúncio de lançamento, a ByteDance cita distorções ocasionais no áudio como um ponto que ainda está melhorando.
Para cenas com diálogo, em que uma fala curta precisa cair numa ação específica, o controle pelo prompt do Veo 3.1 é simples. Para peças guiadas por música, em que você já tem a faixa, a entrada de áudio do Seedance 2.0 é o caminho mais direto.
Resolução e formatos de entrega
O Veo 3.1 oferece 720p, 1080p e 4K em 16:9 ou 9:16. O Google adicionou o 4K na atualização de 13 de janeiro de 2026 e o descreve como upscaling de última geração, então trate o 4K como uma matriz mais nítida, não como prova de mais detalhe gerado. A saída é a 24 quadros por segundo.
O anúncio de lançamento do Seedance 2.0 não informa a resolução de saída, e as opções que você vê dependem do app ou da API que usa. O TechCrunch relatou seis proporções no lançamento pelo CapCut. Se você tem uma especificação de entrega fixa, como uma matriz em 4K ou um formato exato de transmissão, confira no produto que pretende usar antes de se comprometer.
Acesso e disponibilidade
O Veo 3.1 está disponível no app Gemini, no Flow, na Gemini API e na Vertex AI, do Google, e em plataformas independentes como o Veo Video. O Google adiciona uma marca d'água invisível SynthID aos vídeos do Veo.
A chegada do Seedance 2.0 tem sido mais irregular. Em 26 de março de 2026, o TechCrunch informou que a ByteDance tinha começado a levá-lo ao CapCut no Brasil, na Indonésia, na Malásia, no México, nas Filipinas, na Tailândia e no Vietnã, com usuários chineses acessando pelo Jianying. A ByteDance havia pausado o lançamento global depois de críticas de estúdios de Hollywood e da Motion Picture Association sobre direitos autorais. O CapCut bloqueia a geração de vídeo a partir de imagens de rostos reais e de propriedade intelectual não autorizada, e a ByteDance exige verificação de identidade ou autorização legal para usar pessoas reais como referência. Empresas também podem acessá-lo pela plataforma BytePlus da ByteDance.
Se você está fora desses mercados, a disponibilidade pode decidir a questão por você.
Limitações conhecidas
Os dois modelos têm limites conhecidos:
- Veo 3.1: unidades curtas (8 segundos em 1080p e 4K), então peças mais longas exigem planejamento ou extensão; os filtros de segurança do Google bloqueiam alguns prompts, e a geração a partir de imagens só permite pessoas adultas.
- Seedance 2.0: a ByteDance diz que o modelo ainda precisa de refinamento contínuo em estabilidade de detalhes, hiper-realismo e vitalidade dinâmica, e aponta espaço para melhorar a consistência com vários sujeitos, a renderização de texto e efeitos de edição complexos.
Qual escolher?
| Seu projeto | Mais indicado | Por quê |
|---|---|---|
| Uma única tomada principal ou um clipe de produto | Veo 3.1 | Segue o prompt de perto, quadros inicial e final, opção de 4K |
| Um anúncio curto contado em várias tomadas | Seedance 2.0 | Até 15 segundos com várias tomadas numa única geração |
| Manter um personagem consistente | Qualquer um | O Veo 3.1 aceita até 3 imagens de referência; o Seedance 2.0, até 9 imagens mais vídeo |
| Vídeo sincronizado com uma música existente | Seedance 2.0 | Aceita trechos de áudio como entrada |
| Uma fala curta diante da câmera | Veo 3.1 | Diálogo escrito entre aspas no prompt |
| Uma matriz em 4K | Veo 3.1 | Opções de 720p, 1080p e 4K |
Muitas equipes vão usar os dois: o Seedance 2.0 para o rascunho de uma sequência com várias tomadas e o Veo 3.1 para as tomadas individuais que precisam ter imagem e som exatamente certos.
Como testar o Veo 3.1 no Veo Video
O Seedance 2.0 não está disponível no Veo Video; o Veo 3.1 está, em três níveis. Cada geração é um clipe de 8 segundos com som, em 16:9 ou 9:16, em 720p, 1080p ou 4K. Você pode começar de texto ou de uma foto e adicionar um quadro final em qualquer nível. As imagens de referência funcionam no Veo 3.1 Fast, com até três imagens por clipe.
Um fluxo sensato é acertar o prompt no Veo 3.1 Lite em 720p e depois gerar a versão final no Veo 3.1 completo. Contas novas recebem 30 créditos grátis, o suficiente para um clipe do Veo 3.1 Lite em 720p. Cada geração é uma nova tomada, então o resultado final será próximo do rascunho, não idêntico.
Para mais comparações, veja Veo 3.1 vs Kling AI e Veo 3.1 vs Wan 2.6.
