
Veo 3.1과 Seedance 2.0은 둘 다 소리가 있는 영상을 생성하지만, 답하는 질문이 다릅니다. Google DeepMind의 Veo 3.1은 자세한 프롬프트를 충실히 따르는 컷 하나가 필요할 때, 필요하면 시작 프레임과 끝 프레임으로 고정해서 만들 때 가장 좋습니다. ByteDance Seed 팀의 Seedance 2.0은 여러 컷을 담을 수 있는 더 긴 영상을 위해 만들어졌고, 많은 이미지, 영상 클립, 오디오 묶음으로 결과를 조절합니다.
어느 한쪽이 그냥 "이기는" 것은 아닙니다. 프로젝트가 정밀하게 연출한 컷 하나인지, 참조 자료로 조립한 짧은 멀티샷 시퀀스인지에 따라 더 나은 선택이 달라집니다. 아래 사양은 2026년 9월 28일 Google과 ByteDance의 공식 페이지, 그리고 TechCrunch 보도를 기준으로 확인했습니다.
짧은 답
- Veo 3.1을 고르세요. 프롬프트, 첫 프레임, 마지막 프레임이 그대로 지켜져야 하는 메인 컷, 제품 영상, 대사 한 줄짜리 장면이고, 4K 마스터본이 필요할 수 있을 때.
- Seedance 2.0을 고르세요. 한 번의 생성으로 여러 컷이 들어간 더 긴 장면(최대 15초)을 다뤄야 하거나, 영상과 오디오를 포함한 많은 참조 파일로 결과를 조절하고 싶을 때.
- 둘 다 화면과 함께 오디오를 생성하므로, 가편집 단계에서는 어느 쪽도 별도의 사운드 작업이 필요 없습니다.
Veo 3.1 vs Seedance 2.0 사양
| Veo 3.1 (Google DeepMind) | Seedance 2.0 (ByteDance Seed) | |
|---|---|---|
| 출시 | 2025년 10월 15일(4K와 세로 업그레이드는 2026년 1월 13일) | 2026년 2월 12일 |
| 영상 길이 | Google API 기준 4, 6, 8초(1080p와 4K는 8초) | 최대 15초 |
| 영상당 컷 수 | 기본은 하나의 연속 컷, 프롬프트로 요청하면 빠른 컷 전환 가능 | 멀티샷 출력이 대표 기능 |
| 해상도 | 720p, 1080p, 4K(Google은 4K를 업스케일로 설명) | ByteDance 출시 글에 명시되지 않음 |
| 화면 비율 | 16:9, 9:16 | TechCrunch에 따르면 CapCut에서 6가지 |
| 입력 | 텍스트, 시작 이미지, 시작+끝 프레임, 참조 이미지 최대 3장 | 텍스트와 함께 이미지 최대 9장, 영상 클립 3개, 오디오 클립 3개 |
| 오디오 | 영상과 함께 생성: 대사, 효과음, 주변음 | 영상과 함께 듀얼 채널 오디오로 생성: 음악, 주변음, 보이스오버 |
| 이용 경로 | Gemini 앱, Flow, Gemini API, Vertex AI, Veo Video | Jianying(중국), 일부 시장의 CapCut, Dreamina, BytePlus |
영상 길이와 멀티샷 시퀀스
실무에서 가장 큰 차이입니다. ByteDance는 출시 발표에서 Seedance 2.0의 출력을 "15초 고품질 멀티샷 오디오·비디오"라고 설명합니다. 따라서 한 번의 생성에 단일 테이크가 아니라 짧은 시퀀스(예를 들어 와이드 숏, 리액션, 클로즈업)를 담을 수 있습니다.
Veo 3.1은 더 짧은 단위로 작업합니다. Google API는 1회 생성당 4, 6, 8초를 제공하며, 1080p나 4K는 8초 전체가 필요합니다. Google의 자체 도구에서는 영상을 연장할 수 있습니다. API는 720p에서 연장 1회당 7초씩 최대 20번까지 늘리고, Flow의 Extend 기능으로는 1분 이상 이어지는 영상을 만들 수 있습니다. 그래도 더 긴 작품이라면 보통 여러 개의 Veo 컷으로 계획해서 편집으로 이어 붙입니다.
생각만큼 큰 약점은 아닙니다. 아래 예시처럼 프롬프트로 요청하면 Veo 영상 하나 안에서도 프레이밍을 바꿀 수 있습니다. 다만 Seedance처럼 계획된 컷들로 15초 동안 하나의 장면을 한 번에 이어 가는 능력은 없습니다.
실제로 의미하는 바: 결과물이 몇 개의 컷으로 이야기를 전하는 10~15초짜리 소셜 광고라면, Seedance 2.0은 한 번의 생성으로 거기까지 갈 수 있습니다. 어차피 컷 단위로 편집본을 만들 계획이라면 Veo 3.1의 8초 영상이 그 작업 흐름에 잘 맞고, 각 컷을 다른 컷에 영향을 주지 않고 따로 다시 생성할 수 있습니다.
참조 입력과 창작 제어
Seedance 2.0의 또 다른 대표 기능은 넣을 수 있는 자료의 양입니다. ByteDance에 따르면 한 번의 생성에 텍스트 프롬프트와 함께 이미지 최대 9장, 영상 클립 3개, 오디오 클립 3개를 넣을 수 있습니다. 실제로는 여러 각도에서 본 캐릭터 시트, 카메라 움직임을 빌려 오고 싶은 클립, 그리고 동작의 타이밍을 맞출 음악을 함께 줄 수 있다는 뜻입니다.
Veo 3.1은 범위는 더 좁지만 매우 직접적인 제어 수단을 제공합니다.
- 텍스트 투 비디오: 프롬프트로 장면, 카메라, 소리 전체를 묘사합니다.
- 이미지 투 비디오: 사진이 첫 프레임이 됩니다.
- 첫 프레임과 마지막 프레임: 끝 프레임을 추가하면 모델이 두 이미지 사이의 움직임을 만듭니다. 특정 구도로 끝나야 하는 공개 장면이나 전환에 유용합니다.
- 참조 이미지: 사람, 캐릭터, 제품 이미지를 최대 3장 넣으면 새로운 장면에서도 일관되게 유지됩니다. Google은 이를 Ingredients to Video라고 부릅니다.
대가는 준비 시간입니다. Seedance는 좋은 참조 자료를 많이 모을수록 보상이 커지고, Veo는 정확한 프롬프트를 쓰고 강한 프레임 한두 장을 고를수록 보상이 커집니다. 브랜드 자산과 참고 영상이 폴더 가득 있다면 Seedance가 그중 더 많은 것을 활용할 수 있습니다. 제품 사진 한 장과 명확한 컷 아이디어가 있다면 Veo 3.1이 더 적은 준비로 결과를 냅니다.
오디오: 대사, 효과음, 음악
두 모델 모두 화면과 함께 소리를 생성합니다.
Google은 Veo 3.1이 "효과음, 주변 소음, 심지어 대사까지" 생성하며, 오디오가 Veo 3보다 풍부하다고 설명합니다. 사운드트랙은 프롬프트로 연출합니다. 대사는 따옴표 안에, 효과음은 이름을 붙여, 주변음은 따로 묘사합니다.
ByteDance는 Seedance 2.0의 오디오를 배경 음악, 주변 효과음, 캐릭터 보이스오버를 아우르는 듀얼 채널로 설명합니다. 오디오 클립을 입력으로도 받기 때문에 기존 음악이나 목소리를 주고 그에 맞춰 만들게 할 수 있는데, 이는 Veo 3.1에 없는 기능입니다. ByteDance의 출시 글은 "간헐적인 오디오 왜곡"을 아직 개선 중인 부분으로 언급합니다.
짧은 대사 한 줄이 특정 동작에 정확히 맞아야 하는 대사 장면이라면 Veo 3.1의 프롬프트 수준 제어가 간단합니다. 이미 음원이 있는 음악 중심 작품이라면 Seedance 2.0의 오디오 입력이 더 직접적인 방법입니다.
해상도와 납품 형식
Veo 3.1은 16:9 또는 9:16에서 720p, 1080p, 4K를 제공합니다. Google은 2026년 1월 13일 업데이트에서 4K를 추가하며 "최첨단 업스케일링"이라고 설명했으므로, 4K는 더 많은 디테일이 생성됐다는 증거라기보다 더 선명한 마스터본으로 보세요. 출력은 초당 24프레임입니다.
ByteDance의 Seedance 2.0 출시 글에는 출력 해상도가 명시돼 있지 않으며, 선택할 수 있는 옵션은 사용하는 앱이나 API에 따라 다릅니다. TechCrunch는 CapCut 출시 과정에서 6가지 화면 비율을 보도했습니다. 4K 마스터본이나 정확한 방송 규격처럼 정해진 납품 사양이 있다면, 결정하기 전에 사용할 제품에서 확인하세요.
이용 경로와 제공 여부
Veo 3.1은 Google의 Gemini 앱, Flow, Gemini API, Vertex AI에서, 그리고 Veo Video 같은 독립 플랫폼에서 이용할 수 있습니다. Google은 Veo 결과물에 보이지 않는 SynthID 워터마크를 넣습니다.
Seedance 2.0의 출시는 더 고르지 못했습니다. TechCrunch는 2026년 3월 26일, ByteDance가 브라질, 인도네시아, 말레이시아, 멕시코, 필리핀, 태국, 베트남의 CapCut에 Seedance 2.0을 도입하기 시작했고, 중국 사용자는 Jianying으로 이용한다고 보도했습니다. ByteDance는 저작권 문제로 할리우드 스튜디오와 미국영화협회(Motion Picture Association)의 비판을 받은 뒤 글로벌 출시를 일시 중단했었습니다. CapCut은 실제 얼굴 이미지나 허가받지 않은 지식재산으로 영상을 생성하는 것을 차단하며, ByteDance는 실존 인물을 참조로 쓰려면 본인 인증이나 법적 권한을 요구합니다. 기업은 ByteDance의 BytePlus 플랫폼으로도 이용할 수 있습니다.
이 시장 밖에 있다면 제공 여부가 선택을 대신 결정할 수도 있습니다.
알려진 한계
두 모델 모두 알려진 한계가 있습니다.
- Veo 3.1: 단위가 짧아서(1080p와 4K는 8초) 긴 작품은 계획이나 연장이 필요합니다. Google의 안전 필터가 일부 프롬프트를 차단하며, 이미지 기반 생성에서는 성인만 허용됩니다.
- Seedance 2.0: ByteDance는 이 모델이 "디테일 안정성, 극사실성, 동적 생동감에서 여전히 지속적인 개선이 필요하다"고 밝히고, 다중 피사체 일관성, 텍스트 렌더링, 복잡한 편집 효과에도 개선 여지가 있다고 말합니다.
어느 쪽을 골라야 할까?
| 프로젝트 | 더 잘 맞는 모델 | 이유 |
|---|---|---|
| 메인 컷 하나나 제품 영상 | Veo 3.1 | 충실한 프롬프트 반영, 시작·끝 프레임, 4K 옵션 |
| 여러 컷으로 전하는 짧은 광고 | Seedance 2.0 | 한 번에 최대 15초 멀티샷 출력 |
| 캐릭터 일관성 유지 | 둘 다 | Veo 3.1은 참조 이미지 최대 3장, Seedance 2.0은 이미지 최대 9장과 영상 |
| 기존 음악에 맞춘 영상 | Seedance 2.0 | 오디오 클립을 입력으로 받음 |
| 카메라 앞의 짧은 대사 한 줄 | Veo 3.1 | 프롬프트에 따옴표로 대사를 적음 |
| 4K 마스터본 | Veo 3.1 | 720p, 1080p, 4K 옵션 |
많은 팀이 둘 다 쓸 것입니다. 시퀀스의 멀티샷 초안은 Seedance 2.0으로, 보이는 것과 들리는 것이 정확히 맞아야 하는 개별 컷은 Veo 3.1로 만드는 식입니다.
Veo Video에서 Veo 3.1 써 보기
Seedance 2.0은 Veo Video에서 제공하지 않고, Veo 3.1은 세 등급으로 제공합니다. 모든 생성 결과는 소리가 있는 8초 영상이며, 16:9 또는 9:16, 720p·1080p·4K로 만들 수 있습니다. 텍스트나 사진으로 시작할 수 있고, 어느 등급에서든 끝 프레임을 추가할 수 있습니다. 참조 이미지는 Veo 3.1 Fast에서 영상당 최대 3장까지 쓸 수 있습니다.
합리적인 작업 흐름은 Veo 3.1 Lite의 720p로 프롬프트를 찾은 다음, 마음에 드는 결과를 정식 Veo 3.1 등급으로 생성하는 것입니다. 신규 계정에는 무료 크레딧 30개가 지급되며, 720p Veo 3.1 Lite 영상 한 편을 만들 수 있습니다. 생성할 때마다 새 테이크가 나오므로, 최종본은 초안과 똑같지는 않고 가까운 결과가 됩니다.
다른 비교 글은 Veo 3.1 vs Kling AI와 Veo 3.1 vs Wan 2.6에서 볼 수 있습니다.
