
Veo 3.1과 Wan 2.6은 둘 다 화면과 함께 소리를 생성하는 영상 모델이지만, 맞는 작업이 다릅니다. Alibaba의 Wan 2.6은 더 긴 영상(최대 15초)을 만들고, 프롬프트를 스스로 여러 컷으로 나눌 수 있으며, 캐릭터의 참조 영상을 받아 목소리까지 가져올 수 있습니다. Google DeepMind의 Veo 3.1은 자세한 프롬프트를 충실히 따르는 더 짧은 영상을 만들고, 시작·끝 프레임 제어와 4K 옵션을 제공합니다.
이 글에서는 각각의 차이가 실제로 무엇을 의미하는지 설명합니다. 사양은 2026년 9월 28일 Alibaba Cloud와 Google의 공식 문서로 확인했습니다.
짧은 답
- Wan 2.6을 고르세요. 10~15초 영상, 자동 멀티샷 시퀀스, 정사각형이나 4:3 형식이 필요할 때, 또는 참조 영상에서 캐릭터의 외모와 목소리를 그대로 가져오고 싶을 때.
- Veo 3.1을 고르세요. 정밀하게 연출한 단일 컷, 정해진 두 프레임 사이의 전환, 4K 마스터본, 또는 프롬프트에 한 줄씩 적은 대사가 필요할 때.
- 둘 다 다운로드할 수 없습니다. Wan 2.6도 Veo 3.1처럼 호스팅 방식 모델이며, Alibaba가 공개한 가중치는 Wan 2.2까지입니다.
Veo 3.1 vs Wan 2.6 사양
| Veo 3.1 (Google DeepMind) | Wan 2.6 (Alibaba) | |
|---|---|---|
| 출시 | 2025년 10월 15일(4K와 세로 업그레이드는 2026년 1월 13일) | 2025년 12월 16일 |
| 영상 길이 | Google API 기준 4, 6, 8초(1080p와 4K는 8초) | 2 |
| 해상도 | 720p, 1080p, 4K(Google은 4K를 업스케일로 설명) | 720p, 1080p |
| 화면 비율 | 16:9, 9:16 | 16:9, 9:16, 1:1, 4:3, 3:4 |
| 멀티샷 | 기본은 단일 컷, 프롬프트로 요청할 때만 컷 전환 | 내장 멀티샷 모드 |
| 시작점 | 텍스트, 시작 이미지, 시작+끝 프레임, 참조 이미지 최대 3장 | 텍스트, 첫 프레임 이미지, 참조 최대 5개(영상 최대 3개, 이미지 최대 5장) |
| 오디오 | 영상과 함께 생성: 대사, 효과음, 주변음 | 자동 생성, 또는 직접 오디오 트랙 제공 |
| 가중치 | 공개 가중치 없음, Google이 호스팅 | 공개 가중치 없음(Hugging Face에는 Wan 2.2까지), Alibaba가 호스팅 |
| 이용 경로 | Gemini 앱, Flow, Gemini API, Vertex AI, Veo Video | Alibaba Cloud Model Studio, Wan 웹사이트, Qwen 앱 |
영상 길이: 8초 vs 최대 15초
Wan 2.6의 텍스트 투 비디오 모델은 2초부터 15초까지 초 단위 정수라면 어떤 길이든 받습니다. 늘어난 길이는 펼쳐지는 데 시간이 필요한 하나의 연속 동작이나, 여러 번 나눠 생성하면 안 되는 짧은 광고에 유용합니다. reference-to-video 모델은 최대 10초입니다.
Veo 3.1은 더 짧은 단위로 작업합니다. Google API 기준 4, 6, 8초이며, 1080p와 4K는 8초 전체가 필요합니다. Google의 도구에서 영상을 연장할 수 있지만(API는 720p에서 1회당 7초씩 최대 20번), 더 긴 Veo 프로젝트는 대부분 8초 컷 여러 개를 편집으로 이어 붙여 만듭니다. 장점은 나머지를 건드리지 않고 각 컷을 따로 다시 생성할 수 있다는 것입니다.
멀티샷 스토리텔링
Alibaba는 "지능형 멀티샷 스토리텔링"을 Wan 2.6의 대표 기능으로 내세웁니다. API에서는 멀티샷 설정(자동 프롬프트 확장과 함께)을 켜면, 모델이 아이디어를 여러 컷으로 나누면서 핵심 디테일을 일관되게 유지합니다. 설정 숏, 동작, 리액션처럼 이어지는 시퀀스가 필요한데 컷마다 직접 계획하고 싶지 않을 때 편리합니다.
Veo 3.1은 기본적으로 하나의 연속 컷을 만듭니다. 프롬프트로 컷 전환을 요청할 수는 있고, 모델이 8초 안에서 프레이밍을 바꾸는 경우도 많지만, 이때는 컷 계획을 모델에 맡기는 것이 아니라 직접 명시적으로 연출하는 것입니다.
실제로 의미하는 바: 짧은 시퀀스의 구성을 모델에 맡기고 싶다면 Wan 2.6이 그 일을 더 많이 해 줍니다. 모든 컷을 직접 제어하고 싶다면, 생성 한 번에 컷 하나를 만드는 Veo 3.1 쪽이 조절하기 쉽습니다.
참조: 영상 vs 이미지
Wan 2.6의 reference-to-video 모델은 참조를 최대 5개 받으며, 그중 영상은 최대 3개(각 1~30초), 이미지는 최대 5장까지 넣을 수 있습니다. 참조 하나에는 캐릭터나 사물 하나만 담겨야 합니다. Alibaba에 따르면 모델은 참조에서 "캐릭터의 외모와 목소리(있는 경우)"를 추출하므로, 사람이 말하는 짧은 영상 하나로 그 사람의 모습과 목소리를 모두 새 장면에 가져올 수 있습니다.
Veo 3.1은 스틸 이미지를 씁니다. 사람, 캐릭터, 제품의 참조 이미지를 최대 3장 넣어 일관되게 유지하거나(Google은 이를 Ingredients to Video라고 부릅니다), 첫 프레임과 마지막 프레임을 지정해 그 사이의 움직임을 모델이 만들게 할 수 있습니다. 스틸 이미지는 준비하기 쉽고, 참조 영상은 사람이 어떻게 움직이고 어떤 목소리를 내는지처럼 더 많은 정보를 담습니다.
오디오
두 모델 모두 영상과 함께 소리를 생성합니다.
Veo 3.1은 대사, 효과음, 주변음을 생성하며, 이를 프롬프트로 연출합니다. 대사는 따옴표 안에, 효과음은 이름을 붙여, 주변음은 묘사해서 적습니다.
Wan 2.6은 어울리는 배경 음악과 효과음을 자동으로 생성하거나, 업로드한 오디오 파일을 사용합니다. 두 번째 방식은 보이스오버나 징글처럼 사운드트랙이 이미 있고 화면이 그에 맞춰야 할 때 유용합니다.
해상도와 형식
Veo 3.1은 16:9 또는 9:16에서 720p, 1080p, 4K를 제공합니다. Google은 4K를 "최첨단 업스케일링"이라고 설명하므로, 큰 화면을 위한 더 선명한 마스터본으로 생각하세요.
Wan 2.6은 720p와 1080p를 제공하지만, 16:9, 9:16, 1:1, 4:3, 3:4의 다섯 가지 모양을 지원합니다. 정사각형 게시물이나 4:3 화면을 모델에서 바로 뽑아야 한다면 Wan 2.6으로 크롭 한 번을 줄일 수 있습니다.
오픈소스 vs 호스팅
이전 Wan 버전은 가중치가 공개된 모델이었고, 그래서 Wan은 흔히 오픈소스로 불립니다. 하지만 Wan 2.6에는 더 이상 해당되지 않습니다. Hugging Face의 Alibaba Wan-AI 페이지에는 Wan 2.2까지의 가중치만 올라와 있고, Wan 2.6은 Alibaba Cloud Model Studio, Wan 웹사이트, Qwen 앱으로 제공됩니다. 자신의 GPU에서 모델을 돌려야 한다면 Wan 2.6이 아니라 Wan 2.2가 해당 버전입니다.
Veo 3.1도 호스팅으로만 제공됩니다. Google의 제품과 API, 또는 Veo Video 같은 플랫폼으로 이용합니다.
Alibaba는 Wan 2.6 이후에도 Wan 3.0 등 새 Wan 버전을 출시했으며, 문서에는 Wan 3.0이 1회 생성당 최대 30초로 나와 있습니다. 지금 Wan 모델을 고른다면 최신 버전과도 비교해 보세요.
어느 쪽을 골라야 할까?
| 프로젝트 | 더 잘 맞는 모델 | 이유 |
|---|---|---|
| 10~15초 원테이크 | Wan 2.6 | 영상당 최대 15초 |
| 모델이 구성해 주는 짧은 시퀀스 | Wan 2.6 | 내장 멀티샷 모드 |
| 목소리까지 이어져야 하는 캐릭터 | Wan 2.6 | 참조 영상이 외모와 목소리를 전달 |
| 정밀한 메인 컷이나 제품 영상 | Veo 3.1 | 충실한 프롬프트 반영, 시작·끝 프레임 |
| 정해진 프레임으로 끝나는 전환 | Veo 3.1 | 첫 프레임과 마지막 프레임 제어 |
| 4K 마스터본 | Veo 3.1 | 720p, 1080p, 4K |
| 정사각형이나 4:3 소셜 게시물 | Wan 2.6 | 다섯 가지 화면 비율 |
| 세로형 Shorts, Reels, TikTok | 둘 다 | 둘 다 9:16 지원 |
Veo Video에서 Veo 3.1 써 보기
Wan 2.6은 Veo Video에서 제공하지 않고, Veo 3.1은 세 등급으로 제공합니다. 생성할 때마다 소리가 있는 8초 영상이 16:9 또는 9:16, 720p·1080p·4K로 만들어집니다. 텍스트나 사진으로 시작할 수 있고 어느 등급에서든 끝 프레임을 추가할 수 있으며, 참조 이미지는 Veo 3.1 Fast에서 영상당 최대 3장까지 쓸 수 있습니다.
Veo 3.1 Lite의 720p로 프롬프트 초안을 잡고, 마음에 드는 결과는 정식 Veo 3.1 등급으로 생성하세요. 신규 계정에는 무료 크레딧 30개가 지급되며, 720p Veo 3.1 Lite 영상 한 편을 만들 수 있습니다.
다른 비교 글은 Veo 3.1 vs Seedance 2.0과 Veo 3.1 vs Kling AI에서 볼 수 있습니다.
