
이 비교 글을 처음 쓴 뒤로 답이 바뀌었습니다. OpenAI는 2026년 3월 24일 Sora 서비스 중단을 발표했습니다. Sora 앱과 웹사이트는 2026년 4월 26일에, Sora 2 모델과 Videos API는 2026년 9월 24일에 종료됐습니다. 그래서 지금 현실적인 질문은 "Veo 3.1이냐 Sora 2냐"가 아니라 "Sora 2가 무엇을 했고, Veo 3.1이 그중 얼마나 커버하느냐"입니다.
요약하면: Veo 3.1은 Sora 2의 핵심, 즉 텍스트나 이미지로 영상과 소리를 함께 생성하는 기능을 그대로 갖추고 있고, 개별 컷을 더 세밀하게 제어할 수 있습니다. 시작 프레임, 선택적인 끝 프레임, 최대 3장의 참조 이미지, 최대 4K 출력이 그것입니다. 대체하지 못하는 것은 Sora의 더 긴 단일 영상(15~25초)과, 자신을 장면에 넣는 Cameo 기능입니다. 서비스 종료 일정 전체는 Sora 2 서비스 종료를 참고하세요.
Veo 3.1 vs Sora 2: 사양 나란히 보기
Veo 3.1 수치는 Google의 Gemini API 문서에서, Sora 2 수치는 OpenAI 모델 페이지와 2025년 10월 제품 업데이트에서 가져왔습니다. 모두 2026년 9월 28일에 확인했습니다.
| Veo 3.1 (Google DeepMind) | Sora 2 (OpenAI) | |
|---|---|---|
| 출시 | 2025년 10월 15일(2026년 1월 업데이트) | 2025년 9월 30일 |
| 상태 | 이용 가능: Gemini 앱, Flow, Gemini API, Vertex AI | 앱은 2026년 4월 26일, API는 2026년 9월 24일 종료 |
| 네이티브 오디오 | 지원 — 효과음, 주변음, 대사, 항상 켜짐 | 지원 — 대사와 효과음 |
| 영상 길이 | 4, 6, 8초 | 앱에서 모든 사용자 최대 15초, 웹 Pro는 25초 |
| 더 긴 시퀀스 | 연장: 1회당 +7초, 720p에서 약 148초까지 | 없음(Storyboards는 컷 계획용) |
| 해상도 | 720p, 1080p, 4K | 720p(sora-2), 최대 1080p(sora-2-pro) |
| 화면 비율 | 16:9, 9:16 | 가로, 세로 |
| 프레임 레이트 | 24fps | 공개되지 않음 |
| 이미지 투 비디오 | 지원 | 지원 |
| 첫 프레임과 마지막 프레임 | 지원 | 미제공 |
| 참조 | 참조 이미지 최대 3장 | Cameo(녹화한 본인 모습) |
| 모델 등급 | Veo 3.1, Fast, Lite | Sora 2, Sora 2 Pro |
Google은 Veo 3.1의 1080p와 4K 출력을 업스케일 결과라고 설명하므로, 4K는 더 많은 디테일이 생성됐다는 증거라기보다 납품용 형식으로 보는 것이 좋습니다.
오디오와 대사
두 모델 모두 소리가 가장 큰 화제였습니다. OpenAI는 화면에 맞춰 나오는 대사와 효과음을 앞세워 Sora 2를 출시했고, Google은 Veo 3.1이 효과음, 주변 소음, 대사를 네이티브로 생성하며 Gemini API에서는 오디오가 항상 켜져 있다고 설명합니다.
어느 쪽도 같은 조건의 오디오 비교를 공개하지 않았으니, 한 모델의 립싱크가 확실히 낫다는 주장은 조심해서 받아들이세요. Veo 3.1에서 확실히 도움이 되는 것은 소리를 프롬프트에 적는 것입니다. 주변음, 핵심 효과음, 그리고 각 대사를 따옴표 안에 넣으세요. 8초 영상에는 대사 한두 줄이 들어갑니다.
사실감과 물리적 움직임
OpenAI는 물리적 사실감을 Sora 2의 상징으로 내세웠습니다. 빗나간 농구공이 골대 안으로 순간이동하지 않고 백보드에 맞고 튀어나오는 예시가 대표적이었습니다. Google이 Veo 3.1에 대해 내세우는 것은 "향상된 프롬프트 충실도"와 Veo 3보다 사실적인 질감입니다. 둘 다 개발사의 홍보 문구일 뿐, 통제된 테스트 결과는 아닙니다.
직접 판단하려면 신경 쓰이는 장면으로 시험해 보는 것이 가장 유용합니다. 물리적 접촉, 떨어지는 물체, 액체, 두 사람의 상호작용 같은 장면을 생성한 다음, 전체 화면으로 보면서 손이 물체를 통과하거나, 발이 미끄러지거나, 물체 크기가 바뀌는지 확인하세요.
영상 길이와 더 긴 이야기
Sora 2의 가장 분명한 장점이었습니다. 앱에서는 누구나 15초 영상을 만들 수 있었고, 웹의 Pro 사용자는 25초까지 가능했으며, Storyboards로 영상을 컷 단위로 계획할 수 있었습니다.
Veo 3.1은 한 번에 최대 8초를 생성합니다. Google API와 Flow에서 7초 단위로(720p) 영상을 연장할 수 있지만, 보통은 짧은 컷의 연속으로 계획해서 편집으로 이어 붙이는 쪽이 더 간단합니다. Sora에서 넘어왔다면 긴 프롬프트를 컷 목록으로 다시 쓰고, 컷마다 핵심 동작 하나와 카메라 움직임 하나만 두세요.
컷 제어
이 부분에서는 Veo 3.1이 활용할 수 있는 수단이 더 많습니다.
- 이미지 투 비디오: 직접 준비한 스틸 이미지에서 시작해 구도, 피사체, 스타일을 고정합니다.
- 첫 프레임과 마지막 프레임: 끝 이미지를 추가하면 Veo 3.1이 두 이미지 사이의 움직임을 만듭니다.
- 참조 이미지: 캐릭터, 제품, 장소 이미지를 최대 3장 넣어 서로 다른 영상에서도 일관되게 유지합니다.
Sora 2에서 이에 해당하던 기능은 Cameo였는데, 이는 구도를 고정하는 것이 아니라 녹화한 사람을 장면에 넣는 기능이었습니다. Sora 작업이 자신을 등장시키는 Cameo에 의존했다면 Veo 3.1에는 직접적인 대응 기능이 없고, Google의 안전 필터는 사진 속 실존 인물로 영상을 생성하는 것을 제한합니다.
지금 나에게 맞는 선택은?
Sora 2는 더 이상 이용할 수 없으므로, 결정은 무엇을 대신 쓸지에 관한 것입니다.
- Sora로 소리가 있는 짧은 소셜 영상을 만들었다면: Veo 3.1이 바로 대체합니다. Shorts, Reels, TikTok에는 9:16을 쓰세요.
- 15~25초 원테이크에 의존했다면: 8초짜리 Veo 3.1 컷 여러 개로 계획하거나, 한 번에 더 긴 영상을 생성하는 모델을 쓰세요.
- 여러 컷에서 캐릭터나 제품을 일관되게 유지해야 한다면: Veo 3.1의 시작 프레임과 참조 이미지가 더 나은 도구입니다.
- 자신이 등장하는 Cameo를 썼다면: Veo 3.1에는 이를 그대로 대체할 기능이 없습니다.
여기서 Veo 3.1 써 보기
Veo Video는 Veo 3.1의 세 등급을 모두 제공합니다. 모든 생성 결과는 소리가 있는 8초 영상이며, 16:9 또는 9:16, 720p·1080p·4K로, 텍스트나 이미지(선택적으로 끝 프레임 포함)에서 만들 수 있습니다. Veo 3.1 Fast는 참조 이미지도 최대 3장까지 받습니다. 연장과 4초·6초 길이는 여기서 지원하지 않습니다.
신규 계정에는 크레딧 30개가 지급되며, 720p Veo 3.1 Lite 영상 한 편을 만들 수 있으니 예전 Sora 프롬프트 하나를 먼저 시험해 보세요. 최종 품질의 컷에는 Veo 3.1을 쓰세요. 더 긴 원테이크가 필요하다면 AI 영상 생성기에서 MiniMax H3 Max도 쓸 수 있습니다.
