Veo란? 구글 AI 영상 생성 모델 완전 정리
Veo는 구글 딥마인드가 만든 AI 영상 생성 모델 시리즈로, 글로 쓴 설명을 영상 클립으로 바꿔 줍니다. 최신 버전인 Veo 3는 소리가 동기화된 실사급 영상——대사, 효과음, 환경음——을 프롬프트 하나만으로 완결된 시청각 콘텐츠로 출력합니다.
TL;DR 핵심 요약
- 포지션: 구글 딥마인드의 플래그십 텍스트/이미지→영상 모델이며, Veo 3가 2026년 1분기 주력 버전입니다.
- 가장 큰 강점: 영상과 소리의 네이티브 동시 생성——화면, 대사, 효과음, 환경음이 함께 나오며 후반 더빙이 아닙니다.
- 사양: 한 번에 최대 60초, 최고 4K 해상도에 24~60fps, 텍스트→영상·이미지→영상·프레임 제어를 지원합니다.
- 이용 경로: Gemini Advanced 대화창, Google AI Studio, Vertex AI(프로덕션 API), Flow(구글의 영상 제작 워크벤치).
- 가격: Gemini Advanced 월 $19.99에 일정 사용량 포함, API는 영상 초 단위 과금(대략 초당 $0.3~0.5, 4K는 더 비쌈).
- 경쟁 구도: OpenAI Sora, Runway Gen-3, Luma Dream Machine, Kuaishou의 Kling, Minimax/Hailuo와 경쟁하며, 소리를 네이티브로 담는 것은 Veo 3뿐입니다.
Veo 3는 무엇을 할 수 있나요?
Veo는 글을 영상으로 바꿉니다. 장면을 설명하면 모델이 카메라 움직임, 조명의 일관성, 물리 시뮬레이션, 시간적 연속성을 처리합니다. Veo 3의 돌파구는 네이티브 사운드 생성입니다. 화면 속 인물이 자갈길을 걸으면 자갈 밟는 발소리가 들리고, 비가 오면 빗소리가 깔리며, 인물이 말하면 입 모양과 목소리가 맞아떨어집니다. 소리와 영상이 함께 생성되며 후처리가 아닙니다.
해상도는 최고 4K(3840 x 2160)까지 지원하고 표준 출력은 1080p입니다. 프레임 레이트는 24fps(영화적)부터 60fps(부드러움)까지 선택할 수 있습니다. 길이는 8초부터 시작하고, Pro 등급에서는 클립 하나로 30~60초가 열리며, 그보다 긴 콘텐츠는 클립을 이어 붙여 만듭니다(인물과 장면의 일관성을 유지합니다). Veo 3는 초기 영상 생성 모델에서 흔했던 문제——얼굴이 뭉개지는 현상, 물리 법칙 위반(물체 관통, 중력 오류), 텍스처 깜빡임——을 크게 줄였지만 완전히 없애지는 못했습니다.
텍스트 외에도 Veo 3는 다음을 지원합니다. 이미지→영상(정지 이미지 한 장을 올려 ‘살아 움직이게’ 만들고 카메라 워크를 지정), 첫 프레임·끝 프레임 제어(시작과 끝 프레임을 지정하면 모델이 중간 움직임을 채움), 참조 스타일(스타일 샘플 영상을 올려 색감과 편집 리듬을 맞춤), 카메라 용어 지시(“돌리 인”, “따라가는 숏”, “현기증 효과”).
움직임 유형에서 Veo 3가 강한 것은 ‘현실감 있는 중간 속도의 움직임’입니다. 사람이 걷고, 차가 지나가고, 커튼이 흔들리고, 액체가 따라지는 장면은 역동성이 자연스럽고 프레임 간 일관성도 좋습니다. 약한 쪽은 극단적인 슬로모션(초저속에서 물리 디테일의 정밀도가 부족), 극단적인 고속(레이싱카 가속이나 폭발 순간의 디테일이 종종 뭉개짐), 그리고 공간을 넘나드는 긴 카메라 이동(실외에서 문을 지나 실내로 들어가는 시점 전환에서는 장면 일관성이 아직 흔들립니다)입니다.
Veo 3는 어떤 원리로 작동하나요?
기반 구조는 디퓨전 트랜스포머(Diffusion Transformer)로, 시공간 공간에서 노이즈로부터 영상을 단계적으로 다듬어 갑니다. 텍스트 이해 층은 Gemini 3를 그대로 활용해 복잡한 장면 묘사, 공간 관계, 영화 용어를 해석합니다. 예를 들어 “광각 렌즈로 바닥에서 올려다보는 앵글, 배우가 화면 오른쪽에서 등장, 배경은 해질 무렵 도쿄 시부야 교차로” 같은 지시입니다.
Veo 3의 영상·소리 동시 생성 방식은 핵심 혁신입니다. 전통적인 방식은 영상을 먼저 만들고 합성 음성이나 효과음 라이브러리로 소리를 입히는 것이라, 입 모양이 어긋나고 환경음이 밀리고 감정이 맞지 않는 문제가 있었습니다. Veo 3는 영상과 소리를 같은 시간축과 같은 의미 맥락 위에서 함께 만들어 내기 때문에, 인물이 입을 열어 “hello”라고 말할 때 입 모양, 자음의 소리, 공간의 울림 세 가지가 정확히 맞물립니다.
물리적 일관성은 물리 라벨이 붙은 대량의 합성 데이터와 실사 영상 파인튜닝에 기대고 있습니다. 모델은 “물은 떨어진다”, “유리는 깨진다”, “천은 바람에 날린다” 같은 기본 물리 규칙을 학습했지만, 드문 현상(불꽃놀이, 액체끼리 섞이는 장면, 복잡한 유체)에서는 여전히 무너집니다.
연산 비용 측면에서, 8초 1080p 영상 한 편은 구글의 TPU v5 클러스터에서 대략 1~3분의 생성 시간이 걸리고, 4K는 비용이 3배, 60초는 8배가 됩니다. Veo 3의 API 요금이 초 단위 과금인 이유가 여기에 있습니다. 영상 생성은 현재 AI 분야에서 연산 밀도가 가장 높은 작업 중 하나이며, 2분짜리 4K 영상 한 편의 연산량은 Deep Research를 20번 돌리는 것과 맞먹습니다.
주요 영상 생성 모델과 어떻게 다른가요?
| 모델 | 제조사 | 길이 | 해상도 | 네이티브 사운드 | 이미지→영상 | 가격 |
|---|---|---|---|---|---|---|
| Veo 3 | 구글 딥마인드 | 8~60초 | 4K | 예(입 모양 동기화) | 예 | Gemini Advanced 월 $19.99·사용량 포함 |
| Sora 2 | OpenAI | 20~60초 | 1080p~4K | 아니요(후반 더빙) | 예 | ChatGPT Pro 월 $200 |
| Runway Gen-4 | Runway | 10초 | 1080p | 아니요 | 예(모션 브러시가 강력) | 월 $15~76 |
| Luma Dream Machine | Luma AI | 5~10초 | 1080p | 아니요 | 예 | 월 $10~100 |
| Kling 2.0 | Kuaishou | 5~10초 | 1080p | 아니요 | 예(인물 표정이 좋음) | 크레딧 과금 |
| Minimax / Hailuo | Minimax | 6초 | 720p | 아니요 | 예 | 무료 사용량 + 구독 |
Veo 3의 핵심 차별점은 네이티브 사운드입니다. 경쟁 제품은 사운드 디자인에 별도 도구(ElevenLabs 내레이션 + Mubert 배경음악 + Premiere 편집)가 필요하지만, Veo 3는 바로 공개할 수 있는 시청각 콘텐츠를 그대로 출력합니다. 단점은 길이 상한이 Sora 2에 못 미치고, 극단적인 물리 장면과 예술적인 스타일(추상 애니메이션, 카툰 렌더링 등)의 한계가 전문 도구에 아직 미치지 못한다는 점입니다.
Sora 2와 좀 더 세밀하게 비교하면, ‘실사감’과 ‘물리적 정확성’ 두 축에서는 Sora 2의 상한이 조금 더 높습니다. 인물 피부의 질감이나 머리카락이 날리는 느낌이 실제 영상에 더 가깝습니다. 반면 ‘지시 따르기’에서는 Veo 3가 안정적입니다. “빨간 원피스를 입은 여성이 왼쪽에서 오른쪽으로 걸어가다가 도중에 돌아서서 카메라를 본다”라고 쓰면 Veo 3는 그대로 실행하지만, Sora 2는 색이나 동작 순서를 바꿔 버릴 때가 있습니다. ‘네이티브 사운드’라는 결정적 차이에서 Sora 2는 아직 후반 더빙만 가능해 제작자가 별도의 도구를 더 갖춰야 합니다. Veo 3는 1인 미디어와 숏폼 제작자에게 “받아서 바로 올릴 수 있는” 결과물을 줍니다.
Runway Gen-3/Gen-4와의 차이는 포지션에 있습니다. Runway는 영상 전용 도구로 모션 브러시, 크로마키, 시각 효과 같은 전문 편집 기능이 풍부합니다. Veo 3는 ‘범용 멀티모달 모델이 가진 영상 능력’이라 편집 도구로는 약하지만 Gemini의 다른 기능과의 통합이 강점입니다. 편집자는 앞으로도 주로 Runway를 쓰겠지만, 블로거·마케터·교육 종사자는 Veo 3 쪽으로 기울 것입니다.
Veo 3는 실제로 어디에 쓰이나요?
숏폼 크리에이터: 인스타그램 릴스, 틱톡, 유튜브 쇼츠용 9:16 세로 영상. “바리스타가 슬로모션으로 핸드드립을 내리고, 물줄기와 원두 가루를 클로즈업”이라고 설명하면 네이티브 사운드(물소리, 그라인딩 소리)까지 붙어 바로 올릴 수 있고 소재 라이브러리가 필요 없습니다. 한 단계 더 나아가려면 먼저 Nano Banana 2로 브랜드 비주얼을 만든 뒤, 그 정지 이미지를 바탕으로 Veo 3에서 이미지→영상을 돌리면 브랜드 톤이 일관된 시리즈 영상이 나옵니다.
제품 데모 영상: SaaS 기업이 새 기능의 메인 페이지 히어로 영상을 만드는 경우——“사용자가 노트북을 열자 화면에 우리 앱이 뜨고, 카메라가 다가가며 UI가 매끄럽게 전환된다”. 예전에는 이런 10초짜리 데모를 영상 제작사에 맡기면 100만~200만 원이 들었지만, 지금은 Veo 3 프롬프트 한 줄로 몇 분이면 끝납니다.
소셜 콘텐츠와 시즌 마케팅: 명절 숏폼(설날, 크리스마스, 밸런타인데이), 할인 카운트다운, 신제품 티저——차별화된 영상을 짧은 시간에 여러 편 뽑아야 하는 상황에서 Veo 3의 효율이 가장 두드러집니다.
광고·마케팅: 홍보 영상의 빠른 프로토타이핑. 실사 촬영에 들어가기 전에 Veo 3로 6~8개의 콘티 버전을 만들어 클라이언트가 고르게 하면, 선정 기간이 2주에서 2일로 줄어듭니다. 최종본은 여전히 실사로 찍더라도 A/B 테스트 단계는 전부 AI 생성으로 돌릴 수 있습니다.
교육과 연수: 역사 장면 재현(“로마 원로원에서 원로들이 토론하는 장면”), 과학 과정 시각화(“세포 유사분열 전 과정 30초”), 어학 교육의 상황 대화(“파리 카페에서 두 사람이 주문하는 대화”). 네이티브 사운드가 있으니 별도로 성우를 구할 필요가 없습니다.
영화풍 단편: 독립 감독의 콘셉트 검증에——“필름 누아르 스타일, 비 내리는 밤거리, 중절모를 쓴 남자가 담배에 불을 붙이고, 성냥 긋는 소리 클로즈업”. Veo 3는 “cinematic”, “noir”, “anamorphic lens” 같은 영화 용어를 꽤 정확히 이해해 질감 있는 분위기 영상을 뽑아냅니다.
게임과 엔터테인먼트: 컷신 프로토타입, NPC 대화 애니메이션, 세계관 트레일러. 1인 개발자도 예산이 빠듯할 때 Veo 3로 트레일러를 만들 수 있습니다.
사내 활용: 사내 행사 오프닝 영상, 제품 발표 사전 홍보, 사내 교육용 짧은 클립. 영상 제작사에 외주를 주지 않아도 프로덕트 매니저가 직접 프롬프트를 써서 만들 수 있습니다.
Veo 3의 한계는 어디까지인가요?
지금은 안 되는 것들: 초장편 연속 서사(60초를 넘으면 이어 붙여야 하고, 클립을 넘나드는 인물 일관성은 여전히 과제입니다. Flow에 인물 고정 기능이 있지만 완벽하지는 않습니다), 복잡한 문자 삽입(오프닝 자막이나 화면 속 휴대폰 글자에는 아직 오타가 납니다), 실존 배우의 얼굴 지정(딥페이크 방지를 위해 정책상 금지), 아주 정교한 손동작(피아노 연주, 타이핑, 수어 등 손가락 정밀도가 아직 부족), 초사실적인 동물 털의 물리(큰 동물이 달릴 때 털의 움직임이 가끔 어긋남).
알려진 제약: Gemini Advanced의 하루 영상 사용량은 제한적이고(8초 1080p 기준 대략 5~10편, 지역에 따라 변동), 4K와 긴 클립은 사용량을 더 많이 소모합니다. API 요금은 고빈도 상업 이용에 우호적이지 않아, 대규모 제작은 보통 Vertex AI로 기업 계약을 맺습니다. 지역 제한도 있어 EU AI 법의 일부 조항에서 제한되는 용도가 있고, 중국 본토에서는 직접 제공되지 않습니다. 정책 필터는 폭력, 성적 표현, 혐오, 유명 브랜드 로고, 허가받지 않은 유명인의 모습을 차단합니다.
윈도우에서는 어떤가요?
구글은 지금까지도 네이티브 Gemini 윈도우 앱을 내놓지 않았습니다. 2026-04-14에 공개된 “Google app for desktop”은 Alt+Space 검색 런처일 뿐 Gemini 채팅 클라이언트가 아니며, Veo 영상 생성도 지원하지 않고, 20MB 업로드 제한까지 있습니다. 윈도우에서 Veo 3로 영상을 만들고 미리 보고 로컬에 저장하려면 GeminiDesktop을 권합니다. 네이티브 Tauri 바이너리로, Gemini 대화창에서 바로 Veo 3 영상을 만들고 네이티브 플레이어로 미리 볼 수 있습니다. 자세한 내용은 윈도우 설치 가이드와 Google app 비교를 참고하세요.
자주 묻는 질문
Q: Veo 3와 Sora 2 중 어느 쪽이 더 낫나요? A: 잘하는 영역이 다릅니다. Sora 2는 초장편 연속성, 극단적인 물리 장면, 예술적인 숏에서 조금 앞섭니다. Veo 3는 네이티브 사운드, 지시 따르기, Gemini 워크플로 통합에서 확실히 앞섭니다. 크리에이터의 일상적인 작업에는 Veo 3가 더 쓸 만하고, 영화급 실험 단편에는 Sora 2가 여전히 유리합니다.
Q: 생성한 영상을 상업적으로 쓸 수 있나요? 워터마크가 있나요? A: Gemini Advanced는 개인의 상업적 이용을 허용하며, 기업 상업 이용은 Vertex AI 계약을 권장합니다. 모든 Veo 3 출력에는 SynthID 비가시 워터마크(눈에는 보이지 않고 AI로 검출 가능)가 기본 삽입되어 출처 확인에 쓰입니다.
Q: 한국어 대사와 한국 배경의 생성 품질은 어떤가요? A: Veo 3는 다국어 학습 데이터가 충분해 한국어 대사의 입 모양, 한국 거리 풍경, 한국식 결혼식 같은 장면을 잘 재현합니다. 다만 전통문화 요소(탈춤 가면, 한복의 세부 디테일)의 정확도는 영어권 주류 장면만큼은 아니어서 참조 이미지를 함께 쓰는 편이 좋습니다.
Q: 1분짜리 영상을 만드는 데 얼마나 걸리나요? A: 대략 3~8분 정도 기다립니다(대기열과 부하에 따라 변동). 4K와 긴 클립은 대기 시간이 더 깁니다. API에서는 비동기 모드로 Webhook 알림을 받을 수 있습니다.
Q: 카메라의 구체적인 값을 지정할 수 있나요? A: 가능합니다. 자연어로 카메라를 설명하면(“50mm 단렌즈”, “얕은 심도”, “빠른 셔터”, “핸드헬드 추적 촬영”) Veo 3가 그에 맞는 시각 효과를 맞춰 줍니다. Flow에서는 더 정밀한 스토리보드 제어와 파라미터 패널을 제공합니다.
Q: Veo 3와 Flow는 어떤 관계인가요? A: Veo 3는 모델이고, Flow는 Veo 3를 기반으로 한 전용 영상 제작 도구입니다. 스토리보드, 장면 순서 배치, 숏 연결, 인물 고정 같은 전문 기능을 제공합니다. 일반 사용자는 Gemini 대화창에서 바로 Veo 3를 쓰면 충분하고, 전문 크리에이터는 Flow를 씁니다.
Q: 영상 생성이 실패하면 어떻게 확인하나요? A: 가장 흔한 원인은 세 가지입니다. 첫째, 프롬프트가 정책 필터에 걸린 경우(실존 인물, 브랜드, 폭력 관련)로, 더 중립적인 표현으로 고쳐 씁니다. 둘째, 사용량 소진으로, Gemini Advanced 계정의 남은 영상 사용량을 확인합니다. 셋째, 서비스 부하로 인한 시간 초과로, 시간대를 바꿔 재시도하거나 해상도를 1080p로 낮춰 생성합니다. 그래도 계속 실패한다면 먼저 단순한 동작 설명(“고양이가 잔디밭을 걷는다”)으로 서비스 자체가 되는지 확인해 보세요.
Q: 여러 클립에서 인물을 일관되게 유지하려면? A: Flow의 인물 고정 기능을 추천합니다. 첫 클립의 키프레임을 올리고 이후 클립에서 “같은 인물을 사용”이라고 지정하면 얼굴, 의상, 체형을 최대한 유지해 줍니다. Gemini 대화창에서 바로 생성할 때는 프롬프트마다 같은 외형 특징(“짧은 머리에 파란 셔츠를 입은 같은 아시아계 남성”)을 적어 주는 것이 요령이며, 적지 않을 때보다 훨씬 일관성이 좋아집니다.
함께 읽기
- Nano Banana란? 구글 AI 이미지 생성 모델——Veo 3의 정지 이미지 짝
- Gemini Canvas란?——영상을 만든 뒤 홍보용 글과 이미지를 만드는 다음 단계
- Deep Research란?——먼저 조사한 뒤 해설 영상을 만들기
- NotebookLM Video Overview 완전 정리——또 다른 구글 AI 영상 생성 활용법
- Gemini for Mac 100일 100기능 리뷰
- 윈도우 네이티브 Gemini App 완전 가이드
- 구글이 만들지 않은 Gemini 윈도우 클라이언트
제미나이 데스크톱에서의 경험
GeminiDesktop은 Veo 3 영상 생성을 크로스 플랫폼 데스크톱으로 가져옵니다——macOS(Intel + Apple Silicon), 윈도우, 리눅스 네이티브 바이너리. 자연스러운 대화로 영상을 만들고, 네이티브 플레이어로 4K를 미리 보고, 브라우저를 거치지 않고 로컬 파일 시스템에 바로 저장할 수 있습니다. 구글의 윈도우 검색 클라이언트(비교 글)가 영어 전용에 20MB 제한인 데 비해, GeminiDesktop은 한국어·중국어·일본어 UI와 제한 없는 업로드를 지원합니다. 다운로드: geminidesktop.app.