Veo 3.1 프롬프트
Google의 시네마틱 텍스트-투-비디오 모델 — 영화 감독처럼 숏을 지휘하고, 사운드까지 한 번에 생성합니다.
Veo 3.1 소개
Veo 3.1은 Google DeepMind의 플래그십 영상 생성 모델입니다. 글로 쓴 장면 묘사를 영화 같은 쇼트 클립으로 바꿔 주며, 대부분의 영상 모델과 달리 대사·환경음·효과음 같은 네이티브 오디오를 영상과 동기화해 한 번에 생성합니다.
가장 두드러진 강점은 연출 컨트롤입니다. Veo는 영화 언어를 이해합니다: 숏 종류, 렌즈 선택, 달리인·크레인 숏 같은 카메라 무브, 조명 설계, 무드까지. 시나리오의 숏 리스트처럼 쓴 프롬프트가 느슨한 묘사보다 일관되게 좋은 결과를 냅니다.
그래서 Veo에서는 프롬프트 품질이 다른 모델보다 더 중요합니다. 아래 갤러리는 검증된 Veo 프롬프트와 실제 출력을 모아 두었으니, 처음부터 더듬어 찾는 대신 작동하는 구조를 그대로 복사해 시작하세요.
Veo 3.1 프롬프트 작성법
- 1숏 브리프 구조로 쓰세요: 피사체 → 동작 → 배경 → 카메라 → 조명 → 무드. Veo는 형용사 나열보다 영화 용어에 반응합니다.
- 2카메라 워크를 명시하세요 — "슬로우 달리인", "핸드헬드 트래킹 숏", "에어리얼 크레인 다운". 클립당 카메라 지시는 하나로 제한해야 움직임이 일관됩니다.
- 3사운드도 연출하세요: 대사는 따옴표에 넣고 환경음을 묘사하세요("양철 지붕을 때리는 빗소리, 멀리서 울리는 천둥"). 오디오 지시가 없으면 밋밋한 앰비언스가 나오기 쉽습니다.
- 4조명과 색보정 레퍼런스로 룩을 고정하세요: "골든아워 역광, 얕은 심도, 틸-오렌지 필름 그레이드".
- 5프롬프트 하나에 장면 하나만 담으세요. Veo는 단일 연속 숏에 강하고, 여러 컷을 욱여넣으면 움직임이 조각납니다.
- 6한 번에 변수 하나만 바꾸세요 — 카메라, 조명, 동작 중 하나. 어떤 문구가 결과를 움직였는지 판별할 수 있습니다.
자주 묻는 질문
Veo 3.1은 무엇에 가장 강한가요?
사실적인 움직임과 동기화된 네이티브 오디오를 갖춘 시네마틱 원숏 클립입니다. 의도적인 카메라 무브, 일관된 조명, 장면에 맞는 사운드 — '연출된' 영상이 필요할 때 가장 강력한 선택입니다.
좋은 Veo 3.1 프롬프트는 어떻게 쓰나요?
태그를 나열하지 말고 감독처럼 쓰세요. 한 장면을 자연스러운 문장으로 묘사하고 카메라·조명·사운드 지시를 명시하세요. 이 페이지의 검증된 프롬프트를 복사해 피사체만 바꾸는 것이 제로에서 쓰는 것보다 빠른 출발점입니다.
Veo 3.1은 사운드와 대사도 생성하나요?
네 — 네이티브 오디오가 바로 Veo의 대표 기능입니다. 영상과 동기화된 음성·환경음·효과음을 생성합니다. 대사는 따옴표에 넣고 사운드스케이프를 구체적으로 묘사하면 가장 좋은 결과를 얻습니다.
이 Veo 프롬프트는 어디서 써 볼 수 있나요?
Veo는 Google의 Gemini 앱과 Flow에서 사용할 수 있고, 개발자는 Gemini API로 접근할 수 있습니다. 이 페이지의 프롬프트를 복사해 붙여 넣고, 피사체나 카메라 표현만 장면에 맞게 조정하세요.
관련 모델
Nano Banana
Google's fast, free conversational image generation and editing model.
Nano Banana Pro
Google's Gemini image flagship with 4K output, Thinking mode and search grounding for reference-accurate results.
Seedance 2.5
Seedance 2.5 is a next-gen AI video model that generates continuous, synchronized 30-second 4K clips from a single prompt.
MiniMax H3
MiniMax H3 is a powerful multimodal video generation model that creates up to 15-second 2K videos with native stereo sound from text, image, video, and audio inputs.