영상 생성 AI프롬프트 엔지니어링Veo 3.1Kling 3.0Runway Gen-4.5Seedance 2.5촬영 용어이미지 투 비디오튜토리얼
영상 프롬프트 작성 노하우 — 샷 카드 여섯 층, 비트로 쓰는 동작, 입력 방식별로 달라지는 문장
영상 프롬프트에서 쓰지 않은 것은 사라지지 않는다. 모델이 대신 결정한다. 손의 위치를 안 쓰면 여섯 번째 손가락이 되고, 광원을 안 쓰면 '분위기 있는'이라는 단어가 아무것도 만들지 못한다. Google Veo 3.1, Kling 3.0, Runway Gen-4.5의 공식 프롬프팅 가이드와 OpenAI Sora 2 쿡북, Higgsfield의 실패 분석을 종합해 모델을 관통하는 작성법을 정리했다. 샷 카드 여섯 층의 순서, 동작을 비트로 쪼개는 법, 조명을 광원·방향·색 하나씩으로 쓰는 법, 오디오 문법, 텍스트·이미지·첫끝프레임·레퍼런스 입력마다 달라지는 문장, 길이 다이얼, 네거티브, 반복 워크플로우, 그리고 2026년 9월 기준 모델 지형까지.
나쁜 예: 한 여자가 비 오는 밤거리에 서 있다. 분위기 있고 시네마틱하게.
좋은 예: 미디엄 클로즈업. 비 오는 밤, 젖은 보도에 네온이 반사된다.
카메라가 4초 동안 그녀의 얼굴로 천천히 돌리 인.
얕은 심도, 35mm 필름 룩. 그녀는 숨을 참았다가 시선을 카메라 너머로 올린다.
두 프롬프트의 차이는 단어 수가 아니다. 첫 번째 프롬프트는 프레임 크기, 카메라 움직임, 광원, 렌즈, 그리고 그녀가 무엇을 하는지를 전부 모델에게 맡겼다. Higgsfield가 자사 실패 사례를 분석하며 쓴 문장이 이 글의 출발점이다. "프롬프트는 쓴 것만 담는다. 쓰지 않은 것도 결정된다. 다만 당신이 아니라 모델이."
이 블로그의 앞선 두 글은 모델별 문법과 유행 유형·실전 프롬프트 전문을 다뤘다. 이번 글은 그 아래 층, 즉 모델이 바뀌어도 남는 작성법이다. 출처는 Google의 Veo 3.1 공식 프롬프팅 가이드, Runway의 Gen-4·Gen-4.5 가이드와 카메라 프롬프트 자료, fal의 Kling 3.0 가이드, OpenAI의 Sora 2 프롬프팅 쿡북, Higgsfield의 실패 분석이다. 다섯 출처는 표현이 다를 뿐 같은 말을 하고 있었다.
dolly in / push-in, dolly out / pull-back, truck left / right, pedestal up / down, pan, whip pan, tilt, orbit / arc, crane up, drone rise, crash zoom, handheld, steadicam, gimbal, locked-off static
속도(slow, steady, rapid) 또는 시간("5-second pan right")
렌즈
24mm / 35mm / 50mm / 85mm, anamorphic, spherical, shallow / deep depth of field, rack focus, macro
초점이 어디에 맞는가
질감
film grain, halation, lens flare (anamorphic horizontal), Black Pro-Mist, gate weave, handheld micro-shake
시대와 함께 (1970s 35mm film)
세 가지 규칙이 있다.
돌리와 줌은 다르다. 초보자가 가장 자주 틀리는 부분이다. 돌리는 카메라가 공간을 이동해 배경의 시차가 바뀐다. 줌은 렌즈 초점거리만 바뀌어 원근이 평평해진다. "zoom in"이라고 쓰고 돌리를 기대하면 안 된다.
피사체 움직임과 카메라 움직임은 관계 동사로 묶는다. Runway가 권하는 방식이다. "Camera follows the cyclist." "Camera trucks left, matching the runner's speed." "Camera leads the dancer, pulling back as she advances." "Slow tilt up to reveal the skyline behind him." 피사체와 카메라를 따로 쓰면 둘이 따로 논다.
여러 단계의 무브는 동사를 쌓지 말고 무엇이 드러나는지를 쓴다. "Orbit the subject and crane up and push in"은 실패한다. "카메라가 앉은 인물을 돌아 나간 뒤 테이블 위로 올라가, 그녀를 둘러싼 빈 의자들을 드러낸다"는 성공한다. 단계마다 프레임에 무엇이 들어오는지를 쓰는 것이다.
3. 동작은 비트로, 접촉은 이름으로
Sora 2 쿡북이 가장 분명하게 설명한다. "방을 가로질러 걷는다"가 아니라 "창가까지 네 걸음, 멈춤, 마지막 1초에 커튼을 당긴다." 시간을 관찰 가능한 단위로 묶는 것이다. 쿡북의 예시 프롬프트는 행동을 이렇게 쓴다.
hljs language-text
Actions:
- The robot taps the bulb; sparks crackle.
- It flinches, dropping the bulb, eyes widening.
- The bulb tumbles in slow motion; it catches it just in time.
- A puff of steam escapes its chest.
여기서 규칙 세 개가 나온다.
한 클립에 한 행동. "여자가 카페에 들어와 앉고 노트북을 열고 타이핑한다"는 네 개의 샷이다. 한 프롬프트에 넣으면 네 행동이 하나로 뭉개진다. 4~5초짜리 클립에는 비트 하나에서 둘. 8초에는 서너 개. Sora 쿡북은 8초 한 번보다 4초 두 개를 이어 붙이는 편이 지시를 더 잘 따른다고 명시한다.
접촉점을 쓴다. 손가락이 여섯 개가 되는 곳은 대개 손의 위치를 쓰지 않은 곳이다. "손짓하며 말한다"보다 "손은 앞에 모으고"가 낫고, 무언가를 잡는다면 어느 손가락이 어디에 닿는지까지 쓴다. 물리 오류의 상당수는 묘사하지 않은 요소에서 나온다. 두 번째 태양, 추가 팔, 배경의 낯선 인물이 그렇다. 프레임 안에 있어야 할 것을 전부 쓰면 모델이 발명할 자리가 줄어든다.
감정은 보이는 행동으로. "슬프게"는 모델이 해석할 수 없다. "숨을 참는다", "시선이 카메라 너머로 올라간다", "한숨을 쉰다"는 할 수 있다. Higgsfield의 표현으로는 "느낌 대신 보이는 행동을 이름 붙여라". 다만 사례편에서 봤듯이 감정 연기를 0.5초 단위로 지시하면 기계적으로 변한다. 비트는 행동에, 감정은 흐름으로.
4. 조명은 광원·방향·색 하나씩
"분위기 있는 조명"은 지시가 아니다. 지시는 세 요소로 이뤄진다.
요소
어휘
예
광원
golden hour, blue hour, overcast softbox, harsh midday sun, single practical lamp, neon sign, headlights, window light, fluorescent overhead, monitor glow
"1980년대 사무실, 형광등과 단색 모니터의 녹색 빛"
방향
key from left, backlight / rim-lit silhouette, top light, Rembrandt (뺨에 작은 삼각형), under-lit
"warm key from overhead practical; cool spill from window"
색과 팔레트
3~5색을 이름으로: amber, cream, walnut brown / magenta and cyan / cool blue tones
"Palette anchors: amber, cream, walnut brown"
Sora 쿡북은 팔레트를 3~5색으로 못 박으면 샷 사이의 색 일관성이 유지된다고 설명한다. 여러 클립을 이어 붙이는 작업에서는 이 한 줄이 후반 색보정 시간을 줄인다. 시대와 필름 스톡은 조명과 함께 쓴다. "1970년대 로맨틱 드라마, 35mm 필름, 자연스러운 플레어와 헐레이션, 약간의 게이트 위브"처럼 룩 전체를 한 문장으로 잠근다.
5. 오디오는 문법이 있다
네이티브 오디오 모델(Veo 3.1, Kling 3.0, Seedance 2.x, MiniMax H3)에서 소리를 쓰지 않는 것은 믹스를 운에 맡기는 것이다. 모델마다 문법이 조금 다르다.
모델
대사
효과음·배경음
Veo 3.1
따옴표. A woman says, "We have to leave now."
SFX: thunder cracks in the distance / Ambient noise: the quiet hum of a starship bridge
Sora 2 (쿡북)
산문 아래 별도 블록. Dialogue: 다음 줄에 - Woman (laughing): "..."
Background Sound: 블록. "No added score"처럼 없는 것도 명시
Kling 3.0
인물 라벨 + 톤. [Character A: Mom, fast urgent voice]: "Shoes on!" 대명사 금지, 라벨 일관
장면 묘사 안에 산문으로. 겹침 방지는 "Immediately", "Pause", "Suddenly"
공통 규칙은 세 개다. 대사는 한 클립에 몇 문장. 짧고 자연스럽게. 화자 라벨을 일관되게. "그녀"가 아니라 이름이나 역할. 언어를 선언한다. 한국어 대사는 "in Korean"을 쓰고 한글로 적는다. Kling 3.0은 한 장면 안의 언어 전환까지 지원하지만, 선언하지 않으면 모델이 고른다.
6. 입력 방식이 바뀌면 문장이 바뀐다
같은 장면이라도 텍스트만 넣는지, 이미지를 넣는지, 첫 프레임과 끝 프레임을 넣는지, 레퍼런스를 넣는지에 따라 프롬프트가 해야 할 일이 달라진다. 이 구분을 모르면 이미지에 이미 있는 것을 다시 묘사하다 원본과 충돌한다.
입력
프롬프트가 할 일
하지 말 것
Text-to-Video
여섯 층 전부. 시각 묘사 + 움직임 묘사
층을 건너뛰기. 건너뛴 층은 모델이 결정한다
Image-to-Video
움직임만. "The camera [이동] as the subject [행동]." 그리고 무엇을 고정할지: 얼굴, 제품 형태, 로고, 의상, 배경, 프레이밍
이미지의 외형을 다시 설명하기. 텍스트가 이미지와 경쟁한다
첫 프레임 + 끝 프레임
두 프레임 사이의 카메라 경로와 행동. Veo 예시: "카메라가 180도 아크로 정면에서 시작해 무대 뒤 POV로 끝난다"
서로 다른 장면의 두 이미지. Kling은 차이가 크면 "샷 전환"으로 해석하고, 5초 이내를 권한다
레퍼런스 (Ingredients / Elements / @참조)
파일마다 역할 하나를 선언. "Using the provided images for the detective, the woman, and the office setting, create a medium shot of..."
한 레퍼런스에 얼굴·공간·조명·모션 역할을 전부 맡기기. [문법편](/blog/video-model-prompt-guide-2026)의 역할 잠금 참조
Image-to-Video에서 움직임이 과하면 "subtle", "slow"로 톤을 낮춘다. 여러 피사체가 다르게 움직여야 하면 위치 언어를 쓴다. "왼쪽 인물은 앞으로 걷고, 오른쪽 인물은 가만히 있는다." Runway는 가장 중요한 움직임 하나로 시작해 필요할 때만 더하라고 권한다. 그래야 무엇을 더했을 때 결과가 어떻게 바뀌는지 알 수 있다.
첫 프레임과 끝 프레임은 클립을 이어 붙이는 데도 쓴다. 앞 클립의 마지막 프레임을 다음 클립의 첫 프레임으로 넣으면 컷이 자연스럽게 이어진다. 프레임 자체는 이미지 모델로 먼저 만든다. Veo 가이드는 Gemini의 이미지 모델로 시작·끝 프레임과 레퍼런스를 만든 뒤 Veo에 넣는 흐름을 표준 워크플로우로 제시한다.
7. 길이 다이얼: 얼마나 자세히 쓸 것인가
Sora 쿡북의 문장이 정확하다. "자세한 프롬프트는 통제와 일관성을 주고, 가벼운 프롬프트는 창의적 결과의 여지를 연다." 둘 중 하나가 정답이 아니다. 목적에 따라 다이얼을 돌린다.
한 생성에 여러 샷. Veo 3.1 8초, Seedance 2.5 30초. 빈 구간을 남기지 않는다
멀티샷 라벨
Shot 1 / Shot 2 ... 샷마다 프레임·피사체·움직임
Kling 3.0 최대 6컷 15초. 샷마다 카메라 무브 하나씩
타임스탬프 방식의 Veo 공식 예시는 이렇게 생겼다.
hljs language-text
[00:00-00:02] Medium shot from behind a young female explorer with a leather satchel
and messy brown hair in a ponytail, as she pushes aside a large jungle vine to reveal a hidden path.
[00:02-00:04] Reverse shot of the explorer's freckled face, her expression filled with awe
as she gazes upon ancient, moss-covered ruins in the background.
SFX: The rustle of dense leaves, distant exotic bird calls.
[00:04-00:06] Tracking shot following the explorer as she steps into the clearing
and runs her hand over the intricate carvings on a crumbling stone wall.
[00:06-00:08] Wide, high-angle crane shot, revealing the lone explorer standing small
in the center of the vast, forgotten temple complex. SFX: A swelling, gentle orchestral score begins.
구간마다 프레임 크기, 카메라, 행동, 소리가 한 번씩 있고, 인물 묘사는 첫 구간에서 잠근다. 30초에 사건 열 개를 넣으면 인물과 물리가 무너진다. 핵심 비트는 5~8개.
해상도도 다이얼이다. 높은 해상도는 디테일·질감·조명 전환을 더 정확히 만들고, 낮은 해상도는 정보를 압축해 뭉개진다. 탐색은 낮게, 마감은 높게.
8. 네거티브: "없다"고 쓰지 말고 없는 상태를 묘사한다
Veo 가이드의 예가 정확하다. "no man-made structures"가 아니라 "a desolate landscape with no buildings or roads". 부정어 하나보다 부재 상태를 구체적으로 그리는 편이 낫다. Runway도 "원하지 않는 것보다 원하는 것을 묘사하라"고 못 박는다.
전용 네거티브 필드가 있는 도구(Runway, Kling)에서는 필드에 쓴다. 커뮤니티에서 표준처럼 쓰는 문자열은 이렇다.
hljs language-text
no text overlay, no watermark, no distortion, no extra limbs, no glitch artifacts
여기에 작업별로 "no additional people", "no logos", "no camera cuts"(POV·원테이크)를 더한다. 화면 안의 글자는 2~3단어까지만 생성에 맡기고 나머지는 후편집으로 넣는다. 단어가 길어질수록 프레임 사이에서 변형된다.
9. 반복 워크플로우
같은 프롬프트를 여러 번 돌리는 것은 버그가 아니라 기능이다. Sora 쿡북의 표현이다. 한 번 돌려 판단하지 않는다.
1. 탐색
한 줄 프롬프트, 낮은 해상도, 싼 티어(Fast 모델). 같은 줄을 4회 이상. 모델이 이 장면에서 무엇을 잘하고 못하는지 본다.
2. 한 층씩
샷 카드로 확장하되 한 번에 한 층만 바꾼다. 카메라를 바꿨으면 조명은 그대로. 무엇이 결과를 움직였는지 알 수 있는 유일한 방법이다.
3. 시드 고정
시드를 지원하는 도구에서는 마음에 든 생성의 시드를 고정하고 프롬프트만 미세 조정한다. 시드가 없으면 첫 프레임을 고정해 같은 효과를 낸다.
4. 3연속 실패면 구도를 버린다
유리 다층, 빠른 카메라의 글자, 군중 공연, 복잡한 손. 약점을 밀어붙이지 말고 우회한다. 같은 메시지를 다른 구도로.
5. 마감
통한 프롬프트를 고정해 표준 티어·높은 해상도로. 4초 클립을 첫끝프레임으로 이어 붙이고, 글자·로고는 편집에서.
그리고 저장할 것은 프롬프트가 아니라 샷 카드 자체다. 모델이 바뀌면 문법은 바뀌지만 카드의 여섯 층은 그대로 옮겨 쓸 수 있다.
10. 2026년 9월의 모델 지형
작성법은 같아도 어디에 넣을지는 달라진다. 이번 달 기준으로 짧게 정리한다.
모델
강점
프롬프트에서 알아둘 것
Veo 3.1 (Google)
오디오·대사 품질, 첫끝프레임, Ingredients 레퍼런스, 타임스탬프
4·6·8초, 16:9 / 9:16. 대사는 따옴표, SFX:·Ambient: 접두어. Gemini로 프레임을 먼저 만드는 워크플로우
Sora 2의 종료는 이 글의 논지를 역설적으로 뒷받침한다. 모델은 사라져도 그 모델의 프롬프팅 가이드가 가르친 것, 즉 행동을 비트로 쓰고 대사를 블록으로 분리하고 팔레트를 세 색으로 잠그는 방법은 Veo와 Kling에서도 그대로 작동한다.
11. 템플릿과 채운 예
빈 샷 카드는 이렇다. 어떤 모델에든 이 순서로 옮겨 쓴다.
hljs language-text
[프레임 크기], [피사체: 나이·체형·의상], [행동 비트 1~3개, 접촉점 포함],
in [환경, 시간대].
Camera: [무브 하나 + 속도/시간], [앵글].
Lens: [초점거리], [심도].
Lighting: [광원], [방향], [색]. Palette: [3~5색].
Style: [시대·필름 스톡·장르 룩].
Audio: [대사 따옴표 + 언어] / SFX: [...] / Ambient: [...]
Negative: no on-screen text, no logos, no additional people.
전시장 오프닝을 위한 Text-to-Video 예. 코어닷이 실제로 쓰는 유형이다.
hljs language-text
Wide shot, a single visitor in a dark charcoal coat, standing still in the center
of a dark gallery, hands clasped behind her back. A luminous whale slowly drifts
across the far wall behind her; she tilts her head up to follow it, then takes
two steps forward in the final second.
Camera: locked-off static for 3 seconds, then a slow 4-second dolly-in toward her back, eye level.
Lens: 35mm, deep focus so the whale stays sharp.
Lighting: single source, the projected whale itself; cool blue key from behind her,
faint warm floor reflection. Palette: deep navy, cyan, pale gold, charcoal.
Style: contemporary media-art documentation, clean digital, no film grain.
Audio: Ambient: low sub-bass hum of the projection room, distant footsteps.
No music. No dialogue.
Negative: no on-screen text, no logos, no additional visitors, no camera cuts.
같은 장면을 이미지에서 시작하는 Image-to-Video 예. 이미지에 이미 있는 것은 쓰지 않는다.
hljs language-text
The camera holds static for 3 seconds, then slowly dollies in toward the visitor's back
over 4 seconds. The projected whale drifts left to right across the far wall.
The visitor tilts her head up to follow it, then takes two steps forward in the final second.
Keep her coat, the gallery walls, and the framing unchanged. Subtle motion only.
Ambient: low projection-room hum. No music. No cuts.
체크리스트
hljs language-text
□ 여섯 층이 모두 있는가 (프레임·카메라·앵글/렌즈·행동·조명·룩/오디오)
□ 카메라 무브가 한 샷에 하나이고 속도나 시간이 붙어 있는가
□ 돌리와 줌을 구분했는가
□ 행동이 비트로 쪼개져 있고 한 클립에 한두 개인가
□ 손과 접촉점의 위치를 썼는가
□ 감정을 보이는 행동으로 바꿨는가
□ 광원·방향·색이 하나씩 있고 팔레트가 3~5색인가
□ 대사는 따옴표 또는 블록, 화자 라벨 일관, 언어 선언
□ 입력 방식에 맞는 문장인가 (I2V면 움직임만 + 고정할 것)
□ 네거티브가 부재 상태 묘사 또는 전용 필드에 있는가
□ 같은 프롬프트를 4회 이상 돌렸는가, 한 층씩 바꿨는가
□ 샷 카드를 저장했는가 (프롬프트가 아니라)
마치며
이미지 프롬프트가 한 프레임을 묘사한다면, 영상 프롬프트는 그 프레임이 어떻게 변하는지를 묘사한다. 변화를 쓰는 데 필요한 어휘는 새로 발명된 것이 아니다. 촬영 현장이 백 년 동안 다듬어 온 샷 카드의 언어다. 프레임 크기, 무브, 앵글, 렌즈, 광원, 그리고 비트.
모델은 계속 바뀐다. 올해만 해도 Sora 2가 사라지고 Kling 3.0과 Seedance 2.5가 올라왔다. 하지만 이 글의 어느 규칙도 특정 모델의 것이 아니다. 쓰지 않은 것은 모델이 결정한다는 사실만 기억하면, 무엇을 써야 하는지는 샷 카드가 알려준다.