들어가며: 마법 프롬프트의 시대는 오지 않았다
전편에서 네 모델의 문법 차이를 다루며 사례편을 약속했다. 그 사이 지형이 또 움직였다. 정리하면 — Seedance 2.5와 MiniMax H3가 같은 날(7월 31일) 공개됐고, 8월 27일에는 Google의 Gemini Omni 1.1 Flash가 GA로 나왔다. 아레나 상위권의 다크호스였던 Alibaba의 HappyHorse는 6월에 1.1로 판올림되어 공식 프롬프트 저장소까지 갖췄다.
이번 편은 두 부분이다. 앞부분은 지금 공식 데모·제작 플랫폼·크리에이터 커뮤니티에서 반복 검증되고 있는 프롬프트 유형 9가지, 뒷부분은 우리가 실제 준비 중인 소재(문화도시 울산·미디어아트 전시)로 작성한 모델별 실전 프롬프트 전문이다. 결론을 미리 말하면 전편과 같다 — 모두에게 통하는 마법 프롬프트는 없고, 모델마다 써야 하는 문서의 종류가 다르다.
| 모델 | 써야 하는 문서 | 핵심 습관 |
|---|
| Seedance 2.5 | 30초짜리 촬영계획서 | 레퍼런스 직무 분리 + 시간표 + 전환의 물리적 원인 |
| MiniMax H3 | 레퍼런스 관계 그래프 | 무엇을 보존·전이·무시할지 Subject 단위로 선언 |
| Gemini Omni 1.1 Flash | 수정 대화 시나리오 | 360p 시안 → 한 턴에 한 변경 + "Keep everything else the same" |
| HappyHorse 1.1 | 짧은 단일 샷 또는 R2V 4블록 | I2V는 이미지에 있는 것을 반복하지 않기 |
제1장. 요즘 반복해서 통하는 프롬프트 유형 9가지
Higgsfield의 Seedance 가이드, ByteDance Seed 공식 예제, Alibaba Model Studio의 프롬프트 저장소, fal의 테스트 리포트에서 반복적으로 나타나는 유형이다. "전 세계 절대 순위"가 아니라 공유 사례에서 수렴한 패턴이라는 점은 미리 밝혀 둔다.
① 변신 아크 (평범함 → 위기 → 변신 → 폭발 → 평온). Seedance에서 가장 많이 복제되는 형식. 핵심은 '변신'이라는 단어가 아니라 단계적 상승 구조다 — 평범한 시작, 위협의 등장, 반응, 변형 과정, 클라이맥스, 그리고 무심한 결말. 장면을 번호로 나누고 상승 곡선을 명시할 것. 코미디·예고편·"과거의 울산 → 산업도시 → 미래도시" 같은 도시 변환에 잘 맞는다.
② 1인칭 POV·바디캠. 콜로세움 전투, 빗속 도쿄 질주, 어안렌즈 스트리트 댄스가 대표 사례. POV에서 중요한 건 보여줄 것보다 카메라가 하지 말아야 할 것이다: one continuous shot / first-person POV / no cuts / no zoom / natural head movement / camera never leaves the character's viewpoint. 반대로 cinematic dynamic camera처럼 쓰면 모델이 임의로 시점을 바꿔 POV 환상이 깨진다.
③ 3×3 스토리보드 한 장으로 6~9샷. HappyHorse 1.1의 대표 활용법. 9개 장면을 한 장의 3×3 이미지로 만들고 "왼쪽 위부터 오른쪽 아래로, 패널마다 독립된 샷으로" 지시한다. 프롬프트를 길게 쓰는 대신 인물의 얼굴·구도·제품 위치·색 흐름·이야기의 시작과 끝을 이미지로 먼저 고정하는 게 요점이다. Seedance도 촬영 대본·인물·공간·소품을 분리 참조하는 공식 예제를 제공한다.
④ 초고속 액션은 형용사가 아니라 물리로. 나쁜 예: "두 사람이 매우 멋지고 역동적으로 싸운다." 좋은 예: "첫 번째 파이터가 수평으로 휘두른다. 두 번째가 칼날 아래로 숙인다. 왼발이 젖은 바닥에서 회전한다. 팔꿈치를 가슴에 꽂는다. 카메라는 측면 트래킹, 임팩트 순간에만 스피드 램프." — 누가 어느 방향으로 움직여 무엇과 접촉하는지를 쓴다. epic, insane, masterpiece는 도움이 안 된다.
⑤ 원테이크 공간 이동. Seedance 2.5가 미는 형식. 대기실 → 복도 → 무대 → 관객석을 끊김 없이 통과하는 30초. 단순히 길게 찍는 게 아니라 도입·전개·전환·결말을 30초 안에 배치하는 설계다.
⑥ 오클루전(가림막) 전환. 옷자락·기둥·연기·문·지나가는 사람의 등이 화면을 잠깐 가리는 순간 다음 공간으로 넘어간다. seamless transition이라고만 쓰면 공간이 녹아버린다 — 전환의 물리적 원인을 쓴다: "그녀의 코트가 렌즈를 쓸며 프레임을 완전히 덮는다. 이 자연스러운 가림 동안 빗속 거리는 빛나는 갤러리로 바뀐다. 카메라는 같은 방향·같은 속도로 계속 움직인다."
⑦ 제품 매크로·재질 변형·ASMR. 회전을 넘어 표면에 물방울이 맺히고 재료가 분해·조립되는 형식. Seedance 2.0은 긁기·두드리기·버블랩 같은 ASMR 동작과 음향을 한 프롬프트에 결합한 공식 예제를 공개했다.
⑧ 패션 스캔·UGC 세로형. 9:16 vertical / 3 or 4 shots / one simple dialogue exchange / head-to-toe camera scan / final product pose. 제품명·가격 같은 정확한 텍스트는 생성에 맡기지 말고 후편집으로.
⑨ 클레이 렌더 프리비즈 → 완성 영상. Seedance 2.5의 가장 제작지향적인 신기능. Blender/Unreal로 재질 없는 클레이 렌더를 만들어 인물 위치·카메라 경로·조립 순서를 설계하고, 별도 이미지에서 재질·분위기를 가져온다: "@Video 1 = 클레이 렌더의 카메라·공간·블로킹만. @Image 1 = 최종 재질·조명만. 회색 클레이 외관은 재현하지 마라." 전시·미디어아트의 프리비즈 워크플로와 정확히 맞물린다.
제2장. 사례 A — Seedance 2.5, 30초 원테이크 촬영계획서
전편에서 다룬 문법(타임스탬프·사운드 브래킷)을 실전 규모로 확장한 사례다. 소재는 반구천 암각화에서 산업도시를 지나 미래 울산으로 이어지는 30초 원테이크. 구조는 일곱 섹션 — 사양 → 레퍼런스 맵 → 전역 시각 언어 → 샷 타임라인 → (카메라 규칙) → 오디오 설계 → 연속성 잠금이다.
hljs language-text
[VIDEO SPECIFICATIONS]
30 seconds, 16:9, 24fps, photorealistic cinematic video.
One continuous camera journey with invisible transitions.
No subtitles and no visible text.
[REFERENCE MAP]
@Image 1 = exact identity and clothing of the lead visitor.
@Image 2 = Bangudae petroglyph stone texture and carved animal patterns.
@Image 3 = industrial waterfront architecture.
@Image 4 = luminous future forest and ecological city.
@Image 5 = final panoramic composition.
@Video 1 = camera speed and smooth gimbal movement only.
@Audio 1 = river, wind, and forest ambience.
@Audio 2 = restrained orchestral rhythm and climax timing.
[GLOBAL VISUAL LANGUAGE]
Realistic Korean landscape, subtle blue-black shadows,
warm skin tones, physically accurate reflections.
Preserve the visitor's exact face, hair, clothing, age,
and body proportions throughout the entire video.
[0-5s] A close tracking shot follows the visitor's fingers moving
over the petroglyph stone from @Image 2.
Audio: fingertip friction, quiet river water, distant wind.
[5-11s] The carved whale line begins to emit a faint blue light.
The camera pulls back smoothly to reveal the full rock surface.
[11-18s] The glowing whale crosses directly in front of the lens,
fully covering the frame. During the natural occlusion,
the rock texture transforms into the steel surface of the
industrial waterfront from @Image 3.
The camera continues forward at the same speed.
[18-25s] Cranes, pipes, and reflections gradually separate into thin
streams of light, then reorganize into the future forest
from @Image 4. Slow, stable half-orbit around the visitor.
[25-30s] The camera rises and pulls back into the panoramic
composition from @Image 5. The music reaches a restrained
climax, then leaves only river sound.
[CONTINUITY LOCKS]
No facial drift, no wardrobe change, no extra visitors,
no abrupt cut, no floating architecture, no malformed hands,
no subtitles, no logos.
읽는 포인트는 넷이다.
- 레퍼런스 직무가 전부 "only"로 좁혀져 있다. 30장까지 받는다고 많이 넣는 게 아니다 — 역할이 겹치면 모델이 무엇을 우선할지 모른다. 실무에서는 우선순위까지 선언하면 더 안정적이다: "1. @Image 1의 인물 정체성은 정확히 보존. 2. @Image 3의 공간 배치가 2순위. 3. @Video 1의 카메라 리듬은 충돌 시 조정 가능."
- 30초를 5개 비트로 제한했다. 10개 이상의 사건을 넣으면 각각이 얕아진다. 구간마다 "화면 크기 + 피사체 행동 + 카메라 행동 + 핵심 음향" 네 요소만.
- 두 번의 공간 전환 모두 물리적 원인이 있다. 고래가 렌즈를 가리는 오클루전(11초), 구조물이 빛의 흐름으로 분해·재조립(18초). 그리고 전환 후에도 "카메라는 같은 방향·같은 속도" — 이 한 줄이 원테이크의 환상을 지킨다.
- 마지막은 잠금 목록. 지시의 절반은 "무엇을 하지 마라"가 아니라 "무엇이 변하면 안 되는가"다.
특정 구간만 고칠 때는 전체를 다시 쓰지 않는다. Seedance 2.5의 편집 프롬프트는 바꿀 것과 잠글 것의 분리가 전부다:
hljs language-text
Edit @Video 1.
EDIT TARGET: Change only the camera movement between 00:08 and 00:15.
NEW CAMERA: At 00:08, begin a low-angle tracking shot near the floor.
Rise to chest height by 00:12, then a stable 90-degree arc.
PRESERVE EXACTLY: character identity, actions, timing, environment,
lighting, sound, and visual style. No new cuts, objects, or people.
제3장. 사례 B — MiniMax H3, 관계 그래프와 한국어 대사
H3는 다섯 가지 모드(T2VA·I2VA·FL2VA·L2VA·Ref2VA)를 구분하고, 속도 중심의 H3 Max는 T2V·I2V만 지원한다. 기본 모드의 공식 구조는 3필드 — 화면·동작·대사를 시간 순서로 쓰는 integrated_multimodal_description, 환경음·물리음을 정리하는 overall_soundscape, 관객만 듣는 음악을 분리하는 non_diegetic_music이다. 음악·환경음·대사를 한 문단에 섞으면 모델이 어떤 소리가 화면 안에서 나는지 판단하기 어려워지기 때문에 이 분리가 문법의 핵심이다.
hljs language-text
integrated_multimodal_description:
[Shot 1] Live-action, cinematic. A medium-wide shot frames a Korean
visitor in front of a dark media-art wall. Thin carved whale lines
begin glowing across the stone. The camera pushes in with small
amplitude at slow speed. The calm Korean woman with a clear,
restrained voice (S1) says softly:
<d>[Korean] 백 년 뒤의 숲은 어떤 모습일까요?</d>
[Shot 2] At 00:06.500, cut to a close-up of the blue whale light
reflected in her eyes. The light separates into particles and
reveals a future forest growing through an industrial waterfront.
[Shot 3] At 00:10.500, cut to a wide shot. The visitor stands
between the whale and the forest as the camera slowly pulls out.
overall_soundscape:
Quiet gallery room tone, soft footsteps, low friction of projected
stone lines. A distant river and deep underwater resonance emerge
as the forest appears.
non_diegetic_music:
Sparse piano at a slow tempo, low strings from 00:07, restrained
peak at 00:13, fading before the final frame.
주목할 문법 세 가지.
- 카메라는 "종류 + 범위 + 속도"로 쓴다. "The camera pushes in with small amplitude at slow speed" —
push in과 zoom in, 회전하는 pan과 수평 이동하는 truck을 구분하고, 변화 범위와 속도를 붙인다. dynamic camera는 금지어에 가깝다.
- 대사는
<d>[언어] …</d> + 화자 ID. H3는 한국어를 포함한 11개 언어 대사를 공식 지원한다 — 현재 한국어 대사 품질에서 가장 유리한 선택지 중 하나다. 기술 지시는 영어로, 대사만 원문으로.
- 레퍼런스 모드(Ref2VA)는 6섹션.
subject_definitions / summary / retention_analysis / detailed_description / overall_soundscape / non_diegetic_music. 백미는 retention_analysis — 레퍼런스마다 보존 수준을 선언한다: <Subject 1>: fully_preserved, <Video 1> camera rhythm: weak_reference. <Subject N>이 파일이 아니라 "레퍼런스에서 추출한 재사용 단위"라는 점도 중요하다. 한 영상에서 인물과 카메라를 서로 다른 역할로 나눌 수 있다.
워크플로는 해상도 계단이다: 768p로 시안 → 인물·동작·텍스트 확인 → 승인된 것만 2K 재생성. H3의 2K는 단순 업스케일이 아니라 원본 컨텍스트를 다시 읽는 재생성(Regenerate-2K)이라 세부가 복원된다. 가격은 768p 초당 0.08달러, 2K 초당 0.13달러, 재생성은 초당 0.05달러(2026년 8월 공식 기준).
!
한국 사용자 주의 — H3 오픈 웨이트 라이선스
H3는 오픈 웨이트지만 2026년 8월 2일자 Community License는 적용 제외 지역으로 EU·영국·미국과 함께 대한민국을 명시한다. 국내에서 가중치를 내려받아 자체 서비스·온프레미스로 배포하려면 별도 라이선스 협의가 필요하다. API 사용은 별도 약관 기준. 연매출 2,000만 달러 초과 상용 제품도 사전 승인 대상이다. Context-IR과 Regenerate-2K 내부 구현은 비공개(API 제공)라는 점도 함께 알아둘 것.
제4장. 사례 C — Gemini Omni 1.1 Flash, 수정 대화 체인
Omni에 Seedance식 30초 계획서를 넣는 건 좋은 사용법이 아니다. 이 모델의 정체는 대화형 영상 편집기다 — 3~10초를 360p/720p로 빠르게 만들고(1080p·4K는 업스케일), 이전 interaction을 유지한 채 자연어로 한 요소씩 고치고, 최대 40초까지 뒤로 연장한다.
실전은 프롬프트 한 방이 아니라 턴 설계다:
1차 생성
"A continuous 10-second shot of a visitor walking through a dark gallery. A luminous whale appears behind her. Deep blue lighting, no dialogue." — 기본값이 멀티숏이므로 원테이크면 반드시 "single unbroken shot, no scene cuts"를 명시.
2~4차 수정
"Make the visitor's clothing a dark teal jacket. Keep everything else the same." → "Slow the camera movement by approximately 30 percent. Keep everything else the same." → "Add soft river ambience beneath the existing sound. Keep all visual elements unchanged." — 한 턴에 하나만. 원본을 다시 장황하게 설명하면 그 요소까지 재생성 대상이 된다.
5차 연장
"Extend this video. The same visitor reaches the main hall. The camera continues in the same direction." — 연장은 뒤에만 붙고, 마지막 10초가 컨텍스트가 되며, 연장 프롬프트의 '0초'는 새 구간의 시작이다.
세 가지 함정만 기억하자. ① store=false로 생성하면 이후 수정 대화가 불가능하다 — 반복 수정할 영상은 interaction을 저장할 것. ② 레퍼런스는 <FIRST_FRAME>(시작 프레임 원본)과 <IMAGE_REF_0>(외형 참조)를 구분해서 태그해야 이미지가 의도치 않게 첫 프레임으로 쓰이는 사고를 막는다. ③ 별도 오디오 레퍼런스 업로드와 음성만 교체하는 편집은 아직 지원하지 않고, 안정적으로 평가된 언어는 영어다 — 한국어 내레이션은 후반 더빙이 안전하다.
I2V에서도 원칙은 같다. "Make this image move"가 아니라 — "머리카락이 실내 기류에 살짝 움직인다. 시선이 카메라에서 고래로 옮겨간다. 카메라는 아주 느린 달리 인. 건축과 얼굴은 변하지 않는다."
제5장. 사례 D — HappyHorse 1.1, 스토리보드의 모델
Alibaba의 HappyHorse는 짧은 단일 샷과 구조화된 스토리보드 양쪽에 강하다. fal이 수백 개 프롬프트로 테스트한 가이드의 단일 샷 공식은 단순하다: [주체] + [보이는 행동] + [장소·시간] + [촬영 지시 하나] + [오디오], 약 20단어 내외. 긴 프롬프트는 얼굴·손·보행에 갈 표현력을 분산시킨다(1.0 기준 관찰이므로 1.1에서는 출발점으로만).
I2V의 제1원칙은 이미지에 이미 있는 것을 반복하지 않는 것이다. 인물의 나이·헤어·옷·배경을 다시 쓰면 정지 이미지 보존과 텍스트 지시가 충돌한다. 공식 권장은 "동작 + 카메라 + 오디오"만, 30~60자 수준.
R2V는 4블록 구조다 — 레퍼런스 선언, 스타일·캐릭터 카드, 스토리보드, 전역 제약. 레퍼런스는 [Image 1]처럼 Image와 숫자 사이에 공백(API 문서와 동일 형식, 1~9장). 3×3 스토리보드 사례의 뼈대만 보면:
hljs language-text
[Image 1] is a 3x3 storyboard sheet.
[Image 2] is the lead visitor.
[Image 3] is the exhibition-space reference.
Follow [Image 1] strictly from left to right and top to bottom.
Treat each panel as one independent shot and generate a continuous
sequence.
SHOT ORDER
Panel 1: Exterior wide shot of the venue at dusk.
Panel 4: A petroglyph line slowly becomes a luminous whale.
Panel 9: Wide ending shot — the visitor surrounded by layered images
of past, industry, ecology, and future.
GLOBAL CONSTRAINTS
Preserve [Image 2] face, hair, body proportions, and clothing.
Smooth natural transitions between panels.
No subtitles, no panel numbers, no added visitors.
미묘하지만 중요한 규칙 둘. 타임코드는 공간·광고에 쓰고 감정 연기에는 줄인다 — HappyHorse 1.1은 수치를 매우 문자 그대로 수행하므로, 제품 위치·동선·8컷 순서에는 타임코드가 강력하지만 망설임·눈물 같은 미세 연기에는 "2초 동안 멈춘다"보다 "말을 꺼내기 어려워하며 천천히 숨을 삼킨다"가 낫다. 그리고 카메라는 별도 문단으로 — 연기 설명에 카메라 지시를 섞으면 간섭하고, 고정 카메라를 선언했다면 다른 문단에 push 같은 상충 표현을 넣지 말 것.
제6장. 실패 유형 8 — 무엇이 망치는가
| 실패 방식 | 무엇이 잘못되나 | 개선 |
|---|
| 수식어 10개 반복 (epic, stunning…) | 핵심 동작·구도가 약해짐 | 조명·렌즈·동작 한두 개만 구체적으로 |
| "first, then, then…" 긴 산문 | 여러 행동이 한 동작으로 뭉침 | 타임코드 또는 Shot 1·2·3으로 분리 |
| I2V에서 이미지 외형 재설명 | 원본 이미지와 텍스트 충돌 | 동작·카메라·소리만 작성 |
| 한 레퍼런스에 얼굴·공간·조명·모션 역할 전부 | 무엇을 따라야 할지 모호 | 레퍼런스별 역할 한 줄 선언 + "only" |
| 감정 연기를 0.5초 단위로 지시 | 기계적이고 부자연스러움 | 감정의 흐름을 자연어로 |
| "dynamic camera"만 작성 | 모델이 임의로 컷·줌 추가 | 이동 방향·높이·속도·종료 구도 명시 |
| 긴 문장·로고를 영상 안에서 생성 | 글자 변형·오탈자 | 2~3단어만 시도, 나머지는 후편집 |
| 30초에 사건 10개 이상 | 인물·물리·공간 일관성 저하 | 핵심 비트 5~8개로 제한 |
Seedance 2.5 공식 발표조차 복잡한 운동의 물리적 타당성과 다중 인물 상호작용에는 개선 여지가 있다고 인정한다. 이미지 프롬프트의 원칙이 그대로 적용된다 — 약점은 밀어붙이지 말고 우회하라.
제7장. 한국어 콘텐츠와 모델 라우팅
한국어 작업의 안전한 조합은 모델을 불문하고 같다: 촬영·행동·카메라·조명 지시는 영어, 한국어 대사만 따옴표(또는 H3의 <d>[Korean]) 안에, 고유명사는 영·한 병기, 화면 텍스트는 생성하지 않고 후편집. 대사 품질은 짧은 문장부터 A/B로 검증한다. 프롬프트 입력이 다국어를 받는 것과 해당 언어 음성·립싱크 품질이 보장되는 것은 별개의 문제다 — 현재 한국어 대사를 공식 지원 목록에 명시한 것은 H3다.
제작 단계별 라우팅을 표로 정리하면:
| 제작 단계 | 우선 모델 | 이유 |
|---|
| 아이디어 빠른 확인 | Omni 360p · H3 Max | 낮은 비용, 빠른 반복 |
| 2~10초 정밀 I2V 모션 | Runway Gen-4.5 | 이미지 외형 유지 + 모션 중심 지시 |
| 10~15초 제품·브랜드 광고 | MiniMax H3 | 정밀 레퍼런스, 2K, 텍스트 |
| 한국어 대사 포함 숏 | MiniMax H3 | 한국어 공식 지원 명시 |
| 캐릭터·소품 여러 장면 유지 | Kling 3.0 Omni | Element 단위 캐릭터 라이브러리 |
| 20~30초 이야기·원테이크 | Seedance 2.5 | 장시간 생성, 대규모 레퍼런스 |
| 기존 영상의 부분 수정 | Gemini Omni 1.1 Flash | 한 요소씩 대화로 수정 |
| 제품 뷰티샷·HDR | Luma Ray3.14 | 네이티브 1080p·HDR·EXR |
| 텍스트·로고·법적 고지 | Premiere · Resolve | 생성 모델보다 정확함 |
곁가지로 배울 것 둘. Kling 3.0 Omni는 인물·소품을 Element로 등록해 장면마다 역할만 지정하는 방식 — Seedance의 "파일 역할"에서 한 발 더 나간 재사용 가능한 등장인물 라이브러리다. Luma Ray3.14의 공식 필드 가이드는 "begins to run"보다 "running"(현재 진행형), 머리카락·물결 같은 2차 물리 반응 서술을 권하며, vibrant, whimsical, hyper-realistic 같은 수식어가 오히려 결과를 악화시킬 수 있다고 명시한다 — 공식 문서가 금지 수식어를 지목하는 시대다.
마치며: 프롬프트가 아니라 브리프를 저장하라
네 모델의 문법을 오가며 얻은 마지막 교훈은 이것이다. 모델별 프롬프트를 자산으로 저장하면 모델이 바뀔 때마다 전부 버려진다. 저장할 것은 모델 중립적인 제작 브리프 — 레퍼런스와 역할, 샷 타임라인(시작·끝·피사체 행동·카메라 행동·음향), 잠금 목록, 제외 목록 — 이고, 모델별 문법으로의 변환은 어댑터의 일이다. Seedance에는 촬영계획서로, H3에는 3필드/6섹션으로, Omni에는 초기 생성 + 수정 턴 계획으로 컴파일하는 식이다.
우리는 이 구조를 AI 놀이터의 영상 파이프라인에 적용하는 실험을 시작했다. 텍스트 프롬프트에서 Practice Profile이 했던 역할 — 휘발되는 프롬프트를 영속하는 파일로 — 을 영상에서는 제작 브리프가 맡는 셈이다. 결과가 쌓이면 생성 영상과 함께 3편에서 공개하겠다.
마지막으로 한 가지. 실제 인물의 얼굴·목소리, 유명 배우, 기존 IP를 레퍼런스로 쓸 때는 동의와 이용권한을 확인해야 한다. ByteDance는 공식 예제 인물이 AI 생성 또는 적법 허가 소재임을 밝히며 실제 인물 초상에는 신원 확인·사전 승인을 요구하고, Seedance 2.0은 유명인·저작권 캐릭터 영상 논란으로 보호장치를 강화하고 글로벌 출시 일정까지 조정한 전례가 있다. 프롬프트 실력보다 먼저 갖춰야 할 것은 소재의 권리다.