첫 번째 클립은 아주 잘 나왔습니다. 형사는 회색 트렌치코트에 짧은 검은 머리, 한쪽 눈썹 위에 흉터가 있습니다. 그런데 두 번째 클립을 생성하니 코트는 갈색이 되고, 머리는 길어지고, 흉터는 사라졌습니다. 다섯 번째 클립쯤 되면 직업만 같은 다섯 명의 다른 사람이 화면에 등장합니다.
모든 생성은 백지 상태에서 시작합니다. 모델은 이전 클립을 기억하지 못하기 때문에, 고정해 두지 않은 부분은 매번 새로 지어냅니다. 해결책은 고정할 수 있는 것을 최대한 고정하는 것입니다. 텍스트로, 이미지로, 그리고 모델이 지원한다면 시드로요. 이 가이드는 각 방법을 사용해야 하는 순서대로 설명합니다.
클립마다 캐릭터가 달라지는 이유
AI 영상 모델은 프롬프트를 읽고, 비어 있는 부분을 모두 자기 나름의 추측으로 채웁니다. "재킷을 입은 젊은 여성"이라는 표현에는 빈칸이 수십 개나 있습니다. 나이, 얼굴형, 머리카락, 재킷의 색과 디자인, 피부에 떨어지는 빛까지요. 새로 생성할 때마다 이 빈칸은 다르게 채워집니다.
그래서 일관성의 핵심은 빈칸을 줄이는 것입니다. 모델에게 맡기는 선택이 적을수록 캐릭터가 바뀔 여지도 줄어듭니다. 이를 위한 도구는 세 가지입니다.
- 텍스트: 토씨 하나 바꾸지 않고 재사용하는 고정 설명문.
- 이미지: 캐릭터가 정확히 어떻게 생겼는지 모델에게 보여 주는 레퍼런스 프레임.
- 시드: 시드를 받는 모델에서 무작위 시작점을 똑같이 재현하는 숫자.
가능한 경우에는 세 가지를 모두 사용하세요.
1단계: 캐릭터 시트 작성하기
무엇이든 생성하기 전에 짧은 캐릭터 시트부터 작성하세요. 캐릭터를 고정적이고 구체적인 표현으로 묘사한 텍스트 블록입니다. 이 시트를 수정 없이 모든 프롬프트에 붙여 넣게 됩니다.
좋은 캐릭터 시트는 네 가지 영역을 다룹니다.
얼굴과 체형
나이대, 얼굴형, 피부톤, 눈 색, 머리 색, 머리 길이, 헤어스타일, 체격, 그리고 눈에 띄는 특징 한두 가지. 흉터, 주근깨 패턴, 동그란 은테 안경 같은 요소는 모델이 반복할 구체적인 디테일이 되고, 캐릭터가 달라졌는지 빠르게 확인하는 기준도 됩니다.
의상
각 아이템의 이름, 색상, 소재를 적으세요. "머스터드 옐로 울 비니, 황동 단추가 달린 네이비 캔버스 워크 재킷, 흰색 티셔츠"는 "캐주얼한 옷"보다 훨씬 안정적인 결과를 냅니다.
목소리와 태도
오디오가 포함된 클립을 생성한다면 목소리를 묘사하세요. 음높이, 말의 속도, 억양, 분위기를 적습니다. "약간 허스키하고 차분한 낮은 목소리, 천천히 말함"이라고 쓰면 모든 클립이 같은 목표를 갖게 됩니다. 목소리를 나중에 편집 단계에서 넣을 거라면 이 부분은 영상 프롬프트에서 빼세요.
스타일
캐릭터가 사는 세계의 비주얼 톤입니다. 실사, 3D 애니메이션, 아니메, 필름 그레인, 컬러 그레이드 등이죠. 스타일이 달라지면 같은 캐릭터도 다른 인물처럼 보입니다.
캐릭터 시트 예시
MAYA: a woman in her early thirties with an oval face, warm brown skin, dark brown eyes, and shoulder-length black curly hair tied back with a red scrunchie. Small gold hoop earrings. Thin silver scar across her left eyebrow. She wears a mustard-yellow wool beanie, a navy canvas work jacket with brass buttons, and a plain white t-shirt. Calm, low voice with a slight rasp; she speaks slowly and smiles with one side of her mouth. Realistic cinematic style, soft natural light, gentle film grain.
AI 영상 모델은 영어 프롬프트에 가장 잘 반응하므로 예시 프롬프트는 영어로 두었습니다. 내용은 30대 초반 여성 마야의 얼굴, 머리, 액세서리, 흉터, 의상, 목소리, 화면 스타일을 묘사한 것입니다.
시트는 예시처럼 짧은 한 문단으로 유지하세요. 너무 빈약하면 빈칸이 남고, 너무 길면 핵심 디테일이 장면 설명에 묻혀 버립니다.
2단계: 같은 문구를 그대로 재사용하기
시트를 작성한 뒤 가장 흔히 하는 실수는 내용을 바꿔 말하는 것입니다. 첫 번째 클립에서는 "mustard-yellow beanie"라고 쓰고, 두 번째 클립에서는 "yellow knit hat"이라고 쓰는 식이죠. 여러분에게는 같은 모자지만, 모델에게는 결과가 다른 두 개의 프롬프트입니다.
재사용 규칙은 다음과 같습니다.
- 시트를 복사해서 붙여 넣으세요. 기억에 의존해 다시 타이핑하지 마세요.
- 순서를 지키세요. 모든 프롬프트의 맨 앞에 캐릭터 시트를 두고, 그 뒤에 장면과 동작을 추가하세요.
- 장면만 바꾸세요. 장소, 동작, 카메라 움직임은 클립마다 달라집니다. 캐릭터 텍스트는 바뀌지 않습니다.
시트를 재사용한 프롬프트 예시
MAYA: a woman in her early thirties with an oval face, warm brown skin, dark brown eyes, and shoulder-length black curly hair tied back with a red scrunchie. Small gold hoop earrings. Thin silver scar across her left eyebrow. She wears a mustard-yellow wool beanie, a navy canvas work jacket with brass buttons, and a plain white t-shirt. Realistic cinematic style, soft natural light, gentle film grain.
Scene: Maya stands at a food truck window on a rainy evening and hands a paper cup of coffee to a customer. Medium shot, slow push in. She says, "Careful, it's hot." Rain on the metal roof, quiet street ambience.
MAYA: (same sheet, pasted word for word)
Scene: Early morning. Maya unlocks the side door of the food truck and steps inside, switching on a string of warm lights. Wide shot from across the street, camera static. No dialogue. Birds and distant traffic.
첫 번째 프롬프트는 비 오는 저녁 푸드트럭 창구에서 커피를 건네는 장면, 두 번째는 이른 아침 푸드트럭 문을 여는 장면입니다.
실제 프롬프트에서는 "same sheet" 자리에 시트 전체를 붙여 넣으세요. 위의 자리 표시는 이 글의 분량을 줄이기 위한 것일 뿐입니다.
3단계: 레퍼런스 이미지로 외모 고정하기
레퍼런스 이미지는 텍스트보다 강력한 기준점입니다. 모델이 얼굴을 상상하는 대신 직접 볼 수 있기 때문입니다.
작업 흐름은 이렇습니다.
- 대표 이미지 한 장을 만드세요. 이미지 생성 도구로 캐릭터를 만들거나, 사용 권한이 있는 사진을 쓰세요. 얼굴과 의상이 전부 보이고, 정면을 향하며, 조명이 고른 선명한 프레임을 고르세요.
- 각 클립의 첫 프레임으로 사용하세요. 이미지-투-비디오 방식으로 생성합니다. veo4.dev에서는 Veo 4의 선택형 레퍼런스 이미지가 클립의 시작 프레임이 됩니다. Kling 3.0, Seedance 2.0, Wan 2.6은 선택적으로 첫 프레임을 받을 수 있고, Wan AI 2.2는 항상 여러분이 제공한 이미지에서 시작합니다.
- 그래도 프롬프트에 캐릭터 시트는 넣어 두세요. 이미지는 첫 프레임을 고정하고, 텍스트는 클립이 그 프레임에서 멀어지는 동안 캐릭터를 안정적으로 유지해 줍니다.
첫 프레임과 마지막 프레임
일부 모델은 첫 프레임과 마지막 프레임을 모두 받습니다. veo4.dev에서는 Veo 3.1과 MiniMax H3에 두 입력란이 모두 있습니다. 모델이 여러분이 고른 프레임에 도달해야 하므로 일관성 유지에 매우 유용합니다. 두 프레임에 같은 캐릭터가 있으면 클립의 기준점이 하나가 아니라 두 개가 됩니다.
실전 팁 하나: 마음에 드는 클립의 마지막 프레임을 저장해 다음 클립의 첫 프레임으로 쓰세요. 그러면 캐릭터가 한 샷에서 다음 샷으로 자연스럽게 이어집니다.
정면, 3/4 측면, 전신 이렇게 작은 레퍼런스 라이브러리를 만들어 두세요. 새 샷마다 가장 가까운 것을 고르고, 얼굴이 잘리지 않도록 이미지 비율을 클립 비율과 맞추세요.
이미지-투-비디오 옵션이 더 궁금하다면 이미지-투-비디오 페이지를 참고하세요.
4단계: 모델이 지원하면 시드 활용하기
시드는 모델이 무작위 시작점으로 사용하는 숫자입니다. 시드를 지원하는 모델이라면 같은 프롬프트, 같은 설정, 같은 시드로 매우 비슷한 결과를 얻을 수 있습니다.
veo4.dev에서는 Happy Horse 1.0과 Wan AI 2.2에서 시드가 모델에 전달됩니다. 입력란은 고급 설정에 있습니다.
일관성을 위해 시드를 쓰는 방법은 다음과 같습니다.
- 무작위 시드로 몇 가지 버전을 생성합니다.
- 캐릭터가 마음에 드는 버전을 찾아 그 시드를 기록합니다.
- 다음 클립에도 그 시드를 재사용하고, 프롬프트에서는 장면 부분만 바꿉니다.
시드는 같은 캐릭터와 장소에서 동작이나 앵글만 다른 작은 변화에 가장 효과적입니다. 장면 텍스트를 크게 바꾸면 같은 시드를 써도 결과가 크게 달라집니다. 다른 모델에서는 캐릭터 시트와 레퍼런스 이미지에 의존하세요.
5단계: 작은 차이를 가려 주는 샷 구성하기
위의 방법을 모두 써도 미세한 변화는 생길 수 있습니다. 샷을 잘 구성하면 그런 변화를 훨씬 알아차리기 어렵게 만들 수 있습니다.
- 샷 크기를 다양하게 바꾸세요. 와이드 샷에서 클로즈업으로 넘어가면 관객은 프레임이 바뀌리라 예상하기 때문에 의상의 작은 차이가 묻힙니다.
- 조명을 통일하세요. 따뜻한 노을빛 속 캐릭터와 차가운 사무실 조명 속 캐릭터는 얼굴이 같아도 다른 사람처럼 보입니다.
- 클립 하나에 동작 하나만 주세요. 동작이 복잡할수록 움직임이 많아지고, 움직임이 많을수록 클립 도중에 얼굴이 바뀔 가능성도 커집니다.
- 디테일 샷을 활용하세요. 컵을 쥔 손이나 뒷모습 샷은 얼굴을 반복하지 않고도 이야기를 전달합니다.
- 생성 전에 순서를 계획하세요. 샷 번호, 샷 크기, 동작, 대사, 그리고 그 샷의 기준이 될 이미지를 정리한 짧은 샷 리스트를 작성하고, 그 순서대로 생성하세요.
샷 리스트 예시
| 샷 | 크기 | 동작 | 기준점 |
|---|---|---|---|
| 1 | 와이드 | 새벽에 마야가 푸드트럭 문을 연다 | 대표 이미지를 첫 프레임으로 |
| 2 | 미디엄 | 마야가 카운터 뒤에서 커피를 만든다 | 샷 1의 마지막 프레임 |
| 3 | 클로즈업 | 마야가 미소 지으며 대사를 한다 | 정면 레퍼런스 |
| 4 | 디테일 | 손이 손님에게 컵을 건넨다 | 텍스트 시트만 |
일관성 체크리스트
시리즈의 각 클립을 생성하기 전에 이 목록을 확인하세요.
- 캐릭터 시트를 토씨 하나 바꾸지 않고 프롬프트 맨 앞에 붙여 넣었다.
- 의상 아이템마다 색상과 소재를 명시했다.
- 캐릭터에게 눈에 띄는 특징이 최소 하나 있다.
- 비주얼 스타일과 조명이 이전 클립과 일치한다.
- 모델이 지원한다면 레퍼런스 이미지나 이전 클립의 마지막 프레임을 첨부했다.
- 모델, 화면 비율, 해상도가 시리즈의 나머지 클립과 같다.
- 시드를 지원하는 모델이라면 같은 시드를 재사용했다.
- 각 클립에는 명확한 동작이 하나씩만 있다.
자주 묻는 질문
모든 클립에서 완벽하게 똑같은 캐릭터를 얻을 수 있나요?
매번 그렇지는 않습니다. 생성 과정에는 어느 정도 무작위성이 있기 때문입니다. 고정된 시트와 레퍼런스 이미지를 쓰면 편차를 크게 줄일 수 있습니다. 필요한 것보다 더 많은 테이크를 생성하고 맞는 것만 골라 쓰는 것을 전제로 계획하세요.
레퍼런스 이미지가 텍스트 설명보다 나은가요?
얼굴과 의상에 대해서는 레퍼런스 이미지가 더 강력한 기준점입니다. 가장 좋은 결과는 두 가지를 함께 쓸 때 나옵니다. 이미지는 외모를 고정하고, 텍스트는 클립이 움직이는 동안 그 외모를 안정적으로 유지합니다.
목소리를 똑같이 유지하려면 어떻게 하나요?
모든 프롬프트에서 목소리를 같은 방식으로 묘사하세요. 음높이, 말의 속도, 억양, 분위기를 적고, 대사는 짧게 유지합니다. 레퍼런스 이미지가 얼굴을 고정하듯 목소리를 고정해 주는 수단은 없으므로, 목소리가 맞는 테이크를 고르고 나머지는 다시 생성하세요. 긴 시리즈라면 목소리를 직접 녹음하거나 편집 단계에서 넣는 것이 가장 확실하게 제어하는 방법입니다.
한 장면에 캐릭터가 두 명 이상이라면요?
캐릭터마다 이름이 분명한 시트를 따로 작성하고, 각자에게 서로 다른 특징과 색상을 부여하세요. 가능하다면 프레임 안에서 서로 떨어뜨려 배치하세요. 매우 비슷한 두 캐릭터는 서로 섞이는 경향이 있습니다.
나만의 캐릭터 시리즈 시작하기
캐릭터 시트를 작성하고, 강렬한 대표 이미지 한 장을 만든 다음, 첫 번째 샷을 생성해 보세요. 지금 바로 AI 영상 생성기에서 시작하거나, 이미지 기반 클립을 원한다면 Veo 4로 바로 이동하세요. 시리즈를 키울 준비가 되면 요금제 페이지에서 플랜을 확인할 수 있습니다.
더 많은 클립을 계획 중이신가요? 각 샷을 연출하려면 카메라 무빙 프롬프트 가이드를, 클립이 어긋날 때의 해결책은 AI 영상이 이상하게 나오는 이유를 읽어 보세요.