Subskrybuj teraz i otrzymaj 30% zniżki! Odblokuj nieograniczone generowanie wideo AI.Odbierz Zniżkę
Tworzymy lepszy produkt AI do edycji i generowania obrazów: PicEnhancer — większość funkcji jest darmowa.Wypróbuj teraz

Jak zachować spójną postać w wielu klipach wideo AI

Long Cheng
Zachowaj tę samą twarz, strój i głos postaci w wielu klipach wideo AI dzięki karcie postaci, obrazom referencyjnym, seedom i przemyślanemu planowi ujęć.
Jak zachować spójną postać w wielu klipach wideo AI
how-to
characters
prompts
veo4

Pierwszy klip wygląda świetnie. Detektyw ma szary prochowiec, krótkie ciemne włosy i bliznę nad jedną brwią. Potem generujesz drugi klip i nagle płaszcz jest brązowy, włosy dłuższe, a blizna zniknęła. Przy piątym klipie masz już pięć różnych osób, które łączy tylko zawód.

Każde generowanie zaczyna się od zera. Model nie pamięta poprzedniego klipu, więc wszystko, czego nie określisz, wymyśla od nowa. Rozwiązanie polega na tym, aby określić jak najwięcej: tekstem, obrazami oraz seedem tam, gdzie model go obsługuje. Ten poradnik omawia każdą z tych metod w kolejności, w jakiej warto ich używać.


Dlaczego postać zmienia się między klipami

Model wideo AI czyta Twój prompt i każdą lukę wypełnia własnym, najlepszym przypuszczeniem. „Młoda kobieta w kurtce” zostawia dziesiątki luk: jej wiek, kształt twarzy, włosy, kolor i krój kurtki, światło na skórze. Każde kolejne generowanie wypełnia te luki inaczej.

Spójność polega więc przede wszystkim na zamykaniu luk. Im mniej decyzji zostawisz modelowi, tym mniej ma on miejsca na zmianę Twojej postaci. Służą do tego trzy narzędzia:

  1. Słowa: stały opis tekstowy, który powtarzasz słowo w słowo.
  2. Obrazy: kadr referencyjny, który pokazuje modelowi dokładnie, jak wygląda postać.
  3. Seedy: liczba, która powtarza losowy punkt startowy modelu, w modelach, które ją przyjmują.

Używaj wszystkich trzech, gdy tylko możesz.


Krok 1: Napisz kartę postaci

Zanim cokolwiek wygenerujesz, napisz krótką kartę postaci. To blok tekstu, który opisuje postać w stały, konkretny sposób. Wklejasz go bez zmian do każdego promptu.

Dobra karta postaci obejmuje cztery obszary.

Twarz i sylwetka

Przedział wieku, kształt twarzy, odcień skóry, kolor oczu, kolor włosów, ich długość i fryzura, budowa ciała oraz jeden lub dwa charakterystyczne znaki. Blizna, układ piegów albo okrągłe srebrne okulary dają modelowi konkretny szczegół do powtarzania, a Tobie szybki sposób na wychwycenie zmian.

Garderoba

Nazwij każdy element, jego kolor i materiał. „Musztardowożółta wełniana czapka, granatowa płócienna kurtka robocza z mosiężnymi guzikami, biały T-shirt” jest znacznie stabilniejsze niż „swobodny strój”.

Głos i sposób bycia

Jeśli generujesz klipy z dźwiękiem, opisz głos: wysokość, tempo, akcent i nastrój. „Spokojny, niski głos z lekką chrypką, mówi powoli” daje każdemu klipowi ten sam cel. Jeśli dodajesz głos później, w montażu, pomiń tę część w prompcie wideo.

Styl

Wygląd świata, w którym żyje postać: realistyczny, animacja 3D, anime, ziarno filmowe, korekcja barwna. Postać w innym stylu odbieramy jak inną postać.

Przykładowa karta postaci

Prompty zostawiamy po angielsku, bo modele wideo AI najlepiej reagują na język angielski.

MAYA: a woman in her early thirties with an oval face, warm brown skin, dark brown eyes, and shoulder-length black curly hair tied back with a red scrunchie. Small gold hoop earrings. Thin silver scar across her left eyebrow. She wears a mustard-yellow wool beanie, a navy canvas work jacket with brass buttons, and a plain white t-shirt. Calm, low voice with a slight rasp; she speaks slowly and smiles with one side of her mouth. Realistic cinematic style, soft natural light, gentle film grain.

Karta powinna mieścić się w jednym krótkim akapicie, jak w przykładzie. Zbyt uboga karta zostawia luki, a zbyt długa zakopuje najważniejsze szczegóły pod opisem sceny.


Krok 2: Powtarzaj dokładnie te same sformułowania

Największy błąd po napisaniu karty to parafrazowanie jej. W pierwszym klipie piszesz „mustard-yellow beanie”, a w drugim „yellow knit hat”. Dla Ciebie to to samo. Dla modelu to dwa różne prompty z dwoma różnymi wynikami.

Zasady powtarzania:

  • Kopiuj i wklejaj kartę. Nie przepisuj jej z pamięci.
  • Zachowaj tę samą kolejność. Umieść kartę postaci na początku każdego promptu, a scenę i akcję dodaj po niej.
  • Zmieniaj tylko scenę. Miejsce, akcja i ruch kamery zmieniają się z klipu na klip. Tekst o postaci pozostaje taki sam.

Przykładowe prompty z powtórzoną kartą

MAYA: a woman in her early thirties with an oval face, warm brown skin, dark brown eyes, and shoulder-length black curly hair tied back with a red scrunchie. Small gold hoop earrings. Thin silver scar across her left eyebrow. She wears a mustard-yellow wool beanie, a navy canvas work jacket with brass buttons, and a plain white t-shirt. Realistic cinematic style, soft natural light, gentle film grain.
Scene: Maya stands at a food truck window on a rainy evening and hands a paper cup of coffee to a customer. Medium shot, slow push in. She says, "Careful, it's hot." Rain on the metal roof, quiet street ambience.
MAYA: (same sheet, pasted word for word)
Scene: Early morning. Maya unlocks the side door of the food truck and steps inside, switching on a string of warm lights. Wide shot from across the street, camera static. No dialogue. Birds and distant traffic.

W prawdziwych promptach wklej pełną kartę w miejsce „same sheet”. Ten skrót służy tu tylko oszczędzaniu miejsca w artykule.


Krok 3: Zakotwicz wygląd obrazem referencyjnym

Obraz referencyjny jest silniejszą kotwicą niż tekst, ponieważ model widzi twarz, zamiast ją sobie wyobrażać.

Jak to zrobić:

  1. Stwórz jeden obraz główny postaci za pomocą narzędzia do grafiki albo użyj zdjęcia, do którego masz prawa. Wybierz wyraźny kadr en face, z równym oświetleniem, na którym twarz i strój są w pełni widoczne.
  2. Użyj go jako pierwszej klatki w trybie image-to-video dla każdego klipu. Na veo4.dev opcjonalny obraz referencyjny w Veo 4 staje się klatką otwierającą klip. Kling 3.0, Seedance 2.0 i Wan 2.6 przyjmują opcjonalną pierwszą klatkę, a Wan AI 2.2 zawsze zaczyna od dostarczonego przez Ciebie obrazu.
  3. Mimo to zostaw kartę postaci w prompcie. Obraz ustala pierwszą klatkę. Tekst utrzymuje stabilność postaci, gdy klip oddala się od tej klatki.

Pierwsza i ostatnia klatka

Niektóre modele przyjmują zarówno pierwszą, jak i ostatnią klatkę. Na veo4.dev oba pola mają Veo 3.1 oraz MiniMax H3. To bardzo pomaga w zachowaniu spójności, bo model musi dojść do wybranej przez Ciebie klatki. Jeśli obie klatki pokazują tę samą postać, klip ma dwie kotwice zamiast jednej.

Praktyczny trik: zapisz ostatnią klatkę klipu, który Ci się podoba, i użyj jej jako pierwszej klatki kolejnego. Postać przechodzi wtedy płynnie z jednego ujęcia do następnego.

Prowadź małą bibliotekę referencji: widok z przodu, widok trzy czwarte i ujęcie całej sylwetki. Do każdego nowego ujęcia wybierz najbliższą referencję i dopasuj proporcje obrazu do proporcji klipu, aby twarz nie została przycięta.

Więcej możliwości image-to-video znajdziesz na stronie image-to-video.


Krok 4: Używaj seedów tam, gdzie model je obsługuje

Seed to liczba, której model używa jako losowego punktu startowego. Przy tym samym prompcie, tych samych ustawieniach i tym samym seedzie model, który respektuje seedy, daje bardzo podobny wynik.

Na veo4.dev seed trafia do modelu w przypadku Happy Horse 1.0 oraz Wan AI 2.2. Pole znajdziesz w ustawieniach zaawansowanych.

Jak użyć seeda, aby zachować spójność:

  1. Wygeneruj kilka wersji z losowymi seedami.
  2. Znajdź tę, w której postać wygląda dobrze, i zapisz jej seed.
  3. Użyj tego seeda w kolejnych klipach i zmieniaj tylko część promptu dotyczącą sceny.

Seedy najbardziej pomagają przy niewielkich wariacjach: ta sama postać i to samo miejsce, ale inna akcja lub kąt. Duża zmiana w opisie sceny mocno zmienia wynik, nawet przy tym samym seedzie. W innych modelach polegaj na karcie postaci i obrazach referencyjnych.


Krok 5: Planuj ujęcia, które ukrywają drobne różnice

Nawet przy wszystkich powyższych metodach mogą pojawić się drobne odchylenia. Dobry plan ujęć sprawia, że są one znacznie trudniejsze do zauważenia.

  • Zmieniaj plan. Cięcie z planu ogólnego na zbliżenie ukrywa drobne zmiany w stroju, bo widz spodziewa się zmiany kadru.
  • Utrzymuj to samo światło. Postać w ciepłym świetle zachodu słońca, a potem w zimnym świetle biura wygląda jak dwie różne osoby, nawet z tą samą twarzą.
  • Daj każdemu klipowi jedną akcję. Złożona akcja oznacza więcej ruchu, a więcej ruchu to większa szansa, że twarz zmieni się w trakcie klipu.
  • Korzystaj z ujęć detali. Dłoń na kubku albo ujęcie od tyłu opowiada historię bez powtarzania twarzy.
  • Zaplanuj kolejność przed generowaniem. Napisz krótką listę ujęć: numer ujęcia, plan, akcja, kwestia dialogowa i obraz, który kotwiczy ujęcie. Potem generuj w tej kolejności.

Przykładowa lista ujęć

UjęciePlanAkcjaKotwica
1OgólnyMaya otwiera food truck o świcieObraz główny jako pierwsza klatka
2ŚredniMaya parzy kawę za ladąOstatnia klatka ujęcia 1
3ZbliżenieMaya uśmiecha się i wypowiada swoją kwestięReferencja z przodu
4DetalDłonie podają kubek klientowiTylko karta tekstowa

Lista kontrolna spójności

Przejdź przez tę listę przed każdym generowaniem w serii:

  • Karta postaci jest wklejona słowo w słowo na początku promptu.
  • Elementy garderoby mają nazwany kolor i materiał.
  • Postać ma co najmniej jeden charakterystyczny znak.
  • Styl wizualny i światło pasują do wcześniejszych klipów.
  • Obraz referencyjny lub ostatnia klatka poprzedniego klipu jest dołączona, jeśli model to przyjmuje.
  • Model, proporcje obrazu i rozdzielczość są takie same jak w reszcie serii.
  • Seed jest użyty ponownie w modelach, które go respektują.
  • Każdy klip ma jedną wyraźną akcję.

Najczęściej zadawane pytania

Czy mogę uzyskać idealnie identyczną postać w każdym klipie?

Nie za każdym razem, bo generowanie zawiera pewien element losowości. Stała karta i obraz referencyjny bardzo zawężają te różnice. Zaplanuj więcej ujęć, niż potrzebujesz, i zachowaj te, które do siebie pasują.

Czy obraz referencyjny jest lepszy od opisu tekstowego?

Obraz referencyjny to silniejsza kotwica dla twarzy i stroju. Najlepsze wyniki daje połączenie obu: obraz ustala wygląd, a tekst utrzymuje go, gdy klip się rozwija.

Jak zachować ten sam głos?

Opisuj głos w każdym prompcie tak samo: wysokość, tempo, akcent i nastrój. Pisz krótkie kwestie. Nic nie kotwiczy głosu tak, jak obraz referencyjny kotwiczy twarz, więc wybieraj ujęcia, w których głos się zgadza, a resztę generuj ponownie. W długiej serii nagranie lub dodanie głosu w montażu daje Ci pełną kontrolę.

A co z dwiema lub większą liczbą postaci w jednej scenie?

Napisz osobną kartę dla każdej postaci z wyraźnym imieniem i nadaj każdej inny charakterystyczny szczegół oraz kolor. Gdy to możliwe, trzymaj je w kadrze z dala od siebie. Dwie bardzo podobne postacie mają tendencję do zlewania się w jedną.


Zacznij swoją serię z postacią

Napisz kartę postaci, stwórz jeden mocny obraz główny i wygeneruj pierwsze ujęcie. Możesz spróbować od razu w generatorze wideo AI albo przejść prosto do Veo 4, aby tworzyć klipy prowadzone obrazem. Gdy Twoja seria będzie gotowa do rozbudowy, strona z cennikiem pokaże dostępne plany.

Planujesz więcej klipów? Przeczytaj poradnik o promptach ruchu kamery, aby wyreżyserować każde ujęcie, oraz dlaczego Twoje wideo AI wygląda źle, gdy klip zaczyna się rozjeżdżać.