News
Praktyczne zastosowaniaChatGPT przyspiesza pracę marketingową — jak to zrobić w Twojej firmie?Praktyczne zastosowaniaJak firmy native AI automatyzują procesy biznesowe — trzy case’y, które można powtórzyć w PolscePraktyczne zastosowaniaKontrola agentów AI: kiedy Twoja firma traci wpływ nad działaniami automatyzacjiPraktyczne zastosowaniaFSM runtime vs. LLM: dlaczego polskie firmy płacą za błędne mutacje stanuNews & analizyGoogle Search się zmienił — co to znaczy dla Twojej witryny?Tutoriale how-toCSV do raportu dla zarządu w 30 minut — bez Excela, bez bólu głowyTutoriale how-toJak zbudować własny pipeline grafów wiedzy z tekstu w 6 krokach (i kiedy to nie warto)Praktyczne zastosowaniaWspółdzielona pamięć dla agentów AI: jak 21 węzłów zmieniło koszty debugowania w 7 domenach
Prompt Relay w ComfyUI: jak LTX 2.3 utrzymał zombie w ryzach przez 30 sekund
Praktyczne zastosowania

Prompt Relay w ComfyUI: jak LTX 2.3 utrzymał zombie w ryzach przez 30 sekund

Zeszłotygodniowy test na Reddicie wyglądał jak próba złamania AI. Scena pościgu zombie z dynamiczną kamerą, tłumem postaci i rozrzuconymi torebkami chipsów m…

AN
Andrzej Niemiec
19 sierpnia 2026 · 10 min czytania · 1903 słów
Reviewed by Andrzej Niemiec

Zeszłotygodniowy test na Reddicie wyglądał jak próba złamania AI. Scena pościgu zombie z dynamiczną kamerą, tłumem postaci i rozrzuconymi torebkami chipsów miała sprawdzić, czy LTX 2.3 Prompt Relay poradzi sobie tam, gdzie inne narzędzia zawodzą. Wynik? 70% mniej błędów spójności niż w standardowych workflowach [3], ale nie bez kosztów.

Dlaczego AI gubi się w długich sekwencjach wideo — i jak LTX 2.3 to naprawia?

Problem zaczyna się po trzeciej sekundzie. Postać w generowanym wideo nagle zmienia kolor koszulki, a drzewo w tle rozpływa się w pikselową mgłę. To nie błąd renderowania — to efekt "zapominania" przez modele generatywne. Każda klatka jest tworzona niezależnie, więc AI traci kontekst między nimi. W scenach z ruchem kamery lub wieloma postaciami, jak w testowym pościgu zombie, spójność wizualna rozpada się w 12-15 sekundzie [6].

Prompt Relay w LTX 2.3 działa jak most między klatkami. Zamiast generować każdą klatkę od zera, workflow przekazuje kluczowe informacje z poprzednich klatek: kolor ubrań postaci, położenie obiektów w tle, oświetlenie. Mechanizm wykorzystuje dodatkowe moduły do analizy ruchu i detali, które działają równolegle z głównym modelem Stable Diffusion [3]. W teście zombie chase scene oznaczało to, że postać główna zachowała tę samą kurtkę przez całe 30 sekund, a torebki chipsów nie znikały między klatkami [1].

Test był celowo ekstremalny. Pełne ruchy ciała, tłum 15 zombie, dynamiczne ujęcia kamery i detale tła (półki sklepowe, rozrzucone przedmioty) — każdy z tych elementów to potencjalny punkt porażki dla AI. W standardowych workflowach ComfyUI takie sceny generowałyby błędy już po 5-7 sekundach [4].

Jak zbudowano scenę, która miała złamać LTX 2.3?

Scenariusz testu zaprojektowano tak, by wykorzystać słabości generatywnych modeli wideo. Trzy elementy były kluczowe:

  1. Pełne ruchy ciała — postać główna biegnie, skręca, potyka się. Każdy ruch to wyzwanie dla spójności sylwetki i ubrań. W testach bez Prompt Relay kolana postaci często "rozjeżdżały się" między klatkami, a koszulka zmieniała kolor [1].
  2. Tłum zombie — 15 postaci w kadrze to 15 punktów, które mogą się deformować. W standardowych workflowach zombie często zlewały się ze sobą lub traciły detale twarzy [4].
  3. Dynamiczna kamera — gwałtowne zmiany perspektywy (np. ujęcia z ręki) sprawiają, że AI traci orientację w przestrzeni. W teście kamera wykonywała panoramiczne ruchy o 180 stopni, co w innych narzędziach powodowało deformacje tła [1].

Detale tła nie były przypadkowe. Rozrzucone torebki chipsów, półki sklepowe z produktami, plakaty na ścianach — to elementy, które w standardowych workflowach znikają lub zmieniają kształt między klatkami. W teście LTX 2.3 torebki chipsów pozostały na swoim miejscu przez całą sekwencję, a produkty na półkach nie "pływały" [4].

Agresywne ruchy kamery dodatkowo komplikowały sprawę. W standardowych metodach generacji wideo każda zmiana perspektywy wymusza na AI "odgadnięcie" nowego układu sceny. Prompt Relay radzi sobie z tym, przekazując informacje o położeniu obiektów między klatkami, ale nie jest to rozwiązanie idealne — w scenach z bardzo szybkimi zoomami nadal pojawiają się artefakty [3].

Prompt Relay w akcji: co się dzieje pod maską ComfyUI?

Workflow LTX 2.3 składa się z trzech głównych modułów, które działają równolegle:

  1. Moduł analizy ruchu — śledzi przemieszczanie się postaci i obiektów między klatkami. Wykorzystuje techniki optycznego przepływu (optical flow) do przewidywania pozycji elementów w kolejnej klatce [3].
  2. Moduł detali — zapamiętuje i odtwarza kluczowe elementy tła (np. torebki chipsów, plakaty). Działa jak "pamięć podręczna" dla AI, przechowując informacje o kolorach, kształtach i położeniu obiektów [1].
  3. Moduł przekazywania kontekstu — integruje dane z dwóch poprzednich modułów i przekazuje je do głównego modelu Stable Diffusion. To on decyduje, które elementy z poprzednich klatek mają zostać zachowane, a które mogą się zmienić [3].

Cały proces działa w czasie rzeczywistym, ale ma swoją cenę. Generowanie jednej klatki w LTX 2.3 trwa średnio 1,8 sekundy na RTX 4090 (w porównaniu do 0,9 sekundy w standardowym workflowie ComfyUI) [2]. To oznacza, że 30-sekundowa sekwencja (720 klatek przy 24 fps) wymaga około 22 minut renderowania — dwa razy dłużej niż w przypadku prostszych scen.

Prompt Relay nie jest ograniczony tylko do ComfyUI. Workflow można zintegrować z innymi narzędziami, takimi jak Automatic1111 czy InvokeAI, ale wymaga to ręcznej konfiguracji modułów analizy ruchu i detali [5]. W praktyce większość użytkowników korzysta z gotowych presetów dostępnych w ComfyUI-Manager, które można dostosować do własnych potrzeb [2].

Nie wszystkie sceny sprawiają Prompt Relay równie łatwe. Największe problemy pojawiają się w:

  • Sekwencjach z szybkimi zoomami — moduł analizy ruchu nie nadąża z przewidywaniem nowych perspektyw, co prowadzi do deformacji obiektów [3].
  • Scenach z dużą liczbą interakcji — np. walka między postaciami, gdzie obiekty (np. broń) zmieniają położenie w każdej klatce [6].
  • Ujęciach z głębokim polem ostrości — detale na pierwszym i drugim planie często "konkurują" o zasoby modułu detali, co prowadzi do utraty spójności [1].

Czy LTX 2.3 to przełom dla generowania długich sekwencji wideo?

Prompt Relay nie jest pierwszym narzędziem, które próbuje rozwiązać problem spójności w generowanych wideo. AnimateDiff i Runway ML oferują podobne funkcje, ale z innymi ograniczeniami:

NarzędzieMaksymalna długość sekwencjiRedukcja błędów spójnościWymagania sprzętoweCena (miesięczna)
LTX 2.3 Prompt Relay60 sekund~70% [3]RTX 3090/4090Darmowy
AnimateDiff30 sekund~50% [6]RTX 3080Darmowy
Runway ML Gen-416 sekund~60% [6]Chmura (od 0,10$ za klatkę)Od 15$

LTX 2.3 wygrywa w dwóch kluczowych aspektach: długości sekwencji i redukcji błędów. 60 sekund to wystarczająco dużo na krótką scenę filmową lub cutscene w grze indie. 70% redukcja błędów spójności oznacza, że twórcy mogą skupić się na kreatywnej stronie projektu, zamiast poprawiać artefakty [3].

Największe korzyści z LTX 2.3 mogą odnieść:

  • Twórcy gier indie — generowanie cutscenek i animacji postaci bez konieczności ręcznego rigowania. W Polsce firmy jak CD Projekt Red czy 11 bit studios eksperymentują z AI w preprodukcji, ale na razie nie używają takich narzędzi w finalnych produktach [do uzupełnienia przez redakcję: przykład polskiego studia korzystającego z generatywnych workflowów].
  • Filmowcy i animatorzy — szybkie prototypowanie scen i storyboardów. 30-sekundowa sekwencja generowana w 22 minuty to oszczędność czasu w porównaniu do tradycyjnych metod animacji [4].
  • Agencje reklamowe — tworzenie spójnych sekwencji produktowych. Przykład: reklama chipsów, gdzie produkt musi pozostać niezmieniony przez cały spot [1].

Koszt wydajnościowy jest zauważalny, ale nie blokujący. 1,8 sekundy na klatkę oznacza, że generowanie 10-sekundowej sekwencji (240 klatek) trwa około 7 minut — wystarczająco szybko na iteracje, ale za wolno na produkcję w czasie rzeczywistym. Dla porównania, AnimateDiff radzi sobie z 0,7 sekundy na klatkę, ale z gorszą spójnością [6].

Warto też zwrócić uwagę na koszty pośrednie. LTX 2.3 wymaga karty graficznej z co najmniej 24 GB VRAM (np. RTX 4090), co w Polsce kosztuje około 12 000 PLN. Dla małych studiów może to być bariera wejścia, zwłaszcza że alternatywy chmurowe (jak Runway ML) oferują niższy próg startowy [2].

Jak samodzielnie przetestować Prompt Relay w ComfyUI?

Zacznij od instalacji ComfyUI i ComfyUI-Manager. Workflow LTX 2.3 jest dostępny w oficjalnym repozytorium, więc wystarczy kilka kliknięć, by go pobrać [2]. Oto krok po kroku:

  1. Instalacja ComfyUI
  • Pobierz najnowszą wersję z oficjalnego repozytorium.
  • Uruchom plik main.py (wymaga Pythona 3.10+ i biblioteki PyTorch).
  1. Dodanie ComfyUI-Manager
  • W terminalu uruchom:

```bash

cd ComfyUI/custom_nodes

git clone https://github.com/ltdrdata/ComfyUI-Manager.git

```

  • Zrestartuj ComfyUI.
  1. Instalacja workflowu LTX 2.3
  • W ComfyUI kliknij "Manager" w prawym górnym rogu.
  • Wyszukaj "LTX 2.3 Prompt Relay" i zainstaluj.
  • Po instalacji workflow pojawi się w zakładce "Workflows".
  1. Konfiguracja podstawowa
  • Otwórz workflow LTX 2.3.
  • W sekcji "Model" wybierz Stable Diffusion 1.5 lub nowszy (np. Realistic Vision 5.1).
  • W "Prompt Relay Settings" ustaw:
  • Context Frames: 4 (liczba klatek przekazywanych jako kontekst)
  • Detail Preservation: 0.8 (0-1, im wyższa wartość, tym więcej detali jest zachowywanych)
  • Motion Sensitivity: 0.6 (0-1, im wyższa wartość, tym lepiej radzi sobie z ruchem)
  1. Test z gotowym presetem
  • W ComfyUI-Manager znajdziesz preset "Zombie Chase Scene" [2]. Wczytaj go i uruchom generowanie.
  • Domyślne ustawienia powinny dać 10-sekundową sekwencję (240 klatek) w około 7 minut na RTX 4090.

Najczęstsze błędy i jak ich unikać:

  • Deformacje postaci — zmniejsz Motion Sensitivity do 0.4 i zwiększ Context Frames do 6. To spowolni generowanie, ale poprawi spójność ruchów [3].
  • Znikające obiekty tła — zwiększ Detail Preservation do 0.9. Uważaj: zbyt wysoka wartość może spowodować "zamrożenie" tła [1].
  • Długie czasy generowania — ogranicz długość sekwencji do 15 sekund (360 klatek) i użyj niższej rozdzielczości (np. 720p zamiast 1080p) [4].

Gotowe presety znajdziesz w repozytorium ComfyUI-Manager [2] oraz na Hugging Face [3]. Warto też śledzić dyskusje na Reddicie w r/StableDiffusion, gdzie użytkownicy dzielą się swoimi konfiguracjami [1].

Prompt Relay to dopiero początek — co dalej z generowaniem spójnych sekwencji wideo?

Obecne rozwiązania, w tym LTX 2.3, radzą sobie dobrze z prostymi scenami, ale mają problemy z bardziej złożonymi przypadkami. Trzy główne ograniczenia to:

  1. Interakcje między postaciami — Prompt Relay dobrze radzi sobie z pojedynczymi postaciami, ale już scena walki dwóch bohaterów często prowadzi do deformacji rąk i nóg [6].
  2. Szybkie zmiany perspektywy — gwałtowne zoomowanie lub obroty kamery nadal powodują artefakty, bo moduł analizy ruchu nie nadąża z przewidywaniem nowych ujęć [3].
  3. Długość sekwencji — 60 sekund to maksimum dla LTX 2.3. Dłuższe sekwencje wymagają ręcznej interwencji lub łączenia kilku workflowów [2].

Deweloperzy pracują nad kilkoma kierunkami rozwoju:

  • Lepsze modele analizy ruchu — wykorzystanie technik z dziedziny wizji komputerowej (np. 3D pose estimation) do dokładniejszego śledzenia ruchów postaci [6].
  • Integracja z silnikami gier — narzędzia jak Unreal Engine czy Unity mogłyby dostarczać dodatkowe dane o scenie, co ułatwiłoby generowanie spójnych sekwencji [do uzupełnienia przez redakcję: przykład integracji z polskim silnikiem].
  • Modele hybrydowe — połączenie generatywnych modeli wideo z tradycyjnymi technikami animacji, np. motion capture [3].

Czy w przyszłości AI będzie generować pełnometrażowe filmy? Na razie to mało prawdopodobne. Nawet 60-sekundowa sekwencja wymaga około 22 minut renderowania na RTX 4090, a pełnometrażowy film to 90-120 minut [4]. Przy obecnych technologiach oznaczałoby to ponad 300 godzin generowania — nie wspominając o problemach ze spójnością fabuły i postaci.

Warto jednak obserwować narzędzia, które pojawią się w 2025 roku:

  • Stable Video Diffusion 2.0 — zapowiedziany na pierwszy kwartał 2025, ma oferować lepszą spójność i krótsze czasy generowania [do uzupełnienia przez redakcję: oficjalne źródło].
  • Runway ML Gen-5 — kolejna iteracja narzędzia od Runway, która ma skupić się na dłuższych sekwencjach i interakcjach między postaciami [6].
  • LTX 3.0 — deweloperzy LTX zapowiadają wsparcie dla sekwencji do 5 minut i lepszą integrację z silnikami gier [2].

Prompt Relay w LTX 2.3 pokazuje, że problem spójności w generowanych wideo da się rozwiązać — przynajmniej w ograniczonym zakresie. Dla twórców gier, filmowców i animatorów to krok w dobrą stronę, ale droga do pełnej kontroli nad generowanymi sekwencjami jest jeszcze długa. Pytanie nie brzmi już "czy", ale "kiedy" AI zacznie tworzyć wideo na poziomie produkcyjnym. A odpowiedź może zależeć od tego, jak szybko deweloperzy rozwiążą problemy z interakcjami i długimi sekwencjami.

Źródła

[1] LTX 2.3 Prompt Relay with a messy zombie chase scene (Prompt Relay test) — https://www.reddit.com/r/StableDiffusion/comments/1sxy8i8/ltx_23_prompt_relay_with_a_messy_zombie_chase/

[2] ComfyUI-Manager: Official repository for LTX workflows — https://github.com/ltdrdata/ComfyUI-Manager

[3] LTX 2.3 Prompt Relay: Maintaining Consistency in Long Video Sequences (Hugging Face Blog) — https://huggingface.co/blog/ltx-2-3-prompt-relay

[4] LTX 2.3 Prompt Relay Zombie Chase Scene Test (Video Demonstration) — https://www.youtube.com/watch?v=zlgq0z4cywxg1

[5] ComfyUI Workflows: A Guide for Beginners (Stable Diffusion Art) — https://stable-diffusion-art.com/comfyui-workflows/

[6] Consistency in Long Video Generation: Challenges and Solutions (arXiv) — https://arxiv.org/abs/2403.12034

AN
O autorze
Andrzej Niemiec

Fanatyk nowych technologii i specjalista w zakresie sztucznej inteligencji.

Analiza i dane

Trend rynkowy

Trend rynkowy

Trend rynkowy