W grudniu 2025 roku YouTube zablokował kanały Screen Culture i KH Studio. Dwa kanały, łącznie ponad dwa miliony subskrybentów, ponad miliard wyświetleń. Łączyły oficjalne materiały z obrazami AI, tworząc zwiastuny franczyzowe, które wyglądały jak oficjalne. Screen Culture do marca wypuścił 23 wersje jednego zwiastuna Fantastycznej Czwórki, a niektóre z nich przebijały prawdziwy w wynikach wyszukiwania (Deadline, grudzień 2025).
Nie zostali zbanowani za używanie AI. Dostali bana za spam i mylące metadane: udawanie, że cudzy film jest oficjalnie wydanym materiałem.
Ale miliard wyświetleń udowodnił coś innego. Zwiastun to piętnaście sekund o największej dźwigni w marketingu filmowym. Format nigdy nie był problemem. Problemem było przypisanie.
Oto więc użyteczna wersja tego eksperymentu: użyj tego samego formatu dla filmu, który należy do ciebie. Jeden 15-sekundowy teaser, 2K, natywny stereo, jedna linia narracji, muzyka, karta tytułowa. Jedna generacja. Bez timeline’u montażowego, bez studia nagraniowego, bez licencji muzycznej, bez obróbki w After Effects.
Kluczowe wnioski
- Zwiastun to najgęstsza rzecz, o jaką możesz poprosić model wideo: wiele ujęć, narracja, muzyka, projekt dźwięku i napisy na ekranie – wszystko naraz. H3 zajmuje obecnie pierwsze miejsce na liście liderów Artificial Analysis w kategorii edycji wideo z dźwiękiem, a sekwencje tytułowe filmów znajdują się na liście przypadków użycia samego MiniMaxa.
- 15 sekund to twardy limit H3. To nie jest teatralny teaser (takie trwają 30–60 sekund), ale to dokładnie długość wersji społecznościowej, która wykonuje większość rzeczywistej pracy.
- Napisz monit jako arkusz z sygnaturami czasowymi, a nie jako zbiór przymiotników. Wprowadzenie, konflikt, punkt kulminacyjny, karta tytułowa. Cztery rytmy.
- W API nie ma żadnego parametru audio. Jeśli nie zamówisz muzyki, narracji i projektu dźwięku słownie, dostaniesz to, co model uznał za stosowne.
- Rzeczywiste ceny na Atlas Cloud: wersja robocza 768p 1,50 USD, finalna 2K 2,10 USD, plus około 0,17 USD za pierwszą klatkę. Gotowy teaser kosztuje od 2,03 do 3,77 USD.

Pierwsza klatka GPT Image 2, która ustala wygląd filmu: wnętrze stalowego dzwonu nurkowego z lat 70., kobieta w porysowanym pomarańczowym skafandrze, bursztynowa lampa przyrządów i zielona poświata sonaru. Klatka, na której opiera się wszystko inne. Wygenerowana za pomocą openai/gpt-image-2/text-to-image w jakości high, 2048x1152. To właśnie ten pojedynczy obraz sprawia, że wersja robocza 768p i finalna 2K nie stają się dwoma różnymi filmami.
Zwiastun filmowy MiniMax H3, który zrobiłem w jednej generacji
Najpierw zobacz go, zanim przejdziemy do teorii. Oryginalny teaser thrillera głębinowego o nazwie SALVAGE. Jedno wywołanie API, żadnych cięć dodanych później.
SALVAGE, 15 sekund, jedna generacja na minimax/h3/image-to-video. Włącz dźwięk: stęk kadłuba, ping sonaru, smyczki i linia narracji wyszły z tego samego wywołania co obraz. Koszt: 2,10 USD.
Co znajduje się w tym pliku i skąd pochodzi każdy element:
- Cztery wyraźne ujęcia z ostrymi cięciami, bez płynnych przejść. Jedna generacja.
- 24 kl./s, stereo AAC przy 32 kHz. Nie dodane w postprodukcji.
- Jedna linia narracji, żeńska, umieszczona między 5 a 7,5 sekundy, ponieważ tak nakazywał monit.
- Karta tytułowa, która pozostaje całkowicie nieruchoma przez ostatnie dwie sekundy.
To pięć tradycyjnych przejść postprodukcyjnych skompresowanych w jedno. I właśnie dlatego zwiastun jest dobrym testem obciążeniowym dla tego modelu, a złym dla większości innych.
Dlaczego większość prób zwiastuna MiniMax H3 rozpada się w dziewiątej sekundzie
Zwiastuny to najtrudniejsza kategoria do sfałszowania, ponieważ nie można ukryć słabości. Jeśli napisy drżą, widzisz to. Jeśli synchronizacja ust dryfuje, słyszysz to. Jeśli muzyka nie trafia w cięcie, całość sprawia wrażenie pokazu slajdów z dodanym podkładem.
Mniej więcej dlatego H3 jest tam, gdzie jest. Na liście liderów Artificial Analysis w kategorii edycji wideo z dźwiękiem zajmuje pierwsze miejsce z wynikiem 1130 Elo na podstawie 8249 głosów, dziewięć punktów przed Gemini Omni Flash i 93 punkty przed Dreaminą Seedance 2.0, a jako jedyny model w tej czołowej grupie ma oznaczenie Open Weights (Artificial Analysis, sierpień 2026). W materiałach startowych MiniMaxa sekwencje tytułowe filmów znajdują się na liście przypadków użycia pierwszej strony, obok animowanych plakatów i spójnych kinematyk w grach (MarkTechPost, sierpień 2026).
Oto oficjalne 15-sekundowe otwarcie science fiction z tego zestawu startowego, abyś mógł usłyszeć, co oznacza „natywny dźwięk”, zanim cokolwiek wydasz:
THE LAST FLEET LEFT EARTH, z oficjalnego zestawu demonstracyjnego MiniMax H3. Dostarczone w 2560x1440, 24 kl./s, stereo AAC 32 kHz. Zwróć uwagę na przesuwaną kartę tytułową i kartę „SHE KNEW WHY” w środku zwiastuna, które pozostają nieruchome, podczas gdy kamera się porusza.
A teraz lista niepowodzeń. Każde z nich naprawdę wydarzyło się w drodze do klipu na górze tej strony.
- Próba zmieszczenia 60-sekundowego zwiastuna w jednym wywołaniu. 15 sekund to twardy limit. Poproś o pełną historię zwiastuna, a dostaniesz papkę, ponieważ model ściska osiem rytmów w cztery. Napisz teaser.
- Pisanie przymiotników zamiast arkusza z sygnaturami. „Epicki kinowy zwiastun, dramatyczny, napięcie” daje nastrój, a nie strukturę. Sygnatury czasowe dają strukturę.
- Rozmyte karty tytułowe. Jeśli nie podasz dosłownego ciągu w monicie, plus sposobu traktowania napisu, plus wyraźnej instrukcji „nieruchomy”, dostaniesz przybliżone litery. Trzy lub więcej linii napisów to moment, w którym zaczyna się załamywać.
- Otrzymanie cichego pliku lub ścieżki dźwiękowej, o którą nie prosiłeś. W text-to-video, image-to-video i reference-to-video nie ma parametru
audio. Dźwięk zamawia się w prozie w monicie albo wcale. - Tanie szkicowanie na gołym text-to-video. Bez ustawionej pierwszej klatki, 768p i 2K zwracają dwa różne filmy, ponieważ przejście 2K jest regeneracją w kontekście, a nie skalowaniem. Tania wersja robocza nie uczy cię niczego o drogiej finalnej.
- Nieprzesłanie
duration. Schemat dokumentuje domyślną wartość 8, ale pominięcie go skutkowało rozliczeniem jako 5-sekundowe zadanie i zwróceniem 5-sekundowego pliku. Twój zwiastun zostaje ucięty w momencie konfliktu. - Założenie, że HTTP 200 oznacza spełnienie żądania. Wymień prawdziwą franczyzę, a sprawdzanie wejściowe odrzuci zadanie w ciągu kilku sekund. Inne monity są po cichu przycinane i rozliczane normalnie.
Punkty 4, 5 i 6 są kosztowne, a żaden z nich nie jest w dokumentacji.
Przepływ pracy generatora zwiastunów filmowych MiniMax H3 i koszt każdego kroku
Pięć kroków, pięć modeli, jedna karta przeglądarki i jeden klucz API. Poniższe ceny to aktualne stawki za sekundę na stronie każdego modelu, a nie liczby z bloga.
| Krok | Model | Co robi | Cena dzisiaj (sierpień 2026) |
|---|---|---|---|
| Ustaw pierwszą klatkę | GPT Image 2 (text-to-image) | Jedna klatka ustalająca obsadę, kostiumy i kolorystykę | Na podstawie tokenów. Zmierzono 0,1745 USD dla high przy 2048x1152 |
| Szkicowanie i finalizacja teasera | MiniMax H3 image-to-video | 15-sekundowy zwiastun, obraz i dźwięk | 2K 0,14 USD/s, 768p 0,10 USD/s |
| Warianty tylko tekstowe | MiniMax H3 text-to-video | Ten sam arkusz rytmu bez ustawionej pierwszej klatki | Te same stawki |
| Wersja pionowa, utrwalenie obsady | MiniMax H3 reference-to-video | Wersja społecznościowa 9:16, do 9 obrazów referencyjnych | Te same stawki |
| Ratowanie wersji 768p | Atlas Cloud Video Upscaler | Podniesienie jakości roboczej zamiast ponownego uruchamiania | 1080p 0,018 USD/s, 2K 0,024 USD/s, min. 5 s |
Trzy punkty końcowe H3 w katalogu modeli Atlas Cloud. Text-to-video, image-to-video i reference-to-video to oddzielne ścieżki na tym samym kluczu, dlatego cały łańcuch poniżej nigdy nie opuszcza jednej karty.
Warto zapamiętać parametry, wszystkie sprawdzone dzisiaj na żywych schematach, a nie w pliku readme: resolution to 768P lub 2K, domyślnie 2K. duration to dowolna liczba całkowita od 4 do 15. Pole nazywa się ratio, nie aspect_ratio, a w image-to-video jest całkowicie ignorowane, ponieważ kształt wyjściowy jest dziedziczony z klatki wejściowej. Text-to-video i reference-to-video akceptują 21:9 do 9:16. Wszystko działa asynchronicznie: POST /api/v1/model/generateVideo, następnie poll /api/v1/model/prediction/{id}.
Poradnik zwiastuna filmowego MiniMax H3: 15 sekund, cztery rytmy, jedna generacja
Film to oryginalny thriller głębinowy. Jedno słowo tytułu, aby napisy miały miejsce na oddech. Jedna linia narracji. Skopiuj monity dosłownie i zamień rzeczowniki na własne.
Krok 1: Ustaw pierwszą klatkę za pomocą GPT Image 2
Nie zaczynaj od modelu wideo. Klatka kosztuje około 17 centów, a 15-sekundowa generacja 2K kosztuje 2,10 USD, więc chcesz ustalić wygląd o rząd wielkości taniej. Co ważniejsze, zablokowana pierwsza klatka to jedyna rzecz, która sprawia, że twoja wersja robocza 768p jest przewidywalna dla finalnej 2K.
Plain1Klatka filmowa, anamorficzny wygląd w ramce 16:9: wnętrze stalowego dzwonu nurkowego z lat 70. 2opadającego w czarną wodę, widziane przez ramię kobiety w porysowanym pomarańczowym skafandrze. 3Jej twarz oświetla tylko jedna bursztynowa lampa przyrządów i blada zielona poświata ekranu sonaru. 4Skropliny na grubym szkle bulaja; za nim absolutna ciemność z jednym słabym dryfem cząstek. 5Ciężkie ziarno filmu 35 mm, głęboka czerń w kolorze zmiażdżonym, paleta morskiego zieleni i bursztynu, 6płytka głębia ostrości, tylko praktyczne oświetlenie. Brak flar obiektywu, braku tekstu, braku logo, 7braku znaku wodnego, braku napisów.
Ustawienia: jakość high, rozmiar 2048x1152, format wyjściowy png. Jakość high nie jest opcjonalna, ponieważ ziarno i zmiażdżona czerń to to, co model wideo przeniesie przez piętnaście sekund.

Panel GPT Image 2 na Atlas Cloud z załadowanym monitem o dzwonie nurkowym i gotową pierwszą klatką w panelu wyjściowym. GPT Image 2 na Atlas Cloud, ukończone uruchomienie: monit powyżej po lewej, klatka, która stała się bohaterką tego artykułu, po prawej.
Krok 2: Napisz arkusz rytmu 15-sekundowego teasera (Wprowadzenie, konflikt, punkt kulminacyjny, karta tytułowa)
To jest część, której nikt w zestawieniach „najlepszy generator zwiastunów” ci nie da. Monit zwiastuna to arkusz z sygnaturami czasowymi. Obraz dostaje sygnatury, dźwięk dostaje sygnatury, narracja dostaje okno, a karta tytułowa dostaje swój dosłowny ciąg.
Oto struktura oddzielnie, abyś mógł wypełnić ją własnym filmem:
| Rytm | Okno | Obraz | Cięcie | Sygnatura dźwiękowa |
|---|---|---|---|---|
| Wprowadzenie | 0.0-4.0s | Jeden powolny ruch na postaci w jej świecie | Bez cięć, pojedynczy najazd lub ślad | Dźwięk otoczenia, jeden charakterystyczny dźwięk, niski podkład |
| Konflikt | 4.0-8.0s | Szeroki pokazujący skalę problemu, potem powrót do detalu | Dwa ostre cięcia | Podkład się napina, jeden metaliczny akcent, wchodzą smyczki |
| Punkt kulminacyjny | 8.0-12.0s | Trzy szybkie detale, potem czerń | Trzy ostre cięcia, potem sześć klatek czerni | Rosnący klaster smyczków, jeden uderzenie, potem cisza |
| Karta tytułowa | 12.0-15.0s | Rozjaśnienie na tytule, nieruchomo przez dwie pełne sekundy | Żaden ruch | Jeden niski bas, potem zanikający ogon rewerberacji |
A oto ta struktura wypełniona, gotowa do wklejenia do image-to-video z klatką z kroku 1:
Plain115-sekundowy, 16:9 teaser oryginalnego thrillera głębinowego. Kontynuuj dokładnie od 2dostarczonej pierwszej klatki: ta sama kobieta, ten sam pomarańczowy skafander, to samo 3oświetlenie bursztynowe i zielone sonaru, to samo ciężkie ziarno. Cztery rytmy, ostre cięcia, 4bez przejść. 5 60.0-4.0s WPROWADZENIE. Powolny najazd przez jej ramię w stronę bulaja. Cząstki kurzu dryfują. 7Ekran sonaru przeciąga się raz. Ona oddycha; jej wydech zaparowuje szkło. 84.0-8.0s KONFLIKT. Ostre cięcie na niski szeroki: dzwon nurkowy maleńki na tle czarnej ściany 9klifu, lina naprężona nad nim. Ostre cięcie z powrotem na jej rękę trzaskającą przełącznikiem. 10Lampa przyrządów migocze. Kształt przesuwa się obok bulaja, nieostry, nie do zidentyfikowania. 118.0-12.0s PUNKT KULMINACYJNY. Trzy szybkie cięcia: zbliżenie jej oka łapiącego czerwone 12światło przeciążenia; szyba bulaja wyginająca się z drobnym pęknięciem; całkowita czerń przez 13sześć klatek. 1412.0-15.0s KARTA TYTUŁOWA. Rozjaśnienie z czerni na jednym tytule, wyśrodkowanym, trwającym 15nieruchomo przez ostatnie dwie sekundy: SALVAGE 16Bardzo szeroki odstęp między literami, ciężka kondensowana szeryfa, szczotkowana zimna stal 17z lekką rdzą na krawędzi i stonowanym wewnętrznym blaskiem, nie czysta biel. Poniżej, małe 18kapitaliki o połowie rozmiaru: NOTHING DOWN HERE STAYS LOST 19Obie linie nieruchome: bez drgań, bez zniekształceń, bez przesuwania, bez przerenderowania między 20klatkami. 21 22DŹWIĘK, generuj natywnie, nie dostarczaj ścieżki ciszy: 230.0-4.0s niski stęk kadłuba około 40 Hz, jeden ping sonaru w 1.5s z długim ogonem, odległy 24syk ciśnienia. 254.0-8.0s syk się napina; pojedyncze metaliczne brzęknięcie w 6.2s; smyczki wchodzą na jednym 26długim niskim dźwięku. 278.0-12.0s wznoszący się klaster smyczków, trzask nitu w 10.5s, potem twarda cisza w 11.8s. 2812.0-15.0s jeden głęboki bas na karcie tytułowej, potem powolny zanikający ogon rewerberacji 29nad cichym sonarem. 30NARRACJA, tylko jedna linia, żeński głos, niski i niespieszny, zmiksowany pod muzyką, wypowiedziany 31między 5.0s a 7.5s: „Nothing down here stays lost.” 32 33NEGATYW: żaden tekst na ekranie poza dwoma liniami tytułowymi; bez napisów, bez podpisów, bez 34znaku wodnego, bez logo studia, bez flar obiektywu, bez szybkich panoram, bez drgań kamery poza 35powolnym ręcznym pływaniem, bez światła dziennego, bez widocznego stworzenia, bez krwi, bez 36krwawych scen.
Trzy rzeczy w tym monicie robią więcej pracy, niż się wydaje. Blok AUDIO istnieje, ponieważ nie ma parametru audio do ustawienia. Linia „nieruchome” istnieje, ponieważ stabilność napisów jest najczęstszą przyczyną niepowodzenia zwiastuna. A sześć klatek czerni w 11.8 sekund sprawia, że karta tytułowa wydaje się kartą tytułową, a nie kolejnym ujęciem.

Cztery klatki wyciągnięte z gotowego teasera SALVAGE, oznaczone WPROWADZENIE, KONFLIKT, PUNKT KULMINACYJNY i KARTA TYTUŁOWA, pokazujące arkusz rytmu w rzeczywistym wyrenderowaniu. Te same cztery rytmy w rzeczywistości, wyciągnięte z pliku 2K. Od lewej: najazd w 2s, niski szeroki w 5s, światło przeciążenia w 10s, karta tytułowa w 14s.
Krok 3: Szkicowanie zwiastuna MiniMax H3 w 768p za 1,50 USD
Ta sama klatka, ten sam monit, resolution: "768P", duration: 15. Wyślij duration jawnie. Pominięcie go skutkowało rozliczeniem jako 5-sekundowe zadanie. Otrzymasz 1344x768, 24 kl./s, stereo AAC i rachunek 1,50 USD.
Wersja robocza 768p. Strukturalnie ten sam film co finalna 2K, ponieważ pierwsza klatka jest zablokowana. Małe napisy w karcie tytułowej to miejsce, gdzie widać różnicę w rozdzielczości.
Oceń ją tylko pod kątem czterech rzeczy, ignorując całkowicie ostrość:
- Czy cięcia są na tych samych rytmach, czy jeden rytm pochłonął drugi?
- Czy narracja istnieje i czy mieści się w oknie 5–7,5 sekundy?
- Czy karta tytułowa stoi w miejscu, czy się porusza?
- Czy muzyka trafia w uderzenie w 12. sekundzie?
Jeśli którekolwiek z nich zawiedzie, popraw monit i zrób nową wersję roboczą za 1,50 USD. Nie naprawiaj tego za 2,10 USD.
Krok 4: Finalizacja zwiastuna MiniMax H3 w 2K
Zmień dokładnie jedno pole. Ten sam image, ten sam monit, resolution: "2K". Wynik to 2560x1440, a rachunek to 2,10 USD.
Ponieważ pierwsza klatka jest zablokowana, dwie wersje różnią się szczegółami, a nie treścią. Uczciwa wersja: duże napisy są czytelne w 768p, ale druga linia rozdziela się na rzeczywiste litery tylko w 2K.

Kadr karty tytułowej w 100%, 768p po lewej i 2K po prawej, pokazujący, że linia podtytułu rozdziela się na czytelne litery tylko w 2K. Ta sama sekunda, ta sama klatka, przycięta w 100%. Szeroko rozstawiony SALVAGE przetrwa w obu. Linia o połowie rozmiaru pod nim to powód, dla którego finalizujesz w 2K.

Panel MiniMax H3 image-to-video na Atlas Cloud z załadowaną klatką dzwonu nurkowego i gotowym klipem w panelu wyjściowym. MiniMax H3 image-to-video na Atlas Cloud, ukończone uruchomienie. Selektory rozdzielczości i czasu trwania w panelu pozostały na domyślnych ustawieniach dla tego przechwycenia, więc klip w OUTPUT to krótsze uruchomienie niż opisane wyżej 15-sekundowe wywołanie, a nie gotowy teaser.
Jest tańsza finalizacja. Jeśli wersja 768p jest już dobra, wyślij ją przez upscaler wideo za 0,024 USD na sekundę do 2K, co daje 0,36 USD za 15 sekund. Chroni to ujęcie, które już lubisz, ale nie może wymyślić szczegółów liter, których nigdy nie było w źródle, a trasa 2K ma limit 23 sekund wejściowych.
Krok 5: Wytnij pionowy zwiastun MiniMax H3 za pomocą reference-to-video
Plik 16:9 jest na stronę internetową. Plik 9:16 jest tym, który jest faktycznie oglądany. Reference-to-video przyjmuje do dziewięciu obrazów referencyjnych plus wideo i dźwięk, więc możesz utrwalić tę samą główną postać i tę samą kolorystykę w pionowym przeformatowaniu, zamiast mieć nadzieję.
Wyślij refers jako tablicę z klatką z kroku 1 plus tablicą inspiracji, ratio: "9:16", duration: 15, resolution: "2K". Monit to ten sam arkusz rytmu z pionowym blokowaniem: rytm konfliktu staje się pojedynczym średnim zbliżeniem zamiast niskiego szerokiego, a karta tytułowa dostaje większy napis z podtytułem podzielonym na dwie linie.
Jedna pułapka, która kosztuje pieniądze, ponieważ nigdy nie zgłasza błędu: nie wysyłaj image i refers w tym samym żądaniu. Są wzajemnie wykluczające, API akceptuje oba, a jeden z nich jest po cichu odrzucany.
Pionowe cięcie z minimax/h3/reference-to-video, ta sama obsada, ta sama kolorystyka, przeformatowane na telefon.

Panel MiniMax H3 reference-to-video na Atlas Cloud z załadowanymi materiałami referencyjnymi i gotowym klipem w panelu wyjściowym. MiniMax H3 reference-to-video na Atlas Cloud, ukończone uruchomienie, z wypełnionym polem referencyjnym. Rozdzielczość i czas trwania ponownie na domyślnych ustawieniach panelu.
Cztery warianty monitu zwiastuna filmowego MiniMax H3
Ten sam arkusz rytmu, cztery różne produkty.
Scope. Zmień ratio na 21:9 w text-to-video lub reference-to-video. Ten sam arkusz, szersza letterbox, a karta tytułowa ma zauważalnie więcej miejsca na litery.
Tylko sygnatura tytułowa. Usuń rytmy 1–3, zostaw kartę tytułową, ustaw duration: 4. To 0,56 USD w 2K za animację logo z uderzeniem basu. Przydatne także poza filmem, ponieważ „zwiastun” często dotyczy gry, książki lub podcastu.
Inny język. H3 obsługuje narrację w wielu językach natywnie, więc ten sam arkusz z linią narracji przepisaną na japoński daje zlokalizowany teaser bez osobnej ścieżki dubbingu.
Inna kategoria. Pionowe teasery dramatyczne to te same cztery rytmy z dialogiem zamiast narracji. Oto oficjalny przykład 9:16 z zestawu demonstracyjnego H3: piętnaście sekund, osiem ujęć, jedna postać utrzymana konsekwentnie we wszystkich, z wypowiadanymi kwestiami zamiast voice-overu.
Oficjalny pionowy teaser MiniMax H3, 1440x2560, 15 sekund, osiem ujęć, stereo AAC z dialogiem. Ta sama struktura rytmu, skierowana do odbiorców krótkich dramatów.
Chcesz 30-sekundowy teaser? Weź ostatnią klatkę klipu 1 i użyj jej jako pierwszej klatki klipu 2. Szczegóły w naszym przewodniku po długości wideo MiniMax H3.
Ile faktycznie kosztuje zwiastun filmowy MiniMax H3
Cztery uczciwe ścieżki do jednego gotowego 15-sekundowego teasera 2K. Koszt klatki to zmierzony 0,1745 USD dla GPT Image 2 w high, 2048x1152.
| Ścieżka | Pozycje | Razem |
|---|---|---|
| Bezpośrednio do 2K | klatka 0,1745 USD + 2K 2,10 USD | 2,27 USD |
| Szkicowanie potem finalizacja (zalecane) | klatka 0,1745 USD + 768p 1,50 USD + 2K 2,10 USD | 3,77 USD |
| Szkicowanie potem upscaling | klatka 0,1745 USD + 768p 1,50 USD + upscale 0,36 USD | 2,03 USD |
| Realistyczna sesja, trzy szkice | klatka 0,1745 USD + 3 x 1,50 USD + 2K 2,10 USD | 6,77 USD |
| Dodaj pionowe cięcie | + 2,10 USD | — |
Ceny bezpośrednie MiniMax są nieco niższe za sekundę niż stawka Atlas, więc zobaczysz cytowaną gdzie indziej kwotę 1,95 USD za 15-sekundowy klip 2K. Na Atlas stawka wynosi 0,14 USD za sekundę, czyli 2,10 USD, i to jest liczba, której używa każdy rachunek w tym artykule.
A oto co ta kwota 2,10 USD zastąpiła, uczciwie ocenione:
| Tradycyjny element postprodukcji | Kto to zwykle robi | Czy H3 dostarcza to w jednym przebiegu? | Jak dobrze, mierzone |
|---|---|---|---|
| Montaż wielu ujęć | Montażysta | Tak | Cztery rytmy utrzymane; cięcia trafiły w zapisane sygnatury czasowe |
| Nagranie narracji | Artysta voice-over + studio | Tak | Znalazło się w oknie 5–7,5 s zgodnie z zapisem |
| Muzyka | Kompozytor lub licencja z biblioteki | Tak | Łuk i uderzenie w 12 s obecne |
| Projekt dźwięku | Dźwiękowiec | Tak, z zastrzeżeniem | Sygnatury trafiają w rytm, nie są dokładne co do nazwanych sygnatur czasowych |
| Animacja karty tytułowej | Projektant motion | Tak | Stabilne w 2K; linia o połowie rozmiaru jest miękka w 768p |
Jeśli chcesz wycenić to w porównaniu z resztą punktów końcowych H3 linia po linii, szczegółowe zestawienie cen API MiniMax H3 zawiera arytmetykę dla każdego wywołania, a trzy powyższe punkty końcowe znajdują się na jednym kluczu w tym samym katalogu modeli, jeśli chcesz samodzielnie uruchomić łańcuch.
Zwiastuny fanowskie, prawdziwe filmy i metadane, które usunęły miliard wyświetleń
Warto precyzyjnie określić, co tak naprawdę stało się z tymi kanałami, ponieważ lekcja nie brzmi: „nie twórz zwiastunów za pomocą AI”.
Oba kanały zostały zawieszone, dokonały poprawek, zostały ponownie przyjęte do Programu Partnerskiego, a następnie wróciły do starych praktyk i zostały zablokowane na mocy zasad YouTube dotyczących spamu i mylących metadanych. Problemem była prezentacja: tytuły i miniatury, które sugerowały, że są to oficjalne materiały studyjne dla filmów, które nie miały takiego zwiastuna. Jeśli tworzysz koncepcyjny kawałek dla istniejącej własności, oznacz go w tytule, miniaturce i opisie i nie pozwól, aby metadane sugerowały, że pochodzi od studia.
H3 również reaguje na to na poziomie API. Wymień prawdziwą franczyzę lub konkretny film w monicie, a zadanie nie powiedzie się podczas sprawdzania wejściowego w ciągu kilku sekund, zamiast wygenerować coś, co potem musisz rozważać. To tępy filtr, który czasami złapie niewinny monit, ale jest to użyteczny sygnał, gdzie leży granica.
Jeszcze jedna uwaga, jeśli samodzielnie hostujesz, zamiast wywoływać API: wydane wagi są objęte Umową Licencyjną Społeczności MiniMax H3, a moduły H3-Context-IR i H3-Regenerate-2K, które produkują przejście 2K, nie są częścią otwartego wydania – pozostają po stronie API. Nasz przewodnik po użytkowaniu komercyjnym i licencjonowaniu obejmuje warunki; żaden z nich nie dotyczy trasy API użytej w tym artykule.
Najczęściej zadawane pytania
Czy generator zwiastunów filmowych MiniMax H3 może zrobić pełny zwiastun, czy tylko 15 sekund?
15 sekund to twardy limit na jedną generację. Teatralny teaser trwa 30–60 sekund, a pełny zwiastun 90 sekund do trzech minut (Beverly Boy, 2026), więc jedno wywołanie daje ci wersję społecznościową, a nie teatralną. Aby uzyskać dłuższy, łańcuchuj generacje, przekazując ostatnią klatkę jednego klipu jako pierwszą klatkę następnego.
Czy MiniMax H3 generuje voice-over i muzykę zwiastuna, czy muszę je dodać w postprodukcji?
Natywnie, w tym samym wywołaniu co obraz, dostarczane jako stereo AAC przy 32 kHz wraz z wideo 24 kl./s. Jednak na żadnym z trzech punktów końcowych nie ma parametru audio. Muzykę, narrację i efekty dźwiękowe zamawia się w prozie w monicie, z sygnaturami czasowymi. Pomiń ten blok, a dostaniesz ścieżkę dźwiękową, której nie wybrałeś.
Czy napisy na karcie tytułowej będą faktycznie czytelne?
Tak, jeśli napiszesz dosłowny ciąg, opiszesz sposób traktowania napisu i dodasz jawną instrukcję stabilności, np. „nieruchome, bez drgań, bez zniekształceń”. Trzymaj się dwóch linii. Duże szeroko rozstawione napisy przetrwają w 768p; małe drugorzędne linie rozdzielają się tylko w 2K.
Ile kosztuje jeden zwiastun filmowy MiniMax H3?
Na Atlas Cloud, 15 sekund w 2K to 2,10 USD przy 0,14 USD za sekundę, a ta sama długość w 768p to 1,50 USD przy 0,10 USD za sekundę. Dodaj około 0,17 USD za pierwszą klatkę. Gotowy teaser kosztuje od 2,03 do 3,77 USD, w zależności od tego, czy podbijesz jakość wersji roboczej, czy uruchomisz ponownie w 2K. Zawsze wysyłaj duration jawnie.
Czy mogę zrobić zwiastun prawdziwego, istniejącego filmu?
Technicznie sprawdzanie wejściowe blokuje nazwane franczyzy, więc model odmówi, zanim cię obciąży. Praktycznie, YouTube już zablokował kanały z miliardem wyświetleń z powodu mylących metadanych na temat dokładnie takich treści. Zrób to oryginalnie lub wyraźnie oznacz jako koncepcję lub fanowski kawałek w tytule i opisie.
Czy mogę utrzymać tę samą główną postać w dłuższym zwiastunie?
Użyj reference-to-video, które przyjmuje do dziewięciu obrazów referencyjnych plus referencyjne wideo i dźwięk, i utrwal tam obsadę, zamiast mieć nadzieję, że sam tekst utrzyma spójność. Nie wysyłaj image i refers w tym samym żądaniu: są wzajemnie wykluczające, API nie zgłosi błędu, a jeden z nich zostanie po cichu odrzucony.






