Wyższa rozdzielczość zawsze oznaczała wyższy rachunek. MiniMax H3 po cichu łamie tę zasadę. Renderuje bezpośrednio w natywnym 2K, a cena za sekundę jest niższa niż koszt klipu 720p w modelu wideo, po który większość sięga w pierwszej kolejności.
To jest nagłówek, ale rozdzielczość i cena to tylko połowa tego, co sprawia, że MiniMax H3 jest interesujący. Drugą połową jest sposób jego działania: jeden model, który czyta tekst, obraz, wideo i dźwięk razem, a zwraca gotowy klip, obraz i dźwięk w jednym przebiegu. Poniżej znajduje się co robi, ile kosztuje, oraz dokładne prompte, które wyprodukowały każdy klip w tym artykule.
Najważniejsze wnioski
- MiniMax H3 renderuje natywne 2K (2560 na 1440) z zsynchronizowanym stereo ścieżką dźwiękową wygenerowaną w tym samym przebiegu, a nie doklejoną później.
- Zweryfikowana cena na stronie modelu (lipiec 2026): 2K to 0,14 USD za sekundę, 768p to 0,10 USD za sekundę. Dla porównania, Seedance 2.0 kosztuje około 0,24 USD za sekundę w 720p, więc H3 daje klatkę o wyższej rozdzielczości przy niższej cenie jednostkowej.
- Trzy punkty wejścia (tekst, obraz i referencja do wideo) współdzielą jeden klucz API. Referencja-do-wideo akceptuje do dziewięciu mieszanych obrazów, klipów i jednej ścieżki dźwiękowej jako punkty tożsamości.
MiniMax H3 działa w jednym przebiegu zamiast trzech narzędzi
Tworzenie gotowego klipu zwykle oznacza podział zadania. Generujesz obraz w jednym modelu, przełączasz się na drugi model dla dźwięku, a następnie otwierasz edytor, aby je zsynchronizować. Każde przekazanie traci trochę pierwotnego zamiaru, a harmonogram szybko się wydłuża.
MiniMax H3 to wszystko scala. Czyta całe brief jako jeden kontekst: jak wygląda postać, jak przebiega ruch, jak porusza się kamera, klucz emocjonalny i jak powinien brzmieć dźwięk – wszystko trafia razem i wraca jako jeden klip. MiniMax przedstawia ten kierunek jako odejście od modeli wyspecjalizowanych w zadaniach w kierunku ogólnej inteligencji multimodalnej, a w praktyce oznacza to mniej otwartych narzędzi naraz.
Warto jasno stwierdzić dwie rzeczy, ponieważ obie można łatwo zweryfikować w wynikach. Po pierwsze, klipy niosą prawdziwy dźwięk: poniższe pliki demonstracyjne wychodzą z wbudowaną stereo ścieżką dźwiękową, a nie dodaną w postprodukcji. Po drugie, rozdzielczość jest rzeczywiście 2K, 2560 na 1440 przy 24 klatkach na sekundę, a nie upscalowana.
Trzy sposoby na uruchomienie MiniMax H3 na Atlas Cloud
MiniMax H3 jest dostępny na Atlas Cloud z trzema punktami wejścia, a wszystkie odpowiadają na ten sam klucz API. Każdy z nich ma Playground, który możesz wypróbować w przeglądarce, zanim napiszesz choćby linię kodu.
| Punkt wejścia | Sterowany przez | Dane wejściowe | Najlepsze do |
|---|---|---|---|
| Tekst-na-wideo | Sam prompt tekstowy | Brak materiałów referencyjnych | Budowanie sceny od zera |
| Obraz-na-wideo | Pierwsza klatka, plus opcjonalna ostatnia klatka | Jeden lub dwa obrazy statyczne | Animowanie stałej klatki, którą już masz |
| Referencja-do-wideo | Prompt tekstowy plus materiał referencyjny | Do 9 mieszanych obrazów, klipów wideo i jednej ścieżki audio | Utrzymanie spójności postaci, produktu lub stylu w całym klipie |
Ścieżka referencja-do-wideo jest elastyczna. Traktuje twoje odniesienia jako punkty tożsamości, dzięki czemu postać, produkt lub wygląd pozostają spójne, podczas gdy prompt umieszcza je w nowych scenach i ruchu. Możesz mieszać obrazy i klipy wideo oraz dodać jedną ścieżkę audio, aby zsynchronizować akcję z rytmem. Wymagany jest co najmniej jeden obraz lub wideo; sam dźwięk jest niedozwolony.
Ponieważ każdy model na platformie współdzieli jedną konwencję wywoławczą, przejście do H3 z innego modelu wideo sprowadza się do zmiany pola model. Autoryzacja, odpytywanie i pobieranie wyników pozostają identyczne, co jest cichą korzyścią płynącą z uruchamiania modeli wideo, obrazu, audio i języka za pomocą jednego klucza i jednego rachunku.
Ile kosztuje MiniMax H3: 2K, 768p i porównanie z Seedance
MiniMax H3 rozlicza za sekundę wygenerowanego wideo, według rozdzielczości. Te liczby pochodzą bezpośrednio ze strony modelu, sprawdzone 31 lipca 2026.
| Rozdzielczość | Koszt za sekundę | 8-sekundowy klip |
|---|---|---|
| 2K (2560 na 1440) | 0,14 USD | 1,12 USD |
| 768p | 0,10 USD | 0,80 USD |
Oto część, która na pierwszy rzut oka wydaje się odwrotna. Natywna sekunda 2K w H3 kosztuje 0,14 USD. Dla porównania, Seedance 2.0, drugi flagowy model wideo na platformie, kosztuje około 0,24 USD za sekundę w 720p. Tak więc H3 daje ci klatkę o wyższej rozdzielczości, po niższej cenie za sekundę, niż klip o niższej rozdzielczości kosztuje w Seedance. Rozdzielczość w górę, cena jednostkowa w dół, jednocześnie.
Jedna uczciwa uwaga dotycząca liczby, aby nikt źle nie zaplanował budżetu. Za ceną H3 nie stoi żadna promocja. 20% zniżka obowiązująca obecnie na platformie dotyczy modelu obrazu Seedream 5.0 Pro, a nie H3, więc 0,14 USD za sekundę w 2K to standardowa stawka od końca lipca 2026. Poziom 768p jest wymieniony w cenniku jako 0,10 USD za sekundę; 2K to poziom aktywny i dostępny do wywołania dzisiaj.
Książka promptów MiniMax H3: przykłady do skopiowania
Każdy klip poniżej został wyprodukowany przez prompt wydrukowany obok niego. Skopiuj jeden, wstaw własne referencje i uruchom go. Każdy blok pokazuje również obrazy referencyjne, które zostały użyte, w kolejności, w jakiej wywołuje je prompt (obraz 1, obraz 2 itd.).
Filmy brandingowe i filmowe/TV
Zwiastuny, spoty TVC i filmy o teksturze marki są najbardziej bezpośrednim dopasowaniem, ponieważ wpadają do istniejącego potoku treści z najmniejszą ilością przeróbek.
Wejściowe referencje, obraz 1 dla nastroju i stylu, obraz 2 dla głównej postaci:
Obraz referencyjny 1, ogólny nastrój i styl
Obraz referencyjny 2, główna postać
Plain1Realistyczny filmowy wygląd, wysoki kontrast światła i cienia, szybkie tempo. Obraz 1 jest referencją dla ogólnego nastroju i stylu. Obraz 2 jest referencją dla głównej postaci. Ujęcie 1, szeroki plan totalny. Ogromna kosmiczna brama wypełnia prawie całą klatkę; postać to tylko mała sylwetka przed nią, stojąca nisko i nieco na prawo od środka. Ziemia jest mokra i odbijająca; środek bramy jest czarny jak smoła. Kamera powoli wjeżdża. Główny tytuł pojawia się z krawędzi ciemności, najpierw rozmyty, potem ostry: "THE STARS WERE LISTENING", bardzo wąski, pogrubiony, wszystkie wielkie litery, ciemna czerwień zmieszana z rdzą, z lekkim ziarnem i rozmytymi krawędziami. Dźwięk: głęboki impuls niskich częstotliwości, odległy metaliczny dźwięk, jedno miękkie uderzenie, gdy tekst się rozjaśnia. Cięcie.
Kreatywność wizualna i opakowanie treści
Krótkie filmy kreatywne, sekwencje tytułowe, teledyski nastrojowe i plakaty motion. Tutaj najbardziej widać, jak model radzi sobie z tekstem na ekranie i rytmem.
Sekwencja tytułowa kryminału z lekkim napięciem. Pięć referencji stylu ustawia retro-anime, komiksowo-kolażowy wygląd; model zachowuje czytelność każdego angielskiego napisu i trafia w przejścia na uderzenia perkusji.
Referencja stylu
Referencja stylu
Plain1Wygeneruj 15-sekundową sekwencję tytułową w formacie 16:9 poziomym dla lekkiego kryminału. Ogólny styl podąża za językiem wizualnym tych obrazów: retro-japońskie sekwencje tytułowe anime, ostre sylwetki, kolaż komiksowy, asymetryczne podzielone ekrany, mocne geometryczne bloki kolorów, angielskie napisy, kilka japońskich dekoracji katakana, jazzowo-kryminalna postawa. Nastrój to 60% napięcia, 40% jazzu: tajemniczy, chłodny, zwinny, z miejskim kryminalnym klimatem, nie horror, nie ciężki. Ruch przypomina kolaż motion-graphic: ramki linii pojawiają się najpierw na czarnym, granice podzielonego ekranu przesuwają się szybko, bloki kolorów i panele wklejają się blok po bloku; sylwetki postaci, zbliżenia rekwizytów i angielskie napisy wsuwają się, wyskakują i ujawniają się maską w sekwencji na uderzenia perkusji. Angielskie napisy muszą być wyraźnie czytelne i mogą być animowane. Nie dodawaj chińskich znaków, żadnych zniekształconych znaków, żadnych błędów w angielskim. Każdy angielski napis i rola pojawia się dokładnie raz. Utrzymuj różnorodność przejść: okrągła maska winylowa, pionowe cięcie drzwi samochodu, długa ludzka sylwetka przesuwająca ekran, czerwone cięcie linii, gigantyczna maska angielskiej litery, rekompozycja podzielonego ekranu, twarde cięcie bloku kolorów. Wszystkie przejścia trafiają na uderzenia perkusji. Żadnych miękkich rozpuszczeń. BGM: oryginalna 15-sekundowa muzyka tytułowa, 60% napięcia, 40% jazzu, zbudowana z ciągłego basowego tonu, napiętych smyczków pizzicato, zimnych syntezatorowych impulsów, stopy perkusyjnej, rzadkich jazzowych szczotek i krótkich fraz saksofonu. Pierwsze 2 sekundy budują napięcie niskimi częstotliwościami i hi-hatem; w 3 sekundzie wchodzi niski uderzenie perkusji; w 6 sekundzie dołącza jazzowy bas; w 10 sekundzie pojawia się krótki riff saksofonu; ostatnie 2 sekundy zamykają klatkę napiętym akordem plus uderzenie perkusji. Nie naśladuj żadnej istniejącej melodii.
Kuchnia live-action połączona z ręcznie rysowaną animacją. Brak materiałów referencyjnych, tylko tekst-na-wideo. Prompt wykorzystuje niedoskonałą teksturę telefonu, aby nie wyglądało to jak reklama.
Plain115 sekund, 16:9 poziomy. Materiał live-action małej kuchni o zmierzchu połączony z ręcznie rysowaną, świecącą animacją. Światło zachodzącego słońca wciąż zalega w oknie; zamieszkała mała kuchnia ma stary drewniany stół, na wpół umytą szklankę, lekko zaparowaną szklaną butelkę i wiszącą ścierkę. Obraz niesie delikatne drżenie ręki przy nagrywaniu telefonem jedną ręką, wahanie przy zbliżaniu ostrości, fluktuacje ekspozycji od podświetlenia i nieco szorstki szum w cieniach. Nie rób tego starannie skomponowanego jak reklama, powinno to sprawiać wrażenie, jakby ktoś w pośpiechu nagrywał w domu coś niemożliwego. Żadnych wielkich oczu, rozszczepionych ust, kłów, zagrażających lub skaczących ruchów, nagłego cięcia do czerni, jump scare'ów. Dźwięk używa tylko odgłosów pomieszczenia kuchennego, tarcia ścierki, lekkiego brzęku szklanki, kapania wody z kranu, kroków nagrywającego i ledwo słyszalnego oddechu, plus miękkie elektroniczne tony i małe krzyki ręcznie rysowanego stworzenia.
Teledysk dark-pop, cyber-grunge. Dwie referencje ustawiają traktowanie typografii i teksturę druku; cięcie pozostaje twarde, bez rozpuszczeń.
Referencja traktowania typografii
Referencja traktowania typografii
Plain1Styl: dark-pop / cyber-grunge / teledysk rapowy, realistyczna tekstura high-fashion, tekstura magazynu filmowego, wysoki kontrast, ale nie tani. Ogólna referencja: niezależne magazyny z późnych lat 90. do wczesnych 00., papier ksero, skany filmowe, plakaty muzyki undergroundowej i estetyka kolażu zinowego. Obraz ma grube ziarno, lekkie drżenie filmu, kropki rastrowe, zadziory drukarskie i niedokładności skanowania. Szybki rytm cięcia, tylko twarde cięcia, żadnych wyblaknięć i miękkich przejść. Styl i tekstura traktowania typografii podążają za obrazami referencyjnymi.
Plakat motion. Jedna referencja, oryginalny statyczny plakat. Prompt utrzymuje układ i paletę bez zmian, animuje tylko wejście typografii.
Oryginalny statyczny plakat
Plain1Zrób wideo w formie plakatu motion. Zachowaj oryginalną białą ramkę galerii, wewnętrzną ramkę, paletę czerwono-biało-czarną, wrażenie figurki 3D i strukturę układu bez zmian; gdy pojawia się typografia, dodaj zwinny efekt dźwiękowy wejścia tekstu.
Doświadczenie cyfrowe i kreatywność gier
UI gier, interfejsy produktów i dema interakcji. Tutaj wyróżnia się fakt, że H3 podąża za promptem napisanym jako bloki czasowe.
Prezentacja UI ekwipunku gry, z promptem co sekundę. To jest ten, który warto przeczytać uważnie. Prompt jest napisany jako segmenty czasowe, a model podąża za nimi: stany menu, kliknięcia kursora, wsuwanie paneli, siatka uzbrojenia, pasek ładowania od 0% do 100%, a następnie pełne środowisko ładujące się wokół postaci.
Obraz referencyjny 1, postać
Obraz referencyjny 2, styl UI
Plain1Referencja postaci to Obraz 1, referencja stylu UI to Obraz 2. 2 3[0s-2s] Ujęcie z góry, wysoki kąt. Postać siedzi na bardzo nasyconej, jasnofioletowej podłodze, nawiązując do Obrazu 1, patrząc w górę w kamerę. Po prawej stronie pojawia się menu gry: START NEW GAME, CONTINUE (podświetlone), SETTINGS, EXIT GAME. Profil gracza MINIMAX widoczny w lewym górnym rogu. Kursor klika "CONTINUE". 4 5[2s-4s] Płynne przybliżenie do jej prawej ręki. Panel UI wsuwa się z prawej strony i pojawia się panel "RIGHT ARM EQUIPMENT". Zaznaczenie podświetla "PHANTOM GRIP", a następnie przesuwa się do "CHRONOS CLAW". Jej prawa ręka mechanicznie się przekształca, palce rozdzielają się, nowe, szponiaste kostki wskakują na miejsce, cyjanowe diody LED rozjaśniają się. 6 7[4s-7s] Kamera płynnie przesuwa się łukiem na jej lewą stronę. Wsuwa się nowy interfejs UI, siatka "ARMAMENT CUSTOMIZATION", pokazująca elementy dłoni, przedramienia, łokcia i ramienia. Zaznaczenie szybko cyklicznie przechodzi przez części. Jej lewa ręka rozkłada się segment po segmencie, z widocznym okablowaniem i tłokami podczas wymiany. 8 9[7s-8.5s] Kamera oddala się do ujęcia średniego. Przycisk CONFIRM CONFIG miga. Kliknięcie. Wszystkie panele UI kurczą się do wewnątrz i znikają. Postać rozwija nogi i teraz siedzi wygodnie z jednym kolanem do góry. 10 11[8.5s-10s] Pasek ŁADOWANIA pojawia się na dole, szybko wypełniając się od 0% do 100%. Jasnofioletowe środowisko zaczyna ciemnieć, cienie wpełzają z krawędzi, ciepłe złote światło przesącza się. 12 13[10s-15s] Gdy wstaje, pełne środowisko ładuje się wokół niej. Gęsta cyberpunkowa dzielnica biedoty wyostrza się: migające neony, mokre ulice odbijające światło, tłumy w ruchu, motocykle przemykające, piętrzące się budynki sięgające odległych wieżowców. Kamera ustawia się w trzeciej osobie za nią. Elementy HUD pojawiają się, z minimapą w prawym górnym rogu i licznikiem zdrowia oraz amunicji w lewym dolnym rogu. Pojawia się znacznik zadania. Wchodzi na ulicę.
Demo UI/UX strony docelowej produktu. Jedno zdjęcie produktu jako referencja; prompt prosi o przewijającą, energetyczną stronę docelową.
Referencja zdjęcia produktu
Plain1Strona internetowa, projekt UI strony internetowej, ruch strony, wideo pokazuje płynne przewijanie strony w dół. Eksplozywne, energetyczne demo UI/UX strony docelowej produktu w stylu oficjalnej strony Nike, której głównym tematem jest produkt z Obrazu 1. Strona używa surowego, mocnego, pochyłego, wielkiego bezszeryfowego pisma dla głośnego układu. W tle szybko poruszające się światło i cień, ciemny karbon lub tekstura sportowej oddychającej siateczki przeplatają się i przesuwają. Wideo pokazuje ściśle tempo przewijania strony w dół, plus interakcje UI, takie jak silne wizualne powiększenie i inwersja kolorów po najechaniu.
Ruch UI strony internetowej, minimalny prompt. Dowód na to, że szczegółowy, czasowy styl jest opcjonalny; krótka instrukcja też działa.
Obraz referencyjny
Plain1Symuluj projekt UI strony internetowej: najpierw nagłówek u góry zsuwa się w dół do widoku, następnie pasek tekstu poniżej przesuwa się w górę, a światła samochodu zmieniają się z ciemnego na czerwone.
Jak zacząć z MiniMax H3
Są dwa sposoby, a żaden z nich nie zajmuje dużo czasu.
Uruchom w Playgroundzie. Zaloguj się do Atlas Cloud i otwórz MiniMax H3 bezpośrednio na stronie modelu. Wpisz prompt, wybierz rozdzielczość i czas trwania, i generuj, bez potrzeby kodowania. To najszybszy sposób, aby sprawdzić, czy model pasuje do twojego ujęcia, zanim wpięjesz go w cokolwiek.
Lub wywołaj API w trzech krokach.
- Zdobądź klucz API. Otwórz konsolę Atlas Cloud i utwórz klucz na stronie API Keys. Wszystkie trzy punkty wejścia H3 współdzielą jeden klucz.
- Przeczytaj pola na stronie modelu. Odniesienia do parametrów i gotowy kod do skopiowania znajdują się na każdym punkcie wejścia: tekst-na-wideo, obraz-na-wideo, referencja-do-wideo. Każdy z nich przyjmuje inne dane wejściowe, więc nie mieszaj ich ciał żądań.
- Wyślij pierwsze żądanie. Jeden endpoint i jedna konwencja wywoławcza dociera do każdego modelu na platformie, więc przejście z innego modelu wideo do H3 oznacza zmianę pola model na odpowiedni punkt wejścia H3. Autoryzacja, odpytywanie i pobieranie wyników pozostają takie same.
Poza H3, ten sam klucz dociera do modeli wideo, obrazu, audio i języka, które możesz łączyć, za pomocą jednego API i jednego rachunku, więc budowanie gotowego dzieła nie oznacza przenoszenia aktywów i faktur między dostawcami.
Często zadawane pytania
Czym jest MiniMax H3?
MiniMax H3 to multimodalny model generowania wideo firmy MiniMax, dostępny na Atlas Cloud przez trzy punkty wejścia: tekst-na-wideo, obraz-na-wideo i referencja-do-wideo. Czyta tekst, obraz, wideo i dźwięk jako jeden kontekst i zwraca gotowy klip 2K z zsynchronizowanym dźwiękiem w jednym przebiegu.
Ile kosztuje MiniMax H3?
MiniMax H3 rozlicza za sekundę wideo. Zweryfikowane na stronie modelu w lipcu 2026, natywne 2K (2560 na 1440) to 0,14 USD za sekundę, a 768p to 0,10 USD za sekundę. 8-sekundowy klip 2K kosztuje zatem 1,12 USD. W tym czasie nie ma promocyjnej zniżki na H3.
Czy MiniMax H3 generuje dźwięk, czy tylko wideo?
Oboje, razem. Klipy demonstracyjne wychodzą z MiniMax H3 z zsynchronizowaną stereo ścieżką dźwiękową wygenerowaną w tym samym przebiegu co obraz, a nie dodaną w osobnym kroku. Prompty mogą kierować dźwiękiem, opisując muzykę, efekty dźwiękowe i synchronizację wraz z obrazem.
Jaka jest różnica między trzema punktami wejścia MiniMax H3?
Tekst-na-wideo działa na podstawie samego promptu. Obraz-na-wideo animuje pierwszą klatkę, z opcjonalną ostatnią klatką. Referencja-do-wideo utrzymuje spójność tematu przy użyciu do dziewięciu mieszanych materiałów referencyjnych, obrazów, klipów wideo i jednej ścieżki audio. Wszystkie trzy współdzielą jeden klucz API i jedną konwencję wywoławczą.
Jaką rozdzielczość i długość klipu obsługuje MiniMax H3?
MiniMax H3 renderuje natywne 2K w rozdzielczości 2560 na 1440 i 24 klatki na sekundę, z tańszym poziomem 768p w cenniku. Klipy trwają od około 5 do 15 sekund, a proporcje obrazu obejmują adaptacyjne, 21:9, 16:9, 4:3, 1:1, 3:4 i 9:16.






