Całe lato mój feed odtwarzał w pętli ten sam film. Zawodnicy MŚ przerysowani na bohaterów shonen. Dyktator. Kapitan piratów. Zrzędliwy mentor, który pojawia się w ostatnich czterech sekundach. Miliony wyświetleń na post, a fabuła aktualizuje się prawie po każdym meczu.
Nikt, kto to robi, nie pisze postów o benchmarkach. Wybierają model, palą kredyty i wrzucają przed następnym gwizdkiem.
Wziąłem więc jedną klatkę kluczową z anime i jeden prompt, i przetestowałem MiniMax H3 jako generator wideo anime przeciwko Veo 3.1, oba pchnięte do maksymalnych ustawień na identycznych wejściach.
Pierwszą rzeczą, która się zepsuła, nie była jakość obrazu. To był dropdown. Veo 3.1 zatrzymuje się na 8 sekundach i oferuje dokładnie dwa proporcje. Ujęcie, które trzyma twarz, robi szybki panoramiczny ruch z piłką, a potem pozwala na planszę tytułową, nie mieści się w 8 sekundach. Nigdy nie miało szansy zawieść na jakości.
Kluczowe wnioski
- Enum
durationw Veo 3.1 to[4, 6, 8], a enumaspect_ratioto[16:9, 9:16]. MiniMax H3 obsługuje dowolną pełną sekundę od 4 do 15 i oferuje21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Brak 4:3 w Veo oznacza brak retro OVA kadrowania, w ogóle. - Karta modelu H3 wymienia 11 natywnie stabilnych języków dialogowych, a japoński jest jednym z nich. Dźwięk i obraz są generowane razem w 32 kHz stereo, a nie dubbingowane później.
- Pakiety referencyjne nie są zbliżone: H3 przyjmuje do 9 obrazów plus do 3 filmów i 3 klipy audio (maks. 12 plików). Endpoint referencyjny Veo 3.1 przyjmuje 3 obrazy, a w momencie użycia
durationzwija się do tylko[8]. - Dwie pułapki, które po cichu rujnują testy: API Veo domyślnie ustawia
generate_audionafalseiresolutionna720p, a H3 w trybie tekst-do-wideo domyślnie ustawiarationa1:1. Zostawcie je w spokoju, a porównujecie cichy klip 720p z kwadratowym. - Veo 3.1 zachowuje dwie rzeczy, których H3 w ogóle nie ma:
seedinegative_prompt. W przypadku anime 2D to drugie ma prawdziwe znaczenie i pokażę gdzie.
MiniMax H3 Anime Video Generator vs Veo 3.1, Ta Sama Klatka Jeden za Drugim
Jedna oryginalna postać. Jedna klatka kluczowa. Jeden prompt, skopiowany znak po znaku do obu modeli. Wszystko inne ustawione na maksimum po każdej stronie.
MiniMax H3, obraz-do-wideo, 2K, 8 sekund, natywny dźwięk. Włącz dźwięk: szum tłumu, uderzenie piłki i japoński okrzyk są generowane w tym samym przebiegu co obraz. Wygenerowane za pomocą minimax/h3/image-to-video na Atlas Cloud.
Veo 3.1, obraz-do-wideo, 1080p, 8 sekund, generateaudio włączone ręcznie, plus negativeprompt utrzymujący płaską linię. Ta sama pierwsza klatka, te same słowa. Wygenerowane za pomocą google/veo3.1/image-to-video na Atlas Cloud.
Oba rysują pięknie. Szerokie ujęcie Veo uderzenia, z ręcznie rysowanymi liniami uderzenia i efektem dźwiękowym mangi unoszącym się w powietrzu, jest naprawdę urocze. To jest uczciwy punkt wyjścia i dlatego reszta tego artykułu dotyczy parametrów i podążania za instrukcjami, a nie ogólnego wrażenia.
Dlaczego Większość Testów MiniMax H3 Anime Video Generator vs Veo 3.1 Idzie Źle
Tego lata wydarzyły się dwie rzeczy naraz.
Anime stało się formatem o największej objętości w AI video. Mistrzostwa Świata 2026 zostały przepisane jako turniej shonen, z zawodnikami obsadzonymi jako dyktator, kapitan piratów, admirał marynarki i mentor, a historie „ewoluują po prawie każdym meczu” na TikTok, Instagram, X i YouTube (Complex, lipiec 2026).
A MiniMax H3 wypuścił otwarte wagi. Wątek ComfyUI z dnia 0 osiągnął 330 punktów i 95 komentarzy, a ludzie w ciągu kilku godzin podawali rzeczywiste lokalne liczby (Hacker News, sierpień 2026).
Połączcie to, a spodziewalibyście się góry porównań anime. Prawie ich nie ma, ponieważ większość testów jest źle zbudowana na jeden z czterech sposobów.
Porównują obrazy, a nie ograniczenia. Ujęcia anime to kwestia czasu. Szybki panoramiczny ruch na planszę tytułową to problem czasu trwania, zanim stanie się problemem renderowania.
Zapominają, że API Veo jest domyślnie ciche. W API generate_audio to false, a resolution to 720p. Mnóstwo postów „Veo nie ma dźwięku w anime” to po prostu ktoś, kto nigdy nie przełączył boolean.
Zapominają, że H3 w trybie tekst-do-wideo jest domyślnie kwadratowy. ratio domyślnie to 1:1, a nie 16:9. Uruchomienie promptu t2v anime bez ustawienia go daje kwadratowy klip i mylący wniosek.
Testują z fotorealistycznymi promptami. „Kinowy, światło wolumetryczne, płytka głębia ostrości” to dokładnie słownictwo, które ciągnie model 2D w stronę cieniowania 3D. Tryb awarii w anime to nie rozmycie. To plastik.
Trzy ustawienia, które decydują o teście anime, zanim naciśniesz uruchom
Zanim cokolwiek zrobisz, ustaw je po obu stronach, w przeciwnym razie porównanie jest nieważne.
| Ustawienie | MiniMax H3 | Veo 3.1 | Co się stanie, jeśli to pominiesz |
|---|---|---|---|
| Dźwięk | Generowany z obrazem, zawsze włączony | generate_audio domyślnie false | Veo zwraca cichy klip i wygląda gorzej niż jest |
| Kształt klatki | ratio domyślnie 1:1 w text-to-video | aspect_ratio domyślnie 16:9 | H3 daje kwadratowy wycinek anime, którego nie możesz użyć |
| Rozdzielczość | domyślnie 2K | domyślnie 720p | Porównujesz 2K z 720p i nazywasz to różnicą jakości |
Specyfikacja MiniMax H3 vs Veo 3.1 Anime: Długość, Proporcje, Dźwięk, Referencje
Pobrałem na żywo schematy wejściowe obu modeli, zamiast ufać jakimkolwiek postom startowym. Każda wartość poniżej to enum, który możesz sam przeczytać na stronach modeli, a nie wrażenie.
Tabela 1: MiniMax H3 vs Veo 3.1, parametry decydujące o ujęciu anime
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Czas trwania | 4 do 15, co pełna sekunda (domyślnie 8) | 4, 6, 8 (domyślnie 8) |
| Proporcje obrazu | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Domyślne proporcje (text-to-video) | 1:01 | 16:09 |
| Rozdzielczość | 768P, 2K (domyślnie 2K) | 720p, 1080p, 4k (domyślnie 720p) |
| Dźwięk | Generowany łącznie, 32 kHz stereo | generate_audio, domyślnie false |
| Natywne języki dialogowe | 11 stabilnych, japoński wliczony | Nieopublikowane jako stabilna lista |
| Pakiet referencyjny | do 9 obrazów, 3 filmy, 3 klipy audio, łącznie 12 plików | 3 obrazy |
| Czas trwania przy użyciu referencji | nadal 4 do 15 | zwija się do tylko 8 |
| seed | niedostępne | dostępne |
| negative_prompt | niedostępne | dostępne |
| Wagi | do pobrania | zamknięte |
Czas trwania, proporcje, rozdzielczość, dźwięk i limity referencji pochodzą z żywych schematów na stronach MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video i Veo 3.1 reference-to-video. Limit 9 obrazów i 12 plików oraz lista 11 języków dialogowych pochodzą z karty modelu MiniMax H3 (Hugging Face, sierpień 2026).
Teraz tablice wyników, bo mówią coś innego niż specyfikacja, a obie są ważne.
Tabela 2: Elo głosowania społeczności i cena za minutę, snapshot 7 sierpnia 2026
| Model | Text-to-video (z dźwiękiem) | Image-to-video (z dźwiękiem) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | nie wymieniony w top 10 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | nie wymieniony w top 10 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | nie wymieniony w top 10 | $4.80 |
Elo i ceny pochodzą z Artificial Analysis Video Arena (Artificial Analysis, sierpień 2026). Są to zmienne głosy społeczności i się zmieniają. Kolumna $/min to znormalizowane oszacowanie modelu, a nie Twoja faktura.
145-punktowa różnica Elo jest duża, ale jest to głos ogólnego przeznaczenia, a nie głos anime. I tu jest część, którą muszę powiedzieć wprost: MiniMax nie promuje H3 jako modelu anime. Wewnętrzne opinie pierwszej linii wymieniają film, animację i dramat komediowy jako obszary, na które H3 nie jest skierowany. Zatem interesujące pytanie nie brzmi „który jest modelem anime”. Chodzi o to, dlaczego model, który nie sprzedaje się jako anime, wygrywa ujęcie, i gdzie Google wciąż zdobywa rundę.
Jedna praktyczna uwaga przed tutorialem. Każdy model poniżej działa przez tę samą konsolę i ten sam klucz API, co jest jedynym powodem, dla którego parametry są w ogóle porównywalne. Ta sama kolejka, to samo uwierzytelnianie, jeden rachunek. Jeśli skonfigurujesz GPT Image 2 w jednej usłudze, a Veo w innej, połowa różnic, które znajdziesz, będzie wynikać z infrastruktury, a nie z modelu.
Zbuduj Ujęcie: MiniMax H3 vs Veo 3.1, Krok po Kroku
Jeden działający przykład, od początku do końca. „Ostatni Gwizdek”: oryginalny nastoletni napastnik, rude włosy, biało-granatowy strój z numerem 9, światła stadionu, szybki panoramiczny ruch przy uderzeniu i japońska plansza tytułowa, która musi pojawić się w ostatnich dwóch sekundach i pozostać stabilna.
Żaden prawdziwy zawodnik, żadna oficjalna postać, żadne istniejące IP anime. Tylko styl i hołd. Więcej o tym za chwilę.
Krok 1: Zaprojektuj klatkę kluczową anime za pomocą GPT Image 2
Klatka kluczowa niesie kierunek artystyczny, więc model wideo nie musi go wymyślać. Zwróć uwagę na ujemną przestrzeń w lewej trzeciej części: jest celowa. Plansza tytułowa zostanie tam napisana przez model wideo i to jest test stabilności tekstu.
Plain1Pojedyncza klatka z nowoczesnego shonen sportowego anime. Animacja 2D z cieniowaniem cel-shading, ręcznie tuszowane linie o stałej grubości, płaskie wypełnienia kolorem, ostre graficzne cienie, absolutnie żadnego cieniowania 3D i żadnej fotorealistycznej skóry. Zbliżenie na oryginalnego nastoletniego napastnika: rozczochrane ciemnorude włosy, biało-granatowy strój z numerem 9, pot i smugi trawy na jednym policzku, oczy szeroko otwarte z wyczerpaną determinacją, usta otwarte w środku okrzyku. Za nim, światła stadionu rozbłyskują w ścianę rozmazanego koloru tłumu; promieniste linie prędkości wybuchają ze środka kadru; jedno źdźbło trawy wisi zamrożone w powietrzu. Nasycona paleta, głębokie cyjanowe cienie, ciepłe pomarańczowe światło konturowe. Kompozycja 16:9, postać wyśrodkowana po prawej stronie, czysta ujemna przestrzeń w lewej trzeciej części. Żadnego tekstu w obrazie.
Ustawienia: model openai/gpt-image-2/text-to-image, jakość high, rozmiar 16:9 (2048x1152). Nic więcej.

Środowisko GPT Image 2 na Atlas Cloud z promptem klatki kluczowej Last Whistle i gotową klatką anime w panelu wyjściowym
GPT Image 2 na Atlas Cloud: jakość ustawiona na wysoką, gotowa klatka kluczowa po prawej.

Podstawowa klatka kluczowa anime: oryginalny rudowłosy napastnik w środku okrzyku pod światłami stadionu, cieniowanie cel-shading z płaskim kolorem i liniami prędkości
Klatka kluczowa, którą otrzymują oba modele. Płaski kolor, ostre cienie i pusta lewa trzecia część czekająca na planszę tytułową.
Krok 2: MiniMax H3 obraz-do-wideo, wszystko ustawione na maksimum
To samo zdjęcie wejściowe, 2K na wyjściu. Trzymałem H3 przy 8 sekundach tutaj tylko po to, by dopasować się do limitu Veo. To nie jest limit H3, a Krok 4 zdejmie górną granicę.
Plain1Animacja 2D z cieniowaniem cel-shading, ręcznie tuszowana grubość linii, płaski kolor, bez cieniowania 3D. Przytrzymaj twarz napastnika przez jedno uderzenie, a następnie gwałtowny panoramiczny ruch podąża za piłką, gdy uderza, rozmazując kadr w smugi sakuga. Jedna klatka całkowitej ciszy w momencie uderzenia. W ciągu ostatnich dwóch sekund odważne białe japońskie litery tytułowe ラストホイッスル wbijają się w lewą trzecią część kadru i pozostają nieruchome, bez zniekształceń, migotania, dryfu. Napastnik krzyczy jedną kwestię po japońsku: 「まだ終わってない!」. Dźwięk: narastający ryk stadionu, pojedynczy ostry dźwięk uderzenia piłki, niski dźwięk taiko pod planszą tytułową.
Ustawienia: model minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (obraz-do-wideo pobiera kształt klatki z obrazu wejściowego), image = wynik Kroku 1.
Jedno ostrzeżenie, jeśli przejdziesz do text-to-video: napisz ratio: 16:9 jawnie. Domyślnie jest 1:1 i chętnie da ci kwadratowy wycinek anime.

Środowisko MiniMax H3 obraz-do-wideo na Atlas Cloud z promptem Last Whistle, załadowaną klatką kluczową i gotowym klipem w panelu wyjściowym
MiniMax H3 obraz-do-wideo na Atlas Cloud: klatka kluczowa z Kroku 1 załadowana po lewej, gotowy klip odtwarzany po prawej.
Krok 3: Veo 3.1 obraz-do-wideo, dźwięk włączony ręcznie
Prompt jest identyczny, słowo w słowo. Zmiana jednego przymiotnika przestaje być porównaniem. Zmienia się dodatkowe pole, które daje Ci Veo, a H3 nie.
negative_prompt, który w przypadku anime 2D jest najpotężniejszą kontrolą na tej liście:
Plain13D render, CGI, plástikowe cieniowanie, fotorealistyczna skóra, materiał live action, zupa rozmycia ruchu, zniekształcone litery, niezrozumiały tekst, dodatkowe palce, pasek napisów
Ustawienia: model google/veo3.1/image-to-video, resolution: 1080p (zmień to, domyślnie jest 720p), duration: 8 (to jest górna granica), aspect_ratio: 16:9, generate_audio: true (domyślnie API to false, to jest pułapka cichego klipu), seed: 20260807, image = ten sam wynik Kroku 1.

Środowisko Veo 3.1 obraz-do-wideo na Atlas Cloud z włączoną opcją generate audio, załadowaną klatką kluczową anime i gotowym klipem w panelu wyjściowym
Veo 3.1 obraz-do-wideo na Atlas Cloud, z włączoną opcją Generate Audio i gotowym klipem po prawej.
Krok 4: Ocen na pięciu osiach specyficznych dla anime
Nic do generowania. Po prostu spójrz na rzeczy, które rzeczywiście psują się w anime. Oba klipy są osadzone w pobliżu początku tego artykułu, więc możesz je sam ocenić, zamiast polegać na moim słowie.

Ostatnia klatka z obu klipów obok siebie, MiniMax H3 po lewej z czystymi japońskimi literami tytułowymi, Veo 3.1 po prawej z zniekształconymi pionowymi znakami
Ostatnia klatka każdego klipu. Po lewej H3 napisał ラストホイッスル, wszystkie osiem znaków katakana poprawnych i stabilnych. Po prawej Veo 3.1 napisał trzy znaki, które nie są żądanym słowem i nie tworzą go.
Plansza tytułowa to miejsce, w którym rozstrzygnięto rundę, i nie było blisko. H3 wyrenderował żądane katakana dokładnie, ostro i stabilnie, na rozmazanym panoramie bramki. Veo 3.1 wyprodukował pionowy stos trzech znaków, które nie są ani żądanym słowem, ani słowem. W tej samej klatce upuścił też postać poza kadr i pozwolił, by tło przesunęło się w stronę półfotorealistycznej płyty stadionu, mimo że photorealistic skin i 3D render znajdowały się w negatywnym prompcie.
Tabela 3: Pięć osi decydujących o ujęciu anime, z tych dwóch przebiegów
| Oś | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Ciągłość postaci z klatki kluczowej | Utrzymał dokładną twarz, włosy i strój przez pełne 8 sekund | Przerysował postać w nowym szerokim ujęciu, zgodnie z modelem, ale innym rysunkiem |
| Grubość linii i płaskie cieniowanie cel-shading | Utrzymane, bez dryfu w stronę 3D | Utrzymane w średnim ujęciu, pod koniec dryf w stronę fotograficznej płyty stadionu |
| Japońska plansza tytułowa | ラストホイッスル wyrenderowane poprawnie i stabilnie | Trzy znaki, nie żądane słowo, nie słowo |
| Dostarczony ścieżka dźwiękowa | 32 kHz stereo, dokładnie jak podaje karta modelu | 48 kHz stereo, obecne tylko dlatego, że sam ustawiłem generate_audio |
| Panoramiczny ruch i smuga sakuga | Wykonane jako rozmazany panoramiczny ruch w planszę | Zastąpione ostrym cięciem do nowego ustawienia |
Ten ostatni wiersz to najgłośniejsza publiczna krytyka H3 do tej pory, co jest dokładnie powodem, dla którego napisałem go w obu promptach. W wątku ComfyUI z dnia 0, użytkownik fwip narzekał, że nawet oficjalne demo promptów zostało zignorowane: „gwałtowny PANORAMICZNY RUCH z dachu, który ROZMAZUJE unoszące się słowa, motion-streaked. A wideo po prostu nie zrobiło żadnego z tych przejść, zastąpiło je cięciem.”
W tym przebiegu to Veo zamienił panoramiczny ruch na cięcie, a H3 zrobił smugi. Każdy po jednym ujęciu to nie werdykt i nie twierdziłbym inaczej. Ale oznacza to, że krytyka nie jest specyficzna dla H3: panoramiczne ruchy są najmniej niezawodną instrukcją w całym teście po obu stronach. Jeśli twój storyboard opiera się na jednym, zaplanuj go wokół niego, a nie przez niego.
Krok 5: Ujęcie retro OVA 4:3, którego Veo 3.1 strukturalnie nie może wygenerować
To nie jest preferencja jakościowa. To mur. Enum aspect_ratio Veo ma dwie wartości i żadna nie jest 4:3, a enum duration nie ma 12. Wygląd OVA z lat 90. jest po prostu nieosiągalny.
Plain1Ujęcie anime OVA z lat 90., 4:3 pełna klatka. Ręcznie malowane tło z widoczną fakturą pędzla, postacie z cel-paint z grubymi nierównymi liniami tuszu, silna poświata halation wokół świateł stadionu, ziarno filmu 16 mm i delikatne drganie bramki. Ten sam rudowłosy napastnik w biało-granatowym stroju z numerem 9 schodzi z deszczowej murawy, gdy szum tłumu cichnie do pojedynczego dźwięku dzwonka. Kamera powoli najeżdża na jego twarz. Mówi cicho po japońsku: 「次は、勝つ」. Retro paleta: stonowany turkus, zakurzony bursztyn, głębokie bordowe cienie. Dźwięk: odległy deszcz, samotny syntezator analogowy, jeden gwizdek z pogłosem w oddali.
Ustawienia: model minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Ustaw te proporcje ręcznie, pamiętaj o domyślnym.

Środowisko MiniMax H3 text-to-video na Atlas Cloud z wpisanym promptem OVA i gotowym retro klipem w panelu wyjściowym
MiniMax H3 text-to-video na Atlas Cloud, wpisany prompt OVA, klip ukończony. Pełne ujawnienie: to konkretne uruchomienie pozostawiło Aspect Ratio na 16:9 i Duration na 8, więc to, co widzisz po prawej, to panoramiczna krótka wersja. Dwunastosekundowe ujęcie 4:3 poniżej pochodzi z wywołania API z jawnie ustawionymi ratio: 4:3 i duration: 12.

Retro ujęcie OVA 4:3: ten sam napastnik schodzący z deszczowej murawy w stylu anime z lat 90.
H3 text-to-video, 4:3, 12 sekund. Dostarczony plik miał rozdzielczość 1920x1440, co jest dokładnie 4:3, z 32 kHz stereo. Pokazany tutaj jako cichy GIF w zmniejszonej liczbie klatek na sekundę, aby strona była lekka. Wygenerowane za pomocą minimax/h3/text-to-video na Atlas Cloud.
Krok 6: Dziewięć obrazów referencyjnych, jedna postać, cztery ujęcia
Spójność postaci między ujęciami to najtrudniejszy problem w AI anime i jest rozwiązywany za pomocą ilości referencji. Najpierw zbuduj pakiet: uruchom ponownie prompt z Kroku 1, zmieniając kadrowanie na przód, trzy czwarte, pełny profil, tył, śmiech, zaciśnięte zęby, pełna sylwetka, szczegóły stroju i butów. Dziewięć obrazów, łącznie około osiem centów.

Cztery kąty tej samej oryginalnej postaci napastnika wygenerowane jako pakiet referencyjny, ułożone w siatkę dwa na dwa
Cztery z dziewięciu kątów referencyjnych. H3 przyjmuje do dziewięciu obrazów w jednym pakiecie referencyjnym, plus dodatkowo referencje wideo i audio.
Plain1Animacja 2D z cieniowaniem cel-shading, spójna ręcznie tuszowana grubość linii, płaski kolor, bez cieniowania 3D. Zachowaj twarz referencyjnego napastnika, sylwetkę włosów i strój z numerem 9 identyczne w każdym ujęciu. Cztery ujęcia w jednym ciągłym ujęciu: (1) niski kąt najeżdżający na jego buty uderzające o murawę, (2) panoramiczny ruch w górę do ciasnego zbliżenia oczu, (3) szerokie ujęcie jego sprintu obok trzech obrońców narysowanych jako rozmazane sylwetki, (4) zamrożenie na uderzeniu głową w powietrzu, linie prędkości wybuchające na zewnątrz. Dźwięk: ryk tłumu, oddech, uderzenia butów o murawę, jeden dźwięk taiko na zamrożeniu.
Ustawienia: model minimax/h3/reference-to-video, refers = twoje obrazy z type: image, resolution: 2K, duration: 8 lub wyższe, ratio: adaptive lub 16:9.
Odpowiednik Veo 3.1 nie może być uruchomiony przy tych ustawieniach i nie musisz próbować, aby wiedzieć dlaczego. Jego endpoint referencyjny akceptuje maksymalnie trzy obrazy, a wybór tego endpointu zwija duration do pojedynczej dozwolonej wartości 8. Dziewięcioobrazowy pakiet i 10-sekundowe ujęcie są poza zasięgiem.

Środowisko MiniMax H3 reference-to-video na Atlas Cloud pokazujące licznik referencji na czterech z dziewięciu i pierwsze ujęcie w panelu wyjściowym
MiniMax H3 reference-to-video na Atlas Cloud. Licznik pokazuje Reference Materials (4/9) z MAX:9 poniżej, co jest limitem w interfejsie, a nie twierdzeniem z arkusza specyfikacji. Wyjściem jest ujęcie pierwsze, niski kąt najeżdżający na buty.
Cztery Więcej Przebiegów MiniMax H3 Anime Video Generator Wartych Wykonania
Ujęcie Last Whistle obciąża tylko cztery z różnic. Te cztery obciążają resztę. Wszystkie działają na H3; notatki mówią, które Veo 3.1 może dopasować.
- Ultrapanoramiczna walka sakuga,
21:9, 10 sekund. Veo w ogóle nie może wygenerować 21:9.
Plain1Animacja akcji 2D z cieniowaniem cel-shading, grube zwężające się linie tuszu, płaski kolor, ostre cienie, bez cieniowania 3D. Dwóch oryginalnych zamaskowanych pojedynkowiczów na wietrznym dachu świątyni o zmierzchu. Zderzenie ostrzy, kadr drży, obaj wojownicy rozdzielają się w wybuchu ręcznie rysowanych klatek uderzenia i promienistych linii prędkości. Kamera: niski kąt najeżdża, potem boczny tor, potem przeskok do szerokiej sylwetki na pomarańczowym niebie. Dźwięk: dwa ostre metaliczne zderzenia, trzask tkaniny, niski dźwięk taiko na końcowym zamrożeniu, bez muzyki.
- Ujęcie AMV zsynchronizowane z beatem, reference-to-video z referencją audio. H3 przyjmuje do trzech klipów audio jako wejście referencyjne. Veo 3.1 nie ma żadnego wejścia audio, tylko wyjście audio.
Plain1Montaż anime 2D z cieniowaniem cel-shading przycięty do referencyjnego utworu audio. Pięć krótkich beatów: deszcz na oknie, ręka zaciskająca bandaż, panorama miasta migająca za oknem pociągu, start sprintu, zamrożenie na wyciągniętej dłoni. Każde ujęcie trafia dokładnie na akcent referencyjnego dźwięku. Płaski kolor, grube linie tuszu, wysokokontrastowa nocna paleta głębokiego indygo i neonowej magenty.
- Scena dialogowa po japońsku w dwóch linijkach, 12 sekund. To test synchronizacji ust, a 12 sekund jest już poza zakresem Veo.
Plain1Animacja 2D z cieniowaniem cel-shading, płaski kolor, bez cieniowania 3D. Dwie oryginalne postacie na dachu o złotej godzinie, ujęcie przeciwne. Pierwsza mówi po japońsku: 「本当に行くの?」. Druga odpowiada, z półuśmiechem, po japońsku: 「もう決めた」. Usta pasują do każdej sylaby. Ciepłe światło konturowe, długie cienie, delikatny wiatr we włosach. Dźwięk: dwa wyraźne japońskie głosy, odległy ruch uliczny, jedna cykada.
- Pionowy krótki shonen,
9:16, 8 sekund. Oba modele mogą robić pion, więc to jedyne miejsce, aby faktycznie je porównać A/B, a nie zakładać.
Plain1Animacja 2D z cieniowaniem cel-shading, pionowa kompozycja. Oryginalna nastoletnia biegaczka przebija się przez papierowy transparent w zwolnionym tempie, a następnie kadr wraca do pełnej prędkości, gdy przyspiesza na stadionowej prostej. Linie prędkości, płaski kolor, ostre cienie, odważne graficzne niebo. Kamera: niski kąt podążający, potem panoramiczny ruch w górę na jej twarz. Dźwięk: darcie transparentu, napływ tłumu, jeden wstrzymany, a potem wypuszczony oddech. 2 3Jeśli chcesz gramatykę promptów stojącą za tymi, [przewodnik po promptach MiniMax H3](https://www.atlascloud.ai/blog/guides/minimax-h3-prompt-guide?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) zagłębia się bardziej w to, jak H3 analizuje instrukcje kamery i dźwięku, niż mogę tutaj. 4 5## Ile Kosztuje 60-sekundowe Opening Anime na MiniMax H3 vs Veo 3.1 6 7Standardowe OP anime trwa około 90 sekund. Załóżmy osiem ujęć po 8 sekund, 64 sekund gotowego wideo, plus jedna klatka kluczowa na ujęcie po $0.009 każda. 8 9Istnieje prawdziwa rozbieżność cenowa, o której powinieneś wiedzieć, zamiast abym ją zamiatanywał. Katalog Atlas Cloud podaje MiniMax H3 na $0.10 za sekundę, podczas gdy readme modelu rozbija to na $0.14/s przy 2K i $0.10/s przy 768P. Veo 3.1 jest wymieniony na $0.20 za sekundę, podczas gdy jego readme oddziela $0.40/s z dźwiękiem od $0.20/s bez. 10 11Przyciski uruchamiania na moich zrzutach ekranu to rozstrzygają. H3 reference-to-video, 8 sekund przy 2K, wycenione na `Run $1.12`, co jest dokładnie $0.14 za sekundę. Veo 3.1 image-to-video, 8 sekund przy 1080p z dźwiękiem włączonym, wycenione na `Run $3.2`, co jest dokładnie $0.40 za sekundę. Zatem stawki z readme są tymi, które są fakturowane, a nagłówek katalogu to poziom wejścia. Poniżej pokazałem oba odczyty. Są to ceny katalogowe według stanu na sierpień 2026. 12 13**Tabela 4: Osiem ujęć po 8 sekund, z klatkami kluczowymi** 14 15| Konfiguracja | Koszt wideo (stawka katalogowa) | Koszt wideo (stawka z readme) | Klatki kluczowe | Zakres całkowity | 16| ------------------------- | ------------------------- | ------------------------ | --------- | ---------------- | 17| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 do $9.03 | 18| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 | 19| Veo 3.1, 1080p z dźwiękiem | $12.80 | $25.60 | $0.07 | $12.87 do $25.67 | 20| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 | 21 22Ceny pobrane ze stron modeli Atlas Cloud wymienionych w Tabeli 1, sierpień 2026. Żadna z tych czterech nie jest obecnie objęta zniżką. 23 24Dwie rzeczy, których ta tabela nie uwzględnia, a obie uderzają mocniej niż stawka za sekundę. 25 26**Ponowne próby.** Nikt nie wysyła pierwszego ujęcia anime. Jakikolwiek mnożnik założysz, zastosuj go do obu kolumn, a luka powiększy się w tej samej proporcji. 27 28**Czas rzeczywisty, a ten idzie w drugą stronę.** Zmierzony od początku do końca 7 sierpnia 2026: H3 przy 2K przez 8 sekund zajął 447 sekund, około 7,5 minuty. H3 text-to-video przy 2K przez 12 sekund zajął 334 sekundy. Veo 3.1 przy 1080p przez 8 sekund z dźwiękiem zajął 152 sekundy, poniżej trzech minut. Veo jest tutaj około trzy razy szybsze do pierwszej wersji, a jeśli iterujesz nad ujęciem o 2 w nocy, to jest warte prawdziwych pieniędzy. Kolejki się zmieniają, więc traktuj to jako migawkę z jednego popołudnia, a nie specyfikację. Ale każdy, kto cytuje „2 do 3 minut” dla H3 przy 2K, cytuje readme, a nie kolejkę. [Porównanie 2K vs 768P](https://www.atlascloud.ai/blog/guides/minimax-h3-2k-vs-768p?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) omawia, kiedy wyższy poziom jest wart dodatkowych minut. 29 30## Styl Anime, Hołd i Co Możesz Faktycznie Opublikować 31 32Wszystko w tym artykule to styl i hołd. Oryginalna postać, oryginalny strój, oryginalny tytuł. Nie wygenerowano ani nie żądano żadnej oficjalnej postaci anime, ani nie użyto imienia ani podobizny żadnego prawdziwego piłkarza. Trend Mistrzostw Świata jest przywoływany jako _format_, ponieważ właśnie do tego jest przydatny. 33 34To rozróżnienie nie jest ozdobnikiem. Jeśli produkujesz treści w stylu anime komercyjnie, „w stylu OVA z lat 90.” i „ta konkretna postać z tego konkretnego serialu” to różne obiekty prawne i tylko jeden z nich jest biznesem. 35 36W kwestii otwartych wag: H3 jest naprawdę do pobrania i ludzie uruchomili go pierwszego dnia. Jeden komentator zgłosił 10 minut na 10-sekundowy klip 480p na 4070 Ti Super z 16 GB, a inni podali 3 minuty na 5080 i 68 sekund na RTX 6000 Pro. Ale samodzielne hostowanie działa na krótkim boku 768; etapy Context-IR i Regenerate-2K, które produkują 2K, pozostają po stronie API. 37 38Licencja ma prawdziwy haczyk. Licencja społecznościowa nie obejmuje obecnie UE, Wielkiej Brytanii, Korei Południowej ani Stanów Zjednoczonych, powołując się na regiony „obecnie opracowujące lub egzekwujące przepisy związane z AI”. Kanał formalnego wniosku o licencję jest otwarty, co jeden komentator HN podsumował jako „musisz tylko obiecać na różowej torebce, że nie rozgniewasz Disneya, a wyślą ci licencję”. Zabawne, a także dokładnie ten krok zgodności, którego nie możesz pominąć, jeśli jesteś na jednym z tych czterech terytoriów. [Artykuł o otwartych wagach](https://www.atlascloud.ai/blog/guides/minimax-h3-open-source-weights?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) zawiera pełną listę terytoriów. 39 40## Często Zadawane Pytania 41 42### Czy MiniMax H3 to dobry generator wideo anime w porównaniu do Veo 3.1? 43 44Do większości prac anime, H3, głównie z powodów niezwiązanych z renderowaniem. Działa od 4 do 15 sekund w porównaniu do 4, 6 lub 8 Veo, oferuje sześć proporcji obrazu, w tym 4:3 i 21:9, w porównaniu do dwóch Veo, wymienia japoński wśród 11 natywnie stabilnych języków dialogowych i przyjmuje dziewięć obrazów referencyjnych w porównaniu do trzech Veo. Veo 3.1 wygrywa w jednej konkretnej sytuacji: gdy potrzebujesz `seed` do powtarzalnych prób lub `negative_prompt`, aby powstrzymać ujęcie przed dryfowaniem w stronę cieniowania 3D. H3 nie ma żadnego z tych parametrów. Jeśli Twój pipeline zależy od któregokolwiek z nich, jest to prawdziwy powód, aby zostać. 45 46### Czy Veo 3.1 może generować anime w 4:3 lub 15-sekundowy klip? 47 48Nie, i to nie z powodów stylistycznych. Enum `aspect_ratio` Veo 3.1 zawiera dokładnie `16:9` i `9:16`, a jego enum `duration` zawiera dokładnie `4`, `6` i `8`. Nie ma wartości 4:3 do wyboru i nie ma możliwości zażądania 12 lub 15 sekund. Jeśli Twoim odniesieniem jest anime telewizyjne lub OVA z lat 90., kadrowanie jest poza zasięgiem Veo i dostępne na H3. 49 50### Dlaczego mój klip anime Veo 3.1 wrócił cichy? 51 52Ponieważ `generate_audio` domyślnie to `false` w API. Przełącznik w środowisku jest zwykle już włączony, więc to dotyczy tylko osób wywołujących API bezpośrednio. Ustaw `generate_audio: true` jawnie. Przy okazji ustaw też `resolution`, ponieważ domyślnie jest `720p`, a nie 1080p lub 4k, które prawdopodobnie miałeś na myśli. 53 54### Czy MiniMax H3 obsługuje japoński dialog i synchronizację ust dla anime? 55 56Tak. Karta modelu wymienia 11 języków ze stabilnym wsparciem dialogowym: arabski, chiński, angielski, francuski, niemiecki, włoski, japoński, koreański, portugalski, rosyjski i hiszpański. Dźwięk jest generowany łącznie z obrazem w 32 kHz stereo, a nie dubbingowany później, dlatego czas otwierania ust utrzymuje się przez całą linię, a nie tylko pierwsze kilka sylab. Napisz japońską kwestię bezpośrednio w prompcie po japońsku. 57 58### Ile obrazów referencyjnych mogę użyć, aby zachować spójność postaci anime? 59 60MiniMax H3 przyjmuje do 9 obrazów, do 3 klipów wideo i do 3 klipów audio, z twardym limitem 12 plików wszystkich typów. Endpoint reference-to-video Veo 3.1 przyjmuje od 1 do 3 obrazów, a wybranie go zwija `duration` do `8` jako jedynej dozwolonej wartości. W przypadku powracającej postaci anime w serii ta różnica to cała gra. 61 62### MiniMax H3 ma otwarte wagi, więc czy mogę uruchomić mój pipeline anime lokalnie za darmo? 63 64Możesz go pobrać i uruchomić, z trzema zastrzeżeniami. Samodzielne hostowanie działa na krótkim boku 768, a etapy Context-IR i Regenerate-2K, które produkują 2K, pozostają po stronie API. Rzeczywiste lokalne prędkości różnią się znacznie w zależności od karty: około 10 minut na 10-sekundowy klip 480p na 4070 Ti Super, około 3 minuty na 5080, około 68 sekund na RTX 6000 Pro, zgodnie z wątkiem ComfyUI z dnia 0. A licencja społecznościowa nie obejmuje obecnie UE, Wielkiej Brytanii, Korei Południowej ani USA, więc jeśli jesteś na jednym z tych terytoriów, potrzebujesz formalnej licencji przed użyciem komercyjnym.






