Całe lato mój feed odtwarzał w pętli ten sam film. Zawodnicy Pucharu Świata przerysowani na bohaterów shonen. Dyktator. Kapitan piratów. Ogorzały mentor, który pojawia się w ostatnich czterech sekundach. Miliony wyświetleń na post, a fabuła aktualizuje się po prawie każdym meczu.
Nikt, kto to tworzy, nie pisze postów benchmarkowych. Wybierają model, palą kredyty i wrzucają przed kolejnym gwizdkiem.
Wziąłem więc jedną klatkę anime i jeden prompt, i przetestowałem MiniMax H3 jako generator wideo anime przeciwko Veo 3.1, oba ustawione na maksymalne ustawienia na identycznych wejściach.
Pierwszą rzeczą, która się zepsuła, nie była jakość obrazu. To było rozwijane menu. Veo 3.1 zatrzymuje się na 8 sekundach i oferuje dokładnie dwa proporcje. Ujęcie, które trzyma na twarzy, robi szybki panoramiczny ruch z piłką, a potem pozwala na pojawienie się planszy tytułowej, nie mieści się w 8 sekundach. Nigdy nie miało szansy zawieść na jakości.
Kluczowe wnioski
durationw Veo 3.1 to enum[4, 6, 8], aaspect_ratioto enum[16:9, 9:16]. MiniMax H3 obsługuje dowolną pełną sekundę od 4 do 15 i oferuje21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Brak 4:3 w Veo oznacza brak retro oprawy OVA, w ogóle.- Karta modelu H3 wymienia 11 rodzimych stabilnych języków dialogowych, a japoński jest jednym z nich. Audio i obraz są generowane razem w stereo 32 kHz, a nie dubbingowane później.
- Paczki referencyjne nie są zbliżone: H3 przyjmuje do 9 obrazów plus do 3 filmów i 3 klipów audio (maks. 12 plików). Endpoint referencyjny Veo 3.1 przyjmuje 3 obrazy, a gdy go użyjesz,
durationzwija się do tylko[8]. - Dwie pułapki, które po cichu psują testy: API Veo domyślnie ustawia
generate_audionafalse, aresolutionna720p, a H3 w text-to-video domyślnie ustawiarationa1:1. Jeśli je zostawisz, porównujesz cichy klip 720p z kwadratowym. - Veo 3.1 ma dwie rzeczy, których H3 w ogóle nie ma:
seedinegative_prompt. W przypadku 2D anime to drugie ma naprawdę znaczenie, i pokażę gdzie.
Generator wideo anime MiniMax H3 vs Veo 3.1, ta sama klatka jeden po drugim
Jedna oryginalna postać. Jedna klatka. Jeden prompt, skopiowany znak po znaku do obu modeli. Wszystko inne ustawione na maksimum po obu stronach.
MiniMax H3, image-to-video, 2K, 8 sekund, natywne audio. Włącz dźwięk: szum tłumu, uderzenie piłki i japoński okrzyk są generowane w tym samym przebiegu co obraz. Wygenerowane za pomocą minimax/h3/image-to-video na Atlas Cloud.
Veo 3.1, image-to-video, 1080p, 8 sekund, generateaudio włączone ręcznie, plus negativeprompt trzymający płaską kreskę. Ta sama pierwsza klatka, te same słowa. Wygenerowane za pomocą google/veo3.1/image-to-video na Atlas Cloud.
Oba rysują pięknie. Szerokie ujęcie Veo z uderzeniem, z ręcznie rysowanymi liniami uderzenia i efektem dźwiękowym z mangi unoszącym się w powietrzu, jest naprawdę urocze. To jest uczciwy punkt wyjścia i dlatego reszta tego artykułu dotyczy parametrów i podążania za instrukcjami, a nie ogólnego wrażenia.
Dlaczego większość testów generatora wideo anime MiniMax H3 vs Veo 3.1 idzie źle
Tego lata wydarzyły się dwie rzeczy naraz.
Anime stało się najbardziej popularnym formatem w AI wideo. Puchar Świata 2026 został przepisany jako turniej shonen, z zawodnikami obsadzonymi jako dyktator, kapitan piratów, generał marynarki i mentor, a historie "ewoluują po prawie każdym meczu" na TikTok, Instagram, X i YouTube (Complex, lipiec 2026).
A MiniMax H3 został wydany z otwartymi wagami. Wątek ComfyUI z dnia 0 zdobył 330 punktów i 95 komentarzy, a ludzie w ciągu kilku godzin podawali rzeczywiste lokalne liczby (Hacker News, sierpień 2026).
Połącz to, a spodziewałbyś się stosu porównań anime. Prawie ich nie ma, ponieważ większość testów jest źle skonstruowana na jeden z czterech sposobów.
Porównują obrazy, a nie ograniczenia. Ujęcia anime to kwestia czasu. Szybki panoramiczny ruch do planszy tytułowej to problem z czasem trwania, zanim stanie się problemem renderowania.
Zapominają, że API Veo jest domyślnie ciche. W API generate_audio to false, a resolution to 720p. Wiele postów "Veo nie ma dźwięku w anime" to po prostu ktoś, kto nigdy nie przełączył boolean.
Zapominają, że H3 w text-to-video jest domyślnie kwadratowe. ratio domyślnie to 1:1, a nie 16:9. Uruchom prompt anime t2v bez ustawiania tego i otrzymasz kwadratowy klip i zagmatwany wniosek.
Testują z fotorealistycznymi promptami. "Kinowy, światło objętościowe, płytka głębia ostrości" to dokładnie słownictwo, które ciągnie model 2D w kierunku cieniowania renderu 3D. Tryb awarii w anime to nie rozmycie. To plastik.
Trzy ustawienia, które decydują o teście anime, zanim wciśniesz Run
Przed niczym innym ustaw je po obu stronach, w przeciwnym razie porównanie jest nieważne.
| Ustawienie | MiniMax H3 | Veo 3.1 | Co się stanie, jeśli je pominiesz |
|---|---|---|---|
| Audio | Generowane z obrazem, zawsze włączone | generate_audio domyślnie false | Veo zwraca cichy klip i wygląda gorzej niż jest |
| Kształt ramki | ratio domyślnie 1:1 w text-to-video | aspect_ratio domyślnie 16:9 | H3 daje kwadratowy wycinek anime, którego nie możesz użyć |
| Rozdzielczość | domyślnie 2K | domyślnie 720p | Porównujesz 2K z 720p i nazywasz to różnicą jakości |
Arkusz specyfikacji MiniMax H3 vs Veo 3.1 dla anime: długość, proporcje, audio, referencje
Wyciągnąłem żywe schematy wejściowe obu modeli, zamiast ufać jakimkolwiek postom premierowym. Każda wartość poniżej to enum, który możesz sam przeczytać na stronach modeli, a nie wrażenie.
Tabela 1: MiniMax H3 vs Veo 3.1, parametry decydujące o ujęciu anime
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Czas trwania | 4 do 15, co pełna sekunda (domyślnie 8) | 4, 6, 8 (domyślnie 8) |
| Proporcje | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Domyślne proporcje (text-to-video) | 1:01 | 16:09 |
| Rozdzielczość | 768P, 2K (domyślnie 2K) | 720p, 1080p, 4k (domyślnie 720p) |
| Audio | Generowane łącznie, stereo 32 kHz | generate_audio, domyślnie false |
| Natywne języki dialogowe | 11 stabilnych, w tym japoński | Nie opublikowane jako stabilna lista |
| Paczka referencyjna | do 9 obrazów, 3 filmy, 3 klipy audio, łącznie 12 plików | 3 obrazy |
| Czas trwania przy użyciu referencji | nadal 4 do 15 | zwija się do tylko 8 |
| seed | niedostępne | dostępne |
| negative_prompt | niedostępne | dostępne |
| Wagi | do pobrania | zamknięte |
Czas trwania, proporcje, rozdzielczość, audio i limity referencji są odczytane z żywych schematów na stronach MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video i Veo 3.1 reference-to-video. Limit 9 obrazów i 12 plików oraz lista 11 języków dialogowych pochodzą z karty modelu MiniMax H3 (Hugging Face, sierpień 2026).
Teraz tablice wyników, ponieważ mówią coś innego niż arkusz specyfikacji i obie są ważne.
Tabela 2: Elo głosów społeczności i cena za minutę, migawka z 7 sierpnia 2026
| Model | Text-to-video (z audio) | Image-to-video (z audio) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | nie wymieniony w top 10 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | nie wymieniony w top 10 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | nie wymieniony w top 10 | $4.80 |
Dane Elo i ceny z Artificial Analysis Video Arena (Artificial Analysis, sierpień 2026). Są to zmienne głosy społeczności i ulegają zmianie. Kolumna $/min to znormalizowane oszacowanie modelu, a nie twoja faktura.
Różnica 145 punktów Elo jest duża, ale jest to głos ogólnego przeznaczenia, a nie głos anime. I tu jest część, którą muszę powiedzieć wprost: MiniMax nie promuje H3 jako modelu anime. Wewnętrzne informacje zwrotne pierwszej linii wymieniają film, animację i komediodramat jako obszary, na które H3 nie jest ukierunkowany. Zatem interesujące pytanie nie brzmi "który jest modelem anime". Chodzi o to, dlaczego model, który nie sprzedaje się jako anime, wciąż wygrywa w ujęciu, i gdzie Google wciąż zabiera rundę.
Jedna praktyczna uwaga przed samouczkiem. Każdy model poniżej działa przez tę samą konsolę i ten sam klucz API, co jest jedynym powodem, dla którego parametry są w ogóle porównywalne. Ta sama kolejka, to samo uwierzytelnianie, jeden rachunek. Jeśli skonfigurujesz GPT Image 2 w jednej usłudze, a Veo w innej, połowa różnic, które znajdziesz, będzie wynikać z infrastruktury, a nie z modelu.
Zbuduj ujęcie: MiniMax H3 vs Veo 3.1, krok po kroku
Jeden działający przykład, od początku do końca. "Ostatni Gwizdek": oryginalny nastoletni napastnik, rude włosy, biało-granatowy komplet z numerem 9, światła stadionu, szybki panoramiczny ruch przy strzale i japońska plansza tytułowa, która musi pojawić się w ostatnich dwóch sekundach i pozostać nieruchoma.
Żaden prawdziwy zawodnik, żadna oficjalna postać, żadne istniejące IP anime. Tylko styl i hołd. Więcej o tym za chwilę.
Krok 1: Zaprojektuj klatkę anime za pomocą GPT Image 2
Klatka niesie ze sobą kierunek artystyczny, więc model wideo nie musi go wymyślać. Zwróć uwagę na negatywną przestrzeń w lewej jednej trzeciej: jest celowa. Plansza tytułowa zostanie tam napisana przez model wideo i to jest test stabilności tekstu.
Plain1Pojedyncza klatka z nowoczesnego sportowego anime shonen. Cel-shaded 2D animation, 2ręcznie tuszowana kreska o stałej grubości, płaskie wypełnienia kolorem, ostre 3graficzne cienie, absolutnie żadnego cieniowania 3D i żadnej fotorealistycznej skóry. 4Zbliżenie na oryginalnego nastoletniego napastnika: potargane ciemnorude włosy, 5biało-granatowy komplet z numerem 9, pot i smugi trawy na jednym policzku, szeroko 6otwarte oczy pełne wyczerpanej determinacji, otwarte usta w trakcie krzyku. Za nim, 7stadionowe reflektory rozbłyskują w ścianę rozmytego koloru tłumu; promieniste linie 8szybkości wybuchają ze środka kadru; jedno źdźbło trawy wisi zamrożone w powietrzu. 9Nasycona paleta, głębokie cyjanowe cienie, ciepła pomarańczowa krawędźowa poświata. 10Kompozycja 16:9, postać wyśrodkowana po prawej, czysta negatywna przestrzeń w lewej 11jednej trzeciej. Żadnego tekstu nigdzie w obrazie.
Ustawienia: model openai/gpt-image-2/text-to-image, jakość high, rozmiar 16:9 (2048x1152). Nic więcej.

Playground GPT Image 2 na Atlas Cloud z promptem klatki Ostatniego Gwizdka i gotową klatką anime w panelu wyjściowym
GPT Image 2 na Atlas Cloud: jakość ustawiona na high, gotowa klatka po prawej.

Bazowa klatka anime: oryginalny rudowłosy napastnik w trakcie krzyku pod stadionowymi reflektorami, cel-shaded z płaskim kolorem i liniami szybkości
Klatka, którą otrzymują oba modele. Płaski kolor, twarde cienie i pusta lewa jedna trzecia czekająca na planszę tytułową.
Krok 2: MiniMax H3 image-to-video, wszystko maksymalnie
To samo zdjęcie w, 2K na zewnątrz. Trzymałem H3 do 8 sekund tutaj tylko po to, aby dopasować się do limitu Veo. To nie jest limit H3, a Krok 4 zdejmuje górną granicę.
Plain1Cel-shaded 2D anime, ręcznie tuszowana grubość kreski, płaski kolor, bez cieniowania 3D. 2Przytrzymaj na twarzy napastnika przez jedno uderzenie, potem gwałtowny szybki 3panoramiczny ruch podąża za piłką, gdy uderza, panoramowanie rozmazuje kadr w 4smugi sakuga motion trails. Jedna klatka całkowitej ciszy w momencie uderzenia. W 5ciągu ostatnich dwóch sekund, odważne białe japońskie litery tytułowe czytające 6ラストホイッスル pojawiają się w lewej jednej trzeciej kadru i pozostają nieruchome, 7bez wypaczeń, bez migotania, bez dryfowania. Napastnik krzyczy jedną kwestię po japońsku: 8「まだ終わってない!」 Audio: narastający ryk stadionu, jeden ostry dźwięk uderzenia 9piłki, niski dźwięk taiko pod planszą tytułową.
Ustawienia: model minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video przyjmuje kształt ramki z twojego obrazu wejściowego), image = wynik z Kroku 1.
Jedno ostrzeżenie, jeśli przejdziesz zamiast tego do text-to-video: napisz jawnie ratio: 16:9. Wartość domyślna to 1:1 i chętnie da ci kwadratowy wycinek anime.

Playground MiniMax H3 image-to-video na Atlas Cloud z promptem Ostatniego Gwizdka, załadowaną klatką i gotowym klipem w panelu wyjściowym
MiniMax H3 image-to-video na Atlas Cloud: klatka z Kroku 1 załadowana po lewej, gotowy klip odtwarzany po prawej.
Krok 3: Veo 3.1 image-to-video, audio włączone ręcznie
Prompt jest identyczny, słowo w słowo. Zmień jeden przymiotnik, a przestaje to być porównanie. Zmienia się natomiast dodatkowe pole, które daje Veo, a H3 nie.
negative_prompt, który w przypadku 2D anime jest najważniejszą kontrolą na tej liście:
Plain13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
Ustawienia: model google/veo3.1/image-to-video, resolution: 1080p (zmień, domyślnie jest 720p), duration: 8 (to jest sufit), aspect_ratio: 16:9, generate_audio: true (domyślnie API to false, to jest pułapka cichego klipu), seed: 20260807, image = ten sam wynik z Kroku 1.

Playground Veo 3.1 image-to-video na Atlas Cloud pokazujący włączone generate audio, załadowaną klatkę anime i gotowy klip w panelu wyjściowym
Veo 3.1 image-to-video na Atlas Cloud, z włączonym Generate Audio i gotowym klipem po prawej.
Krok 4: Ocen na pięciu osiach specyficznych dla anime
Nic do generowania. Po prostu spójrz, na rzeczy, na których anime faktycznie się psuje. Oba klipy są osadzone na początku tego artykułu, więc możesz je ocenić sam, zamiast wierzyć mi na słowo.

Porównanie obok siebie ostatniej klatki z obu klipów, MiniMax H3 po lewej z czystym japońskim napisem tytułowym, Veo 3.1 po prawej z pomieszanymi pionowymi znakami
Ostatnia klatka każdego klipu. Po lewej H3 napisał ラストホイッスル, wszystkie osiem znaków katakana poprawnie i nieruchomo. Po prawej Veo 3.1 napisało trzy znaki, które nie są żądanym słowem i nie tworzą żadnego.
Plansza tytułowa to miejsce, w którym rozstrzygnęła się runda, i nie było blisko. H3 oddał żądane katakana dokładnie, ostro i stabilnie, na tle rozmytego panoramowania bramki. Veo 3.1 wyprodukowało pionowy stos trzech znaków, które nie są ani żądanym słowem, ani słowem. Na tej samej klatce usunęło również postać z kadru i pozwoliło, aby tło przesunęło się w kierunku półfotorealistycznego zdjęcia stadionu, pomimo photorealistic skin i 3D render w negatywnym prompcie.
Tabela 3: pięć osi decydujących o ujęciu anime, z tych dwóch przebiegów
| Oś | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Ciągłość postaci z klatki | Utrzymał dokładną twarz, włosy i komplet przez pełne 8 sekund | Przerysował postać w nowym szerokim ujęciu, zgodnie z modelem, ale innym rysunkiem |
| Grubość kreski i płaskie cieniowanie cel-shaded | Utrzymane, bez dryfu w kierunku 3D | Utrzymane w średnim ujęciu, pod koniec przesunięte w kierunku fotograficznego zdjęcia stadionu |
| Japońska plansza tytułowa | ラストホイッスル wyrenderowane poprawnie i stabilnie | Trzy znaki, nie żądane słowo, nie słowo |
| Dostarczona ścieżka audio | Stereofoniczny 32 kHz, dokładnie jak w karcie modelu | Stereofoniczny 48 kHz, obecny tylko dlatego, że sam ustawiłem generate_audio |
| Szybki pan i rozmycie sakuga | Wykonane jako rozmyte panoramowanie w planszę tytułową | Zastąpione twardym cięciem do nowej konfiguracji |
Ten ostatni wiersz to najgłośniejsza publiczna krytyka H3 do tej pory, i właśnie dlatego napisałem to w obu promptach. W wątku ComfyUI z dnia 0 użytkownik fwip narzekał, że nawet oficjalne demo promptów zostało zignorowane: "gwałtowny WHIP PAN z dachu, który rozmazuje unoszące się słowa ze sobą, z smugami ruchu. A film po prostu nie zrobił żadnego z tego przejścia, zastąpił je cięciem."
W tym przebiegu to Veo zamieniło panoramowanie na cięcie, a H3 zrobił smugi. Po jednym ujęciu każdy to nie werdykt i nie twierdzę inaczej. Ale oznacza to, że krytyka nie jest specyficzna dla H3: szybkie panoramowania są najmniej niezawodną instrukcją w całym tym teście po obu stronach. Jeśli twój storyboard na nich polega, zaplanuj wokół nich, a nie przez nie.
Krok 5: Retro ujęcie OVA 4:3, którego Veo 3.1 strukturalnie nie może wyprodukować
To nie jest preferencja jakościowa. To ściana. Enum aspect_ratio Veo ma dwie wartości i żadna z nich nie jest 4:3, a jego enum duration nie ma 12. Wygląd OVA z lat 90. jest po prostu nieosiągalny.
Plain1Ujęcie anime OVA z lat 90., 4:3 full-frame. Ręcznie malowane tło z widoczną fakturą 2pędzla, cel-paint postaci z grubymi, nierównymi liniami tuszu, ciężka poświata 3halacyjna wokół reflektorów, ziarno filmu 16mm i delikatne drganie bramki. Ten sam 4rudowłosy napastnik w biało-granatowym komplecie z numerem 9 schodzi z mokrej od deszczu 5murawy, gdy szum tłumu cichnie do pojedynczego dźwięku dzwonka. Kamera powoli zbliża się 6na jego twarz. Mówi cicho po japońsku: 「次は、勝つ」. Retro paleta: stonowany turkus, 7przydymiony bursztyn, głębokie bordowe cienie. Audio: odległy deszcz, samotny analogowy 8pad syntezatora, jeden gwizdek z dużym pogłosem w oddali.
Ustawienia: model minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Ustaw ten stosunek ręcznie, pamiętaj o wartości domyślnej.

Playground MiniMax H3 text-to-video na Atlas Cloud z wpisanym promptem OVA i gotowym retro klipem w panelu wyjściowym
MiniMax H3 text-to-video na Atlas Cloud, wpisany prompt OVA, ukończony klip. Pełne ujawnienie: ten konkretny przebieg pozostawił Aspect Ratio na 16:9, a Duration na 8, więc to, co widzisz po prawej, to krótka wersja panoramiczna. Poniższe 12-sekundowe ujęcie 4:3 pochodzi z wywołania API z jawnie ustawionym ratio: 4:3 i duration: 12 .

Retro ujęcie OVA 4:3: ten sam napastnik schodzący z mokrej od deszczu murawy w stylu anime z lat 90.
H3 text-to-video, 4:3, 12 sekund. Dostarczony plik ma rozdzielczość 1920x1440, co jest dokładnie 4:3, ze stereofoniczną ścieżką 32 kHz. Pokazane tutaj jako cichy GIF w zmniejszonej liczbie klatek na sekundę, aby strona była lekka. Wygenerowane za pomocą minimax/h3/text-to-video na Atlas Cloud.
Krok 6: Dziewięć obrazów referencyjnych, jedna postać, cztery ujęcia
Spójność postaci między ujęciami to najtrudniejszy problem w AI anime i jest rozwiązywany przez objętość referencji. Najpierw zbuduj paczkę: uruchom ponownie prompt z Kroku 1, zmieniając kadrowanie na przód, trzy czwarte, pełny profil, tył, śmiech, zaciśnięte zęby, pełna sylwetka, szczegóły stroju i szczegóły butów. Dziewięć obrazów, łącznie około osiem centów.

Cztery kąty tej samej oryginalnej postaci napastnika wygenerowanej jako paczka referencyjna, ułożone w siatkę 2x2
Cztery z dziewięciu kątów referencyjnych. H3 przyjmuje do dziewięciu obrazów w jednej paczce referencyjnej, a także dodatkowo referencje wideo i audio.
Plain1Cel-shaded 2D anime, spójna ręcznie tuszowana grubość kreski, płaski kolor, bez 2cieniowania 3D. Zachowaj twarz, sylwetkę włosów i komplet z numerem 9 referencyjnego 3napastnika identyczne we wszystkich ujęciach. Cztery ujęcia w jednym ciągłym ujęciu: 4(1) niski kąt zbliżenia na buty uderzające w murawę, (2) szybki panoramiczny ruch w górę 5do ciasnego zbliżenia na oczy, (3) szerokie ujęcie, jak sprintuje obok trzech obrońców 6narysowanych jako rozmyte sylwetki, (4) zamrożenie na główce w powietrzu, linie szybkości 7wybuchające na zewnątrz. Audio: ryk tłumu, oddech, uderzenia butów w murawę, jeden 8dźwięk taiko w momencie zamrożenia.
Ustawienia: model minimax/h3/reference-to-video, refers = twoje obrazy z type: image, resolution: 2K, duration: 8 lub wyższe, ratio: adaptive lub 16:9.
Odpowiednik Veo 3.1 nie może być uruchomiony przy tych ustawieniach i nie musisz próbować, aby wiedzieć, dlaczego. Jego endpoint referencyjny akceptuje maksymalnie trzy obrazy, a wybranie tego endpointu zwija duration do jednej dozwolonej wartości 8. Dziewięcioobrazowa paczka i 10-sekundowe ujęcie są poza zasięgiem.

Playground MiniMax H3 reference-to-video na Atlas Cloud pokazujący licznik referencji na czterech z dziewięciu i pierwsze ujęcie w panelu wyjściowym
MiniMax H3 reference-to-video na Atlas Cloud. Licznik pokazuje Reference Materials (4/9) z MAX:9 pod spodem, co jest sufitem w interfejsie, a nie twierdzeniem z arkusza specyfikacji. Wynikiem jest pierwsze ujęcie, niski kąt zbliżenia na buty.
Cztery dodatkowe przebiegi generatora wideo anime MiniMax H3, które warto wykonać
Ujęcie Ostatniego Gwizdka obciąża tylko cztery różnice. Te cztery obciążają resztę. Wszystkie działają na H3; notatki mówią, które z nich Veo 3.1 może dorównać.
- Ultrawide walka sakuga,
21:9, 10 sekund. Veo w ogóle nie może wyprodukować 21:9.
Plain1Cel-shaded 2D akcja anime, grube, zwężające się linie tuszu, płaski kolor, ostre cienie, 2bez cieniowania 3D. Dwóch oryginalnych zamaskowanych pojedynkujących się na wietrznym 3dachu świątyni o zmierzchu. Zderzenie ostrzy, kadr drży, obaj wojownicy rozdzielają się 4w wybuchu ręcznie rysowanych klatek impaktu i promienistych linii szybkości. Kamera: niski 5kąt zbliżenia, potem boczny ślad, potem przeskok do szerokiej sylwetki na tle 6pomarańczowego nieba. Audio: dwa ostre metaliczne zderzenia, trzask tkaniny, niski 7dźwięk taiko na końcowym zamrożeniu, bez muzyki.
- Zsynchronizowany z beatem klip AMV, reference-to-video z referencją audio. H3 przyjmuje do trzech klipów audio jako wejście referencyjne. Veo 3.1 nie ma żadnego wejścia audio, tylko wyjście audio.
Plain1Cel-shaded 2D montaż anime przycięty do referencyjnej ścieżki audio. Pięć krótkich beatów: 2deszcz na oknie, dłoń zaciskająca bandaż, panorama miasta migająca za oknem pociągu, 3start sprintu, zamrożenie na wyciągniętej dłoni. Każde cięcie trafia dokładnie w 4downbeat referencyjnego audio. Płaski kolor, grube linie tuszu, wysokokontrastowa nocna 5paleta głębokiego indygo i neonowej magenty.
- Dwuwierszowa scena dialogowa po japońsku, 12 sekund. To jest test wytrzymałości synchronizacji ust, a 12 sekund jest już poza zasięgiem Veo.
Plain1Cel-shaded 2D anime, płaski kolor, bez cieniowania 3D. Dwie oryginalne postacie na dachu 2o złotej godzinie, shot reverse shot. Pierwsza mówi po japońsku: 「本当に行くの?」. 3Druga odpowiada, z półuśmiechem, po japońsku: 「もう決めた」. Usta pasują do każdej 4sylaby. Ciepła krawędziowa poświata, długie cienie, delikatny wiatr we włosach. Audio: 5dwa wyraźne japońskie głosy, odległy ruch uliczny, jedna cykada.
- Pionowy krótki film shonen,
9:16, 8 sekund. Oba modele mogą robić pionowe, więc to jest jedyne miejsce, aby faktycznie je porównać A/B, a nie zakładać.
Plain1Cel-shaded 2D anime, kompozycja pionowa. Oryginalna nastoletnia biegaczka przebija się 2przez papierowy transparent w zwolnionym tempie, potem kadr wraca do pełnej prędkości, 3gdy przyspiesza na stadionowej prostej. Linie szybkości, płaski kolor, twarde cienie, 4odważne graficzne niebo. Kamera: niski kąt śledzący, potem szybki panoramiczny ruch na 5jej twarz. Audio: dźwięk rozdzieranego transparentu, przypływ tłumu, jeden wstrzymany, 6a potem wypuszczony oddech.
Jeśli chcesz poznać gramatykę promptów stojącą za tymi, przewodnik po promptach MiniMax H3 omawia, jak H3 analizuje instrukcje dotyczące kamery i audio, bardziej szczegółowo, niż mogę tutaj.
Ile kosztuje 60-sekundowe opening anime na MiniMax H3 vs Veo 3.1
Standardowe OP anime trwa około 90 sekund. Nazwijmy to osiem ujęć po 8 sekund, 64 sekund gotowego wideo, plus jedna klatka na ujęcie po $0.009 każda.
Istnieje realna rozbieżność cenowa, o której powinieneś wiedzieć, zamiast abym ją zamazał. Katalog Atlas Cloud wymienia MiniMax H3 po $0.10 za sekundę, podczas gdy readme modelu podaje $0.14/s w 2K i $0.10/s w 768P. Veo 3.1 jest wymieniony po $0.20 za sekundę, podczas gdy jego readme rozdziela $0.40/s z audio i $0.20/s bez.
Przyciski uruchamiania na moich zrzutach ekranu rozstrzygają sprawę. H3 reference-to-video, 8 sekund w 2K, podano Run $1.12, co jest dokładnie $0.14 za sekundę. Veo 3.1 image-to-video, 8 sekund w 1080p z włączonym audio, podano Run $3.2, co jest dokładnie $0.40 za sekundę. Zatem stawki z readme są tymi, które są fakturowane, a nagłówek katalogu to poziom wejścia. Poniżej pokazałem oba odczyty. Są to ceny katalogowe według stanu na sierpień 2026.
Tabela 4: osiem ujęć po 8 sekund, z klatkami wliczonymi w cenę
| Konfiguracja | Koszt wideo (stawka katalogowa) | Koszt wideo (stawka z readme) | Klatki | Zakres całkowity |
|---|---|---|---|---|
| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 do $9.03 |
| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1, 1080p z audio | $12.80 | $25.60 | $0.07 | $12.87 do $25.67 |
| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 |
Ceny pobrane ze stron modeli Atlas Cloud linkowanych w Tabeli 1, sierpień 2026. Żadna z tych czterech nie jest obecnie objęta zniżką.
Dwie rzeczy, których ta tabela nie obejmuje, a obie uderzają mocniej niż stawka za sekundę.
Próby. Nikt nie publikuje pierwszego ujęcia anime. Niezależnie od tego, jaki mnożnik założysz, zastosuj go do obu kolumn, a różnica zwiększy się w tej samej proporcji.
Czas rzeczywisty, a ten idzie w drugą stronę. Zmierzono od początku do końca 7 sierpnia 2026: H3 w 2K przez 8 sekund zajęło 447 sekund, około 7,5 minuty. H3 text-to-video w 2K przez 12 sekund zajęło 334 sekundy. Veo 3.1 w 1080p przez 8 sekund z audio zajęło 152 sekundy, poniżej trzech minut. Veo jest tutaj mniej więcej trzy razy szybsze do pierwszej próby, a jeśli iterujesz nad ujęciem o 2 nad ranem, to jest warte prawdziwych pieniędzy. Kolejki się zmieniają, więc traktuj to jako migawkę z jednego popołudnia, a nie specyfikację. Ale każdy, kto cytuje "2 do 3 minut" dla H3 w 2K, cytuje readme, a nie kolejkę. Porównanie 2K vs 768P omawia, kiedy wyższy poziom jest wart dodatkowych minut.
Styl anime, hołd i co możesz faktycznie opublikować
Wszystko w tym artykule to styl i hołd. Oryginalna postać, oryginalny komplet, oryginalny tytuł. Żadna oficjalna postać anime nie została wygenerowana ani zamówiona, a żadne nazwisko ani podobizna prawdziwego piłkarza nie zostały użyte. Trend Pucharu Świata jest przywoływany jako format, ponieważ właśnie do tego jest przydatny.
To rozróżnienie nie jest ozdobą. Jeśli produkujesz treści w stylu anime komercyjnie, "w stylu OVA z lat 90." i "ta konkretna postać z tego konkretnego serialu" to różne obiekty prawne i tylko jeden z nich jest biznesem.
W kwestii otwartych wag: H3 jest naprawdę do pobrania, a ludzie uruchomili go pierwszego dnia. Jeden komentujący zgłosił 10 minut na 10-sekundowy klip 480p na 4070 Ti Super z 16 GB, a inni podali 3 minuty na 5080 i 68 sekund na RTX 6000 Pro. Ale samodzielne hostowanie działa na krótkim boku 768; etapy Context-IR i Regenerate-2K, które produkują 2K, pozostają po stronie API.
Licencja ma prawdziwy haczyk. Licencja społecznościowa nie obejmuje obecnie UE, Wielkiej Brytanii, Korei Południowej ani Stanów Zjednoczonych, powołując się na regiony "obecnie opracowujące lub egzekwujące przepisy związane z AI". Otwarty jest kanał formalnego wnioskowania o licencję, który jeden z komentatorów HN podsumował jako "po prostu musisz obiecać, że nie zdenerwujesz Disneya, a oni wyślą ci licencję". Zabawne, a także dokładnie ten krok zgodności, którego nie możesz pominąć, jeśli jesteś na jednym z tych czterech terytoriów. Opis otwartych wag zawiera pełną listę terytoriów.
Często zadawane pytania
Czy MiniMax H3 jest dobrym generatorem wideo anime w porównaniu do Veo 3.1?
W przypadku większości prac anime, H3, głównie z powodów niezwiązanych z renderowaniem. Działa od 4 do 15 sekund w porównaniu do 4, 6 lub 8 Veo, oferuje sześć proporcji, w tym 4:3 i 21:9, w porównaniu do dwóch Veo, wymienia japoński wśród 11 rodzimych stabilnych języków dialogowych i przyjmuje dziewięć obrazów referencyjnych w porównaniu do trzech Veo. Veo 3.1 wygrywa w jednej konkretnej sytuacji: gdy potrzebujesz seed do powtarzalnych prób lub negative_prompt, aby zatrzymać dryf ujęcia w kierunku cieniowania renderu 3D. H3 nie ma żadnego z tych parametrów. Jeśli twój potok zależy od jednego z nich, to jest prawdziwy powód, aby zostać.
Czy Veo 3.1 może generować anime w proporcjach 4:3 lub 15-sekundowy klip?
Nie, i to nie z powodów stylistycznych. Enum aspect_ratio Veo 3.1 zawiera dokładnie 16:9 i 9:16, a jego enum duration zawiera dokładnie 4, 6 i 8. Nie ma wartości 4:3 do wyboru i nie ma możliwości żądania 12 lub 15 sekund. Jeśli twoim punktem odniesienia jest anime TV lub OVA z lat 90., kadrowanie jest poza zasięgiem Veo, a dostępne w H3.
Dlaczego mój klip anime Veo 3.1 wrócił cichy?
Ponieważ generate_audio domyślnie to false w API. Przełącznik w playgroundzie jest zwykle już włączony, więc to dotyczy tylko osób wywołujących API bezpośrednio. Ustaw jawnie generate_audio: true. Przy okazji ustaw też resolution, ponieważ domyślnie to 720p, a nie 1080p lub 4k, które prawdopodobnie miałeś na myśli.
Czy MiniMax H3 obsługuje japoński dialog i synchronizację ust w anime?
Tak. Karta modelu wymienia 11 języków ze stabilnym wsparciem dialogowym: arabski, chiński, angielski, francuski, niemiecki, włoski, japoński, koreański, portugalski, rosyjski i hiszpański. Audio jest generowane łącznie z obrazem w stereo 32 kHz, a nie dubbingowane później, dlatego synchronizacja ust utrzymuje się przez całą kwestię, a nie tylko przez pierwsze sylaby. Wpisz japońską kwestię bezpośrednio do promptu po japońsku.
Ile obrazów referencyjnych mogę użyć, aby zachować spójność postaci anime?
MiniMax H3 przyjmuje do 9 obrazów, do 3 klipów wideo i do 3 klipów audio, z twardym limitem 12 plików wszystkich typów. Endpoint reference-to-video Veo 3.1 przyjmuje od 1 do 3 obrazów, a wybranie go zwija duration do 8 jako jedynej dozwolonej wartości. W przypadku powracającej postaci anime w serii ta różnica jest decydująca.
MiniMax H3 ma otwarte wagi, więc czy mogę uruchomić mój potok anime lokalnie za darmo?
Możesz go pobrać i uruchomić, z trzema zastrzeżeniami. Samodzielnie hostowana inferencja działa na krótkim boku 768, a etapy Context-IR i Regenerate-2K, które produkują 2K, pozostają po stronie API. Rzeczywiste lokalne prędkości różnią się znacznie w zależności od karty: około 10 minut na 10-sekundowy klip 480p na 4070 Ti Super, około 3 minut na 5080, około 68 sekund na RTX 6000 Pro, według wątku ComfyUI z dnia 0. A licencja społecznościowa nie obejmuje obecnie UE, Wielkiej Brytanii, Korei Południowej ani USA, więc jeśli jesteś na jednym z tych terytoriów, potrzebujesz formalnej licencji przed użyciem komercyjnym.






