Seedance 2.0 Mini & Fast API w najniższych cenach na świecie — do 68% zniżki od oficjalnej ceny

MiniMax H3 Anime Video Generator: 15 sekund, 4:3 i nieudany Title Card Veo 3.1

MiniMax H3 generator wideo anime kontra Veo 3.1 na tej samej klatce kluczowej. H3 działa od 4 do 15 sekund i sześć proporcji, Veo ogranicza się do 8 sekund i dwóch. Japoński dialog, 9 referencji, rzeczywiste uruchomienia.

Przez całe lato mój feed pokazywał to samo wideo w pętli. Gracze Pucharu Świata przerysowani na bohaterów shonen. Dyktator. Kapitan piratów. Siwy mentor, który pojawia się w ostatnich czterech sekundach. Miliony wyświetleń na post, a fabuła aktualizuje się po prawie każdym meczu.

Nikt, kto to tworzy, nie pisze postów benchmarkowych. Wybierają model, palą kredyty i wysyłają przed kolejnym gwizdkiem.

Wziąłem więc jedną klatkę anime i jeden prompt, i przetestowałem MiniMax H3 jako generator anime wideo przeciwko Veo 3.1, oba ustawione na maksymalne ustawienia na identycznych wejściach.

Pierwszą rzeczą, która się zepsuła, nie była jakość obrazu. To było rozwijane menu. Veo 3.1 zatrzymuje się na 8 sekundach i oferuje dokładnie dwa proporcje. Ujęcie trzymane na twarzy, szybki panoramiczny ruch z piłką, a potem pojawienie się tytułu – to nie mieści się w 8 sekund. Nigdy nie miało szansy zawieść na jakości.

Kluczowe wnioski

  • Enum duration Veo 3.1 to [4, 6, 8], a enum aspect_ratio to [16:9, 9:16]. MiniMax H3 działa na dowolnych pełnych sekundach od 4 do 15 i oferuje 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Brak 4:3 w Veo oznacza całkowity brak możliwości uzyskania retro kadrowania OVA.
  • Karta modelu H3 wymienia 11 natywnie stabilnych języków dialogowych, a japoński jest jednym z nich. Audio i obraz są generowane razem w stereo 32 kHz, a nie dubbingowane później.
  • Pakiety referencyjne nie są zbliżone: H3 przyjmuje do 9 obrazów plus do 3 filmów i 3 klipów audio (maks. 12 plików). Endpoint referencyjny Veo 3.1 przyjmuje 3 obrazy, a w momencie jego użycia duration zwija się do tylko [8].
  • Dwie pułapki, które po cichu rujnują testy: API Veo domyślnie ustawia generate_audio na false i resolution na 720p, a H3 w text-to-video domyślnie ustawia ratio na 1:1. Zostawienie tych ustawień bez zmian oznacza porównanie cichego klipu 720p z kwadratowym.
  • Veo 3.1 zachowuje dwie rzeczy, których H3 w ogóle nie ma: seed i negative_prompt. W przypadku 2D anime ta druga ma realne znaczenie i pokażę to.

MiniMax H3 Anime Video Generator vs Veo 3.1, Ta Sama Klatka Obok Siebie

Jedna oryginalna postać. Jedna klatka kluczowa. Jeden prompt, skopiowany znak po znaku do obu modeli. Wszystko inne ustawione na maksimum po obu stronach.

MiniMax H3, image-to-video, 2K, 8 sekund, natywne audio. Włącz dźwięk: szum tłumu, uderzenie piłki i japoński okrzyk są generowane w tym samym przebiegu co obraz. Wygenerowano za pomocą minimax/h3/image-to-video na Atlas Cloud.

Veo 3.1, image-to-video, 1080p, 8 sekund, generateaudio włączone ręcznie, plus negativeprompt utrzymujący płaskie linie rysunku. Ta sama pierwsza klatka, te same słowa. Wygenerowano za pomocą google/veo3.1/image-to-video na Atlas Cloud.

Oba rysują pięknie. Szerokie ujęcie strzału Veo, z ręcznie rysowanymi liniami uderzenia i efektem dźwiękowym mangi unoszącym się w powietrzu, jest naprawdę urocze. To jest uczciwy punkt wyjścia i dlatego reszta tego artykułu dotyczy parametrów i podążania za instrukcjami, a nie ogólnego wrażenia.

Dlaczego Większość Testów MiniMax H3 Anime Video Generator vs Veo 3.1 Jest Błędna

Tego lata wydarzyły się dwie rzeczy jednocześnie.

Anime stało się formatem o największej objętości w AI wideo. Puchar Świata 2026 został przepisany jako turniej shonen, z graczami obsadzonymi jako dyktator, kapitan piratów, generał marynarki i mentor, a historie „ewoluują po prawie każdym meczu” na TikTok, Instagramie, X i YouTube (Complex, lipiec 2026).

A MiniMax H3 został wydany z otwartymi wagami. Wątek ComfyUI z dnia 0 osiągnął 330 punktów i 95 komentarzy, a ludzie publikowali rzeczywiste lokalne liczby w ciągu kilku godzin (Hacker News, sierpień 2026).

Połącz to, a spodziewałbyś się sterty porównań anime. Prawie ich nie ma, ponieważ większość testów jest błędnie zbudowana na jeden z czterech sposobów.

Porównują obrazy, a nie ograniczenia. Ujęcia anime to timing. Panoramiczny ruch do tytułu to problem czasu trwania, zanim stanie się problemem renderowania.

Zapominają, że API Veo domyślnie jest ciche. W API generate_audio jest ustawione na false, a resolution na 720p. Wiele postów „Veo nie ma dźwięku w anime” to po prostu ktoś, kto nie przełączył boolean.

Zapominają, że H3 w text-to-video domyślnie jest kwadratowe. ratio domyślnie ustawia się na 1:1, a nie 16:9. Uruchomienie promptu anime t2v bez ustawienia tego daje kwadratowy klip i mylący wniosek.

Testują z fotorealistycznymi promptami. „Kinematograficzny, światło wolumetryczne, mała głębia ostrości” to dokładnie słownictwo, które ciągnie model 2D w kierunku cieniowania renderowania 3D. Tryb awarii w anime to nie rozmycie. To plastik.

Trzy ustawienia, które decydują o teście anime, zanim naciśniesz uruchom

Zanim cokolwiek innego, ustaw je po obu stronach, w przeciwnym razie porównanie jest nieważne.

UstawienieMiniMax H3Veo 3.1Co się stanie, jeśli pominiesz
AudioGenerowane z obrazem, zawsze włączonegenerate_audio domyślnie falseVeo zwraca cichy klip i wygląda gorzej niż jest
Kształt klatkiratio domyślnie 1:1 w text-to-videoaspect_ratio domyślnie 16:9H3 daje kwadratowy wycinek anime, którego nie możesz użyć
Rozdzielczośćdomyślnie 2Kdomyślnie 720pPorównujesz 2K z 720p i nazywasz to różnicą jakości

Chcesz sam przetestować MiniMax H3 i Veo 3.1 na tym samym prompcie anime? Porównanie modeli Atlas Cloud uruchamia je obok siebie w jednym przebiegu – ten sam prompt i ustawienia, koszt pokazany przed wygenerowaniem.

MiniMax H3 i Veo 3.1 na tym samym prompcie anime w porównaniu modeli Atlas Cloud – te same ustawienia, cena pokazana przed wygenerowaniem. Zrobione na żywo w model-explorer

MiniMax H3 i Veo 3.1 na tym samym prompcie anime w porównaniu modeli Atlas Cloud – te same ustawienia, cena pokazana przed wygenerowaniem. Zrobione na żywo w model-explorer.

Specyfikacja MiniMax H3 vs Veo 3.1 Anime: Długość, Proporcje, Audio, Referencje

Wyciągnąłem live input schemas obu modeli, zamiast ufać jakimkolwiek postom premierowym. Każda wartość poniżej to enum, który możesz sam odczytać na stronach modeli, a nie wrażenie.

Tabela 1: MiniMax H3 vs Veo 3.1 – parametry decydujące o ujęciu anime

MiniMax H3Veo 3.1
Czas trwania4 do 15, co pełna sekunda (domyślnie 8)4, 6, 8 (domyślnie 8)
Proporcje obrazu21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
Domyślne proporcje (text-to-video)1:0116:09
Rozdzielczość768P, 2K (domyślnie 2K)720p, 1080p, 4k (domyślnie 720p)
AudioGenerowane łącznie, stereo 32 kHzgenerate_audio, domyślnie false
Natywne języki dialogowe11 stabilnych, w tym japońskiNie opublikowane jako stabilna lista
Pakiet referencyjnydo 9 obrazów, 3 filmy, 3 klipy audio, łącznie 12 plików3 obrazy
Czas trwania przy użyciu referencjinadal 4 do 15zwija się do tylko 8
seedniedostępnedostępne
negative_promptniedostępnedostępne
Wagido pobraniazamknięte

Czas trwania, proporcje, rozdzielczość, audio i limity referencji pochodzą z live schemas na stronach MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video i Veo 3.1 reference-to-video. Limit 9 obrazów i 12 plików oraz lista 11 języków dialogowych pochodzą z karty modelu MiniMax H3 (Hugging Face, sierpień 2026).

Teraz tabele wyników, bo mówią coś innego niż specyfikacja i obie są ważne.

Tabela 2: Elo głosów społeczności i cena za minutę, migawka z 7 sierpnia 2026

ModelText-to-video (z audio)Image-to-video (z audio)$/min
Gemini Omni Flash1,244 (#1) ±71,191 (#2) ±9$6.00
MiniMax H31,238 (#2) ±91,190 (#3) ±10$7.80
Dreamina Seedance 2.0 720p1,224 (#3) ±61,198 (#1) ±7$9.07
Kling 3.0 1080p (Pro)1,111 (#7) ±6nie wymieniony w top 10$20.16
Veo 3.11,093 (#11) ±71,085 (#10) ±7$24.00
Veo 3.1 Fast1,091 (#14) ±6nie wymieniony w top 10$9.00
Veo 3.1 Lite1,089 (#15) ±7nie wymieniony w top 10$4.80

Dane Elo i ceny z Artificial Analysis Video Arena (Artificial Analysis, sierpień 2026). Są to ruchome głosy społeczności i zmieniają się. Kolumna $/min to znormalizowane oszacowanie modelu, nie faktura.

Różnica 145 punktów Elo jest duża, ale to głos ogólnego przeznaczenia, a nie głos anime. I tu jest część, którą muszę powiedzieć wprost: MiniMax nie promuje H3 jako modelu anime. Wewnętrzne opinie pierwszej linii wymieniają film, animację i komedię dramatyczną jako obszary, na które H3 nie jest skierowany. Ciekawe pytanie brzmi więc nie „który jest modelem anime”. Chodzi o to, dlaczego model, który nie sprzedaje się jako anime, wciąż wygrywa ujęcie, i gdzie Google wciąż bierze rundę.

Jedna praktyczna uwaga przed tutorialem. Każdy poniższy model działa przez tę samą konsolę i ten sam klucz API, co jest jedynym powodem, dla którego parametry są w ogóle porównywalne. Ta sama kolejka, to samo uwierzytelnianie, jeden rachunek. Jeśli skonfigurujesz GPT Image 2 w jednej usłudze, a Veo w innej, połowa różnic, które znajdziesz, będzie dotyczyć infrastruktury, a nie modelu.

Zbuduj Ujęcie: MiniMax H3 vs Veo 3.1, Krok po Kroku

Jeden działający przykład od początku do końca. „Last Whistle”: oryginalny nastoletni napastnik, rude włosy, biało-granatowy strój z numerem 9, światła stadionu, szybki panoramiczny ruch przy strzale i japoński tytuł, który musi pojawić się w ostatnich dwóch sekundach i utrzymać stabilnie.

Żaden prawdziwy gracz, żadna oficjalna postać, żadne istniejące IP anime. Tylko styl i hołd. Więcej o tym, dlaczego za chwilę.

Krok 1: Zaprojektuj klatkę kluczową anime za pomocą GPT Image 2

Klatka kluczowa niesie kierunek artystyczny, aby model wideo nie musiał go wymyślać. Zwróć uwagę na ujemną przestrzeń w lewej trzeciej części: jest celowa. Tytuł zostanie tam zapisany przez model wideo i to jest test stabilności tekstu.

Plain
1Pojedyncza klatka z nowoczesnego sportowego anime shonen. Cel-shaded 2D animacja, ręcznie tuszowane linie o spójnej grubości, płaskie wypełnienia kolorem, ostre graficzne cienie, absolutnie bez cieniowania 3D i fotorealistycznej skóry. Zbliżenie na oryginalnego nastoletniego napastnika: rozczochrane ciemnorude włosy, biało-granatowy strój z numerem 9, pot i smugi trawy na jednym policzku, szeroko otwarte oczy z wyczerpaną determinacją, otwarte usta w trakcie krzyku. Za nim, światła stadionu płoną w ścianie rozmytych kolorów tłumu; promieniste linie szybkości wybuchają ze środka kadru; jedno źdźbło trawy wisi zamrożone w powietrzu. Nasycona paleta, głęboko cyjanowe cienie, ciepłe pomarańczowe światło krawędziowe. Kompozycja 16:9, postać wyśrodkowana po prawej stronie, czysta ujemna przestrzeń w lewej trzeciej części. Żadnego tekstu nigdzie na obrazie.

Ustawienia: model openai/gpt-image-2/text-to-image, jakość high, rozmiar 16:9 (2048x1152). Nic więcej.

Interfejs generatora obrazów AI z promptem i wygenerowanym anime piłkarzem

Playground GPT Image 2 na Atlas Cloud z promptem dla klatki kluczowej Last Whistle i gotową klatką anime w panelu wyjściowym

GPT Image 2 na Atlas Cloud: jakość ustawiona na high, gotowa klatka kluczowa po prawej.

Rudowłosy anime piłkarz krzyczący na zatłoczonym stadionie

Podstawowa klatka kluczowa anime: oryginalny rudowłosy napastnik krzyczy pod światłami stadionu, cel-shaded z płaskim kolorem i liniami szybkości

Klatka kluczowa, którą otrzymują oba modele. Płaski kolor, twarde cienie i pusta lewa trzecia część czekająca na tytuł.

Krok 2: MiniMax H3 image-to-video, wszystko na maksa

Ten sam obraz wejściowy, wyjście 2K. Trzymałem H3 na 8 sekundach tylko po to, by dopasować się do limitu Veo. To nie jest limit H3, a Krok 4 zdejmuje ograniczenie.

Plain
1Cel-shaded 2D anime, ręcznie tuszowana grubość linii, płaski kolor, bez cieniowania 3D. Trzymaj na twarzy napastnika przez jeden beat, a następnie gwałtowny panoramiczny ruch śledzący piłkę, gdy ją uderza, pan zamazujący kadr w smugi sakuga motion trails. Jedna klatka całkowitej ciszy przy uderzeniu. Przez ostatnie dwie sekundy, pogrubiony biały japoński tytuł ラストホイッスル uderza w lewą trzecią część kadru i utrzymuje się nieruchomo, bez zniekształceń, migotania, dryfu. Napastnik krzyczy jedną linijkę po japońsku: 「まだ終わってない!」. Audio: narastający ryk stadionu, jeden ostry dźwięk uderzenia piłki, niski dźwięk taiko pod tytułem.

Ustawienia: model minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video pobiera kształt ramki z wejściowego obrazu), image = wynik z Kroku 1.

Jedno ostrzeżenie, jeśli zamiast tego użyjesz text-to-video: napisz jawnie ratio: 16:9. Domyślne ustawienie to 1:1 i chętnie da ci kwadratowy wycinek anime.

Interfejs generatora wideo AI z promptem i wygenerowanym anime wideo

Playground MiniMax H3 image-to-video na Atlas Cloud z promptem Last Whistle, załadowaną klatką kluczową i gotowym klipem w panelu wyjściowym

MiniMax H3 image-to-video na Atlas Cloud: klatka kluczowa z Kroku 1 załadowana po lewej, gotowy klip odtwarzany po prawej.

Krok 3: Veo 3.1 image-to-video, audio włączone ręcznie

Prompt jest identyczny, słowo w słowo. Zmiana jednego przymiotnika sprawia, że przestaje to być porównanie. Zmienia się natomiast dodatkowe pole, które daje Veo, a którego nie ma H3.

negative_prompt, który w przypadku 2D anime jest pojedynczym najbardziej użytecznym elementem sterującym na tej liście:

Plain
13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur soup, warped lettering, gibberish text, extra fingers, subtitle bar

Ustawienia: model google/veo3.1/image-to-video, resolution: 1080p (zmień, domyślnie 720p), duration: 8 (to jest limit), aspect_ratio: 16:9, generate_audio: true (API domyślnie ustawia na false, to jest pułapka cichego klipu), seed: 20260807, image = ten sam wynik z Kroku 1.

Interfejs generatora wideo AI z ustawieniami wejściowymi i wygenerowanym anime wideo

Playground Veo 3.1 image-to-video na Atlas Cloud pokazujący włączone generate audio, załadowaną klatkę kluczową anime i gotowy klip w panelu wyjściowym

Veo 3.1 image-to-video na Atlas Cloud, z włączonym generate audio i gotowym klipem po prawej.

Krok 4: Oceń na pięciu osiach specyficznych dla anime

Nic do generowania. Po prostu spójrz na rzeczy, na których anime faktycznie się psuje. Oba klipy są osadzone w pobliżu początku tego artykułu, więc możesz je ocenić sam, zamiast polegać na moim słowie.

Porównanie obok siebie rozmytych i ostrych scen stadionu piłkarskiego

Porównanie ostatniej klatki z obu klipów: MiniMax H3 po lewej z czystym japońskim tytułem, Veo 3.1 po prawej z zniekształconymi pionowymi znakami

Ostatnia klatka każdego klipu. Po lewej H3 napisał ラストホイッスル, wszystkie osiem katakan poprawnych i nieruchome. Po prawej Veo 3.1 napisał trzy znaki, które nie są żądanym słowem i nie tworzą jednego.

Tytuł to moment, w którym rozstrzygnęła się runda i nie było blisko. H3 wyrenderowało żądane katakana dokładnie, z ostrymi krawędziami i stabilnie, na rozmazanym panoramie bramki. Veo 3.1 wyprodukowało pionowy stos trzech znaków, które nie są ani żądanym słowem, ani słowem. Na tej samej klatce wyrzuciło też postać z kadru i pozwoliło, by tło przesunęło się w kierunku półfotorealistycznego ujęcia stadionu, mimo że photorealistic skin i 3D render znajdowały się w negatywnym prompcie.

Tabela 3: pięć osi decydujących o wycinku anime, z tych dwóch przebiegów

MiniMax H3Veo 3.1
Ciągłość postaci z klatki kluczowejTrzymał dokładną twarz, włosy i strój przez pełne 8 sekundPrzerysował postać w nowym szerokim ujęciu, zgodnie z modelem, ale innym rysunkiem
Grubość linii i płaskie cieniowanie celUtrzymane, bez dryfu w kierunku 3DUtrzymane w średnim ujęciu, pod koniec dryfowało do fotograficznej płyty stadionu
Japoński tytułラストホイッスル wyrenderowane poprawnie i stabilnieTrzy znaki, nie żądane słowo, nie słowo
Dostarczona ścieżka audioStereo 32 kHz, dokładnie jak w karcie modeluStereo 48 kHz, obecne tylko dlatego, że sam ustawiłem generate_audio
Panoramiczny ruch i smuga sakugaWykonane jako rozmazany pan w tytułZastąpione ostrym cięciem do nowego ustawienia

Ten ostatni wiersz to najgłośniejsza publiczna krytyka H3 jak dotąd, i właśnie dlatego napisałem to w obu promptach. W wątku ComfyUI z dnia 0 użytkownik fwip narzekał, że nawet oficjalne promptu demonstracyjne były ignorowane: „gwałtowny WHIP PAN z dachu, który ROZMAZUJE pływające słowa, z smugami ruchu. A wideo po prostu nie zrobiło żadnego z tych przejść, zastąpiło je cięciem.”

W tym przebiegu to Veo zamieniło pan na cięcie, a H3 zrobiło smugi. Każdy po jednym ujęciu to nie werdykt i nie twierdzę inaczej. Ale oznacza to, że krytyka nie jest specyficzna dla H3: panoramiczne ruchy są najmniej niezawodną instrukcją w całym teście po obu stronach. Jeśli twój storyboard polega na jednym, zaplanuj wokół niego, a nie przez niego.

Krok 5: Retro wycinek OVA 4:3, którego Veo 3.1 strukturalnie nie może wygenerować

To nie jest preferencja jakościowa. To ściana. Enum aspect_ratio Veo ma dwie wartości i żadna z nich to 4:3, a jego enum duration nie ma 12. Wygląd OVA z lat 90. jest po prostu nieosiągalny.

Plain
1Wycinek anime OVA z lat 90., pełna klatka 4:3. Ręcznie malowane tło z widoczną teksturą pędzla, postacie malowane na celuloidzie z grubymi, nierównymi liniami atramentu, ciężka poświata halacyjna wokół świateł stadionu, ziarno filmu 16 mm i subtelne drganie bramki. Ten sam rudowłosy napastnik w biało-granatowym stroju z numerem 9 schodzi z deszczowej murawy, gdy hałas tłumu cichnie do pojedynczego dźwięku dzwonka. Kamera powoli zbliża się na jego twarz. Mówi cicho po japońsku: 「次は、勝つ」. Retro paleta: stonowany turkus, zakurzony bursztyn, głębokie bordowe cienie. Audio: odległy deszcz, samotny analogowy pad syntezatora, jeden gwizdek z pogłosem w oddali.

Ustawienia: model minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Ustaw ten stosunek ręcznie, pamiętaj o domyślnym.

Interfejs generatora wideo AI z promptem i wygenerowanym anime wideo

Playground MiniMax H3 text-to-video na Atlas Cloud z wpisanym promptem OVA i gotowym retro klipem w panelu wyjściowym

MiniMax H3 text-to-video na Atlas Cloud, wpisany prompt OVA, ukończony klip. Pełne ujawnienie: ten konkretny przebieg pozostawił Aspect Ratio na 16:9, a Duration na 8, więc to, co widzisz po prawej, to krótka wersja panoramiczna. Dwunastosekundowy wycinek 4:3 poniżej pochodzi z wywołania API z jawnie ustawionymi ratio: 4:3 i duration: 12.

Anime piłkarz w brudnym stroju stojący na stadionie

Retro wycinek OVA 4:3: ten sam napastnik schodzi z deszczowej murawy w stylu anime z lat 90.

H3 text-to-video, 4:3, 12 sekund. Dostarczony plik miał rozdzielczość 1920x1440, co jest dokładnie 4:3, z ścieżką stereo 32 kHz. Pokazany tutaj jako cichy GIF przy zmniejszonej liczbie klatek na sekundę, aby strona była lekka. Wygenerowano za pomocą minimax/h3/text-to-video na Atlas Cloud.

Krok 6: Dziewięć obrazów referencyjnych, jedna postać, cztery wycinki

Spójność postaci w różnych ujęciach to najtrudniejszy problem w AI anime i jest rozwiązywany przez ilość referencji. Najpierw zbuduj pakiet: uruchom ponownie prompt z Kroku 1 z zamienionym kadrowaniem na przód, trzy czwarte, pełny profil, tył, śmiech, zaciśnięte zęby, pełna sylwetka, szczegóły stroju i butów. Dziewięć obrazów, łącznie około osiem centów.

Cztery ilustracje rudowłosego anime piłkarza z numerem 9

Cztery kąty tej samej oryginalnej postaci napastnika wygenerowane jako pakiet referencyjny, ułożone w siatkę dwa na dwa

Cztery z dziewięciu kątów referencyjnych. H3 przyjmuje do dziewięciu obrazów w jednym pakiecie referencyjnym, a także dodatkowo wideo i audio.

Plain
1Cel-shaded 2D anime, spójna ręcznie tuszowana grubość linii, płaski kolor, bez cieniowania 3D. Zachowaj twarz referencyjnego napastnika, sylwetkę włosów i strój z numerem 9 identyczne w każdym wycinku. Cztery wycinki w jednym ciągłym ujęciu: (1) niski kąt najazdu na buty uderzające w murawę, (2) panoramiczny ruch w górę do ciasnego zbliżenia oczu, (3) szerokie ujęcie, jak sprintuje obok trzech obrońców narysowanych jako rozmyte sylwetki, (4) zamrożenie na główce w powietrzu, linie szybkości wybuchające na zewnątrz. Audio: ryk tłumu, oddech, uderzenia butów o murawę, jeden dźwięk taiko na zamrożeniu.

Ustawienia: model minimax/h3/reference-to-video, refers = twoje obrazy z type: image, resolution: 2K, duration: 8 lub wyższe, ratio: adaptive lub 16:9.

Odpowiednik Veo 3.1 nie może być uruchomiony z tymi ustawieniami i nie musisz próbować, aby wiedzieć dlaczego. Jego endpoint referencyjny akceptuje maksymalnie trzy obrazy, a wybranie tego endpointu zwija duration do jednej dozwolonej wartości 8. Pakiet dziewięciu obrazów i 10-sekundowe ujęcie są poza zakresem.

Interfejs generatora wideo AI z polem promptu i wygenerowanym anime wideo

Playground MiniMax H3 reference-to-video na Atlas Cloud pokazujący licznik referencji na cztery z dziewięciu i pierwszy wycinek w panelu wyjściowym

MiniMax H3 reference-to-video na Atlas Cloud. Licznik pokazuje Reference Materials (4/9) z MAX:9 poniżej, co jest limitem w interfejsie, a nie deklaracją z arkusza specyfikacji. Wynikiem jest wycinek pierwszy, niski kąt najazdu na buty.

Cztery Inne Wartościowe Przebiegi MiniMax H3 Anime Video Generator

Ujęcie Last Whistle obciąża tylko cztery różnice. Te cztery obciążają resztę. Wszystkie działają na H3; notatki mówią, które z nich Veo 3.1 może dorównać.

  1. Ultrawide walka sakuga, 21:9 , 10 sekund. Veo w ogóle nie może wygenerować 21:9.
Plain
1Cel-shaded 2D anime akcja, grube, zwężające się linie atramentu, płaski kolor, ostre cienie, bez cieniowania 3D. Dwóch oryginalnych zamaskowanych pojedynkowiczów na wietrznym dachu świątyni o zmierzchu. Zderzenie ostrzy, kadr drży, obaj wojownicy rozdzielają się w serii ręcznie rysowanych klatek uderzenia i promienistych linii szybkości. Kamera: niski kąt najazdu, potem boczny ślad, potem przejście do szerokiej sylwetki na tle pomarańczowego nieba. Audio: dwa ostre dźwięki metalu, trzepot tkaniny, niski dźwięk taiko na końcowym zamrożeniu, bez muzyki.
  1. Zsynchronizowany z beatem wycinek AMV, reference-to-video z referencją audio. H3 przyjmuje do trzech klipów audio jako wejście referencyjne. Veo 3.1 nie ma w ogóle wejścia audio, tylko wyjście audio.
Plain
1Cel-shaded 2D anime montaż dopasowany do referencyjnej ścieżki audio. Pięć krótkich beatów: deszcz na oknie, ręka zaciskająca bandaż, panorama miasta przemykająca za oknem pociągu, start sprintu, zamrożenie na wyciągniętej dłoni. Każde cięcie ląduje dokładnie na downbeacie referencyjnego audio. Płaski kolor, grube linie atramentu, wysokokontrastowa nocna paleta głębokiego indygo i neonowej magenty.
  1. Scena dialogowa po japońsku, dwie linie, 12 sekund. To test synchronizacji ruchu warg, a 12 sekund jest już poza zakresem Veo.
Plain
1Cel-shaded 2D anime, płaski kolor, bez cieniowania 3D. Dwie oryginalne postacie na dachu o złotej godzinie, ujęcie z dwóch stron. Pierwsza mówi po japońsku: 「本当に行くの?」. Druga odpowiada, z półuśmiechem, po japońsku: 「もう決めた」. Usta pasują do każdej sylaby. Ciepłe światło krawędziowe, długie cienie, delikatny wiatr we włosach. Audio: dwa wyraźne japońskie głosy, odległy ruch uliczny, jedna cykada.
  1. Pionowy shonen short, 9:16 , 8 sekund. Oba modele radzą sobie z pionem, więc to jedyne miejsce, aby faktycznie porównać A/B, a nie zakładać.
Plain
1Cel-shaded 2D anime, kompozycja pionowa. Oryginalna nastoletnia biegaczka przebija się przez papierowy transparent w zwolnionym tempie, po czym kadr wraca do pełnej prędkości, gdy przyspiesza na stadionowej prostej. Linie szybkości, płaski kolor, twarde cienie, odważne graficzne niebo. Kamera: niski kąt śledzenia, potem szybki ruch w górę na jej twarz. Audio: dźwięk rozdzieranego transparentu, przypływ tłumu, jeden wstrzymany, a potem wypuszczony oddech.

Jeśli chcesz gramatykę promptów za tymi, przewodnik po promptach MiniMax H3 zagłębia się w to, jak H3 analizuje instrukcje kamery i audio, bardziej niż mogę tutaj.

Ile Kosztuje 60-sekundowe Intro Anime na MiniMax H3 vs Veo 3.1

Standardowe OP anime ma około 90 sekund. Nazwijmy to osiem ujęć po 8 sekund, 64 sekundy gotowego wideo, plus jedna klatka kluczowa na ujęcie po $0.009 za sztukę.

Istnieje prawdziwa rozbieżność cenowa, o której powinieneś wiedzieć, zamiast ją zamazywać. Katalog Atlas Cloud podaje MiniMax H3 za $0.10 za sekundę płasko, podczas gdy readme modelu rozbija to na $0.14/s przy 2K i $0.10/s przy 768P. Veo 3.1 jest wymienione za $0.20 za sekundę, podczas gdy jego readme oddziela $0.40/s z audio od $0.20/s bez.

Przyciski uruchamiania na moich zrzutach ekranu to rozstrzygają. H3 reference-to-video, 8 sekund przy 2K, wycenione na Run $1.12, co jest dokładnie $0.14 za sekundę. Veo 3.1 image-to-video, 8 sekund przy 1080p z włączonym audio, wycenione na Run $3.2, co jest dokładnie $0.40 za sekundę. Więc stawki z readme są tymi, które są fakturowane, a nagłówek katalogu to poziom wejścia. Poniżej pokazałem obie wartości mimo wszystko. Są to ceny katalogowe z sierpnia 2026.

Tabela 4: osiem ujęć po 8 sekund, z klatkami kluczowymi wliczonymi

KonfiguracjaKoszt wideo (stawka katalogowa)Koszt wideo (stawka readme)Klatki kluczoweZakres całkowity
MiniMax H3, 2K$6.40$8.96$0.07$6.47 do $9.03
MiniMax H3, 768P$6.40$6.40$0.07$6.47
Veo 3.1, 1080p z audio$12.80$25.60$0.07$12.87 do $25.67
Veo 3.1 Lite, 720p$3.20$3.20$0.07$3.27

Ceny pobrane ze stron modeli Atlas Cloud wymienionych w Tabeli 1, sierpień 2026. Żadna z tych czterech nie jest obecnie objęta rabatem.

Dwie rzeczy, których ta tabela nie obejmuje, i obie uderzają mocniej niż stawka za sekundę.

Ponowne próby. Nikt nie wysyła pierwszego ujęcia anime. Jakikolwiek mnożnik zakładasz, zastosuj go do obu kolumn, a luka powiększy się w tej samej proporcji.

Czas rzeczywisty, a ten idzie w drugą stronę. Mierzone od końca do końca 7 sierpnia 2026: H3 przy 2K przez 8 sekund zajęło 447 sekund, około 7,5 minuty. H3 text-to-video przy 2K przez 12 sekund zajęło 334 sekund. Veo 3.1 przy 1080p przez 8 sekund z audio zajęło 152 sekund, poniżej trzech minut. Veo jest około trzy razy szybsze do pierwszego ujęcia i jeśli iterujesz nad ujęciem o 2 nad ranem, to jest warte prawdziwych pieniędzy. Kolejki się zmieniają, więc traktuj to jako migawkę jednego popołudnia, a nie specyfikację. Ale każdy, kto cytuje „2 do 3 minut” dla H3 przy 2K, cytuje readme, a nie kolejkę. Podział 2K vs 768P obejmuje, kiedy wyższy poziom jest wart dodatkowych minut.

Styl Anime, Hołd i Co Możesz Faktycznie Opublikować

Wszystko w tym artykule to styl i hołd. Oryginalna postać, oryginalny strój, oryginalny tytuł. Żadna oficjalna postać anime nie została wygenerowana ani zamówiona, a żadne prawdziwe nazwisko ani podobizna piłkarza nie zostały użyte. Trend Pucharu Świata jest przywoływany jako format, ponieważ to jest to, do czego jest przydatny.

To rozróżnienie nie jest dekoracją. Jeśli produkujesz treści w stylu anime komercyjnie, „w stylu OVA z lat 90.” i „ta konkretna postać z tego konkretnego serialu” to różne obiekty prawne i tylko jeden z nich jest biznesem.

Jeśli chodzi o otwarte wagi: H3 jest naprawdę do pobrania i ludzie uruchomili go pierwszego dnia. Jeden komentator zgłosił 10 minut na 10-sekundowy klip 480p na 4070 Ti Super z 16 GB, a inni opublikowali 3 minuty na 5080 i 68 sekund na RTX 6000 Pro. Ale samodzielne hostowanie działa na krótkim boku 768; etapy Context-IR i Regenerate-2K, które produkują 2K, pozostają po stronie API.

Licencja ma prawdziwy haczyk. Licencja społecznościowa nie obejmuje obecnie UE, Wielkiej Brytanii, Korei Południowej ani Stanów Zjednoczonych, powołując się na regiony „obecnie opracowujące lub egzekwujące przepisy związane z AI”. Kanał formalnego wnioskowania licencyjnego jest otwarty, co jeden z komentatorów HN podsumował jako „musisz tylko obiecać na różowy palec, że nie rozzłościsz Disneya, a wyślą ci licencję”. Zabawne, a także dokładnie ten krok zgodności, którego nie możesz pominąć, jeśli jesteś w jednym z tych czterech terytoriów. Artykuł o otwartych wagach zawiera pełną listę terytoriów.

Często Zadawane Pytania

Czy MiniMax H3 to dobry generator wideo anime w porównaniu do Veo 3.1?

W przypadku większości prac anime, H3, i to głównie z powodów niezwiązanych z renderowaniem. Działa od 4 do 15 sekund w porównaniu do 4, 6 lub 8 Veo, oferuje sześć proporcji obrazu, w tym 4:3 i 21:9, w porównaniu do dwóch Veo, wymienia japoński wśród 11 natywnie stabilnych języków dialogowych i przyjmuje dziewięć obrazów referencyjnych w porównaniu do trzech Veo. Veo 3.1 wygrywa w jednej konkretnej sytuacji: gdy potrzebujesz seed do odtwarzalnych ponownych ujęć lub negative_prompt, aby zatrzymać dryfowanie ujęcia w kierunku cieniowania renderowania 3D. H3 nie ma żadnego z tych parametrów. Jeśli twój pipeline zależy od jednego z nich, to prawdziwy powód, aby zostać.

Czy Veo 3.1 może generować anime w 4:3 lub 15-sekundowy klip?

Nie, i to nie z powodów stylistycznych. Enum aspect_ratio Veo 3.1 zawiera dokładnie 16:9 i 9:16, a jego enum duration zawiera dokładnie 4, 6 i 8. Nie ma wartości 4:3 do wyboru i nie ma sposobu, aby poprosić o 12 lub 15 sekund. Jeśli twoim punktem odniesienia jest anime telewizyjne z lat 90. lub OVA, kadrowanie jest poza zasięgiem Veo i dostępne na H3.

Dlaczego mój klip anime Veo 3.1 wrócił cichy?

Ponieważ generate_audio domyślnie ustawia się na false w API. Przełącznik w playgroundzie jest zwykle już włączony, więc to dotyczy tylko osób wywołujących API bezpośrednio. Ustaw jawnie generate_audio: true. Przy okazji ustaw też resolution, ponieważ domyślnie jest to 720p, a nie 1080p lub 4k, które prawdopodobnie miałeś na myśli.

Czy MiniMax H3 obsługuje japoński dialog i synchronizację ruchu warg dla anime?

Tak. Karta modelu wymienia 11 języków ze stabilnym wsparciem dialogowym: arabski, chiński, angielski, francuski, niemiecki, włoski, japoński, koreański, portugalski, rosyjski i hiszpański. Audio jest generowane łącznie z obrazem w stereo 32 kHz, a nie dubbingowane później, dlatego timing ust trzyma się przez całą linijkę, a nie tylko przez pierwsze sylaby. Wpisz japońską linijkę bezpośrednio w prompcie po japońsku.

Ile obrazów referencyjnych mogę użyć, aby utrzymać spójną postać anime?

MiniMax H3 akceptuje do 9 obrazów, do 3 klipów wideo i do 3 klipów audio, z twardym limitem 12 plików we wszystkich typach. Endpoint reference-to-video Veo 3.1 akceptuje od 1 do 3 obrazów, a jego wybranie zwija duration do 8 jako jedynej dozwolonej wartości. W przypadku powracającej postaci anime w serii ta różnica to cała gra.

MiniMax H3 ma otwarte wagi, więc czy mogę uruchomić mój pipeline anime lokalnie za darmo?

Możesz go pobrać i uruchomić, z trzema zastrzeżeniami. Samodzielnie hostowana inferencja działa na krótkim boku 768, a etapy Context-IR i Regenerate-2K, które produkują 2K, pozostają po stronie API. Rzeczywiste lokalne prędkości różnią się znacznie w zależności od karty: około 10 minut na 10-sekundowy klip 480p na 4070 Ti Super, około 3 minut na 5080, około 68 sekund na RTX 6000 Pro, według wątku ComfyUI z dnia 0. A licencja społecznościowa nie obejmuje obecnie UE, Wielkiej Brytanii, Korei Południowej ani USA, więc jeśli jesteś w jednym z tych krajów, potrzebujesz formalnej licencji przed użyciem komercyjnym.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele