Hela sommaren har mitt flöde visat samma video i en loop. Världscup-spelare omritade som shonen-protagonister. En diktator. En piratkapten. En gråhårig mentor som dyker upp de sista fyra sekunderna. Miljontals visningar per inlägg, och storyn uppdateras efter nästan varje match.
Ingen som gör dem skriver benchmark-inlägg. De väljer en modell, bränner krediter och publicerar före nästa avspark.
Så jag tog en anime-keyframe och en prompt och testade MiniMax H3 som anime-videogenerator mot Veo 3.1, båda körda på maxinställningar med identiska indata.
Det första som gick sönder var inte bildkvaliteten. Det var en rullgardinsmeny. Veo 3.1 stannar vid 8 sekunder och erbjuder exakt två bildförhållanden. En bild som håller på ett ansikte, en sveppanorama med bollen, och sedan en titelskylt som landar – det får inte plats på 8 sekunder. Den fick aldrig chansen att misslyckas på kvalitet.
Viktiga slutsatser
- Veo 3.1:s
duration-enum är[4, 6, 8]och dessaspect_ratio-enum är[16:9, 9:16]. MiniMax H3 kör hela sekunder från 4 till 15 och erbjuder21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Inget 4:3 på Veo innebär ingen retro OVA-inramning, punkt slut. - H3:s modellkort listar 11 inbyggt stabila dialogspråk och japanska är ett av dem. Ljud och bild genereras tillsammans i 32 kHz stereo, inte dubbade efteråt.
- Referenspaket är inte jämförbara: H3 tar upp till 9 bilder plus upp till 3 videor och 3 ljudklipp (max 12 filer). Veo 3.1:s referens-endpoint tar 3 bilder, och så fort du använder den kollapsar
durationtill bara[8]. - Tvåällor som tyst sabbar tester: Veo:s API har
generate_audiosom standardfalseochresolutionsom standard720p, och H3:s text-till-videoratiosom standard1:1. Lämnar du dem som de är jämför du en tyst 720p-klipp med en fyrkantig. - Veo 3.1 har två saker som H3 inte har alls:
seedochnegative_prompt. För 2D-anime är den andra verkligen viktig, och jag ska visa var.
MiniMax H3 Anime Video Generator vs Veo 3.1, Samma Bildruta Rygg mot Rygg
En originalkaraktär. En keyframe. En prompt, kopierad tecken för tecken i båda modellerna. Allt annat maxat på varje sida.
MiniMax H3, bild-till-video, 2K, 8 sekunder, inbyggt ljud. Sätt på ljudet: publikbruset, bollträffen och det japanska ropet genereras i samma pass som bilden. Genererad med minimax/h3/bild-till-video på Atlas Cloud.
Veo 3.1, bild-till-video, 1080p, 8 sekunder, generateaudio påslaget manuellt, plus en negativeprompt som håller linjerna platta. Samma första bildruta, samma ord. Genererad med google/veo3.1/bild-till-video på Atlas Cloud.
Båda ritar vackert. Veos vidvinkelbild av skottet, med handritade stötlinjer och en manga-ljudeffekt som svävar i luften, är genuint vacker. Det är den ärliga utgångspunkten, och det är därför resten av denna artikel handlar om parametrar och instruktionsföljande snarare än vibbar.
Varför de flesta MiniMax H3 Anime Video Generator-tester vs Veo 3.1 går fel
Två saker hände samtidigt i sommar.
Anime blev det mest volymstarka formatet inom AI-video. Världscupen 2026 skrevs om som en shonen-turnering, med spelare castade som en diktator, en piratkapten, en maringeneral och en mentor, och storylinjer som "utvecklas efter nästan varje match" över TikTok, Instagram, X och YouTube (Complex, juli 2026).
Och MiniMax H3 släpptes med öppna vikter. ComfyUI-tråden dag 0 nådde 330 poäng och 95 kommentarer, med folk som postade riktiga lokala siffror inom några timmar (Hacker News, augusti 2026).
Sätt ihop dessa och du skulle förvänta dig en massa anime-jämförelser. Det finns nästan inga, för de flesta tester byggs fel på ett av fyra sätt.
De jämför bilder, inte begränsningar. Anime-bilder handlar om timing. En sveppanorama in i en titelskylt är ett längdproblem innan det är ett renderingsproblem.
De glömmer att Veos API är tyst som standard. På API:et är generate_audio false och resolution är 720p. Många inlägg om "Veo har inget ljud i anime" är bara någon som aldrig slog på en boolesk.
De glömmer att H3:s text-till-video är fyrkantig som standard. ratio som standard är 1:1, inte 16:9. Kör en t2v-anime-prompt utan att ställa in den och du får en fyrkantig klipp och en förvirrad slutsats.
De testar med fotorealistiska prompts. "Cinematiskt, volymetriskt ljus, kort skärpedjup" är precis det ordförråd som drar en 2D-modell mot 3D-renderingsskuggning. Felet i anime är inte oskärpa. Det är plast.
De tre inställningarna som avgör ett anime-test innan du trycker på kör
Innan något annat, ställ in dessa på båda sidor annars är jämförelsen ogiltig.
| Inställning | MiniMax H3 | Veo 3.1 | Vad händer om du hoppar över det |
|---|---|---|---|
| Ljud | Genereras med bilden, alltid på | generate_audio som standard false | Veo returnerar en tyst klipp och ser sämre ut än den är |
| Bildform | ratio som standard 1:1 på text-till-video | aspect_ratio som standard 16:9 | H3 ger dig en fyrkantig anime-bild du inte kan använda |
| Upplösning | som standard 2K | som standard 720p | Du jämför 2K mot 720p och kallar det en kvalitetsskillnad |
MiniMax H3 vs Veo 3.1 Anime-specifikationsblad: Längd, Bildförhållande, Ljud, Referenser
Jag drog båda modellernas live-scheman istället för att lita på något lanseringsinlägg. Varje värde nedan är ett enum du kan läsa själv på modellsidorna, inte ett intryck.
Tabell 1: MiniMax H3 vs Veo 3.1, parametrarna som avgör en anime-bild
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Längd | 4 till 15, varje hel sekund (standard 8) | 4, 6, 8 (standard 8) |
| Bildförhållanden | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Standard bildförhållande (text-till-video) | 1:01 | 16:09 |
| Upplösning | 768P, 2K (standard 2K) | 720p, 1080p, 4k (standard 720p) |
| Ljud | Genereras tillsammans, 32 kHz stereo | generate_audio, standard false |
| Inbyggda dialogspråk | 11 stabila, japanska inkluderat | Inte publicerat som en stabil lista |
| Referenspaket | upp till 9 bilder, 3 videor, 3 ljudklipp, 12 filer totalt | 3 bilder |
| Längd vid användning av referenser | fortfarande 4 till 15 | kollapsar till bara 8 |
| seed | inte tillgängligt | tillgängligt |
| negative_prompt | inte tillgängligt | tillgängligt |
| Vikter | nedladdningsbara | stängda |
Längd, bildförhållande, upplösning, ljud och referensgränser är lästa från live-scheman på MiniMax H3 bild-till-video, H3 text-till-video, H3 referens-till-video, Veo 3.1 bild-till-video och Veo 3.1 referens-till-video sidorna. Taket på 9 bilder och 12 filer, samt listan med 11 språk, kommer från MiniMax H3 modellkortet (Hugging Face, augusti 2026).
Nu resultattavlorna, för de säger något annat än specifikationsbladet och båda spelar roll.
Tabell 2: Crowd-vote Elo och listpris per minut, ögonblicksbild 7 augusti 2026
| Modell | Text-till-video (med ljud) | Bild-till-video (med ljud) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | inte listad i topp 10 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | inte listad i topp 10 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | inte listad i topp 10 | $4.80 |
Elo- och prissiffror från Artificial Analysis Video Arena (Artificial Analysis, augusti 2026). Detta är rullande publikröster och de förändras. Kolumnen $/min är en normaliserad modelluppskattning, inte din faktura.
En skillnad på 145 Elo-poäng är stor, men det är en allmän röst, inte en anime-röst. Och här är delen jag måste säga rakt ut: MiniMax marknadsför inte H3 som en animemodell. Intern förstalinje-feedback listar film, animation och komedi-drama som de områden H3 inte är riktad mot. Så den intressanta frågan är inte "vilken är animemodellen". Det är varför modellen som inte säljer sig på anime fortfarande vinner bilden, och var Google fortfarande tar hem omgången.
En praktisk anmärkning före handledningen. Varje modell nedan körs genom samma konsol och samma API-nyckel, vilket är den enda anledningen till att parametrarna är jämförbara överhuvudtaget. Samma kö, samma auth, en räkning. Om du sätter upp GPT Image 2 på en tjänst och Veo på en annan kommer hälften av skillnaderna du hittar vara rörläggning snarare än modell.
Bygg bilden: MiniMax H3 vs Veo 3.1, Steg för Steg
Ett löpande exempel, från början till slut. "Last Whistle": en original tonårsspelare, rött hår, vit och marinblå nummer 9-tröja, strålkastare, en svepande panorering på skottet, och en japansk titelskylt som måste landa de sista två sekunderna och hålla stilla.
Ingen riktig spelare, ingen officiell karaktär, ingen befintlig anime-IP. Stil och homage endast. Mer om varför om en stund.
Steg 1: Designa anime-keyframe med GPT Image 2
Keyframe bär den konstnärliga riktningen så att videomodellen inte behöver uppfinna den. Notera det negativa utrymmet på den vänstra tredjedelen: det är avsiktligt. Titelskylten skrivs där av videomodellen, och det är text-stabilitetstestet.
Plain1En enskild bildruta från en modern shonen sportanime. Cel-shaded 2D-animation, handritad 2linjekonst med konsekvent linjetjocklek, platta färgfyllningar, hårdkantade grafiska 3skuggor, absolut ingen 3D-skuggning och ingen fotorealistisk hud. Närbild på en original 4tonårsspelare: rufsigt mörkrött hår, vit och marinblå tröja med nummer 9, svett och 5grässtrimmor över ena kinden, ögonen vidöppna med utmattad beslutsamhet, munnen öppen 6mitt i ett rop. Bakom honom flammar stadionstrålkastarna mot en vägg av suddig publikfärg; 7radiella hastighetslinjer briserar från mitten av bilden; ett grässtrå hänger fruset i 8luften. Mättad palett, djupa cyanfärgade skuggor, varm orange kantljus. 16:9-komposition, 9karaktären inramad till höger om mitten, rent negativt utrymme på den vänstra tredjedelen. 10Ingen text någonstans i bilden.
Inställningar: modell openai/gpt-image-2/text-to-image, kvalitet high, storlek 16:9 (2048x1152). Inget annat.

GPT Image 2-playground på Atlas Cloud med Last Whistle-keyframe-prompten och den färdiga anime-bilden i utmatningspanelen
GPT Image 2 på Atlas Cloud: kvalitet inställd på high, den färdiga keyframe till höger.

Bas-keyframe: en original rödhårig spelare mitt i ett rop under stadionstrålkastare, cel-shaded med platta färger och hastighetslinjer
Keyframe som båda modellerna får. Platt färg, hårda skuggor och ett tomt vänster tredjedel som väntar på en titelskylt.
Steg 2: MiniMax H3 bild-till-video, allt maxat
Samma bild in, 2K ut. Jag höll H3 till 8 sekunder här endast för att matcha Veos tak. Det är inte H3:s gräns och steg 4 tar bort locket.
Plain1Cel-shaded 2D anime, handritad linjetjocklek, platt färg, ingen 3D-skuggning. Håll på 2spelarens ansikte i ett slag, sedan en våldsam svepande panorering följer bollen när han 3sparkar den, panoreringen smetar ut bilden i strimmiga sakuga-rörelsespår. En ram av total 4tystnad vid nedslaget. Under de sista två sekunderna slår djärva vita japanska 5titellbokstäver som lyder ラストホイッスル in på den vänstra tredjedelen av bilden och 6håller sig bergsäkra, ingen förvrängning, inget flimmer, ingen drift. Spelaren ropar en 7rad på japanska: 「まだ終わってない!」 8Ljud: stadiondån som sväller, en skarp bollträff, ett lågt taiko-slag under titelskylten.
Inställningar: modell minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (bild-till-video tar sin bildform från din inmatningsbild), image = resultatet från steg 1.
En varning om du istället går till text-till-video: skriv ratio: 16:9 explicit. Standard är 1:1 och den kommer glatt att ge dig en fyrkantig anime-bild.

MiniMax H3 bild-till-video-playground på Atlas Cloud med Last Whistle-prompten, keyframe laddad och den färdiga klippet i utmatningspanelen
MiniMax H3 bild-till-video på Atlas Cloud: keyframe från steg 1 laddad till vänster, den färdiga klippet spelas till höger.
Steg 3: Veo 3.1 bild-till-video, ljud påslaget manuellt
Prompten är identisk, ord för ord. Ändra ett enda adjektiv och det slutar vara en jämförelse. Vad som ändras är det extra fältet Veo ger dig och H3 inte har.
negative_prompt, som för 2D-anime är den mest användbara kontrollen på denna lista:
Plain13D-render, CGI, plastskuggning, fotorealistisk hud, live-action-filmmaterial, rörelseoskärpa 2soppa, förvrängda bokstäver, gibberish-text, extra fingrar, undertextfält
Inställningar: modell google/veo3.1/image-to-video, resolution: 1080p (ändra det, standard är 720p), duration: 8 (detta är taket), aspect_ratio: 16:9, generate_audio: true (API-standarden är false, detta är den tysta klippfällan), seed: 20260807, image = samma resultat från steg 1.

Veo 3.1 bild-till-video-playground på Atlas Cloud som visar generate audio påslaget, anime-keyframe laddad och den färdiga klippet i utmatningspanelen
Veo 3.1 bild-till-video på Atlas Cloud, med Generate Audio påslaget och den färdiga klippet till höger.
Steg 4: Poängsätt på fem anime-specifika axlar
Inget att generera här. Titta bara, på de saker anime faktiskt går sönder på. Båda klippen är inbäddade i början av denna artikel, så du kan poängsätta dem själv istället för att ta mitt ord.

Sida vid sida av den sista bildrutan från båda klippen, MiniMax H3 till vänster med ren japansk titeltext, Veo 3.1 till höger med förvrängda vertikala tecken
Den sista bildrutan av varje klipp. Vänster, H3 skrev ラストホイッスル, alla åtta katakana korrekta och bergsäkra. Höger, Veo 3.1 skrev tre tecken som inte är det begärda ordet och inte bildar ett.
Titelskylten är där omgången avgjordes, och det var inte nära. H3 renderade den begärda katakanan exakt, hårdkantad och stabil, över en strimmig panorering av målburen. Veo 3.1 producerade en vertikal stapel med tre tecken som varken är det begärda ordet eller ett ord. På samma bildruta tappade den också karaktären ur bild och lät bakgrunden glida mot semi-fotorealistisk stadionskiva, trots photorealistic skin och 3D render i den negativa prompten.
Tabell 3: fem axlar som avgör en anime-bild, från dessa två körningar
| Axe | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Karaktärskontinuitet från keyframe | Behåll exakt ansikte, hår och tröja under hela 8 sekunderna | Ritade om karaktären i en ny vidvinkelbild, modellmässigt men en annan teckning |
| Linjetjocklek och platt cel-shading | Behållen, ingen drift mot 3D | Behållen i mellanbilden, drev mot fotografisk stadionskiva vid slutet |
| Japansk titelskylt | ラストホイッスル renderad korrekt och stabil | Tre tecken, inte det begärda ordet, inte ett ord |
| Levererat ljudspår | 32 kHz stereo, exakt som modellkortet anger | 48 kHz stereo, närvarande endast för att jag ställde in generate_audio själv |
| Svepande panorering och sakuga-smet | Utförd som en smetande panorering in i titeln | Ersatt med en hård klippning till en ny bild |
Den sista raden är den mest högljudda offentliga kritiken av H3 hittills, vilket är exakt varför jag skrev in den i båda promptarna. På ComfyUI-tråden dag 0 klagade användaren fwip på att även de officiella demo-promptarna ignorerades: "en våldsam WHIP PAN från taket som SMEAR bort de svävande orden med sig, rörelsestrimmig. Och videon gjorde helt enkelt inte den övergången alls, den ersatte den bara med en klippning."
I denna körning var det Veo som bytte panoreringen mot en klippning, och H3 som smetade. En tagning varje är inte ett slutgiltigt omdöme, och jag skulle inte påstå något annat. Men det betyder att kritiken inte är H3-specifik: svepande panoreringar är den minst pålitliga instruktionen i hela detta test på båda sidor. Om din storyboard är beroende av en, storyboarda runt den snarare än genom den.
Steg 5: Den 4:3 retro OVA-bilden som Veo 3.1 strukturellt inte kan producera
Detta är inte en kvalitetspreferens. Det är en vägg. Veos aspect_ratio-enum har två värden och inget är 4:3, och dess duration-enum har inget 12. 90-tals OVA-utseendet är helt enkelt inte nåbart.
Plain1En 1990-tals OVA-anime-bild, 4:3 fullbild. Handmålad bakgrundskonst med synlig 2penselstruktur, cel-färgade karaktärer med tjocka ojämna bläcklinjer, tung halation glöd 3runt strålkastarna, 16mm filmkorn och svag grindvackel. Samma rödhåriga spelare i en 4vit och marinblå nummer 9-tröja går av en regnvåt plan medan publikbruset tonar bort till 5en enda ringande ton. Kameran zoomar sakta in på hans ansikte. Han säger tyst på japanska: 6「次は、勝つ」. Retro-palett: dämpad teal, dammig bärnsten, djupa vinröda skuggor. Ljud: 7avlägset regn, en ensam analog synth-pad, en med efterklang tung vissla i fjärran.
Inställningar: modell minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Ställ in det bildförhållandet manuellt, kom ihåg standard.

MiniMax H3 text-till-video-playground på Atlas Cloud med OVA-prompten inskriven och den färdiga retro-klippet i utmatningspanelen
MiniMax H3 text-till-video på Atlas Cloud, OVA-prompt inskriven, klippet färdigt. Full avslöjande: denna specifika körning lämnade Aspect Ratio på 16:9 och Duration på 8, så vad du ser till höger är widescreen-kortversionen. 4:3 tolvsekundersklippet nedan kom från API-anropet med ratio: 4:3 och duration: 12 uttryckligen inställda.

Den 4:3 retro OVA-bilden: samma spelare som går av en regnvåt plan i 90-tals anime-stil
H3 text-till-video, 4:3, 12 sekunder. Den levererade filen kom tillbaka 1920x1440, vilket är 4:3 till pixeln, med ett 32 kHz stereospår. Visad här som en tyst GIF i reducerad bildfrekvens för att hålla sidan lätt. Genererad med minimax/h3/text-to-video på Atlas Cloud.
Steg 6: Nio referensbilder, en karaktär, fyra klipp
Korsbilds-karaktärskonsistens är det svåraste problemet inom AI-anime, och det löses med referensvolym. Bygg först paketet: kör om prompten från steg 1 med inramningen utbytt för fram, trekvarts, hel profil, bak, skrattande, sammanbitna tänder, helkroppshållning, tröjdetalj och skodetalj. Nio bilder, ungefär åtta cent totalt.

Fyra vinklar av samma original spelare genererad som ett referenspaket, arrangerade i ett två gånger två rutnät
Fyra av de nio referensvinklarna. H3 accepterar upp till nio bilder i ett referenspaket, plus video- och ljudreferenser ovanpå.
Plain1Cel-shaded 2D anime, konsekvent handritad linjetjocklek, platt färg, ingen 3D-skuggning. 2Behåll den refererade spelarens ansikte, hår silhuett och nummer 9-tröja identisk över 3varje klipp. Fyra klipp i en kontinuerlig tagning: (1) lågvinkel push-in på hans stövlar 4som träffar gräset, (2) svepande panorering upp till en tight närbild av hans ögon, (3) 5vidvinkelbild av honom sprintande förbi tre försvarare ritade som suddiga silhuetter, (4) 6frys på en nick i luften, hastighetslinjer exploderar utåt. Ljud: publikdån, andetag, 7stövel-mot-gräs nedslag, ett taiko-slag på frysen.
Inställningar: modell minimax/h3/reference-to-video, refers = dina bilder med type: image, resolution: 2K, duration: 8 eller högre, ratio: adaptive eller 16:9.
Motsvarigheten på Veo 3.1 kan inte köras med dessa inställningar och du behöver inte försöka för att veta varför. Dess referens-endpoint accepterar maximalt tre bilder, och att välja den endpointen kollapsar duration till ett enda lagligt värde på 8. Ett nio-bilders paket och en 10-sekunders tagning är båda utanför räckvidd.

MiniMax H3 referens-till-video-playground på Atlas Cloud som visar referensräknaren på fyra av nio och det första klippet i utmatningspanelen
MiniMax H3 referens-till-video på Atlas Cloud. Räknaren visar Reference Materials (4/9) med MAX:9 under, vilket är taket i gränssnittet snarare än ett påstående från ett specifikationsblad. Utmatningen är klipp ett, lågvinkel push-in på stövlarna.
Fyra fler MiniMax H3 Anime Video Generator-körningar värda att göra
Last Whistle-bilden testar bara fyra av skillnaderna. Dessa fyra testar resten. Alla körs på H3; anteckningarna säger vilka Veo 3.1 kan matcha.
- Ultrawide sakuga-kamp,
21:9, 10 sekunder. Veo kan inte producera 21:9 alls.
Plain1Cel-shaded 2D anime-action, tjocka avsmalnande bläcklinjer, platt färg, hårdkantade 2skuggor, ingen 3D-skuggning. Två original maskerade duellanter på ett vindpinat tempeltak 3i skymningen. Klingkollision, bilden skakar, båda slåssmännen bryter isär i en explosion av 4handritade nedslagsbilder och radiella hastighetslinjer. Kamera: lågvinkel push-in, sedan 5en lateral spårning, sedan en snabb övergång till en bred silhuett mot den orangea himlen. 6Ljud: två skarpa metallkollisioner, tygsmäll, ett lågt taiko-slag på den sista frysen, 7ingen musik.
- Takt-synkad AMV-klipp, referens-till-video med en ljudreferens. H3 tar upp till tre ljudklipp som referensinmatning. Veo 3.1 har ingen ljudinmatning alls, endast ljudutmatning.
Plain1Cel-shaded 2D anime-montage klippt till det refererade ljudspåret. Fem korta beat: regn 2på ett fönster, en hand som drar åt ett bandage, en stadshorisont som blinkar förbi ett 3tågfönster, en sprintstart, en frys på en utsträckt hand. Varje klipp landar exakt på en 4nedslag av det refererade ljudet. Platt färg, tjocka bläcklinjer, högkontrast nattpalett 5av djup indigo och neon magenta.
- Två-radig japansk dialogscen, 12 sekunder. Detta är lip-sync-stresstestet, och 12 sekunder är redan utanför Veos räckvidd.
Plain1Cel-shaded 2D anime, platt färg, ingen 3D-skuggning. Två originalkaraktärer på ett tak 2i gyllene timmen, skott-växel-skott. Första säger på japanska:「本当に行くの?」. Den andra 3svarar, halvleende, på japanska:「もう決めた」. Munnar matchar varje stavelse. Varmt 4kantljus, långa skuggor, mild vind i håret. Ljud: två distinkta japanska röster, avlägsen 5trafik, en cikada.
- Vertikal shonen-kort,
9:16, 8 sekunder. Båda modellerna kan göra vertikalt, så detta är det enda stället att faktiskt A/B-testa dem snarare än att anta.
Plain1Cel-shaded 2D anime, vertikal komposition. En original tonårslöpare brister genom en 2pappersbanner i slow-motion, sedan snäpper bilden tillbaka till full hastighet när hon 3accelererar nerför en stadionraka. Hastighetslinjer, platt färg, hårda skuggor, djärv 4grafisk himmel. Kamera: lågvinkel följningsbild, sedan en svepande panorering upp till 5hennes ansikte. Ljud: banner-sönderrivning, publiksvall, ett andetag som hålls och sedan 6släpps. 7 8Om du vill ha promptgrammatiken bakom dessa, [MiniMax H3 prompt-guide] (https://www.atlascloud.ai/blog/guides/minimax-h3-prompt-guide?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) går djupare in på hur H3 tolkar kamera- och ljudinstruktioner än jag kan här.
Vad en 60-sekunders anime-opener kostar på MiniMax H3 vs Veo 3.1
En standard anime-OP är ungefär 90 sekunder. Kalla det åtta bilder på 8 sekunder, 64 sekunder färdig video, plus en keyframe per bild för $0,009 styck.
Det finns en verklig prisskillnad som du bör känna till istället för att jag sopar under mattan. Atlas Cloud-katalogen listar MiniMax H3 till $0,10 per sekund fast, medan modellens readme delar upp det som $0,14/s vid 2K och $0,10/s vid 768P. Veo 3.1 är listad till $0,20 per sekund, medan dess readme skiljer på $0,40/s med ljud och $0,20/s utan.
Körknapparna i mina skärmdumpar avgör det. H3 referens-till-video, 8 sekunder vid 2K, angav Run $1,12, vilket är exakt $0,14 per sekund. Veo 3.1 bild-till-video, 8 sekunder vid 1080p med ljud på, angav Run $3.2, vilket är exakt $0,40 per sekund. Så readme-takterna är de som faktureras, och katalogrubriken är ingångsnivån. Jag har visat båda läsningarna nedan ändå. Dessa är listpriser från och med augusti 2026.
Tabell 4: åtta bilder på 8 sekunder, keyframes inkluderade
| Uppsättning | Videokostnad (katalogpris) | Videokostnad (readme-pris) | Keyframes | Totalt intervall |
|---|---|---|---|---|
| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 till $9.03 |
| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1, 1080p med ljud | $12.80 | $25.60 | $0.07 | $12.87 till $25.67 |
| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 |
Priser hämtade från Atlas Cloud-modellsidorna länkade i Tabell 1, augusti 2026. Ingen av dessa fyra är rabatterade just nu.
Två saker som tabellen inte inkluderar, och båda slår hårdare än priset per sekund.
Omtagningar. Ingen skickar den första tagningen av en anime-bild. Vilken multiplikator du än antar, tillämpa den på båda kolumnerna och gapet vidgas i samma proportion.
Väggklocka, och denna går åt andra hållet. Tidsinställd från början till slut den 7 augusti 2026: H3 vid 2K för 8 sekunder tog 447 sekunder, cirka 7,5 minuter. H3 text-till-video vid 2K för 12 sekunder tog 334 sekunder. Veo 3.1 vid 1080p för 8 sekunder med ljud tog 152 sekunder, under tre minuter. Veo är ungefär tre gånger snabbare till en första tagning här, och om du itererar på en bild klockan 02:00 är det värt riktiga pengar. Köer förändras, så behandla dessa som en ögonblicksbild från en eftermiddag snarare än en specifikation. Men alla som citerar "2 till 3 minuter" för H3 vid 2K citerar en readme, inte en kö. Uppdelningen mellan 2K och 768P täcker när den högre nivån är värd de extra minuterna.
Anime-stil, Homage och Vad du faktiskt kan publicera
Allt i denna artikel är stil och homage. En originalkaraktär, en originaltröja, en originaltitel. Ingen officiell anime-karaktär genererades eller begärdes, och ingen riktig fotbollsspelares namn eller likhet användes. Världscup-trenden refereras som ett format, för att det är vad den är användbar för.
Den distinktionen är inte dekoration. Om du producerar anime-stilat innehåll kommersiellt är "i stil med 90-tals OVA" och "denna specifika karaktär från denna specifika show" olika juridiska objekt, och endast en av dem är en affärsverksamhet.
Om de öppna vikterna: H3 är verkligen nedladdningsbart, och folk körde det dag ett. En kommentator rapporterade 10 minuter för en 10-sekunders 480p-klipp på en 4070 Ti Super med 16 GB, och andra postade 3 minuter på en 5080 och 68 sekunder på en RTX 6000 Pro. Men självhostning körs med en 768 kort sida; Context-IR- och Regenerate-2K-stegen som producerar 2K förblir på API-sidan.
Licensen har en verklig hake. Community-licensen täcker för närvarande inte EU, Storbritannien, Sydkorea eller USA, med hänvisning till regioner "som för närvarande utvecklar eller tillämpar AI-relaterade regleringar". En formell licensansökningskanal är öppen, vilket en HN-kommentator sammanfattade som "du måste bara pinkie promise att du inte kommer göra disney arg och de kommer skicka dig en licens". Roligt, och också exakt det efterlevnadssteg du inte kan hoppa över om du befinner dig i ett av dessa fyra territorier. Genomgången av öppna vikter har den fullständiga territorielistan.
Vanliga frågor
Är MiniMax H3 en bra anime-videogenerator jämfört med Veo 3.1?
För de flesta anime-arbeten, H3, och främst av skäl som inte handlar om rendering. Den kör 4 till 15 sekunder mot Veos 4, 6 eller 8, den erbjuder sex bildförhållanden inklusive 4:3 och 21:9 mot Veos två, den listar japanska bland 11 inbyggt stabila dialogspråk, och den tar nio referensbilder mot Veos tre. Veo 3.1 vinner i en specifik situation: när du behöver seed för reproducerbara omtagningar, eller negative_prompt för att förhindra att en bild glider mot 3D-renderingsskuggning. H3 har ingen av dessa parametrar. Om din pipeline är beroende av någon av dem är det en genuin anledning att stanna.
Kan Veo 3.1 generera anime i 4:3 eller en 15-sekunders klipp?
Nej, och inte av stilistiska skäl. Veo 3.1:s aspect_ratio-enum innehåller exakt 16:9 och 9:16, och dess duration-enum innehåller exakt 4, 6 och 8. Det finns inget 4:3-värde att välja och inget sätt att begära 12 eller 15 sekunder. Om din referens är en 90-tals TV-anime eller OVA är inramningen utom räckhåll på Veo och tillgänglig på H3.
Varför kom min Veo 3.1 anime-klipp tillbaka tyst?
För att generate_audio som standard är false på API:et. Playground-växeln är vanligtvis redan på, så detta drabbar bara de som anropar API:et direkt. Ställ in generate_audio: true explicit. Medan du håller på, ställ också in resolution, eftersom den som standard är 720p snarare än den 1080p eller 4k du förmodligen menade.
Gör MiniMax H3 japansk dialog och läppsynk för anime?
Ja. Modellkortet listar 11 språk med stabilt dialogstöd: arabiska, kinesiska, engelska, franska, tyska, italienska, japanska, koreanska, portugisiska, ryska och spanska. Ljud genereras tillsammans med bilden i 32 kHz stereo snarare än dubbat efteråt, vilket är varför mun-timing håller över en hel rad istället för de första stavelserna. Skriv den japanska raden direkt i prompten på japanska.
Hur många referensbilder kan jag använda för att hålla en anime-karaktär konsekvent?
MiniMax H3 accepterar upp till 9 bilder, upp till 3 videoklipp och upp till 3 ljudklipp, med ett hårt tak på 12 filer över alla typer. Veo 3.1:s referens-till-video-endpoint accepterar 1 till 3 bilder, och att välja den kollapsar duration till 8 som det enda lagliga värdet. För en återkommande anime-karaktär över en serie är den skillnaden hela bollen.
MiniMax H3 har öppna vikter, så kan jag köra min anime-pipeline lokalt gratis?
Du kan ladda ner och köra den, med tre varningar. Självhostad inferens körs med en 768 kort sida, och Context-IR- och Regenerate-2K-stegen som producerar 2K-utdata förblir API-sida. Verkliga lokala hastigheter varierar kraftigt beroende på kort: ungefär 10 minuter för en 10-sekunders 480p-klipp på en 4070 Ti Super, cirka 3 minuter på en 5080, cirka 68 sekunder på en RTX 6000 Pro, enligt ComfyUI-tråden dag 0. Och community-licensen täcker för närvarande inte EU, Storbritannien, Sydkorea eller USA, så om du är i ett av dessa behöver du den formella licensen före kommersiellt bruk.






