Seedance 2.5 är nu live — Först på Atlas Cloud

MiniMax H3 Anime-videogenerator: 15 sekunder, 4:3, och titelkortet som Veo 3.1 misslyckades med

MiniMax H3 animevideogenerator mot Veo 3.1 på samma nyckelbild. H3 kör 4 till 15 sekunder och sex bildförhållanden, Veo begränsas till 8 sekunder och två. Japansk dialog, 9 referenser, verkliga körningar.

Hela sommaren har mitt flöde visat samma video i en loop. Världscup-spelare omritade som shonen-protagonister. En diktator. En piratkapten. En gråhårig mentor som dyker upp de sista fyra sekunderna. Miljontals visningar per inlägg, och storyn uppdateras efter nästan varje match.

Ingen som gör dem skriver benchmark-inlägg. De väljer en modell, bränner krediter och publicerar före nästa avspark.

Så jag tog en anime-keyframe och en prompt och testade MiniMax H3 som anime-videogenerator mot Veo 3.1, båda körda på maxinställningar med identiska indata.

Det första som gick sönder var inte bildkvaliteten. Det var en rullgardinsmeny. Veo 3.1 stannar vid 8 sekunder och erbjuder exakt två bildförhållanden. En bild som håller på ett ansikte, en sveppanorama med bollen, och sedan en titelskylt som landar – det får inte plats på 8 sekunder. Den fick aldrig chansen att misslyckas på kvalitet.

Viktiga slutsatser

  • Veo 3.1:s duration-enum är [4, 6, 8] och dess aspect_ratio-enum är [16:9, 9:16]. MiniMax H3 kör hela sekunder från 4 till 15 och erbjuder 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Inget 4:3 på Veo innebär ingen retro OVA-inramning, punkt slut.
  • H3:s modellkort listar 11 inbyggt stabila dialogspråk och japanska är ett av dem. Ljud och bild genereras tillsammans i 32 kHz stereo, inte dubbade efteråt.
  • Referenspaket är inte jämförbara: H3 tar upp till 9 bilder plus upp till 3 videor och 3 ljudklipp (max 12 filer). Veo 3.1:s referens-endpoint tar 3 bilder, och så fort du använder den kollapsar duration till bara [8].
  • Tvåällor som tyst sabbar tester: Veo:s API har generate_audio som standard false och resolution som standard 720p, och H3:s text-till-video ratio som standard 1:1. Lämnar du dem som de är jämför du en tyst 720p-klipp med en fyrkantig.
  • Veo 3.1 har två saker som H3 inte har alls: seed och negative_prompt. För 2D-anime är den andra verkligen viktig, och jag ska visa var.

MiniMax H3 Anime Video Generator vs Veo 3.1, Samma Bildruta Rygg mot Rygg

En originalkaraktär. En keyframe. En prompt, kopierad tecken för tecken i båda modellerna. Allt annat maxat på varje sida.

MiniMax H3, bild-till-video, 2K, 8 sekunder, inbyggt ljud. Sätt på ljudet: publikbruset, bollträffen och det japanska ropet genereras i samma pass som bilden. Genererad med minimax/h3/bild-till-video på Atlas Cloud.

Veo 3.1, bild-till-video, 1080p, 8 sekunder, generateaudio påslaget manuellt, plus en negativeprompt som håller linjerna platta. Samma första bildruta, samma ord. Genererad med google/veo3.1/bild-till-video på Atlas Cloud.

Båda ritar vackert. Veos vidvinkelbild av skottet, med handritade stötlinjer och en manga-ljudeffekt som svävar i luften, är genuint vacker. Det är den ärliga utgångspunkten, och det är därför resten av denna artikel handlar om parametrar och instruktionsföljande snarare än vibbar.

Varför de flesta MiniMax H3 Anime Video Generator-tester vs Veo 3.1 går fel

Två saker hände samtidigt i sommar.

Anime blev det mest volymstarka formatet inom AI-video. Världscupen 2026 skrevs om som en shonen-turnering, med spelare castade som en diktator, en piratkapten, en maringeneral och en mentor, och storylinjer som "utvecklas efter nästan varje match" över TikTok, Instagram, X och YouTube (Complex, juli 2026).

Och MiniMax H3 släpptes med öppna vikter. ComfyUI-tråden dag 0 nådde 330 poäng och 95 kommentarer, med folk som postade riktiga lokala siffror inom några timmar (Hacker News, augusti 2026).

Sätt ihop dessa och du skulle förvänta dig en massa anime-jämförelser. Det finns nästan inga, för de flesta tester byggs fel på ett av fyra sätt.

De jämför bilder, inte begränsningar. Anime-bilder handlar om timing. En sveppanorama in i en titelskylt är ett längdproblem innan det är ett renderingsproblem.

De glömmer att Veos API är tyst som standard. På API:et är generate_audio false och resolution är 720p. Många inlägg om "Veo har inget ljud i anime" är bara någon som aldrig slog på en boolesk.

De glömmer att H3:s text-till-video är fyrkantig som standard. ratio som standard är 1:1, inte 16:9. Kör en t2v-anime-prompt utan att ställa in den och du får en fyrkantig klipp och en förvirrad slutsats.

De testar med fotorealistiska prompts. "Cinematiskt, volymetriskt ljus, kort skärpedjup" är precis det ordförråd som drar en 2D-modell mot 3D-renderingsskuggning. Felet i anime är inte oskärpa. Det är plast.

De tre inställningarna som avgör ett anime-test innan du trycker på kör

Innan något annat, ställ in dessa på båda sidor annars är jämförelsen ogiltig.

InställningMiniMax H3Veo 3.1Vad händer om du hoppar över det
LjudGenereras med bilden, alltid pågenerate_audio som standard falseVeo returnerar en tyst klipp och ser sämre ut än den är
Bildformratio som standard 1:1 på text-till-videoaspect_ratio som standard 16:9H3 ger dig en fyrkantig anime-bild du inte kan använda
Upplösningsom standard 2Ksom standard 720pDu jämför 2K mot 720p och kallar det en kvalitetsskillnad

MiniMax H3 vs Veo 3.1 Anime-specifikationsblad: Längd, Bildförhållande, Ljud, Referenser

Jag drog båda modellernas live-scheman istället för att lita på något lanseringsinlägg. Varje värde nedan är ett enum du kan läsa själv på modellsidorna, inte ett intryck.

Tabell 1: MiniMax H3 vs Veo 3.1, parametrarna som avgör en anime-bild

MiniMax H3Veo 3.1
Längd4 till 15, varje hel sekund (standard 8)4, 6, 8 (standard 8)
Bildförhållanden21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
Standard bildförhållande (text-till-video)1:0116:09
Upplösning768P, 2K (standard 2K)720p, 1080p, 4k (standard 720p)
LjudGenereras tillsammans, 32 kHz stereogenerate_audio, standard false
Inbyggda dialogspråk11 stabila, japanska inkluderatInte publicerat som en stabil lista
Referenspaketupp till 9 bilder, 3 videor, 3 ljudklipp, 12 filer totalt3 bilder
Längd vid användning av referenserfortfarande 4 till 15kollapsar till bara 8
seedinte tillgängligttillgängligt
negative_promptinte tillgängligttillgängligt
Vikternedladdningsbarastängda

Längd, bildförhållande, upplösning, ljud och referensgränser är lästa från live-scheman på MiniMax H3 bild-till-video, H3 text-till-video, H3 referens-till-video, Veo 3.1 bild-till-video och Veo 3.1 referens-till-video sidorna. Taket på 9 bilder och 12 filer, samt listan med 11 språk, kommer från MiniMax H3 modellkortet (Hugging Face, augusti 2026).

Nu resultattavlorna, för de säger något annat än specifikationsbladet och båda spelar roll.

Tabell 2: Crowd-vote Elo och listpris per minut, ögonblicksbild 7 augusti 2026

ModellText-till-video (med ljud)Bild-till-video (med ljud)$/min
Gemini Omni Flash1,244 (#1) ±71,191 (#2) ±9$6.00
MiniMax H31,238 (#2) ±91,190 (#3) ±10$7.80
Dreamina Seedance 2.0 720p1,224 (#3) ±61,198 (#1) ±7$9.07
Kling 3.0 1080p (Pro)1,111 (#7) ±6inte listad i topp 10$20.16
Veo 3.11,093 (#11) ±71,085 (#10) ±7$24.00
Veo 3.1 Fast1,091 (#14) ±6inte listad i topp 10$9.00
Veo 3.1 Lite1,089 (#15) ±7inte listad i topp 10$4.80

Elo- och prissiffror från Artificial Analysis Video Arena (Artificial Analysis, augusti 2026). Detta är rullande publikröster och de förändras. Kolumnen $/min är en normaliserad modelluppskattning, inte din faktura.

En skillnad på 145 Elo-poäng är stor, men det är en allmän röst, inte en anime-röst. Och här är delen jag måste säga rakt ut: MiniMax marknadsför inte H3 som en animemodell. Intern förstalinje-feedback listar film, animation och komedi-drama som de områden H3 inte är riktad mot. Så den intressanta frågan är inte "vilken är animemodellen". Det är varför modellen som inte säljer sig på anime fortfarande vinner bilden, och var Google fortfarande tar hem omgången.

En praktisk anmärkning före handledningen. Varje modell nedan körs genom samma konsol och samma API-nyckel, vilket är den enda anledningen till att parametrarna är jämförbara överhuvudtaget. Samma kö, samma auth, en räkning. Om du sätter upp GPT Image 2 på en tjänst och Veo på en annan kommer hälften av skillnaderna du hittar vara rörläggning snarare än modell.

Bygg bilden: MiniMax H3 vs Veo 3.1, Steg för Steg

Ett löpande exempel, från början till slut. "Last Whistle": en original tonårsspelare, rött hår, vit och marinblå nummer 9-tröja, strålkastare, en svepande panorering på skottet, och en japansk titelskylt som måste landa de sista två sekunderna och hålla stilla.

Ingen riktig spelare, ingen officiell karaktär, ingen befintlig anime-IP. Stil och homage endast. Mer om varför om en stund.

Steg 1: Designa anime-keyframe med GPT Image 2

Keyframe bär den konstnärliga riktningen så att videomodellen inte behöver uppfinna den. Notera det negativa utrymmet på den vänstra tredjedelen: det är avsiktligt. Titelskylten skrivs där av videomodellen, och det är text-stabilitetstestet.

Plain
1En enskild bildruta från en modern shonen sportanime. Cel-shaded 2D-animation, handritad
2linjekonst med konsekvent linjetjocklek, platta färgfyllningar, hårdkantade grafiska
3skuggor, absolut ingen 3D-skuggning och ingen fotorealistisk hud. Närbild på en original
4tonårsspelare: rufsigt mörkrött hår, vit och marinblå tröja med nummer 9, svett och
5grässtrimmor över ena kinden, ögonen vidöppna med utmattad beslutsamhet, munnen öppen
6mitt i ett rop. Bakom honom flammar stadionstrålkastarna mot en vägg av suddig publikfärg;
7radiella hastighetslinjer briserar från mitten av bilden; ett grässtrå hänger fruset i
8luften. Mättad palett, djupa cyanfärgade skuggor, varm orange kantljus. 16:9-komposition,
9karaktären inramad till höger om mitten, rent negativt utrymme på den vänstra tredjedelen.
10Ingen text någonstans i bilden.

Inställningar: modell openai/gpt-image-2/text-to-image, kvalitet high, storlek 16:9 (2048x1152). Inget annat.

AI-bildgeneratorgränssnitt som visar prompt och genererad anime-fotbollsspelare

GPT Image 2-playground på Atlas Cloud med Last Whistle-keyframe-prompten och den färdiga anime-bilden i utmatningspanelen

GPT Image 2 på Atlas Cloud: kvalitet inställd på high, den färdiga keyframe till höger.

Rödhårig anime-fotbollsspelare som skriker i en fullsatt stadion

Bas-keyframe: en original rödhårig spelare mitt i ett rop under stadionstrålkastare, cel-shaded med platta färger och hastighetslinjer

Keyframe som båda modellerna får. Platt färg, hårda skuggor och ett tomt vänster tredjedel som väntar på en titelskylt.

Steg 2: MiniMax H3 bild-till-video, allt maxat

Samma bild in, 2K ut. Jag höll H3 till 8 sekunder här endast för att matcha Veos tak. Det är inte H3:s gräns och steg 4 tar bort locket.

Plain
1Cel-shaded 2D anime, handritad linjetjocklek, platt färg, ingen 3D-skuggning. Håll på
2spelarens ansikte i ett slag, sedan en våldsam svepande panorering följer bollen när han
3sparkar den, panoreringen smetar ut bilden i strimmiga sakuga-rörelsespår. En ram av total
4tystnad vid nedslaget. Under de sista två sekunderna slår djärva vita japanska
5titellbokstäver som lyder ラストホイッスル in på den vänstra tredjedelen av bilden och
6håller sig bergsäkra, ingen förvrängning, inget flimmer, ingen drift. Spelaren ropar en
7rad på japanska: 「まだ終わってない!」
8Ljud: stadiondån som sväller, en skarp bollträff, ett lågt taiko-slag under titelskylten.

Inställningar: modell minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (bild-till-video tar sin bildform från din inmatningsbild), image = resultatet från steg 1.

En varning om du istället går till text-till-video: skriv ratio: 16:9 explicit. Standard är 1:1 och den kommer glatt att ge dig en fyrkantig anime-bild.

AI-videogeneratorgränssnitt som visar textprompt och genererad anime-video

MiniMax H3 bild-till-video-playground på Atlas Cloud med Last Whistle-prompten, keyframe laddad och den färdiga klippet i utmatningspanelen

MiniMax H3 bild-till-video på Atlas Cloud: keyframe från steg 1 laddad till vänster, den färdiga klippet spelas till höger.

Steg 3: Veo 3.1 bild-till-video, ljud påslaget manuellt

Prompten är identisk, ord för ord. Ändra ett enda adjektiv och det slutar vara en jämförelse. Vad som ändras är det extra fältet Veo ger dig och H3 inte har.

negative_prompt, som för 2D-anime är den mest användbara kontrollen på denna lista:

Plain
13D-render, CGI, plastskuggning, fotorealistisk hud, live-action-filmmaterial, rörelseoskärpa
2soppa, förvrängda bokstäver, gibberish-text, extra fingrar, undertextfält

Inställningar: modell google/veo3.1/image-to-video, resolution: 1080p (ändra det, standard är 720p), duration: 8 (detta är taket), aspect_ratio: 16:9, generate_audio: true (API-standarden är false, detta är den tysta klippfällan), seed: 20260807, image = samma resultat från steg 1.

AI-videogeneratorgränssnitt som visar inmatningsinställningar och genererad anime-video

Veo 3.1 bild-till-video-playground på Atlas Cloud som visar generate audio påslaget, anime-keyframe laddad och den färdiga klippet i utmatningspanelen

Veo 3.1 bild-till-video på Atlas Cloud, med Generate Audio påslaget och den färdiga klippet till höger.

Steg 4: Poängsätt på fem anime-specifika axlar

Inget att generera här. Titta bara, på de saker anime faktiskt går sönder på. Båda klippen är inbäddade i början av denna artikel, så du kan poängsätta dem själv istället för att ta mitt ord.

Sida vid sida-jämförelse av suddiga och skarpa stadionscener

Sida vid sida av den sista bildrutan från båda klippen, MiniMax H3 till vänster med ren japansk titeltext, Veo 3.1 till höger med förvrängda vertikala tecken

Den sista bildrutan av varje klipp. Vänster, H3 skrev ラストホイッスル, alla åtta katakana korrekta och bergsäkra. Höger, Veo 3.1 skrev tre tecken som inte är det begärda ordet och inte bildar ett.

Titelskylten är där omgången avgjordes, och det var inte nära. H3 renderade den begärda katakanan exakt, hårdkantad och stabil, över en strimmig panorering av målburen. Veo 3.1 producerade en vertikal stapel med tre tecken som varken är det begärda ordet eller ett ord. På samma bildruta tappade den också karaktären ur bild och lät bakgrunden glida mot semi-fotorealistisk stadionskiva, trots photorealistic skin och 3D render i den negativa prompten.

Tabell 3: fem axlar som avgör en anime-bild, från dessa två körningar

AxeMiniMax H3Veo 3.1
Karaktärskontinuitet från keyframeBehåll exakt ansikte, hår och tröja under hela 8 sekundernaRitade om karaktären i en ny vidvinkelbild, modellmässigt men en annan teckning
Linjetjocklek och platt cel-shadingBehållen, ingen drift mot 3DBehållen i mellanbilden, drev mot fotografisk stadionskiva vid slutet
Japansk titelskyltラストホイッスル renderad korrekt och stabilTre tecken, inte det begärda ordet, inte ett ord
Levererat ljudspår32 kHz stereo, exakt som modellkortet anger48 kHz stereo, närvarande endast för att jag ställde in generate_audio själv
Svepande panorering och sakuga-smetUtförd som en smetande panorering in i titelnErsatt med en hård klippning till en ny bild

Den sista raden är den mest högljudda offentliga kritiken av H3 hittills, vilket är exakt varför jag skrev in den i båda promptarna. På ComfyUI-tråden dag 0 klagade användaren fwip på att även de officiella demo-promptarna ignorerades: "en våldsam WHIP PAN från taket som SMEAR bort de svävande orden med sig, rörelsestrimmig. Och videon gjorde helt enkelt inte den övergången alls, den ersatte den bara med en klippning."

I denna körning var det Veo som bytte panoreringen mot en klippning, och H3 som smetade. En tagning varje är inte ett slutgiltigt omdöme, och jag skulle inte påstå något annat. Men det betyder att kritiken inte är H3-specifik: svepande panoreringar är den minst pålitliga instruktionen i hela detta test på båda sidor. Om din storyboard är beroende av en, storyboarda runt den snarare än genom den.

Steg 5: Den 4:3 retro OVA-bilden som Veo 3.1 strukturellt inte kan producera

Detta är inte en kvalitetspreferens. Det är en vägg. Veos aspect_ratio-enum har två värden och inget är 4:3, och dess duration-enum har inget 12. 90-tals OVA-utseendet är helt enkelt inte nåbart.

Plain
1En 1990-tals OVA-anime-bild, 4:3 fullbild. Handmålad bakgrundskonst med synlig
2penselstruktur, cel-färgade karaktärer med tjocka ojämna bläcklinjer, tung halation glöd
3runt strålkastarna, 16mm filmkorn och svag grindvackel. Samma rödhåriga spelare i en
4vit och marinblå nummer 9-tröja går av en regnvåt plan medan publikbruset tonar bort till
5en enda ringande ton. Kameran zoomar sakta in på hans ansikte. Han säger tyst på japanska:
6「次は、勝つ」. Retro-palett: dämpad teal, dammig bärnsten, djupa vinröda skuggor. Ljud:
7avlägset regn, en ensam analog synth-pad, en med efterklang tung vissla i fjärran.

Inställningar: modell minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Ställ in det bildförhållandet manuellt, kom ihåg standard.

AI-videogeneratorgränssnitt som visar textprompt och genererad anime-video

MiniMax H3 text-till-video-playground på Atlas Cloud med OVA-prompten inskriven och den färdiga retro-klippet i utmatningspanelen

MiniMax H3 text-till-video på Atlas Cloud, OVA-prompt inskriven, klippet färdigt. Full avslöjande: denna specifika körning lämnade Aspect Ratio på 16:9 och Duration på 8, så vad du ser till höger är widescreen-kortversionen. 4:3 tolvsekundersklippet nedan kom från API-anropet med ratio: 4:3 och duration: 12 uttryckligen inställda.

Anime-fotbollsspelare i smutsig uniform som står på en stadion

Den 4:3 retro OVA-bilden: samma spelare som går av en regnvåt plan i 90-tals anime-stil

H3 text-till-video, 4:3, 12 sekunder. Den levererade filen kom tillbaka 1920x1440, vilket är 4:3 till pixeln, med ett 32 kHz stereospår. Visad här som en tyst GIF i reducerad bildfrekvens för att hålla sidan lätt. Genererad med minimax/h3/text-to-video på Atlas Cloud.

Steg 6: Nio referensbilder, en karaktär, fyra klipp

Korsbilds-karaktärskonsistens är det svåraste problemet inom AI-anime, och det löses med referensvolym. Bygg först paketet: kör om prompten från steg 1 med inramningen utbytt för fram, trekvarts, hel profil, bak, skrattande, sammanbitna tänder, helkroppshållning, tröjdetalj och skodetalj. Nio bilder, ungefär åtta cent totalt.

Fyra illustrationer av en rödhårig anime-fotbollsspelare med nummer 9

Fyra vinklar av samma original spelare genererad som ett referenspaket, arrangerade i ett två gånger två rutnät

Fyra av de nio referensvinklarna. H3 accepterar upp till nio bilder i ett referenspaket, plus video- och ljudreferenser ovanpå.

Plain
1Cel-shaded 2D anime, konsekvent handritad linjetjocklek, platt färg, ingen 3D-skuggning.
2Behåll den refererade spelarens ansikte, hår silhuett och nummer 9-tröja identisk över
3varje klipp. Fyra klipp i en kontinuerlig tagning: (1) lågvinkel push-in på hans stövlar
4som träffar gräset, (2) svepande panorering upp till en tight närbild av hans ögon, (3)
5vidvinkelbild av honom sprintande förbi tre försvarare ritade som suddiga silhuetter, (4)
6frys på en nick i luften, hastighetslinjer exploderar utåt. Ljud: publikdån, andetag,
7stövel-mot-gräs nedslag, ett taiko-slag på frysen.

Inställningar: modell minimax/h3/reference-to-video, refers = dina bilder med type: image, resolution: 2K, duration: 8 eller högre, ratio: adaptive eller 16:9.

Motsvarigheten på Veo 3.1 kan inte köras med dessa inställningar och du behöver inte försöka för att veta varför. Dess referens-endpoint accepterar maximalt tre bilder, och att välja den endpointen kollapsar duration till ett enda lagligt värde på 8. Ett nio-bilders paket och en 10-sekunders tagning är båda utanför räckvidd.

AI-videogeneratorgränssnitt som visar promptinmatning och genererad anime-video

MiniMax H3 referens-till-video-playground på Atlas Cloud som visar referensräknaren på fyra av nio och det första klippet i utmatningspanelen

MiniMax H3 referens-till-video på Atlas Cloud. Räknaren visar Reference Materials (4/9) med MAX:9 under, vilket är taket i gränssnittet snarare än ett påstående från ett specifikationsblad. Utmatningen är klipp ett, lågvinkel push-in på stövlarna.

Fyra fler MiniMax H3 Anime Video Generator-körningar värda att göra

Last Whistle-bilden testar bara fyra av skillnaderna. Dessa fyra testar resten. Alla körs på H3; anteckningarna säger vilka Veo 3.1 kan matcha.

  1. Ultrawide sakuga-kamp, 21:9 , 10 sekunder. Veo kan inte producera 21:9 alls.
Plain
1Cel-shaded 2D anime-action, tjocka avsmalnande bläcklinjer, platt färg, hårdkantade
2skuggor, ingen 3D-skuggning. Två original maskerade duellanter på ett vindpinat tempeltak
3i skymningen. Klingkollision, bilden skakar, båda slåssmännen bryter isär i en explosion av
4handritade nedslagsbilder och radiella hastighetslinjer. Kamera: lågvinkel push-in, sedan
5en lateral spårning, sedan en snabb övergång till en bred silhuett mot den orangea himlen.
6Ljud: två skarpa metallkollisioner, tygsmäll, ett lågt taiko-slag på den sista frysen,
7ingen musik.
  1. Takt-synkad AMV-klipp, referens-till-video med en ljudreferens. H3 tar upp till tre ljudklipp som referensinmatning. Veo 3.1 har ingen ljudinmatning alls, endast ljudutmatning.
Plain
1Cel-shaded 2D anime-montage klippt till det refererade ljudspåret. Fem korta beat: regn
2på ett fönster, en hand som drar åt ett bandage, en stadshorisont som blinkar förbi ett
3tågfönster, en sprintstart, en frys på en utsträckt hand. Varje klipp landar exakt på en
4nedslag av det refererade ljudet. Platt färg, tjocka bläcklinjer, högkontrast nattpalett
5av djup indigo och neon magenta.
  1. Två-radig japansk dialogscen, 12 sekunder. Detta är lip-sync-stresstestet, och 12 sekunder är redan utanför Veos räckvidd.
Plain
1Cel-shaded 2D anime, platt färg, ingen 3D-skuggning. Två originalkaraktärer på ett tak
2i gyllene timmen, skott-växel-skott. Första säger på japanska:「本当に行くの?」. Den andra
3svarar, halvleende, på japanska:「もう決めた」. Munnar matchar varje stavelse. Varmt
4kantljus, långa skuggor, mild vind i håret. Ljud: två distinkta japanska röster, avlägsen
5trafik, en cikada.
  1. Vertikal shonen-kort, 9:16 , 8 sekunder. Båda modellerna kan göra vertikalt, så detta är det enda stället att faktiskt A/B-testa dem snarare än att anta.
Plain
1Cel-shaded 2D anime, vertikal komposition. En original tonårslöpare brister genom en
2pappersbanner i slow-motion, sedan snäpper bilden tillbaka till full hastighet när hon
3accelererar nerför en stadionraka. Hastighetslinjer, platt färg, hårda skuggor, djärv
4grafisk himmel. Kamera: lågvinkel följningsbild, sedan en svepande panorering upp till
5hennes ansikte. Ljud: banner-sönderrivning, publiksvall, ett andetag som hålls och sedan
6släpps.
7
8Om du vill ha promptgrammatiken bakom dessa, [MiniMax H3 prompt-guide] (https://www.atlascloud.ai/blog/guides/minimax-h3-prompt-guide?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) går djupare in på hur H3 tolkar kamera- och ljudinstruktioner än jag kan här.

Vad en 60-sekunders anime-opener kostar på MiniMax H3 vs Veo 3.1

En standard anime-OP är ungefär 90 sekunder. Kalla det åtta bilder på 8 sekunder, 64 sekunder färdig video, plus en keyframe per bild för $0,009 styck.

Det finns en verklig prisskillnad som du bör känna till istället för att jag sopar under mattan. Atlas Cloud-katalogen listar MiniMax H3 till $0,10 per sekund fast, medan modellens readme delar upp det som $0,14/s vid 2K och $0,10/s vid 768P. Veo 3.1 är listad till $0,20 per sekund, medan dess readme skiljer på $0,40/s med ljud och $0,20/s utan.

Körknapparna i mina skärmdumpar avgör det. H3 referens-till-video, 8 sekunder vid 2K, angav Run $1,12, vilket är exakt $0,14 per sekund. Veo 3.1 bild-till-video, 8 sekunder vid 1080p med ljud på, angav Run $3.2, vilket är exakt $0,40 per sekund. Så readme-takterna är de som faktureras, och katalogrubriken är ingångsnivån. Jag har visat båda läsningarna nedan ändå. Dessa är listpriser från och med augusti 2026.

Tabell 4: åtta bilder på 8 sekunder, keyframes inkluderade

UppsättningVideokostnad (katalogpris)Videokostnad (readme-pris)KeyframesTotalt intervall
MiniMax H3, 2K$6.40$8.96$0.07$6.47 till $9.03
MiniMax H3, 768P$6.40$6.40$0.07$6.47
Veo 3.1, 1080p med ljud$12.80$25.60$0.07$12.87 till $25.67
Veo 3.1 Lite, 720p$3.20$3.20$0.07$3.27

Priser hämtade från Atlas Cloud-modellsidorna länkade i Tabell 1, augusti 2026. Ingen av dessa fyra är rabatterade just nu.

Två saker som tabellen inte inkluderar, och båda slår hårdare än priset per sekund.

Omtagningar. Ingen skickar den första tagningen av en anime-bild. Vilken multiplikator du än antar, tillämpa den på båda kolumnerna och gapet vidgas i samma proportion.

Väggklocka, och denna går åt andra hållet. Tidsinställd från början till slut den 7 augusti 2026: H3 vid 2K för 8 sekunder tog 447 sekunder, cirka 7,5 minuter. H3 text-till-video vid 2K för 12 sekunder tog 334 sekunder. Veo 3.1 vid 1080p för 8 sekunder med ljud tog 152 sekunder, under tre minuter. Veo är ungefär tre gånger snabbare till en första tagning här, och om du itererar på en bild klockan 02:00 är det värt riktiga pengar. Köer förändras, så behandla dessa som en ögonblicksbild från en eftermiddag snarare än en specifikation. Men alla som citerar "2 till 3 minuter" för H3 vid 2K citerar en readme, inte en kö. Uppdelningen mellan 2K och 768P täcker när den högre nivån är värd de extra minuterna.

Anime-stil, Homage och Vad du faktiskt kan publicera

Allt i denna artikel är stil och homage. En originalkaraktär, en originaltröja, en originaltitel. Ingen officiell anime-karaktär genererades eller begärdes, och ingen riktig fotbollsspelares namn eller likhet användes. Världscup-trenden refereras som ett format, för att det är vad den är användbar för.

Den distinktionen är inte dekoration. Om du producerar anime-stilat innehåll kommersiellt är "i stil med 90-tals OVA" och "denna specifika karaktär från denna specifika show" olika juridiska objekt, och endast en av dem är en affärsverksamhet.

Om de öppna vikterna: H3 är verkligen nedladdningsbart, och folk körde det dag ett. En kommentator rapporterade 10 minuter för en 10-sekunders 480p-klipp på en 4070 Ti Super med 16 GB, och andra postade 3 minuter på en 5080 och 68 sekunder på en RTX 6000 Pro. Men självhostning körs med en 768 kort sida; Context-IR- och Regenerate-2K-stegen som producerar 2K förblir på API-sidan.

Licensen har en verklig hake. Community-licensen täcker för närvarande inte EU, Storbritannien, Sydkorea eller USA, med hänvisning till regioner "som för närvarande utvecklar eller tillämpar AI-relaterade regleringar". En formell licensansökningskanal är öppen, vilket en HN-kommentator sammanfattade som "du måste bara pinkie promise att du inte kommer göra disney arg och de kommer skicka dig en licens". Roligt, och också exakt det efterlevnadssteg du inte kan hoppa över om du befinner dig i ett av dessa fyra territorier. Genomgången av öppna vikter har den fullständiga territorielistan.

Vanliga frågor

Är MiniMax H3 en bra anime-videogenerator jämfört med Veo 3.1?

För de flesta anime-arbeten, H3, och främst av skäl som inte handlar om rendering. Den kör 4 till 15 sekunder mot Veos 4, 6 eller 8, den erbjuder sex bildförhållanden inklusive 4:3 och 21:9 mot Veos två, den listar japanska bland 11 inbyggt stabila dialogspråk, och den tar nio referensbilder mot Veos tre. Veo 3.1 vinner i en specifik situation: när du behöver seed för reproducerbara omtagningar, eller negative_prompt för att förhindra att en bild glider mot 3D-renderingsskuggning. H3 har ingen av dessa parametrar. Om din pipeline är beroende av någon av dem är det en genuin anledning att stanna.

Kan Veo 3.1 generera anime i 4:3 eller en 15-sekunders klipp?

Nej, och inte av stilistiska skäl. Veo 3.1:s aspect_ratio-enum innehåller exakt 16:9 och 9:16, och dess duration-enum innehåller exakt 4, 6 och 8. Det finns inget 4:3-värde att välja och inget sätt att begära 12 eller 15 sekunder. Om din referens är en 90-tals TV-anime eller OVA är inramningen utom räckhåll på Veo och tillgänglig på H3.

Varför kom min Veo 3.1 anime-klipp tillbaka tyst?

För att generate_audio som standard är false på API:et. Playground-växeln är vanligtvis redan på, så detta drabbar bara de som anropar API:et direkt. Ställ in generate_audio: true explicit. Medan du håller på, ställ också in resolution, eftersom den som standard är 720p snarare än den 1080p eller 4k du förmodligen menade.

Gör MiniMax H3 japansk dialog och läppsynk för anime?

Ja. Modellkortet listar 11 språk med stabilt dialogstöd: arabiska, kinesiska, engelska, franska, tyska, italienska, japanska, koreanska, portugisiska, ryska och spanska. Ljud genereras tillsammans med bilden i 32 kHz stereo snarare än dubbat efteråt, vilket är varför mun-timing håller över en hel rad istället för de första stavelserna. Skriv den japanska raden direkt i prompten på japanska.

Hur många referensbilder kan jag använda för att hålla en anime-karaktär konsekvent?

MiniMax H3 accepterar upp till 9 bilder, upp till 3 videoklipp och upp till 3 ljudklipp, med ett hårt tak på 12 filer över alla typer. Veo 3.1:s referens-till-video-endpoint accepterar 1 till 3 bilder, och att välja den kollapsar duration till 8 som det enda lagliga värdet. För en återkommande anime-karaktär över en serie är den skillnaden hela bollen.

MiniMax H3 har öppna vikter, så kan jag köra min anime-pipeline lokalt gratis?

Du kan ladda ner och köra den, med tre varningar. Självhostad inferens körs med en 768 kort sida, och Context-IR- och Regenerate-2K-stegen som producerar 2K-utdata förblir API-sida. Verkliga lokala hastigheter varierar kraftigt beroende på kort: ungefär 10 minuter för en 10-sekunders 480p-klipp på en 4070 Ti Super, cirka 3 minuter på en 5080, cirka 68 sekunder på en RTX 6000 Pro, enligt ComfyUI-tråden dag 0. Och community-licensen täcker för närvarande inte EU, Storbritannien, Sydkorea eller USA, så om du är i ett av dessa behöver du den formella licensen före kommersiellt bruk.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller