Hela sommaren har mitt flöde visat samma video på repeat. Världscupsspelare omritade som shonen-protagonister. En diktator. En piratkapten. En gråtmild mentor som dyker upp de sista fyra sekunderna. Miljontals visningar per inlägg, och handlingen uppdateras efter nästan varje match.
Ingen som gör dem skriver benchmark-inlägg. De väljer en modell, bränner krediter och skickar iväg före nästa avspark.
Så jag tog en anime-keyframe och en prompt, och testade MiniMax H3 som anime-videogenerator mot Veo 3.1, båda pressade till maxinställningar på identiska indata.
Det första som gick sönder var inte bildkvalitet. Det var en dropdown. Veo 3.1 stannar vid 8 sekunder och erbjuder exakt två bildförhållanden. En bild som håller kvar ett ansikte, whip-pans med bollen, och sedan låter en titelkort landa, får inte plats på 8 sekunder. Det fick aldrig chansen att misslyckas på kvalitet.
Viktiga slutsatser
- Veo 3.1:s
duration-enum är[4, 6, 8]och dessaspect_ratio-enum är[16:9, 9:16]. MiniMax H3 kör hela sekunder från 4 till 15 och erbjuder21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Inget 4:3 på Veo innebär ingen retro OVA-inramning, överhuvudtaget. - H3:s modellkort listar 11 naturligt stabila dialogspråk och japanska är ett av dem. Ljud och bild genereras tillsammans i 32 kHz stereo, inte dubbade i efterhand.
- Referenspaket är inte lika: H3 tar upp till 9 bilder plus upp till 3 videor och 3 ljudklipp (max 12 filer). Veo 3.1:s referensändpunkt tar 3 bilder, och i samma stund som du använder den krymper
durationtill bara[8]. - Två fällor som tyst förstör tester: Veos API har som standard
generate_audiosatt tillfalseochresolutiontill720p, och H3:s text-till-videoratiohar som standard1:1. Lämna dem och du jämför ett tyst 720p-klipp med ett fyrkantigt. - Veo 3.1 har två saker som H3 inte alls har:
seedochnegative_prompt. För 2D-anime är den andra verkligen viktig, och jag kommer att visa var.
MiniMax H3 Anime-videogenerator vs Veo 3.1, Samma bildruta sida vid sida
En originalkaraktär. En keyframe. En prompt, kopierad tecken för tecken till båda modellerna. Allt annat maxat på varje sida.
MiniMax H3, bild-till-video, 2K, 8 sekunder, inbyggt ljud. Sätt på ljudet: publikbruset, bollträffen och det japanska ropet genereras i samma pass som bilden. Genererad med minimax/h3/image-to-video på Atlas Cloud.
Veo 3.1, bild-till-video, 1080p, 8 sekunder, generateaudio påslagen manuellt, plus en negativeprompt som håller linjekonsten platt. Samma första bild, samma ord. Genererad med google/veo3.1/image-to-video på Atlas Cloud.
Båda ritar vackert. Veos vidvinkelbild av träffen, med handritade slaglinjer och en mangaljudeffekt som svävar i luften, är verkligen vacker. Det är den ärliga utgångspunkten, och det är därför resten av denna artikel handlar om parametrar och instruktionsföljande snarare än vibbar.
Varför de flesta MiniMax H3 Anime-videogeneratortester vs Veo 3.1 blir fel
Två saker hände samtidigt i sommar.
Anime blev det högst volymformatet inom AI-video. Världscupen 2026 omskrevs som en shonen-turnering, med spelare castade som en diktator, en piratkapten, en maringeneral och en mentor, och handlingar som "utvecklas efter nästan varje match" över TikTok, Instagram, X och YouTube (Complex, juli 2026).
Och MiniMax H3 släpptes med öppna vikter. Day-0 ComfyUI-tråden nådde 330 poäng och 95 kommentarer, med folk som postade riktiga lokala siffror inom några timmar (Hacker News, augusti 2026).
Sätt ihop dem och du skulle förvänta dig en hög med anime-jämförelser. Det finns nästan inga, eftersom de flesta tester byggs fel på ett av fyra sätt.
De jämför bilder, inte begränsningar. Anime-bilder handlar om timing. En whip-pan till en titelkort är ett durationsproblem innan det är ett renderingsproblem.
De glömmer att Veos API är tyst som standard. På API:et är generate_audio false och resolution är 720p. Många "Veo har inget ljud i anime"-inlägg är bara någon som aldrig slog på en boolean.
De glömmer att H3:s text-till-video är fyrkantig som standard. ratio har standardvärdet 1:1, inte 16:9. Kör en t2v-anime-prompt utan att ställa in den och du får ett fyrkantigt klipp och en förvirrad slutsats.
De testar med fotorealistiska prompts. "Cinematisk, volymetriskt ljus, grunt skärpedjup" är precis det ordförråd som drar en 2D-modell mot 3D-renderskuggning. Misslyckandet i anime är inte oskärpa. Det är plast.
De tre inställningarna som avgör ett anime-test innan du trycker på kör
Innan något annat, ställ in dessa på båda sidor eller så är jämförelsen ogiltig.
| Inställning | MiniMax H3 | Veo 3.1 | Vad händer om du hoppar över det |
|---|---|---|---|
| Ljud | Genereras med bilden, alltid på | generate_audio har standard false | Veo returnerar ett tyst klipp och ser sämre ut än det är |
| Bildform | ratio har standard 1:1 på text-till-video | aspect_ratio har standard 16:9 | H3 ger dig en fyrkantig anime-bild du inte kan använda |
| Upplösning | har standard 2K | har standard 720p | Du jämför 2K mot 720p och kallar det en kvalitetsskillnad |
MiniMax H3 vs Veo 3.1 Anime-specifikation: Längd, Bildförhållande, Ljud, Referenser
Jag drog båda modellernas live-indatascheman snarare än att lita på något lanseringsinlägg. Varje värde nedan är ett enum du kan läsa själv på modellsidorna, inte ett intryck.
Tabell 1: MiniMax H3 vs Veo 3.1, parametrarna som avgör en anime-bild
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Duration | 4 till 15, varje hel sekund (standard 8) | 4, 6, 8 (standard 8) |
| Bildförhållanden | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Standard bildförhållande (text-till-video) | 1:01 | 16:09 |
| Upplösning | 768P, 2K (standard 2K) | 720p, 1080p, 4k (standard 720p) |
| Ljud | Genereras gemensamt, 32 kHz stereo | generate_audio, standard false |
| Inbyggda dialogspråk | 11 stabila, japanska inkluderat | Inte publicerat som en stabil lista |
| Referenspaket | upp till 9 bilder, 3 videor, 3 ljudklipp, 12 filer totalt | 3 bilder |
| Duration vid användning av referenser | fortfarande 4 till 15 | krymper till bara 8 |
| seed | inte tillgängligt | tillgängligt |
| negative_prompt | inte tillgängligt | tillgängligt |
| Vikter | nedladdningsbara | stängda |
Duration, bildförhållande, upplösning, ljud och referensgränser är lästa från live-scheman på MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video och Veo 3.1 reference-to-video sidorna. 9-bilders- och 12-filers-referenstaket och 11-språks-dialoglistan kommer från MiniMax H3 model card (Hugging Face, augusti 2026).
Nu resultattavlorna, för de säger något annat än specifikationsbladet och båda spelar roll.
Tabell 2: Crowd-vote Elo och listpris per minut, ögonblicksbild 7 augusti 2026
| Modell | Text-till-video (med ljud) | Bild-till-video (med ljud) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | inte listad i topp 10 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | inte listad i topp 10 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | inte listad i topp 10 | $4.80 |
Elo- och prissiffror från Artificial Analysis Video Arena (Artificial Analysis, augusti 2026). Dessa är rullande crowd-röster och de rör sig. $/min-kolumnen är en normaliserad modelluppskattning, inte din faktura.
Ett Elo-gap på 145 poäng är stort, men det är en allmän röst, inte en anime-röst. Och här är delen jag måste säga rakt ut: MiniMax marknadsför inte H3 som en anime-modell. Interna första linjens feedback listar film, animation och komedi-drama som de områden H3 inte är riktad mot. Så den intressanta frågan är inte "vilken är anime-modellen". Det är varför modellen som inte säljer sig själv på anime ändå vinner bilden, och var Google fortfarande tar hem ronden.
En praktisk notering innan handledningen. Varje modell nedan körs via samma konsol och samma API-nyckel, vilket är den enda anledningen till att parametrarna är jämförbara överhuvudtaget. Samma kö, samma auth, en räkning. Om du ställer upp GPT Image 2 på en tjänst och Veo på en annan, kommer hälften av skillnaderna du hittar vara rördragning snarare än modell.
Bygg bilden: MiniMax H3 vs Veo 3.1, steg för steg
Ett löpande exempel, från början till slut. "Last Whistle": en original tonårsspelare, rött hår, vit och marinblå nummer 9-tröja, strålkastarljus, en whip-pan på träffen, och en japansk titelkort som måste landa i de sista två sekunderna och hålla sig stadigt.
Ingen riktig spelare, ingen officiell karaktär, ingen befintlig anime-IP. Stil och homage endast. Mer om varför om en stund.
Steg 1: Designa anime-keyframe med GPT Image 2
Keyframe bär art direction så att videomodellen inte behöver uppfinna den. Notera det negativa utrymmet på vänster tredjedel: det är avsiktligt. Titelkortet skrivs där av videomodellen, och det är textstabilitetstestet.
Plain1En enda bildruta från en modern shonen-sportanime. Cel-shaded 2D-animation, handritad 2linjekonst med konsekvent linjebredd, platta färgfyllningar, hårdkantade grafiska skuggor, 3absolut ingen 3D-skuggning och inget fotorealistiskt hud. Närbild på en original tonårsspelare: 4stökigt mörkrött hår, vit-och-marinblå tröja med nummer 9, svett och grässtrimmor över 5en kind, ögon vida med utmattad beslutsamhet, mun öppen mitt i ett rop. Bakom honom, 6stadionstrålkastare som flammar in i en vägg av suddiga publikfärger; radiella 7hastighetslinjer briserar från mitten av bilden; ett grässtrå hänger fruset i luften. 8Mättad palett, djup cyan skuggor, varm orange kantljus. 16:9 komposition, karaktären 9inramad till höger om mitten, rent negativt utrymme på vänster tredjedel. Ingen text 10någonstans i bilden.
Inställningar: modell openai/gpt-image-2/text-to-image, kvalitet high, storlek 16:9 (2048x1152). Inget annat.

GPT Image 2-lekplats på Atlas Cloud med Last Whistle-keyframe-prompten och den färdiga anime-bilden i utmatningspanelen
GPT Image 2 på Atlas Cloud: kvalitet inställd på hög, den färdiga keyframe till höger.

Bas-anime-keyframe: en original rödhårig spelare mitt i ett rop under stadionstrålkastare, cel-shaded med platt färg och hastighetslinjer
Keyframe som båda modellerna får. Platt färg, hårda skuggor och en tom vänster tredjedel som väntar på en titelkort.
Steg 2: MiniMax H3 bild-till-video, allt maxat
Samma bild in, 2K ut. Jag höll H3 till 8 sekunder här bara för att matcha Veos tak. Det är inte H3:s gräns och steg 4 tar bort locket.
Plain1Cel-shaded 2D-anime, handritad linjebredd, platt färg, ingen 3D-skuggning. Håll kvar på 2spelarens ansikte i ett slag, sedan en våldsam whip-pan som följer bollen när han slår 3till, paning smetar ut bilden i strimmiga sakuga-rörelsespår. En bildruta av total tystnad 4vid träffen. Under de sista två sekunderna, fet vit japansk titeltext som lyder 5ラストホイッスル slår in på vänster tredjedel av bilden och håller sig bergfast, ingen 6förvrängning, inget flimmer, ingen drift. Spelaren ropar en mening på japanska: 「まだ終わってない!」 7Ljud: stadionbrus som sväller, en enda skarp bollträff, ett lågt taiko-slag under 8titelkortet.
Inställningar: modell minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (bild-till-video tar sin bildform från din inmatningsbild), image = utdata från steg 1.
En varning om du grenar av till text-till-video istället: skriv ratio: 16:9 explicit. Standard är 1:1 och den kommer gladeligen att ge dig en fyrkantig anime-bild.

MiniMax H3 bild-till-video-lekplats på Atlas Cloud med Last Whistle-prompten, keyframe inläst och det färdiga klippet i utmatningspanelen
MiniMax H3 bild-till-video på Atlas Cloud: steg 1-keyframe inläst till vänster, det färdiga klippet spelas till höger.
Steg 3: Veo 3.1 bild-till-video, ljud påslaget manuellt
Prompten är identisk, ord för ord. Ändra ett enda adjektiv och det slutar vara en jämförelse. Vad som ändras är det extra fältet Veo ger dig och H3 inte har.
negative_prompt, som för 2D-anime är den mest användbara kontrollen på denna lista:
Plain13D-render, CGI, plastskuggning, fotorealistisk hud, live-action-film, suddig rörelse, 2förvrängd text, gibberish-text, extra fingrar, undertextfält
Inställningar: modell google/veo3.1/image-to-video, resolution: 1080p (ändra det, standard är 720p), duration: 8 (detta är taket), aspect_ratio: 16:9, generate_audio: true (API-standard är false, detta är den tysta klipp-fällan), seed: 20260807, image = samma utdata från steg 1.

Veo 3.1 bild-till-video-lekplats på Atlas Cloud som visar generate audio påslagen, anime-keyframe inläst och det färdiga klippet i utmatningspanelen
Veo 3.1 bild-till-video på Atlas Cloud, med Generate Audio påslagen och det färdiga klippet till höger.
Steg 4: Poängsätt på fem anime-specifika axlar
Inget att generera här. Titta bara, på de saker som anime faktiskt går sönder på. Båda klippen är inbäddade nära toppen av denna artikel, så du kan poängsätta dem själv istället för att ta mitt ord.

Sida vid sida av den sista bilden från båda klippen, MiniMax H3 till vänster med ren japansk titeltext, Veo 3.1 till höger med förvrängda vertikala tecken
Den sista bilden av varje klipp. Vänster, H3 skrev ラストホイッスル, alla åtta katakana korrekta och bergfasta. Höger, Veo 3.1 skrev tre tecken som inte är det begärda ordet och inte bildar ett.
Titelkortet är där ronden avgjordes, och det var inte nära. H3 renderade den begärda katakanan exakt, hårdkantad och stabil, över en strimmig pan av målburen. Veo 3.1 producerade en vertikal stapel av tre tecken som varken är det begärda ordet eller ett ord. På samma bild tappade den också karaktären ur bild och lät bakgrunden glida mot semi-fotorealistisk stadionplatta, trots att photorealistic skin och 3D render fanns i negative prompt.
Tabell 3: fem axlar som avgör en anime-bild, från dessa två körningar
| Axel | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Karaktärskontinuitet från keyframe | Höll exakt ansikte, hår och tröja under hela 8 sekunderna | Ritade om karaktären i en ny vidvinkel, modellrätt men en annan teckning |
| Linjebredd och platt cel-skuggning | Höll, ingen drift mot 3D | Höll i mellanbilden, drev mot fotografisk stadionplatta i slutet |
| Japansk titelkort | ラストホイッスル renderad korrekt och hölls stadigt | Tre tecken, inte det begärda ordet, inte ett ord |
| Levererat ljudspår | 32 kHz stereo, precis som modellkortet anger | 48 kHz stereo, endast närvarande eftersom jag ställde in generate_audio |
| Whip-pan och sakuga-smet | Utfördes som en smetande pan in i titeln | Ersattes med en hård klipp till en ny uppsättning |
Den sista raden är den mest högljudda offentliga kritiken av H3 hittills, vilket är precis varför jag skrev in den i båda promptarna. På day-0 ComfyUI-tråden klagade användaren fwip på att även de officiella demo-promptarna ignorerades: "a violent WHIP PAN off the rooftop that SMEARS the floating words away with it, motion-streaked. And the video just didn't do any of that transition at all, it just replaced it with a cut."
I denna körning var det Veo som bytte ut panen mot en klipp, och H3 som smetade. En tagning varje är inte en dom, och jag skulle inte påstå annat. Men det betyder att kritiken inte är H3-specifik: whip-pans är den minst pålitliga instruktionen i hela detta test på båda sidor. Om din storyboard beror på en, storyboarda runt den snarare än genom den.
Steg 5: Den 4:3 retro OVA bilden som Veo 3.1 strukturellt inte kan producera
Detta är inte en kvalitetspreferens. Det är en vägg. Veos aspect_ratio-enum har två värden och inget är 4:3, och dess duration-enum har inget 12. 90-tals OVA-utseendet är helt enkelt inte tillgängligt.
Plain1En 1990-tals OVA-anime-bild, 4:3 full frame. Handmålad bakgrundskonst med synlig 2penselstruktur, cel-målade karaktärer med tjocka ojämna bläcklinjer, tung halation-glöd 3runt strålkastarna, 16mm filmkorn och svag gate-weave. Samma rödhåriga spelare i en 4vit-och-marinblå nummer 9-tröja går av en regnvåt plan medan publikbruset tonar bort till 5en enda ringande ton. Kameran zoomar sakta in på hans ansikte. Han säger tyst på japanska: 6「次は、勝つ」. Retro-palett: dämpad teal, dammig bärnsten, djup vinröd skugga. Ljud: 7avlägset regn, en ensam analog synth-pad, en reverb-tung vissling i fjärran.
Inställningar: modell minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Ställ in det bildförhållandet manuellt, kom ihåg standarden.

MiniMax H3 text-till-video-lekplats på Atlas Cloud med OVA-prompten inskriven och det färdiga retro-klippet i utmatningspanelen
MiniMax H3 text-till-video på Atlas Cloud, OVA-prompt inskriven, klipp klart. Full disclosure: denna specifika körning lämnade Aspect Ratio på 16:9 och Duration på 8, så vad du ser till höger är den bredskärmskorta versionen. 4:3 tolvsekundersklippet nedan kom från API-anropet med ratio: 4:3 och duration: 12 explicit inställda.

Den 4:3 retro OVA-bilden: samma spelare som går av en regnvåt plan i 90-tals anime-stil
H3 text-till-video, 4:3, 12 sekunder. Den levererade filen kom tillbaka 1920x1440, vilket är 4:3 till pixeln, med ett 32 kHz stereospår. Visad här som en tyst GIF med reducerad bildhastighet för att hålla sidan lätt. Genererad med minimax/h3/text-to-video på Atlas Cloud.
Steg 6: Nio referensbilder, en karaktär, fyra klipp
Tvärbilders karaktärskonsistens är det svåraste problemet i AI-anime, och det löses med referensvolym. Bygg paketet först: kör om steg 1-prompten med inramning bytt till framifrån, trekvart, helprofil, bakifrån, skrattande, sammanbitna tänder, helfigurspose, kitdetalj och skodetalj. Nio bilder, ungefär åtta cent totalt.

Fyra vinklar av samma originalspelare som genererats som ett referenspaket, arrangerade i ett två gånger två rutnät
Fyra av de nio referensvinklarna. H3 accepterar upp till nio bilder i ett referenspaket, plus video- och ljudreferenser ovanpå.
Plain1Cel-shaded 2D-anime, konsekvent handritad linjebredd, platt färg, ingen 3D-skuggning. 2Håll den refererade spelarens ansikte, hårsilhuett och nummer 9-tröja identiska över 3varje klipp. Fyra klipp i en kontinuerlig tagning: (1) låg vinkel push-in på hans skor 4som träffar gräset, (2) whip-pan upp till en tight närbild av hans ögon, (3) vidvinkel 5av honom springande förbi tre försvarare ritade som suddiga silhuetter, (4) frys på en 6nick i luften, hastighetslinjer som exploderar utåt. Ljud: publikbrus, andetag, 7skor-mot-gräs-träffar, ett taiko-slag vid frysen.
Inställningar: modell minimax/h3/reference-to-video, refers = dina bilder med type: image, resolution: 2K, duration: 8 eller högre, ratio: adaptive eller 16:9.
Motsvarigheten för Veo 3.1 kan inte köras med dessa inställningar och du behöver inte prova för att veta varför. Dess referensändpunkt accepterar maximalt tre bilder, och att välja den ändpunkten krymper duration till ett enda lagligt värde på 8. Ett nio-bilders paket och en 10-sekunders tagning är båda utanför räckvidd.

MiniMax H3 reference-to-video-lekplats på Atlas Cloud som visar referensräknaren på fyra av nio och det första klippet i utmatningspanelen
MiniMax H3 reference-to-video på Atlas Cloud. Räknaren visar Reference Materials (4/9) med MAX:9 under, vilket är taket i gränssnittet snarare än ett påstående från ett specifikationsblad. Utdata är klipp ett, den låga vinkel push-in på skorna.
Fyra fler MiniMax H3 Anime-videogeneratorkörningar värda att göra
Last Whistle-bilden stressar bara fyra av skillnaderna. Dessa fyra stressar resten. Alla körs på H3; anteckningarna säger vilka Veo 3.1 kan matcha.
- Ultrawide sakuga-strid,
21:9, 10 sekunder. Veo kan inte producera 21:9 alls.
Plain1Cel-shaded 2D-anime action, tjocka avsmalnande bläcklinjer, platt färg, hårdkantade skuggor, 2ingen 3D-skuggning. Två originalmaskerade duellanter på ett vindpinat tempeltak i skymning. Svärdsklass, 3bilden skakar, båda slagskämparna bryts isär i en explosion av handritade slagbilder 4och radiella hastighetslinjer. Kamera: låg vinkel push-in, sedan ett lateralt spår, sedan en 5snabb till en vid silhuett mot den orange himlen. Ljud: två skarpa metallklang, tygsnärt, 6ett lågt taiko-slag på den sista frysen, ingen musik.
- Beat-synkad AMV-bild, reference-to-video med en ljudreferens. H3 tar upp till tre ljudklipp som referensindata. Veo 3.1 har ingen ljudindata alls, bara ljudutdata.
Plain1Cel-shaded 2D-anime montage klippt till det refererade ljudspåret. Fem korta beats: regn på 2ett fönster, en hand som drar åt ett bandage, en stadssilhuett som blixtrar förbi ett tågfönster, en 3sprintstart, en frys på en utsträckt hand. Varje klipp landar exakt på en downbeat av 4det refererade ljudet. Platt färg, tjocka bläcklinjer, högkontrast nattpalett i djupt 5indigo och neongrön.
- Två-radig japansk dialogscen, 12 sekunder. Detta är läppsynk-stresstestet, och 12 sekunder är redan utanför Veos räckvidd.
Plain1Cel-shaded 2D-anime, platt färg, ingen 3D-skuggning. Två originalkaraktärer på ett tak vid 2guld timme, shot reverse shot. Första säger på japanska:「本当に行くの?」. Den andra 3svarar, halvleende, på japanska:「もう決めた」. Munnar matchar varje stavelse. Varm 4kantljus, långa skuggor, mild vind i håret. Ljud: två distinkta japanska röster, avlägsen 5trafik, en cikada.
- Vertikal shonen-kort,
9:16, 8 sekunder. Båda modellerna kan göra vertikalt, så detta är det enda stället att faktiskt A/B:a dem istället för att anta.
Plain1Cel-shaded 2D-anime, vertikal komposition. En original tonårslöpare brister genom en 2pappersbanner i slowmotion, sedan snäpper bilden tillbaka till full hastighet när hon 3accelererar nerför en stadionraka. Hastighetslinjer, platt färg, hårda skuggor, djärv 4grafisk himmel. Kamera: låg vinkel följningsbild, sedan en whip upp till hennes ansikte. 5Ljud: bannerreva, publiksvall, ett andetag hålls och släpps sedan.
Om du vill ha promptgrammatiken bakom dessa, går MiniMax H3 prompt guide djupare in på hur H3 tolkar kamera- och ljudinstruktioner än jag kan här.
Vad en 60-sekunders anime-intro kostar på MiniMax H3 vs Veo 3.1
En standard anime-OP är ungefär 90 sekunder. Kalla det åtta bilder på 8 sekunder, 64 sekunder färdig video, plus en keyframe per bild för $0.009 var.
Det finns en verklig prisskillnad som du bör veta om snarare än att jag sopar under mattan. Atlas Cloud-katalogen listar MiniMax H3 till $0.10 per sekund platt, medan modellreadmen bryter ut det som $0.14/s vid 2K och $0.10/s vid 768P. Veo 3.1 är listad till $0.20 per sekund, medan dess readme skiljer på $0.40/s med ljud och $0.20/s utan.
Körknapparna i mina skärmdumpar avgör det. H3 reference-to-video, 8 sekunder vid 2K, citerade Run $1.12, vilket är exakt $0.14 per sekund. Veo 3.1 bild-till-video, 8 sekunder vid 1080p med ljud på, citerade Run $3.2, vilket är exakt $0.40 per sekund. Så readme-priserna är de som faktureras, och katalogrubriken är ingångsnivån. Jag har visat båda läsningarna nedan ändå. Dessa är listpriser från och med augusti 2026.
Tabell 4: åtta bilder på 8 sekunder, keyframes inkluderade
| Uppsättning | Videokostnad (katalogpris) | Videokostnad (readme-pris) | Keyframes | Totalt intervall |
|---|---|---|---|---|
| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 till $9.03 |
| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1, 1080p med ljud | $12.80 | $25.60 | $0.07 | $12.87 till $25.67 |
| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 |
Priser hämtade från Atlas Cloud modellsidor länkade i Tabell 1, augusti 2026. Ingen av dessa fyra är rabatterade just nu.
Två saker som tabellen inte inkluderar, och båda slår hårdare än priset per sekund.
Omtagningar. Ingen skickar den första tagningen av en anime-bild. Vilken multiplikator du än antar, tillämpa den på båda kolumnerna och gapet vidgas i samma proportion.
Väggklocka, och den här går åt andra hållet. Tidsinställd från början till slut den 7 augusti 2026: H3 vid 2K för 8 sekunder tog 447 sekunder, cirka 7,5 minuter. H3 text-till-video vid 2K för 12 sekunder tog 334 sekunder. Veo 3.1 vid 1080p för 8 sekunder med ljud tog 152 sekunder, under tre minuter. Veo är ungefär tre gånger snabbare till en första tagning här, och om du itererar på en bild klockan 02:00 är det värt riktiga pengar. Köer rör sig, så behandla dessa som en eftermiddags ögonblicksbild snarare än en specifikation. Men alla som citerar "2 till 3 minuter" för H3 vid 2K citerar en readme, inte en kö. 2K versus 768P breakdown täcker när den högre nivån är värd de extra minuterna.
Anime-stil, Homage och vad du faktiskt kan publicera
Allt i denna artikel är stil och homage. En originalkaraktär, en originaltröja, en originaltitel. Ingen officiell anime-karaktär genererades eller begärdes, och ingen verklig fotbollsspelares namn eller likhet användes. Världscupstrenden hänvisas till som ett format, eftersom det är vad den är användbar för.
Den distinktionen är inte dekoration. Om du producerar anime-stiliserat innehåll kommersiellt, är "i stil med 90-talets OVA" och "denna specifika karaktär från denna specifika show" olika juridiska objekt, och bara en av dem är en affär.
Om öppna vikter: H3 är verkligen nedladdningsbar, och folk körde den dag ett. En kommentator rapporterade 10 minuter för ett 10-sekunders 480p-klipp på en 4070 Ti Super med 16GB, och andra postade 3 minuter på en 5080 och 68 sekunder på en RTX 6000 Pro. Men självhostning körs vid en 768 kort kant; Context-IR- och Regenerate-2K-stegen som producerar 2K stannar på API-sidan.
Licensen har en verklig hake. Communitylicensen täcker för närvarande inte EU, Storbritannien, Sydkorea eller USA, med hänvisning till regioner "som för närvarande utvecklar eller tillämpar AI-relaterade regleringar". En formell licensförfrågningskanal är öppen, vilket en HN-kommentator sammanfattade som "du måste bara pinkie promise att du inte kommer att göra Disney arg så skickar de dig en licens". Roligt, och också exakt det efterlevnadssteg du inte kan hoppa över om du är i ett av dessa fyra territorier. Open weights write-up har den fulla territorielistan.
Vanliga frågor
Är MiniMax H3 en bra anime-videogenerator jämfört med Veo 3.1?
För de flesta anime-arbeten, H3, och främst av skäl som inte handlar om rendering. Den kör 4 till 15 sekunder mot Veos 4, 6 eller 8, den erbjuder sex bildförhållanden inklusive 4:3 och 21:9 mot Veos två, den listar japanska bland 11 naturligt stabila dialogspråk, och den tar nio referensbilder mot Veos tre. Veo 3.1 vinner i en specifik situation: när du behöver seed för reproducerbara omtagningar, eller negative_prompt för att stoppa en bild från att driva mot 3D-renderskuggning. H3 har ingen av parametrarna. Om din pipeline beror på någon av dem, är det en genuin anledning att stanna.
Kan Veo 3.1 generera anime i 4:3 eller ett 15-sekunders klipp?
Nej, och inte av stilistiska skäl. Veo 3.1:s aspect_ratio-enum innehåller exakt 16:9 och 9:16, och dess duration-enum innehåller exakt 4, 6 och 8. Det finns inget 4:3-värde att välja och inget sätt att begära 12 eller 15 sekunder. Om din referens är en 90-tals TV-anime eller OVA, är inramningen utom räckhåll på Veo och tillgänglig på H3.
Varför kom mitt Veo 3.1 anime-klipp tillbaka tyst?
För att generate_audio har standardvärdet false på API:et. Lekplatsens växel är vanligtvis redan på, så detta påverkar bara folk som anropar API:et direkt. Ställ in generate_audio: true explicit. Medan du är där, ställ också in resolution, eftersom den har standardvärdet 720p snarare än 1080p eller 4k du förmodligen menade.
Gör MiniMax H3 japansk dialog och läppsynk för anime?
Ja. Modellkortet listar 11 språk med stabilt dialogstöd: arabiska, kinesiska, engelska, franska, tyska, italienska, japanska, koreanska, portugisiska, ryska och spanska. Ljud genereras gemensamt med bilden i 32 kHz stereo snarare än dubbat i efterhand, vilket är anledningen till att munnens timing håller över en hel rad istället för de första stavelserna. Skriv den japanska raden direkt i prompten på japanska.
Hur många referensbilder kan jag använda för att hålla en anime-karaktär konsekvent?
MiniMax H3 accepterar upp till 9 bilder, upp till 3 videoklipp och upp till 3 ljudklipp, med en hård gräns på 12 filer över alla typer. Veo 3.1:s reference-to-video-endpunkt accepterar 1 till 3 bilder, och att välja den krymper duration till 8 som det enda lagliga värdet. För en återkommande anime-karaktär över en serie är den skillnaden hela bollen.
MiniMax H3 har öppna vikter, så kan jag köra min anime-pipeline lokalt gratis?
Du kan ladda ner och köra den, med tre förbehåll. Självhostad inferens körs vid en 768 kort kant, och Context-IR- och Regenerate-2K-stegen som producerar 2K-utdata förblir på API-sidan. Verkliga lokala hastigheter varierar kraftigt efter kort: ungefär 10 minuter för ett 10-sekunders 480p-klipp på en 4070 Ti Super, cirka 3 minuter på en 5080, cirka 68 sekunder på en RTX 6000 Pro, per day-0 ComfyUI-tråden. Och communitylicensen täcker inte för närvarande EU, Storbritannien, Sydkorea eller USA, så om du är i ett av dessa, behöver du den formella licensen före kommersiell användning.






