Seedance 2.0 Mini & Fast API till världens lägsta priser — upp till 68 % rabatt på det officiella priset

MiniMax H3 Anime Video Generator: 15 sekunder, 4:3, och titelkortet Veo 3.1 misslyckades

MiniMax H3 anime-videogenerator jämfört med Veo 3.1 på samma nyckelbild. H3 kör 4 till 15 s och sex bildförhållanden, Veo är begränsad till 8 s och två. Japansk dialog, 9 referenser, verkliga körningar.

Hela sommaren har mitt flöde visat samma video på repeat. Världscupsspelare omritade som shonen-protagonister. En diktator. En piratkapten. En gråhårig mentor som dyker upp de sista fyra sekunderna. Miljontals visningar per inlägg, och storyn uppdateras efter nästan varje match.

Ingen som gör sådana där skriver benchmark-artiklar. De väljer en modell, bränner credits och levererar innan nästa avspark.

Så jag tog en anime-keyframe och en prompt, och testade MiniMax H3 som anime-videogenerator mot Veo 3.1, båda körda på maxinställningar med identiska indata.

Det första som gick sönder var inte bildkvalitet. Det var en rullgardinsmeny. Veo 3.1 stannar vid 8 sekunder och erbjuder exakt två bildförhållanden. En bild som håller kvar på ett ansikte, whip pans med bollen, och sedan låter en titelbild landa – det får inte plats på 8 sekunder. Den fick aldrig chansen att misslyckas på kvalitet.

Viktiga insikter

  • Veo 3.1:s duration-enum är [4, 6, 8] och dess aspect_ratio-enum är [16:9, 9:16]. MiniMax H3 kör alla hela sekunder från 4 till 15 och erbjuder 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Ingen 4:3 på Veo innebär ingen retro OVA-inramning, överhuvudtaget.
  • H3:s modellkort listar 11 inbyggt stabila dialogspråk och japanska är ett av dem. Ljud och bild genereras tillsammans i 32 kHz stereo, inte dubbade i efterhand.
  • Referenspaket är inte likvärdiga: H3 tar upp till 9 bilder plus upp till 3 videor och 3 ljudklipp (max 12 filer). Veo 3.1:s referens-endpoint tar 3 bilder, och så fort du använder den kollapsar duration till bara [8].
  • Tvåällor som tyst saboterar tester: Veo:s API har generate_audio som standard false och resolution som 720p, och H3:s text-till-video ratio har standard 1:1. Lämna dessa ifred och du jämför en tyst 720p-klipp med en fyrkantig.
  • Veo 3.1 har två saker som H3 inte har alls: seed och negative_prompt. För 2D-anime spelar den andra verkligen roll, och jag kommer visa var.

MiniMax H3 Anime Video Generator vs Veo 3.1, Samma Bild Sida vid Sida

En originalkaraktär. En keyframe. En prompt, kopierad tecken för tecken i båda modellerna. Allt annat maxat på båda sidor.

MiniMax H3, bild-till-video, 2K, 8 sekunder, inbyggt ljud. Sätt på ljudet: publikbruset, bollträffen och det japanska utropet genereras i samma pass som bilden. Genererad med minimax/h3/image-to-video på Atlas Cloud.

Veo 3.1, bild-till-video, 1080p, 8 sekunder, generateaudio aktiverad manuellt, plus en negativeprompt som håller linjerna platta. Samma första bild, samma ord. Genererad med google/veo3.1/image-to-video på Atlas Cloud.

Båda ritar vackert. Veos vidvinkelbild av skottet, med handritade impact lines och en mangaljudeffekt som svävar i luften, är verkligen vacker. Det är den ärliga utgångspunkten, och det är därför resten av denna artikel handlar om parametrar och instruktionsföljande snarare än vibbar.

Varför de flesta MiniMax H3 Anime Video Generator-tester vs Veo 3.1 går fel

Två saker hände samtidigt i sommar.

Anime blev det mest volymstarka formatet inom AI-video. Världscupen 2026 omskrevs som en shonen-turnering, med spelare castade som en diktator, en piratkapten, en maringeneral och en mentor, och storylines som "utvecklas efter nästan varje match" över TikTok, Instagram, X och YouTube (Complex, juli 2026).

Och MiniMax H3 släpptes med öppna vikter. Day-0 ComfyUI-tråden nådde 330 poäng och 95 kommentarer, med folk som postade verkliga lokala siffror inom timmar (Hacker News, augusti 2026).

Sätt ihop dessa och du skulle förvänta dig en hög med anime-jämförelser. Det finns nästan inga, eftersom de flesta tester byggs fel på ett av fyra sätt.

De jämför bilder, inte begränsningar. Anime-bilder är timing. En whip pan in i en titelbild är ett varaktighetsproblem innan det är ett renderingsproblem.

De glömmer att Veos API är tyst som standard. På API:et är generate_audio false och resolution är 720p. Många "Veo har inget ljud i anime"-inlägg är bara någon som aldrig vände en boolean.

De glömmer att H3:s text-till-video är fyrkantig som standard. ratio har standard 1:1, inte 16:9. Kör en t2v anime-prompt utan att ställa in den och du får en fyrkantig klipp och en förvirrad slutsats.

De testar med fotorealistiska prompts. "Cinematic, volumetric light, shallow depth of field" är precis det ordförråd som drar en 2D-modell mot 3D-renderingsskuggning. Felmoden i anime är inte oskärpa. Det är plast.

De tre inställningarna som avgör ett anime-test innan du trycker på kör

Innan något annat, ställ in dessa på båda sidor annars är jämförelsen ogiltig.

InställningMiniMax H3Veo 3.1Vad som händer om du hoppar över det
LjudGenereras med bilden, alltid pågenerate_audio har standard falseVeo returnerar en tyst klipp och ser sämre ut än den är
Bildformatratio har standard 1:1 på text-till-videoaspect_ratio har standard 16:9H3 ger dig en fyrkantig anime-bild du inte kan använda
Upplösningstandard 2Kstandard 720pDu jämför 2K mot 720p och kallar det en kvalitetsskillnad

Vill du testa MiniMax H3 och Veo 3.1 på samma anime-prompt själv? Atlas Cloud's model comparison kör dem sida vid sida i ett svep – samma prompt och inställningar, kostnad visas innan du genererar.

MiniMax H3 och Veo 3.1 på samma anime-prompt i Atlas Cloud's model comparison – samma inställningar, pris visas innan du genererar. Fångad live på model-explorer

MiniMax H3 och Veo 3.1 på samma anime-prompt i Atlas Cloud's model comparison – samma inställningar, pris visas innan du genererar. Fångad live på model-explorer.

MiniMax H3 vs Veo 3.1 Teknisk Specifikation: Längd, Format, Ljud, Referenser

Jag drog båda modellernas live-scheman istället för att lita på något lanseringsinlägg. Varje värde nedan är ett enum du kan läsa själv på modellsidorna, inte ett intryck.

Tabell 1: MiniMax H3 vs Veo 3.1, parametrarna som avgör en anime-bild

MiniMax H3Veo 3.1
Duration4 till 15, varje hel sekund (standard 8)4, 6, 8 (standard 8)
Bildförhållanden21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
Ratio-standard (text-till-video)1:0116:09
Upplösning768P, 2K (standard 2K)720p, 1080p, 4k (standard 720p)
LjudGenereras gemensamt, 32 kHz stereogenerate_audio, standard false
Inbyggda dialogspråk11 stabila, japanska ingårInte publicerat som stabil lista
Referenspaketupp till 9 bilder, 3 videor, 3 ljudklipp, 12 filer totalt3 bilder
Duration vid användning av referenserfortfarande 4 till 15kollapsar till 8 endast
seedinte tillgängligtillgänglig
negative_promptinte tillgängligtillgänglig
Vikternedladdningsbarastängda

Duration, format, upplösning, ljud och referensgränser är hämtade från live-scheman på MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video och Veo 3.1 reference-to-video. 9-bilders- och 12-filers-referenstaket samt 11-språksdialogslistan kommer från MiniMax H3 model card (Hugging Face, augusti 2026).

Nu resultattavlorna, för de säger något annat än specifikationen och båda spelar roll.

Tabell 2: Crowd-vote Elo och listpris per minut, ögonblicksbild 7 augusti 2026

ModelText-to-video (med ljud)Image-to-video (med ljud)$/min
Gemini Omni Flash1,244 (#1) ±71,191 (#2) ±9$6.00
MiniMax H31,238 (#2) ±91,190 (#3) ±10$7.80
Dreamina Seedance 2.0 720p1,224 (#3) ±61,198 (#1) ±7$9.07
Kling 3.0 1080p (Pro)1,111 (#7) ±6not listed in top 10$20.16
Veo 3.11,093 (#11) ±71,085 (#10) ±7$24.00
Veo 3.1 Fast1,091 (#14) ±6not listed in top 10$9.00
Veo 3.1 Lite1,089 (#15) ±7not listed in top 10$4.80

Elo- och prissiffror från Artificial Analysis Video Arena (Artificial Analysis, augusti 2026). Dessa är rullande crowd-röster och de förändras. $/min-kolumnen är en normaliserad modelluppskattning, inte din faktura.

En 145-poängs Elo-skillnad är stor, men det är en allmän röst, inte en anime-röst. Och här är delen jag måste säga rakt ut: MiniMax marknadsför inte H3 som en anime-modell. Intern första-linjens feedback listar film, animation och komedi-drama som de områden H3 inte är riktad mot. Så den intressanta frågan är inte "vilken är anime-modellen". Det är varför modellen som inte säljer sig på anime ändå vinner bilden, och var Google fortfarande tar hem ronden.

En praktisk notering innan handledningen. Varje modell nedan körs via samma konsol och samma API-nyckel, vilket är den enda anledningen till att parametrarna är jämförbara alls. Samma kö, samma autentisering, en räkning. Om du sätter upp GPT Image 2 på en tjänst och Veo på en annan, kommer hälften av skillnaderna du hittar vara rörledning snarare än modell.

Bygg Bilden: MiniMax H3 vs Veo 3.1, Steg för Steg

Ett pågående exempel, från början till slut. "Last Whistle": en original tonårsspelare, rött hår, vit och marinblå nummer 9-tröja, strålkastare, en whip pan på skottet, och en japansk titelbild som måste landa i de sista två sekunderna och hålla sig stadigt.

Ingen verklig spelare, ingen officiell karaktär, ingen befintlig anime-IP. Stil och homage endast. Mer om varför om en stund.

Steg 1: Designa anime-keyframe med GPT Image 2

Keyframe bär den konstnärliga riktningen så att videomodellen inte behöver uppfinna den. Notera det negativa utrymmet på den vänstra tredjedelen: det är avsiktligt. Titelkortet skrivs där av videomodellen, och det är textstabilitetstestet.

Plain
1En enskild bild från en modern shonen sportanime. Cel-shaded 2D-animation, handritad
2linjekonst med konsekvent linjetjocklek, platta färgfyllningar, hårdkantade grafiska
3skuggor, absolut ingen 3D-skuggning och inget fotorealistiskt skinn. Närbild på en
4original tonårsspelare: rufsigt mörkrött hår, vit och marinblå tröja med nummer 9, svett
5och grässtrimmor över ena kinden, ögon vida med utmattad beslutsamhet, mun öppen mitt i
6ett rop. Bakom honom flammar stadions strålkastare mot en vägg av suddig publikfärg;
7radiala hastighetslinjer briserar från mitten av bilden; ett grässtrå hänger fryst i
8luften. Mättad palett, djupcyan skuggor, varm orange kantljus. 16:9 komposition,
9karaktären inramad till höger om mitten, rent negativt utrymme på vänster tredjedel.
10Ingen text någonstans i bilden.

Inställningar: modell openai/gpt-image-2/text-to-image, kvalitet high, storlek 16:9 (2048x1152). Inget annat.

AI-bildgeneratorgränssnitt som visar prompt och genererad anime-fotbollsspelare

GPT Image 2 playground på Atlas Cloud med Last Whistle-keyframe prompten och den färdiga anime-bilden i utmatningspanelen

GPT Image 2 på Atlas Cloud: kvalitet inställd på high, den färdiga keyframe till höger.

Rödhårig anime-fotbollsspelare som skriker i en fullsatt arena

Bas-anime-keyframe: en original rödhårig spelare mitt i ett rop under stadions strålkastare, cel-shaded med platt färg och hastighetslinjer

Keyframe som båda modellerna får. Platt färg, hårda skuggor och en tom vänster tredjedel som väntar på en titelbild.

Steg 2: MiniMax H3 image-to-video, allt maxat

Samma bild in, 2K ut. Jag höll H3 till 8 sekunder här bara för att matcha Veos tak. Det är inte H3:s gräns och Steg 4 tar bort locket.

Plain
1Cel-shaded 2D anime, handritad linjetjocklek, platt färg, ingen 3D-skuggning. Håll kvar på
2spelarens ansikte i ett slag, sedan en våldsam whip pan följer bollen när han slår till,
3panningen smetar ut bilden i strimmiga sakuga-rörelsespår. En bildruta av total tystnad
4vid nedslaget. Under de sista två sekunderna trycks djärv vit japansk titeltext som lyder
5ラストホイッスル in på den vänstra tredjedelen av bilden och hålls bergfast, ingen
6vridning, ingen flimmer, ingen förskjutning. Spelaren ropar en rad på japanska: 「まだ終わってない!」
7Ljud: stadionbrus som sväller, en skarp bollträff, ett lågt taiko-slag under titelbilden.

Inställningar: modell minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video tar sin bildform från din inmatningsbild), image = utdata från Steg 1.

En varning om du grenar till text-to-video istället: skriv ratio: 16:9 explicit. Standard är 1:1 och den kommer glatt ge dig en fyrkantig anime-bild.

AI-videogeneratorgränssnitt som visar textprompt och genererad anime-video

MiniMax H3 image-to-video playground på Atlas Cloud med Last Whistle-prompten, keyframe laddad och den färdiga klippen i utmatningspanelen

MiniMax H3 image-to-video på Atlas Cloud: Steg 1 keyframe laddad till vänster, den färdiga klippen spelas upp till höger.

Steg 3: Veo 3.1 image-to-video, ljud aktiverat manuellt

Prompten är identisk, ord för ord. Ändra ett enda adjektiv och det upphör att vara en jämförelse. Vad som ändras är det extra fältet Veo ger dig och H3 inte.

negative_prompt, som för 2D-anime är den mest användbara kontrollen på denna lista:

Plain
13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur
2soup, warped lettering, gibberish text, extra fingers, subtitle bar

Inställningar: modell google/veo3.1/image-to-video, resolution: 1080p (ändra den, standard är 720p), duration: 8 (detta är taket), aspect_ratio: 16:9, generate_audio: true (API:ets standard är false, detta är fällan för tyst klipp), seed: 20260807, image = samma Steg 1-utdata.

AI-videogeneratorgränssnitt som visar inmatningsinställningar och genererad anime-video

Veo 3.1 image-to-video playground på Atlas Cloud som visar generate audio aktiverad, anime-keyframe laddad och den färdiga klippen i utmatningspanelen

Veo 3.1 image-to-video på Atlas Cloud, med Generate Audio påslagen och den färdiga klippen till höger.

Steg 4: Poängsätt på fem anime-specifika axlar

Inget att generera här. Titta bara, på de saker anime faktiskt går sönder på. Båda klippen är inbäddade nära toppen av denna artikel, så du kan poängsätta dem själv istället för att ta mitt ord.

Sida vid sida-jämförelse av suddiga och skarpa fotbollsstadionscener

Sida vid sida av den sista bildrutan från båda klippen, MiniMax H3 till vänster med ren japansk titeltext, Veo 3.1 till höger med förvrängda vertikala tecken

Den sista bildrutan av varje klipp. Vänster, H3 skrev ラストホイッスル, alla åtta katakana korrekta och bergfasta. Höger, Veo 3.1 skrev tre tecken som inte är det begärda ordet och inte bildar ett.

Titelbilden är där ronden avgjordes, och det var inte nära. H3 renderade de begärda katakanorna exakt, hårdkantade och stabila, över en smetig panorering av målet. Veo 3.1 producerade en vertikal stapel av tre tecken som varken är det begärda ordet eller ett ord. På samma bildruta tappade den också karaktären ur bild och lät bakgrunden glida mot ett semi-fotorealistiskt stadionfotografi, trots photorealistic skin och 3D render i den negativa prompten.

Tabell 3: fem axlar som avgör en anime-bild, från dessa två körningar

AxelMiniMax H3Veo 3.1
Karaktärskontinuitet från keyframeBibehöll exakt ansikte, hår och tröja under hela 8 sekundernaRitade om karaktären i en ny vidvinkelbild, på modell men en annan teckning
Linjetjocklek och platt cel-skuggningBibehöll, ingen drift mot 3DBibehöll i mellanbilden, drev mot ett fotografiskt stadionfotografi i slutet
Japansk titelbildラストホイッスル renderad korrekt och hölls stadigtTre tecken, inte det begärda ordet, inte ett ord
Levererat ljudspår32 kHz stereo, exakt som modellkortet anger48 kHz stereo, närvarande endast för att jag ställde in generate_audio själv
Whip pan och sakuga-smetUtförd som en smetad panorering in i titelnErsatt med en hård klippning till en ny bild

Den sista raden är den mest högljudda offentliga kritiken av H3 hittills, vilket är precis varför jag skrev in den i båda promptarna. På day-0 ComfyUI-tråden klagade användaren fwip på att även de officiella demo-promptarna ignorerades: "a violent WHIP PAN off the rooftop that SMEARS the floating words away with it, motion-streaked. And the video just didn't do any of that transition at all, it just replaced it with a cut."

I denna körning var det Veo som bytte ut panoreringen mot en klippning, och H3 som smetade. En tagning var är ingen dom, och jag skulle inte påstå något annat. Men det betyder att kritiken inte är H3-specifik: whip pans är den minst pålitliga instruktionen i hela detta test på båda sidor. Om din storyboard är beroende av en, planera runt den snarare än genom den.

Steg 5: Den 4:3 retro OVA -klipp som Veo 3.1 strukturellt inte kan producera

Detta är inte en kvalitetspreferens. Det är en vägg. Veos aspect_ratio-enum har två värden och inget är 4:3, och dess duration-enum har inget 12. 90-tals OVA-utseendet är helt enkelt inte tillgängligt.

Plain
1En 1990-tals OVA anime-bild, 4:3 full-frame. Handmålad bakgrundskonst med synlig
2penselstruktur, cel-paint-karaktärer med tjocka ojämna bläcklinjer, tung halation-glöd
3runt strålkastarna, 16mm filmkorn och svag gate weave. Samma rödhåriga spelare i en
4vit och marinblå nummer 9-tröja går av en regnvåt plan när publikbruset tonar bort till
5en enda ringande ton. Kameran zoomar sakta in på hans ansikte. Han säger tyst på
6japanska: 「次は、勝つ」. Retro-palett: dämpad teal, dammig bärnsten, djup vinröd
7skugga. Ljud: avlägset regn, en ensam analog syntpad, en reverb-tung visselpipa i
8fjärran.

Inställningar: modell minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Ställ in det förhållandet manuellt, kom ihåg standard.

AI-videogeneratorgränssnitt som visar textprompt och genererad anime-video

MiniMax H3 text-to-video playground på Atlas Cloud med OVA-prompten inskriven och den färdiga retro-klippen i utmatningspanelen

MiniMax H3 text-to-video på Atlas Cloud, OVA-prompt inskriven, klipp slutförd. Fullständig avslöjande: denna specifika körning lämnade Aspect Ratio på 16:9 och Duration på 8, så vad du ser till höger är den bredbilds korta versionen. Den 4:3 tolv sekunder långa klippen nedan kom från API-anropet med ratio: 4:3 och duration: 12 explicit inställda.

Anime-fotbollsspelare i smutsig uniform som står på en stadion

Den 4:3 retro OVA-klippen: samma spelare som går av en regnvåt plan i 90-tals anime-stil

H3 text-to-video, 4:3, 12 sekunder. Den levererade filen kom tillbaka 1920x1440, vilket är 4:3 till pixeln, med ett 32 kHz stereo-spår. Visas här som en tyst GIF med reducerad bildhastighet för att hålla sidan lätt. Genererad med minimax/h3/text-to-video på Atlas Cloud.

Steg 6: Nio referensbilder, en karaktär, fyra bilder

Korsklippskaraktärskonsistens är det svåraste problemet inom AI-anime, och det löses med referensvolym. Bygg paketet först: kör om Steg 1-prompten med inramningen bytt till fram, trekvart, hel profil, bak, skrattande, sammanbitna tänder, helkroppshållning, tröjedetalj och skodetalj. Nio bilder, ungefär åtta cent totalt.

Fyra illustrationer av en rödhårig anime-fotbollsspelare med nummer 9

Fyra vinklar av samma original-spelare genererade som ett referenspaket, arrangerade i ett två och två rutnät

Fyra av de nio referensvinklarna. H3 accepterar upp till nio bilder i ett referenspaket, plus video- och ljudreferenser ovanpå.

Plain
1Cel-shaded 2D anime, konsekvent handritad linjetjocklek, platt färg, ingen 3D-skuggning.
2Behåll den refererade spelarens ansikte, hårsiluett och nummer 9-tröja identisk över
3varje bild. Fyra bilder i en kontinuerlig tagning: (1) låg vinkel push-in på hans
4skor som träffar gräset, (2) whip-pan upp till en tight närbild av hans ögon, (3) vidvinkel
5av honom sprintande förbi tre försvarare ritade som suddiga silhuetter, (4) frys på en
6nick i luften, hastighetslinjer exploderar utåt. Ljud: publikvrål, andetag, sko-mot-gräs
7nedslag, ett taiko-slag på frysen.

Inställningar: modell minimax/h3/reference-to-video, refers = dina bilder med type: image, resolution: 2K, duration: 8 eller högre, ratio: adaptive eller 16:9.

Motsvarigheten för Veo 3.1 kan inte köras med dessa inställningar och du behöver inte prova för att veta varför. Dess referens-endpoint accepterar max tre bilder, och att välja den endpoint kollapsar duration till ett enda lagligt värde på 8. Ett nio-bilders paket och en 10-sekunders tagning är båda utanför räckvidd.

AI-videogeneratorgränssnitt som visar promptinmatning och genererad anime-video

MiniMax H3 reference-to-video playground på Atlas Cloud som visar referensräknaren på fyra av nio och den första bilden i utmatningspanelen

MiniMax H3 reference-to-video på Atlas Cloud. Räknaren visar Reference Materials (4/9) med MAX:9 under, vilket är taket i gränssnittet snarare än ett påstående från en specifikation. Utdata är bild ett, låg vinkel push-in på skorna.

Fyra Fler MiniMax H3 Anime Video Generator-körningar Värda att Göra

Last Whistle-bilden stressar endast fyra av skillnaderna. Dessa fyra stressar resten. Alla körs på H3; anteckningarna säger vilka Veo 3.1 kan matcha.

  1. Ultrawide sakuga fight, 21:9 , 10 sekunder. Veo kan inte producera 21:9 alls.
Plain
1Cel-shaded 2D anime action, tjocka avsmalnande bläcklinjer, platt färg, hårdkantade skuggor,
2ingen 3D-skuggning. Två original maskerade duellanter på ett vindpinat tempeltak i skymning.
3Klingkollision, bilden skakar, båda fighters bryts isär i ett utbrott av handritade
4impact frames och radiella hastighetslinjer. Kamera: låg vinkel push-in, sedan en lateral
5track, sedan en snabb bild på en silhuett mot den orange himlen. Ljud: två skarpa
6metallkollisioner, tygsmäll, ett lågt taiko-slag på den sista frysen, ingen musik.
  1. Beat-synkad AMV-klipp, reference-to-video med en ljudreferens. H3 tar upp till tre ljudklipp som referensinput. Veo 3.1 har ingen ljudinput alls, endast ljudutgång.
Plain
1Cel-shaded 2D anime montage klippt till det refererade ljudspåret. Fem korta beats: regn på
2ett fönster, en hand som drar åt ett bandage, en stadssilhuett som blinkar förbi ett
3tågfönster, en sprintstart, en frys på en utsträckt hand. Varje klipp landar exakt på en
4downbeat av det refererade ljudet. Platt färg, tjocka bläcklinjer, högkontrast nattpalett
5av djup indigo och neon magenta.
  1. Två-radig japansk dialogscen, 12 sekunder. Detta är läppsynkroniseringstestet, och 12 sekunder är redan utanför Veos räckvidd.
Plain
1Cel-shaded 2D anime, platt färg, ingen 3D-skuggning. Två originalkaraktärer på ett tak i
2gyllene timmen, shot reverse shot. Första säger på japanska: 「本当に行くの?」. Den andra
3svarar, halvleende, på japanska: 「もう決めた」. Munnar matchar varje stavelse. Varm
4kantljus, långa skuggor, mild vind i håret. Ljud: två distinkta japanska röster, avlägsen
5trafik, en cikada.
  1. Vertikal shonen kort, 9:16 , 8 sekunder. Båda modellerna kan göra vertikalt, så detta är det enda stället att faktiskt A/B-jämföra dem snarare än att anta.
Plain
1Cel-shaded 2D anime, vertikal komposition. En original tonårslöpare brister genom ett
2pappersbaner i slow motion, sedan snäpper bilden tillbaka till full fart när hon accelererar
3nerför en stadionraksträcka. Hastighetslinjer, platt färg, hårda skuggor, djärv grafisk
4himmel. Kamera: låg vinkel följningsbild, sedan en whip upp till hennes ansikte. Ljud:
5baner sönder, publikvåg, ett andetag hållet och sedan släppt.
6
7Om du vill ha promptgrammatiken bakom dessa, går [MiniMax H3 prompt guide](https://www.atlascloud.ai/blog/guides/minimax-h3-prompt-guide?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) djupare in på hur H3 tolkar kamera- och ljudinstruktioner än jag kan här.
8
9## Vad en 60-sekunders Anime-öppning Kostar på MiniMax H3 vs Veo 3.1
10
11En standard anime-OP är ungefär 90 sekunder. Kalla det åtta bilder på 8 sekunder, 64 sekunder färdig video, plus en keyframe per bild till $0,009 styck.
12
13Det finns en verklig prisskillnad som du bör känna till snarare än att jag ska sopa över den. Atlas Cloud-katalogen listar MiniMax H3 till $0,10 per sekund platt, medan modellens readme delar upp den som $0,14/s vid 2K och $0,10/s vid 768P. Veo 3.1 listas till $0,20 per sekund, medan dess readme separerar $0,40/s med ljud från $0,20/s utan.
14
15Körknapparna i mina skärmdumpar avgör det. H3 reference-to-video, 8 sekunder vid 2K, citerade `Run $1,12`, vilket är exakt $0,14 per sekund. Veo 3.1 image-to-video, 8 sekunder vid 1080p med ljud på, citerade `Run $3,2`, vilket är exakt $0,40 per sekund. Så readme-priserna är de som faktureras, och katalogrubriken är ingångsnivån. Jag har visat båda avläsningarna nedan ändå. Dessa är listpriser från och med augusti 2026.
16
17**Tabell 4: åtta bilder på 8 sekunder, keyframes inkluderade**
18
19| Setup                     | Videokostnad (katalogpris) | Videokostnad (readme-pris) | Keyframes | Totalt intervall      |
20| ------------------------- | ------------------------- | ------------------------ | --------- | ---------------- |
21| MiniMax H3, 2K            | $6,40                     | $8,96                    | $0,07     | $6,47 till $9,03   |
22| MiniMax H3, 768P          | $6,40                     | $6,40                    | $0,07     | $6,47            |
23| Veo 3.1, 1080p med ljud | $12,80                    | $25,60                   | $0,07     | $12,87 till $25,67 |
24| Veo 3.1 Lite, 720p        | $3,20                     | $3,20                    | $0,07     | $3,27            |
25
26Priser hämtade från Atlas Cloud-modellsidorna länkade i Tabell 1, augusti 2026. Ingen av dessa fyra är rabatterade just nu.
27
28Två saker som tabellen inte inkluderar, och båda slår hårdare än priset per sekund.
29
30**Omtagningar.** Ingen levererar den första tagningen av en anime-bild. Oavsett vilken multiplikator du antar, applicera den på båda kolumnerna och gapet vidgas i samma proportion.
31
32**Väggklocka, och den här går åt andra hållet.** Tidsmätt från början till slut den 7 augusti 2026: H3 vid 2K i 8 sekunder tog 447 sekunder, cirka 7,5 minuter. H3 text-to-video vid 2K i 12 sekunder tog 334 sekunder. Veo 3.1 vid 1080p i 8 sekunder med ljud tog 152 sekunder, under tre minuter. Veo är ungefär tre gånger snabbare till en första tagning här, och om du itererar på en bild klockan 02:00 är det värt riktiga pengar. Köer förändras, så behandla dessa som ett ögonblicksbild från en eftermiddag snarare än en specifikation. Men alla som citerar "2 till 3 minuter" för H3 vid 2K citerar en readme, inte en kö. [2K versus 768P-uppdelningen](https://www.atlascloud.ai/blog/guides/minimax-h3-2k-vs-768p?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) täcker när den högre nivån är värd de extra minuterna.
33
34## Anime-stil, Homage och Vad Du Faktiskt Kan Publicera
35
36Allt i denna artikel är stil och homage. En originalkaraktär, en originaltröja, en originaltitel. Ingen officiell anime-karaktär genererades eller efterfrågades, och ingen verklig fotbollsspelares namn eller likhet användes. Världscupstrenden refereras som ett _format_, eftersom det är vad den är användbar för.
37
38Den distinktionen är inte dekoration. Om du producerar anime-stilat innehåll kommersiellt, är "i stil med 90-tals OVA" och "denna specifika karaktär från denna specifika show" olika juridiska objekt, och endast en av dem är en affärsverksamhet.
39
40Om de öppna vikterna: H3 är verkligen nedladdningsbar, och folk körde den dag ett. En kommentator rapporterade 10 minuter för en 10-sekunders 480p-klipp på en 4070 Ti Super med 16 GB, och andra postade 3 minuter på en 5080 och 68 sekunder på ett RTX 6000 Pro. Men självhostad inferens körs vid en 768 kort sida; Context-IR och Regenerate-2K-stegen som producerar 2K förblir på API-sidan.
41
42Licensen har en verklig hake. Communitylicensen täcker för närvarande inte EU, Storbritannien, Sydkorea eller USA, med hänvisning till regioner "som för närvarande utvecklar eller upprätthåller AI-relaterade regleringar". En formell licensansökningskanal är öppen, vilket en HN-kommentator sammanfattade som "du måste bara pinky promise att du inte gör Disney arg och de kommer skicka dig en licens". Roligt, och också exakt det efterlevnadssteg du inte kan hoppa över om du befinner dig i ett av dessa fyra territorier. [De öppna vikterna-uppskrivningen](https://www.atlascloud.ai/blog/guides/minimax-h3-open-source-weights?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) har den fullständiga territorielistan.
43
44## Vanliga Frågor
45
46### Är MiniMax H3 en bra anime-videogenerator jämfört med Veo 3.1?
47
48För de flesta anime-arbeten, H3, och främst av skäl som inte handlar om rendering. Den kör 4 till 15 sekunder mot Veos 4, 6 eller 8, den erbjuder sex bildförhållanden inklusive 4:3 och 21:9 mot Veos två, den listar japanska bland 11 inbyggt stabila dialogspråk, och den tar nio referensbilder mot Veos tre. Veo 3.1 vinner i en specifik situation: när du behöver `seed` för reproducerbara omtagningar, eller `negative_prompt` för att stoppa en bild från att driva in i 3D-renderingsskuggning. H3 har ingen av dessa parametrar. Om din pipeline är beroende av någon av dem är det en genuin anledning att stanna kvar.
49
50### Kan Veo 3.1 generera anime i 4:3 eller en 15-sekunders klipp?
51
52Nej, och inte av stilistiska skäl. Veo 3.1:s `aspect_ratio`-enum innehåller exakt `16:9` och `9:16`, och dess `duration`-enum innehåller exakt `4`, `6` och `8`. Det finns inget 4:3-värde att välja och inget sätt att begära 12 eller 15 sekunder. Om din referens är en 90-tals TV-anime eller OVA, är inramningen utom räckhåll på Veo och tillgänglig på H3.
53
54### Varför kom min Veo 3.1 anime-klipp tillbaka tyst?
55
56För att `generate_audio` har standard `false` på API:et. Playground-växeln är vanligtvis redan på, så detta drabbar bara de som anropar API:et direkt. Ställ in `generate_audio: true` explicit. Medan du är där, ställ in `resolution` också, eftersom den har standard `720p` snarare än den 1080p eller 4k du förmodligen avsåg.
57
58### Har MiniMax H3 japansk dialog och läppsynk för anime?
59
60Ja. Modellkortet listar 11 språk med stabilt dialogstöd: arabiska, kinesiska, engelska, franska, tyska, italienska, japanska, koreanska, portugisiska, ryska och spanska. Ljud genereras gemensamt med bilden vid 32 kHz stereo snarare än dubbad i efterhand, vilket är varför munnens timing håller över en hel rad istället för de första stavelserna. Skriv den japanska raden direkt i prompten på japanska.
61
62### Hur många referensbilder kan jag använda för att hålla en anime-karaktär konsekvent?
63
64MiniMax H3 accepterar upp till 9 bilder, upp till 3 videoklipp och upp till 3 ljudklipp, med ett hårt tak på 12 filer över alla typer. Veo 3.1:s reference-to-video-endpoint accepterar 1 till 3 bilder, och att välja den kollapsar `duration` till `8` som det enda lagliga värdet. För en återkommande anime-karaktär över en serie är den skillnaden hela bollen.
65
66### MiniMax H3 har öppna vikter, så kan jag köra min anime-pipeline lokalt gratis?
67
68Du kan ladda ner och köra den, med tre förbehåll. Självhostad inferens körs vid en 768 kort sida, och Context-IR och Regenerate-2K-stegen som producerar 2K-utdata förblir API-sida. Verkliga lokala hastigheter varierar mycket beroende på kort: ungefär 10 minuter för en 10-sekunders 480p-klipp på en 4070 Ti Super, cirka 3 minuter på en 5080, cirka 68 sekunder på ett RTX 6000 Pro, enligt day-0 ComfyUI-tråden. Och communitylicensen täcker för närvarande inte EU, Storbritannien, Sydkorea eller USA, så om du är i ett av dessa, behöver du den formella licensen innan kommersiell användning.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller