Seedance 2.5 is nu live — Als eerste op Atlas Cloud

MiniMax H3 Anime Video Generator: 15 seconden, 4:3, en de titelkaart Veo 3.1 mislukt

MiniMax H3 anime video generator vs Veo 3.1 op dezelfde keyframe. H3 loopt van 4 tot 15 seconden en zes beeldverhoudingen, Veo beperkt tot 8 seconden en twee. Japanse dialoog, 9 refs, echte runs.

De hele zomer bestond mijn feed uit dezelfde video in een loop. WK-spelers hertekend als shonen-protagonisten. Een dictator. Een piraatkapitein. Een norse mentor die in de laatste vier seconden opduikt. Miljoenen views per post, en het verhaal wordt na bijna elke wedstrijd bijgewerkt.

Niemand die dit maakt, schrijft benchmarkposts. Ze kiezen een model, verbranden credits en leveren vóór de volgende aftrap.

Dus nam ik één anime-keyframe en één prompt, en testte MiniMax H3 als anime-videogenerator tegen Veo 3.1, beide op hun maximale instellingen met identieke invoer.

Het eerste dat brak, was niet de beeldkwaliteit. Het was een dropdown. Veo 3.1 stopt bij 8 seconden en biedt precies twee beeldverhoudingen. Een shot dat op een gezicht blijft hangen, een whip pan met de bal en dan een titelkaart laat landen, past niet in 8 seconden. Het kreeg nooit de kans om te falen op kwaliteit.

Belangrijkste inzichten

  • Veo 3.1's duration-enum is [4, 6, 8] en de aspect_ratio-enum is [16:9, 9:16]. MiniMax H3 draait elke hele seconde van 4 tot 15 en biedt 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Geen 4:3 op Veo betekent geen retro OVA-framing, helemaal niet.
  • H3's modelkaart vermeldt 11 native stabiele dialoogtalen en Japans is er een van. Audio en beeld worden samen gegenereerd op 32 kHz stereo, niet later nagesynchroniseerd.
  • Referentiepakketten zijn niet vergelijkbaar: H3 neemt tot 9 afbeeldingen plus tot 3 video's en 3 audioclips (max. 12 bestanden). Veo 3.1's referentie-eindpunt neemt 3 afbeeldingen, en zodra je het gebruikt, krimpt duration naar alleen [8].
  • Twee valkuilen die tests stilletjes verpesten: Veo's API zet generate_audio standaard op false en resolution op 720p, en H3's tekst-naar-video ratio staat standaard op 1:1. Als je die met rust laat, vergelijk je een stille 720p-clip met een vierkante.
  • Veo 3.1 heeft twee dingen die H3 helemaal niet heeft: seed en negative_prompt. Voor 2D-anime is dat tweede echt nuttig, en ik zal laten zien waar.

MiniMax H3 Anime-videogenerator vs Veo 3.1, Hetzelfde Frame Achter Elkaar

Eén origineel personage. Eén keyframe. Eén prompt, teken voor teken gekopieerd naar beide modellen. Al het andere gemaximaliseerd aan elke kant.

MiniMax H3, image-to-video, 2K, 8 seconden, native audio. Zet het geluid aan: het stadiongeluid, de balstoot en de Japanse schreeuw worden in dezelfde pass gegenereerd als het beeld. Gegenereerd met minimax/h3/image-to-video op Atlas Cloud.

Veo 3.1, image-to-video, 1080p, 8 seconden, generateaudio handmatig aangezet, plus een negativeprompt die de lijnkunst vlak houdt. Hetzelfde eerste frame, dezelfde woorden. Gegenereerd met google/veo3.1/image-to-video op Atlas Cloud.

Beide tekenen prachtig. Veo's brede shot van de stoot, met handgetekende impactlijnen en een manga-geluidseffect dat in de lucht zweeft, is echt mooi. Dat is het eerlijke startpunt, en daarom gaat de rest van dit artikel over parameters en instructie-opvolging, niet over sfeer.

Waarom de meeste MiniMax H3 Anime-videogenerator-tests vs Veo 3.1 misgaan

Twee dingen gebeurden tegelijk deze zomer.

Anime werd het formaat met het hoogste volume in AI-video. Het WK 2026 werd herschreven als een shonen-toernooi, met spelers als een dictator, een piraatkapitein, een marinier-generaal en een mentor, en verhaallijnen die "na bijna elke wedstrijd evolueren" op TikTok, Instagram, X en YouTube (Complex, juli 2026).

En MiniMax H3 werd uitgebracht met open gewichten. De dag-0 ComfyUI-thread haalde 330 punten en 95 reacties, met mensen die binnen enkele uren echte lokale cijfers postten (Hacker News, augustus 2026).

Combineer die twee en je zou een stapel anime-vergelijkingen verwachten. Er zijn er bijna geen, omdat de meeste tests op een van de vier manieren verkeerd worden opgebouwd.

Ze vergelijken plaatjes, niet beperkingen. Animeshots draaien om timing. Een whip pan naar een titelkaart is een duurprobleem voordat het een renderprobleem is.

Ze vergeten dat Veo's API standaard stil is. Op de API staat generate_audio op false en resolution op 720p. Heel wat "Veo heeft geen audio in anime"-posts zijn gewoon iemand die nooit een boolean heeft omgezet.

Ze vergeten dat H3's tekst-naar-video standaard vierkant is. ratio staat standaard op 1:1, niet op 16:9. Als je een t2v-animeprompt uitvoert zonder het in te stellen, krijg je een vierkante clip en een verwarde conclusie.

Ze testen met fotorealistische prompts. "Cinematografisch, volumetrisch licht, kleine scherptediepte" is precies de woordenschat die een 2D-model naar 3D-renderschaduwen trekt. De faalmodus in anime is niet vaag. Het is plastic.

De drie instellingen die een anime-test bepalen voordat je op run drukt

Zet deze eerst aan beide kanten, anders is de vergelijking ongeldig.

InstellingMiniMax H3Veo 3.1Wat gebeurt er als je het overslaat
AudioAltijd gegenereerd met het beeldgenerate_audio standaard falseVeo geeft een stille clip en ziet er slechter uit dan het is
Vormratio standaard 1:1 bij tekst-naar-videoaspect_ratio standaard 16:9H3 geeft een vierkante anime-crop die je niet kunt gebruiken
Resolutiestandaard 2Kstandaard 720pJe vergelijkt 2K met 720p en noemt het een kwaliteitskloof

De MiniMax H3 vs Veo 3.1 Anime-specificatieblad: Lengte, Beeldverhouding, Audio, Referenties

Ik heb de live invoerschema's van beide modellen gepakt, zonder op een aankondigingspost te vertrouwen. Elke waarde hieronder is een enum die je zelf kunt lezen op de modelpagina's, geen indruk.

Tabel 1: MiniMax H3 vs Veo 3.1, de parameters die een animeshot bepalen

MiniMax H3Veo 3.1
Duur4 tot 15, elke hele seconde (standaard 8)4, 6, 8 (standaard 8)
Beeldverhoudingen21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
Standaard beeldverhouding (t2v)1:0116:09
Resolutie768P, 2K (standaard 2K)720p, 1080p, 4k (standaard 720p)
AudioGezamenlijk gegenereerd, 32 kHz stereogenerate_audio, standaard false
Native dialoogtalen11 stabiel, Japans inbegrepenNiet gepubliceerd als stabiele lijst
Referentiepakkettot 9 afbeeldingen, 3 video's, 3 audioclips, totaal 12 bestanden3 afbeeldingen
Duur bij gebruik referentiesnog steeds 4 tot 15krimpt naar alleen 8
seedniet beschikbaarbeschikbaar
negative_promptniet beschikbaarbeschikbaar
Gewichtendownloadbaargesloten

Duur, beeldverhouding, resolutie, audio en referentielimieten zijn gelezen van de live schema's op de MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video en Veo 3.1 reference-to-video pagina's. Het plafond van 9 afbeeldingen en 12 bestanden en de lijst van 11 dialoogtalen komen van de MiniMax H3 modelkaart (Hugging Face, augustus 2026).

Nu de scoreborden, want die zeggen iets anders dan het specificatieblad en beide zijn van belang.

Tabel 2: Crowd-vote Elo en lijstprijs per minuut, momentopname 7 augustus 2026

ModelTekst-naar-video (met audio)Image-naar-video (met audio)$/min
Gemini Omni Flash1.244 (#1) ±71.191 (#2) ±9$6,00
MiniMax H31.238 (#2) ±91.190 (#3) ±10$7,80
Dreamina Seedance 2.0 720p1.224 (#3) ±61.198 (#1) ±7$9,07
Kling 3.0 1080p (Pro)1.111 (#7) ±6niet in top 10$20,16
Veo 3.11.093 (#11) ±71.085 (#10) ±7$24,00
Veo 3.1 Fast1.091 (#14) ±6niet in top 10$9,00
Veo 3.1 Lite1.089 (#15) ±7niet in top 10$4,80

Elo- en prijsgegevens van de Artificial Analysis Video Arena (Artificial Analysis, augustus 2026). Dit zijn rollende crowd-stemmen en ze bewegen. De $/min-kolom is een genormaliseerde modelschatting, niet je factuur.

Een Elo-kloof van 145 punten is groot, maar het is een algemene stem, geen anime-stem. En hier is het deel dat ik duidelijk moet zeggen: MiniMax verkoopt H3 niet als een animemodel. Interne first-line feedback noemt film, animatie en komedie-drama als de gebieden waar H3 niet op gericht is. Dus de interessante vraag is niet "welke is het animemodel". Het is waarom het model dat zichzelf niet op anime verkoopt, toch de shot wint, en waar Google nog steeds de ronde pakt.

Eén praktische opmerking voor de tutorial. Elk model hieronder draait via dezelfde console en dezelfde API-sleutel, wat de enige reden is dat de parameters überhaupt vergelijkbaar zijn. Dezelfde wachtrij, dezelfde auth, één rekening. Als je GPT Image 2 op de ene service instelt en Veo op een andere, is de helft van de verschillen die je vindt infrastructuur in plaats van model.

Bouw de Shot: MiniMax H3 vs Veo 3.1, Stap voor Stap

Eén doorlopend voorbeeld, van begin tot eind. "Last Whistle": een originele tieneraanvaller, rood haar, wit en marineblauw nummer 9-shirt, schijnwerpers, een whip pan op de stoot, en een Japanse titelkaart die in de laatste twee seconden moet landen en stabiel moet blijven.

Geen echte speler, geen officieel personage, geen bestaande anime-IP. Alleen stijl en hommage. Meer over waarom straks.

Stap 1: Ontwerp het anime-keyframe met GPT Image 2

Het keyframe draagt de artistieke richting, zodat het videomodel het niet hoeft te verzinnen. Let op de negatieve ruimte op het linkerderde: het is opzettelijk. De titelkaart wordt daar door het videomodel geschreven, en dat is de tekststabiliteitstest.

Plain
1A single frame from a modern shonen sports anime. Cel-shaded 2D animation, hand-inked
2line art with consistent line weight, flat colour fills, hard-edged graphic shadows,
3absolutely no 3D shading and no photoreal skin. Close-up on an original teenage striker:
4messy dark-red hair, white-and-navy kit with the number 9, sweat and grass streaks across
5one cheek, eyes wide with exhausted determination, mouth open mid-shout. Behind him,
6stadium floodlights blaze into a wall of blurred crowd colour; radial speed lines burst
7from the centre of frame; one blade of grass hangs frozen in the air. Saturated palette,
8deep cyan shadows, warm orange rim light. 16:9 composition, the character framed right of
9centre, clean negative space on the left third. No text anywhere in the image.

Instellingen: model openai/gpt-image-2/text-to-image, kwaliteit high, formaat 16:9 (2048x1152). Verder niets.

AI-afbeeldingsgeneratorinterface met genummerde stappen om een anime-afbeelding te maken

GPT Image 2-playground op Atlas Cloud met de Last Whistle-keyframeprompt en het voltooide animeframe in het uitvoerpaneel

GPT Image 2 op Atlas Cloud: kwaliteit ingesteld op high, het voltooide keyframe aan de rechterkant.

Intense roodharige anime-atleet die schreeuwt in een vol stadion

Het basis anime-keyframe: een originele roodharige aanvaller midden in een schreeuw onder stadionlampen, cel-shaded met vlakke kleur en snelheidslijnen

Het keyframe dat beide modellen ontvangen. Vlakke kleur, harde schaduwen en een leeg linkerderde wachtend op een titelkaart.

Stap 2: MiniMax H3 image-to-video, alles gemaximaliseerd

Zelfde afbeelding erin, 2K eruit. Ik hield H3 hier op 8 seconden alleen om overeen te komen met Veo's plafond. Dat is niet H3's limiet en stap 4 haalt de beperking eraf.

Plain
1Cel-shaded 2D anime, hand-inked line weight, flat colour, no 3D shading. Hold on the
2striker's face for one beat, then a violent whip pan follows the ball as he strikes it,
3the pan smearing the frame into streaked sakuga motion trails. One frame of total silence
4at impact. Over the final two seconds, bold white Japanese title lettering reading
5ラストホイッスル punches onto the left third of frame and holds rock-steady, no warping,
6no flicker, no drift. The striker shouts one line in Japanese: 「まだ終わってない!」
7Audio: stadium roar swelling, a single sharp ball-strike impact, a low taiko hit under the
8title card.

Instellingen: model minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video neemt zijn framevorm van je invoerafbeelding), image = de uitvoer van stap 1.

Eén waarschuwing als je in plaats daarvan naar tekst-naar-video gaat: schrijf ratio: 16:9 expliciet. De standaard is 1:1 en het geeft je gewillig een vierkante anime-crop.

AI-videogeneratorinterface met invoerprompt en uitvoervideo

MiniMax H3 image-to-video-playground op Atlas Cloud met de Last Whistle-prompt, geladen keyframe en de voltooide clip in het uitvoerpaneel

MiniMax H3 image-to-video op Atlas Cloud: het keyframe van stap 1 aan de linkerkant, de voltooide clip aan de rechterkant.

Stap 3: Veo 3.1 image-to-video, audio handmatig aangezet

De prompt is identiek, woord voor woord. Verander een enkel bijvoeglijk naamwoord en het is geen vergelijking meer. Wat wel verandert, is het extra veld dat Veo je geeft en H3 niet.

negative_prompt, wat voor 2D-anime de handigste controle op deze lijst is:

Plain
13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur
2soup, warped lettering, gibberish text, extra fingers, subtitle bar

Instellingen: model google/veo3.1/image-to-video, resolution: 1080p (verander het, de standaard is 720p), duration: 8 (dit is het plafond), aspect_ratio: 16:9, generate_audio: true (de API-standaard is false, dit is de stille-clipval), seed: 20260807, image = dezelfde uitvoer van stap 1.

AI-videogeneratorinterface met invoerinstellingen en gegenereerde anime-video

Veo 3.1 image-to-video-playground op Atlas Cloud met generate audio ingeschakeld, het anime-keyframe geladen en de voltooide clip in het uitvoerpaneel

Veo 3.1 image-to-video op Atlas Cloud, met Generate Audio ingeschakeld en de voltooide clip aan de rechterkant.

Stap 4: Beoordeel het op vijf anime-specifieke assen

Niets te genereren hier. Kijk gewoon naar de dingen waar anime echt op breekt. Beide clips zijn bovenaan dit artikel ingebed, dus je kunt ze zelf beoordelen in plaats van mij op mijn woord te geloven.

Naast elkaar geplaatste voetbalstadionscènes met de labels MiniMax H3 en Veo 3.1

Naast elkaar geplaatst eindframe van beide clips, MiniMax H3 links met schone Japanse titelletters, Veo 3.1 rechts met verwrongen verticale tekens

Het laatste frame van elke clip. Links schreef H3 ラストホイッスル, alle acht katakana correct en rotsvast. Rechts schreef Veo 3.1 drie tekens die niet het gevraagde woord zijn en er geen vormen.

De titelkaart is waar de ronde werd beslist, en het was niet close. H3 gaf de gevraagde katakana exact, scherp en stabiel, over een uitgesmeerde pan van het doelgebied. Veo 3.1 produceerde een verticale stapel van drie tekens die noch het gevraagde woord noch een woord zijn. Op hetzelfde frame liet het ook het personage uit het shot verdwijnen en liet de achtergrond wegglijden naar een semi-fotorealistische stadionplaat, ondanks photorealistic skin en 3D render in de negatieve prompt.

Tabel 3: vijf assen die een anime-crop bepalen, van deze twee runs

AsMiniMax H3Veo 3.1
Personagecontinuïteit vanuit keyframeHield het exacte gezicht, haar en shirt gedurende de volledige 8 secondenHertekende het personage in een nieuw breed shot, modelgetrouw maar een andere tekening
Lijndikte en vlakke cel-shadingHield, geen afwijking naar 3DHield in het medium shot, gleed tegen het einde naar een fotografische stadionplaat
Japanse titelkaartラストホイッスル correct weergegeven en stabiel gehoudenDrie tekens, niet het gevraagde woord, geen woord
Geleverde audiotrack32 kHz stereo, exact zoals de modelkaart vermeldt48 kHz stereo, alleen aanwezig omdat ik generate_audio zelf instelde
Whip pan en sakuga-smearUitgevoerd als een uitgesmeerde pan naar de titelVervangen door een harde cut naar een nieuwe opstelling

Die laatste rij is de luidste publieke kritiek op H3 tot nu toe, en dat is precies waarom ik het in beide prompts schreef. Op de dag-0 ComfyUI-thread klaagde gebruiker fwip dat zelfs de officiële demo-prompts werden genegeerd: "a violent WHIP PAN off the rooftop that SMEARS the floating words away with it, motion-streaked. And the video just didn't do any of that transition at all, it just replaced it with a cut."

In deze run was het Veo die de pan verwisselde voor een cut, en H3 die uitsmeerde. Elke keer één take is geen oordeel, en ik zou niet anders beweren. Maar het betekent wel dat de kritiek niet H3-specifiek is: whip pans zijn de minst betrouwbare instructie in deze hele test aan beide kanten. Als je storyboard ervan afhangt, storyboard er dan omheen in plaats van erdoorheen.

Stap 5: De 4:3 retro OVA cut die Veo 3.1 structureel niet kan uitvoeren

Dit is geen kwaliteitsvoorkeur. Het is een muur. Veo's aspect_ratio-enum heeft twee waarden en geen van beide is 4:3, en zijn duration-enum heeft geen 12. De jaren 90 OVA-look is simpelweg niet bereikbaar.

Plain
1A 1990s OVA anime cut, 4:3 full-frame. Hand-painted background art with visible brush
2texture, cel-paint characters with thick uneven ink lines, heavy halation glow around the
3floodlights, 16mm film grain and faint gate weave. The same red-haired striker in a
4white-and-navy number 9 kit walks off a rain-soaked pitch as the crowd noise fades to a
5single ringing tone. Camera pushes in slowly on his face. He says quietly in Japanese:
6「次は、勝つ」. Retro palette: muted teal, dusty amber, deep maroon shadows. Audio:
7distant rain, a lone analogue synth pad, one reverb-heavy whistle in the far distance.

Instellingen: model minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Stel die beeldverhouding handmatig in, onthoud de standaard.

AI-videogeneratorinterface met tekstprompt en gegenereerde anime-video

MiniMax H3 text-to-video-playground op Atlas Cloud met de OVA-prompt getypt en de voltooide retro-clip in het uitvoerpaneel

MiniMax H3 text-to-video op Atlas Cloud, OVA-prompt getypt, clip voltooid. Volledige openheid: deze specifieke run liet Aspect Ratio op 16:9 en Duration op 8, dus wat je aan de rechterkant ziet, is de breedbeeld korte versie. De 4:3 twaalf-seconden cut hieronder kwam van de API-aanroep met ratio: 4:3 en duration: 12 expliciet ingesteld.

Roodharige anime-voetbalspeler staand in een vuil uniform in een stadion

De 4:3 retro OVA-cut: dezelfde aanvaller loopt van een natgeregend veld in jaren 90 anime-stijl

H3 text-to-video, 4:3, 12 seconden. Het geleverde bestand kwam terug als 1920x1440, wat pixel-perfect 4:3 is, met een 32 kHz stereo track. Hier getoond als een stille GIF met verlaagde framerate om de pagina licht te houden. Gegenereerd met minimax/h3/text-to-video op Atlas Cloud.

Stap 6: Negen referentieafbeeldingen, één personage, vier cuts

Cross-shot personageconsistentie is het moeilijkste probleem in AI-anime, en het wordt opgelost met referentievolume. Bouw eerst het pakket: voer de prompt van stap 1 opnieuw uit met de kadrering gewisseld voor vooraan, driekwart, volledig profiel, achterkant, lachend, opeengeklemde tanden, volledige lichaamshouding, kitdetail en schoenendetail. Negen afbeeldingen, ruwweg acht cent in totaal.

Concreet en specifiek? Ja (specificeert vier illustraties, roodharig, anime, voetbal

Vier hoeken van hetzelfde originele aanvallerpersonage gegenereerd als een referentiepakket, gerangschikt in een twee bij twee raster

Vier van de negen referentiehoeken. H3 accepteert tot negen afbeeldingen in één referentiepakket, plus video- en audioreferenties er bovenop.

Plain
1Cel-shaded 2D anime, consistent hand-inked line weight, flat colour, no 3D shading. Keep
2the referenced striker's face, hair silhouette and number 9 kit identical across every cut.
3Four cuts in one continuous take: (1) low-angle push-in on his boots hitting the turf,
4(2) whip-pan up to a tight close-up of his eyes, (3) wide shot of him sprinting past three
5defenders drawn as blurred silhouettes, (4) freeze on a mid-air header, speed lines
6exploding outward. Audio: crowd roar, breath, boot-on-turf impacts, one taiko hit on the
7freeze.

Instellingen: model minimax/h3/reference-to-video, refers = je afbeeldingen met type: image, resolution: 2K, duration: 8 of hoger, ratio: adaptive of 16:9.

Het equivalente Veo 3.1-eindpunt kan niet met deze instellingen worden uitgevoerd en je hoeft het niet te proberen om te weten waarom. Het referentie-eindpunt accepteert maximaal drie afbeeldingen, en het kiezen van dat eindpunt krimpt duration tot een enkele geldige waarde van 8. Een pakket van negen afbeeldingen en een take van 10 seconden vallen beide buiten bereik.

AI-videogeneratorinterface met invoerprompt en gegenereerde anime-video

MiniMax H3 reference-to-video-playground op Atlas Cloud met de referentieteller op vier van de negen en de eerste cut in het uitvoerpaneel

MiniMax H3 reference-to-video op Atlas Cloud. De teller geeft Reference Materials (4/9) met MAX:9 eronder, wat het plafond in de interface is in plaats van een claim van een specificatieblad. Uitvoer is cut één, de low-angle push-in op de schoenen.

Vier Extra MiniMax H3 Anime-videogenerator-runs die de Moeite Waard Zijn

De Last Whistle-shot benadrukt slechts vier van de verschillen. Deze vier benadrukken de rest. Ze draaien allemaal op H3; de notities geven aan welke Veo 3.1 kan evenaren.

  1. Ultrawide sakuga-gevecht, 21:9 , 10 seconden. Veo kan helemaal geen 21:9 uitvoeren.
Plain
1Cel-shaded 2D anime action, thick tapered ink lines, flat colour, hard-edged shadows,
2no 3D shading. Two original masked duelists on a windswept temple roof at dusk. Blade
3clash, the frame shudders, both fighters break apart in a burst of hand-drawn impact
4frames and radial speed lines. Camera: low-angle push-in, then a lateral track, then a
5snap to a wide silhouette against the orange sky. Audio: two sharp metal clashes, cloth
6snap, a low taiko hit on the final freeze, no music.
  1. Beatsynchrone AMV-cut, reference-to-video met een audioreferentie. H3 neemt tot drie audioclips als referentie-invoer. Veo 3.1 heeft helemaal geen audio-invoer, alleen audio-uitvoer.
Plain
1Cel-shaded 2D anime montage cut to the referenced audio track. Five short beats: rain on
2a window, a hand tightening a bandage, a city skyline flashing past a train window, a
3sprint start, a freeze on an outstretched hand. Every cut lands exactly on a downbeat of
4the referenced audio. Flat colour, thick ink lines, high-contrast night palette of deep
5indigo and neon magenta.
  1. Tweeregelige Japanse dialoogscène, 12 seconden. Dit is de lip-sync-stresstest, en 12 seconden valt al buiten Veo's bereik.
Plain
1Cel-shaded 2D anime, flat colour, no 3D shading. Two original characters on a rooftop at
2golden hour, shot reverse shot. First says in Japanese:「本当に行くの?」. The second
3answers, half-smiling, in Japanese:「もう決めた」. Mouths match every syllable. Warm rim
4light, long shadows, gentle wind in hair. Audio: two distinct Japanese voices, distant
5traffic, one cicada.
  1. Verticale shonen-kort, 9:16 , 8 seconden. Beide modellen kunnen verticaal, dus dit is de enige plek om ze echt te A/B'en in plaats van aan te nemen.
Plain
1Cel-shaded 2D anime, vertical composition. An original teenage runner bursts through a
2paper banner in slow-motion, then the frame snaps back to full speed as she accelerates
3down a stadium straight. Speed lines, flat colour, hard shadows, bold graphic sky.
4Camera: low-angle follow shot, then a whip up to her face. Audio: banner tear, crowd
5surge, one breath held then released.

Als je de promptgrammatica achter deze wilt, de MiniMax H3 promptgids gaat dieper in op hoe H3 camera- en audio-instructies parseert dan ik hier kan.

Wat een 60-seconden Anime-opening kost op MiniMax H3 vs Veo 3.1

Een standaard anime-OP duurt ongeveer 90 seconden. Noem het acht shots van 8 seconden, 64 seconden voltooide video, plus één keyframe per shot voor $0,009 per stuk.

Er is een reëel prijsverschil dat je moet weten in plaats van dat ik het verdoezel. De Atlas Cloud-catalogus vermeldt MiniMax H3 op $0,10 per seconde vast, terwijl de model-readme het uitsplitst als $0,14/s bij 2K en $0,10/s bij 768P. Veo 3.1 wordt vermeld op $0,20 per seconde, terwijl de readme $0,40/s met audio scheidt van $0,20/s zonder.

De run-knoppen in mijn screenshots bevestigen het. H3 reference-to-video, 8 seconden op 2K, gaf Run $1,12, wat precies $0,14 per seconde is. Veo 3.1 image-to-video, 8 seconden op 1080p met audio aan, gaf Run $3,2, wat precies $0,40 per seconde is. Dus de readme-tarieven zijn degenen die in rekening worden gebracht, en de catalogus-kop is de ingangstier. Ik heb hieronder toch beide waarden getoond. Dit zijn lijstprijzen van augustus 2026.

Tabel 4: acht shots van 8 seconden, keyframes inbegrepen

OpstellingVideokosten (catalogusprijs)Videokosten (readme-prijs)KeyframesTotale range
MiniMax H3, 2K$6,40$8,96$0,07$6,47 tot $9,03
MiniMax H3, 768P$6,40$6,40$0,07$6,47
Veo 3.1, 1080p met audio$12,80$25,60$0,07$12,87 tot $25,67
Veo 3.1 Lite, 720p$3,20$3,20$0,07$3,27

Prijzen afkomstig van de Atlas Cloud-modelpagina's gelinkt in Tabel 1, augustus 2026. Geen van deze vier is momenteel afgeprijsd.

Twee dingen die die tabel niet bevat, en beide raken harder dan de prijs per seconde.

Herkansingen. Niemand levert de eerste take van een animeshot. Welke multiplier je ook aanneemt, pas deze toe op beide kolommen en de kloof wordt in dezelfde verhouding groter.

Kloktijd, en deze gaat de andere kant op. Van begin tot eind getimed op 7 augustus 2026: H3 op 2K voor 8 seconden duurde 447 seconden, ongeveer 7,5 minuten. H3 text-to-video op 2K voor 12 seconden duurde 334 seconden. Veo 3.1 op 1080p voor 8 seconden met audio duurde 152 seconden, minder dan drie minuten. Veo is hier ongeveer drie keer sneller naar een eerste take, en als je om 2 uur 's nachts aan een shot werkt, is dat echt geld waard. Wachtrijen bewegen, dus behandel dit als een momentopname van één middag, niet als een specificatie. Maar iedereen die "2 tot 3 minuten" citeert voor H3 op 2K, citeert een readme, geen wachtrij. De 2K versus 768P-uitsplitsing behandelt wanneer de hogere tier de extra minuten waard is.

Anime-stijl, Hommage, en Wat Je Echt Kunt Publiceren

Alles in dit artikel is stijl en hommage. Een origineel personage, een origineel shirt, een originele titel. Geen officieel anime-personage is gegenereerd of gevraagd, en geen echte voetballersnaam of -gelijkenis is gebruikt. De WK-trend wordt genoemd als een formaat, want dat is waarvoor het nuttig is.

Dat onderscheid is geen decoratie. Als je commercieel anime-achtige content produceert, zijn "in de stijl van jaren 90 OVA" en "dit specifieke personage uit deze specifieke show" verschillende juridische objecten, en slechts een ervan is een bedrijf.

Over de open gewichten: H3 is echt downloadbaar, en mensen draaiden het op dag één. Eén gebruiker meldde 10 minuten voor een 10-seconden 480p-clip op een 4070 Ti Super met 16GB, en anderen plaatsten 3 minuten op een 5080 en 68 seconden op een RTX 6000 Pro. Maar self-hosting draait op een 768 korte zijde; de Context-IR en Regenerate-2K-fasen die 2K produceren, blijven aan de API-kant.

De licentie heeft een echte valkuil. De communitylicentie dekt momenteel niet de EU, het VK, Zuid-Korea of de Verenigde Staten, met verwijzing naar regio's "die momenteel AI-gerelateerde regelgeving ontwikkelen of handhaven". Een formeel licentieverzoekkanaal is open, wat een HN-gebruiker samenvatte als "je moet gewoon met je pink beloven dat je Disney niet boos maakt en ze sturen je een licentie". Grappig, en ook precies de compliance-stap die je niet kunt overslaan als je in een van die vier gebieden bent. De open gewichten uitleg heeft de volledige territoriumlijst.

Veelgestelde Vragen

Is MiniMax H3 een goede anime-videogenerator vergeleken met Veo 3.1?

Voor de meeste anime-werk, H3, en vooral om redenen die niets met rendering te maken hebben. Het draait 4 tot 15 seconden tegen Veo's 4, 6 of 8, het biedt zes beeldverhoudingen waaronder 4:3 en 21:9 tegen Veo's twee, het vermeldt Japans onder 11 native stabiele dialoogtalen, en het neemt negen referentieafbeeldingen tegen Veo's drie. Veo 3.1 wint in één specifieke situatie: wanneer je seed nodig hebt voor reproduceerbare herkansingen, of negative_prompt om te voorkomen dat een shot naar 3D-renderschaduw afdrijft. H3 heeft geen van beide parameters. Als je pijplijn van een van beide afhangt, is dat een oprechte reden om te blijven.

Kan Veo 3.1 anime genereren in 4:3 of een clip van 15 seconden?

Nee, en niet om stilistische redenen. Veo 3.1's aspect_ratio-enum bevat precies 16:9 en 9:16, en zijn duration-enum bevat precies 4, 6 en 8. Er is geen 4:3-waarde om te selecteren en geen manier om 12 of 15 seconden aan te vragen. Als je referentie een jaren 90 tv-anime of OVA is, is de kadrering buiten bereik op Veo en beschikbaar op H3.

Waarom kwam mijn Veo 3.1 anime-clip stil terug?

Omdat generate_audio standaard op false staat op de API. De playground-schakelaar staat meestal al aan, dus dit bijt alleen mensen die de API rechtstreeks aanroepen. Stel generate_audio: true expliciet in. Terwijl je bezig bent, stel je ook resolution in, want het staat standaard op 720p in plaats van de 1080p of 4k die je waarschijnlijk bedoelde.

Doet MiniMax H3 Japanse dialoog en lip-sync voor anime?

Ja. De modelkaart vermeldt 11 talen met stabiele dialoogondersteuning: Arabisch, Chinees, Engels, Frans, Duits, Italiaans, Japans, Koreaans, Portugees, Russisch en Spaans. Audio wordt gezamenlijk gegenereerd met het beeld op 32 kHz stereo in plaats van later nagesynchroniseerd, daarom blijft de mondtiming gedurende een hele regel behouden in plaats van alleen de eerste paar lettergrepen. Schrijf de Japanse regel rechtstreeks in de prompt in het Japans.

Hoeveel referentieafbeeldingen kan ik gebruiken om een anime-personage consistent te houden?

MiniMax H3 accepteert tot 9 afbeeldingen, tot 3 videoclips en tot 3 audioclips, met een hard plafond van 12 bestanden over alle typen. Veo 3.1's reference-to-video-eindpunt accepteert 1 tot 3 afbeeldingen, en het selecteren ervan krimpt duration tot 8 als enige geldige waarde. Voor een terugkerend anime-personage in een serie is dat verschil het hele spel.

MiniMax H3 heeft open gewichten, kan ik mijn anime-pijplijn dus lokaal gratis draaien?

Je kunt het downloaden en draaien, met drie kanttekeningen. Self-hosted inferentie draait op een 768 korte zijde, en de Context-IR en Regenerate-2K-fasen die 2K-uitvoer produceren, blijven aan de API-kant. Real-world lokale snelheden variëren sterk per kaart: ruwweg 10 minuten voor een 10-seconden 480p-clip op een 4070 Ti Super, ongeveer 3 minuten op een 5080, ongeveer 68 seconden op een RTX 6000 Pro, volgens de dag-0 ComfyUI-thread. En de communitylicentie dekt momenteel niet de EU, het VK, Zuid-Korea of de VS, dus als je in een van die bent, heb je de formele licentie nodig vóór commercieel gebruik.

Nieuwste modellen

Eén API voor alle media-AI.

Verken alle modellen