De hele zomer stond mijn feed op repeat met dezelfde video. WK-spelers hertekend als shonen-hoofdpersonages. Een dictator. Een piratenkapitein. Een norse mentor die in de laatste vier seconden opduikt. Miljoenen views per post, en het verhaal wordt na bijna elke wedstrijd bijgewerkt.
Niemand die dit maakt, schrijft benchmarkposts. Ze kiezen een model, verbranden credits en publiceren voor de volgende aftrap.
Dus ik nam één anime-keyframe en één prompt, en testte MiniMax H3 als anime-videogenerator tegen Veo 3.1, beide op hun maximale instellingen met identieke invoer.
Het eerste dat brak, was niet de beeldkwaliteit. Het was een dropdown. Veo 3.1 stopt bij 8 seconden en biedt precies twee beeldverhoudingen. Een shot dat op een gezicht blijft hangen, met de bal meezwaait en dan een titelkaart laat landen, past niet in 8 seconden. Het kreeg nooit de kans om te falen op kwaliteit.
Belangrijkste conclusies
- Veo 3.1's
duration-enumeratie is[4, 6, 8]en deaspect_ratio-enumeratie is[16:9, 9:16]. MiniMax H3 draait elke hele seconde van 4 tot 15 en biedt21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Geen 4:3 op Veo betekent geen retro OVA-framing, helemaal niet. - H3's modelkaart vermeldt 11 native stabiele dialoogtalen, waaronder Japans. Audio en beeld worden samen gegenereerd op 32 kHz stereo, niet achteraf nagesynchroniseerd.
- Referentiepakketten zijn niet vergelijkbaar: H3 neemt tot 9 afbeeldingen plus tot 3 video's en 3 audioclips (maximaal 12 bestanden). Veo 3.1's referentie-eindpunt neemt 3 afbeeldingen, en zodra je het gebruikt, stort
durationin tot alleen[8]. - Twee valkuilen die tests stilletjes verpesten: Veo's API standaard
generate_audionaarfalseenresolutionnaar720p, en H3's tekst-naar-videoratiostandaard1:1. Laat die met rust en je vergelijkt een stille 720p-clip met een vierkante. - Veo 3.1 houdt twee dingen die H3 helemaal niet heeft:
seedennegative_prompt. Voor 2D-anime is dat tweede echt belangrijk, en ik zal laten zien waar.
MiniMax H3 Anime Video Generator vs Veo 3.1, Hetzelfde Frame Naast Elkaar
Eén origineel personage. Eén keyframe. Eén prompt, letterlijk gekopieerd in beide modellen. Al het andere gemaximaliseerd aan elke kant.
MiniMax H3, image-to-video, 2K, 8 seconden, native audio. Zet het geluid aan: het publieksgeruis, de balstoot en de Japanse schreeuw worden in dezelfde pas gegenereerd als het beeld. Gegenereerd met minimax/h3/image-to-video op Atlas Cloud.
Veo 3.1, image-to-video, 1080p, 8 seconden, generateaudio handmatig ingeschakeld, plus een negativeprompt die de lijntekening vlak houdt. Hetzelfde eerste frame, dezelfde woorden. Gegenereerd met google/veo3.1/image-to-video op Atlas Cloud.
Beide tekenen prachtig. Veo's wijde shot van de trap, met handgetekende impactlijnen en een manga-geluidseffect dat in de lucht zweeft, is echt mooi. Dat is het eerlijke beginpunt, en het is waarom de rest van dit artikel over parameters en instructieopvolging gaat in plaats van over sferen.
Waarom de Meeste MiniMax H3 Anime Video Generator Tests vs Veo 3.1 Fout Gaan
Er gebeurden deze zomer twee dingen tegelijk.
Anime werd het hoogste volumeformaat in AI-video. Het WK 2026 werd herschreven als een shonentoernooi, met spelers gecast als een dictator, een piratenkapitein, een mariniergeneraal en een mentor, en verhaallijnen die "na bijna elke wedstrijd evolueren" op TikTok, Instagram, X en YouTube (Complex, juli 2026).
En MiniMax H3 werd uitgebracht met open gewichten. De dag-0 ComfyUI-thread haalde 330 punten en 95 reacties, met mensen die binnen enkele uren echte lokale cijfers postten (Hacker News, augustus 2026).
Zet die twee samen en je zou een stapel anime-vergelijkingen verwachten. Die zijn er bijna niet, omdat de meeste tests op een van vier manieren verkeerd worden opgebouwd.
Ze vergelijken plaatjes, niet beperkingen. Anime-shots gaan over timing. Een whip pan naar een titelkaart is een duurprobleem voordat het een weergaveprobleem is.
Ze vergeten dat Veo's API standaard stil is. Op de API is generate_audio false en resolution 720p. Heel wat "Veo heeft geen audio in anime"-posts komen gewoon van iemand die nooit een boolean heeft omgezet.
Ze vergeten dat H3's tekst-naar-video standaard vierkant is. ratio standaard naar 1:1, niet 16:9. Voer een t2v anime-prompt uit zonder het in te stellen en je krijgt een vierkante clip en een verwarde conclusie.
Ze testen met fotorealistische prompts. "Cinematographic, volumetric light, shallow depth of field" is precies de woordenschat die een 2D-model naar 3D-rendershaduw trekt. De faalmodus in anime is niet wazig. Het is plastic.
De drie instellingen die een anime-test bepalen voordat je op start drukt
Stel deze aan beide kanten in voordat je iets anders doet, anders is de vergelijking ongeldig.
| Instelling | MiniMax H3 | Veo 3.1 | Wat gebeurt er als je het overslaat |
|---|---|---|---|
| Audio | Gegenereerd met het beeld, altijd aan | generate_audio standaard false | Veo geeft een stille clip terug en ziet er slechter uit dan het is |
| Beeldverhouding | ratio standaard 1:1 bij tekst-naar-video | aspect_ratio standaard 16:9 | H3 geeft je een vierkante anime-crop die je niet kunt gebruiken |
| Resolutie | standaard 2K | standaard 720p | Je vergelijkt 2K met 720p en noemt het een kwaliteitsverschil |
Wil je MiniMax H3 en Veo 3.1 zelf testen op dezelfde anime-prompt? Atlas Cloud's modelvergelijking draait ze naast elkaar in één keer — dezelfde prompt en instellingen, kosten getoond voordat je genereert.

MiniMax H3 en Veo 3.1 op dezelfde anime-prompt in Atlas Cloud's modelvergelijking — dezelfde instellingen, prijs getoond voordat je genereert. Live vastgelegd op de model-explorer.
De MiniMax H3 vs Veo 3.1 Anime Specificatieblad: Lengte, Verhouding, Audio, Referenties
Ik heb de live invoerschema's van beide modellen opgehaald in plaats van een lanceringpost te vertrouwen. Elke waarde hieronder is een enumeratie die je zelf kunt lezen op de modelpagina's, geen indruk.
Tabel 1: MiniMax H3 vs Veo 3.1, de parameters die een anime-shot bepalen
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Duur | 4 tot 15, elke hele seconde (standaard 8) | 4, 6, 8 (standaard 8) |
| Beeldverhoudingen | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Standaard verhouding (tekst-naar-video) | 1:01 | 16:09 |
| Resolutie | 768P, 2K (standaard 2K) | 720p, 1080p, 4k (standaard 720p) |
| Audio | Gezamenlijk gegenereerd, 32 kHz stereo | generate_audio, standaard false |
| Native dialoogtalen | 11 stabiel, Japans inbegrepen | Niet gepubliceerd als stabiele lijst |
| Referentiepakket | tot 9 afbeeldingen, 3 video's, 3 audioclips, 12 bestanden totaal | 3 afbeeldingen |
| Duur bij gebruik van referenties | nog steeds 4 tot 15 | stort in tot alleen 8 |
| seed | niet beschikbaar | beschikbaar |
| negative_prompt | niet beschikbaar | beschikbaar |
| Gewichten | downloadbaar | gesloten |
Duur, verhouding, resolutie, audio en referentielimieten zijn afkomstig van de live schema's op de MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video en Veo 3.1 reference-to-video pagina's. De 9-afbeeldingen- en 12-bestanden-referentieplafond en de 11-taal dialooglijst komen van de MiniMax H3 modelkaart (Hugging Face, augustus 2026).
Nu de scoreborden, want die zeggen iets anders dan het specificatieblad en beide zijn belangrijk.
Tabel 2: Crowd-vote Elo en lijstprijs per minuut, momentopname 7 augustus 2026
| Model | Tekst-naar-video (met audio) | Image-naar-video (met audio) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1.244 (#1) ±7 | 1.191 (#2) ±9 | $6,00 |
| MiniMax H3 | 1.238 (#2) ±9 | 1.190 (#3) ±10 | $7,80 |
| Dreamina Seedance 2.0 720p | 1.224 (#3) ±6 | 1.198 (#1) ±7 | $9,07 |
| Kling 3.0 1080p (Pro) | 1.111 (#7) ±6 | niet in top 10 | $20,16 |
| Veo 3.1 | 1.093 (#11) ±7 | 1.085 (#10) ±7 | $24,00 |
| Veo 3.1 Fast | 1.091 (#14) ±6 | niet in top 10 | $9,00 |
| Veo 3.1 Lite | 1.089 (#15) ±7 | niet in top 10 | $4,80 |
Elo- en prijscijfers van de Artificial Analysis Video Arena (Artificial Analysis, augustus 2026). Dit zijn doorlopende stemmen van het publiek en ze bewegen. De kolom $/min is een genormaliseerde modelschatting, niet jouw factuur.
Een Elo-kloof van 145 punten is groot, maar het is een algemene stem, geen anime-stem. En hier is het deel dat ik ronduit moet zeggen: MiniMax verkoopt H3 niet als een animemodel. Interne eerstelijnsfeedback vermeldt film, animatie en komedie-drama als de gebieden waar H3 niet op gericht is. De interessante vraag is dus niet "welke is het animemodel". Het is waarom het model dat zichzelf niet op anime verkoopt, het shot nog steeds wint, en waar Google nog steeds de ronde pakt.
Eén praktische opmerking voor de tutorial. Elk model hieronder draait via dezelfde console en dezelfde API-sleutel, wat de enige reden is dat de parameters überhaupt vergelijkbaar zijn. Zelfde wachtrij, zelfde authenticatie, één factuur. Als je GPT Image 2 op de ene service instelt en Veo op een andere, dan zijn de helft van de verschillen die je vindt infrastructuur in plaats van model.
Bouw het Shot: MiniMax H3 vs Veo 3.1, Stap voor Stap
Eén doorlopend voorbeeld, van begin tot eind. "Last Whistle": een originele tieneraanvaller, rood haar, wit en marineblauw nummer 9-tenue, schijnwerpers, een whip pan op de trap, en een Japanse titelkaart die in de laatste twee seconden moet landen en stabiel moet blijven.
Geen echte speler, geen officieel personage, geen bestaande anime-IP. Alleen stijl en hommage. Meer over waarom over een moment.
Stap 1: Ontwerp het anime-keyframe met GPT Image 2
Het keyframe draagt de artistieke richting, zodat het videomodel het niet hoeft te verzinnen. Let op de negatieve ruimte op de linkerderde: die is bewust. De titelkaart wordt daar door het videomodel geschreven, en dat is de tekststabiliteitstest.
Plain1Een enkel frame uit een moderne shonen sport-anime. Cel-shaded 2D-animatie, met de hand 2geïnkte lijnvoering met consistente lijndikte, platte kleurvullingen, harde grafische 3schaduwen, absoluut geen 3D-schaduw en geen fotorealistische huid. Close-up van een 4originele tieneraanvaller: rommelig donkerrood haar, wit-en-marineblauw tenue met nummer 59, zweet- en grasstrepen over één wang, ogen wijd van uitgeputte vastberadenheid, mond 6open midden in een schreeuw. Achter hem branden stadionlampen in een muur van wazige 7publiekskleuren; radiale snelheidslijnen barsten uit het midden van het frame; één 8grasspriet hangt bevroren in de lucht. Verzadigd palet, diep cyaan schaduwen, warme 9oranje omranding. 16:9 compositie, het personage rechts van het midden geplaatst, schone 10negatieve ruimte op de linkerderde. Geen tekst ergens in de afbeelding.
Instellingen: model openai/gpt-image-2/text-to-image, kwaliteit high, grootte 16:9 (2048x1152). Verder niets.

GPT Image 2-playground op Atlas Cloud met de Last Whistle keyframe-prompt en het voltooide animeframe in het uitvoerpaneel
GPT Image 2 op Atlas Cloud: kwaliteit ingesteld op high, het voltooide keyframe aan de rechterkant.

Het basis anime-keyframe: een originele roodharige aanvaller midden in een schreeuw onder stadionlampen, cel-shaded met platte kleur en snelheidslijnen
Het keyframe dat beide modellen ontvangen. Platte kleur, harde schaduwen en een lege linkerderde die wacht op een titelkaart.
Stap 2: MiniMax H3 image-to-video, alles gemaximaliseerd
Zelfde afbeelding erin, 2K eruit. Ik hield H3 hier op 8 seconden alleen om het plafond van Veo te evenaren. Dat is niet H3's limiet en Stap 4 haalt de grens eraf.
Plain1Cel-shaded 2D-anime, met de hand geïnkte lijnvoering, platte kleur, geen 3D-schaduw. 2Blijf één tel op het gezicht van de aanvaller, dan een gewelddadige whip pan die de bal 3volgt terwijl hij trapt, de pan vervaagt het frame in gestreepte sakuga-bewegingssporen. 4Eén frame van totale stilte bij impact. Gedurende de laatste twee seconden verschijnt 5vette witte Japanse titellettering die ラストホイッスル leest, op de linkerderde van het 6frame en blijft rotsvast staan, geen vervorming, geen flikkering, geen verschuiving. De 7aanvaller schreeuwt één regel in het Japans: 「まだ終わってない!」. Audio: stadion 8lawaai zwelt aan, één scherpe bal-impact, een lage taiko-slag onder de titelkaart.
Instellingen: model minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video neemt de framevorm van je invoerafbeelding), image = de uitvoer van Stap 1.
Eén waarschuwing als je in plaats daarvan naar tekst-naar-video gaat: schrijf expliciet ratio: 16:9. De standaard is 1:1 en het geeft je gewillig een vierkante anime-crop.

MiniMax H3 image-to-video-playground op Atlas Cloud met de Last Whistle-prompt, keyframe geladen en de voltooide clip in het uitvoerpaneel
MiniMax H3 image-to-video op Atlas Cloud: het keyframe van Stap 1 geladen aan de linkerkant, de voltooide clip aan de rechterkant.
Stap 3: Veo 3.1 image-to-video, audio handmatig ingeschakeld
De prompt is identiek, woord voor woord. Verander een enkel bijvoeglijk naamwoord en het is geen vergelijking meer. Wat verandert, is het extra veld dat Veo je geeft en H3 niet.
negative_prompt, wat voor 2D-anime de meest nuttige controle op deze lijst is:
Plain13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
Instellingen: model google/veo3.1/image-to-video, resolution: 1080p (wijzig het, de standaard is 720p), duration: 8 (dit is het plafond), aspect_ratio: 16:9, generate_audio: true (de API-standaard is false, dit is de valkuil voor stille clips), seed: 20260807, image = dezelfde uitvoer van Stap 1.

Veo 3.1 image-to-video-playground op Atlas Cloud met generate audio ingeschakeld, het anime-keyframe geladen en de voltooide clip in het uitvoerpaneel
Veo 3.1 image-to-video op Atlas Cloud, met Generate Audio ingeschakeld en de voltooide clip aan de rechterkant.
Stap 4: Score het op vijf anime-specifieke assen
Niets te genereren. Kijk gewoon, naar de dingen waar anime echt op breekt. Beide clips zijn ingebed bovenaan dit artikel, dus je kunt ze zelf scoren in plaats van mijn woord aan te nemen.

Naast elkaar van het laatste frame van beide clips, MiniMax H3 links met schone Japanse titellettering, Veo 3.1 rechts met onleesbare verticale karakters
Het laatste frame van elke clip. Links schreef H3 ラストホイッスル, alle acht katakana correct en rotsvast. Rechts produceerde Veo 3.1 drie karakters die niet het gevraagde woord zijn en ook geen woord vormen.
De titelkaart is waar de ronde werd beslist, en het was niet close. H3 gaf de gevraagde katakana exact weer, hard en stabiel, over een uitgesmeerde pan van het doelmond. Veo 3.1 produceerde een verticale stapel van drie karakters die noch het gevraagde woord noch een woord zijn. Op hetzelfde frame liet het ook het personage uit beeld vallen en liet de achtergrond naar semi-fotorealistische stadionplaat glijden, ondanks photorealistic skin en 3D render in de negatieve prompt.
Tabel 3: vijf assen die een anime-crop bepalen, van deze twee runs
| As | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Continutieit van personage vanuit keyframe | Hield het exacte gezicht, haar en tenue gedurende de volledige 8 seconden | Tekende het personage opnieuw in een nieuw wijds shot, modelgetrouw maar een andere tekening |
| Lijnvoering en platte cel-schaduw | Hield, geen drift naar 3D | Hield in het midden shot, dreef tegen het einde naar een fotografische stadionplaat |
| Japanse titelkaart | ラストホイッスル correct weergegeven en stabiel gehouden | Drie karakters, niet het gevraagde woord, geen woord |
| Geleverde audiotrack | 32 kHz stereo, exact zoals de modelkaart vermeld | 48 kHz stereo, alleen aanwezig omdat ik generate_audio zelf had ingesteld |
| Whip pan en sakuga-smear | Uitgevoerd als een uitgesmeerde pan naar de titel | Vervangen door een harde cut naar een nieuwe opstelling |
Die laatste rij is de luidruchtigste publieke kritiek op H3 tot nu toe, en dat is precies waarom ik het in beide prompts heb geschreven. Op de dag-0 ComfyUI-thread klaagde gebruiker fwip dat zelfs de officiële demo-prompts werden genegeerd: "a violent WHIP PAN off the rooftop that SMEARS the floating words away with it, motion-streaked. And the video just didn't do any of that transition at all, it just replaced it with a cut."
In deze run was het Veo die de pan voor een cut verwisselde, en H3 die smeerde. Eén take per stuk is geen oordeel, en ik zou niet anders beweren. Maar het betekent wel dat de kritiek niet H3-specifiek is: whip-pans zijn de minst betrouwbare instructie in deze hele test aan beide kanten. Als je storyboard ervan afhangt, storyboard er dan omheen in plaats van erdoorheen.
Stap 5: De 4:3 retro OVA cut die Veo 3.1 structureel niet kan uitvoeren
Dit is geen kwaliteitsvoorkeur. Het is een muur. Veo's aspect_ratio-enumeratie heeft twee waarden en geen van beide is 4:3, en de duration-enumeratie heeft geen 12. De 90s OVA-look is simpelweg niet bereikbaar.
Plain1Een anime-crop uit de jaren 90 OVA, 4:3 full-frame. Met de hand geschilderde 2achtergrondkunst met zichtbare penseeltextuur, cel-verf personages met dikke ongelijke 3inktlijnen, zware halatiegloed rond de schijnwerpers, 16mm-filmkorrel en vage 4poortbeweging. Dezelfde roodharige aanvaller in een wit-en-marineblauw nummer 9-tenue 5loopt van een regenachtig veld terwijl het publieksgeluid vervaagt tot een enkele 6rinkende toon. Camera duwt langzaam in op zijn gezicht. Hij zegt zachtjes in het Japans: 7「次は、勝つ」. Retro palet: gedempt groenblauw, stoffig amber, diep kastanjebruin 8schaduwen. Audio: verre regen, een eenzame analoge synthpad, één fluitje met veel galm 9in de verte.
Instellingen: model minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Stel die verhouding handmatig in, onthoud de standaard.

MiniMax H3 tekst-naar-video-playground op Atlas Cloud met de OVA-prompt ingetypt en de voltooide retro clip in het uitvoerpaneel
MiniMax H3 tekst-naar-video op Atlas Cloud, OVA-prompt ingetypt, clip voltooid. Volledige openheid: deze specifieke run liet Aspect Ratio op 16:9 en Duration op 8, dus wat je aan de rechterkant ziet is de breedbeeld korte versie. De 4:3 twaalf-seconden crop hieronder kwam van de API-aanroep met ratio: 4:3 en duration: 12 expliciet ingesteld.

De 4:3 retro OVA-crop: dezelfde aanvaller loopt van een regenachtig veld in 90s anime-stijl
H3 tekst-naar-video, 4:3, 12 seconden. Het geleverde bestand kwam terug als 1920x1440, wat tot de pixel 4:3 is, met een 32 kHz stereo track. Hier getoond als een stille GIF met verminderde framerate om de pagina licht te houden. Gegenereerd met minimax/h3/text-to-video op Atlas Cloud.
Stap 6: Negen referentieafbeeldingen, één personage, vier cuts
Cross-shot personageconsistentie is het moeilijkste probleem in AI-anime, en het wordt opgelost met referentievolume. Bouw eerst het pakket: voer de prompt van Stap 1 opnieuw uit met de kadrering gewisseld voor vooraan, driekwart, volledig profiel, achterkant, lachend, opeengeklemde tanden, volledige lichaamsstand, kitdetail en schoendetail. Negen afbeeldingen, ongeveer acht cent in totaal.

Vier hoeken van hetzelfde originele aanvallerspersonage gegenereerd als een referentiepakket, gerangschikt in een twee bij twee raster
Vier van de negen referentiehoeken. H3 accepteert tot negen afbeeldingen in één referentiepakket, plus video- en audioreferenties erbovenop.
Plain1Cel-shaded 2D-anime, consistente met de hand geïnkte lijnvoering, platte kleur, geen 23D-schaduw. Houd het gerefereerde aanvallersgezicht, haarsilhouet en nummer 9-tenue 3identiek in elke cut. Vier cuts in één doorlopende take: (1) lage hoek inzoom op zijn 4schoenen die het gras raken, (2) whip-pan omhoog naar een strakke close-up van zijn ogen, 5(3) wijds shot van hem sprintend langs drie verdedigers getekend als vage silhouetten, (4) 6bevries op een kopbal in de lucht, snelheidslijnen exploderen naar buiten. Audio: 7publiekslawaai, ademhaling, schoen-op-gras impact, één taiko-slag bij de bevriezing.
Instellingen: model minimax/h3/reference-to-video, refers = jouw afbeeldingen met type: image, resolution: 2K, duration: 8 of hoger, ratio: adaptive of 16:9.
Het Veo 3.1-equivalent kan niet worden uitgevoerd met deze instellingen en je hoeft het niet te proberen om te weten waarom. Het referentie-eindpunt accepteert maximaal drie afbeeldingen, en het kiezen van dat eindpunt stort duration in tot een enkele legale waarde van 8. Een negen-afbeeldingenpakket en een 10-seconden take zijn beide buiten bereik.

MiniMax H3 reference-to-video-playground op Atlas Cloud met de referentieteller op vier van negen en de eerste cut in het uitvoerpaneel
MiniMax H3 reference-to-video op Atlas Cloud. De teller geeft Reference Materials (4/9) aan met MAX:9 eronder, wat het plafond in de interface is in plaats van een claim van een specificatieblad. Uitvoer is cut één, de lage hoek inzoom op de schoenen.
Vier Meer MiniMax H3 Anime Video Generator Runs Die Het Doen
Het Last Whistle-shot belast slechts vier van de verschillen. Deze vier belasten de rest. Ze draaien allemaal op H3; de notities geven aan welke Veo 3.1 kan evenaren.
- Ultrawide sakuga-gevecht,
21:9, 10 seconden. Veo kan helemaal geen 21:9 uitvoeren.
Plain1Cel-shaded 2D-anime actie, dikke taps toelopende inktlijnen, platte kleur, harde 2schaduwen, geen 3D-schaduw. Twee originele gemaskerde duellisten op een winderig 3tempeldak bij zonsondergang. Zwaardclash, het frame schudt, beide vechters breken uit 4elkaar in een uitbarsting van handgetekende impactframes en radiale snelheidslijnen. 5Camera: lage hoek inzoom, dan een laterale track, dan een snap naar een wijd silhouet 6tegen de oranje lucht. Audio: twee scherpe metaalclashes, stofsnap, een lage taiko-slag 7bij de laatste bevriezing, geen muziek.
- Beat-gesynchroniseerde AMV-cut, reference-to-video met een audioreferentie. H3 neemt tot drie audioclips als referentie-invoer. Veo 3.1 heeft helemaal geen audio-invoer, alleen audio-uitvoer.
Plain1Cel-shaded 2D-anime montage gesneden op de gerefereerde audiotrack. Vijf korte beats: 2regen op een raam, een hand die een verband strakker trekt, een stadsgezicht dat langs 3een treinraam flitst, een sprintstart, een bevriezing op een uitgestrekte hand. Elke cut 4landt exact op een downbeat van de gerefereerde audio. Platte kleur, dikke inktlijnen, 5hoogcontrast nachtpalet van diep indigo en neon magenta.
- Tweeregelige Japanse dialoogscène, 12 seconden. Dit is de lip-sync-stresstest, en 12 seconden ligt al buiten Veo's bereik.
Plain1Cel-shaded 2D-anime, platte kleur, geen 3D-schaduw. Twee originele personages op een dak 2tijdens het gouden uur, shot reverse shot. Eerste zegt in het Japans:「本当に行くの?」. 3De tweede antwoordt, half glimlachend, in het Japans:「もう決めた」. Mondbewegingen 4matchen elke lettergreep. Warme omranding, lange schaduwen, zachte wind in het haar. 5Audio: twee duidelijke Japanse stemmen, ver verkeer, één cicade.
- Verticale shonen-kort,
9:16, 8 seconden. Beide modellen kunnen verticaal, dus dit is de enige plek om ze daadwerkelijk te A/B-testen in plaats van aan te nemen.
Plain1Cel-shaded 2D-anime, verticale compositie. Een originele tienerloopster barst door een 2papieren spandoek in slow-motion, dan klikt het frame terug naar volle snelheid terwijl 3ze versnelt over een stadionrechte. Snelheidslijnen, platte kleur, harde schaduwen, 4vette grafische lucht. Camera: lage hoek volgshot, dan een whip omhoog naar haar gezicht. 5Audio: spandoekscheur, publieksgolf, één ingehouden adem dan losgelaten.
Als je de promptgrammatica achter deze wilt, de MiniMax H3 promptgids gaat dieper in op hoe H3 camera- en audio-instructies parseert dan ik hier kan.
Wat een 60-Seconden Anime-Opening Kost op MiniMax H3 vs Veo 3.1
Een standaard anime-OP is ongeveer 90 seconden. Noem het acht shots van 8 seconden, 64 seconden voltooide video, plus één keyframe per shot voor $0,009 per stuk.
Er is een echt prijsverschil dat je moet weten in plaats van dat ik het gladstrijk. De Atlas Cloud-catalogus vermeldt MiniMax H3 voor $0,10 per seconde vast, terwijl de model-readme het uitsplitst als $0,14/s op 2K en $0,10/s op 768P. Veo 3.1 wordt vermeld voor $0,20 per seconde, terwijl de readme $0,40/s met audio scheidt van $0,20/s zonder.
De run-knoppen in mijn screenshots bevestigen het. H3 reference-to-video, 8 seconden op 2K, gaf Run $1,12 aan, wat exact $0,14 per seconde is. Veo 3.1 image-to-video, 8 seconden op 1080p met audio aan, gaf Run $3,2 aan, wat exact $0,40 per seconde is. Dus de readme-tarieven zijn de tarieven die in rekening worden gebracht, en de cataloguskop is de instapdrempel. Ik heb beide aflezingen hieronder toch weergegeven. Dit zijn catalogusprijzen per augustus 2026.
Tabel 4: acht shots van 8 seconden, keyframes inbegrepen
| Setup | Videokosten (catalogustarief) | Videokosten (readme-tarief) | Keyframes | Totale range |
|---|---|---|---|---|
| MiniMax H3, 2K | $6,40 | $8,96 | $0,07 | $6,47 tot $9,03 |
| MiniMax H3, 768P | $6,40 | $6,40 | $0,07 | $6,47 |
| Veo 3.1, 1080p met audio | $12,80 | $25,60 | $0,07 | $12,87 tot $25,67 |
| Veo 3.1 Lite, 720p | $3,20 | $3,20 | $0,07 | $3,27 |
Prijzen afkomstig van de Atlas Cloud-modelpagina's gelinkt in Tabel 1, augustus 2026. Geen van deze vier is momenteel afgeprijsd.
Twee dingen die die tabel niet bevat, en beide raken harder dan het per-seconde tarief.
Herkansingen. Niemand levert de eerste take van een anime-shot. Welke vermenigvuldiger je ook aanneemt, pas deze toe op beide kolommen en de kloof wordt groter in dezelfde verhouding.
Kloktijd, en deze gaat de andere kant op. Getimed van begin tot eind op 7 augustus 2026: H3 op 2K voor 8 seconden duurde 447 seconden, ongeveer 7,5 minuten. H3 tekst-naar-video op 2K voor 12 seconden duurde 334 seconden. Veo 3.1 op 1080p voor 8 seconden met audio duurde 152 seconden, minder dan drie minuten. Veo is hier ongeveer drie keer sneller naar een eerste take, en als je om 2 uur 's nachts aan een shot werkt, is dat echt geld waard. Wachtrijen bewegen, dus behandel dit als een momentopname van één middag in plaats van een specificatie. Maar iedereen die "2 tot 3 minuten" citeert voor H3 op 2K, citeert een readme, geen wachtrij. De 2K versus 768P uitsplitsing behandelt wanneer de hogere laag de extra minuten waard is.
Animes Stijl, Hommage en Wat Je Werkelijk Kunt Publiceren
Alles in dit artikel is stijl en hommage. Een origineel personage, een origineel tenue, een originele titel. Geen officieel anime-personage is gegenereerd of aangevraagd, en geen echte voetballersnaam of gelijkenis is gebruikt. De WK-trend wordt gerefereerd als een format, omdat dat is waarvoor het nuttig is.
Dat onderscheid is geen decoratie. Als je commercieel anime-achtige inhoud produceert, zijn "in de stijl van 90s OVA" en "dit specifieke personage uit deze specifieke show" verschillende juridische objecten, en slechts één ervan is een bedrijf.
Over de open gewichten: H3 is echt downloadbaar, en mensen draaiden het op dag één. Eén commentator meldde 10 minuten voor een 10-seconden 480p-clip op een 4070 Ti Super met 16GB, en anderen plaatsten 3 minuten op een 5080 en 68 seconden op een RTX 6000 Pro. Maar zelfhosten draait op een 768 korte rand; de Context-IR en Regenerate-2K-fasen die 2K produceren, blijven aan de API-kant.
De licentie heeft een echte valkuil. De communitylicentie dekt momenteel niet de EU, het VK, Zuid-Korea of de Verenigde Staten, met verwijzing naar regio's die "momenteel AI-gerelateerde regelgeving ontwikkelen of handhaven". Een formeel licentieverzoekkanaal is open, wat een HN-commentator samenvatte als "je moet gewoon pinkie beloven dat je Disney niet kwaad maakt en ze sturen je een licentie". Grappig, en ook precies de nalevingsstap die je niet kunt overslaan als je in een van die vier gebieden bent. De open gewichten uiteenzetting heeft de volledige gebiedslijst.
Veelgestelde Vragen
Is MiniMax H3 een goede anime-videogenerator vergeleken met Veo 3.1?
Voor de meeste anime-werk, H3, en vooral om redenen die niet over weergave gaan. Het draait 4 tot 15 seconden tegen Veo's 4, 6 of 8, het biedt zes beeldverhoudingen inclusief 4:3 en 21:9 tegen Veo's twee, het vermeldt Japans onder 11 native stabiele dialoogtalen, en het neemt negen referentieafbeeldingen tegen Veo's drie. Veo 3.1 wint in één specifieke situatie: wanneer je seed nodig hebt voor reproduceerbare herkansingen, of negative_prompt om te voorkomen dat een shot naar 3D-rendershaduw afdrijft. H3 heeft geen van beide parameters. Als jouw pijplijn van een van beide afhangt, is dat een echte reden om te blijven.
Kan Veo 3.1 anime genereren in 4:3 of een 15-seconden clip?
Nee, en niet om stilistische redenen. Veo 3.1's aspect_ratio-enumeratie bevat exact 16:9 en 9:16, en de duration-enumeratie bevat exact 4, 6 en 8. Er is geen 4:3-waarde om te selecteren en geen manier om 12 of 15 seconden aan te vragen. Als jouw referentie een 90s TV-anime of OVA is, is de kadrering buiten bereik op Veo en beschikbaar op H3.
Waarom kwam mijn Veo 3.1 anime-clip stil terug?
Omdat generate_audio standaard false is op de API. De playgound-schakelaar staat meestal al aan, dus dit treft alleen mensen die de API direct aanroepen. Stel expliciet generate_audio: true in. Terwijl je bezig bent, stel ook resolution in, want het standaard naar 720p in plaats van de 1080p of 4k die je waarschijnlijk bedoelde.
Doet MiniMax H3 Japanse dialoog en lip-sync voor anime?
Ja. De modelkaart vermeldt 11 talen met stabiele dialoogondersteuning: Arabisch, Chinees, Engels, Frans, Duits, Italiaans, Japans, Koreaans, Portugees, Russisch en Spaans. Audio wordt gezamenlijk gegenereerd met het beeld op 32 kHz stereo in plaats van achteraf nagesynchroniseerd, daarom blijft de mondtiming over een hele regel in plaats van alleen de eerste paar lettergrepen. Schrijf de Japanse regel direct in de prompt in het Japans.
Hoeveel referentieafbeeldingen kan ik gebruiken om een anime-personage consistent te houden?
MiniMax H3 accepteert tot 9 afbeeldingen, tot 3 videoclips en tot 3 audioclips, met een hard plafond van 12 bestanden over alle typen. Veo 3.1's reference-to-video-eindpunt accepteert 1 tot 3 afbeeldingen, en het selecteren ervan stort duration in tot 8 als de enige legale waarde. Voor een terugkerend anime-personage in een serie is dat verschil het hele spel.
MiniMax H3 heeft open gewichten, dus kan ik mijn anime-pijplijn lokaal voor niets draaien?
Je kunt het downloaden en draaien, met drie kanttekeningen. Zelfgehoste inferentie draait op een 768 korte rand, en de Context-IR- en Regenerate-2K-fasen die 2K produceren, blijven aan de API-kant. Real-world lokale snelheden variëren sterk per kaart: ongeveer 10 minuten voor een 10-seconden 480p-clip op een 4070 Ti Super, ongeveer 3 minuten op een 5080, ongeveer 68 seconden op een RTX 6000 Pro, volgens de dag-0 ComfyUI-thread. En de communitylicentie dekt momenteel niet de EU, het VK, Zuid-Korea of de VS, dus als je in een van die bent, heb je de formele licentie nodig voor commercieel gebruik.






