Seedance 2.0 Mini & Fast API tegen de laagste prijzen wereldwijd — tot 68% korting op de officiële prijs

MiniMax H3 Anime Video Generator: 15 seconden, 4:3, en de titelkaart die Veo 3.1 verknoeide

MiniMax H3 anime video generator versus Veo 3.1 op dezelfde keyframe. H3 draait 4 tot 15 seconden en zes verhoudingen, Veo beperkt tot 8 seconden en twee. Japanse dialoog, 9 referenties, echte runs.

De hele zomer stond mijn feed op repeat met dezelfde video. WK-spelers hertekend als shonen-hoofdpersonages. Een dictator. Een piratenkapitein. Een norse mentor die in de laatste vier seconden opduikt. Miljoenen views per post, en het verhaal wordt na bijna elke wedstrijd bijgewerkt.

Niemand die dit maakt, schrijft benchmarkposts. Ze kiezen een model, verbranden credits en publiceren voor de volgende aftrap.

Dus ik nam één anime-keyframe en één prompt, en testte MiniMax H3 als anime-videogenerator tegen Veo 3.1, beide op hun maximale instellingen met identieke invoer.

Het eerste dat brak, was niet de beeldkwaliteit. Het was een dropdown. Veo 3.1 stopt bij 8 seconden en biedt precies twee beeldverhoudingen. Een shot dat op een gezicht blijft hangen, met de bal meezwaait en dan een titelkaart laat landen, past niet in 8 seconden. Het kreeg nooit de kans om te falen op kwaliteit.

Belangrijkste conclusies

  • Veo 3.1's duration-enumeratie is [4, 6, 8] en de aspect_ratio-enumeratie is [16:9, 9:16]. MiniMax H3 draait elke hele seconde van 4 tot 15 en biedt 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Geen 4:3 op Veo betekent geen retro OVA-framing, helemaal niet.
  • H3's modelkaart vermeldt 11 native stabiele dialoogtalen, waaronder Japans. Audio en beeld worden samen gegenereerd op 32 kHz stereo, niet achteraf nagesynchroniseerd.
  • Referentiepakketten zijn niet vergelijkbaar: H3 neemt tot 9 afbeeldingen plus tot 3 video's en 3 audioclips (maximaal 12 bestanden). Veo 3.1's referentie-eindpunt neemt 3 afbeeldingen, en zodra je het gebruikt, stort duration in tot alleen [8].
  • Twee valkuilen die tests stilletjes verpesten: Veo's API standaard generate_audio naar false en resolution naar 720p, en H3's tekst-naar-video ratio standaard 1:1. Laat die met rust en je vergelijkt een stille 720p-clip met een vierkante.
  • Veo 3.1 houdt twee dingen die H3 helemaal niet heeft: seed en negative_prompt. Voor 2D-anime is dat tweede echt belangrijk, en ik zal laten zien waar.

MiniMax H3 Anime Video Generator vs Veo 3.1, Hetzelfde Frame Naast Elkaar

Eén origineel personage. Eén keyframe. Eén prompt, letterlijk gekopieerd in beide modellen. Al het andere gemaximaliseerd aan elke kant.

MiniMax H3, image-to-video, 2K, 8 seconden, native audio. Zet het geluid aan: het publieksgeruis, de balstoot en de Japanse schreeuw worden in dezelfde pas gegenereerd als het beeld. Gegenereerd met minimax/h3/image-to-video op Atlas Cloud.

Veo 3.1, image-to-video, 1080p, 8 seconden, generateaudio handmatig ingeschakeld, plus een negativeprompt die de lijntekening vlak houdt. Hetzelfde eerste frame, dezelfde woorden. Gegenereerd met google/veo3.1/image-to-video op Atlas Cloud.

Beide tekenen prachtig. Veo's wijde shot van de trap, met handgetekende impactlijnen en een manga-geluidseffect dat in de lucht zweeft, is echt mooi. Dat is het eerlijke beginpunt, en het is waarom de rest van dit artikel over parameters en instructieopvolging gaat in plaats van over sferen.

Waarom de Meeste MiniMax H3 Anime Video Generator Tests vs Veo 3.1 Fout Gaan

Er gebeurden deze zomer twee dingen tegelijk.

Anime werd het hoogste volumeformaat in AI-video. Het WK 2026 werd herschreven als een shonentoernooi, met spelers gecast als een dictator, een piratenkapitein, een mariniergeneraal en een mentor, en verhaallijnen die "na bijna elke wedstrijd evolueren" op TikTok, Instagram, X en YouTube (Complex, juli 2026).

En MiniMax H3 werd uitgebracht met open gewichten. De dag-0 ComfyUI-thread haalde 330 punten en 95 reacties, met mensen die binnen enkele uren echte lokale cijfers postten (Hacker News, augustus 2026).

Zet die twee samen en je zou een stapel anime-vergelijkingen verwachten. Die zijn er bijna niet, omdat de meeste tests op een van vier manieren verkeerd worden opgebouwd.

Ze vergelijken plaatjes, niet beperkingen. Anime-shots gaan over timing. Een whip pan naar een titelkaart is een duurprobleem voordat het een weergaveprobleem is.

Ze vergeten dat Veo's API standaard stil is. Op de API is generate_audio false en resolution 720p. Heel wat "Veo heeft geen audio in anime"-posts komen gewoon van iemand die nooit een boolean heeft omgezet.

Ze vergeten dat H3's tekst-naar-video standaard vierkant is. ratio standaard naar 1:1, niet 16:9. Voer een t2v anime-prompt uit zonder het in te stellen en je krijgt een vierkante clip en een verwarde conclusie.

Ze testen met fotorealistische prompts. "Cinematographic, volumetric light, shallow depth of field" is precies de woordenschat die een 2D-model naar 3D-rendershaduw trekt. De faalmodus in anime is niet wazig. Het is plastic.

De drie instellingen die een anime-test bepalen voordat je op start drukt

Stel deze aan beide kanten in voordat je iets anders doet, anders is de vergelijking ongeldig.

InstellingMiniMax H3Veo 3.1Wat gebeurt er als je het overslaat
AudioGegenereerd met het beeld, altijd aangenerate_audio standaard falseVeo geeft een stille clip terug en ziet er slechter uit dan het is
Beeldverhoudingratio standaard 1:1 bij tekst-naar-videoaspect_ratio standaard 16:9H3 geeft je een vierkante anime-crop die je niet kunt gebruiken
Resolutiestandaard 2Kstandaard 720pJe vergelijkt 2K met 720p en noemt het een kwaliteitsverschil

Wil je MiniMax H3 en Veo 3.1 zelf testen op dezelfde anime-prompt? Atlas Cloud's modelvergelijking draait ze naast elkaar in één keer — dezelfde prompt en instellingen, kosten getoond voordat je genereert.

MiniMax H3 en Veo 3.1 op dezelfde anime-prompt in Atlas Cloud's modelvergelijking — dezelfde instellingen, prijs getoond voordat je genereert. Live vastgelegd op de model-explorer

MiniMax H3 en Veo 3.1 op dezelfde anime-prompt in Atlas Cloud's modelvergelijking — dezelfde instellingen, prijs getoond voordat je genereert. Live vastgelegd op de model-explorer.

De MiniMax H3 vs Veo 3.1 Anime Specificatieblad: Lengte, Verhouding, Audio, Referenties

Ik heb de live invoerschema's van beide modellen opgehaald in plaats van een lanceringpost te vertrouwen. Elke waarde hieronder is een enumeratie die je zelf kunt lezen op de modelpagina's, geen indruk.

Tabel 1: MiniMax H3 vs Veo 3.1, de parameters die een anime-shot bepalen

MiniMax H3Veo 3.1
Duur4 tot 15, elke hele seconde (standaard 8)4, 6, 8 (standaard 8)
Beeldverhoudingen21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
Standaard verhouding (tekst-naar-video)1:0116:09
Resolutie768P, 2K (standaard 2K)720p, 1080p, 4k (standaard 720p)
AudioGezamenlijk gegenereerd, 32 kHz stereogenerate_audio, standaard false
Native dialoogtalen11 stabiel, Japans inbegrepenNiet gepubliceerd als stabiele lijst
Referentiepakkettot 9 afbeeldingen, 3 video's, 3 audioclips, 12 bestanden totaal3 afbeeldingen
Duur bij gebruik van referentiesnog steeds 4 tot 15stort in tot alleen 8
seedniet beschikbaarbeschikbaar
negative_promptniet beschikbaarbeschikbaar
Gewichtendownloadbaargesloten

Duur, verhouding, resolutie, audio en referentielimieten zijn afkomstig van de live schema's op de MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video en Veo 3.1 reference-to-video pagina's. De 9-afbeeldingen- en 12-bestanden-referentieplafond en de 11-taal dialooglijst komen van de MiniMax H3 modelkaart (Hugging Face, augustus 2026).

Nu de scoreborden, want die zeggen iets anders dan het specificatieblad en beide zijn belangrijk.

Tabel 2: Crowd-vote Elo en lijstprijs per minuut, momentopname 7 augustus 2026

ModelTekst-naar-video (met audio)Image-naar-video (met audio)$/min
Gemini Omni Flash1.244 (#1) ±71.191 (#2) ±9$6,00
MiniMax H31.238 (#2) ±91.190 (#3) ±10$7,80
Dreamina Seedance 2.0 720p1.224 (#3) ±61.198 (#1) ±7$9,07
Kling 3.0 1080p (Pro)1.111 (#7) ±6niet in top 10$20,16
Veo 3.11.093 (#11) ±71.085 (#10) ±7$24,00
Veo 3.1 Fast1.091 (#14) ±6niet in top 10$9,00
Veo 3.1 Lite1.089 (#15) ±7niet in top 10$4,80

Elo- en prijscijfers van de Artificial Analysis Video Arena (Artificial Analysis, augustus 2026). Dit zijn doorlopende stemmen van het publiek en ze bewegen. De kolom $/min is een genormaliseerde modelschatting, niet jouw factuur.

Een Elo-kloof van 145 punten is groot, maar het is een algemene stem, geen anime-stem. En hier is het deel dat ik ronduit moet zeggen: MiniMax verkoopt H3 niet als een animemodel. Interne eerstelijnsfeedback vermeldt film, animatie en komedie-drama als de gebieden waar H3 niet op gericht is. De interessante vraag is dus niet "welke is het animemodel". Het is waarom het model dat zichzelf niet op anime verkoopt, het shot nog steeds wint, en waar Google nog steeds de ronde pakt.

Eén praktische opmerking voor de tutorial. Elk model hieronder draait via dezelfde console en dezelfde API-sleutel, wat de enige reden is dat de parameters überhaupt vergelijkbaar zijn. Zelfde wachtrij, zelfde authenticatie, één factuur. Als je GPT Image 2 op de ene service instelt en Veo op een andere, dan zijn de helft van de verschillen die je vindt infrastructuur in plaats van model.

Bouw het Shot: MiniMax H3 vs Veo 3.1, Stap voor Stap

Eén doorlopend voorbeeld, van begin tot eind. "Last Whistle": een originele tieneraanvaller, rood haar, wit en marineblauw nummer 9-tenue, schijnwerpers, een whip pan op de trap, en een Japanse titelkaart die in de laatste twee seconden moet landen en stabiel moet blijven.

Geen echte speler, geen officieel personage, geen bestaande anime-IP. Alleen stijl en hommage. Meer over waarom over een moment.

Stap 1: Ontwerp het anime-keyframe met GPT Image 2

Het keyframe draagt de artistieke richting, zodat het videomodel het niet hoeft te verzinnen. Let op de negatieve ruimte op de linkerderde: die is bewust. De titelkaart wordt daar door het videomodel geschreven, en dat is de tekststabiliteitstest.

Plain
1Een enkel frame uit een moderne shonen sport-anime. Cel-shaded 2D-animatie, met de hand
2geïnkte lijnvoering met consistente lijndikte, platte kleurvullingen, harde grafische
3schaduwen, absoluut geen 3D-schaduw en geen fotorealistische huid. Close-up van een
4originele tieneraanvaller: rommelig donkerrood haar, wit-en-marineblauw tenue met nummer
59, zweet- en grasstrepen over één wang, ogen wijd van uitgeputte vastberadenheid, mond
6open midden in een schreeuw. Achter hem branden stadionlampen in een muur van wazige
7publiekskleuren; radiale snelheidslijnen barsten uit het midden van het frame; één
8grasspriet hangt bevroren in de lucht. Verzadigd palet, diep cyaan schaduwen, warme
9oranje omranding. 16:9 compositie, het personage rechts van het midden geplaatst, schone
10negatieve ruimte op de linkerderde. Geen tekst ergens in de afbeelding.

Instellingen: model openai/gpt-image-2/text-to-image, kwaliteit high, grootte 16:9 (2048x1152). Verder niets.

AI-afbeeldingengeneratorinterface met prompt en gegenereerde anime-voetbalspeler

GPT Image 2-playground op Atlas Cloud met de Last Whistle keyframe-prompt en het voltooide animeframe in het uitvoerpaneel

GPT Image 2 op Atlas Cloud: kwaliteit ingesteld op high, het voltooide keyframe aan de rechterkant.

Roodharige anime-voetbalspeler die schreeuwt in een vol stadion

Het basis anime-keyframe: een originele roodharige aanvaller midden in een schreeuw onder stadionlampen, cel-shaded met platte kleur en snelheidslijnen

Het keyframe dat beide modellen ontvangen. Platte kleur, harde schaduwen en een lege linkerderde die wacht op een titelkaart.

Stap 2: MiniMax H3 image-to-video, alles gemaximaliseerd

Zelfde afbeelding erin, 2K eruit. Ik hield H3 hier op 8 seconden alleen om het plafond van Veo te evenaren. Dat is niet H3's limiet en Stap 4 haalt de grens eraf.

Plain
1Cel-shaded 2D-anime, met de hand geïnkte lijnvoering, platte kleur, geen 3D-schaduw.
2Blijf één tel op het gezicht van de aanvaller, dan een gewelddadige whip pan die de bal
3volgt terwijl hij trapt, de pan vervaagt het frame in gestreepte sakuga-bewegingssporen.
4Eén frame van totale stilte bij impact. Gedurende de laatste twee seconden verschijnt
5vette witte Japanse titellettering die ラストホイッスル leest, op de linkerderde van het
6frame en blijft rotsvast staan, geen vervorming, geen flikkering, geen verschuiving. De
7aanvaller schreeuwt één regel in het Japans: 「まだ終わってない!」. Audio: stadion
8lawaai zwelt aan, één scherpe bal-impact, een lage taiko-slag onder de titelkaart.

Instellingen: model minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video neemt de framevorm van je invoerafbeelding), image = de uitvoer van Stap 1.

Eén waarschuwing als je in plaats daarvan naar tekst-naar-video gaat: schrijf expliciet ratio: 16:9. De standaard is 1:1 en het geeft je gewillig een vierkante anime-crop.

AI-videogeneratorinterface met tekstprompt en gegenereerde anime-video

MiniMax H3 image-to-video-playground op Atlas Cloud met de Last Whistle-prompt, keyframe geladen en de voltooide clip in het uitvoerpaneel

MiniMax H3 image-to-video op Atlas Cloud: het keyframe van Stap 1 geladen aan de linkerkant, de voltooide clip aan de rechterkant.

Stap 3: Veo 3.1 image-to-video, audio handmatig ingeschakeld

De prompt is identiek, woord voor woord. Verander een enkel bijvoeglijk naamwoord en het is geen vergelijking meer. Wat verandert, is het extra veld dat Veo je geeft en H3 niet.

negative_prompt, wat voor 2D-anime de meest nuttige controle op deze lijst is:

Plain
13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur
2soup, warped lettering, gibberish text, extra fingers, subtitle bar

Instellingen: model google/veo3.1/image-to-video, resolution: 1080p (wijzig het, de standaard is 720p), duration: 8 (dit is het plafond), aspect_ratio: 16:9, generate_audio: true (de API-standaard is false, dit is de valkuil voor stille clips), seed: 20260807, image = dezelfde uitvoer van Stap 1.

AI-videogeneratorinterface met invoerinstellingen en gegenereerde anime-video

Veo 3.1 image-to-video-playground op Atlas Cloud met generate audio ingeschakeld, het anime-keyframe geladen en de voltooide clip in het uitvoerpaneel

Veo 3.1 image-to-video op Atlas Cloud, met Generate Audio ingeschakeld en de voltooide clip aan de rechterkant.

Stap 4: Score het op vijf anime-specifieke assen

Niets te genereren. Kijk gewoon, naar de dingen waar anime echt op breekt. Beide clips zijn ingebed bovenaan dit artikel, dus je kunt ze zelf scoren in plaats van mijn woord aan te nemen.

Vergelijking naast elkaar van wazige en scherpe stadiontaferelen

Naast elkaar van het laatste frame van beide clips, MiniMax H3 links met schone Japanse titellettering, Veo 3.1 rechts met onleesbare verticale karakters

Het laatste frame van elke clip. Links schreef H3 ラストホイッスル, alle acht katakana correct en rotsvast. Rechts produceerde Veo 3.1 drie karakters die niet het gevraagde woord zijn en ook geen woord vormen.

De titelkaart is waar de ronde werd beslist, en het was niet close. H3 gaf de gevraagde katakana exact weer, hard en stabiel, over een uitgesmeerde pan van het doelmond. Veo 3.1 produceerde een verticale stapel van drie karakters die noch het gevraagde woord noch een woord zijn. Op hetzelfde frame liet het ook het personage uit beeld vallen en liet de achtergrond naar semi-fotorealistische stadionplaat glijden, ondanks photorealistic skin en 3D render in de negatieve prompt.

Tabel 3: vijf assen die een anime-crop bepalen, van deze twee runs

AsMiniMax H3Veo 3.1
Continutieit van personage vanuit keyframeHield het exacte gezicht, haar en tenue gedurende de volledige 8 secondenTekende het personage opnieuw in een nieuw wijds shot, modelgetrouw maar een andere tekening
Lijnvoering en platte cel-schaduwHield, geen drift naar 3DHield in het midden shot, dreef tegen het einde naar een fotografische stadionplaat
Japanse titelkaartラストホイッスル correct weergegeven en stabiel gehoudenDrie karakters, niet het gevraagde woord, geen woord
Geleverde audiotrack32 kHz stereo, exact zoals de modelkaart vermeld48 kHz stereo, alleen aanwezig omdat ik generate_audio zelf had ingesteld
Whip pan en sakuga-smearUitgevoerd als een uitgesmeerde pan naar de titelVervangen door een harde cut naar een nieuwe opstelling

Die laatste rij is de luidruchtigste publieke kritiek op H3 tot nu toe, en dat is precies waarom ik het in beide prompts heb geschreven. Op de dag-0 ComfyUI-thread klaagde gebruiker fwip dat zelfs de officiële demo-prompts werden genegeerd: "a violent WHIP PAN off the rooftop that SMEARS the floating words away with it, motion-streaked. And the video just didn't do any of that transition at all, it just replaced it with a cut."

In deze run was het Veo die de pan voor een cut verwisselde, en H3 die smeerde. Eén take per stuk is geen oordeel, en ik zou niet anders beweren. Maar het betekent wel dat de kritiek niet H3-specifiek is: whip-pans zijn de minst betrouwbare instructie in deze hele test aan beide kanten. Als je storyboard ervan afhangt, storyboard er dan omheen in plaats van erdoorheen.

Stap 5: De 4:3 retro OVA cut die Veo 3.1 structureel niet kan uitvoeren

Dit is geen kwaliteitsvoorkeur. Het is een muur. Veo's aspect_ratio-enumeratie heeft twee waarden en geen van beide is 4:3, en de duration-enumeratie heeft geen 12. De 90s OVA-look is simpelweg niet bereikbaar.

Plain
1Een anime-crop uit de jaren 90 OVA, 4:3 full-frame. Met de hand geschilderde
2achtergrondkunst met zichtbare penseeltextuur, cel-verf personages met dikke ongelijke
3inktlijnen, zware halatiegloed rond de schijnwerpers, 16mm-filmkorrel en vage
4poortbeweging. Dezelfde roodharige aanvaller in een wit-en-marineblauw nummer 9-tenue
5loopt van een regenachtig veld terwijl het publieksgeluid vervaagt tot een enkele
6rinkende toon. Camera duwt langzaam in op zijn gezicht. Hij zegt zachtjes in het Japans:
7「次は、勝つ」. Retro palet: gedempt groenblauw, stoffig amber, diep kastanjebruin
8schaduwen. Audio: verre regen, een eenzame analoge synthpad, één fluitje met veel galm
9in de verte.

Instellingen: model minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Stel die verhouding handmatig in, onthoud de standaard.

AI-videogeneratorinterface met tekstprompt en gegenereerde anime-video

MiniMax H3 tekst-naar-video-playground op Atlas Cloud met de OVA-prompt ingetypt en de voltooide retro clip in het uitvoerpaneel

MiniMax H3 tekst-naar-video op Atlas Cloud, OVA-prompt ingetypt, clip voltooid. Volledige openheid: deze specifieke run liet Aspect Ratio op 16:9 en Duration op 8, dus wat je aan de rechterkant ziet is de breedbeeld korte versie. De 4:3 twaalf-seconden crop hieronder kwam van de API-aanroep met ratio: 4:3 en duration: 12 expliciet ingesteld.

Anime-voetbalspeler in een vuil tenue die in een stadion staat

De 4:3 retro OVA-crop: dezelfde aanvaller loopt van een regenachtig veld in 90s anime-stijl

H3 tekst-naar-video, 4:3, 12 seconden. Het geleverde bestand kwam terug als 1920x1440, wat tot de pixel 4:3 is, met een 32 kHz stereo track. Hier getoond als een stille GIF met verminderde framerate om de pagina licht te houden. Gegenereerd met minimax/h3/text-to-video op Atlas Cloud.

Stap 6: Negen referentieafbeeldingen, één personage, vier cuts

Cross-shot personageconsistentie is het moeilijkste probleem in AI-anime, en het wordt opgelost met referentievolume. Bouw eerst het pakket: voer de prompt van Stap 1 opnieuw uit met de kadrering gewisseld voor vooraan, driekwart, volledig profiel, achterkant, lachend, opeengeklemde tanden, volledige lichaamsstand, kitdetail en schoendetail. Negen afbeeldingen, ongeveer acht cent in totaal.

Vier illustraties van een roodharige anime-voetbalspeler met nummer 9

Vier hoeken van hetzelfde originele aanvallerspersonage gegenereerd als een referentiepakket, gerangschikt in een twee bij twee raster

Vier van de negen referentiehoeken. H3 accepteert tot negen afbeeldingen in één referentiepakket, plus video- en audioreferenties erbovenop.

Plain
1Cel-shaded 2D-anime, consistente met de hand geïnkte lijnvoering, platte kleur, geen
23D-schaduw. Houd het gerefereerde aanvallersgezicht, haarsilhouet en nummer 9-tenue
3identiek in elke cut. Vier cuts in één doorlopende take: (1) lage hoek inzoom op zijn
4schoenen die het gras raken, (2) whip-pan omhoog naar een strakke close-up van zijn ogen,
5(3) wijds shot van hem sprintend langs drie verdedigers getekend als vage silhouetten, (4)
6bevries op een kopbal in de lucht, snelheidslijnen exploderen naar buiten. Audio:
7publiekslawaai, ademhaling, schoen-op-gras impact, één taiko-slag bij de bevriezing.

Instellingen: model minimax/h3/reference-to-video, refers = jouw afbeeldingen met type: image, resolution: 2K, duration: 8 of hoger, ratio: adaptive of 16:9.

Het Veo 3.1-equivalent kan niet worden uitgevoerd met deze instellingen en je hoeft het niet te proberen om te weten waarom. Het referentie-eindpunt accepteert maximaal drie afbeeldingen, en het kiezen van dat eindpunt stort duration in tot een enkele legale waarde van 8. Een negen-afbeeldingenpakket en een 10-seconden take zijn beide buiten bereik.

AI-videogeneratorinterface met promptinvoer en gegenereerde anime-video

MiniMax H3 reference-to-video-playground op Atlas Cloud met de referentieteller op vier van negen en de eerste cut in het uitvoerpaneel

MiniMax H3 reference-to-video op Atlas Cloud. De teller geeft Reference Materials (4/9) aan met MAX:9 eronder, wat het plafond in de interface is in plaats van een claim van een specificatieblad. Uitvoer is cut één, de lage hoek inzoom op de schoenen.

Vier Meer MiniMax H3 Anime Video Generator Runs Die Het Doen

Het Last Whistle-shot belast slechts vier van de verschillen. Deze vier belasten de rest. Ze draaien allemaal op H3; de notities geven aan welke Veo 3.1 kan evenaren.

  1. Ultrawide sakuga-gevecht, 21:9 , 10 seconden. Veo kan helemaal geen 21:9 uitvoeren.
Plain
1Cel-shaded 2D-anime actie, dikke taps toelopende inktlijnen, platte kleur, harde
2schaduwen, geen 3D-schaduw. Twee originele gemaskerde duellisten op een winderig
3tempeldak bij zonsondergang. Zwaardclash, het frame schudt, beide vechters breken uit
4elkaar in een uitbarsting van handgetekende impactframes en radiale snelheidslijnen.
5Camera: lage hoek inzoom, dan een laterale track, dan een snap naar een wijd silhouet
6tegen de oranje lucht. Audio: twee scherpe metaalclashes, stofsnap, een lage taiko-slag
7bij de laatste bevriezing, geen muziek.
  1. Beat-gesynchroniseerde AMV-cut, reference-to-video met een audioreferentie. H3 neemt tot drie audioclips als referentie-invoer. Veo 3.1 heeft helemaal geen audio-invoer, alleen audio-uitvoer.
Plain
1Cel-shaded 2D-anime montage gesneden op de gerefereerde audiotrack. Vijf korte beats:
2regen op een raam, een hand die een verband strakker trekt, een stadsgezicht dat langs
3een treinraam flitst, een sprintstart, een bevriezing op een uitgestrekte hand. Elke cut
4landt exact op een downbeat van de gerefereerde audio. Platte kleur, dikke inktlijnen,
5hoogcontrast nachtpalet van diep indigo en neon magenta.
  1. Tweeregelige Japanse dialoogscène, 12 seconden. Dit is de lip-sync-stresstest, en 12 seconden ligt al buiten Veo's bereik.
Plain
1Cel-shaded 2D-anime, platte kleur, geen 3D-schaduw. Twee originele personages op een dak
2tijdens het gouden uur, shot reverse shot. Eerste zegt in het Japans:「本当に行くの?」.
3De tweede antwoordt, half glimlachend, in het Japans:「もう決めた」. Mondbewegingen
4matchen elke lettergreep. Warme omranding, lange schaduwen, zachte wind in het haar.
5Audio: twee duidelijke Japanse stemmen, ver verkeer, één cicade.
  1. Verticale shonen-kort, 9:16 , 8 seconden. Beide modellen kunnen verticaal, dus dit is de enige plek om ze daadwerkelijk te A/B-testen in plaats van aan te nemen.
Plain
1Cel-shaded 2D-anime, verticale compositie. Een originele tienerloopster barst door een
2papieren spandoek in slow-motion, dan klikt het frame terug naar volle snelheid terwijl
3ze versnelt over een stadionrechte. Snelheidslijnen, platte kleur, harde schaduwen,
4vette grafische lucht. Camera: lage hoek volgshot, dan een whip omhoog naar haar gezicht.
5Audio: spandoekscheur, publieksgolf, één ingehouden adem dan losgelaten.

Als je de promptgrammatica achter deze wilt, de MiniMax H3 promptgids gaat dieper in op hoe H3 camera- en audio-instructies parseert dan ik hier kan.

Wat een 60-Seconden Anime-Opening Kost op MiniMax H3 vs Veo 3.1

Een standaard anime-OP is ongeveer 90 seconden. Noem het acht shots van 8 seconden, 64 seconden voltooide video, plus één keyframe per shot voor $0,009 per stuk.

Er is een echt prijsverschil dat je moet weten in plaats van dat ik het gladstrijk. De Atlas Cloud-catalogus vermeldt MiniMax H3 voor $0,10 per seconde vast, terwijl de model-readme het uitsplitst als $0,14/s op 2K en $0,10/s op 768P. Veo 3.1 wordt vermeld voor $0,20 per seconde, terwijl de readme $0,40/s met audio scheidt van $0,20/s zonder.

De run-knoppen in mijn screenshots bevestigen het. H3 reference-to-video, 8 seconden op 2K, gaf Run $1,12 aan, wat exact $0,14 per seconde is. Veo 3.1 image-to-video, 8 seconden op 1080p met audio aan, gaf Run $3,2 aan, wat exact $0,40 per seconde is. Dus de readme-tarieven zijn de tarieven die in rekening worden gebracht, en de cataloguskop is de instapdrempel. Ik heb beide aflezingen hieronder toch weergegeven. Dit zijn catalogusprijzen per augustus 2026.

Tabel 4: acht shots van 8 seconden, keyframes inbegrepen

SetupVideokosten (catalogustarief)Videokosten (readme-tarief)KeyframesTotale range
MiniMax H3, 2K$6,40$8,96$0,07$6,47 tot $9,03
MiniMax H3, 768P$6,40$6,40$0,07$6,47
Veo 3.1, 1080p met audio$12,80$25,60$0,07$12,87 tot $25,67
Veo 3.1 Lite, 720p$3,20$3,20$0,07$3,27

Prijzen afkomstig van de Atlas Cloud-modelpagina's gelinkt in Tabel 1, augustus 2026. Geen van deze vier is momenteel afgeprijsd.

Twee dingen die die tabel niet bevat, en beide raken harder dan het per-seconde tarief.

Herkansingen. Niemand levert de eerste take van een anime-shot. Welke vermenigvuldiger je ook aanneemt, pas deze toe op beide kolommen en de kloof wordt groter in dezelfde verhouding.

Kloktijd, en deze gaat de andere kant op. Getimed van begin tot eind op 7 augustus 2026: H3 op 2K voor 8 seconden duurde 447 seconden, ongeveer 7,5 minuten. H3 tekst-naar-video op 2K voor 12 seconden duurde 334 seconden. Veo 3.1 op 1080p voor 8 seconden met audio duurde 152 seconden, minder dan drie minuten. Veo is hier ongeveer drie keer sneller naar een eerste take, en als je om 2 uur 's nachts aan een shot werkt, is dat echt geld waard. Wachtrijen bewegen, dus behandel dit als een momentopname van één middag in plaats van een specificatie. Maar iedereen die "2 tot 3 minuten" citeert voor H3 op 2K, citeert een readme, geen wachtrij. De 2K versus 768P uitsplitsing behandelt wanneer de hogere laag de extra minuten waard is.

Animes Stijl, Hommage en Wat Je Werkelijk Kunt Publiceren

Alles in dit artikel is stijl en hommage. Een origineel personage, een origineel tenue, een originele titel. Geen officieel anime-personage is gegenereerd of aangevraagd, en geen echte voetballersnaam of gelijkenis is gebruikt. De WK-trend wordt gerefereerd als een format, omdat dat is waarvoor het nuttig is.

Dat onderscheid is geen decoratie. Als je commercieel anime-achtige inhoud produceert, zijn "in de stijl van 90s OVA" en "dit specifieke personage uit deze specifieke show" verschillende juridische objecten, en slechts één ervan is een bedrijf.

Over de open gewichten: H3 is echt downloadbaar, en mensen draaiden het op dag één. Eén commentator meldde 10 minuten voor een 10-seconden 480p-clip op een 4070 Ti Super met 16GB, en anderen plaatsten 3 minuten op een 5080 en 68 seconden op een RTX 6000 Pro. Maar zelfhosten draait op een 768 korte rand; de Context-IR en Regenerate-2K-fasen die 2K produceren, blijven aan de API-kant.

De licentie heeft een echte valkuil. De communitylicentie dekt momenteel niet de EU, het VK, Zuid-Korea of de Verenigde Staten, met verwijzing naar regio's die "momenteel AI-gerelateerde regelgeving ontwikkelen of handhaven". Een formeel licentieverzoekkanaal is open, wat een HN-commentator samenvatte als "je moet gewoon pinkie beloven dat je Disney niet kwaad maakt en ze sturen je een licentie". Grappig, en ook precies de nalevingsstap die je niet kunt overslaan als je in een van die vier gebieden bent. De open gewichten uiteenzetting heeft de volledige gebiedslijst.

Veelgestelde Vragen

Is MiniMax H3 een goede anime-videogenerator vergeleken met Veo 3.1?

Voor de meeste anime-werk, H3, en vooral om redenen die niet over weergave gaan. Het draait 4 tot 15 seconden tegen Veo's 4, 6 of 8, het biedt zes beeldverhoudingen inclusief 4:3 en 21:9 tegen Veo's twee, het vermeldt Japans onder 11 native stabiele dialoogtalen, en het neemt negen referentieafbeeldingen tegen Veo's drie. Veo 3.1 wint in één specifieke situatie: wanneer je seed nodig hebt voor reproduceerbare herkansingen, of negative_prompt om te voorkomen dat een shot naar 3D-rendershaduw afdrijft. H3 heeft geen van beide parameters. Als jouw pijplijn van een van beide afhangt, is dat een echte reden om te blijven.

Kan Veo 3.1 anime genereren in 4:3 of een 15-seconden clip?

Nee, en niet om stilistische redenen. Veo 3.1's aspect_ratio-enumeratie bevat exact 16:9 en 9:16, en de duration-enumeratie bevat exact 4, 6 en 8. Er is geen 4:3-waarde om te selecteren en geen manier om 12 of 15 seconden aan te vragen. Als jouw referentie een 90s TV-anime of OVA is, is de kadrering buiten bereik op Veo en beschikbaar op H3.

Waarom kwam mijn Veo 3.1 anime-clip stil terug?

Omdat generate_audio standaard false is op de API. De playgound-schakelaar staat meestal al aan, dus dit treft alleen mensen die de API direct aanroepen. Stel expliciet generate_audio: true in. Terwijl je bezig bent, stel ook resolution in, want het standaard naar 720p in plaats van de 1080p of 4k die je waarschijnlijk bedoelde.

Doet MiniMax H3 Japanse dialoog en lip-sync voor anime?

Ja. De modelkaart vermeldt 11 talen met stabiele dialoogondersteuning: Arabisch, Chinees, Engels, Frans, Duits, Italiaans, Japans, Koreaans, Portugees, Russisch en Spaans. Audio wordt gezamenlijk gegenereerd met het beeld op 32 kHz stereo in plaats van achteraf nagesynchroniseerd, daarom blijft de mondtiming over een hele regel in plaats van alleen de eerste paar lettergrepen. Schrijf de Japanse regel direct in de prompt in het Japans.

Hoeveel referentieafbeeldingen kan ik gebruiken om een anime-personage consistent te houden?

MiniMax H3 accepteert tot 9 afbeeldingen, tot 3 videoclips en tot 3 audioclips, met een hard plafond van 12 bestanden over alle typen. Veo 3.1's reference-to-video-eindpunt accepteert 1 tot 3 afbeeldingen, en het selecteren ervan stort duration in tot 8 als de enige legale waarde. Voor een terugkerend anime-personage in een serie is dat verschil het hele spel.

MiniMax H3 heeft open gewichten, dus kan ik mijn anime-pijplijn lokaal voor niets draaien?

Je kunt het downloaden en draaien, met drie kanttekeningen. Zelfgehoste inferentie draait op een 768 korte rand, en de Context-IR- en Regenerate-2K-fasen die 2K produceren, blijven aan de API-kant. Real-world lokale snelheden variëren sterk per kaart: ongeveer 10 minuten voor een 10-seconden 480p-clip op een 4070 Ti Super, ongeveer 3 minuten op een 5080, ongeveer 68 seconden op een RTX 6000 Pro, volgens de dag-0 ComfyUI-thread. En de communitylicentie dekt momenteel niet de EU, het VK, Zuid-Korea of de VS, dus als je in een van die bent, heb je de formele licentie nodig voor commercieel gebruik.

Nieuwste modellen

Eén API voor alle media-AI.

Verken alle modellen