Den ganzen Sommer über wurde in meinem Feed dasselbe Video in einer Endlosschleife gezeigt. WM-Spieler als Shonen-Protagonisten neu gezeichnet. Ein Diktator. Ein Piratenkapitän. Ein ergrauter Mentor, der in den letzten vier Sekunden auftaucht. Millionen von Aufrufen pro Beitrag, und die Handlung wird nach fast jedem Spiel aktualisiert.
Niemand, der diese Videos erstellt, schreibt Benchmark-Posts. Sie wählen ein Modell aus, verbrennen Credits und liefern vor dem nächsten Anpfiff aus.
Also habe ich einen Anime-Keyframe und einen Prompt genommen und MiniMax H3 als Anime-Videogenerator gegen Veo 3.1 getestet, beide bis zu den maximalen Einstellungen bei identischen Eingaben.
Das Erste, was kaputt ging, war nicht die Bildqualität. Es war ein Dropdown. Veo 3.1 stoppt bei 8 Sekunden und bietet genau zwei Seitenverhältnisse. Eine Einstellung, die auf einem Gesicht verweilt, dann mit dem Ball peitscht und schließlich eine Titelcard landen lässt, passt nicht in 8 Sekunden. Sie hatte nie die Chance, bei der Qualität zu versagen.
Wichtige Erkenntnisse
- Veo 3.1s
duration-Enum ist[4, 6, 8]und seinaspect_ratio-Enum ist[16:9, 9:16]. MiniMax H3 läuft jede ganze Sekunde von 4 bis 15 und bietet21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Kein 4:3 bei Veo bedeutet gar kein Retro-OVA-Framing. - H3s Modellkarte listet 11 nativ stabile Dialogsprachen, und Japanisch ist eine davon. Audio und Bild werden gemeinsam bei 32 kHz Stereo erzeugt, nicht nachträglich synchronisiert.
- Referenzpakete sind nicht vergleichbar: H3 akzeptiert bis zu 9 Bilder plus bis zu 3 Videos und 3 Audioclips (max. 12 Dateien). Veo 3.1s Referenz-Endpunkt akzeptiert 3 Bilder, und sobald man ihn verwendet, fällt
durationauf nur[8]. - Zwei Fallen, die Tests stillschweigend ruinieren: Veos API setzt
generate_audiostandardmäßig auffalseundresolutionauf720p, und H3s Text-zu-Videoratiostandardmäßig auf1:1. Wenn man diese ignoriert, vergleicht man einen stummen 720p-Clip mit einem quadratischen. - Veo 3.1 behält zwei Dinge, die H3 überhaupt nicht hat:
seedundnegative_prompt. Für 2D-Anime ist das zweite wirklich wichtig, und ich werde zeigen, wo.
MiniMax H3 Anime-Videogenerator vs Veo 3.1, Derselbe Frame Rücken an Rücken
Ein Originalcharakter. Ein Keyframe. Ein Prompt, Zeichen für Zeichen in beide Modelle kopiert. Alles andere auf jeder Seite maximiert.
MiniMax H3, Bild-zu-Video, 2K, 8 Sekunden, natives Audio. Schalten Sie den Ton ein: Das Stadionrauschen, der Balltreffer und der japanische Schrei werden im selben Durchlauf wie das Bild erzeugt. Generiert mit minimax/h3/image-to-video auf Atlas Cloud.
Veo 3.1, Bild-zu-Video, 1080p, 8 Sekunden, generateaudio manuell eingeschaltet, plus ein negativeprompt , der die Liniengrafik flach hält. Gleicher erster Frame, gleiche Wörter. Generiert mit google/veo3.1/image-to-video auf Atlas Cloud.
Beide zeichnen wunderschön. Veos Weitwinkelaufnahme des Schlags, mit handgezeichneten Impact-Linien und einem Manga-Soundeffekt, der in der Luft schwebt, ist wirklich schön. Das ist der ehrliche Ausgangspunkt, und deshalb geht es im Rest dieses Artikels um Parameter und Befehlsbefolgung statt um Stimmungen.
Warum die meisten MiniMax H3 Anime-Videogenerator-Tests vs Veo 3.1 schiefgehen
Im Sommer passierten zwei Dinge gleichzeitig.
Anime wurde zum Format mit dem höchsten Volumen in der KI-Videoproduktion. Die WM 2026 wurde als Shonen-Turnier neu geschrieben, mit Spielern als Diktator, Piratenkapitän, Marinegeneral und Mentor, und Handlungssträngen, die sich „nach fast jedem Spiel weiterentwickeln“ auf TikTok, Instagram, X und YouTube (Complex, Juli 2026).
Und MiniMax H3 wurde mit offenen Gewichten veröffentlicht. Der ComfyUI-Thread am Tag 0 erreichte 330 Punkte und 95 Kommentare, in denen Leute innerhalb von Stunden echte lokale Zahlen posteten (Hacker News, August 2026).
Wenn man beides zusammennimmt, würde man eine Menge Anime-Vergleiche erwarten. Es gibt fast keine, weil die meisten Tests auf eine von vier Arten falsch aufgebaut werden.
Sie vergleichen Bilder, keine Einschränkungen. Anime-Einstellungen sind Timing. Ein Peitschen-Schwenk in eine Titelcard ist ein Dauerproblem, bevor es ein Renderingproblem ist.
Sie vergessen, dass Veos API standardmäßig stumm ist. In der API ist generate_audio false und resolution 720p. Viele „Veo hat kein Audio in Anime“-Posts sind nur von jemandem, der nie einen Boolean umgeschaltet hat.
Sie vergessen, dass H3s Text-zu-Video standardmäßig quadratisch ist. ratio standardmäßig 1:1, nicht 16:9. Wenn man einen t2v-Anime-Prompt ausführt, ohne ihn zu setzen, erhält man einen quadratischen Clip und eine verwirrende Schlussfolgerung.
Sie testen mit fotorealistischen Prompts. „Cinematic, volumetrisches Licht, geringe Schärfentiefe“ ist genau das Vokabular, das ein 2D-Modell in Richtung 3D-Render-Shading zieht. Die Fehlerart bei Anime ist nicht Unschärfe. Es ist plastisch.
Die drei Einstellungen, die einen Anime-Test entscheiden, bevor Sie auf „Ausführen“ drücken
Stellen Sie vor allem anderen diese auf beiden Seiten ein, sonst ist der Vergleich ungültig.
| Einstellung | MiniMax H3 | Veo 3.1 | Was passiert, wenn Sie sie überspringen |
|---|---|---|---|
| Audio | Wird mit dem Bild erzeugt, immer an | generate_audio default false | Veo gibt einen stummen Clip zurück und wirkt schlechter, als er ist |
| Bildformat | ratio default 1:1 bei Text-zu-Video | aspect_ratio default 16:9 | H3 liefert einen quadratischen Anime-Schnitt, den Sie nicht verwenden können |
| Auflösung | default 2K | default 720p | Sie vergleichen 2K mit 720p und nennen es einen Qualitätsunterschied |
Das MiniMax H3 vs Veo 3.1 Anime-Datenblatt: Länge, Seitenverhältnis, Audio, Referenzen
Ich habe beide Live-Eingabeschemata der Modelle abgerufen, anstatt einem Launch-Post zu vertrauen. Jeder Wert unten ist ein Enum, das Sie auf den Modellseiten selbst lesen können, kein Eindruck.
Tabelle 1: MiniMax H3 vs Veo 3.1, die Parameter, die einen Anime-Shot bestimmen
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Dauer | 4 bis 15, jede ganze Sekunde (Standard 8) | 4, 6, 8 (Standard 8) |
| Seitenverhältnisse | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Standard-Seitenverhältnis (t2v) | 1:01 | 16:09 |
| Auflösung | 768P, 2K (Standard 2K) | 720p, 1080p, 4k (Standard 720p) |
| Audio | Gemeinsam erzeugt, 32 kHz Stereo | generate_audio, Standard false |
| Native Dialogsprachen | 11 stabil, Japanisch inklusive | Nicht als stabile Liste veröffentlicht |
| Referenzpaket | bis zu 9 Bilder, 3 Videos, 3 Audioclips, 12 Dateien gesamt | 3 Bilder |
| Dauer bei Verwendung von Referenzen | immer noch 4 bis 15 | fällt auf nur 8 |
| seed | nicht verfügbar | verfügbar |
| negative_prompt | nicht verfügbar | verfügbar |
| Gewichte | herunterladbar | geschlossen |
Dauer, Seitenverhältnis, Auflösung, Audio und Referenzlimits stammen aus den Live-Schemata auf den Seiten MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video und Veo 3.1 reference-to-video. Die 9-Bilder- und 12-Dateien-Referenzobergrenze und die 11-Sprachen-Dialogliste stammen aus der MiniMax H3 Modellkarte (Hugging Face, August 2026).
Jetzt die Ranglisten, denn sie sagen etwas anderes als das Datenblatt, und beide sind wichtig.
Tabelle 2: Crowd-Vote Elo und Listenpreis pro Minute, Stand 7. August 2026
| Modell | Text-zu-Video (mit Audio) | Bild-zu-Video (mit Audio) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1.244 (#1) ±7 | 1.191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1.238 (#2) ±9 | 1.190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1.224 (#3) ±6 | 1.198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1.111 (#7) ±6 | nicht in den Top 10 | $20.16 |
| Veo 3.1 | 1.093 (#11) ±7 | 1.085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1.091 (#14) ±6 | nicht in den Top 10 | $9.00 |
| Veo 3.1 Lite | 1.089 (#15) ±7 | nicht in den Top 10 | $4.80 |
Elo- und Preisangaben aus der Artificial Analysis Video Arena (Artificial Analysis, August 2026). Dies sind rollierende Crowd-Votes und sie ändern sich. Die $/min-Spalte ist eine normalisierte Modellschätzung, nicht Ihre Rechnung.
Eine Elo-Lücke von 145 Punkten ist groß, aber es ist eine allgemeine Abstimmung, keine Anime-Abstimmung. Und hier ist der Teil, den ich klar sagen muss: MiniMax vermarktet H3 nicht als Anime-Modell. Internes Feedback der ersten Linie nennt Film, Animation und Comic-Drama als die Bereiche, auf die H3 nicht abzielt. Die interessante Frage ist also nicht „welches ist das Anime-Modell“. Es ist, warum das Modell, das sich nicht als Anime verkauft, den Shot trotzdem gewinnt, und wo Google noch die Runde für sich entscheidet.
Ein praktischer Hinweis vor dem Tutorial. Jedes unten stehende Modell läuft über dieselbe Konsole und denselben API-Schlüssel, was der einzige Grund ist, warum die Parameter überhaupt vergleichbar sind. Gleiche Warteschlange, gleiche Authentifizierung, eine Rechnung. Wenn Sie GPT Image 2 auf einem Dienst und Veo auf einem anderen einrichten, ist die Hälfte der Unterschiede, die Sie finden, eher Infrastruktur als Modell.
Bauen Sie den Shot: MiniMax H3 vs Veo 3.1, Schritt für Schritt
Ein durchgehendes Beispiel, von Anfang bis Ende. „Last Whistle“: Ein originaler Teenager-Stürmer, rote Haare, weiß-marineblaues Trikot mit Nummer 9, Flutlicht, ein Peitschen-Schwenk auf den Schlag und eine japanische Titelcard, die in den letzten zwei Sekunden landen und ruhig halten muss.
Kein echter Spieler, kein offizieller Charakter, kein bestehendes Anime-IP. Stil und Hommage nur. Mehr dazu gleich.
Schritt 1: Entwerfen Sie den Anime-Keyframe mit GPT Image 2
Der Keyframe trägt die künstlerische Richtung, sodass das Videomodell sie nicht erfinden muss. Beachten Sie den negativen Raum im linken Drittel: Er ist bewusst. Die Titelcard wird dort vom Videomodell geschrieben, und das ist der Textstabilitätstest.
Plain1Ein einzelner Frame aus einem modernen Shonen-Sport-Anime. Cel-Shaded 2D-Animation, 2handgezeichnete Linien mit gleichmäßiger Strichstärke, flache Farbfüllungen, 3hartkantige grafische Schatten, absolut kein 3D-Shading und keine fotorealistische Haut. 4Nahaufnahme eines original Teenager-Stürmers: zerzauste dunkelrote Haare, 5weiß-marineblaues Trikot mit der Nummer 9, Schweiß und Grasstreifen auf einer Wange, 6Augen weit offen mit erschöpfter Entschlossenheit, Mund offen mitten im Schrei. Hinter 7ihm lodern Stadionflutlichter in eine Wand aus verschwommener Menge; radiale 8Geschwindigkeitslinien brechen aus der Bildmitte hervor; ein Grashalm hängt gefroren in 9der Luft. Gesättigte Palette, tiefe Cyan-Schatten, warmes orangefarbenes Randlicht. 1016:9-Komposition, der Charakter rechts von der Mitte eingerahmt, sauberer negativer Raum 11im linken Drittel. Kein Text irgendwo im Bild.
Einstellungen: Modell openai/gpt-image-2/text-to-image, Qualität high, Größe 16:9 (2048x1152). Sonst nichts.

GPT Image 2 Playground auf Atlas Cloud mit dem Last Whistle Keyframe-Prompt und dem fertigen Anime-Frame im Ausgabefenster
GPT Image 2 auf Atlas Cloud: Qualität auf high gesetzt, der fertige Keyframe rechts.

Der Basis-Anime-Keyframe: ein originaler rothaariger Stürmer mitten im Schrei unter Stadionflutlichtern, cel-shaded mit flachen Farben und Geschwindigkeitslinien
Der Keyframe, den beide Modelle erhalten. Flache Farbe, harte Schatten und ein leeres linkes Drittel, das auf eine Titelcard wartet.
Schritt 2: MiniMax H3 Bild-zu-Video, alles maximiert
Gleiches Bild hinein, 2K heraus. Ich habe H3 hier nur auf 8 Sekunden gehalten, damit es Veos Obergrenze entspricht. Das ist nicht H3s Limit, und Schritt 4 nimmt die Obergrenze weg.
Plain1Cel-Shaded 2D-Anime, handgezeichnete Linienstärke, flache Farbe, kein 3D-Shading. Halte 2das Gesicht des Stürmers für einen Schlag, dann ein heftiger Peitschen-Schwenk folgt dem 3Ball, während er ihn tritt, der Schwenk verwischt den Frame zu gestreiften Sakuga- 4Bewegungsspuren. Ein Frame völliger Stille beim Aufprall. In den letzten zwei Sekunden 5prallt fette weiße japanische Titel-Schrift, die ラストホイッスル lautet, auf das linke 6Drittel des Frames und hält felsenfest, kein Verziehen, kein Flackern, kein Driften. 7Der Stürmer schreit eine Zeile auf Japanisch: 「まだ終わってない!」 8Audio: anschwellendes Stadiongebrüll, ein einziger scharfer Ball-Treffer, ein tiefer 9Taiko-Schlag unter der Titelcard.
Einstellungen: Modell minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (Bild-zu-Video übernimmt seine Bildform von Ihrem Eingabebild), image = die Ausgabe von Schritt 1.
Eine Warnung, falls Sie stattdessen zu Text-zu-Video wechseln: Schreiben Sie ratio: 16:9 explizit. Der Standard ist 1:1, und es wird Ihnen glücklich einen quadratischen Anime-Schnitt liefern.

MiniMax H3 Bild-zu-Video Playground auf Atlas Cloud mit dem Last Whistle Prompt, geladenem Keyframe und dem fertigen Clip im Ausgabefenster
MiniMax H3 Bild-zu-Video auf Atlas Cloud: der Keyframe aus Schritt 1 links geladen, der fertige Clip rechts abgespielt.
Schritt 3: Veo 3.1 Bild-zu-Video, Audio manuell eingeschaltet
Der Prompt ist identisch, Wort für Wort. Ändern Sie ein einziges Adjektiv, und es ist kein Vergleich mehr. Was sich ändert, ist das zusätzliche Feld, das Veo bietet und H3 nicht.
negative_prompt, das für 2D-Anime die nützlichste Steuerung in dieser Liste ist:
Plain13D-Render, CGI, plastisches Shading, fotorealistische Haut, Live-Action-Aufnahmen, 2Bewegungsunschärfe-Suppe, verzogene Schrift, Kauderwelsch-Text, zusätzliche Finger, 3Untertitel-Leiste
Einstellungen: Modell google/veo3.1/image-to-video, resolution: 1080p (ändern, der Standard ist 720p), duration: 8 (das ist die Obergrenze), aspect_ratio: 16:9, generate_audio: true (der API-Standard ist false, das ist die stumme-Clip-Falle), seed: 20260807, image = dieselbe Ausgabe von Schritt 1.

Veo 3.1 Bild-zu-Video Playground auf Atlas Cloud mit aktiviertem Audio-Generieren, geladenem Anime-Keyframe und dem fertigen Clip im Ausgabefenster
Veo 3.1 Bild-zu-Video auf Atlas Cloud, mit aktiviertem Audio-Generieren und dem fertigen Clip rechts.
Schritt 4: Bewerten Sie es auf fünf Anime-spezifischen Achsen
Hier ist nichts zu generieren. Einfach nur hinschauen, auf die Dinge, die Anime tatsächlich zum Scheitern bringen. Beide Clips sind weiter oben in diesem Artikel eingebettet, sodass Sie sie selbst bewerten können, anstatt mir zu glauben.

Seitenvergleich des letzten Frames beider Clips, MiniMax H3 links mit sauberer japanischer Titel-Schrift, Veo 3.1 rechts mit verstümmelten vertikalen Zeichen
Der letzte Frame jedes Clips. Links schrieb H3 ラストホイッスル, alle acht Katakana korrekt und felsenfest. Rechts schrieb Veo 3.1 drei Zeichen, die nicht das angeforderte Wort sind und kein Wort bilden.
Die Titelcard war der Punkt, an dem die Runde entschieden wurde, und es war knapp. H3 renderten die angeforderten Katakana exakt, hartkantig und stabil, über einem gestreiften Schwenk des Tors. Veo 3.1 produzierte einen vertikalen Stapel von drei Zeichen, die weder das angeforderte Wort noch ein Wort sind. Im selben Frame ließ es auch den Charakter aus dem Bild verschwinden und ließ den Hintergrund in Richtung eines semi-fotorealistischen Stadionbildes abdriften, trotz fotorealistische Haut und 3D-Render im Negative Prompt.
Tabelle 3: Fünf Achsen, die einen Anime-Schnitt entscheiden, aus diesen beiden Läufen
| Achse | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Charakterkontinuität vom Keyframe | Hielt das exakte Gesicht, die Haare und das Trikot für die vollen 8 Sekunden | Zeichnete den Charakter in einer neuen Weitwinkelaufnahme neu, modellgetreu, aber eine andere Zeichnung |
| Linienstärke und flaches Cel-Shading | Gehalten, keine Abdrift in Richtung 3D | Gehalten in der Nahaufnahme, driftete gegen Ende zu einem fotografischen Stadionbild |
| Japanische Titelcard | ラストホイッスル korrekt gerendert und stabil gehalten | Drei Zeichen, nicht das angeforderte Wort, kein Wort |
| Gelieferte Audiospur | 32 kHz Stereo, genau wie auf der Modellkarte angegeben | 48 kHz Stereo, nur vorhanden, weil ich generate_audio selbst gesetzt habe |
| Peitschen-Schwenk und Sakuga-Verwischung | Als verwischter Schwenk in die Titelcard ausgeführt | Ersetzt durch einen harten Schnitt zu einer neuen Einstellung |
Die letzte Zeile ist die lauteste öffentliche Kritik an H3 bisher, weshalb ich sie genau in beide Prompts geschrieben habe. Im ComfyUI-Thread am Tag 0 beschwerte sich Benutzer fwip, dass selbst die offiziellen Demo-Prompts ignoriert wurden: „ein heftiger PEITSCHEN-SCHWENK vom Dach, der die schwebenden Wörter mit sich fortreißt, bewegungsverwischt. Und das Video hat diesen Übergang überhaupt nicht gemacht, es hat ihn einfach durch einen Schnitt ersetzt."
In diesem Lauf war es Veo, das den Schwenk gegen einen Schnitt tauschte, und H3, das verwischte. Ein Lauf pro Seite ist kein Urteil, und ich würde nichts anderes behaupten. Aber es bedeutet, dass die Kritik nicht H3-spezifisch ist: Peitschen-Schwenks sind die unzuverlässigste Anweisung in diesem gesamten Test auf beiden Seiten. Wenn Ihr Storyboard von einem abhängt, storyboarden Sie um ihn herum, nicht durch ihn hindurch.
Schritt 5: Der 4:3 Retro-OVA-Schnitt, den Veo 3.1 strukturell nicht ausgeben kann
Dies ist keine Präferenz für die Qualität. Es ist eine Wand. Veos aspect_ratio-Enum hat zwei Werte, und keiner ist 4:3, und sein duration-Enum hat kein 12. Der 90er Jahre OVA-Look ist einfach nicht erreichbar.
Plain1Ein 1990er OVA-Anime-Schnitt, 4:3 Vollbild. Handgemalter Hintergrund mit sichtbarer 2Pinseltextur, Cel-Paint-Charaktere mit dicken ungleichmäßigen Tuschelinien, starker 3Halation-Glühen um die Flutlichter, 16mm-Filmkorn und schwaches Gate Weave. Der gleiche 4rothaarige Stürmer in einem weiß-marineblauen Trikot mit Nummer 9 geht von einem 5regennassen Feld, während das Publikumsgeräusch zu einem einzelnen klingelnden Ton 6verblasst. Die Kamera fährt langsam auf sein Gesicht zu. Er sagt leise auf Japanisch: 7「次は、勝つ」. Retro-Palette: gedämpftes Blaugrün, staubiges Bernstein, tiefe 8Maroon-Schatten. Audio: entfernter Regen, ein einsames analoges Synth-Pad, eine 9halllastige Pfeife in der Ferne.
Einstellungen: Modell minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Setzen Sie dieses Verhältnis von Hand, denken Sie an den Standard.

MiniMax H3 Text-zu-Video Playground auf Atlas Cloud mit eingegebenem OVA-Prompt und dem fertigen Retro-Clip im Ausgabefenster
MiniMax H3 Text-zu-Video auf Atlas Cloud, OVA-Prompt eingegeben, Clip abgeschlossen. Volle Offenlegung: Dieser spezielle Lauf ließ Aspect Ratio bei 16:9 und Duration bei 8, also ist das, was Sie rechts sehen, die Breitbild-Kurzversion. Der 4:3 zvölfsekündige Schnitt unten stammt vom API-Aufruf mit explizit gesetztem ratio: 4:3 und duration: 12 .

Der 4:3 Retro-OVA-Schnitt: Der gleiche Stürmer, der in 90er Jahre Anime-Stil von einem regennassen Feld geht
H3 Text-zu-Video, 4:3, 12 Sekunden. Die gelieferte Datei kam mit 1920x1440 zurück, was pixelgenau 4:3 ist, mit einer 32 kHz Stereospur. Hier als stummes GIF mit reduzierter Bildrate gezeigt, um die Seite leicht zu halten. Generiert mit minimax/h3/text-to-video auf Atlas Cloud.
Schritt 6: Neun Referenzbilder, ein Charakter, vier Schnitte
Die Konsistenz eines Charakters über mehrere Einstellungen hinweg ist das schwierigste Problem in KI-Anime, und es wird durch die Menge der Referenzen gelöst. Bauen Sie zuerst das Paket: Führen Sie den Prompt aus Schritt 1 erneut aus, wobei die Bildausschnitte gegen Vorderansicht, Dreiviertelansicht, volles Profil, Rückansicht, lachend, zusammengebissene Zähne, Ganzkörperpose, Trikotdetail und Stiefeldetail ausgetauscht werden. Neun Bilder, insgesamt etwa acht Cent.

Vier Blickwinkel desselben original Stürmer-Charakters, generiert als Referenzpaket, in einem 2x2-Raster angeordnet
Vier der neun Referenzwinkel. H3 akzeptiert bis zu neun Bilder in einem Referenzpaket, plus Video- und Audio-Referenzen obendrauf.
Plain1Cel-Shaded 2D-Anime, durchgehend handgezeichnete Linienstärke, flache Farbe, kein 23D-Shading. Behalte das Gesicht des referenzierten Stürmers, die Haar-Silhouette und das 3Trikot mit Nummer 9 in jedem Schnitt identisch. Vier Schnitte in einer durchgehenden 4Einstellung: (1) Untersicht-Push-in auf seine Stiefel, die den Rasen treffen, 5(2) Peitschen-Schwenk nach oben zu einer engen Nahaufnahme seiner Augen, (3) Weitwinkel 6von ihm, wie er an drei als verschwommene Silhouetten gezeichneten Verteidigern 7vorbeisprintet, (4) Einfrieren bei einem Kopfball in der Luft, Geschwindigkeitslinien 8explodieren nach außen. Audio: Menschenmenge brüllt, Atem, Stiefel-auf-Rasen-Aufprall, 9ein Taiko-Schlag beim Einfrieren.
Einstellungen: Modell minimax/h3/reference-to-video, refers = Ihre Bilder mit type: image, resolution: 2K, duration: 8 oder höher, ratio: adaptive oder 16:9.
Das Äquivalent von Veo 3.1 kann mit diesen Einstellungen nicht ausgeführt werden, und Sie müssen es nicht versuchen, um zu wissen, warum. Sein Referenz-Endpunkt akzeptiert maximal drei Bilder, und die Wahl dieses Endpunkts reduziert duration auf einen einzigen gültigen Wert von 8. Ein Neun-Bilder-Paket und ein 10-Sekunden-Take sind beide außerhalb der Reichweite.

MiniMax H3 Referenz-zu-Video Playground auf Atlas Cloud, der den Referenzzähler bei vier von neun und den ersten Schnitt im Ausgabefenster zeigt
MiniMax H3 Referenz-zu-Video auf Atlas Cloud. Der Zähler zeigt Reference Materials (4/9) mit MAX:9 darunter, was die Obergrenze in der Oberfläche ist, keine Behauptung aus einem Datenblatt. Ausgabe ist Schnitt eins, der Untersicht-Push-in auf die Stiefel.
Vier weitere MiniMax H3 Anime-Videogenerator-Läufe, die es wert sind, ausgeführt zu werden
Der Last Whistle Shot testet nur vier der Unterschiede. Diese vier testen den Rest. Alle laufen auf H3; die Anmerkungen sagen, welche Veo 3.1 erreichen kann.
- Ultrawide Sakuga-Kampf,
21:9, 10 Sekunden. Veo kann 21:9 überhaupt nicht ausgeben.
Plain1Cel-Shaded 2D-Anime-Action, dicke konische Tuschelinien, flache Farbe, hartkantige 2Schatten, kein 3D-Shading. Zwei original maskierte Duellanten auf einem windigen Tempeldach 3in der Abenddämmerung. Klingenklirren, der Frame bebt, beide Kämpfer brechen in einem 4Ausbruch handgezeichneter Impact-Frames und radialer Geschwindigkeitslinien auseinander. 5Kamera: Untersicht-Push-in, dann ein lateraler Track, dann ein Schnappschuss zu einer 6weiten Silhouette gegen den orangefarbenen Himmel. Audio: zwei scharfe Metallklänge, 7Stoffknall, ein tiefer Taiko-Schlag beim finalen Einfrieren, keine Musik.
- Beat-synchroner AMV-Schnitt, Referenz-zu-Video mit einer Audio-Referenz. H3 akzeptiert bis zu drei Audioclips als Referenzeingabe. Veo 3.1 hat überhaupt keine Audio-Eingabe, nur Audio-Ausgabe.
Plain1Cel-Shaded 2D-Anime-Montage geschnitten zur referenzierten Audiospur. Fünf kurze Beats: 2Regen auf einem Fenster, eine Hand, die einen Verband strafft, eine Stadtsilhouette, die an 3einem Zugfenster vorbeisaust, ein Sprintstart, ein Einfrieren auf einer ausgestreckten Hand. 4Jeder Schnitt landet exakt auf einem Downbeat des referenzierten Audios. Flache Farbe, dicke 5Tuschelinien, kontrastreiche Nachtpalette aus tiefem Indigo und Neon-Magenta.
- Zweizeilige japanische Dialogszene, 12 Sekunden. Das ist der Lippen-Synchron-Stresstest, und 12 Sekunden liegen bereits außerhalb von Veos Reichweite.
Plain1Cel-Shaded 2D-Anime, flache Farbe, kein 3D-Shading. Zwei original Charaktere auf einem 2Dach in der goldenen Stunde, Schuss-Gegenschuss. Der erste sagt auf Japanisch: 3「本当に行くの?」. Der zweite antwortet, halb lächelnd, auf Japanisch: 4「もう決めた」. Münder passen zu jeder Silbe. Warmes Randlicht, lange Schatten, sanfter 5Wind im Haar. Audio: zwei verschiedene japanische Stimmen, entfernter Verkehr, eine 6Zikade.
- Vertikaler Shonen-Kurzfilm,
9:16, 8 Sekunden. Beide Modelle können vertikal, also ist dies der einzige Ort, um sie tatsächlich A/B zu vergleichen, anstatt anzunehmen.
Plain1Cel-Shaded 2D-Anime, vertikale Komposition. Ein originaler Teenager-Sprinter bricht in 2Zeitlupe durch ein Papierbanner, dann schnappt der Frame zurück auf volle Geschwindigkeit, 3während sie eine Stadiongerade entlang beschleunigt. Geschwindigkeitslinien, flache 4Farbe, harte Schatten, kühner grafischer Himmel. Kamera: Untersicht-Verfolgungsaufnahme, 5dann ein Peitschen-Schwenk zu ihrem Gesicht. Audio: Bannerriss, Menschenmengenschwall, 6ein Atemzug, der angehalten und dann freigegeben wird. 7 8Wenn Sie die Prompt-Grammatik dahinter wollen, geht der [MiniMax H3 Prompt Guide](https://www.atlascloud.ai/blog/guides/minimax-h3-prompt-guide?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) tiefer darauf ein, wie H3 Kamera- und Audio-Anweisungen parst, als ich hier kann. 9 10## Was ein 60-Sekunden-Anime-Opening auf MiniMax H3 vs Veo 3.1 kostet 11 12Ein Standard-Anime-OP ist etwa 90 Sekunden lang. Nennen wir es acht Einstellungen von 8 Sekunden, 64 Sekunden fertiges Video, plus einen Keyframe pro Einstellung zu $0,009 pro Stück. 13 14Es gibt einen echten Preisunterschied, den Sie kennen sollten, anstatt dass ich ihn vertusche. Der Atlas Cloud-Katalog listet MiniMax H3 mit $0,10 pro Sekunde pauschal, während die Modell-Readme es mit $0,14/s bei 2K und $0,10/s bei 768P aufschlüsselt. Veo 3.1 wird mit $0,20 pro Sekunde aufgeführt, während seine Readme $0,40/s mit Audio und $0,20/s ohne trennt. 15 16Die Ausführen-Schaltflächen in meinen Screenshots klären das. H3 Referenz-zu-Video, 8 Sekunden bei 2K, zitiert `Run $1,12`, was genau $0,14 pro Sekunde sind. Veo 3.1 Bild-zu-Video, 8 Sekunden bei 1080p mit Audio an, zitiert `Run $3.2`, was genau $0,40 pro Sekunde sind. Die Readme-Raten sind also die, die abgerechnet werden, und der Katalog-Header ist die Einstiegsstufe. Ich habe trotzdem beide Ablesungen unten gezeigt. Dies sind Listenpreise ab August 2026. 17 18**Tabelle 4: Acht Einstellungen von 8 Sekunden, inklusive Keyframes** 19 20| Setup | Videokosten (Katalograte) | Videokosten (Readme-Rate) | Keyframes | Gesamtbereich | 21| ------------------------- | ------------------------- | ------------------------- | --------- | ------------------ | 22| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 bis $9.03 | 23| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 | 24| Veo 3.1, 1080p mit Audio | $12.80 | $25.60 | $0.07 | $12.87 bis $25.67 | 25| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 | 26 27Preise von den Atlas Cloud-Modellseiten, die in Tabelle 1 verlinkt sind, August 2026. Keiner dieser vier ist derzeit rabattiert. 28 29Zwei Dinge, die diese Tabelle nicht enthält, und beide schlagen härter zu als die Kosten pro Sekunde. 30 31**Wiederholungen.** Niemand liefert den ersten Take eines Anime-Shots aus. Welchen Multiplikator Sie auch annehmen, wenden Sie ihn auf beide Spalten an, und die Lücke vergrößert sich im gleichen Verhältnis. 32 33**Wandzeit, und diese geht in die andere Richtung.** Gemessen von Ende zu Ende am 7. August 2026: H3 bei 2K für 8 Sekunden dauerte 447 Sekunden, etwa 7,5 Minuten. H3 Text-zu-Video bei 2K für 12 Sekunden dauerte 334 Sekunden. Veo 3.1 bei 1080p für 8 Sekunden mit Audio dauerte 152 Sekunden, unter drei Minuten. Veo ist hier etwa dreimal so schnell zu einem ersten Take, und wenn Sie um 2 Uhr morgens an einer Einstellung iterieren, ist das echtes Geld wert. Warteschlangen bewegen sich, also behandeln Sie dies als eine Momentaufnahme eines Nachmittags, nicht als Spezifikation. Aber jeder, der „2 bis 3 Minuten“ für H3 bei 2K zitiert, zitiert eine Readme, keine Warteschlange. Der [2K vs 768P Breakdown](https://www.atlascloud.ai/blog/guides/minimax-h3-2k-vs-768p?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) behandelt, wann die höhere Stufe die zusätzlichen Minuten wert ist. 34 35## Anime-Stil, Hommage und was Sie tatsächlich veröffentlichen können 36 37Alles in diesem Artikel ist Stil und Hommage. Ein originaler Charakter, ein originales Trikot, ein originaler Titel. Es wurde kein offizieller Anime-Charakter generiert oder angefordert, und es wurde kein Name oder Abbild eines echten Fußballers verwendet. Der WM-Trend wird als _Format_ referenziert, denn das ist, wofür er nützlich ist. 38 39Diese Unterscheidung ist kein Schmuck. Wenn Sie kommerziell Anime-inspirierte Inhalte produzieren, sind „im Stil von 90er OVA“ und „dieser bestimmte Charakter aus dieser bestimmten Serie“ unterschiedliche rechtliche Objekte, und nur eines davon ist ein Geschäft. 40 41Zu den offenen Gewichten: H3 ist wirklich herunterladbar, und die Leute haben es am ersten Tag ausgeführt. Ein Kommentator berichtete von 10 Minuten für einen 10-Sekunden-480p-Clip auf einer 4070 Ti Super mit 16 GB, und andere posteten 3 Minuten auf einer 5080 und 68 Sekunden auf einer RTX 6000 Pro. Aber Self-Hosting läuft mit einer 768 kurzen Kante; die Context-IR- und Regenerate-2K-Stufen, die 2K produzieren, bleiben auf der API-Seite. 42 43Die Lizenz hat einen echten Haken. Die Community-Lizenz deckt derzeit nicht die EU, Großbritannien, Südkorea oder die USA ab, mit Verweis auf Regionen, die „derzeit KI-bezogene Vorschriften entwickeln oder durchsetzen“. Ein formeller Lizenzierungsantragskanal ist offen, was ein HN-Kommentator als „Sie müssen nur mit dem kleinen Finger versprechen, dass Sie Disney nicht wütend machen, und sie werden Ihnen eine Lizenz schicken“ zusammenfasste. Lustig, und auch genau der Compliance-Schritt, den Sie nicht überspringen können, wenn Sie in einem dieser vier Gebiete sind. Der [Open Weights Write-up](https://www.atlascloud.ai/blog/guides/minimax-h3-open-source-weights?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) hat die vollständige Gebietsliste. 44 45## Häufig gestellte Fragen 46 47### Ist MiniMax H3 ein guter Anime-Videogenerator im Vergleich zu Veo 3.1? 48 49Für die meisten Anime-Arbeiten ist H3, und zwar hauptsächlich aus Gründen, die nichts mit dem Rendern zu tun haben. Es läuft 4 bis 15 Sekunden gegenüber Veos 4, 6 oder 8, es bietet sechs Seitenverhältnisse einschließlich 4:3 und 21:9 gegenüber Veos zwei, es listet Japanisch unter 11 nativ stabilen Dialogsprachen auf, und es akzeptiert neun Referenzbilder gegenüber Veos drei. Veo 3.1 gewinnt in einer bestimmten Situation: wenn Sie `seed` für reproduzierbare Wiederholungen oder `negative_prompt` benötigen, um zu verhindern, dass ein Shot in 3D-Render-Shading abdriftet. H3 hat keinen der beiden Parameter. Wenn Ihre Pipeline von einem der beiden abhängt, ist das ein echter Grund, dabei zu bleiben. 50 51### Kann Veo 3.1 Anime in 4:3 oder einen 15-Sekunden-Clip generieren? 52 53Nein, und nicht aus stilistischen Gründen. Veo 3.1s `aspect_ratio`-Enum enthält genau `16:9` und `9:16`, und sein `duration`-Enum enthält genau `4`, `6` und `8`. Es gibt keinen 4:3-Wert zur Auswahl und keine Möglichkeit, 12 oder 15 Sekunden anzufordern. Wenn Ihre Referenz ein 90er Jahre TV-Anime oder OVA ist, ist der Bildausschnitt auf Veo unerreichbar und auf H3 verfügbar. 54 55### Warum kam mein Veo 3.1 Anime-Clip stumm zurück? 56 57Weil `generate_audio` standardmäßig auf `false` in der API eingestellt ist. Der Playground-Toggle ist normalerweise bereits eingeschaltet, also betrifft dies nur Leute, die die API direkt aufrufen. Setzen Sie `generate_audio: true` explizit. Setzen Sie nebenbei auch `resolution`, da es standardmäßig `720p` ist, nicht die 1080p oder 4k, die Sie wahrscheinlich meinten. 58 59### Unterstützt MiniMax H3 japanischen Dialog und Lippen-Synchronisation für Anime? 60 61Ja. Die Modellkarte listet 11 Sprachen mit stabiler Dialogunterstützung auf: Arabisch, Chinesisch, Englisch, Französisch, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch, Russisch und Spanisch. Audio wird gemeinsam mit dem Bild bei 32 kHz Stereo erzeugt, nicht nachträglich synchronisiert, weshalb die Mundbewegungen über eine ganze Zeile hinweg halten, anstatt nur die ersten Silben. Schreiben Sie die japanische Zeile direkt in den Prompt auf Japanisch. 62 63### Wie viele Referenzbilder kann ich verwenden, um einen Anime-Charakter konsistent zu halten? 64 65MiniMax H3 akzeptiert bis zu 9 Bilder, bis zu 3 Videoclips und bis zu 3 Audioclips, mit einer harten Obergrenze von 12 Dateien über alle Typen hinweg. Veo 3.1s Referenz-zu-Video-Endpunkt akzeptiert 1 bis 3 Bilder, und die Auswahl reduziert `duration` auf `8` als einzigen gültigen Wert. Für einen wiederkehrenden Anime-Charakter über eine Serie hinweg ist dieser Unterschied das ganze Spiel. 66 67### MiniMax H3 hat offene Gewichte, kann ich meine Anime-Pipeline also lokal kostenlos ausführen? 68 69Sie können es herunterladen und ausführen, mit drei Einschränkungen. Self-Hosted-Inferenz läuft mit einer 768 kurzen Kante, und die Context-IR- und Regenerate-2K-Stufen, die 2K-Ausgabe produzieren, bleiben API-seitig. Reale lokale Geschwindigkeiten variieren stark je nach Karte: ungefähr 10 Minuten für einen 10-Sekunden-480p-Clip auf einer 4070 Ti Super, etwa 3 Minuten auf einer 5080, etwa 68 Sekunden auf einer RTX 6000 Pro, laut dem ComfyUI-Thread am Tag 0. Und die Community-Lizenz deckt derzeit nicht die EU, Großbritannien, Südkorea oder die USA ab. Wenn Sie also in einem dieser Länder sind, benötigen Sie die formelle Lizenz vor der kommerziellen Nutzung.






