Seedance 2.0 Mini & Fast API zu weltweit niedrigsten Preisen — bis zu 68 % Rabatt auf den offiziellen Preis

MiniMax H3 vs Gemini Omni Flash: Google gewinnt das Board um 5 Punkte. Dann bittet der Kunde um eine Änderung.

MiniMax H3 gegen Gemini Omni Flash auf drei Ranglisten, und alle drei Abstände liegen innerhalb der Fehlertoleranz. Also habe ich einen Durchlauf mit beiden gemacht und dann die gleiche Überarbeitungsnotiz zurückgesendet.

Ich starrte zehn Minuten lang auf drei Artificial-Analysis-Bestenlisten und versuchte herauszufinden, wer eigentlich gewonnen hatte.

Text-zu-Video: Gemini Omni Flash mit 5 Punkten. Bild-zu-Video: Gemini mit 2 Punkten. Videobearbeitung: MiniMax H3 mit 9 Punkten.

Dann schaute ich auf die Spalte mit dem Konfidenzintervall. Plus/Minus 7. Plus/Minus 9. Plus/Minus 10.

Drei Tafeln, drei Lücken, jede davon innerhalb ihrer eigenen Fehlertoleranz. Bei einer Blindabstimmung sind diese beiden Modelle ein und dasselbe Modell.

Also schloss ich die Bestenlisten und öffnete stattdessen die Dropdown-Menüs. Diese Lücke beträgt nicht 5 Punkte. Diese Lücke ist eine ganze Auflösungsstufe.

Die wichtigsten Erkenntnisse

  • Alle drei Lücken der Artificial Analysis (+5, +2, +9, Stand 6. August 2026) liegen innerhalb der Konfidenzintervalle von ±7 bis ±10. Was die reine Qualität angeht, ist das ein Unentschieden, kein Sieg.
  • H3 liefert 2K, bis zu 15 Sekunden und sechs Seitenverhältnisse. Die API von Gemini Omni Flash ist auf 720p, 10 Sekunden und zwei Seitenverhältnisse begrenzt. Das sind Enum-Werte, keine Meinungen.
  • H3 akzeptiert Audio als Eingabe. Gemini nicht. Gemini hat seed und thinking_level. H3 hat beides nicht.
  • Gemini hat einen dedizierten video-edit-Endpunkt, der dein Quellclip verändert. Der Revisionspfad von H3 ist reference-to-video, der mit deinem Clip als Referenz neu generiert. Es handelt sich nicht um denselben Vorgang, und die zweite Runde zeigt das.
  • Nur eines der beiden Modelle hat herunterladbare Gewichte, und es ist nicht das von Google.

Seitenvergleich einer nächtlichen Imbissbude in verschiedenen Auflösungen

Runde eins des Tests MiniMax H3 vs. Gemini Omni Flash, beide Modelle animieren das identische erste Bild, nebeneinander dargestellt

Runde eins: gleiches erstes Bild, gleicher Prompt, gleiche Dauer. Links MiniMax H3 in 2K, rechts Gemini Omni Flash in 720p. Hier als stummes GIF dargestellt; beide gelieferten Dateien enthalten natives Audio und sind weiter unten als abspielbare Videos eingebettet. Das ist das Problem. Beide sind gut.


Warum die Lücke in der Bestenliste zwischen MiniMax H3 und Gemini Omni Flash falsch interpretiert wird

Fast jeder Beitrag zu MiniMax H3 vs. Gemini Omni Flash, den du findest, zitiert eine Bestenliste und einen Preis. Beide Gewohnheiten führen zur falschen Antwort.

Hier sind alle drei Artificial-Analysis-Tafeln, mit der Spalte, die jeder überspringt.

Tabelle A: MiniMax H3 vs. Gemini Omni Flash in drei Artificial-Analysis-Bestenlisten (mit Audio), Stand 6. August 2026

BestenlisteGemini Omni FlashMiniMax H3LückeInnerhalb der Fehlertoleranz?
Text-zu-Video1.243 (#1) ±7, 11.842 Stimmen1.238 (#2) ±9, 6.830 StimmenGemini +5Ja
Bild-zu-Video1.191 (#2) ±9, 6.506 Stimmen1.189 (#3) ±10, 5.545 StimmenGemini +2Ja
Videobearbeitung1.123 (#2) ±5, 11.706 Stimmen1.132 (#1) ±6, 9.128 StimmenH3 +9Ja, knapp

MiniMax H3 ist eines von über 30 Videomodellen, die du im Atlas Cloud Model Comparison mit demselben Prompt nebeneinander ausführen kannst – mit den Kosten pro Sekunde, die vor der Generierung angezeigt werden.

Elo-Werte aus der Artificial Analysis Video Arena (Artificial Analysis, August 2026). Bild-zu-Video wird von Dreamina Seedance 2.0 720p mit 1.197 Punkten angeführt, also hält keiner der beiden diese Krone. Dies sind fortlaufende Crowd-Voting-Ergebnisse, die sich ändern, und genau deshalb ist ein 5-Punkte-Vorsprung kein Urteil.

Ein 5-Punkte-Vorsprung mit einem ±9-Intervall bedeutet, dass die Rangfolge nächste Woche allein aufgrund von Stimmrauschen kippen könnte. Das ist nicht „Gemini ist besser bei Text-zu-Video". Das ist ein Münzwurf mit einer Anzeigetafel.

Drei weitere Dinge, die Leute falsch verstehen:

Die Spalte „Dollar pro Minute" ist nicht das, was du bezahlst. Artificial Analysis listet 6,00 $/Min. für Gemini und 7,80 $/Min. für H3. Diese Zahl normalisiert die Kosten für eine Minute 1080p bei Standardeinstellungen. Gemini Omni Flash kann überhaupt kein 1080p produzieren. Die Zahl ist also eine Modellschätzung, keine Rechnung. Vergleiche fertige Ergebnisse, nicht Sekunden.

Eine Tafel ist nicht das Modell. H3 liegt auf den drei Tafeln auf Platz zwei, drei und eins. Gemini liegt auf Platz eins, zwei und zwei. Zitiere nur eine davon, und du kannst alles beweisen, was du ohnehin schon geglaubt hast.

„Omni" bedeutet nicht „frisst alles". Es ist ein guter Name und einer, der in die Irre führt. Nur eines von beiden nimmt Audiodateien als Eingabe. Es ist nicht das mit „Omni" im Namen.

Das Datenblatt von MiniMax H3 vs. Gemini Omni Flash, das niemand ausdruckt

Wenn die Elo-Werte sie nicht trennen können, schaffen es die Einschränkungstabellen. Ich habe die Live-Eingabeschemas beider Modelle abgerufen, anstatt irgendeinem Startbeitrag zu vertrauen, und die Unterschiede sind nicht subtil.

Tabelle B: MiniMax H3 vs. Gemini Omni Flash – harte Einschränkungen, aus den Live-API-Schemas vom 6. August 2026

EinschränkungMiniMax H3Gemini Omni Flash
Auflösung768P oder 2K720p, und das ist der einzige Wert im Enum
Dauer4 bis 15 Sekunden3 bis 10 Sekunden
Seitenverhältnisse21:9, 16:9, 4:3, 1:1, 3:4, 9:16Nur 16:9 und 9:16
Revisionspfadreference-to-video (regeneriert mit Referenzen)Dedizierter video-edit-Endpunkt (ändert deine Quelle)
Letztes Bild steuernend_image unterstütztNicht verfügbar
Referenzlimits≤9 Bilder, ≤3 Videos, ≤3 Audios, insgesamt 12 Dateien1 bis 10 Bilder
AudioeingabeJaNein
Reproduzierbarkeit seedNeinJa
thinking_levelNeinJa (standard/hoch/niedrig)
Offene GewichteJa, auf Hugging FaceNein

Lies diese Tabelle ehrlich, und Gemini gewinnt in drei Zeilen eindeutig. Reproduzierbare Seeds sind wichtig, wenn du eine Pipeline baust, die dasselbe Bild zweimal rendern muss. Ein echter video-edit-Endpunkt ist ein grundlegend anderes Werkzeug als eine referenzgesteuerte Neugenerierung. Und thinking_level gibt dir einen Qualitätsregler, den H3 einfach nicht bietet.

H3 gewinnt fünf Zeilen, und das sind die Zeilen, die darüber entscheiden, ob du die Datei liefern kannst, die der Kunde verlangt hat.

Ich habe alles unten auf Atlas Cloud ausgeführt, weil beide Modelle dort hinter demselben /api/v1/model/generateVideo-Endpunkt liegen, was eine Polling-Schleife und einen Auth-Header für den gesamten Test bedeutete. Das Tauschen der Modelle war eine Änderung des model-Strings. Dieses Detail ist der einzige Grund, warum „beide verwenden" eine realistische Antwort ist und keine Ausrede.

Tabelle C: Was jeder Endpunkt in diesem Test kostet, überprüft anhand der aktuellen Preisliste vom 6. August 2026

EndpunktPreisDieser 10-Sekunden-Clip im Test
openai/gpt-image-2/text-to-image$0,009 / Bild$0,01
minimax/h3/image-to-video$0,14 / s$1,40
minimax/h3/reference-to-video$0,14 / s$1,40
google/gemini-omni-flash/image-to-video$0,13 / s$1,30
google/gemini-omni-flash/video-edit$0,14 / s$1,40
google/gemini-omni-flash/text-to-video$0,125 / snicht verwendet
minimax/h3/text-to-video$0,14 / snicht verwendet

Keines der Modelle bietet diesen Monat einen Rabatt. Gemini bietet auch eine günstigere Entwicklerstufe (0,112 $/s für Text-zu-Video und Bild-zu-Video, 0,12 $/s für Referenz-zu-Video); H3 hat keine entsprechende Stufe.

Die Grenze der offenen Gewichte, die Gemini Omni Flash nicht überschreiten kann. Die Gewichte von H3 sind auf Hugging Face veröffentlicht (MiniMax, August 2026): ein 33B dichter Single-Stream Omni Transformer, plus der Qwen3-VL-32B Text-Encoder, ein visueller VAE und ein Audio-VAE. Zwei Einschränkungen sind wichtiger als die Download-Größe. Erstens: Was du selbst hostest, läuft mit einer kurzen Seite von 768 Pixeln; die Context-IR-Vorverarbeitungsstufe und das Regenerate-2K-Modul sind nicht in der Veröffentlichung enthalten, und die 2K-Ausgabe stammt von diesen beiden. Zweitens: Die Community-Lizenz deckt derzeit nicht die EU, Großbritannien, Südkorea oder die USA ab, und es gibt ein separates Antragsformular für diese Gebiete. Lies sie, bevor du ein Produkt darauf aufbaust. Gemini Omni Flash hat kein entsprechendes Gespräch, weil es keine Datei zum Herunterladen gibt.

Diese Position der offenen Gewichte, gepaart mit aggressiven Preisen, ist die gesamte strategische Geschichte des Starts (South China Morning Post, August 2026).

Führe den MiniMax H3 vs. Gemini Omni Flash Revisionstest selbst durch

Hier ist der Teil, den niemand durchgeführt hat. Jeder vergleicht die erste Generation. Niemand vergleicht die zweite.

Echte Arbeit ist nicht ein Prompt. Echte Arbeit ist ein Clip, den du bereits magst, plus ein Kunde, der zurückschreibt: „Gefällt mir, kann das Schild 24H sagen und ihre Schürze rot sein?" Dieser einzelne Satz ist der Punkt, an dem diese beiden Modelle aufhören, austauschbar zu sein, und es ist zufällig genau die Aufgabe, die die Bestenliste für Videobearbeitung misst.

Die Szene ist bewusst grausam: ein verregneter Nudelstand bei Nacht, die Verkäuferin spricht direkt in die Kamera, ein handbemaltes Schild mit lesbaren Worten hinter ihr, Dampf von der Brühe, Regen auf dem Vordach. Ein Bild, das Lippen-Sync, Stabilität von Bildschirmtext, flüssige Bewegung und mehrschichtiges Umgebungsaudio auf einmal belastet.

Beide Modelle erhalten das identische erste Bild, den identischen Prompt und die identische Revisionsanmerkung. Jeder Durchlauf unten dauert 10 Sekunden, was die Obergrenze von Gemini Omni Flash ist und weit innerhalb der von H3 liegt.

Schritt 1: Erstes Bild mit GPT Image 2 festlegen

Beide Modelle müssen vom selben Bild ausgehen, sonst misst Runde eins das Kompositionsglück und nicht das Modell. Öffne die GPT Image 2 Playground, setze die Qualität auf hoch und das Seitenverhältnis auf 16:9, und füge dies ein:

Plain
1Photorealistischer nächtlicher Straßenimbiss bei starkem Regen, aufgenommen mit einem 35-mm-Objektiv bei Blende 2.0. Eine Frau Ende dreißig in einer indigofarbenen Canvas-Schürze steht hinter einem dampfenden Nudelstand, schaut direkt in die Linse, mitten im Satz. Hinter ihr leuchtet ein handbemaltes, warm orangefarbenes Blechschild mit den Worten "OPEN LATE" in sauberen, fetten serifenlosen Großbuchstaben. Regenstreifen ziehen durch das Natrium-Straßenlicht, Dampf steigt vom Brühtopf auf, nasser Asphalt spiegelt rotes und grünes Neon von gegenüber. Geringe Schärfentiefe, nur praktisches Licht, leichter Linsenschleier, natürliche Hauttextur, kein Text sonst im Bild. 16:9.

KI-Bildgenerator-Oberfläche mit Prompt und generiertem Bild

GPT Image 2 Playground auf Atlas Cloud mit dem Nudelstand-Prompt auf der linken Seite und dem generierten ersten Bild im Ausgabefenster

GPT Image 2 auf Atlas Cloud: der Prompt links, das gemeinsame erste Bild im AUSGABE-Fenster. Kosten für diesen Schritt , $0,009.

Eine Frau steht nachts an einem dampfenden Straßenimbiss

Das generierte erste Bild: eine Frau in einer indigofarbenen Schürze hinter einem dampfenden Nudelstand bei Nacht im Regen, mit einem handbemalten OPEN LATE-Schild, das hinter ihr leuchtet

Die einzige Eingabe, die beide Modelle erhalten haben. Beachte die beiden Dinge, die die Revision anvisieren wird: das "OPEN LATE"-Schild und die indigofarbene Schürze. Generiert mit openai/gpt-image-2/text-to-image.

Schritt 2: Runde eins mit MiniMax H3

Gehe zum MiniMax H3 Playground, wähle die Aufgabe image-to-video, lade das Bild aus Schritt 1 hoch und setze resolution auf 2K, duration auf 10, ratio auf adaptive (das Bild-zu-Video-Enum bietet nur adaptive). Prompt:

Plain
1Die Verkäuferin schaut in die Linse und sagt mit warmer, müder Stimme: "Die Brühe köchelt seit vier Uhr morgens. Setz dich, es regnet immer noch." Sie hebt die Kelle, während sie spricht. Dampf kräuselt sich über das Bild. Regen fällt weiter auf das Vordach hinter ihr. Die Kamera bleibt ruhig, kein Schwenk, keine Fahrt. Umgebungsaudio: Regen auf Plane, köchelnde Brühe, entfernter Verkehr, ihre Stimme nah und trocken.

KI-Videogenerierungsoberfläche mit Texteingabe und Videoausgabe

MiniMax H3 image-to-video Playground auf Atlas Cloud mit ausgewählter 2K-Auflösung und dem fertigen Clip im Ausgabefenster

MiniMax H3 image-to-video auf Atlas Cloud: 2K ausgewählt, der fertige Clip im AUSGABE-Fenster. Dieser Screenshot lief mit der 8-Sekunden-Standardeinstellung des Playgrounds und kostete $1,12; die 10-Sekunden-Version, die für den Vergleich verwendet wurde, ist unten eingebettet und kostete $1,40.

MiniMax H3, Runde eins, 2K, 10 Sekunden. Ton einschalten: Der Dialog, der Regen und die Brühe werden alle im selben Durchlauf generiert, nicht nachträglich überlagert.

Schritt 3: Runde eins mit Gemini Omni Flash, gleiches Bild, gleiche Worte

Öffne den Gemini Omni Flash Playground, wähle image-to-video, lade dasselbe Bild aus Schritt 1 hoch und füge den Prompt aus Schritt 2 ein, ohne ein Zeichen zu ändern. Einstellungen: resolution 720p, duration 10, aspect_ratio 16:9, thinking_level standard, seed -1.

Zwei Dinge, die dir in diesem Formular auffallen sollten, denn sie sind der Artikel im Kleinen. Das Dropdown-Menü für resolution enthält genau eine Option. Das Feld duration endet bei 10. Ich habe 720p nicht einer besseren Option vorgezogen; es gibt nichts anderes zur Auswahl.

Ein Hinweis dazu, was hier fehlt: Ich konnte für keinen der Gemini-Schritte einen Screenshot des Playgrounds mit abgeschlossenem Lauf machen. Die Staging-Umgebung, in der ich Screenshots mache, gab bei allen drei Versuchen 403 PERMISSION_DENIED von Googles Seite zurück, daher zeigen die einzigen Gemini-Screenshots, die ich habe, ein fehlgeschlagenes AUSGABE-Fenster, und ich werde nicht eines als erfolgreichen Lauf tarnen. Die Clips unten sind echt, über die Produktions-API mit den oben aufgeführten Einstellungen generiert. Die beiden H3-Schritte wurden sauber erfasst, und diese Screenshots sind echt.

Gemini Omni Flash, Runde eins, 720p, 10 Sekunden, identische Eingaben. Spiele dies direkt nach dem H3-Clip oben ab und beurteile das Audio selbst.

Schritt 4: Runde zwei, sende die Revision an Gemini Omni Flash

Dies ist die Runde, die zählt. Wechsle auf derselben Gemini-Modellseite zur Aufgabe video-edit, lade den Clip, den Gemini selbst in Schritt 3 produziert hat als video-Eingabe hoch, setze resolution 720p und thinking_level hoch (eine zweiteilige Bearbeitungsanweisung ist genau der komplexe Fall, für den dieser Regler gedacht ist). Füge diese Anmerkung genau so ein, wie ein Kunde sie senden würde:

Plain
1Behalte diese exakte Einstellung bei: gleiche Kameraposition, gleiche Frau, gleiches Gesicht, gleicher Regen, gleiche Beleuchtung, gleiches Audio. Ändere das handbemalte Schild so, dass es "OPEN 24H" statt "OPEN LATE" anzeigt, im gleichen bemalten Stil und dem gleichen warmen orangefarbenen Leuchten. Ändere ihre Schürze von indigoblau zu tiefem Karminrot. Ändere nichts anderes im Bild.

Gemini Omni Flash nach der Revisionsanmerkung. Beachte das Schild, dann die Schürze, und prüfe dann, ob sich sonst etwas bewegt hat.

Schritt 5: Runde zwei, sende die identische Revision an MiniMax H3

Hier ist der ehrliche strukturelle Unterschied, und du solltest ihn kennen, bevor du das Ergebnis liest. H3 hat keinen video-edit-Endpunkt. Sein Revisionspfad ist reference-to-video: Du übergibst ihm den Originalclip als Referenz, und es generiert ein neues Video, das auf dieser Referenz basiert. Es bearbeitet deine Datei nicht. Es erstellt eine neue, die so aussehen soll wie deine.

Wähle auf der MiniMax H3-Seite die Aufgabe reference-to-video, füge den Clip, den H3 in Schritt 2 produziert hat zu refers als Videoreferenz hinzu, setze dann resolution 2K, duration 10, ratio adaptive. Füge den Prompt aus Schritt 4 ohne Änderungen ein.

Auch für diesen Schritt gibt es keinen Playground-Screenshot, aus einem anderen und langweiligeren Grund: Der Headless-Browser, mit dem ich Screenshots mache, ist beim Laden einer Videoreferenz dreimal im Referenz-Uploader abgestürzt. Der Lauf selbst ging ohne Probleme durch die API.

MiniMax H3 nach der identischen Revisionsanmerkung, über reference-to-video in 2K.

Vergleich einer Frau, die an einem verregneten nächtlichen Imbiss kocht

Nebeneinander von Runde zwei: das Gemini Omni Flash video-edit-Ergebnis neben dem MiniMax H3 reference-to-video-Ergebnis, beide von derselben Revisionsanmerkung

Runde zwei nebeneinander, stummes GIF. Links Gemini Omni Flash via video-edit, rechts MiniMax H3 via reference-to-video. Beide hatten denselben Satz als Grundlage.

Was in Runde zwei tatsächlich passiert ist. Ich bin mit der Erwartung rangegangen, dass H3 diese Runde verliert. Referenzgesteuerte Neugenerierung ist ein stumpferes Werkzeug als ein echter Bearbeitungsendpunkt, und „generiere den ganzen Clip neu und hoffe, dass er an derselben Stelle landet" ist genau das, wie du ein anderes Gesicht, eine wandernde Kamera und einen Kunden bekommst, der fragt, was mit der Einstellung passiert ist.

Das ist nicht zurückgekommen. Beide Modelle haben die Aufgabe erledigt, und beide haben es sauber gemacht.

Geminis video-edit hat sich genau so verhalten, wie beworben. Das Schild zeigt OPEN 24H in derselben handgemalten Schrift, mit demselben warmen orangefarbenen Leuchten und derselben Verwitterung auf dem Blech. Die Schürze ist tiefes Karminrot. Alles andere ist unberührt: gleiches Gesicht, gleicher Ausdruck, gleicher Kellenwinkel, gleiche Dampfform, gleicher Regen, gleiche Rücklichter im Hintergrund. Es liest sich wie die Originaldatei mit zwei pixelgenauen Korrekturen, weil es im Wesentlichen das ist.

H3s reference-to-video produzierte dieselben beiden Änderungen und hielt die Einstellung weit besser, als es die Architektur vermuten lässt. Schild geändert, Schürze geändert, und über alle 10 Sekunden blieben die Bildkomposition, das Ausgießen der Brühe von der Kelle, die Dampffahne und ihr Gesicht im Vergleich zum Clip aus Runde eins konsistent. Wenn es hier eine Abweichung gibt, konnte ich sie durch das Durchgehen der Einzelbilder nicht finden.

Runde zwei ist also ein drittes statistisches Unentschieden, und ich werde nicht so tun, als ob es anders wäre, nur um eine griffigere Geschichte zu erzählen. Was die beiden Ausgaben unterscheidet, ist nicht die Bearbeitungsqualität. Es ist, dass H3 2560x1440 mit einer 32-kHz-Stereospur zurückgegeben hat und Gemini 1280x720. Gleiche Anweisung, gleicher Erfolg, unterschiedliches Ergebnis.

Ein ehrlicher Vorbehalt zur Methode: Dies ist eine einzelne Revision an einer einzelnen Einstellung, keine kontrollierte Studie. Eine zweiteilige Änderung an einem Schild und einem Kleidungsstück ist eine ziemlich einfache Bearbeitung. Schwierigere Fälle (Entfernen eines Objekts, an dem die Kamera vorbeifährt, Ändern von etwas, das das Motiv verdeckt, vier Runden von Anmerkungen, die aufeinander aufbauen) sind die Fälle, in denen ein dedizierter Bearbeitungsendpunkt die Nase vorn haben sollte und in denen die Neugenerierung ins Wanken geraten sollte. Führe deine eigenen Tests durch, bevor du dich entscheidest.

Drei weitere MiniMax H3 vs. Gemini Omni Flash Unterschiede, die es wert sind, getestet zu werden

Runde zwei ist der Unterschied, der eine Lieferung verändert. Drei weitere sind zwanzig Minuten deines eigenen Guthabens wert.

Füttere es mit einer Audiodatei. H3s reference-to-video akzeptiert bis zu drei Audioclips von 2 bis 15 Sekunden Länge, solange mindestens eine Bild- oder Videoreferenz mitgeliefert wird. Das bedeutet, dass du ihm eine echte Sprachaufnahme geben und die Figur sie vortragen lassen kannst. Gemini Omni Flash hat auf keinem seiner vier Endpunkte ein Audioeingabefeld, daher kann dieser Vergleich überhaupt nicht durchgeführt werden. Das ist kein Punktabzug für Google; es ist eine Fähigkeit, die einfach nicht vorhanden ist.

Frage nach 21:9. H3s reference-to-video-Verhältnis-Enum enthält 21:9, 16:9, 4:3, 1:1, 3:4 und 9:16. Geminis aspect_ratio-Enum enthält 16:9 und 9:16. Wenn dein Ergebnis ein Breitbild-Titelvorspann oder ein 1:1-Social-Media-Schnitt ist, ist eines dieser beiden Modelle nicht im Gespräch.

Fixiere einen Seed und führe erneut aus. Dieser geht in die andere Richtung. Gemini gibt seed frei; H3 gibt es auf keinem Endpunkt frei. Wenn du eine Pipeline baust, in der dieselbe Anfrage dienstags dieselben Bilder zurückgeben muss wie montags, gibt dir Gemini einen Hebel und H3 gibt dir nichts. Für Regressionstests, A/B-Kopievarianten oder jede automatisierte Renderfarm ist das ein echter Vorteil, und er gehört auf die Google-Seite der Bilanz.

Was ein MiniMax H3 vs. Gemini Omni Flash Test tatsächlich kostet

Das gesamte Experiment oben, vier Videogenerierungen und ein Bild, belief sich auf etwa $5,51. Ein erstes Bild für $0,009, zwei 10-Sekunden-Clips in Runde eins für $1,40 und $1,30, zwei 10-Sekunden-Clips in Runde zwei für je $1,40.

Pro Sekunde ist Gemini billiger: $0,125 bis $0,14 gegenüber pauschal $0,14 für H3, also je nach Endpunkt etwa 7 bis 11 Prozent weniger. Diese Zahl stimmt, und sie ist auch fast nutzlos für sich allein.

Hier ist der Grund. Angenommen, das Ergebnis ist ein 15-sekündiger 21:9-Kino-Opener in 2K. H3 rendert es als einen Clip. Gemini kann es überhaupt nicht rendern: weder die Auflösung, noch die Dauer, noch das Seitenverhältnis. Du müsstest einen 10-Sekunden- und einen 5-Sekunden-16:9-Clip zusammennähen, zuschneiden, um das Breitbild vorzutäuschen, und 720p ausliefern. Der Preis pro Sekunde für etwas, das du nicht liefern kannst, ist keine Ersparnis.

Drehe es um. Angenommen, das Ergebnis ist ein 16:9-Social-Media-Schnitt, der vier Runden von Kundenanmerkungen durchläuft und in drei Wochen byte-identisch zurückkommen muss, wenn das Legal-Team darum bittet, es neu zu rendern. Geminis video-edit plus seed ist genau für diese Schleife gemacht, und es kostet dabei weniger pro Sekunde.

Tabelle D: Welcher MiniMax H3 vs. Gemini Omni Flash Job wohin geht

Die anstehende AufgabeSende es an
2K-LieferungMiniMax H3
Eine einzelne Einstellung länger als 10 SekundenMiniMax H3
21:9-, 4:3-, 1:1- oder 3:4-BildausschnittMiniMax H3
Einbetten einer echten AudiospurMiniMax H3
Selbst hosten auf eigenen GPUsMiniMax H3
Auf einem bestimmten letzten Bild landenMiniMax H3
Gesprächsartige mehrstufige RevisionenGemini Omni Flash
Bewahren der unberührten Teile eines ClipsGemini Omni Flash
Reproduzierbare Renderings via SeedGemini Omni Flash
Einfaches 16:9-Kurzformat zum niedrigsten Preis pro SekundeGemini Omni Flash

Die Schlussfolgerung dieses Artikels ist diese Tabelle, nicht eine Punktzahl. Wenn ein Benchmark zwei Modelle nicht um mehr als seine eigene Fehlertoleranz trennen kann, hat der Benchmark dir alles gesagt, was er weiß, und das Datenblatt übernimmt ab hier.

Für einen breiteren Überblick darüber, wo H3 im Vergleich zum Rest des Feldes steht, findest du in der Aufschlüsselung der MiniMax H3-Alternativen die Modelle, die es auf den Tafeln schlagen, die es nicht anführt.

Häufig gestellte Fragen

Ist MiniMax H3 besser als Gemini Omni Flash?

Blindabstimmungen können sie nicht trennen. In drei Artificial-Analysis-Bestenlisten betragen die Lücken 5, 2 und 9 Elo-Punkte, und jede liegt innerhalb eines Konfidenzintervalls von ±7 bis ±10. Entscheide nach Spezifikationen, nicht nach Rang. Die Auflösungsobergrenze, das Dauerlimit und die Liste der Seitenverhältnisse werden dein Ergebnis verändern; 5 Elo-Punkte werden es nicht.

Welches ist günstiger, MiniMax H3 oder Gemini Omni Flash?

Pro Sekunde: Gemini. Auf Atlas Cloud kostet es $0,125 bis $0,14 pro Sekunde gegenüber H3s pauschal $0,14, mit einer Entwicklerstufe bei $0,112 pro Sekunde, für die H3 kein Äquivalent hat. Aber Gemini ist auf 720p, 10 Sekunden und zwei Seitenverhältnisse begrenzt, daher vergleichst du für viele Ergebnisse nicht dasselbe Produkt. Bewerte den fertigen Schnitt, nicht die Sekunde.

Kann Gemini Omni Flash 1080p, 2K oder 15-sekündige Videos generieren?

Nein. Der API-Parameter resolution hat einen zulässigen Wert, 720p, und duration akzeptiert 3 bis 10 Sekunden. MiniMax H3 bietet 768P oder 2K und 4 bis 15 Sekunden. Dies sind Enum-Einschränkungen, die aus dem Live-Schema vom 6. August 2026 gelesen wurden, keine redaktionelle Meinung, und Google kann sie später aufheben.

Kann ich Gemini Omni Flash selbst hosten, so wie ich MiniMax H3 selbst hosten kann?

Nein. Die Gewichte von H3 sind auf Hugging Face und laufen lokal mit einer kurzen Seite von 768 Pixeln. Die Context-IR-Stufe und das Regenerate-2K-Modul, die die 2K-Ausgabe erzeugen, sind nicht in der Veröffentlichung enthalten und bleiben API-seitig. Überprüfe auch die Lizenz: Sie deckt derzeit nicht die EU, Großbritannien, Südkorea oder die USA ohne einen separaten Antrag ab.

Muss ich mich für nur eines entscheiden?

Nein, und die Aufteilung-nach-Job-Tabelle oben ist die bessere Antwort. Beide Modelle liegen auf Atlas Cloud hinter demselben generateVideo-Endpunkt, daher bedeutet die Verwendung beider eine Polling-Schleife und einen anderen model-String, nicht zwei Integrationen. Die Routenführung nach Ergebnis schlägt die Wette auf eine Bestenliste, die sich jede Woche ändert.

Neueste Modelle

Eine API für alle Media-KI.

Alle Modelle erkunden