MiniMax H3 vs Gemini Omni Flash : Google gagne le tableau par 5 points. Puis le client demande un changement.

MiniMax H3 contre Gemini Omni Flash sur trois classements, et les trois écarts se situent dans la marge d'erreur. J'ai donc effectué un seul passage sur les deux, puis j'ai renvoyé la même note de révision.

J'ai regardé trois classements Artificial Analysis pendant dix minutes en essayant de déterminer qui avait vraiment gagné.

Texte-vers-vidéo : Gemini Omni Flash par 5 points. Image-vers-vidéo : Gemini par 2 points. Montage vidéo : MiniMax H3 par 9 points.

Puis j'ai regardé la colonne des intervalles de confiance. Plus ou moins 7. Plus ou moins 9. Plus ou moins 10.

Trois classements, trois écarts, chacun à l'intérieur de sa propre barre d'erreur. Lors d'un vote à l'aveugle, ces deux modèles sont le même modèle.

J'ai donc fermé les classements et ouvert les menus déroulants à la place. Cet écart n'est pas de 5 points. Cet écart représente tout un palier de résolution.

Points clés

  • Les trois écarts d'Artificial Analysis (+5, +2, +9, capture du 6 août 2026) se situent tous à l'intérieur des intervalles de confiance ±7 à ±10. En termes de qualité brute, c'est une égalité, pas une victoire.
  • H3 propose 2K, jusqu'à 15 secondes et six formats d'image. L'API de Gemini Omni Flash plafonne à 720p, 10 secondes et deux formats d'image. Ce sont des valeurs d'énumération, pas des opinions.
  • H3 accepte l'audio en entrée. Gemini non. Gemini dispose de seed et thinking_level. H3 n'en a aucun.
  • Gemini possède un endpoint dédié video-edit qui modifie votre clip source. Le chemin de révision de H3 est reference-to-video, qui régénère en utilisant votre clip comme référence. Ce ne sont pas les mêmes opérations, et le deuxième tour le montre.
  • Un seul des deux a des poids téléchargeables, et ce n'est pas celui de Google.

Comparaison côte à côte d'une scène de stand de nourriture de nuit à différentes résolutions

Premier tour du test MiniMax H3 vs Gemini Omni Flash, les deux modèles animant la même première image, montrés côte à côte

Premier tour : même première image, même prompt, même durée. À gauche MiniMax H3 en 2K, à droite Gemini Omni Flash en 720p. Montré ici sous forme de GIF silencieux ; les fichiers livrés contiennent tous deux un son natif et sont intégrés plus bas sous forme de vidéo lisible. C'est là le problème. Ils sont tous les deux bons.


Pourquoi l'écart dans le classement MiniMax H3 vs Gemini Omni Flash est mal interprété

Presque tous les articles sur MiniMax H3 vs Gemini Omni Flash que vous trouverez citent un seul classement et un seul prix. Ces deux habitudes mènent à la mauvaise réponse.

Voici les trois classements d'Artificial Analysis, avec la colonne que tout le monde ignore.

Tableau A : MiniMax H3 vs Gemini Omni Flash sur trois classements Artificial Analysis (avec audio), capture du 6 août 2026

ClassementGemini Omni FlashMiniMax H3ÉcartDans les barres d'erreur ?
Texte-vers-vidéo1 243 (#1) ±7, 11 842 votes1 238 (#2) ±9, 6 830 votesGemini +5Oui
Image-vers-vidéo1 191 (#2) ±9, 6 506 votes1 189 (#3) ±10, 5 545 votesGemini +2Oui
Montage vidéo1 123 (#2) ±5, 11 706 votes1 132 (#1) ±6, 9 128 votesH3 +9Oui, de justesse

Scores Elo issus de l'Artificial Analysis Video Arena (Artificial Analysis, août 2026). L'image-vers-vidéo est menée par Dreamina Seedance 2.0 720p à 1 197, donc aucun de ces deux ne détient cette couronne. Ce sont des scores de vote populaire en continu, et ils bougent, ce qui explique pourquoi un écart de 5 points n'est pas un verdict.

Une avance de 5 points avec un intervalle de ±9 signifie que le classement pourrait s'inverser la semaine prochaine sur le seul bruit des votes. Ce n'est pas « Gemini est meilleur en texte-vers-vidéo ». C'est un pile ou face avec un tableau d'affichage.

Trois autres choses que les gens comprennent mal :

La colonne dollar par minute n'est pas ce que vous payez. Artificial Analysis indique 6,00 $/min pour Gemini et 7,80 $/min pour H3. Cette colonne normalise le coût d'une minute de 1080p avec les réglages par défaut. Gemini Omni Flash ne peut pas produire de 1080p du tout. Donc ce nombre est une estimation de modélisation, pas une facture. Comparez les livrables finis, pas les secondes.

Un seul classement ne représente pas le modèle. H3 est deuxième, troisième et premier sur les trois classements. Gemini est premier, deuxième et deuxième. Citer un seul d'entre eux vous permet de prouver ce que vous croyiez déjà.

« Omni » ne signifie pas « mange tout ». C'est un bon nom et un nom trompeur. L'un de ces deux accepte des fichiers audio en entrée. Ce n'est pas celui qui a « omni » dans son nom.

La fiche technique MiniMax H3 vs Gemini Omni Flash que personne n'imprime

Si les scores Elo ne peuvent pas les départager, les tableaux de contraintes le peuvent. J'ai extrait les schémas d'entrée en direct des deux modèles plutôt que de me fier à un quelconque article de lancement, et les différences ne sont pas subtiles.

Tableau B : Contraintes matérielles MiniMax H3 vs Gemini Omni Flash, lues depuis les schémas d'API en direct le 6 août 2026

ContrainteMiniMax H3Gemini Omni Flash
Résolution768P ou 2K720p, et c'est la seule valeur dans l'énumération
Durée4 à 15 secondes3 à 10 secondes
Formats d'image21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9 et 9:16 uniquement
Chemin de révisionréférence-vers-vidéo (régénère avec des références)Point de terminaison dédié video-edit (modifie votre source)
Contrôle de la dernière imageend_image pris en chargeNon disponible
Limites de références≤9 images, ≤3 vidéos, ≤3 audios, 12 fichiers au total1 à 10 images
Entrée audioOuiNon
Reproductibilité seedNonOui
thinking_levelNonOui (par défaut / élevé / bas)
Poids ouvertsOui, sur Hugging FaceNon

Lisez ce tableau honnêtement et Gemini gagne trois lignes sans contestation. Les graines reproductibles comptent si vous construisez un pipeline qui doit générer la même image deux fois. Un véritable endpoint video-edit est un outil fondamentalement différent de la régénération conditionnée par référence. Et thinking_level vous donne un cadran de qualité que H3 n'expose tout simplement pas.

H3 gagne cinq lignes, et ce sont les lignes qui décident si vous pouvez livrer le fichier demandé par le client.

J'ai tout exécuté ci-dessous sur Atlas Cloud car les deux modèles se trouvent derrière le même endpoint /api/v1/model/generateVideo là-bas, ce qui signifie une boucle d'interrogation et un en-tête d'authentification pour tout le test. Changer de modèle était une modification de la chaîne model. Ce détail est la raison pour laquelle « utiliser les deux » est une réponse réaliste plutôt qu'une échappatoire.

Tableau C : Coût de chaque endpoint dans ce test, vérifié par rapport à la grille tarifaire en direct du 6 août 2026

EndpointPrixClip de 10 secondes de ce test
openai/gpt-image-2/text-to-image0,009 $ / image0,01 $
minimax/h3/image-to-video0,14 $ / s1,40 $
minimax/h3/reference-to-video0,14 $ / s1,40 $
google/gemini-omni-flash/image-to-video0,13 $ / s1,30 $
google/gemini-omni-flash/video-edit0,14 $ / s1,40 $
google/gemini-omni-flash/text-to-video0,125 $ / snon utilisé
minimax/h3/text-to-video0,14 $ / snon utilisé

Aucun des deux modèles ne bénéficie de remise ce mois-ci. Gemini propose également un niveau développeur moins cher (0,112 $/s pour texte-vers-vidéo et image-vers-vidéo, 0,12 $/s pour référence-vers-vidéo) ; H3 n'a pas de niveau équivalent.

La ligne des poids ouverts que Gemini Omni Flash ne peut pas franchir. Les poids de H3 sont publiés sur Hugging Face (MiniMax, août 2026) : un Omni Transformer dense à 33B à flux unique, plus l'encodeur de texte Qwen3-VL-32B, un VAE visuel et un VAE audio. Deux mises en garde comptent plus que la taille du téléchargement. Premièrement, ce que vous hébergez vous-même fonctionne avec un petit côté de 768 pixels ; l'étape de prétraitement Context-IR et le module Regenerate-2K ne font pas partie de la version, et la sortie 2K provient de ces deux éléments. Deuxièmement, la licence communautaire ne couvre actuellement pas l'UE, le Royaume-Uni, la Corée du Sud ou les États-Unis, et il existe un formulaire de demande séparé pour ces territoires. Lisez-la avant de construire un produit dessus. Gemini Omni Flash n'a pas de conversation équivalente, car il n'y a pas de fichier à télécharger.

Cette position de poids ouverts, associée à des prix agressifs, constitue toute l'histoire stratégique du lancement (South China Morning Post, août 2026).

Testez vous-même le test de révision MiniMax H3 vs Gemini Omni Flash

Voici la partie que personne n'a testée. Tout le monde évalue la première génération. Personne n'évalue la seconde.

Le vrai travail n'est pas un seul prompt. Le vrai travail, c'est un clip que vous aimez déjà, plus un client qui répond « j'adore, est-ce que le panneau peut indiquer 24H et est-ce que son tablier peut être rouge ». Cette seule phrase est l'endroit où ces deux modèles cessent d'être interchangeables, et il se trouve que c'est exactement la tâche que mesure le classement du montage vidéo.

La scène est délibérément cruelle : un stand de nouilles trempé par la pluie la nuit, la vendeuse parlant directement dans l'objectif, un panneau peint à la main avec des mots lisibles derrière elle, de la vapeur s'élevant du bouillon, de la pluie sur l'auvent. Une seule image qui sollicite à la fois le synchronisme labial, la stabilité du texte à l'écran, le mouvement fluide et l'audio ambiant en couches.

Les deux modèles reçoivent la même première image, le même prompt et la même note de révision. Chaque exécution ci-dessous dure 10 secondes, ce qui est le plafond de Gemini Omni Flash et bien à l'intérieur de celui de H3.

Étape 1 : Verrouiller la première image avec GPT Image 2

Les deux modèles doivent partir de la même image, sinon le premier tour mesure la chance de composition plutôt que le modèle. Ouvrez le playground GPT Image 2, réglez la qualité sur high et le ratio sur 16:9, et collez ceci :

Plain
1Scène photoréaliste de street-food nocturne sous une forte pluie, prise avec un objectif 35 mm à f/2.0. Une femme d'une trentaine d'années dans un tablier en toile indigo se tient derrière un comptoir de nouilles fumant, regardant directement dans l'objectif, au milieu d'une phrase. Derrière elle, un panneau lumineux en fer-blanc peint à la main brille d'un orange chaud avec les mots "OPEN LATE" en capitales sans-serif grasses et propres. La pluie ruisselle à travers la lumière au sodium de la rue, la vapeur monte de la marmite de bouillon, l'asphalte mouillé reflète les néons rouges et verts d'en face. Faible profondeur de champ, éclairage pratique uniquement, léger voile d'objectif, texture de peau naturelle, aucun texte ailleurs dans le cadre. 16:9.

Interface de générateur d'images IA montrant un prompt et l'image générée

Playground GPT Image 2 sur Atlas Cloud avec le prompt du stand de nouilles à gauche et la première image générée dans le panneau de sortie

GPT Image 2 sur Atlas Cloud : le prompt à gauche, la première image partagée dans OUTPUT. Coût pour cette étape , $0.009.

Une femme se tient devant un stand de street-food fumant la nuit

La première image générée : une femme en tablier indigo derrière un comptoir de nouilles fumant la nuit sous la pluie, avec un panneau OPEN LATE peint à la main qui brille derrière elle

L'entrée unique que les deux modèles ont reçue. Notez les deux choses que la révision va cibler : le panneau "OPEN LATE" et le tablier indigo. Généré avec openai/gpt-image-2/text-to-image.

Étape 2 : Premier tour sur MiniMax H3

Allez dans le playground MiniMax H3, choisissez la tâche image-to-video, téléchargez l'image de l'étape 1, et réglez resolution sur 2K, duration sur 10, ratio sur adaptive (l'énumération image-vers-vidéo n'offre que adaptive). Prompt :

Plain
1La vendeuse regarde dans l'objectif et dit, d'une voix chaude et fatiguée : "Le bouillon est sur le feu depuis quatre heures ce matin. Asseyez-vous, il pleut encore." Elle soulève la louche en parlant. La vapeur monte en volutes à travers le cadre. La pluie continue de tomber sur l'auvent derrière elle. La caméra reste fixe, pas de travelling, pas de panoramique. Audio ambiant : pluie sur la toile, bouillon qui mijote, circulation lointaine, sa voix proche et sèche.

Interface de génération vidéo IA montrant la saisie du prompt texte et la sortie vidéo

Playground MiniMax H3 image-to-video sur Atlas Cloud avec la résolution 2K sélectionnée et le clip terminé en lecture dans le panneau de sortie

MiniMax H3 image-to-video sur Atlas Cloud : 2K sélectionné, le clip terminé dans OUTPUT. Cette capture a été exécutée avec la valeur par défaut de 8 secondes du playground et facturée 1,12 $ ; la version de 10 secondes utilisée pour la comparaison est intégrée ci-dessous et a coûté 1,40 $.

MiniMax H3, premier tour, 2K, 10 secondes. Son activé : le dialogue, la pluie et le bouillon sont tous générés dans le même passage, pas ajoutés après.

Étape 3 : Premier tour sur Gemini Omni Flash, même image, mêmes mots

Ouvrez le playground Gemini Omni Flash, choisissez image-to-video, téléchargez la même image de l'étape 1, et collez le prompt de l'étape 2 sans changer un seul caractère. Réglages : resolution 720p, duration 10, aspect_ratio 16:9, thinking_level default, seed -1.

Deux choses à noter pendant que vous êtes dans ce formulaire, car elles sont l'article en miniature. Le menu déroulant resolution contient exactement une option. Le champ duration s'arrête à 10. Je n'ai pas choisi 720p plutôt qu'une meilleure option ; il n'y a rien d'autre à choisir.

Une note sur ce qui manque ici : je n'ai pas pu capturer une capture d'écran de playground terminée pour les étapes Gemini. L'environnement de staging où je prends des captures d'écran a renvoyé 403 PERMISSION_DENIED du côté de Google lors des trois tentatives, donc les seules captures Gemini que j'ai montrent un panneau OUTPUT en échec et je ne vais pas en déguiser une en exécution réussie. Les clips ci-dessous sont réels, générés via l'API de production avec les réglages listés ci-dessus. Les deux étapes H3 ont été capturées proprement et ces captures d'écran sont authentiques.

Gemini Omni Flash, premier tour, 720p, 10 secondes, entrées identiques. Jouez-le juste après le clip H3 ci-dessus et jugez vous-même de l'audio.

Étape 4 : Deuxième tour, envoyer la révision à Gemini Omni Flash

C'est le tour qui compte. Passez à la tâche video-edit sur la même page du modèle Gemini, téléchargez le clip que Gemini lui-même a produit à l'étape 3 comme entrée video, réglez resolution 720p et thinking_level high (une instruction de modification en deux parties est exactement le cas complexe pour lequel ce cadran est conçu). Collez cette note exactement comme un client l'enverrait :

Plain
1Gardez ce plan exact : même position de caméra, même femme, même visage, même pluie, même éclairage, même audio. Changez le panneau peint à la main pour qu'il indique "OPEN 24H" au lieu de "OPEN LATE", dans le même style peint et la même lueur orange. Changez son tablier de l'indigo au cramoisi foncé. Ne changez rien d'autre dans le cadre.

Gemini Omni Flash après la note de révision. Regardez le panneau, puis le tablier, puis vérifiez si autre chose a bougé.

Étape 5 : Deuxième tour, envoyer la révision identique à MiniMax H3

Voici la différence structurelle honnête, et vous devriez la connaître avant de lire le résultat. H3 n'a pas d'endpoint video-edit. Son chemin de révision est reference-to-video : vous lui donnez le clip original comme référence et il génère une nouvelle vidéo conditionnée par cette référence. Il ne modifie pas votre fichier. Il en fabrique un nouveau censé ressembler au vôtre.

Sur la page MiniMax H3, choisissez la tâche reference-to-video, ajoutez le clip que H3 a produit à l'étape 2 dans refers comme référence vidéo, puis réglez resolution 2K, duration 10, ratio adaptive. Collez le prompt de l'étape 4 sans aucune modification.

Cette étape n'a pas non plus de capture d'écran du playground, pour une raison différente et plus ennuyeuse : le navigateur headless avec lequel je capture a planté trois fois sur le chargeur de référence lors du chargement d'une référence vidéo. L'exécution elle-même s'est déroulée sans problème via l'API.

MiniMax H3 après la note de révision identique, via reference-to-video en 2K.

Comparaison d'une femme cuisinant dans un stand de nourriture de nuit sous la pluie

Côte à côte du deuxième tour : le résultat video-edit de Gemini Omni Flash à côté du résultat reference-to-video de MiniMax H3, tous deux issus de la même note de révision

Deuxième tour côte à côte, GIF silencieux. À gauche Gemini Omni Flash via video-edit, à droite MiniMax H3 via reference-to-video. Les deux avaient la même phrase à partir de laquelle travailler.

Ce qui s'est réellement passé au deuxième tour. Je m'attendais à ce que H3 perde celui-ci. La régénération conditionnée par référence est un instrument plus grossier qu'un véritable endpoint de modification, et « régénérer tout le clip et espérer qu'il atterrisse au même endroit » est exactement comme on obtient un visage différent, une caméra qui dérive et un client qui demande ce qui est arrivé au plan.

Ce n'est pas ce qui est revenu. Les deux modèles ont fait le travail, et les deux l'ont fait proprement.

Le video-edit de Gemini s'est comporté exactement comme annoncé. Le panneau indique OPEN 24H dans la même lettre peinte à la main, avec la même lueur orange et la même patine sur le fer-blanc. Le tablier est cramoisi foncé. Tout le reste est intact : même visage, même expression, même angle de la louche, même forme de vapeur, même pluie, mêmes feux arrière à l'arrière-plan. On dirait le fichier original avec deux corrections de quelques pixels, parce que c'est essentiellement ce que c'est.

Le reference-to-video de H3 a produit les deux mêmes changements et a maintenu le plan bien mieux que l'architecture ne le suggère. Panneau changé, tablier changé, et pendant les 10 secondes, le cadrage, le versement du bouillon de la louche, le panache de vapeur et son visage sont restés fidèles au clip du premier tour. S'il y a une dérive ici, je n'ai pas pu la trouver en parcourant les images image par image.

Donc le deuxième tour est un troisième match nul statistique, et je ne vais pas prétendre le contraire pour faire une histoire plus nette. Ce qui sépare les deux sorties n'est pas la qualité de la modification. C'est que H3 a rendu 2560x1440 avec une piste stéréo 32 kHz et Gemini a rendu 1280x720. Même instruction, même succès, livrable différent.

Une mise en garde honnête sur la méthode : il s'agit d'une seule révision sur un seul plan, pas d'une étude contrôlée. Un changement en deux parties sur un panneau et un vêtement est une modification assez amicale. Les cas plus difficiles (supprimer un objet que la caméra dépasse, changer quelque chose que le sujet masque, quatre séries de notes empilées les unes sur les autres) sont là où un endpoint de modification dédié devrait prendre l'avantage, et où la régénération devrait commencer à vaciller. Faites vos propres tests avant de décider.

Trois autres différences MiniMax H3 vs Gemini Omni Flash qui méritent d'être testées

Le deuxième tour est la différence qui change une livraison. Trois autres méritent vingt minutes de votre propre crédit.

Fournissez-lui un fichier audio. Le reference-to-video de H3 accepte jusqu'à trois clips audio de 2 à 15 secondes chacun, à condition qu'au moins une image ou une référence vidéo les accompagne. Cela signifie que vous pouvez lui donner un véritable enregistrement vocal et faire en sorte que le personnage l'interprète. Gemini Omni Flash n'a pas de champ d'entrée audio sur aucun de ses quatre endpoints, donc cette comparaison ne peut pas du tout être effectuée. Ce n'est pas une perte de score pour Google ; c'est une capacité qui est tout simplement absente.

Demandez du 21:9. L'énumération des ratios de reference-to-video de H3 contient 21:9, 16:9, 4:3, 1:1, 3:4 et 9:16. L'énumération aspect_ratio de Gemini contient 16:9 et 9:16. Si votre livrable est une séquence de générique cinémascope ou un format carré pour les réseaux sociaux, l'un de ces deux modèles n'est pas dans la conversation.

Verrouillez une seed et re-exécutez. Celui-ci va dans l'autre sens. Gemini expose seed ; H3 ne l'expose sur aucun endpoint. Si vous construisez un pipeline où la même requête doit renvoyer les mêmes images le mardi que le lundi, Gemini vous donne une poignée et H3 ne vous donne rien. Pour les tests de régression, les variantes de tests A/B, ou toute ferme de rendu automatisée, c'est un avantage réel et il appartient au côté Google du grand livre.

Combien coûte réellement un test MiniMax H3 vs Gemini Omni Flash

L'ensemble de l'expérience ci-dessus, quatre générations vidéo et une image, a coûté environ 5,51 $. Une première image à 0,009 $, deux clips de 10 secondes au premier tour à 1,40 $ et 1,30 $, deux clips de 10 secondes au deuxième tour à 1,40 $ chacun.

Par seconde, Gemini est moins cher : 0,125 $ à 0,14 $ contre un prix fixe de 0,14 $ pour H3, soit environ 7 à 11 % de moins selon l'endpoint. Ce nombre est vrai et il est aussi presque inutile en soi.

Voici pourquoi. Supposons que le livrable soit une ouverture cinématographique de 15 secondes en 21:9 en 2K. H3 le rend en un seul clip. Gemini ne peut pas le rendre du tout : ni la résolution, ni la durée, ni le format d'image. Vous devriez assembler un clip de 10 secondes et un de 5 secondes en 16:9, recadrer pour simuler le cinémascope, et livrer en 720p. Le prix par seconde d'une chose que vous ne pouvez pas livrer n'est pas une économie.

Inversez-le. Supposons que le livrable soit un format carré pour les réseaux sociaux qui passera par quatre séries de notes client et doit revenir à l'identique lorsque l'équipe juridique demande de le re-générer dans trois semaines. Le video-edit plus seed de Gemini est construit exactement pour cette boucle, et il coûte moins cher par seconde en plus.

Tableau D : Quel travail MiniMax H3 vs Gemini Omni Flash va où

Le travail devant vousEnvoyez-le à
Livraison en 2KMiniMax H3
Un plan unique de plus de 10 secondesMiniMax H3
Cadrage 21:9, 4:3, 1:1 ou 3:4MiniMax H3
Fournir une piste audio réelleMiniMax H3
Auto-hébergement sur vos propres GPUMiniMax H3
Atterrir sur une dernière image spécifiqueMiniMax H3
Révisions conversationnelles en plusieurs toursGemini Omni Flash
Préserver les parties intactes d'un clipGemini Omni Flash
Rendu reproductible via seedGemini Omni Flash
Format court 16:9 simple au tarif le plus basGemini Omni Flash

La conclusion de cet article est ce tableau, pas un score. Si un benchmark ne peut pas séparer deux modèles de plus que sa propre barre d'erreur, le benchmark vous a dit tout ce qu'il sait, et la fiche technique prend le relais.

Pour une vue plus large de la place de H3 par rapport au reste du domaine, l'analyse des alternatives à MiniMax H3 couvre les modèles qui le battent sur les classements qu'il ne domine pas.

FAQ

MiniMax H3 est-il meilleur que Gemini Omni Flash ?

Le vote à l'aveugle ne peut pas les départager. Sur trois classements Artificial Analysis, les écarts sont de 5, 2 et 9 points Elo, et chacun se situe à l'intérieur d'un intervalle de confiance de ±7 à ±10. Choisissez sur les spécifications, pas sur le rang. Le plafond de résolution, la limite de durée et la liste des formats d'image changeront votre livrable ; 5 points Elo ne le feront pas.

Lequel est le moins cher, MiniMax H3 ou Gemini Omni Flash ?

Par seconde, Gemini. Sur Atlas Cloud, il coûte 0,125 $ à 0,14 $ par seconde contre 0,14 $ fixe pour H3, avec un niveau développeur à 0,112 $ par seconde que H3 n'a pas d'équivalent. Mais Gemini est plafonné à 720p, 10 secondes et deux formats d'image, donc pour de nombreux livrables, vous ne comparez pas le même produit. Évaluez le montage fini, pas la seconde.

Gemini Omni Flash peut-il générer de la vidéo en 1080p, 2K ou 15 secondes ?

Non. Le paramètre resolution de son API a une seule valeur légale, 720p, et duration accepte de 3 à 10 secondes. MiniMax H3 propose 768P ou 2K et de 4 à 15 secondes. Ce sont des contraintes d'énumération lues depuis le schéma en direct le 6 août 2026, pas une opinion éditoriale, et Google pourrait les lever plus tard.

Puis-je auto-héberger Gemini Omni Flash comme je peux auto-héberger MiniMax H3 ?

Non. Les poids de H3 sont sur Hugging Face et fonctionnent localement avec un petit côté de 768 pixels. L'étape Context-IR et le module Regenerate-2K qui produisent la sortie 2K ne font pas partie de la version et restent côté API. Vérifiez également la licence : elle ne couvre actuellement pas l'UE, le Royaume-Uni, la Corée du Sud ou les États-Unis sans une demande séparée.

Dois-je en choisir un seul ?

Non, et le tableau de répartition par tâche ci-dessus est la meilleure réponse. Les deux modèles se trouvent derrière le même endpoint generateVideo sur Atlas Cloud, donc utiliser les deux signifie une boucle d'interrogation et une chaîne model différente, pas deux intégrations. Router par livrable bat miser sur un classement qui change chaque semaine.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles