J'ai fixé trois classements Artificial Analysis pendant dix minutes pour essayer de déterminer qui avait vraiment gagné.
Texte vers vidéo : Gemini Omni Flash par 5 points. Image vers vidéo : Gemini par 2 points. Montage vidéo : MiniMax H3 par 9 points.
Puis j'ai regardé la colonne des intervalles de confiance. Plus ou moins 7. Plus ou moins 9. Plus ou moins 10.
Trois classements, trois écarts, chacun à l'intérieur de sa propre barre d'erreur. En vote à l'aveugle, ces deux modèles sont le même modèle.
J'ai donc fermé les classements et ouvert les menus déroulants. Cet écart n'est pas de 5 points. Cet écart est un palier de résolution complet.
Points clés à retenir
- Les trois écarts Artificial Analysis (+5, +2, +9, capture du 6 août 2026) se situent tous à l'intérieur des intervalles de confiance de ±7 à ±10. En qualité brute, c'est une égalité, pas une victoire.
- H3 produit du 2K, jusqu'à 15 secondes, et six formats d'image. L'API de Gemini Omni Flash est limitée à 720p, 10 secondes et deux formats d'image. Ce sont des valeurs d'énumération, pas des opinions.
- H3 accepte l'audio en entrée. Gemini non. Gemini dispose de
seedetthinking_level. H3 n'en a aucun. - Gemini dispose d'un endpoint dédié
video-editqui modifie votre clip source. Le chemin de révision de H3 estreference-to-video, qui regénère avec votre clip comme référence. Ce ne sont pas les mêmes opérations, et le second tour le montre. - Un seul des deux a des poids téléchargeables, et ce n'est pas celui de Google.

Premier tour du test MiniMax H3 vs Gemini Omni Flash, les deux modèles animant la même première image, présentés côte à côte
Premier tour : même première image, même prompt, même durée. À gauche MiniMax H3 en 2K, à droite Gemini Omni Flash en 720p. Présenté ici sous forme de GIF silencieux ; les deux fichiers livrés comportent l'audio natif et sont intégrés plus bas en tant que vidéos lisibles. C'est là le problème. Ils sont tous les deux bons.
Pourquoi l'écart du classement MiniMax H3 vs Gemini Omni Flash est mal interprété
Presque tous les articles sur MiniMax H3 vs Gemini Omni Flash que vous trouverez citent un classement et un prix. Ces deux habitudes mènent à la mauvaise réponse.
Voici les trois classements Artificial Analysis, avec la colonne que tout le monde ignore.
Tableau A : MiniMax H3 vs Gemini Omni Flash sur trois classements Artificial Analysis (avec audio), capture du 6 août 2026
| Classement | Gemini Omni Flash | MiniMax H3 | Écart | Dans les barres d'erreur ? |
|---|---|---|---|---|
| Texte vers vidéo | 1 243 (#1) ±7, 11 842 votes | 1 238 (#2) ±9, 6 830 votes | Gemini +5 | Oui |
| Image vers vidéo | 1 191 (#2) ±9, 6 506 votes | 1 189 (#3) ±10, 5 545 votes | Gemini +2 | Oui |
| Montage vidéo | 1 123 (#2) ±5, 11 706 votes | 1 132 (#1) ±6, 9 128 votes | H3 +9 | Oui, tout juste |
MiniMax H3 est l'un des 30+ modèles vidéo que vous pouvez exécuter côte à côte avec le même prompt dans la comparaison de modèles Atlas Cloud — avec le coût par seconde affiché avant de générer.
Scores Elo issus de l'Artificial Analysis Video Arena (Artificial Analysis, août 2026). L'image vers vidéo est dominée par Dreamina Seedance 2.0 720p à 1 197, donc aucun de ces deux ne détient cette couronne. Ce sont des scores de vote populaire en évolution, ce qui explique pourquoi un écart de 5 points n'est pas un verdict.
Une avance de 5 points avec un intervalle de ±9 signifie que le classement pourrait s'inverser la semaine prochaine simplement à cause du bruit des votes. Ce n'est pas « Gemini est meilleur en texte vers vidéo ». C'est un pile ou face avec un tableau d'affichage.
Trois autres choses que les gens comprennent mal :
La colonne dollar par minute ne correspond pas à ce que vous payez. Artificial Analysis indique 6,00 $/min pour Gemini et 7,80 $/min pour H3. Cette colonne normalise le coût d'une minute de vidéo 1080p avec les réglages par défaut. Gemini Omni Flash ne peut pas produire du 1080p du tout. Ce nombre est donc une estimation modélisée, pas une facture. Comparez les livrables finis, pas les secondes.
Un classement ne représente pas le modèle. H3 se classe deuxième, troisième et premier sur les trois classements. Gemini se classe premier, deuxième et deuxième. Ne citez qu'un seul classement et vous pouvez prouver tout ce que vous croyez déjà.
« Omni » ne signifie pas « mange de tout ». C'est un bon nom, mais trompeur. L'un de ces deux modèles accepte les fichiers audio en entrée. Ce n'est pas celui qui a « omni » dans son nom.
La fiche technique MiniMax H3 vs Gemini Omni Flash que personne n'imprime
Si les scores Elo ne peuvent pas les départager, les tableaux de contraintes le peuvent. J'ai récupéré les schémas d'entrée en direct des deux modèles plutôt que de me fier à un article de lancement, et les différences ne sont pas subtiles.
Tableau B : Contraintes strictes MiniMax H3 vs Gemini Omni Flash, lues depuis les schémas d'API en direct le 6 août 2026
| Contrainte | MiniMax H3 | Gemini Omni Flash |
|---|---|---|
| Résolution | 768P ou 2K | 720p, et c'est la seule valeur dans l'énumération |
| Durée | 4 à 15 secondes | 3 à 10 secondes |
| Formats d'image | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9 et 9:16 uniquement |
| Chemin de révision | reference-to-video (regénère avec des références) | Endpoint dédié video-edit (modifie votre source) |
| Contrôle de la dernière image | end_image pris en charge | Non disponible |
| Limites de références | ≤9 images, ≤3 vidéos, ≤3 audios, 12 fichiers total | 1 à 10 images |
| Entrée audio | Oui | Non |
| Reproductibilité via seed | Non | Oui |
| thinking_level | Non | Oui (par défaut / élevé / bas) |
| Poids ouverts | Oui, sur Hugging Face | Non |
Lisez ce tableau honnêtement : Gemini remporte trois lignes de manière incontestable. Les seeds reproductibles comptent si vous construisez un pipeline qui doit produire la même image deux fois. Un véritable endpoint video-edit est un outil fondamentalement différent de la régénération conditionnée par référence. Et thinking_level vous donne un curseur de qualité que H3 n'expose tout simplement pas.
H3 remporte cinq lignes, et ce sont les lignes qui déterminent si vous pouvez livrer le fichier demandé par le client.
J'ai tout exécuté ci-dessous sur Atlas Cloud car les deux modèles se trouvent derrière le même endpoint /api/v1/model/generateVideo là-bas, ce qui signifie une seule boucle d'interrogation et un seul en-tête d'authentification pour tout le test. Changer de modèle revenait à modifier la chaîne model. Ce détail est la raison pour laquelle « utiliser les deux » est une réponse réaliste plutôt qu'une échappatoire.
Tableau C : Coût de chaque endpoint dans ce test, vérifié sur la grille tarifaire en direct du 6 août 2026
| Endpoint | Prix | Ce clip de 10 secondes du test |
|---|---|---|
| openai/gpt-image-2/text-to-image | 0,009 $ / image | 0,01 $ |
| minimax/h3/image-to-video | 0,14 $ / s | 1,40 $ |
| minimax/h3/reference-to-video | 0,14 $ / s | 1,40 $ |
| google/gemini-omni-flash/image-to-video | 0,13 $ / s | 1,30 $ |
| google/gemini-omni-flash/video-edit | 0,14 $ / s | 1,40 $ |
| google/gemini-omni-flash/text-to-video | 0,125 $ / s | non utilisé |
| minimax/h3/text-to-video | 0,14 $ / s | non utilisé |
Aucun des deux modèles n'offre de réduction ce mois-ci. Gemini propose également un niveau développeur moins cher (0,112 $/s pour texte vers vidéo et image vers vidéo, 0,12 $/s pour référence vers vidéo) ; H3 n'a pas d'équivalent.
La ligne des poids ouverts que Gemini Omni Flash ne peut pas franchir. Les poids de H3 sont publiés sur Hugging Face (MiniMax, août 2026) : un Omni Transformer dense à flux unique de 33B, plus l'encodeur de texte Qwen3-VL-32B, un VAE visuel et un VAE audio. Deux mises en garde sont plus importantes que la taille du téléchargement. Premièrement, ce que vous auto-hébergez tourne avec un petit côté de 768 pixels ; l'étape de prétraitement Context-IR et le module Regenerate-2K ne sont pas dans la version, et la sortie 2K provient de ces deux éléments. Deuxièmement, la licence communautaire ne couvre actuellement pas l'UE, le Royaume-Uni, la Corée du Sud ni les États-Unis, et il existe un formulaire de demande distinct pour ces territoires. Lisez-la avant de construire un produit dessus. Gemini Omni Flash n'a pas de conversation équivalente, car il n'y a pas de fichier à télécharger.
Cette position de poids ouverts, associée à des prix agressifs, constitue toute l'histoire stratégique du lancement (South China Morning Post, août 2026).
Testez vous-même le test de révision MiniMax H3 vs Gemini Omni Flash
Voici la partie que personne n'a réalisée. Tout le monde évalue la première génération. Personne n'évalue la seconde.
Le vrai travail n'est pas un seul prompt. Le vrai travail, c'est un clip que vous aimez déjà, plus un client qui répond « j'adore, est-ce que le panneau peut indiquer 24H et est-ce que son tablier peut être rouge ». Cette seule phrase est l'endroit où ces deux modèles cessent d'être interchangeables, et il se trouve que c'est exactement la tâche que mesure le classement du montage vidéo.
La scène est délibérément cruelle : un stand de nouilles trempé par la pluie la nuit, le vendeur parlant directement dans l'objectif, un panneau peint à la main avec des mots lisibles derrière elle, de la vapeur s'élevant du bouillon, de la pluie sur l'auvent. Une seule image qui sollicite à la fois le synchronisme labial, la stabilité du texte à l'écran, le mouvement fluide et l'audio ambiant en couches.
Les deux modèles reçoivent la même première image, le même prompt et la même note de révision. Chaque exécution ci-dessous dure 10 secondes, ce qui est le plafond de Gemini Omni Flash et bien dans les limites de H3.
Étape 1 : Figer la première image avec GPT Image 2
Les deux modèles doivent partir de la même image, sinon le premier tour mesure la chance de composition plutôt que le modèle. Ouvrez le playground GPT Image 2, réglez la qualité sur haute et le format sur 16:9, et collez ceci :
Plain1Scène nocturne photoréaliste de stand de nourriture de rue sous une pluie battante, filmée avec un objectif 35 mm à f/2.0. Une femme d'une trentaine d'années en tablier en toile indigo se tient derrière un comptoir de nouilles fumant, regardant droit dans l'objectif, au milieu d'une phrase. Derrière elle, un panneau lumineux en fer blanc peint à la main brille d'une lueur ambrée chaude avec les mots "OPEN LATE" en majuscules sans empattement propres et audacieuses. La pluie ruisselle à travers la lumière jaune du sodium, de la vapeur s'élève de la marmite de bouillon, l'asphalte mouillé reflète les néons rouges et verts de l'autre côté de la rue. Faible profondeur de champ, éclairage pratique uniquement, légère brume d'objectif, texture cutanée naturelle, aucun texte ailleurs dans le cadre. 16:9.

Playground GPT Image 2 sur Atlas Cloud avec le prompt du stand de nouilles à gauche et la première image générée dans le panneau de sortie
GPT Image 2 sur Atlas Cloud : le prompt à gauche, la première image partagée dans OUTPUT. Coût pour cette étape , 0,009 $.

La première image générée : une femme en tablier indigo derrière un comptoir de nouilles fumant la nuit sous la pluie, avec un panneau OPEN LATE peint à la main qui brille derrière elle
L'entrée unique reçue par les deux modèles. Notez les deux éléments que la révision va cibler : le panneau « OPEN LATE » et le tablier indigo. Généré avec openai/gpt-image-2/text-to-image.
Étape 2 : Premier tour sur MiniMax H3
Allez sur le playground MiniMax H3, choisissez la tâche image-to-video, téléchargez l'image de l'étape 1, et réglez resolution sur 2K, duration sur 10, ratio sur adaptive (l'énumération image-to-video ne propose que adaptive). Prompt :
Plain1La vendeuse regarde l'objectif et dit, d'une voix chaude et fatiguée : « Le bouillon est sur le feu depuis quatre heures ce matin. Asseyez-vous, il pleut encore. » Elle soulève la louche en parlant. La vapeur monte en volutes à travers le cadre. La pluie continue de tomber sur l'auvent derrière elle. La caméra reste immobile, pas d'avancée, pas de panoramique. Audio ambiant : pluie sur la toile, bouillon qui mijote, circulation lointaine, sa voix proche et sèche.

Playground MiniMax H3 image-to-video sur Atlas Cloud avec la résolution 2K sélectionnée et le clip terminé en lecture dans le panneau de sortie
MiniMax H3 image-to-video sur Atlas Cloud : 2K sélectionné, le clip terminé dans OUTPUT. Cette capture a été réalisée avec la valeur par défaut de 8 secondes du playground et facturée 1,12 $ ; la version de 10 secondes utilisée pour la comparaison est intégrée ci-dessous et a coûté 1,40 $.
MiniMax H3, premier tour, 2K, 10 secondes. Activez le son : le dialogue, la pluie et le bouillon sont tous générés dans le même passage, pas ajoutés après.
Étape 3 : Premier tour sur Gemini Omni Flash, même image, mêmes mots
Ouvrez le playground Gemini Omni Flash, choisissez image-to-video, téléchargez la même image de l'étape 1, et collez le prompt de l'étape 2 sans changer un seul caractère. Réglages : resolution 720p, duration 10, aspect_ratio 16:9, thinking_level default, seed -1.
Deux choses à noter pendant que vous êtes dans ce formulaire, car elles résument l'article en miniature. Le menu déroulant resolution contient exactement une option. Le champ duration s'arrête à 10. Je n'ai pas choisi 720p plutôt que quelque chose de mieux ; il n'y a rien d'autre à choisir.
Une note sur ce qui manque ici : je n'ai pas pu capturer de capture d'écran du playground avec une exécution terminée pour l'une ou l'autre des étapes Gemini. L'environnement de staging sur lequel je prends des captures d'écran a renvoyé 403 PERMISSION_DENIED du côté de Google pour les trois tentatives, donc les seules captures Gemini que j'ai montrent un panneau OUTPUT en échec et je ne vais pas en déguiser une en exécution réussie. Les clips ci-dessous sont réels, générés via l'API de production avec les réglages listés ci-dessus. Les deux étapes H3 ont bien été capturées et ces captures d'écran sont authentiques.
Gemini Omni Flash, premier tour, 720p, 10 secondes, entrées identiques. Jouez-le juste après le clip H3 ci-dessus et jugez l'audio par vous-même.
Étape 4 : Deuxième tour, envoyer la révision à Gemini Omni Flash
C'est le tour qui compte. Passez à la tâche video-edit sur la même page du modèle Gemini, téléchargez le clip que Gemini a produit lui-même à l'étape 3 comme entrée video, réglez resolution 720p et thinking_level high (une instruction de modification en deux parties est exactement le cas complexe pour lequel ce curseur est fait). Collez cette note exactement comme un client l'enverrait :
Plain1Gardez ce plan exact : même position de caméra, même femme, même visage, même pluie, même éclairage, même audio. Changez le panneau peint à la main pour qu'il indique "OPEN 24H" au lieu de "OPEN LATE", dans le même style peint et la même lueur ambrée. Changez son tablier d'indigo à rouge foncé. Ne changez rien d'autre dans le cadre.
Gemini Omni Flash après la note de révision. Regardez le panneau, puis le tablier, puis vérifiez si autre chose a bougé.
Étape 5 : Deuxième tour, envoyer la révision identique à MiniMax H3
Voici la différence structurelle honnête, et vous devez la connaître avant de lire le résultat. H3 n'a pas d'endpoint video-edit. Son chemin de révision est reference-to-video : vous lui donnez le clip original comme référence et il génère une nouvelle vidéo conditionnée par cette référence. Il ne modifie pas votre fichier. Il en crée un nouveau censé ressembler au vôtre.
Sur la page MiniMax H3, choisissez la tâche reference-to-video, ajoutez le clip produit par H3 à l'étape 2 dans refers comme référence vidéo, puis réglez resolution 2K, duration 10, ratio adaptive. Collez le prompt de l'étape 4 sans aucune modification.
Cette étape n'a pas non plus de capture d'écran du playground, pour une raison différente et plus ennuyeuse : le navigateur sans tête que j'utilise pour les captures a planté trois fois sur le téléchargeur de référence lors du chargement d'une référence vidéo. L'exécution elle-même s'est déroulée sans problème via l'API.
MiniMax H3 après la note de révision identique, via reference-to-video en 2K.

Côte à côte du deuxième tour : le résultat video-edit de Gemini Omni Flash à côté du résultat reference-to-video de MiniMax H3, tous deux à partir de la même note de révision
Deuxième tour côte à côte, GIF silencieux. À gauche Gemini Omni Flash via video-edit, à droite MiniMax H3 via reference-to-video. Tous deux avaient la même phrase de travail.
Ce qui s'est réellement passé au deuxième tour. Je m'attendais à ce que H3 perde celui-ci. La régénération conditionnée par référence est un instrument plus grossier qu'un véritable endpoint de modification, et « régénérer tout le clip en espérant qu'il atterrisse au même endroit » est exactement la façon d'obtenir un visage différent, une caméra qui dérive et un client qui demande ce qui est arrivé au plan.
Ce n'est pas ce qui est revenu. Les deux modèles ont fait le travail, et les deux l'ont fait proprement.
Le video-edit de Gemini a exactement fait ce qui était annoncé. Le panneau indique OPEN 24H dans la même lettre peinte à la main, avec la même lueur ambrée et la même patine sur le fer blanc. Le tablier est rouge foncé. Tout le reste est inchangé : même visage, même expression, même angle de la louche, même forme de vapeur, même pluie, mêmes feux arrière à l'arrière-plan. Cela ressemble au fichier original avec deux corrections de quelques pixels, car c'est essentiellement ce que c'est.
Le reference-to-video de H3 a produit les deux mêmes changements et a maintenu le plan bien mieux que l'architecture ne le suggère. Panneau changé, tablier changé, et sur l'ensemble des 10 secondes, le cadrage, le versement du bouillon de la louche, le panache de vapeur et son visage sont restés conformes au clip du premier tour. S'il y a une dérive ici, je n'ai pas pu la trouver en parcourant les images.
Donc le deuxième tour est un troisième match nul statistique, et je ne vais pas prétendre le contraire pour rendre l'histoire plus nette. Ce qui distingue les deux sorties, ce n'est pas la qualité de la modification. C'est que H3 a renvoyé du 2560x1440 avec une piste stéréo 32 kHz et Gemini a renvoyé du 1280x720. Même instruction, même succès, livrable différent.
Une mise en garde honnête sur la méthode : il s'agit d'une seule révision sur un seul plan, pas d'une étude contrôlée. Un changement en deux parties sur un panneau et un vêtement est une modification assez simple. Les cas plus difficiles (supprimer un objet devant lequel la caméra passe, changer quelque chose que le sujet cache, quatre séries de notes empilées les unes sur les autres) sont ceux où un véritable endpoint de modification devrait prendre l'avantage, et où la régénération devrait commencer à vaciller. Faites vos propres tests avant de décider.
Trois autres différences MiniMax H3 vs Gemini Omni Flash qui méritent d'être testées
Le deuxième tour est la différence qui change une livraison. Trois autres méritent vingt minutes de votre propre crédit.
Donnez-lui un fichier audio. Le reference-to-video de H3 accepte jusqu'à trois clips audio de 2 à 15 secondes chacun, à condition qu'au moins une référence image ou vidéo les accompagne. Cela signifie que vous pouvez lui donner un véritable enregistrement vocal et faire en sorte que le personnage l'interprète. Gemini Omni Flash n'a pas de champ d'entrée audio sur aucun de ses quatre endpoints, donc cette comparaison ne peut pas du tout être effectuée. Ce n'est pas une perte de score pour Google ; c'est une capacité simplement absente.
Demandez du 21:9. L'énumération des ratios de reference-to-video de H3 contient 21:9, 16:9, 4:3, 1:1, 3:4 et 9:16. L'énumération aspect_ratio de Gemini contient 16:9 et 9:16. Si votre livrable est une séquence de titre cinémascopique ou un plan social 1:1, l'un de ces deux modèles n'est pas dans la conversation.
Verrouillez une seed et re-exécutez. Celui-ci va dans l'autre sens. Gemini expose seed ; H3 ne l'expose sur aucun endpoint. Si vous construisez un pipeline où la même requête doit renvoyer les mêmes images le mardi qu'elle a renvoyées le lundi, Gemini vous donne une poignée et H3 ne vous donne rien. Pour les tests de régression, les variantes de copie A/B, ou toute ferme de rendu automatisée, c'est un véritable avantage et il appartient au côté Google du grand livre.
Combien coûte réellement un test MiniMax H3 vs Gemini Omni Flash
L'ensemble de l'expérience ci-dessus, quatre générations vidéo et une image, a coûté environ 5,51 $. Une première image à 0,009 $, deux clips de 10 secondes du premier tour à 1,40 $ et 1,30 $, deux clips de 10 secondes du deuxième tour à 1,40 $ chacun.
Par seconde, Gemini est moins cher : 0,125 $ à 0,14 $ contre un 0,14 $ fixe pour H3, soit environ 7 à 11 % de moins selon l'endpoint. Ce nombre est vrai, mais il est également presque inutile en soi.
Voici pourquoi. Supposons que le livrable soit une ouverture cinématographique de 15 secondes en 21:9 en 2K. H3 le rend en un seul clip. Gemini ne peut pas le rendre du tout : ni la résolution, ni la durée, ni le format d'image. Vous devriez assembler un clip de 10 secondes et un clip de 5 secondes en 16:9, recadrer pour simuler le cinémascope, et livrer du 720p. Le prix par seconde d'une chose que vous ne pouvez pas livrer n'est pas une économie.
Inversez. Supposons que le livrable soit un plan social 16:9 qui passera par quatre séries de notes client et qui doit revenir octet identique lorsque l'équipe juridique demandera de le re-rendre dans trois semaines. Le video-edit plus seed de Gemini est conçu exactement pour cette boucle, et il coûte moins cher par seconde tout en le faisant.
Tableau D : Quel travail MiniMax H3 vs Gemini Omni Flash va où
| Le travail devant vous | Envoyez-le à |
|---|---|
| Livraison 2K | MiniMax H3 |
| Un seul plan de plus de 10 secondes | MiniMax H3 |
| Cadrage 21:9, 4:3, 1:1 ou 3:4 | MiniMax H3 |
| Insertion d'une piste audio réelle | MiniMax H3 |
| Auto-hébergement sur vos propres GPU | MiniMax H3 |
| Atterrir sur une dernière image spécifique | MiniMax H3 |
| Révisions conversationnelles en plusieurs tours | Gemini Omni Flash |
| Préserver les parties non modifiées d'un clip | Gemini Omni Flash |
| Rendu reproductible via seed | Gemini Omni Flash |
| Format court 16:9 simple au taux par seconde le plus bas | Gemini Omni Flash |
La conclusion de cet article est ce tableau, pas un score. Si un benchmark ne peut pas séparer deux modèles de plus que sa propre barre d'erreur, le benchmark vous a dit tout ce qu'il savait, et la fiche technique prend le relais.
Pour une vue plus large de la place de H3 par rapport au reste du champ, la présentation des alternatives à MiniMax H3 couvre les modèles qui le battent sur les classements qu'il ne domine pas.
Foire aux questions
MiniMax H3 est-il meilleur que Gemini Omni Flash ?
Le vote à l'aveugle ne peut pas les départager. Sur trois classements Artificial Analysis, les écarts sont de 5, 2 et 9 points Elo, et chacun se situe à l'intérieur d'un intervalle de confiance de ±7 à ±10. Choisissez sur les spécifications, pas sur le rang. Le plafond de résolution, la limite de durée et la liste des formats d'image changeront votre livrable ; 5 points Elo ne le feront pas.
Lequel est le moins cher, MiniMax H3 ou Gemini Omni Flash ?
Par seconde, Gemini. Sur Atlas Cloud, il coûte 0,125 $ à 0,14 $ par seconde contre 0,14 $ fixe pour H3, avec un niveau développeur à 0,112 $ par seconde que H3 n'a pas d'équivalent. Mais Gemini est limité à 720p, 10 secondes et deux formats d'image, donc pour de nombreux livrables, vous ne comparez pas le même produit. Évaluez le coût du plan fini, pas de la seconde.
Gemini Omni Flash peut-il générer de la vidéo en 1080p, 2K ou 15 secondes ?
Non. Son paramètre API resolution a une seule valeur légale, 720p, et duration accepte de 3 à 10 secondes. MiniMax H3 propose 768P ou 2K et de 4 à 15 secondes. Ce sont des contraintes d'énumération lues depuis le schéma en direct le 6 août 2026, pas une opinion éditoriale, et Google pourrait les assouplir plus tard.
Puis-je auto-héberger Gemini Omni Flash comme je peux auto-héberger MiniMax H3 ?
Non. Les poids de H3 sont sur Hugging Face et fonctionnent localement avec un petit côté de 768 pixels. L'étape Context-IR et le module Regenerate-2K qui produisent la sortie 2K ne sont pas dans la version et restent côté API. Vérifiez également la licence : elle ne couvre actuellement pas l'UE, le Royaume-Uni, la Corée du Sud ou les États-Unis sans une demande séparée.
Dois-je en choisir un seul ?
Non, et le tableau de répartition par tâche ci-dessus est la meilleure réponse. Les deux modèles se trouvent derrière le même endpoint generateVideo sur Atlas Cloud, donc utiliser les deux signifie une seule boucle d'interrogation et une chaîne model différente, pas deux intégrations. Router par livrable bat de parier sur un classement qui bouge chaque semaine.






