Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

MiniMax H3 2K vs 768P : j’ai exécuté la même invite deux fois et obtenu deux films différents

Mesuré 2026-08-05 : MiniMax H3 2K vs 768P retourne 1344x768 vs 2560x1440 à $0.40 vs $0.56. Pourquoi le brouillon bon marché n'est pas un aperçu de votre version finale, et la correction.

Deux photos imprimées de bouteilles de cold brew sur une table en bois

Deux tirages de la même bouteille de cold brew posée sur un comptoir de café, un flou et un net, avec un ticket de caisse entre eux

Deux tirages du même plan, l’un flou, l’autre net. Sur MiniMax H3, cet écart n’est pas un curseur de qualité. Généré avec openai/gpt-image-2/text-to-image.

J’ai soumis la même invite deux fois. La seule chose que j’ai changée, c’est un menu déroulant : 768P, puis 2K.

La première exécution a coûté 0,40 $ et est revenue en 130 secondes. La seconde a coûté 0,56 $ et a pris 181 secondes. Ensuite, j’ai mis les deux images côte à côte et quelque chose m’a paru étrange. La bouteille était toujours là. L’étiquette était toujours là, petits caractères compris. Mais le comptoir était passé du bois chaud à la pierre pâle, une étagère était apparue à l’arrière-plan derrière le barista, la condensation sur le verre était soudain partout et la lumière avait changé de couleur.

Je n’avais pas économisé sur un brouillon. J’avais tourné deux films différents.

Ce n’est pas un bug. C’est ce que signifie réellement « 2K » sur H3, et une fois que vous l’avez compris, le conseil standard que tout le monde donne – brouillon bon marché, puis finition chère – s’effondre silencieusement. Vous trouverez ci-dessous tous les chiffres de ce test, plus le seul changement qui rend le brouillon bon marché efficace.

Points clés (tous les chiffres mesurés sur Atlas Cloud, 2026-08-05)

  • 768P a délivré 1344x768, 2K a délivré 2560x1440 pour une demande 16:9. Cela représente 3,6 fois les pixels et 3,6 fois le débit vidéo.
  • La facturation était de 0,40 $ vs 0,56 $ pour un clip de 4 secondes, soit 0,10 $/s vs 0,14 $/s. 768P est 29 % moins cher par seconde, pas moitié prix.
  • 768P est revenu 28 % plus vite sur la paire texte-vers-vidéo (130 s contre 181 s) et 17 % plus vite sur la paire image-vers-vidéo (194 s contre 234 s).
  • Texte-vers-vidéo en 768P et 2K avec la même invite a produit deux plans différents, et non deux qualités d’un même plan. Un brouillon nu en 768P ne prévisualise pas votre final 2K.
  • Verrouillez la première image avec image-vers-vidéo et la dérive s’arrête. Même décor, même cadrage, même position de l’étiquette, et le 2K utilise ses pixels supplémentaires exactement là où MiniMax le dit : les petits caractères.
  • 768P n’est pas verrouillé. Les deux niveaux sont actifs dans l’énumération de résolution et sélectionnables dans le menu déroulant au 2026-08-05, quoi que disent encore les anciens résumés.

MiniMax H3 2K vs 768P : le 768P est-il toujours en bêta fermée ?

Non, et il vaut la peine de tuer cette idée tôt car elle est encore répétée dans la plupart des synthèses de prix écrites dans les jours suivant le lancement.

J’ai extrait le schéma d’entrée en direct pour les trois endpoints H3 aujourd’hui. Le champ resolution indique enum: ["768P", "2K"] avec default: "2K" sur texte-vers-vidéo, image-vers-vidéo et référence-vers-vidéo, et duration fonctionne pour chaque seconde entière de 4 à 15 sur les trois. Pas de drapeau, pas de porte, pas de formulaire de vente. J’ai ensuite soumis une tâche 768P sur deux endpoints différents et les deux ont été terminées et facturées au tarif inférieur. Si une page vous dit de contacter les ventes pour le 768P, cette page décrit la première semaine du lancement, pas cette semaine.

MiniMax H3 2K vs 768P, même invite, côte à côte

À gauche, 768P. À droite, 2K. Invite identique, duration=4 identique, ratio=16:9 identique, soumises l’une après l’autre à minimax/h3/text-to-video.

Comparaison côte à côte de la résolution d’image montrant une bouteille de cold brew

MiniMax H3 2K vs 768P en écran partagé à partir de la même invite texte-vers-vidéo, avec résolution, prix et temps réel incrustés

Même invite, deux exécutions. À gauche : 768P, 1344x768, 0,40 $, 130 s. À droite : 2K, 2560x1440, 0,56 $, 181 s. Montré en GIF silencieux ; les deux fichiers livrés contiennent un audio stéréo 32 kHz. Mesuré sur Atlas Cloud, 2026-08-05.

Regardez ce qui diffère réellement. Ce n’est pas la netteté. C’est le film. Matériau de comptoir différent, habillage d’arrière-plan différent, condensation différente, hauteur de caméra différente, température de couleur différente, et l’étiquette se trouve à un endroit différent sur la bouteille. Rien dans l’invite ne demandait que cela change.

Maintenant, la partie que tout le monde suppose inversée. Voici la zone de l’étiquette des deux plans, recadrée à partir des fichiers natifs et agrandie à la même largeur, de sorte que le recadrage 768P est plus agrandi que le recadrage 2K.

Comparaison de résolution 768p et 2K sur une étiquette de cold brew

Comparaison de recadrage d’étiquette entre les plans MiniMax H3 768P et 2K, montrant tous deux la petite ligne d’ingrédients lisible

La petite ligne « single origin ethiopia guji / 250ml / roasted 04.08.2026 » survit en 768P. Elle est plus douce et l’espacement des lettres vacille, mais rien n’est illisible. Le vrai coût du 768P ici n’était pas un texte flou, c’était une composition différente.

Ainsi, le cadrage honnête de MiniMax H3 2K vs 768P n’est pas « net contre flou ». C’est « ce plan contre un autre plan, plus un passage de détails par-dessus ».

La fiche technique MiniMax H3 2K vs 768P, mesurée

Tout dans ce tableau provient de ffmpeg -i sur les fichiers livrés et du champ price sur la prédiction terminée, pas d’une page de documentation.

Mesuré sur le fichier livré768P2KRatio
Résolution livrée (demande 16:9)1344x7682560x14403,6x pixels
Débit vidéo998 kb/s3 624 kb/s3,6x
Taille du fichier, clip de 4,46 s620 Ko2,00 Mo3,3x
Fréquence d’images24 ips24 ipsidentique
Piste audioAAC stéréo, 32 000 Hz, 131 kb/sAAC stéréo, 32 000 Hz, 127 kb/sidentique
Durée du conteneur pour duration=44,46 s4,46 sidentique
Temps réel de soumission à fin130 s181 s1,39x
Facturé réellement0,40 $0,56 $1,4x
Taux effectif0,10 $/s0,14 $/s29 % moins cher

Deux notes de bas de page qui m’ont coûté de l’argent à apprendre. Premièrement, les deux niveaux ont livré 4,46 secondes pour une demande duration=4 et tous deux ont facturé 4 secondes, donc vous obtenez les 0,46 s supplémentaires gratuitement, mais vous ne pouvez pas planifier une coupe autour. Deuxièmement, l’audio est identique entre les niveaux. Si votre clip repose sur un dialogue ou une synchronisation musicale, le 2K ne vous achète rien sur ce qui compte.

Pourquoi MiniMax H3 2K vs 768P piège tout le monde

Parce que le 2K sur H3 n’est pas une étape de suréchantillonnage. C’est une deuxième génération.

MiniMax décrit le mécanisme directement : « Pour la sortie 2K de H3, au lieu d’utiliser un module de super-résolution dédié conventionnel, nous faisons régénérer par le modèle de base H3 sa propre sortie basse résolution en contexte. » Ils expliquent aussi pourquoi ils l’ont construit ainsi : l’approche en contexte « lui permet de puiser à nouveau dans le contexte multimodal original pour produire une sortie haute résolution, récupérant des détails que la super-résolution traditionnelle ne peut que “deviner” et souvent ne peut pas restaurer, comme les petits textes et les détails fins » (MiniMax, juillet 2026).

Relisez cela avec un chapeau de production. Le passage 2K retourne à votre contexte original et génère à nouveau. Lorsque votre contexte n’est rien d’autre qu’une invite textuelle, « générer à nouveau » signifie « relancer les dés à nouveau ». C’est exactement ce que montrent mes deux plans. Le modèle n’a jamais été invité à reproduire la version 768P, car il n’a jamais vu la version 768P.

Trois façons dont cela mord dans la pratique :

  1. Vous lancez des brouillons bon marché en 768P sur texte-vers-vidéo, choisissez un gagnant, puis le relancez en 2K. Vous obtenez un inconnu. L’invite est respectée, le film est nouveau. C’est le test en haut de cette page.
  2. Vous budgétez comme si 29 % moins cher par seconde signifiait 29 % moins cher. Ce n’est pas le cas, car les finaux sont la partie chère de tout lot réel, et une seule relance 2K gaspillée efface l’économie sur plusieurs brouillons.
  3. Vous supposez que le chemin de mise à niveau bon marché est là quelque part. J’ai vérifié le catalogue complet sur Atlas Cloud aujourd’hui : 452 modèles, trois endpoints H3, et aucun endpoint de régénération H3 parmi eux. Là où seuls les trois endpoints de génération sont exposés, « mettre à niveau ce clip vers 2K » signifie soit le relancer, soit exécuter un suréchantillonneur séparé dessus. Les deux coûtent de l’argent, et ils n’achètent pas la même chose.

Il vaut la peine de dire pourquoi il vaut même la peine de concevoir autour de ce modèle plutôt que de changer. L’offre phare au lancement était la vidéo « jusqu’à une résolution 2K, en clips allant jusqu’à 15 secondes, avec un audio stéréo natif » (DataNorth AI, août 2026), et les scores le confirmaient : H3 se situe actuellement en haut du classement Elo de montage vidéo Artificial Analysis à 1 130, devant Gemini Omni Flash à 1 122 et 93 points d’avance sur Dreamina Seedance 2.0 720p à 1 037 (Artificial Analysis, août 2026). La qualité vaut un workflow. Le workflow doit simplement respecter comment le 2K est produit.

Les quatre modèles derrière ce test MiniMax H3 2K vs 768P, dans un seul onglet

L’ensemble du test repose sur quatre modèles, une clé API, une facture. Je l’ai exécuté sur Atlas Cloud car passer d’un modèle d’image, à deux endpoints H3 et à un suréchantillonneur signifie autrement trois comptes et trois factures à réconcilier à la fin du mois.

Tâche dans ce testModèlePrix en août 2026Ce que j’ai réellement payé
Verrouiller la première imageopenai/gpt-image-2/text-to-imageà partir de 0,009 $/image (niveaux de jetons au-dessus)0,1745 $ pour une image 2048x1152 en qualité haute
Brouillon et final, image verrouilléeminimax/h3/image-to-video0,14 $/s en 2K, 0,10 $/s en 768P0,40 $ et 0,56 $ pour 4 s chacun
Paire de contrôle nueminimax/h3/text-to-videomêmes deux niveaux0,40 $ et 0,56 $ pour 4 s chacun
Conserver le plan, augmenter les pixelsatlascloud/video-upscaler0,018 $/s jusqu’en 1080p, 0,024 $/s jusqu’en 2K, minimum 5 s0,12 $ pour le clip de 4,46 s

Deux notes avant de copier les chiffres. Les endpoints H3 publient tous un taux unique de 0,14 $/s, qui est le niveau 2K ; le taux 768P apparaît dans la facture, pas dans le listing, donc mesurez-le une fois vous-même. Et aucun de ces quatre modèles n’est remisé pour le moment. Si vous voulez réduire l’étape de verrouillage de l’image, openai/gpt-image-2-developer/text-to-image est à 50 % de réduction (0,004 $ au lieu de 0,009 $) en août 2026, et c’est la même famille qui fait le même travail.

Comment exécuter le test MiniMax H3 2K vs 768P vous-même

Cinq étapes, 2,21 $ de crédit, et environ 15 minutes de temps réel total. Chaque invite ci-dessous est la chaîne exacte que j’ai envoyée.

Trois notes de paramètres d’abord, car chacun peut silencieusement vous coûter une exécution :

  • Sur texte-vers-vidéo, le champ est ratio, pas aspect_ratio, sa valeur par défaut est 1:1, et son énumération n’a pas d’option adaptive. Passez 16:9 vous-même ou vous obtenez un clip carré. Sur image-vers-vidéo, l’énumération est seulement adaptive, car votre première image décide de la forme.
  • Envoyez toujours duration explicitement plutôt que de vous fier à la valeur par défaut documentée de 8. Ce qui vous est facturé suit ce qui est livré, pas ce que vous avez supposé.
  • Chaque tâche H3 survit à un délai d’attente normal, donc soumettez en asynchrone et interrogez. Le champ price se remplit aussi tard : lorsque status passe à completed, il est souvent encore vide, et vous devez interroger l’identifiant de prédiction une fois de plus pour obtenir le vrai nombre. Sans cette deuxième interrogation, vous ne pouvez pas construire un tableau de coûts honnête.

Étape 1 : Verrouillez l’image avec GPT Image 2

C’est l’étape qui transforme un brouillon en prévisualisation plutôt qu’en ticket de loterie. Générez la composition finie en tant qu’image fixe, et elle devient la partie immuable des deux exécutions vidéo.

text
1Macro product photograph of a matte black cold-brew coffee bottle standing on a wet slate slab, morning window light raking across it from the right. A cream paper label wraps the bottle, sharply legible: bold uppercase title "NORTHBOUND COLD BREW" on one line, and directly beneath it in small type "single origin ethiopia guji / 250ml / roasted 04.08.2026". Condensation beads on the glass, an espresso machine and a barista in a denim shirt softly out of focus in the background. Cinematic, shallow depth of field, warm neutral grade, photoreal, 16:9.
2

Paramètres : qualité haute, taille 2048x1152. Ne lésinez pas ici. Chaque détail que le passage 2K doit protéger doit d’abord exister dans cette image.

Une bouteille de café Northbound Cold Brew sur un comptoir de café

La première image verrouillée générée avec GPT Image 2 en 2048x1152, montrant la bouteille de cold brew et ses petits caractères lisibles

Générée avec openai/gpt-image-2/text-to-image, qualité haute, 2048x1152. Facturée 0,1745 $, revenue en 146 s.

Capture d’écran d’une interface de générateur d’images IA avec étapes numérotées

Interface GPT Image 2 sur Atlas Cloud avec l’invite d’image remplie et la bouteille générée dans le panneau de sortie

GPT Image 2 sur Atlas Cloud : qualité réglée sur haute, 16:9, l’image verrouillée rendue sur la droite.

Étape 2 : Brouillon en 768P

Même endpoint que vous utiliserez pour le final. Seule la résolution diffère entre cette étape et l’étape 4.

text
1Slow macro dolly-in on the bottle. Condensation beads slide down the glass. The label stays perfectly still and legible. In the soft background the barista wipes the counter once. Natural cafe room tone, a faint espresso machine hiss. No camera shake.
2

Paramètres sur minimax/h3/image-to-video : première image = votre sortie de l’étape 1, resolution=768P, duration=4, ratio=adaptive.

Une bouteille de café Northbound Cold Brew sur un comptoir de café

Le clip brouillon MiniMax H3 768P, un lent travelling macro sur la bouteille de cold brew

Le brouillon 768P : 1344x768, facturé 0,40 $, revenu en 194 s. Montré en GIF silencieux ; le fichier lui-même contient un audio stéréo 32 kHz. Notez les quatre grosses traînées de gouttes étalées sur l’étiquette.

Interface de générateur vidéo IA avec invite et vidéo de cold brew générée

Interface MiniMax H3 image-to-video sur Atlas Cloud avec l’image verrouillée téléchargée, l’invite tapée et un clip terminé dans le panneau de sortie

Le formulaire image-to-video avec l’image verrouillée chargée. La résolution et la durée sont les deux seuls champs qui séparent cette étape de l’étape 4, et les deux niveaux se trouvent dans la même liste sans rien qui verrouille l’un ou l’autre. Cette capture a été laissée sur les valeurs par défaut 2K et 8 secondes, c’est pourquoi le bouton Run affiche 1,12 $ ; passez la résolution à 768P et la durée à 4 et cette estimation tombe à 0,40 $.

Étape 3 : Jugez le brouillon MiniMax H3 2K vs 768P sur les bonnes choses

Le brouillon est une répétition, pas une preuve. D’après mes deux paires, voici ce qu’il vous dit de manière fiable et ce qu’il ne dit pas.

Fiez-vous à lui pour : le libellé de l’invite, si le mouvement se lit, la quantité de mouvement de la caméra, le rythme sur les quatre secondes, et le fond audio. Tout cela a été transféré proprement.

Ne vous fiez pas à lui pour : la texture de surface fine, le plus petit type sur votre produit, ou tout artefact qu’il invente. Dans mon brouillon 768P, l’étiquette a reçu quatre épaisses traînées brunes que l’exécution 2K n’a pas produites, et la petite ligne d’ingrédients s’est effondrée en bouillie. Si j’avais rejeté ce brouillon pour son aspect sale, j’aurais rejeté une invite qui fonctionnait.

C’est la vraie division du travail. Le 768P répond à la question « est-ce le bon plan », le 2K répond à la question « est-ce livrable ».

Étape 4 : Changez un champ et terminez en 2K

Même endpoint, même première image, même chaîne d’invite. Changez resolution en 2K et rien d’autre.

Une bouteille de café Northbound Cold Brew sur un comptoir de café

Le clip final MiniMax H3 2K à partir de la même première image verrouillée, avec une étiquette propre et des petits caractères lisibles

Le final 2K : 2560x1440, facturé 0,56 $, revenu en 234 s. Même dalle, même machine à espresso, même plante, même barista, même position de l’étiquette que le brouillon.

Voici la réponse à la question pour laquelle tout cet article a été construit, et elle est allée dans le bon sens. Avec la première image verrouillée, la dérive s’est arrêtée. Le décor, le cadrage, la hauteur de la caméra et la position de la typographie ont tous tenu entre le brouillon 768P et le final 2K. Les différences se limitaient aux détails : le passage 2K a nettoyé les traînées étalées en une seule fine rigole, a résolu le grain du papier, et a transformé la petite ligne d’ingrédients de bruit en mots. C’est exactement le comportement que MiniMax revendique pour la régénération en contexte, et c’est la première fois dans ce test que le 2K ressemblait à un niveau de qualité plutôt qu’à une relance.

Pour contraste, le groupe témoin. Voici l’exécution nue texte-vers-vidéo en 2K, celle qui a produit l’inconnu en haut de cette page. Même contenu d’invite, pas de première image, donc rien n’épingle la composition.

11 mots

Interface MiniMax H3 text-to-video en 2K avec le clip témoin terminé dans le panneau de sortie

MiniMax H3 text-to-video sur Atlas Cloud : pas de première image, résolution 2K, rapport d’aspect 16:9, et le clip terminé dans le panneau de sortie. Rien n’allait mal avec cette génération. Ce n’est tout simplement pas le même film que l’exécution 768P a produit.

Étape 5 : Ou évitez la relance MiniMax H3 2K vs 768P et suréchantillonnez plutôt

Parfois, le plan 768P est déjà le bon. La performance est tombée juste, le timing est bon, et vous ne voulez pas d’une régénération qui pourrait atterrir différemment. Alors ne le relancez pas. Poussez le fichier exact à travers un suréchantillonneur.

Paramètres sur atlascloud/video-upscaler : video = votre URL de sortie 768P, target_resolution=2k. Les limites d’entrée à 2K sont de 23 secondes et 690 images, et l’ips d’entrée doit être de 30 ou moins, donc les clips H3 à 24 ips passent confortablement.

Bouteille de café Northbound Cold Brew sur un comptoir de café

Le plan 768P passé à travers le suréchantillonneur vidéo Atlas Cloud jusqu’en 2K, mêmes images à une résolution plus élevée

Le plan suréchantillonné : 2540x1452, facturé 0,12 $, revenu en 40 s. Mêmes quatre traînées, même tout. C’est le même film, pas un nouveau.

Interface de générateur vidéo IA montrant la vidéo d’entrée et de sortie terminée

Interface du suréchantillonneur vidéo Atlas Cloud avec le clip 768P chargé et le résultat 2K dans le panneau de sortie

Le suréchantillonneur vidéo sur Atlas Cloud avec le clip H3 768P chargé et le résultat suréchantillonné en lecture sur la droite. Cette capture a été exécutée avec la valeur par défaut 1080p, que le bouton Run tarifie à 0,09 $ pour tout ce qui est en dessous du minimum de 5 secondes. Passez la résolution cible à 2k et vous êtes sur le niveau 0,024 $/s, ce qui correspond aux 0,12 $ qui m’ont été facturés pour ma propre exécution.

Et voici le verdict que personne ne devrait sauter, les trois recadrages d’étiquette de la même image verrouillée au même grossissement.

Comparaison à trois panneaux d’étiquettes de bouteille de cold brew à différentes résolutions

Comparaison de recadrage d’étiquette à trois voies : 768P natif, ce clip suréchantillonné en 2K, et 2K natif, montrant que seul le 2K natif récupère les petits caractères

768P natif, le même clip suréchantillonné, et 2K natif. Le suréchantillonneur affine le grain du papier et le grand titre magnifiquement, et il conserve le plan exact. Ce qu’il ne peut pas faire, c’est remettre la petite ligne, car cette information n’a jamais été dans le fichier 768P. Le passage de régénération le peut, car il retourne au contexte au lieu des pixels.

Ainsi, les deux voies ne sont pas concurrentes. Elles répondent à des questions différentes. Le suréchantillonnage préserve une performance. La régénération récupère les détails. Choisissez selon ce que votre clip ne peut pas se permettre de perdre.

Variations à tester sur MiniMax H3 2K vs 768P

  • Vertical. Mes tests 16:9 sont revenus en 1344x768, donc le côté court est ce que le niveau épingle. Une demande 9:16 devrait atterrir en 768x1344 selon la même logique, mais mesurez-le une fois avant de construire un lot vertical sur l’hypothèse. Sur image-vers-vidéo, vous définissez la forme via la première image plutôt que de lutter contre l’énumération adaptive.
  • Têtes parlantes. C’est là que je sauterais complètement le brouillon et irais directement en 2K. Les visages, les dents et les lignes de regard sont précisément la classe de petits détails pour laquelle le passage de régénération existe, et un brouillon 768P vous désinformera sur les trois.
  • Clips longs. À 15 secondes, l’écart passe à 1,50 $ contre 2,10 $, et le temps réel s’allonge avec. Planifiez la file d’attente, pas seulement le budget.
  • Texte de produit et travail multilingue. Le type stable dans l’image de H3 et son audio multilingue natif sont les raisons pour lesquelles les gens le choisissent pour l’emballage commercial en premier lieu. Les deux survivent en 768P, ce qui fait du 768P un niveau de livraison réellement utilisable pour les recadrages sociaux, pas seulement une salle de répétition.

Ce que MiniMax H3 2K vs 768P coûte réellement par clip utilisable

D’abord les trois routes vers un livrable 2K, par clip de 8 secondes, aux taux qui m’ont été réellement facturés.

Route vers un clip 2KTaux utilisésCoût pour un clip de 8 sConserve le même planRécupère les petits textes
Directement en 2K0,14 $/s1,12 $n/aOui
Brouillon 768P, puis relance 2K sur image verrouillée0,10 $/s puis 0,14 $/s0,80 $ + 1,12 $ = 1,92 $Oui, si la première image est verrouilléeOui
Final 768P, puis suréchantillonnage en 2K0,10 $/s puis 0,024 $/s0,80 $ + 0,192 $ = 0,99 $Oui, exactementNon

Maintenant, le chiffre qui décide de votre mois. Prenez un mélange réaliste : dix brouillons de 4 secondes pour trouver le plan, puis deux clips finis de 8 secondes.

Lot de 10 brouillons + 2 finauxBrouillonsFinauxVerrouillage d’imageTotal
Tout en 2K10 x 4 s x 0,14 $ = 5,60 $2 x 8 s x 0,14 $ = 2,24 $aucun7,84 $
Brouillons 768P, finaux 2K, image verrouillée10 x 4 s x 0,10 $ = 4,00 $2,24 $0,17 $6,41 $ (18 % de moins)
Brouillons 768P, finaux 768P, suréchantillonnés4,00 $2 x (0,80 $ + 0,192 $) = 1,98 $0,17 $6,15 $ (22 % de moins)

Lisez la ligne du milieu honnêtement. L’économie par seconde est de 29 %, mais l’économie par lot est de 18 %, car vos finaux sont toujours des finaux. L’économie ne croît que vers 29 % à mesure que le brouillon domine : à vingt brouillons de 8 secondes au lieu de dix courts, la route deux atterrit environ 25 % en dessous du tout-2K. Et chaque centime de cela dépend de l’image verrouillée, car sans elle, ces dix rouleaux bon marché sont dix films que vous n’allez pas livrer.

Le deuxième dividende est le temps, et il pourrait compter davantage. Sur la paire texte-vers-vidéo, le 768P est revenu 28 % plus vite, et sur les deux paires, il n’a jamais pris plus de temps. Sur des clips de 4 secondes avec ces temps réels, cela représente environ 27 brouillons en une heure au lieu de 20. Lorsque vous êtes encore en train de chercher la bonne invite, sept coups supplémentaires comptent plus que les 1,60 $ que vous avez économisés.

Une note juridique si vous prévoyiez d’éviter tout cela en auto-hébergeant. Les poids ouverts sur Hugging Face sont H3-Base, qui génère au côté court 768. Le passage 2K vit du côté de l’API, donc les poids ouverts vous donnent le niveau brouillon et pas le niveau finition. La licence communautaire comporte également des territoires exclus couvrant l’UE, le Royaume-Uni, la Corée et les États-Unis, avec un canal d’autorisation séparé ouvert, alors lisez la licence avant de construire un pipeline commercial sur un checkout local. Pour un aperçu plus large de ce que les poids publiés incluent et n’incluent pas, voir notre revue MiniMax H3, et le catalogue de modèles complet si vous voulez comparer le prix de H3 avec le reste du domaine vidéo actuel.

Questions fréquentes

Dans MiniMax H3 2K vs 768P, le 768P est-il réellement moins cher par clip ?

Oui. On m’a facturé 0,40 $ pour un clip de 4 secondes en 768P et 0,56 $ pour la demande identique en 2K, soit 0,10 $/s contre 0,14 $/s, une économie de 29 % par seconde. L’astuce est que l’économie ne compte que si l’exécution bon marché vous apprend quelque chose sur la coûteuse, ce qui nécessite de verrouiller la première image. Un brouillon nu texte-vers-vidéo en 768P est un film séparé, et l’argent dépensé dessus n’est pas de l’argent économisé.

Dans MiniMax H3 2K vs 768P, le 2K est-il simplement un suréchantillonnage de la sortie 768P ?

Non. MiniMax fait régénérer par le modèle de base sa propre sortie basse résolution en contexte plutôt que d’exécuter un module de super-résolution dédié, ce qui explique pourquoi le 2K peut restaurer les petits textes et les détails de surface fins qu’un suréchantillonneur ne peut qu’approximer. Mon recadrage d’étiquette à trois voies montre exactement cela : le clip 768P suréchantillonné a affiné le grain du papier mais a laissé la petite ligne d’ingrédients comme un bruit illisible, tandis que l’exécution 2K native l’a transformée en mots.

Mon brouillon MiniMax H3 768P ressemblera-t-il à mon final 2K ?

Seulement si vous verrouillez la première image. Sur texte-vers-vidéo nu, les deux niveaux m’ont donné un habillage de décor différent, une hauteur de caméra différente, une condensation différente et une position d’étiquette différente à partir de la même invite. Sur image-vers-vidéo avec une première image fixe, la composition, le cadrage et la typographie ont tous tenu entre les niveaux et les seuls changements étaient dans les détails et la texture.

Dois-je encore contacter les ventes pour MiniMax H3 768P ?

Non, pas au 2026-08-05. Le schéma en direct sur les trois endpoints H3 liste resolution comme enum: ["768P", "2K"], le playground montre les deux dans un seul menu déroulant, et mes tâches 768P ont été terminées et facturées au tarif inférieur sur deux endpoints différents. La ligne de bêta fermée provient de la couverture rédigée dans les premiers jours suivant le lancement.

Dans MiniMax H3 2K vs 768P, combien le 2K est-il plus lent ?

Sur mes paires de 4 secondes, 1,2x à 1,4x plus lent : 181 s contre 130 s sur texte-vers-vidéo et 234 s contre 194 s sur image-vers-vidéo, mesuré de la soumission à la fin. Architecturalement, le 2K est un deuxième passage de génération sur le même contexte, donc attendez-vous à ce que l’écart absolu s’élargisse sur des clips plus longs plutôt que de rester plat.

Puis-je mettre à niveau un clip 768P vers 2K sans le relancer ?

Vous pouvez augmenter la résolution sans toucher au plan en l’exécutant via un suréchantillonneur vidéo, ce qui m’a coûté 0,12 $ pour un clip de 4,46 secondes au niveau 2K (0,024 $/s avec un minimum de 5 secondes) et est revenu en 40 secondes. Cela préserve la performance image par image. Ce qu’il ne fera pas, c’est récupérer les détails qui n’ont jamais été capturés, donc si le but du passage en 2K est d’avoir des petits caractères lisibles, vous avez besoin du passage de régénération, pas du suréchantillonneur.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles