Seedance 2.0 Mini & Fast API aux prix les plus bas au monde — jusqu'à 68 % de réduction sur le tarif officiel

MiniMax H3 2K vs 768P : j'ai exécuté la même invite deux fois et obtenu deux films différents

Mesuré le 2026-08-05 : MiniMax H3 2K vs 768P donne 1344x768 vs 2560x1440 à $0.40 vs $0.56. Pourquoi le brouillon bon marché n'est pas un aperçu de votre version finale, et la correction.

Two printed photos of cold brew bottles on a wooden table

Deux tirages de la même bouteille de cold brew posée sur un comptoir de café, l'un flou et l'autre net, avec un ticket de caisse entre eux

Deux tirages de la même prise, l'un flou et l'autre net. Sur MiniMax H3, cet écart n'est pas un curseur de qualité. Généré avec openai/gpt-image-2/text-to-image.

J'ai soumis deux fois la même instruction. La seule chose que j'ai changée, c'est un menu déroulant : 768P, puis 2K.

La première exécution a coûté 0,40 $ et est revenue en 130 secondes. La seconde a coûté 0,56 $ et a pris 181 secondes. Ensuite, j'ai mis les deux images côte à côte et quelque chose clochait. La bouteille était toujours là. L'étiquette était toujours là, petits caractères compris. Mais le comptoir était passé du bois chaleureux à la pierre pâle, une étagère était apparue en arrière-plan derrière le barista, la condensation sur le verre était soudainement partout, et la lumière avait changé de couleur.

Je n'avais pas économisé sur une ébauche. J'avais développé deux films différents.

Ce n'est pas un bug. C'est ce que "2K" signifie réellement sur H3, et une fois que vous le comprenez, le conseil standard que tout le monde donne, "ébauchez à petit prix puis terminez cher", tombe silencieusement en morceaux. Ci-dessous, tous les chiffres de ce test, plus le seul changement qui rend les ébauches bon marché efficaces.

Points clés (tous les chiffres mesurés sur Atlas Cloud, 2026-08-05)

  • 768P a délivré 1344x768, 2K a délivré 2560x1440 pour une demande 16:9. Soit 3,6 fois les pixels et 3,6 fois le débit vidéo.
  • La facturation était de 0,40 $ vs 0,56 $ pour un clip de 4 secondes, soit 0,10 $/s vs 0,14 $/s. 768P est 29 % moins cher par seconde, pas moitié prix.
  • 768P est revenu 28 % plus vite sur la paire texte-vers-vidéo (130 s contre 181 s) et 17 % plus vite sur la paire image-vers-vidéo (194 s contre 234 s).
  • Texte-vers-vidéo en 768P et 2K avec la même instruction a produit deux prises différentes, pas deux qualités d'une même prise. Une ébauche nue en 768P ne prévisualise pas votre final 2K.
  • Verrouillez la première image avec image-vers-vidéo et la dérive s'arrête. Même décor, même cadrage, même position de l'étiquette, et la 2K dépense ses pixels supplémentaires exactement là où MiniMax le dit : les petits caractères.
  • 768P n'est pas verrouillé. Les deux niveaux sont disponibles dans l'énumération de résolution et sélectionnables dans le menu déroulant au 2026-08-05, quoi que disent encore les anciens récapitulatifs.

MiniMax H3 2K vs 768P : le 768P est-il encore en bêta fermée ?

Non, et il vaut la peine de tuer cette idée rapidement car elle est encore répétée dans la plupart des récapitulatifs de prix rédigés dans les jours suivant le lancement.

J'ai extrait le schéma d'entrée en direct pour les trois endpoints H3 aujourd'hui. Le champ resolution indique enum: ["768P", "2K"] avec default: "2K" sur texte-vers-vidéo, image-vers-vidéo et référence-vers-vidéo, et duration fonctionne pour chaque seconde entière de 4 à 15 sur les trois. Pas de drapeau, pas de porte, pas de formulaire commercial. J'ai ensuite soumis un travail 768P sur deux endpoints différents et les deux se sont terminés et ont été facturés au tarif inférieur. Si une page vous dit de contacter le service commercial pour le 768P, cette page décrit la première semaine du lancement, pas cette semaine.

MiniMax H3 2K vs 768P, même instruction, côte à côte

À gauche, 768P. À droite, 2K. Instruction identique, duration=4 identique, ratio=16:9 identique, soumis l'un après l'autre à minimax/h3/text-to-video.

Side-by-side comparison of image resolution showing a cold brew bottle

MiniMax H3 2K vs 768P en écran partagé à partir de la même instruction texte-vers-vidéo, avec la résolution, le prix et le temps réel incrustés

Même instruction, deux exécutions. Gauche : 768P, 1344x768, 0,40 $, 130 s. Droite : 2K, 2560x1440, 0,56 $, 181 s. Montré sous forme de GIF silencieux ; les deux fichiers livrés portent un audio stéréo 32 kHz. Mesuré sur Atlas Cloud, 2026-08-05.

Regardez ce qui diffère réellement. Ce n'est pas la netteté. C'est le film. Matériau du comptoir différent, habillage d'arrière-plan différent, quantité de condensation différente, hauteur de caméra différente, température de couleur différente, et l'étiquette se trouve à un endroit différent sur la bouteille. Rien dans l'instruction ne demandait que l'un de ces éléments change.

Maintenant, la partie que tout le monde suppose aller dans l'autre sens. Voici la zone de l'étiquette des deux prises, recadrée à partir des fichiers natifs et agrandie à la même largeur, de sorte que le recadrage 768P est plus agrandi que le recadrage 2K.

Comparison of 768p and 2K resolution on a cold brew label

Comparaison du recadrage de l'étiquette entre les prises MiniMax H3 768P et 2K, montrant toutes deux la petite ligne d'ingrédients comme lisible

La petite ligne "single origin ethiopia guji / 250ml / roasted 04.08.2026" survit en 768P. Elle est plus molle et l'espacement des lettres vacille, mais rien n'est illisible. Le vrai coût du 768P ici n'était pas un texte flou, c'était une composition différente.

Donc, le cadrage honnête de MiniMax H3 2K vs 768P n'est pas "net contre flou". C'est "cette prise contre une prise différente, plus une passe de détail par-dessus".

La fiche technique MiniMax H3 2K vs 768P, mesurée

Tout dans ce tableau provient de ffmpeg -i sur les fichiers livrés et du champ price de la prédiction terminée, non d'une page de documentation.

Mesuré sur le fichier livré768P2KRatio
Résolution livrée (demande 16:9)1344x7682560x14403,6x pixels
Débit vidéo998 kb/s3 624 kb/s3,6x
Taille du fichier, clip de 4,46 s620 Ko2,00 Mo3,3x
Fréquence d'images24 ips24 ipsidentique
Piste audioAAC stéréo, 32 000 Hz, 131 kb/sAAC stéréo, 32 000 Hz, 127 kb/sidentique
Durée du conteneur pour duration=44,46 s4,46 sidentique
Soumis à terminé, temps réel130 s181 s1,39x
Effectivement facturé0,40 $0,56 $1,4x
Taux effectif0,10 $/s0,14 $/s29 % moins cher

Vous voulez comparer MiniMax H3 à d'autres modèles vidéo sur la même instruction ? La comparaison de modèles Atlas Cloud les exécute côte à côte avec la résolution et le coût par seconde affichés avant de générer.

Deux notes de bas de page qui m'ont coûté de l'argent à apprendre. Premièrement, les deux niveaux ont livré 4,46 secondes pour une demande duration=4 et les deux ont facturé 4 secondes, donc vous obtenez les 0,46 s supplémentaires gratuitement, mais vous ne pouvez pas planifier une coupe autour. Deuxièmement, l'audio est identique entre les niveaux. Si votre clip repose sur un dialogue ou une synchronisation musicale, 2K ne vous apporte rien sur ce qui compte.

Pourquoi MiniMax H3 2K vs 768P piège tout le monde

Parce que le 2K sur H3 n'est pas une étape de suréchantillonnage. C'est une seconde génération.

MiniMax décrit le mécanisme directement : "Pour la sortie 2K de H3, au lieu d'utiliser un module de super-résolution dédié classique, nous faisons régénérer sa propre sortie basse résolution par le modèle de base H3 en contexte." Ils expliquent aussi pourquoi ils l'ont construit ainsi : l'approche en contexte "lui permet de puiser à nouveau dans le contexte multimodal d'origine pour produire une sortie haute résolution, récupérant des détails que la super-résolution traditionnelle ne peut que 'deviner' et souvent ne peut pas restaurer, comme les petits textes et les détails fins" (MiniMax, juillet 2026).

Relisez cela avec un chapeau de production. La passe 2K retourne à votre contexte d'origine et génère à nouveau. Lorsque votre contexte n'est qu'une instruction textuelle, "générer à nouveau" signifie "relancer les dés". C'est exactement ce que montrent mes deux prises. Le modèle n'a jamais été chargé de reproduire la version 768P, car il n'a jamais vu la version 768P.

Trois façons dont cela mord dans la pratique :

  1. Vous lancez des ébauches bon marché en 768P sur texte-vers-vidéo, choisissez un gagnant, puis le relancez en 2K. Vous obtenez un inconnu. L'instruction est respectée, le film est nouveau. C'est le test en haut de cette page.
  2. Vous budgétisez comme si 29 % de moins par seconde signifiait 29 % de moins cher. Ce n'est pas le cas, car les finales sont la partie coûteuse de tout lot réel, et un seul relancement 2K gaspillé efface l'économie de plusieurs ébauches.
  3. Vous supposez que le chemin de mise à niveau bon marché existe quelque part. J'ai vérifié le catalogue complet sur Atlas Cloud aujourd'hui : 452 modèles, trois endpoints H3, et aucun endpoint de régénération H3 parmi eux. Là où seuls les trois endpoints de génération sont exposés, "mettre à niveau ce clip vers 2K" signifie soit le relancer, soit exécuter un suréchantillonneur séparé dessus. Les deux coûtent de l'argent, et ils n'achètent pas la même chose.

Il vaut la peine de dire pourquoi il vaut même la peine de s'ingénier autour de ce modèle plutôt que de changer. L'offre phare au lancement était la vidéo "jusqu'à une résolution 2K, en clips allant jusqu'à 15 secondes, avec un audio stéréo natif" (DataNorth AI, août 2026), et les scores le confirmaient : H3 se situe actuellement en haut du tableau Elo de l'édition vidéo d'Artificial Analysis à 1 130, devant Gemini Omni Flash à 1 122 et 93 points d'avance sur Dreamina Seedance 2.0 720p à 1 037 (Artificial Analysis, août 2026). La qualité vaut un workflow. Le workflow doit juste respecter comment le 2K est produit.

Les quatre modèles derrière ce test MiniMax H3 2K vs 768P, dans un seul onglet

L'ensemble du test comprend quatre modèles, une clé API, une seule facture. Je l'ai exécuté sur Atlas Cloud car passer d'un modèle d'image, de deux endpoints H3 et d'un suréchantillonneur signifierait autrement trois comptes et trois factures à rapprocher à la fin du mois.

Travail dans ce testModèlePrix en août 2026Ce que j'ai réellement payé
Verrouiller la première imageopenai/gpt-image-2/text-to-imagelisté à partir de 0,009 $/image (paliers de jetons au-dessus)0,1745 $ pour une 2048x1152 en qualité haute
Ébauche et finale, image verrouilléeminimax/h3/image-to-video0,14 $/s en 2K, 0,10 $/s en 768P0,40 $ et 0,56 $ pour 4 s chacun
Paire de contrôle nueminimax/h3/text-to-videomêmes deux niveaux0,40 $ et 0,56 $ pour 4 s chacun
Garder la prise, augmenter les pixelsatlascloud/video-upscaler0,018 $/s en 1080p, 0,024 $/s en 2K, minimum 5 s0,12 $ pour le clip de 4,46 s

Deux notes avant de copier les chiffres. Les endpoints H3 publient tous un taux unique de 0,14 $/s, qui est le niveau 2K ; le taux 768P apparaît dans la facture, pas dans la liste, donc mesurez-le vous-même une fois. Et aucun de ces quatre modèles n'est actuellement réduit. Si vous voulez réduire l'étape de verrouillage de l'image, openai/gpt-image-2-developer/text-to-image est à 50 % de réduction (0,004 $ au lieu de 0,009 $) en août 2026, et c'est la même famille faisant le même travail.

Comment exécuter vous-même le test MiniMax H3 2K vs 768P

Cinq étapes, 2,21 $ de crédit, et environ 15 minutes de temps total. Chaque instruction ci-dessous est la chaîne exacte que j'ai envoyée.

Trois notes sur les paramètres d'abord, car chacun peut vous coûter silencieusement une exécution :

  • Sur texte-vers-vidéo, le champ est ratio, pas aspect_ratio, sa valeur par défaut est 1:1, et son enum n'a pas d'option adaptive. Passez 16:9 vous-même ou vous obtenez un clip carré. Sur image-vers-vidéo, l'enum est seulement adaptive, car votre première image décide de la forme.
  • Envoyez toujours duration explicitement plutôt que de faire confiance à la valeur par défaut documentée de 8. Ce qui vous est facturé suit ce qui est livré, pas ce que vous avez supposé.
  • Chaque travail H3 survit à un délai d'attente normal en ligne, donc soumettez en asynchrone et interrogez. Le champ price se remplit également tard : lorsque status passe à completed, il est souvent encore vide, et vous devez interroger l'ID de prédiction une fois de plus pour obtenir le nombre réel. Sans cette seconde interrogation, vous ne pouvez pas construire un tableau de coûts honnête.

Étape 1 : Verrouiller l'image avec GPT Image 2

C'est l'étape qui transforme une ébauche en prévisualisation au lieu d'un ticket de loterie. Générez la composition finie comme une image fixe, et elle devient la partie immuable des deux exécutions vidéo.

text
1Macro product photograph of a matte black cold-brew coffee bottle standing on a wet slate slab, morning window light raking across it from the right. A cream paper label wraps the bottle, sharply legible: bold uppercase title "NORTHBOUND COLD BREW" on one line, and directly beneath it in small type "single origin ethiopia guji / 250ml / roasted 04.08.2026". Condensation beads on the glass, an espresso machine and a barista in a denim shirt softly out of focus in the background. Cinematic, shallow depth of field, warm neutral grade, photoreal, 16:9.
2

Paramètres : qualité high, taille 2048x1152. Ne lésinez pas ici. Chaque détail que vous souhaitez que la passe 2K protège doit d'abord exister dans cette image.

A bottle of Northbound Cold Brew coffee on a cafe counter

La première image verrouillée générée avec GPT Image 2 en 2048x1152, montrant la bouteille de cold brew et ses petits caractères lisibles

Généré avec openai/gpt-image-2/text-to-image, qualité haute, 2048x1152. Facturé 0,1745 $, revenu en 146 s.

Screenshot of an AI image generator interface with numbered steps

Interface de GPT Image 2 sur Atlas Cloud avec l'instruction de l'image remplie et la bouteille générée dans le panneau de sortie

GPT Image 2 sur Atlas Cloud : qualité réglée sur haute, 16:9, l'image verrouillée rendue à droite.

Étape 2 : Ébaucher en 768P

Même endpoint que vous utiliserez pour la finale. Seule la résolution diffère entre cette étape et l'étape 4.

text
1Slow macro dolly-in on the bottle. Condensation beads slide down the glass. The label stays perfectly still and legible. In the soft background the barista wipes the counter once. Natural cafe room tone, a faint espresso machine hiss. No camera shake.
2

Paramètres sur minimax/h3/image-to-video : première image = votre sortie de l'étape 1, resolution=768P, duration=4, ratio=adaptive.

A bottle of Northbound Cold Brew coffee on a cafe counter

Le clip d'ébauche MiniMax H3 768P, un lent zoom avant macro sur la bouteille de cold brew

L'ébauche 768P : 1344x768, facturé 0,40 $, revenu en 194 s. Montré sous forme de GIF silencieux ; le fichier lui-même porte un audio stéréo 32 kHz. Notez les quatre traces de gouttes épaisses étalées sur l'étiquette.

AI video generator interface with prompt and generated cold brew video

Interface de générateur vidéo IA MiniMax H3 image-vers-vidéo sur Atlas Cloud avec l'image verrouillée téléchargée, l'instruction tapée et un clip terminé dans le panneau de sortie

Le formulaire image-vers-vidéo avec l'image verrouillée chargée. La résolution et la durée sont les deux seuls champs qui séparent cette étape de l'étape 4, et les deux niveaux se trouvent dans la même liste sans rien qui verrouille l'un ou l'autre. Cette capture a été laissée sur les valeurs par défaut 2K et 8 secondes, c'est pourquoi le bouton Exécuter indique 1,12 $ ; passez la Résolution à 768P et la Durée à 4 et ce devis tombe à 0,40 $.

Étape 3 : Juger l'ébauche MiniMax H3 2K vs 768P sur les bonnes choses

L'ébauche est une répétition, pas une preuve. D'après mes deux paires, voici ce qu'elle vous dit de manière fiable et ce qu'elle ne dit pas.

Faites-lui confiance pour : le libellé de l'instruction, si le mouvement se lit du tout, la quantité de mouvement de la caméra, le rythme sur les quatre secondes, et le fond sonore. Tout cela a été transféré proprement.

Ne lui faites pas confiance pour : la texture de surface fine, le plus petit type de votre produit, ou tout artefact qu'elle invente. Dans mon ébauche 768P, l'étiquette a attrapé quatre épaisses traînées brunes que l'exécution 2K n'a pas produites, et la petite ligne d'ingrédients s'est effondrée en bouillie. Si j'avais rejeté cette ébauche pour son aspect sale, j'aurais rejeté une instruction qui fonctionnait.

C'est la véritable division du travail. 768P répond "est-ce la bonne prise", 2K répond "est-ce diffusable".

Étape 4 : Basculer un champ et terminer en 2K

Même endpoint, même première image, même chaîne d'instruction. Changez resolution en 2K et rien d'autre.

A bottle of Northbound Cold Brew coffee on a cafe counter

Le clip final MiniMax H3 2K à partir de la même première image verrouillée, avec une étiquette propre et des petits caractères lisibles

La finale 2K : 2560x1440, facturé 0,56 $, revenu en 234 s. Même dalle, même machine à espresso, même plante, même barista, même position de l'étiquette que l'ébauche.

Voici la réponse à la question que tout cet article était conçu pour tester, et elle est allée dans le bon sens. Avec la première image verrouillée, la dérive s'est arrêtée. Le décor, le cadrage, la hauteur de la caméra et la position de la typographie ont tous tenu entre l'ébauche 768P et la finale 2K. Les différences se limitaient aux détails : la passe 2K a nettoyé les traînées étalées en un seul mince filet, a résolu le grain du papier, et a transformé la petite ligne d'ingrédients de bruit en mots. C'est exactement le comportement que MiniMax revendique pour la régénération en contexte, et c'est la première fois dans ce test que le 2K ressemblait à un niveau de qualité plutôt qu'à un relancement.

Pour contraste, le groupe de contrôle. Voici l'exécution texte-vers-vidéo nue en 2K, celle qui a produit l'inconnu en haut de cette page. Même contenu d'instruction, pas de première image, donc rien ne fixe la composition.

11 words

Interface de générateur vidéo IA MiniMax H3 texte-vers-vidéo en 2K avec le clip de contrôle terminé dans le panneau de sortie

MiniMax H3 texte-vers-vidéo sur Atlas Cloud : pas de première image, Résolution 2K, Aspect Ratio 16:9, et le clip terminé dans le panneau de sortie. Rien n'allait mal avec cette génération. Ce n'est tout simplement pas le même film que l'exécution 768P a produit.

Étape 5 : Ou sauter le relancement MiniMax H3 2K vs 768P et suréchantillonner à la place

Parfois, la prise 768P est déjà la bonne. La performance a atterri, le timing est bon, et vous ne voulez pas d'une régénération qui pourrait atterrir différemment. Alors ne la relancez pas. Poussez le fichier exact à travers un suréchantillonneur.

Paramètres sur atlascloud/video-upscaler : video = votre URL de sortie 768P, target_resolution=2k. Les limites d'entrée en 2K sont de 23 secondes et 690 images, et l'ips d'entrée doit être de 30 ou moins, donc les clips 24 ips de H3 passent confortablement.

Bottle of Northbound Cold Brew coffee on a cafe counter

La prise 768P poussée à travers le suréchantillonneur vidéo Atlas Cloud jusqu'en 2K, mêmes images à une résolution plus élevée

La prise suréchantillonnée : 2540x1452, facturé 0,12 $, revenu en 40 s. Mêmes quatre traînées, même tout. C'est le même film, pas un nouveau.

AI video generator interface showing input and completed output video

Interface du suréchantillonneur vidéo Atlas Cloud avec le clip 768P chargé et le résultat 2K dans le panneau de sortie

Le suréchantillonneur vidéo sur Atlas Cloud avec le clip H3 768P chargé et le résultat suréchantillonné jouant à droite. Cette capture a été exécutée sur la valeur par défaut 1080p, que le bouton Exécuter tarifie à 0,09 $ pour tout ce qui est en dessous du minimum de 5 secondes. Passez la Résolution cible à 2k et vous êtes sur le niveau 0,024 $/s, ce qui correspond aux 0,12 $ qui m'ont été facturés pour ma propre exécution.

Et voici le verdict que personne ne devrait sauter, les trois recadrages d'étiquette de la même image verrouillée à la même magnification.

Three-panel comparison of cold brew bottle labels at different resolutions

Comparaison en trois panneaux du recadrage de l'étiquette de la bouteille de cold brew à différentes résolutions : 768P natif, ce clip suréchantillonné en 2K, et 2K natif, montrant que seul le 2K natif récupère les petits caractères

768P natif, le même clip suréchantillonné, et 2K natif. Le suréchantillonneur affine magnifiquement le grain du papier et le grand titre, et il conserve la prise exacte. Ce qu'il ne peut pas faire, c'est remettre la petite ligne, car cette information n'a jamais été dans le fichier 768P. La passe de régénération le peut, car elle retourne au contexte au lieu des pixels.

Donc, les deux voies ne sont pas concurrentes. Elles répondent à des questions différentes. Le suréchantillonnage préserve une performance. La régénération récupère les détails. Choisissez selon lequel de ces deux éléments votre clip ne peut pas se permettre de perdre.

Variations à tester sur MiniMax H3 2K vs 768P

  • Vertical. Mes tests 16:9 sont revenus en 1344x768, donc le petit côté est ce que le niveau fixe. Une demande 9:16 devrait atterrir en 768x1344 sur la même logique, mais mesurez-la une fois avant de construire un lot vertical sur l'hypothèse. Sur image-vers-vidéo, vous définissez la forme via la première image plutôt que de lutter contre l'enum adaptive.
  • Têtes parlantes. C'est là que je sauterais complètement l'ébauche et irais directement en 2K. Les visages, les dents et les lignes de regard sont précisément la classe de petits détails pour laquelle la passe de régénération existe, et une ébauche 768P vous désinformera sur les trois.
  • Clips longs. À 15 secondes, l'écart passe à 1,50 $ contre 2,10 $, et le temps réel s'allonge avec. Planifiez la file d'attente, pas seulement le budget.
  • Texte de produit et travail multilingue. Le type stable dans l'image de H3 et son audio multilingue natif sont les raisons pour lesquelles les gens le choisissent pour l'emballage commercial en premier lieu. Les deux survivent en 768P, ce qui fait du 768P un niveau de livraison vraiment utilisable pour les recadrages sociaux, pas seulement une salle de répétition.

Ce que MiniMax H3 2K vs 768P coûte vraiment par clip utilisable

D'abord les trois voies vers un livrable 2K, par clip de 8 secondes, aux tarifs qui m'ont été effectivement facturés.

Voie vers un clip 2KTarifs utilisésCoût pour un clip de 8 sConserve la même priseRécupère le petit texte
Directement en 2K0,14 $/s1,12 $n/aOui
Ébauche 768P, puis relancement 2K sur image verrouillée0,10 $/s puis 0,14 $/s0,80 $ + 1,12 $ = 1,92 $Oui, si la première image est verrouilléeOui
Finale 768P, puis suréchantillonnage en 2K0,10 $/s puis 0,024 $/s0,80 $ + 0,192 $ = 0,99 $Oui, exactementNon

Maintenant, le nombre qui décide de votre mois. Prenez un mélange réaliste : dix rouleaux d'ébauche de 4 secondes pour trouver la prise, puis deux clips finis de 8 secondes.

Lot de 10 ébauches + 2 finalesÉbauchesFinalesVerrouillage d'imageTotal
Tout en 2K10 x 4 s x 0,14 $ = 5,60 $2 x 8 s x 0,14 $ = 2,24 $aucun7,84 $
Ébauches 768P, finales 2K, image verrouillée10 x 4 s x 0,10 $ = 4,00 $2,24 $0,17 $6,41 $ (18 % de moins)
Ébauches 768P, finales 768P, suréchantillonnées4,00 $2 x (0,80 $ + 0,192 $) = 1,98 $0,17 $6,15 $ (22 % de moins)

Lisez honnêtement la ligne du milieu. L'économie par seconde est de 29 %, mais l'économie par lot est de 18 %, car vos finales restent des finales. L'économie ne se rapproche de 29 % que lorsque l'ébauche domine : à vingt rouleaux d'ébauche de 8 secondes au lieu de dix courts, la deuxième voie atterrit environ 25 % en dessous du tout 2K. Et chaque centime de cela dépend de l'image verrouillée, car sans elle, ces dix rouleaux bon marché sont dix films que vous n'allez pas livrer.

Le deuxième dividende est le temps, et il pourrait compter davantage. Sur la paire texte-vers-vidéo, le 768P est revenu 28 % plus vite, et sur les deux paires, il n'a jamais pris plus de temps. Sur des clips de 4 secondes à ces temps réels, cela représente environ 27 rouleaux d'ébauche par heure au lieu de 20. Lorsque vous cherchez encore la bonne instruction, sept tentatives supplémentaires comptent plus que les 1,60 $ que vous avez économisés.

Une note juridique si vous prévoyez d'éviter tout cela en auto-hébergeant. Les poids ouverts sur Hugging Face sont H3-Base, qui génère sur le petit côté 768. La passe 2K vit du côté de l'API, donc les poids ouverts vous donnent le niveau d'ébauche et non le niveau de finition. La licence communautaire comporte également des territoires exclus couvrant l'UE, le Royaume-Uni, la Corée et les États-Unis, avec un canal d'autorisation séparé ouvert, alors lisez la licence avant de construire un pipeline commercial sur un checkout local. Pour un aperçu plus large de ce que les poids publiés incluent et n'incluent pas, consultez notre test MiniMax H3, et le catalogue complet de modèles si vous voulez comparer le prix de H3 au reste du domaine vidéo actuel.

Questions fréquemment posées

Dans MiniMax H3 2K vs 768P, le 768P est-il réellement moins cher par clip ?

Oui. On m'a facturé 0,40 $ pour un clip 768P de 4 secondes et 0,56 $ pour la demande identique en 2K, soit 0,10 $/s contre 0,14 $/s, une économie de 29 % par seconde. Le piège, c'est que l'économie ne compte que si l'exécution bon marché vous apprend quelque chose sur la coûteuse, ce qui nécessite de verrouiller la première image. Une ébauche texte-vers-vidéo nue en 768P est un film séparé, et l'argent dépensé pour elle n'est pas de l'argent économisé.

Dans MiniMax H3 2K vs 768P, le 2K est-il simplement un suréchantillonnage de la sortie 768P ?

Non. MiniMax fait régénérer au modèle de base sa propre sortie basse résolution en contexte plutôt que d'exécuter un module de super-résolution dédié, ce qui explique pourquoi le 2K peut restaurer les petits textes et les détails de surface fins qu'un suréchantillonneur ne peut qu'approximer. Mon recadrage d'étiquette en trois panneaux montre exactement cela : le clip 768P suréchantillonné a affiné le grain du papier mais a laissé la petite ligne d'ingrédients comme un bruit illisible, tandis que l'exécution 2K native l'a transformée en mots.

Mon ébauche MiniMax H3 768P ressemblera-t-elle à ma finale 2K ?

Seulement si vous verrouillez la première image. Sur du texte-vers-vidéo nu, les deux niveaux m'ont donné un décor différent, une hauteur de caméra différente, une condensation différente et une position d'étiquette différente à partir de la même instruction. Sur image-vers-vidéo avec une première image fixe, la composition, le cadrage et la typographie ont tous tenu entre les niveaux et les seuls changements concernaient les détails et la texture.

Dois-je encore contacter le service commercial pour le MiniMax H3 768P ?

Non, pas au 2026-08-05. Le schéma en direct sur les trois endpoints H3 liste resolution comme enum: ["768P", "2K"], l'interface de jeu montre les deux dans un seul menu déroulant, et mes travaux 768P se sont terminés et ont été facturés au tarif inférieur sur deux endpoints différents. La ligne de bêta fermée provient de la couverture rédigée dans les premiers jours après le lancement.

Dans MiniMax H3 2K vs 768P, à quel point le 2K est-il plus lent ?

Sur mes paires de 4 secondes, 1,2x à 1,4x plus lent : 181 s contre 130 s sur texte-vers-vidéo et 234 s contre 194 s sur image-vers-vidéo, mesuré de la soumission à la fin. Architecturalement, le 2K est une deuxième passe de génération sur le même contexte, donc attendez-vous à ce que l'écart absolu s'élargisse sur des clips plus longs plutôt que de rester plat.

Puis-je mettre à niveau un clip 768P vers 2K sans le relancer ?

Vous pouvez augmenter la résolution sans toucher à la prise en l'exécutant via un suréchantillonneur vidéo, ce qui m'a coûté 0,12 $ pour un clip de 4,46 secondes au niveau 2K (0,024 $/s avec un minimum de 5 secondes) et est revenu en 40 secondes. Cela préserve la performance image par image. Ce qu'il ne fera pas, c'est récupérer des détails qui n'ont jamais été capturés, donc si l'intérêt de passer en 2K est d'avoir des petits caractères lisibles, vous avez besoin de la passe de régénération, pas du suréchantillonneur.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles