DEUX SEMAINES SEULEMENT | 20 % DE RÉDUCTION sur Seedream 5.0 Pro !

Poids open source de MiniMax H3 : vous n’avez pas besoin d’un supercalculateur. Peut-être d’un avocat.

Les poids open source de MiniMax H3 sont disponibles : 33 Md de paramètres, un téléchargement minimal de 42,5 Go, deux checkpoints et une licence dont la clause territoriale exclut les États-Unis, l’UE, le Royaume-Uni et la Corée.

Base UTM pour tous les liens Atlas Cloud : ?utm_source=blog&utm_medium=article&utm_campaign=minimax-h3-open-source-weights


Poids open source de MiniMax H3 : vous n’avez pas besoin d’un supercalculateur. Peut-être d’un avocat.

Ordinateur portable et PC de bureau lumineux sur un bureau en bois

Un bureau à 3 h du matin avec un boîtier de PC ouvert, un disque externe et un écran affichant un gros téléchargement en cours

Les poids sont sortis. Je vais donc répondre aux deux questions qui ont suscité le plus de réponses sous le post de lancement de MiniMax, avant toute chose.

Non, vous n’avez pas besoin d’un supercalculateur. Choisissez les bons fichiers et le téléchargement pèse 42,5 Go, pas 123,6 Go. Le modèle compte 33 Md de paramètres, dont environ 13 Md se trouvent dans des branches de modulation AdaLN que l’inférence n’a même pas besoin de charger.

Puis j’ai ouvert le fichier LICENSE. Ligne 10, avant même d’arriver à la clause des 20 M$ de revenus, il y a une liste de pays. Le mien y figure. Probablement le vôtre aussi.

Points clés à retenir

  • Les poids open source de MiniMax H3 sont disponibles sur Hugging Face sous MiniMaxAI/MiniMax-H3, ainsi qu’un miroir reconditionné pour ComfyUI sous Comfy-Org/MiniMax-H3. ComfyUI a livré une prise en charge native le jour même.
  • Ce n’est pas un seul fichier. Il y a deux checkpoints spécifiques à des tâches, fl2va (piloté par texte et image) et ref2va (piloté par référence), 21 Go chacun dans leur forme la plus légère. Vous ne téléchargez que celui dont votre tâche a besoin.
  • Transformer dense à flux unique de 33 Md de paramètres. La plus petite combinaison fonctionnelle fait 42,5 Go, soit 66 % de moins que les 123,6 Go en pleine précision. ComfyUI indique qu’une carte de 12 Go avec offloading peut le faire tourner.
  • La génération locale est nativement en 768px sur le petit côté, pas en 2K. Le 2K provient d’un second passage de régénération in-context.
  • L’utilisation commerciale est gratuite, mais vous devez afficher "MiniMax H3" dans votre interface, et au-delà de 20 M$ de revenus annuels, il faut une autorisation écrite distincte. Et le Territoire applicable de la licence exclut l’UE, le Royaume-Uni, la Corée du Sud et les États-Unis. Une API hébergée relève d’une relation juridique différente.

Un personnage, les deux checkpoints, une seule nuit à 3 h du matin. À gauche, ce que fait fl2va. À droite, ce que fait ref2va. Même personne, même pièce, même nuit, deux tâches totalement différentes, et le sifflement de ventilateur que vous entendez est généré dans le même passage que l’image.

4. Affinage du brouillon 9 :

Gauche : image-to-video, la tâche du checkpoint fl2va. Droite : reference-to-video, la tâche de ref2va. Les deux rendus sur MiniMax H3 avec audio stéréo natif. Activez le son.

La première chose que j’ai demandé à ce modèle de générer était un être humain attendant que ce modèle finisse de se télécharger. Cela semblait juste.

Poids open source de MiniMax H3, pesés : deux checkpoints et un plancher à 42,5 Go

Voici pourquoi cette sortie a fait du bruit. Artificial Analysis a placé H3 n° 1 en Video Editing et dans le top trois à la fois en text-to-video et en image-to-video, et a déclaré que publier les poids "would make it the leading open weights model by far" (Artificial Analysis, juillet 2026). C’est un modèle vidéo de niveau frontier avec un bouton de téléchargement.

L’autre moitié, plus honnête : sur le même benchmark, H3 reste derrière Gemini Omni Flash de Google en text-to-video, et derrière Seedance 2.0 comme Gemini Omni Flash en image-to-video (South China Morning Post, juillet 2026). Il est n° 1 en édition, pas n° 1 partout.

Maintenant, la partie que presque personne n’a vérifiée avant de lancer git clone.

Le nombre de paramètres que personne n’a mis en titre. La model card décrit H3-Omni-Transformer comme "a 33B-parameter dense, single-stream Transformer, with approximately 13B parameters residing in AdaLN-related branches," et ajoute que, comme ces sorties de modulation peuvent être pré-calculées et mises en cache, "these parameters do not need to be loaded for inference-only deployment." C’est de là que viennent les checkpoints élagués. Environ 40 % du modèle devient une table de correspondance quand vous ne faites que de l’inférence.

Là où la plupart des gens brûlent 80 Go pour rien. Le dépôt officiel MiniMaxAI/MiniMax-H3 pèse 498 Go si vous récupérez tout. Le miroir ComfyUI fait 343 Go. Les deux contiennent toutes les variantes de précision des deux checkpoints. Vous avez besoin de quatre fichiers, pas de quatre cents.

FichierTailleCe que c’estVous en avez besoin pour
minimax_h3_fl2va_pruned_int8_convrot.safetensors20,97 Gocheckpoint fl2va, élagué + int8Text-to-video, image-to-video
minimax_h3_fl2va_int8_convrot.safetensors34,04 Gofl2va, int8, non élaguéMême chose, meilleure fidélité
minimax_h3_fl2va_bf16.safetensors66,28 Gofl2va, pleine précisionFine-tuning, recherche
minimax_h3_ref2va_pruned_int8_convrot.safetensors20,97 Gocheckpoint ref2va, élagué + int8Reference-to-video uniquement
minimax_h3_ref2va_int8_convrot.safetensors34,04 Goref2va, int8, non élaguéMême chose, meilleure fidélité
minimax_h3_ref2va_bf16.safetensors66,28 Goref2va, pleine précisionFine-tuning, recherche
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15,69 GoEncodeur texte, AWQ 4 bitsChaque workflow
qwen3vl_32b_minimax_h3_int8_convrot.safetensors27,14 GoEncodeur texte, int8Chaque workflow
qwen3vl_32b_minimax_h3_bf16.safetensors51,51 GoEncodeur texte, pleine précisionChaque workflow
minimax_h3_video_vae_fp16.safetensors5,21 GoVAE vidéoChaque workflow
minimax_h3_audio_vae_fp32.safetensors0,61 GoVAE audioChaque workflow (c’est le son)
Plus petit ensemble fonctionnel, une tâche42,5 Gofl2va élagué + encodeur nvfp4 + deux VAELe téléchargement réaliste
Deux checkpoints, configuration minimale63,4 Goajouter ref2va élaguéSi vous voulez les trois modes
Une tâche en bf16 complet123,6 Gotout en bf16Configurations de recherche seules

Tailles de fichiers lues directement dans l’index du dépôt Comfy-Org/MiniMax-H3, août 2026.

La façon dont ComfyUI présente le même chiffre : "total memory footprint reduced by 66%, from 123.6 GB in full precision to 42.5 GB," ce qui "enables a next-generation 2K video model to run locally on a GPU like the RTX 3060" (ComfyUI, août 2026). Prenez le chiffre des 12 Go comme leur affirmation avec offloading dynamique, pas comme un benchmark. Je ne l’ai pas fait tourner sur une 3060, et l’offloading achète de la VRAM avec de la RAM système et du temps d’horloge.

Une chose que "le faire tourner localement" implique discrètement : 768px. Le canevas natif de H3 est un petit côté de 768px, plafonné à 768x1344, selon le tutoriel H3 de ComfyUI. La durée se cale sur une grille de blocs de 17 images à 24 fps. Les clips 2K du marketing proviennent de H3-Regenerate-2K, un second passage qui réinjecte le résultat 768p plus le contexte d’origine dans le modèle. La model card précise explicitement que le système complet comporte trois modules : H3-Context-IR, H3-Base et H3-Regenerate-2K. En local, ComfyUI vous donne H3-Base.

Et le mot "open" fait trois choses différentes ici. Téléchargeable, oui. Utilisable commercialement, sous conditions. Exécutable là où vous vivez, cela dépend de l’endroit où vous vivez. Le fil Reddit qui qualifie cela d’"actually a closed source model" se trompe sur le premier point et pointe quelque chose de réel sur les deux autres. La section 7 contient le texte de la clause.

Poids open source MiniMax H3 locaux vs API hébergée : choisissez votre voie

Tout ce qui suit, toute la démo en quatre étapes, tourne dans un seul onglet de navigateur sur Atlas Cloud, qui sert les trois endpoints H3 ainsi que le modèle image que j’ai utilisé pour l’image de base. Ce n’est pas la même chose que faire tourner les poids, et la différence compte plus que d’habitude avec ce modèle.

Poids locauxAPI hébergée
Coût initialTéléchargement de 42,5 Go, GPU 12 Go+, installation ComfyUIUne clé API
Temps jusqu’au premier clipUne soirée, avec optimismeEnviron deux minutes
Coût par clip de 5 sTemps GPU et électricité0,70 $ à 0,14 $/s
Résolution nativePetit côté 768px, 2K via un passage de régénération2K direct, c’est la seule valeur enum
Fine-tune, LoRA, chirurgieOui, c’est tout l’intérêtNon
Les données ne quittent jamais votre réseauOuiNon
Exposition à la licenceVous acceptez la Community License et sa clause territorialeVous êtes client d’un service hébergé
Si vous êtes dans l’UE, au Royaume-Uni, en Corée ou aux États-UnisSection 7Non affecté par la licence des poids

Règle empirique : sous environ 100 clips par mois, ou si vous avez besoin de 2K directement, ou si vous vous trouvez dans un Territoire exclu, l’hébergé gagne sur tous les axes. Au-delà, ou si vous comptez entraîner par-dessus le checkpoint, ou si les images ne peuvent pas quitter votre bâtiment, les 42,5 Go valent la soirée.

Prix vérifiés sur les pages de modèles en direct, août 2026. Tous les endpoints H3 facturent à la seconde de sortie, sans remise active.

ModèleCe qu’il fait iciPrixRemise
MiniMax H3 image-to-videoÉtape 2, la tâche fl2va0,14 $ / s en 2KAucune
MiniMax H3 reference-to-videoÉtape 3, la tâche ref2va0,14 $ / s en 2KAucune
MiniMax H3 text-to-videoÉtape 4, la base sans référence0,14 $ / s en 2KAucune
GPT Image 2 text-to-imageÉtape 1, l’image de base0,009 $ / image indiqué ; l’exécution 16:9 haute qualité utilisée annonce 0,1745 $Aucune
Seedance 2.0 / Wan 2.7 / Kling v3.0 TurboPoints de comparaison à la seconde0,112 $ / 0,10 $ / 0,095 $ par sKling -15 %

Une incohérence à connaître avant d’écrire du code dessus : le readme H3 documente encore un niveau 768p à 0,10 $/s et une durée de 5 ou 10 secondes. Le schéma en direct dit autre chose. resolution n’a exactement qu’une valeur autorisée, 2K, et duration accepte n’importe quel entier de 5 à 15. Codez contre le schéma. Il y a une symétrie intéressante dans cet écart : le niveau 768p est désactivé côté hébergé, et 768p est précisément le canevas natif obtenu quand vous exécutez les poids vous-même.

Étape 1 : générer l’image de base avec GPT Image 2

Toute cette démo part d’une seule image fixe. La scène est volontairement très littérale : un développeur à 3 h du matin qui regarde le téléchargement d’un checkpoint de 21 Go.

Modèle : openai/gpt-image-2/text-to-image. Paramètres : qualité high, ratio 16:9.

text
1A photorealistic wide shot of a cluttered home office at 3 a.m., lit only by two monitors and the RGB glow from an open PC case on the desk. A tired developer in a gray hoodie sits slouched in a mesh chair, chin on hand, staring at the left monitor. The left monitor shows a dark terminal with a single visible download progress bar at about 78 percent. The right monitor shows a file browser. A cold half-full mug of coffee, a mechanical keyboard, and a small desk fan sit on the desk. Rain streaks the window behind him. Shallow depth of field, 35mm, warm monitor key light against cool blue window light, visible sensor grain. No text overlays, no watermarks.
2

Ne demandez pas au modèle image de rendre les vrais noms de fichiers safetensors. Les longues chaînes avec underscores reviennent en bouillie. Gardez les noms de fichiers dans vos légendes.

Capture d’écran d’une interface de générateur d’images IA avec entrée et sortie

Playground GPT Image 2 sur Atlas Cloud avec le prompt de 3 h du matin saisi et l’image de base terminée dans le panneau de sortie

GPT Image 2 sur Atlas Cloud : qualité high, 16:9, image de base rendue à droite. Le niveau haute qualité annonce 0,1745 $ pour cette exécution, bien au-dessus du plancher catalogue à 0,009 $, donc budgétez par niveau.

Homme en sweat à capuche regardant une barre de chargement sur deux écrans d’ordinateur

L’image de base générée : un développeur fatigué à 3 h du matin regardant une barre de téléchargement sur l’écran de gauche

La sortie de l’Étape 1. Cette image unique alimente les Étapes 2 et 3.

Étape 2 : image to video, la tâche du checkpoint fl2va

C’est l’endpoint qui correspond à minimax_h3_fl2va_pruned_int8_convrot.safetensors. Une première image en entrée, mouvement et son en sortie. En local, c’est le fichier que vous chargeriez ; en hébergé, c’est un appel API.

Modèle : minimax/h3/image-to-video. Paramètres : image = l’image de l’Étape 1 transmise comme data URL, resolution: 2K, duration: 5, ratio: 16:9.

text
1The developer stays still, only breathing and blinking, eyes fixed on the left monitor. The progress bar on the left monitor creeps forward. The case fans spool up and their RGB glow pulses brighter. A moment before the end he exhales and his shoulders drop. Locked-off camera, no camera movement, no zoom, no cuts. Audio: a low case-fan whine that rises in pitch, faint rain against the window, one soft two-note completion chime near the end.
2

Passez l’image sous forme de data URL base64 plutôt que via une URL de stockage fraîchement générée. Une toute nouvelle URL d’objet peut échouer au contrôle de téléchargement upstream. Notez aussi que H3 obéit réellement à "locked-off camera", ce qui n’est pas universellement vrai pour les modèles vidéo de cette catégorie.

Capture d’écran de l’interface du générateur MiniMax image-to-video

Playground MiniMax H3 image-to-video sur Atlas Cloud avec l’image de base chargée et un clip 2K terminé dans le panneau de sortie

MiniMax H3 image-to-video : image de base chargée, 2K, exécution terminée. Cette capture a utilisé la valeur par défaut de l’endpoint, 8 secondes, d’où le devis à 1,12 $. Mon clip intégré ci-dessous est la version 5 secondes à 0,70 $.

Homme stressé à un bureau attendant une barre de progression informatique

La tâche fl2va : une image en entrée, cinq secondes de mouvement plus un sifflement de ventilateur stéréo en sortie.

Étape 3 : reference to video, la tâche du checkpoint ref2va

Checkpoint différent, fichier différent, tâche différente. ref2va ne prolonge pas une première image. Il prend du matériel de référence et construit un nouveau plan qui conserve l’identité et les objets de manière cohérente. C’est pourquoi le dépôt livre deux fichiers de 21 Go au lieu d’un.

Je lui ai donné deux références : l’image de l’Étape 1 pour la personne et la pièce, et un plan macro d’une carte graphique pour le matériel.

Modèle : minimax/h3/reference-to-video. Paramètres : refers = les deux images, resolution: 2K, duration: 8, ratio: 16:9.

text
1Same man, same gray hoodie, same face, in the same dark home office. New shot: a medium close-up from the side as he leans back in the chair and lets out a long breath, the corner of his mouth lifting slightly. The graphics card in the second reference image is visible over his shoulder, its fans slowing down, RGB settling to a steady color. Keep his identity, hoodie, hair and the room's lighting consistent with the reference images. Locked-off camera. Audio: fan whine winding down, one keyboard keypress, rain continuing.
2

refers accepte un tableau mixte d’images, de vidéos et d’audio, avec au moins une image ou une vidéo. L’audio seul est rejeté. Cet endpoint accepte également des durées allant jusqu’à 15 secondes.

Un piège propre à cet endpoint : définissez ratio explicitement. En le laissant sur adaptive, j’ai obtenu 400 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive', quatre fois de suite, y compris depuis le playground avec les deux références clairement attachées. Avec ratio: "16:9" dans l’appel API, c’est passé du premier coup. C’est aussi pourquoi la capture ci-dessous montre l’image de référence plutôt qu’une capture du playground : je n’ai pas réussi à sortir le contrôle Aspect Ratio du playground de adaptive, donc le clip que vous voyez ici vient de l’API avec les paramètres ci-dessus, pas d’une exécution dans le playground.

Carte graphique montée verticalement avec trois ventilateurs dans un boîtier de PC

La deuxième image de référence : un plan macro d’une carte graphique à trois ventilateurs dans un boîtier de PC ouvert, de nuit

Image de référence 2, générée dans le même lot que l’image de base, transmise avec l’image de l’Étape 1.

Homme en sweat à capuche travaillant sur deux écrans d’ordinateur la nuit

La tâche ref2va : une nouvelle prise plutôt qu’une continuation. Même homme, même sweat à capuche, même pièce, et la carte graphique de la référence 2 désormais dans le cadre, avec ses ventilateurs qui ralentissent. Notez qu’il a interprété "medium close-up" assez librement et est resté plutôt large.

Étape 4 : text to video, la base des poids open source MiniMax H3

Même scène, décrite avec des mots, sans aucune référence. Cette étape existe pour vous montrer à quoi servent réellement les deux checkpoints.

Modèle : minimax/h3/text-to-video. Paramètres : ratio est obligatoire ici et ne peut pas être adaptive, donc 16:9. resolution: 2K, duration: 5.

text
1A tired developer in a gray hoodie at 3 a.m. in a cluttered home office, lit by two monitors and the RGB glow of an open PC case, watching a download progress bar crawl across the left screen. Rain on the window behind him. Locked-off 35mm shot, shallow depth of field, warm monitor light against cool window light, film grain. Audio: rising case-fan whine, faint rain, a soft completion chime at the end.
2

Interface IA MiniMax text to video montrant un prompt et une vidéo générée

Playground MiniMax H3 text-to-video sur Atlas Cloud avec le prompt saisi et un clip terminé dans le panneau de sortie

MiniMax H3 text-to-video : aucun matériel de référence, 2K, Aspect Ratio réglé sur 16:9 parce que adaptive est rejeté ici, exécution terminée. Même prompt, et déjà un visage différent de celui de l’Étape 2.

Homme en sweat à capuche gris fixant un écran d’ordinateur lumineux

Mêmes mots, humain différent. Belle pièce, mauvais gars. Cet écart est tout l’argument en faveur de l’existence de fl2va et ref2va comme checkpoints séparés.

Une note opérationnelle si vous scriptiez les trois : la concurrence upstream est d’environ une tâche. Les jobs qui se chevauchent reviennent avec 429 rate limit exceeded (task concurrency). Exécutez-les en série. Un clip 2K de 5 secondes a pris environ deux minutes à chaque fois.

Ce que coûtent les poids open source de MiniMax H3, et ce que dit réellement la licence

La question du coût a deux monnaies. En hébergé, un clip 2K de 5 secondes coûte 0,70 $ et un clip de 15 secondes 2,10 $, à la seconde, sans paliers, sans remise. En local, la monnaie, ce sont les gigaoctets et les heures : 42,5 Go à télécharger, une carte capable de les tenir, et un canevas 768p à moins d’exécuter aussi le passage de régénération. Quelque part au-delà de quelques centaines de clips par mois, le calcul bascule. En dessous, généralement non.

Puis il y a une troisième monnaie : le temps de revue juridique. J’ai lu tout le fichier LICENSE. Voici ce qu’il contient.

Ordinateur portable et pile de papiers éclairés par une lampe de bureau

Une lampe de bureau éclaire un ordinateur portable affichant un document texte dense, à côté d’une impression surlignée, de lunettes de lecture et d’un verre d’eau

La partie d’une sortie open weights que personne ne capture pour le fil de lancement.

ClauseSectionCe qu’elle ditCe que cela signifie pour vous
Applicable TerritoryI.3, I.5Mondial, "excluding the Excluded Territories," définis comme "the European Union, the United Kingdom, the Republic of Korea and the United States of America"La licence communautaire ne vous accorde pas de droits là où vivent la plupart des lecteurs de cet article
Interdiction d’usage territorialV.4Vous ne pouvez pas "use, reproduce, modify, distribute, or display the MiniMax H3 Works or any of their Outputs or results outside the Applicable Territory"Cela couvre les Outputs, pas seulement les poids
Canal de licence distinctIIMiniMax "continuously evaluate the applicable laws" et invite les parties des régions exclues à les contacter pour une licenceC’est "pas encore", pas "jamais". Le dépôt fournit un formulaire de demande
AttributionIV.2Vous "shall prominently display 'MiniMax H3' on the user interface" de tout produit commercial qui l’utiliseUn changement d’interface, pas une note de bas de page
Seuil de revenusIV.1Au-delà de 20 millions de dollars de revenus annuels, vous avez besoin d’une autorisation écrite préalable de [email protected]L’usage commercial gratuit a un plafond
Pas de blanchiment de modèleV.3Vous ne pouvez pas utiliser H3 ou ses Outputs "to improve any other artificial intelligence model"Exclut la distillation dans votre propre modèle
RedistributionIII.1, III.4Expédier l’accord avec, inclure un fichier NOTICE, marquer les fichiers modifiésStandard, mais cela lie aussi les utilisateurs en aval
Encodeur texteAdditional NoteL’encodeur est Qwen3-VL-32B sous Apache 2.0Un composant de la pile est réellement ouvert au sens OSI
Droit applicableIXDroit de la RAS de Hong Kong, juridiction exclusive de Hong KongMérite une ligne dans votre registre des risques

La date d’entrée en vigueur de l’accord est le 2 août 2026 (Hugging Face, août 2026).

La plupart des couvertures du lancement ont mis "open weights" en avant et se sont arrêtées là. À la décharge de MiniMax, ils ne l’ont pas caché : le dépôt contient son propre docs/QA-about-License.md, qui explique que les modèles vidéo font face à un paysage réglementaire plus mouvant que les modèles texte, cite l’EU AI Act, les règles britanniques et coréennes, ainsi que les litiges américains en cours sur le copyright dans la vidéo générative, et affirme clairement que "the current limitation means 'not yet', not 'not ever'." Le même document confirme la séparation qui compte en pratique : l’API reste disponible mondialement parce que MiniMax contrôle l’infrastructure de service, tandis que les poids ouverts sortent de ce contrôle.

Donc si vous êtes à San Francisco, Berlin, Londres ou Séoul, la lecture pratique n’est pas "vous ne pouvez jamais toucher H3". C’est "cette licence particulière n’est pas l’instrument qui vous permet d’exécuter ces poids sur votre propre machine". Demandez la licence distincte, ou utilisez un endpoint hébergé, où vous êtes client d’un service plutôt que licencié des poids.

Je ne suis pas avocat et ceci n’est pas un conseil juridique. Le texte des clauses ci-dessus est cité afin que votre vrai conseil juridique puisse aller lire l’original en une dizaine de minutes.

Poids open source de MiniMax H3 : foire aux questions

Les poids open source de MiniMax H3 sont-ils vraiment disponibles, et où les télécharger ?

Oui, depuis le début août 2026. Deux endroits. MiniMaxAI/MiniMax-H3 est le dépôt officiel, environ 498 Go, contenant le pipeline au format diffusers, les deux transformers, l’encodeur texte, les deux VAE, la documentation et les scripts reproductibles. Comfy-Org/MiniMax-H3 est la version reconditionnée pour ComfyUI, environ 343 Go au total, avec les checkpoints quantifiés en fichier unique que la plupart des gens veulent réellement. Si vous utilisez ComfyUI, utilisez le second et téléchargez quatre fichiers.

Combien de paramètres MiniMax H3 a-t-il, et ai-je besoin d’un supercalculateur ?

33 Md, dans un Transformer dense à flux unique. Environ 13 Md se trouvent dans des branches liées à AdaLN dont les sorties peuvent être pré-calculées et mises en cache, si bien que les déploiements en inférence seule n’ont pas besoin de les charger. C’est ce que sont les checkpoints "pruned". Pas de supercalculateur. Un téléchargement de 42,5 Go et un GPU grand public sérieux.

Puis-je exécuter les poids open source de MiniMax H3 avec 12 Go ou 16 Go de VRAM ?

L’équipe ComfyUI indique qu’une carte de 12 Go peut le faire avec offloading dynamique, en utilisant le checkpoint fl2va élagué int8 plus l’encodeur texte nvfp4 AWQ. C’est leur affirmation, pas un benchmark que j’ai exécuté. Deux réserves : l’offloading échange de la VRAM contre de la RAM système, donc prévoyez 64 Go de RAM et des temps de rendu longs, et votre canevas local a un petit côté de 768px, pas du 2K.

Les poids open source de MiniMax H3 sont-ils vraiment open source, ou seulement open weights ?

Open weights, précisément. Les poids sont téléchargeables et modifiables, ce qui est plus que ce que proposait n’importe quel modèle vidéo frontier il y a un an. Mais la licence n’est pas approuvée par l’OSI, la recette d’entraînement et les données ne sont pas publiées, l’usage commercial comporte des conditions d’attribution et de revenus, et la clause territoriale restreint l’endroit où la concession s’applique. Le seul composant réellement ouvert est l’encodeur Qwen3-VL-32B sous Apache 2.0. Trois couches distinctes, et "open" ne décrit proprement que la première.

Puis-je utiliser les poids open source de MiniMax H3 commercialement, et que signifie la ligne des 20 M$ ?

Oui, avec deux conditions. Vous devez afficher "MiniMax H3" de manière bien visible sur l’interface utilisateur du produit commercial (Section IV.2). Et si vos produits et services commerciaux génèrent plus de 20 millions de dollars de revenus annuels, vous devez obtenir une autorisation écrite préalable distincte de MiniMax avant de l’utiliser, demandée à [email protected] (Section IV.1). Le seuil porte sur vos revenus, pas sur votre utilisation de H3.

Pourquoi la licence MiniMax H3 exclut-elle les États-Unis et l’UE, et quelles sont mes options ?

Selon la FAQ de licence de MiniMax, parce que la génération vidéo se trouve dans un environnement réglementaire plus mouvant que le texte, notamment l’EU AI Act, les règles britanniques et sud-coréennes en évolution, et les litiges américains actifs sur le copyright dans la vidéo générative. Une fois les poids publics, ils ne peuvent pas faire appliquer les garde-fous en aval, ils ont donc limité la portée de la concession au lieu de retarder la sortie. Options dans une région exclue : demander une licence distincte via le formulaire du dépôt, ou utiliser une API hébergée, qui relève d’une relation juridique différente et reste disponible mondialement. Faites confirmer par votre conseil juridique laquelle convient avant de déployer.


Vérifié le 3 août 2026. Trois points sur la liste de suivi : les GGUF communautaires et quantifications à plus faible nombre de bits (aucun n’existe encore pour H3), tout changement de la liste des Territoires exclus, et si le niveau 768p hébergé que le readme documente encore revient un jour.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles