
Un bureau à 3h du matin avec un boîtier PC ouvert, un disque externe et un écran affichant un téléchargement volumineux en cours.
Les poids sont sortis. Permettez-moi donc de répondre aux deux questions qui ont reçu le plus de réponses sous le post de lancement de MiniMax, avant toute autre chose.
Non, vous n'avez pas besoin d'un supercalculateur. Choisissez les bons fichiers et le téléchargement fait 42,5 Go, pas 123,6 Go. Le modèle a 33 milliards de paramètres, et environ 13 milliards d'entre eux se trouvent dans les branches de modulation AdaLN que l'inférence n'a même pas besoin de charger.
Ensuite, j'ai ouvert le fichier LICENSE. Ligne 10, avant même d'arriver à la clause sur les 20 millions de dollars de revenus, il y a une liste de pays. Mon pays y figure. Probablement le vôtre aussi.
Points clés
- Les poids open source de MiniMax H3 sont disponibles sur Hugging Face sous
MiniMaxAI/MiniMax-H3, ainsi qu'un miroir repackagé pour ComfyUI àComfy-Org/MiniMax-H3. ComfyUI a déployé la prise en charge native le jour même. - Ce n'est pas un seul fichier. Il y a deux points de contrôle spécifiques à chaque tâche,
fl2va(guidé par texte et image) etref2va(guidé par référence), 21 Go chacun dans leur forme la plus petite. Vous ne téléchargez que celui dont votre travail a besoin. - Transformateur dense à flux unique de 33B. La combinaison de travail la plus petite est 42,5 Go, soit 66 % de moins que 123,6 Go en pleine précision. ComfyUI indique qu'une carte de 12 Go avec déchargement peut le faire fonctionner.
- La génération locale est nativement en 768px sur le petit côté, pas en 2K. Le 2K provient d'une seconde passe de régénération dans le contexte.
- L'utilisation commerciale est gratuite mais vous devez afficher « MiniMax H3 » dans votre interface utilisateur, et au-delà de 20 millions de dollars de revenus annuels, vous avez besoin d'une autorisation écrite séparée. Et le Territoire Applicable de la licence exclut l'UE, le Royaume-Uni, la Corée du Sud et les États-Unis. Une API hébergée est une relation juridique différente.
Un personnage, les deux points de contrôle, un 3h du matin. Le côté gauche montre ce que fait fl2va. Le côté droit montre ce que fait ref2va. Même personne, même pièce, même nuit, deux travaux complètement différents, et le bruit du ventilateur que vous entendez est généré dans la même passe que l'image.

Gauche : image vers vidéo, le travail effectué par le point de contrôle fl2va. Droite : référence vers vidéo, le travail effectué par ref2va. Les deux rendus sur MiniMax H3 avec audio stéréo natif. Activez le son.
La première chose que j'ai demandé à ce modèle de générer était un être humain attendant que ce modèle finisse de télécharger. Cela semblait approprié.
MiniMax H3 Open Source Weights, Pesés : Deux Points de Contrôle et un Plancher à 42,5 Go
Voici pourquoi cette version a fait du bruit. Artificial Analysis a classé H3 #1 en Édition Vidéo et dans le top trois à la fois en texte-vers-vidéo et image-vers-vidéo, et a déclaré que la sortie des poids « ferait de lui de loin le modèle à poids ouverts dominant » (Artificial Analysis, juillet 2026). C'est un modèle vidéo de niveau frontière avec un bouton de téléchargement.
L'autre moitié honnête : la même série de benchmarks place H3 derrière Google Gemini Omni Flash en texte-vers-vidéo, et derrière à la fois Seedance 2.0 et Gemini Omni Flash en image-vers-vidéo (South China Morning Post, juillet 2026). Il est #1 en édition, pas #1 partout.
Maintenant, la partie que presque personne n'a vérifiée avant de lancer git clone.
Le nombre de paramètres que personne n'a mis dans un titre. La fiche du modèle décrit H3-Omni-Transformer comme « un transformateur dense à flux unique de 33 milliards de paramètres, avec environ 13 milliards de paramètres résidant dans les branches liées à AdaLN », et ajoute que comme ces sorties de modulation peuvent être précalculées et mises en cache, « ces paramètres n'ont pas besoin d'être chargés pour un déploiement dédié à l'inférence ». C'est de là que viennent les points de contrôle élagués. Environ 40 % du modèle se transforme en une table de correspondance lorsque vous ne faites que de l'inférence.
Là où la plupart des gens brûlent 80 Go pour rien. Le dépôt officiel MiniMaxAI/MiniMax-H3 fait 498 Go si vous téléchargez tout. Le miroir ComfyUI fait 343 Go. Les deux contiennent chaque variante de précision des deux points de contrôle. Vous avez besoin de quatre fichiers, pas de quatre cents.
| Fichier | Taille | Ce que c'est | Vous en avez besoin pour |
|---|---|---|---|
| minimax_h3_fl2va_pruned_int8_convrot.safetensors | 20,97 Go | point de contrôle fl2va, élagué + int8 | Texte-vers-vidéo, image-vers-vidéo |
| minimax_h3_fl2va_int8_convrot.safetensors | 34,04 Go | fl2va, int8, non élagué | Idem, meilleure fidélité |
| minimax_h3_fl2va_bf16.safetensors | 66,28 Go | fl2va, pleine précision | Fine-tuning, recherche |
| minimax_h3_ref2va_pruned_int8_convrot.safetensors | 20,97 Go | point de contrôle ref2va, élagué + int8 | Référence-vers-vidéo uniquement |
| minimax_h3_ref2va_int8_convrot.safetensors | 34,04 Go | ref2va, int8, non élagué | Idem, meilleure fidélité |
| minimax_h3_ref2va_bf16.safetensors | 66,28 Go | ref2va, pleine précision | Fine-tuning, recherche |
| qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 15,69 Go | Codeur de texte, AWQ 4 bits | Chaque flux de travail |
| qwen3vl_32b_minimax_h3_int8_convrot.safetensors | 27,14 Go | Codeur de texte, int8 | Chaque flux de travail |
| qwen3vl_32b_minimax_h3_bf16.safetensors | 51,51 Go | Codeur de texte, pleine précision | Chaque flux de travail |
| minimax_h3_video_vae_fp16.safetensors | 5,21 Go | VAE vidéo | Chaque flux de travail |
| minimax_h3_audio_vae_fp32.safetensors | 0,61 Go | VAE audio | Chaque flux de travail (c'est le son) |
| Ensemble de travail le plus petit, une tâche | 42,5 Go | fl2va élagué + codeur nvfp4 + les deux VAE | Le téléchargement réaliste |
| Les deux points de contrôle, le plus petit | 63,4 Go | ajouter ref2va élagué | Si vous voulez les trois modes |
| Une tâche en bf16 complet | 123,6 Go | tout en bf16 | Stations de recherche uniquement |
Tailles de fichiers lues directement depuis l'index du dépôt Comfy-Org/MiniMax-H3, août 2026.
Le propre cadrage de ComfyUI du même nombre : « empreinte mémoire totale réduite de 66 %, passant de 123,6 Go en pleine précision à 42,5 Go », ce qui « permet à un modèle vidéo 2K de nouvelle génération de fonctionner localement sur un GPU comme le RTX 3060 » (ComfyUI, août 2026). Prenez le chiffre de 12 Go comme leur affirmation avec déchargement dynamique, pas comme un benchmark. Je ne l'ai pas fait tourner sur un 3060, et le déchargement achète de la VRAM avec de la RAM système et du temps réel.
Une chose que « faire tourner localement » signifie discrètement : 768px. Le canevas natif de H3 est un petit côté de 768px, plafonné à 768x1344, selon le tutoriel H3 de ComfyUI. La durée s'accroche à une grille de 17 images par bloc à 24 ips. Les clips 2K dans le marketing proviennent de H3-Regenerate-2K, une seconde passe qui renvoie le résultat 768p plus le contexte d'origine à travers le modèle. La fiche du modèle précise que le système complet comprend trois modules : H3-Context-IR, H3-Base et H3-Regenerate-2K. ComfyUI local vous donne H3-Base.
Et le mot « ouvert » fait trois emplois distincts ici. Téléchargeable, oui. Utilisable commercialement, sous conditions. Exécutable là où vous vivez, cela dépend de l'endroit où vous vivez. Le fil Reddit qualifiant cela de « modèle en réalité closed source » a tort sur le premier point et pointe vers quelque chose de réel sur les deux autres. La section 7 contient le texte de la clause.
MiniMax H3 Open Source Weights Local vs API Hébergée : Choisissez Votre Voie
Tout ce qui se trouve en dessous de cette ligne, l'ensemble de la démo en quatre étapes, fonctionne dans un seul onglet de navigateur sur Atlas Cloud, qui dessert les trois points de terminaison H3 ainsi que le modèle d'image que j'ai utilisé pour l'image de base. Ce n'est pas la même chose que d'exécuter les poids, et la différence compte plus que d'habitude avec ce modèle.
| Poids locaux | API hébergée | |
|---|---|---|
| Coût initial | Téléchargement de 42,5 Go, un GPU de 12 Go+, une installation ComfyUI | Une clé API |
| Délai avant le premier clip | Une soirée, optimistiquement | Environ deux minutes |
| Coût par clip de 5s | Temps GPU et électricité | 0,70 $ à 0,14 $/seconde |
| Résolution native | Petit côté 768px, 2K via une passe de régénération | 2K direct, c'est la seule valeur d'énumération |
| Fine-tuning, LoRA, modification | Oui, c'est tout l'intérêt | Non |
| Données ne quittant jamais votre réseau | Oui | Non |
| Exposition à la licence | Vous acceptez la Licence Communautaire et sa clause de territoire | Vous êtes client d'un service hébergé |
| Si vous êtes dans l'UE, RU, Corée ou US | Section 7 | Non affecté par la licence des poids |
Règle empirique : en dessous d'environ 100 clips par mois, ou si vous avez besoin du 2K directement, ou si vous résidez dans un Territoire Exclu, l'hébergé gagne sur tous les axes. Au-dessus, ou si vous avez l'intention de vous entraîner sur le point de contrôle, ou si les images ne peuvent pas quitter votre bâtiment, les 42,5 Go valent la soirée.
Prix vérifiés à partir des pages de modèles en direct, août 2026. Tous les points de terminaison H3 facturent par seconde de sortie, sans réduction active.
| Modèle | Ce qu'il fait ici | Prix | Réduction |
|---|---|---|---|
| MiniMax H3 image-to-video | Étape 2, le travail fl2va | 0,14 $/sec en 2K | Aucune |
| MiniMax H3 reference-to-video | Étape 3, le travail ref2va | 0,14 $/sec en 2K | Aucune |
| MiniMax H3 text-to-video | Étape 4, la référence sans image | 0,14 $/sec en 2K | Aucune |
| GPT Image 2 text-to-image | Étape 1, l'image de base | 0,009 $/image listé ; l'exécution haute qualité 16:9 que j'ai utilisée facture 0,1745 $ | Aucune |
| Seedance 2.0 / Wan 2.7 / Kling v3.0 Turbo | Points de référence par seconde | 0,112 $ / 0,10 $ / 0,095 $ par seconde | Kling 15% de réduction |
Une incohérence à connaître avant d'écrire du code : le README de H3 mentionne encore un palier 768p à 0,10 $/sec et une durée de 5 ou 10 secondes. Le schéma en direct est en désaccord. resolution a exactement une valeur autorisée, 2K, et duration accepte n'importe quel entier de 5 à 15. Écrivez selon le schéma. Il y a une symétrie nette dans cet écart : le palier 768p est désactivé côté hébergé, et 768p est précisément le canevas natif que vous obtenez lorsque vous exécutez les poids vous-même.
Étape 1 : Générer l'Image de Base avec GPT Image 2
Tout dans cette démo commence par une seule image fixe. La scène est délibérément de circonstance : un développeur à 3h du matin regardant un téléchargement de point de contrôle de 21 Go.
Modèle : openai/gpt-image-2/text-to-image. Paramètres : qualité high, rapport 16:9.
plaintext1Un plan large photoréaliste d'un bureau à domicile encombré à 3h du matin, éclairé uniquement par deux écrans et la lueur RVB d'un boîtier PC ouvert sur le bureau. Un développeur fatigué dans un sweat à capuche gris est affalé sur une chaise en filet, le menton dans la main, regardant fixement l'écran gauche. L'écran gauche montre un terminal sombre avec une seule barre de progression de téléchargement visible à environ 78 pour cent. L'écran droit montre un explorateur de fichiers. Une tasse de café à moitié pleine et froide, un clavier mécanique et un petit ventilateur de bureau sont posés sur le bureau. Des traces de pluie sur la fenêtre derrière lui. Faible profondeur de champ, 35 mm, lumière chaude des écrans contre lumière bleue froide de la fenêtre, grain de capteur visible. Pas de superposition de texte, pas de filigrane. 2
Ne demandez pas au modèle d'image de rendre les noms de fichiers safetensors réels. Les longues chaînes de caractères soulignées reviennent en charabia. Conservez les noms de fichiers dans vos légendes.

Terrain de jeu GPT Image 2 sur Atlas Cloud avec l'invite 3h du matin tapée et l'image de base terminée dans le panneau de sortie
GPT Image 2 sur Atlas Cloud : qualité haute, 16:9, l'image de base rendue à droite. Le niveau haute qualité facture 0,1745 $ pour cette exécution, bien au-dessus du plancher de 0,009 $ listé, donc budgétez par niveau.

L'image de base générée : un développeur fatigué à 3h du matin regardant une barre de téléchargement sur l'écran gauche
La sortie de l'étape 1. Cette seule image alimente les étapes 2 et 3.
Étape 2 : Image vers Vidéo, le Travail Effectué par le Point de Contrôle fl2va
C'est le point de terminaison qui correspond à minimax_h3_fl2va_pruned_int8_convrot.safetensors. Une première image en entrée, mouvement et son en sortie. Localement, c'est le fichier que vous chargeriez ; hébergé, c'est un appel API.
Modèle : minimax/h3/image-to-video. Paramètres : image = l'image de l'étape 1 passée sous forme d'URL de données, resolution: 2K, duration: 5, ratio: 16:9.
plaintext1Le développeur reste immobile, seulement des respirations et des clignements d'yeux, les yeux fixés sur l'écran gauche. La barre de progression sur l'écran gauche avance lentement. Les ventilateurs du boîtier s'accélèrent et leur lueur RVB devient plus intense. Un instant avant la fin, il expire et ses épaules s'affaissent. Caméra fixe, aucun mouvement de caméra, aucun zoom, aucune coupure. Audio : un bruit de ventilateur de boîtier grave qui monte en hauteur, une faible pluie contre la fenêtre, une douce sonnerie de fin à deux notes vers la fin. 2
Passez l'image sous forme d'URL de données base64 plutôt qu'une URL de stockage fraîchement générée. Une nouvelle URL d'objet peut échouer à la vérification de téléchargement en amont. Notez également que H3 obéit réellement à « caméra fixe », ce qui n'est pas universellement vrai pour les modèles vidéo de cette classe.

Terrain de jeu MiniMax H3 image-to-video sur Atlas Cloud avec l'image de base chargée et un clip 2K terminé dans le panneau de sortie
MiniMax H3 image-to-video : image de base chargée, 2K, exécution terminée. Cette capture a utilisé la valeur par défaut du point de terminaison de 8 secondes, c'est pourquoi la citation indique 1,12 $. Mon clip intégré ci-dessous est la version de 5 secondes à 0,70 $.

Le travail fl2va : une image en entrée, cinq secondes de mouvement plus le bruit stéréo du ventilateur en sortie.
Étape 3 : Référence vers Vidéo, le Travail Effectué par le Point de Contrôle ref2va
Point de contrôle différent, fichier différent, tâche différente. ref2va ne prolonge pas une première image. Il prend du matériel de référence et construit un nouveau plan qui conserve l'identité et les objets cohérents. C'est pourquoi le dépôt contient deux fichiers de 21 Go au lieu d'un.
Je lui ai donné deux références : l'image de l'étape 1 pour la personne et la pièce, et un plan macro d'une carte graphique pour le matériel.
Modèle : minimax/h3/reference-to-video. Paramètres : refers = les deux images, resolution: 2K, duration: 8, ratio: 16:9.
plaintext1Même homme, même sweat à capuche gris, même visage, dans le même bureau à domicile sombre. Nouveau plan : un plan moyen rapproché de côté alors qu'il se penche en arrière dans la chaise et laisse échapper une longue respiration, le coin de sa bouche se soulevant légèrement. La carte graphique de la deuxième image de référence est visible par-dessus son épaule, ses ventilateurs ralentissant, le RVB se stabilisant à une couleur constante. Gardez son identité, son sweat à capuche, ses cheveux et l'éclairage de la pièce cohérents avec les images de référence. Caméra fixe. Audio : bruit de ventilateur qui diminue, une pression de touche de clavier, la pluie continue. 2
refers prend un tableau mixte d'images, vidéos et audio, au moins une image ou une vidéo. L'audio seul est rejeté. Ce point de terminaison accepte également des durées jusqu'à 15 secondes.
Un piège sur ce point de terminaison spécifiquement : définissez ratio explicitement. Le laisser sur adaptive a renvoyé 400 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive', quatre fois de suite, y compris depuis le terrain de jeu avec les deux références clairement attachées. Avec ratio: "16:9" dans l'appel API, il a fonctionné du premier coup. C'est aussi pourquoi la capture d'écran ci-dessous est l'image de référence plutôt qu'une capture du terrain de jeu : je n'ai pas pu faire sortir le contrôle « Aspect Ratio » du terrain de jeu de adaptive, donc le clip que vous voyez ici provient de l'API avec les paramètres ci-dessus, pas d'une exécution du terrain de jeu.

La deuxième image de référence : un plan macro d'une carte graphique à trois ventilateurs à l'intérieur d'un boîtier PC ouvert la nuit
Image de référence 2, générée dans le même lot que l'image de base, passée à côté de l'image de l'étape 1.

Le travail ref2va : une nouvelle prise plutôt qu'une continuation. Même homme, même sweat à capuche, même pièce, et la carte graphique de la référence 2 maintenant dans le cadre avec ses ventilateurs qui ralentissent. Notez qu'il a interprété « plan moyen rapproché » de manière lâche et est resté assez large.
Étape 4 : Texte vers Vidéo, la Référence MiniMax H3 Open Source Weights
Même scène, décrite en mots, aucune référence du tout. Cette étape existe pour vous montrer ce à quoi servent réellement les deux points de contrôle.
Modèle : minimax/h3/text-to-video. Paramètres : ratio est obligatoire ici et ne peut pas être adaptive, donc 16:9. resolution: 2K, duration: 5.
plaintext1Un développeur fatigué dans un sweat à capuche gris à 3h du matin dans un bureau à domicile encombré, éclairé par deux écrans et la lueur RVB d'un boîtier PC ouvert, regardant une barre de progression de téléchargement ramper sur l'écran gauche. De la pluie sur la fenêtre derrière lui. Plan 35 mm fixe, faible profondeur de champ, lumière chaude des écrans contre lumière froide de la fenêtre, grain de film. Audio : bruit de ventilateur de boîtier qui monte, faible pluie, une douce sonnerie de fin à la fin. 2

Terrain de jeu MiniMax H3 text-to-video sur Atlas Cloud avec l'invite tapée et un clip terminé dans le panneau de sortie
MiniMax H3 text-to-video : aucun matériel de référence, 2K, Aspect Ratio réglé sur 16:9 car adaptive est rejeté ici, exécution terminée. Même invite, et déjà un visage différent de celui de l'étape 2.

Mêmes mots, humain différent. Jolie pièce, mauvais gars. Cet écart est tout l'argument de l'existence de fl2va et ref2va en tant que points de contrôle séparés.
Une note opérationnelle si vous scriptez les trois : la concurrence en amont est d'environ une tâche. Les travaux qui se chevauchent renvoient 429 rate limit exceeded (task concurrency). Exécutez-les en série. Un clip 2K de 5 secondes a pris environ deux minutes à chaque fois.
Ce que Coûtent les MiniMax H3 Open Source Weights, et ce que dit réellement la Licence
La question du coût a deux devises. Hébergé, un clip 2K de 5 secondes coûte 0,70 $ et un de 15 secondes coûte 2,10 $, à la seconde, sans paliers, sans réduction. Local, la devise est les gigaoctets et les heures : 42,5 Go à télécharger, une carte qui peut les contenir, et un canevas 768p à moins que vous n'exécutiez également la passe de régénération. Quelque part au-dessus de quelques centaines de clips par mois, l'arithmétique s'inverse. En dessous, cela ne change pas grand-chose.
Ensuite, il y a la troisième devise, qui est le temps de revue juridique. J'ai lu l'intégralité du LICENSE. Voici ce qu'il contient.

Une lampe de bureau éclairant un ordinateur portable montrant un document texte dense, à côté d'une impression surlignée, de lunettes de lecture et d'un verre d'eau
La partie d'une version à poids ouverts que personne ne capture d'écran pour le fil de lancement.
| Clause | Section | Ce qu'elle dit | Ce que cela signifie pour vous |
|---|---|---|---|
| Territoire Applicable | I.3, I.5 | Mondial, « à l'exclusion des Territoires Exclus », définis comme « l'Union européenne, le Royaume-Uni, la République de Corée et les États-Unis d'Amérique » | La licence communautaire ne vous accorde pas de droits là où vit la plupart des lecteurs de cet article |
| Interdiction d'utilisation territoriale | V.4 | Vous ne pouvez pas « utiliser, reproduire, modifier, distribuer ou afficher les MiniMax H3 Works ou leurs Sorties ou résultats en dehors du Territoire Applicable » | Cela atteint les Sorties, pas seulement les poids |
| Canal de licence séparé | II | MiniMax « évaluera continuellement les lois applicables » et invite les parties des régions exclues à les contacter pour une licence | C'est « pas encore », pas « jamais ». Le dépôt contient un formulaire de demande |
| Attribution | IV.2 | Vous « devez afficher de manière proéminente 'MiniMax H3' sur l'interface utilisateur » de tout produit commercial l'utilisant | Un changement d'interface, pas une note de bas de page |
| Seuil de revenus | IV.1 | Au-delà de 20 millions de dollars de revenus annuels, vous avez besoin d'une autorisation écrite préalable de [email protected] | L'utilisation commerciale gratuite a un plafond |
| Pas de blanchiment de modèle | V.3 | Vous ne pouvez pas utiliser H3 ou ses Sorties « pour améliorer un autre modèle d'intelligence artificielle » | Exclut la distillation dans votre propre modèle |
| Redistribution | III.1, III.4 | Transmettez l'accord avec, incluez un fichier NOTICE, marquez les fichiers modifiés | Standard, mais cela lie aussi les utilisateurs en aval |
| Codeur de texte | Note additionnelle | Le codeur est Qwen3-VL-32B sous Apache 2.0 | Un composant de la pile est véritablement ouvert OSI |
| Droit applicable | IX | Droit de la RAS de Hong Kong, juridiction exclusive de Hong Kong | À prendre en compte dans votre registre des risques |
La date d'effet de l'accord est le 2 août 2026 (Hugging Face, août 2026).
La plupart des couvertures de lancement ont mené avec « poids ouverts » et se sont arrêtées là. À crédit de MiniMax, ils ne l'ont pas caché : le dépôt contient son propre docs/QA-about-License.md expliquant que les modèles vidéo font face à un paysage réglementaire plus dynamique que les modèles de texte, citant l'AI Act de l'UE, les règles du Royaume-Uni et de la Corée, et les litiges en cours sur le droit d'auteur aux États-Unis concernant la vidéo générative, et déclarant clairement que « la limitation actuelle signifie 'pas encore', pas 'jamais' ». Le même document confirme la division qui compte opérationnellement : l'API reste disponible mondialement car MiniMax contrôle l'infrastructure de service, tandis que les poids ouverts laissent ce contrôle derrière.
Donc, si vous êtes à San Francisco, Berlin, Londres ou Séoul, la lecture pratique n'est pas « vous ne pouvez jamais toucher à H3 ». C'est « cette licence particulière n'est pas l'instrument qui vous permet d'exécuter ces poids sur votre propre machine ». Faites une demande de licence séparée, ou utilisez un point de terminaison hébergé, où vous êtes client d'un service plutôt que licencié des poids.
Je ne suis pas avocat et ce n'est pas un conseil juridique. Le texte de la clause ci-dessus est cité pour que votre propre conseiller puisse lire l'original en environ dix minutes.
MiniMax H3 Open Source Weights : Foire Aux Questions
Les poids MiniMax H3 open source sont-ils réellement disponibles, et où puis-je les télécharger ?
Oui, depuis le début août 2026. Deux endroits. MiniMaxAI/MiniMax-H3 est le dépôt officiel, environ 498 Go, contenant le pipeline au format diffusers, les deux transformateurs, le codeur de texte, les deux VAE, la documentation et les scripts reproductibles. Comfy-Org/MiniMax-H3 est la construction ComfyUI repackagée, environ 343 Go au total, avec les points de contrôle quantifiés en un seul fichier que la plupart des gens veulent réellement. Si vous utilisez ComfyUI, utilisez le second et téléchargez quatre fichiers.
Combien de paramètres MiniMax H3 a-t-il, et ai-je besoin d'un supercalculateur ?
33B, dans un transformateur dense à flux unique. Environ 13B de cela se trouve dans les branches liées à AdaLN dont les sorties peuvent être précalculées et mises en cache, donc les déploiements dédiés à l'inférence n'ont pas besoin de les charger. C'est ce que sont les points de contrôle « élagués ». Pas de supercalculateur. Un téléchargement de 42,5 Go et un GPU grand public sérieux.
Puis-je exécuter les poids MiniMax H3 open source sur 12 Go ou 16 Go de VRAM ?
L'équipe ComfyUI dit qu'une carte de 12 Go peut le faire avec déchargement dynamique, en utilisant le point de contrôle fl2va int8 élagué plus le codeur de texte nvfp4 AWQ. C'est leur affirmation, pas un benchmark que j'ai exécuté. Deux mises en garde : le déchargement échange de la VRAM contre de la RAM système, donc prévoyez 64 Go de RAM et attendez-vous à des temps de rendu longs, et votre canevas local est de 768px sur le petit côté, pas 2K.
Les poids MiniMax H3 open source sont-ils vraiment open source, ou juste open weights ?
Open weights, précisément. Les poids sont téléchargeables et modifiables, ce qui est plus que ce que tout modèle vidéo de frontière offrait il y a un an. Mais la licence n'est pas approuvée par l'OSI, la recette d'entraînement et les données ne sont pas publiées, l'utilisation commerciale comporte des conditions d'attribution et de revenus, et la clause de territoire restreint l'endroit où la licence s'applique. Le seul composant véritablement ouvert est le codeur Qwen3-VL-32B sous Apache 2.0. Trois couches séparées, et « ouvert » ne décrit proprement que la première.
Puis-je utiliser les poids MiniMax H3 open source à des fins commerciales, et que signifie la ligne des 20 millions de dollars ?
Oui, avec deux conditions. Vous devez afficher de manière proéminente « MiniMax H3 » sur l'interface utilisateur du produit commercial (Section IV.2). Et si vos produits et services commerciaux génèrent plus de 20 millions de dollars de revenus annuels, vous avez besoin d'une autorisation écrite préalable séparée de MiniMax avant de l'utiliser, demandée à [email protected] (Section IV.1). Le seuil porte sur vos revenus, pas sur votre utilisation de H3.
Pourquoi la licence MiniMax H3 exclut-elle les États-Unis et l'UE, et quelles sont mes options ?
Selon les propres questions-réponses de MiniMax sur la licence, parce que la génération vidéo se trouve dans un environnement réglementaire plus dynamique que le texte, en particulier l'AI Act de l'UE, l'évolution des règles du Royaume-Uni et de la Corée du Sud, et les litiges actifs sur le droit d'auteur aux États-Unis concernant la vidéo générative. Une fois les poids publics, ils ne peuvent pas appliquer de garanties en aval, donc ils ont limité la licence au lieu de retarder la sortie. Options dans une région exclue : demander une licence séparée via le formulaire dans le dépôt, ou utiliser une API hébergée, qui est une relation juridique différente et reste disponible mondialement. Faites confirmer par votre conseiller laquelle convient avant de déployer.
Vérifié le 3 août 2026. Trois points sur la liste de suivi : les quantifications GGUF et à bits inférieurs de la communauté (aucune n'existe encore pour H3), tout changement à la liste des Territoires Exclus, et si le palier 768p hébergé que le README documente encore reviendra un jour.






