Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

MiniMax H3 Open Source Weights : Vous n'avez pas besoin d'un supercalculateur. Vous pourriez avoir besoin d'un avocat.

Les poids open source MiniMax H3 sont disponibles : 33B paramètres, téléchargement minimum de 42,5 Go, deux points de contrôle, et une licence dont la clause territoriale exclut les États-Unis, l'UE, le Royaume-Uni et la Corée.

Laptop affichant du code à côté d'un PC lumineux sur un bureau

Un bureau à 3h du matin avec un boîtier PC ouvert, un disque externe et un écran affichant un téléchargement volumineux en cours.

Les poids sont sortis. Permettez-moi donc de répondre aux deux questions qui ont reçu le plus de réponses sous le post de lancement de MiniMax, avant toute autre chose.

Non, vous n'avez pas besoin d'un supercalculateur. Choisissez les bons fichiers et le téléchargement fait 42,5 Go, pas 123,6 Go. Le modèle a 33 milliards de paramètres, et environ 13 milliards d'entre eux se trouvent dans les branches de modulation AdaLN que l'inférence n'a même pas besoin de charger.

Ensuite, j'ai ouvert le fichier LICENSE. Ligne 10, avant même d'arriver à la clause sur les 20 millions de dollars de revenus, il y a une liste de pays. Mon pays y figure. Probablement le vôtre aussi.

Points clés

  • Les poids open source de MiniMax H3 sont disponibles sur Hugging Face sous MiniMaxAI/MiniMax-H3, ainsi qu'un miroir repackagé pour ComfyUI à Comfy-Org/MiniMax-H3. ComfyUI a déployé la prise en charge native le jour même.
  • Ce n'est pas un seul fichier. Il y a deux points de contrôle spécifiques à chaque tâche, fl2va (guidé par texte et image) et ref2va (guidé par référence), 21 Go chacun dans leur forme la plus petite. Vous ne téléchargez que celui dont votre travail a besoin.
  • Transformateur dense à flux unique de 33B. La combinaison de travail la plus petite est 42,5 Go, soit 66 % de moins que 123,6 Go en pleine précision. ComfyUI indique qu'une carte de 12 Go avec déchargement peut le faire fonctionner.
  • La génération locale est nativement en 768px sur le petit côté, pas en 2K. Le 2K provient d'une seconde passe de régénération dans le contexte.
  • L'utilisation commerciale est gratuite mais vous devez afficher « MiniMax H3 » dans votre interface utilisateur, et au-delà de 20 millions de dollars de revenus annuels, vous avez besoin d'une autorisation écrite séparée. Et le Territoire Applicable de la licence exclut l'UE, le Royaume-Uni, la Corée du Sud et les États-Unis. Une API hébergée est une relation juridique différente.

Un personnage, les deux points de contrôle, un 3h du matin. Le côté gauche montre ce que fait fl2va. Le côté droit montre ce que fait ref2va. Même personne, même pièce, même nuit, deux travaux complètement différents, et le bruit du ventilateur que vous entendez est généré dans la même passe que l'image.

Comparaison côte à côte d'un homme travaillant à un bureau à deux écrans

Gauche : image vers vidéo, le travail effectué par le point de contrôle fl2va. Droite : référence vers vidéo, le travail effectué par ref2va. Les deux rendus sur MiniMax H3 avec audio stéréo natif. Activez le son.

La première chose que j'ai demandé à ce modèle de générer était un être humain attendant que ce modèle finisse de télécharger. Cela semblait approprié.

MiniMax H3 Open Source Weights, Pesés : Deux Points de Contrôle et un Plancher à 42,5 Go

Voici pourquoi cette version a fait du bruit. Artificial Analysis a classé H3 #1 en Édition Vidéo et dans le top trois à la fois en texte-vers-vidéo et image-vers-vidéo, et a déclaré que la sortie des poids « ferait de lui de loin le modèle à poids ouverts dominant » (Artificial Analysis, juillet 2026). C'est un modèle vidéo de niveau frontière avec un bouton de téléchargement.

L'autre moitié honnête : la même série de benchmarks place H3 derrière Google Gemini Omni Flash en texte-vers-vidéo, et derrière à la fois Seedance 2.0 et Gemini Omni Flash en image-vers-vidéo (South China Morning Post, juillet 2026). Il est #1 en édition, pas #1 partout.

Maintenant, la partie que presque personne n'a vérifiée avant de lancer git clone.

Le nombre de paramètres que personne n'a mis dans un titre. La fiche du modèle décrit H3-Omni-Transformer comme « un transformateur dense à flux unique de 33 milliards de paramètres, avec environ 13 milliards de paramètres résidant dans les branches liées à AdaLN », et ajoute que comme ces sorties de modulation peuvent être précalculées et mises en cache, « ces paramètres n'ont pas besoin d'être chargés pour un déploiement dédié à l'inférence ». C'est de là que viennent les points de contrôle élagués. Environ 40 % du modèle se transforme en une table de correspondance lorsque vous ne faites que de l'inférence.

Là où la plupart des gens brûlent 80 Go pour rien. Le dépôt officiel MiniMaxAI/MiniMax-H3 fait 498 Go si vous téléchargez tout. Le miroir ComfyUI fait 343 Go. Les deux contiennent chaque variante de précision des deux points de contrôle. Vous avez besoin de quatre fichiers, pas de quatre cents.

FichierTailleCe que c'estVous en avez besoin pour
minimax_h3_fl2va_pruned_int8_convrot.safetensors20,97 Gopoint de contrôle fl2va, élagué + int8Texte-vers-vidéo, image-vers-vidéo
minimax_h3_fl2va_int8_convrot.safetensors34,04 Gofl2va, int8, non élaguéIdem, meilleure fidélité
minimax_h3_fl2va_bf16.safetensors66,28 Gofl2va, pleine précisionFine-tuning, recherche
minimax_h3_ref2va_pruned_int8_convrot.safetensors20,97 Gopoint de contrôle ref2va, élagué + int8Référence-vers-vidéo uniquement
minimax_h3_ref2va_int8_convrot.safetensors34,04 Goref2va, int8, non élaguéIdem, meilleure fidélité
minimax_h3_ref2va_bf16.safetensors66,28 Goref2va, pleine précisionFine-tuning, recherche
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15,69 GoCodeur de texte, AWQ 4 bitsChaque flux de travail
qwen3vl_32b_minimax_h3_int8_convrot.safetensors27,14 GoCodeur de texte, int8Chaque flux de travail
qwen3vl_32b_minimax_h3_bf16.safetensors51,51 GoCodeur de texte, pleine précisionChaque flux de travail
minimax_h3_video_vae_fp16.safetensors5,21 GoVAE vidéoChaque flux de travail
minimax_h3_audio_vae_fp32.safetensors0,61 GoVAE audioChaque flux de travail (c'est le son)
Ensemble de travail le plus petit, une tâche42,5 Gofl2va élagué + codeur nvfp4 + les deux VAELe téléchargement réaliste
Les deux points de contrôle, le plus petit63,4 Goajouter ref2va élaguéSi vous voulez les trois modes
Une tâche en bf16 complet123,6 Gotout en bf16Stations de recherche uniquement

Tailles de fichiers lues directement depuis l'index du dépôt Comfy-Org/MiniMax-H3, août 2026.

Le propre cadrage de ComfyUI du même nombre : « empreinte mémoire totale réduite de 66 %, passant de 123,6 Go en pleine précision à 42,5 Go », ce qui « permet à un modèle vidéo 2K de nouvelle génération de fonctionner localement sur un GPU comme le RTX 3060 » (ComfyUI, août 2026). Prenez le chiffre de 12 Go comme leur affirmation avec déchargement dynamique, pas comme un benchmark. Je ne l'ai pas fait tourner sur un 3060, et le déchargement achète de la VRAM avec de la RAM système et du temps réel.

Une chose que « faire tourner localement » signifie discrètement : 768px. Le canevas natif de H3 est un petit côté de 768px, plafonné à 768x1344, selon le tutoriel H3 de ComfyUI. La durée s'accroche à une grille de 17 images par bloc à 24 ips. Les clips 2K dans le marketing proviennent de H3-Regenerate-2K, une seconde passe qui renvoie le résultat 768p plus le contexte d'origine à travers le modèle. La fiche du modèle précise que le système complet comprend trois modules : H3-Context-IR, H3-Base et H3-Regenerate-2K. ComfyUI local vous donne H3-Base.

Et le mot « ouvert » fait trois emplois distincts ici. Téléchargeable, oui. Utilisable commercialement, sous conditions. Exécutable là où vous vivez, cela dépend de l'endroit où vous vivez. Le fil Reddit qualifiant cela de « modèle en réalité closed source » a tort sur le premier point et pointe vers quelque chose de réel sur les deux autres. La section 7 contient le texte de la clause.

MiniMax H3 Open Source Weights Local vs API Hébergée : Choisissez Votre Voie

Tout ce qui se trouve en dessous de cette ligne, l'ensemble de la démo en quatre étapes, fonctionne dans un seul onglet de navigateur sur Atlas Cloud, qui dessert les trois points de terminaison H3 ainsi que le modèle d'image que j'ai utilisé pour l'image de base. Ce n'est pas la même chose que d'exécuter les poids, et la différence compte plus que d'habitude avec ce modèle.

Poids locauxAPI hébergée
Coût initialTéléchargement de 42,5 Go, un GPU de 12 Go+, une installation ComfyUIUne clé API
Délai avant le premier clipUne soirée, optimistiquementEnviron deux minutes
Coût par clip de 5sTemps GPU et électricité0,70 $ à 0,14 $/seconde
Résolution nativePetit côté 768px, 2K via une passe de régénération2K direct, c'est la seule valeur d'énumération
Fine-tuning, LoRA, modificationOui, c'est tout l'intérêtNon
Données ne quittant jamais votre réseauOuiNon
Exposition à la licenceVous acceptez la Licence Communautaire et sa clause de territoireVous êtes client d'un service hébergé
Si vous êtes dans l'UE, RU, Corée ou USSection 7Non affecté par la licence des poids

Règle empirique : en dessous d'environ 100 clips par mois, ou si vous avez besoin du 2K directement, ou si vous résidez dans un Territoire Exclu, l'hébergé gagne sur tous les axes. Au-dessus, ou si vous avez l'intention de vous entraîner sur le point de contrôle, ou si les images ne peuvent pas quitter votre bâtiment, les 42,5 Go valent la soirée.

Prix vérifiés à partir des pages de modèles en direct, août 2026. Tous les points de terminaison H3 facturent par seconde de sortie, sans réduction active.

ModèleCe qu'il fait iciPrixRéduction
MiniMax H3 image-to-videoÉtape 2, le travail fl2va0,14 $/sec en 2KAucune
MiniMax H3 reference-to-videoÉtape 3, le travail ref2va0,14 $/sec en 2KAucune
MiniMax H3 text-to-videoÉtape 4, la référence sans image0,14 $/sec en 2KAucune
GPT Image 2 text-to-imageÉtape 1, l'image de base0,009 $/image listé ; l'exécution haute qualité 16:9 que j'ai utilisée facture 0,1745 $Aucune
Seedance 2.0 / Wan 2.7 / Kling v3.0 TurboPoints de référence par seconde0,112 $ / 0,10 $ / 0,095 $ par secondeKling 15% de réduction

Une incohérence à connaître avant d'écrire du code : le README de H3 mentionne encore un palier 768p à 0,10 $/sec et une durée de 5 ou 10 secondes. Le schéma en direct est en désaccord. resolution a exactement une valeur autorisée, 2K, et duration accepte n'importe quel entier de 5 à 15. Écrivez selon le schéma. Il y a une symétrie nette dans cet écart : le palier 768p est désactivé côté hébergé, et 768p est précisément le canevas natif que vous obtenez lorsque vous exécutez les poids vous-même.

Étape 1 : Générer l'Image de Base avec GPT Image 2

Tout dans cette démo commence par une seule image fixe. La scène est délibérément de circonstance : un développeur à 3h du matin regardant un téléchargement de point de contrôle de 21 Go.

Modèle : openai/gpt-image-2/text-to-image. Paramètres : qualité high, rapport 16:9.

plaintext
1Un plan large photoréaliste d'un bureau à domicile encombré à 3h du matin, éclairé uniquement par deux écrans et la lueur RVB d'un boîtier PC ouvert sur le bureau. Un développeur fatigué dans un sweat à capuche gris est affalé sur une chaise en filet, le menton dans la main, regardant fixement l'écran gauche. L'écran gauche montre un terminal sombre avec une seule barre de progression de téléchargement visible à environ 78 pour cent. L'écran droit montre un explorateur de fichiers. Une tasse de café à moitié pleine et froide, un clavier mécanique et un petit ventilateur de bureau sont posés sur le bureau. Des traces de pluie sur la fenêtre derrière lui. Faible profondeur de champ, 35 mm, lumière chaude des écrans contre lumière bleue froide de la fenêtre, grain de capteur visible. Pas de superposition de texte, pas de filigrane.
2

Ne demandez pas au modèle d'image de rendre les noms de fichiers safetensors réels. Les longues chaînes de caractères soulignées reviennent en charabia. Conservez les noms de fichiers dans vos légendes.

Capture d'écran de l'interface du générateur texte-à-image d'Atlas Cloud avec la sortie

Terrain de jeu GPT Image 2 sur Atlas Cloud avec l'invite 3h du matin tapée et l'image de base terminée dans le panneau de sortie

GPT Image 2 sur Atlas Cloud : qualité haute, 16:9, l'image de base rendue à droite. Le niveau haute qualité facture 0,1745 $ pour cette exécution, bien au-dessus du plancher de 0,009 $ listé, donc budgétez par niveau.

Homme en sweat à capuche regardant deux écrans d'ordinateur la nuit

L'image de base générée : un développeur fatigué à 3h du matin regardant une barre de téléchargement sur l'écran gauche

La sortie de l'étape 1. Cette seule image alimente les étapes 2 et 3.

Étape 2 : Image vers Vidéo, le Travail Effectué par le Point de Contrôle fl2va

C'est le point de terminaison qui correspond à minimax_h3_fl2va_pruned_int8_convrot.safetensors. Une première image en entrée, mouvement et son en sortie. Localement, c'est le fichier que vous chargeriez ; hébergé, c'est un appel API.

Modèle : minimax/h3/image-to-video. Paramètres : image = l'image de l'étape 1 passée sous forme d'URL de données, resolution: 2K, duration: 5, ratio: 16:9.

plaintext
1Le développeur reste immobile, seulement des respirations et des clignements d'yeux, les yeux fixés sur l'écran gauche. La barre de progression sur l'écran gauche avance lentement. Les ventilateurs du boîtier s'accélèrent et leur lueur RVB devient plus intense. Un instant avant la fin, il expire et ses épaules s'affaissent. Caméra fixe, aucun mouvement de caméra, aucun zoom, aucune coupure. Audio : un bruit de ventilateur de boîtier grave qui monte en hauteur, une faible pluie contre la fenêtre, une douce sonnerie de fin à deux notes vers la fin.
2

Passez l'image sous forme d'URL de données base64 plutôt qu'une URL de stockage fraîchement générée. Une nouvelle URL d'objet peut échouer à la vérification de téléchargement en amont. Notez également que H3 obéit réellement à « caméra fixe », ce qui n'est pas universellement vrai pour les modèles vidéo de cette classe.

Capture d'écran de l'interface du générateur image-vers-vidéo MiniMax

Terrain de jeu MiniMax H3 image-to-video sur Atlas Cloud avec l'image de base chargée et un clip 2K terminé dans le panneau de sortie

MiniMax H3 image-to-video : image de base chargée, 2K, exécution terminée. Cette capture a utilisé la valeur par défaut du point de terminaison de 8 secondes, c'est pourquoi la citation indique 1,12 $. Mon clip intégré ci-dessous est la version de 5 secondes à 0,70 $.

Homme fatigué attendant une barre de chargement d'ordinateur la nuit

Le travail fl2va : une image en entrée, cinq secondes de mouvement plus le bruit stéréo du ventilateur en sortie.

Étape 3 : Référence vers Vidéo, le Travail Effectué par le Point de Contrôle ref2va

Point de contrôle différent, fichier différent, tâche différente. ref2va ne prolonge pas une première image. Il prend du matériel de référence et construit un nouveau plan qui conserve l'identité et les objets cohérents. C'est pourquoi le dépôt contient deux fichiers de 21 Go au lieu d'un.

Je lui ai donné deux références : l'image de l'étape 1 pour la personne et la pièce, et un plan macro d'une carte graphique pour le matériel.

Modèle : minimax/h3/reference-to-video. Paramètres : refers = les deux images, resolution: 2K, duration: 8, ratio: 16:9.

plaintext
1Même homme, même sweat à capuche gris, même visage, dans le même bureau à domicile sombre. Nouveau plan : un plan moyen rapproché de côté alors qu'il se penche en arrière dans la chaise et laisse échapper une longue respiration, le coin de sa bouche se soulevant légèrement. La carte graphique de la deuxième image de référence est visible par-dessus son épaule, ses ventilateurs ralentissant, le RVB se stabilisant à une couleur constante. Gardez son identité, son sweat à capuche, ses cheveux et l'éclairage de la pièce cohérents avec les images de référence. Caméra fixe. Audio : bruit de ventilateur qui diminue, une pression de touche de clavier, la pluie continue.
2

refers prend un tableau mixte d'images, vidéos et audio, au moins une image ou une vidéo. L'audio seul est rejeté. Ce point de terminaison accepte également des durées jusqu'à 15 secondes.

Un piège sur ce point de terminaison spécifiquement : définissez ratio explicitement. Le laisser sur adaptive a renvoyé 400 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive', quatre fois de suite, y compris depuis le terrain de jeu avec les deux références clairement attachées. Avec ratio: "16:9" dans l'appel API, il a fonctionné du premier coup. C'est aussi pourquoi la capture d'écran ci-dessous est l'image de référence plutôt qu'une capture du terrain de jeu : je n'ai pas pu faire sortir le contrôle « Aspect Ratio » du terrain de jeu de adaptive, donc le clip que vous voyez ici provient de l'API avec les paramètres ci-dessus, pas d'une exécution du terrain de jeu.

Une carte graphique à trois ventilateurs montée verticalement à l'intérieur d'un boîtier d'ordinateur

La deuxième image de référence : un plan macro d'une carte graphique à trois ventilateurs à l'intérieur d'un boîtier PC ouvert la nuit

Image de référence 2, générée dans le même lot que l'image de base, passée à côté de l'image de l'étape 1.

Homme tapant sur un clavier à un bureau avec deux écrans la nuit

Le travail ref2va : une nouvelle prise plutôt qu'une continuation. Même homme, même sweat à capuche, même pièce, et la carte graphique de la référence 2 maintenant dans le cadre avec ses ventilateurs qui ralentissent. Notez qu'il a interprété « plan moyen rapproché » de manière lâche et est resté assez large.

Étape 4 : Texte vers Vidéo, la Référence MiniMax H3 Open Source Weights

Même scène, décrite en mots, aucune référence du tout. Cette étape existe pour vous montrer ce à quoi servent réellement les deux points de contrôle.

Modèle : minimax/h3/text-to-video. Paramètres : ratio est obligatoire ici et ne peut pas être adaptive, donc 16:9. resolution: 2K, duration: 5.

plaintext
1Un développeur fatigué dans un sweat à capuche gris à 3h du matin dans un bureau à domicile encombré, éclairé par deux écrans et la lueur RVB d'un boîtier PC ouvert, regardant une barre de progression de téléchargement ramper sur l'écran gauche. De la pluie sur la fenêtre derrière lui. Plan 35 mm fixe, faible profondeur de champ, lumière chaude des écrans contre lumière froide de la fenêtre, grain de film. Audio : bruit de ventilateur de boîtier qui monte, faible pluie, une douce sonnerie de fin à la fin.
2

Interface de texte-vers-vidéo IA montrant l'invite et la sortie vidéo générée

Terrain de jeu MiniMax H3 text-to-video sur Atlas Cloud avec l'invite tapée et un clip terminé dans le panneau de sortie

MiniMax H3 text-to-video : aucun matériel de référence, 2K, Aspect Ratio réglé sur 16:9 car adaptive est rejeté ici, exécution terminée. Même invite, et déjà un visage différent de celui de l'étape 2.

Homme en sweat à capuche gris regardant un écran d'ordinateur la nuit

Mêmes mots, humain différent. Jolie pièce, mauvais gars. Cet écart est tout l'argument de l'existence de fl2va et ref2va en tant que points de contrôle séparés.

Une note opérationnelle si vous scriptez les trois : la concurrence en amont est d'environ une tâche. Les travaux qui se chevauchent renvoient 429 rate limit exceeded (task concurrency). Exécutez-les en série. Un clip 2K de 5 secondes a pris environ deux minutes à chaque fois.

Ce que Coûtent les MiniMax H3 Open Source Weights, et ce que dit réellement la Licence

La question du coût a deux devises. Hébergé, un clip 2K de 5 secondes coûte 0,70 $ et un de 15 secondes coûte 2,10 $, à la seconde, sans paliers, sans réduction. Local, la devise est les gigaoctets et les heures : 42,5 Go à télécharger, une carte qui peut les contenir, et un canevas 768p à moins que vous n'exécutiez également la passe de régénération. Quelque part au-dessus de quelques centaines de clips par mois, l'arithmétique s'inverse. En dessous, cela ne change pas grand-chose.

Ensuite, il y a la troisième devise, qui est le temps de revue juridique. J'ai lu l'intégralité du LICENSE. Voici ce qu'il contient.

Un ordinateur portable ouvert et une pile de papiers éclairés par une lampe de bureau

Une lampe de bureau éclairant un ordinateur portable montrant un document texte dense, à côté d'une impression surlignée, de lunettes de lecture et d'un verre d'eau

La partie d'une version à poids ouverts que personne ne capture d'écran pour le fil de lancement.

ClauseSectionCe qu'elle ditCe que cela signifie pour vous
Territoire ApplicableI.3, I.5Mondial, « à l'exclusion des Territoires Exclus », définis comme « l'Union européenne, le Royaume-Uni, la République de Corée et les États-Unis d'Amérique »La licence communautaire ne vous accorde pas de droits là où vit la plupart des lecteurs de cet article
Interdiction d'utilisation territorialeV.4Vous ne pouvez pas « utiliser, reproduire, modifier, distribuer ou afficher les MiniMax H3 Works ou leurs Sorties ou résultats en dehors du Territoire Applicable »Cela atteint les Sorties, pas seulement les poids
Canal de licence séparéIIMiniMax « évaluera continuellement les lois applicables » et invite les parties des régions exclues à les contacter pour une licenceC'est « pas encore », pas « jamais ». Le dépôt contient un formulaire de demande
AttributionIV.2Vous « devez afficher de manière proéminente 'MiniMax H3' sur l'interface utilisateur » de tout produit commercial l'utilisantUn changement d'interface, pas une note de bas de page
Seuil de revenusIV.1Au-delà de 20 millions de dollars de revenus annuels, vous avez besoin d'une autorisation écrite préalable de [email protected]L'utilisation commerciale gratuite a un plafond
Pas de blanchiment de modèleV.3Vous ne pouvez pas utiliser H3 ou ses Sorties « pour améliorer un autre modèle d'intelligence artificielle »Exclut la distillation dans votre propre modèle
RedistributionIII.1, III.4Transmettez l'accord avec, incluez un fichier NOTICE, marquez les fichiers modifiésStandard, mais cela lie aussi les utilisateurs en aval
Codeur de texteNote additionnelleLe codeur est Qwen3-VL-32B sous Apache 2.0Un composant de la pile est véritablement ouvert OSI
Droit applicableIXDroit de la RAS de Hong Kong, juridiction exclusive de Hong KongÀ prendre en compte dans votre registre des risques

La date d'effet de l'accord est le 2 août 2026 (Hugging Face, août 2026).

La plupart des couvertures de lancement ont mené avec « poids ouverts » et se sont arrêtées là. À crédit de MiniMax, ils ne l'ont pas caché : le dépôt contient son propre docs/QA-about-License.md expliquant que les modèles vidéo font face à un paysage réglementaire plus dynamique que les modèles de texte, citant l'AI Act de l'UE, les règles du Royaume-Uni et de la Corée, et les litiges en cours sur le droit d'auteur aux États-Unis concernant la vidéo générative, et déclarant clairement que « la limitation actuelle signifie 'pas encore', pas 'jamais' ». Le même document confirme la division qui compte opérationnellement : l'API reste disponible mondialement car MiniMax contrôle l'infrastructure de service, tandis que les poids ouverts laissent ce contrôle derrière.

Donc, si vous êtes à San Francisco, Berlin, Londres ou Séoul, la lecture pratique n'est pas « vous ne pouvez jamais toucher à H3 ». C'est « cette licence particulière n'est pas l'instrument qui vous permet d'exécuter ces poids sur votre propre machine ». Faites une demande de licence séparée, ou utilisez un point de terminaison hébergé, où vous êtes client d'un service plutôt que licencié des poids.

Je ne suis pas avocat et ce n'est pas un conseil juridique. Le texte de la clause ci-dessus est cité pour que votre propre conseiller puisse lire l'original en environ dix minutes.

MiniMax H3 Open Source Weights : Foire Aux Questions

Les poids MiniMax H3 open source sont-ils réellement disponibles, et où puis-je les télécharger ?

Oui, depuis le début août 2026. Deux endroits. MiniMaxAI/MiniMax-H3 est le dépôt officiel, environ 498 Go, contenant le pipeline au format diffusers, les deux transformateurs, le codeur de texte, les deux VAE, la documentation et les scripts reproductibles. Comfy-Org/MiniMax-H3 est la construction ComfyUI repackagée, environ 343 Go au total, avec les points de contrôle quantifiés en un seul fichier que la plupart des gens veulent réellement. Si vous utilisez ComfyUI, utilisez le second et téléchargez quatre fichiers.

Combien de paramètres MiniMax H3 a-t-il, et ai-je besoin d'un supercalculateur ?

33B, dans un transformateur dense à flux unique. Environ 13B de cela se trouve dans les branches liées à AdaLN dont les sorties peuvent être précalculées et mises en cache, donc les déploiements dédiés à l'inférence n'ont pas besoin de les charger. C'est ce que sont les points de contrôle « élagués ». Pas de supercalculateur. Un téléchargement de 42,5 Go et un GPU grand public sérieux.

Puis-je exécuter les poids MiniMax H3 open source sur 12 Go ou 16 Go de VRAM ?

L'équipe ComfyUI dit qu'une carte de 12 Go peut le faire avec déchargement dynamique, en utilisant le point de contrôle fl2va int8 élagué plus le codeur de texte nvfp4 AWQ. C'est leur affirmation, pas un benchmark que j'ai exécuté. Deux mises en garde : le déchargement échange de la VRAM contre de la RAM système, donc prévoyez 64 Go de RAM et attendez-vous à des temps de rendu longs, et votre canevas local est de 768px sur le petit côté, pas 2K.

Les poids MiniMax H3 open source sont-ils vraiment open source, ou juste open weights ?

Open weights, précisément. Les poids sont téléchargeables et modifiables, ce qui est plus que ce que tout modèle vidéo de frontière offrait il y a un an. Mais la licence n'est pas approuvée par l'OSI, la recette d'entraînement et les données ne sont pas publiées, l'utilisation commerciale comporte des conditions d'attribution et de revenus, et la clause de territoire restreint l'endroit où la licence s'applique. Le seul composant véritablement ouvert est le codeur Qwen3-VL-32B sous Apache 2.0. Trois couches séparées, et « ouvert » ne décrit proprement que la première.

Puis-je utiliser les poids MiniMax H3 open source à des fins commerciales, et que signifie la ligne des 20 millions de dollars ?

Oui, avec deux conditions. Vous devez afficher de manière proéminente « MiniMax H3 » sur l'interface utilisateur du produit commercial (Section IV.2). Et si vos produits et services commerciaux génèrent plus de 20 millions de dollars de revenus annuels, vous avez besoin d'une autorisation écrite préalable séparée de MiniMax avant de l'utiliser, demandée à [email protected] (Section IV.1). Le seuil porte sur vos revenus, pas sur votre utilisation de H3.

Pourquoi la licence MiniMax H3 exclut-elle les États-Unis et l'UE, et quelles sont mes options ?

Selon les propres questions-réponses de MiniMax sur la licence, parce que la génération vidéo se trouve dans un environnement réglementaire plus dynamique que le texte, en particulier l'AI Act de l'UE, l'évolution des règles du Royaume-Uni et de la Corée du Sud, et les litiges actifs sur le droit d'auteur aux États-Unis concernant la vidéo générative. Une fois les poids publics, ils ne peuvent pas appliquer de garanties en aval, donc ils ont limité la licence au lieu de retarder la sortie. Options dans une région exclue : demander une licence séparée via le formulaire dans le dépôt, ou utiliser une API hébergée, qui est une relation juridique différente et reste disponible mondialement. Faites confirmer par votre conseiller laquelle convient avant de déployer.


Vérifié le 3 août 2026. Trois points sur la liste de suivi : les quantifications GGUF et à bits inférieurs de la communauté (aucune n'existe encore pour H3), tout changement à la liste des Territoires Exclus, et si le palier 768p hébergé que le README documente encore reviendra un jour.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles