MiniMax H3 Pesi Open Source: Non hai bisogno di un supercomputer. Potresti aver bisogno di un avvocato.

I pesi open source MiniMax H3 sono disponibili: 33B parametri, un download minimo di 42,5 GB, due checkpoint e una licenza la cui clausola territoriale esclude Stati Uniti, UE, Regno Unito e Corea.

Laptop che mostra codice accanto a un PC illuminato su una scrivania

Una scrivania alle 3 di notte con un case PC aperto, un drive esterno e un monitor che mostra un grande download in corso

I pesi sono disponibili. Quindi lasciatemi rispondere alle due domande che hanno ricevuto più risposte sotto il post di lancio di MiniMax, prima di ogni altra cosa.

No, non serve un supercomputer. Scegli i file giusti e il download è di 42,5 GB, non 123,6 GB. Il modello ha 33B di parametri, e circa 13B di questi risiedono nei rami di modulazione AdaLN che l'inferenza non deve nemmeno caricare.

Poi ho aperto il file LICENSE. Alla riga 10, prima ancora di arrivare alla clausola sui ricavi da 20 milioni di dollari, c'è un elenco di paesi. Il mio paese è nella lista. Probabilmente anche il vostro.

Punti chiave

  • I pesi open source di MiniMax H3 sono disponibili su Hugging Face come MiniMaxAI/MiniMax-H3, più un mirror ricompattato per ComfyUI su Comfy-Org/MiniMax-H3. ComfyUI ha pubblicato il supporto nativo lo stesso giorno.
  • Non è un singolo file. Ci sono due checkpoint specifici per attività, fl2va (guidato da testo e immagine) e ref2va (guidato da riferimento), ciascuno da 21 GB nella sua forma più piccola. Scarichi solo quello che serve al tuo compito.
  • Transformer denso a flusso singolo da 33B. La combinazione funzionante più piccola è di 42,5 GB, in calo del 66% rispetto ai 123,6 GB a piena precisione. ComfyUI dice che una scheda da 12 GB con offloading può eseguirlo.
  • La generazione locale è nativamente a 768px sul lato corto, non 2K. Il 2K arriva da un secondo passaggio di rigenerazione in-context.
  • L'uso commerciale è gratuito ma devi mostrare "MiniMax H3" nella tua interfaccia, e sopra i 20 milioni di dollari di ricavi annuali serve un'autorizzazione scritta separata. E il Territorio Applicabile della licenza esclude UE, Regno Unito, Corea del Sud e Stati Uniti. Un'API hosted è un rapporto giuridico diverso.

Un personaggio, entrambi i checkpoint, una sola notte. Il lato sinistro è ciò che fa fl2va. Il lato destro è ciò che fa ref2va. Stessa persona, stessa stanza, stessa notte, due lavori completamente diversi, e il ronzio della ventola che senti viene generato nello stesso passaggio dell'immagine.

Confronto affiancato di un uomo che lavora a una scrivania con doppio monitor

A sinistra: image-to-video, il compito del checkpoint fl2va. A destra: reference-to-video, il compito di ref2va. Entrambi renderizzati su MiniMax H3 con audio stereo nativo. Attiva l'audio.

La prima cosa che ho chiesto a questo modello di generare è stata un essere umano in attesa che questo modello finisse di scaricarsi. Sembrava giusto.

Pesi Open Source MiniMax H3, Soppesati: Due Checkpoint e un Minimo di 42,5 GB

Ecco perché questa release ha fatto rumore. Artificial Analysis ha piazzato H3 al #1 nel Video Editing e nei primi tre sia nel text-to-video che nell'image-to-video, e ha detto che rilasciare i pesi "lo renderebbe il modello open weights di gran lunga leader" (Artificial Analysis, luglio 2026). È un modello video di livello frontier con un pulsante di download.

L'altra metà onesta: la stessa esecuzione del benchmark vede H3 inseguire Gemini Omni Flash di Google nel text-to-video, e dietro sia a Seedance 2.0 che a Gemini Omni Flash nell'image-to-video (South China Morning Post, luglio 2026). È #1 nell'editing, non #1 in tutto.

Ora la parte che quasi nessuno ha controllato prima di lanciare git clone.

Il conteggio dei parametri che nessuno ha messo in un titolo. La scheda del modello descrive H3-Omni-Transformer come "un Transformer denso a flusso singolo da 33B di parametri, con circa 13B di parametri che risiedono nei rami correlati ad AdaLN", e aggiunge che poiché queste uscite di modulazione possono essere precalcolate e memorizzate nella cache, "questi parametri non devono essere caricati per un deployment di sola inferenza". È da qui che arrivano i checkpoint pruned. Circa il 40% del modello diventa una tabella di lookup quando fai solo inferenza.

Dove la maggior parte delle persone brucia 80 GB per nulla. Il repo ufficiale MiniMaxAI/MiniMax-H3 è di 498 GB se lo scarichi tutto. Il mirror ComfyUI è di 343 GB. Entrambi contengono ogni variante di precisione di entrambi i checkpoint. Ti servono quattro file, non quattrocento.

FileDimensioneCos'èTi serve per
minimax_h3_fl2va_pruned_int8_convrot.safetensors20,97 GBCheckpoint fl2va, pruned + int8Text-to-video, image-to-video
minimax_h3_fl2va_int8_convrot.safetensors34,04 GBfl2va, int8, non prunedStesso utilizzo, fedeltà superiore
minimax_h3_fl2va_bf16.safetensors66,28 GBfl2va, piena precisioneFine-tuning, ricerca
minimax_h3_ref2va_pruned_int8_convrot.safetensors20,97 GBCheckpoint ref2va, pruned + int8Solo reference-to-video
minimax_h3_ref2va_int8_convrot.safetensors34,04 GBref2va, int8, non prunedStesso utilizzo, fedeltà superiore
minimax_h3_ref2va_bf16.safetensors66,28 GBref2va, piena precisioneFine-tuning, ricerca
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15,69 GBText encoder, AWQ a 4 bitOgni workflow
qwen3vl_32b_minimax_h3_int8_convrot.safetensors27,14 GBText encoder, int8Ogni workflow
qwen3vl_32b_minimax_h3_bf16.safetensors51,51 GBText encoder, piena precisioneOgni workflow
minimax_h3_video_vae_fp16.safetensors5,21 GBVideo VAEOgni workflow
minimax_h3_audio_vae_fp32.safetensors0,61 GBAudio VAEOgni workflow (questo è l'audio)
Set funzionante minimo, un compito42,5 GBfl2va pruned + encoder nvfp4 + entrambi i VAEIl download realistico
Entrambi i checkpoint, minimo63,4 GBAggiungi ref2va prunedSe vuoi tutte e tre le modalità
Un compito in bf16 completo123,6 GBTutto in bf16Solo sistemi da ricerca

Dimensioni dei file lette direttamente dall'indice del repository Comfy-Org/MiniMax-H3, agosto 2026.

La stessa cifra raccontata da ComfyUI: "impronta di memoria totale ridotta del 66%, da 123,6 GB in piena precisione a 42,5 GB", che è ciò che "consente a un modello video 2K di nuova generazione di girare localmente su una GPU come la RTX 3060" (ComfyUI, agosto 2026). Prendi la cifra dei 12 GB come la loro affermazione con offloading dinamico, non come un benchmark. Non l'ho eseguito su una 3060, e l'offloading compra VRAM pagando con RAM di sistema e tempo di attesa.

Una cosa che "eseguilo localmente" significa in silenzio: 768px. Il canvas nativo di H3 è un lato corto da 768px, con limite a 768x1344, secondo il tutorial H3 di ComfyUI. La durata si aggancia a una griglia di 17 frame per blocco a 24fps. I clip 2K del marketing arrivano da H3-Regenerate-2K, un secondo passaggio che rimanda il risultato 768p più il contesto originale attraverso il modello. La scheda del modello è esplicita: il sistema completo è composto da tre moduli: H3-Context-IR, H3-Base e H3-Regenerate-2K. La ComfyUI locale ti dà H3-Base.

E la parola "open" qui fa tre lavori separati. Scaricabile, sì. Utilizzabile commercialmente, con condizioni. Eseguibile dove vivi, dipende da dove vivi. Il thread Reddit che definisce questo "in realtà un modello closed source" ha torto sul primo punto e indica qualcosa di reale sugli altri due. La Sezione 7 contiene il testo della clausola.

Pesi Open Source MiniMax H3 Locali vs API Hosted: Scegli la Tua Strada

Tutto ciò che sta sotto questa riga, l'intera demo in quattro passaggi, gira in una scheda del browser su Atlas Cloud, che serve tutti e tre gli endpoint H3 più il modello di immagini che ho usato per il frame base. Non è la stessa cosa che eseguire i pesi, e la differenza conta più del solito con questo modello.

Pesi localiAPI hosted
Costo inizialeDownload da 42,5 GB, una GPU da 12 GB+, un'installazione di ComfyUIUna chiave API
Tempo per il primo clipUna serata, ottimisticamenteCirca due minuti
Costo per clip da 5sTempo GPU ed elettricità$0,70 a $0,14/sec
Risoluzione nativa768px lato corto, 2K tramite un passaggio di rigenerazione2K diretto, è l'unico valore enum
Fine-tuning, LoRA, modifiche profondeSì, è il punto centraleNo
I dati non lasciano mai la tua reteNo
Esposizione alla licenzaAccetti la Community License e la sua clausola territorialeSei un cliente di un servizio hosted
Se sei in UE, Regno Unito, Corea o USASezione 7Non influenzato dalla licenza dei pesi

Regola pratica: sotto i 100 clip al mese, o se ti serve il 2K diretto, o se ti trovi in un Territorio Escluso, la soluzione hosted vince su ogni fronte. Sopra quella soglia, o se intendi fare training sul checkpoint, o se le riprese non possono uscire dal tuo edificio, i 42,5 GB valgono una serata.

Prezzi verificati dalle pagine live dei modelli, agosto 2026. Tutti gli endpoint H3 fatturano al secondo di output, senza sconti attivi.

ModelloCosa fa quiPrezzoSconto
MiniMax H3 image-to-videoPassaggio 2, il lavoro di fl2va$0,14 / sec in 2KNessuno
MiniMax H3 reference-to-videoPassaggio 3, il lavoro di ref2va$0,14 / sec in 2KNessuno
MiniMax H3 text-to-videoPassaggio 4, la baseline senza riferimento$0,14 / sec in 2KNessuno
GPT Image 2 text-to-imagePassaggio 1, il frame base$0,009 / immagine in listino; il run in alta qualità 16:9 che ho usato quota $0,1745Nessuno
Seedance 2.0 / Wan 2.7 / Kling v3.0 TurboPunti di riferimento al secondo$0,112 / $0,10 / $0,095 al secKling 15% di sconto

Un'incoerenza da conoscere prima di scrivere codice: il readme di H3 documenta ancora un livello 768p a $0,10/sec con durata di 5 o 10 secondi. Lo schema live non è d'accordo. resolution ha esattamente un valore ammesso, 2K, e duration accetta qualsiasi intero da 5 a 15. Scrivi in base allo schema. C'è un'elegante simmetria in questo divario: il livello 768p è disattivato sul lato hosted, e 768p è esattamente il canvas nativo che ottieni quando esegui i pesi da solo.

Passaggio 1: Genera il Frame Base con GPT Image 2

Tutto in questa demo parte da un singolo fermo immagine. La scena è volutamente esplicita: uno sviluppatore alle 3 di notte che guarda il download di un checkpoint da 21 GB.

Modello: openai/gpt-image-2/text-to-image. Impostazioni: qualità alta, ratio 16:9.

plaintext
1A photorealistic wide shot of a cluttered home office at 3 a.m., lit only by two monitors and the RGB glow from an open PC case on the desk. A tired developer in a gray hoodie sits slouched in a mesh chair, chin on hand, staring at the left monitor. The left monitor shows a dark terminal with a single visible download progress bar at about 78 percent. The right monitor shows a file browser. A cold half-full mug of coffee, a mechanical keyboard, and a small desk fan sit on the desk. Rain streaks the window behind him. Shallow depth of field, 35mm, warm monitor key light against cool blue window light, visible sensor grain. No text overlays, no watermarks.
2

Non chiedere al modello di immagini di renderizzare i veri nomi dei file safetensors. Le stringhe lunghe con underscore tornano come pasticcio. Tieni i nomi dei file nelle didascalie.

Screenshot dell'interfaccia del generatore text-to-image di Atlas Cloud con output

Playground di GPT Image 2 su Atlas Cloud con il prompt delle 3 di notte digitato e il frame base finito nel pannello di output

GPT Image 2 su Atlas Cloud: qualità alta, 16:9, frame base renderizzato a destra. Il livello ad alta qualità quota $0,1745 per questa esecuzione, ben sopra il minimo di listino di $0,009, quindi pianifica il budget in base al livello.

Uomo con felpa con cappuccio che guarda due monitor di computer di notte

Il frame base generato: uno sviluppatore stanco alle 3 di notte che guarda una barra di download sul monitor sinistro

L'output del Passaggio 1. Questo singolo frame alimenta i Passaggi 2 e 3.

Passaggio 2: Image to Video, il Compito del Checkpoint fl2va

Questo è l'endpoint che corrisponde a minimax_h3_fl2va_pruned_int8_convrot.safetensors. Un primo frame in ingresso, movimento e audio in uscita. Localmente è il file che carichi; hosted, è una singola chiamata API.

Modello: minimax/h3/image-to-video. Impostazioni: image = il frame del Passaggio 1 passato come data URL, resolution: 2K, duration: 5, ratio: 16:9.

plaintext
1The developer stays still, only breathing and blinking, eyes fixed on the left monitor. The progress bar on the left monitor creeps forward. The case fans spool up and their RGB glow pulses brighter. A moment before the end he exhales and his shoulders drop. Locked-off camera, no camera movement, no zoom, no cuts. Audio: a low case-fan whine that rises in pitch, faint rain against the window, one soft two-note completion chime near the end.
2

Passa l'immagine come data URL in base64 piuttosto che come URL di storage appena generato. Un URL oggetto nuovo di zecca può far fallire il controllo di download a monte. Nota anche che H3 rispetta davvero "locked-off camera", cosa non universalmente vera per i modelli video di questa classe.

Screenshot dell'interfaccia del generatore image-to-video MiniMax

Playground MiniMax H3 image-to-video su Atlas Cloud con il frame base caricato e un clip 2K completato nel pannello di output

MiniMax H3 image-to-video: frame base caricato, 2K, esecuzione completata. Questa cattura ha usato il default dell'endpoint di 8 secondi, ecco perché la quota mostra $1,12. Il clip incorporato qui sotto è la versione da 5 secondi a $0,70.

Uomo stanco in attesa di una barra di caricamento del computer di notte

Il lavoro di fl2va: un frame in ingresso, cinque secondi di movimento più il ronzio stereo della ventola in uscita.

Passaggio 3: Reference to Video, il Compito del Checkpoint ref2va

Checkpoint diverso, file diverso, compito diverso. ref2va non estende un primo frame. Prende materiale di riferimento e costruisce una nuova inquadratura che mantiene coerenti identità e oggetti. È per questo che il repository distribuisce due file da 21 GB invece di uno.

Gli ho dato due riferimenti: il frame del Passaggio 1 per la persona e la stanza, e una macro di una scheda grafica per l'hardware.

Modello: minimax/h3/reference-to-video. Impostazioni: refers = entrambe le immagini, resolution: 2K, duration: 8, ratio: 16:9.

plaintext
1Same man, same gray hoodie, same face, in the same dark home office. New shot: a medium close-up from the side as he leans back in the chair and lets out a long breath, the corner of his mouth lifting slightly. The graphics card in the second reference image is visible over his shoulder, its fans slowing down, RGB settling to a steady color. Keep his identity, hoodie, hair and the room's lighting consistent with the reference images. Locked-off camera. Audio: fan whine winding down, one keyboard keypress, rain continuing.
2

refers accetta un array misto di immagini, video e audio, con almeno un'immagine o un video. Il solo audio viene rifiutato. Questo endpoint accetta anche durate fino a 15 secondi.

Una trappola specifica di questo endpoint: imposta ratio esplicitamente. Lasciarlo su adaptive ha restituito 400 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive', quattro volte di fila, anche dal playground con entrambi i riferimenti chiaramente allegati. Con ratio: "16:9" nella chiamata API è andato al primo colpo. È anche per questo che lo screenshot qui sotto è l'immagine di riferimento piuttosto che una cattura del playground: non sono riuscito a togliere il controllo Aspect Ratio del playground da adaptive, quindi il clip che vedi qui è arrivato dall'API con le impostazioni sopra, non da un'esecuzione nel playground.

Una scheda grafica a tre ventole montata verticalmente dentro un case del computer

La seconda immagine di riferimento: una macro di una scheda grafica a tre ventole dentro un case PC aperto di notte

Immagine di riferimento 2, generata nello stesso batch del frame base, passata insieme al frame del Passaggio 1.

Uomo che digita a una scrivania con doppio monitor di notte

Il lavoro di ref2va: una nuova ripresa piuttosto che una continuazione. Stesso uomo, stessa felpa, stessa stanza, e la scheda grafica dal riferimento 2 ora inquadrata con le ventole che rallentano. Nota che ha interpretato "primo piano medio" in modo approssimativo ed è rimasta abbastanza larga.

Passaggio 4: Text to Video, la Baseline dei Pesi Open Source MiniMax H3

La stessa scena, descritta a parole, senza alcun riferimento. Questo passaggio esiste per mostrarti ciò a cui servono davvero i due checkpoint.

Modello: minimax/h3/text-to-video. Impostazioni: ratio è obbligatorio qui e non può essere adaptive, quindi 16:9. resolution: 2K, duration: 5.

plaintext
1A tired developer in a gray hoodie at 3 a.m. in a cluttered home office, lit by two monitors and the RGB glow of an open PC case, watching a download progress bar crawl across the left screen. Rain on the window behind him. Locked-off 35mm shot, shallow depth of field, warm monitor light against cool window light, film grain. Audio: rising case-fan whine, faint rain, a soft completion chime at the end.
2

Interfaccia AI text-to-video che mostra il prompt e l'output video generato

Playground MiniMax H3 text-to-video su Atlas Cloud con il prompt digitato e un clip completato nel pannello di output

MiniMax H3 text-to-video: nessun materiale di riferimento, 2K, Aspect Ratio impostato su 16:9 perché adaptive viene rifiutato qui, esecuzione completata. Stesso prompt, e già un volto diverso da quello del Passaggio 2.

Uomo con felpa grigia che guarda uno schermo di computer di notte

Stesse parole, persona diversa. Bella stanza, ragazzo sbagliato. Quel divario è l'intero argomento a favore dell'esistenza di fl2va e ref2va come checkpoint separati.

Una nota operativa se automatizzi tutti e tre: la concorrenza a monte è di circa un compito alla volta. I lavori sovrapposti restituiscono 429 rate limit exceeded (task concurrency). Eseguiteli in serie. Un clip 2K da 5 secondi ha impiegato circa due minuti ogni volta.

Quanto Costano i Pesi Open Source MiniMax H3 e Cosa Dice Davvero la Licenza

La questione dei costi ha due valute. Hosted, un clip 2K da 5 secondi costa $0,70 e uno da 15 secondi costa $2,10, al secondo, senza fasce, senza sconti. Localmente, la valuta sono gigabyte e ore: 42,5 GB da scaricare, una scheda che possa contenerli, e un canvas 768p a meno che tu non esegua anche il passaggio di rigenerazione. Oltre qualche centinaio di clip al mese l'aritmetica si capovolge. Sotto quella soglia, nella maggior parte dei casi, no.

Poi c'è la terza valuta, che è il tempo di revisione legale. Ho letto l'intero LICENSE. Ecco cosa contiene.

Un laptop aperto e una pila di fogli illuminati da una lampada da scrivania

Una lampada da scrivania che illumina un laptop con un documento di testo fitto, accanto a una stampa evidenziata, occhiali da lettura e un bicchiere d'acqua

La parte di una release open weights che nessuno cattura per il thread di lancio.

ClausolaSezioneCosa diceCosa significa per te
Territorio ApplicabileI.3, I.5In tutto il mondo, "esclusi i Territori Esclusi," definiti come "l'Unione Europea, il Regno Unito, la Repubblica di Corea e gli Stati Uniti d'America"La community license non ti concede diritti dove vive la maggior parte dei lettori di questo articolo
Divieto di uso territorialeV.4Non puoi "usare, riprodurre, modificare, distribuire o mostrare le MiniMax H3 Works o qualsiasi loro Output o risultato al di fuori del Territorio Applicabile"Raggiunge gli Output, non solo i pesi
Canale di licenza separatoIIMiniMax "valuterà continuamente le leggi applicabili" e invita le parti nelle regioni escluse a contattarle per una licenzaÈ "non ancora," non "mai." Il repo include un modulo di domanda
AttribuzioneIV.2Devi "mostrare in modo prominente 'MiniMax H3' nell'interfaccia utente" di qualsiasi prodotto commerciale che lo usaUna modifica all'interfaccia, non una nota a piè di pagina
Soglia di ricaviIV.1Oltre i 20 milioni di dollari di ricavi annuali serve un'autorizzazione scritta preventiva da [email protected]L'uso commerciale gratuito ha un tetto
Nessun riciclo di modelloV.3Non puoi usare H3 o i suoi Output "per migliorare qualsiasi altro modello di intelligenza artificiale"Esclude la distillazione nel tuo modello
RidistribuzioneIII.1, III.4Distribuisci l'accordo insieme, includi un file NOTICE, segna i file modificatiStandard, ma vincola anche gli utenti a valle
Text encoderNota aggiuntivaL'encoder è Qwen3-VL-32B sotto Apache 2.0Un componente dello stack è davvero OSI-open
Legge applicabileIXLegge della RAS di Hong Kong, giurisdizione esclusiva di Hong KongMerita una riga nel tuo registro dei rischi

La data di efficacia dell'accordo è il 2 agosto 2026 (Hugging Face, agosto 2026).

La maggior parte della copertura al lancio ha aperto con "open weights" e si è fermata lì. A credito di MiniMax, non l'hanno nascosto: il repo contiene il suo docs/QA-about-License.md che spiega come i modelli video affrontino un quadro normativo in evoluzione più rapida rispetto ai modelli di testo, citando l'EU AI Act, le regole del Regno Unito e della Corea, e le cause sul copyright negli Stati Uniti relative al video generativo, e dichiarando chiaramente che "la limitazione attuale significa 'non ancora', non 'mai'". Lo stesso documento conferma la divisione che conta a livello operativo: l'API resta disponibile globalmente perché MiniMax controlla l'infrastruttura di servizio, mentre i pesi open lasciano quel controllo alle spalle.

Quindi se sei a San Francisco, Berlino, Londra o Seul, la lettura pratica non è "non potrai mai toccare H3". È "questa particolare licenza non è lo strumento che ti permette di eseguire questi pesi sulla tua macchina". Fai domanda per la licenza separata, o usa un endpoint hosted, dove sei cliente di un servizio piuttosto che licenziatario dei pesi.

Non sono un avvocato e questo non è un parere legale. Il testo delle clausole sopra è citato così il tuo consulente legale può andare a leggere l'originale in circa dieci minuti.

Pesi Open Source MiniMax H3: Domande Frequenti

I pesi open source MiniMax H3 sono davvero disponibili, e dove li scarico?

Sì, dall'inizio di agosto 2026. Due posti. MiniMaxAI/MiniMax-H3 è il repository ufficiale, circa 498 GB, che contiene la pipeline in formato diffusers, entrambi i transformer, il text encoder, entrambi i VAE, documentazione e script riproducibili. Comfy-Org/MiniMax-H3 è la build ricompattata per ComfyUI, circa 343 GB in totale, con i checkpoint quantizzati a file singolo che la maggior parte delle persone vuole davvero. Se usi ComfyUI, usa il secondo e scarica quattro file.

Quanti parametri ha MiniMax H3, e mi serve un supercomputer?

33B, in un Transformer denso a flusso singolo. Circa 13B di questi risiedono nei rami correlati ad AdaLN le cui uscite possono essere precalcolate e memorizzate nella cache, quindi i deployment di sola inferenza non devono caricarli. Questo sono i checkpoint "pruned". Niente supercomputer. Un download da 42,5 GB e una GPU consumer seria.

Posso eseguire i pesi open source MiniMax H3 su 12 GB o 16 GB di VRAM?

Il team di ComfyUI dice che una scheda da 12 GB può farcela con offloading dinamico, usando il checkpoint fl2va pruned int8 più il text encoder nvfp4 AWQ. Questa è la loro affermazione, non un benchmark che ho eseguito io. Due avvertenze: l'offloading scambia VRAM con RAM di sistema, quindi metti in conto 64 GB di RAM e aspettati tempi di rendering lunghi, e il tuo canvas locale è 768px sul lato corto, non 2K.

I pesi open source MiniMax H3 sono davvero open source, o solo open weights?

Open weights, per l'esattezza. I pesi sono scaricabili e modificabili, il che è più di quanto qualsiasi modello video frontier offrisse un anno fa. Ma la licenza non è approvata OSI, la ricetta di training e i dati non sono pubblicati, l'uso commerciale comporta condizioni di attribuzione e ricavi, e la clausola territoriale limita dove si applica la concessione. L'unico componente davvero open è l'encoder Qwen3-VL-32B sotto Apache 2.0. Tre strati separati, e "open" descrive in modo pulito solo il primo.

Posso usare commercialmente i pesi open source MiniMax H3, e cosa significa la soglia dei 20 milioni di dollari?

Sì, con due condizioni. Devi mostrare in modo prominente "MiniMax H3" nell'interfaccia utente del prodotto commerciale (Sezione IV.2). E se i tuoi prodotti e servizi commerciali generano più di 20 milioni di dollari di ricavi annuali, ti serve un'autorizzazione scritta preventiva separata da MiniMax prima di usarlo, richiedibile a [email protected] (Sezione IV.1). La soglia è sui tuoi ricavi, non sul tuo utilizzo di H3.

Perché la licenza MiniMax H3 esclude USA e UE, e quali sono le mie opzioni?

Secondo le FAQ sulla licenza di MiniMax, perché la generazione video si trova in un ambiente normativo in evoluzione più rapida rispetto al testo, in particolare l'EU AI Act, le regole in evoluzione del Regno Unito e della Corea del Sud, e le cause sul copyright negli Stati Uniti relative al video generativo. Una volta che i pesi sono pubblici, non possono imporre garanzie a valle, quindi hanno limitato la concessione invece di ritardare la release. Opzioni in una regione esclusa: fare domanda per una licenza separata tramite il modulo nel repository, o usare un'API hosted, che è un rapporto giuridico diverso e resta disponibile globalmente. Fatti confermare dal tuo consulente legale quale si adatta prima di fare deploy.


Verificato il 3 agosto 2026. Tre cose nella lista dei follow-up: GGUF della community e quantizzazioni a bit più bassi (per H3 non ne esistono ancora), qualsiasi modifica all'elenco dei Territori Esclusi, e se il livello hosted 768p che il readme documenta ancora tornerà mai.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli