
Ein Schreibtisch um 3 Uhr morgens mit offenem PC-Gehäuse, einer externen Festplatte und einem Monitor, der einen großen Download-Vorgang anzeigt.
Die Gewichte sind draußen. Also lassen Sie mich die beiden Fragen beantworten, die unter MiniMax' Ankündigungspost die meisten Antworten bekamen, bevor wir weitermachen.
Nein, Sie brauchen keinen Supercomputer. Wählen Sie die richtigen Dateien aus, und der Download beträgt 42,5 GB, nicht 123,6 GB. Das Modell hat 33B Parameter, und etwa 13B davon sitzen in AdaLN-Modulationszweigen, die für die Inferenz gar nicht geladen werden müssen.
Dann öffnete ich die LICENSE-Datei. Zeile 10, bevor ich überhaupt zur 20-Millionen-Dollar-Klausel kam, ist eine Liste von Ländern. Mein Land steht darauf. Ihres wahrscheinlich auch.
Wichtige Erkenntnisse
- Die MiniMax H3 Open-Source-Gewichte sind live auf Hugging Face als
MiniMaxAI/MiniMax-H3, plus ein für ComfyUI neu verpackter Mirror unterComfy-Org/MiniMax-H3. ComfyUI hat am selben Tag native Unterstützung ausgeliefert. - Es ist nicht eine Datei. Es gibt zwei aufgabenspezifische Checkpoints,
fl2va(text- und bildgesteuert) undref2va(referenzgesteuert), jeweils 21 GB in ihrer kleinsten Form. Sie laden nur den herunter, den Ihre Aufgabe braucht. - 33B dichter Single-Stream-Transformer. Die kleinste funktionierende Kombination ist 42,5 GB, 66 % weniger als 123,6 GB in voller Präzision. ComfyUI sagt, eine 12-GB-Karte mit Auslagerung könne es ausführen.
- Lokale Generierung ist nativ 768px an der kurzen Kante, nicht 2K. 2K kommt von einem zweiten In-Context-Regenerationsdurchlauf.
- Kommerzielle Nutzung ist kostenlos, aber Sie müssen "MiniMax H3" in Ihrer Benutzeroberfläche anzeigen, und bei einem Jahresumsatz über 20 Mio. $ benötigen Sie eine separate schriftliche Genehmigung. Und das anwendbare Hoheitsgebiet der Lizenz schließt die EU, das Vereinigte Königreich, Südkorea und die USA aus. Eine gehostete API ist eine andere rechtliche Beziehung.
Eine Person, beide Checkpoints, eine 3 Uhr morgens. Linke Seite zeigt, was fl2va macht. Rechte Seite zeigt, was ref2va macht. Dieselbe Person, derselbe Raum, dieselbe Nacht, zwei völlig unterschiedliche Aufgaben, und das Lüftergeräusch, das Sie hören, wird im selben Durchlauf wie das Bild generiert.

Links: Bild-zu-Video, die Aufgabe des fl2va -Checkpoints. Rechts: Referenz-zu-Video, die Aufgabe von ref2va . Beide mit MiniMax H3 und nativem Stereo-Audio gerendert. Schalten Sie den Ton ein.
Das erste, was ich dieses Modell generieren ließ, war ein Mensch, der darauf wartet, dass dieses Modell fertig heruntergeladen wird. Das fühlte sich richtig an.
MiniMax H3 Open-Source-Gewichte, gewogen: Zwei Checkpoints und eine 42,5-GB-Untergrenze
Hier ist der Grund, warum diese Veröffentlichung so viel Aufsehen erregte. Artificial Analysis setzte H3 auf Platz 1 bei der Videobearbeitung und unter die Top Drei sowohl bei Text-zu-Video als auch Bild-zu-Video und sagte, die Veröffentlichung der Gewichte "würde es mit Abstand zum führenden Open-Weights-Modell machen" (Artificial Analysis, Juli 2026). Das ist ein Video-Modell auf Spitzenniveau mit einem Download-Button.
Die ehrliche andere Hälfte: Derselbe Benchmark-Lauf zeigt H3 hinter Googles Gemini Omni Flash bei Text-zu-Video und sowohl hinter Seedance 2.0 als auch Gemini Omni Flash bei Bild-zu-Video (South China Morning Post, Juli 2026). Es ist Platz 1 bei der Bearbeitung, nicht bei allem.
Jetzt der Teil, den fast niemand überprüft hat, bevor er git clone ausgeführt hat.
Die Parameteranzahl, die in keiner Schlagzeile stand. Die Modellkarte beschreibt H3-Omni-Transformer als "einen 33B-Parameter-dichten Single-Stream-Transformer, mit etwa 13B Parametern in AdaLN-bezogenen Zweigen", und fügt hinzu, dass diese Modulationsausgaben vorberechnet und zwischengespeichert werden können, "diese Parameter für Inferenz-Only-Deployment nicht geladen werden müssen". Daher kommen die bereinigten Checkpoints. Etwa 40 % des Modells werden zu einer Nachschlagetabelle, wenn Sie nur Inferenz durchführen.
Wo die meisten Leute 80 GB für nichts verschwenden. Das offizielle MiniMaxAI/MiniMax-H3-Repo ist 498 GB, wenn Sie alles herunterladen. Der ComfyUI-Mirror ist 343 GB. Beide enthalten jede Präzisionsvariante beider Checkpoints. Sie brauchen vier Dateien, nicht vierhundert.
| Datei | Größe | Was es ist | Wofür Sie es brauchen |
|---|---|---|---|
| minimax_h3_fl2va_pruned_int8_convrot.safetensors | 20,97 GB | fl2va-Checkpoint, bereinigt + int8 | Text-zu-Video, Bild-zu-Video |
| minimax_h3_fl2va_int8_convrot.safetensors | 34,04 GB | fl2va, int8, unbereinigt | Gleiches, höhere Wiedergabetreue |
| minimax_h3_fl2va_bf16.safetensors | 66,28 GB | fl2va, volle Präzision | Feintuning, Forschung |
| minimax_h3_ref2va_pruned_int8_convrot.safetensors | 20,97 GB | ref2va-Checkpoint, bereinigt + int8 | Nur Referenz-zu-Video |
| minimax_h3_ref2va_int8_convrot.safetensors | 34,04 GB | ref2va, int8, unbereinigt | Gleiches, höhere Wiedergabetreue |
| minimax_h3_ref2va_bf16.safetensors | 66,28 GB | ref2va, volle Präzision | Feintuning, Forschung |
| qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 15,69 GB | Text-Encoder, 4-Bit AWQ | Jeder Workflow |
| qwen3vl_32b_minimax_h3_int8_convrot.safetensors | 27,14 GB | Text-Encoder, int8 | Jeder Workflow |
| qwen3vl_32b_minimax_h3_bf16.safetensors | 51,51 GB | Text-Encoder, volle Präzision | Jeder Workflow |
| minimax_h3_video_vae_fp16.safetensors | 5,21 GB | Video-VAE | Jeder Workflow |
| minimax_h3_audio_vae_fp32.safetensors | 0,61 GB | Audio-VAE | Jeder Workflow (das ist der Ton) |
| Kleinster funktionierender Satz, eine Aufgabe | 42,5 GB | bereinigtes fl2va + nvfp4-Encoder + beide VAEs | Der realistische Download |
| Beide Checkpoints, kleinster | 63,4 GB | plus bereinigtes ref2va | Wenn Sie alle drei Modi wollen |
| Eine Aufgabe in voller bf16 | 123,6 GB | bf16 alles | Nur für Forschungs-Rigs |
Dateigrößen direkt aus dem Comfy-Org/MiniMax-H3 -Repository-Index, August 2026.
ComfyUIs eigene Darstellung derselben Zahl: "Gesamter Speicherbedarf um 66 % reduziert, von 123,6 GB in voller Präzision auf 42,5 GB", was "es einem Video-Modell der nächsten Generation mit 2K ermöglicht, lokal auf einer GPU wie der RTX 3060 zu laufen" (ComfyUI, August 2026). Nehmen Sie die 12-GB-Angabe als ihre Behauptung mit dynamischer Auslagerung, nicht als Benchmark. Ich habe es nicht auf einer 3060 ausgeführt, und Auslagerung erkauft VRAM mit System-RAM und Wanduhrzeit.
Eine Sache, die "lokal ausführen" leise bedeutet: 768px. H3s native Leinwand ist eine 768px kurze Kante, begrenzt auf 768x1344, laut ComfyUIs H3-Tutorial. Die Dauer rastet auf ein 17-Frames-pro-Block-Raster bei 24fps ein. Die 2K-Clips im Marketing stammen von H3-Regenerate-2K, einem zweiten Durchlauf, der das 768p-Ergebnis plus den ursprünglichen Kontext durch das Modell zurückführt. Die Modellkarte sagt explizit, dass das vollständige System aus drei Modulen besteht: H3-Context-IR, H3-Base und H3-Regenerate-2K. Lokales ComfyUI gibt Ihnen H3-Base.
Und das Wort "offen" erfüllt hier drei separate Aufgaben. Herunterladbar, ja. Kommerziell nutzbar, unter Bedingungen. Ausführbar dort, wo Sie leben, das hängt davon ab, wo Sie leben. Der Reddit-Thread, der dies "eigentlich ein Closed-Source-Modell" nennt, liegt beim ersten Punkt falsch und weist auf etwas Reales bei den anderen beiden hin. Abschnitt 7 enthält den Klauseltext.
Lokale MiniMax H3 Open-Source-Gewichte vs. eine gehostete API: Wählen Sie Ihren Weg
Alles unterhalb dieser Zeile, die gesamte vier-Schritte-Demo, läuft in einem Browsertab auf Atlas Cloud, das alle drei H3-Endpunkte plus das Bildmodell, das ich für das Basisbild verwendet habe, bereitstellt. Das ist nicht dasselbe wie das Ausführen der Gewichte, und der Unterschied ist bei diesem Modell wichtiger als sonst.
| Lokale Gewichte | Gehostete API | |
|---|---|---|
| Anschaffungskosten | 42,5 GB Download, eine 12 GB+ GPU, eine ComfyUI-Installation | Ein API-Key |
| Zeit bis zum ersten Clip | Ein Abend, optimistisch | Etwa zwei Minuten |
| Kosten pro 5s-Clip | GPU-Zeit und Strom | 0,70 $ bei 0,14 $/Sek. |
| Native Auflösung | 768px kurze Kante, 2K über einen Regenerationsdurchlauf | 2K direkt, es ist der einzige Enum-Wert |
| Feintuning, LoRA, Surgery | Ja, das ist der ganze Punkt | Nein |
| Daten verlassen nie Ihr Netzwerk | Ja | Nein |
| Lizenzexposition | Sie akzeptieren die Community License und ihre Gebietsklausel | Sie sind Kunde eines gehosteten Dienstes |
| Wenn Sie in der EU, UK, Korea oder den USA sind | Abschnitt 7 | Nicht von der Gewichtelizenz betroffen |
Faustregel: Unter etwa 100 Clips pro Monat, oder wenn Sie 2K direkt benötigen, oder wenn Sie in einem ausgeschlossenen Gebiet sitzen, gewinnt das Hosting auf allen Achsen. Darüber hinaus, oder wenn Sie beabsichtigen, auf dem Checkpoint zu trainieren, oder wenn das Filmmaterial Ihr Gebäude nicht verlassen darf, sind die 42,5 GB den Abend wert.
Preise von den Live-Modellseiten, August 2026, verifiziert. Alle H3-Endpunkte werden pro Sekunde Ausgabe abgerechnet, ohne aktiven Rabatt.
| Modell | Was es hier tut | Preis | Rabatt |
|---|---|---|---|
| MiniMax H3 image-to-video | Schritt 2, die fl2va-Aufgabe | 0,14 $ / Sek. bei 2K | Keiner |
| MiniMax H3 reference-to-video | Schritt 3, die ref2va-Aufgabe | 0,14 $ / Sek. bei 2K | Keiner |
| MiniMax H3 text-to-video | Schritt 4, die referenzlose Baseline | 0,14 $ / Sek. bei 2K | Keiner |
| GPT Image 2 text-to-image | Schritt 1, das Basisbild | 0,009 $ / Bild gelistet; der von mir verwendete High-Quality-16:9-Lauf kostet 0,1745 $ | Keiner |
| Seedance 2.0 / Wan 2.7 / Kling v3.0 Turbo | Referenzpunkte pro Sekunde | 0,112 $ / 0,10 $ / 0,095 $ pro Sek. | Kling 15% Rabatt |
Eine Inkonsistenz, die Sie kennen sollten, bevor Sie Code dagegen schreiben: Die H3-Readme dokumentiert immer noch eine 768p-Stufe zu 0,10 $/Sek. und eine Dauer von 5 oder 10 Sekunden. Das Live-Schema widerspricht dem. resolution hat genau einen erlaubten Wert, 2K, und duration akzeptiert jede ganze Zahl von 5 bis 15. Schreiben Sie gegen das Schema. Es gibt eine nette Symmetrie in dieser Lücke: Die 768p-Stufe ist auf der gehosteten Seite abgeschaltet, und 768p ist genau die native Leinwand, die Sie erhalten, wenn Sie die Gewichte selbst ausführen.
Schritt 1: Generieren Sie das Basisbild mit GPT Image 2
Alles in dieser Demo beginnt mit einem einzigen Standbild. Die Szene ist bewusst auf den Punkt gebracht: Ein Entwickler um 3 Uhr morgens, der einen 21-GB-Checkpoint-Download beobachtet.
Modell: openai/gpt-image-2/text-to-image. Einstellungen: Qualität high, Verhältnis 16:9.
plaintext1Eine fotorealistische Weitwinkelaufnahme eines unordentlichen Home-Office um 3 Uhr morgens, nur beleuchtet von zwei Monitoren und dem RGB-Glühen eines offenen PC-Gehäuses auf dem Schreibtisch. Ein müder Entwickler in einem grauen Hoodie sitzt zusammengesunken in einem Netzstuhl, das Kinn in der Hand, und starrt auf den linken Monitor. Der linke Monitor zeigt ein dunkles Terminal mit einem einzigen sichtbaren Download-Fortschrittsbalken bei etwa 78 Prozent. Der rechte Monitor zeigt einen Dateibrowser. Eine kalte, halbvolle Tasse Kaffee, eine mechanische Tastatur und ein kleiner Tischventilator stehen auf dem Schreibtisch. Regen läuft an dem Fenster hinter ihm herunter. Geringe Schärfentiefe, 35mm, warmes Monitor-Schlüssellicht gegen kühles blaues Fensterlicht, sichtbares Filmkorn. Keine Texteinblendungen, keine Wasserzeichen. 2
Bitten Sie das Bildmodell nicht, die tatsächlichen Safetensors-Dateinamen darzustellen. Lange unterstrichene Zeichenfolgen kommen als Matsch zurück. Behalten Sie Dateinamen in Ihren Bildunterschriften.

GPT Image 2 Playground auf Atlas Cloud mit dem 3-Uhr-morgens-Prompt und dem fertigen Basisbild im Ausgabepanel
GPT Image 2 auf Atlas Cloud: Qualität high, 16:9, das Basisbild rechts gerendert. Die High-Quality-Stufe kostet für diesen Lauf 0,1745 $, weit über dem gelisteten Mindestpreis von 0,009 $, also budgetieren Sie nach Stufe.

Das generierte Basisbild: Ein müder Entwickler um 3 Uhr morgens, der einen Download-Balken auf dem linken Monitor beobachtet
Die Ausgabe von Schritt 1. Dieses einzelne Bild speist die Schritte 2 und 3.
Schritt 2: Bild zu Video, die Aufgabe, die der fl2va-Checkpoint erledigt
Dies ist der Endpunkt, der minimax_h3_fl2va_pruned_int8_convrot.safetensors entspricht. Ein erstes Bild hinein, Bewegung und Ton heraus. Lokal wäre dies die Datei, die Sie laden würden; gehostet ist es ein API-Aufruf.
Modell: minimax/h3/image-to-video. Einstellungen: image = das Bild von Schritt 1, übergeben als Data-URL, resolution: 2K, duration: 5, ratio: 16:9.
plaintext1Der Entwickler bleibt still, atmet und blinzelt nur, die Augen auf den linken Monitor gerichtet. Der Fortschrittsbalken auf dem linken Monitor kriecht vorwärts. Die Gehäuselüfter laufen hoch und ihr RGB-Glühen pulsiert heller. Einen Moment vor dem Ende atmet er aus und seine Schultern sinken. Fixierte Kamera, keine Kamerabewegung, kein Zoom, keine Schnitte. Audio: Ein tiefes Gehäuselüftergeräusch, das in der Tonhöhe ansteigt, leiser Regen am Fenster, ein sanfter Zweiton-Abschlusston gegen Ende. 2
Übergeben Sie das Bild als Base64-Data-URL, nicht als eine frisch generierte Storage-URL. Eine brandneue Objekt-URL kann den vorgeschalteten Download-Check fehlschlagen lassen. Beachten Sie auch, dass H3 "fixierte Kamera" tatsächlich befolgt, was nicht bei allen Video-Modellen dieser Klasse universell wahr ist.

MiniMax H3 image-to-video Playground auf Atlas Cloud mit geladenem Basisbild und einem fertigen 2K-Clip im Ausgabepanel
MiniMax H3 image-to-video: Basisbild geladen, 2K, Lauf abgeschlossen. Diese Aufnahme verwendete die Standardeinstellung des Endpunkts von 8 Sekunden, weshalb der Preis bei 1,12 $ liegt. Mein eingebetteter Clip unten ist die 5-Sekunden-Version zu 0,70 $.

Die fl2va -Aufgabe: Ein Bild hinein, fünf Sekunden Bewegung plus Stereo-Lüftergeräusch heraus.
Schritt 3: Referenz zu Video, die Aufgabe, die der ref2va-Checkpoint erledigt
Anderer Checkpoint, andere Datei, andere Aufgabe. ref2va erweitert kein erstes Bild. Es nimmt Referenzmaterial und baut eine neue Einstellung auf, die die Identität und die Objekte konsistent hält. Deshalb liefert das Repository zwei 21-GB-Dateien statt einer.
Ich gab ihm zwei Referenzen: das Bild von Schritt 1 für die Person und den Raum, und eine Makroaufnahme einer Grafikkarte für die Hardware.
Modell: minimax/h3/reference-to-video. Einstellungen: refers = beide Bilder, resolution: 2K, duration: 8, ratio: 16:9.
plaintext1Derselbe Mann, derselbe graue Hoodie, dasselbe Gesicht, im selben dunklen Home-Office. Neue Einstellung: Eine mittlere Nahaufnahme von der Seite, während er sich im Stuhl zurücklehnt und tief ausatmet, der Mundwinkel sich leicht hebt. Die Grafikkarte aus dem zweiten Referenzbild ist über seiner Schulter sichtbar, ihre Lüfter werden langsamer, das RGB beruhigt sich auf eine gleichmäßige Farbe. Behalten Sie seine Identität, Hoodie, Haare und die Raumbeleuchtung konsistent zu den Referenzbildern. Fixierte Kamera. Audio: Herunterlaufendes Lüftergeräusch, ein einzelner Tastendruck, Regen geht weiter. 2
refers akzeptiert ein gemischtes Array aus Bildern, Videos und Audio, mindestens ein Bild oder Video. Audio allein wird abgelehnt. Dieser Endpunkt akzeptiert auch Dauern bis zu 15 Sekunden.
Eine Falle speziell bei diesem Endpunkt: Setzen Sie ratio explizit. Das Belassen auf adaptive kam viermal hintereinander als 400 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive' zurück, auch vom Playground mit beiden klar angehängten Referenzen. Mit ratio: "16:9" im API-Aufruf lief es beim ersten Mal. Das ist auch der Grund, warum der Screenshot unten das Referenzbild und keine Playground-Aufnahme zeigt: Ich konnte das Seitenverhältnis-Steuerelement des Playgrounds nicht von adaptive wegbekommen, also stammt der Clip, den Sie hier sehen, von der API mit den obigen Einstellungen, nicht von einem Playground-Lauf.

Das zweite Referenzbild: Eine Makroaufnahme einer Dreifach-Lüfter-Grafikkarte in einem offenen PC-Gehäuse bei Nacht
Referenzbild 2, im selben Batch wie das Basisbild generiert, zusammen mit dem Bild von Schritt 1 übergeben.

Die ref2va -Aufgabe: Eine neue Einstellung, keine Fortsetzung. Derselbe Mann, derselbe Hoodie, derselbe Raum, und die Grafikkarte aus Referenz 2 jetzt im Bild, mit herunterlaufenden Lüftern. Beachten Sie, dass es "mittlere Nahaufnahme" locker interpretiert hat und ziemlich weit geblieben ist.
Schritt 4: Text zu Video, die MiniMax H3 Open-Source-Gewichte Baseline
Dieselbe Szene, in Worten beschrieben, überhaupt keine Referenz. Dieser Schritt existiert, um Ihnen zu zeigen, wofür die beiden Checkpoints eigentlich sind.
Modell: minimax/h3/text-to-video. Einstellungen: ratio ist erforderlich hier und kann nicht adaptive sein, also 16:9. resolution: 2K, duration: 5.
plaintext1Ein müder Entwickler in einem grauen Hoodie um 3 Uhr morgens in einem unordentlichen Home-Office, beleuchtet von zwei Monitoren und dem RGB-Glühen eines offenen PC-Gehäuses, der einen Download-Fortschrittsbalken über den linken Bildschirm kriechen sieht. Regen am Fenster hinter ihm. Fixierte 35mm-Aufnahme, geringe Schärfentiefe, warmes Monitorlicht gegen kühles Fensterlicht, Filmkorn. Audio: Ansteigendes Gehäuselüftergeräusch, leichter Regen, ein sanfter Abschlusston am Ende. 2

MiniMax H3 text-to-video Playground auf Atlas Cloud mit eingegebenem Prompt und einem fertigen Clip im Ausgabepanel
MiniMax H3 text-to-video: Kein Referenzmaterial, 2K, Seitenverhältnis auf 16:9 gesetzt, da adaptive hier abgelehnt wird, Lauf abgeschlossen. Derselbe Prompt, und bereits ein anderes Gesicht als das in Schritt 2.

Gleiche Worte, anderer Mensch. Netter Raum, falscher Typ. Diese Lücke ist das gesamte Argument dafür, dass fl2va und ref2va als separate Checkpoints existieren.
Ein operativer Hinweis, falls Sie alle drei scripten: Die vorgelagerte Parallelität beträgt ungefähr eine Aufgabe. Sich überschneidende Jobs kommen zurück als 429 rate limit exceeded (task concurrency). Führen Sie sie seriell aus. Ein 5-Sekunden-2K-Clip dauerte jedes Mal etwa zwei Minuten.
Was MiniMax H3 Open-Source-Gewichte kosten und was die Lizenz tatsächlich sagt
Die Kostenfrage hat zwei Währungen. Gehostet kostet ein 5-Sekunden-2K-Clip 0,70 $ und ein 15-Sekunden-Clip 2,10 $, pro Sekunde, keine Stufen, kein Rabatt. Lokal ist die Währung Gigabyte und Stunden: 42,5 GB durch die Leitung, eine Karte, die es halten kann, und eine 768p-Leinwand, es sei denn, Sie führen auch den Regenerationsdurchlauf aus. Irgendwo oberhalb von ein paar hundert Clips pro Monat dreht sich die Arithmetik. Darunter tut sie das meistens nicht.
Dann gibt es die dritte Währung, die Zeit für die rechtliche Prüfung. Ich habe die gesamte LICENSE gelesen. Hier ist, was drin steht.

Eine Schreibtischlampe beleuchtet einen Laptop, der ein dichtes Textdokument zeigt, neben einem markierten Ausdruck, einer Lesebrille und einem Glas Wasser.
Der Teil einer Open-Weights-Veröffentlichung, den niemand für den Launch-Thread screenshotet.
| Klausel | Abschnitt | Was sie sagt | Was sie für Sie bedeutet |
|---|---|---|---|
| Anwendbares Hoheitsgebiet | I.3, I.5 | Weltweit, "mit Ausnahme der ausgeschlossenen Hoheitsgebiete", definiert als "die Europäische Union, das Vereinigte Königreich, die Republik Korea und die Vereinigten Staaten von Amerika" | Die Community-Lizenz gewährt Ihnen keine Rechte dort, wo die meisten Leser dieses Artikels leben |
| Territoriales Nutzungsverbot | V.4 | Sie dürfen "die MiniMax H3 Works oder deren Outputs oder Ergebnisse außerhalb des anwendbaren Hoheitsgebiets nicht nutzen, reproduzieren, modifizieren, verbreiten oder anzeigen" | Es betrifft die Outputs, nicht nur die Gewichte |
| Separater Lizenzierungskanal | II | MiniMax wird "die anwendbaren Gesetze kontinuierlich bewerten" und lädt Parteien in ausgeschlossenen Regionen ein, sie für eine Lizenz zu kontaktieren | Es ist "noch nicht", nicht "nie". Das Repo enthält ein Antragsformular |
| Namensnennung | IV.2 | Sie müssen "MiniMax H3 prominent auf der Benutzeroberfläche" jedes kommerziellen Produkts anzeigen, das es verwendet | Eine UI-Änderung, keine Fußnote |
| Umsatzschwelle | IV.1 | Bei einem Jahresumsatz von über 20 Millionen Dollar benötigen Sie vorherige schriftliche Genehmigung von [email protected] | Kostenlose kommerzielle Nutzung hat eine Obergrenze |
| Kein Modell-Laundering | V.3 | Sie dürfen H3 oder seine Outputs nicht verwenden, "um ein anderes KI-Modell zu verbessern" | Schließt Destillation in Ihr eigenes Modell aus |
| Weiterverteilung | III.1, III.4 | Liefern Sie die Vereinbarung mit, fügen Sie eine NOTICE-Datei bei, markieren Sie geänderte Dateien | Standard, bindet aber auch nachgelagerte Nutzer |
| Text-Encoder | Zusätzlicher Hinweis | Der Encoder ist Qwen3-VL-32B unter Apache 2.0 | Eine Komponente des Stapels ist wirklich OSI-offen |
| Geltendes Recht | IX | Recht der Sonderverwaltungszone Hongkong, ausschließliche Gerichtsbarkeit Hongkong | Eine Zeile in Ihrem Risikoregister wert |
Das Inkrafttreten der Vereinbarung ist der 2. August 2026 (Hugging Face, August 2026).
Die meisten Launch-Berichterstattungen führten mit "Open Weights" und hörten dort auf. Zu MiniMaxs Kredit: Sie haben es nicht versteckt: Das Repo enthält eine eigene docs/QA-about-License.md, die erklärt, dass Videomodelle einer sich schneller bewegenden regulatorischen Landschaft ausgesetzt sind als Textmodelle, den EU AI Act, britische und koreanische Regeln sowie anhängige US-Urheberrechtsverfahren zu generativem Video nennt und klarstellt, dass "die derzeitige Einschränkung 'noch nicht' bedeutet, nicht 'nie'". Dasselbe Dokument bestätigt die Trennung, die operativ wichtig ist: Die API bleibt global verfügbar, weil MiniMax die Bereitstellungsinfrastruktur kontrolliert, während Open Weights diese Kontrolle hinter sich lassen.
Wenn Sie also in San Francisco, Berlin, London oder Seoul sind, ist die praktische Lesart nicht "Sie können H3 nie anfassen." Es ist "Diese spezielle Lizenz ist nicht das Instrument, das es Ihnen erlaubt, diese Gewichte auf Ihrer eigenen Maschine auszuführen." Beantragen Sie die separate Lizenz, oder verwenden Sie einen gehosteten Endpunkt, wo Sie Kunde eines Dienstes sind und nicht Lizenznehmer der Gewichte.
Ich bin kein Anwalt, und dies ist keine Rechtsberatung. Der Klauseltext oben ist zitiert, damit Ihr tatsächlicher Rechtsbeistand in etwa zehn Minuten das Original lesen kann.
MiniMax H3 Open-Source-Gewichte: Häufig gestellte Fragen
Sind die MiniMax H3 Open-Source-Gewichte tatsächlich draußen und wo lade ich sie herunter?
Ja, seit Anfang August 2026. Zwei Orte. MiniMaxAI/MiniMax-H3 ist das offizielle Repository, etwa 498 GB, das die Diffusers-Format-Pipeline, beide Transformatoren, den Text-Encoder, beide VAEs, Dokumente und reproduzierbare Skripte enthält. Comfy-Org/MiniMax-H3 ist der neu verpackte ComfyUI-Build, insgesamt etwa 343 GB, mit den quantisierten Einzeldatei-Checkpoints, die die meisten Leute tatsächlich wollen. Wenn Sie ComfyUI ausführen, verwenden Sie das zweite und laden Sie vier Dateien herunter.
Wie viele Parameter hat MiniMax H3 und brauche ich einen Supercomputer?
33B, in einem dichten Single-Stream-Transformer. Etwa 13B davon sitzen in AdaLN-bezogenen Zweigen, deren Ausgaben vorberechnet und zwischengespeichert werden können, sodass Inferenz-Only-Deployments sie nicht laden müssen. Das ist es, was die "bereinigten" Checkpoints sind. Kein Supercomputer. Ein 42,5 GB Download und eine ernsthafte Consumer-GPU.
Kann ich die MiniMax H3 Open-Source-Gewichte auf 12 GB oder 16 GB VRAM ausführen?
Das ComfyUI-Team sagt, eine 12-GB-Karte könne es mit dynamischer Auslagerung schaffen, unter Verwendung des bereinigten int8 fl2va-Checkpoints plus des nvfp4 AWQ-Text-Encoders. Das ist ihre Behauptung, kein Benchmark, den ich ausgeführt habe. Zwei Einschränkungen: Auslagerung tauscht VRAM gegen System-RAM, also planen Sie 64 GB RAM ein und erwarten Sie lange Renderzeiten, und Ihre lokale Leinwand ist 768px kurze Kante, nicht 2K.
Sind die MiniMax H3 Open-Source-Gewichte wirklich Open Source oder nur Open Weights?
Open Weights, genau. Die Gewichte sind herunterladbar und modifizierbar, was mehr ist, als jedes Frontier-Video-Modell vor einem Jahr bot. Aber die Lizenz ist nicht OSI-zertifiziert, das Trainingsrezept und die Daten sind nicht veröffentlicht, die kommerzielle Nutzung trägt Bedingungen zu Namensnennung und Umsatz, und die Gebietsklausel schränkt ein, wo die Lizenz gilt. Die einzige wirklich offene Komponente ist der Qwen3-VL-32B-Encoder unter Apache 2.0. Drei separate Schichten, und "offen" beschreibt nur die erste sauber.
Kann ich die MiniMax H3 Open-Source-Gewichte kommerziell nutzen und was bedeutet die 20-Millionen-Dollar-Grenze?
Ja, mit zwei Bedingungen. Sie müssen "MiniMax H3" prominent auf der Benutzeroberfläche des kommerziellen Produkts anzeigen (Abschnitt IV.2). Und wenn Ihre kommerziellen Produkte und Dienstleistungen einen Jahresumsatz von mehr als 20 Millionen Dollar erzielen, benötigen Sie eine separate vorherige schriftliche Genehmigung von MiniMax, bevor Sie es nutzen, beantragt unter [email protected] (Abschnitt IV.1). Die Schwelle bezieht sich auf Ihren Umsatz, nicht auf Ihre H3-Nutzung.
Warum schließt die MiniMax H3-Lizenz die USA und die EU aus und welche Optionen habe ich?
Laut MiniMaxs eigenem Lizenz-Q&A, weil Videogenerierung in einem sich schneller bewegenden regulatorischen Umfeld steht als Text, insbesondere dem EU AI Act, sich entwickelnden britischen und südkoreanischen Regeln und anhängigen US-Urheberrechtsverfahren zu generativem Video. Sobald Gewichte öffentlich sind, können sie keine Sicherheitsvorkehrungen nachgelagert durchsetzen, also haben sie die Lizenz eingeschränkt, anstatt die Veröffentlichung zu verzögern. Optionen in einem ausgeschlossenen Gebiet: Beantragen Sie eine separate Lizenz über das Formular im Repository, oder verwenden Sie eine gehostete API, die eine andere rechtliche Beziehung darstellt und global verfügbar bleibt. Lassen Sie Ihren Rechtsbeistand bestätigen, welche Option passt, bevor Sie bereitstellen.
Verifiziert am 3. August 2026. Drei Dinge auf der Nachverfolgungsliste: Community-GGUF und Quantisierungen mit niedrigeren Bitraten (es gibt noch keine für H3), etwaige Änderungen an der Liste der ausgeschlossenen Hoheitsgebiete und ob die gehostete 768p-Stufe, die die Readme immer noch dokumentiert, jemals zurückkommt.






