
Meja pada pukul 3 pagi dengan casing PC terbuka, drive eksternal, dan monitor menampilkan unduhan besar yang sedang berlangsung
Bobotnya sudah dirilis. Jadi, izinkan saya menjawab dua pertanyaan yang paling banyak mendapat balasan di bawah postingan peluncuran MiniMax, sebelum yang lainnya.
Tidak, Anda tidak memerlukan superkomputer. Pilih file yang tepat dan unduhannya 42,5 GB, bukan 123,6 GB. Model ini memiliki 33B parameter, dan sekitar 13B di antaranya berada di cabang modulasi AdaLN yang bahkan tidak perlu dimuat oleh inferensi.
Lalu saya membuka file LICENSE. Baris 10, sebelum saya sampai ke klausul pendapatan $20M, adalah daftar negara. Negara saya ada di dalamnya. Mungkin negara Anda juga.
Poin-poin penting
- Bobot sumber terbuka MiniMax H3 sudah tersedia di Hugging Face sebagai
MiniMaxAI/MiniMax-H3, ditambah cermin yang dikemas ulang untuk ComfyUI diComfy-Org/MiniMax-H3. ComfyUI merilis dukungan asli pada hari yang sama. - Itu bukan satu file. Ada dua checkpoint khusus tugas,
fl2va(berbasis teks dan gambar) danref2va(berbasis referensi), masing-masing 21 GB dalam bentuk terkecilnya. Anda hanya mengunduh yang diperlukan oleh pekerjaan Anda. - 33B Transformer padat aliran tunggal. Kombinasi kerja terkecil 42,5 GB, turun 66% dari 123,6 GB pada presisi penuh. ComfyUI mengatakan kartu 12 GB dengan offloading dapat menjalankannya.
- Generasi lokal secara asli 768px pada sisi pendek, bukan 2K. 2K berasal dari lintasan regenerasi in-konteks kedua.
- Penggunaan komersial gratis tetapi Anda harus menampilkan "MiniMax H3" di antarmuka Anda, dan di atas pendapatan tahunan $20M Anda memerlukan otorisasi tertulis terpisah. Dan Wilayah Berlaku lisensi mengecualikan UE, Inggris, Korea Selatan, dan Amerika Serikat. API yang dihosting adalah hubungan hukum yang berbeda.
Satu karakter, kedua checkpoint, satu pukul 3 pagi. Sisi kiri adalah apa yang dilakukan fl2va. Sisi kanan adalah apa yang dilakukan ref2va. Orang yang sama, ruangan yang sama, malam yang sama, dua pekerjaan yang benar-benar berbeda, dan dengungan kipas yang Anda dengar dihasilkan dalam lintasan yang sama dengan gambar.

Kiri: gambar-ke-video, pekerjaan yang dilakukan checkpoint fl2va. Kanan: referensi-ke-video, pekerjaan yang dilakukan ref2va. Keduanya dirender pada MiniMax H3 dengan audio stereo asli. Nyalakan suaranya.
Hal pertama yang saya minta model ini hasilkan adalah manusia yang menunggu model ini selesai diunduh. Rasanya tepat.
Bobot Sumber Terbuka MiniMax H3, Ditimbang: Dua Checkpoint dan Lantai 42,5 GB
Inilah mengapa rilis ini menjadi heboh. Artificial Analysis menempatkan H3 di #1 dalam Penyuntingan Video dan tiga besar dalam teks-ke-video dan gambar-ke-video, dan mengatakan bahwa merilis bobot "akan menjadikannya model bobot terbuka terdepan sejauh ini" (Artificial Analysis, Juli 2026). Itu adalah model video tingkat frontier dengan tombol unduh.
Separuh jujurnya: dalam pengujian tolok ukur yang sama, H3 tertinggal dari Google Gemini Omni Flash dalam teks-ke-video, dan berada di belakang Seedance 2.0 dan Gemini Omni Flash dalam gambar-ke-video (South China Morning Post, Juli 2026). Ia #1 dalam penyuntingan, bukan #1 dalam segalanya.
Sekarang bagian yang hampir tidak ada yang memeriksa sebelum menekan git clone.
Jumlah parameter yang tidak dimasukkan siapa pun ke dalam judul. Kartu model menjelaskan H3-Omni-Transformer sebagai "Transformer padat aliran tunggal 33B-parameter, dengan sekitar 13B parameter berada di cabang terkait AdaLN", dan menambahkan bahwa karena output modulasi tersebut dapat dihitung dan di-cache, "parameter ini tidak perlu dimuat untuk penerapan hanya inferensi." Dari situlah checkpoint yang dipangkas berasal. Sekitar 40% dari model berubah menjadi tabel pencarian ketika Anda hanya melakukan inferensi.
Di mana kebanyakan orang menghabiskan 80 GB untuk apa-apa. Repositori resmi MiniMaxAI/MiniMax-H3 berukuran 498 GB jika Anda menarik semuanya. Cermin ComfyUI berukuran 343 GB. Keduanya menyimpan setiap varian presisi dari kedua checkpoint. Anda memerlukan empat file, bukan empat ratus.
| File | Ukuran | Apa itu | Anda membutuhkannya untuk |
|---|---|---|---|
| minimax_h3_fl2va_pruned_int8_convrot.safetensors | 20,97 GB | checkpoint fl2va, dipangkas + int8 | Teks-ke-video, gambar-ke-video |
| minimax_h3_fl2va_int8_convrot.safetensors | 34,04 GB | fl2va, int8, tidak dipangkas | Sama, fidelitas lebih tinggi |
| minimax_h3_fl2va_bf16.safetensors | 66,28 GB | fl2va, presisi penuh | Fine-tuning, riset |
| minimax_h3_ref2va_pruned_int8_convrot.safetensors | 20,97 GB | checkpoint ref2va, dipangkas + int8 | Hanya referensi-ke-video |
| minimax_h3_ref2va_int8_convrot.safetensors | 34,04 GB | ref2va, int8, tidak dipangkas | Sama, fidelitas lebih tinggi |
| minimax_h3_ref2va_bf16.safetensors | 66,28 GB | ref2va, presisi penuh | Fine-tuning, riset |
| qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 15,69 GB | Pengode teks, AWQ 4-bit | Setiap alur kerja |
| qwen3vl_32b_minimax_h3_int8_convrot.safetensors | 27,14 GB | Pengode teks, int8 | Setiap alur kerja |
| qwen3vl_32b_minimax_h3_bf16.safetensors | 51,51 GB | Pengode teks, presisi penuh | Setiap alur kerja |
| minimax_h3_video_vae_fp16.safetensors | 5,21 GB | VAE video | Setiap alur kerja |
| minimax_h3_audio_vae_fp32.safetensors | 0,61 GB | VAE audio | Setiap alur kerja (ini suaranya) |
| Set kerja terkecil, satu tugas | 42,5 GB | fl2va dipangkas + pengode nvfp4 + kedua VAE | Unduhan realistis |
| Kedua checkpoint, terkecil | 63,4 GB | tambahkan ref2va dipangkas | Jika Anda menginginkan ketiga mode |
| Satu tugas pada bf16 penuh | 123,6 GB | bf16 semuanya | Hanya rig riset |
Ukuran file dibaca langsung dari indeks repositori Comfy-Org/MiniMax-H3, Agustus 2026.
Pembingkaian ComfyUI sendiri untuk angka yang sama: "jejak memori total berkurang 66%, dari 123,6 GB dalam presisi penuh menjadi 42,5 GB", yang merupakan apa yang "memungkinkan model video 2K generasi berikutnya berjalan secara lokal di GPU seperti RTX 3060" (ComfyUI, Agustus 2026). Ambil angka 12 GB sebagai klaim mereka dengan offloading dinamis, bukan sebagai tolok ukur. Saya belum menjalankannya di 3060, dan offloading membeli VRAM dengan RAM sistem dan waktu dinding.
Satu hal "jalankan secara lokal" diam-diam berarti: 768px. Kanvas asli H3 adalah sisi pendek 768px, dibatasi hingga 768x1344, menurut tutorial H3 ComfyUI. Durasi menempel pada kisi 17 frame per blok pada 24fps. Klip 2K dalam pemasaran berasal dari H3-Regenerate-2K, lintasan kedua yang memasukkan hasil 768p plus konteks asli kembali melalui model. Kartu model secara eksplisit menyatakan bahwa sistem lengkap adalah tiga modul: H3-Context-IR, H3-Base, dan H3-Regenerate-2K. ComfyUI lokal memberi Anda H3-Base.
Dan kata "terbuka" melakukan tiga pekerjaan terpisah di sini. Dapat diunduh, ya. Dapat digunakan secara komersial, dengan syarat. Dapat dijalankan di tempat tinggal Anda, itu tergantung di mana Anda tinggal. Thread Reddit yang menyebut ini "sebenarnya model sumber tertutup" salah pada poin pertama dan menunjuk pada sesuatu yang nyata pada dua poin lainnya. Bagian 7 memiliki teks klausul.
Bobot Sumber Terbuka MiniMax H3 Lokal vs API yang Dihosting: Pilih Jalur Anda
Semua yang di bawah garis ini, seluruh demo empat langkah, berjalan di satu tab browser di Atlas Cloud, yang menyajikan ketiga endpoint H3 ditambah model gambar yang saya gunakan untuk bingkai dasar. Itu bukan hal yang sama dengan menjalankan bobot, dan perbedaannya lebih penting dari biasanya dengan model ini.
| Bobot lokal | API yang dihosting | |
|---|---|---|
| Biaya awal | Unduhan 42,5 GB, GPU 12 GB+, instalasi ComfyUI | Kunci API |
| Waktu ke klip pertama | Satu malam, optimistis | Sekitar dua menit |
| Biaya per klip 5 detik | Waktu GPU dan listrik | $0,70 pada $0,14/detik |
| Resolusi asli | 768px sisi pendek, 2K melalui lintasan regenerasi | 2K langsung, itu satu-satunya nilai enum |
| Fine-tune, LoRA, operasi | Ya, itulah intinya | Tidak |
| Data tidak pernah meninggalkan jaringan Anda | Ya | Tidak |
| Paparan lisensi | Anda menerima Lisensi Komunitas dan klausul wilayahnya | Anda adalah pelanggan layanan yang dihosting |
| Jika Anda di UE, Inggris, Korea, atau AS | Bagian 7 | Tidak terpengaruh oleh lisensi bobot |
Aturan praktis: di bawah sekitar 100 klip per bulan, atau jika Anda perlu 2K langsung, atau jika Anda berada di Wilayah Terlarang, yang dihosting unggul di semua sumbu. Di atas itu, atau jika Anda berniat melatih di atas checkpoint, atau jika rekaman tidak boleh meninggalkan gedung Anda, 42,5 GB sepadan dengan satu malam.
Harga diverifikasi dari halaman model langsung, Agustus 2026. Semua endpoint H3 ditagih per detik output, tanpa diskon aktif.
| Model | Apa yang dilakukannya di sini | Harga | Diskon |
|---|---|---|---|
| MiniMax H3 image-to-video | Langkah 2, pekerjaan fl2va | $0,14 / detik pada 2K | Tidak ada |
| MiniMax H3 reference-to-video | Langkah 3, pekerjaan ref2va | $0,14 / detik pada 2K | Tidak ada |
| MiniMax H3 text-to-video | Langkah 4, dasar tanpa referensi | $0,14 / detik pada 2K | Tidak ada |
| GPT Image 2 text-to-image | Langkah 1, bingkai dasar | $0,009 / gambar yang terdaftar; eksekusi kualitas tinggi 16:9 yang saya gunakan dikutip $0,1745 | Tidak ada |
| Seedance 2.0 / Wan 2.7 / Kling v3.0 Turbo | Titik referensi per detik | $0,112 / $0,10 / $0,095 per detik | Kling diskon 15% |
Satu inkonsistensi yang perlu diketahui sebelum Anda menulis kode terhadapnya: readme H3 masih mendokumentasikan tingkatan 768p seharga $0,10/detik dan durasi 5 atau 10 detik. Skema langsung tidak setuju. resolution memiliki tepat satu nilai yang diizinkan, 2K, dan duration menerima bilangan bulat apa pun dari 5 hingga 15. Tulis terhadap skema. Ada simetri yang rapi dalam celah itu: tingkatan 768p dimatikan di sisi yang dihosting, dan 768p adalah kanvas asli yang Anda dapatkan saat menjalankan bobot sendiri.
Langkah 1: Hasilkan Bingkai Dasar dengan GPT Image 2
Semua yang ada di demo ini dimulai dari satu gambar diam. Adegannya sengaja dibuat langsung: seorang pengembang pada pukul 3 pagi menonton unduhan checkpoint 21 GB.
Model: openai/gpt-image-2/text-to-image. Pengaturan: kualitas high, rasio 16:9.
plaintext1Sebuah foto lebar realistis dari kantor rumah yang berantakan pada pukul 3 pagi, hanya diterangi oleh dua monitor dan sinar RGB dari casing PC terbuka di atas meja. Seorang pengembang lelah dengan hoodie abu-abu duduk santai di kursi jaring, dagu di tangan, menatap monitor kiri. Monitor kiri menampilkan terminal gelap dengan satu bilah progres unduhan yang terlihat pada sekitar 78 persen. Monitor kanan menampilkan penjelajah file. Secangkir kopi setengah penuh dingin, keyboard mekanik, dan kipas meja kecil berada di atas meja. Hujan mengalir di jendela di belakangnya. Kedalaman bidang dangkal, 35mm, cahaya kunci monitor hangat berlawanan dengan cahaya jendela biru dingin, butiran sensor yang terlihat. Tidak ada hamparan teks, tidak ada tanda air. 2
Jangan minta model gambar untuk merender nama file safetensors yang sebenarnya. String panjang dengan garis bawah akan kembali berantakan. Simpan nama file di teks Anda.

Area bermain GPT Image 2 di Atlas Cloud dengan prompt pukul 3 pagi diketik dan bingkai dasar selesai di panel output
GPT Image 2 di Atlas Cloud: kualitas high, 16:9, bingkai dasar dirender di sebelah kanan. Tingkatan kualitas tinggi mengutip $0,1745 untuk eksekusi ini, jauh di atas lantai daftar $0,009, jadi sesuaikan anggaran berdasarkan tingkatan.

Bingkai dasar yang dihasilkan: seorang pengembang lelah pada pukul 3 pagi menonton bilah unduhan di monitor kiri
Output Langkah 1. Bingkai tunggal ini memberi makan Langkah 2 dan 3.
Langkah 2: Gambar ke Video, Pekerjaan yang Dilakukan Checkpoint fl2va
Ini adalah endpoint yang sesuai dengan minimax_h3_fl2va_pruned_int8_convrot.safetensors. Satu bingkai pertama masuk, gerakan dan suara keluar. Secara lokal ini adalah file yang akan Anda muat; dihosting, itu adalah satu panggilan API.
Model: minimax/h3/image-to-video. Pengaturan: image = bingkai Langkah 1 diteruskan sebagai URL data, resolution: 2K, duration: 5, ratio: 16:9.
plaintext1Pengembang tetap diam, hanya bernapas dan berkedip, mata terpaku pada monitor kiri. Bilah progres di monitor kiri merayap maju. Kipas casing menyala dan sinar RGB mereka berdenyut lebih terang. Sesaat sebelum akhir dia menghela napas dan bahunya turun. Kamera terkunci, tidak ada gerakan kamera, tidak ada zoom, tidak ada potongan. Audio: dengungan kipas casing rendah yang meninggi, hujan samar di jendela, satu nada dua not lembut di dekat akhir. 2
Berikan gambar sebagai URL data base64 daripada URL penyimpanan yang baru dihasilkan. URL objek baru dapat gagal dalam pemeriksaan unduhan hulu. Juga perhatikan bahwa H3 benar-benar mematuhi "kamera terkunci," yang tidak berlaku secara universal untuk model video di kelas ini.

Area bermain MiniMax H3 gambar-ke-video di Atlas Cloud dengan bingkai dasar dimuat dan klip 2K selesai di panel output
MiniMax H3 gambar-ke-video: bingkai dasar dimuat, 2K, eksekusi selesai. Tangkapan ini menggunakan default endpoint 8 detik, itulah mengapa kutipan terbaca $1,12. Klip yang disematkan di bawah adalah versi 5 detik seharga $0,70.

Pekerjaan fl2va: satu bingkai masuk, lima detik gerakan plus dengungan kipas stereo keluar.
Langkah 3: Referensi ke Video, Pekerjaan yang Dilakukan Checkpoint ref2va
Checkpoint berbeda, file berbeda, tugas berbeda. ref2va tidak memperpanjang bingkai pertama. Ia mengambil bahan referensi dan membangun bidikan baru yang menjaga identitas dan objek tetap konsisten. Itulah mengapa repositori mengirimkan dua file 21 GB alih-alih satu.
Saya memberikannya dua referensi: bingkai Langkah 1 untuk orang dan ruangan, dan foto makro kartu grafis untuk perangkat keras.
Model: minimax/h3/reference-to-video. Pengaturan: refers = kedua gambar, resolution: 2K, duration: 8, ratio: 16:9.
plaintext1Pria yang sama, hoodie abu-abu yang sama, wajah yang sama, di kantor rumah gelap yang sama. Bidikan baru: close-up sedang dari samping saat dia bersandar di kursi dan menghela napas panjang, sudut mulutnya sedikit terangkat. Kartu grafis di gambar referensi kedua terlihat di atas bahunya, kipasnya melambat, RGB menjadi warna stabil. Jaga identitasnya, hoodie, rambut, dan pencahayaan ruangan tetap konsisten dengan gambar referensi. Kamera terkunci. Audio: dengungan kipas mereda, satu tekan tombol keyboard, hujan berlanjut. 2
refers mengambil array campuran gambar, video, dan audio, setidaknya satu gambar atau video. Audio saja ditolak. Endpoint ini juga menerima durasi hingga 15 detik.
Satu jebakan pada endpoint ini secara khusus: set ratio secara eksplisit. Membiarkannya pada adaptive kembali sebagai 400 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive', empat kali berturut-turut, termasuk dari area bermain dengan kedua referensi yang jelas terlampir. Dengan ratio: "16:9" dalam panggilan API, ia berjalan pertama kali. Ini juga mengapa tangkapan layar di bawah adalah gambar referensi daripada tangkapan area bermain: Saya tidak bisa mengontrol Kontrol Rasio Aspek area bermain dari adaptive, jadi klip yang Anda lihat di sini berasal dari API dengan pengaturan di atas, bukan dari eksekusi area bermain.

Gambar referensi kedua: foto makro kartu grafis tiga kipas di dalam casing PC terbuka di malam hari
Gambar referensi 2, dihasilkan dalam batch yang sama dengan bingkai dasar, diteruskan bersama bingkai Langkah 1.

Pekerjaan ref2va: sudut pandang baru, bukan kelanjutan. Pria yang sama, hoodie yang sama, ruangan yang sama, dan kartu grafis dari referensi 2 sekarang berada dalam bingkai dengan kipasnya melambat. Perhatikan bahwa ia menafsirkan "close-up sedang" secara longgar dan tetap cukup lebar.
Langkah 4: Teks ke Video, Dasar Bobot Sumber Terbuka MiniMax H3
Adegan yang sama, dijelaskan dengan kata-kata, tanpa referensi sama sekali. Langkah ini ada untuk menunjukkan kepada Anda hal yang sebenarnya digunakan oleh kedua checkpoint.
Model: minimax/h3/text-to-video. Pengaturan: ratio wajib di sini dan tidak boleh adaptive, jadi 16:9. resolution: 2K, duration: 5.
plaintext1Seorang pengembang lelah dengan hoodie abu-abu pada pukul 3 pagi di kantor rumah yang berantakan, diterangi oleh dua monitor dan sinar RGB dari casing PC terbuka, menonton bilah progres unduhan merayap di layar kiri. Hujan di jendela di belakangnya. Bidikan 35mm terkunci, kedalaman bidang dangkal, cahaya monitor hangat berlawanan dengan cahaya jendela dingin, butiran film. Audio: dengungan kipas casing meninggi, hujan samar, nada selesai lembut di akhir. 2

Area bermain MiniMax H3 teks-ke-video di Atlas Cloud dengan prompt diketik dan klip selesai di panel output
MiniMax H3 teks-ke-video: tanpa bahan referensi, 2K, Rasio Aspek diatur ke 16:9 karena adaptive ditolak di sini, eksekusi selesai. Prompt yang sama, dan sudah wajah yang berbeda dari yang di Langkah 2.

Kata-kata yang sama, manusia yang berbeda. Ruangan yang bagus, orang yang salah. Celah itu adalah seluruh argumen untuk fl2va dan ref2va ada sebagai checkpoint terpisah.
Satu catatan operasional jika Anda membuat skrip ketiganya: konkurensi hulu kira-kira satu tugas. Pekerjaan yang tumpang tindih kembali sebagai 429 rate limit exceeded (task concurrency). Jalankan secara seri. Klip 2K 5 detik memakan waktu sekitar dua menit setiap kali.
Berapa Biaya Bobot Sumber Terbuka MiniMax H3, dan Apa Isi Lisensi Sebenarnya
Pertanyaan biaya memiliki dua mata uang. Dihosting, klip 2K 5 detik adalah $0,70 dan yang 15 detik adalah $2,10, per detik, tanpa tingkatan, tanpa diskon. Lokal, mata uangnya adalah gigabyte dan jam: 42,5 GB melalui pipa, kartu yang dapat menampungnya, dan kanvas 768px kecuali Anda juga menjalankan lintasan regenerasi. Di suatu tempat di atas beberapa ratus klip per bulan, perhitungannya berbalik. Di bawah itu, sebagian besar tidak.
Kemudian ada mata uang ketiga, yaitu waktu tinjauan hukum. Saya membaca seluruh LICENSE. Inilah isinya.

Lampu meja menerangi laptop yang menampilkan dokumen teks padat, di samping cetakan yang disorot, kacamata baca, dan segelas air
Bagian dari rilis bobot terbuka yang tidak ada yang mengambil tangkapan layar untuk thread peluncuran.
| Klausul | Bagian | Apa yang dikatakannya | Artinya bagi Anda |
|---|---|---|---|
| Wilayah Berlaku | I.3, I.5 | Di seluruh dunia, "tidak termasuk Wilayah Terlarang," yang didefinisikan sebagai "Uni Eropa, Inggris, Republik Korea, dan Amerika Serikat" | Lisensi komunitas tidak memberi Anda hak di tempat tinggal sebagian besar pembaca artikel ini |
| Larangan penggunaan teritorial | V.4 | Anda tidak boleh "menggunakan, mereproduksi, memodifikasi, mendistribusikan, atau menampilkan Karya MiniMax H3 atau Output atau hasilnya di luar Wilayah Berlaku" | Ini menjangkau Output, bukan hanya bobot |
| Saluran lisensi terpisah | II | MiniMax akan "terus mengevaluasi hukum yang berlaku" dan mengundang pihak di wilayah yang dikecualikan untuk menghubungi mereka untuk mendapatkan lisensi | Ini "belum", bukan "tidak pernah." Repositori mengirimkan formulir aplikasi |
| Atribusi | IV.2 | Anda "harus menampilkan secara menonjol 'MiniMax H3' pada antarmuka pengguna" dari produk komersial apa pun yang menggunakannya | Perubahan UI, bukan catatan kaki |
| Ambang pendapatan | IV.1 | Di atas pendapatan tahunan $20 juta, Anda memerlukan otorisasi tertulis sebelumnya dari [email protected] | Penggunaan komersial gratis memiliki batas |
| Larangan pencucian model | V.3 | Anda tidak boleh menggunakan H3 atau Output-nya "untuk meningkatkan model kecerdasan buatan lainnya" | Melarang distilasi ke dalam model Anda sendiri |
| Redistribusi | III.1, III.4 | Kirimkan perjanjian bersamanya, sertakan file NOTICE, tandai file yang dimodifikasi | Standar, tetapi ini mengikat pengguna hilir juga |
| Pengode teks | Catatan Tambahan | Pengode adalah Qwen3-VL-32B di bawah Apache 2.0 | Satu komponen dari tumpukan benar-benar terbuka OSI |
| Hukum yang berlaku | IX | Hukum SAR Hong Kong, yurisdiksi eksklusif Hong Kong | Layak untuk satu baris di daftar risiko Anda |
Tanggal efektif perjanjian adalah 2 Agustus 2026 (Hugging Face, Agustus 2026).
Sebagian besar liputan peluncuran mengarah dengan "bobot terbuka" dan berhenti di situ. Untuk kredit MiniMax, mereka tidak menyembunyikannya: repositori membawa docs/QA-about-License.md sendiri yang menjelaskan bahwa model video menghadapi gambaran regulasi yang bergerak lebih cepat daripada model teks, menyebutkan EU AI Act, aturan Inggris dan Korea, serta litigasi hak cipta AS yang sedang berlangsung atas video generatif, dan menyatakan dengan jelas bahwa "batasan saat ini berarti 'belum', bukan 'tidak pernah'." Dokumen yang sama mengonfirmasi pemisahan yang penting secara operasional: API tetap tersedia secara global karena MiniMax mengontrol infrastruktur penyajian, sementara bobot terbuka meninggalkan kendali itu.
Jadi jika Anda di San Francisco, Berlin, London, atau Seoul, bacaan praktisnya bukanlah "Anda tidak akan pernah bisa menyentuh H3." Itu adalah "lisensi khusus ini bukanlah instrumen yang memungkinkan Anda menjalankan bobot ini di kotak Anda sendiri." Ajukan lisensi terpisah, atau gunakan endpoint yang dihosting, di mana Anda adalah pelanggan layanan daripada penerima lisensi bobot.
Saya bukan pengacara dan ini bukan nasihat hukum. Teks klausul di atas dikutip sehingga penasihat Anda yang sebenarnya dapat membaca aslinya dalam waktu sekitar sepuluh menit.
Bobot Sumber Terbuka MiniMax H3: Pertanyaan yang Sering Diajukan
Apakah bobot sumber terbuka MiniMax H3 benar-benar dirilis, dan di mana saya mengunduhnya?
Ya, per awal Agustus 2026. Dua tempat. MiniMaxAI/MiniMax-H3 adalah repositori resmi, sekitar 498 GB, berisi pipeline format diffusers, kedua transformer, pengode teks, kedua VAE, dokumen, dan skrip yang dapat direproduksi. Comfy-Org/MiniMax-H3 adalah build ComfyUI yang dikemas ulang, total sekitar 343 GB, dengan checkpoint file tunggal terkuantisasi yang sebagian besar orang inginkan. Jika Anda menjalankan ComfyUI, gunakan yang kedua dan unduh empat file.
Berapa banyak parameter yang dimiliki MiniMax H3, dan apakah saya memerlukan superkomputer?
33B, dalam Transformer padat aliran tunggal. Sekitar 13B dari itu berada di cabang terkait AdaLN yang outputnya dapat dihitung dan di-cache, sehingga penerapan hanya inferensi tidak perlu memuatnya. Itulah yang dimaksud dengan checkpoint "dipangkas". Tidak perlu superkomputer. Unduhan 42,5 GB dan GPU konsumen yang serius.
Bisakah saya menjalankan bobot sumber terbuka MiniMax H3 pada VRAM 12 GB atau 16 GB?
Tim ComfyUI mengatakan kartu 12 GB dapat melakukannya dengan offloading dinamis, menggunakan checkpoint fl2va int8 yang dipangkas ditambah pengode teks AWQ nvfp4. Itu adalah klaim mereka, bukan tolok ukur yang saya jalankan. Dua peringatan: offloading menukar VRAM dengan RAM sistem, jadi anggarkan 64 GB RAM dan harapkan waktu render yang lama, dan kanvas lokal Anda adalah 768px sisi pendek, bukan 2K.
Apakah bobot sumber terbuka MiniMax H3 benar-benar sumber terbuka, atau hanya bobot terbuka?
Bobot terbuka, tepatnya. Bobotnya dapat diunduh dan dimodifikasi, yang lebih dari yang ditawarkan model video frontier setahun yang lalu. Tetapi lisensinya tidak disetujui OSI, resep dan data pelatihan tidak dipublikasikan, penggunaan komersial membawa kondisi atribusi dan pendapatan, dan klausul wilayah membatasi di mana hibah berlaku. Satu-satunya komponen yang benar-benar terbuka adalah pengode Qwen3-VL-32B di bawah Apache 2.0. Tiga lapisan terpisah, dan "terbuka" hanya secara bersih menggambarkan yang pertama.
Bisakah saya menggunakan bobot sumber terbuka MiniMax H3 secara komersial, dan apa arti garis $20M?
Ya, dengan dua syarat. Anda harus menampilkan secara menonjol "MiniMax H3" pada antarmuka pengguna produk komersial (Bagian IV.2). Dan jika produk dan layanan komersial Anda menghasilkan lebih dari $20 juta pendapatan tahunan, Anda memerlukan otorisasi tertulis sebelumnya dari MiniMax sebelum menggunakannya, diminta di [email protected] (Bagian IV.1). Ambang batasnya adalah pada pendapatan Anda, bukan pada penggunaan H3 Anda.
Mengapa lisensi MiniMax H3 mengecualikan AS dan UE, dan apa pilihan saya?
Menurut Tanya Jawab lisensi MiniMax sendiri, karena generasi video berada dalam lingkungan regulasi yang bergerak lebih cepat daripada teks, khususnya EU AI Act, aturan Inggris dan Korea Selatan yang berkembang, dan litigasi hak cipta AS yang aktif atas video generatif. Begitu bobot menjadi publik, mereka tidak dapat menegakkan perlindungan di hilir, jadi mereka membatasi hibah alih-alih menunda rilis. Pilihan di wilayah yang dikecualikan: ajukan lisensi terpisah melalui formulir di repositori, atau gunakan API yang dihosting, yang merupakan hubungan hukum yang berbeda dan tetap tersedia secara global. Minta penasihat Anda mengonfirmasi mana yang cocok sebelum Anda menerapkan.
Diverifikasi 3 Agustus 2026. Tiga hal dalam daftar tindak lanjut: GGUF komunitas dan kuantisasi bit lebih rendah (belum ada untuk H3), perubahan apa pun pada daftar Wilayah Terlarang, dan apakah tingkatan 768p yang dihosting yang masih didokumentasikan readme akan kembali lagi.






