Bobot Open Source MiniMax H3: Anda Tidak Perlu Superkomputer. Anda Mungkin Perlu Pengacara.

Berat open source MiniMax H3 telah dirilis: 33B parameter, unduhan minimum 42,5 GB, dua checkpoint, dan lisensi dengan klausul wilayah yang mengecualikan AS, UE, Inggris, dan Korea.

Laptop menampilkan kode di samping PC yang menyala di atas meja

Meja pada pukul 3 pagi dengan casing PC terbuka, drive eksternal, dan monitor menampilkan unduhan besar yang sedang berlangsung

Bobotnya sudah dirilis. Jadi, izinkan saya menjawab dua pertanyaan yang paling banyak mendapat balasan di bawah postingan peluncuran MiniMax, sebelum yang lainnya.

Tidak, Anda tidak memerlukan superkomputer. Pilih file yang tepat dan unduhannya 42,5 GB, bukan 123,6 GB. Model ini memiliki 33B parameter, dan sekitar 13B di antaranya berada di cabang modulasi AdaLN yang bahkan tidak perlu dimuat oleh inferensi.

Lalu saya membuka file LICENSE. Baris 10, sebelum saya sampai ke klausul pendapatan $20M, adalah daftar negara. Negara saya ada di dalamnya. Mungkin negara Anda juga.

Poin-poin penting

  • Bobot sumber terbuka MiniMax H3 sudah tersedia di Hugging Face sebagai MiniMaxAI/MiniMax-H3, ditambah cermin yang dikemas ulang untuk ComfyUI di Comfy-Org/MiniMax-H3. ComfyUI merilis dukungan asli pada hari yang sama.
  • Itu bukan satu file. Ada dua checkpoint khusus tugas, fl2va (berbasis teks dan gambar) dan ref2va (berbasis referensi), masing-masing 21 GB dalam bentuk terkecilnya. Anda hanya mengunduh yang diperlukan oleh pekerjaan Anda.
  • 33B Transformer padat aliran tunggal. Kombinasi kerja terkecil 42,5 GB, turun 66% dari 123,6 GB pada presisi penuh. ComfyUI mengatakan kartu 12 GB dengan offloading dapat menjalankannya.
  • Generasi lokal secara asli 768px pada sisi pendek, bukan 2K. 2K berasal dari lintasan regenerasi in-konteks kedua.
  • Penggunaan komersial gratis tetapi Anda harus menampilkan "MiniMax H3" di antarmuka Anda, dan di atas pendapatan tahunan $20M Anda memerlukan otorisasi tertulis terpisah. Dan Wilayah Berlaku lisensi mengecualikan UE, Inggris, Korea Selatan, dan Amerika Serikat. API yang dihosting adalah hubungan hukum yang berbeda.

Satu karakter, kedua checkpoint, satu pukul 3 pagi. Sisi kiri adalah apa yang dilakukan fl2va. Sisi kanan adalah apa yang dilakukan ref2va. Orang yang sama, ruangan yang sama, malam yang sama, dua pekerjaan yang benar-benar berbeda, dan dengungan kipas yang Anda dengar dihasilkan dalam lintasan yang sama dengan gambar.

Perbandingan berdampingan seorang pria bekerja di meja dengan dua monitor

Kiri: gambar-ke-video, pekerjaan yang dilakukan checkpoint fl2va. Kanan: referensi-ke-video, pekerjaan yang dilakukan ref2va. Keduanya dirender pada MiniMax H3 dengan audio stereo asli. Nyalakan suaranya.

Hal pertama yang saya minta model ini hasilkan adalah manusia yang menunggu model ini selesai diunduh. Rasanya tepat.

Bobot Sumber Terbuka MiniMax H3, Ditimbang: Dua Checkpoint dan Lantai 42,5 GB

Inilah mengapa rilis ini menjadi heboh. Artificial Analysis menempatkan H3 di #1 dalam Penyuntingan Video dan tiga besar dalam teks-ke-video dan gambar-ke-video, dan mengatakan bahwa merilis bobot "akan menjadikannya model bobot terbuka terdepan sejauh ini" (Artificial Analysis, Juli 2026). Itu adalah model video tingkat frontier dengan tombol unduh.

Separuh jujurnya: dalam pengujian tolok ukur yang sama, H3 tertinggal dari Google Gemini Omni Flash dalam teks-ke-video, dan berada di belakang Seedance 2.0 dan Gemini Omni Flash dalam gambar-ke-video (South China Morning Post, Juli 2026). Ia #1 dalam penyuntingan, bukan #1 dalam segalanya.

Sekarang bagian yang hampir tidak ada yang memeriksa sebelum menekan git clone.

Jumlah parameter yang tidak dimasukkan siapa pun ke dalam judul. Kartu model menjelaskan H3-Omni-Transformer sebagai "Transformer padat aliran tunggal 33B-parameter, dengan sekitar 13B parameter berada di cabang terkait AdaLN", dan menambahkan bahwa karena output modulasi tersebut dapat dihitung dan di-cache, "parameter ini tidak perlu dimuat untuk penerapan hanya inferensi." Dari situlah checkpoint yang dipangkas berasal. Sekitar 40% dari model berubah menjadi tabel pencarian ketika Anda hanya melakukan inferensi.

Di mana kebanyakan orang menghabiskan 80 GB untuk apa-apa. Repositori resmi MiniMaxAI/MiniMax-H3 berukuran 498 GB jika Anda menarik semuanya. Cermin ComfyUI berukuran 343 GB. Keduanya menyimpan setiap varian presisi dari kedua checkpoint. Anda memerlukan empat file, bukan empat ratus.

FileUkuranApa ituAnda membutuhkannya untuk
minimax_h3_fl2va_pruned_int8_convrot.safetensors20,97 GBcheckpoint fl2va, dipangkas + int8Teks-ke-video, gambar-ke-video
minimax_h3_fl2va_int8_convrot.safetensors34,04 GBfl2va, int8, tidak dipangkasSama, fidelitas lebih tinggi
minimax_h3_fl2va_bf16.safetensors66,28 GBfl2va, presisi penuhFine-tuning, riset
minimax_h3_ref2va_pruned_int8_convrot.safetensors20,97 GBcheckpoint ref2va, dipangkas + int8Hanya referensi-ke-video
minimax_h3_ref2va_int8_convrot.safetensors34,04 GBref2va, int8, tidak dipangkasSama, fidelitas lebih tinggi
minimax_h3_ref2va_bf16.safetensors66,28 GBref2va, presisi penuhFine-tuning, riset
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15,69 GBPengode teks, AWQ 4-bitSetiap alur kerja
qwen3vl_32b_minimax_h3_int8_convrot.safetensors27,14 GBPengode teks, int8Setiap alur kerja
qwen3vl_32b_minimax_h3_bf16.safetensors51,51 GBPengode teks, presisi penuhSetiap alur kerja
minimax_h3_video_vae_fp16.safetensors5,21 GBVAE videoSetiap alur kerja
minimax_h3_audio_vae_fp32.safetensors0,61 GBVAE audioSetiap alur kerja (ini suaranya)
Set kerja terkecil, satu tugas42,5 GBfl2va dipangkas + pengode nvfp4 + kedua VAEUnduhan realistis
Kedua checkpoint, terkecil63,4 GBtambahkan ref2va dipangkasJika Anda menginginkan ketiga mode
Satu tugas pada bf16 penuh123,6 GBbf16 semuanyaHanya rig riset

Ukuran file dibaca langsung dari indeks repositori Comfy-Org/MiniMax-H3, Agustus 2026.

Pembingkaian ComfyUI sendiri untuk angka yang sama: "jejak memori total berkurang 66%, dari 123,6 GB dalam presisi penuh menjadi 42,5 GB", yang merupakan apa yang "memungkinkan model video 2K generasi berikutnya berjalan secara lokal di GPU seperti RTX 3060" (ComfyUI, Agustus 2026). Ambil angka 12 GB sebagai klaim mereka dengan offloading dinamis, bukan sebagai tolok ukur. Saya belum menjalankannya di 3060, dan offloading membeli VRAM dengan RAM sistem dan waktu dinding.

Satu hal "jalankan secara lokal" diam-diam berarti: 768px. Kanvas asli H3 adalah sisi pendek 768px, dibatasi hingga 768x1344, menurut tutorial H3 ComfyUI. Durasi menempel pada kisi 17 frame per blok pada 24fps. Klip 2K dalam pemasaran berasal dari H3-Regenerate-2K, lintasan kedua yang memasukkan hasil 768p plus konteks asli kembali melalui model. Kartu model secara eksplisit menyatakan bahwa sistem lengkap adalah tiga modul: H3-Context-IR, H3-Base, dan H3-Regenerate-2K. ComfyUI lokal memberi Anda H3-Base.

Dan kata "terbuka" melakukan tiga pekerjaan terpisah di sini. Dapat diunduh, ya. Dapat digunakan secara komersial, dengan syarat. Dapat dijalankan di tempat tinggal Anda, itu tergantung di mana Anda tinggal. Thread Reddit yang menyebut ini "sebenarnya model sumber tertutup" salah pada poin pertama dan menunjuk pada sesuatu yang nyata pada dua poin lainnya. Bagian 7 memiliki teks klausul.

Bobot Sumber Terbuka MiniMax H3 Lokal vs API yang Dihosting: Pilih Jalur Anda

Semua yang di bawah garis ini, seluruh demo empat langkah, berjalan di satu tab browser di Atlas Cloud, yang menyajikan ketiga endpoint H3 ditambah model gambar yang saya gunakan untuk bingkai dasar. Itu bukan hal yang sama dengan menjalankan bobot, dan perbedaannya lebih penting dari biasanya dengan model ini.

Bobot lokalAPI yang dihosting
Biaya awalUnduhan 42,5 GB, GPU 12 GB+, instalasi ComfyUIKunci API
Waktu ke klip pertamaSatu malam, optimistisSekitar dua menit
Biaya per klip 5 detikWaktu GPU dan listrik$0,70 pada $0,14/detik
Resolusi asli768px sisi pendek, 2K melalui lintasan regenerasi2K langsung, itu satu-satunya nilai enum
Fine-tune, LoRA, operasiYa, itulah intinyaTidak
Data tidak pernah meninggalkan jaringan AndaYaTidak
Paparan lisensiAnda menerima Lisensi Komunitas dan klausul wilayahnyaAnda adalah pelanggan layanan yang dihosting
Jika Anda di UE, Inggris, Korea, atau ASBagian 7Tidak terpengaruh oleh lisensi bobot

Aturan praktis: di bawah sekitar 100 klip per bulan, atau jika Anda perlu 2K langsung, atau jika Anda berada di Wilayah Terlarang, yang dihosting unggul di semua sumbu. Di atas itu, atau jika Anda berniat melatih di atas checkpoint, atau jika rekaman tidak boleh meninggalkan gedung Anda, 42,5 GB sepadan dengan satu malam.

Harga diverifikasi dari halaman model langsung, Agustus 2026. Semua endpoint H3 ditagih per detik output, tanpa diskon aktif.

ModelApa yang dilakukannya di siniHargaDiskon
MiniMax H3 image-to-videoLangkah 2, pekerjaan fl2va$0,14 / detik pada 2KTidak ada
MiniMax H3 reference-to-videoLangkah 3, pekerjaan ref2va$0,14 / detik pada 2KTidak ada
MiniMax H3 text-to-videoLangkah 4, dasar tanpa referensi$0,14 / detik pada 2KTidak ada
GPT Image 2 text-to-imageLangkah 1, bingkai dasar$0,009 / gambar yang terdaftar; eksekusi kualitas tinggi 16:9 yang saya gunakan dikutip $0,1745Tidak ada
Seedance 2.0 / Wan 2.7 / Kling v3.0 TurboTitik referensi per detik$0,112 / $0,10 / $0,095 per detikKling diskon 15%

Satu inkonsistensi yang perlu diketahui sebelum Anda menulis kode terhadapnya: readme H3 masih mendokumentasikan tingkatan 768p seharga $0,10/detik dan durasi 5 atau 10 detik. Skema langsung tidak setuju. resolution memiliki tepat satu nilai yang diizinkan, 2K, dan duration menerima bilangan bulat apa pun dari 5 hingga 15. Tulis terhadap skema. Ada simetri yang rapi dalam celah itu: tingkatan 768p dimatikan di sisi yang dihosting, dan 768p adalah kanvas asli yang Anda dapatkan saat menjalankan bobot sendiri.

Langkah 1: Hasilkan Bingkai Dasar dengan GPT Image 2

Semua yang ada di demo ini dimulai dari satu gambar diam. Adegannya sengaja dibuat langsung: seorang pengembang pada pukul 3 pagi menonton unduhan checkpoint 21 GB.

Model: openai/gpt-image-2/text-to-image. Pengaturan: kualitas high, rasio 16:9.

plaintext
1Sebuah foto lebar realistis dari kantor rumah yang berantakan pada pukul 3 pagi, hanya diterangi oleh dua monitor dan sinar RGB dari casing PC terbuka di atas meja. Seorang pengembang lelah dengan hoodie abu-abu duduk santai di kursi jaring, dagu di tangan, menatap monitor kiri. Monitor kiri menampilkan terminal gelap dengan satu bilah progres unduhan yang terlihat pada sekitar 78 persen. Monitor kanan menampilkan penjelajah file. Secangkir kopi setengah penuh dingin, keyboard mekanik, dan kipas meja kecil berada di atas meja. Hujan mengalir di jendela di belakangnya. Kedalaman bidang dangkal, 35mm, cahaya kunci monitor hangat berlawanan dengan cahaya jendela biru dingin, butiran sensor yang terlihat. Tidak ada hamparan teks, tidak ada tanda air.
2

Jangan minta model gambar untuk merender nama file safetensors yang sebenarnya. String panjang dengan garis bawah akan kembali berantakan. Simpan nama file di teks Anda.

Tangkapan layar antarmuka generator teks-ke-gambar Atlas Cloud dengan output

Area bermain GPT Image 2 di Atlas Cloud dengan prompt pukul 3 pagi diketik dan bingkai dasar selesai di panel output

GPT Image 2 di Atlas Cloud: kualitas high, 16:9, bingkai dasar dirender di sebelah kanan. Tingkatan kualitas tinggi mengutip $0,1745 untuk eksekusi ini, jauh di atas lantai daftar $0,009, jadi sesuaikan anggaran berdasarkan tingkatan.

Pria berhoodie melihat dua monitor komputer di malam hari

Bingkai dasar yang dihasilkan: seorang pengembang lelah pada pukul 3 pagi menonton bilah unduhan di monitor kiri

Output Langkah 1. Bingkai tunggal ini memberi makan Langkah 2 dan 3.

Langkah 2: Gambar ke Video, Pekerjaan yang Dilakukan Checkpoint fl2va

Ini adalah endpoint yang sesuai dengan minimax_h3_fl2va_pruned_int8_convrot.safetensors. Satu bingkai pertama masuk, gerakan dan suara keluar. Secara lokal ini adalah file yang akan Anda muat; dihosting, itu adalah satu panggilan API.

Model: minimax/h3/image-to-video. Pengaturan: image = bingkai Langkah 1 diteruskan sebagai URL data, resolution: 2K, duration: 5, ratio: 16:9.

plaintext
1Pengembang tetap diam, hanya bernapas dan berkedip, mata terpaku pada monitor kiri. Bilah progres di monitor kiri merayap maju. Kipas casing menyala dan sinar RGB mereka berdenyut lebih terang. Sesaat sebelum akhir dia menghela napas dan bahunya turun. Kamera terkunci, tidak ada gerakan kamera, tidak ada zoom, tidak ada potongan. Audio: dengungan kipas casing rendah yang meninggi, hujan samar di jendela, satu nada dua not lembut di dekat akhir.
2

Berikan gambar sebagai URL data base64 daripada URL penyimpanan yang baru dihasilkan. URL objek baru dapat gagal dalam pemeriksaan unduhan hulu. Juga perhatikan bahwa H3 benar-benar mematuhi "kamera terkunci," yang tidak berlaku secara universal untuk model video di kelas ini.

Tangkapan layar antarmuka generator gambar-ke-video MiniMax

Area bermain MiniMax H3 gambar-ke-video di Atlas Cloud dengan bingkai dasar dimuat dan klip 2K selesai di panel output

MiniMax H3 gambar-ke-video: bingkai dasar dimuat, 2K, eksekusi selesai. Tangkapan ini menggunakan default endpoint 8 detik, itulah mengapa kutipan terbaca $1,12. Klip yang disematkan di bawah adalah versi 5 detik seharga $0,70.

Pria lelah menunggu bilah pemuatan komputer di malam hari

Pekerjaan fl2va: satu bingkai masuk, lima detik gerakan plus dengungan kipas stereo keluar.

Langkah 3: Referensi ke Video, Pekerjaan yang Dilakukan Checkpoint ref2va

Checkpoint berbeda, file berbeda, tugas berbeda. ref2va tidak memperpanjang bingkai pertama. Ia mengambil bahan referensi dan membangun bidikan baru yang menjaga identitas dan objek tetap konsisten. Itulah mengapa repositori mengirimkan dua file 21 GB alih-alih satu.

Saya memberikannya dua referensi: bingkai Langkah 1 untuk orang dan ruangan, dan foto makro kartu grafis untuk perangkat keras.

Model: minimax/h3/reference-to-video. Pengaturan: refers = kedua gambar, resolution: 2K, duration: 8, ratio: 16:9.

plaintext
1Pria yang sama, hoodie abu-abu yang sama, wajah yang sama, di kantor rumah gelap yang sama. Bidikan baru: close-up sedang dari samping saat dia bersandar di kursi dan menghela napas panjang, sudut mulutnya sedikit terangkat. Kartu grafis di gambar referensi kedua terlihat di atas bahunya, kipasnya melambat, RGB menjadi warna stabil. Jaga identitasnya, hoodie, rambut, dan pencahayaan ruangan tetap konsisten dengan gambar referensi. Kamera terkunci. Audio: dengungan kipas mereda, satu tekan tombol keyboard, hujan berlanjut.
2

refers mengambil array campuran gambar, video, dan audio, setidaknya satu gambar atau video. Audio saja ditolak. Endpoint ini juga menerima durasi hingga 15 detik.

Satu jebakan pada endpoint ini secara khusus: set ratio secara eksplisit. Membiarkannya pada adaptive kembali sebagai 400 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive', empat kali berturut-turut, termasuk dari area bermain dengan kedua referensi yang jelas terlampir. Dengan ratio: "16:9" dalam panggilan API, ia berjalan pertama kali. Ini juga mengapa tangkapan layar di bawah adalah gambar referensi daripada tangkapan area bermain: Saya tidak bisa mengontrol Kontrol Rasio Aspek area bermain dari adaptive, jadi klip yang Anda lihat di sini berasal dari API dengan pengaturan di atas, bukan dari eksekusi area bermain.

Kartu grafis tiga kipas dipasang vertikal di dalam casing komputer

Gambar referensi kedua: foto makro kartu grafis tiga kipas di dalam casing PC terbuka di malam hari

Gambar referensi 2, dihasilkan dalam batch yang sama dengan bingkai dasar, diteruskan bersama bingkai Langkah 1.

Pria mengetik di meja dengan dua monitor di malam hari

Pekerjaan ref2va: sudut pandang baru, bukan kelanjutan. Pria yang sama, hoodie yang sama, ruangan yang sama, dan kartu grafis dari referensi 2 sekarang berada dalam bingkai dengan kipasnya melambat. Perhatikan bahwa ia menafsirkan "close-up sedang" secara longgar dan tetap cukup lebar.

Langkah 4: Teks ke Video, Dasar Bobot Sumber Terbuka MiniMax H3

Adegan yang sama, dijelaskan dengan kata-kata, tanpa referensi sama sekali. Langkah ini ada untuk menunjukkan kepada Anda hal yang sebenarnya digunakan oleh kedua checkpoint.

Model: minimax/h3/text-to-video. Pengaturan: ratio wajib di sini dan tidak boleh adaptive, jadi 16:9. resolution: 2K, duration: 5.

plaintext
1Seorang pengembang lelah dengan hoodie abu-abu pada pukul 3 pagi di kantor rumah yang berantakan, diterangi oleh dua monitor dan sinar RGB dari casing PC terbuka, menonton bilah progres unduhan merayap di layar kiri. Hujan di jendela di belakangnya. Bidikan 35mm terkunci, kedalaman bidang dangkal, cahaya monitor hangat berlawanan dengan cahaya jendela dingin, butiran film. Audio: dengungan kipas casing meninggi, hujan samar, nada selesai lembut di akhir.
2

Antarmuka AI teks-ke-video menampilkan prompt dan output video yang dihasilkan

Area bermain MiniMax H3 teks-ke-video di Atlas Cloud dengan prompt diketik dan klip selesai di panel output

MiniMax H3 teks-ke-video: tanpa bahan referensi, 2K, Rasio Aspek diatur ke 16:9 karena adaptive ditolak di sini, eksekusi selesai. Prompt yang sama, dan sudah wajah yang berbeda dari yang di Langkah 2.

Pria berhoodie abu-abu melihat layar komputer di malam hari

Kata-kata yang sama, manusia yang berbeda. Ruangan yang bagus, orang yang salah. Celah itu adalah seluruh argumen untuk fl2va dan ref2va ada sebagai checkpoint terpisah.

Satu catatan operasional jika Anda membuat skrip ketiganya: konkurensi hulu kira-kira satu tugas. Pekerjaan yang tumpang tindih kembali sebagai 429 rate limit exceeded (task concurrency). Jalankan secara seri. Klip 2K 5 detik memakan waktu sekitar dua menit setiap kali.

Berapa Biaya Bobot Sumber Terbuka MiniMax H3, dan Apa Isi Lisensi Sebenarnya

Pertanyaan biaya memiliki dua mata uang. Dihosting, klip 2K 5 detik adalah $0,70 dan yang 15 detik adalah $2,10, per detik, tanpa tingkatan, tanpa diskon. Lokal, mata uangnya adalah gigabyte dan jam: 42,5 GB melalui pipa, kartu yang dapat menampungnya, dan kanvas 768px kecuali Anda juga menjalankan lintasan regenerasi. Di suatu tempat di atas beberapa ratus klip per bulan, perhitungannya berbalik. Di bawah itu, sebagian besar tidak.

Kemudian ada mata uang ketiga, yaitu waktu tinjauan hukum. Saya membaca seluruh LICENSE. Inilah isinya.

Laptop terbuka dan tumpukan kertas diterangi oleh lampu meja

Lampu meja menerangi laptop yang menampilkan dokumen teks padat, di samping cetakan yang disorot, kacamata baca, dan segelas air

Bagian dari rilis bobot terbuka yang tidak ada yang mengambil tangkapan layar untuk thread peluncuran.

KlausulBagianApa yang dikatakannyaArtinya bagi Anda
Wilayah BerlakuI.3, I.5Di seluruh dunia, "tidak termasuk Wilayah Terlarang," yang didefinisikan sebagai "Uni Eropa, Inggris, Republik Korea, dan Amerika Serikat"Lisensi komunitas tidak memberi Anda hak di tempat tinggal sebagian besar pembaca artikel ini
Larangan penggunaan teritorialV.4Anda tidak boleh "menggunakan, mereproduksi, memodifikasi, mendistribusikan, atau menampilkan Karya MiniMax H3 atau Output atau hasilnya di luar Wilayah Berlaku"Ini menjangkau Output, bukan hanya bobot
Saluran lisensi terpisahIIMiniMax akan "terus mengevaluasi hukum yang berlaku" dan mengundang pihak di wilayah yang dikecualikan untuk menghubungi mereka untuk mendapatkan lisensiIni "belum", bukan "tidak pernah." Repositori mengirimkan formulir aplikasi
AtribusiIV.2Anda "harus menampilkan secara menonjol 'MiniMax H3' pada antarmuka pengguna" dari produk komersial apa pun yang menggunakannyaPerubahan UI, bukan catatan kaki
Ambang pendapatanIV.1Di atas pendapatan tahunan $20 juta, Anda memerlukan otorisasi tertulis sebelumnya dari [email protected]Penggunaan komersial gratis memiliki batas
Larangan pencucian modelV.3Anda tidak boleh menggunakan H3 atau Output-nya "untuk meningkatkan model kecerdasan buatan lainnya"Melarang distilasi ke dalam model Anda sendiri
RedistribusiIII.1, III.4Kirimkan perjanjian bersamanya, sertakan file NOTICE, tandai file yang dimodifikasiStandar, tetapi ini mengikat pengguna hilir juga
Pengode teksCatatan TambahanPengode adalah Qwen3-VL-32B di bawah Apache 2.0Satu komponen dari tumpukan benar-benar terbuka OSI
Hukum yang berlakuIXHukum SAR Hong Kong, yurisdiksi eksklusif Hong KongLayak untuk satu baris di daftar risiko Anda

Tanggal efektif perjanjian adalah 2 Agustus 2026 (Hugging Face, Agustus 2026).

Sebagian besar liputan peluncuran mengarah dengan "bobot terbuka" dan berhenti di situ. Untuk kredit MiniMax, mereka tidak menyembunyikannya: repositori membawa docs/QA-about-License.md sendiri yang menjelaskan bahwa model video menghadapi gambaran regulasi yang bergerak lebih cepat daripada model teks, menyebutkan EU AI Act, aturan Inggris dan Korea, serta litigasi hak cipta AS yang sedang berlangsung atas video generatif, dan menyatakan dengan jelas bahwa "batasan saat ini berarti 'belum', bukan 'tidak pernah'." Dokumen yang sama mengonfirmasi pemisahan yang penting secara operasional: API tetap tersedia secara global karena MiniMax mengontrol infrastruktur penyajian, sementara bobot terbuka meninggalkan kendali itu.

Jadi jika Anda di San Francisco, Berlin, London, atau Seoul, bacaan praktisnya bukanlah "Anda tidak akan pernah bisa menyentuh H3." Itu adalah "lisensi khusus ini bukanlah instrumen yang memungkinkan Anda menjalankan bobot ini di kotak Anda sendiri." Ajukan lisensi terpisah, atau gunakan endpoint yang dihosting, di mana Anda adalah pelanggan layanan daripada penerima lisensi bobot.

Saya bukan pengacara dan ini bukan nasihat hukum. Teks klausul di atas dikutip sehingga penasihat Anda yang sebenarnya dapat membaca aslinya dalam waktu sekitar sepuluh menit.

Bobot Sumber Terbuka MiniMax H3: Pertanyaan yang Sering Diajukan

Apakah bobot sumber terbuka MiniMax H3 benar-benar dirilis, dan di mana saya mengunduhnya?

Ya, per awal Agustus 2026. Dua tempat. MiniMaxAI/MiniMax-H3 adalah repositori resmi, sekitar 498 GB, berisi pipeline format diffusers, kedua transformer, pengode teks, kedua VAE, dokumen, dan skrip yang dapat direproduksi. Comfy-Org/MiniMax-H3 adalah build ComfyUI yang dikemas ulang, total sekitar 343 GB, dengan checkpoint file tunggal terkuantisasi yang sebagian besar orang inginkan. Jika Anda menjalankan ComfyUI, gunakan yang kedua dan unduh empat file.

Berapa banyak parameter yang dimiliki MiniMax H3, dan apakah saya memerlukan superkomputer?

33B, dalam Transformer padat aliran tunggal. Sekitar 13B dari itu berada di cabang terkait AdaLN yang outputnya dapat dihitung dan di-cache, sehingga penerapan hanya inferensi tidak perlu memuatnya. Itulah yang dimaksud dengan checkpoint "dipangkas". Tidak perlu superkomputer. Unduhan 42,5 GB dan GPU konsumen yang serius.

Bisakah saya menjalankan bobot sumber terbuka MiniMax H3 pada VRAM 12 GB atau 16 GB?

Tim ComfyUI mengatakan kartu 12 GB dapat melakukannya dengan offloading dinamis, menggunakan checkpoint fl2va int8 yang dipangkas ditambah pengode teks AWQ nvfp4. Itu adalah klaim mereka, bukan tolok ukur yang saya jalankan. Dua peringatan: offloading menukar VRAM dengan RAM sistem, jadi anggarkan 64 GB RAM dan harapkan waktu render yang lama, dan kanvas lokal Anda adalah 768px sisi pendek, bukan 2K.

Apakah bobot sumber terbuka MiniMax H3 benar-benar sumber terbuka, atau hanya bobot terbuka?

Bobot terbuka, tepatnya. Bobotnya dapat diunduh dan dimodifikasi, yang lebih dari yang ditawarkan model video frontier setahun yang lalu. Tetapi lisensinya tidak disetujui OSI, resep dan data pelatihan tidak dipublikasikan, penggunaan komersial membawa kondisi atribusi dan pendapatan, dan klausul wilayah membatasi di mana hibah berlaku. Satu-satunya komponen yang benar-benar terbuka adalah pengode Qwen3-VL-32B di bawah Apache 2.0. Tiga lapisan terpisah, dan "terbuka" hanya secara bersih menggambarkan yang pertama.

Bisakah saya menggunakan bobot sumber terbuka MiniMax H3 secara komersial, dan apa arti garis $20M?

Ya, dengan dua syarat. Anda harus menampilkan secara menonjol "MiniMax H3" pada antarmuka pengguna produk komersial (Bagian IV.2). Dan jika produk dan layanan komersial Anda menghasilkan lebih dari $20 juta pendapatan tahunan, Anda memerlukan otorisasi tertulis sebelumnya dari MiniMax sebelum menggunakannya, diminta di [email protected] (Bagian IV.1). Ambang batasnya adalah pada pendapatan Anda, bukan pada penggunaan H3 Anda.

Mengapa lisensi MiniMax H3 mengecualikan AS dan UE, dan apa pilihan saya?

Menurut Tanya Jawab lisensi MiniMax sendiri, karena generasi video berada dalam lingkungan regulasi yang bergerak lebih cepat daripada teks, khususnya EU AI Act, aturan Inggris dan Korea Selatan yang berkembang, dan litigasi hak cipta AS yang aktif atas video generatif. Begitu bobot menjadi publik, mereka tidak dapat menegakkan perlindungan di hilir, jadi mereka membatasi hibah alih-alih menunda rilis. Pilihan di wilayah yang dikecualikan: ajukan lisensi terpisah melalui formulir di repositori, atau gunakan API yang dihosting, yang merupakan hubungan hukum yang berbeda dan tetap tersedia secara global. Minta penasihat Anda mengonfirmasi mana yang cocok sebelum Anda menerapkan.


Diverifikasi 3 Agustus 2026. Tiga hal dalam daftar tindak lanjut: GGUF komunitas dan kuantisasi bit lebih rendah (belum ada untuk H3), perubahan apa pun pada daftar Wilayah Terlarang, dan apakah tingkatan 768p yang dihosting yang masih didokumentasikan readme akan kembali lagi.

Model Terbaru

Satu API untuk semua AI multimedia.

Jelajahi semua model