
Suite colour grading larut malam, enam monitor menampilkan enam shot berbeda dari penyanyi berambut perak yang sama_Enam_ shot, satu artis, satu lagu. Dibuat dengan openai/gpt-image-2/text-to-image .
Pengguna Suno membuat sekitar 7 juta lagu per hari, kurang lebih setara satu katalog penuh Spotify setiap dua minggu (TechCrunch, Februari 2026). Hampir tidak ada satu pun yang akan pernah punya gambar pendamping. Bukan karena gambarnya mustahil dibuat, tetapi karena jalur tradisional melewati empat alat: membuat still image, menganimasikannya, menjalankan proses lip-sync terpisah, lalu memperbaiki semuanya di editing. Setiap perpindahan membuat wajah, wardrobe, atau beat ikut meleset.
Jadi saya melewati semua perpindahan itu. Saya menjatuhkan potongan chorus 8 detik langsung ke slot referensi sebuah model video dan menekan Run. Untuk audionya, saya tidak dikenai biaya apa pun.
Lalu saya membongkar mp4 yang sudah jadi untuk menjawab satu pertanyaan yang tidak pernah dijawab gamblang oleh siapa pun di internet: apakah suara yang keluar lagi dari model itu lagu saya, atau sesuatu yang dibuatnya sendiri dan hanya terdengar mirip? Saya mengukurnya. Jawabannya bukan seperti yang saya perkirakan, dan itu mengubah cara Anda sebaiknya mengeditnya.
Poin utama
- Audio referensi gratis. MiniMax H3 hanya menagih detik output. Empat potongan referensi 8 detik saya menambah $0,00 ke tagihan. Referensi video yang mahal.
- 15 detik adalah batas per generasi, bukan per proyek. Potong lagunya, buat satu shot untuk tiap potongan, gabungkan. Cut 32 detik saya terdiri dari empat generasi.
- Tulis hook di 120 BPM. Satu bar persis 2,000 detik, sehingga nilai
durationbilangan bulat milik H3 jatuh tepat di garis bar tanpa perlu digeser manual. 8d = 4 bar.- Audio output adalah trek Anda, selaras sampai sampel. Saya mengukur korelasi waveform 0,892 pada zero lag antara potongan input saya dan mix stereo yang dikirim H3. Itu bukan hasil regenerasi. Anda tetap sebaiknya menaruh master kembali untuk final cut, karena alasan lain (di bawah).
- Total biaya nyata: $7,53 untuk sembilan generasi termasuk yang gagal. Empat shot yang masuk final cut, plus lagu dan base frame, totalnya $4,80.
Video Musik MiniMax H3 yang Saya Edit dari Satu Hook 32 Detik
Nyalakan suara. Ini empat generasi terpisah, digabung tanpa transisi, dengan master asli 32 detik ditaruh kembali di atasnya.
"MIRA", 32 detik, 2560x1440, 24 fps. Empat generasi minimax/h3/reference-to-video masing-masing 8 detik, $1,12 per shot. Lagu masuk sebagai audio referensi dan biayanya $0,00.
Empat generasi, empat dunia pencahayaan yang benar-benar berbeda, satu wajah. Tidak ada yang di-retouch di antaranya.

Empat frame dari empat shot yang menampilkan penyanyi yang sama di rooftop neon, jalan raya gurun, studio putih, dan tangki air hitam_Satu_ frame diambil dari tiap klip yang dikirim. Rambut sama, atasan mesh sama, choker LED merah sama melintasi hujan, matahari rendah, high-key datar, dan bawah air.
Mengapa Kebanyakan Percobaan Video Musik MiniMax H3 Berantakan di Detik Keenam Belas
Tiga mode kegagalan, semuanya bisa dihindari.
Satu: menganggap 15 detik sebagai batas proyek. H3 membatasi satu generasi pada 15 detik. Orang membaca itu, menyimpulkan "tidak bisa untuk video musik", lalu menyerah. Padahal video musik memang tidak pernah berupa satu shot. Video musik sungguhan biasanya cut setiap 4 sampai 8 detik. Batas itu hanya memaksa Anda melakukan apa yang memang akan dilakukan editor.
Dua: mendeskripsikan ritme dengan kata-kata. "Ceria, energik, menari mengikuti beat" tidak memberi model sesuatu untuk dikunci. Ia mengarang tempo sendiri, dan titik cut Anda akan selamanya meleset setengah beat. Memberinya audio asli menghilangkan tebakan itu.
Tiga: membiarkan wardrobe bergeser. Setiap shot membutuhkan gambar referensi yang sama dan redaksi wardrobe yang sama, persis. Ubah "black mesh top" menjadi "dark mesh shirt" di antara shot, dan Anda mendapatkan orang yang berbeda.
Ini biaya nyata dari dua jalur tersebut:
| Rangkaian tradisional empat alat | Satu panggilan referensi H3 | |
|---|---|---|
| Alat per shot | Model gambar, model video, alat lip-sync, NLE | Satu endpoint, lalu NLE di akhir |
| Langkah manual per shot | 4 handoff, 3 ekspor file | 1 submit |
| Yang menjaga karakter | Re-prompt manual dan keberuntungan | Satu gambar referensi dipakai ulang persis |
| Gambar dan suara | Dirender terpisah, diselaraskan kemudian | Dibuat dalam proses yang sama, stereo 32 kHz |
| Biaya per shot 8 detik | Empat meter terpisah | $1,12 di 2K, $0,80 di 768P |
Agar adil terhadap jalur lama: itu bukan fantasi. Kreator Jepang Arata Fukoe meraih perunggu Project Odyssey dengan video musik sepenuhnya AI, dan Queen maupun Linkin Park telah merilis video resmi berbantuan AI. Rangkaian itu hanya melewati empat atau lima alat, tepat hal yang tidak sempat dilakukan artis independen dengan satu lagu.
Apa yang Sebenarnya Diberikan Audio Referensi pada Video Musik MiniMax H3
Bagian ini perlu dipahami sebelum Anda mengeluarkan biaya.
H3 menghasilkan gambar dan suara dalam satu proses, bukan melakukan dubbing audio ke frame yang sudah jadi. Saat Anda memberinya trek referensi, trek itu bukan catatan mood. Saya membandingkan potongan input saya dengan stream audio di dalam mp4 yang dikirim, pada level waveform, memakai downmix mono 8 kHz:
- Korelasi envelope: 0,956 pada zero lag
- Korelasi waveform mentah pada jendela 2 detik: 0,892 pada offset nol sampel
Itu bukan model yang mereproduksi lagu mirip. Itu file Anda, selaras sampai sampel, dengan ambience yang diminta prompt dilapiskan di atasnya dan satu putaran re-encoding AAC. Sebagai perbandingan, pengukuran yang sama terhadap control take yang dibuat tanpa audio referensi menghasilkan 0,26, yaitu noise floor.

Waveform potongan input di atas, audio yang dikirim H3 di bawah, disejajarkan pada offset nol_Atas: mp3 8 detik yang saya unggah. Bawah: stream audio di dalam mp4 yang dikembalikan H3. Peak sama, posisi sama, tanpa offset._
Batas inputnya ketat, dan diterapkan saat submit, bukan diam-diam:
| Input referensi | Batas | Ditagih |
|---|---|---|
| Gambar | hingga 9 | gratis di endpoint H3 Atlas Cloud |
| Video | hingga 3, masing-masing 2-15d | ditagih pada tarif output |
| Audio | hingga 3, masing-masing 2-15d, total 15d untuk semua klip | $0,00 |
| Audio saja | ditolak, butuh setidaknya satu gambar atau video | n/a |
Saya sengaja menguji batas total audio dengan mengirim tiga potongan 8 detik dalam satu panggilan. Gagal dalam 5,8 detik dengan invalid params, total audio duration 24138 ms exceeds 15000 ms dan tidak ditagih. Kabar baik: H3 tidak diam-diam membuang file ekstra lalu tetap menagih Anda.
Satu jebakan lagi yang saya alami sebelumnya. Jika Anda mengirim audio sebagai URL data base64, tipe MIME menentukan ekstensi yang disimpulkan API. data:audio/mpeg ditolak dengan audio format ".mpeg" not allowed. data:audio/mp3 lancar. Empat submit mati karena itu sebelum saya menyadarinya, semuanya gratis.
Workflow Video Musik MiniMax H3, dan Biaya Tiap Detiknya
Semua di bawah ini berjalan melalui satu API key di Atlas Cloud, tempat saya menjalankan dan menagih semuanya. Tiga model, satu tab browser.
| Langkah | Model | Fungsinya | Harga yang benar-benar ditagihkan ke saya |
|---|---|---|---|
| Tulis hook | minimax/music-2.6 | Lagu penuh dari style prompt plus lirik, mp3 hingga ~5 menit | $0,15 per lagu, flat |
| Kunci artis | openai/gpt-image-2/text-to-image | Satu base frame yang diwarisi setiap shot | $0,1745 pada quality high, 2048x1152 |
| Ambil tiap shot | minimax/h3/reference-to-video | Gambar plus audio masuk, klip terkunci beat dengan suara stereo keluar | $0,14/d di 2K, $0,10/d di 768P. Input audio $0,00 |
Dua catatan tentang tabel itu, karena angka yang tercantum menipu ke dua arah. GPT Image 2 menampilkan floor $0,009 di katalog; itu tier token terbawah, dan render high 2048x1152 sungguhan ditagih $0,1745. Entri katalog H3 menampilkan $0,10, yang hanya tier 768P; job 2K 8 detik saya masing-masing ditagih tepat $1,12, yaitu $0,14 per detik.
Jika Anda menginginkan kunci first-frame alih-alih referensi subjek, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) memakai tarif yang sama, dan [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) mencakup shot prompt murni.
Koreksi yang patut dibuat: versi awal rencana ini mengasumsikan Anda harus membawa lagu sendiri karena belum ada generator lagu penuh di platform. Sekarang sudah ada. minimax/music-2.6 menulis treknya, jadi seluruh rangkaian, termasuk lagu, berjalan di satu tempat.
Cara Membuat Video Musik MiniMax H3, Langkah demi Langkah
Langkah 1: Tulis Hook 120 BPM dan Potong Menjadi Slice per Shot
Minta 120 BPM secara eksplisit. Pada 120 BPM satu bar persis 2,000 detik, sehingga enum duration bilangan bulat milik H3 jatuh tepat di garis bar secara gratis: 4d = 2 bar, 6d = 3 bar, 8d = 4 bar, 10d = 5 bar. Cut Anda jatuh di downbeat tanpa menyentuh satu marker pun.
Model: minimax/music-2.6. Settings: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.
Style prompt:
Plain1Synth-pop at exactly 120 BPM, straight four-on-the-floor kick, bright analog 2sidechained pads, clean female lead vocal sitting forward in the mix, wide 3stereo chorus, no rap, sustained open vowels, cinematic and slightly 4melancholy, radio-ready master
Lyrics:
Plain1[Chorus] 2Hold the line, hold the light 3I am running out of night 4Say my name into the rain 5And I will burn again
Model itu mengembalikan trek 70 detik dalam 75 detik seharga $0,15. Lalu saya mengecek temponya alih-alih mempercayainya begitu saja, dengan menjalankan autocorrelation onset-novelty pada file. Lag terkuat muncul tepat di 0,500 d, yaitu 120 BPM, dan grid beat dimulai pada 0,24 d di dalam file yang didekode, bukan pada nol. Offset itu penting: potong dari 0,24 dan setiap slice dimulai di downbeat.
Bash1# 32-second master, starting on the downbeat at 0.24s 2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3 3 4# four 8-second slices, one per shot, each 4 bars and well under the 15s cap 5for i in 0 8 16 24; do 6 ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3 7done
Jika Anda sudah punya trek sendiri, lewati langkah ini sepenuhnya. Itu kasus normal, dan paling murah.
Langkah 2: Kunci Artis dengan Satu Base Frame GPT Image 2
Setiap shot mereferensikan satu file ini. Apa pun yang salah di sini akan salah empat kali, jadi keluarkan $0,17 dan periksalah dengan benar.
Model: openai/gpt-image-2/text-to-image. Settings: quality high , size 2048x1152 (16:9).
Plain1Cinematic music-video still, waist-up portrait. A 25-year-old East Asian female 2synth-pop singer with silver-white cropped hair and a straight-cut fringe, a matte 3black mesh top, a thin red LED choker glowing against her collarbone, and a single 4silver ear cuff. She stands on a rain-soaked rooftop at night holding a vintage 5chrome handheld microphone close to her mouth. Behind her, out-of-focus magenta 6and cyan neon signage, fine rain caught in a hard backlight, steam drifting from a 7vent. Shot on 35mm anamorphic, shallow depth of field, teal-and-magenta grade, 8visible film grain. Her face is sharp and evenly lit by a soft key from camera 9left. No text anywhere in the frame.

Base frame yang dibuat: penyanyi berambut perak dengan mikrofon chrome di rooftop neon basah hujan_Base_ frame yang diwarisi setiap shot berikutnya. Dibuat dengan openai/gpt-image-2/text-to-image , quality high, 2048x1152, ditagih $0,1745.

GPT Image 2 menjalankan prompt persis ini di playground Atlas Cloud dengan frame jadi di panel output
Prompt yang sama di playground: Size 16:9 pada 2048x1152, Quality high, dan tombol Run menampilkan $0,1745, persis seperti yang benar-benar ditagihkan API ke saya. $0,009 di katalog adalah tier token terbawah, bukan yang ini. Prompt sama, seed berbeda, jadi render ini bukan file persis di atas.
Kata-kata wardrobe dalam prompt itu (silver-white cropped hair, matte black mesh top, red LED choker, silver ear cuff) digunakan ulang persis di setiap prompt di bawah. Pengulangan itulah seluruh mekanisme konsistensinya. Jangan parafrasekan.
Langkah 3: Jalankan Shot Video Musik MiniMax H3 Pertama dengan Audio Referensi Gratis
Model: minimax/h3/reference-to-video. Settings: refers = base frame plus slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.
Set ratio secara eksplisit. Default playground adalah adaptive, dan endpoint jauh lebih senang saat Anda menyebut bentuk yang Anda inginkan.
Plain1Music video shot. The woman in the reference image sings the reference track 2straight down the lens on the wet neon rooftop, holding the chrome microphone at 3her mouth. She lands the first line hard on the downbeat, eyes locked to camera, 4then tilts her head back on the sustained note. Slow push-in from waist-up to a 5tight close-up across the eight seconds, handheld micro-drift, rain streaks 6crossing the hard backlight. Her mouth shapes follow the sung vowels of the 7reference audio exactly, she is singing, not speaking. Identical silver-white 8cropped hair, matte black mesh top and glowing red LED choker as the reference 9image. Soundscape: the reference track in stereo, plus faint rain and a distant 10city hum low in the mix.
Shot 1, nyalakan suara. 2560x1440, tepat 8,00 d, 24 fps, stereo 32 kHz. 345 detik dari submit sampai file, ditagih $1,12. Perhatikan kepala yang mendongak ke belakang pada note panjang sekitar detik ke-5.

Playground reference-to-video dengan base frame dan slice audio dimuat serta klip jadi di panel output
Reference Materials terbaca 2/9: slice-0.mp3 di satu slot, base frame di slot lain. Resolution 2K, Duration 8, dan tombol Run menampilkan $1,12, persis 8 x $0,14. Perhatikan dropdown Aspect Ratio berada di adaptive , yaitu default halaman; panggilan API saya mengatur ratio ke 16:9 secara eksplisit.
Satu angka yang layak dicatat: duration: 8 menghasilkan container persis 8,00 detik. duration: 4 menghasilkan 4,46 detik. Jika Anda berencana menggabungkan di garis bar, tetaplah pada durasi yang kembali persis.
Langkah 4: Ambil Tiga Dunia Lagi Tanpa Kehilangan Wajah
Base frame sama, kalimat wardrobe sama, slice audio berikutnya. Semua yang lain berubah.
4a. Jalan raya gurun saat golden hour. refers = base frame + slice-8.mp3, 2K, duration: 8, ratio: 16:9.
Plain1Music video shot. The same woman from the reference image stands on the centre 2line of an empty desert highway at golden hour, no microphone, an open indigo 3denim jacket over the same matte black mesh top, the red LED choker still lit. She 4mouths the chorus of the reference track into the wind while the camera tracks 5backwards low over the asphalt. Heat shimmer off the road, dust lifting, her 6shadow stretching long toward the lens, an anamorphic flare crossing at the 7halfway point. Hair, face and wardrobe identical to the reference image. 8Soundscape: the reference track over open desert wind, wide and airy.
Shot 2, nyalakan suara. Wajah sama, temperatur warna berlawanan, dan trek referensi di-mix ulang di bawah angin terbuka. 332 d, $1,12.
4b. White infinity cove. refers = base frame + slice-16.mp3, 2K, duration: 8, ratio: 16:9.
Plain1Music video shot. The same woman from the reference image in a pure white 2infinity-cove studio under flat high-key light with no shadows, wearing a glossy 3red vinyl trench coat over the same matte black mesh top, red LED choker visible 4at the collar. She dances four bars to the reference track, silver-white hair 5whipping on each turn. Locked-off wide frame, then a hard snap-zoom to a medium on 6the second downbeat. Small white paper squares fall like confetti through the 7final two seconds. Face and hair identical to the reference image. Soundscape: the 8reference track, dry and close, plus the squeak of shoes on the studio floor.
Shot 3, nyalakan suara. Cahaya datar tanpa bayangan adalah tempat paling sulit untuk menyembunyikan face swap, dan itu bertahan . 8,00 d, $1,12.
4c. B-roll bawah air, tanpa lip sync. refers = base frame + slice-24.mp3, 2K, duration: 8, ratio: 16:9.
Plain1Music video shot. The same woman from the reference image suspended underwater in 2a black tank, silver-white hair floating out around her, the red LED choker 3glowing through the water, the black mesh top billowing slowly. One hard beam of 4light from directly above; bubbles rise past the lens in slow motion. She opens 5her eyes on the downbeat and reaches one hand toward the surface. She does not 6sing and her mouth stays closed. The camera rotates thirty degrees around her 7across the shot. Face identical to the reference image. Soundscape: the reference 8track heard from above the surface, muffled and low-passed, with bubble 9transients.
Shot 4, nyalakan suara. Instruksi "she does not sing and her mouth stays closed" dipatuhi, dan itulah bagian yang berguna: audio referensi menggerakkan timing, bukan performa wajib. 329 d, $1,12.
Langkah 5: Jalankan Control Take, dengan Slot Audio Kosong
Prompt sama seperti Langkah 3, kata demi kata. Satu-satunya perubahan: refers berisi gambar dan tidak ada yang lain. 768P, duration: 8.
Satu klip ini menjelaskan seluruh mekanismenya lebih baik daripada paragraf mana pun. Dengarkan bersebelahan dengan Langkah 3.
Control take. Prompt identik, tanpa audio referensi, 1344x768, 8,00 d, 200 d, $0,80. H3 menulis soundtrack-nya sendiri, dan performanya menjadi generik "seseorang sedang bernyanyi" alih-alih kata-kata ini.
Diukur terhadap master saya, audio control mencetak korelasi envelope 0,26. Langkah 3 mencetak 0,956. Selisih itu yang Anda dapat dari slot audio gratis.
Langkah 6: Rusak Lip Sync dengan Sengaja
Setiap model punya batas suku kata. Menemukan batas Anda biayanya $0,40.
Saya membuat trek rap double-time terpisah (minimax/music-2.6 lagi, $0,15), memotong slice 4 detik dengan kira-kira enam suku kata per detik, dan memasukkannya ke setup rooftop yang sama pada 768P, duration: 4.
Plain1Music video shot. The woman in the reference image raps the reference track 2straight down the lens on the wet neon rooftop, holding the chrome microphone at 3her mouth, delivering every syllable of the fast double-time verse. Locked-off 4medium close-up, slight handheld drift, rain streaks in the hard backlight. Her 5mouth shapes follow the rapped syllables of the reference audio exactly. Identical 6silver-white cropped hair, matte black mesh top and glowing red LED choker as the 7reference image. Soundscape: the reference track in stereo plus faint rain.
Stress test, nyalakan suara. 1344x768, 4,46 d, 192 d, $0,40. Mulutnya tetap sibuk dan tetap di beat, tetapi berhenti menyelesaikan konsonan individual dan masuk ke siklus buka-tutup berulang. Baris yang dinyanyikan mendapat bentuk vokal yang berbeda; ini tidak.
Pembacaan jujur saya dari file yang dikirim: vokal nyanyian yang ditahan adalah tempat kerja mulut H3 benar-benar meyakinkan, dan konsonan rap yang padat adalah tempat ia menurun menjadi gerak yang sekadar masuk akal. Rencanakan close-up Anda di sekitar baris yang dinyanyikan dan letakkan bar cepat di b-roll. Ada detail lebih lanjut tentang perbedaan bicara-versus-bernyanyi dalam uraian lip sync dan audio.
Langkah 7: Stitch, Mute, dan Taruh Master Kembali di Atas Video Musik MiniMax H3 Anda
Empat klip yang persis 8,00 detik bergabung menjadi persis 32,00 detik, yaitu 16 bar pada 120 BPM. Tanpa trimming.
Bash1# 1. strip each clip's audio 2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do 3 ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4 4done 5 6# 2. concatenate in bar order (4 x 8s = 32s = 16 bars @ 120 BPM) 7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt 8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4 9 10# 3. lay the original master back 11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4
Mengapa repot mematikan suara, jika model sudah mengembalikan trek Anda? Karena mix stereo setiap klip membawa ambience yang diminta prompt klip itu: hujan di shot 1, angin gurun di shot 2, filter low-pass bawah air di shot 4. Indah per shot, kacau saat dipotong. Master memberi Anda satu mix kontinu pada bitrate penuh tanpa re-encode per shot. H3 memberikan sinkron performa. Master Anda memberikan lagunya.
Empat Variasi Resep Video Musik MiniMax H3
Cut rilis vertikal. Set ratio: 9:16 dan Anda mendapatkan Spotify Canvas atau potongan Shorts dari base frame yang sama dan slice yang sama. Hasilnya benar-benar 768x1344, jadi tidak seperti dropdown aspect di playground, nilai ratio API memang menempel. Canvas loop memang silent secara desain, jadi yang ini dikirim sebagai GIF.

Loop vertikal 9:16 dari artis yang sama di rooftop neon_Base frame sama, slice referensi sama,_ ratio: 9:16 di 768P seharga $0,80. Satu catatan jujur: saya meminta "not singing" dan tetap mendapat singing. Dengan vokal di slot referensi, audio memenangkan argumen. Jika Anda ingin performer diam, berikan slice instrumental.
Video referensi alih-alih gambar referensi. Anda bisa memberi H3 hingga tiga klip video referensi untuk membawa gerak dan framing alih-alih mendeskripsikannya. Perhatikan meternya: referensi video ditagih pada tarif output, sementara audio referensi gratis. Asimetri itu adalah fakta pricing paling berguna di endpoint ini.
Visualiser b-roll murni. Hilangkan performer sepenuhnya. Masukkan product shot, objek cover album, atau texture plate plus slice audio, lalu prompt gerak kamera saja. Tidak ada wajah untuk dijaga, tidak ada lip sync untuk rusak, dan Anda bisa membuat semuanya di 768P.
Draft murah, finish mahal. 768P adalah $0,10/d dibandingkan 2K $0,14/d, dan keduanya kembali dengan stereo 32 kHz yang identik, jadi performa yang Anda nilai sama. Penghematan bukan pada keeper, melainkan pada reject: setiap take 8 detik yang gagal biayanya $0,80 alih-alih $1,12. Roll di 768P sampai take benar, lalu bayar $1,12 sekali. Pada shot yang membutuhkan tiga percobaan, itu $2,72 alih-alih $3,36. Lebih lanjut tentang perbedaan tier ada di perbandingan 768P versus 2K, dan tentang sejauh mana satu klip bisa dipanjangkan ada di panduan panjang klip.
Berapa Sebenarnya Biaya Video Musik MiniMax H3 Penuh
Setiap baris di bawah ini adalah angka tagihan nyata yang ditarik dari prediction record setelah selesai, bukan harga daftar.
| Line item | Model dan settings | Ditagih |
|---|---|---|
| Hook, lagu 70 d | minimax/music-2.6, mp3 44.1 kHz | $0,15 |
| Base frame artis | openai/gpt-image-2/text-to-image, high, 2048x1152 | $0,17 |
| Shot 1, rooftop neon | minimax/h3/reference-to-video, 2K, 8 d | $1,12 |
| Shot 2, jalan raya gurun | same, 2K, 8 d | $1,12 |
| Shot 3, cove putih | same, 2K, 8 d | $1,12 |
| Shot 4, bawah air | same, 2K, 8 d | $1,12 |
| Subtotal video selesai | $4,80 | |
| Probe validasi | 768P, 4 d | $0,40 |
| Control take, tanpa audio | 768P, 8 d | $0,80 |
| Trek rap untuk stress test | minimax/music-2.6 | $0,15 |
| Stress test lip-sync | 768P, 4 d | $0,40 |
| Cut Vertical Canvas | 768P, 8 d, 9:16 | $0,80 |
| Hero image untuk artikel ini | openai/gpt-image-2/text-to-image, high | $0,17 |
| Uji over-limit, audio 24 d | ditolak saat submit | $0,00 |
| Empat submit dengan MIME audio salah | ditolak saat submit | $0,00 |
| Audio referensi, 4 x 8 d | input gratis | $0,00 |
| Total pengeluaran | $7,53 |
Itu berarti $9,00 per menit jadi di 2K untuk shot yang masuk cut, sebelum kesalahan saya. Jika seluruhnya dibuat di 768P, menit yang sama menjadi $6,61. Kru MV manusia tidak akan memberi kuotasi dengan angka semacam itu.
Dua catatan operasional jika Anda menganggarkan karya yang lebih panjang. Penolakan saat submit gratis, jadi parameter buruk hanya memakan waktu, bukan uang. Dan field price pada prediction terisi dengan jeda, jadi poll request ID lagi setelah file terunduh jika Anda ingin invoice nyata alih-alih null.
Lagu Siapa, Wajah Siapa: Yang Perlu Dicek Sebelum Publish
Singkat, karena ini penting dan tidak perlu khotbah.
Anda perlu hak atas trek referensi. Input gratis bukan berarti clearance gratis. Memasukkan single komersial yang sudah dirilis sebagai audio referensi, lalu memublikasikan hasilnya, adalah jalur cepat menuju takedown. Rekaman Anda sendiri, trek yang Anda commissioning, atau sesuatu yang Anda buat baik-baik saja.
Jangan membuat base frame dari wajah artis nyata yang masih hidup. Mekanisme konsistensi di sini sangat bagus untuk menjaga wajah lintas shot, persis itulah alasan mengapa mengarahkannya ke orang nyata adalah ide buruk.
Open weights dan akses API adalah dua lisensi berbeda. MiniMax menerbitkan weight H3 di Hugging Face pada Agustus 2026, dan lisensi komunitasnya saat ini mengecualikan EU, UK, Korea Selatan, dan AS, dengan kanal lisensi formal terbuka untuk wilayah tersebut. Pembatasan itu melekat pada menjalankan weight sendiri. Memanggil model melalui hosted API adalah relasi layanan dan tidak membuat Anda berada di bawah lisensi weight. Penting mengetahui Anda berada di situasi yang mana sebelum berasumsi.
Untuk gambaran lebih luas tentang posisi H3 dibandingkan alternatifnya, ada perbandingan Seedance 2.5 dan panduan struktur prompt. Untuk konteks mengapa semua ini layak direpotkan: di leaderboard video editing yang menilai model dengan audio, H3 saat ini berada di posisi pertama dengan 1.126 Elo, di depan Gemini Omni Flash pada 1.119 dan Dreamina Seedance 2.0 pada 1.027 (Artificial Analysis, dicek 10 Agustus 2026). Skor itu bergerak mengikuti voting, jadi anggap sebagai snapshot.
Video Musik MiniMax H3: Pertanyaan yang Sering Diajukan
Bisakah satu video musik MiniMax H3 berjalan tiga menit penuh?
Tidak dalam satu generasi. Satu panggilan dibatasi 15 detik. Namun itu batas per generasi, bukan per proyek. Video tiga menit dengan 8 detik per shot berarti 23 generasi, kira-kira $25,76 di 2K, dan masing-masing jatuh di garis bar jika trek Anda 120 BPM. Potong, shoot, gabungkan, taruh master kembali.
Apakah video musik MiniMax H3 memakai lagu saya yang sebenarnya, atau model meregenerasi audionya?
Ia memakai lagu Anda yang sebenarnya. Saya mengukur korelasi waveform mentah 0,892 pada offset nol sampel antara mp3 8 detik yang saya unggah dan stream audio di dalam mp4 yang dikembalikan, dengan ambience yang diminta prompt dilapiskan di atasnya. Control take yang dibuat tanpa audio referensi mencetak 0,26 terhadap master yang sama. Anda tetap sebaiknya menaruh master kembali di atas hasil gabungan final, karena setiap klip membawa ambience per-shot dan encode AAC-nya sendiri, yang tidak bertahan rapi saat dipotong.
Apakah memasukkan lagu ke video musik MiniMax H3 dikenai biaya ekstra?
Tidak. Empat slice referensi 8 detik saya menambah $0,00 ke tagihan shot $4,48. Referensi video yang perlu diperhatikan, karena ditagih pada tarif output. Batasnya adalah tiga klip audio, masing-masing 2 sampai 15 detik, total 15 detik, dan audio tidak pernah boleh menjadi satu-satunya referensi.
Seberapa bagus lip sync MiniMax H3 pada nyanyian dibandingkan bicara?
Vokal nyanyian yang ditahan adalah kekuatannya: bentuk mulut berbeda, hold yang cocok dengan note, dan kepala mendongak pada note panjang terbaca sebagai performa, bukan loop. Delivery padat adalah tempat ia menyerah. Tes rap enam suku kata per detik saya tetap menjaga beat tetapi berhenti menyelesaikan konsonan dan jatuh ke siklus buka-tutup berulang. Letakkan bar cepat di b-roll.
Bagaimana menjaga wajah yang sama di setiap shot video musik MiniMax H3?
Tiga hal, semuanya membosankan. Satu gambar referensi dipakai ulang di setiap panggilan, tidak pernah dibuat ulang. Redaksi wardrobe yang sama disalin persis antar-prompt, bukan diparafrasekan. Dan klausa eksplisit "identical to the reference image" di setiap prompt. Empat shot saya melintasi hujan, matahari rendah, high-key datar, dan bawah air tanpa drift.
Berapa biaya video musik MiniMax H3 per menit jadi?
$9,00 per menit jadi di 2K, berdasarkan tagihan nyata saya $4,80 untuk cut 32 detik. Jika seluruhnya dibuat di 768P, menit yang sama biayanya $6,61, dan 768P mengirim stereo 32 kHz yang sama, jadi performa yang Anda nilai identik. Roll reject Anda dengan $0,80 dan bayar $1,12 hanya pada take yang lolos edit.






