Seedance 2.5 Kini Tersedia — Hadir Pertama di Atlas Cloud

MiniMax H3 Referensi Video: Satu Karakter, Dua Adegan, dan Aturan yang Diam-diam Menguras Uang Anda

Setiap panduan mengulangi lembar spesifikasi 9/3/3. Yang ini menjalankannya: sebuah adegan dua bidikan dari referensi gambar, video, dan audio dalam satu panggilan video referensi MiniMax H3.

Setiap artikel tentang model ini berhenti di baris yang sama. Sembilan gambar, tiga klip video, tiga klip audio, total dua belas file. Tulisannya seperti kartu garansi.

Jadi saya perlakukan seperti itu. Saya membangun karakter, membangun properti, menghasilkan pemandangan malam, memasukkan pemandangan malam itu kembali sebagai video referensi, memotong delapan detik jazz menjadi trek audio referensi, dan mendorong ketiga jenis referensi melalui satu permintaan. Kemudian saya mulai melanggar aturan dengan sengaja untuk melihat mana yang benar-benar dipertahankan oleh API.

Empat di antaranya tidak dipertahankan seperti yang Anda harapkan. Salah satunya masih menagih Anda harga penuh untuk video yang tidak Anda minta, dan pesan error yang Anda harapkan tidak pernah tiba. Itulah yang layak dibaca sampai akhir.

Poin-Poin Penting

  • Tiga jenis referensi, satu array. Hingga 9 gambar, 3 klip video, dan 3 klip audio, total 12 file. Semuanya masuk ke dalam field refers yang sama, dan type bersifat opsional karena API menyimpulkan dari ekstensi file.
  • Audio tidak bisa terbang sendirian. Permintaan hanya audio ditolak dengan error bernama. Audio harus disertai setidaknya satu gambar atau satu video.
  • Referensi ke video dan gambar ke video saling eksklusif, tetapi tidak ada yang memberi tahu Anda. Kirim image bingkai pertama bersama refers dan pekerjaan tetap selesai. Salah satu dari dua input Anda dibuang dalam diam, dengan harga penuh. Diverifikasi dua kali pada 2026-08-12, di kedua endpoint.
  • Tidak ada yang divalidasi saat Anda mengirimkan. Setiap permintaan yang salah dalam artikel ini mengembalikan HTTP 200 dan sebuah ID. Putusan sesungguhnya tiba dua hingga tiga menit kemudian di tahap generasi. Penolakan di sana gratis; penyelesaian tidak.
  • File referensi tambahan gratis. Satu gambar referensi dan sepuluh gambar referensi ditagih dengan jumlah yang sama untuk durasi klip yang sama. Harga mengikuti detik output, bukan jumlah input.

Inilah yang keluar dari ujung sana. Dua bidikan, satu wajah, dua tempat yang sama sekali berbeda, dan bidikan kedua dibangun dari gambar, video, dan file audio secara bersamaan.

Bidikan A (hujan, malam, gang neon) lalu Bidikan B (pasar tertutup kosong keesokan paginya), digabung tanpa tambahan apa pun selain sambungan. Wanita yang sama, bekas luka yang sama di atas alis kanan, jaket nila yang sama, handuk yang sama. Bidikan B dihasilkan dari tiga referensi sekaligus: potretnya, klip Bidikan A itu sendiri, dan potongan jazz delapan detik. Kedua bidikan adalah minimax/h3/reference-to-video pada 2K, 2560x1440, 24fps, dengan trek stereo 32kHz asli. Layak untuk menyalakan suara untuk paruh kedua, di mana dia menyampaikan dialognya.

Mengapa MiniMax H3 Reference to Video Mengalahkan Prompt Apa Pun yang Dapat Anda Tulis

Sebuah prompt mendeskripsikan seseorang. Sebuah referensi adalah orang itu. Perbedaan itulah alasan utama mengapa endpoint ini ada, dan itulah mengapa MiniMax H3 saat ini berada di puncak papan peringkat pengeditan video: Elo 1.125 dari 10.280 suara (Artificial Analysis, Agustus 2026). Namun, perlu tepat tentang angka itu: tabel yang sama mencantumkan rentang peringkatnya sebagai 1 hingga 2, secara statistik imbang dengan Google Gemini Omni Flash di 1.122. Posisi pertama, dalam interval kepercayaan yang dibagikan. Klaim terkait bahwa H3 juga masuk tiga besar untuk teks ke video dan gambar ke video berasal dari pos pengumuman laboratorium yang sama (Artificial Analysis di X, Agustus 2026).

Peringkat murah. Inilah perilaku sebenarnya, prompt yang sama, tiga tingkat referensi, sisanya identik.

let's say

Tiga eksekusi MiniMax H3 reference-to-video pada prompt yang sama: tanpa referensi, satu gambar referensi karakter, dan dua gambar referensi

Prompt yang sama, pengaturan 768P 4s yang sama, dari kiri ke kanan: tanpa referensi sama sekali (teks ke video), satu gambar referensi karakter, dua gambar referensi (karakter ditambah mangkuk ramen). Prompt mengatakan "wanita dari gambar referensi" di ketiganya. Di panel kiri, frasa itu tidak merujuk pada siapa pun, sehingga model menciptakan orang asing. Dihasilkan dengan minimax/h3/text-to-video dan minimax/h3/reference-to-video.

Dua pembacaan jujur dari strip itu. Lompatan dari panel satu ke panel dua sangat besar: tanpa referensi, "wanita dari gambar referensi" adalah frasa yang tidak menunjuk ke mana pun, dan model diam-diam mengisi lubang dengan orang yang tidak memiliki hubungan dengan proyek Anda. Lompatan dari panel dua ke panel tiga jauh lebih kecil, karena prompt saya juga mendeskripsikan mangkuk dengan kata-kata, dan H3 menggambar mangkuk biru tua yang lumayan dengan bangau di atasnya hanya dari teks. Itulah bagian yang berguna. Gambar referensi dan frasa nomina yang baik bersaing untuk pekerjaan yang sama, jadi gunakan slot referensi Anda untuk hal-hal yang tidak bisa dijabarkan oleh bahasa: wajah tertentu, produk tertentu, logo tertentu.

Pola di balik hampir setiap kegagalan dalam artikel ini sama dengan panel satu. Tidak ada yang memperingatkan Anda bahwa bagian dari permintaan Anda tidak mengenai sasaran.

Apa yang sebenarnya dikunci oleh referensi, dan apa yang tidak. Gambar referensi mengunci identitas: struktur wajah, rambut, tanda pembeda, pakaian. Gambar tersebut tidak mengunci pencahayaan, dan ini adalah kejutan paling umum. Gambar ini juga membawa cahaya foto referensi, itulah sebabnya lembar karakter yang diambil di lingkungan yang suram menghasilkan karakter yang tidak bisa bertahan dalam perubahan adegan. Ambil referensi Anda dengan pencahayaan datar dan netral. Video referensi mengunci gerakan, gradasi, dan grain, bukan identitas. Audio referensi mengunci alas audio itu sendiri. Jika Anda membutuhkan wajah yang sama membaca dialog dengan suara yang sama di seluruh rangkaian, tumpukan referensi melakukan tiga pekerjaan berbeda dan Anda harus mengatakan mana yang mana. Panduan praktisi cenderung menyebutnya secara posisional dalam prompt ("Gambar 1 adalah karakter, Gambar 2 adalah produk") dan konvensi itu layak diadopsi; prompt saya di bawah menggunakan penamaan deskriptif biasa, yang juga berfungsi ketika referensi secara visual tidak ambigu.

Mengapa panggilan pertama biasanya mengecewakan. Empat hal, semuanya diukur pada 2026-08-12:

  1. Endpoint submit tidak memvalidasi apa pun. MIME salah, audio 164 detik, URL mati, field yang saling eksklusif: semuanya mengembalikan HTTP 200 dengan ID prediksi. Anda mengetahuinya nanti.
  2. ratio default ke adaptive, didokumentasikan sebagai "biarkan model memilih". Dengan referensi 16:9 saya mendapatkan 1344x768 pada 768P baik saya membiarkannya pada adaptive atau memaksa 16:9, jadi default tidak berbahaya ketika input Anda sudah cocok. Ini seperti lemparan koin ketika tidak, dan ini adalah satu-satunya endpoint H3 di mana Anda dapat dengan mudah mengambil keputusan darinya.
  3. Gambar bingkai pertama ditambah referensi tidak error. Gambar tersebut diam-diam menjatuhkan salah satunya dan menagih Anda.
  4. Jika model tidak memiliki sesuatu yang konkret untuk dipegang, model itu mengisi celah dengan percaya diri, dan wajah salah yang percaya diri terlihat persis seperti eksekusi yang berhasil.

Untuk sisi prompt-craft dari ini, panduan prompt MiniMax H3 membahas lebih dalam tentang perumusan daripada yang bisa saya lakukan di sini.

Buku Aturan MiniMax H3 Reference to Video: Tiga Jenis, Satu Permintaan

Ketiga jenis referensi berbagi satu array. Berikut adalah kontrak sebagaimana dipublikasikan, di samping apa yang sebenarnya dilakukan endpoint ketika saya mendorongnya.

Tabel 1: tiga jenis referensi

Gambar referensiVideo referensiAudio referensi
File maks93 klip3 klip
Batas gabungan12 file di semua tiga jenis
Durasi per filet/a2 hingga 15 detik2 hingga 15 detik
Durasi totalt/a15 detik15 detik
Formatpng, jpeg, jpg, webpmp4, movmp3, wav
Bisakah digunakan sendiri?YaYaTidak, perlu gambar atau video
Apa yang dikunciidentitas, pakaian, produk, gayagerakan, kamera, gradasi, grainalas audio itu sendiri
Apa yang tidak dikuncipencahayaan adegan barusiapa yang ada di bidikantrek yang tepat (lihat Langkah 6)
Dikirim sebagaiURL publik atau data URL base64URL publik atau data URL base64harus dideklarasikan audio/mp3, bukan audio/mpeg
Ditegakkan?10 gambar berjalan dengan baiktidak diuji lebih dari 1 klipjendela per klip ditegakkan, total 15 detik tidak

Jumlah file dan jendela durasi adalah batas yang dipublikasikan MiniMax (Hailuo, Agustus 2026), diperiksa silang dengan tulisan peluncuran yang mencantumkan jendela video referensi yang sama yaitu 2 hingga 15 detik masing-masing dan total 15 detik (MarkTechPost, Agustus 2026). Semua yang ada di tiga baris terakhir adalah milik saya, diukur.

Dua hal yang tidak diberitahukan oleh lembar spesifikasi. Pertama, field type pada setiap entri bersifat opsional dan disimpulkan dari ekstensi URL, yang berarti data URL base64 atau tautan tanpa ekstensi harus mendeklarasikan tipenya atau permintaan akan salah tebak. Kedua, pengunggah browser membatasi hingga sembilan file (Reference Materials (2/9), MAX:9 pada tangkapan layar Langkah 5 di bawah), di bawah dua belas milik MiniMax. Saya mengirim sepuluh gambar referensi melalui API dan pekerjaan selesai secara normal, jadi sembilan adalah batas UI, bukan batas model.

Tabel 2: reference-to-video vs image-to-video vs text-to-video

reference-to-videoimage-to-videotext-to-video
Menerima refersya, wajib, minimal 1tidak (diabaikan diam-diam)tidak
Menerima image bingkai pertamatidak (diabaikan diam-diam)ya, wajibtidak
Menerima end_image bingkai terakhirtidakyatidak
Opsi ratiosemua 7, termasuk 16:9, 9:16, 21:9adaptive sajasemua 7
Resolusi768P atau 2K, default 2Ksamasama
Durasi4 hingga 15s integer, default 8samasama
Mencampur input endpoint lainpekerjaan selesai, input dibuang, bayar penuhpekerjaan selesai, refers dibuang, bayar penuht/a

Baris keempat itu adalah perbedaan yang tidak disebutkan siapa pun. Di image-to-video, enum rasio aspek berisi tepat satu nilai, adaptive, karena bingkai pertama menentukan bentuk. Di reference-to-video Anda mendapatkan ketujuh, menjadikan ini satu-satunya endpoint H3 di mana Anda dapat memaksa bentuk bingkai sambil tetap menambatkan karakter. Jika Anda memilih tingkatan untuk pekerjaan ini, 2K vs 768P untuk MiniMax H3 membahas apa yang dibeli oleh piksel ekstra.

Baris terakhir adalah yang mahal. Dokumentasi membingkai kedua endpoint sebagai saling eksklusif, dan memang demikian, dalam arti bahwa hanya satu jalur input yang dihormati. Tapi tidak ada error. Saya menjalankannya kedua arah pada 2026-08-12: panggilan reference-to-video yang membawa image bingkai pertama selesai dalam 115 detik dan ditagih $0,40, dan panggilan image-to-video yang membawa refers selesai dalam 167 detik dan ditagih $0,40. Keduanya menghasilkan video. Keduanya membuang setengah dari apa yang saya kirim, dan tidak ada field dalam respons yang mengatakan setengah mana.

Tabel 3: model yang digunakan alur kerja ini

Semua yang di bawah berjalan dalam satu tab browser di Atlas Cloud, dari mana harga dan tangkapan layar berasal. Tarif diperiksa pada 2026-08-12.

LangkahModelTarifBerjalan di siniBiaya
Referensi karakter + propertiopenai/gpt-image-2/text-to-imagetercantum mulai $0,009; kualitas tinggi pada 2048x1152 terukur $0,17452$0,35
Audio referensiminimax/music-2.6$0,15 per trek1$0,15
Bidikan A dan Bidikan Bminimax/h3/reference-to-video$0,10/dtk pada 768P, $0,14/dtk pada 2K2 x 8dtk pada 2K$2,24
Tangga referensisama, ditambah minimax/h3/text-to-video$0,10/dtk pada 768P3 x 4dtk pada 768P$1,20

Tidak ada diskon yang aktif di ketiga endpoint H3 bulan ini. Dua tetangga lebih murah saat ini jika Anda hanya membangun gambar diam referensi: gpt-image-2-developer/text-to-image diskon 50%, $0,009 turun menjadi $0,004 per Agustus 2026. Rincian per detik penuh ada di panduan Harga API MiniMax H3.

MiniMax H3 Reference to Video, Langkah demi Langkah

Adegannya: seorang wanita menjalankan warung ramen. Bidikan A adalah gang neon hujan di malam hari. Bidikan B adalah wanita yang sama keesokan paginya di pasar tertutup kosong, tempat yang berbeda, waktu yang berbeda, dan lensa yang berbeda. Tidak ada yang terbawa di antara kedua panggilan kecuali referensi, itulah inti dari pengujian.

Langkah 1: Bangun referensi karakter, dengan pencahayaan datar dengan sengaja

Ini adalah langkah yang salah dilakukan orang. Referensi karakter bukanlah foto bagus dari karakter Anda, itu adalah pengukuran wajah mereka. Cahaya netral, latar belakang polos, tanpa adegan, tanpa suasana. H3 mempelajari cahaya bersama dengan wajah, jadi referensi atmosferik menghasilkan karakter yang terpaku pada atmosfer itu.

Model: openai/gpt-image-2/text-to-image. Pengaturan: kualitas high, ukuran 2048x1152 (16:9), format png.

text
1Foto editorial seorang wanita berusia awal tiga puluhan, seorang koki makanan jalanan. Potret tiga perempat dekat, ekspresi netral, kontak mata langsung dengan kamera. Rambut hitam pendek diselipkan di belakang satu telinga, bekas luka kecil di atas alis kanan, kulit zaitun hangat. Dia mengenakan jaket kerja nila usang dengan lengan digulung hingga siku dan handuk putih terlipat di bahu kiri. Latar belakang studio abu-abu terang polos, cahaya kunci lembut merata, tanpa properti, fokus tajam pada wajah, tekstur kulit alami, tanpa retouching. Fotorealistis, lensa 50mm.
2

Tangkapan layar generator gambar AI menunjukkan prompt input dan potret yang dihasilkan

Playground GPT Image 2 di Atlas Cloud dengan prompt referensi karakter dimuat dan potret selesai di panel output

GPT Image 2 di Atlas Cloud: kualitas diatur ke high, 16:9, lembar karakter ditampilkan di sebelah kanan.

Wanita dalam jumpsuit biru dengan handuk disampirkan di bahunya

Gambar referensi karakter untuk MiniMax H3 reference-to-video: potret studio netral seorang koki ramen dengan bekas luka di atas alis kanannya

Gambar referensi 1. Bekas luka di atas alis kanan dan handuk putih terlipat sengaja dibuat: itu adalah jangkar identitas yang murah dan tidak ambigu yang dapat Anda periksa di setiap bingkai selanjutnya.

Langkah 2: Bangun referensi properti

Slot referensi kedua, pekerjaan kedua. Objek berperilaku lebih baik daripada wajah di sini, yang membuat properti yang khas menjadi cara termudah untuk membuktikan bahwa referensi berhasil. Model dan pengaturan yang sama.

text
1Foto produk dari satu mangkuk ramen keramik biru tua dengan bangau putih yang dilukis tangan di samping, terkelupas di tepinya, diisi dengan shoyu ramen yang mengepul. Tampilan lurus, latar belakang abu-abu terang polos, cahaya lembut merata, fokus tajam, fotorealistis, lensa 50mm.
2

babi, (5) telur, (6) dan (7) daun bawang (8) hijau (9)

Gambar referensi properti: mangkuk ramen biru tua dengan bangau putih yang dilukis tangan dan tepi terkelupas

Gambar referensi 2. Bangau yang dilukis tangan dan keripik di tepi adalah petunjuknya. Jika mereka bertahan di dalam video, referensi telah dibaca.

Langkah 3: Bidikan A, dua gambar ke MiniMax H3 reference-to-video

Dua gambar referensi, keduanya type: "image", ke dalam refers. Tetapkan rasio secara eksplisit. adaptive adalah default dan biasanya akan melakukan hal yang benar ketika referensi Anda sudah 16:9, tetapi ia memutuskan untuk Anda, dan di endpoint ini Anda tidak harus membiarkannya.

Model: minimax/h3/reference-to-video. Pengaturan: resolusi 2K, durasi 8, rasio 16:9.

text
1Wide shot pembuka. Hujan lebat di malam hari di gang sempit yang diterangi lampu neon. Wanita dari gambar referensi bekerja sendirian di belakang warung ramen kecil yang mengepul di bawah tenda plastik, menyendok kaldu ke dalam mangkuk biru tua dengan bangau putih dari gambar referensi. Uap naik melalui pantulan neon merah muda dan hijau di trotoar basah. Slow push-in ke warung. Suara sekitar: hujan di plastik, kaldu mendidih, lalu lintas jauh. Tidak ada dialog.
2

Output dari panggilan ini adalah paruh pertama dari klip unggulan di bagian atas. Simpan URL-nya. Itu adalah input untuk Langkah 5.

Langkah 4: Potong delapan detik audio referensi

Audio referensi bukanlah slot soundtrack. Itu adalah alas yang digunakan model untuk mencocokkan campurannya sendiri, dan itu adalah input yang paling rewel di endpoint. Hasilkan trek, lalu potong, karena lagu penuh ditolak.

Model: minimax/music-2.6, dengan is_instrumental: true dan format: "mp3".

text
1Jazz larut malam yang jarang, snare disikat, bass tegak, satu terompet teredam, melankolis, 70 BPM, instrumental.
2

Kemudian potong kira-kira delapan detik dan enkode sebagai URL data:audio/mp3. Tiga hal yang saya salah lakukan di sini pertama kali, semuanya dengan teks error yang tepat:

  • String MIME lebih penting daripada byte. Deklarasikan data:audio/mpeg dan referensi ditolak dengan audio format ".mpeg" not allowed, meskipun filenya adalah MP3 biasa. Tulis audio/mp3.
  • 2 hingga 15 detik per klip, dan itu ditegakkan. Trek yang saya hasilkan adalah 164 detik. Itu kembali sebagai invalid param: audio duration 164258 ms, expected [2000, 15000] ms. Memotong menjadi 8,05 detik memperbaikinya. Kedua penolakan tidak dikenakan biaya.
  • Batas gabungan 15 detik didokumentasikan tetapi tidak ditegakkan. Saya mengirim dua klip 8 detik dalam permintaan yang sama, total 16,1 detik, mengharapkan penolakan. Pekerjaan selesai dan ditagih secara normal. Jangan bergantung pada itu: itu dipublikasikan sebagai batas dan bisa mulai berperilaku seperti itu kapan saja.

Antarmuka generator musik AI menunjukkan prompt teks dan bentuk gelombang audio yang dihasilkan

Playground MiniMax Music 2.6 di Atlas Cloud dengan prompt jazz dan trek selesai di panel output

MiniMax Music 2.6 di Atlas Cloud, $0,15 per eksekusi, trek selesai di sebelah kanan. Satu hal yang perlu disalin dari tangkapan layar ini dan satu hal yang tidak: harga dan format mp3 sudah benar, tetapi Is Instrumental masih mati dan lirik demo halaman masih duduk di kotak, jadi eksekusi khusus ini kembali sebagai lagu 1:35 dengan vokal. Balikkan sakelar itu dan kosongkan bidang Lirik sebelum Anda menjalankannya, atau Anda akan memotong alas referensi dengan seseorang bernyanyi di atasnya. Eksekusi API saya, dengan isinstrumental: true, mengembalikan 2:44 instrumental dalam 209 detik.

Langkah 5: Bidikan B, satu panggilan MiniMax H3 reference-to-video dengan ketiga jenis

Ini adalah panggilan yang sebenarnya menjadi kata kunci. Tiga jenis referensi, tiga pekerjaan berbeda, satu array:

  1. potret karakter dari Langkah 1, type: "image", untuk menahan wajahnya
  2. mp4 Bidikan A dari Langkah 3, type: "video", untuk membawa gradasi dan grain melintasi potongan
  3. potongan jazz delapan detik dari Langkah 4, type: "audio", sebagai alas

URL output dari generasi lain di platform dapat langsung dimasukkan ke dalam refers sebagai referensi video, yang merupakan mekanisme sebenarnya di balik kontinuitas multi-bidikan. Bukan "H3 mengingat karakter Anda". Anda menyerahkan bidikan sebelumnya kembali ke sana.

Model: minimax/h3/reference-to-video. Pengaturan: resolusi 2K, durasi 8, rasio 16:9.

text
1Wanita yang sama dari gambar referensi, keesokan paginya. Pasar tertutup terang yang kosong, siang hari bersih yang dingin melalui skylight, daun jendela masih turun di belakangnya. Medium close-up, kamera statis. Dia mengelap meja dengan handuk putih terlipat, menatap kamera dan mengucapkan satu kalimat, lalu kembali bekerja. Jaga wajah, rambut, bekas luka, dan jaket nilanya identik dengan referensi. Bawa gradasi dan grain dari klip referensi. Gunakan audio referensi sebagai ilustrasi musik.
2

Antarmuka generator video AI menunjukkan prompt input dan video yang dihasilkan

Playground MiniMax H3 reference-to-video di Atlas Cloud dengan referensi gambar dan audio dimuat serta klip yang dihasilkan di panel output

Panggilan yang sama di playground MiniMax H3 Reference-to-Video, pada 2K dan 8 detik. Dua slot referensi dari jenis yang berbeda terlihat di Reference Materials (2/9): slot 1 adalah ref-audio-8s.mp3, slot 2 adalah potretnya. Referensi video masuk melalui "Add via link" (pojok kanan atas panel itu) atau melalui API, karena berada di URL daripada di disk. Tiga hal yang perlu dibaca dari panel ini: pengunggah mengatakan MAX:9 meskipun batas MiniMax sendiri adalah 12, Aspect Ratio berada pada adaptive kecuali Anda mengubahnya, dan harga eksekusi untuk 2K pada 8 detik adalah $1,12, yang merupakan tingkatan $0,14 per detik.

Langkah 6: Verifikasi bahwa referensi benar-benar berhasil

Pekerjaan yang selesai bukanlah pekerjaan yang berhasil. Dua pemeriksaan, keduanya murah.

Periksa wajahnya. Ambil bingkai dari setiap bidikan dan letakkan berdampingan. Anda mencari jangkar yang Anda tanam: bekas luka, garis rambut, jaket, handuk.

Perbandingan seorang wanita dalam pencahayaan neon malam dan pasar pagi

Bingkai dari Bidikan A di samping bingkai dari Bidikan B, menunjukkan karakter MiniMax H3 reference-to-video yang sama di dua adegan berbeda

Kiri: Bidikan A, malam, neon, lebar. Kanan: Bidikan B, pasar tertutup, keesokan pagi, medium close-up. Wajah yang sama, bekas luka yang sama di atas alis kanan, jaket dan handuk yang sama, di seluruh adegan dan perubahan pembingkaian tanpa ada yang dibagikan selain referensi.

Satu hal tidak berjalan seperti yang saya tulis dalam prompt. Saya meminta "pasar tertutup terang yang kosong, siang hari bersih yang dingin" dan "bawa gradasi dan grain dari klip referensi", dan klip referensi menang. Bidikan B jelas pagi hari dan jelas tempat yang berbeda, tetapi jauh lebih murung daripada yang tersirat oleh "terang", karena gradasi malam ikut serta dengan referensi video. Anda tidak dapat meminta satu panggilan untuk tampilan yang sama dan cahaya yang berlawanan. Jika Anda membutuhkan cahaya untuk berubah, jatuhkan instruksi gradasi, atau jatuhkan referensi video dan pegang identitas dengan gambar saja.

Periksa audionya. Plot bentuk gelombang dari potongan delapan detik yang Anda unggah di samping trek yang kembali di dalam mp4, dan tambahkan kontrol: klip yang dihasilkan tanpa referensi audio sama sekali.

Tiga bentuk gelombang audio bertumpuk membandingkan trek yang diunggah, dikembalikan, dan kontrol

Bentuk gelombang dari audio referensi delapan detik yang diunggah, trek audio yang dikembalikan di dalam klip yang dihasilkan, dan kontrol tanpa referensi audio

Atas: potongan jazz 8,05 detik yang dikirim sebagai referensi. Tengah: trek yang diekstrak dari mp4 Bidikan B yang dikembalikan, didominasi oleh dialog di sekitar 5,5 detik. Bawah: Bidikan A, alur kerja yang sama, tanpa referensi audio.

Di sinilah saya harus mengoreksi sesuatu yang saya yakini sebelumnya. Audio referensi tidak kembali secara verbatim. Korelasi amplop antara potongan saya dan trek yang dikembalikan adalah 0,25, dibandingkan −0,05 untuk kontrol tanpa referensi, jadi keduanya terkait tetapi tidak identik, dan bentuk yang dikembalikan jelas merupakan campurannya sendiri daripada file saya dengan sesuatu yang ditumpangkan di atasnya. Apa yang jelas dilakukan referensi adalah menempatkan sesuatu di bawah: alas Bidikan B berjalan sekitar 7 dB lebih panas daripada kontrol tanpa audio di lima detik pertama, sebelum dialog apa pun dimulai. Baca audio referensi sebagai kemudi pada campuran, bukan slot musik. Jika Anda membutuhkan trek yang tepat di bawah gambar, letakkan setelahnya.

Jika Anda membangun di sisi audio dari ini, MiniMax H3 lip sync dan audio dan panduan video musik MiniMax H3 keduanya dimulai dari perilaku audio referensi yang sama ini. Untuk kode polling dan percobaan ulang di sekitar semua ini, tutorial MiniMax H3 memiliki loopnya.

Empat Pengaturan MiniMax H3 Reference to Video Lain yang Layak Dicuri

Ubah gaya klip yang sudah Anda miliki. Masukkan klip yang sudah selesai ke dalam refers sebagai referensi video, tanpa gambar sama sekali, dan minta media yang berbeda. Gerakan, pembingkaian, push-in, dan properti bertahan; permukaannya berubah. Ini adalah mekanisme di balik peringkat pengeditan video H3, dan ini adalah mekanisme yang sama di balik pekerjaan anime di MiniMax H3 vs Veo 3.1 untuk anime.

Wanita memasak di gerobak makanan di gang neon

Pengubahan gaya anime yang dihasilkan dari klip Bidikan A yang digunakan sebagai referensi MiniMax H3 reference-to-video

Gang Bidikan A diserahkan kembali sebagai satu-satunya referensi, dengan prompt anime cel-shaded. Warung yang sama, sendok yang sama, mangkuk bangau yang sama, push-in yang sama, digambar ulang. Satu detail yang perlu diketahui: konversi paling lemah di bingkai pertama dan paling kuat setelah kamera berkomitmen pada gerakan. Ditampilkan sebagai GIF diam. Dihasilkan dengan minimax/h3/reference-to-video pada 768P, 4s, $0,40.

Buat foto bernyanyi. Satu potret ditambah satu klip vokal dalam jendela 2 hingga 15 detik, prompt kinerjanya. Lebih murah daripada pipeline sinkronisasi bibir karena hanya satu panggilan.

Kunci produk ke dalam adegan apa pun. Gambar referensi menjepit objek lebih keras daripada wajah, jadi bidikan produk nyata ditambah prompt adegan adalah hal yang paling dapat diandalkan di endpoint ini. Periksa apa yang diizinkan untuk Anda lakukan dengan hasilnya sebelum masuk ke iklan.

Bangun serial, bukan klip. Rantai: output bidikan N menjadi referensi video bidikan N+1. Setiap panggilan masih dibatasi hingga 15 detik, jadi kontinuitas adalah tugas Anda, bukan model. Berapa lama video MiniMax H3 dapat dibuat membahas di mana batas itu terasa.

Membandingkan mesin sebelum Anda melakukan serial ke satu? Seedance 2.5 vs MiniMax H3 dan Alternatif MiniMax H3 adalah dua yang harus dibaca.

Berapa Biaya Sebenarnya Adegan Dua Bidikan MiniMax H3 Reference to Video

Setiap baris di bawah ini adalah pekerjaan nyata dari 2026-08-12, dengan jumlah yang diambil dari field price yang dikembalikan API pada setiap prediksi yang selesai.

Tabel 4: tagihan sebenarnya

PekerjaanModelPengaturanHasilDitagih
Referensi karaktergpt-image-2high, 2048x1152selesai$0,1745
Referensi propertigpt-image-2high, 2048x1152selesai$0,1745
Audio referensimusic-2.6instrumental, mp3selesai, trek 164 dtk, tunggu 209 dtk$0,15
Bidikan Ah3/reference-to-video2K, 8s, 2 ref gambarselesai dalam 309 dtk$1,12
Bidikan Bh3/reference-to-video2K, 8s, ref gambar + video + audioselesai dalam 557 dtk$1,12
Tangga, tanpa referensih3/text-to-video768P, 4sselesai dalam 154 dtk$0,40
Tangga, 1 ref gambarh3/reference-to-video768P, 4sselesai dalam 119 dtk$0,40
Tangga, 2 ref gambarh3/reference-to-video768P, 4sselesai dalam 128 dtk$0,40
Pengubahan gaya animeh3/reference-to-video768P, 4s, 1 ref videoselesai dalam 239 dtk$0,40
Eksekusi ulang Langkah 5 di playgroundh3/reference-to-video2K, 8s, ref gambar + audioselesai$1,12
Kontrol: 10 ref gambarh3/reference-to-video768P, 4sselesai dalam 150 dtk$0,40
Kontrol: gambar bingkai pertama + refersh3/reference-to-video768P, 4sselesai, satu input dibuang$0,40
Kontrol: refers pada image-to-videoh3/image-to-video768P, 4sselesai, refers dibuang$0,40
Kontrol: 16,1 dtk audio referensih3/reference-to-video768P, 4sselesai melebihi batas yang didokumentasikan$0,40
Kontrol: rasio dihilangkan, lalu rasio adaptiveh3/reference-to-video768P, 4s, dua kalikeduanya selesai, identik 1344x768$0,80
Eksekusi ulang tangkapan layar Langkah 1 dan 4gpt-image-2, music-2.6seperti di atasselesai$0,32
Kontrol: audio referensi sajah3/reference-to-video768P, 4sgagal dalam 7 ms$0,00
Kontrol: audio referensi 164 dtkh3/reference-to-video768P, 4sgagal dalam 16 dtk$0,00
Kontrol: MIME audio/mpegh3/reference-to-video768P, 4sgagal dalam 17 dtk$0,00
Kontrol: URL referensi matih3/reference-to-video768P, 4sgagal dalam 21 dtk$0,00
Total$8,18

Bagi total itu secara jujur. Adegan dua bidikan yang sudah selesai di bagian atas artikel ini, termasuk referensi dan audio, adalah $2,74 darinya. $5,44 lainnya adalah investigasi: kontrol, pelanggaran yang disengaja, dan menjalankan ulang langkah-langkah di browser untuk tangkapan layar. Jika Anda sudah tahu aturannya, urutan dua bidikan 16 detik pada 2K harganya kurang dari sandwich.

Tiga hal jatuh dari tabel itu.

Referensi gratis. Kontrol sepuluh gambar dikenakan biaya persis $0,40 yang sama dengan eksekusi tangga satu gambar pada panjang dan resolusi yang sama. Di platform ini, meteran berjalan pada detik output dan resolusi, tidak ada yang lain. Perlu disebutkan satu kontradiksi: aturan platform MiniMax sendiri menggambarkan video input dikenakan biaya pada tarif output, dan skema terpadu di OpenRouter membawa item baris reference_images terpisah. Tidak satu pun muncul di faktur saya di sini. Jika Anda membuat anggaran di tempat lain, tetapkan harga sendiri daripada berasumsi.

Kegagalan gratis, dan terlambat. Keempat penolakan tidak dikenakan biaya, itulah kabar baik. Kabar buruknya adalah kapan mereka tiba: 7 milidetik untuk aturan audio saja, 16 hingga 21 detik untuk panjang audio, MIME yang salah, dan URL mati, dan tidak sama sekali pada waktu kirim. Setiap permintaan yang salah bentuk dalam artikel ini mendapat HTTP 200 dan ID prediksi terlebih dahulu, jadi perlakukan respons kirim sebagai tanda terima, bukan sebagai validasi, dan polling field status sebelum Anda mempercayai apa pun.

Keberhasilan diam adalah kegagalan yang mahal. Dua kontrol pencampuran masing-masing dikenakan biaya $0,40 penuh dan mengembalikan video yang benar-benar valid yang dibangun dari setengah input saya. Tidak ada error, tidak ada field peringatan, dan tidak ada cara untuk mengetahui dari respons bahwa ada sesuatu yang dibuang. Itu adalah satu-satunya baris dalam tabel di mana uang meninggalkan akun dan saya tidak mendapatkan apa pun yang saya inginkan.

Satu koreksi jujur pada poin terakhir, karena itu berubah di bawah saya saat saya menulis. Pada awal Agustus, URL referensi yang 404 berperilaku sama: pekerjaan selesai, referensi diabaikan diam-diam, dan jumlah penuh dikenakan biaya. Menjalankannya ulang pada 2026-08-12, endpoint sekarang memeriksa keterjangkauan dan menggagalkan pekerjaan secara gratis dengan error bernama, content[1].image_url: media not found (HTTP 404). Lubang spesifik itu tertutup. Lubang input yang saling eksklusif tidak. Untuk matematika kredit per klip, Kredit MiniMax H3 per video memiliki tabelnya.

Wajah Siapa, Suara Siapa: Periksa Ini Sebelum Anda Mengunggah Referensi

Endpoint ini berbeda dari teks ke video dalam satu hal yang relevan secara hukum: Anda yang menyediakan kemiripan. Gambar referensi orang nyata, klip referensi dari film seseorang, vokal referensi dalam suara yang dapat dikenali, semuanya adalah materi yang Anda klaim memiliki hak untuk menggunakannya. Aturan konten sisi model masih berlaku di atas itu, dan mereka lebih ketat tentang orang nyata daripada tentang orang yang diciptakan. Dua panduan yang layak dibaca sebelum klien melihat output: Pembatasan konten MiniMax H3 dan rincian penggunaan komersial dan lisensi, yang juga mencakup pengecualian wilayah dalam persyaratan MiniMax.

MiniMax H3 Reference to Video: Pertanyaan yang Sering Diajukan

Bisakah MiniMax H3 reference-to-video mempertahankan karakter yang sama di dua bidikan yang berbeda?

Ya, dan pengujian dua bidikan saya di atas bertahan di seluruh pembalikan pencahayaan dari malam ke pagi. Tapi gambar karakter saja tidak cukup. Pola yang andal adalah meneruskan URL output bidikan sebelumnya kembali sebagai video referensi bersama dengan gambar karakter, sehingga panggilan kedua mewarisi gradasi dan grain serta identitas.

Bisakah saya menggunakan gambar bingkai pertama dan referensi dalam panggilan MiniMax H3 reference-to-video yang sama?

Tidak, dan mode kegagalan adalah masalahnya. Mengirim keduanya image dan refers tidak error. Diuji pada 2026-08-12, pekerjaan selesai dalam 115 detik, ditagih $0,40, dan diam-diam membuang salah satu dari dua input. Hal yang sama terjadi sebaliknya di endpoint image-to-video. Pilih satu jalur per panggilan.

Bisakah saya mengirim file audio saja sebagai referensi MiniMax H3 reference-to-video?

Tidak. Audio harus disertai dengan setidaknya satu gambar atau video referensi, dan endpoint menerapkannya dengan error eksplisit: reference-to-video requires at least one reference image or video. Itu tiba di tahap generasi, bukan saat kirim, dan pekerjaan yang ditolak gratis. Referensi audio juga harus berada di dalam 2 hingga 15 detik, 15 detik digabungkan, dan dideklarasikan sebagai audio/mp3 daripada audio/mpeg.

Apakah MiniMax H3 reference-to-video mengenakan biaya tambahan untuk setiap file referensi?

Tidak di Atlas Cloud. Eksekusi dengan sepuluh gambar referensi dan satu gambar referensi ditagih identik $0,40 pada 768P dan 4 detik, jadi meteran hanya melacak detik output dan resolusi. Namun, perhatikan kontradiksi: aturan MiniMax sendiri menyebutkan video input diukur pada tarif output, dan platform lain mengekspos item baris gambar referensi terpisah. Verifikasi di permukaan mana pun Anda menagih.

Apa yang terjadi jika salah satu URL MiniMax H3 reference-to-video saya rusak?

Per 2026-08-12, endpoint memvalidasi keterjangkauan dan menggagalkan seluruh pekerjaan secara gratis, dengan content[1].image_url: media not found (HTTP 404) setelah sekitar 21 detik. Itu perubahan: di awal Agustus, permintaan yang sama selesai, diam-diam mengabaikan referensi yang hilang, dan mengenakan harga penuh. Jangan berasumsi laporan perilaku lama masih berlaku, dan periksa field status daripada menganggap 200 saat kirim berarti apa pun.

Apakah MiniMax H3 reference-to-video benar-benar model terbaik untuk ini?

Di satu-satunya head-to-head publik yang mengukurnya, ya, secara sempit. MiniMax H3 memimpin papan peringkat pengeditan video pada Elo 1.125 dari 10.280 suara, tetapi rentang peringkatnya tercantum sebagai 1 hingga 2 dan Gemini Omni Flash berada 3 poin Elo di belakang dengan interval yang tumpang tindih. Perlakukan sebagai "yang terbaik yang tersedia bersama", pilih berdasarkan sisa alur kerja, dan baca Alternatif MiniMax H3 jika seri itu penting bagi Anda.

Model Terbaru

Satu API untuk semua AI multimedia.

Jelajahi semua model