Seedance 2.5 Kini Tersedia — Hadir Pertama di Atlas Cloud

MiniMax H3 Lip Sync dan Audio: Saya Memasukkan 6 Detik Suara dan Menghapus 4 Alat dari Pipeline Saya

MiniMax H3 lip sync dan audio menggantikan rantai dubbing enam langkah saya dengan satu panggilan API. Dua pengambilan asli, batasan audio referensi yang tidak didokumentasikan siapa pun, dan tagihan sebenarnya.

Pria mengenakan headphone berbicara ke mikrofon sambil membaca naskah

Bingkai radio malam hari yang menjadi titik awal setiap gambar dalam artikel ini, dibuat dengan openai/gpt-image-2/text-to-image pada kualitas tinggi, 2048x1152

Gambar diam ini adalah input untuk seluruh tutorial di bawah. Dibuat dengan openai/gpt-image-2/text-to-image, kualitas tinggi, 2048x1152.

Pikirkan tentang terakhir kali Anda menyelesaikan bidikan 8 detik dan hasilnya tanpa suara.

Anda mengekspor klip. Anda membuka tab TTS dan mengetikkan dialog. Anda menggali pustaka suara untuk hujan dan suara ruangan. Anda menyeret semua itu ke dalam linimasa dan menggeser bentuk gelombang ke kiri dan kanan sampai mulut berhenti berbohong. Kemudian Anda membayar model lip-sync terpisah untuk memperbaiki mulut itu. Empat alat, tiga file wav, satu jam, dan penampilannya masih terasa seperti sulih suara, karena memang begitu.

Rantai itulah yang diam-diam dihapus oleh MiniMax H3. Bukan karena ia "memiliki audio" (banyak model yang mengklaim hal itu), tetapi karena satu slot di badan permintaan yang hampir tidak ada yang uji: Anda bisa memberikannya potongan audio yang sudah Anda miliki, secara gratis, dan mendapatkan suara itu kembali pada wajah.

Di bawah ini adalah uji dua pengambilan yang mengisolasi slot tersebut, harga nyata dari setiap langkah yang digantikannya, batasan keras yang akan menolak permintaan Anda, dan tagihan sebenarnya.

Poin-poin penting

  • Satu panggilan mengembalikan gambar, dialog, suara ruangan, dan gerakan bibir secara bersamaan. Teks, visual, dan audio dikodekan secara terpisah, lalu satu Omni Transformer bersama-sama memprediksi laten video dan audio (Kartu model Hugging Face, Agustus 2026).
  • Audio input gratis. Video input tidak: MiniMax menagih video referensi dengan tarif output, sehingga 15 detik bahan yang sama berharga $0 sebagai lagu dan sekitar $1,95 sebagai klip video.
  • Batasan keras: maksimal 3 klip audio, masing-masing 2 hingga 15 detik, total 15 detik, dan audio tidak dapat berjalan sendiri. Ia harus disertai setidaknya satu gambar atau video.
  • Dengan $0,14 per detik untuk 2K di Atlas Cloud, bidikan 10 detik penuh dengan suara berharga $1,40, yang lebih murah daripada membayar model lip-sync khusus $0,22 per detik untuk menambal klip yang sudah Anda render.

Suara Menyala: Dua Pengambilan MiniMax H3 Lip Sync dan Audio, Satu Perbedaan Enam Detik

Pakai headphone untuk yang ini. Kedua bagian mendapatkan bingkai dasar yang sama, dua baris dialog yang sama, dan prompt yang sama, kata demi kata. Hanya satu dari mereka yang mendengar rekaman suara enam detik terlebih dahulu.

fXlyer__czg

Suara menyala, dan gunakan headphone: bagian kiri (Pengambilan A, tanpa audio referensi) diputar di telinga kiri Anda, bagian kanan (Pengambilan B, dengan referensi 6 detik) di telinga kanan Anda. Bingkai yang sama, dialog yang sama, prompt yang sama. Kedua pengambilan: minimax/h3/reference-to-video, 2K, 10 detik, dikirim sebagai 2560x1440 pada 24fps dengan trek stereo 32 kHz.

Pengambilan A tidak memiliki pegangan selain kata-kata "suara pria penyiar yang tenang, rendah, magnetis" dalam prompt, sehingga ia menciptakan suara. Pengambilan B diberikan 6,19 detik dari kalimat yang sama sekali berbeda dan diperintahkan untuk memperlakukannya hanya sebagai jangkar timbre. Tidak ada pengambilan yang di-sulih suara setelahnya. Tidak ada yang mendekati model lip-sync. Dalam keduanya, mulut mengikuti suara apa pun yang dihasilkan model, karena mulut dan suara dihasilkan bersama.

Nilailah timbre dengan telinga Anda sendiri daripada percaya kata-kata saya. Apa yang dapat saya nyatakan sebagai fakta adalah mekanisme, pengaturan, dan tagihan, dan itu akan dijelaskan selanjutnya.

Mengapa MiniMax H3 Lip Sync dan Audio Memutuskan Rantai Sulih Suara Enam Langkah Semua Orang

Rantai lama sebenarnya bukanlah alur kerja. Itu adalah pekerjaan perbaikan.

ImGr2NgcCCY

Suara menyala. Seekor katak dan bunglon animasi 3D berbicara satu sama lain di dalam tenda sirkus di malam hari, dengan suasana kandang di bawah dialog. Klip referensi MiniMax untuk audio asli H3. Bentuk mulut pada karakter animasi adalah kasus tersulit untuk dipalsukan, itulah sebabnya yang satu ini layak mendapat 20 detik perhatian Anda.

Tiga hal terus rusak, dan itu rusak karena alasan struktural, bukan karena nasib buruk.

Linimasa ada di tangan Anda. Model video memberi Anda bingkai. Model TTS memberi Anda bentuk gelombang. Tidak ada satu pun dari kedua keluaran yang tahu tentang yang lain, sehingga penyelarasan adalah penilaian manusia yang dilakukan pada 30 bingkai per detik, dengan mata, pada jam 1 pagi. Setiap render ulang memulai penilaian itu dari awal.

Lip-sync gaya tambal memiliki batas. Model lip-sync khusus hanya memiliki wilayah mulut dari rekaman yang sudah ada. Ia dapat membuat mulut sesuai dengan audio. Ia tidak dapat membuat rahang tegang sebelum konsonan keras, atau menempatkan napas sebelum dialog, atau membiarkan bahu turun saat kalimat berakhir, karena bingkai-bingkai itu dirender sebelum ada yang tahu apa yang akan dikatakan karakter. Anda mendapatkan akurasi tanpa performa, yang terbaca sebagai tidak wajar.

Desain suara adalah proyek kedua. Hujan, suara ruangan, derit kursi, garis bass di bawah dialog. Semua itu datang dari sumber yang berbeda dan harus diseimbangkan dengan suara yang sendiri ditempelkan.

Apa yang Dikatakan Audio VAE kepada Anda Tentang MiniMax H3 Lip Sync dan Audio

Inilah bagian yang bukan bahasa pemasaran, karena Anda dapat melihatnya dalam nama file.

Di H3, teks melewati H3-Encoder, input visual melewati H3-Encoder dan H3-VisualVAE, dan audio hanya berjalan melalui H3-AudioVAE yang berdiri sendiri. H3-Omni-Transformer kemudian bersama-sama memprediksi laten video dan audio, yang didekodekan menjadi video dan audio stereo secara terpisah. AudioVAE berbagi satu encoder dan decoder di seluruh saluran kiri dan kanan, memproses masing-masing secara independen, menggabungkannya kembali untuk stereo, dan mengompresi audio 32 kHz menjadi urutan token laten pada laju temporal 40 Hz (Kartu model Hugging Face).

Ketika ComfyUI merilis dukungan hari-0, arsitektur itu muncul sebagai dua file terpisah di folder VAE: minimax_h3_video_vae_fp16.safetensors dan minimax_h3_audio_vae_fp32.safetensors, dimuat oleh pemuat VAE ganda yang mengambil jalur video dan jalur audio (Blog ComfyUI, Agustus 2026). Audio adalah modalitas yang dibangun ke dalam model, bukan proses pasca-produksi yang ditempelkan di ujungnya.

Papan peringkat setuju di mana hal itu terlihat. Artificial Analysis menempatkan H3 pertama di papan peringkat penyuntingan video dengan audio pada 1.130 Elo dari 5.043 sampel preferensi buta, sementara menempatkannya di tiga besar baik dalam teks-ke-video maupun gambar-ke-video (Artificial Analysis, Juli 2026). Kesenjangan antara "gambar yang sangat bagus" dan "tempat pertama" dalam peringkat tertentu itu adalah audio.

Alur Kerja MiniMax H3 Lip Sync dan Audio, Dihargai Terhadap Rantai yang Digantikannya

Cara yang jujur untuk menilai ini bukanlah dengan perasaan. Ini adalah dengan menghargai rantai lama langkah demi langkah, menggunakan tarif per detik nyata untuk bidikan 10 detik yang sudah jadi, dan kemudian menghargai penggantinya.

#Rantai lama, langkah demi langkahApa yang menjalankannyaBerapa biaya langkah ituDengan MiniMax H3 lip sync dan audio
1Render gambar diammodel video, mis. bytedance/seedance-2.0 seharga $0,112/dtk$1,12panggilan tunggal yang sama
2Menyuarakan dialogminimax/speech-2.6-hdsekitar $0,02 untuk ~250 karakterpanggilan tunggal yang sama
3Temukan atau buat musikminimax/music-2.6$0,15 per trekpanggilan tunggal yang sama
4Lapisi suasana dan efek suarapustaka suara plus tangan Andamalam Andapanggilan tunggal yang sama
5Sejajarkan semua di linimasaeditor plus tangan Andamalam Andatidak ada
6Campureditor plus tangan Andamalam Andatidak ada
7Perbaiki mulutsync/lipsync-v3 seharga $0,22/dtk$2,20tidak ada
Total4 model plus 2 jalur manualsekitar $3,49 plus malam Anda1 panggilan, $1,40

Baca baris 7 dua kali. Memperbaiki mulut klip yang sudah Anda render berharga $0,22 per detik, sementara menghasilkan seluruh bidikan dengan suaranya, suasananya, dan gerakan mulutnya berharga $0,14 per detik. Perbaikan lebih mahal daripada aslinya. Satu perbandingan itu adalah seluruh argumen.

Asimetri yang tidak disebutkan siapa pun: audio Anda sendiri gratis, video Anda sendiri tidak.

Tabel harga prabayar MiniMax mencantumkan materi input secara terpisah dari output. Untuk H3, input audio gratis. Lima gambar input pertama gratis dan setiap gambar setelahnya $0,04. Video input ditagih berdasarkan durasi klip input dengan tarif resolusi output, yaitu $0,13 per detik pada 2K (Dokumen harga MiniMax, diperiksa 3 Agustus 2026). Jadi, 15 detik bahan referensi yang sama tidak ada biaya sebagai lagu, memo suara, atau VO yang disediakan klien, dan sekitar $1,95 sebagai klip video.

Itulah garis yang seharusnya mengubah cara Anda membangun. Audio referensi adalah permukaan kontrol termurah dalam model, dan itulah yang tidak diuji siapa pun.

Input referensiBerapa banyakPer klipTotalPenagihan (MiniMax)
Gambarhingga 9n/an/a5 pertama gratis, lalu $0,04 masing-masing
Videohingga 32 hingga 15 dtkmaks 15 dtkditagih dengan tarif output, $0,13/dtk pada 2K
Audiohingga 32 hingga 15 dtkmaks 15 dtkGratis
Campuran apa punmaks 12 filen/an/asesuai di atas, per jenis
Audio sajatidak diizinkan. Audio harus disertai input gambar atau video dan tidak dapat digunakan sebagai satu-satunya input

Batas dari spesifikasi H3-Base-Ref2VA di kartu model. Skema Atlas Cloud untuk minimax/h3/reference-to-video mengatakan hal yang sama dengan kata-katanya sendiri: "Setidaknya satu gambar ATAU video diperlukan (audio saja tidak diizinkan)."

Dua catatan kaki di sisi Atlas meteran, keduanya dari hasil uji coba saya sendiri, bukan dari halaman dokumen. Atlas menagih tarif tetap $0,14 per detik output untuk ketiga titik akhir H3, dan video referensi yang saya lampirkan tidak menambahkan biaya terpisah di atasnya. Itu adalah satu pengamatan, bukan kebijakan, jadi anggarkan untuk aturan MiniMax dan perlakukan tarif tetap sebagai bonus. Atlas juga menerima resolution: "768P" dan menagihnya dengan $0,14 yang sama, yang merupakan perbedaan yang layak dibaca dalam Rincian harga API MiniMax H3 daripada di sini.

Semua yang di bawah berjalan dalam satu tab browser di Atlas Cloud: bingkai dasar, referensi suara, dan kedua pengambilan H3, pada satu kunci API dengan satu putaran polling. Ketiga titik akhir H3 hanya berbeda dalam bentuk inputnya, sehingga refers menjadi image menjadi teks biasa dan tidak ada yang lain tentang kode Anda yang berubah.

MiniMax H3 Lip Sync dan Audio, Langkah demi Langkah

Lima langkah. Dua di antaranya adalah pengaturan murah, dua adalah uji coba sebenarnya, dan yang terakhir tidak memakan biaya apa pun karena dirancang untuk gagal.

Langkah 1: Buat Bingkai Dasar dengan GPT Image 2

Demo adalah seorang penyiar radio malam, dipilih karena satu alasan: close-up ketat pada mulut adalah satu-satunya pembingkaian di mana Anda benar-benar dapat menilai lip-sync. Bidikan lebar memungkinkan model untuk curang.

Dua hal dalam prompt ini tidak dapat dinegosiasikan. Mulut harus sedikit terbuka di tengah kata, sehingga bingkai pertama sudah terbaca sebagai ucapan, dan tidak boleh ada teks di mana pun dalam bingkai, sehingga teks dinamis nanti tidak bertabrakan dengan huruf yang sudah menyatu.

plaintext
1Still sinematografis fotorealistik, 16:9, studio radio malam, pembingkaian ketat dari dada ke atas pada
2seorang pria berusia akhir tiga puluhan yang mencondongkan tubuh ke mikrofon kondensor perak vintage
3di lengan boom, busa windshield beberapa inci dari bibirnya, headphone setengah terbuka di satu telinga.
4Lampu meja tungsten hangat dari kamera-kiri mengukir tulang pipinya; neon merah ON AIR menyala tidak
5fokus di belakang bahunya dan mengalir merah ke fader meja mixing di latar depan bawah. Hujan mengalir
6di jendela studio di kanan, lampu kota kabur menjadi bokeh. Asap rokok tipis melayang melalui sinar lampu.
7Mulut sedikit terbuka di tengah kata, mata menunduk ke naskah kertas. Difilmkan dengan 35mm,
8kedalaman bidang dangkal, butir film halus, bayangan dalam, tidak ada teks di mana pun dalam bingkai.
9

Pengaturan di openai/gpt-image-2/text-to-image: kualitas tinggi, ukuran 16:9 pada 2048x1152, satu gambar. $0,009 pada daftar model adalah lantai tingkat token, bukan yang Anda bayar. Pada ukuran dan kualitas ini, tombol Jalankan mengutip $0,1745 per gambar, yang dapat Anda baca dalam tangkapan layar di bawah.

Antarmuka generator gambar AI menunjukkan prompt dan keluarannya

GPT Image 2 di Atlas Cloud dengan prompt bilik radio diketik, kualitas tinggi dan 16:9 2048x1152 dipilih, dan bingkai dasar selesai dirender di panel OUTPUT_GPT Image 2 di Atlas Cloud: prompt persis di atas, kualitas tinggi, 16:9 pada 2048x1152, dan gambar kedua dari bingkai yang sama di OUTPUT._

Langkah 2: Buat Referensi Suara Enam Detik

Ini adalah langkah yang sering dilakukan orang salah, jadi baca alasannya sebelum prompt.

Audio referensi harus mengatakan kalimat yang berbeda dari yang Anda inginkan dalam video. Itu adalah jangkar timbre, bukan yang lain. Dialog berasal dari prompt. Contoh referensi-ke-video MiniMax sendiri membuat pemisahan ini eksplisit: ia memberi label satu klip sebagai trek sumber yang akan digunakan sebagian untuk musik, dan klip kedua semata-mata sebagai "referensi timbre suara," dengan dialog baru ditulis dalam prompt. Jika referensi Anda mengatakan kata-kata yang sama yang Anda minta, Anda mengundang model untuk menyalin trek alih-alih mentransfer suara.

plaintext
1Anda mendengarkan Night Line, sembilan puluh satu koma empat, dan ini akan mendekati
2pukul tiga pagi.
3

Pengaturan di minimax/speech-2.6-hd: suara pria rendah tenang apa pun berfungsi, dan saya memilih Pria Bersuara Magnetis (English_magnetic_voiced_man). Atur speed ke 0,95 sehingga pengambilan jatuh dalam jendela 2 hingga 15 detik dengan ruang tersisa, biarkan vol pada 1,0, dan pertahankan output mp3. Model ini $0,08 per 1.000 karakter, turun dari $0,10, diskon 20% yang berlaku per Agustus 2026. Dialog saya kembali pada 6,19 detik dan ditagih $0,00792.

Antarmuka generator suara dengan input teks dan output bentuk gelombang audio

MiniMax Speech 2.6 HD di Atlas Cloud dengan baris referensi diketikkan ke kolom teks dan bentuk gelombang audio yang dirender di panel OUTPUT

MiniMax Speech 2.6 HD di Atlas Cloud: satu baris masuk, satu mp3 pendek keluar, dengan diskon 20% terlihat di tombol Jalankan. Tangkapan layar diambil pada suara Expressive Narrator default, jadi alihkan pemilih Suara ke Pria Bersuara Magnetis dan turunkan Kecepatan ke 0,95 sebelum Anda menjalankannya.

Langkah 3: Jalankan MiniMax H3 Lip Sync dan Audio dengan Audio Referensi

Sekarang kedua file masuk ke refers bersama-sama: gambar diam dari Langkah 1 dan mp3 dari Langkah 2. Ini adalah Pengambilan B.

Prompt menggunakan struktur terseksi yang dilatih H3. subject_definitions menyebutkan siapa dan apa referensi itu, detailed_description membawa dialog di dalam tag <d>[English] ...</d>, dan dua bagian audio menggambarkan campuran. Jika nama seksi baru bagi Anda, panduan prompt MiniMax H3 mencakup struktur lengkap. Hanya tiga bidang yang penting untuk pekerjaan audio, dan semuanya ada di sini.

plaintext
1subject_definitions:
2<Subject 1> adalah pria di mikrofon radio di <Picture 1>, akhir tiga puluhan, headphone
3setengah terbuka di satu telinga, neon merah ON AIR di belakang bahunya.
4<Picture 1> adalah bingkai pembuka video target.
5<Audio 2> adalah referensi timbre suara untuk <Subject 1>: suara pria penyiar yang tenang, rendah, magnetis.
6Referensi hanya timbre; jangan gunakan kembali kata-katanya.
7
8summary:
9[referensi gambar + referensi timbre audio] Satu close-up 10 detik kontinu. <Subject 1>
10menyampaikan dua baris langsung ke mikrofon dalam timbre suara <Audio 2>, sementara
11kamera mendorong perlahan. Gerakan mulut, napas sebelum setiap baris, dan suara ruangan
12dihasilkan bersama.
13
14detailed_description:
15Bidikan terbuka persis pada <Picture 1>. Tungsten hangat dari kamera-kiri, neon merah mengalir ke
16meja mixing di latar depan, hujan di jendela di belakang. <Subject 1> mengambil napas pendek,
17miring beberapa derajat ke arah windscreen, dan berbicara, <d>[English] Ini jam tiga pagi,
18dan saya tahu persis siapa yang masih terjaga.</d> Saat dia berbicara, rahang dan bibirnya bergerak
19secara alami dengan setiap suku kata; plosif pada "three" dan "morning" terlihat. Dia melirik ke
20bawah ke naskah, lalu kembali ke atas melewati lensa, dan melanjutkan, <d>[English] Jadi mari kita
21jaga ini antara kita.</d> Tepat saat suaranya berhenti, bibirnya menutup dan dia menghembuskan napas
22melalui hidung. Sepanjang, kamera melakukan satu dorongan masuk yang lambat dan disengaja; neon
23berkedip sekali, samar-samar, sekitar detik ketujuh. Tidak ada teks di layar.
24
25overall_soundscape:
26Suara dekat, kering, seperti bilik dengan efek kedekatan dari mikrofon. Di bawahnya:
27dengung listrik rendah dari meja, hujan stabil di kaca, satu mobil jauh lewat di
28jalan basah, derit lembut kursi saat dia mencondongkan tubuh, dan satu napas terdengar sebelum
29setiap baris.
30
31non_diegetic_music:
32Kontrabas jazz malam yang jarang, lambat, sangat pelan, jauh di bawah suara, masuk sekitar
33detik kedua dan tidak pernah naik di atas dialog.
34

Pengaturan di minimax/h3/reference-to-video: resolusi 2K, durasi 10, rasio aspek 16:9, dan refers menampung kedua file. Urutan di dalam array tidak masalah, hanya saja setidaknya salah satunya adalah gambar atau video. Penggeser Durasi default ke 8, jadi gerakkan, dan alihkan Rasio Aspek dari adaptive jika Anda menginginkan bingkai yang Anda minta.

Empat jebakan parameter, tiga di antaranya telah menghabiskan uang saya. Kuncinya adalah ratio, bukan aspect_ratio, dan salah mendapatkannya akan mengembalikan 400. Selalu kirim duration secara eksplisit, karena default skema mengatakan 8 tetapi permintaan tanpanya kembali sebagai file 5 detik. Pada titik akhir ini, mengirim image bersama refers akan selesai, ditagih penuh, dan diam-diam menjatuhkan salah satunya. Dan jika Anda meneruskan audio sebagai URL data base64, beri label data:audio/mp3, bukan data:audio/mpeg. Upaya pertama saya mati tepat pada itu:

plaintext
1content[2].audio_url: invalid param: audio format ".mpeg" not allowed
2

Yang itu setidaknya gratis, yang membawa kita pada cara yang berguna untuk mempelajari batasannya.

Antarmuka generator video AI menunjukkan input prompt teks dan output video

Playground MiniMax H3 reference-to-video di Atlas Cloud, dengan mp3 di slot 1 dan bingkai dasar di slot 2 Bahan Referensi, resolusi 2K, dan klip selesai diputar di panel OUTPUT

MiniMax H3 reference-to-video di Atlas Cloud: Bahan Referensi menunjukkan 2/9 dengan mp3 di slot satu dan gambar diam di slot dua, resolusi 2K, klip selesai di kanan. Tangkapan ini berjalan pada default 8 detik playground, itulah sebabnya tombol Jalankan mengatakan $1,12; dua pengambilan saya di atas berjalan pada 10 detik seharga $1,40 masing-masing.

Langkah 4: Jalankan Pengambilan Kontrol MiniMax H3 Lip Sync dan Audio

Ubah satu input dan setiap penyebutannya. Hapus mp3 dari refers sehingga hanya gambar yang tersisa, hapus definisi <Audio 2>, potong frasa "dalam timbre suara <Audio 2>" dari ringkasan, dan ubah tag kurung menjadi [referensi gambar]. Tidak ada yang lain yang bergerak, dan pengaturan tetap identik: 2K, 10 detik, 16:9.

Itulah yang menjadikannya kontrol alih-alih upaya kedua. Model sekarang tidak memiliki jangkar timbre, sehingga ia menciptakan suara dari deskripsi tertulis dan melakukan lip-sync ke suara yang baru saja dibuatnya. Kedua pengambilan kembali pada 10,13 detik dan ditagih $1,40 masing-masing, hingga sen.

WnfqR2I-a-8

Suara menyala. Pengambilan A sendiri: bingkai yang sama, dialog yang sama, tanpa audio referensi. Suara di sini adalah ciptaan model, dan mulut masih mengikutinya.

Dua pengambilan, satu variabel. Itu adalah eksperimen termurah di seluruh artikel ini dan satu-satunya yang memberi tahu Anda apa yang sebenarnya dilakukan slot audio.

Langkah 5: Rusakkan MiniMax H3 Lip Sync dan Audio dengan Sengaja

Langkah terakhir gratis, dan layak dilakukan sekali sehingga Anda mengenali kegagalan pada jam 2 pagi.

Tempatkan mp3 di refers dan tidak ada yang lain. Tanpa gambar, tanpa video, hanya audio. Kemudian kirim.

plaintext
1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "minimax/h3/reference-to-video",
6    "prompt": "Seorang pria di mikrofon radio mengucapkan dua baris ke windscreen.",
7    "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}],
8    "resolution": "2K",
9    "duration": 10,
10    "ratio": "16:9"
11  }'
12

Inilah bagian yang layak diketahui, karena ini bukan yang tersirat oleh skema. Panggilan kirim mengembalikan HTTP 200 dengan id tugas normal dan "status": "processing", sehingga klien yang naif mengira itu berhasil. Dua puluh tiga milidetik kemudian tugas tersebut mati:

plaintext
1{
2  "status": "failed",
3  "error_code": 1010001,
4  "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video",
5  "latency_ms": 23
6}

Tidak ada bidang price yang pernah muncul pada prediksi itu, sehingga tidak memakan biaya. Pelajaran praktisnya adalah tentang kode Anda, bukan dompet Anda: 200 pada pengiriman bukanlah kesuksesan. Polling id, dan periksa status sebelum Anda menganggap Anda memiliki klip.

Empat Cara Lain untuk Mendorong MiniMax H3 Lip Sync dan Audio

Uji dua pengambilan adalah eksperimen terkecil yang berguna. Berikut adalah ke mana slot yang sama pergi selanjutnya.

Satu bidikan, beberapa bahasa. Pertahankan bingkai, pertahankan pemblokiran, ubah tag bahasa di dalam <d>...</d> dan jalankan lagi. Mulut mengikuti bahasa baru daripada yang lama, karena mulut dan suara keluar dari langkah maju yang sama. Kartu model mencantumkan dukungan dialog stabil untuk 11 bahasa: Arab, Cina, Inggris, Prancis, Jerman, Italia, Jepang, Korea, Portugis, Rusia, dan Spanyol, dengan lebih banyak yang didukung dalam berbagai tingkat. Dua klip ini adalah trailer yang sama dengan dua trek suara yang berbeda, dan MiniMax juga memotong versi Prancis dan versi tanpa narasi dari pengaturan yang sama.

hj7ZId3KOKk

Suara menyala. Versi sulih suara Inggris: close-up astronot di planet oranye berdebu, narasi dan musik tiba bersama gambar. Pekerjaan trailer adalah tiga bidang prompt yang sama dengan soundscape yang berbeda.

Hv62FGyBNPM

Suara menyala. Versi Jepang, bingkai demi bingkai trailer yang sama. Tidak ada yang di-sulih suara ulang dan tidak ada sesi VO terpisah yang terjadi.

Bernyanyi, dengan hook yang sudah Anda miliki. Di sinilah audio input gratis berhenti menjadi catatan kaki. Jatuhkan hook yang ada atau instrumental ke dalam refers pada 15 detik atau kurang, deskripsikan performanya, dan karakter akan tampil untuknya. Anda tidak membayar untuk musik yang Anda bawa.

zui3Zw_UWnY

Suara menyala. Potongan band dalam tampilan camcorder retro, di belakang panggung ke pertunjukan, dengan trek dan gambar tiba bersamaan. Itulah bentuk yang sebagian besar pekerjaan video musik sebenarnya inginkan.

Dua orang berbicara lebih sulit daripada satu. Satu pembicara dalam close-up adalah kasus mudah, itulah sebabnya artikel ini menggunakannya. Untuk dialog antara dua karakter, beri label secara eksplisit seperti yang dilakukan contoh MiniMax sendiri, dengan <Subject 1> (S1) dan <Subject 2> (S2) dilampirkan ke setiap baris <d>, dan perkirakan untuk mengulang ketika model salah urutan atau atribusi. Anggarkan dua kali proses untuk dua karakter.

Suasana tanpa sepatah kata pun. overall_soundscape adalah bidang tersendiri, dan berfungsi tanpa dialog sama sekali. Hujan di kaca, derit kursi, dengung kulkas, ruangan itu sendiri. Itu membuat titik akhir yang sama menjadi alat ASMR dan suasana yang sah, dan itu adalah satu-satunya penggunaan di mana mulut tidak pernah penting.

Satu batasan jujur dari dua pengambilan saya sendiri: generasi pass yang sama berarti mulut dan suara setuju, dan itu tidak berarti setiap detail fisik dalam bingkai setuju dengan suara. Dialog panjang yang dipadatkan ke dalam durasi pendek, arahan performa yang tidak jelas, dan adegan multi-pembicara semuanya menurunkan hasil. Tonton klip Anda sebelum Anda mengirimnya, seperti Anda akan menonton pengambilan dari aktor manusia.

Berapa Biaya Sebenarnya MiniMax H3 Lip Sync dan Audio bagi Saya

Setiap angka di bawah adalah biaya nyata pada akun nyata, yang ditarik setelah kejadian. Bidang price pada prediksi terisi terlambat, sehingga polling hingga completed sering kali tidak mengembalikan apa pun. Ambil ulang id untuk mendapatkan angkanya.

LangkahModelApa yang berjalanDitagih
1openai/gpt-image-2/text-to-image1 bingkai dasar, kualitas tinggi, 2048x1152$0,1745 (dikutip pada tombol Jalankan)
2minimax/speech-2.6-hd99 karakter, 6,19 dtk suara referensi$0,01
3minimax/h3/reference-to-videoPengambilan B, 10 dtk pada 2K, gambar + audio di refers$1,40
4minimax/h3/reference-to-videoPengambilan A, 10 dtk pada 2K, gambar saja$1,40
5minimax/h3/reference-to-videopermintaan audio saja, gagal 23 md$0,00
Seluruh eksperimen, kedua pengambilansekitar $2,98

Dua catatan akuntansi, karena kejujuran lebih murah daripada catatan kaki. URL data audio/mpeg yang salah di Langkah 3 juga tidak memakan biaya, karena 400 pada saat pengiriman. Penolakan gratis, tetapi permintaan yang terbentuk dengan baik dengan input yang rusak tidak, sehingga URL referensi yang diam-diam 404 masih akan menagih Anda penuh. Dan tangkapan playground di tangkapan layar Langkah 3 adalah proses H3 ketiga pada default 8 detik panel, yang ditagih $1,12 di atas tabel. Proses itu ada untuk artikel ini, bukan untuk eksperimen.

Rantai lama, yang dihargai dalam tabel di atas, adalah sekitar $3,49 untuk satu bidikan 10 detik ditambah malam penyelarasan manual. Ini adalah dua bidikan 10 detik lengkap dengan suara, A/B terkontrol, dan dua permintaan yang sengaja rusak, dengan harga lebih murah.

Namun demikian, H3 adalah alat yang salah untuk beberapa pekerjaan yang akan coba diberikan orang, dan alternatifnya lebih murah.

Apa yang sebenarnya Anda inginkanModel yang tepatHargaMengapa
Satu potret plus satu file audio yang ada, menjadi kepala berbicarabytedance/avatar-omni-human-v1.5$0,12/dtkAudio-ke-video yang dibangun khusus, dan panjang output mengikuti audio Anda
Klip jadi yang mulutnya perlu berbicara bahasa barusync/lipsync-v3$0,22/dtkH3 tidak memodifikasi render Anda yang sudah ada, dan menambal adalah pekerjaan model ini
Perbaikan mulut termurah pada kepala berbicaraveed/lipsync$0,013/dtkKira-kira sepuluh kali lebih murah, dan hanya menyentuh mulut, bukan performa
Seluruh bidikan terarah, dengan timbre, suasana, dan musik bersamaminimax/h3/reference-to-video$0,14/dtkGambar dan suara berasal dari satu langkah, sehingga performa dirancang, bukan diperbaiki

Jika Anda memilih antara H3 dan pesaing terdekatnya pada pekerjaan karakter daripada pada audio, perbandingan Seedance 2.5 adalah bacaan yang lebih baik. Dan jika Anda bertanya-tanya apakah bobot terbuka membuat ini gratis, itu tidak membuatnya cepat: 2K masih berasal dari sisi API, dan laporan komunitas menempatkan render lokal 480p 10 detik dalam hitungan menit, bukan detik, pada kartu konsumen.

Satu Catatan Jujur tentang Suara, Lagu, dan Hak

Gratis untuk diunggah tidak sama dengan gratis untuk digunakan. Lagu yang tidak Anda tulis dan suara yang bukan milik Anda adalah dua izin terpisah, dan tidak satu pun diberikan oleh API yang tidak membebani biaya apa pun untuk unggahan. Gunakan rekaman Anda sendiri, musik berlisensi, atau suara sintetis yang Anda buat sendiri, yang persis seperti yang dilakukan Langkah 2.

Secara terpisah, bobot komunitas membawa batasan teritorial yang saat ini tidak mencakup UE, Inggris, Korea Selatan, atau AS, dengan saluran lisensi formal yang terbuka sebagai gantinya. Itu adalah cerita yang lebih panjang, dan diceritakan dalam panduan bobot terbuka MiniMax H3.

MiniMax H3 Lip Sync dan Audio: Pertanyaan yang Sering Diajukan

Apakah MiniMax H3 lip sync dan audio benar-benar menghasilkan suara dalam langkah yang sama, atau di-sulih suara setelahnya?

Langkah yang sama. Teks melewati H3-Encoder, visual melalui H3-Encoder plus H3-VisualVAE, dan audio melalui H3-AudioVAE yang berdiri sendiri. H3-Omni-Transformer bersama-sama memprediksi laten video dan audio, yang kemudian didekodekan secara terpisah menjadi gambar dan audio stereo 32 kHz. Tidak ada yang dilapiskan setelahnya, itulah sebabnya mulut, napas, dan suara ruangan milik pengambilan yang sama.

Bisakah saya memasukkan lagu atau suara saya sendiri ke MiniMax H3 lip sync dan audio, dan apakah itu dikenakan biaya tambahan?

Ya, dan tidak. Tabel prabayar MiniMax mencantumkan input audio H3 sebagai Gratis. Asimetri yang harus diperhatikan adalah video: video input ditagih berdasarkan durasinya dengan tarif output, $0,13 per detik pada 2K, sehingga 15 detik video referensi berjalan sekitar $1,95 sementara 15 detik audio referensi berjalan $0.

Mengapa MiniMax H3 lip sync dan audio menolak permintaan yang hanya memiliki audio?

Karena audio adalah satu-satunya jenis referensi yang tidak dapat berjalan sendiri. Ia harus disertai setidaknya satu gambar atau video. Sisa batasannya, dari spesifikasi H3-Base-Ref2VA: hingga 9 gambar, hingga 3 video dan hingga 3 klip audio, setiap klip video atau audio antara 2 hingga 15 detik, total 15 detik per jenis, dan maksimum 12 file di semua jenis dalam satu permintaan.

Apakah MiniMax H3 lip sync dan audio akan bertahan untuk seluruh klip, atau hanya baris pertama?

Untuk satu pembicara dengan ruang bernapas, itu bertahan di seluruh klip, bukan hanya mendaratkan satu baris dan kemudian melenceng. Tiga hal yang memecahkannya: memasukkan naskah panjang ke dalam durasi pendek, arahan performa yang tidak jelas atau hilang, dan adegan multi-pembicara di mana model harus memutuskan siapa yang berbicara kapan. Beri setiap baris pembicara berlabel dan cukup detik untuk mengatakannya.

Apakah MiniMax H3 lip sync dan audio memerlukan sulih suara ulang untuk bahasa lain?

Tidak. Ubah tag bahasa di dalam markup dialog, dari <d>[English] ...</d> menjadi <d>[Japanese] ...</d>, dan jalankan prompt yang sama lagi. Mulut dihasilkan dengan suara baru, sehingga cocok dengan bahasa baru alih-alih yang lama. Kartu model mencantumkan dukungan dialog stabil untuk 11 bahasa.

Apakah lebih murah menjalankan MiniMax H3 lip sync dan audio secara lokal?

Lebih murah per klip, mahal dalam segala hal lainnya. Bobotnya terbuka, tetapi laporan komunitas tentang proses lokal pada kartu konsumen 16GB mengukur generasi 480p 10 detik dalam hitungan menit, hosting sendiri menghasilkan pada sisi pendek 768, dan 2K masih berasal dari langkah regenerasi sisi API. Tambahkan batasan teritorial dalam lisensi komunitas dan API tetap menjadi jalur pragmatis untuk pekerjaan jadi.

Model Terbaru

Satu API untuk semua AI multimedia.

Jelajahi semua model