Kenakan headphone sebelum Anda menggulir ke klip di bawah. Dalam kategori ini, itu benar-benar penting.
Sebuah pisau turun membelah delima yang diukir dari kaca rubi. Cangkangnya terbelah, retakan kristalin terdengar, lalu beberapa lusin biji kaca berguling di atas batu tulis basah. Inilah bagian yang berbeda dari hampir semua klip ASMR AI yang pernah Anda lewati tahun ini: tidak ada orang yang menambahkan suara itu. Tidak ada pustaka suara, tidak ada editor, tidak ada timeline. Gambar dan audio keluar dari satu generasi, dalam satu panggilan.
Selama setahun terakhir, ASMR AI terlihat memuaskan tetapi terdengar sedikit keliru, dan penyebabnya bukan pernah pada visualnya. Masalahnya ada di langkah terakhir pipeline. Menempelkan audio ke klip senyap adalah pekerjaan manual, dilakukan dengan tangan, setiap kali. Kategori ini tumbuh begitu cepat di sekitar celah itu sampai muncul industri kecil berisi situs AI ASMR generator khusus yang murni mengotomatisasi penyambungan, salah satunya mengiklankan "audio binaural 3D" langsung di beranda. Permintaannya sudah lama terbukti. Hanya saja selama ini dilayani lewat perakitan.
Jadi saya mengujinya dengan benar. Satu workflow yang dapat direproduksi, enam klip, lalu bagian yang hampir tidak pernah dilakukan siapa pun dalam kategori ini: saya memisahkan kanal kiri dan kanan di ffmpeg dan mengukurnya. Sebagian dari dugaan saya ternyata salah, dan justru itu menjadi hal paling berguna dalam artikel ini.
Poin utama
- H3 merender gambar 24 fps dan trek stereo AAC 32 kHz dalam proses yang sama. Audionya dihasilkan, bukan disulih setelahnya.
- Stereonya benar-benar stereo, bukan dual mono yang menyamar sebagai stereo. Tetapi Anda tidak bisa mem-prompt pan. Saya meminta sapuan keras dari kiri ke kanan dan mendapat perbedaan 1,9 dB, yang praktis tidak berarti.
- Lebar stereo berasal dari konten, bukan dari kata-kata Anda. Klip hujan, yang sama sekali tidak saya arahkan posisinya, kembali dengan medan stereo yang benar-benar lebar.
- Mengunci frame pertama mempertahankan shot lintas resolusi, tetapi 768P dan 2K tetap dua take yang berbeda. Draft mempratinjau tampilan dan spesifikasi suara, bukan koreografi persisnya.
- Klip 768P berdurasi 5 detik ditagih $0.50. Klip yang sama di 2K ditagih $0.70. Seluruh artikel ini menelan biaya $4.27.
Dengarkan Dulu: Video ASMR MiniMax H3, Dipotong dalam Satu Proses
Lima detik, 2K, 24 fps, stereo 32 kHz, satu generasi, $0.70. Nyalakan suara: derit saat mata pisau menggigit, retakan, lalu biji-bijinya. Tidak satu pun ditambahkan setelahnya. Dibuat dengan minimax/h3/image-to-video.
Satu prompt. Satu model. Satu panggilan. Semua di bawah ini menjelaskan bagaimana klip itu dibuat, berapa biayanya, dan bagian mana dari cerita marketing yang tetap bertahan saat berhadapan dengan waveform.
Mengapa ASMR AI Meledak, dan Mengapa Sebagian Besarnya Gagal dalam Tes Headphone
Tren ini punya tanggal lahir. ASMR AI mulai menyebar pada Juni 2025, tepat setelah Veo 3 hadir, dan formatnya meledak dalam hitungan hari. Lava mukbang dari @asmraiworks meraih lebih dari 11,3 juta view dalam seminggu; klip memotong kaca mendapat 5,3 juta view dalam sebelas hari (Know Your Meme, 2025). Media berita mengangkatnya sebagai keanehan menarik, dengan visual surealis dan lava cair yang dimakan memakai sumpit sebagai daya tarik utama (The Express Tribune, 2025).
Lalu orang-orang memakai headphone, dan suasananya berubah. Penulis TechRadar menonton banyak klip viral itu dan pulang dengan kesan adanya lapisan artifisial, "kurang memiliki kesalahan dan ketidaksempurnaan yang menjadi ciri ASMR buatan manusia" (TechRadar, Juni 2025). Penggemar yang dikutip dalam artikel itu mengatakan pemicu tinglenya secara teknis ada, tetapi tetap tidak terasa sama.
Ada alasan mekanis, dan ini bukan mistik. ASMR adalah satu kategori konten di mana kontennya adalah suara. Di tempat lain audio hanyalah pelengkap. Di sini audio adalah produknya. Dan workflow dominannya adalah:
- menghasilkan klip senyap dengan model video,
- berburu pustaka suara untuk retakan, kunyahan renyah, atau lapisan suara hujan,
- menyelaraskan suara dengan gambar di editor,
- melakukan pan dan mix manual jika Anda peduli, yang hampir tidak dilakukan siapa pun dalam volume besar,
- mengekspor.
Langkah 3 adalah titik kegagalannya. Retakan kalengan yang berbunyi dua frame terlambat terasa palsu sebelum Anda sempat menjelaskan alasannya. Kalikan dengan jadwal posting harian dan kesalahannya menumpuk, karena penyelarasan itu diulang oleh manusia setiap kali.
Celah itulah alasan seluruh cottage industry situs AI ASMR generator muncul. Setidaknya tiga di antaranya aktif memasarkan diri dan salah satunya menonjolkan audio binaural 3D sebagai fitur utama. Mereka tidak memecahkan masalah palsu. Mereka menambal lubang nyata: model video di baliknya tidak menghasilkan suara.
Karena itu, satu pemisahan leaderboard layak diperhatikan. Di papan video editing Artificial Analysis, yang dinilai dengan audio, MiniMax H3 berada di posisi #1 dengan 1.126 Elo, di atas Gemini Omni Flash pada 1.119 dan unggul sekitar seratus poin dari Dreamina Seedance 2.0 pada 1.027 (Artificial Analysis, Agustus 2026). Di papan image-to-video, tempat audio tidak menjadi bagian dari skor, beberapa model itu hanya terpaut beberapa poin. Jaraknya terbuka saat suara dihitung. Untuk ASMR, suara adalah satu-satunya yang dihitung.
Workflow Video ASMR MiniMax H3, dan Biaya Tiap Langkah
Tiga endpoint, satu tab browser. Saya menjalankan semua dalam artikel ini di Atlas Cloud, jadi setiap angka di bawah berasal dari tagihan, bukan rate card.
| Pekerjaan dalam artikel ini | Model | Tarif |
|---|---|---|
| Frame pertama untuk showcase | OpenAI GPT Image 2 (text-to-image) | tercantum mulai $0.009/image, ditagih $0.1745 pada high dan 2048x1152 |
| Draft dan keeper | MiniMax H3 Image-to-Video | $0.10/s pada 768P, $0.14/s pada 2K |
| Memasukkan rekaman nyata | MiniMax H3 Reference-to-Video | dua tier yang sama |
| Tiga template | MiniMax H3 Text-to-Video | dua tier yang sama |
| Cara lama, hanya sisi audio | ByteDance Seed Audio 1.0 | $0.143/min |
Listing menampilkan "From $0.1/SEC" pada ketiga endpoint H3. Itu adalah lantai 768P. 2K ditagih $0.14/s dan angka itu tidak muncul di mana pun kecuali invoice Anda, jadi rencanakan sesuai tier yang benar-benar Anda minta.
Tabel 1: satu proses versus pipeline yang disambung.
| MiniMax H3, audio native | Model senyap plus audio post | |
|---|---|---|
| Langkah menuju klip jadi | 1 | 4 sampai 5 |
| Alat yang terlibat | 1 | model video + pustaka suara + editor + export |
| Cara gambar dan suara tetap sinkron | generasi yang sama, timeline yang sama | Anda menggesernya sampai terlihat pas |
| Siapa yang melakukan mix dan pan | tidak ada, Anda menerima hasil model | Anda, manual, per suara |
| Waktu manusia per klip | kira-kira nol setelah prompt | 15 sampai 40 menit, jujur saja |
| Compute per klip 5s | $0.50 pada 768P | model video + $0.143/min generasi audio |
Saya sengaja tidak mengutip tarif per detik platform video pesaing, karena perbedaannya bukan pada compute. Generasi audio berjalan $0.143 per menit, hanya recehan. Biaya nyata dari pipeline yang disambung adalah 20 menit perhatian manusia per klip, dan biaya itu tidak turun saat Anda scale. Ia berlipat. Akun faceless yang posting harian adalah tempat persis di mana 20 menit per klip diam-diam memakan seluruh model bisnis.
Penyeimbang yang jujur: penyambungan manual memberi Anda kontrol. Anda bisa menaruh suara di mana pun dalam medan stereo dan memangkasnya sampai pas frame. H3 memberi sinkronisasi gratis dan, seperti yang ditunjukkan pengukuran di bawah, tidak mengembalikan kontrol itu kepada Anda.
Tabel 2: tiga endpoint H3, parameter yang benar-benar penting.
| image-to-video | text-to-video | reference-to-video | |
|---|---|---|---|
| Input utama | image (frame pertama) | prompt saja | refers[] |
| resolution | 768P / 2K, default 2K | sama | sama |
| duration | detik bulat apa pun dari 4 sampai 15, default 8 | sama | sama |
| ratio | ditentukan oleh frame pertama | harus diatur eksplisit, adaptive ditolak | ditentukan oleh referensi |
| Batas refers | tidak digunakan bersama image | tidak digunakan | hingga 9 gambar, 3 video, 3 audio |
| Output 16:9 terkirim | 1344x768 pada 768P, 2560x1440 pada 2K | sama | sama |
| Trek audio | stereo AAC 32 kHz di atas video 24 fps | sama | sama |
Dua jebakan parameter yang layak ditulis di tangan Anda. Parameternya bernama ratio, bukan aspect_ratio, dan key yang salah membuatnya tidak terisi sehingga text-to-video menolak request. Dan image plus refers dalam panggilan yang sama tidak error: ia selesai, ditagih penuh, dan diam-diam membuang salah satu dari dua input.
Tutorial Video ASMR MiniMax H3: Memotong Delima Kaca
Memotong buah kaca adalah format yang dikenali semua orang, jadi pembaca langsung tahu apa yang mereka lihat. Namun apel kaca dan mangga kaca sudah terlalu sering dibuat. Delima lebih baik karena satu alasan spesifik: saat cangkangnya terbelah, ratusan biji kaca tumpah dan berguling, sehingga suaranya punya durasi dan struktur, bukan hanya satu benturan di tengah. Jika sebuah model memalsukan audionya, sebaran seperti ini akan membongkarnya.
Langkah 1: Bangun Frame Dasar dengan GPT Image 2
Kunci komposisi sebelum Anda mengeluarkan biaya untuk video. Settings: quality: high, size: 2048x1152 (16:9), output_format: png.
Plain1Extreme close-up macro photograph of a whole pomegranate carved entirely from thick 2translucent ruby-red glass, resting on a wet black slate slab. The glass shell is 8mm 3thick with visible internal bubbles and chipped facets; hundreds of tiny glass seeds 4glow inside like garnet crystals. A polished Japanese santoku knife lies at the left 5edge of the frame, blade tip just touching the glass skin. One hard key light from the 6upper right rakes across the slab and throws sharp red caustics onto the wet stone. 7100mm macro, f/2.8, shallow depth of field, dark moody background. 8No hands, no text, no watermark, no logo.

Playground GPT Image 2 di Atlas Cloud dengan quality diatur ke high dan size 16:9 2048x1152, delima kaca dirender di panel OUTPUT
Run nyata. Quality high pada 2048x1152, dan halaman mengutip $0.1745, sama seperti yang kemudian tertulis di invoice.

Frame dasar yang dihasilkan: delima yang diukir dari kaca rubi tebal di atas batu tulis hitam basah, dengan pisau santoku masuk dari tepi kiri
Frame yang diberikan ke H3. Dibuat dengan openai/gpt-image-2/text-to-image.
Langkah 2: Tulis Separuh Suara dari Prompt Video ASMR MiniMax H3
Kebanyakan orang menulis prompt ASMR sebagai deskripsi gambar dengan kata "ASMR" ditempel di depan, lalu heran mengapa model memberinya musik piano lo-fi. H3 menanggapi arahan audio dengan serius jika Anda memberikannya. Susun separuh audio dalam lima slot:
- Material. Apa yang menghasilkan suara. Kaca, lilin, batu cair, air di kaca. Spesifiklah tentang ketebalan dan kebasahan, karena itu mengubah timbre.
- Aksi dan bentuknya dalam waktu. Bukan sekadar "memotong", tetapi "menekan turun dalam satu gerakan lambat berkelanjutan". Model memakai ini untuk menempatkan event.
- Perspektif mikrofon.
close-mic,intimate, petunjuk jarak rekaman. Ini menentukan seberapa kering dan dekat suara terasa, dan bekerja dengan baik. - Urutan onomatope. Eja event suara secara berurutan: derit, lalu retak, lalu puluhan benturan kecil, lalu hening. Slot inilah yang paling banyak bekerja.
- Negatif.
no music, no voice, no narration, no room reverb, no ambience bed. Tanpa ini, H3 akan dengan senang hati menambahkan score, karena sebagian besar video dalam data latihnya memilikinya.
Saya juga menulis arahan kanal ke slot 4, meminta retakan di kanal kiri dan biji-biji berguling dari kiri ke kanan. Terus baca untuk melihat apa yang sebenarnya dihasilkan.
Langkah 3: Jalankan Draft 768P
Buat draft di 768P. Trek audio memiliki spesifikasi yang sama di kedua tier, jadi seluruh penilaian kreatif, yang dalam ASMR adalah penilaian mendengar, bisa dilakukan pada tarif murah.
Settings pada minimax/h3/image-to-video: image = output Langkah 1, resolution: 768P, duration: 5. Ratio berasal dari frame pertama, jadi biarkan saja.
Plain1The santoku blade enters from the left and presses down through the glass pomegranate 2in one slow continuous stroke, travelling left to right across the frame. The shell 3splits with a bright crystalline crack and a spray of tiny glass seeds tumbles onto the 4wet slate, scattering toward the right edge. Camera locked off, macro, single take, no cuts. 5 6Audio: ASMR, close-mic, intimate, no music, no voice, no narration, no room reverb. 7A dry sustained glass squeak as the edge bites in, then one sharp high crack panned to 8the LEFT channel, followed by dozens of small tinkling seed impacts rolling from the 9LEFT channel across to the RIGHT channel as they scatter. A faint blade-on-stone scrape 10at the very end, then silence. No ambience bed, no hum, no background music.

Playground MiniMax H3 image-to-video di Atlas Cloud dengan frame dasar dimuat, durasi 5, dan klip selesai di panel OUTPUT
Run image-to-video: frame pertama dimuat, durasi 5, OUTPUT selesai. Perhatikan pilihan Resolution sedang berada pada default halaman 2K. Ganti ke 768P untuk draft, yaitu resolusi yang dipakai klip di bawah.
Draft 768P, $0.50. Gambar lebih lembut daripada klip utama, spesifikasi audio sama. Inilah take tempat seluruh keputusan dibuat.
Langkah 4: Ukur Stereo Sebelum Anda Memercayainya
Jangan percaya kata saya soal suara, dan jangan percaya kata model. Pisahkan kanal dan lihat. Ini ffmpeg lokal, tanpa panggilan API, tanpa biaya:
Bash1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \ 2 -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \ 3 -frames:v 1 stereo-proof.png

Analisis waveform empat panel yang membandingkan klip delima kaca dan klip hujan, menampilkan kanal kiri dan kanan serta kanal side untuk masing-masing
Kanal kiri di atas kanal kanan untuk dua klip, plus kanal side (kiri minus kanan) pada gain yang disamakan di bawahnya. Ini seluruh argumen dalam satu gambar.
Inilah hasilnya, dan sebagian tidak sesuai dugaan saya.
Stereonya nyata. Kanal side tidak kosong pada klip mana pun yang saya buat. File dual mono yang didandani sebagai stereo tidak akan menunjukkan apa-apa di sana. Yang ini punya konten.
Tetapi Anda tidak bisa mem-prompt pan. Saya meminta, dengan huruf kapital, retakan di kanal LEFT dan biji-biji berguling LEFT to RIGHT. Hasil pengukuran: korelasi kanal 0,97, kanal side berada 17,7 dB di bawah mid, dan perbedaan level kiri-ke-kanan terbesar dalam jendela seperempat detik mana pun adalah 1,9 dB. Itu bukan pan. Itu image di tengah dengan sedikit lebar alami. Pisau bergerak melintasi frame; suaranya tetap di tempat.
Lebar berasal dari konten, bukan dari kata-kata Anda. Klip hujan di bagian berikutnya, yang sama sekali tidak saya arahkan posisinya, kembali dengan korelasi 0,32 dan kanal side hanya 2,9 dB di bawah mid. Itu medan yang benar-benar lebar dan terdekorrelasi. Ambience difus mendapat lebar secara otomatis. Benturan diskret tetap dekat tengah apa pun yang Anda tulis.
Jadi klaim jujur untuk model ini bukan spasial. Klaimnya temporal. Anda mendapat suara yang dihasilkan bersama gambar dan mendarat pada frame tempat ia seharusnya berada, gratis, selamanya, tanpa editor. Jika format Anda benar-benar membutuhkan hard pan, Anda tetap harus melakukannya sendiri di post, dan Anda sebaiknya berhenti menulis nama kanal dalam prompt karena itu tidak melakukan apa-apa.
Sekarang jalankan ulang keeper: endpoint yang sama, frame pertama yang sama, prompt yang sama, ubah satu field menjadi resolution: 2K. Ada satu hal lagi yang perlu diketahui sebelum Anda menganggap draft sebagai preview.

Dua baris berisi lima frame yang membandingkan run 768P dan 2K pada timestamp yang sama, identik di frame nol dan mulai menyimpang sekitar 2,5 detik
Frame pertama sama, prompt sama, kedua tier. Frame 0 cocok persis. Pada 2,5s cangkangnya pecah berbeda dan kedua klip telah menjadi take yang berbeda.
Mengunci frame pertama mempertahankan komposisi, framing, pencahayaan, dan warna lintas kedua tier, itulah sebabnya Anda sebaiknya selalu memakai image-to-video daripada text-to-video untuk ini. Itu tidak memberi Anda take yang sama. Run 2K mengocok ulang aksinya. Perlakukan draft sebagai preview tampilan dan suara, bukan koreografi persis.
Langkah 5: Tambahkan Rekaman Nyata sebagai Referensi Video ASMR MiniMax H3
Jika Anda memiliki suara yang benar-benar Anda inginkan, serahkan saja. reference-to-video menerima hingga 9 gambar, 3 video, dan 3 klip audio, lalu menarik timbre dan karakter ruang dari referensi audio alih-alih menciptakannya. Saya memakai rekaman kaca pecah yang ramah domain publik oleh Gravity Sound dari Wikimedia Commons (CC BY 4.0), tiga take yang digabung menjadi 4,5 detik.
Tiga aturan, dan dua terakhir saya temukan dengan cara sulit lewat request yang ditolak:
- Audio tidak bisa sendirian. Endpoint menuliskannya jelas: setidaknya satu gambar atau video diperlukan, dan audio saja tidak diperbolehkan. Pasangkan dengan sebuah frame.
- Referensi audio harus 2 sampai 15 detik. Percobaan pertama saya memakai klip 1,49 detik dan kembali dengan
audio duration 1486 ms, expected [2000, 15000] ms. Rentang itu tidak ada di halaman model. - Format file diperiksa. Payload base64 yang dideklarasikan sebagai
audio/mpegditolak denganaudio format ".mpeg" not allowed. Payload.wavberhasil. Request yang ditolak tidak ditagih, tetapi tetap memakan satu round trip.
Settings: refers: [{url: <base frame>, type: "image"}, {url: <a 2 to 15s recording>, type: "audio"}], resolution: 768P, duration: 5.
Plain1Same locked-off macro shot: the blade slices the glass pomegranate from left to right 2and the seeds scatter. Match the timbre, brightness and room character of the reference 3audio, same recording distance, same dryness. ASMR close-mic, no music, no voice.

Playground MiniMax H3 reference-to-video di Atlas Cloud dengan dua materi referensi dimuat, file audio di slot 1 dan frame dasar di slot 2
Reference Materials membawa file audio dan gambar bersama-sama, 2 dari 9 terpakai. Hapus gambar dan request tidak akan berjalan sama sekali.
Take berpandu referensi, $0.50. Shot yang sama, timbre diarahkan oleh rekaman nyata alih-alih diciptakan dari prompt. Referensi audio: Glass breaking oleh Gravity Sound, CC BY 4.0.
Tiga Template Video ASMR MiniMax H3: Memotong, Mengunyah, Hujan
Tiga format mencakup sebagian besar yang perform di kategori ini. Masing-masing adalah prompt lengkap siap tempel dan jalankan, dengan settings dan klip yang dihasilkannya. Sengaja tidak ada kaca, merah, atau batu tulis di bawah: jika setiap klip di akun Anda terlihat sama, algoritma memperlakukannya sebagai klip yang sama.
Tabel 3: lima slot yang sama, tiga pekerjaan berbeda.
| Slot | Template 1, The Cut | Template 2, The Chew | Template 3, The Rain |
|---|---|---|---|
| Material | sarang madu menetes, bilah baja panas | batu cair berpijar, mangkuk batu | hujan di kaca jendela mobil |
| Bentuk aksi | bilah masuk dari depan ke belakang, madu tertarik turun | sumpit mengangkat, lalu dua gigitan | hanya tetesan, tanpa aksi subjek |
| Perspektif mic | close-mic, sangat kering, tanpa ruang | sangat dekat, intim | di luar kaca, kabin teredam |
| Urutan suara | retakan lilin, tarikan madu, tetes di piring | desis cair, kunyahan basah, kriuk kaca, embusan napas | lapisan hujan stabil, hantaman tetesan, desis ban jauh |
| Negatif | no music, no voice, no room reverb | no words, no music, no narration | no music, no thunder, no voice, no wipers |
Template 1, The Cut. Sarang madu, amber dan emas, 9:16, 768P, 6 detik, ratio: "9:16".
Plain1Extreme macro, locked-off overhead shot of a thick slab of golden honeycomb on a pale 2ceramic plate, honey already pooling around it. A hot steel blade lowers into the wax 3and sinks through it front to back in one slow continuous press; the cut faces slump 4and a heavy thread of honey stretches and drips onto the plate. Warm amber key light 5from the left, shallow depth of field, single take, no cuts, no hands in frame. 6 7Audio: ASMR, close-mic, very dry, no room reverb, no music, no voice, no narration. 8A soft crackling of wax splitting under the blade, then a thick low stretching pull as 9the honey lengthens, then two heavy wet drips landing on the ceramic plate. Nothing else.
Template 1, $0.60. Retakan lilin, tarikan madu, tetesan. Dibuat dengan minimax/h3/text-to-video.
Template 2, The Chew. Lava mukbang, format yang meraih 11,3 juta view dalam seminggu, 9:16, 768P, 8 detik, ratio: "9:16".
Plain1Vertical close-up: a pair of black lacquer chopsticks lifts a glowing clump of molten 2orange lava out of a dark stone bowl and carries it toward the camera, out of frame at 3the bottom. The lava is self-illuminating, casting orange light on everything around it; 4the rest of the room is almost black. Steam curls off the surface. Locked-off camera, 5single take, no cuts. 6 7Audio: ASMR, extremely close-mic, intimate, no words, no music, no narration, no room tone. 8A low molten sizzle and bubbling as the lava is lifted, then a soft wet chew, then a 9brighter glassy crunch on the second bite, then one slow satisfied exhale. No speech.
Template 2, $0.80. Desis, kunyah, kriuk, embusan napas, dan tidak satu kata pun. Dibuat dengan minimax/h3/text-to-video.
Template 3, The Rain. Jendela mobil malam hari, biru dingin dan neon, 16:9, 768P, 10 detik, ratio: "16:9".
Ini satu-satunya dari tiga template tanpa aksi subjek, dan paling banyak mengajarkan tentang negatif. Dengan tidak ada apa pun yang terjadi di layar, H3 cenderung mengambil music bed kecuali Anda melarangnya secara eksplisit. Ini juga klip yang kembali dengan medan stereo paling lebar sejauh ini, tanpa diminta. Konten berorientasi tidur membutuhkan durasi, jadi ini berjalan mendekati batas atas rentang durasi yang berguna.
Plain1Macro shot through the inside of a car window at night, heavy rain running down the 2outside of the glass. Individual droplets hit, hesitate, then streak downward and merge. 3Beyond the glass, out-of-focus neon signage breaks into cold blue and magenta bokeh. 4No wipers, no people, no movement inside the car. Camera locked off, single continuous 5take, shallow depth of field, no cuts. 6 7Audio: ASMR, close-mic on the outside of the glass, cabin slightly muffled. 8A steady even rain bed with clearly separated individual droplet impacts on the glass, 9plus a faint distant hiss of tyres on a wet road. No music, no thunder, no voice, 10no narration, no wiper noise.
Template 3, $1.00. Sepuluh detik ambience murni, tanpa soundtrack karena prompt melarangnya. Dibuat dengan minimax/h3/text-to-video.
Berapa Sebenarnya Biaya Video ASMR MiniMax H3
Ini adalah bukti pembayaran untuk artikel ini, bukan estimasi.
| Item baris | Jumlah | Ditagih |
|---|---|---|
| Frame dasar GPT Image 2, high, 2048x1152 | 1 | $0.17 |
| Keeper 2K, 5s, image-to-video | 1 | $0.70 |
| Draft 768P, 5s, image-to-video | 1 | $0.50 |
| 768P reference-to-video, 5s | 1 | $0.50 |
| Klip template pada 768P, 6s + 8s + 10s | 3 | $2.40 |
| Request referensi yang ditolak | 2 | $0.00 |
| Total | $4.27 |
Enam klip layak publikasi dan satu frame dasar. Skalakan ke jadwal: satu klip vertikal 8 detik per hari pada 768P adalah $0.80, jadi sekitar $24 per bulan untuk akun faceless yang posting harian, sebelum Anda menghabiskan satu menit di editor.
Dua catatan billing. $0.009 yang tercantum untuk GPT Image 2 adalah lantai token-tier; render high-quality 2048x1152 jatuh di $0.1745, hampir dua puluh kali lipat, jadi buat anggaran dari tier yang benar-benar Anda pakai. Dan field price H3 terisi belakangan dengan jeda: polling sampai status menjadi completed dan sering kali masih undefined. Poll prediction id lagi beberapa saat kemudian untuk angka sebenarnya. Poll kedua itulah satu-satunya cara membangun bukti pembayaran seperti ini, bukan tebakan.
Satu Catatan Jujur tentang Audio ASMR dan Hak
Jangan unggah rekaman ASMR milik orang lain sebagai file audio refers. Referensi benar-benar memigrasikan timbre ke output, dan menjalankan rekaman melalui model tidak mengubah siapa pemiliknya. Referensi yang dipakai di sini berlisensi CC BY 4.0 dan sudah dikreditkan di atas, yang hanya butuh sekitar dua menit untuk dicari.
Jangan membangun ASMR di sekitar suara orang nyata yang dapat dikenali. Setiap template dalam artikel ini sengaja tanpa suara manusia, yang sekaligus merupakan konvensi genre dan jalur yang paling tidak rumit.
Memanggil H3 melalui API tidak terdampak oleh lisensi komunitas yang melekat pada open weights. Lisensi itu, yang mencakup self-hosting, saat ini mengecualikan EU, UK, Korea, dan US, dan kanal lisensi formal terbuka untuk wilayah tersebut. Perlu diketahui, tetapi tidak perlu dikhawatirkan jika Anda memakai endpoint.
Video ASMR MiniMax H3: Pertanyaan yang Sering Diajukan
Apakah video ASMR MiniMax H3 menghasilkan suaranya sendiri, atau saya menambahkannya setelahnya?
Model menghasilkannya. Gambar dan audio keluar dari proses yang sama: video 24 fps dengan trek stereo AAC pada 32 kHz dalam file yang dikirim. Tidak ada langkah audio terpisah, tidak ada pustaka suara, dan tidak ada kerja penyelarasan, yang menjadi alasan utama endpoint ini menarik khusus untuk ASMR.
Bisakah saya membuat video ASMR MiniMax H3 melakukan pan dari kiri ke kanan?
Tidak hanya dengan memintanya. Saya menulis arahan kanal eksplisit dalam prompt dan mengukur hasilnya: korelasi 0,97 antara kanal dan perbedaan level maksimum 1,9 dB dalam jendela seperempat detik mana pun, yang sama sekali bukan pan. Treknya benar-benar stereo dan konten difus seperti hujan kembali dengan medan lebar, tetapi benturan diskret tetap berada di tengah terlepas dari kata-kata yang dipakai. Jika format Anda membutuhkan hard pan, lakukan di post.
Bisakah saya mengunggah rekaman sendiri sebagai referensi video ASMR MiniMax H3?
Ya, melalui reference-to-video, yang menerima hingga 3 referensi audio bersama hingga 9 gambar dan 3 video. Audio tidak bisa dikirim sendiri, jadi pasangkan dengan setidaknya satu gambar atau video. Audio juga harus berdurasi antara 2 dan 15 detik, dan formatnya divalidasi: payload .wav berhasil sementara audio/mpeg ditolak. Request yang ditolak tidak ditagih.
Apakah audio video ASMR MiniMax H3 768P lebih buruk daripada 2K?
Tidak. Kedua tier mengirim spesifikasi stereo AAC 32 kHz yang sama. Hanya gambar yang berubah, dan perubahannya besar: 16:9 kembali sebagai 1344x768 pada 768P versus 2560x1440 pada 2K. Karena penilaian kreatif dalam ASMR adalah penilaian mendengar, buat draft di $0.10/s dan jalankan ulang keeper di $0.14/s. Ingat saja, run 2K adalah take baru, bukan upscale dari draft.
Berapa durasi ideal video ASMR MiniMax H3, dan rasio aspek apa yang sebaiknya dipakai?
Duration menerima detik bulat apa pun dari 4 sampai 15. Klip memotong dan mengunyah bekerja baik pada 5 sampai 8 detik karena payoff-nya satu event; ambience berorientasi tidur membutuhkan 10 detik atau lebih. Untuk Shorts, Reels, dan TikTok gunakan 9:16, dan ingat bahwa text-to-video mewajibkan ratio diatur eksplisit dan menolak adaptive. Pada image-to-video, frame pertama menentukan bentuknya untuk Anda.
Berapa biaya satu video ASMR MiniMax H3?
Klip 5 detik ditagih $0.50 pada 768P dan $0.70 pada 2K. Klip vertikal 8 detik pada 768P adalah $0.80. Memposting satu klip seperti itu per hari sekitar $24 per bulan dalam compute, angka yang layak dibandingkan dengan 20 menit yang dibutuhkan editor per klip pada workflow yang disambung.
Mengapa video ASMR MiniMax H3 saya keluar dengan musik latar yang tidak pernah saya minta?
Karena Anda tidak melarangnya. Sebagian besar video dalam data latih model mana pun memiliki music bed, jadi perilaku default-nya adalah menambahkan satu, terutama saat tidak ada apa pun yang terjadi di layar. Masukkan negatif secara eksplisit di separuh audio prompt: no music, no voice, no narration, no room reverb, no ambience bed. Template ambient lebih membutuhkan ini daripada template aksi.






