Seedance 2.5 Kini Tersedia — Hadir Pertama di Atlas Cloud

Video ASMR MiniMax H3: Saya Memotong Delima Kaca, Lalu Mengukur Apakah Stereonya Nyata

Sebagian besar ASMR AI menempelkan suara stok ke video senyap. Video ASMR MiniMax H3 merender stereo 32 kHz dalam satu proses. Saya mengukur kanalnya, lengkap dengan prompt dan biaya.

Kenakan headphone sebelum Anda menggulir ke klip di bawah. Dalam kategori ini, itu benar-benar penting.

Sebuah pisau turun membelah delima yang diukir dari kaca rubi. Cangkangnya terbelah, retakan kristalin terdengar, lalu beberapa lusin biji kaca berguling di atas batu tulis basah. Inilah bagian yang berbeda dari hampir semua klip ASMR AI yang pernah Anda lewati tahun ini: tidak ada orang yang menambahkan suara itu. Tidak ada pustaka suara, tidak ada editor, tidak ada timeline. Gambar dan audio keluar dari satu generasi, dalam satu panggilan.

Selama setahun terakhir, ASMR AI terlihat memuaskan tetapi terdengar sedikit keliru, dan penyebabnya bukan pernah pada visualnya. Masalahnya ada di langkah terakhir pipeline. Menempelkan audio ke klip senyap adalah pekerjaan manual, dilakukan dengan tangan, setiap kali. Kategori ini tumbuh begitu cepat di sekitar celah itu sampai muncul industri kecil berisi situs AI ASMR generator khusus yang murni mengotomatisasi penyambungan, salah satunya mengiklankan "audio binaural 3D" langsung di beranda. Permintaannya sudah lama terbukti. Hanya saja selama ini dilayani lewat perakitan.

Jadi saya mengujinya dengan benar. Satu workflow yang dapat direproduksi, enam klip, lalu bagian yang hampir tidak pernah dilakukan siapa pun dalam kategori ini: saya memisahkan kanal kiri dan kanan di ffmpeg dan mengukurnya. Sebagian dari dugaan saya ternyata salah, dan justru itu menjadi hal paling berguna dalam artikel ini.

Poin utama

  • H3 merender gambar 24 fps dan trek stereo AAC 32 kHz dalam proses yang sama. Audionya dihasilkan, bukan disulih setelahnya.
  • Stereonya benar-benar stereo, bukan dual mono yang menyamar sebagai stereo. Tetapi Anda tidak bisa mem-prompt pan. Saya meminta sapuan keras dari kiri ke kanan dan mendapat perbedaan 1,9 dB, yang praktis tidak berarti.
  • Lebar stereo berasal dari konten, bukan dari kata-kata Anda. Klip hujan, yang sama sekali tidak saya arahkan posisinya, kembali dengan medan stereo yang benar-benar lebar.
  • Mengunci frame pertama mempertahankan shot lintas resolusi, tetapi 768P dan 2K tetap dua take yang berbeda. Draft mempratinjau tampilan dan spesifikasi suara, bukan koreografi persisnya.
  • Klip 768P berdurasi 5 detik ditagih $0.50. Klip yang sama di 2K ditagih $0.70. Seluruh artikel ini menelan biaya $4.27.

Dengarkan Dulu: Video ASMR MiniMax H3, Dipotong dalam Satu Proses

Lima detik, 2K, 24 fps, stereo 32 kHz, satu generasi, $0.70. Nyalakan suara: derit saat mata pisau menggigit, retakan, lalu biji-bijinya. Tidak satu pun ditambahkan setelahnya. Dibuat dengan minimax/h3/image-to-video.

Satu prompt. Satu model. Satu panggilan. Semua di bawah ini menjelaskan bagaimana klip itu dibuat, berapa biayanya, dan bagian mana dari cerita marketing yang tetap bertahan saat berhadapan dengan waveform.

Mengapa ASMR AI Meledak, dan Mengapa Sebagian Besarnya Gagal dalam Tes Headphone

Tren ini punya tanggal lahir. ASMR AI mulai menyebar pada Juni 2025, tepat setelah Veo 3 hadir, dan formatnya meledak dalam hitungan hari. Lava mukbang dari @asmraiworks meraih lebih dari 11,3 juta view dalam seminggu; klip memotong kaca mendapat 5,3 juta view dalam sebelas hari (Know Your Meme, 2025). Media berita mengangkatnya sebagai keanehan menarik, dengan visual surealis dan lava cair yang dimakan memakai sumpit sebagai daya tarik utama (The Express Tribune, 2025).

Lalu orang-orang memakai headphone, dan suasananya berubah. Penulis TechRadar menonton banyak klip viral itu dan pulang dengan kesan adanya lapisan artifisial, "kurang memiliki kesalahan dan ketidaksempurnaan yang menjadi ciri ASMR buatan manusia" (TechRadar, Juni 2025). Penggemar yang dikutip dalam artikel itu mengatakan pemicu tinglenya secara teknis ada, tetapi tetap tidak terasa sama.

Ada alasan mekanis, dan ini bukan mistik. ASMR adalah satu kategori konten di mana kontennya adalah suara. Di tempat lain audio hanyalah pelengkap. Di sini audio adalah produknya. Dan workflow dominannya adalah:

  1. menghasilkan klip senyap dengan model video,
  2. berburu pustaka suara untuk retakan, kunyahan renyah, atau lapisan suara hujan,
  3. menyelaraskan suara dengan gambar di editor,
  4. melakukan pan dan mix manual jika Anda peduli, yang hampir tidak dilakukan siapa pun dalam volume besar,
  5. mengekspor.

Langkah 3 adalah titik kegagalannya. Retakan kalengan yang berbunyi dua frame terlambat terasa palsu sebelum Anda sempat menjelaskan alasannya. Kalikan dengan jadwal posting harian dan kesalahannya menumpuk, karena penyelarasan itu diulang oleh manusia setiap kali.

Celah itulah alasan seluruh cottage industry situs AI ASMR generator muncul. Setidaknya tiga di antaranya aktif memasarkan diri dan salah satunya menonjolkan audio binaural 3D sebagai fitur utama. Mereka tidak memecahkan masalah palsu. Mereka menambal lubang nyata: model video di baliknya tidak menghasilkan suara.

Karena itu, satu pemisahan leaderboard layak diperhatikan. Di papan video editing Artificial Analysis, yang dinilai dengan audio, MiniMax H3 berada di posisi #1 dengan 1.126 Elo, di atas Gemini Omni Flash pada 1.119 dan unggul sekitar seratus poin dari Dreamina Seedance 2.0 pada 1.027 (Artificial Analysis, Agustus 2026). Di papan image-to-video, tempat audio tidak menjadi bagian dari skor, beberapa model itu hanya terpaut beberapa poin. Jaraknya terbuka saat suara dihitung. Untuk ASMR, suara adalah satu-satunya yang dihitung.

Workflow Video ASMR MiniMax H3, dan Biaya Tiap Langkah

Tiga endpoint, satu tab browser. Saya menjalankan semua dalam artikel ini di Atlas Cloud, jadi setiap angka di bawah berasal dari tagihan, bukan rate card.

Pekerjaan dalam artikel iniModelTarif
Frame pertama untuk showcaseOpenAI GPT Image 2 (text-to-image)tercantum mulai $0.009/image, ditagih $0.1745 pada high dan 2048x1152
Draft dan keeperMiniMax H3 Image-to-Video$0.10/s pada 768P, $0.14/s pada 2K
Memasukkan rekaman nyataMiniMax H3 Reference-to-Videodua tier yang sama
Tiga templateMiniMax H3 Text-to-Videodua tier yang sama
Cara lama, hanya sisi audioByteDance Seed Audio 1.0$0.143/min

Listing menampilkan "From $0.1/SEC" pada ketiga endpoint H3. Itu adalah lantai 768P. 2K ditagih $0.14/s dan angka itu tidak muncul di mana pun kecuali invoice Anda, jadi rencanakan sesuai tier yang benar-benar Anda minta.

Tabel 1: satu proses versus pipeline yang disambung.

MiniMax H3, audio nativeModel senyap plus audio post
Langkah menuju klip jadi14 sampai 5
Alat yang terlibat1model video + pustaka suara + editor + export
Cara gambar dan suara tetap sinkrongenerasi yang sama, timeline yang samaAnda menggesernya sampai terlihat pas
Siapa yang melakukan mix dan pantidak ada, Anda menerima hasil modelAnda, manual, per suara
Waktu manusia per klipkira-kira nol setelah prompt15 sampai 40 menit, jujur saja
Compute per klip 5s$0.50 pada 768Pmodel video + $0.143/min generasi audio

Saya sengaja tidak mengutip tarif per detik platform video pesaing, karena perbedaannya bukan pada compute. Generasi audio berjalan $0.143 per menit, hanya recehan. Biaya nyata dari pipeline yang disambung adalah 20 menit perhatian manusia per klip, dan biaya itu tidak turun saat Anda scale. Ia berlipat. Akun faceless yang posting harian adalah tempat persis di mana 20 menit per klip diam-diam memakan seluruh model bisnis.

Penyeimbang yang jujur: penyambungan manual memberi Anda kontrol. Anda bisa menaruh suara di mana pun dalam medan stereo dan memangkasnya sampai pas frame. H3 memberi sinkronisasi gratis dan, seperti yang ditunjukkan pengukuran di bawah, tidak mengembalikan kontrol itu kepada Anda.

Tabel 2: tiga endpoint H3, parameter yang benar-benar penting.

image-to-videotext-to-videoreference-to-video
Input utamaimage (frame pertama)prompt sajarefers[]
resolution768P / 2K, default 2Ksamasama
durationdetik bulat apa pun dari 4 sampai 15, default 8samasama
ratioditentukan oleh frame pertamaharus diatur eksplisit, adaptive ditolakditentukan oleh referensi
Batas referstidak digunakan bersama imagetidak digunakanhingga 9 gambar, 3 video, 3 audio
Output 16:9 terkirim1344x768 pada 768P, 2560x1440 pada 2Ksamasama
Trek audiostereo AAC 32 kHz di atas video 24 fpssamasama

Dua jebakan parameter yang layak ditulis di tangan Anda. Parameternya bernama ratio, bukan aspect_ratio, dan key yang salah membuatnya tidak terisi sehingga text-to-video menolak request. Dan image plus refers dalam panggilan yang sama tidak error: ia selesai, ditagih penuh, dan diam-diam membuang salah satu dari dua input.

Tutorial Video ASMR MiniMax H3: Memotong Delima Kaca

Memotong buah kaca adalah format yang dikenali semua orang, jadi pembaca langsung tahu apa yang mereka lihat. Namun apel kaca dan mangga kaca sudah terlalu sering dibuat. Delima lebih baik karena satu alasan spesifik: saat cangkangnya terbelah, ratusan biji kaca tumpah dan berguling, sehingga suaranya punya durasi dan struktur, bukan hanya satu benturan di tengah. Jika sebuah model memalsukan audionya, sebaran seperti ini akan membongkarnya.

Langkah 1: Bangun Frame Dasar dengan GPT Image 2

Kunci komposisi sebelum Anda mengeluarkan biaya untuk video. Settings: quality: high, size: 2048x1152 (16:9), output_format: png.

Plain
1Extreme close-up macro photograph of a whole pomegranate carved entirely from thick
2translucent ruby-red glass, resting on a wet black slate slab. The glass shell is 8mm
3thick with visible internal bubbles and chipped facets; hundreds of tiny glass seeds
4glow inside like garnet crystals. A polished Japanese santoku knife lies at the left
5edge of the frame, blade tip just touching the glass skin. One hard key light from the
6upper right rakes across the slab and throws sharp red caustics onto the wet stone.
7100mm macro, f/2.8, shallow depth of field, dark moody background.
8No hands, no text, no watermark, no logo.

Antarmuka AI image generator yang menampilkan prompt teks dan gambar yang dihasilkan

Playground GPT Image 2 di Atlas Cloud dengan quality diatur ke high dan size 16:9 2048x1152, delima kaca dirender di panel OUTPUT

Run nyata. Quality high pada 2048x1152, dan halaman mengutip $0.1745, sama seperti yang kemudian tertulis di invoice.

Bilah pisau memotong delima kaca merah transparan di atas batu gelap

Frame dasar yang dihasilkan: delima yang diukir dari kaca rubi tebal di atas batu tulis hitam basah, dengan pisau santoku masuk dari tepi kiri

Frame yang diberikan ke H3. Dibuat dengan openai/gpt-image-2/text-to-image.

Langkah 2: Tulis Separuh Suara dari Prompt Video ASMR MiniMax H3

Kebanyakan orang menulis prompt ASMR sebagai deskripsi gambar dengan kata "ASMR" ditempel di depan, lalu heran mengapa model memberinya musik piano lo-fi. H3 menanggapi arahan audio dengan serius jika Anda memberikannya. Susun separuh audio dalam lima slot:

  1. Material. Apa yang menghasilkan suara. Kaca, lilin, batu cair, air di kaca. Spesifiklah tentang ketebalan dan kebasahan, karena itu mengubah timbre.
  2. Aksi dan bentuknya dalam waktu. Bukan sekadar "memotong", tetapi "menekan turun dalam satu gerakan lambat berkelanjutan". Model memakai ini untuk menempatkan event.
  3. Perspektif mikrofon. close-mic, intimate, petunjuk jarak rekaman. Ini menentukan seberapa kering dan dekat suara terasa, dan bekerja dengan baik.
  4. Urutan onomatope. Eja event suara secara berurutan: derit, lalu retak, lalu puluhan benturan kecil, lalu hening. Slot inilah yang paling banyak bekerja.
  5. Negatif. no music, no voice, no narration, no room reverb, no ambience bed. Tanpa ini, H3 akan dengan senang hati menambahkan score, karena sebagian besar video dalam data latihnya memilikinya.

Saya juga menulis arahan kanal ke slot 4, meminta retakan di kanal kiri dan biji-biji berguling dari kiri ke kanan. Terus baca untuk melihat apa yang sebenarnya dihasilkan.

Langkah 3: Jalankan Draft 768P

Buat draft di 768P. Trek audio memiliki spesifikasi yang sama di kedua tier, jadi seluruh penilaian kreatif, yang dalam ASMR adalah penilaian mendengar, bisa dilakukan pada tarif murah.

Settings pada minimax/h3/image-to-video: image = output Langkah 1, resolution: 768P, duration: 5. Ratio berasal dari frame pertama, jadi biarkan saja.

Plain
1The santoku blade enters from the left and presses down through the glass pomegranate
2in one slow continuous stroke, travelling left to right across the frame. The shell
3splits with a bright crystalline crack and a spray of tiny glass seeds tumbles onto the
4wet slate, scattering toward the right edge. Camera locked off, macro, single take, no cuts.
5
6Audio: ASMR, close-mic, intimate, no music, no voice, no narration, no room reverb.
7A dry sustained glass squeak as the edge bites in, then one sharp high crack panned to
8the LEFT channel, followed by dozens of small tinkling seed impacts rolling from the
9LEFT channel across to the RIGHT channel as they scatter. A faint blade-on-stone scrape
10at the very end, then silence. No ambience bed, no hum, no background music.

Antarmuka AI video generator yang menampilkan video delima kaca

Playground MiniMax H3 image-to-video di Atlas Cloud dengan frame dasar dimuat, durasi 5, dan klip selesai di panel OUTPUT

Run image-to-video: frame pertama dimuat, durasi 5, OUTPUT selesai. Perhatikan pilihan Resolution sedang berada pada default halaman 2K. Ganti ke 768P untuk draft, yaitu resolusi yang dipakai klip di bawah.

Draft 768P, $0.50. Gambar lebih lembut daripada klip utama, spesifikasi audio sama. Inilah take tempat seluruh keputusan dibuat.

Langkah 4: Ukur Stereo Sebelum Anda Memercayainya

Jangan percaya kata saya soal suara, dan jangan percaya kata model. Pisahkan kanal dan lihat. Ini ffmpeg lokal, tanpa panggilan API, tanpa biaya:

Bash
1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \
2  -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \
3  -frames:v 1 stereo-proof.png

Perbandingan waveform pemisahan kanal stereo dalam dua klip audio ASMR

Analisis waveform empat panel yang membandingkan klip delima kaca dan klip hujan, menampilkan kanal kiri dan kanan serta kanal side untuk masing-masing

Kanal kiri di atas kanal kanan untuk dua klip, plus kanal side (kiri minus kanan) pada gain yang disamakan di bawahnya. Ini seluruh argumen dalam satu gambar.

Inilah hasilnya, dan sebagian tidak sesuai dugaan saya.

Stereonya nyata. Kanal side tidak kosong pada klip mana pun yang saya buat. File dual mono yang didandani sebagai stereo tidak akan menunjukkan apa-apa di sana. Yang ini punya konten.

Tetapi Anda tidak bisa mem-prompt pan. Saya meminta, dengan huruf kapital, retakan di kanal LEFT dan biji-biji berguling LEFT to RIGHT. Hasil pengukuran: korelasi kanal 0,97, kanal side berada 17,7 dB di bawah mid, dan perbedaan level kiri-ke-kanan terbesar dalam jendela seperempat detik mana pun adalah 1,9 dB. Itu bukan pan. Itu image di tengah dengan sedikit lebar alami. Pisau bergerak melintasi frame; suaranya tetap di tempat.

Lebar berasal dari konten, bukan dari kata-kata Anda. Klip hujan di bagian berikutnya, yang sama sekali tidak saya arahkan posisinya, kembali dengan korelasi 0,32 dan kanal side hanya 2,9 dB di bawah mid. Itu medan yang benar-benar lebar dan terdekorrelasi. Ambience difus mendapat lebar secara otomatis. Benturan diskret tetap dekat tengah apa pun yang Anda tulis.

Jadi klaim jujur untuk model ini bukan spasial. Klaimnya temporal. Anda mendapat suara yang dihasilkan bersama gambar dan mendarat pada frame tempat ia seharusnya berada, gratis, selamanya, tanpa editor. Jika format Anda benar-benar membutuhkan hard pan, Anda tetap harus melakukannya sendiri di post, dan Anda sebaiknya berhenti menulis nama kanal dalam prompt karena itu tidak melakukan apa-apa.

Sekarang jalankan ulang keeper: endpoint yang sama, frame pertama yang sama, prompt yang sama, ubah satu field menjadi resolution: 2K. Ada satu hal lagi yang perlu diketahui sebelum Anda menganggap draft sebagai preview.

Perbandingan dua resolusi video yang memotong delima kaca

Dua baris berisi lima frame yang membandingkan run 768P dan 2K pada timestamp yang sama, identik di frame nol dan mulai menyimpang sekitar 2,5 detik

Frame pertama sama, prompt sama, kedua tier. Frame 0 cocok persis. Pada 2,5s cangkangnya pecah berbeda dan kedua klip telah menjadi take yang berbeda.

Mengunci frame pertama mempertahankan komposisi, framing, pencahayaan, dan warna lintas kedua tier, itulah sebabnya Anda sebaiknya selalu memakai image-to-video daripada text-to-video untuk ini. Itu tidak memberi Anda take yang sama. Run 2K mengocok ulang aksinya. Perlakukan draft sebagai preview tampilan dan suara, bukan koreografi persis.

Langkah 5: Tambahkan Rekaman Nyata sebagai Referensi Video ASMR MiniMax H3

Jika Anda memiliki suara yang benar-benar Anda inginkan, serahkan saja. reference-to-video menerima hingga 9 gambar, 3 video, dan 3 klip audio, lalu menarik timbre dan karakter ruang dari referensi audio alih-alih menciptakannya. Saya memakai rekaman kaca pecah yang ramah domain publik oleh Gravity Sound dari Wikimedia Commons (CC BY 4.0), tiga take yang digabung menjadi 4,5 detik.

Tiga aturan, dan dua terakhir saya temukan dengan cara sulit lewat request yang ditolak:

  • Audio tidak bisa sendirian. Endpoint menuliskannya jelas: setidaknya satu gambar atau video diperlukan, dan audio saja tidak diperbolehkan. Pasangkan dengan sebuah frame.
  • Referensi audio harus 2 sampai 15 detik. Percobaan pertama saya memakai klip 1,49 detik dan kembali dengan audio duration 1486 ms, expected [2000, 15000] ms. Rentang itu tidak ada di halaman model.
  • Format file diperiksa. Payload base64 yang dideklarasikan sebagai audio/mpeg ditolak dengan audio format ".mpeg" not allowed. Payload .wav berhasil. Request yang ditolak tidak ditagih, tetapi tetap memakan satu round trip.

Settings: refers: [{url: <base frame>, type: "image"}, {url: <a 2 to 15s recording>, type: "audio"}], resolution: 768P, duration: 5.

Plain
1Same locked-off macro shot: the blade slices the glass pomegranate from left to right
2and the seeds scatter. Match the timbre, brightness and room character of the reference
3audio, same recording distance, same dryness. ASMR close-mic, no music, no voice.

Antarmuka AI video generator yang menampilkan input prompt dan video delima yang dihasilkan

Playground MiniMax H3 reference-to-video di Atlas Cloud dengan dua materi referensi dimuat, file audio di slot 1 dan frame dasar di slot 2

Reference Materials membawa file audio dan gambar bersama-sama, 2 dari 9 terpakai. Hapus gambar dan request tidak akan berjalan sama sekali.

Take berpandu referensi, $0.50. Shot yang sama, timbre diarahkan oleh rekaman nyata alih-alih diciptakan dari prompt. Referensi audio: Glass breaking oleh Gravity Sound, CC BY 4.0.

Tiga Template Video ASMR MiniMax H3: Memotong, Mengunyah, Hujan

Tiga format mencakup sebagian besar yang perform di kategori ini. Masing-masing adalah prompt lengkap siap tempel dan jalankan, dengan settings dan klip yang dihasilkannya. Sengaja tidak ada kaca, merah, atau batu tulis di bawah: jika setiap klip di akun Anda terlihat sama, algoritma memperlakukannya sebagai klip yang sama.

Tabel 3: lima slot yang sama, tiga pekerjaan berbeda.

SlotTemplate 1, The CutTemplate 2, The ChewTemplate 3, The Rain
Materialsarang madu menetes, bilah baja panasbatu cair berpijar, mangkuk batuhujan di kaca jendela mobil
Bentuk aksibilah masuk dari depan ke belakang, madu tertarik turunsumpit mengangkat, lalu dua gigitanhanya tetesan, tanpa aksi subjek
Perspektif micclose-mic, sangat kering, tanpa ruangsangat dekat, intimdi luar kaca, kabin teredam
Urutan suararetakan lilin, tarikan madu, tetes di piringdesis cair, kunyahan basah, kriuk kaca, embusan napaslapisan hujan stabil, hantaman tetesan, desis ban jauh
Negatifno music, no voice, no room reverbno words, no music, no narrationno music, no thunder, no voice, no wipers

Template 1, The Cut. Sarang madu, amber dan emas, 9:16, 768P, 6 detik, ratio: "9:16".

Plain
1Extreme macro, locked-off overhead shot of a thick slab of golden honeycomb on a pale
2ceramic plate, honey already pooling around it. A hot steel blade lowers into the wax
3and sinks through it front to back in one slow continuous press; the cut faces slump
4and a heavy thread of honey stretches and drips onto the plate. Warm amber key light
5from the left, shallow depth of field, single take, no cuts, no hands in frame.
6
7Audio: ASMR, close-mic, very dry, no room reverb, no music, no voice, no narration.
8A soft crackling of wax splitting under the blade, then a thick low stretching pull as
9the honey lengthens, then two heavy wet drips landing on the ceramic plate. Nothing else.

Template 1, $0.60. Retakan lilin, tarikan madu, tetesan. Dibuat dengan minimax/h3/text-to-video.

Template 2, The Chew. Lava mukbang, format yang meraih 11,3 juta view dalam seminggu, 9:16, 768P, 8 detik, ratio: "9:16".

Plain
1Vertical close-up: a pair of black lacquer chopsticks lifts a glowing clump of molten
2orange lava out of a dark stone bowl and carries it toward the camera, out of frame at
3the bottom. The lava is self-illuminating, casting orange light on everything around it;
4the rest of the room is almost black. Steam curls off the surface. Locked-off camera,
5single take, no cuts.
6
7Audio: ASMR, extremely close-mic, intimate, no words, no music, no narration, no room tone.
8A low molten sizzle and bubbling as the lava is lifted, then a soft wet chew, then a
9brighter glassy crunch on the second bite, then one slow satisfied exhale. No speech.

Template 2, $0.80. Desis, kunyah, kriuk, embusan napas, dan tidak satu kata pun. Dibuat dengan minimax/h3/text-to-video.

Template 3, The Rain. Jendela mobil malam hari, biru dingin dan neon, 16:9, 768P, 10 detik, ratio: "16:9".

Ini satu-satunya dari tiga template tanpa aksi subjek, dan paling banyak mengajarkan tentang negatif. Dengan tidak ada apa pun yang terjadi di layar, H3 cenderung mengambil music bed kecuali Anda melarangnya secara eksplisit. Ini juga klip yang kembali dengan medan stereo paling lebar sejauh ini, tanpa diminta. Konten berorientasi tidur membutuhkan durasi, jadi ini berjalan mendekati batas atas rentang durasi yang berguna.

Plain
1Macro shot through the inside of a car window at night, heavy rain running down the
2outside of the glass. Individual droplets hit, hesitate, then streak downward and merge.
3Beyond the glass, out-of-focus neon signage breaks into cold blue and magenta bokeh.
4No wipers, no people, no movement inside the car. Camera locked off, single continuous
5take, shallow depth of field, no cuts.
6
7Audio: ASMR, close-mic on the outside of the glass, cabin slightly muffled.
8A steady even rain bed with clearly separated individual droplet impacts on the glass,
9plus a faint distant hiss of tyres on a wet road. No music, no thunder, no voice,
10no narration, no wiper noise.

Template 3, $1.00. Sepuluh detik ambience murni, tanpa soundtrack karena prompt melarangnya. Dibuat dengan minimax/h3/text-to-video.

Berapa Sebenarnya Biaya Video ASMR MiniMax H3

Ini adalah bukti pembayaran untuk artikel ini, bukan estimasi.

Item barisJumlahDitagih
Frame dasar GPT Image 2, high, 2048x11521$0.17
Keeper 2K, 5s, image-to-video1$0.70
Draft 768P, 5s, image-to-video1$0.50
768P reference-to-video, 5s1$0.50
Klip template pada 768P, 6s + 8s + 10s3$2.40
Request referensi yang ditolak2$0.00
Total$4.27

Enam klip layak publikasi dan satu frame dasar. Skalakan ke jadwal: satu klip vertikal 8 detik per hari pada 768P adalah $0.80, jadi sekitar $24 per bulan untuk akun faceless yang posting harian, sebelum Anda menghabiskan satu menit di editor.

Dua catatan billing. $0.009 yang tercantum untuk GPT Image 2 adalah lantai token-tier; render high-quality 2048x1152 jatuh di $0.1745, hampir dua puluh kali lipat, jadi buat anggaran dari tier yang benar-benar Anda pakai. Dan field price H3 terisi belakangan dengan jeda: polling sampai status menjadi completed dan sering kali masih undefined. Poll prediction id lagi beberapa saat kemudian untuk angka sebenarnya. Poll kedua itulah satu-satunya cara membangun bukti pembayaran seperti ini, bukan tebakan.

Satu Catatan Jujur tentang Audio ASMR dan Hak

Jangan unggah rekaman ASMR milik orang lain sebagai file audio refers. Referensi benar-benar memigrasikan timbre ke output, dan menjalankan rekaman melalui model tidak mengubah siapa pemiliknya. Referensi yang dipakai di sini berlisensi CC BY 4.0 dan sudah dikreditkan di atas, yang hanya butuh sekitar dua menit untuk dicari.

Jangan membangun ASMR di sekitar suara orang nyata yang dapat dikenali. Setiap template dalam artikel ini sengaja tanpa suara manusia, yang sekaligus merupakan konvensi genre dan jalur yang paling tidak rumit.

Memanggil H3 melalui API tidak terdampak oleh lisensi komunitas yang melekat pada open weights. Lisensi itu, yang mencakup self-hosting, saat ini mengecualikan EU, UK, Korea, dan US, dan kanal lisensi formal terbuka untuk wilayah tersebut. Perlu diketahui, tetapi tidak perlu dikhawatirkan jika Anda memakai endpoint.

Video ASMR MiniMax H3: Pertanyaan yang Sering Diajukan

Apakah video ASMR MiniMax H3 menghasilkan suaranya sendiri, atau saya menambahkannya setelahnya?

Model menghasilkannya. Gambar dan audio keluar dari proses yang sama: video 24 fps dengan trek stereo AAC pada 32 kHz dalam file yang dikirim. Tidak ada langkah audio terpisah, tidak ada pustaka suara, dan tidak ada kerja penyelarasan, yang menjadi alasan utama endpoint ini menarik khusus untuk ASMR.

Bisakah saya membuat video ASMR MiniMax H3 melakukan pan dari kiri ke kanan?

Tidak hanya dengan memintanya. Saya menulis arahan kanal eksplisit dalam prompt dan mengukur hasilnya: korelasi 0,97 antara kanal dan perbedaan level maksimum 1,9 dB dalam jendela seperempat detik mana pun, yang sama sekali bukan pan. Treknya benar-benar stereo dan konten difus seperti hujan kembali dengan medan lebar, tetapi benturan diskret tetap berada di tengah terlepas dari kata-kata yang dipakai. Jika format Anda membutuhkan hard pan, lakukan di post.

Bisakah saya mengunggah rekaman sendiri sebagai referensi video ASMR MiniMax H3?

Ya, melalui reference-to-video, yang menerima hingga 3 referensi audio bersama hingga 9 gambar dan 3 video. Audio tidak bisa dikirim sendiri, jadi pasangkan dengan setidaknya satu gambar atau video. Audio juga harus berdurasi antara 2 dan 15 detik, dan formatnya divalidasi: payload .wav berhasil sementara audio/mpeg ditolak. Request yang ditolak tidak ditagih.

Apakah audio video ASMR MiniMax H3 768P lebih buruk daripada 2K?

Tidak. Kedua tier mengirim spesifikasi stereo AAC 32 kHz yang sama. Hanya gambar yang berubah, dan perubahannya besar: 16:9 kembali sebagai 1344x768 pada 768P versus 2560x1440 pada 2K. Karena penilaian kreatif dalam ASMR adalah penilaian mendengar, buat draft di $0.10/s dan jalankan ulang keeper di $0.14/s. Ingat saja, run 2K adalah take baru, bukan upscale dari draft.

Berapa durasi ideal video ASMR MiniMax H3, dan rasio aspek apa yang sebaiknya dipakai?

Duration menerima detik bulat apa pun dari 4 sampai 15. Klip memotong dan mengunyah bekerja baik pada 5 sampai 8 detik karena payoff-nya satu event; ambience berorientasi tidur membutuhkan 10 detik atau lebih. Untuk Shorts, Reels, dan TikTok gunakan 9:16, dan ingat bahwa text-to-video mewajibkan ratio diatur eksplisit dan menolak adaptive. Pada image-to-video, frame pertama menentukan bentuknya untuk Anda.

Berapa biaya satu video ASMR MiniMax H3?

Klip 5 detik ditagih $0.50 pada 768P dan $0.70 pada 2K. Klip vertikal 8 detik pada 768P adalah $0.80. Memposting satu klip seperti itu per hari sekitar $24 per bulan dalam compute, angka yang layak dibandingkan dengan 20 menit yang dibutuhkan editor per klip pada workflow yang disambung.

Mengapa video ASMR MiniMax H3 saya keluar dengan musik latar yang tidak pernah saya minta?

Karena Anda tidak melarangnya. Sebagian besar video dalam data latih model mana pun memiliki music bed, jadi perilaku default-nya adalah menambahkan satu, terutama saat tidak ada apa pun yang terjadi di layar. Masukkan negatif secara eksplisit di separuh audio prompt: no music, no voice, no narration, no room reverb, no ambience bed. Template ambient lebih membutuhkan ini daripada template aksi.

Model Terbaru

Satu API untuk semua AI multimedia.

Jelajahi semua model