Kulaklığınızı takmadan aşağıdaki klibe kaydırmayın. Bu kategoride gerçekten fark ediyor.
Bir bıçak, yakut camdan oyulmuş bir narın içine doğru iniyor. Kabuk yarılıyor, kristalimsi bir çatırtı, ardından birkaç düzine cam taneciği ıslak arduvazın üzerine yuvarlanıyor. İşte bu yıl kaydırarak geçtiğiniz neredeyse tüm yapay zeka ASMR kliplerinden farklı olan kısım: kimse o sesi eklemedi. Herhangi bir ses kütüphanesi, düzenleyici veya zaman çizelgesi yoktu. Görüntü ve ses, tek bir oluşturma işleminde, tek bir çağrıda çıktı.
Geçtiğimiz yıl boyunca yapay zeka ASMR'si tatmin edici görünüyor ama kulağa biraz yanlış geliyordu ve bunun nedeni asla görseller değildi. Sorun, iş akışının son adımıydı. Sesi sessiz bir klibe yapıştırmak, her seferinde elle yapılan manuel bir işti. Kategori bu boşluk etrafında o kadar hızlı büyüdü ki, sadece bu dikiş işlemini otomatikleştirmek için adanmış küçük bir yapay zeka ASMR oluşturucu sitesi endüstrisi ortaya çıktı; bunlardan biri ana sayfada "binaural 3D ses" reklamı yapıyordu. Talep çoktan kanıtlanmıştı. Sadece montaj hattıyla sunuluyordu.
Ben de işi düzgün yaptım. Tek bir tekrarlanabilir iş akışı, altı klip ve ardından bu kategoride kimsenin yapmadığı şey: ffmpeg'de sol ve sağ kanalları ayırdım ve ölçtüm. Beklediğim şeylerden bazılarının yanlış olduğu ortaya çıktı ve bu da makalenin en kullanışlı kısmı oldu.
Önemli çıkarımlar
- H3, 24 fps görüntüyü ve aynı geçişte 32 kHz AAC stereo parçayı oluşturur. Ses üretilir, sonradan eklenmez.
- Stereo gerçekten stereodur, stereo kostümü giymiş çift mono değil. Ancak bir pan yönlendiremezsiniz. Sert bir soldan sağa tarama istedim ve 1.9 dB fark aldım, ki bu hiçbir şeydir.
- Stereo genişliği içerikten gelir, sizin ifadenizden değil. Hiçbir yönlendirme istemediğim yağmur klibi, gerçekten geniş bir alanla döndü.
- İlk kareyi kilitlemek, çekimi çözünürlükler arasında sabit tutar, ancak 768P ve 2K hala iki farklı çekimdir. Taslak, görünümü ve ses özelliklerini önizler, tam koreografiyi değil.
- 5 saniyelik bir 768P klibin faturası $0.50'dir. Aynı klibin 2K versiyonu $0.70 tutar. Tüm makalenin maliyeti $4.27 oldu.
Önce Dinleyin: Tek Geçişte Kesilmiş Bir MiniMax H3 ASMR Videosu
w7ZRR7bo3KI
Beş saniye, 2K, 24 fps, 32 kHz stereo, tek oluşturma, $0.70. Ses açık: bıçağın kenarının gıcırtısı, çatırtı, ardından taneler. Hiçbiri sonradan eklenmedi. minimax/h3/image-to-video ile oluşturuldu.
Tek bir istem. Tek bir model. Tek bir çağrı. Aşağıdaki her şey, bu klibin nasıl yapıldığı, ne kadara mal olduğu ve pazarlama hikayesinin hangi bölümlerinin bir dalga formuyla temastan sağ çıktığıdır.
Yapay Zeka ASMR Neden Patladı ve Çoğu Neden Kulaklık Testinde Başarısız Oluyor
Trendin bir doğum günü var. Yapay zeka ASMR'si Haziran 2025'te, Veo 3'ün çıkışından hemen sonra yayılmaya başladı ve format birkaç gün içinde nükleer boyutlara ulaştı. @asmraiworks'ten bir lav mukbang'i bir haftada 11.3 milyonun üzerinde görüntüleme aldı; bir cam kesme klibi ise on bir günde 5.3 milyon görüntüleme yaptı (Know Your Meme, 2025). Haber odaları bunu bir merak konusu olarak aldı; işin büyük kısmını yemek çubuklarıyla yenen gerçeküstü görseller ve erimiş lav taşıyordu (The Express Tribune, 2025).
Ardından insanlar kulaklık taktı ve ruh hali değişti. TechRadar'ın yazarı, viral olanlardan bir yığın izledi ve "insan yapımı ASMR'nin ayırt edici özelliği olan hatalardan ve yanlışlıklardan yoksun" yapay bir parlaklık hissini anlatarak ayrıldı (TechRadar, Haziran 2025). Bu yazıda alıntılanan hayranlar, ürperti tetikleyicilerinin teknik olarak mevcut olduğunu ancak yine de aynı olmadığını söyledi.
Bunun mekanik bir nedeni var ve mistik değil. ASMR, içeriğin ses olduğu tek içerik kategorisidir. Başka her yerde ses bir garnitürdür. Burada ise üründür. Ve baskın iş akışı şuydu:
- bir video modeliyle sessiz bir klip oluştur,
- bir ses kütüphanesinde çatırtı, çıtırtı, yağmur zemini ara,
- sesi bir düzenleyicide görüntüyle hizala,
- umursuyorsan elle pan ve miks yap, ki çoğu kişi hacimde yapmaz,
- dışa aktar.
Adım 3, işin öldüğü yerdir. İki kare geç ateşlenen konserve bir çatırtı, nedenini açıklayamadan sahte gibi okunur. Bunu günlük bir yayın programıyla çarpın ve hatalar birikir, çünkü hizalama her seferinde bir insan tarafından yeniden yapılır.
Bu boşluk, bütün bir yapay zeka ASMR oluşturucu sitesi endüstrisinin var olmasının nedenidir. En az üçü aktif olarak pazarlama yapıyor ve biri başlık özelliği olarak binaural 3D ses ile öne çıkıyor. Sahte bir sorunu çözmüyorlar. Gerçek bir deliği yamalıyorlar: altlarındaki video modelleri ses üretmiyor.
Bu da bir liderlik tablosu ayrımını incelemeye değer kılıyor. Artificial Analysis'in video düzenleme panosunda, sesle puanlanan, MiniMax H3, 1,126 Elo ile #1 sırada, Gemini Omni Flash'ın 1,119 puanının önünde ve Dreamina Seedance 2.0'ın 1,027 puanının yaklaşık yüz puan ilerisinde (Artificial Analysis, Ağustos 2026). Sesin puanın bir parçası olmadığı görüntüden videoya panolarda, bu modellerin birçoğu birbirine birkaç puan yakın. Ses önemli olduğunda fark açılıyor. ASMR için, önemli olan tek şey ses.
MiniMax H3 ASMR Video İş Akışı ve Her Adımın Maliyeti
Üç uç nokta, bir tarayıcı sekmesi. Bu makaledeki her şeyi Atlas Cloud üzerinde çalıştırdım, bu nedenle aşağıdaki her rakam faturadan geldi, bir ücret tablosundan değil.
| Bu makaledeki iş | Model | Ücret |
|---|---|---|
| Vitrin için ilk kare | OpenAI GPT Image 2 (metinden görsele) | $0.009/görselden başlar, yüksek ve 2048x1152'de $0.1745 faturalandı |
| Taslak ve kalan | MiniMax H3 Görselden Videoya | 768P'de $0.10/sn, 2K'da $0.14/sn |
| Gerçek bir kaydı besleme | MiniMax H3 Referanstan Videoya | aynı iki kademe |
| Üç şablon | MiniMax H3 Metinden Videoya | aynı iki kademe |
| Eski yöntem, yalnızca ses yarısı | ByteDance Seed Audio 1.0 | $0.143/dk |
Listede, üç H3 uç noktasında da "From $0.1/SEC" yazıyor. Bu 768P taban fiyatıdır. 2K, $0.14/sn'den faturalandırılır ve bu sayı faturanız dışında hiçbir yerde görünmez, bu nedenle fiilen talep ettiğiniz kademeye göre plan yapın.
Tablo 1: tek geçişe karşı dikişli iş akışı.
| MiniMax H3, yerel ses | Sessiz model + sonradan ses | |
|---|---|---|
| Bitmiş bir klibe giden adımlar | 1 | 4 ila 5 |
| Dahil olan araçlar | 1 | video modeli + ses kütüphanesi + düzenleyici + dışa aktar |
| Görüntü ve ses nasıl senkronize kalır? | aynı oluşturma, aynı zaman çizelgesi | doğru görünene kadar sürüklersiniz |
| Kim miks ve pan yapar? | kimse, modelin verdiğini alırsın | sen, elle, her ses için |
| Klip başına insan süresi | istemden sonra kabaca sıfır | 15 ila 40 dakika, dürüst olmak gerekirse |
| 5 saniyelik klip başına hesaplama | 768P'de $0.50 | video modeli + $0.143/dk ses oluşturma |
Rakip bir video platformunun saniye başına ücretini kasten belirtmiyorum çünkü fark hesaplamada değil. Ses oluşturma, dakikası $0.143, yani kuruşlar. Dikişli iş akışının gerçek maliyeti, klip başına 20 dakikalık insan dikkatidir ve bu maliyet ölçeklendikçe düşmez. Çoğalır. Günlük yayın yapan yüzü olmayan bir hesap, klip başına 20 dakikanın sessizce tüm iş modelini yediği yerdir.
Dürüst karşı ağırlık: elle dikiş yapmak size kontrol sağlar. Bir sesi stereo alanın herhangi bir yerine koyabilir ve kareye kadar kırpabilirsiniz. H3 size senkronu ücretsiz verir ve aşağıdaki ölçümlerin gösterdiği gibi, bu kontrolü size geri vermez.
Tablo 2: üç H3 uç noktası, gerçekten önemli olan parametreler.
| görselden videoya | metinden videoya | referanstan videoya | |
|---|---|---|---|
| Ana girdi | görsel (ilk kare) | yalnızca istem | refers[] |
| çözünürlük | 768P / 2K, varsayılan 2K | aynı | aynı |
| süre | 4 ila 15 arası herhangi bir tam saniye, varsayılan 8 | aynı | aynı |
| oran | ilk kare tarafından belirlenir | açıkça ayarlanmalıdır, uyarlanabilir reddedilir | referanslar tarafından belirlenir |
| refers sınırları | görselle birlikte kullanılmaz | kullanılmaz | 9 görsel, 3 video, 3 ses |
| Teslim edilen 16:9 çıktı | 768P'de 1344x768, 2K'da 2560x1440 | aynı | aynı |
| Ses parçası | 24 fps video üzerinde AAC stereo 32 kHz | aynı | aynı |
Elinize yazmaya değer iki parametre tuzağı. Parametre oran olarak adlandırılır, en_boy_orani değil ve yanlış anahtar onu ayarlanmamış bırakır, bu nedenle metinden videoya isteği reddeder. Ve aynı çağrıda görsel artı refers hata vermez: tamamlanır, tam olarak faturalandırılır ve sessizce iki girdiden birini atar.
MiniMax H3 ASMR Video Eğitimi: Cam Nar Kesmek
Cam meyve kesme, herkesin tanıdığı formattır, bu nedenle okuyucu neye baktığını anında bilir. Ancak cam elmalar ve cam mangolar çoktan tüketildi. Bir nar, belirli bir nedenle daha iyidir: kabuk yarıldığında, yüzlerce cam taneciği dökülür ve yuvarlanır, bu nedenle ses, merkezi bir darbe olmak yerine süre ve yapıya sahiptir. Bir model sesini taklit ediyorsa, dağılımın görüldüğü yer burasıdır.
Adım 1: GPT Image 2 ile Temel Kareyi Oluşturun
Video için bir şey harcamadan önce kompozisyonu kilitleyin. Ayarlar: kalite: yüksek, boyut: 2048x1152 (16:9), çıktı_formatı: png.
plaintext1Tamamen kalın yarı saydam yakut kırmızısı camdan oyulmuş, ıslak siyah arduvaz bir levha üzerinde duran bütün bir narın aşırı yakın çekim makro fotoğrafı. Cam kabuk 8mm kalınlığında, görünür iç kabarcıklar ve yontulmuş yüzeyler var; yüzlerce minik cam tohum içeride garnet kristalleri gibi parlıyor. Parlak bir Japon santoku bıçağı çerçevenin sol kenarında, ucu cam derisine zar zor değiyor. Sağ üstten gelen bir sert anahtar ışık, levhayı tarıyor ve ıslak taş üzerinde keskin kırmızı yakıcı desenler oluşturuyor. 100mm makro, f/2.8, sığ alan derinliği, karanlık kasvetli arka plan. 2Eller yok, metin yok, filigran yok, logo yok.

Atlas Cloud'da GPT Image 2 oyun alanı, kalite yüksek ve boyut 16:9 2048x1152 olarak ayarlanmış, cam nar OUTPUT panelinde işlenmiş
Gerçek çalıştırma. 2048x1152'de kalite yüksek ve sayfa $0.1745 olarak alıntı yapıyor, ki fatura da daha sonra aynısını söyledi.

Oluşturulan temel kare: ıslak siyah arduvaz üzerinde kalın yakut camdan oyulmuş bir nar, sol kenardan giren bir santoku bıçağı
H3'e verilen kare. openai/gpt-image-2/text-to-image ile oluşturuldu.
Adım 2: MiniMax H3 ASMR Video İsteminde Ses Yarısını Yazın
Çoğu insan, ASMR istemini önüne "ASMR" kelimesi eklenmiş bir resim açıklaması olarak yazar ve ardından modelin neden bunu lo-fi piyano ile puanladığını merak eder. H3, ses yönlendirmesini verirseniz ciddiye alır. Ses yarısını beş bölümde yapılandırın:
- Malzeme. Sesi çıkaran şey. Cam, mum, erimiş kaya, cam üzerinde su. Kalınlık ve ıslaklık konusunda spesifik olun, tınıyı değiştirirler.
- Eylem ve zaman içindeki şekli. Sadece "keser" değil, "tek bir yavaş sürekli vuruşta aşağı doğru bastırır". Model, olayları yerleştirmek için bunu kullanır.
- Mikrofon perspektifi.
yakın-mikrofon,samimi, kayıt mesafesi ipuçları. Bu, sesin ne kadar kuru ve yakın hissettirdiğini belirler ve iyi çalışır. - Onomatope dizisi. Ses olaylarını sırayla heceleyin: gıcırtı, ardından çatırtı, ardından düzinelerce küçük darbe, ardından sessizlik. En çok işe yarayan bölüm budur.
- Olumsuzlamalar.
müzik yok, ses yok, anlatım yok, oda yankısı yok, ortam zemini yok. Bunlar olmadan H3, eğitim verilerindeki çoğu videoda bir tane olduğu için yardımsever bir şekilde bir müzik ekleyecektir.
Ayrıca 4. bölüme kanal yönlendirmeleri yazdım, çatırtının sol kanalda olmasını ve tanelerin soldan sağa yuvarlanmasını istedim. Bunun gerçekte ne ürettiğini okumaya devam edin.
Adım 3: 768P Taslağını Çalıştırın
768P'de taslak. Ses parçası her iki kademede de aynı özelliktedir, bu nedenle ASMR'de bir dinleme kararı olan tüm yaratıcı yargı, ucuz kademede yapılabilir.
minimax/h3/image-to-video üzerinde ayarlar: görsel = 1. Adım çıktısı, çözünürlük: 768P, süre: 5. Oran ilk kareden gelir, bu nedenle ona dokunmayın.
plaintext1Santoku bıçağı soldan girer ve tek bir yavaş sürekli vuruşta cam narın içinden aşağı doğru bastırır, çerçeve boyunca soldan sağa hareket eder. Kabuk parlak bir kristalimsi çatırtı ile yarılır ve bir avuç minik cam taneciği ıslak arduvazın üzerine dökülür, sağ kenara doğru dağılır. Kamera kilitli, makro, tek çekim, kesme yok. 2 3Ses: ASMR, yakın-mikrofon, samimi, müzik yok, ses yok, anlatım yok, oda yankısı yok. Bıçağın kenarının girmesiyle kuru, sürekli bir cam gıcırtısı, ardından SOL kanala yönlendirilmiş tek bir keskin yüksek çatırtı, ardından düzinelerce küçük tıngırdayan tohum darbesi, dağılırken SOL kanaldan SAĞ kanala doğru yuvarlanıyor. En sonunda hafif bir bıçak-taş kazıma sesi, ardından sessizlik. Ortam zemini yok, uğultu yok, arka plan müziği yok.

Atlas Cloud'da MiniMax H3 görselden videoya oyun alanı, temel kare yüklenmiş, süre 5 ve OUTPUT panelinde tamamlanmış bir klip
Görselden videoya çalıştırma: ilk kare yüklendi, süre 5, OUTPUT tamamlandı. Çözünürlük seçiminin sayfa varsayılanı olan 2K'da olduğuna dikkat edin. Taslaklar için 768P'ye geçirin, aşağıdaki klip bu çözünürlükte işlendi.
xkolGEKI7UI
768P taslak, $0.50. Kahraman klibine göre daha yumuşak görüntü, aynı ses özellikleri. Tüm kararın verildiği çekim budur.
Adım 4: Güvenmeden Önce Stereoyu Ölçün
Ses için benim sözüme güvenmeyin ve modelin sözüne de güvenmeyin. Kanalları ayırın ve bakın. Bu yerel ffmpeg, API çağrısı yok, maliyet yok:
plaintext1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \ 2 -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \ 3 -frames:v 1 stereo-proof.png

Cam nar klibi ve yağmur klibi için dört panelli dalga formu analizi, her biri için sol ve sağ kanallar artı yan kanal gösteriliyor
İki klip için sol kanal üst üste sağ kanal, artı her birinin altında eşleşen kazançta yan kanal (sol eksi sağ). Bu, tek bir resimdeki tüm argüman.
İşte geri dönen ve bir kısmı beklemediğim şey:
Stereo gerçek. Oluşturduğum hiçbir klipte yan kanal boş değil. Stereo kılığına girmiş çift mono bir dosya orada hiçbir şey göstermez. Bunun içeriği var.
Ancak bir pan yönlendiremezsiniz. Büyük harflerle, çatırtının SOL kanalda ve tanelerin soldan SAĞA yuvarlanmasını istedim. Ölçülen: kanal korelasyonu 0.97, yan kanal orta kanalın 17.7 dB altında ve herhangi bir çeyrek saniyelik pencerede en büyük sol-sağ seviye farkı 1.9 dB. Bu bir pan değil. Biraz doğal genişliğe sahip merkezi bir görüntüdür. Bıçak çerçeve boyunca hareket eder; ses sabit kalır.
Genişlik, ifadenizden değil, içerikten gelir. Bir sonraki bölümdeki yağmur klibi, hiçbir yönlendirme istemediğim, 0.32 korelasyonla ve yan kanal orta kanalın yalnızca 2.9 dB altında olarak döndü. Bu gerçekten geniş, korelasyonsuz bir alandır. Dağınık ortam sesi otomatik olarak genişlik kazanır. Ayrı darbeler, ne yazarsanız yazın merkeze yakın kalır.
Dolayısıyla bu model için dürüst iddia mekansal değil. Zamansaldır. Görüntüyle birlikte oluşturulan ve ait olduğu kareye düşen sesi, ücretsiz, sonsuza kadar, bir düzenleyici olmadan alırsınız. Formatınız gerçekten sert bir pan gerektiriyorsa, yine de bunu post prodüksiyonda kendiniz yapmanız gerekir ve kanal adlarını istemlere yazmayı bırakmalısınız çünkü hiçbir işe yaramıyorlar.
Şimdi kalanı yeniden çalıştırın: aynı uç nokta, aynı ilk kare, aynı istem, bir alanı çözünürlük: 2K olarak değiştirin. Taslağın bir önizleme olduğunu varsaymadan önce bilinmeye değer bir şey daha.

768P ve 2K çalıştırmalarını aynı zaman damgalarında karşılaştıran iki sıra beş kare, sıfır karesinde aynı ve yaklaşık 2.5 saniyeden itibaren farklılaşıyor
Aynı ilk kare, aynı istem, her iki kademe. Kare 0 tam olarak eşleşiyor. 2.5 saniyede kabuk farklı şekilde kırılıyor ve iki klip farklı çekimler haline geliyor.
İlk kareyi kilitlemek, kompozisyonu, çerçevelemeyi, aydınlatmayı ve rengi her iki kademede de sabit tutar, bu nedenle bunun için her zaman metinden videoya yerine görselden videoya kullanmalısınız. Ancak size aynı çekimi vermez. 2K çalıştırması eylemi yeniden döndürür. Taslağı, tam koreografinin değil, görünümün ve sesin önizlemesi olarak kabul edin.
Adım 5: MiniMax H3 ASMR Video Referansı Olarak Gerçek Bir Kayıt Ekleyin
Gerçekten istediğiniz bir sesiniz varsa, onu teslim edin. reference-to-video, en fazla 9 görsel, 3 video ve 3 ses klibi alır ve ses referansından tını ve oda karakterini çıkarır, icat etmez. Wikimedia Commons'tan Gravity Sound'a ait, kamu malı dostu bir cam kırma kaydı kullandım (CC BY 4.0), 4.5 saniyeye birleştirilmiş üç çekim.
Üç kural ve son ikisini, isteklerin reddedilmesiyle zor yoldan buldum:
- Ses tek başına gidemez. Uç nokta bunu açıkça belirtir: en az bir görsel veya video gereklidir ve sesin tek başına olmasına izin verilmez. Bir kareyle eşleştirin.
- Ses referansı 2 ila 15 saniye arasında olmalıdır. İlk denememde 1.49 saniyelik bir klip kullandım ve
ses süresi 1486 ms, beklenen [2000, 15000] mshatasıyla döndü. Bu aralık model sayfasında yok. - Dosya formatı kontrol edilir.
audio/mpegolarak bildirilen bir base64 yükü,ses formatı ".mpeg" izin verilmiyorhatasıyla reddedildi. Bir.wavyükü geçti. Reddedilen istekler faturalandırılmaz, ancak bir gidiş-dönüşe mal olurlar.
Ayarlar: refers: [{url: <temel kare>, type: "image"}, {url: <2 ila 15s kayıt>, type: "audio"}], çözünürlük: 768P, süre: 5.
plaintext1Aynı kilitli makro çekim: bıçak cam narı soldan sağa dilimliyor ve taneler dağılıyor. Referans sesin tınısını, parlaklığını ve oda karakterini, aynı kayıt mesafesini, aynı kuruluğu eşleştir. ASMR yakın-mikrofon, müzik yok, ses yok.

Atlas Cloud'da MiniMax H3 referanstan videoya oyun alanı, iki referans malzemesi yüklenmiş, 1. yuvada bir ses dosyası ve 2. yuvada temel kare
Referans Malzemeleri ses dosyasını ve görseli birlikte taşıyor, 9 üzerinden 2 kullanılmış. Görseli bırakın istek hiç çalışmaz.
mY1VrOfM3cM
Referansla yönlendirilen çekim, $0.50. Aynı çekim, tını istemden icat edilmek yerine gerçek bir kayıt tarafından yönlendirildi. Ses referansı: Gravity Sound tarafından cam kırma, CC BY 4.0.
Üç MiniMax H3 ASMR Video Şablonu: Kesme, Çiğneme, Yağmur
Üç format, bu kategoride en çok performans gösterenlerin çoğunu kapsar. Her biri, ayarları ve ürettiği klipleri içeren, kopyala-yapıştır çalıştırmaya hazır bir istemdir. Aşağıda kasıtlı olarak cam, kırmızı veya arduvaz yok: hesabınızdaki her klip aynı görünüyorsa, algoritma onu aynı klip olarak ele alır.
Tablo 3: aynı beş yuva, üç farklı iş.
| Yuva | Şablon 1, Kesme | Şablon 2, Çiğneme | Şablon 3, Yağmur |
|---|---|---|---|
| Malzeme | damlayan petek, sıcak çelik bıçak | parlayan erimiş kaya, taş kase | araba camındaki yağmur |
| Eylem şekli | bıçak önden arkaya batar, bal aşağı çeker | yemek çubukları kaldırır, ardından iki ısırık | hiçbir özne eylemi yok, sadece damlalar |
| Mikrofon persp. | yakın-mikrofon, çok kuru, oda yok | son derece yakın, samimi | camın dışı, kabin boğuk |
| Ses dizisi | mum çatırtısı, bal esnemesi, tabağa damlama | erimiş cızırtı, ıslak çiğneme, camsı çıtırtı, nefes verme | sabit yağmur zemini, damla vuruşları, uzak lastik tıslaması |
| Olumsuzlamalar | müzik yok, ses yok, oda yankısı yok | kelime yok, müzik yok, anlatım yok | müzik yok, gök gürültüsü yok, ses yok, silecek yok |
Şablon 1, Kesme. Petek, kehribar ve altın, 9:16, 768P, 6 saniye, oran: "9:16".
plaintext1Soluk bir seramik tabakta kalın bir altın petek diliminin aşırı makro, kilitli tepeden çekimi, bal zaten etrafında birikiyor. Sıcak bir çelik bıçak mumun içine iner ve tek bir yavaş sürekli baskıyla önden arkaya doğru batar; kesik yüzeyler çöker ve ağır bir bal ipliği gerilir ve tabağa damlar. Soldan sıcak kehribar anahtar ışık, sığ alan derinliği, tek çekim, kesme yok, çerçevede el yok. 2 3Ses: ASMR, yakın-mikrofon, çok kuru, oda yankısı yok, müzik yok, ses yok, anlatım yok. Bıçağın altında mumun yumuşak bir çatırtısı, ardından bal uzadıkça kalın, alçak bir çekme sesi, ardından seramik tabağa iki ağır ıslak damlama. Başka hiçbir şey.
ZsVmf9AhPnw
Şablon 1, $0.60. Mum çatırtısı, bal esnemesi, damlama. minimax/h3/text-to-video ile oluşturuldu.
Şablon 2, Çiğneme. Lav mukbang, bir haftada 11.3 milyon görüntüleme alan format, 9:16, 768P, 8 saniye, oran: "9:16".
plaintext1Dikey yakın çekim: bir çift siyah lake yemek çubuğu, karanlık bir taş kaseden parlayan turuncu erimiş lav yığınını kaldırır ve kameraya doğru, çerçevenin altından dışarı taşır. Lav kendi kendini aydınlatıyor, etrafındaki her şeye turuncu ışık saçıyor; odanın geri kalanı neredeyse siyah. Yüzeyden buhar yükseliyor. Kilitli kamera, tek çekim, kesme yok. 2 3Ses: ASMR, son derece yakın-mikrofon, samimi, kelime yok, müzik yok, anlatım yok, oda tonu yok. Lav kaldırılırken düşük bir erimiş cızırtı ve kabarcıklanma, ardından yumuşak ıslak bir çiğneme, ardından ikinci ısırıkta daha parlak bir camsı çıtırtı, ardından bir yavaş, tatmin olmuş nefes verme. Konuşma yok.
UJhEsTnKkZI
Şablon 2, $0.80. Cızırtı, çiğneme, çıtırtı, nefes verme ve tek bir kelime yok. minimax/h3/text-to-video ile oluşturuldu.
Şablon 3, Yağmur. Gece araba camı, soğuk mavi ve neon, 16:9, 768P, 10 saniye, oran: "16:9".
Bu, hiçbir özne eylemi olmayan üçünden sadece bir tanesidir ve olumsuzlamalar hakkında en çok şey öğretir. Ekranda hiçbir şey olmadığında, H3 açıkça yasaklamadığınız sürece bir müzik zemini arar. Aynı zamanda, sorulmadan açık ara en geniş stereo alanla dönen kliptir. Uyku odaklı içerik uzunluk ister, bu nedenle bu, kullanışlı süre aralığının üst sınırına yakın çalışır.
plaintext1Araba camının içinden gece, dışarıda camdan aşağı akan şiddetli yağmurun makro çekimi. Tek tek damlalar çarpar, duraksar, ardından aşağı doğru çizgi çizer ve birleşir. Camın ötesinde, odak dışı neon tabelalar soğuk mavi ve macenta bokeh'e dönüşür. Silecek yok, insan yok, arabanın içinde hareket yok. Kamera kilitli, tek sürekli çekim, sığ alan derinliği, kesme yok. 2 3Ses: ASMR, camın dışına yakın-mikrofon, kabin hafif boğuk. Açıkça ayrılmış bireysel damla çarpmaları ile sabit, eşit bir yağmur zemini, artı ıslak bir yolda lastiklerin hafif uzak tıslaması. Müzik yok, gök gürültüsü yok, ses yok, anlatım yok, silecek sesi yok.
bUKr5V6wbdM
Şablon 3, $1.00. On saniye saf ortam sesi, istem bir tane yasakladığı için film müziği yok. minimax/h3/text-to-video ile oluşturuldu.
Bir MiniMax H3 ASMR Videosu Gerçekte Ne Kadara Mal Olur
İşte bu makalenin faturası, bir tahmin değil.
| Kalem | Adet | Faturalandırılan |
|---|---|---|
| GPT Image 2 temel kare, yüksek, 2048x1152 | 1 | $0.17 |
| 2K kalan, 5sn, görselden videoya | 1 | $0.70 |
| 768P taslak, 5sn, görselden videoya | 1 | $0.50 |
| 768P referanstan videoya, 5sn | 1 | $0.50 |
| 768P'de şablon klipler, 6sn + 8sn + 10sn | 3 | $2.40 |
| Reddedilen referans istekleri | 2 | $0.00 |
| Toplam | $4.27 |
Altı yayınlanabilir klip ve bir temel kare. Bir programa ölçeklendirin: 768P'de günde bir adet 8 saniyelik dikey klip, $0.80, yani bir düzenleyicide bir dakika geçirmeden önce günlük yayın yapan yüzü olmayan bir hesap için kabaca ayda $24.
İki fatura notu. GPT Image 2'nin listelenen $0.009'u bir token kademe tabanıdır; yüksek kaliteli bir 2048x1152 render, $0.1745'e ulaşır, bunun neredeyse yirmi katı, bu nedenle fiilen kullandığınız kademeden bütçe yapın. Ve H3'ün fiyat alanı bir gecikmeyle doldurulur: durum tamamlandı olana kadar sorgulayın ve sık sık hala tanımsız olur. Gerçek rakam için bir an sonra tahmin kimliğini tekrar sorgulayın. Bu ikinci sorgulama, bir tahmin yerine bunun gibi bir fatura oluşturmanın tek yoludur.
ASMR Sesi ve Haklar Üzerine Dürüst Bir Not
Başka birine ait bir ASMR kaydını refers ses dosyası olarak yüklemeyin. Referans, tınıyı gerçekten çıktıya taşır ve bir kaydı bir modelden geçirmek, ona kimin sahip olduğunu değiştirmez. Burada kullanılan referans CC BY 4.0'dır ve yukarıda belirtilmiştir, ki bu yaklaşık iki dakika sürdü.
ASMR'yi tanınabilir gerçek bir kişinin sesi etrafında oluşturmayın. Bu makaledeki her şablon, hem tür kuralı hem de en az karmaşık yol olan kasıtlı olarak sessizdir.
H3'ü bir API aracılığıyla çağırmak, açık ağırlıklara ekli topluluk lisansından etkilenmez. Kendi kendine barındırmayı kapsayan bu lisans, şu anda AB, Birleşik Krallık, Kore ve ABD'yi hariç tutar ve bu bölgeler için resmi bir lisanslama kanalı açıktır. Uç noktayı kullanıyorsanız bilinmeye değer, endişelenmeye değmez.
MiniMax H3 ASMR Video: Sıkça Sorulan Sorular
MiniMax H3 ASMR videosu kendi sesini mi oluşturur, yoksa ben sonradan mı eklerim?
Model oluşturur. Görüntü ve ses aynı geçişten çıkar: teslim edilen dosyada 24 fps video üzerinde 32 kHz'de bir AAC stereo parça. Ayrı bir ses adımı, ses kütüphanesi veya hizalama çalışması yoktur, bu da bu uç noktanın özellikle ASMR için ilginç olmasının tüm nedenidir.
MiniMax H3 ASMR videosunu soldan sağa pan yapabilir miyim?
İsteyerek değil. İsteme açık kanal yönlendirmeleri yazdım ve sonucu ölçtüm: kanallar arasında korelasyon 0.97 ve herhangi bir çeyrek saniyelik pencerede maksimum seviye farkı 1.9 dB, ki bu hiç pan değildir. Parça gerçekten stereodur ve yağmur gibi dağınık içerik geniş bir alanla döner, ancak ayrı darbeler ifadeden bağımsız olarak merkezde kalır. Formatınız sert bir pan gerektiriyorsa, post prodüksiyonda yapın.
MiniMax H3 ASMR videosu referansı olarak kendi kaydımı yükleyebilir miyim?
Evet, reference-to-video aracılığıyla, en fazla 9 görsel ve 3 video ile birlikte en fazla 3 ses referansını kabul eder. Ses tek başına gönderilemez, bu nedenle en az bir görsel veya video ile eşleştirin. Ayrıca ses 2 ila 15 saniye arasında olmalıdır ve format doğrulanır: bir .wav yükü çalışırken bir audio/mpeg reddedildi. Reddedilen istekler faturalandırılmaz.
768P MiniMax H3 ASMR videosunun sesi 2K'dan daha kötü mü?
Hayır. Her iki kademe de aynı AAC stereo 32 kHz spesifikasyonunu sunar. Sadece görüntü değişir ve çok değişir: 16:9, 768P'de 1344x768'e karşı 2K'da 2560x1440 olarak döner. ASMR'deki yaratıcı yargı bir dinleme kararı olduğundan, $0.10/sn'den taslak çıkarın ve $0.14/sn'den kalanları yeniden çalıştırın. Sadece 2K çalıştırmasının, taslağın yükseltmesi değil, yeni bir çekim olduğunu unutmayın.
MiniMax H3 ASMR videosu ne kadar uzunlukta ve hangi en-boy oranında olmalıdır?
Süre, 4 ila 15 arası herhangi bir tam saniyeyi kabul eder. Kesme ve çiğneme klipleri, ödül tek bir olay olduğu için 5 ila 8 saniyede çalışır; uyku odaklı ortam sesi 10 veya daha fazlasını ister. Shorts, Reels ve TikTok için 9:16 kullanın ve metinden videoya oran'ın açıkça ayarlanması gerektiğini ve uyarlanabilir'i reddettiğini unutmayın. Görselden videoda ilk kare şekli sizin için belirler.
Bir MiniMax H3 ASMR videosu ne kadara mal olur?
5 saniyelik bir klip, 768P'de $0.50 ve 2K'da $0.70 faturalandırır. 768P'de 8 saniyelik dikey bir klip, $0.80'dir. Günde bir tane yayınlamak, hesaplamada ayda yaklaşık $24'tür, bu da dikişli iş akışında bir düzenleyicinin klip başına alacağı 20 dakikaya karşı karşılaştırmaya değer sayıdır.
Hiç istemediğim halde MiniMax H3 ASMR videom neden arka plan müziğiyle geliyor?
Çünkü yasaklamadınız. Herhangi bir modelin eğitim verilerindeki çoğu videonun bir müzik zemini vardır, bu nedenle varsayılan davranış, özellikle ekranda hiçbir şey olmadığında bir tane eklemektir. Olumsuzlamaları istemin ses yarısına açıkça koyun: müzik yok, ses yok, anlatım yok, oda yankısı yok, ortam zemini yok. Ortam şablonlarının buna eylem şablonlarından daha fazla ihtiyacı vardır.






