Seedance 2.5 Şimdi Yayında — İlk Olarak Atlas Cloud'da

Bir adet 32 saniyelik nakarat ile $4.80'a MiniMax H3 Müzik Videosu Yaptım. Ses Parçası Beni Şaşırttı.

MiniMax H3'e ücretsiz referans ses olarak 32 saniyelik bir hook yükledim, dört adet beat'e kilitli çekim aldım ve $4.80 karşılığında gerçek bir MiniMax H3 müzik videosu kestim. Promptlar ve faturalar dahildir.

Bir video editörü, birden çok video monitörü olan bir konsolda çalışıyor

Gece geç saatlerde bir renk düzeltme odası, altı monitörde aynı gümüş saçlı şarkıcının altı farklı çekimi gösteriliyor_Altı_ çekim, tek bir sanatçı, tek bir şarkı. openai/gpt-image-2/text-to-image ile oluşturuldu.

Suno kullanıcıları günde yaklaşık 7 milyon şarkı üretiyor, bu kabaca her iki haftada bir Spotify kataloğu demek (TechCrunch, Şubat 2026). Bunların neredeyse hiçbirine hiçbir zaman bir resim eklenmeyecek. Resmin imkansız olmasından değil, geleneksel yolun dört araçtan geçmesinden: hareketsiz görüntüler oluştur, onları canlandır, ayrı bir dudak senkronizasyonu geçişi yap, sonra her şeyi bir kurguda düzelt. Her atlamada yüz, gardırop veya ritim kaybolur.

Bu yüzden atlamaları atladım. Bir nakaratın 8 saniyelik bir dilimini doğrudan bir video modelinin referans yuvasına bıraktım ve Çalıştır'a bastım. Ses için benden hiçbir şey almadı.

Sonra, internette kimsenin doğru dürüst cevaplamadığı bir soruyu yanıtlamak için bitmiş mp4'ü parçalara ayırdım: modelden geri çıkan ses benim şarkım mı, yoksa sadece benzer gelen bir şey uydurdu mu? Ölçtüm. Cevap beklediğim gibi değil ve bu, şeyi nasıl keseceğinizi değiştiriyor.

Önemli çıkarımlar

  • Referans ses ücretsizdir. MiniMax H3 yalnızca çıktı saniyeleri için fatura keser. Dört adet 8 saniyelik referans dilimim faturaya 0,00 $ ekledi. Referans video pahalı olanıdır.
  • 15 saniye, proje başına değil, üretim başına bir tavan değerdir. Şarkıyı dilimle, her çekim için bir dilim kullan, birleştir. 32 saniyelik kurgum dört üretimdir.
  • Nakaratı 120 BPM'de yazın. Bir ölçü tam olarak 2,000 saniyedir, bu nedenle H3'ün tam saniye duration değerleri elle düzeltme yapmadan ölçü çizgilerine denk gelir. 8s = 4 ölçü.
  • Çıktı sesi, parçanızın örnek hizalanmış halidir. Giriş dilimim ile H3'ün sağladığı stereo miks arasında sıfır gecikmede 0,892 dalga formu korelasyonu ölçtüm. Yeniden oluşturulmamıştır. Yine de final kurgu için master'ı geri yerleştirmek istersiniz, farklı bir nedenden (aşağıda).
  • Toplam gerçek harcama: 7,53 $ başarısız olanlar dahil dokuz üretim arasında. Final kurguya giren dört çekim, şarkı ve temel kare 4,80 $'a mal oldu.

Tek Bir 32 Saniyelik Nakarattan Kestiğim MiniMax H3 Müzik Videosu

Ses açık. Bu, herhangi bir geçiş olmadan birleştirilmiş, üzerine orijinal 32 saniyelik master yerleştirilmiş dört ayrı üretimdir.

TfrOvWHf4ys

"MIRA", 32 saniye, 2560x1440, 24 fps. Her biri 8 saniyelik, çekim başına 1,12 $ olan dört minimax/h3/reference-to-video üretimi. Şarkı referans ses olarak girdi ve 0,00 $'a mal oldu.

Dört üretim, dört tamamen farklı aydınlatma dünyası, tek bir yüz. Aralarında hiçbir şey rötuşlanmadı.

Gümüş saçlı, parlayan kırmızı bir tasma takan bir kadının dört görüntüsü

Dört çekimden dört kare, aynı şarkıcıyı neon bir çatıda, bir çöl otoyolunda, beyaz bir stüdyoda ve siyah bir su tankında gösteriyor_Her_ teslim edilen klipten bir kare çekildi. Yağmur, alçak güneş, düz yüksek anahtar ve su altında aynı saç, aynı file üst, aynı kırmızı LED tasma.


MiniMax H3 Müzik Videosu Denemelerinin Çoğu Neden On Altıncı Saniyede Dağılıyor

Üç başarısızlık modu, hepsi de önlenebilir.

Bir: 15 saniyeyi proje sınırı olarak görmek. H3 tek bir üretimi 15 saniyeyle sınırlar. İnsanlar bunu okuyor, "müzik videosu olmaz" sonucuna varıyor ve pes ediyor. Ama bir müzik videosu hiçbir zaman tek bir çekim değildi. Gerçek bir video zaten her 4 ila 8 saniyede bir keser. Sınırlama sizi yalnızca bir editörün zaten yapacağı şeyi yapmaya zorlar.

İki: Ritmi kelimelerle tanımlamak. "Neşeli, enerjik, ritme uygun dans etmek" modelin kilitleneceği hiçbir şey vermez. Kendi temposunu uydurur ve sizin kesme noktalarınız sonsuza kadar yarım vuruş kayar. Gerçek sesi vermek tahmin yürütmeyi ortadan kaldırır.

Üç: Gardırobun kaymasına izin vermek. Her çekim aynı referans görüntüye ve aynı gardırop ifadesine, kelimesi kelimesine ihtiyaç duyar. Çekimler arasında "siyah file üst"ü "koyu file gömlek" olarak değiştirirseniz farklı bir kişi elde edersiniz.

İki yolun size gerçek maliyeti şöyle:

 Geleneksel dört araçlı zincirTek H3 referans çağrısı
Çekim başına araç sayısıGörüntü modeli, video modeli, dudak senk. aracı, NLETek bir uç nokta, ardından sonda bir NLE
Çekim başına manuel adım4 aktarım, 3 dosya dışa aktarma1 gönderme
Karakteri ne tutar?Elle yeniden yönlendirme ve şansBir referans görüntü, kelimesi kelimesine yeniden kullanılır
Görüntü ve sesAyrı ayrı oluşturulur, sonra hizalanırAynı geçişte oluşturulur, 32 kHz stereo
8 saniyelik çekim başına maliyetDört ayrı sayaç2K'da 1,12 $, 768P'de 0,80 $

Eski yolun hakkını vermek gerek: bu bir hayal değil. Japon yaratıcı Arata Fukoe, tamamen yapay zeka ile yapılmış bir müzik videosuyla Project Odyssey bronz madalyası kazandı ve hem Queen hem de Linkin Park resmi yapay zeka destekli videolar yayınladı. Bu zincirler dört veya beş araçtan geçiyordu, ki bu da tek şarkısı olan bağımsız bir sanatçının zamanının olmadığı şeydir.

Referans Ses Gerçekte Bir MiniMax H3 Müzik Videosu İçin Ne Satın Alır?

Herhangi bir şey harcamadan önce anlamaya değer kısım burası.

H3, sesi bitmiş karelere dublaj yapmak yerine görüntü ve sesi tek bir geçişte üretir. Ona bir referans parçası verdiğinizde, bu parça bir ruh hali notu değildir. Giriş dilimimi, teslim edilen mp4'ün içindeki ses akışına karşı dalga formu seviyesinde, 8 kHz mono downmix üzerinde karşılaştırdım:

  • Zarf korelasyonu: 0,956 sıfır gecikmede
  • 2 saniyelik bir pencere üzerinde ham dalga formu korelasyonu: 0,892sıfır örnek ofsetinde

Bu, benzer bir şarkıyı yeniden üreten bir model değil. Bu, dosyanızın, örnek hizalanmış, istemin istediği ortamın üstüne katmanlandığı ve bir tur AAC yeniden kodlamanın yapıldığı halidir. Karşılaştırma için, referans ses olmadan oluşturulan bir kontrol çekimine karşı aynı ölçüm 0,26 olarak geldi, ki bu gürültü tabanıdır.

Mavi giriş ve kırmızı çıkışı gösteren neredeyse aynı iki ses dalga formu

Yukarıdaki giriş diliminin dalga formu, aşağıda H3'ün teslim ettiği ses, sıfır ofsette hizalanmış_Üst: yüklediğim 8 saniyelik mp3. Alt: H3'ün döndürdüğü mp4'ün içindeki ses akışı. Aynı tepe noktaları, aynı konumlar, ofset yok._

Giriş sınırlamaları katıdır ve sessizce değil, gönderim anında uygulanır:

Referans girişiSınırFaturalandırma
Görüntüleren fazla 9Atlas Cloud'un H3 uç noktalarında ücretsiz
Videolaren fazla 3, her biri 2-15 sçıktı oranı üzerinden faturalandırılır
Sesen fazla 3, her biri 2-15 s, tüm kliplerde toplam 15 s0,00 $
Yalnızca sesreddedilir, en az bir görüntü veya video gerektirirgeçerli değil

Toplam ses tavanını kasıtlı olarak test ettim: bir çağrıda üç adet 8 saniyelik dilim gönderdim. 5,8 saniyede invalid params, total audio duration 24138 ms exceeds 15000 ms hatasıyla başarısız oldu ve faturalandırılmadı. İyi haber: H3 fazladan dosyayı sessizce düşürüp sizi yine de ücretlendirmiyor.

Bundan önce karşılaştığım bir tuzak daha: Sesi base64 veri URL'si olarak iletirseniz, MIME türü API'nin çıkardığı uzantıyı belirler. data:audio/mpeg audio format ".mpeg" not allowed ile reddedilir. data:audio/mp3 sorunsuz geçer. Bunu fark edene kadar dört gönderim bu nedenle öldü, hepsi ücretsiz.


MiniMax H3 Müzik Videosu İş Akışı ve Her Saniyenin Maliyeti

Aşağıdaki her şey, tümünü çalıştırdığım ve faturalandırdığım Atlas Cloud üzerinde bir API anahtarı ile çalışır. Üç model, bir tarayıcı sekmesi.

AdımModelNe yaparGerçekte faturalandırıldığım fiyat
Nakaratı yazminimax/music-2.6Stil istemi ve sözlerden tam şarkı, mp3, ~5 dakikaya kadarŞarkı başına 0,15 $, sabit
Sanatçıyı kilitleopenai/gpt-image-2/text-to-imageHer çekimin devraldığı bir temel kare0,1745 $, quality high, 2048x1152'de
Her çekimi çekminimax/h3/reference-to-videoGörüntü artı ses girer, ritme kilitlenmiş klip, stereo ses çıkar2K'da 0,14 $/s, 768P'de 0,10 $/s. Ses girişi 0,00 $

Bu tabloyla ilgili iki not, çünkü listelenen sayılar her iki yönde de yalan söylüyor. GPT Image 2 katalogta 0,009 $ tabanı gösterir; bu en düşük token kademesidir ve gerçek bir 2048x1152 high render 0,1745 $ faturalandırır. H3'ün katalog girişi 0,10 $ gösterir, bu yalnızca 768P kademesidir; 8 saniyelik 2K işlerimin her biri tam olarak 1,12 $ faturalandı, yani saniyede 0,14 $.

İlk kare kilidi yerine konu referansları istiyorsanız, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) aynı oranları alır ve [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) saf istem çekimlerini kapsar.

Düzeltilmeye değer bir nokta: Bu planın daha önceki bir versiyonu, platformda tam şarkı üreticisi olmadığı için kendi şarkınızı getirmeniz gerektiğini varsayıyordu. Artık var. minimax/music-2.6 parçayı yazar, böylece şarkı da dahil tüm zincir tek bir yerde çalışır.


Adım Adım MiniMax H3 Müzik Videosu Nasıl Yapılır

Adım 1: 120 BPM'lik Bir Nakarat Yazın ve Çekim Başına Dilimlere Kesin

Açıkça 120 BPM isteyin. 120 BPM'de bir ölçü tam olarak 2.000 saniyedir, bu nedenle H3'ün tam saniye duration enum'u otomatik olarak ölçü çizgilerine düşer: 4s = 2 ölçü, 6s = 3 ölçü, 8s = 4 ölçü, 10s = 5 ölçü. Kesimleriniz, tek bir işarete dokunmadan güçlü vuruşa düşer.

Model: minimax/music-2.6. Ayarlar: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.

Stil istemi:

plaintext
1Tam 120 BPM'de synth-pop, düz four-on-the-floor kick, parlak analog
2sidechain'li pad'ler, mikste önde oturan temiz kadın vokal, geniş
3stereo koro, rap yok, sürekli açık ünlüler, sinematik ve biraz
4melankolik, radyoya hazır master

Sözler:

plaintext
1[Chorus]
2Hold the line, hold the light
3I am running out of night
4Say my name into the rain
5And I will burn again

75 saniyede 0,15 $ karşılığında 70 saniyelik bir parça döndürdü. Daha sonra güvenmek yerine tempoyu kontrol ettim: dosya üzerinde bir başlangıç-novelty otokorelasyonu çalıştırdım. En güçlü gecikme tam olarak 0,500 s olarak geldi, bu 120 BPM'dir ve vuruş ızgarası, sıfır yerine kod çözülen dosyada 0,24 s'de başlar. Bu ofset önemlidir: 0,24'ten kesin ve her dilim güçlü vuruşta başlar.

plaintext
1# 32 saniyelik master, güçlü vuruşta 0,24s'den başlıyor
2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3
3
4# dört 8 saniyelik dilim, çekim başına bir tane, her biri 4 ölçü ve 15s sınırının oldukça altında
5for i in 0 8 16 24; do
6  ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3
7done

Kendi parçanız zaten varsa, bu adımı tamamen atlayın. Bu normal durumdur ve en ucuz olanıdır.

Adım 2: Sanatçıyı Tek Bir GPT Image 2 Temel Karesiyle Kilitleyin

Her çekim bu tek dosyaya referans verir. Burada yanlış olan her şey dört kez yanlış olur, bu yüzden 0,17 $'ı harcayın ve düzgünce bakın.

Model: openai/gpt-image-2/text-to-image. Ayarlar: quality high , size 2048x1152 (16:9).

plaintext
1Sinematik müzik videosu karesi, belden yukarı portre. 25 yaşında, Doğu Asyalı kadın
2synth-pop şarkıcısı, gümüş-beyaz kısa saçlı ve düz kesim perçemli, mat siyah
3file üst, köprücük kemiğine karşı parlayan ince bir kırmızı LED tasma ve tek bir
4gümüş küpe. Geceleyin yağmurla ıslanmış bir çatıda duruyor, ağzına yakın tuttuğu
5vintage krom el mikrofonu. Arkasında, odak dışı macenta ve camgöbeği neon tabelalar,
6sert bir arka ışıkta yakalanmış ince yağmur, bir havalandırmadan yükselen buhar.
735mm anamorfik lensle çekilmiş, sığ alan derinliği, teal-ve-macenta renk düzeltmesi,
8görünür film greni. Yüzü keskin ve kamera solundan gelen yumuşak bir anahtar ışıkla
9eşit şekilde aydınlatılmış. Karede hiçbir yerde metin yok.

Gümüş saçlı, yağmurlu bir neon şehirde vintage mikrofon tutan kadın

Oluşturulan temel kare: yağmurla ıslanmış neon çatıda krom mikrofonlu gümüş saçlı şarkıcı_Sonraki_ her çekimin devraldığı temel kare. openai/gpt-image-2/text-to-image ile oluşturuldu, quality high, 2048x1152, 0,1745 $ faturalandırıldı.

Giriş ayarlarını ve oluşturulan çıktıyı gösteren yapay zeka görüntü oluşturucu arayüzü

GPT Image 2, Atlas Cloud oyun alanında bu tam istemi çalıştırıyor, bitmiş kare çıktı panelinde

Atlas Cloud oyun alanında aynı istem: 16:9 boyutunda 2048x1152, Quality high ve 0,1745 $ teklif eden Çalıştır düğmesi, API'nin bana gerçekte faturalandırdığı miktar. Katalogtaki 0,009 $ en düşük token kademesidir, bu değil. Aynı istem, farklı tohum, bu nedenle bu render yukarıdaki dosyanın aynısı değil.

Bu istemdeki gardırop kelimeleri (gümüş-beyaz kısa saç, mat siyah file üst, kırmızı LED tasma, gümüş küpe) aşağıdaki her istemde kelimesi kelimesine yeniden kullanılır. Bu tekrarlama, tüm tutarlılık mekanizmasıdır. Parafraz etmeyin.

Adım 3: Ücretsiz Referans Sesle İlk MiniMax H3 Müzik Videosu Çekimini Çalıştırın

Model: minimax/h3/reference-to-video. Ayarlar: refers = temel kare artı slice-0.mp3 , resolution: 2K, duration: 8, ratio: 16:9.

ratio'yu açıkça belirleyin. Oyun alanı varsayılanı adaptive'dir ve uç nokta, istediğiniz şekli adlandırdığınızda çok daha mutlu olur.

plaintext
1Müzik videosu çekimi. Referans görüntüdeki kadın, referans parçayı ıslak neon
2çatıda doğrudan lensten söylüyor, krom mikrofonu ağzında tutuyor. İlk dizeyi
3güçlü vuruşta sertçe söylüyor, gözleri kameraya kilitli, ardından uzun notada
4başını geriye atıyor. Sekiz saniye boyunca belden yukarıdan sıkı bir yakın
5çekime yavaş push-in, elde taşınır gibi mikro kayma, sert arka ışığı kesen
6yağmur çizgileri. Ağız şekilleri referans sesin söylenen ünlülerini tam olarak
7takip ediyor, şarkı söylüyor, konuşmuyor. Referans görüntüdekiyle aynı gümüş-beyaz
8kısa saç, mat siyah file üst ve parlayan kırmızı LED tasma. Ses manzarası: stero
9referans parça, artı hafif yağmur ve uzak bir şehir uğultusu mikste alçak.

7sPeYEe-xII

Çekim 1, ses açık. 2560x1440, tam 8,00 s, 24 fps, 32 kHz stereo. Gönderimden dosyaya 345 saniye, 1,12 $ faturalandırıldı. Yaklaşık 5 saniyede uzun notada başın geriye atılmasına dikkat edin.

Giriş ayarlarını ve oluşturulan videoyu gösteren yapay zeka video oluşturucu arayüzü

Temel kare ve ses dilimi yüklenmiş referans-to-video oyun alanı, bitmiş klip çıktı panelinde

Referans Materyalleri 2/9 okur: bir yuvada slice-0.mp3, diğerinde temel kare. Çözünürlük 2K, Süre 8 ve 1,12 $ teklif eden Çalıştır düğmesi, tam olarak 8 x 0,14 $. Aspect Ratio açılır menüsünün varsayılan sayfa olan adaptive üzerinde olduğuna dikkat edin; API çağrılarım ratio'yu açıkça 16:9 olarak ayarladı.

Yazmaya değer bir sayı: duration: 8, tam olarak 8,00 saniyelik bir kap dosyası teslim etti. duration: 4, 4,46 saniye teslim etti. Ölçü çizgilerinde birleştirmeyi planlıyorsanız, tam olarak geri dönen sürelerde kalın.

Adım 4: Yüzü Kaybetmeden Üç Dünya Daha Çekin

Aynı temel kare, aynı gardırop cümlesi, sonraki ses dilimi. Diğer her şey değişir.

4a. Altın saatte çöl otoyolu. refers = temel kare + slice-8.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Müzik videosu çekimi. Referans görüntüdeki aynı kadın, altın saatte boş bir çöl
2otoyolunun orta çizgisinde duruyor, mikrofon yok, aynı mat siyah file üstün
3üzerinde açık bir çivit kot ceket, kırmızı LED tasma hala yanıyor. Referans
4parçanın nakaratını rüzgara karşı dudaklarıyla söylerken kamera asfaltta
5alçaktan geriye doğru hareket ediyor. Yoldan ısı titremesi, yükselen toz,
6gölgesi lense doğru uzuyor, yarı yolda bir anamorfik parlama geçiyor. Saç, yüz
7ve gardırop referans görüntüyle aynı. Ses manzarası: açık çöl rüzgarı altında
8referans parça, geniş ve havadar.

4XEki-v2vCU

Çekim 2, ses açık. Aynı yüz, zıt renk sıcaklığı ve referans parça açık rüzgar altında yeniden mikslendi. 332 s, 1,12 $.

4b. Beyaz sonsuzluk kubbesi. refers = temel kare + slice-16.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Müzik videosu çekimi. Referans görüntüdeki aynı kadın, saf beyaz bir sonsuzluk-
2kubbesi stüdyoda, gölgesiz düz yüksek anahtar ışık altında, aynı mat siyah file
3üstün üzerinde parlak kırmızı vinil bir trençkot giyiyor, yakada kırmızı LED
4tasma görünüyor. Referans parçayla dört ölçü dans ediyor, gümüş-beyaz saç her
5dönüşte kamçılıyor. Kilitli geniş çerçeve, ardından ikinci güçlü vuruşta sert bir
6zoom ile orta çekime geçiş. Son iki saniyede konfeti gibi küçük beyaz kare kağıtlar
7düşüyor. Yüz ve saç referans görüntüyle aynı. Ses manzarası: referans parça, kuru
8ve yakın, artı stüdyo zemininde ayakkabı gıcırtısı.

VAyqdkVpnm0

Çekim 3, ses açık. Düz gölgesiz ışık, bir yüz değişimini saklamanın en zor yeridir ve dayandı . 8,00 s, 1,12 $.

4c. Su altı b-roll, dudak senkronizasyonu yok. refers = temel kare + slice-24.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Müzik videosu çekimi. Referans görüntüdeki aynı kadın, siyah bir tankta su altında
2asılı, gümüş-beyaz saç etrafında yüzüyor, kırmızı LED tasma suyun içinde parlıyor,
3siyah file üst yavaşça dalgalanıyor. Tam yukarıdan tek bir sert ışık huzmesi;
4kabarcıklar ağır çekimde lensin yanından yükseliyor. Güçlü vuruşta gözlerini açıyor
5ve bir elini yüzeye doğru uzatıyor. Şarkı söylemiyor ve ağzı kapalı kalıyor.
6Kamera çekim boyunca etrafında otuz derece dönüyor. Yüz referans görüntüyle aynı.
7Ses manzarası: referans parça yüzeyden duyuluyormuş gibi, boğuk ve alçak geçişli,
8kabarcık geçişleriyle.

fibdweUMRpY

Çekim 4, ses açık. "Şarkı söylemiyor ve ağzı kapalı kalıyor" talimatına uyuldu, ki bu yararlı kısım: referans ses zamanlamayı yönlendirir, zorunlu bir performansı değil. 329 s, 1,12 $.

Adım 5: Kontrol Çekimini Ses Yuvası Boşken Çalıştırın

Adım 3 ile aynı istem, kelimesi kelimesine. Tek değişiklik: refers yalnızca görüntüyü tutar, başka bir şey değil. 768P, duration: 8.

Bu tek klip, tüm mekanizmayı herhangi bir paragraftan daha iyi açıklar. Adım 3'e karşı dinleyin.

FAoPplGmKJc

Kontrol çekimi. Aynı istem, referans ses yok, 1344x768, 8,00 s, 200 s, 0,80 $. H3 kendi film müziğini yazdı ve performans, bu kelimeler yerine genel "birisi şarkı söylüyor" şeklinde.

Master'ıma karşı ölçüldüğünde, kontrolün sesi 0,26 zarf korelasyonu puanı alır. Adım 3'ünki 0,956 puan alır. Bu fark, ücretsiz ses yuvasının size satın aldığı şeydir.

Adım 6: Dudak Senkronizasyonunu Kasten Bozun

Her modelin bir hece tavanı vardır. Sizinkini bulmak 0,40 $'a mal olur.

Ayrı bir çift zamanlı rap parçası (minimax/music-2.6 yine, 0,15 $) oluşturdum, saniyede yaklaşık altı hece taşıyan 4 saniyelik bir dilim kestim ve aynı çatı düzenine 768P, duration: 4 ile besledim.

plaintext
1Müzik videosu çekimi. Referans görüntüdeki kadın, referans parçayı ıslak neon
2çatıda doğrudan lensten rap yapıyor, krom mikrofonu ağzında tutuyor, hızlı çift
3zamanlı dizenin her hecesini söylüyor. Kilitli orta yakın çekim, hafif elde
4taşınır kayma, sert arka ışıkta yağmur çizgileri. Ağız şekilleri referans sesin
5rap yapılan hecelerini tam olarak takip ediyor. Referans görüntüdekiyle aynı
6gümüş-beyaz kısa saç, mat siyah file üst ve parlayan kırmızı LED tasma. Ses
7manzarası: artı hafif yağmur ile stero referans parça.

jiQVCjOCbKg

Stres testi, ses açık. 1344x768, 4,46 s, 192 s, 0,40 $. Ağız meşgul kalıyor ve ritmi tutuyor, ancak tek tek ünsüzleri çözmeyi bırakıp tekrarlayan bir aç-kapa döngüsüne yerleşiyor. Söylenen dizeler belirgin ünlü şekilleri alır; bu almıyor.

Teslim edilen dosyalardan dürüst okumam: sürekli söylenen ünlüler, H3'ün ağız çalışmasının gerçekten inandırıcı olduğu yerlerdir ve yoğun rap ünsüzleri, makul harekete dönüştüğü yerlerdir. Yakın çekimlerinizi söylenen dizeler etrafında planlayın ve hızlı barları b-roll'a koyun. Konuşma ve şarkı söyleme arasındaki fark hakkında daha fazla ayrıntı dudak senkronizasyonu ve ses analizi bölümünde.

Adım 7: MiniMax H3 Müzik Videosunun Üzerine Master'ı Dikin, Sesi Kapatın ve Geri Yerleştirin

Tam olarak 8,00 saniyelik dört klip, tam olarak 32,00 saniyeye birleşir, bu da 120 BPM'de 16 ölçüdür. Kırpma yok.

plaintext
1# 1. her klibin sesini kaldır
2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do
3  ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4
4done
5
6# 2. ölçü sırasına göre birleştir (4 x 8s = 32s = 16 ölçü @ 120 BPM)
7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt
8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4
9
10# 3. orijinal master'ı geri yerleştir
11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4

Model zaten parçanızı geri veriyorsa neden uğraşıp sesi kapatasınız? Çünkü her klibin stereo miksi, o klibin isteminin istediği ortamı taşır: çekim 1'de yağmur, çekim 2'de çöl rüzgarı, çekim 4'te bir alçak geçişli su altı filtresi. Çekim başına güzel, bir kesim boyunca tutarsız. Master size, çekim başına yeniden kodlama olmadan, tam bit hızında tek bir sürekli miks verir. H3 performans senkronizasyonunu teslim eder. Master'ınız şarkıyı teslim eder.


MiniMax H3 Müzik Videosu Tarifi İçin Dört Varyasyon

Dikey yayın kesimleri. ratio: 9:16 ayarlayın ve aynı temel kare ve aynı dilimlerden bir Spotify Canvas veya Shorts dilimi elde edersiniz. Gerçek bir 768x1344 olarak döndü, bu nedenle oyun alanındaki açılır menünün aksine API ratio değeri gerçekten işe yarıyor. Canvas döngüleri tasarım gereği sessizdir, bu nedenle bu bir GIF olarak gönderilir.

Yağmurlu bir şehir çatısında mikrofon tutan gümüş saçlı kadın

Aynı sanatçının neon çatıda dikey 9:16 döngü kesimi_Aynı temel kare, aynı referans dilimi,_ ratio: 9:16 768P'de 0,80 $. Dürüst bir kırışıklık: "şarkı söylememesini" istedim ama yine de şarkı söyledi. Referans yuvasında bir vokal olduğunda, ses tartışmayı kazanır. Sessiz bir sanatçı istiyorsanız, enstrümantal bir dilim besleyin.

Referans görüntü yerine referans videosu. H3'e hareketi ve çerçevelemeyi taşıması için en fazla üç referans video klibi verebilirsiniz. Sayaca dikkat edin: referans video çıktı oranı üzerinden faturalandırılırken, referans ses ücretsizdir. Bu asimetri, bu uç noktadaki en kullanışlı fiyatlandırma bilgisidir.

Saf b-roll görselleştiricileri. Sanatçıyı tamamen çıkarın. Bir ürün fotoğrafı, bir albüm kapağı nesnesi veya bir doku plakası artı ses dilimini besleyin ve yalnızca kamera hareketi isteyin. Tutulacak bir yüz yok, bozulacak dudak senkronizasyonu yok ve her şeyi 768P'de çekebilirsiniz.

Ucuz taslak, pahalı final. 768P, 2K'nın 0,14 $/s'sine karşı 0,10 $/s'dir ve her ikisi de aynı 32 kHz stereo ile döner, bu nedenle değerlendirdiğiniz performans aynıdır. Tasarruf kullanılanlarda değil, reddedilenlerdedir: başarısız her 8 saniyelik çekim 1,12 $ yerine 0,80 $'a mal olur. Çekim doğru olana kadar 768P'de yuvarlayın, ardından 1,12 $'ı bir kez ödeyin. Üç deneme gerektiren bir çekimde bu 3,36 $ yerine 2,72 $'dır. Kademe farkı hakkında daha fazla bilgi için 768P ve 2K karşılaştırması ve tek bir klibin ne kadar uzanabileceği hakkında klip uzunluğu rehberi.


Tam Bir MiniMax H3 Müzik Videosunun Gerçek Maliyeti

Aşağıdaki her satır, tamamlandıktan sonra tahmin kaydından çekilmiş gerçek bir faturalandırılmış rakamdır, liste fiyatı değil.

KalemModel ve ayarlarFaturalandırılan
Nakarat, 70 s şarkıminimax/music-2.6, mp3 44.1 kHz0,15 $
Sanatçı temel karesiopenai/gpt-image-2/text-to-image, high, 2048x11520,17 $
Çekim 1, neon çatıminimax/h3/reference-to-video, 2K, 8 s1,12 $
Çekim 2, çöl otoyoluaynı, 2K, 8 s1,12 $
Çekim 3, beyaz kubbeaynı, 2K, 8 s1,12 $
Çekim 4, su altıaynı, 2K, 8 s1,12 $
Bitmiş video ara toplamı 4,80 $
Doğrulama probu768P, 4 s0,40 $
Kontrol çekimi, ses yok768P, 8 s0,80 $
Stres testi için rap parçasıminimax/music-2.60,15 $
Dudak senk. stres testi768P, 4 s0,40 $
Dikey Canvas kesimi768P, 8 s, 9:160,80 $
Bu makale için kahraman görüntüopenai/gpt-image-2/text-to-image, high0,17 $
Sınır aşımı testi, 24 s sesgönderimde reddedildi0,00 $
Yanlış ses MIME ile dört gönderimgönderimde reddedildi0,00 $
Referans ses, 4 x 8 sücretsiz giriş0,00 $
Toplam harcama 7,53 $

Bu, kullanılan çekimlerde 2K'da dakika başına 9,00 $ eder, hatalarımdan önce. Tamamen 768P'de çekilen aynı dakika 6,61 $'a gelir. Bir insan MV ekibi bu sayıların hiçbirini teklif etmez.

Daha uzun bir parça için bütçe yapıyorsanız iki operasyonel not. Gönderim zamanı reddetmeleri ücretsizdir, bu nedenle kötü parametreler size yalnızca zaman kaybettirir, başka bir şey değil. Ve bir tahmindeki price alanı bir gecikmeyle doldurulur, bu nedenle gerçek bir fatura (null yerine) istiyorsanız dosyalar indirildikten sonra istek kimliğini tekrar sorgulayın.


Kimin Şarkısı, Kimin Yüzü: Yayınlamadan Önce Ne Kontrol Edilmeli

Kısa, çünkü önemlidir ve bir vaaza ihtiyacı yoktur.

Referans parçasının haklarına sahip olmanız gerekir. Ücretsiz giriş, ücretsiz izin anlamına gelmez. Ticari olarak yayınlanmış bir single'ı referans ses olarak beslemek ve ardından çıkanı yayınlamak, telif ihtarına giden hızlı yoldur. Kendi kaydınız, sipariş ettiğiniz bir parça veya oluşturduğunuz bir şey sorun değildir.

Temel kareyi gerçek bir yaşayan sanatçının yüzünden oluşturmayın. Buradaki tutarlılık mekanizması, bir yüzü çekimler boyunca tutmakta çok iyidir, ki bu da tam olarak onu gerçek bir kişiye yöneltmenin kötü bir fikir olmasının nedenidir.

Açık ağırlıklar ve API erişimi iki farklı lisanstır. MiniMax, H3'ün ağırlıklarını Ağustos 2026'da Hugging Face üzerinde yayınladı ve topluluk lisansı şu anda AB, Birleşik Krallık, Güney Kore ve ABD'yi hariç tutuyor, bu bölgeler için resmi bir lisanslama kanalı açık. Bu kısıtlama, ağırlıkları kendiniz çalıştırmanıza bağlıdır. Modeli barındırılan bir API aracılığıyla çağırmak bir hizmet ilişkisidir ve sizi ağırlık lisansına tabi kılmaz. Her iki durumda da hangi durumda olduğunuzu bilmeye değer.

H3'ün alternatiflere karşı nerede durduğuna dair daha geniş bir bakış için Seedance 2.5 karşılaştırması ve bir istem yapısı rehberi var. Neden zahmete değer olduğuna dair bağlam için: sesli videoları puanlayan video düzenleme liderlik tablosunda H3 şu anda 1.126 Elo ile ilk sırada, Gemini Omni Flash 1.119 ve Dreamina Seedance 2.0 1.027 ile onu takip ediyor (Artificial Analysis, 10 Ağustos 2026'da kontrol edildi). Bu puanlar oylarla birlikte değişir, bu nedenle onları bir anlık görüntü olarak değerlendirin.


MiniMax H3 Müzik Videosu: Sıkça Sorulan Sorular

Tek bir MiniMax H3 müzik videosu tam üç dakika sürebilir mi?

Tek bir üretimde olamaz. Tek bir çağrı 15 saniyeyle sınırlıdır. Ancak bu, proje başına değil, üretim başına bir tavandır. 8 saniyelik çekimlerle üç dakikalık bir video, 23 üretimdir, 2K'da yaklaşık 25,76 $ ve parçanız 120 BPM ise her biri bir ölçü çizgisine denk gelir. Dilimle, çek, birleştir, master'ı geri yerleştir.

Bir MiniMax H3 müzik videosu gerçek şarkımı mı kullanıyor yoksa model sesi yeniden mi oluşturuyor?

Gerçek şarkınızı kullanır. Yüklediğim 8 saniyelik mp3 ile döndürülen mp4'ün içindeki ses akışı arasında, istemin istediği ortamın üstüne katmanlandığı, sıfır örnek ofsetinde 0,892 ham dalga formu korelasyonu ölçtüm. Referans ses olmadan oluşturulan bir kontrol çekimi, aynı master'a karşı 0,26 puan aldı. Yine de final birleştirme üzerine master'ınızı geri yerleştirmelisiniz, çünkü her klip kendi çekim ortamını ve kendi AAC kodlamasını taşır, bunlar bir kesimden temiz bir şekilde çıkmaz.

Bir MiniMax H3 müzik videosuna şarkı beslemek ekstra maliyet getirir mi?

Hayır. Dört adet 8 saniyelik referans dilimim, 4,48 $'lık bir çekim faturasına 0,00 $ ekledi. Dikkat edilmesi gereken referans video'dur, çünkü çıktı oranı üzerinden faturalandırılır. Sınırlar: üç ses klibi, her biri 2 ila 15 saniye, toplam 15 saniye ve ses asla tek referans olamaz.

MiniMax H3 dudak senkronizasyonu şarkı söylemede konuşmaya kıyasla ne kadar iyi?

Sürekli söylenen ünlüler onun güçlü yanıdır: belirgin ağız şekilleri, notayla eşleşen tutuşlar ve uzun bir notada başın geriye atılması bir döngüden ziyade bir performans olarak okunur. Yoğun sunum, pes ettiği yerdir. Saniyede altı heceli rap testim ritmi korudu ancak ünsüzleri çözmeyi bıraktı ve tekrarlayan bir aç-kapa döngüsüne girdi. Hızlı barları b-roll'a koyun.

Bir MiniMax H3 müzik videosunun her çekiminde aynı yüzü nasıl korurum?

Üç şey, hepsi sıkıcı. Her çağrıda yeniden kullanılan, asla yeniden oluşturulmayan bir referans görüntü. İstemler arasında kelimesi kelimesine kopyalanan, parafraz edilmeyen aynı gardırop ifadesi. Ve her istemde "referans görüntüyle aynı" ifadesini belirten açık bir madde. Dört çekimim yağmur, alçak güneş, düz yüksek anahtar ve su altı arasında kayma olmadan geçti.

Bir MiniMax H3 müzik videosunun bitmiş dakikası ne kadara mal olur?

2K'da bitmiş dakika başına 9,00 $, 32 saniyelik bir kurgu için 4,80 $'lık gerçek faturama dayanarak. Tamamen 768P'de çekilen aynı dakika 6,61 $'a mal olur ve 768P aynı 32 kHz stereo'yu teslim eder, bu nedenle değerlendirdiğiniz performans aynıdır. Reddettiğiniz çekimleri 0,80 $'da yuvarlayın ve 1,12 $'ı yalnızca kurguda hayatta kalan çekim için ödeyin.

En Yeni Modeller

Tüm Medya Yapay Zekâsı için Tek API.

Tüm modelleri keşfet