MiniMax H3 Dudak Senkronizasyonu ve Ses: Ona 6 saniyelik bir ses yükledim ve Pipeline'ımdan 4 aracı sildim.

MiniMax H3 dudak senkronizasyonu ve sesi, altı adımlık dublaj zincirimi tek bir API çağrısıyla değiştirdi. İki gerçek çekim, kimsenin belgelemediği referans ses sınırlamaları ve gerçek fatura.

Kulaklık takan bir adam, bir senaryoyu okurken mikrofona konuşuyor

Bu makaledeki her çekimin başladığı gece vardiyası radyo çerçevesi, openai/gpt-image-2/text-to-image ile kalite yüksek, 2048x1152 olarak oluşturuldu

Bu tek kare, aşağıdaki tüm eğitimin girdisidir. openai/gpt-image-2/text-to-image ile kalite yüksek, 2048x1152 olarak oluşturuldu.

Son 8 saniyelik çekimi bitirip sessiz çıktığında ne hissettiğini düşün.

Klibi dışa aktardın. Bir TTS sekmesi açıp satırı yazdın. Ses kütüphanesinde yağmur ve oda tonu aradın. Hepsini bir zaman çizelgesine sürükleyip, ağız yalan söylemeyi bırakana kadar dalga formunu sağa sola kaydırdın. Sonra yine de ağzı düzeltmek için ayrı bir dudak senkronizasyon modeline para ödedin. Dört araç, üç wav dosyası, bir saat ve performans hâlâ dublajlı hissettirdi, çünkü öyleydi.

İşte MiniMax H3'ün sessizce sildiği zincir bu. "Sesi var" diye değil (birçok model bunu iddia ediyor), neredeyse hiç kimsenin test etmediği istek gövdesindeki bir yuva yüzünden: zaten sahip olduğun bir ses parçasını ücretsiz olarak verebilir ve sesi bir yüze geri alabilirsin.

Aşağıda, o yuvayı izole eden iki çekimli test, yerini aldığı her adımın gerçek fiyatları, isteğinizi reddedecek katı sınırlar ve gerçek fatura yer alıyor.

Önemli çıkarımlar

  • Tek bir çağrı, görüntü, diyalog, oda tonu ve dudak hareketini birlikte döndürür. Metin, görseller ve ses ayrı ayrı kodlanır, ardından tek bir Omni Transformer video ve ses gizli değişkenlerini birlikte tahmin eder (Hugging Face model kartı, Ağustos 2026).
  • Giriş sesi ücretsizdir. Giriş videosu ücretsiz değildir: MiniMax, referans videoyu çıktı oranından faturalandırır, bu nedenle aynı 15 saniyelik malzeme bir şarkı olarak 0$ ve bir video klibi olarak yaklaşık 1.95$ tutar.
  • Katı sınırlar: En fazla 3 ses klibi, her biri 2 ila 15 saniye, toplam 15 saniye ve ses asla tek başına gidemez. En az bir görüntü veya video ile birlikte olmalıdır.
  • Atlas Cloud'da 2K için saniyede 0.14$'dan, sesli 10 saniyelik bir çekimin tamamı 1.40$'a mal olur, bu da zaten oluşturduğunuz bir klibi düzeltmek için özel bir dudak senkronizasyon modeline saniyede 0.22$ ödemekten daha azdır.

Ses Açık: İki MiniMax H3 Dudak Senkronizasyonu ve Ses Çekimi, Altı Saniyelik Fark

Bunun için kulaklıklarınızı takın. Her iki yarı da aynı temel kareyi, aynı iki diyalog satırını ve kelimesi kelimesine aynı istemi aldı. Sadece biri önce altı saniyelik bir ses kaydı duydu.

fXlyer__czg

Ses açık ve kulaklık kullanın: sol yarı (Çekim A, referans ses yok) sol kulağınızda, sağ yarı (Çekim B, 6 saniyelik referansla) sağ kulağınızda çalar. Aynı kare, aynı satırlar, aynı istem. Her iki çekim: minimax/h3/reference-to-video, 2K, 10 saniye, 2560x1440, 24fps, 32 kHz stereo parça olarak teslim edildi.

Çekim A'nın istemde "sakin, alçak, manyetik erkek yayın sesi" kelimelerinden başka dayanağı yoktu, bu yüzden bir ses icat etti. Çekim B'ye tamamen farklı bir cümlenin 6.19 saniyesi verildi ve yalnızca bir tını çapası olarak ele alması söylendi. Daha sonra hiçbir çekim dublajlanmadı. Hiçbiri bir dudak senkronizasyon modeline yaklaşmadı. Her ikisinde de ağız, modelin ürettiği sesi takip eder çünkü ağız ve ses birlikte üretildi.

Tınıyı benim sözüme güvenmek yerine kendi kulaklarınızla değerlendirin. Gerçek olarak ifade edebileceğim şey mekanizma, ayarlar ve fatura ve bunlar sırada.

MiniMax H3 Dudak Senkronizasyonu ve Sesi Neden Herkesin Altı Adımlı Dublaj Zincirini Kırdı?

Eski zincir asla gerçekten bir iş akışı değildi. Bir onarım işiydi.

ImGr2NgcCCY

Ses açık. Gece bir sirk çadırının içinde birbirleriyle konuşan 3D animasyonlu bir kurbağa ve bukalemun, diyaloğun altında muhafazanın ambiyansı var. MiniMax için yerel sesli bir referans klibi. Animasyon karakterlerdeki ağız şekilleri taklit edilmesi en zor durumdur, bu yüzden bu 20 saniyelik dikkatinize değer.

Üç şey sürekli bozuluyordu ve bunlar kötü şanstan ziyade yapısal nedenlerle bozuluyordu.

Zaman çizelgesi sizin ellerinizdeydi. Bir video modeli size kareler verdi. Bir TTS modeli size bir dalga formu verdi. Hiçbir çıktı diğeri hakkında bir şey bilmiyordu, bu nedenle hizalama, saniyede 30 kare, gözle, saat 1'de yapılan insan yargısıydı. Her yeniden oluşturma bu yargıyı yeniden başlattı.

Yama tipi dudak senkronizasyonunun bir tavanı var. Özel bir dudak senkronizasyon modeli, yalnızca zaten var olan görüntülerin ağız bölgesine sahiptir. Ağzı sesle uyumlu hale getirebilir. Sert bir ünsüzden önce çeneyi gerebilir, bir satırdan önce nefes alabilir veya cümle bittiğinde omuzların düşmesine izin veremez, çünkü bu kareler, kimse karakterin ne söyleyeceğini bilmeden önce oluşturulmuştur. Doğruluk elde edersiniz, ancak performans alamazsınız, bu da tekinsiz olarak okunur.

Ses tasarımı ikinci bir projeydi. Yağmur, oda tonu, sandalye gıcırtısı, diyaloğun altında oturan bir bas hattı. Hepsi farklı bir kaynaktan geldi ve üzerine yapıştırılan bir sese karşı dengelenmesi gerekiyordu.

Ses VAE'si Size MiniMax H3 Dudak Senkronizasyonu ve Ses Hakkında Ne Söylüyor?

İşte pazarlama dili olmayan kısım, çünkü bir dosya adında görebilirsiniz.

H3'te metin, H3-Kodlayıcı'dan geçer, görsel girdiler hem H3-Kodlayıcı'dan hem de H3-GörselVAE'den geçer ve ses yalnızca bağımsız bir H3-SesVAE'den geçer. H3-Omni-Dönüştürücü daha sonra video ve ses gizli değişkenlerini birlikte tahmin eder ve bunlar video ve stereo ses olarak ayrı ayrı çözülür. SesVAE, sol ve sağ kanallar arasında bir kodlayıcı ve bir kod çözücü paylaşır, her birini bağımsız olarak işler, stereo için yeniden birleştirir ve 32 kHz sesi 40 Hz'lik bir zamansal hızda bir gizli belirteç dizisine sıkıştırır (Hugging Face model kartı).

ComfyUI 0. gün desteğini gönderdiğinde, bu mimari VAE klasöründe iki ayrı dosya olarak göründü: minimax_h3_video_vae_fp16.safetensors ve minimax_h3_audio_vae_fp32.safetensors, bir video yolu ve bir ses yolu alan bir çift VAE yükleyici tarafından yüklenir (ComfyUI blogu, Ağustos 2026). Ses, modelin etrafında inşa edildiği bir modalitedir, sonuna eklenmiş bir son işlem değil.

Lider tabloları, bunun nerede göründüğü konusunda hemfikirdir. Artificial Analysis, H3'ü 5.043 kör tercih örneğinden 1.130 Elo ile ses içeren video düzenleme lider tablosunda birinci sıraya koyarken, hem metin-video hem de görüntü-video'da ilk üçe yerleştirdi (Artificial Analysis, Temmuz 2026). Bu belirli sıralamada "çok iyi resim" ile "birincilik" arasındaki fark sestir.

MiniMax H3 Dudak Senkronizasyonu ve Ses İş Akışı, Yerini Aldığı Zincire Karşı Fiyatlandırıldı

Bunu değerlendirmenin dürüst yolu hisler değildir. Bitmiş 10 saniyelik bir çekim için gerçek saniye başına oranları kullanarak eski zinciri adım adım fiyatlandırmak ve ardından yenisini fiyatlandırmaktır.

#Eski zincir, adım adımNe çalıştırdıBu adımın maliyetiMiniMax H3 dudak senkronizasyonu ve sesi ile
1Sessiz resmi oluşturbir video modeli, örn. bytedance/seedance-2.0 $0.112/s$1.12aynı tek çağrı
2Satırları seslendirminimax/speech-2.6-hdyaklaşık 250 karakter için $0.02aynı tek çağrı
3Müziği bul veya yapminimax/music-2.6parça başına $0.15aynı tek çağrı
4Ambiyans ve nokta efektlerini katmanlases kütüphanesi artı sizin ellerinizakşamınızaynı tek çağrı
5Her şeyi zaman çizelgesinde hizaladüzenleyici artı sizin ellerinizakşamınızmevcut değil
6Miksdüzenleyici artı sizin ellerinizakşamınızmevcut değil
7Ağzı yamasync/lipsync-v3 $0.22/s$2.20mevcut değil
Toplam4 model artı 2 manuel geçişyaklaşık 3.49$ artı akşamınız1 çağrı, 1.40$
  1. satırı iki kez okuyun. Zaten oluşturduğunuz bir klibin ağzını yamamak saniyede 0.22$'a mal olurken, tüm çekimi sesi, ambiyansı ve ağız hareketiyle birlikte oluşturmak saniyede 0.14$'a mal olur. Yama orijinalinden daha pahalıdır. Bu tek karşılaştırma tüm argümandır.

Kimsenin bahsetmediği asimetri: kendi sesiniz ücretsiz, kendi videonuz ücretsiz değil.

MiniMax'ın kullandıkça öde fiyatlandırma tablosu, girdi malzemesini çıktıdan ayrı olarak listeler. H3 için ses girişi Ücretsizdir. İlk beş giriş görüntüsü ücretsizdir ve sonrakilerin her biri 0.04$'dır. Giriş videosu, çıktı çözünürlüğünün oranında giriş klibinin süresine göre faturalandırılır, bu da 2K'da saniyede 0.13$'dır (MiniMax fiyatlandırma belgeleri, 3 Ağustos 2026'da kontrol edildi). Bu nedenle, aynı 15 saniyelik referans malzeme bir şarkı, bir ses notu veya müşteri tarafından sağlanan bir VO olarak hiçbir şeye mal olmazken, bir video klibi olarak yaklaşık 1.95$'a mal olur.

İnşa etme şeklinizi değiştirmesi gereken çizgi budur. Referans ses, modeldeki en ucuz kontrol yüzeyidir ve kimsenin test etmediğidir.

Referans girdisiNe kadarKlip başınaToplamFaturalandırma (MiniMax)
Görüntü9'a kadaryokyokilk 5 ücretsiz, sonra her biri 0.04$
Video3'e kadar2 ila 15smaks. 15sçıktı oranından faturalandırılır, 2K'da 0.13$/s
Ses3'e kadar2 ila 15smaks. 15sÜcretsiz
Herhangi bir karışımmaks. 12 dosyayokyokyukarıdaki gibi, türe göre
Kendi başına sesizin verilmez. Sese görüntü veya video girişi eşlik etmelidir ve tek girdi olarak kullanılamaz

Model kartındaki H3-Base-Ref2VA spesifikasyonundan sınırlar. Atlas Cloud şeması minimax/h3/reference-to-video için aynı şeyi kendi sözcükleriyle söyler: "En az bir görüntü VEYA video gereklidir (yalnızca ses izin verilmez)."

Atlas tarafında sayacın iki dipnotu, her ikisi de belge sayfasından değil, kendi çalıştırmalarımdan. Atlas, her üç H3 bitiş noktası için çıktı saniyesi başına tek bir sabit 0.14$ faturalandırır ve eklediğim bir referans video, bunun üzerine ayrı bir ücret eklemedi. Bu bir gözlemdir, bir politika değil, bu nedenle MiniMax kuralı için bütçe ayırın ve sabit oranı bir bonus olarak değerlendirin. Atlas ayrıca resolution: "768P" kabul eder ve aynı 0.14$'dan faturalandırır; bu, burada değil, MiniMax H3 API fiyatlandırma dökümünde okumaya değer bir tutarsızlıktır.

Aşağıdaki her şey Atlas Cloud üzerinde bir tarayıcı sekmesinde çalışır: temel kare, ses referansı ve her iki H3 çekimi, tek bir API anahtarı ve tek bir yoklama döngüsü ile. Üç H3 bitiş noktası yalnızca girdilerinin şeklinde farklılık gösterir, bu nedenle refers image olur ve düz metin haline gelir ve kodunuzda başka hiçbir şey değişmez.

MiniMax H3 Dudak Senkronizasyonu ve Ses, Adım Adım

Beş adım. İkisi ucuz kurulum, ikisi gerçek test ve sonuncusu başarısız olmak üzere tasarlandığı için hiçbir şeye mal olmaz.

Adım 1: GPT Image 2 ile Temel Kareyi Oluşturun

Demo, bir gece vardiyası radyo sunucusudur ve tek bir nedenden dolayı seçilmiştir: ağzın yakın çekimi, dudak senkronizasyonunu gerçekten değerlendirebileceğiniz tek çerçevedir. Geniş bir çekim, modelin hile yapmasına izin verir.

Bu istemde iki şey tartışılmaz. Ağız, bir kelimenin ortasında hafifçe açık olmalıdır, böylece ilk kare zaten konuşma olarak okunur ve karede hiçbir yerde metin olmamalıdır, böylece daha sonraki dinamik altyazılar, gömülü harflerle savaşmaz.

plaintext
1Fotogerçekçi sinematik kare, 16:9, gece vardiyası radyo stüdyosu, otuzlu yaşlarının sonlarında bir adamın bom kolunda eski bir gümüş kondenser mikrofona yaslandığı, köpük rüzgarlığın dudaklarından birkaç santim uzakta olduğu, kulaklığın bir kulağından yarı çıktığı sıkı göğüs yukarısı çerçeveleme. Kamera-solundan gelen sıcak tungsten masa lambası elmacık kemiğini oyuyor; arka planda omzunun arkasında odak dışında yanan kırmızı bir neon YAYINDA işareti ve alt ön planda miksaj masası fader'larına kızıl akıyor. Sağdaki stüdyo penceresinde yağmur çizgileri, şehir ışıkları bokeh'e bulanmış. Lamba huzmesinde süzülen ince sigara dumanı. Kelime ortasında hafifçe açık ağız, gözler kağıt bir senaryoya doğru aşağıda. 35mm'de çekilmiş, sığ alan derinliği, ince film greni, derin gölgeler, karede hiçbir yerde metin yok.
2

openai/gpt-image-2/text-to-image üzerinde ayarlar: kalite yüksek, boyut 16:9, 2048x1152, bir görüntü. Model listesindeki 0.009$, bir belirteç katmanı tabanıdır, ödediğiniz değil. Bu boyut ve kalitede Çalıştır düğmesi çizim başına 0.1745$ olarak fiyatlandırır, bunu aşağıdaki ekran görüntüsünde okuyabilirsiniz.

İstem ve oluşturulan çıktısını gösteren AI görüntü oluşturucu arayüzü

Atlas Cloud'da GPT Image 2, radyo kabini istemi yazılmış, kalite yüksek ve 16:9 2048x1152 seçilmiş ve OUTPUT panelinde bitmiş temel kare oluşturulmuş_GPT Image 2 Atlas Cloud'da: yukarıdaki tam istem, kalite yüksek, 16:9, 2048x1152 ve OUTPUT'ta aynı karenin ikinci bir çizimi._

Adım 2: Altı Saniyelik Ses Referansını Oluşturun

İnsanların yanlış yaptığı adım budur, bu nedenle istemden önce mantığı okuyun.

Referans ses, videoda istediğinizden farklı bir cümle söylemelidir. Bu bir tını çapasıdır, başka bir şey değil. Satırlar istemden gelir. MiniMax'ın kendi referans-video örneği bu ayrımı açıkça belirtir: bir klibi müzik için kısmen yeniden kullanılacak kaynak parça, ikinci bir klibi ise yalnızca "ses tını referansı" olarak etiketler ve yeni diyalog istemde satır içi yazılır. Referansınız istediğiniz kelimeleri söylüyorsa, modeli sesi aktarmak yerine parçayı kopyalamaya davet ediyorsunuz demektir.

plaintext
1Night Line, doksan bir nokta dört'ü dinliyorsunuz ve sabahın üçüne yaklaşıyor.
2

minimax/speech-2.6-hd üzerinde ayarlar: herhangi bir sakin, alçak erkek sesi işe yarar ve ben Manyetik Sesli Erkek (English_magnetic_voiced_man) seçtim. Çekimin 2 ila 15 saniyelik pencereye fazlasıyla sığması için speed değerini 0.95 olarak ayarlayın, vol değerini 1.0'da bırakın ve mp3 çıktısını koruyun. Model, 1.000 karakter başına 0.08$'dır, 0.10$'dan düşürülmüş, Ağustos 2026 itibarıyla geçerli olan %20 indirim. Satırım 6.19 saniye olarak geldi ve 0.00792$ faturalandırdı.

Metin girişi ve ses dalga formu çıktısı olan ses oluşturucu arayüzü

Atlas Cloud'da MiniMax Speech 2.6 HD, referans satırı metin alanına yazılmış ve OUTPUT panelinde oluşturulan ses dalga formu

MiniMax Speech 2.6 HD Atlas Cloud'da: bir satır girdi, kısa bir mp3 çıktı, Çalıştır düğmesinde %20 indirim görünüyor. Ekran görüntüsü varsayılan Anlatıcı sesiyle alındı, bu nedenle çalıştırmadan önce Ses seçicisini Manyetik Sesli Erkek olarak değiştirin ve Hızı 0.95'e düşürün.

Adım 3: Referans Ses ile MiniMax H3 Dudak Senkronizasyonu ve Sesini Çalıştırın

Şimdi her iki dosya da refers içine birlikte gider: Adım 1'den kare ve Adım 2'den mp3. Bu, Çekim B'dir.

İstem, H3'ün eğitildiği bölümlenmiş yapıyı kullanır. subject_definitions referansların kim ve ne olduğunu adlandırır, detailed_description diyaloğu <d>[English] ...</d> etiketleri içinde taşır ve iki ses bölümü miksi tanımlar. Bölüm adları size yeni geliyorsa, MiniMax H3 istem kılavuzu tam yapıyı kapsar. Ses çalışması için yalnızca üç alan önemlidir ve hepsi burada.

plaintext
1subject_definitions:
2<Subject 1>, <Picture 1>'deki radyo mikrofonundaki adamdır, otuzlu yaşlarının sonlarında, kulaklık bir kulağından yarı çıkmış, arkasında kırmızı neon YAYINDA.
3<Picture 1>, hedef videonun açılış karesidir.
4<Audio 2>, <Subject 1> için ses tını referansıdır: sakin, alçak, manyetik bir erkek yayın sesi. Yalnızca tınıyı referans alın; sözcüklerini yeniden kullanmayın.
5
6summary:
7[görüntü referansı + ses tını referansı] 10 saniyelik tek bir sürekli yakın çekim. <Subject 1>, <Audio 2>'nin ses tınısında iki satırı doğrudan mikrofona söylerken, kamera yavaşça içeri doğru iter. Ağız hareketi, her satırdan önceki nefes ve oda tonu birlikte oluşturulur.
8
9detailed_description:
10Çekim tam olarak <Picture 1> ile açılır. Kamera-solundan sıcak tungsten, ön plandaki miksaj masasına akan kırmızı neon, arkadaki pencerede yağmur. <Subject 1> kısa bir nefes alır, rüzgarlığa doğru birkaç derece eğilir ve konuşur: <d>[English] Saat sabahın üçü ve kimin hâlâ uyanık olduğunu tam olarak biliyorum.</d> Konuşurken çenesi ve dudakları her heceyle doğal bir şekilde hareket eder; "three" ve "morning" kelimelerindeki patlamalı sesler görünür. Senaryoya doğru aşağı bakar, sonra lensin yanından yukarı bakar ve devam eder: <d>[English] O halde bunu aramızda tutalım.</d> Sesi tam olarak durduğunda dudakları kapanır ve burnundan nefes verir. Boyunca kamera tek bir yavaş, kasıtlı bir içe doğru itme gerçekleştirir; neon, yedinci saniye civarında bir kez hafifçe titrer. Ekranda metin yok.
11
12overall_soundscape:
13Yakın, kuru, kabin işlemli ses, mikrofondan bir miktar yakınlık efektiyle. Altında: masadan düşük bir elektrik uğultusu, cama karşı sabit yağmur, ıslak sokaktan geçen uzak bir araba, içeri doğru eğilirken sandalyenin yumuşak gıcırtısı ve her satırdan önce tek bir duyulabilir nefes.
14
15non_diegetic_music:
16Seyrek, yavaş bir gece geç saat caz kontrbası, çok sessiz, sesin iyice altında, ikinci saniye civarında girer ve diyaloğun üzerine asla çıkmaz.
17

minimax/h3/reference-to-video üzerinde ayarlar: çözünürlük 2K, süre 10, en boy oranı 16:9 ve refers her iki dosyayı da tutar. Dizi içindeki sıra önemli değildir, yalnızca en az birinin görüntü veya video olması önemlidir. Süre kaydırıcısı varsayılan olarak 8'dir, bu nedenle hareket ettirin ve istediğiniz kareyi istiyorsanız En Boy Oranını adaptive dışına çevirin.

Bana paraya mal olan dört parametre tuzağı. Anahtar ratio, aspect_ratio değil ve yanlış yapmak 400 döndürür. duration değerini her zaman açıkça gönderin, çünkü şema varsayılanı 8 der ancak onsuz bir istek 5 saniyelik bir dosya olarak döndü. Bu bitiş noktasında, refers ile birlikte image göndermek tamamlanır, tam olarak faturalandırılır ve sessizce birini düşürür. Ve sesi base64 veri URL'si olarak iletirseniz, data:audio/mp3 olarak etiketleyin, data:audio/mpeg olarak değil. İlk denemem tam olarak şunda başarısız oldu:

plaintext
1content[2].audio_url: invalid param: audio format ".mpeg" not allowed
2

Bu en azından ücretsizdir, bu da bizi sınırları öğrenmenin yararlı yoluna getirir.

Metin istemi girişi ve video çıktısı gösteren AI video oluşturucu arayüzü

Atlas Cloud'da MiniMax H3 reference-to-video oyun alanı, Referans Materyalleri'nde 1. yuvada mp3 ve 2. yuvada temel kare, çözünürlük 2K ve OUTPUT panelinde oynatılan bitmiş klip

MiniMax H3 reference-to-video Atlas Cloud'da: Referans Materyalleri 2/9 okur, birinci yuvada mp3, ikinci yuvada kare, çözünürlük 2K, sağda bitmiş klip. Bu yakalama, oyun alanının varsayılan 8 saniyesinde çalıştırıldı, bu nedenle Çalıştır düğmesi 1.12$ der; yukarıdaki iki çekimim 10 saniyede, her biri 1.40$'da çalıştırıldı.

Adım 4: MiniMax H3 Dudak Senkronizasyonu ve Ses Kontrol Çekimini Çalıştırın

Bir girdiyi ve onunla ilgili her bahsi değiştirin. refers'ten mp3'ü çıkarın, böylece yalnızca görüntü kalır, <Audio 2> tanımını silin, özetten "<Audio 2>'nin ses tınısında" ifadesini kesin ve köşeli etiketi [görüntü referansı] olarak değiştirin. Başka hiçbir şey hareket etmez ve ayarlar aynı kalır: 2K, 10 saniye, 16:9.

Onu ikinci bir deneme yerine kontrol yapan şey budur. Modelin artık bir tını çapası yoktur, bu nedenle yazılı açıklamadan bir ses icat eder ve az önce uydurduğu sese dudak senkronizasyonu yapar. Her iki çekim de 10.13 saniyede geldi ve kuruşuna kadar 1.40$ faturalandırdı.

WnfqR2I-a-8

Ses açık. Kendi başına Çekim A: aynı kare, aynı satırlar, referans ses yok. Buradaki ses modelin icadıdır ve ağız hâlâ onu takip eder.

İki çekim, bir değişken. Bu, bu makaledeki en ucuz deney ve ses yuvasının gerçekte ne yaptığını size söyleyen tek deney.

Adım 5: MiniMax H3 Dudak Senkronizasyonu ve Sesini Bilerek Bozun

Son adım ücretsizdir ve gece saat 2'de hatayı tanımanız için bir kez yapmaya değer.

mp3'ü refers içine koyun ve başka hiçbir şey koymayın. Görüntü yok, video yok, sadece ses. Ardından gönderin.

plaintext
1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "minimax/h3/reference-to-video",
6    "prompt": "Bir radyo mikrofonundaki bir adam, rüzgarlığa iki satır söyler.",
7    "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}],
8    "resolution": "2K",
9    "duration": 10,
10    "ratio": "16:9"
11  }'
12

İşte bilmeye değer kısım, çünkü şemanın ima ettiği şey bu değil. Gönderme çağrısı, normal bir görev kimliği ve "status": "processing" ile HTTP 200 döndürür, bu nedenle saf bir istemci işe yaradığını düşünür. Yirmi üç milisaniye sonra görev ölüdür:

plaintext
1{
2  "status": "failed",
3  "error_code": 1010001,
4  "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video",
5  "latency_ms": 23
6}
7

Bu tahminde hiçbir price alanı görünmedi, bu nedenle hiçbir şeye mal olmadı. Pratik ders cüzdanınızla değil, kodunuzla ilgilidir: göndermede 200, başarı değildir. Kimliği yoklayın ve bir klibiniz olduğunu varsaymadan önce status'u kontrol edin.

MiniMax H3 Dudak Senkronizasyonu ve Sesini Zorlamanın Dört Yolu Daha

İki çekimli test, mümkün olan en küçük yararlı deneydir. İşte aynı yuvanın bir sonraki gideceği yer.

Tek çekim, birkaç dil. Kareyi, blokajı koruyun, <d>...</d> içindeki dil etiketini değiştirin ve tekrar çalıştırın. Ağız yeni dili takip eder, eskisini değil, çünkü ağız ve ses aynı ileri geçişten çıkar. Model kartı, 11 dil için kararlı diyalog desteğini listeler: Arapça, Çince, İngilizce, Fransızca, Almanca, İtalyanca, Japonca, Korece, Portekizce, Rusça ve İspanyolca ve daha fazlası değişen derecelerde desteklenir. Bu iki klip, aynı fragmanın iki farklı ses parçasıdır ve MiniMax ayrıca aynı kurulumdan bir Fransızca versiyon ve anlatımsız bir versiyon da kesti.

hj7ZId3KOKk

Ses açık. İngilizce seslendirme versiyonu: toz-turuncu bir gezegende bir astronot yakın çekimi, anlatım ve müzik resimle birlikte geliyor. Fragman çalışması, farklı bir ses ortamına sahip aynı üç istem alanıdır.

Hv62FGyBNPM

Ses açık. Japonca versiyonu, kare kare aynı fragman. Hiçbir şey yeniden dublajlanmadı ve ayrı bir VO oturumu yapılmadı.

Zaten sahip olduğunuz bir nakaratla şarkı söylemek. Ücretsiz giriş sesinin bir dipnot olmaktan çıktığı yer burasıdır. Mevcut bir nakaratı veya enstrümantal parçayı 15 saniye veya daha kısa sürede refers içine bırakın, performansı tanımlayın ve karakter buna göre performans sergiler. Getirdiğiniz müzik için ödeme yapmıyorsunuz.

zui3Zw_UWnY

Ses açık. Retro bir kamkorder görünümünde kesilmiş bir grup, sahne arkasından performansa, parça ve resim birlikte geliyor. Çoğu müzik videosu çalışmasının gerçekten istediği şekil budur.

İki kişinin konuşması, bir kişiden daha zordur. Yakın çekimde tek bir konuşmacı kolay durumdur, bu nedenle bu makale tam olarak bunu kullandı. İki karakter arasındaki diyalog için, MiniMax'ın kendi örneğinin yaptığı gibi, her bir <d> satırına <Subject 1> (S1) ve <Subject 2> (S2) ekleyerek bunları açıkça etiketleyin ve model sırayı veya atıfı yanlış aldığında yeniden denemeyi bekleyin. İki kişilik oyun başına iki çalıştırma bütçesi ayırın.

Tek bir kelime söylenmeden ambiyans. overall_soundscape kendi başına bir alandır ve hiç diyalog olmadan da çalışır. Camda yağmur, sandalye gıcırtısı, buzdolabı uğultusu, odanın kendisi. Bu, aynı bitiş noktasını meşru bir ASMR ve ambiyans aracı haline getirir ve ağzın hiç önemli olmadığı tek kullanımdır.

Kendi iki çekimimden dürüst bir sınır: aynı geçişli oluşturma, ağzın ve sesin aynı fikirde olduğu anlamına gelir ve karedeki her fiziksel detayın sesle aynı fikirde olduğu anlamına gelmez. Kısa bir süreye sıkıştırılmış uzun satırlar, belirsiz performans yönergeleri ve çok konuşmacılı sahnelerin tümü sonucu bozar. Klibinizi, tıpkı insan bir oyuncunun çekimini izleyeceğiniz gibi, göndermeden önce izleyin.

MiniMax H3 Dudak Senkronizasyonu ve Sesinin Bana Gerçek Maliyeti

Aşağıdaki her rakam, işlem sonrası çekilmiş gerçek bir hesaptaki gerçek bir ücrettir. Bir tahmindeki price alanı geç doldurulur, bu nedenle completed olana kadar yoklamak genellikle hiçbir şey döndürmez. Numarayı almak için kimliği yeniden getirin.

AdımModelNe çalıştıFaturalandırılan
1openai/gpt-image-2/text-to-image1 temel kare, kalite yüksek, 2048x1152$0.1745 (Çalıştır düğmesinde belirtilen)
2minimax/speech-2.6-hd99 karakter, 6.19s referans ses$0.01
3minimax/h3/reference-to-videoÇekim B, 10s, 2K, refers'te görüntü + ses$1.40
4minimax/h3/reference-to-videoÇekim A, 10s, 2K, yalnızca görüntü$1.40
5minimax/h3/reference-to-videoyalnızca ses isteği, 23ms'de başarısız oldu$0.00
Tüm deney, her iki çekimyaklaşık $2.98

İki muhasebe notu, çünkü dürüstlük bir dipnottan daha ucuzdur. Adım 3'teki hatalı audio/mpeg veri URL'si de hiçbir şeye mal olmadı, çünkü göndermede 400 verdi. Reddetmeler ücretsizdir, ancak bozuk bir girdiye sahip iyi biçimlendirilmiş bir istek ücretsiz değildir, bu nedenle sessizce 404 veren bir referans URL'si yine de tam olarak faturalandırılır. Ve Adım 3 ekran görüntüsündeki oyun alanı yakalaması, panelin varsayılan 8 saniyesinde üçüncü bir H3 çalıştırmasıdır ve tablonun üstüne 1.12$ faturalandırmıştır. Bu çalıştırma bu makale için vardır, deney için değil.

Daha yukarıdaki tabloda fiyatlandırılan eski zincir, bir 10 saniyelik çekim için yaklaşık 3.49$ artı bir akşam manuel hizalama idi. Bu, sesli iki tam 10 saniyelik çekim, kontrollü bir A/B ve kasıtlı olarak bozulmuş iki istekti, daha azına.

Bununla birlikte, H3, insanların ona vermeye çalışacağı birkaç iş için yanlış araçtır ve alternatifler daha ucuzdur.

Gerçekten istediğiniz şeyDoğru modelFiyatNeden
Bir portre artı mevcut bir ses dosyası, konuşan bir kafayabytedance/avatar-omni-human-v1.5$0.12/sAmaca yönelik ses-video ve çıktı uzunluğu sesinizi takip eder
Ağzının yeni bir dil konuşması gereken bitmiş bir klipsync/lipsync-v3$0.22/sH3 mevcut oluşturmanızı değiştirmez ve yama tam olarak bu modelin işidir
Konuşan bir kafadaki en ucuz ağız düzeltmesiveed/lipsync$0.013/sYaklaşık on kat daha ucuz ve yalnızca ağza dokunur, performansa değil
Tını, ambiyans ve müzikle birlikte tam bir yönlendirilmiş çekimminimax/h3/reference-to-video$0.14/sResim ve ses tek bir geçişten gelir, bu nedenle performans onarılmak yerine tasarlanır

Ses yerine karakter çalışmasında H3 ve en yakın rakibi arasında seçim yapıyorsanız, Seedance 2.5 karşılaştırması daha iyi bir okumadır. Ve açık ağırlıkların bunu ücretsiz yapıp yapmadığını merak ediyorsanız, hızlı yapmazlar: 2K hâlâ API tarafından gelir ve topluluk raporları, tüketici kartlarında 10 saniyelik 480p yerel oluşturmayı saniyeler yerine dakikalara koyar.

Sesler, Şarkılar ve Haklar Üzerine Dürüst Bir Not

Yüklemek ücretsizdir, kullanmak ücretsizdir anlamına gelmez. Yazmadığınız bir şarkı ve size ait olmayan bir ses, iki ayrı izindir ve hiçbiri, yükleme için sizden ücret almayan bir API tarafından verilmez. Kendi kayıtlarınızı, lisanslı müziğinizi veya kendinizin oluşturduğu sentetik bir sesi kullanın; Adım 2'nin yaptığı tam olarak budur.

Ayrıca, topluluk ağırlıkları, şu anda AB'yi, Birleşik Krallık'ı, Güney Kore'yi veya ABD'yi kapsamayan bölgesel sınırlamalar taşır ve bunun yerine resmi bir lisanslama kanalı açıktır. Bu daha uzun bir hikayedir ve MiniMax H3 açık ağırlıklar kılavuzunda anlatılmaktadır.

MiniMax H3 Dudak Senkronizasyonu ve Ses: Sıkça Sorulan Sorular

MiniMax H3 dudak senkronizasyonu ve sesi gerçekten aynı geçişte ses mi oluşturuyor, yoksa daha sonra mı dublajlanıyor?

Aynı geçiş. Metin H3-Kodlayıcı'dan, görseller H3-Kodlayıcı artı H3-GörselVAE'den ve ses bağımsız bir H3-SesVAE'den geçer. H3-Omni-Dönüştürücü, daha sonra ayrı ayrı resim ve 32 kHz stereo ses olarak çözülen video ve ses gizli değişkenlerini birlikte tahmin eder. Daha sonra hiçbir şey katmanlanmaz, bu nedenle ağız, nefes ve oda tonu aynı çekime aittir.

MiniMax H3 dudak senkronizasyonu ve sesine kendi şarkımı veya sesimi besleyebilir miyim ve bu ekstra ücrete tabi mi?

Evet ve hayır. MiniMax'ın kullandıkça öde tablosu, H3 ses girişini Ücretsiz olarak listeler. İzlenmesi gereken asimetri videodur: giriş videosu, çıktı oranından süresine göre faturalandırılır, 2K'da saniyede 0.13$, bu nedenle 15 saniyelik referans video yaklaşık 1.95$'a mal olurken, 15 saniyelik referans ses 0$'a mal olur.

MiniMax H3 dudak senkronizasyonu ve sesi neden yalnızca ses içeren bir isteği reddediyor?

Çünkü ses, tek başına gidemeyen tek referans türüdür. En az bir görüntü veya video eşlik etmelidir. H3-Base-Ref2VA spesifikasyonundan kalan sınırlar: 9'a kadar görüntü, 3'e kadar video ve 3'e kadar ses klibi, her video veya ses klibi 2 ila 15 saniye arasında, tür başına toplam 15 saniye ve tek bir istekte tüm türlerde maksimum 12 dosya.

MiniMax H3 dudak senkronizasyonu ve sesi tüm klip boyunca mı dayanır, yoksa sadece ilk satırda mı?

Nefes alma payı olan tek bir konuşmacı için, bir satırı indirip kaymak yerine klip boyunca dayanır. Üç şey onu bozar: kısa bir süreye uzun bir senaryo sıkıştırmak, belirsiz veya eksik performans yönergeleri ve modelin kimin ne zaman konuşacağına karar vermesi gereken çok konuşmacılı sahneler. Her satıra etiketli bir konuşmacı ve söylemesi için yeterli saniye verin.

MiniMax H3 dudak senkronizasyonu ve sesinin başka bir dil için yeniden dublajlanması gerekiyor mu?

Hayır. Diyalog işaretlemesi içindeki dil etiketini <d>[English] ...</d>'den <d>[Japanese] ...</d>'ye değiştirin ve aynı istemi tekrar çalıştırın. Ağız yeni sesle oluşturulur, bu nedenle eskisi yerine yeni dili eşleştirir. Model kartı, 11 dil için kararlı diyalog desteğini listeler.

MiniMax H3 dudak senkronizasyonu ve sesini yerel olarak çalıştırmak daha mı ucuz?

Klip başına daha ucuz, diğer her şekilde pahalı. Ağırlıklar açıktır, ancak 16GB tüketici kartlarında yerel çalıştırmaların topluluk raporları, 10 saniyelik 480p oluşturmayı dakikalar içinde ölçer, kendi kendine barındırma 768 kısa kenarda oluşturur ve 2K hâlâ API tarafı yeniden oluşturma adımından gelir. Topluluk lisansındaki bölgesel sınırlamaları ekleyin ve API, bitmiş iş için pragmatik yol olarak kalır.

En Yeni Modeller

Tüm Medya Yapay Zekâsı için Tek API.

Tüm modelleri keşfet