
Kadr radiowy z nocnej zmiany, od którego zaczyna się każde ujęcie w tym artykule, wygenerowany za pomocą openai/gpt-image-2/text-to-image, jakość wysoka, 2048x1152
To pojedyncze zdjęcie jest wejściem dla całego poniższego samouczka. Wygenerowano za pomocą openai/gpt-image-2/text-to-image, jakość wysoka, 2048x1152.
Pomyśl o ostatnim razie, gdy skończyłeś 8-sekundowe ujęcie i wyszło ciche.
Wyeksportowałeś klip. Otworzyłeś zakładkę TTS i wpisałeś kwestię. Przegrzebałeś bibliotekę dźwięków w poszukiwaniu deszczu i szumu pomieszczenia. Wciągnąłeś to wszystko na oś czasu i przesuwałeś przebieg w lewo i w prawo, aż usta przestały kłamać. Potem i tak zapłaciłeś osobnemu modelowi do synchronizacji ust, żeby naprawił usta. Cztery narzędzia, trzy pliki WAV, godzina, a efekt wciąż brzmiał jak dubbing, bo był.
Ten łańcuch to właśnie to, co MiniMax H3 po cichu usunął. Nie dlatego, że „ma audio” (wiele modeli to twierdzi), ale z powodu jednego pola w ciele żądania, którego prawie nikt nie testuje: możesz podać mu kawałek audio, który już posiadasz, za darmo, i odzyskać głos na twarzy.
Poniżej znajduje się test dwóch ujęć, który wyodrębnia to pole, rzeczywiste ceny każdego kroku, który zastępuje, twarde ograniczenia, które odrzucą twoje żądanie, oraz faktyczny rachunek.
Kluczowe wnioski
- Jedno wywołanie zwraca obraz, dialog, szum pomieszczenia i ruch ust razem. Tekst, obraz i dźwięk są kodowane osobno, a następnie pojedynczy Omni Transformer wspólnie przewiduje latenty wideo i audio (karta modelu Hugging Face, sierpień 2026).
- Wejściowe audio jest darmowe. Wejściowe wideo nie jest: MiniMax rozlicza wideo referencyjne według stawki wyjściowej, więc te same 15 sekund materiału kosztuje 0 $ jako piosenka i około 1,95 $ jako klip wideo.
- Twarde ograniczenia: maks. 3 klipy dźwiękowe, każdy od 2 do 15 sekund, łącznie 15 sekund, a dźwięk nigdy nie może być sam. Musi towarzyszyć mu co najmniej jeden obraz lub wideo.
- Przy 0,14 $ za sekundę dla 2K na Atlas Cloud, pełne 10-sekundowe ujęcie z dźwiękiem kosztuje 1,40 $, czyli mniej niż płacenie dedykowanemu modelowi synchronizacji ust 0,22 $ za sekundę za łatanie klipu, który już wyrenderowałeś.
Dźwięk włączony: Dwa ujęcia MiniMax H3 Lip Sync i Audio, jedna sześciosekundowa różnica
Słuchawki na uszach w tej części. Obie połowy dostały tę samą podstawową klatkę, te same dwie kwestie dialogowe i ten sam prompt, słowo w słowo. Tylko jedna z nich najpierw usłyszała sześciosekundowe nagranie głosu.
fXlyer__czg
Dźwięk włączony, używaj słuchawek: lewa połowa (Ujęcie A, bez referencyjnego audio) gra w lewym uchu, prawa połowa (Ujęcie B, z 6-sekundową referencją) w prawym. Ta sama klatka, te same kwestie, ten sam prompt. Oba ujęcia: minimax/h3/reference-to-video, 2K, 10 sekund, dostarczone jako 2560x1440 przy 24 kl./s ze ścieżką stereo 32 kHz.
Ujęcie A nie miało nic poza słowami „spokojny, niski, magnetyczny męski głos radiowy” w prompcie, więc wymyśliło głos. Ujęcie B otrzymało 6,19 sekundy zupełnie innego zdania i kazano mu traktować je wyłącznie jako kotwicę barwy. Żadne ujęcie nie było później dubbingowane. Żadne nie zbliżyło się do modelu synchronizacji ust. W obu przypadkach usta podążają za głosem, który wyprodukował model, ponieważ usta i głos zostały wyprodukowane razem.
Oceń barwę własnymi uszami, zamiast brać moje słowo za pewnik. To, co mogę stwierdzić jako fakt, to mechanizm, ustawienia i rachunek, a te pojawiają się dalej.
Dlaczego MiniMax H3 Lip Sync i Audio zniszczył sześcioetapowy łańcuch dubbingu
Stary łańcuch nigdy tak naprawdę nie był przepływem pracy. Był naprawą.
ImGr2NgcCCY
Dźwięk włączony. Animowana 3D ropucha i kameleon rozmawiające ze sobą w nocy w namiocie cyrkowym, z atmosferą pomieszczenia pod dialogiem. Klip referencyjny MiniMax dla natywnego audio H3. Kształty ust na animowanych postaciach są najtrudniejszym przypadkiem do sfałszowania, dlatego ten klip jest wart 20 sekund twojej uwagi.
Trzy rzeczy ciągle się psuły, i to ze względów strukturalnych, a nie z powodu pecha.
Oś czasu była w twoich rękach. Model wideo dał klatki. Model TTS dał przebieg. Nic w żadnym z wyjść nie wiedziało o drugim, więc dopasowanie było ludzkim osądem wykonywanym z szybkością 30 klatek na sekundę, na oko, o 1 w nocy. Każdy ponowny render zaczynał ten osąd od nowa.
Synchronizacja ust w stylu łatania ma swój sufit. Dedykowany model synchronizacji ust kontroluje tylko obszar ust w materiale, który już istnieje. Może sprawić, że usta będą zgodne z dźwiękiem. Nie może sprawić, że szczęka napię się przed twardą spółgłoską, ani wstawić oddechu przed kwestią, ani pozwolić, by ramiona opadły, gdy zdanie się kończy, ponieważ te klatki zostały wyrenderowane, zanim ktokolwiek wiedział, co postać powie. Otrzymujesz dokładność bez wykonania, co odbiera się jako niesamowite.
Projekt dźwięku był osobnym projektem. Deszcz, szum pomieszczenia, skrzypienie krzesła, linia basu pod dialogiem. Wszystko pochodziło z innego źródła i musiało być zrównoważone z głosem, który sam był naklejony.
Co VAE Audio mówi ci o MiniMax H3 Lip Sync i Audio
Oto część, która nie jest językiem marketingowym, ponieważ możesz ją zobaczyć w nazwie pliku.
W H3 tekst przechodzi przez H3-Encoder, wejścia wizualne przechodzą przez H3-Encoder i H3-VisualVAE, a audio przechodzi wyłącznie przez samodzielny H3-AudioVAE. H3-Omni-Transformer następnie wspólnie przewiduje latenty wideo i audio, które są dekodowane osobno do wideo i stereo audio. AudioVAE współdzieli jeden enkoder i dekoder dla lewego i prawego kanału, przetwarza każdy niezależnie, łączy je z powrotem dla stereo i kompresuje audio 32 kHz do sekwencji latentnych tokenów z tempem czasowym 40 Hz (karta modelu Hugging Face).
Gdy ComfyUI wypuściło wsparcie w dniu 0, ta architektura pojawiła się jako dwa osobne pliki w folderze VAE: minimax_h3_video_vae_fp16.safetensors i minimax_h3_audio_vae_fp32.safetensors, ładowane przez podwójny loader VAE, który przyjmuje ścieżkę wideo i ścieżkę audio (blog ComfyUI, sierpień 2026). Audio jest modalnością, wokół której zbudowano model, a nie post-processem doczepionym na końcu.
Rankingi zgadzają się co do tego, gdzie to widać. Artificial Analysis umieściło H3 na pierwszym miejscu w rankingu edycji wideo z audio na 1130 Elo z 5043 próbek w ślepych preferencjach, jednocześnie plasując go w pierwszej trójce zarówno w tekst-na-wideo, jak i obraz-na-wideo (Artificial Analysis, lipiec 2026). Różnica między „bardzo dobrym obrazem” a „pierwszym miejscem” w tym konkretnym rankingu to audio.
Przepływ pracy MiniMax H3 Lip Sync i Audio, wyceniony w porównaniu z łańcuchem, który zastępuje
Uczciwym sposobem oceny tego nie są odczucia. Jest nim wycena starego łańcucha krok po kroku, przy użyciu rzeczywistych stawek za sekundę dla 10-sekundowego gotowego ujęcia, a następnie wycena zamiennika.
| # | Stary łańcuch, krok po kroku | Co go uruchamiało | Koszt tego kroku | Z MiniMax H3 lip sync i audio |
|---|---|---|---|---|
| 1 | Renderowanie cichego obrazu | model wideo, np. bytedance/seedance-2.0 za 0,112 $/s | 1,12 $ | to samo pojedyncze wywołanie |
| 2 | Udźwiękowienie kwestii | minimax/speech-2.6-hd | około 0,02 $ za ~250 znaków | to samo pojedyncze wywołanie |
| 3 | Znalezienie lub stworzenie ścieżki | minimax/music-2.6 | 0,15 $ za utwór | to samo pojedyncze wywołanie |
| 4 | Nakładanie atmosfery i efektów punktowych | biblioteka dźwiękowa plus twoje ręce | twój wieczór | to samo pojedyncze wywołanie |
| 5 | Wyrównanie wszystkiego na osi czasu | edytor plus twoje ręce | twój wieczór | nie istnieje |
| 6 | Miks | edytor plus twoje ręce | twój wieczór | nie istnieje |
| 7 | Łatanie ust | sync/lipsync-v3 za 0,22 $/s | 2,20 $ | nie istnieje |
| Razem | 4 modele plus 2 ręczne przejścia | około 3,49 $ plus twój wieczór | 1 wywołanie, 1,40 $ |
Przeczytaj wiersz 7 dwa razy. Łatanie ust klipu, który już wyrenderowałeś, kosztuje 0,22 $ za sekundę, podczas gdy wygenerowanie całego ujęcia z jego głosem, atmosferą i ruchem ust kosztuje 0,14 $ za sekundę. Łatanie jest droższe niż oryginał. To jedno porównanie stanowi cały argument.
Asymetria, o której nikt nie wspomina: twoje własne audio jest darmowe, twoje własne wideo nie.
Tabela cenowa MiniMax pay-as-you-go podaje materiał wejściowy oddzielnie od wyjściowego. Dla H3 wejście audio jest darmowe. Pierwsze pięć obrazów wejściowych jest darmowych, a każdy kolejny kosztuje 0,04 $. Wejście wideo jest rozliczane według czasu trwania klipu wejściowego według stawki rozdzielczości wyjściowej, czyli 0,13 $ za sekundę przy 2K (dokumentacja cenowa MiniMax, sprawdzone 3 sierpnia 2026). Tak więc te same 15 sekund materiału referencyjnego kosztuje nic jako piosenka, notatka głosowa lub VO dostarczone przez klienta, a około 1,95 $ jako klip wideo.
To jest linia, która powinna zmienić sposób, w jaki budujesz. Referencyjne audio to najtańsza powierzchnia kontrolna w modelu, i jest to ta, której nikt nie testuje.
| Wejście referencyjne | Ile | Na klip | Razem | Rozliczenie (MiniMax) |
|---|---|---|---|---|
| Obraz | do 9 | n/d | n/d | pierwsze 5 darmowe, potem 0,04 $ za sztukę |
| Wideo | do 3 | 2 do 15 s | maks. 15 s | rozliczane według stawki wyjściowej, 0,13 $/s przy 2K |
| Audio | do 3 | 2 do 15 s | maks. 15 s | Darmowe |
| Dowolna mieszanka | maks. 12 plików | n/d | n/d | jak wyżej, według typu |
| Audio samo | niedozwolone. Audio musi być dołączone do obrazu lub wideo i nie może być jedynym wejściem |
Ograniczenia ze specyfikacji H3-Base-Ref2VA na karcie modelu. Schemat Atlas Cloud dla minimax/h3/reference-to-video mówi to samo własnymi słowami: "Wymagany jest co najmniej jeden obraz LUB wideo (samo audio jest niedozwolone)."
Dwie uwagi po stronie licznika Atlas, obie z moich własnych uruchomień, a nie ze strony dokumentacji. Atlas nalicza stałą stawkę 0,14 $ za wyjściową sekundę dla wszystkich trzech endpointów H3, a dołączone przeze mnie wideo referencyjne nie dodało osobnej opłaty na wierzchu. To jedna obserwacja, a nie polityka, więc zaplanuj budżet według reguły MiniMax i traktuj stałą stawkę jako bonus. Atlas akceptuje również resolution: "768P" i nalicza tę samą stawkę 0,14 $, co jest rozbieżnością wartą przeczytania w analizie cen API MiniMax H3 raczej niż tutaj.
Wszystko poniżej działa w jednej karcie przeglądarki na Atlas Cloud: klatka bazowa, referencja głosowa i oba ujęcia H3, na jednym kluczu API z jedną pętlą odpytywania. Trzy endpointy H3 różnią się tylko kształtem wejścia, więc refers staje się image staje się czystym tekstem i nic więcej w twoim kodzie się nie zmienia.
MiniMax H3 Lip Sync i Audio, krok po kroku
Pięć kroków. Dwa z nich to tania konfiguracja, dwa to właściwy test, a ostatni nic nie kosztuje, ponieważ jest zaprojektowany, by zawieść.
Krok 1: Zbuduj klatkę bazową za pomocą GPT Image 2
Demo to prezenter radiowy z nocnej zmiany, wybrany z jednego powodu: ciasne zbliżenie na usta to jedyne kadrowanie, w którym można faktycznie ocenić synchronizację ust. Szeroki plan pozwala modelowi oszukiwać.
Dwie rzeczy w tym prompcie są niepodlegające negocjacjom. Usta muszą być lekko otwarte w trakcie słowa, aby pierwsza klatka już była odbierana jako mowa, i w kadrze nie może być żadnego tekstu, aby późniejsze dynamiczne napisy nie walczyły z wbudowanym napisem.
plaintext1Fotorealistyczny filmowy kadr, 16:9, studio radiowe nocnej zmiany, ciasne kadrowanie od klatki piersiowej w górę 2mężczyzny po trzydziestce pochylającego się w stronę vintage'owego srebrnego mikrofonu pojemnościowego na wysięgniku, 3piankowy osłona przeciwwiatrowa cale od jego ust, słuchawki w połowie zdjęte z jednego ucha. Ciepła wolframowa lampa biurkowa 4z lewej strony kamery rzeźbi jego kość policzkową; czerwony neon ON AIR płonie nieostro za jego 5ramieniem i rozlewa się szkarłatem na suwaki miksera na pierwszym planie u dołu. Deszcz 6spływa po szybie studia po prawej, światła miasta rozmazane w bokeh. Cienki dym papierosowy unosi się 7przez snop lampy. Usta lekko otwarte w trakcie słowa, oczy w dół w stronę papierowego scenariusza. Zdjęcie na 835mm, płytka głębia ostrości, drobne ziarno filmowe, głębokie cienie, żaden tekst w kadrze. 9
Ustawienia na openai/gpt-image-2/text-to-image: jakość wysoka, rozmiar 16:9 przy 2048x1152, jeden obraz. 0,009 $ na liście modeli to niższy próg tokenów, a nie to, co płacisz. Przy tym rozmiarze i jakości przycisk Run podaje 0,1745 $ za rysunek, co możesz zobaczyć na zrzucie ekranu poniżej.

GPT Image 2 na Atlas Cloud z wpisanym promptem radiowej budki, jakość wysoka i 16:9 2048x1152, oraz gotowa klatka bazowa wyrenderowana w panelu OUTPUT. GPT Image 2 na Atlas Cloud: dokładnie powyższy prompt, jakość wysoka, 16:9 przy 2048x1152, oraz drugi rysunek tej samej klatki w OUTPUT.
Krok 2: Stwórz sześciosekundową referencję głosu
To krok, który ludzie wykonują źle, więc przeczytaj uzasadnienie przed promptem.
Referencyjne audio musi wypowiadać inne zdanie niż to, które chcesz w filmie. Jest kotwicą barwy, niczym więcej. Kwestie pochodzą z promptu. Własny przykład MiniMax referencyjnego do wideo wyraźnie rozdziela to: oznacza jeden klip jako źródłowy do częściowego wykorzystania w muzyce, a drugi klip wyłącznie jako „referencję barwy głosu”, z nowym dialogiem napisanym w prompcie. Jeśli twoja referencja mówi te same słowa, które zasugerowałeś, zapraszasz model do skopiowania ścieżki zamiast przeniesienia głosu.
plaintext1Słuchasz Night Line, dziewięćdziesiąt jeden cztery, i zbliża się 2trzecia nad ranem. 3
Ustawienia na minimax/speech-2.6-hd: dowolny spokojny niski męski głos działa, a ja wybrałem Magnetic-voiced Male (English_magnetic_voiced_man). Ustaw speed na 0.95, aby ujęcie zmieściło się w oknie 2–15 sekund z zapasem, pozostaw vol na 1.0, i zachowaj wyjście mp3. Model kosztuje 0,08 $ za 1000 znaków, obniżone z 0,10 $, 20% zniżki obowiązującej od sierpnia 2026. Moja kwestia wróciła na 6,19 sekundy i kosztowała 0,00792 $.

MiniMax Speech 2.6 HD na Atlas Cloud z referencyjną kwestią wpisaną w pole tekstowe i wyrenderowanym przebiegiem audio w panelu OUTPUT
MiniMax Speech 2.6 HD na Atlas Cloud: jedna kwestia wejściowa, jeden krótki plik mp3 na wyjściu, z 20% zniżką widoczną na przycisku Run. Zrzut ekranu został zrobiony na domyślnym głosie Expressive Narrator, więc przełącz selektor głosu na Magnetic-voiced Male i zmniejsz Speed do 0,95 przed uruchomieniem.
Krok 3: Uruchom MiniMax H3 Lip Sync i Audio z referencyjnym audio
Teraz oba pliki trafiają do refers razem: zdjęcie z Kroku 1 i mp3 z Kroku 2. To jest Ujęcie B.
Prompt używa sekcyjnej struktury, na której trenowano H3. subject_definitions nazywa, kto i co to są referencje, detailed_description zawiera dialog w tagach <d>[English] ...</d>, a dwie sekcje audio opisują miks. Jeśli nazwy sekcji są dla ciebie nowe, przewodnik po prompcie MiniMax H3 obejmuje pełną strukturę. Tylko trzy pola mają znaczenie dla pracy z dźwiękiem i wszystkie są tutaj.
plaintext1subject_definitions: 2<Subject 1> to mężczyzna przy mikrofonie radiowym na <Picture 1>, po trzydziestce, słuchawki 3w połowie zdjęte z jednego ucha, czerwony neon ON AIR za jego ramieniem. 4<Picture 1> to klatka otwierająca docelowe wideo. 5<Audio 2> to referencja barwy głosu dla <Subject 1>: spokojny, niski, magnetyczny męski 6głos radiowy. Referencja wyłącznie barwy; nie używaj ponownie jego słów. 7 8summary: 9[referencja obrazu + referencja barwy audio] Pojedyncze, ciągłe 10-sekundowe zbliżenie. <Subject 1> 10wypowiada dwie kwestie prosto do mikrofonu w barwie głosu <Audio 2>, podczas gdy 11kamera powoli napływa. Ruch ust, oddech przed każdą kwestią i szum pomieszczenia 12są generowane razem. 13 14detailed_description: 15Ujęcie otwiera się dokładnie na <Picture 1>. Ciepłe światło wolframowe z lewej strony kamery, czerwony neon rozlewający się na 16mikser na pierwszym planie, deszcz na szybie z tyłu. <Subject 1> bierze krótki oddech, 17pochyla się o kilka stopni w stronę osłony przeciwwiatrowej i mówi: <d>[English] Jest trzecia nad ranem, 18i wiem dokładnie, kto jeszcze nie śpi.</d> Gdy mówi, jego szczęka i usta poruszają się naturalnie przy 19każdej sylabie; plozywy na "three" i "morning" są widoczne. Spogląda w dół na scenariusz, 20potem z powrotem w górę, poza obiektyw, i kontynuuje: <d>[English] Więc zachowajmy to między nami.</d> 21Dokładnie w momencie, gdy jego głos cichnie, jego usta zamykają się i wydycha powietrze przez nos. Przez cały czas 22kamera wykonuje jeden powolny, celowy najazd; neon miga raz, słabo, około siódmej sekundy. 23Żaden tekst na ekranie. 24 25overall_soundscape: 26Bliski, suchy, studyjny głos z lekkim efektem bliskości od mikrofonu. Pod nim: 27niski szum elektryczny z biurka, deszcz nieustannie uderzający o szybę, jeden odległy samochód przejeżdżający 28mokrą ulicą, ciche skrzypienie krzesła, gdy się pochyla, i pojedynczy słyszalny oddech przed 29każdą kwestią. 30 31non_diegetic_music: 32Rzadki, powolny, późnonocny jazzowy kontrabas, bardzo cicho, znacznie pod głosem, wchodzący 33około drugiej sekundy i nigdy nie wznoszący się ponad dialog. 34
Ustawienia na minimax/h3/reference-to-video: rozdzielczość 2K, czas trwania 10, proporcje 16:9, a refers zawierający oba pliki. Kolejność w tablicy nie ma znaczenia, tylko że co najmniej jeden z nich jest obrazem lub wideo. Suwak Duration domyślnie ustawiony na 8, więc go przesuń, i przełącz Aspect Ratio z adaptive, jeśli chcesz ramkę, o którą prosiłeś.
Cztery pułapki parametrów, z których trzy kosztowały mnie pieniądze. Klucz to ratio, nie aspect_ratio, a jego błędne podanie zwraca błąd 400. Zawsze wysyłaj duration jawnie, ponieważ domyślna wartość schematu to 8, ale żądanie bez niego wróciło jako 5-sekundowy plik. Na tym endpointzie wysłanie image obok refers kończy się, jest w pełni rozliczane i cicho pomija jeden z nich. A jeśli przekażesz audio jako data URL w base64, oznacz go data:audio/mp3, nie data:audio/mpeg. Moja pierwsza próba zakończyła się dokładnie na tym:
plaintext1content[2].audio_url: invalid param: audio format ".mpeg" not allowed 2
Ten przynajmniej jest darmowy, co prowadzi nas do przydatnego sposobu na poznanie ograniczeń.

Playground MiniMax H3 reference-to-video na Atlas Cloud, z mp3 w slocie 1 i klatką bazową w slocie 2 Materiałów Referencyjnych, rozdzielczość 2K, oraz gotowy klip odtwarzany w panelu OUTPUT
MiniMax H3 reference-to-video na Atlas Cloud: Materiały Referencyjne pokazują 2/9 z mp3 w slocie pierwszym i zdjęciem w slocie drugim, rozdzielczość 2K, gotowy klip po prawej. Ten zrzut został wykonany przy domyślnych 8 sekundach playgroundu, dlatego przycisk Run pokazuje 1,12 $; moje dwa ujęcia powyżej działały przez 10 sekund za 1,40 $ każde.
Krok 4: Uruchom kontrolne ujęcie MiniMax H3 Lip Sync i Audio
Zmień jedno wejście i każdą jego wzmiankę. Usuń mp3 z refers, tak aby pozostał tylko obraz, usuń definicję <Audio 2>, wytnij frazę „w barwie głosu <Audio 2>” z podsumowania i zmień tag nawiasowy na [image reference]. Nic więcej się nie zmienia, a ustawienia pozostają identyczne: 2K, 10 sekund, 16:9.
To właśnie czyni z tego kontrolę, a nie drugą próbę. Model nie ma teraz kotwicy barwy, więc wymyśla głos z opisu pisemnego i synchronizuje usta z właśnie wymyślonym głosem. Oba ujęcia wróciły po 10,13 sekundy i kosztowały po 1,40 $ co do centa.
WnfqR2I-a-8
Dźwięk włączony. Ujęcie A samo: ta sama klatka, te same kwestie, brak referencyjnego audio. Głos tutaj jest wymysłem modelu, a usta wciąż za nim podążają.
Dwa ujęcia, jedna zmienna. To najtańszy eksperyment w całym tym artykule i jedyny, który mówi ci, co właściwie robi slot audio.
Krok 5: Celowo zepsuj MiniMax H3 Lip Sync i Audio
Ostatni krok jest darmowy i warto go wykonać raz, aby rozpoznać awarię o 2 w nocy.
Umieść mp3 w refers i nic więcej. Żadnego obrazu, żadnego wideo, tylko audio. Następnie wyślij.
plaintext1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Authorization: Bearer $ATLAS_API_KEY" \ 3 -H "Content-Type: application/json" \ 4 -d '{ 5 "model": "minimax/h3/reference-to-video", 6 "prompt": "Mężczyzna przy mikrofonie radiowym wypowiada dwie kwestie w stronę osłony przeciwwiatrowej.", 7 "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}], 8 "resolution": "2K", 9 "duration": 10, 10 "ratio": "16:9" 11 }' 12
Oto część warta poznania, ponieważ nie jest tym, co sugeruje schemat. Wywołanie submit zwraca HTTP 200 z normalnym identyfikatorem zadania i "status": "processing", więc naiwny klient myśli, że zadziałało. 23 milisekundy później zadanie jest martwe:
plaintext1{ 2 "status": "failed", 3 "error_code": 1010001, 4 "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video", 5 "latency_ms": 23 6} 7
Żadne pole price nie pojawiło się w tej prognozie, więc nic nie kosztowało. Praktyczna lekcja dotyczy twojego kodu, a nie portfela: 200 przy submit to nie sukces. Odpytywaj identyfikator i sprawdzaj status, zanim założysz, że masz klip.
Cztery kolejne sposoby na wykorzystanie MiniMax H3 Lip Sync i Audio
Test dwóch ujęć to najmniejszy użyteczny eksperyment. Oto, gdzie ten sam slot prowadzi dalej.
Jedno ujęcie, kilka języków. Zachowaj klatkę, zachowaj blokowanie, zmień tag językowy w <d>...</d> i uruchom ponownie. Usta podążają za nowym językiem, a nie starym, ponieważ usta i głos pochodzą z tego samego przejścia w przód. Karta modelu wymienia stabilne wsparcie dialogowe dla 11 języków: arabskiego, chińskiego, angielskiego, francuskiego, niemieckiego, włoskiego, japońskiego, koreańskiego, portugalskiego, rosyjskiego i hiszpańskiego, a więcej jest obsługiwanych w różnym stopniu. Te dwa klipy to ten sam zwiastun z dwiema różnymi ścieżkami głosowymi, a MiniMax wyciął również wersję francuską i wersję bez narracji z tego samego zestawu.
hj7ZId3KOKk
Dźwięk włączony. Angielska wersja z voice-over: zbliżenie astronauty na zapylonej pomarańczowej planecie, narracja i ścieżka dźwiękowa pojawiają się z obrazem. Praca nad zwiastunem to te same trzy pola promptu z innym soundscape'em.
Hv62FGyBNPM
Dźwięk włączony. Wersja japońska, klatka po klatce ten sam zwiastun. Nic nie zostało ponownie zdubbingowane i nie odbyła się osobna sesja VO.
Śpiewanie z haczykiem, który już posiadasz. To tutaj darmowe wejściowe audio przestaje być przypisem. Umieść istniejący haczyk lub instrumental w refers na 15 sekund lub mniej, opisz wykonanie, a postać wykonuje do niego. Nie płacisz za muzykę, którą wnosisz.
zui3Zw_UWnY
Dźwięk włączony. Zespół nagrany w retro stylu kamkordera, zza kulis do występu, ze ścieżką i obrazem pojawiającymi się razem. To kształt, jakiego większość prac nad teledyskami faktycznie chce.
Dwie osoby rozmawiające jest trudniejsze niż jedna. Pojedynczy mówca w zbliżeniu to łatwy przypadek, właśnie dlatego ten artykuł go użył. W przypadku dialogu między dwiema postaciami oznacz je jawnie, tak jak robi to własny przykład MiniMax, z <Subject 1> (S1) i <Subject 2> (S2) dołączonymi do każdej linii <d>, i spodziewaj się ponownego losowania, gdy model pomyli kolejność lub przypisanie. Przeznacz dwa uruchomienia na każdą scenę z dwoma postaciami.
Atmosfera bez słowa wypowiedzianego. overall_soundscape to osobne pole i działa bez żadnego dialogu. Deszcz na szybie, skrzypienie krzesła, szum lodówki, samo pomieszczenie. To czyni ten sam endpoint prawowitym narzędziem ASMR i atmosfery, i to jedyne zastosowanie, w którym usta nigdy nie mają znaczenia.
Jedno uczciwe ograniczenie z moich własnych dwóch ujęć: generowanie w jednym przebiegu oznacza, że usta i głos są zgodne, ale nie oznacza, że każdy fizyczny szczegół w kadrze jest zgodny z dźwiękiem. Długie kwestie upchnięte w krótkim czasie, niejasne wskazówki wykonawcze i sceny z wieloma mówcami pogarszają wynik. Obejrzyj swój klip przed wysłaniem, tak samo jak obejrzałbyś ujęcie od ludzkiego aktora.
Co faktycznie kosztowało mnie MiniMax H3 Lip Sync i Audio
Każda poniższa kwota to rzeczywista opłata na prawdziwym koncie, pobrana po fakcie. Pole price w prognozie wypełnia się późno, więc odpytywanie do completed często nic nie zwraca. Ponownie pobierz identyfikator, aby uzyskać liczbę.
| Krok | Model | Co działało | Rozliczone |
|---|---|---|---|
| 1 | openai/gpt-image-2/text-to-image | 1 klatka bazowa, jakość wysoka, 2048x1152 | 0,1745 $ (podane na przycisku Run) |
| 2 | minimax/speech-2.6-hd | 99 znaków, 6,19 s głosu referencyjnego | 0,01 $ |
| 3 | minimax/h3/reference-to-video | Ujęcie B, 10 s przy 2K, obraz + audio w refers | 1,40 $ |
| 4 | minimax/h3/reference-to-video | Ujęcie A, 10 s przy 2K, tylko obraz | 1,40 $ |
| 5 | minimax/h3/reference-to-video | żądanie tylko z audio, nie powiodło się po 23 ms | 0,00 $ |
| Cały eksperyment, oba ujęcia | około 2,98 $ |
Dwie uwagi księgowe, ponieważ uczciwość jest tańsza niż przypis. Zły adres URL audio/mpeg w Kroku 3 również nic nie kosztował, ponieważ zakończył się błędem 400 przy submit. Odrzucenia są darmowe, ale dobrze sformułowane żądanie z uszkodzonym wejściem nie jest, więc referencyjny URL, który cicho zwraca 404, nadal zostanie w pełni rozliczony. A zrzut ekranu playgroundu w Kroku 3 to trzecie uruchomienie H3 przy domyślnych 8 sekundach panelu, które doliczyło 1,12 $ do tabeli. To uruchomienie istnieje dla tego artykułu, a nie dla eksperymentu.
Stary łańcuch, wyceniony w tabeli powyżej, wynosił około 3,49 $ za jedno 10-sekundowe ujęcie plus wieczór ręcznego dopasowania. To były dwa kompletne 10-sekundowe ujęcia z dźwiękiem, kontrolowane A/B i dwa celowo zepsute żądania, za mniej.
Mimo to H3 jest złym narzędziem do kilku zadań, które ludzie będą próbować mu zlecić, a alternatywy są tańsze.
| Czego faktycznie chcesz | Właściwy model | Cena | Dlaczego |
|---|---|---|---|
| Jeden portret plus jeden istniejący plik audio, w głowę mówiącą | bytedance/avatar-omni-human-v1.5 | 0,12 $/s | Stworzony do audio-na-wideo, a długość wyjścia podąża za twoim audio |
| Gotowy klip, którego usta muszą mówić w nowym języku | sync/lipsync-v3 | 0,22 $/s | H3 nie modyfikuje twojego istniejącego renderu, a łatanie to dokładnie zadanie tego modelu |
| Najtańsza możliwa naprawa ust w głowie mówiącej | veed/lipsync | 0,013 $/s | Około dziesięć razy tańsze i dotyka tylko ust, a nie wykonania |
| Całe wyreżyserowane ujęcie, z barwą, atmosferą i ścieżką razem | minimax/h3/reference-to-video | 0,14 $/s | Obraz i dźwięk pochodzą z jednego przejścia, więc wykonanie jest projektowane, a nie naprawiane |
Jeśli wybierasz między H3 a jego najbliższym rywalem w kwestii postaci, a nie audio, porównanie Seedance 2.5 jest lepszą lekturą. A jeśli zastanawiasz się, czy otwarte wagi czynią to darmowym, nie czynią tego szybkim: 2K wciąż pochodzi ze strony API, a raporty społeczności podają lokalny render 480p 10 sekund w minutach, a nie sekundach na kartach konsumenckich.
Jedna uczciwa uwaga o głosach, piosenkach i prawach
Darmowe przesyłanie to nie to samo co darmowe użytkowanie. Piosenka, której nie napisałeś, i głos, który nie jest twój, to dwie oddzielne zgody, a żadna z nich nie jest udzielana przez API, które nie pobiera opłat za przesyłanie. Używaj własnych nagrań, licencjonowanej muzyki lub syntetycznego głosu, który sam wygenerowałeś, co dokładnie robi Krok 2.
Osobno, wagi społeczności niosą ograniczenia terytorialne, które obecnie nie obejmują UE, Wielkiej Brytanii, Korei Południowej ani USA, a zamiast tego dostępny jest formalny kanał licencjonowania. To dłuższa historia, opisana w przewodniku po otwartych wagach MiniMax H3.
MiniMax H3 Lip Sync i Audio: Najczęściej zadawane pytania
Czy MiniMax H3 naprawdę generuje dźwięk w tym samym przejściu, czy jest dubbingowany później?
To samo przejście. Tekst przechodzi przez H3-Encoder, obraz przez H3-Encoder plus H3-VisualVAE, a audio przez samodzielny H3-AudioVAE. H3-Omni-Transformer wspólnie przewiduje latenty wideo i audio, które są następnie dekodowane osobno do obrazu i stereo audio 32 kHz. Nic nie jest nakładane później, dlatego usta, oddech i szum pomieszczenia należą do tego samego ujęcia.
Czy mogę podać własną piosenkę lub głos do MiniMax H3 i czy to kosztuje dodatkowo?
Tak i nie. Tabela cenowa MiniMax pay-as-you-go podaje wejście audio H3 jako darmowe. Asymetrią, na którą należy uważać, jest wideo: wejście wideo jest rozliczane według czasu trwania według stawki wyjściowej, 0,13 $ za sekundę przy 2K, więc 15 sekund wideo referencyjnego kosztuje około 1,95 $, podczas gdy 15 sekund audio referencyjnego kosztuje 0 $.
Dlaczego MiniMax H3 odrzuca żądanie, które ma tylko audio?
Ponieważ audio to jedyny typ referencji, który nie może podróżować sam. Musi mu towarzyszyć co najmniej jeden obraz lub wideo. Pozostałe ograniczenia, ze specyfikacji H3-Base-Ref2VA: do 9 obrazów, do 3 wideo i do 3 klipów audio, każdy klip wideo lub audio od 2 do 15 sekund, łącznie 15 sekund na typ, i maksymalnie 12 plików wszystkich typów w jednym żądaniu.
Czy MiniMax H3 utrzyma synchronizację przez cały klip, czy tylko przy pierwszej kwestii?
Dla pojedynczego mówcy z przestrzenią na oddech utrzymuje się przez cały klip, a nie ląduje na jednej kwestii i dryfuje. Trzy rzeczy to psują: upchnięcie długiego scenariusza w krótkim czasie, niejasne lub brakujące wskazówki wykonawcze oraz sceny z wieloma mówcami, gdzie model musi zdecydować, kto mówi kiedy. Daj każdej kwestii oznakowanego mówcę i wystarczająco dużo sekund, by ją wypowiedzieć.
Czy MiniMax H3 wymaga ponownego dubbingu dla innego języka?
Nie. Zmień tag językowy w znacznikach dialogu, z <d>[English] ...</d> na <d>[Japanese] ...</d>, i uruchom ten sam prompt ponownie. Usta są generowane z nowym głosem, więc pasują do nowego języka zamiast starego. Karta modelu wymienia stabilne wsparcie dialogowe dla 11 języków.
Czy taniej jest uruchomić MiniMax H3 lokalnie?
Tańsze na klip, drogie pod każdym innym względem. Wagi są otwarte, ale raporty społeczności dotyczące lokalnych uruchomień na 16 GB kartach konsumenckich mierzą 10-sekundową generację 480P w minutach, self-hosting renderuje w krótkim boku 768, a 2K wciąż pochodzi z etapu regeneracji po stronie API. Dodaj ograniczenia terytorialne w licencji społeczności i API pozostaje pragmatyczną ścieżką dla gotowej pracy.






