
Nocne studio kolorów, sześć monitorów pokazujących sześć różnych ujęć tej samej srebrnowłosej piosenkarki_Sześć_ ujęć, jedna artystka, jedna piosenka. Wygenerowane przy użyciu openai/gpt-image-2/text-to-image .
Użytkownicy Suno generują około 7 milionów piosenek dziennie, mniej więcej cały katalog Spotify co dwa tygodnie (TechCrunch, luty 2026). Prawie żadna z nich nigdy nie będzie miała dołączonego obrazka. Nie dlatego, że obrazek jest niemożliwy, ale dlatego, że tradycyjna ścieżka prowadzi przez cztery narzędzia: wygeneruj nieruchome obrazy, ożyw je, wykonaj osobny przebieg synchronizacji ust, a potem napraw wszystko w montażu. Każdy przeskok gubi twarz, ubiór lub rytm.
Więc pominąłem przeskoki. Wrzuciłem 8-sekundowy wycinek refrenu prosto w slot referencyjny modelu wideo i nacisnąłem Run. Nie obciążyło mnie to żadnym kosztem za audio.
Następnie rozłożyłem gotowy plik mp4 na części, aby odpowiedzieć na jedno pytanie, na które nikt w internecie nie odpowiada wprost: czy dźwięk wychodzący z modelu to moja piosenka, czy coś, co wymyślił i brzmi podobnie? Zmierzyłem to. Odpowiedź nie jest taka, jakiej się spodziewałem, i zmienia sposób, w jaki powinieneś to ciąć.
Kluczowe wnioski
- Audio referencyjne jest darmowe. MiniMax H3 rozlicza tylko sekundy wyjściowe. Moje cztery 8-sekundowe wycinki referencyjne dodały $0.00 do rachunku. Referencyjne wideo jest drogie.
- 15 sekund to limit na pojedynczą generację, a nie na cały projekt. Potnij piosenkę, wyślij jeden kawałek na ujęcie, połącz. Mój 32-sekundowy montaż to cztery generacje.
- Napisz haczyk w tempie 120 BPM. Jeden takt to dokładnie 2.000 sekund, więc wartości
durationH3 w pełnych sekundach trafiają na linie taktowe bez ręcznego dostrajania. 8s = 4 takty.- Wyjściowe audio to Twój utwór, dopasowany do próbki. Zmierzyłem korelację przebiegu 0,892 przy zerowym opóźnieniu między moim wejściowym wycinkiem a dostarczoną przez H3 stereofoniczną mieszanką. Nie jest regenerowane. Nadal warto nałożyć master na końcowy montaż, z innego powodu (poniżej).
- Całkowity rzeczywisty wydatek: $7.53 w przypadku dziewięciu generacji, wliczając nieudane. Cztery ujęcia, które trafiły do finalnego montażu, plus piosenka i podstawowa ramka, kosztowały $4.80.
Teledysk MiniMax H3, który wyciąłem z jednego 32-sekundowego haczyka
Włącz dźwięk. To cztery oddzielne generacje, połączone bez przejść, z oryginalnym 32-sekundowym masterem nałożonym na wierzch.
TfrOvWHf4ys
"MIRA", 32 sekundy, 2560x1440, 24 kl./s. Cztery generacje minimax/h3/reference-to-video po 8 sekund każda, $1.12 za ujęcie. Piosenka weszła jako audio referencyjne i kosztowała $0.00.
Cztery generacje, cztery zupełnie różne światy oświetleniowe, jedna twarz. Nic nie było retuszowane między nimi.

Cztery klatki z czterech ujęć pokazujące tę samą piosenkarkę na neonowym dachu, pustynnej autostradzie, białym studiu i w czarnym zbiorniku wodnym_Jedna_ klatka wyciągnięta z każdego dostarczonego klipu. Te same włosy, ta sama siateczkowa góra, ten sam czerwony LED-owy naszyjnik w deszczu, niskim słońcu, płaskim wysokim kluczu i pod wodą.
Dlaczego większość prób teledysku MiniMax H3 rozpada się po szesnastej sekundzie
Trzy tryby awarii, wszystkie do uniknięcia.
Po pierwsze: traktowanie 15 sekund jako limitu projektu. H3 ogranicza pojedynczą generację do 15 sekund. Ludzie to czytają, stwierdzają „nie ma teledysków” i rezygnują. Ale teledysk nigdy nie był jednym ujęciem. Prawdziwy i tak tnie się co 4–8 sekund. Limit zmusza cię tylko do zrobienia tego, co i tak zrobiłby montażysta.
Po drugie: opisywanie rytmu słowami. „Energiczny, taneczny, w rytm” nie daje modelowi niczego do uchwycenia. Wymyśla tempo, a punkty cięcia zawsze będą o pół uderzenia poza rytmem. Podanie rzeczywistego audio eliminuje zgadywanie.
Po trzecie: pozwalanie na dryf stroju. Każde ujęcie potrzebuje tego samego obrazu referencyjnego i tego samego sformułowania stroju, słowo w słowo. Zmiana „czarna siateczkowa góra” na „ciemna siateczkowa koszula” między ujęciami daje inną osobę.
Oto, co faktycznie kosztują cię te dwie ścieżki:
| Tradycyjny łańcuch czterech narzędzi | Pojedyncze wywołanie referencyjne H3 | |
|---|---|---|
| Narzędzia na ujęcie | Model obrazu, model wideo, narzędzie do synchronizacji ust, NLE | Jeden endpoint, potem NLE na końcu |
| Ręczne kroki na ujęcie | 4 przekazania, 3 eksporty plików | 1 wysłanie |
| Co utrzymuje postać | Ręczne ponowne promptowanie i szczęście | Jeden obraz referencyjny użyty wielokrotnie |
| Obraz i dźwięk | Renderowane osobno, dopasowywane później | Wygenerowane w jednym przebiegu, 32 kHz stereo |
| Koszt za 8-sekundowe ujęcie | Cztery oddzielne liczniki | $1.12 w 2K, $0.80 w 768P |
Aby być uczciwym wobec starej ścieżki: to nie jest fantazja. Japoński twórca Arata Fukoe zdobył brąz w Project Odyssey z w pełni AI teledyskiem, a zarówno Queen, jak i Linkin Park wydali oficjalne teledyski wspomagane przez AI. Te łańcuchy działały jednak przez cztery lub pięć narzędzi, czyli dokładnie to, na co niezależny artysta z jedną piosenką nie ma czasu.
Co referencyjne audio faktycznie daje teledyskowi MiniMax H3
To jest część, którą warto zrozumieć, zanim wydasz cokolwiek.
H3 generuje obraz i dźwięk w jednym przebiegu, zamiast dogrywać audio do gotowych klatek. Kiedy podajesz mu ścieżkę referencyjną, nie jest to tylko notatka nastrojowa. Porównałem mój wejściowy wycinek z strumieniem audio w dostarczonym pliku mp4, na poziomie przebiegu, na 8 kHz mono downmix:
- Korelacja obwiedni: 0.956 przy zerowym opóźnieniu
- Korelacja surowego przebiegu w oknie 2-sekundowym: 0.892 przy zerowym przesunięciu próbki
To nie jest model odtwarzający podobną piosenkę. To twój plik, dopasowany do próbki, z nałożoną atmosferą, o którą poproszono w prompcie, i po jednej rundzie ponownego kodowania AAC. Dla porównania, ten sam pomiar wobec próbki kontrolnej wygenerowanej bez audio referencyjnego dał 0.26, czyli podłoga szumu.

Przebieg wejściowego wycinka powyżej, audio dostarczonego przez H3 poniżej, wyrównane przy zerowym przesunięciu_Powyżej: 8-sekundowy plik mp3, który wgrałem. Poniżej: strumień audio w pliku mp4 zwróconym przez H3. Te same szczyty, te same pozycje, brak przesunięcia._
Limity wejściowe są ścisłe i egzekwowane w momencie wysyłania, a nie po cichu:
| Wejście referencyjne | Limit | Rozliczane |
|---|---|---|
| Obrazy | do 9 | darmowe w endpointach H3 Atlas Cloud |
| Wideo | do 3, każde 2-15s | rozliczane według stawki wyjściowej |
| Audio | do 3, każde 2-15s, łącznie 15s we wszystkich klipach | $0.00 |
| Samo audio | odrzucone, potrzebuje co najmniej jednego obrazu lub wideo | b/d |
Celowo przetestowałem górny limit całkowitego audio, wysyłając trzy 8-sekundowe wycinki w jednym wywołaniu. Nie udało się w 5.8 sekundy z komunikatem invalid params, total audio duration 24138 ms exceeds 15000 ms i nie zostało rozliczone. Dobra wiadomość: H3 nie odrzuca po cichu dodatkowego pliku i nie nalicza opłaty.
Jeszcze jedna pułapka, którą napotkałem wcześniej. Jeśli przekazujesz audio jako data URL w base64, typ MIME decyduje o rozszerzeniu, które API wnioskuje. data:audio/mpeg jest odrzucane z komunikatem audio format ".mpeg" not allowed. data:audio/mp3 przechodzi bez problemu. Cztery wysłania zmarły z tego powodu, zanim to zauważyłem, wszystkie darmowe.
Przepływ pracy teledysku MiniMax H3 i koszt każdej sekundy
Wszystko poniżej działa przez jeden klucz API na Atlas Cloud, gdzie uruchomiłem i rozliczyłem wszystko. Trzy modele, jedna zakładka przeglądarki.
| Krok | Model | Co robi | Cena, którą faktycznie naliczono |
|---|---|---|---|
| Napisz haczyk | minimax/music-2.6 | Pełna piosenka z promptu stylu i tekstu, mp3 do ~5 min | $0.15 za piosenkę, płasko |
| Ustal artystkę | openai/gpt-image-2/text-to-image | Jedna podstawowa ramka, którą każde ujęcie dziedziczy | $0.1745 przy jakości high, 2048x1152 |
| Nagraj każde ujęcie | minimax/h3/reference-to-video | Obraz plus audio wejście, klip zsynchronizowany z rytmem, stereo out | $0.14/s w 2K, $0.10/s w 768P. Audio wejściowe $0.00 |
Dwie uwagi do tej tabeli, ponieważ podane liczby kłamią w obie strony. GPT Image 2 pokazuje minimalną cenę $0.009 w katalogu; to najniższy poziom tokenów, a rzeczywisty render 2048x1152 w jakości high kosztuje $0.1745. Wpis H3 w katalogu pokazuje $0.10, co dotyczy tylko poziomu 768P; moje 8-sekundowe zadania w 2K były rozliczane dokładnie po $1.12, czyli $0.14 za sekundę.
Jeśli chcesz zablokować pierwszą klatkę zamiast używać referencji do tematu, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) ma takie same stawki, a [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) obsługuje ujęcia tylko z promptu.
Korekta, którą warto wprowadzić: wcześniejsza wersja tego planu zakładała, że musisz przynieść własną piosenkę, ponieważ na platformie nie było generatora całych utworów. Teraz jest. minimax/music-2.6 pisze utwór, więc cały łańcuch, z piosenką włącznie, działa w jednym miejscu.
Jak zrobić teledysk MiniMax H3, krok po kroku
Krok 1: Napisz haczyk w tempie 120 BPM i potnij go na kawałki na ujęcia
Wyraźnie poproś o 120 BPM. Przy 120 BPM jeden takt to dokładnie 2.000 sekund, więc wartości duration H3 w pełnych sekundach trafiają na linie taktowe za darmo: 4s = 2 takty, 6s = 3 takty, 8s = 4 takty, 10s = 5 taktów. Twoje cięcia przypadają na mocne uderzenie bez dotykania żadnego znacznika.
Model: minimax/music-2.6. Ustawienia: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.
Prompt stylu:
plaintext1Synth-pop w dokładnie 120 BPM, prosta stopa 4/4, jasne analogowe 2sidechained pady, czysty żeński wokal prowadzący wysunięty w miksie, 3szeroki stereo refren, bez rapu, długie otwarte samogłoski, kinowo i lekko 4melancholijnie, gotowy do radia mastering
Tekst:
plaintext1[Refren] 2Trzymaj linię, trzymaj światło 3Kończy mi się noc 4Wypowiedz moje imię w deszcz 5A znów zapłonę
Zwrócił 70-sekundowy utwór w 75 sekund za $0.15. Następnie sprawdziłem tempo, zamiast mu ufać, uruchamiając autokorelację nowości ataków na pliku. Najsilniejsze opóźnienie wróciło dokładnie jako 0.500 s, czyli 120 BPM, a siatka beatów zaczyna się od 0.24 s w zdekodowanym pliku, a nie od zera. To przesunięcie ma znaczenie: tnij od 0.24, a każdy wycinek zaczyna się na mocnym uderzeniu.
plaintext1# 32-sekundowy master, zaczynający się na mocnym uderzeniu w 0.24s 2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3 3 4# cztery 8-sekundowe wycinki, jeden na ujęcie, każdy 4 takty i znacznie poniżej limitu 15s 5for i in 0 8 16 24; do 6 ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3 7done
Jeśli masz już własny utwór, pomiń ten krok całkowicie. To normalny przypadek i najtańszy.
Krok 2: Ustal artystkę za pomocą jednej podstawowej ramki GPT Image 2
Każde ujęcie odwołuje się do tego jednego pliku. Cokolwiek jest tu źle, jest źle cztery razy, więc wydaj $0.17 i przyjrzyj się temu odpowiednio.
Model: openai/gpt-image-2/text-to-image. Ustawienia: quality high , size 2048x1152 (16:9).
plaintext1Kinowa nieruchoma scena teledysku, portret do pasa. 25-letnia wschodnioazjatycka 2piosenkarka synth-pop ze srebrnobiałymi krótkimi włosami i prostą grzywką, matową 3czarną siateczkową górą, cienkim czerwonym LED-owym naszyjnikiem świecącym na 4obojczyku i pojedynczą srebrną obręczą na uchu. Stoi na mokrym neonowym dachu 5nocą, trzymając przy ustach vintage chromowany mikrofon ręczny. Za nią, nieostre 6magenta i cyjan neony, drobny deszcz uchwycony w twardym podświetleniu, para 7unosząca się z wentylacji. Sfilmowane na 35mm anamorficznym, płytka głębia ostrości, 8kolorystyka teal-and-magenta, widoczne ziarno filmowe. Jej twarz jest ostra i 9równomiernie oświetlona miękkim kluczem z lewej strony kamery. Żadnego tekstu w 10kadrze.

Wygenerowana podstawowa ramka: srebrnowłosa piosenkarka z chromowanym mikrofonem na mokrym neonowym dachu_Podstawowa_ ramka, którą każde późniejsze ujęcie dziedziczy. Wygenerowana za pomocą openai/gpt-image-2/text-to-image , jakość high, 2048x1152, naliczono $0.1745.

GPT Image 2 uruchomiony z tym samym promptem w playgroundzie Atlas Cloud z gotową ramką w panelu wyjściowym
Ten sam prompt w playgroundzie: Rozmiar 16:9 w 2048x1152, Quality high, a przycisk Run pokazuje kwotę $0.1745, czyli tyle, ile faktycznie naliczyło mi API. Kwota $0.009 w katalogu to najniższy poziom tokenów, nie ten. Ten sam prompt, inne ziarno, więc ten render nie jest dokładnie tym samym plikiem powyżej.
Słowa dotyczące stroju w tym prompcie (srebrnobiałe krótkie włosy, matowa czarna siateczkowa góra, czerwony LED-owy naszyjnik, srebrna obręcz na uchu) są używane wielokrotnie, słowo w słowo, w każdym poniższym prompcie. To powtórzenie jest całym mechanizmem spójności. Nie parafrazuj.
Krok 3: Uruchom pierwsze ujęcie teledysku MiniMax H3 z darmowym audio referencyjnym
Model: minimax/h3/reference-to-video. Ustawienia: refers = podstawowa ramka plus slice-0.mp3 , resolution: 2K, duration: 8, ratio: 16:9.
Ustaw ratio jawnie. Domyślny w playgroundzie to adaptive, a endpoint jest znacznie szczęśliwszy, gdy podasz żądany kształt.
plaintext1Ujęcie teledysku. Kobieta z obrazu referencyjnego śpiewa ścieżkę referencyjną 2prosto w obiektyw na mokrym neonowym dachu, trzymając chromowany mikrofon przy 3ustach. Mocno uderza pierwszą linijkę na mocnym uderzeniu, oczy wbite w kamerę, 4następnie odchyla głowę do tyłu na wytrzymanym dźwięku. Powolny najazd z ujęcia 5do pasa do ciasnego zbliżenia na przestrzeni ośmiu sekund, ręczne mikro-drżenie, 6smugi deszczu przecinające twarde podświetlenie. Kształt jej ust podąża za 7śpiewanymi samogłoskami audio referencyjnego dokładnie, ona śpiewa, nie mówi. 8Identyczne srebrnobiałe krótkie włosy, matowa czarna siateczkowa góra i świecący 9czerwony LED-owy naszyjnik jak na obrazie referencyjnym. Dźwięk: ścieżka 10referencyjna w stereo, plus delikatny deszcz i odległy szum miasta nisko w miksie.
7sPeYEe-xII
Ujęcie 1, włącz dźwięk. 2560x1440, dokładnie 8.00 s, 24 kl./s, 32 kHz stereo. 345 sekund od wysłania do pliku, naliczono $1.12. Zwróć uwagę na odchylenie głowy do tyłu na wytrzymanym dźwięku około 5 s.

Playground reference-to-video z załadowaną podstawową ramką i wycinkiem audio oraz gotowym klipem w panelu wyjściowym
Materiały referencyjne pokazują 2/9: slice-0.mp3 w jednym slocie, podstawowa ramka w drugim. Rozdzielczość 2K, Czas trwania 8, a przycisk Run pokazuje $1.12, czyli dokładnie 8 x $0.14. Zwróć uwagę na rozwijane menu Aspect Ratio ustawione na adaptive , co jest domyślne na stronie; moje wywołania API ustawiały ratio jawnie na 16:9.
Jedna liczba warta zapisania: duration: 8 dostarczyło kontenera o dokładnie 8.00 sekund. duration: 4 dostarczyło 4.46 sekund. Jeśli planujesz łączyć na liniach taktowych, trzymaj się czasów trwania, które wychodzą dokładnie.
Krok 4: Nagraj trzy kolejne światy bez utraty twarzy
Ta sama podstawowa ramka, to samo zdanie o stroju, następny wycinek audio. Wszystko inne się zmienia.
4a. Pustynna autostrada o złotej godzinie. refers = podstawowa ramka + slice-8.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Ujęcie teledysku. Ta sama kobieta z obrazu referencyjnego stoi na linii środkowej 2pustej pustynnej autostrady o złotej godzinie, bez mikrofonu, otwarta indygo 3dżinsowa kurtka na tej samej matowej czarnej siateczkowej górze, czerwony LED-owy 4naszyjnik wciąż zapalony. Wypowiada refren ścieżki referencyjnej bezgłośnie na 5wietrze, podczas gdy kamera przesuwa się do tyłu nisko nad asfaltem. Drgania 6powietrza nad drogą, unoszący się kurz, jej cień wydłużający się w kierunku 7obiektywu, anamorficzna flara przecinająca w połowie. Włosy, twarz i strój 8identyczne jak na obrazie referencyjnym. Dźwięk: ścieżka referencyjna przez 9otwarty pustynny wiatr, szeroko i przestrzennie.
4XEki-v2vCU
Ujęcie 2, włącz dźwięk. Ta sama twarz, przeciwna temperatura barwowa, a ścieżka referencyjna zmiksowana na nowo z otwartym wiatrem. 332 s, $1.12.
4b. Biała nieskończona wnęka. refers = podstawowa ramka + slice-16.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Ujęcie teledysku. Ta sama kobieta z obrazu referencyjnego w czystym białym 2studiu z nieskończoną wnęką pod płaskim wysokim kluczem bez cieni, ubrana w 3błyszczący czerwony winylowy płaszcz na tej samej matowej czarnej siateczkowej 4górze, czerwony LED-owy naszyjnik widoczny przy kołnierzu. Tańczy cztery takty do 5ścieżki referencyjnej, srebrnobiałe włosy trzepoczą przy każdym obrocie. Stałe 6szerokie ujęcie, potem ostry snap-zoom do średniego na drugim mocnym uderzeniu. 7Małe białe papierowe kwadraty spadają jak konfetti przez ostatnie dwie sekundy. 8Twarz i włosy identyczne jak na obrazie referencyjnym. Dźwięk: ścieżka referencyjna, 9sucho i blisko, plus skrzyp butów na podłodze studia.
VAyqdkVpnm0
Ujęcie 3, włącz dźwięk. Płaskie bezcieniowe światło to najtrudniejsze miejsce do ukrycia zamiany twarzy, a ono się obroniło . 8.00 s, $1.12.
4c. Podwodne ujęcie B-roll, bez synchronizacji ust. refers = podstawowa ramka + slice-24.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Ujęcie teledysku. Ta sama kobieta z obrazu referencyjnego zawieszona pod wodą w 2czarnym zbiorniku, srebrnobiałe włosy unoszące się wokół niej, czerwony LED-owy 3naszyjnik świecący przez wodę, czarna siateczkowa góra falująca powoli. Jedna 4twarda wiązka światła z góry; bąbelki unoszą się obok obiektywu w zwolnionym 5tempie. Otwiera oczy na mocnym uderzeniu i wyciąga jedną rękę w kierunku 6powierzchni. Nie śpiewa, a jej usta pozostają zamknięte. Kamera obraca się o 7trzydzieści stopni wokół niej przez całe ujęcie. Twarz identyczna jak na obrazie 8referencyjnym. Dźwięk: ścieżka referencyjna słyszana z nad powierzchni, 9przytłumiona i przepuszczona przez dolnoprzepustowy filtr, z transjentami bąbelków.
fibdweUMRpY
Ujęcie 4, włącz dźwięk. Instrukcja „nie śpiewa, a jej usta pozostają zamknięte” została wykonana, co jest przydatne: audio referencyjne napędza timing, a nie obowiązkowy występ. 329 s, $1.12.
Krok 5: Uruchom próbkę kontrolną, z pustym slotem audio
Ten sam prompt co w kroku 3, słowo w słowo. Jedyna zmiana: refers zawiera obraz i nic więcej. 768P, duration: 8.
Ten jeden klip wyjaśnia cały mechanizm lepiej niż jakikolwiek akapit. Posłuchaj go w porównaniu z krokiem 3.
FAoPplGmKJc
Próbka kontrolna. Identyczny prompt, bez audio referencyjnego, 1344x768, 8.00 s, 200 s, $0.80. H3 napisał własną ścieżkę dźwiękową, a występ jest ogólny „ktoś śpiewa” zamiast tych słów.
Zmierzona względem mojego mastera, próbka kontrolna uzyskała korelację obwiedni 0.26. Krok 3 uzyskał 0.956. Ta różnica to coś, co kupuje ci darmowy slot audio.
Krok 6: Złam synchronizację ust celowo
Każdy model ma sufit sylabowy. Znalezienie swojego kosztuje $0.40.
Wygenerowałem osobny utwór rap w podwójnym tempie (minimax/music-2.6 ponownie, $0.15), wyciąłem 4-sekundowy wycinek z mniej więcej sześcioma sylabami na sekundę i podałem go do tego samego zestawu na dachu w 768P, duration: 4.
plaintext1Ujęcie teledysku. Kobieta z obrazu referencyjnego rapuje ścieżkę referencyjną 2prosto w obiektyw na mokrym neonowym dachu, trzymając chromowany mikrofon przy 3ustach, dostarczając każdą sylabę szybkiej zwrotki w podwójnym tempie. Stałe 4średnie zbliżenie, lekkie ręczne drżenie, smugi deszczu w twardym podświetleniu. 5Kształt jej ust podąża za rapowanymi sylabami audio referencyjnego dokładnie. 6Identyczne srebrnobiałe krótkie włosy, matowa czarna siateczkowa góra i świecący 7czerwony LED-owy naszyjnik jak na obrazie referencyjnym. Dźwięk: ścieżka 8referencyjna w stereo plus delikatny deszcz.
jiQVCjOCbKg
Test wytrzymałości, włącz dźwięk. 1344x768, 4.46 s, 192 s, $0.40. Usta są zajęte i trzymają rytm, ale przestają rozróżniać poszczególne spółgłoski i przechodzą w powtarzający się cykl otwierania i zamykania. Śpiewane linie otrzymują odrębne kształty samogłosek; to nie.
Moja szczera ocena z dostarczonych plików: wytrzymane śpiewane samogłoski to miejsce, gdzie praca ust H3 jest naprawdę przekonująca, a gęste rapowane spółgłoski degradują się do wiarygodnego ruchu. Planuj zbliżenia wokół śpiewanych linii, a szybkie zwrotki umieść na B-rollu. Więcej szczegółów na temat różnicy między mową a śpiewem znajdziesz w analizie synchronizacji ust i audio.
Krok 7: Zszyj, wycisz i nałóż master na teledysk MiniMax H3
Cztery klipy dokładnie po 8.00 sekund łączą się w dokładnie 32.00 sekund, czyli 16 taktów w tempie 120 BPM. Żadnego przycinania.
plaintext1# 1. usuń audio z każdego klipu 2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do 3 ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4 4done 5 6# 2. połącz w kolejności taktów (4 x 8s = 32s = 16 taktów @ 120 BPM) 7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt 8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4 9 10# 3. nałóż oryginalny master 11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4
Po co wyciszać, skoro model już zwraca twój utwór? Ponieważ stereo mix każdego klipu niesie atmosferę, o którą prosił ten klip: deszcz w ujęciu 1, pustynny wiatr w ujęciu 2, podwodny filtr dolnoprzepustowy w ujęciu 4. Ładne w pojedynkę, niespójne w montażu. Master daje ci ciągły miks w pełnej przepływności bez ponownego kodowania na ujęcie. H3 dostarcza synchronizację występu. Twój master dostarcza piosenkę.
Cztery warianty przepisu na teledysk MiniMax H3
Pionowe cięcia. Ustaw ratio: 9:16, a otrzymasz wycinek na Spotify Canvas lub Shorts z tej samej podstawowej ramki i tych samych wycinków. Wrócił jako prawdziwy 768x1344, więc w przeciwieństwie do rozwijanego menu w playgroundzie, wartość ratio w API rzeczywiście się trzyma. Pętle Canvas są domyślnie ciche, więc ten wersja idzie jako GIF.

Pionowa pętla 9:16 tego samego artysty na neonowym dachu_Ta sama podstawowa ramka, ten sam wycinek referencyjny,_ ratio: 9:16 w 768P za $0.80. Jeden uczciwy zgrzyt: poprosiłem o „nie śpiewanie”, a dostałem śpiewanie. Gdy w slocie referencyjnym jest wokal, audio wygrywa argument. Jeśli chcesz cichego wykonawcę, podaj instrumentalny wycinek.
Referencyjne wideo zamiast referencyjnego obrazu. Możesz przekazać H3 do trzech referencyjnych klipów wideo, aby przenosiły ruch i kadrowanie zamiast ich opisywać. Uważaj na licznik: referencyjne wideo jest rozliczane według stawki wyjściowej, podczas gdy referencyjne audio jest darmowe. Ta asymetria to najważniejszy fakt cenowy w tym endpointcie.
Czyste wizualizatory B-roll. Całkowicie zrezygnuj z wykonawcy. Podaj zdjęcie produktu, okładkę albumu lub teksturę plus wycinek audio, a promptuj tylko ruch kamery. Żadnej twarzy do utrzymania, żadnej synchronizacji ust do złamania, i możesz nagrać całość w 768P.
Szkicuj tanio, kończ drogo. 768P to $0.10/s wobec 2K $0.14/s, a oba wracają z identycznym stereo 32 kHz, więc wydajność, którą oceniasz, jest taka sama. Oszczędność nie polega na tym, co zachowujesz, ale na odrzutach: każda nieudana 8-sekundowa próba kosztuje $0.80 zamiast $1.12. Uruchamiaj w 768P, dopóki ujęcie nie będzie dobre, a potem zapłać $1.12 raz. Przy ujęciu, które wymaga trzech prób, to $2.72 zamiast $3.36. Więcej na temat różnicy poziomów w porównaniu 768P vs 2K i o tym, jak daleko może się rozciągnąć pojedynczy klip, w przewodniku po długości klipu.
Co faktycznie kosztował pełny teledysk MiniMax H3
Każda linia poniżej to rzeczywista naliczona kwota pobrana z rekordu prognozy po zakończeniu, a nie cena katalogowa.
| Pozycja | Model i ustawienia | Naliczono |
|---|---|---|
| Haczyk, 70 s piosenka | minimax/music-2.6, mp3 44.1 kHz | $0.15 |
| Podstawowa ramka artysty | openai/gpt-image-2/text-to-image, high, 2048x1152 | $0.17 |
| Ujęcie 1, neonowy dach | minimax/h3/reference-to-video, 2K, 8 s | $1.12 |
| Ujęcie 2, pustynna autostrada | to samo, 2K, 8 s | $1.12 |
| Ujęcie 3, biała wnęka | to samo, 2K, 8 s | $1.12 |
| Ujęcie 4, podwodne | to samo, 2K, 8 s | $1.12 |
| Suma częściowa gotowego wideo | $4.80 | |
| Sonda walidacyjna | 768P, 4 s | $0.40 |
| Próbka kontrolna, bez audio | 768P, 8 s | $0.80 |
| Utwór rap do testu wytrzymałości | minimax/music-2.6 | $0.15 |
| Test wytrzymałości synchronizacji ust | 768P, 4 s | $0.40 |
| Pionowe cięcie Canvas | 768P, 8 s, 9:16 | $0.80 |
| Obraz główny do tego artykułu | openai/gpt-image-2/text-to-image, high | $0.17 |
| Test przekroczenia limitu, 24 s audio | odrzucone przy wysyłaniu | $0.00 |
| Cztery wysłania z błędnym MIME audio | odrzucone przy wysyłaniu | $0.00 |
| Audio referencyjne, 4 x 8 s | darmowe wejście | $0.00 |
| Całkowity wydatek | $7.53 |
To $9.00 za minutę gotową w 2K na ujęciach, które trafiły do montażu, przed moimi błędami. W całości w 768P ta sama minuta kosztuje $6.61. Ludzka ekipa MV nie wycenia żadnej z tych liczb.
Dwie operacyjne uwagi, jeśli budżetujesz dłuższy fragment. Odrzucenia przy wysyłaniu są darmowe, więc złe parametry kosztują cię czas i nic więcej. A pole price w prognozie wypełnia się z opóźnieniem, więc odpyaj ID żądania ponownie po pobraniu pliku, jeśli chcesz prawdziwą fakturę zamiast null.
Czyja piosenka, czyja twarz: co sprawdzić przed publikacją
Krótko, bo to ważne i nie wymaga kazania.
Potrzebujesz praw do ścieżki referencyjnej. Darmowe wejście nie oznacza darmowego rozliczenia. Podanie komercyjnie wydanego singla jako audio referencyjnego, a następnie opublikowanie tego, co wyjdzie, to szybka droga do usunięcia. Własne nagranie, utwór zamówiony lub coś, co wygenerowałeś, jest w porządku.
Nie buduj podstawowej ramki na podstawie twarzy prawdziwego żyjącego artysty. Mechanizm spójności jest tutaj bardzo dobry w utrzymywaniu twarzy w różnych ujęciach, co jest dokładnie powodem, dla którego wskazywanie go na prawdziwą osobę jest złym pomysłem.
Otwarte wagi i dostęp API to dwie różne licencje. MiniMax opublikował wagi H3 na Hugging Face w sierpniu 2026, a jego licencja społecznościowa obecnie wyklucza UE, Wielką Brytanię, Koreę Południową i USA, z formalnym kanałem licencyjnym otwartym dla tych terytoriów. To ograniczenie dotyczy uruchamiania wag samodzielnie. Wywołanie modelu przez hostowane API to relacja usługowa i nie podlega licencji na wagi. Warto wiedzieć, w której sytuacji jesteś, zanim założysz któreś z nich.
Aby uzyskać szerszy obraz tego, gdzie plasuje się H3 w porównaniu z alternatywami, istnieje porównanie z Seedance 2.5 oraz przewodnik po strukturze promptów. Aby uzyskać kontekst, dlaczego w ogóle warto się tym przejmować: w rankingu edycji wideo, który ocenia modele z audio, H3 obecnie zajmuje pierwsze miejsce z 1126 Elo, przed Gemini Omni Flash z 1119 i Dreamina Seedance 2.0 z 1027 (Artificial Analysis, sprawdzone 10 sierpnia 2026). Te wyniki zmieniają się wraz z głosami, więc traktuj je jako migawkę.
Teledysk MiniMax H3: Często zadawane pytania
Czy jeden teledysk MiniMax H3 może trwać pełne trzy minuty?
Nie w jednej generacji. Pojedyncze wywołanie ma limit 15 sekund. Ale to limit na pojedynczą generację, a nie na cały projekt. Trzyminutowe wideo po 8 sekund na ujęcie to 23 generacje, około $25.76 w 2K, a każda trafia na linię taktową, jeśli twój utwór ma 120 BPM. Potnij, nagraj, połącz, nałóż master.
Czy teledysk MiniMax H3 używa mojej rzeczywistej piosenki, czy model regeneruje audio?
Używa twojej rzeczywistej piosenki. Zmierzyłem korelację surowego przebiegu 0,892 przy zerowym przesunięciu próbki między 8-sekundowym plikiem mp3, który wgrałem, a strumieniem audio w zwróconym pliku mp4, z nałożoną atmosferą, o którą prosił prompt. Próbka kontrolna wygenerowana bez audio referencyjnego uzyskała 0.26 względem tego samego mastera. Nadal powinieneś nałożyć swój master na końcowe połączenie, ponieważ każdy klip niesie własną atmosferę dla ujęcia i własne kodowanie AAC, które nie przetrwa czysto połączenia.
Czy podanie piosenki do teledysku MiniMax H3 kosztuje dodatkowo?
Nie. Moje cztery 8-sekundowe wycinki referencyjne dodały $0.00 do rachunku za ujęcie w wysokości $4.48. Referencyjne wideo to to, na co trzeba uważać, ponieważ jest rozliczane według stawki wyjściowej. Limity to trzy klipy audio, każdy od 2 do 15 sekund, łącznie 15 sekund, a audio nigdy nie może być jedynym materiałem referencyjnym.
Jak dobra jest synchronizacja ust MiniMax H3 w śpiewie w porównaniu z mową?
Wytrzymane śpiewane samogłoski to jego mocna strona: odrębne kształty ust, utrzymanie pasujące do nuty, a odchylenie głowy do tyłu na długiej nucie wygląda jak występ, a nie pętla. Gęste przekazywanie to miejsce, gdzie się poddaje. Mój test rapu z sześcioma sylabami na sekundę utrzymał rytm, ale przestał rozróżniać spółgłoski i przeszedł w powtarzający się cykl otwierania i zamykania. Umieść szybkie zwrotki na B-rollu.
Jak utrzymać tę samą twarz w każdym ujęciu teledysku MiniMax H3?
Trzy rzeczy, wszystkie nudne. Jeden obraz referencyjny użyty w każdym wywołaniu, nigdy regenerowany. To samo sformułowanie stroju skopiowane słowo w słowo między promptami, nie parafrazowane. Oraz jawna klauzula „identyczna jak na obrazie referencyjnym” w każdym prompcie. Moje cztery ujęcia przeszły przez deszcz, niskie słońce, płaski wysoki klucz i podwodne bez dryfu.
Ile kosztuje teledysk MiniMax H3 za minutę gotową?
$9.00 za minutę gotową w 2K, na podstawie mojego rzeczywistego rachunku $4.80 za 32-sekundowy montaż. W całości w 768P ta sama minuta kosztuje $6.61, a 768P dostarcza to samo stereo 32 kHz, więc wydajność, którą oceniasz, jest identyczna. Uruchamiaj swoje odrzuty za $0.80 i zapłać $1.12 tylko za ujęcie, które przetrwa montaż.






