Seedance 2.5 już dostępne — Jako pierwsze na Atlas Cloud

Zrobiłem teledysk MiniMax H3 z jednego 32-sekundowego hooka za $4.80\. Ścieżka dźwiękowa mnie zaskoczyła.

Wprowadziłem 32-sekundowy hook do MiniMax H3 jako darmowe referencyjne audio, otrzymałem cztery beat-locked ujęcia, a następnie zmontowałem prawdziwy teledysk MiniMax H3 za 4,80 dolara. W tym prompt'y i rachunki.

Edytor wideo pracujący przy konsoli z wieloma monitorami wideo

Nocne studio kolorów, sześć monitorów pokazujących sześć różnych ujęć tej samej srebrnowłosej piosenkarki_Sześć_ ujęć, jedna artystka, jedna piosenka. Wygenerowane przy użyciu openai/gpt-image-2/text-to-image .

Użytkownicy Suno generują około 7 milionów piosenek dziennie, mniej więcej cały katalog Spotify co dwa tygodnie (TechCrunch, luty 2026). Prawie żadna z nich nigdy nie będzie miała dołączonego obrazka. Nie dlatego, że obrazek jest niemożliwy, ale dlatego, że tradycyjna ścieżka prowadzi przez cztery narzędzia: wygeneruj nieruchome obrazy, ożyw je, wykonaj osobny przebieg synchronizacji ust, a potem napraw wszystko w montażu. Każdy przeskok gubi twarz, ubiór lub rytm.

Więc pominąłem przeskoki. Wrzuciłem 8-sekundowy wycinek refrenu prosto w slot referencyjny modelu wideo i nacisnąłem Run. Nie obciążyło mnie to żadnym kosztem za audio.

Następnie rozłożyłem gotowy plik mp4 na części, aby odpowiedzieć na jedno pytanie, na które nikt w internecie nie odpowiada wprost: czy dźwięk wychodzący z modelu to moja piosenka, czy coś, co wymyślił i brzmi podobnie? Zmierzyłem to. Odpowiedź nie jest taka, jakiej się spodziewałem, i zmienia sposób, w jaki powinieneś to ciąć.

Kluczowe wnioski

  • Audio referencyjne jest darmowe. MiniMax H3 rozlicza tylko sekundy wyjściowe. Moje cztery 8-sekundowe wycinki referencyjne dodały $0.00 do rachunku. Referencyjne wideo jest drogie.
  • 15 sekund to limit na pojedynczą generację, a nie na cały projekt. Potnij piosenkę, wyślij jeden kawałek na ujęcie, połącz. Mój 32-sekundowy montaż to cztery generacje.
  • Napisz haczyk w tempie 120 BPM. Jeden takt to dokładnie 2.000 sekund, więc wartości duration H3 w pełnych sekundach trafiają na linie taktowe bez ręcznego dostrajania. 8s = 4 takty.
  • Wyjściowe audio to Twój utwór, dopasowany do próbki. Zmierzyłem korelację przebiegu 0,892 przy zerowym opóźnieniu między moim wejściowym wycinkiem a dostarczoną przez H3 stereofoniczną mieszanką. Nie jest regenerowane. Nadal warto nałożyć master na końcowy montaż, z innego powodu (poniżej).
  • Całkowity rzeczywisty wydatek: $7.53 w przypadku dziewięciu generacji, wliczając nieudane. Cztery ujęcia, które trafiły do finalnego montażu, plus piosenka i podstawowa ramka, kosztowały $4.80.

Teledysk MiniMax H3, który wyciąłem z jednego 32-sekundowego haczyka

Włącz dźwięk. To cztery oddzielne generacje, połączone bez przejść, z oryginalnym 32-sekundowym masterem nałożonym na wierzch.

TfrOvWHf4ys

"MIRA", 32 sekundy, 2560x1440, 24 kl./s. Cztery generacje minimax/h3/reference-to-video po 8 sekund każda, $1.12 za ujęcie. Piosenka weszła jako audio referencyjne i kosztowała $0.00.

Cztery generacje, cztery zupełnie różne światy oświetleniowe, jedna twarz. Nic nie było retuszowane między nimi.

Cztery widoki srebrnowłosej kobiety w świecącym czerwonym kołnierzu

Cztery klatki z czterech ujęć pokazujące tę samą piosenkarkę na neonowym dachu, pustynnej autostradzie, białym studiu i w czarnym zbiorniku wodnym_Jedna_ klatka wyciągnięta z każdego dostarczonego klipu. Te same włosy, ta sama siateczkowa góra, ten sam czerwony LED-owy naszyjnik w deszczu, niskim słońcu, płaskim wysokim kluczu i pod wodą.


Dlaczego większość prób teledysku MiniMax H3 rozpada się po szesnastej sekundzie

Trzy tryby awarii, wszystkie do uniknięcia.

Po pierwsze: traktowanie 15 sekund jako limitu projektu. H3 ogranicza pojedynczą generację do 15 sekund. Ludzie to czytają, stwierdzają „nie ma teledysków” i rezygnują. Ale teledysk nigdy nie był jednym ujęciem. Prawdziwy i tak tnie się co 4–8 sekund. Limit zmusza cię tylko do zrobienia tego, co i tak zrobiłby montażysta.

Po drugie: opisywanie rytmu słowami. „Energiczny, taneczny, w rytm” nie daje modelowi niczego do uchwycenia. Wymyśla tempo, a punkty cięcia zawsze będą o pół uderzenia poza rytmem. Podanie rzeczywistego audio eliminuje zgadywanie.

Po trzecie: pozwalanie na dryf stroju. Każde ujęcie potrzebuje tego samego obrazu referencyjnego i tego samego sformułowania stroju, słowo w słowo. Zmiana „czarna siateczkowa góra” na „ciemna siateczkowa koszula” między ujęciami daje inną osobę.

Oto, co faktycznie kosztują cię te dwie ścieżki:

 Tradycyjny łańcuch czterech narzędziPojedyncze wywołanie referencyjne H3
Narzędzia na ujęcieModel obrazu, model wideo, narzędzie do synchronizacji ust, NLEJeden endpoint, potem NLE na końcu
Ręczne kroki na ujęcie4 przekazania, 3 eksporty plików1 wysłanie
Co utrzymuje postaćRęczne ponowne promptowanie i szczęścieJeden obraz referencyjny użyty wielokrotnie
Obraz i dźwiękRenderowane osobno, dopasowywane późniejWygenerowane w jednym przebiegu, 32 kHz stereo
Koszt za 8-sekundowe ujęcieCztery oddzielne liczniki$1.12 w 2K, $0.80 w 768P

Aby być uczciwym wobec starej ścieżki: to nie jest fantazja. Japoński twórca Arata Fukoe zdobył brąz w Project Odyssey z w pełni AI teledyskiem, a zarówno Queen, jak i Linkin Park wydali oficjalne teledyski wspomagane przez AI. Te łańcuchy działały jednak przez cztery lub pięć narzędzi, czyli dokładnie to, na co niezależny artysta z jedną piosenką nie ma czasu.

Co referencyjne audio faktycznie daje teledyskowi MiniMax H3

To jest część, którą warto zrozumieć, zanim wydasz cokolwiek.

H3 generuje obraz i dźwięk w jednym przebiegu, zamiast dogrywać audio do gotowych klatek. Kiedy podajesz mu ścieżkę referencyjną, nie jest to tylko notatka nastrojowa. Porównałem mój wejściowy wycinek z strumieniem audio w dostarczonym pliku mp4, na poziomie przebiegu, na 8 kHz mono downmix:

  • Korelacja obwiedni: 0.956 przy zerowym opóźnieniu
  • Korelacja surowego przebiegu w oknie 2-sekundowym: 0.892 przy zerowym przesunięciu próbki

To nie jest model odtwarzający podobną piosenkę. To twój plik, dopasowany do próbki, z nałożoną atmosferą, o którą poproszono w prompcie, i po jednej rundzie ponownego kodowania AAC. Dla porównania, ten sam pomiar wobec próbki kontrolnej wygenerowanej bez audio referencyjnego dał 0.26, czyli podłoga szumu.

Dwa prawie identyczne przebiegi audio, niebieski wejściowy i czerwony wyjściowy

Przebieg wejściowego wycinka powyżej, audio dostarczonego przez H3 poniżej, wyrównane przy zerowym przesunięciu_Powyżej: 8-sekundowy plik mp3, który wgrałem. Poniżej: strumień audio w pliku mp4 zwróconym przez H3. Te same szczyty, te same pozycje, brak przesunięcia._

Limity wejściowe są ścisłe i egzekwowane w momencie wysyłania, a nie po cichu:

Wejście referencyjneLimitRozliczane
Obrazydo 9darmowe w endpointach H3 Atlas Cloud
Wideodo 3, każde 2-15srozliczane według stawki wyjściowej
Audiodo 3, każde 2-15s, łącznie 15s we wszystkich klipach$0.00
Samo audioodrzucone, potrzebuje co najmniej jednego obrazu lub wideob/d

Celowo przetestowałem górny limit całkowitego audio, wysyłając trzy 8-sekundowe wycinki w jednym wywołaniu. Nie udało się w 5.8 sekundy z komunikatem invalid params, total audio duration 24138 ms exceeds 15000 ms i nie zostało rozliczone. Dobra wiadomość: H3 nie odrzuca po cichu dodatkowego pliku i nie nalicza opłaty.

Jeszcze jedna pułapka, którą napotkałem wcześniej. Jeśli przekazujesz audio jako data URL w base64, typ MIME decyduje o rozszerzeniu, które API wnioskuje. data:audio/mpeg jest odrzucane z komunikatem audio format ".mpeg" not allowed. data:audio/mp3 przechodzi bez problemu. Cztery wysłania zmarły z tego powodu, zanim to zauważyłem, wszystkie darmowe.


Przepływ pracy teledysku MiniMax H3 i koszt każdej sekundy

Wszystko poniżej działa przez jeden klucz API na Atlas Cloud, gdzie uruchomiłem i rozliczyłem wszystko. Trzy modele, jedna zakładka przeglądarki.

KrokModelCo robiCena, którą faktycznie naliczono
Napisz haczykminimax/music-2.6Pełna piosenka z promptu stylu i tekstu, mp3 do ~5 min$0.15 za piosenkę, płasko
Ustal artystkęopenai/gpt-image-2/text-to-imageJedna podstawowa ramka, którą każde ujęcie dziedziczy$0.1745 przy jakości high, 2048x1152
Nagraj każde ujęcieminimax/h3/reference-to-videoObraz plus audio wejście, klip zsynchronizowany z rytmem, stereo out$0.14/s w 2K, $0.10/s w 768P. Audio wejściowe $0.00

Dwie uwagi do tej tabeli, ponieważ podane liczby kłamią w obie strony. GPT Image 2 pokazuje minimalną cenę $0.009 w katalogu; to najniższy poziom tokenów, a rzeczywisty render 2048x1152 w jakości high kosztuje $0.1745. Wpis H3 w katalogu pokazuje $0.10, co dotyczy tylko poziomu 768P; moje 8-sekundowe zadania w 2K były rozliczane dokładnie po $1.12, czyli $0.14 za sekundę.

Jeśli chcesz zablokować pierwszą klatkę zamiast używać referencji do tematu, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) ma takie same stawki, a [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) obsługuje ujęcia tylko z promptu.

Korekta, którą warto wprowadzić: wcześniejsza wersja tego planu zakładała, że musisz przynieść własną piosenkę, ponieważ na platformie nie było generatora całych utworów. Teraz jest. minimax/music-2.6 pisze utwór, więc cały łańcuch, z piosenką włącznie, działa w jednym miejscu.


Jak zrobić teledysk MiniMax H3, krok po kroku

Krok 1: Napisz haczyk w tempie 120 BPM i potnij go na kawałki na ujęcia

Wyraźnie poproś o 120 BPM. Przy 120 BPM jeden takt to dokładnie 2.000 sekund, więc wartości duration H3 w pełnych sekundach trafiają na linie taktowe za darmo: 4s = 2 takty, 6s = 3 takty, 8s = 4 takty, 10s = 5 taktów. Twoje cięcia przypadają na mocne uderzenie bez dotykania żadnego znacznika.

Model: minimax/music-2.6. Ustawienia: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.

Prompt stylu:

plaintext
1Synth-pop w dokładnie 120 BPM, prosta stopa 4/4, jasne analogowe
2sidechained pady, czysty żeński wokal prowadzący wysunięty w miksie,
3szeroki stereo refren, bez rapu, długie otwarte samogłoski, kinowo i lekko
4melancholijnie, gotowy do radia mastering

Tekst:

plaintext
1[Refren]
2Trzymaj linię, trzymaj światło
3Kończy mi się noc
4Wypowiedz moje imię w deszcz
5A znów zapłonę

Zwrócił 70-sekundowy utwór w 75 sekund za $0.15. Następnie sprawdziłem tempo, zamiast mu ufać, uruchamiając autokorelację nowości ataków na pliku. Najsilniejsze opóźnienie wróciło dokładnie jako 0.500 s, czyli 120 BPM, a siatka beatów zaczyna się od 0.24 s w zdekodowanym pliku, a nie od zera. To przesunięcie ma znaczenie: tnij od 0.24, a każdy wycinek zaczyna się na mocnym uderzeniu.

plaintext
1# 32-sekundowy master, zaczynający się na mocnym uderzeniu w 0.24s
2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3
3
4# cztery 8-sekundowe wycinki, jeden na ujęcie, każdy 4 takty i znacznie poniżej limitu 15s
5for i in 0 8 16 24; do
6  ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3
7done

Jeśli masz już własny utwór, pomiń ten krok całkowicie. To normalny przypadek i najtańszy.

Krok 2: Ustal artystkę za pomocą jednej podstawowej ramki GPT Image 2

Każde ujęcie odwołuje się do tego jednego pliku. Cokolwiek jest tu źle, jest źle cztery razy, więc wydaj $0.17 i przyjrzyj się temu odpowiednio.

Model: openai/gpt-image-2/text-to-image. Ustawienia: quality high , size 2048x1152 (16:9).

plaintext
1Kinowa nieruchoma scena teledysku, portret do pasa. 25-letnia wschodnioazjatycka
2piosenkarka synth-pop ze srebrnobiałymi krótkimi włosami i prostą grzywką, matową
3czarną siateczkową górą, cienkim czerwonym LED-owym naszyjnikiem świecącym na
4obojczyku i pojedynczą srebrną obręczą na uchu. Stoi na mokrym neonowym dachu
5nocą, trzymając przy ustach vintage chromowany mikrofon ręczny. Za nią, nieostre
6magenta i cyjan neony, drobny deszcz uchwycony w twardym podświetleniu, para
7unosząca się z wentylacji. Sfilmowane na 35mm anamorficznym, płytka głębia ostrości,
8kolorystyka teal-and-magenta, widoczne ziarno filmowe. Jej twarz jest ostra i
9równomiernie oświetlona miękkim kluczem z lewej strony kamery. Żadnego tekstu w
10kadrze.

Kobieta ze srebrnymi włosami trzymająca vintage mikrofon w deszczowym neonowym mieście

Wygenerowana podstawowa ramka: srebrnowłosa piosenkarka z chromowanym mikrofonem na mokrym neonowym dachu_Podstawowa_ ramka, którą każde późniejsze ujęcie dziedziczy. Wygenerowana za pomocą openai/gpt-image-2/text-to-image , jakość high, 2048x1152, naliczono $0.1745.

Interfejs generatora obrazów AI pokazujący ustawienia wejściowe i wygenerowane wyjście

GPT Image 2 uruchomiony z tym samym promptem w playgroundzie Atlas Cloud z gotową ramką w panelu wyjściowym

Ten sam prompt w playgroundzie: Rozmiar 16:9 w 2048x1152, Quality high, a przycisk Run pokazuje kwotę $0.1745, czyli tyle, ile faktycznie naliczyło mi API. Kwota $0.009 w katalogu to najniższy poziom tokenów, nie ten. Ten sam prompt, inne ziarno, więc ten render nie jest dokładnie tym samym plikiem powyżej.

Słowa dotyczące stroju w tym prompcie (srebrnobiałe krótkie włosy, matowa czarna siateczkowa góra, czerwony LED-owy naszyjnik, srebrna obręcz na uchu) są używane wielokrotnie, słowo w słowo, w każdym poniższym prompcie. To powtórzenie jest całym mechanizmem spójności. Nie parafrazuj.

Krok 3: Uruchom pierwsze ujęcie teledysku MiniMax H3 z darmowym audio referencyjnym

Model: minimax/h3/reference-to-video. Ustawienia: refers = podstawowa ramka plus slice-0.mp3 , resolution: 2K, duration: 8, ratio: 16:9.

Ustaw ratio jawnie. Domyślny w playgroundzie to adaptive, a endpoint jest znacznie szczęśliwszy, gdy podasz żądany kształt.

plaintext
1Ujęcie teledysku. Kobieta z obrazu referencyjnego śpiewa ścieżkę referencyjną
2prosto w obiektyw na mokrym neonowym dachu, trzymając chromowany mikrofon przy
3ustach. Mocno uderza pierwszą linijkę na mocnym uderzeniu, oczy wbite w kamerę,
4następnie odchyla głowę do tyłu na wytrzymanym dźwięku. Powolny najazd z ujęcia
5do pasa do ciasnego zbliżenia na przestrzeni ośmiu sekund, ręczne mikro-drżenie,
6smugi deszczu przecinające twarde podświetlenie. Kształt jej ust podąża za
7śpiewanymi samogłoskami audio referencyjnego dokładnie, ona śpiewa, nie mówi.
8Identyczne srebrnobiałe krótkie włosy, matowa czarna siateczkowa góra i świecący
9czerwony LED-owy naszyjnik jak na obrazie referencyjnym. Dźwięk: ścieżka
10referencyjna w stereo, plus delikatny deszcz i odległy szum miasta nisko w miksie.

7sPeYEe-xII

Ujęcie 1, włącz dźwięk. 2560x1440, dokładnie 8.00 s, 24 kl./s, 32 kHz stereo. 345 sekund od wysłania do pliku, naliczono $1.12. Zwróć uwagę na odchylenie głowy do tyłu na wytrzymanym dźwięku około 5 s.

Interfejs generatora wideo AI pokazujący ustawienia wejściowe i wygenerowane wideo

Playground reference-to-video z załadowaną podstawową ramką i wycinkiem audio oraz gotowym klipem w panelu wyjściowym

Materiały referencyjne pokazują 2/9: slice-0.mp3 w jednym slocie, podstawowa ramka w drugim. Rozdzielczość 2K, Czas trwania 8, a przycisk Run pokazuje $1.12, czyli dokładnie 8 x $0.14. Zwróć uwagę na rozwijane menu Aspect Ratio ustawione na adaptive , co jest domyślne na stronie; moje wywołania API ustawiały ratio jawnie na 16:9.

Jedna liczba warta zapisania: duration: 8 dostarczyło kontenera o dokładnie 8.00 sekund. duration: 4 dostarczyło 4.46 sekund. Jeśli planujesz łączyć na liniach taktowych, trzymaj się czasów trwania, które wychodzą dokładnie.

Krok 4: Nagraj trzy kolejne światy bez utraty twarzy

Ta sama podstawowa ramka, to samo zdanie o stroju, następny wycinek audio. Wszystko inne się zmienia.

4a. Pustynna autostrada o złotej godzinie. refers = podstawowa ramka + slice-8.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Ujęcie teledysku. Ta sama kobieta z obrazu referencyjnego stoi na linii środkowej
2pustej pustynnej autostrady o złotej godzinie, bez mikrofonu, otwarta indygo
3dżinsowa kurtka na tej samej matowej czarnej siateczkowej górze, czerwony LED-owy
4naszyjnik wciąż zapalony. Wypowiada refren ścieżki referencyjnej bezgłośnie na
5wietrze, podczas gdy kamera przesuwa się do tyłu nisko nad asfaltem. Drgania
6powietrza nad drogą, unoszący się kurz, jej cień wydłużający się w kierunku
7obiektywu, anamorficzna flara przecinająca w połowie. Włosy, twarz i strój
8identyczne jak na obrazie referencyjnym. Dźwięk: ścieżka referencyjna przez
9otwarty pustynny wiatr, szeroko i przestrzennie.

4XEki-v2vCU

Ujęcie 2, włącz dźwięk. Ta sama twarz, przeciwna temperatura barwowa, a ścieżka referencyjna zmiksowana na nowo z otwartym wiatrem. 332 s, $1.12.

4b. Biała nieskończona wnęka. refers = podstawowa ramka + slice-16.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Ujęcie teledysku. Ta sama kobieta z obrazu referencyjnego w czystym białym
2studiu z nieskończoną wnęką pod płaskim wysokim kluczem bez cieni, ubrana w
3błyszczący czerwony winylowy płaszcz na tej samej matowej czarnej siateczkowej
4górze, czerwony LED-owy naszyjnik widoczny przy kołnierzu. Tańczy cztery takty do
5ścieżki referencyjnej, srebrnobiałe włosy trzepoczą przy każdym obrocie. Stałe
6szerokie ujęcie, potem ostry snap-zoom do średniego na drugim mocnym uderzeniu.
7Małe białe papierowe kwadraty spadają jak konfetti przez ostatnie dwie sekundy.
8Twarz i włosy identyczne jak na obrazie referencyjnym. Dźwięk: ścieżka referencyjna,
9sucho i blisko, plus skrzyp butów na podłodze studia.

VAyqdkVpnm0

Ujęcie 3, włącz dźwięk. Płaskie bezcieniowe światło to najtrudniejsze miejsce do ukrycia zamiany twarzy, a ono się obroniło . 8.00 s, $1.12.

4c. Podwodne ujęcie B-roll, bez synchronizacji ust. refers = podstawowa ramka + slice-24.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Ujęcie teledysku. Ta sama kobieta z obrazu referencyjnego zawieszona pod wodą w
2czarnym zbiorniku, srebrnobiałe włosy unoszące się wokół niej, czerwony LED-owy
3naszyjnik świecący przez wodę, czarna siateczkowa góra falująca powoli. Jedna
4twarda wiązka światła z góry; bąbelki unoszą się obok obiektywu w zwolnionym
5tempie. Otwiera oczy na mocnym uderzeniu i wyciąga jedną rękę w kierunku
6powierzchni. Nie śpiewa, a jej usta pozostają zamknięte. Kamera obraca się o
7trzydzieści stopni wokół niej przez całe ujęcie. Twarz identyczna jak na obrazie
8referencyjnym. Dźwięk: ścieżka referencyjna słyszana z nad powierzchni,
9przytłumiona i przepuszczona przez dolnoprzepustowy filtr, z transjentami bąbelków.

fibdweUMRpY

Ujęcie 4, włącz dźwięk. Instrukcja „nie śpiewa, a jej usta pozostają zamknięte” została wykonana, co jest przydatne: audio referencyjne napędza timing, a nie obowiązkowy występ. 329 s, $1.12.

Krok 5: Uruchom próbkę kontrolną, z pustym slotem audio

Ten sam prompt co w kroku 3, słowo w słowo. Jedyna zmiana: refers zawiera obraz i nic więcej. 768P, duration: 8.

Ten jeden klip wyjaśnia cały mechanizm lepiej niż jakikolwiek akapit. Posłuchaj go w porównaniu z krokiem 3.

FAoPplGmKJc

Próbka kontrolna. Identyczny prompt, bez audio referencyjnego, 1344x768, 8.00 s, 200 s, $0.80. H3 napisał własną ścieżkę dźwiękową, a występ jest ogólny „ktoś śpiewa” zamiast tych słów.

Zmierzona względem mojego mastera, próbka kontrolna uzyskała korelację obwiedni 0.26. Krok 3 uzyskał 0.956. Ta różnica to coś, co kupuje ci darmowy slot audio.

Krok 6: Złam synchronizację ust celowo

Każdy model ma sufit sylabowy. Znalezienie swojego kosztuje $0.40.

Wygenerowałem osobny utwór rap w podwójnym tempie (minimax/music-2.6 ponownie, $0.15), wyciąłem 4-sekundowy wycinek z mniej więcej sześcioma sylabami na sekundę i podałem go do tego samego zestawu na dachu w 768P, duration: 4.

plaintext
1Ujęcie teledysku. Kobieta z obrazu referencyjnego rapuje ścieżkę referencyjną
2prosto w obiektyw na mokrym neonowym dachu, trzymając chromowany mikrofon przy
3ustach, dostarczając każdą sylabę szybkiej zwrotki w podwójnym tempie. Stałe
4średnie zbliżenie, lekkie ręczne drżenie, smugi deszczu w twardym podświetleniu.
5Kształt jej ust podąża za rapowanymi sylabami audio referencyjnego dokładnie.
6Identyczne srebrnobiałe krótkie włosy, matowa czarna siateczkowa góra i świecący
7czerwony LED-owy naszyjnik jak na obrazie referencyjnym. Dźwięk: ścieżka
8referencyjna w stereo plus delikatny deszcz.

jiQVCjOCbKg

Test wytrzymałości, włącz dźwięk. 1344x768, 4.46 s, 192 s, $0.40. Usta są zajęte i trzymają rytm, ale przestają rozróżniać poszczególne spółgłoski i przechodzą w powtarzający się cykl otwierania i zamykania. Śpiewane linie otrzymują odrębne kształty samogłosek; to nie.

Moja szczera ocena z dostarczonych plików: wytrzymane śpiewane samogłoski to miejsce, gdzie praca ust H3 jest naprawdę przekonująca, a gęste rapowane spółgłoski degradują się do wiarygodnego ruchu. Planuj zbliżenia wokół śpiewanych linii, a szybkie zwrotki umieść na B-rollu. Więcej szczegółów na temat różnicy między mową a śpiewem znajdziesz w analizie synchronizacji ust i audio.

Krok 7: Zszyj, wycisz i nałóż master na teledysk MiniMax H3

Cztery klipy dokładnie po 8.00 sekund łączą się w dokładnie 32.00 sekund, czyli 16 taktów w tempie 120 BPM. Żadnego przycinania.

plaintext
1# 1. usuń audio z każdego klipu
2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do
3  ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4
4done
5
6# 2. połącz w kolejności taktów (4 x 8s = 32s = 16 taktów @ 120 BPM)
7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt
8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4
9
10# 3. nałóż oryginalny master
11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4

Po co wyciszać, skoro model już zwraca twój utwór? Ponieważ stereo mix każdego klipu niesie atmosferę, o którą prosił ten klip: deszcz w ujęciu 1, pustynny wiatr w ujęciu 2, podwodny filtr dolnoprzepustowy w ujęciu 4. Ładne w pojedynkę, niespójne w montażu. Master daje ci ciągły miks w pełnej przepływności bez ponownego kodowania na ujęcie. H3 dostarcza synchronizację występu. Twój master dostarcza piosenkę.


Cztery warianty przepisu na teledysk MiniMax H3

Pionowe cięcia. Ustaw ratio: 9:16, a otrzymasz wycinek na Spotify Canvas lub Shorts z tej samej podstawowej ramki i tych samych wycinków. Wrócił jako prawdziwy 768x1344, więc w przeciwieństwie do rozwijanego menu w playgroundzie, wartość ratio w API rzeczywiście się trzyma. Pętle Canvas są domyślnie ciche, więc ten wersja idzie jako GIF.

Srebrnowłosa kobieta trzymająca mikrofon na deszczowym neonowym dachu

Pionowa pętla 9:16 tego samego artysty na neonowym dachu_Ta sama podstawowa ramka, ten sam wycinek referencyjny,_ ratio: 9:16 w 768P za $0.80. Jeden uczciwy zgrzyt: poprosiłem o „nie śpiewanie”, a dostałem śpiewanie. Gdy w slocie referencyjnym jest wokal, audio wygrywa argument. Jeśli chcesz cichego wykonawcę, podaj instrumentalny wycinek.

Referencyjne wideo zamiast referencyjnego obrazu. Możesz przekazać H3 do trzech referencyjnych klipów wideo, aby przenosiły ruch i kadrowanie zamiast ich opisywać. Uważaj na licznik: referencyjne wideo jest rozliczane według stawki wyjściowej, podczas gdy referencyjne audio jest darmowe. Ta asymetria to najważniejszy fakt cenowy w tym endpointcie.

Czyste wizualizatory B-roll. Całkowicie zrezygnuj z wykonawcy. Podaj zdjęcie produktu, okładkę albumu lub teksturę plus wycinek audio, a promptuj tylko ruch kamery. Żadnej twarzy do utrzymania, żadnej synchronizacji ust do złamania, i możesz nagrać całość w 768P.

Szkicuj tanio, kończ drogo. 768P to $0.10/s wobec 2K $0.14/s, a oba wracają z identycznym stereo 32 kHz, więc wydajność, którą oceniasz, jest taka sama. Oszczędność nie polega na tym, co zachowujesz, ale na odrzutach: każda nieudana 8-sekundowa próba kosztuje $0.80 zamiast $1.12. Uruchamiaj w 768P, dopóki ujęcie nie będzie dobre, a potem zapłać $1.12 raz. Przy ujęciu, które wymaga trzech prób, to $2.72 zamiast $3.36. Więcej na temat różnicy poziomów w porównaniu 768P vs 2K i o tym, jak daleko może się rozciągnąć pojedynczy klip, w przewodniku po długości klipu.


Co faktycznie kosztował pełny teledysk MiniMax H3

Każda linia poniżej to rzeczywista naliczona kwota pobrana z rekordu prognozy po zakończeniu, a nie cena katalogowa.

PozycjaModel i ustawieniaNaliczono
Haczyk, 70 s piosenkaminimax/music-2.6, mp3 44.1 kHz$0.15
Podstawowa ramka artystyopenai/gpt-image-2/text-to-image, high, 2048x1152$0.17
Ujęcie 1, neonowy dachminimax/h3/reference-to-video, 2K, 8 s$1.12
Ujęcie 2, pustynna autostradato samo, 2K, 8 s$1.12
Ujęcie 3, biała wnękato samo, 2K, 8 s$1.12
Ujęcie 4, podwodneto samo, 2K, 8 s$1.12
Suma częściowa gotowego wideo $4.80
Sonda walidacyjna768P, 4 s$0.40
Próbka kontrolna, bez audio768P, 8 s$0.80
Utwór rap do testu wytrzymałościminimax/music-2.6$0.15
Test wytrzymałości synchronizacji ust768P, 4 s$0.40
Pionowe cięcie Canvas768P, 8 s, 9:16$0.80
Obraz główny do tego artykułuopenai/gpt-image-2/text-to-image, high$0.17
Test przekroczenia limitu, 24 s audioodrzucone przy wysyłaniu$0.00
Cztery wysłania z błędnym MIME audioodrzucone przy wysyłaniu$0.00
Audio referencyjne, 4 x 8 sdarmowe wejście$0.00
Całkowity wydatek $7.53

To $9.00 za minutę gotową w 2K na ujęciach, które trafiły do montażu, przed moimi błędami. W całości w 768P ta sama minuta kosztuje $6.61. Ludzka ekipa MV nie wycenia żadnej z tych liczb.

Dwie operacyjne uwagi, jeśli budżetujesz dłuższy fragment. Odrzucenia przy wysyłaniu są darmowe, więc złe parametry kosztują cię czas i nic więcej. A pole price w prognozie wypełnia się z opóźnieniem, więc odpyaj ID żądania ponownie po pobraniu pliku, jeśli chcesz prawdziwą fakturę zamiast null.


Czyja piosenka, czyja twarz: co sprawdzić przed publikacją

Krótko, bo to ważne i nie wymaga kazania.

Potrzebujesz praw do ścieżki referencyjnej. Darmowe wejście nie oznacza darmowego rozliczenia. Podanie komercyjnie wydanego singla jako audio referencyjnego, a następnie opublikowanie tego, co wyjdzie, to szybka droga do usunięcia. Własne nagranie, utwór zamówiony lub coś, co wygenerowałeś, jest w porządku.

Nie buduj podstawowej ramki na podstawie twarzy prawdziwego żyjącego artysty. Mechanizm spójności jest tutaj bardzo dobry w utrzymywaniu twarzy w różnych ujęciach, co jest dokładnie powodem, dla którego wskazywanie go na prawdziwą osobę jest złym pomysłem.

Otwarte wagi i dostęp API to dwie różne licencje. MiniMax opublikował wagi H3 na Hugging Face w sierpniu 2026, a jego licencja społecznościowa obecnie wyklucza UE, Wielką Brytanię, Koreę Południową i USA, z formalnym kanałem licencyjnym otwartym dla tych terytoriów. To ograniczenie dotyczy uruchamiania wag samodzielnie. Wywołanie modelu przez hostowane API to relacja usługowa i nie podlega licencji na wagi. Warto wiedzieć, w której sytuacji jesteś, zanim założysz któreś z nich.

Aby uzyskać szerszy obraz tego, gdzie plasuje się H3 w porównaniu z alternatywami, istnieje porównanie z Seedance 2.5 oraz przewodnik po strukturze promptów. Aby uzyskać kontekst, dlaczego w ogóle warto się tym przejmować: w rankingu edycji wideo, który ocenia modele z audio, H3 obecnie zajmuje pierwsze miejsce z 1126 Elo, przed Gemini Omni Flash z 1119 i Dreamina Seedance 2.0 z 1027 (Artificial Analysis, sprawdzone 10 sierpnia 2026). Te wyniki zmieniają się wraz z głosami, więc traktuj je jako migawkę.


Teledysk MiniMax H3: Często zadawane pytania

Czy jeden teledysk MiniMax H3 może trwać pełne trzy minuty?

Nie w jednej generacji. Pojedyncze wywołanie ma limit 15 sekund. Ale to limit na pojedynczą generację, a nie na cały projekt. Trzyminutowe wideo po 8 sekund na ujęcie to 23 generacje, około $25.76 w 2K, a każda trafia na linię taktową, jeśli twój utwór ma 120 BPM. Potnij, nagraj, połącz, nałóż master.

Czy teledysk MiniMax H3 używa mojej rzeczywistej piosenki, czy model regeneruje audio?

Używa twojej rzeczywistej piosenki. Zmierzyłem korelację surowego przebiegu 0,892 przy zerowym przesunięciu próbki między 8-sekundowym plikiem mp3, który wgrałem, a strumieniem audio w zwróconym pliku mp4, z nałożoną atmosferą, o którą prosił prompt. Próbka kontrolna wygenerowana bez audio referencyjnego uzyskała 0.26 względem tego samego mastera. Nadal powinieneś nałożyć swój master na końcowe połączenie, ponieważ każdy klip niesie własną atmosferę dla ujęcia i własne kodowanie AAC, które nie przetrwa czysto połączenia.

Czy podanie piosenki do teledysku MiniMax H3 kosztuje dodatkowo?

Nie. Moje cztery 8-sekundowe wycinki referencyjne dodały $0.00 do rachunku za ujęcie w wysokości $4.48. Referencyjne wideo to to, na co trzeba uważać, ponieważ jest rozliczane według stawki wyjściowej. Limity to trzy klipy audio, każdy od 2 do 15 sekund, łącznie 15 sekund, a audio nigdy nie może być jedynym materiałem referencyjnym.

Jak dobra jest synchronizacja ust MiniMax H3 w śpiewie w porównaniu z mową?

Wytrzymane śpiewane samogłoski to jego mocna strona: odrębne kształty ust, utrzymanie pasujące do nuty, a odchylenie głowy do tyłu na długiej nucie wygląda jak występ, a nie pętla. Gęste przekazywanie to miejsce, gdzie się poddaje. Mój test rapu z sześcioma sylabami na sekundę utrzymał rytm, ale przestał rozróżniać spółgłoski i przeszedł w powtarzający się cykl otwierania i zamykania. Umieść szybkie zwrotki na B-rollu.

Jak utrzymać tę samą twarz w każdym ujęciu teledysku MiniMax H3?

Trzy rzeczy, wszystkie nudne. Jeden obraz referencyjny użyty w każdym wywołaniu, nigdy regenerowany. To samo sformułowanie stroju skopiowane słowo w słowo między promptami, nie parafrazowane. Oraz jawna klauzula „identyczna jak na obrazie referencyjnym” w każdym prompcie. Moje cztery ujęcia przeszły przez deszcz, niskie słońce, płaski wysoki klucz i podwodne bez dryfu.

Ile kosztuje teledysk MiniMax H3 za minutę gotową?

$9.00 za minutę gotową w 2K, na podstawie mojego rzeczywistego rachunku $4.80 za 32-sekundowy montaż. W całości w 768P ta sama minuta kosztuje $6.61, a 768P dostarcza to samo stereo 32 kHz, więc wydajność, którą oceniasz, jest identyczna. Uruchamiaj swoje odrzuty za $0.80 i zapłać $1.12 tylko za ujęcie, które przetrwa montaż.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele