Seedance 2.5 już dostępne — Jako pierwsze na Atlas Cloud

MiniMax H3 – Odniesienie do wideo: Jeden bohater, dwa ujęcia i zasada, która cicho zabiera twoje pieniądze

Każdy przewodnik powtarza arkusz specyfikacji 9/3/3. Ten go uruchamia: dwuujęcie na podstawie referencji obrazu, wideo i audio w jednym odwołaniu MiniMax H3 do połączenia wideo.

Każdy artykuł o tym modelu zatrzymuje się w tym samym miejscu. Dziewięć obrazów, trzy klipy wideo, trzy klipy audio, dwanaście plików łącznie. Brzmi jak karta gwarancyjna.

Potraktowałem go więc jak kartę gwarancyjną. Zbudowałem postać, zbudowałem rekwizyt, wygenerowałem scenę nocną, podałem tę scenę nocną z powrotem jako referencyjne wideo, pociąłem osiem sekund jazzu na referencyjną ścieżkę audio i przesłałem wszystkie trzy typy referencji w jednym żądaniu. Potem zacząłem celowo łamać reguły, aby sprawdzić, które z nich API faktycznie egzekwuje.

Cztery z nich nie są egzekwowane w sposób, którego byś się spodziewał. Jeden z nich nadal pobiera pełną cenę za wideo, o które nie prosiłeś, a komunikat o błędzie, na który liczyłeś, nigdy nie nadchodzi. To ten, który warto przeczytać do końca.

Kluczowe wnioski

  • Trzy typy referencji, jedna tablica. Do 9 obrazów, 3 klipów wideo i 3 klipów audio, łącznie 12 plików. Wszystkie trafiają do tego samego pola refers, a pole type jest opcjonalne, ponieważ API wnioskuje je z rozszerzenia pliku.
  • Audio nigdy nie może lecieć samotnie. Żądanie tylko audio jest odrzucane z nazwanym błędem. Musi podróżować z co najmniej jednym obrazem lub jednym wideo.
  • Referencja do wideo i obraz do wideo wzajemnie się wykluczają, ale nic ci o tym nie mówi. Wyślij image (pierwsza klatka) razem z refers, a zadanie i tak zostanie ukończone. Jeden z dwóch wejść jest po cichu odrzucany, za pełną cenę. Zweryfikowane dwukrotnie 2026-08-12 na obu endpointach.
  • Nic nie jest walidowane podczas wysyłania. Każde nieprawidłowe żądanie w tym artykule zwróciło HTTP 200 i ID. Prawdziwy werdykt zapada dwie do trzech minut później na etapie generowania. Odrzucenia są tam darmowe; ukończenia nie są.
  • Dodatkowe pliki referencyjne są darmowe. Jeden referencyjny obraz i dziesięć referencyjnych obrazów kosztuje dokładnie tyle samo dla tego samego czasu trwania klipu. Cena jest uzależniona od sekund wyjściowych, a nie liczby wejściowych.

Oto, co wyszło na drugim końcu. Dwa ujęcia, jedna twarz, dwa zupełnie różne miejsca, a drugie ujęcie zostało zbudowane z obrazu, pliku wideo i pliku audio jednocześnie.

Ujęcie A (deszcz, noc, neonowa aleja), a następnie Ujęcie B (pusty kryty targ następnego ranka), złączone, bez niczego dodanego poza połączeniem. Ta sama kobieta, ta sama blizna nad prawą brwią, ta sama granatowa kurtka, ten sam ręcznik. Ujęcie B zostało wygenerowane z trzech referencji jednocześnie: jej portretu, samego klipu Ujęcia A i ośmiosekundowego wycinka jazzu. Oba ujęcia to minimax/h3/reference-to-video w 2K, 2560x1440, 24fps, z natywną ścieżką stereo 32kHz. Warto włączyć dźwięk w drugiej połowie, gdzie wypowiada swoją kwestię.

Dlaczego MiniMax H3 Reference to Video bije na głowę każdy prompt, który możesz napisać

Prompt opisuje osobę. Referencja jest tą osobą. Ta różnica to cały powód istnienia tego endpointu i dlaczego MiniMax H3 obecnie znajduje się na szczycie rankingu edycji wideo: Elo 1,125 przy 10 280 głosach (Artificial Analysis, sierpień 2026). Warto jednak być precyzyjnym co do tej liczby: ta sama tabela podaje jego zakres pozycji od 1 do 2, statystycznie remisując z Google Gemini Omni Flash z wynikiem 1.122. Pierwsze miejsce, ale w przedziale ufności, który dzieli. Powiązane twierdzenie, że H3 znajduje się również w pierwszej trójce zarówno w kategorii tekst na wideo, jak i obraz na wideo, pochodzi z tego samego ogłoszenia laboratorium (Artificial Analysis na X, sierpień 2026).

Rankingi są tanie. Oto rzeczywiste zachowanie, ten sam prompt, trzy poziomy referencji, wszystko inne identyczne.

let's say

Trzy uruchomienia MiniMax H3 reference to video dla tego samego promptu: bez referencji, jeden obraz referencyjny postaci i dwa obrazy referencyjne

Ten sam prompt, te same ustawienia 768P 4s, od lewej do prawej: brak referencji (tekst na wideo), jeden obraz referencyjny postaci, dwa obrazy referencyjne (postać plus miska ramenu). Prompt mówi „kobieta z obrazu referencyjnego” we wszystkich trzech. W lewym panelu to wyrażenie nie odnosi się do nikogo, więc model wymyśla nieznajomą. Wygenerowane za pomocą minimax/h3/text-to-video i minimax/h3/reference-to-video.

Dwie uczciwe interpretacje tego paska. Skok z panelu pierwszego do drugiego jest ogromny: bez referencji „kobieta z obrazu referencyjnego” to fraza nie wskazująca na nic, a model po cichu wypełnia lukę osobą, która nie ma żadnego związku z twoim projektem. Skok z panelu drugiego do trzeciego jest znacznie mniejszy, ponieważ mój prompt również opisał miskę słowami, a H3 narysował przyzwoitą granatową miskę z żurawiem na podstawie samego tekstu. To jest użyteczna część. Referencyjny obraz i dobra fraza rzeczownikowa konkurują o to samo zadanie, więc wydaj swoje sloty referencyjne na rzeczy, których język nie jest w stanie precyzyjnie określić: konkretną twarz, konkretny produkt, konkretne logo.

Wzorzec stojący za prawie każdą porażką w tym artykule jest taki sam jak w panelu pierwszym. Nic nie ostrzega cię, że część twojego żądania trafiła w próżnię.

Co referencja faktycznie blokuje, a czego nie. Referencyjny obraz przypina tożsamość: strukturę twarzy, włosy, charakterystyczne znaki, odzież. Nie przypina oświetlenia i to jest najczęstsze zaskoczenie. Ciągnie też ze sobą światło z referencyjnego zdjęcia, dlatego postać sfotografowana w nastrojowym otoczeniu tworzy postać, która nie może przetrwać zmiany sceny. Wykonaj swoją referencję w płaskim, neutralnym świetle. Referencyjne wideo przypina ruch, gradację i ziarno, a nie tożsamość. Referencyjne audio przypina samo podłoże audio. Jeśli potrzebujesz tej samej twarzy wypowiadającej kwestię tym samym głosem w serii ujęć, stos referencyjny wykonuje trzy różne zadania i musisz określić, które jest które. Praktycy są zgodni co do nazywania ich pozycyjnie w prompcie („Obraz 1 to postać, Obraz 2 to produkt”) i warto przyjąć tę konwencję; moje prompt poniżej używają zwykłego opisowego nazewnictwa, które również działa, gdy referencje są wizualnie jednoznaczne.

Dlaczego pierwsze wywołanie zwykle rozczarowuje. Cztery rzeczy, wszystkie zmierzone 2026-08-12:

  1. Endpoint wysyłania nie waliduje niczego. Zły MIME, 164-sekundowe audio, martwy URL, wzajemnie wykluczające się pola: wszystko to zwraca HTTP 200 z ID predykcji. Dowiadujesz się później.
  2. ratio domyślnie ustawione na adaptive, co jest udokumentowane jako „pozwól modelowi wybrać”. Przy referencjach 16:9 dostałem 1344x768 przy 768P, niezależnie od tego, czy zostawiłem adaptive, czy wymusiłem 16:9, więc domyślne ustawienie jest nieszkodliwe, gdy twoje wejścia już są zgodne. To rzut monetą, gdy nie są, i jest to jedyny endpoint H3, na którym możesz po prostu zabrać mu tę decyzję.
  3. Obraz pierwszej klatki plus referencje nie powoduje błędu. Po cichu odrzuca jeden z nich i obciąża cię rachunkiem.
  4. Jeśli model nie ma nic konkretnego, czego mógłby się uchwycić, wypełnia lukę z przekonaniem, a pewna siebie błędna twarz wygląda dokładnie jak udane uruchomienie.

Jeśli chodzi o stronę tworzenia promptów, przewodnik po promptach MiniMax H3 zagłębia się w frazowanie bardziej niż ja mogę tutaj.

Księga zasad MiniMax H3 Reference to Video: Trzy typy, jedno żądanie

Wszystkie trzy typy referencji współdzielą jedną tablicę. Oto kontrakt opublikowany, obok tego, co endpoint faktycznie zrobił, gdy go testowałem.

Tabela 1: trzy typy referencji

Obrazy referencyjneReferencyjne wideoReferencyjne audio
Maksymalna liczba plików93 klipy3 klipy
Łączny limit12 plików łącznie wszystkich typów
Czas trwania na plikn/d2 do 15 sekund2 do 15 sekund
Łączny czas trwanian/d15 sekund15 sekund
Formatypng, jpeg, jpg, webpmp4, movmp3, wav
Czy może być używane samodzielnie?TakTakNie, wymaga obrazu lub wideo
Co blokujetożsamość, odzież, produkt, stylruch, kamera, gradacja, ziarnosamo podłoże audio
Czego nie blokujeoświetlenia nowej scenykto jest w kadrzedokładnego utworu (patrz Krok 6)
Dostarczane jakopubliczny URL lub base64 data URLpubliczny URL lub base64 data URLmusi być zadeklarowane jako audio/mp3, nie audio/mpeg
Egzekwowane?10 obrazów przeszło bez problemunie testowane poza 1 klipemlimit na klip egzekwowany, 15 s łącznie nie było

Liczby plików i okna czasowe są opublikowanymi limitami MiniMax (Hailuo, sierpień 2026), zweryfikowanymi krzyżowo z artykułem uruchomieniowym, który podaje to samo okno referencyjnego wideo od 2 do 15 sekund każdy i 15 sekund łącznie (MarkTechPost, sierpień 2026). Wszystko w ostatnich trzech wierszach jest moje, zmierzone.

Dwie rzeczy, których specyfikacja ci nie mówi. Po pierwsze, pole type dla każdego wpisu jest opcjonalne i wnioskowane z rozszerzenia URL, co oznacza, że base64 data URL lub link bez rozszerzenia musi zadeklarować swój typ, w przeciwnym razie żądanie zgadnie źle. Po drugie, przeglądarkowy uploader ogranicza do dziewięciu plików (Reference Materials (2/9), MAX:9 na zrzucie ekranu z Kroku 5 poniżej), poniżej własnego limitu MiniMax wynoszącego dwanaście. I tak wysłałem dziesięć obrazów referencyjnych przez API i zadanie zakończyło się normalnie, więc dziewięć to limit interfejsu, a nie modelu.

Tabela 2: reference-to-video vs image-to-video vs text-to-video

reference-to-videoimage-to-videotext-to-video
Akceptuje referstak, wymagane, min 1nie (po cichu ignorowane)nie
Akceptuje image (pierwsza klatka)nie (po cichu ignorowane)tak, wymaganenie
Akceptuje end_image (ostatnia klatka)nietaknie
Opcje ratiowszystkie 7, w tym 16:9, 9:16, 21:9tylko adaptivewszystkie 7
Rozdzielczość768P lub 2K, domyślnie 2Kto samoto samo
Czas trwania4 do 15 s liczby całkowite, domyślnie 8to samoto samo
Mieszanie wejść drugiego endpointuzadanie ukończone, wejście odrzucone, pełna opłatazadanie ukończone, refers odrzucone, pełna opłatan/d

Ten czwarty wiersz to różnica, o której nikt nie wspomina. W image-to-video wyliczenie proporcji obrazu zawiera dokładnie jedną wartość, adaptive, ponieważ pierwsza klatka decyduje o kształcie. W reference-to-video masz wszystkie siedem, co czyni go jedynym endpointem H3, na którym możesz wymusić kształt klatki, jednocześnie zakotwiczając postać. Jeśli wybierasz poziom dla tej pracy, 2K vs 768P dla MiniMax H3 omawia, co dodatkowe piksele dają.

Ostatni wiersz jest tym drogim. Dokumentacja przedstawia dwa endpointy jako wzajemnie wykluczające się i takie są, w tym sensie, że tylko jedna ścieżka wejściowa jest honorowana. Ale nie ma błędu. Uruchomiłem to w obie strony 2026-08-12: wywołanie reference-to-video z obrazem pierwszej klatki image zostało ukończone w 115 sekund i naliczyło $0.40, a wywołanie image-to-video z refers zostało ukończone w 167 sekund i naliczyło $0.40. Oba wygenerowały wideo. Oba odrzuciły połowę tego, co wysłałem, a żadne pole w odpowiedzi nie mówi, która połowa.

Tabela 3: modele używane w tym przepływie pracy

Wszystko poniżej działa w jednej karcie przeglądarki na Atlas Cloud, skąd pochodzą ceny i zrzuty ekranu. Stawki sprawdzone 2026-08-12.

KrokModelStawkaUruchomieniaKoszt
Referencje: postać + rekwizytopenai/gpt-image-2/text-to-imagepodana od $0.009; wysoka jakość 2048x1152 zmierzona $0.17452$0.35
Referencyjne audiominimax/music-2.6$0.15 za utwór1$0.15
Ujęcie A i Ujęcie Bminimax/h3/reference-to-video$0.10/s przy 768P, $0.14/s przy 2K2 x 8s przy 2K$2.24
Drabinka referencyjnato samo, plus minimax/h3/text-to-video$0.10/s przy 768P3 x 4s przy 768P$1.20

Żadna zniżka nie jest aktywna na żadnym z trzech endpointów H3 w tym miesiącu. Dwaj sąsiedzi są teraz tańsi, jeśli tylko budujesz referencyjne nieruchome obrazy: gpt-image-2-developer/text-to-image ma 50% zniżki, $0.009 obniżone do $0.004 od sierpnia 2026. Pełne zestawienia kosztów na sekundę znajdują się w przewodniku Ceny API MiniMax H3.

MiniMax H3 Reference to Video krok po kroku

Scena: kobieta prowadząca stoisko z ramenem. Ujęcie A to deszczowa neonowa aleja nocą. Ujęcie B to ta sama kobieta następnego ranka w pustym krytym targu, innym miejscu, innej porze dnia i innym obiektywie. Nic nie przenosi się między dwoma wywołaniami poza referencjami, co jest celem testu.

Krok 1: Zbuduj referencję postaci, celowo oświetloną płasko

To jest krok, który ludzie wykonują źle. Referencja postaci to nie ładne zdjęcie twojej postaci, to pomiar jej twarzy. Neutralne światło, plain background, brak sceny, brak nastroju. H3 uczy się światła razem z twarzą, więc atmosferyczna referencja tworzy postać, która jest przyspawana do tej atmosfery.

Model: openai/gpt-image-2/text-to-image. Ustawienia: quality high, size 2048x1152 (16:9), format png.

text
1Zdjęcie edytorialowe kobiety po trzydziestce, szefowej kuchni ulicznej. Bliski portret w trzech czwartych, neutralny wyraz twarzy, bezpośredni kontakt wzrokowy z aparatem. Krótkie czarne włosy schowane za jednym uchem, mała blizna nad prawą brwią, ciepła oliwkowa skóra. Ma na sobie wyblakłą granatową kurtkę roboczą z podwiniętymi do łokcia rękawami i złożony biały ręcznik na lewym ramieniu. Jednolite jasnoszare tło studyjne, miękkie równomierne światło kluczowe, brak rekwizytów, ostry focus na twarzy, naturalna tekstura skóry, bez retuszu. Fotorealistyczne, obiektyw 50mm.
2

Zrzut ekranu generatora obrazów AI pokazujący wprowadzony prompt i wygenerowany portret

Środowisko GPT Image 2 na Atlas Cloud z załadowanym promptem referencji postaci i gotowym portretem w panelu wyjściowym

GPT Image 2 na Atlas Cloud: jakość ustawiona na high, 16:9, arkusz postaci wyrenderowany po prawej.

Kobieta w granatowym kombinezonie z ręcznikiem przerzuconym przez ramię

Obraz referencyjny postaci dla MiniMax H3 reference to video: neutralny studyjny portret szefa kuchni ramen z blizną nad prawą brwią

Obraz referencyjny 1. Blizna nad prawą brwią i złożony biały ręcznik są celowe: to tanie, jednoznaczne kotwice tożsamości, które możesz sprawdzić w każdej późniejszej klatce.

Krok 2: Zbuduj referencję rekwizytu

Drugi slot referencyjny, drugie zadanie. Obiekty zachowują się lepiej niż twarze, co czyni charakterystyczny rekwizyt najłatwiejszym sposobem udowodnienia, że referencja została odczytana. Ten sam model, te same ustawienia.

text
1Zdjęcie produktowe pojedynczej ciemnogranatowej ceramicznej miski do ramenu z ręcznie malowanym białym żurawiem z boku, wyszczerbioną krawędzią, wypełnionej parującym shoyu ramenem. Widok z przodu, jednolite jasnoszare tło, miękkie równomierne światło, ostry focus, fotorealistyczne, obiektyw 50mm.
2

wieprzowina, (5) jajko, (6) i (7) zielona (8) cebula (9)

Obraz referencyjny rekwizytu: ciemnogranatowa miska do ramenu z ręcznie malowanym białym żurawiem i wyszczerbioną krawędzią

Obraz referencyjny 2. Ręcznie malowany żuraw i wyszczerbienie w krawędzi to wskaźniki. Jeśli przetrwają w filmie, referencja została odczytana.

Krok 3: Ujęcie A, dwa obrazy do MiniMax H3 reference to video

Dwa obrazy referencyjne, oba type: "image", do refers. Ustaw jawnie proporcje. adaptive jest wartością domyślną i zwykle zrobi właściwą rzecz, gdy twoje referencje są już w formacie 16:9, ale decyduje za ciebie, a na tym endpointzie nie musisz mu na to pozwalać.

Model: minimax/h3/reference-to-video. Ustawienia: resolution 2K, duration 8, ratio 16:9.

text
1Szerokie ujęcie wprowadzające. Ulewny deszcz w nocy w wąskiej neonowej alei. Kobieta z obrazu referencyjnego pracuje sama za małym parującym stoiskiem z ramenem pod plastikową markizą, nalewając bulion do granatowej miski z białym żurawiem z obrazu referencyjnego. Para unosi się wśród różowych i zielonych neonowych odbić na mokrym chodniku. Powolny najazd na stoisko. Dźwięk otoczenia: deszcz na plastiku, bulgoczący bulion, odległy ruch uliczny. Bez dialogu.
2

Wynikiem tego wywołania jest pierwsza połowa klipu demonstracyjnego na górze. Zachowaj jego URL. To wejście do Kroku 5.

Krok 4: Wytnij ośmiosekundowe referencyjne audio

Referencyjne audio to nie slot na ścieżkę dźwiękową. To podłoże, z którym model dopasowuje swój własny miks, i jest to najbardziej kapryśne wejście na endpoint. Wygeneruj utwór, a następnie go przytnij, ponieważ cała piosenka jest odrzucana.

Model: minimax/music-2.6, z is_instrumental: true i format: "mp3".

text
1Rzadki późnonocny jazz, szczotkowany werbel, kontrabas, jedna stłumiona trąbka, melancholijny, 70 BPM, instrumentalny.
2

Następnie wytnij około ośmiu sekund i zakoduj jako data:audio/mp3 URL. Trzy rzeczy, które najpierw zrobiłem źle, wszystkie z dokładnym tekstem błędu:

  • Ciąg MIME ma większe znaczenie niż bajty. Zadeklaruj data:audio/mpeg, a referencja zostanie odrzucona z komunikatem audio format ".mpeg" not allowed, mimo że plik jest zwykłym MP3. Napisz audio/mp3.
  • 2 do 15 sekund na klip, i jest egzekwowane. Mój wygenerowany utwór miał 164 sekundy. Zwrócił invalid param: audio duration 164258 ms, expected [2000, 15000] ms. Przycięcie do 8,05 sekundy rozwiązało problem. Oba odrzucenia były bezpłatne.
  • Łączny limit 15 sekund jest udokumentowany, ale nie egzekwowany. Wysłałem dwa 8-sekundowe klipy w tym samym żądaniu, łącznie 16,1 sekundy, spodziewając się odrzucenia. Zadanie zostało ukończone i naliczone normalnie. Nie polegaj na tym: jest opublikowany jako limit i może w każdej chwili zacząć się tak zachowywać.

Interfejs generatora muzyki AI pokazujący tekstowy prompt i wygenerowany przebieg audio

Środowisko MiniMax Music 2.6 na Atlas Cloud z promptem jazzowym i gotowym utworem w panelu wyjściowym

MiniMax Music 2.6 na Atlas Cloud, $0.15 za uruchomienie, gotowy utwór po prawej. Jedna rzecz do skopiowania z tego zrzutu i jedna nie: cena i format mp3 są poprawne, ale Is Instrumental jest wciąż wyłączone, a demo teksty piosenki wciąż siedzą w polu, więc to konkretne uruchomienie zwróciło 1:35 piosenkę z wokalem. Przełącz ten przełącznik i wyczyść pole Lyrics przed uruchomieniem, w przeciwnym razie będziesz ciąć referencyjne podłoże, na którym ktoś śpiewa. Moje wywołanie API, z isinstrumental: true, zwróciło 2:44 instrumentalnego w 209 sekund.

Krok 5: Ujęcie B, jedno wywołanie MiniMax H3 reference to video ze wszystkimi trzema typami

To jest wywołanie, o które tak naprawdę chodzi w słowie kluczowym. Trzy typy referencji, trzy różne zadania, jedna tablica:

  1. portret postaci z Kroku 1, type: "image", aby utrzymać jej twarz
  2. mp4 Ujęcia A z Kroku 3, type: "video", aby przenieść gradację i ziarno przez cięcie
  3. ośmiosekundowy wycinek jazzu z Kroku 4, type: "audio", jako podłoże

Wyjściowe URL z innych generacji na platformie mogą być wrzucone bezpośrednio do refers jako referencja wideo, co jest rzeczywistym mechanizmem ciągłości wielu ujęć. Nie „H3 pamięta twoją postać”. Po prostu podajesz mu poprzednie ujęcie z powrotem.

Model: minimax/h3/reference-to-video. Ustawienia: resolution 2K, duration 8, ratio 16:9.

text
1Ta sama kobieta z obrazu referencyjnego, następnego ranka. Jasny pusty kryty targ, zimne czyste światło dzienne przez świetlik, żaluzje wciąż opuszczone za nią. Średnie zbliżenie, statyczna kamera. Wyciera blat złożonym białym ręcznikiem, podnosi wzrok na kamerę i wypowiada jedną kwestię, po czym wraca do pracy. Zachowaj jej twarz, włosy, bliznę i granatową kurtkę identyczne jak w referencji. Przenieś gradację i ziarno z referencyjnego klipu. Użyj referencyjnego audio jako podkładu.
2

Interfejs generatora wideo AI pokazujący wprowadzony prompt i wygenerowane wideo

Środowisko MiniMax H3 reference to video na Atlas Cloud z załadowaną referencją obrazu i audio oraz wygenerowanym klipem w panelu wyjściowym

To samo wywołanie w środowisku MiniMax H3 Reference-to-Video, w 2K i 8 sekund. Dwa sloty referencyjne różnych typów są widoczne w Reference Materials (2/9): slot 1 to ref-audio-8s.mp3, slot 2 to jej portret. Referencja wideo jest dodawana przez „Add via link” (prawy górny róg tego panelu) lub przez API, ponieważ znajduje się pod URL, a nie na dysku. Trzy rzeczy do odczytania z tego panelu: uploader mówi MAX:9, mimo że własny limit MiniMax to 12, Aspect Ratio jest ustawiony na adaptive, chyba że go zmienisz, a cena uruchomienia za 2K przy 8 sekundach wynosi $1.12, co jest stawką $0.14 za sekundę.

Krok 6: Sprawdź, czy referencja faktycznie została odczytana

Ukończone zadanie to nie udane zadanie. Dwie kontrole, obie tanie.

Sprawdź twarz. Wyciągnij klatkę z każdego ujęcia i umieść je obok siebie. Szukasz kotwic, które umieściłeś: blizny, linii włosów, kurtki, ręcznika.

Porównanie kobiety w neonowej nocy i porannym oświetleniu targu

Klatka z Ujęcia A obok klatki z Ujęcia B, pokazująca tę samą postać MiniMax H3 reference to video w dwóch różnych scenach

Lewo: Ujęcie A, noc, neon, szerokie. Prawo: Ujęcie B, kryty targ, następny ranek, średnie zbliżenie. Ta sama twarz, ta sama blizna nad prawą brwią, ta sama kurtka i ręcznik, w poprzek zmiany sceny i kadrowania, bez niczego wspólnego poza referencjami.

Jedna rzecz nie poszła tak, jak napisałem w prompcie. Poprosiłem o „jasny pusty kryty targ, zimne czyste światło dzienne” oraz „przenieś gradację i ziarno z referencyjnego klipu”, a referencyjny klip wygrał. Ujęcie B jest bez wątpienia poranne i bez wątpienia inne miejsce, ale jest o wiele bardziej nastrojowe, niż sugeruje „jasny”, ponieważ gradacja nocy przeszła wraz z referencją wideo. Nie możesz poprosić jednego wywołania o ten sam wygląd i przeciwne światło. Jeśli potrzebujesz zmiany światła, usuń instrukcję dotyczącą gradacji lub usuń referencję wideo i utrzymaj tożsamość za pomocą samego obrazu.

Sprawdź audio. Wykreśl przebieg ośmiosekundowego wycinka, który przesłałeś, obok ścieżki, która wróciła w mp4, i dodaj kontrolę: klip wygenerowany bez żadnej referencji audio.

Trzy ułożone stosy przebiegów audio porównujące przesłane, zwrócone i kontrolne ścieżki

Przebieg przesłanego ośmiosekundowego referencyjnego audio, ścieżka audio zwrócona w wygenerowanym klipie i kontrola bez referencji audio

Góra: 8.05-sekundowy wycinek jazzu wysłany jako referencja. Środek: ścieżka wyodrębniona ze zwróconego mp4 Ujęcia B, zdominowana przez kwestię dialogową w okolicach 5.5 sekundy. Dół: Ujęcie A, ten sam przepływ pracy, bez referencji audio.

To miejsce, w którym muszę poprawić coś, w co wierzyłem na początku. Referencyjne audio nie wraca dosłownie. Korelacja obwiedni między moim wycinkiem a zwróconą ścieżką wynosi 0.25, w porównaniu do −0.05 dla kontroli bez referencji, więc te dwa są powiązane, ale dalekie od identycznych, a zwrócony kształt jest wyraźnie własnym miksem, a nie moim plikiem z czymś nałożonym. To, co referencja wyraźnie zrobiła, to umieściła coś pod spodem: podłoże Ujęcia B jest około 7 dB głośniejsze niż kontrola bez audio przez pierwsze pięć sekund, zanim zacznie się jakikolwiek dialog. Traktuj referencyjne audio jako sterowanie miksem, a nie slot na muzykę. Jeśli potrzebujesz dokładnie swojego utworu pod obrazem, nałóż go później.

Jeśli budujesz na stronie audio tego, MiniMax H3 lip sync i audio oraz opis teledysku MiniMax H3 zaczynają się od tego samego zachowania referencyjnego audio. W przypadku kodu odpytywania i ponawiania wokół tego wszystkiego, samouczek MiniMax H3 zawiera pętlę.

Cztery kolejne konfiguracje MiniMax H3 Reference to Video warte skopiowania

Zmiana stylu posiadanego klipu. Umieść gotowy klip w refers jako referencję wideo, bez żadnych obrazów, i poproś o inny styl. Ruch, kadrowanie, najazd i rekwizyty przetrwają; zmienia się powierzchnia. To mechanizm stojący za rankingiem edycji wideo H3 i ten sam, który stoi za pracą anime w MiniMax H3 vs Veo 3.1 dla anime.

Kobieta gotująca na wózku z jedzeniem w neonowej alei

Zmiana stylu na anime wygenerowana z klipu Ujęcia A użytego jako referencja MiniMax H3 reference to video

Aleja z Ujęcia A podana z powrotem jako jedyna referencja, z promptem anime w stylu cel-shading. To samo stoisko, ta sama chochla, ta sama miska z żurawiem, ten sam najazd, przerysowane. Jeden szczegół wart wiedzy: konwersja jest najsłabsza w pierwszych klatkach i najsilniejsza, gdy kamera zaangażuje się w ruch. Pokazane jako cichy GIF. Wygenerowane za pomocą minimax/h3/reference-to-video w 768P, 4s, $0.40.

Spraw, by zdjęcie ożyło. Jeden portret plus jeden klip wokalny w oknie 2–15 sekund, prompt do wykonania. Tańsze niż potok synchronizacji ust, ponieważ to pojedyncze wywołanie.

Zablokuj produkt w dowolnej scenie. Obrazy referencyjne przypinają obiekty mocniej niż twarze, więc prawdziwe zdjęcie produktu plus prompt sceny to najbardziej niezawodna rzecz na tym endpointie. Sprawdź co wolno ci zrobić z wynikiem, zanim trafi do reklamy.

Zbuduj serię, a nie klip. Połącz w łańcuch: wyjście ujęcia N staje się referencją wideo ujęcia N+1. Każde wywołanie nadal ma limit 15 sekund, więc ciągłość to twoje zadanie, a nie modelu. Jak długi może być film MiniMax H3 omawia, gdzie ten limit boli.

Porównujesz silniki przed zaangażowaniem serii w jeden? Seedance 2.5 vs MiniMax H3 i Alternatywy dla MiniMax H3 to te, które warto przeczytać.

Ile faktycznie kosztuje dwuujęciowa scena MiniMax H3 Reference to Video

Każdy wiersz poniżej to rzeczywiste zadanie z 2026-08-12, z kwotą pobraną z pola price, które API zwraca w każdym ukończonym przewidywaniu.

Tabela 4: rzeczywisty rachunek

ZadanieModelUstawieniaWynikNaliczone
Referencja postacigpt-image-2high, 2048x1152ukończone$0.1745
Referencja rekwizytugpt-image-2high, 2048x1152ukończone$0.1745
Referencyjne audiomusic-2.6instrumental, mp3ukończone, 164s utwór, 209s oczekiwania$0.15
Ujęcie Ah3/reference-to-video2K, 8s, 2 referencje obrazuukończone w 309s$1.12
Ujęcie Bh3/reference-to-video2K, 8s, ref. obraz + wideo + audioukończone w 557s$1.12
Drabinka, bez referencjih3/text-to-video768P, 4sukończone w 154s$0.40
Drabinka, 1 referencja obrazuh3/reference-to-video768P, 4sukończone w 119s$0.40
Drabinka, 2 referencje obrazuh3/reference-to-video768P, 4sukończone w 128s$0.40
Zmiana stylu na animeh3/reference-to-video768P, 4s, 1 referencja wideoukończone w 239s$0.40
Ponowne uruchomienie Kroku 5 w środowiskuh3/reference-to-video2K, 8s, ref. obraz + audioukończone$1.12
Kontrola: 10 referencji obrazuh3/reference-to-video768P, 4sukończone w 150s$0.40
Kontrola: obraz pierwszej klatki + refersh3/reference-to-video768P, 4sukończone, jedno wejście odrzucone$0.40
Kontrola: refers na image-to-videoh3/image-to-video768P, 4sukończone, refers odrzucone$0.40
Kontrola: 16.1s referencyjnego audioh3/reference-to-video768P, 4sukończone powyżej udokumentowanego limitu$0.40
Kontrola: ratio pominięte, potem ratio adaptiveh3/reference-to-video768P, 4s, dwukrotnieoba ukończone, identyczne 1344x768$0.80
Ponowne uruchomienia zrzutów ekranu Kroków 1 i 4gpt-image-2, music-2.6jak wyżejukończone$0.32
Kontrola: tylko referencja audioh3/reference-to-video768P, 4sniepowodzenie w 7ms$0.00
Kontrola: 164s referencyjnego audioh3/reference-to-video768P, 4sniepowodzenie w 16s$0.00
Kontrola: MIME audio/mpegh3/reference-to-video768P, 4sniepowodzenie w 17s$0.00
Kontrola: martwy URL referencyjnyh3/reference-to-video768P, 4sniepowodzenie w 21s$0.00
Suma$8.18

Podziel tę sumę uczciwie. Gotowa dwuujęciowa scena na górze tego artykułu, z referencjami i audio, to $2.74 z tego. Pozostałe $5.44 to dochodzenie: kontrole, celowe psucie i ponowne uruchamianie kroków w przeglądarce dla zrzutów ekranu. Jeśli znasz już zasady, 16-sekundowa dwuujęciowa sekwencja w 2K kosztuje mniej niż kanapka.

Trzy rzeczy wynikają z tej tabeli.

Referencje są darmowe. Kontrola z dziesięcioma obrazami kosztowała dokładnie te same $0.40, co uruchomienie drabinki z jednym obrazem przy tej samej długości i rozdzielczości. Na tej platformie licznik mierzy tylko sekundy wyjściowe i rozdzielczość, nic więcej. Warto jednak wskazać jedną sprzeczność: własne zasady platformy MiniMax opisują wideo wejściowe jako naliczane według stawki wyjściowej, a ujednolicony schemat na OpenRouter zawiera osobną pozycję reference_images. Żadna z nich nie pojawiła się na mojej fakturze tutaj. Jeśli budżetujesz gdzie indziej, sprawdź cenę samodzielnie, zamiast zakładać.

Niepowodzenie jest darmowe i pojawia się późno. Wszystkie cztery odrzucenia kosztowały nic, co jest dobrą wiadomością. Złą wiadomością jest to, kiedy nadchodzą: 7 milisekund dla reguły samego audio, 16 do 21 sekund dla długości audio, złego MIME i martwego URL, i nic w ogóle w momencie wysyłania. Każde źle sformułowane żądanie w tym artykule najpierw dostało HTTP 200 i ID predykcji, więc traktuj odpowiedź na wysłanie jako potwierdzenie, a nie walidację, i odczytaj pole status, zanim w coś uwierzysz.

Ciche sukcesy to kosztowne niepowodzenia. Dwie kontrole mieszania kosztowały po pełne $0.40 i zwróciły idealnie poprawne wideo zbudowane z połowy moich wejść. Nie ma błędu, pola ostrzegawczego ani sposobu, aby stwierdzić z odpowiedzi, że cokolwiek zostało odrzucone. To jedyna linia w tabeli, w której pieniądze opuściły konto, a ja nie dostałem niczego, czego chciałem.

Jedna uczciwa korekta w tym ostatnim punkcie, ponieważ zmieniło się to pod moim piórem. Na początku sierpnia adres URL referencji, który zwracał 404, zachowywał się tak samo: zadanie zostało ukończone, referencja została po cichu zignorowana, a pełna kwota została naliczona. Ponowne uruchomienie 2026-08-12, endpoint sprawdza teraz osiągalność i odrzuca zadanie za darmo z nazwanym błędem, content[1].image_url: media not found (HTTP 404). Ta konkretna luka jest zamknięta. Luka z wzajemnie wykluczającymi się wejściami nie jest. W przypadku matematyki kredytów na klip, Kredyty MiniMax H3 na wideo zawiera tabele.

Czyja twarz, czyj głos: Sprawdź to, zanim prześlesz referencję

Ten endpoint różni się od tekstu na wideo w jeden istotny prawnie sposób: to ty dostarczasz podobiznę. Referencyjny obraz prawdziwej osoby, referencyjny klip z czyjegoś filmu, referencyjny wokal w rozpoznawalnym głosie – wszystko to jest materiałem, do którego użycia twierdzisz, że masz prawo. Zasady dotyczące treści po stronie modelu nadal mają zastosowanie na dodatek, i są bardziej rygorystyczne w przypadku prawdziwych ludzi niż wymyślonych. Dwa przewodniki warte przeczytania, zanim klient zobaczy wynik: Ograniczenia treści MiniMax H3 oraz opis użytkowania komercyjnego i licencji, który obejmuje również wykluczenia terytorialne w warunkach MiniMax.

MiniMax H3 Reference to Video: Często zadawane pytania

Czy MiniMax H3 reference to video może utrzymać tę samą postać w dwóch różnych ujęciach?

Tak, a mój test dwóch ujęć powyżej działa w poprzek pełnego odwrócenia oświetlenia z nocy na poranek. Ale sam obraz postaci nie jest tym, co to robi. Niezawodny wzorzec polega na przekazaniu URL wyjściowego poprzedniego ujęcia z powrotem jako referencyjnego wideo wraz z obrazem postaci, aby drugie wywołanie odziedziczyło gradację i ziarno, a także tożsamość.

Czy mogę użyć obrazu pierwszej klatki i referencji w tym samym wywołaniu MiniMax H3 reference to video?

Nie, a tryb awarii stanowi problem. Wysłanie zarówno image, jak i refers nie powoduje błędu. Przetestowane 2026-08-12, zadanie ukończone w 115 sekund, naliczone $0.40, po cichu odrzuciło jedno z dwóch wejść. To samo dzieje się w odwrotnej sytuacji w endpointcie image-to-video. Wybierz jedną ścieżkę na wywołanie.

Czy mogę wysłać sam plik audio jako referencję MiniMax H3 reference to video?

Nie. Audio musi podróżować z co najmniej jednym referencyjnym obrazem lub wideo, a endpoint egzekwuje to jawnym błędem: reference-to-video requires at least one reference image or video. Pojawia się na etapie generowania, a nie przy wysyłaniu, a odrzucone zadanie jest darmowe. Referencje audio muszą również mieścić się w przedziale 2–15 sekund, łącznie 15 sekund, i być zadeklarowane jako audio/mp3, a nie audio/mpeg.

Czy MiniMax H3 reference to video pobiera dodatkową opłatę za każdy plik referencyjny?

Nie na Atlas Cloud. Uruchomienie z dziesięcioma obrazami referencyjnymi i uruchomienie z jednym kosztowały identyczne $0.40 przy 768P i 4 sekundach, więc licznik śledzi tylko sekundy wyjściowe i rozdzielczość. Warto jednak zauważyć sprzeczność: własne zasady MiniMax wspominają o pomiarze wideo wejściowego według stawki wyjściowej, a inne platformy ujawniają osobną pozycję dla obrazów referencyjnych. Sprawdź na swoim interfejsie rozliczeniowym.

Co się stanie, jeśli jeden z moich URL referencyjnych MiniMax H3 reference to video będzie uszkodzony?

Od 2026-08-12 endpoint sprawdza osiągalność i odrzuca całe zadanie za darmo, z komunikatem content[1].image_url: media not found (HTTP 404) po około 21 sekundach. To zmiana: wcześniej w sierpniu to samo żądanie zostało ukończone, po cichu zignorowało brakującą referencję i naliczyło pełną cenę. Nie zakładaj, że starsze raporty o zachowaniu nadal obowiązują, i koniecznie sprawdź pole status, zamiast zakładać, że HTTP 200 przy wysyłaniu cokolwiek znaczy.

Czy MiniMax H3 reference to video jest faktycznie najlepszym modelem do tego?

W jedynym publicznym bezpośrednim porównaniu, które to mierzy, tak, nieznacznie. MiniMax H3 prowadzi w rankingu edycji wideo z wynikiem Elo 1.125 przy 10.280 głosach, ale jego zakres pozycji to 1–2, a Gemini Omni Flash jest 3 punkty Elo za nim z nakładającym się przedziałem. Traktuj go jako „wspólnie najlepszy dostępny”, wybieraj na podstawie reszty przepływu pracy i przeczytaj Alternatywy dla MiniMax H3, jeśli remis ma dla ciebie znaczenie.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele