Wiesz już, jak podpowiadać modelowi wideo. „Oświetlenie filmowe, powolny najazd, 4K.” To słownictwo wystarczało ci przez dwa lata. Potem wklejasz je do MiniMax H3 i dostajesz klip 2K, który ma własną ścieżkę dźwiękową. Obraz wygląda świetnie. Tempo jest rozwleczone. Dwie litery w twoim tytule są błędnie napisane. Audio to jakiś pomieszczeniowy szum, który model wybrał dla ciebie.
Model nie jest problemem. Podrzuciłeś mu zdanie. On chciał harmonogramu.
Więc przeczytałem wszystkie 45 przykładowych podpowiedzi, które MiniMax dostarczył z H3, oraz gotowe klipy, które im towarzyszyły, i rozłożyłem klatki na części. Oficjalne podpowiedzi nie są opisami. Dobre są listami ujęć z przypiętą z tyłu kartą wskazówek muzycznych. Poniżej znajdziesz strukturę, parametry, które są obecnie faktycznie dostępne, oraz jedno demo, które możesz odtworzyć w około dwadzieścia minut.
Kluczowe wnioski
- Podpowiedzi H3 to osie czasu, a nie opisy. Najsilniejsze oficjalne przykłady dosłownie dzielą klip na znaczniki [0s-2s], [2s-4s], a gotowy film trafia w każdy beat.
- Dźwięk i obraz pochodzą z tego samego przebiegu, więc audio musi żyć w ciele podpowiedzi. Oficjalne podpowiedzi dają mu własny blok, aż do „wchodzi jazzowy bas w 6s.”
- Tekst, który przeliterujesz, wraca czysty. Tekst, którego nie przeliterujesz, wraca jako szum w kształcie liter. Mam wycinki klatek z pojedynczego oficjalnego klipu, które dowodzą obu połówek naraz.
- image-to-video akceptuje end_image. Podaj pierwszą klatkę i ostatnią klatkę, a łuk emocjonalny jest przypięty, zanim wydasz sekundę obliczeń.
- Długość podpowiedzi nie jest zaletą. Krótkie oficjalne podpowiedzi działają, gdy obraz referencyjny robi za opis. Długość odpowiada temu, ile pracy odmówiłeś przekazania referencji.
Pies „This Is Fine”, wciąż po lewej i płonący w 10 sekundach wyjścia MiniMax H3 po prawej
To ten sam rysunek po obu stronach. Po lewej oryginalny panel KC Greena, nietknięty. Po prawej jedno wywołanie image-to-video: pierwsza klatka w środku, ostatnia klatka w środku, dziesięć sekund na zewnątrz, a trzask ognia i płaskie, małe „this is fine” to własna ścieżka audio modelu. Nikt tego nie nagrał. Wszystko w tym przewodniku ma na celu doprowadzenie cię do tej drugiej połowy.
Jak faktycznie wygląda podpowiedź MiniMax H3 (przeczytałem wszystkie 45)
Każdy „przewodnik po podpowiedziach MiniMax H3” aktualnie na pierwszej stronie wyszukiwania to karta specyfikacji: 2K, 24fps, 5 do 15 sekund, natywne audio. To jest karta modelu. To nie jest podpowiedź.
Oto prawdziwa. To fragment oficjalnej podpowiedzi stojącej za tytułową sekwencją noir MiniMax, przetłumaczony z chińskiego oryginału, mniej więcej jedna trzecia pełnej długości:
Wygeneruj 15-sekundową, 16:9 sekwencję tytułową lekkiego kryminału noir. Ogólny styl nawiązuje do języka wizualnego tych obrazów: retro japońskie karty tytułowe anime, ostre sylwetki, komiksowy kolaż, asymetryczny podzielony ekran, mocne geometryczne bloki kolorów, angielskie napisy tytułowe, trochę japońskiej dekoracji katakana, klimat jazzowo-kryminalny. Nastrój to 60% suspens, 40% jazz: tajemniczy, fajny, zwinny, miejski kryminał, nie horror, nie ciężki, i nie zamieniaj go w wesoły jazzowy teledysk.
[...] Angielskie napisy muszą być wyraźnie czytelne [...] Nie dodawaj chińskiego, nie produkuj zniekształconego tekstu, nie popełniaj błędów w angielskim. Zasada dla całego utworu: każdy angielski napis i tytuł stanowiska pojawia się dokładnie raz. Nie powtarzaj tytułu stanowiska, nie powtarzaj nazwiska, nie dawaj jednej osobie wielu tytułów.
Przejścia muszą być zróżnicowane: okrągła maska winylowa, pionowe wycieranie drzwi samochodu, długi cień postaci przesuwający się po ekranie, cięcie czerwonej linii, gigantyczna maska angielskiej litery, rekompozycja podzielonego ekranu, ostre cięcie bloku koloru, panele wklejane blok po bloku. Wszystkie przejścia lądują na uderzeniach perkusji: ostre, pełne napięcia, zwinne, komiksowy kolaż. Żadnych miękkich rozpuszczeń, żadnych płynnych przejść.
BGM: oryginalna 15-sekundowa muzyka tytułowa, 60% suspens, 40% jazz. Zbudowana z ciągłego tonu basu, napiętych pizzicato smyczków, zimnych pulsów syntezatora, stopy perkusji, rzadkich jazzowych szczotek, fragmentu kroczącego basu, krótkich fraz saksofonu barytonowego i krótkich wstawek blachy. Pierwsze 2 sekundy budują napięcie niskimi częstotliwościami i hi-hatem, w 3 sekundzie wchodzą niskie bębny, w 6 sekundzie dołącza jazzowy bas, w 10 sekundzie pojawia się krótki riff saksofonu/blachy, ostatnie 2 sekundy domykają napiętym akordem i uderzeniem perkusji.
Zobacz, gdzie poszły słowa. Prawie żadne z nich nie poszło w „piękny” czy „filmowy”. Poszły na listę negatywną, listę przejść i sekundową kartę muzyczną. To jest kształt zadania.
Oficjalna sekwencja tytułowa noir MiniMax H3: MIDNIGHT LINE, z czystymi napisami STARRING
Spójrz na napisy w tym klipie. MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS. Poprawnie napisane, żaden tytuł stanowiska nie użyty dwa razy, dekoracja katakana siedzi tam, gdzie miała. Podpowiedź nie mówiła „zrób ładne napisy”. Mówiła: bez powtórzeń, bez błędów, bez chińskiego, i nazwała estetykę na pięć różnych sposobów.
Pięć tablic referencyjnych stylu podanych MiniMax H3 wraz z podpowiedzią noir
Te pięć tablic weszło z tekstem. Pięć obrazów plus jeden długi brief, jedna generacja. Tak wygląda teraz ta praca.
A powód, dla którego tak wiele z 45 podpowiedzi jest krótkich, siedzi na obrazku. W całym zestawie mediana podpowiedzi to około 130 chińskich znaków, ale dwie najdłuższe mają 657 i 858. Krótkie są krótkie, ponieważ tablica referencyjna niesie opis. Długie są długie, bo nic innego nie miało go nieść.
Dlaczego większość podpowiedzi MiniMax H3 wypada płasko i poprawka na zniekształcony tekst
Trzy rzeczy idą źle i wszystkie są nieobecnościami, a nie błędami.
Brak osi czasu. Poprosiłeś o dziesięć sekund i opisałeś jeden moment, więc dostajesz jeden powolny najazd rozciągnięty na dziesięć sekund. Model nie miał nic do roboty w siódmej sekundzie.
Brak bloku audio. Dźwięk jest generowany w tym samym przebiegu co obraz. Jeśli nic nie powiesz, model i tak dostarczy ci ścieżkę. Po prostu wybiera jedną.
Brak listy negatywnej. Pozostawiony sam sobie model sięga po miękkie rozpuszczenia, wymyśla dodatkowy tekst na ekranie i dodaje pasek napisów, o który nikt nie prosił.
Najlepszym dowodem jest oficjalna podpowiedź interfejsu gry, która zbudowana jest z sześciu oznaczonych czasowo beatów: [0s-2s] menu, [2s-4s] panel prawego ramienia, [4s-7s] siatka uzbrojenia, [7s-8.5s] potwierdzenie, [8.5s-10s] pasek ładowania, [10s-15s] świat ładuje się. Gotowy klip trafia we wszystkie sześć, po kolei, na czas.
Klip interfejsu gry MiniMax H3: menu, panel wyposażenia, pasek ładowania, załadowanie świata
A teraz uczciwa połowa, z tego samego klipu, w pełnej rozdzielczości 2560x1440.
Po lewej: tekst przeliterowany w podpowiedzi renderuje się czysto. Po prawej: tekst nieprzeliterowany renderuje się jako szum w kształcie liter
Po lewej każdy ciąg, który podpowiedź faktycznie wypisała: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW. Ostry, poprawny, wyjustowany jak prawdziwe menu gry.
Po prawej HUD w końcowym ujęciu ulicy, który podpowiedź nazwała tylko „elementami HUD”. Czytamy ETR METNO CITFEP. Nad ikonami wyposażenia, gdzie podpowiedź nic nie powiedziała, dostajesz MNALEαIN IAMG. To nie jest błąd renderowania. Model rysuje teksturę angielskiego, ponieważ nigdy nie dostał ciągu.
Więc poprawka nie jest ustawieniem. To nawyk:
Jeśli słowo ma być czytelne, wpisz słowo. Następnie dodaj linię negatywną: nie popełniaj błędów, nie dodawaj innego tekstu, nie dodawaj napisów.
A oto sześcioblokowy kształt, który dzielą wszystkie silne oficjalne podpowiedzi.
| Blok | Co w nim jest | Przykład z oficjalnej podpowiedzi | Pomiń go, a dostaniesz |
|---|---|---|---|
| 1. Kontrakt stylistyczny | Medium, faktura, paleta, era, wygląd, którego nie możesz stracić | „retro japońskie karty tytułowe anime, ostre sylwetki, komiksowy kolaż, mocne geometryczne bloki kolorów” | Generyczny, błyszczący render, który dryfuje do szóstej sekundy |
| 2. Oś czasu | Dosłowne wycinki czasu z akcją w każdym | [2s-4s] Płynny zoom na jej prawe ramię. Panel UI wsuwa się z prawej | Jeden pomysł rozciągnięty na cały czas trwania |
| 3. Kamera | Ruch lub wyraźna odmowa ruchu | „zablokowana, statyczny szeroki plan, bez najazdu, bez cięć” | Domyślny powolny dolly, o który nie prosiłeś |
| 4. Audio | Każdy dźwięk i moment jego wejścia | „w 6 sekundzie dołącza jazzowy bas, ostatnie 2 sekundy domykają napiętym akordem” | Jakikolwiek pomieszczeniowy szum model lubi dziś |
| 5. Tekst, przeliterowany | Dosłowne ciągi, w cudzysłowie | „THIS IS FINE.” / CONFIRM CONFIG | Szum w kształcie liter, jak wyżej |
| 6. Lista negatywna | Przejścia, obiekty i klisze, którym odmawiasz | „Bez miękkich rozpuszczeń, bez płynnych przejść, nie dodawaj chińskiego, nie powtarzaj tytułu stanowiska” | Miękkie rozpuszczenia, wymyślony tekst, niepokojący dryf |
Bloki 5 i 6 są darmowe. Nie kosztują nic dodatkowo do wygenerowania, a w nich tkwi większość jakości.
Przepływ pracy z podpowiedzią MiniMax H3: do którego punktu końcowego należy twoja podpowiedź
Ten sam klucz, ten sam kształt wyślij-i-sprawdź, trzy drzwi. Które wybierzesz, decyduje o tym, co twoja podpowiedź wciąż musi zrobić.
| Punkt końcowy | Co mu dajesz | Co ci blokuje | Parametry warte poznania | Sięgnij po to, gdy | Rozliczanie |
|---|---|---|---|---|---|
| minimax/h3/text-to-video | Tylko podpowiedź | Nic. Tekst niesie wszystko | duration 5-10 (domyślnie 8), resolution 2K, ratio musi być ustawione jawnie | Testujesz wygląd lub projekt dźwięku przed zobowiązaniem się | Rozliczane za sekundę wyjścia, aktualna stawka na stronie modelu |
| minimax/h3/image-to-video | Podpowiedź + obraz (pierwsza klatka), opcjonalnie end_image | Gdzie klip się zaczyna i opcjonalnie gdzie ląduje | end_image, duration 5-10 (domyślnie 8), ratio adaptacyjne domyślnie | Masz grafikę i chcesz, żeby się poruszyła bez przerysowywania | Rozliczane za sekundę wyjścia |
| minimax/h3/reference-to-video | Podpowiedź + refers[] | Tożsamość obiektu i styl, w scenie, którą wymyślasz | refers[] mixed array, duration 5-15, ratio do 21:9 | Ta sama postać lub produkt, nowe środowisko | Rozliczane za sekundę wyjścia |
refers[] to ten, który jest naprawdę słabo udokumentowany w sieci, więc oto kształt, jakiego oczekuje:
json1"refers": [ 2 { "url": "https://.../subject.png", "type": "image" }, 3 { "url": "https://.../style-board.png" }, 4 { "url": "https://.../motion-ref.mp4", "type": "video" }, 5 { "url": "https://.../beat.mp3", "type": "audio" } 6] 7
Cztery zasady, z których każda uratuje ci zmarnowaną generację:
- Audio nie może jechać samo. Co najmniej jeden obraz lub wideo musi być w tablicy. Ścieżka beatowa sama jest odrzucana.
- type jest opcjonalny. Jest wnioskowany z adresu URL, ale podaj go mimo to, gdy rozszerzenie jest niejednoznaczne.
- Limity są realne. Do 9 obrazów, 3 wideo i 3 klipów audio, łącznie 12 plików, z referencyjnym wideo i audio trwającymi od 2 do 15 sekund każdy (dokumentacja API MiniMax, lipiec 2026).
- Daj każdej referencji zadanie w tekście podpowiedzi. To nawyk o najwyższej dźwigni na tej liście. Oficjalne podpowiedzi zaczynają się od linii takich jak „Obraz 1 jest ogólnym nastrojem i referencją stylu, Obraz 2 jest referencją głównej postaci.” Bez tego zdania model musi zgadnąć, która tablica co oznacza.
Teledysk dark-pop MiniMax H3: CUT BACK, ONE LOOK, DETONATE typografia
Dwie tablice referencyjne typografii stojące za klipem dark-pop
Ten klip jest argumentem za zasadą 4. Jego podpowiedź nigdy nie opisuje pojedynczej litery. Mówi „styl i faktura pakowania tekstu odnoszą się do obrazów” i przekazuje dwie tablice. Układ pojawił się, ponieważ został pokazany, a nie opisany.
Jeszcze jedna tabela, ponieważ karta modelu i API obecnie nie mówią tego samego, a luka jest tam, gdzie ludzie tracą popołudnie.
| Rzecz | Własna dokumentacja MiniMax | Co punkty końcowe faktycznie akceptują dziś | Co to oznacza dla twojej podpowiedzi |
|---|---|---|---|
| Czas trwania | 4 do 15 sekund, tylko liczby całkowite | text-to-video i image-to-video: 5 do 10, domyślnie 8. reference-to-video: 5 do 15, domyślnie 8 | 15-sekundowa lista ujęć pasuje tylko do reference-to-video. Przepisz dłuższe tablice na 10 |
| Rozdzielczość | 2K | resolution domyślnie 2K, a 2K jest obecnie jedyną działającą wartością. Zadanie 768p wraca z komunikatem model MiniMax-H3 nie obsługuje rozdzielczości 768P, obsługiwane rozdzielczości: 2K, mimo że 768p pojawia się w tabeli cenowej | Pisz dla krótszego boku 1440px. Szczegóły, o które poprosisz, faktycznie przetrwają |
| Proporcje obrazu | Typowe proporcje lub adaptacyjne | image-to-video i reference-to-video domyślnie adaptacyjne. Tylko tekst odrzuca adaptacyjne i zwraca dozwolony zestaw: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9 | W text-to-video ustaw jawnie ratio, inaczej zadanie nie przejdzie walidacji |
| Mieszane referencje | 9 obrazów, 3 wideo, 3 audio, 12 plików, audio nigdy samo | refers[] przyjmuje {url, type} z obrazem, wideo lub audio, co najmniej jeden obraz lub wideo | Naprawdę możesz zsynchronizować ruch z dostarczonym bitem. Po prostu nie możesz dostarczyć tylko bitu |
| Natywne audio | Audio stereo w tym samym przebiegu | Każdy z dziewięciu oficjalnych klipów, które zbadałem: 2560x1440, 24fps, AAC stereo przy 32 kHz | Blok audio to nie dekoracja. To połowa dostarczanego materiału |
Wszystko powyżej uruchomiono na Atlas Cloud, gdzie wszystkie trzy punkty końcowe H3 siedzą za jednym kluczem i jedną pętlą wyślij-i-sprawdź, więc przełączanie między nimi to zmiana ciągu modelu i nic więcej.
Samouczek podpowiedzi MiniMax H3: Podpal psa „This Is Fine” z dźwiękiem
Oto całość od początku do końca. Żart działa, ponieważ pies nic nie robi. Rozciągnij tę odmowę na dziesięć sekund prawdziwego czasu, dodaj prawdziwy ogień i pozwól, aby ostatnie dwie sekundy poszły tam, gdzie faktycznie poszedł oryginalny komiks, a staje się to zabawniejsze i nieco gorsze dla ciebie. Większość ludzi widziała tylko pierwsze dwa panele.
Krok 1: Pobierz oryginalny komiks. Nie pozwól AI go przerysować.
Pasek ma sześć paneli, dwie kolumny na trzy rzędy, 600 na 887. Chcemy tylko panel 2 i panel 6.
bash1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png 2# 600x887, 6 paneli, 2 kol x 3 rzędy 3 4# przytnij panel 2 (panel „THIS IS FINE.”): x 302-584, y 20-293 5# przytnij panel 6 (topniejący pies): x 302-584, y 595-868 6# przeskaluj każdy 4x Lanczos -> 1128x1092 7
Powiedz to wprost: nie proś modelu obrazu o narysowanie „psa, który wygląda jak This Is Fine.” Rekreacja AI zostaje zdemaskowana jako fałszywa w pół sekundy, a żart umiera na miejscu. Akwarelowa faktura, chwiejne ręczne liternictwo i ziarno papieru to cały kontrakt. Przeskalowanie 4x Lanczos jest tylko dlatego, że 282px źródła jest cienkie; daje modelowi prawdziwe piksele, których może się trzymać, bez wymyślania żadnych.
Panel 2 i panel 6 oryginalnego komiksu, oznaczone jako wejście pierwszej klatki i obrazu końcowego
Krok 2: Uruchom na image-to-video z end_image.
Model: minimax/h3/image-to-video. Ustawienia: resolution 2K, image = panel 2, end_image = panel 6, ratio 1:1, aby dopasować kwadratowe źródło. Ustaw duration na 10; suwak domyślnie znajduje się na 8, więc przeciągnij go.
text1Ręcznie malowany panel komiksu 2D, ożywiony. Zachowaj oryginalną akwarelową 2fakturę, widoczne kontury tuszem, nierejestrowane ziarno papieru i płaską 3komiksową paletę w każdej klatce. Nie wygładzaj, nie renderuj ponownie w 3D, 4nie czyść linii, nie dodawaj nowych obiektów, nie dodawaj nowego tekstu. 5 6[0s-3s] Prawie nic się nie porusza. Pies siedzi idealnie nieruchomo, trzymając 7kubek, oczy skierowane przed siebie. Tylko płomienie za nim poruszają się: 8powolne pomarańczowe lizania wspinające się po ścianie, jeden żar unoszący się 9w górę. Dymek z napisem „THIS IS FINE.” pozostaje dokładnie tam, gdzie jest, 10w pełni czytelny, niezmieniony, ręcznie litery. 11 12[3s-6s] Pies podnosi kubek i bierze jeden mały, spokojny łyk. Dymek znika po 13łyku. Ogień jaśnieje. Ściana za nim zaczyna się wyginać od gorąca. Jego 14kapelusz zaczyna się tlić na brzegu. 15 16[6s-8.5s] Gorąco dociera do niego. Jego uszy opadają, kontur mięknie i zaczyna 17spływać w dół jak mokra farba. Wciąż nie porusza oczami. Kubek pozostaje w jego 18łapie. 19 20[8.5s-10s] Całkowite stopienie. Twarz się deformuje, jedno oko ślizga, zęby 21odsłonięte w nieruchomym uśmiechu, futro płynie czerwienią i pomarańczą. 22Utzymuje pozę. Utrzymaj na ostatniej klatce przez ostatnie pół sekundy. 23 24Kamera: zablokowana, pojedyncze statyczne szerokie ujęcie, bez najazdu, bez 25ręcznego trzymania, bez cięć. Kadr nigdy się nie porusza. To jedno ciągłe 26ujęcie wewnątrz jednego panelu komiksu. 27 28Audio: pomieszczeniowy szum wewnętrznego ognia przez cały czas - niski trzask, 29okazjonalny popęk spalającego się drewna, cichy skrzyp konstrukcji. W 3s jeden 30ceramiczny kubek dotykający zębów i małe przełknięcie. Spokojny, płaski, 31niezaniepokojony męski głos mówi dokładnie: „This is fine.” - bez wyrazu, bez 32emocji, nieco zbyt zrelaksowany. Od 6s trzask staje się głośniejszy, a szum 33pomieszczeniowy gęstnieje; ostatnie 2 sekundy dodają niski przypływ subbasu. 34Bez muzyki, bez śmiechu, bez efektów dźwiękowych spoza tej listy. 35 36Nie dodawaj napisów. Nie dodawaj znaku wodnego. Nie pisz żadnego słowa innego 37niż słowa już obecne na obrazie. Nie zmieniaj „THIS IS FINE.” Nie odcinaj. 38
Ta podpowiedź to żywa tabela struktury. Akapit pierwszy to kontrakt stylistyczny. Cztery wycinki w nawiasach to oś czasu. Potem kamera, potem audio, potem lista negatywna. Nic w niej nie jest dekoracyjne.
MiniMax H3 image-to-video na Atlas Cloud: pierwsza klatka i obraz końcowy załadowane, 10 sekund w 2K, gotowy klip w panelu wyjściowym
Krok 3: Przeczytaj wyjście jak kontrolę jakości.
Cztery sprawdzenia, każde testujące inny blok podpowiedzi.
- Czy THIS IS FINE. w dymku jest wciąż czytelne i poprawnie napisane? To testuje blok 5.
- Czy linie przetrwały, czy coś je „poprawiło” w czyste 3D? To testuje blok 1.
- Czy audio zawiera tylko dźwięki, które wymieniłeś? Zbadaj kontener: powinien wrócić h264 plus AAC stereo.
- Czy ostatnia klatka ląduje na pozie panelu 6? To testuje end_image.
bash1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \ 2 -of default=noprint_wrappers=1 output.mp4 3
Mój wrócił w 1472x1440, 24fps, h264 plus AAC stereo, 10.13 sekundy. Warto zauważyć: poprosiłem o ratio: 1:1 i dostałem 1472x1440, więc w image-to-video kształt źródłowej klatki wygrywa. Dopasuj swoje dwa panele do kształtu, który faktycznie chcesz.
Cztery klatki z gotowego klipu w 0s, 3s, 6.5s i 10s, odpowiadające czterem wycinkom czasowym w podpowiedzi
Krok 4: Przenieś psa gdzieś nowego za pomocą reference-to-video.
Ta sama postać, nowy pokój. Model: minimax/h3/reference-to-video. Ustawienia: refers[] = panel 2 jako image, duration 8, resolution 2K, ratio 16:9.
text1Obraz 1 jest referencją postaci i stylu artystycznego: zachowaj ten dokładny 2ręcznie malowany wygląd komiksu 2D, tę samą akwarelową fakturę, tę samą grubość 3konturu tuszem, tego samego psa, ten sam mały kapelusz, ten sam kubek. Nie 4przerysowuj go w 3D, nie zmieniaj jego proporcji, nie czyść linii. 5 6Umieść go w innym pomieszczeniu i zachowaj jego opanowanie. Ciasne biuro typu 7open-plan w nocy, migające świetlówki, ściana monitorów wszystkie pokazujące 8czerwony stan błędu, papier z drukarki opadający przez kadr, mały pożar 9elektryczny w rogu. On siedzi na biurowym krześle na środku kadru, kubek w 10łapie, patrząc prosto w kamerę, całkowicie zrelaksowany. 11 12Kamera: zablokowana, statyczne szerokie ujęcie. Bez najazdu, bez cięć. 13 14Audio: brzęczenie świetlówki, zgrzyt drukarki, powtarzający się miękki pisk 15alarmu co dwie sekundy, odległy trzask elektryczny, jeden spokojny łyk w 4s. 16Bez muzyki. Bez głosu. 17 18Nie dodawaj żadnego tekstu na ekranie. Nie dodawaj napisów. Nie dodawaj innych 19postaci. 20
Przenośna zasada: refers[] niesie tożsamość i styl, tekst niesie scenę. Ten podział to cały trik na spójność postaci i dlatego pierwsza linia podpowiedzi w ogóle istnieje.
Ten sam komiksowy pies przeniesiony do płonącego biura open-plan w nocy, wygenerowany przez MiniMax H3 reference-to-video
Ten sam kapelusz, ten sam kubek, ta sama grubość tuszu, nowy pokój. Jeden obraz referencyjny zrobił to wszystko.
Trzy kolejne wzorce podpowiedzi MiniMax H3 warte podkradnięcia
Wzorzec 1: plakat ruchomy, gdzie układ nie może się poruszać.
Plakat ruchomy MiniMax H3: układ POPUP! animuje się, podczas gdy kadr i typografia pozostają zablokowane
Oryginalny statyczny plakat podany MiniMax H3
Cała podpowiedź to dwie linie: zachowaj białą ramkę galerii, wewnętrzną ramkę, paletę czerwono-biało-czarną, odczucie figury 3D i strukturę układu niezmienioną, i podłóż zwinną efekcik dźwiękowy pod wejście tekstu. Zasada: nazwij części, które muszą przetrwać. „Zachowaj układ” to nie uwaga stylistyczna, to ograniczenie, a model traktuje je jako takie.
Wzorzec 2: demo interfejsu, gdzie czasowniki biją przymiotniki.
Demo strony docelowej MiniMax H3: przewijanie, najechanie, inwersja kolorów na stronie produktu
Pojedynczy obraz referencyjny produktu stojący za klipem strony docelowej
Ta podpowiedź prosi o przewinięcie w dół, stan najechania, mocne powiększenie i inwersję kolorów. Cztery czasowniki. Nigdy nie mówi „nowoczesny” czy „elegancki”. Interakcje to działania, więc pisz je jako działania. Przerośnięta kursywa i tło z węglowego splotu przyszły z przymiotników; to, co sprawia, że czyta się to jako prawdziwą stronę, przyszło z czasowników.
Wzorzec 3: live action plus ręcznie rysowane, trzymane razem przez odmowy.
Klip MiniMax H3 łączący live-action z kuchni z ręcznie rysowanymi świecącymi stworzeniami
To wieczorna kuchnia nakręcona telefonem z małymi świecącymi ręcznie rysowanymi stworzeniami, a powód, dla którego pozostaje urocza, zamiast zamieniać się w horror, to lista zakazów: bez wielkich oczu, bez rozciętych ust, bez kłów, bez groźnej postawy, bez skakania, bez nagłego przejścia do czerni, bez jumpscare’ów. Lista negatywna jest podstawowym narzędziem stylu, a nie poprawką. To także miejsce, w którym kodujesz gust.
Cztery klatki z oficjalnego zwiastuna sci-fi: THE STARS WERE LISTENING
Tablica nastroju i referencja postaci stojące za zwiastunem
Zwiastun powyżej zamyka pętlę na obu pomysłach. Podpowiedź przeliterowuje jeden tytuł, THE STARS WERE LISTENING, w szczegółach: niezwykle wąski, gruby, wszystkie wielkie litery, ciemna czerwień zmieszana z rdzą, lekki ziarno i zamglone krawędzie. Ten wraca dokładnie tak, jak zamówiony. Dwie tablice referencyjne obsługują nastrój i główną postać, więc tekst nigdy nie musi opisywać twarzy. Podział pracy, aż do samego końca.
Ile kosztuje uruchomienie tych podpowiedzi MiniMax H3
H3 jest rozliczane za sekundę wygenerowanego wideo, według rozdzielczości, więc model kosztów jest odświeżająco nudny: 15-sekundowe ujęcie kosztuje około trzy 5-sekundowe próby. Wszystko inne wynika z tego.
- Iteruj przy 5 sekundach, dostarczaj przy 10 lub 15. Kompozycja, paleta i projekt dźwięku rozstrzygają się przy 5. Nic w statycznym ujęciu nie wymaga pełnego czasu trwania, aby stwierdzić, że jest złe.
- end_image to narzędzie kosztowe, nie tylko kreatywne. Większość powtórek dzieje się, ponieważ zakończenie dryfowało. Przypięcie ostatniej klatki usuwa ten tryb awarii, zanim za niego zapłacisz.
- Listy negatywne i przeliterowany tekst są darmowe. Dodają znaki do podpowiedzi rozliczanej za sekundę, a nie za token. Używaj ich obficie.
- Dopasuj duration do punktu końcowego przed pisaniem. Zbudowanie 15-sekundowej listy ujęć, a następnie odkrycie, że twój punkt końcowy ogranicza do 10, kosztuje cię przepisanie, a nie tylko powtórkę.
Jedna rzecz, której nie planuj na razie: tabele cenowe wymieniają tańszy poziom 768p, ale w chwili pisania tego tekstu zadanie 768p jest odrzucane z miejsca, a 2K jest jedyną działającą rozdzielczością. Budżetuj tak, jakby każda sekunda była sekundą 2K. Aktualne stawki za sekundę znajdują się na stronie modelu, która jest również miejscem, gdzie pojawi się poziom 768p, gdy zostanie otwarty.
Podpowiedzi MiniMax H3, memy i prawa autorskie
Pies nie jest w domenie publicznej. This Is Fine pochodzi z komiksu internetowego KC Greena Gunshow #648, opublikowanego 9 stycznia 2013 r., a tylko pierwsze dwa panele stały się wirusowe (Know Your Meme, styczeń 2013). Green wypowiadał się publicznie i dość znużonie o tym, jak obraz jest używany w kółko, w tym przez ludzi, których polityki nie podziela (NPR, styczeń 2023).
Ten instruktaż jest komentarzem i nauczaniem, a nie biblioteką stockową. Jeśli chcesz dostarczyć coś komercyjnie, narysuj własne klatki lub licencjonuj te, których używasz. I przeprowadź własną kontrolę polityki przed zleceniem klienta: H3 stosuje zasady dotyczące treści do rozpoznawalnych prawdziwych osób i dobrze znanego IP, a dowiedzenie się tego w środku terminu nie jest przyjemne.
Często zadawane pytania
Czy MiniMax H3 generuje audio, czy dodaję je później?
Ten sam przebieg. Obraz i dźwięk wychodzą razem, co jest dokładnie powodem, dla którego audio musi być zapisane w treści podpowiedzi, a nie dodane później. Daj mu własny blok Audio: i określ, kiedy każdy dźwięk wchodzi. Każdy z dziewięciu oficjalnych klipów, które zbadałem, wrócił jako AAC stereo przy 32 kHz obok strumienia wideo 2560x1440, 24fps.
Jak długa może być podpowiedź MiniMax H3?
Do 7000 znaków, według dokumentacji MiniMax. W praktyce oficjalne przykłady obejmują szeroki zakres, z medianą około 130 chińskich znaków i dwiema najdłuższymi na 657 i 858. Krótkie podpowiedzi działają dobrze, gdy obraz referencyjny robi za opis. Jeśli nie masz referencji, spodziewaj się napisać listę ujęć.
Dlaczego tekst w moich filmach MiniMax H3 wychodzi zniekształcony?
Ponieważ go nie wpisałeś. Ciągi, które pojawiają się dosłownie w podpowiedzi, renderują się czysto; wszystko, co określasz ogólnie („elementy HUD”, „jakieś etykiety”), wraca jako tekstura w kształcie liter. Przeliteruj każde słowo, które ma być czytelne, a następnie dodaj nie popełniaj błędów, nie dodawaj innego tekstu, nie dodawaj napisów.
Ile obrazów referencyjnych, filmów i klipów audio może użyć jedna podpowiedź MiniMax H3?
Dziewięć obrazów, trzy filmy i trzy klipy audio, łącznie dwanaście plików, z referencyjnym wideo i audio trwającymi od 2 do 15 sekund każdy. Audio nie może być jedyną referencją. Należy zauważyć, że możliwości modelu i to, co dany punkt końcowy udostępnia, to dwie różne rzeczy, więc sprawdź stronę modelu po aktualną listę wejść.
Czy podpowiedź MiniMax H3 może kontrolować, jak kończy się klip, a nie tylko jak się zaczyna?
Tak, w image-to-video za pomocą opcjonalnego parametru end_image. Podaj pierwszą klatkę i ostatnią klatkę, a klip interpoluje między nimi. Powyższe demo jest dokładnie tym: panel komiksu 2 na wejściu, panel 6 na wyjściu. Utrzymuj oba obrazy w podobnych proporcjach, w przeciwnym razie przejście staje się brzydkie.
Jakie czas trwania i rozdzielczości mogę faktycznie uzyskać teraz?
2K i tylko 2K. Zadanie 768p jest obecnie odrzucane z komunikatem obsługiwane rozdzielczości: 2K, mimo że 768p pojawia się w tabeli cenowej. Czas trwania różni się w zależności od punktu końcowego: text-to-video i image-to-video akceptują 5 do 10 sekund z domyślnym 8, podczas gdy reference-to-video akceptuje 5 do 15. Jeszcze jeden haczyk: w generacji tylko tekstowej API odrzuca adaptive i wymaga jawnego ratio.






