TYLKO DWA TYGODNIE | 20% ZNIŻKI na Seedream 5.0 Pro!

MiniMax H3 Prompt Guide: Przeczytałem wszystkie 45 oficjalnych promptów, a potem podpaliłem psa This Is Fine

Przewodnik po promptach MiniMax H3 zbudowany na podstawie wszystkich 45 przykładowych promptów MiniMax: struktura sześciu bloków, sztuczka end_image, natywne wskazówki audio oraz naprawa zniekształconego tekstu.

Wiesz już, jak podpowiadać modelowi wideo. „Oświetlenie filmowe, powolny najazd, 4K.” To słownictwo wystarczało ci przez dwa lata. Potem wklejasz je do MiniMax H3 i dostajesz klip 2K, który ma własną ścieżkę dźwiękową. Obraz wygląda świetnie. Tempo jest rozwleczone. Dwie litery w twoim tytule są błędnie napisane. Audio to jakiś pomieszczeniowy szum, który model wybrał dla ciebie.

Model nie jest problemem. Podrzuciłeś mu zdanie. On chciał harmonogramu.

Więc przeczytałem wszystkie 45 przykładowych podpowiedzi, które MiniMax dostarczył z H3, oraz gotowe klipy, które im towarzyszyły, i rozłożyłem klatki na części. Oficjalne podpowiedzi nie są opisami. Dobre są listami ujęć z przypiętą z tyłu kartą wskazówek muzycznych. Poniżej znajdziesz strukturę, parametry, które są obecnie faktycznie dostępne, oraz jedno demo, które możesz odtworzyć w około dwadzieścia minut.

Kluczowe wnioski

  • Podpowiedzi H3 to osie czasu, a nie opisy. Najsilniejsze oficjalne przykłady dosłownie dzielą klip na znaczniki [0s-2s], [2s-4s], a gotowy film trafia w każdy beat.
  • Dźwięk i obraz pochodzą z tego samego przebiegu, więc audio musi żyć w ciele podpowiedzi. Oficjalne podpowiedzi dają mu własny blok, aż do „wchodzi jazzowy bas w 6s.”
  • Tekst, który przeliterujesz, wraca czysty. Tekst, którego nie przeliterujesz, wraca jako szum w kształcie liter. Mam wycinki klatek z pojedynczego oficjalnego klipu, które dowodzą obu połówek naraz.
  • image-to-video akceptuje end_image. Podaj pierwszą klatkę i ostatnią klatkę, a łuk emocjonalny jest przypięty, zanim wydasz sekundę obliczeń.
  • Długość podpowiedzi nie jest zaletą. Krótkie oficjalne podpowiedzi działają, gdy obraz referencyjny robi za opis. Długość odpowiada temu, ile pracy odmówiłeś przekazania referencji.

Pies „This Is Fine”, wciąż po lewej i płonący w 10 sekundach wyjścia MiniMax H3 po prawej

To ten sam rysunek po obu stronach. Po lewej oryginalny panel KC Greena, nietknięty. Po prawej jedno wywołanie image-to-video: pierwsza klatka w środku, ostatnia klatka w środku, dziesięć sekund na zewnątrz, a trzask ognia i płaskie, małe „this is fine” to własna ścieżka audio modelu. Nikt tego nie nagrał. Wszystko w tym przewodniku ma na celu doprowadzenie cię do tej drugiej połowy.

Jak faktycznie wygląda podpowiedź MiniMax H3 (przeczytałem wszystkie 45)

Każdy „przewodnik po podpowiedziach MiniMax H3” aktualnie na pierwszej stronie wyszukiwania to karta specyfikacji: 2K, 24fps, 5 do 15 sekund, natywne audio. To jest karta modelu. To nie jest podpowiedź.

Oto prawdziwa. To fragment oficjalnej podpowiedzi stojącej za tytułową sekwencją noir MiniMax, przetłumaczony z chińskiego oryginału, mniej więcej jedna trzecia pełnej długości:

Wygeneruj 15-sekundową, 16:9 sekwencję tytułową lekkiego kryminału noir. Ogólny styl nawiązuje do języka wizualnego tych obrazów: retro japońskie karty tytułowe anime, ostre sylwetki, komiksowy kolaż, asymetryczny podzielony ekran, mocne geometryczne bloki kolorów, angielskie napisy tytułowe, trochę japońskiej dekoracji katakana, klimat jazzowo-kryminalny. Nastrój to 60% suspens, 40% jazz: tajemniczy, fajny, zwinny, miejski kryminał, nie horror, nie ciężki, i nie zamieniaj go w wesoły jazzowy teledysk.

[...] Angielskie napisy muszą być wyraźnie czytelne [...] Nie dodawaj chińskiego, nie produkuj zniekształconego tekstu, nie popełniaj błędów w angielskim. Zasada dla całego utworu: każdy angielski napis i tytuł stanowiska pojawia się dokładnie raz. Nie powtarzaj tytułu stanowiska, nie powtarzaj nazwiska, nie dawaj jednej osobie wielu tytułów.

Przejścia muszą być zróżnicowane: okrągła maska winylowa, pionowe wycieranie drzwi samochodu, długi cień postaci przesuwający się po ekranie, cięcie czerwonej linii, gigantyczna maska angielskiej litery, rekompozycja podzielonego ekranu, ostre cięcie bloku koloru, panele wklejane blok po bloku. Wszystkie przejścia lądują na uderzeniach perkusji: ostre, pełne napięcia, zwinne, komiksowy kolaż. Żadnych miękkich rozpuszczeń, żadnych płynnych przejść.

BGM: oryginalna 15-sekundowa muzyka tytułowa, 60% suspens, 40% jazz. Zbudowana z ciągłego tonu basu, napiętych pizzicato smyczków, zimnych pulsów syntezatora, stopy perkusji, rzadkich jazzowych szczotek, fragmentu kroczącego basu, krótkich fraz saksofonu barytonowego i krótkich wstawek blachy. Pierwsze 2 sekundy budują napięcie niskimi częstotliwościami i hi-hatem, w 3 sekundzie wchodzą niskie bębny, w 6 sekundzie dołącza jazzowy bas, w 10 sekundzie pojawia się krótki riff saksofonu/blachy, ostatnie 2 sekundy domykają napiętym akordem i uderzeniem perkusji.

Zobacz, gdzie poszły słowa. Prawie żadne z nich nie poszło w „piękny” czy „filmowy”. Poszły na listę negatywną, listę przejść i sekundową kartę muzyczną. To jest kształt zadania. Noir anime banner featuring a silhouetted figure on a subway train Oficjalna sekwencja tytułowa noir MiniMax H3: MIDNIGHT LINE, z czystymi napisami STARRING

Spójrz na napisy w tym klipie. MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS. Poprawnie napisane, żaden tytuł stanowiska nie użyty dwa razy, dekoracja katakana siedzi tam, gdzie miała. Podpowiedź nie mówiła „zrób ładne napisy”. Mówiła: bez powtórzeń, bez błędów, bez chińskiego, i nazwała estetykę na pięć różnych sposobów. Five cinematic noir panels featuring silhouetted characters in blue and orange Pięć tablic referencyjnych stylu podanych MiniMax H3 wraz z podpowiedzią noir

Te pięć tablic weszło z tekstem. Pięć obrazów plus jeden długi brief, jedna generacja. Tak wygląda teraz ta praca.

A powód, dla którego tak wiele z 45 podpowiedzi jest krótkich, siedzi na obrazku. W całym zestawie mediana podpowiedzi to około 130 chińskich znaków, ale dwie najdłuższe mają 657 i 858. Krótkie są krótkie, ponieważ tablica referencyjna niesie opis. Długie są długie, bo nic innego nie miało go nieść.

Dlaczego większość podpowiedzi MiniMax H3 wypada płasko i poprawka na zniekształcony tekst

Trzy rzeczy idą źle i wszystkie są nieobecnościami, a nie błędami.

Brak osi czasu. Poprosiłeś o dziesięć sekund i opisałeś jeden moment, więc dostajesz jeden powolny najazd rozciągnięty na dziesięć sekund. Model nie miał nic do roboty w siódmej sekundzie.

Brak bloku audio. Dźwięk jest generowany w tym samym przebiegu co obraz. Jeśli nic nie powiesz, model i tak dostarczy ci ścieżkę. Po prostu wybiera jedną.

Brak listy negatywnej. Pozostawiony sam sobie model sięga po miękkie rozpuszczenia, wymyśla dodatkowy tekst na ekranie i dodaje pasek napisów, o który nikt nie prosił.

Najlepszym dowodem jest oficjalna podpowiedź interfejsu gry, która zbudowana jest z sześciu oznaczonych czasowo beatów: [0s-2s] menu, [2s-4s] panel prawego ramienia, [4s-7s] siatka uzbrojenia, [7s-8.5s] potwierdzenie, [8.5s-10s] pasek ładowania, [10s-15s] świat ładuje się. Gotowy klip trafia we wszystkie sześć, po kolei, na czas. Game menu showing selection of a robotic Phantom Grip arm Klip interfejsu gry MiniMax H3: menu, panel wyposażenia, pasek ładowania, załadowanie świata

A teraz uczciwa połowa, z tego samego klipu, w pełnej rozdzielczości 2560x1440. Comparison of legible game UI text and garbled AI text Po lewej: tekst przeliterowany w podpowiedzi renderuje się czysto. Po prawej: tekst nieprzeliterowany renderuje się jako szum w kształcie liter

Po lewej każdy ciąg, który podpowiedź faktycznie wypisała: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW. Ostry, poprawny, wyjustowany jak prawdziwe menu gry.

Po prawej HUD w końcowym ujęciu ulicy, który podpowiedź nazwała tylko „elementami HUD”. Czytamy ETR METNO CITFEP. Nad ikonami wyposażenia, gdzie podpowiedź nic nie powiedziała, dostajesz MNALEαIN IAMG. To nie jest błąd renderowania. Model rysuje teksturę angielskiego, ponieważ nigdy nie dostał ciągu.

Więc poprawka nie jest ustawieniem. To nawyk:

Jeśli słowo ma być czytelne, wpisz słowo. Następnie dodaj linię negatywną: nie popełniaj błędów, nie dodawaj innego tekstu, nie dodawaj napisów.

A oto sześcioblokowy kształt, który dzielą wszystkie silne oficjalne podpowiedzi.

BlokCo w nim jestPrzykład z oficjalnej podpowiedziPomiń go, a dostaniesz
1. Kontrakt stylistycznyMedium, faktura, paleta, era, wygląd, którego nie możesz stracić„retro japońskie karty tytułowe anime, ostre sylwetki, komiksowy kolaż, mocne geometryczne bloki kolorów”Generyczny, błyszczący render, który dryfuje do szóstej sekundy
2. Oś czasuDosłowne wycinki czasu z akcją w każdym[2s-4s] Płynny zoom na jej prawe ramię. Panel UI wsuwa się z prawejJeden pomysł rozciągnięty na cały czas trwania
3. KameraRuch lub wyraźna odmowa ruchu„zablokowana, statyczny szeroki plan, bez najazdu, bez cięć”Domyślny powolny dolly, o który nie prosiłeś
4. AudioKażdy dźwięk i moment jego wejścia„w 6 sekundzie dołącza jazzowy bas, ostatnie 2 sekundy domykają napiętym akordem”Jakikolwiek pomieszczeniowy szum model lubi dziś
5. Tekst, przeliterowanyDosłowne ciągi, w cudzysłowie„THIS IS FINE.” / CONFIRM CONFIGSzum w kształcie liter, jak wyżej
6. Lista negatywnaPrzejścia, obiekty i klisze, którym odmawiasz„Bez miękkich rozpuszczeń, bez płynnych przejść, nie dodawaj chińskiego, nie powtarzaj tytułu stanowiska”Miękkie rozpuszczenia, wymyślony tekst, niepokojący dryf

Bloki 5 i 6 są darmowe. Nie kosztują nic dodatkowo do wygenerowania, a w nich tkwi większość jakości.

Przepływ pracy z podpowiedzią MiniMax H3: do którego punktu końcowego należy twoja podpowiedź

Ten sam klucz, ten sam kształt wyślij-i-sprawdź, trzy drzwi. Które wybierzesz, decyduje o tym, co twoja podpowiedź wciąż musi zrobić.

Punkt końcowyCo mu dajeszCo ci blokujeParametry warte poznaniaSięgnij po to, gdyRozliczanie
minimax/h3/text-to-videoTylko podpowiedźNic. Tekst niesie wszystkoduration 5-10 (domyślnie 8), resolution 2K, ratio musi być ustawione jawnieTestujesz wygląd lub projekt dźwięku przed zobowiązaniem sięRozliczane za sekundę wyjścia, aktualna stawka na stronie modelu
minimax/h3/image-to-videoPodpowiedź + obraz (pierwsza klatka), opcjonalnie end_imageGdzie klip się zaczyna i opcjonalnie gdzie lądujeend_image, duration 5-10 (domyślnie 8), ratio adaptacyjne domyślnieMasz grafikę i chcesz, żeby się poruszyła bez przerysowywaniaRozliczane za sekundę wyjścia
minimax/h3/reference-to-videoPodpowiedź + refers[]Tożsamość obiektu i styl, w scenie, którą wymyślaszrefers[] mixed array, duration 5-15, ratio do 21:9Ta sama postać lub produkt, nowe środowiskoRozliczane za sekundę wyjścia

refers[] to ten, który jest naprawdę słabo udokumentowany w sieci, więc oto kształt, jakiego oczekuje:

json
1"refers": [
2  { "url": "https://.../subject.png", "type": "image" },
3  { "url": "https://.../style-board.png" },
4  { "url": "https://.../motion-ref.mp4", "type": "video" },
5  { "url": "https://.../beat.mp3",       "type": "audio" }
6]
7

Cztery zasady, z których każda uratuje ci zmarnowaną generację:

  1. Audio nie może jechać samo. Co najmniej jeden obraz lub wideo musi być w tablicy. Ścieżka beatowa sama jest odrzucana.
  2. type jest opcjonalny. Jest wnioskowany z adresu URL, ale podaj go mimo to, gdy rozszerzenie jest niejednoznaczne.
  3. Limity są realne. Do 9 obrazów, 3 wideo i 3 klipów audio, łącznie 12 plików, z referencyjnym wideo i audio trwającymi od 2 do 15 sekund każdy (dokumentacja API MiniMax, lipiec 2026).
  4. Daj każdej referencji zadanie w tekście podpowiedzi. To nawyk o najwyższej dźwigni na tej liście. Oficjalne podpowiedzi zaczynają się od linii takich jak „Obraz 1 jest ogólnym nastrojem i referencją stylu, Obraz 2 jest referencją głównej postaci.” Bez tego zdania model musi zgadnąć, która tablica co oznacza. Large black text reading BASS HITS over a smiling woman Teledysk dark-pop MiniMax H3: CUT BACK, ONE LOOK, DETONATE typografia Three women in grunge fashion next to a bold typographic poster Dwie tablice referencyjne typografii stojące za klipem dark-pop

Ten klip jest argumentem za zasadą 4. Jego podpowiedź nigdy nie opisuje pojedynczej litery. Mówi „styl i faktura pakowania tekstu odnoszą się do obrazów” i przekazuje dwie tablice. Układ pojawił się, ponieważ został pokazany, a nie opisany.

Jeszcze jedna tabela, ponieważ karta modelu i API obecnie nie mówią tego samego, a luka jest tam, gdzie ludzie tracą popołudnie.

RzeczWłasna dokumentacja MiniMaxCo punkty końcowe faktycznie akceptują dziśCo to oznacza dla twojej podpowiedzi
Czas trwania4 do 15 sekund, tylko liczby całkowitetext-to-video i image-to-video: 5 do 10, domyślnie 8. reference-to-video: 5 do 15, domyślnie 815-sekundowa lista ujęć pasuje tylko do reference-to-video. Przepisz dłuższe tablice na 10
Rozdzielczość2Kresolution domyślnie 2K, a 2K jest obecnie jedyną działającą wartością. Zadanie 768p wraca z komunikatem model MiniMax-H3 nie obsługuje rozdzielczości 768P, obsługiwane rozdzielczości: 2K, mimo że 768p pojawia się w tabeli cenowejPisz dla krótszego boku 1440px. Szczegóły, o które poprosisz, faktycznie przetrwają
Proporcje obrazuTypowe proporcje lub adaptacyjneimage-to-video i reference-to-video domyślnie adaptacyjne. Tylko tekst odrzuca adaptacyjne i zwraca dozwolony zestaw: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9W text-to-video ustaw jawnie ratio, inaczej zadanie nie przejdzie walidacji
Mieszane referencje9 obrazów, 3 wideo, 3 audio, 12 plików, audio nigdy samorefers[] przyjmuje {url, type} z obrazem, wideo lub audio, co najmniej jeden obraz lub wideoNaprawdę możesz zsynchronizować ruch z dostarczonym bitem. Po prostu nie możesz dostarczyć tylko bitu
Natywne audioAudio stereo w tym samym przebieguKażdy z dziewięciu oficjalnych klipów, które zbadałem: 2560x1440, 24fps, AAC stereo przy 32 kHzBlok audio to nie dekoracja. To połowa dostarczanego materiału

Wszystko powyżej uruchomiono na Atlas Cloud, gdzie wszystkie trzy punkty końcowe H3 siedzą za jednym kluczem i jedną pętlą wyślij-i-sprawdź, więc przełączanie między nimi to zmiana ciągu modelu i nic więcej.

Samouczek podpowiedzi MiniMax H3: Podpal psa „This Is Fine” z dźwiękiem

Oto całość od początku do końca. Żart działa, ponieważ pies nic nie robi. Rozciągnij tę odmowę na dziesięć sekund prawdziwego czasu, dodaj prawdziwy ogień i pozwól, aby ostatnie dwie sekundy poszły tam, gdzie faktycznie poszedł oryginalny komiks, a staje się to zabawniejsze i nieco gorsze dla ciebie. Większość ludzi widziała tylko pierwsze dwa panele.

Krok 1: Pobierz oryginalny komiks. Nie pozwól AI go przerysować.

Pasek ma sześć paneli, dwie kolumny na trzy rzędy, 600 na 887. Chcemy tylko panel 2 i panel 6.

bash
1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png
2# 600x887, 6 paneli, 2 kol x 3 rzędy
3
4# przytnij panel 2 (panel „THIS IS FINE.”): x 302-584, y 20-293
5# przytnij panel 6 (topniejący pies): x 302-584, y 595-868
6# przeskaluj każdy 4x Lanczos -> 1128x1092
7

Powiedz to wprost: nie proś modelu obrazu o narysowanie „psa, który wygląda jak This Is Fine.” Rekreacja AI zostaje zdemaskowana jako fałszywa w pół sekundy, a żart umiera na miejscu. Akwarelowa faktura, chwiejne ręczne liternictwo i ziarno papieru to cały kontrakt. Przeskalowanie 4x Lanczos jest tylko dlatego, że 282px źródła jest cienkie; daje modelowi prawdziwe piksele, których może się trzymać, bez wymyślania żadnych. Two panels of the This is Fine dog melting in fire Panel 2 i panel 6 oryginalnego komiksu, oznaczone jako wejście pierwszej klatki i obrazu końcowego

Krok 2: Uruchom na image-to-video z end_image.

Model: minimax/h3/image-to-video. Ustawienia: resolution 2K, image = panel 2, end_image = panel 6, ratio 1:1, aby dopasować kwadratowe źródło. Ustaw duration na 10; suwak domyślnie znajduje się na 8, więc przeciągnij go.

text
1Ręcznie malowany panel komiksu 2D, ożywiony. Zachowaj oryginalną akwarelową
2fakturę, widoczne kontury tuszem, nierejestrowane ziarno papieru i płaską
3komiksową paletę w każdej klatce. Nie wygładzaj, nie renderuj ponownie w 3D,
4nie czyść linii, nie dodawaj nowych obiektów, nie dodawaj nowego tekstu.
5
6[0s-3s] Prawie nic się nie porusza. Pies siedzi idealnie nieruchomo, trzymając
7kubek, oczy skierowane przed siebie. Tylko płomienie za nim poruszają się:
8powolne pomarańczowe lizania wspinające się po ścianie, jeden żar unoszący się
9w górę. Dymek z napisem „THIS IS FINE.” pozostaje dokładnie tam, gdzie jest,
10w pełni czytelny, niezmieniony, ręcznie litery.
11
12[3s-6s] Pies podnosi kubek i bierze jeden mały, spokojny łyk. Dymek znika po
13łyku. Ogień jaśnieje. Ściana za nim zaczyna się wyginać od gorąca. Jego
14kapelusz zaczyna się tlić na brzegu.
15
16[6s-8.5s] Gorąco dociera do niego. Jego uszy opadają, kontur mięknie i zaczyna
17spływać w dół jak mokra farba. Wciąż nie porusza oczami. Kubek pozostaje w jego
18łapie.
19
20[8.5s-10s] Całkowite stopienie. Twarz się deformuje, jedno oko ślizga, zęby
21odsłonięte w nieruchomym uśmiechu, futro płynie czerwienią i pomarańczą.
22Utzymuje pozę. Utrzymaj na ostatniej klatce przez ostatnie pół sekundy.
23
24Kamera: zablokowana, pojedyncze statyczne szerokie ujęcie, bez najazdu, bez
25ręcznego trzymania, bez cięć. Kadr nigdy się nie porusza. To jedno ciągłe
26ujęcie wewnątrz jednego panelu komiksu.
27
28Audio: pomieszczeniowy szum wewnętrznego ognia przez cały czas - niski trzask,
29okazjonalny popęk spalającego się drewna, cichy skrzyp konstrukcji. W 3s jeden
30ceramiczny kubek dotykający zębów i małe przełknięcie. Spokojny, płaski,
31niezaniepokojony męski głos mówi dokładnie: „This is fine.” - bez wyrazu, bez
32emocji, nieco zbyt zrelaksowany. Od 6s trzask staje się głośniejszy, a szum
33pomieszczeniowy gęstnieje; ostatnie 2 sekundy dodają niski przypływ subbasu.
34Bez muzyki, bez śmiechu, bez efektów dźwiękowych spoza tej listy.
35
36Nie dodawaj napisów. Nie dodawaj znaku wodnego. Nie pisz żadnego słowa innego
37niż słowa już obecne na obrazie. Nie zmieniaj „THIS IS FINE.” Nie odcinaj.
38

Ta podpowiedź to żywa tabela struktury. Akapit pierwszy to kontrakt stylistyczny. Cztery wycinki w nawiasach to oś czasu. Potem kamera, potem audio, potem lista negatywna. Nic w niej nie jest dekoracyjne. Screenshot of AI video generator showing the This is fine meme MiniMax H3 image-to-video na Atlas Cloud: pierwsza klatka i obraz końcowy załadowane, 10 sekund w 2K, gotowy klip w panelu wyjściowym

Krok 3: Przeczytaj wyjście jak kontrolę jakości.

Cztery sprawdzenia, każde testujące inny blok podpowiedzi.

  1. Czy THIS IS FINE. w dymku jest wciąż czytelne i poprawnie napisane? To testuje blok 5.
  2. Czy linie przetrwały, czy coś je „poprawiło” w czyste 3D? To testuje blok 1.
  3. Czy audio zawiera tylko dźwięki, które wymieniłeś? Zbadaj kontener: powinien wrócić h264 plus AAC stereo.
  4. Czy ostatnia klatka ląduje na pozie panelu 6? To testuje end_image.
bash
1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \
2        -of default=noprint_wrappers=1 output.mp4
3

Mój wrócił w 1472x1440, 24fps, h264 plus AAC stereo, 10.13 sekundy. Warto zauważyć: poprosiłem o ratio: 1:1 i dostałem 1472x1440, więc w image-to-video kształt źródłowej klatki wygrywa. Dopasuj swoje dwa panele do kształtu, który faktycznie chcesz. Cartoon dog says this is fine then melts in a fire Cztery klatki z gotowego klipu w 0s, 3s, 6.5s i 10s, odpowiadające czterem wycinkom czasowym w podpowiedzi

Krok 4: Przenieś psa gdzieś nowego za pomocą reference-to-video.

Ta sama postać, nowy pokój. Model: minimax/h3/reference-to-video. Ustawienia: refers[] = panel 2 jako image, duration 8, resolution 2K, ratio 16:9.

text
1Obraz 1 jest referencją postaci i stylu artystycznego: zachowaj ten dokładny
2ręcznie malowany wygląd komiksu 2D, tę samą akwarelową fakturę, tę samą grubość
3konturu tuszem, tego samego psa, ten sam mały kapelusz, ten sam kubek. Nie
4przerysowuj go w 3D, nie zmieniaj jego proporcji, nie czyść linii.
5
6Umieść go w innym pomieszczeniu i zachowaj jego opanowanie. Ciasne biuro typu
7open-plan w nocy, migające świetlówki, ściana monitorów wszystkie pokazujące
8czerwony stan błędu, papier z drukarki opadający przez kadr, mały pożar
9elektryczny w rogu. On siedzi na biurowym krześle na środku kadru, kubek w
10łapie, patrząc prosto w kamerę, całkowicie zrelaksowany.
11
12Kamera: zablokowana, statyczne szerokie ujęcie. Bez najazdu, bez cięć.
13
14Audio: brzęczenie świetlówki, zgrzyt drukarki, powtarzający się miękki pisk
15alarmu co dwie sekundy, odległy trzask elektryczny, jeden spokojny łyk w 4s.
16Bez muzyki. Bez głosu.
17
18Nie dodawaj żadnego tekstu na ekranie. Nie dodawaj napisów. Nie dodawaj innych
19postaci.
20

Przenośna zasada: refers[] niesie tożsamość i styl, tekst niesie scenę. Ten podział to cały trik na spójność postaci i dlatego pierwsza linia podpowiedzi w ogóle istnieje. Let's try: „Cartoon dog holding coffee cup amidst red screens and a burning printer” Ten sam komiksowy pies przeniesiony do płonącego biura open-plan w nocy, wygenerowany przez MiniMax H3 reference-to-video

Ten sam kapelusz, ten sam kubek, ta sama grubość tuszu, nowy pokój. Jeden obraz referencyjny zrobił to wszystko.

Trzy kolejne wzorce podpowiedzi MiniMax H3 warte podkradnięcia

Wzorzec 1: plakat ruchomy, gdzie układ nie może się poruszać. Cartoon character running forward against a solid pink background Plakat ruchomy MiniMax H3: układ POPUP! animuje się, podczas gdy kadr i typografia pozostają zablokowane Cartoon boy in pink monster hoodie reaching out with giant claw Oryginalny statyczny plakat podany MiniMax H3

Cała podpowiedź to dwie linie: zachowaj białą ramkę galerii, wewnętrzną ramkę, paletę czerwono-biało-czarną, odczucie figury 3D i strukturę układu niezmienioną, i podłóż zwinną efekcik dźwiękowy pod wejście tekstu. Zasada: nazwij części, które muszą przetrwać. „Zachowaj układ” to nie uwaga stylistyczna, to ograniczenie, a model traktuje je jako takie.

Wzorzec 2: demo interfejsu, gdzie czasowniki biją przymiotniki. Mint green Nike ZoomX running shoe with a pink gradient sole Demo strony docelowej MiniMax H3: przewijanie, najechanie, inwersja kolorów na stronie produktu Light blue Nike running shoe with green and pink accents Pojedynczy obraz referencyjny produktu stojący za klipem strony docelowej

Ta podpowiedź prosi o przewinięcie w dół, stan najechania, mocne powiększenie i inwersję kolorów. Cztery czasowniki. Nigdy nie mówi „nowoczesny” czy „elegancki”. Interakcje to działania, więc pisz je jako działania. Przerośnięta kursywa i tło z węglowego splotu przyszły z przymiotników; to, co sprawia, że czyta się to jako prawdziwą stronę, przyszło z czasowników.

Wzorzec 3: live action plus ręcznie rysowane, trzymane razem przez odmowy. Animated glowing green sprout growing in an open hand Klip MiniMax H3 łączący live-action z kuchni z ręcznie rysowanymi świecącymi stworzeniami

To wieczorna kuchnia nakręcona telefonem z małymi świecącymi ręcznie rysowanymi stworzeniami, a powód, dla którego pozostaje urocza, zamiast zamieniać się w horror, to lista zakazów: bez wielkich oczu, bez rozciętych ust, bez kłów, bez groźnej postawy, bez skakania, bez nagłego przejścia do czerni, bez jumpscare’ów. Lista negatywna jest podstawowym narzędziem stylu, a nie poprawką. To także miejsce, w którym kodujesz gust. Four panels showing a woman in a dark tunnel with text Cztery klatki z oficjalnego zwiastuna sci-fi: THE STARS WERE LISTENING Poster for The Stars Were Listening and character design sheet Tablica nastroju i referencja postaci stojące za zwiastunem

Zwiastun powyżej zamyka pętlę na obu pomysłach. Podpowiedź przeliterowuje jeden tytuł, THE STARS WERE LISTENING, w szczegółach: niezwykle wąski, gruby, wszystkie wielkie litery, ciemna czerwień zmieszana z rdzą, lekki ziarno i zamglone krawędzie. Ten wraca dokładnie tak, jak zamówiony. Dwie tablice referencyjne obsługują nastrój i główną postać, więc tekst nigdy nie musi opisywać twarzy. Podział pracy, aż do samego końca.

Ile kosztuje uruchomienie tych podpowiedzi MiniMax H3

H3 jest rozliczane za sekundę wygenerowanego wideo, według rozdzielczości, więc model kosztów jest odświeżająco nudny: 15-sekundowe ujęcie kosztuje około trzy 5-sekundowe próby. Wszystko inne wynika z tego.

  • Iteruj przy 5 sekundach, dostarczaj przy 10 lub 15. Kompozycja, paleta i projekt dźwięku rozstrzygają się przy 5. Nic w statycznym ujęciu nie wymaga pełnego czasu trwania, aby stwierdzić, że jest złe.
  • end_image to narzędzie kosztowe, nie tylko kreatywne. Większość powtórek dzieje się, ponieważ zakończenie dryfowało. Przypięcie ostatniej klatki usuwa ten tryb awarii, zanim za niego zapłacisz.
  • Listy negatywne i przeliterowany tekst są darmowe. Dodają znaki do podpowiedzi rozliczanej za sekundę, a nie za token. Używaj ich obficie.
  • Dopasuj duration do punktu końcowego przed pisaniem. Zbudowanie 15-sekundowej listy ujęć, a następnie odkrycie, że twój punkt końcowy ogranicza do 10, kosztuje cię przepisanie, a nie tylko powtórkę.

Jedna rzecz, której nie planuj na razie: tabele cenowe wymieniają tańszy poziom 768p, ale w chwili pisania tego tekstu zadanie 768p jest odrzucane z miejsca, a 2K jest jedyną działającą rozdzielczością. Budżetuj tak, jakby każda sekunda była sekundą 2K. Aktualne stawki za sekundę znajdują się na stronie modelu, która jest również miejscem, gdzie pojawi się poziom 768p, gdy zostanie otwarty.

Podpowiedzi MiniMax H3, memy i prawa autorskie

Pies nie jest w domenie publicznej. This Is Fine pochodzi z komiksu internetowego KC Greena Gunshow #648, opublikowanego 9 stycznia 2013 r., a tylko pierwsze dwa panele stały się wirusowe (Know Your Meme, styczeń 2013). Green wypowiadał się publicznie i dość znużonie o tym, jak obraz jest używany w kółko, w tym przez ludzi, których polityki nie podziela (NPR, styczeń 2023).

Ten instruktaż jest komentarzem i nauczaniem, a nie biblioteką stockową. Jeśli chcesz dostarczyć coś komercyjnie, narysuj własne klatki lub licencjonuj te, których używasz. I przeprowadź własną kontrolę polityki przed zleceniem klienta: H3 stosuje zasady dotyczące treści do rozpoznawalnych prawdziwych osób i dobrze znanego IP, a dowiedzenie się tego w środku terminu nie jest przyjemne.

Często zadawane pytania

Czy MiniMax H3 generuje audio, czy dodaję je później?

Ten sam przebieg. Obraz i dźwięk wychodzą razem, co jest dokładnie powodem, dla którego audio musi być zapisane w treści podpowiedzi, a nie dodane później. Daj mu własny blok Audio: i określ, kiedy każdy dźwięk wchodzi. Każdy z dziewięciu oficjalnych klipów, które zbadałem, wrócił jako AAC stereo przy 32 kHz obok strumienia wideo 2560x1440, 24fps.

Jak długa może być podpowiedź MiniMax H3?

Do 7000 znaków, według dokumentacji MiniMax. W praktyce oficjalne przykłady obejmują szeroki zakres, z medianą około 130 chińskich znaków i dwiema najdłuższymi na 657 i 858. Krótkie podpowiedzi działają dobrze, gdy obraz referencyjny robi za opis. Jeśli nie masz referencji, spodziewaj się napisać listę ujęć.

Dlaczego tekst w moich filmach MiniMax H3 wychodzi zniekształcony?

Ponieważ go nie wpisałeś. Ciągi, które pojawiają się dosłownie w podpowiedzi, renderują się czysto; wszystko, co określasz ogólnie („elementy HUD”, „jakieś etykiety”), wraca jako tekstura w kształcie liter. Przeliteruj każde słowo, które ma być czytelne, a następnie dodaj nie popełniaj błędów, nie dodawaj innego tekstu, nie dodawaj napisów.

Ile obrazów referencyjnych, filmów i klipów audio może użyć jedna podpowiedź MiniMax H3?

Dziewięć obrazów, trzy filmy i trzy klipy audio, łącznie dwanaście plików, z referencyjnym wideo i audio trwającymi od 2 do 15 sekund każdy. Audio nie może być jedyną referencją. Należy zauważyć, że możliwości modelu i to, co dany punkt końcowy udostępnia, to dwie różne rzeczy, więc sprawdź stronę modelu po aktualną listę wejść.

Czy podpowiedź MiniMax H3 może kontrolować, jak kończy się klip, a nie tylko jak się zaczyna?

Tak, w image-to-video za pomocą opcjonalnego parametru end_image. Podaj pierwszą klatkę i ostatnią klatkę, a klip interpoluje między nimi. Powyższe demo jest dokładnie tym: panel komiksu 2 na wejściu, panel 6 na wyjściu. Utrzymuj oba obrazy w podobnych proporcjach, w przeciwnym razie przejście staje się brzydkie.

Jakie czas trwania i rozdzielczości mogę faktycznie uzyskać teraz?

2K i tylko 2K. Zadanie 768p jest obecnie odrzucane z komunikatem obsługiwane rozdzielczości: 2K, mimo że 768p pojawia się w tabeli cenowej. Czas trwania różni się w zależności od punktu końcowego: text-to-video i image-to-video akceptują 5 do 10 sekund z domyślnym 8, podczas gdy reference-to-video akceptuje 5 do 15. Jeszcze jeden haczyk: w generacji tylko tekstowej API odrzuca adaptive i wymaga jawnego ratio.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele