Seedance 2.0 Mini & Fast API w najniższych cenach na świecie — do 68% zniżki od oficjalnej ceny

MiniMax H3 Przewodnik po promptach: Przestudiowałem 45 oficjalnych promptów, więc ty nie musisz

Przewodnik po promptach MiniMax H3 zbudowany z wszystkich 45 przykładowych promptów MiniMax: struktura sześciu bloków, sztuczka end_image, natywne wskazówki dźwiękowe i naprawa zniekształconego tekstu.

Używaj MiniMax H3 jak krótkiego briefu produkcyjnego, a nie pojedynczego promptu obrazkowego. Wielokrotnego użytku struktura jest prosta: powiąż każdy materiał referencyjny, podaj główną ideę, a następnie opisz scenę jako sekwencję audiowizualną z czasem, ruchem kamery, dialogiem, atmosferą, muzyką i ograniczeniami w osobnych blokach.

Ten przewodnik odwraca inżynierię 45 oficjalnych przykładów MiniMax H3 w sześcioczęściową formułę promptu, pokazuje, gdzie należy end_image, wyjaśnia, jak natywne wskazówki audio zmieniają wynik, i podaje praktyczne rozwiązanie problemu zniekształconego tekstu w generowanych klipach.

Wiesz już, jak pisać prompt do modelu wideo. „Kinowe oświetlenie, powolne zbliżenie, 4K.” To słownictwo wystarczało Ci przez dwa lata.

Potem wklejasz je do MiniMax H3 i dostajesz klip w 2K, który przychodzi z własną ścieżką dźwiękową. Obraz wygląda świetnie. Tempo jest rozwleczone. Dwie litery w tytule są błędnie napisane. Dźwięk to jakiś szum pomieszczenia, który model wybrał za Ciebie.

Problem nie leży po stronie modelu. Podałeś mu zdanie. On chciał harmonogram.

Więc przeczytałem wszystkie 45 przykładowych promptów, które MiniMax dołączył do H3, razem z gotowymi klipami, które im towarzyszyły, i rozłożyłem klatki na czynniki pierwsze. Oficjalne prompty nie są opisami. Dobre to listy ujęć z dołączoną kartą wskazówek muzycznych. Poniżej znajduje się struktura, parametry, które są obecnie faktycznie dostępne, oraz jedna demonstracja, którą możesz odtworzyć w około dwadzieścia minut.

Kluczowe wnioski

  • Prompty H3 to osie czasu, a nie opisy. Najsilniejsze oficjalne przykłady dosłownie dzielą klip znacznikami [0s-2s], [2s-4s], a gotowy film trafia w każdy beat.
  • Dźwięk i obraz pochodzą z tego samego przebiegu, więc audio musi być zawarte w treści promptu. Oficjalne prompty dają mu własny blok, aż do „wejście basowego groove’u jazzowego w 6s.”
  • Tekst, który przeliterujesz, wraca czysty. Tekst, którego nie przeliterujesz, wraca jako szum w kształcie liter. Mam wycinki klatek z jednego oficjalnego klipu, które dowodzą obu tych przypadków jednocześnie.
  • Image-to-video akceptuje end_image. Podaj pierwszą klatkę i ostatnią klatkę, a łuk emocjonalny jest ustalony, zanim wydasz sekundę obliczeń.
  • Długość promptu nie jest zaletą. Krótkie oficjalne prompty działają, gdy obraz referencyjny wykonuje opis. Długość odzwierciedla, jaką część pracy odmówiłeś oddaniu referencji.

Pies „This Is Fine”, wciąż po lewej stronie i płonący w 10 sekundach wyników MiniMax H3 po prawej stronie

To ten sam rysunek po obu stronach. Po lewej oryginalny panel KC Greena, nietknięty. Po prawej jedno wywołanie image-to-video: pierwsza klatka wejściowa, ostatnia klatka wejściowa, dziesięć sekund wyjściowe, a trzask ognia i płaskie „this is fine” to własna ścieżka audio modelu. Nikt tego nie miksował. Wszystko w tym przewodniku ma na celu doprowadzić Cię do tej drugiej połowy.

Jak właściwie wygląda prompt MiniMax H3 (przeczytałem wszystkie 45)

Każdy „przewodnik po promptach MiniMax H3” obecnie na pierwszej stronie wyszukiwarki to karta specyfikacji: 2K, 24fps, 5 do 15 sekund, natywne audio. To jest karta modelu. To nie jest prompt.

Oto prawdziwy. To fragment oficjalnego promptu stojącego za sekwencją tytułową noir od MiniMax, przetłumaczony z chińskiego oryginału, stanowiący może jedną trzecią pełnej długości:

Wygeneruj 15-sekundową sekwencję tytułową kryminału lekkiego suspensu w formacie 16:9. Ogólny styl nawiązuje do języka wizualnego tych obrazów: retro japońsko-anime’owe plansze tytułowe, ostre sylwetki, komiksowy kolaż, asymetryczny podzielony ekran, mocne geometryczne bloki kolorystyczne, angielskie napisy tytułowe, trochę japońskiej dekoracji katakaną, klimat jazzowo-kryminalny. Nastrój to 60% suspensu, 40% jazzu: tajemniczy, chłodny, zwinny, miejsko-kryminalny, nie horror, nie ciężki, i nie zamieniaj go w wesoły teledysk jazzowy.

[...] Angielskie napisy muszą być wyraźnie czytelne [...] Nie dodawaj chińskich znaków, nie generuj zniekształconego tekstu, nie popełniaj błędów ortograficznych w angielskim. Zasada dla całego utworu: każdy angielski napis i tytuł stanowiska pojawia się dokładnie raz. Nie powtarzaj tytułu stanowiska, nie powtarzaj nazwiska, nie nadawaj jednej osobie wielu tytułów.

Przejścia muszą być zróżnicowane: okrągła maska winylowej płyty, pionowe przesunięcie drzwi samochodu, długi cień postaci przesuwający się po ekranie, cięcie czerwonej linii, maska wielkiej angielskiej litery, ponowna kompozycja ramki podzielonego ekranu, twarde cięcie bloku koloru, panele wklejane blok po bloku. Wszystkie przejścia muszą trafiać w uderzenia perkusji: ostre, pełne suspensu, zwinne, komiksowo-kolażowe. Żadnych miękkich rozmyć, żadnych płynnych przejść.

BGM: oryginalna 15-sekundowa muzyka tytułowa, 60% suspensu, 40% jazzu. Zbudowana z utrzymującego się basowego dźwięku, napiętych pizzicato smyczków, zimnych impulsów syntezatora, stopy perkusyjnej, rzadkich jazzowych szczotek, fragmentu chodzącego basu, krótkich fraz barytonowego saksofonu i krótkich uderzeń blachy. Pierwsze 2 sekundy budują napięcie niskimi częstotliwościami i hi-hatem, w 3 sekundach wchodzą niskie bębny, w 6 sekundach dołącza jazzowy basowy groove, w 10 sekundach pojawia się krótki riff saksofonu/blachy, ostatnie 2 sekundy zamykają napiętym akordem i uderzeniem perkusji.

Zobacz, gdzie poszły słowa. Prawie żadne nie poszło do „piękny” czy „kinowy”. Poszły do listy negatywnej, listy przejść i drugiej po sekundzie karty wskazówek muzycznych. To jest kształt zadania. Noir anime banner featuring a silhouetted figure on a subway trainMiniMax H3 official noir title sequence: MIDNIGHT LINE, with clean STARRING credits

Spójrz na napisy w tym klipie. MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS. Poprawnie napisane, żaden tytuł stanowiska nie użyty dwukrotnie, dekoracja katakaną umieszczona tam, gdzie miała być. Prompt nie powiedział „zrób ładne napisy”. Powiedział: bez powtórzeń, bez błędów ortograficznych, bez chińskich znaków, i nazwał estetykę na pięć różnych sposobów. Five cinematic noir panels featuring silhouetted characters in blue and orangePięć tablic referencyjnych stylu przekazanych do MiniMax H3 wraz z promptem noir

Te pięć tablic zostało wrzucone razem z tekstem. Pięć obrazów plus jeden długi brief, jedna generacja. Tak wygląda teraz ta praca.

A powód, dla którego tak wiele z 45 promptów jest krótkich, leży właśnie na obrazku. W całym zestawie mediana promptu wynosi około 130 chińskich znaków, ale dwa najdłuższe mają 657 i 858. Krótkie są krótkie, ponieważ tablica referencyjna niesie opis. Długie są długie, bo nic innego nie miało go nieść.

Dlaczego większość promptów MiniMax H3 wychodzi płasko, i naprawa zniekształconego tekstu

Trzy rzeczy idą źle, i wszystkie są nieobecnościami, a nie błędami.

Brak osi czasu. Poprosiłeś o dziesięć sekund i opisałeś jeden moment, więc dostajesz jedno powolne zbliżenie rozciągnięte na dziesięć sekund. Model nie miał co robić w siódmej sekundzie.

Brak bloku audio. Dźwięk jest generowany w tym samym przebiegu co obraz. Jeśli nic nie powiesz, model i tak wyśle Ci ścieżkę. Po prostu sam wybiera.

Brak listy negatywnej. Pozostawiony sam sobie, model sięga po miękkie rozmycia, wymyśla dodatkowy tekst na ekranie i dodaje pasek napisów, o który nikt nie prosił.

Najczystszym dowodem jest oficjalny prompt interfejsu gry, który jest zbudowany z sześciu oznaczonych czasowo beatów: [0s-2s] menu, [2s-4s] panel prawego ramienia, [4s-7s] siatka uzbrojenia, [7s-8.5s] potwierdzenie, [8.5s-10s] pasek ładowania, [10s-15s] świat się ładuje. Gotowy klip trafia we wszystkie sześć, w kolejności, na czas. Game menu showing selection of a robotic Phantom Grip armMiniMax H3 game UI clip: menu, equipment panel, loading bar, world load

Teraz szczera połowa, z tego samego klipu, w pełnej rozdzielczości 2560x1440. Comparison of legible game UI text and garbled AI textPo lewej: tekst przeliterowany w prompcie renderuje się czysto. Po prawej: tekst nie przeliterowany renderuje się jako szum w kształcie liter

Po lewej każdy ciąg, który prompt faktycznie wypisał: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW. Ostry, poprawny, wyjustowany jak prawdziwe menu gry.

Po prawej HUD w ostatnim ujęciu ulicy, które prompt nazwał tylko „elementy HUD”. Czytamy ETR METNO CITFEP. Nad ikonami ekwipunku, gdzie prompt nic nie powiedział, dostajesz MNALEαIN IAMG. To nie jest błąd renderowania. Model rysuje teksturę angielskiego, ponieważ nigdy nie otrzymał ciągu.

Więc poprawka nie jest ustawieniem. To nawyk:

Jeśli słowo ma być czytelne, wpisz to słowo. Następnie dodaj linię negatywną: nie popełniaj błędów ortograficznych, nie dodawaj innego tekstu, nie dodawaj napisów.

A oto sześcioblokowy kształt, który dzielą wszystkie silne oficjalne prompty.

BlokCo w nim jestPrzykład z oficjalnego promptuPomijasz go, a dostajesz
1. Kontrakt styluMedium, tekstura, paleta, epoka, wygląd, którego nie wolno stracić"retro japońsko-anime’owe plansze tytułowe, ostre sylwetki, komiksowy kolaż, mocne geometryczne bloki kolorystyczne"Generyczny, błyszczący render, który odbiega do szóstej sekundy
2. Oś czasuDosłowne wycinki czasu z akcją w każdym[2s-4s] Płynne zoom do jej prawego ramienia. Panel UI wsuwa się z prawejJeden pomysł rozciągnięty na cały czas trwania
3. KameraRuch, lub wyraźne odrzucenie ruchu"zablokowana, statyczny szeroki plan, bez zbliżenia, bez cięć"Domyślny powolny dolly, o który nie prosiłeś
4. AudioKażdy dźwięk i moment jego wejścia"w 6 sekund dołącza jazzowy basowy groove, ostatnie 2 sekundy zamykają napiętym akordem"Dowolny szum pomieszczenia, jaki model dziś lubi
5. Tekst, przeliterowanyDosłowne ciągi, w cudzysłowie"THIS IS FINE." / CONFIRM CONFIGSzum w kształcie liter, jak wyżej
6. Lista negatywnaPrzejścia, obiekty i klisze do odrzucenia"Bez miękkich rozmyć, bez płynnych przejść, nie dodawaj chińskich znaków, nie powtarzaj tytułu stanowiska"Miękkie rozmycia, wymyślony tekst, niepokojący dryf

Bloki 5 i 6 są darmowe. Nie kosztują dodatkowo przy generowaniu i to w nich tkwi większość jakości.

Przepływ pracy z promptem MiniMax H3: Do którego endpointu należy Twój prompt

Ten sam klucz, ten sam kształt submit-and-poll, troje drzwi. To, które wybierzesz, decyduje o tym, co Twój prompt jeszcze musi zrobić.

EndpointCo mu dajeszCo dla Ciebie blokujeParametry warte znajomościSięgaj po to, gdyRozliczenia
minimax/h3/text-to-videoTylko promptNic. Tekst niesie wszystkoczas trwania 5-10 (domyślnie 8), rozdzielczość 2K, proporcje muszą być ustawione jawnieTestowanie wyglądu lub projektu dźwięku, zanim się zaangażujeszRozliczane za sekundę wyjścia, aktualna stawka na stronie modelu
minimax/h3/image-to-videoPrompt + obraz (pierwsza klatka), opcjonalny end_imageGdzie klip się zaczyna i opcjonalnie gdzie lądujeend_image, czas trwania 5-10 (domyślnie 8), proporcje adaptacyjne domyślnieMasz grafikę i chcesz, żeby się poruszyła bez przerysowywaniaRozliczane za sekundę wyjścia
minimax/h3/reference-to-videoPrompt + refers[]Tożsamość obiektu i stylu, w scenie, którą wymyślaszrefers[] mixed array, czas trwania 5-15, proporcje do 21:9Ta sama postać lub produkt, nowe otoczenieRozliczane za sekundę wyjścia

refers[] jest tym, co jest naprawdę słabo udokumentowane w terenie, więc oto kształt, jakiego oczekuje:

json
1"refers": [
2  { "url": "https://.../subject.png", "type": "image" },
3  { "url": "https://.../style-board.png" },
4  { "url": "https://.../motion-ref.mp4", "type": "video" },
5  { "url": "https://.../beat.mp3",       "type": "audio" }
6]
7

Cztery zasady, z których każda oszczędzi Ci zmarnowanej generacji:

  1. Audio nie może podróżować samotnie. Co najmniej jeden obraz lub film musi być w tablicy. Sam beat track zostanie odrzucony.
  2. type jest opcjonalny. Jest wnioskowany z adresu URL, ale podaj go mimo to, gdy rozszerzenie jest niejednoznaczne.
  3. Limity są realne. Do 9 obrazów, 3 filmy i 3 klipy audio, łącznie 12 plików, przy czym referencyjny film i audio trwają od 2 do 15 sekund każdy (dokumentacja API MiniMax, lipiec 2026).
  4. Daj każdej referencji zadanie w tekście promptu. To najwyższy nawyk dźwigni na tej liście. Oficjalne prompty zaczynają się od wierszy takich jak „Obraz 1 jest ogólnym odniesieniem nastroju i stylu, Obraz 2 jest odniesieniem głównej postaci.” Bez tego zdania model musi zgadnąć, która tablica co oznacza.Large black text reading BASS HITS over a smiling womanMiniMax H3 dark-pop music video: CUT BACK, ONE LOOK, DETONATE typography Three women in grunge fashion next to a bold typographic posterDwie tablice referencyjne typografii stojące za klipem dark-pop

Ten klip jest argumentem za zasadą 4. Jego prompt nigdy nie opisuje pojedynczej litery. Mówi „styl pakowania tekstu i tekstura odnoszą się do obrazów” i przekazuje dwie tablice. Układ przybył, ponieważ został pokazany, a nie opisany.

Jeszcze jedna tabela, ponieważ karta modelu i API nie mówią obecnie tego samego, a luka jest miejscem, gdzie ludzie tracą popołudnie.

RzeczDokumentacja samego MiniMaxCo endpointy faktycznie akceptują dzisiajCo to oznacza dla Twojego promptu
Czas trwania4 do 15 sekund, tylko liczby całkowitetext-to-video i image-to-video: 5 do 10, domyślnie 8. reference-to-video: 5 do 15, domyślnie 815-sekundowa lista ujęć pasuje tylko do reference-to-video na ten moment. Przepisz dłuższe tablice na 10
Rozdzielczość2Krozdzielczość domyślnie 2K, a 2K jest obecnie jedyną wartością, która działa. Zadanie w 768p wraca z modelem MiniMax-H3 does not support resolution 768P, supported resolutions: 2K, mimo że 768p pojawia się w tabeli cenowejPisz dla krótszego boku 1440px. Szczegóły, o które prosisz, faktycznie przetrwają
ProporcjeTypowe proporcje lub adaptacyjneimage-to-video i reference-to-video domyślnie adaptacyjne. Tylko tekst odrzuca adaptacyjne i zwraca dozwolony zestaw: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9W text-to-video ustaw proporcje jawnie, w przeciwnym razie zadanie nie przejdzie walidacji
Mieszane referencje9 obrazów, 3 filmy, 3 audio, 12 plików, audio nigdy samorefers[] przyjmuje {url, type} z obrazem, filmem lub audio, co najmniej jeden obraz lub filmNaprawdę możesz zsynchronizować ruch z dostarczonym bitem. Po prostu nie możesz dostarczyć tylko bitu
Natywne audioAudio stereo w tym samym przebieguKażdy z dziewięciu oficjalnych klipów, które zbadałem: 2560x1440, 24fps, AAC stereo przy 32kHzBlok audio to nie dekoracja. To połowa dostarczanego materiału

Wszystko powyżej działało na Atlas Cloud, gdzie wszystkie trzy endpointy H3 siedzą za jednym kluczem i jedną pętlą submit-and-poll, więc przełączanie między nimi to zmiana ciągu modelu i nic więcej.

Poradnik dotyczący promptu MiniMax H3: Podpal psa „This Is Fine” z dźwiękiem

Oto całość od początku do końca. Żart działa, ponieważ pies nic nie robi. Rozciągnij tę odmowę na dziesięć sekund rzeczywistego czasu, dodaj prawdziwy ogień i pozwól, aby ostatnie dwie sekundy poszły tam, gdzie faktycznie poszedł oryginalny komiks, a stanie się zabawniejszy i nieco gorszy dla Ciebie. Większość ludzi widziała tylko pierwsze dwa panele.

Krok 1: Pobierz oryginalny komiks. Nie pozwól AI przerysować go.

Pasek składa się z sześciu paneli, dwie kolumny po trzy rzędy, 600 na 887. Potrzebujemy tylko panelu 2 i panelu 6.

bash
1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png
2# 600x887, 6 paneli, 2 kol x 3 rzędy
3
4# wytnij panel 2 (panel "THIS IS FINE."):  x 302-584, y 20-293
5# wytnij panel 6 (topniejący pies):            x 302-584, y 595-868
6# przeskaluj każdy 4x z Lanczos  ->  1128x1092
7

Powiedz wprost: nie pytaj modelu obrazkowego, aby narysował „psa, który wygląda jak This Is Fine.” Rekreacja AI zostanie rozpoznana jako fałszywa w pół sekundy, a żart umiera na miejscu. Akwarelowa plama, chwiejne odręczne liternictwo i ziarno papieru to cały kontrakt. 4-krotne skalowanie Lanczos jest tylko dlatego, że 282px źródła to za mało; daje modelowi prawdziwe piksele, których może się trzymać, bez wymyślania czegokolwiek. Two panels of the This is Fine dog melting in firePanel 2 i panel 6 oryginalnego komiksu, oznaczone jako wejściowe pierwsza klatka i ostatnia klatka

Krok 2: Uruchom na image-to-video z end_image.

Model: minimax/h3/image-to-video. Ustawienia: rozdzielczość 2K, obraz = panel 2, end_image = panel 6, proporcje 1:1, aby dopasować do kwadratowego źródła. Ustaw czas trwania na 10; suwak domyślnie stoi na 8, więc przeciągnij go.

text
1Ręcznie malowany panel komiksu 2D, ożywiony. Zachowaj oryginalną akwarelową
2teksturę, widoczne tuszowane kontury, niedokładne ziarno papieru i płaską
3komiksową paletę w każdej klatce. Nie wygładzaj, nie renderuj ponownie w 3D,
4nie czyść linii, nie dodawaj nowych obiektów, nie dodawaj nowego tekstu.
5
6[0s-3s] Prawie nic się nie porusza. Pies siedzi idealnie nieruchomo, trzymając
7kubek, oczy utkwione przed siebie. Tylko płomienie za nim poruszają się: powolne
8pomarańczowe języki wspinające się po ścianie, jeden żarzący się węgielek
9unoszący się do góry. Dymek z tekstem "THIS IS FINE." pozostaje dokładnie
10tam, gdzie jest, w pełni czytelny, niezmieniony, odręcznie napisany.
11
12[3s-6s] Pies podnosi kubek i bierze jeden mały, spokojny łyk. Dymek z tekstem
13zanika po łyku. Ogień jaśnieje. Ściana za nim zaczyna się wypaczać pod wpływem
14ciepła. Jego kapelusz zaczyna się tlić na brzegu.
15
16[6s-8.5s] Ciepło dosięga go. Jego uszy opadają, jego kontur mięknie i zaczyna
17spływać w dół jak mokra farba. Wciąż nie porusza oczami. Kubek pozostaje w jego
18łapie.
19
20[8.5s-10s] Całkowite topnienie. Twarz deformuje się, jedno oko się przesuwa,
21zęby obnażone w sztywnym uśmiechu, futro płynie czerwienią i pomarańczem.
22Utrzymuje pozę. Przytrzymaj ostatnią klatkę przez ostatnie pół sekundy.
23
24Kamera: zablokowana, pojedynczy statyczny szeroki plan, bez zbliżenia, bez
25ręcznego trzymania, bez cięć. Kadr nigdy się nie porusza. To jedno ciągłe
26ujęcie wewnątrz jednego panelu komiksu.
27
28Audio: szum wnętrza ognia przez cały czas - niski trzask, okazjonalny wybuch
29palącego się drewna, słaby strukturalny skrzyp. W 3s, jeden ceramiczny kubek
30dotykający zębów i mały przełknięcie. Spokojny, płaski, niezmartwiony męski
31głos mówi dokładnie: "This is fine." - bez wyrazu, bez emocji, nieco zbyt
32zrelaksowany. Od 6s trzask staje się głośniejszy, a szum pomieszczenia gęstnieje;
33ostatnie 2 sekundy dodają niski basowy przypływ. Bez muzyki, bez ścieżki
34śmiechu, bez efektów dźwiękowych, których nie ma na tej liście.
35
36Nie dodawaj napisów. Nie dodawaj znaku wodnego. Nie przeliteruj żadnego słowa
37innego niż te już obecne na obrazie. Nie zmieniaj "THIS IS FINE." Nie odcinaj.
38

Ten prompt to tabela struktury, żywa. Akapit pierwszy to kontrakt stylu. Cztery przedziały w nawiasach to oś czasu. Potem kamera, potem audio, potem lista negatywna. Nic w nim nie jest dekoracyjne. Screenshot of AI video generator showing the This is fine memeMiniMax H3 image-to-video on Atlas Cloud: first frame and end image loaded, 10 seconds at 2K, finished clip in the output panel

Krok 3: Przeczytaj wynik jak kontrolę QA.

Cztery kontrole, każda testująca inny blok promptu.

  1. Czy THIS IS FINE. w dymku jest nadal czytelne i nadal poprawnie napisane? To testuje blok 5.
  2. Czy linie przetrwały, czy coś „ulepszyło” je w czyste 3D? To testuje blok 1.
  3. Czy audio zawiera tylko dźwięki, które wymieniłeś? Zbadaj kontener: powinien wrócić jako h264 plus AAC stereo.
  4. Czy ostatnia klatka ląduje na pozie panelu 6? To testuje end_image.
bash
1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \
2        -of default=noprint_wrappers=1 output.mp4
3

Mój wrócił jako 1472x1440, 24fps, h264 plus AAC stereo, 10.13 sekund. Warto zauważyć: poprosiłem o proporcje: 1:1 i dostałem 1472x1440, więc w image-to-video kształt źródłowej klatki wygrywa. Dopasuj swoje dwa panele do kształtu, który faktycznie chcesz. Cartoon dog says this is fine then melts in a fireCztery klatki z gotowego klipu w 0s, 3s, 6.5s i 10s, odpowiadające czterem przedziałom czasowym w prompcie

Krok 4: Przenieś psa gdzieś indziej za pomocą reference-to-video.

Ta sama postać, nowe pomieszczenie. Model: minimax/h3/reference-to-video. Ustawienia: refers[] = panel 2 jako obraz, czas trwania 8, rozdzielczość 2K, proporcje 16:9.

text
1Obraz 1 jest odniesieniem postaci i stylu artystycznego: zachowaj ten dokładny
2ręcznie malowany wygląd komiksu 2D, tę samą akwarelową teksturę, tę samą grubość
3tuszowanych konturów, tego samego psa, ten sam mały kapelusz, ten sam kubek. Nie
4przerysowuj go w 3D, nie zmieniaj jego proporcji, nie czyść linii.
5
6Umieść go w innym pokoju i zachowaj jego opanowanie. Ciasne biuro w otwartym
7planie nocą, migoczące jarzeniówki, ściana monitorów wszystkie pokazujące
8czerwony stan błędu, papier z drukarki opadający przez kadr, mały pożar
9elektryczny w kącie. Siedzi na krześle biurowym w środku kadru, kubek w łapie,
10patrząc prosto w kamerę, całkowicie zrelaksowany.
11
12Kamera: zablokowana, statyczny szeroki plan. Bez zbliżenia, bez cięć.
13
14Audio: brzęczenie jarzeniówki, zgrzyt drukarki, powtarzający się miękki alarm
15co dwie sekundy, odległy elektryczny trzask, jeden spokojny łyk w 4s. Bez
16muzyki. Bez głosu.
17
18Nie dodawaj żadnego tekstu na ekranie. Nie dodawaj napisów. Nie dodawaj innych
19postaci.
20

Przenośna zasada: refers[] niesie tożsamość i styl, tekst niesie scenę. Ten podział to cały trik do spójności postaci i dlatego pierwsza linia promptu w ogóle istnieje. Let's try: "Cartoon dog holding coffee cup amidst red screens and a burning printerTen sam pies z komiksu przeniesiony do płonącego biura w otwartym planie nocą, wygenerowany przez MiniMax H3 reference-to-video

Ten sam kapelusz, ten sam kubek, ta sama waga tuszu, nowe pomieszczenie. Jeden obraz referencyjny zrobił to wszystko.

Trzy dodatkowe wzorce promptów MiniMax H3 warte skopiowania

Wzorzec 1: motion poster, gdzie układ nie może się poruszyć. Cartoon character running forward against a solid pink backgroundMiniMax H3 motion poster: układ POPUP! animuje się, podczas gdy kadr i typografia pozostają zablokowane Cartoon boy in pink monster hoodie reaching out with giant clawOryginalny statyczny poster przekazany do MiniMax H3

Cały prompt to dwie linie: zachowaj białą ramkę galerii, wewnętrzną ramkę, paletę czerwono-biało-czarną, wrażenie 3D-figury i strukturę układu niezmienione, i umieść zwinny efekt dźwiękowy pod wejściem tekstu. Zasada: nazwij części, które muszą przetrwać. „Zachowaj układ” to nie uwaga stylistyczna, to ograniczenie, a model traktuje je jako takie.

Wzorzec 2: demo interfejsu, gdzie czasowniki biją przymiotniki. Mint green Nike ZoomX running shoe with a pink gradient soleMiniMax H3 landing page demo: scroll, hover, kolor inwersji na stronie produktu Light blue Nike running shoe with green and pink accentsPojedynczy obraz referencyjny produktu stojący za klipem strony docelowej

Ten prompt prosi o przewijanie strony w dół, stan hover, silne powiększenie i inwersję kolorów. Cztery czasowniki. Nigdy nie mówi „nowoczesny” czy „elegancki”. Interakcje to działania, więc pisz je jako działania. Przesadzona kursywa i tło z tkaniny węglowej wzięły się z przymiotników; to, co sprawia, że czyta się to jako prawdziwą stronę, wzięło się z czasowników.

Wzorzec 3: live action plus ręcznie rysowane, trzymane razem przez odmowy. Animated glowing green sprout growing in an open handMiniMax H3 clip łączący materiał z kuchni w live action z ręcznie rysowanymi świecącymi stworzeniami

To jest nakręcona telefonem wieczorna kuchnia z małymi świecącymi ręcznie rysowanymi stworzeniami, a powód, dla którego pozostaje urocza zamiast zamieniać się w horror, to lista zakazów: żadnych wielkich oczu, żadnych rozciętych pysków, żadnych kłów, żadnej groźnej postawy, żadnego skakania, żadnego nagłego cięcia do czerni, żadnych jump scare’ów. Lista negatywna jest główną kontrolą stylu, a nie łatką. To także miejsce, w którym kodujesz gust. Four panels showing a woman in a dark tunnel with textCztery klatki z oficjalnego zwiastuna sci-fi: THE STARS WERE LISTENING Poster for The Stars Were Listening and character design sheetTablice nastroju i referencji postaci stojące za zwiastunem

Zwiastun powyżej zamyka pętlę obu pomysłów. Prompt przeliterowuje jeden tytuł, THE STARS WERE LISTENING, szczegółowo: niezwykle wąski, pogrubiony, wszystkie wielkie litery, ciemna czerwień zmieszana z rdzą, lekkie ziarno i zamglone krawędzie. Ten wraca dokładnie tak, jak zamówiono. Dwie tablice referencyjne obsługują nastrój i główną postać, więc tekst nigdy nie musi opisywać twarzy. Podział pracy, aż do samego końca.

Ile kosztuje uruchomienie tych promptów MiniMax H3

H3 jest rozliczane za sekundę wygenerowanego wideo, według rozdzielczości, więc model kosztów jest odświeżająco nudny: 15-sekundowe ujęcie kosztuje około trzy 5-sekundowe próby. Wszystko inne wynika z tego.

  • Iteruj w 5 sekund, dostarczaj w 10 lub 15. Kompozycja, paleta i projekt dźwięku wszystkie rozstrzygają się w 5. Nic w statycznym ujęciu nie wymaga pełnego czasu trwania, aby powiedzieć Ci, że jest złe.
  • end_image jest narzędziem kosztowym, a nie tylko kreatywnym. Większość powtórek występuje, ponieważ zakończenie dryfowało. Przypięcie ostatniej klatki usuwa ten tryb awarii, zanim za niego zapłacisz.
  • Listy negatywne i przeliterowany tekst są darmowe. Dodają znaki do promptu, który jest rozliczany za sekundę, a nie za token. Używaj ich intensywnie.
  • Dopasuj czas trwania do endpointu, zanim napiszesz. Zbudowanie 15-sekundowej listy ujęć, a następnie odkrycie, że Twój endpoint ma limit 10, kosztuje Cię przepisanie, a nie tylko ponowne uruchomienie.

Jedna rzecz, której nie należy jeszcze planować: tabele cenowe wymieniają tańszy poziom 768p, ale w chwili pisania tego tekstu zadanie w 768p jest odrzucane z miejsca, a 2K jest jedyną rozdzielczością, która działa. Budżetuj tak, jakby każda sekunda była sekundą 2K. Aktualne stawki za sekundę znajdują się na stronie modelu, która jest również miejscem, gdzie pojawi się poziom 768p, gdy zostanie otwarty.

Prompty MiniMax H3, memy i prawa autorskie

Pies nie jest w domenie publicznej. This Is Fine pochodzi z komiksu internetowego KC Greena Gunshow #648, opublikowanego 9 stycznia 2013 roku, a tylko pierwsze dwa panele stały się wirusowe (Know Your Meme, styczeń 2013). Green wypowiadał się publicznie, i dość zmęczonego, o obserwowaniu, jak obraz jest wykorzystywany w kółko, w tym przez ludzi, których poglądów politycznych nie podziela (NPR, styczeń 2023).

Ten przewodnik to komentarz i nauczanie, a nie biblioteka stockowa. Jeśli chcesz dostarczyć coś komercyjnie, narysuj własne klatki lub licencjonuj te, których używasz. I przeprowadź własną kontrolę polityki przed zleceniem klienta: H3 stosuje zasady dotyczące treści do rozpoznawalnych prawdziwych osób i dobrze znanej własności intelektualnej, a dowiedzenie się tego w trakcie deadline’u nie jest zabawne.

Często zadawane pytania

Czy MiniMax H3 generuje dźwięk, czy dodaję go później?

Ten sam przebieg. Obraz i dźwięk wychodzą razem, co jest właśnie powodem, dla którego audio musi być napisane w treści promptu, a nie dodane później. Daj mu własny blok Audio: i określ, kiedy każdy dźwięk wchodzi. Każdy z dziewięciu oficjalnych klipów, które zbadałem, wrócił jako AAC stereo przy 32kHz wraz ze strumieniem wideo 2560x1440, 24fps.

Jak długi może być prompt MiniMax H3?

Do 7000 znaków, zgodnie z dokumentacją MiniMax. W praktyce oficjalne przykłady obejmują szeroki zakres, z medianą około 130 chińskich znaków i dwoma najdłuższymi na 657 i 858. Krótkie prompty działają dobrze, gdy obraz referencyjny wykonuje opis. Jeśli nie masz referencji, spodziewaj się napisać listę ujęć.

Dlaczego tekst wychodzi zniekształcony w moich filmach MiniMax H3?

Ponieważ go nie wpisałeś. Ciągi, które pojawiają się dosłownie w prompcie, renderują się czysto; wszystko, do czego odnosisz się ogólnie („elementy HUD”, „jakieś etykiety”), wraca jako tekstura w kształcie liter. Przeliteruj każde słowo, które ma być czytelne, a następnie dodaj: nie popełniaj błędów ortograficznych, nie dodawaj innego tekstu, nie dodawaj napisów.

Ile obrazów referencyjnych, filmów i klipów audio może użyć jeden prompt MiniMax H3?

Dziewięć obrazów, trzy filmy i trzy klipy audio, łącznie dwanaście plików, przy czym referencyjny film i audio trwają od 2 do 15 sekund każdy. Audio nie może być jedynym odniesieniem. Należy pamiętać, że możliwości modelu i to, co udostępnia dany endpoint, to dwie różne rzeczy, więc sprawdź stronę modelu dla aktualnej listy wejściowej.

Czy prompt MiniMax H3 może kontrolować, jak kończy się klip, nie tylko jak się zaczyna?

Tak, w image-to-video, za pomocą opcjonalnego parametru end_image. Podaj pierwszą klatkę i ostatnią klatkę, a klip interpoluje między nimi. Powyższa demonstracja jest dokładnie tym: panel komiksu 2 na wejściu, panel 6 na wyjściu. Utrzymuj dwa obrazy w podobnych proporcjach, w przeciwnym razie przejście staje się brzydkie.

Jakie czasy trwania i rozdzielczości mogę faktycznie uzyskać teraz?

2K, i tylko 2K. Zadanie w 768p jest obecnie odrzucane z supported resolutions: 2K, mimo że 768p pojawia się w tabeli cenowej. Czas trwania różni się w zależności od endpointu: text-to-video i image-to-video akceptują 5 do 10 sekund z domyślną wartością 8, podczas gdy reference-to-video akceptuje 5 do 15. Jeszcze jeden haczyk: w generacji tylko tekstowej API odrzuca adaptacyjne i wymaga jawnego ustawienia proporcji.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele