Använd MiniMax H3 som en kort produktionsbrief, inte som en enda bildprompt. Den återanvändbara strukturen är enkel: binda varje referenstillgång, ange kärnidén, skriv sedan scenen som en tidsatt audiovisuell sekvens med kamerarörelse, dialog, stämning, musik och begränsningar i separata block.
Den här guiden baklängeskonstruerar 45 officiella MiniMax H3-exempel till en sexdelad promptformel, visar var end_image hör hemma, förklarar hur inbyggda ljudsignaler förändrar resultatet och ger en praktisk lösning för förvrängd text i genererade klipp.
Du vet redan hur du promptar en videomodell. "Cinematiskt ljus, slow push in, 4K." Det ordförrådet har räckt i två år.
Sedan klistrar du in det i MiniMax H3 och får ett 2K-klipp som kommer med sitt eget soundtrack. Bilden ser bra ut. Tempot är mos. Två bokstäver i din titel är felstavade. Ljudet är någon rumston som modellen valde åt dig.
Modellen är inte problemet. Du gav den en mening. Den ville ha ett schema.
Så jag gick och läste alla 45 exempelprompts som MiniMax levererade med H3, plus de färdiga klipp som följde med, och plockade isär bilderna. De officiella prompterna är inte beskrivningar. De bra är bildlistor med en musiknoteringslista fastsatt på baksidan. Nedan följer strukturen, parametrarna som faktiskt är exponerade just nu och en demo du kan återskapa på ungefär tjugo minuter.
Viktiga insikter
- H3-prompter är tidslinjer, inte beskrivningar. De starkaste officiella exemplen klipper bokstavligen klippet med markörer som [0s-2s], [2s-4s] och den färdiga filmen träffar varje slag.
- Ljud och bild kommer från samma pass, så ljud måste finnas i promptens brödtext. Officiella prompts ger det ett eget block, ner till "jazzbasgroove inträder vid 6s."
- Text du stavar ut kommer tillbaka ren. Text du inte stavar ut kommer tillbaka som bokstavsformade brus. Jag har bildutskärningar från ett enda officiellt klipp som bevisar båda halvorna samtidigt.
- image-to-video accepterar en end_image. Ge den en första bildruta och en sista bildruta så är den känslomässiga bågen fastställd innan du lägger en sekund på beräkning.
- Promptlängd är inte en dygd. Korta officiella prompts fungerar när en referensbild gör beskrivningen. Längden speglar hur mycket av jobbet du vägrade lägga på en referens.
The This Is Fine-hunden, fortfarande till vänster och brinner ner i 10 sekunder av MiniMax H3-utdata till höger
Det är samma teckning på båda sidor. Vänster är KC Greens originalpanel, oberörd. Höger är ett enda image-to-video-anrop: första bildrutan in, sista bildrutan in, tio sekunder ut, och eldens sprakande och det platta lilla "this is fine" är modellens eget ljudspår. Ingen har komponerat det. Allt i den här guiden syftar till att få dig till den andra halvan.
Vad en MiniMax H3-prompt faktiskt ser ut som (jag läste alla 45)
Varje "MiniMax H3-promptguide" som för närvarande finns på första sidan i sökresultaten är en specifikation: 2K, 24 fps, 5 till 15 sekunder, inbyggt ljud. Det är modellkortet. Det är inte en prompt.
Här är en riktig. Det här är en del av den officiella prompten bakom MiniMax noir-titelsekvens, översatt från den kinesiska originaltexten, ungefär en tredjedel av dess fulla längd:
Generera en 15-sekunders 16:9 lättspänningskriminalfilmstitel. Övergripande stil refererar till det visuella språket i dessa bilder: retro-japanska anime-titelkort, skarpa silhuetter, serietidningscollage, asymmetrisk delad skärm, starka geometriska färgblock, engelska krediter, lite japansk katakana-dekoration, jazzkriminal-känsla. Stämningen är 60% spänning, 40% jazz: mystisk, cool, smidig, urban-kriminal, inte skräck, inte tung, och gör det inte till ett glatt jazz-MV.
[...] Engelska krediter måste vara tydligt läsbara [...] Lägg inte till kinesiska, producera inte förvrängd text, stava inte fel på engelskan. Regel för hela stycket: varje engelsk kredit och jobbtitel förekommer exakt en gång. Upprepa inte en jobbtitel, upprepa inte ett namn, ge inte en person flera titlar.
Övergångar måste vara varierade: cirkulär vinylskivmask, vertikal bildörrsövergång, en persons långa skugga som sveper över skärmen, rödlinjeklipp, gigantisk engelsk bokstavsmask, delad skärm, hårda färgblocksklipp, paneler som klistras in block för block. Alla övergångar landar på trumslagen: skarpa, spänningsfyllda, smidiga, serietidningscollage. Inga mjuka övertoningar, inga flytande övergångar.
BGM: original 15-sekunders titelmusik, 60% spänning, 40% jazz. Byggd av en ihållande baston, spända pizzicatosträngar, kalla synthpulser, kicktrumma, glesa jazzborstar, ett vandrande basfragment, korta barytonsaxfraser och korta brass-stötar. Första 2 sekunderna etablerar spänning med låga frekvenser och hi-hat, vid 3 sekunder kommer låga trummor in, vid 6 sekunder ansluter jazzbasgroovet, vid 10 sekunder dyker ett kort sax/brass-ryck upp, de sista 2 sekunderna låser det med ett spänt ackord och trumslag.
Läs var orden hamnade. Nästan inga av dem gick till "vacker" eller "cinematisk." De gick till en negativ lista, en övergångslista och en sekund-för-sekund-musiknoteringslista. Det är formen på jobbet.
MiniMax H3 officiell noir-titelsekvens: MIDNIGHT LINE, med rena STARRING-krediter
Titta på krediterna i det klippet. MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS. Rättstavade, ingen jobbtitel använd två gånger, katakana-dekoration sitter där den ombads sitta. Promten sa inte "gör fina titlar." Den sa inga upprepningar, inga felstavningar, inget kinesiska, och namngav estetiken på fem olika sätt.
Fem stiltavlor som lämnades till MiniMax H3 tillsammans med noir-titelprompten
De fem tavlorna gick in med texten. Fem bilder plus en lång brief, en generation. Det är vad det här arbetet ser ut som nu.
Och anledningen till att så många av de 45 prompterna är korta sitter där i bilden. Över hela uppsättningen är medianprompten runt 130 kinesiska tecken, men de två längsta är 657 och 858. De korta är korta för att en referenstavla bär beskrivningen. De långa är långa för att inget annat skulle bära den.
Varför de flesta MiniMax H3-prompter blir platta, och lösningen på förvrängd text
Tre saker går fel, och de är alla frånvaro snarare än misstag.
Ingen tidslinje. Du bad om tio sekunder och beskrev ett ögonblick, så du får en långsam push-in som sträcks över tio sekunder. Modellen hade inget att göra vid sekund sju.
Inget ljudblock. Ljud genereras i samma pass som bild. Om du inte säger något, skickar modellen ändå ett spår till dig. Den väljer bara ett.
Ingen negativ lista. Lämnad för sig själv sträcker sig modellen efter mjuka övertoningar, hittar på extra text på skärmen och lägger till en undertextremsa som ingen bad om.
Det tydligaste beviset är den officiella spel-UI-promten, som är byggd av sex tidsstämplade slag: [0s-2s] meny, [2s-4s] högerarmspanel, [4s-7s] beväpningsrutnät, [7s-8.5s] bekräfta, [8.5s-10s] laddningsfält, [10s-15s] världen laddas in. Det färdiga klippet träffar alla sex, i ordning, i tid.
MiniMax H3 spel-UI-klipp: meny, utrustningspanel, laddningsfält, världsladdning
Nu den ärliga halvan, från samma klipp, i full 2560x1440 upplösning.
Vänster: text som stavats ut i prompten renderas rent. Höger: text som inte stavats ut renderas som bokstavsformat brus
Till vänster, varje sträng som prompten faktiskt skrev: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW. Skarp, korrekt, kerning som en riktig spelmeny.
Till höger, HUD:en i den sista gatubilden, som prompten bara kallade "HUD-element." Det står ETR METNO CITFEP. Ovanför utrustningsikonerna, där prompten inte sa något, får du MNALEαIN IAMG. Det är inte en renderingsbugg. Modellen ritar texturen av engelska för att den aldrig fick strängen.
Så lösningen är inte en inställning. Det är en vana:
Om ett ord måste vara läsbart, skriv ordet. Lägg sedan till en negativ rad: stava inte fel, lägg inte till annan text, lägg inte till undertexter.
Och här är den sexblockiga formen som varje stark officiell prompt visar sig dela.
| Block | Vad som ingår i det | Exempel från en officiell prompt | Hoppa över det och du får |
|---|---|---|---|
| 1. Stilkontrakt | Medium, textur, palett, era, utseendet du inte får förlora | "retro-japanska anime-titelkort, skarpa silhuetter, serietidningscollage, starka geometriska färgblock" | En generisk glansig render som driver vid sekund sex |
| 2. Tidslinje | Bokstavliga tidssegment med en handling i varje | [2s-4s] Mjuk zoom till hennes högra arm. UI-panel glider in från höger | En idé utsträckt över hela varaktigheten |
| 3. Kamera | Rörelse, eller ett explicit avslag på rörelse | "låst, statisk vidvinkel, ingen push-in, inga klipp" | En standard långsam dolly du inte bad om |
| 4. Ljud | Varje ljud, och när det kommer in | "vid 6 sekunder ansluter jazzbasgroovet, de sista 2 sekunderna låser det med ett spänt ackord" | Vilken rumston modellen gillar idag |
| 5. Text, stavad ut | De bokstavliga strängarna, inom citattecken | "THIS IS FINE." / CONFIRM CONFIG | Bokstavsformat brus, som ovan |
| 6. Negativ lista | Övergångarna, objekten och klichéerna att avvisa | "Inga mjuka övertoningar, inga flytande övergångar, lägg inte till kinesiska, upprepa inte en jobbtitel" | Mjuka övertoningar, påhittad text, olycksbådande drift |
Block 5 och 6 är gratis. De kostar inget extra att generera och det är där större delen av kvaliteten bor.
MiniMax H3-promptarbetsflöde: Vilken slutpunkt din prompt tillhör
Samma nyckel, samma submit-and-poll-form, tre dörrar. Vilken du väljer avgör vad din prompt fortfarande måste göra.
| Slutpunkt | Vad du ger den | Vad den låser för dig | Parametrar värda att känna till | Ta till den när | Debitering |
|---|---|---|---|---|---|
| minimax/h3/text-to-video | Endast prompt | Ingenting. Texten bär allt | duration 5-10 (standard 8), upplösning 2K, ratio måste anges explicit | Testa en look eller en ljuddesign innan du förbinder dig | Debiteras per sekund utdata, nuvarande pris på modellsidan |
| minimax/h3/image-to-video | Prompt + bild (första bildrutan), valfri end_image | Var klippet börjar, och valfritt var det landar | end_image, duration 5-10 (standard 8), ratio adaptiv som standard | Du har konstverk och vill att det ska röra sig utan att ritas om | Debiteras per sekund utdata |
| minimax/h3/reference-to-video | Prompt + refers[] | Subjektets identitet och stil, över en scen du hittar på | refers[] blandad array, duration 5-15, ratio upp till 21:9 | Samma karaktär eller produkt, ny miljö | Debiteras per sekund utdata |
refers[] är den som är genuint underdokumenterad i naturen, så här är formen den vill ha:
json1"refers": [ 2 { "url": "https://.../subject.png", "type": "image" }, 3 { "url": "https://.../style-board.png" }, 4 { "url": "https://.../motion-ref.mp4", "type": "video" }, 5 { "url": "https://.../beat.mp3", "type": "audio" } 6] 7
Fyra regler som var och en sparar dig en bortkastad generation:
- Ljud kan inte åka ensamt. Minst en bild eller video måste finnas i arrayen. Ett beatspår avvisas om det är ensamt.
- type är valfritt. Det härleds från URL:en, men ange det ändå när filändelsen är tvetydig.
- Takgränserna är verkliga. Upp till 9 bilder, 3 videor och 3 ljudklipp, 12 filer totalt, med referensvideo och ljud som varar 2 till 15 sekunder var (MiniMax API-dokumentation, juli 2026).
- Ge varje referens ett jobb inuti prompttexten. Detta är den högst inflytelserika vanan på denna lista. Officiella prompts öppnar med rader som "Bild 1 är den övergripande stämnings- och stilreferensen, Bild 2 är huvudkaraktärsreferensen." Utan den meningen måste modellen gissa vilken tavla som betyder vad.
MiniMax H3 dark-pop-musikvideo: CUT BACK, ONE LOOK, DETONATE typografi
De två typografiska referenstavlorna bakom dark-pop-klippet
Det klippet är argumentet för regel 4. Dess prompt beskriver aldrig en enda bokstavsform. Den säger "textförpackningsstil och textur refererar till bilderna," och lämnar över två tavlor. Layouten anlände för att den visades, inte beskrevs.
En tabell till, eftersom modellkortet och API:et för närvarande inte säger samma sak, och gapet är där folk förlorar en eftermiddag.
| Sak | MiniMax egen dokumentation | Vad slutpunkterna faktiskt accepterar idag | Vad det betyder för din prompt |
|---|---|---|---|
| Varaktighet | 4 till 15 sekunder, endast heltal | text-to-video och image-to-video: 5 till 10, standard 8. reference-to-video: 5 till 15, standard 8 | En 15-sekunders bildlista passar bara reference-to-video just nu. Skriv om längre tavlor till 10 |
| Upplösning | 2K | upplösning standard är 2K, och 2K är för närvarande det enda värdet som körs. Ett 768p-jobb kommer tillbaka med meddelandet MiniMax-H3 stöder inte upplösning 768P, stödda upplösningar: 2K, även om 768p visas i prislistan | Skriv för en 1440px kortsida. Detaljer du ber om kommer faktiskt att överleva |
| Bildförhållande | Vanliga eller adaptivt | image-to-video och reference-to-video standard till adaptivt. Text-only avvisar adaptivt och returnerar sin tillåtna uppsättning: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9 | På text-to-video, ange ratio explicit eller så misslyckas jobbet med validering |
| Blandade referenser | 9 bilder, 3 videor, 3 ljud, 12 filer, ljud aldrig ensamt | refers[] tar {url, type} med bild, video eller ljud, minst en bild eller video | Du kan verkligen synkronisera rörelse till ett medföljande beat. Du kan bara inte bara leverera beatet |
| Inbyggt ljud | Stereoljud i samma pass | Varje av de nio officiella klipp jag undersökte: 2560x1440, 24fps, AAC stereo vid 32kHz | Ljudblocket är inte dekoration. Det är hälften av leveransen |
Allt ovan kördes på Atlas Cloud, där alla tre H3-slutpunkter sitter bakom en nyckel och en submit-and-poll-loop, så att växla mellan dem är en ändring av modellsträng och inget annat.
MiniMax H3-prompttutorial: Sätt eld på This Is Fine-hunden, med ljud
Här är hela grejen från början till slut. Skämtet fungerar för att hunden inte gör någonting. Sträck ut det förnekandet till tio sekunders realtid, lägg till riktig eld, och låt de sista två sekunderna gå dit den ursprungliga serien faktiskt gick, så blir det roligare och lite värre för dig. De flesta har bara sett de två första panelerna.
Steg 1: Ladda ner den ursprungliga serien. Låt inte en AI rita om den.
Strippen är sex paneler, två kolumner och tre rader, 600 gånger 887. Vi vill bara ha panel 2 och panel 6.
bash1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png 2# 600x887, 6 paneler, 2 kolumner x 3 rader 3 4# beskära panel 2 ("THIS IS FINE."-panelen): x 302-584, y 20-293 5# beskära panel 6 (den smältande hunden): x 302-584, y 595-868 6# uppskala varje 4x med Lanczos -> 1128x1092 7
Säg det rakt: be inte en bildmodell att rita "en hund som ser ut som This Is Fine." En AI-återskapning avslöjas som fejk på en halv sekund och skämtet dör på fläcken. Akvarelltvätten, den vingliga handtexten och pappersstrukturen är hela kontraktet. 4x Lanczos-uppskalningen är bara där för att 282px källa är tunt; den ger modellen verkliga pixlar att hålla fast vid utan att hitta på något.
Panel 2 och panel 6 av den ursprungliga serien, märkta som första bildrutan och slutbildsinmatningarna
Steg 2: Kör den på image-to-video med en end_image.
Modell: minimax/h3/image-to-video. Inställningar: upplösning 2K, image = panel 2, end_image = panel 6, ratio 1:1 för att matcha den ungefär kvadratiska källan. Ställ in duration till 10; skjutreglaget ligger på 8 som standard, så dra det.
text1Handmålad 2D-webbseriepanel, väckt till liv. Behåll den ursprungliga akvarelltexturen, 2synliga bläckkonturer, oregistrerad pappersstruktur och platt seriefärgpalett i varje 3bildruta. Jämna inte ut, rendera inte om i 3D, rensa inte upp linjerna, lägg inte till nya 4objekt, lägg inte till ny text. 5 6[0s-3s] Nästan ingenting rör sig. Hunden sitter helt stilla, håller muggen, ögonen 7fästa rakt fram. Bara lågorna bakom honom rör sig: långsamma orangea tungor som klättrar 8uppför väggen, en glöd som driver uppåt. Pratbubblan som läser "THIS IS FINE." 9stannar exakt där den är, fullt läsbar, oförändrad, handtextad. 10 11[3s-6s] Hunden lyfter muggen och tar en liten, lugn klunk. Pratbubblan bleknar bort 12efter klunken. Elden ljusnar. Väggen bakom honom börjar böja sig av värmen. Hans 13hatt börjar pyra i kanten. 14 15[6s-8.5s] Värmen når honom. Hans öron sjunker, hans konturer mjuknar och börjar 16rinna nedåt som våt färg. Han flyttar fortfarande inte blicken. Muggen stannar i 17hans tass. 18 19[8.5s-10s] Full smältning. Ansiktet förvrids, ett öga glider, tänder blottade i ett 20fixerat grin, pälsen rinner röd och orange. Han håller posen. Håll den sista bildrutan 21under den sista halvsekunden. 22 23Kamera: låst, statisk vidvinkelbild, ingen push-in, ingen handhållen, inga klipp. 24Bildrutan rör sig aldrig. Det här är en enda kontinuerlig tagning inuti en seriepanel. 25 26Ljud: rumston av en inomhuseld genomgående - lågt sprakande, enstaka knäpp från 27brinnande trä, ett svagt strukturellt knarrande. Vid 3s, en keramikmugg som nuddar tänder och 28en liten sväljning. En lugn, platt, obekymrad manlig röst säger exakt: "This is fine." 29- poker, ingen känsla, lite för avslappnad. Från 6s växer sprakandet och 30rumstonen tjocknar; de sista 2 sekunderna lägger till en låg sub-bas-svällning. Ingen 31musik, inget skrattspår, inga ljudeffekter som inte finns i den här listan. 32 33Lägg inte till undertexter. Lägg inte till en vattenstämpel. Stava inte något annat ord än 34orden som redan finns i bilden. Ändra inte "THIS IS FINE." Klipp inte bort. 35
Den prompten är strukturtabellen, levande. Första stycket är stilkontraktet. De fyra parentesavsnitten är tidslinjen. Sedan kamera, sedan ljud, sedan den negativa listan. Ingenting i den är dekorativt.
MiniMax H3 image-to-video på Atlas Cloud: första bildrutan och slutbilden laddade, 10 sekunder i 2K, färdigt klipp i utdatapanelen
Steg 3: Läs utdatan som en QA-godkännande.
Fyra kontroller, var och en testar ett annat block i prompten.
- Är THIS IS FINE. i bubblan fortfarande läsbar och fortfarande rättstavad? Det testar block 5.
- Överlevde linjerna, eller "förbättrade" något dem till ren 3D? Det testar block 1.
- Innehåller ljudet bara de ljud du listade? Undersök behållaren: den bör komma tillbaka som h264 plus AAC stereo.
- Landar den sista bildrutan på panel 6:s pose? Det testar end_image.
bash1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \ 2 -of default=noprint_wrappers=1 output.mp4 3
Min kom tillbaka på 1472x1440, 24fps, h264 plus AAC stereo, 10.13 sekunder. Värt att notera: jag bad om ratio: 1:1 och fick 1472x1440, så på image-to-video vinner källbildens form. Matcha dina två paneler till den form du faktiskt vill ha.
Fyra bildrutor från det färdiga klippet vid 0s, 3s, 6.5s och 10s, som matchar de fyra tidssegmenten i prompten
Steg 4: Flytta hunden någonstans ny med reference-to-video.
Samma karaktär, nytt rum. Modell: minimax/h3/reference-to-video. Inställningar: refers[] = panel 2 som bild, duration 8, upplösning 2K, ratio 16:9.
text1Bild 1 är karaktärs- och sttireferensen: behåll denna exakta handmålade 22D-webbserielook, samma akvarelltextur, samma bläckkonturvikt, samma 3hund, samma lilla hatt, samma mugg. Rita inte om honom i 3D, ändra inte 4hans proportioner, rensa inte upp linjerna. 5 6Placera honom i ett annat rum och behåll hans lugn. Ett trångt öppet kontor på 7kvällen, lysrör som flimrar, en vägg med skärmar som alla visar ett rött 8felläge, skrivarpapper som driver ner genom bilden, en liten elektrisk brand i 9hörnet. Han sitter i en kontorsstol i mitten av bilden, muggen i tassen, tittar 10rakt in i kameran, helt avslappnad. 11 12Kamera: låst, statisk vidvinkelbild. Ingen push-in, inga klipp. 13 14Ljud: lysrörssurr, skrivarmalande, ett upprepande mjukt alarmpip varannan 15sekund, avlägset elektriskt sprakande, en lugn klunk vid 4s. Ingen musik. Ingen röst. 16 17Lägg inte till någon text på skärmen. Lägg inte till undertexter. Lägg inte till andra karaktärer. 18
Den överförbara regeln: refers[] bär identitet och stil, texten bär scenen. Den uppdelningen är hela tricket för karaktärskonsistens, och det är därför promptens första rad existerar överhuvudtaget.
Samma webbseriehund flyttad till ett brinnande öppet kontor på natten, genererad av MiniMax H3 reference-to-video
Samma hatt, samma mugg, samma bläckvikt, nytt rum. En referensbild gjorde allt det.
Tre mer MiniMax H3-promptmönster värda att stjäla
Mönster 1: rörelseaffischen, där layouten inte får röra sig.
MiniMax H3 rörelseaffisch: POPUP!-layouten animeras medan ramen och typografin förblir låsta
Den ursprungliga statiska affischen som lämnades till MiniMax H3
Hela prompten är två rader: behåll den vita gallerramen, den inre ramen, den röd-svart-vita paletten, 3D-figurkänslan och layoutstrukturen oförändrad, och lägg en smidig ljudeffekt under textens inträde. Regeln: namnge de delar som måste överleva. "Behåll layouten" är inte en stilanteckning, det är en begränsning, och modellen behandlar den som en.
Mönster 2: gränssnittsdemon, där verb slår adjektiv.
MiniMax H3 landningssida demo: scroll, hover, färginversion på en produktsida
Den enskilda produktreferensbilden bakom landningssidklippet
Den prompten ber om en nedåtgående sidscroll, ett hover-tillstånd, en stark uppskalning och en färginversion. Fyra verb. Den säger aldrig "modern" eller "elegant." Interaktioner är handlingar, så skriv dem som handlingar. Den överdimensionerade kursiva type och kolväven i bakgrunden kom från adjektiven; det som får den att läsas som en riktig sida kom från verben.
Mönster 3: live action plus handritad, hållen samman av avvisanden.
MiniMax H3-klipp som smälter samman live-action-köksbilder med handritade glödande varelser
Det här är ett kvällskök fotat med telefon med små glödande handritade varelser i, och anledningen till att det förblir charmigt istället för att bli en skräckkortfilm är en lista förbud: inga jätteögon, inga delade munnar, inga huggtänder, inget hotfullt kroppsspråk, inget utfall, ingen plötslig klipp till svart, inga jumpscares. Den negativa listan är den primära stilreglaget, inte en lapp. Det är också där du kodar smak.
Fyra bildrutor från den officiella sci-fi-trailern: THE STARS WERE LISTENING
Moodboarden och karaktärsreferensen bakom trailern
Trailern ovan sluter cirkeln för båda idéerna. Promten stavar ut en titel, THE STARS WERE LISTENING, i detalj: extremt smal, fet, versaler, mörkröd blandad med rost, lätt korn och dimmiga kanter. Den kommer tillbaka exakt som beställt. Två referenstavlor hanterar stämningen och huvudpersonen, så texten behöver aldrig beskriva ett ansikte. Arbetsfördelning, hela vägen ner.
Vad det kostar att köra dessa MiniMax H3-prompter
H3 debiteras per sekund genererad video, efter upplösning, så kostnadsmodellen är uppfriskande tråkig: en 15-sekunders tagning kostar ungefär tre 5-sekunders försök. Allt annat följer av det.
- Iterera vid 5 sekunder, leverera vid 10 eller 15. Komposition, palett och ljuddesign löser sig alla vid 5. Ingenting med en låst bild behöver hela varaktigheten för att berätta att det är fel.
- end_image är ett kostnadsverktyg, inte bara ett kreativt. De flesta omkörningar beror på att slutet drev iväg. Att låsa den sista bildrutan tar bort den feltoleransen innan du betalar för den.
- Negativa listor och utstavad text är gratis. De lägger till tecken i en prompt som debiteras per sekund, inte per token. Använd dem mycket.
- Matcha varaktighet till slutpunkten innan du skriver. Att bygga en 15-sekunders bildlista och sedan upptäcka att din slutpunkt slutar vid 10 kostar dig en omskrivning, inte bara en omkörning.
En sak att inte planera för än: prislistorna listar en billigare 768p-nivå, men i skrivande stund avvisas ett 768p-jobb rakt av och 2K är den enda upplösningen som körs. Budgetera som om varje sekund är en 2K-sekund. Nuvarande priser per sekund finns på modellsidan, som också är där 768p-nivån kommer att dyka upp när den öppnas.
MiniMax H3-prompter, memes och upphovsrätt
Hunden är inte allmän egendom. This Is Fine kommer från KC Greens webbserie Gunshow #648, publicerad 9 januari 2013, och bara de två första panelerna blev någonsin virala (Know Your Meme, januari 2013). Green har talat offentligt, och ganska trött, om att se bilden återanvändas för evigt, inklusive av personer vars politik han inte delar (NPR, januari 2023).
Denna genomgång är kommentar och undervisning, inte ett bildbibliotek. Om du vill skicka något kommersiellt, rita dina egna bilder eller licensiera dem du använder. Och kör din egen policykontroll innan ett klientjobb: H3 tillämpar innehållsregler på igenkännliga verkliga personer och välkänd IP, och att upptäcka det mitt i en deadline är inte kul.
Vanliga frågor
Genererar MiniMax H3 ljud, eller lägger jag till det efteråt?
Samma pass. Bild och ljud kommer ut tillsammans, vilket är precis varför ljud måste skrivas in i promptens brödtext snarare än att läggas på senare. Ge den ett eget Ljud: block och ange när varje ljud kommer in. Varje av de nio officiella klipp jag undersökte kom tillbaka som AAC stereo vid 32kHz tillsammans med en 2560x1440, 24fps videoström.
Hur lång kan en MiniMax H3-prompt vara?
Upp till 7 000 tecken, enligt MiniMax dokumentation. I praktiken spänner de officiella exemplen över ett brett spektrum, med en median runt 130 kinesiska tecken och de två längsta på 657 och 858. Korta prompts fungerar bra när en referensbild gör beskrivningen. Om du inte har några referenser, förvänta dig att skriva en bildlista.
Varför blir text förvrängd i mina MiniMax H3-videor?
För att du inte skrev den. Strängar som förekommer ordagrant i prompten renderas rent; allt du pekar på generiskt ("HUD-element," "några etiketter") kommer tillbaka som bokstavsformad textur. Stava ut varje ord som måste vara läsbart, lägg sedan till stava inte fel, lägg inte till annan text, lägg inte till undertexter.
Hur många referensbilder, videor och ljudklipp kan en MiniMax H3-prompt använda?
Nio bilder, tre videor och tre ljudklipp, tolv filer totalt, med referensvideo och ljud mellan 2 och 15 sekunder var. Ljud kan inte vara den enda referensen. Notera att modellens kapacitet och vad en given slutpunkt exponerar är två olika saker, så kontrollera modellsidan för den aktuella inmatningslistan.
Kan en MiniMax H3-prompt styra hur klippet slutar, inte bara hur det börjar?
Ja, på image-to-video, via den valfria parametern end_image. Ge den en första bildruta och en sista bildruta så interpolerar klippet mellan dem. Demon ovan är precis det: serietidningspanel 2 in, serietidningspanel 6 ut. Håll de två bilderna i liknande bildförhållanden, annars blir övergången ful.
Vilka varaktigheter och upplösningar kan jag faktiskt få just nu?
2K, och bara 2K. Ett 768p-jobb avvisas för närvarande med meddelandet stödda upplösningar: 2K, trots att 768p visas i prislistan. Varaktighet skiljer sig åt mellan slutpunkter: text-to-video och image-to-video accepterar 5 till 10 sekunder med standard 8, medan reference-to-video accepterar 5 till 15. En sak till: på text-only-generation avvisar API:et adaptivt och kräver ett explicit ratio.






