ENDAST TVÅ VECKOR | 20% RABATT på Seedream 5.0 Pro!

MiniMax H3 Prompt Guide: Jag läste alla 45 officiella prompter, sedan satte jag eld på This Is Fine-hunden

En MiniMax H3 promptguide byggd från alla 45 av MiniMax egna exempelpromptar: sexblocksstrukturen, end_image-tricket, inbyggda ljudsignaler och fixen för förvrängd text.

Du vet redan hur du promptar en videomodell. "Cinematic lighting, slow push in, 4K." Det ordförrådet har burit dig i två år.

Sedan klistrar du in det i MiniMax H3 och får tillbaka ett 2K-klipp som kommer med sitt eget ljudspår. Bilden ser bra ut. Tempot är mos. Två bokstäver i din titel är felstavade. Ljudet är någon rumston som modellen valde åt dig.

Modellen är inte problemet. Du gav den en mening. Den ville ha ett schema.

Så jag gick och läste alla 45 exempelpromptar som MiniMax skickade med H3, plus de färdiga klippen som följde med, och dissekerade bildrutorna. De officiella promptarna är inte beskrivningar. De bra är bildlistor med en musikschemaflik baktill. Nedan finns strukturen, parametrarna som faktiskt är exponerade just nu, och en demo du kan återskapa på ungefär tjugo minuter.

Viktiga slutsatser

  • H3-promptar är tidslinjer, inte beskrivningar. De starkaste officiella exemplen skivar bokstavligen klippet med [0s-2s], [2s-4s]-markeringar, och det färdiga filmklippet träffar varje slag.
  • Ljud och bild kommer ur samma körning, så ljudet måste leva inuti promptens brödtext. Officiella promptar ger det ett eget block, ända ner till "jazzbasgroove kommer in vid 6s."
  • Text du stavar ut kommer tillbaka ren. Text du inte stavar ut kommer tillbaka som bokstavsformat brus. Jag har bildutsnitt från ett enda officiellt klipp som bevisar båda halvorna samtidigt.
  • image-to-video accepterar en end_image. Ge den en första bild och en sista bild så är den känslomässiga bågen låst innan du förbrukar en sekund av beräkning.
  • Promptlängd är inte en dygd. Korta officiella promptar fungerar när en referensbild gör beskrivningen. Längden speglar hur mycket av jobbet du vägrade att överlåta åt en referens.

The This Is Fine-hunden, fortfarande till vänster och brinner ner under 10 sekunder av MiniMax H3-utdata till höger

Det är samma teckning på båda sidor. Vänster är KC Greens originalruta, orörd. Höger är ett enda image-to-video-anrop: första bilden in, sista bilden in, tio sekunder ut, och eldens sprakande och det platta lilla "this is fine" är modellens eget ljudspår. Ingen har komponerat det. Allt i den här guiden syftar till att få dig till den andra halvan.

Hur ett MiniMax H3-prompt faktiskt ser ut (jag läste alla 45)

Varje "MiniMax H3-promptguide" som just nu ligger på första sidan i sökresultaten är ett specifikationsblad: 2K, 24 fps, 5 till 15 sekunder, inbyggt ljud. Det är modellkortet. Det är inte ett prompt.

Här är ett riktigt. Det här är en bit av det officiella promptet bakom MiniMax noir-titelsekvens, översatt från den kinesiska originaltexten, ungefär en tredjedel av dess fulla längd:

Generera en 15 sekunder lång 16:9-titelsekvens för en lättspänd kriminalfilm. Övergripande stil refererar till det visuella språket i dessa bilder: retro japansk anime-titelkort, hårdkantade silhuetter, seriekollage, asymmetrisk delad skärm, starka geometriska färgblock, engelska krediteringar, lite japansk katakana-dekoration, jazz-kriminalkänsla. Stämningen är 60 % spänning, 40 % jazz: mystisk, cool, smidig, urban-kriminal, inte skräck, inte tung, och gör det inte till en gladlynt jazz-MV.

[...] Engelska krediteringar måste vara tydligt läsbara [...] Lägg inte till kinesiska, producera inte förvrängd text, stava inte fel på engelskan. Regel för hela stycket: varje engelsk kreditering och jobbtitel förekommer exakt en gång. Upprepa inte en jobbtitel, upprepa inte ett namn, ge inte en person flera titlar.

Övergångar måste vara varierade: cirkulär vinylskivemask, vertikal bildörrs-torkning, en figurs långa skugga som sveper över skärmen, röd linje-klippning, mask av stor engelsk bokstav, omkomponering av delad skärm, hårt färgblocksklipp, paneler inklistrade block för block. Alla övergångar landar på trumslagen: skarpa, spända, smidiga, seriekollage. Inga mjuka upplösningar, inga flytande övergångar.

BGM: original 15-sekunders titelmusik, 60 % spänning, 40 % jazz. Byggd på en ihållande bas-ton, spända pizzicatostråkar, kalla synthpulser, bastrumma, glesa jazzborstar, ett vandrande basfragment, korta barytonsaxofrasfraser och korta mässingstötar. Första 2 sekunderna etablerar spänning med låga frekvenser och hi-hat, vid 3 sekunder kommer de låga trummorna in, vid 6 sekunder ansluter jazzbasgroovet, vid 10 sekunder dyker ett kort saxofon/mässingsriff upp, de sista 2 sekunderna låser det med ett spänt ackord och trumslag.

Läs var orden hamnade. Nästan inga av dem gick till "vackert" eller "cinematiskt." De gick till en negativ lista, en övergångslista och en sekund-för-sekund-musikschema. Det är formen på jobbet. Noir anime-banner med silhuettfigur på ett tunnelbanetåg MiniMax H3 officiell noir-titelsekvens: MIDNIGHT LINE, med rena STARRING-krediteringar

Titta på krediteringarna i det klippet. MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS. Korrekt stavat, ingen jobbtitel använd två gånger, katakana-dekoration där den skulle sitta. Promptet sa inte "gör snygga titlar." Det sa inga upprepningar, inga felstavningar, ingen kinesiska, och namngav estetiken på fem olika sätt. Fem noir-inspirerade filmpaneler med silhuettfigurer i blått och orange Fem stilreferenskartor som skickades till MiniMax H3 tillsammans med noir-titelprompten

De fem kartorna följde med i texten. Fem bilder plus en lång brief, en generering. Så här ser det arbetet ut nu.

Och anledningen till att så många av de 45 promptarna är korta finns precis där i bilden. Över hela uppsättningen är medianprompten runt 130 kinesiska tecken, men de två längsta är 657 och 858. De korta är korta för att en referenskarta bär beskrivningen. De långa är långa för att inget annat skulle kunna bära den.

Varför de flesta MiniMax H3-promptar blir platta, och fixen för förvrängd text

Tre saker går fel, och de är alla frånvaro snarare än misstag.

Ingen tidslinje. Du bad om tio sekunder och beskrev ett ögonblick, så du får en långsam inskjutning utdragen över tio sekunder. Modellen hade inget att göra vid sekund sju.

Inget ljudblock. Ljud genereras i samma körning som bild. Om du inte säger något levererar modellen ändå ett spår. Den väljer bara ett.

Ingen negativ lista. Lämnad åt sig själv sträcker sig modellen efter mjuka upplösningar, hittar på extra text på skärmen och lägger till en undertextsremsa som ingen bad om.

Det tydligaste beviset är det officiella spel-UI-promptet, som är byggt av sex tidsstämplade beats: [0s-2s] meny, [2s-4s] högerarmspanel, [4s-7s] beväpningsgrid, [7s-8.5s] bekräfta, [8.5s-10s] laddningsfält, [10s-15s] världen laddas in. Det färdiga klippet träffar alla sex, i ordning, i tid. Spelmeny som visar val av en robotisk Phantom Grip-arm MiniMax H3-spel-UI-klipp: meny, utrustningspanel, laddningsfält, världsladdning

Nu den ärliga hälften, från samma klipp, i full 2560x1440-upplösning. Jämförelse av läsbar spel-UI-text och förvrängd AI-text Vänster: text som stavats ut i prompten renderas rent. Höger: text som inte stavats ut renderas som bokstavsformat brus

Till vänster, varje sträng som prompten faktiskt skrev ut: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW. Skarp, korrekt, kerning som en riktig spelmeny.

Till höger, HUD:en i den sista gatubilden, som prompten bara kallade "HUD-element". Den läser ETR METNO CITFEP. Ovanför utrustningsikonerna, där prompten inte sa något, får du MNALEαIN IAMG. Det är inte en renderingsbugg. Modellen ritar texten strukturen av engelska eftersom den aldrig fick strängen.

Så fixen är inte en inställning. Det är en vana:

Om ett ord måste vara läsbart, skriv ordet. Lägg sedan till en negativ rad: stava inte fel, lägg inte till annan text, lägg inte till undertexter.

Och här är den sexblocksform som varje starkt officiellt prompt visar sig dela.

BlockVad som ingårExempel från ett officiellt promptHoppa över det och du får
1. StilkontraktMedium, textur, palett, era, looken du inte får förlora"retro japanska anime-titelkort, hårdkantade silhuetter, seriekollage, starka geometriska färgblock"En generisk glansig render som driver vid sekund sex
2. TidslinjeBokstavliga tidsintervall med en handling i varje[2s-4s] Mjuk zoom till hennes högra arm. UI-panel glider in från högerEn idé utdragen över hela varaktigheten
3. KameraRörelse, eller ett explicit vägran att röra sig"låst, statisk vidvinkel, ingen inskjutning, inga klipp"En standardslow dolly du inte bad om
4. LjudVarje ljud, och när det kommer in"vid 6 sekunder ansluter jazzbasgroovet, de sista 2 sekunderna låser det med ett spänt ackord"Vilken rumston modellen råkar gilla idag
5. Text, utskrivenDe bokstavliga strängarna, inom citattecken"THIS IS FINE." / CONFIRM CONFIGBokstavsformat brus, som ovan
6. Negativ listaÖvergångarna, objekten och klyschorna du vägrar"Inga mjuka upplösningar, inga flytande övergångar, lägg inte till kinesiska, upprepa inte en jobbtitel"Mjuka upplösningar, påhittad text, kuslig drift

Block 5 och 6 är gratis. De kostar inget extra att generera och där bor det mesta av kvaliteten.

MiniMax H3-promptarbetsflödet: Vilken endpoint ditt prompt tillhör

Samma nyckel, samma skicka-och-poll-form, tre dörrar. Vilken du väljer avgör vad ditt prompt fortfarande måste göra.

EndpointVad du ger denVad den låser för digParametrar värda att känna tillAnvänd den närDebitering
minimax/h3/text-to-videoEndast promptInget. Texten bär alltduration 5-10 (standard 8), upplösning 2K, ratio måste anges explicitTesta en look eller en ljuddesign innan du förbinder digDebiteras per sekund utdata, aktuell kurs på modellsidan
minimax/h3/image-to-videoPrompt + bild (första bilden), valfri end_imageVar klippet börjar, och eventuellt var det landarend_image, duration 5-10 (standard 8), ratio adaptiv som standardDu har konstverk och vill att det rör sig utan att ritas omDebiteras per sekund utdata
minimax/h3/reference-to-videoPrompt + refers[]Subjektets identitet och stil, över en scen du hittar pårefers[] blandad array, duration 5-15, ratio upp till 21:9Samma karaktär eller produkt, ny miljöDebiteras per sekund utdata

refers[] är den som verkligen är underdokumenterad i det vilda, så här är formen den vill ha:

json
1"refers": [
2  { "url": "https://.../subject.png", "type": "image" },
3  { "url": "https://.../style-board.png" },
4  { "url": "https://.../motion-ref.mp4", "type": "video" },
5  { "url": "https://.../beat.mp3",       "type": "audio" }
6]
7

Fyra regler som var och en sparar dig en bortkastad generering:

  1. Ljud kan inte åka ensamt. Minst en bild eller video måste finnas i arrayen. En beat-track ensam avvisas.
  2. type är valfritt. Det härleds från webbadressen, men ange det ändå när filändelsen är tvetydig.
  3. Taken är verkliga. Upp till 9 bilder, 3 videor och 3 ljudklipp, 12 filer totalt, med referensvideo och ljud på 2 till 15 sekunder vardera (MiniMax API-dokumentation, juli 2026).
  4. Ge varje referens en uppgift i prompttexten. Det här är den vanan med högst hävstång på listan. Officiella promptar inleds med rader som "Bild 1 är den övergripande stämnings- och stilreferensen, Bild 2 är huvudkaraktärsreferensen." Utan den meningen måste modellen gissa vilken karta som betyder vad. Stor svart text som läser BASS HITS över en leende kvinna MiniMax H3 dark-pop-musikvideo: CUT BACK, ONE LOOK, DETONATE typografi Tre kvinnor i grungestil bredvid en djärv typografisk affisch De två typografiska referenskartorna bakom dark-pop-klippet

Det klippet är argumentet för regel 4. Dess prompt beskriver aldrig en enda bokstavsform. Det säger "textförpackningsstil och textur refererar till bilderna," och lämnar över två kartor. Layouten kom för att den visades, inte beskrevs.

En tabell till, eftersom modellkortet och API:et för närvarande inte säger samma sak, och gapet är där folk förlorar en eftermiddag.

SakMiniMax egen dokumentationVad endpointerna faktiskt accepterar idagVad det betyder för ditt prompt
Varaktighet4 till 15 sekunder, endast heltaltext-to-video och image-to-video: 5 till 10, standard 8. reference-to-video: 5 till 15, standard 8En 15-sekunders bildlista passar bara reference-to-video just nu. Skriv om längre boards till 10
Upplösning2KUpplösningen är som standard 2K, och 2K är för närvarande det enda värdet som körs. Ett 768p-jobb kommer tillbaka med modellen MiniMax-H3 stöder inte upplösning 768P, stödda upplösningar: 2K, även om 768p finns i prislistanSkriv för en 1440px kortsida. Detaljer du ber om kommer faktiskt att överleva
BildformatVanliga format eller adaptivtimage-to-video och reference-to-video är som standard adaptiva. Text-only avvisar adaptivt och returnerar sin tillåtna uppsättning: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9På text-to-video, ange ratio explicit eller så misslyckas jobbet med validering
Blandade referenser9 bilder, 3 videor, 3 ljud, 12 filer, ljud aldrig ensamtrefers[] tar {url, type} med image, video eller audio, minst en bild eller videoDu kan verkligen synkronisera rörelse till en medföljande beat. Du kan bara inte bara skicka beatet
Inbyggt ljudStereoljud i samma körningVart och ett av de nio officiella klipp jag testade: 2560x1440, 24 fps, AAC-stereo vid 32 kHzLjudblocket är inte dekoration. Det är halva leveransen

Allt ovan kördes på Atlas Cloud, där alla tre H3-endpoints sitter bakom en nyckel och en skicka-och-poll-loop, så att växla mellan dem är en ändring av modellsträng och inget annat.

MiniMax H3-prompt-handledning: Sätt eld på This Is Fine-hunden, med ljud

Här är hela kedjan från början till slut. Skämtet fungerar för att hunden inte gör något. Sträck ut det nekandet till tio sekunder av realtid, lägg till riktig eld, och låt de sista två sekunderna gå dit den ursprungliga serien faktiskt gick, så blir det roligare och lite värre för dig. De flesta har bara sett de två första panelerna.

Steg 1: Ladda ner den ursprungliga serien. Låt inte en AI rita om den.

Strippen är sex paneler, två kolumner med tre rader, 600 gånger 887. Vi vill bara ha panel 2 och panel 6.

bash
1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png
2# 600x887, 6 paneler, 2 kol x 3 rader
3
4# beskära panel 2 ("THIS IS FINE."-panelen):  x 302-584, y 20-293
5# beskära panel 6 (den smältande hunden):     x 302-584, y 595-868
6# uppskala varje 4x med Lanczos  ->  1128x1092
7

Säg det rakt: be inte en bildmodell att rita "en hund som ser ut som This Is Fine." En AI-återskapning avslöjas som fejk på en halv sekund och skämtet dör på fläcken. Akvarelltvätten, den ostadiga handbokstaven och pappersgrynigheten är hela kontraktet. 4x Lanczos-uppskalningen finns bara där för att 282 px källa är tunt; den ger modellen riktiga pixlar att hålla fast vid utan att hitta på något. Två paneler av This is Fine-hunden som smälter i eld Panel 2 och panel 6 av originalteckningen, märkta som första bild och slutbildsinput

Steg 2: Kör den på image-to-video med en end_image.

Modell: minimax/h3/image-to-video. Inställningar: resolution 2K, image = panel 2, end_image = panel 6, ratio 1:1 för att matcha den nästan kvadratiska källan. Ställ in duration på 10; reglaget ligger på 8 som standard, så dra det.

text
1Hand-painted 2D webcomic panel, brought to life. Keep the original watercolour
2texture, visible ink outlines, off-register paper grain and flat comic palette
3in every frame. Do not smooth, do not re-render in 3D, do not clean up the
4linework, do not add new objects, do not add new text.
5
6[0s-3s] Almost nothing moves. The dog sits perfectly still, holding the mug,
7eyes fixed forward. Only the flames behind him move: slow orange licks climbing
8the wall, one ember drifting up. The speech bubble reading "THIS IS FINE."
9stays exactly where it is, fully legible, unchanged, hand-lettered.
10
11[3s-6s] The dog lifts the mug and takes one small, calm sip. The speech bubble
12fades out after the sip. The fire brightens. The wall behind him begins to warp
13with heat. His hat starts to smoulder at the brim.
14
15[6s-8.5s] The heat reaches him. His ears sag, his outline softens and begins to
16run downward like wet paint. He still does not move his eyes. The mug stays in
17his paw.
18
19[8.5s-10s] Full melt. The face distorts, one eye slides, teeth bared in a fixed
20grin, the fur runs red and orange. He holds the pose. Hold on the final frame
21for the last half second.
22
23Camera: locked off, single static wide shot, no push in, no handheld, no cuts.
24The frame never moves. This is one continuous take inside one comic panel.
25
26Audio: room-tone of an interior fire throughout - low crackle, occasional pop of
27burning wood, a faint structural creak. At 3s, one ceramic mug touching teeth and
28a small swallow. A calm, flat, unbothered male voice says exactly: "This is fine."
29- deadpan, no emotion, slightly too relaxed. From 6s the crackle grows louder and
30the room tone thickens; the last 2 seconds add a low sub-bass swell. No music,
31no laugh track, no sound effects that are not in this list.
32
33Do not add subtitles. Do not add a watermark. Do not spell any word other than
34the words already in the image. Do not change "THIS IS FINE." Do not cut away.
35

Det promptet är strukturtabellen, levande. Första stycket är stilkontraktet. De fyra hakparentesmarkerade skivorna är tidslinjen. Sedan kamera, sedan ljud, sedan den negativa listan. Inget i det är dekorativt. Skärmdump av AI-videogenerator som visar This is fine-memen MiniMax H3 image-to-video på Atlas Cloud: första bilden och slutbilden inlästa, 10 sekunder i 2K, färdigt klipp i utdatapanelen

Steg 3: Läs utdatat som en QA-omgång.

Fyra kontroller, var och en testar ett annat block i promptet.

  1. Är THIS IS FINE. i pratbubblan fortfarande läsbart och fortfarande rättstavat? Det testar block 5.
  2. Överlevde linjearbetet, eller "förbättrade" något det till ren 3D? Det testar block 1.
  3. Innehåller ljudet bara de ljud du listade? Sondera behållaren: den borde komma tillbaka som h264 plus AAC-stereo.
  4. Landar slutbilden på panel 6:s pose? Det testar end_image.
bash
1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \
2        -of default=noprint_wrappers=1 output.mp4
3

Min kom tillbaka som 1472x1440, 24 fps, h264 plus AAC-stereo, 10,13 sekunder. Värt att notera: jag bad om ratio: 1:1 och fick 1472x1440, så på image-to-video vinner källbildens form. Matcha dina två paneler till den form du faktiskt vill ha. Tecknad hund säger this is fine och smälter sedan i en eld Fyra bildrutor från det färdiga klippet vid 0s, 3s, 6,5s och 10s, som matchar de fyra tidsintervallen i promptet

Steg 4: Flytta hunden till en ny plats med reference-to-video.

Samma karaktär, nytt rum. Modell: minimax/h3/reference-to-video. Inställningar: refers[] = panel 2 som image, duration 8, resolution 2K, ratio 16:9.

text
1Image 1 is the character and art-style reference: keep this exact hand-painted
22D webcomic look, the same watercolour texture, the same ink outline weight, the
3same dog, the same little hat, the same mug. Do not redraw him in 3D, do not
4change his proportions, do not clean up the linework.
5
6Put him in a different room and keep his composure. A cramped open-plan office at
7night, fluorescent tubes flickering, a wall of monitors all showing a red error
8state, printer paper drifting down through the frame, a small electrical fire in
9the corner. He sits in an office chair at the centre of the frame, mug in paw,
10looking straight at the camera, completely relaxed.
11
12Camera: locked off, static wide shot. No push in, no cuts.
13
14Audio: fluorescent hum, printer grinding, a repeating soft alarm chirp every two
15seconds, distant electrical crackle, one calm sip at 4s. No music. No voice.
16
17Do not add any on-screen text. Do not add subtitles. Do not add other characters.
18

Den överförbara regeln: refers[] bär identitet och stil, texten bär scenen. Den uppdelningen är hela tricket för karaktärskonsistens, och det är därför den första raden i promptet finns överhuvudtaget. Låt oss prova: "Cartoon dog holding coffee cup amidst red screens and a burning printer Samma webbseriehund flyttad till ett brinnande kontorslandskap på natten, genererad av MiniMax H3 reference-to-video

Samma hatt, samma mugg, samma bläckvikt, nytt rum. En referensbild gjorde allt det.

Tre fler MiniMax H3-promptmönster värda att stjäla

Mönster 1: rörelseaffischen, där layouten inte får röra sig. Tecknad karaktär som springer framåt mot en helrosa bakgrund MiniMax H3-rörelseaffisch: POPUP!-layouten animeras medan ramen och typografin förblir låsta Tecknad pojke i rosa monsterhuva som sträcker ut sig med enorm klo Den ursprungliga statiska affischen som överlämnades till MiniMax H3

Hela promptet är två rader: behåll gallerits vita ram, den inre ramen, den röd-vit-svarta paletten, 3D-figurkänslan och layoutstrukturen oförändrade, och lägg ett smidigt ljudeffektljud under textinträdet. Regeln: namnge de delar som måste överleva. "Behåll layouten" är inte en stilnotis, det är en begränsning, och modellen behandlar den som en sådan.

Mönster 2: gränssnittsdemon, där verb slår adjektiv. Mintgrön Nike ZoomX-löparsko med rosa gradient-sula MiniMax H3-landningssidedemo: scroll, hover, färginvertering på en produktsida Ljusblå Nike-löparsko med gröna och rosa accenter Den enda produktreferensbilden bakom landningssideklippet

Det promptet ber om en nedåtscrollning, ett hover-läge, en kraftfull uppskalning och en färginvertering. Fyra verb. Det säger aldrig "modernt" eller "slankt." Interaktioner är handlingar, så skriv dem som handlingar. Den överdimensionerade kursiva typen och kolfibervävsbakgrunden kom från adjektiven; det som får det att läsas som en riktig sida kom från verben.

Mönster 3: live action plus handritat, hållet samman av vägran. Animerad glödande grön grodd som växer i en öppen hand MiniMax H3-klipp som smälter samman live action-köksfilminspelning med handritade glödande varelser

Det här är ett kvällskök fotat med mobiltelefon med små handritade glödande varelser i, och anledningen till att det förblir charmigt istället för att bli en skräckkortfilm är en lista med förbud: inga jätteögon, inga kluvna munnar, inga huggtänder, inget hotfullt kroppsspråk, inga utfall, inget plötsligt klipp till svart, inga jump scares. Den negativa listan är den primära stilreglaget, inte en lapp. Det är också där du kodar smak. Fyra paneler som visar en kvinna i en mörk tunnel med text Fyra bildrutor från den officiella sci-fi-trailern: THE STARS WERE LISTENING Affisch för The Stars Were Listening och karaktärsdesignblad Moodboarden och karaktärsreferensen bakom trailern

Trailern ovan sluter cirkeln kring båda idéerna. Promptet stavar ut en titel, THE STARS WERE LISTENING, i detalj: extremt smal, tung, versaler, mörkröd blandad med rost, lätt grynighet och imma i kanterna. Den kommer tillbaka exakt som beställt. Två referenskartor hanterar stämningen och huvudpersonen, så texten behöver aldrig beskriva ett ansikte. Arbetsfördelning, ända ner i grunden.

Vad det kostar att köra dessa MiniMax H3-promptar

H3 debiteras per sekund genererad video, efter upplösning, så kostnadsmodellen är uppfriskande tråkig: en 15-sekundstagning kostar ungefär tre 5-sekundersförsök. Allt annat följer av det.

  • Iterera vid 5 sekunder, leverera vid 10 eller 15. Komposition, palett och ljuddesign löser sig alla vid 5. Inget med en låst bild behöver hela varaktigheten för att berätta att den är fel.
  • end_image är ett kostnadsverktyg, inte bara ett kreativt. De flesta omkörningar sker för att slutet drev iväg. Att låsa sista bilden tar bort den felläget innan du betalar för det.
  • Negativa listor och utskriven text är gratis. De lägger till tecken i ett prompt som debiteras per sekund, inte per token. Använd dem flitigt.
  • Matcha duration till endpointen innan du skriver. Att bygga en 15-sekunders bildlista och sedan upptäcka att din endpoint har max 10 kostar dig en omskrivning, inte bara en omkörning.

En sak att inte planera för ännu: prislistorna listar en billigare 768p-nivå, men när detta skrivs avvisas ett 768p-jobb direkt och 2K är den enda upplösningen som körs. Budgetera som om varje sekund är en 2K-sekund. Aktuella priser per sekund finns på modellsidan, som också är där 768p-nivån dyker upp när den öppnas.

MiniMax H3-promptar, memes och upphovsrätt

Hunden är inte public domain. This Is Fine kommer från KC Greens webbserie Gunshow #648, publicerad 9 januari 2013, och bara de två första panelerna gick någonsin viralt (Know Your Meme, januari 2013). Green har offentligt, och ganska trött, pratat om att se bilden återanvändas för evigt, inklusive av personer vars politik han inte delar (NPR, januari 2023).

Den här genomgången är kommentar och undervisning, inte ett stockbibliotek. Om du vill skicka något kommersiellt, rita egna bilder eller licensiera dem du använder. Och kör din egen policykontroll innan ett kundjobb: H3 tillämpar innehållsregler på igenkännliga verkliga personer och välkänd IP, och att upptäcka det mitt i en deadline är inte kul.

Vanliga frågor

Genererar MiniMax H3 ljud, eller lägger jag till det i efterhand?

Samma körning. Bild och ljud kommer ut tillsammans, vilket är precis varför ljud måste skrivas in i promptens brödtext snarare än att boltas på senare. Ge det ett eget Audio:-block och ange när varje ljud kommer in. Vart och ett av de nio officiella klipp jag testade kom tillbaka som AAC-stereo vid 32 kHz tillsammans med en 2560x1440, 24 fps-videoström.

Hur långt kan ett MiniMax H3-prompt vara?

Upp till 7 000 tecken, enligt MiniMax dokumentation. I praktiken spänner de officiella exemplen över ett brett spektrum, med en median runt 130 kinesiska tecken och de två längsta på 657 och 858. Korta promptar fungerar bra när en referensbild gör beskrivningen. Om du inte har några referenser, förvänta dig att skriva en bildlista.

Varför blir texten förvrängd i mina MiniMax H3-videor?

För att du inte skrev ut den. Strängar som förekommer bokstavligen i promptet renderas rent; allt du antyder generiskt ("HUD-element," "några etiketter") kommer tillbaka som bokstavsstruktur. Stava ut varje ord som måste vara läsbart, lägg sedan till stava inte fel, lägg inte till annan text, lägg inte till undertexter.

Hur många referensbilder, videor och ljudklipp kan ett MiniMax H3-prompt använda?

Nio bilder, tre videor och tre ljudklipp, tolv filer totalt, med referensvideo och ljud mellan 2 och 15 sekunder vardera. Ljud kan inte vara den enda referensen. Observera att modellkapacitet och vad en viss endpoint exponerar är två olika saker, så kontrollera modellsidan för den aktuella inputlistan.

Kan ett MiniMax H3-prompt styra hur klippet slutar, inte bara hur det börjar?

Ja, på image-to-video, via den valfria parametern end_image. Ge den en första bild och en sista bild så interpolerar klippet mellan dem. Demon ovan är precis det: serieruta 2 in, serieruta 6 ut. Håll de två bilderna i liknande bildformat annars blir övergången ful.

Vilka varaktigheter och upplösningar kan jag faktiskt få just nu?

2K, och bara 2K. Ett 768p-jobb avvisas för närvarande med supported resolutions: 2K, trots att 768p finns i prislistan. Varaktigheten skiljer sig mellan endpoints: text-to-video och image-to-video accepterar 5 till 10 sekunder med standard 8, medan reference-to-video accepterar 5 till 15. Ännu en hake: på text-only-generering avvisar API:et adaptive och kräver ett explicit ratio.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller