Du vet redan hur du promptar en videomodell. "Cinematic lighting, slow push in, 4K." Det ordförrådet har burit dig i två år.
Sedan klistrar du in det i MiniMax H3 och får tillbaka ett 2K-klipp som kommer med sitt eget ljudspår. Bilden ser bra ut. Tempot är mos. Två bokstäver i din titel är felstavade. Ljudet är någon rumston som modellen valde åt dig.
Modellen är inte problemet. Du gav den en mening. Den ville ha ett schema.
Så jag gick och läste alla 45 exempelpromptar som MiniMax skickade med H3, plus de färdiga klippen som följde med, och dissekerade bildrutorna. De officiella promptarna är inte beskrivningar. De bra är bildlistor med en musikschemaflik baktill. Nedan finns strukturen, parametrarna som faktiskt är exponerade just nu, och en demo du kan återskapa på ungefär tjugo minuter.
Viktiga slutsatser
- H3-promptar är tidslinjer, inte beskrivningar. De starkaste officiella exemplen skivar bokstavligen klippet med [0s-2s], [2s-4s]-markeringar, och det färdiga filmklippet träffar varje slag.
- Ljud och bild kommer ur samma körning, så ljudet måste leva inuti promptens brödtext. Officiella promptar ger det ett eget block, ända ner till "jazzbasgroove kommer in vid 6s."
- Text du stavar ut kommer tillbaka ren. Text du inte stavar ut kommer tillbaka som bokstavsformat brus. Jag har bildutsnitt från ett enda officiellt klipp som bevisar båda halvorna samtidigt.
- image-to-video accepterar en end_image. Ge den en första bild och en sista bild så är den känslomässiga bågen låst innan du förbrukar en sekund av beräkning.
- Promptlängd är inte en dygd. Korta officiella promptar fungerar när en referensbild gör beskrivningen. Längden speglar hur mycket av jobbet du vägrade att överlåta åt en referens.
The This Is Fine-hunden, fortfarande till vänster och brinner ner under 10 sekunder av MiniMax H3-utdata till höger
Det är samma teckning på båda sidor. Vänster är KC Greens originalruta, orörd. Höger är ett enda image-to-video-anrop: första bilden in, sista bilden in, tio sekunder ut, och eldens sprakande och det platta lilla "this is fine" är modellens eget ljudspår. Ingen har komponerat det. Allt i den här guiden syftar till att få dig till den andra halvan.
Hur ett MiniMax H3-prompt faktiskt ser ut (jag läste alla 45)
Varje "MiniMax H3-promptguide" som just nu ligger på första sidan i sökresultaten är ett specifikationsblad: 2K, 24 fps, 5 till 15 sekunder, inbyggt ljud. Det är modellkortet. Det är inte ett prompt.
Här är ett riktigt. Det här är en bit av det officiella promptet bakom MiniMax noir-titelsekvens, översatt från den kinesiska originaltexten, ungefär en tredjedel av dess fulla längd:
Generera en 15 sekunder lång 16:9-titelsekvens för en lättspänd kriminalfilm. Övergripande stil refererar till det visuella språket i dessa bilder: retro japansk anime-titelkort, hårdkantade silhuetter, seriekollage, asymmetrisk delad skärm, starka geometriska färgblock, engelska krediteringar, lite japansk katakana-dekoration, jazz-kriminalkänsla. Stämningen är 60 % spänning, 40 % jazz: mystisk, cool, smidig, urban-kriminal, inte skräck, inte tung, och gör det inte till en gladlynt jazz-MV.
[...] Engelska krediteringar måste vara tydligt läsbara [...] Lägg inte till kinesiska, producera inte förvrängd text, stava inte fel på engelskan. Regel för hela stycket: varje engelsk kreditering och jobbtitel förekommer exakt en gång. Upprepa inte en jobbtitel, upprepa inte ett namn, ge inte en person flera titlar.
Övergångar måste vara varierade: cirkulär vinylskivemask, vertikal bildörrs-torkning, en figurs långa skugga som sveper över skärmen, röd linje-klippning, mask av stor engelsk bokstav, omkomponering av delad skärm, hårt färgblocksklipp, paneler inklistrade block för block. Alla övergångar landar på trumslagen: skarpa, spända, smidiga, seriekollage. Inga mjuka upplösningar, inga flytande övergångar.
BGM: original 15-sekunders titelmusik, 60 % spänning, 40 % jazz. Byggd på en ihållande bas-ton, spända pizzicatostråkar, kalla synthpulser, bastrumma, glesa jazzborstar, ett vandrande basfragment, korta barytonsaxofrasfraser och korta mässingstötar. Första 2 sekunderna etablerar spänning med låga frekvenser och hi-hat, vid 3 sekunder kommer de låga trummorna in, vid 6 sekunder ansluter jazzbasgroovet, vid 10 sekunder dyker ett kort saxofon/mässingsriff upp, de sista 2 sekunderna låser det med ett spänt ackord och trumslag.
Läs var orden hamnade. Nästan inga av dem gick till "vackert" eller "cinematiskt." De gick till en negativ lista, en övergångslista och en sekund-för-sekund-musikschema. Det är formen på jobbet.
MiniMax H3 officiell noir-titelsekvens: MIDNIGHT LINE, med rena STARRING-krediteringar
Titta på krediteringarna i det klippet. MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS. Korrekt stavat, ingen jobbtitel använd två gånger, katakana-dekoration där den skulle sitta. Promptet sa inte "gör snygga titlar." Det sa inga upprepningar, inga felstavningar, ingen kinesiska, och namngav estetiken på fem olika sätt.
Fem stilreferenskartor som skickades till MiniMax H3 tillsammans med noir-titelprompten
De fem kartorna följde med i texten. Fem bilder plus en lång brief, en generering. Så här ser det arbetet ut nu.
Och anledningen till att så många av de 45 promptarna är korta finns precis där i bilden. Över hela uppsättningen är medianprompten runt 130 kinesiska tecken, men de två längsta är 657 och 858. De korta är korta för att en referenskarta bär beskrivningen. De långa är långa för att inget annat skulle kunna bära den.
Varför de flesta MiniMax H3-promptar blir platta, och fixen för förvrängd text
Tre saker går fel, och de är alla frånvaro snarare än misstag.
Ingen tidslinje. Du bad om tio sekunder och beskrev ett ögonblick, så du får en långsam inskjutning utdragen över tio sekunder. Modellen hade inget att göra vid sekund sju.
Inget ljudblock. Ljud genereras i samma körning som bild. Om du inte säger något levererar modellen ändå ett spår. Den väljer bara ett.
Ingen negativ lista. Lämnad åt sig själv sträcker sig modellen efter mjuka upplösningar, hittar på extra text på skärmen och lägger till en undertextsremsa som ingen bad om.
Det tydligaste beviset är det officiella spel-UI-promptet, som är byggt av sex tidsstämplade beats: [0s-2s] meny, [2s-4s] högerarmspanel, [4s-7s] beväpningsgrid, [7s-8.5s] bekräfta, [8.5s-10s] laddningsfält, [10s-15s] världen laddas in. Det färdiga klippet träffar alla sex, i ordning, i tid.
MiniMax H3-spel-UI-klipp: meny, utrustningspanel, laddningsfält, världsladdning
Nu den ärliga hälften, från samma klipp, i full 2560x1440-upplösning.
Vänster: text som stavats ut i prompten renderas rent. Höger: text som inte stavats ut renderas som bokstavsformat brus
Till vänster, varje sträng som prompten faktiskt skrev ut: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW. Skarp, korrekt, kerning som en riktig spelmeny.
Till höger, HUD:en i den sista gatubilden, som prompten bara kallade "HUD-element". Den läser ETR METNO CITFEP. Ovanför utrustningsikonerna, där prompten inte sa något, får du MNALEαIN IAMG. Det är inte en renderingsbugg. Modellen ritar texten strukturen av engelska eftersom den aldrig fick strängen.
Så fixen är inte en inställning. Det är en vana:
Om ett ord måste vara läsbart, skriv ordet. Lägg sedan till en negativ rad: stava inte fel, lägg inte till annan text, lägg inte till undertexter.
Och här är den sexblocksform som varje starkt officiellt prompt visar sig dela.
| Block | Vad som ingår | Exempel från ett officiellt prompt | Hoppa över det och du får |
|---|---|---|---|
| 1. Stilkontrakt | Medium, textur, palett, era, looken du inte får förlora | "retro japanska anime-titelkort, hårdkantade silhuetter, seriekollage, starka geometriska färgblock" | En generisk glansig render som driver vid sekund sex |
| 2. Tidslinje | Bokstavliga tidsintervall med en handling i varje | [2s-4s] Mjuk zoom till hennes högra arm. UI-panel glider in från höger | En idé utdragen över hela varaktigheten |
| 3. Kamera | Rörelse, eller ett explicit vägran att röra sig | "låst, statisk vidvinkel, ingen inskjutning, inga klipp" | En standardslow dolly du inte bad om |
| 4. Ljud | Varje ljud, och när det kommer in | "vid 6 sekunder ansluter jazzbasgroovet, de sista 2 sekunderna låser det med ett spänt ackord" | Vilken rumston modellen råkar gilla idag |
| 5. Text, utskriven | De bokstavliga strängarna, inom citattecken | "THIS IS FINE." / CONFIRM CONFIG | Bokstavsformat brus, som ovan |
| 6. Negativ lista | Övergångarna, objekten och klyschorna du vägrar | "Inga mjuka upplösningar, inga flytande övergångar, lägg inte till kinesiska, upprepa inte en jobbtitel" | Mjuka upplösningar, påhittad text, kuslig drift |
Block 5 och 6 är gratis. De kostar inget extra att generera och där bor det mesta av kvaliteten.
MiniMax H3-promptarbetsflödet: Vilken endpoint ditt prompt tillhör
Samma nyckel, samma skicka-och-poll-form, tre dörrar. Vilken du väljer avgör vad ditt prompt fortfarande måste göra.
| Endpoint | Vad du ger den | Vad den låser för dig | Parametrar värda att känna till | Använd den när | Debitering |
|---|---|---|---|---|---|
| minimax/h3/text-to-video | Endast prompt | Inget. Texten bär allt | duration 5-10 (standard 8), upplösning 2K, ratio måste anges explicit | Testa en look eller en ljuddesign innan du förbinder dig | Debiteras per sekund utdata, aktuell kurs på modellsidan |
| minimax/h3/image-to-video | Prompt + bild (första bilden), valfri end_image | Var klippet börjar, och eventuellt var det landar | end_image, duration 5-10 (standard 8), ratio adaptiv som standard | Du har konstverk och vill att det rör sig utan att ritas om | Debiteras per sekund utdata |
| minimax/h3/reference-to-video | Prompt + refers[] | Subjektets identitet och stil, över en scen du hittar på | refers[] blandad array, duration 5-15, ratio upp till 21:9 | Samma karaktär eller produkt, ny miljö | Debiteras per sekund utdata |
refers[] är den som verkligen är underdokumenterad i det vilda, så här är formen den vill ha:
json1"refers": [ 2 { "url": "https://.../subject.png", "type": "image" }, 3 { "url": "https://.../style-board.png" }, 4 { "url": "https://.../motion-ref.mp4", "type": "video" }, 5 { "url": "https://.../beat.mp3", "type": "audio" } 6] 7
Fyra regler som var och en sparar dig en bortkastad generering:
- Ljud kan inte åka ensamt. Minst en bild eller video måste finnas i arrayen. En beat-track ensam avvisas.
- type är valfritt. Det härleds från webbadressen, men ange det ändå när filändelsen är tvetydig.
- Taken är verkliga. Upp till 9 bilder, 3 videor och 3 ljudklipp, 12 filer totalt, med referensvideo och ljud på 2 till 15 sekunder vardera (MiniMax API-dokumentation, juli 2026).
- Ge varje referens en uppgift i prompttexten. Det här är den vanan med högst hävstång på listan. Officiella promptar inleds med rader som "Bild 1 är den övergripande stämnings- och stilreferensen, Bild 2 är huvudkaraktärsreferensen." Utan den meningen måste modellen gissa vilken karta som betyder vad.
MiniMax H3 dark-pop-musikvideo: CUT BACK, ONE LOOK, DETONATE typografi
De två typografiska referenskartorna bakom dark-pop-klippet
Det klippet är argumentet för regel 4. Dess prompt beskriver aldrig en enda bokstavsform. Det säger "textförpackningsstil och textur refererar till bilderna," och lämnar över två kartor. Layouten kom för att den visades, inte beskrevs.
En tabell till, eftersom modellkortet och API:et för närvarande inte säger samma sak, och gapet är där folk förlorar en eftermiddag.
| Sak | MiniMax egen dokumentation | Vad endpointerna faktiskt accepterar idag | Vad det betyder för ditt prompt |
|---|---|---|---|
| Varaktighet | 4 till 15 sekunder, endast heltal | text-to-video och image-to-video: 5 till 10, standard 8. reference-to-video: 5 till 15, standard 8 | En 15-sekunders bildlista passar bara reference-to-video just nu. Skriv om längre boards till 10 |
| Upplösning | 2K | Upplösningen är som standard 2K, och 2K är för närvarande det enda värdet som körs. Ett 768p-jobb kommer tillbaka med modellen MiniMax-H3 stöder inte upplösning 768P, stödda upplösningar: 2K, även om 768p finns i prislistan | Skriv för en 1440px kortsida. Detaljer du ber om kommer faktiskt att överleva |
| Bildformat | Vanliga format eller adaptivt | image-to-video och reference-to-video är som standard adaptiva. Text-only avvisar adaptivt och returnerar sin tillåtna uppsättning: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9 | På text-to-video, ange ratio explicit eller så misslyckas jobbet med validering |
| Blandade referenser | 9 bilder, 3 videor, 3 ljud, 12 filer, ljud aldrig ensamt | refers[] tar {url, type} med image, video eller audio, minst en bild eller video | Du kan verkligen synkronisera rörelse till en medföljande beat. Du kan bara inte bara skicka beatet |
| Inbyggt ljud | Stereoljud i samma körning | Vart och ett av de nio officiella klipp jag testade: 2560x1440, 24 fps, AAC-stereo vid 32 kHz | Ljudblocket är inte dekoration. Det är halva leveransen |
Allt ovan kördes på Atlas Cloud, där alla tre H3-endpoints sitter bakom en nyckel och en skicka-och-poll-loop, så att växla mellan dem är en ändring av modellsträng och inget annat.
MiniMax H3-prompt-handledning: Sätt eld på This Is Fine-hunden, med ljud
Här är hela kedjan från början till slut. Skämtet fungerar för att hunden inte gör något. Sträck ut det nekandet till tio sekunder av realtid, lägg till riktig eld, och låt de sista två sekunderna gå dit den ursprungliga serien faktiskt gick, så blir det roligare och lite värre för dig. De flesta har bara sett de två första panelerna.
Steg 1: Ladda ner den ursprungliga serien. Låt inte en AI rita om den.
Strippen är sex paneler, två kolumner med tre rader, 600 gånger 887. Vi vill bara ha panel 2 och panel 6.
bash1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png 2# 600x887, 6 paneler, 2 kol x 3 rader 3 4# beskära panel 2 ("THIS IS FINE."-panelen): x 302-584, y 20-293 5# beskära panel 6 (den smältande hunden): x 302-584, y 595-868 6# uppskala varje 4x med Lanczos -> 1128x1092 7
Säg det rakt: be inte en bildmodell att rita "en hund som ser ut som This Is Fine." En AI-återskapning avslöjas som fejk på en halv sekund och skämtet dör på fläcken. Akvarelltvätten, den ostadiga handbokstaven och pappersgrynigheten är hela kontraktet. 4x Lanczos-uppskalningen finns bara där för att 282 px källa är tunt; den ger modellen riktiga pixlar att hålla fast vid utan att hitta på något.
Panel 2 och panel 6 av originalteckningen, märkta som första bild och slutbildsinput
Steg 2: Kör den på image-to-video med en end_image.
Modell: minimax/h3/image-to-video. Inställningar: resolution 2K, image = panel 2, end_image = panel 6, ratio 1:1 för att matcha den nästan kvadratiska källan. Ställ in duration på 10; reglaget ligger på 8 som standard, så dra det.
text1Hand-painted 2D webcomic panel, brought to life. Keep the original watercolour 2texture, visible ink outlines, off-register paper grain and flat comic palette 3in every frame. Do not smooth, do not re-render in 3D, do not clean up the 4linework, do not add new objects, do not add new text. 5 6[0s-3s] Almost nothing moves. The dog sits perfectly still, holding the mug, 7eyes fixed forward. Only the flames behind him move: slow orange licks climbing 8the wall, one ember drifting up. The speech bubble reading "THIS IS FINE." 9stays exactly where it is, fully legible, unchanged, hand-lettered. 10 11[3s-6s] The dog lifts the mug and takes one small, calm sip. The speech bubble 12fades out after the sip. The fire brightens. The wall behind him begins to warp 13with heat. His hat starts to smoulder at the brim. 14 15[6s-8.5s] The heat reaches him. His ears sag, his outline softens and begins to 16run downward like wet paint. He still does not move his eyes. The mug stays in 17his paw. 18 19[8.5s-10s] Full melt. The face distorts, one eye slides, teeth bared in a fixed 20grin, the fur runs red and orange. He holds the pose. Hold on the final frame 21for the last half second. 22 23Camera: locked off, single static wide shot, no push in, no handheld, no cuts. 24The frame never moves. This is one continuous take inside one comic panel. 25 26Audio: room-tone of an interior fire throughout - low crackle, occasional pop of 27burning wood, a faint structural creak. At 3s, one ceramic mug touching teeth and 28a small swallow. A calm, flat, unbothered male voice says exactly: "This is fine." 29- deadpan, no emotion, slightly too relaxed. From 6s the crackle grows louder and 30the room tone thickens; the last 2 seconds add a low sub-bass swell. No music, 31no laugh track, no sound effects that are not in this list. 32 33Do not add subtitles. Do not add a watermark. Do not spell any word other than 34the words already in the image. Do not change "THIS IS FINE." Do not cut away. 35
Det promptet är strukturtabellen, levande. Första stycket är stilkontraktet. De fyra hakparentesmarkerade skivorna är tidslinjen. Sedan kamera, sedan ljud, sedan den negativa listan. Inget i det är dekorativt.
MiniMax H3 image-to-video på Atlas Cloud: första bilden och slutbilden inlästa, 10 sekunder i 2K, färdigt klipp i utdatapanelen
Steg 3: Läs utdatat som en QA-omgång.
Fyra kontroller, var och en testar ett annat block i promptet.
- Är THIS IS FINE. i pratbubblan fortfarande läsbart och fortfarande rättstavat? Det testar block 5.
- Överlevde linjearbetet, eller "förbättrade" något det till ren 3D? Det testar block 1.
- Innehåller ljudet bara de ljud du listade? Sondera behållaren: den borde komma tillbaka som h264 plus AAC-stereo.
- Landar slutbilden på panel 6:s pose? Det testar end_image.
bash1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \ 2 -of default=noprint_wrappers=1 output.mp4 3
Min kom tillbaka som 1472x1440, 24 fps, h264 plus AAC-stereo, 10,13 sekunder. Värt att notera: jag bad om ratio: 1:1 och fick 1472x1440, så på image-to-video vinner källbildens form. Matcha dina två paneler till den form du faktiskt vill ha.
Fyra bildrutor från det färdiga klippet vid 0s, 3s, 6,5s och 10s, som matchar de fyra tidsintervallen i promptet
Steg 4: Flytta hunden till en ny plats med reference-to-video.
Samma karaktär, nytt rum. Modell: minimax/h3/reference-to-video. Inställningar: refers[] = panel 2 som image, duration 8, resolution 2K, ratio 16:9.
text1Image 1 is the character and art-style reference: keep this exact hand-painted 22D webcomic look, the same watercolour texture, the same ink outline weight, the 3same dog, the same little hat, the same mug. Do not redraw him in 3D, do not 4change his proportions, do not clean up the linework. 5 6Put him in a different room and keep his composure. A cramped open-plan office at 7night, fluorescent tubes flickering, a wall of monitors all showing a red error 8state, printer paper drifting down through the frame, a small electrical fire in 9the corner. He sits in an office chair at the centre of the frame, mug in paw, 10looking straight at the camera, completely relaxed. 11 12Camera: locked off, static wide shot. No push in, no cuts. 13 14Audio: fluorescent hum, printer grinding, a repeating soft alarm chirp every two 15seconds, distant electrical crackle, one calm sip at 4s. No music. No voice. 16 17Do not add any on-screen text. Do not add subtitles. Do not add other characters. 18
Den överförbara regeln: refers[] bär identitet och stil, texten bär scenen. Den uppdelningen är hela tricket för karaktärskonsistens, och det är därför den första raden i promptet finns överhuvudtaget.
Samma webbseriehund flyttad till ett brinnande kontorslandskap på natten, genererad av MiniMax H3 reference-to-video
Samma hatt, samma mugg, samma bläckvikt, nytt rum. En referensbild gjorde allt det.
Tre fler MiniMax H3-promptmönster värda att stjäla
Mönster 1: rörelseaffischen, där layouten inte får röra sig.
MiniMax H3-rörelseaffisch: POPUP!-layouten animeras medan ramen och typografin förblir låsta
Den ursprungliga statiska affischen som överlämnades till MiniMax H3
Hela promptet är två rader: behåll gallerits vita ram, den inre ramen, den röd-vit-svarta paletten, 3D-figurkänslan och layoutstrukturen oförändrade, och lägg ett smidigt ljudeffektljud under textinträdet. Regeln: namnge de delar som måste överleva. "Behåll layouten" är inte en stilnotis, det är en begränsning, och modellen behandlar den som en sådan.
Mönster 2: gränssnittsdemon, där verb slår adjektiv.
MiniMax H3-landningssidedemo: scroll, hover, färginvertering på en produktsida
Den enda produktreferensbilden bakom landningssideklippet
Det promptet ber om en nedåtscrollning, ett hover-läge, en kraftfull uppskalning och en färginvertering. Fyra verb. Det säger aldrig "modernt" eller "slankt." Interaktioner är handlingar, så skriv dem som handlingar. Den överdimensionerade kursiva typen och kolfibervävsbakgrunden kom från adjektiven; det som får det att läsas som en riktig sida kom från verben.
Mönster 3: live action plus handritat, hållet samman av vägran.
MiniMax H3-klipp som smälter samman live action-köksfilminspelning med handritade glödande varelser
Det här är ett kvällskök fotat med mobiltelefon med små handritade glödande varelser i, och anledningen till att det förblir charmigt istället för att bli en skräckkortfilm är en lista med förbud: inga jätteögon, inga kluvna munnar, inga huggtänder, inget hotfullt kroppsspråk, inga utfall, inget plötsligt klipp till svart, inga jump scares. Den negativa listan är den primära stilreglaget, inte en lapp. Det är också där du kodar smak.
Fyra bildrutor från den officiella sci-fi-trailern: THE STARS WERE LISTENING
Moodboarden och karaktärsreferensen bakom trailern
Trailern ovan sluter cirkeln kring båda idéerna. Promptet stavar ut en titel, THE STARS WERE LISTENING, i detalj: extremt smal, tung, versaler, mörkröd blandad med rost, lätt grynighet och imma i kanterna. Den kommer tillbaka exakt som beställt. Två referenskartor hanterar stämningen och huvudpersonen, så texten behöver aldrig beskriva ett ansikte. Arbetsfördelning, ända ner i grunden.
Vad det kostar att köra dessa MiniMax H3-promptar
H3 debiteras per sekund genererad video, efter upplösning, så kostnadsmodellen är uppfriskande tråkig: en 15-sekundstagning kostar ungefär tre 5-sekundersförsök. Allt annat följer av det.
- Iterera vid 5 sekunder, leverera vid 10 eller 15. Komposition, palett och ljuddesign löser sig alla vid 5. Inget med en låst bild behöver hela varaktigheten för att berätta att den är fel.
- end_image är ett kostnadsverktyg, inte bara ett kreativt. De flesta omkörningar sker för att slutet drev iväg. Att låsa sista bilden tar bort den felläget innan du betalar för det.
- Negativa listor och utskriven text är gratis. De lägger till tecken i ett prompt som debiteras per sekund, inte per token. Använd dem flitigt.
- Matcha duration till endpointen innan du skriver. Att bygga en 15-sekunders bildlista och sedan upptäcka att din endpoint har max 10 kostar dig en omskrivning, inte bara en omkörning.
En sak att inte planera för ännu: prislistorna listar en billigare 768p-nivå, men när detta skrivs avvisas ett 768p-jobb direkt och 2K är den enda upplösningen som körs. Budgetera som om varje sekund är en 2K-sekund. Aktuella priser per sekund finns på modellsidan, som också är där 768p-nivån dyker upp när den öppnas.
MiniMax H3-promptar, memes och upphovsrätt
Hunden är inte public domain. This Is Fine kommer från KC Greens webbserie Gunshow #648, publicerad 9 januari 2013, och bara de två första panelerna gick någonsin viralt (Know Your Meme, januari 2013). Green har offentligt, och ganska trött, pratat om att se bilden återanvändas för evigt, inklusive av personer vars politik han inte delar (NPR, januari 2023).
Den här genomgången är kommentar och undervisning, inte ett stockbibliotek. Om du vill skicka något kommersiellt, rita egna bilder eller licensiera dem du använder. Och kör din egen policykontroll innan ett kundjobb: H3 tillämpar innehållsregler på igenkännliga verkliga personer och välkänd IP, och att upptäcka det mitt i en deadline är inte kul.
Vanliga frågor
Genererar MiniMax H3 ljud, eller lägger jag till det i efterhand?
Samma körning. Bild och ljud kommer ut tillsammans, vilket är precis varför ljud måste skrivas in i promptens brödtext snarare än att boltas på senare. Ge det ett eget Audio:-block och ange när varje ljud kommer in. Vart och ett av de nio officiella klipp jag testade kom tillbaka som AAC-stereo vid 32 kHz tillsammans med en 2560x1440, 24 fps-videoström.
Hur långt kan ett MiniMax H3-prompt vara?
Upp till 7 000 tecken, enligt MiniMax dokumentation. I praktiken spänner de officiella exemplen över ett brett spektrum, med en median runt 130 kinesiska tecken och de två längsta på 657 och 858. Korta promptar fungerar bra när en referensbild gör beskrivningen. Om du inte har några referenser, förvänta dig att skriva en bildlista.
Varför blir texten förvrängd i mina MiniMax H3-videor?
För att du inte skrev ut den. Strängar som förekommer bokstavligen i promptet renderas rent; allt du antyder generiskt ("HUD-element," "några etiketter") kommer tillbaka som bokstavsstruktur. Stava ut varje ord som måste vara läsbart, lägg sedan till stava inte fel, lägg inte till annan text, lägg inte till undertexter.
Hur många referensbilder, videor och ljudklipp kan ett MiniMax H3-prompt använda?
Nio bilder, tre videor och tre ljudklipp, tolv filer totalt, med referensvideo och ljud mellan 2 och 15 sekunder vardera. Ljud kan inte vara den enda referensen. Observera att modellkapacitet och vad en viss endpoint exponerar är två olika saker, så kontrollera modellsidan för den aktuella inputlistan.
Kan ett MiniMax H3-prompt styra hur klippet slutar, inte bara hur det börjar?
Ja, på image-to-video, via den valfria parametern end_image. Ge den en första bild och en sista bild så interpolerar klippet mellan dem. Demon ovan är precis det: serieruta 2 in, serieruta 6 ut. Håll de två bilderna i liknande bildformat annars blir övergången ful.
Vilka varaktigheter och upplösningar kan jag faktiskt få just nu?
2K, och bara 2K. Ett 768p-jobb avvisas för närvarande med supported resolutions: 2K, trots att 768p finns i prislistan. Varaktigheten skiljer sig mellan endpoints: text-to-video och image-to-video accepterar 5 till 10 sekunder med standard 8, medan reference-to-video accepterar 5 till 15. Ännu en hake: på text-only-generering avvisar API:et adaptive och kräver ett explicit ratio.






