SOLO DUE SETTIMANE | 20% DI SCONTO su Seedream 5.0 Pro!

MiniMax H3 Prompt Guide: Ho Letto Tutti i 45 Prompt Ufficiali, Poi Ho Dato Fuoco al Cane This Is Fine

Una guida ai prompt di MiniMax H3 costruita da tutti i 45 esempi di prompt di MiniMax: la struttura a sei blocchi, il trucco end_image, i suggerimenti audio nativi e la correzione del testo distorto.

Hai già imparato a fare prompt per un modello video. "Illuminazione cinematografica, slow push in, 4K." Quel vocabolario ti ha portato avanti per due anni.

Poi lo incolli in MiniMax H3 e ricevi un clip a 2K che arriva con la sua propria colonna sonora. L'immagine è bella. Il ritmo è molle. Due lettere nel tuo titolo sono scritte male. L'audio è un po' di rumore ambientale che il modello ha scelto per te.

Il modello non è il problema. Gli hai dato una frase. Voleva un programma.

Quindi sono andato a leggere tutti i 45 prompt di esempio che MiniMax ha fornito con H3, più i clip finiti che li accompagnavano, e ho analizzato i fotogrammi. I prompt ufficiali non sono descrizioni. Quelli buoni sono liste di inquadrature con un foglio di cue musicali spillato sul retro. Qui sotto trovi la struttura, i parametri effettivamente esposti ora, e una demo che puoi riprodurre in circa venti minuti.

Punti chiave

  • I prompt di H3 sono linee temporali, non descrizioni. Gli esempi ufficiali più forti suddividono letteralmente il clip con marcatori [0s-2s], [2s-4s], e il film finito colpisce ogni beat.
  • Audio e video escono dallo stesso passaggio, quindi l'audio deve vivere all'interno del corpo del prompt. I prompt ufficiali gli danno un proprio blocco, fino a "il groove del basso jazz entra a 6s."
  • Il testo che scrivi torna pulito. Il testo che non scrivi torna come rumore a forma di lettera. Ho i ritagli dei fotogrammi di un singolo clip ufficiale che provano entrambe le cose contemporaneamente.
  • image-to-video accetta un'end_image. Dai un primo fotogramma e un ultimo fotogramma e l'arco emotivo è bloccato prima che tu spenda un secondo di calcolo.
  • La lunghezza del prompt non è una virtù. I prompt ufficiali brevi funzionano quando un'immagine di riferimento fa la descrizione. La lunghezza tiene traccia di quanto del lavoro ti sei rifiutato di affidare a un riferimento.

Il cane di This Is Fine, ancora a sinistra e che brucia in 10 secondi di output di MiniMax H3 a destra

Questo è lo stesso disegno su entrambi i lati. A sinistra c'è la vignetta originale di KC Green, intatta. A destra c'è una singola chiamata image-to-video: primo fotogramma dentro, ultimo fotogramma dentro, dieci secondi fuori, e lo scoppiettio del fuoco e il piatto "this is fine" sono la traccia audio del modello stesso. Nessuno l'ha musicata. Tutto in questa guida è mirato a portarti a quella seconda metà.

Che aspetto ha un Prompt MiniMax H3 (Ho Letto Tutti e 45)

Ogni "guida al prompt MiniMax H3" attualmente sulla prima pagina dei risultati di ricerca è una scheda tecnica: 2K, 24fps, da 5 a 15 secondi, audio nativo. Questa è la scheda del modello. Non è un prompt.

Eccone uno vero. Questo è un pezzo del prompt ufficiale dietro la sequenza di titoli noir di MiniMax, tradotto dall'originale cinese, che costituisce forse un terzo della sua lunghezza totale:

Genera una sequenza di titoli per un film crime di leggera suspence della durata di 15 secondi in formato 16:9. Lo stile generale fa riferimento al linguaggio visivo di queste immagini: titoli retrò degli anime giapponesi, silhouette dai bordi netti, collage a fumetti, split screen asimmetrico, forti blocchi di colore geometrici, titoli di crediti in inglese, un po' di decorazione in katakana giapponese, atmosfera jazz-crime. L'umore è per il 60% suspence, per il 40% jazz: misterioso, cool, agile, crime urbano, non horror, non pesante, e non trasformarlo in un allegro MV jazz.

[...] I crediti in inglese devono essere chiaramente leggibili [...] Non aggiungere cinese, non produrre testo distorto, non scrivere male l'inglese. Regola per l'intero pezzo: ogni credito inglese e titolo di lavoro appare esattamente una volta. Non ripetere un titolo di lavoro, non ripetere un nome, non dare a una persona più titoli.

Le transizioni devono essere varie: maschera circolare a forma di vinile, tendina a forma di portiera dell'auto, ombra lunga di una figura che spazza lo schermo, taglio con linea rossa, maschera gigante a forma di lettera inglese, ricomposizione del fotogramma in split-screen, taglio a blocchi di colore netti, pannelli incollati uno per uno. Tutte le transizioni cadono sui colpi di tamburo: nitide, piene di suspence, agili, collage a fumetti. Nessuna dissolvenza morbida, nessuna transizione fluida.

BGM: musica originale per titoli di 15 secondi, 60% suspence, 40% jazz. Costruita con una nota di basso sostenuta, tesi archi pizzicati, freddi impulsi di synth, grancassa, spazzole jazz sparse, un frammento di basso walking, brevi frasi di sassofono baritono e brevi stacchi di ottoni. I primi 2 secondi stabiliscono la suspence con basse frequenze e hi-hat, a 3 secondi entrano i tamburi bassi, a 6 secondi si unisce il groove del basso jazz, a 10 secondi appare un breve riff di sassofono/ottoni, gli ultimi 2 secondi lo bloccano con un accordo teso e un colpo di tamburo.

Leggi dove sono state spese le parole. Quasi nessuna è andata a "bello" o "cinematografico". Sono andate a un elenco negativo, un elenco di transizioni e un foglio di cue musicali secondo per secondo. Questa è la forma del lavoro. Banner anime noir con una figura in silhouette su un treno della metropolitana Sequenza di titoli noir ufficiale di MiniMax H3: MIDNIGHT LINE, con crediti STARRING puliti

Guarda i crediti in quel clip. MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS. Scritti correttamente, nessun titolo di lavoro usato due volte, decorazione katakana dove era stato richiesto. Il prompt non diceva "fai bei titoli". Diceva niente ripetizioni, niente errori di ortografia, niente cinese, e nominava l'estetica in cinque modi diversi. Cinque pannelli noir cinematografici con personaggi in silhouette in blu e arancione Cinque tavole di riferimento di stile fornite a MiniMax H3 insieme al prompt del titolo noir

Quelle cinque tavole sono state inserite insieme al testo. Cinque immagini più un lungo brief, una generazione. Ecco come appare questo lavoro ora.

E la ragione per cui molti dei 45 prompt sono brevi è proprio lì nell'immagine. In tutto il set, il prompt mediano è di circa 130 caratteri cinesi, ma i due più lunghi arrivano a 657 e 858. Quelli brevi sono brevi perché una tavola di riferimento sta portando la descrizione. Quelli lunghi sono lunghi perché nient'altro avrebbe potuto portarla.

Perché la Maggior Parte dei Prompt di MiniMax H3 Risultano Piatti, e la Soluzione per il Testo Distorto

Tre cose vanno storte, e sono tutte assenze più che errori.

Nessuna linea temporale. Hai chiesto dieci secondi e descritto un momento, quindi ottieni un lento push-in stirato su dieci secondi. Il modello non aveva niente da fare al settimo secondo.

Nessun blocco audio. Il suono è generato nello stesso passaggio dell'immagine. Se non dici nulla, il modello ti fornisce comunque una traccia. Ne sceglie solo una.

Nessun elenco negativo. Lasciato a sé stesso, il modello ricorre a dissolvenze morbide, inventa testo aggiuntivo sullo schermo e aggiunge una striscia di sottotitoli che nessuno ha chiesto.

La prova più chiara è il prompt ufficiale per l'interfaccia di gioco, che è costruito su sei beat con timestamp: [0s-2s] menu, [2s-4s] pannello del braccio destro, [4s-7s] griglia armamenti, [7s-8.5s] conferma, [8.5s-10s] barra di caricamento, [10s-15s] il mondo si carica. Il clip finito colpisce tutti e sei, in ordine, in tempo. Menu di gioco che mostra la selezione di un braccio robotico Phantom Grip Clip dell'interfaccia di gioco MiniMax H3: menu, pannello equipaggiamento, barra di caricamento, caricamento mondo

Ora la metà onesta, dallo stesso clip, a piena risoluzione 2560x1440. Confronto tra testo leggibile dell'interfaccia di gioco e testo AI distorto A sinistra: il testo scritto nel prompt viene reso in modo pulito. A destra: il testo non scritto viene reso come rumore a forma di lettera

A sinistra, ogni stringa che il prompt ha effettivamente digitato: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW. Nitido, corretto, spaziato come un vero menu di gioco.

A destra, l'HUD nell'inquadratura finale della strada, che il prompt ha chiamato solo "elementi HUD". Si legge ETR METNO CITFEP. Sopra le icone dell'equipaggiamento, dove il prompt non diceva nulla, ottieni MNALEαIN IAMG. Non è un bug di rendering. Il modello sta disegnando la texture dell'inglese perché non gli è mai stata data la stringa.

Quindi la soluzione non è un'impostazione. È un'abitudine:

Se una parola deve essere leggibile, scrivi la parola. Poi aggiungi una riga negativa: non scrivere male, non aggiungere altro testo, non aggiungere sottotitoli.

Ed ecco la forma a sei blocchi che ogni prompt ufficiale forte risulta condividere.

BloccoCosa ci va dentroEsempio da un prompt ufficialeSe lo salti ottieni
1. Contratto di stileMedium, texture, tavolozza, epoca, l'aspetto che non devi perdere"titoli retrò degli anime giapponesi, silhouette dai bordi netti, collage a fumetti, forti blocchi di colore geometrici"Un render generico lucido che deriva al sesto secondo
2. Linea temporaleFette temporali letterali con un'azione in ciascuna[2s-4s] Zoom fluido sul suo braccio destro. Il pannello UI scivola dentro da destraUn'idea stirata sull'intera durata
3. FotocameraMovimento, o un rifiuto esplicito di muoversi"bloccata, campo largo statico, nessun push in, nessun taglio"Un lento carrello predefinito che non hai chiesto
4. AudioOgni suono, e quando entra"a 6 secondi si unisce il groove del basso jazz, gli ultimi 2 secondi lo bloccano con un accordo teso"Qualunque rumore ambientale piaccia al modello oggi
5. Testo, scrittoLe stringhe letterali, tra virgolette"THIS IS FINE." / CONFIRM CONFIGRumore a forma di lettera, come sopra
6. Elenco negativoLe transizioni, gli oggetti e i cliché da rifiutare"Niente dissolvenze morbide, niente transizioni fluide, non aggiungere cinese, non ripetere un titolo di lavoro"Dissolvenze morbide, testo inventato, deriva inquietante

I blocchi 5 e 6 sono gratuiti. Non costano nulla in più da generare ed è lì che vive la maggior parte della qualità.

Il Flusso di Lavoro del Prompt MiniMax H3: A Quale Endpoint Appartiene il Tuo Prompt

Stessa chiave, stessa forma submit-and-poll, tre porte. Quale scegli decidi cosa il tuo prompt deve ancora fare.

EndpointCosa gli fornisciCosa blocca per teParametri che vale la pena conoscereUsalo quandoFatturazione
minimax/h3/text-to-videoSolo promptNiente. Il testo porta tuttodurata 5-10 (default 8), risoluzione 2K, aspect ratio deve essere impostato esplicitamentePer testare un look o un sound design prima di impegnartiFatturato al secondo di output, tariffa corrente sulla pagina del modello
minimax/h3/image-to-videoPrompt + immagine (primo fotogramma), end_image opzionaleDove inizia il clip, e opzionalmente dove finisceend_image, durata 5-10 (default 8), aspect ratio adattivo per impostazione predefinitaHai un'opera d'arte e vuoi che si muova senza essere ridisegnataFatturato al secondo di output
minimax/h3/reference-to-videoPrompt + refers[]Identità del soggetto e stile, attraverso una scena che inventirefers[] array misto, durata 5-15, aspect ratio fino a 21:9Stesso personaggio o prodotto, nuovo ambienteFatturato al secondo di output

refers[] è quello che è veramente poco documentato in giro, quindi ecco la forma che vuole:

json
1"refers": [
2  { "url": "https://.../subject.png", "type": "image" },
3  { "url": "https://.../style-board.png" },
4  { "url": "https://.../motion-ref.mp4", "type": "video" },
5  { "url": "https://.../beat.mp3",       "type": "audio" }
6]
7

Quattro regole che ti salveranno ciascuna da una generazione sprecata:

  1. L'audio non può viaggiare da solo. Almeno un'immagine o un video deve essere nell'array. Una traccia ritmica da sola viene rifiutata.
  2. type è opzionale. Viene dedotto dall'URL, ma dichiaralo comunque quando l'estensione è ambigua.
  3. I limiti sono reali. Fino a 9 immagini, 3 video e 3 clip audio, 12 file in totale, con video e audio di riferimento da 2 a 15 secondi ciascuno (Documentazione API MiniMax, Luglio 2026).
  4. Dai a ogni riferimento un lavoro all'interno del testo del prompt. Questa è l'abitudine a più alto impatto in questa lista. I prompt ufficiali iniziano con frasi come "L'immagine 1 è il riferimento per l'umore e lo stile generale, l'immagine 2 è il riferimento per il personaggio principale." Senza quella frase, il modello deve indovinare quale tavola significa cosa. Grande testo nero che dice BASS HITS sopra una donna sorridente Video musicale dark-pop MiniMax H3: tipografia CUT BACK, ONE LOOK, DETONATE Tre donne in abbigliamento grunge accanto a un poster tipografico in grassetto Le due tavole di riferimento tipografico dietro il clip dark-pop

Quel clip è l'argomento per la regola 4. Il suo prompt non descrive mai una singola forma di lettera. Dice "lo stile e la texture del packaging del testo fanno riferimento alle immagini" e passa due tavole. Il layout è arrivato perché è stato mostrato, non descritto.

Un'altra tabella, perché la scheda del modello e l'API attualmente non dicono la stessa cosa, e il divario è dove le persone perdono un pomeriggio.

CosaDocumentazione MiniMax stessaCosa gli endpoint accettano effettivamente oggiCosa significa per il tuo prompt
DurataDa 4 a 15 secondi, solo numeri interitext-to-video e image-to-video: da 5 a 10, default 8. reference-to-video: da 5 a 15, default 8Una lista di inquadrature da 15 secondi si adatta solo a reference-to-video in questo momento. Riscrivi tavole più lunghe in 10
Risoluzione2Kresolution per impostazione predefinita è 2K, e 2K è attualmente l'unico valore che funziona. Un lavoro a 768p torna con il modello MiniMax-H3 non supporta la risoluzione 768P, risoluzioni supportate: 2K, anche se 768p appare nella tabella dei prezziScrivi per un lato corto di 1440px. I dettagli che chiedi sopravviveranno effettivamente
Aspect ratioRapporti comuni o adattivoimage-to-video e reference-to-video per impostazione predefinita sono adattivi. Il solo testo rifiuta adattivo e restituisce il suo set consentito: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9Su text-to-video, imposta aspect ratio esplicitamente o il lavoro fallisce la validazione
Riferimenti misti9 immagini, 3 video, 3 audio, 12 file, audio mai da solorefers[] accetta {url, type} con image, video o audio, almeno un'immagine o un videoPuoi davvero sincronizzare il movimento con un beat fornito. Semplicemente non puoi fornire solo il beat
Audio nativoAudio stereo nello stesso passaggioOgnuno dei nove clip ufficiali che ho analizzato: 2560x1440, 24fps, AAC stereo a 32kHzIl blocco audio non è una decorazione. È metà del risultato finale

Tutto quanto sopra è stato eseguito su Atlas Cloud, dove tutti e tre gli endpoint H3 si trovano dietro una chiave e un loop submit-and-poll, quindi passare dall'uno all'altro è un cambio di stringa del modello e nient'altro.

Tutorial del Prompt MiniMax H3: Dai Fuoco al Cane di This Is Fine, Con Audio

Ecco tutto il processo dall'inizio alla fine. La battuta funziona perché il cane non fa nulla. Allunga quella negazione per dieci secondi di tempo reale, aggiungi fuoco vero, e lascia che gli ultimi due secondi vadano dove andava effettivamente il fumetto originale, e diventa più divertente e leggermente peggio per te. La maggior parte delle persone ha visto solo i primi due pannelli.

Passaggio 1: Scarica il fumetto originale. Non lasciare che un'IA lo ridisegni.

La striscia è di sei pannelli, due colonne per tre righe, 600 per 887. Vogliamo solo il pannello 2 e il pannello 6.

bash
1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png
2# 600x887, 6 pannelli, 2 colonne x 3 righe
3
4# ritaglia il pannello 2 (il pannello "THIS IS FINE."): x 302-584, y 20-293
5# ritaglia il pannello 6 (il cane che si scioglie):      x 302-584, y 595-868
6# aumenta di 4x ciascuno con Lanczos -> 1128x1092
7

Dillo chiaramente: non chiedere a un modello di immagini di disegnare "un cane che assomiglia a This Is Fine." Una ricreazione dell'IA viene riconosciuta come falsa in mezzo secondo e la battuta muore sul colpo. La velatura ad acquerello, la lettering a mano traballante e la grana della carta sono l'intero contratto. L'upscaling Lanczos 4x è presente solo perché 282px di sorgente sono pochi; dà al modello pixel reali a cui aggrapparsi senza inventarne nessuno. Due pannelli del cane di This is Fine che si scioglie nel fuoco Pannello 2 e pannello 6 del fumetto originale, etichettati come input del primo fotogramma e dell'immagine finale

Passaggio 2: Eseguilo su image-to-video con un'end_image.

Modello: minimax/h3/image-to-video. Impostazioni: resolution 2K, image = pannello 2, end_image = pannello 6, ratio 1:1 per corrispondere alla sorgente quasi quadrata. Imposta duration a 10; il cursore è su 8 per impostazione predefinita, quindi trascinalo.

text
1Pannello di webcomic 2D dipinto a mano, portato in vita. Mantieni la texture originale
2dell'acquerello, i contorni a inchiostro visibili, la grana della carta fuori registro e la
3tavolozza piatta del fumetto in ogni fotogramma. Non uniformare, non renderizzare nuovamente in 3D,
4non pulire il tratto, non aggiungere nuovi oggetti, non aggiungere nuovo testo.
5
6[0s-3s] Quasi niente si muove. Il cane siede perfettamente fermo, tenendo la tazza,
7occhi fissi in avanti. Solo le fiamme dietro di lui si muovono: leccate lente arancioni che
8scalano il muro, una brace che sale alla deriva. Il fumetto che dice "THIS IS FINE."
9rimane esattamente dov'è, completamente leggibile, invariato, scritto a mano.
10
11[3s-6s] Il cane solleva la tazza e fa un sorso piccolo e calmo. Il fumetto
12svanisce dopo il sorso. Il fuoco si intensifica. Il muro dietro di lui inizia a deformarsi
13con il calore. Il suo cappello inizia a fumare sull'orlo.
14
15[6s-8.5s] Il calore lo raggiunge. Le sue orecchie si afflosciano, il suo contorno si ammorbidisce e inizia a
16colare verso il basso come vernice bagnata. Lui ancora non muove gli occhi. La tazza rimane nella
17sua zampa.
18
19[8.5s-10s] Scioglimento completo. Il viso si distorce, un occhio scivola, i denti scoperti in un sorriso
20fisso, la pelliccia diventa rossa e arancione. Lui mantiene la posa. Tieni Fermo
21sull'ultimo fotogramma per l'ultimo mezzo secondo.
22
23Fotocamera: bloccata, singolo campo largo statico, nessun push in, nessuna macchina a mano, nessun taglio.
24L'inquadratura non si muove mai. Questa è una singola ripresa continua all'interno di un pannello del fumetto.
25
26Audio: suono ambientale di un fuoco interno per tutto il tempo - crepitio basso, occasionale scoppio di
27legna che brucia, un debole scricchiolio strutturale. A 3s, una tazza di ceramica che tocca i denti e
28una piccola deglutizione. Una voce maschile calma, piatta, indisturbata dice esattamente: "This is fine."
29- inespressiva, senza emozioni, leggermente troppo rilassata. Da 6s il crepitio diventa più forte e
30il suono ambientale si addensa; gli ultimi 2 secondi aggiungono un basso rigonfiamento sub-basso. Nessuna musica,
31nessuna traccia di risate, nessun effetto sonoro che non sia in questo elenco.
32
33Non aggiungere sottotitoli. Non aggiungere una filigrana. Non scrivere alcuna parola diversa
34dalle parole già presenti nell'immagine. Non cambiare "THIS IS FINE." Non staccare.
35

Quel prompt è la tabella della struttura, in azione. Il primo paragrafo è il contratto di stile. Le quattro fette tra parentesi sono la linea temporale. Poi fotocamera, poi audio, poi l'elenco negativo. Niente è decorativo. Screenshot del generatore video AI che mostra il meme This is fine MiniMax H3 image-to-video su Atlas Cloud: primo fotogramma e immagine finale caricati, 10 secondi a 2K, clip finito nel pannello di output

Passaggio 3: Leggi l'output come un controllo di qualità.

Quattro controlli, ognuno dei quali testa un blocco diverso del prompt.

  1. THIS IS FINE. nel fumetto è ancora leggibile e ancora scritto correttamente? Questo testa il blocco 5.
  2. Il tratto è sopravvissuto, o qualcosa lo ha "migliorato" in 3D pulito? Questo testa il blocco 1.
  3. L'audio contiene solo i suoni che hai elencato? Analizza il contenitore: dovrebbe tornare h264 più AAC stereo.
  4. L'ultimo fotogramma corrisponde alla posa del pannello 6? Questo testa end_image.
bash
1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \
2        -of default=noprint_wrappers=1 output.mp4
3

Il mio è tornato a 1472x1440, 24fps, h264 più AAC stereo, 10.13 secondi. Vale la pena notare: ho chiesto ratio: 1:1 e ho ottenuto 1472x1440, quindi su image-to-video la forma del fotogramma sorgente vince. Abbina i tuoi due pannelli alla forma che vuoi effettivamente. Cane dei cartoni animati dice this is fine poi si scioglie in un incendio Quattro fotogrammi dal clip finito a 0s, 3s, 6.5s e 10s, che corrispondono alle quattro fette temporali nel prompt

Passaggio 4: Sposta il cane da qualche parte di nuovo con reference-to-video.

Stesso personaggio, nuova stanza. Modello: minimax/h3/reference-to-video. Impostazioni: refers[] = pannello 2 come image, duration 8, resolution 2K, ratio 16:9.

text
1L'immagine 1 è il riferimento per il personaggio e lo stile artistico: mantieni questo aspetto esatto
2di webcomic 2D dipinto a mano, la stessa texture dell'acquerello, lo stesso spessore del tratto a inchiostro, lo stesso
3cane, lo stesso cappellino, la stessa tazza. Non ridisegnarlo in 3D, non
4cambiare le sue proporzioni, non pulire il tratto.
5
6Mettilo in una stanza diversa e mantieni la sua compostezza. Un angusto ufficio open space di
7notte, tubi fluorescenti che sfarfallano, una parete di monitor che mostrano tutti uno stato di errore
8rosso, carta della stampante che scende alla deriva attraverso l'inquadratura, un piccolo fuoco elettrico nell'
9angolo. Lui si siede su una sedia da ufficio al centro dell'inquadratura, tazza in
10zampa, guardando dritto verso la fotocamera, completamente rilassato.
11
12Fotocamera: bloccata, campo largo statico. Nessun push in, nessun taglio.
13
14Audio: ronzio fluorescente, macinamento della stampante, un ripetuto chirp di allarme morbido ogni due
15secondi, lontano crepitio elettrico, un sorso calmo a 4s. Nessuna musica. Nessuna voce.
16
17Non aggiungere testo sullo schermo. Non aggiungere sottotitoli. Non aggiungere altri personaggi.
18

La regola trasferibile: refers[] porta identità e stile, il testo porta la scena. Questa divisione è l'intero trucco per la coerenza del personaggio, ed è il motivo per cui la prima riga del prompt esiste in primo luogo. Proviamo: "Cane dei cartoni animati che tiene una tazza di caffè in mezzo a schermi rossi e una stampante in fiamme Lo stesso cane del webcomic trasferito in un ufficio open space in fiamme di notte, generato da MiniMax H3 reference-to-video

Stesso cappello, stessa tazza, stesso spessore di inchiostro, nuova stanza. Un'immagine di riferimento ha fatto tutto questo.

Tre Modelli di Prompt MiniMax H3 che Vale la Pena Rubare

Modello 1: il poster animato, dove il layout non deve muoversi. Personaggio dei cartoni animati che corre in avanti su uno sfondo rosa solido Poster animato MiniMax H3: il layout POPUP! si anima mentre l'inquadratura e la tipografia rimangono bloccate Ragazzo dei cartoni animati con felpa con cappuccio da mostro rosa che allunga un artiglio gigante Il poster statico originale fornito a MiniMax H3

L'intero prompt è di due righe: mantieni invariati la cornice bianca della galleria, la cornice interna, la tavolozza rosso-bianco-nero, la sensazione di figura 3D e la struttura del layout, e metti un effetto sonoro agile sotto l'ingresso del testo. La regola: nomina le parti che devono sopravvivere. "Mantieni il layout" non è una nota di stile, è un vincolo, e il modello lo tratta come tale.

Modello 2: la demo dell'interfaccia, dove i verbi battono gli aggettivi. Scarpa da running Nike ZoomX verde menta con suola sfumata rosa Demo della pagina di destinazione MiniMax H3: scorrimento, hover, inversione di colore su una pagina prodotto Scarpa da running Nike blu chiaro con accenti verdi e rosa L'immagine di riferimento del singolo prodotto dietro il clip della pagina di destinazione

Quel prompt chiede uno scorrimento verso il basso della pagina, uno stato hover, un forte ingrandimento e un'inversione di colore. Quattro verbi. Non dice mai "moderno" o "elegante". Le interazioni sono azioni, quindi scrivile come azioni. Il carattere tipografico grande e corsivo e lo sfondo in tessuto di carbonio sono venuti dagli aggettivi; la cosa che lo fa sembrare una pagina reale è venuta dai verbi.

Modello 3: live action più disegnato a mano, tenuti insieme dai rifiuti. Germoglio verde luminoso animato che cresce in una mano aperta Clip MiniMax H3 che fonde filmati live action in cucina con creature luminescenti disegnate a mano

Questo è una cucina serale girata con un telefono con piccole creature luminescenti disegnate a mano, e la ragione per cui rimane affascinante invece di trasformarsi in un cortometraggio horror è un elenco di divieti: niente occhi enormi, niente bocche spaccate, niente zanne, niente postura minacciosa, niente balzi, niente taglio improvviso al nero, niente salti di paura (jump scares). L'elenco negativo è il controllo di stile primario, non una toppa. È anche dove codifichi il gusto. Quattro pannelli che mostrano una donna in un tunnel buio con testo Quattro fotogrammi dal trailer di fantascienza ufficiale: THE STARS WERE LISTENING Poster per The Stars Were Listening e foglio di design del personaggio La mood board e il riferimento del personaggio dietro il trailer

Il trailer qui sopra chiude il cerchio su entrambe le idee. Il prompt scrive un titolo, THE STARS WERE LISTENING, in dettaglio: estremamente stretto, grassetto, tutto maiuscolo, rosso scuro mescolato con ruggine, leggera grana e bordi annebbiati. Quello torna esattamente come ordinato. Due tavole di riferimento gestiscono l'umore e il protagonista, quindi il testo non deve mai descrivere un volto. Divisione del lavoro, fino in fondo.

Quanto Costa Eseguire Questi Prompt MiniMax H3

H3 viene fatturato al secondo di video generato, per risoluzione, quindi il modello di costo è piacevolmente noioso: una ripresa da 15 secondi costa circa tre tentativi da 5 secondi. Tutto il resto ne consegue.

  • Itera a 5 secondi, consegna a 10 o 15. Composizione, tavolozza e sound design si risolvono tutti a 5. Niente di un'inquadratura bloccata ha bisogno dell'intera durata per dirti che è sbagliata.
  • end_image è uno strumento di costo, non solo creativo. La maggior parte dei nuovi tentativi avviene perché il finale è andato alla deriva. Bloccare l'ultimo fotogramma rimuove quella modalità di fallimento prima che tu la paghi.
  • Gli elenchi negativi e il testo scritto sono gratuiti. Aggiungono caratteri a un prompt che viene fatturato al secondo, non al token. Usali pesantemente.
  • Abbina duration all'endpoint prima di scrivere. Costruire una lista di inquadrature da 15 secondi e poi scoprire che il tuo endpoint ha un limite massimo di 10 ti costa una riscrittura, non solo un nuovo tentativo.

Una cosa di cui non pianificare ancora: le tabelle dei prezzi elencano un livello 768p più economico, ma al momento in cui scrivo, un lavoro a 768p viene rifiutato immediatamente e 2K è l'unica risoluzione che funziona. Budget come se ogni secondo fosse un secondo a 2K. Le tariffe correnti al secondo si trovano sulla pagina del modello, che è anche dove apparirà il livello 768p una volta aperto.

Il cane non è di pubblico dominio. This Is Fine proviene dal webcomic Gunshow #648 di KC Green, pubblicato il 9 gennaio 2013, e solo i primi due pannelli sono mai diventati virali (Know Your Meme, gennaio 2013). Green ha parlato pubblicamente, e piuttosto stanco, di guardare l'immagine essere riutilizzata per sempre, anche da persone con cui non condivide la politica (NPR, gennaio 2023).

Questa procedura dettagliata è commento e insegnamento, non una libreria stock. Se vuoi pubblicare qualcosa a livello commerciale, disegna le tue cornici o concedi in licenza quelle che usi. E esegui il tuo controllo delle politiche prima di un lavoro per un cliente: H3 applica regole sui contenuti a persone reali riconoscibili e IP noti, e scoprirlo a metà scadenza non è divertente.

Domande Frequenti

MiniMax H3 genera audio, o lo aggiungo dopo?

Stesso passaggio. Immagine e suono escono insieme, che è esattamente il motivo per cui l'audio deve essere scritto nel corpo del prompt piuttosto che aggiunto in seguito. Dagli il suo blocco Audio: e indica quando entra ogni suono. Ognuno dei nove clip ufficiali che ho analizzato è tornato come AAC stereo a 32kHz insieme a un flusso video 2560x1440, 24fps.

Quanto può essere lungo un prompt MiniMax H3?

Fino a 7.000 caratteri, secondo la documentazione di MiniMax. In pratica, gli esempi ufficiali coprono un'ampia gamma, con una mediana di circa 130 caratteri cinesi e i due più lunghi a 657 e 858. I prompt brevi funzionano bene quando un'immagine di riferimento fa la descrizione. Se non hai riferimenti, aspettati di scrivere una lista di inquadrature.

Perché il testo nei miei video MiniMax H3 esce distorto?

Perché non l'hai digitato. Le stringhe che appaiono letteralmente nel prompt vengono renderizzate in modo pulito; tutto ciò a cui accenni genericamente ("elementi HUD", "alcune etichette") torna come texture a forma di lettera. Scrivi ogni parola che deve essere leggibile, poi aggiungi non scrivere male, non aggiungere altro testo, non aggiungere sottotitoli.

Quante immagini, video e clip audio di riferimento può usare un singolo prompt MiniMax H3?

Nove immagini, tre video e tre clip audio, dodici file in totale, con video e audio di riferimento tra 2 e 15 secondi ciascuno. L'audio non può essere l'unico riferimento. Nota che la capacità del modello e ciò che un dato endpoint espone sono due cose diverse, quindi controlla la pagina del modello per l'elenco di input corrente.

Un prompt MiniMax H3 può controllare come finisce il clip, non solo come inizia?

Sì, su image-to-video, tramite il parametro opzionale end_image. Fornisci un primo fotogramma e un ultimo fotogramma e il clip interpola tra di loro. La demo qui sopra è esattamente questo: pannello 2 del fumetto dentro, pannello 6 del fumetto fuori. Mantieni le due immagini con aspect ratio simili o la transizione diventa brutta.

Quali durate e risoluzioni posso effettivamente ottenere adesso?

2K, e solo 2K. Un lavoro a 768p viene attualmente rifiutato con supported resolutions: 2K, nonostante 768p appaia nella tabella dei prezzi. La durata differisce per endpoint: text-to-video e image-to-video accettano da 5 a 10 secondi con un default di 8, mentre reference-to-video accetta da 5 a 15. Un altro problema: sulla generazione solo testo, l'API rifiuta adaptive e richiede un ratio esplicito.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli