Seedance 2.0 Mini & Fast API ai prezzi più bassi al mondo — fino al 68% di sconto sul prezzo ufficiale

MiniMax H3 Guida ai prompt: Ho studiato 45 prompt ufficiali così tu non devi

Una guida ai prompt H3 di MiniMax costruita partendo da tutti i 45 prompt di esempio di MiniMax: la struttura a sei blocchi, il trucco dell'end_image, i segnali audio nativi e la correzione del testo distorto.

Usa MiniMax H3 come un breve brief di produzione, non come un singolo prompt per immagine. La struttura riutilizzabile è semplice: vincola ogni asset di riferimento, enuncia l'idea centrale, poi scrivi la scena come una sequenza audiovisiva temporizzata con movimento della telecamera, dialogo, atmosfera sonora, musica e vincoli in blocchi separati.

Questa guida inverte 45 esempi ufficiali di MiniMax H3 in una formula di prompt in sei parti, mostra dove appartiene end_image, spiega come gli indizi audio nativi cambiano il risultato e fornisce una soluzione pratica per il testo distorto nei clip generati.

Sai già come scrivere un prompt per un modello video. "Illuminazione cinematografica, slow push in, 4K." Quel vocabolario ti ha portato avanti per due anni.

Poi lo incolli in MiniMax H3 e ricevi un clip in 2K che arriva con la propria colonna sonora. L'immagine è fantastica. Il ritmo è molle. Due lettere nel tuo titolo sono scritte male. L'audio è un rumore ambientale che il modello ha scelto per te.

Il modello non è il problema. Tu gli hai dato una frase. Lui voleva un programma.

Quindi ho letto tutti i 45 prompt di esempio che MiniMax ha fornito con H3, più i clip finiti che li accompagnavano, e ho smontato i fotogrammi. I prompt ufficiali non sono descrizioni. Quelli buoni sono liste di inquadrature con un foglio delle indicazioni musicali cucito sul retro. Di seguito la struttura, i parametri che sono effettivamente esposti ora, e una demo che puoi riprodurre in circa venti minuti.

Punti chiave

  • I prompt H3 sono linee temporali, non descrizioni. Gli esempi ufficiali più forti letteralmente tagliano il clip con marcatori [0s-2s], [2s-4s], e il film finito colpisce ogni battuta.
  • Suono e immagine escono dallo stesso passaggio, quindi l'audio deve vivere all'interno del corpo del prompt. I prompt ufficiali gli danno un blocco separato, fino a "il groove del basso jazz entra a 6s."
  • Il testo che scrivi esplicitamente torna pulito. Il testo che non scrivi esplicitamente torna come rumore a forma di lettera. Ho i ritagli dei fotogrammi da un singolo clip ufficiale che provano entrambe le cose contemporaneamente.
  • image-to-video accetta un end_image. Dai un primo fotogramma e un ultimo fotogramma e l'arco emotivo è fissato prima di spendere un secondo di calcolo.
  • La lunghezza del prompt non è un pregio. I prompt ufficiali brevi funzionano quando un'immagine di riferimento fa il lavoro di descrizione. La lunghezza traccia quanta parte del lavoro hai rifiutato di affidare a un riferimento.

Il cane This Is Fine, ancora a sinistra e in fiamme in 10 secondi di output di MiniMax H3 a destra

Quello è lo stesso disegno su entrambi i lati. A sinistra il pannello originale di KC Green, intatto. A destra è una chiamata image-to-video: primo fotogramma dentro, ultimo fotogramma dentro, dieci secondi fuori, e lo scoppiettio del fuoco e il piatto "this is fine" sono la traccia audio del modello stesso. Nessuno l'ha musicata. Tutto in questa guida è finalizzato a portarti a quella seconda metà.

Che aspetto ha effettivamente un prompt MiniMax H3 (ho letto tutti e 45)

Ogni "guida ai prompt MiniMax H3" attualmente nella prima pagina dei risultati di ricerca è una scheda tecnica: 2K, 24fps, da 5 a 15 secondi, audio nativo. Questa è la scheda del modello. Non è un prompt.

Eccone uno vero. Questo è un pezzo del prompt ufficiale dietro la sequenza di titoli noir di MiniMax, tradotto dall'originale cinese, lungo forse un terzo della sua lunghezza totale:

Genera una sequenza di titoli di testa per un film crime di suspense di 15 secondi in 16:9. Lo stile generale fa riferimento al linguaggio visivo di queste immagini: titoli di testa in stile anime retrò giapponese, silhouette dai bordi netti, collage a fumetti, schermo diviso asimmetrico, blocchi di colore geometrici forti, titoli di credito in inglese, un po' di decorazione katakana giapponese, atmosfera crime-jazz. L'umore è per il 60% suspense, 40% jazz: misterioso, cool, agile, crime urbano, non horror, non pesante, e non trasformarlo in un allegro video musicale jazz.

[...] I crediti in inglese devono essere chiaramente leggibili [...] Non aggiungere cinese, non produrre testo distorto, non scrivere male l'inglese. Regola per l'intero pezzo: ogni credito in inglese e titolo professionale appare esattamente una volta. Non ripetere un titolo professionale, non ripetere un nome, non dare a una persona più titoli.

Le transizioni devono essere varie: maschera a disco in vinile circolare, dissolvenza verticale a portiera d'auto, ombra lunga di una figura che spazza lo schermo, taglio con linea rossa, maschera a lettera inglese gigante, ricomposizione del fotogramma a schermo diviso, taglio duro a blocchi di colore, pannelli incollati blocco per blocco. Tutte le transizioni cadono sui colpi di batteria: nitide, piene di suspense, agili, collage a fumetti. Nessuna dissolvenza morbida, nessuna transizione fluida.

BGM: musica originale di 15 secondi per i titoli, 60% suspense, 40% jazz. Costruita con un tono di basso sostenuto, archi pizzicati tesi, impulsi di sintetizzatore freddi, grancassa, spazzole jazz sparse, un frammento di basso camminato, brevi frasi di sassofono baritono e brevi stacchi di ottoni. I primi 2 secondi stabiliscono la suspense con basse frequenze e hi-hat, a 3 secondi entrano i tamburi bassi, a 6 secondi si unisce il groove del basso jazz, a 10 secondi appare un breve riff di sassofono/ottoni, gli ultimi 2 secondi lo bloccano con un accordo teso e un colpo di batteria.

Guarda dove sono state spese le parole. Quasi nessuna è andata a "bello" o "cinematografico." Sono andate a una lista negativa, una lista di transizioni e un foglio di indicazioni musicali secondo per secondo. Questa è la forma del lavoro. Banner anime noir con una figura in silhouette su un treno della metropolitanaSequenza di titoli noir ufficiale di MiniMax H3: MIDNIGHT LINE, con crediti STARRING puliti

Guarda i crediti in quel clip. MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS. Scritti correttamente, nessun titolo professionale usato due volte, decorazione katakana posizionata dove richiesto. Il prompt non diceva "fai bei titoli." Diceva niente ripetizioni, niente errori di ortografia, niente cinese, e nominava l'estetica in cinque modi diversi. Cinque pannelli cinematografici noir con figure in silhouette in blu e arancioneCinque board di riferimento stilistico forniti a MiniMax H3 insieme al prompt per i titoli noir

Quelle cinque board sono state inserite insieme al testo. Cinque immagini più un lungo brief, una generazione. Ecco come appare questo lavoro ora.

E il motivo per cui molti dei 45 prompt sono brevi è proprio lì nell'immagine. In tutto il set, il prompt mediano è di circa 130 caratteri cinesi, ma i due più lunghi arrivano a 657 e 858. Quelli brevi sono brevi perché una board di riferimento sta portando la descrizione. Quelli lunghi sono lunghi perché nient'altro l'avrebbe portata.

Perché la maggior parte dei prompt MiniMax H3 esce piatta, e la soluzione per il testo distorto

Tre cose vanno storte, e sono tutte assenze piuttosto che errori.

Nessuna linea temporale. Hai chiesto dieci secondi e hai descritto un momento, quindi ottieni un lento push-in allungato per dieci secondi. Il modello non aveva niente da fare al settimo secondo.

Nessun blocco audio. Il suono viene generato nello stesso passaggio dell'immagine. Se non dici nulla, il modello ti consegna comunque una traccia. Semplicemente ne sceglie una.

Nessuna lista negativa. Lasciato a se stesso, il modello opta per dissolvenze morbide, inventa testo sullo schermo extra e aggiunge una striscia di sottotitoli che nessuno ha chiesto.

La prova più chiara è il prompt ufficiale dell'interfaccia di gioco, che è costruito su sei battute temporizzate: [0s-2s] menu, [2s-4s] pannello del braccio destro, [4s-7s] griglia armamenti, [7s-8.5s] conferma, [8.5s-10s] barra di caricamento, [10s-15s] il mondo si carica. Il clip finito colpisce tutte e sei, in ordine, in tempo. Menu di gioco che mostra la selezione di un braccio robotico Phantom GripClip dell'interfaccia di gioco MiniMax H3: menu, pannello equipaggiamento, barra di caricamento, mondo caricato

Ora la metà onesta, dallo stesso clip, a piena risoluzione 2560x1440. Confronto tra testo UI leggibile e testo AI distortoA sinistra: il testo scritto esplicitamente nel prompt viene renderizzato pulito. A destra: il testo non scritto esplicitamente viene renderizzato come rumore a forma di lettera.

A sinistra, ogni stringa che il prompt ha effettivamente digitato: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW. Nitido, corretto, spaziato come un vero menu di gioco.

A destra, l'HUD nell'inquadratura finale della strada, che il prompt ha solo chiamato "elementi HUD." Legge ETR METNO CITFEP. Sopra le icone dell'equipaggiamento, dove il prompt non diceva nulla, ottieni MNALEαIN IAMG. Non è un bug di rendering. Il modello sta disegnando la texture dell'inglese perché non gli è mai stata data la stringa.

Quindi la soluzione non è un'impostazione. È un'abitudine:

Se una parola deve essere leggibile, scrivi la parola. Poi aggiungi una riga negativa: non scrivere male, non aggiungere altro testo, non aggiungere sottotitoli.

Ed ecco la forma a sei blocchi che ogni forte prompt ufficiale condivide.

BloccoCosa contieneEsempio da un prompt ufficialeSe lo salti ottieni
1. Contratto di stileMedium, texture, palette, epoca, l'aspetto da non perdere"titoli di testa in stile anime retrò giapponese, silhouette dai bordi netti, collage a fumetti, blocchi di colore geometrici forti"Un render generico lucido che deriva al sesto secondo
2. Linea temporaleFette di tempo letterali con un'azione in ciascuna[2s-4s] Zoom morbido sul suo braccio destro. Pannello UI scorre da destraUn'idea allungata per tutta la durata
3. TelecameraMovimento, o un rifiuto esplicito di muoversi"bloccata, campo largo statico, nessun push in, nessun taglio"Un carrello lento di default che non hai chiesto
4. AudioOgni suono, e quando entra"a 6 secondi si unisce il groove del basso jazz, gli ultimi 2 secondi lo bloccano con un accordo teso"Qualunque rumore ambientale piaccia oggi al modello
5. Testo, scritto esplicitamenteLe stringhe letterali, tra virgolette"THIS IS FINE." / CONFIRM CONFIGRumore a forma di lettera, come sopra
6. Lista negativaLe transizioni, gli oggetti e i cliché da rifiutare"Nessuna dissolvenza morbida, nessuna transizione fluida, non aggiungere cinese, non ripetere un titolo professionale"Dissolvenze morbide, testo inventato, deriva inquietante

I blocchi 5 e 6 sono gratuiti. Non costano nulla in più da generare e sono dove risiede la maggior parte della qualità.

Il flusso di lavoro del prompt MiniMax H3: a quale endpoint appartiene il tuo prompt

Stessa chiave, stessa forma submit-and-poll, tre porte. Quale scegli decida cosa il tuo prompt deve ancora fare.

EndpointCosa gli daiCosa blocca per teParametri che vale la pena conoscereUsalo quandoFatturazione
minimax/h3/text-to-videoSolo promptNiente. Il testo porta tuttodurata 5-10 (default 8), risoluzione 2K, rapporto deve essere impostato esplicitamenteTestare un look o un sound design prima di impegnartiFatturato al secondo di output, tariffa corrente sulla pagina del modello
minimax/h3/image-to-videoPrompt + immagine (primo fotogramma), end_image opzionaleDove il clip inizia, e opzionalmente dove finisceend_image, durata 5-10 (default 8), rapporto adattivo per defaultHai un'opera d'arte e vuoi che si muova senza essere ridisegnataFatturato al secondo di output
minimax/h3/reference-to-videoPrompt + refers[]Identità del soggetto e stile, attraverso una scena che inventirefers[] array misto, durata 5-15, rapporto fino a 21:9Stesso personaggio o prodotto, nuovo ambienteFatturato al secondo di output

refers[] è quello che è veramente poco documentato in giro, quindi ecco la forma che vuole:

json
1"refers": [
2  { "url": "https://.../subject.png", "type": "image" },
3  { "url": "https://.../style-board.png" },
4  { "url": "https://.../motion-ref.mp4", "type": "video" },
5  { "url": "https://.../beat.mp3",       "type": "audio" }
6]
7

Quattro regole che ti faranno risparmiare una generazione sprecata ciascuna:

  1. L'audio non può viaggiare da solo. Almeno un'immagine o un video deve essere nell'array. Una traccia ritmica da sola viene rifiutata.
  2. type è opzionale. Viene dedotto dall'URL, ma dichiaralo comunque quando l'estensione è ambigua.
  3. I limiti sono reali. Fino a 9 immagini, 3 video e 3 clip audio, 12 file in totale, con video e audio di riferimento della durata di 2-15 secondi ciascuno (Documentazione API MiniMax, luglio 2026).
  4. Dai a ogni riferimento un lavoro all'interno del testo del prompt. Questa è l'abitudine a più alta leva in questa lista. I prompt ufficiali iniziano con frasi come "L'immagine 1 è il riferimento per l'umore e lo stile generale, l'immagine 2 è il riferimento per il personaggio principale." Senza quella frase, il modello deve indovinare quale board significa cosa.Grande testo nero che dice BASS HITS sopra una donna sorridenteVideo musicale dark-pop MiniMax H3: tipografia CUT BACK, ONE LOOK, DETONATE Tre donne in abbigliamento grunge accanto a un poster tipografico audaceLe due board di riferimento tipografico dietro il clip dark-pop

Quel clip è l'argomento per la regola 4. Il suo prompt non descrive mai una singola forma di lettera. Dice "lo stile di confezionamento del testo e la texture fanno riferimento alle immagini", e consegna due board. La disposizione è arrivata perché è stata mostrata, non descritta.

Un'altra tabella, perché la scheda del modello e l'API attualmente non dicono la stessa cosa, e il divario è dove le persone perdono un pomeriggio.

CosaDocumentazione ufficiale di MiniMaxCosa accettano effettivamente gli endpoint oggiCosa significa per il tuo prompt
DurataDa 4 a 15 secondi, solo interitext-to-video e image-to-video: da 5 a 10, default 8. reference-to-video: da 5 a 15, default 8Una lista di inquadrature da 15 secondi è adatta solo a reference-to-video in questo momento. Riscrivi board più lunghe in 10
Risoluzione2Kla risoluzione predefinita è 2K, e 2K è attualmente l'unico valore che funziona. Un lavoro a 768p viene restituito con il modello MiniMax-H3 non supporta la risoluzione 768P, risoluzioni supportate: 2K, anche se 768p appare nella tabella dei prezziScrivi per un lato corto di 1440px. I dettagli che chiedi sopravviveranno effettivamente
Rapporto d'aspettoRapporti comuni o adattivoimage-to-video e reference-to-video impostano adattivo per default. Solo testo rifiuta adattivo e restituisce il suo set consentito: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9Su text-to-video, imposta il rapporto esplicitamente o il lavoro fallisce la validazione
Riferimenti misti9 immagini, 3 video, 3 audio, 12 file, audio mai da solorefers[] accetta {url, type} con image, video o audio, almeno un'immagine o videoPuoi davvero sincronizzare il movimento con un ritmo fornito. Semplicemente non puoi fornire solo il ritmo
Audio nativoAudio stereo nello stesso passaggioCiascuno dei nove clip ufficiali che ho analizzato: 2560x1440, 24fps, AAC stereo a 32kHzIl blocco audio non è una decorazione. È metà del deliverable

Tutto quanto sopra è stato eseguito su Atlas Cloud, dove tutti e tre gli endpoint H3 si trovano dietro una chiave e un unico loop submit-and-poll, quindi passare dall'uno all'altro è un cambio di stringa del modello e nient'altro.

Tutorial del prompt MiniMax H3: Dai fuoco al cane This Is Fine, con suono

Ecco l'intera faccenda dall'inizio alla fine. La battuta funziona perché il cane non fa nulla. Allunga quella negazione per dieci secondi di tempo reale, aggiungi fuoco reale, e lascia che gli ultimi due secondi vadano dove andava effettivamente il fumetto originale, e diventa più divertente e leggermente peggiore per te. La maggior parte delle persone ha visto solo i primi due pannelli.

Passaggio 1: Scarica il fumetto originale. Non lasciare che un'IA lo ridisegni.

La striscia è di sei pannelli, due colonne per tre righe, 600 per 887. Vogliamo solo il pannello 2 e il pannello 6.

bash
1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png
2# 600x887, 6 pannelli, 2 colonne x 3 righe
3
4# ritaglia pannello 2 (il pannello "THIS IS FINE."):  x 302-584, y 20-293
5# ritaglia pannello 6 (il cane che si scioglie):       x 302-584, y 595-868
6# upsala ciascuno 4x con Lanczos  ->  1128x1092
7

Dillo chiaramente: non chiedere a un modello di immagine di disegnare "un cane che assomiglia a This Is Fine." Una ricreazione tramite IA viene riconosciuta come falsa in mezzo secondo e la battuta muore sul colpo. La sfumatura ad acquerello, la lettering traballante a mano e la grana della carta sono l'intero contratto. L'upscaling 4x Lanczos è solo perché 282px di sorgente sono pochi; dà al modello pixel reali a cui aggrapparsi senza inventarne di nuovi. Due pannelli del cane This is Fine che si scioglie nel fuocoPannello 2 e pannello 6 del fumetto originale, etichettati come input del primo fotogramma e dell'immagine finale

Passaggio 2: Eseguilo su image-to-video con un end_image.

Modello: minimax/h3/image-to-video. Impostazioni: risoluzione 2K, immagine = pannello 2, end_image = pannello 6, rapporto 1:1 per corrispondere alla sorgente quasi quadrata. Imposta durata su 10; il cursore è su 8 per default, quindi trascinalo.

text
1Pannello di fumetto web 2D dipinto a mano, portato in vita. Mantieni la texture
2originale dell'acquerello, i contorni a inchiostro visibili, la grana della carta
3fuori registro e la tavolozza piatta del fumetto in ogni fotogramma. Non lisciare,
4non renderizzare nuovamente in 3D, non pulire il tratto, non aggiungere nuovi
5oggetti, non aggiungere nuovo testo.
6
7[0s-3s] Quasi nulla si muove. Il cane siede perfettamente fermo, tiene la tazza,
8occhi fissi in avanti. Solo le fiamme dietro di lui si muovono: leccate arancioni
9lente che salgono sul muro, una brace che sale. Il fumetto che dice "THIS IS FINE."
10rimane esattamente dov'è, completamente leggibile, invariato, lettering a mano.
11
12[3s-6s] Il cane solleva la tazza e fa un piccolo sorso calmo. Il fumetto svanisce
13dopo il sorso. Il fuoco si intensifica. Il muro dietro di lui inizia a deformarsi
14con il calore. Il suo cappello inizia a fumare sull'orlo.
15
16[6s-8.5s] Il calore lo raggiunge. Le sue orecchie si afflosciano, il suo contorno
17si ammorbidisce e inizia a colare verso il basso come vernice bagnata. Lui ancora
18non muove gli occhi. La tazza rimane nella sua zampa.
19
20[8.5s-10s] Scioglimento completo. Il viso si distorce, un occhio scivola, denti
21scoperti in un sorriso fisso, la pelliccia diventa rossa e arancione. Lui mantiene
22la posa. Tieni l'ultimo fotogramma per l'ultimo mezzo secondo.
23
24Telecamera: bloccata, singolo campo largo statico, nessun push in, nessuna
25movimentazione a mano, nessun taglio. Il fotogramma non si muove mai. Questa
26è una singola ripresa continua all'interno di un pannello del fumetto.
27
28Audio: rumore ambientale di un incendio interno per tutta la durata - crepitio
29basso, scoppio occasionale di legno che brucia, un leggero scricchiolio strutturale.
30A 3s, una tazza di ceramica che tocca i denti e una piccola deglutizione. Una voce
31maschile calma, piatta, imperturbabile dice esattamente: "This is fine." - senza
32emozione, leggermente troppo rilassata. Da 6s il crepitio diventa più forte e
33il rumore ambientale si addensa; gli ultimi 2 secondi aggiungono un'ondata di
34sub-bassi. Nessuna musica, nessuna traccia di risate, nessun effetto sonoro che
35non sia in questa lista.
36
37Non aggiungere sottotitoli. Non aggiungere una filigrana. Non scrivere alcuna
38parola diversa da quelle già presenti nell'immagine. Non cambiare "THIS IS FINE."
39Non staccare.
40

Quel prompt è la tabella della struttura, viva. Il primo paragrafo è il contratto di stile. Le quattro fette tra parentesi sono la linea temporale. Poi telecamera, poi audio, poi la lista negativa. Niente in esso è decorativo. Screenshot del generatore video AI che mostra il meme This is fineMiniMax H3 image-to-video su Atlas Cloud: primo fotogramma e immagine finale caricati, 10 secondi a 2K, clip finito nel pannello di output

Passaggio 3: Leggi l'output come una verifica di qualità.

Quattro controlli, ciascuno che testa un diverso blocco del prompt.

  1. THIS IS FINE. nella nuvola è ancora leggibile e ancora scritto correttamente? Questo testa il blocco 5.
  2. Il tratto è sopravvissuto, o qualcosa lo ha "migliorato" in un 3D pulito? Questo testa il blocco 1.
  3. L'audio contiene solo i suoni che hai elencato? Analizza il contenitore: dovrebbe tornare h264 più AAC stereo.
  4. L'ultimo fotogramma atterra sulla posa del pannello 6? Questo testa end_image.
bash
1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \
2        -of default=noprint_wrappers=1 output.mp4
3

Il mio è tornato a 1472x1440, 24fps, h264 più AAC stereo, 10.13 secondi. Vale la pena notare: ho chiesto ratio: 1:1 e ho ottenuto 1472x1440, quindi su image-to-video la forma del fotogramma sorgente vince. Abbina i tuoi due pannelli alla forma che vuoi effettivamente. Cane dei cartoni animati dice this is fine poi si scioglie nel fuocoQuattro fotogrammi dal clip finito a 0s, 3s, 6.5s e 10s, corrispondenti alle quattro fette temporali nel prompt

Passaggio 4: Sposta il cane da qualche altra parte con reference-to-video.

Stesso personaggio, nuova stanza. Modello: minimax/h3/reference-to-video. Impostazioni: refers[] = pannello 2 come immagine, durata 8, risoluzione 2K, rapporto 16:9.

text
1L'immagine 1 è il riferimento per il personaggio e lo stile artistico: mantieni
2questo esatto aspetto di fumetto web 2D dipinto a mano, la stessa texture
3dell'acquerello, lo stesso spessore del contorno a inchiostro, lo stesso cane,
4lo stesso cappellino, la stessa tazza. Non ridisegnarlo in 3D, non cambiare le
5sue proporzioni, non pulire il tratto.
6
7Mettilo in una stanza diversa e mantieni la sua compostezza. Un angusto ufficio
8open space di notte, tubi fluorescenti che sfarfallano, una parete di monitor
9che mostrano tutti uno stato di errore rosso, carta della stampante che scende
10volando attraverso il fotogramma, un piccolo incendio elettrico nell'angolo. Lui
11siede su una sedia da ufficio al centro del fotogramma, tazza nella zampa,
12guardando dritto verso la telecamera, completamente rilassato.
13
14Telecamera: bloccata, campo largo statico. Nessun push in, nessun taglio.
15
16Audio: ronzio fluorescente, macinio della stampante, un allarme morbido e
17ripetitivo ogni due secondi, crepitio elettrico distante, un sorso calmo a 4s.
18Nessuna musica. Nessuna voce.
19
20Non aggiungere testo sullo schermo. Non aggiungere sottotitoli. Non aggiungere
21altri personaggi.
22

La regola trasferibile: refers[] trasporta identità e stile, il testo trasporta la scena. Questa divisione è l'intero trucco per la coerenza del personaggio, ed è il motivo per cui la prima riga del prompt esiste affatto. Proviamo: "Cane dei cartoni animati che tiene una tazza di caffè in mezzo a schermi rossi e una stampante in fiammeLo stesso cane del fumetto web trasferito in un ufficio open space in fiamme di notte, generato da MiniMax H3 reference-to-video

Stesso cappello, stessa tazza, stesso spessore di inchiostro, nuova stanza. Una singola immagine di riferimento ha fatto tutto questo.

Tre altri modelli di prompt MiniMax H3 che vale la pena rubare

Modello 1: il poster animato, in cui il layout non deve muoversi. Personaggio dei cartoni animati che corre in avanti contro uno sfondo rosa solidoPoster animato MiniMax H3: il layout POPUP! si anima mentre il fotogramma e la tipografia rimangono bloccati Ragazzo dei cartoni animati con felpa mostro rosa che allunga la mano con un artiglio giganteIl poster statico originale fornito a MiniMax H3

L'intero prompt è di due righe: mantieni la cornice bianca della galleria, la cornice interna, la tavolozza rosso-bianco-nero, la sensazione di figura 3D e la struttura del layout invariati, e metti un effetto sonoro agile sotto l'ingresso del testo. La regola: nomina le parti che devono sopravvivere. "Mantieni il layout" non è una nota di stile, è un vincolo, e il modello lo tratta come tale.

Modello 2: la demo dell'interfaccia, dove i verbi battono gli aggettivi. Scarpa da running Nike ZoomX verde menta con suola sfumata rosaDemo della pagina di destinazione MiniMax H3: scroll, hover, inversione di colore su una pagina prodotto Scarpa da running Nike azzurra con accenti verdi e rosaL'immagine di riferimento del singolo prodotto dietro il clip della pagina di destinazione

Quel prompt chiede uno scroll verso il basso, uno stato hover, un forte ingrandimento e un'inversione di colore. Quattro verbi. Non dice mai "moderno" o "elegante." Le interazioni sono azioni, quindi scrivile come azioni. Il tipo corsivo sovradimensionato e lo sfondo a trama di carbonio sono venuti dagli aggettivi; la cosa che lo fa sembrare una pagina reale è venuta dai verbi.

Modello 3: live action più disegnato a mano, tenuto insieme dai rifiuti. Germoglio verde animato luminoso che cresce in una mano apertaClip MiniMax H3 che fonde riprese live action in cucina con creature luminose disegnate a mano

Questo è un girato serale in cucina con un telefono, con piccole creature luminose disegnate a mano, e il motivo per cui rimane affascinante invece di trasformarsi in un corto horror è un elenco di divieti: niente occhi giganti, niente bocche spaccate, niente zanne, niente postura minacciosa, niente balzi, niente taglio improvviso al nero, niente spaventi improvvisi. La lista negativa è il controllo di stile primario, non una toppa. È anche dove codifichi il gusto. Quattro pannelli che mostrano una donna in un tunnel buio con testoQuattro fotogrammi dal trailer di fantascienza ufficiale: THE STARS WERE LISTENING Poster per The Stars Were Listening e foglio di design del personaggioLa mood board e il riferimento del personaggio dietro il trailer

Il trailer sopra chiude il cerchio su entrambe le idee. Il prompt scrive esplicitamente un titolo, THE STARS WERE LISTENING, in dettaglio: estremamente stretto, pesante, tutto maiuscolo, rosso scuro misto a ruggine, leggera grana e bordi annebbiati. Quello torna esattamente come ordinato. Due board di riferimento gestiscono l'umore e il protagonista, quindi il testo non deve mai descrivere un volto. Divisione del lavoro, fino in fondo.

Quanto costa eseguire questi prompt MiniMax H3

H3 viene fatturato al secondo di video generato, per risoluzione, quindi il modello di costo è piacevolmente noioso: una ripresa da 15 secondi costa circa tre tentativi da 5 secondi. Tutto il resto segue da questo.

  • Itera a 5 secondi, consegna a 10 o 15. Composizione, tavolozza e sound design si risolvono tutti a 5. Niente di una ripresa bloccata ha bisogno dell'intera durata per dirti che è sbagliata.
  • end_image è uno strumento di costo, non solo creativo. La maggior parte dei nuovi tentativi avviene perché il finale è andato alla deriva. Fissare l'ultimo fotogramma rimuove quella modalità di fallimento prima di pagarla.
  • Le liste negative e il testo scritto esplicitamente sono gratuiti. Aggiungono caratteri a un prompt che viene fatturato al secondo, non al token. Usali pesantemente.
  • Abbina la durata all'endpoint prima di scrivere. Costruire una lista di inquadrature da 15 secondi e poi scoprire che il tuo endpoint è limitato a 10 ti costa una riscrittura, non solo una nuova esecuzione.

Una cosa di cui non pianificare ancora: le tabelle dei prezzi elencano un livello 768p più economico, ma al momento in cui scrivo un lavoro a 768p viene rifiutato categoricamente e 2K è l'unica risoluzione che funziona. Budgetta come se ogni secondo fosse un secondo 2K. Le tariffe correnti al secondo si trovano sulla pagina del modello, che è anche dove apparirà il livello 768p una volta aperto.

Il cane non è di pubblico dominio. This Is Fine proviene dal fumetto web Gunshow #648 di KC Green, pubblicato il 9 gennaio 2013, e solo i primi due pannelli sono diventati virali (Know Your Meme, gennaio 2013). Green ha parlato pubblicamente, e piuttosto stancamente, di guardare l'immagine essere riutilizzata per sempre, anche da persone le cui opinioni politiche non condivide (NPR, gennaio 2023).

Questa procedura è commento e insegnamento, non una libreria stock. Se vuoi spedire qualcosa commercialmente, disegna i tuoi fotogrammi o concedi in licenza quelli che usi. E esegui la tua verifica delle policy prima di un lavoro per un cliente: H3 applica regole sui contenuti a persone reali riconoscibili e IP noti, e scoprirlo a metà scadenza non è divertente.

Domande frequenti

MiniMax H3 genera audio, o lo aggiungo dopo?

Stesso passaggio. Immagine e suono escono insieme, che è esattamente il motivo per cui l'audio deve essere scritto nel corpo del prompt piuttosto che aggiunto in seguito. Dagli un blocco Audio: separato e indica quando ogni suono entra. Ciascuno dei nove clip ufficiali che ho analizzato è tornato come AAC stereo a 32kHz insieme a un flusso video 2560x1440, 24fps.

Quanto può essere lungo un prompt MiniMax H3?

Fino a 7.000 caratteri, secondo la documentazione di MiniMax. In pratica gli esempi ufficiali coprono una vasta gamma, con una mediana di circa 130 caratteri cinesi e i due più lunghi a 657 e 858. I prompt brevi funzionano bene quando un'immagine di riferimento fa il lavoro di descrizione. Se non hai riferimenti, aspettati di scrivere una lista di inquadrature.

Perché il testo esce distorto nei miei video MiniMax H3?

Perché non l'hai digitato. Le stringhe che appaiono letteralmente nel prompt vengono renderizzate pulite; tutto ciò a cui accenni genericamente ("elementi HUD", "alcune etichette") torna come texture a forma di lettera. Scrivi esplicitamente ogni parola che deve essere leggibile, poi aggiungi non scrivere male, non aggiungere altro testo, non aggiungere sottotitoli.

Quante immagini, video e clip audio di riferimento può usare un singolo prompt MiniMax H3?

Nove immagini, tre video e tre clip audio, dodici file in totale, con video e audio di riferimento tra 2 e 15 secondi ciascuno. L'audio non può essere l'unico riferimento. Nota che la capacità del modello e ciò che un dato endpoint espone sono due cose diverse, quindi controlla la pagina del modello per l'elenco di input corrente.

Un prompt MiniMax H3 può controllare come finisce il clip, non solo come inizia?

Sì, su image-to-video, tramite il parametro opzionale end_image. Dai un primo fotogramma e un ultimo fotogramma e il clip interpola tra di loro. La demo sopra è esattamente questo: pannello 2 del fumetto dentro, pannello 6 del fumetto fuori. Mantieni le due immagini a rapporti d'aspetto simili o la transizione diventa brutta.

Quali durate e risoluzioni posso ottenere effettivamente in questo momento?

2K, e solo 2K. Un lavoro a 768p viene attualmente rifiutato con risoluzioni supportate: 2K, nonostante 768p appaia nella tabella dei prezzi. La durata differisce per endpoint: text-to-video e image-to-video accettano da 5 a 10 secondi con un default di 8, mentre reference-to-video accetta da 5 a 15. Un altro problema: sulla generazione solo testo, l'API rifiuta adattivo e richiede un rapporto esplicito.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli