Ogni articolo su questo modello si ferma alla stessa riga. Nove immagini, tre clip video, tre clip audio, dodici file totali. Sembra un certificato di garanzia.
Così l'ho trattato come tale. Ho costruito un personaggio, costruito un oggetto di scena, generato una scena notturna, re-inserito quella scena notturna come video di riferimento, tagliato otto secondi di jazz in una traccia audio di riferimento e inviato tutti e tre i tipi di riferimento in una singola richiesta. Poi ho iniziato a infrangere le regole di proposito per vedere quali l'API difende effettivamente.
Quattro di esse non vengono difese come ci si aspetterebbe. Una di esse ti addebita ancora il prezzo intero per un video che non hai richiesto, e il messaggio di errore che speravi non arriva mai. Quella vale la pena di leggere fino alla fine.
Punti Chiave
- Tre tipi di riferimento, un unico array. Fino a 9 immagini, 3 clip video e 3 clip audio, 12 file in totale. Vanno tutti nello stesso campo
refers, etypeè opzionale perché l'API lo deduce dall'estensione del file. - L'audio non può mai volare da solo. Una richiesta solo audio viene rifiutata con un errore nominato. Deve accompagnarsi ad almeno un'immagine o un video.
- Riferimento a video e immagine a video si escludono a vicenda, ma nulla te lo dice. Invia un'immagine
imagedi primo fotogramma insieme areferse il lavoro viene comunque completato. Uno dei due input viene scartato in silenzio, a prezzo pieno. Verificato due volte il 12-08-2026, su entrambi gli endpoint. - Nulla viene convalidato quando invii. Ogni richiesta errata in questo articolo ha restituito HTTP 200 e un ID. Il verdetto reale arriva due o tre minuti dopo, in fase di generazione. I rifiuti lì sono gratuiti; i completamenti no.
- I file di riferimento extra sono gratuiti. Un'immagine di riferimento e dieci immagini di riferimento vengono fatturate esattamente allo stesso importo per la stessa durata del clip. Il prezzo segue i secondi di output, non il conteggio degli input.
Ecco cosa è uscito dall'altra parte. Due inquadrature, un volto, due posti completamente diversi, e la seconda inquadratura è stata costruita da un'immagine, un video e un file audio contemporaneamente.
Inquadratura A (pioggia, notte, vicolo al neon) poi Inquadratura B (mercato coperto vuoto la mattina dopo), montate insieme senza nulla aggiunto se non la giunzione. Stessa donna, stessa cicatrice sopra il sopracciglio destro, stessa giacca indaco, stesso asciugamano. L'inquadratura B è stata generata da tre riferimenti contemporaneamente: il suo ritratto, la clip dell'inquadratura A stessa e un frammento jazz di otto secondi. Entrambe le inquadrature sono minimax/h3/reference-to-video a 2K, 2560x1440, 24fps, con la traccia stereo nativa a 32kHz. Vale la pena avere l'audio acceso per la seconda metà, dove lei pronuncia la sua battuta.
Perché MiniMax H3 Reference to Video Batte Qualsiasi Prompt Tu Possa Scrivere
Un prompt descrive una persona. Un riferimento è la persona. Questa differenza è l'intera ragione per cui questo endpoint esiste, ed è il motivo per cui MiniMax H3 attualmente siede in cima alla classifica dell'editing video: Elo 1.125 su 10.280 voti (Artificial Analysis, agosto 2026). Vale la pena essere precisi su quel numero, però: la stessa tabella elenca il suo intervallo di rango come 1 a 2, statisticamente in parità con Google Gemini Omni Flash a 1.122. Primo posto, all'interno di un intervallo di confidenza che condivide. L'affermazione correlata che H3 si collochi anche tra i primi tre sia per text-to-video che per image-to-video proviene dallo stesso post di annuncio del laboratorio (Artificial Analysis su X, agosto 2026).
I ranghi sono economici. Ecco il comportamento reale, stesso prompt, tre livelli di riferimento, tutto il resto identico.

Tre esecuzioni MiniMax H3 reference to video sullo stesso prompt: nessun riferimento, un'immagine di riferimento del personaggio, e due immagini di riferimento
Stesso prompt, stesse impostazioni 768P 4s, da sinistra a destra: nessun riferimento (text-to-video), un'immagine di riferimento del personaggio, due immagini di riferimento (personaggio più la ciotola di ramen). Il prompt dice "la donna dell'immagine di riferimento" in tutti e tre. Nel pannello di sinistra quella frase non si riferisce a nessuno, quindi il modello inventa un'estranea. Generato con minimax/h3/text-to-video e minimax/h3/reference-to-video.
Due letture oneste di quella striscia. Il salto dal pannello uno al pannello due è enorme: senza un riferimento, "la donna dell'immagine di riferimento" è una frase che non indica nulla, e il modello riempie silenziosamente il vuoto con una persona che non ha alcuna relazione con il tuo progetto. Il salto dal pannello due al pannello tre è molto più piccolo, perché il mio prompt descriveva anche la ciotola a parole, e H3 ha disegnato una ciotola blu scuro passabile con una gru sopra basandosi solo sul testo. Questa è la parte utile. Un'immagine di riferimento e un buon sintagma nominale competono per lo stesso compito, quindi usa i tuoi slot di riferimento per le cose che il linguaggio non può fissare: un volto specifico, un prodotto specifico, un logo specifico.
Lo schema dietro quasi ogni fallimento in questo articolo è lo stesso del pannello uno. Nulla ti avverte che parte della tua richiesta è finita nel nulla.
Cosa blocca realmente un riferimento, e cosa no. Un'immagine di riferimento fissa l'identità: struttura del viso, capelli, segni distintivi, indumento. Non fissa l'illuminazione, e questa è la sorpresa più comune. Trascina anche la luce della foto di riferimento, motivo per cui una scheda personaggio scattata in un ambiente cupo produce un personaggio che non può sopravvivere a un cambio di scena. Scatta il tuo riferimento in modo piatto e neutro. Un video di riferimento fissa movimento, gradazione e grana, non l'identità. Un audio di riferimento fissa il letto audio stesso. Se hai bisogno dello stesso volto che legge una battuta con la stessa voce in una serie, lo stack di riferimenti sta facendo tre lavori diversi e devi specificare quale è quale. Le guide pratiche convergono nel nominarli posizionalmente nel prompt ("L'immagine 1 è il personaggio, l'Immagine 2 è il prodotto") e questa convenzione vale la pena di adottarla; i miei prompt qui sotto usano invece una denominazione descrittiva semplice, che funziona anche quando i riferimenti sono visivamente inequivocabili.
Perché la prima chiamata di solito delude. Quattro cose, tutte misurate il 12-08-2026:
- L'endpoint di invio non convalida nulla. MIME sbagliato, audio di 164 secondi, URL morto, campi mutuamente esclusivi: tutto restituisce HTTP 200 con un ID di previsione. Lo scopri dopo.
ratioè impostato suadaptiveper impostazione predefinita, documentato come "lascia che il modello scelga". Con riferimenti 16:9 ho ottenuto 1344x768 a 768P sia lasciandolo suadaptiveche forzando 16:9, quindi l'impostazione predefinita è innocua quando i tuoi input sono già d'accordo. È un lancio di moneta quando non lo sono, e questo è l'unico endpoint H3 in cui puoi semplicemente togliergli la decisione.- Un'immagine di primo fotogramma più riferimenti non genera errore. Scarta silenziosamente uno dei due e ti addebita.
- Se il modello non ha nulla di concreto a cui aggrapparsi, riempie il vuoto con sicurezza, e un volto sbagliato ma sicuro sembra esattamente come un'esecuzione riuscita.
Per il lato della creazione del prompt, la Guida ai prompt di MiniMax H3 approfondisce la formulazione più di quanto io possa fare qui.
Il Manuale di MiniMax H3 Reference to Video: Tre Tipi, Una Richiesta
Tutti e tre i tipi di riferimento condividono un unico array. Ecco il contratto come pubblicato, accanto a ciò che l'endpoint ha effettivamente fatto quando l'ho testato.
Tabella 1: i tre tipi di riferimento
| Immagini di riferimento | Video di riferimento | Audio di riferimento | |
|---|---|---|---|
| File massimi | 9 | 3 clip | 3 clip |
| Limite combinato | 12 file in totale tra tutti e tre i tipi | ||
| Durata per file | n/d | da 2 a 15 secondi | da 2 a 15 secondi |
| Durata totale | n/d | 15 secondi | 15 secondi |
| Formati | png, jpeg, jpg, webp | mp4, mov | mp3, wav |
| Può essere usato da solo? | Sì | Sì | No, necessita di un'immagine o un video |
| Cosa fissa | identità, indumento, prodotto, stile | movimento, camera, gradazione, grana | il letto audio stesso |
| Cosa non fissa | illuminazione della nuova scena | chi è nell'inquadratura | la traccia esatta (vedi Passaggio 6) |
| Consegnato come | URL pubblico o URL dati base64 | URL pubblico o URL dati base64 | deve essere dichiarato audio/mp3, non audio/mpeg |
| Applicato? | 10 immagini sono passate senza problemi | non testato oltre 1 clip | finestra per clip applicata, 15s totale no |
I conteggi dei file e le finestre di durata sono i limiti pubblicati da MiniMax (Hailuo, agosto 2026), incrociati con l'articolo di lancio che elenca la stessa finestra video di riferimento da 2 a 15 secondi ciascuno e 15 secondi totali (MarkTechPost, agosto 2026). Tutto nelle ultime tre righe è mio, misurato.
Due cose che la scheda tecnica non ti dice. Primo, il campo type su ogni voce è opzionale e dedotto dall'estensione dell'URL, il che significa che un URL dati base64 o un link senza estensione deve dichiarare il suo tipo o la richiesta indovina male. Secondo, il caricatore del browser ha un limite massimo di nove file (Reference Materials (2/9), MAX:9 nello screenshot del Passaggio 5 qui sotto), al di sotto dei dodici di MiniMax. Ho comunque inviato dieci immagini di riferimento tramite l'API e il lavoro è stato completato normalmente, quindi nove è un limite dell'interfaccia utente, non un limite del modello.
Tabella 2: reference-to-video vs image-to-video vs text-to-video
| reference-to-video | image-to-video | text-to-video | |
|---|---|---|---|
| Accetta refers | sì, obbligatorio, min 1 | no (ignorato silenziosamente) | no |
| Accetta image primo fotogramma | no (ignorato silenziosamente) | sì, obbligatorio | no |
| Accetta end_image ultimo fotogramma | no | sì | no |
| Opzioni ratio | tutti e 7, incl. 16:9, 9:16, 21:9 | solo adaptive | tutti e 7 |
| Risoluzione | 768P o 2K, default 2K | uguale | uguale |
| Durata | interi da 4 a 15s, default 8 | uguale | uguale |
| Mescolare l'input dell'altro endpoint | lavoro completato, input scartato, addebito intero | lavoro completato, refers scartati, addebito intero | n/d |
Quella quarta riga è la differenza che nessuno menziona. Su image-to-video l'enumerazione delle proporzioni contiene esattamente un valore, adaptive, perché il primo fotogramma decide la forma. Su reference-to-video hai tutti e sette, il che rende questo l'unico endpoint H3 in cui puoi forzare una forma del fotogramma pur ancorando un personaggio. Se stai scegliendo un livello per questo lavoro, 2K vs 768P per MiniMax H3 copre cosa acquistano i pixel extra.
L'ultima riga è quella costosa. La documentazione presenta i due endpoint come mutuamente esclusivi, e lo sono, nel senso che viene onorato solo un percorso di input. Ma non c'è errore. L'ho eseguito in entrambi i modi il 12-08-2026: una chiamata reference-to-video che trasportava un'immagine di primo fotogramma si è completata in 115 secondi e ha addebitato $0,40, e una chiamata image-to-video che trasportava refers si è completata in 167 secondi e ha addebitato $0,40. Entrambe hanno prodotto un video. Entrambe hanno buttato via metà di ciò che ho inviato, e nessun campo nella risposta dice quale metà.
Tabella 3: i modelli utilizzati in questo flusso di lavoro
Tutto ciò che segue viene eseguito in una scheda del browser su Atlas Cloud, da dove provengono i prezzi e gli screenshot. Tariffe verificate il 12-08-2026.
| Passaggio | Modello | Tariffa | Esecuzioni | Costo |
|---|---|---|---|---|
| Riferimenti personaggio + oggetto | openai/gpt-image-2/text-to-image | elencato da $0,009; alta qualità a 2048x1152 misurata a $0,1745 | 2 | $0,35 |
| Audio di riferimento | minimax/music-2.6 | $0,15 per traccia | 1 | $0,15 |
| Inquadratura A e B | minimax/h3/reference-to-video | $0,10/s a 768P, $0,14/s a 2K | 2 x 8s a 2K | $2,24 |
| Scala di riferimento | stesso, più minimax/h3/text-to-video | $0,10/s a 768P | 3 x 4s a 768P | $1,20 |
Nessuno sconto è attivo su nessuno dei tre endpoint H3 questo mese. Due vicini sono più economici in questo momento se stai solo costruendo fermi immagine di riferimento: gpt-image-2-developer/text-to-image è al 50% di sconto, da $0,009 a $0,004 ad agosto 2026. Le ripartizioni complete per secondo sono disponibili nella guida Prezzi API MiniMax H3.
MiniMax H3 Reference to Video, Passo Dopo Passo
La scena: una donna che gestisce una bancarella di ramen. L'inquadratura A è un vicolo al neon piovoso di notte. L'inquadratura B è la stessa donna la mattina dopo in un mercato coperto vuoto, un posto diverso, un momento della giornata diverso e una lente diversa. Nulla passa tra le due chiamate tranne i riferimenti, che è lo scopo del test.
Passaggio 1: Costruire il riferimento del personaggio, illuminato piatto di proposito
Questo è il passaggio che le persone sbagliano. Un riferimento del personaggio non è una bella foto del tuo personaggio, è una misurazione del suo viso. Luce neutra, sfondo semplice, niente scena, niente atmosfera. H3 apprende la luce insieme al viso, quindi un riferimento atmosferico produce un personaggio che è saldato a quell'atmosfera.
Modello: openai/gpt-image-2/text-to-image. Impostazioni: qualità alta, dimensione 2048x1152 (16:9), formato png.
text1Fotografia editoriale di una donna sulla trentina, chef di street food. Ritratto ravvicinato a tre quarti, espressione neutra, contatto visivo diretto con la fotocamera. Capelli neri corti raccolti dietro un orecchio, una piccola cicatrice sopra il sopracciglio destro, pelle olivastra calda. Indossa una giacca da lavoro indaco sbiadita con le maniche arrotolate al gomito e un asciugamano bianco piegato sulla spalla sinistra. Sfondo da studio grigio chiaro e semplice, luce chiave morbida e uniforme, nessun oggetto di scena, messa a fuoco nitida sul viso, texture della pelle naturale, nessun ritocco. Fotorealistico, obiettivo 50mm. 2

Playground di GPT Image 2 su Atlas Cloud con il prompt del riferimento del personaggio caricato e il ritratto finito nel pannello di output
GPT Image 2 su Atlas Cloud: qualità impostata su alta, 16:9, la scheda personaggio renderizzata a destra.

Immagine di riferimento del personaggio per MiniMax H3 reference to video: ritratto da studio neutro di una chef di ramen con una cicatrice sopra il sopracciglio destro
Immagine di riferimento 1. La cicatrice sopra il sopracciglio destro e l'asciugamano bianco piegato sono intenzionali: sono ancore di identità economiche e inequivocabili che puoi verificare in ogni fotogramma successivo.
Passaggio 2: Costruire il riferimento dell'oggetto di scena
Secondo slot di riferimento, secondo compito. Gli oggetti si comportano meglio dei volti qui, il che rende un oggetto di scena distintivo il modo più semplice per dimostrare che un riferimento è atterrato. Stesso modello, stesse impostazioni.
text1Fotografia di prodotto di una singola ciotola di ramen in ceramica blu scuro con una gru bianca dipinta a mano sul lato, scheggiata sul bordo, riempita di shoyu ramen fumante. Vista frontale, sfondo grigio chiaro e semplice, luce morbida e uniforme, messa a fuoco nitida, fotorealistico, obiettivo 50mm. 2

Immagine di riferimento dell'oggetto: ciotola di ramen blu scuro con una gru bianca dipinta a mano e un bordo scheggiato
Immagine di riferimento 2. La gru dipinta a mano e la scheggiatura sul bordo sono gli indizi. Se sopravvivono nel video, il riferimento è stato letto.
Passaggio 3: Inquadratura A, due immagini in MiniMax H3 reference to video
Due immagini di riferimento, entrambe type: "image", in refers. Imposta esplicitamente le proporzioni. adaptive è l'impostazione predefinita e di solito farà la cosa giusta quando i tuoi riferimenti sono già 16:9, ma decide per te, e su questo endpoint non sei obbligato a lasciarglielo fare.
Modello: minimax/h3/reference-to-video. Impostazioni: risoluzione 2K, durata 8, proporzioni 16:9.
text1Inquadratura ampia di presentazione. Forte pioggia di notte in uno stretto vicolo illuminato al neon. La donna dell'immagine di riferimento lavora da sola dietro una piccola bancarella di ramen fumante sotto una tenda di plastica, versando brodo nella ciotola blu scuro con la gru bianca dell'immagine di riferimento. Il vapore sale attraverso i riflessi dei neon rosa e verdi sul marciapiede bagnato. Carrellata lenta verso la bancarella. Suono ambientale: pioggia sulla plastica, brodo che bolle, traffico lontano. Nessun dialogo. 2
L'output di questa chiamata è la prima metà del clip dimostrativo all'inizio. Conserva il suo URL. È l'input per il Passaggio 5.
Passaggio 4: Tagliare un audio di riferimento di otto secondi
L'audio di riferimento non è uno slot per colonna sonora. È un letto che il modello abbina al proprio mix, ed è l'input più esigente dell'endpoint. Genera una traccia, poi tagliala, perché una canzone intera viene rifiutata.
Modello: minimax/music-2.6, con is_instrumental: true e format: "mp3".
text1Jazz notturno rado, rullante spazzolato, contrabbasso, una tromba sordina, malinconico, 70 BPM, strumentale. 2
Poi taglia circa otto secondi e codificalo come URL data:audio/mp3. Tre cose che ho sbagliato qui inizialmente, tutte con il testo esatto dell'errore:
- La stringa MIME conta più dei byte. Dichiara
data:audio/mpege il riferimento viene rifiutato conaudio format ".mpeg" not allowed, anche se il file è un MP3 perfettamente normale. Scriviaudio/mp3. - Da 2 a 15 secondi per clip, ed è applicato. La mia traccia generata era di 164 secondi. È tornata con
invalid param: audio duration 164258 ms, expected [2000, 15000] ms. Tagliare a 8,05 secondi l'ha risolto. Entrambi i rifiuti non sono costati nulla. - Il limite combinato di 15 secondi è documentato ma non applicato. Ho inviato due clip da 8 secondi nella stessa richiesta, 16,1 secondi in totale, aspettandomi un rifiuto. Il lavoro è stato completato e fatturato normalmente. Non basarti su questo: è pubblicato come limite e potrebbe iniziare a comportarsi come tale in qualsiasi momento.

Playground di MiniMax Music 2.6 su Atlas Cloud con il prompt jazz e la traccia finita nel pannello di output
MiniMax Music 2.6 su Atlas Cloud, $0,15 per esecuzione, traccia finita a destra. Una cosa da copiare da questo screenshot e una no: il prezzo e il formato mp3 sono corretti, ma Is Instrumental è ancora spento e i testi demo della pagina sono ancora nella casella, quindi questa particolare esecuzione è tornata come una canzone di 1:35 con voci. Attiva quell'interruttore e cancella il campo Lyrics prima di eseguirlo, o ti ritroverai a tagliare un letto di riferimento con qualcuno che canta sopra. La mia esecuzione API, con isinstrumental: true, ha restituito 2:44 di strumentale in 209 secondi.
Passaggio 5: Inquadratura B, una chiamata MiniMax H3 reference to video con tutti e tre i tipi
Questa è la chiamata a cui si riferisce veramente la parola chiave. Tre tipi di riferimento, tre lavori diversi, un unico array:
- il ritratto del personaggio dal Passaggio 1,
type: "image", per mantenere il suo volto - l'mp4 dell'inquadratura A dal Passaggio 3,
type: "video", per trasportare gradazione e grana attraverso il taglio - il frammento jazz di otto secondi dal Passaggio 4,
type: "audio", come letto
Gli URL di output di altre generazioni sulla piattaforma possono essere inseriti direttamente in refers come riferimento video, che è il meccanismo reale alla base della continuità multi-inquadratura. Non "H3 ricorda il tuo personaggio". Gli restituisci l'inquadratura precedente.
Modello: minimax/h3/reference-to-video. Impostazioni: risoluzione 2K, durata 8, proporzioni 16:9.
text1La stessa donna dell'immagine di riferimento, la mattina dopo. Mercato coperto luminoso e vuoto, luce diurna fredda e pulita attraverso un lucernario, saracinesche ancora abbassate dietro di lei. Mezzo primo piano, fotocamera fissa. Lei pulisce il bancone con l'asciugamano bianco piegato, alza lo sguardo verso la fotocamera e dice una battuta, poi torna a lavorare. Mantieni il suo viso, i capelli, la cicatrice e la giacca indaco identici al riferimento. Trasporta la gradazione e la grana del clip di riferimento. Usa l'audio di riferimento come sottolineatura. 2

Playground di MiniMax H3 reference to video su Atlas Cloud con un riferimento immagine e uno audio caricati e il clip generato nel pannello di output
La stessa chiamata nel playground di MiniMax H3 Reference-to-Video, a 2K e 8 secondi. Due slot di riferimento di tipo diverso sono visibili in Reference Materials (2/9): lo slot 1 è ref-audio-8s.mp3, lo slot 2 è il suo ritratto. Il riferimento video va inserito tramite "Add via link" (in alto a destra di quel pannello) o tramite API, perché risiede a un URL piuttosto che su disco. Tre cose da leggere da questo pannello: il caricatore dice MAX:9 anche se il limite di MiniMax è 12, Aspect Ratio è impostato su adaptive a meno che non lo cambi, e il prezzo di esecuzione per 2K a 8 secondi è $1,12, che è il livello di $0,14 al secondo.
Passaggio 6: Verificare che il riferimento sia effettivamente atterrato
Un lavoro completato non è un lavoro riuscito. Due controlli, entrambi economici.
Controlla il volto. Prendi un fotogramma da ogni inquadratura e mettili fianco a fianco. Stai cercando le ancore che hai piantato: la cicatrice, l'attaccatura dei capelli, la giacca, l'asciugamano.

Fotogramma dell'inquadratura A accanto a un fotogramma dell'inquadratura B, che mostra lo stesso personaggio MiniMax H3 reference to video in due scene diverse
Sinistra: Inquadratura A, notte, neon, ampia. Destra: Inquadratura B, mercato coperto, mattina dopo, mezzo primo piano. Stesso volto, stessa cicatrice sopra il sopracciglio destro, stessa giacca e asciugamano, attraverso un cambio di scena e inquadratura senza nulla condiviso tranne i riferimenti.
Una cosa non è andata come ho scritto nel prompt. Ho chiesto "mercato coperto luminoso e vuoto, luce diurna fredda e pulita" e "trasporta la gradazione e la grana del clip di riferimento", e il clip di riferimento ha vinto. L'inquadratura B è inconfondibilmente mattutina e inconfondibilmente un posto diverso, ma è molto più cupa di quanto "luminoso" implichi, perché la gradazione notturna è arrivata insieme al video di riferimento. Non puoi chiedere a una chiamata lo stesso aspetto e la luce opposta. Se hai bisogno che la luce cambi, abbandona l'istruzione sulla gradazione, oppure abbandona il video di riferimento e mantieni l'identità con la sola immagine.
Controlla l'audio. Traccia la forma d'onda del frammento di otto secondi che hai caricato accanto alla traccia che è tornata all'interno dell'mp4 e aggiungi un controllo: un clip generato senza alcun riferimento audio.

Forma d'onda dell'audio di riferimento di otto secondi caricato, della traccia audio restituita all'interno del clip generato e di un controllo senza riferimento audio
In alto: il frammento jazz di 8,05 secondi inviato come riferimento. Al centro: la traccia estratta dall'mp4 restituito dell'inquadratura B, dominata dalla battuta di dialogo intorno a 5,5 secondi. In basso: Inquadratura A, stesso flusso di lavoro, nessun riferimento audio.
Qui devo correggere qualcosa che credevo all'inizio. L'audio di riferimento non torna testualmente. La correlazione dell'inviluppo tra il mio frammento e la traccia restituita è 0,25, contro -0,05 per il controllo senza riferimento, quindi i due sono correlati ma per niente identici, e la forma restituita è chiaramente un suo proprio mix piuttosto che il mio file con qualcosa sovrapposto. Ciò che il riferimento chiaramente ha fatto è stato mettere qualcosa sotto: il letto dell'inquadratura B è circa 7 dB più caldo del controllo senza audio nei primi cinque secondi, prima che inizi qualsiasi dialogo. Interpreta l'audio di riferimento come una guida sul mix, non uno slot musicale. Se hai bisogno della tua traccia esatta sotto l'immagine, sovrapponila dopo.
Se stai lavorando sul lato audio di questo, MiniMax H3 lip sync e audio e il tutorial sul video musicale MiniMax H3 partono entrambi da questo stesso comportamento dell'audio di riferimento. Per il codice di polling e ripetizione dei tentativi attorno a tutto ciò, il tutorial MiniMax H3 contiene il ciclo.
Quattro Altre Configurazioni MiniMax H3 Reference to Video Che Vale la Pena Rubare
Rielabora un clip che già possiedi. Metti un clip finito in refers come riferimento video, nessuna immagine, e chiedi un medium diverso. Il movimento, l'inquadratura, la carrellata e gli oggetti di scena sopravvivono; la superficie cambia. Questo è il meccanismo alla base della classifica di editing video di H3, ed è lo stesso alla base del lavoro anime in MiniMax H3 vs Veo 3.1 per anime.

Rielaborazione anime generata dal clip dell'inquadratura A usato come riferimento MiniMax H3 reference to video
Il vicolo dell'inquadratura A restituito come unico riferimento, con un prompt anime cel-shaded. Stessa bancarella, stesso mestolo, stessa ciotola con gru, stessa carrellata, ridisegnato. Un dettaglio che vale la pena conoscere: la conversione è più debole nei primi fotogrammi e più forte una volta che la fotocamera si impegna nel movimento. Mostrato come GIF silenziosa. Generato con minimax/h3/reference-to-video a 768P, 4s, $0,40.
Fai cantare una foto. Un ritratto più un clip vocale all'interno della finestra da 2 a 15 secondi, prompt della performance. Più economico di una pipeline di lip sync perché è una singola chiamata.
Blocca un prodotto in qualsiasi scena. Le immagini di riferimento fissano gli oggetti più duramente dei volti, quindi una foto di prodotto reale più un prompt di scena è la cosa più affidabile su questo endpoint. Controlla cosa ti è permesso fare con il risultato prima che finisca in un annuncio.
Costruisci una serie, non un clip. Incatenalo: l'output dell'inquadratura N diventa il riferimento video dell'inquadratura N+1. Ogni chiamata ha ancora un limite di 15 secondi, quindi la continuità è un tuo compito, non del modello. Quanto può essere lungo un video MiniMax H3 copre dove morde quel limite.
Confrontare i motori prima di impegnare una serie su uno? Seedance 2.5 vs MiniMax H3 e Alternative a MiniMax H3 sono i due da leggere.
Quanto Costa Realmente una Scena a Due Inquadrature con MiniMax H3 Reference to Video
Ogni riga qui sotto è un lavoro reale del 12-08-2026, con l'importo preso dal campo price che l'API restituisce su ogni previsione completata.
Tabella 4: il conto reale
| Lavoro | Modello | Impostazioni | Risultato | Addebitato |
|---|---|---|---|---|
| Riferimento personaggio | gpt-image-2 | high, 2048x1152 | completato | $0,1745 |
| Riferimento oggetto | gpt-image-2 | high, 2048x1152 | completato | $0,1745 |
| Audio di riferimento | music-2.6 | instrumental, mp3 | completato, traccia 164s, attesa 209s | $0,15 |
| Inquadratura A | h3/reference-to-video | 2K, 8s, 2 riferimenti immagine | completato in 309s | $1,12 |
| Inquadratura B | h3/reference-to-video | 2K, 8s, riferimenti immagine + video + audio | completato in 557s | $1,12 |
| Scala, nessun riferimento | h3/text-to-video | 768P, 4s | completato in 154s | $0,40 |
| Scala, 1 rif. immagine | h3/reference-to-video | 768P, 4s | completato in 119s | $0,40 |
| Scala, 2 rif. immagine | h3/reference-to-video | 768P, 4s | completato in 128s | $0,40 |
| Rielaborazione anime | h3/reference-to-video | 768P, 4s, 1 rif. video | completato in 239s | $0,40 |
| Ripetizione Passaggio 5 nel playground | h3/reference-to-video | 2K, 8s, rif. immagine + audio | completato | $1,12 |
| Controllo: 10 rif. immagine | h3/reference-to-video | 768P, 4s | completato in 150s | $0,40 |
| Controllo: immagine primo fotogramma + refers | h3/reference-to-video | 768P, 4s | completato, un input scartato | $0,40 |
| Controllo: refers su image-to-video | h3/image-to-video | 768P, 4s | completato, refers scartati | $0,40 |
| Controllo: 16,1s di audio di riferimento | h3/reference-to-video | 768P, 4s | completato oltre un limite documentato | $0,40 |
| Controllo: ratio omesso, poi ratio adaptive | h3/reference-to-video | 768P, 4s, due volte | entrambi completati, identico 1344x768 | $0,80 |
| Ripetizioni screenshot Passaggi 1 e 4 | gpt-image-2, music-2.6 | come sopra | completato | $0,32 |
| Controllo: solo audio di riferimento | h3/reference-to-video | 768P, 4s | fallito in 7ms | $0,00 |
| Controllo: audio di riferimento 164s | h3/reference-to-video | 768P, 4s | fallito in 16s | $0,00 |
| Controllo: MIME audio/mpeg | h3/reference-to-video | 768P, 4s | fallito in 17s | $0,00 |
| Controllo: URL riferimento morto | h3/reference-to-video | 768P, 4s | fallito in 21s | $0,00 |
| Totale | $8,18 |
Dividi onestamente quel totale. La scena a due inquadrature finita all'inizio di questo articolo, riferimenti e audio inclusi, è $2,74 di esso. Gli altri $5,44 sono l'indagine: controlli, rotture deliberate e ripetizioni di passaggi nel browser per gli screenshot. Se conosci già le regole, una sequenza a due inquadrature di 16 secondi a 2K costa meno di un panino.
Tre cose emergono da quella tabella.
I riferimenti sono gratuiti. Il controllo con dieci immagini è costato esattamente gli stessi $0,40 dell'esecuzione della scala con una immagine alla stessa lunghezza e risoluzione. Su questa piattaforma il contatore corre sui secondi di output e sulla risoluzione, nient'altro. Vale la pena segnalare una contraddizione: le regole della piattaforma MiniMax descrivono il video di input addebitato alla tariffa di output, e lo schema unificato su OpenRouter espone una voce separata reference_images. Nessuno dei due è apparso sulla mia fattura qui. Se stai facendo un budget altrove, stabilisci il prezzo da solo piuttosto che supporre.
Il fallimento è gratuito, ed è tardivo. Tutti e quattro i rifiuti non sono costati nulla, questa è la buona notizia. La cattiva notizia è quando arrivano: 7 millisecondi per la regola del solo audio, da 16 a 21 secondi per la durata dell'audio, il MIME sbagliato e l'URL morto, e nulla al momento dell'invio. Ogni richiesta malformata in questo articolo ha ricevuto prima HTTP 200 e un ID di previsione, quindi tratta una risposta di invio come una ricevuta, non come una convalida, e interroga il campo status prima di credere a qualsiasi cosa.
Il successo silenzioso è il fallimento costoso. I due controlli di mescolanza sono costati ciascuno $0,40 interi e hanno restituito un video perfettamente valido costruito dalla metà dei miei input. Non c'è errore, nessun campo di avviso e nessun modo per capire dalla risposta che qualcosa è stato scartato. Quella è l'unica riga nella tabella in cui il denaro è uscito dal conto e non ho ottenuto nulla di ciò che volevo.
Una correzione onesta su quest'ultimo punto, perché è cambiato sotto di me mentre scrivevo. All'inizio di agosto, un URL di riferimento che dava 404 si comportava allo stesso modo: il lavoro veniva completato, il riferimento veniva ignorato silenziosamente e l'importo intero veniva addebitato. Riprovandolo il 12-08-2026, l'endpoint ora verifica la raggiungibilità e fa fallire il lavoro gratuitamente con un errore nominato, content[1].image_url: media not found (HTTP 404). Quel buco specifico è chiuso. Il buco degli input mutuamente esclusivi non lo è. Per il calcolo dei crediti per clip, Crediti MiniMax H3 per video ha le tabelle.
Di Chi è il Volto, Di Chi è la Voce: Controlla Questo Prima di Caricare un Riferimento
Questo endpoint è diverso dal text-to-video in un modo legalmente rilevante: tu fornisci la somiglianza. Un'immagine di riferimento di una persona reale, un clip di riferimento dal film di qualcuno, un riferimento vocale in una voce riconoscibile, tutto è materiale per il quale stai affermando di avere il diritto di utilizzare. Le regole sui contenuti lato modello si applicano comunque in aggiunta, e sono più severe sulle persone reali che su quelle inventate. Due guide che vale la pena leggere prima che un cliente veda l'output: Restrizioni sui contenuti di MiniMax H3 e la suddivisione uso commerciale e licenze, che copre anche le esclusioni territoriali nei termini di MiniMax.
MiniMax H3 Reference to Video: Domande Frequenti
MiniMax H3 reference to video può mantenere lo stesso personaggio in due inquadrature diverse?
Sì, e il mio test a due inquadrature sopra regge attraverso un'inversione di illuminazione completa da notte a mattina. Ma una sola immagine del personaggio non è ciò che lo fa. Lo schema affidabile è passare l'URL di output dell'inquadratura precedente come video di riferimento insieme all'immagine del personaggio, in modo che la seconda chiamata erediti gradazione e grana oltre all'identità.
Posso usare un'immagine di primo fotogramma e riferimenti nella stessa chiamata MiniMax H3 reference to video?
No, e la modalità di fallimento è il problema. Inviare sia image che refers non genera errore. Testato il 12-08-2026, il lavoro è stato completato in 115 secondi, ha addebitato $0,40 e ha scartato silenziosamente uno dei due input. La stessa cosa accade al contrario sull'endpoint image-to-video. Scegli un percorso per chiamata.
Posso inviare un file audio da solo come riferimento MiniMax H3 reference to video?
No. L'audio deve viaggiare con almeno un'immagine o video di riferimento, e l'endpoint lo applica con un errore esplicito: reference-to-video requires at least one reference image or video. Arriva in fase di generazione, non all'invio, e il lavoro rifiutato è gratuito. I riferimenti audio devono anche stare tra 2 e 15 secondi, 15 secondi in totale, ed essere dichiarati audio/mp3 piuttosto che audio/mpeg.
MiniMax H3 reference to video addebita un extra per ogni file di riferimento?
Non su Atlas Cloud. Un'esecuzione con dieci immagini di riferimento e una con una hanno fatturato gli identici $0,40 a 768P e 4 secondi, quindi il contatore traccia solo secondi di output e risoluzione. Nota la contraddizione però: le regole di MiniMax menzionano il video di input misurato alla tariffa di output, e altre piattaforme espongono una voce separata per le immagini di riferimento. Verifica sulla superficie attraverso cui stai fatturando.
Cosa succede se uno dei miei URL MiniMax H3 reference to video è rotto?
A partire dal 12-08-2026, l'endpoint convalida la raggiungibilità e fa fallire l'intero lavoro gratuitamente, con content[1].image_url: media not found (HTTP 404) dopo circa 21 secondi. Questo è un cambiamento: all'inizio di agosto la stessa richiesta veniva completata, ignorava silenziosamente il riferimento mancante e addebitava il prezzo intero. Non dare per scontato che i vecchi rapporti sul comportamento siano ancora validi e controlla il campo status piuttosto che presumere che un 200 all'invio significhi qualcosa.
MiniMax H3 reference to video è davvero il miglior modello per questo?
Sull'unico confronto diretto pubblico che lo misura, sì, di poco. MiniMax H3 guida la classifica dell'editing video con Elo 1.125 su 10.280 voti, ma il suo intervallo di rango elencato è da 1 a 2 e Gemini Omni Flash è a 3 punti Elo di distanza con un intervallo sovrapposto. Trattalo come "miglior disponibile congiuntamente", scegli in base al resto del flusso di lavoro e leggi Alternative a MiniMax H3 se il pareggio è importante per te.






