
Una suite di color grading notturna, sei monitor che mostrano sei diverse inquadrature della stessa cantante dai capelli argentei. Sei inquadrature, un'artista, una canzone. Generato con openai/gpt-image-2/text-to-image.
Gli utenti di Suno generano circa 7 milioni di canzoni al giorno, più o meno l'intero catalogo Spotify ogni due settimane (TechCrunch, febbraio 2026). Quasi nessuna di queste avrà mai un'immagine associata. Non perché l'immagine sia impossibile, ma perché il percorso tradizionale passa attraverso quattro strumenti: genera immagini fisse, animale, esegui un passaggio separato di sincronizzazione labiale, poi sistema tutto in montaggio. Ogni salto perde il volto, il guardaroba o il ritmo.
Così ho saltato i passaggi. Ho inserito una fetta da 8 secondi di un ritornello direttamente nello slot di riferimento di un modello video e ho premuto Esegui. Non mi ha addebitato nulla per l'audio.
Poi ho smontato l'mp4 risultato per rispondere all'unica domanda a cui nessuno su internet risponde in modo chiaro: il suono che esce dal modello è la mia canzone, o qualcosa che ha inventato e che suona solo simile? L'ho misurato. La risposta non è quella che mi aspettavo, e cambia il modo in cui dovresti tagliare il video.
Punti chiave
- L'audio di riferimento è gratuito. MiniMax H3 addebita solo i secondi di output. Le mie quattro fette di riferimento da 8 secondi hanno aggiunto $0.00 al conto. Il video di riferimento è quello costoso.
- 15 secondi sono un limite per generazione, non per progetto. Taglia la canzone, scatta una fetta per inquadratura, concatena. Il mio montaggio da 32 secondi è composto da quattro generazioni.
- Scrivi il ritornello a 120 BPM. Una battuta corrisponde esattamente a 2.000 secondi, quindi i valori di
durationin secondi interi di H3 cadono sulle linee di battuta senza bisogno di regolazioni manuali. 8s = 4 battute.- L'audio in output è la tua traccia, allineato al campione. Ho misurato una correlazione di forma d'onda di 0,892 a lag zero tra il mio input e il mix stereo fornito da H3. Non è rigenerato. Dovrai comunque sovrapporre il master per il montaggio finale, per un motivo diverso (sotto).
- Spesa reale totale: $7.53 su nove generazioni, inclusi i fallimenti. Le quattro inquadrature che hanno composto il taglio finale, più la canzone e il fotogramma base, sono costate $4.80.
Il Video Musicale MiniMax H3 che ho Montato da un Ritornello di 32 Secondi
Attiva l'audio. Queste sono quattro generazioni separate, concatenate senza transizioni, con il master originale da 32 secondi sovrapposto.
TfrOvWHf4ys
"MIRA", 32 secondi, 2560x1440, 24 fps. Quattro generazioni minimax/h3/reference-to-video da 8 secondi ciascuna, $1.12 per inquadratura. La canzone è stata inserita come audio di riferimento ed è costata $0.00.
Quattro generazioni, quattro mondi di illuminazione completamente diversi, un solo volto. Niente è stato ritoccato tra di loro.

Quattro fotogrammi dalle quattro inquadrature che mostrano la stessa cantante su un tetto al neon, un'autostrada nel deserto, uno studio bianco e una vasca d'acqua nera. Un fotogramma estratto da ogni clip consegnata. Stessi capelli, stessa maglia a rete, stesso collare LED rosso attraverso pioggia, sole basso, alta chiave piatta e sott'acqua.
Perché la maggior parte dei tentativi di video musicali con MiniMax H3 fallisce al sedicesimo secondo
Tre modalità di fallimento, tutte evitabili.
Uno: considerare 15 secondi come il limite del progetto. H3 limita una singola generazione a 15 secondi. La gente lo legge, conclude "niente video musicali" e molla. Ma un video musicale non è mai stato una singola inquadratura. Quello vero taglia ogni 4-8 secondi comunque. Il limite ti costringe solo a fare ciò che un editor avrebbe fatto comunque.
Due: descrivere il ritmo a parole. "Allegro, energico, ballare a ritmo" non dà nulla al modello da agganciare. Inventa un tempo, e i tuoi punti di taglio cadono fuori ritmo per sempre. Fornire l'audio effettivo elimina le supposizioni.
Tre: lasciare che il guardaroba vari. Ogni inquadratura ha bisogno della stessa immagine di riferimento e della stessa descrizione testuale del guardaroba, identica. Cambiare "maglia a rete nera" in "camicia a rete scura" tra le inquadrature e ottieni una persona diversa.
Ecco cosa ti costano effettivamente le due strade:
| Catena tradizionale a quattro strumenti | Singola chiamata di riferimento H3 | |
|---|---|---|
| Strumenti per inquadratura | Modello immagine, modello video, strumento lip-sync, NLE | Un endpoint, poi un NLE alla fine |
| Passaggi manuali per inquadratura | 4 passaggi, 3 esportazioni di file | 1 invio |
| Cosa mantiene il personaggio | Re-prompting manuale e fortuna | Un'immagine di riferimento riutilizzata identica |
| Immagine e suono | Rendering separati, allineamento successivo | Generati nello stesso passaggio, stereo 32 kHz |
| Costo per inquadratura da 8 secondi | Quattro contatori separati | $1.12 a 2K, $0.80 a 768P |
Per essere equi con la vecchia strada: non è una fantasia. Il creatore giapponese Arata Fukoe ha vinto un bronzo al Project Odyssey con un video musicale completamente AI, e sia i Queen che i Linkin Park hanno pubblicato video ufficiali assistiti da AI. Quelle catene usavano però quattro o cinque strumenti, che è esattamente ciò che un artista indipendente con una sola canzone non ha tempo di fare.
Cosa compra effettivamente l'audio di riferimento per un video musicale MiniMax H3
Questa è la parte che vale la pena capire prima di spendere qualcosa.
H3 genera immagine e suono in un unico passaggio, invece di doppiare l'audio su fotogrammi già pronti. Quando gli fornisci una traccia di riferimento, questa non è una nota di umore. Ho confrontato la mia fetta di input con il flusso audio all'interno dell'mp4 consegnato, a livello di forma d'onda, su un downmix mono a 8 kHz:
- Correlazione dell'inviluppo: 0.956 a lag zero
- Correlazione grezza della forma d'onda su una finestra di 2 secondi: 0.892 a offset di campione zero
Non è un modello che riproduce una canzone simile. È il tuo file, allineato al campione, con l'atmosfera richiesta dal prompt sovrapposta e una codifica AAC in più. Per confronto, la stessa misurazione su una ripresa di controllo generata senza audio di riferimento è risultata 0.26, che è il rumore di fondo.

Forma d'onda della fetta di input sopra, audio H3 consegnato sotto, allineati a offset zero_Sopra: l'mp3 da 8 secondi che ho caricato. Sotto: il flusso audio all'interno dell'mp4 restituito da H3. Stessi picchi, stesse posizioni, nessun offset._
I limiti di input sono severi e vengono applicati al momento dell'invio anziché in silenzio:
| Input di riferimento | Limite | Addebitato |
|---|---|---|
| Immagini | fino a 9 | gratuito sugli endpoint H3 di Atlas Cloud |
| Video | fino a 3, ciascuno 2-15s | addebitato alla tariffa di output |
| Audio | fino a 3, ciascuno 2-15s, 15s totali tra tutti i clip | $0.00 |
| Solo audio | rifiutato, necessita almeno un'immagine o video | n/d |
Ho testato volutamente il limite totale di audio inviando tre fette da 8 secondi in una sola chiamata. È fallita in 5,8 secondi con invalid params, total audio duration 24138 ms exceeds 15000 ms e non è stata addebitata. Buona notizia: H3 non elimina silenziosamente il file extra e ti addebita comunque.
Un'altra trappola in cui sono incappato prima. Se passi l'audio come URL di dati base64, il tipo MIME decide l'estensione che l'API deduce. data:audio/mpeg viene rifiutato con audio format ".mpeg" not allowed. data:audio/mp3 passa. Quattro invii sono morti per questo prima che me ne accorgessi, tutti gratuiti.
Il flusso di lavoro per video musicali MiniMax H3, e quanto costa ogni secondo
Tutto ciò che segue passa attraverso una chiave API su Atlas Cloud, dove ho eseguito e fatturato tutto. Tre modelli, una scheda del browser.
| Passaggio | Modello | Cosa fa | Prezzo effettivamente addebitato |
|---|---|---|---|
| Scrivi il ritornello | minimax/music-2.6 | Canzone completa da un prompt di stile più testo, mp3 fino a ~5 min | $0.15 per canzone, fisso |
| Blocca l'artista | openai/gpt-image-2/text-to-image | Un fotogramma base che ogni inquadratura eredita | $0.1745 a qualità alta, 2048x1152 |
| Scatta ogni inquadratura | minimax/h3/reference-to-video | Immagine più audio in ingresso, clip bloccata sul ritmo con audio stereo in uscita | $0.14/s a 2K, $0.10/s a 768P. Audio in ingresso $0.00 |
Due note su quella tabella, perché i numeri elencati mentono in entrambe le direzioni. GPT Image 2 mostra un minimo di $0.009 nel catalogo; è il livello token più basso, e un render high reale a 2048x1152 costa $0.1745. La voce di catalogo di H3 mostra $0.10, che è solo il livello 768P; i miei lavori da 8 secondi a 2K sono stati addebitati esattamente $1.12 ciascuno, che è $0.14 al secondo.
Se vuoi un blocco del primo fotogramma invece di riferimenti al soggetto, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) ha le stesse tariffe, e [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) copre le inquadrature puramente testuali.
La correzione che vale la pena fare: una versione precedente di questo piano presupponeva che dovessi portare la tua canzone perché non c'era un generatore di canzoni complete sulla piattaforma. Ora ce n'è uno. minimax/music-2.6 scrive la traccia, quindi l'intera catena, canzone inclusa, funziona in un unico posto.
Come realizzare un video musicale MiniMax H3, passo dopo passo
Passaggio 1: Scrivi un ritornello a 120 BPM e taglialo in fette per inquadratura
Chiedi esplicitamente 120 BPM. A 120 BPM una battuta è esattamente 2.000 secondi, quindi l'enum duration in secondi interi di H3 cade sulle linee di battuta gratuitamente: 4s = 2 battute, 6s = 3 battute, 8s = 4 battute, 10s = 5 battute. I tuoi tagli cadono sul battere senza che tu tocchi un singolo marker.
Modello: minimax/music-2.6. Impostazioni: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.
Prompt di stile:
plaintext1Synth-pop a esattamente 120 BPM, cassa dritta quattro sul pavimento, pad analogici 2luminosi sidechainati, voce femminile pulita in primo piano nel mix, ritornello 3stereo ampio, niente rap, vocali aperte sostenute, cinematografico e leggermente 4malinconico, master pronto per la radio
Testo:
plaintext1[Ritornello] 2Tieni la linea, tieni la luce 3Sto esaurendo la notte 4Pronuncia il mio nome nella pioggia 5E brucerò di nuovo
Ha restituito una traccia di 70 secondi in 75 secondi per $0.15. Poi ho controllato il tempo invece di fidarmi, eseguendo un'autocorrelazione di novità di attacco sul file. Il lag più forte è risultato esattamente 0.500 s, che è 120 BPM, e la griglia del beat inizia a 0.24 s nel file decodificato anziché a zero. Quell'offset è importante: taglia da 0.24 e ogni fetta inizia su un battere.
plaintext1# Master da 32 secondi, che inizia sul battere a 0.24s 2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3 3 4# quattro fette da 8 secondi, una per inquadratura, ciascuna 4 battute e ben sotto il limite di 15s 5for i in 0 8 16 24; do 6 ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3 7done
Se hai già la tua traccia, salta completamente questo passaggio. È il caso normale, ed è il più economico.
Passaggio 2: Blocca l'artista con un fotogramma base di GPT Image 2
Ogni inquadratura fa riferimento a questo singolo file. Qualunque cosa sia sbagliata qui è sbagliata quattro volte, quindi spendi $0.17 e guardalo bene.
Modello: openai/gpt-image-2/text-to-image. Impostazioni: quality high , size 2048x1152 (16:9).
plaintext1Fermo cinematografico per video musicale, ritratto a mezzo busto. Una cantante 2synth-pop femminile dell'Asia orientale di 25 anni con capelli corti argentei e 3frangia dritta, una maglia a rete nera opaca, un sottile collare LED rosso che 4brilla contro la sua clavicola, e un singolo orecchino a cuffia d'argento. Si 5trova su un tetto bagnato dalla pioggia di notte, tenendo un microfono a mano 6cromato vintage vicino alla bocca. Dietro di lei, insegne al neon magenta e 7ciano fuori fuoco, pioggia sottile catturata da un controluce duro, vapore che 8si alza da uno sfiato. Scattato con anamorfico 35mm, profondità di campo ridotta, 9gradazione teal-e-magenta, grana visibile. Il suo viso è nitido e illuminato 10uniformemente da una luce morbida da sinistra. Nessun testo nell'inquadratura.

Il fotogramma base generato: cantante dai capelli argentei con microfono cromato su un tetto al neon bagnato dalla pioggia_Il fotogramma base che ogni inquadratura successiva eredita. Generato con_ openai/gpt-image-2/text-to-image , qualità alta, 2048x1152, addebitato $0.1745.

GPT Image 2 che esegue questo stesso prompt nel playground di Atlas Cloud con il fotogramma finito nel pannello di output
Lo stesso prompt nel playground: Dimensione 16:9 a 2048x1152, Qualità alta, e il pulsante Esegui che mostra $0.1745, che è ciò che l'API mi ha effettivamente addebitato. Il $0.009 del catalogo è il livello token più basso, non questo. Stesso prompt, seed diverso, quindi questo render non è il file esatto sopra.
Le parole del guardaroba in quel prompt (capelli corti argentei, maglia a rete nera opaca, collare LED rosso, orecchino a cuffia d'argento) vengono riutilizzate identiche in ogni prompt successivo. Quella ripetizione è l'intero meccanismo di coerenza. Non parafrasarlo.
Passaggio 3: Esegui la prima inquadratura del video musicale MiniMax H3 con audio di riferimento gratuito
Modello: minimax/h3/reference-to-video. Impostazioni: refers = il fotogramma base più slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.
Imposta ratio esplicitamente. Il default del playground è adaptive, e l'endpoint è molto più contento quando nomini la forma che desideri.
plaintext1Inquadratura per video musicale. La donna nell'immagine di riferimento canta la 2traccia di riferimento dritta verso l'obiettivo sul tetto umido al neon, tenendo 3il microfono cromato alla bocca. Pronuncia la prima linea con forza sul battere, 4occhi fissi alla telecamera, poi inclina la testa all'indietro sulla nota 5sostenuta. Lento avvicinamento da mezzo busto a un primo piano stretto negli 6otto secondi, micro-deriva a mano libera, strisce di pioggia che attraversano il 7controluce duro. I movimenti della sua bocca seguono esattamente le vocali 8cantate dell'audio di riferimento, sta cantando, non parlando. Stessi capelli 9corti argentei, maglia a rete nera opaca e collare LED rosso luminoso 10dell'immagine di riferimento. Paesaggio sonoro: la traccia di riferimento in 11stereo, più una leggera pioggia e un lontano ronzio cittadino basso nel mix.
7sPeYEe-xII
Inquadratura 1, audio attivo. 2560x1440, 8.00 s esatti, 24 fps, stereo 32 kHz. 345 secondi dall'invio al file, addebitato $1.12. Guarda l'inclinazione della testa all'indietro sulla nota sostenuta intorno ai 5 s.

Il playground reference-to-video con il fotogramma base e la fetta audio caricati e il clip finito nel pannello di output
Materiali di Riferimento mostra 2/9: slice-0.mp3 in uno slot, il fotogramma base nell'altro. Risoluzione 2K, Durata 8, e il pulsante Esegui che mostra $1.12, che è esattamente 8 x $0.14. Nota il menu a tendina Aspect Ratio su adaptive , che è il default della pagina; le mie chiamate API impostavano ratio esplicitamente a 16:9.
Un numero che vale la pena annotare: duration: 8 ha restituito un contenitore di esattamente 8.00 secondi. duration: 4 ha restituito 4.46 secondi. Se prevedi di concatenare sulle linee di battuta, attieniti alle durate che tornano esatte.
Passaggio 4: Scatta altre tre inquadrature senza perdere il volto
Stesso fotogramma base, stessa frase sul guardaroba, fetta audio successiva. Tutto il resto cambia.
4a. Autostrada nel deserto all'ora d'oro. refers = fotogramma base + slice-8.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Inquadratura per video musicale. La stessa donna dell'immagine di riferimento si 2trova sulla linea centrale di un'autostrada deserta vuota all'ora d'oro, senza 3microfono, una giacca di jeans indaco aperta sopra la stessa maglia a rete nera 4opaca, il collare LED rosso ancora acceso. Muove la bocca sulle parole del 5ritornello della traccia di riferimento contro il vento mentre la telecamera 6arretra bassa sull'asfalto. Tremolio di calore dalla strada, polvere che si 7solleva, la sua ombra che si allunga verso l'obiettivo, un bagliore anamorfico 8che attraversa a metà corsa. Capelli, viso e guardaroba identici all'immagine 9di riferimento. Paesaggio sonoro: la traccia di riferimento sopra il vento 10aperto del deserto, ampia e ariosa.
4XEki-v2vCU
Inquadratura 2, audio attivo. Stesso volto, temperatura di colore opposta, e la traccia di riferimento rimixata sotto il vento aperto. 332 s, $1.12.
4b. Cove bianco infinito. refers = fotogramma base + slice-16.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Inquadratura per video musicale. La stessa donna dell'immagine di riferimento in 2uno studio a cove infinito bianco puro sotto luce piatta ad alta chiave senza 3ombre, che indossa un impermeabile di vinile rosso lucido sopra la stessa maglia 4a rete nera opaca, collare LED rosso visibile al colletto. Balla quattro battute 5sulla traccia di riferimento, i capelli argentei che sferzano ad ogni giro. 6Inquadratura fissa ampia, poi uno zoom rapido a un medio sul secondo battere. 7Piccoli quadrati di carta bianca cadono come coriandoli negli ultimi due secondi. 8Viso e capelli identici all'immagine di riferimento. Paesaggio sonoro: la traccia 9di riferimento, secca e ravvicinata, più lo scricchiolio delle scarpe sul 10pavimento dello studio.
VAyqdkVpnm0
Inquadratura 3, audio attivo. La luce piatta senza ombre è il posto più difficile per nascondere un cambio di volto, e ha retto. 8.00 s, $1.12.
4c. Sott'acqua, b-roll, senza sincronizzazione labiale. refers = fotogramma base + slice-24.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Inquadratura per video musicale. La stessa donna dell'immagine di riferimento 2sospesa sott'acqua in una vasca nera, i capelli argentei che fluttuano intorno a 3lei, il collare LED rosso che brilla attraverso l'acqua, la maglia a rete nera 4che ondeggia lentamente. Un fascio di luce duro dall'alto; bolle che salgono 5oltre l'obiettivo al rallentatore. Apre gli occhi sul battere e allunga una mano 6verso la superficie. Non canta e la sua bocca rimane chiusa. La telecamera ruota 7di trenta gradi intorno a lei nell'inquadratura. Viso identico all'immagine di 8riferimento. Paesaggio sonoro: la traccia di riferimento sentita sopra la 9superficie, ovattata e con un filtro passa-basso, con transienti di bolle.
fibdweUMRpY
Inquadratura 4, audio attivo. L'istruzione "non canta e la sua bocca rimane chiusa" è stata rispettata, che è la parte utile: l'audio di riferimento guida il tempismo, non una performance obbligatoria. 329 s, $1.12.
Passaggio 5: Esegui la ripresa di controllo, con lo slot audio vuoto
Stesso prompt del Passaggio 3, parola per parola. L'unica modifica: refers contiene l'immagine e nient'altro. 768P, duration: 8.
Questo singolo clip spiega l'intero meccanismo meglio di qualsiasi paragrafo. Ascoltalo rispetto al Passaggio 3.
FAoPplGmKJc
La ripresa di controllo. Prompt identico, nessun audio di riferimento, 1344x768, 8.00 s, 200 s, $0.80. H3 ha scritto la propria colonna sonora, e la performance è generica "qualcuno sta cantando" piuttosto che queste parole.
Misurata rispetto al mio master, l'audio di controllo ha ottenuto una correlazione dell'inviluppo di 0.26. Quella del Passaggio 3 ha ottenuto 0.956. Quel divario è ciò che lo slot audio gratuito ti compra.
Passaggio 6: Rompi la sincronizzazione labiale apposta
Ogni modello ha un soffitto di sillabe. Trovare il tuo costa $0.40.
Ho generato una traccia rap separata a doppio tempo (minimax/music-2.6 di nuovo, $0.15), ho tagliato una fetta da 4 secondi con circa sei sillabe al secondo, e l'ho inserita nella stessa ambientazione sul tetto a 768P, duration: 4.
plaintext1Inquadratura per video musicale. La donna nell'immagine di riferimento rappa la 2traccia di riferimento dritta verso l'obiettivo sul tetto umido al neon, tenendo 3il microfono cromato alla bocca, pronunciando ogni sillaba del verso rap veloce a 4doppio tempo. Primo piano medio fisso, leggera deriva a mano libera, strisce di 5pioggia nel controluce duro. I movimenti della sua bocca seguono esattamente le 6sillabe rappate dell'audio di riferimento. Stessi capelli corti argentei, maglia 7a rete nera opaca e collare LED rosso luminoso dell'immagine di riferimento. 8Paesaggio sonoro: la traccia di riferimento in stereo più una leggera pioggia.
jiQVCjOCbKg
Il test di stress, audio attivo. 1344x768, 4.46 s, 192 s, $0.40. La bocca rimane attiva e a tempo, ma smette di risolvere le singole consonanti e si stabilizza in un ciclo ripetitivo di apertura-chiusura. Le linee cantate ottengono forme vocaliche distinte; questo no.
La mia lettura onesta dai file consegnati: le vocali sostenute cantate sono dove il lavoro della bocca di H3 è genuinamente convincente, e le consonanti rappate dense sono dove degrada in movimento plausibile. Pianifica i tuoi primi piani intorno alle linee cantate e metti le battute veloci su b-roll. Ci sono più dettagli sulla differenza tra parlato e canto nella analisi di sincronizzazione labiale e audio.
Passaggio 7: Cuci, silenzia e sovrapponi il master al tuo video musicale MiniMax H3
Quattro clip di esattamente 8.00 secondi si concatenano in esattamente 32.00 secondi, che sono 16 battute a 120 BPM. Nessun taglio.
plaintext1# 1. rimuovi l'audio da ogni clip 2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do 3 ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4 4done 5 6# 2. concatena in ordine di battuta (4 x 8s = 32s = 16 battute @ 120 BPM) 7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt 8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4 9 10# 3. sovrapponi il master originale 11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4
Perché preoccuparsi di silenziare, se il modello restituisce già la tua traccia? Perché il mix stereo di ogni clip porta l'atmosfera che il prompt di quella clip ha richiesto: pioggia nell'inquadratura 1, vento del deserto nell'inquadratura 2, un filtro passa-basso subacqueo nell'inquadratura 4. Piacevole per inquadratura, incoerente attraverso un taglio. Il master ti dà un mix continuo a bitrate pieno senza ricodifica per inquadratura. H3 fornisce la sincronizzazione della performance. Il tuo master fornisce la canzone.
Quattro varianti della ricetta per video musicali MiniMax H3
Tagli verticali per i social. Imposta ratio: 9:16 e ottieni una fetta per Spotify Canvas o Shorts dallo stesso fotogramma base e dalle stesse fette. È tornato un vero 768x1344, quindi a differenza del menu a tendina aspect nel playground, il valore ratio dell'API rimane. I loop di Canvas sono silenziosi per progettazione, quindi questo viene spedito come GIF.

Un loop verticale 9:16 tagliato della stessa artista sul tetto al neon_Stesso fotogramma base, stessa fetta di riferimento,_ ratio: 9:16 a 768P per $0.80. Una piccola stranezza onesta: ho chiesto "non cantare" e ho ottenuto comunque canto. Con una voce nello slot di riferimento, l'audio vince la discussione. Se vuoi un interprete silenzioso, fornisci una fetta strumentale.
Video di riferimento invece di immagine di riferimento. Puoi dare a H3 fino a tre clip video di riferimento per trasportare movimento e inquadratura invece di descriverli. Attenzione al contatore: il video di riferimento viene addebitato alla tariffa di output, mentre l'audio di riferimento è gratuito. Questa asimmetria è il singolo dato di prezzo più utile su questo endpoint.
Visualizzatori b-roll puri. Elimina completamente l'interprete. Fornisci una foto del prodotto, un oggetto di copertina dell'album o una texture più la fetta audio, e richiedi solo movimento della telecamera. Nessun volto da mantenere, nessuna sincronizzazione labiale da rompere, e puoi scattare tutto a 768P.
Boozza a buon mercato, finitura costosa. 768P è $0.10/s contro $0.14/s del 2K, ed entrambi tornano con stereo a 32 kHz identico, quindi la performance che stai giudicando è la stessa. Il risparmio non è nei bocconi buoni, è nei rifiuti: ogni ripresa fallita da 8 secondi costa $0.80 invece di $1.12. Lavora a 768P finché la ripresa non è giusta, poi paga $1.12 una volta sola. Su una inquadratura che richiede tre tentativi, sono $2.72 invece di $3.36. Ulteriori informazioni sulla differenza di livello nel confronto 768P vs 2K, e su quanto può durare un singolo clip nella guida alla lunghezza dei clip.
Quanto è costato effettivamente un video musicale MiniMax H3 completo
Ogni riga qui sotto è una cifra reale addebitata, estratta dal record di previsione dopo il completamento, non un prezzo di listino.
| Voce | Modello e impostazioni | Addebitato |
|---|---|---|
| Ritornello, canzone da 70 s | minimax/music-2.6, mp3 44.1 kHz | $0.15 |
| Fotogramma base dell'artista | openai/gpt-image-2/text-to-image, high, 2048x1152 | $0.17 |
| Inquadratura 1, tetto al neon | minimax/h3/reference-to-video, 2K, 8 s | $1.12 |
| Inquadratura 2, autostrada deserto | stesso, 2K, 8 s | $1.12 |
| Inquadratura 3, cove bianco | stesso, 2K, 8 s | $1.12 |
| Inquadratura 4, subacquea | stesso, 2K, 8 s | $1.12 |
| Subtotale video finito | $4.80 | |
| Sonda di validazione | 768P, 4 s | $0.40 |
| Ripresa di controllo, senza audio | 768P, 8 s | $0.80 |
| Traccia rap per il test di stress | minimax/music-2.6 | $0.15 |
| Test di stress lip-sync | 768P, 4 s | $0.40 |
| Taglio verticale per Canvas | 768P, 8 s, 9:16 | $0.80 |
| Immagine hero per questo articolo | openai/gpt-image-2/text-to-image, high | $0.17 |
| Test oltre limite, 24 s di audio | rifiutato all'invio | $0.00 |
| Quattro invii con MIME audio sbagliato | rifiutati all'invio | $0.00 |
| Audio di riferimento, 4 x 8 s | input gratuito | $0.00 |
| Spesa totale | $7.53 |
Sono $9.00 al minuto finito a 2K sulle inquadrature che hanno composto il taglio, prima di qualsiasi mio errore. Scattato interamente a 768P, lo stesso minuto costa $6.61. Una troupe umana per video musicali non cita nessuno di questi numeri.
Due note operative se stai pianificando un pezzo più lungo. I rifiuti all'invio sono gratuiti, quindi i parametri sbagliati ti costano tempo e nient'altro. E il campo price su una previsione viene popolato con un ritardo, quindi interroga di nuovo l'ID della richiesta dopo che il file viene scaricato se vuoi una fattura reale anziché un null.
Di chi è la canzone, di chi è il volto: cosa controllare prima di pubblicare
Breve, perché è importante e non ha bisogno di una predica.
Devi avere i diritti sulla traccia di riferimento. Input gratuito non significa liberatoria gratuita. Inserire un singolo commerciale come audio di riferimento e poi pubblicare ciò che esce è la via rapida per un takedown. La tua registrazione, una traccia commissionata o qualcosa che hai generato va bene.
Non costruire il fotogramma base dal volto di un artista reale vivente. Il meccanismo di coerenza qui è molto bravo a mantenere un volto attraverso le inquadrature, il che è esattamente il motivo per cui puntarlo a una persona reale è una cattiva idea.
Pesi aperti e accesso API sono due licenze diverse. MiniMax ha pubblicato i pesi di H3 su Hugging Face ad agosto 2026, e la sua licenza comunitaria esclude attualmente UE, Regno Unito, Corea del Sud e Stati Uniti, con un canale di licenza formale aperto per quei territori. Quella restrizione si applica all'esecuzione dei pesi da soli. Chiamare il modello attraverso un'API ospitata è una relazione di servizio e non ti mette sotto la licenza dei pesi. Vale la pena sapere in quale situazione ti trovi prima di assumere qualcosa.
Per una visione più ampia di dove si colloca H3 rispetto alle alternative, c'è un confronto con Seedance 2.5 e una guida alla struttura del prompt. Per contesto sul perché ne vale la pena: nella classifica di editing video che valuta i modelli con audio, H3 attualmente è primo con 1.126 Elo, davanti a Gemini Omni Flash con 1.119 e Dreamina Seedance 2.0 con 1.027 (Artificial Analysis, controllato il 10 agosto 2026). Quei punteggi cambiano con i voti, quindi trattali come un'istantanea.
Video musicale MiniMax H3: domande frequenti
Un video musicale MiniMax H3 può durare tre minuti interi?
Non in una singola generazione. Una singola chiamata ha un limite di 15 secondi. Ma questo è un limite per generazione, non per progetto. Un video di tre minuti a 8 secondi per inquadratura sono 23 generazioni, circa $25.76 a 2K, e ognuna cade su una linea di battuta se la tua traccia è a 120 BPM. Taglia, scatta, concatena, sovrapponi il master.
Un video musicale MiniMax H3 usa la mia canzone reale, o il modello rigenera l'audio?
Usa la tua canzone reale. Ho misurato una correlazione di forma d'onda grezza di 0.892 a offset di campione zero tra l'mp3 da 8 secondi che ho caricato e il flusso audio all'interno dell'mp4 restituito, con l'atmosfera richiesta dal prompt sovrapposta. Una ripresa di controllo generata senza audio di riferimento ha ottenuto 0.26 rispetto allo stesso master. Dovresti comunque sovrapporre il tuo master sulla concatenazione finale, perché ogni clip porta la propria atmosfera per inquadratura e la propria codifica AAC, che non sopravvivono a un taglio pulito.
Inserire una canzone in un video musicale MiniMax H3 costa extra?
No. Le mie quattro fette di riferimento da 8 secondi hanno aggiunto $0.00 a un conto di $4.48 per le inquadrature. Il video di riferimento è quello da tenere d'occhio, perché viene addebitato alla tariffa di output. I limiti sono tre clip audio, da 2 a 15 secondi ciascuno, 15 secondi totali, e l'audio non può mai essere l'unico riferimento.
Quanto è buona la sincronizzazione labiale di MiniMax H3 per il canto rispetto al parlato?
Le vocali sostenute cantate sono il suo punto di forza: forme della bocca distinte, tenute che corrispondono alla nota, e l'inclinazione all'indietro su una nota lunga sembra una performance piuttosto che un loop. La dizione densa è dove cede. Il mio test rap a sei sillabe al secondo ha mantenuto il ritmo ma ha smesso di risolvere le consonanti e si è stabilizzato in un ciclo ripetitivo di apertura-chiusura. Metti le battute veloci su b-roll.
Come faccio a mantenere lo stesso volto in ogni inquadratura di un video musicale MiniMax H3?
Tre cose, tutte noiose. Un'immagine di riferimento riutilizzata in ogni chiamata, mai rigenerata. La stessa descrizione del guardaroba copiata identica tra i prompt, non parafrasata. E una clausola esplicita "identica all'immagine di riferimento" in ogni prompt. Le mie quattro inquadrature hanno attraversato pioggia, sole basso, alta chiave piatta e sott'acqua senza derivazioni.
Quanto costa un video musicale MiniMax H3 al minuto finito?
$9.00 al minuto finito a 2K, basato sul mio conto reale di $4.80 per un taglio di 32 secondi. Scattato interamente a 768P, lo stesso minuto costa $6.61, e 768P fornisce lo stesso stereo a 32 kHz, quindi la performance che stai giudicando è identica. Lavora i tuoi rifiuti a $0.80 e paga $1.12 solo sulla ripresa che sopravvive al montaggio.






