Seedance 2.5 è ora live — In anteprima su Atlas Cloud

Ho realizzato un video musicale MiniMax H3 da un hook di 32 secondi per $4.80. La traccia audio mi ha sorpreso.

Ho inserito un hook di 32 secondi in MiniMax H3 come audio di riferimento gratuito, ho ricevuto quattro riprese allineate al beat, e ho montato un vero video musicale MiniMax H3 per $4,80\. Prompt e fatture inclusi.

Un editor video che lavora a una console con più monitor video

Una suite di color grading notturna, sei monitor che mostrano sei diverse inquadrature della stessa cantante dai capelli argentei. Sei inquadrature, un'artista, una canzone. Generato con openai/gpt-image-2/text-to-image.

Gli utenti di Suno generano circa 7 milioni di canzoni al giorno, più o meno l'intero catalogo Spotify ogni due settimane (TechCrunch, febbraio 2026). Quasi nessuna di queste avrà mai un'immagine associata. Non perché l'immagine sia impossibile, ma perché il percorso tradizionale passa attraverso quattro strumenti: genera immagini fisse, animale, esegui un passaggio separato di sincronizzazione labiale, poi sistema tutto in montaggio. Ogni salto perde il volto, il guardaroba o il ritmo.

Così ho saltato i passaggi. Ho inserito una fetta da 8 secondi di un ritornello direttamente nello slot di riferimento di un modello video e ho premuto Esegui. Non mi ha addebitato nulla per l'audio.

Poi ho smontato l'mp4 risultato per rispondere all'unica domanda a cui nessuno su internet risponde in modo chiaro: il suono che esce dal modello è la mia canzone, o qualcosa che ha inventato e che suona solo simile? L'ho misurato. La risposta non è quella che mi aspettavo, e cambia il modo in cui dovresti tagliare il video.

Punti chiave

  • L'audio di riferimento è gratuito. MiniMax H3 addebita solo i secondi di output. Le mie quattro fette di riferimento da 8 secondi hanno aggiunto $0.00 al conto. Il video di riferimento è quello costoso.
  • 15 secondi sono un limite per generazione, non per progetto. Taglia la canzone, scatta una fetta per inquadratura, concatena. Il mio montaggio da 32 secondi è composto da quattro generazioni.
  • Scrivi il ritornello a 120 BPM. Una battuta corrisponde esattamente a 2.000 secondi, quindi i valori di duration in secondi interi di H3 cadono sulle linee di battuta senza bisogno di regolazioni manuali. 8s = 4 battute.
  • L'audio in output è la tua traccia, allineato al campione. Ho misurato una correlazione di forma d'onda di 0,892 a lag zero tra il mio input e il mix stereo fornito da H3. Non è rigenerato. Dovrai comunque sovrapporre il master per il montaggio finale, per un motivo diverso (sotto).
  • Spesa reale totale: $7.53 su nove generazioni, inclusi i fallimenti. Le quattro inquadrature che hanno composto il taglio finale, più la canzone e il fotogramma base, sono costate $4.80.

Il Video Musicale MiniMax H3 che ho Montato da un Ritornello di 32 Secondi

Attiva l'audio. Queste sono quattro generazioni separate, concatenate senza transizioni, con il master originale da 32 secondi sovrapposto.

TfrOvWHf4ys

"MIRA", 32 secondi, 2560x1440, 24 fps. Quattro generazioni minimax/h3/reference-to-video da 8 secondi ciascuna, $1.12 per inquadratura. La canzone è stata inserita come audio di riferimento ed è costata $0.00.

Quattro generazioni, quattro mondi di illuminazione completamente diversi, un solo volto. Niente è stato ritoccato tra di loro.

Quattro vedute di una donna dai capelli argentei con un collare rosso luminoso

Quattro fotogrammi dalle quattro inquadrature che mostrano la stessa cantante su un tetto al neon, un'autostrada nel deserto, uno studio bianco e una vasca d'acqua nera. Un fotogramma estratto da ogni clip consegnata. Stessi capelli, stessa maglia a rete, stesso collare LED rosso attraverso pioggia, sole basso, alta chiave piatta e sott'acqua.


Perché la maggior parte dei tentativi di video musicali con MiniMax H3 fallisce al sedicesimo secondo

Tre modalità di fallimento, tutte evitabili.

Uno: considerare 15 secondi come il limite del progetto. H3 limita una singola generazione a 15 secondi. La gente lo legge, conclude "niente video musicali" e molla. Ma un video musicale non è mai stato una singola inquadratura. Quello vero taglia ogni 4-8 secondi comunque. Il limite ti costringe solo a fare ciò che un editor avrebbe fatto comunque.

Due: descrivere il ritmo a parole. "Allegro, energico, ballare a ritmo" non dà nulla al modello da agganciare. Inventa un tempo, e i tuoi punti di taglio cadono fuori ritmo per sempre. Fornire l'audio effettivo elimina le supposizioni.

Tre: lasciare che il guardaroba vari. Ogni inquadratura ha bisogno della stessa immagine di riferimento e della stessa descrizione testuale del guardaroba, identica. Cambiare "maglia a rete nera" in "camicia a rete scura" tra le inquadrature e ottieni una persona diversa.

Ecco cosa ti costano effettivamente le due strade:

 Catena tradizionale a quattro strumentiSingola chiamata di riferimento H3
Strumenti per inquadraturaModello immagine, modello video, strumento lip-sync, NLEUn endpoint, poi un NLE alla fine
Passaggi manuali per inquadratura4 passaggi, 3 esportazioni di file1 invio
Cosa mantiene il personaggioRe-prompting manuale e fortunaUn'immagine di riferimento riutilizzata identica
Immagine e suonoRendering separati, allineamento successivoGenerati nello stesso passaggio, stereo 32 kHz
Costo per inquadratura da 8 secondiQuattro contatori separati$1.12 a 2K, $0.80 a 768P

Per essere equi con la vecchia strada: non è una fantasia. Il creatore giapponese Arata Fukoe ha vinto un bronzo al Project Odyssey con un video musicale completamente AI, e sia i Queen che i Linkin Park hanno pubblicato video ufficiali assistiti da AI. Quelle catene usavano però quattro o cinque strumenti, che è esattamente ciò che un artista indipendente con una sola canzone non ha tempo di fare.

Cosa compra effettivamente l'audio di riferimento per un video musicale MiniMax H3

Questa è la parte che vale la pena capire prima di spendere qualcosa.

H3 genera immagine e suono in un unico passaggio, invece di doppiare l'audio su fotogrammi già pronti. Quando gli fornisci una traccia di riferimento, questa non è una nota di umore. Ho confrontato la mia fetta di input con il flusso audio all'interno dell'mp4 consegnato, a livello di forma d'onda, su un downmix mono a 8 kHz:

  • Correlazione dell'inviluppo: 0.956 a lag zero
  • Correlazione grezza della forma d'onda su una finestra di 2 secondi: 0.892 a offset di campione zero

Non è un modello che riproduce una canzone simile. È il tuo file, allineato al campione, con l'atmosfera richiesta dal prompt sovrapposta e una codifica AAC in più. Per confronto, la stessa misurazione su una ripresa di controllo generata senza audio di riferimento è risultata 0.26, che è il rumore di fondo.

Due forme d'onda audio quasi identiche che mostrano input blu e output rosso

Forma d'onda della fetta di input sopra, audio H3 consegnato sotto, allineati a offset zero_Sopra: l'mp3 da 8 secondi che ho caricato. Sotto: il flusso audio all'interno dell'mp4 restituito da H3. Stessi picchi, stesse posizioni, nessun offset._

I limiti di input sono severi e vengono applicati al momento dell'invio anziché in silenzio:

Input di riferimentoLimiteAddebitato
Immaginifino a 9gratuito sugli endpoint H3 di Atlas Cloud
Videofino a 3, ciascuno 2-15saddebitato alla tariffa di output
Audiofino a 3, ciascuno 2-15s, 15s totali tra tutti i clip$0.00
Solo audiorifiutato, necessita almeno un'immagine o videon/d

Ho testato volutamente il limite totale di audio inviando tre fette da 8 secondi in una sola chiamata. È fallita in 5,8 secondi con invalid params, total audio duration 24138 ms exceeds 15000 ms e non è stata addebitata. Buona notizia: H3 non elimina silenziosamente il file extra e ti addebita comunque.

Un'altra trappola in cui sono incappato prima. Se passi l'audio come URL di dati base64, il tipo MIME decide l'estensione che l'API deduce. data:audio/mpeg viene rifiutato con audio format ".mpeg" not allowed. data:audio/mp3 passa. Quattro invii sono morti per questo prima che me ne accorgessi, tutti gratuiti.


Il flusso di lavoro per video musicali MiniMax H3, e quanto costa ogni secondo

Tutto ciò che segue passa attraverso una chiave API su Atlas Cloud, dove ho eseguito e fatturato tutto. Tre modelli, una scheda del browser.

PassaggioModelloCosa faPrezzo effettivamente addebitato
Scrivi il ritornellominimax/music-2.6Canzone completa da un prompt di stile più testo, mp3 fino a ~5 min$0.15 per canzone, fisso
Blocca l'artistaopenai/gpt-image-2/text-to-imageUn fotogramma base che ogni inquadratura eredita$0.1745 a qualità alta, 2048x1152
Scatta ogni inquadraturaminimax/h3/reference-to-videoImmagine più audio in ingresso, clip bloccata sul ritmo con audio stereo in uscita$0.14/s a 2K, $0.10/s a 768P. Audio in ingresso $0.00

Due note su quella tabella, perché i numeri elencati mentono in entrambe le direzioni. GPT Image 2 mostra un minimo di $0.009 nel catalogo; è il livello token più basso, e un render high reale a 2048x1152 costa $0.1745. La voce di catalogo di H3 mostra $0.10, che è solo il livello 768P; i miei lavori da 8 secondi a 2K sono stati addebitati esattamente $1.12 ciascuno, che è $0.14 al secondo.

Se vuoi un blocco del primo fotogramma invece di riferimenti al soggetto, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) ha le stesse tariffe, e [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) copre le inquadrature puramente testuali.

La correzione che vale la pena fare: una versione precedente di questo piano presupponeva che dovessi portare la tua canzone perché non c'era un generatore di canzoni complete sulla piattaforma. Ora ce n'è uno. minimax/music-2.6 scrive la traccia, quindi l'intera catena, canzone inclusa, funziona in un unico posto.


Come realizzare un video musicale MiniMax H3, passo dopo passo

Passaggio 1: Scrivi un ritornello a 120 BPM e taglialo in fette per inquadratura

Chiedi esplicitamente 120 BPM. A 120 BPM una battuta è esattamente 2.000 secondi, quindi l'enum duration in secondi interi di H3 cade sulle linee di battuta gratuitamente: 4s = 2 battute, 6s = 3 battute, 8s = 4 battute, 10s = 5 battute. I tuoi tagli cadono sul battere senza che tu tocchi un singolo marker.

Modello: minimax/music-2.6. Impostazioni: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.

Prompt di stile:

plaintext
1Synth-pop a esattamente 120 BPM, cassa dritta quattro sul pavimento, pad analogici
2luminosi sidechainati, voce femminile pulita in primo piano nel mix, ritornello
3stereo ampio, niente rap, vocali aperte sostenute, cinematografico e leggermente
4malinconico, master pronto per la radio

Testo:

plaintext
1[Ritornello]
2Tieni la linea, tieni la luce
3Sto esaurendo la notte
4Pronuncia il mio nome nella pioggia
5E brucerò di nuovo

Ha restituito una traccia di 70 secondi in 75 secondi per $0.15. Poi ho controllato il tempo invece di fidarmi, eseguendo un'autocorrelazione di novità di attacco sul file. Il lag più forte è risultato esattamente 0.500 s, che è 120 BPM, e la griglia del beat inizia a 0.24 s nel file decodificato anziché a zero. Quell'offset è importante: taglia da 0.24 e ogni fetta inizia su un battere.

plaintext
1# Master da 32 secondi, che inizia sul battere a 0.24s
2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3
3
4# quattro fette da 8 secondi, una per inquadratura, ciascuna 4 battute e ben sotto il limite di 15s
5for i in 0 8 16 24; do
6  ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3
7done

Se hai già la tua traccia, salta completamente questo passaggio. È il caso normale, ed è il più economico.

Passaggio 2: Blocca l'artista con un fotogramma base di GPT Image 2

Ogni inquadratura fa riferimento a questo singolo file. Qualunque cosa sia sbagliata qui è sbagliata quattro volte, quindi spendi $0.17 e guardalo bene.

Modello: openai/gpt-image-2/text-to-image. Impostazioni: quality high , size 2048x1152 (16:9).

plaintext
1Fermo cinematografico per video musicale, ritratto a mezzo busto. Una cantante
2synth-pop femminile dell'Asia orientale di 25 anni con capelli corti argentei e
3frangia dritta, una maglia a rete nera opaca, un sottile collare LED rosso che
4brilla contro la sua clavicola, e un singolo orecchino a cuffia d'argento. Si
5trova su un tetto bagnato dalla pioggia di notte, tenendo un microfono a mano
6cromato vintage vicino alla bocca. Dietro di lei, insegne al neon magenta e
7ciano fuori fuoco, pioggia sottile catturata da un controluce duro, vapore che
8si alza da uno sfiato. Scattato con anamorfico 35mm, profondità di campo ridotta,
9gradazione teal-e-magenta, grana visibile. Il suo viso è nitido e illuminato
10uniformemente da una luce morbida da sinistra. Nessun testo nell'inquadratura.

Donna con capelli argentei che tiene un microfono vintage in una città di notte con pioggia e neon

Il fotogramma base generato: cantante dai capelli argentei con microfono cromato su un tetto al neon bagnato dalla pioggia_Il fotogramma base che ogni inquadratura successiva eredita. Generato con_ openai/gpt-image-2/text-to-image , qualità alta, 2048x1152, addebitato $0.1745.

Interfaccia del generatore di immagini AI che mostra le impostazioni di input e l'output generato

GPT Image 2 che esegue questo stesso prompt nel playground di Atlas Cloud con il fotogramma finito nel pannello di output

Lo stesso prompt nel playground: Dimensione 16:9 a 2048x1152, Qualità alta, e il pulsante Esegui che mostra $0.1745, che è ciò che l'API mi ha effettivamente addebitato. Il $0.009 del catalogo è il livello token più basso, non questo. Stesso prompt, seed diverso, quindi questo render non è il file esatto sopra.

Le parole del guardaroba in quel prompt (capelli corti argentei, maglia a rete nera opaca, collare LED rosso, orecchino a cuffia d'argento) vengono riutilizzate identiche in ogni prompt successivo. Quella ripetizione è l'intero meccanismo di coerenza. Non parafrasarlo.

Passaggio 3: Esegui la prima inquadratura del video musicale MiniMax H3 con audio di riferimento gratuito

Modello: minimax/h3/reference-to-video. Impostazioni: refers = il fotogramma base più slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.

Imposta ratio esplicitamente. Il default del playground è adaptive, e l'endpoint è molto più contento quando nomini la forma che desideri.

plaintext
1Inquadratura per video musicale. La donna nell'immagine di riferimento canta la
2traccia di riferimento dritta verso l'obiettivo sul tetto umido al neon, tenendo
3il microfono cromato alla bocca. Pronuncia la prima linea con forza sul battere,
4occhi fissi alla telecamera, poi inclina la testa all'indietro sulla nota
5sostenuta. Lento avvicinamento da mezzo busto a un primo piano stretto negli
6otto secondi, micro-deriva a mano libera, strisce di pioggia che attraversano il
7controluce duro. I movimenti della sua bocca seguono esattamente le vocali
8cantate dell'audio di riferimento, sta cantando, non parlando. Stessi capelli
9corti argentei, maglia a rete nera opaca e collare LED rosso luminoso
10dell'immagine di riferimento. Paesaggio sonoro: la traccia di riferimento in
11stereo, più una leggera pioggia e un lontano ronzio cittadino basso nel mix.

7sPeYEe-xII

Inquadratura 1, audio attivo. 2560x1440, 8.00 s esatti, 24 fps, stereo 32 kHz. 345 secondi dall'invio al file, addebitato $1.12. Guarda l'inclinazione della testa all'indietro sulla nota sostenuta intorno ai 5 s.

Interfaccia del generatore video AI che mostra le impostazioni di input e il video generato

Il playground reference-to-video con il fotogramma base e la fetta audio caricati e il clip finito nel pannello di output

Materiali di Riferimento mostra 2/9: slice-0.mp3 in uno slot, il fotogramma base nell'altro. Risoluzione 2K, Durata 8, e il pulsante Esegui che mostra $1.12, che è esattamente 8 x $0.14. Nota il menu a tendina Aspect Ratio su adaptive , che è il default della pagina; le mie chiamate API impostavano ratio esplicitamente a 16:9.

Un numero che vale la pena annotare: duration: 8 ha restituito un contenitore di esattamente 8.00 secondi. duration: 4 ha restituito 4.46 secondi. Se prevedi di concatenare sulle linee di battuta, attieniti alle durate che tornano esatte.

Passaggio 4: Scatta altre tre inquadrature senza perdere il volto

Stesso fotogramma base, stessa frase sul guardaroba, fetta audio successiva. Tutto il resto cambia.

4a. Autostrada nel deserto all'ora d'oro. refers = fotogramma base + slice-8.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Inquadratura per video musicale. La stessa donna dell'immagine di riferimento si
2trova sulla linea centrale di un'autostrada deserta vuota all'ora d'oro, senza
3microfono, una giacca di jeans indaco aperta sopra la stessa maglia a rete nera
4opaca, il collare LED rosso ancora acceso. Muove la bocca sulle parole del
5ritornello della traccia di riferimento contro il vento mentre la telecamera
6arretra bassa sull'asfalto. Tremolio di calore dalla strada, polvere che si
7solleva, la sua ombra che si allunga verso l'obiettivo, un bagliore anamorfico
8che attraversa a metà corsa. Capelli, viso e guardaroba identici all'immagine
9di riferimento. Paesaggio sonoro: la traccia di riferimento sopra il vento
10aperto del deserto, ampia e ariosa.

4XEki-v2vCU

Inquadratura 2, audio attivo. Stesso volto, temperatura di colore opposta, e la traccia di riferimento rimixata sotto il vento aperto. 332 s, $1.12.

4b. Cove bianco infinito. refers = fotogramma base + slice-16.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Inquadratura per video musicale. La stessa donna dell'immagine di riferimento in
2uno studio a cove infinito bianco puro sotto luce piatta ad alta chiave senza
3ombre, che indossa un impermeabile di vinile rosso lucido sopra la stessa maglia
4a rete nera opaca, collare LED rosso visibile al colletto. Balla quattro battute
5sulla traccia di riferimento, i capelli argentei che sferzano ad ogni giro.
6Inquadratura fissa ampia, poi uno zoom rapido a un medio sul secondo battere.
7Piccoli quadrati di carta bianca cadono come coriandoli negli ultimi due secondi.
8Viso e capelli identici all'immagine di riferimento. Paesaggio sonoro: la traccia
9di riferimento, secca e ravvicinata, più lo scricchiolio delle scarpe sul
10pavimento dello studio.

VAyqdkVpnm0

Inquadratura 3, audio attivo. La luce piatta senza ombre è il posto più difficile per nascondere un cambio di volto, e ha retto. 8.00 s, $1.12.

4c. Sott'acqua, b-roll, senza sincronizzazione labiale. refers = fotogramma base + slice-24.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Inquadratura per video musicale. La stessa donna dell'immagine di riferimento
2sospesa sott'acqua in una vasca nera, i capelli argentei che fluttuano intorno a
3lei, il collare LED rosso che brilla attraverso l'acqua, la maglia a rete nera
4che ondeggia lentamente. Un fascio di luce duro dall'alto; bolle che salgono
5oltre l'obiettivo al rallentatore. Apre gli occhi sul battere e allunga una mano
6verso la superficie. Non canta e la sua bocca rimane chiusa. La telecamera ruota
7di trenta gradi intorno a lei nell'inquadratura. Viso identico all'immagine di
8riferimento. Paesaggio sonoro: la traccia di riferimento sentita sopra la
9superficie, ovattata e con un filtro passa-basso, con transienti di bolle.

fibdweUMRpY

Inquadratura 4, audio attivo. L'istruzione "non canta e la sua bocca rimane chiusa" è stata rispettata, che è la parte utile: l'audio di riferimento guida il tempismo, non una performance obbligatoria. 329 s, $1.12.

Passaggio 5: Esegui la ripresa di controllo, con lo slot audio vuoto

Stesso prompt del Passaggio 3, parola per parola. L'unica modifica: refers contiene l'immagine e nient'altro. 768P, duration: 8.

Questo singolo clip spiega l'intero meccanismo meglio di qualsiasi paragrafo. Ascoltalo rispetto al Passaggio 3.

FAoPplGmKJc

La ripresa di controllo. Prompt identico, nessun audio di riferimento, 1344x768, 8.00 s, 200 s, $0.80. H3 ha scritto la propria colonna sonora, e la performance è generica "qualcuno sta cantando" piuttosto che queste parole.

Misurata rispetto al mio master, l'audio di controllo ha ottenuto una correlazione dell'inviluppo di 0.26. Quella del Passaggio 3 ha ottenuto 0.956. Quel divario è ciò che lo slot audio gratuito ti compra.

Passaggio 6: Rompi la sincronizzazione labiale apposta

Ogni modello ha un soffitto di sillabe. Trovare il tuo costa $0.40.

Ho generato una traccia rap separata a doppio tempo (minimax/music-2.6 di nuovo, $0.15), ho tagliato una fetta da 4 secondi con circa sei sillabe al secondo, e l'ho inserita nella stessa ambientazione sul tetto a 768P, duration: 4.

plaintext
1Inquadratura per video musicale. La donna nell'immagine di riferimento rappa la
2traccia di riferimento dritta verso l'obiettivo sul tetto umido al neon, tenendo
3il microfono cromato alla bocca, pronunciando ogni sillaba del verso rap veloce a
4doppio tempo. Primo piano medio fisso, leggera deriva a mano libera, strisce di
5pioggia nel controluce duro. I movimenti della sua bocca seguono esattamente le
6sillabe rappate dell'audio di riferimento. Stessi capelli corti argentei, maglia
7a rete nera opaca e collare LED rosso luminoso dell'immagine di riferimento.
8Paesaggio sonoro: la traccia di riferimento in stereo più una leggera pioggia.

jiQVCjOCbKg

Il test di stress, audio attivo. 1344x768, 4.46 s, 192 s, $0.40. La bocca rimane attiva e a tempo, ma smette di risolvere le singole consonanti e si stabilizza in un ciclo ripetitivo di apertura-chiusura. Le linee cantate ottengono forme vocaliche distinte; questo no.

La mia lettura onesta dai file consegnati: le vocali sostenute cantate sono dove il lavoro della bocca di H3 è genuinamente convincente, e le consonanti rappate dense sono dove degrada in movimento plausibile. Pianifica i tuoi primi piani intorno alle linee cantate e metti le battute veloci su b-roll. Ci sono più dettagli sulla differenza tra parlato e canto nella analisi di sincronizzazione labiale e audio.

Passaggio 7: Cuci, silenzia e sovrapponi il master al tuo video musicale MiniMax H3

Quattro clip di esattamente 8.00 secondi si concatenano in esattamente 32.00 secondi, che sono 16 battute a 120 BPM. Nessun taglio.

plaintext
1# 1. rimuovi l'audio da ogni clip
2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do
3  ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4
4done
5
6# 2. concatena in ordine di battuta (4 x 8s = 32s = 16 battute @ 120 BPM)
7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt
8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4
9
10# 3. sovrapponi il master originale
11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4

Perché preoccuparsi di silenziare, se il modello restituisce già la tua traccia? Perché il mix stereo di ogni clip porta l'atmosfera che il prompt di quella clip ha richiesto: pioggia nell'inquadratura 1, vento del deserto nell'inquadratura 2, un filtro passa-basso subacqueo nell'inquadratura 4. Piacevole per inquadratura, incoerente attraverso un taglio. Il master ti dà un mix continuo a bitrate pieno senza ricodifica per inquadratura. H3 fornisce la sincronizzazione della performance. Il tuo master fornisce la canzone.


Quattro varianti della ricetta per video musicali MiniMax H3

Tagli verticali per i social. Imposta ratio: 9:16 e ottieni una fetta per Spotify Canvas o Shorts dallo stesso fotogramma base e dalle stesse fette. È tornato un vero 768x1344, quindi a differenza del menu a tendina aspect nel playground, il valore ratio dell'API rimane. I loop di Canvas sono silenziosi per progettazione, quindi questo viene spedito come GIF.

Donna dai capelli argentei che tiene un microfono su un tetto cittadino piovoso

Un loop verticale 9:16 tagliato della stessa artista sul tetto al neon_Stesso fotogramma base, stessa fetta di riferimento,_ ratio: 9:16 a 768P per $0.80. Una piccola stranezza onesta: ho chiesto "non cantare" e ho ottenuto comunque canto. Con una voce nello slot di riferimento, l'audio vince la discussione. Se vuoi un interprete silenzioso, fornisci una fetta strumentale.

Video di riferimento invece di immagine di riferimento. Puoi dare a H3 fino a tre clip video di riferimento per trasportare movimento e inquadratura invece di descriverli. Attenzione al contatore: il video di riferimento viene addebitato alla tariffa di output, mentre l'audio di riferimento è gratuito. Questa asimmetria è il singolo dato di prezzo più utile su questo endpoint.

Visualizzatori b-roll puri. Elimina completamente l'interprete. Fornisci una foto del prodotto, un oggetto di copertina dell'album o una texture più la fetta audio, e richiedi solo movimento della telecamera. Nessun volto da mantenere, nessuna sincronizzazione labiale da rompere, e puoi scattare tutto a 768P.

Boozza a buon mercato, finitura costosa. 768P è $0.10/s contro $0.14/s del 2K, ed entrambi tornano con stereo a 32 kHz identico, quindi la performance che stai giudicando è la stessa. Il risparmio non è nei bocconi buoni, è nei rifiuti: ogni ripresa fallita da 8 secondi costa $0.80 invece di $1.12. Lavora a 768P finché la ripresa non è giusta, poi paga $1.12 una volta sola. Su una inquadratura che richiede tre tentativi, sono $2.72 invece di $3.36. Ulteriori informazioni sulla differenza di livello nel confronto 768P vs 2K, e su quanto può durare un singolo clip nella guida alla lunghezza dei clip.


Quanto è costato effettivamente un video musicale MiniMax H3 completo

Ogni riga qui sotto è una cifra reale addebitata, estratta dal record di previsione dopo il completamento, non un prezzo di listino.

VoceModello e impostazioniAddebitato
Ritornello, canzone da 70 sminimax/music-2.6, mp3 44.1 kHz$0.15
Fotogramma base dell'artistaopenai/gpt-image-2/text-to-image, high, 2048x1152$0.17
Inquadratura 1, tetto al neonminimax/h3/reference-to-video, 2K, 8 s$1.12
Inquadratura 2, autostrada desertostesso, 2K, 8 s$1.12
Inquadratura 3, cove biancostesso, 2K, 8 s$1.12
Inquadratura 4, subacqueastesso, 2K, 8 s$1.12
Subtotale video finito $4.80
Sonda di validazione768P, 4 s$0.40
Ripresa di controllo, senza audio768P, 8 s$0.80
Traccia rap per il test di stressminimax/music-2.6$0.15
Test di stress lip-sync768P, 4 s$0.40
Taglio verticale per Canvas768P, 8 s, 9:16$0.80
Immagine hero per questo articoloopenai/gpt-image-2/text-to-image, high$0.17
Test oltre limite, 24 s di audiorifiutato all'invio$0.00
Quattro invii con MIME audio sbagliatorifiutati all'invio$0.00
Audio di riferimento, 4 x 8 sinput gratuito$0.00
Spesa totale $7.53

Sono $9.00 al minuto finito a 2K sulle inquadrature che hanno composto il taglio, prima di qualsiasi mio errore. Scattato interamente a 768P, lo stesso minuto costa $6.61. Una troupe umana per video musicali non cita nessuno di questi numeri.

Due note operative se stai pianificando un pezzo più lungo. I rifiuti all'invio sono gratuiti, quindi i parametri sbagliati ti costano tempo e nient'altro. E il campo price su una previsione viene popolato con un ritardo, quindi interroga di nuovo l'ID della richiesta dopo che il file viene scaricato se vuoi una fattura reale anziché un null.


Di chi è la canzone, di chi è il volto: cosa controllare prima di pubblicare

Breve, perché è importante e non ha bisogno di una predica.

Devi avere i diritti sulla traccia di riferimento. Input gratuito non significa liberatoria gratuita. Inserire un singolo commerciale come audio di riferimento e poi pubblicare ciò che esce è la via rapida per un takedown. La tua registrazione, una traccia commissionata o qualcosa che hai generato va bene.

Non costruire il fotogramma base dal volto di un artista reale vivente. Il meccanismo di coerenza qui è molto bravo a mantenere un volto attraverso le inquadrature, il che è esattamente il motivo per cui puntarlo a una persona reale è una cattiva idea.

Pesi aperti e accesso API sono due licenze diverse. MiniMax ha pubblicato i pesi di H3 su Hugging Face ad agosto 2026, e la sua licenza comunitaria esclude attualmente UE, Regno Unito, Corea del Sud e Stati Uniti, con un canale di licenza formale aperto per quei territori. Quella restrizione si applica all'esecuzione dei pesi da soli. Chiamare il modello attraverso un'API ospitata è una relazione di servizio e non ti mette sotto la licenza dei pesi. Vale la pena sapere in quale situazione ti trovi prima di assumere qualcosa.

Per una visione più ampia di dove si colloca H3 rispetto alle alternative, c'è un confronto con Seedance 2.5 e una guida alla struttura del prompt. Per contesto sul perché ne vale la pena: nella classifica di editing video che valuta i modelli con audio, H3 attualmente è primo con 1.126 Elo, davanti a Gemini Omni Flash con 1.119 e Dreamina Seedance 2.0 con 1.027 (Artificial Analysis, controllato il 10 agosto 2026). Quei punteggi cambiano con i voti, quindi trattali come un'istantanea.


Video musicale MiniMax H3: domande frequenti

Un video musicale MiniMax H3 può durare tre minuti interi?

Non in una singola generazione. Una singola chiamata ha un limite di 15 secondi. Ma questo è un limite per generazione, non per progetto. Un video di tre minuti a 8 secondi per inquadratura sono 23 generazioni, circa $25.76 a 2K, e ognuna cade su una linea di battuta se la tua traccia è a 120 BPM. Taglia, scatta, concatena, sovrapponi il master.

Un video musicale MiniMax H3 usa la mia canzone reale, o il modello rigenera l'audio?

Usa la tua canzone reale. Ho misurato una correlazione di forma d'onda grezza di 0.892 a offset di campione zero tra l'mp3 da 8 secondi che ho caricato e il flusso audio all'interno dell'mp4 restituito, con l'atmosfera richiesta dal prompt sovrapposta. Una ripresa di controllo generata senza audio di riferimento ha ottenuto 0.26 rispetto allo stesso master. Dovresti comunque sovrapporre il tuo master sulla concatenazione finale, perché ogni clip porta la propria atmosfera per inquadratura e la propria codifica AAC, che non sopravvivono a un taglio pulito.

Inserire una canzone in un video musicale MiniMax H3 costa extra?

No. Le mie quattro fette di riferimento da 8 secondi hanno aggiunto $0.00 a un conto di $4.48 per le inquadrature. Il video di riferimento è quello da tenere d'occhio, perché viene addebitato alla tariffa di output. I limiti sono tre clip audio, da 2 a 15 secondi ciascuno, 15 secondi totali, e l'audio non può mai essere l'unico riferimento.

Quanto è buona la sincronizzazione labiale di MiniMax H3 per il canto rispetto al parlato?

Le vocali sostenute cantate sono il suo punto di forza: forme della bocca distinte, tenute che corrispondono alla nota, e l'inclinazione all'indietro su una nota lunga sembra una performance piuttosto che un loop. La dizione densa è dove cede. Il mio test rap a sei sillabe al secondo ha mantenuto il ritmo ma ha smesso di risolvere le consonanti e si è stabilizzato in un ciclo ripetitivo di apertura-chiusura. Metti le battute veloci su b-roll.

Come faccio a mantenere lo stesso volto in ogni inquadratura di un video musicale MiniMax H3?

Tre cose, tutte noiose. Un'immagine di riferimento riutilizzata in ogni chiamata, mai rigenerata. La stessa descrizione del guardaroba copiata identica tra i prompt, non parafrasata. E una clausola esplicita "identica all'immagine di riferimento" in ogni prompt. Le mie quattro inquadrature hanno attraversato pioggia, sole basso, alta chiave piatta e sott'acqua senza derivazioni.

Quanto costa un video musicale MiniMax H3 al minuto finito?

$9.00 al minuto finito a 2K, basato sul mio conto reale di $4.80 per un taglio di 32 secondi. Scattato interamente a 768P, lo stesso minuto costa $6.61, e 768P fornisce lo stesso stereo a 32 kHz, quindi la performance che stai giudicando è identica. Lavora i tuoi rifiuti a $0.80 e paga $1.12 solo sulla ripresa che sopravvive al montaggio.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli