Seedance 2.5 è ora live — In anteprima su Atlas Cloud

Video ASMR MiniMax H3: ho tagliato una melagrana di vetro, poi ho misurato se lo stereo fosse reale

La maggior parte degli ASMR AI incolla suoni di repertorio a video muti. Un video ASMR MiniMax H3 renderizza audio stereo a 32 kHz in un solo passaggio. Ho misurato i canali, con prompt e costi.

Indossa le cuffie prima di scorrere fino alla clip qui sotto. In questa categoria conta davvero.

Un coltello cala su una melagrana scolpita nel vetro color rubino. Il guscio si spacca, una crepa cristallina, poi qualche decina di semi di vetro rotola su ardesia bagnata. Ecco la parte diversa da quasi tutte le clip ASMR AI che hai visto scorrere quest’anno: nessuno ha aggiunto quel suono. Non c’era una libreria audio, nessun editor, nessuna timeline. Immagine e audio sono usciti da una sola generazione, in una sola chiamata.

Nell’ultimo anno l’ASMR AI è stato appagante da vedere e leggermente sbagliato da ascoltare, e il motivo non è mai stato la componente visiva. Era l’ultimo passaggio della pipeline. Incollare l’audio su una clip muta è stato un lavoro manuale, fatto a mano, ogni singola volta. La categoria è cresciuta così rapidamente attorno a quella lacuna che è nata una piccola industria di siti dedicati alla generazione di ASMR AI, creati solo per automatizzare l’unione, uno dei quali pubblicizza «binaural 3D audio» direttamente in homepage. La domanda era dimostrata da tempo. Veniva semplicemente soddisfatta tramite assemblaggio.

Così ho provato la cosa come si deve. Un workflow riproducibile, sei clip, e poi la parte che in questa categoria non fa mai nessuno: ho separato i canali sinistro e destro in ffmpeg e li ho misurati. Parte di ciò che mi aspettavo si è rivelato sbagliato, e proprio questo è risultato l’aspetto più utile dell’articolo.

Punti chiave

  • H3 renderizza l’immagine a 24 fps e una traccia stereo AAC a 32 kHz nello stesso passaggio. L’audio è generato, non doppiato in seguito.
  • Lo stereo è davvero stereo, non un doppio mono travestito da stereo. Ma non puoi chiedere un pan nel prompt. Ho richiesto uno sweep netto da sinistra a destra e ho ottenuto una differenza di 1,9 dB, cioè praticamente nulla.
  • L’ampiezza stereo deriva dal contenuto, non dalle parole che usi. La clip della pioggia, in cui non avevo chiesto alcuna direzione, è tornata con un campo sonoro davvero ampio.
  • Bloccare il primo frame mantiene l’inquadratura tra le risoluzioni, ma 768P e 2K restano due take diversi. La bozza anticipa l’aspetto e la specifica audio, non la coreografia esatta.
  • Una clip di 5 secondi a 768P costa $0.50. La stessa clip a 2K costa $0.70. L’intero articolo è costato $4.27.

Ascolta prima: un video ASMR MiniMax H3, tagliato in un solo passaggio

Cinque secondi, 2K, 24 fps, stereo 32 kHz, una generazione, $0.70. Audio attivo: il cigolio del filo che affonda, la crepa, poi i semi. Nulla è stato aggiunto dopo. Generato con minimax/h3/image-to-video.

Un prompt. Un modello. Una chiamata. Tutto ciò che segue spiega come è stata realizzata quella clip, quanto è costata e quali parti della storia di marketing resistono al confronto con una forma d’onda.

Perché l’ASMR AI è esploso, e perché la maggior parte non supera il test delle cuffie

La tendenza ha una data di nascita. L’ASMR AI ha iniziato a diffondersi a giugno 2025, subito dopo l’arrivo di Veo 3, e il formato è diventato virale nel giro di pochi giorni. Un mukbang di lava di @asmraiworks ha superato 11,3 milioni di visualizzazioni in una settimana; una clip di taglio del vetro ne ha fatte 5,3 milioni in undici giorni (Know Your Meme, 2025). Le redazioni l’hanno ripreso come curiosità, con immagini surreali e lava fusa mangiata con le bacchette a fare gran parte del lavoro (The Express Tribune, 2025).

Poi le persone hanno indossato le cuffie, e l’umore è cambiato. L’autore di TechRadar ne ha guardate parecchie tra quelle virali ed è arrivato a descrivere una patina di artificialità, «priva degli errori e dell’imprecisione che sono il tratto distintivo dell’ASMR creato da esseri umani» (TechRadar, giugno 2025). I fan citati in quel pezzo dicevano che i trigger del brivido erano tecnicamente presenti, eppure non era la stessa cosa.

C’è una ragione meccanica, e non ha nulla di mistico. L’ASMR è l’unica categoria di contenuto in cui il contenuto è il suono. Altrove l’audio è una guarnizione. Qui è il prodotto. E il workflow dominante era:

  1. generare una clip muta con un modello video,
  2. cercare in una libreria audio una crepa, un crunch, un tappeto di pioggia,
  3. allineare il suono all’immagine in un editor,
  4. fare pan e mix a mano se ti interessa, cosa che quasi nessuno fa su larga scala,
  5. esportare.

Il passaggio 3 è quello in cui tutto muore. Una crepa preconfezionata che parte con due frame di ritardo suona falsa prima ancora che tu possa spiegare perché. Moltiplica questo per un calendario di pubblicazione quotidiano e gli errori si accumulano, perché l’allineamento viene rifatto da un essere umano ogni singola volta.

Questa lacuna spiega perché esista un’intera micro-industria di siti generatori di ASMR AI. Almeno tre si stanno promuovendo attivamente e uno mette l’audio binaurale 3D in evidenza come funzionalità principale. Non stanno risolvendo un problema finto. Stanno rattoppando un buco reale: i modelli video sottostanti non producono suono.

Il che rende interessante una particolare separazione nelle classifiche. Nella classifica di video editing di Artificial Analysis, quella valutata con audio, MiniMax H3 è al primo posto con 1.126 Elo, davanti a Gemini Omni Flash con 1.119 e con circa cento punti di vantaggio su Dreamina Seedance 2.0 a 1.027 (Artificial Analysis, agosto 2026). Nelle classifiche image-to-video, dove l’audio non rientra nel punteggio, diversi di quei modelli stanno a pochi punti l’uno dall’altro. Il divario si apre quando il suono conta. Per l’ASMR, il suono è tutto ciò che conta.

Il workflow per un video ASMR MiniMax H3, e quanto costa ogni passaggio

Tre endpoint, una scheda del browser. Ho eseguito tutto ciò che trovi in questo articolo su Atlas Cloud, quindi ogni cifra qui sotto arriva dalla fattura e non da un listino.

Lavoro in questo articoloModelloTariffa
Primo frame per la showcaseOpenAI GPT Image 2 (text-to-image)indicato da $0.009/immagine, fatturato $0.1745 a high e 2048x1152
Bozza e take finaleMiniMax H3 Image-to-Video$0.10/s a 768P, $0.14/s a 2K
Inserire una registrazione realeMiniMax H3 Reference-to-Videostessi due livelli
I tre templateMiniMax H3 Text-to-Videostessi due livelli
Il vecchio metodo, solo metà audioByteDance Seed Audio 1.0$0.143/min

La scheda mostra «From $0.1/SEC» su tutti e tre gli endpoint H3. È il minimo per 768P. Il 2K viene fatturato a $0.14/s e quel numero non appare da nessuna parte se non in fattura, quindi pianifica in base al livello che richiedi davvero.

Tabella 1: un solo passaggio contro la pipeline cucita.

MiniMax H3, audio nativoModello muto più audio in post-produzione
Passaggi per una clip finita14 o 5
Strumenti coinvolti1modello video + libreria audio + editor + export
Come immagine e suono restano sincronizzatistessa generazione, stessa timelinelo trascini finché sembra giusto
Chi mixa e fa il pannessuno, prendi ciò che dà il modellotu, a mano, per ogni suono
Tempo umano per clippraticamente zero dopo il prompt15-40 minuti, onestamente
Compute per clip da 5s$0.50 a 768Pmodello video + $0.143/min di generazione audio

Non cito volutamente la tariffa al secondo di una piattaforma video concorrente, perché la differenza non sta nel compute. La generazione audio costa $0.143 al minuto, cioè pochi centesimi. Il costo reale della pipeline cucita sono 20 minuti di attenzione umana per clip, e quel costo non diminuisce con la scala. Si moltiplica. Un account faceless che pubblica ogni giorno è esattamente il caso in cui 20 minuti a clip divorano silenziosamente l’intero modello di business.

Il contrappeso onesto: cucire tutto a mano ti dà controllo. Puoi mettere un suono ovunque nel campo stereo e tagliarlo al frame. H3 ti dà la sincronizzazione gratis e, come mostrano le misurazioni qui sotto, non ti restituisce quel controllo.

Tabella 2: i tre endpoint H3, i parametri che contano davvero.

image-to-videotext-to-videoreference-to-video
Input principaleimage (primo frame)solo promptrefers[]
resolution768P / 2K, default 2Kugualeuguale
durationqualsiasi secondo intero da 4 a 15, default 8ugualeuguale
ratiodecisa dal primo framedeve essere impostata esplicitamente, adaptive viene rifiutatodecisa dai riferimenti
limiti di refersnon usato insieme a imagenon usatofino a 9 immagini, 3 video, 3 audio
Output 16:9 consegnato1344x768 a 768P, 2560x1440 a 2Kugualeuguale
Traccia audioAAC stereo 32 kHz su video a 24 fpsugualeuguale

Due trappole sui parametri da scriversi sulla mano. Il parametro si chiama ratio, non aspect_ratio, e la chiave sbagliata lo lascia non impostato, quindi text-to-video rifiuta la richiesta. Inoltre image più refers nella stessa chiamata non genera errore: completa, fattura per intero e scarta silenziosamente uno dei due input.

Tutorial video ASMR MiniMax H3: tagliare una melagrana di vetro

Il taglio della frutta di vetro è il formato che tutti riconoscono, quindi il lettore capisce subito cosa sta guardando. Mele e manghi di vetro, però, sono stati sfruttati fino allo sfinimento. Una melagrana è migliore per un motivo preciso: quando il guscio si spacca, centinaia di semi di vetro fuoriescono e rotolano, quindi il suono ha durata e struttura invece di essere un singolo impatto centrato. Se un modello sta fingendo l’audio, una dispersione è il punto in cui si vede.

Passaggio 1: costruisci il frame di base con GPT Image 2

Blocca la composizione prima di spendere qualsiasi cosa in video. Impostazioni: quality: high, size: 2048x1152 (16:9), output_format: png.

Plain
1Extreme close-up macro photograph of a whole pomegranate carved entirely from thick
2translucent ruby-red glass, resting on a wet black slate slab. The glass shell is 8mm
3thick with visible internal bubbles and chipped facets; hundreds of tiny glass seeds
4glow inside like garnet crystals. A polished Japanese santoku knife lies at the left
5edge of the frame, blade tip just touching the glass skin. One hard key light from the
6upper right rakes across the slab and throws sharp red caustics onto the wet stone.
7100mm macro, f/2.8, shallow depth of field, dark moody background.
8No hands, no text, no watermark, no logo.

Interfaccia di un generatore di immagini AI che mostra un prompt testuale e un’immagine generata

Playground di GPT Image 2 su Atlas Cloud con qualità impostata su high e dimensione 16:9 2048x1152, la melagrana di vetro renderizzata nel pannello OUTPUT

L’esecuzione reale. Quality high a 2048x1152, e la pagina indica $0.1745, lo stesso importo poi riportato anche in fattura.

Lama di coltello che taglia una melagrana di vetro rosso traslucido su pietra scura

Il frame di base generato: una melagrana scolpita nel vetro rubino spesso su ardesia nera bagnata, con un coltello santoku che entra dal bordo sinistro

Il frame dato a H3. Generato con openai/gpt-image-2/text-to-image.

Passaggio 2: scrivi la metà sonora del prompt per il video ASMR MiniMax H3

La maggior parte delle persone scrive un prompt ASMR come una descrizione visiva con la parola «ASMR» appiccicata davanti, poi si chiede perché il modello lo accompagni con un pianoforte lo-fi. H3 prende sul serio le indicazioni audio, se gliene dai. Struttura la metà audio in cinque slot:

  1. Materiale. Che cosa produce il suono. Vetro, cera, roccia fusa, acqua su vetro. Sii specifico su spessore e umidità: cambiano il timbro.
  2. Azione e sua forma nel tempo. Non solo «taglia», ma «preme verso il basso in un unico movimento lento e continuo». Il modello lo usa per collocare gli eventi.
  3. Prospettiva del microfono. close-mic, intimate, indicazioni sulla distanza di registrazione. Stabilisce quanto secco e vicino risulta il suono, e funziona bene.
  4. Sequenza onomatopeica. Esplicita gli eventi sonori in ordine: cigolio, poi crepa, poi decine di piccoli impatti, poi silenzio. È lo slot che fa più lavoro.
  5. Negativi. no music, no voice, no narration, no room reverb, no ambience bed. Senza questi, H3 aggiungerà premurosamente una colonna sonora, perché la maggior parte dei video nei suoi dati di training ne ha una.

Ho anche scritto indicazioni sui canali nello slot 4, chiedendo la crepa nel canale sinistro e i semi che rotolano da sinistra a destra. Continua a leggere per vedere cosa ha prodotto davvero.

Passaggio 3: esegui la bozza a 768P

Fai la bozza a 768P. La traccia audio ha la stessa specifica su entrambi i livelli, quindi l’intera valutazione creativa, che nell’ASMR è una valutazione d’ascolto, può essere fatta alla tariffa più economica.

Impostazioni su minimax/h3/image-to-video: image = l’output del Passaggio 1, resolution: 768P, duration: 5. Il ratio deriva dal primo frame, quindi lascialo com’è.

Plain
1The santoku blade enters from the left and presses down through the glass pomegranate
2in one slow continuous stroke, travelling left to right across the frame. The shell
3splits with a bright crystalline crack and a spray of tiny glass seeds tumbles onto the
4wet slate, scattering toward the right edge. Camera locked off, macro, single take, no cuts.
5
6Audio: ASMR, close-mic, intimate, no music, no voice, no narration, no room reverb.
7A dry sustained glass squeak as the edge bites in, then one sharp high crack panned to
8the LEFT channel, followed by dozens of small tinkling seed impacts rolling from the
9LEFT channel across to the RIGHT channel as they scatter. A faint blade-on-stone scrape
10at the very end, then silence. No ambience bed, no hum, no background music.

Interfaccia di un generatore video AI che mostra un video con una melagrana di vetro

Playground image-to-video di MiniMax H3 su Atlas Cloud con il frame di base caricato, durata 5, e una clip completata nel pannello OUTPUT

L’esecuzione image-to-video: primo frame caricato, durata 5, OUTPUT completato. Nota che il selettore Resolution è impostato sul default della pagina di 2K. Passalo a 768P per le bozze, che è la risoluzione con cui è stata renderizzata la clip qui sotto.

La bozza a 768P, $0.50. Immagine più morbida rispetto alla clip hero, stessa specifica audio. È il take su cui viene presa tutta la decisione.

Passaggio 4: misura lo stereo prima di fidarti

Non fidarti della mia parola sul suono, e nemmeno di quella del modello. Separa i canali e guarda. Questo è ffmpeg in locale, nessuna chiamata API, nessun costo:

Bash
1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \
2  -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \
3  -frames:v 1 stereo-proof.png

Confronto delle forme d’onda della separazione dei canali stereo in due clip audio ASMR

Analisi della forma d’onda in quattro pannelli che confronta la clip della melagrana di vetro e quella della pioggia, mostrando i canali sinistro e destro più il canale side per ciascuna

Canale sinistro sopra il destro per due clip, più il canale side (sinistro meno destro) a guadagno corrispondente sotto. Questa immagine è l’intero argomento in una sola figura.

Ecco cosa è tornato, e una parte non è ciò che mi aspettavo.

Lo stereo è reale. Il canale side non è vuoto in nessuna delle clip che ho generato. Un file dual mono travestito da stereo non mostrerebbe nulla lì. Questo invece ha contenuto.

Ma non puoi chiedere un pan nel prompt. Ho chiesto, in maiuscolo, la crepa nel canale LEFT e i semi che rotolano da LEFT a RIGHT. Misurazione: correlazione tra canali 0,97, canale side 17,7 dB sotto il mid, e la massima differenza di livello sinistra-destra in qualsiasi finestra da un quarto di secondo è 1,9 dB. Non è un pan. È un’immagine centrata con un po’ di ampiezza naturale. Il coltello attraversa l’inquadratura; il suono resta fermo.

L’ampiezza deriva dal contenuto, non dalle parole. La clip della pioggia nella prossima sezione, in cui non ho richiesto alcuna direzione, è tornata con correlazione 0,32 e il canale side solo 2,9 dB sotto il mid. È un campo davvero ampio e decorrelato. L’ambienza diffusa ottiene ampiezza automaticamente. Gli impatti discreti restano vicini al centro, qualunque cosa tu scriva.

Quindi l’affermazione onesta per questo modello non è spaziale. È temporale. Ottieni un suono generato insieme all’immagine e posizionato sul frame a cui appartiene, gratis, per sempre, senza editor. Se il tuo formato richiede davvero un pan netto, devi ancora farlo tu in post-produzione, e dovresti smettere di scrivere nomi di canali nei prompt perché non stanno facendo nulla.

Ora rilancia il take finale: stesso endpoint, stesso primo frame, stesso prompt, cambia un solo campo in resolution: 2K. C’è un’altra cosa utile da sapere prima di dare per scontato che la bozza sia un’anteprima.

Confronto di due risoluzioni video mentre viene tagliata una melagrana di vetro

Due righe di cinque frame che confrontano le esecuzioni 768P e 2K agli stessi timestamp, identiche al frame zero e divergenti da circa 2,5 secondi

Stesso primo frame, stesso prompt, entrambi i livelli. Il frame 0 coincide esattamente. A 2,5s il guscio si rompe in modo diverso e le due clip sono diventate due take differenti.

Bloccare il primo frame mantiene composizione, inquadratura, illuminazione e colore tra i due livelli, ed è per questo che dovresti sempre usare image-to-video invece di text-to-video per questo caso. Non ti dà lo stesso take. L’esecuzione 2K rilancia l’azione. Tratta la bozza come un’anteprima dell’aspetto e del suono, non della coreografia esatta.

Passaggio 5: aggiungi una registrazione reale come riferimento per il video ASMR MiniMax H3

Se hai un suono che vuoi davvero, dagli quello. reference-to-video accetta fino a 9 immagini, 3 video e 3 clip audio, e ricava timbro e carattere dell’ambiente da un riferimento audio invece di inventarli. Ho usato una registrazione di vetro che si rompe, compatibile con il pubblico dominio, realizzata da Gravity Sound da Wikimedia Commons (CC BY 4.0), tre take concatenati per arrivare a 4,5 secondi.

Tre regole, e le ultime due le ho scoperte nel modo più duro, facendomi rifiutare le richieste:

  • L’audio non può andare da solo. L’endpoint lo specifica: è richiesta almeno un’immagine o un video, e il solo audio non è consentito. Abbinalo a un frame.
  • Il riferimento audio deve durare da 2 a 15 secondi. Il mio primo tentativo usava una clip da 1,49 secondi ed è tornato con audio duration 1486 ms, expected [2000, 15000] ms. Questo intervallo non è indicato nella pagina del modello.
  • Il formato del file viene controllato. Un payload base64 dichiarato come audio/mpeg è stato rifiutato con audio format ".mpeg" not allowed. Un payload .wav è passato. Le richieste rifiutate non vengono fatturate, ma costano comunque un round trip.

Impostazioni: refers: [{url: <base frame>, type: "image"}, {url: <a 2 to 15s recording>, type: "audio"}], resolution: 768P, duration: 5.

Plain
1Same locked-off macro shot: the blade slices the glass pomegranate from left to right
2and the seeds scatter. Match the timbre, brightness and room character of the reference
3audio, same recording distance, same dryness. ASMR close-mic, no music, no voice.

Interfaccia di un generatore video AI che mostra l’input del prompt e un video generato con una melagrana

Playground reference-to-video di MiniMax H3 su Atlas Cloud con due materiali di riferimento caricati, un file audio nello slot 1 e il frame di base nello slot 2

Reference Materials contiene insieme il file audio e l’immagine, 2 su 9 usati. Rimuovi l’immagine e la richiesta non partirà affatto.

Il take guidato dal riferimento, $0.50. Stessa inquadratura, timbro orientato da una registrazione reale invece che inventato dal prompt. Riferimento audio: Glass breaking di Gravity Sound, CC BY 4.0.

Tre template per video ASMR MiniMax H3: taglio, masticazione, pioggia

Tre formati coprono la maggior parte di ciò che funziona in questa categoria. Ognuno è un prompt completo da incollare ed eseguire, con impostazioni e la clip prodotta. Deliberatamente niente vetro, niente rosso, niente ardesia qui sotto: se ogni clip del tuo account sembra uguale, l’algoritmo la tratta come la stessa clip.

Tabella 3: gli stessi cinque slot, tre lavori diversi.

SlotTemplate 1, Il taglioTemplate 2, La masticazioneTemplate 3, La pioggia
Materialefavo gocciolante, lama d’acciaio caldaroccia fusa incandescente, ciotola di pietrapioggia sul vetro del finestrino
Forma dell’azionela lama affonda dal davanti al retro, il miele tira verso il bassole bacchette sollevano, poi due morsinessuna azione del soggetto, solo gocce
Prospettiva microfonoclose-mic, molto secco, senza stanzaestremamente vicino, intimofuori dal vetro, abitacolo ovattato
Sequenza sonoracrepa della cera, stiramento del miele, goccia sul piattosfrigolio fuso, masticazione bagnata, crunch vetroso, espirazionetappeto di pioggia costante, colpi delle gocce, sibilo lontano di pneumatici
Negativino music, no voice, no room reverbno words, no music, no narrationno music, no thunder, no voice, no wipers

Template 1, Il taglio. Favo, ambra e oro, 9:16, 768P, 6 secondi, ratio: "9:16".

Plain
1Extreme macro, locked-off overhead shot of a thick slab of golden honeycomb on a pale
2ceramic plate, honey already pooling around it. A hot steel blade lowers into the wax
3and sinks through it front to back in one slow continuous press; the cut faces slump
4and a heavy thread of honey stretches and drips onto the plate. Warm amber key light
5from the left, shallow depth of field, single take, no cuts, no hands in frame.
6
7Audio: ASMR, close-mic, very dry, no room reverb, no music, no voice, no narration.
8A soft crackling of wax splitting under the blade, then a thick low stretching pull as
9the honey lengthens, then two heavy wet drips landing on the ceramic plate. Nothing else.

Template 1, $0.60. Crepa della cera, stiramento del miele, goccia. Generato con minimax/h3/text-to-video.

Template 2, La masticazione. Mukbang di lava, il formato che ha fatto 11,3 milioni di visualizzazioni in una settimana, 9:16, 768P, 8 secondi, ratio: "9:16".

Plain
1Vertical close-up: a pair of black lacquer chopsticks lifts a glowing clump of molten
2orange lava out of a dark stone bowl and carries it toward the camera, out of frame at
3the bottom. The lava is self-illuminating, casting orange light on everything around it;
4the rest of the room is almost black. Steam curls off the surface. Locked-off camera,
5single take, no cuts.
6
7Audio: ASMR, extremely close-mic, intimate, no words, no music, no narration, no room tone.
8A low molten sizzle and bubbling as the lava is lifted, then a soft wet chew, then a
9brighter glassy crunch on the second bite, then one slow satisfied exhale. No speech.

Template 2, $0.80. Sfrigolio, masticazione, crunch, espirazione, e neanche una parola. Generato con minimax/h3/text-to-video.

Template 3, La pioggia. Finestrino d’auto di notte, blu freddo e neon, 16:9, 768P, 10 secondi, ratio: "16:9".

È l’unico dei tre senza azione del soggetto, ed è quello che insegna di più sui negativi. Quando non succede nulla sullo schermo, H3 tende a inserire un tappeto musicale a meno che tu non lo vieti esplicitamente. È anche la clip tornata con il campo stereo di gran lunga più ampio, senza che glielo chiedessi. I contenuti orientati al sonno vogliono durata, quindi questa gira vicino al limite alto dell’intervallo utile.

Plain
1Macro shot through the inside of a car window at night, heavy rain running down the
2outside of the glass. Individual droplets hit, hesitate, then streak downward and merge.
3Beyond the glass, out-of-focus neon signage breaks into cold blue and magenta bokeh.
4No wipers, no people, no movement inside the car. Camera locked off, single continuous
5take, shallow depth of field, no cuts.
6
7Audio: ASMR, close-mic on the outside of the glass, cabin slightly muffled.
8A steady even rain bed with clearly separated individual droplet impacts on the glass,
9plus a faint distant hiss of tyres on a wet road. No music, no thunder, no voice,
10no narration, no wiper noise.

Template 3, $1.00. Dieci secondi di pura ambienza, nessuna colonna sonora perché il prompt l’ha vietata. Generato con minimax/h3/text-to-video.

Quanto costa davvero un video ASMR MiniMax H3

Ecco la ricevuta di questo articolo, non una stima.

VoceConteggioFatturato
Frame di base GPT Image 2, high, 2048x11521$0.17
Take finale 2K, 5s, image-to-video1$0.70
Bozza 768P, 5s, image-to-video1$0.50
768P reference-to-video, 5s1$0.50
Clip template a 768P, 6s + 8s + 10s3$2.40
Richieste reference rifiutate2$0.00
Totale$4.27

Sei clip pubblicabili e un frame di base. Scalalo su un calendario: una clip verticale da 8 secondi al giorno a 768P costa $0.80, quindi circa $24 al mese per un account faceless che pubblica ogni giorno, prima ancora di passare un minuto in un editor.

Due note sulla fatturazione. Il $0.009 indicato da GPT Image 2 è il minimo di un livello a token; un render 2048x1152 ad alta qualità arriva a $0.1745, quasi venti volte tanto, quindi fai budget sul livello che usi davvero. E il campo price di H3 viene compilato con un ritardo: fai polling finché status è completed ed è spesso ancora undefined. Fai di nuovo polling sul prediction id poco dopo per ottenere la cifra reale. Quel secondo polling è l’unico modo per costruire una ricevuta come questa invece di una stima.

Una nota onesta su audio ASMR e diritti

Non caricare la registrazione ASMR di qualcun altro come file audio refers. Il riferimento trasferisce davvero il timbro nell’output, e far passare una registrazione attraverso un modello non cambia chi ne detiene i diritti. Il riferimento usato qui è CC BY 4.0 ed è accreditato sopra, cosa che ha richiesto circa due minuti per trovarlo.

Non costruire ASMR attorno alla voce riconoscibile di una persona reale. Ogni template in questo articolo è deliberatamente senza voce, il che è sia una convenzione del genere sia il percorso meno complicato.

Chiamare H3 tramite API non è influenzato dalla licenza community associata ai pesi open. Quella licenza, che copre il self-hosting, attualmente esclude UE, Regno Unito, Corea e Stati Uniti, ed è aperto un canale di licenza formale per quei territori. Utile saperlo, non qualcosa di cui preoccuparsi se stai usando l’endpoint.

Video ASMR MiniMax H3: domande frequenti

Un video ASMR MiniMax H3 genera il proprio suono, o devo aggiungerlo dopo?

Lo genera il modello. Immagine e audio escono dallo stesso passaggio: video a 24 fps con una traccia stereo AAC a 32 kHz nel file consegnato. Non c’è un passaggio audio separato, nessuna libreria di suoni e nessun lavoro di allineamento, ed è il motivo principale per cui questo endpoint è interessante specificamente per l’ASMR.

Posso far fare a un video ASMR MiniMax H3 un pan da sinistra a destra?

Non chiedendolo. Ho scritto indicazioni esplicite sui canali nel prompt e ho misurato il risultato: correlazione 0,97 tra i canali e una differenza massima di livello di 1,9 dB in qualsiasi finestra da un quarto di secondo, quindi nessun pan. La traccia è davvero stereo e contenuti diffusi come la pioggia tornano con un campo ampio, ma gli impatti discreti restano centrati indipendentemente dalle parole usate. Se il tuo formato richiede un pan netto, fallo in post-produzione.

Posso caricare una mia registrazione come riferimento per un video ASMR MiniMax H3?

Sì, tramite reference-to-video, che accetta fino a 3 riferimenti audio insieme a un massimo di 9 immagini e 3 video. L’audio non può essere inviato da solo, quindi abbinalo ad almeno un’immagine o un video. Deve anche durare tra 2 e 15 secondi, e il formato viene validato: un payload .wav ha funzionato dove uno audio/mpeg è stato rifiutato. Le richieste rifiutate non vengono fatturate.

L’audio di un video ASMR MiniMax H3 a 768P è peggiore di quello a 2K?

No. Entrambi i livelli consegnano la stessa specifica stereo AAC a 32 kHz. Cambia solo l’immagine, e cambia molto: il 16:9 viene restituito come 1344x768 a 768P contro 2560x1440 a 2K. Poiché la valutazione creativa nell’ASMR è una valutazione d’ascolto, fai la bozza a $0.10/s e rilancia i take finali a $0.14/s. Ricorda solo che l’esecuzione 2K è un nuovo take, non un upscale della bozza.

Quanto dovrebbe durare un video ASMR MiniMax H3, e quale aspect ratio usare?

La durata accetta qualsiasi secondo intero da 4 a 15. Le clip di taglio e masticazione funzionano tra 5 e 8 secondi perché il payoff è un singolo evento; le ambienze orientate al sonno vogliono 10 secondi o più. Per Shorts, Reels e TikTok usa 9:16, e ricorda che text-to-video richiede che ratio sia impostato esplicitamente e rifiuta adaptive. In image-to-video è il primo frame a decidere la forma.

Quanto costa un video ASMR MiniMax H3?

Una clip di 5 secondi costa $0.50 a 768P e $0.70 a 2K. Una clip verticale da 8 secondi a 768P costa $0.80. Pubblicarne una al giorno significa circa $24 al mese in compute, ed è il numero da confrontare con i 20 minuti che un editor impiegherebbe per ogni clip nel workflow cucito.

Perché il mio video ASMR MiniMax H3 esce con musica di sottofondo che non ho mai chiesto?

Perché non l’hai vietata. La maggior parte dei video nei dati di training di qualsiasi modello ha un tappeto musicale, quindi il comportamento predefinito è aggiungerne uno, soprattutto quando sullo schermo non succede nulla. Inserisci esplicitamente i negativi nella metà audio del prompt: no music, no voice, no narration, no room reverb, no ambience bed. I template ambientali ne hanno più bisogno di quelli d’azione.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli