Mettez vos écouteurs avant de défiler jusqu'à la vidéo ci-dessous. Dans cette catégorie, ça compte vraiment.
Un couteau s'abat sur une grenade sculptée dans du verre rubis. La coque se fend, une fissure cristalline, puis quelques dizaines de graines de verre dégringolent sur de l'ardoise humide. Voici ce qui est différent de presque toutes les vidéos ASMR générées par IA que vous avez fait défiler cette année : personne n'a ajouté ce son. Il n'y avait ni bibliothèque sonore, ni monteur, ni timeline. L'image et l'audio sont sortis d'une seule génération, en un seul appel.
Depuis un an, l'ASMR par IA avait l'air satisfaisant et sonnait légèrement faux, et la raison n'était jamais visuelle. C'était la dernière étape du pipeline. Coller de l'audio sur une vidéo muette était un travail manuel, fait à la main, à chaque fois. La catégorie a tellement grandi autour de ce vide qu'une petite industrie de sites dédiés aux générateurs d'ASMR par IA est apparue, uniquement pour automatiser l'assemblage, l'un d'eux faisant la publicité d'un « audio 3D binaural » directement sur la page d'accueil. La demande était prouvée depuis longtemps. Elle était simplement servie par assemblage.
J'ai donc fait les choses correctement. Un workflow reproductible, six clips, puis la partie que personne ne fait jamais dans cette catégorie : j'ai séparé les canaux gauche et droit dans ffmpeg et je les ai mesurés. Une partie de ce que je pensais s'est avérée fausse, et cela s'est avéré être la chose la plus utile de l'article.
Points clés
- H3 génère l'image en 24 fps et une piste stéréo AAC 32 kHz en un seul passage. L'audio est généré, pas ajouté après.
- La stéréo est vraiment stéréo, pas du dual mono déguisé en stéréo. Mais vous ne pouvez pas piloter un panoramique. J'ai demandé un balayage de gauche à droite et j'ai obtenu une différence de 1,9 dB, ce qui est négligeable.
- La largeur stéréo vient du contenu, pas de votre formulation. Le clip de pluie, où je n'ai demandé aucune direction, est revenu avec un champ vraiment large.
- Verrouiller la première image conserve le plan d'une résolution à l'autre, mais 768P et 2K sont toujours deux prises différentes. Le brouillon prévisualise l'aspect et les spécifications sonores, pas la chorégraphie exacte.
- Un clip de 5 secondes en 768P coûte 0,50 $. Le même clip en 2K coûte 0,70 $. L'article entier a coûté 4,27 $.
Écoutez d'abord : une vidéo ASMR MiniMax H3, coupée en un seul passage
w7ZRR7bo3KI
Cinq secondes, 2K, 24 fps, stéréo 32 kHz, une génération, 0,70 $. Activez le son : le grincement du bord qui mord, le craquement, puis les graines. Rien n'a été ajouté après. Généré avec minimax/h3/image-to-video.
Une seule instruction. Un seul modèle. Un seul appel. Tout ce qui suit explique comment ce clip a été réalisé, ce qu'il a coûté, et quelles parties du discours marketing survivent au contact avec une forme d'onde.
Pourquoi l'ASMR par IA a explosé, et pourquoi la plupart échouent au test du casque
La tendance a une date de naissance. L'ASMR par IA a commencé à se répandre en juin 2025, juste après l'arrivée de Veo 3, et le format est devenu viral en quelques jours. Un lava mukbang de @asmraiworks a dépassé les 11,3 millions de vues en une semaine ; un clip de découpe de verre a fait 5,3 millions en onze jours (Know Your Meme, 2025). Les rédactions l'ont repris comme une curiosité, avec des visuels surréalistes et de la lave en fusion mangée avec des baguettes qui faisaient l'essentiel du travail (The Express Tribune, 2025).
Puis les gens ont mis des écouteurs, et l'ambiance a changé. Le journaliste de TechRadar a regardé un tas de vidéos virales et en est ressorti en décrivant une couche d'artificialité, « manquant des erreurs et des imprécisions qui sont la marque de fabrique de l'ASMR fait par l'humain » (TechRadar, juin 2025). Les fans cités dans cet article disaient que les déclencheurs de picotements étaient techniquement présents, mais que ce n'était toujours pas pareil.
Il y a une raison mécanique, et elle n'est pas mystique. L'ASMR est la seule catégorie de contenu où le contenu est le son. Partout ailleurs, l'audio est une garniture. Ici, c'est le produit. Et le workflow dominant était :
- générer un clip muet avec un modèle vidéo,
- chercher dans une bibliothèque sonore un craquement, un crunch, un fond de pluie,
- aligner le son sur l'image dans un éditeur,
- équilibrer et mixer manuellement si on s'en soucie, ce que presque personne ne fait en volume,
- exporter.
L'étape 3 est celle où ça meurt. Un craquement préenregistré qui arrive deux images trop tard sonne faux avant même qu'on puisse expliquer pourquoi. Multipliez cela par un rythme de publication quotidien et les erreurs s'accumulent, car l'alignement est refait par un humain à chaque fois.
C'est ce vide qui explique pourquoi toute une industrie artisanale de sites générateurs d'ASMR par IA existe. Au moins trois font activement leur marketing et l'un d'eux met en avant l'audio 3D binaural comme fonctionnalité phare. Ils ne résolvent pas un problème artificiel. Ils colmatent un vrai trou : les modèles vidéo sous-jacents ne produisent pas de son.
Ce qui rend un classement intéressant à examiner. Sur le tableau de bord d'édition vidéo d'Artificial Analysis, celui noté avec audio, MiniMax H3 est #1 avec 1 126 Elo, devant Gemini Omni Flash à 1 119 et environ cent points devant Dreamina Seedance 2.0 à 1 027 (Artificial Analysis, août 2026). Sur les tableaux image-vers-vidéo, où l'audio n'entre pas dans le score, plusieurs de ces modèles sont à quelques points les uns des autres. L'écart se creuse quand le son compte. Pour l'ASMR, le son est tout ce qui compte.
Le workflow de vidéo ASMR MiniMax H3, et le coût de chaque étape
Trois endpoints, un onglet de navigateur. J'ai tout exécuté pour cet article sur Atlas Cloud, donc tous les chiffres ci-dessous proviennent de la facture, pas d'une grille tarifaire.
| Tâche dans cet article | Modèle | Tarif |
|---|---|---|
| Première image pour la vitrine | OpenAI GPT Image 2 (texte-vers-image) | à partir de 0,009 $/image, facturé 0,1745 $ en haute et 2048x1152 |
| Brouillon et prise finale | MiniMax H3 Image-vers-Vidéo | 0,10 $/s en 768P, 0,14 $/s en 2K |
| Ajout d'un enregistrement réel | MiniMax H3 Référence-vers-Vidéo | mêmes deux paliers |
| Les trois modèles | MiniMax H3 Texte-vers-Vidéo | mêmes deux paliers |
| L'ancienne méthode, moitié audio seulement | ByteDance Seed Audio 1.0 | 0,143 $/min |
La liste indique « À partir de 0,1 $/SEC » sur les trois endpoints H3. C'est le prix plancher en 768P. La 2K est facturée à 0,14 $/s et ce chiffre n'apparaît nulle part sauf sur votre facture, donc planifiez en fonction du palier que vous demandez réellement.
Tableau 1 : un passage contre le pipeline assemblé.
| MiniMax H3, audio natif | Modèle muet plus audio en post-production | |
|---|---|---|
| Étapes pour un clip fini | 1 | 4 à 5 |
| Outils impliqués | 1 | modèle vidéo + bibliothèque sonore + éditeur + export |
| Comment l'image et le son restent synchronisés | même génération, même timeline | vous le glissez jusqu'à ce que ça semble correct |
| Qui mixe et panne | personne, vous prenez ce que le modèle donne | vous, à la main, par son |
| Temps humain par clip | quasiment zéro après l'instruction | 15 à 40 minutes, honnêtement |
| Calcul pour un clip de 5s | 0,50 $ en 768P | modèle vidéo + 0,143 $/min de génération audio |
Je ne cite volontairement pas le tarif par seconde d'une plateforme vidéo concurrente, car le calcul n'est pas là où se situe la différence. La génération audio coûte 0,143 $ la minute, soit quelques centimes. Le vrai coût du pipeline assemblé est de 20 minutes d'attention humaine par clip, et ce coût ne diminue pas quand on monte en échelle. Il se multiplie. Un compte sans visage qui publie quotidiennement est exactement là où 20 minutes par clip grignotent silencieusement tout le modèle économique.
Le contrepoint honnête : l'assemblage manuel vous donne du contrôle. Vous pouvez placer un son n'importe où dans le champ stéréo et le caler sur l'image. H3 vous donne la synchronisation gratuitement et, comme le montrent les mesures ci-dessous, ne vous rend pas ce contrôle.
Tableau 2 : les trois endpoints H3, les paramètres qui comptent vraiment.
| image-vers-vidéo | texte-vers-vidéo | référence-vers-vidéo | |
|---|---|---|---|
| Entrée principale | image (première image) | instruction uniquement | refers[] |
| Résolution | 768P / 2K, défaut 2K | idem | idem |
| Durée | n'importe quelle seconde entière de 4 à 15, défaut 8 | idem | idem |
| Ratio | déterminé par la première image | doit être défini explicitement, « adaptatif » est rejeté | déterminé par les références |
| Limites des refers | non utilisé avec une image | non utilisé | jusqu'à 9 images, 3 vidéos, 3 audios |
| Sortie 16:9 livrée | 1344x768 en 768P, 2560x1440 en 2K | idem | idem |
| Piste audio | AAC stéréo 32 kHz sur vidéo 24 fps | idem | idem |
Deux pièges de paramètres qui valent la peine d'être notés sur votre main. Le paramètre s'appelle ratio, pas aspect_ratio, et la mauvaise clé le laisse non défini, donc le texte-vers-vidéo rejette la requête. Et image plus refers dans le même appel ne génère pas d'erreur : ça se termine, ça facture intégralement, et ça jette silencieusement l'une des deux entrées.
Tutoriel vidéo ASMR MiniMax H3 : découper une grenade en verre
La découpe de fruits en verre est le format que tout le monde reconnaît, donc le lecteur sait immédiatement ce qu'il regarde. Les pommes en verre et les mangues en verre ont été faites à satiété, cependant. Une grenade est meilleure pour une raison précise : quand la coque se fend, des centaines de graines de verre se déversent et roulent, donc le son a une durée et une structure au lieu d'être un seul impact centré. Si un modèle simule son audio, une dispersion est l'endroit où ça se voit.
Étape 1 : Construire l'image de base avec GPT Image 2
Verrouillez la composition avant de dépenser quoi que ce soit en vidéo. Paramètres : quality: high, size: 2048x1152 (16:9), output_format: png.
plaintext1Photographie macro en très gros plan d'une grenade entière sculptée entièrement dans du 2verre rubis translucide épais, reposant sur une dalle d'ardoise noire humide. La coque 3en verre a 8 mm d'épaisseur avec des bulles internes visibles et des facettes ébréchées ; 4des centaines de minuscules graines de verre brillent à l'intérieur comme des cristaux 5de grenat. Un couteau santoku japonais poli repose sur le bord gauche du cadre, la 6pointe de la lame touchant juste la peau de verre. Une lumière dure provenant du coin 7supérieur droit balaie la dalle et projette des caustiques rouges aiguës sur la pierre 8humide. Macro 100 mm, f/2.8, faible profondeur de champ, fond sombre et atmosphérique. 9Pas de mains, pas de texte, pas de filigrane, pas de logo.

Bac à sable GPT Image 2 sur Atlas Cloud avec la qualité réglée sur haute et la taille 16:9 2048x1152, la grenade en verre rendue dans le panneau OUTPUT
Le vrai passage. Qualité high en 2048x1152, et la page indique 0,1745 $, ce que la facture a aussi confirmé plus tard.

L'image de base générée : une grenade sculptée dans du verre rubis épais sur de l'ardoise noire humide, un couteau santoku entrant par le bord gauche
L'image transmise à H3. Généré avec openai/gpt-image-2/text-to-image.
Étape 2 : Rédiger la partie sonore de l'instruction de la vidéo ASMR MiniMax H3
La plupart des gens écrivent une instruction ASMR comme une description d'image avec le mot « ASMR » collé devant, puis se demandent pourquoi le modèle la note avec un piano lo-fi. H3 prend les directions audio au sérieux si vous lui en donnez. Structurez la partie audio en cinq créneaux :
- Matériau. Ce qui produit le son. Verre, cire, roche en fusion, eau sur verre. Soyez précis sur l'épaisseur et l'humidité, cela change le timbre.
- Action et sa forme dans le temps. Pas seulement « coupe » mais « appuie en un seul mouvement continu lent ». Le modèle utilise cela pour placer les événements.
- Perspective du micro.
close-mic,intime, indices de distance d'enregistrement. Cela définit le degré de sécheresse et de proximité du son, et cela fonctionne bien. - Séquence d'onomatopées. Épelez les événements sonores dans l'ordre : grincement, puis craquement, puis des dizaines de petits impacts, puis silence. C'est le créneau qui fait le plus de travail.
- Négations.
pas de musique, pas de voix, pas de narration, pas de réverbération de pièce, pas de fond d'ambiance. Sans cela, H3 ajoutera volontiers une musique de fond, car la plupart des vidéos dans ses données d'entraînement en ont une.
J'ai aussi écrit des directions de canaux dans le créneau 4, demandant le craquement dans le canal gauche et les graines roulant de gauche à droite. Lisez la suite pour voir ce que cela a réellement produit.
Étape 3 : Lancer le brouillon en 768P
Brouillon en 768P. La piste audio est la même spécification aux deux paliers, donc tout le jugement créatif, qui en ASMR est un jugement d'écoute, peut être fait au tarif le moins cher.
Paramètres sur minimax/h3/image-to-video : image = la sortie de l'étape 1, resolution: 768P, duration: 5. Le ratio vient de la première image, donc laissez-le tranquille.
plaintext1La lame du santoku entre par la gauche et appuie sur la grenade en verre en un seul 2mouvement continu lent, se déplaçant de gauche à droite dans le cadre. La coque se 3fend avec un craquement cristallin vif et une gerbe de minuscules graines de verre 4dégringole sur l'ardoise humide, se dispersant vers le bord droit. Caméra fixe, macro, 5prise unique, aucun cut. 6 7Audio : ASMR, micro rapproché, intime, pas de musique, pas de voix, pas de narration, 8pas de réverbération de pièce. Un grincement sec et soutenu du verre lorsque le bord 9mord, puis un craquement aigu et net dans le canal GAUCHE, suivi de dizaines de petits 10impacts tintants de graines roulant du canal GAUCHE vers le canal DROIT en se dispersant. 11Un faible raclement lame-sur-pierre à la toute fin, puis silence. Pas de fond d'ambiance, 12pas de bourdonnement, pas de musique de fond.

Bac à sable MiniMax H3 image-vers-vidéo sur Atlas Cloud avec l'image de base chargée, durée 5, et un clip terminé dans le panneau OUTPUT
Le passage image-vers-vidéo : première image chargée, durée 5, OUTPUT terminé. Notez que le sélecteur de résolution est sur la valeur par défaut de la page en 2K. Passez-le en 768P pour les brouillons, ce qui a été utilisé pour le clip ci-dessous.
xkolGEKI7UI
Le brouillon en 768P, 0,50 $. Image plus douce que le clip principal, mêmes spécifications audio. C'est la prise sur laquelle toute la décision est prise.
Étape 4 : Mesurer la stéréo avant de lui faire confiance
Ne me croyez pas sur parole pour le son, et ne croyez pas non plus le modèle. Séparez les canaux et regardez. Ceci est en ffmpeg local, pas d'appel API, aucun coût :
plaintext1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \ 2 -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \ 3 -frames:v 1 stereo-proof.png

Analyse de forme d'onde en quatre panneaux comparant le clip de grenade en verre et le clip de pluie, montrant les canaux gauche et droit ainsi que le canal latéral pour chacun
Canal gauche sur canal droit pour deux clips, plus le canal latéral (gauche moins droit) à gain égal en dessous. C'est tout l'argument en une image.
Voici ce qui est revenu, et une partie n'est pas ce à quoi je m'attendais.
La stéréo est réelle. Le canal latéral n'est vide sur aucun clip que j'ai généré. Un fichier dual mono déguisé en stéréo ne montrerait rien là. Celui-ci a du contenu.
Mais vous ne pouvez pas piloter un panoramique. J'ai demandé, en lettres majuscules, le craquement dans le canal GAUCHE et les graines roulant de GAUCHE à DROITE. Mesuré : corrélation des canaux 0,97, canal latéral à 17,7 dB en dessous du canal central, et la plus grande différence de niveau gauche-droite dans n'importe quelle fenêtre d'un quart de seconde est de 1,9 dB. Ce n'est pas un panoramique. C'est une image centrée avec une petite largeur naturelle. Le couteau se déplace dans le cadre ; le son reste en place.
La largeur vient du contenu, pas de votre formulation. Le clip de pluie dans la section suivante, où je n'ai demandé aucune direction, est revenu avec une corrélation de 0,32 et le canal latéral seulement 2,9 dB en dessous du canal central. C'est un champ vraiment large et décorrélé. L'ambiance diffuse obtient automatiquement une largeur. Les impacts discrets restent près du centre, quoi que vous écriviez.
Donc la revendication honnête pour ce modèle n'est pas spatiale. Elle est temporelle. Vous obtenez un son qui a été généré en même temps que l'image et qui arrive sur l'image à laquelle il appartient, gratuitement, pour toujours, sans éditeur. Si votre format a vraiment besoin d'un panoramique dur, vous devez toujours le faire vous-même en post-production, et vous devriez arrêter d'écrire des noms de canaux dans les instructions car ils ne servent à rien.
Maintenant, relancez la prise finale : même endpoint, même première image, même instruction, changez un champ en resolution: 2K. Une chose de plus à savoir avant de supposer que le brouillon est une prévisualisation.

Deux rangées de cinq images comparant les passages en 768P et 2K aux mêmes timestamps, identiques à l'image zéro et divergeant à partir d'environ 2,5 secondes
Même première image, même instruction, les deux paliers. L'image 0 correspond exactement. À 2,5 s, la coque se brise différemment et les deux clips sont devenus des prises différentes.
Verrouiller la première image maintient la composition, le cadrage, l'éclairage et la couleur sur les deux paliers, c'est pourquoi vous devriez toujours utiliser image-vers-vidéo plutôt que texte-vers-vidéo pour cela. Cela ne vous donne pas la même prise. Le passage en 2K relance l'action. Traitez le brouillon comme une prévisualisation de l'aspect et du son, pas de la chorégraphie exacte.
Étape 5 : Ajouter un enregistrement réel comme référence vidéo ASMR MiniMax H3
Si vous avez un son que vous voulez vraiment, transmettez-le. reference-to-video accepte jusqu'à 9 images, 3 vidéos et 3 clips audio, et il extrait le timbre et le caractère de la pièce d'une référence audio au lieu de les inventer. J'ai utilisé un enregistrement de bris de verre compatible domaine public par Gravity Sound de Wikimedia Commons (CC BY 4.0), trois prises concaténées pour faire 4,5 secondes.
Trois règles, et j'ai découvert les deux dernières à mes dépens en voyant des requêtes rejetées :
- L'audio ne peut pas aller seul. L'endpoint le précise : au moins une image ou une vidéo est requise, et l'audio seul n'est pas autorisé. Associez-le à une image.
- La référence audio doit faire entre 2 et 15 secondes. Ma première tentative utilisait un clip de 1,49 seconde et m'a renvoyé
audio duration 1486 ms, expected [2000, 15000] ms. Cette plage n'est pas sur la page du modèle. - Le format du fichier est vérifié. Une charge utile base64 déclarée comme
audio/mpega été rejetée avecaudio format ".mpeg" not allowed. Une charge utile.wavest passée. Les requêtes rejetées ne sont pas facturées, mais elles vous coûtent un aller-retour.
Paramètres : refers: [{url: <image de base>, type: "image"}, {url: <un enregistrement de 2 à 15s>, type: "audio"}], resolution: 768P, duration: 5.
plaintext1Même plan macro fixe : la lame tranche la grenade en verre de gauche à droite et les 2graines se dispersent. Correspondre au timbre, à la brillance et au caractère de la 3pièce de l'audio de référence, même distance d'enregistrement, même sécheresse. ASMR 4micro rapproché, pas de musique, pas de voix.

Bac à sable MiniMax H3 référence-vers-vidéo sur Atlas Cloud avec deux matériaux de référence chargés, un fichier audio dans l'emplacement 1 et l'image de base dans l'emplacement 2
Matériaux de référence contenant le fichier audio et l'image ensemble, 2 sur 9 utilisés. Enlevez l'image et la requête ne s'exécutera pas du tout.
mY1VrOfM3cM
La prise guidée par référence, 0,50 $. Même plan, timbre orienté par un enregistrement réel plutôt qu'inventé à partir de l'instruction. Référence audio : bris de verre par Gravity Sound, CC BY 4.0.
Trois modèles de vidéos ASMR MiniMax H3 : découpe, mastication, pluie
Trois formats couvrent la plupart de ce qui fonctionne dans cette catégorie. Chacun est une instruction complète à copier-coller avec les paramètres et le clip qu'il a produit. Volontairement pas de verre, pas de rouge, pas d'ardoise ci-dessous : si chaque clip de votre compte se ressemble, l'algorithme les traite comme le même clip.
Tableau 3 : les mêmes cinq créneaux, trois tâches différentes.
| Créneau | Modèle 1, La découpe | Modèle 2, La mastication | Modèle 3, La pluie |
|---|---|---|---|
| Matériau | rayon de miel qui goutte, lame en acier chaud | roche en fusion incandescente, bol en pierre | pluie sur vitre de voiture |
| Forme de l'action | la lame s'enfonce d'avant en arrière, le miel tire vers le bas | les baguettes soulèvent, puis deux bouchées | aucune action de sujet, seulement les gouttelettes |
| Perspective du micro | micro rapproché, très sec, sans pièce | extrêmement proche, intime | à l'extérieur de la vitre, habitacle assourdi |
| Séquence sonore | craquement de cire, étirement du miel, goutte sur l'assiette | grésillement de lave fondue, mastication humide, croquant vitreux, expiration | fond de pluie régulier, impact de gouttelette, sifflement de pneu lointain |
| Négations | pas de musique, pas de voix, pas de réverbération de pièce | pas de mots, pas de musique, pas de narration | pas de musique, pas de tonnerre, pas de voix, pas d'essuie-glaces |
Modèle 1, La découpe. Rayon de miel, ambre et or, 9:16, 768P, 6 secondes, ratio: "9:16".
plaintext1Macro extrême, vue de dessus fixe d'une épaisse plaque de rayon de miel doré sur une 2assiette en céramique pâle, du miel s'accumulant déjà autour. Une lame en acier chaud 3s'abaisse dans la cire et s'enfonce d'avant en arrière en une seule pression continue 4lente ; les faces de coupe s'affaissent et un épais filet de miel s'étire et goutte sur 5l'assiette. Lumière chaude ambrée venant de la gauche, faible profondeur de champ, 6prise unique, pas de cut, pas de mains dans le cadre. 7 8Audio : ASMR, micro rapproché, très sec, pas de réverbération de pièce, pas de musique, 9pas de voix, pas de narration. Un léger crépitement de la cire qui se fend sous la lame, 10puis un bruit d'étirement grave et épais alors que le miel s'allonge, puis deux gouttes 11lourdes et humides atterrissant sur l'assiette en céramique. Rien d'autre.
ZsVmf9AhPnw
Modèle 1, 0,60 $. Craquement de cire, étirement du miel, goutte. Généré avec minimax/h3/text-to-video.
Modèle 2, La mastication. Lava mukbang, le format qui a fait 11,3 millions de vues en une semaine, 9:16, 768P, 8 secondes, ratio: "9:16".
plaintext1Gros plan vertical : une paire de baguettes laquées noires soulève un morceau incandescent 2de lave orange en fusion d'un bol en pierre sombre et le porte vers la caméra, hors cadre 3en bas. La lave s'illumine d'elle-même, projetant une lumière orange sur tout ce qui 4l'entoure ; le reste de la pièce est presque noir. De la vapeur s'élève de la surface. 5Caméra fixe, prise unique, pas de cut. 6 7Audio : ASMR, micro extrêmement rapproché, intime, pas de mots, pas de musique, pas de 8narration, pas de son de pièce. Un léger grésillement de lave et des bulles alors que 9la lave est soulevée, puis une mastication douce et humide, puis un croquant vitreux 10plus brillant sur la deuxième bouchée, puis une expiration lente et satisfaite. Pas de parole.
UJhEsTnKkZI
Modèle 2, 0,80 $. Grésillement, mastication, croquant, expiration, et pas un mot. Généré avec minimax/h3/text-to-video.
Modèle 3, La pluie. Vitre de voiture de nuit, bleu froid et néon, 16:9, 768P, 10 secondes, ratio: "16:9".
C'est le seul des trois sans action de sujet, et il enseigne le plus sur les négations. Sans rien qui se passe à l'écran, H3 cherche un fond musical à moins que vous ne l'interdisiez explicitement. C'est aussi le clip qui est revenu avec le champ stéréo de loin le plus large, sans qu'on le lui demande. Le contenu axé sur le sommeil veut de la longueur, donc celui-ci se situe près du haut de la plage de durée utile.
plaintext1Plan macro à travers l'intérieur d'une vitre de voiture la nuit, forte pluie coulant à 2l'extérieur du verre. Des gouttelettes individuelles frappent, hésitent, puis filent 3vers le bas et fusionnent. Au-delà du verre, une enseigne au néon floue se brise en 4bokeh bleu froid et magenta. Pas d'essuie-glaces, pas de personnes, pas de mouvement 5à l'intérieur de la voiture. Caméra fixe, prise unique continue, faible profondeur de 6champ, pas de cut. 7 8Audio : ASMR, micro rapproché à l'extérieur du verre, habitacle légèrement assourdi. 9Un fond de pluie régulier et égal avec des impacts de gouttelettes individuelles 10clairement séparés sur le verre, plus un faible sifflement lointain de pneus sur une 11route mouillée. Pas de musique, pas de tonnerre, pas de voix, pas de narration, 12pas de bruit d'essuie-glace.
bUKr5V6wbdM
Modèle 3, 1,00 $. Dix secondes d'ambiance pure, pas de bande sonore car l'instruction en interdisait une. Généré avec minimax/h3/text-to-video.
Ce que coûte réellement une vidéo ASMR MiniMax H3
Voici la facture pour cet article, pas une estimation.
| Élément | Nombre | Facturé |
|---|---|---|
| Image de base GPT Image 2, haute, 2048x1152 | 1 | 0,17 $ |
| Prise finale 2K, 5s, image-vers-vidéo | 1 | 0,70 $ |
| Brouillon 768P, 5s, image-vers-vidéo | 1 | 0,50 $ |
| Référence-vers-vidéo 768P, 5s | 1 | 0,50 $ |
| Clips modèles en 768P, 6s + 8s + 10s | 3 | 2,40 $ |
| Requêtes de référence rejetées | 2 | 0,00 $ |
| Total | 4,27 $ |
Six clips publiable et une image de base. Mettez à l'échelle pour un rythme : un clip vertical de 8 secondes par jour en 768P coûte 0,80 $, soit environ 24 $ par mois pour un compte sans visage qui publie quotidiennement, avant de passer une minute dans un éditeur.
Deux notes de facturation. Le prix listé de GPT Image 2 à 0,009 $ est un plancher de palier de tokens ; un rendu haute qualité en 2048x1152 atterrit à 0,1745 $, soit près de vingt fois plus, donc budgetez en fonction du palier que vous utilisez réellement. Et le champ price de H3 se met à jour avec un délai : interrogez jusqu'à ce que status soit completed et il est souvent encore undefined. Interrogez à nouveau l'ID de prédiction un instant plus tard pour le chiffre réel. Cette deuxième interrogation est le seul moyen d'obtenir une facture comme celle-ci au lieu d'une estimation.
Une note honnête sur l'audio ASMR et les droits
Ne téléchargez pas l'enregistrement ASMR de quelqu'un d'autre comme fichier audio refers. La référence transfère réellement le timbre dans la sortie, et passer un enregistrement dans un modèle ne change pas qui en est propriétaire. La référence utilisée ici est sous CC BY 4.0 et créditée ci-dessus, ce qui a pris environ deux minutes à trouver.
Ne construisez pas d'ASMR autour de la voix reconnaissable d'une personne réelle. Chaque modèle de cet article est volontairement sans voix, ce qui est à la fois la convention du genre et le chemin le moins compliqué.
Appeler H3 via une API n'est pas affecté par la licence communautaire attachée aux poids ouverts. Cette licence, qui couvre l'auto-hébergement, exclut actuellement l'UE, le Royaume-Uni, la Corée et les États-Unis, et un canal de licence formel est ouvert pour ces territoires. Bon à savoir, pas de quoi s'inquiéter si vous utilisez l'endpoint.
Vidéo ASMR MiniMax H3 : Foire aux questions
Une vidéo ASMR MiniMax H3 génère-t-elle son propre son, ou dois-je l'ajouter après ?
Le modèle le génère. L'image et l'audio sortent du même passage : vidéo 24 fps avec une piste stéréo AAC à 32 kHz dans le fichier livré. Il n'y a pas d'étape audio séparée, pas de bibliothèque sonore et pas de travail d'alignement, ce qui est la raison même pour laquelle cet endpoint est intéressant spécifiquement pour l'ASMR.
Puis-je faire en sorte qu'une vidéo ASMR MiniMax H3 effectue un panoramique de gauche à droite ?
Pas en le demandant. J'ai écrit des directions de canaux explicites dans l'instruction et mesuré le résultat : corrélation de 0,97 entre les canaux et une différence de niveau maximale de 1,9 dB dans n'importe quelle fenêtre d'un quart de seconde, ce qui n'est pas un panoramique du tout. La piste est vraiment stéréo et le contenu diffus comme la pluie revient avec un champ large, mais les impacts discrets restent centrés quelle que soit la formulation. Si votre format a besoin d'un panoramique dur, faites-le en post-production.
Puis-je télécharger mon propre enregistrement comme référence vidéo ASMR MiniMax H3 ?
Oui, via reference-to-video, qui accepte jusqu'à 3 références audio en plus de jusqu'à 9 images et 3 vidéos. L'audio ne peut pas être soumis seul, donc associez-le à au moins une image ou une vidéo. L'audio doit également faire entre 2 et 15 secondes, et le format est validé : une charge utile .wav a fonctionné là où une audio/mpeg a été rejetée. Les requêtes rejetées ne sont pas facturées.
L'audio d'une vidéo ASMR MiniMax H3 en 768P est-il moins bon qu'en 2K ?
Non. Les deux paliers offrent la même spécification stéréo AAC 32 kHz. Seule l'image change, et elle change beaucoup : le 16:9 revient en 1344x768 en 768P contre 2560x1440 en 2K. Puisque le jugement créatif en ASMR est un jugement d'écoute, faites vos brouillons à 0,10 $/s et relancez les prises finales à 0,14 $/s. Rappelez-vous simplement que le passage en 2K est une nouvelle prise, pas une mise à l'échelle du brouillon.
Quelle doit être la durée d'une vidéo ASMR MiniMax H3 et quel rapport hauteur/largeur utiliser ?
La durée accepte n'importe quelle seconde entière de 4 à 15. Les clips de découpe et de mastication fonctionnent à 5 à 8 secondes car la récompense est un événement ; l'ambiance axée sur le sommeil veut 10 secondes ou plus. Pour les Shorts, Reels et TikTok, utilisez 9:16, et rappelez-vous que le texte-vers-vidéo nécessite que ratio soit défini explicitement et rejette adaptive. Sur l'image-vers-vidéo, la première image décide de la forme pour vous.
Combien coûte une vidéo ASMR MiniMax H3 ?
Un clip de 5 secondes coûte 0,50 $ en 768P et 0,70 $ en 2K. Un clip vertical de 8 secondes en 768P coûte 0,80 $. En publier un par jour revient à environ 24 $ par mois en calcul, ce qui est le chiffre à comparer avec les 20 minutes qu'un éditeur prendrait par clip sur le workflow assemblé.
Pourquoi ma vidéo ASMR MiniMax H3 sort-elle avec une musique de fond que je n'ai jamais demandée ?
Parce que vous ne l'avez pas interdite. La plupart des vidéos dans les données d'entraînement de n'importe quel modèle ont un fond musical, donc le comportement par défaut est d'en ajouter un, surtout quand rien ne se passe à l'écran. Mettez les négations dans la partie audio de l'instruction explicitement : pas de musique, pas de voix, pas de narration, pas de réverbération de pièce, pas de fond d'ambiance. Les modèles ambiants en ont besoin plus que les modèles d'action.






