Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

MiniMax H3 Vidéo ASMR : J'ai coupé une grenade en verre, puis j'ai mesuré si la stéréo était réelle

La plupart des ASMR générés par IA collent un son préenregistré sur une vidéo silencieuse. Une vidéo ASMR MiniMax H3 rend du stéréo 32 kHz en une seule passe. J'ai mesuré les canaux, avec les prompts et les coûts.

Mettez vos écouteurs avant de défiler jusqu'à la vidéo ci-dessous. Dans cette catégorie, ça compte vraiment.

Un couteau s'abat sur une grenade sculptée dans du verre rubis. La coque se fend, une fissure cristalline, puis quelques dizaines de graines de verre dégringolent sur de l'ardoise humide. Voici ce qui est différent de presque toutes les vidéos ASMR générées par IA que vous avez fait défiler cette année : personne n'a ajouté ce son. Il n'y avait ni bibliothèque sonore, ni monteur, ni timeline. L'image et l'audio sont sortis d'une seule génération, en un seul appel.

Depuis un an, l'ASMR par IA avait l'air satisfaisant et sonnait légèrement faux, et la raison n'était jamais visuelle. C'était la dernière étape du pipeline. Coller de l'audio sur une vidéo muette était un travail manuel, fait à la main, à chaque fois. La catégorie a tellement grandi autour de ce vide qu'une petite industrie de sites dédiés aux générateurs d'ASMR par IA est apparue, uniquement pour automatiser l'assemblage, l'un d'eux faisant la publicité d'un « audio 3D binaural » directement sur la page d'accueil. La demande était prouvée depuis longtemps. Elle était simplement servie par assemblage.

J'ai donc fait les choses correctement. Un workflow reproductible, six clips, puis la partie que personne ne fait jamais dans cette catégorie : j'ai séparé les canaux gauche et droit dans ffmpeg et je les ai mesurés. Une partie de ce que je pensais s'est avérée fausse, et cela s'est avéré être la chose la plus utile de l'article.

Points clés

  • H3 génère l'image en 24 fps et une piste stéréo AAC 32 kHz en un seul passage. L'audio est généré, pas ajouté après.
  • La stéréo est vraiment stéréo, pas du dual mono déguisé en stéréo. Mais vous ne pouvez pas piloter un panoramique. J'ai demandé un balayage de gauche à droite et j'ai obtenu une différence de 1,9 dB, ce qui est négligeable.
  • La largeur stéréo vient du contenu, pas de votre formulation. Le clip de pluie, où je n'ai demandé aucune direction, est revenu avec un champ vraiment large.
  • Verrouiller la première image conserve le plan d'une résolution à l'autre, mais 768P et 2K sont toujours deux prises différentes. Le brouillon prévisualise l'aspect et les spécifications sonores, pas la chorégraphie exacte.
  • Un clip de 5 secondes en 768P coûte 0,50 $. Le même clip en 2K coûte 0,70 $. L'article entier a coûté 4,27 $.

Écoutez d'abord : une vidéo ASMR MiniMax H3, coupée en un seul passage

w7ZRR7bo3KI

Cinq secondes, 2K, 24 fps, stéréo 32 kHz, une génération, 0,70 $. Activez le son : le grincement du bord qui mord, le craquement, puis les graines. Rien n'a été ajouté après. Généré avec minimax/h3/image-to-video.

Une seule instruction. Un seul modèle. Un seul appel. Tout ce qui suit explique comment ce clip a été réalisé, ce qu'il a coûté, et quelles parties du discours marketing survivent au contact avec une forme d'onde.

Pourquoi l'ASMR par IA a explosé, et pourquoi la plupart échouent au test du casque

La tendance a une date de naissance. L'ASMR par IA a commencé à se répandre en juin 2025, juste après l'arrivée de Veo 3, et le format est devenu viral en quelques jours. Un lava mukbang de @asmraiworks a dépassé les 11,3 millions de vues en une semaine ; un clip de découpe de verre a fait 5,3 millions en onze jours (Know Your Meme, 2025). Les rédactions l'ont repris comme une curiosité, avec des visuels surréalistes et de la lave en fusion mangée avec des baguettes qui faisaient l'essentiel du travail (The Express Tribune, 2025).

Puis les gens ont mis des écouteurs, et l'ambiance a changé. Le journaliste de TechRadar a regardé un tas de vidéos virales et en est ressorti en décrivant une couche d'artificialité, « manquant des erreurs et des imprécisions qui sont la marque de fabrique de l'ASMR fait par l'humain » (TechRadar, juin 2025). Les fans cités dans cet article disaient que les déclencheurs de picotements étaient techniquement présents, mais que ce n'était toujours pas pareil.

Il y a une raison mécanique, et elle n'est pas mystique. L'ASMR est la seule catégorie de contenu où le contenu est le son. Partout ailleurs, l'audio est une garniture. Ici, c'est le produit. Et le workflow dominant était :

  1. générer un clip muet avec un modèle vidéo,
  2. chercher dans une bibliothèque sonore un craquement, un crunch, un fond de pluie,
  3. aligner le son sur l'image dans un éditeur,
  4. équilibrer et mixer manuellement si on s'en soucie, ce que presque personne ne fait en volume,
  5. exporter.

L'étape 3 est celle où ça meurt. Un craquement préenregistré qui arrive deux images trop tard sonne faux avant même qu'on puisse expliquer pourquoi. Multipliez cela par un rythme de publication quotidien et les erreurs s'accumulent, car l'alignement est refait par un humain à chaque fois.

C'est ce vide qui explique pourquoi toute une industrie artisanale de sites générateurs d'ASMR par IA existe. Au moins trois font activement leur marketing et l'un d'eux met en avant l'audio 3D binaural comme fonctionnalité phare. Ils ne résolvent pas un problème artificiel. Ils colmatent un vrai trou : les modèles vidéo sous-jacents ne produisent pas de son.

Ce qui rend un classement intéressant à examiner. Sur le tableau de bord d'édition vidéo d'Artificial Analysis, celui noté avec audio, MiniMax H3 est #1 avec 1 126 Elo, devant Gemini Omni Flash à 1 119 et environ cent points devant Dreamina Seedance 2.0 à 1 027 (Artificial Analysis, août 2026). Sur les tableaux image-vers-vidéo, où l'audio n'entre pas dans le score, plusieurs de ces modèles sont à quelques points les uns des autres. L'écart se creuse quand le son compte. Pour l'ASMR, le son est tout ce qui compte.

Le workflow de vidéo ASMR MiniMax H3, et le coût de chaque étape

Trois endpoints, un onglet de navigateur. J'ai tout exécuté pour cet article sur Atlas Cloud, donc tous les chiffres ci-dessous proviennent de la facture, pas d'une grille tarifaire.

Tâche dans cet articleModèleTarif
Première image pour la vitrineOpenAI GPT Image 2 (texte-vers-image)à partir de 0,009 $/image, facturé 0,1745 $ en haute et 2048x1152
Brouillon et prise finaleMiniMax H3 Image-vers-Vidéo0,10 $/s en 768P, 0,14 $/s en 2K
Ajout d'un enregistrement réelMiniMax H3 Référence-vers-Vidéomêmes deux paliers
Les trois modèlesMiniMax H3 Texte-vers-Vidéomêmes deux paliers
L'ancienne méthode, moitié audio seulementByteDance Seed Audio 1.00,143 $/min

La liste indique « À partir de 0,1 $/SEC » sur les trois endpoints H3. C'est le prix plancher en 768P. La 2K est facturée à 0,14 $/s et ce chiffre n'apparaît nulle part sauf sur votre facture, donc planifiez en fonction du palier que vous demandez réellement.

Tableau 1 : un passage contre le pipeline assemblé.

 MiniMax H3, audio natifModèle muet plus audio en post-production
Étapes pour un clip fini14 à 5
Outils impliqués1modèle vidéo + bibliothèque sonore + éditeur + export
Comment l'image et le son restent synchronisésmême génération, même timelinevous le glissez jusqu'à ce que ça semble correct
Qui mixe et pannepersonne, vous prenez ce que le modèle donnevous, à la main, par son
Temps humain par clipquasiment zéro après l'instruction15 à 40 minutes, honnêtement
Calcul pour un clip de 5s0,50 $ en 768Pmodèle vidéo + 0,143 $/min de génération audio

Je ne cite volontairement pas le tarif par seconde d'une plateforme vidéo concurrente, car le calcul n'est pas là où se situe la différence. La génération audio coûte 0,143 $ la minute, soit quelques centimes. Le vrai coût du pipeline assemblé est de 20 minutes d'attention humaine par clip, et ce coût ne diminue pas quand on monte en échelle. Il se multiplie. Un compte sans visage qui publie quotidiennement est exactement là où 20 minutes par clip grignotent silencieusement tout le modèle économique.

Le contrepoint honnête : l'assemblage manuel vous donne du contrôle. Vous pouvez placer un son n'importe où dans le champ stéréo et le caler sur l'image. H3 vous donne la synchronisation gratuitement et, comme le montrent les mesures ci-dessous, ne vous rend pas ce contrôle.

Tableau 2 : les trois endpoints H3, les paramètres qui comptent vraiment.

 image-vers-vidéotexte-vers-vidéoréférence-vers-vidéo
Entrée principaleimage (première image)instruction uniquementrefers[]
Résolution768P / 2K, défaut 2Kidemidem
Duréen'importe quelle seconde entière de 4 à 15, défaut 8idemidem
Ratiodéterminé par la première imagedoit être défini explicitement, « adaptatif » est rejetédéterminé par les références
Limites des refersnon utilisé avec une imagenon utiliséjusqu'à 9 images, 3 vidéos, 3 audios
Sortie 16:9 livrée1344x768 en 768P, 2560x1440 en 2Kidemidem
Piste audioAAC stéréo 32 kHz sur vidéo 24 fpsidemidem

Deux pièges de paramètres qui valent la peine d'être notés sur votre main. Le paramètre s'appelle ratio, pas aspect_ratio, et la mauvaise clé le laisse non défini, donc le texte-vers-vidéo rejette la requête. Et image plus refers dans le même appel ne génère pas d'erreur : ça se termine, ça facture intégralement, et ça jette silencieusement l'une des deux entrées.

Tutoriel vidéo ASMR MiniMax H3 : découper une grenade en verre

La découpe de fruits en verre est le format que tout le monde reconnaît, donc le lecteur sait immédiatement ce qu'il regarde. Les pommes en verre et les mangues en verre ont été faites à satiété, cependant. Une grenade est meilleure pour une raison précise : quand la coque se fend, des centaines de graines de verre se déversent et roulent, donc le son a une durée et une structure au lieu d'être un seul impact centré. Si un modèle simule son audio, une dispersion est l'endroit où ça se voit.

Étape 1 : Construire l'image de base avec GPT Image 2

Verrouillez la composition avant de dépenser quoi que ce soit en vidéo. Paramètres : quality: high, size: 2048x1152 (16:9), output_format: png.

plaintext
1Photographie macro en très gros plan d'une grenade entière sculptée entièrement dans du
2verre rubis translucide épais, reposant sur une dalle d'ardoise noire humide. La coque
3en verre a 8 mm d'épaisseur avec des bulles internes visibles et des facettes ébréchées ;
4des centaines de minuscules graines de verre brillent à l'intérieur comme des cristaux
5de grenat. Un couteau santoku japonais poli repose sur le bord gauche du cadre, la
6pointe de la lame touchant juste la peau de verre. Une lumière dure provenant du coin
7supérieur droit balaie la dalle et projette des caustiques rouges aiguës sur la pierre
8humide. Macro 100 mm, f/2.8, faible profondeur de champ, fond sombre et atmosphérique.
9Pas de mains, pas de texte, pas de filigrane, pas de logo.

Interface de générateur d'images IA montrant une instruction textuelle et une image générée

Bac à sable GPT Image 2 sur Atlas Cloud avec la qualité réglée sur haute et la taille 16:9 2048x1152, la grenade en verre rendue dans le panneau OUTPUT

Le vrai passage. Qualité high en 2048x1152, et la page indique 0,1745 $, ce que la facture a aussi confirmé plus tard.

Lame de couteau coupant une grenade en verre rouge translucide sur pierre sombre

L'image de base générée : une grenade sculptée dans du verre rubis épais sur de l'ardoise noire humide, un couteau santoku entrant par le bord gauche

L'image transmise à H3. Généré avec openai/gpt-image-2/text-to-image.

Étape 2 : Rédiger la partie sonore de l'instruction de la vidéo ASMR MiniMax H3

La plupart des gens écrivent une instruction ASMR comme une description d'image avec le mot « ASMR » collé devant, puis se demandent pourquoi le modèle la note avec un piano lo-fi. H3 prend les directions audio au sérieux si vous lui en donnez. Structurez la partie audio en cinq créneaux :

  1. Matériau. Ce qui produit le son. Verre, cire, roche en fusion, eau sur verre. Soyez précis sur l'épaisseur et l'humidité, cela change le timbre.
  2. Action et sa forme dans le temps. Pas seulement « coupe » mais « appuie en un seul mouvement continu lent ». Le modèle utilise cela pour placer les événements.
  3. Perspective du micro.close-mic, intime, indices de distance d'enregistrement. Cela définit le degré de sécheresse et de proximité du son, et cela fonctionne bien.
  4. Séquence d'onomatopées. Épelez les événements sonores dans l'ordre : grincement, puis craquement, puis des dizaines de petits impacts, puis silence. C'est le créneau qui fait le plus de travail.
  5. Négations.pas de musique, pas de voix, pas de narration, pas de réverbération de pièce, pas de fond d'ambiance. Sans cela, H3 ajoutera volontiers une musique de fond, car la plupart des vidéos dans ses données d'entraînement en ont une.

J'ai aussi écrit des directions de canaux dans le créneau 4, demandant le craquement dans le canal gauche et les graines roulant de gauche à droite. Lisez la suite pour voir ce que cela a réellement produit.

Étape 3 : Lancer le brouillon en 768P

Brouillon en 768P. La piste audio est la même spécification aux deux paliers, donc tout le jugement créatif, qui en ASMR est un jugement d'écoute, peut être fait au tarif le moins cher.

Paramètres sur minimax/h3/image-to-video : image = la sortie de l'étape 1, resolution: 768P, duration: 5. Le ratio vient de la première image, donc laissez-le tranquille.

plaintext
1La lame du santoku entre par la gauche et appuie sur la grenade en verre en un seul
2mouvement continu lent, se déplaçant de gauche à droite dans le cadre. La coque se
3fend avec un craquement cristallin vif et une gerbe de minuscules graines de verre
4dégringole sur l'ardoise humide, se dispersant vers le bord droit. Caméra fixe, macro,
5prise unique, aucun cut.
6
7Audio : ASMR, micro rapproché, intime, pas de musique, pas de voix, pas de narration,
8pas de réverbération de pièce. Un grincement sec et soutenu du verre lorsque le bord
9mord, puis un craquement aigu et net dans le canal GAUCHE, suivi de dizaines de petits
10impacts tintants de graines roulant du canal GAUCHE vers le canal DROIT en se dispersant.
11Un faible raclement lame-sur-pierre à la toute fin, puis silence. Pas de fond d'ambiance,
12pas de bourdonnement, pas de musique de fond.

Interface de générateur vidéo IA montrant une vidéo de grenade en verre

Bac à sable MiniMax H3 image-vers-vidéo sur Atlas Cloud avec l'image de base chargée, durée 5, et un clip terminé dans le panneau OUTPUT

Le passage image-vers-vidéo : première image chargée, durée 5, OUTPUT terminé. Notez que le sélecteur de résolution est sur la valeur par défaut de la page en 2K. Passez-le en 768P pour les brouillons, ce qui a été utilisé pour le clip ci-dessous.

xkolGEKI7UI

Le brouillon en 768P, 0,50 $. Image plus douce que le clip principal, mêmes spécifications audio. C'est la prise sur laquelle toute la décision est prise.

Étape 4 : Mesurer la stéréo avant de lui faire confiance

Ne me croyez pas sur parole pour le son, et ne croyez pas non plus le modèle. Séparez les canaux et regardez. Ceci est en ffmpeg local, pas d'appel API, aucun coût :

plaintext
1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \
2  -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \
3  -frames:v 1 stereo-proof.png

Comparaison de formes d'onde de la séparation des canaux stéréo dans deux clips audio ASMR

Analyse de forme d'onde en quatre panneaux comparant le clip de grenade en verre et le clip de pluie, montrant les canaux gauche et droit ainsi que le canal latéral pour chacun

Canal gauche sur canal droit pour deux clips, plus le canal latéral (gauche moins droit) à gain égal en dessous. C'est tout l'argument en une image.

Voici ce qui est revenu, et une partie n'est pas ce à quoi je m'attendais.

La stéréo est réelle. Le canal latéral n'est vide sur aucun clip que j'ai généré. Un fichier dual mono déguisé en stéréo ne montrerait rien là. Celui-ci a du contenu.

Mais vous ne pouvez pas piloter un panoramique. J'ai demandé, en lettres majuscules, le craquement dans le canal GAUCHE et les graines roulant de GAUCHE à DROITE. Mesuré : corrélation des canaux 0,97, canal latéral à 17,7 dB en dessous du canal central, et la plus grande différence de niveau gauche-droite dans n'importe quelle fenêtre d'un quart de seconde est de 1,9 dB. Ce n'est pas un panoramique. C'est une image centrée avec une petite largeur naturelle. Le couteau se déplace dans le cadre ; le son reste en place.

La largeur vient du contenu, pas de votre formulation. Le clip de pluie dans la section suivante, où je n'ai demandé aucune direction, est revenu avec une corrélation de 0,32 et le canal latéral seulement 2,9 dB en dessous du canal central. C'est un champ vraiment large et décorrélé. L'ambiance diffuse obtient automatiquement une largeur. Les impacts discrets restent près du centre, quoi que vous écriviez.

Donc la revendication honnête pour ce modèle n'est pas spatiale. Elle est temporelle. Vous obtenez un son qui a été généré en même temps que l'image et qui arrive sur l'image à laquelle il appartient, gratuitement, pour toujours, sans éditeur. Si votre format a vraiment besoin d'un panoramique dur, vous devez toujours le faire vous-même en post-production, et vous devriez arrêter d'écrire des noms de canaux dans les instructions car ils ne servent à rien.

Maintenant, relancez la prise finale : même endpoint, même première image, même instruction, changez un champ en resolution: 2K. Une chose de plus à savoir avant de supposer que le brouillon est une prévisualisation.

Comparaison de deux résolutions vidéo coupant une grenade en verre

Deux rangées de cinq images comparant les passages en 768P et 2K aux mêmes timestamps, identiques à l'image zéro et divergeant à partir d'environ 2,5 secondes

Même première image, même instruction, les deux paliers. L'image 0 correspond exactement. À 2,5 s, la coque se brise différemment et les deux clips sont devenus des prises différentes.

Verrouiller la première image maintient la composition, le cadrage, l'éclairage et la couleur sur les deux paliers, c'est pourquoi vous devriez toujours utiliser image-vers-vidéo plutôt que texte-vers-vidéo pour cela. Cela ne vous donne pas la même prise. Le passage en 2K relance l'action. Traitez le brouillon comme une prévisualisation de l'aspect et du son, pas de la chorégraphie exacte.

Étape 5 : Ajouter un enregistrement réel comme référence vidéo ASMR MiniMax H3

Si vous avez un son que vous voulez vraiment, transmettez-le. reference-to-video accepte jusqu'à 9 images, 3 vidéos et 3 clips audio, et il extrait le timbre et le caractère de la pièce d'une référence audio au lieu de les inventer. J'ai utilisé un enregistrement de bris de verre compatible domaine public par Gravity Sound de Wikimedia Commons (CC BY 4.0), trois prises concaténées pour faire 4,5 secondes.

Trois règles, et j'ai découvert les deux dernières à mes dépens en voyant des requêtes rejetées :

  • L'audio ne peut pas aller seul. L'endpoint le précise : au moins une image ou une vidéo est requise, et l'audio seul n'est pas autorisé. Associez-le à une image.
  • La référence audio doit faire entre 2 et 15 secondes. Ma première tentative utilisait un clip de 1,49 seconde et m'a renvoyé audio duration 1486 ms, expected [2000, 15000] ms. Cette plage n'est pas sur la page du modèle.
  • Le format du fichier est vérifié. Une charge utile base64 déclarée comme audio/mpeg a été rejetée avec audio format ".mpeg" not allowed. Une charge utile .wav est passée. Les requêtes rejetées ne sont pas facturées, mais elles vous coûtent un aller-retour.

Paramètres : refers: [{url: <image de base>, type: "image"}, {url: <un enregistrement de 2 à 15s>, type: "audio"}], resolution: 768P, duration: 5.

plaintext
1Même plan macro fixe : la lame tranche la grenade en verre de gauche à droite et les
2graines se dispersent. Correspondre au timbre, à la brillance et au caractère de la
3pièce de l'audio de référence, même distance d'enregistrement, même sécheresse. ASMR
4micro rapproché, pas de musique, pas de voix.

Interface de générateur vidéo IA montrant une instruction et une vidéo de grenade générée

Bac à sable MiniMax H3 référence-vers-vidéo sur Atlas Cloud avec deux matériaux de référence chargés, un fichier audio dans l'emplacement 1 et l'image de base dans l'emplacement 2

Matériaux de référence contenant le fichier audio et l'image ensemble, 2 sur 9 utilisés. Enlevez l'image et la requête ne s'exécutera pas du tout.

mY1VrOfM3cM

La prise guidée par référence, 0,50 $. Même plan, timbre orienté par un enregistrement réel plutôt qu'inventé à partir de l'instruction. Référence audio : bris de verre par Gravity Sound, CC BY 4.0.

Trois modèles de vidéos ASMR MiniMax H3 : découpe, mastication, pluie

Trois formats couvrent la plupart de ce qui fonctionne dans cette catégorie. Chacun est une instruction complète à copier-coller avec les paramètres et le clip qu'il a produit. Volontairement pas de verre, pas de rouge, pas d'ardoise ci-dessous : si chaque clip de votre compte se ressemble, l'algorithme les traite comme le même clip.

Tableau 3 : les mêmes cinq créneaux, trois tâches différentes.

CréneauModèle 1, La découpeModèle 2, La masticationModèle 3, La pluie
Matériaurayon de miel qui goutte, lame en acier chaudroche en fusion incandescente, bol en pierrepluie sur vitre de voiture
Forme de l'actionla lame s'enfonce d'avant en arrière, le miel tire vers le basles baguettes soulèvent, puis deux bouchéesaucune action de sujet, seulement les gouttelettes
Perspective du micromicro rapproché, très sec, sans pièceextrêmement proche, intimeà l'extérieur de la vitre, habitacle assourdi
Séquence sonorecraquement de cire, étirement du miel, goutte sur l'assiettegrésillement de lave fondue, mastication humide, croquant vitreux, expirationfond de pluie régulier, impact de gouttelette, sifflement de pneu lointain
Négationspas de musique, pas de voix, pas de réverbération de piècepas de mots, pas de musique, pas de narrationpas de musique, pas de tonnerre, pas de voix, pas d'essuie-glaces

Modèle 1, La découpe. Rayon de miel, ambre et or, 9:16, 768P, 6 secondes, ratio: "9:16".

plaintext
1Macro extrême, vue de dessus fixe d'une épaisse plaque de rayon de miel doré sur une
2assiette en céramique pâle, du miel s'accumulant déjà autour. Une lame en acier chaud
3s'abaisse dans la cire et s'enfonce d'avant en arrière en une seule pression continue
4lente ; les faces de coupe s'affaissent et un épais filet de miel s'étire et goutte sur
5l'assiette. Lumière chaude ambrée venant de la gauche, faible profondeur de champ,
6prise unique, pas de cut, pas de mains dans le cadre.
7
8Audio : ASMR, micro rapproché, très sec, pas de réverbération de pièce, pas de musique,
9pas de voix, pas de narration. Un léger crépitement de la cire qui se fend sous la lame,
10puis un bruit d'étirement grave et épais alors que le miel s'allonge, puis deux gouttes
11lourdes et humides atterrissant sur l'assiette en céramique. Rien d'autre.

ZsVmf9AhPnw

Modèle 1, 0,60 $. Craquement de cire, étirement du miel, goutte. Généré avec minimax/h3/text-to-video.

Modèle 2, La mastication. Lava mukbang, le format qui a fait 11,3 millions de vues en une semaine, 9:16, 768P, 8 secondes, ratio: "9:16".

plaintext
1Gros plan vertical : une paire de baguettes laquées noires soulève un morceau incandescent
2de lave orange en fusion d'un bol en pierre sombre et le porte vers la caméra, hors cadre
3en bas. La lave s'illumine d'elle-même, projetant une lumière orange sur tout ce qui
4l'entoure ; le reste de la pièce est presque noir. De la vapeur s'élève de la surface.
5Caméra fixe, prise unique, pas de cut.
6
7Audio : ASMR, micro extrêmement rapproché, intime, pas de mots, pas de musique, pas de
8narration, pas de son de pièce. Un léger grésillement de lave et des bulles alors que
9la lave est soulevée, puis une mastication douce et humide, puis un croquant vitreux
10plus brillant sur la deuxième bouchée, puis une expiration lente et satisfaite. Pas de parole.

UJhEsTnKkZI

Modèle 2, 0,80 $. Grésillement, mastication, croquant, expiration, et pas un mot. Généré avec minimax/h3/text-to-video.

Modèle 3, La pluie. Vitre de voiture de nuit, bleu froid et néon, 16:9, 768P, 10 secondes, ratio: "16:9".

C'est le seul des trois sans action de sujet, et il enseigne le plus sur les négations. Sans rien qui se passe à l'écran, H3 cherche un fond musical à moins que vous ne l'interdisiez explicitement. C'est aussi le clip qui est revenu avec le champ stéréo de loin le plus large, sans qu'on le lui demande. Le contenu axé sur le sommeil veut de la longueur, donc celui-ci se situe près du haut de la plage de durée utile.

plaintext
1Plan macro à travers l'intérieur d'une vitre de voiture la nuit, forte pluie coulant à
2l'extérieur du verre. Des gouttelettes individuelles frappent, hésitent, puis filent
3vers le bas et fusionnent. Au-delà du verre, une enseigne au néon floue se brise en
4bokeh bleu froid et magenta. Pas d'essuie-glaces, pas de personnes, pas de mouvement
5à l'intérieur de la voiture. Caméra fixe, prise unique continue, faible profondeur de
6champ, pas de cut.
7
8Audio : ASMR, micro rapproché à l'extérieur du verre, habitacle légèrement assourdi.
9Un fond de pluie régulier et égal avec des impacts de gouttelettes individuelles
10clairement séparés sur le verre, plus un faible sifflement lointain de pneus sur une
11route mouillée. Pas de musique, pas de tonnerre, pas de voix, pas de narration,
12pas de bruit d'essuie-glace.

bUKr5V6wbdM

Modèle 3, 1,00 $. Dix secondes d'ambiance pure, pas de bande sonore car l'instruction en interdisait une. Généré avec minimax/h3/text-to-video.

Ce que coûte réellement une vidéo ASMR MiniMax H3

Voici la facture pour cet article, pas une estimation.

ÉlémentNombreFacturé
Image de base GPT Image 2, haute, 2048x115210,17 $
Prise finale 2K, 5s, image-vers-vidéo10,70 $
Brouillon 768P, 5s, image-vers-vidéo10,50 $
Référence-vers-vidéo 768P, 5s10,50 $
Clips modèles en 768P, 6s + 8s + 10s32,40 $
Requêtes de référence rejetées20,00 $
Total 4,27 $

Six clips publiable et une image de base. Mettez à l'échelle pour un rythme : un clip vertical de 8 secondes par jour en 768P coûte 0,80 $, soit environ 24 $ par mois pour un compte sans visage qui publie quotidiennement, avant de passer une minute dans un éditeur.

Deux notes de facturation. Le prix listé de GPT Image 2 à 0,009 $ est un plancher de palier de tokens ; un rendu haute qualité en 2048x1152 atterrit à 0,1745 $, soit près de vingt fois plus, donc budgetez en fonction du palier que vous utilisez réellement. Et le champ price de H3 se met à jour avec un délai : interrogez jusqu'à ce que status soit completed et il est souvent encore undefined. Interrogez à nouveau l'ID de prédiction un instant plus tard pour le chiffre réel. Cette deuxième interrogation est le seul moyen d'obtenir une facture comme celle-ci au lieu d'une estimation.

Une note honnête sur l'audio ASMR et les droits

Ne téléchargez pas l'enregistrement ASMR de quelqu'un d'autre comme fichier audio refers. La référence transfère réellement le timbre dans la sortie, et passer un enregistrement dans un modèle ne change pas qui en est propriétaire. La référence utilisée ici est sous CC BY 4.0 et créditée ci-dessus, ce qui a pris environ deux minutes à trouver.

Ne construisez pas d'ASMR autour de la voix reconnaissable d'une personne réelle. Chaque modèle de cet article est volontairement sans voix, ce qui est à la fois la convention du genre et le chemin le moins compliqué.

Appeler H3 via une API n'est pas affecté par la licence communautaire attachée aux poids ouverts. Cette licence, qui couvre l'auto-hébergement, exclut actuellement l'UE, le Royaume-Uni, la Corée et les États-Unis, et un canal de licence formel est ouvert pour ces territoires. Bon à savoir, pas de quoi s'inquiéter si vous utilisez l'endpoint.

Vidéo ASMR MiniMax H3 : Foire aux questions

Une vidéo ASMR MiniMax H3 génère-t-elle son propre son, ou dois-je l'ajouter après ?

Le modèle le génère. L'image et l'audio sortent du même passage : vidéo 24 fps avec une piste stéréo AAC à 32 kHz dans le fichier livré. Il n'y a pas d'étape audio séparée, pas de bibliothèque sonore et pas de travail d'alignement, ce qui est la raison même pour laquelle cet endpoint est intéressant spécifiquement pour l'ASMR.

Puis-je faire en sorte qu'une vidéo ASMR MiniMax H3 effectue un panoramique de gauche à droite ?

Pas en le demandant. J'ai écrit des directions de canaux explicites dans l'instruction et mesuré le résultat : corrélation de 0,97 entre les canaux et une différence de niveau maximale de 1,9 dB dans n'importe quelle fenêtre d'un quart de seconde, ce qui n'est pas un panoramique du tout. La piste est vraiment stéréo et le contenu diffus comme la pluie revient avec un champ large, mais les impacts discrets restent centrés quelle que soit la formulation. Si votre format a besoin d'un panoramique dur, faites-le en post-production.

Puis-je télécharger mon propre enregistrement comme référence vidéo ASMR MiniMax H3 ?

Oui, via reference-to-video, qui accepte jusqu'à 3 références audio en plus de jusqu'à 9 images et 3 vidéos. L'audio ne peut pas être soumis seul, donc associez-le à au moins une image ou une vidéo. L'audio doit également faire entre 2 et 15 secondes, et le format est validé : une charge utile .wav a fonctionné là où une audio/mpeg a été rejetée. Les requêtes rejetées ne sont pas facturées.

L'audio d'une vidéo ASMR MiniMax H3 en 768P est-il moins bon qu'en 2K ?

Non. Les deux paliers offrent la même spécification stéréo AAC 32 kHz. Seule l'image change, et elle change beaucoup : le 16:9 revient en 1344x768 en 768P contre 2560x1440 en 2K. Puisque le jugement créatif en ASMR est un jugement d'écoute, faites vos brouillons à 0,10 $/s et relancez les prises finales à 0,14 $/s. Rappelez-vous simplement que le passage en 2K est une nouvelle prise, pas une mise à l'échelle du brouillon.

Quelle doit être la durée d'une vidéo ASMR MiniMax H3 et quel rapport hauteur/largeur utiliser ?

La durée accepte n'importe quelle seconde entière de 4 à 15. Les clips de découpe et de mastication fonctionnent à 5 à 8 secondes car la récompense est un événement ; l'ambiance axée sur le sommeil veut 10 secondes ou plus. Pour les Shorts, Reels et TikTok, utilisez 9:16, et rappelez-vous que le texte-vers-vidéo nécessite que ratio soit défini explicitement et rejette adaptive. Sur l'image-vers-vidéo, la première image décide de la forme pour vous.

Combien coûte une vidéo ASMR MiniMax H3 ?

Un clip de 5 secondes coûte 0,50 $ en 768P et 0,70 $ en 2K. Un clip vertical de 8 secondes en 768P coûte 0,80 $. En publier un par jour revient à environ 24 $ par mois en calcul, ce qui est le chiffre à comparer avec les 20 minutes qu'un éditeur prendrait par clip sur le workflow assemblé.

Pourquoi ma vidéo ASMR MiniMax H3 sort-elle avec une musique de fond que je n'ai jamais demandée ?

Parce que vous ne l'avez pas interdite. La plupart des vidéos dans les données d'entraînement de n'importe quel modèle ont un fond musical, donc le comportement par défaut est d'en ajouter un, surtout quand rien ne se passe à l'écran. Mettez les négations dans la partie audio de l'instruction explicitement : pas de musique, pas de voix, pas de narration, pas de réverbération de pièce, pas de fond d'ambiance. Les modèles ambiants en ont besoin plus que les modèles d'action.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles