Seedance 2.5 is nu live — Als eerste op Atlas Cloud

MiniMax H3 ASMR Video: Ik sneed een glazen granaatappel, daarna mat ik of de stereo echt was

De meeste AI ASMR plakt standaardgeluid op stille video. Een MiniMax H3 ASMR-video rendert 32 kHz stereo in één keer. Ik heb de kanalen gemeten, met prompts en kosten.

Zet een koptelefoon op voordat je naar de onderstaande clip scrollt. In deze categorie maakt het echt uit.

Een mes daalt neer door een granaatappel die uit robijnglas is gesneden. De schil splijt, een kristallijne barst, en dan rollen een paar dozijn glazen pitjes over natte leisteen. Dit is het deel dat anders is dan bijna elke AI-ASMR-clip waar je dit jaar langs bent gescrolld: niemand heeft dat geluid toegevoegd. Er was geen geluidsbibliotheek, geen editor, geen tijdlijn. Het beeld en de audio kwamen uit één enkele generatie, in één enkele aanroep.

Het afgelopen jaar zag AI ASMR er bevredigend uit en klonk het net niet helemaal goed, en de reden lag nooit aan de beelden. Het was de laatste stap in de pijplijn. Het plakken van audio op een stille clip was een handmatige klus, elke keer opnieuw met de hand gedaan. De categorie groeide zo snel rond die kloof dat er een kleine industrie van speciale AI-ASMR-generatorsites ontstond, puur om het aan elkaar naaien te automatiseren; een van hen adverteert met "binaural 3D audio" op de homepage. De vraag was al lang bewezen. Het werd alleen via een assemblageproces bediend.

Dus ik heb het ding goed uitgevoerd. Eén reproduceerbare workflow, zes clips, en dan het deel dat niemand in deze categorie ooit doet: ik heb de linker- en rechterkanalen in ffmpeg uit elkaar gehaald en gemeten. Sommige dingen die ik verwachtte bleken onjuist, en dat bleek het nuttigste deel van het artikel te zijn.

Belangrijkste conclusies

  • H3 rendert het 24 fps beeld en een 32 kHz AAC stereo track in dezelfde pass. De audio wordt gegenereerd, niet later toegevoegd.
  • De stereo is echt stereo, niet dual mono in een stereovermomming. Maar je kunt geen panning aansturen. Ik vroeg om een harde links-naar-rechts sweep en kreeg een verschil van 1,9 dB, wat niets is.
  • Stereobreedte komt van de inhoud, niet van je bewoording. De regenclip, waarbij ik geen richting vroeg, kwam terug met een echt breed veld.
  • Het vastzetten van het eerste beeld houdt de opname consistent over resoluties, maar 768P en 2K zijn nog steeds verschillende takes. De draft geeft een voorproefje van het uiterlijk en de geluidsspecificatie, niet van de exacte choreografie.
  • Een 5 seconden durende 768P-clip kost $0,50. Dezelfde clip op 2K kost $0,70. Het hele artikel kostte $4,27.

Luister eerst: een MiniMax H3 ASMR-video, in één pass geknipt

w7ZRR7bo3KI

Vijf seconden, 2K, 24 fps, 32 kHz stereo, één generatie, $0,70. Geluid aan: het piepen van de rand die erin snijdt, de barst, dan de pitjes. Niets ervan is later toegevoegd. Gegenereerd met minimax/h3/image-to-video.

Eén prompt. Eén model. Eén aanroep. Alles hieronder beschrijft hoe die clip is gemaakt, wat het kostte, en welke delen van de marketingstory het overleven bij contact met een golfvorm.

Waarom AI ASMR explodeerde, en waarom het meeste de koptelefoontest niet doorstaat

De trend heeft een verjaardag. AI ASMR begon zich te verspreiden in juni 2025, direct nadat Veo 3 landde, en het formaat ging binnen dagen viral. Een lava-mukbang van @asmraiworks trok in een week meer dan 11,3 miljoen weergaven; een glas-snijclip deed er 5,3 miljoen in elf dagen (Know Your Me, 2025). Nieuwsredacties pikten het op als curiositeit, met surrealistische beelden en met eetstokjes gegeten gesmolten lava die het zware werk deden (The Express Tribune, 2025).

Toen zetten mensen een koptelefoon op, en de stemming veranderde. TechRadar's schrijver bekeek een stapel van de virale clips en kwam weg met een beschrijving van een laagje kunstmatigheid: "het ontbreekt aan de fouten en onnauwkeurigheden die het kenmerk zijn van menselijke ASMR" (TechRadar, juni 2025). Fans die in dat artikel worden geciteerd, zeiden dat de tintel-triggers technisch aanwezig waren, maar dat het nog steeds niet hetzelfde was.

Er is een mechanische reden, en die is niet mystiek. ASMR is de enige inhoudscategorie waar de inhoud het geluid is. Overal elders is audio een garnering. Hier is het het product. En de dominante workflow was:

  1. een stille clip genereren met een videomodel,
  2. een geluidsbibliotheek doorzoeken op een barst, een knars, een regentapijt,
  3. het geluid in een editor synchroniseren met het beeld,
  4. handmatig pannen en mixen als je er om geeft, wat bijna niemand doet op schaal,
  5. exporteren.

Stap 3 is waar het misgaat. Een ingeblikte barst die twee frames te laat inslaat, voelt nep aan voordat je kunt uitleggen waarom. Vermenigvuldig dat met een dagelijks publicatieschema en de fouten stapelen zich op, omdat de uitlijning elke keer opnieuw door een mens wordt gedaan.

Die kloof is de reden waarom een hele cottage-industrie van AI-ASMR-generatorsites bestaat. Er zijn er minstens drie actief mee bezig, en één leidt met binaural 3D audio als kopzinnige functie. Ze lossen geen nep-probleem op. Ze repareren een echt gat: de onderliggende videomodellen produceren geen geluid.

Wat een blik op één leaderboard de moeite waard maakt. Op Artificial Analysis's video-editing board, het board dat met audio wordt gescoord, staat MiniMax H3 op #1 met 1.126 Elo, voor Gemini Omni Flash met 1.119 en ruwweg honderd punten boven Dreamina Seedance 2.0 met 1.027 (Artificial Analysis, augustus 2026). Op de image-to-video boards, waar audio geen deel uitmaakt van de score, zitten verschillende van die modellen binnen een paar punten van elkaar. De kloof ontstaat wanneer geluid telt. Voor ASMR telt alleen geluid.

De MiniMax H3 ASMR-video-workflow, en wat elke stap kost

Drie endpoints, één browsertabblad. Ik heb alles in dit artikel op Atlas Cloud uitgevoerd, dus elk cijfer hieronder kwam van de factuur, niet van een tariefkaart.

Taak in dit artikelModelTarief
Eerste frame voor de showcaseOpenAI GPT Image 2 (text-to-image)vermeld vanaf $0,009/afbeelding, gefactureerd $0,1745 bij high en 2048x1152
Draft en keeperMiniMax H3 Image-to-Video$0,10/s bij 768P, $0,14/s bij 2K
Een echte opname invoerenMiniMax H3 Reference-to-Videodezelfde twee lagen
De drie sjablonenMiniMax H3 Text-to-Videodezelfde twee lagen
De oude manier, alleen audiodeelByteDance Seed Audio 1.0$0,143/min

De vermelding toont "Vanaf $0,1/SEC" op alle drie H3-endpoints. Dat is de 768P-vloer. 2K wordt gefactureerd tegen $0,14/s en dat getal verschijnt nergens behalve op je factuur, dus plan rond de laag die je daadwerkelijk aanvraagt.

Tabel 1: één pass versus de aan elkaar genaaide pijplijn.

 MiniMax H3, native audioStil model plus post-audio
Stappen naar een afgewerkte clip14 tot 5
Betrokken tools1videomodel + geluidsbibliotheek + editor + export
Hoe beeld en geluid synchroon blijvenzelfde generatie, zelfde tijdlijnjij sleept het tot het er goed uitziet
Wie mixt en pántniemand, je neemt wat het model geeftjij, met de hand, per geluid
Menselijke tijd per clipongeveer nul na de prompt15 tot 40 minuten, eerlijk gezegd
Rekenkracht per 5s-clip$0,50 bij 768Pvideomodel + $0,143/min aan audiogeneratie

Ik citeer bewust geen per-seconde-tarief van een concurrerend videoplatform, omdat rekenkracht niet de plek is waar het verschil zit. Audiogeneratie kost $0,143 per minuut, wat centen zijn. De echte kosten van de aan elkaar genaaide pijplijn zijn 20 minuten menselijke aandacht per clip, en die kosten dalen niet naarmate je opschaalt. Ze vermenigvuldigen. Een gezichtloos account dat dagelijks plaatst, is precies waar 20 minuten per clip stilletjes het hele verdienmodel opeet.

Het eerlijke tegenwicht: handmatig aan elkaar naaien geeft je controle. Je kunt een geluid overal in het stereoveld plaatsen en het tot het frame trimmen. H3 geeft je de synchronisatie gratis en, zoals de metingen hieronder laten zien, geeft je die controle niet terug.

Tabel 2: de drie H3-endpoints, de parameters die er echt toe doen.

 image-to-videotext-to-videoreference-to-video
Hoofdingangimage (eerste frame)alleen promptrefers[]
resolutie768P / 2K, standaard 2Khetzelfdehetzelfde
duurelk geheel getal van 4 tot 15, standaard 8hetzelfdehetzelfde
beeldverhoudingbepaald door het eerste framemoet expliciet worden ingesteld, adaptive wordt geweigerdbepaald door de referenties
refers-limietenniet samen met image gebruiktniet gebruikttot 9 afbeeldingen, 3 video's, 3 audio
Afgeleverde 16:9 output1344x768 bij 768P, 2560x1440 bij 2Khetzelfdehetzelfde
AudiospoorAAC stereo 32 kHz over 24 fps videohetzelfdehetzelfde

Twee parametervallen die het waard zijn om op je hand te schrijven. De parameter heet ratio, niet aspect_ratio, en de verkeerde sleutel laat het oningesteld zodat text-to-video het verzoek afwijst. En image plus refers in dezelfde aanroep geeft geen foutmelding: het wordt voltooid, volledig gefactureerd, en gooit stilletjes één van de twee ingangen weg.

MiniMax H3 ASMR-video-tutorial: een glazen granaatappel snijden

Het snijden van glasfruit is het formaat dat iedereen herkent, dus de lezer weet meteen waar ze naar kijken. Glazen appels en glazen mango's zijn echter al dood gedaan. Een granaatappel is om één specifieke reden beter: wanneer de schil splijt, rollen er honderden glazen pitjes uit, dus het geluid heeft duur en structuur in plaats van één gecentreerde impact. Als een model zijn audio vervalst, is een verstrooiing waar het zichtbaar wordt.

Stap 1: Bouw het basiskader met GPT Image 2

Zet de compositie vast voordat je geld uitgeeft aan video. Instellingen: quality: high, size: 2048x1152 (16:9), output_format: png.

plaintext
1Extreme close-up macrofoto van een hele granaatappel, volledig gesneden uit dik
2translucent robijnrood glas, rustend op een natte zwarte leisteenplaat. De glazen schil
3is 8 mm dik met zichtbare interne bellen en gekartelde facetten; honderden kleine glazen
4pitjes gloeien van binnen als granaatkristallen. Een gepolijst Japans santoku-mes ligt
5aan de linkerrand van het kader, de punt raakt net de glazen schil. Eén harde
6sleutellicht van rechtsboven strijkt over de plaat en werpt scherpe rode caustics op
7de natte steen. 100 mm macro, f/2.8, geringe scherptediepte, donkere sfeervolle
8achtergrond. Geen handen, geen tekst, geen watermerk, geen logo.

AI-afbeeldingsgeneratorinterface met een tekstprompt en gegenereerde afbeelding

GPT Image 2-playground op Atlas Cloud met kwaliteit ingesteld op high en formaat 16:9 2048x1152, de glazen granaatappel weergegeven in het OUTPUT-paneel

De echte run. Kwaliteit high bij 2048x1152, en de pagina vermeldt $0,1745, wat de factuur later ook zei.

Mesblad dat een doorschijnende rode glazen granaatappel snijdt op donkere steen

Het gegenereerde basiskader: een granaatappel gesneden uit dik robijnglas op natte zwarte leisteen, een santoku-mes dat van de linkerrand binnenkomt

Het kader dat aan H3 werd gegeven. Gegenereerd met openai/gpt-image-2/text-to-image.

Stap 2: Schrijf het audiogedeelte van de MiniMax H3 ASMR-videoprompt

De meeste mensen schrijven een ASMR-prompt als een beeldbeschrijving met het woord "ASMR" ervoor geplakt, en vragen zich dan af waarom het model het scoort met lo-fi-piano. H3 neemt audiodirectie serieus als je het enige geeft. Structureer het audiogedeelte in vijf vakken:

  1. Materiaal. Wat het geluid maakt. Glas, was, gesmolten gesteente, water op glas. Wees specifiek over dikte en natheid, ze veranderen het timbre.
  2. Actie en zijn vorm in de tijd. Niet alleen "snijdt" maar "drukt in één langzame, continue beweging naar beneden". Het model gebruikt dit om gebeurtenissen te plaatsen.
  3. Mic-perspectief.close-mic, intiem, aanwijzingen voor opnameafstand. Dit bepaalt hoe droog en dichtbij het geluid aanvoelt, en het werkt goed.
  4. Onomatopee-reeks. Spel de geluidsgebeurtenissen in volgorde uit: piep, dan barst, dan tientallen kleine inslagen, dan stilte. Dit vak doet het meeste werk.
  5. Negatieven.geen muziek, geen stem, geen vertelling, geen kamernagalm, geen omgevingsbed. Zonder deze zal H3 behulpzaam een partituur toevoegen, omdat de meeste video in zijn trainingsdata er een heeft.

Ik heb ook kanaalaanwijzingen in vak 4 geschreven, waarbij ik vroeg om de barst in het linker kanaal en de pitjes die van links naar rechts rollen. Lees verder voor wat dat daadwerkelijk opleverde.

Stap 3: Voer de 768P-draft uit

Draft op 768P. Het audiospoor is dezelfde specificatie op beide lagen, dus het hele creatieve oordeel, dat in ASMR een luisteroordeel is, kan tegen het goedkope tarief worden gemaakt.

Instellingen op minimax/h3/image-to-video: image = de uitvoer van stap 1, resolution: 768P, duration: 5. De beeldverhouding komt van het eerste frame, dus laat het met rust.

plaintext
1Het santoku-mes komt van links binnen en drukt in één langzame, continue beweging door
2de glazen granaatappel, van links naar rechts over het kader bewegend. De schil splijt
3met een heldere kristallijne barst en een regen van kleine glazen pitjes valt op de
4natte leisteen, verspreidend naar rechts. Camera vastgezet, macro, enkele take, geen
5cuttings.
6
7Audio: ASMR, close-mic, intiem, geen muziek, geen stem, geen vertelling, geen
8kamernagalm. Een droog, aanhoudend glasachtig piepen terwijl de rand binnendringt, dan
9één scherpe, hoge barst gepand naar het LINKER kanaal, gevolgd door tientallen kleine
10rinkinkelende pitinslagen die van het LINKER kanaal naar het RECHTER kanaal rollen
11terwijl ze zich verspreiden. Een zwak mes-op-steen schraap aan het einde, dan stilte.
12Geen omgevingsbed, geen gezoem, geen achtergrondmuziek.

AI-videogeneratorinterface met een glazen granaatappelvideo

MiniMax H3 image-to-video-playground op Atlas Cloud met het geladen basiskader, duur 5, en een voltooide clip in het OUTPUT-paneel

De image-to-video-run: eerste frame geladen, duur 5, OUTPUT voltooid. Merk op dat de Resolutie-keuze op de pagina-standaard van 2K staat. Zet het op 768P voor drafts, wat de onderstaande clip ook op die resolutie weergaf.

xkolGEKI7UI

De 768P-draft, $0,50. Zachter beeld dan de hero-clip, dezelfde audiospecificatie. Dit is de take waarop het hele besluit wordt genomen.

Stap 4: Meet de stereo voordat je erop vertrouwt

Neem mijn woord niet aan voor het geluid, en neem ook het model niet aan. Haal de kanalen uit elkaar en kijk. Dit is lokale ffmpeg, geen API-aanroep, geen kosten:

plaintext
1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \
2  -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \
3  -frames:v 1 stereo-proof.png

Golfvormvergelijking van stereokanaalscheiding in twee ASMR-audioclips

Vierdelige golfvormanalyse van de glazen granaatappelclip en de regenclip, met linker- en rechterkanaal plus het zijdenkanaal voor elk

Linkerkanaal over rechterkanaal voor twee clips, plus het zijdenkanaal (links minus rechts) bij gelijke versterking eronder. Dit is het hele argument in één plaatje.

Hier is wat er terugkwam, en een deel ervan is niet wat ik verwachtte.

De stereo is echt. Het zijdenkanaal is niet leeg op een van de clips die ik heb gegenereerd. Een dual mono-bestand vermomd als stereo zou niets laten zien. Deze heeft inhoud.

Maar je kunt geen panning aansturen. Ik vroeg, in hoofdletters, om de barst in het LINKER kanaal en de pitjes die van LINKS naar RECHTS rollen. Gemeten: kanaalcorrelatie 0,97, zijdenkanaal 17,7 dB onder midden, en het grootste links-naar-rechts niveauverschil in een kwartsecondevenster is 1,9 dB. Dat is geen panning. Dat is een gecentreerd beeld met een beetje natuurlijke breedte. Het mes beweegt over het kader; het geluid blijft op zijn plaats.

Breedte komt van de inhoud, niet van je bewoording. De regenclip in de volgende sectie, waarbij ik geen richting vroeg, kwam terug met een correlatie van 0,32 en het zijdenkanaal slechts 2,9 dB onder midden. Dat is een echt breed, gecorreleerd veld. Diffuse omgeving krijgt automatisch breedte. Discrete inslagen blijven dicht bij het midden, ongeacht wat je schrijft.

Dus de eerlijke claim voor dit model is niet ruimtelijk. Het is temporeel. Je krijgt geluid dat tegelijk met het beeld is gegenereerd en op het frame valt waar het hoort, gratis, voor altijd, zonder editor. Als je formaat echt een harde panning nodig heeft, moet je dat nog steeds zelf in post doen, en je moet stoppen met het schrijven van kanaalnamen in prompts, omdat ze niets doen.

Nu de keeper opnieuw uitvoeren: hetzelfde endpoint, hetzelfde eerste frame, dezelfde prompt, één veld wijzigen naar resolution: 2K. Nog één ding dat de moeite waard is om te weten voordat je aanneemt dat de draft een voorbeeld is.

Vergelijking van twee videoresoluties bij het snijden van een glazen granaatappel

Twee rijen van vijf frames die de 768P- en 2K-runs vergelijken op dezelfde tijdstempels, identiek op frame nul en divergerend vanaf ongeveer 2,5 seconden

Zelfde eerste frame, zelfde prompt, beide lagen. Frame 0 komt exact overeen. Tegen 2,5s breekt de schil anders en zijn de twee clips verschillende takes geworden.

Het vastzetten van het eerste frame behoudt de compositie, de kadrering, de belichting en de kleur over beide lagen, wat de reden is waarom je altijd image-to-video moet gebruiken in plaats van text-to-video hiervoor. Het geeft je niet dezelfde take. De 2K-run hergenereert de actie. Behandel de draft als een voorbeeld van het uiterlijk en het geluid, niet van de exacte choreografie.

Stap 5: Voeg een echte opname toe als een MiniMax H3 ASMR-videoreferentie

Als je een geluid hebt dat je echt wilt, geef het dan door. reference-to-video accepteert tot 9 afbeeldingen, 3 video's en 3 audioclips, en het haalt timbre en kamerkarakter uit een audioreferentie in plaats van ze te verzinnen. Ik heb een publiek-domein-vriendelijke glasbreukopname van Gravity Sound van Wikimedia Commons gebruikt (CC BY 4.0), drie takes aan elkaar geplakt tot 4,5 seconden.

Drie regels, en ik vond de laatste twee op de harde manier door geweigerde verzoeken:

  • Audio kan niet alleen. Het endpoint specificeert: ten minste één afbeelding of video is vereist, en audio alleen is niet toegestaan. Combineer het met een kader.
  • De audioreferentie moet 2 tot 15 seconden zijn. Mijn eerste poging gebruikte een clip van 1,49 seconden en kwam terug met audio duration 1486 ms, expected [2000, 15000] ms. Dat bereik staat niet op de modelpagina.
  • Het bestandsformaat wordt gecontroleerd. Een als audio/mpeg gedeclareerde base64-payload werd geweigerd met audio format ".mpeg" not allowed. Een .wav-payload ging erdoor. Geweigerde verzoeken worden niet gefactureerd, maar ze kosten je wel een round trip.

Instellingen: refers: [{url: <base frame>, type: "image"}, {url: <a 2 to 15s recording>, type: "audio"}], resolution: 768P, duration: 5.

plaintext
1Zelfde vastgezette macro-opname: het mes snijdt de glazen granaatappel van links naar
2rechts en de pitjes verspreiden zich. Stem het timbre, de helderheid en het kamerkarakter
3af op de referentieaudio, dezelfde opnameafstand, dezelfde droogheid. ASMR close-mic,
4geen muziek, geen stem.

AI-videogeneratorinterface met promptinvoer en gegenereerde granaatappelvideo

MiniMax H3 reference-to-video-playground op Atlas Cloud met twee geladen referentiematerialen, een audiobestand in vak 1 en het basiskader in vak 2

Referentiematerialen met het audiobestand en de afbeelding samen, 2 van de 9 gebruikt. Laat de afbeelding weg en het verzoek wordt helemaal niet uitgevoerd.

mY1VrOfM3cM

De referentie-gestuurde take, $0,50. Zelfde opname, timbre gestuurd door een echte opname in plaats van verzonnen uit de prompt. Audioreferentie: Glass breaking door Gravity Sound, CC BY 4.0.

Drie MiniMax H3 ASMR-videosjablonen: Snijden, Kauwen, Regen

Drie formaten dekken het meeste van wat presteert in deze categorie. Elk is een volledige kopieer-en-plak-prompt met instellingen en de clip die het produceerde. Bewust geen glas, geen rood, geen leisteen ergens hieronder: als elke clip op je account er hetzelfde uitziet, behandelt het algoritme het als dezelfde clip.

Tabel 3: dezelfde vijf vakken, drie verschillende taken.

VakSjabloon 1, Het SnijdenSjabloon 2, Het KauwenSjabloon 3, De Regen
Materiaaldruipende honingraat, heet stalen mesgloeiend gesmolten gesteente, stenen komregen op autoruitglas
Actievormmes zakt van voor naar achteren, honing trekt naar benedeneetstokjes tillen, dan twee happengeen onderwerp actie, alleen druppels
Mic-perspectiefclose-mic, zeer droog, geen kamerextreem dichtbij, intiembuiten het glas, cabine gedempt
Geluidsreekswasbarst, honingrek, druppel op bordgesmolten sissen, nat kauwen, glasachtige knars, uitademinggestage regentapijt, druppelinslagen, ver weg bandengezoem
Negatievengeen muziek, geen stem, geen kamernagalmgeen woorden, geen muziek, geen vertellinggeen muziek, geen donder, geen stem, geen ruitenwissers

Sjabloon 1, Het Snijden. Honingraat, amber en goud, 9:16, 768P, 6 seconden, ratio: "9:16".

plaintext
1Extreme macro, vastgezette overhead-opname van een dikke plaat gouden honingraat op een
2lichte keramische plaat, honing die er al omheen stroomt. Een heet stalen mes daalt in
3de was en zakt er van voren naar achteren doorheen in één langzame, continue druk; de
4snijvlakken zakken in elkaar en een zware draad honing rekt uit en druppelt op de plaat.
5Warme amberkleurige sleutellicht van links, geringe scherptediepte, enkele take, geen
6cuts, geen handen in beeld.
7
8Audio: ASMR, close-mic, zeer droog, geen kamernagalm, geen muziek, geen stem, geen
9vertelling. Een zacht gekraak van was dat splijt onder het mes, dan een dikke, lage
10rekkende trek terwijl de honing langer wordt, dan twee zware natte druppels die op de
11keramische plaat vallen. Niets anders.

ZsVmf9AhPnw

Sjabloon 1, $0,60. Wasbarst, honingrek, druppel. Gegenereerd met minimax/h3/text-to-video.

Sjabloon 2, Het Kauwen. Lava-mukbang, het formaat dat in een week 11,3 miljoen weergaven trok, 9:16, 768P, 8 seconden, ratio: "9:16".

plaintext
1Verticale close-up: een paar zwarte lak-eetstokjes tilt een gloeiende klomp gesmolten
2oranje lava uit een donkere stenen kom en draagt het naar de camera, uit het kader aan
3de onderkant. De lava is zelfverlichtend, werpt oranje licht op alles eromheen; de rest
4van de kamer is bijna zwart. Stoom stijgt op van het oppervlak. Vastgezette camera,
5enkele take, geen cuts.
6
7Audio: ASMR, extreem close-mic, intiem, geen woorden, geen muziek, geen vertelling,
8geen kamertoon. Een laag, gesmolten sissen en borrelen terwijl de lava wordt opgetild,
9dan een zacht, nat kauwen, dan een helderdere glasachtige knars bij de tweede hap, dan
10één langzame, tevreden uitademing. Geen spraak.

UJhEsTnKkZI

Sjabloon 2, $0,80. Sissen, kauwen, knarsen, uitademing, en geen enkel woord. Gegenereerd met minimax/h3/text-to-video.

Sjabloon 3, De Regen. Nachtelijke autoruit, koud blauw en neon, 16:9, 768P, 10 seconden, ratio: "16:9".

Dit is de enige van de drie zonder onderwerpactie, en het leert het meeste over negatieven. Met niets dat op het scherm gebeurt, grijpt H3 naar een muziekbed, tenzij je er expliciet een verbiedt. Het is ook de clip die veruit het breedste stereoveld terugbracht, zonder erom gevraagd te zijn. Slaapgerichte inhoud wil lengte, dus deze loopt dicht bij de bovengrens van het bruikbare duurbereik.

plaintext
1Macro-opname door de binnenkant van een autoruit 's nachts, zware regen die langs de
2buitenkant van het glas stroomt. Individuele druppels raken, aarzelen, dan strepen ze
3naar beneden en versmelten. Achter het glas, onscherpe neonreclame die uiteenvalt in
4koude blauwe en magenta bokeh. Geen ruitenwissers, geen mensen, geen beweging in de
5auto. Camera vastgezet, enkele continue take, geringe scherptediepte, geen cuts.
6
7Audio: ASMR, close-mic aan de buitenkant van het glas, cabine enigszins gedempt.
8Een gestaag, gelijkmatig regentapijt met duidelijk gescheiden individuele
9druppelinslagen op het glas, plus een zwak, ver weg gezoem van banden op een natte weg.
10Geen muziek, geen donder, geen stem, geen vertelling, geen ruitenwissergeluid.

bUKr5V6wbdM

Sjabloon 3, $1,00. Tien seconden pure omgeving, geen soundtrack omdat de prompt er een verbood. Gegenereerd met minimax/h3/text-to-video.

Wat een MiniMax H3 ASMR-video daadwerkelijk kost

Hier is de rekening voor dit artikel, geen schatting.

PosterijenAantalGefactureerd
GPT Image 2-basiskader, high, 2048x11521$0,17
2K-keeper, 5s, image-to-video1$0,70
768P-draft, 5s, image-to-video1$0,50
768P reference-to-video, 5s1$0,50
Sjabloonclips op 768P, 6s + 8s + 10s3$2,40
Geweigerde referentieverzoeken2$0,00
Totaal $4,27

Zes publiceerbare clips en één basiskader. Schaal het naar een schema: één verticale clip van 8 seconden per dag op 768P kost $0,80, dus ruwweg $24 per maand voor een gezichtloos account dat dagelijks plaatst, voordat je een minuut in een editor besteedt.

Twee factuurnotities. De vermelde $0,009 van GPT Image 2 is een token-tier-vloer; een hoogwaardige 2048x1152-render komt uit op $0,1745, bijna twintig keer zoveel, dus begroot op basis van de laag die je daadwerkelijk gebruikt. En het price-veld van H3 wordt met vertraging bijgewerkt: poll tot status completed is en het is vaak nog undefined. Poll de prediction-id even later opnieuw voor het echte cijfer. Die tweede poll is de enige manier om een factuur zoals deze te bouwen in plaats van een gok.

Eén eerlijke opmerking over ASMR-audio en rechten

Upload niet de ASMR-opname van iemand anders als een refers-audiobestand. De referentie migreert oprecht timbre naar de uitvoer, en het uitvoeren van een opname door een model verandert niet wie de eigenaar is. De hier gebruikte referentie is CC BY 4.0 en hierboven vermeld, wat ongeveer twee minuten kostte om te vinden.

Bouw ASMR niet rond een herkenbare stem van een echt persoon. Elk sjabloon in dit artikel is bewust stemloos, wat zowel de genreconventie als het minst ingewikkelde pad is.

Het aanroepen van H3 via een API wordt niet beïnvloed door de community-licentie die aan de open gewichten is gekoppeld. Die licentie, die zelfhosting dekt, sluit momenteel de EU, het VK, Korea en de VS uit, en er is een formele licentiekanalen geopend voor die gebieden. Het is de moeite waard om te weten, niet de moeite waard om je zorgen over te maken als je het endpoint gebruikt.

MiniMax H3 ASMR-video: Veelgestelde vragen

Genereert een MiniMax H3 ASMR-video zijn eigen geluid, of voeg ik het later toe?

Het model genereert het. Beeld en audio komen uit dezelfde pass: 24 fps video met een AAC stereo track op 32 kHz in het geleverde bestand. Er is geen aparte audiostap, geen geluidsbibliotheek en geen synchronisatiewerk, wat de hele reden is dat dit endpoint interessant is voor ASMR.

Niet door het te vragen. Ik schreef expliciete kanaalaanwijzingen in de prompt en mat het resultaat: correlatie 0,97 tussen kanalen en een maximaal niveauverschil van 1,9 dB in een kwartsecondevenster, wat helemaal geen panning is. De track is echt stereo en diffuse inhoud zoals regen komt terug met een breed veld, maar discrete inslagen blijven gecentreerd, ongeacht de bewoording. Als je formaat een harde panning nodig heeft, doe het dan in post.

Kan ik mijn eigen opname uploaden als een MiniMax H3 ASMR-videoreferentie?

Ja, via reference-to-video, dat tot 3 audioreferenties accepteert naast maximaal 9 afbeeldingen en 3 video's. Audio kan niet alleen worden ingediend, dus combineer het met ten minste één afbeelding of video. De audio moet ook tussen 2 en 15 seconden zijn, en het formaat wordt gevalideerd: een .wav-payload werkte waar een audio/mpeg-payload werd geweigerd. Geweigerde verzoeken worden niet gefactureerd.

Is de audio van een 768P MiniMax H3 ASMR-video slechter dan 2K?

Nee. Beide lagen leveren dezelfde AAC stereo 32 kHz-specificatie. Alleen het beeld verandert, en het verandert veel: 16:9 komt terug als 1344x768 bij 768P versus 2560x1440 bij 2K. Omdat het creatieve oordeel in ASMR een luisteroordeel is, draft op $0,10/s en voer keepers opnieuw uit op $0,14/s. Onthoud gewoon dat de 2K-run een nieuwe take is, geen upscale van de draft.

Hoe lang moet een MiniMax H3 ASMR-video zijn en welke beeldverhouding?

Duur accepteert elk geheel getal van 4 tot 15. Snij- en kauwclips werken op 5 tot 8 seconden omdat de payoff één gebeurtenis is; slaapgerichte omgeving wil 10 of meer. Gebruik voor Shorts, Reels en TikTok 9:16, en onthoud dat text-to-video ratio expliciet moet instellen en adaptive weigert. Bij image-to-video bepaalt het eerste frame de vorm voor jou.

Hoeveel kost één MiniMax H3 ASMR-video?

Een clip van 5 seconden kost $0,50 op 768P en $0,70 op 2K. Een verticale clip van 8 seconden op 768P kost $0,80. Een van die per dag plaatsen kost ongeveer $24 per maand aan rekenkracht, wat het getal is dat de moeite waard is om te vergelijken met de 20 minuten die een editor per clip zou kosten voor de aan elkaar genaaide workflow.

Waarom komt mijn MiniMax H3 ASMR-video uit met achtergrondmuziek die ik niet heb gevraagd?

Omdat je het niet hebt verboden. De meeste video in de trainingsdata van elk model heeft een muziekbed, dus het standaardgedrag is om er een toe te voegen, vooral wanneer er niets op het scherm gebeurt. Zet de negatieven expliciet in het audiogedeelte van de prompt: geen muziek, geen stem, geen vertelling, geen kamernagalm, geen omgevingsbed. Omgevingssjablonen hebben dit meer nodig dan actiesjablonen.

Nieuwste modellen

Eén API voor alle media-AI.

Verken alle modellen