Zet een koptelefoon op voordat je naar de onderstaande clip scrollt. In deze categorie maakt het echt uit.
Een mes daalt neer door een granaatappel die uit robijnglas is gesneden. De schil splijt, een kristallijne barst, en dan rollen een paar dozijn glazen pitjes over natte leisteen. Dit is het deel dat anders is dan bijna elke AI-ASMR-clip waar je dit jaar langs bent gescrolld: niemand heeft dat geluid toegevoegd. Er was geen geluidsbibliotheek, geen editor, geen tijdlijn. Het beeld en de audio kwamen uit één enkele generatie, in één enkele aanroep.
Het afgelopen jaar zag AI ASMR er bevredigend uit en klonk het net niet helemaal goed, en de reden lag nooit aan de beelden. Het was de laatste stap in de pijplijn. Het plakken van audio op een stille clip was een handmatige klus, elke keer opnieuw met de hand gedaan. De categorie groeide zo snel rond die kloof dat er een kleine industrie van speciale AI-ASMR-generatorsites ontstond, puur om het aan elkaar naaien te automatiseren; een van hen adverteert met "binaural 3D audio" op de homepage. De vraag was al lang bewezen. Het werd alleen via een assemblageproces bediend.
Dus ik heb het ding goed uitgevoerd. Eén reproduceerbare workflow, zes clips, en dan het deel dat niemand in deze categorie ooit doet: ik heb de linker- en rechterkanalen in ffmpeg uit elkaar gehaald en gemeten. Sommige dingen die ik verwachtte bleken onjuist, en dat bleek het nuttigste deel van het artikel te zijn.
Belangrijkste conclusies
- H3 rendert het 24 fps beeld en een 32 kHz AAC stereo track in dezelfde pass. De audio wordt gegenereerd, niet later toegevoegd.
- De stereo is echt stereo, niet dual mono in een stereovermomming. Maar je kunt geen panning aansturen. Ik vroeg om een harde links-naar-rechts sweep en kreeg een verschil van 1,9 dB, wat niets is.
- Stereobreedte komt van de inhoud, niet van je bewoording. De regenclip, waarbij ik geen richting vroeg, kwam terug met een echt breed veld.
- Het vastzetten van het eerste beeld houdt de opname consistent over resoluties, maar 768P en 2K zijn nog steeds verschillende takes. De draft geeft een voorproefje van het uiterlijk en de geluidsspecificatie, niet van de exacte choreografie.
- Een 5 seconden durende 768P-clip kost $0,50. Dezelfde clip op 2K kost $0,70. Het hele artikel kostte $4,27.
Luister eerst: een MiniMax H3 ASMR-video, in één pass geknipt
w7ZRR7bo3KI
Vijf seconden, 2K, 24 fps, 32 kHz stereo, één generatie, $0,70. Geluid aan: het piepen van de rand die erin snijdt, de barst, dan de pitjes. Niets ervan is later toegevoegd. Gegenereerd met minimax/h3/image-to-video.
Eén prompt. Eén model. Eén aanroep. Alles hieronder beschrijft hoe die clip is gemaakt, wat het kostte, en welke delen van de marketingstory het overleven bij contact met een golfvorm.
Waarom AI ASMR explodeerde, en waarom het meeste de koptelefoontest niet doorstaat
De trend heeft een verjaardag. AI ASMR begon zich te verspreiden in juni 2025, direct nadat Veo 3 landde, en het formaat ging binnen dagen viral. Een lava-mukbang van @asmraiworks trok in een week meer dan 11,3 miljoen weergaven; een glas-snijclip deed er 5,3 miljoen in elf dagen (Know Your Me, 2025). Nieuwsredacties pikten het op als curiositeit, met surrealistische beelden en met eetstokjes gegeten gesmolten lava die het zware werk deden (The Express Tribune, 2025).
Toen zetten mensen een koptelefoon op, en de stemming veranderde. TechRadar's schrijver bekeek een stapel van de virale clips en kwam weg met een beschrijving van een laagje kunstmatigheid: "het ontbreekt aan de fouten en onnauwkeurigheden die het kenmerk zijn van menselijke ASMR" (TechRadar, juni 2025). Fans die in dat artikel worden geciteerd, zeiden dat de tintel-triggers technisch aanwezig waren, maar dat het nog steeds niet hetzelfde was.
Er is een mechanische reden, en die is niet mystiek. ASMR is de enige inhoudscategorie waar de inhoud het geluid is. Overal elders is audio een garnering. Hier is het het product. En de dominante workflow was:
- een stille clip genereren met een videomodel,
- een geluidsbibliotheek doorzoeken op een barst, een knars, een regentapijt,
- het geluid in een editor synchroniseren met het beeld,
- handmatig pannen en mixen als je er om geeft, wat bijna niemand doet op schaal,
- exporteren.
Stap 3 is waar het misgaat. Een ingeblikte barst die twee frames te laat inslaat, voelt nep aan voordat je kunt uitleggen waarom. Vermenigvuldig dat met een dagelijks publicatieschema en de fouten stapelen zich op, omdat de uitlijning elke keer opnieuw door een mens wordt gedaan.
Die kloof is de reden waarom een hele cottage-industrie van AI-ASMR-generatorsites bestaat. Er zijn er minstens drie actief mee bezig, en één leidt met binaural 3D audio als kopzinnige functie. Ze lossen geen nep-probleem op. Ze repareren een echt gat: de onderliggende videomodellen produceren geen geluid.
Wat een blik op één leaderboard de moeite waard maakt. Op Artificial Analysis's video-editing board, het board dat met audio wordt gescoord, staat MiniMax H3 op #1 met 1.126 Elo, voor Gemini Omni Flash met 1.119 en ruwweg honderd punten boven Dreamina Seedance 2.0 met 1.027 (Artificial Analysis, augustus 2026). Op de image-to-video boards, waar audio geen deel uitmaakt van de score, zitten verschillende van die modellen binnen een paar punten van elkaar. De kloof ontstaat wanneer geluid telt. Voor ASMR telt alleen geluid.
De MiniMax H3 ASMR-video-workflow, en wat elke stap kost
Drie endpoints, één browsertabblad. Ik heb alles in dit artikel op Atlas Cloud uitgevoerd, dus elk cijfer hieronder kwam van de factuur, niet van een tariefkaart.
| Taak in dit artikel | Model | Tarief |
|---|---|---|
| Eerste frame voor de showcase | OpenAI GPT Image 2 (text-to-image) | vermeld vanaf $0,009/afbeelding, gefactureerd $0,1745 bij high en 2048x1152 |
| Draft en keeper | MiniMax H3 Image-to-Video | $0,10/s bij 768P, $0,14/s bij 2K |
| Een echte opname invoeren | MiniMax H3 Reference-to-Video | dezelfde twee lagen |
| De drie sjablonen | MiniMax H3 Text-to-Video | dezelfde twee lagen |
| De oude manier, alleen audiodeel | ByteDance Seed Audio 1.0 | $0,143/min |
De vermelding toont "Vanaf $0,1/SEC" op alle drie H3-endpoints. Dat is de 768P-vloer. 2K wordt gefactureerd tegen $0,14/s en dat getal verschijnt nergens behalve op je factuur, dus plan rond de laag die je daadwerkelijk aanvraagt.
Tabel 1: één pass versus de aan elkaar genaaide pijplijn.
| MiniMax H3, native audio | Stil model plus post-audio | |
|---|---|---|
| Stappen naar een afgewerkte clip | 1 | 4 tot 5 |
| Betrokken tools | 1 | videomodel + geluidsbibliotheek + editor + export |
| Hoe beeld en geluid synchroon blijven | zelfde generatie, zelfde tijdlijn | jij sleept het tot het er goed uitziet |
| Wie mixt en pánt | niemand, je neemt wat het model geeft | jij, met de hand, per geluid |
| Menselijke tijd per clip | ongeveer nul na de prompt | 15 tot 40 minuten, eerlijk gezegd |
| Rekenkracht per 5s-clip | $0,50 bij 768P | videomodel + $0,143/min aan audiogeneratie |
Ik citeer bewust geen per-seconde-tarief van een concurrerend videoplatform, omdat rekenkracht niet de plek is waar het verschil zit. Audiogeneratie kost $0,143 per minuut, wat centen zijn. De echte kosten van de aan elkaar genaaide pijplijn zijn 20 minuten menselijke aandacht per clip, en die kosten dalen niet naarmate je opschaalt. Ze vermenigvuldigen. Een gezichtloos account dat dagelijks plaatst, is precies waar 20 minuten per clip stilletjes het hele verdienmodel opeet.
Het eerlijke tegenwicht: handmatig aan elkaar naaien geeft je controle. Je kunt een geluid overal in het stereoveld plaatsen en het tot het frame trimmen. H3 geeft je de synchronisatie gratis en, zoals de metingen hieronder laten zien, geeft je die controle niet terug.
Tabel 2: de drie H3-endpoints, de parameters die er echt toe doen.
| image-to-video | text-to-video | reference-to-video | |
|---|---|---|---|
| Hoofdingang | image (eerste frame) | alleen prompt | refers[] |
| resolutie | 768P / 2K, standaard 2K | hetzelfde | hetzelfde |
| duur | elk geheel getal van 4 tot 15, standaard 8 | hetzelfde | hetzelfde |
| beeldverhouding | bepaald door het eerste frame | moet expliciet worden ingesteld, adaptive wordt geweigerd | bepaald door de referenties |
| refers-limieten | niet samen met image gebruikt | niet gebruikt | tot 9 afbeeldingen, 3 video's, 3 audio |
| Afgeleverde 16:9 output | 1344x768 bij 768P, 2560x1440 bij 2K | hetzelfde | hetzelfde |
| Audiospoor | AAC stereo 32 kHz over 24 fps video | hetzelfde | hetzelfde |
Twee parametervallen die het waard zijn om op je hand te schrijven. De parameter heet ratio, niet aspect_ratio, en de verkeerde sleutel laat het oningesteld zodat text-to-video het verzoek afwijst. En image plus refers in dezelfde aanroep geeft geen foutmelding: het wordt voltooid, volledig gefactureerd, en gooit stilletjes één van de twee ingangen weg.
MiniMax H3 ASMR-video-tutorial: een glazen granaatappel snijden
Het snijden van glasfruit is het formaat dat iedereen herkent, dus de lezer weet meteen waar ze naar kijken. Glazen appels en glazen mango's zijn echter al dood gedaan. Een granaatappel is om één specifieke reden beter: wanneer de schil splijt, rollen er honderden glazen pitjes uit, dus het geluid heeft duur en structuur in plaats van één gecentreerde impact. Als een model zijn audio vervalst, is een verstrooiing waar het zichtbaar wordt.
Stap 1: Bouw het basiskader met GPT Image 2
Zet de compositie vast voordat je geld uitgeeft aan video. Instellingen: quality: high, size: 2048x1152 (16:9), output_format: png.
plaintext1Extreme close-up macrofoto van een hele granaatappel, volledig gesneden uit dik 2translucent robijnrood glas, rustend op een natte zwarte leisteenplaat. De glazen schil 3is 8 mm dik met zichtbare interne bellen en gekartelde facetten; honderden kleine glazen 4pitjes gloeien van binnen als granaatkristallen. Een gepolijst Japans santoku-mes ligt 5aan de linkerrand van het kader, de punt raakt net de glazen schil. Eén harde 6sleutellicht van rechtsboven strijkt over de plaat en werpt scherpe rode caustics op 7de natte steen. 100 mm macro, f/2.8, geringe scherptediepte, donkere sfeervolle 8achtergrond. Geen handen, geen tekst, geen watermerk, geen logo.

GPT Image 2-playground op Atlas Cloud met kwaliteit ingesteld op high en formaat 16:9 2048x1152, de glazen granaatappel weergegeven in het OUTPUT-paneel
De echte run. Kwaliteit high bij 2048x1152, en de pagina vermeldt $0,1745, wat de factuur later ook zei.

Het gegenereerde basiskader: een granaatappel gesneden uit dik robijnglas op natte zwarte leisteen, een santoku-mes dat van de linkerrand binnenkomt
Het kader dat aan H3 werd gegeven. Gegenereerd met openai/gpt-image-2/text-to-image.
Stap 2: Schrijf het audiogedeelte van de MiniMax H3 ASMR-videoprompt
De meeste mensen schrijven een ASMR-prompt als een beeldbeschrijving met het woord "ASMR" ervoor geplakt, en vragen zich dan af waarom het model het scoort met lo-fi-piano. H3 neemt audiodirectie serieus als je het enige geeft. Structureer het audiogedeelte in vijf vakken:
- Materiaal. Wat het geluid maakt. Glas, was, gesmolten gesteente, water op glas. Wees specifiek over dikte en natheid, ze veranderen het timbre.
- Actie en zijn vorm in de tijd. Niet alleen "snijdt" maar "drukt in één langzame, continue beweging naar beneden". Het model gebruikt dit om gebeurtenissen te plaatsen.
- Mic-perspectief.
close-mic,intiem, aanwijzingen voor opnameafstand. Dit bepaalt hoe droog en dichtbij het geluid aanvoelt, en het werkt goed. - Onomatopee-reeks. Spel de geluidsgebeurtenissen in volgorde uit: piep, dan barst, dan tientallen kleine inslagen, dan stilte. Dit vak doet het meeste werk.
- Negatieven.
geen muziek, geen stem, geen vertelling, geen kamernagalm, geen omgevingsbed. Zonder deze zal H3 behulpzaam een partituur toevoegen, omdat de meeste video in zijn trainingsdata er een heeft.
Ik heb ook kanaalaanwijzingen in vak 4 geschreven, waarbij ik vroeg om de barst in het linker kanaal en de pitjes die van links naar rechts rollen. Lees verder voor wat dat daadwerkelijk opleverde.
Stap 3: Voer de 768P-draft uit
Draft op 768P. Het audiospoor is dezelfde specificatie op beide lagen, dus het hele creatieve oordeel, dat in ASMR een luisteroordeel is, kan tegen het goedkope tarief worden gemaakt.
Instellingen op minimax/h3/image-to-video: image = de uitvoer van stap 1, resolution: 768P, duration: 5. De beeldverhouding komt van het eerste frame, dus laat het met rust.
plaintext1Het santoku-mes komt van links binnen en drukt in één langzame, continue beweging door 2de glazen granaatappel, van links naar rechts over het kader bewegend. De schil splijt 3met een heldere kristallijne barst en een regen van kleine glazen pitjes valt op de 4natte leisteen, verspreidend naar rechts. Camera vastgezet, macro, enkele take, geen 5cuttings. 6 7Audio: ASMR, close-mic, intiem, geen muziek, geen stem, geen vertelling, geen 8kamernagalm. Een droog, aanhoudend glasachtig piepen terwijl de rand binnendringt, dan 9één scherpe, hoge barst gepand naar het LINKER kanaal, gevolgd door tientallen kleine 10rinkinkelende pitinslagen die van het LINKER kanaal naar het RECHTER kanaal rollen 11terwijl ze zich verspreiden. Een zwak mes-op-steen schraap aan het einde, dan stilte. 12Geen omgevingsbed, geen gezoem, geen achtergrondmuziek.

MiniMax H3 image-to-video-playground op Atlas Cloud met het geladen basiskader, duur 5, en een voltooide clip in het OUTPUT-paneel
De image-to-video-run: eerste frame geladen, duur 5, OUTPUT voltooid. Merk op dat de Resolutie-keuze op de pagina-standaard van 2K staat. Zet het op 768P voor drafts, wat de onderstaande clip ook op die resolutie weergaf.
xkolGEKI7UI
De 768P-draft, $0,50. Zachter beeld dan de hero-clip, dezelfde audiospecificatie. Dit is de take waarop het hele besluit wordt genomen.
Stap 4: Meet de stereo voordat je erop vertrouwt
Neem mijn woord niet aan voor het geluid, en neem ook het model niet aan. Haal de kanalen uit elkaar en kijk. Dit is lokale ffmpeg, geen API-aanroep, geen kosten:
plaintext1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \ 2 -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \ 3 -frames:v 1 stereo-proof.png

Vierdelige golfvormanalyse van de glazen granaatappelclip en de regenclip, met linker- en rechterkanaal plus het zijdenkanaal voor elk
Linkerkanaal over rechterkanaal voor twee clips, plus het zijdenkanaal (links minus rechts) bij gelijke versterking eronder. Dit is het hele argument in één plaatje.
Hier is wat er terugkwam, en een deel ervan is niet wat ik verwachtte.
De stereo is echt. Het zijdenkanaal is niet leeg op een van de clips die ik heb gegenereerd. Een dual mono-bestand vermomd als stereo zou niets laten zien. Deze heeft inhoud.
Maar je kunt geen panning aansturen. Ik vroeg, in hoofdletters, om de barst in het LINKER kanaal en de pitjes die van LINKS naar RECHTS rollen. Gemeten: kanaalcorrelatie 0,97, zijdenkanaal 17,7 dB onder midden, en het grootste links-naar-rechts niveauverschil in een kwartsecondevenster is 1,9 dB. Dat is geen panning. Dat is een gecentreerd beeld met een beetje natuurlijke breedte. Het mes beweegt over het kader; het geluid blijft op zijn plaats.
Breedte komt van de inhoud, niet van je bewoording. De regenclip in de volgende sectie, waarbij ik geen richting vroeg, kwam terug met een correlatie van 0,32 en het zijdenkanaal slechts 2,9 dB onder midden. Dat is een echt breed, gecorreleerd veld. Diffuse omgeving krijgt automatisch breedte. Discrete inslagen blijven dicht bij het midden, ongeacht wat je schrijft.
Dus de eerlijke claim voor dit model is niet ruimtelijk. Het is temporeel. Je krijgt geluid dat tegelijk met het beeld is gegenereerd en op het frame valt waar het hoort, gratis, voor altijd, zonder editor. Als je formaat echt een harde panning nodig heeft, moet je dat nog steeds zelf in post doen, en je moet stoppen met het schrijven van kanaalnamen in prompts, omdat ze niets doen.
Nu de keeper opnieuw uitvoeren: hetzelfde endpoint, hetzelfde eerste frame, dezelfde prompt, één veld wijzigen naar resolution: 2K. Nog één ding dat de moeite waard is om te weten voordat je aanneemt dat de draft een voorbeeld is.

Twee rijen van vijf frames die de 768P- en 2K-runs vergelijken op dezelfde tijdstempels, identiek op frame nul en divergerend vanaf ongeveer 2,5 seconden
Zelfde eerste frame, zelfde prompt, beide lagen. Frame 0 komt exact overeen. Tegen 2,5s breekt de schil anders en zijn de twee clips verschillende takes geworden.
Het vastzetten van het eerste frame behoudt de compositie, de kadrering, de belichting en de kleur over beide lagen, wat de reden is waarom je altijd image-to-video moet gebruiken in plaats van text-to-video hiervoor. Het geeft je niet dezelfde take. De 2K-run hergenereert de actie. Behandel de draft als een voorbeeld van het uiterlijk en het geluid, niet van de exacte choreografie.
Stap 5: Voeg een echte opname toe als een MiniMax H3 ASMR-videoreferentie
Als je een geluid hebt dat je echt wilt, geef het dan door. reference-to-video accepteert tot 9 afbeeldingen, 3 video's en 3 audioclips, en het haalt timbre en kamerkarakter uit een audioreferentie in plaats van ze te verzinnen. Ik heb een publiek-domein-vriendelijke glasbreukopname van Gravity Sound van Wikimedia Commons gebruikt (CC BY 4.0), drie takes aan elkaar geplakt tot 4,5 seconden.
Drie regels, en ik vond de laatste twee op de harde manier door geweigerde verzoeken:
- Audio kan niet alleen. Het endpoint specificeert: ten minste één afbeelding of video is vereist, en audio alleen is niet toegestaan. Combineer het met een kader.
- De audioreferentie moet 2 tot 15 seconden zijn. Mijn eerste poging gebruikte een clip van 1,49 seconden en kwam terug met
audio duration 1486 ms, expected [2000, 15000] ms. Dat bereik staat niet op de modelpagina. - Het bestandsformaat wordt gecontroleerd. Een als
audio/mpeggedeclareerde base64-payload werd geweigerd metaudio format ".mpeg" not allowed. Een.wav-payload ging erdoor. Geweigerde verzoeken worden niet gefactureerd, maar ze kosten je wel een round trip.
Instellingen: refers: [{url: <base frame>, type: "image"}, {url: <a 2 to 15s recording>, type: "audio"}], resolution: 768P, duration: 5.
plaintext1Zelfde vastgezette macro-opname: het mes snijdt de glazen granaatappel van links naar 2rechts en de pitjes verspreiden zich. Stem het timbre, de helderheid en het kamerkarakter 3af op de referentieaudio, dezelfde opnameafstand, dezelfde droogheid. ASMR close-mic, 4geen muziek, geen stem.

MiniMax H3 reference-to-video-playground op Atlas Cloud met twee geladen referentiematerialen, een audiobestand in vak 1 en het basiskader in vak 2
Referentiematerialen met het audiobestand en de afbeelding samen, 2 van de 9 gebruikt. Laat de afbeelding weg en het verzoek wordt helemaal niet uitgevoerd.
mY1VrOfM3cM
De referentie-gestuurde take, $0,50. Zelfde opname, timbre gestuurd door een echte opname in plaats van verzonnen uit de prompt. Audioreferentie: Glass breaking door Gravity Sound, CC BY 4.0.
Drie MiniMax H3 ASMR-videosjablonen: Snijden, Kauwen, Regen
Drie formaten dekken het meeste van wat presteert in deze categorie. Elk is een volledige kopieer-en-plak-prompt met instellingen en de clip die het produceerde. Bewust geen glas, geen rood, geen leisteen ergens hieronder: als elke clip op je account er hetzelfde uitziet, behandelt het algoritme het als dezelfde clip.
Tabel 3: dezelfde vijf vakken, drie verschillende taken.
| Vak | Sjabloon 1, Het Snijden | Sjabloon 2, Het Kauwen | Sjabloon 3, De Regen |
|---|---|---|---|
| Materiaal | druipende honingraat, heet stalen mes | gloeiend gesmolten gesteente, stenen kom | regen op autoruitglas |
| Actievorm | mes zakt van voor naar achteren, honing trekt naar beneden | eetstokjes tillen, dan twee happen | geen onderwerp actie, alleen druppels |
| Mic-perspectief | close-mic, zeer droog, geen kamer | extreem dichtbij, intiem | buiten het glas, cabine gedempt |
| Geluidsreeks | wasbarst, honingrek, druppel op bord | gesmolten sissen, nat kauwen, glasachtige knars, uitademing | gestage regentapijt, druppelinslagen, ver weg bandengezoem |
| Negatieven | geen muziek, geen stem, geen kamernagalm | geen woorden, geen muziek, geen vertelling | geen muziek, geen donder, geen stem, geen ruitenwissers |
Sjabloon 1, Het Snijden. Honingraat, amber en goud, 9:16, 768P, 6 seconden, ratio: "9:16".
plaintext1Extreme macro, vastgezette overhead-opname van een dikke plaat gouden honingraat op een 2lichte keramische plaat, honing die er al omheen stroomt. Een heet stalen mes daalt in 3de was en zakt er van voren naar achteren doorheen in één langzame, continue druk; de 4snijvlakken zakken in elkaar en een zware draad honing rekt uit en druppelt op de plaat. 5Warme amberkleurige sleutellicht van links, geringe scherptediepte, enkele take, geen 6cuts, geen handen in beeld. 7 8Audio: ASMR, close-mic, zeer droog, geen kamernagalm, geen muziek, geen stem, geen 9vertelling. Een zacht gekraak van was dat splijt onder het mes, dan een dikke, lage 10rekkende trek terwijl de honing langer wordt, dan twee zware natte druppels die op de 11keramische plaat vallen. Niets anders.
ZsVmf9AhPnw
Sjabloon 1, $0,60. Wasbarst, honingrek, druppel. Gegenereerd met minimax/h3/text-to-video.
Sjabloon 2, Het Kauwen. Lava-mukbang, het formaat dat in een week 11,3 miljoen weergaven trok, 9:16, 768P, 8 seconden, ratio: "9:16".
plaintext1Verticale close-up: een paar zwarte lak-eetstokjes tilt een gloeiende klomp gesmolten 2oranje lava uit een donkere stenen kom en draagt het naar de camera, uit het kader aan 3de onderkant. De lava is zelfverlichtend, werpt oranje licht op alles eromheen; de rest 4van de kamer is bijna zwart. Stoom stijgt op van het oppervlak. Vastgezette camera, 5enkele take, geen cuts. 6 7Audio: ASMR, extreem close-mic, intiem, geen woorden, geen muziek, geen vertelling, 8geen kamertoon. Een laag, gesmolten sissen en borrelen terwijl de lava wordt opgetild, 9dan een zacht, nat kauwen, dan een helderdere glasachtige knars bij de tweede hap, dan 10één langzame, tevreden uitademing. Geen spraak.
UJhEsTnKkZI
Sjabloon 2, $0,80. Sissen, kauwen, knarsen, uitademing, en geen enkel woord. Gegenereerd met minimax/h3/text-to-video.
Sjabloon 3, De Regen. Nachtelijke autoruit, koud blauw en neon, 16:9, 768P, 10 seconden, ratio: "16:9".
Dit is de enige van de drie zonder onderwerpactie, en het leert het meeste over negatieven. Met niets dat op het scherm gebeurt, grijpt H3 naar een muziekbed, tenzij je er expliciet een verbiedt. Het is ook de clip die veruit het breedste stereoveld terugbracht, zonder erom gevraagd te zijn. Slaapgerichte inhoud wil lengte, dus deze loopt dicht bij de bovengrens van het bruikbare duurbereik.
plaintext1Macro-opname door de binnenkant van een autoruit 's nachts, zware regen die langs de 2buitenkant van het glas stroomt. Individuele druppels raken, aarzelen, dan strepen ze 3naar beneden en versmelten. Achter het glas, onscherpe neonreclame die uiteenvalt in 4koude blauwe en magenta bokeh. Geen ruitenwissers, geen mensen, geen beweging in de 5auto. Camera vastgezet, enkele continue take, geringe scherptediepte, geen cuts. 6 7Audio: ASMR, close-mic aan de buitenkant van het glas, cabine enigszins gedempt. 8Een gestaag, gelijkmatig regentapijt met duidelijk gescheiden individuele 9druppelinslagen op het glas, plus een zwak, ver weg gezoem van banden op een natte weg. 10Geen muziek, geen donder, geen stem, geen vertelling, geen ruitenwissergeluid.
bUKr5V6wbdM
Sjabloon 3, $1,00. Tien seconden pure omgeving, geen soundtrack omdat de prompt er een verbood. Gegenereerd met minimax/h3/text-to-video.
Wat een MiniMax H3 ASMR-video daadwerkelijk kost
Hier is de rekening voor dit artikel, geen schatting.
| Posterijen | Aantal | Gefactureerd |
|---|---|---|
| GPT Image 2-basiskader, high, 2048x1152 | 1 | $0,17 |
| 2K-keeper, 5s, image-to-video | 1 | $0,70 |
| 768P-draft, 5s, image-to-video | 1 | $0,50 |
| 768P reference-to-video, 5s | 1 | $0,50 |
| Sjabloonclips op 768P, 6s + 8s + 10s | 3 | $2,40 |
| Geweigerde referentieverzoeken | 2 | $0,00 |
| Totaal | $4,27 |
Zes publiceerbare clips en één basiskader. Schaal het naar een schema: één verticale clip van 8 seconden per dag op 768P kost $0,80, dus ruwweg $24 per maand voor een gezichtloos account dat dagelijks plaatst, voordat je een minuut in een editor besteedt.
Twee factuurnotities. De vermelde $0,009 van GPT Image 2 is een token-tier-vloer; een hoogwaardige 2048x1152-render komt uit op $0,1745, bijna twintig keer zoveel, dus begroot op basis van de laag die je daadwerkelijk gebruikt. En het price-veld van H3 wordt met vertraging bijgewerkt: poll tot status completed is en het is vaak nog undefined. Poll de prediction-id even later opnieuw voor het echte cijfer. Die tweede poll is de enige manier om een factuur zoals deze te bouwen in plaats van een gok.
Eén eerlijke opmerking over ASMR-audio en rechten
Upload niet de ASMR-opname van iemand anders als een refers-audiobestand. De referentie migreert oprecht timbre naar de uitvoer, en het uitvoeren van een opname door een model verandert niet wie de eigenaar is. De hier gebruikte referentie is CC BY 4.0 en hierboven vermeld, wat ongeveer twee minuten kostte om te vinden.
Bouw ASMR niet rond een herkenbare stem van een echt persoon. Elk sjabloon in dit artikel is bewust stemloos, wat zowel de genreconventie als het minst ingewikkelde pad is.
Het aanroepen van H3 via een API wordt niet beïnvloed door de community-licentie die aan de open gewichten is gekoppeld. Die licentie, die zelfhosting dekt, sluit momenteel de EU, het VK, Korea en de VS uit, en er is een formele licentiekanalen geopend voor die gebieden. Het is de moeite waard om te weten, niet de moeite waard om je zorgen over te maken als je het endpoint gebruikt.
MiniMax H3 ASMR-video: Veelgestelde vragen
Genereert een MiniMax H3 ASMR-video zijn eigen geluid, of voeg ik het later toe?
Het model genereert het. Beeld en audio komen uit dezelfde pass: 24 fps video met een AAC stereo track op 32 kHz in het geleverde bestand. Er is geen aparte audiostap, geen geluidsbibliotheek en geen synchronisatiewerk, wat de hele reden is dat dit endpoint interessant is voor ASMR.
Kan ik een MiniMax H3 ASMR-video van links naar rechts laten pannen?
Niet door het te vragen. Ik schreef expliciete kanaalaanwijzingen in de prompt en mat het resultaat: correlatie 0,97 tussen kanalen en een maximaal niveauverschil van 1,9 dB in een kwartsecondevenster, wat helemaal geen panning is. De track is echt stereo en diffuse inhoud zoals regen komt terug met een breed veld, maar discrete inslagen blijven gecentreerd, ongeacht de bewoording. Als je formaat een harde panning nodig heeft, doe het dan in post.
Kan ik mijn eigen opname uploaden als een MiniMax H3 ASMR-videoreferentie?
Ja, via reference-to-video, dat tot 3 audioreferenties accepteert naast maximaal 9 afbeeldingen en 3 video's. Audio kan niet alleen worden ingediend, dus combineer het met ten minste één afbeelding of video. De audio moet ook tussen 2 en 15 seconden zijn, en het formaat wordt gevalideerd: een .wav-payload werkte waar een audio/mpeg-payload werd geweigerd. Geweigerde verzoeken worden niet gefactureerd.
Is de audio van een 768P MiniMax H3 ASMR-video slechter dan 2K?
Nee. Beide lagen leveren dezelfde AAC stereo 32 kHz-specificatie. Alleen het beeld verandert, en het verandert veel: 16:9 komt terug als 1344x768 bij 768P versus 2560x1440 bij 2K. Omdat het creatieve oordeel in ASMR een luisteroordeel is, draft op $0,10/s en voer keepers opnieuw uit op $0,14/s. Onthoud gewoon dat de 2K-run een nieuwe take is, geen upscale van de draft.
Hoe lang moet een MiniMax H3 ASMR-video zijn en welke beeldverhouding?
Duur accepteert elk geheel getal van 4 tot 15. Snij- en kauwclips werken op 5 tot 8 seconden omdat de payoff één gebeurtenis is; slaapgerichte omgeving wil 10 of meer. Gebruik voor Shorts, Reels en TikTok 9:16, en onthoud dat text-to-video ratio expliciet moet instellen en adaptive weigert. Bij image-to-video bepaalt het eerste frame de vorm voor jou.
Hoeveel kost één MiniMax H3 ASMR-video?
Een clip van 5 seconden kost $0,50 op 768P en $0,70 op 2K. Een verticale clip van 8 seconden op 768P kost $0,80. Een van die per dag plaatsen kost ongeveer $24 per maand aan rekenkracht, wat het getal is dat de moeite waard is om te vergelijken met de 20 minuten die een editor per clip zou kosten voor de aan elkaar genaaide workflow.
Waarom komt mijn MiniMax H3 ASMR-video uit met achtergrondmuziek die ik niet heb gevraagd?
Omdat je het niet hebt verboden. De meeste video in de trainingsdata van elk model heeft een muziekbed, dus het standaardgedrag is om er een toe te voegen, vooral wanneer er niets op het scherm gebeurt. Zet de negatieven expliciet in het audiogedeelte van de prompt: geen muziek, geen stem, geen vertelling, geen kamernagalm, geen omgevingsbed. Omgevingssjablonen hebben dit meer nodig dan actiesjablonen.






