Seedance 2.5 är nu live — Först på Atlas Cloud

MiniMax H3 ASMR-video: Jag skar ett glasgranatäpple, sedan mätte jag om stereon var äkta

De flesta AI-ASMR klistrar på lagerljud på tyst video. En MiniMax H3-ASMR-video renderar 32 kHz stereo i ett enda pass. Jag mätte kanalerna, med prompts och kostnader.

Sätt på hörlurarna innan du scrollar till klippet nedan. I den här kategorin spelar det faktiskt roll.

En kniv kommer ner genom ett granatäpple skuret i rubinglas. Skalet spricker, en kristallin knäck, och sedan rullar ett dussin glasfrön över våt skiffer. Här är det som skiljer sig från nästan alla AI-ASMR-klipp du scrollat förbi i år: ingen lade till det ljudet. Det fanns inget ljudbibliotek, ingen redigerare, ingen tidslinje. Bilden och ljudet kom ur en enda generering, i ett enda anrop.

Det senaste året har AI-ASMR sett tillfredsställande ut och låtit lite fel, och anledningen var aldrig bilderna. Det var det sista steget i pipeline. Att klistra ljud på ett tyst klipp har varit ett manuellt jobb, gjort för hand, varje gång. Kategorin växte så snabbt runt den luckan att en liten industri av dedikerade AI-ASMR-generatorsajter dök upp enbart för att automatisera ihopklistringen, en av dem annonserade "binauralt 3D-ljud" direkt på startsidan. Efterfrågan var bevisad för länge sedan. Den betjänades bara av löpande band.

Så jag körde det ordentligt. Ett reproducerbart arbetsflöde, sex klipp, och sedan den del som ingen i den här kategorin någonsin gör: jag drog isär vänster och höger kanal i ffmpeg och mätte dem. En del av det jag förväntade mig visade sig vara fel, och det visade sig vara det mest användbara i artikeln.

Viktiga slutsatser

  • H3 renderar 24 fps-bilden och ett 32 kHz AAC stereo-spår i samma pass. Ljudet genereras, inte dubbat i efterhand.
  • Stereot är genuint stereo, inte dual mono i en stereokostym. Men du kan inte styra panorering. Jag bad om en hård svepning från vänster till höger och fick en 1,9 dB skillnad, vilket är ingenting.
  • Stereo bredd kommer från innehållet, inte från din formulering. Regnklippet, där jag inte bad om någon riktning alls, kom tillbaka med ett genuint brett fält.
  • Att låsa första bilden håller bilden över upplösningar, men 768P och 2K är fortfarande två olika tagningar. Utkastet förhandsvisar utseendet och ljudspecifikationen, inte den exakta koreografin.
  • Ett 5 sekunders 768P-klipp kostar $0,50. Samma klipp i 2K kostar $0,70. Hela artikeln kostade $4,27.

Lyssna först: En MiniMax H3 ASMR-video, skuren i ett pass

w7ZRR7bo3KI

Fem sekunder, 2K, 24 fps, 32 kHz stereo, en generation, $0,70. Ljud på: knirket när eggen biter i, knäcken, sedan fröna. Inget av det lades till i efterhand. Genererad med minimax/h3/image-to-video.

Ett prompt. En modell. Ett anrop. Allt nedanför är hur det klippet gjordes, vad det kostade och vilka delar av marknadsföringsberättelsen som överlever kontakt med en vågform.

Varför AI-ASMR exploderade, och varför det mesta misslyckas i hörlurstestet

Trenden har en födelsedag. AI-ASMR började spridas i juni 2025, direkt efter att Veo 3 landade, och formatet blev viralt inom dagar. En lava-mukbang från @asmraiworks fick över 11,3 miljoner visningar på en vecka; ett glasklippningsklipp fick 5,3 miljoner på elva dagar (Know Your Meme, 2025). Nyhetsrum plockade upp det som en kuriositet, med surrealistiska bilder och smält lava som äts med ätpinnar som gjorde det mesta av det tunga lyftet (The Express Tribune, 2025).

Sedan satte folk på hörlurar, och stämningen ändrades. TechRadars skribent tittade på en hög av de virala och kom iväg med en beskrivning av en konstgjord glans, "saknar de fel och den oprecision som är kännetecknet för mänskliggjord ASMR" (TechRadar, juni 2025). Fans som citerades i den artikeln sa att kittlingsutlösarna var tekniskt närvarande och det var ändå inte samma sak.

Det finns en mekanisk anledning, och den är inte mystisk. ASMR är den enda innehållskategorin där innehållet är ljudet. Överallt annars är ljud en garnering. Här är det produkten. Och det dominerande arbetsflödet var:

  1. generera ett tyst klipp med en videomodell,
  2. leta i ett ljudbibliotek efter en knäck, ett crunch, ett regnskikt,
  3. passa ihop ljudet med bilden i en redigerare,
  4. handpanorera och handmixa om du bryr dig, vilket nästan ingen gör i stor skala,
  5. exportera.

Steg 3 är där det dör. En konserverad knäck som avfyras två bildrutor för sent uppfattas som fejk innan du kan förklara varför. Multiplicera det med ett dagligt publiceringsschema och felen ackumuleras, eftersom justeringen görs om av en människa varje gång.

Den luckan är anledningen till att en hel småindustri av AI-ASMR-generatorsajter finns. Åtminstone tre marknadsför sig aktivt och en leder med binauralt 3D-ljud som en rubrikfunktion. De löser inte ett falskt problem. De lappar ett verkligt hål: videomodellerna under dem producerar inget ljud.

Vilket gör en ledartavla värd att titta på. På Artificial Analysis video-redigeringsboard, den som poängsätts med ljud, ligger MiniMax H3 på #1 med 1 126 Elo, före Gemini Omni Flash på 1 119 och ungefär hundra poäng före Dreamina Seedance 2.0 på 1 027 (Artificial Analysis, augusti 2026). På image-to-video-brädorna, där ljud inte är en del av poängen, ligger flera av dessa modeller inom ett par poäng från varandra. Gapet öppnar sig när ljud räknas. För ASMR är ljud allt som räknas.

MiniMax H3 ASMR-video-arbetsflödet, och vad varje steg kostar

Tre slutpunkter, en webbläsarflik. Jag körde allt i den här artikeln på Atlas Cloud, så varje siffra nedan kom från fakturan snarare än en prislista.

Jobb i denna artikelModellPris
Första bild för showcaseOpenAI GPT Image 2 (text-to-image)listat från $0,009/bild, fakturerad $0,1745 vid high och 2048x1152
Utkast och keeperMiniMax H3 Image-to-Video$0,10/s vid 768P, $0,14/s vid 2K
Mata in en riktig inspelningMiniMax H3 Reference-to-Videosamma två nivåer
De tre mallarnaMiniMax H3 Text-to-Videosamma två nivåer
Det gamla sättet, endast ljudhälftenByteDance Seed Audio 1.0$0,143/min

Listningen visar "Från $0,1/SEK" på alla tre H3-slutpunkter. Det är 768P-golvet. 2K faktureras till $0,14/s och den siffran visas ingenstans förutom på din faktura, så planera efter den nivå du faktiskt begär.

Tabell 1: ett pass kontra den ihopfogade pipelinen.

 MiniMax H3, inbyggt ljudTyst modell plus efterljud
Steg till ett färdigt klipp14 till 5
Verktyg inblandade1videomodell + ljudbibliotek + redigerare + export
Hur bild och ljud synkassamma generation, samma tidslinjedu drar tills det ser rätt ut
Vem mixar och panoreraringen, du tar vad modellen gerdu, för hand, per ljud
Mänsklig tid per klippungefär noll efter prompten15 till 40 minuter, ärligt talat
Beräkning per 5s-klipp$0,50 vid 768Pvideomodell + $0,143/min ljudgenerering

Jag citerar medvetet inte en rivaliserande videoplattforms pris per sekund, eftersom beräkning inte är där skillnaden finns. Ljudgenerering kostar $0,143 per minut, vilket är slantar. Den verkliga kostnaden för den ihopfogade pipelinen är 20 minuters mänsklig uppmärksamhet per klipp, och den kostnaden sjunker inte när du skalar. Den multipliceras. Ett ansiktslöst konto som publicerar dagligen är precis där 20 minuter per klipp tyst äter upp hela affärsmodellen.

Den ärliga motvikten: handsömning ger dig kontroll. Du kan placera ett ljud var som helst i stereofältet och trimma det till bilden. H3 ger dig synken gratis och, som mätningarna nedan visar, ger dig inte den kontrollen tillbaka.

Tabell 2: de tre H3-slutpunkterna, parametrarna som faktiskt spelar roll.

 image-to-videotext-to-videoreference-to-video
Huvudingångbild (första bildruta)endast promptrefers[]
Upplösning768P / 2K, standard 2Ksammasamma
Längdvalfri hel sekund 4 till 15, standard 8sammasamma
Förhållandebestäms av första bildenmåste anges explicit, adaptivt avvisasbestäms av referenserna
Begränsningar referenseranvänds inte tillsammans med bildanvänds inteupp till 9 bilder, 3 videor, 3 ljud
Levererad 16:9-utdata1344x768 vid 768P, 2560x1440 vid 2Ksammasamma
LjudspårAAC stereo 32 kHz över 24 fps videosammasamma

Två parameterfällor värda att skriva på handen. Parametern heter ratio, inte aspect_ratio, och fel nyckel lämnar den oinställd så text-to-video avvisar begäran. Och image plus refers i samma anrop ger inget fel: det slutförs, faktureras fullt och kastar tyst bort en av de två ingångarna.

MiniMax H3 ASMR-video-handledning: Skära ett glasgranatäpple

Att skära glasfrukt är formatet alla känner igen, så läsaren vet omedelbart vad de tittar på. Glasäpplen och glasmango har dock gjorts till leda. Ett granatäpple är bättre av en specifik anledning: när skalet spricker spills hundratals glasfrön ut och rullar, så ljudet har varaktighet och struktur istället för att vara en centrerad stöt. Om en modell fejkar sitt ljud är en spridning där det syns.

Steg 1: Bygg basbilden med GPT Image 2

Lås kompositionen innan du spenderar något på video. Inställningar: quality: high, size: 2048x1152 (16:9), output_format: png.

plaintext
1Extreme close-up macro photograph of a whole pomegranate carved entirely from thick
2translucent ruby-red glass, resting on a wet black slate slab. The glass shell is 8mm
3thick with visible internal bubbles and chipped facets; hundreds of tiny glass seeds
4glow inside like garnet crystals. A polished Japanese santoku knife lies at the left
5edge of the frame, blade tip just touching the glass skin. One hard key light from the
6upper right rakes across the slab and throws sharp red caustics onto the wet stone.
7100mm macro, f/2.8, shallow depth of field, dark moody background.
8No hands, no text, no watermark, no logo.

AI-bildgeneratorgränssnitt med textprompt och genererad bild

GPT Image 2-lekplats på Atlas Cloud med kvalitet inställd på high och storlek 16:9 2048x1152, glasgranatäpplet renderat i OUTPUT-panelen

Den riktiga körningen. Kvalitet high vid 2048x1152, och sidan anger $0,1745, vilket är vad fakturan senare sa också.

Knivblad som skär ett genomskinligt rött glasgranatäpple på mörk sten

Den genererade basbilden: ett granatäpple skuret i tjockt rubinglas på våt svart skiffer, en santokukniv som kommer in från vänsterkanten

Bilden som skickades till H3. Genererad med openai/gpt-image-2/text-to-image.

Steg 2: Skriv ljuddelen av MiniMax H3 ASMR-videoprompten

De flesta skriver en ASMR-prompt som en bildbeskrivning med ordet "ASMR" fastklistrat framför, och undrar sedan varför modellen poängsätter det med lo-fi-piano. H3 tar ljudinstruktioner på allvar om du ger den några. Strukturera ljuddelen i fem fack:

  1. Material. Vad som gör ljudet. Glas, vax, smält sten, vatten på glas. Var specifik om tjocklek och våthet, de förändrar klangfärgen.
  2. Handling och dess form i tiden. Inte bara "skär" utan "trycker ner i ett långsamt kontinuerligt drag". Modellen använder detta för att placera händelser.
  3. Mikroperspektiv.close-mic, intimate, inspelningsavståndsindikationer. Detta sätter hur torrt och nära ljudet känns, och det fungerar bra.
  4. Onomatopoesi-sekvens. Stava ljudhändelserna i ordning: knirk, sedan knäck, sedan dussintals små stötar, sedan tystnad. Detta är facket som gör mest arbete.
  5. Negationer.no music, no voice, no narration, no room reverb, no ambience bed. Utan dessa kommer H3 hjälpsamt att lägga till ett soundtrack, eftersom de flesta videor i dess träningsdata har ett.

Jag skrev också kanalinstruktioner i fack 4, och bad om knäcken i vänster kanal och fröna som rullar från vänster till höger. Fortsätt läsa för vad det faktiskt producerade.

Steg 3: Kör 768P-utkastet

Utkast i 768P. Ljudspåret har samma specifikation på båda nivåerna, så hela det kreativa omdömet, som i ASMR är ett lyssningsomdöme, kan göras till det billiga priset.

Inställningar på minimax/h3/image-to-video: image = utdata från steg 1, resolution: 768P, duration: 5. Förhållandet kommer från första bilden, så lämna det ifred.

plaintext
1The santoku blade enters from the left and presses down through the glass pomegranate
2in one slow continuous stroke, travelling left to right across the frame. The shell
3splits with a bright crystalline crack and a spray of tiny glass seeds tumbles onto the
4wet slate, scattering toward the right edge. Camera locked off, macro, single take, no cuts.
5
6Audio: ASMR, close-mic, intimate, no music, no voice, no narration, no room reverb.
7A dry sustained glass squeak as the edge bites in, then one sharp high crack panned to
8the LEFT channel, followed by dozens of small tinkling seed impacts rolling from the
9LEFT channel across to the RIGHT channel as they scatter. A faint blade-on-stone scrape
10at the very end, then silence. No ambience bed, no hum, no background music.

AI-videogeneratorgränssnitt med ett glasgranatäpple-video

MiniMax H3 image-to-video-lekplats på Atlas Cloud med basbilden laddad, duration 5, och ett färdigt klipp i OUTPUT-panelen

Image-to-video-körningen: första bilden laddad, duration 5, OUTPUT slutförd. Notera att Resolution-väljaren sitter på sidans standard av 2K. Byt till 768P för utkast, vilket är vad klippet nedan renderades i.

xkolGEKI7UI

768P-utkastet, $0,50. Mjukare bild än hjälteklippet, samma ljudspecifikation. Detta är tagningen som hela beslutet fattas på.

Steg 4: Mät stereon innan du litar på den

Ta inte mitt ord för ljudet, och ta inte modellens. Dra isär kanalerna och titta. Detta är lokal ffmpeg, inget API-anrop, ingen kostnad:

plaintext
1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \
2  -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \
3  -frames:v 1 stereo-proof.png

Vågformsjämförelse av stereokanalseparering i två ASMR-ljudklipp

Fyrpanels vågformsanalys som jämför glasgranatäppleklippet och regnklippet, visar vänster och höger kanal plus sidokanalen för varje

Vänster kanal över höger kanal för två klipp, plus sidokanalen (vänster minus höger) vid matchad förstärkning under. Detta är hela argumentet i en bild.

Här är vad som kom tillbaka, och en del av det är inte vad jag förväntade mig.

Stereon är verklig. Sidokanalen är inte tom på något klipp jag genererade. En dual mono-fil utklädd till stereo skulle visa ingenting där. Den här har innehåll.

Men du kan inte prompta en panorering. Jag bad, med versaler, om knäcken i VÄNSTER kanalen och fröna som rullar VÄNSTER till HÖGER. Uppmätt: kanalkorrelation 0,97, sidokanalen sitter 17,7 dB under mitt, och den största vänster-till-höger-nivåskillnaden i något kvartssekundsfönster är 1,9 dB. Det är inte en panorering. Det är en centrerad bild med lite naturlig bredd. Kniven rör sig över bilden; ljudet stannar kvar.

Bredd kommer från innehållet, inte från din formulering. Regnklippet i nästa avsnitt, där jag inte bad om någon riktning alls, kom tillbaka med korrelation 0,32 och sidokanalen endast 2,9 dB under mitt. Det är ett genuint brett, dekorrelerat fält. Diffus ambiens får bredd automatiskt. Diskreta stötar stannar nära mitten oavsett vad du skriver.

Så det ärliga påståendet för denna modell är inte spatialt. Det är temporalt. Du får ljud som genererades tillsammans med bilden och landar på den bildruta det tillhör, gratis, för alltid, utan redigerare. Om ditt format verkligen behöver en hård panorering måste du fortfarande göra det själv i efterproduktion, och du bör sluta skriva kanalnamn i prompts eftersom de inte gör någonting.

Kör nu om keepern: samma slutpunkt, samma första bild, samma prompt, ändra ett fält till resolution: 2K. En sak till värd att veta innan du antar att utkastet är en förhandsvisning.

Jämförelse av två videoupplösningar vid skärning av ett glasgranatäpple

Två rader med fem bildrutor som jämför 768P- och 2K-körningarna vid samma tidsstämplar, identiska vid bildruta noll och divergerande från cirka 2,5 sekunder

Samma första bild, samma prompt, båda nivåerna. Bildruta 0 matchar exakt. Vid 2,5s spricker skalet annorlunda och de två klippen har blivit olika tagningar.

Att låsa den första bildrutan håller kompositionen, inramningen, ljussättningen och färgen över båda nivåerna, vilket är anledningen till att du alltid bör använda image-to-video snarare än text-to-video för detta. Det ger dig inte samma tagning. 2K-körningen rullar om handlingen. Behandla utkastet som en förhandsvisning av utseendet och ljudet, inte av den exakta koreografin.

Steg 5: Lägg till en riktig inspelning som MiniMax H3 ASMR-videoreferens

Om du har ett ljud du faktiskt vill ha, lämna över det. reference-to-video tar upp till 9 bilder, 3 videor och 3 ljudklipp, och den hämtar klangfärg och rumskaraktär från en ljudreferens istället för att uppfinna dem. Jag använde en public-domain-vänlig glasbrytningsinspelning av Gravity Sound från Wikimedia Commons (CC BY 4.0), tre tagningar ihopsatta till 4,5 sekunder.

Tre regler, och jag fann de två sista på det hårda sättet genom att ha förfrågningar avvisade:

  • Ljud kan inte gå ensamt. Slutpunkten stavar ut det: minst en bild eller video krävs, och ljud ensamt är inte tillåtet. Para ihop det med en bild.
  • Ljudreferensen måste vara 2 till 15 sekunder. Mitt första försök använde ett 1,49 sekunders klipp och kom tillbaka med audio duration 1486 ms, expected [2000, 15000] ms. Det intervallet finns inte på modellsidan.
  • Filformatet kontrolleras. En base64-nyttolast deklarerad som audio/mpeg avvisades med audio format ".mpeg" not allowed. En .wav-nyttolast gick igenom. Avvisade förfrågningar faktureras inte, men de kostar dig en tur och retur.

Inställningar: refers: [{url: <basbild>, type: "image"}, {url: <en 2 till 15s inspelning>, type: "audio"}], resolution: 768P, duration: 5.

plaintext
1Same locked-off macro shot: the blade slices the glass pomegranate from left to right
2and the seeds scatter. Match the timbre, brightness and room character of the reference
3audio, same recording distance, same dryness. ASMR close-mic, no music, no voice.

AI-videogeneratorgränssnitt med promptinmatning och genererad granatäpplevideo

MiniMax H3 reference-to-video-lekplats på Atlas Cloud med två referensmaterial laddade, en ljudfil i slot 1 och basbilden i slot 2

Referensmaterial som bär ljudfilen och bilden tillsammans, 2 av 9 använda. Ta bort bilden och begäran kommer inte att köras alls.

mY1VrOfM3cM

Den referensstyrda tagningen, $0,50. Samma bild, klangfärg styrd av en riktig inspelning snarare än uppfunnen från prompten. Ljudreferens: Glass breaking av Gravity Sound, CC BY 4.0.

Tre MiniMax H3 ASMR-videomallar: Skära, Tugga, Regn

Tre format täcker det mesta som presterar i den här kategorin. Varje är en komplett kopiera-och-kör-prompt med inställningar och klippet det producerade. Medvetet inget glas, inget rött, ingen skiffer någonstans nedan: om varje klipp på ditt konto ser likadant ut behandlar algoritmen det som samma klipp.

Tabell 3: samma fem fack, tre olika jobb.

FackMall 1, SkäretMall 2, TuggningenMall 3, Regnet
Materialdroppande honungskaka, het stålknivglödande smält lava, stenskålregn på bilruta glas
Handlingsformblad sjunker framifrån och bak, honung drar nerätpinnar lyfter, sedan två tuggoringet motivhandling, endast droppar
Mikroperspektivclose-mic, mycket torrt, inget rumextremt nära, intimtutanför glaset, hytt dämpad
Ljudsekvensvaxknäck, honungssträck, droppe på tallriksmält väsande, våt tugga, glasigt crunch, utandningstadigt regnskikt, droppträff, avlägset däckssus
Negationeringen musik, ingen röst, inget rumsekoinga ord, ingen musik, ingen berättelseingen musik, inget åska, ingen röst, inga vindrutetorkare

Mall 1, Skäret. Honungskaka, bärnsten och guld, 9:16, 768P, 6 sekunder, ratio: "9:16".

plaintext
1Extreme macro, locked-off overhead shot of a thick slab of golden honeycomb on a pale
2ceramic plate, honey already pooling around it. A hot steel blade lowers into the wax
3and sinks through it front to back in one slow continuous press; the cut faces slump
4and a heavy thread of honey stretches and drips onto the plate. Warm amber key light
5from the left, shallow depth of field, single take, no cuts, no hands in frame.
6
7Audio: ASMR, close-mic, very dry, no room reverb, no music, no voice, no narration.
8A soft crackling of wax splitting under the blade, then a thick low stretching pull as
9the honey lengthens, then two heavy wet drips landing on the ceramic plate. Nothing else.

ZsVmf9AhPnw

Mall 1, $0,60. Vaxknäck, honungssträck, droppe. Genererad med minimax/h3/text-to-video.

Mall 2, Tuggningen. Lava-mukbang, formatet som drog 11,3 miljoner visningar på en vecka, 9:16, 768P, 8 sekunder, ratio: "9:16".

plaintext
1Vertical close-up: a pair of black lacquer chopsticks lifts a glowing clump of molten
2orange lava out of a dark stone bowl and carries it toward the camera, out of frame at
3the bottom. The lava is self-illuminating, casting orange light on everything around it;
4the rest of the room is almost black. Steam curls off the surface. Locked-off camera,
5single take, no cuts.
6
7Audio: ASMR, extremely close-mic, intimate, no words, no music, no narration, no room tone.
8A low molten sizzle and bubbling as the lava is lifted, then a soft wet chew, then a
9brighter glassy crunch on the second bite, then one slow satisfied exhale. No speech.

UJhEsTnKkZI

Mall 2, $0,80. Väsande, tugga, crunch, utandning, och inte ett enda ord. Genererad med minimax/h3/text-to-video.

Mall 3, Regnet. Nattlig bilruta, kallt blått och neon, 16:9, 768P, 10 sekunder, ratio: "16:9".

Detta är den enda av de tre utan motivhandling, och den lär dig mest om negationer. Med inget som händer på skärmen sträcker sig H3 efter en musikbakgrund om du inte uttryckligen förbjuder en. Det är också klippet som kom tillbaka med den överlägset bredaste stereofältet, utan att bli tillfrågat. Sömnorienterat innehåll vill ha längd, så detta körs nära toppen av det användbara längdintervallet.

plaintext
1Macro shot through the inside of a car window at night, heavy rain running down the
2outside of the glass. Individual droplets hit, hesitate, then streak downward and merge.
3Beyond the glass, out-of-focus neon signage breaks into cold blue and magenta bokeh.
4No wipers, no people, no movement inside the car. Camera locked off, single continuous
5take, shallow depth of field, no cuts.
6
7Audio: ASMR, close-mic on the outside of the glass, cabin slightly muffled.
8A steady even rain bed with clearly separated individual droplet impacts on the glass,
9plus a faint distant hiss of tyres on a wet road. No music, no thunder, no voice,
10no narration, no wiper noise.

bUKr5V6wbdM

Mall 3, $1,00. Tio sekunder av ren ambiens, inget soundtrack eftersom prompten förbjöd ett. Genererad med minimax/h3/text-to-video.

Vad en MiniMax H3 ASMR-video faktiskt kostar

Här är kvittot för denna artikel, inte en uppskattning.

RadartikelAntalFakturerad
GPT Image 2 basbild, high, 2048x11521$0,17
2K keeper, 5s, image-to-video1$0,70
768P utkast, 5s, image-to-video1$0,50
768P reference-to-video, 5s1$0,50
Mallklipp vid 768P, 6s + 8s + 10s3$2,40
Avvisade referensförfrågningar2$0,00
Totalt $4,27

Sex publicerbara klipp och en basbild. Skala det till ett schema: ett 8 sekunders vertikalt klipp per dag vid 768P är $0,80, så ungefär $24 per månad för ett ansiktslöst konto som publicerar dagligen, innan du spenderar en minut i en redigerare.

T två faktureringsanteckningar. GPT Image 2:s listade $0,009 är ett token-nivågolv; en hög kvalitet 2048x1152-rendering landar på $0,1745, nästan tjugo gånger det, så budgetera från den nivå du faktiskt använder. Och H3:s price-fält fylls i med fördröjning: polla tills status är completed och det är ofta fortfarande undefined. Polla prediktions-id:t igen en stund senare för den verkliga siffran. Den andra pollningen är det enda sättet att bygga ett kvitto som detta istället för en gissning.

En ärlig not om ASMR-ljud och rättigheter

Ladda inte upp någon annans ASMR-inspelning som en refers-ljudfil. Referensen migrerar verkligen klangfärg till utdata, och att köra en inspelning genom en modell ändrar inte vem som äger den. Referensen som används här är CC BY 4.0 och krediterad ovan, vilket tog ungefär två minuter att hitta.

Bygg inte ASMR kring en igenkännbar verklig persons röst. Varje mall i denna artikel är medvetet röstlös, vilket både är genrens konvention och den minst komplicerade vägen.

Att anropa H3 via ett API påverkas inte av communitylicensen som är kopplad till de öppna vikterna. Den licensen, som täcker egenhostning, utesluter för närvarande EU, Storbritannien, Korea och USA, och en formell licenskanal är öppen för dessa territorier. Värt att veta, inte värt att oroa sig för om du använder slutpunkten.

MiniMax H3 ASMR-video: Vanliga frågor

Genererar en MiniMax H3 ASMR-video sitt eget ljud, eller lägger jag till det i efterhand?

Modellen genererar det. Bild och ljud kommer ur samma pass: 24 fps video med ett AAC stereo-spår vid 32 kHz i den levererade filen. Det finns inget separat ljudsteg, inget ljudbibliotek och inget aligningsarbete, vilket är hela anledningen till att denna slutpunkt är intressant specifikt för ASMR.

Kan jag få en MiniMax H3 ASMR-video att panorera från vänster till höger?

Inte genom att be. Jag skrev explicita kanalinstruktioner i prompten och mätte resultatet: korrelation 0,97 mellan kanaler och en maximal nivåskillnad på 1,9 dB i något kvartssekundsfönster, vilket inte är någon panorering alls. Spåret är genuint stereo och diffust innehåll som regn kommer tillbaka med ett brett fält, men diskreta stötar förblir centrerade oavsett formulering. Om ditt format behöver en hård panorering, gör det i efterproduktion.

Kan jag ladda upp min egen inspelning som MiniMax H3 ASMR-videoreferens?

Ja, via reference-to-video, som accepterar upp till 3 ljudreferenser tillsammans med upp till 9 bilder och 3 videor. Ljud kan inte skickas in ensamt, så para ihop det med minst en bild eller video. Ljudet måste också vara mellan 2 och 15 sekunder, och formatet valideras: en .wav-nyttolast fungerade där en audio/mpeg-en avvisades. Avvisade förfrågningar faktureras inte.

Är ljudet i en 768P MiniMax H3 ASMR-video sämre än i 2K?

Nej. Båda nivåerna levererar samma AAC stereo 32 kHz-specifikation. Endast bilden ändras, och den ändras mycket: 16:9 kommer tillbaka som 1344x768 vid 768P jämfört med 2560x1440 vid 2K. Eftersom det kreativa omdömet i ASMR är ett lyssningsomdöme, gör utkast till $0,10/s och kör om keepers till $0,14/s. Kom bara ihåg att 2K-körningen är en ny tagning, inte en uppskalning av utkastet.

Hur lång bör en MiniMax H3 ASMR-video vara, och vilket bildförhållande?

Längd accepterar valfri hel sekund från 4 till 15. Skärande och tuggande klipp fungerar vid 5 till 8 sekunder eftersom utdelningen är en händelse; sömnorienterad ambiens vill ha 10 eller mer. För Shorts, Reels och TikTok, använd 9:16, och kom ihåg att text-to-video kräver att ratio anges explicit och avvisar adaptive. På image-to-video bestämmer första bilden formen åt dig.

Hur mycket kostar en MiniMax H3 ASMR-video?

Ett 5 sekunders klipp kostar $0,50 vid 768P och $0,70 vid 2K. Ett 8 sekunders vertikalt klipp vid 768P är $0,80. Att publicera ett sådant per dag är cirka $24 per månad i beräkningskostnad, vilket är siffran värd att jämföra mot de 20 minuter en redigerare skulle ta per klipp i det ihopfogade arbetsflödet.

Varför kommer min MiniMax H3 ASMR-video ut med bakgrundsmusik som jag aldrig bad om?

För att du inte förbjöd det. De flesta videor i någon modells träningsdata har en musikbakgrund, så standardbeteendet är att lägga till en, särskilt när ingenting händer på skärmen. Sätt negationerna i ljuddelen av prompten explicit: no music, no voice, no narration, no room reverb, no ambience bed. Ambienta mallar behöver detta mer än handlingsbaserade.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller