Załóż słuchawki, zanim przewiniesz do poniższego klipu. W tej kategorii to naprawdę ma znaczenie.
Nóż opada na granat wyrzeźbiony ze szkła rubinowego. Łupina pęka, kryształowy trzask, a potem kilkadziesiąt szklanych pestek stacza się po mokrym łupku. Oto część, która różni się od prawie wszystkich klipów AI ASMR, które przewinąłeś w tym roku: nikt nie dodał tego dźwięku. Nie było biblioteki dźwięków, edytora ani osi czasu. Obraz i audio wyszły z jednego generowania, w jednym wywołaniu.
W zeszłym roku AI ASMR wyglądało satysfakcjonująco, a brzmiało trochę nie tak, a powodem nigdy nie były wizualizacje. Chodziło o ostatni krok procesu. Nakładanie dźwięku na niemy klip było ręczną pracą, wykonywaną za każdym razem od nowa. Kategoria rosła tak szybko wokół tej luki, że powstała mała branża dedykowanych generatorów AI ASMR, które automatyzowały łączenie, a jeden z nich reklamował „dźwięk binauralny 3D” już na stronie głównej. Popyt był udowodniony dawno temu. Tyle że był zaspokajany przez składanie.
Więc zrobiłem to porządnie. Jeden powtarzalny workflow, sześć klipów, a potem część, której nikt w tej kategorii nie robi: rozdzieliłem lewy i prawy kanał w ffmpeg i zmierzyłem je. Część tego, czego się spodziewałem, okazała się błędna, a to okazało się najcenniejszą rzeczą w artykule.
Najważniejsze wnioski
- H3 renderuje obraz 24 kl./s i stereo AAC 32 kHz w tym samym przebiegu. Dźwięk jest generowany, a nie dodawany później.
- Stereofonia jest prawdziwa, a nie dual mono w kostce stereo. Ale nie możesz zaprogramować panoramy. Poprosiłem o płynne przejście z lewej na prawą i dostałem różnicę 1,9 dB, czyli nic.
- Szerokość stereo wynika z zawartości, a nie z twojego opisu. Klip z deszczem, gdzie nie prosiłem o żaden kierunek, wyszedł z naprawdę szerokim polem.
- Zablokowanie pierwszej klatki utrzymuje ujęcie w różnych rozdzielczościach, ale 768P i 2K to wciąż dwa różne ujęcia. Wersja robocza pokazuje wygląd i specyfikację dźwięku, a nie dokładną choreografię.
- 5-sekundowy klip w 768P kosztuje 0,50 USD. Ten sam klip w 2K kosztuje 0,70 USD. Cały artykuł kosztował 4,27 USD.
Posłuchaj najpierw: film ASMR MiniMax H3, ucięty w jednym przejściu
w7ZRR7bo3KI
Pięć sekund, 2K, 24 kl./s, stereo 32 kHz, jedno generowanie, 0,70 USD. Włącz dźwięk: pisk ostrza wgryzającego się, trzask, potem pestki. Nic nie zostało dodane później. Wygenerowane za pomocą minimax/h3/image-to-video.
Jeden prompt. Jeden model. Jedno wywołanie. Wszystko poniżej to jak powstał ten klip, ile kosztował i które części historii marketingowej przetrwają kontakt z przebiegiem.
Dlaczego AI ASMR eksplodowało i dlaczego większość nie przechodzi testu słuchawek
Ten trend ma datę urodzin. AI ASMR zaczęło się rozprzestrzeniać w czerwcu 2025 roku, zaraz po premierze Veo 3, a format stał się wiralowy w ciągu kilku dni. Lava mukbang od @asmraiworks zdobył ponad 11,3 miliona wyświetleń w tydzień; klip z cięciem szkła miał 5,3 miliona w jedenaście dni (Know Your Meme, 2025). Redakcje podchwyciły to jako ciekawostkę, z surrealistycznymi wizualizacjami i płynną lawą jedzoną pałeczkami jako główną atrakcją (The Express Tribune, 2025).
Potem ludzie założyli słuchawki i nastrój się zmienił. Pisarz TechRadar obejrzał stertę wiralowych klipów i opisał je jako sztuczne, „pozbawione błędów i niedokładności, które są cechą charakterystyczną ludzkiego ASMR” (TechRadar, czerwiec 2025). Fani cytowani w tym artykule mówili, że wyzwalacze mrowienia były technicznie obecne, a mimo to nie było to samo.
Jest tego mechaniczny powód i nie jest mistyczny. ASMR to jedyna kategoria treści, w której treść to dźwięk. Wszędzie indziej audio jest dodatkiem. Tutaj jest produktem. A dominujący workflow wyglądał tak:
- wygeneruj niemy klip za pomocą modelu wideo,
- przeszukaj bibliotekę dźwięków w poszukiwaniu trzasku, chrupnięcia, szumu deszczu,
- zsynchronizuj dźwięk z obrazem w edytorze,
- ręcznie wyreguluj panoramę i mix, jeśli ci zależy, co przy dużej skali robi prawie nikt,
- eksportuj.
Krok 3 to miejsce, gdzie to umiera. Kolejny trzask opóźniony o dwie klatki brzmi fałszywie, zanim zdążysz wyjaśnić dlaczego. Pomnóż to przez codzienny harmonogram publikacji, a błędy się kumulują, ponieważ synchronizacja jest wykonywana przez człowieka za każdym razem od nowa.
Ta luka to powód, dla którego istnieje cały przemysł stron z generatorami AI ASMR. Co najmniej trzy aktywnie się promują, a jedna z nich reklamuje dźwięk binauralny 3D jako główną funkcję. Nie rozwiązują one fałszywego problemu. Łatają prawdziwą dziurę: leżące u ich podstaw modele wideo nie wytwarzają dźwięku.
Co sprawia, że jeden podział w rankingu jest wart uwagi. Na tablicy edycji wideo Artificial Analysis, tej ocenianej z dźwiękiem, MiniMax H3 zajmuje #1 z 1126 Elo, przed Gemini Omni Flash z 1119 i około sto punktów przed Dreamina Seedance 2.0 z 1027 (Artificial Analysis, sierpień 2026). Na tablicach image-to-video, gdzie dźwięk nie jest częścią oceny, kilka z tych modeli mieści się w granicach kilku punktów od siebie. Różnica pojawia się, gdy liczy się dźwięk. Dla ASMR dźwięk liczy się najbardziej.
Workflow filmu ASMR MiniMax H3 i koszt każdego kroku
Trzy endpointy, jedna zakładka przeglądarki. Wszystko w tym artykule uruchomiłem na Atlas Cloud, więc każda podana poniżej kwota pochodzi z rachunku, a nie z cennika.
| Zadanie w tym artykule | Model | Stawka |
|---|---|---|
| Pierwsza klatka do pokazu | OpenAI GPT Image 2 (text-to-image) | od 0,009 USD/obraz, naliczone 0,1745 USD w wysokiej i 2048x1152 |
| Wersja robocza i ostateczna | MiniMax H3 Image-to-Video | 0,10 USD/s w 768P, 0,14 USD/s w 2K |
| Wgranie prawdziwego nagrania | MiniMax H3 Reference-to-Video | te same dwa poziomy |
| Trzy szablony | MiniMax H3 Text-to-Video | te same dwa poziomy |
| Stary sposób, tylko połowa audio | ByteDance Seed Audio 1.0 | 0,143 USD/min |
Na liście widnieje „Od 0,1 USD/SEK” na wszystkich trzech endpointach H3. To podstawa 768P. 2K kosztuje 0,14 USD/s i ta liczba pojawia się tylko na fakturze, więc planuj w oparciu o poziom, który faktycznie zamawiasz.
Tabela 1: jedno przejście vs. łączony pipeline.
| MiniMax H3, natywne audio | Cichy model + dźwięk po obróbce | |
|---|---|---|
| Kroki do gotowego klipu | 1 | 4 do 5 |
| Zaangażowane narzędzia | 1 | model wideo + biblioteka dźwięków + edytor + eksport |
| Jak obraz i dźwięk są w synchronii | to samo generowanie, ta sama oś czasu | przeciągasz, aż wygląda dobrze |
| Kto miksuje i panuje | nikt, bierzesz to, co daje model | ty, ręcznie, przy każdym dźwięku |
| Ludzki czas na klip | mniej więcej zero po prompcie | 15 do 40 minut, szczerze |
| Obliczenia na 5-sekundowy klip | 0,50 USD w 768P | model wideo + 0,143 USD/min generacji audio |
Celowo nie podaję stawki za sekundę konkurencyjnej platformy wideo, ponieważ różnica nie leży w obliczeniach. Generowanie audio kosztuje 0,143 USD za minutę, czyli grosze. Prawdziwy koszt łączonego pipeline’u to 20 minut ludzkiej uwagi na klip, a ten koszt nie spada wraz ze skalą. Mnoży się. Konto publikujące codziennie bez twarzy to dokładnie miejsce, gdzie 20 minut na klip cicho zjada cały model biznesowy.
Uczciwa przeciwwaga: ręczne łączenie daje ci kontrolę. Możesz umieścić dźwięk w dowolnym miejscu pola stereo i przyciąć go do klatki. H3 daje synchronizację za darmo, ale, jak pokazują pomiary poniżej, nie daje ci tej kontroli z powrotem.
Tabela 2: trzy endpointy H3, parametry, które naprawdę mają znaczenie.
| image-to-video | text-to-video | reference-to-video | |
|---|---|---|---|
| Główne wejście | obraz (pierwsza klatka) | tylko prompt | refers[] |
| Rozdzielczość | 768P / 2K, domyślnie 2K | to samo | to samo |
| Długość | dowolna pełna sekunda 4 do 15, domyślnie 8 | to samo | to samo |
| Proporcje | ustalone przez pierwszą klatkę | muszą być ustawione jawnie, adaptive jest odrzucane | ustalone przez referencje |
| Limity refers | nie używane razem z obrazem | nie używane | do 9 obrazów, 3 filmów, 3 audio |
| Dostarczone wyjście 16:9 | 1344×768 w 768P, 2560×1440 w 2K | to samo | to samo |
| Ścieżka audio | AAC stereo 32 kHz, 24 kl./s video | to samo | to samo |
Dwie pułapki parametrów, które warto zapisać na ręce. Parametr nazywa się ratio, a nie aspect_ratio, a błędny klucz pozostawia go nieustawionym, więc text-to-video odrzuca żądanie. A image plus refers w tym samym wywołaniu nie powoduje błędu: wykonuje się, pobiera pełną opłatę i po cichu odrzuca jedno z dwóch wejść.
Poradnik filmu ASMR MiniMax H3: cięcie szklanego granatu
Cięcie szklanych owoców to format, który wszyscy rozpoznają, więc czytelnik od razu wie, na co patrzy. Szklane jabłka i szklane mango zostały już jednak zrobione do znudzenia. Granat jest lepszy z jednego konkretnego powodu: gdy łupina pęka, setki szklanych pestek wylewa się i toczy, więc dźwięk ma czas trwania i strukturę, zamiast być jednym centralnym uderzeniem. Jeśli model fałszuje dźwięk, rozrzut jest miejscem, gdzie to widać.
Krok 1: Zbuduj bazową klatkę za pomocą GPT Image 2
Ustal kompozycję, zanim wydasz cokolwiek na wideo. Ustawienia: quality: high, size: 2048x1152 (16:9), output_format: png.
plaintext1Zbliżenie makro całego granatu wyrzeźbionego w całości z grubego przezroczystego 2rubinowego szkła, spoczywającego na mokrej czarnej płycie łupkowej. Szklana skorupa 3ma grubość 8 mm z widocznymi wewnętrznymi pęcherzykami i wyszczerbionymi fasetami; 4setki maleńkich szklanych pestek jarzą się w środku jak kryształy granatu. Wypolerowany 5japoński nóż santoku leży na lewej krawędzi kadru, czubek ostrza ledwo dotyka szklanej 6skóry. Jedno ostre światło kluczowe z prawego górnego rogu przesuwa się po płycie i 7rzuca ostre czerwone refrakcje na mokry kamień. Obiektyw 100 mm, f/2.8, mała głębia 8ostrości, ciemne nastrojowe tło. 9Bez dłoni, bez tekstu, bez znaku wodnego, bez logo.

GPT Image 2 na Atlas Cloud z ustawioną jakością high i rozmiarem 16:9 2048×1152, szklany granat wyrenderowany w panelu OUTPUT
Rzeczywiste uruchomienie. Jakość high w 2048×1152, a strona podaje 0,1745 USD, co później pokazała też faktura.

Wygenerowana klatka bazowa: granat z grubego rubinowego szkła na mokrym czarnym łupku, nóż santoku wchodzący z lewej krawędzi
Klatka przekazana do H3. Wygenerowane za pomocą openai/gpt-image-2/text-to-image.
Krok 2: Napisz część audio promptu filmu ASMR MiniMax H3
Większość ludzi pisze prompt ASMR jako opis obrazu z doklejonym słowem „ASMR” na początku, a potem dziwi się, że model ocenia go z lo-fi pianinem. H3 traktuje wskazówki audio poważnie, jeśli mu je dasz. Ustrukturyzuj część audio w pięciu slotach:
- Materiał. Co wydaje dźwięk. Szkło, wosk, stopiona skała, woda na szkle. Bądź konkretny co do grubości i wilgotności – zmieniają barwę.
- Akcja i jej kształt w czasie. Nie tylko „tnie”, ale „naciska w jednym wolnym, ciągłym pociągnięciu”. Model używa tego do umiejscowienia zdarzeń.
- Perspektywa mikrofonu.
close-mic,intimate, wskazówki odległości nagrywania. To ustawia, jak suchy i bliski wydaje się dźwięk, i działa dobrze. - Sekwencja onomatopei. Wypisz zdarzenia dźwiękowe w kolejności: pisk, potem trzask, potem kilkadziesiąt małych uderzeń, potem cisza. To jest slot, który robi najwięcej.
- Negacje.
no music, no voice, no narration, no room reverb, no ambience bed. Bez nich H3 chętnie doda muzykę w tle, ponieważ większość filmów w jego danych treningowych ją ma.
Napisałem też wskazówki kanałowe w slocie 4, prosząc o trzask w lewym kanale i pestki toczące się z lewej na prawą. Czytaj dalej, aby zobaczyć, co to faktycznie wyprodukowało.
Krok 3: Uruchom wersję roboczą w 768P
Wersja robocza w 768P. Ścieżka audio jest taka sama w obu poziomach, więc cały osąd twórczy, który w ASMR jest osądem słuchowym, można podjąć przy niskiej stawce.
Ustawienia na minimax/h3/image-to-video: image = wynik z kroku 1, resolution: 768P, duration: 5. Proporcje pochodzą z pierwszej klatki, więc zostaw je w spokoju.
plaintext1Ostrze santoku wchodzi z lewej strony i naciska w dół przez szklany granat w jednym 2wolnym, ciągłym pociągnięciu, przesuwając się z lewej na prawą w kadrze. Łupina pęka 3z jasnym kryształowym trzaskiem, a fontanna maleńkich szklanych pestek wysypuje się 4na mokry łupek, rozsypując się w kierunku prawej krawędzi. Aparat unieruchomiony, 5makro, pojedyncze ujęcie, bez cięć. 6 7Audio: ASMR, close-mic, intymne, bez muzyki, bez głosu, bez narracji, bez pogłosu pomieszczenia. 8Suchy, ciągły pisk szkła, gdy ostrze się wgryza, potem jeden ostry, wysoki trzask 9wyparowany na LEWYM kanale, a następnie kilkadziesiąt małych brzęczących uderzeń pestek 10toczących się z LEWEGO kanału na PRAWY, gdy się rozsypują. Na samym końcu słaby 11zgrzyt ostrza o kamień, potem cisza. Bez tła dźwiękowego, bez szumu, bez muzyki w tle.

MiniMax H3 image-to-video na Atlas Cloud z załadowaną klatką bazową, czasem trwania 5 i ukończonym klipem w panelu OUTPUT
Uruchomienie image-to-video: załadowana pierwsza klatka, czas trwania 5, OUTPUT ukończony. Zwróć uwagę, że wybór Resolution jest ustawiony na domyślną dla strony wartość 2K. Przełącz go na 768P dla wersji roboczych, z czego poniższy klip został wyrenderowany.
xkolGEKI7UI
Wersja robocza 768P, 0,50 USD. Miększy obraz niż w głównym klipie, ta sama specyfikacja audio. To na podstawie tego ujęcia podejmuje się całą decyzję.
Krok 4: Zmierz stereo, zanim mu zaufasz
Nie wierz mi na słowo w kwestii dźwięku i nie wierz modelowi. Rozdziel kanały i spójrz. To lokalny ffmpeg, bez wywołania API, bez kosztów:
plaintext1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \ 2 -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \ 3 -frames:v 1 stereo-proof.png

Analiza przebiegu w czterech panelach porównująca klip z szklanym granatem i klip z deszczem, pokazująca lewy i prawy kanał oraz kanał boczny dla każdego
Lewy kanał nad prawym dla dwóch klipów, plus kanał boczny (lewy minus prawy) przy dopasowanym wzmocnieniu poniżej. To jest cały argument na jednym obrazku.
Oto, co otrzymałem, i część tego nie jest tym, czego się spodziewałem.
Stereofonia jest prawdziwa. Kanał boczny nie jest pusty w żadnym z wygenerowanych przeze mnie klipów. Plik dual mono przebrany za stereo nie pokazałby niczego. Ten ma zawartość.
Ale nie możesz zaprogramować panoramy. Poprosiłem, dużymi literami, o trzask w LEWYM kanale i pestki toczące się z LEWEJ na PRAWĄ. Zmierzone: korelacja kanałów 0,97, kanał boczny 17,7 dB poniżej środka, a największa różnica poziomów między lewym a prawym w dowolnym oknie ćwierćsekundowym wynosi 1,9 dB. To nie jest panorama. To wyśrodkowany obraz z odrobiną naturalnej szerokości. Nóż przesuwa się w poprzek kadru; dźwięk pozostaje na miejscu.
Szerokość wynika z zawartości, a nie z twojego opisu. Klip z deszczem w następnej sekcji, gdzie nie prosiłem o żaden kierunek, wyszedł z korelacją 0,32, a kanał boczny tylko 2,9 dB poniżej środka. To naprawdę szerokie, nieskorelowane pole. Rozproszone tło automatycznie zyskuje szerokość. Dyskretne uderzenia pozostają blisko środka, bez względu na to, co napiszesz.
Uczciwe twierdzenie dla tego modelu nie jest więc przestrzenne. Jest czasowe. Otrzymujesz dźwięk, który został wygenerowany razem z obrazem i trafia na klatkę, do której należy, za darmo, na zawsze, bez edytora. Jeśli twój format naprawdę potrzebuje twardej panoramy, nadal musisz to zrobić sam w postprodukcji i powinieneś przestać wpisywać nazwy kanałów w promptach, bo one nic nie robią.
Teraz uruchom ponownie wersję ostateczną: ten sam endpoint, ta sama pierwsza klatka, ten sam prompt, zmień jedno pole na resolution: 2K. Jeszcze jedna rzecz, którą warto wiedzieć, zanim założysz, że wersja robocza jest podglądem.

Dwa wiersze po pięć klatek porównujące uruchomienia w 768P i 2K w tych samych znacznikach czasu, identyczne w klatce zerowej i rozchodzące się od około 2,5 sekundy
Ta sama pierwsza klatka, ten sam prompt, oba poziomy. Klatka 0 pasuje dokładnie. Około 2,5 s skorupa pęka inaczej i oba klipy stają się różnymi ujęciami.
Zablokowanie pierwszej klatki utrzymuje kompozycję, kadrowanie, oświetlenie i kolor w obu poziomach, dlatego zawsze powinieneś używać image-to-video zamiast text-to-video do tego celu. Nie daje ci to tego samego ujęcia. Uruchomienie w 2K przerzuca akcję. Traktuj wersję roboczą jako podgląd wyglądu i dźwięku, a nie dokładnej choreografii.
Krok 5: Dodaj prawdziwe nagranie jako referencję filmu ASMR MiniMax H3
Jeśli masz dźwięk, którego faktycznie chcesz, podaj go. reference-to-video przyjmuje do 9 obrazów, 3 filmy i 3 klipy audio, a barwę i charakter pomieszczenia pobiera z referencji audio zamiast je wymyślać. Użyłem przyjaznego dla domeny publicznej nagrania tłuczonego szkła autorstwa Gravity Sound z Wikimedia Commons (CC BY 4.0), trzy ujęcia połączone w 4,5 sekundy.
Trzy zasady, a dwie ostatnie odkryłem na własnej skórze, gdy żądania zostały odrzucone:
- Audio nie może iść samo. Endpoint wyjaśnia to wprost: wymagany jest co najmniej jeden obraz lub film, a samo audio nie jest dozwolone. Połącz je z klatką.
- Referencja audio musi mieć od 2 do 15 sekund. Moja pierwsza próba użyła klipu o długości 1,49 sekundy i otrzymała odpowiedź
audio duration 1486 ms, expected [2000, 15000] ms. Ten zakres nie jest podany na stronie modelu. - Format pliku jest sprawdzany. Ładunek base64 zadeklarowany jako
audio/mpegzostał odrzucony z komunikatemaudio format ".mpeg" not allowed. Ładunek.wavprzeszedł. Odrzucone żądania nie są rozliczane, ale kosztują cię czas.
Ustawienia: refers: [{url: <klatka bazowa>, type: "image"}, {url: <nagranie od 2 do 15 s>, type: "audio"}], resolution: 768P, duration: 5.
plaintext1To samo unieruchomione ujęcie makro: ostrze przecina szklany granat od lewej do prawej, 2a pestki się rozsypują. Dopasuj barwę, jasność i charakter pomieszczenia z referencji 3audio, tę samą odległość nagrywania, tę samą suchość. ASMR close-mic, bez muzyki, bez głosu.

MiniMax H3 reference-to-video na Atlas Cloud z załadowanymi dwoma materiałami referencyjnymi, plikiem audio w slocie 1 i klatką bazową w slocie 2
Reference Materials niosące plik audio i obraz razem, 2 z 9 użytych. Usuń obraz, a żądanie w ogóle się nie uruchomi.
mY1VrOfM3cM
Ujęcie z referencją, 0,50 USD. To samo ujęcie, barwa sterowana prawdziwym nagraniem, a nie wymyślona z promptu. Referencja audio: Tłuczone szkło autorstwa Gravity Sound, CC BY 4.0.
Trzy szablony filmów ASMR MiniMax H3: cięcie, żucie, deszcz
Trzy formaty pokrywają większość tego, co działa w tej kategorii. Każdy to gotowy prompt do skopiowania i uruchomienia z ustawieniami i wyprodukowanym klipem. Celowo nigdzie poniżej nie ma szkła, czerwieni ani łupka: jeśli każdy klip na twoim koncie wygląda tak samo, algorytm traktuje go jako ten sam klip.
Tabela 3: te same pięć slotów, trzy różne zadania.
| Slot | Szablon 1, Cięcie | Szablon 2, Żucie | Szablon 3, Deszcz |
|---|---|---|---|
| Materiał | ociekający plaster miodu, gorące stalowe ostrze | jarząca się stopiona skała, kamienna misa | deszcz na szybie samochodu |
| Kształt akcji | ostrze opada od przodu do tyłu, miód ciągnie się | pałeczki podnoszą, potem dwa kęsy | brak akcji podmiotu, tylko krople |
| Perspektywa mikrofonu | close-mic, bardzo sucho, bez pomieszczenia | ekstremalnie blisko, intymna | na zewnątrz szyby, kabina stłumiona |
| Sekwencja dźwiękowa | trzeszczenie wosku, rozciąganie miodu, kapnięcie na talerz | syk lawy, mokre żucie, szklany chrzęst, wydech | stałe tło deszczu, uderzenia kropli, daleki syk opon |
| Negacje | bez muzyki, bez głosu, bez pogłosu pomieszczenia | bez słów, bez muzyki, bez narracji | bez muzyki, bez grzmotów, bez głosu, bez wycieraczek |
Szablon 1, Cięcie. Plaster miodu, bursztyn i złoto, 9:16, 768P, 6 sekund, ratio: "9:16".
plaintext1Ekstremalne makro, unieruchomione ujęcie z góry na gruby plaster złotego miodu na bladej 2ceramicznej płycie, miód już rozlewa się wokół. Gorące stalowe ostrze opuszcza się w wosk 3i zapada się w niego od przodu do tyłu w jednym wolnym, ciągłym naciśnięciu; przecięte 4powierzchnie opadają, a ciężka nitka miodu rozciąga się i kapie na talerz. Ciepłe 5bursztynowe światło kluczowe z lewej, mała głębia ostrości, pojedyncze ujęcie, bez 6cięć, bez dłoni w kadrze. 7 8Audio: ASMR, close-mic, bardzo sucho, bez pogłosu pomieszczenia, bez muzyki, bez głosu, 9bez narracji. Miękkie trzaskanie wosku pękającego pod ostrzem, potem niski, gruby 10dźwięk rozciągania, gdy miód się wydłuża, potem dwa ciężkie, mokre kapnięcia na 11ceramiczną płytę. Nic więcej.
ZsVmf9AhPnw
Szablon 1, 0,60 USD. Trzeszczenie wosku, rozciąganie miodu, kapnięcie. Wygenerowane za pomocą minimax/h3/text-to-video.
Szablon 2, Żucie. Lava mukbang, format, który zdobył 11,3 miliona wyświetleń w tydzień, 9:16, 768P, 8 sekund, ratio: "9:16".
plaintext1Pionowe zbliżenie: para czarnych lakierowanych pałeczek podnosi jarzącą się grudkę 2stopionej pomarańczowej lawy z ciemnej kamiennej misy i niesie ją w kierunku kamery, 3poza kadr na dole. Lawa świeci własnym światłem, rzucając pomarańczowe światło na 4wszystko wokół; reszta pomieszczenia jest prawie czarna. Para unosi się z powierzchni. 5Unieruchomiona kamera, pojedyncze ujęcie, bez cięć. 6 7Audio: ASMR, ekstremalnie blisko, intymne, bez słów, bez muzyki, bez narracji, bez 8dźwięku pomieszczenia. Niski syk i bulgotanie stopionej lawy, gdy jest podnoszona, 9potem miękkie, mokre żucie, potem jaśniejszy, szklany chrzęst przy drugim kęsie, 10potem jeden powolny, zadowolony wydech. Żadnej mowy.
UJhEsTnKkZI
Szablon 2, 0,80 USD. Syk, żucie, chrzęst, wydech – ani jednego słowa. Wygenerowane za pomocą minimax/h3/text-to-video.
Szablon 3, Deszcz. Nocna szyba samochodowa, zimny błękit i neon, 16:9, 768P, 10 sekund, ratio: "16:9".
To jedyny z trzech szablonów bez akcji podmiotu, a uczy najwięcej o negacjach. Gdy na ekranie nic się nie dzieje, H3 sięga po muzykę w tle, chyba że wyraźnie tego zabronisz. To także klip, który wyszedł z najszerszym polem stereo, bez proszenia. Treści nastawione na sen potrzebują długości, więc ten działa blisko górnej granicy użytecznego zakresu czasu.
plaintext1Makro przez wnętrze szyby samochodowej w nocy, ulewny deszcz spływa po zewnętrznej 2stronie szyby. Poszczególne krople uderzają, zawieszają się, a potem spływają w dół 3i łączą się. Za szybą, nieostre neony rozbijają się na zimne niebieskie i magentowe 4bokeh. Brak wycieraczek, brak ludzi, brak ruchu wewnątrz samochodu. Kamera unieruchomiona, 5pojedyncze ciągłe ujęcie, mała głębia ostrości, bez cięć. 6 7Audio: ASMR, close-mic na zewnątrz szyby, kabina lekko stłumiona. Stałe, równomierne 8tło deszczu z wyraźnie oddzielonymi uderzeniami pojedynczych kropel o szybę, plus 9słaby, daleki syk opon na mokrej drodze. Bez muzyki, bez grzmotów, bez głosu, bez 10narracji, bez hałasu wycieraczek.
bUKr5V6wbdM
Szablon 3, 1,00 USD. Dziesięć sekund czystego tła, bez muzyki, bo prompt jej zabronił. Wygenerowane za pomocą minimax/h3/text-to-video.
Ile faktycznie kosztuje film ASMR MiniMax H3
Oto rachunek za ten artykuł, a nie szacunek.
| Pozycja | Liczba | Naliczone |
|---|---|---|
| Klatka bazowa GPT Image 2, high, 2048×1152 | 1 | 0,17 USD |
| Wersja ostateczna 2K, 5 s, image-to-video | 1 | 0,70 USD |
| Wersja robocza 768P, 5 s, image-to-video | 1 | 0,50 USD |
| 768P reference-to-video, 5 s | 1 | 0,50 USD |
| Klipy szablonów w 768P, 6 s + 8 s + 10 s | 3 | 2,40 USD |
| Odrzucone żądania referencji | 2 | 0,00 USD |
| Razem | 4,27 USD |
Sześć publikowalnych klipów i jedna klatka bazowa. Skaluj do harmonogramu: jeden 8-sekundowy pionowy klip dziennie w 768P to 0,80 USD, czyli około 24 USD miesięcznie za konto publikujące codziennie bez twarzy, zanim spędzisz minutę w edytorze.
Dwie uwagi dotyczące rozliczeń. Wymieniony GPT Image 2 za 0,009 USD to podstawa na poziomie tokenów; render w wysokiej jakości 2048×1152 ląduje na 0,1745 USD, czyli prawie dwadzieścia razy więcej, więc budżetuj na podstawie poziomu, którego faktycznie używasz. A pole price H3 jest wypełniane z opóźnieniem: ankietuj, aż status będzie completed, a często wciąż jest undefined. Zapytaj ponownie o identyfikator prognozy chwilę później, aby uzyskać rzeczywistą liczbę. To drugie zapytanie to jedyny sposób, aby zbudować rachunek taki jak ten, a nie zgadywać.
Jedna uczciwa uwaga na temat dźwięku ASMR i praw
Nie przesyłaj cudzego nagrania ASMR jako pliku audio refers. Referencja rzeczywiście przenosi barwę do wyniku, a przepuszczenie nagrania przez model nie zmienia tego, kto jest jego właścicielem. Użyta tutaj referencja jest na licencji CC BY 4.0 i jest podana powyżej, co zajęło około dwóch minut na znalezienie.
Nie buduj ASMR wokół rozpoznawalnego głosu prawdziwej osoby. Każdy szablon w tym artykule jest celowo bezgłosowy, co jest zarówno konwencją gatunku, jak i najmniej skomplikowaną ścieżką.
Wywoływanie H3 przez API nie podlega licencji społecznościowej dołączonej do otwartych wag. Ta licencja, która obejmuje samodzielne hostowanie, obecnie wyklucza UE, Wielką Brytanię, Koreę i USA, a dla tych terytoriów dostępny jest formalny kanał licencjonowania. Warto wiedzieć, nie warto się martwić, jeśli korzystasz z endpointu.
Film ASMR MiniMax H3: często zadawane pytania
Czy film ASMR MiniMax H3 generuje własny dźwięk, czy dodaję go później?
Model go generuje. Obraz i audio pochodzą z tego samego przebiegu: wideo 24 kl./s ze ścieżką stereo AAC przy 32 kHz w dostarczonym pliku. Nie ma oddzielnego kroku audio, biblioteki dźwięków ani pracy nad synchronizacją, co jest całym powodem, dla którego ten endpoint jest interesujący właśnie dla ASMR.
Czy mogę sprawić, by film ASMR MiniMax H3 przesuwał się z lewej na prawą?
Nie poprzez prośbę. Napisałem wyraźne wskazówki kanałów w prompcie i zmierzyłem wynik: korelacja 0,97 między kanałami i maksymalna różnica poziomu 1,9 dB w dowolnym oknie ćwierćsekundowym, co nie jest żadną panoramą. Ścieżka jest prawdziwie stereofoniczna, a rozproszone treści, takie jak deszcz, wracają z szerokim polem, ale dyskretne uderzenia pozostają wyśrodkowane niezależnie od opisu. Jeśli twój format potrzebuje twardej panoramy, zrób to w postprodukcji.
Czy mogę przesłać własne nagranie jako referencję filmu ASMR MiniMax H3?
Tak, za pomocą reference-to-video, który akceptuje do 3 referencji audio wraz z do 9 obrazami i 3 filmami. Audio nie może być przesłane samodzielnie, więc połącz je z co najmniej jednym obrazem lub filmem. Ponadto audio musi mieć od 2 do 15 sekund, a format jest sprawdzany: ładunek .wav zadziałał, podczas gdy audio/mpeg został odrzucony. Odrzucone żądania nie są rozliczane.
Czy dźwięk w filmie ASMR MiniMax H3 w 768P jest gorszy niż w 2K?
Nie. Oba poziomy dostarczają tę samą specyfikację stereo AAC 32 kHz. Zmienia się tylko obraz, a zmienia się znacząco: 16:9 zwraca 1344×768 w 768P w porównaniu do 2560×1440 w 2K. Ponieważ osąd twórczy w ASMR jest osądem słuchowym, twórz wersje robocze za 0,10 USD/s i uruchamiaj ponownie wersje ostateczne za 0,14 USD/s. Pamiętaj tylko, że uruchomienie w 2K to nowe ujęcie, a nie powiększenie wersji roboczej.
Jak długi powinien być film ASMR MiniMax H3 i w jakich proporcjach?
Czas trwania akceptuje dowolną pełną sekundę od 4 do 15. Klipy z cięciem i żuciem działają przez 5 do 8 sekund, ponieważ punktem kulminacyjnym jest jedno zdarzenie; tło nastawione na sen chce 10 lub więcej. W przypadku Shorts, Reels i TikTok używaj 9:16 i pamiętaj, że text-to-video wymaga jawnego ustawienia ratio i odrzuca adaptive. W przypadku image-to-video pierwsza klatka decyduje o kształcie za ciebie.
Ile kosztuje jeden film ASMR MiniMax H3?
5-sekundowy klip kosztuje 0,50 USD w 768P i 0,70 USD w 2K. 8-sekundowy pionowy klip w 768P to 0,80 USD. Publikowanie jednego takiego dziennie to około 24 USD miesięcznie za obliczenia, czyli liczba, którą warto porównać z 20 minutami, jakie edytor zająłby na klip w łączonym workflow.
Dlaczego mój film ASMR MiniMax H3 wychodzi z muzyką w tle, o którą nie prosiłem?
Ponieważ jej nie zabroniłeś. Większość filmów w danych treningowych dowolnego modelu ma muzykę w tle, więc domyślnym zachowaniem jest dodanie jej, zwłaszcza gdy na ekranie nic się nie dzieje. Umieść negacje w części audio promptu jawnie: no music, no voice, no narration, no room reverb, no ambience bed. Szablony ambientowe potrzebują tego bardziej niż te akcyjne.






