Seedance 2.5 już dostępne — Jako pierwsze na Atlas Cloud

MiniMax H3 ASMR Wideo: Przeciąłem szklany granat, a następnie zmierzyłem, czy stereo było prawdziwe.

Większość AI ASMR przykleja standardowy dźwięk do cichego wideo. Film ASMR MiniMax H3 renderuje 32 kHz stereo w jednym przejściu. Zmierzyłem kanały, wraz z promptami i kosztami.

Załóż słuchawki, zanim przewiniesz do poniższego klipu. W tej kategorii to naprawdę ma znaczenie.

Nóż opada na granat wyrzeźbiony ze szkła rubinowego. Łupina pęka, kryształowy trzask, a potem kilkadziesiąt szklanych pestek stacza się po mokrym łupku. Oto część, która różni się od prawie wszystkich klipów AI ASMR, które przewinąłeś w tym roku: nikt nie dodał tego dźwięku. Nie było biblioteki dźwięków, edytora ani osi czasu. Obraz i audio wyszły z jednego generowania, w jednym wywołaniu.

W zeszłym roku AI ASMR wyglądało satysfakcjonująco, a brzmiało trochę nie tak, a powodem nigdy nie były wizualizacje. Chodziło o ostatni krok procesu. Nakładanie dźwięku na niemy klip było ręczną pracą, wykonywaną za każdym razem od nowa. Kategoria rosła tak szybko wokół tej luki, że powstała mała branża dedykowanych generatorów AI ASMR, które automatyzowały łączenie, a jeden z nich reklamował „dźwięk binauralny 3D” już na stronie głównej. Popyt był udowodniony dawno temu. Tyle że był zaspokajany przez składanie.

Więc zrobiłem to porządnie. Jeden powtarzalny workflow, sześć klipów, a potem część, której nikt w tej kategorii nie robi: rozdzieliłem lewy i prawy kanał w ffmpeg i zmierzyłem je. Część tego, czego się spodziewałem, okazała się błędna, a to okazało się najcenniejszą rzeczą w artykule.

Najważniejsze wnioski

  • H3 renderuje obraz 24 kl./s i stereo AAC 32 kHz w tym samym przebiegu. Dźwięk jest generowany, a nie dodawany później.
  • Stereofonia jest prawdziwa, a nie dual mono w kostce stereo. Ale nie możesz zaprogramować panoramy. Poprosiłem o płynne przejście z lewej na prawą i dostałem różnicę 1,9 dB, czyli nic.
  • Szerokość stereo wynika z zawartości, a nie z twojego opisu. Klip z deszczem, gdzie nie prosiłem o żaden kierunek, wyszedł z naprawdę szerokim polem.
  • Zablokowanie pierwszej klatki utrzymuje ujęcie w różnych rozdzielczościach, ale 768P i 2K to wciąż dwa różne ujęcia. Wersja robocza pokazuje wygląd i specyfikację dźwięku, a nie dokładną choreografię.
  • 5-sekundowy klip w 768P kosztuje 0,50 USD. Ten sam klip w 2K kosztuje 0,70 USD. Cały artykuł kosztował 4,27 USD.

Posłuchaj najpierw: film ASMR MiniMax H3, ucięty w jednym przejściu

w7ZRR7bo3KI

Pięć sekund, 2K, 24 kl./s, stereo 32 kHz, jedno generowanie, 0,70 USD. Włącz dźwięk: pisk ostrza wgryzającego się, trzask, potem pestki. Nic nie zostało dodane później. Wygenerowane za pomocą minimax/h3/image-to-video.

Jeden prompt. Jeden model. Jedno wywołanie. Wszystko poniżej to jak powstał ten klip, ile kosztował i które części historii marketingowej przetrwają kontakt z przebiegiem.

Dlaczego AI ASMR eksplodowało i dlaczego większość nie przechodzi testu słuchawek

Ten trend ma datę urodzin. AI ASMR zaczęło się rozprzestrzeniać w czerwcu 2025 roku, zaraz po premierze Veo 3, a format stał się wiralowy w ciągu kilku dni. Lava mukbang od @asmraiworks zdobył ponad 11,3 miliona wyświetleń w tydzień; klip z cięciem szkła miał 5,3 miliona w jedenaście dni (Know Your Meme, 2025). Redakcje podchwyciły to jako ciekawostkę, z surrealistycznymi wizualizacjami i płynną lawą jedzoną pałeczkami jako główną atrakcją (The Express Tribune, 2025).

Potem ludzie założyli słuchawki i nastrój się zmienił. Pisarz TechRadar obejrzał stertę wiralowych klipów i opisał je jako sztuczne, „pozbawione błędów i niedokładności, które są cechą charakterystyczną ludzkiego ASMR” (TechRadar, czerwiec 2025). Fani cytowani w tym artykule mówili, że wyzwalacze mrowienia były technicznie obecne, a mimo to nie było to samo.

Jest tego mechaniczny powód i nie jest mistyczny. ASMR to jedyna kategoria treści, w której treść to dźwięk. Wszędzie indziej audio jest dodatkiem. Tutaj jest produktem. A dominujący workflow wyglądał tak:

  1. wygeneruj niemy klip za pomocą modelu wideo,
  2. przeszukaj bibliotekę dźwięków w poszukiwaniu trzasku, chrupnięcia, szumu deszczu,
  3. zsynchronizuj dźwięk z obrazem w edytorze,
  4. ręcznie wyreguluj panoramę i mix, jeśli ci zależy, co przy dużej skali robi prawie nikt,
  5. eksportuj.

Krok 3 to miejsce, gdzie to umiera. Kolejny trzask opóźniony o dwie klatki brzmi fałszywie, zanim zdążysz wyjaśnić dlaczego. Pomnóż to przez codzienny harmonogram publikacji, a błędy się kumulują, ponieważ synchronizacja jest wykonywana przez człowieka za każdym razem od nowa.

Ta luka to powód, dla którego istnieje cały przemysł stron z generatorami AI ASMR. Co najmniej trzy aktywnie się promują, a jedna z nich reklamuje dźwięk binauralny 3D jako główną funkcję. Nie rozwiązują one fałszywego problemu. Łatają prawdziwą dziurę: leżące u ich podstaw modele wideo nie wytwarzają dźwięku.

Co sprawia, że jeden podział w rankingu jest wart uwagi. Na tablicy edycji wideo Artificial Analysis, tej ocenianej z dźwiękiem, MiniMax H3 zajmuje #1 z 1126 Elo, przed Gemini Omni Flash z 1119 i około sto punktów przed Dreamina Seedance 2.0 z 1027 (Artificial Analysis, sierpień 2026). Na tablicach image-to-video, gdzie dźwięk nie jest częścią oceny, kilka z tych modeli mieści się w granicach kilku punktów od siebie. Różnica pojawia się, gdy liczy się dźwięk. Dla ASMR dźwięk liczy się najbardziej.

Workflow filmu ASMR MiniMax H3 i koszt każdego kroku

Trzy endpointy, jedna zakładka przeglądarki. Wszystko w tym artykule uruchomiłem na Atlas Cloud, więc każda podana poniżej kwota pochodzi z rachunku, a nie z cennika.

Zadanie w tym artykuleModelStawka
Pierwsza klatka do pokazuOpenAI GPT Image 2 (text-to-image)od 0,009 USD/obraz, naliczone 0,1745 USD w wysokiej i 2048x1152
Wersja robocza i ostatecznaMiniMax H3 Image-to-Video0,10 USD/s w 768P, 0,14 USD/s w 2K
Wgranie prawdziwego nagraniaMiniMax H3 Reference-to-Videote same dwa poziomy
Trzy szablonyMiniMax H3 Text-to-Videote same dwa poziomy
Stary sposób, tylko połowa audioByteDance Seed Audio 1.00,143 USD/min

Na liście widnieje „Od 0,1 USD/SEK” na wszystkich trzech endpointach H3. To podstawa 768P. 2K kosztuje 0,14 USD/s i ta liczba pojawia się tylko na fakturze, więc planuj w oparciu o poziom, który faktycznie zamawiasz.

Tabela 1: jedno przejście vs. łączony pipeline.

 MiniMax H3, natywne audioCichy model + dźwięk po obróbce
Kroki do gotowego klipu14 do 5
Zaangażowane narzędzia1model wideo + biblioteka dźwięków + edytor + eksport
Jak obraz i dźwięk są w synchroniito samo generowanie, ta sama oś czasuprzeciągasz, aż wygląda dobrze
Kto miksuje i panujenikt, bierzesz to, co daje modelty, ręcznie, przy każdym dźwięku
Ludzki czas na klipmniej więcej zero po prompcie15 do 40 minut, szczerze
Obliczenia na 5-sekundowy klip0,50 USD w 768Pmodel wideo + 0,143 USD/min generacji audio

Celowo nie podaję stawki za sekundę konkurencyjnej platformy wideo, ponieważ różnica nie leży w obliczeniach. Generowanie audio kosztuje 0,143 USD za minutę, czyli grosze. Prawdziwy koszt łączonego pipeline’u to 20 minut ludzkiej uwagi na klip, a ten koszt nie spada wraz ze skalą. Mnoży się. Konto publikujące codziennie bez twarzy to dokładnie miejsce, gdzie 20 minut na klip cicho zjada cały model biznesowy.

Uczciwa przeciwwaga: ręczne łączenie daje ci kontrolę. Możesz umieścić dźwięk w dowolnym miejscu pola stereo i przyciąć go do klatki. H3 daje synchronizację za darmo, ale, jak pokazują pomiary poniżej, nie daje ci tej kontroli z powrotem.

Tabela 2: trzy endpointy H3, parametry, które naprawdę mają znaczenie.

 image-to-videotext-to-videoreference-to-video
Główne wejścieobraz (pierwsza klatka)tylko promptrefers[]
Rozdzielczość768P / 2K, domyślnie 2Kto samoto samo
Długośćdowolna pełna sekunda 4 do 15, domyślnie 8to samoto samo
Proporcjeustalone przez pierwszą klatkęmuszą być ustawione jawnie, adaptive jest odrzucaneustalone przez referencje
Limity refersnie używane razem z obrazemnie używanedo 9 obrazów, 3 filmów, 3 audio
Dostarczone wyjście 16:91344×768 w 768P, 2560×1440 w 2Kto samoto samo
Ścieżka audioAAC stereo 32 kHz, 24 kl./s videoto samoto samo

Dwie pułapki parametrów, które warto zapisać na ręce. Parametr nazywa się ratio, a nie aspect_ratio, a błędny klucz pozostawia go nieustawionym, więc text-to-video odrzuca żądanie. A image plus refers w tym samym wywołaniu nie powoduje błędu: wykonuje się, pobiera pełną opłatę i po cichu odrzuca jedno z dwóch wejść.

Poradnik filmu ASMR MiniMax H3: cięcie szklanego granatu

Cięcie szklanych owoców to format, który wszyscy rozpoznają, więc czytelnik od razu wie, na co patrzy. Szklane jabłka i szklane mango zostały już jednak zrobione do znudzenia. Granat jest lepszy z jednego konkretnego powodu: gdy łupina pęka, setki szklanych pestek wylewa się i toczy, więc dźwięk ma czas trwania i strukturę, zamiast być jednym centralnym uderzeniem. Jeśli model fałszuje dźwięk, rozrzut jest miejscem, gdzie to widać.

Krok 1: Zbuduj bazową klatkę za pomocą GPT Image 2

Ustal kompozycję, zanim wydasz cokolwiek na wideo. Ustawienia: quality: high, size: 2048x1152 (16:9), output_format: png.

plaintext
1Zbliżenie makro całego granatu wyrzeźbionego w całości z grubego przezroczystego
2rubinowego szkła, spoczywającego na mokrej czarnej płycie łupkowej. Szklana skorupa
3ma grubość 8 mm z widocznymi wewnętrznymi pęcherzykami i wyszczerbionymi fasetami;
4setki maleńkich szklanych pestek jarzą się w środku jak kryształy granatu. Wypolerowany
5japoński nóż santoku leży na lewej krawędzi kadru, czubek ostrza ledwo dotyka szklanej
6skóry. Jedno ostre światło kluczowe z prawego górnego rogu przesuwa się po płycie i
7rzuca ostre czerwone refrakcje na mokry kamień. Obiektyw 100 mm, f/2.8, mała głębia
8ostrości, ciemne nastrojowe tło.
9Bez dłoni, bez tekstu, bez znaku wodnego, bez logo.

Interfejs generatora obrazów AI z promptem tekstowym i wygenerowanym obrazem

GPT Image 2 na Atlas Cloud z ustawioną jakością high i rozmiarem 16:9 2048×1152, szklany granat wyrenderowany w panelu OUTPUT

Rzeczywiste uruchomienie. Jakość high w 2048×1152, a strona podaje 0,1745 USD, co później pokazała też faktura.

Ostrze noża tnące przezroczysty czerwony szklany granat na ciemnym kamieniu

Wygenerowana klatka bazowa: granat z grubego rubinowego szkła na mokrym czarnym łupku, nóż santoku wchodzący z lewej krawędzi

Klatka przekazana do H3. Wygenerowane za pomocą openai/gpt-image-2/text-to-image.

Krok 2: Napisz część audio promptu filmu ASMR MiniMax H3

Większość ludzi pisze prompt ASMR jako opis obrazu z doklejonym słowem „ASMR” na początku, a potem dziwi się, że model ocenia go z lo-fi pianinem. H3 traktuje wskazówki audio poważnie, jeśli mu je dasz. Ustrukturyzuj część audio w pięciu slotach:

  1. Materiał. Co wydaje dźwięk. Szkło, wosk, stopiona skała, woda na szkle. Bądź konkretny co do grubości i wilgotności – zmieniają barwę.
  2. Akcja i jej kształt w czasie. Nie tylko „tnie”, ale „naciska w jednym wolnym, ciągłym pociągnięciu”. Model używa tego do umiejscowienia zdarzeń.
  3. Perspektywa mikrofonu.close-mic, intimate, wskazówki odległości nagrywania. To ustawia, jak suchy i bliski wydaje się dźwięk, i działa dobrze.
  4. Sekwencja onomatopei. Wypisz zdarzenia dźwiękowe w kolejności: pisk, potem trzask, potem kilkadziesiąt małych uderzeń, potem cisza. To jest slot, który robi najwięcej.
  5. Negacje.no music, no voice, no narration, no room reverb, no ambience bed. Bez nich H3 chętnie doda muzykę w tle, ponieważ większość filmów w jego danych treningowych ją ma.

Napisałem też wskazówki kanałowe w slocie 4, prosząc o trzask w lewym kanale i pestki toczące się z lewej na prawą. Czytaj dalej, aby zobaczyć, co to faktycznie wyprodukowało.

Krok 3: Uruchom wersję roboczą w 768P

Wersja robocza w 768P. Ścieżka audio jest taka sama w obu poziomach, więc cały osąd twórczy, który w ASMR jest osądem słuchowym, można podjąć przy niskiej stawce.

Ustawienia na minimax/h3/image-to-video: image = wynik z kroku 1, resolution: 768P, duration: 5. Proporcje pochodzą z pierwszej klatki, więc zostaw je w spokoju.

plaintext
1Ostrze santoku wchodzi z lewej strony i naciska w dół przez szklany granat w jednym
2wolnym, ciągłym pociągnięciu, przesuwając się z lewej na prawą w kadrze. Łupina pęka
3z jasnym kryształowym trzaskiem, a fontanna maleńkich szklanych pestek wysypuje się
4na mokry łupek, rozsypując się w kierunku prawej krawędzi. Aparat unieruchomiony,
5makro, pojedyncze ujęcie, bez cięć.
6
7Audio: ASMR, close-mic, intymne, bez muzyki, bez głosu, bez narracji, bez pogłosu pomieszczenia.
8Suchy, ciągły pisk szkła, gdy ostrze się wgryza, potem jeden ostry, wysoki trzask
9wyparowany na LEWYM kanale, a następnie kilkadziesiąt małych brzęczących uderzeń pestek
10toczących się z LEWEGO kanału na PRAWY, gdy się rozsypują. Na samym końcu słaby
11zgrzyt ostrza o kamień, potem cisza. Bez tła dźwiękowego, bez szumu, bez muzyki w tle.

Interfejs generatora wideo AI z filmem szklanego granatu

MiniMax H3 image-to-video na Atlas Cloud z załadowaną klatką bazową, czasem trwania 5 i ukończonym klipem w panelu OUTPUT

Uruchomienie image-to-video: załadowana pierwsza klatka, czas trwania 5, OUTPUT ukończony. Zwróć uwagę, że wybór Resolution jest ustawiony na domyślną dla strony wartość 2K. Przełącz go na 768P dla wersji roboczych, z czego poniższy klip został wyrenderowany.

xkolGEKI7UI

Wersja robocza 768P, 0,50 USD. Miększy obraz niż w głównym klipie, ta sama specyfikacja audio. To na podstawie tego ujęcia podejmuje się całą decyzję.

Krok 4: Zmierz stereo, zanim mu zaufasz

Nie wierz mi na słowo w kwestii dźwięku i nie wierz modelowi. Rozdziel kanały i spójrz. To lokalny ffmpeg, bez wywołania API, bez kosztów:

plaintext
1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \
2  -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \
3  -frames:v 1 stereo-proof.png

Porównanie przebiegu separacji kanałów stereo w dwóch klipach ASMR

Analiza przebiegu w czterech panelach porównująca klip z szklanym granatem i klip z deszczem, pokazująca lewy i prawy kanał oraz kanał boczny dla każdego

Lewy kanał nad prawym dla dwóch klipów, plus kanał boczny (lewy minus prawy) przy dopasowanym wzmocnieniu poniżej. To jest cały argument na jednym obrazku.

Oto, co otrzymałem, i część tego nie jest tym, czego się spodziewałem.

Stereofonia jest prawdziwa. Kanał boczny nie jest pusty w żadnym z wygenerowanych przeze mnie klipów. Plik dual mono przebrany za stereo nie pokazałby niczego. Ten ma zawartość.

Ale nie możesz zaprogramować panoramy. Poprosiłem, dużymi literami, o trzask w LEWYM kanale i pestki toczące się z LEWEJ na PRAWĄ. Zmierzone: korelacja kanałów 0,97, kanał boczny 17,7 dB poniżej środka, a największa różnica poziomów między lewym a prawym w dowolnym oknie ćwierćsekundowym wynosi 1,9 dB. To nie jest panorama. To wyśrodkowany obraz z odrobiną naturalnej szerokości. Nóż przesuwa się w poprzek kadru; dźwięk pozostaje na miejscu.

Szerokość wynika z zawartości, a nie z twojego opisu. Klip z deszczem w następnej sekcji, gdzie nie prosiłem o żaden kierunek, wyszedł z korelacją 0,32, a kanał boczny tylko 2,9 dB poniżej środka. To naprawdę szerokie, nieskorelowane pole. Rozproszone tło automatycznie zyskuje szerokość. Dyskretne uderzenia pozostają blisko środka, bez względu na to, co napiszesz.

Uczciwe twierdzenie dla tego modelu nie jest więc przestrzenne. Jest czasowe. Otrzymujesz dźwięk, który został wygenerowany razem z obrazem i trafia na klatkę, do której należy, za darmo, na zawsze, bez edytora. Jeśli twój format naprawdę potrzebuje twardej panoramy, nadal musisz to zrobić sam w postprodukcji i powinieneś przestać wpisywać nazwy kanałów w promptach, bo one nic nie robią.

Teraz uruchom ponownie wersję ostateczną: ten sam endpoint, ta sama pierwsza klatka, ten sam prompt, zmień jedno pole na resolution: 2K. Jeszcze jedna rzecz, którą warto wiedzieć, zanim założysz, że wersja robocza jest podglądem.

Porównanie dwóch rozdzielczości wideo tnących szklany granat

Dwa wiersze po pięć klatek porównujące uruchomienia w 768P i 2K w tych samych znacznikach czasu, identyczne w klatce zerowej i rozchodzące się od około 2,5 sekundy

Ta sama pierwsza klatka, ten sam prompt, oba poziomy. Klatka 0 pasuje dokładnie. Około 2,5 s skorupa pęka inaczej i oba klipy stają się różnymi ujęciami.

Zablokowanie pierwszej klatki utrzymuje kompozycję, kadrowanie, oświetlenie i kolor w obu poziomach, dlatego zawsze powinieneś używać image-to-video zamiast text-to-video do tego celu. Nie daje ci to tego samego ujęcia. Uruchomienie w 2K przerzuca akcję. Traktuj wersję roboczą jako podgląd wyglądu i dźwięku, a nie dokładnej choreografii.

Krok 5: Dodaj prawdziwe nagranie jako referencję filmu ASMR MiniMax H3

Jeśli masz dźwięk, którego faktycznie chcesz, podaj go. reference-to-video przyjmuje do 9 obrazów, 3 filmy i 3 klipy audio, a barwę i charakter pomieszczenia pobiera z referencji audio zamiast je wymyślać. Użyłem przyjaznego dla domeny publicznej nagrania tłuczonego szkła autorstwa Gravity Sound z Wikimedia Commons (CC BY 4.0), trzy ujęcia połączone w 4,5 sekundy.

Trzy zasady, a dwie ostatnie odkryłem na własnej skórze, gdy żądania zostały odrzucone:

  • Audio nie może iść samo. Endpoint wyjaśnia to wprost: wymagany jest co najmniej jeden obraz lub film, a samo audio nie jest dozwolone. Połącz je z klatką.
  • Referencja audio musi mieć od 2 do 15 sekund. Moja pierwsza próba użyła klipu o długości 1,49 sekundy i otrzymała odpowiedź audio duration 1486 ms, expected [2000, 15000] ms. Ten zakres nie jest podany na stronie modelu.
  • Format pliku jest sprawdzany. Ładunek base64 zadeklarowany jako audio/mpeg został odrzucony z komunikatem audio format ".mpeg" not allowed. Ładunek .wav przeszedł. Odrzucone żądania nie są rozliczane, ale kosztują cię czas.

Ustawienia: refers: [{url: <klatka bazowa>, type: "image"}, {url: <nagranie od 2 do 15 s>, type: "audio"}], resolution: 768P, duration: 5.

plaintext
1To samo unieruchomione ujęcie makro: ostrze przecina szklany granat od lewej do prawej,
2a pestki się rozsypują. Dopasuj barwę, jasność i charakter pomieszczenia z referencji
3audio, tę samą odległość nagrywania, tę samą suchość. ASMR close-mic, bez muzyki, bez głosu.

Interfejs generatora wideo AI z polem promptu i wygenerowanym filmem granatu

MiniMax H3 reference-to-video na Atlas Cloud z załadowanymi dwoma materiałami referencyjnymi, plikiem audio w slocie 1 i klatką bazową w slocie 2

Reference Materials niosące plik audio i obraz razem, 2 z 9 użytych. Usuń obraz, a żądanie w ogóle się nie uruchomi.

mY1VrOfM3cM

Ujęcie z referencją, 0,50 USD. To samo ujęcie, barwa sterowana prawdziwym nagraniem, a nie wymyślona z promptu. Referencja audio: Tłuczone szkło autorstwa Gravity Sound, CC BY 4.0.

Trzy szablony filmów ASMR MiniMax H3: cięcie, żucie, deszcz

Trzy formaty pokrywają większość tego, co działa w tej kategorii. Każdy to gotowy prompt do skopiowania i uruchomienia z ustawieniami i wyprodukowanym klipem. Celowo nigdzie poniżej nie ma szkła, czerwieni ani łupka: jeśli każdy klip na twoim koncie wygląda tak samo, algorytm traktuje go jako ten sam klip.

Tabela 3: te same pięć slotów, trzy różne zadania.

SlotSzablon 1, CięcieSzablon 2, ŻucieSzablon 3, Deszcz
Materiałociekający plaster miodu, gorące stalowe ostrzejarząca się stopiona skała, kamienna misadeszcz na szybie samochodu
Kształt akcjiostrze opada od przodu do tyłu, miód ciągnie siępałeczki podnoszą, potem dwa kęsybrak akcji podmiotu, tylko krople
Perspektywa mikrofonuclose-mic, bardzo sucho, bez pomieszczeniaekstremalnie blisko, intymnana zewnątrz szyby, kabina stłumiona
Sekwencja dźwiękowatrzeszczenie wosku, rozciąganie miodu, kapnięcie na talerzsyk lawy, mokre żucie, szklany chrzęst, wydechstałe tło deszczu, uderzenia kropli, daleki syk opon
Negacjebez muzyki, bez głosu, bez pogłosu pomieszczeniabez słów, bez muzyki, bez narracjibez muzyki, bez grzmotów, bez głosu, bez wycieraczek

Szablon 1, Cięcie. Plaster miodu, bursztyn i złoto, 9:16, 768P, 6 sekund, ratio: "9:16".

plaintext
1Ekstremalne makro, unieruchomione ujęcie z góry na gruby plaster złotego miodu na bladej
2ceramicznej płycie, miód już rozlewa się wokół. Gorące stalowe ostrze opuszcza się w wosk
3i zapada się w niego od przodu do tyłu w jednym wolnym, ciągłym naciśnięciu; przecięte
4powierzchnie opadają, a ciężka nitka miodu rozciąga się i kapie na talerz. Ciepłe
5bursztynowe światło kluczowe z lewej, mała głębia ostrości, pojedyncze ujęcie, bez
6cięć, bez dłoni w kadrze.
7
8Audio: ASMR, close-mic, bardzo sucho, bez pogłosu pomieszczenia, bez muzyki, bez głosu,
9bez narracji. Miękkie trzaskanie wosku pękającego pod ostrzem, potem niski, gruby
10dźwięk rozciągania, gdy miód się wydłuża, potem dwa ciężkie, mokre kapnięcia na
11ceramiczną płytę. Nic więcej.

ZsVmf9AhPnw

Szablon 1, 0,60 USD. Trzeszczenie wosku, rozciąganie miodu, kapnięcie. Wygenerowane za pomocą minimax/h3/text-to-video.

Szablon 2, Żucie. Lava mukbang, format, który zdobył 11,3 miliona wyświetleń w tydzień, 9:16, 768P, 8 sekund, ratio: "9:16".

plaintext
1Pionowe zbliżenie: para czarnych lakierowanych pałeczek podnosi jarzącą się grudkę
2stopionej pomarańczowej lawy z ciemnej kamiennej misy i niesie ją w kierunku kamery,
3poza kadr na dole. Lawa świeci własnym światłem, rzucając pomarańczowe światło na
4wszystko wokół; reszta pomieszczenia jest prawie czarna. Para unosi się z powierzchni.
5Unieruchomiona kamera, pojedyncze ujęcie, bez cięć.
6
7Audio: ASMR, ekstremalnie blisko, intymne, bez słów, bez muzyki, bez narracji, bez
8dźwięku pomieszczenia. Niski syk i bulgotanie stopionej lawy, gdy jest podnoszona,
9potem miękkie, mokre żucie, potem jaśniejszy, szklany chrzęst przy drugim kęsie,
10potem jeden powolny, zadowolony wydech. Żadnej mowy.

UJhEsTnKkZI

Szablon 2, 0,80 USD. Syk, żucie, chrzęst, wydech – ani jednego słowa. Wygenerowane za pomocą minimax/h3/text-to-video.

Szablon 3, Deszcz. Nocna szyba samochodowa, zimny błękit i neon, 16:9, 768P, 10 sekund, ratio: "16:9".

To jedyny z trzech szablonów bez akcji podmiotu, a uczy najwięcej o negacjach. Gdy na ekranie nic się nie dzieje, H3 sięga po muzykę w tle, chyba że wyraźnie tego zabronisz. To także klip, który wyszedł z najszerszym polem stereo, bez proszenia. Treści nastawione na sen potrzebują długości, więc ten działa blisko górnej granicy użytecznego zakresu czasu.

plaintext
1Makro przez wnętrze szyby samochodowej w nocy, ulewny deszcz spływa po zewnętrznej
2stronie szyby. Poszczególne krople uderzają, zawieszają się, a potem spływają w dół
3i łączą się. Za szybą, nieostre neony rozbijają się na zimne niebieskie i magentowe
4bokeh. Brak wycieraczek, brak ludzi, brak ruchu wewnątrz samochodu. Kamera unieruchomiona,
5pojedyncze ciągłe ujęcie, mała głębia ostrości, bez cięć.
6
7Audio: ASMR, close-mic na zewnątrz szyby, kabina lekko stłumiona. Stałe, równomierne
8tło deszczu z wyraźnie oddzielonymi uderzeniami pojedynczych kropel o szybę, plus
9słaby, daleki syk opon na mokrej drodze. Bez muzyki, bez grzmotów, bez głosu, bez
10narracji, bez hałasu wycieraczek.

bUKr5V6wbdM

Szablon 3, 1,00 USD. Dziesięć sekund czystego tła, bez muzyki, bo prompt jej zabronił. Wygenerowane za pomocą minimax/h3/text-to-video.

Ile faktycznie kosztuje film ASMR MiniMax H3

Oto rachunek za ten artykuł, a nie szacunek.

PozycjaLiczbaNaliczone
Klatka bazowa GPT Image 2, high, 2048×115210,17 USD
Wersja ostateczna 2K, 5 s, image-to-video10,70 USD
Wersja robocza 768P, 5 s, image-to-video10,50 USD
768P reference-to-video, 5 s10,50 USD
Klipy szablonów w 768P, 6 s + 8 s + 10 s32,40 USD
Odrzucone żądania referencji20,00 USD
Razem 4,27 USD

Sześć publikowalnych klipów i jedna klatka bazowa. Skaluj do harmonogramu: jeden 8-sekundowy pionowy klip dziennie w 768P to 0,80 USD, czyli około 24 USD miesięcznie za konto publikujące codziennie bez twarzy, zanim spędzisz minutę w edytorze.

Dwie uwagi dotyczące rozliczeń. Wymieniony GPT Image 2 za 0,009 USD to podstawa na poziomie tokenów; render w wysokiej jakości 2048×1152 ląduje na 0,1745 USD, czyli prawie dwadzieścia razy więcej, więc budżetuj na podstawie poziomu, którego faktycznie używasz. A pole price H3 jest wypełniane z opóźnieniem: ankietuj, aż status będzie completed, a często wciąż jest undefined. Zapytaj ponownie o identyfikator prognozy chwilę później, aby uzyskać rzeczywistą liczbę. To drugie zapytanie to jedyny sposób, aby zbudować rachunek taki jak ten, a nie zgadywać.

Jedna uczciwa uwaga na temat dźwięku ASMR i praw

Nie przesyłaj cudzego nagrania ASMR jako pliku audio refers. Referencja rzeczywiście przenosi barwę do wyniku, a przepuszczenie nagrania przez model nie zmienia tego, kto jest jego właścicielem. Użyta tutaj referencja jest na licencji CC BY 4.0 i jest podana powyżej, co zajęło około dwóch minut na znalezienie.

Nie buduj ASMR wokół rozpoznawalnego głosu prawdziwej osoby. Każdy szablon w tym artykule jest celowo bezgłosowy, co jest zarówno konwencją gatunku, jak i najmniej skomplikowaną ścieżką.

Wywoływanie H3 przez API nie podlega licencji społecznościowej dołączonej do otwartych wag. Ta licencja, która obejmuje samodzielne hostowanie, obecnie wyklucza UE, Wielką Brytanię, Koreę i USA, a dla tych terytoriów dostępny jest formalny kanał licencjonowania. Warto wiedzieć, nie warto się martwić, jeśli korzystasz z endpointu.

Film ASMR MiniMax H3: często zadawane pytania

Czy film ASMR MiniMax H3 generuje własny dźwięk, czy dodaję go później?

Model go generuje. Obraz i audio pochodzą z tego samego przebiegu: wideo 24 kl./s ze ścieżką stereo AAC przy 32 kHz w dostarczonym pliku. Nie ma oddzielnego kroku audio, biblioteki dźwięków ani pracy nad synchronizacją, co jest całym powodem, dla którego ten endpoint jest interesujący właśnie dla ASMR.

Czy mogę sprawić, by film ASMR MiniMax H3 przesuwał się z lewej na prawą?

Nie poprzez prośbę. Napisałem wyraźne wskazówki kanałów w prompcie i zmierzyłem wynik: korelacja 0,97 między kanałami i maksymalna różnica poziomu 1,9 dB w dowolnym oknie ćwierćsekundowym, co nie jest żadną panoramą. Ścieżka jest prawdziwie stereofoniczna, a rozproszone treści, takie jak deszcz, wracają z szerokim polem, ale dyskretne uderzenia pozostają wyśrodkowane niezależnie od opisu. Jeśli twój format potrzebuje twardej panoramy, zrób to w postprodukcji.

Czy mogę przesłać własne nagranie jako referencję filmu ASMR MiniMax H3?

Tak, za pomocą reference-to-video, który akceptuje do 3 referencji audio wraz z do 9 obrazami i 3 filmami. Audio nie może być przesłane samodzielnie, więc połącz je z co najmniej jednym obrazem lub filmem. Ponadto audio musi mieć od 2 do 15 sekund, a format jest sprawdzany: ładunek .wav zadziałał, podczas gdy audio/mpeg został odrzucony. Odrzucone żądania nie są rozliczane.

Czy dźwięk w filmie ASMR MiniMax H3 w 768P jest gorszy niż w 2K?

Nie. Oba poziomy dostarczają tę samą specyfikację stereo AAC 32 kHz. Zmienia się tylko obraz, a zmienia się znacząco: 16:9 zwraca 1344×768 w 768P w porównaniu do 2560×1440 w 2K. Ponieważ osąd twórczy w ASMR jest osądem słuchowym, twórz wersje robocze za 0,10 USD/s i uruchamiaj ponownie wersje ostateczne za 0,14 USD/s. Pamiętaj tylko, że uruchomienie w 2K to nowe ujęcie, a nie powiększenie wersji roboczej.

Jak długi powinien być film ASMR MiniMax H3 i w jakich proporcjach?

Czas trwania akceptuje dowolną pełną sekundę od 4 do 15. Klipy z cięciem i żuciem działają przez 5 do 8 sekund, ponieważ punktem kulminacyjnym jest jedno zdarzenie; tło nastawione na sen chce 10 lub więcej. W przypadku Shorts, Reels i TikTok używaj 9:16 i pamiętaj, że text-to-video wymaga jawnego ustawienia ratio i odrzuca adaptive. W przypadku image-to-video pierwsza klatka decyduje o kształcie za ciebie.

Ile kosztuje jeden film ASMR MiniMax H3?

5-sekundowy klip kosztuje 0,50 USD w 768P i 0,70 USD w 2K. 8-sekundowy pionowy klip w 768P to 0,80 USD. Publikowanie jednego takiego dziennie to około 24 USD miesięcznie za obliczenia, czyli liczba, którą warto porównać z 20 minutami, jakie edytor zająłby na klip w łączonym workflow.

Dlaczego mój film ASMR MiniMax H3 wychodzi z muzyką w tle, o którą nie prosiłem?

Ponieważ jej nie zabroniłeś. Większość filmów w danych treningowych dowolnego modelu ma muzykę w tle, więc domyślnym zachowaniem jest dodanie jej, zwłaszcza gdy na ekranie nic się nie dzieje. Umieść negacje w części audio promptu jawnie: no music, no voice, no narration, no room reverb, no ambience bed. Szablony ambientowe potrzebują tego bardziej niż te akcyjne.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele