Setzen Sie Kopfhörer auf, bevor Sie zum unten stehenden Clip scrollen. In dieser Kategorie kommt es wirklich darauf an.
Ein Messer fährt durch einen Granatapfel aus Rubinglas. Die Schale spaltet sich, ein kristalliner Riss, dann purzeln einige Dutzend Glassamen über nassen Schiefer. Hier ist der Teil, der sich von fast jedem KI-ASMR-Clip unterscheidet, an dem Sie dieses Jahr vorbeigescrollt sind: Niemand hat dieses Geräusch hinzugefügt. Es gab keine Soundbibliothek, keinen Editor, keine Timeline. Bild und Audio entstanden in einer Generation, in einem Aufruf.
Im letzten Jahr sah KI-ASMR befriedigend aus und klang leicht falsch, und der Grund lag nie an den Bildern. Es war der letzte Schritt der Pipeline. Das Kleben von Audio auf einen stummen Clip war eine manuelle Arbeit, die jedes Mal von Hand erledigt wurde. Die Kategorie wuchs so schnell um diese Lücke herum, dass eine kleine Industrie spezieller KI-ASMR-Generatorseiten entstand, die das Zusammenfügen rein automatisieren sollte. Eine davon bewirbt "binaurales 3D-Audio" direkt auf der Startseite. Die Nachfrage war längst bewiesen. Sie wurde nur durch Montage bedient.
Also habe ich die Sache ordentlich durchgeführt. Ein reproduzierbarer Workflow, sechs Clips, und dann der Teil, den niemand in dieser Kategorie jemals macht: Ich habe den linken und rechten Kanal in ffmpeg getrennt und gemessen. Einiges von dem, was ich erwartet hatte, stellte sich als falsch heraus, und das erwies sich als das Nützlichste in diesem Artikel.
Wichtige Erkenntnisse
- H3 rendert das 24 fps-Bild und eine 32 kHz AAC-Stereospur im selben Durchlauf. Das Audio wird generiert, nicht nachträglich unterlegt.
- Die Stereospur ist wirklich Stereospur, kein Dual-Mono im Stereokostüm. Aber Sie können kein Schwenken per Prompt erzwingen. Ich bat um eine harte Links-nach-rechts-Bewegung und erhielt einen Unterschied von 1,9 dB, was nichts ist.
- Die Stereobreite kommt vom Inhalt, nicht von Ihrer Formulierung. Der Regenclip, bei dem ich überhaupt keine Richtung angab, kam mit einem wirklich breiten Feld zurück.
- Das Einfrieren des ersten Bildes hält die Aufnahme über Auflösungen hinweg, aber 768P und 2K sind immer noch zwei verschiedene Aufnahmen. Der Entwurf zeigt die Optik und die Audiospezifikation, nicht die exakte Choreografie.
- Ein 5-Sekunden-Clip mit 768P kostet $0,50. Derselbe Clip mit 2K kostet $0,70. Der gesamte Artikel kostete $4,27.
Hören Sie zuerst: Ein MiniMax H3 ASMR-Video, in einem Durchlauf geschnitten
w7ZRR7bo3KI
Fünf Sekunden, 2K, 24 fps, 32 kHz Stereo, eine Generation, $0,70. Ton an: das Quietschen der eindringenden Klinge, der Riss, dann die Samen. Nichts davon wurde nachträglich hinzugefügt. Generiert mit minimax/h3/image-to-video.
Ein Prompt. Ein Modell. Ein Aufruf. Alles, was folgt, beschreibt, wie dieser Clip erstellt wurde, was er kostete und welche Teile der Marketinggeschichte einer Wellenform standhalten.
Warum KI-ASMR explodierte und warum die meisten Clips den Kopfhörertest nicht bestehen
Der Trend hat einen Geburtstag. KI-ASMR verbreitete sich ab Juni 2025, direkt nachdem Veo 3 landete, und das Format ging innerhalb von Tagen durch die Decke. Ein Lava-Mukbang von @asmraiworks erzielte über 11,3 Millionen Aufrufe in einer Woche; ein Glasschneideclip erzielte 5,3 Millionen in elf Tagen (Know Your Meme, 2025). Nachrichtenredaktionen griffen es als Kuriosität auf, wobei surreale Bilder und mit Stäbchen gegessenes geschmolzenes Lava den Großteil der Arbeit erledigten (The Express Tribune, 2025).
Dann setzten die Leute Kopfhörer auf, und die Stimmung kippte. Der TechRadar-Autor sah sich einen Haufen der viralen Clips an und beschrieb einen Schimmer von Künstlichkeit, "es fehlen die Fehler und Ungenauigkeiten, die das Markenzeichen von menschlichem ASMR sind" (TechRadar, Juni 2025). In dem Artikel zitierte Fans sagten, die Kitzelauslöser seien technisch vorhanden, und es sei trotzdem nicht dasselbe.
Es gibt einen mechanischen Grund, und der ist nicht mystisch. ASMR ist die eine Inhaltskategorie, bei der der Inhalt das Geräusch ist. Überall sonst ist Audio eine Garnitur. Hier ist es das Produkt. Und der vorherrschende Workflow war:
- Erzeuge einen stummen Clip mit einem Videomodell,
- durchsuche eine Soundbibliothek nach einem Knacken, Knirschen, Regenbett,
- richte den Ton im Editor auf das Bild aus,
- schwenke und mische von Hand, wenn es dir wichtig ist – was fast niemand in großem Umfang tut,
- exportiere.
Schritt 3 ist der Tod. Ein eingefrorener Knack, der zwei Frames zu spät abgespielt wird, wirkt unecht, bevor man erklären kann, warum. Multiplizieren Sie das mit einem täglichen Veröffentlichungsplan, und die Fehler häufen sich, weil die Ausrichtung jedes Mal von einem Menschen neu gemacht wird.
Diese Lücke ist der Grund, warum eine ganze Cottage-Industrie von KI-ASMR-Generatorseiten existiert. Mindestens drei vermarkten sich aktiv, und eine wirbt mit binauralem 3D-Audio als Hauptmerkmal. Sie lösen kein erfundenes Problem. Sie stopfen ein echtes Loch: Die darunterliegenden Videomodelle erzeugen keinen Ton.
Damit lohnt sich ein Blick auf eine bestimmte Bestenliste. Auf Artificial Analysis' Video-Editing-Tafel, derjenigen, die mit Audio bewertet wird, liegt MiniMax H3 mit 1.126 Elo auf Platz 1, vor Gemini Omni Flash mit 1.119 und etwa hundert Punkten vor Dreamina Seedance 2.0 mit 1.027 (Artificial Analysis, August 2026). Auf den Image-to-Video-Tafeln, wo Audio nicht Teil der Bewertung ist, liegen mehrere dieser Modelle innerhalb weniger Punkte voneinander. Der Abstand entsteht, wenn Ton zählt. Für ASMR zählt nur der Ton.
Der MiniMax H3 ASMR-Video-Workflow und was jeder Schritt kostet
Drei Endpunkte, ein Browser-Tab. Alles in diesem Artikel habe ich auf Atlas Cloud ausgeführt, daher stammt jeder unten aufgeführte Betrag von der Rechnung und nicht von einer Preisliste.
| Auftrag in diesem Artikel | Modell | Preis |
|---|---|---|
| Erstes Bild für das Showcase | OpenAI GPT Image 2 (Text-zu-Bild) | ab $0,009/Bild, abgerechnet $0,1745 bei High und 2048x1152 |
| Entwurf und Finale | MiniMax H3 Image-to-Video | $0,10/s bei 768P, $0,14/s bei 2K |
| Eine echte Aufnahme einspielen | MiniMax H3 Reference-to-Video | dieselben zwei Stufen |
| Die drei Vorlagen | MiniMax H3 Text-to-Video | dieselben zwei Stufen |
| Der alte Weg, nur die Audiohälfte | ByteDance Seed Audio 1.0 | $0,143/min |
Die Auflistung zeigt "Ab $0,1/SEC" auf allen drei H3-Endpunkten. Das ist der 768P-Mindestpreis. 2K wird mit $0,14/s abgerechnet, und diese Zahl erscheint nirgends außer auf Ihrer Rechnung, also planen Sie basierend auf der Stufe, die Sie tatsächlich anfordern.
Tabelle 1: Ein Durchlauf versus die zusammengesetzte Pipeline.
| MiniMax H3, natives Audio | Stummes Modell plus nachträgliches Audio | |
|---|---|---|
| Schritte zu einem fertigen Clip | 1 | 4 bis 5 |
| Beteiligte Werkzeuge | 1 | Videomodell + Soundbibliothek + Editor + Export |
| Wie Bild und Ton synchron bleiben | dieselbe Generation, dieselbe Timeline | Sie ziehen es, bis es richtig aussieht |
| Wer mischt und schwenkt | niemand, Sie nehmen, was das Modell liefert | Sie, von Hand, pro Geräusch |
| Menschliche Zeit pro Clip | ungefähr null nach dem Prompt | 15 bis 40 Minuten, ehrlich gesagt |
| Rechenleistung pro 5s-Clip | $0,50 bei 768P | Videomodell + $0,143/min Audiogenerierung |
Ich verzichte bewusst darauf, den Preis pro Sekunde einer konkurrierenden Videoplattform zu nennen, denn die Rechenleistung ist nicht der entscheidende Unterschied. Die Audiogenerierung kostet $0,143 pro Minute, also Pfennige. Die wahren Kosten der zusammengesetzten Pipeline sind 20 Minuten menschlicher Aufmerksamkeit pro Clip, und diese Kosten sinken nicht mit der Skalierung. Sie multiplizieren sich. Ein gesichtsloser Account, der täglich postet, ist genau der Fall, bei dem 20 Minuten pro Clip leise das gesamte Geschäftsmodell auffressen.
Das ehrliche Gegengewicht: Das manuelle Zusammensetzen erkauft Ihnen Kontrolle. Sie können ein Geräusch überall im Stereofeld platzieren und es auf den Frame zuschneiden. H3 liefert die Synchronisation kostenlos, gibt Ihnen aber, wie die unten stehenden Messungen zeigen, diese Kontrolle nicht zurück.
Tabelle 2: Die drei H3-Endpunkte, die Parameter, die wirklich zählen.
| image-to-video | text-to-video | reference-to-video | |
|---|---|---|---|
| Haupteingabe | Bild (erstes Bild) | Nur Prompt | refers[] |
| Auflösung | 768P / 2K, Standard 2K | gleich | gleich |
| Dauer | jede ganze Sekunde 4 bis 15, Standard 8 | gleich | gleich |
| Seitenverhältnis | wird durch das erste Bild bestimmt | muss explizit gesetzt werden, adaptiv wird abgelehnt | wird durch die Referenzen bestimmt |
| refers-Limits | nicht zusammen mit image verwendet | nicht verwendet | bis zu 9 Bilder, 3 Videos, 3 Audio |
| Gelieferte 16:9-Ausgabe | 1344x768 bei 768P, 2560x1440 bei 2K | gleich | gleich |
| Audiospur | AAC Stereo 32 kHz über 24 fps Video | gleich | gleich |
Zwei Parameterfallen, die Sie sich auf die Hand schreiben sollten. Der Parameter heißt ratio, nicht aspect_ratio, und der falsche Schlüssel lässt ihn ungesetzt, sodass text-to-video die Anfrage ablehnt. Und image plus refers im selben Aufruf verursacht keinen Fehler: Es wird ausgeführt, vollständig abgerechnet und wirft stillschweigend einen der beiden Eingaben weg.
MiniMax H3 ASMR-Video-Tutorial: Einen Glasgranatapfel schneiden
Glasschneiden ist das Format, das jeder erkennt, also weiß der Leser sofort, worum es geht. Glaspfel und Glasmangos wurden jedoch schon zu Tode gemacht. Ein Granatapfel ist aus einem bestimmten Grund besser: Wenn die Schale platzt, ergießen sich Hunderte von Glassamen und rollen, sodass das Geräusch Dauer und Struktur hat, anstatt nur ein zentrierter Einschlag zu sein. Wenn ein Modell sein Audio vortäuscht, zeigt sich das bei einer Streuung.
Schritt 1: Erstellen Sie das Basisbild mit GPT Image 2
Fixieren Sie die Komposition, bevor Sie Geld für das Video ausgeben. Einstellungen: quality: high, size: 2048x1152 (16:9), output_format: png.
plaintext1Extrem nahe Makroaufnahme eines ganzen Granatapfels, der vollständig aus dickem, 2durchscheinendem rubinrotem Glas geschnitzt ist, auf einer nassen schwarzen Schieferplatte 3ruhend. Die Glasschale ist 8 mm dick mit sichtbaren inneren Blasen und gemeißelten Facetten; 4Hunderte winziger Glassamen glühen im Inneren wie Granatkristalle. Ein poliertes japanisches 5Santoku-Messer liegt am linken Bildrand, die Klingenspitze berührt gerade die Glasoberfläche. 6Ein hartes Schlüssellicht von oben rechts streift über die Platte und wirft scharfe rote 7Kaustiken auf den nassen Stein. 100 mm Makro, f/2,8, geringe Schärfentiefe, dunkler 8mysteriöser Hintergrund. Keine Hände, kein Text, kein Wasserzeichen, kein Logo.

GPT Image 2 Playground auf Atlas Cloud mit Qualität auf High und Größe 16:9 2048x1152, der Glasgranatapfel im AUSGABE-Panel dargestellt
Der tatsächliche Durchlauf. Qualität high bei 2048x1152, und die Seite gibt $0,1745 an, was später auch auf der Rechnung stand.

Das generierte Basisbild: ein Granatapfel aus dickem Rubinglas auf nassem schwarzem Schiefer, ein Santoku-Messer dringt von links ein
Das Bild, das an H3 übergeben wurde. Generiert mit openai/gpt-image-2/text-to-image.
Schritt 2: Schreiben Sie die Audio-Hälfte des MiniMax H3 ASMR-Video-Prompts
Die meisten Leute schreiben einen ASMR-Prompt als Bildbeschreibung mit dem Wort "ASMR" vorne dran und wundern sich dann, warum das Modell es mit Lo-Fi-Klavier bewertet. H3 nimmt Audioanweisungen ernst, wenn Sie welche geben. Strukturieren Sie die Audio-Hälfte in fünf Abschnitten:
- Material. Was das Geräusch macht. Glas, Wachs, geschmolzenes Gestein, Wasser auf Glas. Geben Sie Dicke und Nässe genau an, sie verändern die Klangfarbe.
- Aktion und ihre zeitliche Form. Nicht nur "schneidet", sondern "drückt in einer langsamen, durchgehenden Bewegung nach unten". Das Modell nutzt dies, um Ereignisse zu platzieren.
- Mikrofonperspektive.
close-mic,intimate, Hinweise zur Aufnahmeentfernung. Dies bestimmt, wie trocken und nah das Geräusch wirkt, und funktioniert gut. - Lautmalerische Sequenz. Buchstabieren Sie die Geräuschereignisse der Reihe nach: Quietschen, dann Knacken, dann Dutzende kleiner Einschläge, dann Stille. Dies ist der Abschnitt, der die meiste Arbeit leistet.
- Negativangaben.
no music, no voice, no narration, no room reverb, no ambience bed. Ohne diese fügt H3 hilfreich eine Hintergrundmusik hinzu, da die meisten Videos in seinen Trainingsdaten eine haben.
Ich habe auch Kanalrichtungen in Abschnitt 4 geschrieben und den Riss im linken Kanal und die Samen, die von links nach rechts rollen, verlangt. Lesen Sie weiter, um zu sehen, was das tatsächlich produziert hat.
Schritt 3: Führen Sie den 768P-Entwurf aus
Entwurf mit 768P. Die Audiospur hat in beiden Stufen die gleiche Spezifikation, sodass das gesamte kreative Urteil, das bei ASMR ein Hörurteil ist, zum günstigen Preis getroffen werden kann.
Einstellungen auf minimax/h3/image-to-video: image = Ausgabe von Schritt 1, resolution: 768P, duration: 5. Das Seitenverhältnis wird vom ersten Bild bestimmt, also lassen Sie es in Ruhe.
plaintext1Die Santoku-Klinge dringt von links ein und drückt in einer langsamen, durchgehenden 2Bewegung von links nach rechts durch den Glasgranatapfel. Die Schale platzt mit einem 3hellen kristallinen Knacken, und ein Schauer winziger Glassamen ergießt sich auf den 4nassen Schiefer und verstreut sich nach rechts. Kamera fixiert, Makro, eine Einstellung, 5keine Schnitte. 6 7Audio: ASMR, close-mic, intim, keine Musik, keine Stimme, keine Erzählung, kein 8Raumhall. Ein trockenes, anhaltendes Glasquietschen, während die Klinge eindringt, 9dann ein scharfes, hohes Knacken, das auf den LINKEN Kanal geschwenkt wird, gefolgt 10von Dutzenden kleiner klirrender Sameneinschläge, die vom LINKEN Kanal nach RECHTS 11rollen, während sie sich verteilen. Ein schwaches Klingen-auf-Stein-Schaben am Ende, 12dann Stille. Kein Ambience-Bett, kein Brummen, keine Hintergrundmusik.

MiniMax H3 image-to-video Playground auf Atlas Cloud mit geladenem Basisbild, Dauer 5 und einem fertigen Clip im AUSGABE-Panel
Der image-to-video-Durchlauf: erstes Bild geladen, Dauer 5, AUSGABE abgeschlossen. Beachten Sie, dass die Auflösungsauswahl auf dem Seitenstandard von 2K steht. Schalten Sie sie für Entwürfe auf 768P um, was der untenstehende Clip auch ist.
xkolGEKI7UI
Der 768P-Entwurf, $0,50. Weicheres Bild als der Hauptclip, gleiche Audiospezifikation. Dies ist die Aufnahme, auf deren Grundlage die gesamte Entscheidung getroffen wird.
Schritt 4: Messen Sie das Stereobild, bevor Sie ihm vertrauen
Verlassen Sie sich nicht auf mein Wort zum Klang und auch nicht auf das des Modells. Trennen Sie die Kanäle und sehen Sie nach. Das ist lokales ffmpeg, kein API-Aufruf, keine Kosten:
plaintext1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \ 2 -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \ 3 -frames:v 1 stereo-proof.png

Vier-Panel-Wellenformanalyse, die den Glasgranatapfel-Clip und den Regenclip vergleicht und linken und rechten Kanal sowie den Seitenkanal für jeden zeigt
Linker Kanal über rechtem Kanal für zwei Clips, plus der Seitenkanal (links minus rechts) bei angeglichener Verstärkung darunter. Das ist das gesamte Argument in einem Bild.
Hier ist, was zurückkam, und ein Teil davon ist nicht das, was ich erwartet hatte.
Das Stereobild ist echt. Der Seitenkanal ist bei keinem von mir generierten Clip leer. Eine als Stereobild getarnte Dual-Mono-Datei würde dort nichts zeigen. Dieser hier hat Inhalt.
Aber Sie können kein Schwenken per Prompt erzwingen. Ich habe in Großbuchstaben nach dem Knacken im LINKEN Kanal und den Samen, die von LINKS nach RECHTS rollen, verlangt. Gemessen: Kanal-Korrelation 0,97, Seitenkanal 17,7 dB unter Mitte, und der größte Links-Rechts-Pegelunterschied in einem Viertelsekunden-Fenster beträgt 1,9 dB. Das ist kein Schwenken. Das ist ein zentriertes Bild mit ein wenig natürlicher Breite. Das Messer bewegt sich über das Bild; der Ton bleibt an Ort und Stelle.
Die Breite kommt vom Inhalt, nicht von Ihrer Formulierung. Der Regenclip im nächsten Abschnitt, bei dem ich überhaupt keine Richtung angab, kam mit einer Korrelation von 0,32 zurück, wobei der Seitenkanal nur 2,9 dB unter Mitte lag. Das ist ein wirklich breites, dekorreliertes Feld. Diffuse Umgebungsgeräusche erhalten automatisch Breite. Diskrete Einschläge bleiben unabhängig von der Formulierung in der Nähe der Mitte.
Die ehrliche Behauptung für dieses Modell ist also nicht räumlich. Sie ist zeitlich. Sie erhalten Ton, der zusammen mit dem Bild generiert wurde und auf dem Frame landet, zu dem er gehört, kostenlos, immer, ohne Editor. Wenn Ihr Format wirklich einen harten Schwenker benötigt, müssen Sie das immer noch selbst in der Nachbearbeitung erledigen, und Sie sollten aufhören, Kanalnamen in Prompts zu schreiben, da sie nichts bewirken.
Führen Sie nun das Finale erneut aus: derselbe Endpunkt, dasselbe erste Bild, derselbe Prompt, ändern Sie ein Feld auf resolution: 2K. Noch eine Sache, die Sie wissen sollten, bevor Sie annehmen, der Entwurf sei eine Vorschau.

Zwei Reihen von fünf Frames, die die 768P- und 2K-Durchläufe zu denselben Zeitstempeln vergleichen, identisch bei Frame Null und ab etwa 2,5 Sekunden abweichend
Gleiches erstes Bild, gleicher Prompt, beide Stufen. Frame 0 stimmt exakt überein. Nach 2,5 s bricht die Schale anders, und die beiden Clips sind zu verschiedenen Aufnahmen geworden.
Das Einfrieren des ersten Bildes hält die Komposition, den Bildausschnitt, die Beleuchtung und die Farbe über beide Stufen hinweg konstant, weshalb Sie für diesen Zweck immer image-to-video anstelle von text-to-video verwenden sollten. Es liefert Ihnen nicht dieselbe Aufnahme. Der 2K-Durchlauf führt die Aktion neu aus. Behandeln Sie den Entwurf als Vorschau der Optik und des Tons, nicht der exakten Choreografie.
Schritt 5: Fügen Sie eine echte Aufnahme als MiniMax H3 ASMR-Video-Referenz hinzu
Wenn Sie ein Geräusch haben, das Sie tatsächlich verwenden möchten, geben Sie es weiter. reference-to-video akzeptiert bis zu 9 Bilder, 3 Videos und 3 Audioclips und übernimmt Klangfarbe und Raumcharakter aus einer Audio-Referenz, anstatt sie zu erfinden. Ich habe eine gemeinfreundliche Glasbruch-Aufnahme von Gravity Sound von Wikimedia Commons (CC BY 4.0) verwendet, drei Takes zu 4,5 Sekunden zusammengefügt.
Drei Regeln, und die letzten beiden habe ich auf die harte Tour gelernt, weil Anfragen abgelehnt wurden:
- Audio kann nicht allein kommen. Der Endpunkt sagt es deutlich: Mindestens ein Bild oder Video ist erforderlich, und Audio allein ist nicht erlaubt. Kombinieren Sie es mit einem Bild.
- Die Audio-Referenz muss 2 bis 15 Sekunden lang sein. Mein erster Versuch verwendete einen 1,49-Sekunden-Clip und kam mit
audio duration 1486 ms, expected [2000, 15000] mszurück. Dieser Bereich steht nicht auf der Modellseite. - Das Dateiformat wird geprüft. Ein als
audio/mpegdeklarierter Base64-Payload wurde mitaudio format ".mpeg" not allowedabgelehnt. Ein.wav-Payload wurde akzeptiert. Abgelehnte Anfragen werden nicht berechnet, kosten aber einen Roundtrip.
Einstellungen: refers: [{url: <Basisbild>, type: "image"}, {url: <eine 2 bis 15s Aufnahme>, type: "audio"}], resolution: 768P, duration: 5.
plaintext1Gleiche fixierte Makroaufnahme: Die Klinge schneidet den Glasgranatapfel von links nach 2rechts, und die Samen verteilen sich. Passen Sie die Klangfarbe, Helligkeit und den 3Raumcharakter der Referenzaufnahme an, gleiche Aufnahmeentfernung, gleiche Trockenheit. 4ASMR close-mic, keine Musik, keine Stimme.

MiniMax H3 reference-to-video Playground auf Atlas Cloud mit zwei geladenen Referenzmaterialien, einer Audiodatei in Slot 1 und dem Basisbild in Slot 2
Referenzmaterialien mit Audiodatei und Bild zusammen, 2 von 9 verwendet. Lassen Sie das Bild weg, und die Anfrage wird überhaupt nicht ausgeführt.
mY1VrOfM3cM
Der referenzgeführte Take, $0,50. Gleiche Aufnahme, Klangfarbe durch eine echte Aufnahme gesteuert, nicht durch den Prompt erfunden. Audio-Referenz: Glasbruch von Gravity Sound, CC BY 4.0.
Drei MiniMax H3 ASMR-Video-Vorlagen: Schneiden, Kauen, Regen
Drei Formate decken das meiste ab, was in dieser Kategorie gut funktioniert. Jede ist ein kompletter Prompt zum Kopieren und Ausführen mit Einstellungen und dem produzierten Clip. Absichtlich kein Glas, kein Rot, kein Schiefer unten: Wenn jeder Clip auf Ihrem Konto gleich aussieht, behandelt der Algorithmus ihn als denselben Clip.
Tabelle 3: Dieselben fünf Abschnitte, drei verschiedene Aufgaben.
| Abschnitt | Vorlage 1, Das Schneiden | Vorlage 2, Das Kauen | Vorlage 3, Der Regen |
|---|---|---|---|
| Material | tropfende Wabe, heiße Stahlklinge | glühendes geschmolzenes Gestein, Steinschale | Regen auf Autoscheibe |
| Aktionsform | Klinge sinkt von vorne nach hinten ein, Honig zieht nach unten | Stäbchen heben, dann zwei Bissen | keine Subjektaktion, nur Tropfen |
| Mikrofonperspektive | close-mic, sehr trocken, kein Raum | extrem nah, intim | außerhalb der Scheibe, Kabine gedämpft |
| Geräuschsequenz | Wachsknacken, Honigdehnung, Tropfen auf Teller | geschmolzenes Zischen, nasses Kauen, glasiges Knirschen, Ausatmen | stetiges Regenbett, Tropfentreffer, entfernter Reifenquietscher |
| Negativangaben | keine Musik, keine Stimme, kein Raumhall | keine Worte, keine Musik, keine Erzählung | keine Musik, kein Donner, keine Stimme, keine Scheibenwischer |
Vorlage 1, Das Schneiden. Wabe, Bernstein und Gold, 9:16, 768P, 6 Sekunden, ratio: "9:16".
plaintext1Extremes Makro, fixierte Draufsicht auf eine dicke Platte goldener Wabe auf einem 2hellen Keramikteller, Honig bereits darum herum sammelnd. Eine heiße Stahlklinge senkt 3sich in das Wachs und sinkt in einer langsamen, durchgehenden Pressbewegung von vorne 4nach hinten hindurch; die Schnittflächen sacken ein, und ein schwerer Honigfaden dehnt 5sich und tropft auf den Teller. Warmes bernsteinfarbenes Schlüssellicht von links, 6geringe Schärfentiefe, eine Einstellung, keine Schnitte, keine Hände im Bild. 7 8Audio: ASMR, close-mic, sehr trocken, kein Raumhall, keine Musik, keine Stimme, keine 9Erzählung. Ein weiches Knistern des Wachses unter der Klinge, dann ein dickes, tiefes 10Ziehen, während der Honig länger wird, dann zwei schwere nasse Tropfen, die auf dem 11Keramikteller landen. Sonst nichts.
ZsVmf9AhPnw
Vorlage 1, $0,60. Wachsknacken, Honigdehnung, Tropfen. Generiert mit minimax/h3/text-to-video.
Vorlage 2, Das Kauen. Lava-Mukbang, das Format, das 11,3 Millionen Aufrufe in einer Woche erzielte, 9:16, 768P, 8 Sekunden, ratio: "9:16".
plaintext1Vertikale Nahaufnahme: Ein Paar schwarzer Lackstäbchen hebt einen glühenden Klumpen 2geschmolzener oranger Lava aus einer dunklen Steinschale und trägt ihn zur Kamera hin, 3unten aus dem Bild. Die Lava leuchtet selbst und wirft orangefarbenes Licht auf alles 4um sie herum; der Rest des Raums ist fast schwarz. Dampf kräuselt sich von der 5Oberfläche. Fixierte Kamera, eine Einstellung, keine Schnitte. 6 7Audio: ASMR, extrem nah, intim, keine Worte, keine Musik, keine Erzählung, kein 8Raumklang. Ein tiefes geschmolzenes Zischen und Blubbern, während die Lava angehoben 9wird, dann ein weiches nasses Kauen, dann ein helleres glasiges Knirschen beim zweiten 10Bissen, dann ein langsames zufriedenes Ausatmen. Keine Sprache.
UJhEsTnKkZI
Vorlage 2, $0,80. Zischen, Kauen, Knirschen, Ausatmen und kein einziges Wort. Generiert mit minimax/h3/text-to-video.
Vorlage 3, Der Regen. Nacht-Autoscheibe, kaltes Blau und Neon, 16:9, 768P, 10 Sekunden, ratio: "16:9".
Dies ist die einzige der drei Vorlagen ohne Subjektaktion, und sie lehrt am meisten über Negativangaben. Da nichts auf dem Bildschirm passiert, greift H3 zu einer Musikuntermalung, es sei denn, Sie verbieten es ausdrücklich. Es ist auch der Clip, der mit Abstand das breiteste Stereofeld zurückbrachte, ohne dass man darum gebeten hat. Schlaforientierte Inhalte wünschen Länge, daher läuft dieser nahe am oberen Ende des sinnvollen Dauerbereichs.
plaintext1Makroaufnahme durch die Innenseite einer Autoscheibe bei Nacht, starker Regen läuft 2an der Außenseite des Glases herunter. Einzelne Tropfen treffen auf, zögern, ziehen 3dann nach unten und verschmelzen. Jenseits des Glases brechen unscharfe Neonreklamen 4in kaltes Blau und Magenta-Bokeh. Keine Scheibenwischer, keine Menschen, keine 5Bewegung im Auto. Kamera fixiert, eine durchgehende Einstellung, geringe Schärfentiefe, 6keine Schnitte. 7 8Audio: ASMR, close-mic an der Außenseite des Glases, Kabine leicht gedämpft. 9Ein stetiges, gleichmäßiges Regenbett mit deutlich getrennten einzelnen Tropfentreffern 10auf dem Glas, plus ein leises entferntes Zischen von Reifen auf nasser Straße. 11Keine Musik, kein Donner, keine Stimme, keine Erzählung, kein Scheibenwischergeräusch.
bUKr5V6wbdM
Vorlage 3, $1,00. Zehn Sekunden reine Atmosphäre, kein Soundtrack, weil der Prompt einen verboten hat. Generiert mit minimax/h3/text-to-video.
Was ein MiniMax H3 ASMR-Video tatsächlich kostet
Hier ist die Rechnung für diesen Artikel, keine Schätzung.
| Posten | Anzahl | Abgerechnet |
|---|---|---|
| GPT Image 2 Basisbild, high, 2048x1152 | 1 | $0,17 |
| 2K Finale, 5s, image-to-video | 1 | $0,70 |
| 768P Entwurf, 5s, image-to-video | 1 | $0,50 |
| 768P reference-to-video, 5s | 1 | $0,50 |
| Vorlagen-Clips bei 768P, 6s + 8s + 10s | 3 | $2,40 |
| Abgelehnte Referenzanfragen | 2 | $0,00 |
| Gesamt | $4,27 |
Sechs veröffentlichungsfähige Clips und ein Basisbild. Skalieren Sie es auf einen Zeitplan: Ein 8-Sekunden-Vertikalclip pro Tag bei 768P kostet $0,80, also etwa $24 pro Monat für einen gesichtslosen Account, der täglich postet, bevor Sie eine Minute in einem Editor verbringen.
Zwei Abrechnungshinweise. Der angegebene Preis von $0,009 für GPT Image 2 ist ein Token-Stufen-Mindestpreis; ein High-Quality-2048x1152-Render liegt bei $0,1745, fast zwanzigmal so viel, also budgetieren Sie basierend auf der Stufe, die Sie tatsächlich verwenden. Und das price-Feld von H3 wird mit Verzögerung nachgefüllt: Pollen Sie, bis status completed ist, und es ist oft noch undefined. Pollen Sie die Vorhersage-ID einen Moment später erneut, um den tatsächlichen Betrag zu erhalten. Dieser zweite Poll ist die einzige Möglichkeit, eine Rechnung wie diese zu erstellen, anstatt eine Schätzung.
Eine ehrliche Anmerkung zu ASMR-Audio und Rechten
Laden Sie keine ASMR-Aufnahme einer anderen Person als refers-Audiodatei hoch. Die Referenz überträgt tatsächlich die Klangfarbe in die Ausgabe, und das Durchlaufen einer Aufnahme durch ein Modell ändert nichts an den Eigentumsverhältnissen. Die hier verwendete Referenz ist CC BY 4.0 und oben gekennzeichnet, was etwa zwei Minuten dauerte.
Bauen Sie ASMR nicht um die erkennbare Stimme einer realen Person herum auf. Jede Vorlage in diesem Artikel ist bewusst stimmlos, was sowohl die Genre-Konvention als auch der unkomplizierteste Weg ist.
Der Aufruf von H3 über eine API wird nicht von der Community-Lizenz beeinflusst, die an die offenen Gewichte gebunden ist. Diese Lizenz, die das Selbst-Hosten abdeckt, schließt derzeit die EU, Großbritannien, Korea und die USA aus, und für diese Gebiete ist ein formeller Lizenzierungskanal geöffnet. Wissenswert, aber kein Grund zur Sorge, wenn Sie den Endpunkt aufrufen.
MiniMax H3 ASMR-Video: Häufig gestellte Fragen
Erzeugt ein MiniMax H3 ASMR-Video seinen eigenen Ton, oder füge ich ihn nachträglich hinzu?
Das Modell erzeugt ihn. Bild und Ton stammen aus demselben Durchlauf: 24 fps-Video mit einer AAC-Stereospur bei 32 kHz in der gelieferten Datei. Es gibt keinen separaten Audio-Schritt, keine Soundbibliothek und keine Ausrichtungsarbeit, was der gesamte Grund ist, warum dieser Endpunkt speziell für ASMR interessant ist.
Kann ich ein MiniMax H3 ASMR-Video von links nach rechts schwenken lassen?
Nicht durch Aufforderung. Ich habe explizite Kanalanweisungen in den Prompt geschrieben und das Ergebnis gemessen: Korrelation 0,97 zwischen den Kanälen und ein maximaler Pegelunterschied von 1,9 dB in einem Viertelsekunden-Fenster, was überhaupt kein Schwenken ist. Die Spur ist wirklich Stereo, und diffuse Inhalte wie Regen kommen mit einem breiten Feld zurück, aber diskrete Einschläge bleiben unabhängig von der Formulierung zentriert. Wenn Ihr Format einen harten Schwenker benötigt, erledigen Sie das in der Nachbearbeitung.
Kann ich meine eigene Aufnahme als MiniMax H3 ASMR-Video-Referenz hochladen?
Ja, über reference-to-video, das bis zu 3 Audio-Referenzen zusammen mit bis zu 9 Bildern und 3 Videos akzeptiert. Audio kann nicht allein eingereicht werden, also kombinieren Sie es mit mindestens einem Bild oder Video. Das Audio muss außerdem zwischen 2 und 15 Sekunden lang sein, und das Format wird überprüft: Ein .wav-Payload funktionierte, während ein audio/mpeg-Payload abgelehnt wurde. Abgelehnte Anfragen werden nicht berechnet.
Ist das Audio eines 768P MiniMax H3 ASMR-Videos schlechter als bei 2K?
Nein. Beide Stufen liefern die gleiche AAC-Stereo-32-kHz-Spezifikation. Nur das Bild ändert sich, und zwar erheblich: 16:9 kommt als 1344x768 bei 768P zurück gegenüber 2560x1440 bei 2K. Da das kreative Urteil bei ASMR ein Hörurteil ist, entwerfen Sie mit $0,10/s und führen Sie Finale mit $0,14/s erneut aus. Denken Sie nur daran, dass der 2K-Durchlauf eine neue Aufnahme ist, kein Hochskalieren des Entwurfs.
Wie lang sollte ein MiniMax H3 ASMR-Video sein und welches Seitenverhältnis?
Die Dauer akzeptiert jede ganze Sekunde von 4 bis 15. Schneide- und Kauclips funktionieren bei 5 bis 8 Sekunden, da der Lohn ein Ereignis ist; schlaforientierte Atmosphäre wünscht 10 oder mehr. Für Shorts, Reels und TikTok verwenden Sie 9:16, und denken Sie daran, dass text-to-video erfordert, dass ratio explizit gesetzt wird, und adaptive ablehnt. Bei image-to-video bestimmt das erste Bild die Form für Sie.
Wie viel kostet ein MiniMax H3 ASMR-Video?
Ein 5-Sekunden-Clip kostet $0,50 bei 768P und $0,70 bei 2K. Ein 8-Sekunden-Vertikalclip bei 768P kostet $0,80. Wenn Sie einen solchen pro Tag posten, sind das etwa $24 pro Monat an Rechenleistung, was die Zahl ist, die sich mit den 20 Minuten vergleichen lässt, die ein Editor pro Clip für den zusammengesetzten Workflow bräuchte.
Warum hat mein MiniMax H3 ASMR-Video Hintergrundmusik, die ich nie verlangt habe?
Weil Sie sie nicht verboten haben. Die meisten Videos in den Trainingsdaten eines Modells haben eine Musikuntermalung, daher ist das Standardverhalten, eine hinzuzufügen, besonders wenn nichts auf dem Bildschirm passiert. Setzen Sie die Negativangaben im Audio-Teil des Prompts explizit: no music, no voice, no narration, no room reverb, no ambience bed. Atmosphären-Vorlagen benötigen dies mehr als aktionsorientierte.






