Seedance 2.5 ist jetzt live — Zuerst auf Atlas Cloud

MiniMax H3 ASMR Video: Ich schnitt einen Granatapfel aus Glas und maß dann, ob das Stereo echt war.

Die meisten KI-ASMR kleben Stock Sound auf stummes Video. Ein MiniMax H3 ASMR-Video rendert 32 kHz Stereo in einem Durchgang. Ich habe die Kanäle gemessen, mit Prompts und Kosten.

Setzen Sie Kopfhörer auf, bevor Sie zum unten stehenden Clip scrollen. In dieser Kategorie kommt es wirklich darauf an.

Ein Messer fährt durch einen Granatapfel aus Rubinglas. Die Schale spaltet sich, ein kristalliner Riss, dann purzeln einige Dutzend Glassamen über nassen Schiefer. Hier ist der Teil, der sich von fast jedem KI-ASMR-Clip unterscheidet, an dem Sie dieses Jahr vorbeigescrollt sind: Niemand hat dieses Geräusch hinzugefügt. Es gab keine Soundbibliothek, keinen Editor, keine Timeline. Bild und Audio entstanden in einer Generation, in einem Aufruf.

Im letzten Jahr sah KI-ASMR befriedigend aus und klang leicht falsch, und der Grund lag nie an den Bildern. Es war der letzte Schritt der Pipeline. Das Kleben von Audio auf einen stummen Clip war eine manuelle Arbeit, die jedes Mal von Hand erledigt wurde. Die Kategorie wuchs so schnell um diese Lücke herum, dass eine kleine Industrie spezieller KI-ASMR-Generatorseiten entstand, die das Zusammenfügen rein automatisieren sollte. Eine davon bewirbt "binaurales 3D-Audio" direkt auf der Startseite. Die Nachfrage war längst bewiesen. Sie wurde nur durch Montage bedient.

Also habe ich die Sache ordentlich durchgeführt. Ein reproduzierbarer Workflow, sechs Clips, und dann der Teil, den niemand in dieser Kategorie jemals macht: Ich habe den linken und rechten Kanal in ffmpeg getrennt und gemessen. Einiges von dem, was ich erwartet hatte, stellte sich als falsch heraus, und das erwies sich als das Nützlichste in diesem Artikel.

Wichtige Erkenntnisse

  • H3 rendert das 24 fps-Bild und eine 32 kHz AAC-Stereospur im selben Durchlauf. Das Audio wird generiert, nicht nachträglich unterlegt.
  • Die Stereospur ist wirklich Stereospur, kein Dual-Mono im Stereokostüm. Aber Sie können kein Schwenken per Prompt erzwingen. Ich bat um eine harte Links-nach-rechts-Bewegung und erhielt einen Unterschied von 1,9 dB, was nichts ist.
  • Die Stereobreite kommt vom Inhalt, nicht von Ihrer Formulierung. Der Regenclip, bei dem ich überhaupt keine Richtung angab, kam mit einem wirklich breiten Feld zurück.
  • Das Einfrieren des ersten Bildes hält die Aufnahme über Auflösungen hinweg, aber 768P und 2K sind immer noch zwei verschiedene Aufnahmen. Der Entwurf zeigt die Optik und die Audiospezifikation, nicht die exakte Choreografie.
  • Ein 5-Sekunden-Clip mit 768P kostet $0,50. Derselbe Clip mit 2K kostet $0,70. Der gesamte Artikel kostete $4,27.

Hören Sie zuerst: Ein MiniMax H3 ASMR-Video, in einem Durchlauf geschnitten

w7ZRR7bo3KI

Fünf Sekunden, 2K, 24 fps, 32 kHz Stereo, eine Generation, $0,70. Ton an: das Quietschen der eindringenden Klinge, der Riss, dann die Samen. Nichts davon wurde nachträglich hinzugefügt. Generiert mit minimax/h3/image-to-video.

Ein Prompt. Ein Modell. Ein Aufruf. Alles, was folgt, beschreibt, wie dieser Clip erstellt wurde, was er kostete und welche Teile der Marketinggeschichte einer Wellenform standhalten.

Warum KI-ASMR explodierte und warum die meisten Clips den Kopfhörertest nicht bestehen

Der Trend hat einen Geburtstag. KI-ASMR verbreitete sich ab Juni 2025, direkt nachdem Veo 3 landete, und das Format ging innerhalb von Tagen durch die Decke. Ein Lava-Mukbang von @asmraiworks erzielte über 11,3 Millionen Aufrufe in einer Woche; ein Glasschneideclip erzielte 5,3 Millionen in elf Tagen (Know Your Meme, 2025). Nachrichtenredaktionen griffen es als Kuriosität auf, wobei surreale Bilder und mit Stäbchen gegessenes geschmolzenes Lava den Großteil der Arbeit erledigten (The Express Tribune, 2025).

Dann setzten die Leute Kopfhörer auf, und die Stimmung kippte. Der TechRadar-Autor sah sich einen Haufen der viralen Clips an und beschrieb einen Schimmer von Künstlichkeit, "es fehlen die Fehler und Ungenauigkeiten, die das Markenzeichen von menschlichem ASMR sind" (TechRadar, Juni 2025). In dem Artikel zitierte Fans sagten, die Kitzelauslöser seien technisch vorhanden, und es sei trotzdem nicht dasselbe.

Es gibt einen mechanischen Grund, und der ist nicht mystisch. ASMR ist die eine Inhaltskategorie, bei der der Inhalt das Geräusch ist. Überall sonst ist Audio eine Garnitur. Hier ist es das Produkt. Und der vorherrschende Workflow war:

  1. Erzeuge einen stummen Clip mit einem Videomodell,
  2. durchsuche eine Soundbibliothek nach einem Knacken, Knirschen, Regenbett,
  3. richte den Ton im Editor auf das Bild aus,
  4. schwenke und mische von Hand, wenn es dir wichtig ist – was fast niemand in großem Umfang tut,
  5. exportiere.

Schritt 3 ist der Tod. Ein eingefrorener Knack, der zwei Frames zu spät abgespielt wird, wirkt unecht, bevor man erklären kann, warum. Multiplizieren Sie das mit einem täglichen Veröffentlichungsplan, und die Fehler häufen sich, weil die Ausrichtung jedes Mal von einem Menschen neu gemacht wird.

Diese Lücke ist der Grund, warum eine ganze Cottage-Industrie von KI-ASMR-Generatorseiten existiert. Mindestens drei vermarkten sich aktiv, und eine wirbt mit binauralem 3D-Audio als Hauptmerkmal. Sie lösen kein erfundenes Problem. Sie stopfen ein echtes Loch: Die darunterliegenden Videomodelle erzeugen keinen Ton.

Damit lohnt sich ein Blick auf eine bestimmte Bestenliste. Auf Artificial Analysis' Video-Editing-Tafel, derjenigen, die mit Audio bewertet wird, liegt MiniMax H3 mit 1.126 Elo auf Platz 1, vor Gemini Omni Flash mit 1.119 und etwa hundert Punkten vor Dreamina Seedance 2.0 mit 1.027 (Artificial Analysis, August 2026). Auf den Image-to-Video-Tafeln, wo Audio nicht Teil der Bewertung ist, liegen mehrere dieser Modelle innerhalb weniger Punkte voneinander. Der Abstand entsteht, wenn Ton zählt. Für ASMR zählt nur der Ton.

Der MiniMax H3 ASMR-Video-Workflow und was jeder Schritt kostet

Drei Endpunkte, ein Browser-Tab. Alles in diesem Artikel habe ich auf Atlas Cloud ausgeführt, daher stammt jeder unten aufgeführte Betrag von der Rechnung und nicht von einer Preisliste.

Auftrag in diesem ArtikelModellPreis
Erstes Bild für das ShowcaseOpenAI GPT Image 2 (Text-zu-Bild)ab $0,009/Bild, abgerechnet $0,1745 bei High und 2048x1152
Entwurf und FinaleMiniMax H3 Image-to-Video$0,10/s bei 768P, $0,14/s bei 2K
Eine echte Aufnahme einspielenMiniMax H3 Reference-to-Videodieselben zwei Stufen
Die drei VorlagenMiniMax H3 Text-to-Videodieselben zwei Stufen
Der alte Weg, nur die AudiohälfteByteDance Seed Audio 1.0$0,143/min

Die Auflistung zeigt "Ab $0,1/SEC" auf allen drei H3-Endpunkten. Das ist der 768P-Mindestpreis. 2K wird mit $0,14/s abgerechnet, und diese Zahl erscheint nirgends außer auf Ihrer Rechnung, also planen Sie basierend auf der Stufe, die Sie tatsächlich anfordern.

Tabelle 1: Ein Durchlauf versus die zusammengesetzte Pipeline.

 MiniMax H3, natives AudioStummes Modell plus nachträgliches Audio
Schritte zu einem fertigen Clip14 bis 5
Beteiligte Werkzeuge1Videomodell + Soundbibliothek + Editor + Export
Wie Bild und Ton synchron bleibendieselbe Generation, dieselbe TimelineSie ziehen es, bis es richtig aussieht
Wer mischt und schwenktniemand, Sie nehmen, was das Modell liefertSie, von Hand, pro Geräusch
Menschliche Zeit pro Clipungefähr null nach dem Prompt15 bis 40 Minuten, ehrlich gesagt
Rechenleistung pro 5s-Clip$0,50 bei 768PVideomodell + $0,143/min Audiogenerierung

Ich verzichte bewusst darauf, den Preis pro Sekunde einer konkurrierenden Videoplattform zu nennen, denn die Rechenleistung ist nicht der entscheidende Unterschied. Die Audiogenerierung kostet $0,143 pro Minute, also Pfennige. Die wahren Kosten der zusammengesetzten Pipeline sind 20 Minuten menschlicher Aufmerksamkeit pro Clip, und diese Kosten sinken nicht mit der Skalierung. Sie multiplizieren sich. Ein gesichtsloser Account, der täglich postet, ist genau der Fall, bei dem 20 Minuten pro Clip leise das gesamte Geschäftsmodell auffressen.

Das ehrliche Gegengewicht: Das manuelle Zusammensetzen erkauft Ihnen Kontrolle. Sie können ein Geräusch überall im Stereofeld platzieren und es auf den Frame zuschneiden. H3 liefert die Synchronisation kostenlos, gibt Ihnen aber, wie die unten stehenden Messungen zeigen, diese Kontrolle nicht zurück.

Tabelle 2: Die drei H3-Endpunkte, die Parameter, die wirklich zählen.

 image-to-videotext-to-videoreference-to-video
HaupteingabeBild (erstes Bild)Nur Promptrefers[]
Auflösung768P / 2K, Standard 2Kgleichgleich
Dauerjede ganze Sekunde 4 bis 15, Standard 8gleichgleich
Seitenverhältniswird durch das erste Bild bestimmtmuss explizit gesetzt werden, adaptiv wird abgelehntwird durch die Referenzen bestimmt
refers-Limitsnicht zusammen mit image verwendetnicht verwendetbis zu 9 Bilder, 3 Videos, 3 Audio
Gelieferte 16:9-Ausgabe1344x768 bei 768P, 2560x1440 bei 2Kgleichgleich
AudiospurAAC Stereo 32 kHz über 24 fps Videogleichgleich

Zwei Parameterfallen, die Sie sich auf die Hand schreiben sollten. Der Parameter heißt ratio, nicht aspect_ratio, und der falsche Schlüssel lässt ihn ungesetzt, sodass text-to-video die Anfrage ablehnt. Und image plus refers im selben Aufruf verursacht keinen Fehler: Es wird ausgeführt, vollständig abgerechnet und wirft stillschweigend einen der beiden Eingaben weg.

MiniMax H3 ASMR-Video-Tutorial: Einen Glasgranatapfel schneiden

Glasschneiden ist das Format, das jeder erkennt, also weiß der Leser sofort, worum es geht. Glaspfel und Glasmangos wurden jedoch schon zu Tode gemacht. Ein Granatapfel ist aus einem bestimmten Grund besser: Wenn die Schale platzt, ergießen sich Hunderte von Glassamen und rollen, sodass das Geräusch Dauer und Struktur hat, anstatt nur ein zentrierter Einschlag zu sein. Wenn ein Modell sein Audio vortäuscht, zeigt sich das bei einer Streuung.

Schritt 1: Erstellen Sie das Basisbild mit GPT Image 2

Fixieren Sie die Komposition, bevor Sie Geld für das Video ausgeben. Einstellungen: quality: high, size: 2048x1152 (16:9), output_format: png.

plaintext
1Extrem nahe Makroaufnahme eines ganzen Granatapfels, der vollständig aus dickem,
2durchscheinendem rubinrotem Glas geschnitzt ist, auf einer nassen schwarzen Schieferplatte
3ruhend. Die Glasschale ist 8 mm dick mit sichtbaren inneren Blasen und gemeißelten Facetten;
4Hunderte winziger Glassamen glühen im Inneren wie Granatkristalle. Ein poliertes japanisches
5Santoku-Messer liegt am linken Bildrand, die Klingenspitze berührt gerade die Glasoberfläche.
6Ein hartes Schlüssellicht von oben rechts streift über die Platte und wirft scharfe rote
7Kaustiken auf den nassen Stein. 100 mm Makro, f/2,8, geringe Schärfentiefe, dunkler
8mysteriöser Hintergrund. Keine Hände, kein Text, kein Wasserzeichen, kein Logo.

KI-Bildgenerator-Oberfläche mit einem Text-Prompt und generiertem Bild

GPT Image 2 Playground auf Atlas Cloud mit Qualität auf High und Größe 16:9 2048x1152, der Glasgranatapfel im AUSGABE-Panel dargestellt

Der tatsächliche Durchlauf. Qualität high bei 2048x1152, und die Seite gibt $0,1745 an, was später auch auf der Rechnung stand.

Messer schneidet einen durchscheinenden roten Glasgranatapfel auf dunklem Stein

Das generierte Basisbild: ein Granatapfel aus dickem Rubinglas auf nassem schwarzem Schiefer, ein Santoku-Messer dringt von links ein

Das Bild, das an H3 übergeben wurde. Generiert mit openai/gpt-image-2/text-to-image.

Schritt 2: Schreiben Sie die Audio-Hälfte des MiniMax H3 ASMR-Video-Prompts

Die meisten Leute schreiben einen ASMR-Prompt als Bildbeschreibung mit dem Wort "ASMR" vorne dran und wundern sich dann, warum das Modell es mit Lo-Fi-Klavier bewertet. H3 nimmt Audioanweisungen ernst, wenn Sie welche geben. Strukturieren Sie die Audio-Hälfte in fünf Abschnitten:

  1. Material. Was das Geräusch macht. Glas, Wachs, geschmolzenes Gestein, Wasser auf Glas. Geben Sie Dicke und Nässe genau an, sie verändern die Klangfarbe.
  2. Aktion und ihre zeitliche Form. Nicht nur "schneidet", sondern "drückt in einer langsamen, durchgehenden Bewegung nach unten". Das Modell nutzt dies, um Ereignisse zu platzieren.
  3. Mikrofonperspektive.close-mic, intimate, Hinweise zur Aufnahmeentfernung. Dies bestimmt, wie trocken und nah das Geräusch wirkt, und funktioniert gut.
  4. Lautmalerische Sequenz. Buchstabieren Sie die Geräuschereignisse der Reihe nach: Quietschen, dann Knacken, dann Dutzende kleiner Einschläge, dann Stille. Dies ist der Abschnitt, der die meiste Arbeit leistet.
  5. Negativangaben.no music, no voice, no narration, no room reverb, no ambience bed. Ohne diese fügt H3 hilfreich eine Hintergrundmusik hinzu, da die meisten Videos in seinen Trainingsdaten eine haben.

Ich habe auch Kanalrichtungen in Abschnitt 4 geschrieben und den Riss im linken Kanal und die Samen, die von links nach rechts rollen, verlangt. Lesen Sie weiter, um zu sehen, was das tatsächlich produziert hat.

Schritt 3: Führen Sie den 768P-Entwurf aus

Entwurf mit 768P. Die Audiospur hat in beiden Stufen die gleiche Spezifikation, sodass das gesamte kreative Urteil, das bei ASMR ein Hörurteil ist, zum günstigen Preis getroffen werden kann.

Einstellungen auf minimax/h3/image-to-video: image = Ausgabe von Schritt 1, resolution: 768P, duration: 5. Das Seitenverhältnis wird vom ersten Bild bestimmt, also lassen Sie es in Ruhe.

plaintext
1Die Santoku-Klinge dringt von links ein und drückt in einer langsamen, durchgehenden
2Bewegung von links nach rechts durch den Glasgranatapfel. Die Schale platzt mit einem
3hellen kristallinen Knacken, und ein Schauer winziger Glassamen ergießt sich auf den
4nassen Schiefer und verstreut sich nach rechts. Kamera fixiert, Makro, eine Einstellung,
5keine Schnitte.
6
7Audio: ASMR, close-mic, intim, keine Musik, keine Stimme, keine Erzählung, kein
8Raumhall. Ein trockenes, anhaltendes Glasquietschen, während die Klinge eindringt,
9dann ein scharfes, hohes Knacken, das auf den LINKEN Kanal geschwenkt wird, gefolgt
10von Dutzenden kleiner klirrender Sameneinschläge, die vom LINKEN Kanal nach RECHTS
11rollen, während sie sich verteilen. Ein schwaches Klingen-auf-Stein-Schaben am Ende,
12dann Stille. Kein Ambience-Bett, kein Brummen, keine Hintergrundmusik.

KI-Videogenerator-Oberfläche mit einem Glasgranatapfel-Video

MiniMax H3 image-to-video Playground auf Atlas Cloud mit geladenem Basisbild, Dauer 5 und einem fertigen Clip im AUSGABE-Panel

Der image-to-video-Durchlauf: erstes Bild geladen, Dauer 5, AUSGABE abgeschlossen. Beachten Sie, dass die Auflösungsauswahl auf dem Seitenstandard von 2K steht. Schalten Sie sie für Entwürfe auf 768P um, was der untenstehende Clip auch ist.

xkolGEKI7UI

Der 768P-Entwurf, $0,50. Weicheres Bild als der Hauptclip, gleiche Audiospezifikation. Dies ist die Aufnahme, auf deren Grundlage die gesamte Entscheidung getroffen wird.

Schritt 4: Messen Sie das Stereobild, bevor Sie ihm vertrauen

Verlassen Sie sich nicht auf mein Wort zum Klang und auch nicht auf das des Modells. Trennen Sie die Kanäle und sehen Sie nach. Das ist lokales ffmpeg, kein API-Aufruf, keine Kosten:

plaintext
1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \
2  -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \
3  -frames:v 1 stereo-proof.png

Wellenformvergleich der Stereokanal-Trennung in zwei ASMR-Audioclips

Vier-Panel-Wellenformanalyse, die den Glasgranatapfel-Clip und den Regenclip vergleicht und linken und rechten Kanal sowie den Seitenkanal für jeden zeigt

Linker Kanal über rechtem Kanal für zwei Clips, plus der Seitenkanal (links minus rechts) bei angeglichener Verstärkung darunter. Das ist das gesamte Argument in einem Bild.

Hier ist, was zurückkam, und ein Teil davon ist nicht das, was ich erwartet hatte.

Das Stereobild ist echt. Der Seitenkanal ist bei keinem von mir generierten Clip leer. Eine als Stereobild getarnte Dual-Mono-Datei würde dort nichts zeigen. Dieser hier hat Inhalt.

Aber Sie können kein Schwenken per Prompt erzwingen. Ich habe in Großbuchstaben nach dem Knacken im LINKEN Kanal und den Samen, die von LINKS nach RECHTS rollen, verlangt. Gemessen: Kanal-Korrelation 0,97, Seitenkanal 17,7 dB unter Mitte, und der größte Links-Rechts-Pegelunterschied in einem Viertelsekunden-Fenster beträgt 1,9 dB. Das ist kein Schwenken. Das ist ein zentriertes Bild mit ein wenig natürlicher Breite. Das Messer bewegt sich über das Bild; der Ton bleibt an Ort und Stelle.

Die Breite kommt vom Inhalt, nicht von Ihrer Formulierung. Der Regenclip im nächsten Abschnitt, bei dem ich überhaupt keine Richtung angab, kam mit einer Korrelation von 0,32 zurück, wobei der Seitenkanal nur 2,9 dB unter Mitte lag. Das ist ein wirklich breites, dekorreliertes Feld. Diffuse Umgebungsgeräusche erhalten automatisch Breite. Diskrete Einschläge bleiben unabhängig von der Formulierung in der Nähe der Mitte.

Die ehrliche Behauptung für dieses Modell ist also nicht räumlich. Sie ist zeitlich. Sie erhalten Ton, der zusammen mit dem Bild generiert wurde und auf dem Frame landet, zu dem er gehört, kostenlos, immer, ohne Editor. Wenn Ihr Format wirklich einen harten Schwenker benötigt, müssen Sie das immer noch selbst in der Nachbearbeitung erledigen, und Sie sollten aufhören, Kanalnamen in Prompts zu schreiben, da sie nichts bewirken.

Führen Sie nun das Finale erneut aus: derselbe Endpunkt, dasselbe erste Bild, derselbe Prompt, ändern Sie ein Feld auf resolution: 2K. Noch eine Sache, die Sie wissen sollten, bevor Sie annehmen, der Entwurf sei eine Vorschau.

Vergleich zweier Videoauflösungen beim Schneiden eines Glasgranatapfels

Zwei Reihen von fünf Frames, die die 768P- und 2K-Durchläufe zu denselben Zeitstempeln vergleichen, identisch bei Frame Null und ab etwa 2,5 Sekunden abweichend

Gleiches erstes Bild, gleicher Prompt, beide Stufen. Frame 0 stimmt exakt überein. Nach 2,5 s bricht die Schale anders, und die beiden Clips sind zu verschiedenen Aufnahmen geworden.

Das Einfrieren des ersten Bildes hält die Komposition, den Bildausschnitt, die Beleuchtung und die Farbe über beide Stufen hinweg konstant, weshalb Sie für diesen Zweck immer image-to-video anstelle von text-to-video verwenden sollten. Es liefert Ihnen nicht dieselbe Aufnahme. Der 2K-Durchlauf führt die Aktion neu aus. Behandeln Sie den Entwurf als Vorschau der Optik und des Tons, nicht der exakten Choreografie.

Schritt 5: Fügen Sie eine echte Aufnahme als MiniMax H3 ASMR-Video-Referenz hinzu

Wenn Sie ein Geräusch haben, das Sie tatsächlich verwenden möchten, geben Sie es weiter. reference-to-video akzeptiert bis zu 9 Bilder, 3 Videos und 3 Audioclips und übernimmt Klangfarbe und Raumcharakter aus einer Audio-Referenz, anstatt sie zu erfinden. Ich habe eine gemeinfreundliche Glasbruch-Aufnahme von Gravity Sound von Wikimedia Commons (CC BY 4.0) verwendet, drei Takes zu 4,5 Sekunden zusammengefügt.

Drei Regeln, und die letzten beiden habe ich auf die harte Tour gelernt, weil Anfragen abgelehnt wurden:

  • Audio kann nicht allein kommen. Der Endpunkt sagt es deutlich: Mindestens ein Bild oder Video ist erforderlich, und Audio allein ist nicht erlaubt. Kombinieren Sie es mit einem Bild.
  • Die Audio-Referenz muss 2 bis 15 Sekunden lang sein. Mein erster Versuch verwendete einen 1,49-Sekunden-Clip und kam mit audio duration 1486 ms, expected [2000, 15000] ms zurück. Dieser Bereich steht nicht auf der Modellseite.
  • Das Dateiformat wird geprüft. Ein als audio/mpeg deklarierter Base64-Payload wurde mit audio format ".mpeg" not allowed abgelehnt. Ein .wav-Payload wurde akzeptiert. Abgelehnte Anfragen werden nicht berechnet, kosten aber einen Roundtrip.

Einstellungen: refers: [{url: <Basisbild>, type: "image"}, {url: <eine 2 bis 15s Aufnahme>, type: "audio"}], resolution: 768P, duration: 5.

plaintext
1Gleiche fixierte Makroaufnahme: Die Klinge schneidet den Glasgranatapfel von links nach
2rechts, und die Samen verteilen sich. Passen Sie die Klangfarbe, Helligkeit und den
3Raumcharakter der Referenzaufnahme an, gleiche Aufnahmeentfernung, gleiche Trockenheit.
4ASMR close-mic, keine Musik, keine Stimme.

KI-Videogenerator-Oberfläche mit Prompt-Eingabe und generiertem Granatapfel-Video

MiniMax H3 reference-to-video Playground auf Atlas Cloud mit zwei geladenen Referenzmaterialien, einer Audiodatei in Slot 1 und dem Basisbild in Slot 2

Referenzmaterialien mit Audiodatei und Bild zusammen, 2 von 9 verwendet. Lassen Sie das Bild weg, und die Anfrage wird überhaupt nicht ausgeführt.

mY1VrOfM3cM

Der referenzgeführte Take, $0,50. Gleiche Aufnahme, Klangfarbe durch eine echte Aufnahme gesteuert, nicht durch den Prompt erfunden. Audio-Referenz: Glasbruch von Gravity Sound, CC BY 4.0.

Drei MiniMax H3 ASMR-Video-Vorlagen: Schneiden, Kauen, Regen

Drei Formate decken das meiste ab, was in dieser Kategorie gut funktioniert. Jede ist ein kompletter Prompt zum Kopieren und Ausführen mit Einstellungen und dem produzierten Clip. Absichtlich kein Glas, kein Rot, kein Schiefer unten: Wenn jeder Clip auf Ihrem Konto gleich aussieht, behandelt der Algorithmus ihn als denselben Clip.

Tabelle 3: Dieselben fünf Abschnitte, drei verschiedene Aufgaben.

AbschnittVorlage 1, Das SchneidenVorlage 2, Das KauenVorlage 3, Der Regen
Materialtropfende Wabe, heiße Stahlklingeglühendes geschmolzenes Gestein, SteinschaleRegen auf Autoscheibe
AktionsformKlinge sinkt von vorne nach hinten ein, Honig zieht nach untenStäbchen heben, dann zwei Bissenkeine Subjektaktion, nur Tropfen
Mikrofonperspektiveclose-mic, sehr trocken, kein Raumextrem nah, intimaußerhalb der Scheibe, Kabine gedämpft
GeräuschsequenzWachsknacken, Honigdehnung, Tropfen auf Tellergeschmolzenes Zischen, nasses Kauen, glasiges Knirschen, Ausatmenstetiges Regenbett, Tropfentreffer, entfernter Reifenquietscher
Negativangabenkeine Musik, keine Stimme, kein Raumhallkeine Worte, keine Musik, keine Erzählungkeine Musik, kein Donner, keine Stimme, keine Scheibenwischer

Vorlage 1, Das Schneiden. Wabe, Bernstein und Gold, 9:16, 768P, 6 Sekunden, ratio: "9:16".

plaintext
1Extremes Makro, fixierte Draufsicht auf eine dicke Platte goldener Wabe auf einem
2hellen Keramikteller, Honig bereits darum herum sammelnd. Eine heiße Stahlklinge senkt
3sich in das Wachs und sinkt in einer langsamen, durchgehenden Pressbewegung von vorne
4nach hinten hindurch; die Schnittflächen sacken ein, und ein schwerer Honigfaden dehnt
5sich und tropft auf den Teller. Warmes bernsteinfarbenes Schlüssellicht von links,
6geringe Schärfentiefe, eine Einstellung, keine Schnitte, keine Hände im Bild.
7
8Audio: ASMR, close-mic, sehr trocken, kein Raumhall, keine Musik, keine Stimme, keine
9Erzählung. Ein weiches Knistern des Wachses unter der Klinge, dann ein dickes, tiefes
10Ziehen, während der Honig länger wird, dann zwei schwere nasse Tropfen, die auf dem
11Keramikteller landen. Sonst nichts.

ZsVmf9AhPnw

Vorlage 1, $0,60. Wachsknacken, Honigdehnung, Tropfen. Generiert mit minimax/h3/text-to-video.

Vorlage 2, Das Kauen. Lava-Mukbang, das Format, das 11,3 Millionen Aufrufe in einer Woche erzielte, 9:16, 768P, 8 Sekunden, ratio: "9:16".

plaintext
1Vertikale Nahaufnahme: Ein Paar schwarzer Lackstäbchen hebt einen glühenden Klumpen
2geschmolzener oranger Lava aus einer dunklen Steinschale und trägt ihn zur Kamera hin,
3unten aus dem Bild. Die Lava leuchtet selbst und wirft orangefarbenes Licht auf alles
4um sie herum; der Rest des Raums ist fast schwarz. Dampf kräuselt sich von der
5Oberfläche. Fixierte Kamera, eine Einstellung, keine Schnitte.
6
7Audio: ASMR, extrem nah, intim, keine Worte, keine Musik, keine Erzählung, kein
8Raumklang. Ein tiefes geschmolzenes Zischen und Blubbern, während die Lava angehoben
9wird, dann ein weiches nasses Kauen, dann ein helleres glasiges Knirschen beim zweiten
10Bissen, dann ein langsames zufriedenes Ausatmen. Keine Sprache.

UJhEsTnKkZI

Vorlage 2, $0,80. Zischen, Kauen, Knirschen, Ausatmen und kein einziges Wort. Generiert mit minimax/h3/text-to-video.

Vorlage 3, Der Regen. Nacht-Autoscheibe, kaltes Blau und Neon, 16:9, 768P, 10 Sekunden, ratio: "16:9".

Dies ist die einzige der drei Vorlagen ohne Subjektaktion, und sie lehrt am meisten über Negativangaben. Da nichts auf dem Bildschirm passiert, greift H3 zu einer Musikuntermalung, es sei denn, Sie verbieten es ausdrücklich. Es ist auch der Clip, der mit Abstand das breiteste Stereofeld zurückbrachte, ohne dass man darum gebeten hat. Schlaforientierte Inhalte wünschen Länge, daher läuft dieser nahe am oberen Ende des sinnvollen Dauerbereichs.

plaintext
1Makroaufnahme durch die Innenseite einer Autoscheibe bei Nacht, starker Regen läuft
2an der Außenseite des Glases herunter. Einzelne Tropfen treffen auf, zögern, ziehen
3dann nach unten und verschmelzen. Jenseits des Glases brechen unscharfe Neonreklamen
4in kaltes Blau und Magenta-Bokeh. Keine Scheibenwischer, keine Menschen, keine
5Bewegung im Auto. Kamera fixiert, eine durchgehende Einstellung, geringe Schärfentiefe,
6keine Schnitte.
7
8Audio: ASMR, close-mic an der Außenseite des Glases, Kabine leicht gedämpft.
9Ein stetiges, gleichmäßiges Regenbett mit deutlich getrennten einzelnen Tropfentreffern
10auf dem Glas, plus ein leises entferntes Zischen von Reifen auf nasser Straße.
11Keine Musik, kein Donner, keine Stimme, keine Erzählung, kein Scheibenwischergeräusch.

bUKr5V6wbdM

Vorlage 3, $1,00. Zehn Sekunden reine Atmosphäre, kein Soundtrack, weil der Prompt einen verboten hat. Generiert mit minimax/h3/text-to-video.

Was ein MiniMax H3 ASMR-Video tatsächlich kostet

Hier ist die Rechnung für diesen Artikel, keine Schätzung.

PostenAnzahlAbgerechnet
GPT Image 2 Basisbild, high, 2048x11521$0,17
2K Finale, 5s, image-to-video1$0,70
768P Entwurf, 5s, image-to-video1$0,50
768P reference-to-video, 5s1$0,50
Vorlagen-Clips bei 768P, 6s + 8s + 10s3$2,40
Abgelehnte Referenzanfragen2$0,00
Gesamt $4,27

Sechs veröffentlichungsfähige Clips und ein Basisbild. Skalieren Sie es auf einen Zeitplan: Ein 8-Sekunden-Vertikalclip pro Tag bei 768P kostet $0,80, also etwa $24 pro Monat für einen gesichtslosen Account, der täglich postet, bevor Sie eine Minute in einem Editor verbringen.

Zwei Abrechnungshinweise. Der angegebene Preis von $0,009 für GPT Image 2 ist ein Token-Stufen-Mindestpreis; ein High-Quality-2048x1152-Render liegt bei $0,1745, fast zwanzigmal so viel, also budgetieren Sie basierend auf der Stufe, die Sie tatsächlich verwenden. Und das price-Feld von H3 wird mit Verzögerung nachgefüllt: Pollen Sie, bis status completed ist, und es ist oft noch undefined. Pollen Sie die Vorhersage-ID einen Moment später erneut, um den tatsächlichen Betrag zu erhalten. Dieser zweite Poll ist die einzige Möglichkeit, eine Rechnung wie diese zu erstellen, anstatt eine Schätzung.

Eine ehrliche Anmerkung zu ASMR-Audio und Rechten

Laden Sie keine ASMR-Aufnahme einer anderen Person als refers-Audiodatei hoch. Die Referenz überträgt tatsächlich die Klangfarbe in die Ausgabe, und das Durchlaufen einer Aufnahme durch ein Modell ändert nichts an den Eigentumsverhältnissen. Die hier verwendete Referenz ist CC BY 4.0 und oben gekennzeichnet, was etwa zwei Minuten dauerte.

Bauen Sie ASMR nicht um die erkennbare Stimme einer realen Person herum auf. Jede Vorlage in diesem Artikel ist bewusst stimmlos, was sowohl die Genre-Konvention als auch der unkomplizierteste Weg ist.

Der Aufruf von H3 über eine API wird nicht von der Community-Lizenz beeinflusst, die an die offenen Gewichte gebunden ist. Diese Lizenz, die das Selbst-Hosten abdeckt, schließt derzeit die EU, Großbritannien, Korea und die USA aus, und für diese Gebiete ist ein formeller Lizenzierungskanal geöffnet. Wissenswert, aber kein Grund zur Sorge, wenn Sie den Endpunkt aufrufen.

MiniMax H3 ASMR-Video: Häufig gestellte Fragen

Erzeugt ein MiniMax H3 ASMR-Video seinen eigenen Ton, oder füge ich ihn nachträglich hinzu?

Das Modell erzeugt ihn. Bild und Ton stammen aus demselben Durchlauf: 24 fps-Video mit einer AAC-Stereospur bei 32 kHz in der gelieferten Datei. Es gibt keinen separaten Audio-Schritt, keine Soundbibliothek und keine Ausrichtungsarbeit, was der gesamte Grund ist, warum dieser Endpunkt speziell für ASMR interessant ist.

Nicht durch Aufforderung. Ich habe explizite Kanalanweisungen in den Prompt geschrieben und das Ergebnis gemessen: Korrelation 0,97 zwischen den Kanälen und ein maximaler Pegelunterschied von 1,9 dB in einem Viertelsekunden-Fenster, was überhaupt kein Schwenken ist. Die Spur ist wirklich Stereo, und diffuse Inhalte wie Regen kommen mit einem breiten Feld zurück, aber diskrete Einschläge bleiben unabhängig von der Formulierung zentriert. Wenn Ihr Format einen harten Schwenker benötigt, erledigen Sie das in der Nachbearbeitung.

Kann ich meine eigene Aufnahme als MiniMax H3 ASMR-Video-Referenz hochladen?

Ja, über reference-to-video, das bis zu 3 Audio-Referenzen zusammen mit bis zu 9 Bildern und 3 Videos akzeptiert. Audio kann nicht allein eingereicht werden, also kombinieren Sie es mit mindestens einem Bild oder Video. Das Audio muss außerdem zwischen 2 und 15 Sekunden lang sein, und das Format wird überprüft: Ein .wav-Payload funktionierte, während ein audio/mpeg-Payload abgelehnt wurde. Abgelehnte Anfragen werden nicht berechnet.

Ist das Audio eines 768P MiniMax H3 ASMR-Videos schlechter als bei 2K?

Nein. Beide Stufen liefern die gleiche AAC-Stereo-32-kHz-Spezifikation. Nur das Bild ändert sich, und zwar erheblich: 16:9 kommt als 1344x768 bei 768P zurück gegenüber 2560x1440 bei 2K. Da das kreative Urteil bei ASMR ein Hörurteil ist, entwerfen Sie mit $0,10/s und führen Sie Finale mit $0,14/s erneut aus. Denken Sie nur daran, dass der 2K-Durchlauf eine neue Aufnahme ist, kein Hochskalieren des Entwurfs.

Wie lang sollte ein MiniMax H3 ASMR-Video sein und welches Seitenverhältnis?

Die Dauer akzeptiert jede ganze Sekunde von 4 bis 15. Schneide- und Kauclips funktionieren bei 5 bis 8 Sekunden, da der Lohn ein Ereignis ist; schlaforientierte Atmosphäre wünscht 10 oder mehr. Für Shorts, Reels und TikTok verwenden Sie 9:16, und denken Sie daran, dass text-to-video erfordert, dass ratio explizit gesetzt wird, und adaptive ablehnt. Bei image-to-video bestimmt das erste Bild die Form für Sie.

Wie viel kostet ein MiniMax H3 ASMR-Video?

Ein 5-Sekunden-Clip kostet $0,50 bei 768P und $0,70 bei 2K. Ein 8-Sekunden-Vertikalclip bei 768P kostet $0,80. Wenn Sie einen solchen pro Tag posten, sind das etwa $24 pro Monat an Rechenleistung, was die Zahl ist, die sich mit den 20 Minuten vergleichen lässt, die ein Editor pro Clip für den zusammengesetzten Workflow bräuchte.

Warum hat mein MiniMax H3 ASMR-Video Hintergrundmusik, die ich nie verlangt habe?

Weil Sie sie nicht verboten haben. Die meisten Videos in den Trainingsdaten eines Modells haben eine Musikuntermalung, daher ist das Standardverhalten, eine hinzuzufügen, besonders wenn nichts auf dem Bildschirm passiert. Setzen Sie die Negativangaben im Audio-Teil des Prompts explizit: no music, no voice, no narration, no room reverb, no ambience bed. Atmosphären-Vorlagen benötigen dies mehr als aktionsorientierte.

Neueste Modelle

Eine API für alle Media-KI.

Alle Modelle erkunden