
Ein nächtlicher Colorgrading-Raum, sechs Monitore zeigen sechs verschiedene Aufnahmen derselben silberhaarigen Sängerin. Sechs Aufnahmen, eine Künstlerin, ein Song. Generiert mit openai/gpt-image-2/text-to-image .
Suno-Nutzer generieren täglich etwa 7 Millionen Songs, das entspricht grob einem vollständigen Spotify-Katalog alle zwei Wochen (TechCrunch, Februar 2026). Fast keiner dieser Songs wird jemals ein Bild haben. Nicht, weil das Bild unmöglich ist, sondern weil der traditionelle Weg durch vier Tools führt: Standbilder generieren, animieren, einen separaten Lip-Sync-Durchlauf und dann alles im Schnitt korrigieren. Bei jedem Schritt gehen das Gesicht, die Kleidung oder der Beat verloren.
Also habe ich die Schritte übersprungen. Ich habe einen 8-Sekunden-Ausschnitt eines Refrains direkt in den Referenzslot eines Videomodells gelegt und auf „Starten“ gedrückt. Es hat mir nichts für das Audio berechnet.
Dann habe ich die fertige mp4 auseinandergenommen, um die eine Frage zu beantworten, die niemand im Internet klar beantwortet: Ist der Sound, der aus dem Modell kommt, mein Song, oder etwas, das es sich ausgedacht hat und nur ähnlich klingt? Ich habe es gemessen. Die Antwort ist nicht das, was ich erwartet habe, und sie ändert, wie du das Ding schneiden solltest.
Wichtige Erkenntnisse
- Referenz-Audio ist kostenlos. MiniMax H3 berechnet nur die Ausgabesekunden. Meine vier 8-Sekunden-Referenzausschnitte haben $0,00 zur Rechnung hinzugefügt. Referenz-Video ist das Teure.
- 15 Sekunden sind eine Obergrenze pro Generation, nicht pro Projekt. Schneide den Song, schieße einen Ausschnitt pro Einstellung, verketten. Mein 32-Sekunden-Schnitt besteht aus vier Generationen.
- Schreibe den Hook mit 120 BPM. Ein Takt ist genau 2,000 Sekunden, daher landen H3s ganzzahlige
duration-Werte ohne manuelles Nachjustieren auf den Taktschlägen. 8s = 4 Takte.- Das Ausgabe-Audio ist dein Track, samplegenau. Ich habe eine Wellenformkorrelation von 0,892 bei Nullverzögerung zwischen meinem Eingabeausschnitt und der von H3 gelieferten Stereomischung gemessen. Es wird nicht neu generiert. Du solltest dennoch den Master für den finalen Cut darüberlegen, aus einem anderen Grund (siehe unten).
- Tatsächliche Gesamtausgaben: $7,53 über neun Generationen, einschließlich der Fehlschläge. Die vier Aufnahmen, die es in den finalen Cut geschafft haben, plus der Song und das Basisbild, kosteten $4,80.
Das MiniMax H3 Musikvideo, das ich aus einem 32-Sekunden-Hook geschnitten habe
Ton an. Dies sind vier separate Generationen, ohne Übergänge aneinandergereiht, mit dem ursprünglichen 32-Sekunden-Master darübergelegt.
TfrOvWHf4ys
„MIRA", 32 Sekunden, 2560x1440, 24 fps. Vier minimax/h3/reference-to-video -Generationen zu je 8 Sekunden, $1,12 pro Aufnahme. Der Song wurde als Referenz-Audio eingegeben und kostete $0,00.
Vier Generationen, vier völlig unterschiedliche Lichtwelten, ein Gesicht. Nichts wurde dazwischen nachbearbeitet.

Vier Frames aus den vier Aufnahmen, die dieselbe Sängerin auf einem Neon-Dach, einer Wüstenautobahn, in einem weißen Studio und in einem schwarzen Wassertank zeigen_Ein_ Frame aus jeder gelieferten Clip. Gleiches Haar, gleiches Mesh-Top, gleicher roter LED-Choker bei Regen, tiefer Sonne, flachem High-Key und unter Wasser.
Warum die meisten MiniMax H3 Musikvideo-Versuche nach der zweiten Sechzehn scheitern
Drei Fehlermodi, alle vermeidbar.
Eins: Die 15 Sekunden als Projektgrenze behandeln. H3 begrenzt eine einzelne Generation auf 15 Sekunden. Leute lesen das, schließen daraus „keine Musikvideos" und geben auf. Aber ein Musikvideo war nie eine einzige Einstellung. Ein echtes schneidet ohnehin alle 4 bis 8 Sekunden. Die Grenze zwingt dich nur dazu, das zu tun, was ein Editor ohnehin getan hätte.
Zwei: Rhythmus in Worten beschreiben. „Schwungvoll, energiegeladen, tanzen zum Beat" gibt dem Modell nichts, woran es sich festhalten kann. Es erfindet ein Tempo, und deine Schnittpunkte landen für immer einen halben Beat daneben. Wenn du die tatsächliche Audiospur übergibst, entfällt das Raten.
Drei: Die Kleidung treiben lassen. Jede Einstellung benötigt dasselbe Referenzbild und dieselbe Kleidungsbeschreibung, wortwörtlich. Ändere „schwarzes Mesh-Top" zwischen den Einstellungen in „dunkles Mesh-Shirt" und du bekommst eine andere Person.
So viel kosten dich die beiden Routen tatsächlich:
| Traditionelle Vier-Tool-Kette | Einzelner H3-Referenzaufruf | |
|---|---|---|
| Tools pro Einstellung | Bildmodell, Videomodell, Lip-Sync-Tool, NLE | Ein Endpunkt, dann ein NLE am Ende |
| Manuelle Schritte pro Einstellung | 4 Übergaben, 3 Dateiexporte | 1 Absenden |
| Was die Figur hält | Manuelles erneutes Prompten und Glück | Ein Referenzbild, unverändert wiederverwendet |
| Bild und Ton | Getrennt gerendert, später ausgerichtet | Im selben Durchgang generiert, 32 kHz Stereo |
| Kosten pro 8-Sekunden-Einstellung | Vier separate Zähler | $1,12 bei 2K, $0,80 bei 768P |
Um der alten Route gerecht zu werden: Sie ist keine Fantasie. Der japanische Creator Arata Fukoe hat mit einem vollständig KI-generierten Musikvideo eine Project Odyssey Bronze gewonnen, und sowohl Queen als auch Linkin Park haben offizielle KI-gestützte Videos veröffentlicht. Diese Ketten liefen jedoch durch vier oder fünf Tools, genau das, wofür ein unabhängiger Künstler mit einem Song keine Zeit hat.
Was Referenz-Audio einem MiniMax H3 Musikvideo tatsächlich bringt
Dies ist der Teil, den es wert ist zu verstehen, bevor du etwas ausgibst.
H3 generiert Bild und Ton in einem Durchgang, anstatt Audio auf fertige Frames zu legen. Wenn du einen Referenz-Track übergibst, ist der Track keine Stimmungsnotiz. Ich habe meinen Eingabeausschnitt mit dem Audiostream in der gelieferten mp4 verglichen, auf Wellenformebene, in einem 8-kHz-Mono-Downmix:
- Hüllkurvenkorrelation: 0,956 bei Nullverzögerung
- Rohwellenformkorrelation über ein 2-Sekunden-Fenster: 0,892 bei Null-Sample-Offset
Das ist kein Modell, das einen ähnlichen Song reproduziert. Das ist deine Datei, samplegenau, mit der durch das Prompt angefragten Atmosphäre darübergelegt und einer AAC-Neuencodierung. Zum Vergleich: Die gleiche Messung gegen einen Kontrolldurchlauf, der ohne Referenz-Audio generiert wurde, ergab 0,26, was dem Rauschboden entspricht.

Wellenform des Eingabeausschnitts oben, des von H3 gelieferten Audios unten, ausgerichtet bei Nullversatz_Oben: die 8-Sekunden-mp3, die ich hochgeladen habe. Unten: der Audiostream in der mp4, die H3 zurückgegeben hat. Gleiche Peaks, gleiche Positionen, kein Versatz._
Die Eingabebeschränkungen sind streng und werden zum Zeitpunkt des Absendens durchgesetzt, nicht stillschweigend:
| Referenzeingabe | Grenze | Abgerechnet |
|---|---|---|
| Bilder | bis zu 9 | kostenlos auf Atlas Cloud H3-Endpunkten |
| Videos | bis zu 3, jedes 2-15s | zum Ausgabesatz abgerechnet |
| Audio | bis zu 3, jedes 2-15s, insgesamt 15s über alle Clips | $0,00 |
| Audio allein | abgelehnt, benötigt mindestens ein Bild oder Video | n/a |
Ich habe die Gesamtaudio-Obergrenze absichtlich getestet, indem ich drei 8-Sekunden-Ausschnitte in einem Aufruf gesendet habe. Es schlug nach 5,8 Sekunden mit invalid params, total audio duration 24138 ms exceeds 15000 ms fehl und wurde nicht berechnet. Gute Nachricht: H3 verwirft die zusätzliche Datei nicht stillschweigend und berechnet dir trotzdem etwas.
Noch eine Falle, auf die ich zuvor gestoßen bin. Wenn du Audio als base64-Daten-URL übergibst, bestimmt der MIME-Typ die Erweiterung, die die API ableitet. data:audio/mpeg wird mit audio format ".mpeg" not allowed abgelehnt. data:audio/mp3 kommt problemlos durch. Vier Absendungen sind daran gestorben, bevor ich es bemerkt habe, alle kostenlos.
Der MiniMax H3 Musikvideo-Workflow und was jede Sekunde kostet
Alles unten läuft über einen API-Schlüssel auf Atlas Cloud, wo ich alles ausgeführt und abgerechnet habe. Drei Modelle, ein Browser-Tab.
| Schritt | Modell | Was es tut | Tatsächlich berechneter Preis |
|---|---|---|---|
| Den Hook schreiben | minimax/music-2.6 | Vollständiger Song aus einem Style-Prompt plus Text, mp3 bis ~5 Min | $0,15 pro Song, pauschal |
| Den Künstler festlegen | openai/gpt-image-2/text-to-image | Ein Basis-Frame, den jede Einstellung erbt | $0,1745 bei Qualität high, 2048x1152 |
| Jede Einstellung aufnehmen | minimax/h3/reference-to-video | Bild plus Audio rein, beat-locked Clip mit Stereo-Sound raus | $0,14/s bei 2K, $0,10/s bei 768P. Audioeingabe $0,00 |
Zwei Anmerkungen zu dieser Tabelle, denn die aufgeführten Nummern lügen in beide Richtungen. GPT Image 2 zeigt einen $0,009-Boden im Katalog; das ist die unterste Token-Stufe, und ein echter 2048x1152 high-Render kostet $0,1745. H3s Katalogeintrag zeigt $0,10, was nur die 768P-Stufe ist; meine 8-Sekunden-2K-Jobs haben jeweils genau $1,12 gekostet, also $0,14 pro Sekunde.
Wenn du eine First-Frame-Sperre anstelle von Subjektreferenzen möchtest, gelten für [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) dieselben Sätze, und [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) deckt reine Prompt-Aufnahmen ab.
Die Korrektur, die es wert ist, gemacht zu werden: Eine frühere Version dieses Plans ging davon aus, dass du deinen eigenen Song mitbringen musstest, weil es keinen Ganz-Song-Generator auf der Plattform gab. Jetzt gibt es einen. minimax/music-2.6 schreibt den Track, sodass die gesamte Kette, Song inklusive, an einem Ort läuft.
Wie man ein MiniMax H3 Musikvideo erstellt, Schritt für Schritt
Schritt 1: Einen 120 BPM Hook schreiben und in Einstellungsausschnitte schneiden
Fordere explizit 120 BPM an. Bei 120 BPM ist ein Takt genau 2,000 Sekunden, sodass H3s ganzzahlige duration-Enum-Werte automatisch auf Taktschlägen landen: 4s = 2 Takte, 6s = 3 Takte, 8s = 4 Takte, 10s = 5 Takte. Deine Schnitte landen auf dem Downbeat, ohne dass du einen einzigen Marker berühren musst.
Modell: minimax/music-2.6. Einstellungen: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.
Style-Prompt:
plaintext1Synthpop bei genau 120 BPM, geradlinige Four-on-the-Floor-Kick, helle analoge 2Seitenketten-Pads, saubere weibliche Lead-Vocals, die vorne im Mix liegen, breiter 3Stereo-Chorus, kein Rap, anhaltende offene Vokale, cineastisch und leicht 4melancholisch, radioreifer Master
Text:
plaintext1[Chorus] 2Hold the line, hold the light 3I am running out of night 4Say my name into the rain 5And I will burn again
Es gab einen 70-Sekunden-Track in 75 Sekunden für $0,15 zurück. Ich habe dann das Tempo überprüft, anstatt es zu glauben, indem ich eine Onset-Novelty-Autokorrelation über die Datei laufen ließ. Die stärkste Verzögerung kam bei genau 0,500 s zurück, was 120 BPM entspricht, und das Beat-Raster beginnt bei 0,24 s in der decodierten Datei, nicht bei Null. Dieser Versatz ist wichtig: Schneide ab 0,24 und jeder Ausschnitt beginnt auf einem Downbeat.
plaintext1# 32-Sekunden-Master, beginnend auf dem Downbeat bei 0,24s 2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3 3 4# vier 8-Sekunden-Ausschnitte, einer pro Einstellung, jeweils 4 Takte und deutlich unter der 15s-Grenze 5for i in 0 8 16 24; do 6 ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3 7done
Wenn du bereits deinen eigenen Track hast, überspringe diesen Schritt ganz. Das ist der Normalfall und der günstigste.
Schritt 2: Den Künstler mit einem GPT Image 2 Basis-Frame festlegen
Jede Einstellung referenziert diese einzelne Datei. Was hier falsch ist, ist viermal falsch, also gib die $0,17 aus und schau es dir richtig an.
Modell: openai/gpt-image-2/text-to-image. Einstellungen: Qualität high , Größe 2048x1152 (16:9).
plaintext1Cineastisches Musikvideo-Standbild, Hüftporträt. Eine 25-jährige ostasiatische 2Synthpop-Sängerin mit silberweißem, kurz geschnittenem Haar und einem geraden 3Pony, einem matten schwarzen Mesh-Top, einem dünnen roten LED-Choker, der gegen 4ihr Schlüsselbein leuchtet, und einer einzelnen silbernen Ohrkrempe. Sie steht auf 5einem regennassen Dach in der Nacht und hält ein altes Chrom-Handmikrofon dicht 6vor ihrem Mund. Hinter ihr, unscharfe magenta- und cyanfarbene Neonbeschriftung, 7feiner Regen, der von einem harten Gegenlicht eingefangen wird, Dampf, der aus 8einem Lüftungsschacht aufsteigt. Auf 35mm anamorphotischem Film aufgenommen, 9geringe Schärfentiefe, Teal-und-Magenta-Gradierung, sichtbares Filmkorn. Ihr 10Gesicht ist scharf und gleichmäßig von einem weichen Key von links der Kamera 11ausgeleuchtet. Kein Text irgendwo im Frame.

Das generierte Basis-Frame: Silberhaarige Sängerin mit Chrom-Mikrofon auf einem regennassen Neon-Dach_Das_ Basis-Frame, das jede spätere Einstellung erbt. Generiert mit openai/gpt-image-2/text-to-image , Qualität high, 2048x1152, berechnet $0,1745.

GPT Image 2, das genau dieses Prompt im Atlas Cloud Playground ausführt, mit dem fertigen Frame im Ausgabefeld
Dasselbe Prompt im Playground: Größe 16:9 bei 2048x1152, Qualität high, und der Run-Button mit $0,1745, was die API mir tatsächlich berechnet hat. Die $0,009 im Katalog sind die unterste Token-Stufe, nicht diese. Gleiches Prompt, anderer Seed, daher ist dieser Render nicht die exakte Datei oben.
Die Kleidungsbegriffe in diesem Prompt (silberweißes, kurz geschnittenes Haar, mattes schwarzes Mesh-Top, roter LED-Choker, silberne Ohrkrempe) werden in jedem folgenden Prompt wörtlich wiederverwendet. Diese Wiederholung ist der gesamte Konsistenzmechanismus. Paraphrasiere sie nicht.
Schritt 3: Die erste MiniMax H3 Musikvideo-Einstellung mit kostenlosem Referenz-Audio ausführen
Modell: minimax/h3/reference-to-video. Einstellungen: refers = das Basis-Frame plus slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.
Setze ratio explizit. Der Playground-Standard ist adaptive, und der Endpunkt ist viel zufriedener, wenn du die gewünschte Form benennst.
plaintext1Musikvideo-Einstellung. Die Frau im Referenzbild singt den Referenz-Track direkt 2in die Linse auf dem nassen Neon-Dach, das Chrom-Mikrofon an ihrem Mund. Sie 3setzt die erste Zeile hart auf dem Downbeat, Blick auf die Kamera fixiert, dann 4neigt sie den Kopf auf der anhaltenden Note zurück. Langsamer Push-In von der 5Hüfte zu einer engen Nahaufnahme über die acht Sekunden, Handheld-Mikro-Drift, 6Regenstreifen, die das harte Gegenlicht kreuzen. Ihre Mundbewegungen folgen genau 7den gesungenen Vokalen des Referenz-Audios, sie singt, spricht nicht. Identisches 8silberweißes, kurz geschnittenes Haar, mattes schwarzes Mesh-Top und glühender 9roter LED-Choker wie im Referenzbild. Klanglandschaft: der Referenz-Track in 10Stereo, plus leichter Regen und ein entferntes Stadtbrummen leise im Mix.
7sPeYEe-xII
Einstellung 1, Ton an. 2560x1440, genau 8,00 s, 24 fps, 32 kHz Stereo. 345 Sekunden vom Absenden bis zur Datei, berechnet $1,12. Sieh dir das Zurückneigen des Kopfes auf der anhaltenden Note bei etwa 5 s an.

Der Reference-to-Video-Playground mit dem Basis-Frame und dem Audio-Ausschnitt geladen und dem fertigen Clip im Ausgabefeld
Referenzmaterialien zeigt 2/9: slice-0.mp3 in einem Slot, das Basis-Frame im anderen. Auflösung 2K, Dauer 8, und der Run-Button mit $1,12, was genau 8 x $0,14 entspricht. Beachte das Dropdown für das Seitenverhältnis auf adaptive , was die Seiteneinstellung ist; meine API-Aufrufe setzten ratio explizit auf 16:9.
Eine Zahl, die es wert ist, notiert zu werden: duration: 8 lieferte einen Container von genau 8,00 Sekunden. duration: 4 lieferte 4,46 Sekunden. Wenn du auf Taktschlägen verketten willst, bleib bei den Dauern, die exakt zurückkommen.
Schritt 4: Drei weitere Welten schießen, ohne das Gesicht zu verlieren
Gleiches Basis-Frame, gleicher Kleidungssatz, nächster Audio-Ausschnitt. Alles andere ändert sich.
4a. Wüstenautobahn zur goldenen Stunde. refers = Basis-Frame + slice-8.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Musikvideo-Einstellung. Dieselbe Frau aus dem Referenzbild steht auf der 2Mittellinie einer leeren Wüstenautobahn zur goldenen Stunde, ohne Mikrofon, eine 3offene indigoblaue Denim-Jacke über demselben matten schwarzen Mesh-Top, der rote 4LED-Choker noch leuchtend. Sie formt den Refrain des Referenz-Tracks mit den 5Lippen in den Wind, während die Kamera rückwärts tief über den Asphalt fährt. 6Hitzeflimmern über der Straße, aufwirbelnder Staub, ihr Schatten dehnt sich lang 7Richtung Linse, ein anamorphotischer Lens Flare kreuzt auf halber Strecke. Haar, 8Gesicht und Kleidung identisch mit dem Referenzbild. Klanglandschaft: der 9Referenz-Track über offenem Wüstenwind, weit und luftig.
4XEki-v2vCU
Einstellung 2, Ton an. Gleiches Gesicht, entgegengesetzte Farbtemperatur, und der Referenz-Track neu gemischt unter offenem Wind. 332 s, $1,12.
4b. Weißer Infinity-Cove. refers = Basis-Frame + slice-16.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Musikvideo-Einstellung. Dieselbe Frau aus dem Referenzbild in einem rein weißen 2Infinity-Cove-Studio unter flachem High-Key-Licht ohne Schatten, trägt einen 3glänzenden roten Vinyl-Trenchcoat über demselben matten schwarzen Mesh-Top, der 4rote LED-Choker am Kragen sichtbar. Sie tanzt vier Takte zum Referenz-Track, das 5silberweiße Haar peitscht bei jeder Drehung. Feststehende Weitwinkelaufnahme, 6dann ein harter Snap-Zoom zur Halbtotalen auf den zweiten Downbeat. Kleine weiße 7Papierquadrate fallen wie Konfetti durch die letzten zwei Sekunden. Gesicht und 8Haar identisch mit dem Referenzbild. Klanglandschaft: der Referenz-Track, trocken 9und nah, plus das Quietschen von Schuhen auf dem Studioboden.
VAyqdkVpnm0
Einstellung 3, Ton an. Flaches, schattenloses Licht ist der schwierigste Ort, um einen Gesichtsaustausch zu verstecken, und es hat gehalten . 8,00 s, $1,12.
4c. Unterwasser-B-Roll, ohne Lippen-Sync. refers = Basis-Frame + slice-24.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Musikvideo-Einstellung. Dieselbe Frau aus dem Referenzbild schwebt unter Wasser 2in einem schwarzen Tank, das silberweiße Haar schwimmt um sie herum, der rote 3LED-Choker leuchtet durch das Wasser, das schwarze Mesh-Top bauscht sich langsam. 4Ein harter Lichtstrahl von direkt oben; Blasen steigen in Zeitlupe an der Linse 5vorbei. Sie öffnet die Augen auf dem Downbeat und streckt eine Hand zur 6Oberfläche. Sie singt nicht und ihr Mund bleibt geschlossen. Die Kamera dreht 7sich dreißig Grad um sie herum während der Einstellung. Gesicht identisch mit dem 8Referenzbild. Klanglandschaft: der Referenz-Track, von über der Oberfläche gehört, 9gedämpft und tiefpassgefiltert, mit Blasentransienten.
fibdweUMRpY
Einstellung 4, Ton an. Die Anweisung „sie singt nicht und ihr Mund bleibt geschlossen" wurde befolgt, was der nützliche Teil ist: Das Referenz-Audio steuert das Timing, nicht eine zwingende Performance. 329 s, $1,12.
Schritt 5: Den Kontrolldurchlauf ausführen, mit leerem Audio-Slot
Gleiches Prompt wie Schritt 3, Wort für Wort. Die einzige Änderung: refers enthält das Bild und nichts anderes. 768P, duration: 8.
Dieser eine Clip erklärt den gesamten Mechanismus besser als jeder Absatz. Höre ihn dir gegen Schritt 3 an.
FAoPplGmKJc
Der Kontrolldurchlauf. Identisches Prompt, kein Referenz-Audio, 1344x768, 8,00 s, 200 s, $0,80. H3 hat seinen eigenen Soundtrack geschrieben, und die Performance ist generisches „jemand singt" anstatt dieser Worte.
Gemessen gegen meinen Master erreicht das Audio des Kontrolldurchlaufs eine Hüllkurvenkorrelation von 0,26. Schritt 3 erreicht 0,956. Diese Lücke ist das, was der kostenlose Audio-Slot dir bringt.
Schritt 6: Den Lip-Sync absichtlich brechen
Jedes Modell hat eine Silbendecke. Deine zu finden, kostet $0,40.
Ich habe einen separaten Double-Time-Rap-Track generiert (minimax/music-2.6 nochmal, $0,15), einen 4-Sekunden-Ausschnitt mit etwa sechs Silben pro Sekunde geschnitten und ihn in dasselbe Dach-Setup bei 768P, duration: 4 eingespeist.
plaintext1Musikvideo-Einstellung. Die Frau im Referenzbild rappt den Referenz-Track direkt 2in die Linse auf dem nassen Neon-Dach, das Chrom-Mikrofon an ihrem Mund, und 3liefert jede Silbe der schnellen Double-Time-Strophe. Feststehende 4Halbnahaufnahme, leichter Handheld-Drift, Regenstreifen im harten Gegenlicht. 5Ihre Mundbewegungen folgen genau den gerappten Silben des Referenz-Audios. 6Identisches silberweißes, kurz geschnittenes Haar, mattes schwarzes Mesh-Top und 7glühender roter LED-Choker wie im Referenzbild. Klanglandschaft: der Referenz-Track 8in Stereo plus leichter Regen.
jiQVCjOCbKg
Der Belastungstest, Ton an. 1344x768, 4,46 s, 192 s, $0,40. Der Mund bleibt beschäftigt und bleibt im Takt, aber er hört auf, einzelne Konsonanten aufzulösen und verfällt in einen sich wiederholenden Öffnen-Schließen-Zyklus. Gesungene Zeilen erhalten unterschiedliche Vokalformen; dies nicht.
Meine ehrliche Einschätzung aus den gelieferten Dateien: Anhaltende gesungene Vokale sind, wo H3s Mundarbeit wirklich überzeugend ist, und dichte gerappte Konsonanten sind, wo sie zu plausibler Bewegung degradiert. Plane deine Nahaufnahmen um die gesungenen Zeilen herum und lege die schnellen Bars auf B-Roll. Weitere Details zum Unterschied zwischen Sprache und Gesang findest du in der Lip-Sync- und Audio-Analyse.
Schritt 7: Verketten, stummschalten und den Master über dein MiniMax H3 Musikvideo legen
Vier Clips von genau 8,00 Sekunden ergeben genau 32,00 Sekunden, das sind 16 Takte bei 120 BPM. Kein Trimmen.
plaintext1# 1. Audio jedes Clips entfernen 2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do 3 ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4 4done 5 6# 2. in Takt-Reihenfolge verketten (4 x 8s = 32s = 16 Takte @ 120 BPM) 7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt 8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4 9 10# 3. den Original-Master darüberlegen 11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4
Warum stummschalten, wenn das Modell dir bereits deinen Track zurückgibt? Weil die Stereomischung jedes Clips die Atmosphäre trägt, die das Prompt dieser Einstellung verlangt hat: Regen in Einstellung 1, Wüstenwind in Einstellung 2, einen Tiefpass-Unterwasserfilter in Einstellung 4. Lieblich pro Einstellung, inkohärent über einen Schnitt hinweg. Der Master gibt dir eine durchgehende Mischung mit voller Bitrate und ohne Neuencodierung pro Einstellung. H3 liefert die Performance-Synchronisation. Dein Master liefert den Song.
Vier Variationen des MiniMax H3 Musikvideo-Rezepts
Vertikale Veröffentlichungsschnitte. Setze ratio: 9:16 und du erhältst einen Spotify Canvas oder einen Shorts-Ausschnitt aus demselben Basis-Frame und denselben Ausschnitten. Es kam als echte 768x1344 zurück, also bleibt im Gegensatz zum Seitenverhältnis-Dropdown im Playground der API-ratio-Wert tatsächlich erhalten. Canvas-Loops sind standardmäßig stumm, also wird dieser als GIF ausgeliefert.

Ein vertikaler 9:16-Loop-Schnitt derselben Künstlerin auf dem Neon-Dach_Gleiches Basis-Frame, gleicher Referenz-Ausschnitt,_ ratio: 9:16 bei 768P für $0,80. Eine ehrliche Falte: Ich habe um „nicht singen" gebeten und trotzdem Gesang bekommen. Mit einem Vocal im Referenz-Slot gewinnt das Audio das Argument. Wenn du einen stummen Darsteller möchtest, füttere einen Instrumental-Ausschnitt.
Referenzvideo anstelle von Referenzbild. Du kannst H3 bis zu drei Referenz-Videoclips übergeben, um Bewegung und Bildausschnitt zu transportieren, anstatt sie zu beschreiben. Achte auf den Zähler: Referenz-Video wird zum Ausgabesatz abgerechnet, während Referenz-Audio kostenlos ist. Diese Asymmetrie ist die nützlichste Preisinformation auf diesem Endpunkt.
Reine B-Roll-Visualiser. Verzichte ganz auf den Darsteller. Füttere ein Produktfoto, ein Albumcover-Objekt oder eine Texturplatte plus den Audio-Ausschnitt und fordere nur Kamerabewegung an. Kein Gesicht zu halten, kein Lip-Sync zu brechen, und du kannst das Ganze bei 768P schießen.
Günstig entwerfen, teuer fertigstellen. 768P kostet $0,10/s gegenüber 2Ks $0,14/s, und beide kommen mit identischem 32 kHz Stereo zurück, also ist die Performance, die du beurteilst, dieselbe. Die Ersparnis liegt nicht in den Keepers, sondern in den Ablehnungen: Jeder fehlgeschlagene 8-Sekunden-Take kostet $0,80 statt $1,12. Rolle bei 768P, bis der Take richtig ist, und zahle dann einmal $1,12. Bei einer Einstellung, die drei Versuche benötigt, sind das $2,72 statt $3,36. Mehr zum Stufenunterschied im 768P-gegen-2K-Vergleich und darüber, wie weit ein einzelner Clip reichen kann, im Clip-Längen-Leitfaden.
Was ein vollständiges MiniMax H3 Musikvideo tatsächlich gekostet hat
Jede Zeile unten ist ein echter abgerechneter Betrag, der nach Abschluss aus dem Vorhersagedatensatz gezogen wurde, kein Listenpreis.
| Posten | Modell und Einstellungen | Abgerechnet |
|---|---|---|
| Hook, 70 s Song | minimax/music-2.6, mp3 44,1 kHz | $0,15 |
| Künstler-Basis-Frame | openai/gpt-image-2/text-to-image, high, 2048x1152 | $0,17 |
| Einstellung 1, Neon-Dach | minimax/h3/reference-to-video, 2K, 8 s | $1,12 |
| Einstellung 2, Wüstenautobahn | same, 2K, 8 s | $1,12 |
| Einstellung 3, weißer Cove | same, 2K, 8 s | $1,12 |
| Einstellung 4, Unterwasser | same, 2K, 8 s | $1,12 |
| Zwischensumme fertiges Video | $4,80 | |
| Validierungssonde | 768P, 4 s | $0,40 |
| Kontrolldurchlauf, kein Audio | 768P, 8 s | $0,80 |
| Rap-Track für den Belastungstest | minimax/music-2.6 | $0,15 |
| Lip-Sync-Belastungstest | 768P, 4 s | $0,40 |
| Vertikaler Canvas-Schnitt | 768P, 8 s, 9:16 | $0,80 |
| Hero-Bild für diesen Artikel | openai/gpt-image-2/text-to-image, high | $0,17 |
| Über-Limit-Test, 24 s Audio | beim Absenden abgelehnt | $0,00 |
| Vier Absendungen mit falschem Audio-MIME | beim Absenden abgelehnt | $0,00 |
| Referenz-Audio, 4 x 8 s | kostenloser Input | $0,00 |
| Gesamtausgaben | $7,53 |
Das sind $9,00 pro fertiger Minute bei 2K für die Einstellungen, die es in den Schnitt geschafft haben, vor all meinen Fehlern. Wenn alles bei 768P geschossen wird, liegt dieselbe Minute bei $6,61. Eine menschliche MV-Crew bietet keinen dieser Preise.
Zwei betriebliche Hinweise, wenn du ein längeres Stück budgetierst. Absagezeitpunkt-Ablehnungen sind kostenlos, also kosten schlechte Parameter dir Zeit und sonst nichts. Und das price-Feld einer Vorhersage wird mit Verzögerung gefüllt, also poll die Request-ID erneut, nachdem die Dateien heruntergeladen sind, wenn du eine echte Rechnung und kein null haben möchtest.
Wessen Song, wessen Gesicht: Was du vor der Veröffentlichung prüfen solltest
Kurz, weil es wichtig ist und keine Predigt braucht.
Du brauchst die Rechte an dem Referenz-Track. Kostenloser Input bedeutet nicht kostenlose Freigabe. Einen kommerziell veröffentlichten Song als Referenz-Audio zu verwenden und dann das Ergebnis zu veröffentlichen, ist der schnelle Weg zu einer Abmahnung. Deine eigene Aufnahme, ein von dir in Auftrag gegebener Track oder etwas, das du generiert hast, ist in Ordnung.
Baue das Basis-Frame nicht aus dem Gesicht eines echten lebenden Künstlers. Der Konsistenzmechanismus hier ist sehr gut darin, ein Gesicht über Einstellungen hinweg zu halten, was genau der Grund ist, warum es eine schlechte Idee ist, es auf eine reale Person zu richten.
Offene Gewichte und API-Zugriff sind zwei verschiedene Lizenzen. MiniMax hat H3s Gewichte im August 2026 auf Hugging Face veröffentlicht, und seine Community-Lizenz schließt derzeit die EU, das Vereinigte Königreich, Südkorea und die USA aus, mit einem formalen Lizenzierungskanal für diese Gebiete. Diese Einschränkung betrifft das Ausführen der Gewichte selbst. Das Modell über eine gehostete API aufzurufen, ist eine Dienstleistungsbeziehung und unterstellt dich nicht der Gewichtelizenz. Es ist gut zu wissen, in welcher Situation du dich befindest, bevor du in die eine oder andere Richtung annimmst.
Für einen breiteren Überblick darüber, wo H3 im Vergleich zu den Alternativen steht, gibt es einen Seedance 2.5-Vergleich und einen Prompt-Struktur-Leitfaden. Für den Kontext, warum es die Mühe überhaupt wert ist: Auf dem Video-Editing-Leaderboard, das Modelle mit Audio bewertet, liegt H3 derzeit mit 1.126 Elo auf Platz eins, vor Gemini Omni Flash mit 1.119 und Dreamina Seedance 2.0 mit 1.027 (Artificial Analysis, geprüft am 10. August 2026). Diese Werte ändern sich mit den Stimmen, also betrachte sie als Momentaufnahme.
MiniMax H3 Musikvideo: Häufig gestellte Fragen
Kann ein MiniMax H3 Musikvideo volle drei Minuten laufen?
Nicht in einer Generation. Ein einzelner Aufruf ist auf 15 Sekunden begrenzt. Aber das ist eine Obergrenze pro Generation, nicht pro Projekt. Ein dreiminütiges Video mit 8 Sekunden pro Einstellung sind 23 Generationen, etwa $25,76 bei 2K, und jede landet auf einem Taktschlag, wenn dein Track 120 BPM hat. Schneiden, schießen, verketten, den Master darüberlegen.
Verwendet ein MiniMax H3 Musikvideo meinen tatsächlichen Song, oder regeneriert das Modell das Audio?
Es verwendet deinen tatsächlichen Song. Ich habe eine Rohwellenformkorrelation von 0,892 bei Null-Sample-Offset zwischen der 8-Sekunden-mp3, die ich hochgeladen habe, und dem Audiostream in der zurückgegebenen mp4 gemessen, mit der vom Prompt angefragten Atmosphäre darübergelegt. Ein Kontrolldurchlauf, der ohne Referenz-Audio generiert wurde, erreichte 0,26 gegen denselben Master. Du solltest dennoch deinen Master über die endgültige Verkettung legen, da jeder Clip seine eigene Atmosphäre pro Einstellung und seine eigene AAC-Codierung trägt, die einen Schnitt nicht sauber überstehen.
Kostet es extra, einen Song in ein MiniMax H3 Musikvideo zu füttern?
Nein. Meine vier 8-Sekunden-Referenzausschnitte haben $0,00 zu einer $4,48-Einstellungsrechnung hinzugefügt. Referenz-Video ist das, worauf du achten musst, da es zum Ausgabesatz abgerechnet wird. Die Grenzen sind drei Audio-Clips, 2 bis 15 Sekunden jeder, insgesamt 15 Sekunden, und Audio kann niemals die einzige Referenz sein.
Wie gut ist MiniMax H3 Lip-Sync bei Gesang im Vergleich zu Sprache?
Anhaltende gesungene Vokale sind seine Stärke: deutliche Mundformen, Halte, die zur Note passen, und das Zurückneigen des Kopfes bei einer langen Note wirkt wie eine Performance und nicht wie eine Schleife. Dichte Darbietung ist, wo es aufgibt. Mein Rap-Test mit sechs Silben pro Sekunde hielt den Takt, löste aber keine Konsonanten mehr auf und verfiel in einen sich wiederholenden Öffnen-Schließen-Zyklus. Lege die schnellen Bars auf B-Roll.
Wie behalte ich dasselbe Gesicht in jeder Einstellung eines MiniMax H3 Musikvideos?
Drei Dinge, alle langweilig. Ein Referenzbild, das in jedem Aufruf wiederverwendet wird, nie neu generiert. Dieselbe Kleidungsbeschreibung, die zwischen Prompts wörtlich kopiert wird, nicht paraphrasiert. Und eine explizite „identisch mit dem Referenzbild"-Klausel in jedem Prompt. Meine vier Einstellungen haben Regen, tiefe Sonne, flaches High-Key und Unterwasser ohne Drift überstanden.
Wie viel kostet ein MiniMax H3 Musikvideo pro fertiger Minute?
$9,00 pro fertiger Minute bei 2K, basierend auf meiner tatsächlichen Rechnung von $4,80 für einen 32-Sekunden-Schnitt. Wenn alles bei 768P geschossen wird, kostet dieselbe Minute $6,61, und 768P liefert dasselbe 32 kHz Stereo, also ist die Performance, die du beurteilst, identisch. Rolle deine Ablehnungen bei $0,80 und zahle die $1,12 nur für den Take, der den Schnitt überlebt.






