Seedance 2.5 ist jetzt live — Zuerst auf Atlas Cloud

Ich habe ein MiniMax H3 Musikvideo aus einem 32-Sekunden-Hook für $4,80\. Der Audio-Track hat mich überrascht.

Ich habe einen 32-Sekunden-Hook als kostenloses Referenzaudio in MiniMax H3 eingespeist, vier beat-lockierte Shots zurückbekommen und für 4,80 $ ein echtes MiniMax H3 Musikvideo geschnitten. Prompts und Rechnungen inbegriffen.

Ein Videoeditor an einer Konsole mit mehreren Videomonitoren

Ein nächtlicher Colorgrading-Raum, sechs Monitore zeigen sechs verschiedene Aufnahmen derselben silberhaarigen Sängerin. Sechs Aufnahmen, eine Künstlerin, ein Song. Generiert mit openai/gpt-image-2/text-to-image .

Suno-Nutzer generieren täglich etwa 7 Millionen Songs, das entspricht grob einem vollständigen Spotify-Katalog alle zwei Wochen (TechCrunch, Februar 2026). Fast keiner dieser Songs wird jemals ein Bild haben. Nicht, weil das Bild unmöglich ist, sondern weil der traditionelle Weg durch vier Tools führt: Standbilder generieren, animieren, einen separaten Lip-Sync-Durchlauf und dann alles im Schnitt korrigieren. Bei jedem Schritt gehen das Gesicht, die Kleidung oder der Beat verloren.

Also habe ich die Schritte übersprungen. Ich habe einen 8-Sekunden-Ausschnitt eines Refrains direkt in den Referenzslot eines Videomodells gelegt und auf „Starten“ gedrückt. Es hat mir nichts für das Audio berechnet.

Dann habe ich die fertige mp4 auseinandergenommen, um die eine Frage zu beantworten, die niemand im Internet klar beantwortet: Ist der Sound, der aus dem Modell kommt, mein Song, oder etwas, das es sich ausgedacht hat und nur ähnlich klingt? Ich habe es gemessen. Die Antwort ist nicht das, was ich erwartet habe, und sie ändert, wie du das Ding schneiden solltest.

Wichtige Erkenntnisse

  • Referenz-Audio ist kostenlos. MiniMax H3 berechnet nur die Ausgabesekunden. Meine vier 8-Sekunden-Referenzausschnitte haben $0,00 zur Rechnung hinzugefügt. Referenz-Video ist das Teure.
  • 15 Sekunden sind eine Obergrenze pro Generation, nicht pro Projekt. Schneide den Song, schieße einen Ausschnitt pro Einstellung, verketten. Mein 32-Sekunden-Schnitt besteht aus vier Generationen.
  • Schreibe den Hook mit 120 BPM. Ein Takt ist genau 2,000 Sekunden, daher landen H3s ganzzahlige duration-Werte ohne manuelles Nachjustieren auf den Taktschlägen. 8s = 4 Takte.
  • Das Ausgabe-Audio ist dein Track, samplegenau. Ich habe eine Wellenformkorrelation von 0,892 bei Nullverzögerung zwischen meinem Eingabeausschnitt und der von H3 gelieferten Stereomischung gemessen. Es wird nicht neu generiert. Du solltest dennoch den Master für den finalen Cut darüberlegen, aus einem anderen Grund (siehe unten).
  • Tatsächliche Gesamtausgaben: $7,53 über neun Generationen, einschließlich der Fehlschläge. Die vier Aufnahmen, die es in den finalen Cut geschafft haben, plus der Song und das Basisbild, kosteten $4,80.

Das MiniMax H3 Musikvideo, das ich aus einem 32-Sekunden-Hook geschnitten habe

Ton an. Dies sind vier separate Generationen, ohne Übergänge aneinandergereiht, mit dem ursprünglichen 32-Sekunden-Master darübergelegt.

TfrOvWHf4ys

„MIRA", 32 Sekunden, 2560x1440, 24 fps. Vier minimax/h3/reference-to-video -Generationen zu je 8 Sekunden, $1,12 pro Aufnahme. Der Song wurde als Referenz-Audio eingegeben und kostete $0,00.

Vier Generationen, vier völlig unterschiedliche Lichtwelten, ein Gesicht. Nichts wurde dazwischen nachbearbeitet.

Vier Ansichten einer silberhaarigen Frau mit einem leuchtend roten Kragen

Vier Frames aus den vier Aufnahmen, die dieselbe Sängerin auf einem Neon-Dach, einer Wüstenautobahn, in einem weißen Studio und in einem schwarzen Wassertank zeigen_Ein_ Frame aus jeder gelieferten Clip. Gleiches Haar, gleiches Mesh-Top, gleicher roter LED-Choker bei Regen, tiefer Sonne, flachem High-Key und unter Wasser.


Warum die meisten MiniMax H3 Musikvideo-Versuche nach der zweiten Sechzehn scheitern

Drei Fehlermodi, alle vermeidbar.

Eins: Die 15 Sekunden als Projektgrenze behandeln. H3 begrenzt eine einzelne Generation auf 15 Sekunden. Leute lesen das, schließen daraus „keine Musikvideos" und geben auf. Aber ein Musikvideo war nie eine einzige Einstellung. Ein echtes schneidet ohnehin alle 4 bis 8 Sekunden. Die Grenze zwingt dich nur dazu, das zu tun, was ein Editor ohnehin getan hätte.

Zwei: Rhythmus in Worten beschreiben. „Schwungvoll, energiegeladen, tanzen zum Beat" gibt dem Modell nichts, woran es sich festhalten kann. Es erfindet ein Tempo, und deine Schnittpunkte landen für immer einen halben Beat daneben. Wenn du die tatsächliche Audiospur übergibst, entfällt das Raten.

Drei: Die Kleidung treiben lassen. Jede Einstellung benötigt dasselbe Referenzbild und dieselbe Kleidungsbeschreibung, wortwörtlich. Ändere „schwarzes Mesh-Top" zwischen den Einstellungen in „dunkles Mesh-Shirt" und du bekommst eine andere Person.

So viel kosten dich die beiden Routen tatsächlich:

 Traditionelle Vier-Tool-KetteEinzelner H3-Referenzaufruf
Tools pro EinstellungBildmodell, Videomodell, Lip-Sync-Tool, NLEEin Endpunkt, dann ein NLE am Ende
Manuelle Schritte pro Einstellung4 Übergaben, 3 Dateiexporte1 Absenden
Was die Figur hältManuelles erneutes Prompten und GlückEin Referenzbild, unverändert wiederverwendet
Bild und TonGetrennt gerendert, später ausgerichtetIm selben Durchgang generiert, 32 kHz Stereo
Kosten pro 8-Sekunden-EinstellungVier separate Zähler$1,12 bei 2K, $0,80 bei 768P

Um der alten Route gerecht zu werden: Sie ist keine Fantasie. Der japanische Creator Arata Fukoe hat mit einem vollständig KI-generierten Musikvideo eine Project Odyssey Bronze gewonnen, und sowohl Queen als auch Linkin Park haben offizielle KI-gestützte Videos veröffentlicht. Diese Ketten liefen jedoch durch vier oder fünf Tools, genau das, wofür ein unabhängiger Künstler mit einem Song keine Zeit hat.

Was Referenz-Audio einem MiniMax H3 Musikvideo tatsächlich bringt

Dies ist der Teil, den es wert ist zu verstehen, bevor du etwas ausgibst.

H3 generiert Bild und Ton in einem Durchgang, anstatt Audio auf fertige Frames zu legen. Wenn du einen Referenz-Track übergibst, ist der Track keine Stimmungsnotiz. Ich habe meinen Eingabeausschnitt mit dem Audiostream in der gelieferten mp4 verglichen, auf Wellenformebene, in einem 8-kHz-Mono-Downmix:

  • Hüllkurvenkorrelation: 0,956 bei Nullverzögerung
  • Rohwellenformkorrelation über ein 2-Sekunden-Fenster: 0,892 bei Null-Sample-Offset

Das ist kein Modell, das einen ähnlichen Song reproduziert. Das ist deine Datei, samplegenau, mit der durch das Prompt angefragten Atmosphäre darübergelegt und einer AAC-Neuencodierung. Zum Vergleich: Die gleiche Messung gegen einen Kontrolldurchlauf, der ohne Referenz-Audio generiert wurde, ergab 0,26, was dem Rauschboden entspricht.

Zwei nahezu identische Audio-Wellenformen, blaue Eingabe und rote Ausgabe

Wellenform des Eingabeausschnitts oben, des von H3 gelieferten Audios unten, ausgerichtet bei Nullversatz_Oben: die 8-Sekunden-mp3, die ich hochgeladen habe. Unten: der Audiostream in der mp4, die H3 zurückgegeben hat. Gleiche Peaks, gleiche Positionen, kein Versatz._

Die Eingabebeschränkungen sind streng und werden zum Zeitpunkt des Absendens durchgesetzt, nicht stillschweigend:

ReferenzeingabeGrenzeAbgerechnet
Bilderbis zu 9kostenlos auf Atlas Cloud H3-Endpunkten
Videosbis zu 3, jedes 2-15szum Ausgabesatz abgerechnet
Audiobis zu 3, jedes 2-15s, insgesamt 15s über alle Clips$0,00
Audio alleinabgelehnt, benötigt mindestens ein Bild oder Videon/a

Ich habe die Gesamtaudio-Obergrenze absichtlich getestet, indem ich drei 8-Sekunden-Ausschnitte in einem Aufruf gesendet habe. Es schlug nach 5,8 Sekunden mit invalid params, total audio duration 24138 ms exceeds 15000 ms fehl und wurde nicht berechnet. Gute Nachricht: H3 verwirft die zusätzliche Datei nicht stillschweigend und berechnet dir trotzdem etwas.

Noch eine Falle, auf die ich zuvor gestoßen bin. Wenn du Audio als base64-Daten-URL übergibst, bestimmt der MIME-Typ die Erweiterung, die die API ableitet. data:audio/mpeg wird mit audio format ".mpeg" not allowed abgelehnt. data:audio/mp3 kommt problemlos durch. Vier Absendungen sind daran gestorben, bevor ich es bemerkt habe, alle kostenlos.


Der MiniMax H3 Musikvideo-Workflow und was jede Sekunde kostet

Alles unten läuft über einen API-Schlüssel auf Atlas Cloud, wo ich alles ausgeführt und abgerechnet habe. Drei Modelle, ein Browser-Tab.

SchrittModellWas es tutTatsächlich berechneter Preis
Den Hook schreibenminimax/music-2.6Vollständiger Song aus einem Style-Prompt plus Text, mp3 bis ~5 Min$0,15 pro Song, pauschal
Den Künstler festlegenopenai/gpt-image-2/text-to-imageEin Basis-Frame, den jede Einstellung erbt$0,1745 bei Qualität high, 2048x1152
Jede Einstellung aufnehmenminimax/h3/reference-to-videoBild plus Audio rein, beat-locked Clip mit Stereo-Sound raus$0,14/s bei 2K, $0,10/s bei 768P. Audioeingabe $0,00

Zwei Anmerkungen zu dieser Tabelle, denn die aufgeführten Nummern lügen in beide Richtungen. GPT Image 2 zeigt einen $0,009-Boden im Katalog; das ist die unterste Token-Stufe, und ein echter 2048x1152 high-Render kostet $0,1745. H3s Katalogeintrag zeigt $0,10, was nur die 768P-Stufe ist; meine 8-Sekunden-2K-Jobs haben jeweils genau $1,12 gekostet, also $0,14 pro Sekunde.

Wenn du eine First-Frame-Sperre anstelle von Subjektreferenzen möchtest, gelten für [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) dieselben Sätze, und [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) deckt reine Prompt-Aufnahmen ab.

Die Korrektur, die es wert ist, gemacht zu werden: Eine frühere Version dieses Plans ging davon aus, dass du deinen eigenen Song mitbringen musstest, weil es keinen Ganz-Song-Generator auf der Plattform gab. Jetzt gibt es einen. minimax/music-2.6 schreibt den Track, sodass die gesamte Kette, Song inklusive, an einem Ort läuft.


Wie man ein MiniMax H3 Musikvideo erstellt, Schritt für Schritt

Schritt 1: Einen 120 BPM Hook schreiben und in Einstellungsausschnitte schneiden

Fordere explizit 120 BPM an. Bei 120 BPM ist ein Takt genau 2,000 Sekunden, sodass H3s ganzzahlige duration-Enum-Werte automatisch auf Taktschlägen landen: 4s = 2 Takte, 6s = 3 Takte, 8s = 4 Takte, 10s = 5 Takte. Deine Schnitte landen auf dem Downbeat, ohne dass du einen einzigen Marker berühren musst.

Modell: minimax/music-2.6. Einstellungen: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.

Style-Prompt:

plaintext
1Synthpop bei genau 120 BPM, geradlinige Four-on-the-Floor-Kick, helle analoge
2Seitenketten-Pads, saubere weibliche Lead-Vocals, die vorne im Mix liegen, breiter
3Stereo-Chorus, kein Rap, anhaltende offene Vokale, cineastisch und leicht
4melancholisch, radioreifer Master

Text:

plaintext
1[Chorus]
2Hold the line, hold the light
3I am running out of night
4Say my name into the rain
5And I will burn again

Es gab einen 70-Sekunden-Track in 75 Sekunden für $0,15 zurück. Ich habe dann das Tempo überprüft, anstatt es zu glauben, indem ich eine Onset-Novelty-Autokorrelation über die Datei laufen ließ. Die stärkste Verzögerung kam bei genau 0,500 s zurück, was 120 BPM entspricht, und das Beat-Raster beginnt bei 0,24 s in der decodierten Datei, nicht bei Null. Dieser Versatz ist wichtig: Schneide ab 0,24 und jeder Ausschnitt beginnt auf einem Downbeat.

plaintext
1# 32-Sekunden-Master, beginnend auf dem Downbeat bei 0,24s
2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3
3
4# vier 8-Sekunden-Ausschnitte, einer pro Einstellung, jeweils 4 Takte und deutlich unter der 15s-Grenze
5for i in 0 8 16 24; do
6  ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3
7done

Wenn du bereits deinen eigenen Track hast, überspringe diesen Schritt ganz. Das ist der Normalfall und der günstigste.

Schritt 2: Den Künstler mit einem GPT Image 2 Basis-Frame festlegen

Jede Einstellung referenziert diese einzelne Datei. Was hier falsch ist, ist viermal falsch, also gib die $0,17 aus und schau es dir richtig an.

Modell: openai/gpt-image-2/text-to-image. Einstellungen: Qualität high , Größe 2048x1152 (16:9).

plaintext
1Cineastisches Musikvideo-Standbild, Hüftporträt. Eine 25-jährige ostasiatische
2Synthpop-Sängerin mit silberweißem, kurz geschnittenem Haar und einem geraden
3Pony, einem matten schwarzen Mesh-Top, einem dünnen roten LED-Choker, der gegen
4ihr Schlüsselbein leuchtet, und einer einzelnen silbernen Ohrkrempe. Sie steht auf
5einem regennassen Dach in der Nacht und hält ein altes Chrom-Handmikrofon dicht
6vor ihrem Mund. Hinter ihr, unscharfe magenta- und cyanfarbene Neonbeschriftung,
7feiner Regen, der von einem harten Gegenlicht eingefangen wird, Dampf, der aus
8einem Lüftungsschacht aufsteigt. Auf 35mm anamorphotischem Film aufgenommen,
9geringe Schärfentiefe, Teal-und-Magenta-Gradierung, sichtbares Filmkorn. Ihr
10Gesicht ist scharf und gleichmäßig von einem weichen Key von links der Kamera
11ausgeleuchtet. Kein Text irgendwo im Frame.

Frau mit silbernem Haar, die ein Vintage-Mikrofon in einer regnerischen Neonstadt hält

Das generierte Basis-Frame: Silberhaarige Sängerin mit Chrom-Mikrofon auf einem regennassen Neon-Dach_Das_ Basis-Frame, das jede spätere Einstellung erbt. Generiert mit openai/gpt-image-2/text-to-image , Qualität high, 2048x1152, berechnet $0,1745.

KI-Bildgenerator-Oberfläche mit Eingabeeinstellungen und generiertem Ausgabe

GPT Image 2, das genau dieses Prompt im Atlas Cloud Playground ausführt, mit dem fertigen Frame im Ausgabefeld

Dasselbe Prompt im Playground: Größe 16:9 bei 2048x1152, Qualität high, und der Run-Button mit $0,1745, was die API mir tatsächlich berechnet hat. Die $0,009 im Katalog sind die unterste Token-Stufe, nicht diese. Gleiches Prompt, anderer Seed, daher ist dieser Render nicht die exakte Datei oben.

Die Kleidungsbegriffe in diesem Prompt (silberweißes, kurz geschnittenes Haar, mattes schwarzes Mesh-Top, roter LED-Choker, silberne Ohrkrempe) werden in jedem folgenden Prompt wörtlich wiederverwendet. Diese Wiederholung ist der gesamte Konsistenzmechanismus. Paraphrasiere sie nicht.

Schritt 3: Die erste MiniMax H3 Musikvideo-Einstellung mit kostenlosem Referenz-Audio ausführen

Modell: minimax/h3/reference-to-video. Einstellungen: refers = das Basis-Frame plus slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.

Setze ratio explizit. Der Playground-Standard ist adaptive, und der Endpunkt ist viel zufriedener, wenn du die gewünschte Form benennst.

plaintext
1Musikvideo-Einstellung. Die Frau im Referenzbild singt den Referenz-Track direkt
2in die Linse auf dem nassen Neon-Dach, das Chrom-Mikrofon an ihrem Mund. Sie
3setzt die erste Zeile hart auf dem Downbeat, Blick auf die Kamera fixiert, dann
4neigt sie den Kopf auf der anhaltenden Note zurück. Langsamer Push-In von der
5Hüfte zu einer engen Nahaufnahme über die acht Sekunden, Handheld-Mikro-Drift,
6Regenstreifen, die das harte Gegenlicht kreuzen. Ihre Mundbewegungen folgen genau
7den gesungenen Vokalen des Referenz-Audios, sie singt, spricht nicht. Identisches
8silberweißes, kurz geschnittenes Haar, mattes schwarzes Mesh-Top und glühender
9roter LED-Choker wie im Referenzbild. Klanglandschaft: der Referenz-Track in
10Stereo, plus leichter Regen und ein entferntes Stadtbrummen leise im Mix.

7sPeYEe-xII

Einstellung 1, Ton an. 2560x1440, genau 8,00 s, 24 fps, 32 kHz Stereo. 345 Sekunden vom Absenden bis zur Datei, berechnet $1,12. Sieh dir das Zurückneigen des Kopfes auf der anhaltenden Note bei etwa 5 s an.

KI-Videogenerator-Oberfläche mit Eingabeeinstellungen und generiertem Video

Der Reference-to-Video-Playground mit dem Basis-Frame und dem Audio-Ausschnitt geladen und dem fertigen Clip im Ausgabefeld

Referenzmaterialien zeigt 2/9: slice-0.mp3 in einem Slot, das Basis-Frame im anderen. Auflösung 2K, Dauer 8, und der Run-Button mit $1,12, was genau 8 x $0,14 entspricht. Beachte das Dropdown für das Seitenverhältnis auf adaptive , was die Seiteneinstellung ist; meine API-Aufrufe setzten ratio explizit auf 16:9.

Eine Zahl, die es wert ist, notiert zu werden: duration: 8 lieferte einen Container von genau 8,00 Sekunden. duration: 4 lieferte 4,46 Sekunden. Wenn du auf Taktschlägen verketten willst, bleib bei den Dauern, die exakt zurückkommen.

Schritt 4: Drei weitere Welten schießen, ohne das Gesicht zu verlieren

Gleiches Basis-Frame, gleicher Kleidungssatz, nächster Audio-Ausschnitt. Alles andere ändert sich.

4a. Wüstenautobahn zur goldenen Stunde. refers = Basis-Frame + slice-8.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Musikvideo-Einstellung. Dieselbe Frau aus dem Referenzbild steht auf der
2Mittellinie einer leeren Wüstenautobahn zur goldenen Stunde, ohne Mikrofon, eine
3offene indigoblaue Denim-Jacke über demselben matten schwarzen Mesh-Top, der rote
4LED-Choker noch leuchtend. Sie formt den Refrain des Referenz-Tracks mit den
5Lippen in den Wind, während die Kamera rückwärts tief über den Asphalt fährt.
6Hitzeflimmern über der Straße, aufwirbelnder Staub, ihr Schatten dehnt sich lang
7Richtung Linse, ein anamorphotischer Lens Flare kreuzt auf halber Strecke. Haar,
8Gesicht und Kleidung identisch mit dem Referenzbild. Klanglandschaft: der
9Referenz-Track über offenem Wüstenwind, weit und luftig.

4XEki-v2vCU

Einstellung 2, Ton an. Gleiches Gesicht, entgegengesetzte Farbtemperatur, und der Referenz-Track neu gemischt unter offenem Wind. 332 s, $1,12.

4b. Weißer Infinity-Cove. refers = Basis-Frame + slice-16.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Musikvideo-Einstellung. Dieselbe Frau aus dem Referenzbild in einem rein weißen
2Infinity-Cove-Studio unter flachem High-Key-Licht ohne Schatten, trägt einen
3glänzenden roten Vinyl-Trenchcoat über demselben matten schwarzen Mesh-Top, der
4rote LED-Choker am Kragen sichtbar. Sie tanzt vier Takte zum Referenz-Track, das
5silberweiße Haar peitscht bei jeder Drehung. Feststehende Weitwinkelaufnahme,
6dann ein harter Snap-Zoom zur Halbtotalen auf den zweiten Downbeat. Kleine weiße
7Papierquadrate fallen wie Konfetti durch die letzten zwei Sekunden. Gesicht und
8Haar identisch mit dem Referenzbild. Klanglandschaft: der Referenz-Track, trocken
9und nah, plus das Quietschen von Schuhen auf dem Studioboden.

VAyqdkVpnm0

Einstellung 3, Ton an. Flaches, schattenloses Licht ist der schwierigste Ort, um einen Gesichtsaustausch zu verstecken, und es hat gehalten . 8,00 s, $1,12.

4c. Unterwasser-B-Roll, ohne Lippen-Sync. refers = Basis-Frame + slice-24.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Musikvideo-Einstellung. Dieselbe Frau aus dem Referenzbild schwebt unter Wasser
2in einem schwarzen Tank, das silberweiße Haar schwimmt um sie herum, der rote
3LED-Choker leuchtet durch das Wasser, das schwarze Mesh-Top bauscht sich langsam.
4Ein harter Lichtstrahl von direkt oben; Blasen steigen in Zeitlupe an der Linse
5vorbei. Sie öffnet die Augen auf dem Downbeat und streckt eine Hand zur
6Oberfläche. Sie singt nicht und ihr Mund bleibt geschlossen. Die Kamera dreht
7sich dreißig Grad um sie herum während der Einstellung. Gesicht identisch mit dem
8Referenzbild. Klanglandschaft: der Referenz-Track, von über der Oberfläche gehört,
9gedämpft und tiefpassgefiltert, mit Blasentransienten.

fibdweUMRpY

Einstellung 4, Ton an. Die Anweisung „sie singt nicht und ihr Mund bleibt geschlossen" wurde befolgt, was der nützliche Teil ist: Das Referenz-Audio steuert das Timing, nicht eine zwingende Performance. 329 s, $1,12.

Schritt 5: Den Kontrolldurchlauf ausführen, mit leerem Audio-Slot

Gleiches Prompt wie Schritt 3, Wort für Wort. Die einzige Änderung: refers enthält das Bild und nichts anderes. 768P, duration: 8.

Dieser eine Clip erklärt den gesamten Mechanismus besser als jeder Absatz. Höre ihn dir gegen Schritt 3 an.

FAoPplGmKJc

Der Kontrolldurchlauf. Identisches Prompt, kein Referenz-Audio, 1344x768, 8,00 s, 200 s, $0,80. H3 hat seinen eigenen Soundtrack geschrieben, und die Performance ist generisches „jemand singt" anstatt dieser Worte.

Gemessen gegen meinen Master erreicht das Audio des Kontrolldurchlaufs eine Hüllkurvenkorrelation von 0,26. Schritt 3 erreicht 0,956. Diese Lücke ist das, was der kostenlose Audio-Slot dir bringt.

Schritt 6: Den Lip-Sync absichtlich brechen

Jedes Modell hat eine Silbendecke. Deine zu finden, kostet $0,40.

Ich habe einen separaten Double-Time-Rap-Track generiert (minimax/music-2.6 nochmal, $0,15), einen 4-Sekunden-Ausschnitt mit etwa sechs Silben pro Sekunde geschnitten und ihn in dasselbe Dach-Setup bei 768P, duration: 4 eingespeist.

plaintext
1Musikvideo-Einstellung. Die Frau im Referenzbild rappt den Referenz-Track direkt
2in die Linse auf dem nassen Neon-Dach, das Chrom-Mikrofon an ihrem Mund, und
3liefert jede Silbe der schnellen Double-Time-Strophe. Feststehende
4Halbnahaufnahme, leichter Handheld-Drift, Regenstreifen im harten Gegenlicht.
5Ihre Mundbewegungen folgen genau den gerappten Silben des Referenz-Audios.
6Identisches silberweißes, kurz geschnittenes Haar, mattes schwarzes Mesh-Top und
7glühender roter LED-Choker wie im Referenzbild. Klanglandschaft: der Referenz-Track
8in Stereo plus leichter Regen.

jiQVCjOCbKg

Der Belastungstest, Ton an. 1344x768, 4,46 s, 192 s, $0,40. Der Mund bleibt beschäftigt und bleibt im Takt, aber er hört auf, einzelne Konsonanten aufzulösen und verfällt in einen sich wiederholenden Öffnen-Schließen-Zyklus. Gesungene Zeilen erhalten unterschiedliche Vokalformen; dies nicht.

Meine ehrliche Einschätzung aus den gelieferten Dateien: Anhaltende gesungene Vokale sind, wo H3s Mundarbeit wirklich überzeugend ist, und dichte gerappte Konsonanten sind, wo sie zu plausibler Bewegung degradiert. Plane deine Nahaufnahmen um die gesungenen Zeilen herum und lege die schnellen Bars auf B-Roll. Weitere Details zum Unterschied zwischen Sprache und Gesang findest du in der Lip-Sync- und Audio-Analyse.

Schritt 7: Verketten, stummschalten und den Master über dein MiniMax H3 Musikvideo legen

Vier Clips von genau 8,00 Sekunden ergeben genau 32,00 Sekunden, das sind 16 Takte bei 120 BPM. Kein Trimmen.

plaintext
1# 1. Audio jedes Clips entfernen
2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do
3  ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4
4done
5
6# 2. in Takt-Reihenfolge verketten (4 x 8s = 32s = 16 Takte @ 120 BPM)
7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt
8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4
9
10# 3. den Original-Master darüberlegen
11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4

Warum stummschalten, wenn das Modell dir bereits deinen Track zurückgibt? Weil die Stereomischung jedes Clips die Atmosphäre trägt, die das Prompt dieser Einstellung verlangt hat: Regen in Einstellung 1, Wüstenwind in Einstellung 2, einen Tiefpass-Unterwasserfilter in Einstellung 4. Lieblich pro Einstellung, inkohärent über einen Schnitt hinweg. Der Master gibt dir eine durchgehende Mischung mit voller Bitrate und ohne Neuencodierung pro Einstellung. H3 liefert die Performance-Synchronisation. Dein Master liefert den Song.


Vier Variationen des MiniMax H3 Musikvideo-Rezepts

Vertikale Veröffentlichungsschnitte. Setze ratio: 9:16 und du erhältst einen Spotify Canvas oder einen Shorts-Ausschnitt aus demselben Basis-Frame und denselben Ausschnitten. Es kam als echte 768x1344 zurück, also bleibt im Gegensatz zum Seitenverhältnis-Dropdown im Playground der API-ratio-Wert tatsächlich erhalten. Canvas-Loops sind standardmäßig stumm, also wird dieser als GIF ausgeliefert.

Silberhaarige Frau, die ein Mikrofon auf einem regnerischen Stadtdach hält

Ein vertikaler 9:16-Loop-Schnitt derselben Künstlerin auf dem Neon-Dach_Gleiches Basis-Frame, gleicher Referenz-Ausschnitt,_ ratio: 9:16 bei 768P für $0,80. Eine ehrliche Falte: Ich habe um „nicht singen" gebeten und trotzdem Gesang bekommen. Mit einem Vocal im Referenz-Slot gewinnt das Audio das Argument. Wenn du einen stummen Darsteller möchtest, füttere einen Instrumental-Ausschnitt.

Referenzvideo anstelle von Referenzbild. Du kannst H3 bis zu drei Referenz-Videoclips übergeben, um Bewegung und Bildausschnitt zu transportieren, anstatt sie zu beschreiben. Achte auf den Zähler: Referenz-Video wird zum Ausgabesatz abgerechnet, während Referenz-Audio kostenlos ist. Diese Asymmetrie ist die nützlichste Preisinformation auf diesem Endpunkt.

Reine B-Roll-Visualiser. Verzichte ganz auf den Darsteller. Füttere ein Produktfoto, ein Albumcover-Objekt oder eine Texturplatte plus den Audio-Ausschnitt und fordere nur Kamerabewegung an. Kein Gesicht zu halten, kein Lip-Sync zu brechen, und du kannst das Ganze bei 768P schießen.

Günstig entwerfen, teuer fertigstellen. 768P kostet $0,10/s gegenüber 2Ks $0,14/s, und beide kommen mit identischem 32 kHz Stereo zurück, also ist die Performance, die du beurteilst, dieselbe. Die Ersparnis liegt nicht in den Keepers, sondern in den Ablehnungen: Jeder fehlgeschlagene 8-Sekunden-Take kostet $0,80 statt $1,12. Rolle bei 768P, bis der Take richtig ist, und zahle dann einmal $1,12. Bei einer Einstellung, die drei Versuche benötigt, sind das $2,72 statt $3,36. Mehr zum Stufenunterschied im 768P-gegen-2K-Vergleich und darüber, wie weit ein einzelner Clip reichen kann, im Clip-Längen-Leitfaden.


Was ein vollständiges MiniMax H3 Musikvideo tatsächlich gekostet hat

Jede Zeile unten ist ein echter abgerechneter Betrag, der nach Abschluss aus dem Vorhersagedatensatz gezogen wurde, kein Listenpreis.

PostenModell und EinstellungenAbgerechnet
Hook, 70 s Songminimax/music-2.6, mp3 44,1 kHz$0,15
Künstler-Basis-Frameopenai/gpt-image-2/text-to-image, high, 2048x1152$0,17
Einstellung 1, Neon-Dachminimax/h3/reference-to-video, 2K, 8 s$1,12
Einstellung 2, Wüstenautobahnsame, 2K, 8 s$1,12
Einstellung 3, weißer Covesame, 2K, 8 s$1,12
Einstellung 4, Unterwassersame, 2K, 8 s$1,12
Zwischensumme fertiges Video $4,80
Validierungssonde768P, 4 s$0,40
Kontrolldurchlauf, kein Audio768P, 8 s$0,80
Rap-Track für den Belastungstestminimax/music-2.6$0,15
Lip-Sync-Belastungstest768P, 4 s$0,40
Vertikaler Canvas-Schnitt768P, 8 s, 9:16$0,80
Hero-Bild für diesen Artikelopenai/gpt-image-2/text-to-image, high$0,17
Über-Limit-Test, 24 s Audiobeim Absenden abgelehnt$0,00
Vier Absendungen mit falschem Audio-MIMEbeim Absenden abgelehnt$0,00
Referenz-Audio, 4 x 8 skostenloser Input$0,00
Gesamtausgaben $7,53

Das sind $9,00 pro fertiger Minute bei 2K für die Einstellungen, die es in den Schnitt geschafft haben, vor all meinen Fehlern. Wenn alles bei 768P geschossen wird, liegt dieselbe Minute bei $6,61. Eine menschliche MV-Crew bietet keinen dieser Preise.

Zwei betriebliche Hinweise, wenn du ein längeres Stück budgetierst. Absagezeitpunkt-Ablehnungen sind kostenlos, also kosten schlechte Parameter dir Zeit und sonst nichts. Und das price-Feld einer Vorhersage wird mit Verzögerung gefüllt, also poll die Request-ID erneut, nachdem die Dateien heruntergeladen sind, wenn du eine echte Rechnung und kein null haben möchtest.


Wessen Song, wessen Gesicht: Was du vor der Veröffentlichung prüfen solltest

Kurz, weil es wichtig ist und keine Predigt braucht.

Du brauchst die Rechte an dem Referenz-Track. Kostenloser Input bedeutet nicht kostenlose Freigabe. Einen kommerziell veröffentlichten Song als Referenz-Audio zu verwenden und dann das Ergebnis zu veröffentlichen, ist der schnelle Weg zu einer Abmahnung. Deine eigene Aufnahme, ein von dir in Auftrag gegebener Track oder etwas, das du generiert hast, ist in Ordnung.

Baue das Basis-Frame nicht aus dem Gesicht eines echten lebenden Künstlers. Der Konsistenzmechanismus hier ist sehr gut darin, ein Gesicht über Einstellungen hinweg zu halten, was genau der Grund ist, warum es eine schlechte Idee ist, es auf eine reale Person zu richten.

Offene Gewichte und API-Zugriff sind zwei verschiedene Lizenzen. MiniMax hat H3s Gewichte im August 2026 auf Hugging Face veröffentlicht, und seine Community-Lizenz schließt derzeit die EU, das Vereinigte Königreich, Südkorea und die USA aus, mit einem formalen Lizenzierungskanal für diese Gebiete. Diese Einschränkung betrifft das Ausführen der Gewichte selbst. Das Modell über eine gehostete API aufzurufen, ist eine Dienstleistungsbeziehung und unterstellt dich nicht der Gewichtelizenz. Es ist gut zu wissen, in welcher Situation du dich befindest, bevor du in die eine oder andere Richtung annimmst.

Für einen breiteren Überblick darüber, wo H3 im Vergleich zu den Alternativen steht, gibt es einen Seedance 2.5-Vergleich und einen Prompt-Struktur-Leitfaden. Für den Kontext, warum es die Mühe überhaupt wert ist: Auf dem Video-Editing-Leaderboard, das Modelle mit Audio bewertet, liegt H3 derzeit mit 1.126 Elo auf Platz eins, vor Gemini Omni Flash mit 1.119 und Dreamina Seedance 2.0 mit 1.027 (Artificial Analysis, geprüft am 10. August 2026). Diese Werte ändern sich mit den Stimmen, also betrachte sie als Momentaufnahme.


MiniMax H3 Musikvideo: Häufig gestellte Fragen

Kann ein MiniMax H3 Musikvideo volle drei Minuten laufen?

Nicht in einer Generation. Ein einzelner Aufruf ist auf 15 Sekunden begrenzt. Aber das ist eine Obergrenze pro Generation, nicht pro Projekt. Ein dreiminütiges Video mit 8 Sekunden pro Einstellung sind 23 Generationen, etwa $25,76 bei 2K, und jede landet auf einem Taktschlag, wenn dein Track 120 BPM hat. Schneiden, schießen, verketten, den Master darüberlegen.

Verwendet ein MiniMax H3 Musikvideo meinen tatsächlichen Song, oder regeneriert das Modell das Audio?

Es verwendet deinen tatsächlichen Song. Ich habe eine Rohwellenformkorrelation von 0,892 bei Null-Sample-Offset zwischen der 8-Sekunden-mp3, die ich hochgeladen habe, und dem Audiostream in der zurückgegebenen mp4 gemessen, mit der vom Prompt angefragten Atmosphäre darübergelegt. Ein Kontrolldurchlauf, der ohne Referenz-Audio generiert wurde, erreichte 0,26 gegen denselben Master. Du solltest dennoch deinen Master über die endgültige Verkettung legen, da jeder Clip seine eigene Atmosphäre pro Einstellung und seine eigene AAC-Codierung trägt, die einen Schnitt nicht sauber überstehen.

Kostet es extra, einen Song in ein MiniMax H3 Musikvideo zu füttern?

Nein. Meine vier 8-Sekunden-Referenzausschnitte haben $0,00 zu einer $4,48-Einstellungsrechnung hinzugefügt. Referenz-Video ist das, worauf du achten musst, da es zum Ausgabesatz abgerechnet wird. Die Grenzen sind drei Audio-Clips, 2 bis 15 Sekunden jeder, insgesamt 15 Sekunden, und Audio kann niemals die einzige Referenz sein.

Wie gut ist MiniMax H3 Lip-Sync bei Gesang im Vergleich zu Sprache?

Anhaltende gesungene Vokale sind seine Stärke: deutliche Mundformen, Halte, die zur Note passen, und das Zurückneigen des Kopfes bei einer langen Note wirkt wie eine Performance und nicht wie eine Schleife. Dichte Darbietung ist, wo es aufgibt. Mein Rap-Test mit sechs Silben pro Sekunde hielt den Takt, löste aber keine Konsonanten mehr auf und verfiel in einen sich wiederholenden Öffnen-Schließen-Zyklus. Lege die schnellen Bars auf B-Roll.

Wie behalte ich dasselbe Gesicht in jeder Einstellung eines MiniMax H3 Musikvideos?

Drei Dinge, alle langweilig. Ein Referenzbild, das in jedem Aufruf wiederverwendet wird, nie neu generiert. Dieselbe Kleidungsbeschreibung, die zwischen Prompts wörtlich kopiert wird, nicht paraphrasiert. Und eine explizite „identisch mit dem Referenzbild"-Klausel in jedem Prompt. Meine vier Einstellungen haben Regen, tiefe Sonne, flaches High-Key und Unterwasser ohne Drift überstanden.

Wie viel kostet ein MiniMax H3 Musikvideo pro fertiger Minute?

$9,00 pro fertiger Minute bei 2K, basierend auf meiner tatsächlichen Rechnung von $4,80 für einen 32-Sekunden-Schnitt. Wenn alles bei 768P geschossen wird, kostet dieselbe Minute $6,61, und 768P liefert dasselbe 32 kHz Stereo, also ist die Performance, die du beurteilst, identisch. Rolle deine Ablehnungen bei $0,80 und zahle die $1,12 nur für den Take, der den Schnitt überlebt.

Neueste Modelle

Eine API für alle Media-KI.

Alle Modelle erkunden