MiniMax H3 Lip Sync and Audio: Ich habe ihm 6 Sekunden einer Stimme gegeben und 4 Tools aus meiner Pipeline gelöscht.

MiniMax H3 Lip Sync und Audio haben meine sechsstufige Synchronisationskette durch einen einzigen API-Aufruf ersetzt. Zwei echte Takes, die Grenzen des Referenz-Audios, die niemand dokumentiert, und die wahre Rechnung.

Mann mit Kopfhörern spricht in ein Mikrofon, während er ein Skript liest

Der Nachtradio-Frame, von dem jeder Take in diesem Artikel ausgeht, generiert mit openai/gpt-image-2/text-to-image bei hoher Qualität, 2048x1152

Dieses einzelne Standbild ist die Eingabe für das gesamte folgende Tutorial. Generiert mit openai/gpt-image-2/text-to-image, hohe Qualität, 2048x1152.

Denken Sie an das letzte Mal, als Sie einen 8-Sekunden-Shot fertiggestellt haben und er stumm herauskam.

Sie exportierten den Clip. Sie öffneten einen TTS-Tab und tippten die Zeile ein. Sie durchsuchten eine Sound-Bibliothek nach Regen und Raumklang. Sie zogen alles in eine Timeline und schoben die Wellenform hin und her, bis der Mund aufhörte zu lügen. Dann bezahlten Sie ein separates Lip-Sync-Modell, um den Mund trotzdem zu korrigieren. Vier Tools, drei WAV-Dateien, eine Stunde – und die Performance wirkte trotzdem wie nachsynchronisiert. Weil sie es war.

Diese Kette hat MiniMax H3 leise eliminiert. Nicht weil es „Audio hat“ (viele Modelle behaupten das), sondern wegen eines einzigen Slots im Request-Body, den fast niemand testet: Sie können ihm ein Audiostück geben, das Sie bereits besitzen, kostenlos, und bekommen die Stimme zurück auf ein Gesicht.

Unten folgt der Zwei-Takes-Test, der genau diesen Slot isoliert, die realen Preise jedes Schritts, den er ersetzt, die harten Limits, die Ihre Anfrage ablehnen, und die tatsächliche Rechnung.

Die wichtigsten Erkenntnisse

  • Ein einziger Aufruf liefert Bild, Dialog, Raumklang und Lippenbewegung zusammen. Text, Bild und Audio werden getrennt kodiert, dann sagt ein einzelner Omni-Transformer die Video- und Audio-Latents gemeinsam voraus (Hugging Face Model Card, August 2026).
  • Eingabe-Audio ist kostenlos. Eingabe-Video nicht: MiniMax berechnet Referenzvideo zum Ausgabesatz, also kosten dieselben 15 Sekunden Material $0 als Song und etwa $1,95 als Videoclip.
  • Harte Limits: maximal 3 Audioclips, jeder 2 bis 15 Sekunden, 15 Sekunden gesamt, und Audio kann nie allein reisen. Es muss mit mindestens einem Bild oder Video mitfahren.
  • Bei $0,14 pro Sekunde für 2K auf Atlas Cloud kostet ein kompletter 10-Sekunden-Shot mit Ton $1,40 – weniger als ein dediziertes Lip-Sync-Modell mit $0,22 pro Sekunde zu bezahlen, um einen Clip zu patchen, den Sie bereits gerendert haben.

Sound an: Zwei MiniMax-H3-Lip-Sync- und Audio-Takes, ein Unterschied von sechs Sekunden

Kopfhörer auf für diesen Abschnitt. Beide Hälften bekamen denselben Basisframe, dieselben zwei Dialogzeilen und denselben Prompt, Wort für Wort. Nur eine davon hörte zuerst eine sechssekündige Aufnahme einer Stimme.

fXlyer__czg

Sound an, und bitte Kopfhörer verwenden: Die linke Hälfte (Take A, ohne Referenzaudio) spielt im linken Ohr, die rechte Hälfte (Take B, mit 6-Sekunden-Referenz) im rechten. Gleicher Frame, gleiche Zeilen, gleicher Prompt. Beide Takes: minimax/h3/reference-to-video, 2K, 10 Sekunden, geliefert als 2560x1440 bei 24fps mit einer 32-kHz-Stereospur.

Take A hatte nichts als die Worte „ruhige, tiefe, magnetische männliche Rundfunkstimme“ im Prompt, also erfand es eine Stimme. Take B bekam 6,19 Sekunden eines völlig anderen Satzes und wurde angewiesen, dies nur als Klanganker zu behandeln. Keiner der beiden Takes wurde danach nachsynchronisiert. Keiner kam in die Nähe eines Lip-Sync-Modells. In beiden folgt der Mund der Stimme, die das Modell produziert hat, weil Mund und Stimme zusammen produziert wurden.

Beurteilen Sie das Timbre mit Ihren eigenen Ohren, statt mir aufs Wort zu glauben. Was ich als Tatsache angeben kann, sind der Mechanismus, die Einstellungen und die Rechnung – und die kommen als Nächstes.

Warum MiniMax H3 Lip Sync und Audio die sechsstufige Synchronisationskette zerschlagen hat

Die alte Kette war nie wirklich ein Workflow. Sie war eine Reparaturarbeit.

ImGr2NgcCCY

Sound an. Ein 3D-animierter Frosch und ein Chamäleon, die sich nachts in einem Zirkuszelt unterhalten, mit der Umgebungsatmosphäre des Geheges unter dem Dialog. Ein MiniMax-Referenzclip für natives H3-Audio. Mundformen bei animierten Charakteren sind der schwerste Fall, um sie zu faken – deshalb sind diese 20 Sekunden Ihrer Aufmerksamkeit wert.

Drei Dinge brachen immer wieder, und sie brachen aus strukturellen Gründen, nicht aus Pech.

Die Timeline lebte in Ihren Händen. Ein Videomodell lieferte Frames. Ein TTS-Modell lieferte eine Wellenform. Nichts in den beiden Ausgaben wusste voneinander, also war die Ausrichtung ein menschliches Urteil, das bei 30 Bildern pro Sekunde, per Auge, um 1 Uhr nachts gefällt wurde. Jeder Neurender startete dieses Urteil von vorn.

Patch-basiertes Lip-Sync hat eine Obergrenze. Ein dediziertes Lip-Sync-Modell besitzt nur die Mundregion von bereits existierendem Material. Es kann den Mund mit dem Audio in Übereinstimmung bringen. Es kann nicht den Kiefer vor einem harten Konsonanten anspannen, einen Atemzug vor eine Zeile legen oder die Schultern sinken lassen, wenn der Satz endet – weil diese Frames gerendert wurden, bevor irgendjemand wusste, was der Charakter sagen würde. Sie bekommen Genauigkeit ohne Performance, und das wirkt unheimlich.

Sounddesign war ein zweites Projekt. Regen, Raumklang, Stuhlknarren, eine Basslinie unter dem Dialog. Alles kam aus einer anderen Quelle und musste gegen eine Stimme ausbalanciert werden, die selbst aufgeklebt war.

Was der Audio-VAE Ihnen über MiniMax H3 Lip Sync und Audio verrät

Hier ist der Teil, der keine Marketing-Sprache ist, weil Sie ihn in einem Dateinamen sehen können.

In H3 läuft Text durch den H3-Encoder, visuelle Eingaben laufen durch sowohl den H3-Encoder als auch den H3-VisualVAE, und Audio läuft ausschließlich durch einen eigenständigen H3-AudioVAE. Der H3-Omni-Transformer sagt dann gemeinsam Video- und Audio-Latents voraus, die getrennt in Video und Stereo-Audio dekodiert werden. Der AudioVAE teilt sich einen Encoder und Dekoder über den linken und rechten Kanal, verarbeitet jeden unabhängig, führt sie für Stereo wieder zusammen und komprimiert 32-kHz-Audio in eine Latent-Tokensequenz bei einer zeitlichen Rate von 40 Hz (Hugging Face Model Card).

Als ComfyUI Day-0-Support auslieferte, zeigte sich diese Architektur als zwei separate Dateien im VAE-Ordner: minimax_h3_video_vae_fp16.safetensors und minimax_h3_audio_vae_fp32.safetensors, geladen von einem Dual-VAE-Loader, der einen Videopfad und einen Audiopfad entgegennimmt (ComfyUI-Blog, August 2026). Audio ist eine Modalität, um die das Modell herum gebaut wurde, kein nachträglich angeflanschter Postprozess.

Die Leaderboards stimmen darin überein, wo sich das zeigt. Artificial Analysis setzte H3 auf Platz eins seines Video-Editing-Leaderboards mit Audio bei 1.130 Elo aus 5.043 Blind-Preference-Stichproben und platzierte es in den Top 3 sowohl bei Text-zu-Video als auch bei Bild-zu-Video (Artificial Analysis, Juli 2026). Die Lücke zwischen „sehr gutem Bild“ und „Platz eins“ in genau diesem Ranking ist das Audio.

Der MiniMax-H3-Lip-Sync- und Audio-Workflow, bepreist gegen die Kette, die er ersetzt

Der ehrliche Weg, das zu beurteilen, sind nicht Bauchgefühle. Es ist, die alte Kette Schritt für Schritt zu bepreisen, mit echten Pro-Sekunde-Sätzen für einen 10-sekündigen fertigen Shot, und dann den Ersatz zu bepreisen.

#Die alte Kette, Schritt für SchrittWas sie ausführteWas dieser Schritt kosteteMit MiniMax H3 Lip Sync und Audio
1Das stumme Bild rendernein Videomodell, z. B. bytedance/seedance-2.0 bei $0,112/s$1,12derselbe einzelne Aufruf
2Die Zeilen vertonenminimax/speech-2.6-hdetwa $0,02 für ~250 Zeichenderselbe einzelne Aufruf
3Den Score finden oder erstellenminimax/music-2.6$0,15 pro Trackderselbe einzelne Aufruf
4Atmosphäre und Spot-Effekte schichtenSound-Bibliothek plus Ihre HändeIhr Abendderselbe einzelne Aufruf
5Alles auf einer Timeline ausrichtenEditor plus Ihre HändeIhr Abendexistiert nicht
6MischenEditor plus Ihre HändeIhr Abendexistiert nicht
7Den Mund patchensync/lipsync-v3 bei $0,22/s$2,20existiert nicht
Gesamt4 Modelle plus 2 manuelle Durchgängeetwa $3,49 plus Ihr Abend1 Aufruf, $1,40

Lesen Sie Zeile 7 zweimal. Den Mund eines Clips zu patchen, den Sie bereits gerendert haben, kostet $0,22 pro Sekunde, während der gesamte Shot mit Stimme, Atmosphäre und Mundbewegung $0,14 pro Sekunde kostet. Der Patch ist teurer als das Original. Genau dieser eine Vergleich ist das gesamte Argument.

Die Asymmetrie, die niemand erwähnt: Ihr eigenes Audio ist kostenlos, Ihr eigenes Video nicht.

Die Pay-as-you-go-Preistabelle von MiniMax listet Eingabematerial getrennt von der Ausgabe. Für H3 ist Audio-Eingabe kostenlos. Die ersten fünf Eingabebilder sind kostenlos, jedes weitere kostet $0,04. Eingabevideo wird nach der Dauer des Eingabeclips zum Satz der Ausgabeauflösung abgerechnet, also $0,13 pro Sekunde bei 2K (MiniMax-Preisdokumentation, geprüft am 3. August 2026). Dieselben 15 Sekunden Referenzmaterial kosten also nichts als Song, Sprachnotiz oder Kunden-VO und etwa $1,95 als Videoclip.

Das ist die Linie, die ändern sollte, wie Sie bauen. Referenzaudio ist die günstigste Steuerfläche im Modell – und genau die testet niemand.

ReferenzeingabeWie vielePro ClipGesamtAbrechnung (MiniMax)
Bildbis zu 9n/an/aerste 5 kostenlos, dann $0,04 pro Stück
Videobis zu 32 bis 15s15s maxzum Ausgabesatz abgerechnet, $0,13/s bei 2K
Audiobis zu 32 bis 15s15s maxKostenlos
Beliebige Mischung12 Dateien maxn/an/awie oben, pro Typ
Audio für sich alleinnicht erlaubt. Audio muss von Bild- oder Videoeingabe begleitet sein und kann nicht als alleinige Eingabe verwendet werden

Limits aus der H3-Base-Ref2VA-Spezifikation auf der Model Card. Das Atlas-Cloud-Schema für minimax/h3/reference-to-video sagt dasselbe in eigenen Worten: „Mindestens ein Bild ODER Video ist erforderlich (Audio allein ist nicht erlaubt).“

Zwei Fußnoten zur Atlas-Seite des Zählers, beide aus eigenen Läufen statt aus einer Doku-Seite. Atlas berechnet einen einzigen pauschalen Satz von $0,14 pro Ausgabesekunde für alle drei H3-Endpunkte, und ein Referenzvideo, das ich angehängt habe, erzeugte keine separate Gebühr obendrauf. Das ist eine Beobachtung, keine Policy, also kalkulieren Sie die MiniMax-Regel ein und behandeln Sie den Pauschalsatz als Bonus. Atlas akzeptiert außerdem resolution: "768P" und berechnet dafür dieselben $0,14 – eine Diskrepanz, über die Sie besser in der MiniMax-H3-API-Preisaufschlüsselung lesen als hier.

Alles unten läuft in einem einzigen Browser-Tab auf Atlas Cloud: der Basisframe, die Stimmreferenz und beide H3-Takes, auf einem API-Key mit einer Poll-Schleife. Die drei H3-Endpunkte unterscheiden sich nur in der Form ihrer Eingabe, also wird refers zu image zu Klartext, und sonst ändert sich nichts an Ihrem Code.

MiniMax H3 Lip Sync und Audio, Schritt für Schritt

Fünf Schritte. Zwei davon sind günstige Einrichtung, zwei sind der eigentliche Test, und der letzte kostet nichts, weil er dazu bestimmt ist, zu scheitern.

Schritt 1: Den Basisframe mit GPT Image 2 bauen

Die Demo ist ein Nachtradio-Moderator, gewählt aus einem einzigen Grund: Eine enge Nahaufnahme auf einen Mund ist die einzige Bildkomposition, in der Sie Lip-Sync tatsächlich beurteilen können. Eine Totale lässt ein Model schummeln.

Zwei Dinge in diesem Prompt sind nicht verhandelbar. Der Mund muss mitten im Wort leicht geöffnet sein, damit der erste Frame bereits wie Sprache wirkt, und es darf keinerlei Text im Bild sein, damit spätere dynamische Untertitel nicht mit eingebrannten Lettern kämpfen.

plaintext
1Photoreal cinematic still, 16:9, night-shift radio studio, tight chest-up framing on a
2man in his late thirties leaning into a vintage silver condenser microphone on a boom arm,
3foam windscreen inches from his lips, headphones half-off one ear. Warm tungsten desk lamp
4from camera-left carves his cheekbone; a red neon ON AIR sign burns out of focus behind his
5shoulder and bleeds crimson onto the mixing desk faders in the lower foreground. Rain streaks
6the studio window on the right, city lights smeared into bokeh. Thin cigarette smoke drifts
7through the lamp beam. Mouth slightly open mid-word, eyes down toward a paper script. Shot on
835mm, shallow depth of field, fine film grain, deep shadows, no text anywhere in the frame.
9

Einstellungen bei openai/gpt-image-2/text-to-image: Qualität hoch, Größe 16:9 bei 2048x1152, ein Bild. Die $0,009 auf der Modellliste sind eine Token-Tier-Untergrenze, nicht das, was Sie zahlen. Bei dieser Größe und Qualität kalkuliert der Run-Button $0,1745 pro Zeichnung, wie Sie im Screenshot unten lesen können.

KI-Bildgenerator-Oberfläche mit einem Prompt und seiner generierten Ausgabe

GPT Image 2 auf Atlas Cloud mit dem Radiokabinen-Prompt, Qualität hoch und 16:9 2048x1152 ausgewählt, und dem fertigen Basisframe im OUTPUT-Panel_GPT Image 2 auf Atlas Cloud: der exakte Prompt oben, Qualität hoch, 16:9 bei 2048x1152, und eine zweite Zeichnung desselben Frames in OUTPUT._

Schritt 2: Die Sechs-Sekunden-Stimmreferenz erstellen

Das ist der Schritt, den Leute falsch machen, also lesen Sie die Begründung vor dem Prompt.

Das Referenzaudio muss einen anderen Satz sagen als den, den Sie im Video haben wollen. Es ist ein Klanganker, sonst nichts. Die Zeilen kommen aus dem Prompt. Das eigene Reference-to-Video-Beispiel von MiniMax macht diese Trennung explizit: Es kennzeichnet einen Clip als Quellspur, die teilweise für Musik wiederverwendet wird, und einen zweiten Clip rein als „die Stimm-Timbre-Referenz“, wobei der neue Dialog inline im Prompt geschrieben wird. Wenn Ihre Referenz dieselben Worte sagt, die Sie angefordert haben, laden Sie das Modell ein, die Spur zu kopieren, statt die Stimme zu übertragen.

plaintext
1You're listening to Night Line, ninety-one point four, and it is coming up on
2three in the morning.
3

Einstellungen bei minimax/speech-2.6-hd: Jede ruhige tiefe Männerstimme funktioniert, und ich habe Magnetische Männerstimme (English_magnetic_voiced_man) gewählt. Setzen Sie speed auf 0,95, damit der Take mit Puffer in das 2-bis-15-Sekunden-Fenster fällt, lassen Sie vol bei 1,0 und behalten Sie den mp3-Output. Das Modell kostet $0,08 pro 1.000 Zeichen, reduziert von $0,10 – ein Rabatt von 20 %, gültig ab August 2026. Meine Zeile kam mit 6,19 Sekunden zurück und berechnete $0,00792.

Sprachgenerator-Oberfläche mit Texteingabe und Audio-Wellenform-Ausgabe

MiniMax Speech 2.6 HD auf Atlas Cloud mit der Referenzzeile im Textfeld und der gerenderten Audio-Wellenform im OUTPUT-Panel

MiniMax Speech 2.6 HD auf Atlas Cloud: eine Zeile rein, eine kurze MP3 raus, mit dem 20-%-Rabatt auf dem Run-Button. Der Screenshot wurde mit der Standardstimme Expressive Narrator aufgenommen, also stellen Sie den Voice-Picker auf Magnetische Männerstimme um und senken Sie Speed auf 0,95, bevor Sie ihn ausführen.

Schritt 3: MiniMax H3 Lip Sync und Audio mit dem Referenzaudio ausführen

Jetzt kommen beide Dateien zusammen in refers: das Standbild aus Schritt 1 und die MP3 aus Schritt 2. Das ist Take B.

Der Prompt verwendet die strukturierte Abschnittsform, auf der H3 trainiert wurde. subject_definitions benennt, wer und was die Referenzen sind, detailed_description trägt den Dialog in <d>[English] ...</d>-Tags, und die beiden Audio-Abschnitte beschreiben den Mix. Wenn Ihnen die Abschnittsnamen neu sind, deckt der MiniMax-H3-Prompt-Guide die vollständige Struktur ab. Nur drei Felder sind für Audioarbeit wichtig, und alle sind hier.

plaintext
1subject_definitions:
2<Subject 1> is the man at the radio microphone in <Picture 1>, late thirties, headphones
3half-off one ear, red ON AIR neon behind his shoulder.
4<Picture 1> is the opening frame of the target video.
5<Audio 2> is the voice timbre reference for <Subject 1>: a calm, low, magnetic male
6broadcast voice. Reference the timbre only; do not reuse its words.
7
8summary:
9[image reference + audio timbre reference] A single continuous 10-second close-up. <Subject 1>
10delivers two lines straight into the microphone in the voice timbre of <Audio 2>, while the
11camera pushes in slowly. The mouth movement, the breath before each line, and the room tone
12are generated together.
13
14detailed_description:
15The shot opens exactly on <Picture 1>. Warm tungsten from camera-left, red neon bleeding onto
16the mixing desk in the foreground, rain on the window behind. <Subject 1> takes a short breath,
17tilts a few degrees toward the windscreen, and speaks, <d>[English] It's three in the morning,
18and I know exactly who's still awake.</d> As he speaks, his jaw and lips move naturally with
19every syllable; the plosives on "three" and "morning" are visible. He glances down at the script,
20then back up past the lens, and continues, <d>[English] So let's keep this between us.</d>
21Exactly as his voice stops, his lips settle closed and he exhales through his nose. Throughout,
22the camera executes one slow, deliberate push-in; the neon flickers once, faintly, around second
23seven. No on-screen text.
24
25overall_soundscape:
26Close, dry, booth-treated voice with a touch of proximity effect from the microphone. Under it:
27a low electrical hum from the desk, rain steady against the glass, one distant car passing on
28the wet street, the soft creak of the chair as he leans in, and a single audible breath before
29each line.
30
31non_diegetic_music:
32A sparse, slow late-night jazz double bass, very quiet, well under the voice, entering around
33second two and never rising above the dialogue.
34

Einstellungen bei minimax/h3/reference-to-video: Auflösung 2K, Dauer 10, Seitenverhältnis 16:9, und refers hält beide Dateien. Die Reihenfolge im Array spielt keine Rolle, nur dass mindestens eine davon ein Bild oder ein Video ist. Der Duration-Slider steht standardmäßig auf 8, also verschieben Sie ihn, und stellen Sie Aspect Ratio von adaptive um, wenn Sie den Frame wollen, den Sie angefordert haben.

Vier Parameterfallen, drei davon haben mich Geld gekostet. Der Schlüssel ist ratio, nicht aspect_ratio, und ein Fehler hier liefert eine 400. Senden Sie duration immer explizit, denn das Schema-Standard sagt 8, aber eine Anfrage ohne duration kam als 5-Sekunden-Datei zurück. Bei diesem Endpunkt vervollständigt das Senden von image neben refers, berechnet den vollen Betrag und lässt stillschweigend eines davon fallen. Und wenn Sie das Audio als Base64-Daten-URL übergeben, beschriften Sie es als data:audio/mp3, nicht data:audio/mpeg. Mein erster Versuch starb genau daran:

plaintext
1content[2].audio_url: invalid param: audio format ".mpeg" not allowed
2

Das ist zumindest kostenlos – und damit kommen wir zu der nützlichen Methode, die Limits kennenzulernen.

KI-Videogenerator-Oberfläche mit Texteingabe und Videoausgabe

Der MiniMax-H3-Reference-to-Video-Playground auf Atlas Cloud, mit der MP3 in Slot 1 und dem Basisframe in Slot 2 der Referenzmaterialien, Auflösung 2K, und dem fertigen Clip im OUTPUT-Panel

MiniMax H3 reference-to-video auf Atlas Cloud: Referenzmaterialien zeigt 2/9 mit der MP3 in Slot eins und dem Standbild in Slot zwei, Auflösung 2K, fertiger Clip rechts. Dieser Screenshot lief mit der Standardeinstellung von 8 Sekunden im Playground, deshalb steht auf dem Run-Button $1,12; meine beiden Takes oben liefen mit 10 Sekunden für je $1,40.

Schritt 4: Den MiniMax-H3-Lip-Sync- und Audio-Kontrolltake ausführen

Ändern Sie eine Eingabe und jede Erwähnung davon. Entfernen Sie die MP3 aus refers, sodass nur das Bild übrig bleibt, löschen Sie die <Audio 2>-Definition, streichen Sie die Phrase „in der Stimmtimbre von <Audio 2>“ aus der Zusammenfassung und ändern Sie das Klammer-Tag zu [image reference]. Sonst bewegt sich nichts, und die Einstellungen bleiben identisch: 2K, 10 Sekunden, 16:9.

Genau das macht es zu einem Kontrolltake statt zu einem zweiten Versuch. Das Modell hat jetzt keinen Klanganker, also erfindet es eine Stimme aus der schriftlichen Beschreibung und synchronisiert die Lippen zu der Stimme, die es gerade erfunden hat. Beide Takes kamen mit 10,13 Sekunden zurück und berechneten jeweils $1,40, auf den Cent genau.

WnfqR2I-a-8

Sound an. Take A für sich allein: gleicher Frame, gleiche Zeilen, kein Referenzaudio. Die Stimme hier ist die Erfindung des Modells, und der Mund folgt ihr trotzdem.

Zwei Takes, eine Variable. Das ist das günstigste Experiment in diesem gesamten Artikel und das einzige, das Ihnen sagt, was der Audio-Slot tatsächlich tut.

Schritt 5: MiniMax H3 Lip Sync und Audio absichtlich brechen

Der letzte Schritt ist kostenlos, und es lohnt sich, ihn einmal zu machen, damit Sie den Fehler um 2 Uhr nachts erkennen.

Legen Sie die MP3 in refers und sonst nichts. Kein Bild, kein Video, nur Audio. Dann senden Sie ab.

plaintext
1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "minimax/h3/reference-to-video",
6    "prompt": "A man at a radio microphone speaks two lines into the windscreen.",
7    "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}],
8    "resolution": "2K",
9    "duration": 10,
10    "ratio": "16:9"
11  }'
12

Hier ist der Teil, den es zu wissen lohnt, weil er nicht das ist, was das Schema nahelegt. Der Submit-Aufruf liefert HTTP 200 mit einer normalen Task-ID und "status": "processing", ein naiver Client denkt also, es habe funktioniert. Dreiundzwanzig Millisekunden später ist der Task tot:

plaintext
1{
2  "status": "failed",
3  "error_code": 1010001,
4  "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video",
5  "latency_ms": 23
6}
7

Auf dieser Vorhersage erschien nie ein price-Feld, es hat also nichts gekostet. Die praktische Lektion betrifft Ihren Code, nicht Ihren Geldbeutel: Ein 200 beim Submit ist kein Erfolg. Pollen Sie die ID und prüfen Sie status, bevor Sie annehmen, dass Sie einen Clip haben.

Vier weitere Wege, MiniMax H3 Lip Sync und Audio auszureizen

Der Zwei-Takes-Test ist das kleinste nützliche Experiment. Hier geht derselbe Slot als Nächstes hin.

Ein Shot, mehrere Sprachen. Behalten Sie den Frame, behalten Sie die Blockierung, ändern Sie das Sprach-Tag in <d>...</d> und führen Sie es erneut aus. Der Mund folgt der neuen Sprache statt der alten, weil Mund und Stimme aus demselben Forward-Pass kommen. Die Model Card listet stabilen Dialog-Support für 11 Sprachen: Arabisch, Chinesisch, Englisch, Französisch, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch, Russisch und Spanisch, wobei weitere in unterschiedlichem Maße unterstützt werden. Diese beiden Clips sind derselbe Trailer mit zwei verschiedenen Sprachspuren, und MiniMax hat aus demselben Setup auch eine französische Version und eine versionsfreie Version ohne Erzählung geschnitten.

hj7ZId3KOKk

Sound an. Die englische Voice-over-Version: eine Astronauten-Nahaufnahme auf einem stauborangen Planeten, Erzählung und Score kommen mit dem Bild. Trailer-Arbeit sind dieselben drei Prompt-Felder mit einer anderen Klangkulisse.

Hv62FGyBNPM

Sound an. Die japanische Version, Frame für Frame derselbe Trailer. Nichts wurde neu synchronisiert und keine separate VO-Session fand statt.

Gesang, mit einem Hook, den Sie bereits besitzen. Hier hört kostenloses Eingabe-Audio auf, eine Fußnote zu sein. Legen Sie einen vorhandenen Hook oder ein Instrumental in refers mit 15 Sekunden oder weniger, beschreiben Sie die Performance, und der Charakter performt dazu. Sie zahlen nicht für die Musik, die Sie mitbringen.

zui3Zw_UWnY

Sound an. Eine Band in einem Retro-Camcorder-Look, Backstage in die Performance, mit Track und Bild, die zusammen ankommen. Das ist die Form, die die meiste Musikvideo-Arbeit tatsächlich will.

Zwei Personen, die sprechen, sind schwerer als eine. Ein einzelner Sprecher in der Nahaufnahme ist der einfache Fall – genau deshalb hat dieser Artikel ihn verwendet. Bei Dialog zwischen zwei Charakteren beschriften Sie sie explizit, wie es MiniMax' eigenes Beispiel tut, mit <Subject 1> (S1) und <Subject 2> (S2) an jeder <d>-Zeile, und rechnen Sie mit Neu-Würfeln, wenn das Modell die Reihenfolge oder die Zuordnung falsch bekommt. Kalkulieren Sie zwei Läufe pro Zwei-Personen-Szene ein.

Atmosphäre ohne ein gesprochenes Wort. overall_soundscape ist ein eigenes Feld, und es funktioniert ganz ohne Dialog. Regen auf Glas, ein Stuhlknarren, ein Kühlschrankbrummen, der Raum selbst. Das macht denselben Endpunkt zu einem legitimen ASMR- und Atmosphäre-Tool – und es ist die eine Verwendung, bei der der Mund nie zählt.

Eine ehrliche Grenze aus meinen eigenen zwei Takes: Die Same-Pass-Generierung bedeutet, dass Mund und Stimme übereinstimmen, und sie bedeutet nicht, dass jedes physische Detail im Bild mit dem Ton übereinstimmt. Lange Zeilen, die in eine kurze Dauer gequetscht werden, vage Performance-Anweisungen und Szenen mit mehreren Sprechern verschlechtern alle das Ergebnis. Sehen Sie sich Ihren Clip an, bevor Sie ihn ausliefern, so wie Sie einen Take eines menschlichen Schauspielers ansehen würden.

Was MiniMax H3 Lip Sync und Audio mich tatsächlich gekostet hat

Jede Zahl unten ist eine echte Belastung auf einem echten Konto, im Nachhinein abgerufen. Das price-Feld einer Vorhersage füllt sich spät, also liefert das Pollen bis completed oft nichts. Rufen Sie die ID erneut ab, um die Zahl zu bekommen.

SchrittModellWas liefAbgerechnet
1openai/gpt-image-2/text-to-image1 Basisframe, Qualität hoch, 2048x1152$0,1745 (auf dem Run-Button zitiert)
2minimax/speech-2.6-hd99 Zeichen, 6,19 s Referenzstimme$0,01
3minimax/h3/reference-to-videoTake B, 10 s bei 2K, Bild + Audio in refers$1,40
4minimax/h3/reference-to-videoTake A, 10 s bei 2K, nur Bild$1,40
5minimax/h3/reference-to-videoAudio-only-Anfrage, nach 23 ms fehlgeschlagen$0,00
Gesamtes Experiment, beide Takesetwa $2,98

Zwei Abrechnungsanmerkungen, denn Ehrlichkeit ist billiger als eine Fußnote. Die fehlerhafte audio/mpeg-Daten-URL in Schritt 3 hat ebenfalls nichts gekostet, da sie beim Submit eine 400 lieferte. Ablehnungen sind kostenlos, aber eine wohlgeformte Anfrage mit einer kaputten Eingabe ist es nicht – eine Referenz-URL, die still eine 404 liefert, wird Ihnen also den vollen Betrag berechnen. Und der Playground-Screenshot in Schritt 3 ist ein dritter H3-Lauf mit den Standard-8-Sekunden des Panels, der zusätzlich zur Tabelle $1,12 berechnete. Dieser Lauf existiert für diesen Artikel, nicht für das Experiment.

Die alte Kette, weiter oben in der Tabelle bepreist, kostete etwa $3,49 für einen einzigen 10-Sekunden-Shot plus einen Abend manueller Ausrichtung. Das hier waren zwei komplette 10-Sekunden-Shots mit Ton, ein kontrollierter A/B und zwei absichtlich kaputte Anfragen – für weniger.

Das gesagt: H3 ist das falsche Werkzeug für mehrere Aufgaben, die man ihm geben wird, und die Alternativen sind billiger.

Was Sie eigentlich wollenDas richtige ModellPreisWarum
Ein Porträt plus eine vorhandene Audiodatei, in einen sprechenden Kopfbytedance/avatar-omni-human-v1.5$0,12/sZweckgebautes Audio-zu-Video, und die Ausgabelänge folgt Ihrem Audio
Einen fertigen Clip, dessen Mund eine neue Sprache sprechen sollsync/lipsync-v3$0,22/sH3 modifiziert Ihren vorhandenen Render nicht, und Patchen ist genau der Job dieses Modells
Die günstigste mögliche Mundkorrektur an einem sprechenden Kopfveed/lipsync$0,013/sEtwa zehnmal billiger, und es berührt nur den Mund, nicht die Performance
Einen ganzen inszenierten Shot, mit Timbre, Atmosphäre und Score zusammenminimax/h3/reference-to-video$0,14/sBild und Ton kommen aus einem Durchgang, also wird die Performance entworfen statt repariert

Wenn Sie zwischen H3 und seinem nächsten Rivalen bei Charakterarbeit statt bei Audio wählen, ist der Seedance-2.5-Vergleich die bessere Lektüre. Und wenn Sie sich fragen, ob die offenen Gewichte das kostenlos machen: Sie machen es nicht schnell. 2K kommt weiterhin von der API-Seite, und Community-Berichte beziffern ein lokales 10-Sekunden-480p-Rendering mit Minuten statt Sekunden auf Consumer-Karten.

Eine ehrliche Anmerkung zu Stimmen, Songs und Rechten

Kostenlos hochzuladen ist nicht dasselbe wie kostenlos zu nutzen. Ein Song, den Sie nicht geschrieben haben, und eine Stimme, die nicht Ihre ist, sind zwei getrennte Berechtigungen, und keine davon wird von einer API gewährt, die Ihnen für den Upload nichts berechnet. Verwenden Sie eigene Aufnahmen, lizenzierte Musik oder eine synthetische Stimme, die Sie selbst generiert haben – genau das macht Schritt 2.

Separate dazu: Die Community-Gewichte tragen territoriale Begrenzungen, die derzeit die EU, das Vereinigte Königreich, Südkorea und die USA nicht abdecken, wobei stattdessen ein formeller Lizenzierungskanal offen steht. Das ist eine längere Geschichte, und sie wird im MiniMax-H3-Open-Weights-Guide erzählt.

MiniMax H3 Lip Sync und Audio: Häufig gestellte Fragen

Erzeugt MiniMax H3 Lip Sync und Audio den Ton wirklich im selben Durchgang, oder wird danach nachsynchronisiert?

Selber Durchgang. Text läuft durch den H3-Encoder, Visuelles durch den H3-Encoder plus den H3-VisualVAE, und Audio durch einen eigenständigen H3-AudioVAE. Der H3-Omni-Transformer sagt die Video- und Audio-Latents gemeinsam voraus, die dann getrennt in Bild und 32-kHz-Stereo-Audio dekodiert werden. Nichts wird danach aufgeschichtet, und genau deshalb gehören Mund, Atem und Raumklang zu demselben Take.

Kann ich meinen eigenen Song oder meine eigene Stimme in MiniMax H3 Lip Sync und Audio einspeisen, und kostet das extra?

Ja – und nein. Die Pay-as-you-go-Tabelle von MiniMax listet H3-Audio-Eingabe als kostenlos. Die Asymmetrie, auf die Sie achten sollten, ist Video: Eingabevideo wird nach Dauer zum Ausgabesatz abgerechnet, $0,13 pro Sekunde bei 2K, also kosten 15 Sekunden Referenzvideo etwa $1,95, während 15 Sekunden Referenzaudio $0 kosten.

Warum lehnt MiniMax H3 Lip Sync und Audio eine Anfrage ab, die nur Audio enthält?

Weil Audio der einzige Referenztyp ist, der nicht allein reisen kann. Es muss von mindestens einem Bild oder Video begleitet sein. Die restlichen Limits laut H3-Base-Ref2VA-Spezifikation: bis zu 9 Bilder, bis zu 3 Videos und bis zu 3 Audioclips, jeder Video- oder Audioclip zwischen 2 und 15 Sekunden, 15 Sekunden gesamt pro Typ, und maximal 12 Dateien über alle Typen in einer Anfrage.

Hält MiniMax H3 Lip Sync und Audio über einen ganzen Clip oder nur über die erste Zeile?

Bei einem einzelnen Sprecher mit Luft zum Atmen hält es über den Clip, statt eine Zeile zu treffen und dann abzudriften. Drei Dinge brechen es: ein langes Skript in eine kurze Dauer zu quetschen, vage oder fehlende Performance-Anweisungen und Szenen mit mehreren Sprechern, in denen das Modell entscheiden muss, wer wann spricht. Geben Sie jeder Zeile einen beschrifteten Sprecher und genug Sekunden, um sie zu sagen.

Braucht MiniMax H3 Lip Sync und Audio für eine andere Sprache eine Neu-Synchronisation?

Nein. Ändern Sie das Sprach-Tag in der Dialog-Markierung von <d>[English] ...</d> zu <d>[Japanese] ...</d> und führen Sie denselben Prompt erneut aus. Der Mund wird mit der neuen Stimme generiert, also passt er zur neuen Sprache statt zur alten. Die Model Card listet stabilen Dialog-Support für 11 Sprachen.

Ist es billiger, MiniMax H3 Lip Sync und Audio lokal auszuführen?

Billiger pro Clip, teuer in jeder anderen Hinsicht. Die Gewichte sind offen, aber Community-Berichte über lokale Läufe auf 16-GB-Consumer-Karten messen eine 10-Sekunden-480p-Generierung in Minuten, Self-Hosting rendert mit einer kurzen Seite von 768, und 2K kommt weiterhin aus dem API-seitigen Regenerierungsschritt. Dazu die territorialen Begrenzungen in der Community-Lizenz – und die API bleibt der pragmatische Weg für fertige Arbeit.

Neueste Modelle

Eine API für alle Media-KI.

Alle Modelle erkunden