Seedance 2.5 ist jetzt live — Zuerst auf Atlas Cloud

MiniMax H3 Videoreferenz: Ein Charakter, zwei Aufnahmen und die Regel, die leise Ihr Geld nimmt

Jeder Leitfaden wiederholt das 9/3/3-Datenblatt. Dieser führt es aus: eine Two-Shot-Szene aus Bild-, Video- und Audio-Referenzen in einem MiniMax H3-Verweis auf einen Videoanruf.

Jeder Artikel über dieses Modell endet an derselben Stelle. Neun Bilder, drei Videoclips, drei Audioclips, zwölf Dateien insgesamt. Es liest sich wie eine Garantiekarte.

Also habe ich es wie eine solche behandelt. Ich habe eine Figur erstellt, ein Requisit gebaut, eine Nachtszene generiert, diese Nachtszene als Referenzvideo zurückgespeist, acht Sekunden Jazz in eine Referenz-Audiodatei geschnitten und alle drei Referenztypen in einer einzigen Anfrage verarbeitet. Dann habe ich absichtlich die Regeln gebrochen, um zu sehen, welche die API tatsächlich verteidigt.

Vier davon werden nicht so verteidigt, wie man es erwarten würde. Eine davon berechnet dir immer noch den vollen Preis für ein Video, das du nicht angefordert hast, und die erhoffte Fehlermeldung kommt nie. Das ist die, die es wert ist, bis zum Ende gelesen zu werden.

Wichtige Erkenntnisse

  • Drei Referenztypen, ein Array. Bis zu 9 Bilder, 3 Videoclips und 3 Audioclips, insgesamt 12 Dateien. Sie alle kommen in dasselbe refers-Feld, und type ist optional, da die API ihn aus der Dateierweiterung ableitet.
  • Audio kann niemals allein fliegen. Eine reine Audio-Anfrage wird mit einem benannten Fehler abgelehnt. Sie muss mit mindestens einem Bild oder einem Video mitfahren.
  • Referenz zu Video und Bild zu Video schließen sich gegenseitig aus, aber nichts sagt dir das. Sende ein erstes Einzelbild image zusammen mit refers und der Auftrag wird trotzdem abgeschlossen. Einer deiner beiden Eingaben wird stillschweigend verworfen, zum vollen Preis. Zweimal verifiziert am 12.08.2026, an beiden Endpunkten.
  • Nichts wird bei der Übermittlung validiert. Jede falsche Anfrage in diesem Artikel gab HTTP 200 und eine ID zurück. Das wahre Urteil fällt zwei bis drei Minuten später in der Generierungsphase. Ablehnungen dort sind kostenlos; Fertigstellungen nicht.
  • Zusätzliche Referenzdateien sind kostenlos. Ein Referenzbild und zehn Referenzbilder werden für dieselbe Cliplänge exakt gleich abgerechnet. Der Preis folgt den Ausgabesekunden, nicht der Eingabeanzahl.

Hier ist, was hinten rauskam. Zwei Aufnahmen, ein Gesicht, zwei völlig verschiedene Orte, und die zweite Aufnahme wurde gleichzeitig aus einem Bild, einem Video und einer Audiodatei erstellt.

Aufnahme A (Regen, Nacht, Neon-Gasse), dann Aufnahme B (leerer überdachter Markt am nächsten Morgen), zusammengeschnitten mit nichts außer der Verbindung. Dieselbe Frau, dieselbe Narbe über der rechten Augenbraue, dieselbe indigoblaue Jacke, dasselbe Handtuch. Aufnahme B wurde aus drei Referenzen gleichzeitig generiert: ihrem Porträt, dem Aufnahme-A-Clip selbst und einem acht Sekunden langen Jazz-Ausschnitt. Beide Aufnahmen sind minimax/h3/reference-to-video in 2K, 2560x1440, 24fps, mit der nativen 32kHz-Stereospur. Es lohnt sich, den Ton für die zweite Hälfte einzuschalten, wo sie ihren Satz spricht.

Warum MiniMax H3 Referenz zu Video jeden Prompt schlägt, den du schreiben kannst

Ein Prompt beschreibt eine Person. Eine Referenz ist die Person. Dieser Unterschied ist der ganze Grund, warum dieser Endpunkt existiert, und warum MiniMax H3 derzeit ganz oben auf der Videobearbeitungs-Rangliste steht: Elo 1.125 bei 10.280 Stimmen (Artificial Analysis, August 2026). Es lohnt sich, bei dieser Zahl präzise zu sein: Dieselbe Tabelle listet seinen Rangbereich als 1 bis 2, statistisch gleichauf mit Google Gemini Omni Flash bei 1.122. Erster Platz, innerhalb eines Konfidenzintervalls, das es teilt. Die damit verbundene Behauptung, dass H3 auch unter den ersten drei für Text-zu-Video und Bild-zu-Video liegt, stammt aus dem Ankündigungsbeitrag desselben Labors (Artificial Analysis auf X, August 2026).

Ränge sind billig. Hier ist das tatsächliche Verhalten, derselbe Prompt, drei Referenzstufen, alles andere identisch.

nehmen wir mal an

Drei MiniMax H3 Referenz-zu-Video-Durchläufe mit demselben Prompt: keine Referenz, ein Charakter-Referenzbild und zwei Referenzbilder

Derselbe Prompt, gleiche 768P 4s-Einstellungen, von links nach rechts: überhaupt keine Referenzen (Text-zu-Video), ein Charakter-Referenzbild, zwei Referenzbilder (Charakter plus die Ramen-Schüssel). Der Prompt sagt in allen drei Fällen „die Frau aus dem Referenzbild". Im linken Panel bezieht sich dieser Satz auf niemanden, also erfindet das Modell eine Fremde. Generiert mit minimax/h3/text-to-video und minimax/h3/reference-to-video.

Zwei ehrliche Lesarten dieses Streifens. Der Sprung von Panel eins zu Panel zwei ist enorm: Ohne Referenz ist „die Frau aus dem Referenzbild" ein Satz, der auf nichts verweist, und das Modell füllt das Loch stillschweigend mit einer Person, die keine Beziehung zu deinem Projekt hat. Der Sprung von Panel zwei zu Panel drei ist viel kleiner, weil mein Prompt die Schüssel auch in Worten beschrieben hat und H3 eine passable marineblaue Schüssel mit einem Kranich darauf allein aus dem Text gezeichnet hat. Das ist der nützliche Teil. Ein Referenzbild und eine gute Nominalphrase konkurrieren um dieselbe Aufgabe, also gib deine Referenzslots für die Dinge aus, die Sprache nicht festnageln kann: ein bestimmtes Gesicht, ein bestimmtes Produkt, ein bestimmtes Logo.

Das Muster hinter fast jedem Fehlschlag in diesem Artikel ist dasselbe wie in Panel eins. Nichts warnt dich davor, dass ein Teil deiner Anfrage ins Leere gelaufen ist.

Was eine Referenz tatsächlich festlegt und was nicht. Ein Referenzbild fixiert die Identität: Gesichtsstruktur, Haar, Unterscheidungsmerkmale, Kleidungsstück. Es fixiert nicht die Beleuchtung, und das ist die häufigste Überraschung. Es zieht auch das Licht des Referenzfotos mit sich, weshalb ein Charakterblatt, das in einer stimmungsvollen Umgebung aufgenommen wurde, einen Charakter hervorbringt, der einen Szenenwechsel nicht überlebt. Fotografiere deine Referenz flach und neutral. Ein Referenzvideo fixiert Bewegung, Grading und Körnung, nicht die Identität. Eine Referenzaudio fixiert das Audiobett selbst. Wenn du dasselbe Gesicht brauchst, das eine Zeile in derselben Stimme über eine Serie liest, dann erledigt der Referenzstapel drei verschiedene Aufgaben, und du musst sagen, welche welche ist. Praxisleitfäden sind sich einig, sie im Prompt positionell zu benennen („Bild 1 ist der Charakter, Bild 2 ist das Produkt"), und diese Konvention ist es wert, übernommen zu werden; meine Prompts unten verwenden stattdessen eine einfache beschreibende Benennung, die auch funktioniert, wenn die Referenzen visuell eindeutig sind.

Warum der erste Aufruf normalerweise enttäuscht. Vier Dinge, alle gemessen am 12.08.2026:

  1. Der Submit-Endpunkt validiert nichts. Falscher MIME, 164 Sekunden Audio, eine tote URL, sich gegenseitig ausschließende Felder: Alles gibt HTTP 200 mit einer Vorhersage-ID zurück. Du erfährst es später.
  2. ratio standardmäßig auf adaptive, dokumentiert als „lass das Modell wählen". Bei 16:9-Referenzen bekam ich 1344x768 bei 768P, egal ob ich es auf adaptive ließ oder 16:9 erzwang, also ist die Voreinstellung harmlos, wenn deine Eingaben bereits übereinstimmen. Es ist ein Münzwurf, wenn sie es nicht tun, und dies ist der einzige H3-Endpunkt, bei dem du die Entscheidung einfach aus der Hand nehmen kannst.
  3. Ein erstes Einzelbild plus Referenzen ergibt keinen Fehler. Es verwirft stillschweigend eines davon und belastet dich.
  4. Wenn das Modell nichts Konkretes hat, woran es sich festhalten kann, füllt es die Lücke selbstbewusst, und ein selbstbewusstes falsches Gesicht sieht genauso aus wie ein erfolgreicher Durchlauf.

Für die Prompt-Erstellungsseite dazu geht der MiniMax H3 Prompt Guide tiefer auf die Formulierung ein, als ich es hier kann.

Das MiniMax H3 Referenz-zu-Video-Regelwerk: Drei Typen, eine Anfrage

Alle drei Referenztypen teilen sich ein Array. Hier ist der veröffentlichte Vertrag, neben dem, was der Endpunkt tatsächlich tat, als ich ihn drückte.

Tabelle 1: Die drei Referenztypen

ReferenzbilderReferenzvideoReferenzaudio
Max. Dateien93 Clips3 Clips
Kombinierte Obergrenze12 Dateien über alle drei Typen
Dauer pro Datein/a2 bis 15 Sekunden2 bis 15 Sekunden
Gesamtdauern/a15 Sekunden15 Sekunden
Formatepng, jpeg, jpg, webpmp4, movmp3, wav
Kann allein verwendet werden?JaJaNein, benötigt ein Bild oder ein Video
Was es festlegtIdentität, Kleidung, Produkt, StilBewegung, Kamera, Grading, Körnungdas Audiobett selbst
Was es nicht festlegtBeleuchtung der neuen Szenewer im Bild istdie exakte Spur (siehe Schritt 6)
Geliefert alsöffentliche URL oder Base64-Daten-URLöffentliche URL oder Base64-Daten-URLmuss als audio/mp3 deklariert werden, nicht audio/mpeg
Durchgesetzt?10 Bilder funktionierten problemlosnicht über 1 Clip hinaus getestetFenster pro Clip durchgesetzt, 15s gesamt wurde nicht

Dateianzahlen und Dauerfenster sind MiniMax' veröffentlichte Grenzen (Hailuo, August 2026), gegengeprüft mit dem Launch-Artikel, der dasselbe Referenzvideo-Fenster von 2 bis 15 Sekunden pro Clip und 15 Sekunden insgesamt auflistet (MarkTechPost, August 2026). Alles in den letzten drei Zeilen stammt von mir, gemessen.

Zwei Dinge, die das Datenblatt nicht verrät. Erstens: Das type-Feld bei jedem Eintrag ist optional und wird aus der URL-Erweiterung abgeleitet, was bedeutet, dass eine Base64-Daten-URL oder ein erweiterungsloser Link **seinen Typ deklarieren muss, sonst errät die Anfrage falsch. Zweitens: Der Browser-Uploader begrenzt auf neun Dateien (Referenzmaterialien (2/9), MAX:9 im Screenshot von Schritt 5 unten), unter MiniMax' eigenen zwölf. Ich habe trotzdem zehn Referenzbilder über die API gesendet, und der Auftrag wurde normal abgeschlossen, also ist neun eine UI-Grenze, keine Modellgrenze.

Tabelle 2: Referenz-zu-Video vs. Bild-zu-Video vs. Text-zu-Video

reference-to-videoimage-to-videotext-to-video
Akzeptiert refersja, erforderlich, mind. 1nein (stillschweigend ignoriert)nein
Akzeptiert image first framenein (stillschweigend ignoriert)ja, erforderlichnein
Akzeptiert end_image last frameneinjanein
ratio-Optionenalle 7, inkl. 16:9, 9:16, 21:9nur adaptivealle 7
Auflösung768P oder 2K, Standard 2Kgleichgleich
Dauer4 bis 15s Ganzzahlen, Standard 8gleichgleich
Mischen der Eingabe des anderen EndpunktsAuftrag abgeschlossen, Eingabe verworfen, volle GebührAuftrag abgeschlossen, refers verworfen, volle Gebührn/a

Die vierte Zeile ist der Unterschied, den niemand erwähnt. Bei Bild-zu-Video enthält das Seitenverhältnis-Enum genau einen Wert, adaptive, weil das erste Bild die Form bestimmt. Bei Referenz-zu-Video bekommst du alle sieben, was dies zum einzigen H3-Endpunkt macht, an dem du eine Bildform erzwingen kannst, während du immer noch einen Charakter verankerst. Wenn du für diese Arbeit eine Stufe auswählst, behandelt 2K vs. 768P für MiniMax H3, was die zusätzlichen Pixel bringen.

Die letzte Zeile ist die teure. Die Dokumentation stellt die beiden Endpunkte als sich gegenseitig ausschließend dar, und das sind sie auch, in dem Sinne, dass nur ein Eingabepfad berücksichtigt wird. Aber es gibt keinen Fehler. Ich habe es am 12.08.2026 auf beide Arten ausgeführt: Ein reference-to-video-Aufruf mit einem ersten Einzelbild image wurde in 115 Sekunden abgeschlossen und mit 0,40 $ berechnet, und ein image-to-video-Aufruf mit refers wurde in 167 Sekunden abgeschlossen und mit 0,40 $ berechnet. Beide produzierten ein Video. Beide warfen die Hälfte dessen weg, was ich gesendet hatte, und kein Feld in der Antwort sagt, welche Hälfte.

Tabelle 3: Die Modelle, die dieser Workflow verwendet

Alles unten läuft in einem Browser-Tab auf Atlas Cloud, von wo die Preise und Screenshots stammen. Preise geprüft am 12.08.2026.

SchrittModellSatzLäufe hierKosten
Charakter- + Requisit-Referenzopenai/gpt-image-2/text-to-imagegelistet ab $0,009; hohe Qualität bei 2048x1152 gemessen bei $0,17452$0,35
Referenzaudiominimax/music-2.6$0,15 pro Spur1$0,15
Aufnahme A und Aufnahme Bminimax/h3/reference-to-video$0,10/s bei 768P, $0,14/s bei 2K2 x 8s bei 2K$2,24
Referenzleitergleich, plus minimax/h3/text-to-video$0,10/s bei 768P3 x 4s bei 768P$1,20

Auf keinen der drei H3-Endpunkte ist in diesem Monat ein Rabatt aktiv. Zwei Nachbarn sind derzeit günstiger, wenn du nur Referenz-Standbilder erstellst: gpt-image-2-developer/text-to-image ist bei 50 % Rabatt, $0,009 auf $0,004 reduziert, Stand August 2026. Vollständige Aufschlüsselung pro Sekunde findest du im MiniMax H3 API-Preisleitfaden.

MiniMax H3 Referenz zu Video, Schritt für Schritt

Die Szene: Eine Frau, die einen Ramen-Stand betreibt. Aufnahme A ist eine regnerische Neon-Gasse bei Nacht. Aufnahme B ist dieselbe Frau am nächsten Morgen in einem leeren überdachten Markt, ein anderer Ort, eine andere Tageszeit und eine andere Linse. Nichts wird zwischen den beiden Aufrufen übertragen außer den Referenzen, was der Sinn des Tests ist.

Schritt 1: Baue die Charakter-Referenz, absichtlich flach ausgeleuchtet

Das ist der Schritt, den die Leute falsch machen. Eine Charakter-Referenz ist kein schönes Foto deines Charakters, es ist eine Messung seines Gesichts. Neutrales Licht, einfacher Hintergrund, keine Szene, keine Stimmung. H3 lernt das Licht zusammen mit dem Gesicht, also produziert eine atmosphärische Referenz einen Charakter, der an diese Atmosphäre geschweißt ist.

Modell: openai/gpt-image-2/text-to-image. Einstellungen: quality high, size 2048x1152 (16:9), format png.

text
1Editorial photograph of a woman in her early thirties, a street-food chef. Close three-quarter portrait, neutral expression, direct eye contact with camera. Short black hair tucked behind one ear, a small scar above the right eyebrow, warm olive skin. She wears a faded indigo work jacket with the sleeves rolled to the elbow and a folded white towel over the left shoulder. Plain light grey studio background, soft even key light, no props, sharp focus on the face, natural skin texture, no retouching. Photorealistic, 50mm lens.
2

Screenshot des KI-Bildgenerators mit eingegebenem Prompt und generiertem Porträt

GPT Image 2 Playground auf Atlas Cloud mit dem geladenen Charakter-Referenz-Prompt und dem fertigen Porträt im Ausgabefenster

GPT Image 2 auf Atlas Cloud: Qualität auf high gesetzt, 16:9, das Charakterblatt rechts gerendert.

Frau in blauem Overall mit einem über die Schulter gelegten Handtuch

Charakter-Referenzbild für MiniMax H3 Referenz-zu-Video: neutrales Studio-Porträt einer Ramen-Köchin mit einer Narbe über der rechten Augenbraue

Referenzbild 1. Die Narbe über der rechten Augenbraue und das gefaltete weiße Handtuch sind bewusst gewählt: Sie sind billige, eindeutige Identitätsanker, die du in jedem späteren Bild überprüfen kannst.

Schritt 2: Baue die Requisiten-Referenz

Zweiter Referenzslot, zweite Aufgabe. Objekte verhalten sich hier besser als Gesichter, was eine markante Requisite zum einfachsten Weg macht, zu beweisen, dass eine Referenz angekommen ist. Gleiches Modell, gleiche Einstellungen.

text
1Product photograph of a single dark navy ceramic ramen bowl with a hand-painted white crane on the side, chipped at the rim, filled with steaming shoyu ramen. Straight-on view, plain light grey background, soft even light, sharp focus, photorealistic, 50mm lens.
2

Schwein, (5) Ei, (6) und (7) grüne (8) Zwiebeln (9)

Requisiten-Referenzbild: dunkelmarineblaue Ramen-Schüssel mit handbemaltem weißem Kranich und abgesplittertem Rand

Referenzbild 2. Der handbemalte Kranich und der Splitter am Rand sind die Indizien. Wenn sie im Video überleben, wurde die Referenz gelesen.

Schritt 3: Aufnahme A, zwei Bilder in MiniMax H3 Referenz-zu-Video

Zwei Referenzbilder, beide type: "image", in refers. Setze das Seitenverhältnis explizit. adaptive ist die Voreinstellung und wird normalerweise das Richtige tun, wenn deine Referenzen bereits 16:9 sind, aber es entscheidet für dich, und bei diesem Endpunkt musst du das nicht zulassen.

Modell: minimax/h3/reference-to-video. Einstellungen: resolution 2K, duration 8, ratio 16:9.

text
1Wide establishing shot. Heavy rain at night in a narrow neon-lit alley. The woman from the reference image works alone behind a small steaming ramen stall under a plastic awning, ladling broth into the navy bowl with the white crane from the reference image. Steam rises through pink and green neon reflections on the wet pavement. Slow push-in on the stall. Ambient sound: rain on plastic, boiling broth, distant traffic. No dialogue.
2

Die Ausgabe dieses Aufrufs ist die erste Hälfte des oben gezeigten Clips. Behalte seine URL. Sie ist die Eingabe für Schritt 5.

Schritt 4: Schneide eine acht Sekunden lange Referenzaudio

Referenzaudio ist kein Soundtrack-Slot. Es ist ein Bett, an dem das Modell seinen eigenen Mix misst, und es ist die pingeligste Eingabe an diesem Endpunkt. Generiere einen Track, schneide ihn dann zurecht, denn ein vollständiger Song wird abgelehnt.

Modell: minimax/music-2.6, mit is_instrumental: true und format: "mp3".

text
1Sparse late-night jazz, brushed snare, upright bass, one muted trumpet, melancholic, 70 BPM, instrumental.
2

Dann schneide etwa acht Sekunden ab und kodiere es als data:audio/mp3-URL. Drei Dinge, die ich hier zuerst falsch gemacht habe, alle mit dem genauen Fehlertext:

  • Der MIME-String ist wichtiger als die Bytes. Deklariere data:audio/mpeg und die Referenz wird mit audio format ".mpeg" not allowed abgelehnt, obwohl die Datei eine ganz normale MP3 ist. Schreibe audio/mp3.
  • 2 bis 15 Sekunden pro Clip, und das wird durchgesetzt. Mein generierter Track war 164 Sekunden lang. Es kam zurück als invalid param: audio duration 164258 ms, expected [2000, 15000] ms. Das Zuschneiden auf 8,05 Sekunden behob das Problem. Beide Ablehnungen kosteten nichts.
  • Die kombinierte Obergrenze von 15 Sekunden ist dokumentiert, wird aber nicht durchgesetzt. Ich habe zwei 8-Sekunden-Clips in derselben Anfrage gesendet, insgesamt 16,1 Sekunden, und eine Ablehnung erwartet. Der Auftrag wurde abgeschlossen und normal abgerechnet. Baue nicht darauf auf: Es ist als Limit veröffentlicht und könnte sich jederzeit wie eines verhalten.

KI-Musikgenerator-Oberfläche mit Text-Prompt und generierter Audio-Wellenform

MiniMax Music 2.6 Playground auf Atlas Cloud mit dem Jazz-Prompt und dem fertigen Track im Ausgabefenster

MiniMax Music 2.6 auf Atlas Cloud, $0,15 pro Durchlauf, fertiger Track rechts. Eine Sache, die du aus diesem Screenshot übernehmen solltest, und eine, die du nicht solltest: Der Preis und das mp3-Format sind richtig, aber Is Instrumental ist noch ausgeschaltet und die Demo-Texte der Seite stehen noch im Feld, also kam dieser spezielle Durchlauf als 1:35 langes Lied mit Gesang zurück. Schalte diesen Schalter um und leere das Lyrics-Feld, bevor du es ausführst, sonst schneidest du ein Referenzbett, über das jemand singt. Mein API-Durchlauf mit isinstrumental: true gab 2:44 Instrumentalmusik in 209 Sekunden zurück.

Schritt 5: Aufnahme B, ein MiniMax H3 Referenz-zu-Video-Aufruf mit allen drei Typen

Das ist der Aufruf, um den es bei dem Schlüsselwort eigentlich geht. Drei Referenztypen, drei verschiedene Aufgaben, ein Array:

  1. das Charakter-Porträt aus Schritt 1, type: "image", um ihr Gesicht zu halten
  2. das Aufnahme-A-mp4 aus Schritt 3, type: "video", um Grading und Körnung über den Schnitt zu tragen
  3. der acht Sekunden lange Jazz-Ausschnitt aus Schritt 4, type: "audio", als Bett

Ausgabe-URLs von anderen Generationen auf der Plattform können direkt in refers als Video-Referenz eingefügt werden, das ist der eigentliche Mechanismus hinter der Multi-Shot-Kontinuität. Nicht „H3 erinnert sich an deinen Charakter". Du gibst die vorherige Aufnahme an es zurück.

Modell: minimax/h3/reference-to-video. Einstellungen: resolution 2K, duration 8, ratio 16:9.

text
1The same woman from the reference image, the next morning. Bright empty covered market, cold clean daylight through a skylight, shutters still down behind her. Medium close-up, static camera. She wipes the counter with the folded white towel, looks up at the camera and says one line, then goes back to work. Keep her face, hair, scar and indigo jacket identical to the reference. Carry the grade and grain of the reference clip. Use the reference audio as the underscore.
2

KI-Videogenerator-Oberfläche mit eingegebenem Prompt und generiertem Video

MiniMax H3 Referenz-zu-Video Playground auf Atlas Cloud mit geladener Bild- und Audio-Referenz und dem generierten Clip im Ausgabefenster

Derselbe Aufruf im MiniMax H3 Referenz-zu-Video Playground, bei 2K und 8 Sekunden. Zwei Referenzslots verschiedener Typen sind in Referenzmaterialien (2/9) sichtbar: Slot 1 ist ref-audio-8s.mp3, Slot 2 ist ihr Porträt. Die Video-Referenz wird über „Add via link" (oben rechts in diesem Panel) oder über die API hinzugefügt, da sie sich unter einer URL und nicht auf der Festplatte befindet. Drei Dinge, die du aus diesem Panel ablesen kannst: Der Uploader sagt MAX:9, obwohl MiniMax' eigene Obergrenze 12 ist, Aspect Ratio steht auf adaptive, wenn du es nicht änderst, und der Run-Preis für 2K bei 8 Sekunden beträgt $1,12, was der Stufe von $0,14 pro Sekunde entspricht.

Schritt 6: Überprüfe, ob die Referenz tatsächlich angekommen ist

Ein abgeschlossener Auftrag ist kein erfolgreicher Auftrag. Zwei Überprüfungen, beide billig.

Überprüfe das Gesicht. Ziehe ein Bild aus jeder Aufnahme und lege sie nebeneinander. Du suchst nach den Ankern, die du gesetzt hast: die Narbe, die Haarlinie, die Jacke, das Handtuch.

Vergleich einer Frau in Neon-Nacht- und Morgenmarkt-Beleuchtung

Bild aus Aufnahme A neben einem Bild aus Aufnahme B, zeigt denselben MiniMax H3 Referenz-zu-Video-Charakter in zwei verschiedenen Szenen

Links: Aufnahme A, Nacht, Neon, weit. Rechts: Aufnahme B, überdachter Markt, nächster Morgen, mittlere Nahaufnahme. Gleiches Gesicht, gleiche Narbe über der rechten Augenbraue, gleiche Jacke und dasselbe Handtuch, über einen Szenen- und Bildausschnittswechsel hinweg, ohne dass außer den Referenzen etwas gemeinsam ist.

Eine Sache ist nicht so gelaufen, wie ich den Prompt geschrieben habe. Ich bat um „bright empty covered market, cold clean daylight" und „carry the grade and grain of the reference clip", und der Referenzclip gewann. Aufnahme B ist unverkennbar Morgen und unverkennbar ein anderer Ort, aber sie ist weitaus stimmungsvoller, als „bright" impliziert, weil das Nacht-Grading mit der Video-Referenz mitkam. Du kannst nicht in einem Aufruf denselben Look und das gegenteilige Licht verlangen. Wenn das Licht sich ändern muss, lass die Grading-Anweisung weg oder lass die Video-Referenz weg und halte die Identität nur mit dem Bild.

Überprüfe das Audio. Zeichne die Wellenform des acht Sekunden langen Ausschnitts, den du hochgeladen hast, neben der Spur, die im mp4 zurückkam, und füge eine Kontrolle hinzu: einen Clip, der ohne Audio-Referenz generiert wurde.

Drei gestapelte Audio-Wellenformen, die hochgeladene, zurückgegebene und Kontroll-Spuren vergleichen

Wellenform der hochgeladenen acht Sekunden langen Referenzaudio, der Audiospur, die im generierten Clip zurückkam, und einer Kontrolle ohne Audio-Referenz

Oben: der 8,05 Sekunden lange Jazz-Ausschnitt, der als Referenz gesendet wurde. Mitte: die Spur, die aus dem zurückgegebenen Aufnahme-B-mp4 extrahiert wurde, dominiert von der Dialogzeile bei etwa 5,5 Sekunden. Unten: Aufnahme A, gleicher Workflow, keine Audio-Referenz.

Hier muss ich etwas korrigieren, was ich vorher geglaubt habe. Referenzaudio kommt nicht wortwörtlich zurück. Die Hüllkurvenkorrelation zwischen meinem Ausschnitt und der zurückgegebenen Spur beträgt 0,25, gegenüber −0,05 für die Kontrolle ohne Referenz, also sind die beiden verwandt, aber bei weitem nicht identisch, und die zurückgegebene Form ist eindeutig ein eigener Mix und nicht meine Datei mit etwas darübergelegt. Was die Referenz eindeutig getan hat, ist, etwas darunterzulegen: Aufnahme B's Bett läuft etwa 7 dB heißer als die Kontrolle ohne Audio über die ersten fünf Sekunden, bevor irgendein Dialog beginnt. Betrachte Referenzaudio als Steuerung für den Mix, nicht als Musik-Slot. Wenn du deinen exakten Track unter dem Bild brauchst, lege ihn später darunter.

Wenn du auf der Audioseite davon aufbaust, gehen MiniMax H3 Lippen-Sync und Audio und die MiniMax H3 Musikvideo-Anleitung beide von diesem selben Referenzaudio-Verhalten aus. Für den Polling- und Wiederholungscode rund um all das enthält das MiniMax H3 Tutorial die Schleife.

Vier weitere MiniMax H3 Referenz-zu-Video-Setups, die es wert sind, übernommen zu werden

Restyle einen Clip, den du bereits besitzt. Lege einen fertigen Clip als Video-Referenz in refers, überhaupt keine Bilder, und bitte um ein anderes Medium. Die Bewegung, der Bildausschnitt, der Hereinzoom und die Requisiten überleben; die Oberfläche ändert sich. Das ist der Mechanismus hinter H3's Videobearbeitungs-Ranking, und es ist derselbe, der hinter der Anime-Arbeit in MiniMax H3 vs. Veo 3.1 für Anime steckt.

Frau, die an einem Imbisswagen in einer Neon-Gasse kocht

Anime-Restyle, generiert aus dem Aufnahme-A-Clip, der als MiniMax H3 Referenz-zu-Video-Referenz verwendet wurde

Die Aufnahme-A-Gasse, als einzige Referenz zurückgegeben, mit einem Cel-Shading-Anime-Prompt. Derselbe Stand, dieselbe Kelle, dieselbe Kranich-Schüssel, derselbe Hereinzoom, neu gezeichnet. Ein Detail, das es wert ist zu wissen: Die Konvertierung ist in den ersten Bildern am schwächsten und am stärksten, sobald die Kamera sich auf die Bewegung festlegt. Gezeigt als stummes GIF. Generiert mit minimax/h3/reference-to-video bei 768P, 4s, $0,40.

Ein Foto zum Singen bringen. Ein Porträt plus ein Vokal-Clip innerhalb des 2- bis 15-Sekunden-Fensters, führe die Performance im Prompt aus. Billiger als eine Lippen-Sync-Pipeline, weil es ein einziger Aufruf ist.

Ein Produkt in jede Szene sperren. Referenzbilder fixieren Objekte stärker als Gesichter, also ist ein echtes Produktfoto plus ein Szenen-Prompt das Zuverlässigste an diesem Endpunkt. Überprüfe vorher, was du mit dem Ergebnis machen darfst, bevor es in eine Anzeige kommt.

Baue eine Serie, keinen Clip. Verkette es: Die Ausgabe von Aufnahme N wird zur Video-Referenz von Aufnahme N+1. Jeder Aufruf ist immer noch auf 15 Sekunden begrenzt, also ist Kontinuität deine Aufgabe, nicht die des Modells. Wie lang ein MiniMax H3 Video sein kann behandelt, wo diese Grenze beißt.

Vergleichst du Engines, bevor du eine Serie einer anvertraust? Seedance 2.5 vs. MiniMax H3 und MiniMax H3 Alternativen sind die beiden zu lesen.

Was eine Zwei-Aufnahmen-MiniMax-H3-Referenz-zu-Video-Szene tatsächlich kostet

Jede Zeile unten ist ein echter Auftrag vom 12.08.2026, mit dem Betrag aus dem price-Feld, das die API bei jeder abgeschlossenen Vorhersage zurückgibt.

Tabelle 4: Die tatsächliche Rechnung

AuftragModellEinstellungenErgebnisAbgerechnet
Charakter-Referenzgpt-image-2high, 2048x1152abgeschlossen$0,1745
Requisiten-Referenzgpt-image-2high, 2048x1152abgeschlossen$0,1745
Referenzaudiomusic-2.6instrumental, mp3abgeschlossen, 164s Track, 209s Wartezeit$0,15
Aufnahme Ah3/reference-to-video2K, 8s, 2 Bild-Referenzenabgeschlossen in 309s$1,12
Aufnahme Bh3/reference-to-video2K, 8s, Bild + Video + Audio-Referenzenabgeschlossen in 557s$1,12
Leiter, keine Referenzh3/text-to-video768P, 4sabgeschlossen in 154s$0,40
Leiter, 1 Bild-Refh3/reference-to-video768P, 4sabgeschlossen in 119s$0,40
Leiter, 2 Bild-Refsh3/reference-to-video768P, 4sabgeschlossen in 128s$0,40
Anime-Restyleh3/reference-to-video768P, 4s, 1 Video-Refabgeschlossen in 239s$0,40
Schritt 5 Wiederholung im Playgroundh3/reference-to-video2K, 8s, Bild + Audio-Referenzenabgeschlossen$1,12
Kontrolle: 10 Bild-Refsh3/reference-to-video768P, 4sabgeschlossen in 150s$0,40
Kontrolle: Erstes Einzelbild + refersh3/reference-to-video768P, 4sabgeschlossen, eine Eingabe verworfen$0,40
Kontrolle: refers bei image-to-videoh3/image-to-video768P, 4sabgeschlossen, refers verworfen$0,40
Kontrolle: 16,1s Referenzaudioh3/reference-to-video768P, 4sabgeschlossen über dokumentiertem Limit$0,40
Kontrolle: ratio ausgelassen, dann ratio adaptiveh3/reference-to-video768P, 4s, zweimalbeide abgeschlossen, identisch 1344x768$0,80
Screenshot-Wiederholungen von Schritt 1 und 4gpt-image-2, music-2.6wie obenabgeschlossen$0,32
Kontrolle: Audio-Referenz alleinh3/reference-to-video768P, 4sfehlgeschlagen in 7ms$0,00
Kontrolle: 164s Referenzaudioh3/reference-to-video768P, 4sfehlgeschlagen in 16s$0,00
Kontrolle: audio/mpeg MIMEh3/reference-to-video768P, 4sfehlgeschlagen in 17s$0,00
Kontrolle: tote Referenz-URLh3/reference-to-video768P, 4sfehlgeschlagen in 21s$0,00
Gesamt$8,18

Teile diese Summe ehrlich auf. Die fertige Zwei-Aufnahmen-Szene am Anfang dieses Artikels, inklusive Referenzen und Audio, macht $2,74 davon aus. Die anderen $5,44 sind die Untersuchung: Kontrollen, absichtliche Fehler und erneutes Ausführen von Schritten im Browser für die Screenshots. Wenn du die Regeln bereits kennst, kostet eine 16-Sekunden-Zwei-Aufnahmen-Sequenz in 2K weniger als ein belegtes Brötchen.

Drei Dinge fallen aus dieser Tabelle heraus.

Referenzen sind kostenlos. Die Kontrolle mit zehn Bildern kostete exakt dieselben $0,40 wie der Leiterdurchlauf mit einem Bild bei derselben Länge und Auflösung. Auf dieser Plattform läuft der Zähler über Ausgabesekunden und Auflösung, sonst nichts. Es ist erwähnenswert, einen Widerspruch zu kennzeichnen: MiniMax' eigene Plattformregeln beschreiben, dass eingehendes Video zum Ausgabesatz abgerechnet wird, und das einheitliche Schema auf OpenRouter führt einen separaten reference_images-Posten. Keiner davon erschien auf meiner Rechnung hier. Wenn du woanders budgetierst, kalkuliere es selbst, anstatt es anzunehmen.

Fehler sind kostenlos und kommen spät. Alle vier Ablehnungen kosteten nichts, das ist die gute Nachricht. Die schlechte Nachricht ist, wann sie eintreffen: 7 Millisekunden für die Audio-Allein-Regel, 16 bis 21 Sekunden für die Audio-Länge, den falschen MIME und die tote URL, und überhaupt nichts zum Zeitpunkt der Übermittlung. Jede fehlerhafte Anfrage in diesem Artikel erhielt zuerst HTTP 200 und eine Vorhersage-ID, also behandle eine Submit-Antwort als Quittung, nicht als Validierung, und frage das status-Feld ab, bevor du irgendetwas glaubst.

Stillschweigender Erfolg ist der teure Fehler. Die zwei Kontrollen zum Mischen kosteten jeweils volle $0,40 und gaben ein perfekt gültiges Video zurück, das aus der Hälfte meiner Eingaben erstellt wurde. Es gibt keinen Fehler, kein Warnfeld und keine Möglichkeit, anhand der Antwort zu erkennen, dass etwas verworfen wurde. Das ist die einzige Zeile in der Tabelle, bei der Geld das Konto verließ und ich nichts bekam, was ich wollte.

Eine ehrliche Korrektur zu diesem letzten Punkt, denn er hat sich während des Schreibens geändert. Anfang August verhielt sich eine Referenz-URL, die 404 zurückgab, genauso: Der Auftrag wurde abgeschlossen, die Referenz stillschweigend ignoriert und der volle Betrag berechnet. Als ich es am 12.08.2026 erneut ausführte, überprüft der Endpunkt nun die Erreichbarkeit und lässt den Auftrag kostenlos mit einem benannten Fehler fehlschlagen, content[1].image_url: media not found (HTTP 404). Dieses spezielle Loch ist geschlossen. Das Loch der sich gegenseitig ausschließenden Eingaben ist es nicht. Für die Kredit-Mathematik pro Clip enthält MiniMax H3 Credits pro Video die Tabellen.

Wessen Gesicht, wessen Stimme: Überprüfe dies, bevor du eine Referenz hochlädst

Dieser Endpunkt unterscheidet sich in einer rechtlich relevanten Hinsicht von Text-zu-Video: Du lieferst das Abbild. Ein Referenzbild einer echten Person, ein Referenzclip aus dem Film von jemandem, eine Referenzstimme in einer erkennbaren Stimme – all das ist Material, für das du ein Nutzungsrecht beanspruchst. Modellseitige Content-Regeln gelten zusätzlich, und sie sind strenger bei echten Personen als bei erfundenen. Zwei Leitfäden, die es wert sind, gelesen zu werden, bevor ein Kunde die Ausgabe sieht: MiniMax H3 Content-Beschränkungen und die Aufschlüsselung zur kommerziellen Nutzung und Lizenzierung, die auch die Gebietsausschlüsse in MiniMax' Bedingungen behandelt.

MiniMax H3 Referenz zu Video: Häufig gestellte Fragen

Kann MiniMax H3 Referenz-zu-Video denselben Charakter über zwei verschiedene Aufnahmen hinweg beibehalten?

Ja, und mein Zwei-Aufnahmen-Test oben hält auch über eine vollständige Nacht-zu-Morgen-Beleuchtungsumkehr hinweg. Aber ein Charakterbild allein ist nicht das, was es tut. Das zuverlässige Muster ist, die Ausgabe-URL der vorherigen Aufnahme zusammen mit dem Charakterbild als Referenzvideo zurückzugeben, sodass der zweite Aufruf sowohl Grading und Körnung als auch die Identität erbt.

Kann ich ein erstes Einzelbild und Referenzen im selben MiniMax H3 Referenz-zu-Video-Aufruf verwenden?

Nein, und die Fehlerart ist das Problem. Das Senden von sowohl image als auch refers ergibt keinen Fehler. Getestet am 12.08.2026, wurde der Auftrag in 115 Sekunden abgeschlossen, $0,40 berechnet und eine der beiden Eingaben stillschweigend verworfen. Dasselbe passiert umgekehrt am Bild-zu-Video-Endpunkt. Wähle einen Pfad pro Aufruf.

Kann ich eine Audiodatei allein als MiniMax H3 Referenz-zu-Video-Referenz senden?

Nein. Audio muss mit mindestens einem Referenzbild oder -video reisen, und der Endpunkt setzt es mit einem expliziten Fehler durch: reference-to-video requires at least one reference image or video. Es tritt in der Generierungsphase auf, nicht beim Absenden, und der abgelehnte Auftrag ist kostenlos. Audio-Referenzen müssen außerdem zwischen 2 und 15 Sekunden liegen, insgesamt 15 Sekunden, und als audio/mp3 statt audio/mpeg deklariert sein.

Berechnet MiniMax H3 Referenz-zu-Video extra für jede Referenzdatei?

Nicht auf Atlas Cloud. Ein Durchlauf mit zehn Referenzbildern und einer mit einem berechneten identische $0,40 bei 768P und 4 Sekunden, also misst der Zähler nur Ausgabesekunden und Auflösung. Beachte jedoch den Widerspruch: MiniMax' eigene Regeln erwähnen, dass eingehendes Video zum Ausgabesatz gemessen wird, und andere Plattformen führen einen separaten Referenzbild-Posten. Überprüfe es auf der Oberfläche, über die du abrechnest.

Was passiert, wenn eine meiner MiniMax H3 Referenz-zu-Video-URLs defekt ist?

Stand 12.08.2026 validiert der Endpunkt die Erreichbarkeit und lässt den gesamten Auftrag kostenlos fehlschlagen, mit content[1].image_url: media not found (HTTP 404) nach etwa 21 Sekunden. Das ist eine Änderung: Anfang August wurde dieselbe Anfrage abgeschlossen, ignorierte die fehlende Referenz stillschweigend und berechnete den vollen Preis. Gehe nicht davon aus, dass ältere Verhaltensberichte noch gültig sind, und überprüfe das status-Feld, anstatt anzunehmen, dass ein 200er beim Absenden etwas bedeutet.

Ist MiniMax H3 Referenz-zu-Video tatsächlich das beste Modell dafür?

Bei dem einzigen öffentlichen Kopf-an-Kopf-Vergleich, der es misst, ja, knapp. MiniMax H3 führt die Videobearbeitungs-Rangliste mit Elo 1.125 bei 10.280 Stimmen an, aber sein gelisteter Rangbereich ist 1 bis 2, und Gemini Omni Flash sitzt 3 Elo-Punkte dahinter mit einem überlappenden Intervall. Behandle es als „gemeinsam bestverfügbar", wähle nach dem Rest des Workflows aus und lies MiniMax H3 Alternativen, wenn dir die Gleichwertigkeit wichtig ist.

Neueste Modelle

Eine API für alle Media-KI.

Alle Modelle erkunden