MiniMax H3 Videolänge beträgt 15 Sekunden. Ich zählte zehn Schnitte in einem davon.

MiniMax H3-Videolänge beträgt 4 bis 15 ganze Sekunden bei 24 FPS. Sehen Sie, was Sie wirklich Bild für Bild zurückbekommen, wie viele Schnitte in einen Clip passen und wie man 45 Sekunden aneinanderreiht.

Jeder macht am ersten Tag dasselbe. Du öffnest das Dauer-Dropdown, siehst 15 und beginnst zu dividieren. Zehnminütiger Film? Vierzig Generationen. Dreiminütiger Erklärfilm? Zwölf. Dann schaust du auf die Zahl, die die Division ergibt, schließt den Tab und entscheidest, dass das Modell noch nicht bereit für irgendetwas mit einer Geschichte ist.

Ich habe die Division auch gemacht. Dann habe ich ffmpeg über neun echte H3-Clips laufen lassen und etwas gefunden, das die ganze Berechnung albern aussehen ließ.

Einer dieser Clips ist 15,10 Sekunden lang. Darin markiert der Szenendetektor zehn saubere Schnitte. Zehn. Andere Garderobe, andere Bildausschnitte, andere Hintergründe, Full-Frame-Titelkarten – alles in einer einzigen Generation, die den Preis einer einzigen Generation kostet. Hätte ich diesen Clip so geplant, wie die Division es suggeriert – eine Generation pro Einstellung –, hätte ich für dieselben fünfzehn Sekunden das Zehnfache bezahlt.

Die Division ist der Fehler. Das Limit ist keine Stoppuhr, es ist ein Behälter, und fast niemand füllt ihn.

Sequenz eines Skateboarders, der nachts über eine Betonkante springt

Ein Skateboarder in der Mitte eines Tricks, eingefangen als Stroboskop-Sequenz, viele verschiedene Positionen in einem einzigen Frame eingefroren

Ein Frame, viele Momente. Das ist das mentale Modell, von dem dich das Dauer-Dropdown abhält.

Wichtige Erkenntnisse

  • Der Parameter duration akzeptiert nur ganze Zahlen von 4 bis 15. Standard ist 8. Es gibt keine 7,5 und keinen Wert über 15.
  • Jeder Clip wird mit 24 FPS, bis zu nativen 2K und mit Stereoton ausgegeben, der im selben Durchlauf wie das Bild generiert wird.
  • Dein „15-Sekunden"-Clip hat tatsächlich 362 Frames, also 15,083 Sekunden. Dauern werden auf ein 17-Frame-Raster aufgerundet, und nur duration: 8 landet auf einer ganzen Sekunde.
  • Eine Generation kann viele Einstellungen enthalten. Schreibe EINSTELLUNG 1 / SCHNITT ZU in den Prompt und das Modell schneidet für dich – ohne zusätzliche Kosten.
  • Es gibt keinen extend-Parameter in der API. Du kommst über 15 Sekunden hinaus, indem du verkettest: letzten Frame in den nächsten ersten Frame, Referenzbilder, um den Look zu halten, dann einen harten Concat.

45 Sekunden MiniMax H3-Videolänge aus drei Clips

Bevor es an die Theorie geht, hier das Ding selbst. Ein 45-Sekunden-Noodle-Stall-Spot namens MIDNIGHT BOWL. Drei Generationen, je fünfzehn Sekunden, drei Einstellungen in jeder. Neun Einstellungen, ein durchgehendes narratives Stück, keine Überblendungen, die die Übergänge verstecken.

Der vollständige 45-Sekunden-Schnitt. Drei MiniMax H3-Generationen ohne Übergangseffekte aneinandergereiht. Der Koch, die Schürze, die Glühbirne und das handgemalte Schild überleben zwei Übergaben.

Neun Videoframes, die einen Koch bei der Zubereitung und dem Servieren von Ramen zeigen

Neun Frames aus dem MIDNIGHT BOWL-Spot, angeordnet als 3x3-Kontaktabzug, beschriftet mit EINSTELLUNG 1 bis EINSTELLUNG 9 und Zeitcodes

Neun Einstellungen, drei Generationen. Jede Zeile ist eine Generation, jede Spalte ein Schnitt, den das Modell selbstständig gemacht hat. Einstellungen 3 und 4 reimen sich, weil Generation 2 mit dem letzten Frame von Generation 1 beginnt – genau das macht die Naht unsichtbar.

Drei Generationen. Nicht neun. Diese Lücke ist der ganze Sinn dieses Artikels.

Ich habe nichts davon manuell geschnitten. Ich habe jede Generation nach drei mit Zeitcode versehenen Einstellungen gefragt, und ffmpegs Szenendetektor fand die Schnitte bei 4,9s und 9,1s in der ersten, 4,9s und 9,0s in der zweiten, 5,3s und 11,0s in der dritten. Neun Einstellungen, drei Rechnungen.

Warum die MiniMax H3-Videolänge Langzeitpläne zunichtemacht

Die Zahl selbst ist in Ordnung. Fünfzehn Sekunden am oberen Ende der Spanne sind für diese Generation von Modellen großzügig, und die Clips sind 2K mit echtem Stereoton. Was die Leute umhaut, ist die Einheit, in der sie planen.

Wenn du in Sekunden budgetierst, ist ein einminütiges Stück „vier Clips" und ein zehnminütiges Stück „vierzig Clips", und vierzig Clips von irgendetwas sind ein Albtraum an Kontinuitätsarbeit. Wenn du in Einstellungen budgetierst, ist ein einminütiges Stück vier Generationen, die etwa zwölf Einstellungen enthalten – das ist eine normale Menge an Abdeckung für einen Werbespot. Gleiches Modell, gleiches Limit, völlig anderer Produktionsplan.

Finger halten einen Sepia-Filmstreifen, der eine Straße, Hände und eine Silhouette zeigt

Retro-Plakatillustration eines einzelnen 35-mm-Filmstreifens, in dem drei aufeinanderfolgende Frames jeweils eine völlig andere Szene zeigen

Budgetiere in Einstellungen, nicht in Sekunden. Ein berechneter Streifen, drei verschiedene Szenen darin.

Es gibt eine zweite Sache, die Langzeitpläne zerbricht, und es ist überhaupt nicht das Limit. Es sind die Nähte. Einzelne Clips fallen fast nie in der Mitte auseinander. Sie fallen an den Verbindungsstellen auseinander, weil jede Generation ihr eigenes Audio-Bett erfindet und bei Garderobe und Licht leicht abweicht. Plane die Nähte ein und 45 Sekunden sind einfach. Ignoriere sie und vier perfekte Clips sehen immer noch aus wie vier Clips.

Was die MiniMax H3-Videolänge wirklich ist: 4 bis 15 ganze Sekunden auf einem 17-Frame-Raster

Beginnen wir mit der Spezifikation, denn es kursieren zwei verschiedene Zahlen. Das Live-API-Schema für alle drei H3-Endpunkte auf Atlas Cloud listet duration als Enum von genau 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15 mit einem Standardwert von 8. Ganze Zahlen, nichts Bruchstückhaftes, nichts über 15 hinaus. Die Startberichterstattung deckt sich mit dieser Lesart: 2K-Ausgabe, 4 bis 15 Sekunden, nur ganzzahlige Dauern (MarkTechPost, August 2026). MiniMaxs eigener Startbeitrag beschreibt es als bis zu 15 Sekunden bei 2K mit nativem Stereoton (MiniMax, August 2026).

Du wirst immer noch „5 bis 15 Sekunden" in verschiedenen Profil-Beschreibungen und Schnellstartanleitungen sehen, einschließlich einiger plattforminterner Texte. Betrachte das Schema-Enum als die Wahrheit. Die Untergrenze ist 4, und ich habe 4-Sekunden-Clips abgerechnet, um das zu beweisen.

Jetzt der Teil, den fast niemand erwähnt. Frage nach 15 Sekunden und du bekommst nicht 360 Frames. Du bekommst 362.

H3 baut Videos in 17-Frame-Blöcken auf und rundet deine angeforderte Dauer auf die nächste 17k + 5-Frame-Anzahl bei 24 FPS auf. Dieses Raster ist im offiziellen H3-Tutorial von ComfyUI dokumentiert (ComfyUI Docs, 2026), und es gilt auch auf der API-Seite. Ich habe Frames auf neun echten H3-Dateien mit ffmpeg gezählt:

text
1ffmpeg -i video-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | tail -1
2# frame=  362  ...
3#   Duration: 00:00:15.10, 1280x720, 24 fps
4

Jede 15-Sekunden-Datei kam mit 362 Frames zurück. Jede 10-Sekunden-Datei mit 243. Die drei neuen Generationen, die ich für diesen Artikel erstellt habe, kamen ebenfalls mit 362 zurück, und die 4-Sekunden-Probe aus Schritt 5 kam mit 107. Setze diese ins Raster ein: 362 ist 17x21+5, 243 ist 17x14+5 und 107 ist 17x6+5. Die Formel hat alle drei exakt vorhergesagt, was die Art von Übereinstimmung ist, die mich den Rest der Tabelle vertrauen lässt.

DauerAusgelieferte Frames (17k+5)Echte Länge bei 24 FPSLandet auf einer ganzen Sekunde?Quelle
41074,458 sNeinGemessen
51245,167 sNeinRaster
61586,583 sNeinRaster
71757,292 sNeinRaster
81928,000 sJaRaster
92269,417 sNeinRaster
1024310,125 sNeinGemessen
1127711,542 sNeinRaster
1229412,250 sNeinRaster
1332813,667 sNeinRaster
1434514,375 sNeinRaster
1536215,083 sNeinGemessen

Drei Dinge fallen aus dieser Tabelle heraus.

duration: 8 ist der einzige Wert im gesamten Bereich, der dir eine saubere ganze Sekunde gibt, und es ist zufällig der Standard. Das ist kein Zufall, es ist 17x11+5 = 192 = 8 x 24 exakt.

Frage nach 6 und du bekommst 6,583 Sekunden – mehr als eine halbe Sekunde Gratisbild. Frage nach 13 und du bekommst 13,667. Das Raster rundet immer auf, nie ab, also wirst du nie zu kurz kommen.

Und wenn du auf Musik schneidest oder einen frame-genauen Edit abstimmst, berechne deine Timeline niemals als duration x 24. Miss die Datei. Ein 40-Clip-Projekt, das auf der Annahme ganzer Sekunden basiert, liegt am Ende um fast vier Sekunden daneben.

Zehn Schnitte in einer 15-Sekunden-MiniMax H3-Generation

Hier ist der Clip, den ich oben erwähnt habe. Eine Generation, 362 Frames, 15,10 Sekunden im Container. Es ist ein Fashion-Kinetic-Type-Stück und verhält sich wie ein geschnittenes Musikvideo und nicht wie eine einzelne Einstellung.

Nahaufnahme der Augen einer Frau hinter fettem weißem Text ONE LOOK

Eine einzige MiniMax H3-Generation. Garderobenwechsel, Bildausschnittwechsel, geteilte Bildschirme und Full-Frame-Titelkarten, alles in einem 15-Sekunden-Job.

Ich habe ffmpegs Szenendetektor darüber laufen lassen, anstatt mit dem Auge zu zählen:

text
1ffmpeg -i video-5.mp4 -vf "select='gt(scene,0.6)',showinfo" -f null -
2# 18 Brüche markiert, bei 1.54 2.88 3.63 4.21 5.54 5.83 6.92 8.88 11.17 13.00 ...
3

Zehn davon sind saubere Einstellungswechsel in den ersten dreizehn Sekunden. Der Rest ist eine flackernde Titelsequenz auf Schwarz, die die Rohzahl aufbläht, also ist zehn die konservative, ehrliche Zahl. So oder so ist es nicht eine Einstellung und nicht drei.

Jetzt der Kontrollfall, denn „H3 hackt deinen Clip immer in Stücke" ist der gegenteilige Fehler und genauso falsch. Diese nächste Datei ist ebenfalls eine einzige 15-Sekunden-Generation, ebenfalls 362 Frames, und derselbe Detektor findet darin genau null Schnitte.

Ich-Perspektive von Wolkenkratzern, die auf eine Stadtstraße stürzen

Eine andere einzelne Generation, dieselben 362 Frames, null erkannte Schnitte. Eine durchgehende Kamerabewegung über die gesamten fünfzehn Sekunden.

Das Limit ist also nicht „fünfzehn Sekunden Filmmaterial". Es sind fünfzehn Sekunden Bildschirmzeit, die du nach Belieben unterteilen kannst – von einer ununterbrochenen Einstellung bis zu zehn Schnitten. Du steuerst es über den Prompt und zahlst in beiden Fällen dasselbe.

Die drei Endpunkte hinter der MiniMax H3-Videolänge in einem Tab

Um über fünfzehn Sekunden hinauszukommen, brauchst du drei verschiedene Jobs: etwas, um einen Ankerframe zu erstellen, etwas, um zu animieren und zu verketten, und etwas, um die Kamera zu bewegen, ohne das Motiv zu verlieren. Auf Atlas Cloud leben alle vier im selben Katalog mit einem Schlüssel und einem Guthaben, was hier vor allem deshalb wichtig ist, weil die Kette im nächsten Abschnitt wiederholt Dateien zwischen ihnen hin- und herreicht.

SchrittModellAufgabe in diesem BuildLängenbereichGelisteter Preis, 4. Aug. 2026
Ankerframeopenai/gpt-image-2/text-to-imageEin Standbild, das den gesamten Look definiertn/a0,1745 $ für meinen Durchlauf bei High
Eröffnung, kein Standbild nötigminimax/h3/text-to-videoDirekt vom Prompt zum Clip4 bis 15 s, Standard 80,14 $ / s
Generationen 1 und 2minimax/h3/image-to-videoEinen ersten Frame animieren, dann von einem letzten Frame aus verketten4 bis 15 s, Standard 80,14 $ / s
Generation 3minimax/h3/reference-to-videoNeue Kameraposition, gleiches Motiv4 bis 15 s, Standard 80,14 $ / s

Alle drei H3-Endpunkte haben derzeit keinen Rabatt, also ist der Preis der Preis. Du kannst alles im vollständigen Modellkatalog überprüfen.

Drei Parameterfallen, die du kennen solltest, bevor du eine einzige Anfrage schreibst – alle aus den Live-Schemas, nicht aus der Prosa der Dokumentation:

  1. ratio verhält sich an jedem Endpunkt anders. text-to-video bietet sechs Verhältnisse und standardmäßig 1:1, was dir leise einen quadratischen Clip ausliefert, wenn du vergisst, es einzustellen, und es akzeptiert adaptive überhaupt nicht. image-to-video bietet nur adaptive an, also folgt der Bildausschnitt deinem ersten Frame. reference-to-video ist der einzige mit dem vollständigen Satz plus adaptive.
  2. resolution ist 768P oder 2K, standardmäßig 2K. Beide Stufen liegen unter einem einzigen gelisteten Preis pro Sekunde im Katalog, also spart das Heruntergehen auf 768P kein Geld. Verwende 2K.
  3. image-to-video akzeptiert auch ein optionales end_image. Du kannst beide Enden eines Clips fixieren, nicht nur den Anfang. Das macht den unten beschriebenen Verkettungstrick zu etwas, das du von beiden Seiten steuern kannst.

Wie man das MiniMax H3-Videolängenlimit Schritt für Schritt überwindet

Dies ist der vollständige MIDNIGHT BOWL-Build. Jeder Prompt unten ist der, den ich tatsächlich gesendet habe – kopiere sie wortwörtlich. Die Gesamtlaufzeit beträgt drei H3-Generationen plus ein Standbild, und das Ganze ist in einem Browser-Tab reproduzierbar.

Schritt 1: Den Look in einem Ankerframe festlegen

Beginne nicht mit Video. Beginne mit einem Standbild, das dir wirklich gefällt, denn jeder Clip in der Kette wird sein Licht, seine Garderobe und seine Beschilderung von ihm erben. Das falsch zu machen ist teuer; es richtig zu machen kostet Cent.

Modell: openai/gpt-image-2/text-to-image. Einstellungen: Qualität high, Verhältnis 16:9.

text
1Filmbild, 2 Uhr morgens in einer engen Tokioter Hinterhof-Nudelbude. Ein 50-jähriger Koch in einer marineblauen Schürze und einem weißen Stirnband beugt sich über einen dampfenden Suppentopf hinter einer zerkratzten Holztheke, die Ärmel bis zum Ellbogen hochgekrempelt, die Unterarme heiß orange von einer einzelnen hängenden Glühbirne beleuchtet. Regenglatter Asphalt reflektiert rotes und grünes Licht; Papierlaternen und ein handgemaltes Holzschild mit der Aufschrift „MIDNIGHT BOWL" hängen über der Theke. Dampf zieht von der Kamera rechts über das Bild. Aufgenommen mit einem 35-mm-Objektiv bei Blende 2, geringe Schärfentiefe, tiefe Schatten, warme Wolframlichtquelle gegen kühle blaue Nacht, sichtbares feines Filmkorn, keine Texteinblendungen.
2

KI-Bildgenerator-Oberfläche mit Text-Prompt und dem resultierenden Bild

GPT Image 2 Playground auf Atlas Cloud mit dem ausgefüllten MIDNIGHT BOWL-Ankerprompt und dem fertigen Bild im Ausgabefenster

GPT Image 2 auf Atlas Cloud: Qualität auf High gesetzt, 16:9, der Ankerframe rechts gerendert.

4

Der MIDNIGHT BOWL-Ankerframe: ein Koch in einer marineblauen Schürze hinter einem dampfenden Suppentopf unter einer einzelnen hängenden Glühbirne in einer regnerischen Hinterhofgasse

Der Ankerframe. Alles Nachfolgende erbt diese Glühbirne, diese Schürze und dieses Schild.

Schritt 2: Drei Einstellungen in eine 15-Sekunden-MiniMax H3-Generation stecken

Hier ist der Zug, der das Budget verändert. Anstatt nach einer durchgehenden fünfzehn Sekunden zu fragen, übergib dem Modell eine Einstellungsliste mit expliziten Zeitcodes und den Worten SCHNITT ZU. Es wird für dich schneiden – innerhalb einer einzigen abgerechneten Generation.

Modell: minimax/h3/image-to-video. Einstellungen: resolution 2K, duration 15, ratio adaptive (die einzige Option hier, der Bildausschnitt folgt deinem ersten Frame), erster Frame = das Standbild aus Schritt 1.

text
1EINSTELLUNG 1 (0-5s): Feststehende Totale der Bude. Dampf quillt auf; der Koch schöpft Brühe in eine schwarze Schale; Regen tropft von der Markisenkante. EINSTELLUNG 2 (5-10s): SCHNITT ZU einer Makro-Nahaufnahme der Kelle, die die Brühoberfläche durchbricht, goldenes Fett wirbelt, gehackte Frühlingszwiebeln fallen in langsamen Bögen. EINSTELLUNG 3 (10-15s): SCHNITT ZU einer Halbtotalen des Kochs, der direkt in die Linse blickt, sich die Hände an der Schürze abwischt und auf Japanisch mit einem müden Lächeln sagt: „Ippai, dozo." Er stellt die Schale auf die Theke, und die Einstellung verweilt auf seinem Gesicht.
2Audio: starker Regen auf der Markise, köchelnde Brühe, die Kelle, die an den Topfrand stößt, ein entfernter Zug, tiefes nächtliches Stadtbrummen. Eine Zeile klarer männlicher japanischer Dialog, natürlicher Raumklang, keine Musik.
3Behalte denselben Koch, dieselbe Schürze, dasselbe Stirnband, dieselbe Glühbirne und dasselbe Schild in allen drei Einstellungen. Nur harte Schnitte, keine Überblendungen, keine Kamera-Whip-Übergänge. Warme Wolframlichtquelle, kühle blaue Nacht, 35-mm-Look, Filmkorn.
4

Drei Dinge machen das möglich. Explizite Sekundenbereiche, die wörtliche Zeichenfolge SCHNITT ZU und eine Kontinuitätsklausel am Ende, die jedes Element nennt, das die Schnitte überleben muss. Lass die Kontinuitätsklausel weg und Einstellung 3 kommt mit einer anderen Schürze zurück.

KI-Videogenerator-Oberfläche mit Eingabeeinstellungen und fertiger Videoausgabe

MiniMax H3 image-to-video Playground auf Atlas Cloud mit geladenem Ankerframe, Dauer 15 und 2K ausgewählt, der fertige Clip läuft im Ausgabefenster

MiniMax H3 image-to-video auf Atlas Cloud: Ankerframe als erster Frame geladen, Auflösung 2K, der fertige Clip rechts. Beachte den Dauer-Schieberegler und den Preis, der ihm folgt. Dieser spezielle Durchlauf hat die Dauer auf dem Standardwert 8 belassen, weshalb der Button 1,12 $ anzeigt; bei 15 zeigt er 2,10 $ an.

Koch, der an einem dampfenden Straßenstand in einer regnerischen Nacht Essen zubereitet

Generation 1. Ein abgerechneter Job, drei Einstellungen (Schnitte gemessen bei 4,92 s und 9,13 s), eine Dialogzeile mit Lippen-Sync, natives 2560x1440 und 32-kHz-Stereoton in derselben Datei.

Schritt 3: Die nächsten 15 Sekunden an den letzten Frame anhängen

Es gibt keinen extend-Parameter. Die Verkettung ist manuell und trivial: Ziehe den letzten Frame von Generation 1 heraus und füge ihn als ersten Frame von Generation 2 wieder ein.

bash
1ffmpeg -sseof -0.08 -i generation-1.mp4 -frames:v 1 -q:v 2 handoff-frame-01.jpg
2

Modell: wieder minimax/h3/image-to-video. Einstellungen: erster Frame = handoff-frame-01.jpg, resolution 2K, duration 15, ratio adaptive.

Die wichtige Disziplin hier ist, was du weglässt. Beschreibe den Koch nicht noch einmal. Er ist bereits in den Pixeln, die du gerade übergeben hast, und eine erneute Beschreibung gibt dem Modell die Erlaubnis, ihn neu zu interpretieren.

text
1Fahre mit diesem exakten Frame fort, derselbe Mann, dieselbe Schürze, dasselbe Licht. EINSTELLUNG 1 (0-5s): Er schiebt die Schale mit beiden Händen über die Theke in Richtung Kamera. EINSTELLUNG 2 (5-10s): SCHNITT ZU einer Über-die-Schulter-Aufnahme der Hände eines Gastes, die hölzerne Essstäbchen aufnehmen und auseinanderbrechen, Manschetten eines nassen grauen Regenmantels sichtbar. EINSTELLUNG 3 (10-15s): SCHNITT ZU einer extremen Makro-Nudelaufnahme, Dampf kringelt sich an der Linse vorbei, Brühe tropft zurück in die Schale.
2Audio: durchgehender Regen und Köcheln von vorher, Keramik auf Holz, knackende Stäbchen, ein Schlürfen, derselbe entfernte Zug. Keine Musik, kein Kommentar.
3Nur harte Schnitte. Dieselbe warme Wolframlichtquelle von der hängenden Glühbirne, dieselbe kühle blaue Nacht dahinter, dieselbe 35-mm-geringe Schärfentiefe und dasselbe Filmkorn.
4

Lächelnder Koch mit Stirnband serviert eine dampfende Schale Essen

Generation 2, gestartet vom letzten Frame von Generation 1. Derselbe Koch, dasselbe Stirnbandmuster, dasselbe marineblaue Oberteil, dieselbe Küche hinter ihm. Wieder drei Einstellungen, Schnitte bei 4,92 s und 9,04 s.

Lächelnder Koch mit Stirnband serviert eine dampfende schwarze Schale

Zwei-Sekunden-Schleife über die Naht zwischen Generation 1 und Generation 2

Die Naht selbst: letzte Sekunde von Generation 1 in die erste Sekunde von Generation 2. Kein Übergangseffekt, nur ein Schnitt.

Schritt 4: Die Kamera mit Reference-to-Video bewegen

Die Verkettung mit dem letzten Frame hat eine eingebaute Einschränkung: Sie setzt immer dort fort, wo die vorherige Kamera stand. Um zu einem wirklich neuen Blickwinkel zu springen und dabei dasselbe Motiv zu behalten, wechsle den Endpunkt.

Modell: minimax/h3/reference-to-video. Einstellungen: refers = der Ankerframe aus Schritt 1 plus der letzte Frame von Generation 2, resolution 2K, duration 15, und setze ratio explizit auf 16:9 hier, anstatt es auf adaptive zu belassen. Dieser Endpunkt akzeptiert bis zu neun Referenzbilder, drei Referenzvideos und drei Audioclips, wobei das Referenzvideo auf insgesamt 15 Sekunden begrenzt ist (MarkTechPost, August 2026).

text
1Weite Untersicht aus der Mitte der nassen Straße zurück zur selben Nudelbude, demselben Koch darin. EINSTELLUNG 1 (0-6s): Regen streift durch das Bild; zwei silhouettierte Gäste sitzen an der Theke; der Koch arbeitet unter der einzelnen Glühbirne. EINSTELLUNG 2 (6-11s): SCHNITT ZU dem handgemalten Holzschild, während daneben kinetischer weißer Text Buchstabe für Buchstabe animiert: „MIDNIGHT BOWL - OPEN TILL 4AM". Der Text bleibt messerscharf und am Schild fixiert, während die Kamera driftet. EINSTELLUNG 3 (11-15s): SCHNITT ZURÜCK zur Totalen, als der Koch aufblickt, eine Hand zu einem kleinen Winken hebt und die Glühbirne einmal flackert.
2Audio: Regen, Straßenatmosphäre, ein vorbeifahrender Roller, derselbe schwache Zug, ein einzelner tiefer Sub-Hit, wenn der Text erscheint. Kein Dialog.
3Derselbe Koch, dieselbe Schürze und dasselbe Stirnband, dieselbe Beschilderung und dieselben Laternenfarben wie auf den Referenzbildern. Nur harte Schnitte, Filmkorn, 35 mm, warme Wolframlichtquelle gegen kühles Blau.
4

Diese ratio-Anweisung ist keine Paranoia. Hier ist, was passiert, wenn du das Dropdown an diesem Endpunkt einfach so lässt:

KI-Videogenerator-Oberfläche mit einer Eingabevalidierungsfehlermeldung

MiniMax H3 reference-to-video Playground auf Atlas Cloud mit zwei geladenen Referenzbildern, Seitenverhältnis auf Adaptive belassen und einem 400-Validierungsfehler im Ausgabefenster

MiniMax H3 reference-to-video auf Atlas Cloud: beide Referenzbilder geladen, Auflösung 2K, und das Seitenverhältnis steht immer noch auf seinem adaptive-Standard. Der Durchlauf kommt mit 400 zurück: „ratio is required for t2va (text-only) and cannot be 'adaptive'; allowed: 16:9/4:3/1:1/3:4/9:16/21:9". Setze es explizit und dieselbe Anfrage geht durch – so wurde der Clip unten erstellt. Beachte auch den Hinweis auf der Seite oben, der „768P/1080P/2K, 5s/10s" liest, während das Schema 768P oder 2K und 4 bis 15 Sekunden sagt. Vertraue dem Schema.

Ich konnte das Seitenverhältnis-Dropdown des Playgrounds nicht dazu bringen, eine skriptgesteuerte Änderung über drei Versuche hinweg zu halten, daher kam die erfolgreiche Generation 3 unten von der API mit ratio: "16:9" im Anforderungstext. Der fehlgeschlagene Durchlauf hat nichts gekostet.

Koch bereitet Essen für Gäste an einem regnerischen Nacht-Imbissstand zu

Generation 3. Völlig neue Kameraposition von der anderen Seite der nassen Straße, derselbe Koch, und der animierte weiße Text auf dem Schild bleibt messerscharf, während die Kamera driftet. Schnitte bei 5,29 s und 10,96 s.

Seitenvergleich eines japanischen Imbissstandes bei Nacht

Seitenvergleich des ursprünglichen Ankerframes und eines Frames aus Generation 3, die denselben Koch und dieselbe Beschilderung 41 Sekunden und zwei Übergaben später zeigen

Links: der Anker aus Schritt 1. Rechts: Generation 3 bei der 41-Sekunden-Marke, zwei Übergaben später. Derselbe Koch, dasselbe Stirnband, dasselbe marineblaue Oberteil, dasselbe handgemalte Schild, dieselbe rote Laterne.

Schritt 5: Die tatsächliche MiniMax H3-Videolänge messen, dann zusammensetzen

Zwei Gewohnheiten zum Abschluss. Erstens: Führe eine billige Probe durch, bevor du fünfzehn Sekunden kaufst. Gleicher Prompt, duration 4, und du findest heraus, ob das Modell deine Einstellungsliste verstanden hat – für etwa ein Viertel des Preises.

Koch kocht an einem dampfenden Außenstand in einer regnerischen Gasse

Die 4-Sekunden-Probe derselben Einstellungsliste. Gemessen mit 107 Frames, also 4,458 Sekunden, genau das, was das Raster vorhersagt. Genug, um zu sehen, ob das Modell die Szene verstanden hat, bevor du die volle Einstellung kaufst.

Zweitens: Miss jede Datei, bevor du schneidest, denn keine von ihnen ist so lang, wie du angefordert hast:

bash
1# tatsächliche Frame-Anzahl und Container-Dauer, nicht Dauer x 24
2ffmpeg -i generation-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | grep -o 'frame= *[0-9]*' | tail -1
3
4# harter Schnitt-Concat, keine Übergänge, keine Neucodierung
5printf "file 'generation-1.mp4'\nfile 'generation-2.mp4'\nfile 'generation-3.mp4'\n" > list.txt
6ffmpeg -f concat -safe 0 -i list.txt -c copy midnight-bowl-45s.mp4
7

Drei Dateien mit je 362 Frames ergeben 1086 Frames, die ich am fertigen Concat gemessen habe: 45,25 Sekunden Bild, nicht 45. Gering, bis du vierzig davon zusammensetzt.

Variationen: Dialog, vertikal und die 4-Sekunden-Probe

Sobald die Kette funktioniert, decken dieselben drei Endpunkte die meisten Dinge ab, nach denen die Leute tatsächlich fragen.

Schuss-Gegenschuss-Dialog. Platziere beide Seiten eines Gesprächs innerhalb einer Generation statt auf zwei verteilt. Lippen-Sync und das Audio-Bett sind innerhalb eines einzelnen Jobs durchgehend und zwischen Jobs unabhängig, daher bekommst du bei einem auf zwei Generationen verteilten Gespräch zwei nicht zusammenhängende Raumklänge. Halte Austausche innerhalb eines Clips.

Weinende junge Frau blickt zu einem Mann in einem Treppenhaus auf

Zwei junge Schauspieler mitten im Streit auf einem Betontreppenabsatz, hartes Fensterlicht streift sie, über die Schulter gefilmt

Schuss-Gegenschuss funktioniert, solange beide Blickwinkel innerhalb derselben Generation leben.

Vertikal. Bei image-to-video stellst du das Verhältnis nicht ein, du stellst den ersten Frame ein. Generiere einen hohen Anker und adaptive folgt ihm. Einer der Clips, die ich gemessen habe, kam mit 1280x2276 zurück, mit derselben Frame-Anzahl von 243 wie seine 16:9-Geschwister, also interessiert sich das Frame-Raster nicht für dein Seitenverhältnis.

Die 4-Sekunden-Probe als Standardpraxis. Bei 0,14 $ pro Sekunde kostet vier Sekunden 0,56 $ gegenüber 2,10 $ für eine vollständige Einstellung. Bei einem Build mit neun Einstellungen kostet das Proben jeder Generation vor der Festlegung weniger als ein verschwendeter 15-Sekunden-Job.

Wo das Limit wirklich zubeißt. Alles, was eine ununterbrochene Darbietung von mehr als fünfzehn Sekunden erfordert. Ein durchgehender 30-Sekunden-Monolog ist kein Verkettungsproblem, sondern ein Lippen-Sync-über-eine-Naht-Problem, und keine noch so große Prompt-Disziplin behebt das.

Was 45 Sekunden MiniMax H3-Videolänge kosten

Bei 0,14 $ pro Sekunde kostet eine vollständige 15-Sekunden-Generation 2,10 $. Das ist die einzige Zahl, die du brauchst; alles andere ist Multiplikation. Die interessante Spalte ist die letzte.

ZiellängeGenerationen à 15 sGerade Linie KostenRealistisch bei einer 1-zu-3-BehaltungsrateGelieferte EinstellungenKosten pro Einstellung
15 s12,10 $6,30 $30,70 $
45 s (dieser Build)36,30 $18,90 $90,70 $
60 s48,40 $25,20 $120,70 $
3 min1225,20 $75,60 $360,70 $
10 min4084,00 $252,00 $1200,70 $

Lies die Spalte „Kosten pro Einstellung" und die Panik wegen des Limits verfliegt größtenteils. Wenn du eine Generation pro Einstellung planst, landest du bei 2,10 $ pro Einstellung. Wenn du drei Einstellungen in jede Generation packst, landest du bei 0,70 $. Gleiches Modell, gleiches 15-Sekunden-Limit, ein Drittel der Rechnung.

Die Spalte „Behaltungsrate" ist die, die die Leute vergessen. Nichts Verwendbares kommt beim ersten Versuch jedes Mal zurück, und ein Plan, der davon ausgeht, dass es so ist, ist ein Plan, der nach zwei Minuten kein Budget mehr hat.

Zur Einordnung, wo das Limit im Vergleich zu allem anderen im Katalog steht – alle aktuell zum 4. August 2026:

ModellMaximale einzelne GenerationBemerkenswertGelisteter Preis
minimax/h34 bis 15 s768P oder 2K, nativer Stereoton0,14 $ / s
bytedance/seedance-2.04 bis 15 s, oder -1 für Auto480p bis nativen 4K0,112 $ / s
kwaivgi/kling-v3.0-pro3 bis 15 sHat ein explizites multi_shot-Flag mit Prompts pro Einstellung0,095 $ / s, 15 % Rabatt
alibaba/wan-2.72 bis 15 sBreiteste Untergrenze, 720P oder 1080P0,10 $ / s
google/veo3.1nur 4, 6 oder 8 sGar keine 15-Sekunden-Option0,20 $ / s
alibaba/wan-2.5/video-extendfügt 5 bis 10 s hinzuErweitert eine vorhandene Datei, anstatt frisch zu generieren0,052 $ / s

Zwei Schlussfolgerungen. H3s fünfzehn Sekunden liegen an der Spitze der aktuellen Generation, nicht dahinter, und Veo 3.1 endet bei acht. Und wenn du wirklich eine lange Datei von einem Endpunkt brauchst, gibt es ein dediziertes Erweiterungsmodell, aber der Wechsel des Modells mitten in der Kette bedeutet, dass sich die Gesichter ändern.

Eine ehrliche Anmerkung zu Audio, Gewichten und der MiniMax H3-Videolänge

Drei Vorbehalte, von denen keiner das Limit verschiebt.

Audio wird nicht zwischen Generationen übertragen. Jeder Job komponiert sein eigenes Stereobett von Grund auf neu. Drei verkettete Clips bedeuten drei nicht zusammenhängende Regenbetten, und du wirst die Veränderung hören, selbst wenn das Bild perfekt übereinstimmt. Zwei Lösungen: Schreibe die Atmosphärenklausel in jedem Prompt identisch, damit die Betten nah beieinander liegen, oder stummschalte den zusammengesetzten Schnitt und lege eine durchgehende Spur darunter. Für Dialog halte den Austausch innerhalb einer einzigen Generation.

Sechs kleine schwarze Schallwellen neben einer langen orangefarbenen Schallwelle

Mehrere separate kurze Audio-Wellenformfragmente mit sichtbaren Lücken dazwischen auf der linken Seite, eine einzelne durchgehende Wellenform auf der rechten Seite, auf einem blassen einheitlichen Hintergrund

Links: Was die Verkettung dir tatsächlich gibt. Rechts: Was du darunter bauen musst.

Selbsthosting entsperrt keine längeren Clips. Die offenen Gewichte landeten am 2. August 2026 (Hugging Face, August 2026), und wenn du sie lokal ausführst, erhältst du eine 768-Pixel-Kurzseite, gerundet auf Vielfache von 32, gemäß den Setup-Notizen von ComfyUI. Das 17-Frame-Raster und die 15-Sekunden-Obergrenze sind dieselben. Die Community-Lizenz deckt derzeit auch nicht die EU, Großbritannien, Korea oder die USA ab, daher ist die API für die meisten Teams der praktische Weg.

Das Modell kann dich leise umschreiben. Ich hatte schon H3, das completed für einen Job zurückgab, in dem es ein Element, das ich anforderte, stillschweigend fallen ließ. Ziehe Frames aus jedem Clip und schau sie dir an, bevor du zusammensetzt. Bei einer Kette von neun Einstellungen ist ein unbeaufsichtigter Clip eine verschwendete Naht.

Häufig gestellte Fragen

Was ist die maximale MiniMax H3-Videolänge?

Fünfzehn Sekunden. Der Parameter duration ist ein Enum aus ganzen Zahlen von 4 bis 15 mit einem Standardwert von 8, daher wird 16 abgelehnt und 7,5 ist kein gültiger Wert. Jeder Clip hat 24 FPS bei bis zu nativen 2K mit Stereoton, der zusammen mit dem Bild generiert wird.

Kann MiniMax H3 Videos länger als 15 Sekunden generieren?

Nicht in einer einzigen Generation, und die API hat keinen extend-Parameter. Du kommst über 15 Sekunden hinaus, indem du verkettest: Ziehe den letzten Frame eines Clips als ersten Frame des nächsten heraus, verwende reference-to-video, wenn du einen neuen Kamerawinkel brauchst, und füge dann mit harten Schnitten zusammen. Einige Consumer-Frontends legen ihre eigene Erweiterungsfunktion auf H3, um etwa 30 Sekunden zu erreichen, aber das Produkt macht das Zusammensetzen, nicht das Modell generiert länger.

Warum ist mein 15-Sekunden-MiniMax H3-Clip tatsächlich 15,08 Sekunden lang?

Weil Dauern auf ein 17-Frame-Raster aufgerundet werden. Das Anfordern von 15 Sekunden gibt 362 Frames zurück, also 17x21+5, und bei 24 FPS sind das 15,083 Sekunden. Das Anfordern von 10 gibt 243 Frames zurück, also 10,125 Sekunden. Nur duration: 8 landet auf einer ganzen Sekunde, bei exakt 192 Frames. Wenn dein Edit frame-genau ist, miss jede Datei, anstatt duration x 24 zu berechnen.

Kann ich mehrere Einstellungen in eine MiniMax H3-Generation stecken?

Ja, und das ist die größte Einsparung, die es gibt. Schreibe explizite mit Zeitcode versehene Einstellungen in den Prompt mit den wörtlichen Worten SCHNITT ZU und füge eine Kontinuitätsklausel hinzu, die nennt, was die Schnitte überleben muss. Ich habe zehn saubere Schnitte in einer echten 15-Sekunden-Generation gemessen. Drei Einstellungen pro Generation sind bequem und zuverlässig, was aus einem 2,10 $-Clip drei 0,70 $-Einstellungen macht.

Kostet eine kürzere MiniMax H3-Videolänge weniger?

Ja, linear. Die Abrechnung erfolgt pro Sekunde zu 0,14 $, daher kostet eine 4-Sekunden-Probe 0,56 $ gegenüber 2,10 $ für eine vollständige 15-Sekunden-Einstellung. Die Auflösung ist eine andere Geschichte: 768P und 2K liegen unter einem einzigen gelisteten Preis im Katalog, daher spart das Heruntergehen der Auflösung nichts. Kürze den Clip, nicht die Pixel.

Wie viele MiniMax H3-Clips brauche ich für ein einminütiges Video?

Vier, wenn du jedes Mal alle fünfzehn Sekunden füllst. Aber zähle in Einstellungen: vier Generationen mit je drei Einstellungen geben dir zwölf Einstellungen Abdeckung, was eine normale Menge für einen einminütigen Werbespot ist. Multipliziere dann dein Budget mit etwa drei, um die Einstellungen zu berücksichtigen, die du wegwirfst.

Neueste Modelle

Eine API für alle Media-KI.

Alle Modelle erkunden