Im Dezember 2025 sperrte YouTube Screen Culture und KH Studio. Zwei Kanäle, mehr als zwei Millionen Abonnenten zusammen, über eine Milliarde Aufrufe. Sie schnitten offizielles Filmmaterial mit KI-Bildern zusammen, um Franchise-Trailer zu erstellen, die wie offiziell aussahen. Screen Culture hatte bis März 23 Versionen eines Fantastic Four-Trailers ausgeliefert, und einige davon übertrafen den echten in der Suche (Deadline, Dezember 2025).
Sie wurden nicht wegen der Nutzung von KI gesperrt. Sie wurden wegen Spam und irreführenden Metadaten gesperrt: Sie gaben einen fremden Film als offiziell veröffentlichtes Material aus.
Aber eine Milliarde Aufrufe bewiesen etwas anderes. Der Trailer ist die fünfzehn Sekunden mit der höchsten Hebelwirkung im Filmmarketing. Das Format war nie das Problem. Die Zuschreibung war es.
Hier ist also die nützliche Version dieses Experiments: Verwende dasselbe Format für einen Film, der dir gehört. Ein 15-Sekunden-Teaser, 2K, nativem Stereo, einer Erzählstimme, einer Filmmusik, einer Titelsequenz. Eine Generierung. Kein Schnitt-Timeline, kein Sprachstudio, keine Musiklizenz, kein After-Effects-Durchlauf.
Wichtige Erkenntnisse
- Ein Trailer ist das dichteste, was man von einem Videomodell verlangen kann: mehrere Einstellungen, Erzählung, Musik, Sounddesign und Texteinblendungen, alles auf einmal. H3 belegt derzeit Platz 1 auf der Artificial Analysis-Rangliste für Videobearbeitung mit Audio, und Film-Titelsequenzen stehen auf der eigenen Anwendungsliste von MiniMax.
- 15 Sekunden ist die harte Obergrenze von H3. Das ist kein Kinoteaser (die laufen 30 bis 60 Sekunden), aber es ist genau die Länge des Social-Clips, der die meiste Arbeit leistet.
- Schreibe den Prompt als Ablaufplan mit Zeitcodes, nicht als Ansammlung von Adjektiven. Etablierung, Konflikt, Höhepunkt, Titelsequenz. Vier Schläge.
- Es gibt überhaupt keinen Audio-Parameter in der API. Wenn du die Musik, die Erzählung und das Sounddesign nicht in Worten bestellst, bekommst du, was das Modell gerade wollte.
- Echte Zahlen auf Atlas Cloud: 768p-Entwurf 1,50 $, 2K-Final 2,10 $, plus etwa 0,17 $ für das Startbild. Ein fertiger Teaser liegt zwischen 2,03 $ und 3,77 $.

Das GPT Image 2-Startbild, das den Film festlegt: das Innere einer Stahl-Taucherglocke aus den 1970ern, eine Frau in einem zerkratzten orangefarbenen Tauchanzug, bernsteinfarbene Instrumentenlampe und sonargrüner Lichtschein – der Rahmen, auf dem alles andere aufbaut. Generiert mit openai/gpt-image-2/text-to-image bei Qualität high, 2048x1152. Dieses einzelne Bild ist der Grund, warum der 768p-Entwurf und der 2K-Final nicht zu zwei verschiedenen Filmen werden.
Der MiniMax H3-Kinotrailer, den ich in einer Generation erstellt habe
Hier ist er zuerst, vor aller Theorie. Ein Original-Teaser für einen Tiefsee-Thriller namens SALVAGE. Ein API-Aufruf, keine nachträglich hinzugefügten Schnitte.
SALVAGE, 15 Sekunden, eine Generation auf minimax/h3/image-to-video . Schalte den Ton ein: Das Rumpfstöhnen, der Sonar-Ping, das Streicher-Cluster und die eine Erzählstimme kamen alle aus demselben Aufruf wie das Bild. Abgerechnet 2,10 $.
Was in dieser Datei steckt und woher jedes Stück kommt:
- Vier verschiedene Einstellungen mit harten Schnitten, keine Überblendungen. Eine Generation.
- 24 fps, AAC-Stereo bei 32 kHz. Nicht nachträglich hinzugefügt.
- Eine Erzählstimme, weiblich, platziert zwischen 5 und 7,5 Sekunden, weil der Prompt es so sagte.
- Eine Titelsequenz, die in den letzten zwei Sekunden absolut still steht.
Das sind fünf traditionelle Post-Production-Durchläufe, die in einem zusammengefasst sind. Das ist der Grund, warum ein Trailer ein guter Stresstest für dieses Modell ist und ein schlechter für die meisten anderen.
Warum die meisten MiniMax H3-Kinotrailer-Versuche in der zweiten neun Sekunden scheitern
Trailer sind die schwierigste Kategorie, um sie zu fälschen, weil man keine Schwäche verstecken kann. Wenn die Schrift zittert, sieht man es. Wenn die Lippenbewegung driftet, hört man es. Wenn die Musik nicht auf den Schnitt fällt, wirkt das Ganze wie eine Diashow mit Musik darüber.
Das ist ungefähr der Grund, warum H3 dort steht, wo es steht. Auf der Artificial Analysis-Rangliste für Videobearbeitung mit Audio liegt es mit 1.130 Elo bei 8.249 Stimmen auf Platz 1, neun Punkte vor Gemini Omni Flash und 93 Punkte vor Dreamina Seedance 2.0, und es ist das einzige Modell in dieser Spitzengruppe, das als Open Weights markiert ist (Artificial Analysis, August 2026). MiniMax' eigenes Launch-Material listet Film-Titelsequenzen unter den Anwendungsfällen erster Klasse auf, neben animierten Postern und charakterkonsistenten Game-Cinematics (MarkTechPost, August 2026).
Hier ist der offizielle 15-Sekunden-Sci-Fi-Opening aus diesem Launch-Set, damit du hörst, was "natives Audio" bedeutet, bevor du etwas ausgibst:
THE LAST FLEET LEFT EARTH, aus MiniMax' offiziellem H3-Showcase-Set. Geliefert in 2560x1440, 24 fps, AAC-Stereo 32 kHz. Beachte die herausgezoomte Titelsequenz und die Karte "SHE KNEW WHY" in der Mitte des Trailers, die still stehen, während die Kamera sich weiterbewegt.
Nun die Fehlerliste. Jeder davon ist etwas, das auf dem Weg zu dem Clip am Anfang dieser Seite tatsächlich schiefgegangen ist.
- Versuch, einen 60-Sekunden-Trailer in einen Aufruf zu packen. 15 Sekunden sind eine harte Obergrenze. Wenn du eine ganze Trailerlänge an Geschichte verlangst, bekommst du Matsch, weil das Modell acht Schläge in vier komprimiert. Schreibe einen Teaser.
- Adjektive statt eines Ablaufplans schreiben. "Epischer Kinotrailer, dramatisch, hohe Spannung" gibt dir eine Stimmung, aber keine Struktur. Zeitcodes geben dir eine Struktur.
- Verschwommene Titelsequenzen. Wenn du nicht den wörtlichen Text in den Prompt setzt, plus wie die Schrift behandelt werden soll, plus eine explizite "felsenfest"-Anweisung, bekommst du ungefähre Buchstaben. Drei oder mehr Zeilen Text sind der Punkt, an dem es anfängt zu zerbrechen.
- Eine stumme Datei oder eine Musik, die du nie bestellt hast. Es gibt keinen
audio-Parameter bei Text-to-Video, Image-to-Video oder Reference-to-Video. Audio wird in Prosa innerhalb des Prompts bestellt oder gar nicht. - Billig entwerfen mit bloßem Text-to-Video. Ohne ein festgelegtes erstes Bild liefern 768p und 2K zwei verschiedene Filme, weil der 2K-Durchlauf eine kontextbezogene Regeneration und kein Upscaling ist. Dein billiger Entwurf lehrt dich nichts über deinen teuren Final.
durationnicht senden. Das Schema dokumentiert einen Standardwert von 8, aber das Weglassen hat als 5-Sekunden-Job abgerechnet und eine 5-Sekunden-Datei zurückgegeben. Dein Trailer wird am Konfliktschlag geköpft.- Annehmen, dass HTTP 200 bedeutet, dass es befolgt wurde. Nenne ein echtes Franchise, und die Eingabeüberprüfung lehnt den Job in Sekunden ab. Andere Prompts werden stillschweigend gekürzt und normal abgerechnet.
Die Punkte 4, 5 und 6 sind die teuren, und keiner davon steht in der Dokumentation.
Der MiniMax H3-Kinotrailer-Generator-Workflow und was jeder Schritt kostet
Fünf Schritte, fünf Modelle, ein Browser-Tab und ein API-Key. Die Preise unten sind die aktuellen Pro-Sekunde-Raten auf der jeweiligen Modellseite heute, keine Blog-Zahlen.
| Schritt | Modell | Was es tut | Preis heute (August 2026) |
|---|---|---|---|
| Startbild festlegen | GPT Image 2 (Text-to-Image) | Ein Bild, das Besetzung, Garderobe und Farbgebung festlegt | Token-basiert. Gemessene 0,1745 $ für high bei 2048x1152 |
| Teaser entwerfen und fertigstellen | MiniMax H3 Image-to-Video | Der 15-Sekunden-Trailer selbst, Bild und Ton | 2K 0,14 $/s, 768p 0,10 $/s |
| Nur-Text-Varianten | MiniMax H3 Text-to-Video | Derselbe Ablaufplan ohne festgelegtes Bild | Gleiche Raten |
| Vertikaler Schnitt, Besetzung festlegen | MiniMax H3 Reference-to-Video | 9:16-Social-Version, bis zu 9 Bildreferenzen | Gleiche Raten |
| Einen 768p-Keeper retten | Atlas Cloud Video Upscaler | Einen Entwurf, den du magst, hochskalieren, anstatt neu zu generieren | 1080p 0,018 $/s, 2K 0,024 $/s, mindestens 5 s |
Die drei H3-Endpunkte auf dem Atlas Cloud-Modellverzeichnis . Text-to-Video, Image-to-Video und Reference-to-Video sind separate Routen mit demselben Key, weshalb die gesamte Kette unten nie einen Tab verlässt.
Parameter-Fakten, die es wert sind, auf die Hand geschrieben zu werden, alle heute anhand der Live-Schemas überprüft, nicht anhand der Readme: resolution ist 768P oder 2K, standardmäßig 2K. duration ist eine ganze Zahl von 4 bis 15. Das Feld heißt ratio, nicht aspect_ratio, und bei Image-to-Video wird es komplett ignoriert, weil die Ausgabeform von deinem Eingabebild übernommen wird. Text-to-Video und Reference-to-Video akzeptieren 21:9 bis 9:16. Alles läuft asynchron: POST /api/v1/model/generateVideo, dann poll /api/v1/model/prediction/{id}.
MiniMax H3-Kinotrailer-Tutorial: 15 Sekunden, vier Schläge, eine Generation
Der Film ist ein Original-Tiefsee-Thriller. Ein Wort für den Titel, damit die Schrift Platz zum Atmen hat. Eine Erzählstimme. Kopiere die Prompts wörtlich und tausche die Substantive gegen dein eigenes Projekt aus.
Schritt 1: Startbild mit GPT Image 2 festlegen
Beginne nicht mit dem Videomodell. Ein Bild kostet etwa siebzehn Cent und eine 15-Sekunden-2K-Generation kostet 2,10 $, also willst du den Look um eine Größenordnung günstiger festlegen. Noch wichtiger: Das festgelegte Startbild ist das Einzige, das deinen 768p-Entwurf für deinen 2K-Final vorhersagbar macht.
Plain1Kinematografisches Filmbild, anamorphotischer Look in einem 16:9-Rahmen: das Innere einer Stahl-Taucherglocke aus den 1970ern, die in schwarzes Wasser hinabsteigt, gesehen über die Schulter einer Frau in einem zerkratzten orangefarbenen Tauchanzug. Ihr Gesicht wird nur von einer einzelnen bernsteinfarbenen Instrumentenlampe und dem blassgrünen Lichtschein eines Sonarbildschirms beleuchtet. Kondenswasser perlt auf dem dicken Bullaugenglas; dahinter absolute Dunkelheit mit einem schwachen Drift von Partikeln. Starkes 35mm-Filmkorn, tiefe, zerdrückte Schwarztöne, Teal-and-Amber-Palette, geringe Schärfentiefe, nur praktisches Licht. Kein Lens Flare, kein Text, keine Logos, kein Wasserzeichen, keine Untertitel.
Einstellungen: Qualität high, Größe 2048x1152, Ausgabeformat png. Qualität high ist hier nicht optional, denn das Korn und die zerdrückten Schwarztöne sind das, was das Videomodell fünfzehn Sekunden lang weitertragen wird.

GPT Image 2-Playground auf Atlas Cloud mit dem Taucherglocken-Prompt und dem fertigen Startbild im Ausgabefeld – GPT Image 2 auf Atlas Cloud, abgeschlossener Durchlauf: der Prompt oben links, das Bild, das zum Helden dieses Artikels wurde, rechts.
Schritt 2: Den 15-Sekunden-Trailer-Ablaufplan schreiben (Etablierung, Konflikt, Höhepunkt, Titelsequenz)
Das ist der Teil, den dir niemand in den "Bester-Trailer-Generator"-Zusammenfassungen geben wird. Ein Trailer-Prompt ist ein Ablaufplan. Bild bekommt Zeitcodes, Audio bekommt Zeitcodes, Erzählung bekommt ein Fenster, und die Titelsequenz bekommt ihren wörtlichen Text.
Hier ist die Struktur allein, damit du sie mit deinem eigenen Film füllen kannst:
| Schlag | Fenster | Bild | Schnitt | Audio-Cue |
|---|---|---|---|---|
| Etablierung | 0,0–4,0 s | Eine langsame Bewegung auf deinen Protagonisten in seiner Welt | Keine Schnitte, einzelne Kamerafahrt oder -schwenk | Raumton, ein charakteristisches Geräusch, tiefe Bettung |
| Konflikt | 4,0–8,0 s | Totale, die das Ausmaß des Problems zeigt, dann zurück zu einem Detail | Zwei harte Schnitte | Die Bettung wird enger, ein metallischer Akzent, Streicher setzen ein |
| Höhepunkt | 8,0–12,0 s | Drei schnelle Details, dann Schwarz | Drei harte Schnitte, dann sechs Bilder Schwarz | Steigendes Cluster, ein Einschlag, dann harte Stille |
| Titelsequenz | 12,0–15,0 s | Titel einblenden, zwei volle Sekunden absolut still | Keine Bewegung | Ein tiefer Subbass-Einschlag, dann ein abklingender Halleffekt |
Und hier ist diese Struktur ausgefüllt, bereit zum Einfügen in Image-to-Video mit dem Schritt-1-Bild:
Plain115-Sekunden-16:9-Teaser-Trailer für einen Original-Tiefsee-Thriller. Fahre genau ab dem bereitgestellten Startbild fort: dieselbe Frau, derselbe orangefarbene Tauchanzug, dieselbe bernsteinfarbene und sonargrüne Beleuchtung, dasselbe starke Korn. Vier Schläge, harte Schnitte, keine Überblendungen. 2 30.0-4.0s ETABLIERUNG. Langsamer Zoom auf ihr Bullauge zu. Staubpartikel treiben. Der Sonarbildschirm streicht einmal. Sie atmet; ihr Ausatmen beschlägt das Glas. 44.0-8.0s KONFLIKT. Harter Schnitt auf eine niedrige Totale: die Taucherglocke winzig gegen eine schwarze Felswand, das Kabel straff darüber. Harter Schnitt zurück auf ihre Hand, die einen Schalter umlegt. Die Instrumentenlampe flackert. Eine Form passiert das Bullauge, unscharf, nicht identifizierbar. 58.0-12.0s HÖHEPUNKT. Drei schnelle Schnitte: extreme Nahaufnahme ihres Auges, das ein rotes Überlastlicht erfasst; das Bullaugenglas, das sich mit einem Haarriss biegt; totales Schwarz für sechs Bilder. 612.0-15.0s TITELSEQUENZ. Einblendung aus Schwarz auf einen Titel, zentriert, in den letzten zwei Sekunden absolut still: SALVAGE 7Extrem breite Buchstabenabstände, schwere kondensierte Serife, gebürsteter kalter Stahl mit einer leichten Rostkante und einer dezenten inneren Leuchtkraft, nicht reinweiß. Darunter, in Kapitälchen in halber Größe: NOTHING DOWN HERE STAYS LOST 8Beide Zeilen felsenfest: kein Zittern, keine Verzerrung, kein Drift, kein Neu-Rendering zwischen den Bildern. 9 10AUDIO, nativ generieren, keine stumme Spur liefern: 110.0-4.0s tiefes Rumpfstöhnen um 40 Hz, ein Sonar-Ping bei 1,5 s mit langem Nachhall, entferntes Druckzischen. 124.0-8.0s das Zischen wird enger; ein einzelner metallischer Klang bei 6,2 s; Streicher setzen auf einem einzelnen tiefen Ton ein. 138.0-12.0s steigendes Streicher-Cluster, ein Nietenknall bei 10,5 s, dann harte Stille bei 11,8 s. 1412.0-15.0s ein tiefer Subbass-Einschlag auf der Titelsequenz, dann ein langsamer abklingender Hall über leisem Sonar. 15ERZÄHLUNG, nur eine Zeile, weibliche Stimme, leise und gemächlich, unter die Musik gemischt, gesprochen zwischen 5,0 s und 7,5 s: "Nothing down here stays lost." 16 17NEGATIV: kein Text auf dem Bildschirm außer den beiden Titelzeilen; keine Untertitel, keine Bildunterschriften, kein Wasserzeichen, kein Studio-Logo, kein Lens Flare, keine Schwenks, keine Kamerabewegung außer einer langsamen Handkameraführung, kein Tageslicht, keine sichtbare Kreatur, kein Blut, keine Gewalt.
Drei Dinge darin leisten mehr Arbeit, als sie aussehen. Der AUDIO-Block existiert, weil es keinen Audio-Parameter gibt, den man setzen könnte. Die "felsenfest"-Zeile existiert, weil Schriftstabilität der häufigste Fehler bei Trailern ist. Und die sechs Bilder Schwarz bei 11,8 Sekunden sind das, was die Titelsequenz wie eine Titelsequenz aussehen lässt und nicht wie eine weitere Einstellung.

Vier Bilder aus dem fertigen SALVAGE-Teaser, beschriftet mit ETABLIERUNG, KONFLIKT, HÖHEPUNKT und TITELSEQUENZ, die den Ablaufplan zeigen, wie er tatsächlich gerendert wurde – Dieselben vier Schläge, wie sie tatsächlich herauskamen, aus der 2K-Datei. Von links nach rechts: die Kamerafahrt bei 2 s, die niedrige Totale bei 5 s, das Überlastlicht bei 10 s, die Titelsequenz bei 14 s.
Schritt 3: Den MiniMax H3-Kinotrailer bei 768p für 1,50 $ entwerfen
Gleiches Bild, gleicher Prompt, resolution: "768P", duration: 15. Sende duration explizit. Das Weglassen hat als 5-Sekunden-Job abgerechnet. Du bekommst 1344x768, 24 fps, AAC-Stereo und eine Rechnung von 1,50 $.
Der 768p-Entwurf. Strukturell derselbe Film wie der 2K-Final, weil das erste Bild festgelegt ist. Die kleine Schrift in der Titelsequenz ist der Ort, an dem der Auflösungsunterschied sichtbar wird.
Beurteile ihn nur nach vier Dingen und ignoriere die Schärfe vollständig:
- Liegen die Schnitte auf den Schlägen, oder hat ein Schlag einen anderen aufgefressen?
- Existiert die Erzählung, und liegt sie innerhalb des 5- bis 7,5-Sekunden-Fensters?
- Steht die Titelsequenz still oder kriecht sie?
- Trifft die Musik den Einschlag bei 12 Sekunden?
Wenn einer dieser Punkte fehlschlägt, korrigiere den Prompt und entwerfe für 1,50 $ neu. Korrigiere es nicht für 2,10 $.
Schritt 4: Den MiniMax H3-Kinotrailer bei 2K fertigstellen
Ändere genau ein Feld. Gleiches image, gleicher Prompt, resolution: "2K". Ausgabe ist 2560x1440 und die Rechnung beträgt 2,10 $.
Weil das erste Bild festgelegt ist, unterscheiden sich die beiden Durchläufe in Details, nicht im Inhalt. Die ehrliche Version: Die große Schrift liest sich bei 768p gut, aber die zweite Zeile löst sich nur bei 2K in tatsächliche Buchstabenformen auf.

Ausschnitt der Titelsequenz bei 100 %, links 768p und rechts 2K, zeigt, wie sich die Untertitelzeile nur bei 2K in lesbare Buchstabenformen auflöst – Dasselbe Bild, derselbe Frame, bei 100 % beschnitten. Das weit gesetzte SALVAGE überlebt beide. Die halb so große Zeile darunter ist der Grund, warum du bei 2K fertigstellst.

MiniMax H3 Image-to-Video-Playground auf Atlas Cloud mit geladenem Taucherglocken-Bild und einem fertigen Clip im Ausgabefeld – MiniMax H3 Image-to-Video auf Atlas Cloud, abgeschlossener Durchlauf. Die Auflösungs- und Dauer-Auswahlfelder des Playgrounds wurden für diesen Screenshot auf den Standardwerten belassen, daher ist der Clip im AUSGABE-Feld ein kürzerer Lauf als der oben beschriebene 15-Sekunden-Aufruf, nicht der fertige Teaser.
Es gibt eine günstigere Fertigstellung. Wenn ein 768p-Durchlauf bereits ein Keeper ist, sende ihn durch den Video-Upscaler für 0,024 $ pro Sekunde auf 2K, das sind 0,36 $ für 15 Sekunden. Es schützt den Durchlauf, den du bereits magst, kann aber keine Buchstabenform-Details erfinden, die nie in der Quelle waren, und die 2K-Route begrenzt die Eingabe auf 23 Sekunden.
Schritt 5: Einen vertikalen MiniMax H3-Kinotrailer mit Reference-to-Video schneiden
Die 16:9-Datei ist für die Website. Die 9:16-Datei ist die, die tatsächlich angesehen wird. Reference-to-Video akzeptiert bis zu neun Bildreferenzen plus Video und Audio, sodass du denselben Hauptdarsteller und dieselbe Farbgebung in einem Hochformat-Neurahmen festlegen kannst, anstatt es zu erhoffen.
Sende refers als Array mit dem Schritt-1-Bild plus einem Moodboard, ratio: "9:16", duration: 15, resolution: "2K". Der Prompt ist derselbe Ablaufplan mit vertikaler Blockung: Der Konfliktschlag wird zu einer einzelnen mittleren Nahaufnahme anstelle einer niedrigen Totalen, und die Titelsequenz bekommt größere Schrift mit der Untertitelzeile auf zwei Zeilen aufgeteilt.
Eine Falle, die Geld kostet, weil sie nie einen Fehler ausgibt: Sende image und refers nicht in derselben Anfrage. Sie schließen sich gegenseitig aus, die API akzeptiert beide, und einer wird stillschweigend fallengelassen.
Der vertikale Schnitt von minimax/h3/reference-to-video , gleiche Besetzung, gleiche Farbgebung, für ein Telefon umgebockt.

MiniMax H3 Reference-to-Video-Playground auf Atlas Cloud mit geladenen Referenzmaterialien und einem fertigen Clip im Ausgabefeld – MiniMax H3 Reference-to-Video auf Atlas Cloud, abgeschlossener Durchlauf, mit gefülltem Referenzfeld. Auflösung und Dauer wieder auf Playground-Standardwerten.
Vier Variationen des MiniMax H3-Kinotrailer-Prompts
Derselbe Ablaufplan, vier verschiedene Liefergegenstände.
Scope. Ändere ratio auf 21:9 bei Text-to-Video oder Reference-to-Video. Derselbe Ablaufplan, breiterer Letterbox, und die Titelsequenz bekommt merklich mehr Platz für die Buchstabenabstände.
Nur Titelsting. Lasse die Schläge eins bis drei weg, behalte die Titelsequenz, setze duration: 4. Das sind 0,56 $ bei 2K für eine Logo-Animation mit einem Subbass-Einschlag. Nützlich weit über Filme hinaus, da ein "Trailer" oft für ein Spiel, ein Buch oder einen Podcast ist.
Eine andere Sprache. H3 verarbeitet Erzählung nativ in mehreren Sprachen, sodass derselbe Ablaufplan mit der in Japanisch umgeschriebenen Erzählzeile einen lokalisierten Teaser ohne separate Synchronisationsspur ergibt.
Eine andere Kategorie. Vertikale Drama-Teaser sind dieselben vier Schläge mit Dialog statt Erzählung. Hier ist ein offizielles 9:16-Beispiel aus dem H3-Showcase-Set: fünfzehn Sekunden, acht Einstellungen, eine durchgehend konsistente Figur, mit gesprochenen Zeilen statt Voiceover.
Offizieller MiniMax H3-Vertikal-Teaser, 1440x2560, 15 Sekunden, acht Einstellungen, AAC-Stereo mit Dialog. Dieselbe Schlag-Struktur, ausgerichtet auf ein Kurzfilm-Drama-Publikum.
Möchtest du einen 30-Sekunden-Teaser? Nimm das letzte Bild von Clip eins und verwende es als erstes Bild von Clip zwei. Details findest du in unserem MiniMax H3-Videolängen-Leitfaden.
Was ein MiniMax H3-Kinotrailer tatsächlich kostet
Vier ehrliche Wege zu einem fertigen 15-Sekunden-2K-Teaser. Die Bildkosten betragen die gemessenen 0,1745 $ für GPT Image 2 bei high, 2048x1152.
| Weg | Posten | Gesamt |
|---|---|---|
| Direkt zu 2K | Bild 0,1745 $ + 2K 2,10 $ | 2,27 $ |
| Entwurf, dann fertig (empfohlen) | Bild 0,1745 $ + 768p 1,50 $ + 2K 2,10 $ | 3,77 $ |
| Entwurf, dann hochskalieren | Bild 0,1745 $ + 768p 1,50 $ + Upscaling 0,36 $ | 2,03 $ |
| Realistische Sitzung, drei Entwürfe | Bild 0,1745 $ + 3 x 1,50 $ + 2K 2,10 $ | 6,77 $ |
| Vertikalen Schnitt hinzufügen | + 2,10 $ | — |
MiniMax' eigene direkte Preisgestaltung ist etwas niedriger pro Sekunde als der Atlas-Tarif, daher wirst du anderswo eine Zahl von 1,95 $ für einen 15-Sekunden-2K-Clip sehen. Auf Atlas beträgt der Tarif 0,14 $ pro Sekunde, was 2,10 $ entspricht, und das ist die Zahl, die jede Rechnung in diesem Artikel verwendet.
Und hier ist, was diese 2,10 $ ersetzt haben, ehrlich bewertet:
| Traditioneller Post-Durchlauf | Wer macht es normalerweise | Liefert H3 es in einem Durchlauf? | Wie gut, gemessen |
|---|---|---|---|
| Mehreinstellungs-Montage | Editor | Ja | Vier Schläge gehalten; Schnitte landeten auf den geschriebenen Zeitcodes |
| Erzählung aufnehmen | Sprecher plus Studio | Ja | Landete im geschriebenen 5- bis 7,5-s-Fenster |
| Musik | Komponist oder Bibliothekslizenz | Ja | Bogen und der 12-s-Einschlag beide vorhanden |
| Sounddesign | Sounddesigner | Ja, mit Einschränkung | Cues landen auf dem Schlag, nicht frame-genau zu den benannten Zeitcodes |
| Titelsequenz-Animation | Motion-Designer | Ja | Stabil bei 2K; die halb so große Zeile ist weich bei 768p |
Wenn du dies Zeile für Zeile gegen die anderen H3-Endpunkte bepreisen möchtest, findest du die Pro-Aufruf-Arithmetik im MiniMax H3 API-Preisaufschlüsselung, und die drei Endpunkte oben leben auf einem Key im demselben Modellverzeichnis, wenn du die Kette selbst ausführen möchtest.
Fan-Trailer, echte Filme und die Metadaten, die eine Milliarde Aufrufe gelöscht haben
Es lohnt sich, genau zu sein, was mit diesen Kanälen tatsächlich passiert ist, denn die Lektion ist nicht "mache keine Trailer mit KI".
Beide Kanäle wurden gesperrt, machten Korrekturen, wurden wieder in das Partnerprogramm aufgenommen, fielen dann zurück und wurden gemäß YouTubes Richtlinien zu Spam und irreführenden Metadaten gekündigt. Das Problem war die Präsentation: Titel und Thumbnails, die wie offizielles Studiomaterial für Filme aussahen, die keinen solchen Trailer hatten. Wenn du ein Konzeptstück für ein bestehendes Eigentum machst, kennzeichne es im Titel, im Thumbnail und in der Beschreibung, und lass die Metadaten nicht implizieren, dass es vom Studio stammt.
H3 drängt auf API-Ebene auch dagegen zurück. Nenne ein echtes Franchise oder einen bestimmten Film im Prompt, und der Job schlägt während der Eingabeüberprüfung innerhalb von Sekunden fehl, anstatt etwas zu generieren, über das du dann nachdenken musst. Es ist ein stumpfer Filter, und er wird gelegentlich einen unschuldigen Prompt erwischen, aber es ist ein nützliches Signal dafür, wo die Grenze liegt.
Noch eine Anmerkung, wenn du selbst hostest, anstatt die API aufzurufen: Die veröffentlichten Gewichte werden unter der MiniMax H3 Community License Agreement ausgeliefert, und die Module H3-Context-IR und H3-Regenerate-2K, die den 2K-Durchlauf produzieren, sind nicht Teil der offenen Veröffentlichung, sie bleiben API-seitig. Unser Leitfaden zur kommerziellen Nutzung und Lizenzierung behandelt die Bedingungen; nichts davon gilt für den in diesem Artikel verwendeten API-Weg.
Häufig gestellte Fragen
Kann der MiniMax H3-Kinotrailer-Generator einen vollständigen Trailer oder nur 15 Sekunden erstellen?
15 Sekunden sind eine harte Obergrenze pro Generation. Ein Kinoteaser läuft 30 bis 60 Sekunden und ein vollständiger Trailer 90 Sekunden bis drei Minuten (Beverly Boy, 2026), also gibt dir ein Aufruf den Social-Clip, nicht den Kinoclip. Für längere Clips verketten Generationen, indem du das letzte Bild eines Clips als erstes Bild des nächsten einspeist.
Generiert MiniMax H3 die Trailer-Voiceover und Musik nativ, oder füge ich sie nachträglich hinzu?
Nativ, im selben Aufruf wie das Bild, geliefert als AAC-Stereo bei 32 kHz zusammen mit 24 fps Video. Aber es gibt keinen Audio-Parameter an einem der drei Endpunkte. Du bestellst die Musik, die Erzählung und die Soundeffekte in Prosa innerhalb des Prompts, mit Zeitcodes. Überspringe diesen Block, und du bekommst einen Soundtrack, den du nicht gewählt hast.
Wird der Text der Titelsequenz tatsächlich lesbar sein?
Ja, wenn du den wörtlichen Text schreibst, beschreibst, wie die Schrift behandelt werden soll, und eine explizite Stabilitätsanweisung wie "felsenfest, kein Zittern, keine Verzerrung" hinzufügst. Halte es bei zwei Zeilen. Große, weit gesetzte Schrift überlebt 768p; kleine Sekundärzeilen lösen sich nur bei 2K ordentlich auf.
Wie viel kostet ein MiniMax H3-Kinotrailer?
Auf Atlas Cloud, 15 Sekunden bei 2K kosten 2,10 $ bei 0,14 $ pro Sekunde, und dieselbe Länge bei 768p kostet 1,50 $ bei 0,10 $ pro Sekunde. Füge etwa 0,17 $ für das Startbild hinzu. Ein fertiger Teaser liegt zwischen 2,03 $ und 3,77 $, je nachdem, ob du einen Entwurf hochskalierst oder bei 2K neu generierst. Sende duration immer explizit.
Kann ich einen Trailer für einen echten, existierenden Film erstellen?
Technisch blockiert die Eingabeüberprüfung benannte Franchises, sodass das Modell ablehnt, bevor es dir etwas in Rechnung stellt. Praktisch hat YouTube bereits Kanäle mit einer Milliarde Aufrufen wegen irreführender Metadaten zu genau diesem Inhalt gekündigt. Mache es original oder kennzeichne es klar als Konzept- oder Fanstück im Titel und in der Beschreibung.
Kann ich denselben Hauptdarsteller über einen längeren Trailer hinweg beibehalten?
Verwende Reference-to-Video, das bis zu neun Referenzbilder plus Referenzvideo und -audio akzeptiert, und lege deine Besetzung dort fest, anstatt zu hoffen, dass Text allein sie hält. Sende image und refers nicht in derselben Anfrage: Sie schließen sich gegenseitig aus, die API wird sich nicht beschweren, und einer wird ohne Benachrichtigung fallengelassen.






