Nutze MiniMax H3 wie ein kurzes Produktions-Briefing, nicht wie einen einzelnen Bild-Prompt. Die wiederverwendbare Struktur ist einfach: Binde jedes Referenz-Asset ein, nenne die Kernidee, schreibe dann die Szene als zeitgesteuerte audiovisuelle Sequenz mit Kamerabewegung, Dialog, Atmosphäre, Musik und Einschränkungen in separaten Blöcken.
Dieser Leitfaden dekodiert 45 offizielle MiniMax-H3-Beispiele in eine sechsteilige Prompt-Formel, zeigt, wo end_image hingehört, erklärt, wie native Audio-Hinweise das Ergebnis verändern, und gibt einen praktischen Fix für verstümmelten Text in generierten Clips.
Du weißt bereits, wie man ein Videomodell promptet. „Cinematic Lighting, Slow Push In, 4K.“ Dieses Vokabular hat dich zwei Jahre lang getragen.
Dann fügst du es in MiniMax H3 ein und bekommst einen 2K-Clip zurück, der mit eigenem Soundtrack daherkommt. Das Bild sieht großartig aus. Das Tempo ist Matsch. Zwei Buchstaben in deinem Titel sind falsch geschrieben. Der Audio ist ein Raumton, den das Modell für dich ausgesucht hat.
Das Modell ist nicht das Problem. Du hast ihm einen Satz gegeben. Es wollte einen Fahrplan.
Also habe ich alle 45 Beispiel-Prompts gelesen, die MiniMax mit H3 ausgeliefert hat, plus die fertigen Clips, und die Frames auseinandergenommen. Die offiziellen Prompts sind keine Beschreibungen. Die guten sind Drehpläne mit einer beigehefteten Musik-Cue-Sheet. Unten folgen die Struktur, die Parameter, die gerade tatsächlich exponiert sind, und eine Demo, die du in etwa zwanzig Minuten nachbauen kannst.
Wichtige Erkenntnisse
- H3-Prompts sind Zeitachsen, keine Beschreibungen. Die stärksten offiziellen Beispiele schneiden den Clip buchstäblich mit [0s-2s], [2s-4s]-Markern, und der fertige Film trifft jeden Beat.
- Bild und Ton kommen aus demselben Durchlauf, daher muss Audio im Prompt-Körper leben. Offizielle Prompts geben ihm einen eigenen Block, bis hin zu „Jazz-Bass-Groove setzt bei 6s ein“.
- Text, den du buchstabierst, kommt sauber zurück. Text, den du nicht buchstabierst, kommt als buchstabenförmiges Rauschen zurück. Ich habe die Frame-Ausschnitte aus einem einzigen offiziellen Clip, die beide Hälften gleichzeitig beweisen.
- Image-to-Video akzeptiert ein end_image. Gib einen ersten Frame und einen letzten Frame, und der emotionale Bogen ist festgelegt, bevor du eine Sekunde Rechenzeit ausgibst.
- Prompt-Länge ist keine Tugend. Kurze offizielle Prompts funktionieren, wenn ein Referenzbild die Beschreibung übernimmt. Länge misst, wie viel der Arbeit du dich geweigert hast, einer Referenz zu überlassen.
Der This Is Fine-Hund, immer noch links und in 10 Sekunden MiniMax-H3-Ausgabe rechts brennend
Das ist dieselbe Zeichnung auf beiden Seiten. Links ist KC Greens ursprüngliches Panel, unberührt. Rechts ist ein Image-to-Video-Aufruf: erster Frame rein, letzter Frame rein, zehn Sekunden raus, und das Knistern des Feuers und das flache kleine „This is fine“ sind die eigene Audiospur des Modells. Niemand hat es vertont. Alles in diesem Leitfaden zielt darauf ab, dich zu dieser zweiten Hälfte zu bringen.
Wie ein MiniMax-H3-Prompt tatsächlich aussieht (ich habe alle 45 gelesen)
Jeder „MiniMax-H3-Prompt-Guide“, der derzeit auf der ersten Suchergebnisseite steht, ist ein Datenblatt: 2K, 24fps, 5 bis 15 Sekunden, nativer Audio. Das ist die Modellkarte. Es ist kein Prompt.
Hier ist ein echter. Dies ist ein Ausschnitt des offiziellen Prompts hinter MiniMaxs Noir-Titelsequenz, aus dem chinesischen Original übersetzt, etwa ein Drittel seiner vollen Länge:
Generiere eine 15-sekündige 16:9-Titelsequenz für einen leichten Spannungs-Kriminalfilm. Gesamtstil bezieht sich auf die visuelle Sprache dieser Bilder: Retro-Japan-Anime-Titelkarten, harte Silhouetten, Comic-Collage, asymmetrischer Split-Screen, starke geometrische Farbblöcke, englische Credit-Titel, etwas japanische Katakana-Dekoration, Jazz-Crime-Feeling. Die Stimmung ist zu 60% Spannung, 40% Jazz: mysteriös, cool, flink, urban-crime, kein Horror, nicht schwer, und nicht in ein fröhliches Jazz-Musikvideo verwandeln.
[...] Englische Credits müssen klar lesbar sein [...] Kein Chinesisch hinzufügen, keinen verstümmelten Text produzieren, keine englischen Wörter falsch schreiben. Regel für das gesamte Stück: Jeder englische Credit und jede Berufsbezeichnung erscheint genau einmal. Wiederhole keine Berufsbezeichnung, wiederhole keinen Namen, gib einer Person nicht mehrere Titel.
Übergänge müssen abwechslungsreich sein: kreisförmige Vinyl-Schallplattenmaske, vertikaler Autotür-Wipe, langer Schatten einer Figur, der über den Bildschirm fegt, roter Linien-Schnitt, riesige englische Buchstabenmaske, Split-Screen-Frame-Neukomposition, harter Farbblock-Schnitt, Panel, die Block für Block eingefügt werden. Alle Übergänge landen auf den Drum-Hits: knackig, spannungsgeladen, flink, Comic-Collage. Keine weichen Überblendungen, keine fließenden Übergänge.
BGM: Original-15-Sekunden-Titelmusik, 60% Spannung, 40% Jazz. Aufgebaut aus einem anhaltenden Bass-Ton, angespannten Pizzicato-Streichern, kalten Synth-Pulsen, Kick-Drum, spärlichen Jazz-Bürsten, einem Walking-Bass-Fragment, kurzen Baritonsaxophon-Phrasen und kurzen Blechbläser-Stichen. Die ersten 2 Sekunden etablieren Spannung mit tiefen Frequenzen und Hi-Hat, bei 3 Sekunden setzen die tiefen Drums ein, bei 6 Sekunden kommt der Jazz-Bass-Groove hinzu, bei 10 Sekunden erscheint ein kurzes Saxophon/Blechbläser-Riff, die letzten 2 Sekunden verriegeln es mit einem spannungsgeladenen Akkord und Drum-Hit.
Lies, wohin die Wörter gingen. Fast keines ging zu „schön“ oder „cinematic“. Sie gingen zu einer Negativliste, einer Übergangsliste und einer sekundengenauen Musik-Cue-Sheet. Das ist die Form der Aufgabe.
MiniMax H3 offizielle Noir-Titelsequenz: MIDNIGHT LINE, mit sauberen STARRING-Credits
Sieh dir die Credits in diesem Clip an. MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS. Richtig geschrieben, keine Berufsbezeichnung doppelt verwendet, Katakana-Dekoration dort, wo sie sein sollte. Der Prompt sagte nicht „mach schöne Titel“. Er sagte keine Wiederholungen, keine Rechtschreibfehler, kein Chinesisch und nannte die Ästhetik auf fünf verschiedene Arten.
Fünf Stil-Referenztafeln, die zusammen mit dem Noir-Titel-Prompt an MiniMax H3 übergeben wurden
Diese fünf Tafeln gingen mit dem Text hinein. Fünf Bilder plus ein langes Briefing, eine Generierung. So sieht diese Arbeit jetzt aus.
Und der Grund, warum so viele der 45 Prompts kurz sind, liegt genau in diesem Bild. Über die gesamte Menge hinweg liegt der Median-Prompt bei etwa 130 chinesischen Zeichen, aber die beiden längsten laufen auf 657 und 858. Die kurzen sind kurz, weil eine Referenztafel die Beschreibung trägt. Die langen sind lang, weil nichts anderes sie tragen würde.
Warum die meisten MiniMax-H3-Prompts flach herauskommen, und der Fix für verstümmelten Text
Drei Dinge gehen schief, und sie sind alle Abwesenheiten, keine Fehler.
Keine Zeitachse. Du hast zehn Sekunden verlangt und einen Moment beschrieben, also bekommst du einen langsamen Push-In, der über zehn Sekunden gedehnt wird. Das Modell hatte bei Sekunde sieben nichts zu tun.
Kein Audio-Block. Ton wird im selben Durchlauf wie das Bild erzeugt. Wenn du nichts sagst, liefert dir das Modell trotzdem eine Spur. Es wählt einfach eine aus.
Keine Negativliste. Allein gelassen greift das Modell zu weichen Überblendungen, erfindet zusätzlichen Bildschirmtext und fügt eine Untertitel-Leiste hinzu, die niemand verlangt hat.
Der deutlichste Beweis ist der offizielle Game-UI-Prompt, der aus sechs zeitgestempelten Beats besteht: [0s-2s] Menü, [2s-4s] rechter Arm-Panel, [4s-7s] Bewaffnungsraster, [7s-8.5s] Bestätigen, [8.5s-10s] Ladebalken, [10s-15s] die Welt lädt. Der fertige Clip trifft alle sechs, in der Reihenfolge, pünktlich.
MiniMax H3 Game-UI-Clip: Menü, Ausrüstungspanel, Ladebalken, Welt laden
Jetzt die ehrliche Hälfte, aus demselben Clip, in voller 2560x1440-Auflösung.
Links: Im Prompt buchstabierter Text wird sauber dargestellt. Rechts: Nicht buchstabierter Text wird als buchstabenförmiges Rauschen dargestellt
Links: Jeder String, den der Prompt tatsächlich ausgeschrieben hat: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW. Knackig, korrekt, gesperrt wie ein echtes Spielmenü.
Rechts: Das HUD in der letzten Straßenszene, das der Prompt nur als „HUD-Elemente“ bezeichnete. Es liest sich ETR METNO CITFEP. Über den Ausrüstungssymbolen, wo der Prompt nichts sagte, bekommst du MNALEαIN IAMG. Das ist kein Rendering-Fehler. Das Modell zeichnet die Textur von Englisch, weil ihm nie der String gegeben wurde.
Die Lösung ist also keine Einstellung. Es ist eine Gewohnheit:
Wenn ein Wort lesbar sein muss, tippe das Wort. Füge dann eine Negativzeile hinzu: nicht falsch schreiben, keinen anderen Text hinzufügen, keine Untertitel hinzufügen.
Und hier ist die Sechs-Block-Form, die jeder starke offizielle Prompt teilt.
| Block | Was reinkommt | Beispiel aus einem offiziellen Prompt | Überspringe es und du bekommst |
|---|---|---|---|
| 1. Stilvertrag | Medium, Textur, Palette, Ära, der Look, den du nicht verlieren darfst | „Retro-Japan-Anime-Titelkarten, harte Silhouetten, Comic-Collage, starke geometrische Farbblöcke“ | Ein generischer glänzender Render, der bei Sekunde sechs abdrifft |
| 2. Zeitachse | Buchstäbliche Zeitscheiben mit einer Aktion in jeder | [2s-4s] Sanfter Zoom auf ihren rechten Arm. UI-Panel gleitet von rechts herein | Eine Idee, die über die gesamte Dauer gestreckt wird |
| 3. Kamera | Bewegung oder explizite Verweigerung von Bewegung | „fest, statische Totale, kein Push-In, keine Schnitte“ | Eine standardmäßige langsame Dolly, die du nicht verlangt hast |
| 4. Audio | Jedes Geräusch und wann es einsetzt | „bei 6 Sekunden kommt der Jazz-Bass-Groove hinzu, die letzten 2 Sekunden verriegeln es mit einem spannungsgeladenen Akkord“ | Welcher Raumton dem Modell heute gefällt |
| 5. Text, buchstabiert | Die wörtlichen Strings, in Anführungszeichen | „THIS IS FINE.“ / CONFIRM CONFIG | Buchstabenförmiges Rauschen, wie oben |
| 6. Negativliste | Die Übergänge, Objekte und Klischees, die abgelehnt werden sollen | „Keine weichen Überblendungen, keine fließenden Übergänge, kein Chinesisch hinzufügen, keine Berufsbezeichnung wiederholen“ | Weiche Überblendungen, erfundener Text, unheimliches Abdriften |
Blöcke 5 und 6 sind kostenlos. Sie kosten nichts extra für die Generierung und beherbergen den Großteil der Qualität.
Der MiniMax-H3-Prompt-Workflow: Zu welchem Endpunkt dein Prompt gehört
Gleicher Schlüssel, gleiches Submit-and-Poll-Format, drei Türen. Welche du wählst, entscheidet, was dein Prompt noch tun muss.
| Endpunkt | Was du übergibst | Was es für dich festlegt | Wissenswerte Parameter | Greife danach, wenn | Abrechnung |
|---|---|---|---|---|---|
| minimax/h3/text-to-video | Nur Prompt | Nichts. Der Text trägt alles | Dauer 5-10 (Standard 8), Auflösung 2K, Seitenverhältnis muss explizit gesetzt werden | Einen Look oder ein Sounddesign testen, bevor du dich festlegst | Abgerechnet pro Sekunde Ausgabe, aktueller Satz auf der Modellseite |
| minimax/h3/image-to-video | Prompt + Bild (erster Frame), optionales end_image | Wo der Clip beginnt und optional wo er endet | end_image, Dauer 5-10 (Standard 8), Seitenverhältnis standardmäßig adaptiv | Du hast Kunst und möchtest, dass sie sich bewegt, ohne neu gezeichnet zu werden | Abgerechnet pro Sekunde Ausgabe |
| minimax/h3/reference-to-video | Prompt + refers[] | Subjektidentität und Stil, in einer Szene, die du erfindest | refers[] gemischtes Array, Dauer 5-15, Seitenverhältnis bis 21:9 | Gleicher Charakter oder gleiches Produkt, neue Umgebung | Abgerechnet pro Sekunde Ausgabe |
refers[] ist das, was in der freien Wildbahn wirklich unterdokumentiert ist, also hier die Form, die es haben möchte:
json1"refers": [ 2 { "url": "https://.../subject.png", "type": "image" }, 3 { "url": "https://.../style-board.png" }, 4 { "url": "https://.../motion-ref.mp4", "type": "video" }, 5 { "url": "https://.../beat.mp3", "type": "audio" } 6] 7
Vier Regeln, die dir jeweils eine verschwendete Generierung ersparen:
- Audio kann nicht allein reiten. Mindestens ein Bild oder Video muss im Array sein. Eine Beat-Spur allein wird abgelehnt.
- type ist optional. Es wird aus der URL abgeleitet, aber gib es trotzdem an, wenn die Erweiterung mehrdeutig ist.
- Die Obergrenzen sind real. Bis zu 9 Bilder, 3 Videos und 3 Audio-Clips, insgesamt 12 Dateien, wobei Referenz-Video und -Audio jeweils 2 bis 15 Sekunden laufen (MiniMax API-Dokumentation, Juli 2026).
- Gib jeder Referenz eine Aufgabe im Prompt-Text. Das ist die gewinnbringendste Gewohnheit auf dieser Liste. Offizielle Prompts beginnen mit Zeilen wie „Bild 1 ist die Gesamtstimmungs- und Stilreferenz, Bild 2 ist die Hauptfigurenreferenz.“ Ohne diesen Satz muss das Modell raten, welche Tafel was bedeutet.
MiniMax H3 Dark-Pop-Musikvideo: CUT BACK, ONE LOOK, DETONATE Typografie
Die zwei Typografie-Referenztafeln hinter dem Dark-Pop-Clip
Dieser Clip ist das Argument für Regel 4. Sein Prompt beschreibt nie eine einzelne Buchstabenform. Er sagt „Text-Packaging-Stil und Textur beziehen sich auf die Bilder“ und übergibt zwei Tafeln. Das Layout kam an, weil es gezeigt wurde, nicht beschrieben.
Noch eine Tabelle, weil die Modellkarte und die API derzeit nicht dasselbe sagen, und die Lücke ist der Ort, an dem Leute einen Nachmittag verlieren.
| Sache | MiniMaxs eigene Dokumentation | Was die Endpunkte heute tatsächlich akzeptieren | Was das für deinen Prompt bedeutet |
|---|---|---|---|
| Dauer | 4 bis 15 Sekunden, nur ganze Zahlen | text-to-video und image-to-video: 5 bis 10, Standard 8. reference-to-video: 5 bis 15, Standard 8 | Eine 15-Sekunden-Shotliste passt nur derzeit in reference-to-video. Schreibe längere Boards in 10 um |
| Auflösung | 2K | Auflösung standardmäßig 2K, und 2K ist derzeit der einzige Wert, der läuft. Ein 768p-Job kommt mit dem Modell MiniMax-H3 does not support resolution 768P, supported resolutions: 2K zurück, obwohl 768p in der Preistabelle erscheint | Schreibe für eine kurze Seite von 1440px. Details, die du verlangst, werden tatsächlich überleben |
| Seitenverhältnis | Übliche Verhältnisse oder adaptiv | image-to-video und reference-to-video standardmäßig adaptiv. Nur-Text lehnt adaptiv ab und gibt seine erlaubte Menge zurück: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9 | Bei text-to-video das Verhältnis explizit setzen, sonst schlägt die Validierung fehl |
| Gemischte Referenzen | 9 Bilder, 3 Videos, 3 Audio, 12 Dateien, Audio nie allein | refers[] nimmt {url, type} mit image, video oder audio, mindestens ein Bild oder Video | Du kannst Bewegung wirklich mit einem gelieferten Beat synchronisieren. Du kannst nur nicht nur den Beat liefern |
| Nativer Audio | Stereo-Audio im selben Durchlauf | Jeder der neun offiziellen Clips, die ich untersucht habe: 2560x1440, 24fps, AAC Stereo bei 32kHz | Der Audio-Block ist keine Dekoration. Er ist die Hälfte des Liefergegenstandes |
Alles oben lief auf Atlas Cloud, wo alle drei H3-Endpunkte hinter einem Schlüssel und einer Submit-and-Poll-Schleife sitzen, sodass der Wechsel zwischen ihnen eine Änderung des Modell-Strings und sonst nichts ist.
MiniMax H3 Prompt-Tutorial: Setze den This Is Fine-Hund in Brand, mit Ton
Hier ist das Ganze von Anfang bis Ende. Der Witz funktioniert, weil der Hund nichts tut. Dehne diese Verweigerung auf zehn Sekunden Echtzeit aus, füge echtes Feuer hinzu und lass die letzten zwei Sekunden dorthin gehen, wo der ursprüngliche Comic tatsächlich hinging, und es wird lustiger und etwas schlimmer für dich. Die meisten Leute haben nur die ersten beiden Panels gesehen.
Schritt 1: Lade den originalen Comic herunter. Lass keine KI ihn neu zeichnen.
Der Strip besteht aus sechs Panels, zwei Spalten mal drei Reihen, 600 mal 887. Wir wollen nur Panel 2 und Panel 6.
bash1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png 2# 600x887, 6 panels, 2 cols x 3 rows 3 4# crop panel 2 (the "THIS IS FINE." panel): x 302-584, y 20-293 5# crop panel 6 (the melting dog): x 302-584, y 595-868 6# upscale each 4x with Lanczos -> 1128x1092 7
Sag es klar: Bitte kein Bildmodell, einen „Hund, der wie This Is Fine aussieht“ zu zeichnen. Eine KI-Nachbildung wird innerhalb einer halben Sekunde als Fake erkannt, und der Witz stirbt auf der Stelle. Die Aquarellwäsche, die wackelige Handlettering und die Papierkörnung sind der gesamte Vertrag. Die 4-fache Lanczos-Hochskalierung ist nur da, weil 282px Quelle dünn ist; sie gibt dem Modell echte Pixel zum Festhalten, ohne welche zu erfinden.
Panel 2 und Panel 6 des Original-Comics, beschriftet als Eingaben für ersten Frame und Endbild
Schritt 2: Führe es auf image-to-video mit einem end_image aus.
Modell: minimax/h3/image-to-video. Einstellungen: Auflösung 2K, image = Panel 2, end_image = Panel 6, Verhältnis 1:1, um die eher quadratische Quelle zu treffen. Setze Dauer auf 10; der Schieberegler steht standardmäßig auf 8, also ziehe ihn.
text1Handgemalter 2D-Webcomic-Panel, zum Leben erweckt. Behalte in jedem Frame die 2originale Aquarell-Textur, sichtbare Tintenumrisse, nicht passende Papierkörnung 3und flache Comic-Palette bei. Nicht glätten, nicht in 3D neu rendern, die 4Linienführung nicht bereinigen, keine neuen Objekte hinzufügen, keinen neuen 5Text hinzufügen. 6 7[0s-3s] Fast nichts bewegt sich. Der Hund sitzt völlig still, hält die Tasse, 8Blick geradeaus. Nur die Flammen hinter ihm bewegen sich: langsame orangefarbene 9Lecks, die die Wand hochkriechen, ein Glutstück, das aufsteigt. Die Sprechblase 10mit „THIS IS FINE.“ bleibt genau, wo sie ist, vollständig lesbar, unverändert, 11handgeschrieben. 12 13[3s-6s] Der Hund hebt die Tasse und nimmt einen kleinen, ruhigen Schluck. Die 14Sprechblase verblasst nach dem Schluck. Das Feuer wird heller. Die Wand hinter 15ihm beginnt sich vor Hitze zu verziehen. Sein Hut beginnt am Rand zu schwelen. 16 17[6s-8.5s] Die Hitze erreicht ihn. Seine Ohren sacken ab, seine Kontur wird 18weicher und beginnt wie nasse Farbe nach unten zu laufen. Er bewegt seine Augen 19immer noch nicht. Die Tasse bleibt in seiner Pfote. 20 21[8.5s-10s] Vollständiges Schmelzen. Das Gesicht verzerrt sich, ein Auge 22rutscht, Zähne in einem starren Grinsen entblößt, das Fell läuft rot und orange. 23Er hält die Pose. Halte den letzten Frame für die letzte halbe Sekunde. 24 25Kamera: fest, einzelne statische Totale, kein Push-In, keine Handkamera, keine 26Schnitte. Der Frame bewegt sich nie. Dies ist eine einzige durchgehende 27Einstellung innerhalb eines Comic-Panels. 28 29Audio: Raumton eines Innenfeuers durchgehend - leises Knistern, gelegentliches 30Ploppen von brennendem Holz, ein schwaches strukturelles Knarren. Bei 3s eine 31Keramiktasse, die Zähne berührt, und ein kleiner Schluck. Eine ruhige, flache, 32unbeteiligte männliche Stimme sagt genau: „This is fine.“ - ausdruckslos, keine 33Emotion, leicht zu entspannt. Ab 6s wird das Knistern lauter und der Raumton 34dicker; die letzten 2 Sekunden fügen ein tiefes Subbass-Schwellen hinzu. Keine 35Musik, kein Lachtrack, keine Soundeffekte, die nicht in dieser Liste stehen. 36 37Keine Untertitel hinzufügen. Kein Wasserzeichen hinzufügen. Kein Wort 38buchstabieren, das nicht bereits im Bild ist. „THIS IS FINE.“ nicht ändern. 39Nicht wegschneiden. 40
Dieser Prompt ist die Strukturtabelle, lebendig. Absatz eins ist der Stilvertrag. Die vier eingeklammerten Scheiben sind die Zeitachse. Dann Kamera, dann Audio, dann die Negativliste. Nichts darin ist dekorativ.
MiniMax H3 image-to-video auf Atlas Cloud: erster Frame und Endbild geladen, 10 Sekunden bei 2K, fertiger Clip im Ausgabefenster
Schritt 3: Lies die Ausgabe wie ein QA-Durchlauf.
Vier Checks, die jeweils einen anderen Block des Prompts testen.
- Ist THIS IS FINE. in der Blase noch lesbar und noch richtig geschrieben? Testet Block 5.
- Hat die Linienführung überlebt, oder hat etwas sie in sauberes 3D „verbessert“? Testet Block 1.
- Enthält das Audio nur die von dir aufgelisteten Geräusche? Untersuche den Container: Er sollte h264 plus AAC Stereo zurückgeben.
- Landet der letzte Frame auf der Pose von Panel 6? Testet end_image.
bash1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \ 2 -of default=noprint_wrappers=1 output.mp4 3
Meiner kam mit 1472x1440, 24fps, h264 plus AAC Stereo, 10,13 Sekunden zurück. Beachte: Ich habe ratio: 1:1 verlangt und 1472x1440 bekommen, also gewinnt bei image-to-video die Form des Quellframes. Passe deine beiden Panels an die Form an, die du tatsächlich haben möchtest.
Vier Frames aus dem fertigen Clip bei 0s, 3s, 6.5s und 10s, die den vier Zeitscheiben im Prompt entsprechen
Schritt 4: Bewege den Hund mit reference-to-video an einen neuen Ort.
Gleicher Charakter, neuer Raum. Modell: minimax/h3/reference-to-video. Einstellungen: refers[] = Panel 2 als Bild, Dauer 8, Auflösung 2K, Verhältnis 16:9.
text1Bild 1 ist die Charakter- und Kunststil-Referenz: Behalte diesen exakten 2handgemalten 2D-Webcomic-Look, die gleiche Aquarell-Textur, das gleiche 3Tintenumriss-Gewicht, den gleichen Hund, den gleichen kleinen Hut, die gleiche 4Tasse. Zeichne ihn nicht in 3D neu, ändere seine Proportionen nicht, bereinige 5die Linienführung nicht. 6 7Setze ihn in einen anderen Raum und bewahre seine Gelassenheit. Ein beengtes 8Open-Plan-Büro bei Nacht, Leuchtstoffröhren flackern, eine Wand aus Monitoren, 9die alle einen roten Fehlerzustand anzeigen, Druckerpapier schwebt durch den 10Frame, ein kleines elektrisches Feuer in der Ecke. Er sitzt auf einem Bürostuhl 11in der Mitte des Frames, Tasse in der Pfote, schaut direkt in die Kamera, 12völlig entspannt. 13 14Kamera: fest, statische Totale. Kein Push-In, keine Schnitte. 15 16Audio: Leuchtstoffröhren-Summen, Drucker-Schleifgeräusch, ein sich wiederholender 17weicher Alarmton alle zwei Sekunden, entferntes elektrisches Knistern, ein 18ruhiger Schluck bei 4s. Keine Musik. Keine Stimme. 19 20Keinen Bildschirmtext hinzufügen. Keine Untertitel hinzufügen. Keine anderen 21Charaktere hinzufügen. 22
Die übertragbare Regel: refers[] trägt Identität und Stil, der Text trägt die Szene. Diese Aufteilung ist der ganze Trick für Charakterkonsistenz, und sie ist der Grund, warum die erste Zeile des Prompts überhaupt existiert.
Derselbe Webcomic-Hund, der in ein brennendes Open-Plan-Büro bei Nacht verlegt wurde, generiert von MiniMax H3 reference-to-video
Gleicher Hut, gleiche Tasse, gleiches Tintengewicht, neuer Raum. Ein Referenzbild hat das alles bewirkt.
Drei weitere MiniMax-H3-Prompt-Muster, die man stehlen sollte
Muster 1: Das Motion-Poster, bei dem das Layout nicht bewegt werden darf.
MiniMax H3 Motion-Poster: Das POPUP!-Layout animiert, während Frame und Typografie fest bleiben
Das ursprüngliche statische Poster, das MiniMax H3 übergeben wurde
Der gesamte Prompt besteht aus zwei Zeilen: Behalte den weißen Galerierahmen, den inneren Rahmen, die rot-schwarz-weiße Palette, das 3D-Figuren-Gefühl und die Layout-Struktur unverändert bei, und setze einen flinken Soundeffekt unter den Texteingang. Die Regel: Nenne die Teile, die überleben müssen. „Behalte das Layout“ ist kein Stilhinweis, es ist eine Einschränkung, und das Modell behandelt es als solche.
Muster 2: Die Interface-Demo, bei der Verben Adjektive schlagen.
MiniMax H3 Landing-Page-Demo: Scrollen, Hover, Farbinversion auf einer Produktseite
Das einzige Produkt-Referenzbild hinter dem Landing-Page-Clip
Dieser Prompt verlangt einen Seiten-Scroll nach unten, einen Hover-Zustand, eine starke Skalierung und eine Farbinversion. Vier Verben. Er sagt nie „modern“ oder „sleek“. Interaktionen sind Aktionen, also schreibe sie als Aktionen. Die übergroße kursive Type und der Carbon-Gewebe-Hintergrund kamen von den Adjektiven; das, was es wie eine echte Seite lesen lässt, kam von den Verben.
Muster 3: Live-Action plus handgezeichnet, zusammengehalten durch Verweigerungen.
MiniMax H3 Clip, der Live-Action-Küchenaufnahmen mit handgezeichneten leuchtenden Kreaturen verschmilzt
Dieser Clip zeigt eine mit dem Handy gefilmte Abendküche mit kleinen handgezeichneten leuchtenden Kreaturen, und der Grund, warum es charmant bleibt, statt zu einem Horror-Kurzfilm zu werden, ist eine Liste von Verboten: keine riesigen Augen, keine aufgerissenen Münder, keine Reißzähne, keine bedrohliche Haltung, kein Anspringen, kein plötzlicher Cut zu Schwarz, keine Jump-Scares. Die Negativliste ist die primäre Stilkontrolle, kein Pflaster. Sie ist auch der Ort, an dem du Geschmack codierst.
Vier Frames aus dem offiziellen Sci-Fi-Trailer: THE STARS WERE LISTENING
Das Moodboard und die Charakterreferenz hinter dem Trailer
Der Trailer oben schließt den Kreis zu beiden Ideen. Der Prompt buchstabiert einen Titel, THE STARS WERE LISTENING, im Detail aus: extrem schmal, fett, in Großbuchstaben, dunkelrot gemischt mit Rost, leichte Körnung und verschwommene Kanten. Dieser kommt genau wie bestellt zurück. Zwei Referenztafeln kümmern sich um die Stimmung und die Hauptfigur, sodass der Text nie ein Gesicht beschreiben muss. Arbeitsteilung, bis runter.
Was es kostet, diese MiniMax-H3-Prompts auszuführen
H3 wird pro Sekunde generierten Videos abgerechnet, nach Auflösung, also ist das Kostenmodell erfrischend langweilig: Ein 15-Sekunden-Take kostet etwa drei 5-Sekunden-Versuche. Alles andere folgt daraus.
- Iteriere bei 5 Sekunden, liefere bei 10 oder 15. Komposition, Palette und Sounddesign lösen sich alle bei 5 auf. Nichts an einer festen Einstellung braucht die volle Dauer, um dir zu sagen, dass sie falsch ist.
- end_image ist ein Kostenwerkzeug, nicht nur ein kreatives. Die meisten Wiederholungen passieren, weil das Ende abgedriftet ist. Das Festlegen des letzten Frames entfernt diesen Fehlermodus, bevor du dafür bezahlst.
- Negativlisten und buchstabierter Text sind kostenlos. Sie fügen einem Prompt Zeichen hinzu, der nach Sekunde, nicht nach Token abgerechnet wird. Nutze sie stark.
- Passe die Dauer an den Endpunkt an, bevor du schreibst. Eine 15-Sekunden-Shotliste zu bauen und dann festzustellen, dass dein Endpunkt bei 10 gedeckelt ist, kostet dich eine Umschreibung, nicht nur eine Wiederholung.
Eine Sache, um die man noch nicht planen sollte: Die Preistabellen listen eine günstigere 768p-Stufe, aber zum Zeitpunkt der Erstellung wird ein 768p-Job glatt abgelehnt, und 2K ist die einzige Auflösung, die läuft. Budgetiere, als ob jede Sekunde eine 2K-Sekunde ist. Die aktuellen Preise pro Sekunde stehen auf der Modellseite, auf der auch die 768p-Stufe erscheinen wird, sobald sie freigeschaltet ist.
MiniMax-H3-Prompts, Memes und Urheberrecht
Der Hund ist nicht gemeinfrei. This Is Fine stammt aus KC Greens Webcomic Gunshow #648, veröffentlicht am 9. Januar 2013, und nur die ersten beiden Panels gingen jemals viral (Know Your Meme, Januar 2013). Green hat sich öffentlich und ziemlich müde darüber geäußert, zuzusehen, wie das Bild endlos weiterverwendet wird, auch von Leuten, deren Politik er nicht teilt (NPR, Januar 2023).
Dieser Walkthrough ist Kommentar und Lehre, keine Stockbibliothek. Wenn du etwas Kommerzielles ausliefern möchtest, zeichne eigene Frames oder lizenziere die, die du verwendest. Und führe deine eigene Richtlinienprüfung vor einem Kundenauftrag durch: H3 wendet Inhaltsregeln auf erkennbare reale Personen und bekanntes geistiges Eigentum an, und das mitten in der Deadline herauszufinden, macht keinen Spaß.
Häufig gestellte Fragen
Erzeugt MiniMax H3 Audio, oder füge ich es nachträglich hinzu?
Gleicher Durchlauf. Bild und Ton kommen zusammen heraus, weshalb Audio in den Prompt-Körper geschrieben werden muss, anstatt später hinzugefügt zu werden. Gib ihm einen eigenen Audio:-Block und gib an, wann jedes Geräusch einsetzt. Jeder der neun offiziellen Clips, die ich untersucht habe, kam als AAC Stereo bei 32kHz zusammen mit einem 2560x1440, 24fps Videostream zurück.
Wie lang kann ein MiniMax-H3-Prompt sein?
Bis zu 7.000 Zeichen, laut MiniMax-Dokumentation. In der Praxis reichen die offiziellen Beispiele von einer großen Bandbreite, mit einem Median von etwa 130 chinesischen Zeichen und den beiden längsten bei 657 und 858. Kurze Prompts funktionieren gut, wenn ein Referenzbild die Beschreibung übernimmt. Wenn du keine Referenzen hast, erwarte, eine Shotliste zu schreiben.
Warum kommt Text in meinen MiniMax-H3-Videos verstümmelt heraus?
Weil du ihn nicht getippt hast. Strings, die buchstäblich im Prompt erscheinen, werden sauber dargestellt; alles, worauf du generisch zeigst („HUD-Elemente“, „einige Bezeichnungen“), kommt als buchstabenförmige Textur zurück. Schreibe jedes Wort aus, das lesbar sein muss, füge dann hinzu: nicht falsch schreiben, keinen anderen Text hinzufügen, keine Untertitel hinzufügen.
Wie viele Referenzbilder, Videos und Audio-Clips kann ein MiniMax-H3-Prompt verwenden?
Neun Bilder, drei Videos und drei Audio-Clips, insgesamt zwölf Dateien, wobei Referenzvideo und -audio zwischen 2 und 15 Sekunden lang sein können. Audio kann nicht die einzige Referenz sein. Beachte, dass Modellfähigkeit und das, was ein bestimmter Endpunkt exponiert, zwei verschiedene Dinge sind, also überprüfe die Modellseite für die aktuelle Eingabeliste.
Kann ein MiniMax-H3-Prompt steuern, wie der Clip endet, nicht nur, wie er beginnt?
Ja, bei image-to-video über den optionalen end_image-Parameter. Gib einen ersten Frame und einen letzten Frame, und der Clip interpoliert zwischen ihnen. Die Demo oben ist genau das: Comic-Panel 2 rein, Comic-Panel 6 raus. Halte die beiden Bilder in ähnlichen Seitenverhältnissen, sonst wird der Übergang hässlich.
Welche Dauern und Auflösungen kann ich derzeit tatsächlich bekommen?
2K, und nur 2K. Ein 768p-Job wird derzeit mit supported resolutions: 2K abgelehnt, obwohl 768p in der Preistabelle erscheint. Die Dauer unterscheidet sich je nach Endpunkt: text-to-video und image-to-video akzeptieren 5 bis 10 Sekunden mit einem Standard von 8, während reference-to-video 5 bis 15 akzeptiert. Noch eine Falle: Bei reiner Textgenerierung lehnt die API adaptiv ab und erfordert ein explizites Verhältnis.






