NUR ZWEI WOCHEN | 20% RABATT auf Seedream 5.0 Pro!

MiniMax H3 Prompt Guide: Ich habe alle 45 offiziellen Prompts gelesen und dann den This Is Fine Dog in Brand gesetzt.

Ein MiniMax H3 Prompt-Guide, erstellt aus allen 45 Beispiel-Prompts von MiniMax: die Sechs-Block-Struktur, der end_image-Trick, native Audio-Cues und die Garbled-Text-Korrektur.

Du weißt bereits, wie man ein Videomodell promptet. „Cinematic lighting, slow push in, 4K.“ Mit diesem Vokabular hast du zwei Jahre lang gearbeitet.

Dann fügst du es in MiniMax H3 ein und bekommst einen 2K-Clip zurück, der mit einem eigenen Soundtrack daherkommt. Das Bild sieht großartig aus. Der Rhythmus ist Matsch. Zwei Buchstaben in deinem Titel sind falsch geschrieben. Der Audio ist ein Raumton, den das Modell für dich ausgewählt hat.

Das Modell ist nicht das Problem. Du hast ihm einen Satz gegeben. Es wollte einen Zeitplan.

Also habe ich alle 45 Beispiel-Prompts gelesen, die MiniMax mit H3 ausgeliefert hat, plus die fertigen Clips, und die Einzelbilder auseinandergenommen. Die offiziellen Prompts sind keine Beschreibungen. Die guten sind Drehpläne mit einer Musik-Cue-Liste auf der Rückseite. Nachfolgend die Struktur, die Parameter, die tatsächlich jetzt verfügbar sind, und eine Demo, die du in etwa zwanzig Minuten nachstellen kannst.

Wichtige Erkenntnisse

  • H3-Prompts sind Zeitachsen, keine Beschreibungen. Die stärksten offiziellen Beispiele unterteilen den Clip buchstäblich mit [0s-2s], [2s-4s]-Markierungen, und der fertige Film trifft jeden Beat.
  • Ton und Bild kommen aus demselben Durchlauf, daher muss Audio innerhalb des Prompt-Körpers leben. Offizielle Prompts geben ihm einen eigenen Block, bis hin zu „Jazz-Bass-Groove setzt bei 6s ein“.
  • Text, den du buchstabierst, kommt sauber zurück. Text, den du nicht buchstabierst, kommt als buchstabenförmiges Rauschen zurück. Ich habe die Bildausschnitte aus einem einzigen offiziellen Clip, die beides gleichzeitig beweisen.
  • image-to-video akzeptiert ein end_image. Gib einen ersten Frame und einen letzten Frame an, und der emotionale Bogen ist festgelegt, bevor du eine Sekunde Rechenzeit verbrauchst.
  • Die Prompt-Länge ist keine Tugend. Kurze offizielle Prompts funktionieren, wenn ein Referenzbild die Beschreibung übernimmt. Die Länge gibt an, wie viel der Arbeit du dich geweigert hast, an eine Referenz zu übergeben.

Der This Is Fine-Hund, immer noch links und in 10 Sekunden MiniMax H3-Ausgabe rechts brennend

Das ist auf beiden Seiten die gleiche Zeichnung. Links ist K.C. Greens Original-Panel, unberührt. Rechts ist ein einziger image-to-video-Aufruf: erster Frame rein, letzter Frame rein, zehn Sekunden raus, und das Feuerknistern und das flache kleine „this is fine“ sind die eigene Audiospur des Modells. Niemand hat es vertont. Alles in dieser Anleitung zielt darauf ab, dich zu dieser zweiten Hälfte zu bringen.

Wie ein MiniMax H3-Prompt tatsächlich aussieht (Ich habe alle 45 gelesen)

Jeder „MiniMax H3-Prompt-Guide“, der derzeit auf der ersten Suchergebnisseite steht, ist ein Datenblatt: 2K, 24fps, 5 bis 15 Sekunden, nativer Audio. Das ist die Modellkarte. Es ist kein Prompt.

Hier ist ein echter. Dies ist ein Ausschnitt des offiziellen Prompts hinter MiniMaxs Noir-Titelsequenz, übersetzt aus dem chinesischen Original, der etwa ein Drittel seiner vollen Länge umfasst:

Erstelle einen 15-sekündigen 16:9-Light-Suspense-Krimi-Titelvorspann. Der Gesamtstil bezieht sich auf die visuelle Sprache dieser Bilder: Retro-Japan-Anime-Titelkarten, hart konturierte Silhouetten, Comic-Collage, asymmetrische geteilte Bildschirme, starke geometrische Farbblöcke, englische Credit-Titel, ein wenig japanische Katakana-Dekoration, Jazz-Krimi-Gefühl. Die Stimmung ist 60% Spannung, 40% Jazz: mysteriös, cool, flink, urban-kriminell, kein Horror, nicht schwer, und verwandle es nicht in ein fröhliches Jazz-Musikvideo.

[...] Englische Credits müssen klar lesbar sein [...] Füge kein Chinesisch hinzu, produziere keinen verstümmelten Text, schreibe das Englisch nicht falsch. Regel für das gesamte Stück: Jeder englische Credit und jede Berufsbezeichnung erscheint genau einmal. Wiederhole keine Berufsbezeichnung, wiederhole keinen Namen, gib einer Person nicht mehrere Titel.

Übergänge müssen abwechslungsreich sein: kreisförmige Vinyl-Schallplatten-Maske, vertikale Autotür-Wipe, langer Schatten einer Figur, der über den Bildschirm fegt, roter Linien-Schnitt, riesige englische Buchstaben-Maske, Split-Screen-Neukomposition, harter Farbblock-Schnitt, Panel für Panel eingefügte Blöcke. Alle Übergänge landen auf den Drum-Hits: knackig, spannend, flink, Comic-Collage. Keine weichen Überblendungen, keine fließenden Übergänge.

BGM: originelle 15-Sekunden-Titelmusik, 60% Spannung, 40% Jazz. Aufgebaut aus einem anhaltenden Basston, angespannten Pizzicato-Streichern, kalten Synth-Pulsen, Kick-Drum, spärlichen Jazz-Besen, einem Walking-Bass-Fragment, kurzen Baritonsaxophon-Phrasen und kurzen Blechbläser-Stabs. Die ersten 2 Sekunden etablieren Spannung mit tiefen Frequenzen und Hi-Hat, bei 3 Sekunden setzen die tiefen Drums ein, bei 6 Sekunden kommt der Jazz-Bass-Groove hinzu, bei 10 Sekunden erscheint ein kurzes Saxophon/Blechbläser-Riff, die letzten 2 Sekunden schließen mit einem angespannten Akkord und Drum-Hit.

Lies, wohin die Wörter gingen. Fast keines davon ging zu „schön“ oder „filmisch“. Sie gingen zu einer Negativliste, einer Übergangsliste und einer sekundengenauen Musik-Cue-Liste. Das ist die Form der Aufgabe. Noir-Anime-Banner mit einer silhouettierten Figur in einer U-Bahn MiniMax H3 offizielle Noir-Titelsequenz: MIDNIGHT LINE, mit sauberen STARRING-Credits

Schau dir die Credits in diesem Clip an. MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS. Richtig geschrieben, keine Berufsbezeichnung doppelt verwendet, Katakana-Dekoration dort, wo sie sein sollte. Der Prompt sagte nicht „mach schöne Titel“. Er sagte keine Wiederholungen, keine Rechtschreibfehler, kein Chinesisch und nannte die Ästhetik auf fünf verschiedene Arten. Fünf filmische Noir-Panels mit silhouettierten Figuren in Blau und Orange Fünf Stil-Referenztafeln, die zusammen mit dem Noir-Titel-Prompt an MiniMax H3 übergeben wurden

Diese fünf Tafeln kamen zusammen mit dem Text. Fünf Bilder plus eine lange Anweisung, eine Generierung. So sieht diese Arbeit jetzt aus.

Und der Grund, warum so viele der 45 Prompts kurz sind, liegt direkt im Bild. Im gesamten Satz liegt der Median-Prompt bei etwa 130 chinesischen Zeichen, aber die beiden längsten laufen auf 657 und 858. Die kurzen sind kurz, weil eine Referenztafel die Beschreibung trägt. Die langen sind lang, weil nichts anderes sie tragen würde.

Warum die meisten MiniMax H3-Prompts flach herauskommen, und die Lösung für verstümmelten Text

Drei Dinge gehen schief, und sie sind alle Abwesenheiten und keine Fehler.

Kein Zeitplan. Du hast zehn Sekunden angefordert und einen Moment beschrieben, also bekommst du einen langsamen Push-In, der über zehn Sekunden gedehnt wird. Das Modell hatte bei Sekunde sieben nichts zu tun.

Kein Audio-Block. Ton wird im selben Durchlauf wie das Bild generiert. Wenn du nichts sagst, liefert das Modell trotzdem eine Spur. Es wählt einfach eine aus.

Keine Negativliste. Wenn man sich selbst überlassen, greift das Modell zu weichen Überblendungen, erfindet zusätzlichen Bildschirmtext und fügt eine Untertitel-Leiste hinzu, die niemand verlangt hat.

Der klarste Beweis ist der offizielle Game-UI-Prompt, der aus sechs zeitgestempelten Beats aufgebaut ist: [0s-2s] Menü, [2s-4s] rechtes Arm-Panel, [4s-7s] Bewaffnungsraster, [7s-8.5s] Bestätigen, [8.5s-10s] Ladebalken, [10s-15s] die Welt lädt. Der fertige Clip trifft alle sechs, in der richtigen Reihenfolge, pünktlich. Spielmenü, das die Auswahl eines robotischen Phantom Grip-Arms zeigt MiniMax H3 Game-UI-Clip: Menü, Ausrüstungspanel, Ladebalken, Welt-Laden

Nun die ehrliche Hälfte, aus demselben Clip, in voller 2560x1440-Auflösung. Vergleich von lesbarem Game-UI-Text und verstümmeltem KI-Text Links: Text, der im Prompt buchstabiert wurde, wird sauber gerendert. Rechts: Text, der nicht buchstabiert wurde, wird als buchstabenförmiges Rauschen gerendert

Links, jeder String, den der Prompt tatsächlich ausgeschrieben hat: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW. Knackig, korrekt, gesperrt wie ein echtes Spielmenü.

Rechts, das HUD in der letzten Straßenaufnahme, das der Prompt nur als „HUD-Elemente“ bezeichnete. Es liest sich wie ETR METNO CITFEP. Über den Ausrüstungssymbolen, wo der Prompt nichts sagte, bekommst du MNALEαIN IAMG. Das ist kein Rendering-Fehler. Das Modell zeichnet die Textur von Englisch, weil es nie den String bekommen hat.

Die Lösung ist also keine Einstellung. Es ist eine Gewohnheit:

Wenn ein Wort lesbar sein muss, tippe das Wort. Füge dann eine negative Zeile hinzu: do not misspell, do not add other text, do not add subtitles.

Und hier ist die Sechs-Block-Form, die jeder starke offizielle Prompt teilt.

BlockWas hineinkommtBeispiel aus einem offiziellen PromptWenn du es auslässt, bekommst du
1. StilvertragMedium, Textur, Palette, Ära, der Look, den du nicht verlieren darf"retro Japanese-anime title cards, hard-edged silhouettes, comic collage, strong geometric colour blocks"Ein generischer glänzender Render, der bei Sekunde sechs abdriften
2. ZeitplanWörtliche Zeitscheiben mit einer Aktion in jeder[2s-4s] Smooth zoom to her right arm. UI panel slides in from the rightEine Idee, die über die gesamte Dauer gestreckt wird
3. KameraBewegung oder eine explizite Weigerung, sich zu bewegen"locked off, static wide shot, no push in, no cuts"Eine Standard-Langsamfahrt, die du nicht verlangt hast
4. AudioJedes Geräusch und wann es einsetzt"at 6 seconds the jazz bass groove joins, the last 2 seconds lock it with a tense chord"Was auch immer für ein Raumton dem Modell heute gefällt
5. Text, buchstabiertDie wörtlichen Strings, in Anführungszeichen"THIS IS FINE." / CONFIRM CONFIGBuchstabenförmiges Rauschen, wie oben
6. NegativlisteDie Übergänge, Objekte und Klischees, die abgelehnt werden"No soft dissolves, no fluid transitions, do not add Chinese, do not repeat a job title"Weiche Überblendungen, erfundener Text, unheimliches Abdriften

Die Blöcke 5 und 6 sind kostenlos. Sie kosten nichts extra zu generieren und dort lebt der Großteil der Qualität.

Der MiniMax H3-Prompt-Workflow: Zu welchem Endpunkt dein Prompt gehört

Gleicher Schlüssel, gleiches Submit-and-Poll-Muster, drei Türen. Welche du wählst, entscheidet, was dein Prompt noch tun muss.

EndpunktWas du hineingibstWas es für dich festlegtParameter, die es wert sind, zu kennenGreife danach, wennAbrechnung
minimax/h3/text-to-videoNur PromptNichts. Der Text trägt allesduration 5-10 (default 8), resolution 2K, ratio muss explizit gesetzt werdenTesten eines Looks oder Sounddesigns, bevor du dich festlegstAbgerechnet pro Sekunde Ausgabe, aktueller Satz auf der Modellseite
minimax/h3/image-to-videoPrompt + Bild (erster Frame), optional end_imageWo der Clip beginnt und optional wo er landetend_image, duration 5-10 (default 8), ratio standardmäßig adaptivDu hast Kunst und möchtest, dass sie sich bewegt, ohne neu gezeichnet zu werdenAbgerechnet pro Sekunde Ausgabe
minimax/h3/reference-to-videoPrompt + refers[]Subjektidentität und Stil, in einer Szene, die du erfindestrefers[] gemischtes Array, duration 5-15, ratio bis zu 21:9Gleiche Figur oder gleiches Produkt, neue UmgebungAbgerechnet pro Sekunde Ausgabe

refers[] ist dasjenige, das in der freien Wildbahn wirklich unterdokumentiert ist, also hier die Form, die es haben möchte:

json
1"refers": [
2  { "url": "https://.../subject.png", "type": "image" },
3  { "url": "https://.../style-board.png" },
4  { "url": "https://.../motion-ref.mp4", "type": "video" },
5  { "url": "https://.../beat.mp3",       "type": "audio" }
6]
7

Vier Regeln, die dir jeweils eine verschwendete Generierung ersparen:

  1. Audio kann nicht allein reisen. Mindestens ein Bild oder Video muss im Array sein. Ein Beat-Track allein wird abgelehnt.
  2. type ist optional. Es wird aus der URL abgeleitet, aber gib es trotzdem an, wenn die Erweiterung mehrdeutig ist.
  3. Die Obergrenzen sind real. Bis zu 9 Bilder, 3 Videos und 3 Audioclips, insgesamt 12 Dateien, wobei Referenzvideo und -audio jeweils 2 bis 15 Sekunden lang sind (MiniMax API-Dokumentation, Juli 2026).
  4. Gib jeder Referenz eine Aufgabe im Prompt-Text. Dies ist die gewinnbringendste Gewohnheit auf dieser Liste. Offizielle Prompts beginnen mit Zeilen wie „Bild 1 ist die Gesamtstimmungs- und Stilreferenz, Bild 2 ist die Hauptfigurenreferenz.“ Ohne diesen Satz muss das Modell raten, welche Tafel was bedeutet. Großer schwarzer Text, der BASS HITS über einer lächelnden Frau liest MiniMax H3 Dark-Pop-Musikvideo: CUT BACK, ONE LOOK, DETONATE Typografie Drei Frauen in Grunge-Mode neben einem fetten typografischen Poster Die beiden Typografie-Referenztafeln hinter dem Dark-Pop-Clip

Dieser Clip ist das Argument für Regel 4. Sein Prompt beschreibt keine einzige Buchstabenform. Er sagt „Textverpackungsstil und -textur beziehen sich auf die Bilder“ und übergibt zwei Tafeln. Das Layout kam, weil es gezeigt wurde, nicht beschrieben.

Noch eine Tabelle, weil die Modellkarte und die API derzeit nicht dasselbe sagen, und die Lücke ist, wo Leute einen Nachmittag verlieren.

SacheMiniMaxs eigene DokumentationWas die Endpunkte derzeit tatsächlich akzeptierenWas das für deinen Prompt bedeutet
Dauer4 bis 15 Sekunden, nur ganze Zahlentext-to-video und image-to-video: 5 bis 10, Standard 8. reference-to-video: 5 bis 15, Standard 8Eine 15-Sekunden-Shot-Liste passt derzeit nur in reference-to-video. Schreibe längere Boards auf 10 um
Auflösung2KAuflösung standardmäßig 2K, und 2K ist derzeit der einzige Wert, der läuft. Ein 768p-Auftrag kommt mit der Fehlermeldung, dass MiniMax-H3 die Auflösung 768P nicht unterstützt, unterstützte Auflösungen: 2K, obwohl 768p in der Preistabelle erscheintSchreibe für eine kurze Seite von 1440px. Details, die du anforderst, werden tatsächlich überleben
SeitenverhältnisÜbliche Verhältnisse oder adaptivimage-to-video und reference-to-video standardmäßig adaptiv. Text-only lehnt adaptiv ab und gibt seinen erlaubten Satz zurück: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9Bei text-to-video setze das Verhältnis explizit, sonst schlägt der Job bei der Validierung fehl
Gemischte Referenzen9 Bilder, 3 Videos, 3 Audio, 12 Dateien, Audio nie alleinrefers[] nimmt {url, type} mit image, video oder audio, mindestens ein Bild oder VideoDu kannst Bewegung wirklich mit einem bereitgestellten Beat synchronisieren. Du kannst nur nicht nur den Beat bereitstellen
Nativer AudioStereo-Audio im selben DurchlaufJeder der neun offiziellen Clips, die ich untersucht habe: 2560x1440, 24fps, AAC Stereo bei 32kHzDer Audio-Block ist keine Dekoration. Er ist die Hälfte des Liefergegenstands

Alles oben Genannte lief auf Atlas Cloud, wo alle drei H3-Endpunkte hinter einem Schlüssel und einer Submit-and-Poll-Schleife sitzen, sodass der Wechsel zwischen ihnen nur eine Änderung des Modell-Strings und sonst nichts ist.

MiniMax H3-Prompt-Tutorial: Setze den This Is Fine-Hund in Brand, mit Ton

Hier ist das Ganze von Anfang bis Ende. Der Witz funktioniert, weil der Hund nichts tut. Dehne diese Verweigerung auf zehn Sekunden Echtzeit aus, füge echtes Feuer hinzu und lass die letzten zwei Sekunden dorthin gehen, wo der ursprüngliche Comic tatsächlich hinging, und es wird lustiger und etwas schlimmer für dich. Die meisten Leute haben nur die ersten beiden Panels gesehen.

Schritt 1: Lade den Original-Comic herunter. Lass eine KI ihn nicht neu zeichnen.

Der Strip besteht aus sechs Panels, zwei Spalten mal drei Zeilen, 600 x 887. Wir wollen nur Panel 2 und Panel 6.

bash
1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png
2# 600x887, 6 Panels, 2 Spalten x 3 Zeilen
3
4# Panel 2 zuschneiden (das "THIS IS FINE."-Panel):  x 302-584, y 20-293
5# Panel 6 zuschneiden (der schmelzende Hund):            x 302-584, y 595-868
6# Jedes 4x mit Lanczos hochskalieren  ->  1128x1092
7

Sag es klar: Bitte kein Bildmodell, einen „Hund, der wie This Is Fine aussieht“ zu zeichnen. Eine KI-Nachbildung wird in einer halben Sekunde als Fälschung erkannt und der Witz stirbt auf der Stelle. Die Aquarellwäsche, die wackelige Handlettering und die Papierkörnung sind der gesamte Vertrag. Die 4x-Lanczos-Hochskalierung ist nur da, weil 282px Quelle dünn ist; sie gibt dem Modell echte Pixel zum Festhalten, ohne welche zu erfinden. Zwei Panels des schmelzenden This is Fine-Hundes im Feuer Panel 2 und Panel 6 des Original-Comics, beschriftet als Eingaben für ersten Frame und Endbild

Schritt 2: Führe es auf image-to-video mit einem end_image aus.

Modell: minimax/h3/image-to-video. Einstellungen: resolution 2K, image = Panel 2, end_image = Panel 6, ratio 1:1, um der quadratischen Quelle zu entsprechen. Setze duration auf 10; der Schieberegler sitzt standardmäßig auf 8, also ziehe ihn.

text
1Hand-painted 2D webcomic panel, brought to life. Keep the original watercolour
2texture, visible ink outlines, off-register paper grain and flat comic palette
3in every frame. Do not smooth, do not re-render in 3D, do not clean up the
4linework, do not add new objects, do not add new text.
5
6[0s-3s] Almost nothing moves. The dog sits perfectly still, holding the mug,
7eyes fixed forward. Only the flames behind him move: slow orange licks climbing
8the wall, one ember drifting up. The speech bubble reading "THIS IS FINE."
9stays exactly where it is, fully legible, unchanged, hand-lettered.
10
11[3s-6s] The dog lifts the mug and takes one small, calm sip. The speech bubble
12fades out after the sip. The fire brightens. The wall behind him begins to warp
13with heat. His hat starts to smoulder at the brim.
14
15[6s-8.5s] The heat reaches him. His ears sag, his outline softens and begins to
16run downward like wet paint. He still does not move his eyes. The mug stays in
17his paw.
18
19[8.5s-10s] Full melt. The face distorts, one eye slides, teeth bared in a fixed
20grin, the fur runs red and orange. He holds the pose. Hold on the final frame
21for the last half second.
22
23Camera: locked off, single static wide shot, no push in, no handheld, no cuts.
24The frame never moves. This is one continuous take inside one comic panel.
25
26Audio: room-tone of an interior fire throughout - low crackle, occasional pop of
27burning wood, a faint structural creak. At 3s, one ceramic mug touching teeth and
28a small swallow. A calm, flat, unbothered male voice says exactly: "This is fine."
29- deadpan, no emotion, slightly too relaxed. From 6s the crackle grows louder and
30the room tone thickens; the last 2 seconds add a low sub-bass swell. No music,
31no laugh track, no sound effects that are not in this list.
32
33Do not add subtitles. Do not add a watermark. Do not spell any word other than
34the words already in the image. Do not change "THIS IS FINE." Do not cut away.
35

Dieser Prompt ist die Strukturtabelle, lebendig. Absatz eins ist der Stilvertrag. Die vier eingeklammerten Abschnitte sind der Zeitplan. Dann Kamera, dann Audio, dann die Negativliste. Nichts darin ist dekorativ. Screenshot eines KI-Videogenerators, der das This is fine-Meme zeigt MiniMax H3 image-to-video auf Atlas Cloud: erster Frame und Endbild geladen, 10 Sekunden bei 2K, fertiger Clip im Ausgabefenster

Schritt 3: Lies die Ausgabe wie eine QA-Prüfung.

Vier Überprüfungen, jede testet einen anderen Block des Prompts.

  1. Ist THIS IS FINE. in der Sprechblase immer noch lesbar und immer noch richtig geschrieben? Das testet Block 5.
  2. Hat die Linienführung überlebt, oder hat etwas sie in sauberes 3D „verbessert“? Das testet Block 1.
  3. Enthält das Audio nur die von dir aufgelisteten Geräusche? Untersuche den Container: Er sollte als h264 plus AAC Stereo zurückkommen.
  4. Landet der letzte Frame auf der Pose von Panel 6? Das testet end_image.
bash
1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \
2        -of default=noprint_wrappers=1 output.mp4
3

Meiner kam mit 1472x1440, 24fps, h264 plus AAC Stereo, 10,13 Sekunden zurück. Erwähnenswert: Ich habe ratio: 1:1 angefordert und 1472x1440 erhalten, also gewinnt bei image-to-video die Form des Quellframes. Passe deine beiden Panels an die Form an, die du tatsächlich haben möchtest. Cartoon-Hund sagt this is fine und schmilzt dann in einem Feuer Vier Frames aus dem fertigen Clip bei 0s, 3s, 6,5s und 10s, die den vier Zeitscheiben im Prompt entsprechen

Schritt 4: Bewege den Hund mit reference-to-video an einen neuen Ort.

Gleiche Figur, neuer Raum. Modell: minimax/h3/reference-to-video. Einstellungen: refers[] = Panel 2 als image, duration 8, resolution 2K, ratio 16:9.

text
1Image 1 is the character and art-style reference: keep this exact hand-painted
22D webcomic look, the same watercolour texture, the same ink outline weight, the
3same dog, the same little hat, the same mug. Do not redraw him in 3D, do not
4change his proportions, do not clean up the linework.
5
6Put him in a different room and keep his composure. A cramped open-plan office at
7night, fluorescent tubes flickering, a wall of monitors all showing a red error
8state, printer paper drifting down through the frame, a small electrical fire in
9the corner. He sits in an office chair at the centre of the frame, mug in paw,
10looking straight at the camera, completely relaxed.
11
12Camera: locked off, static wide shot. No push in, no cuts.
13
14Audio: fluorescent hum, printer grinding, a repeating soft alarm chirp every two
15seconds, distant electrical crackle, one calm sip at 4s. No music. No voice.
16
17Do not add any on-screen text. Do not add subtitles. Do not add other characters.
18

Die übertragbare Regel: refers[] trägt Identität und Stil, der Text trägt die Szene. Diese Aufteilung ist der ganze Trick für die Figurenkonsistenz, und sie ist der Grund, warum die erste Zeile des Prompts überhaupt existiert. Lass es uns versuchen: „Cartoon-Hund hält Kaffeetasse umgeben von roten Bildschirmen und einem brennenden Drucker“ Derselbe Webcomic-Hund, verlegt in ein brennendes Großraumbüro bei Nacht, generiert von MiniMax H3 reference-to-video

Gleicher Hut, gleiche Tasse, gleiche Tintenstärke, neuer Raum. Ein Referenzbild hat das alles getan.

Drei weitere MiniMax H3-Prompt-Muster, die es wert sind, gestohlen zu werden

Muster 1: Das Bewegtposter, bei dem das Layout sich nicht bewegen darf. Cartoon-Figur rennt vor einem einfarbigen rosa Hintergrund nach vorne MiniMax H3 Bewegtposter: Das POPUP!-Layout animiert, während der Rahmen und die Typografie fixiert bleiben Cartoon-Junge in pinkem Monster-Hoodie, der mit einer riesigen Klaue greift Das ursprüngliche statische Poster, das MiniMax H3 übergeben wurde

Der gesamte Prompt besteht aus zwei Zeilen: Behalte den weißen Galerierahmen, den inneren Rahmen, die rot-weiß-schwarze Palette, das 3D-Figurengefühl und die Layout-Struktur unverändert bei, und füge einen flinken Soundeffekt unter dem Texteingang hinzu. Die Regel: Nenne die Teile, die überleben müssen. „Behalte das Layout“ ist keine Stilnotiz, es ist eine Einschränkung, und das Modell behandelt es als eine solche.

Muster 2: Die Interface-Demo, bei der Verben stärker sind als Adjektive. Mintgrüner Nike ZoomX-Laufschuh mit einer pinken Gradienten-Sohle MiniMax H3 Landingpage-Demo: Scrollen, Hover, Farbinversion auf einer Produktseite Hellblauer Nike-Laufschuh mit grünen und pinken Akzenten Das einzelne Produktreferenzbild hinter dem Landingpage-Clip

Dieser Prompt fordert einen Bildlauf nach unten, einen Hover-Zustand, eine starke Vergrößerung und eine Farbinversion. Vier Verben. Er sagt nie „modern“ oder „sleek“. Interaktionen sind Aktionen, also schreibe sie als Aktionen. Der übergroße kursive Typ und der Carbon-Gewebe-Hintergrund kamen von den Adjektiven; das, was ihn wie eine echte Seite lesen lässt, kam von den Verben.

Muster 3: Live-Action plus Handzeichnung, zusammengehalten durch Verweigerungen. Animierter leuchtender grüner Spross, der in einer offenen Hand wächst MiniMax H3-Clip, der Live-Action-Küchenaufnahmen mit handgezeichneten leuchtenden Kreaturen verschmilzt

Dieser ist eine mit dem Handy aufgenommene Abendküche mit kleinen leuchtenden handgezeichneten Kreaturen darin, und der Grund, warum sie charmant bleibt, anstatt sich in einen Horror-Kurzfilm zu verwandeln, ist eine Liste von Verboten: keine riesigen Augen, keine gespaltenen Münder, keine Fangzähne, keine bedrohliche Haltung, kein Anspringen, kein plötzlicher Schwarzschnitt, keine Jump Scares. Die Negativliste ist die primäre Stilkontrolle, kein Pflaster. Sie ist auch der Ort, an dem du Geschmack kodierst. Vier Panels zeigen eine Frau in einem dunklen Tunnel mit Text Vier Frames aus dem offiziellen Sci-Fi-Trailer: THE STARS WERE LISTENING Poster für The Stars Were Listening und Charakter-Design-Blatt Die Moodboard und Charakterreferenz hinter dem Trailer

Der Trailer oben schließt den Kreis zu beiden Ideen. Der Prompt buchstabiert einen Titel aus, THE STARS WERE LISTENING, im Detail: extrem schmal, fett, in Großbuchstaben, dunkelrot gemischt mit Rost, leichte Körnung und beschlagene Kanten. Dieser kommt genau wie bestellt zurück. Zwei Referenztafeln übernehmen die Stimmung und die Hauptfigur, sodass der Text nie ein Gesicht beschreiben muss. Arbeitsteilung, durchgängig.

Was es kostet, diese MiniMax H3-Prompts auszuführen

H3 wird pro Sekunde generiertem Video abgerechnet, nach Auflösung, also ist das Kostenmodell erfrischend langweilig: Ein 15-Sekunden-Take kostet etwa drei 5-Sekunden-Versuche. Alles andere folgt daraus.

  • Iteriere bei 5 Sekunden, liefere bei 10 oder 15. Komposition, Palette und Sounddesign lösen sich alle bei 5 auf. Nichts an einer fixierten Aufnahme benötigt die volle Dauer, um dir zu sagen, dass sie falsch ist.
  • end_image ist ein Kostenwerkzeug, nicht nur ein kreatives. Die meisten Wiederholungen passieren, weil das Ende abgedriftet ist. Das Festlegen des letzten Frames entfernt diesen Fehlermodus, bevor du dafür bezahlst.
  • Negativlisten und buchstabierter Text sind kostenlos. Sie fügen einem Prompt Zeichen hinzu, der nach der Sekunde abgerechnet wird, nicht nach dem Token. Verwende sie reichlich.
  • Passe duration an den Endpunkt an, bevor du schreibst. Eine 15-Sekunden-Shot-Liste zu erstellen und dann festzustellen, dass dein Endpunkt bei 10 gedeckelt ist, kostet dich eine Umschreibung, nicht nur eine Wiederholung.

Eine Sache, um die du noch nicht herumplanen solltest: Die Preistabellen listen eine günstigere 768p-Stufe, aber zum Zeitpunkt dieses Schreibens wird ein 768p-Auftrag sofort abgelehnt und 2K ist die einzige Auflösung, die läuft. Budgetiere, als ob jede Sekunde eine 2K-Sekunde ist. Die aktuellen Preise pro Sekunde stehen auf der Modellseite, wo auch die 768p-Stufe erscheinen wird, sobald sie geöffnet wird.

MiniMax H3-Prompts, Memes und Urheberrecht

Der Hund ist nicht gemeinfrei. This Is Fine stammt aus K.C. Greens Webcomic Gunshow #648, veröffentlicht am 9. Januar 2013, und nur die ersten beiden Panels wurden jemals viral (Know Your Meme, Januar 2013). Green hat öffentlich und ziemlich müde darüber gesprochen, wie das Bild immer wieder verwendet wird, auch von Leuten, deren Politik er nicht teilt (NPR, Januar 2023).

Diese Anleitung ist Kommentar und Lehre, keine Stockbibliothek. Wenn du etwas Kommerzielles ausliefern möchtest, zeichne deine eigenen Frames oder lizenziere die, die du verwendest. Und führe deine eigene Richtlinienprüfung durch, bevor ein Kundenauftrag ansteht: H3 wendet Inhaltsregeln auf erkennbare reale Personen und bekannte IP an, und das mitten in einer Deadline herauszufinden, ist nicht lustig.

Häufig gestellte Fragen

Generiert MiniMax H3 Audio, oder füge ich es nachträglich hinzu?

Gleicher Durchlauf. Bild und Ton kommen zusammen heraus, weshalb genau Audio in den Prompt-Körper geschrieben werden muss, anstatt später angehängt zu werden. Gib ihm einen eigenen Audio:-Block und gib an, wann jedes Geräusch einsetzt. Jeder der neun offiziellen Clips, die ich untersucht habe, kam als AAC Stereo bei 32kHz zusammen mit einem 2560x1440, 24fps Videostream zurück.

Wie lang kann ein MiniMax H3-Prompt sein?

Bis zu 7.000 Zeichen, laut MiniMax-Dokumentation. In der Praxis decken die offiziellen Beispiele eine breite Spanne ab, mit einem Median um 130 chinesische Zeichen und den beiden längsten bei 657 und 858. Kurze Prompts funktionieren gut, wenn ein Referenzbild die Beschreibung übernimmt. Wenn du keine Referenzen hast, erwarte, eine Shot-Liste zu schreiben.

Warum kommt Text in meinen MiniMax H3-Videos verstümmelt heraus?

Weil du ihn nicht getippt hast. Strings, die wörtlich im Prompt erscheinen, werden sauber gerendert; alles, was du allgemein umschreibst („HUD-Elemente“, „einige Beschriftungen“) kommt als buchstabenförmige Textur zurück. Buchstabiere jedes Wort, das lesbar sein muss, und füge dann do not misspell, do not add other text, do not add subtitles hinzu.

Wie viele Referenzbilder, -videos und -audioclips kann ein MiniMax H3-Prompt verwenden?

Neun Bilder, drei Videos und drei Audioclips, insgesamt zwölf Dateien, wobei Referenzvideo und -audio zwischen 2 und 15 Sekunden lang sind. Audio kann nicht die einzige Referenz sein. Beachte, dass die Modellfähigkeit und das, was ein bestimmter Endpunkt bereitstellt, zwei verschiedene Dinge sind, also überprüfe die Modellseite für die aktuelle Eingabeliste.

Kann ein MiniMax H3-Prompt steuern, wie der Clip endet, nicht nur, wie er beginnt?

Ja, bei image-to-video, über den optionalen Parameter end_image. Gib einen ersten Frame und einen letzten Frame an, und der Clip interpoliert zwischen ihnen. Die Demo oben ist genau das: Comic-Panel 2 rein, Comic-Panel 6 raus. Halte die beiden Bilder in ähnlichen Seitenverhältnissen, sonst wird der Übergang hässlich.

Welche Dauern und Auflösungen kann ich derzeit tatsächlich erhalten?

2K, und nur 2K. Ein 768p-Auftrag wird derzeit mit supported resolutions: 2K abgelehnt, obwohl 768p in der Preistabelle erscheint. Die Dauer unterscheidet sich je nach Endpunkt: text-to-video und image-to-video akzeptieren 5 bis 10 Sekunden mit einem Standard von 8, während reference-to-video 5 bis 15 akzeptiert. Noch eine Falle: Bei reiner Textgenerierung lehnt die API adaptive ab und erfordert ein explizites ratio.

Neueste Modelle

Eine API für alle Media-KI.

Alle Modelle erkunden