MiniMax hat H3 am Freitag veröffentlicht. Innerhalb von 24 Stunden war Seedance 2.5 in den Händen der Nutzer, und die Timeline schrumpfte auf eine einzige Konversation zusammen: dreißig Sekunden, native 4K, fünfzig Referenzeingaben. H3s Launch-Post lag still darunter, fast niemand führte einen echten Test durch.
Ich verstehe, warum. Dreißig Sekunden sind eine tolle Zahl. Sie passt in eine Schlagzeile.
Aber wenn du tatsächlich vertikale Kurzdramen produzierst, weißt du, dass nicht Sekunde 30 deine Nacht ruiniert. Es ist Einstellung 4. Der Kiefer des Hauptdarstellers verschiebt sich um einen halben Zentimeter, seine Krawatte verliert eine Falte, und der Zuschauer wischt weg, bevor der Haken zündet. Niemand steigt aus, weil ein Clip fünfzehn statt dreißig Sekunden lang war. Sie steigen aus, weil der Typ in der Nahaufnahme nicht der Typ aus der Totalen ist.
Also habe ich das Spec-Sheet-Duell übersprungen. Ich habe ein Charakter-Turnaround-Blatt erstellt, ein Sechs-Panel-Locations-Board, einen 15-Sekunden-Gothic-Kurzdrama-Prompt geschrieben und das identische Paket an beide Seiten geschickt. Dann habe ich auf das Gesicht gestarrt.
Wichtige Erkenntnisse
- Beide sind echt, aber nicht gleich erreichbar. H3s drei Endpunkte (Text, Bild und Referenz zu Video) sind live und sofort aufrufbar. Seedance 2.5s API ist bei ByteDance draußen, aber auf der Multi-Modell-Plattform, auf der ich alles ausgeführt habe, ist es noch eine Day-0-Seite, daher ist die Seedance-Seite meines Kopf-an-Kopf-Rennens Seedance 2.0 Referenz-zu-Video. Ich kennzeichne das überall, wo es relevant ist.
- Die Specs trennen sich sauber. Seedance 2.5 = bis zu 30 Sekunden in einer Generation, native 4K, bis zu 50 multimodale Referenzen, regionale Bearbeitung. H3 = 5 bis 15 Sekunden, native 2K bei 24fps, 9 Bilder + 3 Videos + 3 Audioclips (max. 12 Dateien), Stereo-Audio bei jeder Ausgabe, Bearbeitung durch ganze Clip-Anweisungen.
- Figurenstabilität ist ein Verpackungsproblem, kein Modellgenerierungsproblem. Mit einem zusammengesetzten Turnaround-Blatt plus einem Beleuchtungsboard behielten beide Modelle dasselbe Gesicht und dieselbe Kleidung. Weder die Generierungsnummer rettete noch ruinierte die Einstellung; das Paket tat es.
- Das Modell, das niemand getestet hat, ist bereits auf Platz drei. In der Artificial Analysis Image-to-Video Arena liegt H3 mit 1.185 Elo hinter Seedance 2.0 mit 1.196. Seedance 2.5 ist noch gar nicht auf der Tafel.
- Beide generieren ihren eigenen Ton. H3 akzeptiert außerdem bis zu drei Audio-Referenzen, um eine Stimme an eine Figur zu binden, was eine ganze TTS-und-Sync-Stufe aus einer Kurzdrama-Pipeline entfernt.
- Frage nach Pixeln pro Frame, nicht nach Sekunden. Gleiches Referenzpaket, gleiche Laufzeit: H3s Referenz-zu-Video liefert 1440p, Seedance 2.0s Referenz-zu-Video liefert 720p. Das stellt die gesamte Kostenfrage neu.
Seedance 2.5s eigene gepaarte Zahlen sind noch nicht da. Ich werde sie am Tag hinzufügen, an dem der Endpunkt dort geöffnet wird, wo ich teste.
Das Seedance 2.5 vs MiniMax H3 Ergebnis, vor jeder Theorie
Vor jeder Theorie hier, was der Workflow produziert. Dies sind vier Einstellungen aus einem fertigen 15-Sekunden-Vertikalclip, die zusammengesetzt sind. Es ist MiniMaxs eigener H3-Referenzlauf, erstellt aus genau dem Charakterblatt und Locations-Board, die du in Schritt 1 und Schritt 2 sehen wirst, bei nativen 1440x2560. Meine eigenen Läufe desselben Pakets kommen später, im Tutorial, mit sichtbarem Playground-Zustand.
Sie erreicht die geschnitzte Tür, das ist Panel 4 des Locations-Boards, dann den Korridor-Standoff, dann eine enge Nahaufnahme auf ihn, dann die Zweiereinstellung. Sein Haaransatz teilt sich im Profil und in der Nahaufnahme gleich. Ihre halb hochgesteckte, geflochtene Krone überlebt eine Gesichtsnahaufnahme, genau dort, wo die meisten Modelle leise ein Gesicht neu aufbauen. Das cremefarbene Spitzenmieder behält denselben Ausschnitt und dieselbe Ärmelmanschette vom ersten bis zum letzten Frame.
Das ist der ganze Test. Nicht dreißig Sekunden. Vier Einstellungen und ein Kiefer.
Warum Seedance 2.5 vs MiniMax H3 in derselben Woche herauskamen und warum die meisten Charaktertests nutzlos sind
MiniMax veröffentlichte H3 am 30. Juli, ein allgemeines multimodales Videomodell, das Text, Bilder, Video und Audio als einen Kontext liest und 5 bis 15 Sekunden lange Clips mit bis zu 2K und nativen Stereo-Sound zurückgibt. Es kann auch vorhandenes Filmmaterial bearbeiten und Bewegung von einem Clip auf einen anderen übertragen, und MiniMax sagte, Gewichte würden innerhalb von Tagen folgen (Reuters, Juli 2026).
Seedance 2.5 landete im selben Zeitfenster mit einer lauteren Zahl: 30 Sekunden in einer einzigen Generation, native 4K und bis zu 50 multimodale Referenzeingaben in einem Job (The Next Web, Juli 2026). Seine API ist bereits in den Händen von Entwicklern, mit lokalisierter Bearbeitung, die einen Teil eines Frames neu zeichnet, während Performance, Beleuchtung und Kamerabewegung intakt bleiben, Referenz-zu-Video, das Green-Screen-Platten oder 3D-Weißmodell-Blockouts akzeptiert, elf Sprachen und einen experimentellen Langvideomodus, der 180 Sekunden erreicht (CineD, Juli 2026).
Die Aufmerksamkeitslücke ist der interessante Teil. Fast jeder Beitrag, den ich finden konnte, war ein 2.5-Clip. Inzwischen sagen die öffentlichen Arena-Zahlen etwas anderes: Auf der Artificial Analysis Image-to-Video Rangliste führt Seedance 2.0 bei 720p mit 1.196 Elo, Gemini Omni Flash folgt mit 1.195, und MiniMax H3 ist bereits Dritter mit 1.185, vier Tage nach dem Start. Seedance 2.5 hat dort noch keine Bewertung (Artificial Analysis, Juli 2026). Das Modell mit dem geringsten Gerede ist das mit dem höchsten Verhältnis von Punktzahl zu Aufmerksamkeit.
Nun der Teil, der tatsächlich deine Ausgabe bestimmt, weil er fast nichts damit zu tun hat, welches Logo du wählst.
Die meisten Tests zur Figurenkonsistenz scheitern, bevor das Modell überhaupt involviert ist. Vier Fehlermodi, und alle vier liegen an dir:
| Fehlermodus | Was du in der Ausgabe siehst | Die Lösung |
|---|---|---|
| Mehrfachansichts-Referenzen als separate Dateien gesendet | Jedes Einstellungsgesicht ist "fast richtig" und keine zwei stimmen überein | Kombiniere die Ansichten in einem Bild, weise dann Rollen im Prompt zu ("der Mann LINKS", "die Frau RECHTS") |
| Die Figurenbeschreibung pro Einstellung neu schreiben | Kleidung und Accessoires driften von Einstellung zu Einstellung | Schreibe den Identitätsblock einmal und verwende ihn wörtlich; nur Kamera und Aktion ändern sich pro Einstellung |
| Beleuchtung mit der Szene wandern lassen | Das Gesicht wird im neuen Licht strukturell neu aufgebaut | Erstelle ein separates Locations-Board, das Lichtrichtung, Nebel und Bodenreflexion festlegt, und füge es als Referenz hinzu |
| Maximale Dauer als Qualitätsmetrik behandeln | Eine Drift innerhalb von 30 Sekunden tötet alle 30 | Schneide auf die Granularität, die du neu würfeln kannst, und rede dann über Länge |
Zeile eins ist die, die die Leute am häufigsten falsch machen. Sende sechs Einzelansichtsbilder, und das Modell behandelt sie als sechs Kandidatenpersonen und mittelt sie. Sende eine saubere Composite, und es behandelt sie als eine Person, die von drei Seiten gesehen wird. Gleiche Pixel, völlig anderes Ergebnis.
Seedance 2.5 vs MiniMax H3 Spec-Sheet, und was du heute tatsächlich aufrufen kannst
Trenne Fähigkeit von Verfügbarkeit, und die Spannung wird deutlich. Bei den reinen Fähigkeiten führt Seedance 2.5 bei Dauer, Auflösungsobergrenze, Referenzanzahl und Bearbeitungsgranularität. Bei der Verfügbarkeit ist H3 dasjenige mit drei Live-Endpunkten auf einer allgemeinen Modellplattform diese Woche. Wenn du einen AI-Videomodellvergleich für die Planung 2026 machst, zählt die zweite Spalte genauso viel wie die erste.
| MiniMax H3 | Seedance 2.5 | Seedance 2.0 Ref-to-Video (was ich ausgeführt habe) | |
|---|---|---|---|
| Maximale Länge, eine Generation | 5 bis 15 s | bis zu 30 s, kein Stitching (Beta-Modus bis 180 s, experimentell) | Kurzclip-Menü, siehe Modellseite |
| Auflösung | native 2K, 1440p kurze Seite bei 16:9 bis 9:16; eine 768p-Stufe ist angekündigt | native 4K, 10-Bit-Farbe | bis zu 720p an diesem Endpunkt |
| Bildrate | 24 fps | nicht separat veröffentlicht | nicht separat veröffentlicht |
| Referenzeingaben | 9 Bilder + 3 Videos + 3 Audio, insgesamt 12 Dateien | bis zu 50 multimodale Referenzen | 9 Bilder + 3 Videos + 3 Audio |
| Nativer Ton | ja, jede Ausgabe, Stereo | ja, plus 11 Untertitel- und Sprachsprachen | ja |
| Bearbeitungsgranularität | Bearbeitung durch ganze Clip-Anweisungen (Charakter, Hintergrund, Beleuchtung, Dialog austauschen) | Regionale Bearbeitung, die einen Teil eines Frames neu zeichnet | Bearbeitung durch ganze Clip-Anweisungen |
| Prompt-Limit | 7.000 Zeichen | nicht veröffentlicht | nicht veröffentlicht |
| Offene Gewichte | angekündigt für Tage nach dem Launch | nicht angekündigt | nicht angekündigt |
| Artificial Analysis I2V Elo, 31. Juli 2026 | 1.185 (3. Platz) | noch nicht bewertet | 1.196 (1. Platz, Dreamina 720p Eintrag) |
| Auf der von mir getesteten Plattform aufrufbar | ja, 3 Endpunkte | noch nicht, Day-0-Seite | ja |
Vollständige Offenlegung des Testaufbaus. Seedance 2.5 war auf meiner Plattform nicht offen, als ich dies ausführte, daher ist die Seedance-Seite Seedance 2.0 Reference-to-Video, das derzeit ausgelieferte Mitglied derselben Familie mit demselben quad-modalen Referenzsystem. Wo 2.5 die Antwort ändern würde, sage ich es. Die Seedance 2.5 Seite ist vorerst ein Day-0-Hinweis.
Alles unten läuft in einem Browser-Tab, mit einem Schlüssel, insgesamt drei Modelle:
| Schritt | Modell | Was es produziert | Wichtige Einstellungen | Was die Kosten antreibt |
|---|---|---|---|---|
| 1 | OpenAI GPT Image 2 Text-to-Image | das Charakter-Turnaround-Blatt | quality high, 16:9 | pro Bild, Pay-as-you-go, aktueller Tarif auf der Modellseite |
| 2 | gleiches Modell, zweiter Lauf | das Sechs-Panel-Locations- und Beleuchtungsboard | quality high, 16:9 | pro Bild, Pay-as-you-go |
| 3 | MiniMax H3 Reference-to-Video | der 9:16-Clip mit nativem Ton | 9:16, 2K, Dauer 5 für einen Test und 15 für den echten Schnitt | Sekunden x Auflösung, Abrechnung pro Sekunde |
| 4 | Seedance 2.0 Reference-to-Video | der Kontrolllauf, identische Eingaben | 9:16, höchste verfügbare Auflösung, gleiche Dauer | Sekunden x Auflösung, Abrechnung pro Sekunde |
| 5 | H3 Reference-to-Video, Clip als Eingabe | eine korrigierte Einstellung ohne alles neu zu würfeln | gleiche Auflösung, kurze Dauer | Sekunden x Auflösung, Abrechnung pro Sekunde |
H3 hat auch Text-to-Video und Image-to-Video Einträge, falls du eine reine Text-Baseline oder Erst-und-Letzt-Frame-Kontrolle haben möchtest.
Noch eine Sache, die du wissen solltest, bevor du einen Batch planst: Bildschirmtext. Diese 15-Sekunden-H3-Titelsequenz hält englische Credits durch acht harte Schnitte ohne einen einzigen Rechtschreibfehler, was eines der schwierigsten Dinge ist, in generiertem Video stabil zu halten.
Der Seedance 2.5 vs MiniMax H3 Kurzdrama-Workflow, Schritt für Schritt
Fünf Schritte. Kopiere die Prompts genau so, wie sie geschrieben sind, einschließlich der hässlichen Teile. Ich habe sie für den Artikel nicht bereinigt, und du solltest sie für das Modell nicht bereinigen.
Schritt 1: Erstelle das Charakterblatt mit GPT Image 2
Erstelle das Referenzpaket, bevor du irgendein Video erstellst. Ein Bild, zwei Charaktere, drei Ansichten pro Charakter, reiner weißer nahtloser Hintergrund, gleichmäßiges Studiolicht. Das entfernt jede Mehrdeutigkeit außer der, die dich interessiert: Wie sieht diese Person aus.
plaintext1Ein Ganzkörper-Charakter-Turnaround-Referenzblatt auf einem reinen weißen nahtlosen Hintergrund, zwei Charaktere nebeneinander, insgesamt sechs Figuren, gleichmäßiges neutrales Studiolicht, keine Schatten auf dem Boden, kein Text, keine Beschriftungen, kein Wasserzeichen. 2 3LINKE HÄLFTE, männlicher Hauptdarsteller, drei Ansichten in einer Reihe: vorne, rechtes Profil, hinten. Ende 20, blasse Gesichtsfarbe, dunkles welliges mittellanges Haar, scharfer Kieferknochen. Gekleidet in einen bodenlangen schwarzen Samt-Gehrrock mit subtiler Ton-in-Ton-Stickerei an Revers und Manschetten, eine schwarze Brokatweste, eine schwarze Seidenkrawatte, gerade schwarze Hosen, polierte schwarze Lederderbyschuhe. Arme entspannt an den Seiten, neutraler Gesichtsausdruck. 4 5RECHTE HÄLFTE, weibliche Hauptdarstellerin, drei Ansichten in einer Reihe: vorne, rechtes Profil, hinten. Anfang 20, helle Gesichtsfarbe, langes welliges kastanienbraunes Haar mit einer halb hochgesteckten geflochtenen Krone. Gekleidet in ein cremefarbenes viktorianisches Baumwoll-Spitzenkleid, lange Ärmel mit Spitzenmanschetten, tailliertes Mieder mit kleinen Knöpfen, voller knöchellanger Rock, cremefarbene Knöchelriemen-Pumps mit niedrigem Absatz. Arme entspannt an den Seiten, neutraler Gesichtsausdruck. 6 7Fotorealistisch, konsistenter Maßstab zwischen allen sechs Figuren, Füße auf derselben Grundlinie ausgerichtet, scharfer Fokus von Rand zu Rand.
Einstellungen: Modell OpenAI GPT Image 2 Text-to-Image, Qualität hoch, Seitenverhältnis 16:9, alles andere Standard.
GPT Image 2 Text-to-Image auf Atlas Cloud, Lauf abgeschlossen: der Turnaround-Prompt auf der linken Seite, sechs Figuren auf einem weißen Blatt im OUTPUT-Bereich.
Dies ist die Zielform. Sechs Figuren, eine Grundlinie, nichts im Hintergrund, worüber man streiten könnte:
Das Referenzpaket, das den Demo-Clip antrieb: männlicher Hauptdarsteller in schwarzem Samt, weibliche Hauptdarstellerin in cremefarbener viktorianischer Spitze, drei Ansichten pro Person, eine Datei.
Mein eigener GPT Image 2 Lauf des Schritt 1 Prompts, zum Vergleich mit der obigen Referenz.
Schritt 2: Verankere den Ort mit einem Sechs-Panel-Szenenboard
Du hast das Gesicht gehalten. Das Licht wird dich trotzdem verraten. Das zweite Referenzbild legt sechs Kamerapositionen, die Richtung des Mondlichts, wie viel Nebel in der Luft liegt und wie nass der Boden aussieht, fest. Du sagst dem Modell, dass dieser Film genau eine Beleuchtungseinrichtung hat.
plaintext1Ein Sechs-Panel-Kinematographie-Locations-Board, 2 Zeilen mal 3 Spalten, dünne schwarze Ränder zwischen den Panels, jedes Panel unten mit kleiner eleganter weißer Schrift in Großbuchstaben und Buchstabenabstand beschriftet. Motiv: das Innere eines verlassenen gotischen Schlosses bei Nacht. Kaltes blaues Mondlicht, treibender niedriger Nebel, nasser reflektierender Steinboden, hohe Buntglasfenster, eiserne Kerzenhalter mit kleinen warmen Flammen, tiefe entsättigte Schwarztöne, schwere Samtvorhänge. Keine Personen in irgendeinem Panel. 2 3Panel 1, Beschriftung "WEITE EINSTELLUNG - KORRIDOR": ein langer säulengestützter Korridor, der zu einem beleuchteten Buntglasfenster führt. 4Panel 2, Beschriftung "UNTERSICHT - MONDSCHEIN ÜBER BODEN": tiefe Kamera, ein Strahl Mondlicht, der über nasse Steinplatten streicht. 5Panel 3, Beschriftung "TÜR- & TREPPENKOMPOSITION": eine gewölbte Türöffnung, die eine geschwungene Steintreppe einrahmt. 6Panel 4, Beschriftung "NAHAUFNAHME - SCHNITZTÜR": enge Aufnahme einer schweren geschnitzten Holztür mit einem Eisengriff. 7Panel 5, Beschriftung "FENSTERANSICHT - NEBEL & VORHÄNGE": hohes Fenster, hereinrollender Nebel, Vorhangkante im Vordergrund. 8Panel 6, Beschriftung "LETZTER POSTER-RAHMEN - LEERE HALLE": symmetrische leere Halle, gemusterter Läufer, der zum Fenster führt. 9 10Fotorealistisch, kinematographisch, Filmkorn, konsistente Farbgebung über alle sechs Panels.
Einstellungen: gleiches Modell, Qualität hoch, Seitenverhältnis 16:9.
Das Locations-Board, das den Demo-Clip antrieb: sechs gotische Schlossinnenräume, eine Farbgebung, Beschriftungen lesbar.
Mein eigener GPT Image 2 Lauf des Schritt 2 Board-Prompts.
Schritt 3: Generiere die Einstellung mit MiniMax H3 Reference-to-Video
Zwei Referenzbilder plus ein Prompt, der Kamerapositionen und Audioanweisungen enthält. Der Ton wird im selben Durchgang erzeugt, es gibt also keinen separaten Sprach- oder Score-Schritt. Halte die Dauer kurz, während du justierst, und erhöhe sie dann auf 15 für den echten Schnitt.
plaintext1Referenzbild 1 ist das Charakterblatt: der Mann LINKS ist der männliche Hauptdarsteller, die Frau RECHTS ist die weibliche Hauptdarstellerin. Behalte beide Identitäten genau wie gezeigt bei: sein Kiefer, dunkles welliges Haar, schwarzer Samt-Gehrrock, schwarze Brokatweste und schwarze Seidenkrawatte; ihr kastanienbraunes halb hochgestecktes geflochtenes Haar und cremefarbenes viktorianisches Spitzenkleid. Referenzbild 2 ist das Locations- und Beleuchtungsboard: passe sein kaltes blaues Mondlicht, den treibenden Nebel, den nassen reflektierenden Steinboden und die entsättigten Schwarztöne an. 2 39:16 vertikal, Premium-Live-Action-Kurzdrama-Look, geringe Schärfentiefe, kinematographischer Kontrast, keine Untertitel, kein Bildschirmtext, kein Wasserzeichen. 4 5Einstellung 1: Halbnahaufnahme, Kamera fährt langsam heran. Die weibliche Hauptdarstellerin steht im mondbeschienenen Korridor, atmet flach, Blick auf etwas außerhalb des Bildes rechts gerichtet. Nebel zieht auf Kniehöhe an ihr vorbei. 6Einstellung 2: Harter Schnitt. Über-die-Schulter von hinten, der männliche Hauptdarsteller tritt aus dem dunklen Torbogen ins Mondlicht, der Mantel fängt das Licht, Ausdruck kalt und neugierig. 7Einstellung 3: Enge Nahaufnahme auf sein Gesicht, halb vom Fenster beleuchtet, dann eine passende Nahaufnahme auf ihres, als sie sich weigert wegzusehen. 8 9Audio: tiefes anhaltendes Bassdröhnen, entfernter Steinecho, ihr unruhiger Atem, ein schwerer Fußtritt, als er ins Licht tritt, ein einzelner sanfter Streicher-Swell beim letzten Schnitt.
Einstellungen: Modell MiniMax H3 Reference-to-Video, Auflösung 2K, Dauer 8 (der Schieberegler-Standard; auf 15 für den echten Schnitt erhöhen), Seitenverhältnis adaptiv, und beide Dateien in Referenzmaterialien. Das Panel zählt sie als 2 von 9, du hast also reichlich Platz für Kleidungs- oder Requisitenplatten später.
Bemerkenswert, was mit dem Seitenverhältnis passiert ist. Ich habe das Seitenverhältnis auf adaptiv gelassen und nur "9:16 vertikal" in den Prompt geschrieben. H3 kam trotzdem vertikal zurück, las also die Rahmung aus dem Text, anstatt das Formularfeld zu benötigen.
MiniMax H3 Reference-to-Video auf Atlas Cloud, Lauf abgeschlossen: beide Referenzdateien als 2 von 9 geladen, Auflösung 2K, und der generierte vertikale Clip, der im OUTPUT-Bereich abgespielt wird.
Der erste Frame zeigt die weibliche Hauptdarstellerin im cremefarbenen Spitzenmieder, stehend im Korridor von Board-Panel 1, mit Nebel auf Kniehöhe und dem Mondlicht, das den nassen Boden genau dort trifft, wo das Board es platziert hat. Beide Referenzbilder sind angekommen.
Schritt 4: Führe den Seedance 2.5 vs MiniMax H3 Kontrolllauf mit dem identischen Paket durch
Ändere kein Wort. Gleiche zwei Referenzbilder, gleicher Prompt, anderes Modell. Ich habe die jeweilige Dauer-Voreinstellung jeder Seite in Ruhe gelassen, anstatt sie anzugleichen, und ich sage unten, was jede zurückgegeben hat. Einen Prompt "für" das andere Modell umzuformulieren, ist genau die Art, wie Vergleiche zu lügen beginnen.
plaintext1Gleicher Prompt wie Schritt 3, wörtlich. Formuliere ihn nicht für das andere Modell um.
Einstellungen: Modell Seedance 2.0 Reference-to-Video, Auflösung 720p, gleiche zwei Referenzbilder in Referenzbildern (wieder 2 von 9, mit separaten Slots für bis zu 3 Referenzvideos und 3 Referenzaudiodateien). Dauer auf der Seitenvoreinstellung belassen, die als 10-Sekunden-Clip zurückkam.
Seedance 2.0 Reference-to-Video auf Atlas Cloud, Lauf abgeschlossen mit dem identischen Referenzpaket und Prompt aus Schritt 3, und einem 10-Sekunden-Ergebnis im OUTPUT-Bereich.
Hier ist, was die beiden OUTPUT-Bereiche tatsächlich gezeigt haben, und ich berichte es flach, anstatt einen Gewinner zu wählen.
Beide Läufe hielten die Figur. Gleiches cremefarbenes Spitzenkleid mit demselben Ausschnitt und denselben Ärmelmanschetten, gleiches kastanienbraunes Haar, gleicher Nebel-und-Mondlicht-Korridor, vom Board übernommen. Keiner hat eine andere Frau erfunden. Das Referenzpaket hat diese Arbeit auf beiden Seiten geleistet, was der Befund ist, der mir am wichtigsten ist.
Die Unterschiede betrafen die Form, nicht das Gesicht. Dieser Seedance-Endpunkt lieferte 720p; H3 lieferte 2K bei identischen Eingaben. Und die Rahmung teilte sich: H3 las "9:16 vertikal" direkt aus dem Prompt-Text und gab vertikal zurück, während der Seedance-Lauf 16:9 zurückgab, weil diese Seite ihre eigene Seitenverhältnis-Steuerung hat und der Prompt-Text allein sie nicht überschrieb. Wenn du für TikTok schneidest, wird dir dieser Unterschied einen Lauf kosten, sobald du das Formularfeld das erste Mal vergisst. Seedance 2.5 würde wahrscheinlich die Auflösungshälfte davon ändern und regionale Neu-Würfe hinzufügen, und ich werde nicht so tun, als hätte ich das gemessen.
Schritt 5: Korrigiere eine Einstellung, ohne den gesamten Clip neu zu würfeln
Die wahren Kosten eines Kurzdramas sind nicht die erste Generation. Es ist die siebte Revision. H3 akzeptiert einen vorhandenen Clip als Eingabe und bearbeitet nach Anweisungen, wobei das, was du nicht erwähnt hast, erhalten bleibt. Seedance 2.5s Angebot hier ist feiner: einen Bereich des Frames neu zeichnen und Performance, Beleuchtung und Kamera in Ruhe lassen.
plaintext1Verwende den bereitgestellten Clip: Behalte die beiden Charaktere, ihre Kleidung, die Kamerabewegungen und den Schnittrhythmus genau so, wie sie sind. Ändere nur die Umgebung, ersetze den mondbeschienenen Steinkorridor durch denselben Ballsaal des Schlosses, hohe Bogenfenster, einen beleuchteten Kronleuchter und warmes Kerzenlicht, und beleuchte beide Charaktere neu, sodass ihr Schlüssellicht vom Kronleuchter auf der linken Bildseite kommt, anstatt vom Fenster. Schreibe ihren einzigen gesprochenen Satz um zu: "Du warst nie eingeschlafen, oder?" Behalte ihr Performance-Timing auf denselben Schlägen bei.
Einstellungen: MiniMax H3 Reference-to-Video mit dem Schritt 3 Clip als Referenzeingabe, Dauer 5, Auflösung 2K.
Über den Seedance 2.5 vs MiniMax H3 Test hinaus: Vier Möglichkeiten, ein Referenzpaket zu erweitern
Gleicher Charakter, nächste Episode. Speichere das Schritt 1 Blatt als Asset und ändere nur die Einstellungsliste und den Handlungsblock im Prompt. Die Identität kommt aus einer Datei, nicht aus deiner Erinnerung, wie du sie letzten Dienstag formuliert hast.
Die Stimme auch festlegen. H3 nimmt bis zu drei Audio-Referenzen, 2 bis 15 Sekunden pro Stück, und sie müssen eine Bild- oder Videoeingabe begleiten. Gib ihm eine Sprachprobe, und der Charakter spricht in dieser Klangfarbe, sodass du keinen Synchronsprecher zwischen den Episoden neu besetzen musst.
Die Kamera blocken, bevor du für den Render bezahlst. Seedance 2.5s Reference-to-Video akzeptiert 3D-Weißmodell-Blockouts und Green-Screen-Platten, sodass du die Rahmung auf grauer Geometrie festlegen und dich erst dann zu einem fertigen Look verpflichten kannst. Dieses Beispiel lief auf Seedance 2.1, einem früheren Mitglied der Familie, aber die Form des Workflows ist dieselbe.
Einen Master-Schnitt lokalisieren, anstatt ihn neu zu drehen. Regionale Ersetzung tauscht ein Gesicht, ein Produkt oder eine gesprochene Sprache aus, während Kamera, Timing und Lippendauer an Ort und Stelle bleiben. Hier wird ein Master-Beauty-Schnitt für Spanisch, Koreanisch und Hindi neu besetzt und neu vertont, wobei der Raum, die Rahmung und die Lippendauer beibehalten werden.
Und weil jemand fragen wird, wie Bewegungstransfer aussieht, wenn du aufhörst, vernünftig zu sein: drei Männer in Anzügen, ersetzt durch drei fotorealistische Capybaras, die dem Bewegungspfad des Originalclips Schlag für Schlag folgen, bis sie sich zu einer Pyramide stapeln.
Es gibt auch die schlichte Version all dessen, die niemand postet: ein statisches Poster wird zu einem bewegten Poster, und das Layout überlebt.
Das statische Quellposter. Füttere es mit Referenz-zu-Video mit "Behalte den Rahmen, die Palette und das Layout, animiere die Schrift" und du erhältst eine bewegte Version desselben Designs.
Was ein Seedance 2.5 vs MiniMax H3 Kurzfilm dich tatsächlich kostet
Keine Zahlen hier, weil die Zahlen sich bewegen und die Struktur nicht. Beide Familien berechnen pro Sekunde ab, Pay-as-you-go, kein Sitzplatz und kein Abonnement. Das lässt drei Variablen: Sekunden, Auflösungsstufe und Neu-Würfe.
Die dritte ist die gesamte Rechnung. Ein 15-Sekunden-Clip, der beim ersten Versuch landet, ist eine Gebühr. Derselbe Clip beim siebten Versuch ist sieben. Also ist der Geldspar-Trick nicht, das günstigere Pro-Sekunde-Modell zu wählen, sondern das Referenzpaket richtig hinzubekommen, bevor du irgendetwas generierst. Diese beiden Bildaufrufe in Schritt 1 und Schritt 2 sind die günstigste Zeile in der gesamten Pipeline und diejenige, die bestimmt, wie viele Videoaufrufe du tätigst. Höchste Rendite auf die Ausgaben in der gesamten Kette, mit Abstand.
Dann korrigiere den Pro-Sekunde-Instinkt. Gleiches Referenzpaket, gleiche Laufzeit: H3s Referenz-zu-Video gibt 1440p zurück, dieser Seedance-Referenz-zu-Video-Endpunkt gibt 720p zurück. Pro Sekunde ist die falsche Einheit. Pixel pro Frame, und ob du dann für einen separaten Upscale-Durchgang bezahlen musst, ist die richtige.
Audio gehört auch in die Arithmetik. Beide Seiten produzieren natives synchronisiertes Audio im selben Durchgang. Wenn deine aktuelle Pipeline Videomodell plus TTS plus einen Editor, der Spuren ausrichtet, ist, sparst du zwei API-Aufrufe und einen Nachmittag einer Person, und diese Ersparnis erscheint auf keiner Preisliste.
Welches für welchen Job:
| Job | Wähle | Warum | Einschränkung |
|---|---|---|---|
| Vertikales Kurzdrama, 9:16, TikTok oder ReelShort | MiniMax H3 | 1440p vertikal mit nativem Stereo, sofort aufrufbar, 15 s sind ein voller Aufhänger | du schneidest bei 15 s, also plane Beats entsprechend |
| Ein durchgehender 30-Sekunden-Markenfilm | Seedance 2.5 | Einzelgeneration, kein Stitching, native 4K | überprüfe zuerst die Verfügbarkeit auf deiner Plattform |
| Korrigieren einer Einstellung in einem genehmigten Schnitt | Seedance 2.5 | Regionale Neuzeichnung lässt den Rest in Ruhe | H3s Ganzclip-Bearbeitung bringt dich heute schon weit |
| Produkt- und E-Commerce-Schnitte | beides | beide halten Bildschirmtext und Markenmarkierungen gut | überprüfe Text bei der Auflösung, die du auslieferst |
| Game- oder Interface-Demos | MiniMax H3 | UI- und Typografie-Stabilität bei 2K ist stark | 15 s Obergrenze für einen einzelnen Durchgang |
| Mehrsprachige Versionen eines Masters | Seedance 2.5 | Regionsersetzung plus mehrsprachige Stimme | Lokalisierungsqualität braucht noch eine Muttersprachler-Prüfung |
| Noch heute ausliefern | MiniMax H3 | drei Endpunkte live, plus das gesamte Seedance 2.0 | Seedance 2.5 Zugang variiert je nach Plattform |
Bevor du auslieferst. MiniMax sagte, H3s Gewichte würden innerhalb von Tagen nach dem Launch folgen, und offene Gewichte sind nicht dasselbe wie eine kommerzielle Lizenz, also lies die Bedingungen, bevor du selbst hostest. Wasserzeichen- und kommerzielle Nutzungsrichtlinien unterscheiden sich auch zwischen Consumer-Apps und API-Zugang auf beiden Seiten, und ich konnte während des Schreibens keine von einer primären Bedingungsseite bestätigen, also überprüfe die Bedingungen des Anbieters, anstatt mein Wort dafür zu nehmen. Und nichts in irgendeiner Modelllizenz deckt Ähnlichkeit oder Markenrechte ab. Wenn eine reale Person, eine reale Marke oder das geistige Eigentum einer anderen Person in deinem Referenzpaket ist, ist das eine separate rechtliche Frage, und die Modellbedingungen werden sie nicht beantworten.
Jedes Modell in den obigen Tabellen läuft mit demselben Schlüssel, und die Modellseiten enthalten die aktuellen Tarife sowie Copy-Paste-Code, einschließlich aller Aktionen, die diese Woche für die Seedance-Linie laufen.
Häufig gestellte Fragen
Ist Seedance 2.5 besser als MiniMax H3 für Figurenkonsistenz?
Theoretisch sollte es das sein, mit bis zu 50 multimodalen Referenzen gegenüber H3s 12 Dateien, plus regionalen Neu-Würfen. Aber Stand 31. Juli 2026 gibt es keinen gepaarten öffentlichen Test, auf den ich verweisen kann, und Seedance 2.5 hat noch keine Arena-Bewertung. In den Läufen, die ich tatsächlich machen konnte, war die Variable, die die Identitätsstabilität bestimmte, die Referenzpaketstruktur, nicht die Modellgenerierung: mit einem zusammengesetzten Turnaround-Blatt plus einem Beleuchtungsboard hielten beide Seiten die Figur. Hol dir das Paket richtig, bevor du Zeit damit verbringst, Modelle zu vergleichen.
Kann ich Seedance 2.5 jetzt sofort nutzen, oder muss ich warten?
Seine API ist bei ByteDance live. Die Verfügbarkeit auf Drittanbieter-Modellplattformen ist uneinheitlich, und auf der, die ich getestet habe, ist es noch eine Day-0-Mitteilung. Wenn du heute Abend eine Ausgabe brauchst, sind die aufrufbaren Optionen MiniMax H3s drei Endpunkte und die gesamte ausgelieferte Seedance 2.0 Linie.
Produziert MiniMax H3 wirklich 30-Sekunden-Video?
Nein. Die Spezifikation ist 5 bis 15 Sekunden pro Generation bei 24fps. Alles Längere ist Erweiterung oder Stitching, was eine andere Sache mit einem anderen Drift-Risiko ist. Die 30-Sekunden-Einzelgeneration gehört zu Seedance 2.5. Lass die beiden Behauptungen nicht verschwimmen.
Generieren beide Modelle Audio, und kann ich eine Stimme über Episoden hinweg behalten?
Beide produzieren natives synchronisiertes Audio im selben Durchgang, und H3 gibt Stereo bei jedem Ergebnis aus. Für eine dauerhafte Stimme akzeptiert H3 bis zu drei Audio-Referenzen von 2 bis 15 Sekunden Länge, die zusammen mit einer Bild- oder Videoeingabe eingereicht werden müssen, nicht allein.
Wie viele Referenzbilder sollte ich tatsächlich senden?
Weniger als du denkst, besser strukturiert als du denkst. Eine gut komponierte Composite schlägt im Allgemeinen sechs lose Zuschnitte, weil separate Dateien das Modell einladen, sie zu einer Person zu mitteln, die nicht existiert. Gib ihm zwei klare Aufgaben, Identität und Beleuchtung, und nimm keine Stilproben auf, die sich widersprechen.
Welches Modell sollte ich für TikTok- oder ReelShort-artige vertikale Kurzdramen verwenden?
Diese Woche auslieferbar, in 9:16, in hoher Auflösung mit bereits gemischtem Sound: MiniMax H3. Planung einer 30-Sekunden-Durchgehend-Szene, bei der du einzelne Regionen neu würfeln willst, anstatt ganze Clips: baue für Seedance 2.5 und überprüfe, wann deine Plattform es öffnet.






