Seedance 2.5 ist jetzt live — Zuerst auf Atlas Cloud

Wan 3.0 vs Seedance 2.5 Native 30s: Beide sagen 30 Sekunden, nur einer ist wirklich 1080p

Wan 3.0 vs Seedance 2.5 native 30s, geprüft anhand von Alibabas eigenen Demo-Prompts: Welche rendert echte 1080p-Pixel, welche skaliert hoch und welche kann man heute schon ausführen?

Two monitors showing a western scene next to storyboards

Zwei nebeneinander stehende Schnittmonitore, die dieselbe Einstellung einer Tankstelle in der Wüste zeigen – einer mit einer ununterbrochenen 30-Sekunden-Zeitleiste darunter, einer mit einer in zwei Segmente geteilten Zeitleiste

Bei Sekunde 20 spritzt der Zapfhahn frisches grünes Gras aus. Noch mit Wassertropfen bedeckt. Das Pferd kneift genüsslich die Augen zusammen. Dem Angestellten fällt der Zahnstocher aus dem Mund.

Dieser Witz funktioniert nur in einer einzigen durchgehenden 30-Sekunden-Einstellung. Schneidet man vier 8-Sekunden-Clips zusammen, wechselt das Pferd sein Fell, die Sonnenbrille ihre Form, der Himmel verschiebt sich um eine Blende wärmer, und die Pointe stirbt irgendwo in den Übergängen.

Als Wan 3.0 und Seedance 2.5 beide im selben Zeitfenster mit der Behauptung landeten, native 30 Sekunden, ein Durchlauf, kein Stitching, war das keine reine Benchmark-Geschichte mehr. Es war das erste Mal, dass ein KI-Videomodell einen Aufbau, eine Wendung und eine Auflösung in einer einzigen Aufnahme halten konnte.

Ich habe die Spezifikationen auseinandergenommen, einen Spezifikationscheck gegen Alibabas eigene veröffentlichte Demodateien durchgeführt und fand das, was niemand, der darüber schreibt, gedruckt hat: Beide Modelle sagen 30 Sekunden, aber die Auflösung unter diesen 30 Sekunden ist nicht dasselbe Produkt.

Die wichtigsten Erkenntnisse

  1. Beide Modelle generieren wirklich 30 Sekunden in einem einzigen Durchlauf. Das ist kein Marketing. Wan 3.0 deckt 2 bis 30 Sekunden mit einer intelligenten Daueroption ab, Seedance 2.5 deckt 4 bis 30 Sekunden ab.
  2. Nur Wan 3.0 rendert native 1080p bei 30 Sekunden. Seedance 2.5 generiert nativ nur in 480p und 720p. Die Optionen 1080p, 1440p und 4K sind nachträgliche Upscales einer 720p-Quelle, und die eigene API-Dokumentation besagt, dass die 4K-Stufe „keine native 4K-Generierung“ ist.
  3. Seedance 2.5 gewinnt beim Referenzvolumen: bis zu 30 Bilder plus 10 Videos plus 10 Audiodateien, insgesamt 50. Wan 3.0s Creator-Handbook begrenzt Referenzen auf 20.
  4. Wan 3.0 hat einen Input, den niemand sonst hat: .doc, .xls, .ppt, .pdf, .txt-Dateien und Live-Webseiten, die direkt als kreative Referenzen eingespeist werden.
  5. Nur eines der beiden Modelle ist heute tatsächlich außerhalb von Alibaba nutzbar. Wan 3.0 befindet sich in der öffentlichen Beta auf Alibaba Cloud Model Studio und Qwen Cloud, der Drittanbieter-API-Zugang rollt noch aus. Seedance 2.5 ist live auf Atlas Cloud mit 30 im Dauerregler sofort verfügbar.
  6. Möchten Sie die 30-Sekunden-Geschichtenstruktur testen, bevor Sie für eine einzige Sekunde bezahlen? Der kostenlose KI-Werbespot-Generator von Atlas Cloud gibt Ihnen einen kostenlosen Durchlauf: einen fertigen 15-Sekunden-Spot mit gesprochenem Dialog und Soundeffekten, wasserzeichenfreier Download.
Invalid YouTube video ID

Alibabas offizieller Wan 3.0-Demo, aus dem Tongyi Wan 3.0 Creator-Handbook. Eine Aufnahme, keine Schnitte, 30,07 Sekunden. Gemessen mit ffprobe: 1920x1072, 24fps, AAC-Stereo-Audio eingebrannt. Ton einschalten für den Schweifwedler und den Zahnstocher, der bei Sekunde 29 auf den Boden fällt. Nur als Referenzmaterial für Vergleich und Kommentar verwendet.

Wan 3.0 vs Seedance 2.5 Native 30s: Was sich diesen Monat tatsächlich geändert hat

Fünfzehn Sekunden waren lange die Grenze. Wan 2.7 endet dort. Seedance 2.0 endete dort. Jeder „Ein-Minuten-KI-Film“, den Sie im letzten Jahr in Ihrem Feed gesehen haben, bestand aus vier bis acht Clips, die in einem NLE zusammengeklebt wurden, mit einem Colorist-Pass, um die Übergänge zu verbergen.

Zwei Dinge durchbrachen diese Grenze in denselben wenigen Wochen. Alibaba eröffnete die öffentliche Beta von Wan 3.0 am 6. August 2026 mit nativer 30-Sekunden-Generierung und vollständigem multimodalem Referenz-Input (AlphaSignal, August 2026). ByteDance verdoppelte Seedance von 15 auf 30 Sekunden in Version 2.5 und positionierte es explizit als Möglichkeit, Clip-Stitching und die damit einhergehende visuelle Drift zu reduzieren.

Native ist hier in einem spezifischen technischen Sinne wichtig. Es bedeutet einen Vorwärtsdurchlauf über eine einzelne latente Sequenz, keine Last-Frame-Erweiterung, bei der das Modell den letzten Frame von Clip A nimmt und Clip B davon startet. Erweiterung ist der Grund, warum der Kragen Ihrer Figur zwischen den Aufnahmen leise seine Form ändert. Ein nativer Durchlauf hat die gesamten 30 Sekunden im selben Kontext, sodass das Pferd dasselbe Pferd bleibt.

Die Tankstellen-Demo ist der sauberste Test dafür. Die Struktur besteht aus vier Takten: 0 bis 8 Sekunden, in denen nichts passiert, 8 bis 16 Sekunden, in denen etwas Seltsames passiert, 16 bis 24 Sekunden für die Pointe, 24 bis 30 Sekunden für den Abgang. Der Witz landet bei Sekunde 20. Das bedeutet, er landet nur, wenn das Pferd, die Sonnenbrille, die Teal-and-Orange-Farbgebung und die emotionslose, fest fixierte Kamera alle die ersten 19 Sekunden unberührt überstehen. Das kann Stitching nicht leisten. Nicht, weil der Editor schlecht ist, sondern weil Clip B Clip A nie gesehen hat.

Wan 3.0 vs Seedance 2.5 Native 30s: Wo das Bild tatsächlich bricht

Dreißig Sekunden sind zweimal fünfzehn. Das Drift-Risiko ist nicht doppelt so groß, es ist schlimmer, und es wechselt zu einer anderen Fehlerart.

Die Fehler im gestückelten Workflow traten zwischen den Clips auf. Native 30s-Fehler treten im Clip auf. In einer praktischen Seedance 2.5-Kurzfilmproduktion fand der Rezensent Dekohärenz und Morphing als „visuelle Spitzigkeit oder Instabilität in Charaktermodellen“, konzentriert auf schnelle Action-Sequenzen, und stellte insbesondere fest, dass diese Artefakte nicht durch Upscaling beseitigt werden können (MindStudio, August 2026). Das ist der Teil, der für jeden wichtig ist, der plant, in 720p zu rendern und später auf 4K hochzuskalieren: Der Upscaler schärft das Morphing, er entfernt es nicht.

Dieselbe Produktion verzeichnete ein Shoot-Verhältnis von 3,2 zu 1. Ungefähr 450 Sekunden Rohgenerierung für einen endgültigen Schnitt von 2 Minuten 22 Sekunden. Planen Sie Long-Take-Arbeiten wie einen Dreh mit Coverage, nicht wie eine Render-Warteschlange, bei der jeder Job ausgeliefert wird.

Zwei weitere Erkenntnisse aus dieser Produktion sind es wert, direkt übernommen zu werden. Die visuelle Identität des gesamten Films beruhte auf drei Referenzbildern, zwei Charakterporträts und einer Locations-Platte, obwohl das System bis zu 50 akzeptiert. Und beim Voice-Casting behob das Schreiben von „American“ einen unbeabsichtigten britischen Akzent, während das Schreiben von „American English“ dies nicht tat, weil das Wort „English“ die Aussprache wieder in Richtung britisch drückte.

Die Prompt-Struktur, die 30 Sekunden überlebt, ist die, die Alibaba in seinem eigenen Handbuch verwendet: explizite, mit Zeitstempeln versehene Beats. Kein Absatz voller Stimmungen. Schreiben Sie 0-8s, 8-16s, 16-24s, 24-30s, geben Sie jedem Block sein eigenes Kameraverhalten und sein eigenes Ereignis, und enden Sie mit einer einzigen Audiozeile, die den gesamten Clip abdeckt. Sie werden genau dieses Gerüst in Schritt 4 unten sehen, weil ich Alibabas Struktur beibehalten und nur übersetzt habe.

Wan 3.0 vs Seedance 2.5 Native 30s: Spezifikationen, Preis und was Sie heute ausführen können

Hier ist der ehrliche Stand der Dinge, und der Teil, in dem die beiden Modelle aufhören, vergleichbare Produkte zu sein.

Lesen Sie die Auflösungszeile zweimal, denn sie ist der ganze Artikel. Die eigene Seedance 2.5 Text-to-Video-API-Dokumentation von Atlas Cloud besagt, dass 720p-esr eine 480p-Quelle verbessert, dass 1080p-esr, 1440p-esr und 4k-esr alle eine 720p-Quelle verbessern, und dass die 4K-Option eine kurze Kante von 2160 Pixeln liefert, „keine native 4K-Generierung“. Ein 30-Sekunden-Seedance-Clip mit der Bezeichnung 4K hat also 720p echte Details, neu abgetastet. Die Preisliste von Wan 3.0 hat dagegen eine direkte 1080p-Stufe für $0,20 pro Sekunde, und Alibabas eigene veröffentlichte 30-Sekunden-Demodateien messen 1920x1072.

Der Vorteil dieser Einschränkung: Der gesamte Test läuft in einem Browser-Tab, auf drei Modellen, ohne lokale Einrichtung.

Rolle in diesem TestModellAusgewiesener Preis
EröffnungsframeGPT Image 2 Text-to-Imageab $0,009 / Bild
Der native 30s-LaufSeedance 2.5 Text-to-Videoab $0,134 / SEKUNDE

Ausgewiesene Preise, überprüft auf den Atlas Cloud-Modellseiten, August 2026. Betrachten Sie sie als Untergrenzen, nicht als Festpreise. Jedes dieser Modelle berechnet nach dem, was Sie tatsächlich anfordern, und der Run-Button bepreist Ihre genauen Einstellungen, bevor Sie klicken. In diesem Test kostete der Button $0,1745 für einen GPT Image 2-Frame bei hoher Qualität und 2048x1152, und $1,514799 für einen fünf Sekunden dauernden Seedance 2.5-Job bei 720p und 16:9, was ungefähr $0,30 pro Sekunde entspricht, statt der ausgewiesenen $0,134. Der ausgewiesene Betrag ist der 480p-Satz. Überprüfen Sie den Button, nicht den Katalog. Seedance 2.5 bietet auch einen Reference-to-Video-Endpunkt zum gleichen Preis von $0,134 pro Sekunde, wenn Sie die 50-Referenz-Obergrenze ausreizen möchten.

So reproduzieren Sie diesen nativen 30s-Test auf Seedance 2.5

Fünf Schritte, drei Modelle, alles im Browser. Kopieren Sie die Prompts wörtlich.

Schritt 1: Das mit Zeitstempeln versehene 30s-Gerüst festlegen

Führen Sie noch nichts aus. Lesen Sie zuerst die Struktur, denn das ist der Teil, der entscheidet, ob Ihre 30 Sekunden halten.

Die Wan 3.0-Tankstellen-Demo am Anfang dieses Artikels ist als vier benannte Blöcke mit einer einmal zu Beginn festgelegten festen Kameradoktrin aufgebaut: ruhige, objektive Beobachtung, fest fixierte Halbtotale, plötzliche extreme Nahaufnahmen nur bei den absurden Beats. Jedes Ereignis ist an einen Zeitbereich gebunden. Audio ist eine Zeile am Ende, die alle 30 Sekunden abdeckt.

Hier ist das leere Gerüst. Füllen Sie es aus, und Sie haben einen Prompt, den ein natives 30s-Modell tatsächlich verfolgen kann:

Plain
1Ein 30-Sekunden-[Genre] in [Ort]. [Visueller Stil, Grading, Sättigung]. Kamerasprache: [Doktrin], unterbrochen von [Ausnahme].
2
30-8s: [Aufbau, Weitwinkel, Etablierung der normalen Welt, Einführung der Anomalie am Horizont]
4
58-16s: [Die Anomalie handelt, wird noch als normal behandelt, eine Sichtweise oder Reaktions-Einstellung]
6
716-24s: [Die Pointe, extreme Nahaufnahme auf die Sache selbst, harter Schnitt auf das Reaktionsgesicht]
8
924-30s: [Der Abgang, ein kleiner physischer Knopf, der den Witz abschließt]
10
11Audio: [Atmosphäre, drei oder vier spezifische diegetische Geräusche, ein letztes kleines Geräusch]. Keine Musik, kein Dialog, kein Text auf dem Bildschirm.

Die messbare Spezifikation der Referenzdatei von Alibaba, für alle, die meine Zahlen überprüfen möchten: 30,07 Sekunden, 1920x1072, 24fps, AAC-Stereo. Das ist die Messlatte, an der der Seedance-Lauf gemessen wird.

Schritt 2: Den Eröffnungsframe generieren

Sie benötigen einen festen visuellen Anker, damit die 15-Sekunden- und 30-Sekunden-Läufe von derselben Welt ausgehen. Öffnen Sie GPT Image 2 Text-to-Image.

Einstellungen: Qualität high, Seitenverhältnis 16:9, 1 Bild.

Plain
1Eine weite, regungslose Einstellung, die eine einsame Tankstelle im Stil der Route 66 in einer hellen Wüste zeigt. Retro-Gebäude in Gelb-Orange und Blau, Farbe leicht sonnenverblichen; eine verblasste, vintage-rote Zapfsäule davor; ein kleiner Laden daneben mit einem ausgewaschenen Cola-Automaten neben der Tür. Rissige, orangefarbene, trockene Erde im Vordergrund, warme terrakottafarbene Berge weit hinten, wolkenloser, klarer cyanblauer Himmel. Ein Tankwart in schmierigen blauen Overalls und übergroßen schwarzen Sonnenbrillen döst halb schlafend in einem Stuhl neben der Tür, einen Zahnstocher im Mund. Strenges, helles Teal-and-Orange-Color-Grading, hohe Sättigung, hohe Helligkeit, filmisch fotorealistisch, fest fixierte Kamera, 16:9.

Screenshot einer KI-Bildgenerator-Oberfläche mit Prompt und Ausgabebild

GPT Image 2-Playground auf Atlas Cloud mit Qualität auf high und 16:9, die generierte Route 66-Tankstellen-Einstellung im Ausgabefenster

GPT Image 2 auf Atlas Cloud: Qualität high, 16:9, ein Bild. Der Run-Button kostete $0,1745 für diesen Frame, was ein 2048x1152-Render in hoher Qualität tatsächlich kostet. Die $0,009 auf der Modellseite sind die Untergrenze.

Mann, der vor einer Vintage-Route-66-Wüstentankstelle ruht

Route 66-Tankstellen-Einstellung, generiert mit GPT Image 2, teal-farbener Himmel und orangefarbene, rissige Erde, Angestellter döst neben der Tür

Der Eröffnungsframe. Dies ist der Input für Schritt 3 und das visuelle Ziel für Schritt 4. Generiert mit openai/gpt-image-2.

Schritt 3: Die 15-Sekunden-Grenze erreichen

Einstellungen: Erster Frame = Ihr Output aus Schritt 2, duration auf das Maximum von 15 gezogen, Auflösung 1080P.

Plain
1Fest fixierte Weitwinkel-Einstellung hält. Eine Cowgirl in einem breitkrempigen Hut reitet auf einem echten Pferd im Schritt vom Horizont herein. Der dösende Angestellte wird von Hufgetrappel geweckt, schiebt seine Sonnenbrille hoch, setzt sich aufrecht hin, kaut an seinem Zahnstocher, unbeeindruckt. Sie steigt sauber ab, führt das Pferd direkt zur Vintage-Zapfsäule. Helles Teal-and-Orange-Grading, hohe Sättigung, fotorealistisch, ruhige, beobachtende Kamera, keine Schnitte.

Das Dropdown stoppt bei 15. Das ist der springende Punkt dieses Schritts. Ihre Pointe ist für Sekunde 20 geplant, und diese Pipeline kann Sekunde 20 nicht in einem Stück erreichen. Um dorthin zu gelangen, müssten Sie einen zweiten Clip aus dem letzten Frame generieren, und in dem Moment, in dem Sie das tun, ist das Pferd ein neues Pferd.

Screenshot einer KI-Videogenerator-Oberfläche mit Input und Output

Schritt 4: Den vollständigen nativen 30s-Durchlauf ausführen

Öffnen Sie Seedance 2.5 Text-to-Video.

Einstellungen: duration = 30, resolution = 720p, ratio = 16:9, generate_audio = an, output_format = mp4, Wasserzeichen aus.

Wählen Sie bewusst 720p, nicht 1080p-esr. 720p ist die tatsächliche Obergrenze des Modells, dies ist also ein direkter Pixelvergleich anstelle eines Vergleichs mit einem Upscaler.

Der Prompt unten ist Alibabas eigener Tankstellen-Demo-Prompt, getreu aus dem Wan 3.0 Creator-Handbook übersetzt und auf nichts umstrukturiert. Dieselben Beats, dieselben Timings, dieselbe Kameradoktrin, dieselbe Audio-Liste.

Plain
1Ein 30-Sekunden absurdistischer, todernster Comedy-Kurzfilm, der an einer sonnenverblichenen Tankstelle im Stil der Route 66 in einer hellen Wüste spielt. Fotorealistisch, strenges, helles Teal-and-Orange-Grading, hohe Sättigung und hohe Helligkeit, sodass das absurde Ereignis in einer völlig normalen, fast schönen Welt stattfindet. Kamerasprache: ruhige, objektive Beobachtung, meist fest fixierte Halbtotale und langsame seitliche Fahrten, keine emotionale Lenkung, unterbrochen von plötzlichen extremen Nahaufnahmen auf die absurden Beats.
2
30-8s: Weitwinkel, fest fixiert. Cyanfarbener Himmel, treibender Staub. Die Retro-Tankstelle in Gelb-Orange und Blau steht allein an der Straße; ein Angestellter in schmierigen blauen Overalls und riesigen schwarzen Sonnenbrillen döst in einem Stuhl, Zahnstocher im Mund. Nur Wind. Am Horizont erscheint ein Cowgirl auf einem echten Pferd im Schritt. Schnitt auf Halbtotale: Hufgetrappel weckt ihn, er schiebt seine Sonnenbrille hoch, setzt sich auf, interpretiert die beiden als „schon wieder einer, der nach dem Weg fragt.“
4
58-16s: Sie sagt nichts. Sie steigt sauber ab, führt das Pferd direkt zur alten Zapfsäule. Das Pferd legt lässig seinen Kopf neben die Zapfsäule, als hätte es das schon einmal getan. Kurze, leicht fischaugenartige Sichtweise von hinter seiner Sonnenbrille, die Frau und das Pferd wirken noch seltsamer. Nahaufnahme: seine Stirn runzelt sich, er nimmt die Sonnenbrille ab, will gerade losschreien. Zeitlupen-Nahaufnahme: Während die Brille abgenommen wird, zielt sie mit dem Zapfhahn auf das Maul des Pferdes und drückt ab.
6
716-24s: Extreme Nahaufnahme auf den Zapfhahn. Heraus kommt nicht Benzin, sondern Fontänen aus frischem, hellgrünem Gras, noch mit Wassertropfen bedeckt. Harter Schnitt auf eine extreme Nahaufnahme des Gesichts des Angestellten, erstarrt: Augen weit aufgerissen, Mund leicht geöffnet, Zahnstocher mitten im Kauen vergessen. Halbtotale: Das Pferd frisst glücklich, kneift genüsslich die Augen zusammen, gibt dann einen zufriedenen, kräftigen Schweifwedler, und der aufgewirbelte Staub landet direkt im Gesicht des immer noch fassungslosen Angestellten.
8
924-30s: „Vollgetankt“ mit Gras. Sie hängt den Zapfhahn wieder an die Säule, klaubt Münzen aus ihrer Tasche, geht zur Ladentür und lässt sie klirrend in eine Blechdose auf der Theke fallen. Sie wirft einen Blick zurück auf den versteinerten Angestellten; unter der Hutkrempe hebt sich der Mundwinkel ein kleines Stück. Sie steigt wieder auf und reitet in einer Staubfahne davon. Die Kamera fährt langsam auf ihn zu: dieselbe erstarrte Haltung, das Gesicht voller Staub, die Sonnenbrille immer noch in der Hand, und schließlich fällt der Zahnstocher mit einem kleinen Klicken aus seinem Mund.
10
11Audio: trockener Wüstenwind durchgehend, Hufgetrappel, das mechanische Klacken des Zapfhenkels, spritzendes nasses Gras, der Schweifwedler, Münzen in einer Blechdose und ein kleines Klicken, als der Zahnstocher auf den Boden fällt. Keine Musik, kein Dialog, kein Text auf dem Bildschirm.

Eine Warnung, die Ihnen eine verschwendete Rechnung erspart, und es ist dieselbe Falle wie in Schritt 3: Ziehen Sie den Dauerregler auf 30, geben Sie nicht 30 in das Zahlenfeld ein. Das Feld zeigt zwar fröhlich 30 an, während der Schieberegler auf seinem fünfsekündigen Standardwert bleibt, und der Run-Button wird Ihnen fünf Sekunden in Rechnung stellen. Überprüfen Sie das Angebot, bevor Sie klicken. Bei 720p und 16:9 kostet ein Fünf-Sekunden-Job $1,514799, ein echter 30-Sekunden-Durchlauf kostet also etwa das Sechsfache.

Es gibt keinen Screenshot des fertigen Laufs für diesen Schritt. Drei automatisierte Erfassungsversuche haben alle den Schieberegler-Standardwert anstelle von 30 Sekunden übermittelt, und anstatt Ihnen einen Fünf-Sekunden-Clip zu zeigen, der als 30-Sekunden-Clip bezeichnet wird, wurde die Erfassung weggelassen. Der Prompt und die Einstellungen oben sind genau das, was Sie einfügen und einstellen müssen.

Schritt 5: Die Drift ehrlich beurteilen

Hier ist die Seedance 2.5-Seite dieses exakten Prompts, generiert bei nativen 30 Sekunden, 720p, 16:9, Audio an.

Seedance 2.5, derselbe Wan 3.0-Tankstellen-Prompt wörtlich kopiert: native 30s in einer Generierung, 1280x720, 24fps, Audio eingebrannt. Dieselben vier Beats, Cowgirl und Pferd kommen an, der Zapfhahn-Gag, die Nahaufnahme der kognitiven Dissonanz des Angestellten. Stellen Sie es neben den Wan 3.0-Clip oben für einen direkten Vergleich.

Legen Sie die beiden Clips nebeneinander und überprüfen Sie fünf bestimmte Dinge. Überprüfen Sie nicht, „welcher besser aussieht“, das ist ein Geschmacksargument und wird Ihren Nachmittag verschwenden.

  1. Fell- und Kostümidentität. Ist das Pferd bei Sekunde 29 dieselbe Farbe wie bei Sekunde 6? Haben die Sonnenbrillen dieselbe Form, nachdem sie abgenommen wurden und wieder in seine Hand zurückkehren?
  2. Grading-Stabilität. Messen Sie den Himmel bei Sekunde 2 und Sekunde 28. Teal-and-Orange-Grading driftet bei langen Generierungen häufiger in Richtung warm, als die Leute erwarten.
  3. Der physische Beat bei Sekunde 20. Gras aus einem Zapfhahn ist eine Physikanfrage. Bogen es und fällt es mit Gewicht, oder erscheint es als Textur?
  4. Kameradisziplin. Der Prompt sagt fest fixiert. Zählen Sie, wie oft die Kamera eine Heranfahrt erfindet, die nicht angefordert wurde. Dies ist der häufigste Fehler bei langen Generierungen: Das Modell geht ihm die geplanten Ereignisse aus und füllt die Zeit mit Bewegung.
  5. Morphing bei schnellen Bewegungen. Der Schweifwedler und der Staubtritt sind die schnellsten Bewegungen im Clip. Laut den MindStudio-Produktionsnotizen ist dies genau der Ort, an dem sich Dekohärenz konzentriert, und genau das, was ein Upscale nicht beheben wird.

Bewerten Sie diese fünf, nicht die Stimmung. Das ist ein Vergleich, den Sie einem Kunden gegenüber verteidigen können.

Drei weitere passende Prompts für Wan 3.0 vs Seedance 2.5 Native 30s

Eine Demo ist eine Anekdote. Hier sind drei weitere offizielle Wan 3.0 30-Sekunden-Dateien aus demselben Handbuch, jede belastet einen anderen Teil des 30-Sekunden-Problems. Für das Seeungeheuer und den Dark-Fantasy-Monolog wurde die Seedance 2.5-Seite mit demselben Prompt bei nativen 30 Sekunden generiert und ist direkt nach jeder eingebettet, sodass Sie beide ansehen können, anstatt mir aufs Wort zu glauben.

PromptWas es stresstestetOffizielle Wan 3.0-Datei, gemessenSeedance 2.5-Seite, gleicher Prompt
Seeungeheuer-Katastrophenfilm10 geschriebene Einstellungen plus eine Orchesterpartitur in 30s1920x1072, 24fps, 30,07s, AACgeneriert bei 30s, unten eingebettet; ein IP-Name und der Bootsmarkentext wurden entfernt, damit Seedances Inhaltsfilter es durchlässt, das Storyboard ist ansonsten identisch
Dark-Fantasy-englischer Monolognatives englisches Voiceover und Lippen-Sync über eine langsame kontinuierliche Heranfahrt1280x720, 24fps, 30,05s, AACgeneriert bei 30s aus dem Prompt wörtlich, unten eingebettet
2D-Sport-Anime, zweizeiliger PromptKann das Modell 30s mit fast keiner Anweisung füllen1280x720, 24fps, 30,05s, AAChier nicht generiert; als Nur-Wan-Frame-Raster gezeigt, um die Struktur im Zeitverlauf zu lesen
Whip-Pan-Comedy-Kurzfilm (ausgeschlossen)8 Whip-Pans und 8 emotionale Beats ohne Schnitt1280x720, 24fps, 30,04s, AACnicht ausgeführt: Die Dialogdichte ist mandarinspezifisch, eine englische Umschreibung wäre kein fairer direkter Vergleich

Offizielle Wan 3.0-Demo: zehn geschriebene Einstellungen und eine vollständige orchestrale Steigerung in einem einzigen 30-Sekunden-Durchlauf, bei 1920x1072. Dies ist das stärkste Argument für natives 1080p, denn die Wassermenge und die Details der nassen Haut des Kreatur sind genau das, was ein 720p-Upscale eher erfindet als auflöst. Alibaba Tongyi Creator-Handbook, verwendet für Vergleich und Kommentar.

Seedance 2.5, derselbe Zehn-Einstellungs-Katastrophen-Prompt bei nativen 30s, Ton an. Sturmgebeuteltes Fischerboot, der verängstigte Decksmann, die anschwellende Dünung, dann der Tiefsee-Leviathan, der im Blitzlicht die Oberfläche durchbricht. Ein IP-Verweis und der Rumpfmarkentext wurden entfernt, damit Seedances Inhaltsfilter es durchlässt; das Storyboard ist ansonsten identisch, was die Wassermenge und die Details der nassen Haut zu einem fairen direkten Vergleich mit dem Wan 3.0-Clip oben macht.

Offizielle Wan 3.0-Demo, Ton an. Nativer englischer Schurken-Dialog, „Reif genug für die Leere“, geliefert in einer einzigen langsamen Aufwärtsneigung ohne Schnitt. Dies ist der Clip, den englischsprachige Teams testen sollten, denn Stimme, Lippen-Sync und eine 30-sekündige kontinuierliche Kamerabewegung müssen alle gleichzeitig halten.

Seedance 2.5, derselbe Dark-Fantasy-Prompt wörtlich kopiert, native 30s, Ton an. Derselbe Schurke mit veilchenfarbenen Augen, die Sternrunen-Markierungen, der Schattennebel, der sich in seiner offenen Handfläche bildet, und die beiden englischen Zeilen. Beobachten Sie, ob der Lippen-Sync und die einzige kontinuierliche Heranfahrt über die gesamten 30 Sekunden halten, wie sie es auf der Wan 3.0-Seite tun.

Wenn Sie die passende Seedance 2.5-Seite davon ausführen, behalten Sie die beiden englischen Zeilen wörtlich bei und denken Sie an die Akzent-Eigenheit aus den Produktionsnotizen: Schreiben Sie „American“, nicht „American English“. Das Wort „English“ zieht die Aussprache in Richtung einer britischen Lesart.

Der dritte ist die stille Überraschung. Der 2D-Sport-Anime-Prompt in Alibabas Handbuch ist zwei Zeilen lang. Keine Zeitstempel, keine Einstellungsliste, nur ein Boxer, der einen Sandsack schlägt, müde, unter Schmerzen. Dreißig Sekunden daraus sind ein echter Test, ob das Modell seine eigene Struktur erfinden kann. Hier ist es über seine eigene Laufzeit abgetastet:

Vier Anime-Panels eines erschöpften Boxers, der mit einem Sandsack trainiert

Vier Frames aus der offiziellen Wan 3.0 2D-Sport-Anime-Demo, abgetastet bei ungefähr 1, 10, 20 und 29 Sekunden, die das Design des Boxers und den Turnhallen-Hintergrund über die gesamten 30 Sekunden zeigen

Vier Frames aus der offiziellen Wan 3.0 2D-Sport-Anime-Demo, abgetastet bei ungefähr 1, 10, 20 und 29 Sekunden. Dasselbe Charakterdesign, dasselbe Tanktop, derselbe schwere Sandsack, dieselbe Spindreihe, bei einem Wechsel von Weitwinkel zu Nahaufnahme, den der Prompt nie angefordert hat. Ein Standbild-Raster anstelle eines Clips, weil der Vergleich hier über die Zeit innerhalb einer Datei geht, nicht über Bewegung.

Praktische Lesart: Bei einem zweizeiligen Prompt erfand das Modell seine eigene Coverage, bewegte sich von einer fest fixierten Weitwinkelaufnahme zu einer Schweiß-und-Erschöpfungs-Nahaufnahme und hielt dabei das Charakterdesign. Das ist die gute Nachricht. Der Nachteil ist, dass Sie die Kontrolle darüber aufgegeben haben, wann etwas passiert. Wenn Sie 30 Sekunden benötigen, um einen bestimmten Beat zu einer bestimmten Sekunde zu landen, schreiben Sie die Zeitstempel.

Testen Sie natives 30-Sekunden-Storytelling kostenlos, bevor Sie für eines bezahlen

Ein 30-Sekunden-720p-Lauf auf Seedance 2.5 kostet etwa $9, sobald Sie die tatsächliche Auflösung und nicht die Kataloguntergrenze bepreisen. Ein 30-Sekunden-1080p-Lauf auf Wan 3.0s Preisliste kostet $6,00. Keines davon ist nach Produktionsstandards teuer, aber bei einem Shoot-Verhältnis von 3,2 zu 1 kaufen Sie nicht einen Clip, sondern drei oder vier.

Bevor Sie etwas ausgeben, lohnt es sich, eine billigere Frage zu beantworten: Hält mein Skript tatsächlich als eine einzige durchgehende Aufnahme? Die meisten 30-Sekunden-Fehler sind keine Modellfehler. Es sind Strukturfehler, drei Beats, die dort hineingezwängt wurden, wo nur zwei Platz hatten, oder eine Pointe, die für Sekunde 26 geschrieben wurde, ohne dass irgendetwas die Sekunden 8 bis 20 trägt.

Der kostenlose KI-Werbespot-Generator von Atlas Cloud beantwortet das für nichts. Sie geben eine Produktbeschreibung und bis zu vier Produktfotos, jedes unter 8 MB, wählen einen von sechs Stilen (lustiger Meme, Plot Twist, Sitcom, herzerwärmend, Luxus oder Hard Sell), und er schreibt zuerst ein Zwei-Charakter-Skript mit einem Drei-Sekunden-Haken, einem Konflikt und einer Wendung, dann baut er jede Einstellung um dieses Skript herum auf. Charaktere sprechen ihre Zeilen laut aus, und Soundeffekte werden in das Video gerendert.

Die ehrlichen Grenzen: Es sind 15 Sekunden, nicht 30, Sie müssen angemeldet sein, und Sie erhalten eine kostenlose Generierung, bevor Sie Credits aufladen. Aber 15 Sekunden mit einem Haken, einem Konflikt und einer Wendung sagen Ihnen, ob Ihre drei Beats atmen. Wenn die Struktur dort funktioniert, nehmen Sie dieselben Beats, dehnen Sie sie auf das 0-8s / 8-16s / 16-24s / 24-30s-Gerüst aus Schritt 1 und geben Sie die neun Dollar für einen echten nativen 30-Sekunden-Durchlauf aus.

Was ein nativer 30s-Clip bei Wan 3.0 vs Seedance 2.5 tatsächlich kostet

SetupSatzDauerEin Clip
Wan 3.0, 1080p native (nur Alibaba Cloud)$0,20 / Sek.30s$6,00
Wan 3.0, 720p native (nur Alibaba Cloud)$0,10 / Sek.30s$3,00
Wan 3.0, 480p native (nur Alibaba Cloud)$0,05 / Sek.30s$1,50
Seedance 2.5, 720p native, auf Atlas Cloud$0,30 / Sek. gemessen bei 720p, ausgewiesen ab $0,13430setwa $9,09
GPT Image 2 Eröffnungsframe, hohe Qualität, 2048x1152ausgewiesen ab $0,009 / Bild1 Bild$0,1745 angeboten

Der Vergleich, der es tatsächlich entscheidet: Wan 3.0 bei 720p ist pro Sekunde günstiger als Seedance 2.5 bei 720p, und bei 1080p ist es das einzige der beiden, das echte Pixel verkauft. Seedance 2.5s Antwort sind 50 Referenzslots, sofortige Verfügbarkeit und eine funktionierende API, gegen die Sie noch heute Nachmittag ausliefern können.

Quellen- und Lizenzierungshinweis für diese nativen 30s-Clips

Jeder Wan 3.0-Clip und jeder Wan 3.0-Prompt in diesem Artikel stammt aus Alibabas öffentlich verteiltem Tongyi Wan 3.0 Creator-Handbook, hier reproduziert zu Vergleichs- und Kommentarzwecken, zitiert, unverändert und nicht ohne Wasserzeichen. Die kommerzielle Nutzung von Seedance 2.5-Output unterliegt den Bedingungen von ByteDance und Volcengine; die API-Abrechnung und Datenverarbeitung auf der Atlas Cloud-Seite unterliegen den eigenen Bedingungen von Atlas Cloud. Kein Abbild einer realen Person wird irgendwo in diesem Test reproduziert. Wenn Sie Kundenarbeit ausliefern, lesen Sie die Modellbedingungen für den spezifischen Endpunkt, den Sie aufrufen, nicht eine Blog-Zusammenfassung davon.

Häufig gestellte Fragen

Ist Wan 3.0s natives 30s tatsächlich ein Durchlauf oder gestitchte Clips?

Ein Durchlauf. Wan 3.0 generiert 2 bis 30 Sekunden in einer einzigen Generierung mit einer intelligenten Daueroption, sodass es auch entscheiden kann, dass der Clip nicht die vollen 30 benötigt. Das unterscheidet sich von der Last-Frame-Erweiterung, bei der ein zweiter Clip aus dem letzten Frame des ersten gespeist wird und die Identität über die Naht hinweg driftet.

Welches ist wirklich 1080p bei 30 Sekunden, Wan 3.0 oder Seedance 2.5?

Wan 3.0. Es hat eine native 1080p-Stufe auf seiner Preisliste, und Alibabas eigene 30-Sekunden-Demodateien messen 1920x1072. Seedance 2.5 generiert nativ nur in 480p und 720p; seine Optionen 1080p, 1440p und 4K sind Verbesserungen einer 720p-Quelle, und die API-Dokumentation beschreibt die 4K-Stufe als „keine native 4K-Generierung“.

Fällt das Bild bei Sekunde 25 immer noch auseinander?

Es kann, aber die Fehlerart hat sich geändert. Anstelle einer sichtbaren Naht zwischen Clips erhalten Sie Morphing und Dekohärenz innerhalb der Einstellung, konzentriert auf schnelle Bewegungspassagen, und Upscaling entfernt es nicht. Eine dokumentierte Seedance 2.5-Kurzfilmproduktion verzeichnete ein Shoot-Verhältnis von 3,2 zu 1, also planen Sie Long Takes mit Coverage.

Welches Modell nimmt mehr Referenzmaterial auf?

Seedance 2.5, mit deutlichem Abstand: 30 Bilder plus 10 Videos plus 10 Audiodateien, insgesamt 50, wobei Referenzvideo und -audio jeweils auf 30 Sekunden kombiniert pro Anfrage begrenzt sind. Wan 3.0s Handbuch begrenzt Referenzen auf 20, aber es ist das einzige, das .pdf, .ppt, .xls, .doc, .txt-Dateien und Live-Webseiten als kreativen Input akzeptiert.

Wird Wan 3.0 offene Gewichte haben?

Es gibt keine offizielle Zusage. Stand der öffentlichen Beta im August 2026 wurden keine Wan 3.0-Gewichte, kein Hugging Face-Checkpoint und kein ComfyUI-Knoten veröffentlicht, und die offiziellen offenen Gewichte für die Flaggschiff-Videolinie enden bei Wan 2.2 (Kingy AI, August 2026). Behandeln Sie alles andere, was Sie über einen 3.0-Gewichts-Drop lesen, als Spekulation, bis Alibaba etwas anderes sagt.

Neueste Modelle

Eine API für alle Media-KI.

Alle Modelle erkunden