Seedance 2.5 ist jetzt live — Zuerst auf Atlas Cloud

Wan 3.0 Multimodale Referenz nimmt 20 Assets auf, und ein PDF ist eines davon.

Wan 3.0 multimodale Referenz nimmt 20 Assets in einem Aufruf: Bilder, Video, Audio, PDFs, sogar eine URL. Sehen Sie Alibabas eigene Ergebnisse und einen Workflow, den Sie heute ausführen können.

Sie haben einen Ordner für eine 15-Sekunden-Werbung erstellt. Zwei Charakter-Stills. Ein vom Kunden gesendetes Brand-Tone-Video. Ein Brand Book, das es nur als PDF gibt. Ein Sprachsample des Schauspielers, den Sie eigentlich wollten.

Dann haben Sie Ihr Videomodell geöffnet, und es hat nach einem einzigen Bild gefragt.

Also haben Sie getan, was jeder tut. Sie haben den Ordner in einen 800-Wörter-Prompt übersetzt und gebetet. Das Gesicht driftete in Einstellung drei. Die Jacke wechselte die Farbe. Die Stimme gehörte jemand ganz anderem.

Wan 3.0s Omni-Reference ist das erste Mal, dass ein Videomodell sagt: Na gut, gib mir den Ordner. Bis zu 20 Assets in einem einzigen Aufruf, über fünf Arten von Eingaben, zusammengehalten durch eine einzige durchgehende 30-Sekunden-Aufnahme.

Dieser Artikel tut drei Dinge und überspringt den Rest. Er schlüsselt auf, was diese 20 Assets tatsächlich sind, verwendet Alibabas eigene generierte Clips als Belege und gibt Ihnen einen äquivalenten Workflow, den Sie heute ausführen können, da Wan 3.0 noch in der öffentlichen Beta auf Alibabas eigener Cloud läuft und noch nicht von Drittanbieter-Plattformen aufrufbar ist.

Die wichtigsten Erkenntnisse

  • Wan 3.0s multimodale Referenz akzeptiert bis zu 20 Assets in einem Aufruf, darunter Bilder, Videos, Audio, Dokumente und Live-Webseiten, und hält sie über eine einzige 30-Sekunden-Aufnahme hinweg konsistent.
  • Es ist das erste Mainstream-Videomodell, das ein PDF, eine Präsentation oder eine URL als kreative Eingabe behandelt, anstatt etwas, das Sie in einen Prompt umformulieren.
  • Wan 3.0 trat am 6. August 2026 in die öffentliche Beta auf Alibaba Cloud Model Studio und Qwen Cloud als wan3.0-video ein. Es hat geschlossene Gewichte. Jeder, der Ihnen sagt, es sei bereits Apache 2.0, rät.
  • Die 20-Asset-Schlagzeile ist nicht der Punkt, an dem es wirklich vorne liegt. Referenz-zu-Video-Modelle, die Sie jetzt aufrufen können, akzeptieren bereits mehr als 20 Assets. Der Unterschied sind Dokumente und Webseiten, nicht die Stückzahl.
  • Sie können das Zwei-Charakter-, referenzgesperrte, voll vertonte Format kostenlos testen mit Atlas Cloud's kostenlosem KI-Werbespot-Generator: vier Produktfotos rein, ein 15-Sekunden-Sprachskit raus, ohne Karte.

Flauschige Katze und schwarze Katze rennen durch eine prächtige Hotelhalle

Zwei Katzen, gejagt durch fünf verschiedene Sets von Wan 3.0 ohne Charakterdrift_Zwei Referenzbilder. Fünf völlig unterschiedliche Sets, von einem Hotelkorridor bis zu einer Waschmaschinentrommel bis zu einer roten Telefonzelle. Kein einziger Frame Drift. Quelle: Alibabas offizielles_ Wan 3.0 Creator Handbook , August 2026, das auch die Quelle für alle anderen Wan 3.0-Clips in diesem Artikel ist.

Warum Multi-Referenz-Video auseinanderfällt und was Wan 3.0 Multimodale Referenz ändert

Videomodelle haben kein Gedächtnis zwischen Clips. Jede Generation beginnt bei Null. Das ist das ganze Problem in einem Satz.

Sobald Ihre Geschichte also mehr als eine Einstellung benötigt, müssen Sie flicken. Einstellung eins gibt Ihnen ein Gesicht, das Sie lieben. Einstellung zwei gibt Ihnen einen Cousin dieses Gesichts. Einstellung drei ändert leise die Jacke von Pflaume zu Burgunderrot, und bis Sie es bemerken, haben Sie bereits elf Renderings bezahlt.

Einzelbild-Referenz hat geholfen, aber sie hat immer nur eines festgehalten. Ein Gesicht. Sie konnte nicht gleichzeitig ein Gesicht, ein Outfit, ein Requisit, einen Ort und eine Stimme halten, weil es einen Slot und fünf Jobs gab.

Es gibt zwei Auswege. Geben Sie dem Modell mehr Slots, oder hören Sie auf, es von vorne beginnen zu lassen. Wan 3.0 macht beides gleichzeitig, und deshalb sind die beiden Hauptfunktionen eigentlich eine Funktion. Eine native 30-Sekunden-Aufnahme bedeutet, dass es keinen Schnitt gibt, über den der Charakter driften kann. Zwanzig Referenz-Assets bedeuten, dass jedes Element, das fixiert bleiben muss, seinen eigenen dedizierten Slot bekommt, anstatt um einen zu kämpfen.

Hier ist, wie das aussieht, wenn nichts geflickt ist. Dreißig Sekunden, eine durchgehende Kamera, ein Kind in einem Einkaufswagen, das in einer Werbetafel endet und dann darunter hervorkommt.

Eine volle 30 Sekunden in einem Durchgang, ohne Schnitte, mit dem Soundtrack, der im selben Durchgang erzeugt wurde. Quelle: Alibabas offizielles Wan 3.0 Creator Handbook.

Was „20 Assets“ tatsächlich innerhalb von Wan 3.0 Multimodaler Referenz bedeutet

Zwanzig ist eine Schlagzeilenzahl. Was zählt, ist, dass die zwanzig nicht alle die gleiche Art von Ding sind. Wan 3.0s Omni-Reference umfasst fünf Eingabetypen, und jeder steuert eine andere Achse der Ausgabe.

Bilder steuern die Identität. Eine Charakterkarte, ein Produktbild, eine Ortsaufnahme. Wan 3.0 nennt dies Pixel-genaue Konsistenz, und in Alibabas eigenen Beispielen erstreckt sich die Sperre über das Gesicht hinaus auf die Kleidung: der geschichtete graue Umhang, die gepanzerte Lederweste, die dunkle Taillenwickel überleben einen 16-Sekunden-Nahkampf über drei Orte.

Junger Mann in traditionellen chinesischen Gewändern, der bei Sonnenuntergang im Freien steht

Zwei Charakterkarten treiben eine Wuxia-Kampfszene mit Kostümdetails, die Frame für Frame gehalten werden

Zwei Charakterkarten plus eine Ortsaufnahme des Schilfufers. Die Garderobe und die Umgebung halten durch jeden Wurf. Hier als stummes GIF gezeigt; die gelieferte Datei enthält einen 44,1-kHz-Stereo-Mix. Quelle: Alibabas offizielles Wan 3.0 Creator Handbook.

Audio steuert die Stimme. Dies ist der Teil, der „multimodal“ mehr als nur Marketing macht. Sie hängen pro Charakter ein Sprachsample an, schreiben die Zeilen in den Prompt, und der Dialog kommt in dieser Klangfarbe zurück, lippensynchron, im selben Durchgang wie das Bild. Zwei Personen, zwei Sprachreferenzen, ein Fitnessstudio.

Zwei Motivbilder plus zwei separate Sprachreferenzclips, und der Dialog kommt in diesen beiden Stimmen zurück. Es lohnt sich, für diesen den Ton einzuschalten. Quelle: Alibabas offizielles Wan 3.0 Creator Handbook.

Video steuert das Timing. Ein Referenzvideo ist nicht da, um kopiert zu werden. Es ist da, um seinen Rhythmus zu spenden: wie lange ein Beat hält, wie sich ein Übergang bewegt. In diesem hier liefern fünf Keyframes die Motive und ein Referenzvideo liefert den horizontalen Karten-Flip-Rhythmus zwischen ihnen.

Frau mit aufwendigem traditionellem chinesischem Kopfschmuck und blau besticktem Kleid

Fünf Keyframes, durchgeblättert mit dem Tempo eines Referenzvideos_Fünf_ Keyframe-Bilder für die Motive, ein Referenzvideo für den Flip-Rhythmus. Quelle: Alibabas offizielles Wan 3.0 Creator Handbook.

Dokumente und Webseiten steuern die Struktur. Dies ist der wirklich neue Teil. Wan 3.0 akzeptiert Dokumentdateien und Live-URLs als kreative Eingabe, und die Berichterstattung über die Beta listet .doc, .xls, .ppt, .pdf und .txt unter den akzeptierten Formaten (AlphaSignal, August 2026). Die gleiche Logik funktioniert bereits mit einem Storyboard-Bild: ein Board rein, sechs Einstellungen raus, in der eigenen Reihenfolge des Boards.

Zwei Personen mit Regenschirmen stehen auf einem regnerischen Bahnsteig

Ein einzelnes Storyboard-Blatt, erweitert auf sechs aufeinanderfolgende Einstellungen auf einem regnerischen Bahnsteig

Ein Storyboard-Blatt als Referenz, sechs Einstellungen in seiner Reihenfolge generiert, bis hin zur Notiz, die in Einstellung fünf die Hände wechselt. Quelle: Alibabas offizielles Wan 3.0 Creator Handbook.

Erster und letzter Frame steuern Endpunkte. Der älteste Trick im Buch, immer noch unterstützt, immer noch der schnellste Weg, eine Einstellung zu begrenzen.

So schneidet das im Vergleich zu der Version ab, die die meisten Leute heute tatsächlich verwenden.

Wan 2.7 Referenz-zu-VideoWan 3.0 Omni-Referenz
Referenz-Assetsein Bild pro Motiv, bis zu 3 Videos, 1 Sprachclipbis zu 20 Assets insgesamt
ModalitätenBild, Video, AudioBild, Video, Audio, Dokument, Webseite
Maximale Dauer, ein Durchgang10 s30 s nativ, plus intelligente Dauer
Audio im selben Durchgangjaja
Videobearbeitung und -verlängerungnicht verfügbaranweisungs- und referenzbasierte Bearbeitung plus Verlängerung
Verfügbarkeitlive auf Drittanbieter-APIsAlibaba Cloud Model Studio und Qwen Cloud Beta

Es gibt eine Regel, die niemand in die Dokumente schreibt und die jeder auf die harte Tour lernt: eine Referenz, ein Job. Bild1 sperrt das Gesicht und das Outfit. Video1 spendet nur Bewegung. Audio1 spendet nur die Klangfarbe. In dem Moment, in dem Sie einem einzelnen Asset zwei widersprüchliche Jobs geben oder ein Referenzbild mit zwei Personen hochladen, muss das Modell raten, und Raten ist genau das, was Sie verhindern wollten. Alibabas Handbuch ist auch dazu deutlich: ein Motiv pro Referenzbild.

Der Wan 3.0 Multimodale Referenz-Workflow, den Sie heute ausführen können

Zuerst die klare Antwort. Wan 3.0 ist in der öffentlichen Beta auf Alibabas eigener Cloud, unter der Modell-ID wan3.0-video (Alibaba Wan, August 2026). Es ist noch nicht auf Drittanbieter-API-Plattformen gelandet, Atlas Cloud inbegriffen. Jeder, der Ihnen jetzt Wan 3.0 API-Zugang verkauft, verkauft etwas anderes weiter.

Was gelandet ist, ist die Workflow-Form. Referenzpaket rein, ein Aufruf, fertiger Clip mit Ton raus. Das läuft heute auf Referenz-zu-Video-Modellen, die Sie in einem Browser-Tab aufrufen können, und sobald Sie sie alle nebeneinanderstellen, sieht die 20-Asset-Schlagzeile anders aus.

ModellReferenz-AssetsModalitätenMaximale DauerNativer TonPreis pro Sekunde
Wan 3.0 (Alibaba Beta, nicht auf Atlas)20 insgesamtBild, Video, Audio, Dokument, Webseite30 sJaBerichtet $0.05 bis $0.20 je nach Auflösung
Wan 2.7 Referenz-zu-Video1 Bild pro Motiv, 3 Videos, 1 SprachclipBild, Video, Audio10 sJa$0.10
Seedance 2.5 Referenz-zu-Video50 (30 Bild / 10 Video / 10 Audio)Bild, Video, Audio30 sJa$0.13
MiniMax H3 Referenz-zu-Videogemischt, keine angegebene ObergrenzeBild, Video, Audio15 sJa$0.10
Kling Video O3 Pro Referenz-zu-Video7 Bilder, oder 4 Bilder + 1 VideoBild, Video15 sJa$0.10
Vidu Q3-Mix Referenz-zu-Video4 BilderBild16 sJa$0.11
Veo 3.1 Referenz-zu-Video3 BilderBild8 sOptional$0.20

Preise sind Atlas Cloud Tarife Stand August 2026. Wan 3.0s Zahlen sind die für die Alibaba Cloud Beta gemeldeten, kein Atlas Tarif, und Alibaba hat noch keine öffentliche Preisseite für das Modell veröffentlicht, behandeln Sie diese Zeile also als vorläufig.

Lesen Sie die Tabelle zweimal, und die wahre Geschichte zeigt sich. Die 20-Asset-Schlagzeile ist nicht der Punkt, an dem Wan 3.0 vorne liegt, denn Seedance 2.5 nimmt bereits 50 und erreicht die 30 Sekunden. Was nichts anderes auf dieser Liste nimmt, ist ein PDF.

Für die folgende Schritt-für-Schritt-Anleitung läuft die Demo auf Wan 2.7 Referenz-zu-Video, weil seine Eingabeform der nächste lebende Verwandte von Omni-Reference ist: mehrere Motivbilder, ein optionales Referenzvideo und ein Sprachclip, alle innerhalb des Prompts auf character1- und character2-Labels abgebildet. Drei Modelle, ein Browser-Tab, keine lokale Installation.

Bauen Sie es selbst: Eine multimodale Referenzszene in vier Schritten

Die Szene: eine pastellfarbene Hotelrezeption. Ein todernster Concierge. Ein Reisender, der eine Ragdoll-Katze hält. Der Concierge blickt direkt in die Linse und sagt: „Die Katze hat eine Reservierung. Sie nicht."

Zwei Bilder plus ein Sprachclip, das sind drei Referenz-Assets über zwei Modalitäten. Das ist der kleinste Aufbau, der ehrlich multimodal ist und nicht nur Multi-Image.

Schritt 1. Generieren Sie Referenzbild 1, das Motiv, das Sie sperren müssen

Referenzbilder haben drei Jobs und nur drei: ein Motiv, zur Kamera blickend, sauberer Hintergrund. Alles andere ist Dekoration. Verwenden Sie GPT Image 2 mit Qualität high, Größe 16:9, n=1.

Plain
1Ganzkörper-Studio-Porträt eines mittelalten Hotel-Concierges mit todernstem Ausdruck, der genau mittig vor einer flachen, staubigen rosa Wand steht. Er trägt eine pflaumenfarbene, zweireihige Hoteluniform mit Goldborten und Messingknöpfen, eine kleine runde Pillbox-Mütze und einen dünnen Schnurrbart. Perfekt symmetrischer Bildausschnitt, weiches, gleichmäßiges Frontallicht, kein Schlagschatten an der Wand, 35mm-Filmkorn, gedämpfte Pastellpalette. Nur ein Motiv, keine anderen Personen, kein Text, kein Logo, keine Requisiten im Bild.

KI-Bildgenerator-Oberfläche mit nummerierten Schritten und einem generierten Hotelpagen

GPT Image 2 Playground auf Atlas Cloud mit dem Concierge-Referenzporträt im Ausgabefenster

GPT Image 2 auf Atlas Cloud: Qualität hoch, 16:9, ein Motiv, flacher Hintergrund. Dies ist die Datei, die zu character1 wird.

Schritt 2. Generieren Sie Referenzbild 2, das zweite gesperrte Motiv

Gleiches Modell, gleiche Einstellungen. Der Farbkontrast zwischen den beiden Charakteren ist beabsichtigt, da er dem Modell eine einfache Möglichkeit gibt, sie auseinanderzuhalten, wenn sie sich einen Frame teilen.

Plain
1Ganzkörper-Studio-Porträt einer jungen Reisenden, die eine flauschige Ragdoll-Katze an ihre Brust drückt, genau mittig vor einer flachen, senfgelben Wand stehend. Sie trägt einen senfgelben Wollmantel, eine rote Baskenmütze und eine runde Schildpattbrille und hält in ihrer freien Hand einen kleinen Vintage-Lederkoffer. Perfekt symmetrischer Bildausschnitt, weiches, gleichmäßiges Frontallicht, kein Schlagschatten an der Wand, 35mm-Filmkorn, gedämpfte Pastellpalette. Nur ein Motiv, keine anderen Personen, kein Text, kein Logo.

Schritt 3. Generieren Sie die Sprachreferenz, der eigentliche multimodale Teil

Der Sprachclip ist es, der dies von einem Multi-Image-Job zu einem multimodalen macht. Wan 2.7s Audio-Slot möchte ein kurzes Sample, ungefähr 1 bis 10 Sekunden, also halten Sie die Zeile kurz. Verwenden Sie MiniMax Speech 2.6 HD und wählen Sie eine tiefe, flache, ungerührte männliche Stimme.

Plain
1Guten Abend. Checken Sie ein? Natürlich. Das tut jeder.

Schritt 4. Ein Aufruf, drei Referenzen, ein fertiger Clip

Jetzt geht das ganze Paket zusammen auf Wan 2.7 Referenz-zu-Video. Einstellungen: resolution: 1080P, ratio: 16:9, duration: 10, was die Obergrenze dieses Modells ist, prompt_extend: false, seed: -1. Laden Sie images in der Reihenfolge, Schritt 1 zuerst, damit es auf character1 abgebildet wird, dann Schritt 2 als character2, und hängen Sie die Datei von Schritt 3 an audio an.

Plain
1Symmetrischer, mittiger Weitwinkel einer pastellfarbenen Hotel-Lobby-Rezeption, staubig rosa Wände und ein senfgelber Schlüsselbrett dahinter. character1 ist der Concierge, der hinter dem Tresen steht; character2 ist die Reisende, die davor steht, immer noch ihre Ragdoll-Katze haltend. Die Kamera fährt langsam entlang einer perfekten Mittelachse nach vorne und neigt sich nie. character1 blickt direkt in die Linse und sagt flach: "Die Katze hat eine Reservierung. Sie nicht." character2 blinzelt einmal, dreht langsam den Kopf zur Katze, dann zurück zum Tresen. Die Katze starrt direkt in die Kamera, ohne sich zu bewegen. 35mm Filmkorn, gleichmäßiges weiches Licht, gedämpfte Pastellpalette, kein Kamera-Wackeln, keine Schnitte.

Negativer Prompt:

Plain
1Handheld-Wackeln, Jump Cuts, Untertitel, Bildschirmtext, Wasserzeichen, zusätzliche Personen, deformierte Hände, Gesichtsmorphing, Farbverschiebung, Bewegungsunschärfe

Screenshot einer KI-Videogenerator-Oberfläche mit Ein- und Ausgabe

Wan 2.7 Referenz-zu-Video Playground auf Atlas Cloud mit zwei Referenzbildern und einer Audiodatei geladen und dem fertigen Clip im Ausgabefenster

Wan 2.7 Referenz-zu-Video auf Atlas Cloud: zwei Referenzbilder und ein Sprachclip links angehängt, die fertige Aufnahme rechts bei 1080P und 16:9. Diese Aufnahme lief mit der Standarddauer des Modells; stellen Sie sie für die vollständige Version unten auf 10 ein.

Der fertige Clip. Beide Gesichter gehalten, beide Outfits gehalten, und die Zeile in der geklonten Stimme aus Schritt 3 geliefert, daher lohnt es sich, diesen mit Ton abzuspielen.

Frau mit einer Katze am Hotelrezeptionstresen mit Hotelpage

Die beiden Referenzporträts neben einem Frame aus dem fertigen Clip, die die gleichen Gesichter und Outfits zeigen

Referenzen links, ein Frame aus dem gelieferten Clip rechts. Uniformborten, Baskenmütze, Brille und Katze überleben die Reise.

Variationen des Wan 3.0 Multimodalen Referenz-Workflows

Auf 30 Sekunden erweitern. Das gleiche Referenzpaket läuft auf Seedance 2.5 Referenz-zu-Video mit duration: 30, was Ihnen die Länge gibt, die Wan 3.0 verspricht, ohne auf die Beta zu warten. Es nimmt bis zu 30 Referenzbilder, 10 Videos und 10 Audioclips auf, das Paket hat also Platz zum Wachsen. Schreiben Sie die zusätzlichen 20 Sekunden als Beats in den Prompt, nicht als Stimmungen, sonst füllt das Modell auf.

KI-Videogenerator-Oberfläche mit Eingabeeinstellungen und Generierungsfortschritt

Seedance 2.5 Referenz-zu-Video Playground auf Atlas Cloud mit Dauer auf 30 eingestellt und der langen Aufnahme gerendert

Seedance 2.5 Referenz-zu-Video auf Atlas Cloud mit Dauer auf 30 eingestellt und den gleichen zwei Referenzporträts angehängt, mitten in der Generierung erfasst. Beachten Sie die @image1 - und @image2 -Chips im Prompt: So sagen Sie Seedance, welche Referenz welchen Teil spielt. Überprüfen Sie den angegebenen Preis auf der Ausführen-Schaltfläche, bevor Sie zustimmen, da er die Dauer widerspiegelt, die der Job tatsächlich einreichen wird.

Die 30-Sekunden-Version derselben Szene, dasselbe Referenzpaket, Beats Einstellung für Einstellung ausgeschrieben.

Fügen Sie ein Referenzvideo nur für die Bewegung hinzu. Hängen Sie einen Clip an, dessen Tempo Ihnen gefällt, und sagen Sie dies explizit im Prompt, etwa „Folge dem Referenzvideo nur für den Schnittrhythmus, ignoriere seine Motive und die Umgebung". Das ist der Trick hinter dem Karten-Flip-Beispiel weiter oben.

Beheben Sie Drift mit dem negativen Prompt, bevor Sie den positiven anfassen. Gesichtsmorphing, Farbverschiebung und Handheld-Wackeln sind die drei, die referenzgesperrte Aufnahmen ruinieren, und sie sind normalerweise billiger zu unterdrücken als zu beschreiben.

Probieren Sie das multimodale Referenzformat kostenlos aus

Wenn Sie die Form davon wollen, bevor Sie die Parameter wollen, hat Atlas Cloud letzte Woche einen kostenlosen KI-Werbespot-Generator veröffentlicht, der die gleiche Kette ohne die Einstellmöglichkeiten ausführt.

Sie schreiben eine Zeile über Ihr Produkt und seine Verkaufsargumente. Er schreibt ein Zwei-Charakter-Comedy-Skript für Sie, Haken, Konflikt, Wendung, und rendert dann ein 15-Sekunden-Video mit gesprochenem Dialog und Soundeffekten. Sie können bis zu vier echte Produktfotos als Referenzen anhängen, und die Werbung behält ihre Form, Farbe, Etikett und Logo vom Skript bis zum finalen Frame. Sechs Stile sind enthalten, von lustigem Meme über Plot Twist und Sitcom bis zu Luxus und Hard Sell, und der Dialog kommt in der Sprache zurück, in der Sie die Beschreibung geschrieben haben.

Das ist die gleiche Zwei-Charaktere-plus-Referenzbilder-plus-Stimme-Kette aus dem Tutorial, minus dem Prompt-Schreiben und minus der Rechnung. Was es zu einem anständigen Weg macht, herauszufinden, ob dieses Format zu Ihrem Produkt passt, bevor Sie etwas für die Feinabstimmung ausgeben.

Um ein Gefühl dafür zu bekommen, was ein Stapel von Referenz-Stills mit einem Produktstück macht, hier ist Wan 3.0s eigene Version des Jobs: fünf Bilder rein, ein Launch-Reel raus, jedes Still verankert einen Beat des Schnitts.

Animierter schwebender Stapel weißer und mintgrüner Karten

Fünf Referenz-Stills, erweitert zu einem Material Design Produkt-Launch-Reel_Fünf Referenzbilder treiben einen neunsekündigen Produktfilm an, jedes verankert einen Beat und übergibt an den nächsten. Quelle: Alibabas offizielles Wan 3.0 Creator Handbook._

Was ein Wan 3.0 Multimodaler Referenzclip kostet

SchrittModellStückpreisMengeKosten
1 und 2, zwei ReferenzbilderGPT Image 2$0.009 pro Bild2$0.02
3, SprachreferenzMiniMax Speech 2.6 HD$0.08 pro 1K Zeichen49 Zeichen$0.00
4, die 10-Sekunden-Aufnahme bei 1080PWan 2.7 Referenz-zu-Video$0,15 pro Sekunde bei 1080P10 s$1.50
Tutorial-Gesamtsummeetwa $1.52
Variation, 30 SekundenSeedance 2.5 Referenz-zu-Video$0,134 pro Sekunde bei 480P30 setwa $4.02
Kostenloser WegKostenloser KI-Werbespot-Generatorkostenlos1 Clip, 15 s$0

Dies sind die eigenen Tarife der Plattform, Stand August 2026, und werden nach Verbrauch abgerechnet. Zwei Dinge bewegen die Gesamtsumme mehr, als die Leute erwarten. Die Auflösung ist das erste: die $0,10 pro Sekunde in der Vergleichstabelle sind Wan 2.7s Basistarif, und 1080P wird mit $0,15 abgerechnet, was die $1,50 oben erklärt. Das zweite ist, dass Seedance nach Pixelzahl abrechnet, daher ist der angegebene $0,134 pro Sekunde der 480P-Wert, und eine 720P-Aufnahme kostet mehr als eine einfache Multiplikation vermuten lässt. Zum Vergleich: Der gemeldete Wan 3.0 Beta-Tarif von $0,20 pro Sekunde bei 1080p würde eine volle 30-Sekunden-Aufnahme auf etwa $6 bringen, was mehr ist als der Seedance-Weg bei 480P heute.

Ein Hinweis zur Verwendung dieser Sachen. Wan 3.0 ist eine Beta und seine Bedingungen können sich ändern, lesen Sie sie also erneut, bevor Sie eine Pipeline darauf aufbauen. Wenn Ihre Referenzbilder echte Personen sind, holen Sie deren Erlaubnis ein, da Referenz-zu-Video genau die Fähigkeit ist, die dies relevant macht. Die Beispiel-Clips in diesem Artikel sind Alibabas eigene generierte Ergebnisse aus seinem öffentlichen Creator Handbook, die hier zu Kommentarzwecken reproduziert werden.

Häufig gestellte Fragen

Wie viele Referenzen kann Wan 3.0s multimodale Referenz tatsächlich aufnehmen?

Bis zu 20 Assets in einem einzigen Aufruf, gezogen aus Bildern, Videos, Audio, Dokumenten und Webseiten. Die praktische Grenze ist niedriger als die technische. Weisen Sie jedem Asset genau einen Job zu, ein Motiv pro Bild, und Sie werden für die meisten Szenen weit weniger als 20 verwenden.

Kann Wan 3.0 wirklich ein PDF oder eine Webseite in ein Video verwandeln?

Ja, das ist der wirklich einzigartige Teil. Neben Text, Bild, Audio und Video akzeptiert es Dokumentdateien und Live-URLs, wobei die Berichterstattung über die Beta .doc, .xls, .ppt, .pdf und .txt auflistet. Kein anderes Referenz-zu-Video-Modell in der Vergleichstabelle oben nimmt überhaupt ein Dokument an.

Ist Wan 3.0 Open Source? Kann ich es in ComfyUI ausführen?

Nein, und im Moment nicht. Wan 3.0 ist eine geschlossene Beta, die auf Alibabas eigener Cloud läuft. Frühere Wan-Generationen wurden offen veröffentlicht, weshalb die Erwartung besteht, aber Alibaba hat keine Gewichte für 3.0 bestätigt. Seiten, die eine 1,3B- oder 14B-Apache-2.0-Veröffentlichung von Wan 3.0 behaupten, werden durch nichts Offizielles gestützt.

Ist Wan 3.0 bereits über Drittanbieter-APIs verfügbar?

Noch nicht, Atlas Cloud inbegriffen. Das Nächstgelegene, was Sie heute aufrufen können, ist Wan 2.7 Referenz-zu-Video, dessen Eingabeform fast genau mit Omni-Reference übereinstimmt, abgesehen von den Dokument- und Webseiten-Modalitäten, oder Seedance 2.5 Referenz-zu-Video, wenn Sie die vollen 30 Sekunden benötigen.

Was ist der billigste Weg, ein referenzgesperrtes Zwei-Charakter-Video zu testen?

Der oben verlinkte kostenlose KI-Werbespot-Generator. Vier Referenzfotos rein, ein 15-Sekunden-Sprach-Zwei-Charakter-Clip raus, keine Parameter und keine Ausgaben. Wenn es Ihr Produkt und Ihr Format hält, dann gehen Sie daran, die kostenpflichtige Kette zu optimieren.

Warum driften meine Charaktere trotz Referenzbildern immer noch?

Drei Ursachen, in der Reihenfolge ihrer Häufigkeit. Eine Referenz trägt zwei Jobs, sie wird also gebeten, sowohl das Gesicht als auch den Ort zu fixieren. Das Referenzbild hat mehr als eine Person oder einen unruhigen Hintergrund, sodass das Modell nicht weiß, welchen Teil es sperren soll. Oder die Drift ist ein Rendering-Artefakt und kein Referenzfehler. Setzen Sie in diesem Fall Gesichtsmorphing, Farbverschiebung in den negativen Prompt, bevor Sie etwas umschreiben.

Neueste Modelle

Eine API für alle Media-KI.

Alle Modelle erkunden