Der Sänger existiert nicht. Der Song ist nicht in deiner Sprache. Trotzdem fühlst du ihn.
So reagiert das Publikum auf einen Clip, den der Creator Cia0 auf X geteilt hat – 19. Juli 2026: fünfzehn Sekunden einer Figur mitten im Gesang, betitelt als „Song, den du fühlen kannst, ohne ein einziges Wort zu verstehen." Die Bildunterschrift nennt den gesamten Stack in einer Zeile: Seedream 5.0 Pro für das Bild, Seedance 2.0 für das Video, ausgeführt auf CapCut. Was ihn verkauft, ist die Detailarbeit. Die Lippen folgen dem Gesang. Das Haar bewegt sich wie Haar. Das Gesicht trägt eine Emotion, nicht nur eine Pose.
Diese Anleitung baut diese Pipeline Schritt für Schritt nach: welches Modell was macht, die Prompts, die Emotionen über den Bild-zu-Video-Übergang transportieren, und was ein fertiges MV tatsächlich kostet.

Wichtige Erkenntnisse
- Der Workflow ist bildbasiert: Art-Directe einen Keyframe in Seedream 5.0 Pro für 0,045 $, zahle Videopreise erst, wenn der Look feststeht. Ein Gesicht im Standbild zu korrigieren kostet etwa ein Zwanzigstel des Neu-Rollens des Clips.
- Seedance 2.0 Bild-zu-Video akzeptiert einen ersten Frame plus optional einen letzten Frame, generiert 4 bis 15 Sekunden pro Lauf mit nativer Audiospur und kann den letzten Frame zurückgeben, damit der nächste Clip nahtlos anknüpft.
- Lippen-Synchronisation einer Figur zu deinem eigenen Track verwendet den Referenz-zu-Video-Endpunkt: bis zu 9 Bilder, 3 Videos und 3 Audioclips als Referenzen, mit @-Erwähnungen im Prompt.
- Ein 40-sekündiges, 720p vertikales MV liegt bei etwa 10 $ zu den rabattierten Preisen von Juli 2026, wobei dein Soundtrack die einzige nicht berechnete Kosten ist.
Die Seedream + Seedance MVs, die es nachzuahmen lohnt
Drei Posts innerhalb von zwei Tagen, plus ein früherer Lippen-Sync-Test, skizzieren das gesamte Terrain, das diese Paarung abdeckt. Keiner davon ist eine Labordemo. Jeder nennt seine Werkzeuge.
| Creator | Gepostet | Was der Clip zeigt | Toolchain |
|---|---|---|---|
| @Cia0_exe | 19. Juli 2026 | 15 s Balladen-Performance: Lippen-Sync, Haarphysik, eine gehaltene Emotion | Seedream 5.0 Pro + Seedance 2.0, auf CapCut laut Bildunterschrift |
| @Cia0_exe | 20. Juli 2026 | 15 s „Peak 2.5D Anime Action", die Art, die „Studios Jahre brauchen" | Gleiches Modell-Paar, ausgeführt auf einer Drittanbieter-App |
| @tjb_shizuka | 20. Juli 2026 | 30 s „Augentropfen-Warp"-Reise-Meme an einem Schweizer See, mit offener Einladung, das Format zu kopieren | Seedream Standbilder, Seedance 2.0 Bewegung, Mureka V9 Soundtrack, OpenShot Schnitt |
| @CuriousRefuge | 5. Mai 2026 | Multi-Sprecher Lippen-Sync-Tests über Realfilm und Animation | Referenzbild, Audiodatei, Kamera- und Dialog-Prompt |

Zwei Dinge wiederholen sich bei allen vier. Erstens: Das Bildmodell und das Videomodell werden als separate Aufgaben behandelt: Casting passiert in Seedream, Performance in Seedance. Zweitens: Das Videomodell ist nur die Mitte des Stacks. Jede Bildunterschrift nennt, was es umgibt: die App, auf der es lief, eine Soundtrack-Quelle, einen Editor für den Schnitt. Beide Cia0-Posts versprechen den Prompt „auf Chinesisch" in den Antworten, und der japanische Post buchstabiert seine Vier-Tool-Fließband in der Bildunterschrift selbst aus.
Warum der Seedream-zuerst-Workflow reine Text-zu-Video schlägt
Seedance 2.0 hat einen vollkommen brauchbaren Text-zu-Video-Modus. Die Leute, die die obigen Clips erstellen, überspringen ihn, und der Grund ist Arithmetik plus Kontrolle.
Auf Atlas Cloud kostet ein Seedream 5.0 Pro Standbild 0,045 $. Ein 5-Sekunden-Clip in 720p mit Seedance 2.0 kostet etwa 0,97 $ mit dem aktuellen Rabatt. Jedes falsche Gesicht, falsche Outfit oder falsche Framing, das du auf der Standbildstufe erwischst, kostet ein Standbild zur Korrektur. Jedes, das du auf der Videostufe erwischst, kostet einen kompletten Neu-Roll zum etwa 20-fachen Preis plus Wartezeit.
| Direkt Text-zu-Video | Seedream Keyframe zuerst | |
|---|---|---|
| Kosten für die Korrektur eines falschen Gesichts | ≈0,97 $ pro 5 s Neu-Roll | 0,045 $ pro Standbild |
| Casting-Konsistenz über Einstellungen | Neuer Würfelwurf pro Clip | Gleicher Charakterblock, gleiches Gesicht |
| Framing-Kontrolle | Prompt und hoffen | Du genehmigst die exakte Komposition zuerst |
| Wo Fehler auftauchen | Im teuren Schritt | Im günstigen Schritt |
Der Konsistenzpunkt ist für ein MV am wichtigsten. Ein Musikvideo zeigt das gleiche Gesicht acht oder zehn Mal. Text-zu-Video erfindet den Charakter bei jeder Generierung neu. Eine Keyframe-Pipeline hält die Identität auf zwei Arten fest: Verwende das genehmigte Standbild als ersten Frame jedes Clips, oder füge die gleichen Referenzbilder jeder Generierung hinzu. Du art-directest einmal, dann gibst du Videogeld aus, um eine Entscheidung zu animieren, die dir bereits gefällt.
Ausführen des Seedream + Seedance Workflows auf Atlas Cloud
Beide Hälften der Pipeline laufen an einem Ort. Atlas Cloud hostet die vollständige ByteDance-Modellfamilie, sodass Seedream 5.0 Pro (öffentliche APIs seit 8. Juli 2026) und Seedance 2.0 (gestartet am 12. Februar 2026) hinter demselben Konto, denselben Credits und derselben API-Form sitzen. Es gibt zwei Arbeitsweisen: über die Playgrounds klicken oder die Endpunkte in Code verketten.
Methode 1: Generiere deine MV-Shots im Playground
Schritt 1: Casting deines Charakters in Seedream. Öffne den Seedream 5.0 Pro Playground und schreibe den Keyframe-Prompt (ein vollständiges Rezept findest du zwei Abschnitte weiter unten). Passe das Seitenverhältnis jetzt an dein Ausgabeformat an: 9:16 für Shorts und TikTok, 16:9 für YouTube. Jeder Lauf gibt ein Bild für 0,045 $ zurück, also iteriere, bis Gesicht, Kleidung und Licht genau stimmen.

Schritt 2: Lade das Standbild in Seedance. Öffne den Seedance 2.0 Bild-zu-Video Playground. Das Formular nimmt ein erforderliches Bild, deinen genehmigten Keyframe, plus ein optionales letztes Frame-Bild, wenn die Einstellung auf einer bestimmten Komposition enden soll.
Schritt 3: Schreibe den Bewegungs-Prompt und stelle den Clip ein. Die Dauer reicht von 4 bis 15 Sekunden, oder Auto, um das Modell wählen zu lassen. Wähle das Seitenverhältnis, das zu deinem Keyframe passt, oder lass es auf Auto. Auflösung ist standardmäßig 720p.
Schritt 4: Überprüfe drei Umschalter. „Generate audio" gibt dem Clip nativen Ton. „Watermark" bleibt aus für saubere Master. „Return last frame" gibt dir den Schlussframe als separates Bild; gib ihn als ersten Frame der nächsten Generation zurück und der neue Clip setzt dort an, wo dieser aufgehört hat. Dieser Umschalter ist der Unterschied zwischen vier unzusammenhängenden Clips und einer durchgehenden Performance.
Schritt 5: Lies den Preis, dann führe aus. Der Run-Button zeigt die Kosten deiner exakten Einstellungen, bevor du dich festlegst. Stand 21. Juli 2026 zeigt ein 5-Sekunden-Clip in 720p ≈0,97 $ mit dem zeitlich begrenzten 20%-Rabatt der Plattform (≈1,21 $ Listenpreis).
Methode 2: Seedream und Seedance über eine API verketten
Schritt 1: Hol dir deinen API-Key. Erstelle einen Schlüssel in der Atlas Cloud-Konsole und exportiere ihn als Umgebungsvariable. Halte ihn aus dem Client-Code heraus.


Schritt 2: Überprüfe die API-Dokumentation. Endpunkte, Parameter und Polling-Verhalten findest du in der API-Dokumentation. Die gesamte Pipeline besteht aus zwei Submit-und-Poll-Zyklen.
Schritt 3: Führe die beiden Aufrufe aus. Zuerst den Keyframe:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateImage \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedream-v5.0-pro/text-to-image", 6 "prompt": "<dein Keyframe-Prompt>", 7 "size": "1152*2048" 8 }'
Poll GET /api/v1/model/prediction/ bis der Job abgeschlossen ist, nimm die gehostete Bild-URL aus der Ausgabe und übergib sie direkt an den Video-Aufruf:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedance-2.0/image-to-video", 6 "prompt": "<Bewegungs- und Performance-Prompt>", 7 "image": "<Seedream-Ausgabe-URL>", 8 "duration": 10, 9 "resolution": "720p", 10 "ratio": "adaptive", 11 "generate_audio": true, 12 "return_last_frame": true 13 }'
image akzeptiert eine URL, Base64 oder eine Asset-Referenz, und duration akzeptiert -1, um das Modell wählen zu lassen. watermark ist standardmäßig false. Mit return_last_frame aktiviert enthält die abgeschlossene Vorhersage den letzten Frame als Bild, sodass ein Skript eine Schleife ausführen kann: Clip generieren, letzten Frame holen, nächsten Clip einreichen. Diese Schleife ist die gesamte MV-Pipeline in etwa dreißig Zeilen.
Beide Aufrufe verwenden dieselbe Basis-URL, denselben Bearer-Header und dasselbe Prediction-Polling. Das ist der praktische Nutzen des Ein-API-Designs: Deine Seedream-Integration und deine Seedance-Integration unterscheiden sich nur durch einen Modell-String und ein paar Felder, und die nächste ByteDance-Veröffentlichung wird in denselben Code passen.
Seedream 5.0 Pro Prompt-Rezept für MV-Keyframes
Ein MV-Keyframe ist eine Casting-Entscheidung, daher ist die erste Aufgabe des Prompts, eine Person zu definieren, die du erneut beschwören kannst. Das Arbeitsmuster ist ein Charakterblock: ein Satz, 40 bis 60 Wörter, der Gesicht, Haare und Kleidung festlegt. Er wird wörtlich in jedem Keyframe-Prompt für das Projekt wiederverwendet. Ändere ein Wort und du riskierst, einen Fremden zu casten.
Hier ist ein vollständiger Keyframe-Prompt in diesem Muster:
Eine junge Frau mit hüftlangem schwarzem Haar, weichen, runden Gesichtszügen und silbernen tropfenförmigen Ohrringen, die einen übergroßen cremefarbenen Strickpullover trägt. Sie steht allein auf einem regennassen Dach in der Dämmerung, von den Schultern aufwärts auf Augenhöhe gerahmt. Ihre Augen sind glänzend, die Lippen leicht geöffnet, als würde sie gleich singen, der Blick knapp an der Kamera vorbei. Kühler blauer Stadtschein hinter ihr, ein warmes Randlicht auf ihrer Wange, geringe Tiefenschärfe, filmischer Standbild, weiches Korn, 9:16.
Der erste Satz ist der Charakterblock. Alles danach ändert sich pro Einstellung. Ein MV braucht einen kleinen Coverage-Satz, nicht ein Bild:
| Einstellung | Zweck | Was sich im Prompt ändert | Was fest bleibt |
|---|---|---|---|
| Weit | Ort und Stimmung etablieren | Standortdetail, Ganzkörper-Framing | Charakterblock, Lichtrichtung |
| Halbnah | Vers-Performance | „Von der Taille aufwärts gerahmt", eine Geste | Charakterblock |
| Nah | Emotionaler Höhepunkt des Refrains | „Schultern aufwärts", die Gesichtszeichen | Charakterblock |
Zwei Seedream-spezifische Hinweise. Schreibe die Emotion als physischen Beweis, nicht als Label: „Augen glänzend, Kiefer angespannt, ein angehaltener Atem" animiert später, während „traurig" zu einem Standardausdruck verflacht. Und setze das Seitenverhältnis im Größenwähler, nicht nur im Text, denn der Parameter gewinnt. Für die tiefere Prompt-Anatomie, einschließlich Ausschlussmustern und den bekannten Bugs des Modells, siehe unseren Prompt Guide für Seedream 5.0 Pro.
Seedance 2.0 Prompts für Lippen-Sync, Physik und Emotion
Der Keyframe übergibt Seedance 2.0 ein Gesicht, das es zu animieren lohnt. Der Bewegungs-Prompt entscheidet, ob der Clip performt oder sich nur bewegt. Seedance 2.0 generiert nativ Dual-Channel-Audio und lippensynchronisiert auf Phonem-Ebene in acht+ Sprachen, laut ByteDances Launch-Post, daher ist die Aufgabe des Prompts, dem Modell mitzuteilen, was aufgeführt wird, von wem und wie die Kamera es behandelt.
Es gibt zwei Wege zu einer singenden Figur.
Route A, generierter Song: Bleibe bei Bild-zu-Video, schalte „generate audio" ein und beschreibe den Gesang im Prompt. Das Modell erfindet die Musik und synchronisiert die Lippen zu seiner eigenen Spur. Das ist der schnellste Weg zu einem Cia0-ähnlichen Performance-Clip.
Route B, dein eigener Track: Wechsle zu Referenz-zu-Video, das pro Lauf bis zu 9 Referenzbilder, 3 Videos und 3 Audioclips akzeptiert. Lade deinen Song-Abschnitt als Audio-Referenz hoch, füge deinen Keyframe als Bild-Referenz hinzu und erwähne ihn mit @ im Prompt, um den Charakter an die Aktion zu binden. Dies ist das Rezept, das Curious Refuge im Mai validiert hat für Multi-Sprecher Lippen-Sync: „ein Referenzbild", „ein geschwärztes Video mit Audio ODER eine Audiodatei" und „ein Prompt (Kamerabewegung + VO/Dialog)." Kürze das Audio vor dem Hochladen auf die Clip-Länge; abgerechnete Token zählen Eingangsdauer plus Ausgangsdauer, also kostet Auffüllen echtes Geld.

Die Signale, die eine Performance von einem Bildschirmschoner unterscheiden:
| Was du willst | Prompt-Cue, der funktioniert | Warum es funktioniert |
|---|---|---|
| Lippen-Sync, das lesbar ist | Nenne die Sprache und den Gesangsstil: „sie singt eine langsame Ballade auf Mandarin, sanfte, hauchige Stimme" | Phonem-Ebene-Sync muss wissen, was gesungen wird |
| Haar- und Stoffphysik | Gib der Kraft eine Ursache: „eine Böe hebt ihr Haar, der Pullover wellt sich" | Physik folgt genannten Kräften, nicht Adjektiven |
| Sichtbare Emotion | Physische Anzeichen mit Timing: „ihre Augen schließen sich auf der gehaltenen Note, eine einzelne Träne am äußeren Augenwinkel" | Modelle animieren Aktionen weit besser als Stimmungen |
| Kameragefühl | Eine Bewegung pro Clip: „langsames Heranzoomen von halbnah auf nah" | Gestapelte Kamerafahrten bekämpfen sich innerhalb von 15 Sekunden |
| Mehr-Einstellungs-Drama | Beschreibe die Sequenz in der Reihenfolge: „öffne auf der Skyline, schneide zu ihrem Gesicht, wenn der Gesang einsetzt" | Seedance 2.0 verarbeitet Mehr-Einstellungs-Sequenzen nativ in einem Lauf |
Alles länger als 15 Sekunden ist ein Verkettungsjob: der Return-last-Frame-Trick aus dem Einrichtungsabschnitt, mit der nächsten Songzeile in jedem neuen Prompt. Behalte die Charakterblock-Formulierung aus deinen Seedream-Prompts auch in den Bewegungs-Prompts bei. Redundanz ist eine günstige Versicherung für die Identität.
Von Seedance-Clips zu einem fertigen MV: Schnitt und Budget
Der japanische „Augentropfen-Warp"-Post ist das klarste Bild der Endbearbeitungsphase, weil der Creator die gesamte Fließband in der Bildunterschrift auflistet: Seedream für die Standbilder, Seedance 2.0 für die Bewegung, Mureka V9 für den Soundtrack und OpenShot, einen kostenlosen Desktop-Editor, für den Schnitt. Cia0s Clip nennt CapCut als seine Plattform. Welchen Editor du auch wählst, der Schnitt ist derselbe Job: Lege zuerst die vollständige Spur ab, trimme Clips auf den Beat und behalte ein Seitenverhältnis von Anfang bis Ende bei.

Ein Hinweis zu dieser CapCut-Route. Innerhalb von CapCut läuft Seedance 2.0 als Dreamina Seedance 2.0, verfügbar in den USA seit dem 7. April 2026, und laut CapCuts eigener Ankündigung wird es mit Einschränkungen ausgeliefert, die das Generieren von Videos aus Bildern mit echten Gesichtern blockieren, plus einem sichtbaren Wasserzeichen auf der Ausgabe. Gut für Memes, einschränkend für saubere MV-Master. Die API- und Playground-Route lässt das Wasserzeichen standardmäßig weg und akzeptiert jeden von dir generierten Keyframe.
Was das Ganze kostet, zu den rabattierten Preisen von Juli 2026 auf Atlas Cloud:
| Phase | Modell oder Tool | Volumen | Kosten |
|---|---|---|---|
| Keyframes | Seedream 5.0 Pro | 10 Standbilder zu 0,045 $ | 0,45 $ |
| Bewegungsentwürfe | Seedance 2.0 Mini Bild-zu-Video | 4 Clips × 10 s zu 0,045 $/s | 1,80 $ |
| Endclips | Seedance 2.0 Bild-zu-Video, 720p | 4 Clips × 10 s zu ≈0,1935 $/s | ≈7,74 $ |
| Soundtrack | Dein eigener Track oder ein KI-Musikmodell | 1 Song | variiert |
| Schnitt | CapCut oder OpenShot | 1 Session | 0 $ |
| Gesamt | ~40 s fertiges MV | ≈10 $ |
Die Entwurfszeile ist die, die Leute überspringen und nicht sollten. Seedance 2.0 Mini verwendet denselben First-Frame-plus-Prompt-Workflow ab 0,045 $ pro Sekunde (Listenpreis 0,056 $), etwa ein Viertel des Flaggschiff-720p-Satzes, sodass Blocking, Kamerabewegungen und Physik günstig vor dem finalen Rendern debuggt werden. Ohne den Rabatt landet das gleiche Budget bei etwa 12,40 $ zu Listenpreisen, immer noch weniger als die meisten Stock-Footage-Abonnements für einen Monat berechnen.
Häufig gestellte Fragen
Kann Seedance 2.0 eine Figur zu meinem eigenen Song lippensynchronisieren?
Ja. Verwende den Referenz-zu-Video-Endpunkt, der bis zu 3 Audioclips zusammen mit 9 Bildern und 3 Videos pro Generation aufnimmt. Lade den Song-Abschnitt als Audio-Referenz hoch, füge deinen Seedream-Keyframe als Bild-Referenz hinzu, erwähne ihn mit @ im Prompt und beschreibe die Performance und die Kamera. Kürze das Audio vor dem Hochladen auf die Clip-Länge, da abgerechnete Token die Eingangs- plus Ausgangsdauer zählen.
Müssen Seedream- und Seedance-Prompts auf Chinesisch sein?
Nein. Cia0 teilt Prompts auf Chinesisch, und die chinesischsprachige Prompt-Kultur rund um ByteDance-Modelle ist stark, aber beide Modelle akzeptieren englische Prompts, und Seedance 2.0s Lippen-Sync funktioniert auf Phonem-Ebene in acht+ Sprachen. Wichtig ist, die Sprache des Gesangs im Prompt zu nennen, damit die Mundformen zum Track passen.
Wie lang kann eine einzelne Seedance 2.0-Generierung sein?
4 bis 15 Sekunden pro Lauf, wobei Mehr-Einstellungs-Sequenzen innerhalb dieses Fensters unterstützt werden, oder setze die Dauer auf -1 und das Modell wählt. Für ein vollständiges MV verketten: Aktiviere „return last frame" und starte den nächsten Clip vom letzten Frame des vorherigen Clips, damit die Performance durchgehend bleibt.
Werden meine MV-Clips ein Wasserzeichen haben?
Standardmäßig nicht auf der API oder dem Playground: Der Parameter watermark ist standardmäßig false, sodass Master sauber herauskommen. Die CapCut-Verbraucherversion ist anders. Dreamina Seedance 2.0 wendet ein sichtbares Wasserzeichen an und blockiert die Generierung aus Bildern mit echten Gesichtern, Teil des Schutzpakets, mit dem es 2026 neu gestartet wurde.
Was kostet ein komplettes Seedream + Seedance MV?
Etwa 10 $ für ein 40-sekündiges 720p-Vertikalvideo zu den rabattierten Preisen von Juli 2026: 0,45 $ für Keyframes, 1,80 $ für Mini-Entwürfe und etwa 7,74 $ für finale 720p-Clips, wobei der Schnitt in CapCut oder OpenShot kostenlos ist. Zu Listenpreisen liegt der gleiche Lauf bei etwa 12,40 $. Die Keyframe-Phase hält die Zahl so niedrig, weil Look-Entscheidungen zu 0,045 $ getroffen werden statt zu ≈0,97 $ pro Neu-Roll.
Fazit
Die Clips, die diesen Monat die Runde machen, sind nicht das Werk einer geheimen Funktion. Sie sind eine Arbeitsteilung: Seedream 5.0 Pro entscheidet, wer auf dem Bildschirm ist und wie der Rahmen sich anfühlt, Seedance 2.0 entscheidet, wie sie sich bewegen und klingen, und ein kostenloser Editor verwandelt Clips in einen Song mit einem Gesicht. Jeder Schritt ist überprüfbar, und jeder Fehler wird an der billigstmöglichen Stelle abgefangen.
Klau die Reihenfolge der Operationen. Lege einen Charakterblock fest, kaufe deine Fehler zu 0,045 $, animiere nur, was du bereits genehmigt hast, und lass den letzten Frame eines Clips den nächsten öffnen. Die Werkzeuge sind neu. Die Disziplin ist einfach Filmemachen.






