El cantante no existe. La canción no está en tu idioma. Lo sientes de todas formas.
Esa es la reacción bajo un clip que el creador Cia0 compartió en X el 19 de julio de 2026: quince segundos de un personaje cantando, anunciado como "canción que puedes sentir incluso sin entender una sola palabra". El pie de foto nombra toda la pila en una línea: Seedream 5.0 Pro para la imagen, Seedance 2.0 para el video, ejecutado en CapCut. Lo que lo vende es el trabajo de detalle. Los labios siguen la voz. El cabello se mueve como cabello. El rostro sostiene una emoción en lugar de una pose.
Esta guía reconstruye ese pipeline paso a paso: qué modelo hace qué, los prompts que transportan la emoción en el traspaso de imagen a video, y lo que realmente cuesta un MV terminado.

Conclusiones clave
- El flujo de trabajo es primero la imagen: diseñar un keyframe en Seedream 5.0 Pro por $0.045, luego pagar las tarifas de video solo cuando el look está fijado. Arreglar una cara en la imagen fija cuesta aproximadamente una vigésima parte de lo que costaría repetir el clip.
- Seedance 2.0 imagen a video acepta un primer fotograma más un fotograma final opcional, genera de 4 a 15 segundos por ejecución con audio nativo, y puede devolver su fotograma final para que el siguiente clip continúe la toma.
- El sincronizado de labios de un personaje con tu propia pista usa el endpoint de referencia a video: hasta 9 imágenes, 3 videos y 3 clips de audio como referencias, con menciones @ en el prompt.
- Un MV vertical de 40 segundos a 720p cuesta alrededor de $10 a las tarifas con descuento de julio de 2026, siendo tu banda sonora el único costo no contabilizado.
Los MV de Seedream + Seedance que vale la pena copiar
Tres publicaciones en dos días, más una prueba de sincronizado de labios anterior, esbozan todo el territorio que cubre esta combinación. Ninguno es un demo de laboratorio. Cada uno nombra sus herramientas.
| Creador | Publicado | Qué muestra el clip | Cadena de herramientas |
|---|---|---|---|
| @Cia0_exe | 19 jul 2026 | 15 s de interpretación de balada: sincronizado de labios, física del cabello, una emoción sostenida | Seedream 5.0 Pro + Seedance 2.0, en CapCut según el pie de foto |
| @Cia0_exe | 20 jul 2026 | 15 s de "acción anime 2.5D en su punto máximo", del tipo que "los estudios tardan años" en lanzar | El mismo par de modelos, ejecutado en una app de terceros |
| @tjb_shizuka | 20 jul 2026 | 30 s de meme de viaje "warp de gotero" ambientado en un lago suizo, con invitación abierta a copiar el formato | Imágenes fijas de Seedream, movimiento de Seedance 2.0, banda sonora de Mureka V9, edición en OpenShot |
| @CuriousRefuge | 5 may 2026 | Pruebas de sincronizado de labios con múltiples hablantes en acción real y animación | Imagen de referencia, archivo de audio, prompt de cámara y diálogo |

Dos cosas se repiten en las cuatro. Primero, el modelo de imagen y el modelo de video se tratan como trabajos separados: el casting ocurre en Seedream, la actuación en Seedance. Segundo, el modelo de video es solo el medio de la pila. Cada pie de foto nombra lo que lo rodea: la app en la que se ejecutó, una fuente de banda sonora, un editor para el corte. Ambas publicaciones de Cia0 prometen el prompt "en chino" en las respuestas, y la publicación japonesa detalla su línea de ensamblaje de cuatro herramientas en el propio pie de foto.
Por qué el flujo de trabajo primero Seedream supera al texto a video puro
Seedance 2.0 tiene un modo de texto a video perfectamente funcional. Las personas que hacen los clips de arriba lo omiten, y la razón es aritmética más control.
En Atlas Cloud, una imagen fija de Seedream 5.0 Pro cuesta $0.045. Un clip de 5 segundos a 720p de Seedance 2.0 cuesta aproximadamente $0.97 con el descuento actual. Cada cara equivocada, atuendo incorrecto o encuadre fallido que detectes en la etapa de imagen fija cuesta una imagen fija arreglarlo. Cada uno que detectes en la etapa de video cuesta una repetición completa a aproximadamente 20 veces el precio, más la espera.
| Texto a video directo | Keyframe de Seedream primero | |
|---|---|---|
| Costo de arreglar una mala cara | ≈$0.97 por repetición de 5 s | $0.045 por imagen fija |
| Consistencia del casting entre tomas | Nueva tirada de dados por clip | Mismo bloque de personaje, misma cara |
| Control de encuadre | Prompt y esperanza | Apruebas la composición exacta primero |
| Dónde aparecen los errores | En el paso caro | En el paso barato |
El punto de consistencia es lo que más importa para un MV. Un video musical vuelve a la misma cara ocho o diez veces. El texto a video reinventa el personaje en cada generación. Un pipeline de keyframe mantiene la identidad de dos maneras: reutiliza la imagen fija aprobada como primer fotograma de cada clip, o alimenta las mismas imágenes de referencia a cada generación. Diseñas una vez, luego gastas dinero de video animando una decisión que ya te gusta.
Ejecutar el flujo de trabajo Seedream + Seedance en Atlas Cloud
Ambas mitades del pipeline se ejecutan en un solo lugar. Atlas Cloud aloja toda la familia de modelos ByteDance, por lo que Seedream 5.0 Pro (APIs públicas desde el 8 de julio de 2026) y Seedance 2.0 (lanzado el 12 de febrero de 2026) están detrás de la misma cuenta, los mismos créditos y la misma forma de API. Hay dos formas de trabajar: hacer clic en los playgrounds, o encadenar los endpoints en código.
Método 1: Genera tus tomas de MV en el Playground
Paso 1: Haz el casting de tu personaje en Seedream. Abre el playground de Seedream 5.0 Pro y escribe el prompt del keyframe (una receta completa está dos secciones más abajo). Haz coincidir la relación de aspecto con tu formato de entrega ahora: 9:16 para Shorts y TikTok, 16:9 para YouTube. Cada ejecución devuelve una imagen a $0.045, así que itera hasta que la cara, el vestuario y la luz sean exactamente correctos.

Paso 2: Carga la imagen fija en Seedance. Abre el playground de Seedance 2.0 imagen a video. El formulario toma una imagen obligatoria, tu keyframe aprobado, más una imagen de fotograma final opcional si quieres que la toma termine en una composición específica.
Paso 3: Escribe el prompt de movimiento y configura el clip. La duración va de 4 a 15 segundos, o Auto para dejar que el modelo elija. Elige la relación que coincida con tu keyframe, o déjala en Auto. La resolución predeterminada es 720p.
Paso 4: Revisa tres interruptores. "Generar audio" le da al clip sonido nativo. "Marca de agua" permanece desactivado para masters limpios. "Devolver último fotograma" te entrega el fotograma de cierre como una imagen separada; reintrodúcela como primer fotograma de la siguiente generación y el nuevo clip continúa donde este se detuvo. Ese interruptor es la diferencia entre cuatro clips desconectados y una actuación continua.
Paso 5: Lee el precio, luego ejecuta. El botón Ejecutar muestra el costo de tus configuraciones exactas antes de que te comprometas. Al 21 de julio de 2026, un clip de 5 segundos a 720p muestra ≈$0.97 con el descuento por tiempo limitado del 20% de la plataforma aplicado (≈$1.21 a precio de lista).
Método 2: Encadena Seedream y Seedance a través de una sola API
Paso 1: Obtén tu clave API. Crea una clave en la consola de Atlas Cloud y expórtala como variable de entorno. Mantenla fuera del código del cliente.


Paso 2: Revisa la documentación de la API. Los endpoints, parámetros y comportamiento de polling viven en la documentación de la API. Todo el pipeline son dos ciclos de envío y polling.
Paso 3: Haz las dos llamadas. Primero el keyframe:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateImage \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedream-v5.0-pro/text-to-image", 6 "prompt": "<tu prompt de keyframe>", 7 "size": "1152*2048" 8 }'
Haz polling a GET /api/v1/model/prediction/ hasta que el trabajo se complete, toma la URL de la imagen alojada del resultado, y pásala directamente a la llamada de video:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedance-2.0/image-to-video", 6 "prompt": "<prompt de movimiento y actuación>", 7 "image": "<URL de salida de Seedream>", 8 "duration": 10, 9 "resolution": "720p", 10 "ratio": "adaptive", 11 "generate_audio": true, 12 "return_last_frame": true 13 }'
image acepta una URL, Base64 o una referencia de activo, y duration acepta -1 para dejar que el modelo elija. watermark por defecto es false. Con return_last_frame configurado, la predicción completada incluye el fotograma final como una imagen, por lo que un script puede hacer un bucle: generar clip, tomar el último fotograma, enviar el siguiente clip. Ese bucle es todo el pipeline de MV en unas treinta líneas.
Ambas llamadas usan la misma URL base, el mismo encabezado bearer y el mismo polling de predicción. Esa es la ventaja práctica del diseño de una sola API: tu integración de Seedream y tu integración de Seedance difieren por una cadena de modelo y un par de campos, y el próximo lanzamiento de ByteDance encajará en el mismo código.
Receta de prompt de Seedream 5.0 Pro para keyframes de MV
Un keyframe de MV es una decisión de casting, por lo que el primer trabajo del prompt es definir una persona que puedas convocar de nuevo. El patrón de trabajo es un bloque de personaje: una oración, de 40 a 60 palabras, que fija cara, cabello y vestuario. Se reutiliza textualmente en cada prompt de keyframe del proyecto. Cambia una palabra y corres el riesgo de elegir a un extraño.
Aquí hay un prompt de keyframe completo en ese patrón:
Una mujer joven con cabello negro hasta la cintura, rasgos suaves y redondeados, y pendientes de gota de plata, vistiendo un suéter de punto color crema de talla grande. Está sola en una azotea mojada por la lluvia al anochecer, encuadrada de hombros para arriba a la altura de los ojos. Sus ojos están brillantes, labios entreabiertos como si fuera a cantar, mirada justo más allá de la cámara. Resplandor azul de ciudad fría detrás de ella, una luz cálida de borde en su mejilla, poca profundidad de campo, fotograma de película cinematográfica, grano suave, 9:16.
La primera oración es el bloque de personaje. Todo lo que sigue cambia por toma. Un MV necesita un pequeño conjunto de cobertura, no una imagen:
| Toma | Propósito | Qué cambia en el prompt | Qué se mantiene fijo |
|---|---|---|---|
| Plano general | Establecer el lugar y el ambiente | Detalle de ubicación, encuadre de cuerpo completo | Bloque de personaje, dirección de luz |
| Plano medio | Actuación del verso | "Encuadrado de cintura para arriba", un gesto | Bloque de personaje |
| Primer plano | Pico emocional del estribillo | "De hombros para arriba", las señales faciales | Bloque de personaje |
Dos notas específicas de Seedream. Escribe la emoción como evidencia física, no como etiqueta: "ojos brillantes, mandíbula apretada, una respiración contenida" se anima después, mientras que "triste" se aplana en una expresión estándar. Y establece la relación de aspecto en el selector de tamaño, no solo en prosa, porque el parámetro gana. Para la anatomía más profunda del prompt, incluidos patrones de exclusión y los bugs conocidos del modelo, consulta nuestra guía de prompts para Seedream 5.0 Pro.
Prompts de Seedance 2.0 para sincronizado de labios, física y emoción
El keyframe entrega a Seedance 2.0 una cara que vale la pena animar. El prompt de movimiento decide si el clip actúa o solo se mueve. Seedance 2.0 genera audio de doble canal de forma nativa y sincroniza los labios a nivel de fonema en ocho o más idiomas, según el post de lanzamiento de ByteDance, por lo que el trabajo del prompt es decirle qué se está interpretando, por quién y cómo lo trata la cámara.
Hay dos rutas para un personaje que canta.
Ruta A, canción generada: quédate en imagen a video, activa "generar audio" y describe la voz en el prompt. El modelo inventa la música y sincroniza los labios con su propia pista. Este es el camino más rápido a un clip de actuación estilo Cia0.
Ruta B, tu propia pista: cambia a referencia a video, que acepta hasta 9 imágenes de referencia, 3 videos y 3 clips de audio por ejecución. Sube tu sección de canción como referencia de audio, añade tu keyframe como referencia de imagen, y menciónalo con @ en el prompt para vincular el personaje a la acción. Esta es la receta que Curious Refuge validó en mayo para sincronizado de labios con múltiples hablantes: "una imagen de referencia", "un video en negro con audio o un archivo de audio", y "un prompt (movimiento de cámara + VO/diálogo)". Recorta el audio a la longitud de tu clip antes de subirlo; los tokens facturados cuentan la duración de entrada más la duración de salida, por lo que el relleno cuesta dinero real.

Las señales que separan una actuación de un protector de pantalla:
| Lo que quieres | Señal de prompt que funciona | Por qué funciona |
|---|---|---|
| Sincronizado de labios legible | Nombra el idioma y el estilo vocal: "ella canta una balada lenta en mandarín, voz suave y con aliento" | El sincronizado a nivel de fonema necesita saber qué se está cantando |
| Física del cabello y la tela | Dale una causa a la fuerza: "una ráfaga de viento levanta su cabello, el suéter se ondula" | La física sigue las fuerzas declaradas, no los adjetivos |
| Emoción visible | Señales físicas con tiempo: "sus ojos se cierran en la nota sostenida, una lágrima solitaria en la comisura exterior" | Los modelos animan acciones mucho mejor que los estados de ánimo |
| Sensación de cámara | Un movimiento por clip: "acercamiento lento de plano medio a primer plano" | Los movimientos de cámara apilados compiten entre sí en 15 segundos |
| Drama de múltiples tomas | Describe la secuencia en orden: "abrir en el horizonte, cortar a su cara cuando entra la voz" | Seedance 2.0 maneja secuencias de múltiples tomas de forma nativa en una sola ejecución |
Cualquier cosa de más de 15 segundos es un trabajo de encadenamiento: el truco de devolver el último fotograma de la sección de configuración, con la siguiente línea de la canción en cada nuevo prompt. Mantén la redacción del bloque de personaje de tus prompts de Seedream también dentro de los prompts de movimiento. La redundancia es un seguro barato para la identidad.
De los clips de Seedance a un MV terminado: Edición y presupuesto
La publicación japonesa del "warp de gotero" es la imagen más clara de la etapa de finalización, porque el creador enumera toda la línea de ensamblaje en el pie de foto: Seedream para las imágenes fijas, Seedance 2.0 para el movimiento, Mureka V9 para la banda sonora y OpenShot, un editor de escritorio gratuito, para el corte. El clip de Cia0 nombra a CapCut como su plataforma en su lugar. Cualquier editor que elijas, el corte es el mismo trabajo: coloca la pista completa primero, recorta los clips en el ritmo y mantén una relación de aspecto de principio a fin.

Una nota sobre esa ruta de CapCut. Dentro de CapCut, Seedance 2.0 se ejecuta como Dreamina Seedance 2.0, disponible en EE. UU. desde el 7 de abril de 2026, y según el propio anuncio de CapCut, viene con restricciones que incluyen bloquear la generación de video a partir de imágenes que contengan rostros reales, además de una marca de agua visible en la salida. Bueno para memes, limitante para masters limpios de MV. La ruta de API y playground deja la marca de agua desactivada por defecto y acepta cualquier keyframe que hayas generado.
Lo que cuesta todo, a las tarifas con descuento de julio de 2026 en Atlas Cloud:
| Etapa | Modelo o herramienta | Volumen | Costo |
|---|---|---|---|
| Keyframes | Seedream 5.0 Pro | 10 imágenes fijas a $0.045 | $0.45 |
| Borradores de movimiento | Seedance 2.0 Mini imagen a video | 4 clips × 10 s a $0.045/s | $1.80 |
| Clips finales | Seedance 2.0 imagen a video, 720p | 4 clips × 10 s a ≈$0.1935/s | ≈$7.74 |
| Banda sonora | Tu propia pista, o un modelo de música IA | 1 canción | varía |
| Edición | CapCut o OpenShot | 1 sesión | $0 |
| Total | ~40 s de MV terminado | ≈$10 |
La línea de borradores es la que la gente se salta y no debería. Seedance 2.0 Mini ejecuta el mismo flujo de trabajo de primer fotograma más prompt desde $0.045 por segundo (lista $0.056), aproximadamente una cuarta parte de la tarifa de 720p del modelo insignia, por lo que el bloqueo, los movimientos de cámara y la física se depuran a bajo costo antes de la renderización final. Sin el descuento, el mismo presupuesto ronda los $12.40 a precios de lista, aún menos que la mayoría de las suscripciones de metraje de archivo que cobran por un mes.
Preguntas frecuentes
¿Puede Seedance 2.0 sincronizar los labios de un personaje con mi propia canción?
Sí. Usa el endpoint de referencia a video, que toma hasta 3 clips de audio junto con 9 imágenes y 3 videos por generación. Sube la sección de la canción como referencia de audio, añade tu keyframe de Seedream como referencia de imagen, menciónalo con @ en el prompt y describe la actuación y la cámara. Recorta el audio a la longitud del clip primero, ya que los tokens facturados cuentan la duración de entrada más la de salida.
¿Los prompts de Seedream y Seedance tienen que estar en chino?
No. Cia0 comparte prompts en chino, y la cultura de prompts en chino alrededor de los modelos de ByteDance es fuerte, pero ambos modelos aceptan prompts en inglés, y el sincronizado de labios de Seedance 2.0 funciona a nivel de fonema en ocho o más idiomas. Lo que importa es nombrar el idioma de la voz en el prompt para que las formas de la boca coincidan con la pista.
¿Cuánto tiempo puede durar una sola generación de Seedance 2.0?
De 4 a 15 segundos por ejecución, con secuencias de múltiples tomas compatibles dentro de esa ventana, o establece la duración en -1 y el modelo elige. Para un MV completo, encadena generaciones: activa "devolver último fotograma" y comienza el siguiente clip desde el fotograma de cierre del clip anterior para que la actuación sea continua.
¿Mis clips de MV tendrán una marca de agua?
No por defecto en la API o el playground: el parámetro watermark viene como false, por lo que los masters salen limpios. La versión para consumidores de CapCut es diferente. Dreamina Seedance 2.0 aplica una marca de agua visible y bloquea la generación a partir de imágenes con rostros reales, parte del paquete de salvaguardas con el que se relanzó en 2026.
¿Cuánto cuesta un MV completo de Seedream + Seedance?
Alrededor de $10 por un video vertical de 40 segundos a 720p a las tarifas con descuento de julio de 2026: $0.45 en keyframes, $1.80 en borradores Mini y aproximadamente $7.74 en clips finales a 720p, con edición gratuita en CapCut u OpenShot. A precios de lista, la misma ejecución cuesta alrededor de $12.40. La etapa de keyframe es lo que mantiene ese número tan bajo, porque las decisiones de apariencia se toman a $0.045 en lugar de ≈$0.97 por repetición.
Conclusión
Los clips que circulan este mes no son el trabajo de una función secreta. Son una división del trabajo: Seedream 5.0 Pro decide quién está en pantalla y cómo se siente el encuadre, Seedance 2.0 decide cómo se mueven y suenan, y un editor gratuito convierte los clips en una canción con un rostro. Cada paso es inspeccionable, y cada error se detecta en el lugar más barato posible.
Roba el orden de operaciones. Bloquea un personaje, compra tus errores a $0.045, anima solo lo que ya has aprobado y deja que el último fotograma de un clip abra el siguiente. Las herramientas son nuevas. La disciplina es solo cinematografía.






