Un clip de 30 segundos le da a tu prompt treinta oportunidades para desmoronarse. Seedance 2.5 se lanzó oficialmente el 31 de julio de 2026, implementándose primero en Jimeng AI y el nivel profesional de Doubao, con acceso API en Volcano Ark próximamente. La duración de salida duplicada, un límite de 50 activos de referencia y un control de edición más preciso recompensan una habilidad por encima de todas las demás: escribir prompts como una lista de tomas, donde cada archivo de referencia tiene un trabajo con nombre.

La buena noticia para quienes aprendieron Seedance 2.0: la gramática no cambió. Seedance 2.5 mantiene la misma división de tareas en tres vías (referencia, edición, extensión) que definió a Seedance 2.0. Lo que cambió es cuánto material puedes alimentarle y durante cuánto tiempo el modelo debe mantenerse coherente. Esta guía explica ambos aspectos.
Conclusiones clave
- Seedance 2.5 genera hasta 30 segundos en una sola pasada y acepta hasta 50 activos de referencia por trabajo: 30 imágenes, 10 clips de video, 10 clips de audio.
- La estructura central del prompt se hereda de Seedance 2.0: define sujetos, escribe tomas numeradas, envuelve el diálogo entre {}, y cierra con palabras de calidad y restricción.
- Los prompts de edición siguen una regla estricta: usa "referencia @video1" solo cuando quieras tomar prestadas características. Para ediciones, nombra el video directamente, o el modelo podría malinterpretar tu edición como un trabajo de referencia.
- Seedance 2.5 aún no estaba listado en Atlas Cloud en el momento del lanzamiento. La misma gramática de referencia se ejecuta hoy en la familia Seedance 2.0 allí, desde aproximadamente $0.09 por segundo con el descuento del 20% vigente al 31 de julio de 2026.
Lo que Seedance 2.5 cambia para los escritores de prompts
Cuatro mejoras importan al teclado. La salida de una sola pasada pasa de 15 a 30 segundos. El límite de referencias se triplica a 50 activos. La edición se convierte en una tarea de prompt de primera clase con su propia gramática, cubierta en su propia sección de esta guía. Y la generación de diálogos ahora funciona de forma nativa en más de diez idiomas.

ByteDance llama a la salida de 30 segundos y al límite de 50 activos como primicias mundiales. Trátalo como un marco del vendedor más que como un punto de referencia establecido. Lo que realmente importa para la calidad de salida es direccional: la iluminación, el movimiento de cámara, la actuación y la legibilidad emocional mejoraron lo suficiente como para que la empresa ahora promocione trabajos de toma de calidad cinematográfica, con menos de ese brillo característico de la IA.
De todas formas, un hábito que conviene mantener: todo lo que esté por debajo del límite de 30 segundos sigue comportándose mejor cuando el prompt está estructurado. Un lienzo más largo amplifica la deriva en lugar de ocultarla.
Dónde practicar: ejecutar prompts de Seedance en Atlas Cloud
Al 31 de julio, Seedance 2.5 no había llegado a plataformas de terceros; se espera que el acceso API y el playground de Ark se abran por completo el 7 de agosto de 2026. El movimiento práctico esta semana: ensayar exactamente la misma gramática de referencia en la familia Seedance 2.0, que Atlas Cloud sirve a través de su familia de modelos Seedance con texto a video, imagen a video y el playground multimodal de referencia a video. La sintaxis @ sujeto, las ranuras de referencia, los verbos de edición: todo se transfiere.
El precio en el endpoint de referencia se basa en tokens, y la página del modelo indica las tarifas vigentes claramente: la salida a 720p se factura a $0.2419 por segundo, y los trabajos que incluyen una entrada de video bajan a $0.1486 por segundo a 720p. Los precios de entrada en toda la familia comienzan más bajos. Las tarjetas de texto a video listan desde ≈$0.112 por segundo, alrededor de $0.09 con el descuento del 20% vigente al 31 de julio de 2026. Seedance 2.0 Fast comienza alrededor de $0.072 por segundo con descuento, y la variante ligera Mini alrededor de $0.045. El descuento tiene un temporizador de cuenta regresiva, así que verifica los números actuales en la página del modelo antes de presupuestar un proyecto.
Método 1: El Playground de Seedance en Atlas Cloud
Inicia sesión, abre el playground de referencia a video, y puedes ejecutar todos los patrones de este artículo sin escribir código. Sube archivos de referencia a la izquierda, luego escribe @ en el cuadro de prompt para vincular un sujeto a una ranura de imagen, video o audio específica.

El ejemplo predeterminado en esa página merece ser leído como plantilla. Cada sustantivo importante está anclado a una @imagen, por lo que el modelo nunca adivina qué ciudad o qué robot quieres decir.
Método 2: Prompts de Seedance a través de la API de Atlas Cloud
Paso 1: Obtén una clave API. Crea una en la consola de Atlas Cloud y cópiala.


Paso 2: Consulta la documentación de la API. Los endpoints, parámetros y autenticación se encuentran en la documentación de la API.
Paso 3: Haz tu primera solicitud. El endpoint de referencia toma el prompt más arreglos paralelos para cada tipo de referencia:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedance-2.0/reference-to-video", 6 "prompt": "Define a la mujer en @image1 como Mara. Toma 1: plano de seguimiento medio, Mara camina por el mercado nocturno @image2, reflejos de neón en el pavimento mojado. <siseo de puestos de comida>", 7 "reference_images": ["https://your-cdn/mara-face-closeup.jpg", "https://your-cdn/night-market.jpg"], 8 "reference_videos": [], 9 "reference_audios": [], 10 "duration": -1, 11 "resolution": "720p", 12 "ratio": "16:9", 13 "generate_audio": true 14 }'
Establecer duration en -1 permite que el modelo elija una duración natural dentro del rango de 4 a 15 segundos de este endpoint. Consulta el ID de predicción devuelto hasta que se complete:
plaintext1curl https://api.atlascloud.ai/api/v1/model/prediction/<prediction_id> \ 2 -H "Authorization: Bearer $ATLASCLOUD_API_KEY"
La respuesta completa lleva la URL del video alojado. Debido a que Atlas Cloud ejecuta una API en toda la plataforma, cualquier endpoint de Seedance más nuevo que llegue se convierte en un cambio de una línea en la cadena del modelo. Tus arreglos de referencia, tu bucle de consulta y tus archivos de prompt permanecen intactos.
La fórmula del prompt de Seedance 2.5, heredada de Seedance 2.0
Piensa en el modelo como un director multimodal que lee tu texto, imágenes, video y audio, luego divide el trabajo en una capa espacial (lo que está en el encuadre) y una capa temporal (cómo cambia con el tiempo). Eso se traduce en una fórmula de seis ranuras, donde todo después de las dos primeras ranuras es opcional:
sujeto + acción o evento + escena y entorno + estilo visual + trabajo de cámara + sonido
La expansión de la era Seedance 2.0 (palabras de iluminación, palabras de calidad, una cola de restricción como "sin subtítulos, sin marca de agua") aún encaja dentro de esas ranuras, por lo que nada de lo aprendido se desperdicia. Una regla que vale la pena destacar: la configuración de generación como duración y resolución queda fuera del prompt por completo, pertenecen a los parámetros de la página o la API.
En la práctica, las seis ranuras se pliegan en cuatro líneas escribibles. Aquí está el ejemplo de la plantilla base, traducido:

Los sujetos van primero porque las referencias son inútiles hasta que el modelo sabe qué rostro quieres decir. Define cada sujeto una vez, con dos o tres características estables, luego reutiliza la etiqueta en todas partes.
- Define a la mujer en @image1 (vestido rojo, sombrero de paja) como Mara.
- Mara camina por el muelle al atardecer...

Tres reglas evitan que las definiciones se filtren. Dale a cada @referencia una descripción de trabajo inmediata, incluyendo lo que el modelo debe ignorar: "al estilo de @image1 para las características, el cabello y el delantal verde de la alfarera, no el fondo de la imagen". Usa un primer plano facial ajustado como su propia imagen, separado de tomas de cuerpo completo, un truco de la era Seedance 2.0 contra la deriva de identidad que sigue siendo igual de efectivo ahora. Y maneja las vistas de múltiples ángulos con cuidado: con cinco o menos sujetos, las imágenes de vista única o múltiple funcionan, pero más de cinco es mejor ceñirse a vistas únicas, dividir las hojas de ángulos en imágenes separadas y declararlas explícitamente ("estas cuatro imágenes definen la misma lámpara plegable; solo una lámpara aparece en el video").
El sonido y el texto tienen cada uno su propio envoltorio para que el modelo nunca confunda el diálogo con un título:
| Tipo de información | Envoltorio | Ejemplo |
|---|---|---|
| Diálogo | { } | Ella sonríe y dice {Definitivamente podemos hacerlo} |
| Música | ( ) | (suena rock alegre de fondo) |
| Efecto de sonido | < > | |
| Título en pantalla | 【 】 | 【Capítulo Uno: Partida】 |
Mantén cada línea de diálogo en un solo idioma y nombra el idioma antes de las llaves. Para el control de acento, hay un patrón dedicado: idioma, variante regional, entrega, hablante, luego la línea, como en "Idioma del diálogo: inglés americano natural y conversacional. La chica dice: {Pensé que no vendrías.}"
Cómo usar 50 ranuras de referencia en un prompt de Seedance 2.5
Cincuenta ranuras se dividen en 30 imágenes, 10 clips de video y 10 clips de audio. El tiempo de video y audio se presupuesta por separado: hasta 30 segundos de referencias de video y otros 30 segundos de audio, con cada clip de entre 2 y 30 segundos. Las imágenes pueden tener hasta 4K y 30 MB cada una, los videos hasta 4K y 200 MB, el audio 15 MB como mp3 o wav. La referencia solo de audio también funciona: puedes entregar al modelo solo una pista de audio y un prompt de texto. El número de ranuras se triplica con respecto a Seedance 2.0 y el metraje de referencia se duplica, y lo peor que puedes hacer con el espacio es llenarlo.

Mantén las referencias de sujeto de audio o video en cinco o menos (seis a diez si el trabajo lo requiere), y las imágenes de sujeto en ocho o menos (nueve a doce como máximo). Los clips individuales funcionan mejor de 5 a 10 segundos: menos de aproximadamente 2 segundos transmite muy poca identidad para fijarse, mientras que un clip completo de 30 segundos diluye las características que deseas copiar. Cuando la pila crece de todos modos, el orden de recorte recomendado son primero los personajes principales, luego los productos o accesorios clave, luego la escena, luego el estilo general.
Entonces, ¿para qué sirve el espacio adicional? Escenas de conjunto. Un ejemplo destacado temprano es una fiesta de palacio de 30 segundos construida a partir de 20 imágenes numeradas de personajes y accesorios más tres muestras de voz, cada invitado anclado a una @referencia. Su lista de exhibición funciona de la misma manera: escenas grupales de múltiples personajes, una secuencia wuxia de 32 referencias y transferencia de movimiento a un gorila trepador, todo se apoya en referencias apiladas de modalidad completa.
Las listas de tomas mantienen coherentes los prompts de 30 segundos de Seedance 2.5
El hábito más efectivo para mantener: deja de escribir textos de estado de ánimo, comienza a escribir tomas numeradas. "Un hombre corre por la calle, muy cinematográfico" no le da nada que programar a la capa temporal. Una lista de tomas sí lo hace:
plaintext1Define a la chica en @image1 como Lin. @image2 establece la escena del dormitorio. Referencia @video1 para el movimiento de cámara. 2Toma 1: plano de seguimiento medio, atardecer. Lin camina hacia la puerta del dormitorio, se detiene, respira hondo, ligeramente nerviosa. Luz cálida desde la ventana del pasillo. 3Toma 2: corte a un plano medio interior. Lin empuja la puerta. Las compañeras de cuarto levantan la vista de sus escritorios. Una pregunta {¿Y bien? ¿Pasaste?}. Cortes lentos de medio cuerpo entre los rostros. 4Toma 3: primer plano de Lin. Ella baja la cabeza, luego suelta una risa y dice {Les he engañado a todas}. Las compañeras la persiguen por la habitación. La cámara se aleja a un plano general de la habitación. 5Realismo documental, tonos cálidos, luz suave. Los rostros se mantienen estables. Sin subtítulos, sin marca de agua.

Ese ejemplo ilustra bien el patrón. Cada toma responde a las mismas cuatro preguntas:
| Línea en la toma | Qué escribir | Ejemplo de redacción |
|---|---|---|
| Cámara | un movimiento por toma para empezar, términos estándar | "zoom lento", "cámara fija", "corte a primer plano" |
| Acción | parte del cuerpo más velocidad o fuerza | "levanta lentamente la mano", "agarra la correa con fuerza" |
| Espacio | dónde está el sujeto ahora | "en la puerta del dormitorio", "cruzando la azotea" |
| Audio | diálogo, efectos o música para esta toma | {línea}, , (música) |
Dos reglas de escritura hacen el trabajo pesado. Cuantifica el movimiento (lentamente, bruscamente, ligeramente) y nombra la extremidad que lo ejecuta. Y externaliza la emoción en lugar de etiquetarla: "cabeza gacha, hombros temblando ligeramente, dedos retorciendo el dobladillo de su chaqueta" anima, mientras que "ella está triste" no lo hace. Una regla de la era Seedance 2.0 se ha relajado: la versión anterior limitaba cada toma a un solo movimiento de cámara, mientras que Seedance 2.5 maneja movimientos combinados (seguimiento más grúa más rotación en una sola toma larga de entrada de atleta) ejecutándose de manera estable. Empieza simple, combina cuando la toma lo merezca.
El tiempo es donde Seedance 2.5 se diferencia de su predecesor. Las indicaciones de segundos precisos solían desestabilizar las generaciones en Seedance 2.0. Esa limitación ha desaparecido: los prompts de Seedance 2.5 tienen códigos de tiempo en toda su extensión: una secuencia wuxia escrita como segmentos [0-3s], [3-5s], [5-10s], un explicador de formación lunar guionizado segundo a segundo contra su narración. El orden de las tomas aún lleva la historia; los rangos de segundos ahora te permiten fijar dónde cae un ritmo dentro del lapso de 30 segundos. Así es como ese prompt wuxia gasta su línea de tiempo:

Prompts de edición de Seedance 2.5: cambia una cosa, mantén el resto
La edición es donde la redacción es menos indulgente, porque un verbo decide el tipo de tarea. La regla es explícita: escribe "referencia @video1" solo cuando quieras tomar prestadas características en un video nuevo. Cuando quieras modificar el clip en sí, nómbralo directamente ("@video1", "editar estrictamente @video1"), o el modelo podría malinterpretar el trabajo como una tarea de referencia y regenerar toda la escena.
Los buenos prompts de edición se comprimen en tres movimientos: apunta a la fuente con @video1, delimita exactamente qué cambia (agrega una imagen de referencia si se está intercambiando un sujeto) y cierra con una línea de bloqueo como "todo lo demás permanece igual" para que el modelo no repinte lo que nunca mencionaste. Dos parámetros están fuera de tu control aquí: un clip editado conserva la relación de aspecto de la fuente y aproximadamente su duración. Las extensiones también heredan la relación de aspecto, pero su duración adicional es tuya para establecer en el prompt ("extender por 6 segundos").
| Operación | Patrón de oración | ¿Mantiene estable el resto? |
|---|---|---|
| Añadir | describe el nuevo elemento, cuándo aparece, dónde aparece | sí, las partes no mencionadas permanecen intactas por defecto |
| Reemplazar | "Editar estrictamente @video1, cambiar [característica antigua] por [característica nueva]" | sí, pero indica explícitamente los elementos clave que deben mantenerse |
| Eliminar | nombra el elemento a eliminar, luego nombra lo que debe permanecer | reforzar los elementos mantenidos ayuda notablemente |
| Extender | "Extender @video1 hacia atrás/adelante: [lo que sucede después]" | el estilo, los sujetos, la historia deben nombrarse como constantes |
| Re-puntuar | "Mantener la imagen y la cámara de @video1 sin cambios, reemplazar la música de fondo con @audio1" | las ediciones de audio dejan cada fotograma intacto |
| Puente | "@video1, [descripción de transición], luego @video2" | Seedance 2.0 limita las entradas de video a 3 clips, 15 segundos en total; el límite de Seedance 2.5 sube a 10 clips, 30 segundos |
Se admiten tanto el direccionamiento de marcas de tiempo como las ediciones guiadas por referencia ("reemplazar la escena de 0:02 a 0:05 en @video1, mantener la acción y el ritmo"); junto con intercambios de pantalla verde y cambios de perspectiva de cámara adicionales. La exhibición va más allá de lo que la mayoría necesitará: re-iluminar una escena terminada ("cambiar la luz de @video1 de luz cenital fuerte del mediodía a luz lateral de atardecer"), envejecer a una actriz de sus veinte a sesenta años en una toma ininterrumpida, ciclar un clip a través de estilos manga, anime y tinta lavada, y cambiar en lote una botella de bebida en tres colores de SKU, todo archivado bajo edición, sin regeneración completa.
Dos trucos de reparación de la era Seedance 2.0 siguen siendo útiles mientras el comportamiento de Seedance 2.5 se estabiliza. Si un clip extendido salta en la unión, recorta seis fotogramas del final del primer segmento y uno del comienzo del segundo antes de unir. Y si las pasadas de extensión repetidas degradan la calidad de la imagen, una solución alternativa es convertir la fuente en un render de modelo 3D blanco primero, luego extender desde esa base limpia.
Lo que Seedance 2.5 puede hacer en todas las industrias
Lo que ha surgido es una galería de casos de uso clara: cinco industrias cruzadas con las cuatro capacidades principales, cada celda respaldada por un prompt trabajado y un clip terminado. El mapa, condensado:
| Ámbito | Trabajos emblemáticos |
|---|---|
| Cine | un latido completo de la historia en una sola toma de 30 segundos, escenas de conjunto a partir de activos de actores apilados, eliminación de andamios de cables, un corte maestro re-doblado en varios idiomas |
| Publicidad, comercio electrónico | narración de TVC en una sola toma, aspecto del producto bloqueado contra activos de marca, reescritura de etiquetas de precio, intercambios de presentador para mercados de exportación |
| Educación | un concepto explicado en 30 segundos, visualizaciones de principios, un personaje anfitrión consistente en una serie, entrega multilingüe |
| Industrial | recorridos de ensamblaje, vistas previas de productos en modelo 3D blanco, intercambios de placas de identificación en líneas de productos, capacitación en seguridad en varios idiomas |
| IP de entretenimiento | avances de estilo de juego, actuaciones de ídolos virtuales, videos de aspectos festivos, anclas virtuales multilingües |
El más silencioso primero: una historia sin diálogo de 30 segundos contada en un solo párrafo, sin números de toma, llevada enteramente por la descripción de la escena y el sonido ambiental:
plaintext1Una historia visual sin palabras de 30 segundos con la tranquila elegancia de la Francia rural, en una tarde de verano en Provenza. Una joven con un vestido de lino blanco roto termina una carta escrita a mano en una vieja mesa de madera dentro de una cabaña de piedra, sale, sigue un camino de grava a través de un campo de girasoles y desliza la carta en un buzón amarillo vintage al borde del pueblo. La cámara se abre con un primer plano de enfoque superficial del escritorio, pasa por la puerta mientras la luz da paso a la sombra, luego se eleva y se aleja hacia un plano general del valle dorado. Solo sonido ambiental: cigarras, viento, el rasguño de la pluma sobre el papel, el suave clic del buzón al cerrarse.

Cuando una pieza se apoya en un solo estado de ánimo continuo, el andamio de tomas numeradas desaparece. Ambos patrones son válidos.
La galería de publicidad muestra el pipeline de un solo maestro en dos etapas. El maestro es un anuncio de 12 segundos con un portavoz guionizado con latidos de diálogo por segundo. Cada versión localizada es entonces una sola línea de edición:
plaintext1Cambia el presentador por una mujer estadounidense, vuelve a doblar el texto en inglés. 2Cambia el presentador por un hombre español, vuelve a doblar el texto en español. 3Cambia el presentador por una mujer indonesia, vuelve a doblar el texto en indonesio.

La fila de educación fusiona las dos técnicas que esta guía cubrió por separado: un documental de museo de 30 segundos donde un guía recorre cuatro galerías y habla inglés, mandarín, malayo y luego japonés, cada segmento anclado a una ventana de 7.5 segundos. Y los prompts de drones FPV industriales actualizan la cola de restricción de la sección de fórmula más allá del texto estándar: cierran con restricciones de movimiento y escena, líneas como "sin texto ni marcadores en pantalla, no volar hacia atrás, el clima y la iluminación se mantienen constantes."
Preguntas frecuentes
¿Seedance 2.5 ya está disponible a través de una API?
Aún no en el lanzamiento. El despliegue del 31 de julio cubre primero las propias aplicaciones de ByteDance, Jimeng AI y el nivel profesional de Doubao entre ellas. El acceso API y el playground de Ark se abrirán por completo el 7 de agosto de 2026, con dos detalles de acceso que vale la pena señalar: sin cuota gratuita, y la activación requiere un saldo de cuenta superior a 200 RMB o un paquete de recursos activo de Seedance 2.0. La familia Seedance 2.0 sigue siendo completamente servida a través de la API mientras tanto.
¿Los prompts de Seedance 2.0 todavía funcionan en Seedance 2.5?
La estructura se transfiere: las definiciones de sujeto, las referencias @, las tomas numeradas, los envoltorios de diálogo y sonido, y la división de tareas referencia/edición/extensión se transfieren sin cambios a Seedance 2.5. Lo que debes volver a probar son las soluciones antiguas, ya que varios puntos débiles de Seedance 2.0 (pasadas únicas cortas, control de edición tosco, indicaciones de tiempo inestables) son exactamente lo que Seedance 2.5 afirma solucionar.
¿Cuántos archivos de referencia puede incluir un prompt de Seedance 2.5?
Hasta 50 por trabajo: 30 imágenes, 10 clips de video y 10 clips de audio. Las referencias de video suman hasta 30 segundos, el audio otros 30, y cada clip dura de 2 a 30 segundos. El presupuesto completo está destinado a repartos de conjunto y escenas con muchas referencias; la sección de ranuras de referencia anterior cubre los límites de proporción recomendados para trabajos cotidianos.
¿Puede Seedance 2.5 generar diálogos en idiomas distintos del inglés o chino?
Sí. Los idiomas compatibles de forma nativa incluyen chino, inglés, español, indonesio, malayo, tailandés, árabe, portugués, vietnamita, japonés y coreano entre sus idiomas nativos, y promueve una distribución de un maestro, muchos idiomas: su demo de avance vuelve a doblar el mismo corte al japonés y al francés con un prompt de edición de una línea. Etiqueta el idioma antes de cada línea de diálogo; el patrón de acento de la sección de fórmula se aplica sin cambios.
¿Cuánto tiempo puede durar un video de Seedance 2.5?
Treinta segundos en una sola pasada, con extensión de múltiples rondas disponible además para cortes más largos. No confundas esto con los límites de 30 segundos en los clips de referencia; esos presupuestan tus entradas, no la salida.
Conclusión
El lenguaje del prompt es la parte estable. Sujetos definidos una vez y referenciados con @, tomas numeradas en orden, diálogo entre llaves, restricciones al final: esa gramática escribió clips de 15 segundos en febrero y escribe clips de 30 segundos ahora. Lo que cambió son los límites a su alrededor. Practica la gramática en los endpoints de Seedance 2.0 hoy, mantén tus conjuntos de referencia pequeños y con nombre, y una vez que Seedance 2.5 se abra a través de la API, migrar tus prompts debería ser el paso fácil.






