Seedance 2.5 ya está disponible — Primero en Atlas Cloud

Wan 3.0 vs Seedance 2.5 Native 30s: Ambos dicen 30 segundos, solo uno es realmente 1080p

Wan 3.0 vs Seedance 2.5 nativo de 30 segundos, comparados con los prompts de demostración propios de Alibaba: cuál renderiza píxeles reales 1080p, cuál hace upscaling, y cuál puedes ejecutar hoy.

Dos monitores mostrando una escena del oeste junto a storyboards

Dos monitores de edición lado a lado reproduciendo la misma toma de una gasolinera en el desierto, uno con una línea de tiempo ininterrumpida de 30 segundos debajo y otro con una línea de tiempo dividida en dos segmentos

En el segundo 20, la boquilla del combustible rocía hierba fresca y verde. Todavía perlada de agua. El caballo entrecierra los ojos con placer. El palillo del empleado se le cae de la boca.

Ese chiste solo funciona dentro de una toma continua de 30 segundos. Corta cuatro clips de 8 segundos juntos y el caballo cambia de pelaje, las gafas de sol cambian de forma, el cielo se desplaza un punto más cálido y el remate muere en algún lugar entre las costuras.

Así que cuando Wan 3.0 y Seedance 2.5 llegaron ambos en la misma ventana afirmando tener 30 segundos nativos, una sola pasada, sin costuras, dejó de ser una historia de referencia. Se convirtió en la primera vez que un modelo de video de IA podía sostener una introducción, un giro y un remate en una sola toma.

Analicé las especificaciones, comparé con los archivos demo publicados por el propio Alibaba y encontré lo que nadie que escribe sobre esto ha impreso: ambos modelos dicen 30 segundos, pero la resolución debajo de esos 30 segundos no es el mismo producto en absoluto.

Conclusiones clave

  1. Ambos modelos realmente generan 30 segundos en una sola pasada. Esa parte no es marketing. Wan 3.0 cubre de 2 a 30 segundos con una opción de duración inteligente, Seedance 2.5 cubre de 4 a 30 segundos.
  2. Solo Wan 3.0 renderiza 1080p nativo a 30 segundos. Seedance 2.5 genera de forma nativa solo a 480p y 720p. Sus opciones de 1080p, 1440p y 4K son ampliaciones posteriores a la generación de una fuente de 720p, y su propia documentación de API dice que el nivel 4K "no es generación 4K nativa".
  3. Seedance 2.5 gana en volumen de referencia: hasta 30 imágenes más 10 videos más 10 archivos de audio, 50 en total. El manual del creador de Wan 3.0 limita las referencias a 20.
  4. Wan 3.0 tiene una entrada que nadie más tiene: archivos .doc, .xls, .ppt, .pdf, .txt y páginas web en vivo, alimentados directamente como referencias creativas.
  5. Solo uno de los dos es realmente ejecutable fuera de Alibaba hoy. Wan 3.0 está en beta pública en Alibaba Cloud Model Studio y Qwen Cloud, con acceso API de terceros aún en implementación. Seedance 2.5 está activo en Atlas Cloud con 30 en el control de duración ahora mismo.
  6. ¿Quieres probar la estructura narrativa de 30 segundos antes de pagar un solo segundo? El generador gratuito de anuncios AI skit de Atlas Cloud te da una ejecución gratuita: un spot terminado de 15 segundos con diálogo hablado y efectos de sonido, descarga sin marca de agua.
Invalid YouTube video ID

Demo oficial de Wan 3.0 de Alibaba, del manual del creador de Tongyi Wan 3.0. Una toma, sin cortes, 30.07 segundos. Medido con ffprobe: 1920x1072, 24fps, audio AAC estéreo incorporado. Activa el sonido para el movimiento de la cola y el palillo golpeando el suelo en el segundo 29. Se utiliza aquí como material de referencia para comparación y comentario únicamente.

Wan 3.0 vs Seedance 2.5 Nativo 30s: Qué cambió realmente este mes

Quince segundos fue el muro durante mucho tiempo. Wan 2.7 termina ahí. Seedance 2.0 terminó ahí. Cada "película de IA de un minuto" que viste en tu feed durante el último año eran de cuatro a ocho clips pegados en un NLE, con un pase de colorista para ocultar las uniones.

Dos cosas rompieron ese muro en las mismas semanas. Alibaba abrió la beta pública de Wan 3.0 el 6 de agosto de 2026 con generación nativa de 30 segundos y entrada de referencia multimodal completa (AlphaSignal, agosto de 2026). ByteDance duplicó Seedance de 15 a 30 segundos en 2.5, posicionándolo explícitamente como una forma de reducir el empalme de clips y la deriva visual que conlleva.

Nativo importa aquí en un sentido técnico específico. Significa una sola pasada hacia adelante sobre una secuencia latente, no una extensión del último fotograma donde el modelo toma el fotograma final del clip A y comienza el clip B a partir de él. La extensión es la razón por la que el cuello de la chaqueta de tu personaje cambia silenciosamente de forma entre tomas. Una pasada nativa tiene los 30 segundos completos en el mismo contexto, por lo que el caballo sigue siendo el mismo caballo.

La demo de la gasolinera es la prueba más limpia posible de eso. La estructura es de cuatro tiempos: de 0 a 8 segundos sin que pase nada, de 8 a 16 segundos de algo extraño sucediendo, de 16 a 24 segundos para el remate, de 24 a 30 segundos para la retirada. El chiste aterriza en el segundo 20. Lo que significa que solo aterriza si el caballo, las gafas de sol, la gradación teal-and-orange y la cámara fija inexpresiva sobreviven intactos los primeros 19 segundos. El empalme no puede hacer eso. No porque el editor sea malo, sino porque el clip B nunca vio al clip A.

Wan 3.0 vs Seedance 2.5 Nativo 30s: Donde la imagen realmente se rompe

Treinta segundos es el doble de quince. El riesgo de deriva no es el doble, es peor, y se mueve a un modo de fallo diferente.

Los fallos del flujo de trabajo empalmado estaban entre clips. Los fallos de 30s nativos están dentro del clip. En una producción práctica de cortometraje con Seedance 2.5, el revisor encontró decoherencia y morphing manifestándose como "picos visuales o inestabilidad en los modelos de personajes", concentrados en secuencias de acción rápida, y señaló específicamente que estos artefactos no se pueden limpiar con ampliación (MindStudio, agosto de 2026). Esa es la parte que importa para cualquiera que planee renderizar a 720p y ampliar a 4K después: el ampliador agudiza el morph, no lo elimina.

La misma producción registró una relación de toma de 3.2 a 1. Aproximadamente 450 segundos de generación bruta para cortar un final de 2 minutos 22 segundos. Planifica el trabajo de toma larga como una grabación con cobertura, no como una cola de renderizado donde cada trabajo se envía.

Dos hallazgos más de esa producción vale la pena tomar prestados directamente. La identidad visual de toda la película se basó en tres imágenes de referencia, dos retratos de personajes y una placa de ubicación, aunque el sistema acepta hasta 50. Y en la selección de voces, escribir "American" corrigió un acento británico no deseado, mientras que escribir "American English" no lo hizo, porque la palabra "English" empujó la entrega de vuelta hacia una lectura británica.

La estructura de prompt que sobrevive 30 segundos es la que Alibaba usa en su propio manual: tiempos explícitos con marca de tiempo. No un párrafo de vibes. Escribe 0-8s, 8-16s, 16-24s, 24-30s, dale a cada bloque su propio comportamiento de cámara y su propio evento, y termina con una sola línea de audio que cubra todo el clip. Verás ese esqueleto exacto en el Paso 4 a continuación, porque mantuve la estructura de Alibaba y solo la traduje.

Wan 3.0 vs Seedance 2.5 Nativo 30s: Especificaciones, precio y lo que puedes ejecutar hoy

Aquí está el estado real de las cosas, y la parte donde los dos modelos dejan de ser productos comparables.

Lee la fila de resolución dos veces, porque es todo el artículo. La propia documentación de la API de Seedance 2.5 Texto a Video de Atlas Cloud establece que 720p-esr mejora una fuente de 480p, que 1080p-esr, 1440p-esr y 4k-esr mejoran todas una fuente de 720p, y que la opción 4K entrega un borde corto de 2160 píxeles "no generación 4K nativa". Por lo tanto, un clip de Seedance de 30 segundos etiquetado como 4K es 720p de detalle real, remuestreado. La hoja de precios de Wan 3.0, por el contrario, tiene un nivel directo de 1080p a $0.20 por segundo, y los archivos demo de 30 segundos publicados por Alibaba miden 1920x1072.

La ventaja de esta limitación: toda la prueba se ejecuta en una pestaña del navegador, en tres modelos, sin configuración local.

Rol en esta pruebaModeloPrecio indicado
Fotograma de aperturaGPT Image 2 Texto a Imagendesde $0.009 / imagen
La ejecución de 30s nativosSeedance 2.5 Texto a Videodesde $0.134 / SEC

Precios indicados verificados en las páginas de modelo de Atlas Cloud, agosto de 2026. Léelos como mínimos, no como cotizaciones. Cada uno de estos modelos factura por lo que realmente pides, y el botón Ejecutar cotiza tus ajustes exactos antes de que hagas clic. En esta prueba, el botón cotizó $0.1745 por un fotograma de GPT Image 2 en calidad alta y 2048x1152, y $1.514799 por un trabajo de cinco segundos de Seedance 2.5 a 720p y 16:9, lo que equivale aproximadamente a $0.30 por segundo en lugar de los $0.134 indicados. La cifra indicada es la tarifa de 480p. Revisa el botón, no el catálogo. Seedance 2.5 también envía un endpoint de referencia a video al mismo precio de $0.134 por segundo si quieres llegar al límite de 50 referencias.

Cómo reproducir esta prueba de 30s nativos en Seedance 2.5

Cinco pasos, tres modelos, todo en el navegador. Copia los prompts textualmente.

Paso 1: Bloquear el esqueleto de 30s con marca de tiempo

No ejecutes nada aún. Lee la estructura primero, porque esta es la parte que decide si tus 30 segundos se sostienen.

La demo de la gasolinera de Wan 3.0 al inicio de este artículo está construida como cuatro bloques etiquetados con una doctrina de cámara fija declarada una vez al principio: observación objetiva y tranquila, planos medios generales fijos, primeros planos extremos repentinos solo en los tiempos absurdos. Cada evento está anclado a un rango de tiempo. El audio es una línea al final que cubre los 30 segundos.

Aquí está el esqueleto, vacío. Complétalo y tendrás un prompt que un modelo nativo de 30s puede rastrear realmente:

Plain
1Un [género] de 30 segundos ambientado en [lugar]. [Estilo visual, gradación, saturación]. Lenguaje de cámara: [doctrina], puntuado por [excepción].
2
30-8s: [introducción, plano general, establece el mundo normal, presenta la anomalía en el horizonte]
4
58-16s: [la anomalía actúa, todavía tratada como normal, un inserto de POV o reacción]
6
716-24s: [el remate, primer plano extremo de la cosa en sí, corte brusco al rostro de reacción]
8
924-30s: [la retirada, un pequeño botón físico que cierra el chiste]
10
11Audio: [ambiente, tres o cuatro sonidos diegéticos específicos, un último sonido pequeño]. Sin música, sin diálogo, sin texto en pantalla.

La especificación medible del archivo de referencia de Alibaba, para cualquiera que quiera verificar mis números: 30.07 segundos, 1920x1072, 24fps, AAC estéreo. Ese es el listón contra el que se mide la ejecución de Seedance.

Paso 2: Generar el fotograma de apertura

Necesitas un ancla visual fija para que las ejecuciones de 15 y 30 segundos comiencen desde el mismo mundo. Abre GPT Image 2 Texto a Imagen.

Configuración: calidad high, relación de aspecto 16:9, 1 imagen.

Plain
1Un plano general fijo y estático de una gasolinera solitaria estilo Route 66 en un desierto brillante. Edificio retro amarillo-naranja y azul, pintura ligeramente decolorada por el sol; un surtidor de gasolina vintage rojo descolorido al frente; una pequeña tienda de conveniencia al lado con una máquina expendedora de cola lavada junto a la puerta. Tierra seca de naranja agrietada en primer plano, montañas de terracota cálidas al fondo, cielo azul cian limpio y sin nubes. Un empleado de gasolinera en overoles azules grasientos y gafas de sol negras grandes holgazanea medio dormido en una silla junto a la puerta, palillo en la boca. Estricta gradación de color teal y naranja brillante, alta saturación, alto brillo, fotorrealismo cinematográfico, cámara fija, 16:9.

Captura de pantalla de un generador de imágenes AI con prompt e imagen de salida

Entorno de GPT Image 2 en Atlas Cloud con calidad ajustada a high y 16:9, la imagen de establecimiento de la gasolinera Route 66 generada en el panel de salida

GPT Image 2 en Atlas Cloud: calidad high, 16:9, una imagen. El botón Ejecutar cotizó $0.1745 por este fotograma, que es lo que cuesta realmente un render de alta calidad de 2048x1152. Los $0.009 en la página del modelo son el mínimo.

Hombre descansando afuera de una gasolinera vintage Route 66 en el desierto

Fotograma de establecimiento de gasolinera Route 66 generado con GPT Image 2, cielo teal y tierra agrietada naranja, empleado dormitando junto a la puerta

El fotograma de apertura. Esta es la entrada para el Paso 3 y el objetivo visual para el Paso 4. Generado con openai/gpt-image-2.

Paso 3: Alcanzar el muro de 15 segundos

Configuración: primer fotograma = tu salida del Paso 2, duration arrastrada a su máximo de 15, resolución 1080P.

Plain
1Plano general fijo se mantiene. Una vaquera con sombrero de ala ancha monta un caballo real desde el horizonte al paso. El empleado dormitando es despertado por los cascos, se sube las gafas de sol, se sienta erguido, masticando su palillo, sin impresionarse. Ella desmonta limpiamente, lleva al caballo directamente al surtidor vintage. Gradación teal y naranja brillante, alta saturación, fotorrealista, cámara tranquila y observadora, sin cortes.

El menú desplegable se detiene en 15. Ese es el punto completo de este paso. Tu remate está programado para el segundo 20, y este pipeline no puede alcanzar el segundo 20 en una sola pieza. Para llegar allí, generarías un segundo clip desde el último fotograma, y en el momento en que hagas eso, el caballo es un caballo nuevo.

Captura de pantalla de una interfaz de generador de video AI con entrada y salida

Paso 4: Ejecutar la pasada completa de 30s nativos

Abre Seedance 2.5 Texto a Video.

Configuración: duration = 30, resolution = 720p, ratio = 16:9, generate_audio = activado, output_format = mp4, marca de agua desactivada.

Elige 720p deliberadamente, no 1080p-esr. 720p es el techo real del modelo, por lo que esta es una comparación de píxeles equivalente en lugar de una comparación contra un ampliador.

El prompt a continuación es el prompt de la demo de la gasolinera del propio Alibaba, traducido fielmente del manual del creador de Wan 3.0 y reestructurado en nada. Mismos tiempos, mismas temporizaciones, misma doctrina de cámara, misma lista de audio.

Plain
1Un cortometraje de comedia absurda e inexpresiva de 30 segundos ambientado en una gasolinera estilo Route 66 decolorada por el sol en un desierto brillante. Fotorrealista, estricta gradación teal y naranja brillante, alta saturación y alto brillo, para que el evento absurdo ocurra en un mundo completamente normal, casi bonito. Lenguaje de cámara: observación tranquila y objetiva, principalmente planos medios generales fijos y derivas laterales lentas, sin dirección emocional, puntuado por primeros planos extremos repentinos en los tiempos absurdos.
2
30-8s: Plano general fijo. Cielo cian, polvo flotante. La estación retro amarillo-naranja-azul se encuentra sola junto a la carretera; un empleado en overoles azules grasientos y enormes gafas de sol negras dormita en una silla, palillo en la boca. Solo viento. En el horizonte, una vaquera en un caballo real aparece al paso. Corte a plano medio: los cascos lo despiertan, se empuja las gafas de sol, se sienta, lee a la pareja como "otra pidiendo direcciones".
4
58-16s: Ella no dice nada. Desmonta limpiamente, lleva al caballo directamente al viejo surtidor. El caballo casualmente pone la cabeza al lado del surtidor como si lo hubiera hecho antes. Breve POV ligeramente ojo de pez desde detrás de sus gafas de sol, la mujer y el caballo parecen aún más extraños. Primer plano: frunce el ceño, se quita las gafas de sol, a punto de gritar. Primer plano en cámara lenta: mientras se quita las gafas, ella apunta la boquilla del combustible a la boca del caballo y aprieta el gatillo.
6
716-24s: Primer plano extremo de la boquilla. Sale no gasolina sino chorros de hierba fresca de color verde brillante, todavía perlada de agua. Corte brusco a un primer plano extremo del rostro del empleado, congelado: ojos como platos, boca ligeramente abierta, palillo olvidado en medio de la masticación. Plano medio: el caballo come felizmente, entrecierra los ojos con placer, luego da un movimiento poderoso y satisfecho de su cola, y el polvo que levanta cae directamente sobre el rostro aún atónito del empleado.
8
924-30s: "Depósito lleno" de hierba. Ella cuelga la boquilla de nuevo en el surtidor, saca monedas de su bolsillo, camina hacia la puerta de la tienda y las deja caer tintineando en una lata de hojalata en el mostrador. Mira hacia atrás al empleado petrificado; bajo el ala del sombrero, la comisura de su boca se levanta una fracción. Vuelve a montar y se aleja en una estela de polvo. La cámara se acerca lentamente a él: misma postura congelada, cara cubierta de polvo, gafas de sol aún pellizcadas en su mano, y finalmente el palillo cae de su boca con un pequeño clic.
10
11Audio: viento seco del desierto durante todo el tiempo, cascos, el golpe mecánico de la manija del surtidor, hierba mojada brotando, el movimiento de la cola, monedas en una lata de hojalata, y un pequeño clic cuando el palillo golpea el suelo. Sin música, sin diálogo, sin texto en pantalla.

Una advertencia que te ahorrará una factura desperdiciada, y es la misma trampa que en el Paso 3: arrastra el control deslizante de duración a 30, no escribas 30 en el cuadro de número. El cuadro mostrará felizmente 30 mientras el control deslizante permanece en su valor predeterminado de cinco segundos, y el botón Ejecutar te cotizará por cinco segundos. Verifica la cotización antes de hacer clic. A 720p y 16:9, un trabajo de cinco segundos cotiza $1.514799, por lo que una pasada real de 30 segundos cotiza aproximadamente seis veces eso.

No hay captura de pantalla de ejecución terminada para este paso. Tres intentos de captura automatizada enviaron el valor predeterminado del control deslizante en lugar de 30 segundos, y en lugar de mostrarte un clip de cinco segundos etiquetado como uno de 30 segundos, la captura se omite. El prompt y la configuración anteriores son exactamente lo que debes pegar y configurar.

Paso 5: Leer la deriva, honestamente

Aquí está el lado de Seedance 2.5 de ese mismo prompt, generado a 30 segundos nativos, 720p, 16:9, audio activado.

Seedance 2.5, el mismo prompt de la gasolinera de Wan 3.0 copiado textualmente: 30s nativos en una generación, 1280x720, 24fps, audio incorporado. Mismos cuatro tiempos, vaquera y caballo llegando, el gag de la boquilla de combustible, el primer plano de disonancia cognitiva del empleado. Colócalo junto al clip de Wan 3.0 en la parte superior para una lectura equivalente.

Pon los dos clips lado a lado y verifica cinco cosas específicas. No verifiques "cuál se ve mejor", eso es una discusión de gusto y te hará perder la tarde.

  1. Identidad del pelaje y la vestimenta. ¿El caballo es del mismo color en el segundo 29 que en el segundo 6? ¿Las gafas de sol tienen la misma forma después de que se las quitan y vuelven a su mano?
  2. Estabilidad de la gradación. Muestra el cielo en el segundo 2 y en el segundo 28. La gradación teal y naranja tiende a desplazarse hacia cálido en generaciones largas más a menudo de lo que la gente espera.
  3. El tiempo físico en el segundo 20. Hierba saliendo de una boquilla de combustible es una solicitud de física. ¿Arquea y cae con peso, o se desvanece como una textura?
  4. Disciplina de cámara. El prompt dice fija. Cuenta cuántas veces la cámara inventa un acercamiento que no se le pidió. Este es el fallo de generación larga más común: el modelo se queda sin eventos programados y llena el tiempo con movimiento.
  5. Morphing en movimiento rápido. El movimiento de la cola y la patada de polvo son el movimiento más rápido del clip. Según las notas de producción de MindStudio, aquí es exactamente donde se concentra la decoherencia, y exactamente lo que una ampliación no arreglará.

Puntúa esos cinco, no la vibra. Esa es una comparación que puedes defender ante un cliente.

Tres prompts emparejados más de Wan 3.0 vs Seedance 2.5 Nativo 30s

Una demo es una anécdota. Aquí hay tres archivos oficiales más de Wan 3.0 de 30 segundos del mismo manual, cada uno estresando una parte diferente del problema de los 30 segundos. Para el monstruo marino y el monólogo de fantasía oscura, el lado de Seedance 2.5 se generó con el mismo prompt a 30 segundos nativos y está insertado justo después de cada uno, para que puedas ver ambos en lugar de creerme a mí.

PromptLo que prueba de estrésArchivo oficial de Wan 3.0, medidoLado de Seedance 2.5, mismo prompt
Película de desastre de monstruo marino10 tomas guionizadas más una partitura orquestal en 30s1920x1072, 24fps, 30.07s, AACgenerado a 30s, insertado abajo; se eliminó un nombre IP y el texto de la marca del barco para que el filtro de contenido de Seedance lo pasara, el storyboard es idéntico por lo demás
Monólogo en inglés de fantasía oscuravoz en inglés nativa y sincronización labial en un push continuo lento1280x720, 24fps, 30.05s, AACgenerado a 30s a partir del prompt textual, insertado abajo
Anime deportivo 2D, prompt de dos líneas¿puede el modelo llenar 30s con casi ninguna instrucción1280x720, 24fps, 30.05s, AACno generado aquí; se muestra como una cuadrícula de fotogramas solo de Wan para leer la estructura a lo largo del tiempo
Cortometraje de comedia con whip pan (excluido)8 whip pans y 8 tiempos emocionales sin corte1280x720, 24fps, 30.04s, AACno ejecutado: la densidad del diálogo es específica del mandarín, una reescritura en inglés no sería una comparación justa equivalente

Demo oficial de Wan 3.0: diez tomas guionizadas y una construcción orquestal completa dentro de una sola pasada de 30 segundos, a 1920x1072. Este es el argumento más difícil para el 1080p nativo, porque el volumen de agua y el detalle de la piel húmeda de la criatura son exactamente lo que una ampliación de 720p inventa en lugar de resolver. Manual del creador de Alibaba Tongyi, utilizado para comparación y comentario.

Seedance 2.5, el mismo prompt de desastre de diez tomas a 30s nativos, sonido activado. Barco de pesca sacudido por la tormenta, el marinero aterrorizado, el oleaje elevándose, luego el leviatán de las profundidades rompiendo la superficie en el relámpago. Se eliminó una referencia IP y el texto de la marca en el casco para que el filtro de contenido de Seedance lo pasara; el storyboard es idéntico por lo demás, que es lo que hace que el volumen de agua y el detalle de la piel húmeda sean una comparación justa equivalente contra el clip de Wan 3.0 arriba.

Demo oficial de Wan 3.0, sonido activado. Diálogo de villano en inglés nativo, "Ripe enough for the void", entregado en una sola inclinación hacia arriba lenta sin corte. Este es el clip que los equipos de habla inglesa deberían probar, porque la voz, la sincronización labial y un movimiento de cámara continuo de 30 segundos tienen que sostenerse a la vez.

Seedance 2.5, el mismo prompt de fantasía oscura copiado textualmente, 30s nativos, sonido activado. Mismo villano de ojos violeta, las marcas de runas estelares, la nebulosa de sombra formándose en su palma abierta, y las dos líneas en inglés. Observa si la sincronización labial y el único push continuo se mantienen durante los 30 segundos completos como lo hacen en el lado de Wan 3.0.

Si ejecutas el lado emparejado de Seedance 2.5 de este, mantén las dos líneas en inglés textuales y recuerda la peculiaridad del acento de las notas de producción: escribe "American", no "American English". La palabra "English" empuja la entrega de vuelta hacia una lectura británica.

El tercero es la sorpresa tranquila. El prompt de anime deportivo 2D en el manual de Alibaba tiene dos líneas. Sin marcas de tiempo, sin lista de tomas, solo un boxeador golpeando un saco pesado, cansado, con dolor. Treinta segundos a partir de eso es una prueba genuina de si el modelo puede inventar su propia estructura. Aquí está muestreado a lo largo de su propio tiempo de ejecución:

Cuatro paneles de anime de un boxeador agotado entrenando con un saco de boxeo

Cuatro fotogramas de la demo oficial de anime deportivo 2D de Wan 3.0 muestreados aproximadamente a los 1, 10, 20 y 29 segundos, mostrando el diseño del boxeador y el fondo del gimnasio a lo largo de los 30 segundos completos

Cuatro fotogramas de la demo oficial de anime deportivo 2D de Wan 3.0, muestreados aproximadamente a los 1, 10, 20 y 29 segundos. Mismo diseño de personaje, misma camiseta sin mangas, mismo saco pesado, misma fila de taquillas, a través de un cambio de plano general a primer plano que el prompt nunca pidió. Una cuadrícula fija en lugar de un clip, porque la comparación aquí es a lo largo del tiempo dentro de un archivo, no de movimiento.

Lectura práctica: con un prompt de dos líneas, el modelo inventó su propia cobertura, pasando de un plano general fijo a un primer plano de sudor y agotamiento, y mantuvo el diseño del personaje mientras lo hacía. Esa es la buena noticia. El intercambio es que renunciaste al control de cuándo sucede algo. Si necesitas 30 segundos para que un tiempo específico aterrice en un segundo específico, escribe las marcas de tiempo.

Prueba la narración de 30s nativos gratis antes de pagar por cualquiera de los dos

Una ejecución de 30 segundos a 720p en Seedance 2.5 cotiza alrededor de $9 una vez que valoras la resolución real en lugar del mínimo del catálogo. Una ejecución de 30 segundos a 1080p en la hoja de precios de Wan 3.0 es de $6.00. Ninguno es caro para los estándares de producción, pero con una relación de toma de 3.2 a 1, no estás comprando un clip, estás comprando tres o cuatro.

Antes de gastar algo, vale la pena responder una pregunta más barata: ¿mi guión realmente se sostiene como una sola toma continua? La mayoría de los fallos de 30 segundos no son fallos del modelo. Son fallos de estructura, tres tiempos metidos donde había espacio para dos, o un remate escrito en el segundo 26 sin nada que sostenga los segundos 8 al 20.

El generador gratuito de anuncios AI skit de Atlas Cloud responde a eso sin costo. Le das una descripción de producto y hasta cuatro fotos de producto, cada una de menos de 8MB, eliges uno de seis estilos (meme divertido, giro argumental, comedia de situación, conmovedor, lujo o venta dura), y primero escribe un guión de dos personajes, con un gancho de tres segundos, un conflicto y un giro, luego construye cada toma alrededor de ese guión. Los personajes dicen sus líneas en voz alta y los efectos de sonido se renderizan en el video.

Los límites honestos: son 15 segundos, no 30, necesitas iniciar sesión, y obtienes una generación gratuita antes de recargar créditos. Pero 15 segundos con un gancho, un conflicto y un giro te dicen si tus tres tiempos respiran. Si la estructura funciona allí, toma los mismos tiempos, extiéndelos al esqueleto 0-8s / 8-16s / 16-24s / 24-30s del Paso 1, y ve a gastar los nueve dólares en una pasada real de 30 segundos nativos.

Lo que realmente cuesta un clip de 30s nativos en Wan 3.0 vs Seedance 2.5

ConfiguraciónTarifaDuraciónUn clip
Wan 3.0, 1080p nativo (solo Alibaba Cloud)$0.20 / seg30s$6.00
Wan 3.0, 720p nativo (solo Alibaba Cloud)$0.10 / seg30s$3.00
Wan 3.0, 480p nativo (solo Alibaba Cloud)$0.05 / seg30s$1.50
Seedance 2.5, 720p nativo, en Atlas Cloud$0.30 / seg medido a 720p, indicado desde $0.13430saproximadamente $9.09
GPT Image 2 fotograma de apertura, calidad high, 2048x1152indicado desde $0.009 / imagen1 imagen$0.1745 cotizado

La comparación que realmente lo decide: Wan 3.0 a 720p es más barato por segundo que Seedance 2.5 a 720p, y a 1080p es el único de los dos que vende píxeles reales. La respuesta de Seedance 2.5 son 50 ranuras de referencia, disponibilidad en vivo y una API funcional con la que puedes enviar esta misma tarde.

Nota de licencia y fuentes para estos clips de 30s nativos

Cada clip de Wan 3.0 y cada prompt de Wan 3.0 en este artículo provienen del manual del creador de Tongyi Wan 3.0 distribuido públicamente por Alibaba, reproducido aquí para comparación y comentario, acreditado, sin modificar y sin eliminar la marca de agua. El uso comercial de la salida de Seedance 2.5 está sujeto a los términos de ByteDance y Volcengine; la facturación de la API y el manejo de datos en el lado de Atlas Cloud están sujetos a los términos propios de Atlas Cloud. No se reproduce la imagen de ninguna persona real en ninguna parte de esta prueba. Si estás enviando trabajo de clientes, lee los términos del modelo para el endpoint específico que llamas, no un resumen de blog de los mismos.

Preguntas frecuentes

¿Los 30s nativos de Wan 3.0 son realmente una pasada, o clips empalmados?

Una pasada. Wan 3.0 genera de 2 a 30 segundos en una sola generación con una opción de duración inteligente, por lo que también puede decidir que el clip no necesita los 30 completos. Eso es diferente de la extensión del último fotograma, donde un segundo clip se siembra a partir del fotograma final del primero y la identidad se desvía a través de la costura.

¿Cuál es realmente 1080p a 30 segundos, Wan 3.0 o Seedance 2.5?

Wan 3.0. Tiene un nivel de 1080p nativo en su hoja de precios, y los archivos demo de 30 segundos del propio Alibaba miden 1920x1072. Seedance 2.5 genera de forma nativa solo a 480p y 720p; sus opciones de 1080p, 1440p y 4K son mejoras de una fuente de 720p, y sus documentos de API describen el nivel 4K como "no generación 4K nativa".

¿La imagen aún se desmorona en el segundo 25?

Puede, pero el fallo cambió de forma. En lugar de una costura visible entre clips, obtienes morphing y decoherencia dentro de la toma, concentrados en pasajes de movimiento rápido, y la ampliación no lo elimina. Una producción documentada de cortometraje con Seedance 2.5 tuvo una relación de toma de 3.2 a 1, así que planifica tomas largas con cobertura.

¿Qué modelo acepta más material de referencia?

Seedance 2.5, por un amplio margen: 30 imágenes más 10 videos más 10 archivos de audio, 50 en total, con video y audio de referencia cada uno limitado a 30 segundos combinados por solicitud. El manual de Wan 3.0 limita las referencias a 20, pero es el único que acepta archivos .pdf, .ppt, .xls, .doc, .txt y páginas web en vivo como entrada creativa.

¿Tendrá Wan 3.0 pesos abiertos?

No hay un compromiso oficial. A partir de la beta pública de agosto de 2026, no se han publicado pesos de Wan 3.0, checkpoint de Hugging Face o nodo de ComfyUI, y los pesos abiertos oficiales para la línea de video insignia se detienen en Wan 2.2 (Kingy AI, agosto de 2026). Trata cualquier otra cosa que leas sobre una caída de pesos de 3.0 como especulación hasta que Alibaba diga lo contrario.

Modelos recientes

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos