
Última actualización: Wan 3.0 ya está disponible desde el 24 de agosto de 2026.
Dos monitores de edición lado a lado reproduciendo la misma toma de una gasolinera en el desierto, uno con una línea de tiempo ininterrumpida de 30 segundos debajo y otro con una línea de tiempo dividida en dos segmentos
En el segundo 20, la boquilla de combustible rocía hierba verde fresca. Todavía cubierta de gotas de agua. El caballo entrecierra los ojos con placer. El palillo del encargado cae de su boca.
Ese chiste solo funciona dentro de una sola toma continua de 30 segundos. Corta cuatro clips de 8 segundos juntos y el caballo cambia de pelaje, las gafas de sol cambian de forma, el cielo se vuelve un paso más cálido, y el remate muere en algún lugar entre las uniones.
Así que cuando Wan 3.0 y Seedance 2.5 llegaron ambos en la misma ventana afirmando 30 segundos nativos, en un solo pase, sin costuras, dejó de ser una historia de referencia. Se convirtió en la primera vez que un modelo de video con IA podía sostener una premisa, un giro y un remate en una sola toma.
Analicé las especificaciones, hice una verificación de especificaciones contra los archivos demo publicados por el propio Alibaba, y encontré lo que nadie que escribe sobre esto ha impreso: ambos modelos dicen 30 segundos, pero la resolución debajo de esos 30 segundos no es el mismo producto en absoluto.
Conclusiones clave
- Ambos modelos realmente generan 30 segundos en un solo pase. Esa parte no es marketing. Wan 3.0 cubre de 2 a 30 segundos con una opción de duración inteligente, Seedance 2.5 cubre de 4 a 30 segundos.
- Solo Wan 3.0 renderiza 1080p nativo a 30 segundos. Seedance 2.5 genera nativamente solo en 480p y 720p. Sus opciones de 1080p, 1440p y 4K son ampliaciones posteriores a la generación de una fuente de 720p, y su propia documentación de API dice que el nivel 4K "no es generación 4K nativa".
- Seedance 2.5 gana en volumen de referencia: hasta 30 imágenes más 10 videos más 10 archivos de audio, 50 en total. El manual del creador de Wan 3.0 limita las referencias a 20.
- Wan 3.0 tiene una entrada que nadie más tiene: archivos
.doc,.xls,.ppt,.pdf,.txty páginas web en vivo, alimentados directamente como referencias creativas. - Solo uno de los dos es realmente ejecutable fuera de Alibaba hoy. Wan 3.0 está en beta pública en Alibaba Cloud Model Studio y Qwen Cloud, con acceso a API de terceros aún en implementación. Seedance 2.5 está activo en Atlas Cloud con 30 en el control de duración ahora mismo.
- ¿Quieres probar la estructura narrativa de 30 segundos antes de pagar por un solo segundo? El generador gratuito de skits publicitarios con IA de Atlas Cloud te da una ejecución gratuita: un spot terminado de 15 segundos con diálogo hablado y efectos de sonido, descarga sin marca de agua.
Demo oficial de Wan 3.0 de Alibaba, del manual del creador de Tongyi Wan 3.0. Una toma, sin cortes, 30.07 segundos. Medido con ffprobe: 1920x1072, 24fps, audio AAC estéreo integrado. Activa el sonido para el movimiento de la cola y el palillo golpeando el suelo en el segundo 29. Utilizado aquí como material de referencia para comparación y comentario solamente.
Wan 3.0 vs Seedance 2.5 30s nativos: Lo que realmente cambió este mes
Quince segundos fue el límite durante mucho tiempo. Wan 2.7 termina ahí. Seedance 2.0 terminaba ahí. Cada "película de IA de un minuto" que viste en tu feed durante el último año eran de cuatro a ocho clips pegados en un NLE, con un pase de colorista para ocultar las uniones.
Dos cosas rompieron ese límite en las mismas semanas. Alibaba abrió la beta pública de Wan 3.0 el 6 de agosto de 2026 con generación nativa de 30 segundos y entrada de referencia multimodal completa (AlphaSignal, agosto de 2026). ByteDance duplicó Seedance de 15 a 30 segundos en la versión 2.5, posicionándolo explícitamente como una forma de reducir la unión de clips y la deriva visual que la acompaña.
Nativo importa aquí en un sentido técnico específico. Significa un pase hacia adelante sobre una secuencia latente, no extensión del último fotograma donde el modelo toma el fotograma final del clip A e inicia el clip B a partir de él. La extensión es la razón por la que el cuello de la chaqueta de tu personaje cambia silenciosamente de forma entre tomas. Un pase nativo tiene los 30 segundos completos en el mismo contexto, por lo que el caballo sigue siendo el mismo caballo.
La demo de la gasolinera es la prueba más limpia posible de esto. La estructura es de cuatro tiempos: de 0 a 8 segundos sin que pase nada, de 8 a 16 segundos sucede algo extraño, de 16 a 24 segundos es el remate, de 24 a 30 segundos es la salida. El chiste aterriza en el segundo 20. Lo que significa que solo aterriza si el caballo, las gafas de sol, la gradación teal-and-orange y la cámara fija e inexpresiva sobreviven los primeros 19 segundos intactos. La unión no puede hacer eso. No porque el editor sea malo, sino porque el clip B nunca vio al clip A.
Wan 3.0 vs Seedance 2.5 30s nativos: Donde la imagen realmente se rompe
Treinta segundos es el doble de quince. El riesgo de deriva no es el doble, es peor, y se mueve a un modo de fallo diferente.
Los fallos del flujo de trabajo con unión eran entre clips. Los fallos de los 30s nativos están dentro del clip. En una producción práctica de cortometraje con Seedance 2.5, el revisor encontró decoherencia y morphing que aparecían como "inestabilidad visual o picos en los modelos de personajes", concentrados en secuencias de acción rápida, y señaló específicamente que estos artefactos no se pueden limpiar con ampliación (MindStudio, agosto de 2026). Esa es la parte que importa para cualquiera que planee renderizar a 720p y ampliar a 4K después: el ampliador agudiza el morph, no lo elimina.
La misma producción registró una relación de 3.2 a 1. Aproximadamente 450 segundos de generación bruta para cortar un final de 2 minutos 22 segundos. Planifica el trabajo de toma larga como una grabación con cobertura, no como una cola de renderizado donde cada trabajo se envía.
Dos hallazgos más de esa producción vale la pena robarlos directamente. La identidad visual en toda la película se basó en tres imágenes de referencia, dos retratos de personajes y una placa de ubicación, aunque el sistema acepta hasta 50. Y en la elección de voz, escribir "American" corrigió un acento británico no deseado mientras que escribir "American English" no lo hizo, porque la palabra "English" empujó la entrega de vuelta hacia lo británico.
La estructura de prompt que sobrevive 30 segundos es la que Alibaba usa en su propio manual: tiempos explícitos con marcas de tiempo. No un párrafo de vibraciones. Escribe 0-8s, 8-16s, 16-24s, 24-30s, dale a cada bloque su propio comportamiento de cámara y su propio evento, y termina con una sola línea de audio que cubra todo el clip. Verás ese esqueleto exacto en el Paso 4 a continuación, porque mantuve la estructura de Alibaba y solo la traduje.
Para una ejecución alojada actual, abre Wan 3.0 en Atlas Cloud y prueba un prompt como el de abajo antes de publicar el flujo de trabajo.

Wan 3.0 vs Seedance 2.5 30s nativos: Especificaciones, precio y lo que puedes ejecutar hoy
Aquí está el estado real del juego, y la parte donde los dos modelos dejan de ser productos comparables.
Lee la fila de resolución dos veces, porque es todo el artículo. La documentación de la API de Seedance 2.5 Texto a Video del propio Atlas Cloud establece que 720p-esr mejora una fuente de 480p, que 1080p-esr, 1440p-esr y 4k-esr mejoran todas una fuente de 720p, y que la opción 4K entrega un borde corto de 2160 píxeles "no generación 4K nativa". Así que un clip de 30 segundos de Seedance etiquetado como 4K es 720p de detalle real, remuestreado. La hoja de precios de Wan 3.0, por el contrario, tiene un nivel directo de 1080p a $0.20 por segundo, y los archivos demo publicados por Alibaba de 30 segundos miden 1920x1072.
El lado positivo de esa limitación: toda la prueba se ejecuta en una pestaña del navegador, en tres modelos, sin configuración local.
| Rol en esta prueba | Modelo | Precio listado |
|---|---|---|
| Fotograma de apertura | GPT Image 2 Texto a Imagen | desde $0.009/imagen |
| La ejecución nativa 30s | Seedance 2.5 Texto a Video | desde $0.134/SEG |
Precios listados verificados en las páginas de modelo de Atlas Cloud, agosto de 2026. Léelos como mínimos, no como cotizaciones. Cada uno de estos modelos factura por lo que realmente pides, y el botón Ejecutar cotiza tus ajustes exactos antes de que hagas clic. En esta prueba, el botón cotizó $0.1745 por un fotograma de GPT Image 2 en calidad alta y 2048x1152, y $1.514799 por un trabajo de cinco segundos de Seedance 2.5 a 720p y 16:9, lo que equivale aproximadamente a $0.30 por segundo en lugar de los $0.134 listados. La cifra listada es la tarifa de 480p. Revisa el botón, no el catálogo. Seedance 2.5 también envía un endpoint de referencia a video al mismo precio de $0.134 por segundo si quieres llegar al límite de 50 referencias.
Cómo reproducir esta prueba de 30s nativos en Seedance 2.5
Cinco pasos, tres modelos, todo en el navegador. Copia los prompts textualmente.
Paso 1: Bloquea el esqueleto de 30s con marcas de tiempo
No ejecutes nada todavía. Lee la estructura primero, porque esta es la parte que decide si tus 30 segundos se mantienen.
La demo de la gasolinera de Wan 3.0 al principio de este artículo está construida como cuatro bloques etiquetados con una doctrina de cámara fija declarada una vez al principio: observación objetiva y tranquila, planos medios abiertos fijos, primeros planos extremos repentinos solo en los tiempos absurdos. Cada evento está anclado a un rango de tiempo. El audio es una línea al final que cubre los 30 segundos.
Aquí está el esqueleto, vacío. Complétalo y tendrás un prompt que un modelo nativo de 30s puede rastrear realmente:
Plain1Un [género] de 30 segundos ambientado en [lugar]. [Estilo visual, gradación, saturación]. Lenguaje de cámara: [doctrina], puntuado por [excepción]. 2 30-8s: [premisa, plano general, establece el mundo normal, introduce la anomalía en el horizonte] 4 58-16s: [la anomalía actúa, aún tratada como normal, un inserto de POV o reacción] 6 716-24s: [el remate, primer plano extremo de la cosa en sí, corte brusco al rostro de reacción] 8 924-30s: [la salida, un pequeño botón físico que cierra el chiste] 10 11Audio: [ambiente, tres o cuatro sonidos diegéticos específicos, un sonido final pequeño]. Sin música, sin diálogo, sin texto en pantalla. 12
La especificación medible del archivo de referencia de Alibaba, para cualquiera que quiera verificar mis números: 30.07 segundos, 1920x1072, 24fps, AAC estéreo. Ese es el listón con el que se mide la ejecución de Seedance.
Paso 2: Genera el fotograma de apertura
Necesitas un ancla visual fija para que las ejecuciones de 15 y 30 segundos comiencen desde el mismo mundo. Abre GPT Image 2 Texto a Imagen.
Configuración: calidad high, relación de aspecto 16:9, 1 imagen.
Plain1Un plano general fijo y estático de una gasolinera solitaria estilo Route 66 en un desierto brillante. Edificio retro amarillo-naranja-y-azul, pintura ligeramente descolorida por el sol; un surtidor de combustible rojo vintage descolorido al frente; una pequeña tienda de conveniencia al lado con una máquina expendedora de refrescos desteñida junto a la puerta. Tierra seca anaranjada agrietada en primer plano, montañas terracota cálidas al fondo, cielo azul cian limpio y sin nubes. Un encargado de gasolinera en overoles azules grasientos y gafas de sol negras grandes holgazanea medio dormido en una silla junto a la puerta, palillo en la boca. Gradación estricta de color teal-and-orange brillante, alta saturación, alto brillo, fotorrealismo cinematográfico, cámara fija, 16:9. 2

Área de juego de GPT Image 2 en Atlas Cloud con calidad en alta y 16:9, la toma establecida de la gasolinera Route 66 generada en el panel de salida
GPT Image 2 en Atlas Cloud: calidad alta, 16:9, una imagen. El botón Ejecutar cotizó $0.1745 por este fotograma, que es lo que realmente cuesta un renderizado de alta calidad de 2048x1152. Los $0.009 en la página del modelo son el mínimo.

Fotograma de establecimiento de gasolinera Route 66 generado con GPT Image 2, cielo teal y tierra agrietada naranja, encargado dormitando junto a la puerta
El fotograma de apertura. Esta es la entrada para el Paso 3 y el objetivo visual para el Paso 4. Generado con openai/gpt-image-2.
Paso 3: Llega al límite de 15 segundos
Configuración: primer fotograma = tu salida del Paso 2, duration arrastrado a su máximo de 15, resolución 1080P.
Plain1El plano general fijo se mantiene. Una vaquera con un sombrero de ala ancha monta un caballo real que llega desde el horizonte al paso. El encargado dormitando es despertado por los cascos, se sube las gafas de sol, se sienta erguido, masticando su palillo, sin impresionarse. Ella desmonta limpiamente, lleva al caballo directamente al surtidor vintage. Gradación teal-and-orange brillante, alta saturación, fotorrealista, cámara de observación tranquila, sin cortes. 2
El menú desplegable se detiene en 15. Ese es todo el punto de este paso. Tu remate está programado para el segundo 20, y este pipeline no puede alcanzar el segundo 20 en una sola pieza. Para llegar allí, generarías un segundo clip desde el último fotograma, y en el momento en que hagas eso, el caballo es un caballo nuevo.

Paso 4: Ejecuta el pase completo de 30s nativos
Abre Seedance 2.5 Texto a Video.
Configuración: duration = 30, resolution = 720p, ratio = 16:9, generate_audio = activado, output_format = mp4, marca de agua desactivada.
Elige 720p deliberadamente, no 1080p-esr. 720p es el techo real del modelo, así que esta es una comparación de píxeles equivalente en lugar de una comparación contra un ampliador.
El prompt a continuación es el prompt de la demo de la gasolinera del propio Alibaba, traducido fielmente del manual del creador de Wan 3.0 y reestructurado en nada. Mismos tiempos, mismas marcas de tiempo, misma doctrina de cámara, misma lista de audio.
Plain1Un cortometraje de comedia absurda e inexpresiva de 30 segundos ambientado en una gasolinera descolorida por el sol estilo Route 66 en un desierto brillante. Fotorrealista, gradación estricta teal-and-orange brillante, alta saturación y alto brillo, de modo que el evento absurdo ocurre en un mundo completamente normal, casi bonito. Lenguaje de cámara: observación tranquila y objetiva, principalmente planos medios abiertos fijos y desplazamientos laterales lentos, sin dirección emocional, puntuado por primeros planos extremos repentinos en los tiempos absurdos. 2 30-8s: Plano general, fijo. Cielo cian, polvo que se desplaza. La estación retro amarillo-naranja-y-azul está sola junto a la carretera; un encargado en overoles azules grasientos y enormes gafas de sol negras dormita en una silla, palillo en la boca. Solo viento. En el horizonte, una vaquera sobre un caballo real aparece al paso. Corte a plano medio: los cascos lo despiertan, se sube las gafas de sol, se sienta erguido, interpreta a la pareja como "otra más pidiendo direcciones". 4 58-16s: Ella no dice nada. Desmonta limpiamente, lleva al caballo directamente al viejo surtidor. El caballo coloca casualmente su cabeza junto al surtidor como si ya lo hubiera hecho antes. Breve POV ligeramente ojo de pez desde detrás de sus gafas de sol, la mujer y el caballo se ven aún más extraños. Primer plano: su ceño se frunce, se quita las gafas de sol, a punto de gritar. Primer plano en cámara lenta: mientras se quita las gafas, ella apunta la boquilla del combustible a la boca del caballo y aprieta el gatillo. 6 716-24s: Primer plano extremo de la boquilla. Sale no gasolina sino chorros de hierba verde fresca y brillante, todavía cubierta de gotas de agua. Corte brusco a un primer plano extremo del rostro del encargado, congelado: ojos muy abiertos como platos, boca ligeramente abierta, palillo olvidado a medio masticar. Plano medio: el caballo come felizmente, entrecierra los ojos con placer, luego da un movimiento poderoso y satisfecho de su cola, y el polvo que levanta aterriza directamente en el rostro aún atónito del encargado. 8 924-30s: "Tanque lleno" de hierba. Ella cuelga la boquilla de nuevo en el surtidor, saca monedas de su bolsillo, camina hacia la puerta de la tienda y las deja caer tintineando en una lata de hojalata en el mostrador. Mira hacia atrás al encargado petrificado; debajo del ala del sombrero, la comisura de su boca se eleva una fracción. Vuelve a montar y se aleja en una estela de polvo. La cámara se acerca lentamente a él: misma postura congelada, rostro cubierto de polvo, gafas de sol aún pellizcadas en su mano, y finalmente el palillo cae de su boca con un pequeño clac. 10 11Audio: viento seco del desierto durante todo, cascos, el clunk mecánico de la manija del surtidor, hierba mojada brotando, el movimiento de la cola, monedas en una lata de hojalata, y un pequeño clac cuando el palillo golpea el suelo. Sin música, sin diálogo, sin texto en pantalla. 12
Una advertencia que te ahorrará una factura desperdiciada, y es la misma trampa que el Paso 3: arrastra el control deslizante de duración a 30, no escribas 30 en el cuadro numérico. El cuadro mostrará felizmente 30 mientras el control deslizante permanece en su valor predeterminado de cinco segundos, y el botón Ejecutar te cotizará cinco segundos. Verifica la cotización antes de hacer clic. A 720p y 16:9, un trabajo de cinco segundos cotiza $1.514799, por lo que un pase real de 30 segundos cotiza aproximadamente seis veces eso.
No hay captura de pantalla de ejecución terminada para este paso. Tres intentos de captura automatizados enviaron todos el valor predeterminado del control deslizante en lugar de 30 segundos, y en lugar de mostrarte un clip de cinco segundos etiquetado como uno de 30 segundos, la captura se omite. El prompt y la configuración anteriores son exactamente lo que debes pegar y configurar.
Paso 5: Lee la deriva, honestamente
Aquí está el lado de Seedance 2.5 de ese mismo prompt, generado a 30 segundos nativos, 720p, 16:9, audio activado.
Seedance 2.5, el mismo prompt de la gasolinera de Wan 3.0 copiado textualmente: 30s nativos en una generación, 1280x720, 24fps, audio integrado. Mismos cuatro tiempos, vaquera y caballo llegando, el gag de la boquilla de combustible, el primer plano de disonancia cognitiva del encargado. Ponlo junto al clip de Wan 3.0 al principio para una lectura equivalente.
Pon los dos clips lado a lado y verifica cinco cosas específicas. No verifiques "cuál se ve mejor", eso es un argumento de gusto y te hará perder la tarde.
- Identidad de pelaje y vestimenta. ¿El caballo es del mismo color en el segundo 29 que en el segundo 6? ¿Las gafas de sol tienen la misma forma después de que se las quita y vuelven a su mano?
- Estabilidad de gradación. Muestra el cielo en el segundo 2 y en el segundo 28. La gradación teal-and-orange tiende a volverse más cálida en generaciones largas más a menudo de lo que la gente espera.
- El tiempo físico en el segundo 20. Hierba saliendo de una boquilla de combustible es una solicitud de física. ¿Arquea y cae con peso, o se desvanece como una textura?
- Disciplina de cámara. El prompt dice fijo. Cuenta cuántas veces la cámara inventa un acercamiento que no se le pidió. Este es el fallo más común en generaciones largas: el modelo se queda sin eventos programados y llena el tiempo con movimiento.
- Morphing en movimiento rápido. El movimiento de la cola y la patada de polvo son el movimiento más rápido en el clip. Según las notas de producción de MindStudio, esto es exactamente donde se concentra la decoherencia, y exactamente lo que una ampliación no arreglará.
Puntúa esos cinco, no la vibra. Esa es una comparación que puedes defender ante un cliente.
Tres prompts emparejados más de Wan 3.0 vs Seedance 2.5 30s nativos
Una demo es una anécdota. Aquí hay tres archivos oficiales más de Wan 3.0 de 30 segundos del mismo manual, cada uno estresando una parte diferente del problema de los 30 segundos. Para el monstruo marino y el monólogo de fantasía oscura, el lado de Seedance 2.5 se generó con el mismo prompt a 30 segundos nativos y se incrusta justo después de cada uno, para que puedas ver ambos en lugar de tomarme la palabra.
| Prompt | Lo que prueba de estrés | Archivo oficial de Wan 3.0, medido | Lado de Seedance 2.5, mismo prompt |
|---|---|---|---|
| Película de desastre del monstruo marino | 10 tomas guionadas más una partitura orquestal dentro de 30s | 1920x1072, 24fps, 30.07s, AAC | generado a 30s, incrustado abajo; se eliminó un nombre de IP y el texto de la marca del barco para que el filtro de contenido de Seedance lo pasara, el storyboard es por lo demás idéntico |
| Monólogo en inglés de fantasía oscura | voz en inglés nativa y sincronización de labios en un lento avance continuo | 1280x720, 24fps, 30.05s, AAC | generado a 30s a partir del prompt textual, incrustado abajo |
| Anime deportivo 2D, prompt de dos líneas | puede el modelo llenar 30s con casi ninguna instrucción | 1280x720, 24fps, 30.05s, AAC | no generado aquí; se muestra como una cuadrícula de fotogramas solo de Wan para leer la estructura a lo largo del tiempo |
| Cortometraje de comedia con whip-pan (excluido) | 8 whip-pans y 8 tiempos emocionales sin un corte | 1280x720, 24fps, 30.04s, AAC | no ejecutado: la densidad del diálogo es específica del mandarín, una reescritura en inglés no sería una comparación justa equivalente |
Demo oficial de Wan 3.0: diez tomas guionadas y una construcción orquestal completa dentro de un solo pase de 30 segundos, a 1920x1072. Este es el argumento más difícil para 1080p nativo, porque el volumen de agua y el detalle de la piel mojada de la criatura son exactamente lo que una ampliación de 720p inventa en lugar de resolver. Manual del creador de Tongyi Alibaba, utilizado para comparación y comentario.
Seedance 2.5, el mismo prompt de desastre de diez tomas a 30s nativos, con sonido activado. Barco de pesca azotado por la tormenta, el marinero aterrorizado, el oleaje que se eleva, luego el leviatán de las profundidades rompiendo la superficie en el relámpago. Se eliminó una referencia de IP y el texto de la marca en el casco para que el filtro de contenido de Seedance lo pasara; el storyboard es por lo demás idéntico, que es lo que hace que el detalle del volumen de agua y la piel mojada sea una comparación justa equivalente con el clip de Wan 3.0 de arriba.
Demo oficial de Wan 3.0, con sonido activado. Diálogo de villano en inglés nativo, "Ripe enough for the void", entregado en una sola inclinación hacia arriba lenta sin corte. Este es el clip que los equipos de habla inglesa deberían probar, porque la voz, la sincronización de labios y un movimiento de cámara continuo de 30 segundos deben mantenerse todos a la vez.
Seedance 2.5, el mismo prompt de fantasía oscura copiado textualmente, 30s nativos, con sonido activado. Mismo villano de ojos violeta, las marcas de runas estelares, la nebulosa de sombra formándose en su palma abierta, y las dos líneas en inglés. Observa si la sincronización de labios y el único avance continuo se mantienen durante los 30 segundos completos como lo hacen en el lado de Wan 3.0.
Si ejecutas el lado emparejado de Seedance 2.5 de este, mantén las dos líneas en inglés textuales y recuerda la peculiaridad del acento de las notas de producción: escribe "American", no "American English". La palabra "English" empuja la entrega de vuelta hacia una lectura británica.
El tercero es la sorpresa tranquila. El prompt de anime deportivo 2D en el manual de Alibaba tiene dos líneas. Sin marcas de tiempo, sin lista de tomas, solo un boxeador golpeando un saco de boxeo, cansado, con dolor. Treinta segundos a partir de eso es una prueba genuina de si el modelo puede inventar su propia estructura. Aquí se muestra muestreado a lo largo de su propio tiempo de ejecución:

Cuatro fotogramas de la demo oficial de anime deportivo 2D de Wan 3.0 muestreados aproximadamente en los segundos 1, 10, 20 y 29, mostrando el diseño del boxeador y el fondo del gimnasio durante los 30 segundos completos
Cuatro fotogramas de la demo oficial de anime deportivo 2D de Wan 3.0, muestreados aproximadamente en los segundos 1, 10, 20 y 29. Mismo diseño de personaje, misma camiseta de tirantes, mismo saco de boxeo, misma fila de taquillas, a través de un cambio de plano general a primer plano que el prompt nunca pidió. Una cuadrícula fija en lugar de un clip, porque la comparación aquí es a lo largo del tiempo dentro de un solo archivo, no de movimiento.
Lectura práctica: con un prompt de dos líneas, el modelo inventó su propia cobertura, moviéndose de un plano general fijo a un primer plano de sudor y agotamiento, y mantuvo el diseño del personaje mientras lo hacía. Esa es la buena noticia. La compensación es que cediste el control de cuándo sucede algo. Si necesitas que 30 segundos aterricen un tiempo específico en un segundo específico, escribe las marcas de tiempo.
Prueba la narración de 30s nativos gratis antes de pagar por cualquiera
Una ejecución de 30 segundos a 720p en Seedance 2.5 cotiza alrededor de $9 una vez que calculas la resolución real en lugar del mínimo del catálogo. Una ejecución de 30 segundos a 1080p en la hoja de precios de Wan 3.0 es de $6.00. Ninguno es caro para los estándares de producción, pero con una relación de 3.2 a 1, no estás comprando un clip, estás comprando tres o cuatro.
Antes de gastar algo, vale la pena responder una pregunta más barata: ¿mi guión realmente se sostiene como una sola toma continua? La mayoría de los fallos de 30 segundos no son fallos del modelo. Son fallos de estructura, tres tiempos metidos donde había espacio para dos, o un remate escrito en el segundo 26 sin nada que lleve los segundos 8 al 20.
El generador gratuito de skits publicitarios con IA de Atlas Cloud responde a eso por nada. Le das una descripción de producto y hasta cuatro fotos del producto, cada una de menos de 8MB, eliges uno de seis estilos (meme divertido, giro argumental, comedia de situación, conmovedor, lujo o venta agresiva), y primero escribe un guión de dos personajes, con un gancho de tres segundos, un conflicto y un giro, luego construye cada toma alrededor de ese guión. Los personajes dicen sus líneas en voz alta y los efectos de sonido se renderizan en el video.
Los límites honestos: son 15 segundos, no 30, necesitas iniciar sesión, y obtienes una generación gratuita antes de recargar créditos. Pero 15 segundos con un gancho, un conflicto y un giro te dicen si tus tres tiempos respiran. Si la estructura funciona allí, toma los mismos tiempos, estíralos en el esqueleto 0-8s / 8-16s / 16-24s / 24-30s del Paso 1, y ve a gastar los nueve dólares en un pase nativo real de 30 segundos.
Lo que realmente cuesta un clip de 30s nativos en Wan 3.0 vs Seedance 2.5
| Configuración | Tarifa | Duración | Un clip |
|---|---|---|---|
| Wan 3.0, 1080p nativo (solo Alibaba Cloud) | $0.20 / seg | 30s | $6.00 |
| Wan 3.0, 720p nativo (solo Alibaba Cloud) | $0.10 / seg | 30s | $3.00 |
| Wan 3.0, 480p nativo (solo Alibaba Cloud) | $0.05 / seg | 30s | $1.50 |
| Seedance 2.5, 720p nativo, en Atlas Cloud | $0.30 / seg medido a 720p, listado desde $0.134 | 30s | aprox. $9.09 |
| GPT Image 2 fotograma de apertura, calidad alta, 2048x1152 | listado desde $0.009 / imagen | 1 imagen | $0.1745 cotizado |
La comparación que realmente lo decide: Wan 3.0 a 720p es más barato por segundo que Seedance 2.5 a 720p, y a 1080p es el único de los dos que vende píxeles reales. La respuesta de Seedance 2.5 son 50 espacios de referencia, disponibilidad en vivo y una API funcional contra la que puedes enviar esta misma tarde.
Nota de obtención y licencia para estos clips de 30s nativos
Cada clip de Wan 3.0 y cada prompt de Wan 3.0 en este artículo provienen del manual del creador de Tongyi Wan 3.0 distribuido públicamente por Alibaba, reproducido aquí para comparación y comentario, acreditado, sin modificar y sin eliminar la marca de agua. El uso comercial de la salida de Seedance 2.5 está sujeto a los términos de ByteDance y Volcengine; la facturación de la API y el manejo de datos en el lado de Atlas Cloud están sujetos a los términos propios de Atlas Cloud. No se reproduce la imagen de ninguna persona real en ninguna parte de esta prueba. Si estás enviando trabajo de clientes, lee los términos del modelo para el endpoint específico al que llamas, no un resumen del blog de los mismos.
Preguntas frecuentes
¿Los 30s nativos de Wan 3.0 son realmente un solo pase o clips unidos?
Un solo pase. Wan 3.0 genera de 2 a 30 segundos en una sola generación con una opción de duración inteligente, por lo que también puede decidir que el clip no necesita los 30 completos. Eso es diferente de la extensión del último fotograma, donde un segundo clip se siembra a partir del fotograma final del primero y la identidad se desvía a través de la unión.
¿Cuál es realmente 1080p a 30 segundos, Wan 3.0 o Seedance 2.5?
Wan 3.0. Tiene un nivel nativo de 1080p en su hoja de precios, y los propios archivos demo de 30 segundos de Alibaba miden 1920x1072. Seedance 2.5 genera nativamente solo en 480p y 720p; sus opciones de 1080p, 1440p y 4K son mejoras de una fuente de 720p, y sus documentos de API describen el nivel 4K como "no generación 4K nativa".
¿La imagen todavía se desmorona en el segundo 25?
Puede, pero el fallo cambió de forma. En lugar de una unión visible entre clips, obtienes morphing y decoherencia dentro de la toma, concentrados en pasajes de movimiento rápido, y la ampliación no lo elimina. Una producción documentada de cortometraje con Seedance 2.5 ejecutó una relación de 3.2 a 1, así que planifica tomas largas con cobertura.
¿Qué modelo acepta más material de referencia?
Seedance 2.5, por un amplio margen: 30 imágenes más 10 videos más 10 archivos de audio, 50 en total, con video y audio de referencia cada uno limitado a 30 segundos combinados por solicitud. El manual de Wan 3.0 limita las referencias a 20, pero es el único que acepta archivos .pdf, .ppt, .xls, .doc, .txt y páginas web en vivo como entrada creativa.
¿Wan 3.0 tendrá pesos abiertos?
No hay un compromiso oficial. A partir de la beta pública de agosto de 2026, no se han publicado pesos de Wan 3.0, checkpoint de Hugging Face o nodo de ComfyUI, y los pesos abiertos oficiales para la línea de video insignia se detienen en Wan 2.2 (Kingy AI, agosto de 2026). Trata cualquier otra cosa que leas sobre un lanzamiento de pesos 3.0 como especulación hasta que Alibaba diga lo contrario.






