Consistencia multi-toma de Wan 3.0: Conté cada corte en 110 clips oficiales
Escribiste un guion de cuatro tomas. La toma 1 sale perfecta: sombrero de paja, collar de cuentas negras, vestido de lino blanco, luz exactamente correcta. Llega la toma 2 y es una mujer diferente con un sombrero diferente.
Esa brecha es la razón por la que todo el mundo está mirando la consistencia multi-toma de Wan 3.0, la promesa de un solo prompt, seis tomas, treinta segundos, el mismo personaje en todo momento.
Así que dejé de leer fichas técnicas. Descargué los 110 archivos de demostración que Alibaba publicó con su propio manual para creadores de Wan 3.0, ejecuté ffmpeg sobre cada uno, analicé los 64 prompts emparejados, y luego hice lo que nadie en los resultados de búsqueda ha hecho: conté los cortes reales en los videos entregados y los comparé con la cantidad de tomas que cada prompt solicitaba.
Tres hallazgos contradicen lo que leerás en todas partes.

Suite de gradación de color cinematográfica donde una pared de monitores muestra al mismo personaje del sombrero de paja sostenido en seis tomas diferentes, el punto de referencia para la consistencia multi-toma de Wan 3.0
La pared de referencia de un colorista es el modelo mental honesto para la consistencia multi-toma: una identidad, seis encuadres, revisados lado a lado. Generado con openai/gpt-image-2.
Conclusiones clave
- 6 tomas es real pero no garantizado: 3 de los propios prompts multi-toma de Alibaba alcanzaron exactamente el número declarado, 2 se quedaron cortos.
- El peor caso pedía 4 tomas y generó 2.
- Sin 4K. Ninguno de los 110 archivos oficiales supera 1080p, y solo 4 son exactamente 1920x1080.
- Los accesorios y la cámara se desvían antes que los rostros. Mira el sombrero, no los ojos.
- No hay API pública de Wan 3.0 fuera de la propia plataforma de Alibaba todavía, así que el tutorial a continuación lo reconstruye en modelos a los que puedes llamar hoy.
Aquí está el mejor resultado, del manual de Alibaba. Seis tomas declaradas en el prompt, seis tomas entregadas, los mismos dos personajes, la misma vestimenta, la misma lluvia:

Secuencia anime de seis tomas en una plataforma de tren lluviosa, la misma chica con un paraguas transparente y el chico con una mochila caqui mantenidos consistentemente en cada corte
Demo beta oficial de Wan 3.0 de Alibaba (clip del manual v013, 1280x720, 20.05s). El prompt numeró las tomas del 1 al 6; ffmpeg encuentra exactamente 5 cortes duros, así que las 6 tomas se cumplieron. No generado por Atlas Cloud.
Qué es realmente la consistencia multi-toma de Wan 3.0
Versión corta: son tres promesas separadas bajo un mismo nombre, y Alibaba es inusualmente específico sobre cuáles tres.
En su publicación de lanzamiento, Alibaba divide la consistencia en personajes ("rasgos faciales, peinado y color de cabello, forma del cuerpo, vestimenta y accesorios"), accesorios ("aparición multiángulo, estructura de hardware, logotipos y detalles de material") y espacio ("bloqueo de personajes y perspectiva de cámara") (Alibaba Cloud, 2026). Esa división en tres capas es la rúbrica de evaluación para todo lo que sigue. Misma cara, collar incorrecto, es un fracaso.
El modelo genera hasta 30 segundos en un solo trabajo, a 480P, 720P o 1080P (Alibaba Cloud, 2026).
Ahora la parte que los resultados de búsqueda se equivocan.
| Afirmación común en resultados de búsqueda | Lo que realmente muestra el material de primera mano |
|---|---|
| "Generación nativa en 4K" | La publicación oficial enumera solo 480P / 720P / 1080P. En 110 archivos de demostración oficiales, nada supera 1080p, y solo 4 archivos son exactamente 1920x1080. La salida de paisaje "1080p" habitual es 1920x1072. |
| "Hasta 6 tomas independientes por generación" | No aparece una especificación de conteo de tomas en la publicación de lanzamiento de Alibaba. Empíricamente se sostiene: de 8 prompts explícitamente multi-toma en el manual, el máximo que declara alguno es 6, y dos de esos entregaron 6. |
| "Hasta 12 imágenes de referencia" | Pruebas prácticas reportan hasta 10 imágenes más 5 clips de video más 5 clips de audio (Curious Refuge, 2026). La publicación de Alibaba no da ningún número. |
| "Pesos abiertos, Apache-2.0" | Lanzamientos anteriores de Wan tenían pesos abiertos; Wan 3.0 se distribuye como un servicio de plataforma y no han aparecido pesos (Curious Refuge, 2026). |
| "La API está disponible" | Se ejecuta en Alibaba Cloud Model Studio. Las plataformas de inferencia de terceros aún no lo tienen. |
Y esta es la tabla que más tiempo llevó construir. Cada número es mío, de la detección de escenas con ffmpeg en el archivo entregado frente al conteo de tomas escrito en el prompt emparejado:
| Demo oficial | Prompt declara | Cortes duros encontrados | Tomas entregadas | Veredicto |
|---|---|---|---|---|
| v013 plataforma lluviosa, anime | 6 tomas | 5 | 6 | Exacto |
| v055 diario golden retriever | 6 tomas, 30.0s | 5 | 6 | Exacto |
| v021 ramen shop y gatito | 4 tomas | 3 | 4 | Exacto |
| v008 lago del bosque, 3D | 4 tomas | 2 | 3 | Una menos |
| v085 mujer sombrero de paja | 4 tomas | 1 | 2 | La mitad |
| v041 pasillo a callejón mágico | 3 segmentos, "sin corte duro" | 0 | 1 toma continua | Exactamente como se pidió |
| v045, v084, v102 | 3 / 5 / multi-sujeto | Demasiados para resolver | No contable | Corte rápido y estroboscopía de tinta china vencen detección |
Lee las filas del medio otra vez. Tres prompts alcanzaron su número exactamente. Dos no lo hicieron. El conteo de tomas que escribes es una solicitud, no un contrato.
Por qué se rompe la consistencia multi-toma de Wan 3.0: 4 modos de fallo
Veredicto primero: rara vez se rompe en la cara. Se rompe en los objetos y la cámara, y se rompe más fuerte cuando cambias varias cosas a la vez.
Aquí está el clip que más me enseñó, porque es el peor rendimiento en la propia muestra de Alibaba.
GtZy2TUK4ak
Demo beta oficial de Wan 3.0 de Alibaba (clip del manual v085, 1240x742, 30.08s). El prompt describe cuatro tomas con marcas de tiempo. ffmpeg encuentra un corte real, a los 9.3s. Las tomas 3 y 4 colapsan en una sola toma mantenida que se desvanece a negro. No generado por Atlas Cloud.
Modo de fallo 1: los accesorios se desvían antes que los rostros. En ese clip, mira solo la toma inicial, antes de que ocurra cualquier corte. A los 0.6s el sombrero de paja tiene una banda negra delgada y el colgante es una piedra azul facetada. A los 9.2s la banda es una cinta negra ancha y el colgante es una gota negra brillante lisa. Su cara es estable todo el tiempo. Los accesorios no.

Dos fotogramas de la misma toma continua de nueve segundos, lado a lado, mostrando cómo la banda del sombrero se ensancha y el colgante del collar cambia de forma y color
Ambos fotogramas provienen de la misma toma ininterrumpida de la demo oficial v085, con 8.6 segundos de diferencia, sin corte entre ellos. La banda del sombrero y el colgante cambian. Esto es la capa de accesorios fallando mientras la capa del personaje se mantiene.
Por eso la prueba de aceptación que realmente funciona es una lista de verificación de accesorios, no una verificación de ambiente. Para este personaje son tres elementos: forma y banda del sombrero, collar de cuentas y colgante, escote del vestido.
Modo de fallo 2: las escenas con múltiples sujetos se mantienen individualmente y se difuminan al contacto. Cada personaje se mantiene reconocible por separado. Ponlos en el mismo cuadro, interactuando, y las identidades se mezclan. Pruebas independientes encontraron lo mismo: "La consistencia del personaje comenzó a descomponerse, y la composición ocasionalmente parecía más un mal efecto de pantalla verde que un entorno generado naturalmente", con la sincronización de labios señalada como la mayor debilidad (Curious Refuge, 2026).
Modo de fallo 3: cambiaste cuatro variables en una sola línea. Nueva ubicación más nuevo ángulo de cámara más nueva iluminación más nuevo estado de vestimenta es la forma confiable de perder una identidad. Los propios prompts del manual combaten esto repitiendo todo el atuendo en cada segmento. En los 64 prompts emparejados, 9 dicen explícitamente "permanece sin cambios", 5 fijan la posición de la cámara y 4 exigen que el personaje permanezca idéntico.
Modo de fallo 4: 30 segundos en un solo trabajo no son 30 segundos de una sola toma. Estos son productos diferentes. Un trabajo multi-toma de 30s corta entre encuadres. Si lo que quieres es una sola toma continua e ininterrumpida, encadenar continuaciones degrada: el error de identidad se acumula en cada traspaso, por lo que la toma única limpia es corta por naturaleza.
El manual tiene exactamente un prompt que logra la continuidad perfecta, y vale la pena copiar la estructura de la oración:

Tres segmentos de prompt renderizados como una sola toma continua e ininterrumpida, desde un pasillo de apartamento a través de una puerta hasta un callejón gótico iluminado con lámparas
Demo beta oficial de Wan 3.0 de Alibaba (clip del manual v041, 720x1280, 15.04s). Tres segmentos de prompt, y ffmpeg encuentra cero cortes duros, que es exactamente lo que exigía el prompt. No generado por Atlas Cloud.
Su línea de transición, traducida, es lo más reutilizable de todo el manual: continuar sin problemas desde el último fotograma del segmento anterior; el personaje, la vestimenta, la ubicación y la posición de la cámara permanecen completamente idénticos; sin corte duro ni transición abrupta de escena. Solo un prompt de 64 lo usa. Róbatelo.
El flujo de trabajo de consistencia multi-toma que puedes ejecutar hoy
La pregunta es: ¿dónde ejecutas esto realmente?
Ahora mismo Wan 3.0 vive en el propio Model Studio de Alibaba. Ninguna plataforma de inferencia de terceros lo aloja. En Atlas Cloud aparece solo como una entrada de próximamente sin puntos finales en vivo, que es el estado honesto de las cosas y vale la pena decirlo claramente en lugar de fingir lo contrario.
Así que tienes dos opciones: esperar, o dejar de pedirle a un solo prompt que haga seis cosas.
La segunda opción es mejor de todos modos, y mi conteo de cortes es el argumento a favor. Un solo trabajo multi-toma te dio un conteo de tomas que falló por la mitad en la propia muestra de Alibaba. Dividir el trabajo devuelve ese control a tus manos:
- Fija el aspecto una vez, como una imagen fija.
- Clona esa identidad en un fotograma clave por toma, cambiando exactamente una variable cada vez.
- Anima cada toma por separado con la referencia fijada.
- Une localmente.
Más lento de configurar, dramáticamente más predecible. Y cada modelo en la cadena se puede llamar hoy.
| Paso | Modelo | Rol en la cadena | Precio listado |
|---|---|---|---|
| 1 | bytedance/seedream-v5.0-pro/text-to-image | Fijar el aspecto del personaje | $0.045 / imagen |
| 2 | google/nano-banana-2/edit | Clonar identidad en cada fotograma clave de toma | $0.08 / imagen |
| 3 | alibaba/wan-2.7/reference-to-video | Animar cada toma con la referencia fijada | $0.10 / segundo |
| Alt | alibaba/wan-2.7/text-to-video | Un prompt, muchas tomas (menos controlable) | $0.10 / segundo |
| Fix | alibaba/wan-2.7/video-edit | Reparar un accesorio incorrecto sin regenerar | $0.10 / segundo |
Vale la pena saber para la pregunta "mejor modelo para consistencia multi-toma": referencia-a-video es toda una categoría ahora. bytedance/seedance-2.0-fast/reference-to-video cuesta $0.072/s (20% de descuento sobre $0.09, a agosto de 2026), kwaivgi/kling-video-o3-pro/reference-to-video $0.095/s (15% de descuento sobre $0.112), minimax/h3/reference-to-video $0.10/s, y google/veo3.1/reference-to-video $0.20/s. Todos los precios verificados contra el catálogo en vivo el 21 de agosto de 2026.
Una advertencia antes de los pasos: los precios listados son un piso, no una cotización. La resolución y la duración mueven el número real, así que lee el botón Ejecutar antes de comprometerte.
Cómo construir consistencia multi-toma estilo Wan 3.0, paso a paso
Estamos reconstruyendo la misma hoja de ritmos que el propio modelo de Alibaba falló: la mujer del sombrero de paja, cuatro tomas, jardín a coche. Mismo guion, control por toma, y esta vez obtienes cuatro tomas porque renderizaste cuatro.
Empecemos.
Paso 1: fijar el aspecto. Una imagen se convierte en el ancla de identidad para todo lo posterior. Genérala en Seedream v5.0 Pro, 16:9, la resolución más alta que ofrezca la página. Nombra explícitamente los tres accesorios de control, porque esos son los que se desvían.
plaintext135mm film still, vintage sunlit rose garden. An elegant young woman wearing a 2natural straw boater hat with a black band, a black beaded necklace with a single 3teardrop pendant, and a white sleeveless linen dress. She stands before a wall of 4blooming pink and cream roses, one hand lightly touching the brim of her hat, 5gentle and thoughtful gaze just off camera. Soft warm natural light, dappled sun 6flare, shallow depth of field, fine film grain, medium close-up.

Playground de Seedream v5.0 Pro en Atlas Cloud con el prompt del sombrero de paja ingresado y el fotograma clave del personaje terminado renderizado en el panel de salida
Paso 1 completado: el ancla de identidad para toda la secuencia de cuatro tomas.
Paso 2: clonar la identidad en las tomas 2 a 4. Un fotograma clave por toma, una ejecución cada uno, usando Nano Banana 2 Edit con la salida del Paso 1 como referencia. La disciplina que importa: repetir toda la vestimenta cada vez, luego cambiar exactamente una cosa.
Toma 2, el giro emocional:
plaintext1Keep the exact same woman from the reference image: identical face, identical 2natural straw boater hat with black band, identical black beaded necklace with a 3teardrop pendant, identical white sleeveless linen dress. New shot: cinematic 4close-up, she slowly lifts the straw hat off her head and lowers her chin, a faint 5wistful expression. Same rose garden background. Strictly preserve the same 6lighting, skin tone, film grain and colour grade as the reference.
Toma 3, el corte al coche:
plaintext1Keep the exact same woman from the reference image: identical face, identical black 2beaded necklace with a teardrop pendant, identical white sleeveless linen dress, 3the straw boater hat now resting on her lap. New shot: back seat of a moving car, 4side profile, her hand propped against the door, gazing out a rain-beaded window, 5blurred green foliage rushing past. Overcast light with a warm interior fill, 6shallow depth of field, elegant melancholy. Strictly preserve the same face, the 7same colour grade and the same 35mm film grain as the reference.
Toma 4, la última mirada:
plaintext1Keep the exact same woman from the reference image: identical face, identical black 2beaded necklace with a teardrop pendant. New shot: extreme facial close-up beside 3the car window, eyes slowly closing, a calm and released expression. Raindrops 4slide down the glass in front of her, focus shifting onto the droplets, background 5falling into bokeh. Wong Kar-wai style cinematic mood, fine film grain. Strictly 6preserve the same face, the same lighting and the same colour grade as the 7reference.

Playground de Nano Banana 2 Edit en Atlas Cloud con el fotograma clave del Paso 1 cargado como referencia y el fotograma clave de la toma 2 renderizado, identidad y vestimenta mantenidas
Paso 2 completado: fotograma clave de la toma 2, misma mujer, sombrero ahora en sus manos.
Paso 3: animar la toma 1 con la referencia fijada. Ahora cada toma se convierte en video de forma independiente en Wan 2.7 reference-to-video. Configuración: 720P, 5 segundos, y coloca el fotograma clave del Paso 1 en la ranura de Imágenes. Verifica la cotización del botón Ejecutar antes de lanzarlo.
plaintext1Shot 1 of 4. Reference image 1 defines the character: keep the same face, the same 2natural straw boater hat with black band, the same black beaded necklace with a 3teardrop pendant and the same white sleeveless linen dress identical for the entire 4clip. 35mm film look, vintage sunlit rose garden. The woman lightly touches the 5brim of her hat as a soft breeze lifts strands of her hair; the camera pushes in 6very slowly. Warm natural light, dappled sun flare, shallow depth of field, fine 7film grain. The camera position stays stable. No hard cut and no scene change.

Playground de Wan 2.7 reference-to-video en Atlas Cloud con el fotograma clave en la ranura de Imágenes y el clip terminado de cinco segundos reproduciéndose en el panel de salida
Paso 3 completado: el clip con referencia fijada renderizado en el panel de salida.
Y aquí está lo que salió:

Clip de cinco segundos con referencia fijada de la mujer del sombrero de paja en el jardín de rosas, banda del sombrero y collar manteniéndose estables durante todo el tiempo
Nuestra propia ejecución en Atlas Cloud, no una demo de Alibaba. Mostrado como un GIF silencioso; el archivo entregado lleva una pista de audio.
Paso 4: encadenar las tomas 2 a 4, luego unir. Repite el Paso 3 para cada fotograma clave restante, y pega la oración de transición del manual al inicio de cada prompt siguiente:
plaintext1Continue seamlessly from the last frame of the previous segment. The character, 2the wardrobe, the location and the camera position stay completely identical. 3No hard cut and no abrupt scene transition.
Luego concatena localmente con ffmpeg y ejecuta la verificación de aceptación de tres puntos: forma y banda del sombrero, collar de cuentas y colgante, y si la progresión de encuadre entre tomas tiene sentido. Si exactamente un accesorio está mal en una toma, no regeneres la toma. Envíala a través de wan-2.7/video-edit y cambia solo eso, tomando prestada la redacción del manual: mantener las acciones, la vestimenta y el resto del fotograma sin cambios.
Variaciones: escenas con múltiples sujetos y bloqueos de estilo
Tres patrones del manual que vale la pena robar.
Tarjetas de personaje para tomas con múltiples sujetos. Cuando dos o más personas comparten el cuadro, los prompts oficiales asignan tarjetas de personaje con letras y vuelven a declarar el atuendo completo de cada uno en cada segmento. Verboso, feo, y funciona mejor que los pronombres.
Declaración de estilo global para trabajos estilizados. Tinta china, animación cel y otros estilos pesados necesitan que el estilo se fije una vez para toda la pieza, luego una hoja de ritmos con marcas de tiempo debajo.

Secuencia de artes marciales en tinta china con un espadachín en un bosque de bambú, estilo bloqueado en una pelea de cinco ritmos con marcas de tiempo
Demo beta oficial de Wan 3.0 de Alibaba (clip del manual v084, 20.05s, recortado). Cinco ritmos con marcas de tiempo bajo una declaración de estilo global de tinta china. El pincelado estroboscópico es por qué la detección automática de cortes no puede contar esta. No generado por Atlas Cloud.
Repara, no regeneres. Una pasada de video-edit sobre un accesorio incorrecto es más barata que un renderizado nuevo y no puede romper las tomas que ya estaban bien.
Cuánto cuesta una secuencia de cuatro tomas
Números concretos para la secuencia construida arriba, a tarifas listadas:
- 1 ancla de identidad en Seedream v5.0 Pro: $0.045
- 3 fotogramas clave de toma en Nano Banana 2 Edit: 3 x $0.08 = $0.24
- 4 clips de 5s, 720P, en Wan 2.7 reference-to-video: 20s x $0.10 = $2.00
- Total: aproximadamente $2.29 por una secuencia de 20 segundos, cuatro tomas, identidad bloqueada
Extiéndelo a una pieza de seis tomas y 30 segundos y la línea de video se convierte en $3.00, llegando a cerca de $3.44 todo incluido.
Dos advertencias honestas. Primero, los precios listados son un piso: los niveles de resolución y la duración cambian el cargo real, y la cotización del propio botón Ejecutar del playground es el único número que vincula, por lo que las capturas de pantalla anteriores importan más que esta lista. Segundo, en Wan 3.0 en sí, Alibaba precios de generación de video en Model Studio por segundo según el nivel de resolución, pero no pude confirmar las tarifas exactas por segundo de Wan 3.0 desde una página de primera mano, así que no estoy citando cifras que no pude verificar.
Vale la pena señalar lo que estás comprando con el enfoque de trabajo dividido: no un precio más bajo, sino un conteo de tomas que coincida con tu guion. Según la evidencia de la propia muestra de Alibaba, eso no es algo que un solo trabajo de 30 segundos pueda prometerte todavía, y es la respuesta práctica a la consistencia multi-toma de Wan 3.0 hasta que la API se abra.
Preguntas frecuentes
¿Cuántas tomas puede mantener consistentes Wan 3.0 en una sola generación?
Seis, según la evidencia actual, con una salvedad. La publicación de lanzamiento de Alibaba no publica ninguna especificación de conteo de tomas. En los 8 prompts explícitamente multi-toma de su manual oficial, el máximo que declara alguno es 6, y dos de esos entregaron exactamente 6 tomas verificadas con cortes. Trata 6 como un límite observado, no una garantía.
¿Wan 3.0 realmente genera 4K nativo?
No. La publicación oficial enumera solo 480P, 720P y 1080P. En todos los 110 archivos de demostración oficiales, nada supera 1080p, solo 4 archivos son exactamente 1920x1080, y la salida de paisaje común es 1920x1072. Las frecuencias de imagen se dividen en 24fps para 63 archivos y 30fps para 46.
¿La API de Wan 3.0 está disponible, y dónde puedo ejecutarla?
Se ejecuta en Alibaba Cloud Model Studio. Ninguna plataforma de inferencia de terceros la aloja todavía; Atlas Cloud la lista como una entrada de próximamente sin puntos finales en vivo. Si necesitas salida multi-toma esta semana, la cadena de Wan 2.7 reference-to-video anterior es el sustituto funcional.
¿Por qué mis personajes aún cambian entre tomas incluso con una imagen de referencia?
Generalmente porque un prompt cambió la ubicación, el ángulo de cámara y la iluminación simultáneamente. Cambia una variable por toma y repite toda la vestimenta en cada prompt. También verifica las cosas correctas: en la propia demo de Alibaba, la cara se mantuvo estable mientras la banda del sombrero y el colgante del collar cambiaron dentro de una sola toma ininterrumpida.
¿Los pesos de Wan 3.0 son de código abierto?
No se han lanzado pesos. Las versiones anteriores de Wan eran descargables y ejecutables localmente, mientras que Wan 3.0 se distribuye como un servicio de plataforma alojado. Cualquiera que cite una licencia Apache-2.0 para Wan 3.0 está repitiendo algo sin fuente de primera mano detrás.
¿Cuál es la forma más rápida de obtener consistencia multi-toma sin acceso a Wan 3.0?
Cuatro movimientos: fijar una imagen de identidad, clonarla en un fotograma clave por toma cambiando una sola variable cada vez, animar cada toma con referencia-a-video, luego unir localmente y verificar tus accesorios. Aproximadamente $2.29 y media hora para una secuencia de cuatro tomas.
Metodología: los 110 archivos de demostración y 64 prompts emparejados provienen del manual oficial para creadores de Wan 3.0 de Alibaba, archivado localmente el 11 de agosto de 2026. Los metadatos se leyeron archivo por archivo con ffmpeg; los conteos de tomas provienen de la detección de cambios de escena de ffmpeg con un umbral de 0.2, verificados contra fotogramas extraídos; la estructura de los prompts se analizó mediante programación. Los precios de Atlas Cloud se verificaron contra el catálogo de modelos en vivo el 21 de agosto de 2026.
Fuentes: Alibaba Cloud (agosto de 2026); Curious Refuge (2026).






