La línea Wan ya es la familia de video abierto más bifurcada de internet. Los repositorios de Wan 2.2 y Wan 2.1 tienen aproximadamente 17.000 estrellas cada uno (GitHub, agosto de 2026), y la página Wan-AI mueve cientos de miles de descargas al mes a través de sus puntos de control (Hugging Face, agosto de 2026). Así que cuando Wan 3.0 entró en acceso anticipado con generación nativa de 30 segundos, hasta 20 entradas de referencia y audio generado en la misma pasada que la imagen, la primera pregunta no fue si la gente lo usaría. Fue si alguien sabría cómo escribir para ello.
Porque una generación única de 30 segundos no es una versión más grande de un clip de 5 segundos. Es un problema de escritura diferente. Un prompt de 5 segundos describe una imagen que se mueve. Un prompt de 30 segundos dirige el tiempo: quién cambia, cuándo, en qué corte, con qué sonido debajo.
El manual del creador de Wan 3.0 que circula con el acceso anticipado incluye diecinueve casos oficiales de prompt y resultado. Estudié los diecinueve, luego elegí los tres que enseñan la técnica más transferible y los desglosé: qué controla realmente el prompt, por qué está construido de esa manera y cómo reutilizar su esqueleto para tus propias tomas. Cada video a continuación es la salida real y sin editar para el caso que se discute. Los prompts de los casos originales están escritos en chino; los esqueletos aquí son reformulaciones en inglés de su estructura, y la línea Wan acepta prompts en ambos idiomas.
Conclusiones clave
- Los prompts largos de Wan 3.0 comparten una arquitectura: primero las vinculaciones de referencia, segundo las reglas globales, tercero una lista de tomas con marcas de tiempo. Los prompts de prueba cortos pueden omitir capas, los prompts de producción no deberían.
- Escribe la interpretación como una cadena de acciones visibles, nunca como una etiqueta emocional. "Ansioso" es una esperanza. "Masticar se ralentiza, las cejas se fruncen, la mirada cae a sus manos" es una instrucción.
- El sonido es parte del prompt, no un paso posterior. El diálogo va entre llaves, los efectos y la música tienen sus propias oraciones, y el silencio debe solicitarse explícitamente.
- Los casos oficiales repiten su restricción más importante y prohíben el fallo que esperan. Un prompt del manual prohíbe el "deslizamiento suave" en tres formulaciones diferentes, porque el modelo por defecto tiende a lo suave.
- El movimiento se puede cuantificar: fotogramas por ráfaga, porcentaje del ancho del cuadro por dash, número de repeticiones. El caso de la libélula a continuación es la prueba.
Una generación, 30 segundos, diez tiempos numerados de storyboard y un arco completo de banda sonora escritos en un solo prompt: un barco pesquero, una tormenta y un monstruo marino que emerge a tiempo. Caso oficial del manual de Wan 3.0, mostrado aquí sin editar.
Qué hace diferente escribir un prompt de Wan 3.0
Tres capacidades cambian la tarea, y cada una añade una habilidad de escritura que los modelos más cortos nunca pidieron.
30 segundos nativos significa estructura. Cuando un modelo renderiza 5 segundos, un prompt puede ser una sola oración densa. A los 30 segundos, un prompt sin estructura se desvía: los personajes se intercambian la ropa, la cámara olvida su regla, el final no tiene nada que ver con el principio. Todos los casos largos del manual combaten la deriva de la misma manera, con etapas explícitas y estados finales. Esa estructura es el núcleo de esta guía.
Audio conjunto significa dirección de sonido. Wan 3.0 genera la banda sonora junto con la imagen. El diálogo, los efectos, el ambiente y la música se pueden incluir en el prompt, lo que también significa que una banda sonora no escrita es una banda sonora improvisada. Los casos oficiales tratan el audio con la misma disciplina que la luz: declarado, delimitado y, a veces, silenciado deliberadamente.
Hasta 20 referencias significa sintaxis de vinculación. Los rostros, las vestimentas, las ubicaciones, las voces e incluso las imágenes del storyboard se pueden fijar a materiales subidos. Los casos del manual vinculan cada referencia a un sujeto nombrado una vez, y luego reutilizan el nombre en cada toma posterior. Si has probado la misma disciplina en la generación actual, por ejemplo en Wan 2.7 reference-to-video, la versión 3.0 te resultará familiar, no nueva.
Nada de esto requiere escribir una novela cada vez. El caso bueno más corto del manual es una sola oración sobre un OVNI que roba una vaca en un estilo pintado a mano. La habilidad está en saber qué capas necesita tu toma, que es exactamente para lo que sirven los tres casos siguientes.
La pila de prompts de Wan 3.0: tres capas que comparten todos los casos largos
Si reducimos los diecinueve casos oficiales a sus huesos, los largos son todos la misma pila de tres capas.
Capa 1: vinculaciones de referencia. Una línea por material subido, indicando qué es y qué se puede tomar de él. Define a la mujer en la imagen 1 como Sujeto 1. Toma solo la vestimenta de la imagen 2. La voz del Sujeto 2 sigue al audio 1. Vincula una vez, luego refiérete por nombre para siempre. Plurales vagos como "las imágenes definen a los personajes" son exactamente lo que esta capa existe para prevenir.
Capa 2: reglas globales. Todo lo que debe mantenerse verdadero durante todo el clip, escrito antes de cualquier acción: estilo visual y sus puntos de referencia, un sistema de color nombrado, comportamiento de la luz, gramática de cámara, disciplina de interpretación, disciplina de audio y una lista de fallos prohibidos. Esta capa es donde los casos del manual son más agresivos. Un caso de artes marciales limita la cámara lenta a dos usos de menos de un segundo cada uno, prohíbe los subtítulos en pantalla, prohíbe la música de fondo por completo y prohíbe que la cámara se quede quieta más de 1,5 segundos.
Capa 3: la línea de tiempo. Tiempos con marcas de tiempo o numerados, cada uno con un evento principal y un estado final visible. No "pelean un rato" sino "0 a 1,5 segundos: él está en la línea de cañas, a contraluz, viento en su abrigo, y dice su única línea". Los estados finales son lo que mantiene el segundo quince coherente con el segundo cinco.
Una forma útil de tenerlo en la cabeza: la Capa 1 es el casting, la Capa 2 es el libro de reglas, la Capa 3 es la lista de tomas. Los tres casos que siguen enfatizan cada uno una capa diferente.
Caso 1: cómo escribir un prompt de Wan 3.0 para interpretación, un rostro durante 30 segundos
El caso menos llamativo del manual es el que la mayoría debería estudiar primero: un único primer plano fijo de una joven con toga de graduación azul, mantenido durante 30 segundos completos mientras habla, se preocupa y finalmente mira hacia abajo a sus manos.
Treinta segundos, una toma, sin corte. La toga te dice la escena, el ceño te dice lo que está en juego, y la caída de la mirada aterriza exactamente donde el prompt la puso. Caso oficial del manual, salida sin editar.
Esto es lo que hace el prompt oficial, movimiento por movimiento, en mis palabras en lugar de las suyas:
- Cámara antes que sujeto. Abre bloqueando el encuadre: primer plano frontal, cabeza y parte superior del cuerpo, y una imperfección deliberada, una segunda persona en el borde izquierdo que está completamente desenfocada. Los fondos que nombras y luego desenfocas son fondos que el modelo no agudizará a mitad de la toma.
- Vestuario como exposición. Una toga de graduación azul reemplaza un párrafo de ambientación. El modelo infiere la ceremonia, la multitud, el día. Elige la prenda o el accesorio que implique el mundo, y omite describir el mundo.
- Emoción como una cadena de actos visibles. El prompt nunca pide "ansiedad". Escribe la boca moviéndose mientras habla, el ceño ligeramente fruncido, la seriedad del rostro. Cada elemento es algo que una cámara puede verificar. Las etiquetas emocionales son esperanzas. Los movimientos musculares son instrucciones.
- El micromovimiento que vende realismo. Dos detalles hacen más que todo lo demás combinado: la cámara mantiene un leve balanceo de respiración de mano, y su mirada viaja de frente hacia abajo a sus manos, en una trayectoria declarada. Dale a cualquier toma larga un cambio lento y deliberado como ese y la toma se lee como dirigida en lugar de generada.
Esqueleto reutilizable, en inglés, estructura idéntica al caso:
Plain1Frontal [tamaño de plano] sobre [sujeto], [detalle de encuadre]. Un [elemento desenfocado] 2se encuentra en el [borde] del cuadro. [Sujeto] viste [una prenda que implica toda la escena]. 3[Sujeto] está [acción], boca moviéndose, [detalle de cejas / ojos / mandíbula]. La luz cae 4desde [dirección], manteniendo [nota de textura de piel / tela]. La cámara está fija pero 5lleva un leve balanceo de respiración de mano. A lo largo de la toma, [un cambio lento y 6visible: una trayectoria de mirada, un cambio de postura, un objeto bajado].
Llena esa plantilla con un sujeto propio antes de tocar las épicas de 30 segundos. Si el rostro se mantiene durante treinta segundos, tu estructura es sólida.
Caso 2: cómo estructurar un prompt de 30 segundos de Wan 3.0 como un director
El corto absurdo del manual es el mejor objeto de enseñanza estructural de todo el documento: una vaquera monta un caballo real en una solitaria gasolinera de la Ruta 66, toma la manguera y llena su caballo con hierba fresca mientras la cosmovisión del empleado se derrumba silenciosamente.
Treinta segundos de presentación inexpresiva y un gag visual perfecto. La comedia está escrita en la estructura: encuadre observacional fijo, luego un primer plano extremo repentino justo cuando ocurre lo absurdo. Caso oficial del manual, salida sin editar.
Su prompt está organizado como cinco módulos nombrados, y la lista de módulos en sí misma es la lección:
- Un logline. Dos oraciones sobre lo que sucede y cuál es el chiste. No visuales, historia. Escribir esto primero te obliga a saber para qué son los 30 segundos.
- Un sistema de color nombrado. No "colorido" sino una ley de dos colores: cielo turquesa y tierra naranja, luego cada objeto importante asignado a un lado de ella: la bomba roja descolorida, la bufanda naranja, las montañas terracota. Nombra el sistema, luego distribúyelo. La consistencia en el video de IA suele ser un problema de paleta antes que un problema de personaje.
- Una lista de reparto con funciones narrativas. Cada personaje recibe dos o tres rasgos visibles y, crucialmente, una función: el empleado es designado explícitamente como el portador del plano de reacción de la película. Asignar una función le dice al modelo dónde pertenece la atención de la cámara en cada tiempo en que aparece ese personaje.
- Una filosofía de cámara nombrada. El caso inventa una regla y la define en una línea: observación tranquila más primer plano absurdo, lo que significa planos medios fijos y paneos lentos como valor predeterminado, interrumpido por un primer plano extremo repentino solo cuando ocurre el evento absurdo. Nombrar tu regla de cámara y luego referirte a ella supera volver a describir los movimientos de cámara en cada tiempo. También es todo el mecanismo cómico: la mirada plana hace que el primer plano de la bomba de hierba impacte.
- Una línea de tiempo de cuatro actos con estados finales. Planteamiento, escalada, remate, consecuencias, cada uno con un rango de tiempo, un evento principal y una imagen final congelada, hasta que el palillo finalmente cae de la boca del empleado en el último tiempo.
El modelo transferible es más grande que la comedia. Logline, ley de paleta, reparto con funciones, una regla de cámara nombrada, cuatro actos con estados finales: eso es un brief de producción, y Wan 3.0 es la primera generación de esta familia con suficiente pista, treinta segundos de ella, para que un brief importe. La demostración del monstruo marino al principio de este artículo es el mismo esqueleto con diez tiempos y un arco musical con partitura, escrito de la misma manera: cada tiempo un evento, cada tiempo un estado final visible.
Caso 3: escribir física de movimiento en un prompt de Wan 3.0
Lo más difícil de obtener de cualquier modelo de video es un movimiento que no sea suave. Los modelos tienden a un movimiento suave y continuo, por lo que cada hada de IA flota como un globo lento. El hada del manual no flota. Se mueve como una libélula: flotación fija, dash instantáneo, parada total, nueva dirección.

Flotación, dash, parada brusca. El desenfoque en medio de cada ráfaga tiene uno o dos fotogramas de ancho, exactamente como lo presupuestó el prompt. Caso oficial del manual, mostrado como un GIF silencioso; el clip entregado lleva su propio ambiente.
Este prompt gana con cuatro técnicas que puedes tomar directamente:
- Declaración de prioridad al principio. La primera línea anuncia el requisito de máxima prioridad, la ley de movimiento de la libélula, antes de cualquier escenario. La atención es un presupuesto. Gasta los tokens iniciales en la regla que decide el éxito, no en el color de la alfombra.
- Un ancla de física del mundo real. En lugar de adjetivos como "rápido y ágil", el prompt nombra un animal cuya firma de movimiento el modelo ha visto miles de veces: flotación puntual, lanzamiento en ráfaga, parada total, reorientación aguda. Un ancla familiar supera a diez adverbios abstractos.
- Números donde los adjetivos se difuminarían. El dash debe cruzar del 60 al 90 por ciento del ancho del cuadro en 3 a 5 fotogramas. La parada debe mantenerse de 2 a 4 fotogramas. Deben ocurrir al menos seis ráfagas claramente separadas en los primeros ocho segundos. El desenfoque de movimiento residual se presupuesta en 1 a 2 fotogramas. Ya no estás escribiendo poesía, estás escribiendo una especificación, y el modelo la respeta. Mira la tira a continuación: el fotograma a mitad del dash es pura estela, los fotogramas a cada lado están perfectamente nítidos.
- Prohibir el comportamiento por defecto. El prompt prohíbe explícitamente el fallo que predice, en múltiples formulaciones: no hada flotando lentamente, no crucero a velocidad uniforme, no deslizamiento suave continuo, y luego una oración correctiva que dice lo que el movimiento no es, "no una trayectoria de vuelo continua, sino desplazamientos cortos, agudos, casi saltando fotogramas". Cuando sabes lo que el modelo hará en piloto automático, escribe el piloto automático fuera de la toma.

Cuatro fotogramas consecutivos del caso de la libélula: flotación junto al osito de peluche, desenfoque de movimiento a mitad del dash, llegada sobre los bloques, flotación en parada total
Cuatro fotogramas de la salida anterior. Nítido, estriado, nítido, nítido: el presupuesto de desenfoque del prompt, visible fotograma a fotograma.
Las mismas cuatro técnicas se generalizan a cualquier problema de movimiento: barridos que no deben convertirse en cortes, impactos que necesitan peso, movimiento mecánico que no debe volverse orgánico. Ancla, cuantifica, prioriza y prohíbe el comportamiento por defecto.
Diálogo, sonido y sintaxis de referencia en prompts de Wan 3.0
Los tres casos anteriores son silenciosos sobre la mecánica que hace que los prompts de Wan 3.0 hablen, así que aquí está la capa de sintaxis, compilada del resto de los casos del manual.
El diálogo va entre llaves. Las líneas habladas se envuelven como {Qué grupo muscular hoy} en lugar de dejarse en prosa abierta, lo que evita que el modelo narre tu diálogo como un subtítulo. Las líneas llegan con sincronización labial, y una escena de diálogo se escribe como acción alternada y líneas entre llaves, exactamente como un guion.
Las voces se pueden asignar. La sintaxis de referencia se extiende al audio: define a la mujer en la imagen 1 como Sujeto 1, luego indica que la voz del Sujeto 1 sigue al audio 1. Rostro de un archivo, voz de otro, ambos bloqueados durante la duración.
El audio necesita una declaración de disciplina. Los casos más fuertes declaran su paisaje sonoro de la misma manera que declaran su paleta. Un caso de animación indica sus tipos de audio al principio: solo ambiente y música, sin habla. El caso de artes marciales va más allá, prohibiendo la música de fondo por completo, manteniendo solo respiración, fricción de tela, golpes y viento, y obtiene exactamente eso. La música, cuando se desea, se escribe como un arco a lo largo de la línea de tiempo, desde zumbidos graves de tensión hasta escalada de cuerdas, un impacto de metal y una nota larga de fatalidad, mapeada a los tiempos que debe alcanzar.
El silencio también es una solicitud. Sin indicación, el modelo llena la pista. Si tu toma solo necesita sonido de sala y un evento sonoro, dilo. La dirección de sonido en Wan 3.0 no es un adorno. Es la segunda mitad del medio.
Dónde practicar hoy la fórmula de prompt de Wan 3.0
Wan 3.0 todavía está en camino, y los usuarios no pueden usarlo ahora. La estructura anterior se acumula ahora, porque nada de ello está bloqueado por versión: vinculaciones, reglas globales, líneas de tiempo, diálogo entre llaves y prohibición de comportamientos por defecto funcionan en la generación actual de Wan.
Toda la familia actual está disponible en Atlas Cloud, Wan 2.7 text-to-video, image-to-video, reference-to-video y edición de video, con una clave y precio por ejecución mostrado antes de presionar ejecutar. Un ejercicio práctico: toma el esqueleto del Caso 1, llénalo con tu propio sujeto y ejecútalo como una toma corta en Wan 2.7 text-to-video. Si la cadena de interpretación se mantiene allí, el mismo archivo es tu borrador de Wan 3.0 desde el día uno, con la duración aumentada en lugar de reescrita. Atlas Cloud tiene la costumbre de ofrecer acceso desde el día cero cuando esta familia se actualiza, por lo que el entorno de práctica y el destino probablemente serán la misma página.
Preguntas frecuentes
¿Cuánto debe durar un prompt de Wan 3.0?
Tan largo como la toma lo necesite y no más. El manual oficial va desde una oración (un gag de un OVNI pintado a mano) hasta prompts de más de mil palabras para una película de monstruos de diez tiempos. La variable decisiva es la duración y el tamaño del reparto: una prueba de 5 segundos con un solo sujeto necesita una oración densa, una historia de 30 segundos con varios personajes necesita las tres capas: vinculaciones, reglas globales y una línea de tiempo.
¿Wan 3.0 genera sonido a partir del prompt?
Sí, el audio se genera en la misma pasada que la imagen. El diálogo se escribe entre llaves y llega con sincronización labial, los efectos de sonido y el ambiente se escriben como prosa, y la música se puede dirigir como un arco a lo largo de la línea de tiempo. La disciplina funciona en ambos sentidos: si quieres casi silencio, o ambiente sin banda sonora, debes decirlo, o el modelo llenará la pista por sí solo.
¿Cuál es la sintaxis de llaves en los prompts de Wan 3.0?
Las llaves marcan las palabras que un personaje dice en voz alta, como en {Nos vemos en la línea de meta}. Mantener el diálogo entre llaves lo separa de la descripción de la escena, para que el modelo interprete la línea en lugar de ilustrarla. Para trabajos multilingües, indica el idioma antes de la línea y el estilo de entrega junto con ella.
¿Cómo mantengo la consistencia de un personaje a lo largo de un video de 30 segundos de Wan 3.0?
Vincula el personaje a una referencia una vez, con alcance: define a la persona en la imagen 1 como Sujeto 1, toma solo rostro, cabello y vestimenta. Luego repite el nombre del sujeto en cada tiempo de la línea de tiempo en que aparezca, y vuelve a indicar los dos o tres rasgos fijos en cualquier momento de alto riesgo, como una acción relacionada con el vestuario o un cambio de iluminación. El caso de la escena de pelea del manual incluso repite los bloqueos de rasgos por módulo, que es la versión de tirantes y cinturón (seguridad extra).
¿Puedo practicar la escritura de prompts de Wan 3.0 antes de tener acceso?
Sí, y deberías. La estructura de tres capas, el diálogo entre llaves, las vinculaciones de referencia y la técnica de prohibir el comportamiento por defecto funcionan en la familia actual hoy. Wan 2.7 en Atlas Cloud cubre text-to-video, image-to-video, reference-to-video y edición de video con una clave, por lo que una plantilla probada allí se transfiere a 3.0 como un cambio de duración en lugar de una reescritura.
Conclusión
Diecinueve casos oficiales dicen lo mismo de tres maneras diferentes: un prompt de Wan 3.0 es un documento de producción, no un título. Asigna tus referencias, legisla tu estilo, programa tus tiempos y trata el sonido como la mitad de la imagen. Comienza con el esqueleto del primer plano de la graduada, pasa al resumen de cinco módulos y guarda la especificación de movimiento con presupuesto de fotogramas para la toma que lo necesite. Los modelos seguirán cambiando. La disciplina de escribir el tiempo en lugar de describir imágenes es la parte que te queda.






