Última actualización: Wan 3.0 ya está disponible desde el 24 de agosto de 2026.
Abriste seis pestañas. Cada una te mostró una tabla limpia: 1.3B en 8GB, 14B en 24GB, Apache-2.0, lanzado en abril de 2026. Así que abriste la página Wan-AI en Hugging Face para descargar el checkpoint.
27 repositorios. El más reciente es Wan2.2.
Esas tablas no están desactualizadas. Fueron inventadas. Los requisitos de VRAM de Wan 3.0 no pueden haber sido medidos por nadie fuera de Alibaba, porque Wan 3.0 solo entró en beta pública el 6 de agosto de 2026 y nunca ha lanzado un archivo de pesos. No había nada que lanzar en abril.
Entonces, ¿cuál es la respuesta real? Nadie lo ha benchmarkeado. Pero la propia hoja de especificaciones de Wan 3.0 encierra la respuesta en duro, y nosotros hicimos ese cálculo a continuación.
Conclusiones clave
- No existen pesos de Wan 3.0 en ninguna parte. Toda tabla de VRAM para él en la web hoy es fabricada.
- Wan 3.0 es una beta de API de primera parte: máximo 30s, máximo 1080P, sin nivel 4K.
- Sus propias especificaciones implican 13.5 veces la secuencia latente de un clip de 5s 720P, lo que supone una factura de atención ~180x.
- El techo local real hoy es Wan2.2 TI2V-5B en 24GB, o 6GB con cuantización comunitaria.
- Para salida 1080P esta semana, alquila segundos en lugar de comprar VRAM.

Requisitos de VRAM de Wan hechos visibles: el mismo primer fotograma animado en el nivel 720P a la izquierda y en el nivel 1080P a la derecha, ambos renderizados sin GPU local
Mismo primer fotograma, mismo prompt de movimiento, mismo modelo. Solo cambia el nivel de resolución: 720P a la izquierda a $0.50 por 5 segundos, 1080P a la derecha a $0.75. Ambos fueron renderizados en Wan 2.7 con cero VRAM local, y el precio en cada etiqueta es la cotización que el botón Run nos dio realmente. Mostrado como un GIF silencioso.
De esto trata todo este argumento. No de gigabytes. De píxeles.
Por qué cada tabla de requisitos de VRAM de Wan 3.0 que encontraste es ficción
Conclusión primero: las páginas mejor posicionadas para esta palabra clave reciclaron números de Wan 2.1 y Wan 2.2, les pusieron "3.0" e inventaron una fecha de lanzamiento. Puedes refutarlo todo en unos 60 segundos.
Mira esto.

Página de la organización Wan-AI en Hugging Face que muestra 27 repositorios con Wan2.2 como la versión más alta, demostrando que no existen pesos de Wan 3.0 para pruebas de VRAM local
La organización oficial Wan-AI en Hugging Face, pestaña de modelos, ordenados del más nuevo al más antiguo. 27 repos, y el número de versión más alto en toda la lista es 2.2 (Hugging Face, agosto de 2026).
No hay repositorio de Wan3.0. Tampoco hay repositorio de Wan2.7, Wan2.6 o Wan2.5. Lo más nuevo en la organización es Wan2.2-Animate-2-14B-Diffusers, actualizado hace siete días (Hugging Face, agosto de 2026).
Aquí está el desglose afirmación por afirmación.
Tabla 1: lo que afirman las guías vs lo que es verificable
| Afirmación que encontrarás en la página 1 | Verificable a agosto de 2026 | Cómo comprobarlo tú mismo |
|---|---|---|
| "Wan 3.0 lanzó pesos 1.3B + 14B en abril de 2026" | Wan 3.0 abrió beta pública el 6 de agosto de 2026. Sin pesos en ninguna fecha. | Carga la página de la org Wan-AI |
| "Wan 3.0 es Apache-2.0" | Nunca se ha publicado un archivo de licencia para 3.0 | Busca en la org un repositorio de 3.0. No hay ninguno. |
| "1.3B funciona en 8GB, 14B en 24GB" | Esas son cifras de Wan 2.1/2.2. El propio Wan 2.2 A14B pide 80GB. | La sección de hardware del README de Wan2.2 |
| "Nivel de flujo de trabajo completo 4K / 30s" | La beta llega hasta 1080P. Los niveles son 480P, 720P, 1080P. | La lista de precios por segundo de Alibaba |
| "Funciona en ComfyUI / WanGP hoy" | La lista compatible de WanGP cubre solo Wan 2.1/2.2 | El README de Wan2GP |
Lo que Alibaba realmente lanzó en agosto de 2026 es un producto API y web, no un checkpoint. Una generación dura hasta 30 segundos, la resolución máxima es 1080P, y acepta texto, imágenes, audio, video e incluso documentos (doc, xls, ppt, pdf, md) como entrada de referencia. El precio de la API es ¥0.3 / ¥0.6 / ¥1.2 por segundo para 480P / 720P / 1080P (QbitAI, agosto de 2026).
Observa lo que falta en esa lista: un enlace de descarga.
Requisitos de VRAM de Wan 3.0, calculados a partir de sus propias especificaciones
Promesa: al final de esta sección sabrás por qué "consigue una tarjeta de 32GB" no puede funcionar, con números que puedes rederivar tú mismo. Prueba: el cálculo solo necesita dos datos publicados: la tasa de compresión del VAE de Wan y el techo de 1080P/30s de Wan 3.0.
Empecemos.
Es la longitud de la secuencia, no el conteo de parámetros. Todo el mundo mira el número B. Esa es la variable incorrecta.
La memoria y el cómputo de un transformer de difusión de video escalan con cuántos tokens latentes tiene que atender, y ese conteo proviene de la resolución por la duración, no de los parámetros. El VAE de Wan2.2 comprime a 4x16x16 en tiempo, altura y anchura, y el DiT parchea encima de eso, por lo que cada token latente cubre aproximadamente un bloque de 4x32x32 píxeles (README de Wan2.2, agosto de 2026). El VAE de la generación anterior Wan2.1 comprime a 4x8x8, por lo que con parcheado es 4x16x16 por token, cuatro veces más tokens para el mismo clip.
Pasa el propio techo de Wan 3.0 a través de eso y esto es lo que sale.
Tabla 2: recuento de tokens latentes por clip objetivo (nuestro cálculo, 24fps)
| Clip objetivo | Fotogramas | Fotogramas latentes | Tokens (VAE gen 2.2) | Tokens (VAE gen 2.1) | vs 5s 720P |
|---|---|---|---|---|---|
| 5s 480P (832x480) | 121 | 31 | 12,090 | 48,360 | 0.44x |
| 5s 720P (1280x704) | 121 | 31 | 27,280 | 109,120 | 1.0x (línea base) |
| 10s 1080P (1920x1088) | 241 | 61 | 124,440 | 497,760 | 4.6x |
| 30s 1080P (1920x1088) | 721 | 181 | 369,240 | 1,476,960 | 13.5x |
Lee la última fila de nuevo. La capacidad principal de Wan 3.0 es 13.5 veces la longitud de secuencia del clip de 5 segundos 720P con el que tu 4090 actualmente se esfuerza.
Y la autoatención es cuadrática en la longitud de la secuencia. 13.5 al cuadrado es aproximadamente 180. Así que el trabajo de atención para un clip de 30s 1080P es aproximadamente 180x el trabajo de atención de un clip de 5s 720P, antes de contar cualquier otra cosa.
Ese es el número que nadie en el SERP calculó. También es por lo que "compra 8 gigabytes más" no es un plan.
Entonces, ¿qué significa eso en gigabytes? Los pesos son la parte aburrida. Un MoE total de 27B en fp8 es aproximadamente 27GB residente, bf16 aproximadamente 54GB. MoE solo ayuda al cómputo por paso (el A14B de Wan2.2 activa 14B de 27B parámetros por paso), no a lo que debe vivir en memoria.
La parte interesante son las activaciones. El estado oculto de una capa del transformer en dim de modelo 5120 en bf16 cuesta tokens x 5120 x 2 bytes:
- 5s 720P (27,280 tokens): 0.28 GB por capa
- 30s 1080P (369,240 tokens): 3.8 GB por capa
- 30s 1080P con VAE de generación 2.1 (1,476,960 tokens): 15.1 GB por capa
Por capa. Multiplica por la cantidad de capas que tu implementación de atención deba mantener vivas, añade el codificador de texto, añade el paso de decodificación VAE, y la cifra de 80GB deja de parecer conservadora.
Tabla 3: VRAM estimada si alguna vez se lanzan los pesos (ESTIMACIÓN, no medida)
| Clip objetivo | Si se lanza un modelo de clase 5B de alta compresión (fp8) | Si es un MoE de clase A14B (fp8) | Veredicto práctico |
|---|---|---|---|
| 5s 480P | ~8-10 GB | ~30-34 GB | una tarjeta de 12GB es plausible solo para el modelo pequeño |
| 5s 720P | ~10-14 GB | ~34-40 GB | piso de 16GB, 24GB cómodo |
| 10s 1080P | ~20-28 GB | ~45-60 GB | una tarjeta de 32GB ya es marginal |
| 30s 1080P | ~45-70 GB | ~90-140 GB | ninguna tarjeta de consumo individual, en ninguna cuantización |
Cada celda de esa tabla es una ESTIMACIÓN derivada de la Tabla 2 más los tamaños de checkpoint publicados. Las cifras reales dependen del kernel de atención, la estrategia de offload, y si Alibaba alguna vez lanza pesos. Trátalo como la forma del problema, no una hoja de especificaciones.
La forma es suficientemente clara: la configuración estrella nunca fue una carga de trabajo de GPU de consumo.
Los requisitos de VRAM de Wan que realmente puedes alcanzar hoy
Aquí está la parte que las tablas fabricadas pretendían ser. Estos números son publicados por el equipo de Wan y son reales.
Tabla 4: niveles reales de VRAM de Wan, agosto de 2026
| Variante | VRAM mínima | Resolución | Velocidad medida | Banderas que necesitas | Pesos |
|---|---|---|---|---|---|
| Wan2.2 T2V-A14B / I2V-A14B | 80GB GPU única | 480P / 720P | no publicada | --offload_model True --convert_model_dtype | Apache-2.0 |
| Wan2.2 TI2V-5B | 24GB (RTX 4090) | 720P @ 24fps | 5s 720P en menos de 9 minutos | --offload_model True --convert_model_dtype --t5_cpu | Apache-2.0 |
| Wan 2.1 / 2.2 via WanGP | 6GB y más | principalmente 480P | más lento, costo de calidad | int8 / fp8 / gguf / NVFP4 / Nunchaku | base Apache-2.0 |
| Wan 2.5 / 2.6 / 2.7 | n/a | solo API | n/a | n/a | ninguno publicado |
| Wan 3.0 | n/a | solo API, beta de primera parte | n/a | n/a | ninguno publicado |
Dos cosas en esa tabla merecen una segunda mirada.
Primero: la fila A14B ya tiene ambas banderas de ahorro de memoria activadas y aún así quiere 80GB. Esa es la cifra oficial de GPU única, no una ingenua. Segundo: la fila 5B es la respuesta honesta para consumo, y su propio README cita 5 segundos de 720P en menos de 9 minutos en una 4090.
Por debajo de 24GB estás en territorio comunitario. WanGP (el proyecto deepbeepmeep/Wan2GP, que se describe a sí mismo como modelos generativos "accesibles para los pobres en GPU") reduce modelos seleccionados a 6GB usando cuantización int8, fp8, gguf, NVFP4 y Nunchaku. Soporta Wan 2.1 y 2.2. No soporta 3.0, porque no hay nada que soportar.
Ahora la parte que debería cambiar tu decisión de compra: la suposición de que "la próxima versión será abierta" ha fallado tres veces seguidas. Wan 2.2 era Apache-2.0. Wan 2.5 pasó a solo API. Wan 2.6 y 2.7 nunca lanzaron pesos. Wan 3.0 no tiene ningún archivo de licencia.
Comprar una tarjeta hoy con la apuesta de que los pesos de 3.0 llegarán mañana es apostar en contra de una tendencia de tres generaciones.
Para una ejecución alojada actual, abre Wan 3.0 en Atlas Cloud y prueba un prompt como el de abajo antes de publicar el flujo de trabajo.

Captura de pantalla de Wan 3.0 prompt-a-resultado: ruta de renderizado sin GPU.
Omite los requisitos de VRAM: el flujo de trabajo de Wan sin GPU
Déjame ser directo sobre el límite primero, porque la mayoría de las páginas en este nicho no lo serán.
Nadie aloja Wan 3.0. Ni Atlas Cloud, ni nadie más. No hay pesos, por lo que no hay inferencia de terceros. Si una página te ofrece "acceso a la API de Wan 3.0", te está vendiendo otra cosa.
Lo que puedes obtener ahora mismo es el resto de la familia, alojado, facturado por segundo, sin VRAM en la ecuación. Atlas Cloud ejecuta Wan 2.2 a 2.7 detrás de una API y una pestaña del navegador, y Wan 2.7 a 1080P es lo más cercano a la salida de clase 3.0 disponible fuera de los canales beta de Alibaba.
Para el lector para quien está escrito este artículo, eso resuelve un problema específico. Estabas a punto de gastar cuatro cifras en una tarjeta para perseguir un checkpoint que no existe. Alquilar segundos significa que descubres cómo se ve la salida realmente antes de comprar nada, y si los pesos de 3.0 nunca llegan, no has perdido más que unos pocos dólares.
Tabla 5: la familia Wan alojada (precios de lista a agosto de 2026)
| ID del modelo | Resolución | Duración máxima | Precio | Mejor para |
|---|---|---|---|---|
| atlascloud/wan-2.2-turbo/image-to-video | 480p / 720p / 1080p, 30fps | 5s solo | $0.02 / s | vistazo más barato de la familia |
| atlascloud/wan-2.2/image-to-video | 480P nativo + 720P VSR | 3-10s | $0.03 / s | lotes económicos |
| alibaba/wan-2.5/text-to-video | hasta 1920x1080 | 10s | $0.035 / s | texto a video 1080P económico |
| alibaba/wan-2.6/text-to-video | hasta 1920x1080 | 5 / 10 / 15s | $0.07 / s | tomas más largas, sin necesidad de primer fotograma |
| alibaba/wan-2.7/image-to-video | 720P / 1080P, más 1080P-SR y 1440P-SR | 15s | $0.10 / s lista | el nivel más cercano a la salida de clase 3.0 |
| alibaba/wan-2.2/animate-mix | intercambio de personajes en metraje existente | coincide con tu clip de origen | $0.126 / s | intercambiar un personaje en una toma |
Una advertencia antes del tutorial, porque aparecerá en tu factura: el precio de lista es un piso. La página de Wan 2.7 cotiza $0.10 por segundo. En nuestras ejecuciones de agosto de 2026, el mismo trabajo de cinco segundos cotizó $0.50 en el nivel 720P y $0.75 en 1080P, por lo que el nivel estrella factura a $0.15 por segundo, una vez y media la tarifa listada. Lee siempre la cotización que te da el botón antes de hacer clic.
Tabla 6: cuatro rutas para 30 segundos de 1080P
| Ruta | Costo inicial | Por 30s de 1080P | ¿Realmente lo obtienes? |
|---|---|---|---|
| Compra una tarjeta de 24GB (clase 4090) | ~$1,600-2,000 | electricidad | No. 24GB ejecuta Wan2.2 TI2V-5B a 720P. No existen pesos de 3.0. |
| Alquila una tarjeta de 80GB | por hora | horas de cómputo + configuración | Solo Wan 2.2 A14B, y aún así no 1080P/30s |
| Beta de primera parte de Alibaba | ninguno | ¥1.2/s x 30 = ¥36 (~$5) | Sí, un clip continuo, solo canales de primera parte |
| Wan 2.7 alojado a 1080P | ninguno | 2 x 15s a ~$0.15/s = ~$4.50 | 30s de metraje, pero como dos clips (límite de 15s) |
Haz la división. A aproximadamente $4.50 por 30 segundos de 1080P, una tarjeta de $2,000 necesita alrededor de 440 renderizados de treinta segundos para alcanzar el punto de equilibrio, y aún así no puede producir ni uno solo de ellos.
Ese es el argumento. Ahora aquí está la ejecución de tres pasos para que puedas juzgar la salida tú mismo.
Paso 1: Bloquea el primer fotograma a 16:9
Cada comparación honesta de VRAM necesita una variable. Así que fijamos el primer fotograma, luego alimentamos el fotograma idéntico y el prompt de movimiento idéntico a ambos niveles. Cualquier diferencia que veas después es el nivel, no los dados.
Abre el playground de Qwen Image 2.0 Pro text-to-image y pega esto:
text1Plano general cinematográfico dentro de una oficina en casa oscura a las 2am: un joven ingeniero con una sudadera gris se reclina en una silla de escritorio, rostro iluminado solo por un trío de monitores que muestran una línea de tiempo de video pausada. Junto al escritorio, una caja de PC abierta brilla, con una única tarjeta gráfica de gran tamaño visible en su interior, ventiladores girando. Partículas de polvo en el aire, gradación de color teal y ámbar, profundidad de campo reducida, lente anamórfica de 35 mm, fotorrealista, muy detallado, 16:9 2
Configuración: haz clic en el chip de tamaño 16:9, que ajusta el fotograma a 1280 x 720, y deja todo lo demás por defecto. El costo es de $0.06 por imagen (actualmente con un 20 % de descuento sobre $0.075). Los cuadros de ancho y alto llegan hasta 2048 por lado si quieres un fotograma más grande, pero el valor predeterminado del chip ya tiene la forma correcta para ambos niveles de video.
¿Por qué esta escena? Porque es literalmente el lector. Guarda el archivo de salida, lo necesitas dos veces.

Playground de Qwen Image 2.0 Pro en Atlas Cloud con el chip de tamaño 16:9 seleccionado y el primer fotograma 1280x720 terminado en el panel de salida
Paso 1 completo: el chip 16:9 seleccionado a 1280 x 720, y el primer fotograma del que partirán ambos niveles de video. $0.06 en el botón Run.
Paso 2: Anímalo en el nivel de VRAM 720P
Este es el sustituto de lo que una configuración local real de 24GB obtiene: 720P, cinco segundos, y ese es el techo.
Una elección deliberada aquí. En lugar de cambiar de modelo entre los dos niveles, ejecutamos el mismo modelo en ambos, de modo que la única variable en la comparación es el nivel de resolución. Carga la imagen del Paso 1 como primer fotograma en el playground de Wan 2.7 image-to-video, luego pega este prompt de movimiento:
text1El ingeniero se inclina lentamente hacia adelante y se frota los ojos; el resplandor del monitor parpadea mientras la línea de tiempo avanza; la cámara se acerca ligeramente; las partículas de polvo se desplazan a través del haz de luz; microtemblor sutil de cámara en mano; toma única y continua, sin cortes. 2
Configuración: resolución 720P, duración 5s, todo lo demás por defecto. El botón Run cotizó $0.50, que es la tarifa de lista de $0.10 por segundo multiplicada por cinco segundos. Anota ese número, porque el Paso 3 lo cambiará.

Playground de Wan 2.7 image-to-video en el nivel 720P con el primer fotograma cargado, duración de 5s, y el clip terminado en el panel de salida
Paso 2 completo: el nivel 720P, 5 segundos, cotizado a $0.50, con un clip real en el panel de salida.
Paso 3: Anima el mismo fotograma a 1080P sin GPU local
Misma página, mismo primer fotograma, mismo prompt de movimiento palabra por palabra, misma duración de 5 segundos. Cambia exactamente un control: establece la resolución a 1080P.
La cotización del Run pasa de $0.50 a $0.75. Eso son tus $0.15 por segundo, medidos, en una página cuyo precio de lista dice $0.10.
Dos trampas de configuración a tener en cuenta, ambas nos costaron ejecuciones reales aprenderlas:
- El control de duración no siempre se confirma. Configuramos la duración a 10 segundos, el campo mostraba 10, y el trabajo aún así renderizó 5. La cotización del botón Run es la única fuente de verdad: a $0.15 por segundo, un trabajo genuino de 10 segundos 1080P debe leer alrededor de $1.50, por lo que una cotización de $0.75 significa que sigues comprando 5 segundos sin importar lo que muestre el control deslizante. Lee la cotización, no el campo.
- Confirma que tu propia imagen está cargada. Si la ranura de referencia aún contiene la imagen de demostración predeterminada de la página, la ejecución producirá felizmente algo no relacionado. Mira la miniatura antes de hacer clic.

Playground de Wan 2.7 image-to-video en el nivel 1080P con el botón Run cotizando $0.75, y el clip 1080P terminado en el panel de salida
Paso 3 completo en el nivel 1080P. La cotización del Run es el punto: $0.75 por los mismos cinco segundos que costaron $0.50 un nivel más abajo, en una página que lista $0.10 por segundo.
Ambos renderizados están en el clip al inicio de este artículo, lado a lado. Ese es todo el argumento de VRAM en cinco segundos: dos niveles de salida, el mismo prompt, y ni un gigabyte de memoria de video local involucrado.
Variaciones que vale la pena probar. Baja a 480P para vistazos económicos antes de comprometerte con un renderizado 1080P. Cambia a alibaba/wan-2.6/text-to-video a $0.07/s cuando no tengas un primer fotograma y quieras 15 segundos de una sola vez. Usa alibaba/wan-2.2/animate-mix a $0.126/s para poner un personaje diferente en metraje que ya tengas. Y si quieres acercarte a 30 segundos, presupuesta dos clips, debido a un límite de 15 segundos por clip que casi ningún tutorial menciona.
Preguntas frecuentes
¿Puede una GPU de 24GB ejecutar Wan 3.0?
Hoy no, porque no hay pesos que cargar. Si alguna vez se lanzan, las matemáticas de la Tabla 2 dicen que 24GB obtiene 480P y clips cortos bajo cuantización agresiva. La configuración estrella 1080P/30s es un orden de magnitud diferente y no es alcanzable en una sola tarjeta de consumo.
¿Dónde puedo descargar los pesos de Wan 3.0?
En ninguna parte. La organización Wan-AI en Hugging Face llega hasta Wan2.2, y la org de GitHub Wan-Video no tiene ningún repositorio de inferencia de 3.0 ni ninguna licencia de 3.0. Cualquier sitio que ofrezca una "descarga de checkpoint de Wan 3.0" no está distribuyendo lo que dice.
¿Wan 3.0 es de código abierto o Apache 2.0?
No se ha publicado ninguna licencia. La tendencia va en la dirección opuesta: Wan 2.2 era Apache-2.0, Wan 2.5 pasó a solo API, y 2.6 y 2.7 no lanzaron ningún peso. Tres generaciones consecutivas se han cerrado. Planifica en consecuencia.
¿Cuál es el modelo Wan de menor VRAM que puedo ejecutar realmente hoy?
Wan2.2 TI2V-5B, oficialmente 24GB en una 4090, haciendo 5s de 720P en menos de 9 minutos. Por debajo de eso, las rutas cuantizadas de WanGP llegan hasta 6GB en modelos seleccionados, y lo pagas en velocidad y detalle.
Wan 3.0 vs Wan 2.7: ¿cuál puedo ejecutar localmente?
Ninguno. Ambos son solo API. Si el requisito es "se ejecuta en mi máquina", tus opciones son las familias Wan 2.1 y 2.2. Si el requisito es salida de clase 2.7, eso es una llamada alojada, no una instalación local.
Si no puedo ejecutarlo localmente, ¿cómo obtengo 30 segundos de 1080P ahora?
La beta de primera parte de Alibaba factura por segundo y entrega 30s en un solo clip. Fuera de esos canales hay un límite estricto de 15 segundos por clip, por lo que 30 segundos significa unir dos. En nuestras propias pruebas de continuación de Wan 2.7, las restricciones eran estrictas: el segmento de origen tenía que ser de 2 a 10 segundos, la salida tenía que ser estrictamente más larga que el origen, los fotogramas de origen no se conservaban, y encadenar continuaciones no acumulaba longitud. La mayoría de los tutoriales nunca mencionan nada de eso.
Así que la versión corta de toda la cuestión de los requisitos de VRAM de Wan 3.0: deja de buscar una tarjeta, porque el checkpoint para el que la comprarías no existe. Ejecuta Wan 2.2 localmente si quieres pesos en el disco, y alquila segundos 1080P cuando quieras la salida que las tablas falsas estaban vendiendo.






