MiniMax H3 Developer já está disponível — 60% de desconto, a partir de US$ 0,02 por segundo

Requisitos de VRAM do Wan 3.0: Por que 80GB Não é Suficiente, e o que Realmente Roda Hoje

Requisitos de VRAM do Wan 3.0, calculados a partir de suas próprias especificações 1080P/30s: 13.5x o comprimento da sequência, zero pesos públicos e os níveis locais de Wan que funcionam hoje.

Última atualização: Wan 3.0 está ativo desde 24 de agosto de 2026.

Você abriu seis abas. Cada uma lhe entregou uma tabela limpa: 1.3B em 8GB, 14B em 24GB, Apache-2.0, lançado em abril de 2026. Então você abriu a página Wan-AI no Hugging Face para pegar o checkpoint.

27 repositórios. O mais novo é Wan2.2.

Essas tabelas não estão desatualizadas. Elas foram inventadas. Os requisitos de VRAM do Wan 3.0 não podem ter sido medidos por ninguém fora da Alibaba, porque o Wan 3.0 só entrou em beta público em 6 de agosto de 2026 e nunca lançou um arquivo de pesos. Não havia nada para lançar em abril.

Então qual é a resposta real? Ninguém fez benchmark. Mas a própria ficha técnica do Wan 3.0 delimita a resposta com firmeza, e fizemos as contas abaixo.

Principais conclusões

  • Não existem pesos do Wan 3.0 em lugar algum. Toda tabela de VRAM para ele na web hoje é fabricada.
  • Wan 3.0 é um beta de API próprio: máximo de 30s, máximo de 1080P, sem tier 4K.
  • Suas próprias especificações implicam 13,5x a sequência latente de um clipe de 5s 720P, o que equivale a uma conta de atenção de ~180x.
  • O teto local real hoje é Wan2.2 TI2V-5B em 24GB, ou 6GB com quantização da comunidade.
  • Para saída 1080P esta semana, alugue segundos em vez de comprar VRAM. comparação 768p vs 2k

Requisitos de VRAM do Wan em evidência: o mesmo primeiro quadro animado no tier 720P à esquerda e no tier 1080P à direita, ambos renderizados sem GPU local

Mesmo primeiro quadro, mesmo prompt de movimento, mesmo modelo. Apenas o tier de resolução muda: 720P à esquerda por US$ 0,50 por 5 segundos, 1080P à direita por US$ 0,75. Ambos foram renderizados no Wan 2.7 com zero VRAM local, e o preço em cada rótulo é o orçamento que o botão Run realmente nos deu. Mostrado como um GIF silencioso.

É sobre isso que toda essa discussão se trata. Não sobre gigabytes. Sobre pixels.

Por que toda tabela de requisitos de VRAM do Wan 3.0 que você encontrou é ficção

Conclusão primeiro: as páginas mais bem classificadas para essa palavra-chave reciclaram números do Wan 2.1 e Wan 2.2, colocaram "3.0" neles e inventaram uma data de lançamento. Você pode refutar tudo isso em cerca de 60 segundos.

Veja só.

Página de perfil do Wan-AI no Hugging Face listando seus modelos de IA

Página da organização Wan-AI no Hugging Face mostrando 27 repositórios com Wan2.2 como a versão mais alta, provando que não existem pesos do Wan 3.0 para testes locais de VRAM

A organização oficial Wan-AI no Hugging Face, aba de modelos, ordenados do mais novo para o mais antigo. 27 repositórios, e o número de versão mais alto em qualquer lugar da lista é 2.2 (Hugging Face, agosto de 2026).

Não há repositório Wan3.0. Também não há repositórios Wan2.7, Wan2.6 ou Wan2.5. A coisa mais nova na organização é Wan2.2-Animate-2-14B-Diffusers, atualizado há sete dias (Hugging Face, agosto de 2026).

Aqui está a análise alegação por alegação.

Tabela 1: o que os guias afirmam vs o que é verificável

Alegação que você encontrará na página 1Verificável a partir de agosto de 2026Como verificar por conta própria
"Wan 3.0 lançou pesos 1.3B + 14B em abril de 2026"Wan 3.0 abriu beta público em 6 de agosto de 2026. Nenhum peso em qualquer data.Carregue a página da organização Wan-AI
"Wan 3.0 é Apache-2.0"Nenhum arquivo de licença foi publicado para 3.0Pesquise na organização por um repositório 3.0. Não existe.
"1.3B roda em 8GB, 14B em 24GB"Esses são números do Wan 2.1/2.2. O próprio Wan 2.2 A14B pede 80GB.A seção de hardware do README do Wan2.2
"Tier completo de workflow 4K/30s"O beta máximo é 1080P. Os tiers são 480P, 720P, 1080P.Lista de preços por segundo da própria Alibaba
"Roda no ComfyUI/WanGP hoje"A lista de suporte do WanGP cobre apenas Wan 2.1/2.2O README do Wan2GP

O que a Alibaba realmente lançou em agosto de 2026 é um produto de API e web, não um checkpoint. Uma geração vai até 30 segundos, a resolução máxima é 1080P, e aceita texto, imagens, áudio, vídeo e até documentos (doc, xls, ppt, pdf, md) como entrada de referência. O preço da API é ¥0,3 / ¥0,6 / ¥1,2 por segundo para 480P / 720P / 1080P (QbitAI, agosto de 2026).

Observe o que está faltando nessa lista: um link para download.

Requisitos de VRAM do Wan 3.0, calculados a partir de suas próprias especificações

Promessa: ao final desta seção, você saberá por que "apenas compre uma placa de 32GB" não funciona, com números que você pode recalcular por conta própria. Prova: o cálculo precisa apenas de dois fatos publicados, a taxa de compressão do VAE do Wan e o teto de 1080P/30s do Wan 3.0.

Vamos começar.

É o comprimento da sequência, não a contagem de parâmetros. Todo mundo olha para o número B. Essa é a variável errada.

A memória e o poder computacional de um transformer de difusão de vídeo escalam com quantos tokens latentes ele precisa atender, e essa contagem vem da resolução vezes a duração, não dos parâmetros. O VAE do Wan2.2 comprime a 4x16x16 em tempo, altura e largura, e o DiT patchifica sobre isso, então cada token latente cobre aproximadamente um bloco de 4x32x32 pixels (README do Wan2.2, agosto de 2026). O VAE mais antigo da geração Wan2.1 comprime a 4x8x8, então com patchify são 4x16x16 por token, quatro vezes mais tokens para o mesmo clipe.

Passe o próprio teto do Wan 3.0 por isso e aqui está o que resulta.

Tabela 2: contagem de tokens latentes por clipe alvo (nosso cálculo, 24fps)

Clipe alvoQuadrosQuadros latentesTokens (VAE geração 2.2)Tokens (VAE geração 2.1)vs 5s 720P
5s 480P (832x480)1213112.09048.3600,44x
5s 720P (1280x704)1213127.280109.1201,0x (linha de base)
10s 1080P (1920x1088)24161124.440497.7604,6x
30s 1080P (1920x1088)721181369.2401.476.96013,5x

Leia a última linha novamente. A capacidade principal do Wan 3.0 é 13,5x o comprimento da sequência do clipe de 5 segundos 720P pelo qual sua 4090 atualmente sua.

E a autoatenção é quadrática no comprimento da sequência. 13,5 ao quadrado é cerca de 180. Portanto, o trabalho de atenção para um único clipe de 30s 1080P é aproximadamente 180x o trabalho de atenção de um clipe de 5s 720P, antes de contar qualquer outra coisa.

Esse é o número que ninguém no SERP calculou. Também é por isso que "compre mais 8 gigabytes" não é um plano.

Então o que isso significa em gigabytes? Pesos são a parte chata. Um MoE total de 27B em fp8 tem cerca de 27GB residentes, bf16 cerca de 54GB. MoE só ajuda o cálculo por etapa (o A14B do Wan2.2 ativa 14B dos 27B parâmetros por etapa), não o que precisa estar na memória.

A parte interessante são as ativações. O estado oculto de uma camada do transformer na dimensão do modelo 5120 em bf16 custa tokens x 5120 x 2 bytes:

  • 5s 720P (27.280 tokens): 0,28 GB por camada
  • 30s 1080P (369.240 tokens): 3,8 GB por camada
  • 30s 1080P em um VAE de geração 2.1 (1.476.960 tokens): 15,1 GB por camada

Por camada. Multiplique por quantas camadas sua implementação de atenção precisar manter ativas, adicione o codificador de texto, adicione a passagem de decodificação do VAE, e o número de 80GB deixa de ser conservador.

Tabela 3: VRAM estimada se os pesos algum dia forem lançados (ESTIMATIVA, não medida)

Clipe alvoSe um modelo de 5B de alta compressão for lançado (fp8)Se for um MoE classe A14B (fp8)Veredito prático
5s 480P~8-10 GB~30-34 GBuma placa de 12GB é plausível apenas para o modelo pequeno
5s 720P~10-14 GB~34-40 GBmínimo de 16GB, confortável com 24GB
10s 1080P~20-28 GB~45-60 GBuma placa de 32GB já é marginal
30s 1080P~45-70 GB~90-140 GBnenhuma placa de consumo individual, em qualquer quantização

Cada célula nessa tabela é uma ESTIMATIVA derivada da Tabela 2 mais tamanhos de checkpoint publicados. Os números reais dependem do kernel de atenção, da estratégia de offload e se a Alibaba algum dia lançará pesos. Trate como a forma do problema, não uma ficha técnica.

A forma é clara o suficiente: a configuração principal nunca foi uma carga de trabalho de GPU de consumo.

Os requisitos de VRAM do Wan que você pode realmente atingir hoje

Aqui está a parte que as tabelas fabricadas fingiam ser. Esses números são publicados pela equipe do Wan e são reais.

Tabela 4: tiers reais de VRAM do Wan, agosto de 2026

VarianteVRAM mínimaResoluçãoVelocidade medidaSinalizadores necessáriosPesos
Wan2.2 T2V-A14B / I2V-A14B80GB GPU única480P / 720Pnão publicado--offload_model True --convert_model_dtypeApache-2.0
Wan2.2 TI2V-5B24GB (RTX 4090)720P @ 24fps5s 720P em menos de 9 minutos--offload_model True --convert_model_dtype --t5_cpuApache-2.0
Wan 2.1 / 2.2 via WanGP6GB e acimaprincipalmente 480Pmais lento, custo de qualidadeint8 / fp8 / gguf / NVFP4 / NunchakuBase Apache-2.0
Wan 2.5 / 2.6 / 2.7n/aSomente APIn/an/anenhum publicado
Wan 3.0n/aSomente API, beta próprion/an/anenhum publicado

Duas coisas nessa tabela merecem uma segunda olhada.

Primeiro: a linha A14B já tem ambos os sinalizadores de economia de memória ativados e ainda quer 80GB. Esse é o número oficial de GPU única, não um ingênuo. Segundo: a linha 5B é a resposta honesta para o consumidor, e seu próprio README cita 5 segundos de 720P em menos de 9 minutos em uma 4090.

Abaixo de 24GB você está em território da comunidade. O WanGP (o projeto deepbeepmeep/Wan2GP, que se descreve como modelos generativos "acessíveis aos pobres em GPU") reduz modelos selecionados para 6GB usando quantização int8, fp8, gguf, NVFP4 e Nunchaku. Ele suporta Wan 2.1 e 2.2. Não suporta 3.0, porque não há nada para suportar.

Agora a parte que deve mudar sua decisão de compra: a suposição de que "a próxima versão será aberta" falhou três vezes seguidas. Wan 2.2 era Apache-2.0. Wan 2.5 tornou-se apenas API. Wan 2.6 e 2.7 nunca lançaram pesos. Wan 3.0 não tem nenhum arquivo de licença.

Comprar uma placa hoje com a aposta de que os pesos do 3.0 chegam amanhã é apostar contra uma tendência de três gerações.

Para uma execução hospedada atual, acesse Wan 3.0 no Atlas Cloud e teste um prompt como o abaixo antes de publicar o workflow.

Captura de tela do prompt e efeito gerado do Wan 3.0 para wan-3.0-vram-requirements

Captura de tela de prompt para resultado do Wan 3.0: Caminho de renderização sem GPU.

Pule os Requisitos de VRAM: O Workflow Wan Sem GPU

Deixe-me ser direto sobre o limite primeiro, porque a maioria das páginas nesse nicho não será.

Ninguém hospeda o Wan 3.0. Nem o Atlas Cloud, nem ninguém. Não há pesos, então não há inferência de terceiros. Se uma página lhe oferecer "acesso à API do Wan 3.0", está vendendo outra coisa.

O que você pode obter agora é o resto da família, hospedado, cobrado por segundo, sem VRAM na equação. O Atlas Cloud executa Wan 2.2 a 2.7 por trás de uma API e uma aba do navegador, e o Wan 2.7 em 1080P é a coisa mais próxima de uma saída classe 3.0 disponível fora dos próprios canais beta da Alibaba.

Para o leitor para quem este artigo foi escrito, isso resolve um problema específico. Você estava prestes a gastar quatro dígitos em uma placa para perseguir um checkpoint que não existe. Alugar segundos significa que você descobre como é a saída antes de comprar qualquer coisa, e se os pesos do 3.0 nunca chegarem, você não terá perdido nada além de alguns dólares.

Tabela 5: a família Wan hospedada (preços de lista em agosto de 2026)

Model idResoluçãoDuração máximaPreçoMelhor para
atlascloud/wan-2.2-turbo/image-to-video480p / 720p / 1080p, 30fpsapenas 5sUS$ 0,02 / solhada mais barata da família
atlascloud/wan-2.2/image-to-video480P nativo + 720P VSR3-10sUS$ 0,03 / slotes econômicos
alibaba/wan-2.5/text-to-videoaté 1920x108010sUS$ 0,035 / stexto para vídeo 1080P barato
alibaba/wan-2.6/text-to-videoaté 1920x10805 / 10 / 15sUS$ 0,07 / stakes mais longos, sem necessidade de primeiro quadro
alibaba/wan-2.7/image-to-video720P / 1080P, mais 1080P-SR e 1440P-SR15sUS$ 0,10 / s listao tier mais próximo da saída classe 3.0
alibaba/wan-2.2/animate-mixtroca de personagem em filmagem existentecorresponde ao seu clipe de origemUS$ 0,126 / strocar um personagem em uma cena

Um aviso antes do tutorial, porque aparecerá na sua fatura: o preço de lista é um piso. A página do Wan 2.7 cita US$ 0,10 por segundo. Em nossas execuções de agosto de 2026, o mesmo trabalho de cinco segundos citou US$ 0,50 no tier 720P e US$ 0,75 em 1080P, então o tier principal fatura a US$ 0,15 por segundo, metade a mais que a taxa listada. Sempre leia o orçamento que o botão lhe dá antes de clicar.

Tabela 6: quatro rotas para 30 segundos de 1080P

RotaCusto inicialPor 30s de 1080PVocê realmente consegue?
Comprar uma placa de 24GB (classe 4090)~US$ 1.600-2.000eletricidadeNão. 24GB roda Wan2.2 TI2V-5B em 720P. Pesos 3.0 não existem.
Alugar uma placa de 80GBpor horahoras de computação + configuraçãoApenas Wan 2.2 A14B, e ainda não 1080P/30s
Beta próprio da Alibabanenhum¥1,2/s x 30 = ¥36 (~US$ 5)Sim, um clipe contínuo, apenas canais próprios
Wan 2.7 hospedado em 1080Pnenhum2 x 15s a ~US$ 0,15/s = ~US$ 4,5030s de filmagem, mas como dois clipes (limite de 15s)

Faça a conta. A aproximadamente US$ 4,50 por 30 segundos de 1080P, uma placa de US$ 2.000 precisa de cerca de 440 renderizações de trinta segundos para se pagar, e ainda assim não consegue produzir uma única delas.

Esse é o argumento. Agora aqui está a execução de três etapas para que você possa julgar a saída por conta própria.

Etapa 1: Fixe o Primeiro Quadro em 16:9

Toda comparação honesta de VRAM precisa de uma variável. Então fixamos o primeiro quadro, depois alimentamos o quadro idêntico e o prompt de movimento idêntico para ambos os tiers. Qualquer diferença que você veja depois é o tier, não os dados.

Abra o playground de texto para imagem do Qwen Image 2.0 Pro e cole isto:

text
1Plano aberto cinematográfico dentro de um home office escuro às 2h: um jovem engenheiro de moletom cinza está reclinado em uma cadeira de escritório, rosto iluminado apenas por um rig de três monitores mostrando uma linha do tempo de vídeo pausada. Ao lado da mesa, um gabinete de PC aberto brilha, uma única placa gráfica gigante visível dentro, ventoinhas girando. Partículas de poeira no ar, gradiente de cores teal e âmbar, profundidade de campo rasa, lente anamórfica 35mm, fotorrealista, altamente detalhado, 16:9
2

Configurações: clique no chip de tamanho 16:9, que ajusta o quadro para 1280 x 720, e deixe todo o resto padrão. O custo é US$ 0,06 por imagem (atualmente com 20% de desconto sobre US$ 0,075). As caixas de largura e altura vão até 2048 por lado se você quiser um quadro maior, mas o padrão do chip já é o formato certo para ambos os tiers de vídeo.

Por que essa cena? Porque é literalmente o leitor. Mantenha o arquivo de saída, você precisa dele duas vezes.

Captura de tela de uma interface de gerador de imagens de IA mostrando entrada e saída

Playground do Qwen Image 2.0 Pro no Atlas Cloud com o chip de tamanho 16:9 selecionado e o primeiro quadro 1280x720 finalizado no painel de saída

Etapa 1 concluída: o chip 16:9 selecionado em 1280 x 720, e o primeiro quadro a partir do qual ambos os tiers de vídeo começarão. US$ 0,06 no botão Run.

Etapa 2: Anime-o no Tier de VRAM 720P

Este é o substituto para o que uma configuração local real de 24GB oferece: 720P, cinco segundos, e esse é o teto.

Uma escolha deliberada aqui. Em vez de alternar modelos entre os dois tiers, executamos o mesmo modelo em ambos, então a única variável na comparação é o tier de resolução. Carregue a imagem da Etapa 1 como primeiro quadro no playground de imagem para vídeo do Wan 2.7 e cole este prompt de movimento:

text
1O engenheiro lentamente se inclina para frente e esfrega os olhos; o brilho do monitor pisca enquanto a linha do tempo avança; a câmera se aproxima ligeiramente; partículas de poeira flutuam pelo feixe de luz; micro-tremor sutil de câmera na mão; plano único contínuo, sem cortes.
2

Configurações: resolução 720P, duração 5s, todo o resto padrão. O botão Run citou US$ 0,50, que é a taxa de lista de US$ 0,10 por segundo vezes cinco segundos. Anote esse número, porque a Etapa 3 vai mudá-lo.

Interface de geração de vídeo de IA mostrando entrada de prompt de texto e saída de vídeo

Playground de imagem para vídeo do Wan 2.7 no tier 720P com o primeiro quadro carregado, duração de 5s, e o clipe finalizado no painel de saída

Etapa 2 concluída: o tier 720P, 5 segundos, orçado em US$ 0,50, com um clipe real no painel de saída.

Etapa 3: Anime o Mesmo Quadro em 1080P Sem GPU Local

Mesma página, mesmo primeiro quadro, mesmo prompt de movimento palavra por palavra, mesma duração de 5 segundos. Mude exatamente um controle: defina a resolução para 1080P.

O orçamento do Run vai de US$ 0,50 para US$ 0,75. Esse é o seu US$ 0,15 por segundo, medido, em uma página cujo preço de lista diz US$ 0,10.

Duas armadilhas de configuração a observar, ambas nos custaram execuções reais para aprender:

  • O controle de duração nem sempre confirma. Definimos a duração para 10 segundos, o campo mostrava 10, e o trabalho ainda renderizou 5. O orçamento do botão Run é a única fonte da verdade: a US$ 0,15 por segundo, um trabalho genuíno de 10 segundos 1080P tem que mostrar cerca de US$ 1,50, então um orçamento de US$ 0,75 significa que você ainda está comprando 5 segundos, não importa o que o controle deslizante mostre. Leia o orçamento, não o campo.
  • Confirme se sua própria imagem está carregada. Se o slot de referência ainda mantiver a imagem de demonstração predefinida da página, a execução produzirá alegremente algo não relacionado. Olhe a miniatura antes de clicar. Interface de gerador de vídeo de IA mostrando um prompt de texto e vídeo gerado

Playground de imagem para vídeo do Wan 2.7 no tier 1080P com o botão Run orçando US$ 0,75, e o clipe 1080P finalizado no painel de saída

Etapa 3 concluída no tier 1080P. O orçamento do Run é o ponto: US$ 0,75 pelos mesmos cinco segundos que custaram US$ 0,50 um tier abaixo, em uma página que lista US$ 0,10 por segundo.

Ambas as renderizações estão no clipe no topo deste artigo, lado a lado. Esse é todo o argumento da VRAM em cinco segundos: dois tiers de saída, o mesmo prompt, e nem um gigabyte de memória de vídeo local envolvido.

Variações que valem a pena tentar. Caia para 480P para olhadas baratas antes de se comprometer com uma renderização 1080P. Troque por alibaba/wan-2.6/text-to-video a US$ 0,07/s quando você não tiver um primeiro quadro e quiser 15 segundos de uma vez. Use alibaba/wan-2.2/animate-mix a US$ 0,126/s para colocar um personagem diferente em filmagem que você já tem. E se você quiser mais perto de 30 segundos, planeje dois clipes, por causa de um teto de 15 segundos por clipe que quase nenhum tutorial menciona.

Perguntas Frequentes

Uma GPU de 24GB pode rodar o Wan 3.0?

Não hoje, porque não há pesos para carregar. Se algum dia forem lançados, a matemática na Tabela 2 diz que 24GB oferece 480P e clipes curtos sob quantização agressiva. A configuração principal de 1080P/30s é uma ordem de grandeza diferente e não é alcançável em uma única placa de consumo.

Onde posso baixar os pesos do Wan 3.0?

Em lugar nenhum. A organização Wan-AI no Hugging Face termina no Wan2.2, e a organização Wan-Video no GitHub não tem repositório de inferência 3.0 nem licença 3.0. Qualquer site que ofereça um "download de checkpoint do Wan 3.0" não está distribuindo o que alega.

O Wan 3.0 é open source ou Apache 2.0?

Nenhuma licença foi publicada. A tendência está indo na direção oposta: Wan 2.2 era Apache-2.0, Wan 2.5 se tornou apenas API, e 2.6 e 2.7 não lançaram pesos nenhum. Três gerações consecutivas fecharam. Planeje de acordo.

Qual é o modelo Wan de menor VRAM que posso realmente rodar hoje?

Wan2.2 TI2V-5B, oficialmente 24GB em uma 4090, fazendo 5s de 720P em menos de 9 minutos. Abaixo disso, os caminhos quantizados do WanGP chegam a 6GB em modelos selecionados, e você paga por isso em velocidade e detalhes.

Wan 3.0 vs Wan 2.7: qual deles posso rodar localmente?

Nenhum. Ambos são apenas API. Se o requisito é "roda na minha máquina", suas opções são as famílias Wan 2.1 e 2.2. Se o requisito é saída classe 2.7, isso é uma chamada hospedada, não uma instalação local.

Se não posso rodar localmente, como obtenho 30 segundos de 1080P agora?

O beta próprio da Alibaba cobra por segundo e entrega 30s em um clipe. Fora desses canais, há um teto rígido de 15 segundos por clipe, então 30 segundos significa unir dois. Em nossos próprios testes de continuação do Wan 2.7, as restrições eram rigorosas: o segmento de origem tinha que ter de 2 a 10 segundos, a saída tinha que ser estritamente mais longa que a origem, os quadros de origem não eram preservados, e encadear continuações não acumulava comprimento. A maioria dos tutoriais nunca menciona nada disso.

Portanto, a versão resumida de toda a questão dos Requisitos de VRAM do Wan 3.0: pare de procurar uma placa, porque o checkpoint para o qual você a compraria não existe. Rode Wan 2.2 localmente se quiser pesos no disco, e alugue segundos de 1080P quando quiser a saída que as tabelas falsas estavam vendendo.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos