APENAS DUAS SEMANAS | 20% DE DESCONTO no Seedream 5.0 Pro!

HappyHorse-1.0 conquista o primeiro lugar, API disponível em breve

No início de abril, um modelo chamado "HappyHorse-1.0" surgiu repentinamente. Ele liderou quatro categorias no ranking de vídeo da Artificial Analysis, superando com folga o Seedance 2.0 da ByteDance e o Kling.

No início de abril, um modelo chamado "HappyHorse-1.0" surgiu repentinamente. Ele alcançou o topo de quatro categorias no ranking de vídeo da Artificial Analysis, superando com folga o Seedance 2.0 da ByteDance e o Kling.

Não houve comunicados de imprensa, nem postagens em blogs, e o nome da empresa estava oculto. A página do modelo trazia apenas a mensagem "em breve".

No dia 10 de abril, a divisão ATH da Alibaba reconheceu o projeto. O HappyHorse é um projeto interno de P&D da unidade de inovação da ATH e está atualmente em versão beta privada. A API será lançada em 30 de abril.

Além disso, o HappyHorse-1.0 será totalmente open-source. Ele é promovido como o primeiro modelo de vídeo open-source a gerar áudio e vídeo simultaneamente de forma nativa.

Este "lançamento silencioso" seguido por um "anúncio espetacular" está se tornando uma tendência entre as empresas de IA chinesas. A Xiaomi fez isso com o codinome "Hunter Alpha", e a Zhipu usou "Pony Alpha" para seu novo modelo GLM.

Neste artigo, desvendamos os fatos conhecidos sobre o HappyHorse e o que eles significam.


A Posição do HappyHorse no Ranking

A Artificial Analysis opera quatro rankings: Texto-para-Vídeo sem áudio, Imagem-para-Vídeo sem áudio, Texto-para-Vídeo com áudio e Imagem-para-Vídeo com áudio.

Os dados ao meio-dia de 13 de abril são os seguintes:

  • Texto-para-Vídeo (sem áudio): 1384 Elo. Está 111 pontos à frente do Seedance 2.0.
  • Imagem-para-Vídeo (sem áudio): 1413 Elo. Esta é a pontuação mais alta registrada na plataforma.

下载 (1).png

下载.png

Em pontuações Elo, uma diferença superior a 60 pontos indica uma preferência clara. Uma diferença de 111 pontos indica que os usuários escolheram o HappyHorse de forma esmagadora em testes cegos.

No entanto, a situação muda quando o áudio é incluído. A diferença cai para apenas 1-2 pontos, efetivamente um empate. Isso mostra que a sincronização audiovisual e a qualidade do som do HappyHorse não são drasticamente superiores. Nesse aspecto, ele está praticamente no mesmo nível do Seedance.


Comparação entre HappyHorse e Seedance 2.0

ItemHappyHorse-1.0Seedance 2.0
Natureza do ModeloOpen SourceSistema Comercial Fechado
ArquiteturaTransformer UnificadoTransformer de Difusão Bidirecional (DB-DiT)
Capacidade MultimodalGeração Simultânea de Áudio/Vídeo (One-pass)Entrada Multimodal (Texto, Imagem, Vídeo, Áudio)
Modo de Geração de VídeoGeração em uma única etapa (One-pass)Geração baseada em pipeline
Duração da GeraçãoAprox. 5–10 segundos (1080p)Até aprox. 60 segundos (2K)

Os dois representam filosofias diferentes.

HappyHorse‑1.0: Open source. Transformer Unificado. Geração simultânea de áudio/vídeo. Processamento em uma única etapa. Suporte nativo a sincronia labial para 7 idiomas. 15 bilhões de parâmetros. Leva 38 segundos para gerar um vídeo de 5 segundos em 1080p em um ambiente H100.

Seedance 2.0: Sistema comercial fechado. Transformer de Difusão Bidirecional (DB‑DiT). Entrada multimodal. Capaz de gerar vídeos de 60 segundos em 2K. Suporta sincronia labial para 8+ idiomas.

Em relação à qualidade visual pura, o HappyHorse é claramente preferido em testes cegos. Em relação à sincronização audiovisual e qualidade sonora, ambos são aproximadamente iguais. Quanto à usabilidade, o Seedance já oferece uma API madura por meio de serviços como o Volcano Engine. A API do HappyHorse está prevista para ser lançada em 30 de abril, e o desempenho na versão beta privada ainda está sendo verificado.

Comparação de exemplos de geração entre HappyHorse-1.0 e Dreamina Seedance 2.0 (Texto-para-Vídeo com áudio) pela Artificial Analysis:

Prompt: Uma curta animação estilo Pixar sobre um tímido cone de trânsito que sonha em ser o cone na linha de chegada de uma grande corrida. Os outros cones riem da sua ambição. Um trabalhador da construção civil acidentalmente o coloca na linha de chegada de uma maratona. À medida que os corredores passam, a expressão pintada do cone muda de medo para alegria. Confetes caem do alto. Os outros cones assistem na TV e ficam inspirados. Áudio: De barulho de trânsito a aplausos da multidão, e depois música animada.


Sobre a Arquitetura

O HappyHorse adota uma abordagem incomum.

Ele possui 15 bilhões de parâmetros e usa um Transformer de autoatenção unificado de 40 camadas. Tokens de texto, vídeo e áudio são alimentados na mesma sequência e modelados conjuntamente. Isso é significativamente diferente do pipeline comum de "gerar o vídeo primeiro e depois adicionar o áudio". Aqui, som e cena existem no mesmo espaço semântico desde o início.

Este modelo usa destilação DMD-2 e otimização total de grafo via MagiCompiler. Em uma única GPU H100, leva cerca de 38 segundos para gerar um vídeo de 5 segundos em 1080p.

Ele suporta sincronia labial nativa para 7 idiomas: inglês, mandarim, cantonês, japonês, coreano, alemão e francês. Sua Taxa de Erro de Palavra (WER) está entre as mais baixas de qualquer modelo open-source.

Participantes do teste cego da Artificial Analysis afirmam que o HappyHorse se destaca especialmente na representação de personagens. A textura da pele e a suavidade dos movimentos são superiores. O fato de mais de 60% das amostras de teste serem retratos ou clipes de cabeças falantes foi um fator que impulsionou este modelo ao topo.

1280X1280 (5).PNG

No entanto, há críticas. Vídeos vazados apontaram ondulações não naturais, artefatos de listras em assuntos em movimento rápido e degradação da qualidade de imagem em telas grandes.


Open Source e Plano de Acesso

No dia 9 de abril, o HappyHorse‑1.0 anunciou que seria totalmente open-source. O repositório do GitHub está ativo, os pesos estão completamente abertos e não há restrições comerciais.

O site oficial oferece demonstrações online para texto-para-vídeo e imagem-para-vídeo. Segundo a Alibaba ATH, a API está programada para ser liberada ao público em 30 de abril.

No entanto, um aviso: segundo a equipe oficial, a maioria dos "sites oficiais" circulando online são falsos. O verdadeiro ainda não está totalmente operacional.


Impacto no Mercado e Significado

O HappyHorse apareceu duas semanas após a OpenAI interromper o desenvolvimento do Sora. Seu movimento foi visto como um sinal de estagnação no campo de vídeo por IA, mas um modelo chinês assumiu o bastão.

O mercado reagiu rapidamente. O preço das ações da Alibaba subiu mais de 7% após a confirmação e continuou a subir. No fechamento do mercado em 10 de abril, estava em alta de mais de 3%, chegando a HK$ 126,6.

Em um nível estratégico, o HappyHorse mostra que a ATH possui uma segunda equipe capaz de construir modelos multimodais de alto nível. Esta equipe tem experiência de negócios e entende as necessidades dos usuários e cenários comerciais. Isso criou uma estrutura de motor duplo: Tongyi Lab (focado em pesquisa básica) e a Unidade de Inovação (construindo aplicações a partir de desafios reais de negócios).

Vejamos a linha do tempo. Lin Junyang renunciou no início de março, e a ATH foi estabelecida em 16 de março. Em 2 de abril, o Qwen 3.6 Plus assumiu o primeiro lugar no volume global de chamadas do OpenRouter, e em 8 de abril, o HappyHorse liderou a lista da Artificial Analysis. Em apenas um mês, a Alibaba produziu resultados poderosos tanto em modelos de linguagem quanto de vídeo.


Histórico da Equipe: Zhang Di e Alibaba ATH

Por trás do HappyHorse está o peso-pesado Zhang Di.

Ele foi originalmente vice-presidente na Kuaishou e atuou como líder técnico do Kling AI. Ele é conhecido como o "pai do Kling". Ele deixou a Kuaishou em novembro de 2025 e assumiu a chefia do "Future Life Lab" da Alibaba, reportando-se diretamente ao cientista-chefe Zheng Bo.

Cinco meses depois, sua equipe construiu o HappyHorse‑1.0 e superou o Kling e o Seedance 2.0 da ByteDance.

Esta equipe fazia parte inicialmente do Future Life Lab do Taobao, mas foi transferida para a Unidade de Inovação de IA do grupo de negócios ATH após a última reorganização da Alibaba.

ATH significa "Alibaba Token Hub", estabelecido pelo CEO Wu Yongming em 16 de março, que o lidera pessoalmente. Sua missão é a "criação, fornecimento e aplicação de tokens", e integra o Tongyi Lab, a linha de negócios MaaS, o departamento Qianwen, o departamento Wukong e a Unidade de Inovação de IA.

Perguntas Frequentes

Que tipo de GPU é necessária para executar o HappyHorse localmente?

Este modelo tem 15 bilhões de parâmetros e não é pequeno. Em um ambiente H100 único, leva cerca de 38 segundos para gerar um vídeo de 5 segundos em 1080p. GPUs de consumo como a RTX 4090 (24GB VRAM) exigirão quantização ou offloading. É provável que exceda 24GB para inferência FP16. Alguns usuários relataram sucesso com quantização de 4 bits, mas a qualidade é reduzida. Para uso sério, recomenda-se uma GPU em nuvem com 40GB+ de VRAM. Alternativamente, é sensato esperar pelo lançamento da API em 30 de abril.

Posso fazer o fine-tuning do HappyHorse com meus próprios dados?

Sim, sob a licença. Não há restrições de uso comercial. No entanto, fazer o fine-tuning de um modelo de vídeo de 15 bilhões de parâmetros não é fácil. Requer um cluster H100 ou A100, um grande conjunto de dados de pares vídeo-áudio e recursos de engenharia significativos. O repositório do GitHub não contém scripts de fine-tuning atualmente e suporta apenas inferência. A equipe sugeriu que lançará código de treinamento no futuro, mas nenhuma data foi definida.

Existem grupos de comunidade no Discord ou WeChat?

Existem, mas não são oficiais. Várias comunidades de IA iniciaram tópicos no Discord e WeChat. A equipe oficial ainda não abriu canais formais de comunidade. Se você entrar em um grupo, cuidado com links falsos e golpes de phishing. É melhor verificar o repositório do GitHub e os anúncios oficiais da Alibaba ATH para as informações mais recentes.

Este modelo está disponível no Hugging Face?

Não até o momento desta publicação. A equipe afirmou que está trabalhando em um lançamento no Hugging Face, mas ainda não está concluído. Atualmente, os pesos estão apenas no GitHub. Membros da comunidade começaram a fazer upload de checkpoints convertidos para o Hugging Face, mas eles não são oficiais. Para sua segurança, use a fonte do GitHub até que a página oficial no Hugging Face apareça.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos