A principios de abril, apareció repentinamente un modelo llamado "HappyHorse-1.0". Encabezó cuatro categorías en la tabla de clasificación de vídeo de Artificial Analysis, superando ampliamente a Seedance 2.0 de ByteDance y a Kling.
No hubo comunicados de prensa, ni publicaciones en blogs, y el nombre de la empresa permanecía oculto. La página del modelo simplemente decía "próximamente".
El 10 de abril, la división ATH de Alibaba reconoció el proyecto. HappyHorse es un proyecto interno de I+D de la unidad de innovación de ATH y actualmente se encuentra en fase beta privada. La API se lanzará el 30 de abril.
Además, HappyHorse-1.0 será totalmente de código abierto. Se promociona como el primer modelo de vídeo de código abierto que genera audio y vídeo de forma nativa y simultánea.
Este "lanzamiento silencioso" seguido de un "anuncio espectacular" se está convirtiendo en una tendencia entre las empresas de IA chinas. Xiaomi hizo esto con el nombre en clave "Hunter Alpha", y Zhipu utilizó "Pony Alpha" para su nuevo modelo GLM.
En este artículo, desentrañamos los hechos conocidos sobre HappyHorse y lo que esto significa.
Posición de HappyHorse en la tabla de clasificación
Artificial Analysis gestiona cuatro tablas de clasificación: texto a vídeo sin audio, imagen a vídeo sin audio, texto a vídeo con audio e imagen a vídeo con audio.
Los datos al mediodía del 13 de abril son los siguientes:
- Texto a vídeo (sin audio): 1384 Elo. Está 111 puntos por delante de Seedance 2.0.
- Imagen a vídeo (sin audio): 1413 Elo. Esta es la puntuación más alta registrada en la plataforma.


En las puntuaciones Elo, una diferencia superior a 60 puntos indica una preferencia clara. Una diferencia de 111 puntos indica que los usuarios eligieron abrumadoramente HappyHorse en pruebas a ciegas.
Sin embargo, la situación cambia cuando se incluye el audio. La diferencia se reduce a apenas 1 o 2 puntos, lo que equivale a un empate. Esto demuestra que la sincronización audiovisual y la calidad de sonido de HappyHorse no son drásticamente superiores. En este aspecto, está prácticamente a la par con Seedance.
Comparativa entre HappyHorse y Seedance 2.0
| Elemento | HappyHorse-1.0 | Seedance 2.0 |
|---|---|---|
| Naturaleza del modelo | Código abierto | Sistema comercial cerrado |
| Arquitectura | Unified Transformer | Bidirectional Diffusion Transformer (DB-DiT) |
| Capacidad multimodal | Generación simultánea audio/vídeo (One-pass) | Entrada multimodal (texto, imagen, vídeo, audio) |
| Modo de generación | Generación One-pass | Generación basada en pipeline |
| Duración | Aprox. 5–10 segundos (1080p) | Hasta aprox. 60 segundos (2K) |
Ambos representan filosofías diferentes.
HappyHorse‑1.0: Código abierto. Unified Transformer. Generación simultánea de audio/vídeo. Procesamiento "one-pass". Soporte nativo de sincronización labial para 7 idiomas. 15 mil millones de parámetros. Tarda 38 segundos en generar un vídeo de 5 segundos a 1080p en un entorno H100.
Seedance 2.0: Sistema comercial cerrado. Bidirectional Diffusion Transformer (DB‑DiT). Entrada multimodal. Capaz de generar vídeos 2K de 60 segundos. Soporta sincronización labial en más de 8 idiomas.
En cuanto a la calidad visual pura, HappyHorse es claramente preferido en las pruebas a ciegas. En cuanto a la sincronización audiovisual y la calidad de sonido, ambos son prácticamente iguales. En términos de usabilidad, Seedance ya proporciona una API madura a través de servicios como Volcano Engine. La API de HappyHorse está programada para su lanzamiento el 30 de abril, y el rendimiento en la beta privada aún está bajo verificación.
Comparativa de ejemplos de generación entre HappyHorse-1.0 y Dreamina Seedance 2.0 (texto a vídeo con audio) realizada por Artificial Analysis:
Prompt: Una animación corta al estilo Pixar sobre un tímido cono de tráfico que sueña con ser el cono de la línea de meta en una gran carrera. Los otros conos se ríen de su ambición. Un trabajador de la construcción lo coloca accidentalmente en la línea de meta de un maratón. A medida que los corredores pasan, la expresión pintada del cono cambia del miedo a la alegría. El confeti cae desde arriba. Los otros conos lo ven por televisión y se inspiran. Audio: Desde ruido de tráfico hasta vítores de la multitud, y luego música inspiradora.
Sobre la arquitectura
HappyHorse adopta un enfoque inusual.
Cuenta con 15 mil millones de parámetros y utiliza un Transformer de autoatención unificado de 40 capas. Los tokens de texto, vídeo y audio se introducen en la misma secuencia y se modelan conjuntamente. Esto difiere significativamente del proceso común de "generar primero el vídeo y luego añadir el audio". Aquí, el sonido y la escena existen en el mismo espacio semántico desde el principio.
Este modelo utiliza destilación DMD-2 y optimización completa de grafos mediante MagiCompiler. En una sola GPU H100, tarda unos 38 segundos en generar un vídeo de 5 segundos a 1080p.
Soporta sincronización labial nativa para 7 idiomas: inglés, mandarín, cantonés, japonés, coreano, alemán y francés. Su tasa de error de palabras (WER) es de las más bajas entre todos los modelos de código abierto.
Los participantes en la prueba a ciegas de Artificial Analysis afirman que HappyHorse destaca especialmente en la representación de personajes. La textura de la piel y la fluidez del movimiento son superiores. El hecho de que más del 60% de las muestras de prueba fueran retratos o clips de "talking-head" fue un factor que impulsó a este modelo a la cima.
Sin embargo, hay críticas. Algunos vídeos filtrados han señalado ondulaciones poco naturales, artefactos de rayas en sujetos que se mueven rápido y una degradación de la calidad de imagen en pantallas grandes.
Código abierto y plan de acceso
El 9 de abril, HappyHorse‑1.0 anunció que sería completamente de código abierto. El repositorio de GitHub está activo, los pesos están completamente abiertos y no existen restricciones comerciales.
El sitio web oficial ofrece demostraciones en línea para texto a vídeo e imagen a vídeo. Según Alibaba ATH, el lanzamiento de la API al público está programado para el 30 de abril.
Sin embargo, una advertencia: según el equipo oficial, la mayoría de los "sitios web oficiales" que circulan en línea son falsos. El real aún no está totalmente operativo.
Impacto en el mercado y significado
HappyHorse apareció dos semanas después de que OpenAI detuviera el desarrollo de Sora. Su movimiento fue visto como un signo de estancamiento en el campo del vídeo generado por IA, pero un modelo chino ha tomado el relevo.
El mercado reaccionó rápidamente. El precio de las acciones de Alibaba subió más de un 7% tras la confirmación y siguió aumentando. Al cierre de la sesión del 10 de abril, subía más de un 3% hasta los 126,6 HKD.
A nivel estratégico, HappyHorse demuestra que ATH posee un segundo equipo capaz de construir modelos multimodales de primer nivel. Este equipo tiene experiencia empresarial y comprende las necesidades de los usuarios y los escenarios comerciales. Esto creó una estructura de doble motor: Tongyi Lab (centrado en investigación básica) y la Unidad de Innovación (que construye aplicaciones a partir de desafíos comerciales reales).
Observemos la cronología. Lin Junyang renunció a principios de marzo y ATH se estableció el 16 de marzo. El 2 de abril, Qwen 3.6 Plus ocupó el primer lugar en el volumen de llamadas global de OpenRouter, y el 8 de abril, HappyHorse encabezó la lista de Artificial Analysis. En solo un mes, Alibaba produjo resultados potentes tanto en modelos de lenguaje como de vídeo.
Antecedentes del equipo: Zhang Di y Alibaba ATH
Detrás de HappyHorse se encuentra el peso pesado Zhang Di.
Originalmente fue vicepresidente en Kuaishou y se desempeñó como líder técnico de Kling AI. Es conocido como el "padre de Kling". Dejó Kuaishou en noviembre de 2025 y asumió el cargo de director del "Future Life Lab" de Alibaba, reportando directamente al científico jefe Zheng Bo.
Cinco meses después, su equipo construyó HappyHorse‑1.0 y superó a Kling y a Seedance 2.0 de ByteDance.
Este equipo formaba parte inicialmente del Future Life Lab de Taobao, pero fue trasladado a la Unidad de Innovación de IA del grupo empresarial ATH tras la última reorganización de Alibaba.
ATH significa "Alibaba Token Hub", establecido por el CEO Wu Yongming el 16 de marzo, quien lo lidera personalmente. Su misión es la "creación, provisión y aplicación de tokens", e integra Tongyi Lab, la línea de negocio MaaS, el departamento Qianwen, el departamento Wukong y la Unidad de Innovación de IA.
Preguntas frecuentes
¿Qué tipo de GPU se requiere para ejecutar HappyHorse localmente?
Este modelo tiene 15 mil millones de parámetros y no es pequeño. En un entorno H100, tarda unos 38 segundos en generar un vídeo de 5 segundos a 1080p. Las GPU de consumo como la RTX 4090 (24 GB de VRAM) requerirán cuantización o descarga (offloading). Es probable que supere los 24 GB para inferencia en FP16. Algunos usuarios han reportado éxito con cuantización de 4 bits, pero la calidad se reduce. Para un uso serio, se recomienda una GPU en la nube con más de 40 GB de VRAM. Alternativamente, es prudente esperar al lanzamiento de la API el 30 de abril.
¿Puedo ajustar (fine-tune) HappyHorse con mis propios datos?
Sí, bajo la licencia. No hay restricciones de uso comercial. Sin embargo, ajustar un modelo de vídeo de 15 mil millones de parámetros no es sencillo. Requiere un clúster de H100 o A100, un gran conjunto de datos de pares vídeo-audio y recursos de ingeniería significativos. El repositorio de GitHub no contiene actualmente scripts de ajuste fino y solo admite inferencia. El equipo ha insinuado que publicará código de entrenamiento en el futuro, pero no se ha fijado fecha.
¿Existen grupos de comunidad en Discord o WeChat?
Existen, pero no son oficiales. Varias comunidades de IA han iniciado hilos en Discord y WeChat. El equipo oficial aún no ha abierto canales comunitarios formales. Si se une a un grupo, tenga cuidado con los enlaces falsos y las estafas de phishing. Lo mejor es consultar el repositorio de GitHub y los anuncios oficiales de Alibaba ATH para obtener la información más reciente.
¿Está este modelo disponible en Hugging Face?
No al momento de escribir este artículo. El equipo ha declarado que están trabajando en un lanzamiento en Hugging Face, pero aún no está completo. Actualmente, los pesos solo están en GitHub. Miembros de la comunidad han comenzado a subir puntos de control (checkpoints) convertidos a Hugging Face, pero no son oficiales. Para estar seguro, utilice la fuente de GitHub hasta que aparezca la página oficial de Hugging Face.






