4月初,一款名为“HappyHorse-1.0”的模型突然现身,一举登顶 Artificial Analysis 视频模型排行榜的四个类别,以较大优势超越了字节跳动的 Seedance 2.0 和 Kling。
当时,没有任何新闻稿或博客文章,公司名称也被刻意隐去,模型页面仅显示“即将到来(coming soon)”。
4月10日,阿里巴巴 ATH 事业部确认了该项目。HappyHorse 是 ATH 创新单元的一个内部研发项目,目前处于内测阶段,API 将于4月30日发布。
此外,HappyHorse-1.0 将完全开源。它被称为首个能原生实现音视频同步生成的开源视频模型。
这种“静默发布”后接“盛大官宣”的模式,正成为中国 AI 公司的流行趋势。小米曾用代号“Hunter Alpha”进行尝试,智谱 AI 也曾为新版 GLM 模型使用过“Pony Alpha”这一代号。
本文将为您拆解关于 HappyHorse 的已知事实及其背后的意义。
HappyHorse 在排行榜上的表现
Artificial Analysis 目前运营着四个榜单:无音频文生视频、无音频图生视频、带音频文生视频以及带音频图生视频。
截至4月13日中午的数据如下:
- 文生视频(无音频):Elo 分数 1384,领先 Seedance 2.0 达 111 分。
- 图生视频(无音频):Elo 分数 1413,这是该平台记录以来的最高分。


在 Elo 分数中,超过 60 分的差距即代表有明显的偏好差异。111 分的差距意味着在盲测中,用户压倒性地选择了 HappyHorse。
然而,加入音频后情况有所不同。差距缩小到仅 1–2 分,几乎可以视为平局。这表明 HappyHorse 的音视频同步和音质并没有表现出绝对的领先优势。在这一点上,它与 Seedance 基本持平。
HappyHorse 与 Seedance 2.0 的对比
| 项目 | HappyHorse-1.0 | Seedance 2.0 |
|---|---|---|
| 模型性质 | 开源 | 闭源商业系统 |
| 架构 | 统一 Transformer | 双向扩散 Transformer (DB-DiT) |
| 多模态能力 | 音视频同步生成 (One-pass) | 多模态输入 (文本、图像、视频、音频) |
| 视频生成模式 | 一次性生成 (One-pass) | 流水线生成 (Pipeline-based) |
| 视频生成长度 | 约 5–10 秒 (1080p) | 最长约 60 秒 (2K) |
两者代表了不同的技术路径。
HappyHorse-1.0:开源,采用统一 Transformer 架构,支持音视频同步生成,一次性处理。原生支持 7 种语言的口型同步。拥有 150 亿参数,在 H100 环境下生成 5 秒 1080p 视频需 38 秒。
Seedance 2.0:闭源商业系统,采用双向扩散 Transformer (DB-DiT),支持多模态输入,能够生成 60 秒 2K 视频,支持 8 种以上语言的口型同步。
在纯视觉质量方面,HappyHorse 在盲测中明显胜出;在音视频同步和音质方面,两者大致相当;在易用性方面,Seedance 已通过火山引擎等服务提供了成熟的 API。HappyHorse 的 API 计划于 4月30日发布,其在内测中的实际表现仍待验证。
由 Artificial Analysis 对比的 HappyHorse-1.0 与 Dreamina Seedance 2.0(带音频文生视频)生成示例:
提示词:一部皮克斯风格的短动画,讲述了一个害羞的小交通锥,梦想着成为大型赛车终点线的路标。其他交通锥嘲笑它的雄心壮志。一名建筑工人无意中把它放在了马拉松的终点线。当赛跑者经过时,交通锥的表情从恐惧变成了喜悦,头顶上方飘下五彩纸屑。其他交通锥在电视上看到了它,并深受鼓舞。音频:从交通噪音到人群欢呼,再到励志音乐。
关于架构
HappyHorse 采取了一种非同寻常的方法。
它拥有 150 亿参数,使用 40 层统一自注意力 Transformer 架构。文本、视频和音频 token 都被输入到同一个序列中并进行联合建模。这与常见的“先生成视频,再添加音频”的流水线模式有显著不同。在这里,声音和场景从一开始就存在于同一个语义空间中。
该模型使用了 DMD-2 蒸馏技术,并通过 MagiCompiler 进行全图优化。在单张 H100 GPU 上,生成 5 秒 1080p 视频大约需要 38 秒。
它原生支持 7 种语言的口型同步:英语、普通话、粤语、日语、韩语、德语和法语。其单词错误率 (WER) 在所有开源模型中处于极低水平。
参加 Artificial Analysis 盲测的用户表示,HappyHorse 在角色刻画方面表现尤为出色,皮肤纹理和动作流畅度均属上乘。测试样本中超过 60% 为肖像或说话人视频,这也是该模型登顶的重要因素。
不过,也有批评声音指出,泄露的视频中存在不自然的波纹、快速移动物体的条纹伪影,以及在大屏幕上画质下降的问题。
开源与访问计划
4月9日,HappyHorse-1.0 宣布完全开源。GitHub 仓库已上线,权重完全公开,且没有任何商业限制。
官方网站提供了文生视频和图生视频的在线演示。根据阿里巴巴 ATH 的说法,API 计划于 4月30日向公众开放。
需要提醒的是,据官方团队称,网上流传的多数“官方网站”均为假冒,真正的官网目前尚未完全上线。
市场影响与意义
HappyHorse 的出现正值 OpenAI 停止 Sora 开发后的两周。这一举动被视为 AI 视频领域进入停滞期的信号,而中国模型接过这一接力棒。
市场反应迅速。在确认该消息后,阿里巴巴股价一度上涨超过 7%,并持续走高。截至 4月10日收盘,涨幅超过 3%,报 126.6 港元。
从战略层面看,HappyHorse 表明 ATH 拥有第二支能够构建顶级多模态模型的团队。该团队具备业务背景,深谙用户需求和商业场景。这形成了一种“双引擎”结构:通义实验室(专注基础研究)与创新单元(从真实业务挑战中构建应用)。
回顾时间轴:林俊杨于3月初离职,ATH 于3月16日成立。4月2日,Qwen 3.6 Plus 夺得 OpenRouter 全球调用量第一,4月8日,HappyHorse 登顶 Artificial Analysis 榜单。短短一个月内,阿里巴巴在语言和视频模型方面均取得了强劲成果。
团队背景:张迪与阿里巴巴 ATH
HappyHorse 背后的操盘手是重量级人物张迪。
他曾任快手副总裁,并担任 Kling AI 的技术负责人,被称为“Kling 之父”。他于 2025 年 11 月离开快手,接手阿里巴巴“未来生活实验室”,直接向首席科学家郑博汇报。
五个月后,他的团队构建了 HappyHorse-1.0,并击败了 Kling 和字节跳动的 Seedance 2.0。
该团队最初隶属于淘宝未来生活实验室,在阿里巴巴最新一次架构调整后,被整合进了 ATH 事业群下的 AI 创新单元。
ATH 代表“Alibaba Token Hub”,由首席执行官吴泳铭于 3月16日亲自创立。其使命是“代币(Token)的创造、供给与应用”,整合了通义实验室、MaaS 业务线、千问部门、悟空部门以及 AI 创新单元。
常见问题解答
在本地运行 HappyHorse 需要什么样的 GPU?
该模型拥有 150 亿参数,体量不小。在单张 H100 环境下,生成 5 秒 1080p 视频需要约 38 秒。对于 RTX 4090 (24GB 显存) 等消费级 GPU,需要进行量化处理或卸载部分计算。FP16 推理很可能超过 24GB 显存。部分用户反馈 4-bit 量化版本运行成功,但质量有所下降。若要严肃使用,建议配置显存 40GB 以上的云端 GPU。当然,等待 4月30日发布的 API 也是明智之选。
可以用自己的数据微调 HappyHorse 吗?
可以,在许可证范围内允许。且没有商业使用限制。但微调一个 150 亿参数的视频模型并非易事,需要 H100 或 A100 集群、大量的视频-音频对数据集以及雄厚的工程资源。目前的 GitHub 仓库尚未包含微调脚本,仅支持推理。团队已暗示未来会发布训练代码,但尚未确定日期。
有 Discord 或微信交流群吗?
有,但均为非官方。一些 AI 社区已在 Discord 和微信上建立了讨论组。官方团队尚未开设正式的社群渠道。如果加入此类群组,请务必警惕假冒链接和钓鱼诈骗。建议以 GitHub 仓库和阿里巴巴 ATH 的官方公告为准。
这个模型在 Hugging Face 上线了吗?
截至撰稿时还没有。团队表示正在处理 Hugging Face 的发布事宜,但尚未完成。目前权重仅在 GitHub 上提供。社区成员已开始上传转换后的 checkpoint 到 Hugging Face,但这些均为非官方来源。为安全起见,请在官方页面发布前优先使用 GitHub 资源。






