Seedance 2.5 现已上线 — 首发 Atlas Cloud

Wan 3.0 vs Wan 2.7: 我打开了阿里巴巴自己的演示文件。被广泛复制的三个规格都是错误的。

Wan 3.0 vs Wan 2.7: 30秒片段,20个参考槽,无4K,无开放权重。我们打开了阿里巴巴自己的演示文件,并重建了你可以今天运行的测试。

调色台与显示器,画面中显示巨型海怪场景

最新更新: Wan 3.0 已于2026年8月24日正式上线。

两个剪辑室监视器并排,左侧显示海怪在风暴中破水而出,右侧显示同一风暴被截短

播放阿里巴巴随 Wan 3.0 测试版附带的 30 秒海怪片段。渔船、倾盆大雨、闪电,然后海面向上炸开。十个不同镜头。没有一次剪切。背景的管弦乐由模型编写。

你的第一反应不是“哇”。而是“我的 Wan 2.7 到底缺了什么?”

于是我寻找答案,首先发现的是大部分互联网的回答都是错的。搜索 wan 3.0 vs wan 2.7,排名靠前的结果自信地告诉你 Wan 3.0 原生渲染 4K,权重已在 Hugging Face 上开放。两者都不对。我把官方演示文件拉到笔记本上,用 ffmpeg 读取,然后检查了模型注册表和已发布的价格层级。真正的升级很大。只是不是人们描述的那种升级。

Wan 3.0 vs Wan 2.7:关键要点

  • 时长是头号亮点。 Wan 3.0 一次性生成 30 秒,并带有自动“智能时长”推荐。Wan 2.7 在文生视频和图生视频中上限为 15 秒,参考生视频和视频编辑中上限为 10 秒。
  • 参考物从少数增加到大量。 Wan 2.7 最多接受 5 个参考项。Wan 3.0 最多接受 20 个,并且首次支持 doc、xls、ppt、pdf 和 md 文件以及网页作为生成输入。
  • 没有 4K。 阿里巴巴官方 API 价格表只有三个层级:480P、720P 和 1080P。在 Atlas Cloud 上,Wan 2.7 实际上通过其 1080P-SR 和 1440P-SR 超分辨率选项提供了更高的上限。
  • 权重未开源。 Hugging Face 上的 Wan-AI 组织最高仍停留在 Wan 2.2。没有 3.0 仓库,没有 2.7 仓库,也没有 2.5 仓库。
  • Wan 3.0 仅限测试版且仅限第一方使用。 它在阿里云百炼、万相网站、千问创作桌面应用及少数兄弟产品上运行。如果你本周需要一个可在生产环境中调用的 API,Wan 2.7 仍是可用的那个版本。
  • 想先看看格式再学习提示词语法? Atlas Cloud 有一个免费 AI 广告短剧生成器,可将一个产品描述转化为 15 秒的双角色喜剧广告,带对话语音。一次免费生成,无水印。

完整的 30 秒怪兽场景,由阿里巴巴在 Wan 3.0 公开测试期间生成,并发布在官方 Wan 3.0 创作者手册中。我们未生成此片段。打开声音:配乐是输出的一部分,而非后期添加的背景音乐。交付文件规格:1920x1072,24fps,30.07s,44.1kHz 立体声 AAC。

以下是规格表遗漏的第一件事。该文件是 1920x1072,而非 1920x1080。官方手册中的每个“1080p”演示都落在 1072 像素高度,而其他几个已发布的演示是简单的 1280x720。手册中的 19 个片段中有 12 个时长在 30.05 到 30.07 秒之间,这说明 30 秒上限是一个真正的硬限制,而非营销上的取整数字。

为什么 Wan 3.0 vs Wan 2.7 的问题比看起来更复杂

诚实的答案是,几乎没有人用相同的提示词运行过这两个模型,因为几乎没有人能做到。Wan 3.0 于 2026 年 8 月 6 日开放公开测试,并仅存在于阿里巴巴自有平台上(QbitAI,2026 年 8 月)。第三方推理平台尚未接入。因此,现有的对比内容只是规格表之间的对比,而规格表已被横向复制,直到错误固化。

三个完全错误的 Wan 3.0 vs Wan 2.7 “事实”

“Wan 3.0 是原生 4K。” 并非如此。已发布的 API 价格表为 480P、720P 和 1080P,价格分别为 ¥0.3、¥0.6 和 ¥1.2 每秒。三个层级,没有第四个。与此同时,Atlas Cloud 在 Wan 2.7 上提供 1080P-SR 和 1440P-SR,因此就纯像素上限而言,旧版本目前胜出。

“Wan 3.0 权重已开源。” 并非如此。浏览 Hugging Face 页面,Wan-AI 组织最新发布的系列是 Wan 2.2,包括 Animate 和 S2V 变体。核心视频线自 2.2 以来就未再发布权重。如果你想要在本地 ComfyUI 图中使用的东西,2.1 和 2.2 是你的选择,这一点没有改变。

“提示词语法可以直接沿用。” 这一条半真半假,且会以某种方式坑到你。单词可以沿用。结构不行。Wan 3.0 的官方提示词是带时间戳的多镜头脚本:怪兽提示词是十个编号镜头,广告牌提示词是四个带明确秒数范围的标注节拍。将一个十镜头脚本粘贴到 15 秒模型中,它不会优雅地挑选六个镜头。它会压缩。

为什么你不能简单地在 Wan 3.0 和 Wan 2.7 之间互换提示词

在此之下还有第二个陷阱,也是为什么“只需拼接两个片段”并不能救你的原因。

Wan 2.7 有一个视频续写模式。它看起来像是通往 30 秒的路径。但并非如此。你输入的源片段必须为 2 到 10 秒,因此 15 秒的生成不能作为种子。输出会重新编码源片段,这会吃掉你输入片段的尾部。而且链式续写往往会使结果回落到开头节拍,而不是推动故事向前发展。15 秒是 Wan 2.7 单个连续文件的硬上限。任何更长的内容都是编辑,而非生成。

这就是这两个版本之间真正的迁移成本,没有哪个对比表会展示给你。

Wan 3.0 vs Wan 2.7 规格表,以及实际运行位置

要测试任何这些,你需要一个在同一账户上运行文生视频、参考生视频和视频编辑的平台,按秒计费,这样失败的尝试只需花费几秒而非订阅费。本文中 Wan 2.7 侧的所有内容均在 Atlas Cloud 上运行,该平台托管了四个 Wan 2.7 端点以及用于参考测试的图像模型。Wan 3.0 尚未出现在 Atlas Cloud 或任何其他第三方平台上,这正是本文中 Wan 3.0 材料来自阿里巴巴官方测试版发布的原因。

表 1:Wan 3.0 vs Wan 2.7,版本对比

Wan 3.0 (公开测试版)Wan 2.7 (生产版)
单次生成最大时长30秒,带智能时长15秒 (t2v, i2v),10秒 (r2v, 视频编辑)
参考项最多 20 个最多 5 个 (每个主题 1 张图片,最多 3 个视频)
输入模态文本、图片、视频、音频、doc/xls/ppt/pdf/md、网页文本、图片、视频、音频
文档输入单个文件或链接,最大 100MB 和 50 页不支持
分辨率层级480P / 720P / 1080P720P / 1080P / 1080P-SR / 1440P-SR
原生音频
视频编辑指令编辑和参考编辑专用视频编辑端点
开源权重
运行位置仅阿里巴巴第一方平台第三方 API,包括 Atlas Cloud
标价¥0.3 / ¥0.6 / ¥1.2 每秒 (按层级)$0.1 每秒,720P 基准

表 2:本文使用的 Wan 2.7 端点

端点最大时长分辨率参考限制标价
文生视频2-15秒720P, 1080P, 1080P-SR, 1440P-SR不适用$0.1 / 秒
参考生视频2-10秒720P, 1080P, 1080P-SR, 1440P-SR5 项$0.1 / 秒
图生视频2-15秒720P, 1080P, 1080P-SR, 1440P-SR源片段 2-10秒$0.1 / 秒
视频编辑输出 2-10秒,输入 2-10秒720P (1.0x), 1080P (1.5x)3 张图片$0.1 / 秒

在运行任何内容之前,有一个定价细节值得你记住:“$0.1 每秒”这个标题是 720P 基准价格。视频编辑页面明确记载了 1080P 的 1.5 倍乘数,而“运行”按钮会显示你选择层级后的实际价格。看按钮,别看标题。

如需当前托管运行,请打开 Atlas Cloud 上的 Wan 3.0,在发布工作流之前测试类似下面的提示词。

Wan 3.0 提示词与生成效果截图,用于 wan-3.0-vs-wan-2.7

Wan 3.0 提示词到结果截图:匹配模型对比。

亲自运行 Wan 3.0 vs Wan 2.7 测试

四个步骤。其中两个使用阿里巴巴已发布的材料作为固定参考点,两个是你自己运行的操作。这里不需要访问 Wan 3.0 测试版。

步骤 1:获取 Wan 3.0 片段及其原始提示词

本测试的 Wan 3.0 侧并非需要你生成的内容。而是需要你阅读的内容。完整的怪兽提示词已发布在官方 Wan 3.0 创作者手册中,以及完成的片段,位于“灾难电影”示例下。这是一个中文脚本,包含十个编号镜头和一个单独描述配乐的段落。

在做任何其他事情之前,先读一遍。结构就是教训:十个镜头,每个都有各自的摄影机、主体和灯光说明,最后以配乐概要结束。这就是一个 30 秒单次生成提示词的样子。

步骤 2:在 Wan 2.7 文生视频中运行相同的提示词

打开 Wan 2.7 文生视频测试区,粘贴同一脚本的英文翻译。暂时不要缩短它。你想看看当意图超出上限时模型会做什么。

Plain
1一段 30 秒、逼真的电影感序列:深海怪兽在夜晚的暴风雨中现身。开场:一艘小型破旧渔船,船体上有白色字母“WAN”,在倾盆大雨中与巨浪搏斗;闪电短暂照亮整个海面。推至甲板中近景:海浪冲击船头,绳索、渔网和金属栏杆在风中猛烈摇晃,雨水在镜头前形成条纹。然后前方海面异常隆起,形成一个巨大的漩涡,一个巨大的暗影从船底经过,将船抬起。一名穿着湿透雨衣的水手紧抓栏杆,惊恐万分,转向水面。最后海面向上炸开,一只巨大的太平洋沿岸风格海怪破水而出:湿漉漉、布满伤疤、有脊状突起的皮肤,巨大的下颚,数十米高的水花。特写:它在闪电中咆哮。渔船几乎被吞没。结尾:广角镜头,海怪耸立在翻滚的大海上,船在画面中显得渺小,最后一道闪电。好莱坞灾难片配乐:低沉的次声波轰鸣和稀疏的弦乐,逐渐加入铜管和重打击乐,在海怪破水时达到高潮,最后以压抑的持续低音和弦结束。逼真的尺度,体积感的水体,高对比度的风暴照明。

设置:分辨率 1080P,时长 15 秒(最大值),宽高比 16:9,保持音频开启以便模型自行配乐。参考音频槽留空。

AI 视频生成器界面,显示编号步骤和生成的视频

Wan 2.7 文生视频测试区 (Atlas Cloud),已加载怪兽提示词,输出面板中显示完成的 15 秒片段

Wan 2.7 文生视频 (Atlas Cloud),提示词已粘贴,选择 1080P 和 16:9。运行按钮为这次短测试报价 $0.75,折合每秒 $0.15:这是 1.5 倍 1080P 乘数,显示在模型页面上,而其标题数字是 $0.1。

然后再次运行,在提示词末尾附加一行:

Plain
1单次连续拍摄,无剪切。优先处理破水时刻;压缩铺垫部分。

这一行就是迁移工作的缩影。一个 30 秒的脚本必须被重新编写为 15 秒的意图,而由你决定哪七个镜头被舍弃。

左侧:官方 Wan 3.0 输出,30 秒。右侧:Atlas Cloud 上的 Wan 2.7 运行相同提示词,在其 15 秒上限处停止。

步骤 3:为 Wan 3.0 vs Wan 2.7 身份一致性测试构建参考图像

时长是明显的升级。像素级的一致性才是真正改变生产工作的那个,你可以用两只猫来测试。

阿里巴巴的手册包含一个韦斯·安德森风格的拼贴,其中同一只布偶猫和同一只黑猫必须在五个截然不同的环境中保持一致性:一个对称的酒店走廊、一个剖视侧面图、一个洗衣机滚筒、一个机场行李传送带和一个红色电话亭。两只猫都通过 @Image1@Image2 参考标签固定。

首先自己生成两个参考图像。使用 GPT Image 2,质量设置为高,16:9 画幅,运行两次。

Plain
1一只蓬松布偶猫的工作室肖像,蓝眼睛,深色面具,坐直面向镜头,均匀照明,纯浅粉色背景,清晰的毛发细节,全身可见,干净的参考图框架。
Plain
1一只小巧光滑的黑猫工作室肖像,明亮的琥珀色眼睛,侧身站立面向右侧,均匀照明,纯浅粉色背景,清晰的毛发细节,全身可见,干净的参考图框架。

AI 图像生成器界面,显示输入设置和生成的猫

Atlas Cloud 上的 GPT Image 2 测试区,质量设置为高,输出面板中渲染了布偶猫参考图

GPT Image 2,质量高,16:9。以相同方式运行第二个提示词以获取黑猫。

步骤 4:在 Wan 2.7 参考生视频上运行身份一致性测试

将两只猫上传到 Wan 2.7 参考生视频端点。分辨率 1080P,宽高比 16:9,时长 10 秒,这是该端点的最大值。下面的提示词将手册中的镜头列表从五个节拍压缩为三个,因为十秒不足以容纳五个。

Plain
1韦斯·安德森风格,完全对称,平面正面构图,柔和色调。参考图像 1 是布偶猫,参考图像 2 是黑猫;在每个镜头中保持两只猫一致。镜头 1:无限延伸的对称酒店走廊,布偶猫带着严肃表情径直向镜头跑来,黑猫在背景中扭过头 180 度疾驰而去。镜头 2:走廊的剖视侧面图,粉色花纹壁纸和金色画框,布偶猫从左向右走,黑猫从右向左穿越。镜头 3:正面特写,薄荷绿复古洗衣机门,两只猫僵硬地漂浮在滚筒内的泡沫中,眼神空洞,身后排列着彩虹色洗涤剂瓶。严格的水平和垂直线条,无摄影机倾斜,冷面荒诞幽默。

AI 视频生成器界面,显示文本提示词和生成的猫视频

Atlas Cloud 上的 Wan 2.7 参考生视频测试区,已加载两只猫参考图像,输出面板中显示完成的片段

Wan 2.7 参考生视频:两只猫已加载到图像参考槽,分辨率设置为 1080P,运行按钮在开始前报价。两个参考项已经占用了该端点接受量的很大一部分。Wan 3.0 接受 20 个参考项。

现在将两者并排放置。

一只蓬松猫直立站在一只黑猫旁边,在一个宏伟的走廊里

官方 Wan 3.0 身份锁定片段:同一只布偶猫和黑猫在酒店走廊、剖视墙壁、洗衣机滚筒、行李传送带和红色电话亭中保持一致

由阿里巴巴在 Wan 3.0 公开测试期间生成,并发布在官方创作者手册中。五个环境,19.9 秒,两只猫通过参考标签固定。此处显示为静音 GIF;交付文件带有 44.1kHz 立体声音频。

两只猫走在一条长长的粉色走廊里

Wan 2.7 参考生视频结果,相同简报,三个镜头,在 10 秒上限内

Atlas Cloud 上的 Wan 2.7 参考生视频,相同的两个参考图,此处显示为静音 GIF。这是该端点的默认 5 秒输出,而非完整的 10 秒:值得注意,时长控制并不总是如你所设,因此请在按下运行按钮前读取报价。观察猫的斑纹和布偶猫的面具;这就是“像素级一致性”声明所涉及的维度。

另外四个值得重新运行的 Wan 3.0 vs Wan 2.7 提示词

怪兽片段侧重于时长和物理效果。这三个侧重于不同方面,每个都会与不同的 Wan 2.7 限制相冲突。这三个都是阿里巴巴官方手册中测试版的输出。

Wan 3.0,官方测试版输出:一个单次 30 秒后退穿过荧光灯医院走廊的镜头,浅绿色单色调配色,女演员大声呼救。打开声音。表演、脚步声和设备嗡嗡声均为模型生成。

表 3:每个提示词的要求,以及 Wan 2.7 的限制

提示词脚本要求的内容Wan 2.7 的已发布限制被测试的维度
怪兽破水10 个编号镜头,跨越 30 秒,外加配乐概要文生视频最大 15 秒时长和多镜头叙事
医院走廊一个 30 秒连续拍摄,带对话语音最大 15 秒,原生音频可用长镜头中的表演和对话
加油站牛仔女30 秒喜剧弧线,分为四个计时幕最大 15 秒,因此必须去掉两个幕需要运行时长的喜剧节奏
广告牌单次拍摄四个节拍,带明确秒数范围,无剪切最大 15 秒,因此范围需要重写长移动镜头中的摄影机物理效果
两只猫,五个房间2 个标记主体,在 5 个环境中保持一致最大 10 秒,5 个参考槽身份一致性

同一想法的免费 15 秒版本

再看一下加油站片段。这种格式——一个短喜剧小品,两个角色,一个反转和一个笑点——正是 Wan 3.0 额外时长发挥最大价值的地方。它也是最有可能卖东西的格式。

问题在于提示词。手册中的喜剧示例有 800 字,带有明确的时间戳和走位。这是一项真正的技能,需要花一个周末来学习。

如果你只想在投入那个周末之前看看这个格式是否适合你的产品,Atlas Cloud 有一个免费工具,完全跳过提示词工程。你描述产品,可选上传最多四张产品照片(每张 8MB),选择六种风格之一(搞笑梗、情节反转、情景喜剧、暖心、奢华或硬推销),它会编写双角色脚本,分配声音,生成对话和音效,并返回一个完整的 15 秒广告,作为连续场景呈现。下载内容干净,无水印。你需要登录,在充值积分前可获得一次免费生成。

图表显示文本输入转化为 AI 视频广告

一行产品文案输入,一个完整的 15 秒喜剧广告输出:Atlas Cloud 的免费 AI 广告短剧生成器

免费 AI 广告短剧生成器:一个产品描述输入,一个 15 秒双角色广告输出。

公园里兴奋的年轻人看着黑色背包内部

免费生成器的实际输出。打开声音:脚本、两个声音和音效均来自一次运行。

运行 Wan 3.0 vs Wan 2.7 对比的成本

按秒计算,在 720P 层级上,两个版本的价格相近。成本差异在于结构:一个原本 15 秒的片段现在变成了 30 秒,因此完成品的成本大致翻倍。

表 4:同一怪兽序列,四种方式

运行费率总计
Wan 3.0, 30秒, 720P¥0.6 / 秒¥18,约 $2.50
Wan 3.0, 30秒, 1080P¥1.2 / 秒¥36,约 $5.00
Wan 2.7, 15秒, 720P$0.10 / 秒$1.50
Wan 2.7, 15秒, 1080P$0.10 / 秒,带 1.5x 层级乘数$2.25
Wan 2.7, 15秒, 1440P-SR运行按钮实时报价运行按钮实时报价
免费 AI 广告短剧, 15秒免费,每个账户一次生成$0.00

两个注意事项。测试版定价并非通用定价,阿里巴巴已表示 API 将很快更广泛开放,因此请将 ¥ 数字视为公开测试版的快照,而非承诺费率。而在 Atlas Cloud 这边,在提交之前始终读取运行按钮上的实时报价,因为分辨率乘数是在那里应用的,而非标题价格中。

阿里巴巴也异常直接地指出了 Wan 3.0 仍然薄弱的地方,表示该模型“在音质和文本准确性方面仍有改进空间。”这与文件显示的情况一致:官方演示中的音频是 44.1kHz 立体声,但编码为适中的 32 kb/s,这对于预览来说可以,但对于交付母带来说略显单薄。

Wan 3.0 vs Wan 2.7 许可:你实际可以发布什么

简短版本,请在将任何内容交给客户前自行核实当前条款。

Wan 3.0 处于公开测试阶段,其商业条款尚未确定。由于权重未发布,完全没有自托管路径;你制作的任何内容都通过阿里巴巴的 API 或其消费者端进行,并受生成当日这些条款的约束。Wan 2.7 在权重方面情况相同,但已投入生产足够长的时间,平台 API 条款已稳定。如果你通过第三方平台运行,你的商业权利来自该平台的服务条款,因此请阅读实际适用于你账户的条款。以上两段均非法律建议。

Wan 3.0 vs Wan 2.7 常见问题解答

Wan 3.0 是开源的?我可以在 ComfyUI 中运行它吗?

不。截至 2026 年 8 月,Hugging Face 上的 Wan-AI 组织下没有 Wan 3.0 仓库,Wan-Video GitHub 上也没有。已发布权重的最新 Wan 系列是 Wan 2.2,包括 Animate 和 S2V 变体。对于本地 ComfyUI 图,你仍在使用 2.1 或 2.2。Wan 3.0 仅限 API 和网页端。

Wan 3.0 vs Wan 2.7 分辨率:Wan 3.0 真的能生成 4K 吗?

不。已发布的 API 价格表有三个分辨率层级:480P、720P 和 1080P。几个广泛传播的对比帖子声称原生 4K,它们是错误的。就原始输出上限而言,Atlas Cloud 上的 Wan 2.7 实际上通过其 1080P-SR 和 1440P-SR 超分辨率选项提供了更高的上限。

我可以通过扩展片段从 Wan 2.7 获得 30 秒吗?

不能作为单个连续文件。续写模式要求源片段为 2 到 10 秒,因此完整的 15 秒生成不能作为种子。输出会重新编码并截断你输入的任何内容的尾部,而链式续写往往会使结果回落到开场节拍。超过 15 秒,你是在编辑,而非生成。

Wan 3.0 vs Wan 2.7:我目前可以在哪里实际运行每个版本?

Wan 3.0 处于公开测试阶段,仅在阿里巴巴自有平台上运行:阿里云百炼、万境亿刻、万相网站、千问创作桌面客户端、IF STUDIO 和堆友,千问 App 中有灰度访问。目前没有任何第三方推理平台托管它。Wan 2.7 是你仍然可以直接调用的版本,在文生视频、图生视频、参考生视频和视频编辑端点上均可。

Wan 3.0 vs Wan 2.7 定价:每个完成片段哪个更贵?

在 720P 层级上,按秒计算两者接近。按完成片段计算,预计大约翻倍,因为自然输出长度从 15 秒变成了 30 秒。预算时要考虑运行时长的变化,而非费率变化,并记住测试版定价在正式发布后可能不会保持不变。

我需要为 Wan 3.0 重写我的 Wan 2.7 提示词吗?

是的,而且重写是结构性的,而非词汇性的。Wan 2.7 提示词用丰富的细节描述一个连续镜头。Wan 3.0 提示词是带时间戳的镜头列表,有时还带有单独的配乐段落,模型也可以将 pdf 或演示文稿作为输入。经验法则:对于 Wan 2.7,写一个段落描述一个镜头;对于 Wan 3.0,写一个带秒数范围的编号场景分解。

最新模型

一个 API,畅享全模态 AI。

探索全部模型