
两台剪辑套件显示器并排摆放,左侧显示一只海怪冲破风暴,右侧显示同一场风暴被截断
播放阿里巴巴随 Wan 3.0 测试版提供的 30 秒海怪片段。渔船、暴雨、闪电,然后海面猛然炸开。十个不同镜头,一个剪辑点都没有。其下的管弦乐配乐也是模型生成的。
你的第一反应不是“哇”,而是“我用的 Wan 2.7 到底缺了什么?”
于是我四处寻找答案,结果发现互联网上大部分答案都是错的。搜索 wan 3.0 vs wan 2.7,排名靠前的结果信心满满地告诉你:Wan 3.0 原生渲染 4K,权重已在 Hugging Face 上开源。这两条都不是真的。我把官方演示文件下载到笔记本上,用 ffmpeg 读取,然后检查了模型注册表和已发布的价格档位。真正的升级很大,但不是人们描述的那种升级。
Wan 3.0 vs Wan 2.7:关键要点
- 时长是重头戏。 Wan 3.0 一次生成 30 秒,并带有自动“智能时长”推荐。Wan 2.7 在文生视频和图生视频上最多 15 秒,在参考生视频和视频编辑上最多 10 秒。
- 参考素材从少数几个变成众多。 Wan 2.7 最多接受 5 个参考项。Wan 3.0 最多接受 20 个,并且首次支持 doc、xls、ppt、pdf 和 md 文件,以及网页作为生成输入。
- 没有 4K。 阿里巴巴自己的 API 价格表只有三个档位:480P、720P 和 1080P。在 Atlas Cloud 上,Wan 2.7 实际上通过其 1080P-SR 和 1440P-SR 超分辨率选项提供了更高的上限。
- 权重未开源。 Hugging Face 上的 Wan-AI 组织仍然停留在 Wan 2.2。没有 3.0 仓库,没有 2.7 仓库,也没有 2.5 仓库。
- Wan 3.0 仅限测试版且仅限第一方。 它在阿里云百炼、万相网站、通义千问创作桌面应用以及少数姊妹产品上运行。如果你本周需要生产环境可调用的 API,Wan 2.7 仍然是可用的版本。
- 想在学提示词语法之前先看看格式? Atlas Cloud 有一个免费 AI 广告短剧生成器,只需一个产品描述就能生成 15 秒的双角色喜剧广告,带对话配音。一次免费生成,无水印。
完整 30 秒怪兽片段,由阿里巴巴在 Wan 3.0 公开测试期间生成,并发布在官方 Wan 3.0 创作者手册中。我们未生成此片段。打开声音:配乐是输出的一部分,而非后期添加的背景音乐。交付文件规格:1920x1072,24fps,30.07s,44.1kHz 立体声 AAC。
这是规格表忽略的第一件事。该文件是 1920x1072,而不是 1920x1080。官方手册中的所有“1080p”演示最终高度都是 1072 像素,其他几个已发布的演示只是 1280x720。手册中 19 个片段里有 12 个时长在 30.05 到 30.07 秒之间,这说明 30 秒上限是一个真正的硬性限制,而非营销上的整数。
为什么 Wan 3.0 vs Wan 2.7 的问题比看起来更复杂
老实说,几乎没有人用相同的提示词运行过两个模型,因为几乎没有人能这么做。Wan 3.0 于 2026 年 8 月 6 日开放公开测试,且仅存在于阿里巴巴自己的平台上(QbitAI,2026 年 8 月)。第三方推理平台尚未接入。因此,现有的对比内容都是规格表之间的对比,而且规格表被反复横向复制,直到错误固化。
三条完全错误的 Wan 3.0 vs Wan 2.7 “事实”
“Wan 3.0 是原生 4K。” 并非如此。已发布的 API 价格表为 480P、720P 和 1080P,价格分别为 ¥0.3、¥0.6 和 ¥1.2 每秒。三个档位,没有第四个。与此同时,Atlas Cloud 在 Wan 2.7 上提供了 1080P-SR 和 1440P-SR,因此纯像素上限方面,旧版本目前胜出。
“Wan 3.0 权重已开源。” 并非如此。浏览 Hugging Face,Wan-AI 组织最新发布的产品系列是 Wan 2.2,包括 Animate 和 S2V 变体。核心视频线自 2.2 以来一直没有发布过权重。如果你想要本地 ComfyUI 流程图用的东西,2.1 和 2.2 是你的选择,这一点没有改变。
“提示词语法完全通用。” 这句话半真半假,而且会坑你。单词可以通用,但结构不行。Wan 3.0 的官方提示词是带时间戳的多镜头脚本:怪兽提示词是十个编号镜头,广告牌提示词是四个带明确秒数范围的标注节拍。如果把一个十镜头脚本粘贴到 15 秒模型里,它不会优雅地只选六个镜头,而是会压缩。
为什么你不能在 Wan 3.0 和 Wan 2.7 之间直接互换提示词
这下面还有第二个陷阱,也是“拼接两个片段就能解决”行不通的原因。
Wan 2.7 有一个视频续写模式。它看起来像是通往 30 秒的途径,但实际并非如此。你输入的源片段必须是 2 到 10 秒,因此一个 15 秒的生成结果无法作为种子。输出会重新编码源片段,从而吃掉你输入片段的尾部。而且连续续写倾向于回到开头节拍,而不是推动故事向前。15 秒是单个连续 Wan 2.7 文件的硬上限。更长的时间是编辑,而不是生成。
这就是这两代模型之间真正的迁移成本,没有哪个对比表格会告诉你这一点。
Wan 3.0 vs Wan 2.7 规格表,以及实际运行位置
要测试这一切,你需要一个能在同一账户上运行文生视频、参考生视频和视频编辑的平台,并按秒计费,这样失败的拍摄只消耗几秒钟,而不是一个订阅。本文中所有 Wan 2.7 方面的内容都在 Atlas Cloud 上运行,该平台托管了四个 Wan 2.7 端点以及用于参考测试的图像模型。Wan 3.0 尚未出现在 Atlas Cloud 或任何其他第三方平台上,这正是本文中 Wan 3.0 材料来自阿里巴巴自身测试版发布的原因。
表 1:Wan 3.0 vs Wan 2.7,代际对比
| Wan 3.0 (公开测试版) | Wan 2.7 (生产环境) | |
|---|---|---|
| 单次最大时长 | 30s,带智能时长 | 15s(t2v, i2v),10s(r2v, 视频编辑) |
| 参考项 | 最多 20 个 | 最多 5 个(每个主题 1 张图片,最多 3 个视频) |
| 输入模态 | 文本、图像、视频、音频、doc/xls/ppt/pdf/md、网页 | 文本、图像、视频、音频 |
| 文档输入 | 单文件或链接,最多 100MB 和 50 页 | 不支持 |
| 分辨率档位 | 480P / 720P / 1080P | 720P / 1080P / 1080P-SR / 1440P-SR |
| 原生音频 | 是 | 是 |
| 视频编辑 | 指令编辑和参考编辑 | 专用视频编辑端点 |
| 开源权重 | 否 | 否 |
| 可运行位置 | 阿里巴巴第一方平台仅限 | 第三方 API,包括 Atlas Cloud |
| 标价 | ¥0.3 / ¥0.6 / ¥1.2 每秒,按档位计费 | $0.1 每秒,720P 基准 |
表 2:本文中使用的 Wan 2.7 端点
| 端点 | 最长时长 | 分辨率 | 参考限制 | 标价 |
|---|---|---|---|---|
| 文生视频 | 2-15s | 720P, 1080P, 1080P-SR, 1440P-SR | 无 | $0.1 / 秒 |
| 参考生视频 | 2-10s | 720P, 1080P, 1080P-SR, 1440P-SR | 5 项 | $0.1 / 秒 |
| 图生视频 | 2-15s | 720P, 1080P, 1080P-SR, 1440P-SR | 源片段 2-10s | $0.1 / 秒 |
| 视频编辑 | 输出 2-10s,输入 2-10s | 720P (1.0x), 1080P (1.5x) | 3 张图片 | $0.1 / 秒 |
在运行任何操作之前,有一个定价细节值得内化:“$0.1 每秒”这个标题是 720P 基准价。视频编辑页面明确记录了 1080P 的 1.5 倍乘数,而“运行”按钮会显示你所选档位的实际价格。看按钮,别只看标题。
自己动手测试 Wan 3.0 vs Wan 2.7
四个步骤。其中两个使用阿里巴巴已发布的材料作为固定参考点,另外两个是你自己运行的操作。这里不需要访问 Wan 3.0 测试版。
步骤 1:获取 Wan 3.0 片段及其原始提示词
Wan 3.0 方面的测试不是由你生成,而是由你阅读。完整的怪兽提示词发布在官方 Wan 3.0 创作者手册中,以及完成的片段,位于“灾难电影”示例下。这是一个中文脚本,包含十个编号镜头和一个描述配乐的独立段落。
在做任何其他事情之前,先读一遍。结构就是重点:十个镜头,每个镜头都有自己的镜头、主体和灯光说明,最后以配乐简报结束。这就是一个 30 秒单次生成提示词的样子。
步骤 2:用 Wan 2.7 文生视频运行相同的提示词
打开 Wan 2.7 文生视频操作台,粘贴同一脚本的英文翻译。先不要缩短它。你想看看当意图超出上限时模型会怎么处理。
Plain1一段 30 秒、逼真的电影级序列:一只深海巨兽在暴风雨的夜晚出现。开场是一艘破旧的小型拖网渔船,船体上有白色字母"WAN",在倾盆大雨中与巨浪搏斗;闪电短暂照亮了整个海洋。推进到甲板的中近景:海浪拍打船头,绳索、渔网和金属栏杆在风中狂舞,雨滴划过镜头。然后前方的海面异常隆起,形成一个巨大的漩涡,一个巨大的暗影从船底穿过,将船抬起。一名穿着湿透雨衣的船员紧紧抓住栏杆,惊恐万分,转向水面。最后海面猛然向上炸开,一只巨大的、环太平洋风格的怪兽破水而出:湿漉漉的、布满伤疤的、有脊状的皮肤,巨大的下颚,数十米高的水花。特写它的头部在闪电中咆哮。拖网渔船几乎被吞没。以广角镜头结束:怪兽高耸于翻滚的海面之上,船只在前景中显得渺小,最后一道闪电。好莱坞灾难片配乐:低沉的次低音隆隆声和稀疏的弦乐,在破水时加入铜管和重打击乐,以压抑的持续低音和弦结束。逼真的尺度,体积感的水体,高对比度的风暴光照。
设置:分辨率 1080P,时长 15s(最大值),宽高比 16:9,音频保持开启,以便模型自行配乐。参考音频槽留空。

Atlas Cloud 上的 Wan 2.7 文生视频操作台,已加载怪兽提示词,OUTPUT 面板中显示完成的 15 秒片段
Atlas Cloud 上的 Wan 2.7 文生视频,提示词已粘贴,选择了 1080P 和 16:9。运行按钮显示此次短测试拍摄需 $0.75,相当于每秒 $0.15:这是显而易见的 1.5x 1080P 乘数,出现在标题数字为 $0.1 的模型页面上。
然后用提示词追加一行,再运行一次:
Plain1单次连续拍摄,无剪辑。优先考虑破水时刻;压缩开场铺垫。
这一行就是迁移工作的缩影。一个 30 秒的脚本必须被重新编写为 15 秒的意图,而由你决定哪七个镜头被舍弃。
左:官方 Wan 3.0 输出,30 秒。右:Atlas Cloud 上的 Wan 2.7 运行相同提示词,在其 15 秒上限处停止。
步骤 3:为 Wan 3.0 vs Wan 2.7 身份测试构建参考图像
时长是最大的升级。像素级一致性才是真正改变生产工作的升级,你可以用两只猫来测试。
阿里巴巴的手册包括一个韦斯·安德森风格的混搭,其中同一只布偶猫和同一只黑猫必须在五个截然不同的环境中存活:对称的酒店走廊、剖面侧视图、洗衣机滚筒、机场行李传送带和红色电话亭。两只猫都通过 @Image1 和 @Image2 参考标签固定。
首先自己生成两个参考图像。使用 GPT Image 2,质量设为高,16:9 画幅,运行两次。
Plain1一只蓬松的布偶猫的影棚肖像,蓝眼睛,深色面具,正面直立面向镜头,均匀照明,纯淡粉色背景,毛发细节清晰,全身可见,干净的参考图构图。
Plain1一只小巧光滑的黑猫的影棚肖像,明亮的琥珀色眼睛,侧身向右站立,均匀照明,纯淡粉色背景,毛发细节清晰,全身可见,干净的参考图构图。

Atlas Cloud 上的 GPT Image 2 操作台,质量设为高,OUTPUT 面板中渲染了布偶猫参考图
GPT Image 2 质量设为高,16:9。以同样方式运行第二个提示词以获取黑猫。
步骤 4:在 Wan 2.7 参考生视频上运行身份测试
将两只猫上传到 Wan 2.7 参考生视频端点。分辨率 1080P,宽高比 16:9,时长 10 秒,这是此端点的最大值。下面的提示词将手册的镜头列表从五个节拍压缩到三个,因为十秒装不下五个。
Plain1韦斯·安德森风格,完美对称,扁平正面构图,柔和色调。参考图像 1 是布偶猫,参考图像 2 是黑猫;保持两只猫在每个镜头中完全相同。镜头 1:一条无尽的对称酒店走廊,布偶猫带着严肃的表情径直向镜头跑来,黑猫在背景中头向后扭转 180 度飞奔而去。镜头 2:走廊的剖面侧视图,粉色图案墙纸和金色画框,布偶猫从左向右走,黑猫从右向左穿过。镜头 3:正面微距对准薄荷绿复古洗衣机门,两只猫僵硬地漂浮在滚筒内的泡沫中,眼神空洞,后面排列着彩虹色洗涤剂瓶。严格的水平和垂直线条,无镜头倾斜,冷面荒诞幽默。

Atlas Cloud 上的 Wan 2.7 参考生视频操作台,已加载两只猫的参考图像,OUTPUT 面板中显示完成的片段
Wan 2.7 参考生视频:两只猫都已加载到图像参考槽中,分辨率设为 1080P,运行按钮在开始前显示拍摄费用。两个参考图像已经占用了此端点可接受数量的一大部分。Wan 3.0 接受 20 个参考项。
现在将两者并排放置。

官方 Wan 3.0 身份锁定片段:同一只布偶猫和黑猫在酒店走廊、剖面的墙壁、洗衣机滚筒、行李传送带和红色电话亭中保持一致
由阿里巴巴在 Wan 3.0 公开测试期间生成,并发布在官方创作者手册中。五个环境,19.9 秒,两只猫通过参考标签固定。此处显示为静音 GIF;交付文件包含 44.1kHz 立体声音频。

Wan 2.7 参考生视频在相同简报上的结果,三个镜头在 10 秒上限内
Atlas Cloud 上的 Wan 2.7 参考生视频,相同的两个参考图像,此处显示为静音 GIF。这是端点的默认 5 秒拍摄,而非完整的 10 秒:值得注意,时长控制并不总是完全按你设定的执行,因此在按下按钮前先阅读运行按钮的报价。观察猫的斑纹和布偶猫的面具;这就是“像素级一致性”说法所涉及的维度。
另外四个值得重新运行的 Wan 3.0 vs Wan 2.7 提示词
怪兽片段强调时长和物理效果。下面这三个强调不同的东西,每个都会与 Wan 2.7 的不同限制发生冲突。这三个都是阿里巴巴官方手册中的测试版输出。
Wan 3.0,官方测试版输出:一次 30 秒的连续长镜头,沿着一条荧光灯照明的医院走廊向后推,淡绿色单色调色,女演员在呼救。打开声音。表演、脚步声和设备嗡鸣声均由模型生成。
表 3:每个提示词的要求,以及 Wan 2.7 的限制
| 提示词 | 脚本要求什么 | Wan 2.7 的已发布限制 | 正在测试的维度 |
|---|---|---|---|
| 怪兽破水 | 10 个编号镜头,跨越 30 秒,外加配乐简报 | 文生视频最长 15s | 时长和多镜头叙事 |
| 医院走廊 | 一次 30 秒连续拍摄,带对话 | 最长 15s,原生音频可用 | 长镜头中的表演和对话 |
| 加油站女牛仔 | 30 秒喜剧弧线,分四个计时幕 | 最长 15s,因此必须去掉两幕 | 需要运行时长的喜剧节奏 |
| 广告牌一镜到底 | 四个节拍,带明确秒数范围,无剪辑 | 最长 15s,因此需要重写范围 | 长镜头移动中的镜头物理 |
| 两只猫,五个房间 | 2 个标记主体,在 5 个环境中保持一致 | 最长 10s,5 个参考槽 | 身份一致性 |
同一想法的免费 15 秒版本
再看看那个加油站片段。那种格式,一个带有反转和笑点的短喜剧短剧,正是 Wan 3.0 额外运行时最有效的地方。它也是最有可能卖东西的格式。
问题在于提示词。手册中的喜剧示例有 800 字,带有明确的时间戳和舞台调度。这是一项真正的技能,需要花一个周末来学习。
如果你只是想先看看这个格式对你的产品是否有效,然后再投入那个周末,Atlas Cloud 有一个免费工具,完全跳过了提示词工程。你描述产品,可选上传最多四张产品照片(每张 8MB),选择六种风格之一(搞笑梗、剧情反转、情景喜剧、暖心、奢华或硬推销),它会编写双角色脚本、分配声音、生成对话和音效,并返回一个 15 秒的成品广告,作为连续场景。下载内容干净,无水印。你需要登录,在充值积分之前有一次免费生成机会。

一行产品文案输入,一个 15 秒的成品喜剧广告输出:Atlas Cloud 的免费 AI 广告短剧生成器
免费 AI 广告短剧生成器:一个产品描述输入,一个 15 秒的双角色广告输出。

免费生成器的真实输出。打开声音:脚本、两个声音和音效均来自一次运行。
运行 Wan 3.0 vs Wan 2.7 对比需要多少成本
按秒计算,在 720P 档位上,两代模型的价格相近。成本差异在于结构:原本 15 秒的片段现在变成了 30 秒,因此成品费用大约翻倍。
表 4:同一怪兽序列,四种方式
| 运行 | 费率 | 总计 |
|---|---|---|
| Wan 3.0, 30s 在 720P | ¥0.6 / 秒 | ¥18,约 $2.50 |
| Wan 3.0, 30s 在 1080P | ¥1.2 / 秒 | ¥36,约 $5.00 |
| Wan 2.7, 15s 在 720P | $0.10 / 秒 | $1.50 |
| Wan 2.7, 15s 在 1080P | $0.10 / 秒,带 1.5x 档位乘数 | $2.25 |
| Wan 2.7, 15s 在 1440P-SR | 实时在运行按钮上显示 | 实时显示 |
| 免费 AI 广告短剧, 15s | 免费,每个账户一次生成 | $0.00 |
两个注意事项。测试版定价并非正式上市定价,阿里巴巴已表示 API 将很快更广泛地开放,因此请将 ¥ 数字视为公开测试版的快照,而非承诺的费率。而在 Atlas Cloud 方面,在提交之前始终查看运行按钮上的实时报价,因为分辨率乘数是在那里应用的,而不是在标题价格中。
阿里巴巴还异常直接地指出了 Wan 3.0 仍然薄弱的地方,称该模型“在音质和文本准确性方面仍有改进空间”。这与文件显示的情况一致:官方演示的音频是 44.1kHz 立体声,但编码为适中的 32 kb/s,这对于预览来说不错,但对于交付母带来说则显得单薄。
Wan 3.0 vs Wan 2.7 许可:你实际可以发布什么
简而言之,在将任何内容交给客户之前,请自行核对当前条款。
Wan 3.0 处于公开测试阶段,其商业条款尚未确定。由于权重未发布,完全没有自托管途径;你制作的任何内容都通过阿里巴巴的 API 或其消费平台,并且受你生成当天这些条款的约束。Wan 2.7 在权重方面情况相同,但它已在生产环境中运行足够长时间,平台 API 条款已稳定。如果你通过第三方平台运行它,你的商业权利来自该平台的服务条款,因此请阅读实际适用于你账户的条款。以上两段均非法律建议。
Wan 3.0 vs Wan 2.7 常见问题
Wan 3.0 是开源的吗?我能在 ComfyUI 中运行吗?
不能。截至 2026 年 8 月,Hugging Face 上 Wan-AI 组织下没有 Wan 3.0 仓库,Wan-Video GitHub 上也没有。最新发布权重的 Wan 系列是 Wan 2.2,包括 Animate 和 S2V 变体。对于本地 ComfyUI 流程图,你仍然在使用 2.1 或 2.2。Wan 3.0 仅限 API 和网页端。
Wan 3.0 vs Wan 2.7 分辨率:Wan 3.0 真的能生成 4K 吗?
不能。已发布的 API 价格表有三个分辨率档位:480P、720P 和 1080P。几个广泛传播的对比帖子声称原生 4K,它们是错误的。在原始输出上限方面,Atlas Cloud 上的 Wan 2.7 实际上通过其 1080P-SR 和 1440P-SR 超分辨率选项提供了更高的效果。
我可以通过延伸片段让 Wan 2.7 输出 30 秒吗?
不能作为单个连续文件。续写模式需要一个 2 到 10 秒的源片段,因此完整的 15 秒生成结果不能作为种子。输出会重新编码并截断你输入的任何内容的尾部,并且连续续写倾向于循环回到开头节拍。超过 15 秒,你是在编辑,而不是生成。
Wan 3.0 vs Wan 2.7:我目前在哪里可以实际运行每个版本?
Wan 3.0 在阿里巴巴自己的平台上处于公开测试阶段:阿里云百炼、万镜亿刻、万相网站、通义千问创作桌面客户端、IF STUDIO 和堆友,通义千问 App 中有灰度访问。尚无第三方推理平台托管它。Wan 2.7 是仍然可以直接调用的版本,涵盖文生视频、图生视频、参考生视频和视频编辑端点。
Wan 3.0 vs Wan 2.7 定价:每个成品片段哪个更贵?
按秒计算,在 720P 档位上两者相近。按每个成品片段计算,预计大约翻倍,因为自然输出长度从 15 秒变成了 30 秒。预算应关注运行时变化而非费率变化,并记住测试版定价可能在正式发布后发生变化。
我是否需要为 Wan 3.0 重写我的 Wan 2.7 提示词?
是的,重写是结构性的,而非词汇性的。Wan 2.7 提示词详细描述一个连续镜头。Wan 3.0 提示词是带时间戳的镜头列表,有时带有独立的配乐段落,模型也可以读取 pdf 或演示文稿作为输入。经验法则:对于 Wan 2.7,写一段关于一个镜头的段落;对于 Wan 3.0,写一个带秒数范围的编号场景分解。






