
最新更新:Wan 3.0 已于 2026 年 8 月 24 日上线。
一个调色棚墙面上显示同一雨夜屋顶镜头,时间码从 00:00 到 00:30
三十秒的一个连续镜头,铺展在时间线上。到达那里,就是全部的故事。
当 Wan 3.0 Preview 进入公测那天,我去找它的规格说明。搜索结果第一页告诉我它支持原生 4K、采用 Apache 2.0 许可证发布,并且拥有“六摄像头 AI 导演模式”。六个不同的网站,相同的说法,没有一个链接到原始来源。
于是我直接打开了阿里巴巴自己的模型页面。480P、720P、1080P。没有 4K。然后我直接调用 Hugging Face API,拉取了 Wan-AI 组织下的所有仓库。最新的是 Wan2.2-Animate-2,推送时间与 Wan 3.0 上线同一天。根本没有 3.0 的任何东西。
然后我做了别人没做的事:Wan 3.0 的卖点是单次生成 30 秒连续视频,而我并没有访问权限,所以我尝试用今天能实际调用的模型来复现这一结果。我失败了。失败的方式反而成了本文最有价值的部分。
关键要点
- Wan 3.0 Preview 于 2026 年 8 月 6 日进入公测。 模型 ID 为
wan3.0-video,需通过阿里巴巴云模型工作室和通义千问云提交申请才能使用。并非开放注册。 - 真实规格: 单次生成最长 30 秒,支持 480P/720P/1080P,价格分别为每输出秒 $0.05/$0.10/$0.20。
- 没有 4K,也没有开放权重。 我查询了 Hugging Face API 下
Wan-AI的所有仓库。没有任何高于 Wan 2.2 的下载版本。 - 真正的瓶颈是速率限制: 2 个并发请求,30 RPM,50 个异步排队任务。
- 无法用 Wan 2.7 伪造 30 秒单次拍摄。 三个未公开的限制将真正连续片段的最长长度限制在 15 秒,而尝试第二次接续时,模型会反向循环而非向前推进。
15 秒壁垒:Wan 3.0 Preview 真正在卖什么
这是我得到的最佳结果。15 秒不间断的 1080P 视频:推进到霓虹灯招牌,一个摊贩在雨中关闭屋顶咖啡摊,然后镜头向下摇至湿漉漉的街道和一辆出租车。一个连续生成的视频文件,无需剪辑,自带生成音频。

Wan 2.7 连续 15 秒视频:霓虹灯招牌、屋顶摊贩、向下摇至湿漉漉的街道和一辆出租车
Wan 2.7 系列为我生成的最长真正连续片段:15 秒,1080P,单个文件。此处显示为静音 GIF;交付文件包含 44.1kHz 立体声音频。
这已经很不错了。但它恰好是 Wan 3.0 声称一次调用就能做到的时长的一半,而 15 秒就是那道焊死的天花板。以下内容讲述了我如何找到那道焊缝。
为什么你读到的每份 Wan 3.0 Preview 规格说明很可能都是错的
有两个原因让这次发布异常嘈杂。首先,单次生成 30 秒对于该系列来说是真正的第一次。Wan2.7-Video 最长 15 秒,而大多数主流视频模型介于 5 到 15 秒之间(TNGlobal,2026 年 8 月)。其次,Wan 3.0 接受其他模型不接受的参考输入:除了文本、图像、音频和视频,它还接受 doc、xls、ppt、pdf 和 md 文件以及网页,因此幻灯片可以变成视频(AlphaSignal,2026 年 8 月)。
这种组合带来了大量来自从未打开过文档的网站的报道。以下是我根据主要来源核实的所有广泛流传的说法。
表 A:Wan 3.0 Preview 规格核对
| 流传的说法 | 主要来源的说法 | 判断 |
|---|---|---|
| 单次生成 30 秒 | 已确认,对比 Wan 2.7 的 2 至 15 秒 | ✅ 真实 |
| 原生 4K 输出 | 官方分辨率仅为 480P、720P 和 1080P | ❌ 错误 |
| Apache 2.0 开放权重 | Hugging Face 上 Wan-AI 下无 Wan 3.0 仓库 | ❌ 错误 |
| 文档转视频(PDF、PPT、XLS) | 已确认为一种参考输入类型 | ✅ 真实 |
| “六摄像头 AI 导演模式” | 阿里巴巴文档中未出现 | ❌ 不支持 |
| “12 种语言唇形同步与身份锁定” | 阿里巴巴文档中未出现 | ❌ 不支持 |
| 每秒 $0.05 / $0.10 / $0.20 | 已确认适用于 480P / 720P / 1080P | ✅ 真实 |
| 面向所有人开放 | 需在模型工作室和通义千问云提交申请 | ⚠️ 测试版,需邀请 |
定价和速率限制直接来自模型页面:2 个并发请求,每分钟 30 个请求,50 个异步排队任务(QwenCloud,2026 年 8 月)。这个并发数几乎没有任何报道,但它是页面上最重要的一行。两个并行任务,每个耗时几分钟,对于发布演示来说没问题,但无法构成管线。
现在来看开源社区真正关心的问题。Wan 2.1 和 Wan 2.2 发布了可下载的检查点。Wan 2.5 承诺了从未兑现的权重,Wan 2.6 完全封闭,Wan 2.7 仍仅限 API。我通过查询 Hugging Face API 下 Wan-AI 组织的所有模型(按创建日期排序)来检查 3.0 是否打破了这一惯例。最新的三个仓库都是 Wan2.2-Animate-2 变体,创建于 2026 年 8 月 6 日,即 Wan 3.0 上线当天。下载量最高的仓库仍然是 Wan2.2-TI2V-5B-Diffusers,过去 30 天约有 179,000 次下载(Hugging Face,2026 年 8 月)。
所以答案是否定的,Wan 2.2 仍然是开放权重上限。如果你的计划涉及本地运行或微调,那目前无模型可用。
在 Atlas Cloud 上体验实时模型:在 Atlas Cloud 上打开 Wan 3.0 文生视频。
一个真实的 Atlas Cloud Wan 3.0 文生视频体验运行:提示词显示在左侧,完成的生成片段出现在右侧。
Wan 3.0 Preview 技术栈:你今天实际能运行什么
情况泾渭分明。Wan 3.0 位于申请表后面,并发限制为两个任务。在此之前的所有版本,从 Wan 2.7 回到 2.2,都可以用一个 API 密钥立即调用,同时还可以调用 Seedance 和 Kling 进行跨模型对比。本文中的所有内容都是这样在一个浏览器标签页中运行的。
以下价格来自 2026 年 8 月 10 日的 Atlas Cloud 模型目录,而非任何博客文章。
表 B:Wan 3.0 Preview 与现有模型的对比
| 模型 | 最长单次生成 | 分辨率 | 访问方式 | 并发数 | 每秒钟标价 |
|---|---|---|---|---|---|
| Wan 3.0 Preview | 30秒 | 480P / 720P / 1080P | 需要申请 | 2 | $0.05 / $0.10 / $0.20 |
| Wan 2.7 文生视频 | 15秒 | 720P / 1080P / 1080P-SR / 1440P-SR | 开放 | 标准 | 从 $0.10 起 |
| Wan 2.7 图生视频 | 15秒 | 720P / 1080P | 开放 | 标准 | 从 $0.10 起 |
| Wan 2.6 文生视频 | 15秒 | 720p / 1080p | 开放 | 标准 | $0.07($0.10 的 7 折) |
| Wan 2.5 文生视频 | 10秒 | 720p / 1080p | 开放 | 标准 | $0.035($0.05 的 7 折) |
| Wan 2.2 图生视频 | 10秒 | 480p / 720p | 开放,权重可下载 | 标准 | $0.03 |
| Seedance 2.5 文生视频 | 30秒 | 480p / 720p | 开放 | 标准 | 从 $0.134 起 |
| Kling v3.0 Pro 文生视频 | 15秒 | 模型默认 | 开放 | 标准 | $0.095($0.112 的 85 折) |
折扣截至 2026 年 8 月,且有时限,因此在预算前请查看模型页面。
从这张表中可以得出两点。Wan 3.0 的 30 秒单次生成已不再是唯一:Seedance 2.5 已经接受单次调用 4 到 30 秒的时长,只是上限为 720p。而 Wan 2.7 是唯一提供 1440P-SR 超分辨率级别的行,其计费为原生 1080P 的 80%,Wan 3.0 没有这个级别。
Wan 3.0 独有的优势是在 1080P 下单次生成 30 秒,以及文档参考输入。Wan 3.0 在 Atlas Cloud 上有一个占位页面,标记为“即将推出”,因此正式上线时将使用同一个密钥。在此之前,以下是旧版模型能带你走多远的确切答案。
Wan 3.0 Preview 教程第 1 步:编写单次拍摄脚本
脚本在不同生成之间可以复用,所以一次写就。Wan 3.0 偏爱长而带时间码的镜头描述,Wan 2.7 在 5000 字符提示词限制内也接受相同结构。
适用的模板:镜头 [时间码] + 主体动作 + 相机运动 + 光线 + 环境音效。在第一行声明拍摄是连续的,并明确描述声音基底,因为 Wan 2.7 原生生成音频,如果留空,它会自行编造出一些无用的内容。
我特意选择了一个雨夜屋顶咖啡摊。这能对通常同时出问题的四个方面进行压力测试:持续相机运动、面部一致性随时间保持、湿霓虹灯反射以及连续的环境音基底。
textCopy
text11BEAT 1 (0-10s): 从闪烁的粉蓝霓虹灯招牌缓慢推近,朝向一位年轻女性摊贩在屋顶咖啡摊擦拭不锈钢台面。 22BEAT 2 (10-15s): 相机向下摇过屋顶边缘,来到下方湿漉漉的街道,滑向一辆停在路边的出租车。 33恒定:大雨、霓虹色调、35mm 变形镜头、胶片颗粒、无剪辑。 44
这是计划,而不是提示词。下面粘贴的才是提示词。
第 2 步:以 1080P 生成开场镜头
打开 Wan 2.7 文生视频页面,粘贴完整写出的 Beat 1。
textCopy
text11连续单次拍摄,无剪辑。深圳雨夜屋顶咖啡摊。 22镜头 [0-4s]:从闪烁的粉蓝霓虹灯招牌缓慢推近,朝向一位年轻女性摊贩擦拭不锈钢台面,雨水在霓虹光芒中划过,水壶蒸汽升腾。 33镜头 [4-10s]:相机定位在胸部高度,她抬起头并半微笑,浅景深,台面上湿漉漉的反光,身后黑暗天空中可见雨滴。 44音频:持续雨声、远处车流声、陶瓷杯碰撞声。 55电影感、变形镜头、35mm、高动态范围、精细胶片颗粒。 66
设置: 分辨率 1080P,画面比例 16:9,时长 10,提示词扩展 关闭。
提示词扩展默认开启,它会重写你的提示词后再生成,这悄无声息地破坏了带时间码的镜头控制。当镜头分解是关键时,请关闭它。
将时长设为 10 而不是 15 秒最大值。这不是成本决策,原因在第 3 步中才会显现。

Atlas Cloud 上的 Wan 2.7 文生视频,运行完成,在 OUTPUT 面板中可见 1080P 输出
第 2 步在体验环境中:粘贴提示词,1080P,16:9,运行完成,结果在右侧。注意运行按钮显示 $0.75 用于五秒 1080P 任务,这相当于每秒 $0.15,而非目录中的“从 $0.10 起”。
第 3 步:继续生成,并观察它在哪里失败
Wan 2.7 的图生视频端点有一个视频续接模式,可以接受现有片段并继续拍摄。将第 2 步的输出 URL 放入 video 字段,将时长设为 15,然后粘贴 Beat 2:
textCopy
text11继续同一个不间断拍摄,保持相同的镜头语言和光线。 22向下摇摄继续越过屋顶边缘到街道水平,相机向前滑过雨幕,朝向一辆停在路边的出租车,雨刷在摆动。 33保持与源片段相同的雨势强度、霓虹色调、胶片颗粒和环境音效。无剪辑、无淡入淡出、无场景切换。 44
这样就生成了本文顶部的 15 秒片段。现在是我遇到的三个限制,文档中均未提及。
一:源片段必须为 2 到 10 秒。 这就是为什么第 2 步上限为 10 秒。生成 15 秒的开场片段,你就根本无法扩展它,因为 15 秒的文件不是合法输入。
二:请求时长必须大于源片段时长。 提供 10 秒片段并要求 10 秒,API 会直接拒绝:first_clip duration (10s after trim) must be less than the requested duration (10s)。因此输出包含源片段,一次最多只能获得 5 秒的新内容。
三:它不会保留你的源片段。 这是最关键的。下面,上一行是原始 10 秒片段在 5 秒和 9.9 秒时的画面。下一行是续接输出在相同两个时间码时的画面。

四个帧,对比源片段和续接输出在 5 秒和 9.9 秒时的画面
上一行:源片段在 5 秒和 9.9 秒时。下一行:续接输出在相同时间码时。在 5 秒时它们匹配。到 9.9 秒时,源片段仍然在摊贩上,而续接已经切到了街道,因为续接将源片段重新压缩到大约前六秒,并将剩余时间用于新内容。
所以续接不是拼接。它会以更快的速度重新渲染你的片段以腾出空间,而你原始表演的最后几秒就这么消失了。
这就引出了一个明显的想法:链式续接。将 15 秒的结果再次输入,再请求 15 秒。我试了。结果如下。

第二次链式续接,结果漂回屋顶摊贩,而不是推进场景
第二次续接。它重放了街道和出租车,然后循环回到序列最开始的屋顶摊贩,而不是向前推进。链式续接不会累积。
这就是那道墙。输出上限是 15 秒,输入上限是 10 秒,而链中的第二个环节会反向运行。真正连续 15 秒的素材是该模型系列的天花板。任何更长的都是剪辑,而不是拍摄,而剪辑正是 30 秒单次拍摄所要消除的。
有一点需要说明:这个续接步骤的体验环境捕获失败了三次,因为页面的预设参考图像不断劫持运行,因此第 3 步是通过 API 而非体验 UI 执行的。上面的提示词、设置和输出均来自那次真实运行。
Wan 3.0 Preview 的 30 秒实际成本是多少
第 2 步中的运行按钮显示 $0.75 用于五秒 1080P 任务。这相当于每秒 $0.15,而不是目录列出的 $0.10,因为列出的数字是下限,计费随分辨率变化。始终相信报价而非卡片。
以那个实际费率计算,我的 15 秒连续素材成本为:10 秒开场 $1.50,加上续接 $2.25,因此 15 秒交付片段总共 $3.75。
表 C:30 秒的五种价格方案
| 路径 | 计算 | 总计 | 实际获得的内容 |
|---|---|---|---|
| Wan 3.0 Preview, 1080P | $0.20 × 30 | $6.00 | 30 秒连续,单次生成,无接缝 |
| Wan 3.0 Preview, 720P | $0.10 × 30 | $3.00 | 30 秒连续,720P |
| Wan 3.0 Preview, 480P | $0.05 × 30 | $1.50 | 30 秒连续,480P |
| Wan 2.7, 开场加续接 | $0.15 × 25 计费 | $3.75 | 仅 15 秒。 无法达到 30 秒。 |
| Seedance 2.5, 480p | 从 $0.134 × 30 | ~$4.05 | 30 秒连续,上限 720p |
再读一遍第四行。在 Wan 2.7 上生成 15 秒连续素材的成本,高于 Wan 3.0 在 720P 下生成 30 秒连续素材的收费。变通方法不是省钱方案,而是更贵且同样行不通的方案。
关于 Seedance 行的注意事项:其标价是 480p 下限,模型按像素面积计费,因此 720p 实际运行价格约为该数字的 2.25 倍。
关于许可,请谨慎。Wan 3.0 处于测试版,因此商业条款来自申请时接受的阿里巴巴云服务协议,而非任何模型许可证,且可能在正式版发布前更改。由于没有公开发布的权重,本地部署和微调均不可行。在交付客户作品前,请根据你自己的账户条款确认署名和水印要求。
常见问题解答
Wan 3.0 Preview 是否已向所有人开放?
尚未开放。它于 2026 年 8 月 6 日进入公测,但访问需要通过阿里巴巴云模型工作室和通义千问云提交申请。获批账户可获得 2 个并发请求、30 RPM 和 50 个异步排队任务,这更适合评估而非生产环境。
Wan 3.0 Preview 是开源的吗?权重在哪里?
没有权重。查询 Hugging Face API 下 Wan-AI 组织的所有仓库,未返回任何高于 Wan 2.2 的内容。最新的三个仓库均为 Wan2.2-Animate-2 变体,创建于 Wan 3.0 上线当天。Wan 2.2 仍然是开放权重上限。
Wan 3.0 Preview 真的支持原生 4K 吗?
不支持。官方文档仅列出 480P、720P 和 1080P。4K 的说法来自聚合网站互相引用而非原始来源,且与阿里巴巴自己的定价表相矛盾,后者只有三个分辨率层级。
一个 30 秒的 Wan 3.0 Preview 视频需要多少钱?
1080P 下,每输出秒 $0.20,30 秒为 $6.00。720P 下为 $3.00,480P 下为 $1.50。作为对比,在 Wan 2.7 上以 1080P 生成 15 秒连续素材,实际计费费率为 $3.75。
没有 Wan 3.0 Preview 访问权限,今天能生成 30 秒单次拍摄吗?
不能使用 Wan 2.7。其续接模式输出上限为 15 秒,仅接受不超过 10 秒的源片段,且链式续接会反向循环。Seedance 2.5 可以单次生成 4 到 30 秒,但仅限 720p。
Wan 3.0 Preview 对比 Wan 2.7:值得等待吗?
如果你需要超过 15 秒的连续单次拍摄,或者需要文档和网页参考输入,值得等待,而且没有变通方法。对于 15 秒及以下的任何内容,Wan 2.7 目前更实用,因为 2 个请求的并发限制会使批量作业在 3.0 上比在其替代模型上更慢。







