
一面调色室显示墙,展示同一个雨夜屋顶镜头在 00:00 到 00:30 的各个时间码画面
一段 30 秒连续一镜到底,铺在时间线上。如何做到这一点,就是整篇文章的故事。
Wan 3.0 Preview 进入公开测试的那天,我去找它的规格表。搜索结果第一页告诉我:它支持原生 4K、按 Apache 2.0 发布,并且有一个“六机位 AI 导演模式”。六个不同网站,给出的说法都一样,却没有一个链接到一手来源。
于是我打开了 Alibaba 自己的模型页面。480P、720P、1080P。没有 4K。接着我直接调用 Hugging Face API,拉取 Wan-AI 组织下的所有仓库。最新的是 Wan2.2-Animate-2,发布时间正好是 Wan 3.0 发布当天。没有任何 3.0 相关仓库。
然后我做了别人都没做的那一步。Wan 3.0 的头号卖点,是一次生成 30 秒连续视频;而我没有它的访问权限,所以我尝试用今天实际能调用的模型复现这个结果。我失败了。而我失败的方式,最后成了本文最有价值的部分。
核心要点
- Wan 3.0 Preview 于 2026 年 8 月 6 日进入公开测试。 模型 ID 为
wan3.0-video,需要在 Alibaba Cloud Model Studio 和 Qwen Cloud 上申请访问权限。它不是开放注册。 - 真实规格: 单次生成最长 30 秒,480P/720P/1080P,按输出秒计费,分别为 $0.05/$0.10/$0.20。
- 没有 4K,也没有开放权重。 我查询了
Wan-AI下所有仓库的 Hugging Face API。没有任何可下载内容超过 Wan 2.2。 - 速率限制才是真正瓶颈: 2 个并发请求、30 RPM、50 个异步排队任务。
- 你无法用 Wan 2.7 伪造 30 秒一镜到底。 三个未写入文档的限制,把真正连续的最长片段封顶在 15 秒;而继续串接第二段时,模型会向后循环,而不是向前推进。
15 秒墙:Wan 3.0 Preview 真正卖的是什么
这是我能得到的最好结果。1080P 下 15 秒无中断:镜头推进到霓虹招牌,一个摊主在雨中收拾屋顶咖啡摊,然后镜头摇臂下落到湿漉漉的街面和一辆出租车。一个连续生成文件,无剪辑,带生成音频。

Wan 2.7 连续视频的 15 秒:霓虹招牌、屋顶摊主、镜头下降到雨中街道和出租车
Wan 2.7 系列为我生成的最长真正连续片段:15 秒、1080P、一个文件。这里展示为静音 GIF;交付文件包含 44.1kHz 立体声音频。
这已经很好。但它也正好只有 Wan 3.0 声称单次调用能力的一半,而 15 秒就是天花板被焊死的地方。下面就是我如何找到那道焊缝。
为什么你读到的每一份 Wan 3.0 Preview 规格表都可能是错的
这次发布异常嘈杂,有两个原因。第一,单次生成 30 秒确实是 Wan 系列的第一次。Wan2.7-Video 最高 15 秒,而大多数主流视频模型都在 5 到 15 秒之间(TNGlobal,2026 年 8 月)。第二,Wan 3.0 接受别人不接受的参考输入:除文本、图像、音频和视频外,它还接受 doc、xls、ppt、pdf 和 md 文件以及网页,因此一份幻灯片可以变成视频(AlphaSignal,2026 年 8 月)。
这种组合带来了大量报道,而许多网站根本没有打开文档。以下是流传最广的所有说法,并逐一对照一手来源核验。
表 A:Wan 3.0 Preview 规格核验
| 流传说法 | 一手来源的说法 | 结论 |
|---|---|---|
| 单次生成 30 秒 | 已确认,相比 Wan 2.7 的 2 到 15 秒 | ✅ 真实 |
| 原生 4K 输出 | 官方分辨率只有 480P、720P 和 1080P | ❌ 错误 |
| Apache 2.0 开放权重 | Hugging Face 的 Wan-AI 下不存在 Wan 3.0 仓库 | ❌ 错误 |
| 文档转视频(PDF、PPT、XLS) | 已确认为一种参考输入类型 | ✅ 真实 |
| “六机位 AI 导演模式” | 未出现在任何 Alibaba 文档中 | ❌ 无依据 |
| “12 语言口型同步并锁定身份” | 未出现在任何 Alibaba 文档中 | ❌ 无依据 |
| 每秒 $0.05 / $0.10 / $0.20 | 已确认为 480P / 720P / 1080P 对应价格 | ✅ 真实 |
| 向所有人开放 | 在 Model Studio 和 Qwen Cloud 上需申请 | ⚠️ 测试版,需邀请 |
价格和速率限制直接来自模型页面:2 个并发请求、每分钟 30 个请求,以及 50 个任务的异步队列(QwenCloud,2026 年 8 月)。这个并发数字几乎没有报道提到,但它是页面上最重要的一行。两个并行任务,每个都要跑几分钟,用来做发布演示还可以。它不是一条生产流水线。
接下来是开源社区真正关心的问题。Wan 2.1 和 Wan 2.2 发布了可下载检查点。Wan 2.5 承诺过权重但从未兑现,Wan 2.6 完全闭源,Wan 2.7 仍然仅 API 可用。我检查了 3.0 是否打破这一趋势:查询 Hugging Face API 中 Wan-AI 组织下的每个模型,并按创建日期排序。最新的三个仓库都是 Wan2.2-Animate-2 变体,创建于 2026 年 8 月 6 日,也就是 Wan 3.0 发布当天。下载量最高的仓库仍然是 Wan2.2-TI2V-5B-Diffusers,过去 30 天约 179,000 次下载(Hugging Face,2026 年 8 月)。
所以答案是否定的,Wan 2.2 仍然是开放权重的天花板。如果你的计划是本地运行或微调它,那么没有任何东西可运行。
Wan 3.0 Preview 技术栈:你今天真正能运行什么
现状划分得很清楚。Wan 3.0 位于申请表之后,并且有两个任务的并发上限。在它之前的所有模型,从 Wan 2.7 回溯到 2.2,都可以用一个 API key 立即调用,同时还能调用 Seedance 和 Kling 进行跨模型比较。本文中的所有内容都是这样跑出来的,只用了一个浏览器标签页。
下面的价格来自 2026 年 8 月 10 日的 Atlas Cloud 模型目录,不是来自任何博客文章。
表 B:Wan 3.0 Preview 与现有可用模型对比
| 模型 | 最长单次生成 | 分辨率 | 访问方式 | 并发 | 标价(每秒) |
|---|---|---|---|---|---|
| Wan 3.0 Preview | 30s | 480P / 720P / 1080P | 需要申请 | 2 | $0.05 / $0.10 / $0.20 |
| Wan 2.7 text-to-video | 15s | 720P / 1080P / 1080P-SR / 1440P-SR | 开放 | 标准 | from $0.10 |
| Wan 2.7 image-to-video | 15s | 720P / 1080P | 开放 | 标准 | from $0.10 |
| Wan 2.6 text-to-video | 15s | 720p / 1080p | 开放 | 标准 | $0.07($0.10 的 7 折) |
| Wan 2.5 text-to-video | 10s | 720p / 1080p | 开放 | 标准 | $0.035($0.05 的 7 折) |
| Wan 2.2 image-to-video | 10s | 480p / 720p | 开放,权重可下载 | 标准 | $0.03 |
| Seedance 2.5 text-to-video | 30s | 480p / 720p | 开放 | 标准 | from $0.134 |
| Kling v3.0 Pro text-to-video | 15s | 模型默认 | 开放 | 标准 | $0.095($0.112 的 85 折) |
以上折扣在 2026 年 8 月仍然有效,但有时间限制,所以在做预算前请查看模型页面。
这张表带出两点。Wan 3.0 的 30 秒单次生成已经不再独一无二:Seedance 2.5 已经能在一次调用中接受 4 到 30 秒的时长,只是封顶在 720p。并且 Wan 2.7 是唯一提供 1440P-SR 的一行,这是一个超分辨率档位,按其自身 schema 以原生 1080P 的 80% 计费,而 Wan 3.0 没有这个档位。
Wan 3.0 拥有而其他模型没有的,是一次生成 30 秒 1080P,再加上文档参考输入。Wan 3.0 在 Atlas Cloud 上有一个标记为 Coming Soon 的占位页面,因此上线后会落到同一个 key 上。在那之前,下面就是老模型究竟能把你带到多远。
Wan 3.0 Preview 教程第 1 步:写一镜到底简报
简报会在多次生成之间沿用,所以先一次写好。Wan 3.0 更吃长篇、带时间码的镜头描述,而 Wan 2.7 在 5,000 字符提示词限制内也接受同样结构。
有效模板是:镜头 [时间码] + 主体动作 + 摄影机运动 + 光线 + 环境音频。第一行就声明这是一个连续镜头,并明确描述声音底,因为 Wan 2.7 会原生生成音频;如果你留空,它会自行编出一些没用的东西。
我特意选择了雨夜屋顶咖啡摊。它会同时压力测试四件通常会一起崩掉的东西:持续摄影机运动、人物面部随时间的一致性、潮湿霓虹反射,以及连续环境音底。
text1BEAT 1(0-10s):镜头从闪烁的粉青色霓虹招牌缓慢推入,移向一位 2年轻女摊主;她正在雨夜屋顶咖啡摊擦拭钢制柜台。 3BEAT 2(10-15s):摄影机越过屋顶边缘向下摇臂移动到湿漉漉的街道, 4滑向路边一辆怠速等待的出租车。 5Constant:大雨、霓虹色调、35mm anamorphic、film grain、无剪切。 6
这是计划,不是提示词。你要粘贴的提示词如下。
第 2 步:以 1080P 生成开场
打开 Wan 2.7 text-to-video 页面,粘贴完整写出的 Beat 1。
text1连续单镜头,无剪切。深圳雨夜的屋顶咖啡摊。 2镜头 [0-4s]:从闪烁的粉青色霓虹招牌缓慢推入,移向一位年轻女摊主; 3她正在擦拭钢制柜台,雨丝穿过霓虹光晕,水壶中升起蒸汽。 4镜头 [4-10s]:摄影机停在胸口高度,她抬头露出半个微笑,浅景深, 5柜台上有潮湿反光,身后黑暗天空中可见雨滴。 6音频:持续雨声、远处车流低鸣、陶瓷杯轻碰声。 7电影感、anamorphic、35mm、高动态范围、细腻 film grain。 8
设置: Resolution 1080P,Aspect ratio 16:9,Duration 10,Prompt extend OFF。
Prompt extend 默认开启,它会在生成前重写你的提示词,从而悄悄破坏带时间码的镜头控制。只要镜头拆解是重点,就把它关掉。
把时长设为 10,而不是 15 秒上限。这不是出于成本考虑,原因要到第 3 步才会显现。

Atlas Cloud 上的 Wan 2.7 text-to-video,运行完成,OUTPUT 面板中可见 1080P 输出
Playground 中的第 2 步:已粘贴提示词,1080P,16:9,运行完成,结果显示在右侧。注意 Run 按钮报价:一个 5 秒 1080P 任务为 $0.75,折算下来是每秒 $0.15,而不是目录里的“from $0.10”。
第 3 步:继续生成,然后看它在哪里断掉
Wan 2.7 的 image-to-video 端点有一个视频续写模式,可以接收已有片段并继续拍摄。拿到第 2 步输出 URL,把它放入 video 字段,将 Duration 设为 15,然后粘贴 Beat 2:
text1延续同一个无中断镜头,保持完全相同的摄影机语言和光线。 2镜头继续越过屋顶边缘向下摇臂移动到街面高度,摄影机在雨中向前滑行, 3靠近路边一辆怠速等待的出租车,雨刷来回摆动。 4保持与源片段相同的雨势、霓虹色彩、film grain 和环境音。 5无剪切、无淡入淡出、无场景变化。 6
这会生成本文开头那段 15 秒片段。下面是我撞上的三个限制,文档里都没有写。
第一:源片段必须是 2 到 10 秒。 这就是为什么第 2 步被限制在 10 秒。生成一个 15 秒开场,你根本无法延续,因为 15 秒文件不是合法输入。
第二:请求时长必须超过源片段时长。 输入一个 10 秒片段并请求 10 秒,API 会直接拒绝:first_clip duration (10s after trim) must be less than the requested duration (10s)。所以输出包含源片段,而你单次最多只能多得到 5 秒。
第三:它不会保留你的源片段。 这一点最关键。下图中,第一行是原始 10 秒片段在 5s 和 9.9s 的画面。第二行是续写输出在相同两个时间码的画面。

四帧对比:源片段与续写输出在 5 秒和 9.9 秒的画面
第一行:源片段在 5s 和 9.9s。第二行:续写输出在相同时间码的画面。5s 时它们匹配。到 9.9s 时,源片段仍然停留在摊主身上,而续写已经切到街道,因为它把源片段重新压缩到了大约前六秒,并把剩余时间用于新内容。
因此,续写不是拼接。它会用更快的节奏重新渲染你的片段以腾出空间,而你原始表演的最后几秒会直接消失。
这自然引出一个想法:串起来。把 15 秒结果再喂回去,再请求 15 秒。我试了。返回结果如下。

第二次串接续写没有推进场景,而是漂回屋顶摊主
第二次续写。它重放街道和出租车,然后没有向前推进,而是循环回到整个序列最开头的屋顶摊主。串接不会累积。
这就是那堵墙。输出上限是 15 秒,输入上限是 10 秒,而链条的第二环会倒着跑。15 秒真正连续素材,就是这个模型系列的天花板。更长的东西都是剪切,不是一镜到底;而 30 秒单次生成存在的意义,正是消除这些剪切。
披露一点:这一步续写的 playground 录屏失败了三次,因为页面的预设参考图一直劫持运行,所以第 3 步是通过 API 执行的,而不是通过 playground UI。上面的提示词、设置和输出都来自那次真实运行。
Wan 3.0 Preview 的 30 秒到底要多少钱
第 2 步中,Run 按钮给一个 5 秒 1080P 任务报价 $0.75。也就是每秒 $0.15,而不是目录里列出的 $0.10,因为标价是底价,计费会随分辨率变化。永远相信报价,而不是卡片上的价格。
按这个真实费率,我的 15 秒连续素材花费为:10 秒开场 $1.50,加上续写 $2.25,所以 15 秒交付内容共 $3.75。
表 C:30 秒的五种成本
| 路径 | 计算方式 | 总计 | 你实际得到什么 |
|---|---|---|---|
| Wan 3.0 Preview,1080P | $0.20 × 30 | $6.00 | 30s 连续,一次生成,无接缝 |
| Wan 3.0 Preview,720P | $0.10 × 30 | $3.00 | 720P 下 30s 连续 |
| Wan 3.0 Preview,480P | $0.05 × 30 | $1.50 | 480P 下 30s 连续 |
| Wan 2.7,开场加续写 | $0.15 × 25 计费 | $3.75 | 只有 15s。 无法达到 30。 |
| Seedance 2.5,480p | from $0.134 × 30 | ~$4.05 | 30s 连续,封顶 720p |
再读一遍第四行。用 Wan 2.7 生成 15 秒连续内容,比 Wan 3.0 在 720P 下生成 30 秒连续内容还贵。这个变通方案不是便宜选项,而是一个更贵、并且也行不通的选项。
关于 Seedance 那一行有个注意事项:它列出的费率是 480p 底价,并且模型按像素面积计费,所以 720p 实际运行大约是这个数字的 2.25 倍。
授权方面要谨慎。Wan 3.0 仍处于 beta,因此商业条款来自你申请时接受的 Alibaba Cloud 服务协议,而不是任何模型许可证,并且在正式可用前可能变化。由于没有发布权重,本地部署和微调都不是选项。在交付客户项目之前,请根据你自己账号的条款确认署名和水印要求。
常见问题
Wan 3.0 Preview 已经向所有人开放了吗?
没有。它于 2026 年 8 月 6 日进入公开测试,但访问需要通过 Alibaba Cloud Model Studio 和 Qwen Cloud 申请。获批账号拥有 2 个并发请求、30 RPM 和 50 个异步任务队列,这更适合评估,而不是生产。
Wan 3.0 Preview 是开源的吗?权重在哪里?
没有权重。查询 Wan-AI 组织下每个仓库的 Hugging Face API,结果显示没有任何内容超过 Wan 2.2。最新的三个仓库都是 Wan2.2-Animate-2 变体,创建于 Wan 3.0 发布同一天。Wan 2.2 仍然是开放权重的天花板。
Wan 3.0 Preview 真的支持原生 4K 吗?
不支持。官方文档列出的分辨率是 480P、720P 和 1080P。4K 说法来自互相引用的聚合网站,而不是一手来源,并且与 Alibaba 自己的价格表相矛盾;那张表只有三个分辨率档位。
30 秒 Wan 3.0 Preview 视频要多少钱?
在 1080P 下,每输出秒 $0.20,30 秒就是 $6.00。720P 为 $3.00,480P 为 $1.50。相比之下,我在 Wan 2.7 上以 1080P 生成 15 秒连续内容,按真实计费费率花了 $3.75。
如果没有 Wan 3.0 Preview 访问权限,今天能生成 30 秒一镜到底吗?
不能用 Wan 2.7。它的续写模式输出封顶 15 秒,只接受 10 秒或更短的源片段,而且串接时会向后循环。Seedance 2.5 可以单次生成 4 到 30 秒,但最高只有 720p。
Wan 3.0 Preview 对比 Wan 2.7:值得等吗?
如果你需要超过 15 秒的连续镜头,或者需要文档和网页参考输入,那么值得,而且没有变通方案。对于 15 秒及以下的任何内容,Wan 2.7 现在更实用,因为 2 请求并发上限会让 3.0 上的批量工作比它所替代的模型更慢。






