MiniMax H3 Developer 现已上线 — 官方定价 4 折,低至 $0.02/秒

Wan 3.0 Prime 指南:参数、Atlas Cloud 设置与提示规则

Wan 3.0 Prime 是 Atlas Cloud 上的高级 Wan 3.0 视频套餐,专为需要更长片段、原生音频、更强参考处理以及更可控最终输出的创作者打造。本指南将说明如何在标准版 Wan 3.0 与 Prime 之间做选择、哪些参数最为关键,以及如何构建提示词以实现可靠的视频生成。内容涵盖文生视频、图生视频及参考视频工作流,并提供关于分辨率、宽高比、时长、音频、提示词扩展、思考模式及种子控制的实用建议。

Wan 3.0 Prime 是阿里云 Wan 3.0 视频模型家族在 Atlas Cloud 上的高级版本。它专为那些需要更长单次视频生成、原生音频、更强的多模态参考处理能力,以及从提示到成片更清晰流程的创作者和开发者而设计。

简而言之:在探索创意并密切关注成本时,使用标准 Wan 3.0。当镜头至关重要、参考堆栈密集,或者需要在一个运行中保持角色、运动、声音和场景逻辑的 30 秒片段时,请切换到 Wan 3.0 Prime。

本指南涵盖 Wan 3.0 Prime 是什么、哪些参数重要、它与 Wan 3.0 有何不同、如何在 Atlas Cloud 上运行它,以及如何编写既能给模型足够结构又不会让提示变成噪音的提示。

关键要点

  • Wan 3.0 Prime 涵盖文本到视频、图像到视频和参考到视频。
  • 它支持最长 30 秒、480P 到 1080P、自适应或固定宽高比以及原生音频。
  • Prime 是价格更高的层级,因此先在较短运行中测试结构。
  • 最佳提示应描述时间、镜头、声音、身份和约束。
  • 在 Atlas Cloud 上,从模型页面开始,选择 Prime 模式,然后在 playground 或 API 流程中运行。

Wan 3.0 Prime 工作流卡片,显示文本、图像和参考输入转化为可控视频

Wan 3.0 Prime 在每个输入都有其角色时效果最佳:提示用于方向,参考用于锚点,参数用于交付。

为什么 Wan 3.0 Prime 备受关注

Wan 3.0 改变了 AI 视频提示的格局,因为该模型可以在同一次生成中产生更长的带有音频的片段。阿里云在 官方 Wan 3.0 发布页面 上描述了原生 30 秒生成、1080P 输出、原生视听生成,以及一个广泛的全参考工作流,该工作流可以使用文本、图像、音频、视频、文档和网页作为创意输入。

这一点很重要,因为视频工作很少只是“制作一个片段”。营销人员可能需要在 20 秒广告中保持相同的产品和房间。游戏工作室可能需要角色保持相同的服装和动作风格。短片团队可能需要镜头在三个节拍中移动而不失去空间连续性。Prime 正是针对这种更受控的使用场景。

专业习惯是将三个任务分开:

  • 创意意图: 观众在结束时应该理解什么。
  • 参考控制: 什么必须在视觉或声音上保持稳定。
  • 交付设置: 时长、分辨率、宽高比和音频行为。

糟糕的 Wan 提示将这些任务混为一谈。优秀的 Wan 3.0 Prime 提示使模型的工作负载清晰可读。

Atlas Cloud 上的 Wan 3.0 Prime 工作流和参数

Atlas Cloud 在同一个 Wan 3.0 模型页面 上列出了 Wan 3.0 和 Wan 3.0 Prime。公开列表显示三种 Prime 模式:文本到视频、图像到视频和参考到视频。它还显示了匹配的标准 Wan 3.0 模式,这在您想要比较成本或在运行高级版本之前测试提示时非常有用。

使用 Atlas Cloud 模型中心 在预算前验证实时价格。截至 2026 年 8 月 26 日,Atlas Cloud 的公开列表显示 Wan 3.0 Prime 为 $0.068/SEC,可见折扣率为 $0.061/SEC,标准 Wan 3.0 为 $0.05/SEC,可见折扣率为 $0.04/SEC。请将这些视为发布时检查的值,而非永久定价。

Wan 3.0 Prime 模式输入模式最佳用途关键控制
文本到视频仅提示新场景、情绪测试、短概念、长单次拍摄强时间线和声音方向
图像到视频起始图像,可选结束图像动画化已设计的第一帧或锁定最终帧身份、物体、灯光和镜头约束
参考到视频混合图像、视频、音频、文档或网页参考角色、产品、位置、运动、声音一致性位置参考语言

跨 Wan 3.0 Prime 风格端点使用的公共模式围绕这些控制:

参数典型值控制内容提示注意事项
prompt文本字符串场景、主体、动作、镜头、声音、约束写片段,而不仅仅是图像
resolution480p, 720p, 1080p输出质量层级在 720P 测试,当细节重要时在 1080P 完成
aspect_ratioadaptive, 16:9, 4:3, 1:1, 3:4, 9:16画面形状选择原生宽高比,而不是后期裁剪
duration2 到 30 秒,或支持智能时长的地方片段长度时间码任何超过一个简单动作的内容
audiotrue 或 false原生生成音频静音也是一种声音决策
enable_prompt_expansiontrue 或 false提示重写为质量保持开启,仅在延迟重要时关闭
enable_thinkingtrue 或 false(如果暴露)为复杂节拍提供额外推理用于时间序列和参考密集型镜头
enable_safety_checkertrue 或 false(如果暴露)安全过滤对于正常生产工作保持开启
seed整数(如果暴露)可重复性用于受控变体,不是保证

Wan 3.0 Prime 参数卡片,将提示、时长、分辨率、比例、音频和参考映射到输出行为

参数不是装饰。它们决定 Wan 3.0 Prime 是探索、测试还是生成最终片段。

步骤 1:选择正确的 Wan 3.0 Prime 模式

从您已经信任的输入开始。如果您只有一个想法,请使用文本到视频。如果设计团队已经批准了第一帧,请使用图像到视频。如果连续性工作是任务,请使用参考到视频。

可复制的文本到视频测试提示:

Plain
1创建一个10秒的电影级产品展示片,主角是一款哑光黑色旅行相机,放置在阳光照射的火车桌上。
2
30到3秒:微距特写快门按钮,手正在收紧腕带。
43到7秒:相机向上倾斜,火车驶出隧道,暖光扫过镜头玻璃。
57到10秒:拉远镜头,在一个干净的画面中展示相机、笔记本和窗户反射。
6
7镜头:50mm微距慢速拉远,无剪辑。
8光线:来自画面右侧的窗户暖光,镜头上清晰的反光。
9声音:火车轨道节奏,皮革腕带吱嘎声,轻柔快门声,无音乐。
10约束:无文字叠加,无标志,无额外的手。
11

推荐设置:

设置选择
模式Wan 3.0 Prime 文本到视频
分辨率首次测试 720P,最终 1080P
宽高比网页主图 16:9,竖版广告 9:16
时长首次测试 10 秒
音频开启,除非最终交付需要静音视频

重要的不是主体。而是结构。提示给出了时间范围、物理动作、镜头路径、光源、声音设计和约束。这给了 Wan 3.0 Prime 一个可执行的片段。

步骤 2:在编写提示之前设置 Wan 3.0 Prime 参数

在编写最终版本的提示之前,选择交付框架。9:16 的广告、16:9 的登陆页面主图和 1:1 的产品循环不应使用相同的措辞。

可复制的参数检查清单:

Plain
1Wan 3.0 Prime 设置
2模式:文本到视频 / 图像到视频 / 参考到视频
3分辨率:720P 测试,1080P 最终
4宽高比:原生交付比例,不是后期裁剪
5时长:先短测试,仅当时间线值得时最多 30 秒
6音频:如果声音有助于场景则开启,仅用于静音放置时关闭
7提示扩展:为质量开启,为延迟敏感测试关闭
8思考:为多节拍序列或密集参考堆栈开启
9种子:仅在比较提示变体时设置
10

推荐设置:

目标分辨率时长宽高比音频
低成本提示测试720P5 到 8 秒自适应或最终比例如果声音重要则开启
社交媒体广告草稿720P 或 1080P8 到 15 秒9:16开启
网站主图1080P8 到 12 秒16:09通常关闭或微妙
叙事证明1080P20 到 30 秒16:09开启

Wan 3.0 Prime 设置卡片,显示模式、分辨率、宽高比、时长、音频、提示扩展、思考和种子

先选择交付设置,然后围绕您实际选择的画面和时间编写提示。

步骤 3:使用 Wan 3.0 Prime 参考到视频处理密集创意包

参考到视频是 Prime 最有用的地方。一个请求可以结合多个角色:角色参考、产品图像、位置图、运动片段和音频提示。提示必须位置性地处理这些参考。

可复制的参考提示:

Plain
1使用图像1作为主要主体的面部和服装。
2使用图像2作为产品设计。
3仅使用视频1作为运动参考。
4使用音频1作为节奏和声音纹理。
5
6创建一个20秒的时尚科技发布影片。
70到5秒:主要主体从画面左侧进入玻璃中庭,穿着精确的夹克并携带图像2中的产品。
85到12秒:镜头在胸部高度向后跟踪,主体打开产品盒,匹配视频1中自信的行走节奏。
912到17秒:围绕主体绕行,同时产品亮起,保持面部、夹克和产品形状一致。
1017到20秒:切换到干净的产品英雄定格,产品在前景,主体在其后柔焦。
11
12声音:使用音频1作为节奏参考,带柔和房间反射和产品激活咔嗒声。
13约束:保持面部、夹克、产品比例、中庭布局和运动节奏。无重复主体,无服装变化,无字幕,无标志。
14

推荐设置:

设置选择
模式Wan 3.0 Prime 参考到视频
参考顺序按插槽命名每个参考
时长15 到 20 秒用于受控审查
思考为参考密集型提示开启
审查检查身份、产品形状、运动节奏和声音

本地 Wan 3.0 手册包含一个多参考风格案例,涉及群体表演和协调服装。它展示了为什么参考角色很重要:结果不仅仅是关于一个时尚的画面,而是关于在一条连贯的序列中保持多个主体、服装语言、编舞和灯光。

手册案例:一个多主体时尚序列展示了参考到视频工作流旨在保护的身份、服装和编舞控制类型。

步骤 4:在 Atlas Cloud 上运行 Wan 3.0 Prime

Atlas Cloud 为希望在一个地方测试和交付模型输出的团队保持工作流简洁。

可复制的平台检查清单:

Plain
11. 打开 Atlas Cloud 并登录。
22. 进入模型,然后搜索 Wan 3.0。
33. 选择 Prime 模式:文本到视频、图像到视频或参考到视频。
44. 设置分辨率、宽高比、时长、音频和其他暴露的控制。
55. 上传起始帧、结束帧或参考(如果模式需要)。
66. 粘贴提示并运行一个短测试。
77. 审查身份、运动、音频和构图。
88. 以所需的分辨率和时长重新运行最终版本。
99. 下载视频或通过 API 工作流调用同一模型。
10

推荐设置:

Atlas Cloud 步骤检查什么
模型页面正确的 Prime 端点,除非测试成本,否则不是标准
输入面板参考文件按预期顺序排列
设置时长和比例与提示匹配
输出片段实际以预期长度和格式渲染
最终下载文件名、海报帧和字幕与交付的片段匹配

Wan 3.0 Prime Atlas Cloud 检查清单卡片,显示模型选择、设置、参考、提示、运行、审查和下载

使用 Atlas Cloud 作为操作界面:选择模式、设置交付控制、上传参考、运行、审查和交付。

Wan 3.0 Prime 与 Wan 3.0 对比

最简单的区别是层级选择。标准 Wan 3.0 是经济实惠的起点。当提示准备好进行更高价值的运行时,Wan 3.0 Prime 是高级通道。

比较点Wan 3.0Wan 3.0 Prime宽高比音频
Atlas Cloud 上的模式文本到视频、图像到视频、参考到视频文本到视频、图像到视频、参考到视频自适应或最终比例如果声音重要则开启
2026年8月26日列出的起始价格$0.05/SEC,可见折扣价 $0.04/SEC$0.068/SEC,可见折扣价 $0.061/SEC9:16开启
最佳用途提示探索、更便宜的测试运行、早期变体最终质量尝试、密集参考、更高风险片段16:09通常关闭或微妙
提示策略清晰的行动、镜头、音频和约束相同结构,但参考角色和审查更严格16:09开启
预算习惯更自由地迭代先短测试,然后提交更长的运行静音也是一种声音决策
enable_prompt_expansiontrue 或 false提示重写为质量保持开启,仅在延迟重要时关闭
enable_thinkingtrue 或 false(如果暴露)为复杂节拍提供额外推理用于时间序列和参考密集型镜头
enable_safety_checkertrue 或 false(如果暴露)安全过滤对于正常生产工作保持开启
seed整数(如果暴露)可重复性用于受控变体,不是保证

两个层级共享相同的广泛 Wan 3.0 逻辑:长单次生成、原生音频和多模态输入。Prime 并没有消除对纪律的需求。它奖励纪律。松散的提示仍然会产生松散的视频,只是在高级通道中。

选择标准 Wan 3.0 当:

  • 您正在测试故事创意。
  • 您需要许多变体。
  • 参考包很简单。
  • 片段可以很短。
  • 预算比周转时间或完成质量更重要。

选择 Wan 3.0 Prime 当:

  • 提示已经通过更便宜的测试。
  • 片段需要在一次连贯的生成中达到 20 到 30 秒。
  • 任务依赖于角色、产品、位置、运动或声音参考。
  • 输出接近活动、推销或客户审查阶段。
  • 重新运行失败片段的成本高于从一开始使用更强层级。

Wan 3.0 Prime 的提示规则

Wan 3.0 Prime 提示应像一份简短的生产简报。模型需要足够的细节来在提示扩展后保留重要的内容,但它不需要十个“电影级”的同义词。

使用这些规则:

规则为什么重要示例
给片段一个时钟更长的片段需要节奏0到5秒,5到12秒,12到20秒
每个节拍命名一个镜头计划防止随机剪辑慢速横向跟踪,固定微距,四分之三环绕
有意识地编写声音原生音频无论如何都会发生无音乐,柔和房间音调,一句台词
用语言锁定身份仅参考可能漂移相同面部、夹克、产品形状和颜色
谨慎使用约束负面提示在具体时效果最好无字幕,无标志,无重复主体
按插槽处理参考模型需要角色图像1是主体,视频1仅用于运动
将比例与交付匹配裁剪会浪费信息为9:16编写竖版镜头,而不是16:9的剩余部分

短提示结构:

Plain
1主体 + 动作 + 地点 + 光线 + 镜头 + 声音 + 约束。
2

块提示结构:

Plain
1风格
2描述镜头、灯光、纹理和颜色。
3
4主体
5列出稳定的身份、产品或环境细节。
6
7时间线
8将片段分解为时间范围。
9
10镜头
11为每个节拍命名运动和景别大小。
12
13声音
14编写环境、效果、对话、静音和音乐。
15
16约束
17仅列出绝对不能改变的细节。
18

参考提示结构:

Plain
1参考角色:
2图像1 = 主要主体身份。
3图像2 = 产品设计。
4视频1 = 仅运动节奏。
5音频1 = 仅声音纹理。
6
7时间线:
80到6秒:...
96到14秒:...
1014到22秒:...
1122到30秒:...
12
13连续性锁定:
14相同面部、相同服装、相同产品几何、相同位置、相同运动逻辑。
15

最常见的提示错误是用风格词代替生产决策。“高级电影级商业广告”是不够的。说出镜头做什么、随时间变化什么、音频做什么以及必须保持什么。

成本和工作流技巧

Prime 每秒成本更高,因此最佳预算举动不是永远写更短的片段。而是运行更智能的测试。

使用此顺序:

  1. 起草最终提示结构。
  2. 在 720P 下运行 5 到 8 秒测试。
  3. 修复参考角色和约束。
  4. 运行核心 10 到 15 秒版本。
  5. 只有在那时才提交 20 到 30 秒的 Prime 生成。

对于生产团队来说,昂贵的运行应该感觉有点无聊。镜头已经设计好,参考已命名,设置匹配交付,审查清单已准备好。Prime 是执行计划的地方,而不是发现计划的地方。

还要保持字幕诚实。如果交付的片段是 20 秒,就称其为 20 秒。如果模型改变了道具,要么重新运行,要么描述局限性。当字幕承诺了片段未显示的控制时,强大的 AI 视频文章会最快失去信任。

安全与权利说明

使用您有权使用的参考,特别是面部、声音、品牌产品和受版权保护的素材。Wan 3.0 Prime 可以组合图像、视频、音频和文档,这使得权利管理更加重要。参考包应包括批准的资产、明确的使用范围,以及不应进入生成工作流的私人材料。

常见问题

什么是 Wan 3.0 Prime?

Wan 3.0 Prime 是 Atlas Cloud 上 Wan 3.0 视频生成的高级版本,可在文本到视频、图像到视频和参考到视频模式下使用。它专为更受控、更高价值的视频运行而设计。

Wan 3.0 Prime 与 Wan 3.0 有何不同?

在 Atlas Cloud 上,两个层级都暴露了相同的三种广泛模式。标准 Wan 3.0 更便宜,更适合探索。Wan 3.0 Prime 每秒成本更高,在参考、时长和最终输出质量更重要时是更好的选择。

Wan 3.0 Prime 使用哪些参数?

核心控制是提示、分辨率、宽高比、时长、音频、提示扩展、思考(如果可用)、安全过滤器(如果可用)和种子。参考模式还使用媒体输入,例如图像、视频、音频、文档或网页,具体取决于端点。

提示扩展应该打开吗?

对于大多数创意运行,保持提示扩展开启,因为它可以改善模型的解释。仅在测试延迟或需要比较非常受控提示的原始效果时关闭它。

Wan 3.0 Prime 的最佳提示格式是什么?

使用块简报或时间码化节拍表。包括主体、动作、位置、光线、镜头、声音、参考角色和约束。对于较长的片段,时间码化节拍,以便模型知道镜头应该如何展开。

如何在 Atlas Cloud 上使用 Wan 3.0 Prime?

登录 Atlas Cloud,打开 Wan 3.0 模型页面,选择 Prime 模式,设置分辨率、宽高比、时长、音频和任何暴露的控制,如果需要上传参考,粘贴提示,运行一个短测试,审查输出,然后重新运行最终版本。

何时应避免使用 Wan 3.0 Prime?

在早期头脑风暴、模糊提示或标准 Wan 3.0 已经可以处理的简单片段中避免使用 Prime。使用较低成本层级来完善想法,当镜头准备好时再切换到 Prime。

最新模型

一个 API,畅享全模态 AI。

探索全部模型