Wan 系列已经是互联网上分支最多的开源视频家族。Wan 2.2 和 Wan 2.1 仓库各自拥有约 17,000 颗星(GitHub,2026年8月),Wan-AI 页面每月在其检查点上移动数十万次下载(Hugging Face,2026年8月)。因此,当 Wan 3.0 进入早期访问阶段,支持原生 30 秒生成、最多 20 个参考输入,并在与画面相同的生成过程中生成音频时,第一个问题不是人们是否会使用它,而是是否有人知道如何为它编写提示词。
因为一个 30 秒的单次生成并不是一个 5 秒片段的放大版。这是一个不同的写作问题。一个 5 秒的提示词描述的是一个移动的画面。一个 30 秒的提示词则引导时间:谁变化、何时、在哪个剪辑点、下面有什么声音。
随早期访问一起发布的 Wan 3.0 创作者手册包含 19 个官方提示词与结果案例。我研究了全部 19 个,然后挑选了三个最能传授可迁移技术的案例,并逐一拆解:提示词实际控制什么、为什么这样构建,以及如何复用其骨架来创作你自己的镜头。下面的每个视频都是所讨论案例的真实、未编辑输出。原始案例提示词是用中文写的;这里的骨架是英文重述其结构,Wan 系列接受两种语言的提示词。
关键要点
- 长 Wan 3.0 提示词共享一个架构:首先是参考绑定,其次是全局规则,第三是带时间戳的镜头列表。短测试提示词可以省略层次,但生产提示词不应省略。
- 将表演写成一系列可见动作,切勿使用情感标签。“焦虑”是一种希望。“咀嚼变慢、眉头皱起、目光垂落到手上”才是一条指令。
- 声音是提示词的一部分,不是后期步骤。对话放在花括号内,效果和音乐用单独的句子表达,静音需要明确请求。
- 官方案例重复其最重要的约束,并禁止他们预期的失败。一个手册提示词用三种不同措辞禁止“平滑滑动”,因为模型默认会平滑。
- 运动可以量化:每帧爆发次数、每次冲刺占帧宽度的百分比、重复次数。下面的蜻蜓案例就是证明。
一次生成,30秒,10个编号分镜和一个完整的配乐弧线,全部写在一个提示词中:一艘渔船、一场风暴、一个按计划浮出水面的海怪。官方 Wan 3.0 手册案例,此处显示未经编辑。
为什么编写 Wan 3.0 提示词有所不同
三种能力改变了工作内容,每一种都增加了一种较短视频模型从未要求过的写作技巧。
原生 30 秒意味着结构。 当模型渲染 5 秒时,一个提示词可以是一个密集的句子。在 30 秒时,一个无结构的提示词会漂移:角色换衣服、摄像机忘记规则、结尾与开头无关。手册中的每个长案例都以相同的方式对抗漂移:使用明确的阶段和结束状态。这种结构是本指南的核心。
联合音频意味着声音指导。 Wan 3.0 与画面同时生成配乐。对话、效果、氛围和音乐都可以通过提示词引导,这也意味着未编写的配乐是即兴的。官方案例以与光线相同的纪律对待音频:明确说明、限定范围,有时甚至故意静音。
最多 20 个参考意味着绑定语法。 面孔、服装、地点、声音甚至分镜图像都可以固定到上传的材料上。手册案例将每个参考绑定到命名主题一次,然后在后续每个镜头中重用该名称。如果你已经在当前一代上测试过同样的纪律,比如在 Wan 2.7 参考到视频 上,那么 3.0 版本会让你感觉熟悉而不是陌生。
这些都不需要每次都写一部小说。手册中最短的优秀案例是一个关于手绘风格 UFO 偷牛的单句提示词。技巧在于知道你的镜头需要哪些层次,这正是下面三个案例的目的。
Wan 3.0 提示词堆栈:每个长案例共享的三个层次
剥去 19 个官方案例的骨架,长案例都是相同的三层堆栈。
第一层:参考绑定。 每个上传材料一行,说明它是什么以及可能从中提取什么。将图像 1 中的女性定义为 Subject 1。仅从图像 2 中提取服装。Subject 2 的声音遵循音频 1。绑定一次,然后永远用名称引用。像“图像定义了角色”这样的模糊复数正是这一层要防止的。
第二层:全局规则。 必须在整个视频中保持真实的一切,在描述任何动作之前写:视觉风格及其参考点、命名的色彩系统、光线行为、摄像机语法、表演纪律、音频纪律,以及禁止失败的列表。这一层是手册案例中最具侵略性的。一个武术案例将慢动作限制为两次,每次不超过一秒,禁止屏幕上的字幕,完全禁止背景音乐,并禁止摄像机静止超过 1.5 秒。
第三层:时间线。 带时间戳或编号的节拍,每个节拍包含一个主要事件和一个可见的结束状态。不是“他们打了一会儿”,而是“0 到 1.5 秒:他站在芦苇线旁,背光,风衣在风中,说出他的台词”。结束状态是保持第 15 秒与第 5 秒一致的关键。
一种有用的记忆方式:第一层是选角,第二层是规则手册,第三层是镜头列表。下面三个案例分别强调某一层。
案例 1:如何为表演编写 Wan 3.0 提示词,一张脸持续 30 秒
手册中最不花哨的案例是大多数人应该首先学习的:一个年轻女子穿着蓝色毕业长袍的固定特写,持续整整 30 秒,她说话、担忧,最后低头看着自己的手。
三十秒,一个镜头,无剪辑。长袍告诉你场景,眉毛告诉你利害关系,目光垂落精确落在提示词指定的位置。官方手册案例,未编辑输出。
以下是官方提示词逐动作所做的,用我自己的话而不是原文:
- 摄像机先于主体。 它通过锁定画面开始:正面特写,头部和上半身,以及一个故意的不完美,左侧边缘有一个完全失焦的第二个人。你命名然后模糊的背景,模型不会在镜头中突然锐化。
- 服装作为展示。 一件蓝色毕业长袍取代了场景设定的一段话。模型推断出仪式、人群、那一天。选择一件能暗示整个世界的服装或道具,跳过描述世界。
- 情感作为可见动作链。 提示词从未要求“焦虑”。它写的是她说话时嘴巴在动,眉毛微微皱起,脸上一副严肃的表情。每个项目都是摄像机可以验证的东西。情感标签是希望。肌肉运动是指令。
- 卖出现实感的微动作。 两个细节比所有其他细节加起来都重要:摄像机保持轻微的呼吸式手持晃动,她的目光从前方移动到看向自己的手,沿着指定的轨迹。给任何长镜头一次这样缓慢、有意的变化,镜头就会读起来像是被导演过的,而不是生成的。
可重用骨架,英文,结构与其案例相同:
Plain1正面 [景别] 对 [主体],[取景细节]。一个 [失焦元素] 位于画面 [边缘]。 2[主体] 穿着 [一件能暗示整个场景的服装]。 3[主体] 正在 [动作],嘴巴在动,[眉毛/眼睛/下巴细节]。光线从 [方向] 照来,保持 [皮肤/织物纹理说明]。摄像机锁定但带有轻微的呼吸式手持晃动。在整个镜头中,[一个缓慢的可见变化:目光轨迹、姿势变化、物体放下]。
在接触 30 秒史诗之前,先用你自己的主体填充这个模板。如果一张脸能保持三十秒,你的结构就是可靠的。
案例 2:如何像导演一样构建 30 秒的 Wan 3.0 提示词
手册中的荒诞短片是整个文档中最好的结构教学工具:一个女牛仔骑着一匹真马进入一个孤独的 66 号公路加油站,拿起油枪,给她的马加满新鲜草料,而服务生的世界观悄然崩溃。
三十秒的冷面铺垫和一个完美的视觉噱头。喜剧被写进结构:固定的观察式取景,然后在荒诞事情发生时突然出现一个极端特写。官方手册案例,未编辑输出。
它的提示词组织为五个命名模块,模块列表本身就是课程:
- 一句话梗概。 描述发生了什么以及笑点是什么的两句话。不是视觉,而是故事。先写这个迫使你弄清楚这 30 秒的目的是什么。
- 命名的色彩系统。 不是“色彩丰富”,而是两色法则:青色天空和橙色大地,然后每个主要物体被分配到其中一侧,褪色的红色油泵、橙色围巾、土红色山脉。命名系统,然后分配它。AI 视频中的一致性问题通常首先是一个调色板问题,而不是角色问题。
- 带有叙事任务的角色列表。 每个角色有两到三个可见特征,并且关键的是,有一个功能:服务生被明确指定为影片的反应镜头承担者。分配任务告诉模型,在每个该角色出现的节拍中,摄像机的注意力应该放在哪里。
- 命名的摄像机哲学。 案例发明了一个规则并用一句话定义:冷静观察加荒诞特写,意思是固定的中景和慢速平移作为默认,只有在荒诞事件发生时才被一个突然的极端特写打破。命名你的摄像机规则然后引用它,比在每个节拍中重新描述摄像机移动要好。这也是整个喜剧机制:平淡的凝视让草泵特写更有冲击力。
- 带有结束状态的四个幕时间线。 设置、升级、笑点、余波,每个都有时间范围、一个主要事件和一个冻结的最终图像,直到最后一拍服务生嘴里的牙签终于掉下来。
可迁移的模型比喜剧更大。一句话梗概、调色板法则、带有任务的角色、一个命名的摄像机规则、四个带有结束状态的幕:这是一份制作简报,而 Wan 3.0 是这个系列中第一个有足够跑道——30 秒——让简报起作用的世代。本文顶部的海怪展示案例是同一个骨架,有十个节拍和一个配乐弧线,以同样的方式编写:每个节拍一个事件,每个节拍一个可见的结束状态。
案例 3:将运动物理写入 Wan 3.0 提示词
从任何视频模型中获得的最难的东西是运动的非平滑。模型倾向于温和、连续的运动,这就是为什么每个 AI 仙女都像慢气球一样漂浮。手册中的仙女不漂浮。她像蜻蜓一样移动:静止悬停、瞬间冲刺、猛然停止、新方向。

悬停、冲刺、猛然停止。每次爆发中间的模糊只有一到两帧宽,正如提示词所预算的。官方手册案例,以无声 GIF 显示;交付的视频带有自己的氛围。
这个提示词通过四种你可以直接借用的技术获胜:
- 顶部优先级声明。 第一行在任何场景描述之前宣布单一最高优先级要求,即蜻蜓运动法则。注意力是预算。将开头的令牌花在决定成功的规则上,而不是地毯颜色上。
- 现实物理锚点。 不是使用形容词如“快速敏捷”,而是提示词命名一个动物,其运动特征模型已经见过数千次:点悬停、爆发启动、完全停止、锐利重定向。一个熟悉的锚点胜过十个抽象的副词。
- 在形容词模糊的地方用数字。 冲刺必须在 3 到 5 帧内跨越画面宽度的 60% 到 90%。停止必须保持 2 到 4 帧。在前八秒内必须发生至少六个清晰分离的爆发。残余运动模糊预算为 1 到 2 帧。此时你不是在写诗,你是在写规格,模型会尊重它。看下面的条状图:中冲刺帧是纯条纹,两侧的帧非常清晰。
- 禁止默认。 提示词明确禁止它预测的失败,以多种措辞:没有缓慢的仙女漂浮,没有匀速巡航,没有连续平滑的滑动,然后一个纠正性句子说明运动不是什么,“不是连续的飞行路径,而是短促、尖锐、几乎跳帧的位移”。当你知道模型在自动驾驶模式下会做什么时,就把自动驾驶从镜头中写出来。

来自蜻蜓案例的四个连续静止帧:在泰迪熊旁边悬停、中冲刺运动模糊、到达积木上方、死停悬停
来自上述输出的四帧。清晰、条纹、清晰、清晰:提示词中的模糊预算,逐帧可见。
相同的四种动作可以推广到任何运动问题:必须不变成剪辑的快速摇镜头、需要重量的撞击、必须不变成有机的机械运动。锚定、量化、优先级排序、禁止默认。
Wan 3.0 提示词中的对话、声音和参考语法
上面的三个案例在解释 Wan 3.0 提示词如何说话的具体机制上是沉默的,所以这里是语法层,从手册其余案例中编译。
对话放在花括号内。 口语台词被包裹在 {今天练哪块肌肉} 中,而不是留在开放散文中,这可以防止模型将你的对话作为字幕叙述。台词落地时带有唇形同步,一个对话场景被写成交替的动作和包在括号内的台词,就像剧本一样。
声音可以被选角。 参考语法扩展到音频:将图像 1 中的女性定义为 Subject 1,然后说明 Subject 1 的声音遵循音频 1。面孔来自一个文件,声音来自另一个,两者在持续时间内锁定。
音频需要一个纪律声明。 最强有力的案例像声明调色板一样声明其声景。一个动画案例提前声明其音频类型:只有氛围和音乐,没有语音。武术案例更进一步,完全禁止背景音乐,只保留呼吸、布料摩擦、打击和风声,并且它确实得到了那个效果。音乐,当需要时,被写成一个贯穿时间线的弧线,从低沉的恐惧音到弦乐升级,再到铜管冲击和长长的厄运音,映射到它必须击中的节拍。
静音也是一个请求。 如果没有提示,模型会填满音轨。如果你的镜头只需要房间音调和一个声音事件,请明确说明。Wan 3.0 中的声音指导不是装饰。它是媒介的后半部分。
今天在哪里练习 Wan 3.0 提示词公式
Wan 3.0 仍在路上,用户目前无法使用它。上述结构现在仍然有效,因为其中没有任何版本锁定的内容:绑定、全局规则、时间线、括号对话和禁止默认都在当前 Wan 世代上运行。
整个当前系列在 Atlas Cloud 上运行,Wan 2.7 文本到视频、图像到视频、参考到视频和视频编辑,使用一个密钥,每次运行前显示每次运行的价格。一个实用的练习:取案例 1 的骨架,用你自己的主体填充,并在 Wan 2.7 文本到视频上作为短镜头运行。如果表演链在那里成立,那么同一个文件就是你在 Wan 3.0 上的第一天草稿,只需调高时长而不是重写。当这个系列更新时,Atlas Cloud 习惯于在 Day-0 提供访问,所以练习环境和目的地很可能是同一个页面。
常见问题
Wan 3.0 提示词应该多长?
与镜头需要一样长,不再更长。官方手册范围从一句话,一个手绘 UFO 噱头,到超过一千个单词的十拍怪物电影。决定变量是时长和角色数量:一个 5 秒的单主体测试需要一个密集的句子,一个 30 秒的多角色故事需要所有三个层次:绑定、全局规则和时间线。
Wan 3.0 是否从提示词生成声音?
是的,音频与画面在同一生成过程中生成。对话写在花括号内,落地时带有唇形同步,音效和氛围作为散文编写,音乐可以作为一个贯穿时间线的弧线进行指导。纪律是双向的:如果你想要接近静音,或者只有氛围没有配乐,你必须明确说明,否则模型会自己填满音轨。
Wan 3.0 提示词中的花括号语法是什么?
花括号标记角色口头说出的单词,如 {终点见}。将对话放在花括号内将其与场景描述分开,这样模型会表演台词而不是说明它。对于多语言工作,在台词之前说明语言,同时说明表演风格。
如何在整个 30 秒 Wan 3.0 视频中保持角色一致性?
将角色绑定到参考一次,并限定范围:将图像 1 中的人定义为 Subject 1,仅取面部、头发和服装。然后,在角色出现的每个时间线节拍中重复主体名称,并在任何高风险时刻(如与服装相关的动作或灯光变化)重新陈述两到三个锁定特征。手册中的战斗场景案例甚至在每个模块中重新陈述特征锁定,这是双保险版本。
我可以在获得 Wan 3.0 访问权限之前练习编写提示词吗?
可以,而且你应该这样做。三层结构、括号对话、参考绑定和禁止默认技术今天都在当前系列上运行。Atlas Cloud 上的 Wan 2.7 涵盖文本到视频、图像到视频、参考到视频和视频编辑,使用一个密钥,因此在那里验证的模板转移到 3.0 时只是时长变化,而不是重写。
结论
19 个官方案例以三种不同方式说了同一件事:一个 Wan 3.0 提示词是一份制作文档,而不是一个标题。选角你的参考、立法你的风格、安排你的节拍,并将声音视为画面的一半。从毕业特写骨架开始,升级到五模块简报,并为需要它的镜头保留帧预算运动规格。模型会继续变化。而编写时间而不是描述画面的纪律,是你能够保留的部分。






