你终于有了一个强大的30秒AI视频。然后客户要求制作45秒广告。或者剪辑需要一个60秒的Shorts版本。这就是Wan 3.0视频扩展超过30秒从模型规格问题转变为连续性工作流的地方。
简而言之:将Wan 3.0视为一个30秒的规划单元。先生成最强的30秒基础镜头,然后使用最后一帧、最后1-3秒、强参考和拒绝重置场景的延续提示来继续它。
Wan 3.0令人兴奋,因为原生30秒生成是真实的。但更长的成品视频仍然是通过分段制作的。诀窍是让片段2感觉像是下一口气,而不是穿着同一件夹克的新视频。
关键要点
- Wan 3.0最好规划为原生30秒镜头。
- 45秒和60秒的剪辑需要延续,而不是一个巨大的提示。
- 当没有出现"扩展"按钮时,参考到视频是实用的后备方案。
- 在每次延续中锁定身份、地点、摄像机、运动和声音。
- 预留重试预算。连续性通常需要超过1次运行。
案例1: Wan 3.0视频扩展超过30秒,使用一个中式房间戏剧片段,再延续15秒。
为什么Wan 3.0视频扩展超过30秒很热门
先下结论:主打功能是30秒,但创作者的问题是30秒之后发生了什么。
阿里巴巴自己的Model Studio发布页面将Wan 3.0描述为原生30秒叙事、1080P电影级输出、原生视听生成,以及来自图像、文本、视频、音频、文档和网页的参考(阿里云Model Studio,2026年8月)。阿里云社区也将Wan 3.0描述为30秒测试版,具有多模态参考和视频扩展功能(阿里云社区,2026年8月)。
这是好的部分。
混乱的部分对于尝试过长时间AI视频的人来说很熟悉:
- 第二个片段重新开始场景,而不是继续。
- 角色获得新面孔、外套、年龄或姿势。
- 产品标签在CTA应该落地的瞬间变形。
- 摄像机无缘无故跳到新轴线。
- 音频背景重新开始,剪辑点显得突兀。
大多数失败的尝试都有相同的根本原因。用户将第二个提示写成全新的生成。对于Wan 3.0视频扩展,第二个提示应该像编辑的交接记录。
问题是:这个交接记录应该是什么样?
Wan 3.0视频扩展工作流概览
本节提供工作地图:使用哪种Wan 3.0模式、何时使用,以及如何将整个测试保持在一个浏览器标签中。
Atlas Cloud在这里很有用,因为同一个模型系列暴露在一个地方。你可以测试文本到视频的基础,然后切换到图像到视频进行产品拍摄,再使用参考到视频进行延续,而无需更改工作流或资产库。从Atlas Cloud模型中心开始,然后准备好运行时打开Wan 3.0 on Atlas Cloud。
| 需求 | Atlas Cloud 模型 | 用途 | 计划设置 | 价格说明 |
|---|---|---|---|---|
| 从文本开始的30秒 | Wan-3.0 Text-to-video | 没有起始图像 | 30秒,720P测试,1080P最终,16:9或9:16 | Atlas models/all列表从$0.05/秒 |
| 从图像开始的30秒 | Wan-3.0 Image-to-video | 产品、人物或品牌锚点 | 30秒,相同比例,如果需要原生音频 | 发布前验证最终层级 |
| 延续片段 | Wan-3.0 Reference-to-video | 输入前一个片段、最终帧或产品参考 | 6-15秒延续,相同比例和分辨率 | Atlas models/all列表从$0.05/秒 |
| 可选拼接 | 本地编辑器 | 组装、压缩、海报、GIF | 仅对<=10秒的片段使用GIF | 本地处理 |
Atlas Cloud的all-models页面目前列出Wan-3.0 Text-to-video、Image-to-video和Reference-to-video从$0.05/秒起。其主页也说Wan 3.0 text-to-video、image-to-video和all-in-one reference-to-video已上线,从$0.05/秒起。发布日检查所有模型定价页面,因为分辨率层级和折扣可能变化。
Picsart最近关于Wan 3.0集成的文章指向同一方向:30秒单镜头是主打,但扩展、智能时长、文档、网页和首尾帧控制才是将其转化为工作流的关键(Picsart,2026年8月)。
第1步:规划Wan 3.0 30秒基础镜头
从30秒开始,而不是60秒。你的基础剪辑应该已经有一个开始、中间和有用的结束状态。
使用此结构:
身份 -> 设定 -> 时间线节拍 -> 摄像机 -> 声音 -> 结束状态
Plain1创建一个30秒的电影级产品视频,展示一款优质冰镇抹茶饮料,装在透明玻璃瓶中。 216:9横屏。单个连续镜头。 3 40-5秒:瓶子放在湿石台面上,旁边有新鲜抹茶粉和冰块。柔和的晨光从窗户照入,玻璃上有冷凝水。 55-12秒:一只手拿起瓶子,水滴沿表面滑落,标签保持清晰可见且居中。 612-22秒:摄像机跟随瓶子穿过明亮的咖啡柜台场景,背景中有咖啡师工具和绿色陶瓷杯。 722-30秒:瓶子放回柜台,摄像机稳定到干净的主角角度,右侧留出空间供后续行动号召。 8 9保持相同的瓶子形状、标签位置、绿色、灯光和咖啡馆环境。自然咖啡馆氛围,轻柔的冰块碰撞声,无对话。
选择设置:
| 设置 | 选择 |
|---|---|
| 模型 | 如果有产品主图,使用Wan-3.0 Image-to-video,否则使用Wan-3.0 Text-to-video |
| 时长 | 如果可用则30秒。如果返回较短的探测,保持相同工作流并重新运行最终版本。 |
| 分辨率 | 第一次测试720P,最终1080P |
| 宽高比 | 16:09 |
| 音频 | 如果氛围重要则开启 |

Atlas Cloud Wan 3.0基础运行截图,用于30秒产品视频
第1步截图:Wan 3.0基础提示词、720P设置、16:9构图和完成输出在游乐场中可见。在此开发捕获中,保存的探测片段比计划的30秒短,因此将其视为操作设置证明,而非最终广告长度。
第2步:扩展Wan 3.0视频前捕获最终帧
下载第一个片段,然后保存最后一帧或最后1-3秒。这是你的连续性锚点。
在进入下一个模型之前写下状态。听起来很繁琐,但这是大多数长AI视频得以保存的关键。
Plain1前一个片段的连续性状态: 2瓶子回到湿石台面上,标签面向摄像机,早晨咖啡馆光线从左侧照来,后面有绿色陶瓷杯,摄像机锁定在干净的主角角度,画面右侧留空。
选择设置:
| 设置 | 选择 |
|---|---|
| 参考来源 | 首选最终帧,如果被接受则使用最后1-3秒 |
| 文件命名 | 保存为延续参考 |
| 备注 | 记录物体位置、摄像机轴、灯光、声音和结束动作 |

Wan 3.0视频延续的最终帧参考卡
第2步参考卡:一个真实的浏览器渲染卡片,显示延续提示必须保留的最终帧状态。
第3步:使用Wan 3.0参考到视频延续超过30秒
如果游乐场暴露了专用的扩展控制,使用它。如果没有,使用参考到视频延续模式:上传前一个片段或最终帧,然后告诉模型直接从该精确状态继续。
以下是粘贴的提示词:
Plain1直接从前一个片段的最终帧继续。 2不要重新开始场景。不要改变瓶子、标签、灯光、台面、背景杯子、摄像机角度或色彩分级。 3 4创建同一产品视频的下一个15秒。 50-5秒:摄像机保持主角角度,柔和阳光稍微变亮,冷凝水继续沿玻璃移动。 65-10秒:一只手从左侧进入,轻轻将瓶子旋转仅15度,保持标签可读。 710-15秒:瓶子停止移动,画面右侧保持干净以放置简单结束卡,咖啡馆氛围自然延续。 8 9保持相同的16:9构图、相同的早晨咖啡馆环境、相同的产品身份,以及从前一个结束的平滑运动连续性。
选择设置:
| 设置 | 选择 |
|---|---|
| 模型 | Wan-3.0 Reference-to-video |
| 时长 | 如果可用则15秒。如果返回较短的探测,重新运行相同设置以获取最终延续。 |
| 分辨率 | 与基础镜头相同 |
| 宽高比 | 与基础镜头相同 |
| 参考 | 如果被接受则使用前一个视频片段,否则使用最终帧加产品图像 |
| 音频 | 与第1步相同选择 |

Atlas Cloud Wan 3.0参考到视频延续运行完成
第3步截图:Wan 3.0 Reference-to-video延续运行在游乐场中完成。

Wan 3.0产品广告扩展GIF
案例2 GIF :产品广告扩展工作流,展示为30秒商业风格Wan 3.0运动证明,可延续为45秒社交剪辑。
第4步:测试前向Wan 3.0视频扩展
并非所有扩展都针对结尾。有时你现有的片段是中间部分,你需要一个6秒的开场,其最后一帧落在现有片段的第一帧上。
本地Wan 3.0手册有这种确切模式:v083.mp4描述了将视频作为中间片段,然后在其之前写2秒,使一名女性走向摄像机的镜头流畅地进入源片段。
Plain1将参考片段用作故事中间部分。 2创建一个6秒的开场,自然过渡到参考片段的第一帧。 3 4一名年轻女性穿着深色长外套,在寒冷早晨空气中缓慢走向摄像机,背景是安静的都市人行道。 5她的姿势、外套、发型、灯光、背景颜色和摄像机方向必须与参考片段匹配。 6这个新开场的最后一帧应与参考片段的第一帧对齐,使两个片段可以在没有可见跳跃的情况下剪辑在一起。 7 8无场景重置,无服装变化,无突然的摄像机角度变化。环境城市声音,轻柔脚步声,无对话。
选择设置:
| 设置 | 选择 |
|---|---|
| 模型 | Wan-3.0 Reference-to-video |
| 时长 | 6秒 |
| 分辨率 | 720P快速测试,1080P最终 |
| 参考 | 原始中间片段或第一帧 |
| 输出 | 如果<=10秒且声音不重要,使用GIF |

Atlas Cloud Wan 3.0前向扩展运行完成
第4步截图:Wan 3.0工作流中的前向扩展提示词和完成输出。

Wan 3.0前向前传扩展GIF
案例3:前向前传扩展,其中新开场旨在落在现有片段的第一帧上。
第5步:组装更长剪辑并检查连续性
现在按此顺序拼接时间线:
基础30秒 -> 延续15秒 -> 可选CTA 5-10秒
当你想要短片戏剧延续而非产品广告时,使用此提示词:
Plain1直接从前一个戏剧片段的最终帧继续。 2保持相同的两个男性角色、相同的中式房间、相同的服装、相同的桌子位置、相同的温暖室内灯光和相同的摄像机轴。 3 4创建下一个15秒。 50-5秒:角色B停顿,慢慢放下手,看向角色A,不改变位置。 65-10秒:角色A向前迈出半步,以克制的情感回应。 710-15秒:两个角色在沉默中保持紧张,摄像机稍微靠近,以角色A的反应结束。 8 9不要重新开始对话。不要改变房间、服装、面孔、年龄、发型、道具或灯光。保留前一个片段的电影感和音频氛围。
选择设置:
| 设置 | 选择 |
|---|---|
| 时间线 | 30秒基础,15秒延续,可选CTA |
| 剪辑 | 如果剪辑跳跃,添加1-2秒重叠 |
| 导出 | 将长片段保留为MP4并附带海报 |
| QA | 检查身份、运动、摄像机、声音和剪辑点 |

Wan 3.0视频扩展超过30秒连续性QA表
第5步连续性QA表:发布更长Wan 3.0剪辑前的快速检查清单。
| 检查 | 通过信号 | 常见失败 | 修复 |
|---|---|---|---|
| 身份 | 相同面孔、产品、标志 | 新面孔或变形标签 | 添加更强参考和身份锁定 |
| 运动 | 动作继续 | 循环到较早姿态 | 重述最终帧状态 |
| 摄像机 | 相同轴 | 突然角度重置 | 指定摄像机保持不变或继续 |
| 声音 | 氛围继续 | 音频重新开始 | 描述相同的声音背景 |
| 剪辑点 | 剪辑感觉有动机 | 可见跳跃 | 添加1-2秒重叠或前传 |
Wan 3.0视频扩展超过30秒变体
一旦核心工作流有效,按交付物分支。
对于60秒产品广告,使用30秒基础 + 15秒延续 + 15秒CTA或产品特写。这是最清晰的商业模式,因为最后15秒可以保持产品角度并留出负空间放置文字。
对于45秒短剧,使用30秒对话 + 15秒反应延续。手册v079.mp4案例很有用,因为场景不仅仅是“更多镜头”。它包含两个男性、固定服装、中式房间、走位、手部动作和情感张力,扩展必须保留这些。
对于前传扩展,使用现有片段作为中间部分。v083.mp4手册模式是关键思路:构建一个开场,其最后一帧与参考片段的第一帧匹配。
对于文档到视频,使用产品简介、PDF、演示文稿或网页作为基础30秒片段的规划来源。V2EX关于Wan 3.0的讨论提到,文档输入可能与30秒限制对真正商业用户同样重要,因为模型接收整个任务上下文而不仅仅是简短提示。我仍然建议将文档到视频作为基础步骤,然后使用相同最终帧方法继续。
Wan 3.0视频扩展超过30秒成本
使用每秒公式。不要凭感觉预算。
截至2026年8月24日,Atlas Cloud的models/all页面显示Wan-3.0 Text-to-video、Image-to-video和Reference-to-video从$0.05/秒起。阿里云社区列出Model Studio自己的API定价按分辨率:480P $0.05/秒,720P $0.10/秒,1080P $0.20/秒,在单独的阿里云环境中。这些不是相同的商店,因此在发布前验证你购买的页面。
| 目标输出 | 从$0.05/秒的干净计算 | 考虑重试的规划 |
|---|---|---|
| 30秒基础测试 | 约$1.50 | 规划$3.00-$4.50 |
| 45秒最终剪辑 | 约$2.25 | 规划$4.50-$6.75 |
| 60秒最终剪辑 | 约$3.00 | 规划$6.00-$9.00 |
| 1080P最终 | 检查模型层级 | 检查模型层级 |
最无聊的建议是最好的建议:以最便宜的可接受设置起草,锁定连续性,然后为最终层级花钱。
更长Wan 3.0视频的法律和使用说明
保持简短实用。
不要在商业剪辑中使用未经授权的人物、品牌标志、电影IP、音乐或声音。如果客户提供产品图像、声音参考或品牌资产,将权限记录与提示词、参考文件、生成输出和最终剪辑版本一起保存。
这对于长视频更重要,因为作品开始看起来像成品广告,而不仅仅是测试渲染。
常见问题解答
Wan 3.0一次能生成超过30秒吗?
根据当前公开资料,Wan 3.0应被视为一次原生生成最多30秒。要更长,使用延续或参考到视频片段。
如何在不丢失一致性的情况下扩展Wan 3.0视频超过30秒?
使用第一个片段的最终帧或最后1-3秒作为参考。然后编写延续提示词,重复身份、位置、摄像机轴、灯光、运动状态和声音。
应该使用哪种Wan 3.0模式进行扩展:text-to-video、image-to-video还是reference-to-video?
对于全新概念使用text-to-video,当产品或角色图像必须保持一致时使用image-to-video,当从先前片段继续时使用reference-to-video。
为什么第二个Wan 3.0片段看起来像新场景?
通常是因为第二个提示词被写成了新提示词。添加“直接从前一个片段的最终帧继续”,描述确切的结束状态,并上传更强的参考。
45秒或60秒的Wan 3.0视频成本是多少?
将生成的秒数乘以当前每秒价格,然后加上重试预算。在Atlas Cloud上,Wan 3.0模式目前从$0.05/秒起,因此45秒的干净通过在重试前从$2.25开始。
Wan 3.0可以向后扩展视频以创建开场吗?
是的,将现有片段用作中间部分,创建一个前传开场,其最后一帧落在第一帧上。这仍然是Wan 3.0视频扩展超过30秒的工作流,只是方向相反。






