Seedance 2.5 现已上线 — 首发 Atlas Cloud

Wan 3.0多模态参考可接受20个资产,其中包含PDF文件。

Wan 3.0多模态参考一次调用可处理20个资产:图片、视频、音频、PDF,甚至URL。查看阿里巴巴自己的成果以及一个你今天即可运行的工作流。

你为一段15秒的广告建了一个文件夹。两张角色静态图。客户发来的一段品牌调性视频。一本只有PDF格式的品牌手册。以及你真正想要的那位演员的声音样本。

然后你打开视频模型,它却只要求一张图片。

于是你做了所有人都会做的事。你把这个文件夹翻译成了一段800词的提示词,然后祈祷。第三镜头里,人脸飘移了。夹克颜色变了。声音也完全变成了另一个人。

Wan 3.0 的全参考是第一个让视频模型说:“好,把文件夹给我吧。”最多20个资产,单次调用,涵盖五种输入类型,通过一段连续30秒的镜头一气呵成。

这篇文章只做三件事,其余一概不提。它拆解了那20个资产到底是什么,它用阿里巴巴官方生成的片段作为证据,并给出了你今天就能运行的等效工作流,因为Wan 3.0仍在阿里巴巴自家云上公测,尚未对第三方平台开放调用。

关键要点

  • Wan 3.0 的多模态参考单次调用最多接受20个资产,涵盖图像、视频、音频、文档和实时网页,并在单个30秒镜头中保持一致性。
  • 它是首个将PDF、幻灯片或URL视为创意输入(而非需要在提示词中转述的内容)的主流视频模型。
  • Wan 3.0 于2026年8月6日在阿里云百炼和通义千问云上以 wan3.0-video 模型名进入公测。权重封闭。任何告诉你它已经是Apache 2.0的人都是在猜测。
  • 20个资产这个数字并不是它真正领先的地方。你现在就能调用的参考到视频模型已经支持超过20个资产。差距在于文档和网页,而不是数量。
  • 你可以免费使用Atlas Cloud的AI广告短剧生成器测试双角色、参考锁定、全配音的格式:输入四张产品照片,输出一段15秒的口播短剧,无需信用卡。

两只猫跑过豪华酒店走廊

两只猫在Wan 3.0生成的五个不同场景中奔跑,无角色漂移_两张参考图片。五个完全不同的场景——从酒店走廊到洗衣机滚筒,再到红色电话亭。没有一帧漂移。来源:阿里巴巴官方_ Wan 3.0创作者手册 ,2026年8月,本文中所有其它Wan 3.0片段也来自此手册。

多参考视频为何会失败,而Wan 3.0多模态参考改变了什么

视频模型在片段之间没有记忆。每次生成都从零开始。这就是整个问题的一句话概括。

所以一旦你的故事需要不止一个镜头,你就在拼接。第一个镜头给了你一张喜欢的脸。第二个镜头给了你那张脸的远房表亲。第三个镜头悄悄把夹克从枣红色改成了酒红色,等你发现时,已经付了十一次渲染的钱。

单张图片参考有所帮助,但它只能锁定一件事:一张脸。它无法同时锁定一张脸、一套服装、一个道具、一个地点和一个声音,因为只有一个位置,却有五个任务。

有两种出路。给模型更多位置,或者让它不再重新开始。Wan 3.0 同时做到了这两点,这就是为什么两个主打功能其实是一个功能。原生30秒拍摄意味着没有剪辑点让角色漂移。20个参考资产意味着每个需要固定的元素都有自己专属的位置,而不是相互争夺一个。

以下就是当无需拼接时的效果:30秒,一个连续镜头,一个坐在购物车里的孩子,最终嵌入了广告牌,然后从下面走出来。

一段完整的30秒单次生成,无剪辑,配乐也在同一轮生成中完成。来源:阿里巴巴官方Wan 3.0创作者手册。

Wan 3.0多模态参考中“20个资产”的真正含义

20是头条数字。真正重要的是,这20个并非都是同一种东西。Wan 3.0的全参考涵盖五种输入类型,每种控制输出中不同的轴。

图像控制身份。 一张角色卡、一张产品照片、一个地点图。Wan 3.0 称之为像素级一致性,在阿里巴巴自己的示例中,锁定效果甚至超出了脸部,延伸到服装:层叠的灰色长袍、束带皮甲、深色腰封,在跨越三个地点的16秒徒手打斗中始终不变。

传统中国长袍青年男子站在户外日落中

两张角色卡驱动一场武侠打斗场景,服装细节逐帧保持

两张角色卡加一张芦苇岸地点图。服装和场景在每一次投掷中都保持稳定。此处显示为静音GIF;交付文件包含44.1kHz立体声混音。来源:阿里巴巴官方Wan 3.0创作者手册。

音频控制声音。 这是“多模态”不止是营销说法的部分。你可以为每个角色附加一段声音样本,在提示词中写下台词,对话就会以那种音色返回,并且与画面同步,在同一轮生成中完成。两个人,两段声音参考,一个健身房。

两张人物图像加上两段独立的声音参考片段,对话以那两种声音返回。这段值得打开声音。来源:阿里巴巴官方Wan 3.0创作者手册。

视频控制节奏。 参考视频不是为了被复制。它是为了提供节奏:一个节拍持续多久,一个转场如何移动。在这个例子中,五个关键帧提供主体,一个参考视频提供它们之间的横向卡片翻转节奏。

女子佩戴精美传统中国头饰和蓝色刺绣连衣裙

五个关键帧通过参考视频的节奏翻转_五个_ 关键帧图像作为主体,一个参考视频提供翻转节奏。来源:阿里巴巴官方Wan 3.0创作者手册。

文档和网页控制结构。 这是真正的新功能。Wan 3.0 接受文档文件和实时URL作为创意输入,关于beta版的报道列出了 .doc.xls.ppt.pdf.txt 等接受格式(AlphaSignal,2026年8月)。同样的逻辑已经适用于分镜图:一张分镜板输入,六个镜头输出,按分镜板本身的顺序。

两个人打着伞站在雨火车站台上

一张分镜板扩展为雨火车站台上的六个连续镜头

一张分镜板作为参考,按顺序生成六个镜头,连第五个镜头中递纸条的动作都保留。来源:阿里巴巴官方Wan 3.0创作者手册。

首尾帧控制端点。 最老套的技巧,仍然支持,仍然是约束镜头的最快方式。

以下是它与大多数人目前实际使用的版本的对比。

Wan 2.7 参考到视频Wan 3.0 全参考
参考资产每个主体一张图像,最多3个视频,1个音频片段总共最多20个资产
模态图像、视频、音频图像、视频、音频、文档、网页
单次最大时长10 秒原生30秒,外加智能时长
同轮生成音频
视频编辑和扩展未公开基于指令和参考的编辑,外加扩展
可用性已在第三方API上线阿里云百炼和通义千问云beta版

有一条规则没有写进文档,但每个人都是通过吃亏才学到的:一个参考,一个任务。 Image1锁定面部和服装。Video1仅提供运动。Audio1仅提供音色。一旦你给一个资产分配两个相互冲突的任务,或者上传一张包含两个人的参考图片,模型就必须猜测,而猜测正是你试图阻止的事。阿里巴巴的手册对此也直言不讳:每张参考图片一个主体。

你今天就能运行的Wan 3.0多模态参考工作流

先直接回答。Wan 3.0 在阿里巴巴自家云上公测,模型ID为 wan3.0-video阿里巴巴Wan,2026年8月)。它尚未登陆第三方API平台,Atlas Cloud 也不例外。现在向你出售 Wan 3.0 API 访问权限的人,是在转售别的东西。

真正已经落地的是工作流形态。参考包输入,一次调用,包含声音的完成片段输出。这今天就可以在浏览器标签页中调用的参考到视频模型上运行,一旦你把它们全部排列好,20个资产这个数字看起来就不一样了。

模型参考资产模态最大时长原生音频每秒价格
Wan 3.0(阿里巴巴beta版,不在Atlas上)总共20个图像、视频、音频、文档、网页30 秒报道称按分辨率$0.05到$0.20
Wan 2.7 参考到视频每个主体1张图像,3个视频,1个音频片段图像、视频、音频10 秒$0.10
Seedance 2.5 参考到视频50个(30图像/10视频/10音频)图像、视频、音频30 秒$0.13
MiniMax H3 参考到视频混合,无明确上限图像、视频、音频15 秒$0.10
Kling Video O3 Pro 参考到视频7张图像,或4张图像+1个视频图像、视频15 秒$0.10
Vidu Q3-Mix 参考到视频4张图像图像16 秒$0.11
Veo 3.1 参考到视频3张图像图像8 秒可选$0.20

价格是Atlas Cloud截至2026年8月的费率。Wan 3.0的数据是阿里云beta版报道的数值,并非Atlas费率,且阿里巴巴尚未发布该模型的公开价格页面,因此该行视为暂定。

把这张表读两遍,真实情况就显现出来了。20个资产这个数字并不是Wan 3.0领先的地方,因为Seedance 2.5已经支持50个,并且也达到了30秒。这份列表中其他模型都不接受的是PDF。

下面的演示工作流运行在Wan 2.7参考到视频上,因为它的输入形态最接近全参考的现成版本:多个主体图像、一个可选的参考视频和一个音频片段,全部映射到提示词中的 character1character2 标签。三个模型,一个浏览器标签页,无需本地安装。

自己动手:四步构建一个多模态参考场景

场景:一个柔和的酒店前台。一位面无表情的礼宾员。一位抱着布偶猫的旅行者。礼宾员直视镜头说:“猫有预订。你没有。”

两张图片加一段音频片段,共三个资产,涉及两种模态。这是真正多模态(而非仅多图像)的最小构建方案。

步骤1:生成参考图像1,必须锁定的主体

参考图像只有三个任务,且只有三个:一个主体,面对镜头,干净背景。其他都是装饰。使用 GPT Image 2,质量设为 high,尺寸 16:9,n=1。

Plain
1一位中年酒店礼宾员的全幅工作室肖像,面无表情,正中央站立,背景为平坦的暗粉色墙壁。他身穿梅紫色双排扣礼宾制服,配有金色饰边和黄铜纽扣,头戴一顶小圆药盒帽,留着细胡子。完全对称的构图,均匀柔和的正面光,墙上无投影,35mm胶片颗粒感,柔和的粉彩调色板。仅限一个主体,无其他人、无文字、无标志、无画面道具。

AI图像生成界面,显示编号步骤和生成的礼宾员

Atlas Cloud上的GPT Image 2工作区,输出面板中呈现了礼宾员参考肖像

Atlas Cloud上的GPT Image 2:高质量,16:9,一个主体,平坦背景。该文件将成为character1。

步骤2:生成参考图像2,第二个锁定主体

相同模型,相同设置。两个角色之间的颜色对比是故意的,因为这给模型一种简单的方法,在它们共享画面时区分彼此。

Plain
1一位年轻女旅行者的全幅工作室肖像,她抱着一只毛茸茸的布偶猫贴在胸前,正中央站立,背景为平坦的芥末黄墙壁。她身穿芥末黄羊毛大衣,戴红色贝雷帽和圆形玳瑁眼镜,另一只手提着一个复古小皮箱。完全对称的构图,均匀柔和的正面光,墙上无投影,35mm胶片颗粒感,柔和的粉彩调色板。仅限一个主体,无其他人、无文字、无标志。

步骤3:生成声音参考,这是真正的多模态部分

声音片段是将这个任务从多图像任务转变为多模态任务的关键。Wan 2.7的音频插槽需要一段短样本,大约1到10秒,所以保持台词简短。使用 MiniMax Speech 2.6 HD,选择一个低沉、平淡、无动于衷的男声。

Plain
1晚上好。入住?当然。每个人都是。

步骤4:一次调用,三个参考,一个完成片段

现在整个包一起输入 Wan 2.7 参考到视频。设置:resolution: 1080Pratio: 16:9duration: 10(这是该模型的上限),prompt_extend: falseseed: -1。按顺序加载 images,步骤1在先,映射到character1,然后步骤2作为character2,并将步骤3的文件附加到 audio

Plain
1对称、正中央的广角镜头,柔和的酒店大堂前台,暗粉色墙壁,后面是芥末黄钥匙架。character1是站在前台后面的礼宾员;character2是站在前台前的旅行者,仍然抱着她的布偶猫。摄像机沿完美中心轴缓慢推进,绝不倾斜。character1直视镜头,平淡地说:“猫有预订。你没有。”character2眨了一下眼,慢慢把头转向猫,然后转回前台。猫一动不动地盯着摄像机。35mm胶片颗粒感,均匀柔和的灯光,柔和的粉彩调色板,无摄像机抖动,无剪辑。

负面提示词:

Plain
1手持抖动,跳切,字幕,屏幕上文字,水印,额外人物,变形的手,面部变形,颜色偏移,运动模糊

AI视频生成器界面截图,显示输入和输出

Atlas Cloud上的Wan 2.7参考到视频工作区,已加载两张参考图像和一个音频文件,输出面板中显示完成片段

Atlas Cloud上的Wan 2.7参考到视频:左侧附加了两张参考图像和一段音频片段,右侧以1080P和16:9播放完成片段。此截图在模型默认时长下运行;将其设置为10以获得下面的完整版本。

完成片段。两张脸都保持稳定,两套服装都保持稳定,台词以步骤3中克隆的声音说出,所以这段值得打开声音播放。

女子在酒店接待处抱着猫,身边有礼宾员

两张参考肖像与完成片段中的一帧并排,显示相同的面孔和服装

左侧为参考图,右侧为交付片段中的一帧。制服饰边、贝雷帽、眼镜和猫都完好无损地保留下来。

Wan 3.0多模态参考工作流的变体

推到30秒。 相同的参考包可以在 Seedance 2.5 参考到视频 上运行,设置 duration: 30,这样你就能获得Wan 3.0承诺的时长,而无需等待beta版。它最多接受30张参考图像、10个视频和10个音频片段,所以参考包还有扩展空间。将额外的20秒写成提示词中的节拍,而不是氛围,否则模型会填充。

AI视频生成器界面,显示输入设置和生成进度

Atlas Cloud上的Seedance 2.5参考到视频工作区,时长设置为30,正在渲染长镜头

Atlas Cloud上的Seedance 2.5参考到视频,时长设置为30,附加了相同的两张参考肖像,捕捉到生成过程中。注意提示词中的 @image1 @image2 标签:这是告诉Seedance哪个参考扮演哪个部分的方式。点击“运行”按钮前检查报价价格,因为它反映了作业实际提交的时长。

同一场景的30秒版本,相同参考包,节拍逐镜头写出。

仅添加参考视频用于运动。 附加一个你喜欢的节奏的片段,并在提示词中明确说明,例如“仅遵循参考视频的剪辑节奏,忽略其主体和场景”。这就是上面卡片翻转示例背后的技巧。

在修改正面提示词之前,先使用负面提示词修复漂移。 面部变形、颜色偏移和手持抖动是破坏参考锁定镜头的三个主要因素,通常抑制它们比描述它们更便宜。

免费尝试多模态参考格式

如果你想要这种形态的体验,但不想调整参数,Atlas Cloud上周发布了一个免费AI广告短剧生成器,它运行相同的链,但没有任何旋钮。

你只需写一行关于你的产品和卖点的文字。它会为你编写一个双角色喜剧脚本,包含钩子、冲突、转折,然后渲染一段15秒的视频,内置口播对话和音效。你可以附加最多四张真实产品照片作为参考,广告会保持它们的形状、颜色、标签和标志,从脚本到最终帧。内置六种风格,从搞笑表情包到剧情反转、情景喜剧、奢华和硬销售,对话会以你写描述的语言返回。

这就是教程中相同的双角色+参考图像+声音链,省去了提示词编写和账单。因此,这是一个很好的方式,在花费任何调优成本之前,测试这种格式是否适合你的产品。

为了了解一套参考静图对产品片段的效果,这是Wan 3.0自己对该任务的版本:五张图像输入,一个发布预告片输出,每张静图固定编辑中的一个节拍。

动画浮动堆叠的白色和薄荷绿卡片

五张参考静图扩展为Material Design风格的产品发布预告片_五张参考图像驱动一段九秒的产品影片,每张图像固定一个节拍并传递给下一个。来源:阿里巴巴官方Wan 3.0创作者手册。_

Wan 3.0多模态参考片段的成本

步骤模型单价数量成本
1和2,两张参考图像GPT Image 2每张图像 $0.0092$0.02
3,声音参考MiniMax Speech 2.6 HD每1000字符 $0.0849字符$0.00
4,10秒1080P片段Wan 2.7 参考到视频1080P每秒 $0.1510 秒$1.50
教程总计约 $1.52
变体,30秒Seedance 2.5 参考到视频480P每秒 $0.13430 秒约 $4.02
免费路线免费AI广告短剧生成器免费1个片段,15秒$0

以上是平台自身的费率,于2026年8月核实,按量付费。有两件事对总成本的影响比人们预期的更大。分辨率是第一件:对比表中的$0.10每秒是Wan 2.7的基础费率,1080P按$0.15计费,这就是上面$1.50的来源。第二件是Seedance按像素数计费,因此其列出的$0.134每秒是480P的数值,而720P片段的成本高于简单的乘法计算。作为参考,报道中Wan 3.0 beta版1080P每秒$0.20的费率,将使完整的30秒片段成本约为$6,高于今天Seedance 480P路线的成本。

关于使用这些东西的说明。 Wan 3.0 是测试版,其条款可能变化,因此在它之上构建管道之前,请重新阅读条款。如果你的参考图像是真人,请先获得他们的许可,因为参考到视频正是使这一点变得重要的能力。本文中的示例片段是阿里巴巴从其公开创作者手册中生成的官方结果,在此转载用于评论。

常见问题

Wan 3.0的多模态参考实际上可以接受多少参考?

单次调用最多20个资产,来自图像、视频、音频、文档和网页。实际限制低于技术限制。为每个资产分配恰好一个任务,每张图像一个主体,对于大多数场景,你将使用远少于20个。

Wan 3.0真的能把PDF或网页变成视频吗?

是的,这正是真正独特的部分。除了文本、图像、音频和视频之外,它还接受文档文件和实时URL,关于beta版的报道列出了 .doc.xls.ppt.pdf.txt。上面对比表中没有其他参考到视频模型接受任何文档。

Wan 3.0是开源的吗?我能在ComfyUI中运行它吗?

不,目前不行。Wan 3.0 是在阿里巴巴自家云上运行的封闭测试版。早期的Wan代是开放发布的,这就是为什么存在这种期望,但阿里巴巴尚未确认3.0的权重。声称Wan 3.0有1.3B或14B Apache 2.0版本的页面,没有任何官方依据。

Wan 3.0现在可以通过第三方API使用吗?

还没有,Atlas Cloud 也包括在内。你今天能调用到的最接近的东西是Wan 2.7参考到视频,其输入形态与全参考几乎完全匹配,除了文档和网页模态;或者如果你需要完整的30秒,可以使用Seedance 2.5参考到视频。

测试参考锁定、双角色视频的最便宜方式是什么?

上面链接的免费AI广告短剧生成器。输入四张参考照片,输出一段15秒的口播双角色片段,无需参数,无需花费。如果它适合你的产品和格式,然后再去调优付费链。

为什么即使有参考图像,我的角色仍然漂移?

三个原因,按频率排序。一个参考承担了两个任务,被要求同时固定面部和地点。参考图像中有多个人物或复杂的背景,模型不知道要锁定哪部分。或者漂移是渲染伪影,而不是参考失败,这时在负面提示词中加入 面部变形,颜色偏移,然后再修改任何东西。

最新模型

一个 API,畅享全模态 AI。

探索全部模型