
两块剪辑显示器并排播放同一沙漠加油站镜头,一块下方是完整的30秒时间线,另一块时间线被分成两段。
到了第20秒,燃油喷嘴喷出鲜嫩的绿草,还挂着水珠。马舒服地眯起眼睛。加油工的牙签从嘴里掉出来。
这个笑点只能在一个连续的30秒镜头里成立。把四个8秒的片段拼在一起,马的花色变了,墨镜形状变了,天空色温偏暖了一档,笑点也在接缝处消失了。
所以当Wan 3.0和Seedance 2.5几乎同时宣称原生30秒、一次生成、无需拼接时,这不再是一个关于基准测试的故事。这是AI视频模型第一次能在单个镜头里完成“铺垫、转折、收尾”的完整叙事。
我仔细对比了两者的规格,并根据阿里巴巴官方发布的演示文件进行了核对,发现了一个所有报道都没有提及的关键点:两者都声称支持30秒,但这30秒背后的分辨率根本不是一回事。
核心要点
- 两款模型确实都能单次生成30秒。这部分不是营销话术。Wan 3.0覆盖2到30秒,并提供智能时长选项;Seedance 2.5覆盖4到30秒。
- 只有Wan 3.0在30秒时能原生生成1080p分辨率。Seedance 2.5仅原生支持480p和720p。其1080p、1440p和4K选项都是基于720p源的后处理放大,其API文档也明确指出4K档位“并非原生4K生成”。
- Seedance 2.5在参考素材数量上胜出:最多30张图片加10个视频加10个音频文件,共50个。Wan 3.0的创作者手册将参考素材上限设为20个。
- Wan 3.0拥有一个其他模型没有的输入方式:
.doc、.xls、.ppt、.pdf、.txt文件以及实时网页,可直接作为创意参考输入。 - 目前,两者中只有一个真正能在阿里巴巴以外的平台运行。Wan 3.0在阿里云百炼和通义千问云上处于公开测试阶段,第三方API访问仍在逐步开放中。Seedance 2.5现已登陆Atlas Cloud,时长控制可直接设定为30秒。
- 想在付费之前先测试一下30秒的故事结构?Atlas Cloud的免费AI广告短剧生成器提供一次免费试用:生成一个15秒的成品广告,包含语音对话和音效,无水印下载。
阿里巴巴官方Wan 3.0演示,来自通义万相3.0创作者手册。单次拍摄,无剪辑,时长30.07秒。通过ffprobe测量:1920x1072,24fps,内置AAC立体声音频。打开声音,在第29秒能听到尾巴甩动和牙签落地的声音。此处仅作为对比和评论的参考素材。
Wan 3.0 vs Seedance 2.5 原生30秒:这个月真正发生了什么
15秒曾经是一道难以逾越的坎。Wan 2.7的极限就在那里。Seedance 2.0的极限也在那里。过去一年里你在信息流中看到的每一部“一分钟AI电影”,都是用四到八个片段在非线性编辑软件里拼接而成,再通过调色师调色来掩盖接缝。
有两个突破在同一几周内打破了这道坎。阿里巴巴于2026年8月6日开放了Wan 3.0的公开测试,支持原生30秒生成和全多模态参考输入(AlphaSignal,2026年8月)。字节跳动将Seedance 2.5的时长从15秒翻倍到30秒,明确将其定位为减少片段拼接及其带来的视觉漂移问题的方案。
“原生”在这里有特定的技术含义。它意味着对单个潜变量序列进行单次前向传播,而不是基于最后一帧的扩展——即模型取片段A的最后一帧,然后从该帧开始生成片段B。扩展是导致角色衣领在镜头之间悄悄变形的元凶。原生传播则将整个30秒置于同一个上下文中,因此马始终是同一匹马。
加油站演示是对此最清晰的测试。其结构是四个节拍:0到8秒无事发生,8到16秒发生奇怪的事,16到24秒笑点揭晓,24到30秒离场。笑点落在第20秒。这意味着只有马、墨镜、青橙色调和固定机位的平淡镜头在前19秒内保持不变,这个笑点才能成立。拼接无法做到这一点。不是因为剪辑师水平不行,而是因为片段B从未见过片段A。
Wan 3.0 vs Seedance 2.5 原生30秒:画面真正在何处崩溃
30秒是15秒的两倍。漂移的风险并非简单地翻倍,而是更严重,并且会转变为一种不同的失败模式。
拼接工作流的失败发生在片段之间。原生30秒的失败则发生在片段内部。在一次Seedance 2.5短片制作的实际操作中,评测者发现非连贯性和变形表现为“角色模型上的视觉突兀感或不稳定性”,集中在快速动作序列中,并特别指出这些瑕疵无法通过放大来消除(MindStudio,2026年8月)。这对任何打算先渲染720p再放大到4K的人来说至关重要:放大锐化了变形,而非消除它。
同一次制作记录了3.2比1的拍摄比。大约需要450秒的原始生成才能剪辑出2分22秒的最终成品。规划长镜头工作时,要像有多个机位的拍摄那样去构思,而不是像处理一个每项任务都能直接输出的渲染队列。
那次制作中还有两个发现值得直接借鉴。整个影片的视觉一致性依赖于三张参考图像(两张角色肖像和一张场景定位图),尽管系统最多可接受50张。在配音方面,写入“American”修正了意外出现的英式口音,而写入“American English”则没有效果,因为“English”这个词将发音拉回了英式。
能够支撑30秒的提示词结构,正是阿里巴巴在其官方手册中使用的:明确的时间戳节拍。不要写一段描述氛围的段落。写成 0-8s,8-16s,16-24s,24-30s,为每个部分指定其自身的镜头行为和事件,最后用一行概括整个片段的音频描述。你将在下面的步骤4中看到这个确切的框架,因为我保留了阿里巴巴的结构,仅仅进行了翻译。
Wan 3.0 vs Seedance 2.5 原生30秒:规格、价格和今日可用性
以下是当前局面的真实情况,也是两款模型不再具有可比性的部分。
请仔细阅读分辨率那一行,因为这是整篇文章的核心。Atlas Cloud 自己的 Seedance 2.5 文生视频 API 文档指出,720p-esr 是对 480p 源的增强,1080p-esr、1440p-esr 和 4k-esr 都是对 720p 源的增强,并且 4K 选项提供的是 2160 像素的短边,属于“非原生 4K 生成”。因此,一个标称为 4K 的 30 秒 Seedance 片段,实际上只有 720p 的真实细节,经过重采样。相比之下,Wan 3.0 的价格表上有一个直接的 1080p 档位,每秒 $0.20,而且阿里巴巴官方发布的 30 秒演示文件测量分辨率为 1920x1072。
这个限制的好处是:整个测试在一个浏览器标签页内完成,涉及三个模型,无需本地设置。
| 在本测试中的角色 | 模型 | 标价 |
|---|---|---|
| 开场画面 | GPT Image 2 文生图 | 从 $0.009 / 张起 |
| 原生30秒运行 | Seedance 2.5 文生视频 | 从 $0.134 / 秒起 |
标价取自 Atlas Cloud 模型页面,2026年8月验证。请将其视为底价,而非最终报价。这些模型都根据你实际请求的内容计费,运行按钮会在你点击前显示你的确切设置价格。在这个测试中,按钮对一张 GPT Image 2 图片(高质量,2048x1152)的报价是 $0.1745,对一次 5 秒的 Seedance 2.5 任务(720p,16:9)的报价是 $1.514799,这相当于大约 $0.30/秒,而不是标价 $0.134。标价是 480p 的费率。请查看按钮,而不是目录。Seedance 2.5 还提供了一个 参考素材生视频端点,价格同样是 $0.134/秒,如果你想挑战 50 个参考素材的上限的话。
如何在 Seedance 2.5 上复现这个原生30秒测试
五个步骤,三个模型,全在浏览器中完成。请逐字复制提示词。
步骤1:锁定带时间戳的30秒骨架
现在先不要运行任何东西。先阅读结构,因为这是决定你的30秒能否成立的关键。
本文开头的 Wan 3.0 加油站演示由四个带标签的区块构成,并在开头声明了一次固定镜头规则:冷静客观的观察、固定中全景、仅在荒诞节拍处使用突然的极端特写。每个事件都固定在时间范围内。音频在末尾用一行涵盖所有30秒。
这是空的骨架。填充它,你就得到了一个原生30秒模型能够真正追踪的提示词:
Plain1一个30秒的[类型片],场景设定在[地点]。[视觉风格,色调,饱和度]。镜头语言:[规则],辅以[例外]。 2 30-8秒:[铺垫,全景,建立正常世界,引入地平线上的异常] 4 58-16秒:[异常发生作用,仍以正常方式处理,插入一个主观视角或反应镜头] 6 716-24秒:[收尾,对事物本身的极端特写,硬切到反应脸部] 8 924-30秒:[离场,一个小的物理动作,作为笑点的收尾] 10 11音频:[环境音,三到四个具体的画内声音,一个最终的小声响]。无音乐,无对白,无屏幕文字。
阿里巴巴参考文件的可测量规格,供任何人核对:30.07秒,1920x1072,24fps,AAC立体声。这是衡量Seedance运行的基准。
步骤2:生成开场画面
你需要一个固定的视觉锚点,以便15秒和30秒的运行从同一个世界开始。打开 GPT Image 2 文生图。
设置: quality 为 high,aspect ratio 为 16:9,1张图片。
Plain1一个宽阔、静止的定场镜头,展示一座孤独的66号公路风格加油站,位于明亮的沙漠中。复古的黄色、橙色和蓝色建筑,油漆微微褪色;前面有一台褪色的老式红色加油泵;旁边是一家小便利店,门口有一台褪色的可乐自动售货机。前景是干裂的橙色干土,远处是温暖的赭色山脉,无云的清澈蓝绿色天空。一名加油工穿着油腻的蓝色连体工作服,戴着超大黑色墨镜,在门口的椅子上半睡半醒地懒散坐着,嘴里叼着牙签。严格的明亮青橙色色调,高饱和度,高亮度,电影级照片写实风格,固定机位,16:9。

Atlas Cloud上的GPT Image 2操作界面,质量设置为高,16:9,输出面板中显示了生成的66号公路加油站定场镜头
Atlas Cloud上的GPT Image 2:质量高,16:9,一张图片。运行按钮对此帧的报价是$0.1745,这实际上是2048x1152高质量渲染的成本。模型页面上的$0.009是底价。

用GPT Image 2生成的66号公路加油站定场镜头,蓝绿色天空和橙色干裂土地,加油工在门口打盹
开场画面。这是步骤3的输入和步骤4的视觉目标。使用 openai/gpt-image-2 生成。
步骤3:冲击15秒之墙
设置: first frame = 你的步骤2输出,duration 拖拽到最大值 15,resolution 为 1080P。
Plain1固定中景镜头保持。一名戴宽檐帽的女牛仔骑着真马从地平线缓缓走来。打盹的加油工被马蹄声惊醒,推了推墨镜,坐直身子,嚼着牙签,一脸不屑。她利落地翻身下马,牵着马径直走向老式加油泵。明亮的青橙色色调,高饱和度,照片写实,冷静的观察镜头,无剪辑。
下拉菜单停在15秒。这就是这一步的全部意义。你的笑点预计在第20秒,而这个流程无法在不中断的情况下到达第20秒。要到达那里,你需要从最后一帧生成第二个片段,而一旦你这么做,马就变成了一匹新马。

步骤4:运行完整的原生30秒生成
设置: duration = 30,resolution = 720p,ratio = 16:9,generate_audio = 开启,output_format = mp4,水印关闭。
特意选择720p,而不是 1080p-esr。720p是模型的真实上限,所以这是像素对像素的直接比较,而不是与放大器的比较。
下面的提示词忠实地翻译自阿里巴巴的加油站演示提示词,来自Wan 3.0创作者手册,并重新组织成纯文本结构。相同的节拍,相同的时机,相同的镜头规则,相同的音频列表。
Plain1一个30秒的荒诞冷面喜剧短片,场景设定在明亮沙漠中一座被阳光晒褪色的66号公路风格加油站。照片写实,严格的明亮青橙色色调,高饱和度和高亮度,使得荒诞事件发生在一个完全正常、近乎美好的世界中。镜头语言:冷静、客观的观察,主要是固定的中全景和缓慢的横向平移,没有情感引导,在荒诞节拍处辅以突然的极端特写。 2 30-8秒:全景,固定。蓝绿色天空,飘浮的尘土。复古的黄橙蓝三色加油站孤零零地坐落在路边;一名穿着油腻蓝色连体工作服、戴着巨大黑色墨镜的加油工在椅子上打盹,嘴里叼着牙签。只有风声。地平线上,一名女牛仔骑着真马缓缓走来。切到中景:马蹄声惊醒了他,他推了推墨镜,坐直身子,把这组合解读为“又一个问路的”。 4 58-16秒:她一言不发。她利落地翻身下马,牵着马径直走向老式加油泵。马随意地把头凑到加油泵旁边,好像以前做过一样。从他的墨镜后面短暂地出现一个略微鱼眼效果的视角,女人和马看起来更奇怪了。特写:他皱起眉头,摘下墨镜,正要喊叫。慢动作特写:当墨镜摘下时,她将燃油喷嘴对准马的嘴,扣动了扳机。 6 716-24秒:喷嘴的极端特写。喷出来的不是汽油,而是几股鲜嫩的亮绿色草,还挂着水珠。硬切到加油工脸部的极端特写,僵住了:眼睛瞪得像铜铃,嘴巴微张,牙签忘在嘴里。中景:马开心地吃着,舒服地眯起眼睛,然后满意地用力甩了一下尾巴,扬起的尘土正好落在仍然目瞪口呆的加油工脸上。 8 924-30秒:草“加满了”。她把喷嘴挂回油泵,从口袋里掏出硬币,走到商店门口,叮当作响地扔进柜台上的一个锡罐里。她回头看了一眼吓呆的加油工;帽檐下,她的嘴角微微上扬。她重新上马,在一片尘土中骑马离去。镜头缓缓推向加油工:同样的僵硬姿势,脸上沾满尘土,墨镜还捏在手里,最后,牙签从他嘴里掉落,发出微小的咔哒声。 10 11音频:全程干燥的沙漠风声,马蹄声,油泵手柄的机械撞击声,湿润的草地喷射声,尾巴甩动声,硬币落入锡罐声,以及牙签撞地时一声微小的咔哒声。无音乐,无对白,无屏幕文字。
一个可以帮你避免浪费账单的警告,和步骤3是同一个陷阱:拖拽时长滑块到30,不要在数字框中输入30。 输入框可能会显示30,但滑块可能停留在5秒的默认值上,运行按钮会按5秒报价。在点击之前检查报价。在720p和16:9下,一个5秒的任务报价为$1.514799,因此一个真正的30秒任务报价大约是这个数字的六倍。
这一步没有完成的运行截图。三次自动截图尝试都提交了滑块默认值,而不是30秒。为了避免展示一个标为30秒的5秒片段,这里省略了截图。上面的提示词和设置正是你需要粘贴和设定的内容。
步骤5:诚实地评估漂移
以下是基于完全相同的提示词,在Seedance 2.5上原生30秒生成的片段,720p,16:9,音频开启。
Seedance 2.5,完全复制了相同的Wan 3.0加油站提示词:原生30秒一次生成,1280x720,24fps,内置音频。相同的四个节拍,女牛仔和马到达,燃油喷嘴的噱头,加油工认知失调的特写。将其与顶部的Wan 3.0片段并列放置,进行直接比较。
将两个片段并排放置,检查五个具体项目。不要检查“哪个看起来更好”,那是审美争论,会浪费你的下午。
- 外套和服装一致性。 第29秒的马和第6秒的马颜色相同吗?墨镜摘下来又放回手里后,形状一样吗?
- 色调稳定性。 采样第2秒和第28秒的天空。青橙色调在长时间生成中比人们预期的更常偏暖。
- 第20秒的物理动作。 从燃油喷嘴喷出草是对物理效果的考验。它是带着重量弧线落下,还是像纹理一样淡入?
- 镜头纪律。 提示词要求固定机位。数一下镜头在没有被要求的情况下,自行发明了多少次推进。这是长时间生成中最常见的失败:模型用完了预定事件,用运动来填充时间。
- 快速运动中的变形。 尾巴甩动和尘土飞扬是片段中运动最快的部分。根据MindStudio的制作笔记,这恰恰是非连贯性集中的地方,也是放大无法修复的地方。
根据这五点打分,而不是凭感觉。这是一个你可以向客户辩护的比较。
另外三个Wan 3.0 vs Seedance 2.5原生30秒匹配提示词
一个演示只是轶事。以下是来自同一手册的另外三个官方Wan 3.0 30秒文件,每个都针对30秒问题的不同方面。对于海怪和黑暗奇幻独白,Seedance 2.5 的片段是在相同提示词下原生30秒生成的,并紧随其后嵌入,以便你可以同时观看,而不是只听我讲述。
| 提示词 | 压力测试内容 | Wan 3.0 官方文件,测量结果 | Seedance 2.5 相同提示词片段 |
|---|---|---|---|
| 海怪灾难片 | 30秒内包含10个脚本镜头加管弦乐配乐 | 1920x1072, 24fps, 30.07s, AAC | 在30秒生成,嵌入下方;移除了一个IP名称和船品牌文字以通过Seedance的内容过滤器,故事板其他部分相同 |
| 黑暗奇幻英文独白 | 原生英语配音和唇形同步,伴随缓慢持续推进 | 1280x720, 24fps, 30.05s, AAC | 在30秒从提示词逐字生成,嵌入下方 |
| 2D体育动漫,两行提示词 | 模型能否在几乎没有指令的情况下填满30秒 | 1280x720, 24fps, 30.05s, AAC | 此处未生成;以仅Wan的画面网格展示,以读取跨时间的结构 |
| 甩镜头喜剧短片(排除) | 8个甩镜头和8个情感节拍,不通过剪辑 | 1280x720, 24fps, 30.04s, AAC | 未运行:对白密度是普通话特有的,英文改写后无法进行公平的直接比较 |
官方Wan 3.0演示:在一个30秒的片段内包含十个脚本镜头和完整的管弦乐构建,分辨率为1920x1072。这是原生1080p最有力的论据,因为水量和生物湿皮肤细节正是720p放大所“发明”而非“解决”的。来自阿里巴巴通义万相创作者手册,用于比较和评论。
Seedance 2.5,相同的十个镜头灾难提示词,原生30秒,开启声音。风暴中颠簸的渔船,惊恐的甲板水手,涌起的巨浪,然后深海巨兽在闪电中破水而出。移除了一个IP参考和船体上的品牌文字以通过Seedance的内容过滤器;故事板其他部分相同,这使得水量和湿皮肤细节的对比成为与上方Wan 3.0片段公平的直接比较。
官方Wan 3.0演示,开启声音。原生英语反派对白,“足够成熟,可以坠入虚空了”,在一次缓慢的向上倾斜中完成,无剪辑。这是英语团队应该测试的片段,因为配音、唇形同步和一个30秒的连续镜头运动必须同时保持稳定。
Seedance 2.5,完全相同的黑暗奇幻提示词,原生30秒,开启声音。相同的紫眼反派,星符文标记,在他张开的手掌中形成的阴影星云,以及两行英文台词。观察唇形同步和单一的连续推进是否像Wan 3.0一侧那样在整个30秒内保持稳定。
如果你运行匹配的Seedance 2.5这一侧,请逐字保留两行英文台词,并记住制作笔记中的口音问题:写“American”,而不是“American English”。“English”这个词会把发音拉回英式读法。
第三个是安静的惊喜。阿里巴巴手册中的2D体育动漫提示词只有两行。没有时间戳,没有镜头列表,只有一个拳击手在打沙袋,疲惫,痛苦。从这样的提示词生成30秒,是对模型能否自行发明结构的真正考验。以下是它在自身时长内的采样:

来自官方Wan 3.0 2D体育动漫演示的四帧,大约在第1、10、20和29秒采样,展示了拳击手的设计和健身房背景在整个30秒内的变化
来自官方Wan 3.0 2D体育动漫演示的四帧,大约在第1、10、20和29秒采样。相同的角色设计,相同的背心,相同的沙袋,相同的储物柜排,从全景到特写的变化是提示词从未要求的。这里使用静止帧网格而非视频片段,因为比较的是单一文件内部跨时间的一致性,而非运动。
实际解读:使用两行提示词,模型自行发明了镜头覆盖,从一个固定的全景移动到汗水和疲惫的特写,并在过程中保持了角色设计。这是好消息。代价是你放弃了控制事件发生的时间。如果你需要30秒在特定秒数出现特定节拍,请写上时间戳。
在付费前免费测试原生30秒叙事
Seedance 2.5上一个30秒720p的运行,按实际分辨率而非目录底价计算,报价约为9美元。Wan 3.0价格表上30秒1080p运行是6.00美元。按制作标准来说都不算贵,但考虑到3.2比1的拍摄比,你买的不是一个片段,而是三到四个。
在花钱之前,值得回答一个更便宜的问题:我的剧本真的能作为一个连续的镜头成立吗?大多数30秒的失败不是模型失败,而是结构失败——三个节拍挤在只能容纳两个的空间里,或者一个写在第26秒的收尾,却没有任何东西支撑第8到第20秒。
Atlas Cloud的免费AI广告短剧生成器可以免费回答这个问题。你提供一个产品描述和最多四张产品照片(每张小于8MB),选择六种风格之一(搞笑梗、剧情反转、情景喜剧、暖心、奢华或硬推销),它会先写一个包含两个角色的剧本,包含一个3秒钩子、一个冲突和一个反转,然后围绕这个剧本构建每一个镜头。角色会说出他们的台词,音效也会渲染到视频中。
诚实的限制:它是15秒,不是30秒,你需要登录,并且在充值之前只能获得一次免费生成。但一个包含钩子、冲突和反转的15秒剧本,可以告诉你你的三个节拍是否呼吸顺畅。如果结构在那里成立,就把相同的节拍拿出来,拉伸到步骤1中的 0-8s / 8-16s / 16-24s / 24-30s 骨架里,然后去花那9美元进行真正的原生30秒生成。
Wan 3.0 vs Seedance 2.5 原生30秒片段的实际成本
| 设置 | 费率 | 时长 | 一个片段 |
|---|---|---|---|
| Wan 3.0,1080p 原生(仅限阿里云) | $0.20 / 秒 | 30秒 | $6.00 |
| Wan 3.0,720p 原生(仅限阿里云) | $0.10 / 秒 | 30秒 | $3.00 |
| Wan 3.0,480p 原生(仅限阿里云) | $0.05 / 秒 | 30秒 | $1.50 |
| Seedance 2.5,720p 原生,在 Atlas Cloud 上 | $0.30 / 秒(720p 实测),标价从 $0.134 起 | 30秒 | 约 $9.09 |
| GPT Image 2 开场画面,高质量,2048x1152 | 标价从 $0.009 / 张起 | 1张图片 | 报价 $0.1745 |
真正决定性的比较:Wan 3.0在720p下每秒比Seedance 2.5在720p下更便宜,而在1080p下,它是两者中唯一出售真实像素的。Seedance 2.5的回应是50个参考素材槽位、即时可用性以及一个你今天下午就可以对接使用的API。
这些原生30秒片段的来源和许可说明
本文中的每一个Wan 3.0片段和每一个Wan 3.0提示词均来自阿里巴巴公开发布的《通义万相3.0创作者手册》,此处用于比较和评论,已注明出处,未经修改且未去除水印。Seedance 2.5输出的商业用途受字节跳动和火山引擎的条款约束;Atlas Cloud 侧的API计费和数据处理受Atlas Cloud自身条款约束。本测试中未使用任何真实人物的肖像。如果你为客户交付作品,请阅读你所调用的特定端点的模型条款,而非博客总结。
常见问题解答
Wan 3.0的原生30秒真的是单次生成,还是拼接的片段?
单次生成。Wan 3.0在单次生成中产生2到30秒,并带有智能时长选项,因此它也可以决定片段不需要完整的30秒。这与基于最后一帧的扩展不同,在扩展中,第二个片段从第一个片段的最后一帧开始生成,身份会在接缝处漂移。
在30秒时,哪个是真正的1080p,Wan 3.0还是Seedance 2.5?
Wan 3.0。它的价格表上有原生1080p档位,阿里巴巴自己的30秒演示文件测量为1920x1072。Seedance 2.5仅原生生成480p和720p;其1080p、1440p和4K选项是对720p源的增强,其API文档将4K档位描述为“非原生4K生成”。
画面在第25秒还会崩溃吗?
有可能,但失败形式改变了。不再是片段之间的可见接缝,而是镜头内部的变形和非连贯性,集中在快速运动段落,并且放大无法消除。一个已记录的Seedance 2.5短片制作项目运行了3.2比1的拍摄比,因此规划长镜头时要准备备用镜头。
哪个模型能接受更多参考素材?
Seedance 2.5,遥遥领先:30张图片加10个视频加10个音频文件,共50个,其中参考视频和音频每个请求的总时长上限为30秒。Wan 3.0的手册将参考素材上限设为20个,但它是唯一一个接受 .pdf、.ppt、.xls、.doc、.txt 文件和实时网页作为创意输入的模型。
Wan 3.0会开源吗?
没有官方承诺。截至2026年8月的公开测试版,尚未发布任何Wan 3.0权重、Hugging Face检查点或ComfyUI节点,官方旗舰视频模型的开源权重止步于Wan 2.2(Kingy AI,2026年8月)。请将你读到的任何关于3.0权重发布的说法视为猜测,直到阿里巴巴另有说明。






