
最新更新: Wan 3.0 已于2026年8月24日正式上线。
两台并排的剪辑显示器播放着相同的沙漠加油站镜头,一台下方有一条完整的30秒时间线,另一台的时间线则分为两段
在第20秒时,加油枪喷出新鲜翠绿的青草,还挂着水珠。马眯起眼睛,一脸惬意。加油站服务员嘴里的牙签掉了下来。
这个笑点只有在连续30秒的长镜头里才能成立。如果把四个8秒的片段拼在一起,马的颜色会变,太阳镜的形状会变,天空的色温会偏暖一级,而笑点也会在衔接处消失。
因此,当Wan 3.0和Seedance 2.5在同一时间窗口内宣称原生30秒、一次生成、无需拼接时,这就不再只是一个基准测试的故事。它标志着AI视频模型首次能够在单一镜头内承载一个铺垫、一个转折和一个收尾。
我拆解了规格,对照阿里巴巴官方发布的演示文件进行了检查,并发现了一个几乎所有报道都忽略的问题:两个模型都说30秒,但在这30秒背后的分辨率,根本不是同一回事。
核心要点
- 两个模型确实都能在一次生成中产出30秒。这部分不是营销噱头。Wan 3.0支持2到30秒,带有智能时长选项;Seedance 2.5支持4到30秒。
- 只有Wan 3.0能在30秒时提供原生1080p。Seedance 2.5仅原生生成480p和720p。其1080p、1440p和4K选项都是基于720p源进行后期放大,其API文档也明确指出4K档位“非原生4K生成”。
- Seedance 2.5在参考素材数量上胜出:最多30张图片加10段视频加10个音频文件,共50个。Wan 3.0的创作者手册将参考素材上限设为20个。
- Wan 3.0拥有一个其他模型没有的输入:
.doc、.xls、.ppt、.pdf、.txt文件以及实时网页,可直接作为创意参考输入。 - 目前只有其中一个模型可以在阿里巴巴之外运行。Wan 3.0在阿里云模型工作室和Qwen Cloud上处于公测阶段,第三方API访问仍在逐步开放中。Seedance 2.5已在Atlas Cloud上线,时长控制支持30秒。
- 想在为30秒故事结构付费之前先进行压力测试?Atlas Cloud的免费AI广告短剧生成器提供一次免费试用:生成一个15秒的成品广告片段,包含语音对话和音效,无水印下载。
阿里巴巴官方Wan 3.0演示,来自通义万相3.0创作者手册。单次拍摄,无剪辑,30.07秒。经ffprobe测量:1920x1072,24fps,内嵌AAC立体声音频。请打开声音,在29秒处听尾巴甩动和牙签落地的声音。此处仅作为比较和评论的参考材料。
Wan 3.0 与 Seedance 2.5 原生30秒:本月真正发生了什么变化
十五秒曾是长期以来的瓶颈。Wan 2.7止步于此。Seedance 2.0止步于此。过去一年里你在信息流中看到的每一部“一分钟AI电影”,都是由四到八个片段在非线性编辑软件中拼接而成,再通过调色师的一轮处理来掩盖接缝。
有两件事在同一时间段内打破了这一瓶颈。阿里巴巴于2026年8月6日开放了Wan 3.0公测,支持原生30秒生成和完整的多模态参考输入(AlphaSignal,2026年8月)。字节跳动则将Seedance从15秒翻倍至30秒,推出了2.5版本,明确将其定位为减少片段拼接及由此产生的视觉漂移的方法。
“原生”在这里具有特定的技术含义。它意味着对单个潜在序列进行一次正向传递,而不是所谓的“末帧延展”——即模型先获取片段A的最后一帧,再以此为基础生成片段B。延展方式是导致角色外套领口在不同镜头间悄悄变形的元凶。而原生传递将整个30秒置于同一上下文中,因此马始终是同一匹马。
加油站演示是检验这一点的最纯粹测试。其结构包含四个节拍:0到8秒无事发生,8到16秒出现一些奇怪的事情,16到24秒是笑点,24到30秒是收尾。笑点出现在第20秒。这意味着,只有马、太阳镜、青橙色调以及面无表情的固定镜头,都完好无损地坚持到第19秒,这个笑点才能成立。拼接无法做到这一点。不是因为剪辑师水平差,而是因为片段B从未见过片段A。
Wan 3.0 与 Seedance 2.5 原生30秒:画面究竟在哪里崩溃
三十秒是十五秒的两倍。漂移的风险并非简单翻倍,而是更糟,并且会转向不同的失败模式。
拼接工作流的失败发生在片段之间。原生30秒的失败则发生在片段内部。在一次Seedance 2.5短片制作的实操中,评测者发现,在快速动作序列中,去相干和变形表现为“角色模型的视觉刺突或不稳定性”,并特别指出这些伪影无法通过放大来消除(MindStudio,2026年8月)。这一点对于任何计划以720p渲染再放大到4K的人来说至关重要:放大只会锐化变形,而不是消除它。
同一制作记录了一个3.2比1的拍摄比率。即大约需要生成450秒的原始素材,才能剪辑出2分22秒的最终成品。请像对待有覆盖镜头的拍摄一样规划长镜头工作,而不是像对待每个任务都能出片的渲染队列。
该制作中还有两个发现值得直接借鉴。整部影片的视觉识别仅依赖于三张参考图像:两张角色肖像和一张场景图,尽管系统接受多达50个参考。在配音选角方面,输入“American”能修正意外的英式口音,而输入“American English”则不行,因为“English”这个词会促使发音向英式靠拢。
能够在30秒内保持稳定的提示词结构,正是阿里巴巴在其官方手册中使用的:明确的时间戳节拍。而不是一段氛围描述。请写成 0-8s、8-16s、16-24s、24-30s,为每个段落指定独立的镜头行为和事件,并以一条覆盖整个片段的音频线结尾。你将在下面的步骤4中看到这个精确的框架,因为我保留了阿里巴巴的结构,仅进行了翻译。
对于当前可运行的托管服务,请在发布工作流之前,打开 Atlas Cloud上的Wan 3.0,并使用类似下面的提示词进行测试。

Wan 3.0 与 Seedance 2.5 原生30秒:规格、价格及当前可运行的内容
以下是当前的真实情况,也是两个模型不再具有可比性的部分。
请仔细阅读分辨率这一行,因为它是整篇文章的核心。Atlas Cloud自己的 Seedance 2.5 文生视频 API文档明确指出,720p-esr 是对480p源的增强,1080p-esr、1440p-esr 和 4k-esr 都是对720p源的增强,并且4K选项提供的是2160像素短边,“非原生4K生成”。因此,一个标记为4K的30秒Seedance片段,实际细节仅为720p,是经过重采样得到的。相比之下,Wan 3.0的价格表上有一个直接的1080p档位,价格为每秒钟0.20美元,而阿里巴巴官方发布的30秒演示文件测量尺寸为1920x1072。
这种限制的优点是:整个测试可以在一个浏览器标签页内,使用三个模型完成,无需任何本地设置。
| 在本测试中的角色 | 模型 | 标价 |
|---|---|---|
| 开场画面 | GPT Image 2 文生图 | 从 $0.009 / 张起 |
| 原生30秒运行 | Seedance 2.5 文生视频 | 从 $0.134 / 秒起 |
标价已于2026年8月在Atlas Cloud模型页面验证。请将其视为起步价而非最终报价。每个模型都根据你实际请求的内容收费,而“运行”按钮会在你点击前显示你具体设置的价格。在本测试中,该按钮为一张质量高、尺寸为2048x1152的GPT Image 2画面报价0.1745美元,为一个5秒、720p、16:9的Seedance 2.5任务报价1.514799美元,这大约相当于每秒0.30美元,而非标价上的0.134美元。标价是480p的费率。请检查按钮,而不是目录。Seedance 2.5还提供 参考转视频端点,价格相同,为每秒0.134美元,如果你想挑战50个参考的上限。
如何在Seedance 2.5上复现这个原生30秒测试
五个步骤,三个模型,全部在浏览器中完成。请逐字复制提示词。
第一步:锁定带时间戳的30秒框架
现在先不要运行任何东西。首先阅读结构,因为这部分决定了你的30秒是否能够保持稳定。
本文顶部的Wan 3.0加油站演示由四个标有标签的段落组成,并在开头声明了一次固定的镜头原则:冷静客观的观察,锁定的中全景,仅在荒诞节拍处使用突然的大特写。每个事件都固定在时间范围内。音频在结尾用一行描述覆盖整个30秒。
以下是空白的框架。填充它,你就得到了一个原生30秒模型能够真正追踪的提示词:
Plain1一个30秒的[类型]发生在[地点]。[视觉风格,色调,饱和度]。镜头语言:[原则],以[例外]作为点缀。 2 30-8秒:[铺垫,远景,建立正常世界,在远方引入异常] 4 58-16秒:[异常发生,仍被视为正常,插入一个视角或反应镜头] 6 716-24秒:[收尾,对事物本身的大特写,硬切到反应面部] 8 924-30秒:[收场,一个小的物理动作结束笑点] 10 11音频:[环境音,三到四个具体的画内声音,最后一个小声音]。无音乐,无对话,无屏幕文字。 12
阿里巴巴参考文件的可测量规格,供任何想核对数据的人参考:30.07秒,1920x1072,24fps,AAC立体声。这是Seedance运行所要与之比较的基准。
第二步:生成开场画面
你需要一个固定的视觉锚点,这样15秒和30秒的运行可以从同一个世界开始。打开 GPT Image 2 文生图。
设置: 质量 高,宽高比 16:9,1张图片。
Plain1一个宽阔、绝对静止的定场镜头,展现一座孤零零的66号公路风格加油站,位于明亮的沙漠中。复古的黄橙蓝相间建筑,油漆微微褪色;前面有一台褪色的复古红色加油泵;旁边是一家小便利店,门口有一台褪色的可乐自动售货机。前景是干裂的橙色土地,远处是温暖的赭色山脉,晴朗无云的青色天空。一名加油站服务员穿着油腻的蓝色工作服,戴着巨大的黑色太阳镜,在门口的椅子上半睡半醒,嘴里叼着牙签。严格的明亮青橙色调,高饱和度,高亮度,电影级写实,固定镜头,16:9。 2

Atlas Cloud上的GPT Image 2 工作区,质量设置为高,16:9,输出面板中显示了生成的66号公路加油站定场镜头
Atlas Cloud上的GPT Image 2:质量高,16:9,一张图片。“运行”按钮为此帧报价0.1745美元,这正是2048x1152高质量渲染的实际成本。模型页面上的0.009美元是起步价。

使用GPT Image 2生成的66号公路加油站定场帧,青色天空和橙色干裂土地,服务员在门口打盹
开场画面。这是步骤3的输入和步骤4的视觉目标。使用 openai/gpt-image-2 生成。
第三步:达到15秒的瓶颈
设置: 首帧 = 你的步骤2输出,时长 拖到最大值 15,分辨率 1080P。
Plain1锁定的全景镜头保持不动。一位戴着宽檐帽的女牛仔骑着一匹真马,以步行速度从地平线出现。打盹的服务员被马蹄声惊醒,推了推太阳镜,坐直身体,嚼着牙签,一脸不以为然。她利落地翻身下马,牵着马径直走向那台复古加油泵。明亮的青橙色调,高饱和度,写实风格,冷静的观察镜头,无剪辑。 2
下拉菜单停在15秒。这正是这一步的全部意义所在。你的笑点预定在第20秒,而这个管道无法完整地到达第20秒。要到达那里,你需要从最后一帧生成第二个片段,而一旦你这么做,马就变成了一匹新的马。

第四步:运行完整的原生30秒
设置: 时长 = 30,分辨率 = 720p,比例 = 16:9,生成音频 = 开启,输出格式 = mp4,水印关闭。
特意选择720p,而不是 1080p-esr。720p是模型真正的上限,因此这是像素对像素的直接比较,而不是与放大器的比较。
下面的提示词是阿里巴巴自己的加油站演示提示词,忠实地从Wan 3.0创作者手册翻译而来,并重组为无格式文本。相同的节拍,相同的时序,相同的镜头原则,相同的音频列表。
Plain1一个30秒的荒诞冷面喜剧短片,发生在明亮的沙漠中一座褪色的66号公路风格加油站。写实风格,严格的明亮青橙色调,高饱和度和高亮度,使荒诞事件发生在一个完全正常、几乎美丽的场景中。镜头语言:冷静、客观的观察,大部分是锁定的中全景和缓慢的横向移动,没有情绪引导,在荒诞节拍处突然插入大特写。 2 30-8秒:全景,锁定。青色天空,飘动的尘土。复古的黄橙蓝相间加油站孤零零地矗立在路边;一名穿着油腻蓝色工作服、戴着巨大黑色太阳镜的服务员在椅子上打盹,嘴里叼着牙签。只有风声。在地平线上,一位女牛仔骑着一匹真马以步行速度出现。切到中景:马蹄声惊醒了他,他推了推太阳镜,坐起来,把这两人解读为“又是来问路的”。 4 58-16秒:她一言不发。她利落地翻身下马,牵着马径直走向那台旧加油泵。那匹马随意地把头放在加油泵旁边,像是做过无数次一样。通过他太阳镜后方的一个短暂鱼眼视角,女人和马看起来更加怪异。特写:他皱起眉头,摘下太阳镜,正要喊叫。慢动作特写:当他摘下眼镜时,她将加油枪对准马的嘴,扣动了扳机。 6 716-24秒:加油枪的大特写。喷出来的不是汽油,而是新鲜翠绿的青草,还挂着水珠。硬切到服务员面部的大特写,僵住了:眼睛瞪得像铜铃,嘴巴微微张开,牙签悬在嘴里忘了嚼。中景:马开心地吃着,眯起眼睛,一脸惬意,然后满足地、有力地甩了一下尾巴,扬起的尘土正好落在仍然目瞪口呆的服务员脸上。 8 924-30秒:“加满了”草。她将加油枪挂回泵上,从口袋里掏出几枚硬币,走向商店门口,当啷一声扔进柜台上的一个锡罐里。她回头看了一眼吓呆的服务员;帽檐下,她的嘴角微微上扬。她重新上马,在一片尘土中骑马离去。镜头慢慢推进到他身上:保持同样的僵硬姿势,满脸尘土,太阳镜还捏在手里,最后,牙签从他嘴里掉了下来,发出轻微的咔哒声。 10 11音频:贯穿始终的沙漠干燥风声,马蹄声,油泵手柄的机械咔哒声,青草喷射声,尾巴甩动声,硬币落入锡罐声,以及牙签落地时的一声轻微咔哒声。无音乐,无对话,无屏幕文字。 12
一个可以帮你省下一笔浪费的费用的警告,与步骤3中的陷阱相同:将时长滑块拖到30,不要在数字框中输入30。 数字框会愉快地显示30,而滑块可能仍停在默认的5秒上,那么“运行”按钮会按5秒来报价。在点击之前检查报价。在720p和16:9下,一个5秒的任务报价1.514799美元,因此一个真正的30秒任务报价大约是这个数字的六倍。
这一步没有成品运行的截图。三次自动捕获尝试都提交了滑块默认值而非30秒,为了避免向你展示一个标注为30秒的5秒片段,此处省略了截图。以上提示词和设置是你要粘贴和设置的内容。
第五步:诚实地分析漂移
以下是该精确提示词在Seedance 2.5端的表现,以原生30秒、720p、16:9、音频开启生成。
Seedance 2.5,完全复制了Wan 3.0加油站演示的提示词:一次生成原生30秒,1280x720,24fps,内嵌音频。相同的四个节拍,女牛仔和马到来,加油枪的梗,服务员认知失调的特写。将其与顶部的Wan 3.0片段并排放置,进行像素对像素的对比。
将两个片段并排放置,检查五个具体方面。不要检查“哪个看起来更好”,那是品味之争,只会浪费你的下午时间。
- 毛色和服装的一致性。 第29秒的马和第6秒的马是同一颜色吗?太阳镜摘下后放回手里时,形状是否保持不变?
- 色调稳定性。 在第2秒和第28秒分别采样天空。青橙色调在长时间生成中往往比人们预期的更偏暖。
- 第20秒的物理节拍。 从加油枪里喷出草是一个物理请求。它是否带着重量呈弧线落下,还是作为纹理淡入?
- 镜头纪律。 提示词要求锁定镜头。统计镜头在未经请求的情况下“推近”的次数。这是长时间生成中最常见的失败:模型用完了预定事件,便用运动来填充时间。
- 快速运动变形。 尾巴甩动和扬尘是片段中最快的运动。根据MindStudio的制作笔记,这正是去相干集中的地方,也是放大无法修复的地方。
用这五项来评分,而不是凭感觉。这是一个你可以向客户辩护的对比。
另外三个Wan 3.0与Seedance 2.5原生30秒的匹配提示词
一个演示只是一个例子。以下是来自同一官方手册的另外三个Wan 3.0 30秒文件,每个都针对30秒问题的不同部分进行压力测试。对于海怪和黑暗奇幻独白,Seedance 2.5端使用相同的提示词以原生30秒生成,并直接嵌入在各自之后,这样你可以同时观看,而不必只相信我的描述。
| 提示词 | 压力测试内容 | Wan 3.0 官方文件,测量值 | Seedance 2.5 端,相同提示词 |
|---|---|---|---|
| 海怪灾难片 | 10个脚本化镜头加一个管弦乐配乐,全部在30秒内 | 1920x1072, 24fps, 30.07s, AAC | 以30秒生成,嵌入下方;移除了一个IP名称和船体品牌文字以便通过Seedance的内容过滤器,分镜稿其他部分完全相同 |
| 黑暗奇幻英语独白 | 在缓慢连续的推近镜头中实现原生英语配音和口型同步 | 1280x720, 24fps, 30.05s, AAC | 以提示词逐字生成,嵌入下方 |
| 2D体育动漫,两行提示词 | 模型能否在几乎没有指令的情况下填充30秒 | 1280x720, 24fps, 30.05s, AAC | 未在此生成;以仅Wan的帧网格展示,以阅读随时间变化的结构 |
| 甩镜头喜剧短片(已排除) | 8个甩镜头和8个情感节拍,无剪辑 | 1280x720, 24fps, 30.04s, AAC | 未运行:对话密度为中文特有,英文改写无法做到公平的像素级对比 |
官方Wan 3.0演示:在单个30秒内完成10个脚本化镜头和完整的管弦乐铺垫,分辨率为1920x1072。这是原生1080p最有力的论据,因为水量和生物湿润皮肤细节正是720p放大所捏造而非解析的内容。阿里巴巴通义万相创作者手册,用于比较和评论。
Seedance 2.5,相同的10镜头灾难提示词,原生30秒,请打开声音。暴风雨中的渔船,惊恐的甲板水手,涌起的巨浪,然后深海巨兽在闪电中破水而出。移除了一个IP参考和船体品牌文字以便通过Seedance的内容过滤器;分镜稿其他部分完全相同,这使得水量和湿润皮肤细节成为与上方Wan 3.0片段进行公平像素级对比的基础。
官方Wan 3.0演示,请打开声音。原生英语反派独白,“足够成熟,可以投入虚空”,在单次缓慢上摇镜头中完成,无剪辑。这是英语团队应该测试的片段,因为语音、口型同步和30秒连续镜头运动必须同时保持稳定。
Seedance 2.5,完全复制相同的黑暗奇幻提示词,原生30秒,请打开声音。相同的紫眼反派,星符文印记,在他张开的手掌中形成的阴影星云,以及两行英语台词。观察口型同步和单次连续推近镜头是否像Wan 3.0端一样在整个30秒内保持稳定。
如果你运行这个匹配的Seedance 2.5端,请逐字保留两行英语台词,并记住制作笔记中的口音古怪之处:输入“American”,而不是“American English”。“English”这个词会促使发音向英式靠拢。
第三个是意料之外的惊喜。阿里巴巴手册中的2D体育动漫提示词只有两行。没有时间戳,没有镜头列表,只有一个拳击手在击打沙袋,疲惫而痛苦。从这样简单的提示词产生30秒,是对模型能否自行创造结构的真正考验。以下是它在其运行时间内的采样:

官方Wan 3.0 2D体育动漫演示的四帧,分别在大约1秒、10秒、20秒和29秒处采样,展示了拳击手设计和健身房背景在整个30秒内的变化
官方Wan 3.0 2D体育动漫演示的四帧,分别在大约1秒、10秒、20秒和29秒处采样。相同的角色设计,相同的背心,相同的沙袋,相同的储物柜排,在提示词从未要求的全景到特写变化中保持不变。使用静态帧网格而非视频片段,因为此处的比较是同一文件内随时间变化的结构,而非运动。
实际解读:使用两行提示词,模型自行创造了覆盖镜头,从锁定的全景移动到一个汗水与疲惫的特写,并在过程中保持了角色设计。这是好消息。代价是你放弃了对任何事件发生时间的控制。如果你需要30秒来在特定秒数落地一个特定节拍,请编写时间戳。
在付费之前免费测试原生30秒故事叙述
Seedance 2.5上一个30秒的720p运行,按实际分辨率而非目录起步价计算,报价大约为9美元。Wan 3.0价格表上一个30秒的1080p运行是6.00美元。按制作标准来说都不算贵,但考虑到3.2比1的拍摄比率,你买的不是一个片段,而是三到四个。
在花钱之前,值得先回答一个更便宜的问题:我的剧本作为连续单次拍摄是否真的成立?大多数30秒的失败并非模型失败,而是结构失败——三个节拍被塞进了只能容纳两个的空间,或者在第26秒写了一个收尾,但第8到20秒之间没有任何内容支撑。
Atlas Cloud的免费AI广告短剧生成器可以免费回答这个问题。你提供一件产品描述和最多四张产品照片(每张小于8MB),选择六种风格之一(搞笑梗、剧情反转、情景喜剧、暖心、奢华或硬推销),它会先编写一个双角色剧本,包含三秒钩子、冲突和反转,然后围绕这个剧本构建每个镜头。角色会大声说出台词,音效也会渲染到视频中。
诚实的限制:它是15秒,而不是30秒,你需要登录,并且在充值积分之前你只能获得一次免费生成。但15秒内包含一个钩子、冲突和反转,可以告诉你你的三个节拍是否呼吸顺畅。如果结构在那里有效,那么将相同的节拍拉伸到第一步中的 0-8秒 / 8-16秒 / 16-24秒 / 24-30秒 框架上,然后去花那9美元进行真正的原生30秒运行。
Wan 3.0 与 Seedance 2.5 原生30秒的实际成本
| 设置 | 费率 | 时长 | 单个片段 |
|---|---|---|---|
| Wan 3.0, 1080p 原生 (仅阿里云) | $0.20 / 秒 | 30秒 | $6.00 |
| Wan 3.0, 720p 原生 (仅阿里云) | $0.10 / 秒 | 30秒 | $3.00 |
| Wan 3.0, 480p 原生 (仅阿里云) | $0.05 / 秒 | 30秒 | $1.50 |
| Seedance 2.5, 720p 原生, 在 Atlas Cloud上 | 720p时实测约$0.30 / 秒,标价从$0.134起 | 30秒 | 约 $9.09 |
| GPT Image 2 开场画面,质量高,2048x1152 | 标价从 $0.009 / 张起 | 1张图片 | 报价 $0.1745 |
最终决定其可比性的比较:Wan 3.0在720p下每秒比Seedance 2.5在720p下更便宜,而在1080p下,它是两者中唯一一个出售真实像素的。Seedance 2.5的回应是50个参考槽位、实时可用性以及一个今天下午就能投入使用的API。
这些原生30秒片段的来源和许可说明
本文中的每个Wan 3.0片段和每个Wan 3.0提示词均来自阿里巴巴公开发布的通义万相3.0创作者手册,在此用于比较和评论,已注明出处,未经修改,未去水印。Seedance 2.5输出的商业用途受字节跳动和火山引擎条款约束;Atlas Cloud端的API计费和数据处理受Atlas Cloud自身条款约束。本测试中未复制任何真实人物的肖像。如果你正在为客户项目输出内容,请阅读你调用的特定端点的模型条款,而不是本文的摘要。
常见问题解答
Wan 3.0的原生30秒真的是单次生成,还是拼接片段?
单次生成。Wan 3.0在单次生成中产出2到30秒,并带有智能时长选项,因此它也可以决定片段不需要完整的30秒。这与“末帧延展”不同,后者是从第一个片段的最后一帧种子生成第二个片段,导致身份在接缝处漂移。
哪个在30秒时真正是1080p,Wan 3.0还是Seedance 2.5?
Wan 3.0。它的价格表上有原生1080p档位,阿里巴巴自己的30秒演示文件测量尺寸为1920x1072。Seedance 2.5仅原生生成480p和720p;其1080p、1440p和4K选项是对720p源的增强,其API文档将4K档位描述为“非原生4K生成”。
画面在第25秒仍然会崩溃吗?
有可能,但失败的形式发生了变化。不再是片段之间可见的接缝,而是镜头内部出现变形和去相干,集中在快速运动段落中,放大无法消除。一份记录的Seedance 2.5短片制作运行了3.2比1的拍摄比率,因此请规划好长镜头并准备覆盖镜头。
哪个模型接受更多参考素材?
Seedance 2.5,数量优势明显:30张图片加10段视频加10个音频文件,共50个,其中参考视频和音频每个请求的总时长限制为30秒。Wan 3.0的手册将参考素材上限设为20个,但它是唯一一个接受 .pdf、.ppt、.xls、.doc、.txt 文件和实时网页作为创意输入的模型。
Wan 3.0会开源权重吗?
没有官方承诺。截至2026年8月的公测,尚未发布任何Wan 3.0权重、Hugging Face检查点或ComfyUI节点,官方旗舰视频线的开源权重停留在Wan 2.2(Kingy AI,2026年8月)。在阿里巴巴另有说法之前,请将你读到的关于3.0权重发布的任何其他内容视为猜测。






