Seedance 2.5 现已上线 — 首发 Atlas Cloud

Wan 3.0 与 Seedance 2.5 Native 30s 对比:两者都声称30秒,但只有一个是真正的1080p。

Wan 3.0 与 Seedance 2.5 原生30秒对比,对照阿里巴巴自家演示提示:哪个渲染真实1080p像素,哪个进行放大,哪个你现在就能运行。

两块显示器并排播放同一沙漠加油站镜头,下方分别对应一条完整的30秒时间线和一条分成两段的时间线

两块剪辑显示器并排播放同一沙漠加油站镜头,一块下方是完整的30秒时间线,另一块时间线被分成两段。

到了第20秒,燃油喷嘴喷出鲜嫩的绿草,还挂着水珠。马舒服地眯起眼睛。加油工的牙签从嘴里掉出来。

这个笑点只能在一个连续的30秒镜头里成立。把四个8秒的片段拼在一起,马的花色变了,墨镜形状变了,天空色温偏暖了一档,笑点也在接缝处消失了。

所以当Wan 3.0和Seedance 2.5几乎同时宣称原生30秒、一次生成、无需拼接时,这不再是一个关于基准测试的故事。这是AI视频模型第一次能在单个镜头里完成“铺垫、转折、收尾”的完整叙事。

我仔细对比了两者的规格,并根据阿里巴巴官方发布的演示文件进行了核对,发现了一个所有报道都没有提及的关键点:两者都声称支持30秒,但这30秒背后的分辨率根本不是一回事。

核心要点

  1. 两款模型确实都能单次生成30秒。这部分不是营销话术。Wan 3.0覆盖2到30秒,并提供智能时长选项;Seedance 2.5覆盖4到30秒。
  2. 只有Wan 3.0在30秒时能原生生成1080p分辨率。Seedance 2.5仅原生支持480p和720p。其1080p、1440p和4K选项都是基于720p源的后处理放大,其API文档也明确指出4K档位“并非原生4K生成”。
  3. Seedance 2.5在参考素材数量上胜出:最多30张图片加10个视频加10个音频文件,共50个。Wan 3.0的创作者手册将参考素材上限设为20个。
  4. Wan 3.0拥有一个其他模型没有的输入方式:.doc.xls.ppt.pdf.txt文件以及实时网页,可直接作为创意参考输入。
  5. 目前,两者中只有一个真正能在阿里巴巴以外的平台运行。Wan 3.0在阿里云百炼和通义千问云上处于公开测试阶段,第三方API访问仍在逐步开放中。Seedance 2.5现已登陆Atlas Cloud,时长控制可直接设定为30秒。
  6. 想在付费之前先测试一下30秒的故事结构?Atlas Cloud的免费AI广告短剧生成器提供一次免费试用:生成一个15秒的成品广告,包含语音对话和音效,无水印下载。
Invalid YouTube video ID

阿里巴巴官方Wan 3.0演示,来自通义万相3.0创作者手册。单次拍摄,无剪辑,时长30.07秒。通过ffprobe测量:1920x1072,24fps,内置AAC立体声音频。打开声音,在第29秒能听到尾巴甩动和牙签落地的声音。此处仅作为对比和评论的参考素材。

Wan 3.0 vs Seedance 2.5 原生30秒:这个月真正发生了什么

15秒曾经是一道难以逾越的坎。Wan 2.7的极限就在那里。Seedance 2.0的极限也在那里。过去一年里你在信息流中看到的每一部“一分钟AI电影”,都是用四到八个片段在非线性编辑软件里拼接而成,再通过调色师调色来掩盖接缝。

有两个突破在同一几周内打破了这道坎。阿里巴巴于2026年8月6日开放了Wan 3.0的公开测试,支持原生30秒生成和全多模态参考输入(AlphaSignal,2026年8月)。字节跳动将Seedance 2.5的时长从15秒翻倍到30秒,明确将其定位为减少片段拼接及其带来的视觉漂移问题的方案。

“原生”在这里有特定的技术含义。它意味着对单个潜变量序列进行单次前向传播,而不是基于最后一帧的扩展——即模型取片段A的最后一帧,然后从该帧开始生成片段B。扩展是导致角色衣领在镜头之间悄悄变形的元凶。原生传播则将整个30秒置于同一个上下文中,因此马始终是同一匹马。

加油站演示是对此最清晰的测试。其结构是四个节拍:0到8秒无事发生,8到16秒发生奇怪的事,16到24秒笑点揭晓,24到30秒离场。笑点落在第20秒。这意味着只有马、墨镜、青橙色调和固定机位的平淡镜头在前19秒内保持不变,这个笑点才能成立。拼接无法做到这一点。不是因为剪辑师水平不行,而是因为片段B从未见过片段A。

Wan 3.0 vs Seedance 2.5 原生30秒:画面真正在何处崩溃

30秒是15秒的两倍。漂移的风险并非简单地翻倍,而是更严重,并且会转变为一种不同的失败模式。

拼接工作流的失败发生在片段之间。原生30秒的失败则发生在片段内部。在一次Seedance 2.5短片制作的实际操作中,评测者发现非连贯性和变形表现为“角色模型上的视觉突兀感或不稳定性”,集中在快速动作序列中,并特别指出这些瑕疵无法通过放大来消除(MindStudio,2026年8月)。这对任何打算先渲染720p再放大到4K的人来说至关重要:放大锐化了变形,而非消除它。

同一次制作记录了3.2比1的拍摄比。大约需要450秒的原始生成才能剪辑出2分22秒的最终成品。规划长镜头工作时,要像有多个机位的拍摄那样去构思,而不是像处理一个每项任务都能直接输出的渲染队列。

那次制作中还有两个发现值得直接借鉴。整个影片的视觉一致性依赖于三张参考图像(两张角色肖像和一张场景定位图),尽管系统最多可接受50张。在配音方面,写入“American”修正了意外出现的英式口音,而写入“American English”则没有效果,因为“English”这个词将发音拉回了英式。

能够支撑30秒的提示词结构,正是阿里巴巴在其官方手册中使用的:明确的时间戳节拍。不要写一段描述氛围的段落。写成 0-8s8-16s16-24s24-30s,为每个部分指定其自身的镜头行为和事件,最后用一行概括整个片段的音频描述。你将在下面的步骤4中看到这个确切的框架,因为我保留了阿里巴巴的结构,仅仅进行了翻译。

Wan 3.0 vs Seedance 2.5 原生30秒:规格、价格和今日可用性

以下是当前局面的真实情况,也是两款模型不再具有可比性的部分。

请仔细阅读分辨率那一行,因为这是整篇文章的核心。Atlas Cloud 自己的 Seedance 2.5 文生视频 API 文档指出,720p-esr 是对 480p 源的增强,1080p-esr1440p-esr4k-esr 都是对 720p 源的增强,并且 4K 选项提供的是 2160 像素的短边,属于“非原生 4K 生成”。因此,一个标称为 4K 的 30 秒 Seedance 片段,实际上只有 720p 的真实细节,经过重采样。相比之下,Wan 3.0 的价格表上有一个直接的 1080p 档位,每秒 $0.20,而且阿里巴巴官方发布的 30 秒演示文件测量分辨率为 1920x1072。

这个限制的好处是:整个测试在一个浏览器标签页内完成,涉及三个模型,无需本地设置。

在本测试中的角色模型标价
开场画面GPT Image 2 文生图从 $0.009 / 张起
原生30秒运行Seedance 2.5 文生视频从 $0.134 / 秒起

标价取自 Atlas Cloud 模型页面,2026年8月验证。请将其视为底价,而非最终报价。这些模型都根据你实际请求的内容计费,运行按钮会在你点击前显示你的确切设置价格。在这个测试中,按钮对一张 GPT Image 2 图片(高质量,2048x1152)的报价是 $0.1745,对一次 5 秒的 Seedance 2.5 任务(720p,16:9)的报价是 $1.514799,这相当于大约 $0.30/秒,而不是标价 $0.134。标价是 480p 的费率。请查看按钮,而不是目录。Seedance 2.5 还提供了一个 参考素材生视频端点,价格同样是 $0.134/秒,如果你想挑战 50 个参考素材的上限的话。

如何在 Seedance 2.5 上复现这个原生30秒测试

五个步骤,三个模型,全在浏览器中完成。请逐字复制提示词。

步骤1:锁定带时间戳的30秒骨架

现在先不要运行任何东西。先阅读结构,因为这是决定你的30秒能否成立的关键。

本文开头的 Wan 3.0 加油站演示由四个带标签的区块构成,并在开头声明了一次固定镜头规则:冷静客观的观察、固定中全景、仅在荒诞节拍处使用突然的极端特写。每个事件都固定在时间范围内。音频在末尾用一行涵盖所有30秒。

这是空的骨架。填充它,你就得到了一个原生30秒模型能够真正追踪的提示词:

Plain
1一个30秒的[类型片],场景设定在[地点]。[视觉风格,色调,饱和度]。镜头语言:[规则],辅以[例外]。
2
30-8秒:[铺垫,全景,建立正常世界,引入地平线上的异常]
4
58-16秒:[异常发生作用,仍以正常方式处理,插入一个主观视角或反应镜头]
6
716-24秒:[收尾,对事物本身的极端特写,硬切到反应脸部]
8
924-30秒:[离场,一个小的物理动作,作为笑点的收尾]
10
11音频:[环境音,三到四个具体的画内声音,一个最终的小声响]。无音乐,无对白,无屏幕文字。

阿里巴巴参考文件的可测量规格,供任何人核对:30.07秒,1920x1072,24fps,AAC立体声。这是衡量Seedance运行的基准。

步骤2:生成开场画面

你需要一个固定的视觉锚点,以便15秒和30秒的运行从同一个世界开始。打开 GPT Image 2 文生图

设置: qualityhighaspect ratio16:9,1张图片。

Plain
1一个宽阔、静止的定场镜头,展示一座孤独的66号公路风格加油站,位于明亮的沙漠中。复古的黄色、橙色和蓝色建筑,油漆微微褪色;前面有一台褪色的老式红色加油泵;旁边是一家小便利店,门口有一台褪色的可乐自动售货机。前景是干裂的橙色干土,远处是温暖的赭色山脉,无云的清澈蓝绿色天空。一名加油工穿着油腻的蓝色连体工作服,戴着超大黑色墨镜,在门口的椅子上半睡半醒地懒散坐着,嘴里叼着牙签。严格的明亮青橙色色调,高饱和度,高亮度,电影级照片写实风格,固定机位,16:9。

AI图像生成器界面截图,显示提示词和输出图像

Atlas Cloud上的GPT Image 2操作界面,质量设置为高,16:9,输出面板中显示了生成的66号公路加油站定场镜头

Atlas Cloud上的GPT Image 2:质量高,16:9,一张图片。运行按钮对此帧的报价是$0.1745,这实际上是2048x1152高质量渲染的成本。模型页面上的$0.009是底价。

一名男子在复古的66号公路沙漠加油站外休息

用GPT Image 2生成的66号公路加油站定场镜头,蓝绿色天空和橙色干裂土地,加油工在门口打盹

开场画面。这是步骤3的输入和步骤4的视觉目标。使用 openai/gpt-image-2 生成。

步骤3:冲击15秒之墙

设置: first frame = 你的步骤2输出,duration 拖拽到最大值 15resolution1080P

Plain
1固定中景镜头保持。一名戴宽檐帽的女牛仔骑着真马从地平线缓缓走来。打盹的加油工被马蹄声惊醒,推了推墨镜,坐直身子,嚼着牙签,一脸不屑。她利落地翻身下马,牵着马径直走向老式加油泵。明亮的青橙色色调,高饱和度,照片写实,冷静的观察镜头,无剪辑。

下拉菜单停在15秒。这就是这一步的全部意义。你的笑点预计在第20秒,而这个流程无法在不中断的情况下到达第20秒。要到达那里,你需要从最后一帧生成第二个片段,而一旦你这么做,马就变成了一匹新马。

AI视频生成器界面截图,显示输入和输出

步骤4:运行完整的原生30秒生成

打开 Seedance 2.5 文生视频

设置: duration = 30resolution = 720pratio = 16:9generate_audio = 开启,output_format = mp4,水印关闭。

特意选择720p,而不是 1080p-esr。720p是模型的真实上限,所以这是像素对像素的直接比较,而不是与放大器的比较。

下面的提示词忠实地翻译自阿里巴巴的加油站演示提示词,来自Wan 3.0创作者手册,并重新组织成纯文本结构。相同的节拍,相同的时机,相同的镜头规则,相同的音频列表。

Plain
1一个30秒的荒诞冷面喜剧短片,场景设定在明亮沙漠中一座被阳光晒褪色的66号公路风格加油站。照片写实,严格的明亮青橙色色调,高饱和度和高亮度,使得荒诞事件发生在一个完全正常、近乎美好的世界中。镜头语言:冷静、客观的观察,主要是固定的中全景和缓慢的横向平移,没有情感引导,在荒诞节拍处辅以突然的极端特写。
2
30-8秒:全景,固定。蓝绿色天空,飘浮的尘土。复古的黄橙蓝三色加油站孤零零地坐落在路边;一名穿着油腻蓝色连体工作服、戴着巨大黑色墨镜的加油工在椅子上打盹,嘴里叼着牙签。只有风声。地平线上,一名女牛仔骑着真马缓缓走来。切到中景:马蹄声惊醒了他,他推了推墨镜,坐直身子,把这组合解读为“又一个问路的”。
4
58-16秒:她一言不发。她利落地翻身下马,牵着马径直走向老式加油泵。马随意地把头凑到加油泵旁边,好像以前做过一样。从他的墨镜后面短暂地出现一个略微鱼眼效果的视角,女人和马看起来更奇怪了。特写:他皱起眉头,摘下墨镜,正要喊叫。慢动作特写:当墨镜摘下时,她将燃油喷嘴对准马的嘴,扣动了扳机。
6
716-24秒:喷嘴的极端特写。喷出来的不是汽油,而是几股鲜嫩的亮绿色草,还挂着水珠。硬切到加油工脸部的极端特写,僵住了:眼睛瞪得像铜铃,嘴巴微张,牙签忘在嘴里。中景:马开心地吃着,舒服地眯起眼睛,然后满意地用力甩了一下尾巴,扬起的尘土正好落在仍然目瞪口呆的加油工脸上。
8
924-30秒:草“加满了”。她把喷嘴挂回油泵,从口袋里掏出硬币,走到商店门口,叮当作响地扔进柜台上的一个锡罐里。她回头看了一眼吓呆的加油工;帽檐下,她的嘴角微微上扬。她重新上马,在一片尘土中骑马离去。镜头缓缓推向加油工:同样的僵硬姿势,脸上沾满尘土,墨镜还捏在手里,最后,牙签从他嘴里掉落,发出微小的咔哒声。
10
11音频:全程干燥的沙漠风声,马蹄声,油泵手柄的机械撞击声,湿润的草地喷射声,尾巴甩动声,硬币落入锡罐声,以及牙签撞地时一声微小的咔哒声。无音乐,无对白,无屏幕文字。

一个可以帮你避免浪费账单的警告,和步骤3是同一个陷阱:拖拽时长滑块到30,不要在数字框中输入30。 输入框可能会显示30,但滑块可能停留在5秒的默认值上,运行按钮会按5秒报价。在点击之前检查报价。在720p和16:9下,一个5秒的任务报价为$1.514799,因此一个真正的30秒任务报价大约是这个数字的六倍。

这一步没有完成的运行截图。三次自动截图尝试都提交了滑块默认值,而不是30秒。为了避免展示一个标为30秒的5秒片段,这里省略了截图。上面的提示词和设置正是你需要粘贴和设定的内容。

步骤5:诚实地评估漂移

以下是基于完全相同的提示词,在Seedance 2.5上原生30秒生成的片段,720p,16:9,音频开启。

Seedance 2.5,完全复制了相同的Wan 3.0加油站提示词:原生30秒一次生成,1280x720,24fps,内置音频。相同的四个节拍,女牛仔和马到达,燃油喷嘴的噱头,加油工认知失调的特写。将其与顶部的Wan 3.0片段并列放置,进行直接比较。

将两个片段并排放置,检查五个具体项目。不要检查“哪个看起来更好”,那是审美争论,会浪费你的下午。

  1. 外套和服装一致性。 第29秒的马和第6秒的马颜色相同吗?墨镜摘下来又放回手里后,形状一样吗?
  2. 色调稳定性。 采样第2秒和第28秒的天空。青橙色调在长时间生成中比人们预期的更常偏暖。
  3. 第20秒的物理动作。 从燃油喷嘴喷出草是对物理效果的考验。它是带着重量弧线落下,还是像纹理一样淡入?
  4. 镜头纪律。 提示词要求固定机位。数一下镜头在没有被要求的情况下,自行发明了多少次推进。这是长时间生成中最常见的失败:模型用完了预定事件,用运动来填充时间。
  5. 快速运动中的变形。 尾巴甩动和尘土飞扬是片段中运动最快的部分。根据MindStudio的制作笔记,这恰恰是非连贯性集中的地方,也是放大无法修复的地方。

根据这五点打分,而不是凭感觉。这是一个你可以向客户辩护的比较。

另外三个Wan 3.0 vs Seedance 2.5原生30秒匹配提示词

一个演示只是轶事。以下是来自同一手册的另外三个官方Wan 3.0 30秒文件,每个都针对30秒问题的不同方面。对于海怪和黑暗奇幻独白,Seedance 2.5 的片段是在相同提示词下原生30秒生成的,并紧随其后嵌入,以便你可以同时观看,而不是只听我讲述。

提示词压力测试内容Wan 3.0 官方文件,测量结果Seedance 2.5 相同提示词片段
海怪灾难片30秒内包含10个脚本镜头加管弦乐配乐1920x1072, 24fps, 30.07s, AAC在30秒生成,嵌入下方;移除了一个IP名称和船品牌文字以通过Seedance的内容过滤器,故事板其他部分相同
黑暗奇幻英文独白原生英语配音和唇形同步,伴随缓慢持续推进1280x720, 24fps, 30.05s, AAC在30秒从提示词逐字生成,嵌入下方
2D体育动漫,两行提示词模型能否在几乎没有指令的情况下填满30秒1280x720, 24fps, 30.05s, AAC此处未生成;以仅Wan的画面网格展示,以读取跨时间的结构
甩镜头喜剧短片(排除)8个甩镜头和8个情感节拍,不通过剪辑1280x720, 24fps, 30.04s, AAC未运行:对白密度是普通话特有的,英文改写后无法进行公平的直接比较

官方Wan 3.0演示:在一个30秒的片段内包含十个脚本镜头和完整的管弦乐构建,分辨率为1920x1072。这是原生1080p最有力的论据,因为水量和生物湿皮肤细节正是720p放大所“发明”而非“解决”的。来自阿里巴巴通义万相创作者手册,用于比较和评论。

Seedance 2.5,相同的十个镜头灾难提示词,原生30秒,开启声音。风暴中颠簸的渔船,惊恐的甲板水手,涌起的巨浪,然后深海巨兽在闪电中破水而出。移除了一个IP参考和船体上的品牌文字以通过Seedance的内容过滤器;故事板其他部分相同,这使得水量和湿皮肤细节的对比成为与上方Wan 3.0片段公平的直接比较。

官方Wan 3.0演示,开启声音。原生英语反派对白,“足够成熟,可以坠入虚空了”,在一次缓慢的向上倾斜中完成,无剪辑。这是英语团队应该测试的片段,因为配音、唇形同步和一个30秒的连续镜头运动必须同时保持稳定。

Seedance 2.5,完全相同的黑暗奇幻提示词,原生30秒,开启声音。相同的紫眼反派,星符文标记,在他张开的手掌中形成的阴影星云,以及两行英文台词。观察唇形同步和单一的连续推进是否像Wan 3.0一侧那样在整个30秒内保持稳定。

如果你运行匹配的Seedance 2.5这一侧,请逐字保留两行英文台词,并记住制作笔记中的口音问题:写“American”,而不是“American English”。“English”这个词会把发音拉回英式读法。

第三个是安静的惊喜。阿里巴巴手册中的2D体育动漫提示词只有两行。没有时间戳,没有镜头列表,只有一个拳击手在打沙袋,疲惫,痛苦。从这样的提示词生成30秒,是对模型能否自行发明结构的真正考验。以下是它在自身时长内的采样:

四幅动漫风格的画面,展示一位疲惫的拳击手在训练,旁边是一个沙袋

来自官方Wan 3.0 2D体育动漫演示的四帧,大约在第1、10、20和29秒采样,展示了拳击手的设计和健身房背景在整个30秒内的变化

来自官方Wan 3.0 2D体育动漫演示的四帧,大约在第1、10、20和29秒采样。相同的角色设计,相同的背心,相同的沙袋,相同的储物柜排,从全景到特写的变化是提示词从未要求的。这里使用静止帧网格而非视频片段,因为比较的是单一文件内部跨时间的一致性,而非运动。

实际解读:使用两行提示词,模型自行发明了镜头覆盖,从一个固定的全景移动到汗水和疲惫的特写,并在过程中保持了角色设计。这是好消息。代价是你放弃了控制事件发生的时间。如果你需要30秒在特定秒数出现特定节拍,请写上时间戳。

在付费前免费测试原生30秒叙事

Seedance 2.5上一个30秒720p的运行,按实际分辨率而非目录底价计算,报价约为9美元。Wan 3.0价格表上30秒1080p运行是6.00美元。按制作标准来说都不算贵,但考虑到3.2比1的拍摄比,你买的不是一个片段,而是三到四个。

在花钱之前,值得回答一个更便宜的问题:我的剧本真的能作为一个连续的镜头成立吗?大多数30秒的失败不是模型失败,而是结构失败——三个节拍挤在只能容纳两个的空间里,或者一个写在第26秒的收尾,却没有任何东西支撑第8到第20秒。

Atlas Cloud的免费AI广告短剧生成器可以免费回答这个问题。你提供一个产品描述和最多四张产品照片(每张小于8MB),选择六种风格之一(搞笑梗、剧情反转、情景喜剧、暖心、奢华或硬推销),它会先写一个包含两个角色的剧本,包含一个3秒钩子、一个冲突和一个反转,然后围绕这个剧本构建每一个镜头。角色会说出他们的台词,音效也会渲染到视频中。

诚实的限制:它是15秒,不是30秒,你需要登录,并且在充值之前只能获得一次免费生成。但一个包含钩子、冲突和反转的15秒剧本,可以告诉你你的三个节拍是否呼吸顺畅。如果结构在那里成立,就把相同的节拍拿出来,拉伸到步骤1中的 0-8s / 8-16s / 16-24s / 24-30s 骨架里,然后去花那9美元进行真正的原生30秒生成。

Wan 3.0 vs Seedance 2.5 原生30秒片段的实际成本

设置费率时长一个片段
Wan 3.0,1080p 原生(仅限阿里云)$0.20 / 秒30秒$6.00
Wan 3.0,720p 原生(仅限阿里云)$0.10 / 秒30秒$3.00
Wan 3.0,480p 原生(仅限阿里云)$0.05 / 秒30秒$1.50
Seedance 2.5,720p 原生,在 Atlas Cloud 上$0.30 / 秒(720p 实测),标价从 $0.134 起30秒约 $9.09
GPT Image 2 开场画面,高质量,2048x1152标价从 $0.009 / 张起1张图片报价 $0.1745

真正决定性的比较:Wan 3.0在720p下每秒比Seedance 2.5在720p下更便宜,而在1080p下,它是两者中唯一出售真实像素的。Seedance 2.5的回应是50个参考素材槽位、即时可用性以及一个你今天下午就可以对接使用的API。

这些原生30秒片段的来源和许可说明

本文中的每一个Wan 3.0片段和每一个Wan 3.0提示词均来自阿里巴巴公开发布的《通义万相3.0创作者手册》,此处用于比较和评论,已注明出处,未经修改且未去除水印。Seedance 2.5输出的商业用途受字节跳动和火山引擎的条款约束;Atlas Cloud 侧的API计费和数据处理受Atlas Cloud自身条款约束。本测试中未使用任何真实人物的肖像。如果你为客户交付作品,请阅读你所调用的特定端点的模型条款,而非博客总结。

常见问题解答

Wan 3.0的原生30秒真的是单次生成,还是拼接的片段?

单次生成。Wan 3.0在单次生成中产生2到30秒,并带有智能时长选项,因此它也可以决定片段不需要完整的30秒。这与基于最后一帧的扩展不同,在扩展中,第二个片段从第一个片段的最后一帧开始生成,身份会在接缝处漂移。

在30秒时,哪个是真正的1080p,Wan 3.0还是Seedance 2.5?

Wan 3.0。它的价格表上有原生1080p档位,阿里巴巴自己的30秒演示文件测量为1920x1072。Seedance 2.5仅原生生成480p和720p;其1080p、1440p和4K选项是对720p源的增强,其API文档将4K档位描述为“非原生4K生成”。

画面在第25秒还会崩溃吗?

有可能,但失败形式改变了。不再是片段之间的可见接缝,而是镜头内部的变形和非连贯性,集中在快速运动段落,并且放大无法消除。一个已记录的Seedance 2.5短片制作项目运行了3.2比1的拍摄比,因此规划长镜头时要准备备用镜头。

哪个模型能接受更多参考素材?

Seedance 2.5,遥遥领先:30张图片加10个视频加10个音频文件,共50个,其中参考视频和音频每个请求的总时长上限为30秒。Wan 3.0的手册将参考素材上限设为20个,但它是唯一一个接受 .pdf.ppt.xls.doc.txt 文件和实时网页作为创意输入的模型。

Wan 3.0会开源吗?

没有官方承诺。截至2026年8月的公开测试版,尚未发布任何Wan 3.0权重、Hugging Face检查点或ComfyUI节点,官方旗舰视频模型的开源权重止步于Wan 2.2(Kingy AI,2026年8月)。请将你读到的任何关于3.0权重发布的说法视为猜测,直到阿里巴巴另有说明。

最新模型

一个 API,畅享全模态 AI。

探索全部模型