Seedance 2.5 现已上线 — 首发 Atlas Cloud

Wan 3.0 文档转视频:我审核了每一帧

Wan 3.0 文档转视频是真的:我逐帧检查了官方的 xlsx 演示文件。数字保留,图表破碎。另外,你现在就可以运行一个工作流。

上传一个电子表格,就能得到一段23秒的带音乐的数据动画。

这就是 Wan 3.0 文档转视频 的承诺——该系列首个原生文档输入功能,而官方演示比我想象的更加直接地兑现了这一点。数字准确无误。$1,580 增长到 $3,460,徽章显示 +45.7%,这些数字直接追溯到源表格中的特定单元格。

然后我将播放头拖到第12秒处,读取了图表图例。

"Southeasta North America。"

两个销售区域被压缩成一个不存在的单词。这就是2026年文档转视频的真正水位线:模型确实读取了你的表格,但它仍然无法绘制你的图表。下面是我尚未发布的逐帧审计,以及一个你今天下午就能实际运行的三步链条。

关键要点

  • Wan 3.0 接受1个文件或1个链接,最多100MB或50页,输出最长30秒的1080p视频。
  • 它根据你的文档重新导演一部影片,而不是将第3张幻灯片变成第3个镜头。
  • 单元格数值完整保留。图表图例、坐标轴刻度和千位分隔符则不会。
  • 存在硬性上限:无4K、无开源权重、仅限官方渠道。
  • 长上下文模型加上15秒视频模型就能复现其大部分功能。

带有金色闪粉的“H1 2026 Wan”金色文字

Wan 3.0 文档转视频输出:官方 xlsx 演示渲染为 Keynote 风格的数据动画影片

展示:阿里巴巴官方 Wan 3.0 公测版演示,输入一个.xlsx格式的月度GMV数据,输出23秒的数据动画影片。此处显示为无声GIF;交付的文件包含44.1kHz立体声AAC音轨。来源:阿里巴巴官方Wan 3.0创作者手册。

Wan 3.0 文档转视频的实际功能

简短版,如果你只需要这个,一分钟后就可以离开。

你给它一个文档或一个网页链接。它会读取全部内容,决定故事是什么,并在同一轮次中生成带有图像和声音的视频。最长30秒,最高1080p。它不会按顺序逐页呈现。

以下是实际影响项目的一些限制。

规格Wan 3.0 文档输入
格式doc, xls, ppt, pdf, txt, md,以及 key / pages / numbers 和纯网页链接
每次任务输入1个文件 1个链接(不能同时使用,也不能多个)
大小上限100MB
页数上限50页
最大输出30秒,单次连续生成
最大分辨率1080p(无4K选项)
音频与图像在同一轮次生成
开源权重无;Wan 2.2 仍是最后一个开源权重版本
获取方式阿里云 Model Studio(百炼)和 Qwen 云,需要邀请制

公测版于2026年8月6日开放(AgentUpdate,2026年8月)。格式列表和两份已发布的价格表来自另一份规格汇总(Ngram,2026年8月)。

官方手册提供了四个文档用例,它们清晰地对应了人们已经付费给代理机构完成的四类工作:

  • 提案文档 → 品牌影片。 一份护肤方案文档变成30秒的广告,包含一位女主角和晨光故事。
  • 课件 → 视频课程。 一篇百科条目变成面向一年级学生的动画课程。
  • 电子表格 → 动画图表。 上面的演示,也是四个用例中最难的一个。
  • 报告 → 语音摘要。 一份书面报告变成主持人风格的简报。

现在,大多数文章在分类上搞错了。

现有的“PDF转视频”产品并非如此。Kapwing的文档转视频只是将文件中的文本提取出来并放到时间线上,没有场景构建,也没有主持人。Pictory和Powtoon会组装素材视频或模板动画,而Powtoon的产品页面会宣传AI虚拟形象和语音朗读你的脚本。这三个产品都生成带有旁白的幻灯片。

Wan 3.0Kapwing 文档转视频PictoryPowtoon 任意内容转视频
输出内容生成的影片文本在时间线上根据脚本剪辑的素材模板动画
创造新图像是,每一帧否,使用库剪辑否,使用模板素材
AI 主持人默认无可选语音虚拟形象和语音
音频与图像一起生成你自行添加TTS 语音旁白TTS 语音旁白
最长单次输出30秒项目长度项目长度项目长度
可用性邀请制,仅官方渠道公开公开公开

把这张表读两遍,因为这就是全部论点:这些产品不属于同一类别。 一个制作旁白幻灯片。另一个制作从未存在过的影像。按每分钟价格来比较它们,就像比较复印机和电影摄制组。

Wan 3.0 也能做幻灯片那种事吗?是的,这是诚实的说明。

反例:要求将一篇关于量子力学的网页变成一个有趣的讲解视频,Wan 3.0 精确生成了现有产品所销售的“主持人+字幕”格式。它在30.02秒处碰到了30秒的上限。阿里巴巴官方公测演示,含音频。

因此,区别不在于 Wan 3.0 不能制作主持人讲解视频。而在于对于现有产品来说,那种格式是唯一的选项。

为什么 Wan 3.0 文档转视频会搞乱图表,却能保留你的数字

以下是本文中最有用的一点:我从官方电子表格演示中提取了12个均匀间隔的帧,并读取了每一个字符。

结论明确分为两部分。数值通过。图表元素失败。

幸存的内容。 在第4秒标记处,帧显示 $1,580、一个细灰色箭头、$3,460、标题“Monthly GMV Growth”,以及一个珊瑚色徽章,上面写着 +45.7%。排版清晰,逗号位置正确,没有乱码字符。该演示背后的提示引用了特定的电子表格单元格,屏幕上的数字与之匹配。一项针对8页产品演示文稿的第三方测试发现了同样的情况:45g、12小时和55度都正确渲染,结尾标语没有出现任何错误字符(AI-Driven Lab,2026年8月)。

这回答了财务和培训团队真正关心的问题。你的数字不会悄然变异。

失败的内容。 图表帧则完全不同。

带注释的折线图,显示图例、刻度和单位三个错误

Wan 3.0 文档转视频帧审计,显示合并的图表图例和损坏的Y轴

在官方演示的第12秒处定格。一帧中存在三个缺陷:两个区域名称合并为“Southeasta North America”,“North America”随后作为独立系列重复出现,以及Y轴显示30, 60, 70,而顶部数据标签显示$3,880。

统计那一帧中的失败点:

  1. 合并的图例。 “Southeast Asia”和“North America”碰撞成“Southeasta North America”。然后“North America”再次作为单独系列出现,因此一个区域被标记了两次,另一个则消失了。
  2. 不是刻度的Y轴。 刻度标记为30, 60, 70。像素间距相等,值却不相等,40和50完全缺失。
  3. 轴和标签的单位不同。 最高网格线为70。固定在顶部数据点上的标签显示$3,880。
  4. 同一条线上的数值漂移。 那条顶部曲线上的标签从$330和$335开始,然后落到$3,970和$3,880。一条平滑上升的线在两个相邻点之间不可能有十倍跳跃。中间的两个标签模糊到无法准确辨认,这本身就是一种答案。

柱状图部分重复了这种模式。四条柱分别显示$1750, $1,580, $2,350 和 $2,580,因此最短的柱却拥有第二高的数值,并且第一个标签丢失了千位分隔符,而其他三个则保留着。旁边是四个柱对应的五个绿色增长数字。而环形图中心显示 $89,7M,逗号代替了小数点。

注意到所有这些问题的共同点了吗?没有一个属于内容错误。每一个都是绘制错误:布局、标注、刻度、标点符号。模型理解了电子表格,然后以视频模型渲染任何密集文本的方式近似地绘制了图表。

还有第二个结构性原因,使得输出看起来完全不像你的演示文稿。

算一下。50页是页数上限,30秒是时长上限。那就是每页0.6秒。

你不可能在0.6秒内呈现一页,所以模型做了唯一合理的事情:制作一个预告片。那个第三方演示文稿测试也独立得出了相同结论:它将演示文稿视为电影广告的素材,而不是要逐页翻看的幻灯片。产品眼镜框在镜头中从厚框变为无框再到第三种形状。

这也就是为什么30秒上限是一个设计约束,而不是规格表上的脚注。

我们测量了交付的文件:四个官方文档演示时长分别为30.04秒、30.02秒、25.03秒和23.04秒。那两个30秒的剪辑在彼此相差不到0.04秒处戛然而止。而电子表格演示要求22秒,实际交付了23.04秒。我们在 Wan 3.0 预览 中详细分析了这个上限。

那么:调整预期。给它一个文档,得到一个预告片,保持你的图表简单。

今天就能运行的文档转视频工作流

在教程之前先快速确认一下现实情况,因为这会节省你一个小时的搜索时间。

Wan 3.0 的文档输入功能仅存在于阿里巴巴自己的渠道上,访问需要邀请制,权重未发布。这些渠道之外没有人能提供它,包括我们。你今天可以做的是用已经开放使用的模型重建那个 xlsx 演示中有用的一半,上面的帧审计精确地告诉你如何避开会出问题的部分。

三个步骤,在 Atlas Cloud 上用一个浏览器标签页即可完成:

  1. 一个百万级 token 的模型读取文档,编写带时间码的镜头脚本,每个数字都以字符串字面量嵌入。
  2. 一个图像模型渲染第一帧,所有文本精度都在这里锁定。
  3. 一个视频模型根据脚本对那一帧进行动画处理。
步骤模型标价最大时长为什么在这里
1. 脚本Qwen3.8 Max (/models/qwen/qwen3.8-max)输入$2 / 输出$6 每100万 tokensn/a100万上下文可吞下整个演示文稿
2. 第一帧GPT Image 2 文本转图像每张图$0.009(底价)n/a针对屏幕上数字最强的文本渲染能力
3. 渲染Wan 2.7 图像转视频每秒$0.115秒第一帧控制可保持你的排版稳定
音频选项Wan 2.7 文本转视频每秒$0.115秒在同一轮次生成音乐和音效,但不接受第一帧
可替换步骤3MiniMax H3 文本转视频每秒$0.115秒相同费率,不同的运动风格
可替换步骤3Seedance 2.5 文本转视频每秒$0.13430秒这里唯一能在一次生成中达到30秒的模型

这个链条有三个诚实的限制。它不能直接读取 .pptx 二进制文件,所以你需要自己粘贴文本或 CSV。Wan 2.7 最多15秒,因此一次生成30秒是不可能的。而且图像转视频路径默认无声:其 audio 参数接受你提供的音轨来驱动唇形同步,它不会创造配乐。如果你希望在同一轮次中生成音频,需要使用文本转视频的兄弟模型,但会失去第一帧控制,对于一个充满美元数字的视频来说,这是错误的权衡。价格于2026年8月20日在模型页面上验证,请注意标价是底价:质量和分辨率层级会提高实际报价,因此请在提交前阅读“运行”按钮。

让我们开始构建。

步骤1:将你的电子表格转化为带时间码的镜头脚本

视频模型记不住数字。它们渲染你给它们的任何字符串。因此,这一步的任务是将表格转换为镜头方向,其中每个数字都以引号内的文本形式预先写好。

将你的表格粘贴在 <<< 标记之间。设置:温度 0.3,max_tokens 4000。保持 max_tokens 充裕,因为一个具备推理能力的模型如果在思考过程中预算不足,会返回一个空答案,而你仍需要为此付费。

text
1你是一位动态图形导演。下面是一个原始电子表格导出。
2
3<<<
4月份,北美,东南亚,欧洲,GMV总额
51月,1580,880,640,3100
62月,2110,1240,900,4250
73月,2740,1610,1150,5500
84月,3120,1980,1330,6430
95月,3350,2240,1460,7050
106月,3460,2480,1580,7520
11上半年增长,+45.7%,,,
12>>>
13
14编写一个10秒、16:9、苹果Keynote风格的商业数据视频的镜头脚本。规则:
151. 恰好2个镜头。为每个镜头指定入/出时间码(00:00-00:05,00:05-00:10)。
162. 屏幕上出现的每个数字都必须在镜头描述中以精确的字面字符串形式写出,例如 "$1,580"。永远不要写“一月份的数字”——要写出数字。
173. 不要要求图例、带刻度标签的坐标轴,或屏幕上同时显示超过两个数据系列。改用大的独立数字和一个珊瑚色药丸形徽章。
184. 纯白色背景,柔和珊瑚色+深灰色调,无衬线字体。
195. 以一行背景音乐+音效指示结束(滑入时呼啸声,徽章出现时一声钟声)。
20只输出脚本,不附加任何评论。
21

规则3是从审计中得到的回报。官方输出恰恰在三个地方出问题:图例、坐标轴刻度和多系列图表。因此,我们从需求中删除所有这三项,并将这些屏幕空间用于超大数字和颜色编码的徽章。相同的信息,没有失败点。

规则2是大家经常跳过的,这也是数字能在这个链条中幸存到最后的理由。一个写着“一月份的数字”的镜头描述把数字交还给模型,模型必须为它创造字符。一个写着 "$1,580" 的镜头描述给接下来的两个步骤提供了一个要复制的字符串。你这里不是在要求数据可视化,而是在要求一个打字指令。

返回的将是一个包含两个镜头的脚本,带有入/出时间码,每个屏幕上的数字都以字面量引用,以及结尾的一行背景音乐和音效指示。将其保存在一个临时文件中;步骤2和步骤3都将从中读取。

步骤2:生成品牌第一帧

屏幕上的每个文字字符都在这里决定。一个高质量的图像模型渲染 $1,580 的正确性远高于视频模型在移动的同时还能写对它,因此我们在静态图像中确定排版,让步骤3只推动像素。

打开 GPT Image 2 并将质量设置为 high,尺寸设置为 16:9 选项,在此页面上是 2048x1152。匹配你要制作的视频的宽高比,否则步骤3会开始裁剪你的排版。

text
1一个纯白色的无缝背景上,一个完美的苹果Keynote风格演示帧,仿佛投射在哑光演播室墙壁上。居中标题采用深炭灰色几何无衬线字体,显示为“H1 2026”,设置在宽阔的负空间中。下方是两个相同字体的超大数字,左侧是“$1,580”,右侧是“$3,460”,中间由一个细浅灰色箭头分隔。箭头下方是小号浅灰色标题文字“Monthly GMV Growth”。再下方是一个单一的珊瑚色药丸形徽章,白色文字显示“+45.7%”。柔和均匀的漫射光,右上角有微弱的暖色渐变,细微的纸张纹理,无杂乱,无标志,无图表。超干净的企业极简风格,16:9。
2

有两个值得复制的细节。“无图表”是有意包含的。并且在按下“运行”按钮之前阅读价格报价,因为高质量宽2K帧的成本是 $0.009 标价的好几倍。

AI图像生成器截图,显示输入步骤和输出

Atlas Cloud 上的 GPT Image 2 工作区,显示第一帧提示和渲染后的 Keynote 风格帧,每个数字拼写正确

GPT Image 2,质量 high,16:9 2048x1152。每个数字都准确呈现:“H1 2026”、“$1,580”、“$3,460”和珊瑚色“+45.7%”徽章,这正是为什么排版要在静态图像中确定,而不是在视频模型中。

步骤3:渲染文档转视频片段并验证每个数字

最后一步。加载步骤2的图像作为第一帧,让视频模型在保持排版不动的情况下进行动画处理。

打开 Wan 2.7 图像转视频。设置:上传你的第一帧,分辨率 1080P,时长 10秒。将音频字段留空,因为此模型将音频视为驱动输入而非生成内容。你将自行配乐,或者在单独的文本转视频过程中完成。

text
1将此帧动画化为一个10秒的苹果Keynote风格商业数据视频,保持现有排版像素稳定。
2
300:00-00:05 - 标题“H1 2026”保持,然后消散为金色粒子并向四周漂移。两个数字“$1,580”和“$3,460”从左右两侧滑入并锁定到位;细灰色箭头从左到右自行绘制。显示“+45.7%”的珊瑚色徽章从下方弹出,带有轻微过冲,与一声清晰的钟声同步。
4
500:05-00:10 - 所有内容平滑向左滑出。在相同的纯白色背景上,三个粗圆角柱从共享基线向上生长,颜色为珊瑚色、青色和琥珀色,每个柱上方有一个大号独立数字:“$3,460”、“$2,480”、“$1,580”。无图例,无坐标轴,无刻度标签,无网格线。摄像机保持锁定并完全静止。
6

“保持现有排版像素稳定”和“摄像机保持锁定”在发挥实际作用。每一次摄像机移动都给了模型一次重新绘制它本应保持不变的文本的机会。

然后做那个无聊但重要的部分:在出现数字的每一帧暂停,并与源行进行核对。这是一个30秒的检查,也是防止你得到一段自信地显示错误收入数字的视频的唯一屏障。

AI视频生成界面,显示输入提示和完成的视频

Atlas Cloud 上的 Wan 2.7 图像转视频工作区,已加载第一帧并渲染完成的数据剪辑

Wan 2.7 图像转视频,1080P,已上传步骤2的第一帧,输出面板中显示完成的剪辑。值得注意面板上的内容:我们要求10秒,时长字段显示10,但渲染返回了5秒。运行报价在文件之前就告诉了我们这一点,这正是阅读它的全部原因。

H1 2026 月度GMV增长从$1,580到$3,460,增长45.7%

完成的数据剪辑,使用相同的GMV电子表格重建,每个数字完整

成果:相同的电子表格,通过有意设计去掉了图例和坐标轴刻度后重建。模型将两个脚本化的镜头压缩到了它实际渲染的五秒内,每个数字在移动中幸存了下来:开头的“$1,580”和“$3,460”,然后三个柱上方的“$3,460”、“$2,480”和“$1,580”。零个乱码标签,因为根本没有标签可乱。默认无声,因为图像转视频路径不会为你生成任何音频。

文档转视频的变体以及一分钟成品视频的成本

电子表格案例是最难的。其他三个官方用例更容易,而且大部分商业价值也在于此。

课件。 输入一篇百科条目,要求以特定阅读水平制作课程。下面的输出是关于诗人王维的Q版风格动画课程,时长25.03秒。

绘画风格贯穿始终。角色细节则不然。在第3秒处,他戴着黑色帽子,背景是纯白色;到第22秒,帽子变成了浅蓝色,他站在一幅古典卷轴画中。与演示文稿测试中看到的眼镜框漂移相同。如果你在三步链条上重建这个,请在步骤1中锁定一个角色卡片,并将步骤2的帧作为你的风格锚点重复使用。

百科条目变成一年级动画课程,25.03秒,含生成音频。阿里巴巴官方 Wan 3.0 公测演示。

品牌影片。 一份提案文档变成完整的30秒广告。这是四个演示中最漂亮的一个,也是最难验证的,因为你无法看到源文档的内容。关注一致性而非美观性:这是让第三方测试者出错的失败模式,其产品在一个剪辑中改变了三次形状。

提案文档变成30.04秒的护肤品牌影片。阿里巴巴官方 Wan 3.0 公测演示,含音频。

报告摘要。 没有针对此用例的官方演示,因此将该模式视为未经测试:要求一个主持人,每个镜头一个主张,并将每个数字放在引号内,完全按照步骤1。

现在来谈钱。

什么费率30秒成品视频
Wan 3.0, 1080p (人民币表)每秒钟¥1.2¥36
Wan 3.0, 1080p (美元表)每秒钟$0.20$6.00
Wan 3.0, 720p (人民币表)每秒钟¥0.6¥18
三步链条,一次生成脚本 + 帧 + 每秒钟$0.1渲染大约 $1.20 每10秒
三步链条,尝试3次脚本复用,帧和渲染重复大约 $3.50

两份已发布的 Wan 3.0 价格表在1080p是¥1.2还是每秒钟$0.20上存在分歧,这两个数字并不相同。在你预算系列之前,请确认你实际计费的端点的费率。

隐藏成本不是每秒费率。而是重新运行。文档输入每次任务只接受一个文件,因此更改单个数字意味着重新生成整个视频。在三步链条中,镜头脚本是一个可复用的文本产物,因此更改一个数字只需要一次渲染,而不是一次完整任务。在一个季度报告周期内,这个差异会远远超过每秒价格。

上传任何内容之前,请注意一条法律提示。你发送给托管模型的文档是离开你建筑的文档,内部演示文稿和未发布的财务数据通常有相关策略。请在截止日期压力到来之前检查,而不是之后。本文中的所有官方演示剪辑均属于阿里巴巴,作为公测材料在此引用;此处的任何内容都不构成商业复用的许可。

Wan 3.0 文档转视频常见问题解答

Wan 3.0 文档转视频可以接受哪些文件类型,以及大小限制?

doc, xls, ppt, pdf, txt 和 md,另有报告称支持 key, pages 和 numbers,此外还可以使用纯网页链接代替文件。每次任务一个文件或一个链接,最多100MB或50页。

Wan 3.0 是否将每张幻灯片转换为一个场景?

不,这是最常见的误解。它会读取整个文档,然后根据所学内容导演一段视频。在极限情况下,这是50页压缩到30秒,即每页0.6秒,因此它生成的是预告片而非翻页效果。官方用例和独立测试都指向同一方向。

我电子表格中的数字在视频中准确吗?

在我检查的每个案例中,单元格数值都保持完好,包括官方演示中的 $1,580、$3,460 和 +45.7%。失败的是图表元素:图例合并,坐标轴刻度出现非线性,千位分隔符丢失。将每个数字作为带引号的字面量注入,并完全从需求中设计掉图例和刻度标签。

我能否通过 API 今天就用上 Wan 3.0 文档转视频?

只能通过阿里巴巴自己的渠道,目前需要邀请制,且权重未发布。Wan 2.2 仍然是该系列中最后一个开源权重版本。在此变化之前,上述三步链条是实用的替代方案。

一个30秒的 Wan 3.0 视频需要多少钱?

按照已发布的1080p费率,即¥36,或国际价格表上的$6.00,用于一个30秒的剪辑。请为重新运行而非单次生成做预算,因为一个数字的修正意味着重新生成整个视频。

我现在能运行的最接近 Wan 3.0 文档转视频的是什么?

一个长上下文模型来编写镜头脚本,然后使用 Wan 2.7 以每秒$0.1进行渲染,或使用相同费率的 MiniMax H3 或每秒$0.134的 Seedance 2.5 作为替代。你能够得到生成式影像的外观和帧精确的文本。你得不到的:一次连续生成30秒、图像转视频渲染中同一轮次生成音频、或一个能为你读取 .pptx 的模型。

诚实的总结:Wan 3.0 文档转视频 是一项真实的能力,拥有真实的限制,并且其输出与你的期望之间的差距比看起来要小,只要你不再要求任何一个去绘制图例。

最新模型

一个 API,畅享全模态 AI。

探索全部模型