仅限两周 | Seedream 5.0 Pro 立享 8 折!

一个API密钥,一部15秒短片:完整的Seedream 5.0 15秒工作流

深度图 Seedream 5.0 15秒工作流:将几何与风格分离,故事板九个镜头,并仅用一个API密钥渲染一部电影短片。完整提示词在内。

我是在一个周末里完成的:一位孤独的守护者走进一座无尽的档案馆,翻开一本书,光芒从书页中倾泻而出。时长十五秒。角色设计、故事板、动态,全部由 AI 生成,全部来自一个 API 密钥。没有渲染农场,没有三应用管线,没有插件动物园。

诀窍不在于更聪明的提示词,而在于将任务一分为二。大多数人要求一个模型同时搞定色彩、光照、纹理和几何结构,然后纳闷为什么结果看起来平淡。这就是 Seedream 5.0 15s 工作流解决此问题的方案:先用深度图锁定几何结构,之后再绘制风格。下面是完整的管线,以及我实际使用的每一个提示词。

关键要点

  • Seedream 5.0 15s 工作流的核心操作:将几何结构(深度图)与风格(色卡)分离,这样你就可以在不破坏构图的前提下无数次地重新样式化一个镜头。
  • 九个相机角度预先作为一张 3x3 深度网格进行故事板编排,这能让视频模型保持连续性,而不是凭空创造九个无关的帧。
  • 2026 年 7 月下旬验证的价格:Seedream 5.0 Pro 图像在 1.5K 层级起步价为 0.045 美元,大约是 GPT Image 2 高质量版价格的五分之一。图像使用 Seedream 5.0 Pro,视频使用 Seedance 2.0,一个密钥。

为什么在 Seedream 5.0 15s 工作流中先使用深度图

几何结构是图像模型最先丢失的东西。要求它一次解决色彩、光照、材质和 3D 空间,空间就会坍塌,这就是为什么很多 AI 艺术看起来像是一张漂亮的贴纸,内部没有空间感。解决办法借鉴了扩散工具中一个成熟的想法:给模型提供一个控制图像,让它在此基础上构建固定结构(ControlNet,ICCV 2023)。

人们通常会用到三种控制图像,它们之间的差距比看起来要大。以下是它们在这个工作流中的比较。

控制图像编码内容为什么有帮助失败之处
线稿边缘、姿势、构图锁定布局和角色姿势没有深度信息,所以画面仍然显得扁平
3D 白色模型体积和剪影真实的体量感过度控制:黏土渲染效果会渗入最终图像,且无法去除
深度图仅距离(白色近,黑色远)精确的空间,无风格污染需要单独的样式处理,而这正是重点

故事板,展示一个人变形为巨型机甲面对怪物

一个线稿故事板:边缘和姿势被锁定,但每个画面都显得扁平,没有深度

线稿仅锁定姿势,别无他用。模型无法判断远近,所以画面保持扁平。

故事板,展示一个人变形为巨型机器人对抗怪物

同一个故事板,以 3D 白色模型渲染,灰色黏土外观占据了整个图像

3D 白色模型有体积,但过度控制。模型把那种灰色黏土皮肤当作图像本身,后续每一步你都得与这种塑料渲染效果作斗争。

深度图只编码一件事:到摄像机的距离。白色近,黑色远,中间是连续的灰色渐变(Depth Anything V2,2024)。这使得它比线稿更精确,因为它承载了真实空间;也比白色模型更干净,因为它没有材质和风格会泄露。在任何外观之上叠加,几何结构都不会被污染。先干净地锁定几何结构,之后再添加风格。这一个习惯保证了 Seedream 5.0 15s 工作流的其余部分能够保持稳定。

一个 API 密钥运行整个 Seedream 5.0 15s 工作流

这之所以能成为一个周末项目,而不是系统集成难题,是因为链条中的每个模型都位于一个端点之后。图像在 Seedream 5.0 Pro 上运行,视频在 Seedance 2.0 上运行,两者都通过 Atlas Cloud 上的同一个 API 密钥响应。无需在角色卡和最终渲染之间切换平台,无需协调两个计费仪表板,无需第二个 SDK。

这比听起来更重要。一个 15 秒的短片在这条管线中至少涉及五次图像生成和一次视频处理。如果分散到三个供应商,你一半的时间都会花在连接工作上。保持在同一个密钥下,摩擦几乎为零。

获取密钥大约需要一分钟:打开控制台,进入 API 密钥,创建一个,复制它。然后,将任何 HTTP 客户端指向兼容 OpenAI 的图像端点,你就可以开始生成了。

Seedream 5.0 15s 工作流,从面孔到成片的六个步骤

管线共六步,只有前两步构建可复用的资产。之后的所有步骤都是组合和动态。将角色和风格向前传递,保持锁定,模型就不会偏离。以下是全貌概览,然后我们再逐步深入。

步骤锁定内容模型输入到输出
1 角色卡身份、服装Seedream 5.0 Pro多视图参考到五角度角色表
2 风格卡色彩分级、外观Seedream 5.0 Pro电影静帧到调色色卡
3 定场帧第一个镜头Seedream 5.0 Pro角色卡加风格卡到第一帧
4 深度图纯几何结构Seedream 5.0 Pro定场帧到灰度深度通道
5 3x3 故事板九个相机角度Seedream 5.0 Pro帧加深图到九面板深度网格
6 视频动态、连续性Seedance 2.0面孔加帧加故事板到 15 秒序列
  1. 角色卡:锁定身份。 将多视图参考输入 Seedream 5.0 Pro,得到一个包含同一面孔五个角度的角色表。一个能避免后期大量麻烦的技巧:如果你已经有了一张干净的正面头部特写,删除全身视图上的面孔。每个角度只保留一张面孔,可以防止视频模型在镜头中途漂移到陌生人。

女性穿长深绿色大衣的多个角度

档案管理员的五角度角色卡:全身、背面、正面头部特写,以及两个四分之三视角

  1. 风格卡:锁定调色。 不让模型随意发挥外观,而是拉取一个参考。从你喜欢的电影中抓取几帧,提取调色板形成色卡,然后将其作为风格锚点反馈回去。外观来自这里,构图不来自这里。我向 Seedream 5.0 Pro 提供了一些《银翼杀手2049》的静帧,让它提取调色板——那种温暖琥珀色过渡到深沉墨青色阴影的色调,正是罗杰·迪金斯为这部电影构建的(美国电影摄影师,2017)。

四个黄色电影静帧上方显示匹配的调色板

根据《银翼杀手2049》静帧构建的色卡,带有六色琥珀到墨青调色板

六个土褐色和金色色块,标注有十六进制代码

提取的六色调色板条:深棕色到琥珀色再到暖灰色

  1. 定场帧。 角色卡加风格卡,得到场景的第一帧。这是步骤 2 中的色彩读数完全显现的地方。

人物手持灯笼站在高耸、阳光充足的图书馆中

定场镜头:档案管理员渺小而居中,位于对称的一点透视通道中

Plain
1电影定场镜头,以丹尼斯·维伦纽瓦 / 罗杰·迪金斯的风格构图:严谨的中心一点透视对称,宏伟的尺度感,强烈的负空间,安静而充满敬畏。
2
3场景:一个巨大的、看似无限的大教堂规模图书馆-档案馆内部。高耸的垂直书架在两侧对称地向后延伸,沿着一条中央通道通向远处一个发光的温暖消失点。体积感琥珀色上帝之光光束穿过精细的浮尘和几张飘落的散页。三个清晰的深度层:靠近摄像机的锐利前景书架边缘,中景通道中的主人公,以及无限后退的金色雾状背景。
4
5主人公,身份和服装锁定到图像 1。仅将图像 1 作为身份和服装参考;不要复制其参考表布局或灰色工作室背景。同一位女性:她的面孔和特征不变,及地深墨青色羊毛大衣内搭奶油色高领毛衣,低马尾。她手持一盏点亮的黄铜油灯,在她周围投下一片温暖的光晕。她渺小而居中地站在深远通道的远处,从低角度看去,被高耸的书架衬托得渺小。
6
7调色和光学,匹配图像 2:温暖的金色琥珀高光过渡到深沉的去饱和墨青色阴影,低对比度,柔和提亮的干净黑色;长椭圆变形散景,在最亮的光束上出现微弱的水平镜头光晕,高光处有柔和的 Black Pro-Mist 辉光,精细的 35mm 柯达胶片颗粒,2.00 变形宽银幕构图。
8
9电影 35mm 胶片静帧,照片级真实,超详细,宏伟。非 CGI,非 3D 渲染,非游戏引擎外观。
  1. 深度图:Seedream 5.0 15s 工作流的关键。 将该帧转换为纯灰度深度通道。白色近,黑色远,风格剥离,仅几何结构。现在构图成为独立的一层,你可以无数次地重新样式化,而无需触及结构。

白色剪影站在高书架之间,面对黑暗虚空

定场帧转换为灰度深度图:白色前景书架渐变为黑色深度

Plain
1将此图像重新解释为单通道线性深度通道,一种灰度 Z 深度图,类似于 3D 渲染器从其深度缓冲区写入的图,或 LiDAR 范围图像。亮度仅编码到摄像机的距离:最近可见表面为纯白色,最远为纯黑色,两者之间所有物体为连续单调的中间灰度斜坡。将标尺一次锚定到整个帧,使得图像中任何地方相同距离读取为相同灰色;切勿按区域自动对比度。保持几何结构精确:圆形体积获得平滑连续渐变,重叠物体在清晰硬边界的遮挡边缘处断裂,细结构和剪影保持可读,相连表面保持稳定值。距离是唯一变量:平坦的深度驱动灰色,无反照率,无纹理,无投射阴影,无方向光,无轮廓,无环境光遮蔽。输出干净的深度通道,别无其他。
  1. 3x3 深度故事板。 只需要一张图像?跳过这一步。要制作视频?你需要一个完整的故事板,预先构建九个镜头,共享一个深度约定和连续性,而不是九个各自为政的帧。输入两张图像:彩色定场帧(场景内容)和深度图(距离编码方式)。下面的提示词迫使每个面板使用不同的摄像机,这能防止视频模型默认九次使用相同的居中通道。

九张灰度面板,展示一个人探索一个巨大的超现实图书馆

3x3 网格的九个灰度深度通道,每个都是同一个档案馆的不同摄像机角度

Plain
1你是一个深度图故事板生成器。输出一张图像:一个干净的 3x3 网格,包含来自一个连续场景的九个连续镜头,每个面板都是灰度线性深度通道(白色 = 最近,黑色 = 最远),别无其他。
2
3输入,图像 1 是一个居中的对称定场深度通道。用它做两件事:(a) 灰度线性深度约定和色调范围,以便在所有九个面板中匹配;(b) 要在面板 2 中复制的确切构图。同时从中读取角色、服装(及地大衣、黄铜油灯)和档案馆设计语言。
4
5关键,构图多样性(最高优先级):每个面板必须使用不同的摄像机,不同的景别、高度、方位角、倾斜度。仅面板 2 可以使用居中的对称一点透视通道;禁止所有其他面板使用居中的对称通道。采用电影化构图:斜角、耙状对角线柱廊、虫眼垂直视角、高俯视角度、强烈偏离中心的非对称构图、荷兰式倾斜、深负空间。
6
7故事(九个面板 = 一个连续事件;一位穿长外套、提黄铜油灯的孤独女档案管理员发现一本书并伸手去拿;从左到右阅读,顶行,中间,底部):
81. 建立,高角度俯拍,靠近拱形天花板,斜向下看,通道对角线延伸,主角在对角线上微小。
92. 到达,来自图像 1 的居中对称定场构图。
103. 发现,极低虫眼视角,几乎垂直向上看一个高耸的书架,朝向高处一个小的目标书本。
114. 反应,中景特写,强烈偏离中心:主角的脸位于右侧三分之一,向左上方看,轻微荷兰式倾斜。
125. 准备,一个斜角构图,主角在转角处渺小并向上伸手,巨大的黑暗负空间虚影占据了一半。
136. 插入细节,极端微距;书架以陡峭对角线延伸,她的手和一个书脊在近角处清晰。
147. 主要动作,斜向视野穿过一排高耸的垂直鳍片,斜向耙状排列,打开的书本在近前景中大幅呈现。
158. 后果,高角度俯视,散落的书页穿过多个深度层飘散和落下。
169. 结局,从高处角落升起的斜向极宽全景,揭示档案馆是一个巨大的非对称结构。
17
18连续性:在所有面板中保持相同,角色身份、外套、油灯、头发、书架和建筑设计、场景比例。只有摄像机和姿势变化。
19
20深度渲染:每个面板都是单通道线性深度通道,灰度 Z 深度,亮度 = 仅距离。最近为纯白色,最远为纯黑色,一个连续单调斜坡;锚定标尺一次,并相同地应用于所有九个。无颜色,无纹理,无方向光,无投射阴影,无发光,无环境光遮蔽,无景深模糊,无颗粒。
21
22网格:正好九个面板,三个等高的行和三个等宽的列,相同的宽高比,薄而均匀的间距。任何地方无标题、数字、标签、箭头、边框或颜色。
  1. 视频。 将面孔、定场帧和 3x3 故事板输入 Seedance 2.0,它会根据你的故事板逐镜头渲染序列。深度网格在这里发挥了实际作用:因为每个面板都编码了距离,模型可以模拟视差,并在镜头之间保持物体位置稳定,而不是在每次切换时重新排列场景。

发光纸张从图书馆书架之间的一道明亮光束中迸发而出

成片中的一帧:档案馆的俯拍镜头,光线爆发,书页散落

Plain
1一个电影化的 15 秒连续单镜头,2.00 变形宽银幕,照片级真实 35mm 胶片外观,带有精细柯达颗粒,无 AI 光泽。场景:一个巨大的、看似无限的高耸书架图书馆-档案馆内部,书架退入温暖的黑暗。视觉风格:温暖的金色琥珀主光过渡到深沉的去饱和墨青色阴影,体积感上帝之光光束穿过精细浮尘,维伦纽瓦 / 迪金斯史诗风格。导演主题:一位孤独的守护者行走在每一个被书写过的故事的无限档案馆中,找到一本发光的书并打开它,光芒和世界从书页中倾泻而出。
2
3锁定:
4- 身份:图像 1 是女性面孔和身份的唯一来源,在每一个镜头中保持她的面孔相同,永不漂移。
5- 服装、第一帧和调色:图像 2 是第一帧和外观,匹配其温暖的琥珀色与墨青色调色、变形光学和整个影片中的 35mm 颗粒。
6- 构图和摄像机:图像 3 是一个 3x3 深度图故事板,包含九个镜头构图;从图像 3 开始按顺序驱动序列(面板 1 到面板 9),每个镜头匹配其面板的取景、景别和摄像机角度。
7- 连续性:同一女性,同一外套,同一油灯,整个过程中同一档案馆建筑和比例。
8- 负面锁定:无手部变形,一致的自然手指,无面部扭曲,无重复或漂浮的肢体,任何地方无文字或标题。
9
10时间线(从图像 3 驱动;所有光线由油灯和发光书本激发):
110-2 秒 镜头 1(面板 1),高斜向俯拍,缓慢漂移进入。
122-3.5 秒 镜头 2(面板 2),居中对称广角,沿轴线缓慢推进。
133.5-5 秒 镜头 3(面板 3),极端虫眼视角,向上对准一本发光的书。
145-6.5 秒 镜头 4(面板 4),偏离中心的中景特写,她的眼睛抬起,带着安静的敬畏。
156.5-8 秒 镜头 5(面板 5),斜角,她向上伸手,进入深负空间。
168-9.5 秒 镜头 6(面板 6),紧微距,她的手指滑出一本书。
179.5-11.5 秒 镜头 7,第一人称视角,她的手拿着书打开,温暖的光线向镜头爆发。
1811.5-13.5 秒 镜头 8(面板 8),高角度,散落的书页在她周围的通道中飘动。
1913.5-15 秒 镜头 9(面板 9),从高处角落升起的斜向极宽全景,她渺小地站在广阔档案馆中,现在温暖地发光。

Seedream 5.0 15s 工作流的实际成本

整个短片生成成本不到一杯咖啡。这条管线在单个帧移动之前会产生一堆图像:角色卡、风格卡、定场帧、深度图和九面板故事板,因此是五次图像生成加一次视频处理。这就是每张图像的价格不再是四舍五入的误差,而是决定你是自由迭代还是定量尝试的关键所在。以下所有数字均来自 Atlas Cloud 模型定价页面,验证时间为 2026 年 7 月下旬。

工作流中的资产模型层级标价当前(8折)
角色卡Seedream 5.0 Pro1.5K$0.05$0.04
风格 / 色卡Seedream 5.0 Pro1.5K$0.05$0.04
定场帧Seedream 5.0 Pro2K$0.09$0.07
深度图Seedream 5.0 Pro1.5K$0.05$0.04
3x3 深度故事板Seedream 5.0 Pro2K$0.09$0.07
图像小计$0.32$0.25
15 秒视频(720p)Seedance 2.0720p$0.2419 / 秒按秒计

以 720p 每秒 $0.2419 计算,完整的 15 秒序列大约增加 $3.63,因此整个短片(图像和动态合计)生成成本低于 $4。Seedance 2.0 在输入视频时还会降至每秒 $0.1486,其参考转视频模式最多可接受九张参考图像,这正是故事板驱动序列所需要的。

图像经济性让我多看了一眼。Seedream 5.0 Pro 帧在 1.5K 层级起步价为 $0.045,大约是 GPT Image 2 高质量版(1024 像素帧 $0.21572,1536x1024 为 $0.16964)的五分之一。即使在完整的 2K 层级(GPT Image 2 无法达到),Seedream 5.0 Pro 每张图像 $0.09,仍不到后者价格的一半,同时输出更大的帧。每个短片生成五张图像,或一批生成五十张,这个差距会迅速累积。

注意时机:Seedream 5.0 Pro 目前正在限时打八折,因此在促销窗口期间,1.5K 帧实际为 $0.036,2K 帧为 $0.072。价格和促销活动会变动,所以在预算大批量生成之前,请查看模型页面。

将 Seedream 5.0 工作流扩展到单个短片之外

深度与风格分离不仅适用于电影拍摄。同样的原则——先锁定结构,将连续性视为独立层——正是 Seedream 5.0 Pro 能够一次在多个面板上保持一致设计系统的原因。这在任何需要一组彼此协调的图像(而非单张主角帧)的场景中都很有用。

建筑师勒·柯布西耶从 1907 年到 1965 年的生活与工作年表

一个九面板传记年表布局,每个卡片采用一致的设计系统

多面板知识卡片或轮播图与九镜头故事板是同一个问题:在内容逐格变化时,保持字体、间距和色彩语言一致。Seedream 5.0 系列在这方面异常强大,因为它能很好地处理结构化布局和文本渲染,这是它与其他前沿图像模型抗衡的领域之一。构建一次网格,保持约定锁定,每个面板看起来就像是一个整体。

深度图、故事板、色卡,所有这些都是你在提交前仔细思考一个镜头的方式。工具变得越来越狂野和便宜。但它们仍然无法决定你真正想讲述什么故事。

常见问题

用一句话概括 Seedream 5.0 15s 工作流是什么?

这是一个六步管线,将几何结构与风格分离:你将场景构图锁定为灰度深度图,将九个摄像机角度编排为单个 3x3 深度网格,然后将这些加上锁定的角色和色彩分级输入视频模型,渲染出一个 15 秒的短片。

这个工作流需要 Stable Diffusion 或 ComfyUI 吗?

不需要。深度图的想法来自 ControlNet 工具,但这个工作流完全在托管的 API 模型上运行。你在 Seedream 5.0 Pro 上生成所有图像,在 Seedance 2.0 上生成视频,两者通过同一个 API 密钥,因此无需本地安装、无需 GPU、无需维护节点图。

Seedream 5.0 15s 工作流每部短片的成本是多少?

2026 年 7 月下旬按标价生成大约 4 美元。五张图像资产在 Seedream 5.0 Pro 上总计约 0.315 美元,15 秒 720p 片段在 Seedance 2.0 上以每秒 0.2419 美元计算约增加 3.63 美元。当前的八折优惠进一步降低了图像成本。请始终在实时模型页面上确认。

Seedream 5.0 15s 工作流能保持一个角色一致吗?

可以,这正是第一步的目的。你构建一个五角度角色卡,删除重复的面孔,使每个角度保持一个干净的参考,然后在故事板和视频提示中锁定该图像作为唯一身份来源。深度故事板处理构图,而角色卡处理面孔。

为什么深度图在这里优于线稿或 3D 白色模型?

线稿锁定姿势但不携带空间信息,因此画面保持扁平。3D 白色模型增加了体积,但会将灰色黏土外观带入最终图像。深度图只编码距离(白色近,黑色远),因此提供精确的几何结构,且无风格污染,这让你可以按照需要多次重新样式化同一个构图。

最新模型

一个 API,畅享全模态 AI。

探索全部模型