限时优惠 | Seedance 2.0 & 2.0 Mini 立减20%!

从一张静态图到一首歌:使用Seedream 5.0 Pro和Seedance 2.0制作情感化的MV

经过验证的 Seedream 5.0 Pro + Seedance 2.0 工作流程,用于AI音乐视频:关键帧提示配方、口型同步与物理提示、片段链接以及实际成本分解。

歌手并不存在。这首歌不是你的语言。但你仍能感受到它。

这就是创作者 Cia0 于2026年7月19日在X平台分享的一段视频下的反应:十五秒的角色演唱片段,标题为“即使一个字也听不懂也能感受到的歌曲”。描述文字用一行列出了整个技术栈:Seedream 5.0 Pro 用于图像,Seedance 2.0 用于视频,在 CapCut 上运行。真正打动人的是细节处理。嘴唇与歌声同步。头发像真发一样飘动。面部流露的是情感,而非摆拍。

本指南将逐步重建这个流程:哪个模型做什么,哪些提示词能在图像到视频的转换中传递情感,以及完成一部 MV 的实际成本。

创作者在夜晚的编辑桌,显示器显示AI歌手特写,第二台显示器显示带有音频波形的视频时间线

关键要点

  • 工作流程以图像为先:在 Seedream 5.0 Pro 中艺术指导关键帧,成本为 $0.045,只有在画面锁定后才支付视频费用。在静态图像中修正面部成本约为重新生成视频片段的二十分之一。
  • Seedance 2.0 图像转视频接受首帧加可选末帧,每次生成 4 到 15 秒并自带音频,并可返回末帧以便下一片段继续拍摄。
  • 将角色与你自己的曲目进行口型同步,使用参考转视频端点:最多 9 张图像、3 个视频和 3 个音频片段作为参考,并在提示词中使用 @提及。
  • 一部 40 秒、720p 竖屏 MV 在 2026 年 7 月的折扣价下大约花费 $10,只有你的配乐成本未计入。

值得复制的 Seedream + Seedance MV

两天内三个帖子,加上一个更早的口型同步测试,勾勒出这对组合所能覆盖的全部领域。它们都不是实验室演示。每个都列出了所用工具。

创作者发布时间片段展示内容工具链
@Cia0_exe2026年7月19日15 秒抒情演唱表演:口型同步、头发物理效果、滞留的情感Seedream 5.0 Pro + Seedance 2.0,在 CapCut 上运行(根据描述)
@Cia0_exe2026年7月20日15 秒“巅峰 2.5D 动漫动作”,工作室“需要数年”才能制作的那种相同的模型组合,在第三方应用上运行
@tjb_shizuka2026年7月20日30 秒“眼药水扭曲”旅行梗图,背景为瑞士湖泊,并公开邀请复制格式Seedream 静态图像,Seedance 2.0 动态,Mureka V9 配乐,OpenShot 剪辑
@CuriousRefuge2026年5月5日跨实拍和动画的多说话人口型同步测试参考图像、音频文件、摄影机和对话提示词

1.png

四个例子中有两点重复出现。首先,图像模型和视频模型被视为独立任务:选角在 Seedream 中完成,表演在 Seedance 中完成。其次,视频模型只是整个流程的中间环节。每个描述都列出了它周围的部分:运行的应用、配乐来源、剪辑编辑器。Cia0 的两个帖子都承诺在回复中提供“中文”提示词,而日文帖子在描述中直接列出了四个工具的组合。

为什么 Seedream 优先的工作流程优于纯文本转视频

Seedance 2.0 有相当不错的文本转视频模式。但上面制作片段的人都跳过了它,原因在于算术加控制。

在 Atlas Cloud 上,Seedream 5.0 Pro 的静态图像成本为 $0.045。一个 5 秒、720p 的 Seedance 2.0 片段在享受当前折扣后约为 $0.97。每一个在静态阶段发现的面部、服装或构图错误,只需要一个静态图像的成本来修正。每一个在视频阶段发现的问题,则需要大约 20 倍的价格重新生成整个片段,还要加上等待时间。

 直接文本转视频Seedream 关键帧优先
修正错误面部的成本≈$0.97 每 5 秒重新生成$0.045 每静态图像
多个片段间选角的一致性每次生成随机结果相同角色块,相同面部
构图控制依赖提示词和运气你先批准精确构图
错误出现在哪里在昂贵的步骤中在便宜的步骤中

对于 MV 来说,一致性最为关键。一部音乐视频会多次出现同一张脸。文本转视频每次生成都会重新创造角色。关键帧流程通过两种方式保持身份一致性:复用已批准的静态图像作为每个片段的起始帧,或者每次生成都提供相同的参考图像。你只需一次艺术指导,然后只为已经满意的动画支付视频费用。

在 Atlas Cloud 上运行 Seedream + Seedance 工作流程

流程的两个部分都在一个地方运行。Atlas Cloud 托管完整的 ByteDance 模型系列,因此 Seedream 5.0 Pro(自 2026 年 7 月 8 日起提供公共 API)和 Seedance 2.0(2026 年 2 月 12 日发布)位于同一账户、同一积分和同一 API 格式下。有两种工作方式:通过 Playground 点击操作,或通过代码串联端点。

方法 1:在 Playground 中生成 MV 镜头

第 1 步:在 Seedream 中塑造角色。 打开 Seedream 5.0 Pro playground,编写关键帧提示词(完整配方在下面两节)。立即匹配目标交付格式的宽高比:Shorts 和 TikTok 使用 9:16,YouTube 使用 16:9。每次运行返回一张图像,成本 $0.045,因此迭代直到面部、服装和光线完全正确。

Seedream 5.0 Pro 在 Atlas Cloud 上的 Playground 截图,表单中包含关键帧提示词,输出面板中显示 9:16 的特写歌手图片,“运行”按钮显示价格 $0.045。

第 2 步:将静态图像加载到 Seedance。 打开 Seedance 2.0 图像转视频 playground。该表单需要一张必填图像,即你已批准的关键帧,外加一个可选的末帧图像(如果你希望镜头以特定构图结束)。

第 3 步:编写动态提示词并设置片段。 时长范围 4 到 15 秒,或设置为“自动”让模型选择。选择与关键帧匹配的宽高比,或保留为“自动”。分辨率默认为 720p。

第 4 步:检查三个开关。 “生成音频”为片段提供原生声音。“水印”保持关闭以获得干净母版。“返回末帧”将结束帧作为单独图像返回;将其作为下一生成的首帧输入,新片段将从上一片段停止的地方继续。这个开关是四个不连贯片段与一个连续表演之间的区别。

第 5 步:查看价格,然后运行。 “运行”按钮在提交之前显示你确切设置的成本。截至 2026 年 7 月 21 日,一个 5 秒 720p 的片段在平台 20% 限时折扣下显示约为 $0.97(标价约为 $1.21)。

方法 2:通过一个 API 串联 Seedream 和 Seedance

第 1 步:获取你的 API 密钥。 在 Atlas Cloud 控制台中创建一个密钥,并将其导出为环境变量。不要在客户端代码中暴露它。

Atlas Cloud 首页控制台导航截图,显示顶部导航栏中 Console 按钮的位置,用于访问 API Keys 管理.png

Atlas Cloud API Keys 管理仪表盘截图,显示逐步过程:点击 API Keys 菜单,然后点击 Create API Key 按钮,并复制生成的 API 密钥.png

第 2 步:查看 API 文档。 端点、参数和轮询行为位于 API 文档中。整个流程是两个提交并轮询的循环。

第 3 步:进行两次调用。 首先是关键帧:

plaintext
1curl -X POST https://api.atlascloud.ai/api/v1/model/generateImage \
2  -H "Content-Type: application/json" \
3  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
4  -d '{
5    "model": "bytedance/seedream-v5.0-pro/text-to-image",
6    "prompt": "<你的关键帧提示词>",
7    "size": "1152*2048"
8  }'

轮询 GET /api/v1/model/prediction/ 直到任务完成,从输出中获取托管的图像 URL,然后直接传递到视频调用:

plaintext
1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Content-Type: application/json" \
3  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
4  -d '{
5    "model": "bytedance/seedance-2.0/image-to-video",
6    "prompt": "<动态和表演提示词>",
7    "image": "<Seedream 输出 URL>",
8    "duration": 10,
9    "resolution": "720p",
10    "ratio": "adaptive",
11    "generate_audio": true,
12    "return_last_frame": true
13  }'

image 接受 URL、Base64 或资产引用,duration 接受 -1 以让模型选择。watermark 默认为 false。当 return_last_frame 设置为 true 时,完成的预测包括作为图像返回的末帧,因此脚本可以循环:生成片段,获取末帧,提交下一个片段。这个循环就是大约三十行代码的整个 MV 流程。

两次调用使用相同的基础 URL、相同的 Bearer 标头和相同的预测轮询。这就是一体化 API 设计的实际优势:你的 Seedream 集成和 Seedance 集成仅通过一个模型字符串和几个字段来区分,而下一个 ByteDance 版本将适配到相同的代码中。

用于 MV 关键帧的 Seedream 5.0 Pro 提示词配方

MV 关键帧是一个选角决定,因此提示词的首要任务是定义一个你可以再次召唤的角色。工作模式是一个角色块:一句话,40 到 60 个词,锁定面部、头发和服装。在项目的每个关键帧提示词中逐字复用。更改一个词,你就有可能召唤一个陌生人。

以下是一个完整的关键帧提示词示例:

一位年轻女性,齐腰黑发,五官柔和圆润,戴着银色垂坠耳环,身穿宽松的奶油色针织毛衣。她独自站在黄昏时分雨水湿润的屋顶上,从肩部以上平视角度拍摄。她眼睛湿润,嘴唇微张,仿佛即将歌唱,目光略过镜头。背后是冷蓝色城市的光芒,脸侧有一道温暖边缘光,浅景深,电影感静帧,柔和颗粒,9:16。

第一句是角色块。之后的所有内容随镜头变化。一个 MV 需要一个小覆盖面集,而非一张图像:

镜头目的提示词中变化的内容固定不变的内容
全景建立地点和氛围地点细节,全身构图角色块,光线方向
中景主歌表演“腰部以上构图”,一个手势角色块
特写副歌情感高潮“肩部以上”,面部细节角色块

两个 Seedream 特有的注意事项。将情感描述为物理证据,而非标签:“眼睛湿润,下巴紧绷,屏住呼吸”在后续动画中更生动,而“悲伤”则沦为刻板表情。在尺寸选择器中设置宽高比,而不仅仅在文字中描述,因为参数设置优先。有关更深入的提示词结构,包括排除模式以及模型已知的 bug,请参阅我们的 Seedream 5.0 Pro 提示词指南

用于口型同步、物理效果和情感的 Seedance 2.0 提示词

关键帧为 Seedance 2.0 提供了一个值得动画化的面孔。动态提示词决定了片段是表演还是仅仅移动。Seedance 2.0 原生生成双声道音频,并在八种以上语言中实现音素级口型同步(根据 ByteDance 的发布文章),因此提示词的任务是告诉它正在表演什么、由谁表演以及摄像机如何对待。

有两种方式实现歌唱角色。

路径 A,生成歌曲: 留在图像转视频,打开“生成音频”开关,并在提示词中描述人声。模型会创作音乐并根据自己的轨道同步口型。这是最快获得 Cia0 风格表演片段的路径。

路径 B,你自己的曲目: 切换到参考转视频,该端点每次运行最多接受 9 张参考图像、3 个视频和 3 个音频片段。上传你的歌曲部分作为音频参考,添加你的关键帧作为图像参考,并在提示词中使用 @提及来将角色绑定到动作。这是 Curious Refuge 在五月验证过的多说话人口型同步配方:“一张参考图像”,“一个黑屏视频包含音频或音频文件”,以及“一个提示词(摄像机运动 + 旁白/对话)”。在上传前将音频修剪到片段长度;计费 Token 包含输入时长加上输出时长,因此填充会浪费实际金钱。

Curious Refuge 的 X 帖子,描述 Seedance 2.0 口型同步测试:上传参考图像、黑屏视频(带音频)或音频文件,以及摄像机运动加对话提示词,下方是一个四镜示例提示词和一张参考图像,显示夜晚汽车后座的一男一女。

区分表演与屏幕保护程序的提示词线索:

你想要的有效的提示词线索为什么有效
清晰的口型同步指出语言和演唱风格:“她用普通话缓缓演唱一首抒情歌,轻柔的呼吸声”音素级同步需要知道正在唱什么
头发和布料物理效果为力给出原因:“一阵风吹起她的头发,毛衣随之飘动”物理效果遵循明确描述的力,而非形容词
可见的情感带有时间节点的物理细节:“她在长音上闭上眼睛,眼角一颗泪珠”模型对动作的动画化远好于对情绪本身
摄像机感觉每个片段一个运动:“从中景缓缓推近到特写”堆叠的摄像机运动在 15 秒内会相互冲突
多镜头戏剧按顺序描述序列:“以天际线开场,当人声进入时切到她的脸”Seedance 2.0 原生处理多镜头序列,一次运行即可

超过 15 秒的内容是拼接任务:使用设置部分中的“返回末帧”技巧,在每个新提示词中加入歌曲的下一行。保持 Seedream 提示词中的角色块措辞也出现在动态提示词中。冗余是保持身份一致性的廉价保险。

从 Seedance 片段到完成的 MV:剪辑和预算

日文“眼药水扭曲”帖子最清晰地展示了完成阶段,因为创作者在描述中列出了整个装配线:Seedream 用于静态图像,Seedance 2.0 用于动态,Mureka V9 用于配乐,OpenShot(免费桌面编辑器)用于剪辑。Cia0 的片段则指定 CapCut 作为其平台。无论你选择哪个编辑器,剪辑工作都是一样的:首先铺好完整轨道,在节拍上修剪片段,并从头到尾保持一个宽高比。

日文 X 帖子,标签 #AI目薬ワープ,列出其工具链:Seedream 用于图像生成,Seedance 2.0 用于视频,Mureka V9 用于背景音乐,OpenShot 用于剪辑,上方是暖橙色灯光下的木制螺旋楼梯视频帧。

关于 CapCut 路径的说明。在 CapCut 内部,Seedance 2.0 作为 Dreamina Seedance 2.0 运行,自 2026 年 4 月 7 日起在美国可用,根据 CapCut 自己的公告,它带有一些限制,包括阻止从包含真实面部的图像生成视频,以及在输出上添加可见水印。对于梗图来说没问题,但对于干净的 MV 母版来说有限制。API 和 Playground 路径默认关闭水印,并接受你生成的任何关键帧。

整个项目的成本,基于 2026 年 7 月 Atlas Cloud 的折扣价:

阶段模型或工具数量成本
关键帧Seedream 5.0 Pro10 张静态图像,每张 $0.045$0.45
动态草稿Seedance 2.0 Mini 图像转视频4 个片段 × 10 秒,每秒 $0.045$1.80
最终片段Seedance 2.0 图像转视频,720p4 个片段 × 10 秒,每秒 ≈$0.1935≈$7.74
配乐你自己的曲目,或 AI 音乐模型1 首歌不定
剪辑CapCut 或 OpenShot1 次剪辑$0
总计 ~40 秒完成的 MV≈$10

草稿行是很多人跳过但不应跳过的。Seedance 2.0 Mini 运行相同的首帧加提示词工作流程,每秒成本 $0.045(标价 $0.056),约为旗舰版 720p 费率的四分之一,因此分镜、摄像机运动和物理效果可以在最终渲染前廉价地调试。如果没有折扣,同样的预算在标价下约为 $12.40,仍然低于大多数素材库订阅的月费。

常见问题解答

Seedance 2.0 能否将角色与我自己的歌曲进行口型同步?

可以。使用参考转视频端点,该端点每次生成最多接受 3 个音频片段,以及 9 张图像和 3 个视频。上传歌曲部分作为音频参考,添加你的 Seedream 关键帧作为图像参考,在提示词中使用 @提及,并描述表演和摄像机。先修剪音频到片段长度,因为计费 Token 包含输入时长加上输出时长。

Seedream 和 Seedance 的提示词必须用中文吗?

不需要。Cia0 分享的是中文提示词,围绕 ByteDance 模型的中文提示词文化很强,但两个模型都接受英文提示词,Seedance 2.0 的口型同步在八种以上语言中在音素级别工作。重要的是在提示词中指定人声的语言,以便嘴型与轨道匹配。

单个 Seedance 2.0 生成可以持续多长时间?

每次运行 4 到 15 秒,支持在该窗口内进行多镜头序列,或者将时长设置为 -1 让模型选择。对于完整的 MV,需要拼接生成:启用“返回末帧”,并从上一片段的结束帧开始下一个片段,使表演保持连续。

我的 MV 片段会有水印吗?

默认情况下 API 和 Playground 没有水印:watermark 参数默认为 false,因此母版输出是干净的。CapCut 消费者版本则不同。Dreamina Seedance 2.0 会应用可见水印,并阻止从包含真实面部的图像生成视频,这是其 2026 年重新发布时附带的安全措施包的一部分。

完整的 Seedream + Seedance MV 成本是多少?

在 2026 年 7 月的折扣价下,一部 40 秒 720p 竖屏视频大约 $10:关键帧 $0.45,Mini 草稿 $1.80,最终 720p 片段约 $7.74,使用 CapCut 或 OpenShot 剪辑免费。按标价计算,同样的运行约为 $12.40。关键帧阶段是保持成本如此之低的原因,因为画面决策在 $0.045 时做出,而不是在每次重新生成约 $0.97 时做出。

结论

本月流传的片段并非某个秘密功能的成果。它们体现的是分工合作:Seedream 5.0 Pro 决定谁在屏幕上以及画面感觉如何,Seedance 2.0 决定他们如何移动和发声,而免费编辑器将片段变成一首有面孔的歌曲。每个步骤都是可检查的,每个错误都在最便宜的地方被捕获。

借鉴这个操作顺序。锁定一个角色块,以 $0.045 的价格购买你的错误,只对你已经批准的进行动画化,让一个片段的末帧打开下一个片段。工具是新的。但纪律只是电影制作。

最新模型

一个 API,畅享全模态 AI。

探索全部模型

Join our Discord community

Join the Discord community for the latest model updates, prompts, and support.