歌手并不存在。这首歌不是你的语言。但你仍能感受到它。
这就是创作者 Cia0 于2026年7月19日在X平台分享的一段视频下的反应:十五秒的角色演唱片段,标题为“即使一个字也听不懂也能感受到的歌曲”。描述文字用一行列出了整个技术栈:Seedream 5.0 Pro 用于图像,Seedance 2.0 用于视频,在 CapCut 上运行。真正打动人的是细节处理。嘴唇与歌声同步。头发像真发一样飘动。面部流露的是情感,而非摆拍。
本指南将逐步重建这个流程:哪个模型做什么,哪些提示词能在图像到视频的转换中传递情感,以及完成一部 MV 的实际成本。

关键要点
- 工作流程以图像为先:在 Seedream 5.0 Pro 中艺术指导关键帧,成本为 $0.045,只有在画面锁定后才支付视频费用。在静态图像中修正面部成本约为重新生成视频片段的二十分之一。
- Seedance 2.0 图像转视频接受首帧加可选末帧,每次生成 4 到 15 秒并自带音频,并可返回末帧以便下一片段继续拍摄。
- 将角色与你自己的曲目进行口型同步,使用参考转视频端点:最多 9 张图像、3 个视频和 3 个音频片段作为参考,并在提示词中使用 @提及。
- 一部 40 秒、720p 竖屏 MV 在 2026 年 7 月的折扣价下大约花费 $10,只有你的配乐成本未计入。
值得复制的 Seedream + Seedance MV
两天内三个帖子,加上一个更早的口型同步测试,勾勒出这对组合所能覆盖的全部领域。它们都不是实验室演示。每个都列出了所用工具。
| 创作者 | 发布时间 | 片段展示内容 | 工具链 |
|---|---|---|---|
| @Cia0_exe | 2026年7月19日 | 15 秒抒情演唱表演:口型同步、头发物理效果、滞留的情感 | Seedream 5.0 Pro + Seedance 2.0,在 CapCut 上运行(根据描述) |
| @Cia0_exe | 2026年7月20日 | 15 秒“巅峰 2.5D 动漫动作”,工作室“需要数年”才能制作的那种 | 相同的模型组合,在第三方应用上运行 |
| @tjb_shizuka | 2026年7月20日 | 30 秒“眼药水扭曲”旅行梗图,背景为瑞士湖泊,并公开邀请复制格式 | Seedream 静态图像,Seedance 2.0 动态,Mureka V9 配乐,OpenShot 剪辑 |
| @CuriousRefuge | 2026年5月5日 | 跨实拍和动画的多说话人口型同步测试 | 参考图像、音频文件、摄影机和对话提示词 |

四个例子中有两点重复出现。首先,图像模型和视频模型被视为独立任务:选角在 Seedream 中完成,表演在 Seedance 中完成。其次,视频模型只是整个流程的中间环节。每个描述都列出了它周围的部分:运行的应用、配乐来源、剪辑编辑器。Cia0 的两个帖子都承诺在回复中提供“中文”提示词,而日文帖子在描述中直接列出了四个工具的组合。
为什么 Seedream 优先的工作流程优于纯文本转视频
Seedance 2.0 有相当不错的文本转视频模式。但上面制作片段的人都跳过了它,原因在于算术加控制。
在 Atlas Cloud 上,Seedream 5.0 Pro 的静态图像成本为 $0.045。一个 5 秒、720p 的 Seedance 2.0 片段在享受当前折扣后约为 $0.97。每一个在静态阶段发现的面部、服装或构图错误,只需要一个静态图像的成本来修正。每一个在视频阶段发现的问题,则需要大约 20 倍的价格重新生成整个片段,还要加上等待时间。
| 直接文本转视频 | Seedream 关键帧优先 | |
|---|---|---|
| 修正错误面部的成本 | ≈$0.97 每 5 秒重新生成 | $0.045 每静态图像 |
| 多个片段间选角的一致性 | 每次生成随机结果 | 相同角色块,相同面部 |
| 构图控制 | 依赖提示词和运气 | 你先批准精确构图 |
| 错误出现在哪里 | 在昂贵的步骤中 | 在便宜的步骤中 |
对于 MV 来说,一致性最为关键。一部音乐视频会多次出现同一张脸。文本转视频每次生成都会重新创造角色。关键帧流程通过两种方式保持身份一致性:复用已批准的静态图像作为每个片段的起始帧,或者每次生成都提供相同的参考图像。你只需一次艺术指导,然后只为已经满意的动画支付视频费用。
在 Atlas Cloud 上运行 Seedream + Seedance 工作流程
流程的两个部分都在一个地方运行。Atlas Cloud 托管完整的 ByteDance 模型系列,因此 Seedream 5.0 Pro(自 2026 年 7 月 8 日起提供公共 API)和 Seedance 2.0(2026 年 2 月 12 日发布)位于同一账户、同一积分和同一 API 格式下。有两种工作方式:通过 Playground 点击操作,或通过代码串联端点。
方法 1:在 Playground 中生成 MV 镜头
第 1 步:在 Seedream 中塑造角色。 打开 Seedream 5.0 Pro playground,编写关键帧提示词(完整配方在下面两节)。立即匹配目标交付格式的宽高比:Shorts 和 TikTok 使用 9:16,YouTube 使用 16:9。每次运行返回一张图像,成本 $0.045,因此迭代直到面部、服装和光线完全正确。

第 2 步:将静态图像加载到 Seedance。 打开 Seedance 2.0 图像转视频 playground。该表单需要一张必填图像,即你已批准的关键帧,外加一个可选的末帧图像(如果你希望镜头以特定构图结束)。
第 3 步:编写动态提示词并设置片段。 时长范围 4 到 15 秒,或设置为“自动”让模型选择。选择与关键帧匹配的宽高比,或保留为“自动”。分辨率默认为 720p。
第 4 步:检查三个开关。 “生成音频”为片段提供原生声音。“水印”保持关闭以获得干净母版。“返回末帧”将结束帧作为单独图像返回;将其作为下一生成的首帧输入,新片段将从上一片段停止的地方继续。这个开关是四个不连贯片段与一个连续表演之间的区别。
第 5 步:查看价格,然后运行。 “运行”按钮在提交之前显示你确切设置的成本。截至 2026 年 7 月 21 日,一个 5 秒 720p 的片段在平台 20% 限时折扣下显示约为 $0.97(标价约为 $1.21)。
方法 2:通过一个 API 串联 Seedream 和 Seedance
第 1 步:获取你的 API 密钥。 在 Atlas Cloud 控制台中创建一个密钥,并将其导出为环境变量。不要在客户端代码中暴露它。


第 2 步:查看 API 文档。 端点、参数和轮询行为位于 API 文档中。整个流程是两个提交并轮询的循环。
第 3 步:进行两次调用。 首先是关键帧:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateImage \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedream-v5.0-pro/text-to-image", 6 "prompt": "<你的关键帧提示词>", 7 "size": "1152*2048" 8 }'
轮询 GET /api/v1/model/prediction/ 直到任务完成,从输出中获取托管的图像 URL,然后直接传递到视频调用:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedance-2.0/image-to-video", 6 "prompt": "<动态和表演提示词>", 7 "image": "<Seedream 输出 URL>", 8 "duration": 10, 9 "resolution": "720p", 10 "ratio": "adaptive", 11 "generate_audio": true, 12 "return_last_frame": true 13 }'
image 接受 URL、Base64 或资产引用,duration 接受 -1 以让模型选择。watermark 默认为 false。当 return_last_frame 设置为 true 时,完成的预测包括作为图像返回的末帧,因此脚本可以循环:生成片段,获取末帧,提交下一个片段。这个循环就是大约三十行代码的整个 MV 流程。
两次调用使用相同的基础 URL、相同的 Bearer 标头和相同的预测轮询。这就是一体化 API 设计的实际优势:你的 Seedream 集成和 Seedance 集成仅通过一个模型字符串和几个字段来区分,而下一个 ByteDance 版本将适配到相同的代码中。
用于 MV 关键帧的 Seedream 5.0 Pro 提示词配方
MV 关键帧是一个选角决定,因此提示词的首要任务是定义一个你可以再次召唤的角色。工作模式是一个角色块:一句话,40 到 60 个词,锁定面部、头发和服装。在项目的每个关键帧提示词中逐字复用。更改一个词,你就有可能召唤一个陌生人。
以下是一个完整的关键帧提示词示例:
一位年轻女性,齐腰黑发,五官柔和圆润,戴着银色垂坠耳环,身穿宽松的奶油色针织毛衣。她独自站在黄昏时分雨水湿润的屋顶上,从肩部以上平视角度拍摄。她眼睛湿润,嘴唇微张,仿佛即将歌唱,目光略过镜头。背后是冷蓝色城市的光芒,脸侧有一道温暖边缘光,浅景深,电影感静帧,柔和颗粒,9:16。
第一句是角色块。之后的所有内容随镜头变化。一个 MV 需要一个小覆盖面集,而非一张图像:
| 镜头 | 目的 | 提示词中变化的内容 | 固定不变的内容 |
|---|---|---|---|
| 全景 | 建立地点和氛围 | 地点细节,全身构图 | 角色块,光线方向 |
| 中景 | 主歌表演 | “腰部以上构图”,一个手势 | 角色块 |
| 特写 | 副歌情感高潮 | “肩部以上”,面部细节 | 角色块 |
两个 Seedream 特有的注意事项。将情感描述为物理证据,而非标签:“眼睛湿润,下巴紧绷,屏住呼吸”在后续动画中更生动,而“悲伤”则沦为刻板表情。在尺寸选择器中设置宽高比,而不仅仅在文字中描述,因为参数设置优先。有关更深入的提示词结构,包括排除模式以及模型已知的 bug,请参阅我们的 Seedream 5.0 Pro 提示词指南。
用于口型同步、物理效果和情感的 Seedance 2.0 提示词
关键帧为 Seedance 2.0 提供了一个值得动画化的面孔。动态提示词决定了片段是表演还是仅仅移动。Seedance 2.0 原生生成双声道音频,并在八种以上语言中实现音素级口型同步(根据 ByteDance 的发布文章),因此提示词的任务是告诉它正在表演什么、由谁表演以及摄像机如何对待。
有两种方式实现歌唱角色。
路径 A,生成歌曲: 留在图像转视频,打开“生成音频”开关,并在提示词中描述人声。模型会创作音乐并根据自己的轨道同步口型。这是最快获得 Cia0 风格表演片段的路径。
路径 B,你自己的曲目: 切换到参考转视频,该端点每次运行最多接受 9 张参考图像、3 个视频和 3 个音频片段。上传你的歌曲部分作为音频参考,添加你的关键帧作为图像参考,并在提示词中使用 @提及来将角色绑定到动作。这是 Curious Refuge 在五月验证过的多说话人口型同步配方:“一张参考图像”,“一个黑屏视频包含音频或音频文件”,以及“一个提示词(摄像机运动 + 旁白/对话)”。在上传前将音频修剪到片段长度;计费 Token 包含输入时长加上输出时长,因此填充会浪费实际金钱。

区分表演与屏幕保护程序的提示词线索:
| 你想要的 | 有效的提示词线索 | 为什么有效 |
|---|---|---|
| 清晰的口型同步 | 指出语言和演唱风格:“她用普通话缓缓演唱一首抒情歌,轻柔的呼吸声” | 音素级同步需要知道正在唱什么 |
| 头发和布料物理效果 | 为力给出原因:“一阵风吹起她的头发,毛衣随之飘动” | 物理效果遵循明确描述的力,而非形容词 |
| 可见的情感 | 带有时间节点的物理细节:“她在长音上闭上眼睛,眼角一颗泪珠” | 模型对动作的动画化远好于对情绪本身 |
| 摄像机感觉 | 每个片段一个运动:“从中景缓缓推近到特写” | 堆叠的摄像机运动在 15 秒内会相互冲突 |
| 多镜头戏剧 | 按顺序描述序列:“以天际线开场,当人声进入时切到她的脸” | Seedance 2.0 原生处理多镜头序列,一次运行即可 |
超过 15 秒的内容是拼接任务:使用设置部分中的“返回末帧”技巧,在每个新提示词中加入歌曲的下一行。保持 Seedream 提示词中的角色块措辞也出现在动态提示词中。冗余是保持身份一致性的廉价保险。
从 Seedance 片段到完成的 MV:剪辑和预算
日文“眼药水扭曲”帖子最清晰地展示了完成阶段,因为创作者在描述中列出了整个装配线:Seedream 用于静态图像,Seedance 2.0 用于动态,Mureka V9 用于配乐,OpenShot(免费桌面编辑器)用于剪辑。Cia0 的片段则指定 CapCut 作为其平台。无论你选择哪个编辑器,剪辑工作都是一样的:首先铺好完整轨道,在节拍上修剪片段,并从头到尾保持一个宽高比。

关于 CapCut 路径的说明。在 CapCut 内部,Seedance 2.0 作为 Dreamina Seedance 2.0 运行,自 2026 年 4 月 7 日起在美国可用,根据 CapCut 自己的公告,它带有一些限制,包括阻止从包含真实面部的图像生成视频,以及在输出上添加可见水印。对于梗图来说没问题,但对于干净的 MV 母版来说有限制。API 和 Playground 路径默认关闭水印,并接受你生成的任何关键帧。
整个项目的成本,基于 2026 年 7 月 Atlas Cloud 的折扣价:
| 阶段 | 模型或工具 | 数量 | 成本 |
|---|---|---|---|
| 关键帧 | Seedream 5.0 Pro | 10 张静态图像,每张 $0.045 | $0.45 |
| 动态草稿 | Seedance 2.0 Mini 图像转视频 | 4 个片段 × 10 秒,每秒 $0.045 | $1.80 |
| 最终片段 | Seedance 2.0 图像转视频,720p | 4 个片段 × 10 秒,每秒 ≈$0.1935 | ≈$7.74 |
| 配乐 | 你自己的曲目,或 AI 音乐模型 | 1 首歌 | 不定 |
| 剪辑 | CapCut 或 OpenShot | 1 次剪辑 | $0 |
| 总计 | ~40 秒完成的 MV | ≈$10 |
草稿行是很多人跳过但不应跳过的。Seedance 2.0 Mini 运行相同的首帧加提示词工作流程,每秒成本 $0.045(标价 $0.056),约为旗舰版 720p 费率的四分之一,因此分镜、摄像机运动和物理效果可以在最终渲染前廉价地调试。如果没有折扣,同样的预算在标价下约为 $12.40,仍然低于大多数素材库订阅的月费。
常见问题解答
Seedance 2.0 能否将角色与我自己的歌曲进行口型同步?
可以。使用参考转视频端点,该端点每次生成最多接受 3 个音频片段,以及 9 张图像和 3 个视频。上传歌曲部分作为音频参考,添加你的 Seedream 关键帧作为图像参考,在提示词中使用 @提及,并描述表演和摄像机。先修剪音频到片段长度,因为计费 Token 包含输入时长加上输出时长。
Seedream 和 Seedance 的提示词必须用中文吗?
不需要。Cia0 分享的是中文提示词,围绕 ByteDance 模型的中文提示词文化很强,但两个模型都接受英文提示词,Seedance 2.0 的口型同步在八种以上语言中在音素级别工作。重要的是在提示词中指定人声的语言,以便嘴型与轨道匹配。
单个 Seedance 2.0 生成可以持续多长时间?
每次运行 4 到 15 秒,支持在该窗口内进行多镜头序列,或者将时长设置为 -1 让模型选择。对于完整的 MV,需要拼接生成:启用“返回末帧”,并从上一片段的结束帧开始下一个片段,使表演保持连续。
我的 MV 片段会有水印吗?
默认情况下 API 和 Playground 没有水印:watermark 参数默认为 false,因此母版输出是干净的。CapCut 消费者版本则不同。Dreamina Seedance 2.0 会应用可见水印,并阻止从包含真实面部的图像生成视频,这是其 2026 年重新发布时附带的安全措施包的一部分。
完整的 Seedream + Seedance MV 成本是多少?
在 2026 年 7 月的折扣价下,一部 40 秒 720p 竖屏视频大约 $10:关键帧 $0.45,Mini 草稿 $1.80,最终 720p 片段约 $7.74,使用 CapCut 或 OpenShot 剪辑免费。按标价计算,同样的运行约为 $12.40。关键帧阶段是保持成本如此之低的原因,因为画面决策在 $0.045 时做出,而不是在每次重新生成约 $0.97 时做出。
结论
本月流传的片段并非某个秘密功能的成果。它们体现的是分工合作:Seedream 5.0 Pro 决定谁在屏幕上以及画面感觉如何,Seedance 2.0 决定他们如何移动和发声,而免费编辑器将片段变成一首有面孔的歌曲。每个步骤都是可检查的,每个错误都在最便宜的地方被捕获。
借鉴这个操作顺序。锁定一个角色块,以 $0.045 的价格购买你的错误,只对你已经批准的进行动画化,让一个片段的末帧打开下一个片段。工具是新的。但纪律只是电影制作。






