仅限两周 | Seedream 5.0 Pro 立享 8 折!

双静帧输入,连续镜头输出:PixVerse 过渡效果详解

PixVerse AI 过渡如何将第一帧和最后一帧转换为一个连续镜头,如何提示中间帧,照片到动漫的变形工作流程,以及每秒API定价。

第一张图片中是一个关闭的首饰盒。同一个盒子打开后,闪烁着光芒,在第二张图片中。点击生成,PixVerse 就会填充它们之间的每一帧。这就是 PixVerse AI 过渡 的全部技巧:你固定视频的开始位置,固定视频的结束位置,然后模型构建连接它们的运动。

听起来像是一个噱头,直到你意识到固定最后一帧能带来什么。常规的图像转视频会拿着你的照片,然后随意漂移到模型决定去的任何地方。过渡生成不能漂移。它必须到达你的第二张图片,这使它成为实现服装更换、场景变化、产品展示以及充斥短视频信息流的照片转动漫变形的最可控方式。

一张胶片条,展示了一个PixVerse AI过渡,从真实的第一个帧逐渐变形为同一画面的动漫风格。

关键要点

  • PixVerse AI 过渡(首尾帧功能)根据文本提示,在两幅上传的图片之间生成视频。从 v3.5 到 V6 和 C1 的每个模型都支持该功能(PixVerse 平台文档)。
  • 在 V6 和 C1 上,过渡剪辑的长度可以是 1 到 15 秒,包括 1080p 分辨率。旧版本固定为 5、8 或 10 秒。
  • 同一端点托管在 Atlas Cloud 上,命名为 Start-End-to-Video,按秒计费,V6 为 $0.025,C1 为 $0.03,无水印,按标准列表价格,截至 2026 年 7 月无有效折扣。
  • PixVerse 自述将 C1 定位为动漫制作,这使得过渡加上动漫风格的结束帧成为可靠的 pixverse ai 动漫工作流。

什么是 PixVerse AI 过渡?

PixVerse 称之为过渡功能,或首尾帧功能。你提供两张图片。第一张成为视频的第一帧,第二张成为最后一帧,文本提示描述中间发生的内容(过渡文档)。在 PixVerse 应用中,它作为独立的“首尾帧”模式存在于创建面板中。

API 参考 显示了该功能支持的广泛性。每一代模型都接受过渡任务,但不同版本之间的上限变化很大:

模型版本过渡时长选项音频
v3.5, v4, v4.5, v55 或 8 秒仅限音效附加组件
v5.5, v5.65、8 或 10 秒(1080p 下无 10 秒)原生音频开关
V6, C1任意长度,1 到 15 秒原生音频开关

各模型版本的时长和音频支持,来自 PixVerse 过渡生成 API 参考,检索于 2026-07-24。

在规划拍摄前有两个限制需要注意。每个版本的分辨率范围从 360p 到 1080p。并且过渡任务没有宽高比设置;输出会跟随你的输入图片,因此在上传之前,请将两个静态帧裁剪到最终比例。不匹配的帧是导致变形结果的最快方式。

原生平台还有一个特点:PixVerse 自己的 API 只通过其上传端点以表单数据格式接收图片。文档指出“目前不支持基于 URL 的图片上传”。如果你直接连接,请记住这一点,因为每对帧都需要一次上传往返。

在 Atlas Cloud 上运行 PixVerse 过渡

应用程序是尝试过渡功能最简单的地方,但它会通过积分和水印免费导出对你进行计量。Atlas Cloud 托管了来自 PixVerse 家族 的相同功能,作为名为 Start-End-to-Video 的计量 API 端点,提供 V6 和 C1 两种版本,无需订阅,无水印。两种方式:

方法 1:在 Playground 中运行 PixVerse 过渡

打开 V6 Start-End-to-Video playground 并在浏览器中运行。添加你的开始图片,添加你的结束图片(这里都接受普通 URL,无需上传 API 的步骤),编写提示,选择质量和时长,然后点击运行。默认配置,5 秒 720p 并开启音频,每次运行费用为 $0.30。 Atlas Cloud 的 PixVerse V6 Start-End-to-Video playground,显示两张上传的关键帧图片、一个提示字段以及质量和时长控制。

方法 2:通过 API 使用 PixVerse 过渡

1. 获取你的 API 密钥。 在控制台仪表板中创建一个并复制它。

Atlas Cloud 首页控制台导航截图,显示用于访问 API 密钥管理的顶部导航栏中的 Console 按钮位置.png

Atlas Cloud API 密钥管理仪表板截图,显示逐步点击 API Keys 菜单然后 Create API Key 按钮并复制生成的 API 密钥的过程.png

2. 查看 API 文档。 Atlas Cloud API 文档 在一个地方涵盖了端点、参数和认证。

3. 发出你的第一个请求。 提交包含两个帧的任务:

plaintext
1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Content-Type: application/json" \
3  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
4  -d '{
5    "model": "pixverse/v6/start-end-to-video",
6    "prompt": "The box lid lifts slowly, warm light spills out, the camera pushes in as sparkles rise",
7    "image": "https://example.com/box-closed.jpg",
8    "end_image": "https://example.com/box-open.jpg",
9    "duration": 5,
10    "quality": "720p",
11    "sound": true
12  }'

轮询返回的预测 ID 直到它完成:

plaintext
1curl https://api.atlascloud.ai/api/v1/model/prediction/<prediction_id> \
2  -H "Authorization: Bearer $ATLASCLOUD_API_KEY"

Atlas Cloud 在所有托管的模型上运行同一个 API。相同的密钥,相同的标头,相同的提交-轮询循环。切换到 C1 或未来任何模型,只需更改模型字符串,其他不变。

计费按输出秒数计算。两个端点均按标准列表价格定价,截至 2026 年 7 月无有效折扣:

质量V6 无音频V6 带音频C1 无音频C1 带音频
360p$0.025/s$0.035/s$0.030/s$0.040/s
540p$0.035/s$0.045/s$0.040/s$0.050/s
720p$0.045/s$0.060/s$0.050/s$0.065/s
1080p$0.090/s$0.115/s$0.095/s$0.120/s

Atlas Cloud Start-End-to-Video 定价,在 V6 和 C1 模型页面上验证,2026-07-24。C1 在每个层级上比 V6 略贵。

因此,一个 5 秒 720p 无音频的变形在 V6 上花费 $0.225,在 C1 上花费 $0.25。一个最大的 15 秒 1080p 带音频片段在 V6 上花费 $1.725。注意音频默认值:Atlas 默认开启声音,除非你关闭,而 PixVerse 原生 API 默认关闭。如果你的成本估算一直偏高,通常就是这个开关造成的。

控制中间过程的 PixVerse 过渡提示

当两个端点都固定后,唯一剩下的就是引导过程,而提示词掌握着控制权。Atlas Cloud 自身对该端点的指导建议明确描述中间运动,这个建议很有效:模糊的提示词只会得到淡入淡出,具体的提示词才能得到想要的镜头。

PixVerse 将提示词限制在 5,000 个字符以内,没人需要那么多。有效的方法是一到两句话,涵盖三件事:什么在移动,相机如何运动,以及节奏。

目标提示词框架重要的细节
服装更换"她旋转一次,裙子随着她的转身飘动成红色晚礼服"说出隐藏变化的物理动作
白天到夜晚"云彩掠过天空,阴影拉长,窗户逐一亮起"给模型提供需要动画的时间标记
产品展示"盖子打开,相机推进,光线从内部溢出"将物体运动与相机运动配对
照片转动漫"她的面部特征柔和成动漫阴影,头发获得赛璐珞风格高光,背景扁平化为绘画色调"将风格转变描述为可见的变化
地点跳跃"相机向右快速甩动产生运动模糊,然后在新街道上稳定下来"要求模糊或甩动以桥接不相关的场景

PixVerse 过渡任务的提示词模式。每个都指明了变化机制,这样模型就能动画化它,而不是在帧之间溶解。

帧的准备工作完成了一半的工作。保持主体在两幅图像中的相似位置,匹配光线,那么变形就会读作一次连续的拍摄。如果输入两帧光线和构图冲突,你会得到令人不快的溶解。

当你接近目标时,复用种子。端点接受固定种子,因此你可以锁定你喜欢的运动,只迭代措辞。

PixVerse AI 动漫视频生成器:照片转动漫变形

这是固定最后一帧最能发挥作用的用例。从真实照片到同一场景的动漫版本的变形,本质上就是一个过渡任务:输入真实帧,输出风格化帧。

PixVerse 明确表达了其动漫定位。它自己的 C1 评测说得很清楚:“如果你是动漫导演、漫画工作室、短剧团队,或者任何制作涉及角色互相攻击、施法或快速移动内容的人,PixVerse C1 就是为你打造的”(PixVerse 博客,2026 年 4 月)。同一页面确认 C1 接受基于提示词加首尾帧的过渡输入。该应用在模板方面也讲述了同样的故事,截至 2026 年 7 月 26 日运行着如《足球小将》系列等授权动漫 IP。

制作一个干净 pixverse 动漫视频的工作流需要三样东西:

  1. 你的源照片,裁剪到最终宽高比。
  2. 该照片的动漫风格版本。使用任何图像模型生成,保持姿态、构图和布局尽可能接近原图。
  3. 描述风格变化为运动的提示词,如上表中的照片转动漫框架。

通过过渡端点运行它,模型就会将风格化效果动画化到整个画面中。你的两个构图匹配得越紧密,就越像世界本身在被重新绘制。 PixVerse AI 动漫过渡的开始和结束帧,一个真实的屋顶肖像变形为同一构图的赛璐珞风格动漫。

在 Atlas Cloud V6 Start-End-to-Video 端点上生成的真实照片转动漫 PixVerse 过渡:7 秒,720p,开启音频,每次运行 $0.42。提示词遵循上表中的照片转动漫框架。

一个准确性的说明,因为教程经常搞错。当前的 V6 API 没有风格参数。在生成调用中没有动漫切换开关。风格完全存在于你的结束帧和提示词中,这正是过渡路线优于普通图像转视频的原因:图像转视频只能用文字向动漫方向引导,而基于过渡的 pixverse ai 动漫视频生成器工作流则向模型提供了目标风格的字面图像。当片段涉及战斗、特效或快速角色运动时,选择 C1 而非 V6,因为这正是 PixVerse 构建它的确切基础。

多达七个关键帧的 PixVerse 多过渡链

两帧构成一个瞬间。序列需要更多,而 PixVerse 为此提供了一个独立的多过渡功能:一个由 2 到 7 个关键帧组成的链,渲染为长达 30 秒的连续视频,在整个运行过程中保持风格和角色的一致性。

链中的每个关键帧都有自己的时长和可选提示词,因此你可以逐帧对视频进行故事板:

多过渡规格
每次任务关键帧2 到 7
总视频长度1 到 30 秒
每段时长1 到 8 秒(三个或更多关键帧时为 1 到 5 秒)
每关键帧提示词可选,每段一个
质量360p 到 1080p
支持的模型v3.5, v4, v4.5, v5

多过渡限制来自 PixVerse 平台文档和生成 API 参考,检索于 2026-07-24。

再读一遍最后一行。多过渡最高只支持到 v5。最新的模型 V6 和 C1 只处理单次的首尾过渡,而 V6 文档也确认过渡任务不能使用多片段开关。因此当前的权衡是真实的:在旧模型上串联七个关键帧,或者使用 V6 质量每次两帧然后在编辑器中拼接片段。对于故事板化的动漫序列,你可以结合两者,先用多过渡草拟完整运行,再用 C1 重新生成关键镜头。

常见问题解答

哪些 PixVerse 模型支持过渡生成?

所有都支持。过渡 API 接受 v3.5、v4、v4.5、v5、v5.5、v5.6、V6 和 C1,每个版本都支持 360p 到 1080p。区别在于时长范围和音频支持,V6 和 C1 在这方面领先很多。

PixVerse 过渡视频可以运行多长时间?

在 V6 或 C1 上最长可达 15 秒,包括 1080p 在内的任何分辨率。如果你需要在一次生成中获得更长的视频,多过渡可以达到 30 秒,跨越最多 7 个关键帧,但仅限于 v5 代及更旧的模型。

PixVerse 可以将普通照片转换为动漫视频吗?

是的,过渡是实现这一点的最干净方式。准备一张与照片构图匹配的动漫风格副本,将原图设置为第一帧,风格化副本设置为最后一帧,然后在提示词中描述转换过程。PixVerse 将 C1 专门针对动漫和漫画制作进行营销。

PixVerse 过渡 AI 会生成音频吗?

在 v5.5 及更新版本上,是的,通过原生音频开关。旧版本仅提供音效附加组件。在 Atlas Cloud 上,启用音频会根据分辨率每秒增加 $0.010 到 $0.025 的费用。

在 Atlas Cloud 上,过渡视频比文本转视频更贵吗?

不。Start-End-to-Video 与 V6 文本转视频和图像转视频使用完全相同的每秒计费矩阵,无音频时从 $0.025/秒起。提供两个帧而不是仅提供提示词没有额外费用。

PixVerse 过渡的图像要求是什么?

在 Atlas Cloud 上:PNG、JPEG、JPG 或 WebP,每张图片最大 10MB,需要两个帧。PixVerse 原生 API 额外要求每张图片先通过其上传端点。无论选择哪种方式,在生成前都要匹配两个帧的宽高比。

结论

PixVerse AI 过渡消除了视频生成中最大的不确定性。你自己决定最后一帧,模型只需要弄清楚如何到达那里。这使得它成为任何最终状态不可协商的情况下的正确工具:产品必须打开,服装必须更换,照片必须以动漫结尾。

从 playground 中使用一对帧和默认的 5 秒运行开始。当某个格式有效时,API 将其转变为流水线,每 5 秒 720p 关闭音频的片段花费 $0.225。两幅图像和一句话,对于最终精确按照你所说结束的镜头来说,代价很小。

最新模型

一个 API,畅享全模态 AI。

探索全部模型