Pixverse API 为开发者提供直接访问 AISphere 视频生成模型的权限。V6 在单一工作流中涵盖了文本生成视频、图像生成视频、参考引导生成、起始和结束帧控制以及视频延展功能;而 C1 则将故事板转化为多镜头序列,并在跨镜头时保持角色和场景的一致性。Atlas Cloud 为这两个系列提供服务,采用透明的按秒计费模式,无需进行基础设施设置。立即开始构建。
Atlas Cloud 为您提供最新的行业领先创意模型。
了解每个 Pixverse API 端点在 Atlas Cloud 上的输入内容、生成结果及所需成本,涵盖从单一文本提示到七图参考控制的各项功能。
| Modality | Description |
|---|---|
| Pixverse V6 Text-to-Video API (Text to Video) | 对于需要一个角色从一集到下一集看起来相同的序列化内容,此端点接受最多七个标记的参考图像,并在每个生成的镜头中保持其外观。主题和背景标签加上每个图像的参考名称为Pixverse API提供了最细粒度的一致性控制,分层在C1的多镜头架构上。在Atlas Cloud上从每秒$0.03开始使用OpenAI兼容密钥提供。 |
| Pixverse V6 Image-to-Video API (Image to Video) | A single still image is all this endpoint needs to produce a motion clip that preserves the source's visual identity, guided by a text prompt of up to 5,000 characters. It accepts JPG and PNG inputs up to 10MB with aspect ratios from 1:2.5 to 2.5:1, so portraits, product shots, and wide banners all animate without reformatting. Optional native audio and a seed parameter make outputs repeatable for production pipelines. |
| Pixverse V6 Start-End-to-Video API (Image to Video) | When a clip has to land on an exact final frame, this endpoint takes both a start image and an end image and generates all the motion in between. Frames can be passed as public URLs or Base64 in PNG, JPEG, or WebP, and clips run 1 to 15 seconds at up to 1080p. That makes it the natural pick for scene transitions, loopable content, and shots with a fixed visual destination. |
| Pixverse V6 Reference-to-Video API (Reference to Video) | Up to seven reference images steer each generation, and every image can be tagged as subject or background and given its own reference name for prompt-level control. V6 keeps character appearance and scene context stable across the clip, which removes manual keyframing from character-driven and brand-consistent work. Output supports the full range of eight aspect ratios and resolutions up to 1080p. |
| Pixverse V6 Video-Extend API (Video to Video) | Need a clip to run longer than its original cut? Pass a source video URL plus a text prompt and V6 continues the footage for another 1 to 15 seconds, preserving the established motion and visual style. At $0.025 per second on Atlas Cloud, extending a scene costs the same as generating one from scratch. |
| Pixverse C1 Text-to-Video API (Text to Video) | C1 treats text-to-video as a storyboard problem, generating clips built for multi-shot narrative continuity rather than isolated standalone shots. Prompts up to 5,000 characters drive videos of 1 to 15 seconds with native audio, eight aspect ratio options, and quality up to 1080p. Atlas Cloud prices the C1 series from $0.03 per second on a pay-as-you-go basis. |
| Pixverse C1 Image-to-Video API (Image to Video) | Feed C1 a still image and it returns a video sequence in which character and scene fidelity hold from the first frame to the last. Inputs follow the same practical limits as V6, JPG or PNG up to 10MB with aspect ratios from 1:2.5 to 2.5:1, so existing assets drop straight in. Its storyboard-aware design suits multi-scene projects where identity drift between shots is not acceptable. |
| Pixverse C1 Start-End-to-Video API (Image to Video) | Defining a clip by its first and last frames gives C1 a complete narrative arc to fill, and the model generates the connecting motion while keeping the series' storyboard-native visual language intact. Start and end images upload as URLs or Base64 in PNG, JPEG, or WebP, with durations of 1 to 15 seconds and a seed option for repeatable results. Episodic and multi-chapter productions use it to lock scene-to-scene transitions in place. |
| Pixverse C1 Reference-to-Video API (Reference to Video) | For serialized content where a character must look identical from one episode to the next, this endpoint accepts up to seven tagged reference images and holds their appearance across every generated shot. Subject and background tags plus per-image reference names give the Pixverse API its most granular consistency control, layered on C1's multi-shot architecture. It is available on Atlas Cloud from $0.03 per second with one OpenAI-compatible key. |
将先进模型与 Atlas Cloud 的 GPU 加速平台相结合,为图像和视频生成带来无与伦比的速度、可扩展性和创作掌控力。
C1 专为处理最能暴露多数 AI 视频模型短板的场景而打造——近身格斗动作设计、高速运动、粒子特效、流体动力学以及氛围环境。空间关系与物理重量在各帧之间保持一致,减少了动作类内容通常所需的修正工作量。它在同一生成工作流中同时支持写实与风格化场景。
PixVerse C1 可将静态分镜布局直接转换为连续的视频序列,并根据提示词结构自动完成场景切分。制作团队上传静态分镜画面即可获得多镜头序列,无需从零重建每个场景。这使 C1 成为电影工作室、动画团队以及依据既定创意简报开展工作的代理机构的实用之选。
PixVerse V6 能够精准渲染各类运镜——跟拍镜头、视角切换与环境揭示——且几乎不产生瑕疵。角色的情绪与肢体语言在场景切换中保持一致,使其能够可靠地支撑不止单个独立片段的叙事序列。对营销团队和内容工作室而言,这意味着更少的手动修正,以及从简报到成片更快的迭代速度。
最多可将七张参考图标注为主体或背景,为每张图命名,并在提示词中直接调用。人脸、产品和环境在每一帧中都保持原样。
想要声音却不想额外搭建一条流水线?V6 和 C1 都能在同一次生成中渲染同步音频,预告片、广告和社交短片从 API 输出后即可直接发布。
从 21:9 的宽银幕画幅到 9:16 的竖屏信息流,八种宽高比和四档分辨率覆盖电影、广播和社交媒体输出。草稿可选 360p,成片交付可选 1080p,生成后无需再裁剪。
单条提示词最长可达 5,000 字符,足以在一次请求中指定镜头顺序、灯光、服装和节奏。详尽的脚本能一次性生成符合简报要求的素材。
同一条提示词,由 Pixverse 与其他领先视频模型生成:多镜头、高端商业广告片
为一款豪华电动自行车制作一支 10 秒的电影级产品广告。 场景 1(0–2 秒): 微距特写:雨滴滑过哑光黑色车架。柔和的霓虹反光,浅景深,缓慢推进的镜头运动。细微的雨声氛围。 场景 2(2–5 秒): 低角度跟踪镜头:自行车夜间驶过湿漉漉的城市街道,轮胎溅过浅浅的水洼。加入真实的轮胎溅水声、轻柔的电机嗡鸣声和远处的车流环境音。 场景 3(5–8 秒): 平滑的侧面跟拍镜头:同一辆自行车从路灯下驶过。保持完全一致的车架几何结构、车轮、车灯、颜色和比例。可控的运动模糊,高级商业广告构图。 场景 4(8–10 秒): 最终主镜头:自行车停在一栋玻璃建筑旁。车灯柔和发光,雨水和霓虹反光自然淡出。产品居中、清晰锐利,呈现高端广告质感。 要求: - 所有镜头中保持完全一致的自行车设计 - 使用清晰的电影级运镜:微距特写、低角度跟踪、侧面跟拍、最终主镜头 - 保持雨水、光线、反光和城市氛围的一致性 - 音频与动作同步:雨声、轮胎溅水声、电机嗡鸣声、城市环境音 - 不得出现变形的车轮、变化的车架结构或不一致的产品细节 - 真实材质,精致的商业广告片质感,1080p
Pixverse
Wan 2.7
Kling V3.0
为一款放置在现代摄影棚桌面上的透明无线音箱制作一支 10 秒的电影级产品广告。 场景 1(0–2 秒): 透明音箱外壳的微距特写。透过透明外壳可以看到内部元件。柔和的摄影棚灯光,干净的反光,浅景深,缓慢推进的镜头运动。 场景 2(2–5 秒): 音箱开机。一圈低调的 LED 灯环从中心向外亮起。镜头围绕产品进行平滑的环绕运镜。加入柔和的开机提示音,以及与 LED 动画同步的低频低音脉冲。 场景 3(5–8 秒): 侧面近景:通过旁边一杯水的轻微振动来可视化声波。音箱的形状、尺寸、材质和内部布局保持完全一致。干净的摄影棚背景,高级产品构图。 场景 4(8–10 秒): 最终主镜头:透明音箱位于桌面中央,LED 灯环柔和发光,镜头缓缓后拉。极简的未来感摄影棚,精致的商业广告质感。 要求: - 所有镜头中保持完全一致的音箱设计 - 使用电影级运镜:微距特写、平滑环绕、侧面近景、最终主镜头后拉 - 保持摄影棚灯光、反光、透明质感和产品比例的一致性 - 音频与动作同步:开机提示音、低音脉冲、细微振动 - 不得出现变化的内部元件、变形的透明外壳或位置不一致的 LED - 高端科技广告风格,干净的构图,真实材质,1080p
Pixverse
Wan 2.7
Kling V3.0
无论是让一张产品图动起来,还是执导多集连载系列,Atlas Cloud 上的 Pixverse API 都能覆盖社交视频、电商动效、无缝转场与长篇叙事,并采用透明的按量付费定价。
借助 Pixverse V6 的文本生成视频能力,将一条文字提示词变成让人停下滑动的竖屏短片。每天在 TikTok、Reels 和 Shorts 上发布内容的创作者,只需每秒 $0.025 即可让信息流保持新鲜。
通过 V6 的图像生成视频能力,静态产品图可变为动感十足的主视觉短片,原有视觉形象在每一帧中都得以保留。电商团队无需预约棚拍,即可将整个商品目录制作成动态广告。
需要同一位主角贯穿十集内容?C1 的参考图生成视频能力可在片段之间锁定角色外观与场景环境,为动画团队、条漫工作室和 IP 方提供可靠的连载制作管线。
当两帧关键帧定义了你的镜头,start-end 端点会生成两者之间的全部运动。精致的场景切换、渐变变形的画面揭示,以及可完美循环的背景视觉,都无需任何手动关键帧操作即可获得。
生成的片段很少需要止步于第一刀剪辑,因为 V6 的 video-extend 端点能在保持运动与风格的前提下延续画面。剪辑师将延长后的片段串联成预告片、音乐视频和更长的序列。
所有 V6 和 C1 端点都通过 Atlas Cloud 上一个 OpenAI 兼容密钥调用,按量计费,每秒 $0.025 起。开发者无需管理 GPU 基础设施,即可为自己的产品加入生产级视频生成能力。
在选定视频生成技术栈之前,先看看 PixVerse API 在输入模式、分辨率、片段时长、原生音频和按秒计价方面与 Kling、Veo、Sora、Wan 的对比。
| 模型 | 输入模式 | 最高分辨率 | 片段时长 | 原生音频 | Price per Second |
|---|---|---|---|---|---|
| PixVerse V6 | 文本、图像、参考图、首尾帧、视频延长 | 1080p | 1 至 15 秒 | √ | From $0.025/s on Atlas Cloud |
| PixVerse C1 | 文本、图像、参考图、首尾帧 | 1080p | 1 至 15 秒 | √ | From $0.03/s on Atlas Cloud |
| Kling 2.5 Turbo Pro | 文本、图像 | 1080p | 5 秒或 10 秒 | - | About $0.07/s |
| Google Veo 3.1 | 文本、图像、参考图、首尾帧 | 最高 4K | 4 秒、6 秒或 8 秒 | √ | $0.40/s (Fast from $0.10/s) |
| OpenAI Sora 2 | 文本、图像 | 720p(Sora 2 Pro 为 1080p) | 4 秒、8 秒或 12 秒 | √ | $0.10/s ($0.30/s for Pro) |
| Alibaba Wan 2.5 | 文本、图像、可选的音频引导 | 1080p | 5 秒或 10 秒 | √ | From $0.05/s |
几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。
在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。
将先进的 Pixverse 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。
低延迟:
GPU 优化推理,实现实时响应。
统一 API:
一次集成,畅用 Pixverse、GPT、Gemini 和 DeepSeek。
透明定价:
按 Token 计费,支持 Serverless 模式。
开发者体验:
SDK、数据分析、微调工具和模板一应俱全。
可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。
安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。
PixVerse API 通过 Atlas Cloud 为开发者提供对 PixVerse AI 视频生成模型的编程访问。与使用消耗每日积分、添加水印并限制分辨率的 PixVerse 消费者应用程序不同,您可以直接通过 REST API 调用模型,并且只需为您生成的内容付费。
V6 是旗舰级通用系列,在一条流水线中覆盖文生视频、图生视频、参考图生视频、首尾帧控制和视频延长。C1 则采用原生分镜(storyboard)思路,专为多镜头叙事制作打造,镜头之间的场景连续性和角色一致性与单帧画质同样重要。在 Atlas Cloud 上,V6 端点每秒 $0.025 起,C1 端点每秒 $0.03 起。
按用量计费,无需订阅。PixVerse V6 的全部五个端点按生成视频每秒 $0.025 起计费,C1 的全部四个端点每秒 $0.03 起。只为实际生成的内容付费,每次请求的单次调用价格公开透明。
PixVerse 的所有生成端点均可输出 360p、540p、720p 或 1080p,默认 720p。片段时长可在 1 到 15 秒之间任选,并提供八种宽高比:16:9、9:16、1:1、4:3、3:4、2:3、3:2 和 21:9。从竖屏社交格式到 21:9 电影画幅全部覆盖,生成后无需任何裁剪。
会。V6 和 C1 都会在同一次生成中输出声音,Pixverse API 提供 sound 参数且默认开启。如果打算自行配乐,将其设为 false 即可。唯一的例外是 V6 的 Video-Extend 端点,它不提供音频参数。
C1 读取多格分镜稿的方式,就像导演读漫画分页:把每一格当作独立镜头,并自动推断镜头之间的转场逻辑。输出是一段角色一致、空间逻辑连贯的连续多镜头序列,团队可以直接从定稿分镜进入成片制作,无需逐场景重建。在文生视频端点上,镜头切分还可以直接由提示词结构来控制。
V6 和 C1 的 Reference-to-Video 端点每次请求都可接受 1 到 7 张参考图,每张图可标记为主体(subject)或背景(background)参考。图片可以用公开 URL 或 Base64 字符串提供,支持 PNG、JPEG、WebP 格式,单次请求总大小上限为 20MB。带标记的参考图正是多镜头制作在各个片段之间锁定角色身份的关键。
V6 的 Video-Extend 端点接收源视频 URL 加一段文字提示词,生成 1 到 15 秒的续接内容。运动连贯性和视觉风格会延续到扩展部分,因此无论是把片段拉长到超出原始时长,还是用多个素材拼接出连续内容,都很实用。计费与其他 V6 端点相同,均为每秒 $0.025。
注册 Atlas Cloud 账号,生成 API key,然后在 Authorization 请求头中携带该 key 调用任意 PixVerse 端点即可。请求异步执行:提交生成任务后会返回一个 prediction ID,轮询结果端点直到状态变为 completed。无需搭建任何基础设施,Day-0 接入意味着 PixVerse 新版本发布即可用、无需迁移。今天就开始构建吧。