Pixverse API 為開發者提供直接存取 AISphere 影片生成模型的權限。V6 在單一工作流程中涵蓋了文字生成影片、圖像生成影片、參考引導生成、起始與結束幀控制以及影片延展功能;而 C1 則將故事板轉化為多鏡頭序列,並在跨鏡頭時保持角色與場景的一致性。Atlas Cloud 為這兩個系列提供服務,採用透明的按秒計費模式,無需進行基礎設施設定。立即開始建置。
Atlas Cloud 為您提供最新的行業領先創意模型。
了解每個 Pixverse API 端點在 Atlas Cloud 上的輸入內容、生成結果及所需成本,涵蓋從單一文本提示到七圖參考控制的各項功能。
| Modality | Description |
|---|---|
| Pixverse V6 Text-to-Video API (Text to Video) | 對於需要一個角色從一集到下一集看起來相同的序列化內容,此端點接受最多七個標記的參考圖像,並在每個生成的鏡頭中保持其外觀。主題和背景標籤加上每個圖像的參考名稱為Pixverse API提供了最細粒度的一致性控制,分層在C1的多鏡頭架構上。在Atlas Cloud上從每秒$0.03開始使用OpenAI兼容密鑰提供。 |
| Pixverse V6 Image-to-Video API (Image to Video) | A single still image is all this endpoint needs to produce a motion clip that preserves the source's visual identity, guided by a text prompt of up to 5,000 characters. It accepts JPG and PNG inputs up to 10MB with aspect ratios from 1:2.5 to 2.5:1, so portraits, product shots, and wide banners all animate without reformatting. Optional native audio and a seed parameter make outputs repeatable for production pipelines. |
| Pixverse V6 Start-End-to-Video API (Image to Video) | When a clip has to land on an exact final frame, this endpoint takes both a start image and an end image and generates all the motion in between. Frames can be passed as public URLs or Base64 in PNG, JPEG, or WebP, and clips run 1 to 15 seconds at up to 1080p. That makes it the natural pick for scene transitions, loopable content, and shots with a fixed visual destination. |
| Pixverse V6 Reference-to-Video API (Reference to Video) | Up to seven reference images steer each generation, and every image can be tagged as subject or background and given its own reference name for prompt-level control. V6 keeps character appearance and scene context stable across the clip, which removes manual keyframing from character-driven and brand-consistent work. Output supports the full range of eight aspect ratios and resolutions up to 1080p. |
| Pixverse V6 Video-Extend API (Video to Video) | Need a clip to run longer than its original cut? Pass a source video URL plus a text prompt and V6 continues the footage for another 1 to 15 seconds, preserving the established motion and visual style. At $0.025 per second on Atlas Cloud, extending a scene costs the same as generating one from scratch. |
| Pixverse C1 Text-to-Video API (Text to Video) | C1 treats text-to-video as a storyboard problem, generating clips built for multi-shot narrative continuity rather than isolated standalone shots. Prompts up to 5,000 characters drive videos of 1 to 15 seconds with native audio, eight aspect ratio options, and quality up to 1080p. Atlas Cloud prices the C1 series from $0.03 per second on a pay-as-you-go basis. |
| Pixverse C1 Image-to-Video API (Image to Video) | Feed C1 a still image and it returns a video sequence in which character and scene fidelity hold from the first frame to the last. Inputs follow the same practical limits as V6, JPG or PNG up to 10MB with aspect ratios from 1:2.5 to 2.5:1, so existing assets drop straight in. Its storyboard-aware design suits multi-scene projects where identity drift between shots is not acceptable. |
| Pixverse C1 Start-End-to-Video API (Image to Video) | Defining a clip by its first and last frames gives C1 a complete narrative arc to fill, and the model generates the connecting motion while keeping the series' storyboard-native visual language intact. Start and end images upload as URLs or Base64 in PNG, JPEG, or WebP, with durations of 1 to 15 seconds and a seed option for repeatable results. Episodic and multi-chapter productions use it to lock scene-to-scene transitions in place. |
| Pixverse C1 Reference-to-Video API (Reference to Video) | For serialized content where a character must look identical from one episode to the next, this endpoint accepts up to seven tagged reference images and holds their appearance across every generated shot. Subject and background tags plus per-image reference names give the Pixverse API its most granular consistency control, layered on C1's multi-shot architecture. It is available on Atlas Cloud from $0.03 per second with one OpenAI-compatible key. |
將先進模型與 Atlas Cloud 的 GPU 加速平台相結合,為影像與影片生成帶來無與倫比的速度、可擴展性與創作掌控力。
C1 專為處理最能暴露多數 AI 影片模型極限的場景而打造——近身格鬥動作設計、高速運動、粒子特效、流體動力學以及氛圍環境。空間關係與物理重量在各影格之間保持一致,減少動作類內容通常所需的修正工作量。它可在同一生成工作流程中同時支援寫實與風格化場景。
PixVerse C1 可將靜態分鏡佈局直接轉換為連續的影片序列,並依提示詞結構自動完成場景切分。製作團隊上傳靜態分鏡畫面即可獲得多鏡頭序列,無需從零重建每個場景。這使 C1 成為電影工作室、動畫團隊以及依既定創意簡報作業的代理商的實用之選。
PixVerse V6 能精準渲染各類運鏡——跟拍鏡頭、視角切換與環境揭示——且幾乎不產生瑕疵。角色的情緒與肢體語言在場景切換中保持一致,使其能可靠支撐不只單一獨立片段的敘事序列。對行銷團隊和內容工作室而言,這意味著更少的手動修正,以及從簡報到成品更快的迭代速度。
最多可將七張參考圖標註為主體或背景,為每張圖命名,並在提示詞中直接呼叫。人臉、產品和環境在每一影格中都保持原貌。
想要聲音卻不想另建一條管線?V6 和 C1 都能在同一次生成中渲染同步音訊,預告片、廣告和社群短片從 API 輸出後即可直接發布。
從 21:9 的寬銀幕畫幅到 9:16 的直式動態消息,八種長寬比和四檔解析度涵蓋電影、廣播和社群媒體輸出。草稿可選 360p,成品交付可選 1080p,生成後無需再裁切。
單條提示詞最長可達 5,000 字元,足以在一次請求中指定鏡頭順序、燈光、服裝和節奏。詳盡的腳本能一次就生成符合簡報要求的素材。
同一條提示詞,由 Pixverse 與其他領先影片模型生成:多鏡頭、高階商業廣告片
為一款豪華電動自行車製作一支 10 秒的電影級產品廣告。 場景 1(0–2 秒): 微距特寫:雨滴滑過霧面黑色車架。柔和的霓虹反光,淺景深,緩慢推進的鏡頭運動。細微的雨聲氛圍。 場景 2(2–5 秒): 低角度跟蹤鏡頭:自行車夜間駛過濕漉漉的城市街道,輪胎濺過淺淺的水窪。加入真實的輪胎濺水聲、輕柔的電動馬達嗡鳴聲和遠處的車流環境音。 場景 3(5–8 秒): 平滑的側面跟拍鏡頭:同一輛自行車從路燈下駛過。保持完全一致的車架幾何結構、車輪、車燈、顏色和比例。可控的動態模糊,高級商業廣告構圖。 場景 4(8–10 秒): 最終主鏡頭:自行車停在一棟玻璃建築旁。車燈柔和發光,雨水和霓虹反光自然淡出。產品置中、清晰銳利,呈現高階廣告質感。 要求: - 所有鏡頭中保持完全一致的自行車設計 - 使用清晰的電影級運鏡:微距特寫、低角度跟蹤、側面跟拍、最終主鏡頭 - 保持雨水、光線、反光和城市氛圍的一致性 - 音訊與動作同步:雨聲、輪胎濺水聲、電動馬達嗡鳴聲、城市環境音 - 不得出現變形的車輪、變化的車架結構或不一致的產品細節 - 真實材質,精緻的商業廣告片質感,1080p
Pixverse
Wan 2.7
Kling V3.0
為一款放置在現代攝影棚桌面上的透明無線音箱製作一支 10 秒的電影級產品廣告。 場景 1(0–2 秒): 透明音箱外殼的微距特寫。透過透明外殼可以看到內部元件。柔和的攝影棚燈光,乾淨的反光,淺景深,緩慢推進的鏡頭運動。 場景 2(2–5 秒): 音箱開機。一圈低調的 LED 燈環從中心向外亮起。鏡頭圍繞產品進行平滑的環繞運鏡。加入柔和的開機提示音,以及與 LED 動畫同步的低頻低音脈衝。 場景 3(5–8 秒): 側面近景:透過旁邊一杯水的輕微振動來呈現聲波。音箱的形狀、尺寸、材質和內部佈局保持完全一致。乾淨的攝影棚背景,高級產品構圖。 場景 4(8–10 秒): 最終主鏡頭:透明音箱位於桌面中央,LED 燈環柔和發光,鏡頭緩緩後拉。極簡的未來感攝影棚,精緻的商業廣告質感。 要求: - 所有鏡頭中保持完全一致的音箱設計 - 使用電影級運鏡:微距特寫、平滑環繞、側面近景、最終主鏡頭後拉 - 保持攝影棚燈光、反光、透明質感和產品比例的一致性 - 音訊與動作同步:開機提示音、低音脈衝、細微振動 - 不得出現變化的內部元件、變形的透明外殼或位置不一致的 LED - 高階科技廣告風格,乾淨的構圖,真實材質,1080p
Pixverse
Wan 2.7
Kling V3.0
無論是讓一張產品照動起來,還是執導多集連載影集,Atlas Cloud 上的 Pixverse API 都能涵蓋社群影片、電商動態、無縫轉場與長篇敘事,並採用透明的隨用隨付定價。
透過 Pixverse V6 的文字生成影片能力,把一句文字提示詞變成讓人停下滑動的直式短片。每天在 TikTok、Reels 與 Shorts 上發布內容的創作者,只需每秒 $0.025 就能讓動態牆保持新鮮。
透過 V6 的圖片生成影片能力,靜態產品照可變成動感十足的主視覺短片,原有視覺識別在每一格畫面中都完整保留。電商團隊不必預約棚拍,就能把整個商品目錄製作成動態廣告。
需要同一位主角貫穿十集內容?C1 的參考圖生成影片能力可在片段之間鎖定角色外觀與場景環境,為動畫團隊、條漫工作室和 IP 擁有者提供可靠的連載製作流程。
當兩張關鍵影格定義了你的鏡頭,start-end 端點會生成兩者之間的全部動態。精緻的場景切換、變形轉場的畫面揭示,以及可完美循環的背景視覺,全都不需任何手動關鍵影格作業。
生成的片段很少需要止步於第一次剪輯,因為 V6 的 video-extend 端點能在保持動態與風格的前提下延續畫面。剪輯師把延長後的片段串接成預告片、音樂錄影帶和更長的段落。
所有 V6 和 C1 端點都透過 Atlas Cloud 上同一組 OpenAI 相容金鑰呼叫,採隨用隨付計費,每秒 $0.025 起。開發者不必管理 GPU 基礎設施,就能為自家產品加入生產級影片生成能力。
在選定影片生成技術棧之前,先看看 PixVerse API 在輸入模式、解析度、片段長度、原生音訊和按秒計價方面與 Kling、Veo、Sora、Wan 的比較。
| 模型 | 輸入模式 | 最高解析度 | 片段長度 | 原生音訊 | Price per Second |
|---|---|---|---|---|---|
| PixVerse V6 | 文字、圖片、參考圖、首尾影格、影片延長 | 1080p | 1 至 15 秒 | √ | From $0.025/s on Atlas Cloud |
| PixVerse C1 | 文字、圖片、參考圖、首尾影格 | 1080p | 1 至 15 秒 | √ | From $0.03/s on Atlas Cloud |
| Kling 2.5 Turbo Pro | 文字、圖片 | 1080p | 5 秒或 10 秒 | - | About $0.07/s |
| Google Veo 3.1 | 文字、圖片、參考圖、首尾影格 | 最高 4K | 4 秒、6 秒或 8 秒 | √ | $0.40/s (Fast from $0.10/s) |
| OpenAI Sora 2 | 文字、圖片 | 720p(Sora 2 Pro 為 1080p) | 4 秒、8 秒或 12 秒 | √ | $0.10/s ($0.30/s for Pro) |
| Alibaba Wan 2.5 | 文字、圖片、可選的音訊引導 | 1080p | 5 秒或 10 秒 | √ | From $0.05/s |
幾分鐘即可上手 — 按照以下簡單步驟,透過 Atlas Cloud 平台整合和部署模型。
在 atlascloud.ai 註冊並完成驗證。新用戶可獲得免費額度,用於探索平台和測試模型。
將先進的 Pixverse 模型與 Atlas Cloud 的 GPU 加速平台相結合,提供無與倫比的效能、可擴展性和開發體驗。
低延遲:
GPU 最佳化推理,實現即時回應。
統一 API:
一次整合,暢用 Pixverse、GPT、Gemini 和 DeepSeek。
透明定價:
按 Token 計費,支援 Serverless 模式。
開發者體驗:
SDK、資料分析、微調工具和模板一應俱全。
可靠性:
99.99% 可用性、RBAC 權限控制、合規日誌。
安全與合規:
SOC 2 Type II 認證、HIPAA 合規、美國資料主權。
PixVerse API 透過 Atlas Cloud 為開發者提供對 PixVerse AI 影片生成模型的程式設計存取。與使用消耗每日點數、添加浮水印並限制解析度的 PixVerse 消費者應用程式不同,您可以直接透過 REST API 呼叫模型,並且只需為您生成的內容付費。
V6 是旗艦級通用系列,在單一流程中涵蓋文字生成影片、圖片生成影片、參考圖生成影片、首尾影格控制與影片延長。C1 則採用原生分鏡(storyboard)思維,專為多鏡頭敘事製作而生,鏡頭之間的場景連續性與角色一致性,和單一影格畫質同樣重要。在 Atlas Cloud 上,V6 端點每秒 $0.025 起,C1 端點每秒 $0.03 起。
採用量計費,無需訂閱。PixVerse V6 的全部五個端點依生成影片每秒 $0.025 起計費,C1 的全部四個端點每秒 $0.03 起。只需為實際生成的內容付費,每次請求的單次呼叫價格公開透明。
PixVerse 的所有生成端點均可輸出 360p、540p、720p 或 1080p,預設為 720p。片段長度可在 1 到 15 秒之間任選,並提供八種長寬比:16:9、9:16、1:1、4:3、3:4、2:3、3:2 和 21:9。從直式社群格式到 21:9 電影畫幅全數涵蓋,生成後無需任何裁切。
會。V6 和 C1 都會在同一次生成中輸出聲音,Pixverse API 提供 sound 參數且預設開啟。如果打算自行配樂,將其設為 false 即可。唯一的例外是 V6 的 Video-Extend 端點,它不提供音訊參數。
C1 讀取多格分鏡稿的方式,就像導演讀漫畫分頁:把每一格視為獨立鏡頭,並自動推斷鏡頭之間的轉場邏輯。輸出是一段角色一致、空間邏輯連貫的連續多鏡頭序列,團隊可以直接從定稿分鏡進入成片製作,無需逐場景重建。在文字生成影片端點上,鏡頭切分還可以直接由提示詞結構來控制。
V6 和 C1 的 Reference-to-Video 端點每次請求都可接受 1 到 7 張參考圖,每張圖可標記為主體(subject)或背景(background)參考。圖片可以用公開 URL 或 Base64 字串提供,支援 PNG、JPEG、WebP 格式,單次請求總大小上限為 20MB。帶標記的參考圖正是多鏡頭製作在各個片段之間鎖定角色身份的關鍵。
V6 的 Video-Extend 端點接收來源影片 URL 加一段文字提示詞,生成 1 到 15 秒的續接內容。運動連貫性和視覺風格會延續到擴展部分,因此無論是把片段拉長到超出原始長度,還是用多個素材拼接出連續內容,都很實用。計費與其他 V6 端點相同,均為每秒 $0.025。
註冊 Atlas Cloud 帳號,產生 API key,然後在 Authorization 請求標頭中帶上該 key 呼叫任意 PixVerse 端點即可。請求以非同步方式執行:提交生成任務後會取得一個 prediction ID,輪詢結果端點直到狀態變為 completed。無需架設任何基礎設施,Day-0 接入意味著 PixVerse 新版本一發布即可使用、無需遷移。今天就開始打造吧。