Pixverse APIは、開発者にAISphereの動画生成モデルへの直接アクセスを提供します。V6は、テキストから動画、画像から動画、リファレンスガイド生成、開始および終了フレーム制御、クリップ拡張を単一のパイプラインでカバーします。一方、C1は絵コンテをマルチショットシーケンスに変換し、カット間でのキャラクターやシーンの一貫性を維持します。Atlas Cloudは、透明性のある秒単位の料金設定とインフラストラクチャ設定不要で、両方のシリーズにサービスを提供します。今日から構築を始めましょう。
Atlas Cloudは、業界をリードする最新のクリエイティブモデルを提供します。
単一のテキストプロンプトから7枚の画像参照コントロールまで、Atlas Cloud上における各Pixverse APIエンドポイントの入力内容、生成物、およびコストをご確認ください。
| Modality | Description |
|---|---|
| Pixverse V6 Text-to-Video API (Text to Video) | Describe a scene in up to 5,000 characters and V6 renders it as a video of 1 to 15 seconds, at up to 1080p, with audio generated in the same pass. Eight aspect ratios from 21:9 cinematic to 9:16 vertical cover film, social, and ad formats without post-cropping. Pricing on Atlas Cloud starts at $0.025 per second. |
| Pixverse V6 Image-to-Video API (Image to Video) | A single still image is all this endpoint needs to produce a motion clip that preserves the source's visual identity, guided by a text prompt of up to 5,000 characters. It accepts JPG and PNG inputs up to 10MB with aspect ratios from 1:2.5 to 2.5:1, so portraits, product shots, and wide banners all animate without reformatting. Optional native audio and a seed parameter make outputs repeatable for production pipelines. |
| Pixverse V6 Start-End-to-Video API (Image to Video) | When a clip has to land on an exact final frame, this endpoint takes both a start image and an end image and generates all the motion in between. Frames can be passed as public URLs or Base64 in PNG, JPEG, or WebP, and clips run 1 to 15 seconds at up to 1080p. That makes it the natural pick for scene transitions, loopable content, and shots with a fixed visual destination. |
| Pixverse V6 Reference-to-Video API (Reference to Video) | Up to seven reference images steer each generation, and every image can be tagged as subject or background and given its own reference name for prompt-level control. V6 keeps character appearance and scene context stable across the clip, which removes manual keyframing from character-driven and brand-consistent work. Output supports the full range of eight aspect ratios and resolutions up to 1080p. |
| Pixverse V6 Video-Extend API (Video to Video) | Need a clip to run longer than its original cut? Pass a source video URL plus a text prompt and V6 continues the footage for another 1 to 15 seconds, preserving the established motion and visual style. At $0.025 per second on Atlas Cloud, extending a scene costs the same as generating one from scratch. |
| Pixverse C1 Text-to-Video API (Text to Video) | C1 treats text-to-video as a storyboard problem, generating clips built for multi-shot narrative continuity rather than isolated standalone shots. Prompts up to 5,000 characters drive videos of 1 to 15 seconds with native audio, eight aspect ratio options, and quality up to 1080p. Atlas Cloud prices the C1 series from $0.03 per second on a pay-as-you-go basis. |
| Pixverse C1 Image-to-Video API (Image to Video) | Feed C1 a still image and it returns a video sequence in which character and scene fidelity hold from the first frame to the last. Inputs follow the same practical limits as V6, JPG or PNG up to 10MB with aspect ratios from 1:2.5 to 2.5:1, so existing assets drop straight in. Its storyboard-aware design suits multi-scene projects where identity drift between shots is not acceptable. |
| Pixverse C1 Start-End-to-Video API (Image to Video) | Defining a clip by its first and last frames gives C1 a complete narrative arc to fill, and the model generates the connecting motion while keeping the series' storyboard-native visual language intact. Start and end images upload as URLs or Base64 in PNG, JPEG, or WebP, with durations of 1 to 15 seconds and a seed option for repeatable results. Episodic and multi-chapter productions use it to lock scene-to-scene transitions in place. |
| Pixverse C1 Reference-to-Video API (Reference to Video) | For serialized content where a character must look identical from one episode to the next, this endpoint accepts up to seven tagged reference images and holds their appearance across every generated shot. Subject and background tags plus per-image reference names give the Pixverse API its most granular consistency control, layered on C1's multi-shot architecture. It is available on Atlas Cloud from $0.03 per second with one OpenAI-compatible key. |
高度なモデルと Atlas Cloud の GPU アクセラレーション基盤を組み合わせることで、画像・動画生成において比類のない速度、スケーラビリティ、クリエイティブなコントロールを実現します。
C1 は、多くの AI 動画モデルの限界が露呈するシーケンス——近接戦闘の振り付け、高速モーション、パーティクルエフェクト、流体力学、雰囲気のある環境——を扱うために設計されています。空間関係と物理的な重量感がフレーム間で一貫して保たれるため、アクション系コンテンツで通常必要となる修正の手間を削減できます。単一の生成ワークフロー内で、リアルなシーンとスタイライズされたシーンの両方に対応します。
PixVerse C1 は、静的なストーリーボードのレイアウトを連続した動画シーケンスへ直接変換し、シーン分割はプロンプト構造に基づいて自動的に処理されます。制作チームは静止画のパネルをアップロードするだけで、各シーンをゼロから作り直すことなくマルチショットのシーケンスを得られます。承認済みのクリエイティブブリーフをもとに作業する映画スタジオ、アニメーション制作チーム、エージェンシーにとって、C1 は実用的な選択肢です。
PixVerse V6 は、トラッキングショット、視点の切り替え、環境のリビールといったカメラワークを、高い精度と最小限のアーティファクトでレンダリングします。シーンが切り替わってもキャラクターの感情表現やボディランゲージが一貫して保たれるため、単発のクリップでは足りないナラティブなシーケンスにも安心して使えます。マーケティングチームやコンテンツスタジオにとっては、手作業の修正が減り、ブリーフから最終アウトプットまでのイテレーションが速くなることを意味します。
最大 7 枚の参照画像を被写体または背景としてタグ付けし、それぞれに名前を付けて、プロンプト内で直接呼び出せます。顔、製品、環境は、すべてのフレームで見た目がそのまま保たれます。
別パイプラインなしで音声も欲しい?V6 と C1 はどちらも同じ生成パスで同期音声をレンダリングするため、トレーラー、広告、SNS 向けクリップは API から出力された時点で公開できる状態になっています。
21:9 のシネマティックなフレームから 9:16 の縦型フィードまで、8 種類のアスペクト比と 4 段階の解像度が映画、放送、SNS 向けの出力をカバーします。下書きには 360p、最終納品には 1080p を選べて、生成後のクロップは不要です。
1 つのプロンプトで 5,000 文字まで記述でき、ショットの順序、ライティング、衣装、ペース配分を 1 回のリクエストで指定するのに十分です。詳細なスクリプトは、一発でブリーフどおりの映像に仕上がります。
同じプロンプトを Pixverse と他の主要動画モデルで生成:マルチショットのハイエンドCM映像
高級電動自転車の10秒間のシネマティックなプロダクトCMを制作してください。 シーン1(0〜2秒): マットブラックのフレームを伝う雨粒のマクロ接写。柔らかなネオンの反射、浅い被写界深度、ゆっくりとしたプッシュインのカメラワーク。かすかな雨の環境音。 シーン2(2〜5秒): 夜の濡れた街路を走る自転車をローアングルでトラッキング撮影。タイヤが浅い水たまりの水を跳ね上げる。リアルなタイヤの水しぶき音、静かな電動モーターの駆動音、遠くの交通の環境音を加える。 シーン3(5〜8秒): 街灯の下を通り過ぎる同じ自転車を、滑らかなサイドフォローで撮影。フレーム形状、ホイール、ヘッドライト、色、プロポーションを完全に同一に保つ。抑制されたモーションブラー、プレミアムなCM的構図。 シーン4(8〜10秒): 最後のヒーローショット:自転車がガラス張りのビルの横に停まる。ヘッドライトが柔らかく光り、雨とネオンの反射が自然にフェードアウトする。製品を中央に配置し、シャープでハイエンドな広告ルック。 要件: - 全ショットで自転車のデザインを完全に統一する - 明確なシネマティックカメラコントロールを使用する:マクロ接写、ローアングルトラッキング、サイドフォロー、最後のヒーローショット - 雨、ライティング、反射、都市の雰囲気を一貫させる - 音声を動きと同期させる:雨音、タイヤの水しぶき、電動モーターの駆動音、都市の環境音 - ホイールの歪み、フレーム構造の変化、製品ディテールの不整合は不可 - リアルな質感、洗練されたCMフィルムのルック、1080p
Pixverse
Wan 2.7
Kling V3.0
モダンなスタジオテーブルの上に置かれた透明ワイヤレススピーカーの、10秒間のシネマティックなプロダクトCMを制作してください。 シーン1(0〜2秒): 透明なスピーカー筐体のマクロ接写。クリアなシェル越しに内部コンポーネントが見える。柔らかなスタジオライティング、クリーンな反射、浅い被写界深度、ゆっくりとしたプッシュインのカメラワーク。 シーン2(2〜5秒): スピーカーの電源が入る。控えめなLEDリングが中心から外側へと点灯していく。カメラは製品の周りを滑らかにオービット撮影する。LEDアニメーションと同期した、柔らかな起動音と低いベースのパルスを加える。 シーン3(5〜8秒): サイドからのクローズショット:近くに置かれた水の入ったグラスの穏やかな振動によって音波を可視化する。スピーカーの形状、サイズ、素材、内部レイアウトは完全に同一のまま。クリーンなスタジオ背景、プレミアムなプロダクト構図。 シーン4(8〜10秒): 最後のヒーローショット:透明スピーカーをテーブル中央に配置し、LEDリングが柔らかく光る中、カメラがゆっくりと引いていく。ミニマルで未来的なスタジオ、洗練されたCMルック。 要件: - 全ショットでスピーカーのデザインを完全に統一する - シネマティックカメラコントロールを使用する:マクロ接写、滑らかなオービット、サイドクローズアップ、最後のヒーロープルバック - スタジオライティング、反射、透明感、製品スケールを一貫させる - 音声をアクションと同期させる:起動音、ベースのパルス、かすかな振動 - 内部コンポーネントの変化、透明筐体の歪み、LED位置の不整合は不可 - ハイエンドなテクノロジーCMスタイル、クリーンな構図、リアルな質感、1080p
Pixverse
Wan 2.7
Kling V3.0
1 枚の商品写真をアニメーション化する場合でも、複数エピソードのシリーズを演出する場合でも、Atlas Cloud の Pixverse API はソーシャル動画、EC 向けモーション、シームレスなトランジション、長尺ストーリーテリングをカバーし、料金は透明性の高い従量課金制です。
Pixverse V6 のテキストから動画への生成で、1 つのテキストプロンプトをスクロールの手が止まる縦型クリップに変えられます。TikTok、Reels、Shorts に毎日投稿するクリエイターは、1 秒あたり $0.025 でフィードを新鮮に保てます。
V6 の画像から動画への変換により、静止した商品写真が動きの豊かなヒーロークリップになります。元のビジュアルアイデンティティはフレームからフレームへとそのまま維持されます。EC チームはスタジオ撮影を予約することなく、カタログ全体をアニメーション化して広告にできます。
10 話にわたって同じ主人公が必要ですか?C1 の参照画像から動画への生成は、クリップ間でキャラクターの外見と環境を固定し、アニメーション制作チーム、ウェブトゥーンスタジオ、IP ホルダーに信頼できる連載パイプラインを提供します。
2 つのキーフレームでショットを定義すれば、start-end エンドポイントがその間のすべての動きを生成します。洗練されたシーンカット、モーフィングによる演出、完璧にループする背景ビジュアルが、手作業のキーフレーム設定なしで手に入ります。
V6 の video-extend エンドポイントは動きとスタイルを保ったまま映像を続きから生成できるため、生成されたクリップを最初のカットで終わらせる必要はほとんどありません。編集者は延長したセグメントをつなぎ合わせ、予告編、ミュージックビデオ、より長いシーケンスに仕上げます。
すべての V6 および C1 エンドポイントは、Atlas Cloud 上の OpenAI 互換キー 1 つで利用でき、1 秒あたり $0.025 からの従量課金で請求されます。開発者は GPU インフラを管理することなく、本番品質の動画生成を自社プロダクトに組み込めます。
動画生成スタックを選ぶ前に、入力モード、解像度、クリップの長さ、ネイティブ音声、秒単位の料金の観点で、PixVerse APIがKling、Veo、Sora、Wanとどう比較できるかを確認しましょう。
| モデル | 入力モード | 最大解像度 | クリップの長さ | ネイティブ音声 | Price per Second |
|---|---|---|---|---|---|
| PixVerse V6 | テキスト、画像、参照画像、開始・終了フレーム、動画の延長 | 1080p | 1〜15秒 | √ | From $0.025/s on Atlas Cloud |
| PixVerse C1 | テキスト、画像、参照画像、開始・終了フレーム | 1080p | 1〜15秒 | √ | From $0.03/s on Atlas Cloud |
| Kling 2.5 Turbo Pro | テキスト、画像 | 1080p | 5秒または10秒 | - | About $0.07/s |
| Google Veo 3.1 | テキスト、画像、参照画像、最初と最後のフレーム | 最大4K | 4秒、6秒、または8秒 | √ | $0.40/s (Fast from $0.10/s) |
| OpenAI Sora 2 | テキスト、画像 | 720p(Sora 2 Proでは1080p) | 4秒、8秒、または12秒 | √ | $0.10/s ($0.30/s for Pro) |
| Alibaba Wan 2.5 | テキスト、画像、オプションの音声ガイダンス | 1080p | 5秒または10秒 | √ | From $0.05/s |
数分で始められます — 以下の簡単なステップに従って、Atlas Cloud プラットフォームでモデルを統合・デプロイしましょう。
atlascloud.ai でサインアップし、認証を完了します。新規ユーザーには無料クレジットが付与され、プラットフォームの探索やモデルのテストに使用できます。
高度なPixverseモデルとAtlas CloudのGPU加速プラットフォームを組み合わせることで、比類のないパフォーマンス、スケーラビリティ、開発者エクスペリエンスを提供。
低レイテンシ:
リアルタイム推論のためのGPU最適化推論。
統合API:
1つの統合でPixverse、GPT、Gemini、DeepSeekを実行。
透明な料金:
サーバーレスオプション付きの予測可能なtoken単位の課金。
開発者エクスペリエンス:
SDK、分析、ファインチューニングツール、テンプレート。
信頼性:
99.99%の稼働率、RBAC、コンプライアンス対応ロギング。
セキュリティとコンプライアンス:
SOC 2 Type II、HIPAA準拠、米国内のデータ主権。
PixVerse API は、開発者に Atlas Cloud 経由で PixVerse の AI 動画生成モデルへのプログラムによるアクセスを提供します。日々のクレジットを消費し、透かしを追加し、解像度を制限する PixVerse コンシューマーアプリを使用する代わりに、REST API を介して直接モデルを呼び出し、生成した分だけ料金を支払うことができます。
V6はフラッグシップの汎用シリーズで、テキストから動画、画像から動画、参照画像から動画、開始・終了フレーム制御、動画延長までを1つのパイプラインでカバーします。C1はストーリーボードネイティブなアプローチを採用し、マルチショットのナラティブ制作向けに設計されています。カット間のシーンの連続性やキャラクターの一貫性が、1フレームごとの品質と同じくらい重視される用途に適しています。Atlas CloudではV6エンドポイントが1秒あたり$0.025から、C1エンドポイントが1秒あたり$0.03から利用できます。
料金は従量課金制で、サブスクリプションは不要です。PixVerse V6の5つのエンドポイントはすべて生成動画1秒あたり$0.025から、C1の4つのエンドポイントはすべて1秒あたり$0.03から課金されます。生成した分だけの支払いで、すべてのリクエストで呼び出しごとの料金が明示されます。
PixVerseのすべての生成エンドポイントは360p、540p、720p、1080pで出力でき、デフォルトは720pです。クリップの長さは1〜15秒で、アスペクト比は16:9、9:16、1:1、4:3、3:4、2:3、3:2、21:9の8種類が利用できます。縦型のソーシャル向けフォーマットから21:9のシネマティックなフレームまで、生成後のクロップなしでカバーできます。
はい。V6とC1はどちらも同じ生成パスで音声も生成し、Pixverse APIにはデフォルトで有効なsoundパラメータが用意されています。自分でクリップに音を付ける場合はfalseに設定してください。唯一の例外はV6のVideo-Extendエンドポイントで、音声パラメータは提供されていません。
C1は、映画監督がコミックのページを読むように複数パネルのストーリーボードを読み取り、各パネルを個別のショットとして扱い、パネル間のトランジションのロジックを推論します。出力はキャラクターと空間の一貫性が保たれた連続的なマルチショットシーケンスとなるため、チームは承認済みのボードからシーンを作り直すことなく映像制作に進めます。テキストから動画のエンドポイントでは、プロンプトの構造によってショット分割を直接制御することもできます。
V6とC1のReference-to-Videoエンドポイントはどちらも、1リクエストあたり1〜7枚の参照画像を受け付け、それぞれを被写体(subject)または背景(background)の参照としてタグ付けできます。画像は公開URLまたはBase64文字列で、PNG・JPEG・WebP形式に対応し、リクエスト全体の上限は20MBです。タグ付けされた参照画像こそが、マルチショット制作でクリップ間のキャラクターの同一性を固定する仕組みです。
V6のVideo-Extendエンドポイントは、元動画のURLとテキストプロンプトを受け取り、1〜15秒の続きを生成します。モーションの連続性とビジュアルスタイルは延長部分にも引き継がれるため、クリップを元の長さ以上に伸ばしたり、複数のソースからシーケンス化したコンテンツを組み立てたりするのに実用的です。料金は他のV6エンドポイントと同じ1秒あたり$0.025です。
Atlas Cloudのアカウントを作成し、APIキーを生成して、そのキーをAuthorizationヘッダーに含めて任意のPixVerseエンドポイントを呼び出します。リクエストは非同期で実行されます。生成をサブミットするとprediction IDが返るので、ステータスがcompletedになるまで結果エンドポイントをポーリングしてください。インフラのセットアップは不要で、Day-0アクセスによりPixVerseの新リリースは移行作業なしで利用可能になります。今日から開発を始めましょう。