Interfejs API Pixverse zapewnia programistom bezpośredni dostęp do modeli generowania wideo AISphere. V6 obejmuje generowanie wideo z tekstu, z obrazu, generowanie sterowane referencjami, kontrolę klatki początkowej i końcowej oraz rozszerzanie klipów w jednym potoku, podczas gdy C1 przekształca scenorysy w sekwencje wieloujęciowe, które zachowują spójność postaci i scen w różnych cięciach. Atlas Cloud obsługuje obie serie z przejrzystymi cenami sekundowymi i brakiem konieczności konfiguracji infrastruktury. Zacznij budować już dziś.
Atlas Cloud zapewnia najnowsze, wiodące w branży modele kreatywne.
Sprawdź, co przyjmuje każdy endpoint API Pixverse, co generuje i jakie generuje koszty w Atlas Cloud, od pojedynczych promptów tekstowych po kontrolę referencyjną z użyciem siedmiu obrazów.
| Modality | Description |
|---|---|
| Pixverse V6 Text-to-Video API (Text to Video) | Describe a scene in up to 5,000 characters and V6 renders it as a video of 1 to 15 seconds, at up to 1080p, with audio generated in the same pass. Eight aspect ratios from 21:9 cinematic to 9:16 vertical cover film, social, and ad formats without post-cropping. Pricing on Atlas Cloud starts at $0.025 per second. |
| Pixverse V6 Image-to-Video API (Image to Video) | A single still image is all this endpoint needs to produce a motion clip that preserves the source's visual identity, guided by a text prompt of up to 5,000 characters. It accepts JPG and PNG inputs up to 10MB with aspect ratios from 1:2.5 to 2.5:1, so portraits, product shots, and wide banners all animate without reformatting. Optional native audio and a seed parameter make outputs repeatable for production pipelines. |
| Pixverse V6 Start-End-to-Video API (Image to Video) | When a clip has to land on an exact final frame, this endpoint takes both a start image and an end image and generates all the motion in between. Frames can be passed as public URLs or Base64 in PNG, JPEG, or WebP, and clips run 1 to 15 seconds at up to 1080p. That makes it the natural pick for scene transitions, loopable content, and shots with a fixed visual destination. |
| Pixverse V6 Reference-to-Video API (Reference to Video) | Up to seven reference images steer each generation, and every image can be tagged as subject or background and given its own reference name for prompt-level control. V6 keeps character appearance and scene context stable across the clip, which removes manual keyframing from character-driven and brand-consistent work. Output supports the full range of eight aspect ratios and resolutions up to 1080p. |
| Pixverse V6 Video-Extend API (Video to Video) | Need a clip to run longer than its original cut? Pass a source video URL plus a text prompt and V6 continues the footage for another 1 to 15 seconds, preserving the established motion and visual style. At $0.025 per second on Atlas Cloud, extending a scene costs the same as generating one from scratch. |
| Pixverse C1 Text-to-Video API (Text to Video) | C1 treats text-to-video as a storyboard problem, generating clips built for multi-shot narrative continuity rather than isolated standalone shots. Prompts up to 5,000 characters drive videos of 1 to 15 seconds with native audio, eight aspect ratio options, and quality up to 1080p. Atlas Cloud prices the C1 series from $0.03 per second on a pay-as-you-go basis. |
| Pixverse C1 Image-to-Video API (Image to Video) | Feed C1 a still image and it returns a video sequence in which character and scene fidelity hold from the first frame to the last. Inputs follow the same practical limits as V6, JPG or PNG up to 10MB with aspect ratios from 1:2.5 to 2.5:1, so existing assets drop straight in. Its storyboard-aware design suits multi-scene projects where identity drift between shots is not acceptable. |
| Pixverse C1 Start-End-to-Video API (Image to Video) | Defining a clip by its first and last frames gives C1 a complete narrative arc to fill, and the model generates the connecting motion while keeping the series' storyboard-native visual language intact. Start and end images upload as URLs or Base64 in PNG, JPEG, or WebP, with durations of 1 to 15 seconds and a seed option for repeatable results. Episodic and multi-chapter productions use it to lock scene-to-scene transitions in place. |
| Pixverse C1 Reference-to-Video API (Reference to Video) | For serialized content where a character must look identical from one episode to the next, this endpoint accepts up to seven tagged reference images and holds their appearance across every generated shot. Subject and background tags plus per-image reference names give the Pixverse API its most granular consistency control, layered on C1's multi-shot architecture. It is available on Atlas Cloud from $0.03 per second with one OpenAI-compatible key. |
Połączenie zaawansowanych modeli z akcelerowaną przez GPU platformą Atlas Cloud zapewnia niezrównaną szybkość, skalowalność i kontrolę twórczą przy generowaniu obrazów i wideo.
C1 powstał z myślą o sekwencjach, które obnażają ograniczenia większości modeli wideo AI — choreografii walki wręcz, ruchu z dużą prędkością, efektach cząsteczkowych, dynamice płynów i klimatycznych sceneriach. Relacje przestrzenne i fizyczny ciężar pozostają spójne między klatkami, co ogranicza nakład pracy nad poprawkami, jakiego zwykle wymagają treści akcji. Obsługuje zarówno sceny realistyczne, jak i stylizowane w ramach jednego procesu generowania.
PixVerse C1 przekształca statyczne układy storyboardów bezpośrednio w ciągłe sekwencje wideo, a podział na sceny odbywa się automatycznie na podstawie struktury promptu. Zespoły produkcyjne mogą przesłać nieruchome kadry i otrzymać sekwencję wieloujęciową bez odtwarzania każdej sceny od zera. To czyni C1 praktycznym wyborem dla studiów filmowych, zespołów animacji i agencji pracujących na zatwierdzonych wcześniej briefach kreatywnych.
PixVerse V6 renderuje ruchy kamery — ujęcia śledzące, zmiany perspektywy i stopniowe odsłanianie otoczenia — precyzyjnie i z minimalną liczbą artefaktów. Emocje i mowa ciała postaci pozostają spójne przy zmianach scen, dzięki czemu model sprawdza się w sekwencjach narracyjnych wymagających czegoś więcej niż pojedynczego klipu. Dla zespołów marketingowych i studiów contentowych oznacza to mniej ręcznych poprawek i szybsze iteracje od briefu do finalnego materiału.
Oznacz maksymalnie siedem obrazów referencyjnych jako obiekt lub tło, nadaj każdemu nazwę i przywołuj go bezpośrednio w prompcie. Twarze, produkty i otoczenie zachowują dokładnie ten sam wygląd w każdej klatce.
Chcesz dźwięku bez osobnego pipeline'u? Zarówno V6, jak i C1 renderują zsynchronizowane audio w tym samym przebiegu generowania, więc zwiastuny, reklamy i klipy do mediów społecznościowych wychodzą z API gotowe do publikacji.
Od kinowych kadrów 21:9 po pionowe feedy 9:16 — osiem proporcji obrazu i cztery poziomy rozdzielczości obejmują produkcję filmową, telewizyjną i społecznościową. Wybierz 360p do wersji roboczych lub 1080p do finalnej dostawy, bez przycinania po wygenerowaniu.
Pojedynczy prompt może liczyć 5,000 znaków — wystarczająco, by w jednym żądaniu określić kolejność ujęć, oświetlenie, kostiumy i tempo. Szczegółowe scenariusze przekładają się na materiał zgodny z briefem już za pierwszym razem.
Ten sam prompt wygenerowany przez Pixverse i inne czołowe modele wideo: wiele ujęć i film reklamowy z najwyższej półki
Stwórz 10-sekundową kinową reklamę produktową luksusowego roweru elektrycznego. Scena 1, 0–2 s: Zbliżenie makro kropel deszczu spływających po matowej czarnej ramie roweru. Miękkie neonowe odbicia, mała głębia ostrości, powolny najazd kamery. Subtelne tło dźwiękowe deszczu. Scena 2, 2–5 s: Ujęcie śledzące z niskiego kąta, gdy rower jedzie nocą mokrą miejską ulicą. Opony rozchlapują wodę w płytkich kałużach. Dodaj realistyczny dźwięk rozbryzgów spod opon, cichy szum silnika elektrycznego i odgłosy ruchu ulicznego w oddali. Scena 3, 5–8 s: Płynne boczne ujęcie podążające za tym samym rowerem przejeżdżającym pod latarniami. Zachowaj dokładnie tę samą geometrię ramy, koła, reflektor, kolor i proporcje. Kontrolowane rozmycie ruchu, kadrowanie jak w reklamie premium. Scena 4, 8–10 s: Finałowe ujęcie hero: rower zatrzymuje się obok szklanego budynku. Reflektor łagodnie świeci, odbicia deszczu i neonów naturalnie zanikają. Produkt wyśrodkowany, ostry, w stylistyce reklamy z najwyższej półki. Wymagania: - Zachowaj dokładnie ten sam projekt roweru we wszystkich ujęciach - Użyj wyraźnej kinowej kontroli kamery: zbliżenie makro, śledzenie z niskiego kąta, ujęcie boczne, finałowe ujęcie hero - Utrzymuj spójność deszczu, oświetlenia, odbić i atmosfery miasta - Synchronizuj dźwięk z ruchem: deszcz, rozbryzgi spod opon, szum silnika elektrycznego, odgłosy miasta - Żadnych zniekształconych kół, zmieniającej się konstrukcji ramy ani niespójnych detali produktu - Realistyczne materiały, dopracowany wygląd filmu reklamowego, 1080p
Pixverse
Wan 2.7
Kling V3.0
Stwórz 10-sekundową kinową reklamę produktową przezroczystego głośnika bezprzewodowego stojącego na nowoczesnym studyjnym stole. Scena 1, 0–2 s: Zbliżenie makro przezroczystej obudowy głośnika. Przez przejrzystą powłokę widać wewnętrzne komponenty. Miękkie oświetlenie studyjne, czyste odbicia, mała głębia ostrości, powolny najazd kamery. Scena 2, 2–5 s: Głośnik włącza się. Subtelny pierścień LED rozświetla się od środka na zewnątrz. Kamera wykonuje płynne ujęcie orbitalne wokół produktu. Dodaj delikatny dźwięk uruchomienia i niski puls basu zsynchronizowany z animacją LED. Scena 3, 5–8 s: Bliskie ujęcie boczne: fale dźwiękowe są wizualizowane poprzez delikatne drgania na stojącej obok szklance wody. Głośnik zachowuje dokładnie ten sam kształt, rozmiar, materiał i wewnętrzny układ. Czyste studyjne tło, kadrowanie produktu klasy premium. Scena 4, 8–10 s: Finałowe ujęcie hero: przezroczysty głośnik wyśrodkowany na stole, pierścień LED łagodnie świeci, kamera powoli się oddala. Minimalistyczne futurystyczne studio, dopracowany reklamowy wygląd. Wymagania: - Zachowaj dokładnie ten sam projekt głośnika we wszystkich ujęciach - Użyj kinowej kontroli kamery: zbliżenie makro, płynna orbita, boczne zbliżenie, finałowy odjazd hero - Utrzymuj spójność oświetlenia studyjnego, odbić, przezroczystości i skali produktu - Synchronizuj dźwięk z akcją: dźwięk uruchomienia, puls basu, subtelne drgania - Żadnych zmieniających się komponentów wewnętrznych, zniekształconej przezroczystej obudowy ani niespójnej pozycji LED - Styl reklamy technologicznej z najwyższej półki, czysta kompozycja, realistyczne materiały, 1080p
Pixverse
Wan 2.7
Kling V3.0
Niezależnie od tego, czy animujesz pojedyncze zdjęcie produktu, czy reżyserujesz wieloodcinkowy serial, Pixverse API w Atlas Cloud obejmuje wideo do social mediów, animacje e-commerce, płynne przejścia i dłuższe formy narracyjne — z przejrzystym rozliczeniem pay-as-you-go.
Zamień pojedynczy prompt tekstowy w pionowy klip, który zatrzymuje scrollowanie, dzięki generowaniu wideo z tekstu w Pixverse V6. Twórcy publikujący codziennie w serwisach TikTok, Reels i Shorts utrzymują świeże feedy za $0.025 za sekundę.
Statyczne zdjęcia produktów zamieniają się w pełne ruchu klipy hero dzięki funkcji image-to-video w V6, a oryginalna identyfikacja wizualna zostaje zachowana klatka po klatce. Zespoły e-commerce animują całe katalogi w reklamy bez rezerwowania sesji studyjnej.
Potrzebujesz tego samego bohatera w dziesięciu odcinkach? Funkcja reference-to-video w C1 utrwala wygląd postaci i otoczenie z klipu na klip, dając zespołom animacji, studiom webtoonów i właścicielom IP niezawodny serialowy pipeline.
Gdy ujęcie definiują dwie klatki kluczowe, endpoint start-end generuje cały ruch pomiędzy nimi. Dopracowane cięcia scen, przejścia z morphingiem i idealnie zapętlające się tła powstają bez ręcznego klatkowania.
Wygenerowane klipy rzadko muszą kończyć się na pierwszym cięciu — endpoint video-extend w V6 kontynuuje materiał, zachowując ruch i styl. Montażyści łączą wydłużone segmenty w zwiastuny, teledyski i dłuższe sekwencje.
Każdy endpoint V6 i C1 kryje się za jednym kluczem zgodnym z OpenAI w Atlas Cloud, rozliczanym w modelu pay-as-you-go od $0.025 za sekundę. Deweloperzy dodają produkcyjne generowanie wideo do własnych produktów bez zarządzania infrastrukturą GPU.
Zanim wybierzesz stack do generowania wideo, zobacz, jak PixVerse API wypada na tle Kling, Veo, Sora i Wan pod względem trybów wejścia, rozdzielczości, długości klipu, natywnego dźwięku i ceny za sekundę.
| Model | Tryby wejścia | Maks. rozdzielczość | Długość klipu | Natywny dźwięk | Price per Second |
|---|---|---|---|---|---|
| PixVerse V6 | Tekst, obraz, obrazy referencyjne, klatka początkowa i końcowa, wydłużanie wideo | 1080p | Od 1 do 15 sekund | √ | From $0.025/s on Atlas Cloud |
| PixVerse C1 | Tekst, obraz, obrazy referencyjne, klatka początkowa i końcowa | 1080p | Od 1 do 15 sekund | √ | From $0.03/s on Atlas Cloud |
| Kling 2.5 Turbo Pro | Tekst, obraz | 1080p | 5 lub 10 sekund | - | About $0.07/s |
| Google Veo 3.1 | Tekst, obraz, obrazy referencyjne, pierwsza i ostatnia klatka | Do 4K | 4, 6 lub 8 sekund | √ | $0.40/s (Fast from $0.10/s) |
| OpenAI Sora 2 | Tekst, obraz | 720p (1080p w Sora 2 Pro) | 4, 8 lub 12 sekund | √ | $0.10/s ($0.30/s for Pro) |
| Alibaba Wan 2.5 | Tekst, obraz, opcjonalne sterowanie dźwiękiem | 1080p | 5 lub 10 sekund | √ | From $0.05/s |
Zacznij w kilka minut — wykonaj te proste kroki, aby zintegrować i wdrożyć modele za pośrednictwem platformy Atlas Cloud.
Zarejestruj się na atlascloud.ai i ukończ weryfikację. Nowi użytkownicy otrzymują bezpłatne kredyty do eksploracji platformy i testowania modeli.
Połączenie zaawansowanych modeli Pixverse z platformą GPU-akcelerowaną Atlas Cloud zapewnia niezrównaną wydajność, skalowalność i doświadczenie deweloperskie.
Niska Latencja:
Inferencja zoptymalizowana pod GPU dla rozumowania w czasie rzeczywistym.
Zunifikowane API:
Uruchamiaj Pixverse, GPT, Gemini i DeepSeek za pomocą jednej integracji.
Przejrzysta Wycena:
Przewidywalne rozliczenia za token z opcjami serverless.
Doświadczenie Dewelopera:
SDK, analityka, narzędzia dostrajania i szablony.
Niezawodność:
99,99% dostępności, RBAC i logowanie gotowe na zgodność.
Bezpieczeństwo i Zgodność:
SOC 2 Type II, zgodność z HIPAA, suwerenność danych w USA.
PixVerse API zapewnia programistom programistyczny dostęp do modeli generowania wideo AI firmy PixVerse za pośrednictwem Atlas Cloud. Zamiast korzystać z aplikacji konsumenckiej PixVerse, która działa w oparciu o codzienne kredyty, dodaje znak wodny i ogranicza rozdzielczość, można wywoływać modele bezpośrednio przez REST API i płacić tylko za to, co się wygeneruje.
V6 to flagowa seria ogólnego przeznaczenia, obejmująca w jednym pipelinie generowanie wideo z tekstu, z obrazu i z materiałów referencyjnych, kontrolę klatki początkowej i końcowej oraz wydłużanie wideo. C1 stawia na podejście natywnie oparte na storyboardzie, stworzone z myślą o narracyjnej produkcji wieloujęciowej, w której ciągłość scen i spójność postaci między cięciami liczą się tak samo jak jakość pojedynczej klatki. W Atlas Cloud endpointy V6 zaczynają się od $0.025 za sekundę, a endpointy C1 od $0.03 za sekundę.
Rozliczenie działa w modelu pay-as-you-go, bez żadnej subskrypcji. Wszystkie pięć endpointów PixVerse V6 rozliczanych jest od $0.025 za sekundę wygenerowanego wideo, a wszystkie cztery endpointy C1 zaczynają się od $0.03 za sekundę. Płacisz tylko za to, co wygenerujesz, z przejrzystą wyceną każdego wywołania.
Każdy endpoint generowania PixVerse zwraca wideo w 360p, 540p, 720p lub 1080p, domyślnie w 720p. Klipy mogą trwać od 1 do 15 sekund, a do wyboru jest osiem proporcji obrazu: 16:9, 9:16, 1:1, 4:3, 3:4, 2:3, 3:2 i 21:9. Ten zakres obejmuje wszystko — od pionowych formatów społecznościowych po kinowe kadry 21:9 — bez żadnego przycinania po wygenerowaniu.
Tak. Zarówno V6, jak i C1 generują dźwięk w tym samym przebiegu, a Pixverse API udostępnia parametr sound, domyślnie włączony. Ustaw go na false, jeśli planujesz samodzielnie udźwiękowić klip. Jedynym wyjątkiem jest endpoint V6 Video-Extend, który nie udostępnia parametru audio.
C1 czyta wielopanelowy storyboard tak, jak reżyser czyta stronę komiksu: traktuje każdy panel jako osobne ujęcie i sam wnioskuje logikę przejść między nimi. Wynikiem jest ciągła sekwencja wieloujęciowa ze spójnymi postaciami i logiką przestrzenną, dzięki czemu zespoły mogą przejść od zatwierdzonych plansz do materiału bez odtwarzania każdej sceny od zera. W endpoincie tekst-wideo segmentację ujęć można też sterować bezpośrednio strukturą promptu.
Endpointy Reference-to-Video zarówno w V6, jak i w C1 przyjmują od 1 do 7 obrazów referencyjnych na żądanie, a każdy z nich można oznaczyć jako referencję postaci lub tła. Obrazy można przekazać jako publiczne adresy URL lub ciągi Base64 w formacie PNG, JPEG lub WebP, przy łącznym limicie żądania 20MB. To właśnie otagowane referencje pozwalają produkcjom wieloujęciowym utrzymać tożsamość postaci od klipu do klipu.
Endpoint V6 Video-Extend przyjmuje adres URL wideo źródłowego oraz prompt tekstowy i generuje kontynuację o długości od 1 do 15 sekund. Ciągłość ruchu i styl wizualny przenoszą się na przedłużenie, co czyni go praktycznym do wydłużania klipu poza pierwotną długość lub budowania sekwencyjnych treści z wielu źródeł. Rozliczany jest według tej samej stawki $0.025 za sekundę co pozostałe endpointy V6.
Załóż konto Atlas Cloud, wygeneruj klucz API i wywołaj dowolny endpoint PixVerse, przekazując klucz w nagłówku Authorization. Żądania działają asynchronicznie: wysyłasz generację, otrzymujesz prediction ID, a następnie odpytujesz endpoint wyników, aż status będzie completed. Nie ma żadnej infrastruktury do skonfigurowania, a dostęp Day-0 oznacza, że nowe wydania PixVerse pojawiają się bez żadnej migracji. Zacznij budować już dziś.