
Kling O1 to rodzina modeli wideo firmy Kuaishou, zbudowana w oparciu o technologię Multi-modal Visual Language. Jej przepływy pracy text-to-video i image-to-video łączą kontekst językowy i wizualny, aby na podstawie promptów lub obrazów źródłowych tworzyć płynne dynamiki scen. Atlas Cloud udostępnia oba tryby za pośrednictwem gotowego do użycia REST API, bez zimnych startów i z przejrzystym rozliczaniem pay-as-you-go. Zacznij tworzyć już dziś.
Kling o1 został opracowany przez Kuaishou. Atlas Cloud (prowadzona przez Atlas Cloud AI LLC) zapewnia dostęp do modelu, ale nie jest jego właścicielem. Wszystkie znaki towarowe należą do ich odpowiednich właścicieli.
Porównaj tekstowe i obrazowe przepływy pracy Kling O1, aby wybrać właściwy endpoint generowania wideo dla swojego projektu.
| Tryb | Opis |
|---|---|
| Kling O1 T2V API (Text To Video) | Zamieniaj prompty tekstowe w filmy o kinowej jakości za pomocą endpointu Kling O1 Text to Video. Technologia MVL obsługuje precyzyjne rozumienie semantyki, spójność obiektów oraz naturalną symulację fizyki. Używaj jej do tworzenia koncepcji fabularnych, narracji produktowych i scen reżyserowanych za pomocą tekstu. |
| Kling O1 I2V API (Image To Video) | Na podstawie statycznego obrazu endpoint Kling O1 Image to Video tworzy dynamiczny film o kinowej jakości. Zachowuje spójność obiektu, dodając naturalny ruch, symulację fizyki oraz płynną dynamikę sceny. Ten przepływ pracy sprawdza się w animowaniu obrazów, narracji wizualnej i tworzeniu scen o kinowej jakości. |
Kling O1 łączy generowanie text-to-video i image-to-video ze spójnością obiektów, naturalną fizyką, precyzyjnym rozumieniem promptów, kontrolą pierwszej i ostatniej klatki, elastycznym czasem trwania 5 lub 10 sekund, trzema proporcjami obrazu oraz gotowym dostępem do REST API Atlas Cloud przy przejrzystym rozliczaniu zależnym od użycia.
Kling O1 przekształca prompty tekstowe lub obraz źródłowy w kinowe wideo za pośrednictwem dedykowanych endpointów text-to-video i image-to-video Atlas Cloud. Jego architektura MVL interpretuje zamysł sceny na podstawie danych językowych i wizualnych. Wybierz tryb odpowiadający materiałowi początkowemu bez zmiany bazowej rodziny modeli. Ta elastyczność sprawdza się w zespołach przechodzących od wczesnych koncepcji do animowanych ujęć kampanii lub scen fabularnych.
Model zachowuje rozpoznawalność obiektów w miarę rozwoju akcji, nawet gdy kamera się porusza, a scena ewoluuje. Generowanie image-to-video przenosi wizualną tożsamość obrazu źródłowego w ruch, natomiast text-to-video tworzy spójne postacie na podstawie promptu. Stabilne obiekty ograniczają rozpraszające zmiany między klatkami. Wykorzystaj tę zaletę w historiach skupionych na postaciach, ujęciach produktów oraz sekwencjach, w których ciągłość wizualna ma znaczenie.
Naturalna symulacja fizyki nadaje ruchowi ciężar, pęd i wiarygodną interakcję z otaczającą sceną. Kling O1 animuje ludzi, obiekty i elementy otoczenia z dynamiką, która sprawia wrażenie spójnej, a nie doklejonej. Połącz w promptach wyraźne wskazówki dotyczące akcji z kierunkiem ruchu kamery. Rezultat sprawdza się w ujęciach sportowych, kulinarnych, przyrodniczych i akcji, w których jakość ruchu decyduje o odbiorze sceny.
Rozpocznij od jednego obrazu lub dodaj opcjonalny obraz końcowy, aby określić, gdzie ruch ma się zakończyć. Schemat image-to-video Atlas Cloud obsługuje klipy o długości 5 lub 10 sekund, zapewniając czytelne możliwości rytmizacji zarówno krótkich sekwencji, jak i dłuższych przejść. Model syntetyzuje ruch między stanami wizualnymi zgodnie z wytycznymi promptu. Ta kontrola doskonale nadaje się do prezentacji produktów, transformacji i krótkich łuków narracyjnych.
Precyzyjne rozumienie semantyki pozwala Kling O1 przekształcać szczegółowe prompty w obiekty, działania, dynamikę sceny i filmowy ruch kamery. Ustaw kadr za pomocą proporcji 16:9, 9:16 lub 1:1, a następnie opisz ruch i atmosferę językiem naturalnym. Złożone wytyczne stają się ustrukturyzowanym żądaniem generowania zamiast ręcznej animacji. Dzięki temu model sprawdza się w klipach do mediów społecznościowych, storyboardach i dopracowanych koncepcjach wizualnych.
Twórz za pomocą ujednoliconego REST API Atlas Cloud, obsługującego zarówno generowanie text-to-video, jak i image-to-video. Atlas Cloud nie stosuje cold startów i pobiera standardową stawkę $0.112 za każdą sekundę wyjściową, a rozliczenie opiera się na wygenerowanym czasie trwania. Przesyłaj prompty, klatki źródłowe, czas trwania i proporcje obrazu jako ustrukturyzowane parametry. Taka konfiguracja zapewnia programistom przewidywalne koszty i bezpośrednią integrację z produkcyjnymi przepływami pracy związanymi z wideo.
Zobacz, jak Kling O1, Seedance 2.0 i Kling V3.0 Turbo interpretują te same dwa prompty pod kątem kinowego realizmu, ciągłości ruchu, interakcji fizycznych i stylizowanej narracji.
Stwórz 10-sekundowy fotorealistyczny, kinowy film przedstawiający golden retrievera niosącego bukiet przez zatłoczony targ kwiatowy o wschodzie słońca. Rozpocznij od ujęcia śledzącego z niskiej perspektywy, gdy pies pędzi po mokrym bruku, rozrzucając płatki i przemykając między poruszającymi się wózkami. Wykonaj gwałtowny obrót panoramujący w stronę sprzedawcy kwiatów biegnącego z tyłu, a następnie okrąż psa, gdy przeskakuje nad przewróconym koszem i naturalnie ląduje. Zakończ szybkim najazdem, gdy pies zatrzymuje się obok dziecka, podaje mu bukiet, a roześmiany sprzedawca dogania ich. Ciepłe światło konturowe, realistyczna sierść, realistyczna fizyka tkanin i płatków, nieprzerwany, pełen energii ruch, proporcje obrazu 16:9.
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Stwórz 8-sekundowy stylizowany film z glinianą animacją poklatkową, rozgrywający się w oświetlonej księżycowym blaskiem piekarni, gdzie maleńki lis-kucharz przygotowuje magiczne ciastko. Rozpocznij od ujęcia z góry z jazdą kamerową, gdy lis obraca ciasto, podrzuca jagody i unika odbijających się przyborów kuchennych. Przejdź do śledzącego ujęcia z poziomu blatu, gdy ciastko pędzi do piekarnika i zaczyna świecić. Szybko okrąż lisa, gdy piekarnik gwałtownie się otwiera, a z jego wnętrza wylatuje miniaturowy smok z ciasta, wykonuje pętlę wśród unoszącej się mąki i ląduje na czapce kucharza. Ręcznie wykonane gliniane tekstury, ekspresyjny ruch, figlarne niebieskie i bursztynowe oświetlenie, płynna ciągłość akcji, proporcje obrazu 16:9.
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Od inspirowanych promptami filmowych koncepcji po animowane materiały produktowe — Kling O1 oferuje filmowcom, marketerom, zespołom e-commerce i twórcom aplikacji praktyczne sposoby na tworzenie spójnych, uwzględniających prawa fizyki nagrań wideo na podstawie tekstu lub nieruchomych klatek.
Przekształcaj szczegółowe prompty w kinowe sekwencje dzięki precyzyjnemu rozumieniu semantyki i naturalnej symulacji fizyki. Filmowcy i zespoły prewizualizacji mogą testować nastrój, akcję oraz pomysły na ujęcia kamery, zanim zaangażują zasoby w kosztowną produkcję na żywo.
Animuj statyczne zdjęcie produktu, zachowując jego główny obiekt i dodając płynną dynamikę sceny. Zespoły e-commerce mogą przekształcać materiały katalogowe w dopracowane animacje na potrzeby premier, sklepów internetowych i kreacji kampanii.
Zacznij od opisu koncepcji, a następnie generuj kinowe filmy, których ruch opiera się na naturalnych prawach fizyki. Zespoły social media zyskują nowe kierunki wizualne dla ogłoszeń, kampanii sezonowych i szybkiego testowania kreacji dopasowanych do konkretnych kanałów.
Przekształcaj narracyjne prompty w spójne ruchome sceny dzięki precyzyjnemu rozumieniu semantyki. Reżyserzy, agencje i studia gier mogą wizualizować ruch postaci, dynamikę otoczenia oraz filmową atmosferę na wczesnym etapie rozwoju i planowania projektu.
Nadaj statycznemu portretowi naturalny ruch, zachowując spójność obiektu dzięki trybowi obrazu Kling O1. Twórcy mogą przygotowywać ekspresyjne filmy profilowe, prezentacje postaci i materiały do wizualnego storytellingu na podstawie istniejących ilustracji.
Gdy prompt opisuje złożony ruch, Kling O1 wykorzystuje naturalną symulację fizyki i precyzyjne rozumienie semantyki. Projektanci akcji i zespoły koncepcyjne mogą podglądać dynamiczne sceny z wiarygodnym ruchem, zanim rozpocznie się produkcja.
Porównaj Kling O1 z innymi modelami wideo Atlas Cloud według dostawcy, trybu generowania, identyfikatora modelu i standardowych cen katalogowych.
| Model | Dostawca | Tryb generowania | Identyfikator modelu Atlas | Podana cena bazowa |
|---|---|---|---|---|
| Kling Video O1 Text-to-video | Kuaishou | Tekst na wideo | kwaivgi/kling-video-o1/text-to-video | $0.112, jednostka niepodana |
| Kling Video O1 Image-to-video | Kuaishou | Obraz na wideo | kwaivgi/kling-video-o1/image-to-video | $0.112, jednostka niepodana |
| Seedance 2.0 Text-to-Video | ByteDance | Tekst na wideo | bytedance/seedance-2.0/text-to-video | $0.112, jednostka niepodana |
| Wan-2.7 Image-to-video | Qwen | Obraz na wideo | alibaba/wan-2.7/image-to-video | $0.10, jednostka niepodana |
| Veo 3.1 Lite Text-to-video | Tekst na wideo | google/veo3.1-lite/text-to-video | $0.05, jednostka niepodana | |
| MiniMax H3 Image-to-Video | MiniMax | Obraz na wideo | minimax/h3/image-to-video | $0.038 za sekundę |
Zacznij w kilka minut — wykonaj te proste kroki, aby zintegrować i wdrożyć modele za pośrednictwem platformy Atlas Cloud.
Zarejestruj się na atlascloud.ai i ukończ weryfikację. Nowi użytkownicy otrzymują bezpłatne kredyty do eksploracji platformy i testowania modeli.
Połączenie zaawansowanych modeli Kling o1 z platformą GPU-akcelerowaną Atlas Cloud zapewnia niezrównaną wydajność, skalowalność i doświadczenie deweloperskie.
Niska Latencja:
Inferencja zoptymalizowana pod GPU dla rozumowania w czasie rzeczywistym.
Zunifikowane API:
Uruchamiaj Kling o1, GPT, Gemini i DeepSeek za pomocą jednej integracji.
Przejrzysta Wycena:
Przewidywalne rozliczenia za token z opcjami serverless.
Doświadczenie Dewelopera:
SDK, analityka, narzędzia dostrajania i szablony.
Niezawodność:
99,99% dostępności, RBAC i logowanie gotowe na zgodność.
Bezpieczeństwo i Zgodność:
SOC 2 Type II, zgodność z HIPAA, suwerenność danych w USA.
Kling O1 to zunifikowany multimodalny model wideo firmy Kuaishou, zbudowany z wykorzystaniem technologii Multi-modal Visual Language. W Atlas Cloud zweryfikowana rodzina obejmuje endpointy text-to-video oraz image-to-video. Model koncentruje się na semantycznym rozumieniu promptów, spójności obiektów i naturalnej symulacji fizyki.
Użyj text-to-video, aby przekształcić pisemne opisy scen w kinowe klipy, lub animuj obraz źródłowy za pomocą trybu image-to-video. Oba endpointy obsługują przepływy pracy wymagające spójnych obiektów, kontrolowanego ruchu i realistycznej dynamiki sceny.
Wybierz text-to-video, gdy projekt zaczyna się od pisemnego opisu sceny. Wybierz image-to-video, gdy istniejący obraz ma określić obiekt, kompozycję lub pierwszą klatkę przed dodaniem ruchu.
Wyślij uwierzytelnione żądanie POST do https://api.atlascloud.ai/api/v1/model/generateVideo, podając wybrany identyfikator modelu i dane wejściowe. Użyj kwaivgi/kling-video-o1/text-to-video lub kwaivgi/kling-video-o1/image-to-video, a następnie pobierz wynik za pomocą zwróconego prediction ID.
W przypadku text-to-video podaj prompt i użyj udokumentowanych ustawień proporcji obrazu oraz czasu trwania. Image-to-video wymaga promptu i obrazu, natomiast last_image jest opcjonalny. Zweryfikowane proporcje obrazu to 16:9, 9:16 i 1:1, a dostępne czasy trwania to 5 lub 10 sekund.
Atlas Cloud podaje standardową cenę $0.112 za sekundę dla obu zweryfikowanych endpointów wideo. Rozliczenie zależy od żądanego czasu trwania wyniku, więc wygenerowanie materiału trwającego 10 sekund kosztuje dwukrotnie więcej niż materiału trwającego 5 sekund przy standardowej stawce.
Generowanie rozpoczyna się od żądania POST, które zwraca prediction ID i status przetwarzania. Wysyłaj zapytania do https://api.atlascloud.ai/api/v1/model/prediction/{prediction_id} aż do zakończenia lub niepowodzenia zadania. Pomyślna odpowiedź umieszcza URL wygenerowanego wideo w tablicy outputs.
Spójność obiektu jest udokumentowaną funkcją obu dostępnych trybów, a image-to-video wykorzystuje klatkę źródłową do zachowania tożsamości wizualnej i kompozycji. Wyniki mogą się jednak różnić w zależności od jakości danych wejściowych i złożoności promptu, dlatego zalecane są wyraźne obrazy źródłowe oraz precyzyjne instrukcje dotyczące ruchu.
Nie wśród dwóch endpointów Atlas Cloud zweryfikowanych dla tej strony rodziny. Obecny wybór obejmuje text-to-video i image-to-video, dlatego parametrów Elements, referencyjnego wideo ani edycji nie należy przesyłać, chyba że Atlas Cloud opublikuje zgodny endpoint i schemat.
Poradniki, samouczki i nowości produktowe, dzięki którym w pełni wykorzystasz Atlas Cloud.