


FLUX 3 API wprowadza najnowszy model bazowy Black Forest Labs do Twojego stosu: pojedynczą architekturę Self-Flow trenowaną wspólnie na obrazach, wideo i audio. Generuj klipy o długości do 20 sekund z wielojęzycznymi dialogami, efektami dźwiękowymi i tłem dźwiękowym w jednym przebiegu albo renderuj treści text-to-image z precyzyjną typografią. Atlas Cloud udostępnia go za pomocą jednego klucza zgodnego z OpenAI, z rozliczaniem pay-as-you-go za każde wywołanie i dostępem Day-0.
Atlas Cloud zapewnia najnowsze, wiodące w branży modele kreatywne.
W ramach jednego interfejsu FLUX 3 API dostępnych jest pięć endpointów wideo, a poniższa tabela pokazuje, co każdy z nich przyjmuje, co zwraca i ile kosztuje za sekundę.
| Modalność | Opis |
|---|---|
| FLUX 3 T2V API (tekst na wideo) | Prompty tekstowe zamieniają się w klipy trwające od 5 do 20 sekund z dźwiękiem wygenerowanym w tym samym przebiegu, ponieważ generate_audio jest domyślnie włączone. Wynik ma 720p lub 1080p w jednym z siedmiu stałych współczynników proporcji od 21:9 do 9:16 oraz opcję auto, a wartość seed pozwala odtworzyć dowolny rezultat. Cena wynosi $0.17 za sekundę wygenerowanego wideo. |
| FLUX 3 I2V API (obraz na wideo) | Przekaż pojedynczy obraz PNG, JPEG lub WebP, a model zanimuje go do przodu od tej klatki, dobierając ruch i tempo na podstawie promptu. Czas trwania można wybrać w dowolnym zakresie od 5 do 20 sekund, co sprawdza się w ujęciach produktowych, intro postaci i krótkich wersjach do mediów społecznościowych tworzonych na bazie materiałów graficznych, które już posiadasz. Rozliczenie wynosi $0.17 za sekundę wygenerowanego wideo. |
| FLUX 3 Keyframes API (klatki kluczowe na wideo) | Gdy ujęcie musi trafić w konkretne momenty, można przypiąć do 10 obrazów klatek kluczowych do dokładnych pozycji klatek na osi czasu 24 fps. Każdy frame_index musi mieścić się w wartości duration pomnożonej przez 24, co daje zespołom od storyboardów i previz bezpośrednią kontrolę nad tym, co pojawia się na ekranie i kiedy. Stawka jest taka sama jak w pozostałych endpointach generowania: $0.17 za sekundę wygenerowanego wideo. |
| FLUX 3 FLF API (pierwsza i ostatnia klatka na wideo) | Potrzebujesz klipu kończącego się dokładnie na wskazanym obrazie? Przekazanie start_image_url i end_image_url blokuje oba końce ujęcia, a model wypełnia ruch pomiędzy nimi. Ujawnianie logo, sekwencje transformacji i przejścia między scenami, które muszą pasować do sąsiedniego materiału, dobrze pasują do tego endpointu, w cenie $0.17 za sekundę wygenerowanego wideo. |
| FLUX 3 Extend API (rozszerzanie wideo) | Ten endpoint kontynuuje historię z istniejącego materiału: MP4 poniżej 50 MB i krótszy niż 15 sekund jest przedłużany od ostatnich klatek zgodnie z promptem. Dźwięk nadal generuje się równolegle z obrazem, a te same parametry wyjściowe 720p lub 1080p oraz zakres od 5 do 20 sekund pozostają w mocy. Rozszerzanie kosztuje $0.41 za sekundę wygenerowanego wideo. |
Zbudowane przez Black Forest Labs na jednym multimodalnym backbone, FLUX 3 API zwraca do dwudziestu sekund wideo HD lub Full HD z dialogami, efektami dźwiękowymi i ambientem generowanymi w tym samym przebiegu, a po drodze przyjmuje wskazówki dotyczące ujęć, keyframes, języków i tekstu na ekranie.
Jedno wywołanie zwraca od 5 do 20 sekund wideo z audio generowanym w tym samym przebiegu, nigdy niepodkładanym później. Dialogi, efekty dźwiękowe i tła ambientowe trafiają dokładnie w klatkę, w której dzieje się zdarzenie, a wynik jest dostarczany w 720p HD lub 1080p Full HD. To właśnie to wyczucie czasu sprawia, że płomień w woku albo trzask drzwi wyglądają jak sfilmowane, a nie zmontowane.
Poproś o cięcie, a model je dostarczy. Sceny i kąty kamery zmieniają się w ramach jednej generacji, a ten sam bohater, garderoba i logika oświetlenia przechodzą przez każde ujęcie. Dłuższe materiały powstają dzięki agentic clip chaining, które łączy osobne generacje w sekwencje trwające minutami. Storyboardy, które kiedyś wymagały czterech renderów i pracy montażysty, wracają teraz jako jeden spójny materiał.
Sam tekst, pojedynczy kadr, para pierwszej i ostatniej klatki, keyframes rozmieszczone na osi czasu albo istniejący klip do kontynuacji: wszystkie pięć punktów wejścia jest obsługiwanych. Keyframes przypinają to, co się dzieje, i kiedy, a continuation podejmuje materiał, który już masz. Studia dysponujące materiałami marki w postaci stills lub niedokończonych montaży mogą zacząć od tych zasobów zamiast opisywać każde ujęcie od zera.
Dialog natywny obejmuje dialekty angielskiego, chiński, hiszpański, francuski, niemiecki, japoński, portugalski, rosyjski, włoski, indonezyjski, turecki, hindi, pendżabski i inne, a ruch warg jest dopasowany do języka, o który poprosisz. Typografia renderuje się także jako część sceny, więc oznakowanie i tytuły pozostają w kadrze zamiast być później kompozytowane. Jeden prompt może więc dostarczyć zlokalizowany spot z gotowymi napisami.
Atlas Cloud udostępnia FLUX 3 przez ten sam ujednolicony endpoint, który obsługuje resztę katalogu, więc jednym kluczem sięgasz po modele wideo, obrazów i językowe bez dodatkowej integracji. Rozliczenie pozostaje pay as you go, bez subskrypcji i opłat za stanowiska, a płacisz tylko za generacje, które faktycznie uruchomisz. Zmiana modelu sprowadza się do podmiany stringa. Zacznij budować już dziś.
Każdy wiersz poniżej uruchamia jeden identyczny prompt przez FLUX 3 API oraz dwa inne modele wideo na Atlas Cloud, dzięki czemu ciągłość ruchu, zmiany ujęć i natywny dźwięk można ocenić na podstawie tego samego briefu, a nie starannie wybranych dem.
Filmowy live action, mokra od deszczu boczna uliczka Tokio nocą. Shiba Inu w maleńkim żółtym płaszczu przeciwdeszczowym jedzie na deskorolce w dół zaułka, lawirując między kałużami i otworami wentylacyjnymi z parą. Zacznij od niskiego ujęcia śledzącego, sunącego po mokrym bruku tuż za deską, z przemykającymi odbiciami neonów. Pies zahacza o stos papierowych lampionów, które wystrzeliwują w powietrze, a gwałtowna panorama podąża za jednym wirującym lampionem, gdy ten koziołkuje w stronę stoiska z ramenem. Cięcie do ujęcia z drona, który unosi się i cofa, podczas gdy Shiba mocno przyciska łapę, obraca deskę do gwałtownego zatrzymania i raz szczeka na roześmianego kucharza ramen, który podrzuca plasterek chashu, złapany przez psa w locie. Ciepłe światło stoiska kontra zimny neon, rozpryski wody podświetlone od tyłu. Audio: syczący deszcz, poliuretanowe kółka dudniące po kamieniu, skwierczący wok, jedno ostre szczeknięcie, pociąg przejeżdżający gdzieś nad głową. Proporcje 16:9.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
Ręcznie malowany styl anime, jasne południe nad bezkresnym morzem chmur. Nastoletnia podniebna rybaczka zapiera się na pokładzie drewnianego sterowca i zarzuca długą linkę w dół, w morze chmur. Zacznij od ujęcia POV z pierwszej osoby znad relingu, gdy linka śmiga w powietrzu i znika w bieli. Wędka gwałtownie się napina, a kamera tnie do szybkiego orbitowania wokół pokładu, podczas gdy dziewczyna jest ciągnięta po deskach, lina dymi, przesuwając się przez jej rękawice, a jeden but zahacza o zwój olinowania. Stawia stopę na relingu i szarpie do tyłu dokładnie w chwili, gdy koi wielkości wieloryba przebija się przez chmury za jej plecami, a jego łuski rozrzucają tęczowe światło po żaglach. Zakończ niskim heroicznym ujęciem, gdy załoga wybucha wiwatami, a mgiełka chmur dryfuje przez kadr. Malarskie cel shading, ciepłe światło kontrowe, widoczna faktura pędzla. Audio: pędzący wiatr, skrzypiąca lina, narastające orkiestrowe crescendo, głęboki wodny huk przy wynurzeniu. Proporcje 16:9.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
Niezależnie od tego, czy zadanie polega na krótkim klipie socialowym trwającym dwadzieścia sekund z natywnym audio, storyboardzie z klatkami kluczowymi, lokalizowanej wersji reklamy czy szybkim przejściu roboczym przed finalnym renderem, FLUX 3 API obsłuży je w Atlas Cloud w modelu pay-as-you-go i z dostępem Day-0.
Generuj do dwudziestu sekund wideo z jednego promptu tekstowego, z mową, efektami i ambientem tworzonymi razem z klatkami. Zespoły socialowe dostają gotowy klip bez osobnego etapu audio.
Uporządkowane klatki kluczowe pozwalają FLUX 3 API prowadzić scenę przez zdefiniowane momenty, zmieniając kąty kamery i ustawienia w ramach jednego generowania. Artyści storyboardów mogą podejrzeć pełną sekwencję, zanim zostanie zarezerwowany jakikolwiek plan zdjęciowy.
Typografia renderuje się precyzyjnie w generowanych scenach, a obsługa tekstu wielojęzycznego działa lepiej niż w wcześniejszych generacjach FLUX. Makiety opakowań, plansze tytułowe i lokalizowane banery wychodzą z jednego wywołania gotowe do review.
Potrzebujesz tego samego spotu na sześciu rynkach? FLUX 3 API generuje zsynchronizowany wielojęzyczny dialog razem z wideo, więc każda wersja ma własną zlokalizowaną ścieżkę głosową bez etapu dubbingu.
Istniejące materiały można przenieść do nowych kontekstów, rozszerzyć o dopasowane audio albo przekształcić, zachowując ich kluczowe elementy nienaruszone. Agencje odświeżają stare materiały kampanijne zamiast zlecać kolejne zdjęcia.
Tryb draft zwraca szybki podgląd HD przy niższym koszcie, a zatwierdzone ujęcia są renderowane ponownie w HD lub FHD przez FLUX 3 API. Iteracje pozostają przystępne, gdy koncept wymaga dwudziestu prób.
Porównaj długość klipu, rozdzielczość wyjściową, natywny dźwięk i koszt za sekundę, aby sprawdzić, gdzie FLUX 3 API zyskuje przewagę, a gdzie inny model Atlas Cloud może lepiej pasować do Twojego pipeline’u.
| Model | Maks. długość klipu | Maks. rozdzielczość wyjściowa | Natywny dźwięk | Cena za sekundę |
|---|---|---|---|---|
| FLUX 3 Video (Text-to-Video) | 20 s | FHD, do 2 MP na klatkę | √ dialogi, SFX, tło dźwiękowe | $0.17 HD / $0.29 FHD |
| FLUX 3 Video (Video-to-Video) | 20 s | FHD, do 2 MP na klatkę | √ dialogi, SFX, tło dźwiękowe | $0.41 HD / $0.53 FHD |
| Seedance 2.0 Text-to-Video | 15 s | 4K (3840 x 2160) | √ domyślnie włączony | $0.112 |
| Kling V3.0 Turbo Text-to-Video | 15 s | 1080p | √ opcjonalny, domyślnie wyłączony | $0.112 |
| Wan-2.7 Text-to-video | 15 s | 1080p natywnie, 1440p-SR | √ SFX, muzyka, tło dźwiękowe | $0.10 |
| Veo3.1 Text-to-video | 8 s | 1080p | √ zsynchronizowany dźwięk | $0.20 |
Zacznij w kilka minut — wykonaj te proste kroki, aby zintegrować i wdrożyć modele za pośrednictwem platformy Atlas Cloud.
Zarejestruj się na atlascloud.ai i ukończ weryfikację. Nowi użytkownicy otrzymują bezpłatne kredyty do eksploracji platformy i testowania modeli.
Połączenie zaawansowanych modeli FLUX 3 z platformą GPU-akcelerowaną Atlas Cloud zapewnia niezrównaną wydajność, skalowalność i doświadczenie deweloperskie.
Niska Latencja:
Inferencja zoptymalizowana pod GPU dla rozumowania w czasie rzeczywistym.
Zunifikowane API:
Uruchamiaj FLUX 3, GPT, Gemini i DeepSeek za pomocą jednej integracji.
Przejrzysta Wycena:
Przewidywalne rozliczenia za token z opcjami serverless.
Doświadczenie Dewelopera:
SDK, analityka, narzędzia dostrajania i szablony.
Niezawodność:
99,99% dostępności, RBAC i logowanie gotowe na zgodność.
Bezpieczeństwo i Zgodność:
SOC 2 Type II, zgodność z HIPAA, suwerenność danych w USA.
FLUX 3 to multimodalny model bazowy Black Forest Labs, trenowany wspólnie na obrazach, wideo, audio i predykcji akcji, zamiast składany z osobnych systemów. FLUX 3 API udostępnia ten model przez Atlas Cloud, dzięki czemu jedno żądanie zwraca wideo z zsynchronizowanym dźwiękiem. Jeden klucz zgodny z OpenAI obejmuje go razem ze wszystkimi pozostałymi modelami w katalogu, z rozliczeniem za użycie.
Ogólnie dostępna jest funkcja wideo, obejmująca text to video, image to video, ujęcia prowadzone klatkami kluczowymi oraz kontynuację istniejącego klipu — w każdym przypadku z opcjonalnym natywnym audio. Black Forest Labs udostępnia tę rodzinę etapami, więc FLUX 3 Image i FLUX 3 Action pojawią się po endpointach wideo, a nie równolegle z nimi.
Utwórz konto, wygeneruj klucz API i skieruj swojego obecnego klienta na endpoint FLUX 3 API. Żądania używają tego samego wzorca zgodnego z OpenAI, który obowiązuje w całym katalogu Atlas Cloud, więc nie musisz uczyć się osobnego SDK ani później odkręcać uzależnienia od dostawcy. Rozliczenie działa w modelu pay-as-you-go za generację, bez konieczności wcześniejszego wykupienia subskrypcji. Zacznij budować już dziś.
Tak, i odbywa się to w tym samym przebiegu generowania, a nie przez drugi model, dzięki czemu dialogi, efekty dźwiękowe i tło pozostają zsynchronizowane z obrazem. FLUX 3 obsługuje mowę z lip sync w ponad tuzinie języków, w tym po angielsku, chińsku, hiszpańsku, japońsku i hindi. Audio można wyłączyć dla pojedynczego żądania, gdy potrzebujesz tylko niemego materiału.
Generacje trwają od 5 do 20 sekund, z wyjściem w HD 720p oraz opcją Full HD 1080p, gdy szczegółowość jest ważniejsza niż koszt. Obsługiwane są kadry panoramiczne, kwadratowe i pionowe, więc ten sam prompt można wykorzystać zarówno do hero na landing page, jak i do feedu mobilnego. Dłuższe historie najlepiej budować z kilku kontrolowanych klipów, zamiast z jednego zbyt dużego żądania.
Przekaż obraz startowy, a model go zanimuje, albo przypnij klatki kluczowe, gdy ujęcie musi trafić w konkretne momenty w ustalonej kolejności. Można też kontynuować istniejący materiał, przenosząc ruch i kadrowanie z końcówki klipu wejściowego. Kontynuacje łącz oszczędnie, ponieważ spójność wizualna z czasem się rozjeżdża, gdy każde przedłużenie opiera się na poprzednim.
Tryb Draft zwraca tańszy podgląd HD, aby ocenić kompozycję, tempo i audio, zanim zapłacisz za finalny render. Iteruj tam prompty, a następnie uruchom zwycięski prompt ponownie w standardowym HD albo Full HD bez zmiany struktury żądania. Zespoły dostarczające wiele wariantów zyskują na tej pętli najwięcej.
Wideo jest rozliczane za sekundę wyjścia, więc krótki klip kosztuje ułamek ceny długiego, a płacisz tylko za to, co faktycznie wygenerujesz. Stawkę określa rozdzielczość: Full HD jest droższe niż standardowe HD, a tryb Draft tańszy od obu. Atlas Cloud nie dolicza subskrypcji, opłat za stanowisko ani minimalnego poziomu wydatków. Zacznij już dziś.
Jeszcze nie. FLUX 3 Video to już udostępniona część rodziny, natomiast FLUX 3 Image jest wdrażany etapami, a wariant FLUX 3 Dev z otwartymi wagami zapowiedziano na później. Atlas Cloud dodaje każdy nowy endpoint FLUX 3, gdy tylko zostaje wydany, więc ten sam klucz będzie nadal działał, gdy pojawi się generowanie obrazów.
Model wspólny usuwa etap sklejania: nie ma drugiego przebiegu do dopasowania głosu do ruchu ust ani nakładania tła dźwiękowego pod gotowy montaż. Ma to największe znaczenie w scenach dialogowych, gdzie rozjazd między ścieżkami jest od razu widoczny dla widzów. Pipeline kurczy się z kilku usług do jednego wywołania, czyli jest mniej punktów awarii do monitorowania.
Poradniki, samouczki i nowości produktowe, dzięki którym w pełni wykorzystasz Atlas Cloud.