


Gemini Omni 1.1 Flash to natywnie multimodalna rodzina modeli wideo Google DeepMind, przeznaczona do elastycznych procesów produkcyjnych. Edytuj istniejący materiał za pomocą instrukcji tekstowych, zachowuj spójność wizualną dzięki maksymalnie 10 obrazom referencyjnym i 3 klipom wideo lub wydłużaj ujęcia w łączonych segmentach do 40 sekund. Uzyskaj dostęp do wszystkich procesów w Atlas Cloud za pomocą jednego klucza API zgodnego z OpenAI, z rozliczaniem według zużycia i dostępnością od pierwszego dnia. Zacznij tworzyć już dziś.
Gemini Omni 1.1 Flash został opracowany przez Google. Atlas Cloud (prowadzona przez Atlas Cloud AI LLC) zapewnia dostęp do modelu, ale nie jest jego właścicielem. Wszystkie znaki towarowe należą do ich odpowiednich właścicieli.
Atlas Cloud zapewnia najnowsze, wiodące w branży modele kreatywne.
Porównaj pięć endpointów Gemini Omni 1.1 Flash pod kątem sposobu wprowadzania danych, możliwości wyjściowych i zastosowań produkcyjnych.
| Modalność | Opis |
|---|---|
| Gemini Omni 1.1 Flash Video Extend API | Kontynuuj istniejący klip za pomocą płynnie dopasowanego rozszerzenia o długości od 3 do 10 sekund, zachowując natywny dźwięk. Łącz wiele rozszerzeń, aby zbudować jedno spójne ujęcie wideo o łącznej długości do 40 sekund. |
| Gemini Omni 1.1 Flash Video Edit API | Chcesz zmodyfikować istniejący materiał bez przebudowy całej sceny? Użyj instrukcji tekstowych, aby dodawać, usuwać, zastępować lub zmieniać styl elementów wideo z natywnym dźwiękiem, zachowując treści, o których prompt nie wspomina. |
| Gemini Omni 1.1 Flash Reference-to-Video API | Podaj prompt tekstowy wraz z maksymalnie 10 obrazami referencyjnymi i 3 referencyjnymi klipami wideo, aby wygenerować kinowe wideo z natywnym dźwiękiem. Ten endpoint sprawdzi się w projektach wymagających spójnych postaci, produktów lub kierunku artystycznego w kolejnych generacjach. |
| Gemini Omni 1.1 Flash Image-to-Video API | Ożyw nieruchomy obraz, przekształcając go w kinowy klip z dźwiękiem zgodnie z promptem tekstowym. Opcjonalna klatka końcowa zapewnia precyzyjną kontrolę nad miejscem rozpoczęcia i zakończenia wygenerowanego ujęcia. |
| Gemini Omni 1.1 Flash Text-to-Video API | Na podstawie jednego promptu tekstowego ten endpoint generuje kinowe wideo z zsynchronizowanym natywnym dźwiękiem. Dostosuj czas trwania, proporcje obrazu i rozdzielczość wyjściową — od szybkiego szkicu w 360p po wynik w 4K. |
Gemini Omni 1.1 Flash łączy generowanie wideo, natywny dźwięk, ciągłość opartą na materiałach referencyjnych, precyzyjną kontrolę klatek, edycję za pomocą instrukcji oraz łańcuchowe rozszerzanie w jednym elastycznym przepływie pracy Atlas Cloud.
Zacznij od promptu tekstowego i wygeneruj filmowy klip ze zsynchronizowanym natywnym dźwiękiem. Gemini Omni 1.1 Flash pozwala kontrolować czas trwania, proporcje obrazu i rozdzielczość wyjściową — od wersji roboczych 360p po 4K. W jednym żądaniu opisz ruch, kierunek kamery, dialogi, muzykę i atmosferę. Ten przepływ pracy sprawdza się w zwiastunach, materiałach do mediów społecznościowych i scenach fabularnych, które wymagają jednoczesnego opracowania obrazu i dźwięku.
Kontynuuj istniejący klip, dodając płynnie dopasowany segment o długości od 3 do 10 sekund, a następnie łącz kolejne rozszerzenia, aby osiągnąć do 40 sekund. Model zachowuje kontekst wizualny i natywny dźwięk, dzięki czemu nowa akcja pozostaje częścią tego samego ujęcia. Twórz dłuższe odsłonięcia, pościgi lub historie produktowe bez rozpoczynania sekwencji od nowa, gdy narracja potrzebuje więcej przestrzeni.
Do promptu tekstowego dodaj maksymalnie 10 obrazów referencyjnych i 3 referencyjne klipy wideo, aby pokierować jednym spójnym procesem generowania z natywnym dźwiękiem. Obrazy mogą określać postać, produkt, lokalizację lub kierunek artystyczny, a materiały wideo sterują ruchem i zachowaniem ujęcia. Wybierz tę ścieżkę, gdy powtarzalna tożsamość i język wizualny mają znaczenie w materiałach kampanii, scenach odcinkowych lub treściach markowych.
Zdefiniuj obraz otwierający, a następnie opcjonalnie podaj ostatnią klatkę, aby kontrolować miejsce zakończenia ujęcia. Gemini Omni 1.1 Flash animuje statyczny obraz, tworząc filmowy klip z natywnym dźwiękiem, i interpoluje obraz w kierunku określonego punktu końcowego. Taka struktura początku i końca sprawdza się przy prezentacjach produktów, płynnych przejściach, match cutach oraz zaplanowanych ruchach kamery, które muszą zakończyć się na precyzyjnie określonej kompozycji.
Zmieniaj istniejące wideo za pomocą bezpośredniej instrukcji tekstowej, zachowując wszystko, czego prompt nie wymienia. Dodawaj, usuwaj, zastępuj lub zmieniaj styl elementów, zachowując natywny dźwięk w edytowanym materiale. Gdy udane ujęcie wymaga jedynie nowego obiektu, otoczenia lub opracowania wizualnego, ten ukierunkowany przepływ pracy zachowuje resztę wykonanej pracy i eliminuje konieczność tworzenia sceny od podstaw.
Przechodź między generowaniem tekstu na wideo, obrazu na wideo, generowaniem na podstawie materiałów referencyjnych, edycją i rozszerzaniem w Atlas Cloud, korzystając z jednego klucza API. Przejrzyste rozliczanie pay as you go oddziela eksperymentowanie od subskrypcji i minimalnych zobowiązań. Deweloperzy mogą tworzyć wersje robocze w 360p i zamawiać wyjście do 4K, gdy liczy się końcowa szczegółowość. Ta skonsolidowana ścieżka ułatwia dodanie całej rodziny modeli do produkcyjnych przepływów pracy.
Zobacz, jak Gemini Omni 1.1 Flash, Seedance 2.5 i poprzedni Gemini Omni Flash interpretują te same dwa kinowe prompty.
8–10-sekundowy fantastyczny mikrofilm rozgrywający się w poczerniałym, rzemieślniczym warsztacie dmuchania szkła: rozpocznij od ekstremalnego ujęcia makro z najazdem na jaskrawoczerwoną bryłę roztopionego szkła, szybko wirującą na końcu piszczela, której lepka powierzchnia fałduje się, żarzy i załamuje światło ognia z pieca, podczas gdy gliniany rzemieślnik nieustannie obraca piszczel; wykonaj ciasny okrąg wokół poruszającego się przedramienia rzemieślnika, gdy metalowe szczypce uderzają w rytm i zaciskają się na roztopionym szkle — bez cięcia rozżarzona masa rozciąga się, stygnie i płynnie przeobraża w przezroczystego szklanego kolibra z ognistym sercem. Wykonaj gwałtowny whip-pan do szybkiego ujęcia śledzącego, gdy koliber trzepocze krystalicznymi skrzydłami, przemyka nad otwartymi słoikami z pigmentami i wciąga w powietrze turbulentne smugi pawiego błękitu i magenty; każde uderzenie skrzydeł rozprasza cząsteczki, które zderzają się, wirują i iskrzą w jego załamanej sylwetce. Ptak gwałtownie skręca w stronę unoszącej się szklanej bańki i dziobie ją dokładnie przy ostatnim muzycznym uderzeniu; cięcie do dramatycznego ujęcia z góry, gdy bańka pęka na zewnątrz, a cienkie jak brzytwa odłamki nieustannie przeobrażają się w miękkie, półprzezroczyste płatki kwiatów spiralnie wirujące po całym warsztacie. Wyrafinowana gliniana animacja poklatkowa połączona z jasnymi, półprzezroczystymi teksturami artystycznego szkła, namacalne rękodzielnicze niedoskonałości, przekonujące odbicia, załamania światła, kaustyka, migotanie rozgrzanego powietrza, deformacja szkła i fizyka cząsteczek; pomarańczowoczerwone światło pieca jako dominujące światło główne, chłodne cyjanowe światło księżyca jako światło konturowe, przygaszona czerń i złoto na początku, eksplodujące nasyconym pawim błękitem i magentą w kulminacji. Szybki, płynny ruch kamery, silna spójność czasowa i spójność postaci, bez pauz i wypełniaczy w zwolnionym tempie. Audio: ryk pieca, brzęczenie obracającego się szkła, rytmiczne stuknięcia metalu zsynchronizowane z każdym zaciśnięciem szczypiec i uderzeniem skrzydeł, świst proszku, ostry krystaliczny dźwięk w chwili uderzenia oraz jasny, kaskadowy finał przejścia szkła w płatki; bez ekranów, interfejsów, pulpitów, pasków postępu, wykresów, napisów, logo ani tekstu. Proporcje obrazu 16:9.
Generated with Gemini Omni 1.1 Flash Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud
8–10-sekundowa ultrafotorealistyczna sekwencja makro w stylu filmu przyrodniczego, rozgrywająca się w skalistej grocie z basenami pływowymi podczas odpływu: jaskrawopomarańczowa ośmiornica kokosowa improwizuje rytmiczną perkusję, a wszystkie osiem anatomicznie spójnych ramion porusza się niezależnie, lecz naturalnie, gdy ich przyssawki uderzają w perłowe muszle, puste pancerzyki jeżowców i gładkie kawałki szkła morskiego w coraz gęstszym rytmie, z precyzyjnym odwzorowaniem deformacji, kontaktu, odbicia i ciężaru przedmiotów. Rozpocznij od makro ujęcia lateralnego na wysokości linii wody, płynnie przesuwającego się obok ośmiornicy, gdy krople lśnią na jej teksturowanej skórze, a każde uderzenie wysyła drobne zmarszczki przez zimną cyjanową wodę morską; cięcie do ekstremalnego ujęcia z bardzo niskiej perspektywy, szybko wijącego się między poruszającymi się ramionami i instrumentami, z zachowaniem wyraźnej ciągłości kończyn i realistycznego przesłaniania. Nagle wbiega krab pustelnik, chwyta główną muszlę i ucieka; whip-pan do szybkiego, pełnego energii pościgu, gdy ośmiornica przeskakuje nad śliską, nierówną skałą i płynnie się po niej porusza, a jej ramiona chwytają, puszczają i odpychają się z przekonującym tarciem, podczas gdy nogi kraba stukoczą o kamyki. Tuż przed tym, jak nadciągająca fala zaleje grotę, ośmiornica odzyskuje muszlę, mocno ją ustawia i wykonuje jedno zdecydowane końcowe uderzenie; szybko wznieś kamerę do ujęcia z góry, gdy fala rozbryzguje się wokół ośmiornicy, a promieniście rozchodząca się piana tworzy niemal idealnie okrągłą kompozycję. Tańcząca podwodna kaustyka załamanych promieni słońca, chłodna turkusowa woda kontrastująca z koralowopomarańczowym obiektem, krystaliczna bryzga, pęcherzyki, zawieszony piasek, odbicia na mokrych skałach, mała głębia ostrości w ujęciach makro, kinowe HDR, niezwykle ostre naturalne tekstury, płynny ciągły ruch, szybkie przejścia kamery bez zwolnionego tempa. Wyłącznie dźwięk diegetyczny, idealnie zsynchronizowany: wyraźne stuknięcia muszli, głuche uderzenia w pancerzyki jeżowców, jasne kliknięcia szkła, odrywanie przyssawek, chrobotanie szczypiec i nóg kraba pustelnika, narastający szum fal, a następnie końcowe uderzenie i huk fali w idealnym rytmicznym zgraniu; bez muzyki, narracji, tekstu, napisów, logo, interfejsu, pulpitu, wykresów, pasków postępu, podzielonego ekranu, dodatkowych kończyn, zrośniętych ani zduplikowanych ramion, zniekształconej anatomii, unoszących się przedmiotów, przenikania ani zerwanej fizyki kontaktu, gumowatego ruchu, migotania czasowego, skokowych cięć, niespójnego położenia muszli ani kreskówkowej stylistyki. Ultrafotorealistyczny, kinowy dokument przyrodniczy makro, proporcje obrazu 16:9.
Generated with Gemini Omni 1.1 Flash Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud
Gemini Omni 1.1 Flash przekształca briefy, kadry, materiały referencyjne i istniejące klipy w filmy kampanijne, spójne historie z bohaterami, kontrolowane przejścia, rozszerzone sceny oraz gotowe do publikacji materiały do mediów społecznościowych z natywnym dźwiękiem.
Istniejące klipy zyskują płynnie dopasowaną kontynuację trwającą od 3 do 10 sekund, a łańcuchowe rozszerzenia mogą osiągnąć 40 sekund. Twórcy filmowi i zespoły tworzące treści serializowane mogą rozwijać spójne ujęcia bez przebudowywania każdej sceny.
Potrzebujesz nowego produktu, tła lub stylu wizualnego? Zastosuj edycję opisaną tekstem, zachowując elementy, o których nie wspomniano, i twórz precyzyjne warianty bez każdorazowego odtwarzania klipu źródłowego od podstaw.
Dzięki maksymalnie 10 obrazom referencyjnym i 3 klipom wideo model może zachować spójność bohatera, produktu lub kierunku artystycznego w kolejnych generacjach. Studia brandowe zyskują powiązane sceny premierowe o bardziej spójnej tożsamości wizualnej.
Rozpocznij od jednego kadru i opcjonalnie dodaj klatkę końcową, aby model mógł animować filmową ścieżkę między obiema kompozycjami. Projektanci zyskują precyzyjną kontrolę nad początkiem i końcem ujęcia na potrzeby odsłonięć, pętli i zmian sceny.
Pojedynczy brief tekstowy staje się filmowym klipem ze zsynchronizowanym natywnym dźwiękiem, a czas trwania, proporcje obrazu i rozdzielczość wyjściowa pozostają konfigurowalne. Twórcy mogą dopasowywać reklamy i historie do mediów społecznościowych do różnych formatów publikacji.
Podczas testowania ujęcia przygotuj prototyp w 360p, porównaj obiecujące kierunki i zwiększ rozdzielczość wybranych koncepcji aż do 4K. Reżyserzy i deweloperzy kreatywni mogą zweryfikować ruch, kadrowanie, dźwięk i tempo przed rozpoczęciem finalnej produkcji.
Porównaj Gemini Omni 1.1 Flash z czołowymi modelami generowania wideo na podstawie długości klipu, maksymalnej rozdzielczości, natywnej obsługi dźwięku i liczby klatek na sekundę.
| Model | Długość wyjściowego wideo | Maksymalna rozdzielczość | Natywny dźwięk | Liczba klatek na sekundę |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash Text-to-Video | 3–10 sekund | 4K | √ | 24 FPS |
| MiniMax H3 Text-to-Video | 4–15 sekund | 2K | √ | 24 FPS |
| Wan-3.0 Text-to-video | 2–30 sekund | 1080P | √ | 30 FPS |
Zacznij w kilka minut — wykonaj te proste kroki, aby zintegrować i wdrożyć modele za pośrednictwem platformy Atlas Cloud.
Zarejestruj się na atlascloud.ai i ukończ weryfikację. Nowi użytkownicy otrzymują bezpłatne kredyty do eksploracji platformy i testowania modeli.
Połączenie zaawansowanych modeli Gemini Omni 1.1 Flash z platformą GPU-akcelerowaną Atlas Cloud zapewnia niezrównaną wydajność, skalowalność i doświadczenie deweloperskie.
Niska Latencja:
Inferencja zoptymalizowana pod GPU dla rozumowania w czasie rzeczywistym.
Zunifikowane API:
Uruchamiaj Gemini Omni 1.1 Flash, GPT, Gemini i DeepSeek za pomocą jednej integracji.
Przejrzysta Wycena:
Przewidywalne rozliczenia za token z opcjami serverless.
Doświadczenie Dewelopera:
SDK, analityka, narzędzia dostrajania i szablony.
Niezawodność:
99,99% dostępności, RBAC i logowanie gotowe na zgodność.
Bezpieczeństwo i Zgodność:
SOC 2 Type II, zgodność z HIPAA, suwerenność danych w USA.
Gemini Omni 1.1 Flash to natywnie multimodalny model Google DeepMind do generowania i edycji wideo. W Atlas Cloud obsługuje pięć przepływów pracy dotyczących generowania, tworzenia z użyciem materiałów referencyjnych, edycji i rozszerzania. Wyniki wideo mogą zawierać zsynchronizowany natywny dźwięk.
Może generować wideo na podstawie tekstu, animować nieruchomy obraz, korzystać z wizualnych materiałów referencyjnych, edytować istniejący klip na podstawie instrukcji tekstowej lub kontynuować scenę. Image to Video może także interpolować obraz w kierunku podanej klatki końcowej, umożliwiając kontrolowane przejścia między ujęciami.
Utwórz klucz API Atlas Cloud i wybierz endpoint odpowiadający Twojemu przepływowi pracy. Wyślij prompt wraz z wymaganym obrazem źródłowym, wideo lub materiałami referencyjnymi, zgodnie ze schematem parametrów danego endpointu. Zacznij od jednego jasno opisanego ujęcia, a następnie dopracuj dane wejściowe po przejrzeniu wyniku.
Wybierz Text to Video do generowania na podstawie promptu, a Image to Video do animowania nieruchomej klatki. Reference to Video pomaga sterować tożsamością lub kierunkiem artystycznym, natomiast Video Edit zmienia istniejący materiał, a Video Extend kontynuuje rozpoczęte ujęcie.
Text to Video udostępnia ustawienia czasu trwania, proporcji obrazu i rozdzielczości wyjściowej od 360p do 4K. Image to Video przyjmuje obraz początkowy i może korzystać z opcjonalnej klatki końcowej. Reference to Video obsługuje maksymalnie 10 obrazów referencyjnych i 3 referencyjne klipy wideo.
Tak, wszystkie pięć przepływów pracy Atlas Cloud zaprojektowano tak, aby tworzyły wideo ze zsynchronizowanym natywnym dźwiękiem. Gdy dźwięk ma znaczenie dla sceny, jasno opisz w prompcie zamierzony dialog, atmosferę, muzykę lub efekty dźwiękowe.
Atlas Cloud zapewnia dostęp rozliczany zgodnie z użyciem. Standardowa cena bazowa wynosi $0.041 dla Text to Video, Reference to Video, Video Edit i Video Extend, natomiast dla Image to Video standardowa cena bazowa wynosi $0.043. Są to standardowe ceny backendu, a nie tymczasowe stawki promocyjne.
Każde rozszerzenie może dodać od 3 do 10 sekund, a rozszerzenia można łączyć, aż jedno spójne ujęcie osiągnie łącznie 40 sekund. Model wykorzystuje istniejący klip jako kontekst, kontynuując zarówno obraz, jak i natywny dźwięk.
Użyj Reference to Video z wyraźnymi, zgodnymi materiałami referencyjnymi, w tym maksymalnie 10 obrazami i 3 klipami wideo. W przypadku animowania obrazu dostarcz mocną klatkę początkową oraz opcjonalną klatkę końcową, jeśli potrzebujesz kontrolowanego celu. Wynik generatywny nadal może ulegać zmianom, dlatego po każdym wygenerowaniu lub rozszerzeniu sprawdzaj tożsamość, oświetlenie, ruch i dźwięk.
Google opisuje 1080p i 4K jako opcje wyjściowe z powiększaniem, a nie natywne rozdzielczości generowania. Używaj 360p podczas iteracji roboczych, a wyższą rozdzielczość wybierz dopiero wtedy, gdy kompozycja i ruch spełnią Twoje wymagania.
Poradniki, samouczki i nowości produktowe, dzięki którym w pełni wykorzystasz Atlas Cloud.