An adult claps three times in a silent, fixed-camera clip. After each clap, only the hat changes. The performer, jacket, room, light, and timing stay in place. That is the practical promise developers are testing with the gemini omni flash 1.1 api.
Trudna część to nie wysłanie jednego żądania wideo. Chodzi o przekształcenie „zmień tylko tę jedną rzecz” we właściwy tryb wejścia, prompt z wystarczającą liczbą ograniczeń oraz budżet, który zostawia miejsce na iteracje. Poniższe trzy implementacje skupiają się na tym przekazaniu: edycja kapelusza z timingiem zdarzeń, edycja materiału pojedynczego obiektu oraz sekwencja fizyczna oparta wyłącznie na tekście.
Gemini Omni 1.1 Flash to produkcyjna aktualizacja Google do generowania wideo. Obsługuje wejścia tekstowe, obrazowe i przesłane wideo, a interfejs Interactions API obsługuje stan iteracyjny przez poprzednie ID interakcji. Udokumentowane opcje wyjściowe obejmują 360p, 720p, 1080p i 4K, z kadrowaniem 16:9 lub 9:16 (dokumentacja Google Gemini Omni, wrzesień 2026).
Najważniejsze wnioski
- Stabilny identyfikator modelu Google:
gemini-omni-1.1-flash.- Wybierz ścieżkę wejścia przed napisaniem promptu.
- Utrzymuj segment źródłowy edycji referencyjnej na poziomie 10 sekund lub krócej.
- Traktuj ważny dialog jako osobne zadanie zatwierdzania audio.
Dlaczego Gemini Omni Flash 1.1 API wzbudza zainteresowanie i dlaczego pierwsze próby kończą się niepowodzeniem
Omni 1.1 przyciąga uwagę, ponieważ łączy generowanie z edycją i kontrolą kontynuacji. Google twierdzi, że aktualizacja może wydłużać sceny o 10-sekundowe przyrosty do 40 sekund, interpolować między pierwszą a ostatnią klatką, tworzyć podglądy 360p i skalować do 4K (ogłoszenie Google Omni 1.1, sierpień 2026). Te funkcje mają znaczenie dla zespołu produktowego budującego edytor, kreatywne SaaS lub narzędzie marketingowe do krótkich treści.
Pierwsza próba często kończy się niepowodzeniem z prostszych powodów:
- Ścieżka text-to-video ma zachować istniejące wykonanie.
- Edycja prosi o nowy obiekt bez wyraźnego odniesienia lub konkretnego opisu wizualnego.
- Jeden prompt zmienia jednocześnie aktora, kamerę, ubranie, otoczenie i obiekt.
- Długi źródłowy klip ukrywa dokładny moment, który ma wyzwolić edycję.
Zacznij od ustalenia, co musi pozostać niezmienne. W przypadku kapelusza niezmienne są wykonawca, kamera, pomieszczenie, kurtka, cienie i timing klaśnięć. Kapelusz jest jedyną zmienną. Przypadek rzeźby z bąbelków wykorzystuje ten sam pomysł, ale blokuje twórcę i światło okienne, zmieniając materiał jednego obiektu.
Ciągłość wizualna i ciągłość audio wymagają różnych kryteriów akceptacji. Użytkownik Reddita opisał wynik, który po edycjach przepisał mowę i kontekst klipu z mówiącą głową (raport społeczności, lipiec 2026). Ten raport jest anegdotyczny, ale stanowi użyteczną regułę produkcyjną: jeśli dialog, muzyka lub zgoda prawna zależą od oryginalnej ścieżki, zachowaj i zmasteruj oryginalne audio osobno. Nie zatwierdzaj generatywnej edycji wizualnej tylko dlatego, że obraz wygląda dobrze.
Przepływ pracy Gemini Omni Flash 1.1 API: wybierz właściwe wejście, model i koszt
Wybierz wejście, które już zawiera potrzebne informacje. Text-to-video służy do nowej sceny. Image-to-video służy do artystycznie zaaranżowanego wyglądu początkowego. Reference-to-video służy do źródłowego wykonania wymagającego ściśle ograniczonej zmiany. W Atlas Cloud zespoły mogą otworzyć odpowiednią ścieżkę modelu Developer w jednej karcie przeglądarki, porównać tryby wejścia i zachować wspólny przepływ pracy prototypowania dzięki Atlas Cloud.
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| Ścieżka | Przynieś do pierwszej próby | Najlepsze zastosowanie | Częsty błąd pierwszej próby | Przypadek w artykule | Publiczna stawka początkowa* |
| Text-to-Video Developer | Prompt tekstowy | Nowa, ciągła scena | Próba odtworzenia konkretnego źródłowego wykonania | Rube Goldberg | $0.112/sec |
| Image-to-Video Developer | 1–7 obrazów referencyjnych | Animowanie określonego wyglądu lub obiektu | Dostarczanie niespójnych obrazów referencyjnych | Opcjonalna wariacja | $0.112/sec |
| Reference-to-Video Developer | 1 źródłowy film plus do 5 obrazów | Zachowanie akcji przy edycji ograniczonego szczegółu | Przekazanie przycięcia dłuższego niż 10 sekund | Kapelusze i bąbelki | $0.120/sec |
Publiczne stawki początkowe sprawdzono na liście Models All 1 września 2026 r. Rozdzielczość, czas trwania i szczegóły zakupu mogą się zmieniać, dlatego przed budżetem wydawniczym potwierdź odpowiednią stronę modelu. Szacunek dla 8 sekund to stawka × 8, a nie uniwersalna obietnica ceny.
Dla wariantów sterowanych obrazem ścieżka Image-to-Video Developer przyjmuje 1–7 obrazów referencyjnych. Schemat reference-to-video przyjmuje jeden źródłowy klip plus do pięciu obrazów; przycięty segment źródłowy nie może przekraczać 10 sekund. Używaj stałego ziarna (seed) dopiero po znalezieniu wariantu, który warto iterować.
Wygodne wyjście SDK Google to output_video. Surowa odpowiedź REST umieszcza natomiast treść wideo w tablicy steps. To rozróżnienie pozwala uniknąć częstego błędu integracyjnego.
plaintext1import { GoogleGenAI } from '@google/genai'; 2import fs from 'node:fs'; 3 4const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY }); 5const interaction = await ai.interactions.create({ 6 model: 'gemini-omni-1.1-flash', 7 input: 'A polished steel marble triggers a tabletop chain reaction.', 8 response_format: { type: 'video', aspect_ratio: '16:9', resolution: '4k' } 9}); 10 11fs.writeFileSync('result.mp4', Buffer.from(interaction.output_video.data, 'base64'));
plaintext1{ 2 "model": "gemini-omni-1.1-flash", 3 "input": "A polished steel marble triggers a tabletop chain reaction.", 4 "response_format": { "type": "video", "aspect_ratio": "16:9", "resolution": "4k" } 5}
Krok 1: edycja wideo Gemini Omni Flash 1.1 API — zmiana kapeluszy w rytm klaśnięć
Użyj cichego, 10-sekundowego źródłowego klipu z czystymi prawami, z jedną dorosłą osobą wykonawcy, nieruchomą kamerą 16:9 i trzema wyraźnymi klaśnięciami. Prześlij źródłowy klip, jego pierwszą klatkę i trzy wyraźne referencje kapeluszy. Dla tej ścieżki użyj playgroundu Reference-to-Video Developer.
plaintext1Use the uploaded original video as the timing, camera, and performance reference. Preserve the same adult performer, face, body movement, tan jacket, room, framing, shadows, and pacing. At the instant immediately after each completed clap, change only the hat: after clap one, a forest-green knit beanie; after clap two, a cream wide-brim felt hat; after clap three, a red baseball cap. Keep each hat naturally fitted and stable between claps. No cuts, no added people, no text, no captions, no logos, and no changes to the jacket or room. Preserve the silent source audio; do not generate speech or music.
Wybierz przycięcie źródła 0-10s, 16:9, 4K i stałe ziarno (seed) wyłącznie w celu późniejszej kontrolowanej ponownej próby. Zmieniaj jedną zmienną na raz. Jeśli kapelusz dryfuje, uprość zmianę, zanim dodasz mocniejszą referencję.
Nieruchomy kadr z przypadku 1. Wybrana wyraźna klatka pokazuje końcową czerwoną czapkę po trzecim klaśnięciu, podczas gdy wykonawca, pomieszczenie i kamera pozostają stabilne.
Test ruchu z przypadku 1. W 10-sekundowym klipie trzy osobne klaśnięcia wyzwalają stany: czapkę beanie, kapelusz z szerokim rondem i czerwoną czapkę, w jednym ciągłym ujęciu studyjnym.
Krok 2: edycja wideo Gemini Omni Flash 1.1 API — transformacja jednego obiektu
Użyj wyraźnego, cichego źródła 10-sekundowego: dorosła osoba obraca małą geometryczną ceramiczną rzeźbę przy oknie. Prześlij źródłowy film i jego pierwszą klatkę. Wejście pozostaje proste, aby transformacja materiału miała jedno zadanie.
plaintext1Use the uploaded video as the exact performance, camera, and lighting reference. Preserve the adult creator, hands, clothing, studio, window light, camera position, and the slow turn of the object. At 2.0 seconds, transform only the small geometric ceramic sculpture into a connected cluster of translucent soap bubbles with realistic reflections and soft iridescent color. The creator continues the same hand motion. Keep the bubbles attached in the same position and scale as the original sculpture. One continuous shot, no cuts, no new objects, no new people, no text, no logos, and no generated speech or music.
Wybierz przycięcie źródła 0-10s, 16:9, 4K i ten sam przepływ pracy ze stałym ziarnem co w kroku 1. Sprawdź krawędź obiektu w przejściu w drugiej sekundzie oraz w ostatniej sekundzie. Te momenty pokazują, czy model zmienił więcej niż tylko wskazany obiekt.
Nieruchomy kadr z przypadku 2. Klaster bąbelków jest w pełni uformowany, a obracające dłonie artysty, stół roboczy i światło okienne pozostają czytelne.
Test ruchu z przypadku 2. Geometryczna rzeźba zmienia się w półprzezroczysty klaster bąbelków w żądanym momencie, a kamera przesuwa się w bok przez nasłonecznione studio.
Krok 3: Gemini Omni Flash 1.1 API Text-to-Video — test ciągłej sekwencji fizycznej
W przypadku nowej sceny zacznij od samego tekstu. To izoluje timing modelu, relacje między obiektami i instrukcje dotyczące kamery. Użyj modelu Text-to-Video Developer do uruchomienia 8-sekundowego, 16:9, 4K. Ustal ziarno (seed) dopiero po otrzymaniu wyniku, do którego warto wrócić.
plaintext1One continuous 8-second studio shot of a hand-built tabletop Rube Goldberg machine. A polished steel marble rolls from left to right through a wooden track, tips a row of dominoes, releases a small brass lever, rings a bell, and opens a paper flower. Every collision follows believable gravity, weight, momentum, and contact. The camera begins in a close tracking shot with the marble, then smoothly slides sideways to reveal the full chain reaction. Warm morning window light, crisp wood and metal textures, practical workshop setting. No jump cuts, no visible hands, no logos, no captions, no text.
Sprawdź faktyczny łańcuch, a nie pojedynczą atrakcyjną klatkę. Jeśli kulka nie trafia w kontakt, skróć sekwencję lub usuń jedną zależność. Niezawodny łańcuch 5 zdarzeń jest mocniejszym demo produktu niż zatłoczona sekwencja, której mechaniki nie da się odczytać.
Nieruchomy kadr z przypadku 3. Wybrana klatka końcowa pokazuje otwarty papierowy kwiat i ukończony łańcuch na stole.
Test ruchu z przypadku 3. Kulka uruchamia domino, potem dźwignię i dzwonek, zanim w ostatnich sekundach otwiera się kwiat. Kamera przesuwa się w bok, aby ukazać każdy etap, zamiast zwykłego najazdu.
Warianty Gemini Omni Flash 1.1 API: rozszerzaj, interpoluj i iteruj bezpiecznie
Używaj rozszerzania i interpolacji do rozwiązania konkretnego problemu ciągłości, a nie do uniknięcia wyraźnego pierwszego przejścia. Google opisuje 10-sekundowe rozszerzenia do łącznej długości 40 sekund oraz kontrolę klatki początkowej i końcowej w Omni 1.1. Podaje również, że wstępne wersje 360p mogą być nawet o 60% szybsze i kosztować jedną trzecią standardowego poziomu 720p w jego własnym porównaniu przepustowości. To warunki testowe Google, a nie gwarancja szybkości na całej platformie.
Przyjmij sekwencję dwuprzebiegową:
- Zweryfikuj logikę ruchu w niskiej rozdzielczości roboczej, jeśli ta kontrola jest faktycznie dostępna.
- Zmieniaj jedną zmienną na ponowną próbę: kapelusz, materiał bąbelków lub jedną frazę dotyczącą kamery.
- Generuj finalny asset w docelowej rozdzielczości dopiero po tym, jak akcja wygląda poprawnie.
Najpierw zapisz ograniczenia zachowania: zachowaj tego samego wykonawcę, kamerę, pomieszczenie i timing. Następnie nazwij jedną transformację. W przypadku ciągłego ujęcia napisz jedno ciągłe ujęcie, bez cięć. W przypadku przejścia od początku do końca podaj celowo dobraną pierwszą i ostatnią klatkę, zamiast prosić model, aby wywnioskował oba punkty końcowe z luźnego zdania.
Gemini Omni Flash 1.1 API: koszty, prawa i produkcyjne zabezpieczenia
Planuj budżet pracy jako ciąg decyzji, a nie nieograniczony przycisk „generuj ponownie”. Przy publicznych stawkach początkowych pokazanych powyżej jedno 8-sekundowe uruchomienie tekstowe kosztuje około $0.896, a jedna 8-sekundowa edycja referencyjna około $0.960. Budżet na trzy próby wynosi zatem około $2.688 w przypadku Rube Goldberga i $2.880 w przypadku każdej z edycji referencyjnych, zanim zacznie obowiązywać stawka za wyższą rozdzielczość lub inny SKU produktu.
W wewnętrznym planowaniu trzymaj osobno rozliczenia API, ceny zakupu na stronie produktu oraz limity społecznościowe lub konta. Przed zakupem lub uruchomieniem sprawdź aktualną cenę wybranej ścieżki dla danej rozdzielczości i czasu trwania. Ten artykuł celowo nie zamienia listy stawek początkowych na stałą wycenę 4K.
Używaj wyłącznie filmów i obrazów referencyjnych, do których masz prawo przesłania. Uzyskaj zgodę od rozpoznawalnych osób, zachowuj zapisy promptów i źródeł oraz oznaczaj wygenerowany materiał w miejscach, gdzie odbiorcy mogliby pomylić go z materiałem dokumentalnym. Sprawdź dialog, muzykę, znaki towarowe i wizerunki w osobnym przejściu zatwierdzania. Te zabezpieczenia są równie ważne jak klauzula preserve w prompcie Gemini Omni Flash 1.1 API.
Gemini Omni Flash 1.1 API — najczęściej zadawane pytania
Jaki jest stabilny identyfikator modelu Gemini Omni Flash 1.1 API?
Obecny stabilny identyfikator modelu Google to gemini-omni-1.1-flash. Podczas wdrażania korzystaj z aktualnej dokumentacji modelu, ponieważ aliasy modeli i dostępność podglądu mogą się zmieniać.
Czy gemini-omni-flash-preview jest wycofywany?
Traktuj nazwę preview jako osobną ścieżkę wydawniczą. Potwierdź aktualne powiadomienie o wycofaniu w dokumentacji modelu Google, zanim przypniesz ją w produkcji, a następnie używaj stabilnego identyfikatora, jeśli odpowiada wymaganym możliwościom.
Czy Gemini Omni Flash 1.1 może edytować istniejące wideo?
Tak. Udokumentowany przepływ pracy przesyła wideo przez interfejs Files API i dostarcza instrukcję edycji. Trzymaj segment źródłowy krótko i podaj każdy element, który ma pozostać niezmieniony.
Jak długie może być wideo w Gemini Omni Flash 1.1 API?
Standardowe przykłady generowania obejmują krótkie klipy, podczas gdy Omni 1.1 może rozszerzać wideo o 10-sekundowe przyrosty do łącznej długości 40 sekund. W obecnie udokumentowanej ścieżce Developer w Atlas źródłowe przycięcie reference-to-video musi wynosić 10 sekund lub mniej.
Czy może zachować dialog i oryginalną ścieżkę audio?
Stosuj instrukcje zachowania wizualnego, a następnie weryfikuj audio niezależnie. W przypadku klipu, w którym dokładny dialog lub muzyka mają znaczenie, przenieś zatwierdzony oryginalny utwór przez postprodukcję, zamiast traktować generatywny wynik jako automatyczny master audio.
Ile kosztuje Gemini Omni Flash 1.1 API?
Koszt zależy od ścieżki, czasu trwania, rozdzielczości i powierzchni rozliczeniowej. W przypadku przepływu pracy Gemini Omni Flash 1.1 API pomnóż sekundy przez aktualnie wyświetlaną stawkę ścieżki, a następnie zarezerwuj co najmniej 3 próby dla każdego ujęcia krytycznego dla ruchu.






