MiniMax H3 Developer już dostępny — 60% zniżki, od 0,02 $ za sekundę

Gemini Omni Flash 1.1 API: 3 warianty wideo do przetestowania przed pierwszym uruchomieniem produkcyjnym

Ten artykuł wyjaśnia 3 buildy wideo do przetestowania przed pierwszym uruchomieniem produkcyjnym dla API Gemini Omni Flash 1.1. Meta Title: Gemini Omni Flash 1.1 API: 3 buildy wideo do przetestowania przed pierwszym uruchomieniem produkcyjnym Meta Description: Buduj, edytuj i rozszerzaj wideo za pomocą API Gemini Omni Flash 1.1.

An adult claps three times in a silent, fixed-camera clip. After each clap, only the hat changes. The performer, jacket, room, light, and timing stay in place. That is the practical promise developers are testing with the gemini omni flash 1.1 api.

Trudna część to nie wysłanie jednego żądania wideo. Chodzi o przekształcenie „zmień tylko tę jedną rzecz” we właściwy tryb wejścia, prompt z wystarczającą liczbą ograniczeń oraz budżet, który zostawia miejsce na iteracje. Poniższe trzy implementacje skupiają się na tym przekazaniu: edycja kapelusza z timingiem zdarzeń, edycja materiału pojedynczego obiektu oraz sekwencja fizyczna oparta wyłącznie na tekście.

Gemini Omni 1.1 Flash to produkcyjna aktualizacja Google do generowania wideo. Obsługuje wejścia tekstowe, obrazowe i przesłane wideo, a interfejs Interactions API obsługuje stan iteracyjny przez poprzednie ID interakcji. Udokumentowane opcje wyjściowe obejmują 360p, 720p, 1080p i 4K, z kadrowaniem 16:9 lub 9:16 (dokumentacja Google Gemini Omni, wrzesień 2026).

Najważniejsze wnioski

  • Stabilny identyfikator modelu Google: gemini-omni-1.1-flash.
  • Wybierz ścieżkę wejścia przed napisaniem promptu.
  • Utrzymuj segment źródłowy edycji referencyjnej na poziomie 10 sekund lub krócej.
  • Traktuj ważny dialog jako osobne zadanie zatwierdzania audio.

Dlaczego Gemini Omni Flash 1.1 API wzbudza zainteresowanie i dlaczego pierwsze próby kończą się niepowodzeniem

Omni 1.1 przyciąga uwagę, ponieważ łączy generowanie z edycją i kontrolą kontynuacji. Google twierdzi, że aktualizacja może wydłużać sceny o 10-sekundowe przyrosty do 40 sekund, interpolować między pierwszą a ostatnią klatką, tworzyć podglądy 360p i skalować do 4K (ogłoszenie Google Omni 1.1, sierpień 2026). Te funkcje mają znaczenie dla zespołu produktowego budującego edytor, kreatywne SaaS lub narzędzie marketingowe do krótkich treści.

Pierwsza próba często kończy się niepowodzeniem z prostszych powodów:

  • Ścieżka text-to-video ma zachować istniejące wykonanie.
  • Edycja prosi o nowy obiekt bez wyraźnego odniesienia lub konkretnego opisu wizualnego.
  • Jeden prompt zmienia jednocześnie aktora, kamerę, ubranie, otoczenie i obiekt.
  • Długi źródłowy klip ukrywa dokładny moment, który ma wyzwolić edycję.

Zacznij od ustalenia, co musi pozostać niezmienne. W przypadku kapelusza niezmienne są wykonawca, kamera, pomieszczenie, kurtka, cienie i timing klaśnięć. Kapelusz jest jedyną zmienną. Przypadek rzeźby z bąbelków wykorzystuje ten sam pomysł, ale blokuje twórcę i światło okienne, zmieniając materiał jednego obiektu.

Ciągłość wizualna i ciągłość audio wymagają różnych kryteriów akceptacji. Użytkownik Reddita opisał wynik, który po edycjach przepisał mowę i kontekst klipu z mówiącą głową (raport społeczności, lipiec 2026). Ten raport jest anegdotyczny, ale stanowi użyteczną regułę produkcyjną: jeśli dialog, muzyka lub zgoda prawna zależą od oryginalnej ścieżki, zachowaj i zmasteruj oryginalne audio osobno. Nie zatwierdzaj generatywnej edycji wizualnej tylko dlatego, że obraz wygląda dobrze.

Przepływ pracy Gemini Omni Flash 1.1 API: wybierz właściwe wejście, model i koszt

Wybierz wejście, które już zawiera potrzebne informacje. Text-to-video służy do nowej sceny. Image-to-video służy do artystycznie zaaranżowanego wyglądu początkowego. Reference-to-video służy do źródłowego wykonania wymagającego ściśle ograniczonej zmiany. W Atlas Cloud zespoły mogą otworzyć odpowiednią ścieżkę modelu Developer w jednej karcie przeglądarki, porównać tryby wejścia i zachować wspólny przepływ pracy prototypowania dzięki Atlas Cloud.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

      
ŚcieżkaPrzynieś do pierwszej próbyNajlepsze zastosowanieCzęsty błąd pierwszej próbyPrzypadek w artykulePubliczna stawka początkowa*
Text-to-Video DeveloperPrompt tekstowyNowa, ciągła scenaPróba odtworzenia konkretnego źródłowego wykonaniaRube Goldberg$0.112/sec
Image-to-Video Developer1–7 obrazów referencyjnychAnimowanie określonego wyglądu lub obiektuDostarczanie niespójnych obrazów referencyjnychOpcjonalna wariacja$0.112/sec
Reference-to-Video Developer1 źródłowy film plus do 5 obrazówZachowanie akcji przy edycji ograniczonego szczegółuPrzekazanie przycięcia dłuższego niż 10 sekundKapelusze i bąbelki$0.120/sec

Publiczne stawki początkowe sprawdzono na liście Models All 1 września 2026 r. Rozdzielczość, czas trwania i szczegóły zakupu mogą się zmieniać, dlatego przed budżetem wydawniczym potwierdź odpowiednią stronę modelu. Szacunek dla 8 sekund to stawka × 8, a nie uniwersalna obietnica ceny.

Dla wariantów sterowanych obrazem ścieżka Image-to-Video Developer przyjmuje 1–7 obrazów referencyjnych. Schemat reference-to-video przyjmuje jeden źródłowy klip plus do pięciu obrazów; przycięty segment źródłowy nie może przekraczać 10 sekund. Używaj stałego ziarna (seed) dopiero po znalezieniu wariantu, który warto iterować.

Wygodne wyjście SDK Google to output_video. Surowa odpowiedź REST umieszcza natomiast treść wideo w tablicy steps. To rozróżnienie pozwala uniknąć częstego błędu integracyjnego.

plaintext
1import { GoogleGenAI } from '@google/genai';
2import fs from 'node:fs';
3
4const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY });
5const interaction = await ai.interactions.create({
6  model: 'gemini-omni-1.1-flash',
7  input: 'A polished steel marble triggers a tabletop chain reaction.',
8  response_format: { type: 'video', aspect_ratio: '16:9', resolution: '4k' }
9});
10
11fs.writeFileSync('result.mp4', Buffer.from(interaction.output_video.data, 'base64'));
plaintext
1{
2  "model": "gemini-omni-1.1-flash",
3  "input": "A polished steel marble triggers a tabletop chain reaction.",
4  "response_format": { "type": "video", "aspect_ratio": "16:9", "resolution": "4k" }
5}

Krok 1: edycja wideo Gemini Omni Flash 1.1 API — zmiana kapeluszy w rytm klaśnięć

Użyj cichego, 10-sekundowego źródłowego klipu z czystymi prawami, z jedną dorosłą osobą wykonawcy, nieruchomą kamerą 16:9 i trzema wyraźnymi klaśnięciami. Prześlij źródłowy klip, jego pierwszą klatkę i trzy wyraźne referencje kapeluszy. Dla tej ścieżki użyj playgroundu Reference-to-Video Developer.

plaintext
1Use the uploaded original video as the timing, camera, and performance reference. Preserve the same adult performer, face, body movement, tan jacket, room, framing, shadows, and pacing. At the instant immediately after each completed clap, change only the hat: after clap one, a forest-green knit beanie; after clap two, a cream wide-brim felt hat; after clap three, a red baseball cap. Keep each hat naturally fitted and stable between claps. No cuts, no added people, no text, no captions, no logos, and no changes to the jacket or room. Preserve the silent source audio; do not generate speech or music.

Wybierz przycięcie źródła 0-10s, 16:9, 4K i stałe ziarno (seed) wyłącznie w celu późniejszej kontrolowanej ponownej próby. Zmieniaj jedną zmienną na raz. Jeśli kapelusz dryfuje, uprość zmianę, zanim dodasz mocniejszą referencję.

Gemini Omni Flash – klatka kluczowa przypadku zmiany kapelusza

Nieruchomy kadr z przypadku 1. Wybrana wyraźna klatka pokazuje końcową czerwoną czapkę po trzecim klaśnięciu, podczas gdy wykonawca, pomieszczenie i kamera pozostają stabilne.

Gemini Omni Flash – przypadek testu ruchu zmiany kapelusza

Test ruchu z przypadku 1. W 10-sekundowym klipie trzy osobne klaśnięcia wyzwalają stany: czapkę beanie, kapelusz z szerokim rondem i czerwoną czapkę, w jednym ciągłym ujęciu studyjnym.

Krok 2: edycja wideo Gemini Omni Flash 1.1 API — transformacja jednego obiektu

Użyj wyraźnego, cichego źródła 10-sekundowego: dorosła osoba obraca małą geometryczną ceramiczną rzeźbę przy oknie. Prześlij źródłowy film i jego pierwszą klatkę. Wejście pozostaje proste, aby transformacja materiału miała jedno zadanie.

plaintext
1Use the uploaded video as the exact performance, camera, and lighting reference. Preserve the adult creator, hands, clothing, studio, window light, camera position, and the slow turn of the object. At 2.0 seconds, transform only the small geometric ceramic sculpture into a connected cluster of translucent soap bubbles with realistic reflections and soft iridescent color. The creator continues the same hand motion. Keep the bubbles attached in the same position and scale as the original sculpture. One continuous shot, no cuts, no new objects, no new people, no text, no logos, and no generated speech or music.

Wybierz przycięcie źródła 0-10s, 16:9, 4K i ten sam przepływ pracy ze stałym ziarnem co w kroku 1. Sprawdź krawędź obiektu w przejściu w drugiej sekundzie oraz w ostatniej sekundzie. Te momenty pokazują, czy model zmienił więcej niż tylko wskazany obiekt.

Gemini Omni Flash – klatka kluczowa przypadku rzeźby z bąbelków

Nieruchomy kadr z przypadku 2. Klaster bąbelków jest w pełni uformowany, a obracające dłonie artysty, stół roboczy i światło okienne pozostają czytelne.

Gemini Omni Flash – przypadek ruchu rzeźby z bąbelków

Test ruchu z przypadku 2. Geometryczna rzeźba zmienia się w półprzezroczysty klaster bąbelków w żądanym momencie, a kamera przesuwa się w bok przez nasłonecznione studio.

Krok 3: Gemini Omni Flash 1.1 API Text-to-Video — test ciągłej sekwencji fizycznej

W przypadku nowej sceny zacznij od samego tekstu. To izoluje timing modelu, relacje między obiektami i instrukcje dotyczące kamery. Użyj modelu Text-to-Video Developer do uruchomienia 8-sekundowego, 16:9, 4K. Ustal ziarno (seed) dopiero po otrzymaniu wyniku, do którego warto wrócić.

plaintext
1One continuous 8-second studio shot of a hand-built tabletop Rube Goldberg machine. A polished steel marble rolls from left to right through a wooden track, tips a row of dominoes, releases a small brass lever, rings a bell, and opens a paper flower. Every collision follows believable gravity, weight, momentum, and contact. The camera begins in a close tracking shot with the marble, then smoothly slides sideways to reveal the full chain reaction. Warm morning window light, crisp wood and metal textures, practical workshop setting. No jump cuts, no visible hands, no logos, no captions, no text.

Sprawdź faktyczny łańcuch, a nie pojedynczą atrakcyjną klatkę. Jeśli kulka nie trafia w kontakt, skróć sekwencję lub usuń jedną zależność. Niezawodny łańcuch 5 zdarzeń jest mocniejszym demo produktu niż zatłoczona sekwencja, której mechaniki nie da się odczytać.

Gemini Omni Flash – klatka kluczowa przypadku Rube Goldberga

Nieruchomy kadr z przypadku 3. Wybrana klatka końcowa pokazuje otwarty papierowy kwiat i ukończony łańcuch na stole.

Gemini Omni Flash text-to-video – GIF reakcji łańcuchowej Rube Goldberga

Test ruchu z przypadku 3. Kulka uruchamia domino, potem dźwignię i dzwonek, zanim w ostatnich sekundach otwiera się kwiat. Kamera przesuwa się w bok, aby ukazać każdy etap, zamiast zwykłego najazdu.

Warianty Gemini Omni Flash 1.1 API: rozszerzaj, interpoluj i iteruj bezpiecznie

Używaj rozszerzania i interpolacji do rozwiązania konkretnego problemu ciągłości, a nie do uniknięcia wyraźnego pierwszego przejścia. Google opisuje 10-sekundowe rozszerzenia do łącznej długości 40 sekund oraz kontrolę klatki początkowej i końcowej w Omni 1.1. Podaje również, że wstępne wersje 360p mogą być nawet o 60% szybsze i kosztować jedną trzecią standardowego poziomu 720p w jego własnym porównaniu przepustowości. To warunki testowe Google, a nie gwarancja szybkości na całej platformie.

Przyjmij sekwencję dwuprzebiegową:

  1. Zweryfikuj logikę ruchu w niskiej rozdzielczości roboczej, jeśli ta kontrola jest faktycznie dostępna.
  2. Zmieniaj jedną zmienną na ponowną próbę: kapelusz, materiał bąbelków lub jedną frazę dotyczącą kamery.
  3. Generuj finalny asset w docelowej rozdzielczości dopiero po tym, jak akcja wygląda poprawnie.

Najpierw zapisz ograniczenia zachowania: zachowaj tego samego wykonawcę, kamerę, pomieszczenie i timing. Następnie nazwij jedną transformację. W przypadku ciągłego ujęcia napisz jedno ciągłe ujęcie, bez cięć. W przypadku przejścia od początku do końca podaj celowo dobraną pierwszą i ostatnią klatkę, zamiast prosić model, aby wywnioskował oba punkty końcowe z luźnego zdania.

Gemini Omni Flash 1.1 API: koszty, prawa i produkcyjne zabezpieczenia

Planuj budżet pracy jako ciąg decyzji, a nie nieograniczony przycisk „generuj ponownie”. Przy publicznych stawkach początkowych pokazanych powyżej jedno 8-sekundowe uruchomienie tekstowe kosztuje około $0.896, a jedna 8-sekundowa edycja referencyjna około $0.960. Budżet na trzy próby wynosi zatem około $2.688 w przypadku Rube Goldberga i $2.880 w przypadku każdej z edycji referencyjnych, zanim zacznie obowiązywać stawka za wyższą rozdzielczość lub inny SKU produktu.

W wewnętrznym planowaniu trzymaj osobno rozliczenia API, ceny zakupu na stronie produktu oraz limity społecznościowe lub konta. Przed zakupem lub uruchomieniem sprawdź aktualną cenę wybranej ścieżki dla danej rozdzielczości i czasu trwania. Ten artykuł celowo nie zamienia listy stawek początkowych na stałą wycenę 4K.

Używaj wyłącznie filmów i obrazów referencyjnych, do których masz prawo przesłania. Uzyskaj zgodę od rozpoznawalnych osób, zachowuj zapisy promptów i źródeł oraz oznaczaj wygenerowany materiał w miejscach, gdzie odbiorcy mogliby pomylić go z materiałem dokumentalnym. Sprawdź dialog, muzykę, znaki towarowe i wizerunki w osobnym przejściu zatwierdzania. Te zabezpieczenia są równie ważne jak klauzula preserve w prompcie Gemini Omni Flash 1.1 API.

Gemini Omni Flash 1.1 API — najczęściej zadawane pytania

Jaki jest stabilny identyfikator modelu Gemini Omni Flash 1.1 API?

Obecny stabilny identyfikator modelu Google to gemini-omni-1.1-flash. Podczas wdrażania korzystaj z aktualnej dokumentacji modelu, ponieważ aliasy modeli i dostępność podglądu mogą się zmieniać.

Czy gemini-omni-flash-preview jest wycofywany?

Traktuj nazwę preview jako osobną ścieżkę wydawniczą. Potwierdź aktualne powiadomienie o wycofaniu w dokumentacji modelu Google, zanim przypniesz ją w produkcji, a następnie używaj stabilnego identyfikatora, jeśli odpowiada wymaganym możliwościom.

Czy Gemini Omni Flash 1.1 może edytować istniejące wideo?

Tak. Udokumentowany przepływ pracy przesyła wideo przez interfejs Files API i dostarcza instrukcję edycji. Trzymaj segment źródłowy krótko i podaj każdy element, który ma pozostać niezmieniony.

Jak długie może być wideo w Gemini Omni Flash 1.1 API?

Standardowe przykłady generowania obejmują krótkie klipy, podczas gdy Omni 1.1 może rozszerzać wideo o 10-sekundowe przyrosty do łącznej długości 40 sekund. W obecnie udokumentowanej ścieżce Developer w Atlas źródłowe przycięcie reference-to-video musi wynosić 10 sekund lub mniej.

Czy może zachować dialog i oryginalną ścieżkę audio?

Stosuj instrukcje zachowania wizualnego, a następnie weryfikuj audio niezależnie. W przypadku klipu, w którym dokładny dialog lub muzyka mają znaczenie, przenieś zatwierdzony oryginalny utwór przez postprodukcję, zamiast traktować generatywny wynik jako automatyczny master audio.

Ile kosztuje Gemini Omni Flash 1.1 API?

Koszt zależy od ścieżki, czasu trwania, rozdzielczości i powierzchni rozliczeniowej. W przypadku przepływu pracy Gemini Omni Flash 1.1 API pomnóż sekundy przez aktualnie wyświetlaną stawkę ścieżki, a następnie zarezerwuj co najmniej 3 próby dla każdego ujęcia krytycznego dla ruchu.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele