Ein Erwachsener klatscht dreimal in einem stummen Clip mit fester Kamera. Nach jedem Klatschen ändert sich nur der Hut. Darsteller, Jacke, Raum, Licht und Timing bleiben unverändert. Das ist das praktische Versprechen, das Entwickler mit der gemini omni flash 1.1 api testen.
Der schwierige Teil besteht nicht darin, eine einzelne Videoanfrage zu senden. Es geht darum, „ändere genau diese eine Sache“ in den richtigen Eingabemodus, einen Prompt mit ausreichenden Einschränkungen und ein Budget, das Raum für Iterationen lässt, zu übersetzen. Die drei folgenden Builds konzentrieren sich auf diese Übergabe: eine ereignisgetaktete Hut-Änderung, eine Material-Änderung eines einzelnen Objekts und eine reine Text-Physiksequenz.
Gemini Omni 1.1 Flash ist Googles produktionsreifes Video-Generierungs-Update. Es unterstützt Text-, Bild- und hochgeladene Videoeingaben, während die Interactions API über eine vorherige Interaktions-ID iterativen Zustand unterstützt. Zu den dokumentierten Ausgabesteuerungen gehören 360p, 720p, 1080p und 4K mit 16:9- oder 9:16-Format (Google Gemini Omni-Dokumentation, September 2026).
Wichtigste Erkenntnisse
- Stabile Google-Modell-ID:
gemini-omni-1.1-flash.- Wähle die Eingaberoute, bevor du den Prompt schreibst.
- Halte das Quellsegment für Referenz-Editierungen bei 10 Sekunden oder weniger.
- Behandle wichtigen Dialog als separate Audio-Freigabeaufgabe.
Warum die Gemini Omni Flash 1.1 API gefragt ist und warum erste Versuche scheitern
Omni 1.1 erregt Aufmerksamkeit, weil es Generierung mit Bearbeitungs- und Fortsetzungsfunktionen kombiniert. Google zufolge kann das Update Szenen in 10-Sekunden-Schritten auf bis zu 40 Sekunden verlängern, zwischen erstem und letztem Frame interpolieren, 360p-Vorschauen erstellen und auf 4K hochskalieren (Google Omni 1.1-Ankündigung, August 2026). Diese Steuerungsmöglichkeiten sind für ein Produktteam wichtig, das einen Editor, eine kreative SaaS-Lösung oder ein Tool für Kurzform-Marketing entwickelt.
Der erste Versuch scheitert oft aus einfacheren Gründen:
- Eine Text-to-Video-Route wird gebeten, eine vorhandene Performance zu erhalten.
- Die Bearbeitung verlangt ein neues Objekt ohne klare Referenz oder eine konkrete visuelle Beschreibung.
- Ein einziger Prompt ändert Schauspieler, Kamera, Kleidung, Umgebung und Objekt gleichzeitig.
- Ein langes Quellvideo verdeckt den genauen Moment, der die Bearbeitung auslösen soll.
Beginnen Sie damit, festzulegen, was unverändert bleiben muss. Im Hut-Beispiel sind Darsteller, Kamera, Raum, Jacke, Schatten und Klatsch-Timing invariante Elemente. Der Hut ist die einzige Variable, die sich ändert. Das Bubble-Skulptur-Beispiel folgt derselben Idee, fixiert jedoch den Künstler und das Fensterlicht, während das Material eines Objekts geändert wird.
Visuelle Kontinuität und Audio-Kontinuität erfordern unterschiedliche Abnahmeprüfungen. Ein Reddit-Nutzer beschrieb ein Ergebnis, das nach Bearbeitungen Sprache und Kontext eines Talking-Head-Clips neu schrieb (Community-Bericht, Juli 2026). Dieser Bericht ist anekdotisch, aber dennoch eine nützliche Produktionsregel: Wenn Dialog, Musik oder eine rechtliche Freigabe vom Original-Track abhängen, den Originalton separat aufbewahren und mastern. Genehmigen Sie eine generative visuelle Bearbeitung nicht nur, weil die Bilder richtig aussehen.
Gemini Omni Flash 1.1 API-Workflow: Die richtige Eingabe, das richtige Modell und die richtigen Kosten wählen
Wählen Sie die Eingabe, die bereits die benötigten Informationen enthält. Text-to-Video ist für eine neue Szene. Image-to-Video ist für einen gezielt gestalteten Ausgangs-Look. Reference-to-Video ist für eine Quell-Performance, die eine eng begrenzte Änderung benötigt. In Atlas Cloud können Teams die relevante Developer-Modellroute in einem Browser-Tab öffnen, Eingabemodi vergleichen und einen gemeinsamen Prototyp-Workflow über Atlas Cloud beibehalten.
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| Route | Für den ersten Lauf mitbringen | Am besten geeignet für | Häufiger Fehler beim ersten Lauf | Fall im Artikel | Öffentlicher Einstiegspreis* |
| Text-to-Video Developer | Text-Prompt | Neue, durchgehende Szene | Versuch, eine bestimmte Quell-Performance nachzubilden | Rube Goldberg | $0.112/sec |
| Image-to-Video Developer | 1–7 Referenzbilder | Einen definierten Look oder ein definiertes Motiv animieren | Inkonsistente Referenzbilder liefern | Optionale Variante | $0.112/sec |
| Reference-to-Video Developer | 1 Quellvideo plus bis zu 5 Bilder | Aktion erhalten, während ein begrenztes Detail geändert wird | Einen Trim von mehr als 10 Sekunden übergeben | Hüte und Blasen | $0.120/sec |
Die öffentlichen Einstiegspreise wurden am 1. September 2026 anhand der Models-All-Liste geprüft. Auflösung, Dauer und Checkout-Details können sich ändern. Daher vor einem Release-Budget die jeweilige Modellseite bestätigen. Eine 8-Sekunden-Schätzung ist Rate × 8 und kein universelles Preisversprechen.
Für bildgeführte Variationen akzeptiert die Image-to-Video Developer-Route 1–7 Bildreferenzen. Das Reference-to-Video-Schema akzeptiert ein Quellvideo plus bis zu fünf Bilder; das getrimmte Quellsegment darf 10 Sekunden nicht überschreiten. Verwenden Sie einen festen Seed erst, wenn Sie eine Variante gefunden haben, die sich zu iterieren lohnt.
Die SDK-Komfortausgabe von Google ist output_video. Eine rohe REST-Antwort legt Videoinhalte stattdessen im steps-Array ab. Diese Unterscheidung erspart einen häufigen Integrationsfehler.
plaintext1import { GoogleGenAI } from '@google/genai'; 2import fs from 'node:fs'; 3 4const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY }); 5const interaction = await ai.interactions.create({ 6 model: 'gemini-omni-1.1-flash', 7 input: 'A polished steel marble triggers a tabletop chain reaction.', 8 response_format: { type: 'video', aspect_ratio: '16:9', resolution: '4k' } 9}); 10 11fs.writeFileSync('result.mp4', Buffer.from(interaction.output_video.data, 'base64'));
plaintext1{ 2 "model": "gemini-omni-1.1-flash", 3 "input": "A polished steel marble triggers a tabletop chain reaction.", 4 "response_format": { "type": "video", "aspect_ratio": "16:9", "resolution": "4k" } 5}
Schritt 1: Video-Edit mit Gemini Omni Flash 1.1 API – Hüte im Takt wechseln
Verwenden Sie ein stummes 10-Sekunden-Quellvideo mit geklärten Rechten, einem erwachsenen Darsteller, einer festen 16:9-Kamera und drei klar erkennbaren Klatschern. Laden Sie das Quellvideo, sein erstes Bild und drei eindeutige Hut-Referenzen hoch. Verwenden Sie für diese Route den Reference-to-Video Developer-Playground.
plaintext1Use the uploaded original video as the timing, camera, and performance reference. Preserve the same adult performer, face, body movement, tan jacket, room, framing, shadows, and pacing. At the instant immediately after each completed clap, change only the hat: after clap one, a forest-green knit beanie; after clap two, a cream wide-brim felt hat; after clap three, a red baseball cap. Keep each hat naturally fitted and stable between claps. No cuts, no added people, no text, no captions, no logos, and no changes to the jacket or room. Preserve the silent source audio; do not generate speech or music.
Wählen Sie den Quell-Trim 0-10s, 16:9, 4K und einen festen Seed nur für einen späteren kontrollierten Wiederholungsversuch. Ändern Sie jeweils nur eine Variable. Wenn ein Hut abweicht, vereinfachen Sie die Änderung, bevor Sie eine stärkere Referenz hinzufügen.
Standbild aus Fall 1. Das ausgewählte klare Bild zeigt die endgültige rote Mütze nach dem dritten Klatschen, während Darsteller, Raum und Kamera stabil bleiben.
Bewegungstest aus Fall 1. Im 10-Sekunden-Clip lösen drei getrennte Klatscher die Zustände Beanie, breitkrempiger Hut und rote Mütze in einer durchgehenden Studioaufnahme aus.
Schritt 2: Video-Edit mit Gemini Omni Flash 1.1 API – Ein Objekt transformieren
Verwenden Sie ein separates stummes 10-Sekunden-Quellvideo: Ein Erwachsener dreht eine kleine geometrische Keramikskulptur neben einem Fenster. Laden Sie das Quellvideo und sein erstes Bild hoch. Die Eingabe bleibt einfach, damit die Materialtransformation nur eine Aufgabe hat.
plaintext1Use the uploaded video as the exact performance, camera, and lighting reference. Preserve the adult creator, hands, clothing, studio, window light, camera position, and the slow turn of the object. At 2.0 seconds, transform only the small geometric ceramic sculpture into a connected cluster of translucent soap bubbles with realistic reflections and soft iridescent color. The creator continues the same hand motion. Keep the bubbles attached in the same position and scale as the original sculpture. One continuous shot, no cuts, no new objects, no new people, no text, no logos, and no generated speech or music.
Wählen Sie den Quell-Trim 0-10s, 16:9, 4K und denselben Workflow mit festem Seed wie in Schritt 1. Prüfen Sie die Objektkante am Übergang bei zwei Sekunden und in der letzten Sekunde. Diese Momente zeigen, ob das Modell mehr geändert hat als das angeforderte Objekt.
Standbild aus Fall 2. Die Blasenansammlung ist vollständig ausgebildet, während die drehenden Hände des Künstlers, der Arbeitstisch und das Fensterlicht erkennbar bleiben.
Bewegungstest aus Fall 2. Die geometrische Skulptur verwandelt sich zum gewünschten Zeitpunkt in eine transluzente Blasenansammlung, während die Kamera seitlich durch das sonnendurchflutete Studio gleitet.
Schritt 3: Text-to-Video mit Gemini Omni Flash 1.1 API – Eine durchgehende Physiksequenz testen
Für eine neue Szene beginnen Sie nur mit Text. Das isoliert das Timing, die Objektbeziehungen und die Kameraanweisung des Modells. Verwenden Sie das Text-to-Video Developer-Modell für einen 8-Sekunden-Lauf mit 16:9 und 4K. Legen Sie den Seed erst fest, wenn Sie ein Ergebnis haben, das einen zweiten Blick wert ist.
plaintext1One continuous 8-second studio shot of a hand-built tabletop Rube Goldberg machine. A polished steel marble rolls from left to right through a wooden track, tips a row of dominoes, releases a small brass lever, rings a bell, and opens a paper flower. Every collision follows believable gravity, weight, momentum, and contact. The camera begins in a close tracking shot with the marble, then smoothly slides sideways to reveal the full chain reaction. Warm morning window light, crisp wood and metal textures, practical workshop setting. No jump cuts, no visible hands, no logos, no captions, no text.
Prüfen Sie die tatsächliche Kette und nicht nur ein einzelnes ansprechendes Bild. Wenn die Murmel einen Kontakt verfehlt, kürzen Sie die Sequenz oder entfernen Sie eine Abhängigkeit. Eine zuverlässige Kette aus fünf Ereignissen ist eine stärkere Produktdemo als eine überladene Sequenz, deren Mechanik nicht lesbar ist.
Standbild aus Fall 3. Das ausgewählte Endbild zeigt die geöffnete Papierblume und die vollständige Tischkette.
Bewegungstest aus Fall 3. Die Murmel stößt die Dominos an, dann Hebel und Glocke, bevor sich in den letzten Sekunden die Blume öffnet. Die Kamera bewegt sich seitlich, um jede Stufe zu zeigen, anstatt nur hineinzufahren.
Gemini Omni Flash 1.1 API-Variationen: Sicher erweitern, interpolieren und iterieren
Nutzen Sie Erweiterung und Interpolation, um ein konkretes Kontinuitätsproblem zu lösen, nicht um einen sauberen ersten Durchgang zu vermeiden. Google beschreibt in Omni 1.1 10-Sekunden-Erweiterungen auf eine kumulative Gesamtdauer von 40 Sekunden sowie Start-/Endframe-Kontrolle. Außerdem berichtet Google, dass 360p-Entwürfe im eigenen Durchsatzvergleich bis zu 60 % schneller und ein Drittel so teuer sein können wie die Standard-720p-Stufe. Das sind Googles Testbedingungen und keine plattformweite Geschwindigkeitsgarantie.
Verwenden Sie eine Zwei-Durchlauf-Sequenz:
- Validieren Sie die Bewegungslogik in einer niedrigen Entwurfsauflösung, sofern diese Steuerung dort tatsächlich verfügbar ist.
- Ändern Sie pro Wiederholung nur eine Variable: den Hut, das Blasenmaterial oder eine Kamerabeschreibung.
- Erzeugen Sie das Release-Asset erst dann in der Zielauflösung, wenn die Aktion korrekt zu erkennen ist.
Schreiben Sie zuerst die Erhaltungsbedingungen: preserve the same performer, camera, room, and timing. Benennen Sie dann die eine Transformation. Für eine durchgehende Aufnahme formulieren Sie one continuous shot, no cuts. Für einen Übergang vom Anfang bis zum Ende liefern Sie ein bewusst gewähltes erstes und letztes Bild, anstatt das Modell zu bitten, beide Endpunkte aus einem lockeren Satz abzuleiten.
Gemini Omni Flash 1.1 API: Kosten, Rechte und Produktionsleitplanken
Planen Sie das Budget als eine Abfolge von Entscheidungen, nicht als unbegrenzten „Nochmal generieren“-Button. Bei den oben genannten öffentlichen Einstiegspreisen kostet ein 8-Sekunden-Textlauf etwa $0.896 und eine 8-Sekunden-Referenzbearbeitung etwa $0.960. Ein Budget für drei Versuche liegt also bei etwa $2.688 für den Rube-Goldberg-Fall und $2.880 für jeden der Referenzbearbeitungsfälle, bevor ein Preis für höhere Auflösung oder eine andere Produkt-SKU gilt.
Trennen Sie in der internen Planung die API-Abrechnung, die Checkout-Preise auf der Produktseite und Community- oder Kontokontingente. Prüfen Sie vor Kauf oder Launch den aktuellen Preis für Auflösung und Dauer der gewählten Route. Dieser Artikel macht aus einer Auflistung von Einstiegspreisen bewusst kein dauerhaftes 4K-Angebot.
Verwenden Sie nur Videos und Referenzbilder, die Sie hochladen dürfen. Holen Sie die Erlaubnis erkennbarer Personen ein, bewahren Sie Prompt- und Quellaufzeichnungen auf und kennzeichnen Sie generiertes Material, wo das Publikum es mit dokumentarischem Filmmaterial verwechseln könnte. Prüfen Sie Dialog, Musik, Marken und Bildnisse in einem eigenen Freigabedurchlauf. Diese Schutzmaßnahmen sind ebenso wichtig wie die preserve-Klausel in einem Gemini Omni Flash 1.1 API-Prompt.
Gemini Omni Flash 1.1 API – Häufig gestellte Fragen
Wie lautet die stabile Modell-ID der Gemini Omni Flash 1.1 API?
Die aktuelle stabile Modell-ID von Google lautet gemini-omni-1.1-flash. Verwenden Sie zum Implementierungszeitpunkt die aktuelle Modelldokumentation, da sich Modell-Aliase und die Verfügbarkeit von Vorschauversionen ändern können.
Wird gemini-omni-flash-preview eingestellt?
Behandeln Sie den Vorschaunamen als separaten Release-Track. Bestätigen Sie den aktuellen Einstellungshinweis in der Modelldokumentation von Google, bevor Sie ihn in der Produktion festschreiben, und verwenden Sie dann die stabile ID, wenn sie Ihren Anforderungen entspricht.
Kann Gemini Omni Flash 1.1 ein vorhandenes Video bearbeiten?
Ja. Der dokumentierte Workflow lädt ein Video über die Files API hoch und liefert eine Bearbeitungsanweisung. Halten Sie das Quellsegment kurz und benennen Sie jedes Element, das unverändert bleiben muss.
Wie lang kann ein Video mit der Gemini Omni Flash 1.1 API sein?
Die Standard-Generierungsbeispiele umfassen kurze Clips, während Omni 1.1 in 10-Sekunden-Schritten bis zu einer kumulativen Gesamtdauer von 40 Sekunden erweitern kann. Ein Atlas-Reference-to-Video-Quelltrim muss auf der aktuell dokumentierten Developer-Route 10 Sekunden oder weniger betragen.
Kann es Dialog und den ursprünglichen Audiospur erhalten?
Verwenden Sie visuelle Erhaltungsanweisungen und prüfen Sie den Ton anschließend unabhängig. Wenn bei einem Clip exakter Dialog oder Musik wichtig ist, führen Sie den freigegebenen Original-Track durch die Postproduktion, anstatt ein generatives Ergebnis als automatische Audio-Master zu behandeln.
Wie viel kostet die Gemini Omni Flash 1.1 API?
Die Kosten hängen von Route, Dauer, Auflösung und der Abrechnungsoberfläche ab. Für den Gemini Omni Flash 1.1 API-Workflow berechnen Sie Sekunden × den aktuell angezeigten Routenpreis und reservieren Sie für jedes bewegungskritische Bild mindestens 3 Versuche.






