MiniMax H3 Developer est maintenant en ligne — 60 % de réduction, à partir de 0,02 $ par seconde

Gemini Omni Flash 1.1 API : 3 builds vidéo à tester avant votre premier passage en production

Cet article explique 3 builds vidéo à tester avant votre premier run de production pour l'API Gemini Omni Flash 1.1. Meta Title : Gemini Omni Flash 1.1 API : 3 builds vidéo à tester avant votre premier run de production Meta Description : Créez, modifiez et prolongez des vidéos avec l'API Gemini Omni Flash 1.1.

Un adulte applaudit trois fois dans un clip silencieux à caméra fixe. Après chaque claquement, seul le chapeau change. L'interprète, la veste, la pièce, la lumière et le timing restent en place. C'est la promesse concrète que les développeurs testent avec l'API gemini omni flash 1.1.

La difficulté ne réside pas dans l'envoi d'une seule requête vidéo. Elle consiste à transformer « changer cette seule chose » en un mode d'entrée approprié, une consigne avec suffisamment de contraintes, et un budget qui laisse de la place à l'itération. Les trois réalisations ci-dessous se concentrent sur cette passation : une édition de chapeau synchronisée sur un événement, une édition de matériau sur un objet unique, et une séquence physique en texte seul.

Gemini Omni 1.1 Flash est la mise à jour de génération vidéo prête pour la production de Google. Elle prend en charge les entrées texte, image et vidéo téléchargée, tandis que l'API Interactions permet de gérer un état itératif via un identifiant d'interaction précédent. Ses contrôles de sortie documentés incluent la 360p, la 720p, la 1080p et la 4K, avec un cadrage 16:9 ou 9:16 (Documentation Google Gemini Omni, septembre 2026).

Points clés à retenir

  • Identifiant de modèle Google stable : gemini-omni-1.1-flash.
  • Choisissez le mode d'entrée avant d'écrire la consigne.
  • Conservez un segment source d'édition de référence de 10 secondes ou moins.
  • Traitez les dialogues importants comme une tâche d'approbation audio distincte.

Pourquoi l'API Gemini Omni Flash 1.1 attire l'attention, et pourquoi les premiers essais échouent

Omni 1.1 attire l'attention parce qu'il combine la génération avec des contrôles d'édition et de continuation. Google indique que la mise à jour peut prolonger les scènes par incréments de 10 secondes jusqu'à 40 secondes, interpoler entre la première et la dernière image, créer des aperçus en 360p et passer en 4K (Annonce Google Omni 1.1, août 2026). Ces contrôles comptent pour une équipe produit qui développe un éditeur, un SaaS créatif ou un outil marketing de formats courts.

Le premier essai échoue souvent pour des raisons plus simples :

  • Une voie texte-vers-vidéo est sollicitée pour préserver une performance existante.
  • L'édition demande un nouvel objet sans référence claire ni description visuelle précise.
  • Une seule consigne modifie à la fois l'acteur, la caméra, les vêtements, le décor et l'objet.
  • Un clip source long masque le moment exact qui doit déclencher l'édition.

Commencez par décider ce qui doit rester invariant. Dans le cas du chapeau, l'interprète, la caméra, la pièce, la veste, les ombres et le timing des applaudissements sont des invariants. Le chapeau est la seule variable changeante. Le cas de la sculpture en bulles utilise la même idée, mais verrouille le créateur et la lumière de la fenêtre tout en modifiant le matériau d'un seul objet.

La continuité visuelle et la continuité audio exigent des contrôles d'acceptation différents. Un utilisateur de Reddit a décrit une sortie qui réécrivait la parole et le contexte d'un clip avec une tête parlante après des éditions (rapport communautaire, juillet 2026). Ce rapport est anecdotique, mais constitue une règle de production utile : si le dialogue, la musique ou une approbation juridique dépend de la piste originale, conservez et masterisez la piste audio originale séparément. N'approuvez pas une édition visuelle générative uniquement parce que les images semblent correctes.

Flux de travail de l'API Gemini Omni Flash 1.1 : choisir la bonne entrée, le bon modèle et le bon coût

Choisissez l'entrée qui contient déjà les informations dont vous avez besoin. Le texte-vers-vidéo est destiné à une nouvelle scène. L'image-vers-vidéo est destinée à un look de départ dirigé artistiquement. La référence-vers-vidéo est destinée à une performance source qui nécessite un changement étroitement encadré. Sur Atlas Cloud, les équipes peuvent ouvrir la route de modèle Developer correspondante dans un onglet de navigateur, comparer les modes d'entrée et conserver un flux de travail de prototypage commun via Atlas Cloud.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

      
RouteÀ fournir au premier essaiMeilleure utilisationErreur courante au premier essaiCas de l'articleTarif public de départ*
Text-to-Video DeveloperConsigne texteNouvelle scène continueTenter de recréer une performance source préciseRube Goldberg$0.112/sec
Image-to-Video Developer1 à 7 images de référenceAnimer un look ou un sujet définiFournir des images de référence incohérentesVariation facultative$0.112/sec
Reference-to-Video Developer1 vidéo source et jusqu'à 5 imagesPréserver l'action tout en modifiant un détail délimitéPasser une sélection de plus de 10 secondesChapeaux et bulles$0.120/sec

Les tarifs publics de départ ont été vérifiés dans la liste Models All le 1er septembre 2026. La résolution, la durée et les détails de paiement peuvent changer ; confirmez donc la page du modèle concerné avant d'établir un budget de sortie. Une estimation de 8 secondes correspond au tarif × 8, et non à une promesse de prix universelle.

Pour les variations guidées par image, la route Image-to-Video Developer accepte de 1 à 7 images de référence. Le schéma référence-vers-vidéo accepte un clip source plus jusqu'à cinq images ; son segment source sélectionné ne doit pas dépasser 10 secondes. N'utilisez une graine fixe qu'après avoir trouvé une branche qui vaut la peine d'être itérée.

La sortie pratique du SDK Google est output_video. Une réponse REST brute place quant à elle le contenu vidéo dans le tableau steps. Cette distinction évite une erreur d'intégration courante.

plaintext
1import { GoogleGenAI } from '@google/genai';
2import fs from 'node:fs';
3
4const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY });
5const interaction = await ai.interactions.create({
6  model: 'gemini-omni-1.1-flash',
7  input: 'A polished steel marble triggers a tabletop chain reaction.',
8  response_format: { type: 'video', aspect_ratio: '16:9', resolution: '4k' }
9});
10
11fs.writeFileSync('result.mp4', Buffer.from(interaction.output_video.data, 'base64'));
plaintext
1{
2  "model": "gemini-omni-1.1-flash",
3  "input": "A polished steel marble triggers a tabletop chain reaction.",
4  "response_format": { "type": "video", "aspect_ratio": "16:9", "resolution": "4k" }
5}

Étape 1 : édition vidéo avec l'API Gemini Omni Flash 1.1, changer de chapeau au rythme des claquements

Utilisez un clip source silencieux de 10 secondes, libre de droits, avec un interprète adulte, une caméra fixe 16:9 et trois applaudissements distincts. Téléversez le clip source, sa première image et trois références claires de chapeaux. Pour cette route, utilisez le playground Reference-to-Video Developer.

plaintext
1Utilisez la vidéo originale téléversée comme référence de timing, de caméra et de performance. Préservez le même interprète adulte, le visage, le mouvement corporel, la veste beige, la pièce, le cadrage, les ombres et le rythme. À l'instant qui suit immédiatement chaque claquement terminé, changez uniquement le chapeau : après le premier claquement, un bonnet en maille vert forêt ; après le deuxième claquement, un chapeau de feutre crème à large bord ; après le troisième claquement, une casquette de baseball rouge. Gardez chaque chapeau naturellement ajusté et stable entre les claquements. Aucune coupe, aucune personne ajoutée, aucun texte, aucune légende, aucun logo et aucune modification de la veste ou de la pièce. Préservez la piste audio source silencieuse ; ne générez ni parole ni musique.

Choisissez la sélection source 0-10s, 16:9, 4K, et une graine fixe uniquement pour une nouvelle tentative contrôlée ultérieure. Modifiez une variable à la fois. Si un chapeau dérive, simplifiez le changement avant d'ajouter une référence plus forte.

Image clé du cas de changement de chapeau Gemini Omni Flash

Image fixe du cas 1. L'image claire sélectionnée montre la casquette rouge finale après le troisième claquement, tandis que l'interprète, la pièce et la caméra restent stables.

Cas de mouvement du changement de chapeau Gemini Omni Flash

Test de mouvement du cas 1. Sur les 10 secondes du clip, trois claquements distincts déclenchent les états bonnet, chapeau à large bord et casquette rouge dans un seul plan de studio continu.

Étape 2 : édition vidéo avec l'API Gemini Omni Flash 1.1, transformer un seul objet

Utilisez une source silencieuse distincte de 10 secondes : un adulte tourne une petite sculpture en céramique géométrique près d'une fenêtre. Téléversez la vidéo source et sa première image. L'entrée reste simple pour que la transformation de matériau n'ait qu'une seule tâche.

plaintext
1Utilisez la vidéo téléversée comme référence exacte de performance, de caméra et d'éclairage. Préservez le créateur adulte, ses mains, ses vêtements, le studio, la lumière de la fenêtre, la position de la caméra et la rotation lente de l'objet. À 2,0 secondes, transformez uniquement la petite sculpture en céramique géométrique en un groupe connecté de bulles de savon translucides, avec des reflets réalistes et une douce couleur iridescente. Le créateur poursuit le même mouvement de main. Gardez les bulles attachées dans la même position et la même échelle que la sculpture d'origine. Un seul plan continu, aucune coupe, aucun nouvel objet, aucune nouvelle personne, aucun texte, aucun logo, et aucune parole ou musique générée.

Choisissez la sélection source 0-10s, 16:9, 4K, et le même flux de travail à graine fixe que l'étape 1. Vérifiez le bord de l'objet à la transition de deux secondes et à la dernière seconde. Ces moments révèlent si le modèle a modifié plus que l'objet demandé.

Image clé du cas de sculpture en bulles Gemini Omni Flash

Image fixe du cas 2. L'amas de bulles est entièrement formé tandis que les mains qui tournent de l'artiste, la table de travail et la lumière de la fenêtre restent lisibles.

Cas de mouvement de la sculpture en bulles Gemini Omni Flash

Test de mouvement du cas 2. La sculpture géométrique se transforme en amas de bulles translucides au moment demandé tandis que la caméra glisse latéralement à travers le studio baigné de lumière.

Étape 3 : texte-vers-vidéo avec l'API Gemini Omni Flash 1.1, tester une séquence physique continue

Pour une nouvelle scène, commencez avec le texte seul. Cela isole le timing du modèle, les relations entre objets et l'instruction de caméra. Utilisez le modèle Text-to-Video Developer pour une exécution de 8 secondes, 16:9, 4K. Ne figez la graine qu'après avoir obtenu une sortie qui mérite d'être revue.

plaintext
1Un seul plan de studio continu de 8 secondes montrant une machine de Rube Goldberg de table construite à la main. Une bille en acier poli roule de gauche à droite sur une piste en bois, fait tomber une rangée de dominos, libère un petit levier en laiton, fait sonner une cloche et ouvre une fleur en papier. Chaque collision suit une gravité, un poids, un élan et un contact crédibles. La caméra commence par un plan de travelling rapproché qui suit la bille, puis glisse latéralement en douceur pour révéler toute la réaction en chaîne. Lumière matinale chaude de la fenêtre, textures nettes de bois et de métal, décor d'atelier pratique. Aucun cut, aucune main visible, aucun logo, aucune légende, aucun texte.

Inspectez la chaîne réelle plutôt qu'une seule image attrayante. Si la bille manque un contact, raccourcissez la séquence ou supprimez une dépendance. Une chaîne fiable de 5 événements constitue une meilleure démonstration produit qu'une séquence surchargée dont la mécanique ne peut pas être lue.

Image clé du cas Rube Goldberg Gemini Omni Flash

Image fixe du cas 3. L'image finale sélectionnée montre la fleur en papier ouverte et la chaîne de table achevée.

GIF de réaction en chaîne Rube Goldberg texte-vers-vidéo Gemini Omni Flash

Test de mouvement du cas 3. La bille déclenche les dominos, puis le levier et la cloche, avant que la fleur ne s'ouvre dans les dernières secondes. La caméra se déplace latéralement pour révéler chaque étape plutôt que de simplement avancer.

Variations de l'API Gemini Omni Flash 1.1 : prolonger, interpoler et itérer en toute sécurité

Utilisez l'extension et l'interpolation pour résoudre un problème de continuité spécifique, et non pour éviter une première passe claire. Google décrit des extensions de 10 secondes jusqu'à un total cumulé de 40 secondes et un contrôle des images de début et de fin dans Omni 1.1. Il indique également que les brouillons en 360p peuvent être jusqu'à 60 % plus rapides et coûter un tiers du prix du palier standard 720p selon sa propre comparaison de débit. Ce sont les conditions de test de Google, pas une garantie de vitesse à l'échelle de la plateforme.

Adoptez une séquence en deux passes :

  1. Validez la logique du mouvement à une résolution de brouillon faible, là où ce contrôle est réellement disponible.
  2. Modifiez une seule variable par tentative : le chapeau, le matériau des bulles ou une phrase de caméra.
  3. Générez l'actif de diffusion à la résolution cible uniquement après que l'action se lit correctement.

Rédigez d'abord les contraintes de préservation : préserver le même interprète, la même caméra, la même pièce et le même timing. Puis nommez l'unique transformation. Pour un plan continu, indiquez un seul plan continu, aucune coupe. Pour une transition de bout en bout, fournissez une première et une dernière image délibérées plutôt que de demander au modèle d'inférer les deux extrémités à partir d'une phrase vague.

Coût, droits et garde-fous de production de l'API Gemini Omni Flash 1.1

Budgétisez le travail comme une séquence de décisions, et non comme un bouton « générer encore » illimité. Aux tarifs publics de départ indiqués ci-dessus, une exécution texte de 8 secondes coûte environ $0.896 et une édition de référence de 8 secondes environ $0.960. Un budget de trois tentatives est donc d'environ $2.688 pour le cas Rube Goldberg et de $2.880 pour chacun des cas d'édition de référence, avant application d'un tarif de résolution supérieure ou d'une autre référence produit (SKU).

Dans la planification interne, distinguez la facturation de l'API, les tarifs de paiement de la page produit et les quotas communautaires ou de compte. Avant un achat ou un lancement, vérifiez le prix actuel de la résolution et de la durée de la route sélectionnée. Cet article ne transforme volontairement pas une liste de tarifs de départ en devis 4K permanent.

N'utilisez que des vidéos et des images de référence que vous avez le droit de téléverser. Obtenez l'autorisation des personnes reconnaissables, conservez les consignes et les sources, et étiquetez les contenus générés là où le public pourrait les confondre avec des images documentaires. Examinez les dialogues, la musique, les marques déposées et les droits à l'image dans une passe d'approbation dédiée. Ces garde-fous comptent autant que la clause preserve dans une consigne de l'API Gemini Omni Flash 1.1.

Questions fréquentes sur l'API Gemini Omni Flash 1.1

Quel est l'identifiant de modèle stable de l'API Gemini Omni Flash 1.1 ?

L'identifiant de modèle stable actuel de Google est gemini-omni-1.1-flash. Consultez la documentation du modèle en vigueur au moment de l'implémentation, car les alias de modèles et la disponibilité des aperçus peuvent changer.

Le modèle gemini-omni-flash-preview est-il abandonné ?

Traitons le nom d'aperçu comme une voie de version distincte. Confirmez l'avis de dépréciation actuel dans la documentation des modèles de Google avant de l'épingler en production, puis utilisez l'identifiant stable lorsqu'il correspond à vos capacités requises.

Gemini Omni Flash 1.1 peut-il modifier une vidéo existante ?

Oui. Le flux de travail documenté téléverse une vidéo via l'API Files et fournit une instruction d'édition. Gardez le segment source court et indiquez chaque élément qui doit rester inchangé.

Quelle peut être la durée d'une vidéo de l'API Gemini Omni Flash 1.1 ?

Les exemples de génération standard couvrent des clips courts, tandis qu'Omni 1.1 peut prolonger par incréments de 10 secondes jusqu'à un total cumulé de 40 secondes. Une sélection source référence-vers-vidéo Atlas doit être de 10 secondes ou moins sur la route Developer actuellement documentée.

Peut-il préserver le dialogue et la piste audio d'origine ?

Utilisez des instructions de préservation visuelle, puis vérifiez l'audio indépendamment. Pour un clip où le dialogue ou la musique exacts comptent, reportez la piste originale approuvée à travers la post-production plutôt que de traiter une sortie générative comme un master audio automatique.

Combien coûte l'API Gemini Omni Flash 1.1 ?

Le coût dépend de la route, de la durée, de la résolution et de la surface de facturation. Pour le flux de travail de l'API Gemini Omni Flash 1.1, calculez secondes × le tarif de la route actuellement affiché, puis réservez au moins 3 tentatives pour tout plan critique en termes de mouvement.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles