شخص بالغ يصفّق ثلاث مرات في مقطع صامت بكاميرا ثابتة. بعد كل تصفيقة، تتغير القبعة فقط. المؤدي، والسترة، والغرفة، والإضاءة، والتوقيت تظل ثابتة. هذا هو الوعد العملي الذي يختبره المطورون باستخدام gemini omni flash 1.1 api.
الجزء الصعب ليس إرسال طلب فيديو واحد، بل تحويل «غيّر هذا الشيء الواحد» إلى وضع الإدخال الصحيح، مع مطالبة تحتوي على قيود كافية، وميزانية تترك مجالاً للتكرار. النماذج الثلاثة أدناه تركّز على هذا التسليم: تعديل قبعة بتوقيت حدث، وتعديل مادة كائن واحد، وتسلسل فيزيائي بالنص فقط.
جيميني أومني 1.1 فلاش هو تحديث جوجل الجاهز للإنتاج لتوليد الفيديو. يدعم إدخالات النص والصورة والفيديو المرفوع، بينما تدعم واجهة برمجة التطبيقات Interactions الحالة التكرارية عبر معرّف تفاعل سابق. تتضمن عناصر التحكم في الإخراج الموثّقة 360p و720p و1080p و4K، مع تأطير 16:9 أو 9:16 (وثائق جوجل جيميني أومني، سبتمبر 2026).
الخلاصات الرئيسية
- معرّف نموذج جوجل المستقر:
gemini-omni-1.1-flash.- اختر مسار الإدخال قبل كتابة المطالبة.
- أبقِ مقطع المصدر للتعديل المرجعي عند 10 ثوانٍ أو أقل.
- تعامل مع الحوار المهم كمهمة اعتماد صوتي منفصلة.
لماذا تحظى واجهة Gemini Omni Flash 1.1 API بشعبية، ولماذا تفشل المحاولات الأولى
يجذب أومني 1.1 الانتباه لأنه يجمع بين التوليد وعناصر التحكم في التحرير والاستمرار. تقول جوجل إن التحديث يمكنه تمديد المشاهد بزيادات قدرها 10 ثوانٍ حتى 40 ثانية، والاستيفاء بين الإطار الأول والأخير، وإنشاء معاينات بدقة 360p، ورفع الدقة إلى 4K (إعلان جوجل أومني 1.1، أغسطس 2026). هذه الضوابط مهمة لفريق منتج يبني محرراً، أو SaaS إبداعيًا، أو أداة تسويق قصيرة الشكل.
تفشل المحاولة الأولى غالباً لأسباب أبسط:
- يُطلب من مسار النص إلى فيديو الحفاظ على أداء قائم.
- يطلب التعديل كائنًا جديدًا دون مرجع واضح أو وصف بصري محدد.
- تغيّر مطالبة واحدة الممثل والكاميرا والملابس والإعداد والكائن في الوقت نفسه.
- يخفي مقطع مصدر طويل الإيقاع الدقيق الذي يجب أن يفعّل التعديل.
ابدأ بتحديد ما يجب أن يظل ثابتًا. في حالة القبعة، المؤدي والكاميرا والغرفة والسترة والظلال وتوقيت التصفيق هي عناصر ثابتة. القبعة هي المتغير الوحيد المتغير. حالة نحت الفقاعات تستخدم الفكرة نفسها، لكنها تثبّت المؤلف وإضاءة النافذة مع تغيير مادة كائن واحد.
الاستمرارية البصرية والاستمرارية الصوتية تتطلبان فحوص قبول مختلفة. وصف مستخدم في Reddit مخرجات أعادت كتابة كلام مقطع «رأس يتحدث» وسياقه بعد التعديلات (تقرير مجتمعي، يوليو 2026). هذا التقرير قصصي، لكنه قاعدة إنتاجية مفيدة: إذا كان الحوار أو الموسيقى أو موافقة قانونية تعتمد على المسار الأصلي، فاحتفظ بالصوت الأصلي واعمله بإتقان بشكل منفصل. لا تعتمد تعديلاً مرئيًا مولّدًا لمجرد أن الصور تبدو صحيحة.
سير عمل Gemini Omni Flash 1.1 API: اختر الإدخال والنموذج والتكلفة الصحيحة
اختر الإدخال الذي يحتوي بالفعل على المعلومات التي تحتاجها. النص إلى فيديو للمشاهد الجديدة. الصورة إلى فيديو لمظهر بداية مبني وفق توجيه فني. المرجع إلى فيديو لأداء مصدري يحتاج إلى تغيير محدود بدقة. على Atlas Cloud، يمكن للفرق فتح مسار نموذج Developer ذي الصلة في علامة تبويب واحدة، ومقارنة أوضاع الإدخال، والاحتفاظ بسير عمل نموذجي مشترك عبر Atlas Cloud.
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| المسار | ما يجب إحضاره للتشغيل الأول | الأنسب لـ | الخطأ الشائع في التشغيل الأول | حالة المقال | السعر الابتدائي العام* |
| Text-to-Video Developer | مطالبة نصية | مشهد جديد مستمر | محاولة إعادة إنشاء أداء مصدري محدد | Rube Goldberg | $0.112/ثانية |
| Image-to-Video Developer | من 1 إلى 7 صور مرجعية | تحريك مظهر أو موضوع محدد | تقديم صور مرجعية غير متسقة | تنويع اختياري | $0.112/ثانية |
| Reference-to-Video Developer | فيديو مصدري واحد + حتى 5 صور | الحفاظ على الحركة أثناء تعديل تفصيل محدود | تمرير مقطع أطول من 10 ثوانٍ | القبعات والفقاعات | $0.120/ثانية |
تم التحقق من الأسعار الابتدائية العامة من قائمة Models All في 1 سبتمبر 2026. قد تتغير الدقة والمدة وتفاصيل الدفع، لذا أكّد صفحة النموذج ذات الصلة قبل ميزانية الإصدار. التقدير لمدة 8 ثوانٍ هو السعر × 8، وليس وعدًا عالميًا بالسعر.
بالنسبة للتنويعات القائمة على الصور، يقبل مسار Image-to-Video Developer من 1 إلى 7 صور مرجعية. يقبل مخطط reference-to-video مقطعًا مصدريًا واحدًا يصل إلى خمس صور؛ ويجب ألا يتجاوز مقطع المصدر المقتطع 10 ثوانٍ. استخدم بذرة ثابتة فقط بعد أن تجد فرعًا يستحق التكرار.
مخرج ملاءمة SDK من جوجل هو output_video. أما استجابة REST الخام فتضع محتوى الفيديو داخل مصفوفة steps. هذا التمييز يوفّر عليك خطأ تكامل شائعًا.
plaintext1import { GoogleGenAI } from '@google/genai'; 2import fs from 'node:fs'; 3 4const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY }); 5const interaction = await ai.interactions.create({ 6 model: 'gemini-omni-1.1-flash', 7 input: 'A polished steel marble triggers a tabletop chain reaction.', 8 response_format: { type: 'video', aspect_ratio: '16:9', resolution: '4k' } 9}); 10 11fs.writeFileSync('result.mp4', Buffer.from(interaction.output_video.data, 'base64'));
plaintext1{ 2 "model": "gemini-omni-1.1-flash", 3 "input": "A polished steel marble triggers a tabletop chain reaction.", 4 "response_format": { "type": "video", "aspect_ratio": "16:9", "resolution": "4k" } 5}
الخطوة 1: تعديل الفيديو باستخدام Gemini Omni Flash 1.1 API، تغيير القبعات عند الإيقاع
استخدم مقطعًا مصدريًا صامتًا مدته 10 ثوانٍ وخاليًا من حقوق الطبع، يضم مؤديًا بالغًا واحدًا وكاميرا ثابتة بنسبة 16:9 وثلاث تصفيقات واضحة. ارفع المقطع المصدر وإطاره الأول وثلاث مراجع واضحة للقبعات. لهذا المسار، استخدم بيئة Reference-to-Video Developer التجريبية.
plaintext1Use the uploaded original video as the timing, camera, and performance reference. Preserve the same adult performer, face, body movement, tan jacket, room, framing, shadows, and pacing. At the instant immediately after each completed clap, change only the hat: after clap one, a forest-green knit beanie; after clap two, a cream wide-brim felt hat; after clap three, a red baseball cap. Keep each hat naturally fitted and stable between claps. No cuts, no added people, no text, no captions, no logos, and no changes to the jacket or room. Preserve the silent source audio; do not generate speech or music.
اختر قص المصدر 0-10s، ودقة 16:9، و4K، وبذرة ثابتة فقط لمحاولة مضبوطة لاحقًا. نفّذ متغيرًا واحدًا في كل مرة. إذا انجرفت القبعة، بسّط التغيير قبل إضافة مرجع أقوى.
لقطة ثابتة من الحالة 1. يُظهر الإطار الواضح المحدد القبعة الحمراء النهائية بعد التصفيقة الثالثة، بينما يظل المؤدي والغرفة والكاميرا ثابتين.
اختبار حركة الحالة 1. عبر المقطع الذي تبلغ مدته 10 ثوانٍ، تطلق ثلاث تصفيقات منفصلة حالات القبعة المحبوكة والقبعة واسعة الحواف والقبعة الحمراء في لقطة استوديو واحدة متصلة.
الخطوة 2: تعديل الفيديو باستخدام Gemini Omni Flash 1.1 API، تحويل كائن واحد
استخدم مصدرًا صامتًا مميزًا مدته 10 ثوانٍ: شخص بالغ يقلب تمثالًا سيراميكيًا هندسيًا صغيرًا بجانب نافذة. ارفع فيديو المصدر وإطاره الأول. يبقى الإدخال بسيطًا ليكون لتحويل المادة مهمة واحدة.
plaintext1Use the uploaded video as the exact performance, camera, and lighting reference. Preserve the adult creator, hands, clothing, studio, window light, camera position, and the slow turn of the object. At 2.0 seconds, transform only the small geometric ceramic sculpture into a connected cluster of translucent soap bubbles with realistic reflections and soft iridescent color. The creator continues the same hand motion. Keep the bubbles attached in the same position and scale as the original sculpture. One continuous shot, no cuts, no new objects, no new people, no text, no logos, and no generated speech or music.
اختر قص المصدر 0-10s، و16:9، و4K، وسير العمل نفسه بالبذرة الثابتة كما في الخطوة 1. افحص حافة الكائن عند الانتقال عند الثانية الثانية وفي الثانية الأخيرة. تكشف هاتان اللحظتان ما إذا كان النموذج قد غيّر أكثر من الكائن المطلوب.
لقطة ثابتة من الحالة 2. تتكوّن مجموعة الفقاعات بالكامل بينما تظل يدا الفنان المتحركتان وطاولة العمل وإضاءة النافذة واضحة.
اختبار حركة الحالة 2. يتحول التمثال الهندسي إلى مجموعة فقاعات شفافة عند الإيقاع المطلوب بينما تنزلق الكاميرا جانبيًا عبر الاستوديو المضاء بنور الشمس.
الخطوة 3: النص إلى فيديو عبر Gemini Omni Flash 1.1 API، اختبار تسلسل فيزيائي مستمر
بالنسبة لمشهد جديد، ابدأ بالنص وحده. وهذا يعزل توقيت النموذج وعلاقات الكائنات وتعليمات الكاميرا. استخدم نموذج Text-to-Video Developer لتشغيل مدته 8 ثوانٍ، بدقة 16:9، و4K. ثبّت البذرة فقط بعد أن تحصل على مخرج يستحق إعادة النظر فيه.
plaintext1One continuous 8-second studio shot of a hand-built tabletop Rube Goldberg machine. A polished steel marble rolls from left to right through a wooden track, tips a row of dominoes, releases a small brass lever, rings a bell, and opens a paper flower. Every collision follows believable gravity, weight, momentum, and contact. The camera begins in a close tracking shot with the marble, then smoothly slides sideways to reveal the full chain reaction. Warm morning window light, crisp wood and metal textures, practical workshop setting. No jump cuts, no visible hands, no logos, no captions, no text.
افحص السلسلة الفعلية بدلاً من إطار جذاب واحد. إذا أخطأت الكرة الفولاذية نقطة تلامس، فقصّر التسلسل أو أزل اعتمادًا واحدًا. سلسلة موثوقة من 5 أحداث هي عرض منتج أقوى من تسلسل مزدحم يتعذر قراءة آلياته.
لقطة ثابتة من الحالة 3. يُظهر إطار النهاية المحدد زهرة الورق المفتوحة وسلسلة الطاولة المكتملة.
اختبار حركة الحالة 3. تبدأ الكرة الفولاذية قطع الدومينو، ثم الرافعة والجرس، قبل أن تفتح الزهرة في الثواني الأخيرة. تتحرك الكاميرا جانبيًا لتكشف كل مرحلة بدلاً من الدفع للأمام فقط.
تنويعات Gemini Omni Flash 1.1 API: التمديد والاستيفاء والتكرار بأمان
استخدم التمديد والاستيفاء لحل مشكلة استمرارية محددة، لا لتجنّب مرور أول واضح. تصف جوجل تمديدات بمقدار 10 ثوانٍ ليصل الإجمالي التراكمي إلى 40 ثانية والتحكم في إطار البداية/النهاية في أومني 1.1. وتذكر أيضًا أن مسودات 360p يمكن أن تكون أسرع بنسبة تصل إلى 60% وتكلفتها ثلث تكلفة الطبقة القياسية 720p في المقارنة الخاصة بالإنتاجية. هذه شروط اختبار جوجل، وليست ضمانًا للسرعة على مستوى المنصة.
اعتمد تسلسلًا من مرّتين:
- تحقق من منطق الحركة بدقة مسودة منخفضة حيث يتوفر هذا التحكم فعليًا.
- غيّر متغيرًا واحدًا في كل محاولة: القبعة، أو مادة الفقاعات، أو عبارة كاميرا واحدة.
- أنشئ أصل الإصدار بالدقة المستهدفة فقط بعد أن تصبح الحركة مقروءة بشكل صحيح.
اكتب قيود الحفاظ أولاً: preserve the same performer, camera, room, and timing. ثم سمِّ التحويل الواحد. للقطة مستمرة، اذكر one continuous shot, no cuts. لانتقال من طرف إلى آخر، وفّر إطارًا أول وأخيرًا متعمدين بدلاً من مطالبة النموذج باستنتاج كلتا النقطتين من جملة فضفاضة.
تكلفة Gemini Omni Flash 1.1 API والحقوق وضوابط الإنتاج
احسب ميزانية العمل كسلسلة قرارات، وليس كزر «ولّد مجددًا» غير محدود. وفق الأسعار الابتدائية العامة الموضحة أعلاه، يبلغ تشغيل نصي واحد مدته 8 ثوانٍ حوالي $0.896، وتعديل مرجعي واحد مدته 8 ثوانٍ حوالي $0.960. وبالتالي تبلغ ميزانية المحاولات الثلاث حوالي $2.688 لحالة Rube Goldberg و$2.880 لأي من حالتي التعديل المرجعي، قبل تطبيق سعر دقة أعلى أو SKU مختلف.
افصل في التخطيط الداخلي بين فوترة API، وتسعير الدفع من صفحة المنتج، والحصص المجتمعية أو الخاصة بالحساب. قبل الشراء أو الإطلاق، تحقق من السعر الحالي للدقة والمدة للمسار المحدد. لا تحوّل هذه المقالة عمدًا قائمة السعر الابتدائي إلى عرض سعر دائم بدقة 4K.
استخدم فقط الفيديو والصور المرجعية التي يحق لك رفعها. احصل على إذن من الأشخاص المعروفين، واحتفظ بسجلات المطالبات والمصادر، وسمّ المواد المولّدة في الأماكن التي قد يظن فيها الجمهور أنها لقطات وثائقية. راجع الحوار والموسيقى والعلامات التجارية والصور الشخصية في مسار موافقة مستقل. هذه الضوابط مهمة بقدر شرط preserve في مطالبة Gemini Omni Flash 1.1 API.
الأسئلة الشائعة حول Gemini Omni Flash 1.1 API
ما هو معرّف نموذج Gemini Omni Flash 1.1 API المستقر؟
معرّف نموذج جوجل المستقر الحالي هو gemini-omni-1.1-flash. استخدم وثائق النموذج الحالية وقت التنفيذ لأن أسماء النماذج المستعارة وتوافر المعاينة قد تتغير.
هل gemini-omni-flash-preview في طور الإهمال؟
تعامل مع اسم المعاينة كمسار إصدار منفصل. تأكد من إشعار الإهمال الحالي في وثائق نماذج جوجل قبل تثبيته في الإنتاج، ثم استخدم المعرّف المستقر عندما يطابق قدراتك المطلوبة.
هل يمكن لـ Gemini Omni Flash 1.1 تعديل فيديو موجود؟
نعم. يرفع سير العمل الموثق فيديو عبر Files API ويقدم تعليمات التحرير. أبقِ مقطع المصدر قصيرًا واذكر كل عنصر يجب أن يظل دون تغيير.
ما المدة التي يمكن أن يصل إليها فيديو Gemini Omni Flash 1.1 API؟
تغطي أمثلة التوليد القياسية مقاطع قصيرة، بينما يمكن لأومني 1.1 التمديد بزيادات قدرها 10 ثوانٍ حتى إجمالي تراكمي يبلغ 40 ثانية. يجب أن يكون قص المصدر في Atlas المرجعي للنص إلى فيديو 10 ثوانٍ أو أقل في مسار Developer الموثق حاليًا.
هل يمكنه الحفاظ على الحوار والمسار الصوتي الأصلي؟
استخدم تعليمات الحفاظ البصري، ثم تحقق من الصوت بشكل مستقل. بالنسبة لمقطع يكون فيه الحوار الدقيق أو الموسيقى مهمًا، احمل المسار الأصلي المعتمد عبر مرحلة ما بعد الإنتاج بدلاً من التعامل مع المخرج المولّد كماجستير صوتي تلقائي.
كم تبلغ تكلفة Gemini Omni Flash 1.1 API؟
تعتمد التكلفة على المسار والمدة والدقة وسطح الفوترة. بالنسبة لسير عمل Gemini Omni Flash 1.1 API، احسب الثواني × معدل المسار المعروض حاليًا، ثم احجز 3 محاولات على الأقل لأي لقطة حرجة الحركة.






