ผู้ใหญ่คนหนึ่งปรบมือสามครั้งในคลิปเงียบและกล้องนิ่ง หลังการปรบแต่ละครั้ง มีเพียงหมวกที่เปลี่ยนไป ผู้แสดง เสื้อแจ็คเก็ต ห้อง แสง และจังหวะเวลาคงที่ นี่คือคำมั่นเชิงปฏิบัติที่นักพฒนากำลังทดสอบกับ gemini omni flash 1.1 api
ส่วนที่ยากไม่ใช่การส่งคำขอวิดีโอครั้งเดียว แต่คือการเปลี่ยน “เปลี่ยนสิ่งนี้เพียงอย่างเดียว” ให้เป็นโหมดอินพุตที่ถูกต้อง พร้อมท์ที่มีข้อจำกัดเพียงพอ และงบประมาณที่เหลือพื้นที่สำหรับการทำซ้ำ บิลด์สามรายการด้านล่างเน้นที่การส่งต่องานนั้น ได้แก่ การแก้ไขหมวกตามจังหวะเหตุการณ์ การแก้ไขวัสดุของวัตถุชิ้นเดียว และซีเควนซ์ฟิสิกส์ที่ใช้ข้อความล้วน
Gemini Omni 1.1 Flash คืืออัปเดตการสร้างงวิดีโอที่พร้อมใช้งานจริงของ Google รองรับอินพุตแบบข้อความ รูปภาพ และวิดีโอที่อัปโหลด ขณะที่ Interactions API รองรับสถานะแบบวนซ้ำผ่าน ID การโต้ตอบก่อนหน้า ตัวควบคุมเอาต์พุตที่บันทึกไว้ประกอบด้วย 360p, 720p, 1080p และ 4K ในรูปแบบเฟรม 16:9 หรือ 9:16 (เอกสาร Google Gemini Omni, กันยายน 2026)
ประเด็นสำคัญ
- ID โมเดล Google ที่เสถียร:
gemini-omni-1.1-flash- เลือกเส้นทางอินพุตก่อนเขียนพร้อมท์
- เก็บเซ็กเมนต์ต้นฉบับสำหรับการแก้ไขอ้างอิงให้อยู่ที่ 10 วินาทีหรือน้อยกว่า
- ปฏิบัติต่อบทสนทนาสำคัญเป็นงานอนุมัติเสียงแยกต่างหาก
ทำไม Gemini Omni Flash 1.1 API ถึงมาแรง และทำไมรันครั้งแรกถึงล้มเหลว
Omni 1.1 กำลังได้รับความสนใจเพราะรวมการสร้างงเข้กับการแก้ไขและการควบคุมการต่อเนื่อง Google ระบุว่าอัปเดตนี้สามารถขย้าฉฉากเป็นช่วง 10 วินาทีจนถึง 40 วินาที แทรกระหว่างเฟรมแรกและเฟรมสุดท้าย สร้างงพรีวิว 360p และอัปสเกลเป็น 4K (ประกาศ Google Omni 1.1, สิงหาคม 2026) ตัวควบคุมเหล่านี้สำคัญต่อทีมผลิตภัณฑ์ที่สร้างโปรแกรมตัดต่อ SaaS เชิงสร้า้งสรรค์ หรือเครื่องมืือการตลาดแบบสั้น
รันครั้งแรกมักล้มเหลวด้วยเหตุผลที่ง่ายกว่า:
- เส้นทาง text-to-video ถูกขอให้รักษาการแสดงที่มีอยู่
- การแก้ไขขอวัตถุใหม่โดยไม่มีข้อมูลอ้างอิงชัดเจนหรือคำอธิบายภาพที่เฉพาะเจาะจง
- พร้อมท์เดียวเปลี่ยนนักแสดง กล้อง เสื้อผ้า ฉาก และวัตถุในครั้งเดียว
- คลิปต้นฉบับที่ยาวซ่อนจังหวะที่แท้จริ่งที่ควรกระตุ้นการแก้ไข
เริ่มต้นด้วยการตัดสินใจว่าสิ่งใดต้องคงที่ไม่เปลี่ยนแปลง ในกรณีหมวก นักแสดง กล้อง ห้อง แจ็คเก็ต เงา และจังหวะการปรบมือเป็นตัวแปรคงที่ หมวกเป็นตัวแปรเดียวที่เปลี่ยน กรณีประติมากรรมฟองสบู่ใช้แนวคิดเดียวกัน แต่ล็อกผู้สร้างและแสงจากหน้าต่างไว้ ขณะที่เปลี่ยนวัสดุของวัตถุหนึ่งชิ้น
ความต่อเนื่องของภาพและความต่อเนื่องของเสียงต้องใช้การตรวจสอบการยอมรับที่แตกต่างกัน ผู้ใช้ Reddit รายหนึ่งอธิบายผลลัพธ์ที่เขียนบทพูดและบริบทของคลิปพูดหน้าตรงใหม่หลังการแก้ไข (รายงานจากชุมชน, กรกฎาคม 2026) รายงานนั้นเป็นประสบการณ์ส่วนตัว แต่ก็เป็นกฎการผลิตที่มีประโยชน์: หากบทสนทนา เพลง หรือการอนุมัติทางกฎหมายขึ้นอยู่กับแทร็กต้นฉบับ ให้เก็บรักษาและมาสเตอร์เสียงต้นฉบับแยกต่างหาก อย่าอนุมัติการแก้ไขภาพที่สร้างขึ้นเพียงเพราะภาพดูถูกต้อง
เวิร์กโฟลว์ Gemini Omni Flash 1.1 API: เลือกอินพุต โมเดล และต้นทุนที่ถูกต้อง
เลือกอินพุตที่มีข้อมูลที่คุณต้องการอยู่แล้ว Text-to-video สำหรับฉากใหม่ Image-to-video สำหรับลุคเริ่มต้นที่มีทิศทางอาร์ต Reference-to-video สำหรับการแสดงต้นฉบับที่ต้องการการเปลี่ยนแปลงอย่างมีขอบเขต บน Atlas Cloud ทีมสามารถเปิดเส้นทางโมเดล Developer ที่เกี่ยวข้องในแท็บเบราว์เซอร์เดียว เปรียบเทียบโหมดอินพุต และรักษาเวิร์กโฟลว์โปรโตไทป์ทั่วไปผ่าน Atlas Cloud
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| เส้นทาง | สิ่งที่นำใส่ในรันแรก | เหมาะที่สุด | ข้อผิดพลาดทั่วไปในรันแรก | กรณีในบทความ | อัตราเริ่มต้นสาธารณะ* |
| Text-to-Video Developer | พร้อมท์ข้อความ | ฉากใหม่ต่อเนื่อง | การพยายามสร้างการแสดงต้นฉบับเฉพาะขึ้นมาใหม่ | Rube Goldberg | $0.112/sec |
| Image-to-Video Developer | รูปภาพอ้างอิง 1-7 รูป | ทำให้ลุคหรือหัวเรื่องที่กำหนดไว้เคลื่อนไหว | การส่งรูปภาพอ้างอิงที่ไม่สอดคล้องกัน | การเปลี่ยนแปลงทางเลือก | $0.112/sec |
| Reference-to-Video Developer | วิดีโอต้นฉบับ 1 รายการบวกรูปภาพสูงสุด 5 รูป | รักษาการกระทำไว้ขณะแก้ไขรายละเอียดที่มีขอบเขต | การส่งคลิปที่ตัดแต่งยาวเกิน 10 วินาที | หมวกและฟองสบู่ | $0.120/sec |
อัตราเริ่มต้นสาธารณะถูกตรวจสอบกับรายการ Models All เมื่อวันที่ 1 กันยายน 2026 ความละเอียด ระยะเวลา และรายละเอียดการชำระเงินสามารถเปลี่ยนแปลงได้ ดังนั้นโปรดยืนยันหน้าโมเดลที่เกี่ยวข้องก่อนกำหนดงบประมาณเผยแพร่ ประมาณการ 8 วินาทีคืออัตรา × 8 ไม่ใช่คำมั่นสัญญาด้านราคาสากล
สำหรับรูปแบบที่นำโดยรูปภาพ เส้นทาง Image-to-Video Developer รองรับรูปภาพอ้างอิง 1-7 รูป สคีมา reference-to-video รองรับคลิปต้นฉบับหนึ่งรายการบวกรูปภาพสูงสุดห้ารูป คลิปต้นฉบับที่ตัดแต่งแล้วต้องไม่เกิน 10 วินาที ใช้ seed แบบคงที่หลังจากคุณพบสาขาที่คุ้มค่าจะวนซ้ำเท่านั้น
เอาต์พุตสะดวกของ SDK ของ Google คือ output_video ขณะที่การตอบสนอง REST ดิบจะวางเนื้อหาวิดีโอไว้ในอาร์เรย์ steps ความแตกต่างนี้ช่วยหลีกเลี่ยงข้อผิดพลาดการผสานรวมที่พบบ่อย
plaintext1import { GoogleGenAI } from '@google/genai'; 2import fs from 'node:fs'; 3 4const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY }); 5const interaction = await ai.interactions.create({ 6 model: 'gemini-omni-1.1-flash', 7 input: 'A polished steel marble triggers a tabletop chain reaction.', 8 response_format: { type: 'video', aspect_ratio: '16:9', resolution: '4k' } 9}); 10 11fs.writeFileSync('result.mp4', Buffer.from(interaction.output_video.data, 'base64'));
plaintext1{ 2 "model": "gemini-omni-1.1-flash", 3 "input": "A polished steel marble triggers a tabletop chain reaction.", 4 "response_format": { "type": "video", "aspect_ratio": "16:9", "resolution": "4k" } 5}
ขั้นตอนที่ 1: การแก้ไขวิดีโอ Gemini Omni Flash 1.1 API เปลี่ยนหมวกตามจังหวะ
ใช้คลิปต้นฉบับเสียงเงียบที่มีลิขสิทธิ์ชัดเจน ยาว 10 วินาที ประกอบด้วยผู้ใหญ่หนึ่งคน กล้อง 16:9 นิ่ง และเสียงปรบมือชัดเจนสามครั้ง อัปโหลดคลิปต้นฉบับ เฟรมแรก และภาพอ้างอิงหมวกชัดเจนสามภาพ สำหรับเส้นทางนี้ ใช้ เพลย์กราวด์ Reference-to-Video Developer
plaintext1Use the uploaded original video as the timing, camera, and performance reference. Preserve the same adult performer, face, body movement, tan jacket, room, framing, shadows, and pacing. At the instant immediately after each completed clap, change only the hat: after clap one, a forest-green knit beanie; after clap two, a cream wide-brim felt hat; after clap three, a red baseball cap. Keep each hat naturally fitted and stable between claps. No cuts, no added people, no text, no captions, no logos, and no changes to the jacket or room. Preserve the silent source audio; do not generate speech or music.
เลือกตัดต้นฉบับ 0-10s, 16:9, 4K และใช้ seed แบบคงที่เฉพาะสำหรับการลองซ้ำที่มีการควบคุมในภายหลัง รันทีละหนึ่งตัวแปร หากหมวกคลาดเคลื่อน ให้ลดความซับซ้อนของการเปลี่ยนแปลงก่อนเพิ่มข้อมูลอ้างอิงที่แข็งแรงขึ้น
คีย์เฟรมกรณีเปลี่ยนหมวกของ Gemini Omni Flash
ภาพนิ่งกรณีที่ 1 เฟรมคมชัดที่เลือกแสดงหมวกแก๊ปสีแดงสุดท้ายหลังการปรบครั้งที่สาม ขณะที่นักแสดง ห้อง และกล้องคงที่
กรณีการเคลื่อนไหวการเปลี่ยนหมวก Gemini Omni Flash
การทดสอบการเคลื่อนไหวกรณีที่ 1 ตลอดคลิป 10 วินาที การปรบมือสามครั้งที่แยกจากกันกระตุ้นสภาวะหมวกบีนนี่ หมวกปีกกว้าง และหมวกแก๊ปสีแดงในช็อตสตูดิโอต่อเนื่องหนึ่งช็อต
ขั้นตอนที่ 2: การแก้ไขวิดีโอ Gemini Omni Flash 1.1 API เปลี่ยนวัตถุหนึ่งชิ้น
ใช้คลิปต้นฉบับเงียบยาว 10 วินาทีที่แตกต่างกัน: ผู้ใหญ่หมุนประติมากรรมเซรามิกเรขาคณิตขนาดเล็กข้างหน้าต่าง อัปโหลดวิดีโอต้นฉบับและเฟรมแรก อินพุตคงความเรียบง่ายเพื่อให้การเปลี่ยนแปลงวัสดุมีหน้าที่เดียว
plaintext1Use the uploaded video as the exact performance, camera, and lighting reference. Preserve the adult creator, hands, clothing, studio, window light, camera position, and the slow turn of the object. At 2.0 seconds, transform only the small geometric ceramic sculpture into a connected cluster of translucent soap bubbles with realistic reflections and soft iridescent color. The creator continues the same hand motion. Keep the bubbles attached in the same position and scale as the original sculpture. One continuous shot, no cuts, no new objects, no new people, no text, no logos, and no generated speech or music.
เลือกตัดต้นฉบับ 0-10s, 16:9, 4K และใช้เวิร์กโฟลว์ seed แบบคงที่เดียวกับขั้นตอนที่ 1 ตรวจสอบขอบวัตถุที่ช่วงเปลี่ยนสองวินาทีและวินาทีสุดท้าย ช่วงเวลาเหล่านั้นเผยให้เห็นว่าโมเดลเปลี่ยนมากกว่าวัตถุที่ขอหรือไม่
คีย์เฟรมกรณีประติมากรรมฟองสบู่ของ Gemini Omni Flash
ภาพนิ่งกรณีที่ 2 กลุ่มฟองสบู่ก่อตัวเต็มที่ ขณะที่มือที่หมุนของศิลปิน โต๊ะทำงาน และแสงจากหน้าต่างยังคงมองเห็นชัดเจน
กรณีการเคลื่อนไหวประติมากรรมฟองสบู่ Gemini Omni Flash
การทดสอบการเคลื่อนไหวกรณีที่ 2 ประติมากรรมเรขาคณิตเปลี่ยนเป็นกลุ่มฟองสบู่โปร่งแสงที่จังหวะที่ขอ ขณะที่กล้องเลื่อนไปด้านข้างผ่านสตูดิโอที่แสงแดดส่อง
ขั้นตอนที่ 3: Gemini Omni Flash 1.1 API Text-to-Video ทดสอบซีเควนซ์ฟิสิกส์ต่อเนื่อง
สำหรับฉากใหม่ ให้เริ่มจากข้อความเพียงอย่างเดียว สิ่งนี้แยกจังหวะเวลา ความสัมพันธ์ของวัตถุ และคำสั่งกล้องของโมเดล ใช้ โมเดล Text-to-Video Developer สำหรับรัน 8 วินาที 16:9 4K กำหนด seed หลังจากคุณมีเอาต์พุตที่คุ้มค่าจะกลับมาดูเท่านั้น
plaintext1One continuous 8-second studio shot of a hand-built tabletop Rube Goldberg machine. A polished steel marble rolls from left to right through a wooden track, tips a row of dominoes, releases a small brass lever, rings a bell, and opens a paper flower. Every collision follows believable gravity, weight, momentum, and contact. The camera begins in a close tracking shot with the marble, then smoothly slides sideways to reveal the full chain reaction. Warm morning window light, crisp wood and metal textures, practical workshop setting. No jump cuts, no visible hands, no logos, no captions, no text.
ตรวจสอบห่วงโซ่จริงมากกว่าเฟรมสวยเพียงเฟรมเดียว หากลูกหินพลาดการสัมผัส ให้ลดความยาวซีเควนซ์หรือนำการพึ่งพาออกหนึ่งรายการ ห่วงโซ่ 5 เหตุการณ์ที่เชื่อถือได้เป็นเดโมผลิตภัณฑ์ที่แข็งแกร่งกว่าซีเควนซ์ที่แน่นเกินไปซึ่งกลไกไม่สามารถอ่านได้
คีย์เฟรมกรณี Rube Goldberg ของ Gemini Omni Flash
ภาพนิ่งกรณีที่ 3 เฟรมจบที่เลือกแสดงดอกไม้กระดาษที่เปิดออกและห่วงโซ่บนโต๊ะที่เสร็จสมบูรณ์
GIF ปฏิกิริยาลูกโซ่ Rube Goldberg แบบ text-to-video ของ Gemini Omni Flash
การทดสอบการเคลื่อนไหวกรณีที่ 3 ลูกหินเริ่มชนโดมิโน จากนั้นคันโยกและระฆัง ก่อนที่ดอกไม้จะเปิดในวินาทีสุดท้าย กล้องเคลื่อนไปด้านข้างเพื่อเผยให้เห็นแต่ละขั้นตอนแทนที่จะค่อยๆ ดันเข้าไป
รูปแบบ Gemini Omni Flash 1.1 API: ขยาย แทรก และวนซ้ำอย่างปลอดภัย
ใช้การขยายและการแทรกเพื่อแก้ปัญหาความต่อเนื่องเฉพาะ ไม่ใช่เพื่อหลีกเลี่ยงรอบแรกที่ชัดเจน Google อธิบายการขยาย 10 วินาทีจนถึงยอดรวมสะสม 40 วินาทีและการควบคุมเฟรมเริ่มต้น/สิ้นสุดใน Omni 1.1 และยังรายงานว่าแบบร่าง 360p อาจเร็วขึ้นถึง 60% และมีต้นทุนหนึ่งในสามของระดับ 720p มาตรฐานในการเปรียบเทียบปริมาณงานของตัวเอง เงื่อนไขเหล่านั้นเป็นเงื่อนไขการทดสอบของ Google ไม่ใช่การรับประกันความเร็วทั้งแพลตฟอร์ม
นำซีเควนซ์สองรอบมาใช้:
- ตรวจสอบตรรกะการเคลื่อนไหวที่ความละเอียดร่างต่ำซึ่งตัวควบคุมนั้นพร้อมใช้งานจริง
- เปลี่ยนหนึ่งตัวแปรต่อการลองใหม่: หมวก วัสดุฟองสบู่ หรือวลีกล้องหนึ่งวลี
- สร้างแอสเซ็ตเผยแพร่ที่ความละเอียดเป้าหมายหลังจากที่การกระทำอ่านได้ถูกต้องเท่านั้น
เขียนข้อจำกัดการรักษาไว้ก่อน: preserve the same performer, camera, room, and timing จากนั้นระบุการเปลี่ยนแปลงเพียงหนึ่งอย่าง สำหรับช็อตต่อเนื่อง ให้ระบุ one continuous shot, no cuts สำหรับการเปลี่ยนแบบครบวงจร ให้กำหนดเฟรมแรกและเฟรมสุดท้ายอย่างจงใจ แทนที่จะขอให้โมเดลอนุมานทั้งสองจุดจากประโยคหลวมๆ
ต้นทุน สิทธิ และการ์ดเรลการผลิตของ Gemini Omni Flash 1.1 API
จัดงบประมาณงานเป็นลำดับการตัดสินใจ ไม่ใช่ปุ่ม “สร้างอีกครั้ง” ที่ไม่จำกัด ที่อัตราเริ่มต้นสาธารณะที่แสดงด้านบน การรันข้อความ 8 วินาทีหนึ่งครั้งอยู่ที่ประมาณ $0.896 และการแก้ไขอ้างอิง 8 วินาทีหนึ่งครั้งอยู่ที่ประมาณ $0.960 ดังนั้นงบประมาณสามครั้งจึงอยู่ที่ประมาณ $2.688 สำหรับกรณี Rube Goldberg และ $2.880 สำหรับกรณีแก้ไขอ้างอิงแต่ละกรณี ก่อนที่อัตราความละเอียดสูงขึ้นหรือ SKU ผลิตภัณฑ์อื่นจะคิดเพิ่ม
แยกการเรียกเก็บเงิน API ราคาชำระเงินบนหน้าผลิตภัณฑ์ และโควตาชุมชนหรือบัญชีออกจากกันในการวางแผนภายใน ก่อนซื้อหรือเปิดตัว ให้ตรวจสอบราคาความละเอียดและระยะเวลาปัจจุบันของเส้นทางที่เลือก บทความนี้จงใจไม่เปลี่ยนรายการอัตราเริ่มต้นให้เป็นราคา 4K ถาวร
ใช้วิดีโอและรูปภาพอ้างอิงที่คุณมีสิทธิ์อัปโหลดเท่านั้น ขออนุญาตจากบุคคลที่จำได้ เก็บบันทึกพรอมต์และต้นฉบับ และติดป้ายกำกับวัสดุที่สร้างขึ้นในจุดที่ผู้ชมอาจเข้าใจผิดว่าเป็นฟุตเทจสารคดี ทบทวนบทสนทนา เพลง เครื่องหมายการค้า และภาพเหมือนในการอนุมัติแยกต่างหาก การ์ดเรลเหล่านี้สำคัญพอๆ กับส่วนคำสั่ง preserve ในพรอมต์ Gemini Omni Flash 1.1 API
คำถามที่พบบ่อย Gemini Omni Flash 1.1 API
ID โมเดล Gemini Omni Flash 1.1 API ที่เสถียรคืออะไร
ID โมเดลเสถียรปัจจุบันของ Google คือ gemini-omni-1.1-flash ใช้เอกสารโมเดลปัจจุบันในเวลาที่นำไปใช้งาน เนื่องจากนามแฝงโมเดลและความพร้อมใช้งานของพรีวิวสามารถเปลี่ยนแปลงได้
gemini-omni-flash-preview กำลังถูกเลิกใช้งานหรือไม่
ปฏิบัติกับชื่อพรีวิวเป็นแทร็กเผยแพร่แยกต่างหาก ยืนยันประกาศการเลิกใช้งานปัจจุบันในเอกสารโมเดลของ Google ก่อนผูกไว้ในโปรดักชัน จากนั้นใช้ ID เสถียรเมื่อตรงกับความสามารถที่คุณต้องการ
Gemini Omni Flash 1.1 แก้ไขวิดีโอที่มีอยู่ได้หรือไม่
ได้ เวิร์กโฟลว์ที่บันทึกไว้อัปโหลดวิดีโอผ่าน Files API และให้คำแนะนำการแก้ไข เก็บเซ็กเมนต์ต้นฉบับให้สั้นและระบุทุกองค์ประกอบที่ต้องคงที่ไม่เปลี่ยนแปลง
วิดีโอ Gemini Omni Flash 1.1 API ยาวได้เท่าใด
ตัวอย่างการสร้างมาตรฐานครอบคลุมคลิปสั้น ขณะที่ Omni 1.1 สามารถขยายเป็นช่วง 10 วินาทีจนถึงยอดรวมสะสม 40 วินาที คลิปต้นฉบับ reference-to-video ของ Atlas ต้องมีความยาว 10 วินาทีหรือน้อยกว่าบนเส้นทาง Developer ที่บันทึกไว้ในปัจจุบัน
มันสามารถรักษาบทสนทนาและแทร็กเสียงต้นฉบับได้หรือไม่
ใช้คำแนะนำการรักษาภาพ จากนั้นตรวจสอบเสียงแยกกัน สำหรับคลิปที่บทสนทนาหรือเพลงที่แม่นยำสำคัญ ให้นำแทร็กต้นฉบับที่อนุมัติแล้วผ่านขั้นตอนหลังการผลิต แทนที่จะถือว่าเอาต์พุตที่สร้างขึ้นเป็นมาสเตอร์เสียงอัตโนมัติ
Gemini Omni Flash 1.1 API ราคาเท่าใด
ต้นทุนขึ้นอยู่กับเส้นทาง ระยะเวลา ความละเอียด และพื้นผิวการเรียกเก็บเงิน สำหรับเวิร์กโฟลว์ Gemini Omni Flash 1.1 API ให้คำนวณวินาที × อัตราเส้นทางที่แสดงในปัจจุบัน จากนั้นสำรองอย่างน้อย 3 ครั้งสำหรับช็อตที่สำคัญต่อการเคลื่อนไหว






