API ของ gemini omni นำตระกูล Gemini Omni Flash แบบมัลติโมดัลโดยกำเนิดจาก Google DeepMind ซึ่งรวมถึง Gemini Omni 1.1 Flash มาสู่นักพัฒนา สร้างวิดีโอสไตล์ภาพยนตร์พร้อมเสียงเนทีฟที่ซิงโครไนซ์กัน ทำให้ภาพนิ่งเคลื่อนไหวได้ด้วยการควบคุมเฟรมเริ่มต้นและเฟรมสิ้นสุดอย่างแม่นยำ หรือปรับแก้ฟุตเทจที่มีอยู่ผ่านการแก้ไขด้วยคำสั่งข้อความ โดยยังคงรักษาเนื้อหาที่ไม่ได้แก้ไขไว้ Atlas Cloud มอบคีย์เดียวที่เข้ากันได้กับ OpenAI การเข้าถึงแบบรวมศูนย์ และราคาที่โปร่งใสโดยคิดค่าบริการตามการใช้งาน เริ่มพัฒนาได้วันนี้
Gemini Omni Flash พัฒนาโดย Google โดย Atlas Cloud (ดำเนินการโดย Atlas Cloud AI LLC) เป็นผู้ให้บริการเข้าถึงโมเดลนี้ แต่ไม่ได้เป็นเจ้าของโมเดล เครื่องหมายการค้าทั้งหมดเป็นของเจ้าของที่เกี่ยวข้อง
Atlas Cloud มอบโมเดลสร้างสรรค์ล่าสุดที่นำหน้าในอุตสาหกรรมให้กับคุณ
เปรียบเทียบเส้นทางสำหรับข้อความ รูปภาพ ข้อมูลอ้างอิง การแก้ไข และการต่อขยายของ Gemini Omni Flash และ Gemini Omni 1.1 Flash ก่อนเลือก endpoint ที่เหมาะสม
| โมดัลลิตี | คำอธิบาย |
|---|---|
| Gemini Omni Flash Reference-to-Video API (R2V) | รวมพรอมต์ข้อความกับภาพอ้างอิงหนึ่งถึงห้าภาพเพื่อสร้างวิดีโอแบบภาพยนตร์พร้อมเสียงในตัว การรักษาความสอดคล้องของตัวแบบ ฉาก และสไตล์ ทำให้ endpoint นี้เหมาะสำหรับลำดับภาพที่มีแบรนด์และตัวละครที่ปรากฏซ้ำ |
| Gemini Omni Flash Image-to-Video API (I2V) | เริ่มจากภาพนิ่งและพรอมต์ข้อความ endpoint นี้จะสร้างวิดีโอแบบภาพยนตร์พร้อมเสียง โดยคงตัวแบบและองค์ประกอบของภาพต้นฉบับไว้ ใช้สำหรับทำให้ภาพถ่ายสินค้า ภาพบุคคล หรือแนวคิดภาพเคลื่อนไหว |
| Gemini Omni Flash Video Edit API | ส่งคำสั่งข้อความและภาพอ้างอิงเพิ่มเติม (ถ้ามี) ให้กับวิดีโอที่มีอยู่ เพื่อปรับเปลี่ยนฉากให้สอดคล้องกันพร้อมเสียงในตัว ฟุตเทจที่ไม่ได้แตะต้องจะยังคงเดิม รองรับการแก้ไขหลังการถ่ายทำและการอัปเดตภาพเฉพาะจุด |
| Gemini Omni Flash Text-to-Video API (T2V) | จากพรอมต์ข้อความเพียงอย่างเดียว endpoint จะสร้างวิดีโอแบบภาพยนตร์พร้อมเสียงในตัวที่ซิงโครไนซ์และการเคลื่อนไหวที่อิงหลักฟิสิกส์ การสร้างที่ควบคุมได้และความเร็วสูงเหมาะสำหรับการสร้างภาพแนวคิด พัฒนาเรื่องราว และสร้างต้นแบบวิดีโออย่างรวดเร็ว |
| Gemini Omni Flash Reference-to-Video Developer API | ใช้พรอมต์ข้อความและภาพอ้างอิงเพื่อแปลงคลิปวิดีโอที่มีอยู่ผ่านการถ่ายโอนสไตล์ การแก้ไขฉาก หรือการแทรกตัวละคร Developer endpoint นี้เหมาะกับเครื่องมือสร้างสรรค์ที่ต้องการสร้างรูปแบบต่าง ๆ ของฟุตเทจที่ผู้ใช้ป้อนอย่างมีแนวทาง |
| Gemini Omni Flash Image-to-Video Developer API | เมื่ออัตลักษณ์ทางภาพมีความสำคัญ ให้รวมพรอมต์ข้อความกับภาพอ้างอิงสูงสุดเจ็ดภาพเพื่อสร้างวิดีโอที่คงความสอดคล้องของตัวแบบ เวิร์กโฟลว์นี้รองรับตัวละครที่ปรากฏซ้ำ ภาพแคตตาล็อก และแอสเซ็ตแคมเปญที่มีความเป็นหนึ่งเดียว |
| Gemini Omni Flash Text-to-Video Developer API | เลือกพรอมต์ข้อความ ความละเอียด อัตราส่วนภาพ และระยะเวลาเพื่อสร้างวิดีโอแบบภาพยนตร์ที่ควบคุมได้ การตั้งค่าเอาต์พุตที่ยืดหยุ่นช่วยให้นักพัฒนาเตรียมคอนเทนต์เฉพาะแพลตฟอร์ม ทดสอบแนวทางสร้างสรรค์ และสร้างเวิร์กโฟลว์การสร้างอัตโนมัติ |
| Gemini Omni 1.1 Flash Video Extend API | ต่อคลิปที่มีอยู่ด้วยส่วนขยายที่เข้ากันได้อย่างไร้รอยต่อ ความยาวสามถึงสิบวินาที และคงเสียงในตัวไว้ สามารถต่อส่วนขยายแบบต่อเนื่องเพื่อสร้างช็อตเดียวที่สอดคล้องกันยาวสูงสุดสี่สิบวินาที สำหรับฉากที่ยาวขึ้นหรือแอ็กชันต่อเนื่อง |
| Gemini Omni 1.1 Flash Video Edit API | ขอให้เพิ่ม ลบ แทนที่ หรือปรับเปลี่ยนสไตล์ด้วยการส่งวิดีโอที่มีอยู่และคำสั่งข้อความให้ endpoint ระบบจะคงเนื้อหาและเสียงในตัวที่ไม่ได้ระบุให้เปลี่ยนไว้ ทำให้แก้ไขได้อย่างแม่นยำโดยไม่ต้องสร้างฉากทั้งหมดใหม่ |
| Gemini Omni 1.1 Flash Reference-to-Video API (R2V) | ส่งพรอมต์ข้อความพร้อมภาพอ้างอิงสูงสุดสิบภาพและคลิปวิดีโออ้างอิงสามคลิปเพื่อสร้างวิดีโอแบบภาพยนตร์พร้อมเสียงในตัว ความสอดคล้องของตัวละคร สินค้า และทิศทางศิลป์ รองรับคอนเทนต์แบบซีรีส์และแคมเปญที่ประสานงานกัน |
| Gemini Omni 1.1 Flash Image-to-Video API (I2V) | ทำให้ภาพนิ่งกลายเป็นคลิปแบบภาพยนตร์พร้อมเสียงในตัว โดยมีข้อความเป็นตัวกำกับ เฟรมสุดท้ายที่ระบุเพิ่มเติมช่วยควบคุมจุดจบของช็อตได้อย่างแม่นยำ ทำให้ endpoint นี้เหมาะสำหรับทรานซิชันที่วางแผนไว้และการเปิดตัวสินค้า |
| Gemini Omni 1.1 Flash Text-to-Video API (T2V) | เปลี่ยนพรอมต์ข้อความหนึ่งรายการให้เป็นคลิปแบบภาพยนตร์พร้อมเสียงในตัวที่ซิงโครไนซ์ โดยควบคุมระยะเวลา อัตราส่วนภาพ และความละเอียดได้ เอาต์พุตตั้งแต่ฉบับร่าง 360p ไปจนถึง 4K รองรับทั้งการพรีวิวอย่างรวดเร็วและการส่งมอบความละเอียดสูงจาก endpoint เดียว |
คำขอ Gemini Omni Flash API แต่ละครั้งสามารถรับข้อความ รูปภาพ วิดีโอ และเสียงในสัดส่วนใดก็ได้ สร้างเสียงที่ซิงโครไนซ์ จำลองฟิสิกส์ของโลกจริง และปรับแต่งผลลัพธ์ต่อผ่านการสนทนา

ปรับแต่งคลิปด้วยภาษาธรรมชาติ แล้ว Gemini Omni Flash API จะนำการเปลี่ยนแปลงไปใช้โดยคงส่วนอื่นของฉากไว้ Interactions API แบบมีสถานะจะจดจำการโต้ตอบแต่ละรอบ ทำให้การแก้ไขต่อยอดกันได้

Gemini Omni Flash API รับข้อความ รูปภาพ วิดีโอ และเสียงในรูปแบบผสมใดก็ได้ภายในพรอมต์เดียว อินพุตจากแหล่งใดก็ได้นี้ช่วยให้คุณสร้างงานจากสื่อต้นฉบับที่มีอยู่แล้วได้โดยตรง

ระบบสร้างเสียงพร้อมภาพในการอนุมานครั้งเดียว ทำให้บทสนทนา เอฟเฟกต์ และเสียงบรรยากาศสอดคล้องกับการเคลื่อนไหว Gemini Omni Flash API จึงไม่ต้องใช้ขั้นตอนสร้างเสียงแยกต่างหากภายหลัง

ด้วยพื้นฐานจากแบบจำลองฟิสิกส์ของโลกจริง Gemini Omni Flash API จึงเรนเดอร์เงาสะท้อน แรงโน้มถ่วง แสง และสภาพอากาศได้อย่างน่าเชื่อถือ ฉากยังคงความต่อเนื่องทางภาพแทนที่จะค่อย ๆ เกิดสิ่งผิดเพี้ยน แม้ในช็อตที่มีการเคลื่อนไหวมาก

กำกับการสร้างงานด้วยภาพอ้างอิงได้สูงสุดเจ็ดภาพและคลิปวิดีโอสั้นสามคลิป โดย Gemini Omni Flash API จะรักษาความสอดคล้องของตัวแบบ สไตล์ และฉากไว้ วิธีนี้ช่วยให้เอกลักษณ์ของตัวแบบคงที่ตลอดการแก้ไขและแต่ละช็อต
วิดีโอจากพรอมต์เดียวกันที่สร้างโดย Gemini Omni และโมเดลวิดีโอชั้นนำอื่น ๆ: หลายช็อตและภาพยนตร์โฆษณาระดับไฮเอนด์
สร้างวิดีโอต่อเนื่อง 3 ฉาก: ฉากที่ 1: ผู้หญิงยืนอยู่ใต้แสงนีออนบนถนนที่มีฝนตกในโตเกียว เงาสะท้อนบนพื้นเปียก ให้มิติความลึกแบบภาพยนตร์ พร้อมการเคลื่อนกล้องแบบถือด้วยมือ ฉากที่ 2: กล้องค่อย ๆ เปลี่ยนเป็นภาพระยะใกล้ขึ้น เธอพูดเบา ๆ ให้ตรงจังหวะกับเสียงที่ให้มา โดยการขยับริมฝีปากตรงกันอย่างสมบูรณ์ การจราจรด้านหลังดำเนินต่อไปอย่างไร้รอยต่อ ฉากที่ 3: เธอเดินเข้าสถานีรถไฟใต้ดิน สภาพแวดล้อมยังคงสอดคล้องกันทั้งด้านแสง สภาพอากาศ และอารมณ์ กล้องติดตามเธอจากด้านหลัง โดยคงความสอดคล้องของอัตลักษณ์บุคคล ข้อจำกัด: - คงอัตลักษณ์ใบหน้าเดิมอย่างสมบูรณ์ในทุกฉาก - รักษาความต่อเนื่องของแสง (ฝนและเงาสะท้อนนีออน) - ให้เกิดความสมจริงทางกายภาพ (ปฏิสัมพันธ์กับฝน พื้นผิวเปียก) - ตรวจสอบให้เสียงและภาพตรงจังหวะกับอินพุตเสียง - ห้ามรีเซ็ตฉากระหว่างการเปลี่ยนผ่าน ให้สถานะของโลกดำเนินต่อเนื่อง สไตล์: ความสมจริงแบบภาพยนตร์ระดับไฮเอนด์ เม็ดเกรนฟิล์ม เลนส์อะนามอร์ฟิก ระยะชัดตื้น ลุคฟิล์ม 4K
Gemini Omni
Wan 2.7
Kling v3.0
สร้างวิดีโอต่อเนื่อง 4 ฉาก: ฉากที่ 1: หุ่นยนต์สีขาวขนาดเล็กนั่งนิ่งอยู่บนโต๊ะไม้ในอพาร์ตเมนต์ที่มีแสงสลัวช่วงเที่ยงคืน แสงจันทร์ส่องเข้ามาทางหน้าต่าง ดวงตาของหุ่นยนต์ค่อย ๆ สว่างขึ้น พร้อมเสียงฮัมเชิงกลแผ่วเบาที่เริ่มดังขึ้น ฉากที่ 2: หุ่นยนต์ค่อย ๆ ปีนลงจากโต๊ะอย่างระมัดระวัง เท้าโลหะเล็ก ๆ ของมันส่งเสียงก๊อกแก๊กเบา ๆ บนพื้นไม้ กล้องติดตามจากมุมต่ำ โดยคงขนาดและรูปร่างของหุ่นยนต์ให้สอดคล้องกัน ฉากที่ 3: หุ่นยนต์เดินเข้าไปในห้องครัว เงาสะท้อนจากประตูตู้เย็นและพื้นกระเบื้องตอบสนองต่อการเคลื่อนไหวอย่างเป็นธรรมชาติ แสงจันทร์และบรรยากาศยามค่ำคืนอันเงียบสงบยังคงต่อเนื่องจากฉากก่อนหน้า ฉากที่ 4: หุ่นยนต์หยุดอยู่ใกล้หน้าต่างและมองออกไปยังแสงไฟของเมือง กล้องค่อย ๆ ดันเข้าใกล้จากด้านหลัง โดยคงอัตลักษณ์ วัสดุ ขนาด แสง และความต่อเนื่องของเสียงของหุ่นยนต์ไว้ ข้อกำหนด: - คงดีไซน์หุ่นยนต์แบบเดิมอย่างแม่นยำในทุกฉาก - รักษาผังอพาร์ตเมนต์เดียวกันให้ต่อเนื่อง โดยไม่มีการรีเซ็ตฉาก - คงแสงให้สอดคล้องกันจากห้องหนึ่งไปยังอีกห้องหนึ่ง - ให้เสียงฝีเท้าและเสียงฮัมเชิงกลตรงกับการเคลื่อนไหวของหุ่นยนต์ - ใช้เงาสะท้อน เงามืด และปฏิสัมพันธ์ระหว่างวัตถุที่สมจริงตามหลักฟิสิกส์ - เปลี่ยนผ่านระหว่างฉากอย่างราบรื่น ราวกับกำลังถ่ายทำโลกเดียวกันอย่างต่อเนื่อง สไตล์: ความสมจริงแบบภาพยนตร์ บรรยากาศไซไฟอันเงียบสงบ แสงจันทร์นุ่มนวล วัสดุที่มีรายละเอียด การเคลื่อนกล้องสมจริง ระยะชัดตื้น ลุคภาพยนตร์โฆษณาระดับไฮเอนด์
Gemini Omni
Kling V3.0
Pixverse v6
ครอบคลุมตั้งแต่แคมเปญสินค้า การปรับแก้แบบสนทนา ทรานซิชันที่ควบคุมได้ การต่อขยายอย่างสอดคล้อง โลกของแบรนด์ที่มีเอกภาพ ไปจนถึงเครื่องมือสร้างสรรค์แบบฝังในระบบ Gemini Omni API รองรับกระบวนการผลิตตั้งแต่เฟรมแรกจนถึงไฟนัลคัต
เปลี่ยนภาพนิ่งของสินค้าให้เป็นภาพเคลื่อนไหวแบบภาพยนตร์ พร้อมเสียงเนทีฟที่ซิงก์กัน และเลือกกำหนดเฟรมสุดท้ายได้ ทีมการตลาดสามารถนำภาพถ่ายที่ผ่านการอนุมัติมาสร้างทีเซอร์เปิดตัว โฆษณาบนโซเชียล และการเผยโฉมสินค้าอย่างสวยงาม
อธิบายสิ่งที่ต้องการเพิ่ม ลบ แทนที่ หรือปรับสไตล์ แล้วโมเดลจะอัปเดตฟุตเทจเดิมโดยคงทุกอย่างที่พรอมป์ไม่ได้ระบุให้เปลี่ยนไว้เหมือนเดิม ผู้ตัดต่อสามารถสร้างเวอร์ชันทางเลือกและแก้ไขงานตามความต้องการของลูกค้าได้ โดยไม่ต้องสร้างฉากที่อนุมัติแล้วขึ้นใหม่
กำหนดภาพเริ่มต้นและเฟรมสุดท้ายที่จัดเตรียมไว้ แล้วให้ Gemini Omni 1.1 Flash สร้างการเคลื่อนไหวระหว่างทั้งสองเฟรม นักออกแบบจะได้ทรานซิชันที่ควบคุมได้ การเผยโฉมสินค้า และการแปลงภาพสำหรับชิ้นงานแคมเปญ
ต่อคลิปเดิมด้วยช่วงวิดีโอความยาวสามถึงสิบวินาทีที่เข้าคู่กันอย่างไร้รอยต่อ แล้วเชื่อมหลายช่วงต่อขยายให้เป็นลำดับเดียวที่สอดคล้องกัน ผู้สร้างภาพยนตร์และนักเล่าเรื่องสามารถพัฒนาช็อตที่ยาวขึ้น โดยยังคงความต่อเนื่องของการเคลื่อนไหว เสียง และภาพ
ใช้พรอมป์ร่วมกับภาพอ้างอิงได้สูงสุดสิบภาพและคลิปวิดีโอสามคลิป เพื่อกำหนดแนวทางของตัวละคร สินค้า หรือทิศทางศิลป์ สตูดิโอสามารถรักษาเอกลักษณ์ของตัวแบบและสุนทรียภาพของแบรนด์ให้ต่อเนื่องตลอดช็อตในแคมเปญและคอนเทนต์แบบตอน
รวมการสร้างข้อความ การทำภาพให้เคลื่อนไหว การสร้างจากภาพอ้างอิง การตัดต่อวิดีโอ และการต่อขยายคลิปไว้ในการเชื่อมต่อ API เดียว แพลตฟอร์มครีเอเตอร์สามารถมอบพื้นที่ทำงานด้านการผลิตที่เชื่อมต่อกันได้ โดยไม่ต้องประกอบไปป์ไลน์วิดีโอและเสียงแยกกัน
เปรียบเทียบโมเดลวิดีโออ้างอิงของ Gemini Omni API รวมถึง Gemini Omni 1.1 Flash กับทางเลือกชั้นนำตามอินพุตที่รองรับ ความจุข้อมูลอ้างอิง การสร้างเสียง และราคามาตรฐาน
| โมเดล | อินพุตที่รองรับ | ความจุข้อมูลอ้างอิง | การสร้างเสียง | ราคามาตรฐาน |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash Reference-to-Video | ข้อความ รูปภาพ คลิปวิดีโอ | สูงสุด 10 รูปภาพและ 3 คลิปวิดีโอ | √ | $0.041/sec |
| Gemini Omni Flash Reference-to-Video | ข้อความ รูปภาพ | รูปภาพ 1 ถึง 5 รูป | √ | $0.135/sec |
| Seedance 2.0 Reference-to-Video | ข้อความ รูปภาพ วิดีโอ เสียง | สูงสุด 9 รูปภาพ วิดีโอ 3 รายการ และคลิปเสียง 3 คลิป | √ | $0.112/sec |
| Wan-2.7 Reference-to-video | ข้อความ รูปภาพ วิดีโอ เสียง | รวมรูปภาพและวิดีโอได้สูงสุด 5 รายการ พร้อมเสียงตัวแบบที่เลือกใช้ได้ | √ | $0.10/sec |
| Grok Imagine Video v1.5 Reference-to-Video | ข้อความ รูปภาพ เสียงสำเร็จรูป | สูงสุด 7 รูปภาพและเสียงสำเร็จรูป 3 รายการ | √ | $0.08/sec |
เริ่มต้นได้ในไม่กี่นาที — ทำตามขั้นตอนง่าย ๆ เหล่านี้เพื่อเชื่อมต่อและใช้งานโมเดลผ่านแพลตฟอร์ม Atlas Cloud
สมัครสมาชิกที่ atlascloud.ai และยืนยันตัวตน ผู้ใช้ใหม่จะได้รับเครดิตฟรีเพื่อสำรวจแพลตฟอร์มและทดสอบโมเดล
การรวมโมเดล Gemini Omni Flash ขั้นสูงเข้ากับแพลตฟอร์มที่เร่งด้วย GPU ของ Atlas Cloud ให้ประสิทธิภาพ ความสามารถในการขยาย และประสบการณ์นักพัฒนาที่ไม่มีใครเทียบได้
เวลาแฝงต่ำ:
inference ที่ปรับแต่ง GPU เพื่อการตอบสนองแบบเรียลไทม์
API แบบรวมศูนย์:
รัน Gemini Omni Flash, GPT, Gemini และ DeepSeek ด้วยการเชื่อมต่อเดียว
ราคาโปร่งใส:
ชำระเงินต่อโทเค็นที่คาดเดาได้พร้อมตัวเลือก serverless
ประสบการณ์นักพัฒนา:
SDK, การวิเคราะห์, เครื่องมือปรับแต่ง และเทมเพลต
ความน่าเชื่อถือ:
ความพร้อมใช้งาน 99.99%, RBAC และการบันทึกที่พร้อมสำหรับการปฏิบัติตาม
ความปลอดภัยและการปฏิบัติตาม:
SOC 2 Type II, สอดคล้อง HIPAA, อธิปไตยข้อมูลในสหรัฐอเมริกา
Gemini Omni API ช่วยให้นักพัฒนาสามารถเข้าถึงตระกูลการสร้างและตัดต่อวิดีโอแบบ native multimodal ของ Google DeepMind ผ่าน Atlas Cloud ได้ โดยขึ้นอยู่กับ endpoint ที่เลือก ระบบสามารถสร้างวิดีโอจากข้อความหรือภาพ ใช้สื่ออ้างอิง ตัดต่อฟุตเทจเดิม และสร้างเสียง native ที่ซิงโครไนซ์กับวิดีโอได้
Gemini Omni 1.1 Flash เพิ่มความสามารถในการต่อวิดีโอ การอินเตอร์โพเลตระหว่างเฟรมแรกและเฟรมสุดท้าย ความละเอียดเอาต์พุตตั้งแต่ 360p ถึง 4K และการควบคุมด้วยสื่ออ้างอิงที่ยืดหยุ่นยิ่งขึ้น โดย variant สำหรับต่อวิดีโอสามารถเพิ่มความยาวได้ 3 ถึง 10 วินาทีต่อคำขอ และนำมาต่อเนื่องกันเพื่อสร้างวิดีโอที่ต่อเนื่องเป็นเรื่องเดียวได้นานสูงสุด 40 วินาที
สร้างบัญชี Atlas Cloud เก็บ API key ไว้บนเซิร์ฟเวอร์ และเลือก model endpoint ที่ตรงกับ workflow ของคุณ Atlas Cloud มีคีย์ที่เข้ากันได้กับ OpenAI เพียงหนึ่งคีย์ ส่วน schema ที่เผยแพร่ของแต่ละ endpoint จะระบุ prompt, media input และการตั้งค่าการสร้างที่จำเป็น
เลือก text to video เมื่อเริ่มจาก prompt, image to video เมื่อต้องการทำให้ภาพนิ่งเคลื่อนไหว หรือ reference to video เมื่อต้องการควบคุมอัตลักษณ์และสไตล์ ใช้ video edit เพื่อปรับแก้ฟุตเทจเดิม และใช้ Gemini Omni 1.1 Flash video extend endpoint เพื่อดำเนินฉากต่อ
ข้อจำกัดของสื่ออ้างอิงจะแตกต่างกันไปตาม endpoint และเวอร์ชันของโมเดล Gemini Omni 1.1 Flash Reference to Video รองรับภาพอ้างอิงสูงสุด 10 ภาพและคลิปวิดีโออ้างอิง 3 คลิป ขณะที่ endpoint รุ่นก่อนหน้าอาจรองรับจำนวนแตกต่างกัน ดังนั้นควรตรวจสอบ schema ของ endpoint ที่เลือกก่อนส่งสื่อ
Gemini Omni 1.1 Flash รองรับเอาต์พุตความยาว 3 ถึง 10 วินาทีที่ 24 FPS พร้อมตัวเลือกความละเอียด 360p, 720p, 1080p ที่ขยายความละเอียดแล้ว และ 4K ที่ขยายความละเอียดแล้ว อัตราส่วนภาพที่รองรับคือ 16:9 และ 9:16 อย่างไรก็ตาม การควบคุมที่ใช้งานได้อาจแตกต่างกันตาม Atlas Cloud endpoint
ได้ โดย variant ของ video edit จะทำตามคำสั่งข้อความเพื่อเพิ่ม ลบ แทนที่ หรือปรับสไตล์องค์ประกอบต่าง ๆ ขณะคงฟุตเทจส่วนที่ prompt ไม่ได้กล่าวถึงไว้ สำหรับการปรับแก้หลายรอบ ให้ใช้คำสั่งที่เจาะจงและ interaction context ที่ workflow ที่เลือกนั้นรองรับ
หากต้องการดำเนินฉากต่อ ให้ส่งคลิปเดิมไปยัง Gemini Omni 1.1 Flash video extend endpoint และระบุให้เพิ่มอีก 3 ถึง 10 วินาที สามารถต่อวิดีโอเป็นลำดับได้จนมีความยาวรวมสูงสุด 40 วินาที ส่วน variant ของ image to video สามารถอินเตอร์โพเลตระหว่างเฟรมแรกและเฟรมสุดท้ายที่ส่งให้ระบบได้
ราคามาตรฐานของ Atlas Cloud สำหรับ Gemini Omni 1.1 Flash อยู่ที่ $0.041 ต่อวินาทีสำหรับ text to video, reference to video, video editing และ video extension ขณะที่ image to video มีค่าใช้จ่าย $0.043 ต่อวินาที ส่วน Gemini Omni Flash endpoint รุ่นก่อนหน้าเริ่มต้นที่ $0.112 ต่อวินาที โดยคิดค่าบริการตามการใช้งานและไม่จำเป็นต้องสมัครสมาชิก
วิดีโอที่สร้างขึ้นทุกไฟล์จะมีลายน้ำ SynthID แบบมองไม่เห็น ซึ่งสามารถตรวจจับได้ด้วยโปรแกรม ระบบใช้ safety filter กับทั้ง prompt และเอาต์พุตที่สร้างขึ้น ขณะที่เวลาในการประมวลผลจะแตกต่างกันตามระยะเวลา ความละเอียด และภาระงานของบริการ ไม่รองรับการควบคุม dedicated negative prompt, system instruction, temperature, top_p และ stop sequence ดังนั้นให้ระบุข้อยกเว้นไว้ใน prompt หลัก
คู่มือ บทแนะนำ และอัปเดตผลิตภัณฑ์ ที่ช่วยให้คุณใช้ Atlas Cloud ได้อย่างเต็มประสิทธิภาพ