Seedance 2.0 Mini & Fast API ในราคาถูกที่สุดในโลก — ลดสูงสุดถึง 68% จากราคาทางการ

Conversational Video Editing with gemini omni API

API ของ gemini omni นำตระกูล Gemini Omni Flash แบบมัลติโมดัลโดยกำเนิดจาก Google DeepMind ซึ่งรวมถึง Gemini Omni 1.1 Flash มาสู่นักพัฒนา สร้างวิดีโอสไตล์ภาพยนตร์พร้อมเสียงเนทีฟที่ซิงโครไนซ์กัน ทำให้ภาพนิ่งเคลื่อนไหวได้ด้วยการควบคุมเฟรมเริ่มต้นและเฟรมสิ้นสุดอย่างแม่นยำ หรือปรับแก้ฟุตเทจที่มีอยู่ผ่านการแก้ไขด้วยคำสั่งข้อความ โดยยังคงรักษาเนื้อหาที่ไม่ได้แก้ไขไว้ Atlas Cloud มอบคีย์เดียวที่เข้ากันได้กับ OpenAI การเข้าถึงแบบรวมศูนย์ และราคาที่โปร่งใสโดยคิดค่าบริการตามการใช้งาน เริ่มพัฒนาได้วันนี้

Gemini Omni Flash พัฒนาโดย Google โดย Atlas Cloud (ดำเนินการโดย Atlas Cloud AI LLC) เป็นผู้ให้บริการเข้าถึงโมเดลนี้ แต่ไม่ได้เป็นเจ้าของโมเดล เครื่องหมายการค้าทั้งหมดเป็นของเจ้าของที่เกี่ยวข้อง

สำรวจโมเดลชั้นนำ

Atlas Cloud มอบโมเดลสร้างสรรค์ล่าสุดที่นำหน้าในอุตสาหกรรมให้กับคุณ

คู่มือ Gemini Omni API Endpoint สำหรับเวิร์กโฟลว์วิดีโอ

เปรียบเทียบเส้นทางสำหรับข้อความ รูปภาพ ข้อมูลอ้างอิง การแก้ไข และการต่อขยายของ Gemini Omni Flash และ Gemini Omni 1.1 Flash ก่อนเลือก endpoint ที่เหมาะสม

โมดัลลิตีคำอธิบาย
Gemini Omni Flash Reference-to-Video API (R2V)รวมพรอมต์ข้อความกับภาพอ้างอิงหนึ่งถึงห้าภาพเพื่อสร้างวิดีโอแบบภาพยนตร์พร้อมเสียงในตัว การรักษาความสอดคล้องของตัวแบบ ฉาก และสไตล์ ทำให้ endpoint นี้เหมาะสำหรับลำดับภาพที่มีแบรนด์และตัวละครที่ปรากฏซ้ำ
Gemini Omni Flash Image-to-Video API (I2V)เริ่มจากภาพนิ่งและพรอมต์ข้อความ endpoint นี้จะสร้างวิดีโอแบบภาพยนตร์พร้อมเสียง โดยคงตัวแบบและองค์ประกอบของภาพต้นฉบับไว้ ใช้สำหรับทำให้ภาพถ่ายสินค้า ภาพบุคคล หรือแนวคิดภาพเคลื่อนไหว
Gemini Omni Flash Video Edit APIส่งคำสั่งข้อความและภาพอ้างอิงเพิ่มเติม (ถ้ามี) ให้กับวิดีโอที่มีอยู่ เพื่อปรับเปลี่ยนฉากให้สอดคล้องกันพร้อมเสียงในตัว ฟุตเทจที่ไม่ได้แตะต้องจะยังคงเดิม รองรับการแก้ไขหลังการถ่ายทำและการอัปเดตภาพเฉพาะจุด
Gemini Omni Flash Text-to-Video API (T2V)จากพรอมต์ข้อความเพียงอย่างเดียว endpoint จะสร้างวิดีโอแบบภาพยนตร์พร้อมเสียงในตัวที่ซิงโครไนซ์และการเคลื่อนไหวที่อิงหลักฟิสิกส์ การสร้างที่ควบคุมได้และความเร็วสูงเหมาะสำหรับการสร้างภาพแนวคิด พัฒนาเรื่องราว และสร้างต้นแบบวิดีโออย่างรวดเร็ว
Gemini Omni Flash Reference-to-Video Developer APIใช้พรอมต์ข้อความและภาพอ้างอิงเพื่อแปลงคลิปวิดีโอที่มีอยู่ผ่านการถ่ายโอนสไตล์ การแก้ไขฉาก หรือการแทรกตัวละคร Developer endpoint นี้เหมาะกับเครื่องมือสร้างสรรค์ที่ต้องการสร้างรูปแบบต่าง ๆ ของฟุตเทจที่ผู้ใช้ป้อนอย่างมีแนวทาง
Gemini Omni Flash Image-to-Video Developer APIเมื่ออัตลักษณ์ทางภาพมีความสำคัญ ให้รวมพรอมต์ข้อความกับภาพอ้างอิงสูงสุดเจ็ดภาพเพื่อสร้างวิดีโอที่คงความสอดคล้องของตัวแบบ เวิร์กโฟลว์นี้รองรับตัวละครที่ปรากฏซ้ำ ภาพแคตตาล็อก และแอสเซ็ตแคมเปญที่มีความเป็นหนึ่งเดียว
Gemini Omni Flash Text-to-Video Developer APIเลือกพรอมต์ข้อความ ความละเอียด อัตราส่วนภาพ และระยะเวลาเพื่อสร้างวิดีโอแบบภาพยนตร์ที่ควบคุมได้ การตั้งค่าเอาต์พุตที่ยืดหยุ่นช่วยให้นักพัฒนาเตรียมคอนเทนต์เฉพาะแพลตฟอร์ม ทดสอบแนวทางสร้างสรรค์ และสร้างเวิร์กโฟลว์การสร้างอัตโนมัติ
Gemini Omni 1.1 Flash Video Extend APIต่อคลิปที่มีอยู่ด้วยส่วนขยายที่เข้ากันได้อย่างไร้รอยต่อ ความยาวสามถึงสิบวินาที และคงเสียงในตัวไว้ สามารถต่อส่วนขยายแบบต่อเนื่องเพื่อสร้างช็อตเดียวที่สอดคล้องกันยาวสูงสุดสี่สิบวินาที สำหรับฉากที่ยาวขึ้นหรือแอ็กชันต่อเนื่อง
Gemini Omni 1.1 Flash Video Edit APIขอให้เพิ่ม ลบ แทนที่ หรือปรับเปลี่ยนสไตล์ด้วยการส่งวิดีโอที่มีอยู่และคำสั่งข้อความให้ endpoint ระบบจะคงเนื้อหาและเสียงในตัวที่ไม่ได้ระบุให้เปลี่ยนไว้ ทำให้แก้ไขได้อย่างแม่นยำโดยไม่ต้องสร้างฉากทั้งหมดใหม่
Gemini Omni 1.1 Flash Reference-to-Video API (R2V)ส่งพรอมต์ข้อความพร้อมภาพอ้างอิงสูงสุดสิบภาพและคลิปวิดีโออ้างอิงสามคลิปเพื่อสร้างวิดีโอแบบภาพยนตร์พร้อมเสียงในตัว ความสอดคล้องของตัวละคร สินค้า และทิศทางศิลป์ รองรับคอนเทนต์แบบซีรีส์และแคมเปญที่ประสานงานกัน
Gemini Omni 1.1 Flash Image-to-Video API (I2V)ทำให้ภาพนิ่งกลายเป็นคลิปแบบภาพยนตร์พร้อมเสียงในตัว โดยมีข้อความเป็นตัวกำกับ เฟรมสุดท้ายที่ระบุเพิ่มเติมช่วยควบคุมจุดจบของช็อตได้อย่างแม่นยำ ทำให้ endpoint นี้เหมาะสำหรับทรานซิชันที่วางแผนไว้และการเปิดตัวสินค้า
Gemini Omni 1.1 Flash Text-to-Video API (T2V)เปลี่ยนพรอมต์ข้อความหนึ่งรายการให้เป็นคลิปแบบภาพยนตร์พร้อมเสียงในตัวที่ซิงโครไนซ์ โดยควบคุมระยะเวลา อัตราส่วนภาพ และความละเอียดได้ เอาต์พุตตั้งแต่ฉบับร่าง 360p ไปจนถึง 4K รองรับทั้งการพรีวิวอย่างรวดเร็วและการส่งมอบความละเอียดสูงจาก endpoint เดียว

สร้างวิดีโอด้วยการสนทนาด้วย Gemini Omni Flash API

คำขอ Gemini Omni Flash API แต่ละครั้งสามารถรับข้อความ รูปภาพ วิดีโอ และเสียงในสัดส่วนใดก็ได้ สร้างเสียงที่ซิงโครไนซ์ จำลองฟิสิกส์ของโลกจริง และปรับแต่งผลลัพธ์ต่อผ่านการสนทนา

การตัดต่อด้วยการสนทนา

การตัดต่อด้วยการสนทนา

ปรับแต่งคลิปด้วยภาษาธรรมชาติ แล้ว Gemini Omni Flash API จะนำการเปลี่ยนแปลงไปใช้โดยคงส่วนอื่นของฉากไว้ Interactions API แบบมีสถานะจะจดจำการโต้ตอบแต่ละรอบ ทำให้การแก้ไขต่อยอดกันได้

อินพุตมัลติโมดัลแบบเนทีฟ

อินพุตมัลติโมดัลแบบเนทีฟ

Gemini Omni Flash API รับข้อความ รูปภาพ วิดีโอ และเสียงในรูปแบบผสมใดก็ได้ภายในพรอมต์เดียว อินพุตจากแหล่งใดก็ได้นี้ช่วยให้คุณสร้างงานจากสื่อต้นฉบับที่มีอยู่แล้วได้โดยตรง

เสียงซิงโครไนซ์ในการประมวลผลครั้งเดียว

เสียงซิงโครไนซ์ในการประมวลผลครั้งเดียว

ระบบสร้างเสียงพร้อมภาพในการอนุมานครั้งเดียว ทำให้บทสนทนา เอฟเฟกต์ และเสียงบรรยากาศสอดคล้องกับการเคลื่อนไหว Gemini Omni Flash API จึงไม่ต้องใช้ขั้นตอนสร้างเสียงแยกต่างหากภายหลัง

การสร้างแบบจำลองโลก

การสร้างแบบจำลองโลก

ด้วยพื้นฐานจากแบบจำลองฟิสิกส์ของโลกจริง Gemini Omni Flash API จึงเรนเดอร์เงาสะท้อน แรงโน้มถ่วง แสง และสภาพอากาศได้อย่างน่าเชื่อถือ ฉากยังคงความต่อเนื่องทางภาพแทนที่จะค่อย ๆ เกิดสิ่งผิดเพี้ยน แม้ในช็อตที่มีการเคลื่อนไหวมาก

การอ้างอิงแบบมัลติโมดัล

การอ้างอิงแบบมัลติโมดัล

กำกับการสร้างงานด้วยภาพอ้างอิงได้สูงสุดเจ็ดภาพและคลิปวิดีโอสั้นสามคลิป โดย Gemini Omni Flash API จะรักษาความสอดคล้องของตัวแบบ สไตล์ และฉากไว้ วิธีนี้ช่วยให้เอกลักษณ์ของตัวแบบคงที่ตลอดการแก้ไขและแต่ละช็อต

Gemini Omni เทียบกับโมเดลอื่น — พรอมต์เดียว

วิดีโอจากพรอมต์เดียวกันที่สร้างโดย Gemini Omni และโมเดลวิดีโอชั้นนำอื่น ๆ: หลายช็อตและภาพยนตร์โฆษณาระดับไฮเอนด์

พรอมต์

สร้างวิดีโอต่อเนื่อง 3 ฉาก: ฉากที่ 1: ผู้หญิงยืนอยู่ใต้แสงนีออนบนถนนที่มีฝนตกในโตเกียว เงาสะท้อนบนพื้นเปียก ให้มิติความลึกแบบภาพยนตร์ พร้อมการเคลื่อนกล้องแบบถือด้วยมือ ฉากที่ 2: กล้องค่อย ๆ เปลี่ยนเป็นภาพระยะใกล้ขึ้น เธอพูดเบา ๆ ให้ตรงจังหวะกับเสียงที่ให้มา โดยการขยับริมฝีปากตรงกันอย่างสมบูรณ์ การจราจรด้านหลังดำเนินต่อไปอย่างไร้รอยต่อ ฉากที่ 3: เธอเดินเข้าสถานีรถไฟใต้ดิน สภาพแวดล้อมยังคงสอดคล้องกันทั้งด้านแสง สภาพอากาศ และอารมณ์ กล้องติดตามเธอจากด้านหลัง โดยคงความสอดคล้องของอัตลักษณ์บุคคล ข้อจำกัด: - คงอัตลักษณ์ใบหน้าเดิมอย่างสมบูรณ์ในทุกฉาก - รักษาความต่อเนื่องของแสง (ฝนและเงาสะท้อนนีออน) - ให้เกิดความสมจริงทางกายภาพ (ปฏิสัมพันธ์กับฝน พื้นผิวเปียก) - ตรวจสอบให้เสียงและภาพตรงจังหวะกับอินพุตเสียง - ห้ามรีเซ็ตฉากระหว่างการเปลี่ยนผ่าน ให้สถานะของโลกดำเนินต่อเนื่อง สไตล์: ความสมจริงแบบภาพยนตร์ระดับไฮเอนด์ เม็ดเกรนฟิล์ม เลนส์อะนามอร์ฟิก ระยะชัดตื้น ลุคฟิล์ม 4K

Gemini Omni

Wan 2.7

Kling v3.0

พรอมต์

สร้างวิดีโอต่อเนื่อง 4 ฉาก: ฉากที่ 1: หุ่นยนต์สีขาวขนาดเล็กนั่งนิ่งอยู่บนโต๊ะไม้ในอพาร์ตเมนต์ที่มีแสงสลัวช่วงเที่ยงคืน แสงจันทร์ส่องเข้ามาทางหน้าต่าง ดวงตาของหุ่นยนต์ค่อย ๆ สว่างขึ้น พร้อมเสียงฮัมเชิงกลแผ่วเบาที่เริ่มดังขึ้น ฉากที่ 2: หุ่นยนต์ค่อย ๆ ปีนลงจากโต๊ะอย่างระมัดระวัง เท้าโลหะเล็ก ๆ ของมันส่งเสียงก๊อกแก๊กเบา ๆ บนพื้นไม้ กล้องติดตามจากมุมต่ำ โดยคงขนาดและรูปร่างของหุ่นยนต์ให้สอดคล้องกัน ฉากที่ 3: หุ่นยนต์เดินเข้าไปในห้องครัว เงาสะท้อนจากประตูตู้เย็นและพื้นกระเบื้องตอบสนองต่อการเคลื่อนไหวอย่างเป็นธรรมชาติ แสงจันทร์และบรรยากาศยามค่ำคืนอันเงียบสงบยังคงต่อเนื่องจากฉากก่อนหน้า ฉากที่ 4: หุ่นยนต์หยุดอยู่ใกล้หน้าต่างและมองออกไปยังแสงไฟของเมือง กล้องค่อย ๆ ดันเข้าใกล้จากด้านหลัง โดยคงอัตลักษณ์ วัสดุ ขนาด แสง และความต่อเนื่องของเสียงของหุ่นยนต์ไว้ ข้อกำหนด: - คงดีไซน์หุ่นยนต์แบบเดิมอย่างแม่นยำในทุกฉาก - รักษาผังอพาร์ตเมนต์เดียวกันให้ต่อเนื่อง โดยไม่มีการรีเซ็ตฉาก - คงแสงให้สอดคล้องกันจากห้องหนึ่งไปยังอีกห้องหนึ่ง - ให้เสียงฝีเท้าและเสียงฮัมเชิงกลตรงกับการเคลื่อนไหวของหุ่นยนต์ - ใช้เงาสะท้อน เงามืด และปฏิสัมพันธ์ระหว่างวัตถุที่สมจริงตามหลักฟิสิกส์ - เปลี่ยนผ่านระหว่างฉากอย่างราบรื่น ราวกับกำลังถ่ายทำโลกเดียวกันอย่างต่อเนื่อง สไตล์: ความสมจริงแบบภาพยนตร์ บรรยากาศไซไฟอันเงียบสงบ แสงจันทร์นุ่มนวล วัสดุที่มีรายละเอียด การเคลื่อนกล้องสมจริง ระยะชัดตื้น ลุคภาพยนตร์โฆษณาระดับไฮเอนด์

Gemini Omni

Kling V3.0

Pixverse v6

จากภาพสินค้าสู่ไฟนัลคัตด้วย Gemini Omni API

ครอบคลุมตั้งแต่แคมเปญสินค้า การปรับแก้แบบสนทนา ทรานซิชันที่ควบคุมได้ การต่อขยายอย่างสอดคล้อง โลกของแบรนด์ที่มีเอกภาพ ไปจนถึงเครื่องมือสร้างสรรค์แบบฝังในระบบ Gemini Omni API รองรับกระบวนการผลิตตั้งแต่เฟรมแรกจนถึงไฟนัลคัต

แคมเปญสินค้าด้วย Gemini Omni API

เปลี่ยนภาพนิ่งของสินค้าให้เป็นภาพเคลื่อนไหวแบบภาพยนตร์ พร้อมเสียงเนทีฟที่ซิงก์กัน และเลือกกำหนดเฟรมสุดท้ายได้ ทีมการตลาดสามารถนำภาพถ่ายที่ผ่านการอนุมัติมาสร้างทีเซอร์เปิดตัว โฆษณาบนโซเชียล และการเผยโฉมสินค้าอย่างสวยงาม

โพสต์โปรดักชันแบบสนทนา

อธิบายสิ่งที่ต้องการเพิ่ม ลบ แทนที่ หรือปรับสไตล์ แล้วโมเดลจะอัปเดตฟุตเทจเดิมโดยคงทุกอย่างที่พรอมป์ไม่ได้ระบุให้เปลี่ยนไว้เหมือนเดิม ผู้ตัดต่อสามารถสร้างเวอร์ชันทางเลือกและแก้ไขงานตามความต้องการของลูกค้าได้ โดยไม่ต้องสร้างฉากที่อนุมัติแล้วขึ้นใหม่

ทรานซิชันระหว่างเฟรมแรกและเฟรมสุดท้าย

กำหนดภาพเริ่มต้นและเฟรมสุดท้ายที่จัดเตรียมไว้ แล้วให้ Gemini Omni 1.1 Flash สร้างการเคลื่อนไหวระหว่างทั้งสองเฟรม นักออกแบบจะได้ทรานซิชันที่ควบคุมได้ การเผยโฉมสินค้า และการแปลงภาพสำหรับชิ้นงานแคมเปญ

การต่อขยายเรื่องราวอย่างสอดคล้องด้วย Gemini Omni API

ต่อคลิปเดิมด้วยช่วงวิดีโอความยาวสามถึงสิบวินาทีที่เข้าคู่กันอย่างไร้รอยต่อ แล้วเชื่อมหลายช่วงต่อขยายให้เป็นลำดับเดียวที่สอดคล้องกัน ผู้สร้างภาพยนตร์และนักเล่าเรื่องสามารถพัฒนาช็อตที่ยาวขึ้น โดยยังคงความต่อเนื่องของการเคลื่อนไหว เสียง และภาพ

ความต่อเนื่องของตัวละครและแบรนด์

ใช้พรอมป์ร่วมกับภาพอ้างอิงได้สูงสุดสิบภาพและคลิปวิดีโอสามคลิป เพื่อกำหนดแนวทางของตัวละคร สินค้า หรือทิศทางศิลป์ สตูดิโอสามารถรักษาเอกลักษณ์ของตัวแบบและสุนทรียภาพของแบรนด์ให้ต่อเนื่องตลอดช็อตในแคมเปญและคอนเทนต์แบบตอน

แอปสร้างสรรค์ที่ขับเคลื่อนด้วย Gemini Omni API

รวมการสร้างข้อความ การทำภาพให้เคลื่อนไหว การสร้างจากภาพอ้างอิง การตัดต่อวิดีโอ และการต่อขยายคลิปไว้ในการเชื่อมต่อ API เดียว แพลตฟอร์มครีเอเตอร์สามารถมอบพื้นที่ทำงานด้านการผลิตที่เชื่อมต่อกันได้ โดยไม่ต้องประกอบไปป์ไลน์วิดีโอและเสียงแยกกัน

เปรียบเทียบโมเดลอ้างอิงของ Gemini Omni API

เปรียบเทียบโมเดลวิดีโออ้างอิงของ Gemini Omni API รวมถึง Gemini Omni 1.1 Flash กับทางเลือกชั้นนำตามอินพุตที่รองรับ ความจุข้อมูลอ้างอิง การสร้างเสียง และราคามาตรฐาน

โมเดลอินพุตที่รองรับความจุข้อมูลอ้างอิงการสร้างเสียงราคามาตรฐาน
Gemini Omni 1.1 Flash Reference-to-Videoข้อความ รูปภาพ คลิปวิดีโอสูงสุด 10 รูปภาพและ 3 คลิปวิดีโอ$0.041/sec
Gemini Omni Flash Reference-to-Videoข้อความ รูปภาพรูปภาพ 1 ถึง 5 รูป$0.135/sec
Seedance 2.0 Reference-to-Videoข้อความ รูปภาพ วิดีโอ เสียงสูงสุด 9 รูปภาพ วิดีโอ 3 รายการ และคลิปเสียง 3 คลิป$0.112/sec
Wan-2.7 Reference-to-videoข้อความ รูปภาพ วิดีโอ เสียงรวมรูปภาพและวิดีโอได้สูงสุด 5 รายการ พร้อมเสียงตัวแบบที่เลือกใช้ได้$0.10/sec
Grok Imagine Video v1.5 Reference-to-Videoข้อความ รูปภาพ เสียงสำเร็จรูปสูงสุด 7 รูปภาพและเสียงสำเร็จรูป 3 รายการ$0.08/sec

วิธีใช้ Gemini Omni Flash บน Atlas Cloud

เริ่มต้นได้ในไม่กี่นาที — ทำตามขั้นตอนง่าย ๆ เหล่านี้เพื่อเชื่อมต่อและใช้งานโมเดลผ่านแพลตฟอร์ม Atlas Cloud

สร้างบัญชี Atlas Cloud

สมัครสมาชิกที่ atlascloud.ai และยืนยันตัวตน ผู้ใช้ใหม่จะได้รับเครดิตฟรีเพื่อสำรวจแพลตฟอร์มและทดสอบโมเดล

ทำไมต้องใช้ Gemini Omni Flash บน Atlas Cloud

การรวมโมเดล Gemini Omni Flash ขั้นสูงเข้ากับแพลตฟอร์มที่เร่งด้วย GPU ของ Atlas Cloud ให้ประสิทธิภาพ ความสามารถในการขยาย และประสบการณ์นักพัฒนาที่ไม่มีใครเทียบได้

ประสิทธิภาพและความยืดหยุ่น

เวลาแฝงต่ำ:
inference ที่ปรับแต่ง GPU เพื่อการตอบสนองแบบเรียลไทม์

API แบบรวมศูนย์:
รัน Gemini Omni Flash, GPT, Gemini และ DeepSeek ด้วยการเชื่อมต่อเดียว

ราคาโปร่งใส:
ชำระเงินต่อโทเค็นที่คาดเดาได้พร้อมตัวเลือก serverless

องค์กรและขนาด

ประสบการณ์นักพัฒนา:
SDK, การวิเคราะห์, เครื่องมือปรับแต่ง และเทมเพลต

ความน่าเชื่อถือ:
ความพร้อมใช้งาน 99.99%, RBAC และการบันทึกที่พร้อมสำหรับการปฏิบัติตาม

ความปลอดภัยและการปฏิบัติตาม:
SOC 2 Type II, สอดคล้อง HIPAA, อธิปไตยข้อมูลในสหรัฐอเมริกา

คำถามเกี่ยวกับ Gemini Omni API สำหรับนักพัฒนาวิดีโอ

Gemini Omni API ช่วยให้นักพัฒนาสามารถเข้าถึงตระกูลการสร้างและตัดต่อวิดีโอแบบ native multimodal ของ Google DeepMind ผ่าน Atlas Cloud ได้ โดยขึ้นอยู่กับ endpoint ที่เลือก ระบบสามารถสร้างวิดีโอจากข้อความหรือภาพ ใช้สื่ออ้างอิง ตัดต่อฟุตเทจเดิม และสร้างเสียง native ที่ซิงโครไนซ์กับวิดีโอได้

Gemini Omni 1.1 Flash เพิ่มความสามารถในการต่อวิดีโอ การอินเตอร์โพเลตระหว่างเฟรมแรกและเฟรมสุดท้าย ความละเอียดเอาต์พุตตั้งแต่ 360p ถึง 4K และการควบคุมด้วยสื่ออ้างอิงที่ยืดหยุ่นยิ่งขึ้น โดย variant สำหรับต่อวิดีโอสามารถเพิ่มความยาวได้ 3 ถึง 10 วินาทีต่อคำขอ และนำมาต่อเนื่องกันเพื่อสร้างวิดีโอที่ต่อเนื่องเป็นเรื่องเดียวได้นานสูงสุด 40 วินาที

สร้างบัญชี Atlas Cloud เก็บ API key ไว้บนเซิร์ฟเวอร์ และเลือก model endpoint ที่ตรงกับ workflow ของคุณ Atlas Cloud มีคีย์ที่เข้ากันได้กับ OpenAI เพียงหนึ่งคีย์ ส่วน schema ที่เผยแพร่ของแต่ละ endpoint จะระบุ prompt, media input และการตั้งค่าการสร้างที่จำเป็น

เลือก text to video เมื่อเริ่มจาก prompt, image to video เมื่อต้องการทำให้ภาพนิ่งเคลื่อนไหว หรือ reference to video เมื่อต้องการควบคุมอัตลักษณ์และสไตล์ ใช้ video edit เพื่อปรับแก้ฟุตเทจเดิม และใช้ Gemini Omni 1.1 Flash video extend endpoint เพื่อดำเนินฉากต่อ

ข้อจำกัดของสื่ออ้างอิงจะแตกต่างกันไปตาม endpoint และเวอร์ชันของโมเดล Gemini Omni 1.1 Flash Reference to Video รองรับภาพอ้างอิงสูงสุด 10 ภาพและคลิปวิดีโออ้างอิง 3 คลิป ขณะที่ endpoint รุ่นก่อนหน้าอาจรองรับจำนวนแตกต่างกัน ดังนั้นควรตรวจสอบ schema ของ endpoint ที่เลือกก่อนส่งสื่อ

Gemini Omni 1.1 Flash รองรับเอาต์พุตความยาว 3 ถึง 10 วินาทีที่ 24 FPS พร้อมตัวเลือกความละเอียด 360p, 720p, 1080p ที่ขยายความละเอียดแล้ว และ 4K ที่ขยายความละเอียดแล้ว อัตราส่วนภาพที่รองรับคือ 16:9 และ 9:16 อย่างไรก็ตาม การควบคุมที่ใช้งานได้อาจแตกต่างกันตาม Atlas Cloud endpoint

ได้ โดย variant ของ video edit จะทำตามคำสั่งข้อความเพื่อเพิ่ม ลบ แทนที่ หรือปรับสไตล์องค์ประกอบต่าง ๆ ขณะคงฟุตเทจส่วนที่ prompt ไม่ได้กล่าวถึงไว้ สำหรับการปรับแก้หลายรอบ ให้ใช้คำสั่งที่เจาะจงและ interaction context ที่ workflow ที่เลือกนั้นรองรับ

หากต้องการดำเนินฉากต่อ ให้ส่งคลิปเดิมไปยัง Gemini Omni 1.1 Flash video extend endpoint และระบุให้เพิ่มอีก 3 ถึง 10 วินาที สามารถต่อวิดีโอเป็นลำดับได้จนมีความยาวรวมสูงสุด 40 วินาที ส่วน variant ของ image to video สามารถอินเตอร์โพเลตระหว่างเฟรมแรกและเฟรมสุดท้ายที่ส่งให้ระบบได้

ราคามาตรฐานของ Atlas Cloud สำหรับ Gemini Omni 1.1 Flash อยู่ที่ $0.041 ต่อวินาทีสำหรับ text to video, reference to video, video editing และ video extension ขณะที่ image to video มีค่าใช้จ่าย $0.043 ต่อวินาที ส่วน Gemini Omni Flash endpoint รุ่นก่อนหน้าเริ่มต้นที่ $0.112 ต่อวินาที โดยคิดค่าบริการตามการใช้งานและไม่จำเป็นต้องสมัครสมาชิก

วิดีโอที่สร้างขึ้นทุกไฟล์จะมีลายน้ำ SynthID แบบมองไม่เห็น ซึ่งสามารถตรวจจับได้ด้วยโปรแกรม ระบบใช้ safety filter กับทั้ง prompt และเอาต์พุตที่สร้างขึ้น ขณะที่เวลาในการประมวลผลจะแตกต่างกันตามระยะเวลา ความละเอียด และภาระงานของบริการ ไม่รองรับการควบคุม dedicated negative prompt, system instruction, temperature, top_p และ stop sequence ดังนั้นให้ระบุข้อยกเว้นไว้ใน prompt หลัก

สำรวจกลุ่มเพิ่มเติม

Seedance 2.5

Seedance 2.5 API พร้อมใช้งานแล้วบน Atlas Cloud! มอบโมเดลวิดีโอใหม่ล่าสุดของ ByteDance ให้กับนักพัฒนา สร้างวิดีโอเนทีฟได้นานถึง 30 วินาทีในการประมวลผลเพียงครั้งเดียวจากข้อความ รูปภาพเดียว หรือการอ้างอิงหลายรูปแบบสูงสุด 50 รายการ พร้อมเสียงที่ซิงโครไนซ์และข้อความหลายภาษาในเฟรม บน Atlas Cloud คุณสามารถเข้าถึงได้ผ่านคีย์เดียว โดยมีความสอดคล้องของวัตถุและระบบฟิสิกส์ที่ได้รับการปรับปรุงซึ่งช่วยให้ภาพระยะยาวมีความต่อเนื่อง

ดูกลุ่ม

Wan 3.0

Wan 3.0 API คือเจเนอเรชันถัดไปของตระกูลวิดีโอ Wan จาก Alibaba ซึ่งสร้างขึ้นเพื่อยกระดับการสร้างวิดีโอแบบยาว การควบคุมแบบหลายข้อมูลอ้างอิง และคุณภาพของภาพและเสียงให้ก้าวไปอีกขั้น Atlas Cloud ได้โฮสต์ Wan 2.7, 2.6 และ 2.5 ไว้แล้ว และ Wan 3.0 สามารถทำงานบนคีย์แบบรวมเดียวกันโดยไม่ต้องตั้งค่าแยกต่างหาก เริ่มต้นสร้างสรรค์ได้ตั้งแต่วันนี้ เลื่อนลงไปที่ส่วนจัดแสดงเพื่อดูว่า Wan 3.0 สามารถสร้างอะไรได้บ้าง

ดูกลุ่ม

MiniMax H3

MiniMax H3 คือกลุ่มโมเดลวิดีโอของ MiniMax สำหรับการสร้างวิดีโอจากข้อความ รูปภาพ และข้อมูลอ้างอิง สร้างคลิปความยาว 5 ถึง 15 วินาที กำหนดการเคลื่อนไหวด้วยเฟรมสุดท้ายที่เลือกใช้ได้ รักษาองค์ประกอบของวัตถุจากรูปภาพอ้างอิง หรือเลือก H3 Developer เมื่อเสียงที่สร้างขึ้นเหมาะกับเวิร์กโฟลว์ของคุณ Atlas Cloud รวม H3, H3 Fast, H3 Max และ H3 Developer ไว้ในเวิร์กโฟลว์ API เดียว พร้อมราคาแบบมาตรฐานเริ่มต้นที่ $0.038 ต่อวินาที เริ่มพัฒนาได้แล้ววันนี้

ดูกลุ่ม

Seedream 5.0 Pro

Seedream 5.0 Pro API มอบโมเดลการแก้ไขภาพที่ควบคุมได้ของ ByteDance บน Atlas Cloud ให้กับนักพัฒนา โดยจะวางการแก้ไขอย่างแม่นยำด้วยจุดยึดและพิกัด แยกภาพออกเป็นเลเยอร์ที่แก้ไขได้ ผสานข้อมูลอ้างอิงหลายรายการ และจับคู่สีและวัสดุที่แน่นอน พร้อมข้อความหลายภาษาที่ความละเอียด 2K และ 3K บน Atlas Cloud คุณสามารถเข้าถึงได้ผ่านคีย์เดียว!

ดูกลุ่ม

Seedance 2.0

Seedance 2.0 API ให้คุณเข้าถึงระดับโปรดักชันของโมเดลวิดีโอแบบมัลติโมดัลจาก ByteDance — รองรับอินพุต 4 รูปแบบ (ข้อความ, รูปภาพ, วิดีโอ, เสียง) และระบบ "Universal Reference" ชั้นนำของอุตสาหกรรมที่ล็อกองค์ประกอบภาพ การเคลื่อนไหวของกล้อง และการกระทำของตัวละครในทุกช็อต ผสานรวมการควบคุมระดับผู้กำกับด้วยการเรียกใช้ API เพียงครั้งเดียว ในราคาคงที่ $0.09/วินาที รับคีย์ได้ทันที และไม่มีคิวรอ — พร้อมการรับประกันเวลาพร้อมใช้งานและการปฏิบัติตามข้อกำหนดระดับองค์กร Seedance 2.0 Native 4K เปิดใช้งานแล้ววันนี้!

ดูกลุ่ม

GPT Image 2.5

ตระกูล gpt-image-2.5 จาก OpenAI มอบทางเลือก Flare และ Sunburst ให้แก่นักพัฒนาสำหรับกระบวนการทำงานด้านการสร้างภาพเพื่อใช้งานจริง เรนเดอร์ด้วยความละเอียดตามต้องการสูงสุด 3840x2160 และเลือกได้จากระดับคุณภาพ 5 ระดับ รวมถึง xhigh และ max เพื่อให้ตรงตามข้อกำหนดของเอาต์พุตแต่ละแบบ Atlas Cloud ให้บริการอนุมานผ่าน REST ที่พร้อมใช้งาน โดยไม่มี cold start และคิดค่าบริการตามมาตรฐานเริ่มต้นที่ $0.004 ต่อการสร้างภาพ เริ่มพัฒนาได้วันนี้

ดูกลุ่ม

GPT Image 2

GPT Image 2 API ช่วยให้นักพัฒนาสามารถเข้าถึงโมเดลรูปภาพล่าสุดของ OpenAI ซึ่งเป็นรุ่นสืบทอดจาก GPT Image 1.5 โดยสามารถสร้างและแก้ไขรูปภาพพร้อมกับการเรนเดอร์ข้อความที่แม่นยำทั้งในอักษรละตินและ CJK รวมถึงการจัดวางองค์ประกอบที่ยอดเยี่ยมสำหรับโปสเตอร์ ม็อกอัป และอินโฟกราฟิก บน Atlas Cloud คุณสามารถเข้าถึงโมเดลนี้ผ่าน API ที่เป็นหนึ่งเดียวร่วมกับโมเดลอื่นๆ อีกกว่า 300 รุ่น พร้อมเครดิตฟรี เวลาทำงาน 99.99% และไม่จำเป็นต้องมีการตรวจสอบยืนยันองค์กรจาก OpenAI

ดูกลุ่ม

Gemini Omni Flash

API ของ gemini omni นำตระกูล Gemini Omni Flash แบบมัลติโมดัลโดยกำเนิดจาก Google DeepMind ซึ่งรวมถึง Gemini Omni 1.1 Flash มาสู่นักพัฒนา สร้างวิดีโอสไตล์ภาพยนตร์พร้อมเสียงเนทีฟที่ซิงโครไนซ์กัน ทำให้ภาพนิ่งเคลื่อนไหวได้ด้วยการควบคุมเฟรมเริ่มต้นและเฟรมสิ้นสุดอย่างแม่นยำ หรือปรับแก้ฟุตเทจที่มีอยู่ผ่านการแก้ไขด้วยคำสั่งข้อความ โดยยังคงรักษาเนื้อหาที่ไม่ได้แก้ไขไว้ Atlas Cloud มอบคีย์เดียวที่เข้ากันได้กับ OpenAI การเข้าถึงแบบรวมศูนย์ และราคาที่โปร่งใสโดยคิดค่าบริการตามการใช้งาน เริ่มพัฒนาได้วันนี้

ดูกลุ่ม

Grok Imagine

Grok Imagine API ครอบคลุมโมเดลรูปภาพ วิดีโอ และพูดของ xAI ตั้งแต่ Image 2.0 ถึง Video 1.5 และ xAI TTS v1 สร้างรูปภาพนิ่ง 1K หรือ 2K ในอัตราส่วน 14 แบบ ขยายฉากไปยัง 15 วินาทีของวิดีโอ 1080p ควบคุมภาพด้วยรูปภาพอ้างอิงได้ถึง 7 รูป หรือเพิ่มบรรยายเสียงในภาษา 20 ภาษา Atlas Cloud รันทุกโหมดบนเอนด์พอยต์เดียว มีราคาแบบจ่ายตามการใช้งาน ตั้งแต่ $0.02 ต่อรูปภาพและ $0.05 ต่อวินาที เริ่มสร้างวันนี้

ดูกลุ่ม

Google

โมเดลเชิงสร้างสรรค์ที่ทรงพลังที่สุดของ Google พร้อมใช้งานแล้วบน Atlas Cloud โดย Veo 3.1 นำเสนอการสร้างวิดีโอระดับภาพยนตร์ Nano Banana 2 ขับเคลื่อนการสร้างภาพที่มีความเที่ยงตรงสูง และ Gemini นำความชาญฉลาดแบบมัลติโมดัลมาสู่ทุกเวิร์กโฟลว์ เข้าถึงชุดโมเดลของ Google เต็มรูปแบบผ่าน API key เดียวพร้อมความพร้อมใช้งานระดับ Day-0 และการกำหนดราคาแบบจ่ายตามการใช้งาน (pay-as-you-go)

ดูกลุ่ม

Seedance 2.0 Mini

Seedance 2.0 Mini นำเสนอการสร้างวิดีโอแบบมัลติโมดัลของ ByteDance สู่เวิร์กโฟลว์ที่ความเร็วและต้นทุนมีความสำคัญสูงสุด โดยมอบความสามารถหลักของ Seedance 2.0 ในรูปแบบที่ใช้ทรัพยากรน้อยลง — สร้างได้เร็วกว่า ต้นทุนต่อวิดีโอต่ำกว่า และใช้การผสานรวม API เดิมที่คุณใช้อยู่แล้ว สำหรับทีมที่จัดการไปป์ไลน์ปริมาณมากหรือสร้างต้นแบบในสเกลขนาดใหญ่ Mini คือตัวเลือกเริ่มต้นที่ใช้งานได้จริง

ดูกลุ่ม

ByteDance

ตั้งแต่การสร้างวิดีโอระดับภาพยนตร์ไปจนถึงการสร้างภาพที่มีความละเอียดสูง โมเดลที่ทรงพลังที่สุดของ ByteDance พร้อมใช้งานแล้วบน Atlas Cloud รัน Seedance และ Seedream ในสเกลขนาดใหญ่ด้วยราคาการอนุมานที่ต่ำที่สุด และไม่มีค่าใช้จ่ายแฝงด้านโครงสร้างพื้นฐาน

ดูกลุ่ม

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด