
Grok Imagine Video 1.5 คือชุดโมเดลสร้างวิดีโอของ xAI สำหรับนักพัฒนาที่ต้องการควบคุมการเคลื่อนไหวจากพรอมต์และอินพุตภาพ สร้างภาพเคลื่อนไหวจากเฟรมเริ่มต้นด้วยคำสั่งการเคลื่อนไหวภาษาธรรมชาติ เลือก 480p หรือ 720p สำหรับเวิร์กโฟลว์อ้างอิง และเพิ่มเสียงอ้างอิงที่เป็นตัวเลือกเพื่อช่วยกำกับผลลัพธ์ เข้าถึงโหมดที่รองรับผ่านคีย์ Atlas Cloud เดียวที่เข้ากันได้กับ OpenAI พร้อมราคาแบบจ่ายตามการใช้งานที่โปร่งใส เริ่มพัฒนาได้วันนี้
Grok Imagine Video 1.5 พัฒนาโดย xAI โดย Atlas Cloud (ดำเนินการโดย Atlas Cloud AI LLC) เป็นผู้ให้บริการเข้าถึงโมเดลนี้ แต่ไม่ได้เป็นเจ้าของโมเดล เครื่องหมายการค้าทั้งหมดเป็นของเจ้าของที่เกี่ยวข้อง
สำรวจเอ็นด์พอยต์ 6 รายการที่เปลี่ยนข้อความ เฟรมเริ่มต้น หรือแอสเซ็ตอ้างอิงให้เป็นวิดีโอสำหรับเวิร์กโฟลว์ของนักพัฒนาและการใช้งานทั่วไป
| รูปแบบอินพุต | คำอธิบาย |
|---|---|
| Grok Imagine Video 1.5 Developer Reference-to-Video API | เปลี่ยนรูปภาพอ้างอิง 1–7 ภาพและเสียงอ้างอิง (หากมี) ให้เป็นวิดีโอพร้อมเสียงที่ซิงโครไนซ์ในตัว เอาต์พุตมีความยาวได้สูงสุด 15 วินาทีที่ความละเอียด 480p หรือ 720p เอ็นด์พอยต์นี้เหมาะสำหรับฉากที่กำกับด้วยข้อมูลอ้างอิงและคอนเซ็ปต์ภาพที่ต้องใช้รูปภาพต้นทางหลายภาพ |
| Grok Imagine Video 1.5 Reference-to-Video API | เอ็นด์พอยต์นี้สร้างวิดีโอโดยอ้างอิงจากรูปภาพ 1–7 ภาพ พร้อมเสียงที่ซิงโครไนซ์ในตัว และรองรับเสียงอ้างอิงเพิ่มเติมได้ วิดีโอมีความยาวสูงสุด 15 วินาทีที่ความละเอียด 480p หรือ 720p เลือกใช้สำหรับการสร้างวิดีโอจากข้อมูลอ้างอิงหลายรายการและลำดับภาพที่กำกับด้วยเสียง |
| Grok Imagine Video 1.5 Developer Text-to-Video API | เพียงใช้พรอมต์ข้อความก็สามารถสร้างวิดีโอพร้อมเสียงที่ซิงโครไนซ์ในตัวผ่านเอ็นด์พอยต์สำหรับนักพัฒนานี้ได้ สร้างคลิปความยาวสูงสุด 15 วินาทีที่ความละเอียด 480p, 720p หรือ 1080p เหมาะสำหรับคอนเซ็ปต์ที่ขับเคลื่อนด้วยพรอมต์ สตอรีบอร์ด และการผลิตวิดีโอขนาดสั้น |
| Grok Imagine Video 1.5 Text-to-Video API | สร้างวิดีโอโดยตรงจากพรอมต์ข้อความ พร้อมสร้างเสียงที่ซิงโครไนซ์ในตัว ตัวเลือกเอาต์พุตประกอบด้วย 480p, 720p และ 1080p โดยมีความยาวสูงสุด 15 วินาที ใช้สำหรับฉากตามบท คอนเซ็ปต์แคมเปญ หรือแอสเซ็ตวิดีโอสำหรับโซเชียลมีเดีย |
| Grok Imagine Video 1.5 Developer Image-to-Video API | เริ่มจากรูปภาพ 1 ภาพ แล้วใช้คำสั่งการเคลื่อนไหวด้วยภาษาธรรมชาติเพื่อสร้างวิดีโอแอนิเมชันผ่านเอ็นด์พอยต์สำหรับนักพัฒนานี้ รองรับความละเอียด 480p, 720p และ 1080p เหมาะสำหรับทำให้งานศิลป์ ภาพผลิตภัณฑ์ และเฟรมเปิดที่เตรียมไว้มีการเคลื่อนไหว |
| Grok Imagine Video 1.5 Image-to-Video API | ทำให้รูปภาพเฟรมเริ่มต้นเคลื่อนไหวด้วยการอธิบายการเคลื่อนไหวที่ต้องการเป็นภาษาธรรมชาติ วิดีโอที่ได้สามารถสร้างที่ความละเอียด 480p, 720p หรือ 1080p เวิร์กโฟลว์นี้รองรับการศึกษาการเคลื่อนไหว การเล่าเรื่องด้วยภาพ และการผลิตครีเอทีฟที่ใช้รูปภาพเป็นแกนหลัก |
Grok Imagine Video 1.5 รวมเวิร์กโฟลว์สำหรับข้อความ ภาพเริ่มต้น และภาพอ้างอิง 1 ถึง 7 ภาพเข้ากับเสียงที่ซิงโครไนซ์ในตัว เอาต์พุตสูงสุด 1080p และคลิปยาวสูงสุด 15 วินาทีในโหมดข้อความหรือโหมดอ้างอิง ขณะที่ Atlas Cloud มอบ API เดียวพร้อมการคิดค่าบริการตามการใช้งานที่โปร่งใส
เริ่มต้นด้วยพรอมต์ข้อความเพื่อสร้างคลิปยาวสูงสุด 15 วินาทีที่ความละเอียด 480p, 720p หรือ 1080p เสียงที่ซิงโครไนซ์ในตัวจะถูกสร้างมาพร้อมวิดีโอในกระบวนการสร้างเดียวกัน กำหนดฉากและการเคลื่อนไหวทั้งหมดผ่านคำบรรยายเป็นลายลักษณ์อักษรเมื่อไม่มีภาพต้นฉบับ เวิร์กโฟลว์นี้เหมาะกับภาพยนตร์คอนเซ็ปต์ การทดลองเชิงภาพยนตร์ และไปป์ไลน์คอนเทนต์ที่ขับเคลื่อนด้วยพรอมต์
เปลี่ยนเฟรมเริ่มต้นเพียงภาพเดียวให้เป็นลำดับภาพเคลื่อนไหวผ่านพรอมต์การเคลื่อนไหวด้วยภาษาธรรมชาติ เลือกเอาต์พุต 480p, 720p หรือ 1080p โดยให้ภาพกำหนดองค์ประกอบของฉากเปิด ระบุการเคลื่อนไหวของตัวแบบและฉากในพรอมต์ แล้วให้โมเดลสร้างแอนิเมชันต่อจากจุดยึดทางภาพนั้น เหมาะกับภาพสินค้า ช่วงเวลาของตัวละคร และภาพนิ่งที่กำกับด้านศิลป์ซึ่งต้องการการเคลื่อนไหว
กำกับ Grok Imagine Video 1.5 ด้วยภาพอ้างอิง 1 ถึง 7 ภาพและเสียงอ้างอิงที่เลือกใส่ได้ โหมดอ้างอิงสร้างคลิปยาวสูงสุด 15 วินาทีที่ความละเอียด 480p หรือ 720p พร้อมเสียงที่ซิงโครไนซ์ในตัว ใช้ข้อมูลเหล่านี้ชี้นำฉากที่สร้างขึ้นให้สอดคล้องกับทิศทางภาพที่กำหนดไว้ เวิร์กโฟลว์นี้เหมาะกับแคมเปญและเรื่องราวที่สร้างจากข้อมูลอ้างอิงเชิงสร้างสรรค์ที่มีอยู่แล้ว
วิดีโอและเสียงถูกสร้างขึ้นพร้อมกัน ทำให้ทุกคลิปมีเสียงที่ซิงโครไนซ์ในตัวได้โดยไม่ต้องผ่านขั้นตอนประมวลผลเสียงแยกต่างหาก ออกแบบฉากโดยอิงจากการกระทำที่มองเห็นได้ ซึ่งจังหวะสามารถเสริมให้ชัดเจนขึ้นด้วยแทร็กเสียงประกอบ สำหรับช่วงเวลาที่การซิงโครไนซ์เป็นสิ่งสำคัญ กระบวนการสร้างแบบรวมนี้ช่วยลดการส่งต่องานระหว่างการสร้างภาพและการผลิตเสียง เหมาะอย่างยิ่งกับฟุตเทจที่เน้นการแสดงและบรรยากาศ
ขยายจังหวะสำคัญทางภาพให้สมบูรณ์ผ่านคลิปข้อความหรือคลิปอ้างอิงที่ยาวสูงสุด 15 วินาที แทนที่จะหยุดอยู่ที่ลูปสั้น ๆ ระยะเวลานี้รองรับการปูพื้น การเคลื่อนไหว และบทสรุปที่ชัดเจนภายในลำดับภาพที่สร้างขึ้นชุดเดียว ใช้ช่วงเวลานี้ร่วมกับมุมกล้องที่เปลี่ยนไปและการเคลื่อนไหวต่อเนื่องเพื่อสร้างช่วงเหตุการณ์ที่มีรายละเอียดมากขึ้น ความยาวนี้เหมาะกับโฆษณาสั้น การเปิดเผยเนื้อเรื่อง และฉากวิดีโอบนโซเชียลมีเดีย
สลับไปมาระหว่างการสร้างจากข้อความ ภาพเริ่มต้น และภาพอ้างอิงผ่าน Atlas Cloud API เดียว พร้อมการคิดค่าบริการตามการใช้งานที่โปร่งใส เลือกเวิร์กโฟลว์ให้ตรงกับสินทรัพย์แต่ละประเภท แทนการบังคับให้ทุกไอเดียใช้รูปแบบอินพุตเดียวกัน การผสานรวมเดียวกันนี้เปิดให้นักพัฒนาเข้าถึง Grok Imagine Video v1.5 endpoints ทั้ง 6 รายการที่ระบุไว้ รวมถึงเส้นทางมาตรฐานและ Developer ช่วยให้การทดลองและการวางแผนการผลิตสำหรับงานวิดีโอหลากหลายรูปแบบทำได้ง่ายขึ้น
ดูว่า Grok Imagine Video 1.5 และทางเลือกอีกสองแบบจาก Atlas Cloud ตีความพรอมต์เดียวกันอย่างไร ทั้งฉากแอ็กชันแบบภาพยนตร์และแฟนตาซีเชิงสไตล์
ภาพยนตร์แฟนตาซีใต้น้ำสไตล์บาโรก ความยาว 9 วินาที ถ่ายแบบเทกเดียวภายในโรงอุปรากรที่ถูกทิ้งร้างและจมอยู่ใต้น้ำทั้งหมด: นักดำน้ำแบบฟรีไดฟ์ผู้สง่างาม ผมพลิ้วไหว สวมหน้ากากไข่มุกเรืองแสง ไล่ตามปลาหมึกยักษ์สีแดงปะการังสดที่คาบกุญแจทองเหลืองลวดลายประณีต ผ่านม่านกำมะหยี่ที่ลอยพลิ้ว เริ่มจากภายในพื้นเวทีที่แตกร้าว ด้วยช็อตเงยจากมุมต่ำอย่างดรามาติก ขณะที่เธอหมุนตัวแล้วพุ่งหัวลงผ่านรอยแยก จากนั้นเปลี่ยนเป็นการเคลื่อนกล้องติดตามด้านข้างระยะประชิด ขณะเธอลอดผ่านเก้าอี้โรงละครที่ล้มระเนระนาด โดยให้ผมและเครื่องแต่งกายตอบสนองต่อกระแสน้ำอย่างเป็นธรรมชาติ ขณะที่ม่านพองพลิ้วและฟองอากาศลอยเป็นทางผ่านซุ้มโค้งหลายชั้น จากนั้นโคจรรอบตัวเธอและยกกล้องขึ้น ขณะที่แรงดันน้ำกระชากโคมระย้าคริสตัลเหนือศีรษะให้หลุดออก ในช่วงไคลแมกซ์ เธอบิดตัวไปด้านข้างในจังหวะสุดท้ายเพื่อหลบโคมระย้าที่ร่วงลงมา ผลึกกระทบกันและกระจายออกอย่างสมจริง ขณะที่ปลาหมึกยักษ์ใช้หนวดที่ม้วนโค้งซับซ้อนรับกุญแจที่กำลังหมุนตกอย่างคล่องแคล่ว หยุดชั่วขณะอย่างเป็นพิธีการเคร่งขรึม แล้ววางกุญแจคืนลงบนมือที่แบออกของเธอ การเคลื่อนไหวต่อเนื่องลื่นไหล มีจุดเริ่มต้น–การไล่ล่า–บทสรุปที่ชัดเจน ตัวละครและหน้ากากไข่มุกคงรูปสม่ำเสมอ แสดงแรงต้านน้ำ แรงลอยตัว เนื้อผ้า เส้นผม ฟองอากาศ การเปลี่ยนรูปของหนวด แรงกระแทก และการหลบหลีกการชนอย่างถูกต้องตามหลักฟิสิกส์ ลำแสงสีไซแอนเย็นจากช่องแสงบนหลังคาที่แตกส่องตัดผ่านหอประชุมมืดมิดใต้น้ำ โดยสีแดงปะการังเป็นสีอิ่มตัวจัดเพียงสีเดียว ช่วยนำสายตาผ่านชั้นลึกของซุ้มโค้ง ม่าน เศษซากที่ลอยค้าง และฟองอากาศ การถ่ายภาพใต้น้ำแบบภาพยนตร์สมจริงระดับภาพถ่าย ผสานพื้นผิวคล้ายภาพวาดสีน้ำมันอย่างละเอียดอ่อน ความโอ่อ่าสง่างามแบบบาโรก แสงคอสติกเชิงปริมาตร รายละเอียดสูง ไม่มีข้อความ ไม่มีอินเทอร์เฟซ ไม่มีการตัดต่อที่ปลอมเป็นภาพนิ่ง เสียงสมจริงเต็มอารมณ์: เสียงก้องทุ้มอู้อี้ใต้น้ำ กระแสน้ำไหลเชี่ยว เสียงผ้าพลิ้ว ฟองอากาศ เสียงผลึกกระทบกัน และจังหวะออร์เคสตราตึงเครียดที่คลี่คลายเป็นเสียงฮาร์ปแผ่วเบาเพียงหนึ่งโน้ตเมื่อกุญแจถูกส่งคืน อัตราส่วนภาพ 16:9
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
โฆษณาแอ็กชันคอเมดี้แนวเซอร์เรียล ความยาว 9 วินาที ภายในร้านตัดผมสไตล์ยุค 1950 ที่มีรายละเอียดประณีตยิบย่อยในยามรุ่งสาง สุนัขพันธุ์โอลด์อิงลิชชีปด็อกขนรุงรังหน้าบึ้ง เปียกโชกไปด้วยฟองสบู่สีขาวหนา พุ่งทะลุประตูเข้ามาแล้ววิ่งเต็มแรงข้ามร้านพร้อมสะบัดฟองกระจายไปทั่ว ช่างตัดผมที่ตกใจจนผงะกระโดดขึ้นบนเก้าอี้หมุนแล้วขี่ไล่ตาม ใช้กรรไกรเล็มขนที่ปลิวว่อนของสุนัขอย่างรวดเร็ว โดยให้เสียงกรรไกรดังแกร๊กคมชัดทุกครั้งซิงก์ตรงกับจังหวะกลองแจ๊สที่กระแทกเร้าใจ เริ่มด้วยช็อตติดตามระดับพื้นสุดขีด วิ่งแข่งข้างอุ้งเท้าเปียกขณะที่มันไถลไปบนกระเบื้องลายตารางหมากรุกสีดำสลับขาวมันวาว ส่งหยดน้ำและฟองสบู่กระเซ็นเข้าหาเลนส์อย่างสมจริง จากนั้นแพนกล้องฉับพลันขึ้นด้านบนเข้าสู่ช็อตติดตามแบบวงกลมความเร็วสูง โดยใช้กระจกบานใหญ่สามบานเพื่อเผยให้เห็นและคงตำแหน่งที่เปลี่ยนไปของสุนัขกับช่างตัดผมผ่านภาพสะท้อนที่ซับซ้อนและแม่นยำอย่างต่อเนื่อง แล้วดอลลี่อินอย่างรวดเร็ว ขณะที่เศษขนที่ลอยอยู่ในอากาศร่วงหมุนวนและตกลงบนศีรษะของสุนัขได้พอดี ก่อตัวเป็นทรงผมปอมปาดัวร์สูงเว่อร์วัง สุนัขหยุดแล้วโพสท่าอย่างยโสในจังหวะฮีโร่คล้ายภาพหยุดนิ่งนาน 1 วินาที ก่อนจามกะทันหัน ปล่อยฟองสบู่และขนระเบิดฟุ้งกระจาย ขณะที่เพลงแจ๊สจบลงด้วยเสียงริมช็อตแบบตลกคมกริบ ไฟทังสเตนโทนอุ่นจากโคมไฟจริงภายในร้านตัดผ่านหมอกยามเช้าสีทีลเย็นด้านนอกหน้าต่าง จานสีวินเทจประกอบด้วยสีเบอร์กันดีเข้ม สีครีม ทองเหลืองขัดเงา และไม้สีเข้ม งานภาพโฆษณาไลฟ์แอ็กชันระดับพรีเมียม การออกแบบท่าเคลื่อนไหวความเร็วสูงแบบต่อเนื่องไร้รอยต่อ ตัวละครและความต่อเนื่องของพื้นที่คงรูปสม่ำเสมอ แสดงขนเปียก ฟองสบู่ เส้นขนที่หลุดลอย ภาพสะท้อน การหมุนของเก้าอี้ แรงเฉื่อย และการชนอย่างถูกต้องตามหลักฟิสิกส์ รายละเอียดสมจริงที่สัมผัสได้ ความเคลื่อนไหวคมชัด ไม่มีสโลว์โมชัน ไม่มีช็อตเปิดฉากโล่ง ๆ ไม่มีหน้าจอ ไม่มีอินเทอร์เฟซซอฟต์แวร์ ไม่มีแดชบอร์ด ไม่มีแถบความคืบหน้า ไม่มีกราฟ ไม่มีคำบรรยาย ไม่มีข้อความอธิบาย ไม่มีโลโก้ ไม่มีลายน้ำ อัตราส่วนภาพ 16:9
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video 1.5 เปลี่ยนพรอมต์ เฟรมต้นฉบับ และภาพอ้างอิงสูงสุด 7 ภาพให้เป็นวิดีโอสั้นพร้อมเสียงที่ซิงโครไนซ์ สำหรับแคมเปญ การนำเสนอผลิตภัณฑ์ เรื่องราวตัวละคร คอนเทนต์โซเชียล และการสร้างต้นแบบภาพอย่างรวดเร็ว
ทำให้ภาพนิ่งของผลิตภัณฑ์เคลื่อนไหวด้วยพรอมต์การเคลื่อนไหวภาษาธรรมชาติและเสียงที่ซิงโครไนซ์ สร้างคลิปสั้นเพื่อการนำเสนอสำหรับหน้าร้านค้า หน้าแคมเปญ สื่อเปิดตัว หรือพื้นที่โฆษณาแบบชำระเงินบนโซเชียลมีเดียที่ความละเอียดสูงสุด 1080p
กำกับฉากด้วยภาพอ้างอิงตัวละคร 1–7 ภาพ พร้อมเสียงอ้างอิงเสริม การตั้งค่านี้รองรับการปรากฏตัวซ้ำของนักแสดงชุดเดิม ฉากบทสนทนา และคลิปเรื่องเล่าสั้น ๆ พร้อมเสียงซิงโครไนซ์ในตัว
เริ่มจากพรอมต์ข้อความเพื่อสร้างวิดีโอที่สมบูรณ์พร้อมเสียงซิงโครไนซ์ในตัว ทีมการตลาดสามารถสำรวจแนวคิดแคมเปญ วิดีโอสร้างบรรยากาศ และทีเซอร์เปิดตัวได้โดยไม่ต้องเตรียมภาพต้นฉบับ
เปลี่ยนเฟรมเริ่มต้นเพียงเฟรมเดียวให้เกิดการเคลื่อนไหวด้วยคำสั่งภาษาธรรมชาติที่ความละเอียดสูงสุด 1080p สร้างสื่อแคมเปญขนาดกระชับสำหรับฟีด หน้าเปิดตัว ประกาศกิจกรรม อัปเดตผลิตภัณฑ์ และโพสต์ที่สร้างโดยครีเอเตอร์
ทำให้เฟรมสตอรีบอร์ดที่อนุมัติแล้วมีชีวิตด้วยการเคลื่อนไหวที่กำกับผ่านพรอมต์ โดยยังคงใช้เฟรมนั้นเป็นภาพเริ่มต้น ผู้กำกับและนักออกแบบสามารถสร้างช็อตพรีวิซสั้น ๆ พร้อมเสียงที่ซิงโครไนซ์เพื่อการตรวจทาน
ผสานภาพผลิตภัณฑ์ ภาพบุคลิกตัวละคร รายละเอียดเครื่องแต่งกาย และภาพอ้างอิงฉากจากภาพสูงสุด 7 ภาพ ทีมแบรนด์สามารถกำกับฉากโปรโมตสั้น ๆ พร้อมเสียงที่ซิงโครไนซ์ โดยยึดคำขอแต่ละรายการจากสื่อภาพที่จัดเตรียมไว้
เปรียบเทียบ Grok Imagine Video 1.5 กับโมเดล reference-to-video ชั้นนำในด้านอินพุตที่รองรับ ความยาวคลิป ความละเอียด เสียงที่ซิงโครไนซ์ และราคามาตรฐานต่อวินาที
| โมเดล | ประเภทอินพุต | ความยาวคลิป | ความละเอียดสูงสุด | เสียงในตัว | ราคามาตรฐาน |
|---|---|---|---|---|---|
| Grok Imagine Video v1.5 | ข้อความ, รูปภาพ, รูปภาพอ้างอิง, เสียงพูด | สูงสุด 15 วินาที | 1080p | √ | $0.08/วินาที |
| Seedance 2.0 Reference-to-Video | ข้อความ, รูปภาพ, วิดีโอ, เสียง | 4 ถึง 15 วินาที | 4K | √ | $0.112/วินาที |
| MiniMax H3 Reference-to-Video | ข้อความ, รูปภาพ, วิดีโอ, เสียง | 4 ถึง 15 วินาที | 2K | √ | $0.038/วินาที |
| Wan-2.7 Reference-to-video | ข้อความ, รูปภาพ, วิดีโอ, เสียง | 2 ถึง 10 วินาที | 1080p | √ | $0.10/วินาที |
เริ่มต้นได้ในไม่กี่นาที — ทำตามขั้นตอนง่าย ๆ เหล่านี้เพื่อเชื่อมต่อและใช้งานโมเดลผ่านแพลตฟอร์ม Atlas Cloud
สมัครสมาชิกที่ atlascloud.ai และยืนยันตัวตน ผู้ใช้ใหม่จะได้รับเครดิตฟรีเพื่อสำรวจแพลตฟอร์มและทดสอบโมเดล
การรวมโมเดล Grok Imagine Video 1.5 ขั้นสูงเข้ากับแพลตฟอร์มที่เร่งด้วย GPU ของ Atlas Cloud ให้ประสิทธิภาพ ความสามารถในการขยาย และประสบการณ์นักพัฒนาที่ไม่มีใครเทียบได้
เวลาแฝงต่ำ:
inference ที่ปรับแต่ง GPU เพื่อการตอบสนองแบบเรียลไทม์
API แบบรวมศูนย์:
รัน Grok Imagine Video 1.5, GPT, Gemini และ DeepSeek ด้วยการเชื่อมต่อเดียว
ราคาโปร่งใส:
ชำระเงินต่อโทเค็นที่คาดเดาได้พร้อมตัวเลือก serverless
ประสบการณ์นักพัฒนา:
SDK, การวิเคราะห์, เครื่องมือปรับแต่ง และเทมเพลต
ความน่าเชื่อถือ:
ความพร้อมใช้งาน 99.99%, RBAC และการบันทึกที่พร้อมสำหรับการปฏิบัติตาม
ความปลอดภัยและการปฏิบัติตาม:
SOC 2 Type II, สอดคล้อง HIPAA, อธิปไตยข้อมูลในสหรัฐอเมริกา
Grok Imagine Video 1.5 คือกลุ่มโมเดลสร้างวิดีโอของ xAI สำหรับสร้างคลิปจากข้อความ ภาพเริ่มต้น หรือภาพอ้างอิงหลายภาพ ผ่าน Atlas Cloud นักพัฒนาสามารถเข้าถึง endpoint แยกตามโหมดการสร้างแต่ละแบบได้
มี 3 โหมด ได้แก่ text-to-video, image-to-video และ reference-to-video เลือก text เพื่อสร้างฉากตั้งแต่ต้น เลือก image เพื่อทำให้เฟรมเริ่มต้นเคลื่อนไหว หรือเลือกโหมด reference เพื่อกำหนดแนวทางให้กับบุคคล วัตถุ และสไตล์ด้วยภาพหลายภาพ
สร้างคีย์ Atlas Cloud API แล้วส่งคำขอที่ผ่านการยืนยันตัวตนไปยัง endpoint สร้างวิดีโอ พร้อมระบุ model ID ที่เหมาะสม ใช้ task ID ที่ได้รับกลับมาเพื่อตรวจสอบสถานะการสร้างและดึง URL ของวิดีโอที่เสร็จสมบูรณ์แล้ว
text-to-video ต้องใช้พรอมต์ภาษาธรรมชาติ ส่วน image-to-video จะเพิ่มภาพเฟรมเริ่มต้น 1 ภาพ reference-to-video รับพรอมต์และภาพอ้างอิงตั้งแต่ 1 ถึง 7 ภาพ พร้อมรองรับ voice ID แบบพรีเซ็ตสำหรับบทสนทนาที่สร้างขึ้น
สคีมา Atlas Cloud ที่มีอยู่รองรับคลิปความยาวตั้งแต่ 1 ถึง 15 วินาที text-to-video และ image-to-video รองรับเอาต์พุต 480p, 720p หรือ 1080p ส่วน reference-to-video รองรับ 480p หรือ 720p
รองรับ โดย text-to-video จะสร้างเสียงซิงโครไนซ์ในตัวจากพรอมต์ และ reference-to-video สามารถผสานเสียงที่สร้างขึ้นกับเสียงพรีเซ็ตที่เลือกใช้สำหรับบทสนทนาได้
Atlas Cloud ระบุราคาพื้นฐานมาตรฐานที่ $0.08 สำหรับแต่ละ endpoint ที่อยู่ในหน้านี้ โปรดตรวจสอบรายละเอียดการเรียกเก็บเงินปัจจุบันของ endpoint ที่เลือกก่อนนำไปใช้งานจริง เนื่องจากข้อมูลราคาที่ให้มาไม่ได้ระบุหน่วยการเรียกเก็บเงิน
ส่งภาพจำนวน 1 ถึง 7 ภาพผ่าน endpoint reference-to-video ระบุแอสเซ็ตแต่ละรายการในพรอมต์ด้วยแท็ก เช่น <IMAGE_0> และ <IMAGE_1> เพื่อให้โมเดลเชื่อมโยงภาพอ้างอิงแต่ละภาพกับบุคคลหรือองค์ประกอบฉากที่ต้องการได้
สคีมา Atlas Cloud ที่มีอยู่ไม่มีพารามิเตอร์เฉพาะสำหรับเฟรมสุดท้าย image-to-video ใช้ภาพ 1 ภาพเป็นเฟรมเริ่มต้น ส่วน reference-to-video ใช้ภาพ 1 ถึง 7 ภาพเป็นแนวทางด้านภาพ โดยไม่ได้รับประกันว่าจะเป็นเฟรมแรกและเฟรมสุดท้าย
เลือก reference-to-video เมื่อจำเป็นต้องใช้ภาพหลายภาพเพื่อกำหนดแนวทางให้กับบุคคล วัตถุ หรือสไตล์ภาพในฉากใหม่ ใช้ image-to-video เมื่อควรใช้ภาพที่มีอยู่ 1 ภาพเป็นเฟรมเปิด และต้องการให้การเคลื่อนไหวเป็นไปตามพรอมต์ภาษาธรรมชาติ
คู่มือ บทแนะนำ และอัปเดตผลิตภัณฑ์ ที่ช่วยให้คุณใช้ Atlas Cloud ได้อย่างเต็มประสิทธิภาพ