MiniMax H3 Developer เปิดตัวแล้ววันนี้ — ลด 60% เริ่มต้นเพียง $0.02 ต่อวินาที
Hero background 1Hero background 2Hero background 3
Grok Imagine API for 15 Second Video

Grok Imagine API for 15 Second Video

Grok Imagine API ครอบคลุมโมเดลรูปภาพ วิดีโอ และพูดของ xAI ตั้งแต่ Image 2.0 ถึง Video 1.5 และ xAI TTS v1 สร้างรูปภาพนิ่ง 1K หรือ 2K ในอัตราส่วน 14 แบบ ขยายฉากไปยัง 15 วินาทีของวิดีโอ 1080p ควบคุมภาพด้วยรูปภาพอ้างอิงได้ถึง 7 รูป หรือเพิ่มบรรยายเสียงในภาษา 20 ภาษา Atlas Cloud รันทุกโหมดบนเอนด์พอยต์เดียว มีราคาแบบจ่ายตามการใช้งาน ตั้งแต่ $0.02 ต่อรูปภาพและ $0.05 ต่อวินาที เริ่มสร้างวันนี้

Grok Imagine พัฒนาโดย xAI โดย Atlas Cloud (ดำเนินการโดย Atlas Cloud AI LLC) เป็นผู้ให้บริการเข้าถึงโมเดลนี้ แต่ไม่ได้เป็นเจ้าของโมเดล เครื่องหมายการค้าทั้งหมดเป็นของเจ้าของที่เกี่ยวข้อง

สำรวจโมเดลชั้นนำ

Atlas Cloud มอบโมเดลสร้างสรรค์ล่าสุดที่นำหน้าในอุตสาหกรรมให้กับคุณ

ปลายทาง Grok Imagine API ทั้งหมด ตั้งแต่รูปภาพหนึ่งไปจนถึงเสียง

จับคู่ Grok Imagine API model ที่เหมาะสมกับประเภทอินพุต ความยาวเอาต์พุต ความละเอียด และราคาต่อการเรียก

โมดาลคำอธิบาย
Grok Imagine Image 2.0 T2I API (Text to Image)เขียนพรอมพ์ได้สูงสุด 8,000 อักขระ ปลายทางนี้จะส่งคืนรูปภาพ 1-4 ภาพที่ความละเอียด 1K หรือ 2K ชั้นคุณภาพต่ำหรือปานกลางช่วยให้แลกเปลี่ยนความพยายามในการเรนเดอร์เพื่อความเร็วโดยราคา $0.04 ต่อรูปภาพ เหมาะสำหรับการสำรวจแนวคิด สร้างสรรค์สำหรับโซเชียลมีเดีย และการผลิตภาพหมู่ที่ปริมาณเป็นสิ่งสำคัญ
Grok Imagine Image 2.0 Edit API (Image to Image)ส่งรูปภาพอ้างอิง 1-3 ภาพพร้อมคำสั่งภาษาธรรมชาติ ผลลัพธ์ที่แก้ไขจะกลับมาที่ 1K หรือ 2K ในอัตราส่วนภาพที่ตั้งไว้หรืออัตโนมัติ ชั้นคุณภาพต่ำและปานกลางเดียวกันใช้ได้ และแต่ละรูปภาพมีค่า $0.04 การปรับเปลี่ยนผลิตภัณฑ์ การแลกเปลี่ยนพื้นหลัง และตัวแปรการออกแบบอย่างรวดเร็วทั้งหมดทำงานผ่านการเรียกครั้งเดียว
Grok Imagine Image Quality T2I API (Text to Image)เมื่อรายละเอียดที่ละเอียดมีความสำคัญ ปลายทางนี้แปลงพรอมพ์ข้อความเป็นรูปภาพคงที่ที่แต่งแต้มในระดับ 1K หรือ 2K และส่งคืนตัวแปรได้สูงสุด 4 ตัวต่อการร้องขอที่ $0.05 ต่อรูปภาพ อัตราส่วนภาพครอบคลุมสี่เหลี่ยมจัตุรัส แนวตั้ง แนวนอน และอัลตราไวด์ ใช้สำหรับรูปภาพหลัก สร้างสรรค์โฆษณา และการเรนเดอร์ผลิตภัณฑ์ระดับแบรนด์
Grok Imagine Image Quality Edit API (Image to Image)ป้อนรูปภาพต้นฉบับ 1-8 ภาพพร้อมคำสั่งการแก้ไข รับเวอร์ชันแก้ไขแล้วที่ 1K หรือ 2K ด้วย $0.05 ต่อรูปภาพ การอ้างอิงหลายรูปภาพจะถูกอ้างถึงแบบอินไลน์เป็น <IMAGE_0> และ <IMAGE_1> ดังนั้นหัวข้อและสไตล์สามารถรวมเข้าในคำสั่งเดียวได้ การปรับปรุงแคมเปญ การโอนสไตล์ และการแก้ไขประกอบคือการใช้งานทั่วไป
Grok Imagine Image T2I API (Text to Image)ปลายทางแปลงข้อความเป็นรูปภาพต้นฉบับสนับสนุนเอาต์พุต 1K และ 2K พร้อมบัตช์รูปภาพ 4 ภาพในราคารูปภาพต่ำสุดในตระกูล $0.02 ต่อรูปภาพ ทำให้เป็นค่าเริ่มต้นที่ใช้ได้จริงสำหรับไปป์ไลน์ปริมาณสูง การสร้างรูปขนาดย่อ และการทดสอบพรอมพ์อย่างรวดเร็ว
Grok Imagine Image Edit API (Image to Image)ต้องการการแก้ไขแบบเบาที่ขนาดใหญ่ ปลายทางนี้ยอมรับรูปภาพ 1-8 ภาพพร้อมคำสั่งข้อความ และส่งคืนผลลัพธ์ที่แก้ไขแล้วได้สูงสุด 4 ภาพที่ 1K หรือ 2K ด้วย $0.02 ต่อรูปภาพ การล้างแค็ตตาล็อก ตัวแปรตามฤดูกาล และการส่งผ่านการออกแบบแบบวนซ้ำยังคงราคาไม่แพง
Grok Imagine Video v1.5 T2V API (Text to Video)พรอมพ์เพียงอย่างเดียวสร้างวิดีโอระยะเวลา 1-15 วินาที พร้อมเสียงซิงโครไนซ์แบบดั้งเดิมที่ 480p, 720p หรือ 1080p ครอบคลุมอัตราส่วนภาพ 7 แบบ การเรียกเก็บเงินคือ $0.08 ต่อวินาทีของเอาต์พุต โปรโมโตรสินค้า โฆษณาสื่อสังคม และฉากเล่าเรื่องที่ต้องให้เสียงเข้าไปเหมาะสมที่สุด
Grok Imagine Video v1.5 I2V API (Image to Video)ให้เฟรมเริ่มต้นและพรอมพ์การเคลื่อนไหว v1.5 จะสร้างภาพเคลื่อนไหวเป็นระยะเวลาสูงสุด 15 วินาทีที่ความละเอียดถึง 1080p พร้อมเสียงที่สร้างในการส่งผ่านเดียวกัน ต้นทุนอยู่ที่ $0.08 ต่อวินาที การหมุนผลิตภัณฑ์ ภาพเคลื่อนไหวเหมือน และสินทรัพย์แคมเปญจากรูปนิ่งไปยังการเคลื่อนไหวพอดี
Grok Imagine Video v1.5 R2V API (Reference to Video)ภาพอ้างอิง 1-7 ภาพกำหนดตัวอักษร วัตถุ และสไตล์บนหน้าจอ ขณะที่เสียงได้สูงสุด 3 เสียงที่เลือกจากพรีเซต 26 รายการขับเสียงพูด เอาต์พุตถึง 15 วินาทีที่ 480p หรือ 720p ด้วย $0.08 ต่อวินาที การเล่าเรื่องที่ตัวอักษรสอดคล้องกัน การลองใส่เสมือน และมาสคอตแบรนด์ได้ประโยชน์มากที่สุด
Grok Imagine Video T2V API (Text to Video)พรอมพ์ข้อความกลายเป็นคลิป 1-15 วินาทีที่ 480p หรือ 720p โดยมีอัตราส่วนภาพ 7 แบบครอบคลุมรูปแบบแนวนอน สี่เหลี่ยม และแนวตั้ง ที่ $0.05 ต่อวินาที เป็นตัวเลือกคุณค่าสำหรับเนื้อหาโซเชียลมีเดียและบอร์ดแนวคิดอย่างรวดเร็ว
Grok Imagine Video I2V API (Image to Video)ยึดภาพคงที่เป็นเฟรมแรก อธิบายการเคลื่อนไหวที่คุณต้องการ คลิปจะขยายไปถึง 15 วินาทีที่ 480p หรือ 720p ราคาอยู่ที่ $0.05 ต่อวินาที ซึ่งทำให้การสร้างภาพเคลื่อนไหวจำนวนมากของรูปภาพผลิตภัณฑ์และภาพเหมือนราคาไม่แพง
Grok Imagine Video R2V API (Reference to Video)ภาพอ้างอิง 1-7 ภาพกำหนดตัวอักษร วัตถุ และสไตล์บนหน้าจอโดยไม่ตรึงเฟรมเปิดคงที่ คลิปทำงานได้สูงสุด 10 วินาทีที่ 480p หรือ 720p และมีค่า $0.05 ต่อวินาที ใช้เมื่อความเป็นตัวตนและสไตล์ต้องคงสอดคล้องกันในแต่ละฉาก
Grok Imagine Video Extend API (Video Extension)ไฟล์ mp4 ที่มีอยู่ระยะ 2-15 วินาทีสามารถดำเนินการต่อด้วย 2-10 วินาทีเพิ่มเติมได้ โดยมีพรอมพ์ที่กำหนดว่าจะเกิดอะไรขึ้นต่อไป เอาต์พุตจะตรงกับวิดีโอต้นฉบับและถูกจำกัดไว้ที่ 720p โดยเรียกเก็บ $0.07 ต่อวินาที มันมีประโยชน์สำหรับการยืดการตัดสั้น ๆ ไปยังความยาวโฆษณาที่ต้องการ
Grok Imagine Video Edit API (Video to Video)คำสั่งภาษาธรรมชาติเขียนไฟล์ mp4 ที่มีอยู่ใหม่ขณะที่ฉากต้นฉบับ การเคลื่อนไหว และการจัดเฟรมยังคงเหมือนเดิม เอาต์พุตรักษาระยะเวลาต้นฉบับ จำกัดไว้ที่ 8.7 วินาที และการเรียกเก็บเงินตามวิดีโออินพุตที่ $0.07 ต่อวินาที การเพิ่มอุปกรณ์ประกอบ การเปลี่ยนเสื้อผ้า และการจัดแต่งทรงผมใหม่เกิดขึ้นโดยไม่ต้องถ่ายภาพใหม่
xAI TTS v1 API (Text to Speech)ข้อความจนถึง 15,000 อักขระเปลี่ยนเป็นเสียงธรรมชาติที่มีเวลาตอบสนองต่ำกว่าวินาทีในภาษา 20 ภาษา พร้อมการตรวจหาภาษาอัตโนมัติที่พร้อมใช้งาน การส่งมอบสามารถปรับแต่งได้: ความเร็วในการเล่นจาก 0.7x ถึง 1.5x, codecs รวมถึง mp3, wav และ pcm และอัตราการสุ่มตัวอย่างสูงถึง 48 kHz บรรยายเสียง พรอมพ์ IVR และการบรรยายในแอปเป็นการใช้งานที่เหมาะสม

คุณสมบัติหลักของ Grok Imagine API

สำรวจสิ่งที่ Grok Imagine API นำเสนอ ตั้งแต่การสร้างภาพความละเอียด 2K ด้วยข้อความหลายภาษา ไปจนถึงวิดีโอหลายรูปแบบพร้อมเสียงซิงโครไนซ์แบบเนทีฟและโหมดสร้างสรรค์ต่างๆ

การเรนเดอร์ความละเอียดสูงพิเศษโดยใช้ API คุณภาพรูปภาพ Grok Imagine

การเรนเดอร์ความละเอียดสูงพิเศษโดยใช้ API คุณภาพรูปภาพ Grok Imagine

Grok Imagine Image Quality API นำเสนอการสร้างรูปภาพที่ความละเอียดสูงสุด 2K พร้อมรายละเอียดที่คมชัดในทุกผลลัพธ์ ด้วยการรักษารายละเอียดพื้นผิวที่ละเอียดอ่อนและองค์ประกอบที่ซับซ้อนเมื่อขยายขนาด ผู้ใช้สามารถสร้างภาพที่ยังคงความคมชัดแม้จะแสดงในรูปแบบที่มีขนาดใหญ่พิเศษ นี่คือโซลูชันขั้นสูงสุดสำหรับภาพหลัก ชิ้นงานโฆษณา และภาพเรนเดอร์ผลิตภัณฑ์ระดับแบรนด์

การเรนเดอร์ข้อความหลายภาษา

การเรนเดอร์ข้อความหลายภาษา

Grok Imagine Image Quality API นำเสนอการเรนเดอร์ข้อความที่ดีที่สุดในระดับเดียวกัน รองรับหลายภาษาโดยตรงภายในภาพที่สร้างขึ้น ด้วยการจำลองการจัดรูปแบบตัวอักษร สคริปต์ และอักขระในทุกภาษาได้อย่างแม่นยำ ผู้ใช้จึงสามารถฝังข้อความที่อ่านได้ลงในชิ้นงานภาพโดยไม่ต้องปรับแต่งแก้ไขภาพด้วยตนเองในภายหลัง นี่คือโซลูชันขั้นสูงสุดสำหรับงานโฆษณา แคมเปญการตลาดที่ปรับให้เข้ากับท้องถิ่น และภาพระดับแบรนด์

การสร้างภาพสมจริง

การสร้างภาพสมจริง

Grok Imagine API สร้างผลลัพธ์ที่สมจริงราวกับภาพถ่าย โดยมีจุดเด่นอยู่ที่แสงธรรมชาติ พื้นผิวที่สมบูรณ์ และฟิสิกส์ที่น่าเชื่อถือในทุกฉาก ด้วยการจำลองทัศนศาสตร์และพฤติกรรมของวัสดุในโลกแห่งความเป็นจริง ผู้ใช้จึงสามารถสร้างภาพที่แยกไม่ออกจากการถ่ายภาพระดับมืออาชีพด้วยตาเปล่า นี่คือสุดยอดโซลูชันสำหรับการเรนเดอร์ผลิตภัณฑ์ ภาพฮีโร่ และภาพลักษณ์ของแบรนด์ระดับไฮเอนด์

การควบคุมพรอมต์ที่แม่นยำและการแก้ไขอิงตามข้อมูลอ้างอิง

การควบคุมพรอมต์ที่แม่นยำและการแก้ไขอิงตามข้อมูลอ้างอิง

Grok Imagine Image Quality API รองรับการปฏิบัติตาม prompt ที่แม่นยำยิ่งขึ้น ควบคู่ไปกับการแก้ไขภาพขั้นสูงที่ขับเคลื่อนโดยข้อมูลอ้างอิงที่ป้อนเข้า ด้วยการตีความคำแนะนำโดยละเอียดและการจับคู่สไตล์จากภาพอ้างอิงที่อัปโหลด ผู้ใช้สามารถปรับแต่งและปรับเปลี่ยนสไตล์ของภาพได้อย่างแม่นยำระดับพิกเซล นี่คือโซลูชันขั้นสูงสุดสำหรับงานโฆษณาเชิงสร้างสรรค์ การเรนเดอร์ผลิตภัณฑ์ และภาพที่ได้มาตรฐานของแบรนด์อย่างสม่ำเสมอ

การสร้างเสียงและวิดีโอแบบเนทีฟ

การสร้างเสียงและวิดีโอแบบเนทีฟ

สร้างเพลง เอฟเฟกต์เสียง และบทสนทนาที่ซิงค์กับแต่ละคลิปโดยอัตโนมัติ เพื่อให้เสียงและการเคลื่อนไหวสอดคล้องกันในขั้นตอนเดียว คลิปไม่ต้องผ่านขั้นตอนจัดการเสียงแยกต่างหาก และพร้อมใช้งานได้ทันที

การสร้างวิดีโอแบบมัลติโมดัล

การสร้างวิดีโอแบบมัลติโมดัล

ครอบคลุมทั้งการแปลงข้อความเป็นวิดีโอ รูปภาพเป็นวิดีโอ ข้อมูลอ้างอิงเป็นวิดีโอ และการตัดต่อวิดีโอภายในชุดเครื่องมือเดียว คุณสามารถสลับระหว่างงานสร้างและงานตัดต่อได้โดยไม่ต้องเปลี่ยนโมเดลหรือระบบที่ผสานการทำงาน

การควบคุมการเคลื่อนไหวและความสอดคล้อง

การควบคุมการเคลื่อนไหวและความสอดคล้อง

Grok Imagine Video API สร้างการเคลื่อนไหวที่เป็นธรรมชาติพร้อมระบบฟิสิกส์ที่เสถียรและวัตถุที่สอดคล้องกันในทุกเฟรม สิ่งนี้ช่วยลดการกะพริบและความผิดเพี้ยนของภาพในคลิปที่ยาวขึ้น ทำให้ตัวละครและฉากมีความสอดคล้องกันตั้งแต่ต้นจนจบ

หนึ่งคำสั่ง สร้างสามโมเดล: เปรียบเทียบ Grok Imagine API

แต่ละแถวใช้คำสั่งเดียวกันผ่าน Grok Imagine API และคู่แข่งสองโมเดลบน Atlas Cloud เพื่อให้สามารถประเมินการเคลื่อนไหว การซิงค์เสียง รายละเอียด และไทโปกราฟีได้อย่างเท่าเทียม

พรอมต์

ฉากตลาดกลางคืนสไตล์ภาพยนตร์ไลฟ์แอคชั่น ความยาวประมาณ 10 วินาที เปิดด้วยช็อตติดตามมุมต่ำที่ลื่นไหลผ่านแผงขายของที่มีไอระเหยลอยขึ้น ขณะพ่อครัววัยหนุ่มในเสื้อกล้ามเปียกน้ำกำลังเหวี่ยงเส้นบะหมี่ในกระทะ พร้อมเปลวไฟพุ่งขึ้นจากกระทะและส่องใบหน้าของเขาเป็นสีส้ม กล้องหมุนไปทางขวาอย่างรวดเร็วเข้าสู่ช็อตมาโครใกล้ของกุ้งที่กำลังทอดในน้ำมัน หยดน้ำมันกระเด็น แล้วกล้องถอยหลังและยกขึ้นเหนือเคาน์เตอร์ ขณะที่เขาจับกระทะที่หมุนอยู่และตักบะหมี่ใส่จานในการเคลื่อนไหวต่อเนื่องครั้งเดียว ช่วงท้าย: แมวจรจัดตัวหนึ่งกระโดดขึ้นบนเคาน์เตอร์ แย่งกุ้งหนึ่งตัวแล้ววิ่งหายเข้าไปในฝูงชน ขณะที่พ่อครัวหมุนตัวกลับพร้อมเสียงหัวเราะ กล้องเปลี่ยนเป็นโหมดมือถือเร็วไล่ตามหลังแมว ถนนแอสฟัลต์เปียกสะท้อนแสงโคมไฟสีแดง ไอระเหยลอยคว้าง โฟกัสตื้น ให้ลุคหนังสารคดีหยาบๆ พร้อมเม็ดฟิล์มละเอียด เสียง: เตาแก๊สจุดระเบิด เสียงน้ำมันกระเดาะ เสียงจอแจในตลาดและเสียงทัพพีกระทบกัน ลวดลายกลองที่เพิ่มขึ้นเรื่อยๆ และลงจังหวะพอดีกับการกระโดดของแมว อัตราส่วนภาพ 16:9

Generated with Grok Imagine Video v1.5 on Atlas Cloud

Generated with Veo3.1 on Atlas Cloud

Generated with Grok Imagine Video on Atlas Cloud

พรอมต์

Extreme macro photograph shot at tabletop level, camera lens resting flat on the wooden desk surface at the eye height of a 1:64 scale figure, looking horizontally across a miniature modeling workbench in the exact instant the illusion of scale becomes real. In the mid-ground, a wave of blue-tinted epoxy resin has been frozen mid-curl, its surface just misted with a water sprayer so genuine droplets bead and cling to the glossy resin; three tiny hand-painted surfers in bright orange swim trunks ride down the face of the frozen wave, one crouched low with an arm dragging through the resin, and a spray of real water beads flings off the wave's lip, caught sharp in mid-air with tiny burst highlights on every droplet edge. Behind them, softly out of focus, the hand of a young woman modelmaker hovers in the air holding fine steel tweezers, suspended and enormous like a giant who has wandered into the world she built; only the lower half of her face is visible at the top of the frame, the corner of her mouth curved into a small delighted smile, all of it dissolved into creamy bokeh. Late-afternoon hard sunlight cuts through venetian blinds, painting a row of crisp diagonal light bars and clean shadows across the bare wood and over the resin sea, striping the surfers' shoulders. A single dropped, out-of-focus miniature part — a stray plastic sprue fragment — sits in the extreme foreground as a blurred occluding layer at the lower left, separating planes; strips of blue masking tape edge the resin sea, and negative space is left on the right side for the hovering tweezers. Complementary orange-and-blue palette: cool blue resin and blue tape against warm orange trunks, grounded by the warm honey tone of the oak desk. Shot on 100mm f/2.8 macro lens, ultra-shallow depth of field with buttery focus falloff, telephoto compression from an ultra-low camera position, visible fine film grain, true photographic realism, no illustration, no CGI look. Wide 16:9 aspect ratio, full-bleed horizontal composition.

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud

สร้างผลงานข้ามภาพ วิดีโอ และเสียงด้วย Grok Imagine API

ทุกเวิร์กโฟลว์ด้านล่างทำงานด้วยคีย์ OpenAI-compatible เดียว ทีมจึงเคลื่อนแนวคิดจากภาพร่างภาพ ผ่านการแก้ไขภาพอ้างอิง ไปจนถึงวิดีโอพร้อมเสียงประสานและเสียงบรรยายที่แปลท้องถิ่นได้ โดยไม่ต้องเปลี่ยน stacks

การสร้างแนวคิดอย่างรวดเร็วด้วย Grok Imagine API

Image 2.0 คืน 1K drafts ภายในประมาณสิบวินาทีบน low quality tier และให้ถึงสี่ variants ต่อ call ทีมดีไซน์สแกนหลายทิศทางตั้งแต่เนิ่นๆ แล้ว re-render ตัวที่ชนะที่ 2K

การประกอบภาพผลิตภัณฑ์จากหลายภาพอ้างอิง

ป้อนภาพอ้างอิงได้สูงสุดสามภาพเข้าสู่ Grok Imagine Image 2.0 Edit แล้วอธิบายการเปลี่ยนแปลงด้วยภาษาธรรมดา ทีม e-commerce สลับพื้นหลัง ปรับสไตล์บรรจุภัณฑ์ และรักษาผลิตภัณฑ์เดียวให้คงที่ทั่วแคตตาล็อก

เสียงพากย์และบรรยายหลายภาษา

xAI TTS v1 แปลงสคริปต์เป็นเสียงพูดที่มีอารมณ์ร่วมข้ามยี่สิบภาษาและมากกว่าแปดสิบเสียงด้วย latency ต่ำกว่าหนึ่งวินาที ทีมผลิตภัณฑ์จับคู่กับวิดีโอที่สร้างได้สำหรับโฆษณาที่แปลท้องถิ่น บทสอน และเสียงบรรยายในแอป

วิดีโอ Grok Imagine API พร้อมเสียงต้นฉบับ

Grok Imagine Video v1.5 เขียนดนตรี effects และบทสนทนาที่ประสานกับภาพในคลิปยาวถึงสิบห้าวินาทีที่ 1080p ทีมการตลาดได้สปอตที่เสร็จในหนึ่ง pass โดยไม่ต้องมี session เสียงแยก

การเล่าเรื่องโดยรักษาตัวละครให้คงที่ด้วย Grok Imagine API

ต้องการตัวละครเดียวกันในทุกช็อต? Reference-to-video ยอมรับหนึ่งถึงเจ็ดภาพอ้างอิง плюс reference voice ที่ไม่บังคับ ผู้สร้างซีรีส์จึงรักษาอัตลักษณ์และโทนเสียงให้คงที่ตลอดคลิปสิบห้าวินาที

หลังการผลิตโดยไม่ต้องถ่ายทำใหม่

ฟุตเทจที่มีอยู่สามารถปรับสไตล์ผ่านการแก้ไขด้วยภาษาธรรมชาติ หรือต่อด้วย extension ยี่สิบถึงสิบวินาทีที่ตรงกับต้นฉบับ ทีมหลังการผลิตแก้ไข props เครื่องแต่งกาย และจังหวะได้โดยไม่ต้องกลับไปที่ set

เปรียบเทียบโมเดล

ดูว่าโมเดลจากผู้ให้บริการต่างๆ เปรียบเทียบกันอย่างไร — เปรียบเทียบประสิทธิภาพ ราคา และจุดแข็งเฉพาะตัวเพื่อตัดสินใจอย่างมีข้อมูล

โมเดลจำนวนภาพอ้างอิงสูงสุดจำนวนผลลัพธ์ความละเอียดอัตราส่วนภาพ
Grok Imagine Image Quality81~42K, 1KAuto, 1:1, 3:2, 2:3, 3:4, 4:3, 9:16, 16:9, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1
Nano Banana 21414K, 2K, 1K1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Nano Banana Pro1014K, 2K, 1K1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Seedream 5.0 Lite141~152K~4K+1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Qwen-Image31~6512P~2KWidth[512, 2048]px, Height[512, 2048]px

วิธีใช้ Grok Imagine บน Atlas Cloud

เริ่มต้นได้ในไม่กี่นาที — ทำตามขั้นตอนง่าย ๆ เหล่านี้เพื่อเชื่อมต่อและใช้งานโมเดลผ่านแพลตฟอร์ม Atlas Cloud

สร้างบัญชี Atlas Cloud

สมัครสมาชิกที่ atlascloud.ai และยืนยันตัวตน ผู้ใช้ใหม่จะได้รับเครดิตฟรีเพื่อสำรวจแพลตฟอร์มและทดสอบโมเดล

ทำไมต้องใช้ Grok Imagine บน Atlas Cloud

การรวมโมเดล Grok Imagine ขั้นสูงเข้ากับแพลตฟอร์มที่เร่งด้วย GPU ของ Atlas Cloud ให้ประสิทธิภาพ ความสามารถในการขยาย และประสบการณ์นักพัฒนาที่ไม่มีใครเทียบได้

ประสิทธิภาพและความยืดหยุ่น

เวลาแฝงต่ำ:
inference ที่ปรับแต่ง GPU เพื่อการตอบสนองแบบเรียลไทม์

API แบบรวมศูนย์:
รัน Grok Imagine, GPT, Gemini และ DeepSeek ด้วยการเชื่อมต่อเดียว

ราคาโปร่งใส:
ชำระเงินต่อโทเค็นที่คาดเดาได้พร้อมตัวเลือก serverless

องค์กรและขนาด

ประสบการณ์นักพัฒนา:
SDK, การวิเคราะห์, เครื่องมือปรับแต่ง และเทมเพลต

ความน่าเชื่อถือ:
ความพร้อมใช้งาน 99.99%, RBAC และการบันทึกที่พร้อมสำหรับการปฏิบัติตาม

ความปลอดภัยและการปฏิบัติตาม:
SOC 2 Type II, สอดคล้อง HIPAA, อธิปไตยข้อมูลในสหรัฐอเมริกา

คำถามที่นักพัฒนาถามเกี่ยวกับ Grok Imagine API

Grok Imagine API เป็นจุดเข้าถึงแบบรวมจาก Atlas Cloud สำหรับชุดสร้างภาพของ xAI ที่ครอบคลุมการสร้างภาพ การแก้ไขภาพ วิดีโอ และการสร้างเสียง โดยมีคีย์เดียวที่เข้าถึงได้ทุกโหมด รวมถึงโมเดล Grok Imagine Image 2.0 Text-to-Image และ Grok Imagine Image 2.0 Edit ที่เพิ่งปล่อยเมื่อ 7 สิงหาคม 2026 ระบบคิดค่าบริการตามการใช้งานจริงสำหรับการสร้างที่สำเร็จ จึงจ่ายตามจำนวนครั้งที่เรียกใช้โดยไม่จำเป็นต้องสมัครสมาชิก

มีภาพเจนเนอเรชันสามรุ่นทำงานคู่กัน: Grok Imagine Image ราคา $0.02 ต่อภาพ, Grok Imagine Image Quality ราคา $0.05 และ Grok Imagine Image 2.0 เริ่มต้นที่ $0.04 โดยแต่ละรุ่นมีเอนด์พอยต์แก้ไขของตัวเอง วิดีโอให้บริการผ่าน Grok Imagine Video ราคา $0.05 ต่อวินาที และ Grok Imagine Video v1.5 ราคา $0.08 ต่อวินาที พร้อมเอนด์พอยต์ extend และ edit xAI TTS v1 ปิดท้ายชุดด้วยเสียงกว่า 80 เสียงใน 20 ภาษา

Image 2.0 วางแผนตัวอักษรและเลย์เอาต์เหมือนนักออกแบบ จึงทำให้ภาพที่มีรายละเอียดหนาแน่นและตัวอักษรขนาดเล็กยังคงอ่านได้ ไม่แตกเป็นเนื้อภาพ นอกจากนี้ยังมีระดับคุณภาพให้เลือก ทำให้สามารถแลกเปลี่ยนเวลาเรนเดอร์กับความละเอียดได้บนพรอมต์เดียวกัน ซึ่งโมเดล Image และ Image Quality รุ่นก่อนไม่รองรับ ฟีเจอร์นี้ใช้ได้ทั้งรุ่น Text-to-Image และ Edit

คิดราคาจากการสร้างที่สำเร็จโดยไม่มีขั้นต่ำ Grok Imagine Image 2.0 ราคา $0.04 ต่อภาพที่คุณภาพต่ำและ 1K, $0.06 ที่คุณภาพต่ำพร้อม 2K หรือคุณภาพกลางพร้อม 1K, และ $0.08 ที่คุณภาพกลางพร้อม 2K ส่วนแต่ละภาพที่ส่งเข้าในเอนด์พอยต์ Edit เพิ่ม $0.01 ต่อภาพ สำหรับโมเดลภาพอื่นๆ Grok Imagine Image ราคา $0.02 ต่อภาพ และ Grok Imagine Image Quality ราคา $0.05 วิดีโอเริ่มต้นที่ $0.05 ต่อวินาที

สร้าง API key จาก Atlas Cloud แล้วส่งพรอมต์พร้อม model id เช่น xai/grok-imagine-image-2.0/text-to-image ไปยังเอนด์พอยต์สร้างภาพ การเรนเดอร์เป็นแบบ asynchronous ดังนั้นการเรียกจะส่ง request id กลับมา แล้วคุณจึง poll หาสถานะที่เอนด์พอยต์ prediction จนกว่าสถานะจะเปลี่ยนจาก processing เป็น completed เนื่องจากโมเดล Grok Imagine ทุกตัวใช้รูปแบบเดียวกัน การเพิ่มวิดีโอหรือเสียงในภายหลังจึงเพียงเปลี่ยนสตริงเดียว เริ่มสร้างงานได้เลยวันนี้

ผลลัพธ์เรนเดอร์ได้ที่ 1K (1024x1024) หรือ 2K (2048x2048) ใน 14 อัตราส่วนภาพ ตั้งแต่สี่จัตุรัส 1:1 และ widescreen 16:9 ไปจนถึงแนวตั้ง 9:20 และแบนเนอร์ ultrawide 20:9 การเรียกครั้งเดียวสามารถส่งภาพได้สูงสุด 4 ภาพ และพรอมต์สามารถยาวได้ถึง 8,000 ตัวอักษร ที่เอนด์พอยต์ Edit อัตราส่วนภาพจะตั้งเป็น auto โดยอัตโนมัติ และตามภาพนำเข้าภาพแรก เว้นแต่คุณจะระบุค่าเอง

สูงสุดสามภาพต่อครั้ง โดยส่งเป็น public URL หรือ base64 data URI เมื่อส่งมากกว่าหนึ่งภาพ ให้อ้างอิงในพรอมต์ด้วย <IMAGE_0>, <IMAGE_1> และ <IMAGE_2> เพื่อให้โมเดลรู้ว่าคำสั่งแต่ละข้ออ้างอิงภาพใด แต่ละภาพที่ส่งเข้าจะเพิ่ม $0.01 ต่อการเรียก และคุณสามารถขอภาพที่แก้ไขแล้วได้ 1 ถึง 4 ภาพต่อครั้ง

ใช่ Grok Imagine Video v1.5 สร้างเสียงที่ประสานกันแบบเนทีฟในรอบเดียวกับภาพ ทำให้ดนตรี ผลกระทบเสียง และบทพูดตรงจังหวะกับการเคลื่อนไหว โดยไม่ต้องพึ่งพาอีกพাইปไลน์หนึ่ง โหมด reference-to-video ยังรองรับ reference voice เป็นตัวเลือก alongside ภาพอ้างอิง 1 ถึง 7 ภาพ คลิปยาวได้สูงสุด 15 วินาที ความละเอียด 1080p ทั้ง text-to-video และ image-to-video

เลือก Image 2.0 เมื่อเฟรมมีตัวอักษร เลย์เอาต์ หรือรายละเอียดหลายส่วนที่ต้องคงความสอดคล้องกัน และเมื่อต้องการควบคุมโดยตรงเรื่องการแลกเปลี่ยนระหว่างความเร็วกับความละเอียด Grok Imagine Image Quality ยังคงอัตราคงที่ $0.05 ต่อภาพ พร้อมผลลัพธ์ 1K และ 2K ใน 14 อัตราส่วนภาพ หากปริมาณงานสำคัญกว่าความละเอียดของตัวอักษร Grok Imagine Image รุ่นเดิมที่ $0.02 ต่อภาพยังคงเป็นทางเลือกที่คุ้มค่าที่สุด

คุณภาพระดับกลาง (medium) เป็นค่าเริ่มต้นและใช้เวลาราว 84 วินาทีที่ 1K เพราะมุ่งเน้นผลลัพธ์ที่ดีที่สุดของโมเดล การตั้งค่าคุณภาพเป็นต่ำจะลดเวลาลงเหลือประมาณ 10 วินาที เร็วขึ้นประมาณ 8 เท่า และต้นทุน $0.04 แทนที่จะเป็น $0.06 สำหรับภาพ 1K แนะนำให้ร่างและทดลองที่คุณภาพต่ำก่อน แล้วค่อยรันใหม่เฉพาะพรอมต์ที่ผ่านเข้ามาที่คุณภาพกลางและ 2K เมื่อองค์ประกอบภาพลงตัวแล้ว

สำรวจกลุ่มเพิ่มเติม

Seedance 2.5

Seedance 2.5 API พร้อมใช้งานแล้วบน Atlas Cloud! มอบโมเดลวิดีโอใหม่ล่าสุดของ ByteDance ให้กับนักพัฒนา สร้างวิดีโอเนทีฟได้นานถึง 30 วินาทีในการประมวลผลเพียงครั้งเดียวจากข้อความ รูปภาพเดียว หรือการอ้างอิงหลายรูปแบบสูงสุด 50 รายการ พร้อมเสียงที่ซิงโครไนซ์และข้อความหลายภาษาในเฟรม บน Atlas Cloud คุณสามารถเข้าถึงได้ผ่านคีย์เดียว โดยมีความสอดคล้องของวัตถุและระบบฟิสิกส์ที่ได้รับการปรับปรุงซึ่งช่วยให้ภาพระยะยาวมีความต่อเนื่อง

ดูกลุ่ม

Wan 3.0

Wan 3.0 API คือเจเนอเรชันถัดไปของตระกูลวิดีโอ Wan จาก Alibaba ซึ่งสร้างขึ้นเพื่อยกระดับการสร้างวิดีโอแบบยาว การควบคุมแบบหลายข้อมูลอ้างอิง และคุณภาพของภาพและเสียงให้ก้าวไปอีกขั้น Atlas Cloud ได้โฮสต์ Wan 2.7, 2.6 และ 2.5 ไว้แล้ว และ Wan 3.0 สามารถทำงานบนคีย์แบบรวมเดียวกันโดยไม่ต้องตั้งค่าแยกต่างหาก เริ่มต้นสร้างสรรค์ได้ตั้งแต่วันนี้ เลื่อนลงไปที่ส่วนจัดแสดงเพื่อดูว่า Wan 3.0 สามารถสร้างอะไรได้บ้าง

ดูกลุ่ม

MiniMax H3

MiniMax H3 API เปิดให้ใช้งานโมเดลวิดีโอมัลติโหมดอเนกประสงค์ของ MiniMax ซึ่งอ่าน text, images, video และ audio เป็นบริบทเดียว แทนที่จะประมวลผลทีละงาน คลิปมีความยาว 5 ถึง 15 วินาทีที่ 24 FPS รองรับอัตราส่วนภาพตั้งแต่ 21:9 ถึง 9:16 และ prompt เดียวสามารถสลับตัวละคร เปลี่ยนฉากหลัง เขียนบทสนทนาใหม่ หรือโคลนเสียงจากคลิปอ้างอิงได้ Atlas Cloud ให้บริการทั้งหมดนี้ผ่าน endpoint เดียวที่เข้ากันได้กับ OpenAI เริ่มสร้างได้วันนี้

ดูกลุ่ม

Seedream 5.0 Pro

Seedream 5.0 Pro API มอบโมเดลการแก้ไขภาพที่ควบคุมได้ของ ByteDance บน Atlas Cloud ให้กับนักพัฒนา โดยจะวางการแก้ไขอย่างแม่นยำด้วยจุดยึดและพิกัด แยกภาพออกเป็นเลเยอร์ที่แก้ไขได้ ผสานข้อมูลอ้างอิงหลายรายการ และจับคู่สีและวัสดุที่แน่นอน พร้อมข้อความหลายภาษาที่ความละเอียด 2K และ 3K บน Atlas Cloud คุณสามารถเข้าถึงได้ผ่านคีย์เดียว!

ดูกลุ่ม

Seedance 2.0

Seedance 2.0 API ให้คุณเข้าถึงระดับโปรดักชันของโมเดลวิดีโอแบบมัลติโมดัลจาก ByteDance — รองรับอินพุต 4 รูปแบบ (ข้อความ, รูปภาพ, วิดีโอ, เสียง) และระบบ "Universal Reference" ชั้นนำของอุตสาหกรรมที่ล็อกองค์ประกอบภาพ การเคลื่อนไหวของกล้อง และการกระทำของตัวละครในทุกช็อต ผสานรวมการควบคุมระดับผู้กำกับด้วยการเรียกใช้ API เพียงครั้งเดียว ในราคาคงที่ $0.09/วินาที รับคีย์ได้ทันที และไม่มีคิวรอ — พร้อมการรับประกันเวลาพร้อมใช้งานและการปฏิบัติตามข้อกำหนดระดับองค์กร Seedance 2.0 Native 4K เปิดใช้งานแล้ววันนี้!

ดูกลุ่ม

GPT Image 2

GPT Image 2 API ช่วยให้นักพัฒนาสามารถเข้าถึงโมเดลรูปภาพล่าสุดของ OpenAI ซึ่งเป็นรุ่นสืบทอดจาก GPT Image 1.5 โดยสามารถสร้างและแก้ไขรูปภาพพร้อมกับการเรนเดอร์ข้อความที่แม่นยำทั้งในอักษรละตินและ CJK รวมถึงการจัดวางองค์ประกอบที่ยอดเยี่ยมสำหรับโปสเตอร์ ม็อกอัป และอินโฟกราฟิก บน Atlas Cloud คุณสามารถเข้าถึงโมเดลนี้ผ่าน API ที่เป็นหนึ่งเดียวร่วมกับโมเดลอื่นๆ อีกกว่า 300 รุ่น พร้อมเครดิตฟรี เวลาทำงาน 99.99% และไม่จำเป็นต้องมีการตรวจสอบยืนยันองค์กรจาก OpenAI

ดูกลุ่ม

Gemini Omni Flash

Gemini Omni API นำโมเดลสร้างและแก้ไขวิดีโอแบบมัลติโมดัลของ Google DeepMind ซึ่งเปิดตัวในงาน Google I/O 2026 มาสู่สแต็กของคุณ Gemini Omni ผสานเอนจินการใช้เหตุผลของ Gemini เข้ากับสื่อเชิงสร้างสรรค์ รองรับอินพุตทุกรูปแบบทั้งข้อความ รูปภาพ วิดีโอ และเสียง เพื่อสร้างผลลัพธ์ที่สอดคล้องกันและอิงตามความรู้ ปรับแต่งผลลัพธ์ผ่านการสนทนาอย่างเป็นธรรมชาติ ไม่ว่าจะเปลี่ยนวัตถุ เขียนฉากใหม่ หรือปรับสไตล์ โดยที่ฟิสิกส์ ตัวละคร และความต่อเนื่องยังคงเดิม Atlas Cloud ให้บริการ Gemini Omni Flash ครบทั้งไลน์อัป ทั้งการสร้างวิดีโอจากข้อความ การสร้างวิดีโอจากรูปภาพพร้อมรูปอ้างอิงสูงสุด 7 รูป และการสร้างวิดีโอจากรูปอ้างอิง ผ่าน API เดียวแบบครบวงจร ด้วยราคาต่อวินาทีที่โปร่งใสเริ่มต้นที่ $0.112 โดยไม่ต้องสมัครสมาชิก เริ่มสร้างได้เลยวันนี้

ดูกลุ่ม

Grok Imagine

Grok Imagine API ครอบคลุมโมเดลรูปภาพ วิดีโอ และพูดของ xAI ตั้งแต่ Image 2.0 ถึง Video 1.5 และ xAI TTS v1 สร้างรูปภาพนิ่ง 1K หรือ 2K ในอัตราส่วน 14 แบบ ขยายฉากไปยัง 15 วินาทีของวิดีโอ 1080p ควบคุมภาพด้วยรูปภาพอ้างอิงได้ถึง 7 รูป หรือเพิ่มบรรยายเสียงในภาษา 20 ภาษา Atlas Cloud รันทุกโหมดบนเอนด์พอยต์เดียว มีราคาแบบจ่ายตามการใช้งาน ตั้งแต่ $0.02 ต่อรูปภาพและ $0.05 ต่อวินาที เริ่มสร้างวันนี้

ดูกลุ่ม

Google

โมเดลเชิงสร้างสรรค์ที่ทรงพลังที่สุดของ Google พร้อมใช้งานแล้วบน Atlas Cloud โดย Veo 3.1 นำเสนอการสร้างวิดีโอระดับภาพยนตร์ Nano Banana 2 ขับเคลื่อนการสร้างภาพที่มีความเที่ยงตรงสูง และ Gemini นำความชาญฉลาดแบบมัลติโมดัลมาสู่ทุกเวิร์กโฟลว์ เข้าถึงชุดโมเดลของ Google เต็มรูปแบบผ่าน API key เดียวพร้อมความพร้อมใช้งานระดับ Day-0 และการกำหนดราคาแบบจ่ายตามการใช้งาน (pay-as-you-go)

ดูกลุ่ม

Seedance 2.0 Mini

Seedance 2.0 Mini นำเสนอการสร้างวิดีโอแบบมัลติโมดัลของ ByteDance สู่เวิร์กโฟลว์ที่ความเร็วและต้นทุนมีความสำคัญสูงสุด โดยมอบความสามารถหลักของ Seedance 2.0 ในรูปแบบที่ใช้ทรัพยากรน้อยลง — สร้างได้เร็วกว่า ต้นทุนต่อวิดีโอต่ำกว่า และใช้การผสานรวม API เดิมที่คุณใช้อยู่แล้ว สำหรับทีมที่จัดการไปป์ไลน์ปริมาณมากหรือสร้างต้นแบบในสเกลขนาดใหญ่ Mini คือตัวเลือกเริ่มต้นที่ใช้งานได้จริง

ดูกลุ่ม

ByteDance

ตั้งแต่การสร้างวิดีโอระดับภาพยนตร์ไปจนถึงการสร้างภาพที่มีความละเอียดสูง โมเดลที่ทรงพลังที่สุดของ ByteDance พร้อมใช้งานแล้วบน Atlas Cloud รัน Seedance และ Seedream ในสเกลขนาดใหญ่ด้วยราคาการอนุมานที่ต่ำที่สุด และไม่มีค่าใช้จ่ายแฝงด้านโครงสร้างพื้นฐาน

ดูกลุ่ม

Alibaba

Atlas Cloud รวบรวมโมเดลทั้งหมดของ Alibaba ไว้ใน API เดียว: Qwen สำหรับงานด้านภาษาและรูปภาพ และ Wan สำหรับการสร้างวิดีโอความละเอียดสูงสุด 1080p เข้าถึงทุกโมเดลในรูปแบบจ่ายตามการใช้งานจริง (pay-as-you-go) โดยไม่ต้องสมัครสมาชิก Alibaba API พร้อมใช้งานผ่าน base URL เดียวโดยใช้ไคลเอนต์ที่รองรับ OpenAI ที่คุณมีอยู่แล้ว

ดูกลุ่ม

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด