



Grok Imagine API ครอบคลุมโมเดลรูปภาพ วิดีโอ และพูดของ xAI ตั้งแต่ Image 2.0 ถึง Video 1.5 และ xAI TTS v1 สร้างรูปภาพนิ่ง 1K หรือ 2K ในอัตราส่วน 14 แบบ ขยายฉากไปยัง 15 วินาทีของวิดีโอ 1080p ควบคุมภาพด้วยรูปภาพอ้างอิงได้ถึง 7 รูป หรือเพิ่มบรรยายเสียงในภาษา 20 ภาษา Atlas Cloud รันทุกโหมดบนเอนด์พอยต์เดียว มีราคาแบบจ่ายตามการใช้งาน ตั้งแต่ $0.02 ต่อรูปภาพและ $0.05 ต่อวินาที เริ่มสร้างวันนี้
Grok Imagine พัฒนาโดย xAI โดย Atlas Cloud (ดำเนินการโดย Atlas Cloud AI LLC) เป็นผู้ให้บริการเข้าถึงโมเดลนี้ แต่ไม่ได้เป็นเจ้าของโมเดล เครื่องหมายการค้าทั้งหมดเป็นของเจ้าของที่เกี่ยวข้อง
Atlas Cloud มอบโมเดลสร้างสรรค์ล่าสุดที่นำหน้าในอุตสาหกรรมให้กับคุณ
จับคู่ Grok Imagine API model ที่เหมาะสมกับประเภทอินพุต ความยาวเอาต์พุต ความละเอียด และราคาต่อการเรียก
| โมดาล | คำอธิบาย |
|---|---|
| Grok Imagine Image 2.0 T2I API (Text to Image) | เขียนพรอมพ์ได้สูงสุด 8,000 อักขระ ปลายทางนี้จะส่งคืนรูปภาพ 1-4 ภาพที่ความละเอียด 1K หรือ 2K ชั้นคุณภาพต่ำหรือปานกลางช่วยให้แลกเปลี่ยนความพยายามในการเรนเดอร์เพื่อความเร็วโดยราคา $0.04 ต่อรูปภาพ เหมาะสำหรับการสำรวจแนวคิด สร้างสรรค์สำหรับโซเชียลมีเดีย และการผลิตภาพหมู่ที่ปริมาณเป็นสิ่งสำคัญ |
| Grok Imagine Image 2.0 Edit API (Image to Image) | ส่งรูปภาพอ้างอิง 1-3 ภาพพร้อมคำสั่งภาษาธรรมชาติ ผลลัพธ์ที่แก้ไขจะกลับมาที่ 1K หรือ 2K ในอัตราส่วนภาพที่ตั้งไว้หรืออัตโนมัติ ชั้นคุณภาพต่ำและปานกลางเดียวกันใช้ได้ และแต่ละรูปภาพมีค่า $0.04 การปรับเปลี่ยนผลิตภัณฑ์ การแลกเปลี่ยนพื้นหลัง และตัวแปรการออกแบบอย่างรวดเร็วทั้งหมดทำงานผ่านการเรียกครั้งเดียว |
| Grok Imagine Image Quality T2I API (Text to Image) | เมื่อรายละเอียดที่ละเอียดมีความสำคัญ ปลายทางนี้แปลงพรอมพ์ข้อความเป็นรูปภาพคงที่ที่แต่งแต้มในระดับ 1K หรือ 2K และส่งคืนตัวแปรได้สูงสุด 4 ตัวต่อการร้องขอที่ $0.05 ต่อรูปภาพ อัตราส่วนภาพครอบคลุมสี่เหลี่ยมจัตุรัส แนวตั้ง แนวนอน และอัลตราไวด์ ใช้สำหรับรูปภาพหลัก สร้างสรรค์โฆษณา และการเรนเดอร์ผลิตภัณฑ์ระดับแบรนด์ |
| Grok Imagine Image Quality Edit API (Image to Image) | ป้อนรูปภาพต้นฉบับ 1-8 ภาพพร้อมคำสั่งการแก้ไข รับเวอร์ชันแก้ไขแล้วที่ 1K หรือ 2K ด้วย $0.05 ต่อรูปภาพ การอ้างอิงหลายรูปภาพจะถูกอ้างถึงแบบอินไลน์เป็น <IMAGE_0> และ <IMAGE_1> ดังนั้นหัวข้อและสไตล์สามารถรวมเข้าในคำสั่งเดียวได้ การปรับปรุงแคมเปญ การโอนสไตล์ และการแก้ไขประกอบคือการใช้งานทั่วไป |
| Grok Imagine Image T2I API (Text to Image) | ปลายทางแปลงข้อความเป็นรูปภาพต้นฉบับสนับสนุนเอาต์พุต 1K และ 2K พร้อมบัตช์รูปภาพ 4 ภาพในราคารูปภาพต่ำสุดในตระกูล $0.02 ต่อรูปภาพ ทำให้เป็นค่าเริ่มต้นที่ใช้ได้จริงสำหรับไปป์ไลน์ปริมาณสูง การสร้างรูปขนาดย่อ และการทดสอบพรอมพ์อย่างรวดเร็ว |
| Grok Imagine Image Edit API (Image to Image) | ต้องการการแก้ไขแบบเบาที่ขนาดใหญ่ ปลายทางนี้ยอมรับรูปภาพ 1-8 ภาพพร้อมคำสั่งข้อความ และส่งคืนผลลัพธ์ที่แก้ไขแล้วได้สูงสุด 4 ภาพที่ 1K หรือ 2K ด้วย $0.02 ต่อรูปภาพ การล้างแค็ตตาล็อก ตัวแปรตามฤดูกาล และการส่งผ่านการออกแบบแบบวนซ้ำยังคงราคาไม่แพง |
| Grok Imagine Video v1.5 T2V API (Text to Video) | พรอมพ์เพียงอย่างเดียวสร้างวิดีโอระยะเวลา 1-15 วินาที พร้อมเสียงซิงโครไนซ์แบบดั้งเดิมที่ 480p, 720p หรือ 1080p ครอบคลุมอัตราส่วนภาพ 7 แบบ การเรียกเก็บเงินคือ $0.08 ต่อวินาทีของเอาต์พุต โปรโมโตรสินค้า โฆษณาสื่อสังคม และฉากเล่าเรื่องที่ต้องให้เสียงเข้าไปเหมาะสมที่สุด |
| Grok Imagine Video v1.5 I2V API (Image to Video) | ให้เฟรมเริ่มต้นและพรอมพ์การเคลื่อนไหว v1.5 จะสร้างภาพเคลื่อนไหวเป็นระยะเวลาสูงสุด 15 วินาทีที่ความละเอียดถึง 1080p พร้อมเสียงที่สร้างในการส่งผ่านเดียวกัน ต้นทุนอยู่ที่ $0.08 ต่อวินาที การหมุนผลิตภัณฑ์ ภาพเคลื่อนไหวเหมือน และสินทรัพย์แคมเปญจากรูปนิ่งไปยังการเคลื่อนไหวพอดี |
| Grok Imagine Video v1.5 R2V API (Reference to Video) | ภาพอ้างอิง 1-7 ภาพกำหนดตัวอักษร วัตถุ และสไตล์บนหน้าจอ ขณะที่เสียงได้สูงสุด 3 เสียงที่เลือกจากพรีเซต 26 รายการขับเสียงพูด เอาต์พุตถึง 15 วินาทีที่ 480p หรือ 720p ด้วย $0.08 ต่อวินาที การเล่าเรื่องที่ตัวอักษรสอดคล้องกัน การลองใส่เสมือน และมาสคอตแบรนด์ได้ประโยชน์มากที่สุด |
| Grok Imagine Video T2V API (Text to Video) | พรอมพ์ข้อความกลายเป็นคลิป 1-15 วินาทีที่ 480p หรือ 720p โดยมีอัตราส่วนภาพ 7 แบบครอบคลุมรูปแบบแนวนอน สี่เหลี่ยม และแนวตั้ง ที่ $0.05 ต่อวินาที เป็นตัวเลือกคุณค่าสำหรับเนื้อหาโซเชียลมีเดียและบอร์ดแนวคิดอย่างรวดเร็ว |
| Grok Imagine Video I2V API (Image to Video) | ยึดภาพคงที่เป็นเฟรมแรก อธิบายการเคลื่อนไหวที่คุณต้องการ คลิปจะขยายไปถึง 15 วินาทีที่ 480p หรือ 720p ราคาอยู่ที่ $0.05 ต่อวินาที ซึ่งทำให้การสร้างภาพเคลื่อนไหวจำนวนมากของรูปภาพผลิตภัณฑ์และภาพเหมือนราคาไม่แพง |
| Grok Imagine Video R2V API (Reference to Video) | ภาพอ้างอิง 1-7 ภาพกำหนดตัวอักษร วัตถุ และสไตล์บนหน้าจอโดยไม่ตรึงเฟรมเปิดคงที่ คลิปทำงานได้สูงสุด 10 วินาทีที่ 480p หรือ 720p และมีค่า $0.05 ต่อวินาที ใช้เมื่อความเป็นตัวตนและสไตล์ต้องคงสอดคล้องกันในแต่ละฉาก |
| Grok Imagine Video Extend API (Video Extension) | ไฟล์ mp4 ที่มีอยู่ระยะ 2-15 วินาทีสามารถดำเนินการต่อด้วย 2-10 วินาทีเพิ่มเติมได้ โดยมีพรอมพ์ที่กำหนดว่าจะเกิดอะไรขึ้นต่อไป เอาต์พุตจะตรงกับวิดีโอต้นฉบับและถูกจำกัดไว้ที่ 720p โดยเรียกเก็บ $0.07 ต่อวินาที มันมีประโยชน์สำหรับการยืดการตัดสั้น ๆ ไปยังความยาวโฆษณาที่ต้องการ |
| Grok Imagine Video Edit API (Video to Video) | คำสั่งภาษาธรรมชาติเขียนไฟล์ mp4 ที่มีอยู่ใหม่ขณะที่ฉากต้นฉบับ การเคลื่อนไหว และการจัดเฟรมยังคงเหมือนเดิม เอาต์พุตรักษาระยะเวลาต้นฉบับ จำกัดไว้ที่ 8.7 วินาที และการเรียกเก็บเงินตามวิดีโออินพุตที่ $0.07 ต่อวินาที การเพิ่มอุปกรณ์ประกอบ การเปลี่ยนเสื้อผ้า และการจัดแต่งทรงผมใหม่เกิดขึ้นโดยไม่ต้องถ่ายภาพใหม่ |
| xAI TTS v1 API (Text to Speech) | ข้อความจนถึง 15,000 อักขระเปลี่ยนเป็นเสียงธรรมชาติที่มีเวลาตอบสนองต่ำกว่าวินาทีในภาษา 20 ภาษา พร้อมการตรวจหาภาษาอัตโนมัติที่พร้อมใช้งาน การส่งมอบสามารถปรับแต่งได้: ความเร็วในการเล่นจาก 0.7x ถึง 1.5x, codecs รวมถึง mp3, wav และ pcm และอัตราการสุ่มตัวอย่างสูงถึง 48 kHz บรรยายเสียง พรอมพ์ IVR และการบรรยายในแอปเป็นการใช้งานที่เหมาะสม |
สำรวจสิ่งที่ Grok Imagine API นำเสนอ ตั้งแต่การสร้างภาพความละเอียด 2K ด้วยข้อความหลายภาษา ไปจนถึงวิดีโอหลายรูปแบบพร้อมเสียงซิงโครไนซ์แบบเนทีฟและโหมดสร้างสรรค์ต่างๆ

Grok Imagine Image Quality API นำเสนอการสร้างรูปภาพที่ความละเอียดสูงสุด 2K พร้อมรายละเอียดที่คมชัดในทุกผลลัพธ์ ด้วยการรักษารายละเอียดพื้นผิวที่ละเอียดอ่อนและองค์ประกอบที่ซับซ้อนเมื่อขยายขนาด ผู้ใช้สามารถสร้างภาพที่ยังคงความคมชัดแม้จะแสดงในรูปแบบที่มีขนาดใหญ่พิเศษ นี่คือโซลูชันขั้นสูงสุดสำหรับภาพหลัก ชิ้นงานโฆษณา และภาพเรนเดอร์ผลิตภัณฑ์ระดับแบรนด์

Grok Imagine Image Quality API นำเสนอการเรนเดอร์ข้อความที่ดีที่สุดในระดับเดียวกัน รองรับหลายภาษาโดยตรงภายในภาพที่สร้างขึ้น ด้วยการจำลองการจัดรูปแบบตัวอักษร สคริปต์ และอักขระในทุกภาษาได้อย่างแม่นยำ ผู้ใช้จึงสามารถฝังข้อความที่อ่านได้ลงในชิ้นงานภาพโดยไม่ต้องปรับแต่งแก้ไขภาพด้วยตนเองในภายหลัง นี่คือโซลูชันขั้นสูงสุดสำหรับงานโฆษณา แคมเปญการตลาดที่ปรับให้เข้ากับท้องถิ่น และภาพระดับแบรนด์

Grok Imagine API สร้างผลลัพธ์ที่สมจริงราวกับภาพถ่าย โดยมีจุดเด่นอยู่ที่แสงธรรมชาติ พื้นผิวที่สมบูรณ์ และฟิสิกส์ที่น่าเชื่อถือในทุกฉาก ด้วยการจำลองทัศนศาสตร์และพฤติกรรมของวัสดุในโลกแห่งความเป็นจริง ผู้ใช้จึงสามารถสร้างภาพที่แยกไม่ออกจากการถ่ายภาพระดับมืออาชีพด้วยตาเปล่า นี่คือสุดยอดโซลูชันสำหรับการเรนเดอร์ผลิตภัณฑ์ ภาพฮีโร่ และภาพลักษณ์ของแบรนด์ระดับไฮเอนด์

Grok Imagine Image Quality API รองรับการปฏิบัติตาม prompt ที่แม่นยำยิ่งขึ้น ควบคู่ไปกับการแก้ไขภาพขั้นสูงที่ขับเคลื่อนโดยข้อมูลอ้างอิงที่ป้อนเข้า ด้วยการตีความคำแนะนำโดยละเอียดและการจับคู่สไตล์จากภาพอ้างอิงที่อัปโหลด ผู้ใช้สามารถปรับแต่งและปรับเปลี่ยนสไตล์ของภาพได้อย่างแม่นยำระดับพิกเซล นี่คือโซลูชันขั้นสูงสุดสำหรับงานโฆษณาเชิงสร้างสรรค์ การเรนเดอร์ผลิตภัณฑ์ และภาพที่ได้มาตรฐานของแบรนด์อย่างสม่ำเสมอ

สร้างเพลง เอฟเฟกต์เสียง และบทสนทนาที่ซิงค์กับแต่ละคลิปโดยอัตโนมัติ เพื่อให้เสียงและการเคลื่อนไหวสอดคล้องกันในขั้นตอนเดียว คลิปไม่ต้องผ่านขั้นตอนจัดการเสียงแยกต่างหาก และพร้อมใช้งานได้ทันที

ครอบคลุมทั้งการแปลงข้อความเป็นวิดีโอ รูปภาพเป็นวิดีโอ ข้อมูลอ้างอิงเป็นวิดีโอ และการตัดต่อวิดีโอภายในชุดเครื่องมือเดียว คุณสามารถสลับระหว่างงานสร้างและงานตัดต่อได้โดยไม่ต้องเปลี่ยนโมเดลหรือระบบที่ผสานการทำงาน

Grok Imagine Video API สร้างการเคลื่อนไหวที่เป็นธรรมชาติพร้อมระบบฟิสิกส์ที่เสถียรและวัตถุที่สอดคล้องกันในทุกเฟรม สิ่งนี้ช่วยลดการกะพริบและความผิดเพี้ยนของภาพในคลิปที่ยาวขึ้น ทำให้ตัวละครและฉากมีความสอดคล้องกันตั้งแต่ต้นจนจบ
แต่ละแถวใช้คำสั่งเดียวกันผ่าน Grok Imagine API และคู่แข่งสองโมเดลบน Atlas Cloud เพื่อให้สามารถประเมินการเคลื่อนไหว การซิงค์เสียง รายละเอียด และไทโปกราฟีได้อย่างเท่าเทียม
ฉากตลาดกลางคืนสไตล์ภาพยนตร์ไลฟ์แอคชั่น ความยาวประมาณ 10 วินาที เปิดด้วยช็อตติดตามมุมต่ำที่ลื่นไหลผ่านแผงขายของที่มีไอระเหยลอยขึ้น ขณะพ่อครัววัยหนุ่มในเสื้อกล้ามเปียกน้ำกำลังเหวี่ยงเส้นบะหมี่ในกระทะ พร้อมเปลวไฟพุ่งขึ้นจากกระทะและส่องใบหน้าของเขาเป็นสีส้ม กล้องหมุนไปทางขวาอย่างรวดเร็วเข้าสู่ช็อตมาโครใกล้ของกุ้งที่กำลังทอดในน้ำมัน หยดน้ำมันกระเด็น แล้วกล้องถอยหลังและยกขึ้นเหนือเคาน์เตอร์ ขณะที่เขาจับกระทะที่หมุนอยู่และตักบะหมี่ใส่จานในการเคลื่อนไหวต่อเนื่องครั้งเดียว ช่วงท้าย: แมวจรจัดตัวหนึ่งกระโดดขึ้นบนเคาน์เตอร์ แย่งกุ้งหนึ่งตัวแล้ววิ่งหายเข้าไปในฝูงชน ขณะที่พ่อครัวหมุนตัวกลับพร้อมเสียงหัวเราะ กล้องเปลี่ยนเป็นโหมดมือถือเร็วไล่ตามหลังแมว ถนนแอสฟัลต์เปียกสะท้อนแสงโคมไฟสีแดง ไอระเหยลอยคว้าง โฟกัสตื้น ให้ลุคหนังสารคดีหยาบๆ พร้อมเม็ดฟิล์มละเอียด เสียง: เตาแก๊สจุดระเบิด เสียงน้ำมันกระเดาะ เสียงจอแจในตลาดและเสียงทัพพีกระทบกัน ลวดลายกลองที่เพิ่มขึ้นเรื่อยๆ และลงจังหวะพอดีกับการกระโดดของแมว อัตราส่วนภาพ 16:9
Generated with Grok Imagine Video v1.5 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Grok Imagine Video on Atlas Cloud
Extreme macro photograph shot at tabletop level, camera lens resting flat on the wooden desk surface at the eye height of a 1:64 scale figure, looking horizontally across a miniature modeling workbench in the exact instant the illusion of scale becomes real. In the mid-ground, a wave of blue-tinted epoxy resin has been frozen mid-curl, its surface just misted with a water sprayer so genuine droplets bead and cling to the glossy resin; three tiny hand-painted surfers in bright orange swim trunks ride down the face of the frozen wave, one crouched low with an arm dragging through the resin, and a spray of real water beads flings off the wave's lip, caught sharp in mid-air with tiny burst highlights on every droplet edge. Behind them, softly out of focus, the hand of a young woman modelmaker hovers in the air holding fine steel tweezers, suspended and enormous like a giant who has wandered into the world she built; only the lower half of her face is visible at the top of the frame, the corner of her mouth curved into a small delighted smile, all of it dissolved into creamy bokeh. Late-afternoon hard sunlight cuts through venetian blinds, painting a row of crisp diagonal light bars and clean shadows across the bare wood and over the resin sea, striping the surfers' shoulders. A single dropped, out-of-focus miniature part — a stray plastic sprue fragment — sits in the extreme foreground as a blurred occluding layer at the lower left, separating planes; strips of blue masking tape edge the resin sea, and negative space is left on the right side for the hovering tweezers. Complementary orange-and-blue palette: cool blue resin and blue tape against warm orange trunks, grounded by the warm honey tone of the oak desk. Shot on 100mm f/2.8 macro lens, ultra-shallow depth of field with buttery focus falloff, telephoto compression from an ultra-low camera position, visible fine film grain, true photographic realism, no illustration, no CGI look. Wide 16:9 aspect ratio, full-bleed horizontal composition.

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud
ทุกเวิร์กโฟลว์ด้านล่างทำงานด้วยคีย์ OpenAI-compatible เดียว ทีมจึงเคลื่อนแนวคิดจากภาพร่างภาพ ผ่านการแก้ไขภาพอ้างอิง ไปจนถึงวิดีโอพร้อมเสียงประสานและเสียงบรรยายที่แปลท้องถิ่นได้ โดยไม่ต้องเปลี่ยน stacks
Image 2.0 คืน 1K drafts ภายในประมาณสิบวินาทีบน low quality tier และให้ถึงสี่ variants ต่อ call ทีมดีไซน์สแกนหลายทิศทางตั้งแต่เนิ่นๆ แล้ว re-render ตัวที่ชนะที่ 2K
ป้อนภาพอ้างอิงได้สูงสุดสามภาพเข้าสู่ Grok Imagine Image 2.0 Edit แล้วอธิบายการเปลี่ยนแปลงด้วยภาษาธรรมดา ทีม e-commerce สลับพื้นหลัง ปรับสไตล์บรรจุภัณฑ์ และรักษาผลิตภัณฑ์เดียวให้คงที่ทั่วแคตตาล็อก
xAI TTS v1 แปลงสคริปต์เป็นเสียงพูดที่มีอารมณ์ร่วมข้ามยี่สิบภาษาและมากกว่าแปดสิบเสียงด้วย latency ต่ำกว่าหนึ่งวินาที ทีมผลิตภัณฑ์จับคู่กับวิดีโอที่สร้างได้สำหรับโฆษณาที่แปลท้องถิ่น บทสอน และเสียงบรรยายในแอป
Grok Imagine Video v1.5 เขียนดนตรี effects และบทสนทนาที่ประสานกับภาพในคลิปยาวถึงสิบห้าวินาทีที่ 1080p ทีมการตลาดได้สปอตที่เสร็จในหนึ่ง pass โดยไม่ต้องมี session เสียงแยก
ต้องการตัวละครเดียวกันในทุกช็อต? Reference-to-video ยอมรับหนึ่งถึงเจ็ดภาพอ้างอิง плюс reference voice ที่ไม่บังคับ ผู้สร้างซีรีส์จึงรักษาอัตลักษณ์และโทนเสียงให้คงที่ตลอดคลิปสิบห้าวินาที
ฟุตเทจที่มีอยู่สามารถปรับสไตล์ผ่านการแก้ไขด้วยภาษาธรรมชาติ หรือต่อด้วย extension ยี่สิบถึงสิบวินาทีที่ตรงกับต้นฉบับ ทีมหลังการผลิตแก้ไข props เครื่องแต่งกาย และจังหวะได้โดยไม่ต้องกลับไปที่ set
ดูว่าโมเดลจากผู้ให้บริการต่างๆ เปรียบเทียบกันอย่างไร — เปรียบเทียบประสิทธิภาพ ราคา และจุดแข็งเฉพาะตัวเพื่อตัดสินใจอย่างมีข้อมูล
| โมเดล | จำนวนภาพอ้างอิงสูงสุด | จำนวนผลลัพธ์ | ความละเอียด | อัตราส่วนภาพ |
|---|---|---|---|---|
| Grok Imagine Image Quality | 8 | 1~4 | 2K, 1K | Auto, 1:1, 3:2, 2:3, 3:4, 4:3, 9:16, 16:9, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1 |
| Nano Banana 2 | 14 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Nano Banana Pro | 10 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Seedream 5.0 Lite | 14 | 1~15 | 2K~4K+ | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Qwen-Image | 3 | 1~6 | 512P~2K | Width[512, 2048]px, Height[512, 2048]px |
เริ่มต้นได้ในไม่กี่นาที — ทำตามขั้นตอนง่าย ๆ เหล่านี้เพื่อเชื่อมต่อและใช้งานโมเดลผ่านแพลตฟอร์ม Atlas Cloud
สมัครสมาชิกที่ atlascloud.ai และยืนยันตัวตน ผู้ใช้ใหม่จะได้รับเครดิตฟรีเพื่อสำรวจแพลตฟอร์มและทดสอบโมเดล
การรวมโมเดล Grok Imagine ขั้นสูงเข้ากับแพลตฟอร์มที่เร่งด้วย GPU ของ Atlas Cloud ให้ประสิทธิภาพ ความสามารถในการขยาย และประสบการณ์นักพัฒนาที่ไม่มีใครเทียบได้
เวลาแฝงต่ำ:
inference ที่ปรับแต่ง GPU เพื่อการตอบสนองแบบเรียลไทม์
API แบบรวมศูนย์:
รัน Grok Imagine, GPT, Gemini และ DeepSeek ด้วยการเชื่อมต่อเดียว
ราคาโปร่งใส:
ชำระเงินต่อโทเค็นที่คาดเดาได้พร้อมตัวเลือก serverless
ประสบการณ์นักพัฒนา:
SDK, การวิเคราะห์, เครื่องมือปรับแต่ง และเทมเพลต
ความน่าเชื่อถือ:
ความพร้อมใช้งาน 99.99%, RBAC และการบันทึกที่พร้อมสำหรับการปฏิบัติตาม
ความปลอดภัยและการปฏิบัติตาม:
SOC 2 Type II, สอดคล้อง HIPAA, อธิปไตยข้อมูลในสหรัฐอเมริกา
Grok Imagine API เป็นจุดเข้าถึงแบบรวมจาก Atlas Cloud สำหรับชุดสร้างภาพของ xAI ที่ครอบคลุมการสร้างภาพ การแก้ไขภาพ วิดีโอ และการสร้างเสียง โดยมีคีย์เดียวที่เข้าถึงได้ทุกโหมด รวมถึงโมเดล Grok Imagine Image 2.0 Text-to-Image และ Grok Imagine Image 2.0 Edit ที่เพิ่งปล่อยเมื่อ 7 สิงหาคม 2026 ระบบคิดค่าบริการตามการใช้งานจริงสำหรับการสร้างที่สำเร็จ จึงจ่ายตามจำนวนครั้งที่เรียกใช้โดยไม่จำเป็นต้องสมัครสมาชิก
มีภาพเจนเนอเรชันสามรุ่นทำงานคู่กัน: Grok Imagine Image ราคา $0.02 ต่อภาพ, Grok Imagine Image Quality ราคา $0.05 และ Grok Imagine Image 2.0 เริ่มต้นที่ $0.04 โดยแต่ละรุ่นมีเอนด์พอยต์แก้ไขของตัวเอง วิดีโอให้บริการผ่าน Grok Imagine Video ราคา $0.05 ต่อวินาที และ Grok Imagine Video v1.5 ราคา $0.08 ต่อวินาที พร้อมเอนด์พอยต์ extend และ edit xAI TTS v1 ปิดท้ายชุดด้วยเสียงกว่า 80 เสียงใน 20 ภาษา
Image 2.0 วางแผนตัวอักษรและเลย์เอาต์เหมือนนักออกแบบ จึงทำให้ภาพที่มีรายละเอียดหนาแน่นและตัวอักษรขนาดเล็กยังคงอ่านได้ ไม่แตกเป็นเนื้อภาพ นอกจากนี้ยังมีระดับคุณภาพให้เลือก ทำให้สามารถแลกเปลี่ยนเวลาเรนเดอร์กับความละเอียดได้บนพรอมต์เดียวกัน ซึ่งโมเดล Image และ Image Quality รุ่นก่อนไม่รองรับ ฟีเจอร์นี้ใช้ได้ทั้งรุ่น Text-to-Image และ Edit
คิดราคาจากการสร้างที่สำเร็จโดยไม่มีขั้นต่ำ Grok Imagine Image 2.0 ราคา $0.04 ต่อภาพที่คุณภาพต่ำและ 1K, $0.06 ที่คุณภาพต่ำพร้อม 2K หรือคุณภาพกลางพร้อม 1K, และ $0.08 ที่คุณภาพกลางพร้อม 2K ส่วนแต่ละภาพที่ส่งเข้าในเอนด์พอยต์ Edit เพิ่ม $0.01 ต่อภาพ สำหรับโมเดลภาพอื่นๆ Grok Imagine Image ราคา $0.02 ต่อภาพ และ Grok Imagine Image Quality ราคา $0.05 วิดีโอเริ่มต้นที่ $0.05 ต่อวินาที
สร้าง API key จาก Atlas Cloud แล้วส่งพรอมต์พร้อม model id เช่น xai/grok-imagine-image-2.0/text-to-image ไปยังเอนด์พอยต์สร้างภาพ การเรนเดอร์เป็นแบบ asynchronous ดังนั้นการเรียกจะส่ง request id กลับมา แล้วคุณจึง poll หาสถานะที่เอนด์พอยต์ prediction จนกว่าสถานะจะเปลี่ยนจาก processing เป็น completed เนื่องจากโมเดล Grok Imagine ทุกตัวใช้รูปแบบเดียวกัน การเพิ่มวิดีโอหรือเสียงในภายหลังจึงเพียงเปลี่ยนสตริงเดียว เริ่มสร้างงานได้เลยวันนี้
ผลลัพธ์เรนเดอร์ได้ที่ 1K (1024x1024) หรือ 2K (2048x2048) ใน 14 อัตราส่วนภาพ ตั้งแต่สี่จัตุรัส 1:1 และ widescreen 16:9 ไปจนถึงแนวตั้ง 9:20 และแบนเนอร์ ultrawide 20:9 การเรียกครั้งเดียวสามารถส่งภาพได้สูงสุด 4 ภาพ และพรอมต์สามารถยาวได้ถึง 8,000 ตัวอักษร ที่เอนด์พอยต์ Edit อัตราส่วนภาพจะตั้งเป็น auto โดยอัตโนมัติ และตามภาพนำเข้าภาพแรก เว้นแต่คุณจะระบุค่าเอง
สูงสุดสามภาพต่อครั้ง โดยส่งเป็น public URL หรือ base64 data URI เมื่อส่งมากกว่าหนึ่งภาพ ให้อ้างอิงในพรอมต์ด้วย <IMAGE_0>, <IMAGE_1> และ <IMAGE_2> เพื่อให้โมเดลรู้ว่าคำสั่งแต่ละข้ออ้างอิงภาพใด แต่ละภาพที่ส่งเข้าจะเพิ่ม $0.01 ต่อการเรียก และคุณสามารถขอภาพที่แก้ไขแล้วได้ 1 ถึง 4 ภาพต่อครั้ง
ใช่ Grok Imagine Video v1.5 สร้างเสียงที่ประสานกันแบบเนทีฟในรอบเดียวกับภาพ ทำให้ดนตรี ผลกระทบเสียง และบทพูดตรงจังหวะกับการเคลื่อนไหว โดยไม่ต้องพึ่งพาอีกพাইปไลน์หนึ่ง โหมด reference-to-video ยังรองรับ reference voice เป็นตัวเลือก alongside ภาพอ้างอิง 1 ถึง 7 ภาพ คลิปยาวได้สูงสุด 15 วินาที ความละเอียด 1080p ทั้ง text-to-video และ image-to-video
เลือก Image 2.0 เมื่อเฟรมมีตัวอักษร เลย์เอาต์ หรือรายละเอียดหลายส่วนที่ต้องคงความสอดคล้องกัน และเมื่อต้องการควบคุมโดยตรงเรื่องการแลกเปลี่ยนระหว่างความเร็วกับความละเอียด Grok Imagine Image Quality ยังคงอัตราคงที่ $0.05 ต่อภาพ พร้อมผลลัพธ์ 1K และ 2K ใน 14 อัตราส่วนภาพ หากปริมาณงานสำคัญกว่าความละเอียดของตัวอักษร Grok Imagine Image รุ่นเดิมที่ $0.02 ต่อภาพยังคงเป็นทางเลือกที่คุ้มค่าที่สุด
คุณภาพระดับกลาง (medium) เป็นค่าเริ่มต้นและใช้เวลาราว 84 วินาทีที่ 1K เพราะมุ่งเน้นผลลัพธ์ที่ดีที่สุดของโมเดล การตั้งค่าคุณภาพเป็นต่ำจะลดเวลาลงเหลือประมาณ 10 วินาที เร็วขึ้นประมาณ 8 เท่า และต้นทุน $0.04 แทนที่จะเป็น $0.06 สำหรับภาพ 1K แนะนำให้ร่างและทดลองที่คุณภาพต่ำก่อน แล้วค่อยรันใหม่เฉพาะพรอมต์ที่ผ่านเข้ามาที่คุณภาพกลางและ 2K เมื่อองค์ประกอบภาพลงตัวแล้ว
คู่มือ บทแนะนำ และอัปเดตผลิตภัณฑ์ ที่ช่วยให้คุณใช้ Atlas Cloud ได้อย่างเต็มประสิทธิภาพ