เพียง 2 สัปดาห์เท่านั้น | รับส่วนลด 20% สำหรับ Seedream 5.0 Pro!
Hero background 1Hero background 2

MiniMax H3 API for Video Generation and Editing

MiniMax H3 API เปิดให้ใช้งานโมเดลวิดีโอมัลติโหมดอเนกประสงค์ของ MiniMax ซึ่งอ่าน text, images, video และ audio เป็นบริบทเดียว แทนที่จะประมวลผลทีละงาน คลิปมีความยาว 5 ถึง 15 วินาทีที่ 24 FPS รองรับอัตราส่วนภาพตั้งแต่ 21:9 ถึง 9:16 และ prompt เดียวสามารถสลับตัวละคร เปลี่ยนฉากหลัง เขียนบทสนทนาใหม่ หรือโคลนเสียงจากคลิปอ้างอิงได้ Atlas Cloud ให้บริการทั้งหมดนี้ผ่าน endpoint เดียวที่เข้ากันได้กับ OpenAI เริ่มสร้างได้วันนี้

สำรวจโมเดลชั้นนำ

Atlas Cloud มอบโมเดลสร้างสรรค์ล่าสุดที่นำหน้าในอุตสาหกรรมให้กับคุณ

จากข้อความสู่ข้อมูลอ้างอิงเก้ารายการ: Modalities ของ MiniMax H3 API

แต่ละ endpoint ของ MiniMax H3 API อ่านข้อความ รูปภาพ วิดีโอ และเสียงแตกต่างกัน ดังนั้นให้ดูแถวด้านล่างแล้วจับคู่ modality ให้ตรงกับสิ่งที่คุณกำลังสร้าง

Modalityคำอธิบาย
MiniMax H3 T2V API (ข้อความเป็นวิดีโอ)เขียน prompt ได้สูงสุด 7,000 characters แล้วโมเดลจะส่งคืนคลิปความยาว 5 ถึง 15 second ที่ 24 FPS ใน 1440p พร้อมเสียง stereo แบบ native ที่สร้างขึ้นในรอบเดียวกัน กำหนด aspect ratio ได้ต่อ request ทั้ง 21:9, 16:9, 4:3, 1:1, 3:4 และ 9:16 ดังนั้นการเรียกเพียงครั้งเดียวจึงรองรับได้ทั้งตัวอย่างภาพยนตร์แบบ cinematic และคัตแนวตั้งสำหรับโซเชียล
MiniMax H3 I2V API (รูปภาพเป็นวิดีโอ)รูปภาพหนึ่งภาพใช้กำหนดเฟรมเปิด และสองภาพใช้ล็อกทั้งเฟรมแรกและเฟรมสุดท้าย โดย H3 จะเติมการเคลื่อนไหวระหว่างนั้นตาม aspect ratio ของรูปภาพอินพุต รองรับแหล่งที่มาขนาด 256 ถึง 5760 pixels ต่อด้าน ทำให้ง่ายต่อการทำให้ key art, ภาพนิ่งสินค้า และเฟรม storyboard เคลื่อนไหว
MiniMax H3 Omni Reference API (ข้อมูลอ้างอิงเป็นวิดีโอ)ต้องการให้หลายแหล่งข้อมูลทำงานร่วมกันหรือไม่? ใส่รูปภาพได้สูงสุดเก้าภาพ วิดีโอคลิปสามคลิป และแทร็กเสียงสามแทร็กใน request เดียว ภายใต้ขีดจำกัด 12 file โดยทั้งหมดจะถูกอ่านเป็นบริบท multimodal เดียวกัน ใช้คงตัวละคร การเคลื่อนกล้อง หรือโทนเสียงพูดให้ต่อเนื่องข้ามช็อต หรือแก้ไขคลิปที่มีอยู่ด้วยการสลับตัวแบบ ฉากหลัง และบทพูด

ภาพ เสียง และการแก้ไขวิดีโอในการเรียก MiniMax H3 API ครั้งเดียว

ทุกคลิปที่ MiniMax H3 API ส่งคืนมีความยาวได้สูงสุด 15 seconds ที่ 1440p พร้อมเสียงสเตอริโอแบบเนทีฟ สร้างจากการอ้างอิงข้อความ รูปภาพ วิดีโอ และเสียงพูดในรูปแบบใดก็ได้ และในการเรียกครั้งเดียวกันยังสามารถแก้ไขตัวละคร ฉาก และบทสนทนาในฟุตเทจที่คุณมีอยู่แล้วได้ด้วย

ไฟล์อ้างอิง 12 ไฟล์ ในการเรียก MiniMax H3 API ครั้งเดียว

คำขอ MiniMax H3 API หนึ่งครั้งรองรับรูปภาพอ้างอิงได้สูงสุด 9 ภาพ คลิปวิดีโอ 3 คลิป และแทร็กเสียง 3 แทร็ก โดยจำกัดรวมที่ 12 ไฟล์ แทนที่จะอ่านแต่ละไฟล์เป็นช่องแยกกัน โมเดลจะมองข้อความ ภาพ และเสียงเป็นบริบทเดียวกัน ดึงตัวละครจากภาพถ่าย การเคลื่อนกล้องจากคลิป และอารมณ์จากแทร็กเสียงเข้ามาอยู่ในฉากเดียวกัน ทีมที่มีวัสดุเดิมอยู่แล้วจึงมีเส้นทางตรงไปสู่ช็อตที่เสร็จสมบูรณ์

เสียงสเตอริโอแบบเนทีฟในทุกคลิป

ผลลัพธ์ทุกชิ้นมาพร้อมเสียง บทสนทนา เสียงบรรยากาศ และดนตรีถูกสร้างเป็นสเตอริโอแบบเนทีฟในรอบเดียวกับที่เรนเดอร์ภาพที่ 24 frames per second จึงไม่ต้องทำดนตรีประกอบหรือพากย์เสียงเพิ่มภายหลัง เพราะจังหวะเวลาถูกกำหนดระหว่างการสร้างช็อต เสียงฝีเท้า คำพูด และคัตจึงตรงกับแอ็กชันเสมอ โฆษณาสั้นและคอนเทนต์โซเชียลจึงพร้อมเผยแพร่ทันที

แก้ไขระดับ prompt ผ่าน MiniMax H3 API

ต้องการเปลี่ยนแมวเป็นสุนัข แทนที่ green screen หรือเขียนบทสนทนาหนึ่งบรรทัดใหม่ใช่ไหม MiniMax H3 API นำการแก้ไขลักษณะนี้ไปใช้กับวิดีโอที่คุณส่งมา ครอบคลุมตัวละคร วัตถุ ฉากหลัง แสง และเอฟเฟกต์ ขณะที่ส่วนที่คุณไม่ได้ระบุจะยังคงใกล้เคียงต้นฉบับ prompt รองรับได้ถึง 7000 characters จึงสามารถซ้อนการเปลี่ยนแปลงหลายสิบรายการไว้ในรอบเดียว ทำให้การปรับแก้คัตที่ได้รับอนุมัติแล้วทำได้จริง

ถ่ายโอนโทนเสียงและสลับบทสนทนา

ส่งตัวอย่างเสียงไปพร้อมกับรูปภาพหรือฟุตเทจ แล้วตัวละครที่สร้างขึ้นจะพูดด้วยโทนเสียงนั้น รองรับเสียงอ้างอิงได้สูงสุด 3 รายการต่อคำขอ โดยแต่ละรายการมีความยาวระหว่าง 2 and 15 seconds และเสียงต้องมาพร้อมอินพุตภาพเสมอ ไม่สามารถส่งมาเดี่ยว ๆ ได้ บทสนทนาเดิมยังสามารถถูกแทนที่และปรับการแสดงให้เข้ากันได้ งานซีรีส์จึงรักษาเสียงที่จดจำได้เดิมไว้ในทุกตอน

1440p และ 6 อัตราส่วนภาพใน MiniMax H3 API

คลิปมีความยาวตั้งแต่ 5 to 15 seconds และโหมด 1440p จะวาง 1440 pixels ไว้ด้านสั้นระหว่าง 16:9 ถึง 9:16 หรือประมาณ 3.7 megapixels ในอัตราส่วนที่กว้างกว่า เช่น 2976 by 1248 สำหรับ 21:9 เลือกอัตราส่วนได้ 6 แบบ ตั้งแต่ 21:9 แบบภาพยนตร์ไปจนถึงแนวตั้ง 9:16 และ MiniMax H3 API ยังเลือกให้คุณได้ด้วย ช่วงตัวเลือกนี้ครอบคลุมทั้งตัวอย่างภาพยนตร์ ลูปสินค้า และดราม่าแนวตั้ง โดยไม่ต้องสลับโมเดล

รับฟอร์แมตสำหรับงานโปรดักชันได้เลย ไม่ต้องแปลงไฟล์

ถ้าไฟล์ต้นฉบับของคุณมาจากกล้องหรือไทม์ไลน์ตัดต่อโดยตรง ก็ส่งเข้าไปได้ตามเดิม: วิดีโอ H.264 และ H.265, ภาพนิ่ง JPG, PNG, WEBP, HEIC และ HEIF รวมถึงเสียง WAV และ MP3 ขีดจำกัดต่อไฟล์อยู่ที่ 50MB สำหรับวิดีโอ, 30MB สำหรับรูปภาพ และ 15MB สำหรับเสียง ขณะที่การส่ง asset ผ่าน URL ช่วยให้คำขออยู่ภายในขีดจำกัด body 64MB บน Atlas Cloud ชุดงานทั้งหมดทำงานผ่านคีย์เดียวที่เข้ากันได้กับ OpenAI พร้อมการคิดค่าบริการตามการใช้งาน

พรอมต์เดียวกัน สามเอนจิน: เปรียบเทียบ MiniMax H3 API แบบตัวต่อตัว

ทุกคลิปในชุดนี้มาจากพรอมต์เดียวกันทุกคำที่ส่งไปยัง MiniMax H3 API และโมเดลวิดีโออีกสองตัวที่โฮสต์บน Atlas Cloud เพื่อให้เปรียบเทียบการเคลื่อนไหว เสียง และความแม่นยำในการทำตามคำสั่งได้โดยไม่เปลี่ยนแม้แต่คำเดียว

พรอมต์

วิดีโอสั้น 15 วินาที อัตราส่วน 16:9 แนวนอน ฟุตเทจไลฟ์แอ็กชันของร้านซักผ้าหยอดเหรียญแบบบริการตนเองยามดึก ผสานกับแอนิเมชันเรืองแสงแบบวาดมือจนกลายเป็นภาพสื่อผสม ร้านซักผ้าหยอดเหรียญขนาดเล็ก แสงไฟฟลูออเรสเซนต์กะพริบแผ่ว ๆ ภายในมีเครื่องซักผ้าที่กำลังทำงาน ตะกร้าผ้าพลาสติก และม้านั่งเก่า ๆ พร้อมถุงเท้าข้างหนึ่งวางอยู่บนพื้น ทั้งพื้นที่เงียบสงบ แฝงอารมณ์โหยหาอดีตจาง ๆ มีพื้นผิวแบบฟุตเทจมือถือที่ถือถ่ายด้วยมือข้างเดียว กล้องสั่นอย่างเห็นได้ชัด แสงฟลูออเรสเซนต์สีขาวทำให้ค่าแสงแกว่งไปมาระหว่างสว่างกับมืด พื้นผิวกระจกมีเงาสะท้อนจากสภาพแวดล้อม และมีอาการโฟกัสหน่วงเมื่อเลนส์เคลื่อนเข้าใกล้วัตถุ ภาพไม่ควรเนี้ยบและเป็นระเบียบเหมือนโฆษณาเชิงพาณิชย์ — โดยรวมควรให้ความรู้สึกเหมือนภาพบันทึกสารคดีจริง ๆ ราวกับคุณบังเอิญเดินเข้ามาตอนดึกแล้วรีบคว้าช็อตนี้ไว้ขณะไล่ตามนิมิตประหลาดคล้ายความฝัน

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

พรอมต์

มุมมองบุคคลที่หนึ่ง · ระดับสายตา · กล้องเกมแบบถือด้วยมือ ฉาก: ช็อตนี้จำลองผู้เล่นที่กำลังควบคุมเกม FPS สงครามยุคใหม่ มือทั้งสองข้างถือปืนไรเฟิลจู่โจม พร้อมค่อย ๆ รุกไปตามแนวรอบนอกของฐานทัพ ผู้เล่นเคลื่อนไปข้างหน้าตามถนนข้างที่กำบัง เป้าเล็งกวาดสำรวจทางเดินด้านหน้า หลังหยุดชั่วครู่ก็ยิงไปยังเป้าหมายระยะไกลสองสามนัด แล้วเดินหน้าบุกต่อ — เหมือนฟุตเทจเกมเพลย์สดของผู้เล่นทั่วไป แสง: แสงธรรมชาติโทนเย็นของฐานทัพสมัยใหม่สอดประสานกับควันและแสงไฟจากปากกระบอกปืน ภาพสมจริงและคมชัด โดยอาวุธโลหะ รวมถึงฝุ่นและหมอกควันในสนามรบ ให้คุณภาพระดับ AAA-game งานกล้อง: กล้องมีอาการโยกไหวเล็กน้อยแบบถือด้วยมือขณะผู้เล่นเคลื่อนที่ — เริ่มจากค่อย ๆ เดินหน้า จากนั้นกวาดซ้ายขวาเล็กน้อยเพื่อสังเกตการณ์ มีแรงสั่นสะเทือนจากการถอยของปืนอย่างละเอียดตอนยิง ก่อนจะเดินหน้ารุกต่อไปอย่างมั่นคงในท้ายที่สุด

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

MiniMax H3 API เหมาะกับงานโปรดักชันส่วนไหน

ตั้งแต่ภาพยนตร์แบรนด์และดราม่าแนวตั้ง ไปจนถึงวิดีโอสินค้า วิชวลเกม และการตัดต่อฟุตเทจเดิมอย่างแม่นยำ MiniMax H3 API รองรับทุกสถานการณ์ผ่านคำขอ multimodal เพียงครั้งเดียว และส่งคืนวิดีโอพร้อมเสียงสเตอริโอแบบ native

ภาพยนตร์แบรนด์สไตล์ภาพยนตร์บน MiniMax H3 API

ส่งเฟรมสตอรีบอร์ดและ shot list เข้าไปในการเรียกครั้งเดียว เพื่อสร้างเทรลเลอร์ 1440p, สปอต TVC และแคมเปญแฟชั่นที่ 24 FPS โดยทุกผลลัพธ์มาพร้อมเสียงสเตอริโอแบบ native ทำให้ทีมแบรนด์สามารถพรีวิวคัตที่เสร็จสมบูรณ์ได้ทันที

การผลิตดราม่าสั้นแนวตั้ง

เอาต์พุตแนวตั้ง 9:16 รองรับฉากดราม่าตามบท ตั้งแต่ปริศนาเครื่องแต่งกายไปจนถึงการเผชิญหน้าในครอบครัว พร้อมพากย์บทสนทนาในขั้นตอนเดียวกัน สตูดิโอที่สร้างคลังดราม่าสั้นจะได้ฮุกความยาว 15 วินาทีโดยไม่ต้องจองนักแสดงหรือสตูดิโอถ่ายทำ

การประกอบช็อตจากหลาย Reference

หากช็อตหนึ่งต้องการใบหน้าและการเคลื่อนไหวเฉพาะ สามารถใช้ภาพได้สูงสุดเก้าภาพ วิดีโอสามไฟล์ และคลิปเสียงสามไฟล์เพื่อกำกับการเรียกครั้งเดียวได้ อัตลักษณ์ตัวละคร งานกล้อง และโทนเสียงพูดจะคงที่ตลอดทุกตอน

การตัดต่อฟุตเทจเดิมด้วย MiniMax H3 API

ต้องการแก้ไขภายหลังใช่ไหม? สามารถตัดต่อฟุตเทจเดิมด้วย prompt ได้ เช่น สลับตัวแบบ เปลี่ยนฉากหลัง ปรับแสง หรือเขียนประโยคพูดใหม่ โดยไม่ต้องถ่ายซ้ำแม้แต่เฟรมเดียว

การตลาดสำหรับสินค้าและ E-commerce

ภาพถ่ายสินค้ากลายเป็นภาพเคลื่อนไหวได้: ใช้ภาพ reference เพียงภาพเดียวเพื่อสร้างโชว์เคส 360 degree วิดีโออธิบายฟีเจอร์ หรือคัตสำหรับโฆษณาโซเชียลแบบเสียเงิน อัตราส่วนภาพตั้งแต่ 21:9 ถึง 9:16 ช่วยให้ชุด asset เดียวใช้งานได้กับทุกตำแหน่งสื่อ

MiniMax H3 API สำหรับวิชวลเกมและอนิเมะ

เอาต์พุตแบบมีสไตล์ยังคงคุณภาพสำหรับ game CG, character PV, opening อนิเมะ และเดโมอินเทอร์เฟซที่เมนู องค์ประกอบ HUD และข้อความซ้อนทับต้องอ่านได้ชัดเจน ทีมอาร์ตใช้เพื่อตรวจสอบคอนเซ็ปต์ก่อนเข้าสู่การผลิต

MiniMax H3 API Compared With Other Multimodal Video Models

Line the MiniMax H3 API up against the other video models hosted on Atlas Cloud and see how input modalities, reference limits, length, resolution, and audio output actually differ before you commit to an endpoint.

ModelInput ModalitiesMax Reference FilesOutput DurationMax ResolutionNative Audio
MiniMax H3Text, image, video, audio9 images, 3 videos, 3 audio clips, 12 files total5s to 15s1440p at 24 FPS√ Native stereo audio on every output
Seedance 2.0 Reference-to-VideoText, image, video, audio9 images, 3 videos, 3 audio clipsUp to 15s720p√ Stereo dialogue, effects, and music generated in one pass
Veo3.1 Reference-to-videoText and image3 reference images4s, 6s, or 8s4K at 8s length only√ Dialogue, ambience, and sound effects aligned to the timeline
Wan-2.7 Reference-to-videoText, image, video, audio5 images or video clips, plus one voice clip2s to 15s1080p√ Music and effects generated, or drive lip sync with your own audio
Kling v3.0 Pro Image-to-VideoText and image-Up to 15s1080p√ Multilingual dialogue with lip sync in five languages

วิธีใช้ MiniMax H3 บน Atlas Cloud

เริ่มต้นได้ในไม่กี่นาที — ทำตามขั้นตอนง่าย ๆ เหล่านี้เพื่อเชื่อมต่อและใช้งานโมเดลผ่านแพลตฟอร์ม Atlas Cloud

สร้างบัญชี Atlas Cloud

สมัครสมาชิกที่ atlascloud.ai และยืนยันตัวตน ผู้ใช้ใหม่จะได้รับเครดิตฟรีเพื่อสำรวจแพลตฟอร์มและทดสอบโมเดล

ทำไมต้องใช้ MiniMax H3 บน Atlas Cloud

การรวมโมเดล MiniMax H3 ขั้นสูงเข้ากับแพลตฟอร์มที่เร่งด้วย GPU ของ Atlas Cloud ให้ประสิทธิภาพ ความสามารถในการขยาย และประสบการณ์นักพัฒนาที่ไม่มีใครเทียบได้

ประสิทธิภาพและความยืดหยุ่น

เวลาแฝงต่ำ:
inference ที่ปรับแต่ง GPU เพื่อการตอบสนองแบบเรียลไทม์

API แบบรวมศูนย์:
รัน MiniMax H3, GPT, Gemini และ DeepSeek ด้วยการเชื่อมต่อเดียว

ราคาโปร่งใส:
ชำระเงินต่อโทเค็นที่คาดเดาได้พร้อมตัวเลือก serverless

องค์กรและขนาด

ประสบการณ์นักพัฒนา:
SDK, การวิเคราะห์, เครื่องมือปรับแต่ง และเทมเพลต

ความน่าเชื่อถือ:
ความพร้อมใช้งาน 99.99%, RBAC และการบันทึกที่พร้อมสำหรับการปฏิบัติตาม

ความปลอดภัยและการปฏิบัติตาม:
SOC 2 Type II, สอดคล้อง HIPAA, อธิปไตยข้อมูลในสหรัฐอเมริกา

MiniMax H3 API: คำตอบสำหรับนักพัฒนา

MiniMax H3 API ช่วยให้นักพัฒนาเข้าถึง MiniMax H3 ผ่านโปรแกรมได้ โดยเป็นโมเดลวิดีโอมัลติโมดัลอเนกประสงค์แบบเปิดที่มองข้อความ รูปภาพ วิดีโอ และเสียงเป็นบริบทร่วมเดียวกัน แทนที่จะแยกการสร้าง การแก้ไข และการอ้างอิงออกเป็นโมเดลงานคนละตัว H3 จะอ่านชุดอินพุตทั้งหมดแล้วส่งคืนคลิปที่เสร็จสมบูรณ์พร้อมเสียง บน Atlas Cloud โมเดลนี้ทำงานอยู่หลัง API key เดียว พร้อมราคาแบบ pay-as-you-go

ขอบเขตการใช้งานครอบคลุมทั้งภาพยนตร์แบรนด์ ตัวอย่างภาพยนตร์ ละครสั้นแนวตั้ง โฆษณาสินค้าและอีคอมเมิร์ซ เดโมโมชั่นสำหรับเกมและ UI รวมถึงแอนิเมชันสไตล์ต่าง ๆ เนื่องจากโมเดลจัดการข้อความบนหน้าจอ คำบรรยาย และแอสเซ็ตของแบรนด์ได้ ทีมต่าง ๆ จึงใช้สำหรับตรวจสอบคอนเซ็ปต์ พรีวิวสตอรีบอร์ด และทำพิตช์เชิงภาพก่อนตัดสินใจใช้งบการผลิตจริง

สร้างบัญชี Atlas Cloud สร้าง API key จากนั้นส่งพรอมป์พร้อมไฟล์อ้างอิงใด ๆ ไปยัง video generation endpoint แล้ว poll เพื่อรับผลลัพธ์ที่เสร็จสมบูรณ์ แนะนำให้ส่งสื่อเป็น hosted URLs แทนการอัปโหลดแบบ inline เนื่องจาก request body จำกัดไว้ที่ 64MB เริ่มสร้างได้วันนี้

การเรียกเก็บเงินเป็นแบบ pay-as-you-go คุณจึงจ่ายต่อการเรียกใช้งาน แทนการซื้อ subscription หรือ seat license ค่าใช้จ่ายจะอิงตามสิ่งที่คุณเรนเดอร์จริง ซึ่งหมายความว่าความละเอียดและความยาวคลิปเป็นปัจจัยกำหนดราคารวมของ batch ควรตรวจสอบ model page เพื่อดูอัตราต่อ generation ล่าสุดก่อนวางแผนรันงานปริมาณมาก

ใช่ ผลลัพธ์จาก H3 ทุกชิ้นส่งมอบพร้อมเสียงแบบ native stereo ดังนั้นบทสนทนา เอฟเฟกต์ และเสียงบรรยากาศจะมาพร้อมภาพใน pass เดียวกัน หากส่งคลิปเสียงอ้างอิงให้ โมเดลสามารถนำ timbre นั้นไปใช้กับตัวละครได้ ช่วยตัดขั้นตอน voice synthesis แยกออกจาก pipeline

คลิปมีความยาวตั้งแต่ 5 ถึง 15 วินาที ที่ 24 FPS ในโหมด 1440p ด้านสั้นจะเรนเดอร์ที่ 1440 พิกเซลสำหรับอัตราส่วนระหว่าง 16:9 ถึง 9:16 และหากอยู่นอกช่วงนั้น เฟรมจะมีจำนวนพิกเซลรวมประมาณ 3.7M เช่น 2976 x 1248 ที่ 21:9 คำขอ text to video และ omni reference รองรับ 21:9, 16:9, 4:3, 1:1, 3:4 และ 9:16 ส่วนคำขอ first and last frame จะใช้อัตราส่วนภาพตามรูปภาพอินพุต

สามารถส่งรูปภาพได้สูงสุดเก้ารูป วิดีโอสามช่วง และคลิปเสียงสามคลิปไปพร้อมกับพรอมป์เดียว โดยจำกัดไฟล์รวมทั้งหมดไม่เกินสิบสองไฟล์ วิดีโอและเสียงแต่ละประเภทมีความยาวรวมไม่เกิน 15 วินาที และเสียงต้องมาพร้อมรูปภาพหรือวิดีโอ ไม่ใช่ส่งมาเดี่ยว ๆ พรอมป์รองรับได้ถึง 7000 อักขระ จึงมีพื้นที่เพียงพอสำหรับคำสั่งแบบช็อตต่อช็อตที่ครอบคลุมกล้อง การแสดง และเสียง

อินพุตที่รองรับ ได้แก่ วิดีโอ H.264 และ H.265, รูปภาพ JPG, JPEG, PNG, WEBP, HEIC และ HEIF รวมถึงเสียง WAV หรือ MP3 โดยแทร็กเสียงภายในไฟล์วิดีโอรองรับ AAC หรือ MP3 ขีดจำกัดต่อไฟล์คือ 50MB สำหรับวิดีโอ, 30MB สำหรับรูปภาพ และ 15MB สำหรับเสียง เนื่องจาก request body จำกัดไว้ที่ 64MB การใช้ hosted URLs จึงเป็นทางเลือกที่ปลอดภัยกว่าสำหรับแอสเซ็ตขนาดใหญ่

การแก้ไขเป็นหนึ่งในโหมดหลักของโมเดลนี้ ส่งคลิปต้นฉบับพร้อมคำสั่ง แล้ว MiniMax H3 API สามารถสลับตัวละครหรือวัตถุ เปลี่ยนฉากหลังและแสง เพิ่ม visual effects เป็นเลเยอร์ และเขียนบทสนทนาใหม่ โดยยังคงพื้นที่ที่ไม่ต้องการแก้ไขให้เสถียร คำสั่งแบบ compound จัดการได้ในคำขอเดียว จึงทำให้การเปลี่ยนแปลงหลายอย่างเกิดขึ้นพร้อมกัน แทนที่จะต้องวนส่งหลายรอบ

โมเดลวิดีโอส่วนใหญ่มักรับพรอมป์หนึ่งรายการพร้อมรูปภาพหนึ่งรูป แล้วส่งคืนคลิปที่ไม่มีเสียง แต่ H3 รับชุดอ้างอิงแบบผสม อ่านเจตนาด้านตัวละคร การเคลื่อนไหว กล้อง และเสียงจากทั้งหมด จากนั้นส่งคืนคลิปพร้อม native audio หาก pipeline ของคุณในปัจจุบันต้องนำโมเดลวิดีโอ โมเดลเสียง และตัวแก้ไขมาต่อเข้าด้วยกัน H3 จะรวมขั้นตอนเหล่านั้นให้เหลือเพียงการเรียกครั้งเดียว

สำรวจกลุ่มเพิ่มเติม

Seedance 2.0

Seedance 2.0 API ให้คุณเข้าถึงระดับโปรดักชันของโมเดลวิดีโอแบบมัลติโมดัลจาก ByteDance — รองรับอินพุต 4 รูปแบบ (ข้อความ, รูปภาพ, วิดีโอ, เสียง) และระบบ "Universal Reference" ชั้นนำของอุตสาหกรรมที่ล็อกองค์ประกอบภาพ การเคลื่อนไหวของกล้อง และการกระทำของตัวละครในทุกช็อต ผสานรวมการควบคุมระดับผู้กำกับด้วยการเรียกใช้ API เพียงครั้งเดียว ในราคาคงที่ $0.09/วินาที รับคีย์ได้ทันที และไม่มีคิวรอ — พร้อมการรับประกันเวลาพร้อมใช้งานและการปฏิบัติตามข้อกำหนดระดับองค์กร Seedance 2.0 Native 4K เปิดใช้งานแล้ววันนี้!

ดูกลุ่ม

GPT Image 2

GPT Image 2 API ช่วยให้นักพัฒนาสามารถเข้าถึงโมเดลรูปภาพล่าสุดของ OpenAI ซึ่งเป็นรุ่นสืบทอดจาก GPT Image 1.5 โดยสามารถสร้างและแก้ไขรูปภาพพร้อมกับการเรนเดอร์ข้อความที่แม่นยำทั้งในอักษรละตินและ CJK รวมถึงการจัดวางองค์ประกอบที่ยอดเยี่ยมสำหรับโปสเตอร์ ม็อกอัป และอินโฟกราฟิก บน Atlas Cloud คุณสามารถเข้าถึงโมเดลนี้ผ่าน API ที่เป็นหนึ่งเดียวร่วมกับโมเดลอื่นๆ อีกกว่า 300 รุ่น พร้อมเครดิตฟรี เวลาทำงาน 99.99% และไม่จำเป็นต้องมีการตรวจสอบยืนยันองค์กรจาก OpenAI

ดูกลุ่ม

Seedream 5.0 Pro

Seedream 5.0 Pro API มอบโมเดลการแก้ไขภาพที่ควบคุมได้ของ ByteDance บน Atlas Cloud ให้กับนักพัฒนา โดยจะวางการแก้ไขอย่างแม่นยำด้วยจุดยึดและพิกัด แยกภาพออกเป็นเลเยอร์ที่แก้ไขได้ ผสานข้อมูลอ้างอิงหลายรายการ และจับคู่สีและวัสดุที่แน่นอน พร้อมข้อความหลายภาษาที่ความละเอียด 2K และ 3K บน Atlas Cloud คุณสามารถเข้าถึงได้ผ่านคีย์เดียว!

ดูกลุ่ม

Gemini Omni Flash

Gemini Omni API นำโมเดลสร้างและแก้ไขวิดีโอแบบมัลติโมดัลของ Google DeepMind ซึ่งเปิดตัวในงาน Google I/O 2026 มาสู่สแต็กของคุณ Gemini Omni ผสานเอนจินการใช้เหตุผลของ Gemini เข้ากับสื่อเชิงสร้างสรรค์ รองรับอินพุตทุกรูปแบบทั้งข้อความ รูปภาพ วิดีโอ และเสียง เพื่อสร้างผลลัพธ์ที่สอดคล้องกันและอิงตามความรู้ ปรับแต่งผลลัพธ์ผ่านการสนทนาอย่างเป็นธรรมชาติ ไม่ว่าจะเปลี่ยนวัตถุ เขียนฉากใหม่ หรือปรับสไตล์ โดยที่ฟิสิกส์ ตัวละคร และความต่อเนื่องยังคงเดิม Atlas Cloud ให้บริการ Gemini Omni Flash ครบทั้งไลน์อัป ทั้งการสร้างวิดีโอจากข้อความ การสร้างวิดีโอจากรูปภาพพร้อมรูปอ้างอิงสูงสุด 7 รูป และการสร้างวิดีโอจากรูปอ้างอิง ผ่าน API เดียวแบบครบวงจร ด้วยราคาต่อวินาทีที่โปร่งใสเริ่มต้นที่ $0.112 โดยไม่ต้องสมัครสมาชิก เริ่มสร้างได้เลยวันนี้

ดูกลุ่ม

Grok Imagine

Grok Imagine API นำเสนอการสร้างภาพ วิดีโอ และเสียงของ xAI ให้นักพัฒนาในชุดเครื่องมือเดียว สามารถสร้างภาพความละเอียดสูงสุด 2K พร้อมการเรนเดอร์ข้อความหลายภาษา รวมถึงวิดีโอความยาวสูงสุด 15 วินาทีพร้อมเสียงที่ซิงโครไนซ์แบบเนทีฟและการแก้ไขตามข้อมูลอ้างอิง บน Atlas Cloud คีย์เดียวสามารถรัน Grok Imagine ได้ทุกโหมด คุณจึงสามารถสลับไปมาระหว่างภาพ วิดีโอ และเสียงได้โดยไม่ต้องตั้งค่าแยกกัน เริ่มต้นที่ $0.02 ต่อภาพ และ $0.05 ต่อวินาที

ดูกลุ่ม

Google

โมเดลเชิงสร้างสรรค์ที่ทรงพลังที่สุดของ Google พร้อมใช้งานแล้วบน Atlas Cloud โดย Veo 3.1 นำเสนอการสร้างวิดีโอระดับภาพยนตร์ Nano Banana 2 ขับเคลื่อนการสร้างภาพที่มีความเที่ยงตรงสูง และ Gemini นำความชาญฉลาดแบบมัลติโมดัลมาสู่ทุกเวิร์กโฟลว์ เข้าถึงชุดโมเดลของ Google เต็มรูปแบบผ่าน API key เดียวพร้อมความพร้อมใช้งานระดับ Day-0 และการกำหนดราคาแบบจ่ายตามการใช้งาน (pay-as-you-go)

ดูกลุ่ม

Seedance 2.0 Mini

Seedance 2.0 Mini นำเสนอการสร้างวิดีโอแบบมัลติโมดัลของ ByteDance สู่เวิร์กโฟลว์ที่ความเร็วและต้นทุนมีความสำคัญสูงสุด โดยมอบความสามารถหลักของ Seedance 2.0 ในรูปแบบที่ใช้ทรัพยากรน้อยลง — สร้างได้เร็วกว่า ต้นทุนต่อวิดีโอต่ำกว่า และใช้การผสานรวม API เดิมที่คุณใช้อยู่แล้ว สำหรับทีมที่จัดการไปป์ไลน์ปริมาณมากหรือสร้างต้นแบบในสเกลขนาดใหญ่ Mini คือตัวเลือกเริ่มต้นที่ใช้งานได้จริง

ดูกลุ่ม

ByteDance

ตั้งแต่การสร้างวิดีโอระดับภาพยนตร์ไปจนถึงการสร้างภาพที่มีความละเอียดสูง โมเดลที่ทรงพลังที่สุดของ ByteDance พร้อมใช้งานแล้วบน Atlas Cloud รัน Seedance และ Seedream ในสเกลขนาดใหญ่ด้วยราคาการอนุมานที่ต่ำที่สุด และไม่มีค่าใช้จ่ายแฝงด้านโครงสร้างพื้นฐาน

ดูกลุ่ม

Alibaba

Atlas Cloud รวบรวมโมเดลทั้งหมดของ Alibaba ไว้ใน API เดียว: Qwen สำหรับงานด้านภาษาและรูปภาพ และ Wan สำหรับการสร้างวิดีโอความละเอียดสูงสุด 1080p เข้าถึงทุกโมเดลในรูปแบบจ่ายตามการใช้งานจริง (pay-as-you-go) โดยไม่ต้องสมัครสมาชิก Alibaba API พร้อมใช้งานผ่าน base URL เดียวโดยใช้ไคลเอนต์ที่รองรับ OpenAI ที่คุณมีอยู่แล้ว

ดูกลุ่ม

OpenAI

Atlas Cloud ให้คุณเข้าถึงกลุ่มผลิตภัณฑ์ OpenAI API แบบครบวงจร ตั้งแต่ GPT Image 2 สำหรับการสร้างภาพถ่าย ไปจนถึง Sora 2 สำหรับวิดีโอ ทุกโมเดลพร้อมใช้งานแบบจ่ายตามการใช้งานจริง (pay-as-you-go) โดยไม่มีข้อผูกมัดรายเดือน เชื่อมต่อได้ง่ายดายด้วยการสลับ base URL เพียงจุดเดียวโดยใช้ API ที่เข้ากันได้กับ OpenAI

ดูกลุ่ม

xAI

สร้างไปป์ไลน์ภาพและวิดีโอที่สมบูรณ์โดยใช้ xAI API บน Atlas Cloud สร้างที่ความละเอียด 2K แก้ไขด้วยภาพอ้างอิง และทำให้ภาพเคลื่อนไหวเป็นคลิปที่ซิงค์กับเสียง

ดูกลุ่ม

Kwaivgi

Kwaivgi API ในราคาที่ถูกกว่าราคามาตรฐาน 15% Atlas Cloud มอบการเข้าถึง Day-0 สำหรับการเปิดตัว Kling ใหม่ด้วยการกำหนดราคาแบบจ่ายตามการใช้งานจริง (pay-as-you-go) และไม่จำกัดจำนวนผู้ใช้ บัญชีเดียว คีย์เดียว สำหรับโมเดล Kling ทุกรุ่นตั้งแต่ระดับมาตรฐานไปจนถึงระดับมาสเตอร์

ดูกลุ่ม

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด