Kling O1 Powered by MVL

Kling O1 Powered by MVL

Kling O1 คือกลุ่มโมเดลวิดีโอของ Kuaishou ที่พัฒนาด้วยเทคโนโลยี Multi-modal Visual Language เวิร์กโฟลว์ text-to-video และ image-to-video เชื่อมโยงบริบทด้านภาษาและภาพเข้าด้วยกัน เพื่อสร้างการเคลื่อนไหวของฉากที่ต่อเนื่องราบรื่นจากพรอมต์หรือภาพต้นฉบับ Atlas Cloud รองรับทั้งสองโหมดผ่าน REST API ที่พร้อมใช้งานทันที ไม่มี cold start และคิดค่าบริการตามการใช้งานจริงอย่างโปร่งใส เริ่มสร้างสรรค์ได้วันนี้

Kling o1 พัฒนาโดย Kuaishou โดย Atlas Cloud (ดำเนินการโดย Atlas Cloud AI LLC) เป็นผู้ให้บริการเข้าถึงโมเดลนี้ แต่ไม่ได้เป็นเจ้าของโมเดล เครื่องหมายการค้าทั้งหมดเป็นของเจ้าของที่เกี่ยวข้อง

รูปแบบการทำงานของ Kling O1 สำหรับการสร้างวิดีโอแบบภาพยนตร์

เปรียบเทียบเวิร์กโฟลว์ข้อความและรูปภาพของ Kling O1 เพื่อเลือก endpoint สำหรับสร้างวิดีโอที่เหมาะกับโปรเจกต์ของคุณ

รูปแบบการทำงานคำอธิบาย
Kling O1 T2V API (Text To Video)เปลี่ยนพรอมต์ข้อความให้เป็นวิดีโอแบบภาพยนตร์ด้วย Kling O1 Text to Video endpoint เทคโนโลยี MVL รองรับการทำความเข้าใจความหมายอย่างแม่นยำ ความสอดคล้องของตัวแบบ และการจำลองฟิสิกส์ที่เป็นธรรมชาติ เหมาะสำหรับแนวคิดเรื่องราว การเล่าเรื่องผลิตภัณฑ์ และฉากที่กำกับผ่านข้อความ
Kling O1 I2V API (Image To Video)เริ่มต้นจากภาพนิ่ง แล้วสร้างวิดีโอแบบภาพยนตร์ที่มีไดนามิกด้วย Kling O1 Image to Video endpoint โดยคงความสอดคล้องของตัวแบบ พร้อมเพิ่มการเคลื่อนไหวที่เป็นธรรมชาติ การจำลองฟิสิกส์ และไดนามิกของฉากที่ต่อเนื่องราบรื่น เวิร์กโฟลว์นี้เหมาะสำหรับการทำภาพให้เคลื่อนไหว การเล่าเรื่องด้วยภาพ และการพัฒนาฉากแบบภาพยนตร์

ภายในเอ็นจินการเคลื่อนไหว Kling O1

Kling O1 ผสานการสร้างวิดีโอจากข้อความและการสร้างวิดีโอจากภาพเข้ากับความคงเส้นคงวาของวัตถุ ฟิสิกส์ที่เป็นธรรมชาติ ความเข้าใจพรอมต์อย่างแม่นยำ การควบคุมเฟรมแรกและเฟรมสุดท้าย ระยะเวลาแบบยืดหยุ่น 5 หรือ 10 วินาที อัตราส่วนภาพ 3 รูปแบบ และการเข้าถึง Atlas Cloud REST ที่พร้อมใช้งาน ด้วยราคาตามการใช้งานอย่างโปร่งใส

การสร้างแบบมัลติโหมดด้วย Kling O1

Kling O1 เปลี่ยนพรอมต์ข้อความหรือภาพต้นทางให้เป็นวิดีโอสไตล์ภาพยนตร์ผ่าน dedicated text-to-video และ image-to-video endpoints ของ Atlas Cloud สถาปัตยกรรม MVL ตีความเจตนาของฉากจากทั้งอินพุตด้านภาษาและภาพ เลือกโหมดให้ตรงกับแอสเซ็ตตั้งต้นได้โดยไม่ต้องเปลี่ยนตระกูลโมเดลพื้นฐาน ความยืดหยุ่นนี้เหมาะกับทีมที่พัฒนางานตั้งแต่แนวคิดเริ่มต้นไปจนถึงช็อตแคมเปญหรือเรื่องราวแบบแอนิเมชัน

คงเอกลักษณ์ได้อย่างต่อเนื่อง

โมเดลยังคงให้วัตถุเป็นที่จดจำได้ตลอดการเคลื่อนไหว แม้กล้องจะเคลื่อนที่และฉากจะเปลี่ยนแปลง การสร้าง image-to-video นำเอกลักษณ์ทางภาพจากภาพต้นฉบับไปสู่การเคลื่อนไหว ขณะที่ text-to-video สร้างตัวละครที่สอดคล้องกันจากพรอมต์ วัตถุที่คงที่ช่วยลดการเปลี่ยนแปลงที่รบกวนสายตาระหว่างเฟรม ใช้จุดแข็งนี้กับเรื่องราวที่ขับเคลื่อนด้วยตัวละคร ช็อตสินค้า และลำดับภาพที่ความต่อเนื่องทางภาพมีความสำคัญ

การเคลื่อนไหวและฟิสิกส์ที่เป็นธรรมชาติ

การจำลองฟิสิกส์ที่เป็นธรรมชาติช่วยให้การเคลื่อนไหวมีน้ำหนัก โมเมนตัม และปฏิสัมพันธ์กับฉากโดยรอบที่น่าเชื่อถือ Kling O1 ทำให้ผู้คน วัตถุ และองค์ประกอบในสภาพแวดล้อมเคลื่อนไหวด้วยไดนามิกที่เชื่อมโยงกันอย่างเป็นธรรมชาติ แทนที่จะดูเหมือนนำมาต่อกัน ใส่คำบอกการกระทำที่ชัดเจนควบคู่กับทิศทางกล้องในพรอมต์ ผลลัพธ์เหมาะกับภาพกีฬา อาหาร ธรรมชาติ และแอ็กชัน ซึ่งคุณภาพของการเคลื่อนไหวเป็นหัวใจสำคัญของช็อต

การควบคุมเฟรมของ Kling O1

เริ่มต้นด้วยภาพเดียว หรือระบุภาพสุดท้ายเพิ่มเติมเพื่อกำหนดจุดสิ้นสุดของการเคลื่อนไหว image-to-video schema ของ Atlas Cloud รองรับคลิปความยาว 5 หรือ 10 วินาที ทำให้สามารถเลือกระยะจังหวะสั้นหรือช่วงเปลี่ยนผ่านที่ยาวขึ้นได้อย่างชัดเจน โมเดลสังเคราะห์การเคลื่อนไหวระหว่างสถานะทางภาพภายใต้คำแนะนำจากพรอมต์ การควบคุมนี้เหมาะอย่างยิ่งกับการเปิดตัวสินค้า การเปลี่ยนรูป และโครงเรื่องขนาดกะทัดรัด

การกำกับในระดับพรอมต์

ความเข้าใจเชิงความหมายอย่างแม่นยำช่วยให้ Kling O1 แปลงพรอมต์โดยละเอียดเป็นวัตถุ การกระทำ ไดนามิกของฉาก และการเคลื่อนกล้องแบบภาพยนตร์ กำหนดองค์ประกอบภาพด้วยเอาต์พุต 16:9, 9:16 หรือ 1:1 จากนั้นอธิบายการเคลื่อนไหวและบรรยากาศด้วยภาษาธรรมชาติ การกำกับที่ซับซ้อนกลายเป็นคำขอสร้างงานที่มีโครงสร้าง แทนการทำแอนิเมชันด้วยตนเอง จึงเหมาะกับคลิปโซเชียล สตอรีบอร์ด และคอนเซ็ปต์ภาพที่ผ่านการขัดเกลา

Kling O1 API บน Atlas Cloud

พัฒนาผ่าน unified REST API ของ Atlas Cloud สำหรับทั้งการสร้าง text-to-video และ image-to-video Atlas Cloud ระบุว่าไม่มี cold starts และคิดค่าบริการในอัตรามาตรฐาน $0.112 ต่อวินาทีของเอาต์พุต โดยคำนวณตามระยะเวลาที่สร้างขึ้น ส่งพรอมต์ เฟรมต้นทาง ระยะเวลา และอัตราส่วนภาพในรูปแบบพารามิเตอร์ที่มีโครงสร้าง การตั้งค่านี้ช่วยให้นักพัฒนาคาดการณ์ต้นทุนได้และผสานการทำงานเข้ากับเวิร์กโฟลว์วิดีโอสำหรับการใช้งานจริงได้โดยตรง

Kling O1 ในศึกดวลสามโมเดล หนึ่งพรอมป์ต

ดูว่า Kling O1, Seedance 2.0 และ Kling V3.0 Turbo ตีความพรอมป์ตเดียวกันสองชุดอย่างไร ทั้งในด้านความสมจริงแบบภาพยนตร์ ความต่อเนื่องของการเคลื่อนไหว ปฏิสัมพันธ์ทางกายภาพ และการเล่าเรื่องเชิงสไตล์

พรอมต์

สร้างวิดีโอภาพยนตร์สมจริงแบบโฟโตเรียลลิสติกความยาว 10 วินาที เป็นภาพโกลเดนรีทรีฟเวอร์คาบช่อดอกไม้เดินผ่านตลาดดอกไม้ที่พลุกพล่านในยามพระอาทิตย์ขึ้น เริ่มด้วยภาพ tracking shot มุมต่ำ ขณะที่สุนัขวิ่งพุ่งข้ามพื้นหินกรวดเปียกน้ำ โปรยกลีบดอกไม้และเลี้ยวหลบรถเข็นที่กำลังเคลื่อนที่ จากนั้น whip pan ไปยังคนขายดอกไม้ที่กำลังวิ่งไล่ตามจากด้านหลัง แล้วโคจรรอบสุนัขขณะที่มันกระโดดข้ามตะกร้าที่ล้มอยู่และลงพื้นอย่างเป็นธรรมชาติ ปิดท้ายด้วยการ push-in อย่างรวดเร็ว ขณะที่สุนัขหยุดข้างเด็กคนหนึ่ง ยื่นช่อดอกไม้ให้ และคนขายดอกไม้ที่หัวเราะอยู่ก็วิ่งตามมาทัน แสงย้อนจากด้านหลังโทนอุ่น ขน ผ้า และการเคลื่อนไหวของกลีบดอกไม้สมจริง การเคลื่อนไหวต่อเนื่องและเปี่ยมพลัง อัตราส่วนภาพ 16:9

Generated with Kling Video O1 Text-to-Video on Atlas Cloud

Generated with Seedance 2.0 Text-to-Video on Atlas Cloud

Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud

พรอมต์

สร้างวิดีโอสต็อปโมชันสไตล์ดินน้ำมันความยาว 8 วินาที ภายในร้านเบเกอรีที่ส่องสว่างด้วยแสงจันทร์ ซึ่งเชฟจิ้งจอกตัวจิ๋วกำลังเตรียมขนมอบวิเศษ เปิดด้วย crane shot จากมุมสูง ขณะที่จิ้งจอกหมุนแป้ง โยนผลเบอร์รี และหลบหลีกอุปกรณ์ครัวที่เด้งไปมา ตัดไปยังภาพ tracking view ระดับเคาน์เตอร์ ขณะที่ขนมอบพุ่งเข้าเตาอบและเริ่มเปล่งแสง หมุนกล้องอย่างรวดเร็วรอบตัวจิ้งจอก ขณะที่ประตูเตาอบระเบิดเปิดออก และมังกรขนมอบจิ๋วบินออกมา วนผ่านแป้งที่กำลังลอยฟุ้ง แล้วร่อนลงบนหมวกเชฟของมัน พื้นผิวดินน้ำมันแบบงานทำมือ การเคลื่อนไหวที่สื่ออารมณ์ แสงสีน้ำเงินและสีอำพันที่สนุกสนาน ความต่อเนื่องของแอ็กชันที่ลื่นไหล อัตราส่วนภาพ 16:9

Generated with Kling Video O1 Text-to-Video on Atlas Cloud

Generated with Seedance 2.0 Text-to-Video on Atlas Cloud

Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud

Kling O1 ในการเคลื่อนไหว: 6 แนวทางการผลิต

ตั้งแต่คอนเซปต์ภาพยนตร์ที่ขับเคลื่อนด้วยพรอมต์ไปจนถึงภาพสินค้าแบบแอนิเมชัน Kling O1 มอบแนวทางที่ใช้งานได้จริงแก่ผู้สร้างภาพยนตร์ นักการตลาด ทีมพาณิชย์ และนักพัฒนาแอป ในการเปลี่ยนข้อความหรือเฟรมภาพนิ่งให้เป็นวิดีโอที่มีความสม่ำเสมอและสอดคล้องกับหลักฟิสิกส์

ภาพยนตร์คอนเซปต์เชิงภาพยนตร์

เปลี่ยนพรอมต์ที่มีรายละเอียดให้เป็นซีเควนซ์สไตล์ภาพยนตร์ ด้วยความเข้าใจเชิงความหมายอย่างแม่นยำและฟิสิกส์ตามธรรมชาติ ผู้สร้างภาพยนตร์และทีมพรีวิชวลไลเซชันสามารถสำรวจอารมณ์ แอ็กชัน และแนวคิดด้านกล้องได้ก่อนทุ่มทรัพยากรให้กับการถ่ายทำจริงที่มีต้นทุนสูง

แอนิเมชันภาพสินค้าด้วย Kling O1

เติมการเคลื่อนไหวให้ภาพสินค้านิ่ง โดยยังคงตัวแบบไว้และเพิ่มไดนามิกของฉากอย่างลื่นไหล ทีมพาณิชย์สามารถเปลี่ยนภาพจากแค็ตตาล็อกให้เป็นแอสเซ็ตภาพเคลื่อนไหวที่ดูเป็นมืออาชีพสำหรับการเปิดตัวสินค้า หน้าร้าน และครีเอทีฟของแคมเปญ

รูปแบบหลากหลายสำหรับแคมเปญโซเชียลด้วย Kling O1

เริ่มต้นจากคอนเซปต์ที่เขียนไว้ แล้วสร้างวิดีโอสไตล์ภาพยนตร์ที่มีการเคลื่อนไหวตามหลักฟิสิกส์ธรรมชาติ ทีมโซเชียลจะได้ทิศทางภาพใหม่ ๆ สำหรับการประกาศข่าว แคมเปญตามฤดูกาล และการทดสอบครีเอทีฟอย่างรวดเร็วในช่องทางต่าง ๆ

จากสตอรีบอร์ดสู่ฉากเคลื่อนไหว

แปลงพรอมต์เชิงเรื่องราวให้เป็นฉากเคลื่อนไหวที่ต่อเนื่องสอดคล้องกัน ด้วยความเข้าใจเชิงความหมายอย่างแม่นยำ ผู้กำกับ เอเจนซี และสตูดิโอเกมสามารถสร้างภาพการเคลื่อนไหวของตัวละคร สภาพแวดล้อม และบรรยากาศแบบภาพยนตร์ได้ตั้งแต่ช่วงเริ่มต้นของการพัฒนาและวางแผนงานสร้างสรรค์

ทำให้ภาพพอร์ตเทรตมีชีวิต

เติมการเคลื่อนไหวที่เป็นธรรมชาติให้ภาพพอร์ตเทรตนิ่ง โดยโหมดภาพของ Kling O1 ยังคงความสม่ำเสมอของตัวแบบไว้ ครีเอเตอร์สามารถสร้างวิดีโอโปรไฟล์ที่สื่ออารมณ์ การแนะนำตัวละคร และแอสเซ็ตสำหรับการเล่าเรื่องด้วยภาพจากผลงานศิลปะที่มีอยู่

การเคลื่อนไหวที่เป็นธรรมชาติสำหรับคอนเซปต์ฉากแอ็กชัน

เมื่อพรอมต์อธิบายการเคลื่อนไหวที่ซับซ้อน Kling O1 จะใช้การจำลองฟิสิกส์ตามธรรมชาติและความเข้าใจเชิงความหมายอย่างแม่นยำ นักออกแบบแอ็กชันและทีมคอนเซปต์สามารถดูตัวอย่างฉากไดนามิกที่มีการเคลื่อนไหวน่าเชื่อถือได้ก่อนเริ่มการผลิต

Kling O1 เปรียบเทียบกับทางเลือกอื่นสำหรับการสร้างวิดีโอ

เปรียบเทียบ Kling O1 กับโมเดลวิดีโออื่น ๆ ของ Atlas Cloud ตามผู้ให้บริการ โหมดการสร้าง รหัสโมเดล และราคามาตรฐานในแค็ตตาล็อก

โมเดลผู้ให้บริการโหมดการสร้างรหัสโมเดล Atlasราคาพื้นฐานที่ระบุ
Kling Video O1 สร้างวิดีโอจากข้อความKuaishouข้อความเป็นวิดีโอkwaivgi/kling-video-o1/text-to-video$0.112 ไม่ได้ระบุหน่วย
Kling Video O1 สร้างวิดีโอจากรูปภาพKuaishouรูปภาพเป็นวิดีโอkwaivgi/kling-video-o1/image-to-video$0.112 ไม่ได้ระบุหน่วย
Seedance 2.0 สร้างวิดีโอจากข้อความByteDanceข้อความเป็นวิดีโอbytedance/seedance-2.0/text-to-video$0.112 ไม่ได้ระบุหน่วย
Wan-2.7 สร้างวิดีโอจากรูปภาพQwenรูปภาพเป็นวิดีโอalibaba/wan-2.7/image-to-video$0.10 ไม่ได้ระบุหน่วย
Veo 3.1 Lite สร้างวิดีโอจากข้อความGoogleข้อความเป็นวิดีโอgoogle/veo3.1-lite/text-to-video$0.05 ไม่ได้ระบุหน่วย
MiniMax H3 สร้างวิดีโอจากรูปภาพMiniMaxรูปภาพเป็นวิดีโอminimax/h3/image-to-video$0.038 ต่อวินาที

วิธีใช้ Kling o1 บน Atlas Cloud

เริ่มต้นได้ในไม่กี่นาที — ทำตามขั้นตอนง่าย ๆ เหล่านี้เพื่อเชื่อมต่อและใช้งานโมเดลผ่านแพลตฟอร์ม Atlas Cloud

สร้างบัญชี Atlas Cloud

สมัครสมาชิกที่ atlascloud.ai และยืนยันตัวตน ผู้ใช้ใหม่จะได้รับเครดิตฟรีเพื่อสำรวจแพลตฟอร์มและทดสอบโมเดล

ทำไมต้องใช้ Kling o1 บน Atlas Cloud

การรวมโมเดล Kling o1 ขั้นสูงเข้ากับแพลตฟอร์มที่เร่งด้วย GPU ของ Atlas Cloud ให้ประสิทธิภาพ ความสามารถในการขยาย และประสบการณ์นักพัฒนาที่ไม่มีใครเทียบได้

ประสิทธิภาพและความยืดหยุ่น

เวลาแฝงต่ำ:
inference ที่ปรับแต่ง GPU เพื่อการตอบสนองแบบเรียลไทม์

API แบบรวมศูนย์:
รัน Kling o1, GPT, Gemini และ DeepSeek ด้วยการเชื่อมต่อเดียว

ราคาโปร่งใส:
ชำระเงินต่อโทเค็นที่คาดเดาได้พร้อมตัวเลือก serverless

องค์กรและขนาด

ประสบการณ์นักพัฒนา:
SDK, การวิเคราะห์, เครื่องมือปรับแต่ง และเทมเพลต

ความน่าเชื่อถือ:
ความพร้อมใช้งาน 99.99%, RBAC และการบันทึกที่พร้อมสำหรับการปฏิบัติตาม

ความปลอดภัยและการปฏิบัติตาม:
SOC 2 Type II, สอดคล้อง HIPAA, อธิปไตยข้อมูลในสหรัฐอเมริกา

คำถามเกี่ยวกับ Kling O1 API พร้อมคำตอบ

Kling O1 คือโมเดลวิดีโอแบบมัลติโมดัลแบบรวมของ Kuaishou ที่พัฒนาด้วยเทคโนโลยี Multi-modal Visual Language บน Atlas Cloud ชุดโมเดลที่ผ่านการตรวจสอบแล้วรองรับ endpoint สำหรับ text-to-video และ image-to-video โดยมุ่งเน้นการทำความเข้าใจพรอมต์เชิงความหมาย ความสอดคล้องของตัวแบบ และการจำลองฟิสิกส์ที่เป็นธรรมชาติ

ใช้ text-to-video เพื่อเปลี่ยนคำอธิบายฉากที่เขียนไว้ให้เป็นคลิปสไตล์ภาพยนตร์ หรือใช้โหมด image-to-video เพื่อทำให้ภาพต้นฉบับเคลื่อนไหวได้ ทั้งสอง endpoint รองรับเวิร์กโฟลว์ที่ต้องการตัวแบบที่ต่อเนื่อง การควบคุมการเคลื่อนไหว และพลวัตของฉากที่สมจริง

เลือก text-to-video เมื่อโปรเจกต์เริ่มต้นจากคำอธิบายฉากที่เป็นข้อความ เลือก image-to-video เมื่อมีภาพอยู่แล้วและต้องการใช้ภาพนั้นกำหนดตัวแบบ องค์ประกอบภาพ หรือเฟรมแรกก่อนเพิ่มการเคลื่อนไหว

ส่งคำขอ POST ที่ผ่านการยืนยันตัวตนไปยัง https://api.atlascloud.ai/api/v1/model/generateVideo พร้อม model ID และอินพุตที่เลือก ใช้ kwaivgi/kling-video-o1/text-to-video หรือ kwaivgi/kling-video-o1/image-to-video จากนั้นดึงผลลัพธ์ด้วย prediction ID ที่ได้รับกลับมา

สำหรับ text-to-video ให้ระบุพรอมต์และใช้การควบคุมอัตราส่วนภาพกับระยะเวลาตามที่ระบุไว้ในเอกสาร ส่วน image-to-video ต้องระบุ prompt และ image โดย last_image เป็นตัวเลือกเสริม อัตราส่วนภาพที่ผ่านการตรวจสอบแล้วคือ 16:9, 9:16 และ 1:1 โดยรองรับระยะเวลา 5 หรือ 10 วินาที

Atlas Cloud ระบุราคามาตรฐานที่ $0.112 ต่อวินาทีสำหรับ video endpoint ทั้งสองรายการที่ผ่านการตรวจสอบแล้ว ค่าใช้จ่ายจะเพิ่มตามระยะเวลาของเอาต์พุตที่ร้องขอ ดังนั้นการสร้างวิดีโอความยาว 10 วินาทีจึงมีค่าใช้จ่ายเป็นสองเท่าของวิดีโอความยาว 5 วินาทีในอัตรามาตรฐาน

การสร้างเริ่มต้นด้วยคำขอ POST ซึ่งส่งคืน prediction ID และสถานะการประมวลผล ให้เรียกดู https://api.atlascloud.ai/api/v1/model/prediction/{prediction_id} ซ้ำจนกว่างานจะเสร็จสมบูรณ์หรือล้มเหลว เมื่อสำเร็จ URL ของวิดีโอที่สร้างจะอยู่ในอาร์เรย์ outputs

ความสอดคล้องของตัวแบบเป็นความสามารถที่ระบุไว้ในเอกสารสำหรับทั้งสองโหมดที่มีให้ใช้งาน และ image-to-video จะใช้เฟรมต้นฉบับเป็นจุดยึดสำหรับอัตลักษณ์ทางภาพและองค์ประกอบภาพ อย่างไรก็ตาม ผลลัพธ์อาจแตกต่างกันไปตามคุณภาพของอินพุตและความซับซ้อนของพรอมต์ จึงควรใช้ภาพต้นฉบับที่ชัดเจนและคำสั่งการเคลื่อนไหวที่ระบุไว้อย่างชัดเจน

ไม่มีในสอง endpoint ของ Atlas Cloud ที่ผ่านการตรวจสอบสำหรับหน้าชุดโมเดลนี้ ตัวเลือกปัจจุบันครอบคลุม text-to-video และ image-to-video ดังนั้นจึงไม่ควรส่ง Elements, วิดีโออ้างอิง หรือพารามิเตอร์การตัดต่อ เว้นแต่ Atlas Cloud จะเผยแพร่ endpoint และ schema ที่เข้ากันได้

สำรวจกลุ่มเพิ่มเติม

Seedance 2.5

Seedance 2.5 API พร้อมใช้งานแล้วบน Atlas Cloud! มอบโมเดลวิดีโอใหม่ล่าสุดของ ByteDance ให้กับนักพัฒนา สร้างวิดีโอเนทีฟได้นานถึง 30 วินาทีในการประมวลผลเพียงครั้งเดียวจากข้อความ รูปภาพเดียว หรือการอ้างอิงหลายรูปแบบสูงสุด 50 รายการ พร้อมเสียงที่ซิงโครไนซ์และข้อความหลายภาษาในเฟรม บน Atlas Cloud คุณสามารถเข้าถึงได้ผ่านคีย์เดียว โดยมีความสอดคล้องของวัตถุและระบบฟิสิกส์ที่ได้รับการปรับปรุงซึ่งช่วยให้ภาพระยะยาวมีความต่อเนื่อง

ดูกลุ่ม

Wan 3.0

Wan 3.0 API คือเจเนอเรชันถัดไปของตระกูลวิดีโอ Wan จาก Alibaba ซึ่งสร้างขึ้นเพื่อยกระดับการสร้างวิดีโอแบบยาว การควบคุมแบบหลายข้อมูลอ้างอิง และคุณภาพของภาพและเสียงให้ก้าวไปอีกขั้น Atlas Cloud ได้โฮสต์ Wan 2.7, 2.6 และ 2.5 ไว้แล้ว และ Wan 3.0 สามารถทำงานบนคีย์แบบรวมเดียวกันโดยไม่ต้องตั้งค่าแยกต่างหาก เริ่มต้นสร้างสรรค์ได้ตั้งแต่วันนี้ เลื่อนลงไปที่ส่วนจัดแสดงเพื่อดูว่า Wan 3.0 สามารถสร้างอะไรได้บ้าง

ดูกลุ่ม

MiniMax H3

MiniMax H3 คือผลิตภัณฑ์วิดีโอแบบมัลติโมดัลของ MiniMax สำหรับการสร้างสรรค์โดยใช้ข้อความ รูปภาพ และข้อมูลอ้างอิง ในเส้นทาง API ที่รองรับ ระบบจะคงลักษณะของวัตถุจากสื่ออ้างอิงไว้ มีอัตราส่วนภาพที่ยืดหยุ่น และจับคู่เสียงที่สร้างขึ้นกับภาพผ่าน H3 Developer โดยโปรไฟล์เอาต์พุตจะถูกเลือกตาม endpoint Atlas Cloud รวมผลิตภัณฑ์ในตระกูลนี้ไว้เบื้องหลังคีย์เดียวที่รองรับ OpenAI พร้อมการคิดค่าบริการตามการใช้งานอย่างโปร่งใส เริ่มต้นที่อัตรามาตรฐาน $0.038 ต่อวินาที เริ่มพัฒนาได้วันนี้

ดูกลุ่ม

Seedream 5.0 Pro

Seedream 5.0 Pro API มอบโมเดลการแก้ไขภาพที่ควบคุมได้ของ ByteDance บน Atlas Cloud ให้กับนักพัฒนา โดยจะวางการแก้ไขอย่างแม่นยำด้วยจุดยึดและพิกัด แยกภาพออกเป็นเลเยอร์ที่แก้ไขได้ ผสานข้อมูลอ้างอิงหลายรายการ และจับคู่สีและวัสดุที่แน่นอน พร้อมข้อความหลายภาษาที่ความละเอียด 2K และ 3K บน Atlas Cloud คุณสามารถเข้าถึงได้ผ่านคีย์เดียว!

ดูกลุ่ม

Seedance 2.0

Seedance 2.0 คือโมเดลวิดีโอสำหรับการใช้งานจริงของ ByteDance ที่ออกแบบมาเพื่อสร้างช็อตได้อย่างแม่นยำ เปลี่ยนพรอมป์ต์เป็นวิดีโอ ทำให้ภาพเฟรมแรกเคลื่อนไหวโดยมีตัวเลือกให้ใช้คำแนะนำจากเฟรมสุดท้าย หรือปรับแต่งผลลัพธ์ด้วยสื่ออ้างอิงและการค้นหาเว็บแบบเลือกใช้ได้ Atlas Cloud รวมเวิร์กโฟลว์เหล่านี้ไว้ใน API เดียว พร้อมการคิดค่าบริการตามการใช้งานจริงอย่างโปร่งใสและคีย์เดียวที่เข้ากันได้กับ OpenAI เริ่มสร้างสรรค์ได้วันนี้

ดูกลุ่ม

GPT Image 2.5

ตระกูล gpt-image-2.5 จาก OpenAI มอบทางเลือก Flare และ Sunburst ให้แก่นักพัฒนาสำหรับกระบวนการทำงานด้านการสร้างภาพเพื่อใช้งานจริง เรนเดอร์ด้วยความละเอียดตามต้องการสูงสุด 3840x2160 และเลือกได้จากระดับคุณภาพ 5 ระดับ รวมถึง xhigh และ max เพื่อให้ตรงตามข้อกำหนดของเอาต์พุตแต่ละแบบ Atlas Cloud ให้บริการอนุมานผ่าน REST ที่พร้อมใช้งาน โดยไม่มี cold start และคิดค่าบริการตามมาตรฐานเริ่มต้นที่ $0.004 ต่อการสร้างภาพ เริ่มพัฒนาได้วันนี้

ดูกลุ่ม

GPT Image 2

GPT Image 2 API ช่วยให้นักพัฒนาสามารถเข้าถึงโมเดลรูปภาพล่าสุดของ OpenAI ซึ่งเป็นรุ่นสืบทอดจาก GPT Image 1.5 โดยสามารถสร้างและแก้ไขรูปภาพพร้อมกับการเรนเดอร์ข้อความที่แม่นยำทั้งในอักษรละตินและ CJK รวมถึงการจัดวางองค์ประกอบที่ยอดเยี่ยมสำหรับโปสเตอร์ ม็อกอัป และอินโฟกราฟิก บน Atlas Cloud คุณสามารถเข้าถึงโมเดลนี้ผ่าน API ที่เป็นหนึ่งเดียวร่วมกับโมเดลอื่นๆ อีกกว่า 300 รุ่น พร้อมเครดิตฟรี เวลาทำงาน 99.99% และไม่จำเป็นต้องมีการตรวจสอบยืนยันองค์กรจาก OpenAI

ดูกลุ่ม

Gemini Omni Flash

API ของ gemini omni นำตระกูล Gemini Omni Flash แบบมัลติโมดัลโดยกำเนิดจาก Google DeepMind ซึ่งรวมถึง Gemini Omni 1.1 Flash มาสู่นักพัฒนา สร้างวิดีโอสไตล์ภาพยนตร์พร้อมเสียงเนทีฟที่ซิงโครไนซ์กัน ทำให้ภาพนิ่งเคลื่อนไหวได้ด้วยการควบคุมเฟรมเริ่มต้นและเฟรมสิ้นสุดอย่างแม่นยำ หรือปรับแก้ฟุตเทจที่มีอยู่ผ่านการแก้ไขด้วยคำสั่งข้อความ โดยยังคงรักษาเนื้อหาที่ไม่ได้แก้ไขไว้ Atlas Cloud มอบคีย์เดียวที่เข้ากันได้กับ OpenAI การเข้าถึงแบบรวมศูนย์ และราคาที่โปร่งใสโดยคิดค่าบริการตามการใช้งาน เริ่มพัฒนาได้วันนี้

ดูกลุ่ม

Grok Imagine

Grok Imagine API ครอบคลุมโมเดลรูปภาพ วิดีโอ และพูดของ xAI ตั้งแต่ Image 2.0 ถึง Video 1.5 และ xAI TTS v1 สร้างรูปภาพนิ่ง 1K หรือ 2K ในอัตราส่วน 14 แบบ ขยายฉากไปยัง 15 วินาทีของวิดีโอ 1080p ควบคุมภาพด้วยรูปภาพอ้างอิงได้ถึง 7 รูป หรือเพิ่มบรรยายเสียงในภาษา 20 ภาษา Atlas Cloud รันทุกโหมดบนเอนด์พอยต์เดียว มีราคาแบบจ่ายตามการใช้งาน ตั้งแต่ $0.02 ต่อรูปภาพและ $0.05 ต่อวินาที เริ่มสร้างวันนี้

ดูกลุ่ม

Google

โมเดลเชิงสร้างสรรค์ที่ทรงพลังที่สุดของ Google พร้อมใช้งานแล้วบน Atlas Cloud โดย Veo 3.1 นำเสนอการสร้างวิดีโอระดับภาพยนตร์ Nano Banana 2 ขับเคลื่อนการสร้างภาพที่มีความเที่ยงตรงสูง และ Gemini นำความชาญฉลาดแบบมัลติโมดัลมาสู่ทุกเวิร์กโฟลว์ เข้าถึงชุดโมเดลของ Google เต็มรูปแบบผ่าน API key เดียวพร้อมความพร้อมใช้งานระดับ Day-0 และการกำหนดราคาแบบจ่ายตามการใช้งาน (pay-as-you-go)

ดูกลุ่ม

Seedance 2.0 Mini

Seedance 2.0 Mini นำเสนอการสร้างวิดีโอแบบมัลติโมดัลของ ByteDance สู่เวิร์กโฟลว์ที่ความเร็วและต้นทุนมีความสำคัญสูงสุด โดยมอบความสามารถหลักของ Seedance 2.0 ในรูปแบบที่ใช้ทรัพยากรน้อยลง — สร้างได้เร็วกว่า ต้นทุนต่อวิดีโอต่ำกว่า และใช้การผสานรวม API เดิมที่คุณใช้อยู่แล้ว สำหรับทีมที่จัดการไปป์ไลน์ปริมาณมากหรือสร้างต้นแบบในสเกลขนาดใหญ่ Mini คือตัวเลือกเริ่มต้นที่ใช้งานได้จริง

ดูกลุ่ม

ByteDance

ตั้งแต่การสร้างวิดีโอระดับภาพยนตร์ไปจนถึงการสร้างภาพที่มีความละเอียดสูง โมเดลที่ทรงพลังที่สุดของ ByteDance พร้อมใช้งานแล้วบน Atlas Cloud รัน Seedance และ Seedream ในสเกลขนาดใหญ่ด้วยราคาการอนุมานที่ต่ำที่สุด และไม่มีค่าใช้จ่ายแฝงด้านโครงสร้างพื้นฐาน

ดูกลุ่ม

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด