
Kling O1 คือกลุ่มโมเดลวิดีโอของ Kuaishou ที่พัฒนาด้วยเทคโนโลยี Multi-modal Visual Language เวิร์กโฟลว์ text-to-video และ image-to-video เชื่อมโยงบริบทด้านภาษาและภาพเข้าด้วยกัน เพื่อสร้างการเคลื่อนไหวของฉากที่ต่อเนื่องราบรื่นจากพรอมต์หรือภาพต้นฉบับ Atlas Cloud รองรับทั้งสองโหมดผ่าน REST API ที่พร้อมใช้งานทันที ไม่มี cold start และคิดค่าบริการตามการใช้งานจริงอย่างโปร่งใส เริ่มสร้างสรรค์ได้วันนี้
Kling o1 พัฒนาโดย Kuaishou โดย Atlas Cloud (ดำเนินการโดย Atlas Cloud AI LLC) เป็นผู้ให้บริการเข้าถึงโมเดลนี้ แต่ไม่ได้เป็นเจ้าของโมเดล เครื่องหมายการค้าทั้งหมดเป็นของเจ้าของที่เกี่ยวข้อง
เปรียบเทียบเวิร์กโฟลว์ข้อความและรูปภาพของ Kling O1 เพื่อเลือก endpoint สำหรับสร้างวิดีโอที่เหมาะกับโปรเจกต์ของคุณ
| รูปแบบการทำงาน | คำอธิบาย |
|---|---|
| Kling O1 T2V API (Text To Video) | เปลี่ยนพรอมต์ข้อความให้เป็นวิดีโอแบบภาพยนตร์ด้วย Kling O1 Text to Video endpoint เทคโนโลยี MVL รองรับการทำความเข้าใจความหมายอย่างแม่นยำ ความสอดคล้องของตัวแบบ และการจำลองฟิสิกส์ที่เป็นธรรมชาติ เหมาะสำหรับแนวคิดเรื่องราว การเล่าเรื่องผลิตภัณฑ์ และฉากที่กำกับผ่านข้อความ |
| Kling O1 I2V API (Image To Video) | เริ่มต้นจากภาพนิ่ง แล้วสร้างวิดีโอแบบภาพยนตร์ที่มีไดนามิกด้วย Kling O1 Image to Video endpoint โดยคงความสอดคล้องของตัวแบบ พร้อมเพิ่มการเคลื่อนไหวที่เป็นธรรมชาติ การจำลองฟิสิกส์ และไดนามิกของฉากที่ต่อเนื่องราบรื่น เวิร์กโฟลว์นี้เหมาะสำหรับการทำภาพให้เคลื่อนไหว การเล่าเรื่องด้วยภาพ และการพัฒนาฉากแบบภาพยนตร์ |
Kling O1 ผสานการสร้างวิดีโอจากข้อความและการสร้างวิดีโอจากภาพเข้ากับความคงเส้นคงวาของวัตถุ ฟิสิกส์ที่เป็นธรรมชาติ ความเข้าใจพรอมต์อย่างแม่นยำ การควบคุมเฟรมแรกและเฟรมสุดท้าย ระยะเวลาแบบยืดหยุ่น 5 หรือ 10 วินาที อัตราส่วนภาพ 3 รูปแบบ และการเข้าถึง Atlas Cloud REST ที่พร้อมใช้งาน ด้วยราคาตามการใช้งานอย่างโปร่งใส
Kling O1 เปลี่ยนพรอมต์ข้อความหรือภาพต้นทางให้เป็นวิดีโอสไตล์ภาพยนตร์ผ่าน dedicated text-to-video และ image-to-video endpoints ของ Atlas Cloud สถาปัตยกรรม MVL ตีความเจตนาของฉากจากทั้งอินพุตด้านภาษาและภาพ เลือกโหมดให้ตรงกับแอสเซ็ตตั้งต้นได้โดยไม่ต้องเปลี่ยนตระกูลโมเดลพื้นฐาน ความยืดหยุ่นนี้เหมาะกับทีมที่พัฒนางานตั้งแต่แนวคิดเริ่มต้นไปจนถึงช็อตแคมเปญหรือเรื่องราวแบบแอนิเมชัน
โมเดลยังคงให้วัตถุเป็นที่จดจำได้ตลอดการเคลื่อนไหว แม้กล้องจะเคลื่อนที่และฉากจะเปลี่ยนแปลง การสร้าง image-to-video นำเอกลักษณ์ทางภาพจากภาพต้นฉบับไปสู่การเคลื่อนไหว ขณะที่ text-to-video สร้างตัวละครที่สอดคล้องกันจากพรอมต์ วัตถุที่คงที่ช่วยลดการเปลี่ยนแปลงที่รบกวนสายตาระหว่างเฟรม ใช้จุดแข็งนี้กับเรื่องราวที่ขับเคลื่อนด้วยตัวละคร ช็อตสินค้า และลำดับภาพที่ความต่อเนื่องทางภาพมีความสำคัญ
การจำลองฟิสิกส์ที่เป็นธรรมชาติช่วยให้การเคลื่อนไหวมีน้ำหนัก โมเมนตัม และปฏิสัมพันธ์กับฉากโดยรอบที่น่าเชื่อถือ Kling O1 ทำให้ผู้คน วัตถุ และองค์ประกอบในสภาพแวดล้อมเคลื่อนไหวด้วยไดนามิกที่เชื่อมโยงกันอย่างเป็นธรรมชาติ แทนที่จะดูเหมือนนำมาต่อกัน ใส่คำบอกการกระทำที่ชัดเจนควบคู่กับทิศทางกล้องในพรอมต์ ผลลัพธ์เหมาะกับภาพกีฬา อาหาร ธรรมชาติ และแอ็กชัน ซึ่งคุณภาพของการเคลื่อนไหวเป็นหัวใจสำคัญของช็อต
เริ่มต้นด้วยภาพเดียว หรือระบุภาพสุดท้ายเพิ่มเติมเพื่อกำหนดจุดสิ้นสุดของการเคลื่อนไหว image-to-video schema ของ Atlas Cloud รองรับคลิปความยาว 5 หรือ 10 วินาที ทำให้สามารถเลือกระยะจังหวะสั้นหรือช่วงเปลี่ยนผ่านที่ยาวขึ้นได้อย่างชัดเจน โมเดลสังเคราะห์การเคลื่อนไหวระหว่างสถานะทางภาพภายใต้คำแนะนำจากพรอมต์ การควบคุมนี้เหมาะอย่างยิ่งกับการเปิดตัวสินค้า การเปลี่ยนรูป และโครงเรื่องขนาดกะทัดรัด
ความเข้าใจเชิงความหมายอย่างแม่นยำช่วยให้ Kling O1 แปลงพรอมต์โดยละเอียดเป็นวัตถุ การกระทำ ไดนามิกของฉาก และการเคลื่อนกล้องแบบภาพยนตร์ กำหนดองค์ประกอบภาพด้วยเอาต์พุต 16:9, 9:16 หรือ 1:1 จากนั้นอธิบายการเคลื่อนไหวและบรรยากาศด้วยภาษาธรรมชาติ การกำกับที่ซับซ้อนกลายเป็นคำขอสร้างงานที่มีโครงสร้าง แทนการทำแอนิเมชันด้วยตนเอง จึงเหมาะกับคลิปโซเชียล สตอรีบอร์ด และคอนเซ็ปต์ภาพที่ผ่านการขัดเกลา
พัฒนาผ่าน unified REST API ของ Atlas Cloud สำหรับทั้งการสร้าง text-to-video และ image-to-video Atlas Cloud ระบุว่าไม่มี cold starts และคิดค่าบริการในอัตรามาตรฐาน $0.112 ต่อวินาทีของเอาต์พุต โดยคำนวณตามระยะเวลาที่สร้างขึ้น ส่งพรอมต์ เฟรมต้นทาง ระยะเวลา และอัตราส่วนภาพในรูปแบบพารามิเตอร์ที่มีโครงสร้าง การตั้งค่านี้ช่วยให้นักพัฒนาคาดการณ์ต้นทุนได้และผสานการทำงานเข้ากับเวิร์กโฟลว์วิดีโอสำหรับการใช้งานจริงได้โดยตรง
ดูว่า Kling O1, Seedance 2.0 และ Kling V3.0 Turbo ตีความพรอมป์ตเดียวกันสองชุดอย่างไร ทั้งในด้านความสมจริงแบบภาพยนตร์ ความต่อเนื่องของการเคลื่อนไหว ปฏิสัมพันธ์ทางกายภาพ และการเล่าเรื่องเชิงสไตล์
สร้างวิดีโอภาพยนตร์สมจริงแบบโฟโตเรียลลิสติกความยาว 10 วินาที เป็นภาพโกลเดนรีทรีฟเวอร์คาบช่อดอกไม้เดินผ่านตลาดดอกไม้ที่พลุกพล่านในยามพระอาทิตย์ขึ้น เริ่มด้วยภาพ tracking shot มุมต่ำ ขณะที่สุนัขวิ่งพุ่งข้ามพื้นหินกรวดเปียกน้ำ โปรยกลีบดอกไม้และเลี้ยวหลบรถเข็นที่กำลังเคลื่อนที่ จากนั้น whip pan ไปยังคนขายดอกไม้ที่กำลังวิ่งไล่ตามจากด้านหลัง แล้วโคจรรอบสุนัขขณะที่มันกระโดดข้ามตะกร้าที่ล้มอยู่และลงพื้นอย่างเป็นธรรมชาติ ปิดท้ายด้วยการ push-in อย่างรวดเร็ว ขณะที่สุนัขหยุดข้างเด็กคนหนึ่ง ยื่นช่อดอกไม้ให้ และคนขายดอกไม้ที่หัวเราะอยู่ก็วิ่งตามมาทัน แสงย้อนจากด้านหลังโทนอุ่น ขน ผ้า และการเคลื่อนไหวของกลีบดอกไม้สมจริง การเคลื่อนไหวต่อเนื่องและเปี่ยมพลัง อัตราส่วนภาพ 16:9
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
สร้างวิดีโอสต็อปโมชันสไตล์ดินน้ำมันความยาว 8 วินาที ภายในร้านเบเกอรีที่ส่องสว่างด้วยแสงจันทร์ ซึ่งเชฟจิ้งจอกตัวจิ๋วกำลังเตรียมขนมอบวิเศษ เปิดด้วย crane shot จากมุมสูง ขณะที่จิ้งจอกหมุนแป้ง โยนผลเบอร์รี และหลบหลีกอุปกรณ์ครัวที่เด้งไปมา ตัดไปยังภาพ tracking view ระดับเคาน์เตอร์ ขณะที่ขนมอบพุ่งเข้าเตาอบและเริ่มเปล่งแสง หมุนกล้องอย่างรวดเร็วรอบตัวจิ้งจอก ขณะที่ประตูเตาอบระเบิดเปิดออก และมังกรขนมอบจิ๋วบินออกมา วนผ่านแป้งที่กำลังลอยฟุ้ง แล้วร่อนลงบนหมวกเชฟของมัน พื้นผิวดินน้ำมันแบบงานทำมือ การเคลื่อนไหวที่สื่ออารมณ์ แสงสีน้ำเงินและสีอำพันที่สนุกสนาน ความต่อเนื่องของแอ็กชันที่ลื่นไหล อัตราส่วนภาพ 16:9
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
ตั้งแต่คอนเซปต์ภาพยนตร์ที่ขับเคลื่อนด้วยพรอมต์ไปจนถึงภาพสินค้าแบบแอนิเมชัน Kling O1 มอบแนวทางที่ใช้งานได้จริงแก่ผู้สร้างภาพยนตร์ นักการตลาด ทีมพาณิชย์ และนักพัฒนาแอป ในการเปลี่ยนข้อความหรือเฟรมภาพนิ่งให้เป็นวิดีโอที่มีความสม่ำเสมอและสอดคล้องกับหลักฟิสิกส์
เปลี่ยนพรอมต์ที่มีรายละเอียดให้เป็นซีเควนซ์สไตล์ภาพยนตร์ ด้วยความเข้าใจเชิงความหมายอย่างแม่นยำและฟิสิกส์ตามธรรมชาติ ผู้สร้างภาพยนตร์และทีมพรีวิชวลไลเซชันสามารถสำรวจอารมณ์ แอ็กชัน และแนวคิดด้านกล้องได้ก่อนทุ่มทรัพยากรให้กับการถ่ายทำจริงที่มีต้นทุนสูง
เติมการเคลื่อนไหวให้ภาพสินค้านิ่ง โดยยังคงตัวแบบไว้และเพิ่มไดนามิกของฉากอย่างลื่นไหล ทีมพาณิชย์สามารถเปลี่ยนภาพจากแค็ตตาล็อกให้เป็นแอสเซ็ตภาพเคลื่อนไหวที่ดูเป็นมืออาชีพสำหรับการเปิดตัวสินค้า หน้าร้าน และครีเอทีฟของแคมเปญ
เริ่มต้นจากคอนเซปต์ที่เขียนไว้ แล้วสร้างวิดีโอสไตล์ภาพยนตร์ที่มีการเคลื่อนไหวตามหลักฟิสิกส์ธรรมชาติ ทีมโซเชียลจะได้ทิศทางภาพใหม่ ๆ สำหรับการประกาศข่าว แคมเปญตามฤดูกาล และการทดสอบครีเอทีฟอย่างรวดเร็วในช่องทางต่าง ๆ
แปลงพรอมต์เชิงเรื่องราวให้เป็นฉากเคลื่อนไหวที่ต่อเนื่องสอดคล้องกัน ด้วยความเข้าใจเชิงความหมายอย่างแม่นยำ ผู้กำกับ เอเจนซี และสตูดิโอเกมสามารถสร้างภาพการเคลื่อนไหวของตัวละคร สภาพแวดล้อม และบรรยากาศแบบภาพยนตร์ได้ตั้งแต่ช่วงเริ่มต้นของการพัฒนาและวางแผนงานสร้างสรรค์
เติมการเคลื่อนไหวที่เป็นธรรมชาติให้ภาพพอร์ตเทรตนิ่ง โดยโหมดภาพของ Kling O1 ยังคงความสม่ำเสมอของตัวแบบไว้ ครีเอเตอร์สามารถสร้างวิดีโอโปรไฟล์ที่สื่ออารมณ์ การแนะนำตัวละคร และแอสเซ็ตสำหรับการเล่าเรื่องด้วยภาพจากผลงานศิลปะที่มีอยู่
เมื่อพรอมต์อธิบายการเคลื่อนไหวที่ซับซ้อน Kling O1 จะใช้การจำลองฟิสิกส์ตามธรรมชาติและความเข้าใจเชิงความหมายอย่างแม่นยำ นักออกแบบแอ็กชันและทีมคอนเซปต์สามารถดูตัวอย่างฉากไดนามิกที่มีการเคลื่อนไหวน่าเชื่อถือได้ก่อนเริ่มการผลิต
เปรียบเทียบ Kling O1 กับโมเดลวิดีโออื่น ๆ ของ Atlas Cloud ตามผู้ให้บริการ โหมดการสร้าง รหัสโมเดล และราคามาตรฐานในแค็ตตาล็อก
| โมเดล | ผู้ให้บริการ | โหมดการสร้าง | รหัสโมเดล Atlas | ราคาพื้นฐานที่ระบุ |
|---|---|---|---|---|
| Kling Video O1 สร้างวิดีโอจากข้อความ | Kuaishou | ข้อความเป็นวิดีโอ | kwaivgi/kling-video-o1/text-to-video | $0.112 ไม่ได้ระบุหน่วย |
| Kling Video O1 สร้างวิดีโอจากรูปภาพ | Kuaishou | รูปภาพเป็นวิดีโอ | kwaivgi/kling-video-o1/image-to-video | $0.112 ไม่ได้ระบุหน่วย |
| Seedance 2.0 สร้างวิดีโอจากข้อความ | ByteDance | ข้อความเป็นวิดีโอ | bytedance/seedance-2.0/text-to-video | $0.112 ไม่ได้ระบุหน่วย |
| Wan-2.7 สร้างวิดีโอจากรูปภาพ | Qwen | รูปภาพเป็นวิดีโอ | alibaba/wan-2.7/image-to-video | $0.10 ไม่ได้ระบุหน่วย |
| Veo 3.1 Lite สร้างวิดีโอจากข้อความ | ข้อความเป็นวิดีโอ | google/veo3.1-lite/text-to-video | $0.05 ไม่ได้ระบุหน่วย | |
| MiniMax H3 สร้างวิดีโอจากรูปภาพ | MiniMax | รูปภาพเป็นวิดีโอ | minimax/h3/image-to-video | $0.038 ต่อวินาที |
เริ่มต้นได้ในไม่กี่นาที — ทำตามขั้นตอนง่าย ๆ เหล่านี้เพื่อเชื่อมต่อและใช้งานโมเดลผ่านแพลตฟอร์ม Atlas Cloud
สมัครสมาชิกที่ atlascloud.ai และยืนยันตัวตน ผู้ใช้ใหม่จะได้รับเครดิตฟรีเพื่อสำรวจแพลตฟอร์มและทดสอบโมเดล
การรวมโมเดล Kling o1 ขั้นสูงเข้ากับแพลตฟอร์มที่เร่งด้วย GPU ของ Atlas Cloud ให้ประสิทธิภาพ ความสามารถในการขยาย และประสบการณ์นักพัฒนาที่ไม่มีใครเทียบได้
เวลาแฝงต่ำ:
inference ที่ปรับแต่ง GPU เพื่อการตอบสนองแบบเรียลไทม์
API แบบรวมศูนย์:
รัน Kling o1, GPT, Gemini และ DeepSeek ด้วยการเชื่อมต่อเดียว
ราคาโปร่งใส:
ชำระเงินต่อโทเค็นที่คาดเดาได้พร้อมตัวเลือก serverless
ประสบการณ์นักพัฒนา:
SDK, การวิเคราะห์, เครื่องมือปรับแต่ง และเทมเพลต
ความน่าเชื่อถือ:
ความพร้อมใช้งาน 99.99%, RBAC และการบันทึกที่พร้อมสำหรับการปฏิบัติตาม
ความปลอดภัยและการปฏิบัติตาม:
SOC 2 Type II, สอดคล้อง HIPAA, อธิปไตยข้อมูลในสหรัฐอเมริกา
Kling O1 คือโมเดลวิดีโอแบบมัลติโมดัลแบบรวมของ Kuaishou ที่พัฒนาด้วยเทคโนโลยี Multi-modal Visual Language บน Atlas Cloud ชุดโมเดลที่ผ่านการตรวจสอบแล้วรองรับ endpoint สำหรับ text-to-video และ image-to-video โดยมุ่งเน้นการทำความเข้าใจพรอมต์เชิงความหมาย ความสอดคล้องของตัวแบบ และการจำลองฟิสิกส์ที่เป็นธรรมชาติ
ใช้ text-to-video เพื่อเปลี่ยนคำอธิบายฉากที่เขียนไว้ให้เป็นคลิปสไตล์ภาพยนตร์ หรือใช้โหมด image-to-video เพื่อทำให้ภาพต้นฉบับเคลื่อนไหวได้ ทั้งสอง endpoint รองรับเวิร์กโฟลว์ที่ต้องการตัวแบบที่ต่อเนื่อง การควบคุมการเคลื่อนไหว และพลวัตของฉากที่สมจริง
เลือก text-to-video เมื่อโปรเจกต์เริ่มต้นจากคำอธิบายฉากที่เป็นข้อความ เลือก image-to-video เมื่อมีภาพอยู่แล้วและต้องการใช้ภาพนั้นกำหนดตัวแบบ องค์ประกอบภาพ หรือเฟรมแรกก่อนเพิ่มการเคลื่อนไหว
ส่งคำขอ POST ที่ผ่านการยืนยันตัวตนไปยัง https://api.atlascloud.ai/api/v1/model/generateVideo พร้อม model ID และอินพุตที่เลือก ใช้ kwaivgi/kling-video-o1/text-to-video หรือ kwaivgi/kling-video-o1/image-to-video จากนั้นดึงผลลัพธ์ด้วย prediction ID ที่ได้รับกลับมา
สำหรับ text-to-video ให้ระบุพรอมต์และใช้การควบคุมอัตราส่วนภาพกับระยะเวลาตามที่ระบุไว้ในเอกสาร ส่วน image-to-video ต้องระบุ prompt และ image โดย last_image เป็นตัวเลือกเสริม อัตราส่วนภาพที่ผ่านการตรวจสอบแล้วคือ 16:9, 9:16 และ 1:1 โดยรองรับระยะเวลา 5 หรือ 10 วินาที
Atlas Cloud ระบุราคามาตรฐานที่ $0.112 ต่อวินาทีสำหรับ video endpoint ทั้งสองรายการที่ผ่านการตรวจสอบแล้ว ค่าใช้จ่ายจะเพิ่มตามระยะเวลาของเอาต์พุตที่ร้องขอ ดังนั้นการสร้างวิดีโอความยาว 10 วินาทีจึงมีค่าใช้จ่ายเป็นสองเท่าของวิดีโอความยาว 5 วินาทีในอัตรามาตรฐาน
การสร้างเริ่มต้นด้วยคำขอ POST ซึ่งส่งคืน prediction ID และสถานะการประมวลผล ให้เรียกดู https://api.atlascloud.ai/api/v1/model/prediction/{prediction_id} ซ้ำจนกว่างานจะเสร็จสมบูรณ์หรือล้มเหลว เมื่อสำเร็จ URL ของวิดีโอที่สร้างจะอยู่ในอาร์เรย์ outputs
ความสอดคล้องของตัวแบบเป็นความสามารถที่ระบุไว้ในเอกสารสำหรับทั้งสองโหมดที่มีให้ใช้งาน และ image-to-video จะใช้เฟรมต้นฉบับเป็นจุดยึดสำหรับอัตลักษณ์ทางภาพและองค์ประกอบภาพ อย่างไรก็ตาม ผลลัพธ์อาจแตกต่างกันไปตามคุณภาพของอินพุตและความซับซ้อนของพรอมต์ จึงควรใช้ภาพต้นฉบับที่ชัดเจนและคำสั่งการเคลื่อนไหวที่ระบุไว้อย่างชัดเจน
ไม่มีในสอง endpoint ของ Atlas Cloud ที่ผ่านการตรวจสอบสำหรับหน้าชุดโมเดลนี้ ตัวเลือกปัจจุบันครอบคลุม text-to-video และ image-to-video ดังนั้นจึงไม่ควรส่ง Elements, วิดีโออ้างอิง หรือพารามิเตอร์การตัดต่อ เว้นแต่ Atlas Cloud จะเผยแพร่ endpoint และ schema ที่เข้ากันได้
คู่มือ บทแนะนำ และอัปเดตผลิตภัณฑ์ ที่ช่วยให้คุณใช้ Atlas Cloud ได้อย่างเต็มประสิทธิภาพ