
Kling O1 là dòng mô hình video của Kuaishou, được xây dựng bằng công nghệ Multi-modal Visual Language. Các quy trình text-to-video và image-to-video kết hợp ngữ cảnh ngôn ngữ và hình ảnh để tạo ra chuyển động cảnh liền mạch từ prompt hoặc hình ảnh nguồn. Atlas Cloud cung cấp cả hai chế độ thông qua REST API sẵn sàng sử dụng, không gặp cold start và có mức giá pay-as-you-go minh bạch. Bắt đầu xây dựng ngay hôm nay.
Kling o1 do Kuaishou phát triển. Atlas Cloud (vận hành bởi Atlas Cloud AI LLC) cung cấp quyền truy cập vào mô hình này và không sở hữu mô hình. Mọi thương hiệu đều thuộc về chủ sở hữu tương ứng.
So sánh quy trình Kling O1 dùng văn bản và hình ảnh để chọn endpoint tạo video phù hợp cho dự án của bạn.
| Phương thức | Mô tả |
|---|---|
| Kling O1 T2V API (Text To Video) | Biến prompt văn bản thành video điện ảnh với endpoint Kling O1 Text to Video. Công nghệ MVL hỗ trợ khả năng hiểu ngữ nghĩa chính xác, duy trì tính nhất quán của chủ thể và mô phỏng vật lý tự nhiên. Sử dụng cho ý tưởng câu chuyện, nội dung giới thiệu sản phẩm và các cảnh được định hướng bằng văn bản. |
| Kling O1 I2V API (Image To Video) | Bắt đầu từ một hình ảnh tĩnh, endpoint Kling O1 Image to Video tạo ra video điện ảnh sống động. Quy trình này duy trì tính nhất quán của chủ thể đồng thời bổ sung chuyển động tự nhiên, mô phỏng vật lý và diễn biến cảnh mượt mà. Phù hợp cho việc tạo chuyển động từ hình ảnh, kể chuyện bằng hình ảnh và phát triển các cảnh điện ảnh. |
Kling O1 kết hợp khả năng tạo video từ văn bản và từ hình ảnh với tính nhất quán của chủ thể, vật lý tự nhiên, khả năng hiểu prompt chính xác, kiểm soát khung hình đầu và cuối, thời lượng linh hoạt 5 hoặc 10 giây, ba tỷ lệ khung hình cùng quyền truy cập REST sẵn sàng sử dụng vào Atlas Cloud với mức giá minh bạch dựa trên lượng sử dụng.
Kling O1 biến prompt văn bản hoặc hình ảnh nguồn thành video điện ảnh thông qua các endpoint text-to-video và image-to-video chuyên biệt của Atlas Cloud. Kiến trúc MVL diễn giải ý định của cảnh dựa trên cả ngôn ngữ và dữ liệu hình ảnh. Bạn có thể chọn chế độ phù hợp với tài sản đầu vào mà không cần thay đổi dòng model nền tảng. Tính linh hoạt này phù hợp với các đội ngũ chuyển từ ý tưởng ban đầu sang những cảnh hoạt họa cho chiến dịch hoặc câu chuyện.
Model duy trì khả năng nhận diện chủ thể khi hành động diễn ra, ngay cả lúc máy quay di chuyển và bối cảnh phát triển. Quá trình tạo video image-to-video đưa nhận diện hình ảnh của ảnh nguồn vào chuyển động, trong khi text-to-video xây dựng nhân vật nhất quán từ prompt. Chủ thể ổn định giúp giảm các thay đổi gây mất tập trung giữa các khung hình. Hãy tận dụng ưu điểm này cho các câu chuyện xoay quanh nhân vật, cảnh quay sản phẩm và những phân đoạn đòi hỏi tính liên tục về hình ảnh.
Mô phỏng vật lý tự nhiên tạo cho chuyển động trọng lượng, quán tính và tương tác thuyết phục với bối cảnh xung quanh. Kling O1 hoạt họa con người, vật thể và các yếu tố môi trường với động lực học liền mạch thay vì tạo cảm giác bị ghép vào cảnh. Hãy kết hợp các chỉ dẫn hành động cụ thể với hướng máy quay trong prompt. Kết quả phù hợp với cảnh thể thao, ẩm thực, thiên nhiên và hành động, nơi chất lượng chuyển động quyết định sức nặng của khung hình.
Bắt đầu bằng một hình ảnh hoặc cung cấp thêm hình ảnh cuối tùy chọn để xác định điểm kết thúc của chuyển động. Schema image-to-video của Atlas Cloud hỗ trợ các đoạn video dài 5 hoặc 10 giây, mang đến lựa chọn nhịp độ rõ ràng cho cả những nhịp ngắn và chuyển cảnh dài hơn. Model tổng hợp chuyển động giữa các trạng thái hình ảnh dưới sự định hướng của prompt. Khả năng kiểm soát này đặc biệt phù hợp với các cảnh giới thiệu sản phẩm, biến đổi và mạch truyện ngắn gọn.
Khả năng hiểu ngữ nghĩa chính xác cho phép Kling O1 chuyển các prompt chi tiết thành chủ thể, hành động, động lực cảnh và chuyển động máy quay điện ảnh. Thiết lập khung hình với đầu ra 16:9, 9:16 hoặc 1:1, sau đó mô tả chuyển động và không khí bằng ngôn ngữ tự nhiên. Các chỉ dẫn phức tạp được chuyển thành một yêu cầu tạo nội dung có cấu trúc thay vì phải hoạt họa thủ công. Điều này khiến model trở nên hữu ích cho các video mạng xã hội, storyboard và ý tưởng hình ảnh hoàn thiện.
Xây dựng quy trình thông qua REST API hợp nhất của Atlas Cloud cho cả việc tạo video text-to-video và image-to-video. Atlas Cloud không tính cold start và áp dụng mức giá tiêu chuẩn $0.112 cho mỗi giây đầu ra, với chi phí dựa trên thời lượng được tạo. Gửi prompt, khung hình nguồn, thời lượng và tỷ lệ khung hình dưới dạng các tham số có cấu trúc. Thiết lập này mang đến chi phí có thể dự đoán và khả năng tích hợp trực tiếp cho các quy trình video production.
Khám phá cách Kling O1, Seedance 2.0 và Kling V3.0 Turbo diễn giải cùng hai prompt qua các khía cạnh: tính chân thực điện ảnh, độ liền mạch của chuyển động, tương tác vật lý và cách kể chuyện cách điệu.
Tạo một video điện ảnh chân thực như ảnh chụp, dài 10 giây, về một chú chó Golden Retriever ngậm bó hoa băng qua khu chợ hoa đông đúc lúc bình minh. Mở đầu bằng cảnh quay bám theo từ góc thấp khi chú chó chạy nhanh trên nền đá lát ướt, làm cánh hoa tung lên và luồn qua những xe đẩy đang di chuyển. Lia máy thật nhanh sang người bán hoa đang đuổi theo phía sau, rồi xoay vòng quanh chú chó khi nó nhảy qua một chiếc giỏ bị đổ và tiếp đất tự nhiên. Kết thúc bằng cú tiến máy nhanh khi chú chó dừng lại bên cạnh một đứa trẻ, trao bó hoa, còn người bán hoa đang cười bắt kịp. Ánh sáng ngược ấm áp, lông, vải và chuyển động vật lý của cánh hoa chân thực, chuyển động liên tục đầy năng lượng, tỷ lệ khung hình 16:9.
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Tạo một video stop-motion đất sét cách điệu, dài 8 giây, bên trong một tiệm bánh ngập ánh trăng, nơi một đầu bếp cáo tí hon chế biến món bánh ngọt kỳ diệu. Mở đầu bằng cảnh cẩu máy từ trên cao khi chú cáo xoay bột, tung quả mọng và né những dụng cụ đang nảy lên. Cắt sang góc quay bám theo trên mặt bàn khi chiếc bánh lao vào lò nướng và bắt đầu phát sáng. Nhanh chóng xoay quanh chú cáo khi lò nướng bật mở, một chú rồng bánh ngọt thu nhỏ bay ra, lượn qua lớp bột mì đang trôi và đáp xuống mũ đầu bếp. Kết cấu đất sét thủ công, chuyển động biểu cảm, ánh sáng xanh lam và hổ phách vui nhộn, diễn tiến hành động liền mạch, tỷ lệ khung hình 16:9.
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Từ các ý tưởng điện ảnh dựa trên prompt đến hình ảnh sản phẩm chuyển động, Kling O1 mang đến cho nhà làm phim, chuyên gia tiếp thị, đội ngũ thương mại và nhà phát triển ứng dụng những quy trình thực tiễn để chuyển văn bản hoặc khung hình tĩnh thành video nhất quán, tuân theo quy luật vật lý.
Biến các prompt chi tiết thành những phân cảnh điện ảnh với khả năng hiểu ngữ nghĩa chính xác và chuyển động theo quy luật vật lý tự nhiên. Nhà làm phim và đội ngũ tiền kỳ hình ảnh có thể khám phá sắc thái, hành động và ý tưởng máy quay trước khi đầu tư nguồn lực vào quá trình sản xuất trực tiếp tốn kém.
Tạo chuyển động cho ảnh sản phẩm tĩnh, đồng thời giữ nguyên chủ thể và bổ sung động lực cảnh quay liền mạch. Đội ngũ thương mại có thể biến hình ảnh catalog thành nội dung chuyển động hoàn thiện cho các đợt ra mắt, gian hàng trực tuyến và nội dung sáng tạo cho chiến dịch.
Bắt đầu từ một ý tưởng bằng văn bản, sau đó tạo các video điện ảnh có chuyển động tuân theo quy luật vật lý tự nhiên. Đội ngũ mạng xã hội có thêm những hướng hình ảnh mới cho thông báo, chiến dịch theo mùa và hoạt động thử nghiệm nội dung sáng tạo nhanh chóng theo từng kênh.
Chuyển hóa các prompt tự sự thành những cảnh chuyển động mạch lạc nhờ khả năng hiểu ngữ nghĩa chính xác. Đạo diễn, agency và studio game có thể hình dung hành động của nhân vật, chuyển động của môi trường và bầu không khí điện ảnh trong giai đoạn phát triển cũng như lập kế hoạch sáng tạo ban đầu.
Tạo chuyển động tự nhiên cho ảnh chân dung tĩnh, trong khi chế độ hình ảnh của Kling O1 duy trì tính nhất quán của chủ thể. Nhà sáng tạo có thể tạo video hồ sơ cá nhân giàu biểu cảm, video giới thiệu nhân vật và nội dung kể chuyện bằng hình ảnh từ các tác phẩm sẵn có.
Khi prompt mô tả chuyển động phức tạp, Kling O1 áp dụng mô phỏng vật lý tự nhiên và khả năng hiểu ngữ nghĩa chính xác. Nhà thiết kế hành động và đội ngũ ý tưởng có thể xem trước các cảnh động với chuyển động thuyết phục trước khi bắt đầu sản xuất.
So sánh Kling O1 với các model video khác trên Atlas Cloud theo nhà cung cấp, chế độ tạo, ID model và giá niêm yết tiêu chuẩn.
| Model | Nhà cung cấp | Chế độ tạo | ID model Atlas | Giá cơ bản niêm yết |
|---|---|---|---|---|
| Kling Video O1 Text-to-video | Kuaishou | Văn bản sang video | kwaivgi/kling-video-o1/text-to-video | $0.112, chưa liệt kê đơn vị |
| Kling Video O1 Image-to-video | Kuaishou | Hình ảnh sang video | kwaivgi/kling-video-o1/image-to-video | $0.112, chưa liệt kê đơn vị |
| Seedance 2.0 Text-to-Video | ByteDance | Văn bản sang video | bytedance/seedance-2.0/text-to-video | $0.112, chưa liệt kê đơn vị |
| Wan-2.7 Image-to-video | Qwen | Hình ảnh sang video | alibaba/wan-2.7/image-to-video | $0.10, chưa liệt kê đơn vị |
| Veo 3.1 Lite Text-to-video | Văn bản sang video | google/veo3.1-lite/text-to-video | $0.05, chưa liệt kê đơn vị | |
| MiniMax H3 Image-to-Video | MiniMax | Hình ảnh sang video | minimax/h3/image-to-video | $0.038 mỗi giây |
Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.
Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.
Sự kết hợp của các mô hình tiên tiến của Kling o1 với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.
Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.
API Thống nhất:
Chạy Kling o1, GPT, Gemini và DeepSeek với một tích hợp duy nhất.
Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.
Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.
Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.
Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.
Kling O1 là mô hình video đa phương thức hợp nhất của Kuaishou, được xây dựng bằng công nghệ Multi-modal Visual Language. Trên Atlas Cloud, nhóm endpoint đã được xác minh bao gồm text-to-video và image-to-video. Mô hình tập trung vào khả năng hiểu prompt theo ngữ nghĩa, duy trì tính nhất quán của chủ thể và mô phỏng vật lý tự nhiên.
Sử dụng text-to-video để chuyển hướng dẫn cảnh bằng văn bản thành các đoạn video mang tính điện ảnh, hoặc tạo chuyển động cho hình ảnh nguồn bằng chế độ image-to-video. Cả hai endpoint đều hỗ trợ các quy trình cần chủ thể nhất quán, chuyển động có kiểm soát và diễn biến cảnh chân thực.
Chọn text-to-video khi dự án bắt đầu bằng phần mô tả cảnh bằng văn bản. Chọn image-to-video khi một hình ảnh có sẵn cần xác định chủ thể, bố cục hoặc khung hình đầu tiên trước khi thêm chuyển động.
Gửi yêu cầu POST đã xác thực đến https://api.atlascloud.ai/api/v1/model/generateVideo cùng model ID và các đầu vào đã chọn. Sử dụng kwaivgi/kling-video-o1/text-to-video hoặc kwaivgi/kling-video-o1/image-to-video, sau đó truy xuất kết quả bằng prediction ID được trả về.
Đối với text-to-video, hãy cung cấp prompt và sử dụng các tùy chọn tỷ lệ khung hình và thời lượng được nêu trong tài liệu. Image-to-video yêu cầu prompt và image, còn last_image là tùy chọn. Các tỷ lệ khung hình đã được xác minh là 16:9, 9:16 và 1:1, với thời lượng 5 hoặc 10 giây.
Atlas Cloud niêm yết mức giá tiêu chuẩn là $0.112 mỗi giây cho cả hai endpoint video đã được xác minh. Chi phí được tính theo thời lượng đầu ra yêu cầu, vì vậy một lần tạo 10 giây sẽ có giá gấp đôi lần tạo 5 giây ở mức giá tiêu chuẩn.
Quá trình tạo bắt đầu bằng một yêu cầu POST, yêu cầu này trả về prediction ID và trạng thái xử lý. Gửi yêu cầu thăm dò đến https://api.atlascloud.ai/api/v1/model/prediction/{prediction_id} cho đến khi tác vụ hoàn tất hoặc thất bại. Khi phản hồi thành công, URL video được tạo sẽ nằm trong mảng outputs.
Tính nhất quán của chủ thể là một khả năng được nêu trong tài liệu của cả hai chế độ hiện có, trong đó image-to-video sử dụng khung hình nguồn để neo nhận dạng hình ảnh và bố cục. Tuy nhiên, kết quả vẫn có thể thay đổi tùy theo chất lượng đầu vào và độ phức tạp của prompt, vì vậy nên sử dụng hình ảnh nguồn rõ ràng và hướng dẫn chuyển động cụ thể.
Không nằm trong hai endpoint Atlas Cloud đã được xác minh cho trang nhóm này. Lựa chọn hiện tại chỉ bao gồm text-to-video và image-to-video, vì vậy không nên gửi Elements, video tham chiếu hoặc các tham số chỉnh sửa trừ khi Atlas Cloud công bố endpoint và schema tương thích.
Hướng dẫn, bài hướng dẫn và cập nhật sản phẩm giúp bạn khai thác tối đa Atlas Cloud.