
Kling v2.6 là dòng mô hình video của Kuaishou dành cho việc tạo video điện ảnh từ văn bản và hình ảnh, avatar AI và chuyển đổi chuyển động dựa trên hình tham chiếu. Mô hình hỗ trợ tỷ lệ khung hình linh hoạt, chuyển động sống động hơn, nhận diện ổn định và tính nhất quán theo thời gian trong các quy trình chuyên biệt. Atlas Cloud cung cấp các tùy chọn Pro và Standard thông qua các endpoint nhất quán với mức giá theo mức sử dụng minh bạch. Bắt đầu xây dựng ngay hôm nay.
Kling 2.6 do Kuaishou phát triển. Atlas Cloud (vận hành bởi Atlas Cloud AI LLC) cung cấp quyền truy cập vào mô hình này và không sở hữu mô hình. Mọi thương hiệu đều thuộc về chủ sở hữu tương ứng.
Đối chiếu từng endpoint Kling v2.6 với quy trình đầu vào được hỗ trợ, thế mạnh trong sản xuất và các trường hợp sử dụng video phù hợp.
| Phương thức | Mô tả |
|---|---|
| Kling v2.6 Pro Avatar API (Avatar To Video) | Được thiết kế để tạo avatar cao cấp, endpoint này tạo ra video chất lượng cao với chi tiết rõ nét, chuyển động ổn định và độ nhất quán nhận diện mạnh mẽ. Phù hợp với video hồ sơ chỉn chu, video giới thiệu và nội dung mạng xã hội. |
| Kling v2.6 Std Avatar API (Avatar To Video) | Chọn Standard Avatar endpoint để tạo video avatar AI với chi tiết rõ nét, chuyển động đậm chất điện ảnh và khả năng tuân thủ prompt đáng tin cậy. Các tính năng của endpoint phù hợp với video hồ sơ, phần giới thiệu ngắn và quy trình sản xuất nội dung mạng xã hội định kỳ. |
| Kling v2.6 Pro Motion Control API (Reference Motion To Video) | Các clip chuyển động tham chiếu truyền điệu nhảy, hành động hoặc cử chỉ sang hình ảnh nhân vật hay video nguồn, đồng thời duy trì nhận diện và độ nhất quán theo thời gian. Sử dụng endpoint này để tạo hoạt ảnh nhân vật mượt mà, bám sát các chuyển động được ghi lại cụ thể. |
| Kling v2.6 Std Motion Control API (Image And Motion To Video) | Tạo hoạt ảnh cho hình ảnh nhân vật tĩnh bằng cách cung cấp một clip chuyển động có điệu nhảy, hành động hoặc cử chỉ. Endpoint sẽ trích xuất chuyển động đó và tạo video mượt mà, chân thực cho các quy trình chuyển đổi chuyển động dễ tiếp cận. |
| Kling v2.6 Pro API (Text To Video) | Thông qua model Kuaishou này, prompt văn bản được chuyển thành video đậm chất điện ảnh với âm thanh được tạo tự động và tỷ lệ khung hình linh hoạt. Endpoint hỗ trợ phát triển ý tưởng, xây dựng cảnh kể chuyện, quảng cáo và các dự án video khác dựa trên prompt. |
| Kling v2.6 Pro API (Image To Video) | Bắt đầu từ một hình ảnh, endpoint này tạo video đậm chất điện ảnh với khả năng tạo âm thanh và chuyển động được nâng cao. Biến hình ảnh sản phẩm, tranh minh họa hoặc ảnh tĩnh sáng tạo thành video sống động khi cần kiểm soát tính liên tục về hình ảnh. |
Kling v2.6 kết hợp khả năng tạo nội dung nghe nhìn nguyên bản, quy trình làm việc với văn bản và hình ảnh, điều khiển chuyển động dựa trên video tham chiếu, avatar điều khiển bằng âm thanh, các tham số linh hoạt và hình thức thanh toán theo mức sử dụng trên các endpoint Standard và Pro.
Kling v2.6 Pro có thể đồng thời tạo video và âm thanh từ prompt văn bản hoặc hình ảnh nguồn. Tùy chọn âm thanh được bật mặc định trên các endpoint text to video và image to video của Atlas Cloud. Nhờ đó, lời thoại, hiệu ứng và âm thanh môi trường có thể diễn tiến phù hợp với cảnh quay. Đây là lựa chọn lý tưởng cho các đoạn video kể chuyện ngắn cần kết quả nghe nhìn nhất quán mà không phải xử lý âm thanh riêng.
Bắt đầu với một cảnh được mô tả bằng văn bản hoặc tạo chuyển động cho hình ảnh tĩnh bằng các endpoint tạo nội dung Pro. Prompt văn bản hỗ trợ đầu ra với tỷ lệ 1:1, 9:16 và 16:9, trong khi cả hai quy trình đều cung cấp thời lượng 5 hoặc 10 giây, tùy chọn bật/tắt âm thanh, negative prompt và khả năng điều chỉnh CFG từ 0 đến 1. Đầu vào hình ảnh hỗ trợ tệp JPG, JPEG hoặc PNG có dung lượng tối đa 10 MB, mang đến cho nhà phát triển khả năng kiểm soát thiết thực đối với nội dung mạng xã hội, sản phẩm và điện ảnh.
Cung cấp hình ảnh nhân vật và một video chuyển động tham chiếu cho Kling v2.6 Motion Control để chuyển các chuỗi động tác nhảy, hành động hoặc cử chỉ toàn thân, đồng thời bảo toàn danh tính và tính nhất quán theo thời gian. Video tham chiếu có thể dài từ 3 đến 30 giây. Bạn có thể chọn bố cục bám theo hình ảnh hay video chuyển động, đồng thời quyết định có giữ lại âm thanh nguồn hay không. Kết quả phù hợp với các màn trình diễn liền mạch, hoạt ảnh nhân vật và chiến dịch quảng bá thiên về hành động.
Hình ảnh và một track âm thanh là các đầu vào bắt buộc đối với các endpoint Avatar Standard và Pro, cùng một prompt tùy chọn để định hướng kết quả. Pro ưu tiên chi tiết rõ nét, chuyển động ổn định và tính nhất quán cao về danh tính, trong khi Standard kết hợp chuyển động mang tính điện ảnh với khả năng bám sát prompt đáng tin cậy. Hãy sử dụng quy trình này khi một chủ thể dễ nhận diện cần truyền tải âm thanh đã chuẩn bị trong video hồ sơ, phần giới thiệu thương hiệu hoặc nội dung mạng xã hội định kỳ.
Chọn endpoint Standard hoặc Pro tùy theo khối lượng công việc, sau đó chỉ trả phí cho các lệnh gọi được thực hiện thông qua Atlas Cloud. Standard Avatar có giá khởi điểm $0.056 cho mỗi lệnh gọi, Standard Motion Control là $0.07, Pro Text to Video và Image to Video là $0.07, còn Pro Avatar hoặc Motion Control là $0.112. Một tài khoản bao phủ cả sáu endpoint, giúp nhà phát triển cân bằng chất lượng hình ảnh, nhu cầu chuyển động và chi phí sản xuất mà không phải cam kết thuê bao.
Khám phá cách Kling v2.6 và hai lựa chọn thay thế của Atlas Cloud diễn giải cùng một prompt qua các cảnh hành động chân thực và kể chuyện cách điệu.
Một bộ phim quảng cáo thời trang siêu chân thực dài 8–10 giây, lấy bối cảnh vào buổi trưa trên một hồ muối trắng rộng mênh mông: sáu vận động viên trượt tốc độ cao khoác áo choàng gương óng ánh tạo thành một “đội thu hoạch muối hình cánh diều” với đội hình hình học chính xác; mỗi người kéo căng những sợi dây màu xanh cobalt và cam huỳnh quang nối với một cánh diều hình cá đuối khổng lồ. Mở đầu bằng cảnh quay từ trên xuống theo chiều dọc của máy bay không người lái khi đội hình đồng bộ rạch những hoa văn sắc như dao qua lớp vỏ muối; máy bay không người lái bất ngờ bổ xuống rồi cân bằng chỉ cách mặt đất vài inch, tăng tốc bám theo người dẫn đầu khi cả đội luồn lách qua các cổng cờ phấp phới, áo choàng bật tung và dây thừng uốn cong dưới lực căng chân thực. Chuyển lia nhanh vào một vòng quay 360 độ khi một cột bụi bất ngờ bùng lên bên cạnh họ, cuộn các tinh thể muối rời vào không trung; sáu vận động viên phản ứng hoàn toàn đồng bộ, nhanh chóng thu dây, và cánh diều cá đuối gập lại thành một cú bổ nhào mạnh đầy kịch tính, xuyên qua xoáy tinh thể và tung những hạt muối lấp lánh như một trận tuyết rực rỡ phủ lên đội hình đang lao đi. Hành động phối hợp liên tục từ đầu đến cuối, danh tính và đội hình nhất quán trong mọi cảnh quay, quán tính trượt thuyết phục, lực căng dây chính xác về mặt vật lý, chuyển động vải đúng khí động học, các hạt muối dạng hạt, nhiễu loạn gió và bóng đổ bám chắc trên mặt đất. Ánh nắng gay gắt từ trên cao, ánh sáng đỉnh có độ tương phản cao và sắc nét, phản chiếu cầu vồng lăng kính trên những chiếc áo choàng gương và bề mặt muối, bố cục nhiều lớp với trắng tuyết, xanh cobalt và cam huỳnh quang, phong cách quảng cáo thời trang cao cấp siêu thực, chi tiết điện ảnh sắc như dao, nhịp bộ gõ tràn đầy năng lượng đồng bộ với từng đường rạch và chuyển cảnh của máy quay, tiếng gió rít, lưỡi trượt cào trên mặt đất, vải bật phập phồng, dây siết căng, rồi tiếng xì tinh thể trong trẻo ở đoạn kết. Không quay chậm, không cảnh chèn tĩnh, không cắt cảnh làm đứt quãng tính liên tục không gian, không cơ thể biến dạng, không người bị nhân bản, không dây rối hoặc đứt nối, không trang phục thiếu nhất quán, không vật thể lơ lửng, không màn hình, không giao diện phần mềm, không bảng điều khiển, không thanh tiến trình, không biểu đồ, không chú thích, không logo, không hình mờ, không văn bản có thể đọc được. Tỷ lệ khung hình 16:9.
Generated with Kling v2.6 Pro Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Fast Text-to-Video on Atlas Cloud
Một cuộc rượt đuổi điện ảnh liên tục dài 8–10 giây dưới biển sâu, diễn ra bên trong phòng khiêu vũ nghiêng dốc của một xác tàu đắm mục nát: bắt đầu bằng cảnh macro cực cận một xúc tu của bạch tuộc bắt chước bán trong suốt lấp lánh xuyên qua những mảnh pha lê của đèn chùm nứt vỡ khi nó chộp lấy một “viên ngọc trai”; nhanh chóng thu và lùi máy quay theo hiệu ứng dolly-zoom để hé lộ con bạch tuộc đang đu từ lan can ăn mòn phía trên những bàn ăn bị lật úp, trong khi những con lươn moray luồn qua các ghế và truy đuổi nó, còn dao nĩa, mảnh kính, trầm tích và chuỗi bong bóng nổi lên rồi va chạm theo các quy luật vật lý dưới nước đầy thuyết phục. Chuyển sang một cảnh rượt đuổi xoay vòng 360 độ ở cự ly hẹp khi con bạch tuộc liên tục thay đổi kết cấu và độ trong suốt của da để hòa lẫn với rèm nhung, đồng thau xỉn màu và gỗ phủ hàu, rồi phun ra một đám mực dày cuộn lại thành mồi nhử có hình bạch tuộc đầy thuyết phục; những con lươn tấn công bóng dáng giả trong khi con bạch tuộc thật lách qua chúng. Lia nhanh và lăn máy quay vào góc nhìn từ trên xuống đầy nghiêng lệch: “viên ngọc trai” bị đánh cắp bất ngờ mở một con mắt nhỏ, ánh sáng hổ phách của nó mạnh dần lên, và khuôn mặt khổng lồ được ngụy trang của một con cá cần câu xuất hiện bên dưới bàn tiệc — viên ngọc trai chính là chiếc mồi của nó; con bạch tuộc đứng sững trong một nhịp hài hước khi cá cần câu lao về phía máy quay. Chân thực điện ảnh dưới biển sâu theo phong cách ảnh thật, ánh sáng môi trường xanh cyan lạnh tương phản với ánh phát quang sinh học màu hổ phách ấm, thể tích nước, các hạt trôi nổi, chuyển động xúc tu dạng mô mềm mật độ cao, mô phỏng chất lỏng, va chạm giữa các vật thể nổi, tính liên tục liền mạch của chủ thể, quán tính đáng tin cậy về mặt vật lý, hành động sắc nét dễ đọc, không quay chậm. Âm thanh đắm chìm đồng bộ: tiếng thân tàu rên rỉ bị bóp nghẹt, tiếng pha lê leng keng, bong bóng ào ạt, tiếng lươn táp, nhịp điệu rượt đuổi dồn dập, một tiếng mực phun ướt át, rồi cú nhấn bass đột ngột khi bí mật được hé lộ. Không màn hình, giao diện, bảng điều khiển, thanh tiến trình, biểu đồ, chú thích, phụ đề, logo, hình mờ hoặc văn bản giải thích. Tỷ lệ khung hình 16:9
Generated with Kling v2.6 Pro Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Fast Text-to-Video on Atlas Cloud
Từ prompt điện ảnh và key visual chiến dịch hoạt họa đến avatar nhất quán và màn trình diễn được dẫn hướng bằng chuyển động, Kling v2.6 hỗ trợ các nhà phát triển sáng tạo phim, quảng cáo, nội dung mạng xã hội và nhân vật thương hiệu.
Biến ý tưởng viết sẵn thành video điện ảnh bằng Kling v2.6 Pro Text to Video, với tỷ lệ khung hình linh hoạt và âm thanh được tạo tự động. Các nhà làm phim có thể phác thảo trailer, những phân đoạn cao trào và ý tưởng hình ảnh chỉ từ một prompt.
Thổi sức sống vào hình ảnh sản phẩm hoặc key visual chiến dịch với chuyển động sống động hơn, chất lượng điện ảnh và âm thanh được tạo tự động. Đội ngũ marketing có thể tạo teaser ra mắt, bản trình diễn trực quan và nội dung quảng bá trên mạng xã hội từ tác phẩm có sẵn.
Tạo video avatar chỉn chu với chi tiết rõ nét, chuyển động ổn định và độ nhất quán nhận diện cao thông qua model Pro Avatar. Sử dụng chúng cho phần giới thiệu hồ sơ, các phân đoạn thuyết trình và nhân vật thương hiệu xuất hiện định kỳ trên mạng xã hội.
Ánh xạ cảnh quay vũ đạo, hành động hoặc cử chỉ lên hình ảnh nhân vật trong khi vẫn duy trì nhận diện và tính nhất quán theo thời gian. Nhà sáng tạo có thể tạo bản thử nghiệm biên đạo, linh vật hoạt họa và các clip mạng xã hội thiên về trình diễn từ chuyển động được ghi lại.
Truyền chuyển động từ clip tham chiếu vào hình ảnh nhân vật hoặc video nguồn thông qua Pro Motion Control, đồng thời giữ nguyên nhận diện nhân vật. Đội ngũ sản xuất có thể khám phá các diễn viên thay thế, chuỗi hành động cách điệu và hoạt ảnh nhân vật nhất quán.
Bắt đầu bằng một prompt văn bản và tạo video điện ảnh kèm âm thanh với tỷ lệ khung hình linh hoạt. Nhà phát triển có thể tự động hóa ý tưởng chiến dịch ngắn, nội dung dành cho nhà sáng tạo và hình ảnh chuyên biệt cho từng nền tảng mà không cần cung cấp hình ảnh mở đầu.
So sánh Kling v2.6 với các mô hình text-to-video hàng đầu theo nhà cung cấp, thời lượng clip, âm thanh gốc và mức giá cơ bản tiêu chuẩn.
| Mô hình | Nhà cung cấp | Thời lượng đầu ra | Âm thanh gốc | Giá cơ bản tiêu chuẩn |
|---|---|---|---|---|
| Kling v2.6 Pro Text-to-Video | Kuaishou | 5 hoặc 10 giây | √ | $0.07/giây |
| Seedance 2.0 Text-to-Video | ByteDance | 4 đến 15 giây | √ | $0.112/giây |
| Wan-2.7 Text-to-video | Qwen | 2 đến 15 giây | √ | $0.10/giây |
| Veo 3.1 Lite Text-to-video | 4, 6 hoặc 8 giây | √ | $0.05/giây |
Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.
Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.
Sự kết hợp của các mô hình tiên tiến của Kling 2.6 với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.
Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.
API Thống nhất:
Chạy Kling 2.6, GPT, Gemini và DeepSeek với một tích hợp duy nhất.
Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.
Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.
Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.
Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.
Kling v2.6 là một dòng mô hình video AI của Kuaishou, được cung cấp thông qua Atlas Cloud. Dòng mô hình này bao gồm các endpoint Pro Text-to-Video và Pro Image-to-Video, cùng các endpoint Standard và Pro dành cho avatar và điều khiển chuyển động.
Bạn có thể tạo video từ prompt, tạo chuyển động cho ảnh nguồn, tạo video avatar từ hình ảnh và âm thanh, hoặc chuyển các chuỗi động tác khiêu vũ, hành động và cử chỉ từ các clip tham chiếu. Các endpoint Pro Text-to-Video và Pro Image-to-Video có thể tạo âm thanh đồng thời với hình ảnh.
Chọn Text-to-Video khi bắt đầu từ prompt và Image-to-Video khi tạo chuyển động cho ảnh tĩnh. Các endpoint Avatar kết hợp một hình ảnh với âm thanh được cung cấp, còn Motion Control áp dụng chuyển động từ video tham chiếu cho nhân vật.
Gửi yêu cầu POST tới `/api/v1/model/generateVideo` cùng với API key của Atlas Cloud, model ID chính xác và các đầu vào riêng của endpoint. Phản hồi bất đồng bộ cung cấp một prediction ID mà bạn có thể kiểm tra qua `/api/v1/model/prediction/{id}` cho đến khi tác vụ hoàn tất.
Các tùy chọn khác nhau tùy endpoint. Text-to-Video hỗ trợ prompt, negative prompt, các tỷ lệ khung hình 1:1, 9:16 và 16:9, thời lượng 5 hoặc 10 giây, âm thanh và guidance scale; trong khi các quy trình khác bổ sung đầu vào về hình ảnh, âm thanh, video chuyển động, hướng hoặc giữ lại âm thanh tùy trường hợp.
Đối với Pro Text-to-Video và Pro Image-to-Video, tham số `sound` điều khiển việc tạo âm thanh đồng thời. Các mô hình Avatar thay vào đó yêu cầu đầu vào âm thanh đi kèm hình ảnh nhân vật, còn Motion Control có thể giữ lại âm thanh gốc của video tham chiếu.
Atlas Cloud niêm yết mức giá tiêu chuẩn là $0.07 mỗi giây cho Pro Text-to-Video, Pro Image-to-Video và Standard Motion Control. Standard Avatar có giá $0.056 mỗi giây, còn Pro Avatar và Pro Motion Control có giá $0.112 mỗi giây, áp dụng mức giá gốc thay vì giá khuyến mãi.
Chuẩn bị một ảnh nhân vật JPG, JPEG hoặc PNG và một video chuyển động MP4 hoặc MOV. Mỗi tệp không được lớn hơn 10 MB, phải có kích thước ít nhất 300 pixel ở cả hai chiều và sử dụng tỷ lệ khung hình từ 1:2.5 đến 2.5:1.
Trước tiên, hãy xác minh model ID, xác thực Bearer, các trường bắt buộc và các ràng buộc về media của endpoint. Nếu tác vụ đã được chấp nhận, hãy kiểm tra prediction ID cho đến khi tác vụ hoàn tất hoặc thất bại, rồi xem lỗi được trả về. Nếu hình ảnh không nhất quán, hãy đơn giản hóa cảnh và sử dụng media nguồn rõ ràng, đặc biệt khi chuyển động khuôn mặt hoặc tương tác với các vật thể phức tạp.
Hướng dẫn, bài hướng dẫn và cập nhật sản phẩm giúp bạn khai thác tối đa Atlas Cloud.