Kling 1.6 Multi-Image Subject Consistency

Kling 1.6 Multi-Image Subject Consistency

Kling 1.6 là mô hình tạo video của Kuaishou, được xây dựng để biến câu lệnh và hình ảnh tham chiếu thành các video ngắn mạch lạc. Mô hình cải thiện khả năng phản hồi với chuyển động, hành động theo thời gian và chuyển động máy quay, đồng thời nâng cao tính nhất quán của chủ thể, độ chính xác màu sắc, biến đổi ánh sáng và khả năng kết xuất chi tiết. Truy cập dòng mô hình này qua Atlas Cloud với một khóa tương thích OpenAI duy nhất và mức giá minh bạch theo mức sử dụng. Bắt đầu xây dựng ngay hôm nay.

Kling 1.6 do Kuaishou phát triển. Atlas Cloud (vận hành bởi Atlas Cloud AI LLC) cung cấp quyền truy cập vào mô hình này và không sở hữu mô hình. Mọi thương hiệu đều thuộc về chủ sở hữu tương ứng.

So sánh các endpoint Kling 1.6 theo phương thức video

Xem cách mỗi endpoint Kling 1.6 xử lý đầu vào văn bản hoặc hình ảnh, cũng như mức độ phù hợp của các thế mạnh đã được kiểm chứng về chuyển động, tính nhất quán, độ chi tiết và hiệu suất.

Phương thứcMô tả
Kling 1.6 Multi I2V Pro API (Multi Image To Video)Chuyển hình ảnh thành video với nhiều chủ thể, mang lại tính nhất quán tốt hơn và độ chính xác cao hơn trong việc theo dõi chuyển động nâng cao. Endpoint Pro này phù hợp với các cảnh phức tạp, nơi chuyển động phối hợp của chủ thể và tính nhất quán hình ảnh đóng vai trò quan trọng.
Kling 1.6 Multi I2V Standard API (Multi Image To Video)Dành cho việc tạo video nhiều chủ thể với chi phí hợp lý, endpoint này chuyển hình ảnh thành video đồng thời cân bằng giữa tốc độ và độ chi tiết. Endpoint phù hợp với hoạt ảnh cảnh cơ bản và sản xuất nội dung thường nhật có nhiều chủ thể.
Kling 1.6 T2V Standard API (Text To Video)Biến prompt văn bản thành các video ngắn với chuyển động ổn định và khả năng bám sát prompt đáng tin cậy. Sử dụng endpoint cấp cơ bản này để trực quan hóa ý tưởng, tạo nội dung mạng xã hội và xây dựng các chuỗi video đơn giản dựa trên prompt.
Kling 1.6 I2V Pro API (Image To Video)Bắt đầu từ một hình ảnh tĩnh, endpoint Pro tạo ra video với sự chuyển tiếp chuyển động mượt mà hơn và độ chân thực kết cấu được cải thiện. Endpoint này phù hợp với hình ảnh sản phẩm được hoàn thiện kỹ, cảnh quay nhân vật và hoạt ảnh hình ảnh mang phong cách điện ảnh.
Kling 1.6 I2V Standard API (Image To Video)Chọn endpoint gọn nhẹ này để chuyển hình ảnh thành video thông qua quy trình tạo nội dung nền tảng. Với mức chi phí tối thiểu, endpoint phù hợp với các hoạt ảnh đơn giản, thử nghiệm sáng tạo ban đầu và sản xuất số lượng lớn.

Kling 1.6: Từ prompt trực tiếp đến chuyển động

Kling 1.6 kết hợp quy trình từ văn bản, một ảnh và tối đa bốn ảnh tham chiếu, với đầu ra 5 hoặc 10 giây, khả năng kiểm soát mức độ bám sát prompt, prompt phủ định tùy chọn, các tỷ lệ khung hình được chọn và quyền truy cập Standard hoặc Pro thông qua một Atlas Cloud API.

Kling 1.6 từ văn bản hoặc hình ảnh

Kling 1.6 hỗ trợ tạo video từ văn bản và từ hình ảnh thông qua các biến thể chuyên dụng. Bắt đầu bằng một cảnh được mô tả bằng văn bản hoặc tạo chuyển động cho ảnh nguồn, sau đó định hướng hành động bằng prompt dài tối đa 2.500 ký tự. Các model Standard ưu tiên hiệu quả chi phí, trong khi biến thể ảnh Pro chú trọng khả năng hòa trộn chuyển động mượt mà hơn và kết cấu chân thực hơn. Phạm vi này phù hợp với việc thử nghiệm ý tưởng, clip mạng xã hội và các phân cảnh hình ảnh hoàn thiện.

Bốn ảnh tham chiếu

Tải lên từ một đến bốn ảnh tham chiếu với biến thể Multi I2V Standard hoặc Pro. Model sử dụng chúng làm tham chiếu hình ảnh, trong khi prompt định hướng chủ thể, chuyển động và diễn tiến của cảnh. Pro được tinh chỉnh để duy trì tính nhất quán tốt hơn giữa nhiều chủ thể và theo dõi chuyển động chính xác hơn. Tính năng này phù hợp với tương tác giữa các nhân vật, kết hợp sản phẩm và những cảnh quy tụ nhiều yếu tố hình ảnh.

Kiểm soát khung hình đầu và cuối

Thiết lập cả ảnh đầu vào và ảnh kết thúc tùy chọn với biến thể I2V Pro để định hình điểm bắt đầu và kết thúc của clip. Mỗi ảnh có thể ở định dạng JPG, JPEG hoặc PNG, dung lượng tối đa 10 MB và kích thước tối thiểu 300 x 300 pixel. Thêm hướng dẫn chuyển động giữa hai mốc hình ảnh này. Khả năng kiểm soát này đặc biệt hữu ích cho các chuyển cảnh được lên kế hoạch, thay đổi tư thế và cảnh hé lộ sản phẩm.

Chuyển động Kling 1.6 có định hướng

Chuyển động mượt mà là trọng tâm nổi bật của biến thể ảnh Pro, với khả năng hòa trộn được nâng cấp và độ chân thực của kết cấu được cải thiện trong hồ sơ Atlas Cloud. Guidance scale từ 0 đến 1 điều chỉnh mức độ bám sát prompt, trong khi prompt phủ định giúp loại bỏ các yếu tố không mong muốn. Sử dụng những tùy chọn này để cân bằng giữa chuyển động tự nhiên và hành động được định hướng chặt chẽ. Sự kết hợp này phù hợp với các yêu cầu cao về chuyển động của nhân vật, vải vóc và camera.

Thời lượng và định dạng phù hợp

Chọn đầu ra 5 hoặc 10 giây trên toàn bộ dòng Kling 1.6. Các biến thể văn bản và nhiều ảnh cũng hỗ trợ các tỷ lệ khung hình 16:9, 9:16 và 1:1, để một quy trình có thể nhắm đến bố cục màn hình rộng, dọc hoặc vuông. Giới hạn prompt 2.500 ký tự cung cấp đủ không gian cho chủ thể, hành động, ánh sáng và hướng dẫn camera. Những tùy chọn này giúp các nhóm lập kế hoạch nội dung phù hợp từng nền tảng mà không cần thay đổi dòng model.

Các gói Kling 1.6 qua một API

Chạy mọi biến thể Kling 1.6 được liệt kê thông qua một Atlas Cloud video generation API với hình thức thanh toán theo mức sử dụng. Các biến thể Standard áp dụng mức giá gốc đã xác minh là $0.056 cho mỗi lần chạy, trong khi các biến thể Pro có giá $0.098 cho mỗi lần chạy. Chọn gói phù hợp với sự cân bằng cần thiết giữa chi phí, độ chi tiết và chất lượng chuyển động. Thiết lập này hỗ trợ thử nghiệm nhanh và quy trình production mà không cần tích hợp riêng với từng nhà cung cấp.

Kling 1.6 trong một prompt: So sánh ba mô hình video

Khám phá cách Kling 1.6 và hai mô hình video thay thế diễn giải cùng một prompt trong các cảnh hành động chân thực và kể chuyện cách điệu.

Prompt

Một phân cảnh điện ảnh người thật dài 8–10 giây với mô hình thu nhỏ bên trong xưởng thổi thủy tinh lúc nửa đêm: một nghệ nhân trẻ liên tục xoay ống thổi khi bong bóng thủy tinh trắng nóng rực nhanh chóng phồng lên, hình dáng tròn hoàn hảo làm điểm neo cho bố cục. Mở đầu bằng chuyển động quỹ đạo macro cực cận quanh khối thủy tinh nóng chảy đang xoay, ghi lại những sợi hổ phách trong suốt kéo dài, sức căng bề mặt nhớt, hiệu ứng lung linh do nhiệt, các tia lửa nhỏ và hiện tượng khúc xạ chân thực bên trong. Bong bóng đang phồng bất ngờ tuột khỏi ống, va vào bàn kim loại màu xám bạc rồi lăn nhanh; hạ xuống một cú máy bám tốc độ cao ngang mặt bàn, chạy song song với nó khi bong bóng lắc lư, biến dạng, để lại những sợi phát sáng và phản chiếu ánh trăng xanh cô-ban trên nền ánh cam của lò nung. Lia máy cực nhanh đến người nghệ nhân hoảng hốt lao qua bàn và chụp lấy khối thủy tinh mất kiểm soát bằng một mái chèo gỗ ướt vào khoảnh khắc cuối cùng—một tiếng xì nổ lớn khiến hơi nước xoáy quanh khung hình theo đúng vật lý. Khi hơi nước tan đi, để lộ khối thủy tinh kỳ diệu đông cứng thành một chú cá nóc nhỏ trong suốt với những vây thủy tinh tinh tế và các bong bóng bên trong nhất quán; nó nhẹ nhàng phồng má một lần, tạo nên nhịp kết tinh nghịch ngợm. Chuyển động liên tục liền mạch, biến đổi chủ thể nhất quán, độ nhớt thủy tinh chân thực, va chạm, ánh sáng nhiệt, tia lửa, khúc xạ, quang sai caustic, biến dạng do nhiệt và vật lý hơi nước; bảng màu gồm hổ phách, xanh cô-ban và xám bạc; ánh sáng chính màu cam từ lò nung, ánh viền xanh lạnh như ánh trăng, độ sâu trường ảnh nông, phong cách làm phim mô hình thu nhỏ thực tế cao cấp giàu tính xúc giác, kết cấu điện ảnh chân thực, không quay chậm, không có cảnh chèn tĩnh, không màn hình, giao diện phần mềm, bảng điều khiển, thanh tiến trình, biểu đồ, chú thích, văn bản, logo hoặc hình mờ. Âm thanh đồng bộ: tiếng lò nung gầm vang, tiếng ống thổi cọ xát, tiếng kim loại leng keng sắc gọn, tiếng thủy tinh lăn lách cách, tiếng bước chân gấp gáp, tiếng xì ướt lớn, sau đó là một tiếng phì tinh thể nhỏ; nhịp điệu bộ gõ căng thẳng kết thúc bằng tiếng chuông thủy tinh tinh nghịch. Tỷ lệ khung hình 16:9.

Generated with Kling v1.6 Multi i2v Pro on Atlas Cloud

Generated with Seedance 2.0 Image-to-Video on Atlas Cloud

Generated with Kling v1.6 i2v Standard on Atlas Cloud

Prompt

Một câu chuyện cực ngắn dài 9 giây đầy căng thẳng trong căn bếp sau chật hẹp của một quán mì Hồng Kông hoạt động về đêm: một đầu bếp trẻ khẩn trương cứu một phần ramen, liên tục chuyển động với những động tác tay chính xác, đáng tin cậy. Mở đầu bằng cú máy bám ngang góc cực thấp lướt sát trên chiếc thớt phủ bột mì khi anh búng cổ tay và tung một bó mì dài lên cao; máy quay đuổi theo những sợi mì xoắn qua làn hơi nước dày đặc, với từng sợi mì uốn cong, kéo giãn và tự nhiên che khuất đôi tay cùng các dụng cụ treo lủng lẳng của anh. Lia máy cực nhanh đến góc cận bên bếp khi bó mì gần rơi vào ngọn lửa gas đang liếm lên; vào khoảnh khắc cuối cùng, anh lao tới và đón gọn bó mì bằng một chiếc vợt lưới, phần lưới oằn xuống dưới sức nặng, rồi xoay người trong một chuyển động liền mạch và nhúng mì vào nồi nước dùng sôi dữ dội, tạo ra những giọt bắn, bong bóng và gợn dầu chân thực lan trên mặt nồi. Cắt nhanh sang cú máy từ trên cao nhìn thẳng xuống khi mì bung ra thành một vòng xoắn nở đều đẹp mắt trong nước súp; qua ô cửa phục vụ, những thực khách đang chờ nghiêng người về phía trước rồi vỗ tay reo vui, trong khi đầu bếp nở một nụ cười thở phào. Duy trì tính liên tục chính xác của cùng một đầu bếp, trang phục, dụng cụ, bó mì, không gian bếp và chuyển động qua mọi lần cắt. Bố cục nhiều lớp chiều sâu liên tục phối hợp đầu bếp, mì, ngọn lửa, nồi và dụng cụ ở tiền cảnh; các lớp bột mì bay trong không khí, phản chiếu trên gạch ướt, dầu bóng loáng, hơi nước ngưng tụ và hơi nóng cuộn tròn tạo cảm giác giàu tính xúc giác. Thẩm mỹ điện ảnh Hồng Kông chân thực, năng lượng động kiểu máy quay cầm tay, nhòe chuyển động tự nhiên sắc nét, ánh đèn thực tế màu cam tungsten ấm tương phản với gạch men xanh cyan lạnh, độ tương phản phong phú, hạt phim 35mm tinh tế, kết cấu da và thực phẩm chân thực. Âm thanh đồng bộ: tiếng dao gõ trên thớt, tiếng ngọn lửa gas gầm, tiếng hơi nước rushing, tiếng vợt va leng keng, tiếng nước dùng sôi bắn tung, sau đó là tràng pháo tay sắc gọn; nhịp điệu bếp núc nhanh giàu tính bộ gõ, không lời thoại. Không quay chậm, không tư thế bất động, không cảnh toàn mở đầu trống rỗng, không khoảng trống dựng phim, không tính liên tục giật cục, không ngón tay thừa, bàn tay dị dạng, chi thừa bị lặp, dụng cụ hỏng, hiện tượng xuyên cắt, mì dịch chuyển tức thời, chuyển động cao su, chất lỏng chuyển động phi thực tế, vật thể lơ lửng, UI, màn hình, bảng điều khiển, thanh tiến trình, biểu đồ, chú thích, phụ đề, logo hoặc văn bản nhìn thấy được. Tỷ lệ khung hình 16:9.

Generated with Kling v1.6 Multi i2v Pro on Atlas Cloud

Generated with Seedance 2.0 Image-to-Video on Atlas Cloud

Generated with Kling v1.6 i2v Standard on Atlas Cloud

Kling 1.6 biến ý tưởng thành chuyển động như thế nào

Kling 1.6 biến prompt và hình ảnh nguồn thành các ý tưởng video ngắn cho storyboard, chiến dịch sản phẩm, cảnh có nhiều chủ thể, tác phẩm nghệ thuật hoạt họa, các phiên bản nội dung mạng xã hội và mạch truyện nhân vật.

Nguyên mẫu storyboard với Kling 1.6

Biến các ý tưởng dạng văn bản thành bản nháp video ngắn với chuyển động ổn định và khả năng bám sát prompt đáng tin cậy. Đạo diễn, agency và đội ngũ sản phẩm có thể xem trước nhịp độ, hành động và định hướng hình ảnh trước khi bắt tay vào sản xuất toàn bộ.

Tạo chuyển động cho sản phẩm với Kling 1.6

Hoạt họa ảnh tĩnh sản phẩm với khả năng hòa trộn chuyển động mượt mà hơn và chất liệu chân thực hơn. Đội ngũ marketing có thể biến hình ảnh trong catalog thành các đoạn video ra mắt chỉn chu, video giới thiệu tính năng và tài sản chiến dịch mà không cần sắp xếp buổi chụp mới.

Câu chuyện thương hiệu với nhiều chủ thể

Kết hợp các chủ thể từ những hình ảnh riêng biệt, đồng thời duy trì sự nhất quán của cảnh tốt hơn và theo dõi chuyển động chính xác. Xây dựng tương tác giữa các nhân vật, khoảnh khắc nhóm hoặc mạch truyện phong cách sống cho nội dung thương hiệu và chiến dịch mạng xã hội ở quy mô lớn.

Hoạt họa minh họa

Hoạt họa các tác phẩm tĩnh với khả năng hòa trộn chuyển động mượt mà hơn và độ chân thực chất liệu được cải thiện từ biến thể Pro image-to-video. Nghệ sĩ và đội ngũ phát triển game có thể tạo ý tưởng hoạt họa, nhịp nhân vật hoặc nghiên cứu cảnh giàu không khí từ các hình ảnh có sẵn.

Các phiên bản video mạng xã hội với Kling 1.6

Bắt đầu từ prompt hoặc hình ảnh nguồn để tạo các ý tưởng video ngắn với chuyển động ổn định hoặc được hòa trộn mượt mà. Nhà sáng tạo có thể phát triển nhiều hook, cách xử lý hình ảnh và hướng triển khai chiến dịch cho các kênh mạng xã hội.

Đoạn video tương tác giữa các nhân vật

Khi nhiều chủ thể cần cùng xuất hiện trong một cảnh, các biến thể Multi ưu tiên tính nhất quán và khả năng theo dõi chuyển động nâng cao. Sử dụng chúng cho các cặp nhân vật, tương tác với thú cưng, khoảnh khắc nhóm hoặc các thử nghiệm mạch truyện được xây dựng từ hình ảnh.

So sánh mô hình Kling 1.6 và các đối thủ cạnh tranh

So sánh các biến thể Kling 1.6 với những mô hình video khác có trên Atlas Cloud theo quy trình đầu vào, thời lượng clip, âm thanh tích hợp và mức giá tiêu chuẩn.

Mô hìnhQuy trình đầu vàoThời lượng đầu raÂm thanh tích hợpGiá tiêu chuẩn
Kling v1.6 Multi i2v ProPrompt + 1 đến 4 hình ảnh5 hoặc 10 giây-$0.098/lần chạy
Kling v1.6 Multi i2v StandardPrompt + 1 đến 4 hình ảnh5 hoặc 10 giây-$0.056/lần chạy
Kling v1.6 t2v StandardPrompt văn bản5 hoặc 10 giây-$0.056/lần chạy
Kling v1.6 i2v ProPrompt + khung hình đầu + khung hình cuối tùy chọn5 hoặc 10 giây-$0.098/lần chạy
Kling v1.6 i2v StandardPrompt + khung hình đầu5 hoặc 10 giây-$0.056/lần chạy
Wan-3.0 Image-to-videoPrompt + khung hình đầu + khung hình cuối tùy chọn2 đến 30 giây√$0.05/giây
MiniMax H3 Image-to-VideoPrompt + khung hình đầu + khung hình cuối tùy chọn4 đến 15 giây√$0.038/giây

Cách Sử Dụng Kling 1.6 trên Atlas Cloud

Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.

Tạo Tài Khoản Atlas Cloud

Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.

Tại sao Sử dụng Kling 1.6 trên Atlas Cloud

Sự kết hợp của các mô hình tiên tiến của Kling 1.6 với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.

Hiệu suất và Tính linh hoạt

Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.

API Thống nhất:
Chạy Kling 1.6, GPT, Gemini và DeepSeek với một tích hợp duy nhất.

Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.

Doanh nghiệp và Mở rộng

Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.

Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.

Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.

Câu hỏi về API Kling 1.6 dành cho nhà phát triển

Kling 1.6 là dòng mô hình tạo video do Kuaishou phát triển. Trên Atlas Cloud, dòng mô hình này hỗ trợ chuyển văn bản thành video, chuyển một hình ảnh thành video và chuyển nhiều hình ảnh thành video thông qua năm endpoint Standard và Pro. Các biến thể mang đến chuyển động ổn định, khả năng bám sát prompt, hòa trộn chuyển động mượt mà hơn, kết cấu chân thực và tính nhất quán giữa nhiều chủ thể.

Chuyển prompt văn bản thành các cảnh video nguyên bản, tạo chuyển động cho một ảnh bắt đầu hoặc kết hợp nhiều ảnh tham chiếu trong bố cục có nhiều chủ thể. Tùy endpoint, bạn có thể tạo các đoạn video dài 5 hoặc 10 giây.

Chọn T2V Standard để tạo nội dung dựa trên văn bản và I2V Standard để tạo chuyển động từ một hình ảnh với chi phí tối ưu. I2V Pro ưu tiên khả năng hòa trộn chuyển động mượt mà hơn và kết cấu chân thực hơn. Với nhiều chủ thể hoặc ảnh tham chiếu, hãy chọn Multi I2V Standard hoặc Multi I2V Pro tùy theo yêu cầu về chi phí và tính nhất quán.

Tạo khóa API trong bảng điều khiển Atlas Cloud, sau đó gửi yêu cầu JSON đến POST /api/v1/model/generateVideo cùng Bearer token của bạn. Bao gồm mã định danh model chính xác, prompt và hình ảnh hoặc các hình ảnh bắt buộc đối với các endpoint dựa trên hình ảnh. Lưu prediction ID được trả về và sử dụng ID này để lấy kết quả không đồng bộ.

Mỗi endpoint yêu cầu mã định danh model và prompt dài tối đa 2,500 ký tự. Text to video hỗ trợ tỷ lệ khung hình, thời lượng, guidance scale và negative prompt, trong khi các endpoint single image yêu cầu hình ảnh bắt đầu ở định dạng JPG, JPEG hoặc PNG. Các endpoint multi image chấp nhận từ một đến bốn hình ảnh tham chiếu, đồng thời cung cấp các tùy chọn kiểm soát thời lượng, tỷ lệ khung hình và negative prompt.

Cả năm endpoint của Atlas Cloud đều hỗ trợ tạo video dài 5 hoặc 10 giây, trong đó 5 giây là giá trị mặc định được ghi nhận. Các endpoint text to video và multi image chấp nhận 16:9, 9:16 hoặc 1:1. Quy trình single image lấy khung hình từ ảnh nguồn được cung cấp thay vì cung cấp cùng tham số tỷ lệ khung hình.

Theo bảng giá niêm yết tiêu chuẩn, các endpoint T2V Standard, I2V Standard và Multi I2V Standard có giá $0.056 cho mỗi giây video được tạo. I2V Pro và Multi I2V Pro có giá $0.098 cho mỗi giây video được tạo, với hình thức thanh toán theo mức sử dụng.

Trước tiên, hãy xác minh Bearer token, mã định danh model chính xác, prompt bắt buộc và mọi trường hình ảnh bắt buộc. Kiểm tra độ dài prompt, định dạng hình ảnh, kích thước tệp, độ phân giải, thời lượng và phạm vi tham số được ghi nhận trước khi gửi lại yêu cầu không hợp lệ. Vì quá trình tạo video là không đồng bộ, hãy lưu prediction ID và tiếp tục truy vấn endpoint kết quả trong khi trạng thái vẫn là processing.

Khám phá Thêm Dòng

Seedance 2.5

Seedance 2.5 API hiện đã có mặt trên Atlas Cloud! Cung cấp cho các nhà phát triển mô hình video mới nhất của ByteDance. Nó tạo ra tối đa 30 giây video gốc chỉ trong một lần xử lý từ văn bản, một hình ảnh duy nhất hoặc tối đa 50 tài liệu tham khảo đa phương thức, với âm thanh được đồng bộ hóa và văn bản đa ngôn ngữ trong khung hình. Trên Atlas Cloud, bạn có thể truy cập thông qua một khóa duy nhất, với tính nhất quán của chủ thể và vật lý được cải thiện giúp giữ cho các cảnh quay dài luôn mạch lạc.

Xem Dòng

Wan 3.0

Wan 3.0 API là thế hệ tiếp theo trong hệ sinh thái video Wan của Alibaba, được xây dựng để đưa khả năng tạo video dài, kiểm soát đa tham chiếu và chất lượng nghe nhìn lên những tầm cao mới. Atlas Cloud đã lưu trữ Wan 2.7, 2.6 và 2.5, và Wan 3.0 hoạt động trên cùng một khóa hợp nhất mà không cần thiết lập riêng. Bắt đầu xây dựng ngay hôm nay. Cuộn xuống phần trưng bày để xem những gì Wan 3.0 có thể tạo ra.

Xem Dòng

MiniMax H3

MiniMax H3 là dòng video đa phương thức của MiniMax, hỗ trợ sáng tạo từ văn bản, hình ảnh và nội dung tham chiếu. Trên các route được hỗ trợ, sản phẩm duy trì chủ thể từ nội dung tham chiếu, cung cấp các tỷ lệ khung hình linh hoạt và kết hợp âm thanh được tạo với hình ảnh thông qua H3 Developer, với hồ sơ đầu ra được lựa chọn theo endpoint. Atlas Cloud hợp nhất dòng sản phẩm này dưới một khóa tương thích với OpenAI, cùng mức giá trả theo nhu cầu minh bạch bắt đầu từ mức tiêu chuẩn $0.038 mỗi giây. Hãy bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Seedream 5.0 Pro

Seedream 5.0 Pro API cung cấp cho các nhà phát triển mô hình chỉnh sửa hình ảnh có thể kiểm soát của ByteDance trên Atlas Cloud. Nó đặt các chỉnh sửa một cách chính xác bằng các điểm neo và tọa độ, tách hình ảnh thành các lớp có thể chỉnh sửa, kết hợp nhiều tham chiếu và khớp màu sắc cũng như vật liệu chính xác, với văn bản đa ngôn ngữ ở độ phân giải 2K và 3K. Trên Atlas Cloud, bạn có thể truy cập nó chỉ bằng một khóa!

Xem Dòng

Seedance 2.0

Seedance 2.0 là mô hình video phục vụ môi trường production của ByteDance, giúp tạo cảnh quay chính xác. Biến prompt thành video, tạo chuyển động cho hình ảnh khung hình đầu tiên với tùy chọn hướng dẫn bằng khung hình cuối, hoặc định hình kết quả bằng media tham chiếu và tùy chọn tìm kiếm web. Atlas Cloud hợp nhất các quy trình này trong một API duy nhất, với mức giá pay-as-you-go minh bạch và một key tương thích với OpenAI. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

GPT Image 2.5

Dòng gpt-image-2.5 của OpenAI mang đến cho nhà phát triển lựa chọn giữa Flare và Sunburst cho các quy trình xử lý ảnh trong môi trường production. Kết xuất ở độ phân giải tùy ý lên đến 3840x2160 và chọn một trong năm cấp chất lượng, bao gồm xhigh và max, để đáp ứng các yêu cầu đầu ra cụ thể. Atlas Cloud cung cấp dịch vụ suy luận REST sẵn sàng sử dụng, không cần khởi động nguội, với mức giá tiêu chuẩn từ $0.004 cho mỗi lần tạo. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

GPT Image 2

GPT Image 2 API cung cấp cho các nhà phát triển quyền truy cập vào mô hình hình ảnh mới nhất của OpenAI, phiên bản kế nhiệm của GPT Image 1.5. Mô hình này tạo và chỉnh sửa hình ảnh với khả năng hiển thị văn bản chính xác trên các chữ viết Latinh và CJK, cùng với bố cục mạnh mẽ cho áp phích, mockup và đồ họa thông tin. Trên Atlas Cloud, bạn có thể truy cập nó thông qua một API thống nhất cùng với hơn 300 mô hình khác, với tín dụng miễn phí, 99,99% thời gian hoạt động và không yêu cầu xác minh tổ chức OpenAI.

Xem Dòng

Gemini Omni Flash

Gemini Omni API mang dòng Gemini Omni Flash đa phương thức nguyên bản của Google DeepMind, bao gồm Gemini Omni 1.1 Flash, đến với các nhà phát triển. Tạo video điện ảnh với âm thanh gốc được đồng bộ, tạo chuyển động cho ảnh tĩnh với khả năng kiểm soát chính xác khung hình bắt đầu và kết thúc, hoặc chỉnh sửa cảnh quay hiện có bằng các hướng dẫn văn bản mà vẫn bảo toàn nội dung không được thay đổi. Atlas Cloud cung cấp một khóa tương thích với OpenAI, quyền truy cập hợp nhất và mức giá trả theo mức sử dụng minh bạch. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Grok Imagine

Grok Imagine API của xAI cung cấp các mô hình hình ảnh, video và lời nói, từ Image 2.0 đến Video 1.5 và xAI TTS v1. Render 1K hoặc 2K hình tĩnh trên 14 tỷ lệ khung hình, tạo cảnh 15 giây video 1080p, điều hướng các shot bằng tối đa 7 hình ảnh tham chiếu, hoặc cung cấp lời tường thuật bằng 20 ngôn ngữ. Atlas Cloud chạy mọi chế độ trên một endpoint, có giá theo mô hình trả tiền khi sử dụng từ $0.02 mỗi hình ảnh và $0.05 mỗi giây. Bắt đầu xây dựng hôm nay.

Xem Dòng

Google

Các mô hình sáng tạo mạnh mẽ nhất của Google hiện đều có sẵn trên Atlas Cloud. Veo 3.1 cung cấp khả năng tạo video đậm chất điện ảnh, Nano Banana 2 hỗ trợ tạo hình ảnh có độ chân thực cao, và Gemini mang trí tuệ đa phương thức vào mọi quy trình làm việc. Truy cập toàn bộ bộ mô hình Google thông qua một API key duy nhất với tính khả dụng Day-0 và mức giá dùng bao nhiêu trả bấy nhiêu (pay-as-you-go).

Xem Dòng

Seedance 2.0 Mini

Seedance 2.0 Mini mang khả năng tạo video đa phương thức của ByteDance vào các quy trình làm việc nơi tốc độ và chi phí là quan trọng nhất. Nó cung cấp các khả năng cốt lõi của Seedance 2.0 với mức tiêu thụ tài nguyên nhẹ hơn — tạo nhanh hơn, chi phí mỗi video thấp hơn và tích hợp API giống như bạn đã sử dụng. Đối với các nhóm chạy các quy trình (pipeline) khối lượng lớn hoặc tạo nguyên mẫu ở quy mô lớn, Mini là lựa chọn mặc định thiết thực.

Xem Dòng

ByteDance

Từ tạo video điện ảnh đến kiến tạo hình ảnh có độ trung thực cao, các mô hình mạnh mẽ nhất của ByteDance hiện đã có mặt trên Atlas Cloud. Chạy Seedance và Seedream ở quy mô lớn với mức giá suy luận thấp nhất và không có chi phí quản lý cơ sở hạ tầng.

Xem Dòng

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình