Kling v2.6 Cinematic Video Creation

Kling v2.6 Cinematic Video Creation

Kling v2.6 là dòng mô hình video của Kuaishou dành cho việc tạo video điện ảnh từ văn bản và hình ảnh, avatar AI và chuyển đổi chuyển động dựa trên hình tham chiếu. Mô hình hỗ trợ tỷ lệ khung hình linh hoạt, chuyển động sống động hơn, nhận diện ổn định và tính nhất quán theo thời gian trong các quy trình chuyên biệt. Atlas Cloud cung cấp các tùy chọn Pro và Standard thông qua các endpoint nhất quán với mức giá theo mức sử dụng minh bạch. Bắt đầu xây dựng ngay hôm nay.

Kling 2.6 do Kuaishou phát triển. Atlas Cloud (vận hành bởi Atlas Cloud AI LLC) cung cấp quyền truy cập vào mô hình này và không sở hữu mô hình. Mọi thương hiệu đều thuộc về chủ sở hữu tương ứng.

Khám phá Mô hình Hàng đầu(6)

So sánh các endpoint tạo video Kling v2.6

Đối chiếu từng endpoint Kling v2.6 với quy trình đầu vào được hỗ trợ, thế mạnh trong sản xuất và các trường hợp sử dụng video phù hợp.

Phương thứcMô tả
Kling v2.6 Pro Avatar API (Avatar To Video)Được thiết kế để tạo avatar cao cấp, endpoint này tạo ra video chất lượng cao với chi tiết rõ nét, chuyển động ổn định và độ nhất quán nhận diện mạnh mẽ. Phù hợp với video hồ sơ chỉn chu, video giới thiệu và nội dung mạng xã hội.
Kling v2.6 Std Avatar API (Avatar To Video)Chọn Standard Avatar endpoint để tạo video avatar AI với chi tiết rõ nét, chuyển động đậm chất điện ảnh và khả năng tuân thủ prompt đáng tin cậy. Các tính năng của endpoint phù hợp với video hồ sơ, phần giới thiệu ngắn và quy trình sản xuất nội dung mạng xã hội định kỳ.
Kling v2.6 Pro Motion Control API (Reference Motion To Video)Các clip chuyển động tham chiếu truyền điệu nhảy, hành động hoặc cử chỉ sang hình ảnh nhân vật hay video nguồn, đồng thời duy trì nhận diện và độ nhất quán theo thời gian. Sử dụng endpoint này để tạo hoạt ảnh nhân vật mượt mà, bám sát các chuyển động được ghi lại cụ thể.
Kling v2.6 Std Motion Control API (Image And Motion To Video)Tạo hoạt ảnh cho hình ảnh nhân vật tĩnh bằng cách cung cấp một clip chuyển động có điệu nhảy, hành động hoặc cử chỉ. Endpoint sẽ trích xuất chuyển động đó và tạo video mượt mà, chân thực cho các quy trình chuyển đổi chuyển động dễ tiếp cận.
Kling v2.6 Pro API (Text To Video)Thông qua model Kuaishou này, prompt văn bản được chuyển thành video đậm chất điện ảnh với âm thanh được tạo tự động và tỷ lệ khung hình linh hoạt. Endpoint hỗ trợ phát triển ý tưởng, xây dựng cảnh kể chuyện, quảng cáo và các dự án video khác dựa trên prompt.
Kling v2.6 Pro API (Image To Video)Bắt đầu từ một hình ảnh, endpoint này tạo video đậm chất điện ảnh với khả năng tạo âm thanh và chuyển động được nâng cao. Biến hình ảnh sản phẩm, tranh minh họa hoặc ảnh tĩnh sáng tạo thành video sống động khi cần kiểm soát tính liên tục về hình ảnh.

Kling v2.6 trong Âm thanh, Chuyển động và Nhận diện danh tính

Kling v2.6 kết hợp khả năng tạo nội dung nghe nhìn nguyên bản, quy trình làm việc với văn bản và hình ảnh, điều khiển chuyển động dựa trên video tham chiếu, avatar điều khiển bằng âm thanh, các tham số linh hoạt và hình thức thanh toán theo mức sử dụng trên các endpoint Standard và Pro.

Khả năng tạo nội dung nghe nhìn nguyên bản của Kling v2.6

Kling v2.6 Pro có thể đồng thời tạo video và âm thanh từ prompt văn bản hoặc hình ảnh nguồn. Tùy chọn âm thanh được bật mặc định trên các endpoint text to video và image to video của Atlas Cloud. Nhờ đó, lời thoại, hiệu ứng và âm thanh môi trường có thể diễn tiến phù hợp với cảnh quay. Đây là lựa chọn lý tưởng cho các đoạn video kể chuyện ngắn cần kết quả nghe nhìn nhất quán mà không phải xử lý âm thanh riêng.

Quy trình tạo từ văn bản và hình ảnh

Bắt đầu với một cảnh được mô tả bằng văn bản hoặc tạo chuyển động cho hình ảnh tĩnh bằng các endpoint tạo nội dung Pro. Prompt văn bản hỗ trợ đầu ra với tỷ lệ 1:1, 9:16 và 16:9, trong khi cả hai quy trình đều cung cấp thời lượng 5 hoặc 10 giây, tùy chọn bật/tắt âm thanh, negative prompt và khả năng điều chỉnh CFG từ 0 đến 1. Đầu vào hình ảnh hỗ trợ tệp JPG, JPEG hoặc PNG có dung lượng tối đa 10 MB, mang đến cho nhà phát triển khả năng kiểm soát thiết thực đối với nội dung mạng xã hội, sản phẩm và điện ảnh.

Điều khiển chuyển động Motion Transfer của Kling v2.6

Cung cấp hình ảnh nhân vật và một video chuyển động tham chiếu cho Kling v2.6 Motion Control để chuyển các chuỗi động tác nhảy, hành động hoặc cử chỉ toàn thân, đồng thời bảo toàn danh tính và tính nhất quán theo thời gian. Video tham chiếu có thể dài từ 3 đến 30 giây. Bạn có thể chọn bố cục bám theo hình ảnh hay video chuyển động, đồng thời quyết định có giữ lại âm thanh nguồn hay không. Kết quả phù hợp với các màn trình diễn liền mạch, hoạt ảnh nhân vật và chiến dịch quảng bá thiên về hành động.

Video avatar điều khiển bằng âm thanh

Hình ảnh và một track âm thanh là các đầu vào bắt buộc đối với các endpoint Avatar Standard và Pro, cùng một prompt tùy chọn để định hướng kết quả. Pro ưu tiên chi tiết rõ nét, chuyển động ổn định và tính nhất quán cao về danh tính, trong khi Standard kết hợp chuyển động mang tính điện ảnh với khả năng bám sát prompt đáng tin cậy. Hãy sử dụng quy trình này khi một chủ thể dễ nhận diện cần truyền tải âm thanh đã chuẩn bị trong video hồ sơ, phần giới thiệu thương hiệu hoặc nội dung mạng xã hội định kỳ.

Lựa chọn model theo hình thức thanh toán theo mức sử dụng

Chọn endpoint Standard hoặc Pro tùy theo khối lượng công việc, sau đó chỉ trả phí cho các lệnh gọi được thực hiện thông qua Atlas Cloud. Standard Avatar có giá khởi điểm $0.056 cho mỗi lệnh gọi, Standard Motion Control là $0.07, Pro Text to Video và Image to Video là $0.07, còn Pro Avatar hoặc Motion Control là $0.112. Một tài khoản bao phủ cả sáu endpoint, giúp nhà phát triển cân bằng chất lượng hình ảnh, nhu cầu chuyển động và chi phí sản xuất mà không phải cam kết thuê bao.

Kling v2.6: Phân tích chuyên sâu — Một prompt, ba mô hình video

Khám phá cách Kling v2.6 và hai lựa chọn thay thế của Atlas Cloud diễn giải cùng một prompt qua các cảnh hành động chân thực và kể chuyện cách điệu.

Prompt

Một bộ phim quảng cáo thời trang siêu chân thực dài 8–10 giây, lấy bối cảnh vào buổi trưa trên một hồ muối trắng rộng mênh mông: sáu vận động viên trượt tốc độ cao khoác áo choàng gương óng ánh tạo thành một “đội thu hoạch muối hình cánh diều” với đội hình hình học chính xác; mỗi người kéo căng những sợi dây màu xanh cobalt và cam huỳnh quang nối với một cánh diều hình cá đuối khổng lồ. Mở đầu bằng cảnh quay từ trên xuống theo chiều dọc của máy bay không người lái khi đội hình đồng bộ rạch những hoa văn sắc như dao qua lớp vỏ muối; máy bay không người lái bất ngờ bổ xuống rồi cân bằng chỉ cách mặt đất vài inch, tăng tốc bám theo người dẫn đầu khi cả đội luồn lách qua các cổng cờ phấp phới, áo choàng bật tung và dây thừng uốn cong dưới lực căng chân thực. Chuyển lia nhanh vào một vòng quay 360 độ khi một cột bụi bất ngờ bùng lên bên cạnh họ, cuộn các tinh thể muối rời vào không trung; sáu vận động viên phản ứng hoàn toàn đồng bộ, nhanh chóng thu dây, và cánh diều cá đuối gập lại thành một cú bổ nhào mạnh đầy kịch tính, xuyên qua xoáy tinh thể và tung những hạt muối lấp lánh như một trận tuyết rực rỡ phủ lên đội hình đang lao đi. Hành động phối hợp liên tục từ đầu đến cuối, danh tính và đội hình nhất quán trong mọi cảnh quay, quán tính trượt thuyết phục, lực căng dây chính xác về mặt vật lý, chuyển động vải đúng khí động học, các hạt muối dạng hạt, nhiễu loạn gió và bóng đổ bám chắc trên mặt đất. Ánh nắng gay gắt từ trên cao, ánh sáng đỉnh có độ tương phản cao và sắc nét, phản chiếu cầu vồng lăng kính trên những chiếc áo choàng gương và bề mặt muối, bố cục nhiều lớp với trắng tuyết, xanh cobalt và cam huỳnh quang, phong cách quảng cáo thời trang cao cấp siêu thực, chi tiết điện ảnh sắc như dao, nhịp bộ gõ tràn đầy năng lượng đồng bộ với từng đường rạch và chuyển cảnh của máy quay, tiếng gió rít, lưỡi trượt cào trên mặt đất, vải bật phập phồng, dây siết căng, rồi tiếng xì tinh thể trong trẻo ở đoạn kết. Không quay chậm, không cảnh chèn tĩnh, không cắt cảnh làm đứt quãng tính liên tục không gian, không cơ thể biến dạng, không người bị nhân bản, không dây rối hoặc đứt nối, không trang phục thiếu nhất quán, không vật thể lơ lửng, không màn hình, không giao diện phần mềm, không bảng điều khiển, không thanh tiến trình, không biểu đồ, không chú thích, không logo, không hình mờ, không văn bản có thể đọc được. Tỷ lệ khung hình 16:9.

Generated with Kling v2.6 Pro Text-to-Video on Atlas Cloud

Generated with Seedance 2.0 Text-to-Video on Atlas Cloud

Generated with Seedance 2.0 Fast Text-to-Video on Atlas Cloud

Prompt

Một cuộc rượt đuổi điện ảnh liên tục dài 8–10 giây dưới biển sâu, diễn ra bên trong phòng khiêu vũ nghiêng dốc của một xác tàu đắm mục nát: bắt đầu bằng cảnh macro cực cận một xúc tu của bạch tuộc bắt chước bán trong suốt lấp lánh xuyên qua những mảnh pha lê của đèn chùm nứt vỡ khi nó chộp lấy một “viên ngọc trai”; nhanh chóng thu và lùi máy quay theo hiệu ứng dolly-zoom để hé lộ con bạch tuộc đang đu từ lan can ăn mòn phía trên những bàn ăn bị lật úp, trong khi những con lươn moray luồn qua các ghế và truy đuổi nó, còn dao nĩa, mảnh kính, trầm tích và chuỗi bong bóng nổi lên rồi va chạm theo các quy luật vật lý dưới nước đầy thuyết phục. Chuyển sang một cảnh rượt đuổi xoay vòng 360 độ ở cự ly hẹp khi con bạch tuộc liên tục thay đổi kết cấu và độ trong suốt của da để hòa lẫn với rèm nhung, đồng thau xỉn màu và gỗ phủ hàu, rồi phun ra một đám mực dày cuộn lại thành mồi nhử có hình bạch tuộc đầy thuyết phục; những con lươn tấn công bóng dáng giả trong khi con bạch tuộc thật lách qua chúng. Lia nhanh và lăn máy quay vào góc nhìn từ trên xuống đầy nghiêng lệch: “viên ngọc trai” bị đánh cắp bất ngờ mở một con mắt nhỏ, ánh sáng hổ phách của nó mạnh dần lên, và khuôn mặt khổng lồ được ngụy trang của một con cá cần câu xuất hiện bên dưới bàn tiệc — viên ngọc trai chính là chiếc mồi của nó; con bạch tuộc đứng sững trong một nhịp hài hước khi cá cần câu lao về phía máy quay. Chân thực điện ảnh dưới biển sâu theo phong cách ảnh thật, ánh sáng môi trường xanh cyan lạnh tương phản với ánh phát quang sinh học màu hổ phách ấm, thể tích nước, các hạt trôi nổi, chuyển động xúc tu dạng mô mềm mật độ cao, mô phỏng chất lỏng, va chạm giữa các vật thể nổi, tính liên tục liền mạch của chủ thể, quán tính đáng tin cậy về mặt vật lý, hành động sắc nét dễ đọc, không quay chậm. Âm thanh đắm chìm đồng bộ: tiếng thân tàu rên rỉ bị bóp nghẹt, tiếng pha lê leng keng, bong bóng ào ạt, tiếng lươn táp, nhịp điệu rượt đuổi dồn dập, một tiếng mực phun ướt át, rồi cú nhấn bass đột ngột khi bí mật được hé lộ. Không màn hình, giao diện, bảng điều khiển, thanh tiến trình, biểu đồ, chú thích, phụ đề, logo, hình mờ hoặc văn bản giải thích. Tỷ lệ khung hình 16:9

Generated with Kling v2.6 Pro Text-to-Video on Atlas Cloud

Generated with Seedance 2.0 Text-to-Video on Atlas Cloud

Generated with Seedance 2.0 Fast Text-to-Video on Atlas Cloud

Kling v2.6 trong câu chuyện, nhân vật và chuyển động

Từ prompt điện ảnh và key visual chiến dịch hoạt họa đến avatar nhất quán và màn trình diễn được dẫn hướng bằng chuyển động, Kling v2.6 hỗ trợ các nhà phát triển sáng tạo phim, quảng cáo, nội dung mạng xã hội và nhân vật thương hiệu.

Ý tưởng điện ảnh với Kling v2.6

Biến ý tưởng viết sẵn thành video điện ảnh bằng Kling v2.6 Pro Text to Video, với tỷ lệ khung hình linh hoạt và âm thanh được tạo tự động. Các nhà làm phim có thể phác thảo trailer, những phân đoạn cao trào và ý tưởng hình ảnh chỉ từ một prompt.

Chiến dịch sản phẩm hoạt họa

Thổi sức sống vào hình ảnh sản phẩm hoặc key visual chiến dịch với chuyển động sống động hơn, chất lượng điện ảnh và âm thanh được tạo tự động. Đội ngũ marketing có thể tạo teaser ra mắt, bản trình diễn trực quan và nội dung quảng bá trên mạng xã hội từ tác phẩm có sẵn.

Avatar thuyết trình Kling v2.6

Tạo video avatar chỉn chu với chi tiết rõ nét, chuyển động ổn định và độ nhất quán nhận diện cao thông qua model Pro Avatar. Sử dụng chúng cho phần giới thiệu hồ sơ, các phân đoạn thuyết trình và nhân vật thương hiệu xuất hiện định kỳ trên mạng xã hội.

Biên đạo dựa trên hình tham chiếu

Ánh xạ cảnh quay vũ đạo, hành động hoặc cử chỉ lên hình ảnh nhân vật trong khi vẫn duy trì nhận diện và tính nhất quán theo thời gian. Nhà sáng tạo có thể tạo bản thử nghiệm biên đạo, linh vật hoạt họa và các clip mạng xã hội thiên về trình diễn từ chuyển động được ghi lại.

Tái dựng nhân vật với Kling v2.6

Truyền chuyển động từ clip tham chiếu vào hình ảnh nhân vật hoặc video nguồn thông qua Pro Motion Control, đồng thời giữ nguyên nhận diện nhân vật. Đội ngũ sản xuất có thể khám phá các diễn viên thay thế, chuỗi hành động cách điệu và hoạt ảnh nhân vật nhất quán.

Pipeline video mạng xã hội tự động

Bắt đầu bằng một prompt văn bản và tạo video điện ảnh kèm âm thanh với tỷ lệ khung hình linh hoạt. Nhà phát triển có thể tự động hóa ý tưởng chiến dịch ngắn, nội dung dành cho nhà sáng tạo và hình ảnh chuyên biệt cho từng nền tảng mà không cần cung cấp hình ảnh mở đầu.

Đối chiếu Kling v2.6 với các API video production

So sánh Kling v2.6 với các mô hình text-to-video hàng đầu theo nhà cung cấp, thời lượng clip, âm thanh gốc và mức giá cơ bản tiêu chuẩn.

Mô hìnhNhà cung cấpThời lượng đầu raÂm thanh gốcGiá cơ bản tiêu chuẩn
Kling v2.6 Pro Text-to-VideoKuaishou5 hoặc 10 giây√$0.07/giây
Seedance 2.0 Text-to-VideoByteDance4 đến 15 giây√$0.112/giây
Wan-2.7 Text-to-videoQwen2 đến 15 giây√$0.10/giây
Veo 3.1 Lite Text-to-videoGoogle4, 6 hoặc 8 giây√$0.05/giây

Cách Sử Dụng Kling 2.6 trên Atlas Cloud

Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.

Tạo Tài Khoản Atlas Cloud

Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.

Tại sao Sử dụng Kling 2.6 trên Atlas Cloud

Sự kết hợp của các mô hình tiên tiến của Kling 2.6 với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.

Hiệu suất và Tính linh hoạt

Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.

API Thống nhất:
Chạy Kling 2.6, GPT, Gemini và DeepSeek với một tích hợp duy nhất.

Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.

Doanh nghiệp và Mở rộng

Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.

Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.

Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.

Các câu hỏi về API Kling v2.6 dành cho nhà phát triển

Kling v2.6 là một dòng mô hình video AI của Kuaishou, được cung cấp thông qua Atlas Cloud. Dòng mô hình này bao gồm các endpoint Pro Text-to-Video và Pro Image-to-Video, cùng các endpoint Standard và Pro dành cho avatar và điều khiển chuyển động.

Bạn có thể tạo video từ prompt, tạo chuyển động cho ảnh nguồn, tạo video avatar từ hình ảnh và âm thanh, hoặc chuyển các chuỗi động tác khiêu vũ, hành động và cử chỉ từ các clip tham chiếu. Các endpoint Pro Text-to-Video và Pro Image-to-Video có thể tạo âm thanh đồng thời với hình ảnh.

Chọn Text-to-Video khi bắt đầu từ prompt và Image-to-Video khi tạo chuyển động cho ảnh tĩnh. Các endpoint Avatar kết hợp một hình ảnh với âm thanh được cung cấp, còn Motion Control áp dụng chuyển động từ video tham chiếu cho nhân vật.

Gửi yêu cầu POST tới `/api/v1/model/generateVideo` cùng với API key của Atlas Cloud, model ID chính xác và các đầu vào riêng của endpoint. Phản hồi bất đồng bộ cung cấp một prediction ID mà bạn có thể kiểm tra qua `/api/v1/model/prediction/{id}` cho đến khi tác vụ hoàn tất.

Các tùy chọn khác nhau tùy endpoint. Text-to-Video hỗ trợ prompt, negative prompt, các tỷ lệ khung hình 1:1, 9:16 và 16:9, thời lượng 5 hoặc 10 giây, âm thanh và guidance scale; trong khi các quy trình khác bổ sung đầu vào về hình ảnh, âm thanh, video chuyển động, hướng hoặc giữ lại âm thanh tùy trường hợp.

Đối với Pro Text-to-Video và Pro Image-to-Video, tham số `sound` điều khiển việc tạo âm thanh đồng thời. Các mô hình Avatar thay vào đó yêu cầu đầu vào âm thanh đi kèm hình ảnh nhân vật, còn Motion Control có thể giữ lại âm thanh gốc của video tham chiếu.

Atlas Cloud niêm yết mức giá tiêu chuẩn là $0.07 mỗi giây cho Pro Text-to-Video, Pro Image-to-Video và Standard Motion Control. Standard Avatar có giá $0.056 mỗi giây, còn Pro Avatar và Pro Motion Control có giá $0.112 mỗi giây, áp dụng mức giá gốc thay vì giá khuyến mãi.

Chuẩn bị một ảnh nhân vật JPG, JPEG hoặc PNG và một video chuyển động MP4 hoặc MOV. Mỗi tệp không được lớn hơn 10 MB, phải có kích thước ít nhất 300 pixel ở cả hai chiều và sử dụng tỷ lệ khung hình từ 1:2.5 đến 2.5:1.

Trước tiên, hãy xác minh model ID, xác thực Bearer, các trường bắt buộc và các ràng buộc về media của endpoint. Nếu tác vụ đã được chấp nhận, hãy kiểm tra prediction ID cho đến khi tác vụ hoàn tất hoặc thất bại, rồi xem lỗi được trả về. Nếu hình ảnh không nhất quán, hãy đơn giản hóa cảnh và sử dụng media nguồn rõ ràng, đặc biệt khi chuyển động khuôn mặt hoặc tương tác với các vật thể phức tạp.

Khám phá Thêm Dòng

Seedance 2.5

Seedance 2.5 API hiện đã có mặt trên Atlas Cloud! Cung cấp cho các nhà phát triển mô hình video mới nhất của ByteDance. Nó tạo ra tối đa 30 giây video gốc chỉ trong một lần xử lý từ văn bản, một hình ảnh duy nhất hoặc tối đa 50 tài liệu tham khảo đa phương thức, với âm thanh được đồng bộ hóa và văn bản đa ngôn ngữ trong khung hình. Trên Atlas Cloud, bạn có thể truy cập thông qua một khóa duy nhất, với tính nhất quán của chủ thể và vật lý được cải thiện giúp giữ cho các cảnh quay dài luôn mạch lạc.

Xem Dòng

Wan 3.0

Wan 3.0 API là thế hệ tiếp theo trong hệ sinh thái video Wan của Alibaba, được xây dựng để đưa khả năng tạo video dài, kiểm soát đa tham chiếu và chất lượng nghe nhìn lên những tầm cao mới. Atlas Cloud đã lưu trữ Wan 2.7, 2.6 và 2.5, và Wan 3.0 hoạt động trên cùng một khóa hợp nhất mà không cần thiết lập riêng. Bắt đầu xây dựng ngay hôm nay. Cuộn xuống phần trưng bày để xem những gì Wan 3.0 có thể tạo ra.

Xem Dòng

MiniMax H3

MiniMax H3 là dòng video đa phương thức của MiniMax, hỗ trợ sáng tạo từ văn bản, hình ảnh và nội dung tham chiếu. Trên các route được hỗ trợ, sản phẩm duy trì chủ thể từ nội dung tham chiếu, cung cấp các tỷ lệ khung hình linh hoạt và kết hợp âm thanh được tạo với hình ảnh thông qua H3 Developer, với hồ sơ đầu ra được lựa chọn theo endpoint. Atlas Cloud hợp nhất dòng sản phẩm này dưới một khóa tương thích với OpenAI, cùng mức giá trả theo nhu cầu minh bạch bắt đầu từ mức tiêu chuẩn $0.038 mỗi giây. Hãy bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Seedream 5.0 Pro

Seedream 5.0 Pro API cung cấp cho các nhà phát triển mô hình chỉnh sửa hình ảnh có thể kiểm soát của ByteDance trên Atlas Cloud. Nó đặt các chỉnh sửa một cách chính xác bằng các điểm neo và tọa độ, tách hình ảnh thành các lớp có thể chỉnh sửa, kết hợp nhiều tham chiếu và khớp màu sắc cũng như vật liệu chính xác, với văn bản đa ngôn ngữ ở độ phân giải 2K và 3K. Trên Atlas Cloud, bạn có thể truy cập nó chỉ bằng một khóa!

Xem Dòng

Seedance 2.0

Seedance 2.0 là mô hình video phục vụ môi trường production của ByteDance, giúp tạo cảnh quay chính xác. Biến prompt thành video, tạo chuyển động cho hình ảnh khung hình đầu tiên với tùy chọn hướng dẫn bằng khung hình cuối, hoặc định hình kết quả bằng media tham chiếu và tùy chọn tìm kiếm web. Atlas Cloud hợp nhất các quy trình này trong một API duy nhất, với mức giá pay-as-you-go minh bạch và một key tương thích với OpenAI. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

GPT Image 2.5

Dòng gpt-image-2.5 của OpenAI mang đến cho nhà phát triển lựa chọn giữa Flare và Sunburst cho các quy trình xử lý ảnh trong môi trường production. Kết xuất ở độ phân giải tùy ý lên đến 3840x2160 và chọn một trong năm cấp chất lượng, bao gồm xhigh và max, để đáp ứng các yêu cầu đầu ra cụ thể. Atlas Cloud cung cấp dịch vụ suy luận REST sẵn sàng sử dụng, không cần khởi động nguội, với mức giá tiêu chuẩn từ $0.004 cho mỗi lần tạo. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

GPT Image 2

GPT Image 2 API cung cấp cho các nhà phát triển quyền truy cập vào mô hình hình ảnh mới nhất của OpenAI, phiên bản kế nhiệm của GPT Image 1.5. Mô hình này tạo và chỉnh sửa hình ảnh với khả năng hiển thị văn bản chính xác trên các chữ viết Latinh và CJK, cùng với bố cục mạnh mẽ cho áp phích, mockup và đồ họa thông tin. Trên Atlas Cloud, bạn có thể truy cập nó thông qua một API thống nhất cùng với hơn 300 mô hình khác, với tín dụng miễn phí, 99,99% thời gian hoạt động và không yêu cầu xác minh tổ chức OpenAI.

Xem Dòng

Gemini Omni Flash

Gemini Omni API mang dòng Gemini Omni Flash đa phương thức nguyên bản của Google DeepMind, bao gồm Gemini Omni 1.1 Flash, đến với các nhà phát triển. Tạo video điện ảnh với âm thanh gốc được đồng bộ, tạo chuyển động cho ảnh tĩnh với khả năng kiểm soát chính xác khung hình bắt đầu và kết thúc, hoặc chỉnh sửa cảnh quay hiện có bằng các hướng dẫn văn bản mà vẫn bảo toàn nội dung không được thay đổi. Atlas Cloud cung cấp một khóa tương thích với OpenAI, quyền truy cập hợp nhất và mức giá trả theo mức sử dụng minh bạch. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Grok Imagine

Grok Imagine API của xAI cung cấp các mô hình hình ảnh, video và lời nói, từ Image 2.0 đến Video 1.5 và xAI TTS v1. Render 1K hoặc 2K hình tĩnh trên 14 tỷ lệ khung hình, tạo cảnh 15 giây video 1080p, điều hướng các shot bằng tối đa 7 hình ảnh tham chiếu, hoặc cung cấp lời tường thuật bằng 20 ngôn ngữ. Atlas Cloud chạy mọi chế độ trên một endpoint, có giá theo mô hình trả tiền khi sử dụng từ $0.02 mỗi hình ảnh và $0.05 mỗi giây. Bắt đầu xây dựng hôm nay.

Xem Dòng

Google

Các mô hình sáng tạo mạnh mẽ nhất của Google hiện đều có sẵn trên Atlas Cloud. Veo 3.1 cung cấp khả năng tạo video đậm chất điện ảnh, Nano Banana 2 hỗ trợ tạo hình ảnh có độ chân thực cao, và Gemini mang trí tuệ đa phương thức vào mọi quy trình làm việc. Truy cập toàn bộ bộ mô hình Google thông qua một API key duy nhất với tính khả dụng Day-0 và mức giá dùng bao nhiêu trả bấy nhiêu (pay-as-you-go).

Xem Dòng

Seedance 2.0 Mini

Seedance 2.0 Mini mang khả năng tạo video đa phương thức của ByteDance vào các quy trình làm việc nơi tốc độ và chi phí là quan trọng nhất. Nó cung cấp các khả năng cốt lõi của Seedance 2.0 với mức tiêu thụ tài nguyên nhẹ hơn — tạo nhanh hơn, chi phí mỗi video thấp hơn và tích hợp API giống như bạn đã sử dụng. Đối với các nhóm chạy các quy trình (pipeline) khối lượng lớn hoặc tạo nguyên mẫu ở quy mô lớn, Mini là lựa chọn mặc định thiết thực.

Xem Dòng

ByteDance

Từ tạo video điện ảnh đến kiến tạo hình ảnh có độ trung thực cao, các mô hình mạnh mẽ nhất của ByteDance hiện đã có mặt trên Atlas Cloud. Chạy Seedance và Seedream ở quy mô lớn với mức giá suy luận thấp nhất và không có chi phí quản lý cơ sở hạ tầng.

Xem Dòng

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình