Kimi API for Vision-to-Code Generation

Kimi API for Vision-to-Code Generation

Kimi API là dòng K2 open-weight của Moonshot AI, từ K2.5 đa phương thức gốc đến K2.7 Code chuyên biệt cho lập trình. Vì khả năng thị giác được tích hợp sẵn trong mô hình, bạn có thể chuyển ảnh chụp màn hình, bản mô phỏng UI và video ngắn thành mã frontend hoạt động được, điều phối tối đa 100 sub-agent song song và suy luận trên ngữ cảnh 256K token. Atlas Cloud cung cấp toàn bộ dòng này qua một endpoint thống nhất với giá trả theo mức sử dụng minh bạch. Hãy bắt đầu xây dựng ngay hôm nay.

Khám phá Mô hình Hàng đầu

Atlas Cloud cung cấp cho bạn các mô hình sáng tạo tiên tiến nhất trong ngành.

Ghép khối lượng công việc của bạn với đúng model Kimi API

So sánh nhanh trọng tâm của từng endpoint Kimi và mức giá tiêu chuẩn trên mỗi triệu token.

Phương thứcMô tả
Kimi K2.7 Code API (Văn bản sang văn bản)Được xây dựng chuyên biệt cho công việc kỹ thuật, endpoint này biến prompt ngôn ngữ tự nhiên và các tệp mã nguồn hiện có thành mã chạy được, bản sửa lỗi và tự động hóa cho nhà phát triển. Model này hướng đến các quy trình lập trình, gỡ lỗi và AI developer, nơi khả năng sinh mã đáng tin cậy là ưu tiên hàng đầu, với mức giá tiêu chuẩn $0.95 cho mỗi triệu input tokens và $4 cho mỗi triệu output tokens.
Kimi K2.6 API (Văn bản sang văn bản)Đưa prompt văn bản vào, Kimi K2.6 sẽ trả về câu trả lời có lập luận, mã và đầu ra có cấu trúc cho các tác vụ năng suất hằng ngày. Được tăng cường cho cả lập luận lẫn lập trình, model này phù hợp với các đội ngũ muốn một model đa dụng duy nhất cho phân tích, soạn thảo và phát triển phần mềm, với input được cache có giá $0.16 cho mỗi triệu token khi dùng lại ngữ cảnh.
Kimi K2.5 API (Văn bản sang văn bản)Khi một công việc bao trùm tài liệu dài hoặc pipeline nhiều bước, Kimi K2.5 tiếp nhận đầu vào văn bản mở rộng và trả về phản hồi mạch lạc, hiểu ngữ cảnh. Được xây dựng cho khả năng hiểu ngữ cảnh dài và các quy trình làm việc thông minh, model này vận hành theo giá pay-as-you-go minh bạch ở mức $0.60 cho mỗi triệu input tokens và $3 cho mỗi triệu output tokens, giúp phân tích quy mô lớn hiệu quả về chi phí.

Kimi API, từ ngữ cảnh 256K đến bầy 300 tác nhân

Kimi API đưa các mô hình K2 nghìn tỷ tham số của Moonshot AI vào một endpoint duy nhất, kết hợp cửa sổ ngữ cảnh 262.144 token với đầu vào hình ảnh và video native, các bầy tác nhân tự định hướng, cùng các mô hình chuyên biệt được tinh chỉnh cho lập trình, gỡ lỗi và suy luận dài hạn.

Hiểu hình ảnh và video native

Hiểu hình ảnh và video native

K2.6 xử lý văn bản, hình ảnh và video trong một kiến trúc đa phương thức native duy nhất, chấp nhận các định dạng từ PNG và WebP đến MP4, MOV và WebM mà không cần plugin bên ngoài. Bộ mã hóa thị giác MoonViT của nó đọc trực tiếp bản ghi màn hình, tệp thiết kế và sơ đồ. Trong khi K2.5 trước đây xử lý văn bản và hình ảnh, K2.6 mở rộng cùng stack đó sang khả năng hiểu video đầy đủ, để ngữ cảnh hình ảnh trở thành một đầu vào như mọi đầu vào khác.

Bầy tác nhân tự định hướng qua Kimi API

Bầy tác nhân tự định hướng qua Kimi API

Kimi API cung cấp một bầy tác nhân tự định hướng có thể mở rộng đến 300 sub-agent làm việc qua khoảng 4.000 bước được phối hợp. Thay vì suy luận trên một luồng duy nhất, K2.6 phân rã một mục tiêu lớn thành các nhánh song song và điều phối chúng đến khi hoàn tất. Mỗi sub-agent mang một phần nhiệm vụ riêng, rồi báo cáo lại vào kế hoạch chung. Thiết kế này phù hợp với tự động hóa dài hạn khi một dự án trải qua nhiều giai đoạn phụ thuộc lẫn nhau.

Tích hợp sẵn lập trình và gỡ lỗi

Tích hợp sẵn lập trình và gỡ lỗi

Lập trình nằm ở trung tâm của họ mô hình này, với Kimi K2.7 Code được xây dựng riêng cho lập trình, gỡ lỗi và workflow tác nhân dành cho nhà phát triển. Trên benchmark lập trình SWE-Bench Pro, K2.6 đạt 58.6, nhỉnh hơn một số mô hình frontier trong các bản sửa lỗi repository thực tế. Trỏ một trong hai mô hình vào một bộ kiểm thử đang lỗi và nó sẽ truy vết lỗi, đề xuất bản vá, rồi lặp lại cho đến khi build chuyển xanh.

Suy luận agentic qua một khóa Kimi API

Suy luận agentic qua một khóa Kimi API

Cần suy luận minh bạch? Bật chế độ thinking có thể cấu hình và mô hình sẽ hiển thị chuỗi suy luận từng bước trước khi chốt câu trả lời, cùng với khả năng gọi công cụ và hàm native. Trên Atlas Cloud, toàn bộ Kimi API chạy sau một khóa tương thích OpenAI duy nhất, với mức giá trả theo từng lệnh gọi và quyền truy cập Day-0 vào mọi bản phát hành mới. Chỉ cần đổi base URL là code hiện có của bạn tiếp tục hoạt động.

Kimi API Face-Off: Một prompt, ba mô hình

Gửi cùng một bản mô tả giống hệt tới Kimi API và hai mô hình đối thủ, rồi so sánh trang HTML tương tác mà mỗi mô hình tạo ra từ đúng cùng một bộ hướng dẫn.

Prompt

Xây dựng một trang HTML đơn tệp hoàn chỉnh cho trò chơi arcade Snake có thể chơi được, với toàn bộ CSS và JavaScript được nhúng trực tiếp, không dùng bất kỳ dependency bên ngoài, CDN, hình ảnh hay phông chữ nào. Vẽ bàn chơi trên canvas với bảng màu hiện đại kiểu neon trên nền tối, chuyển động mượt và vệt sáng mềm phía sau con rắn. Hỗ trợ điều khiển bằng phím mũi tên và WASD, kèm thao tác vuốt trên thiết bị cảm ứng; hiển thị điểm số trực tiếp và điểm cao nhất được lưu bền vững; đồng thời tăng tốc độ trò chơi dần khi điểm số tăng. Kích hoạt một vụ nổ hạt nhỏ mỗi khi ăn thức ăn, hiển thị lớp phủ game-over có hoạt ảnh với nút chơi lại, và giữ bố cục responsive để bàn chơi luôn được căn giữa, dễ nhìn trên cả desktop lẫn mobile.

Generated with Kimi K2.7 Code on Atlas Cloud

Generated with GPT 5.5 on Atlas Cloud

Generated with Kimi K2.6 on Atlas Cloud

Prompt

Tạo một tệp HTML đơn lẻ, hoàn toàn tự chứa (toàn bộ CSS và JavaScript được nhúng trực tiếp, tuyệt đối không có dependency bên ngoài, CDN, hình ảnh hay web font) để hiển thị một "khu vườn thủy tinh kỹ thuật số sống" tương tác — một chiếc lọ thủy tinh kín đặt ở giữa màn hình, bên trong là khu rừng mưa thu nhỏ tự duy trì và phát triển theo thời gian thực. Mở trong bất kỳ trình duyệt hiện đại nào và nó phải chạy ngay ở 60fps, không cần bước build. Cảnh chính và bố cục: căn giữa bố cục một cách đối xứng, xem chiếc lọ thủy tinh như sân khấu trung tâm trên nền tối sâu có vignette (radial gradient từ tâm sáng dịu màu rêu mờ dần ra các mép gần như đen) để mọi sự chú ý đổ dồn vào chiếc lọ. Vẽ mọi thứ trên HTML5 Canvas toàn cửa sổ, đặt dưới lớp chrome DOM/CSS glassmorphism thật: thành lọ phải thể hiện đúng chất liệu thủy tinh — các vệt sáng khúc xạ cong, một vệt rim-light phản chiếu sắc nét, hiệu ứng mờ phủ sương nhẹ và những giọt ngưng tụ rải rác với hiệu ứng thấu kính nhỏ — đạt được bằng các lớp radial/linear gradient, backdrop-filter blur, nét viền trắng bán trong suốt và box-shadow mềm. Bên trong lọ là lớp đất mùn ẩm sẫm ở đáy và một làn sương thể tích mờ trôi chậm. Ba lớp kỹ thuật phải xếp chồng và cùng tồn tại (đây là điểm phân tách mô hình yếu với mô hình mạnh — mô hình yếu sẽ tạo ra một bức tranh tĩnh, mô hình mạnh khiến cả chiếc lọ trở nên sống động): 1. Sinh trưởng L-system đệ quy: dây leo, tàu dương xỉ và rêu được tạo bằng thuật toán L-system / phân nhánh đệ quy và có hoạt ảnh bung mở theo thời gian — thân cây dài ra, cành phân tách, tàu lá cuộn mở, lá phóng to dần với easing. Sự sinh trưởng phải hữu cơ và hơi ngẫu nhiên theo từng nhánh (dao động góc, độ dày thuôn dần, chiều dài suy giảm) để không có hai cây nào trông giống hệt nhau khi tải lại. 2. Hệ thống hạt: các đốm sáng màu hổ phách giống đom đóm (hàng chục hạt) trôi và nhấp nhô trong sương với ánh sáng additive glow mềm và parallax nhẹ, cùng các hạt ngưng tụ/phấn hoa bay lên; các hạt phản ứng tinh tế với cây mới mọc. 3. Chu kỳ ánh sáng ngày–đêm: một vòng lặp ánh sáng môi trường liên tục quét nguồn sáng chính từ trên xuống, từ bình minh trắng lạnh → hoàng hôn vàng ấm → đêm chàm sâu rồi quay lại, đồng thời đổi màu toàn bộ cảnh, các highlight trên thủy tinh, sương và tông màu cây cối tương ứng. Cây thể hiện phototropism — thân uốn cong và nghiêng ngọn về phía hướng sáng hiện tại khi ánh sáng di chuyển. Tương tác chính: khi nhấp vào bất kỳ đâu trên thành lọ/bên trong lọ, thả một hạt giống đơn vào lớp đất mùn tại vị trí x của cú nhấp; hạt giống đó diễn ra một vòng đời đầy đủ, nhìn thấy rõ theo trình tự — hạt rơi xuống và nằm yên, nảy mầm thành chồi, chồi phân nhánh đệ quy bằng L-system, rồi nở một bông hoa nhỏ phát sáng khi trưởng thành — mỗi giai đoạn đều có easing và dễ nhận biết, kèm gợn sóng/đám bụi mềm khi chạm đất. Nhiều cú nhấp tạo ra nhiều cây cùng tồn tại và tiếp tục phát triển, dần lấp đầy terrarium thành một bụi cây dày hơn. Thêm một vài điều khiển inline tinh tế dạng nút pill glassmorphic (ví dụ: "Reset terrarium" và nút chuyển "Day/Night: auto ⇄ drag" để người dùng có thể kéo chỉnh thời điểm trong ngày, kèm tùy chọn tạm dừng nếu muốn). Cung cấp một dòng gợi ý mờ ("chạm vào kính để trồng một hạt giống") và làm nó mờ đi sau tương tác đầu tiên. Bảng màu và cảm xúc: tán lá xanh mực rừng và vàng-xanh rêu, ánh hổ phách/mật ong cho các đốm sáng và hoa nở, sắc xanh teal thủy tinh mát trên chiếc lọ, các lớp phủ vàng ấm và chàm lạnh xuyên suốt chu kỳ ngày-đêm. Cảm giác tổng thể là tĩnh lặng, có hơi thở, thiền định — chuyển động chậm và dịu, không có chuyển cảnh gắt. Yêu cầu kỹ thuật: dùng requestAnimationFrame với delta-time để hoạt ảnh độc lập với frame-rate; làm canvas responsive khi thay đổi kích thước cửa sổ với tỉ lệ devicePixelRatio chính xác và giữ chiếc lọ ở giữa; giới hạn số lượng hạt/nhánh hợp lý để luôn mượt; giữ mọi yếu tố ngẫu nhiên được seed theo từng cây để sinh trưởng trông tự nhiên. Mọi thứ — hình học, ánh sáng phát quang, thủy tinh, sương, ánh sáng, hạt và cây đệ quy — đều phải được vẽ hoặc tính toán bằng code, không dùng bất kỳ asset bên ngoài nào. Chỉ xuất tài liệu HTML hoàn chỉnh, sẵn sàng lưu thành một tệp .html và mở.

Generated with Kimi K2.7 Code on Atlas Cloud

Generated with GPT 5.5 on Atlas Cloud

Generated with Kimi K2.6 on Atlas Cloud

Đưa Kimi API vào vận hành trên toàn bộ stack của bạn

Dù bạn đang triển khai mã trên các kho mã khổng lồ, chuyển đổi thiết kế thành giao diện, hay điều phối các swarm agent, Kimi API mang năng lực suy luận ngữ cảnh dài và sử dụng công cụ native vào các workload production thực tế.

Lập trình ở quy mô kho mã với Kimi API

Kimi K2.7 Code đọc toàn bộ kho mã trong cửa sổ 262K-token, refactor, gỡ lỗi và mở rộng codebase chỉ trong một lượt. Các đội ngũ dựa vào nó để hiện đại hóa hệ thống legacy và triển khai các tính năng nhiều file mà không mất ngữ cảnh dự án.

Biến thiết kế thành mã front-end

Đưa cho Kimi K2.5 một ảnh chụp màn hình, mockup hoặc video demo ngắn, và nó sẽ trả về mã front-end hoạt động được từ đầu vào trực quan đó. Designer và đội ngũ sản phẩm biến các ý tưởng tĩnh thành trang tương tác và prototype chỉ trong vài phút.

Phân tích tài liệu và dữ liệu dài

Khi báo cáo hoặc hợp đồng dài đến hàng trăm trang, các mô hình Kimi xử lý chúng trong ngữ cảnh 256K-token để làm nổi bật xu hướng và điểm mâu thuẫn. Analyst trích xuất câu trả lời có cấu trúc kèm trích dẫn thay vì phải đọc thủ công từng trang.

Điều phối agent swarm qua Kimi API

Agent swarm cho phép Kimi K2.5 chia một mục tiêu thành tối đa 100 sub-agent chạy song song, rút ngắn thời gian thực thi lên đến 4.5x. Các đội ngũ tự động hóa phân tích hàng loạt và các tác vụ xây dựng dài mà một mô hình đơn lẻ không thể hoàn tất.

Vận hành các autonomous agent biết dùng công cụ

Được huấn luyện cho khả năng sử dụng công cụ theo kiểu agentic, các mô hình Kimi gọi hàm bên ngoài, API và công cụ tìm kiếm để hoàn thành tác vụ mà không cần prompt từng bước. Developer xây dựng các assistant có thể đặt lịch, truy vấn và hành động trên các hệ thống thực thay mặt người dùng.

Chuyển sang Kimi API trong vài phút

Vì Kimi API tương thích với OpenAI, bạn chỉ cần thay base URL và một key để định tuyến lưu lượng sang các mô hình Moonshot. Startup có thể dùng Kimi mà không phải viết lại logic ứng dụng và trả phí minh bạch theo từng lượt gọi.

Kimi API so với các API LLM đối thủ: Ngữ cảnh, phương thức và chi phí

So sánh Kimi API với các API mô hình ngôn ngữ flagship khác trên Atlas Cloud để xem Kimi dẫn đầu ở đâu về độ dài ngữ cảnh, tính linh hoạt của đầu vào và giá theo token.

Mô hìnhCửa sổ ngữ cảnhLoại đầu vàoGiá đầu vào ($/1M tokens)Giá đầu ra ($/1M tokens)
Kimi K2.7 Code256K tokensVăn bản, Hình ảnh$0.95$4.00
Kimi K2.6256K tokensVăn bản, Hình ảnh, Video$0.95$4.00
Kimi K2.5256K tokensVăn bản, Hình ảnh, Video$0.60$3.00
DeepSeek V4 Pro1M tokensVăn bản$1.74$3.45
GLM 5.21M tokensVăn bản$1.40$4.40
Grok 4.5500K tokensVăn bản$2.00$6.00
Doubao Seed 2.1 Pro256K tokensVăn bản$0.90$4.50

Cách Sử Dụng Kimi trên Atlas Cloud

Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.

Tạo Tài Khoản Atlas Cloud

Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.

Tại sao Sử dụng Kimi trên Atlas Cloud

Sự kết hợp của các mô hình tiên tiến của Kimi với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.

Hiệu suất và Tính linh hoạt

Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.

API Thống nhất:
Chạy Kimi, GPT, Gemini và DeepSeek với một tích hợp duy nhất.

Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.

Doanh nghiệp và Mở rộng

Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.

Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.

Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.

Giải đáp các câu hỏi về Kimi API

Kimi API cho phép nhà phát triển truy cập theo cách lập trình vào dòng mô hình ngôn ngữ lớn Kimi của Moonshot AI để suy luận, lập trình và hiểu ngữ cảnh dài. Trên Atlas Cloud, bạn truy cập thông qua một endpoint tương thích với OpenAI, nên chỉ một key có thể dùng cho mọi phiên bản Kimi với mức giá trả theo mức sử dụng, tính theo từng lệnh gọi.

Atlas Cloud lưu trữ nhiều phiên bản, bao gồm Kimi K2.5 cho ngữ cảnh dài và quy trình agentic, Kimi K2.6 là mô hình tổng quát thông minh nhất của Moonshot, và Kimi K2.7 Code cho lập trình và gỡ lỗi. Vì chúng dùng chung định dạng request, việc chuyển đổi giữa các mô hình chỉ cần thay một chuỗi model.

Các mô hình này nổi bật ở những tác vụ lập trình phức tạp, phân tích repository nhiều tệp, suy luận trên tài liệu dày đặc và gọi công cụ theo kiểu agentic. Các nhóm thường chọn Kimi khi công việc cần cả bộ nhớ làm việc lớn lẫn khả năng suy luận từng bước mạnh mẽ, chẳng hạn như tái cấu trúc toàn bộ codebase hoặc kiểm tra các báo cáo dài.

Thanh toán theo mức sử dụng, không cần đăng ký thuê bao và không có mức tối thiểu. Kimi K2.5 có giá $0.60 cho mỗi triệu input tokens và $3.00 cho mỗi triệu output tokens, trong khi Kimi K2.6 và Kimi K2.7 Code có giá $0.95 cho mỗi triệu input tokens và $4.00 cho mỗi triệu output tokens. Context caching giúp giảm chi phí cho các prompt được lặp lại hoặc dùng chung.

Vì Atlas Cloud cung cấp Kimi thông qua một API tương thích với OpenAI, bạn có thể trỏ OpenAI SDK hiện tại của mình tới endpoint của Atlas và thay bằng tên mô hình Kimi. Không cần viết lại logic ứng dụng, nên đây thực sự là một lựa chọn thay thế trực tiếp cho các pipeline chat, coding và agent.

Kimi K2.5, K2.6 và K2.7 Code đều hỗ trợ cửa sổ ngữ cảnh 262,144 token, xấp xỉ 256K tokens. Dung lượng này cho phép bạn đưa toàn bộ codebase, tài liệu kỹ thuật dài hoặc hàng trăm trang báo cáo vào một request duy nhất mà không cần chia nhỏ thủ công.

Các phiên bản Kimi gần đây có khả năng đa phương thức nguyên bản, không chỉ giới hạn ở văn bản. Kimi K2.6 nhận đầu vào văn bản, hình ảnh và video, còn Kimi K2.5 suy luận trên các token hình ảnh và văn bản kết hợp, nên bạn có thể gửi ảnh chụp màn hình, tệp thiết kế hoặc bản ghi và để mô hình diễn giải chúng cùng với prompt của bạn.

Nhà phát triển thường chọn nó vì chi phí và ngữ cảnh. Các báo cáo từ cộng đồng cho thấy mức tiết kiệm đáng kể so với những mô hình độc quyền hàng đầu ở chất lượng lập trình tương đương, và cửa sổ 256K xử lý được các tác vụ toàn repository và toàn tài liệu mà các mô hình ngữ cảnh ngắn hơn không thể. Hãy bắt đầu xây dựng ngay hôm nay.

Khám phá Thêm Dòng

Seedance 2.0

Seedance 2.0 API cung cấp cho bạn quyền truy cập cấp sản xuất vào mô hình video đa phương thức của ByteDance — đầu vào bốn phương thức (văn bản, hình ảnh, video, âm thanh) và hệ thống "Universal Reference" hàng đầu trong ngành giúp khóa bố cục, chuyển động của camera và hành động của nhân vật trên các cảnh quay. Tích hợp quyền kiểm soát cấp độ đạo diễn bằng một lệnh gọi API, mức giá cố định $0,09/giây, cấp khóa tức thì và không có danh sách chờ — được hỗ trợ bởi thời gian hoạt động và sự tuân thủ cấp doanh nghiệp. Seedance 2.0 Native 4K hiện đã ra mắt!

Xem Dòng

MiniMax H3

API MiniMax H3 mở quyền truy cập vào mô hình video đa phương thức đa dụng của MiniMax, có thể đọc văn bản, hình ảnh, video và âm thanh như một ngữ cảnh duy nhất thay vì xử lý từng tác vụ riêng lẻ. Các clip có thời lượng từ 5 đến 15 giây ở 24 FPS, hỗ trợ nhiều tỷ lệ khung hình từ 21:9 đến 9:16; chỉ với một prompt, bạn có thể hoán đổi nhân vật, thay nền, viết lại hội thoại hoặc sao chép giọng nói từ một clip tham chiếu. Atlas Cloud cung cấp toàn bộ khả năng này thông qua một endpoint tương thích OpenAI. Hãy bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Seedream 5.0 Pro

Seedream 5.0 Pro API cung cấp cho các nhà phát triển mô hình chỉnh sửa hình ảnh có thể kiểm soát của ByteDance trên Atlas Cloud. Nó đặt các chỉnh sửa một cách chính xác bằng các điểm neo và tọa độ, tách hình ảnh thành các lớp có thể chỉnh sửa, kết hợp nhiều tham chiếu và khớp màu sắc cũng như vật liệu chính xác, với văn bản đa ngôn ngữ ở độ phân giải 2K và 3K. Trên Atlas Cloud, bạn có thể truy cập nó chỉ bằng một khóa!

Xem Dòng

GPT Image 2

GPT Image 2 API cung cấp cho các nhà phát triển quyền truy cập vào mô hình hình ảnh mới nhất của OpenAI, phiên bản kế nhiệm của GPT Image 1.5. Mô hình này tạo và chỉnh sửa hình ảnh với khả năng hiển thị văn bản chính xác trên các chữ viết Latinh và CJK, cùng với bố cục mạnh mẽ cho áp phích, mockup và đồ họa thông tin. Trên Atlas Cloud, bạn có thể truy cập nó thông qua một API thống nhất cùng với hơn 300 mô hình khác, với tín dụng miễn phí, 99,99% thời gian hoạt động và không yêu cầu xác minh tổ chức OpenAI.

Xem Dòng

Gemini Omni Flash

Gemini Omni API đưa mô hình tạo và chỉnh sửa video đa phương thức của Google DeepMind, được giới thiệu tại Google I/O 2026, vào stack của bạn. Gemini Omni kết hợp công cụ suy luận của Gemini với media tạo sinh, chấp nhận mọi tổ hợp văn bản, hình ảnh, video và âm thanh để tạo ra kết quả nhất quán, dựa trên nền tảng tri thức. Tinh chỉnh kết quả qua hội thoại tự nhiên — hoán đổi vật thể, viết lại cảnh quay và thay đổi phong cách, trong khi vật lý, nhân vật và tính liên tục vẫn được giữ nguyên. Atlas Cloud cung cấp trọn bộ dòng Gemini Omni Flash — chuyển văn bản thành video, chuyển hình ảnh thành video với tối đa 7 hình ảnh tham chiếu, và chuyển tham chiếu thành video — thông qua một API hợp nhất với mức giá minh bạch tính theo giây từ $0.112 và không cần đăng ký thuê bao. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Grok Imagine

Grok Imagine API cung cấp cho các nhà phát triển khả năng tạo hình ảnh, video và âm thanh của xAI trong một bộ công cụ duy nhất. API này tạo ra hình ảnh độ phân giải lên đến 2K với khả năng hiển thị văn bản đa ngôn ngữ, cộng với video lên đến 15 giây với âm thanh gốc, được đồng bộ hóa và chỉnh sửa dựa trên tham chiếu. Trên Atlas Cloud, một khóa duy nhất có thể chạy mọi chế độ Grok Imagine, do đó bạn có thể chuyển đổi giữa hình ảnh, video và âm thanh mà không cần thiết lập riêng biệt, với mức giá từ 0,02 USD cho mỗi hình ảnh và 0,05 USD mỗi giây.

Xem Dòng

Google

Các mô hình sáng tạo mạnh mẽ nhất của Google hiện đều có sẵn trên Atlas Cloud. Veo 3.1 cung cấp khả năng tạo video đậm chất điện ảnh, Nano Banana 2 hỗ trợ tạo hình ảnh có độ chân thực cao, và Gemini mang trí tuệ đa phương thức vào mọi quy trình làm việc. Truy cập toàn bộ bộ mô hình Google thông qua một API key duy nhất với tính khả dụng Day-0 và mức giá dùng bao nhiêu trả bấy nhiêu (pay-as-you-go).

Xem Dòng

Seedance 2.0 Mini

Seedance 2.0 Mini mang khả năng tạo video đa phương thức của ByteDance vào các quy trình làm việc nơi tốc độ và chi phí là quan trọng nhất. Nó cung cấp các khả năng cốt lõi của Seedance 2.0 với mức tiêu thụ tài nguyên nhẹ hơn — tạo nhanh hơn, chi phí mỗi video thấp hơn và tích hợp API giống như bạn đã sử dụng. Đối với các nhóm chạy các quy trình (pipeline) khối lượng lớn hoặc tạo nguyên mẫu ở quy mô lớn, Mini là lựa chọn mặc định thiết thực.

Xem Dòng

ByteDance

Từ tạo video điện ảnh đến kiến tạo hình ảnh có độ trung thực cao, các mô hình mạnh mẽ nhất của ByteDance hiện đã có mặt trên Atlas Cloud. Chạy Seedance và Seedream ở quy mô lớn với mức giá suy luận thấp nhất và không có chi phí quản lý cơ sở hạ tầng.

Xem Dòng

Alibaba

Atlas Cloud tập hợp toàn bộ dòng mô hình của Alibaba dưới một API duy nhất: Qwen cho các tác vụ ngôn ngữ và hình ảnh, Wan để tạo video với độ phân giải lên đến 1080p. Truy cập mọi mô hình theo hình thức dùng đến đâu trả tiền đến đó (pay-as-you-go) mà không cần đăng ký gói. Alibaba API có sẵn thông qua một URL cơ sở (base URL) duy nhất bằng cách sử dụng ứng dụng khách tương thích với OpenAI hiện có của bạn.

Xem Dòng

OpenAI

Atlas Cloud cấp cho bạn quyền truy cập vào toàn bộ danh mục OpenAI API, từ GPT Image 2 để tạo hình ảnh đến Sora 2 cho video. Mọi mô hình đều có sẵn theo hình thức dùng đến đâu trả tiền đến đó (pay-as-you-go) mà không cần cam kết hàng tháng. Tích hợp dễ dàng chỉ bằng cách thay đổi một base URL thông qua API tương thích với OpenAI.

Xem Dòng

xAI

Xây dựng các pipeline hình ảnh và video hoàn chỉnh bằng xAI API trên Atlas Cloud. Tạo ở độ phân giải 2K, chỉnh sửa bằng hình ảnh tham chiếu và tạo hoạt ảnh từ hình ảnh thành các clip đồng bộ với âm thanh.

Xem Dòng

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình