Seedance 2.5 đã chính thức ra mắt — Có mặt đầu tiên trên Atlas Cloud
Hero background 1Hero background 2Hero background 3

FLUX 3 API: 20-Second Video With Native Audio

FLUX 3 API mang mô hình nền tảng mới nhất của Black Forest Labs vào hệ thống của bạn, một kiến trúc Self-Flow duy nhất được huấn luyện chung trên hình ảnh, video và âm thanh. Tạo các đoạn clip dài մինչև 20 giây với hội thoại đa ngôn ngữ, hiệu ứng âm thanh và âm nền trong một lần chạy, hoặc render tác vụ text-to-image với kiểu chữ chính xác. Atlas Cloud cung cấp nó qua một khóa tương thích OpenAI, với mô hình tính phí trả theo lượt gọi và quyền truy cập Day-0.

Khám phá Mô hình Hàng đầu

Atlas Cloud cung cấp cho bạn các mô hình sáng tạo tiên tiến nhất trong ngành.

Tất cả endpoint FLUX 3 API, theo từng phương thức

Năm endpoint video nằm sau cùng một giao diện FLUX 3 API, và bảng dưới đây cho biết mỗi endpoint nhận gì, trả về gì và có chi phí bao nhiêu mỗi giây.

Phương thứcMô tả
FLUX 3 T2V API (Text to Video)Prompt văn bản được chuyển thành clip dài 5 đến 20 giây, kèm âm thanh được tạo trong cùng một lượt chạy, vì generate_audio được bật mặc định. Đầu ra ở 720p hoặc 1080p với bảy tỷ lệ khung hình cố định từ 21:9 đến 9:16, cộng thêm tùy chọn auto, và giá trị seed giúp tái tạo bất kỳ kết quả nào. Giá là $0.17 cho mỗi giây video được tạo.
FLUX 3 I2V API (Image to Video)Cung cấp một ảnh PNG, JPEG hoặc WebP duy nhất, mô hình sẽ tạo chuyển động tiếp diễn từ khung hình đó, lấy chuyển động và nhịp độ theo prompt. Có thể chọn thời lượng trong khoảng 5 đến 20 giây, phù hợp với cảnh sản phẩm, phần giới thiệu nhân vật và các đoạn cắt ngắn cho mạng xã hội dựa trên artwork bạn đã sở hữu. Tính phí $0.17 cho mỗi giây video được tạo.
FLUX 3 Keyframes API (Keyframes to Video)Khi một cảnh quay cần khớp các nhịp cụ thể, có thể ghim tối đa 10 ảnh keyframe vào đúng vị trí khung hình trên timeline 24 fps. Mỗi frame_index phải nằm trong phạm vi duration nhân với 24, giúp các nhóm storyboard và previz kiểm soát trực tiếp nội dung xuất hiện và thời điểm xuất hiện. Mức giá tương tự các endpoint tạo sinh khác: $0.17 cho mỗi giây video được tạo.
FLUX 3 FLF API (First and Last Frame to Video)Cần clip kết thúc đúng bằng một hình ảnh chốt cụ thể? Truyền start_image_url và end_image_url để khóa cả hai đầu của cảnh quay, trong khi mô hình tự điền chuyển động ở giữa. Các cảnh lộ logo, chuỗi biến đổi và chuyển cảnh cần khớp với footage xung quanh đều phù hợp ở đây, với giá $0.17 cho mỗi giây video được tạo.
FLUX 3 Extend API (Video Extension)Footage hiện có sẽ tiếp tục câu chuyện trên endpoint này: một tệp MP4 dưới 50 MB và ngắn hơn 15 giây được nối tiếp từ các khung hình cuối theo prompt. Âm thanh vẫn được tạo song song với hình ảnh, và các tùy chọn đầu ra 720p hoặc 1080p cùng khoảng thời lượng 5 đến 20 giây vẫn được áp dụng. Extension có giá $0.41 cho mỗi giây video được tạo.

Video, âm thanh và chỉ đạo trong một lệnh gọi FLUX 3 API duy nhất

Được Black Forest Labs xây dựng trên một backbone đa phương thức, FLUX 3 API trả về video HD hoặc Full HD dài tối đa 20 giây, trong đó thoại, hiệu ứng âm thanh và âm nền được tạo trong cùng một lượt; đồng thời nhận chỉ đạo về cảnh quay, keyframe, ngôn ngữ và chữ hiển thị trên màn hình trong suốt quá trình.

20 giây hình ảnh và âm thanh trong một lượt

Một lệnh gọi duy nhất trả về video dài 5 đến 20 giây với âm thanh được tạo ngay trong cùng một lượt, không bao giờ lồng tiếng bổ sung về sau. Thoại, hiệu ứng âm thanh và lớp âm nền khớp đúng khung hình nơi sự kiện diễn ra, và đầu ra có độ phân giải 720p HD hoặc 1080p Full HD. Chính độ khớp thời gian đó khiến cảnh chảo bùng lửa hay cánh cửa đóng sầm trông như được quay thật, thay vì được ghép dựng.

Thay đổi cảnh và máy quay trong cùng một lần tạo

Yêu cầu một cú cắt cảnh và model sẽ thực hiện. Cảnh và góc máy có thể thay đổi trong cùng một lần tạo, trong khi cùng một nhân vật, trang phục và logic ánh sáng vẫn được duy trì xuyên suốt mọi cảnh quay. Các tác phẩm dài hơn được tạo bằng agentic clip chaining, liên kết các lần tạo riêng lẻ thành chuỗi kéo dài nhiều phút. Những storyboard trước đây cần bốn lần render và một biên tập viên giờ có thể trả về dưới dạng một tác phẩm liền mạch.

Năm cách đưa nội dung vào FLUX 3 API

Chỉ văn bản, một ảnh tĩnh duy nhất, cặp khung hình đầu và cuối, các keyframe được đặt dọc timeline, hoặc một clip hiện có để tiếp tục: cả năm điểm vào đều được hỗ trợ. Keyframe cố định điều gì xảy ra và khi nào, còn continuation tiếp nối từ footage bạn đã có. Các studio đang có ảnh tĩnh thương hiệu hoặc những bản dựng còn dang dở có thể bắt đầu từ chính các tài sản đó thay vì phải mô tả từng cảnh quay từ đầu.

Thoại khớp tự nhiên bằng mười ba ngôn ngữ

Thoại gốc hỗ trợ các phương ngữ tiếng Anh, tiếng Trung, tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Nhật, tiếng Bồ Đào Nha, tiếng Nga, tiếng Ý, tiếng Indonesia, tiếng Thổ Nhĩ Kỳ, tiếng Hindi, tiếng Punjabi và hơn thế nữa, với chuyển động môi khớp với bất kỳ ngôn ngữ nào bạn yêu cầu. Chữ cũng được render như một phần của cảnh, nên biển hiệu và tiêu đề nằm ngay trong khung hình thay vì phải compositing sau. Vì vậy, một prompt duy nhất có thể xuất ra một spot đã bản địa hóa với phần chữ được đặt sẵn đúng vị trí.

FLUX 3 API phía sau một khóa Atlas Cloud duy nhất

Atlas Cloud cung cấp FLUX 3 qua cùng endpoint hợp nhất dùng cho phần còn lại của catalog, nên một khóa có thể truy cập các model video, hình ảnh và ngôn ngữ mà không cần tích hợp lần hai. Thanh toán theo mức sử dụng, không cần subscription và không có phí theo seat; bạn chỉ trả tiền cho những lần tạo mà mình thực sự chạy. Đổi model chỉ là đổi một chuỗi. Hãy bắt đầu xây dựng ngay hôm nay.

Một prompt, ba model: So sánh FLUX 3 API song song

Mỗi hàng bên dưới chạy cùng một prompt giống hệt nhau qua FLUX 3 API và hai model video khác trên Atlas Cloud, để có thể đánh giá độ liền mạch của chuyển động, các chuyển cảnh và âm thanh native trên cùng một brief thay vì dựa vào các demo được chọn lọc.

Prompt

Live action phong cách điện ảnh, con hẻm sau ở Tokyo về đêm, mặt đường ướt bóng vì mưa. Một chú Shiba Inu mặc áo mưa vàng nhỏ xíu cưỡi ván trượt lao xuống hẻm, lạng lách giữa các vũng nước và miệng thoát hơi. Mở đầu bằng một tracking shot góc thấp lướt sát mặt đường ướt ngay sau ván trượt, các phản chiếu neon kéo thành vệt vụt qua. Chú chó quệt trúng một chồng đèn lồng giấy khiến chúng tung lên không trung, rồi một cú whip pan bám theo một chiếc đèn lồng đang xoay tròn khi nó lăn nhào về phía một quầy ramen. Cắt sang cảnh quay bằng drone kéo lên và lùi ra sau trong lúc Shiba dậm một chân xuống, xoay ván trượt để dừng gắt, rồi sủa một tiếng với người đầu bếp ramen đang cười, người này búng một lát chashu để chú chó chụp lấy giữa không trung. Ánh đèn ấm của quầy tương phản với neon lạnh, tia nước được chiếu sáng từ phía sau. Âm thanh: tiếng mưa xối xả, bánh xe urethane lăn ầm ì trên đá, chảo wok xèo xèo, một tiếng sủa sắc gọn, tiếng tàu chạy đâu đó phía trên. Tỷ lệ khung hình 16:9.

Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud

Generated with Veo3.1 on Atlas Cloud

Generated with Kling v3.0 on Atlas Cloud

Prompt

Phong cách anime vẽ tay, buổi trưa rực sáng phía trên biển mây bất tận. Một thiếu nữ câu cá trên trời đứng vững trên boong một chiếc airship bằng gỗ và quăng dây câu dài xuống biển mây. Bắt đầu bằng góc nhìn POV ngôi thứ nhất qua lan can khi dây câu vút ra và biến mất vào khoảng trắng. Cần câu bất ngờ căng phựt, và camera cắt sang một vòng orbit tốc độ cao quanh boong khi cô bị kéo lê trên các tấm ván, sợi dây bốc khói xuyên qua găng tay, một chiếc ủng móc vào một cuộn dây chằng. Cô chống một chân lên lan can và giật mạnh về sau đúng lúc một con cá koi lớn bằng cá voi trồi xuyên qua mây phía sau cô, vảy hắt ánh cầu vồng lên các cánh buồm. Kết thúc bằng một hero shot góc thấp khi thủy thủ đoàn vỡ òa reo hò và bụi nước từ mây trôi ngang khung hình. Cel shading giàu chất hội họa, rim light ấm, thấy rõ texture nét cọ. Âm thanh: gió rít ào ào, dây thừng kẽo kẹt, dàn nhạc dâng cao, một tiếng bùng sâu như nước khi con cá trồi lên. Tỷ lệ khung hình 16:9.

Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Kling v3.0 on Atlas Cloud

Nơi các đội ngũ đưa FLUX 3 API vào ứng dụng

Dù công việc là một clip mạng xã hội dài hai mươi giây với âm thanh gốc, một storyboard có keyframe, một bản cắt quảng cáo bản địa hóa, hay một lượt dựng nháp nhanh trước bản render cuối, FLUX 3 API đều đáp ứng trên Atlas Cloud với giá trả theo mức sử dụng và quyền truy cập Day-0.

Clip mạng xã hội có sẵn âm thanh riêng

Tạo video dài đến hai mươi giây từ một prompt văn bản duy nhất, với lời thoại, hiệu ứng và âm thanh môi trường được tạo cùng với từng khung hình. Các đội ngũ social có ngay một clip hoàn chỉnh mà không cần thêm bước xử lý âm thanh riêng.

Storyboard nhiều cảnh quay thông qua FLUX 3 API

Các keyframe theo thứ tự cho phép FLUX 3 API dẫn dắt một cảnh qua những khoảnh khắc đã định, thay đổi góc máy và bối cảnh trong cùng một lần tạo. Họa sĩ storyboard có thể xem trước toàn bộ chuỗi cảnh trước khi lên lịch bất kỳ buổi quay nào.

Kiểu chữ và văn bản trong khung hình

Kiểu chữ được render chính xác trong các cảnh được tạo, và khả năng xử lý văn bản đa ngôn ngữ được cải thiện so với các thế hệ FLUX trước đó. Mockup bao bì, thẻ tiêu đề và banner bản địa hóa có thể được tạo sẵn sàng để duyệt chỉ từ một lần gọi duy nhất.

Bản cắt quảng cáo bản địa hóa với FLUX 3 API

Cần cùng một spot quảng cáo cho sáu thị trường? FLUX 3 API tạo lời thoại đa ngôn ngữ được đồng bộ với video, để mỗi bản cắt có sẵn track giọng nói bản địa hóa riêng mà không cần công đoạn lồng tiếng.

Vòng đời thứ hai cho footage hiện có

Footage hiện có có thể được đưa vào bối cảnh mới, mở rộng với âm thanh khớp, hoặc tái định hình trong khi các yếu tố trung tâm vẫn được giữ nguyên. Các agency có thể hồi sinh tài sản chiến dịch cũ thay vì đặt thêm một buổi quay mới.

Lượt dựng nháp chi phí thấp trên FLUX 3 API

Chế độ nháp trả về bản xem trước HD nhanh với chi phí thấp hơn, và các shot đã được duyệt sẽ được render lại ở HD hoặc FHD thông qua FLUX 3 API. Việc lặp lại vẫn tiết kiệm khi một ý tưởng cần đến hai mươi lần thử.

So sánh song song FLUX 3 API với các mô hình video khác trên Atlas Cloud

Cân nhắc độ dài clip, độ phân giải đầu ra, âm thanh native và chi phí mỗi giây để xem FLUX 3 API vượt trội ở đâu và khi nào một mô hình Atlas Cloud khác có thể phù hợp hơn với pipeline của bạn.

Mô hìnhĐộ dài clip tối đaĐộ phân giải đầu ra tối đaÂm thanh nativeGiá mỗi giây
FLUX 3 Video (Text-to-Video)20 sFHD, tối đa 2 MP mỗi khung hình√ lời thoại, SFX, âm thanh môi trường$0.17 HD / $0.29 FHD
FLUX 3 Video (Video-to-Video)20 sFHD, tối đa 2 MP mỗi khung hình√ lời thoại, SFX, âm thanh môi trường$0.41 HD / $0.53 FHD
Seedance 2.0 Text-to-Video15 s4K (3840 x 2160)√ bật theo mặc định$0.112
Kling V3.0 Turbo Text-to-Video15 s1080p√ tùy chọn, tắt theo mặc định$0.112
Wan-2.7 Text-to-video15 s1080p native, 1440p-SR√ SFX, nhạc, âm thanh môi trường$0.10
Veo3.1 Text-to-video8 s1080p√ âm thanh được đồng bộ$0.20

Cách Sử Dụng FLUX 3 trên Atlas Cloud

Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.

Tạo Tài Khoản Atlas Cloud

Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.

Tại sao Sử dụng FLUX 3 trên Atlas Cloud

Sự kết hợp của các mô hình tiên tiến của FLUX 3 với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.

Hiệu suất và Tính linh hoạt

Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.

API Thống nhất:
Chạy FLUX 3, GPT, Gemini và DeepSeek với một tích hợp duy nhất.

Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.

Doanh nghiệp và Mở rộng

Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.

Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.

Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.

Giải đáp các câu hỏi về FLUX 3 API cho nhà phát triển

FLUX 3 là mô hình nền tảng đa phương thức của Black Forest Labs, được huấn luyện chung trên hình ảnh, video, âm thanh và dự đoán hành động, thay vì ghép nối từ các hệ thống riêng lẻ. FLUX 3 API cung cấp mô hình đó thông qua Atlas Cloud, nên một yêu cầu duy nhất có thể trả về video kèm âm thanh được đồng bộ. Một khóa tương thích OpenAI bao phủ mô hình này cùng mọi mô hình khác trong danh mục, tính phí theo mức sử dụng.

Video là năng lực hiện đã được cung cấp rộng rãi, bao gồm text to video, image to video, các cảnh quay được dẫn hướng bằng keyframe và tiếp nối một clip hiện có, mỗi loại đều có thể tùy chọn âm thanh native. Black Forest Labs đang phát hành dòng mô hình này theo từng giai đoạn, vì vậy FLUX 3 Image và FLUX 3 Action sẽ ra mắt sau các endpoint video thay vì được phát hành cùng lúc.

Tạo tài khoản, tạo API key và trỏ client hiện có của bạn đến endpoint FLUX 3 API. Các yêu cầu tuân theo cùng mẫu tương thích OpenAI được dùng trong toàn bộ danh mục Atlas Cloud, nên bạn không cần học SDK riêng và cũng không bị khóa chặt vào một nhà cung cấp để rồi phải gỡ bỏ về sau. Việc tính phí theo hình thức pay-as-you-go cho từng lần tạo, không cần đăng ký gói thuê bao trước. Hãy bắt đầu xây dựng ngay hôm nay.

Có, và việc này diễn ra trong cùng một lượt tạo thay vì qua một mô hình thứ hai, giúp hội thoại, hiệu ứng âm thanh và âm nền khớp với hình ảnh. FLUX 3 xử lý giọng nói với lip sync trên hơn một chục ngôn ngữ, bao gồm English, Chinese, Spanish, Japanese và Hindi. Có thể tắt âm thanh theo từng yêu cầu khi bạn chỉ cần cảnh quay không tiếng.

Mỗi lần tạo có độ dài từ 5 đến 20 giây, xuất ở HD 720p, với Full HD 1080p khả dụng khi độ chi tiết quan trọng hơn chi phí. Các khung hình widescreen, square và vertical đều được hỗ trợ, nên cùng một prompt có thể dùng cho hero của landing page hoặc feed di động. Với câu chuyện dài hơn, tốt nhất nên xây dựng từ nhiều clip được kiểm soát thay vì một yêu cầu quá lớn.

Cung cấp một hình ảnh bắt đầu và mô hình sẽ tạo chuyển động cho hình đó, hoặc ghim keyframe khi cảnh quay cần đạt các khoảnh khắc cụ thể theo một thứ tự nhất định. Cảnh quay hiện có cũng có thể được tiếp nối, với chuyển động và khung hình được kế thừa từ phần cuối của clip đầu vào. Chỉ nên nối tiếp nhiều lần một cách tiết chế, vì độ nhất quán hình ảnh sẽ trôi dần khi mỗi phần mở rộng được xây trên phần trước đó.

Draft mode trả về bản xem trước HD với chi phí thấp hơn để bạn đánh giá bố cục, nhịp dựng và âm thanh trước khi trả phí cho bản render cuối. Hãy lặp lại prompt ở đó, rồi chạy lại prompt tốt nhất ở HD tiêu chuẩn hoặc Full HD mà không cần thay đổi cấu trúc yêu cầu. Các đội ngũ phát hành nhiều biến thể sẽ nhận được nhiều giá trị nhất từ vòng lặp này.

Video được tính phí theo từng giây đầu ra, vì vậy clip ngắn chỉ tốn một phần chi phí so với clip dài và bạn chỉ trả cho những gì thực sự tạo ra. Độ phân giải quyết định mức giá, trong đó Full HD cao hơn HD tiêu chuẩn và Draft mode thấp hơn cả hai. Atlas Cloud không cộng thêm phí thuê bao, phí theo chỗ ngồi hay mức chi tối thiểu. Hãy bắt đầu hôm nay.

Chưa. FLUX 3 Video là phần đã được phát hành của dòng mô hình này, trong khi FLUX 3 Image đang được triển khai theo giai đoạn và một biến thể open weights FLUX 3 Dev đã được công bố cho thời điểm sau. Atlas Cloud sẽ bổ sung từng endpoint FLUX 3 mới khi chúng được phát hành, nên cùng một khóa vẫn tiếp tục hoạt động khi tính năng tạo hình ảnh ra mắt.

Một mô hình chung loại bỏ bước ghép nối: không cần lượt xử lý thứ hai để căn giọng nói theo chuyển động miệng hoặc phủ âm nền lên một bản dựng đã hoàn tất. Điều này đặc biệt quan trọng với các cảnh hội thoại, nơi độ lệch giữa các track sẽ ngay lập tức bị người xem nhận ra. Pipeline được rút gọn từ nhiều dịch vụ xuống còn một lệnh gọi, nghĩa là có ít điểm lỗi cần giám sát hơn.

Khám phá Thêm Dòng

Seedance 2.5

Seedance 2.5 API hiện đã có mặt trên Atlas Cloud! Cung cấp cho các nhà phát triển mô hình video mới nhất của ByteDance. Nó tạo ra tối đa 30 giây video gốc chỉ trong một lần xử lý từ văn bản, một hình ảnh duy nhất hoặc tối đa 50 tài liệu tham khảo đa phương thức, với âm thanh được đồng bộ hóa và văn bản đa ngôn ngữ trong khung hình. Trên Atlas Cloud, bạn có thể truy cập thông qua một khóa duy nhất, với tính nhất quán của chủ thể và vật lý được cải thiện giúp giữ cho các cảnh quay dài luôn mạch lạc.

Xem Dòng

MiniMax H3

API MiniMax H3 mở quyền truy cập vào mô hình video đa phương thức đa dụng của MiniMax, có thể đọc văn bản, hình ảnh, video và âm thanh như một ngữ cảnh duy nhất thay vì xử lý từng tác vụ riêng lẻ. Các clip có thời lượng từ 5 đến 15 giây ở 24 FPS, hỗ trợ nhiều tỷ lệ khung hình từ 21:9 đến 9:16; chỉ với một prompt, bạn có thể hoán đổi nhân vật, thay nền, viết lại hội thoại hoặc sao chép giọng nói từ một clip tham chiếu. Atlas Cloud cung cấp toàn bộ khả năng này thông qua một endpoint tương thích OpenAI. Hãy bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Seedream 5.0 Pro

Seedream 5.0 Pro API cung cấp cho các nhà phát triển mô hình chỉnh sửa hình ảnh có thể kiểm soát của ByteDance trên Atlas Cloud. Nó đặt các chỉnh sửa một cách chính xác bằng các điểm neo và tọa độ, tách hình ảnh thành các lớp có thể chỉnh sửa, kết hợp nhiều tham chiếu và khớp màu sắc cũng như vật liệu chính xác, với văn bản đa ngôn ngữ ở độ phân giải 2K và 3K. Trên Atlas Cloud, bạn có thể truy cập nó chỉ bằng một khóa!

Xem Dòng

Seedance 2.0

Seedance 2.0 API cung cấp cho bạn quyền truy cập cấp sản xuất vào mô hình video đa phương thức của ByteDance — đầu vào bốn phương thức (văn bản, hình ảnh, video, âm thanh) và hệ thống "Universal Reference" hàng đầu trong ngành giúp khóa bố cục, chuyển động của camera và hành động của nhân vật trên các cảnh quay. Tích hợp quyền kiểm soát cấp độ đạo diễn bằng một lệnh gọi API, mức giá cố định $0,09/giây, cấp khóa tức thì và không có danh sách chờ — được hỗ trợ bởi thời gian hoạt động và sự tuân thủ cấp doanh nghiệp. Seedance 2.0 Native 4K hiện đã ra mắt!

Xem Dòng

GPT Image 2

GPT Image 2 API cung cấp cho các nhà phát triển quyền truy cập vào mô hình hình ảnh mới nhất của OpenAI, phiên bản kế nhiệm của GPT Image 1.5. Mô hình này tạo và chỉnh sửa hình ảnh với khả năng hiển thị văn bản chính xác trên các chữ viết Latinh và CJK, cùng với bố cục mạnh mẽ cho áp phích, mockup và đồ họa thông tin. Trên Atlas Cloud, bạn có thể truy cập nó thông qua một API thống nhất cùng với hơn 300 mô hình khác, với tín dụng miễn phí, 99,99% thời gian hoạt động và không yêu cầu xác minh tổ chức OpenAI.

Xem Dòng

Gemini Omni Flash

Gemini Omni API đưa mô hình tạo và chỉnh sửa video đa phương thức của Google DeepMind, được giới thiệu tại Google I/O 2026, vào stack của bạn. Gemini Omni kết hợp công cụ suy luận của Gemini với media tạo sinh, chấp nhận mọi tổ hợp văn bản, hình ảnh, video và âm thanh để tạo ra kết quả nhất quán, dựa trên nền tảng tri thức. Tinh chỉnh kết quả qua hội thoại tự nhiên — hoán đổi vật thể, viết lại cảnh quay và thay đổi phong cách, trong khi vật lý, nhân vật và tính liên tục vẫn được giữ nguyên. Atlas Cloud cung cấp trọn bộ dòng Gemini Omni Flash — chuyển văn bản thành video, chuyển hình ảnh thành video với tối đa 7 hình ảnh tham chiếu, và chuyển tham chiếu thành video — thông qua một API hợp nhất với mức giá minh bạch tính theo giây từ $0.112 và không cần đăng ký thuê bao. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Grok Imagine

Grok Imagine API của xAI cung cấp các mô hình hình ảnh, video và lời nói, từ Image 2.0 đến Video 1.5 và xAI TTS v1. Render 1K hoặc 2K hình tĩnh trên 14 tỷ lệ khung hình, tạo cảnh 15 giây video 1080p, điều hướng các shot bằng tối đa 7 hình ảnh tham chiếu, hoặc cung cấp lời tường thuật bằng 20 ngôn ngữ. Atlas Cloud chạy mọi chế độ trên một endpoint, có giá theo mô hình trả tiền khi sử dụng từ $0.02 mỗi hình ảnh và $0.05 mỗi giây. Bắt đầu xây dựng hôm nay.

Xem Dòng

Google

Các mô hình sáng tạo mạnh mẽ nhất của Google hiện đều có sẵn trên Atlas Cloud. Veo 3.1 cung cấp khả năng tạo video đậm chất điện ảnh, Nano Banana 2 hỗ trợ tạo hình ảnh có độ chân thực cao, và Gemini mang trí tuệ đa phương thức vào mọi quy trình làm việc. Truy cập toàn bộ bộ mô hình Google thông qua một API key duy nhất với tính khả dụng Day-0 và mức giá dùng bao nhiêu trả bấy nhiêu (pay-as-you-go).

Xem Dòng

Seedance 2.0 Mini

Seedance 2.0 Mini mang khả năng tạo video đa phương thức của ByteDance vào các quy trình làm việc nơi tốc độ và chi phí là quan trọng nhất. Nó cung cấp các khả năng cốt lõi của Seedance 2.0 với mức tiêu thụ tài nguyên nhẹ hơn — tạo nhanh hơn, chi phí mỗi video thấp hơn và tích hợp API giống như bạn đã sử dụng. Đối với các nhóm chạy các quy trình (pipeline) khối lượng lớn hoặc tạo nguyên mẫu ở quy mô lớn, Mini là lựa chọn mặc định thiết thực.

Xem Dòng

ByteDance

Từ tạo video điện ảnh đến kiến tạo hình ảnh có độ trung thực cao, các mô hình mạnh mẽ nhất của ByteDance hiện đã có mặt trên Atlas Cloud. Chạy Seedance và Seedream ở quy mô lớn với mức giá suy luận thấp nhất và không có chi phí quản lý cơ sở hạ tầng.

Xem Dòng

Alibaba

Atlas Cloud tập hợp toàn bộ dòng mô hình của Alibaba dưới một API duy nhất: Qwen cho các tác vụ ngôn ngữ và hình ảnh, Wan để tạo video với độ phân giải lên đến 1080p. Truy cập mọi mô hình theo hình thức dùng đến đâu trả tiền đến đó (pay-as-you-go) mà không cần đăng ký gói. Alibaba API có sẵn thông qua một URL cơ sở (base URL) duy nhất bằng cách sử dụng ứng dụng khách tương thích với OpenAI hiện có của bạn.

Xem Dòng

OpenAI

Atlas Cloud cấp cho bạn quyền truy cập vào toàn bộ danh mục OpenAI API, từ GPT Image 2 để tạo hình ảnh đến Sora 2 cho video. Mọi mô hình đều có sẵn theo hình thức dùng đến đâu trả tiền đến đó (pay-as-you-go) mà không cần cam kết hàng tháng. Tích hợp dễ dàng chỉ bằng cách thay đổi một base URL thông qua API tương thích với OpenAI.

Xem Dòng

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình