


FLUX 3 API mang mô hình nền tảng mới nhất của Black Forest Labs vào hệ thống của bạn, một kiến trúc Self-Flow duy nhất được huấn luyện chung trên hình ảnh, video và âm thanh. Tạo các đoạn clip dài մինչև 20 giây với hội thoại đa ngôn ngữ, hiệu ứng âm thanh và âm nền trong một lần chạy, hoặc render tác vụ text-to-image với kiểu chữ chính xác. Atlas Cloud cung cấp nó qua một khóa tương thích OpenAI, với mô hình tính phí trả theo lượt gọi và quyền truy cập Day-0.
Atlas Cloud cung cấp cho bạn các mô hình sáng tạo tiên tiến nhất trong ngành.
Năm endpoint video nằm sau cùng một giao diện FLUX 3 API, và bảng dưới đây cho biết mỗi endpoint nhận gì, trả về gì và có chi phí bao nhiêu mỗi giây.
| Phương thức | Mô tả |
|---|---|
| FLUX 3 T2V API (Text to Video) | Prompt văn bản được chuyển thành clip dài 5 đến 20 giây, kèm âm thanh được tạo trong cùng một lượt chạy, vì generate_audio được bật mặc định. Đầu ra ở 720p hoặc 1080p với bảy tỷ lệ khung hình cố định từ 21:9 đến 9:16, cộng thêm tùy chọn auto, và giá trị seed giúp tái tạo bất kỳ kết quả nào. Giá là $0.17 cho mỗi giây video được tạo. |
| FLUX 3 I2V API (Image to Video) | Cung cấp một ảnh PNG, JPEG hoặc WebP duy nhất, mô hình sẽ tạo chuyển động tiếp diễn từ khung hình đó, lấy chuyển động và nhịp độ theo prompt. Có thể chọn thời lượng trong khoảng 5 đến 20 giây, phù hợp với cảnh sản phẩm, phần giới thiệu nhân vật và các đoạn cắt ngắn cho mạng xã hội dựa trên artwork bạn đã sở hữu. Tính phí $0.17 cho mỗi giây video được tạo. |
| FLUX 3 Keyframes API (Keyframes to Video) | Khi một cảnh quay cần khớp các nhịp cụ thể, có thể ghim tối đa 10 ảnh keyframe vào đúng vị trí khung hình trên timeline 24 fps. Mỗi frame_index phải nằm trong phạm vi duration nhân với 24, giúp các nhóm storyboard và previz kiểm soát trực tiếp nội dung xuất hiện và thời điểm xuất hiện. Mức giá tương tự các endpoint tạo sinh khác: $0.17 cho mỗi giây video được tạo. |
| FLUX 3 FLF API (First and Last Frame to Video) | Cần clip kết thúc đúng bằng một hình ảnh chốt cụ thể? Truyền start_image_url và end_image_url để khóa cả hai đầu của cảnh quay, trong khi mô hình tự điền chuyển động ở giữa. Các cảnh lộ logo, chuỗi biến đổi và chuyển cảnh cần khớp với footage xung quanh đều phù hợp ở đây, với giá $0.17 cho mỗi giây video được tạo. |
| FLUX 3 Extend API (Video Extension) | Footage hiện có sẽ tiếp tục câu chuyện trên endpoint này: một tệp MP4 dưới 50 MB và ngắn hơn 15 giây được nối tiếp từ các khung hình cuối theo prompt. Âm thanh vẫn được tạo song song với hình ảnh, và các tùy chọn đầu ra 720p hoặc 1080p cùng khoảng thời lượng 5 đến 20 giây vẫn được áp dụng. Extension có giá $0.41 cho mỗi giây video được tạo. |
Được Black Forest Labs xây dựng trên một backbone đa phương thức, FLUX 3 API trả về video HD hoặc Full HD dài tối đa 20 giây, trong đó thoại, hiệu ứng âm thanh và âm nền được tạo trong cùng một lượt; đồng thời nhận chỉ đạo về cảnh quay, keyframe, ngôn ngữ và chữ hiển thị trên màn hình trong suốt quá trình.
Một lệnh gọi duy nhất trả về video dài 5 đến 20 giây với âm thanh được tạo ngay trong cùng một lượt, không bao giờ lồng tiếng bổ sung về sau. Thoại, hiệu ứng âm thanh và lớp âm nền khớp đúng khung hình nơi sự kiện diễn ra, và đầu ra có độ phân giải 720p HD hoặc 1080p Full HD. Chính độ khớp thời gian đó khiến cảnh chảo bùng lửa hay cánh cửa đóng sầm trông như được quay thật, thay vì được ghép dựng.
Yêu cầu một cú cắt cảnh và model sẽ thực hiện. Cảnh và góc máy có thể thay đổi trong cùng một lần tạo, trong khi cùng một nhân vật, trang phục và logic ánh sáng vẫn được duy trì xuyên suốt mọi cảnh quay. Các tác phẩm dài hơn được tạo bằng agentic clip chaining, liên kết các lần tạo riêng lẻ thành chuỗi kéo dài nhiều phút. Những storyboard trước đây cần bốn lần render và một biên tập viên giờ có thể trả về dưới dạng một tác phẩm liền mạch.
Chỉ văn bản, một ảnh tĩnh duy nhất, cặp khung hình đầu và cuối, các keyframe được đặt dọc timeline, hoặc một clip hiện có để tiếp tục: cả năm điểm vào đều được hỗ trợ. Keyframe cố định điều gì xảy ra và khi nào, còn continuation tiếp nối từ footage bạn đã có. Các studio đang có ảnh tĩnh thương hiệu hoặc những bản dựng còn dang dở có thể bắt đầu từ chính các tài sản đó thay vì phải mô tả từng cảnh quay từ đầu.
Thoại gốc hỗ trợ các phương ngữ tiếng Anh, tiếng Trung, tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Nhật, tiếng Bồ Đào Nha, tiếng Nga, tiếng Ý, tiếng Indonesia, tiếng Thổ Nhĩ Kỳ, tiếng Hindi, tiếng Punjabi và hơn thế nữa, với chuyển động môi khớp với bất kỳ ngôn ngữ nào bạn yêu cầu. Chữ cũng được render như một phần của cảnh, nên biển hiệu và tiêu đề nằm ngay trong khung hình thay vì phải compositing sau. Vì vậy, một prompt duy nhất có thể xuất ra một spot đã bản địa hóa với phần chữ được đặt sẵn đúng vị trí.
Atlas Cloud cung cấp FLUX 3 qua cùng endpoint hợp nhất dùng cho phần còn lại của catalog, nên một khóa có thể truy cập các model video, hình ảnh và ngôn ngữ mà không cần tích hợp lần hai. Thanh toán theo mức sử dụng, không cần subscription và không có phí theo seat; bạn chỉ trả tiền cho những lần tạo mà mình thực sự chạy. Đổi model chỉ là đổi một chuỗi. Hãy bắt đầu xây dựng ngay hôm nay.
Mỗi hàng bên dưới chạy cùng một prompt giống hệt nhau qua FLUX 3 API và hai model video khác trên Atlas Cloud, để có thể đánh giá độ liền mạch của chuyển động, các chuyển cảnh và âm thanh native trên cùng một brief thay vì dựa vào các demo được chọn lọc.
Live action phong cách điện ảnh, con hẻm sau ở Tokyo về đêm, mặt đường ướt bóng vì mưa. Một chú Shiba Inu mặc áo mưa vàng nhỏ xíu cưỡi ván trượt lao xuống hẻm, lạng lách giữa các vũng nước và miệng thoát hơi. Mở đầu bằng một tracking shot góc thấp lướt sát mặt đường ướt ngay sau ván trượt, các phản chiếu neon kéo thành vệt vụt qua. Chú chó quệt trúng một chồng đèn lồng giấy khiến chúng tung lên không trung, rồi một cú whip pan bám theo một chiếc đèn lồng đang xoay tròn khi nó lăn nhào về phía một quầy ramen. Cắt sang cảnh quay bằng drone kéo lên và lùi ra sau trong lúc Shiba dậm một chân xuống, xoay ván trượt để dừng gắt, rồi sủa một tiếng với người đầu bếp ramen đang cười, người này búng một lát chashu để chú chó chụp lấy giữa không trung. Ánh đèn ấm của quầy tương phản với neon lạnh, tia nước được chiếu sáng từ phía sau. Âm thanh: tiếng mưa xối xả, bánh xe urethane lăn ầm ì trên đá, chảo wok xèo xèo, một tiếng sủa sắc gọn, tiếng tàu chạy đâu đó phía trên. Tỷ lệ khung hình 16:9.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
Phong cách anime vẽ tay, buổi trưa rực sáng phía trên biển mây bất tận. Một thiếu nữ câu cá trên trời đứng vững trên boong một chiếc airship bằng gỗ và quăng dây câu dài xuống biển mây. Bắt đầu bằng góc nhìn POV ngôi thứ nhất qua lan can khi dây câu vút ra và biến mất vào khoảng trắng. Cần câu bất ngờ căng phựt, và camera cắt sang một vòng orbit tốc độ cao quanh boong khi cô bị kéo lê trên các tấm ván, sợi dây bốc khói xuyên qua găng tay, một chiếc ủng móc vào một cuộn dây chằng. Cô chống một chân lên lan can và giật mạnh về sau đúng lúc một con cá koi lớn bằng cá voi trồi xuyên qua mây phía sau cô, vảy hắt ánh cầu vồng lên các cánh buồm. Kết thúc bằng một hero shot góc thấp khi thủy thủ đoàn vỡ òa reo hò và bụi nước từ mây trôi ngang khung hình. Cel shading giàu chất hội họa, rim light ấm, thấy rõ texture nét cọ. Âm thanh: gió rít ào ào, dây thừng kẽo kẹt, dàn nhạc dâng cao, một tiếng bùng sâu như nước khi con cá trồi lên. Tỷ lệ khung hình 16:9.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
Dù công việc là một clip mạng xã hội dài hai mươi giây với âm thanh gốc, một storyboard có keyframe, một bản cắt quảng cáo bản địa hóa, hay một lượt dựng nháp nhanh trước bản render cuối, FLUX 3 API đều đáp ứng trên Atlas Cloud với giá trả theo mức sử dụng và quyền truy cập Day-0.
Tạo video dài đến hai mươi giây từ một prompt văn bản duy nhất, với lời thoại, hiệu ứng và âm thanh môi trường được tạo cùng với từng khung hình. Các đội ngũ social có ngay một clip hoàn chỉnh mà không cần thêm bước xử lý âm thanh riêng.
Các keyframe theo thứ tự cho phép FLUX 3 API dẫn dắt một cảnh qua những khoảnh khắc đã định, thay đổi góc máy và bối cảnh trong cùng một lần tạo. Họa sĩ storyboard có thể xem trước toàn bộ chuỗi cảnh trước khi lên lịch bất kỳ buổi quay nào.
Kiểu chữ được render chính xác trong các cảnh được tạo, và khả năng xử lý văn bản đa ngôn ngữ được cải thiện so với các thế hệ FLUX trước đó. Mockup bao bì, thẻ tiêu đề và banner bản địa hóa có thể được tạo sẵn sàng để duyệt chỉ từ một lần gọi duy nhất.
Cần cùng một spot quảng cáo cho sáu thị trường? FLUX 3 API tạo lời thoại đa ngôn ngữ được đồng bộ với video, để mỗi bản cắt có sẵn track giọng nói bản địa hóa riêng mà không cần công đoạn lồng tiếng.
Footage hiện có có thể được đưa vào bối cảnh mới, mở rộng với âm thanh khớp, hoặc tái định hình trong khi các yếu tố trung tâm vẫn được giữ nguyên. Các agency có thể hồi sinh tài sản chiến dịch cũ thay vì đặt thêm một buổi quay mới.
Chế độ nháp trả về bản xem trước HD nhanh với chi phí thấp hơn, và các shot đã được duyệt sẽ được render lại ở HD hoặc FHD thông qua FLUX 3 API. Việc lặp lại vẫn tiết kiệm khi một ý tưởng cần đến hai mươi lần thử.
Cân nhắc độ dài clip, độ phân giải đầu ra, âm thanh native và chi phí mỗi giây để xem FLUX 3 API vượt trội ở đâu và khi nào một mô hình Atlas Cloud khác có thể phù hợp hơn với pipeline của bạn.
| Mô hình | Độ dài clip tối đa | Độ phân giải đầu ra tối đa | Âm thanh native | Giá mỗi giây |
|---|---|---|---|---|
| FLUX 3 Video (Text-to-Video) | 20 s | FHD, tối đa 2 MP mỗi khung hình | √ lời thoại, SFX, âm thanh môi trường | $0.17 HD / $0.29 FHD |
| FLUX 3 Video (Video-to-Video) | 20 s | FHD, tối đa 2 MP mỗi khung hình | √ lời thoại, SFX, âm thanh môi trường | $0.41 HD / $0.53 FHD |
| Seedance 2.0 Text-to-Video | 15 s | 4K (3840 x 2160) | √ bật theo mặc định | $0.112 |
| Kling V3.0 Turbo Text-to-Video | 15 s | 1080p | √ tùy chọn, tắt theo mặc định | $0.112 |
| Wan-2.7 Text-to-video | 15 s | 1080p native, 1440p-SR | √ SFX, nhạc, âm thanh môi trường | $0.10 |
| Veo3.1 Text-to-video | 8 s | 1080p | √ âm thanh được đồng bộ | $0.20 |
Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.
Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.
Sự kết hợp của các mô hình tiên tiến của FLUX 3 với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.
Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.
API Thống nhất:
Chạy FLUX 3, GPT, Gemini và DeepSeek với một tích hợp duy nhất.
Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.
Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.
Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.
Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.
FLUX 3 là mô hình nền tảng đa phương thức của Black Forest Labs, được huấn luyện chung trên hình ảnh, video, âm thanh và dự đoán hành động, thay vì ghép nối từ các hệ thống riêng lẻ. FLUX 3 API cung cấp mô hình đó thông qua Atlas Cloud, nên một yêu cầu duy nhất có thể trả về video kèm âm thanh được đồng bộ. Một khóa tương thích OpenAI bao phủ mô hình này cùng mọi mô hình khác trong danh mục, tính phí theo mức sử dụng.
Video là năng lực hiện đã được cung cấp rộng rãi, bao gồm text to video, image to video, các cảnh quay được dẫn hướng bằng keyframe và tiếp nối một clip hiện có, mỗi loại đều có thể tùy chọn âm thanh native. Black Forest Labs đang phát hành dòng mô hình này theo từng giai đoạn, vì vậy FLUX 3 Image và FLUX 3 Action sẽ ra mắt sau các endpoint video thay vì được phát hành cùng lúc.
Tạo tài khoản, tạo API key và trỏ client hiện có của bạn đến endpoint FLUX 3 API. Các yêu cầu tuân theo cùng mẫu tương thích OpenAI được dùng trong toàn bộ danh mục Atlas Cloud, nên bạn không cần học SDK riêng và cũng không bị khóa chặt vào một nhà cung cấp để rồi phải gỡ bỏ về sau. Việc tính phí theo hình thức pay-as-you-go cho từng lần tạo, không cần đăng ký gói thuê bao trước. Hãy bắt đầu xây dựng ngay hôm nay.
Có, và việc này diễn ra trong cùng một lượt tạo thay vì qua một mô hình thứ hai, giúp hội thoại, hiệu ứng âm thanh và âm nền khớp với hình ảnh. FLUX 3 xử lý giọng nói với lip sync trên hơn một chục ngôn ngữ, bao gồm English, Chinese, Spanish, Japanese và Hindi. Có thể tắt âm thanh theo từng yêu cầu khi bạn chỉ cần cảnh quay không tiếng.
Mỗi lần tạo có độ dài từ 5 đến 20 giây, xuất ở HD 720p, với Full HD 1080p khả dụng khi độ chi tiết quan trọng hơn chi phí. Các khung hình widescreen, square và vertical đều được hỗ trợ, nên cùng một prompt có thể dùng cho hero của landing page hoặc feed di động. Với câu chuyện dài hơn, tốt nhất nên xây dựng từ nhiều clip được kiểm soát thay vì một yêu cầu quá lớn.
Cung cấp một hình ảnh bắt đầu và mô hình sẽ tạo chuyển động cho hình đó, hoặc ghim keyframe khi cảnh quay cần đạt các khoảnh khắc cụ thể theo một thứ tự nhất định. Cảnh quay hiện có cũng có thể được tiếp nối, với chuyển động và khung hình được kế thừa từ phần cuối của clip đầu vào. Chỉ nên nối tiếp nhiều lần một cách tiết chế, vì độ nhất quán hình ảnh sẽ trôi dần khi mỗi phần mở rộng được xây trên phần trước đó.
Draft mode trả về bản xem trước HD với chi phí thấp hơn để bạn đánh giá bố cục, nhịp dựng và âm thanh trước khi trả phí cho bản render cuối. Hãy lặp lại prompt ở đó, rồi chạy lại prompt tốt nhất ở HD tiêu chuẩn hoặc Full HD mà không cần thay đổi cấu trúc yêu cầu. Các đội ngũ phát hành nhiều biến thể sẽ nhận được nhiều giá trị nhất từ vòng lặp này.
Video được tính phí theo từng giây đầu ra, vì vậy clip ngắn chỉ tốn một phần chi phí so với clip dài và bạn chỉ trả cho những gì thực sự tạo ra. Độ phân giải quyết định mức giá, trong đó Full HD cao hơn HD tiêu chuẩn và Draft mode thấp hơn cả hai. Atlas Cloud không cộng thêm phí thuê bao, phí theo chỗ ngồi hay mức chi tối thiểu. Hãy bắt đầu hôm nay.
Chưa. FLUX 3 Video là phần đã được phát hành của dòng mô hình này, trong khi FLUX 3 Image đang được triển khai theo giai đoạn và một biến thể open weights FLUX 3 Dev đã được công bố cho thời điểm sau. Atlas Cloud sẽ bổ sung từng endpoint FLUX 3 mới khi chúng được phát hành, nên cùng một khóa vẫn tiếp tục hoạt động khi tính năng tạo hình ảnh ra mắt.
Một mô hình chung loại bỏ bước ghép nối: không cần lượt xử lý thứ hai để căn giọng nói theo chuyển động miệng hoặc phủ âm nền lên một bản dựng đã hoàn tất. Điều này đặc biệt quan trọng với các cảnh hội thoại, nơi độ lệch giữa các track sẽ ngay lập tức bị người xem nhận ra. Pipeline được rút gọn từ nhiều dịch vụ xuống còn một lệnh gọi, nghĩa là có ít điểm lỗi cần giám sát hơn.
Hướng dẫn, bài hướng dẫn và cập nhật sản phẩm giúp bạn khai thác tối đa Atlas Cloud.