

API MiniMax H3 mở quyền truy cập vào mô hình video đa phương thức đa dụng của MiniMax, có thể đọc văn bản, hình ảnh, video và âm thanh như một ngữ cảnh duy nhất thay vì xử lý từng tác vụ riêng lẻ. Các clip có thời lượng từ 5 đến 15 giây ở 24 FPS, hỗ trợ nhiều tỷ lệ khung hình từ 21:9 đến 9:16; chỉ với một prompt, bạn có thể hoán đổi nhân vật, thay nền, viết lại hội thoại hoặc sao chép giọng nói từ một clip tham chiếu. Atlas Cloud cung cấp toàn bộ khả năng này thông qua một endpoint tương thích OpenAI. Hãy bắt đầu xây dựng ngay hôm nay.
Atlas Cloud cung cấp cho bạn các mô hình sáng tạo tiên tiến nhất trong ngành.
Mỗi endpoint MiniMax H3 API xử lý văn bản, hình ảnh, video và âm thanh theo cách khác nhau, vì vậy hãy xem các hàng bên dưới và chọn phương thức phù hợp với thứ bạn đang xây dựng.
| Phương thức | Mô tả |
|---|---|
| MiniMax H3 T2V API (Văn bản thành video) | Viết prompt dài tối đa 7.000 ký tự, mô hình sẽ trả về một clip dài 5 đến 15 giây ở 24 FPS, độ phân giải 1440p, kèm âm thanh stereo gốc được tạo trong cùng một lượt. Tỷ lệ khung hình được đặt cho từng request, gồm 21:9, 16:9, 4:3, 1:1, 3:4 và 9:16, nên một lệnh gọi có thể đáp ứng cả trailer điện ảnh lẫn các bản cắt dọc cho mạng xã hội. |
| MiniMax H3 I2V API (Hình ảnh thành video) | Một hình ảnh sẽ đặt khung hình mở đầu, còn hai hình ảnh sẽ cố định cả khung hình đầu tiên và cuối cùng, để H3 tự điền chuyển động ở giữa theo tỷ lệ khung hình của ảnh đầu vào. Hỗ trợ nguồn có kích thước từ 256 đến 5760 pixel mỗi cạnh, giúp dễ dàng biến key art, ảnh tĩnh sản phẩm và khung storyboard thành chuyển động. |
| MiniMax H3 Omni Reference API (Tham chiếu thành video) | Cần nhiều nguồn phối hợp với nhau? Tối đa chín hình ảnh, ba clip video và ba track âm thanh có thể nằm trong một request duy nhất với giới hạn 12 file, tất cả được đọc như một ngữ cảnh đa phương thức thống nhất. Bạn có thể duy trì nhân vật, chuyển động camera hoặc âm sắc giọng nói xuyên suốt các cảnh, hoặc chỉnh sửa một clip hiện có bằng cách thay chủ thể, hậu cảnh và lời thoại. |
Every clip the MiniMax H3 API returns runs up to fifteen seconds at 1440p with native stereo sound, built from any mix of text, image, video and voice references, and the same call can also edit characters, scenes and dialogue inside footage you already have.
One MiniMax H3 API request accepts up to nine reference images, three video clips and three audio tracks, capped at twelve files. Rather than reading them as separate slots, the model treats text, picture and sound as one context, pulling a character from a photo, a camera move from a clip and a mood from a track into the same scene. Teams with existing material get a direct route to a finished shot.
Every result ships with sound. Dialogue, ambience and music are produced in native stereo during the same pass that renders the picture at 24 frames per second, so nothing has to be scored or dubbed afterwards. Because timing is decided while the shot is generated, footsteps, speech and cuts stay locked to the action. Short ads and social spots come out ready to publish.
Need a cat swapped for a dog, a green screen replaced, or one line of dialogue rewritten? The MiniMax H3 API applies edits like these to video you supply, covering characters, objects, backgrounds, lighting and effects, while parts you did not mention stay close to the original. Prompts run to 7000 characters, so a dozen changes can be stacked into one pass. That makes iterating on an approved cut practical.
Send a voice sample alongside your images or footage and the generated character speaks in that timbre. Up to three audio references are allowed per request, each between two and fifteen seconds, and audio must always accompany a visual input rather than arrive on its own. Existing dialogue can also be replaced and the performance adjusted to match. Series work keeps one recognizable voice across every episode.
Clips run from five to fifteen seconds, and the 1440p mode puts 1440 pixels on the short side between 16:9 and 9:16, or roughly 3.7 megapixels at wider ratios such as 2976 by 1248 for 21:9. Six ratios are selectable, from cinematic 21:9 to vertical 9:16, and the MiniMax H3 API can also choose one for you. That range covers a trailer, a product loop and a vertical drama without switching models.
If your source files come straight off a camera or an editing timeline, they go in as they are: H.264 and H.265 video, JPG, PNG, WEBP, HEIC and HEIF stills, plus WAV and MP3 audio. Per-file limits sit at 50MB for video, 30MB for images and 15MB for audio, while passing assets by URL keeps requests within the 64MB body limit. On Atlas Cloud the whole set runs through one OpenAI-compatible key with pay-as-you-go billing.
Mọi clip trong bộ này đều được tạo từ một prompt giống hệt nhau gửi tới MiniMax H3 API và hai mô hình video khác được lưu trữ trên Atlas Cloud, nhờ đó có thể so sánh chuyển động, âm thanh và độ bám sát chỉ dẫn mà không thay đổi dù chỉ một từ.
15 giây, video ngắn khổ ngang 16:9. Cảnh quay người thật về một tiệm giặt tự phục vụ lúc khuya, kết hợp với hoạt họa phát sáng vẽ tay thành một hình ảnh mixed-media. Một tiệm giặt tự phục vụ nhỏ, đèn huỳnh quang chập chờn yếu ớt; bên trong có các máy giặt đang chạy, giỏ nhựa đựng đồ giặt và một chiếc ghế băng cũ, với một chiếc tất đơn lẻ nằm trên sàn. Toàn bộ không gian yên tĩnh, mang một tâm trạng hoài niệm mơ hồ. Hình ảnh có chất liệu như cảnh quay điện thoại cầm tay bằng một tay, với độ rung máy rõ rệt; ánh đèn huỳnh quang trắng khiến phơi sáng dao động lúc sáng lúc tối; các bề mặt kính có phản chiếu môi trường; khi ống kính tiến sát vật thể sẽ có độ trễ lấy nét. Hình ảnh không nên bóng bẩy và chỉn chu như quảng cáo thương mại — cảm giác tổng thể nên giống một lát cắt tài liệu chân thật, như thể bạn tình cờ bước vào lúc khuya và vội ghi lại cảnh đó trong lúc đuổi theo một thị giác kỳ lạ, như trong mơ.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Góc nhìn ngôi thứ nhất · độ cao ngang tầm mắt · camera game cầm tay Cảnh: Cú máy mô phỏng một người chơi đang điều khiển một game FPS chiến tranh hiện đại, hai tay cầm súng trường tấn công và chậm rãi tiến dọc theo vành đai ngoài của một căn cứ quân sự. Người chơi di chuyển về phía trước trên con đường cạnh chỗ nấp, tâm ngắm quét qua lối đi phía trước; sau một thoáng dừng lại, họ bắn vài phát về phía một mục tiêu ở xa, rồi tiếp tục đẩy lên — giống cảnh gameplay trực tiếp của một người chơi bình thường. Ánh sáng: Ánh sáng tự nhiên tông lạnh của một căn cứ quân sự hiện đại đan xen với khói và lửa đầu nòng. Hình ảnh chân thực và sắc nét, với vũ khí kim loại cùng bụi và màn khói chiến trường mang chất lượng của game AAA. Máy quay: Camera có độ lắc cầm tay nhẹ khi người chơi di chuyển — ban đầu chậm rãi tiến lên, sau đó quét nhẹ sang trái và phải để quan sát, có rung giật lùi tinh tế khi khai hỏa, trước khi cuối cùng tiếp tục tiến đều về phía trước.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Từ phim thương hiệu và phim ngắn dọc đến video sản phẩm, hình ảnh game và các chỉnh sửa chính xác trên footage hiện có, MiniMax H3 API bao phủ từng kịch bản thông qua một request đa phương thức duy nhất, trả về video kèm âm thanh stereo native.
Đưa các khung storyboard và shot list vào một lệnh gọi duy nhất để tạo trailer 1440p, spot TVC và chiến dịch thời trang ở 24 FPS. Âm thanh stereo native đi kèm mọi kết quả, để đội ngũ thương hiệu có thể duyệt ngay bản dựng hoàn chỉnh.
Đầu ra dọc 9:16 đáp ứng các cảnh phim có kịch bản, từ bí ẩn cổ trang đến đối đầu gia đình, với lời thoại được lồng tiếng trong cùng một lượt xử lý. Các studio xây dựng thư viện phim ngắn có thể tạo hook 15 second mà không cần đặt lịch diễn viên hay bối cảnh quay.
Nếu một cảnh cần khuôn mặt và chuyển động cụ thể, tối đa chín hình ảnh, ba video và ba clip âm thanh có thể cùng dẫn hướng một lệnh gọi. Danh tính nhân vật, chuyển động máy quay và âm sắc giọng nói được giữ ổn định qua các tập.
Cần thay đổi sau khi đã quay? Footage hiện có có thể được chỉnh sửa bằng prompt: thay chủ thể, đổi nền, điều chỉnh ánh sáng hoặc viết lại một câu thoại mà không cần quay lại bất kỳ khung hình nào.
Ảnh sản phẩm trở thành chuyển động: một ảnh tham chiếu có thể biến thành showcase 360 degree, video giải thích tính năng hoặc bản cắt paid social. Các tỷ lệ khung hình từ 21:9 đến 9:16 cho phép một bộ asset dùng được cho mọi vị trí hiển thị.
Đầu ra phong cách hóa vẫn đủ chất lượng cho game CG, PV nhân vật, opening anime và demo giao diện, nơi menu, phần tử HUD và lớp phủ văn bản phải luôn dễ đọc. Đội ngũ art dùng API này để kiểm chứng concept trước khi vào production.
Đặt API MiniMax H3 cạnh các mô hình video khác được lưu trữ trên Atlas Cloud để xem các phương thức đầu vào, giới hạn tham chiếu, thời lượng, độ phân giải và đầu ra âm thanh thực sự khác nhau như thế nào trước khi chọn một endpoint.
| Mô hình | Phương thức đầu vào | Số tệp tham chiếu tối đa | Thời lượng đầu ra | Độ phân giải tối đa | Âm thanh gốc |
|---|---|---|---|---|---|
| MiniMax H3 | Văn bản, hình ảnh, video, âm thanh | 9 hình ảnh, 3 video, 3 đoạn âm thanh, tổng cộng 12 tệp | 5s đến 15s | 1440p ở 24 FPS | √ Âm thanh stereo gốc trên mọi đầu ra |
| Seedance 2.0 Reference-to-Video | Văn bản, hình ảnh, video, âm thanh | 9 hình ảnh, 3 video, 3 đoạn âm thanh | Tối đa 15s | 720p | √ Lời thoại stereo, hiệu ứng và nhạc được tạo trong một lần chạy |
| Veo3.1 Reference-to-video | Văn bản và hình ảnh | 3 hình ảnh tham chiếu | 4s, 6s hoặc 8s | 4K chỉ với thời lượng 8s | √ Lời thoại, âm thanh môi trường và hiệu ứng âm thanh được căn chỉnh theo timeline |
| Wan-2.7 Reference-to-video | Văn bản, hình ảnh, video, âm thanh | 5 hình ảnh hoặc video clip, cộng thêm một voice clip | 2s đến 15s | 1080p | √ Tạo nhạc và hiệu ứng, hoặc điều khiển lip sync bằng âm thanh của bạn |
| Kling v3.0 Pro Image-to-Video | Văn bản và hình ảnh | - | Tối đa 15s | 1080p | √ Lời thoại đa ngôn ngữ với lip sync bằng năm ngôn ngữ |
Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.
Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.
Sự kết hợp của các mô hình tiên tiến của MiniMax H3 với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.
Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.
API Thống nhất:
Chạy MiniMax H3, GPT, Gemini và DeepSeek với một tích hợp duy nhất.
Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.
Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.
Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.
Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.
MiniMax H3 API cho phép nhà phát triển truy cập MiniMax H3 theo cách lập trình, một mô hình video đa phương thức tổng quát mở, xử lý văn bản, hình ảnh, video và âm thanh như một ngữ cảnh chung. Thay vì tách tạo sinh, chỉnh sửa và tham chiếu thành các mô hình tác vụ riêng, H3 đọc toàn bộ tập đầu vào và trả về một clip hoàn chỉnh có âm thanh. Trên Atlas Cloud, mô hình chạy sau một API key duy nhất với cách tính phí trả theo mức sử dụng.
Phim thương hiệu, trailer, phim ngắn dọc, quảng cáo sản phẩm và thương mại điện tử, demo chuyển động cho game và UI, cũng như hoạt hình cách điệu đều nằm trong phạm vi của mô hình. Vì mô hình xử lý được chữ trên màn hình, phụ đề và tài sản thương hiệu, các nhóm cũng dùng nó để xác thực ý tưởng, xem trước storyboard và tạo bản pitching hình ảnh trước khi cam kết ngân sách sản xuất.
Tạo tài khoản Atlas Cloud, tạo API key, sau đó gửi prompt cùng mọi tệp tham chiếu đến endpoint tạo video và polling để nhận kết quả hoàn chỉnh. Nên truyền media dưới dạng URL được lưu trữ thay vì upload inline, vì request body bị giới hạn ở 64MB. Hãy bắt đầu xây dựng ngay hôm nay.
Billing theo mô hình trả theo mức sử dụng, nên bạn trả tiền cho từng call thay vì mua subscription hoặc seat license. Chi phí bám theo nội dung bạn thực sự render, nghĩa là độ phân giải và độ dài clip sẽ quyết định tổng chi phí cho một batch. Hãy kiểm tra trang model để xem mức phí hiện tại cho mỗi lần tạo trước khi lên kế hoạch chạy khối lượng lớn.
Có. Mọi kết quả H3 đều được cung cấp kèm âm thanh stereo gốc, nên thoại, hiệu ứng và âm môi trường được tạo cùng lượt với hình ảnh. Cung cấp một clip âm thanh tham chiếu và mô hình có thể chuyển sắc âm đó sang một nhân vật, giúp loại bỏ một bước tổng hợp giọng nói riêng trong pipeline.
Clip có thời lượng từ 5 đến 15 giây ở 24 FPS. Ở chế độ 1440p, cạnh ngắn render ở 1440 pixel cho các tỷ lệ từ 16:9 đến 9:16; ngoài khoảng đó, khung hình giữ tổng cộng khoảng 3.7M pixel, ví dụ 2976 x 1248 ở 21:9. Các request text to video và omni reference chấp nhận 21:9, 16:9, 4:3, 1:1, 3:4 và 9:16, trong khi các request first and last frame kế thừa tỷ lệ khung hình của ảnh đầu vào.
Một prompt có thể đi kèm tối đa chín hình ảnh, ba đoạn video và ba clip âm thanh, với giới hạn tổng cộng mười hai tệp. Tổng thời lượng video và âm thanh mỗi loại không quá 15 giây, và âm thanh phải đi kèm một hình ảnh hoặc một video thay vì được gửi riêng. Prompt hỗ trợ tối đa 7000 ký tự, đủ chỗ cho chỉ dẫn theo từng cảnh quay về camera, diễn xuất và âm thanh.
Đầu vào được chấp nhận gồm video H.264 và H.265, hình ảnh JPG, JPEG, PNG, WEBP, HEIC và HEIF, cùng âm thanh WAV hoặc MP3; track âm thanh bên trong tệp video dùng AAC hoặc MP3. Giới hạn cho mỗi tệp là 50MB với video, 30MB với hình ảnh và 15MB với âm thanh. Vì request body bị giới hạn ở 64MB, URL được lưu trữ vẫn là lựa chọn an toàn hơn cho các asset nặng.
Chỉnh sửa là một trong các chế độ cốt lõi của mô hình. Gửi clip nguồn kèm hướng dẫn, MiniMax H3 API có thể thay nhân vật hoặc vật thể, thay nền và ánh sáng, thêm lớp hiệu ứng hình ảnh, cũng như viết lại thoại trong khi giữ ổn định các vùng không bị tác động. Các chỉ dẫn phức hợp được xử lý trong một request, nên nhiều thay đổi được áp dụng cùng lúc thay vì qua nhiều lượt gọi lặp lại.
Hầu hết mô hình video nhận một prompt cộng một hình ảnh rồi trả về một clip không có tiếng. H3 thì ngược lại: nó tiếp nhận một tập tham chiếu hỗn hợp, đọc ý định về nhân vật, chuyển động, camera và âm thanh trên toàn bộ tập đó, rồi trả về một clip có âm thanh gốc. Nếu pipeline hiện tại của bạn đang ghép một mô hình video, một mô hình giọng nói và một trình chỉnh sửa với nhau, H3 sẽ gộp các giai đoạn đó vào một call duy nhất.
Hướng dẫn, bài hướng dẫn và cập nhật sản phẩm giúp bạn khai thác tối đa Atlas Cloud.