

The MiniMax H3 API opens MiniMax's general purpose multimodal video model, which reads text, images, video and audio as one context instead of one task at a time. Clips run 5 to 15 seconds at 24 FPS across aspect ratios from 21:9 to 9:16, and one prompt can swap characters, replace backgrounds, rewrite dialogue or clone a voice from a reference clip. Atlas Cloud serves it all through one OpenAI-compatible endpoint. Start building today.
Atlas Cloud 为您提供最新的行业领先创意模型。
每个 MiniMax H3 API 端点对文本、图像、视频和音频的读取方式各不相同,因此请浏览下方各行,并将模态与正在构建的内容相匹配。
| 模态 | 描述 |
|---|---|
| MiniMax H3 T2V API(文本生成视频) | 编写最长 7,000 个字符的提示词,模型会返回一段 5 到 15 秒、24 FPS、1440p 的视频片段,并在同一次生成中生成原生立体声。每次请求都可在 21:9、16:9、4:3、1:1、3:4 和 9:16 之间设置宽高比,因此一次调用即可覆盖电影感预告片和竖屏社交媒体剪辑等场景。 |
| MiniMax H3 I2V API(图像生成视频) | 使用一张图像可设定开场帧,使用两张图像则可同时锁定首帧和尾帧,由 H3 按输入图像的宽高比补全其间的运动。支持每边 256 到 5760 像素的源图像,因此可以轻松让关键视觉、产品静帧和分镜帧动起来。 |
| MiniMax H3 Omni Reference API(参考生成视频) | 需要让多个素材协同工作?在单次请求中,在 12 个文件的上限内,最多可放入九张图像、三段视频片段和三条音轨,并作为一个多模态上下文整体读取。你可以在多个镜头间延续角色、镜头运动或声音音色,也可以通过替换主体、背景和台词来编辑现有片段。 |
MiniMax H3 API 返回的每个片段最长可达十五秒,支持 1440p,并带有原生立体声;可由文本、图像、视频和语音参考的任意组合生成,同一次调用还能编辑你已有素材中的角色、场景和对白。
一次 MiniMax H3 API 请求最多可接收九张参考图像、三个视频片段和三条音轨,总数上限为十二个文件。模型不会把它们当作彼此独立的输入槽位,而是将文本、画面和声音视为同一个上下文:从照片中提取角色,从片段中借鉴镜头运动,从音轨中吸收情绪,并融合到同一个场景里。已有素材的团队可以更直接地得到成片镜头。
每个生成结果都自带声音。对白、环境声和音乐会在渲染 24 frames per second 画面的同一流程中以原生立体声生成,因此后期无需再配乐或配音。由于时序在生成镜头时一并确定,脚步声、台词和剪辑点都能与动作保持同步。短广告和社交媒体短片生成后即可发布。
需要把猫换成狗、替换绿幕背景,或重写一句对白?MiniMax H3 API 可以对你提供的视频应用这类编辑,涵盖角色、物体、背景、灯光和特效,同时未提及的部分会尽量贴近原片。提示词最长可达 7000 个字符,因此可以把十几项修改叠加到一次处理中。这让基于已批准剪辑版本继续迭代变得切实可行。
将语音样本与你的图像或素材一同发送,生成的角色就会以该音色说话。每个请求最多允许三段音频参考,每段时长为两到十五秒,并且音频必须始终搭配视觉输入,不能单独提交。现有对白也可以被替换,并可调整表演以实现匹配。系列内容可以在每一集里保持同一个可识别的声音。
片段时长为五到十五秒;在 1440p 模式下,短边为 1440 像素,可覆盖 16:9 到 9:16,或在更宽比例下达到约 3.7 megapixels,例如 21:9 的 2976 by 1248。可选择六种宽高比,从电影感的 21:9 到竖屏 9:16,MiniMax H3 API 也可以为你自动选择。这个范围足以覆盖预告片、产品循环视频和竖屏短剧,无需切换模型。
如果源文件直接来自相机或剪辑时间线,可以原样输入:H.264 和 H.265 视频,JPG、PNG、WEBP、HEIC 和 HEIF 静态图像,以及 WAV 和 MP3 音频。单文件限制为视频 50MB、图像 30MB、音频 15MB;通过 URL 传递资源可让请求保持在 64MB 的正文限制内。在 Atlas Cloud 上,整套流程可通过一个 OpenAI-compatible key 运行,并采用 pay-as-you-go billing。
这一组中的每个片段都来自同一个提示词,分别发送给 MiniMax H3 API 以及托管在 Atlas Cloud 上的另外两个视频模型,因此可以在不改动任何一个词的情况下,对比运动表现、声音效果和指令遵循度。
15 秒,16:9 横屏短视频。深夜自助洗衣店的真人实拍画面,融合手绘发光动画,形成混合媒介影像。一间小型自助洗衣店,荧光灯微微闪烁;店内有正在运转的洗衣机、塑料洗衣篮和一张旧长椅,地板上躺着一只袜子。整个空间很安静,带着淡淡的怀旧情绪。画面具有单手手持手机拍摄的质感,能明显感到镜头晃动;白色荧光灯让曝光在明暗之间波动;玻璃表面带有环境反光;镜头靠近物体时会出现对焦滞后。画面不应像商业广告那样精致、有序——整体感觉应像真实的纪录片式抓拍,仿佛你深夜偶然闯入这里,在追逐某种奇异而梦幻的景象时随手拍下了这一幕。
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
第一人称视角 · 眼平高度 · 手持游戏镜头 场景:镜头模拟玩家操作一款现代战争题材 FPS game,双手持突击步枪,沿着军事基地外围缓慢推进。玩家沿掩体旁的道路向前移动,准星扫过前方通道;短暂停顿后,朝远处目标点开火数发,然后继续向前推进——就像一名普通玩家的实机游玩画面。 光照:现代军事基地的冷色自然光与烟雾、枪口火光交织。画面真实清晰,金属武器以及战场上的尘土和薄雾都带有 AAA-game 质感。 镜头运动:玩家移动时,镜头带有轻微的手持晃动——先是缓慢前进,随后小幅左右扫视观察;开火时有细微的后坐力抖动,最后继续稳定向前推进。
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
从品牌影片、竖屏短剧,到产品剪辑、游戏视觉以及对现有素材的精细编辑,MiniMax H3 API 都能通过一次多模态请求覆盖相应场景,并返回带原生立体声音频的视频。
将分镜画面和镜头清单放入一次调用,即可生成 24 FPS 的 1440p 预告片、TVC 广告和时尚大片。每个结果都自带原生立体声音频,品牌团队可直接审看片完成片。
竖屏 9:16 输出可覆盖从古装悬疑到家庭冲突等各类剧本化短剧情节,并在同一次流程中完成对白配音。制作短剧内容库的工作室无需预约演员或搭建场景,就能获得 15 秒的吸睛开场。
如果一个镜头需要特定面孔和动作,最多可使用九张图片、三段视频和三段音频来引导一次调用。角色身份、镜头调度和人声音色都能在多集内容中保持稳定。
后期需要修改?现有视频素材可通过 prompt 进行编辑:替换主体、更换背景、调整光线或改写一句台词,无需重拍任何画面。
产品照片可以动起来:一张参考图即可生成 360 degree 展示、功能讲解或付费社媒短片。支持从 21:9 到 9:16 的画幅比例,让同一组资产适配所有投放版位。
在游戏 CG、角色 PV、动漫片头以及界面演示等场景中,风格化输出依然表现稳定,并能让菜单、HUD 元素和文字叠加保持可读。美术团队可在正式制作前用它进行概念验证。
将 MiniMax H3 API 与 Atlas Cloud 上托管的其他视频模型进行对比,在选择 endpoint 之前,了解输入模态、参考文件限制、时长、分辨率和音频输出的实际差异。
| 模型 | 输入模态 | 最大参考文件数 | 输出时长 | 最高分辨率 | 原生音频 |
|---|---|---|---|---|---|
| MiniMax H3 | 文本、图像、视频、音频 | 9 张图像、3 个视频、3 段音频剪辑,总计 12 个文件 | 5s 至 15s | 24 FPS 下 1440p | √ 每个输出均支持原生立体声音频 |
| Seedance 2.0 Reference-to-Video | 文本、图像、视频、音频 | 9 张图像、3 个视频、3 段音频剪辑 | 最长 15s | 720p | √ 一次生成即可得到立体声对白、音效和音乐 |
| Veo3.1 Reference-to-video | 文本和图像 | 3 张参考图像 | 4s、6s 或 8s | 仅 8s 时长支持 4K | √ 对白、环境声和音效与时间线对齐 |
| Wan-2.7 Reference-to-video | 文本、图像、视频、音频 | 5 张图像或视频剪辑,外加 1 段语音剪辑 | 2s 至 15s | 1080p | √ 可生成音乐和音效,或使用你自己的音频驱动唇形同步 |
| Kling v3.0 Pro Image-to-Video | 文本和图像 | - | 最长 15s | 1080p | √ 支持 5 种语言的多语言对白与唇形同步 |
几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。
在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。
将先进的 MiniMax H3 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。
低延迟:
GPU 优化推理,实现实时响应。
统一 API:
一次集成,畅用 MiniMax H3、GPT、Gemini 和 DeepSeek。
透明定价:
按 Token 计费,支持 Serverless 模式。
开发者体验:
SDK、数据分析、微调工具和模板一应俱全。
可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。
安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。
MiniMax H3 API 让开发者能够以编程方式访问 MiniMax H3。MiniMax H3 是一个开放的通用多模态视频模型,可将文本、图像、视频和音频视为同一个共享上下文。H3 不会把生成、编辑和参考拆分到不同的任务模型中,而是读取完整输入集,并返回带声音的成片。在 Atlas Cloud 上,它通过单个 API key 调用,并采用按量付费定价。
品牌影片、预告片、竖屏短剧、产品和电商广告、游戏与 UI 动效演示,以及风格化动画,都在它的能力范围内。由于该模型能够处理屏幕文字、字幕和品牌素材,团队也会在投入制作预算前,用它进行概念验证、分镜预览和视觉提案。
创建 Atlas Cloud 账号,生成 API key,然后将提示词和任意参考文件发送到视频生成 endpoint,并轮询获取最终结果。建议通过托管 URL 传入媒体,而不是内联上传,因为请求体上限为 64MB。今天就开始构建吧。
计费方式为按量付费,因此你按调用付费,而不是购买订阅或席位许可。成本取决于你实际渲染的内容,也就是说,分辨率和片段时长会决定一个批次的总费用。在规划大规模运行前,请查看模型页面上的当前单次生成费率。
是的。每个 H3 结果都会以原生立体声交付声音,因此对白、音效和环境声会与画面在同一次生成中完成。提供一段参考音频后,模型可以将该音色应用到角色上,从而省去流水线中单独的语音合成步骤。
片段时长为 5 到 15 秒,帧率为 24 FPS。在 1440p 模式下,当宽高比介于 16:9 和 9:16 之间时,短边会渲染为 1440 像素;超出该范围时,画面总像素数约保持在 3.7M,例如 21:9 下为 2976 x 1248。Text to video 和 omni reference 请求支持 21:9、16:9、4:3、1:1、3:4 和 9:16,而首尾帧请求会继承输入图像的宽高比。
一个提示词最多可同时携带九张图像、三个视频片段和三段音频,总文件数上限为十二个。视频和音频各自的合计时长需控制在 15 秒以内,并且音频必须与图像或视频一起提供,不能单独提交。提示词最多 7000 个字符,足以按镜头描述相机、表演和声音等方向。
可接受的输入包括 H.264 和 H.265 视频,JPG、JPEG、PNG、WEBP、HEIC 和 HEIF 图像,以及 WAV 或 MP3 音频;视频文件内的音轨支持 AAC 或 MP3。单文件上限为:视频 50MB、图像 30MB、音频 15MB。由于请求体限制为 64MB,对于较大的素材,使用托管 URL 仍然是更稳妥的方式。
编辑是它的核心模式之一。发送源片段和指令后,MiniMax H3 API 可以替换角色或物体、更换背景和光照、叠加视觉特效,并重写对白,同时保持未修改区域稳定。它可在一个请求中处理复合指令,因此多项修改可以一次完成,而不需要多轮往返。
大多数视频模型接收一个提示词和一张图像,然后返回一个无声片段。H3 则会读取混合参考集,综合理解其中的角色、运动、相机和声音意图,再返回带原生音频的片段。如果你当前的流水线需要把视频模型、语音模型和编辑器串接在一起,H3 可以把这些阶段压缩为一次调用。
指南、教程与产品动态,助你充分发挥 Atlas Cloud 的价值。