仅限两周 | Seedream 5.0 Pro 立享 8 折!
Hero background 1Hero background 2

MiniMax H3 API for Video Generation and Editing

The MiniMax H3 API opens MiniMax's general purpose multimodal video model, which reads text, images, video and audio as one context instead of one task at a time. Clips run 5 to 15 seconds at 24 FPS across aspect ratios from 21:9 to 9:16, and one prompt can swap characters, replace backgrounds, rewrite dialogue or clone a voice from a reference clip. Atlas Cloud serves it all through one OpenAI-compatible endpoint. Start building today.

探索领先模型

Atlas Cloud 为您提供最新的行业领先创意模型。

从文本到九个参考:MiniMax H3 API 模态

每个 MiniMax H3 API 端点对文本、图像、视频和音频的读取方式各不相同,因此请浏览下方各行,并将模态与正在构建的内容相匹配。

模态描述
MiniMax H3 T2V API(文本生成视频)编写最长 7,000 个字符的提示词,模型会返回一段 5 到 15 秒、24 FPS、1440p 的视频片段,并在同一次生成中生成原生立体声。每次请求都可在 21:9、16:9、4:3、1:1、3:4 和 9:16 之间设置宽高比,因此一次调用即可覆盖电影感预告片和竖屏社交媒体剪辑等场景。
MiniMax H3 I2V API(图像生成视频)使用一张图像可设定开场帧,使用两张图像则可同时锁定首帧和尾帧,由 H3 按输入图像的宽高比补全其间的运动。支持每边 256 到 5760 像素的源图像,因此可以轻松让关键视觉、产品静帧和分镜帧动起来。
MiniMax H3 Omni Reference API(参考生成视频)需要让多个素材协同工作?在单次请求中,在 12 个文件的上限内,最多可放入九张图像、三段视频片段和三条音轨,并作为一个多模态上下文整体读取。你可以在多个镜头间延续角色、镜头运动或声音音色,也可以通过替换主体、背景和台词来编辑现有片段。

一次 MiniMax H3 API 调用,集画面、声音与剪辑于一体

MiniMax H3 API 返回的每个片段最长可达十五秒,支持 1440p,并带有原生立体声;可由文本、图像、视频和语音参考的任意组合生成,同一次调用还能编辑你已有素材中的角色、场景和对白。

十二个参考文件,一次 MiniMax H3 API 调用

一次 MiniMax H3 API 请求最多可接收九张参考图像、三个视频片段和三条音轨,总数上限为十二个文件。模型不会把它们当作彼此独立的输入槽位,而是将文本、画面和声音视为同一个上下文:从照片中提取角色,从片段中借鉴镜头运动,从音轨中吸收情绪,并融合到同一个场景里。已有素材的团队可以更直接地得到成片镜头。

每个片段都内置原生立体声

每个生成结果都自带声音。对白、环境声和音乐会在渲染 24 frames per second 画面的同一流程中以原生立体声生成,因此后期无需再配乐或配音。由于时序在生成镜头时一并确定,脚步声、台词和剪辑点都能与动作保持同步。短广告和社交媒体短片生成后即可发布。

通过 MiniMax H3 API 进行提示词级编辑

需要把猫换成狗、替换绿幕背景,或重写一句对白?MiniMax H3 API 可以对你提供的视频应用这类编辑,涵盖角色、物体、背景、灯光和特效,同时未提及的部分会尽量贴近原片。提示词最长可达 7000 个字符,因此可以把十几项修改叠加到一次处理中。这让基于已批准剪辑版本继续迭代变得切实可行。

声音音色迁移与对白替换

将语音样本与你的图像或素材一同发送,生成的角色就会以该音色说话。每个请求最多允许三段音频参考,每段时长为两到十五秒,并且音频必须始终搭配视觉输入,不能单独提交。现有对白也可以被替换,并可调整表演以实现匹配。系列内容可以在每一集里保持同一个可识别的声音。

MiniMax H3 API 支持 1440p 与六种宽高比

片段时长为五到十五秒;在 1440p 模式下,短边为 1440 像素,可覆盖 16:9 到 9:16,或在更宽比例下达到约 3.7 megapixels,例如 21:9 的 2976 by 1248。可选择六种宽高比,从电影感的 21:9 到竖屏 9:16,MiniMax H3 API 也可以为你自动选择。这个范围足以覆盖预告片、产品循环视频和竖屏短剧,无需切换模型。

直接接收生产格式,无需转换步骤

如果源文件直接来自相机或剪辑时间线,可以原样输入:H.264 和 H.265 视频,JPG、PNG、WEBP、HEIC 和 HEIF 静态图像,以及 WAV 和 MP3 音频。单文件限制为视频 50MB、图像 30MB、音频 15MB;通过 URL 传递资源可让请求保持在 64MB 的正文限制内。在 Atlas Cloud 上,整套流程可通过一个 OpenAI-compatible key 运行,并采用 pay-as-you-go billing。

同一提示词,三款引擎:MiniMax H3 API 正面对比

这一组中的每个片段都来自同一个提示词,分别发送给 MiniMax H3 API 以及托管在 Atlas Cloud 上的另外两个视频模型,因此可以在不改动任何一个词的情况下,对比运动表现、声音效果和指令遵循度。

提示词

15 秒,16:9 横屏短视频。深夜自助洗衣店的真人实拍画面,融合手绘发光动画,形成混合媒介影像。一间小型自助洗衣店,荧光灯微微闪烁;店内有正在运转的洗衣机、塑料洗衣篮和一张旧长椅,地板上躺着一只袜子。整个空间很安静,带着淡淡的怀旧情绪。画面具有单手手持手机拍摄的质感,能明显感到镜头晃动;白色荧光灯让曝光在明暗之间波动;玻璃表面带有环境反光;镜头靠近物体时会出现对焦滞后。画面不应像商业广告那样精致、有序——整体感觉应像真实的纪录片式抓拍,仿佛你深夜偶然闯入这里,在追逐某种奇异而梦幻的景象时随手拍下了这一幕。

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

提示词

第一人称视角 · 眼平高度 · 手持游戏镜头 场景:镜头模拟玩家操作一款现代战争题材 FPS game,双手持突击步枪,沿着军事基地外围缓慢推进。玩家沿掩体旁的道路向前移动,准星扫过前方通道;短暂停顿后,朝远处目标点开火数发,然后继续向前推进——就像一名普通玩家的实机游玩画面。 光照:现代军事基地的冷色自然光与烟雾、枪口火光交织。画面真实清晰,金属武器以及战场上的尘土和薄雾都带有 AAA-game 质感。 镜头运动:玩家移动时,镜头带有轻微的手持晃动——先是缓慢前进,随后小幅左右扫视观察;开火时有细微的后坐力抖动,最后继续稳定向前推进。

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

MiniMax H3 API 在生产环境中的适用场景

从品牌影片、竖屏短剧,到产品剪辑、游戏视觉以及对现有素材的精细编辑,MiniMax H3 API 都能通过一次多模态请求覆盖相应场景,并返回带原生立体声音频的视频。

基于 MiniMax H3 API 的电影感品牌影片

将分镜画面和镜头清单放入一次调用,即可生成 24 FPS 的 1440p 预告片、TVC 广告和时尚大片。每个结果都自带原生立体声音频,品牌团队可直接审看片完成片。

竖屏短剧制作

竖屏 9:16 输出可覆盖从古装悬疑到家庭冲突等各类剧本化短剧情节,并在同一次流程中完成对白配音。制作短剧内容库的工作室无需预约演员或搭建场景,就能获得 15 秒的吸睛开场。

多参考镜头组装

如果一个镜头需要特定面孔和动作,最多可使用九张图片、三段视频和三段音频来引导一次调用。角色身份、镜头调度和人声音色都能在多集内容中保持稳定。

使用 MiniMax H3 API 编辑现有素材

后期需要修改?现有视频素材可通过 prompt 进行编辑:替换主体、更换背景、调整光线或改写一句台词,无需重拍任何画面。

产品与电商营销

产品照片可以动起来:一张参考图即可生成 360 degree 展示、功能讲解或付费社媒短片。支持从 21:9 到 9:16 的画幅比例,让同一组资产适配所有投放版位。

用于游戏和动漫视觉的 MiniMax H3 API

在游戏 CG、角色 PV、动漫片头以及界面演示等场景中,风格化输出依然表现稳定,并能让菜单、HUD 元素和文字叠加保持可读。美术团队可在正式制作前用它进行概念验证。

MiniMax H3 API 与其他多模态视频模型对比

将 MiniMax H3 API 与 Atlas Cloud 上托管的其他视频模型进行对比,在选择 endpoint 之前,了解输入模态、参考文件限制、时长、分辨率和音频输出的实际差异。

模型输入模态最大参考文件数输出时长最高分辨率原生音频
MiniMax H3文本、图像、视频、音频9 张图像、3 个视频、3 段音频剪辑,总计 12 个文件5s 至 15s24 FPS 下 1440p√ 每个输出均支持原生立体声音频
Seedance 2.0 Reference-to-Video文本、图像、视频、音频9 张图像、3 个视频、3 段音频剪辑最长 15s720p√ 一次生成即可得到立体声对白、音效和音乐
Veo3.1 Reference-to-video文本和图像3 张参考图像4s、6s 或 8s仅 8s 时长支持 4K√ 对白、环境声和音效与时间线对齐
Wan-2.7 Reference-to-video文本、图像、视频、音频5 张图像或视频剪辑,外加 1 段语音剪辑2s 至 15s1080p√ 可生成音乐和音效,或使用你自己的音频驱动唇形同步
Kling v3.0 Pro Image-to-Video文本和图像-最长 15s1080p√ 支持 5 种语言的多语言对白与唇形同步

如何在 Atlas Cloud 上使用 MiniMax H3

几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。

创建 Atlas Cloud 账户

在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。

为何在 Atlas Cloud 使用 MiniMax H3

将先进的 MiniMax H3 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。

性能与灵活性

低延迟:
GPU 优化推理,实现实时响应。

统一 API:
一次集成,畅用 MiniMax H3、GPT、Gemini 和 DeepSeek。

透明定价:
按 Token 计费,支持 Serverless 模式。

企业与规模

开发者体验:
SDK、数据分析、微调工具和模板一应俱全。

可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。

安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。

MiniMax H3 API:开发者答疑

MiniMax H3 API 让开发者能够以编程方式访问 MiniMax H3。MiniMax H3 是一个开放的通用多模态视频模型,可将文本、图像、视频和音频视为同一个共享上下文。H3 不会把生成、编辑和参考拆分到不同的任务模型中,而是读取完整输入集,并返回带声音的成片。在 Atlas Cloud 上,它通过单个 API key 调用,并采用按量付费定价。

品牌影片、预告片、竖屏短剧、产品和电商广告、游戏与 UI 动效演示,以及风格化动画,都在它的能力范围内。由于该模型能够处理屏幕文字、字幕和品牌素材,团队也会在投入制作预算前,用它进行概念验证、分镜预览和视觉提案。

创建 Atlas Cloud 账号,生成 API key,然后将提示词和任意参考文件发送到视频生成 endpoint,并轮询获取最终结果。建议通过托管 URL 传入媒体,而不是内联上传,因为请求体上限为 64MB。今天就开始构建吧。

计费方式为按量付费,因此你按调用付费,而不是购买订阅或席位许可。成本取决于你实际渲染的内容,也就是说,分辨率和片段时长会决定一个批次的总费用。在规划大规模运行前,请查看模型页面上的当前单次生成费率。

是的。每个 H3 结果都会以原生立体声交付声音,因此对白、音效和环境声会与画面在同一次生成中完成。提供一段参考音频后,模型可以将该音色应用到角色上,从而省去流水线中单独的语音合成步骤。

片段时长为 5 到 15 秒,帧率为 24 FPS。在 1440p 模式下,当宽高比介于 16:9 和 9:16 之间时,短边会渲染为 1440 像素;超出该范围时,画面总像素数约保持在 3.7M,例如 21:9 下为 2976 x 1248。Text to video 和 omni reference 请求支持 21:9、16:9、4:3、1:1、3:4 和 9:16,而首尾帧请求会继承输入图像的宽高比。

一个提示词最多可同时携带九张图像、三个视频片段和三段音频,总文件数上限为十二个。视频和音频各自的合计时长需控制在 15 秒以内,并且音频必须与图像或视频一起提供,不能单独提交。提示词最多 7000 个字符,足以按镜头描述相机、表演和声音等方向。

可接受的输入包括 H.264 和 H.265 视频,JPG、JPEG、PNG、WEBP、HEIC 和 HEIF 图像,以及 WAV 或 MP3 音频;视频文件内的音轨支持 AAC 或 MP3。单文件上限为:视频 50MB、图像 30MB、音频 15MB。由于请求体限制为 64MB,对于较大的素材,使用托管 URL 仍然是更稳妥的方式。

编辑是它的核心模式之一。发送源片段和指令后,MiniMax H3 API 可以替换角色或物体、更换背景和光照、叠加视觉特效,并重写对白,同时保持未修改区域稳定。它可在一个请求中处理复合指令,因此多项修改可以一次完成,而不需要多轮往返。

大多数视频模型接收一个提示词和一张图像,然后返回一个无声片段。H3 则会读取混合参考集,综合理解其中的角色、运动、相机和声音意图,再返回带原生音频的片段。如果你当前的流水线需要把视频模型、语音模型和编辑器串接在一起,H3 可以把这些阶段压缩为一次调用。

探索更多系列

Seedance 2.0

Seedance 2.0 API 为您提供 ByteDance 多模态视频模型的生产级访问权限——支持四模态输入(文本、图像、视频、音频),以及行业领先的“Universal Reference”(通用参考)系统,可在不同镜头间锁定构图、运镜和角色动作。只需一次 API 调用即可集成导演级控制,固定费率为 $0.09/秒,即时获取密钥,无需排队——由企业级正常运行时间和合规性提供保障。Seedance 2.0 原生 4K 现已上线!

查看系列

GPT Image 2

GPT Image 2 API 为开发者提供了访问 OpenAI 最新图像模型的途径,它是 GPT Image 1.5 的继任者。该模型可生成和编辑图像,能够在拉丁和 CJK 文字上实现准确的文本渲染,并在海报、样机和信息图表方面具备强大的排版能力。在 Atlas Cloud 上,您可以通过一个统一的 API 与 300 多个模型一起访问它,并享受免费额度、99.99% 的正常运行时间,且无需 OpenAI 组织验证。

查看系列

Seedream 5.0 Pro

Seedream 5.0 Pro API 为开发者在 Atlas Cloud 上提供了字节跳动的可控图像编辑模型。它通过锚点和坐标精确定位编辑,将图像分离为可编辑图层,融合多个参考,并精准匹配颜色和材质,支持 2K 和 3K 分辨率的多语言文本。在 Atlas Cloud 上,您只需一个密钥即可访问!

查看系列

Gemini Omni Flash

Gemini Omni API 将 Google DeepMind 在 Google I/O 2026 上发布的多模态视频生成与编辑模型带入你的技术栈。Gemini Omni 将 Gemini 的推理引擎与生成式媒体融合,可接受文本、图像、视频和音频的任意组合输入,生成一致且以知识为依据的输出。通过自然对话不断打磨结果:替换物体、重写场景、切换风格,同时保持物理规律、角色形象和画面连贯性不变。Atlas Cloud 通过统一的 API 提供完整的 Gemini Omni Flash 系列——文生视频、支持最多 7 张参考图的图生视频,以及参考图生视频——按秒计费、价格透明,低至 $0.112 起,且无需订阅。立即开始构建。

查看系列

Grok Imagine

Grok Imagine API 为开发者提供 xAI 的图像、视频和音频生成一站式套件。它可以生成分辨率高达 2K 且支持多语言文本渲染的图像,以及长达 15 秒且带有原生同步音频和基于参考图像编辑功能的视频。在 Atlas Cloud 上,只需一个密钥即可运行每个 Grok Imagine 模式,因此您可以在图像、视频和音频之间无缝切换,无需单独设置,每张图像 0.02 美元起,每秒 0.05 美元起。

查看系列

Google

Google最强大的创意模型现已在Atlas Cloud上全面可用。Veo 3.1提供电影级别的视频生成,Nano Banana 2支持高保真图像创建,而Gemini为每个工作流带来多模态智能。通过单一API key即可访问完整的Google模型套件,提供Day-0可用性和按需付费(pay-as-you-go)定价。

查看系列

Seedance 2.0 Mini

Seedance 2.0 Mini 将 ByteDance 的多模态视频生成技术引入到对速度和成本要求极高的工作流中。它以更轻量的占用空间提供 Seedance 2.0 的核心能力——更快的生成速度、更低的单条视频成本,并且使用您现有的同款 API 集成。对于运行高吞吐量流水线或进行大规模原型设计的团队来说,Mini 是最实用的默认选择。

查看系列

ByteDance

从电影级视频生成到高保真图像创建,ByteDance 最强大的模型现已在 Atlas Cloud 上线。以最低的推理定价和零基础设施开销,大规模运行 Seedance 和 Seedream。

查看系列

Alibaba

Atlas Cloud 将 Alibaba 的全系模型阵容整合至同一个 API 中:Qwen 用于语言和图像任务,Wan 用于高达 1080p 的视频生成。所有模型均采用按需付费模式,无需订阅。您可以使用现有的 OpenAI 兼容客户端,通过单一的 base URL 访问 Alibaba API。

查看系列

OpenAI

Atlas Cloud 为您提供访问完整 OpenAI API 产品线的权限,从用于图像生成的 GPT Image 2 到用于视频的 Sora 2。每个模型均采用按需付费模式,无月度消费限制。使用兼容 OpenAI 的 API,只需简单替换基础 URL 即可轻松接入。

查看系列

xAI

在 Atlas Cloud 上使用 xAI API 构建完整的图像和视频处理工作流。以 2K 分辨率生成、使用参考图像进行编辑,并将图像动画化为音画同步的视频片段。

查看系列

Kwaivgi

Kwaivgi API 价格低于标准定价 15%。Atlas Cloud 提供对最新 Kling 版本的零日(Day-0)访问权限,采用按需付费定价且无席位限制。一个账户,一个密钥,畅享从标准版到大师版的所有 Kling 模型。

查看系列

一个 API,畅享全模态 AI。

探索全部模型