

MiniMax H3 是 MiniMax 的视频模型系列,支持文本、图像和参考图驱动的生成。创建 5 至 15 秒的视频片段,使用可选的末帧引导运动,保留参考图像中的主体;如果生成音频符合工作流,也可以选择 H3 Developer。Atlas Cloud 将 H3、H3 Fast、H3 Max 和 H3 Developer 纳入统一的 API 工作流,标准价格从 $0.038/秒起。立即开始构建。
MiniMax H3 由 MiniMax 开发。Atlas Cloud(由 Atlas Cloud AI LLC 运营)仅提供接入服务,并不拥有该模型。所有商标均归其各自所有者所有。
Atlas Cloud 为您提供最新的行业领先创意模型。
根据分辨率、时长、音频能力、宽高比和标准价格,将 MiniMax H3、H3 Fast、H3 Max 和 H3 Developer 端点与文本、图像或参考输入进行匹配。
| 模态 | 描述 |
|---|---|
| MiniMax H3 Max T2V API (Text to Video) | 输入文本提示词,即可生成 480P 或 768P 的电影感视频,时长为 5 至 15 秒。支持 16:9、9:16、1:1 或自适应画面,适用于广告、预告片和社交媒体内容,标准价格为每秒 $0.05。 |
| MiniMax H3 Max I2V API (Image to Video) | 以首帧图像开始,通过文本提示词控制动画,也可选用末帧来控制最终构图。输出分辨率为 480P 或 768P,时长为 5 至 15 秒,适合产品动态展示、主视觉动画和分镜过渡,价格为每秒 $0.05。 |
| MiniMax H3 Fast T2V API (Text to Video) | 针对文本驱动的 480P 制作,MiniMax H3 Fast 可生成时长为 5 至 15 秒的电影感片段。16:9、9:16、1:1 和自适应选项支持快速制作概念视频及适配不同平台的内容,标准价格为每秒 $0.046。 |
| MiniMax H3 Fast I2V API (Image to Video) | 通过提示词控制运动,为提供的首帧图像添加动画;当结尾需要视觉引导时,还可添加可选的末帧。该端点支持 480P、5 至 15 秒输出,适合产品演示、艺术作品动画和短篇社交媒体素材,价格为每秒 $0.046。 |
| MiniMax H3 Fast Reference to Video API | 保留参考图像中的主体,同时由文本提示词定义生成的 480P 视频。该 5 至 15 秒的端点适合制作连续出现的角色、具有辨识度的产品和风格一致的营销视觉内容,标准价格为每秒 $0.046。 |
| MiniMax H3 Developer T2V API (Text to Video) | 通过自托管的 MiniMax H3 Developer 端点,将文本提示词转换为带生成音频的视频。支持选择 480P、768P 或 2K 输出,并提供 16:9、9:16 或 1:1 画面比例,适用于叙事概念、营销预览和社交媒体制作,价格为每秒 $0.05。 |
| MiniMax H3 Developer I2V API (Image to Video) | 提供开场图像、可选的末帧和文本提示词,即可创建带生成音频的动态内容。480P、768P 和 2K 输出选项使这一自托管端点适合制作主视觉动画、产品场景和分镜序列,价格为每秒 $0.05。 |
| MiniMax H3 Developer Reference to Video API | 当内容连续性依赖现有媒体时,可使用一张或多张参考图像或视频,在新的视频提示词引导下保留主体,并生成带音频的视频。支持 480P、768P 或 2K 输出,适用于连续角色和相互衔接的品牌序列,标准价格为每秒 $0.05。 |
| MiniMax H3 T2V API (Text to Video) | 将文本提示词转换为电影感 2K 视频,时长可选择 5 至 15 秒。每个结果都可设置为 16:9、9:16、1:1 或自适应宽高比,适用于精致的预告片、竖屏故事和营销素材,价格为每秒 $0.038。 |
| MiniMax H3 I2V API (Image to Video) | 将首帧图像与文本提示词结合,并可按需添加可选的末帧,以 2K 分辨率赋予画面生命。5 至 15 秒的输出时长适合产品展示、角色动画和经过规划的视觉过渡,标准价格为每秒 $0.038。 |
| MiniMax H3 Reference to Video API | 参考图像引导的生成会保留输入图像中的主体,同时由提示词控制最终的 2K 视频。片段时长为 5 至 15 秒,适合角色聚焦场景和风格一致的产品视觉内容,价格为每秒 $0.038。 |
MiniMax H3 API 返回的每段视频最长可达 15 秒、分辨率为 1440p,并原生支持立体声;它可以混合使用文本、图像、视频和声音参考生成内容,同一次调用还能够编辑现有素材中的角色、场景和对白。
一次 MiniMax H3 API 请求最多可接收 9 张参考图像、3 段视频和 3 条音轨,总数上限为 12 个文件。模型不会把它们视为彼此独立的输入槽位,而是将文本、画面与声音整合为一个上下文:从照片中提取角色,从视频片段中提取镜头运动,再从音轨中提取情绪,并将这些元素融入同一场景。对于已有素材的团队来说,这提供了直达成片镜头的路径。
每个生成结果都自带声音。对白、环境音和音乐会与画面一起,在 24 帧每秒的渲染过程中以原生立体声生成,无需事后配乐或配音。由于节奏在镜头生成时就已确定,脚步声、对白和剪辑都能与动作保持同步。短广告和社交媒体视频生成后即可发布。
想把猫换成狗、替换绿幕,或重写一句对白?MiniMax H3 API 可以对你提供的视频执行这类编辑,涵盖角色、物体、背景、光照和特效;对于未提及的部分,则尽量保持原样。提示词最多支持 7000 个字符,因此可以在一次处理中叠加十几项修改,让已获批准版本的迭代变得切实可行。
将声音样本与图像或视频素材一同发送,生成角色就会使用该音色进行说话。每次请求最多允许 3 条声音参考,每条时长为 2 至 15 秒;声音必须始终与视觉输入一起提供,不能单独提交。现有对白也可以替换,并调整表演以实现匹配。对于系列内容制作,这有助于让每一集都保持统一且易于识别的声音。
视频时长为 5 至 15 秒;在 1440p 模式下,短边可在 16:9 至 9:16 之间达到 1440 像素,较宽画幅(例如 21:9 的 2976 × 1248)约为 3.7 百万像素。可选画幅比例共有 6 种,从电影感的 21:9 到竖屏 9:16 均可覆盖,MiniMax H3 API 也能为你自动选择。无需切换模型,就能满足预告片、产品循环视频和竖屏剧集等不同需求。
如果源文件直接来自摄像机或剪辑时间线,可以按原格式提交:H.264 和 H.265 视频,JPG、PNG、WEBP、HEIC 和 HEIF 静态图像,以及 WAV 和 MP3 音频。单文件限制分别为视频 50MB、图像 30MB、音频 15MB;通过 URL 传递素材则可将请求控制在 64MB 的请求体限制内。在 Atlas Cloud 上,整套素材只需通过一个 OpenAI 兼容密钥处理,并按用量计费。
这一组中的每个片段都来自同一个提示词,分别发送给 MiniMax H3 API 以及托管在 Atlas Cloud 上的另外两个视频模型,因此可以在不改动任何一个词的情况下,对比运动表现、声音效果和指令遵循度。
15 秒,16:9 横屏短视频。深夜自助洗衣店的真人实拍画面,融合手绘发光动画,形成混合媒介影像。一间小型自助洗衣店,荧光灯微微闪烁;店内有正在运转的洗衣机、塑料洗衣篮和一张旧长椅,地板上躺着一只袜子。整个空间很安静,带着淡淡的怀旧情绪。画面具有单手手持手机拍摄的质感,能明显感到镜头晃动;白色荧光灯让曝光在明暗之间波动;玻璃表面带有环境反光;镜头靠近物体时会出现对焦滞后。画面不应像商业广告那样精致、有序——整体感觉应像真实的纪录片式抓拍,仿佛你深夜偶然闯入这里,在追逐某种奇异而梦幻的景象时随手拍下了这一幕。
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
第一人称视角 · 眼平高度 · 手持游戏镜头 场景:镜头模拟玩家操作一款现代战争题材 FPS game,双手持突击步枪,沿着军事基地外围缓慢推进。玩家沿掩体旁的道路向前移动,准星扫过前方通道;短暂停顿后,朝远处目标点开火数发,然后继续向前推进——就像一名普通玩家的实机游玩画面。 光照:现代军事基地的冷色自然光与烟雾、枪口火光交织。画面真实清晰,金属武器以及战场上的尘土和薄雾都带有 AAA-game 质感。 镜头运动:玩家移动时,镜头带有轻微的手持晃动——先是缓慢前进,随后小幅左右扫视观察;开火时有细微的后坐力抖动,最后继续稳定向前推进。
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
从使用 MiniMax H3 Fast 制作的 480P 草稿,推进到 2K 宣传片镜头和由 H3 Developer 支持音频的创意概念;MiniMax H3 系列覆盖产品动态、社交媒体变体、系列角色和分镜预览,并支持通过文本、图像或参考内容生成。
MiniMax H3 Fast 可将文本提示词转换为时长 5 到 15 秒的 480P 视频片段。社交媒体团队可以先测试宣传活动的吸引点、节奏和画幅比例,再决定是否投入更高分辨率的制作。
通过图像路由为首帧添加动画,还可以选择使用尾帧引导结尾。商品运营团队可以基于已批准的静帧制作产品展示、目录动态内容和发布素材。
当宣传活动需要高分辨率输出时,选择 2K MiniMax H3 路由。代理机构可以通过文本或图像制作精致的主视觉镜头、电影感产品瞬间和高分辨率社交媒体素材。
提供一张参考图像,在由提示词指导新视频片段的同时,保持主体的辨识度。工作室可以制作系列角色短片、连贯的宣传内容和品牌产品场景,获得更强的视觉连续性。
需要根据一份简报生成横屏、方形和竖屏预览?文本生成支持 16:9、1:1、9:16 或自适应构图,帮助创意团队为多个投放位置准备分镜方案,而无需切换模型系列。
使用 MiniMax H3 Developer,根据文本提示词或源图像生成带音频的视频。创意团队可以设计提案片段、角色瞬间和宣传活动概念,让画面与声音在同一工作流中协同完成。
对比 MiniMax H3 文生视频变体与其他 Atlas Cloud 模型在最高分辨率、片段时长、宽高比和标示标准价格方面的表现。
| 模型 | 最高分辨率 | 片段时长 | 宽高比 | 标示基础价格 |
|---|---|---|---|---|
| MiniMax H3 Text-to-Video | 2K | 5 至 15 秒 | 16:9、9:16、1:1、自适应 | 每秒 $0.038 |
| MiniMax H3 Fast Text-to-Video | 480P | 5 至 15 秒 | 16:9、9:16、1:1、自适应 | 每秒 $0.046 |
| MiniMax H3 Max Text-to-Video | 768P | 5 至 15 秒 | 16:9、9:16、1:1、自适应 | 每秒 $0.05 |
| MiniMax H3-Developer Text-to-Video | 2K | - | 16:9、9:16、1:1 | 每秒 $0.05 |
| Kling V3.0 Turbo Text-to-Video | 1080p | 3 至 15 秒 | 16:9、9:16、1:1 | $0.112 |
| Veo 3.1 Lite Text-to-video | 1080p | 4、6 或 8 秒 | 16:9、9:16 | $0.05 |
几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。
在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。
将先进的 MiniMax H3 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。
低延迟:
GPU 优化推理,实现实时响应。
统一 API:
一次集成,畅用 MiniMax H3、GPT、Gemini 和 DeepSeek。
透明定价:
按 Token 计费,支持 Serverless 模式。
开发者体验:
SDK、数据分析、微调工具和模板一应俱全。
可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。
安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。
MiniMax H3 是 MiniMax 的视频模型系列,可根据文本、图像和参考媒体生成视频片段。在 Atlas Cloud 上,该系列包含标准 H3、H3 Fast、H3 Max 和 H3 Developer,支持文生视频、图生视频以及部分参考生视频路线。根据所选模型的不同,可用输出规格范围为 480P 至 2K。
你可以从文本提示词开始生成视频,使用首帧并可选添加尾帧来控制动画效果,或通过支持的参考生视频路线保持主体一致。H3 Developer 还可以随视频生成音频,而每个变体都有各自的路线、分辨率和参数限制。
创建 Atlas Cloud 账户和 API 密钥,然后选择准确的模型 ID,并查看该模型当前的参数结构。通过 Atlas Cloud 兼容 OpenAI 的 API 发送请求,并在应用中处理返回的视频。立即开始构建。
MiniMax H3 Fast 提供 480P 的文生视频、图生视频和参考生视频路线,可生成时长为 5 至 15 秒的视频片段。标准价格为每生成 1 秒 $0.046,图像路线接受首帧,并可选添加尾帧。当你的项目需要 480P 输出,并且需要支持这三种输入工作流时,可以选择它。
当工作流需要 2K 输出时,选择标准 H3。480P 文本、图像或参考输入请选择 H3 Fast;480P 或 768P 的文本和图像生成请选择 H3 Max;需要 480P、768P 或 2K 工作流并生成音频时,选择 H3 Developer。
图生视频路线接受首帧,也可以选择尾帧来引导结尾效果。标准 H3、H3 Fast 和 H3 Developer 均支持参考生视频,但支持的参考输入会因 endpoint 而异。目前,H3 Max 在 Atlas Cloud 上提供文本和图像路线。
标准 H3 输出时长为 5 至 15 秒的 2K 视频片段;H3 Fast 在相同的时长范围内支持 480P;H3 Max 支持 480P 或 768P,时长同样为 5 至 15 秒。在文生视频场景中,这三个变体支持 16:9、9:16、1:1 和自适应画幅,而 H3 Developer 支持 16:9、9:16 和 1:1。请检查所选 endpoint 的结构,因为图像和参考路线可能提供不同的控制参数。
计费依据是每次生成的视频秒数。标准价格为:H3 每秒 $0.038,H3 Fast 每秒 $0.046,H3 Max 或 H3 Developer 每秒 $0.05。你可以将所选路线的标准费率乘以输出时长,估算一次请求的费用。
不会。经过验证的 Atlas Cloud 配置明确包含 H3 Developer 文本、图像和参考路线的音频生成功能,但没有说明标准 H3、H3 Fast 或 H3 Max 支持音频。当音频必须属于文档明确支持的输出时,请选择 H3 Developer。
首先确认模型 ID 与预期的文本、图像或参考路线匹配。根据该 endpoint 当前的结构验证所有必填字段,尤其是提示词、媒体输入、分辨率、时长和宽高比。如果请求仍然失败,请先检查返回的错误信息,再进行重试,不要重复提交相同的无效负载。
指南、教程与产品动态,助你充分发挥 Atlas Cloud 的价值。