仅限两周 | Seedream 5.0 Pro 立享 8 折!

MiniMax H3 已上线:原生2K视频、一次生成、更低的每秒成本

MiniMax H3 已在 Atlas Cloud 上线:原生 2K 视频与立体声音频一次性生成。查看实时按秒计费、三个 API 入口以及可直接复制的提示词。

更高分辨率通常意味着更高价格。MiniMax H3 悄悄打破了这一规则。它直接渲染原生 2K 分辨率,每秒价格低于大多数人首选视频模型上 720p 片段的成本。

 

 

这是标题,但分辨率和价格只是 MiniMax H3 有趣的一半。另一半是其工作原理:一个模型同时读取文本、图像、视频和音频,并在单次通过中返回一个完整的片段、画面和声音。以下是它的功能、成本以及本文中每个片段所对应的精确提示词。

关键要点

  • MiniMax H3 渲染原生 2K(2560×1440)分辨率,并在同一过程中生成同步立体声配乐,而非后期拼接。
  • 模型页面(2026 年 7 月)已验证价格:2K 为每秒 0.14 美元,768p 为每秒 0.10 美元。作为对比,Seedance 2.0 在 720p 下约为每秒 0.24 美元,因此 H3 以更低单价提供了更高分辨率的画面。
  • 三个入口(文本、图像和视频参考)共享一个 API 密钥。参考到视频模式最多可接受九个混合图像、片段和一条音轨作为身份锚点。

MiniMax H3 单次完成,而非三款工具

制作一个成品片段通常需要分步完成。在一个模型中生成画面,切换到第二个模型生成音频,然后打开编辑器将两者对齐。每次交接都会损失一点原始意图,时间线也会迅速累积。

MiniMax H3 将这一切整合。它将整个需求作为单一上下文读取:角色的外观、运动的方式、镜头的移动、情感基调以及声音应有的感觉,全部一起输入,并作为一个片段返回。MiniMax 将这一方向定位为从任务专用模型向通用多模态智能的转变,在实践中意味着同时打开的工具更少。

有两件事值得明确说明,因为两者都可以在输出中轻松验证。首先,片段带有真实声音:下方的展示文件在输出时已内置立体声音轨,而非后期添加。其次,分辨率是真正的 2K,2560×1440,24 帧每秒,而非上采样。

在 Atlas Cloud 上运行 MiniMax H3 的三种方式

MiniMax H3 已在 Atlas Cloud 上上线,提供三个入口,且所有入口都使用同一个 API 密钥。每个入口都有一个 Playground,您可以在编写代码之前直接在浏览器中试用。

入口驱动方式输入最适合
文本到视频仅文本提示词无参考素材从零构建场景
图片到视频首帧,可选末帧一张或两张静态图像将已有固定帧动画化
参考到视频文本提示词加参考素材最多 9 个混合图像、视频片段和一条音轨在片段中保持角色、产品或风格一致

参考到视频路径最为灵活。它将您的参考素材视为身份锚点,因此角色、产品或外观保持一致,而提示词则将其置于新的场景和运动中。您可以混合图像和视频片段,并添加一条音轨来使动作与节拍同步。至少需要一张图像或一个视频片段;单独的音轨不被允许。

由于平台上的所有模型共享同一个调用约定,从其他视频模型切换到 H3 只需更改 model 字段。认证、轮询和结果检索保持不变,这是在一个密钥和一张账单下运行视频、图像、音频和语言模型的隐性好处。

MiniMax H3 的成本:2K、768p 及与 Seedance 的对比

MiniMax H3 按生成视频的每秒时长和分辨率收费。以下数据直接来自模型页面,于 2026 年 7 月 31 日核实。

分辨率每秒成本一个 8 秒片段
2K(2560×1440)0.14 美元1.12 美元
768p0.10 美元0.80 美元

这里有一个乍看反直觉的部分。H3 的原生 2K 每秒成本为 0.14 美元。作为对比,平台上的另一款旗舰视频模型 Seedance 2.0 在 720p 下收费约为每秒 0.24 美元。因此,H3 以更低每秒价格提供了更高分辨率的画面,而 Seedance 上更低分辨率的片段成本更高。分辨率提升,单价下降,同时实现。

一个关于价格的诚实说明,以免预算出错。H3 的价格没有促销活动。目前平台上运行的 20% 折扣是针对 Seedream 5.0 Pro 图像模型,而非 H3,因此截至 2026 年 7 月下旬,2K 每秒 0.14 美元是标准费率。768p 层级标价为每秒 0.10 美元;2K 是当前已上线并可调用的层级。

MiniMax H3 提示手册:可直接复制的展示

以下每个片段均由旁边印出的提示词生成。复制一个,替换您自己的参考素材,然后运行。每个区块还显示了输入的参考图像,按提示词调用的顺序(图像 1、图像 2 等)。

品牌影片与影视内容

预告片、电视广告和品牌质感影片是最直接的适用场景,因为它们能以最少的返工融入现有内容制作流程。

参考输入,图像 1 用于氛围和风格,图像 2 用于主角: 面对巨大传送门的剪影,文字为 The Stars Were Listening 参考图像 1,整体氛围和风格 一位穿着长炭灰色大衣的女性的多个视角 参考图像 2,主角

 

 

Plain
1写实电影感,高对比度光影,节奏紧凑。图像1为整体氛围和风格参考。图像2为主角参考。镜头1,超广角定场镜头。一个巨大的圆形宇宙之门几乎充满画面;人物只是门前一个小小的剪影,站得较低,略偏右侧。地面湿润且反光;门的中心漆黑一片。镜头缓慢推进。主标题从黑暗边缘淡入,先模糊后清晰:"THE STARS WERE LISTENING",极窄、粗体、全大写,暗红色混合锈红色,带有轻微颗粒感和模糊边缘。音频:深沉的低频脉冲,遥远金属颤抖声,文字清晰时一声轻柔的撞击。硬切。

视觉创意与内容包装

创意短片、片头序列、情绪驱动的音乐视频和动态海报。这是模型处理屏幕文本和节奏感最突出的地方。

轻悬疑犯罪片头序列。 五张风格参考设定了复古动漫、漫画拼贴的外观;模型使每个英文演职员表清晰可读,并将转场落在鼓点上。 黑色动漫横幅,展示地铁列车上的剪影角色 风格参考 剪影侦探在证据板前拿着照片 风格参考

 

 

Plain
1生成一个15秒的16:9横屏轻悬疑犯罪片开场片头。整体风格遵循这些图像的可视化语言:复古日本动漫片头、硬边剪影、漫画拼贴、不对称分屏、强烈几何色块、英文演职员表、少许日文片假名装饰、爵士犯罪感。情绪为60%悬疑、40%爵士:神秘、酷、灵动,带有都市犯罪感,非恐怖,非沉重。运动感类似动态图形拼贴:线框先出现在黑色上,分屏边界快速滑开,色块和面板逐块粘贴;角色剪影、道具特写和英文演职员表按序列在鼓点上滑入、弹出、遮罩显现。英文演职员表必须清晰可读,可有动画效果。不要添加中文,不要乱码,不要拼写错误的英文。每个英文演职员表和角色仅出现一次。保持转场多样化:圆形黑胶遮罩、垂直车门式切割、长人形阴影扫过屏幕、红色线条切割、巨大英文字母遮罩、分屏框架重组、硬色块切割。所有转场落在鼓点上。无软溶解。背景音乐:原创15秒片头音乐,60%悬疑,40%爵士,由持续低音、紧张的拨弦弦乐、冷合成器脉冲、底鼓、稀疏爵士刷子和短低音萨克斯乐句构成。前2秒用低频和踩镲建立悬疑感;第3秒低鼓进入;第6秒爵士贝斯律动加入;第10秒短萨克斯即兴出现;最后2秒用紧张和弦加鼓点锁定画面。不要模仿任何现有旋律。

实景厨房与手绘动画融合。 无参考素材,仅文本到视频。提示词借用不完美的手机拍摄质感,避免看起来像商业广告。

 

 

Plain
115秒,16:9横屏。黄昏时分小厨房的实景镜头与手绘发光动画融合。夕阳余晖仍停留在窗户上;生活气息浓厚的小厨房里有一张旧木桌、一个洗了一半的杯子、一个略带雾气的玻璃瓶和一块挂着的洗碗布。画面带有单手手机拍摄的轻微手抖、近距离对焦时的犹豫、背光引起的曝光波动以及阴影中略粗的噪点。不要像商业广告那样处理得整洁有致,应感觉像有人在家匆忙拍摄某种不可能之物。不要大眼睛、不要裂嘴、不要獠牙、不要威胁或扑击动作、不要突然黑屏、不要惊吓跳跃。声音仅使用厨房环境音、洗碗布的摩擦声、杯子的轻碰声、水龙头滴水声、拍摄者的脚步声和轻微呼吸声,加上手绘生物柔和的电子音和小叫声。

暗黑流行、赛博垃圾摇滚音乐视频。 两张参考设定了字体处理和印刷质感;剪辑保持硬切,无溶解。 三位女性穿着仿皮草点缀的破旧服装摆姿势 字体处理参考 黑白红三色破旧排版设计模板网格 字体处理参考

 

 

Plain
1风格:暗黑流行 / 赛博垃圾摇滚 / 说唱音乐视频,写实高时尚质感,电影杂志质感,高对比度但不廉价。整体参考:90年代末到00年代初的独立杂志、复印纸、胶片扫描、地下音乐海报和zine拼贴美学。图像有粗颗粒、轻微胶片抖动、半色调网点、印刷毛边和扫描错位。快速剪辑节奏,仅硬切,无淡入淡出和软转场。字体处理风格和质感遵循参考图像。

动态海报。 一张参考,原始静态海报。提示词保持布局和色调不变,仅动画化文字进入。 穿着粉色恐龙连帽衫的动漫男孩伸出手,带有巨大爪子 原始静态海报

 

 

Plain
1制作一个动态海报视频。保持原始图像的画廊白色边框、内框、红白黑色调、3D手办感和布局结构不变;当文字进入时,添加一个灵动的文字进入音效。

数字体验与游戏创意

游戏 UI、产品界面和交互演示。这里的亮点是 H3 能够遵循按时间块编写的提示词。

游戏装备 UI 导览,按秒提示。 这是值得仔细阅读的一个。提示词按时间分段编写,模型遵循了这些分段:菜单状态、光标点击、面板滑入、武器网格、从 0% 到 100% 的加载条,然后完整环境围绕角色加载。 风格化的粉色头发章鱼角色,盘腿坐在纯紫色背景上 参考图像 1,角色 紫色游戏菜单,光标指向 Continue 按钮 参考图像 2,UI 风格

 

 

Plain
1角色参考为图像1,UI风格参考为图像2。
2
3[0秒-2秒] 高角度俯拍。角色坐在高饱和度亮紫色地板上,参考图像1,抬头看向镜头。右侧显示游戏菜单UI:START NEW GAME、CONTINUE(高亮)、SETTINGS、EXIT GAME。左上角显示玩家资料MINIMAX。光标点击"CONTINUE"。
4
5[2秒-4秒] 平滑变焦至她的右臂。一个UI面板从右侧滑入,"RIGHT ARM EQUIPMENT"面板出现。选择高亮"PHANTOM GRIP",然后滑动至"CHRONOS CLAW"。她的右手机械重组,手指分开,新的爪状指节锁定到位,青色LED灯更亮地闪烁。
6
7[4秒-7秒] 镜头平滑地绕到她左侧。一个新的UI滑入,"ARMAMENT CUSTOMIZATION"网格,显示手、前臂、肘部和上臂组件。选择快速循环各部件。她的左臂一段段分解,在交换过程中可见裸露的线缆和活塞。
8
9[7秒-8.5秒] 镜头拉回至中景。CONFIRM CONFIG按钮闪烁。点击。所有UI面板向内收缩并消失。角色展开双腿,现在放松地坐着,一条膝盖抬起。
10
11[8.5秒-10秒] 底部出现一个LOADING条,快速从0%填充到100%。亮紫色环境开始变暗,阴影从边缘渗入,温暖的金色光线渗透进来。
12
13[10秒-15秒] 当她站起时,完整环境围绕她加载。一个密集的赛博朋克贫民窟逐渐清晰:霓虹灯闪烁,湿漉漉的街道反射光线,人群移动,摩托车穿梭,堆叠的建筑延伸至远处的摩天大楼。镜头稳定在第三人称视角,位于她身后。HUD元素淡入,右上角有迷你地图,左下角有生命值和弹药计数器。一个任务标记出现。她步入街道。

产品落地页 UI/UX 演示。 一张产品照片作为参考;提示词要求一个滚动的高能量落地页。 浅蓝色耐克跑鞋,绿色点缀和粉色鞋跟 产品照片参考

 

 

Plain
1一个网页,网页UI设计,网页动效,视频展示平滑向下滚动页面。一个爆炸性的、高能量的耐克官网风格产品落地页UI/UX演示视频,其核心展示主题为图像1中的产品。页面使用粗犷、有力、倾斜的超大无衬线字体实现张扬布局。背景中,快速移动的光影、深色碳纤维或运动透气网眼纹理交织变化。视频展示节奏紧凑的向下滚动,以及悬停时强烈的视觉放大和颜色反转等UI交互。

Web UI 动效,最小提示。 证明按时间详细编写风格是可选的;简短指令同样有效。 在暗色摄影棚中的光滑灰色电动超级跑车,带有发光的红色尾灯 参考图像

 

 

Plain
1模拟一个网站 UI 设计:首先顶部标题向下滑入视图,然后下方的文字栏向上擦除,车灯从暗色变为红色。

如何开始使用 MiniMax H3

有两种方式,都不需要太长时间。

在 Playground 中运行。 登录 Atlas Cloud,直接在模型页面打开 MiniMax H3。输入提示词,选择分辨率和时长,即可生成,无需代码。这是查看模型是否适合您的镜头的最快方式,然后再将其集成到任何流程中。

或者通过三步调用 API。

  1. 获取您的 API 密钥。打开 Atlas Cloud 控制台,在 API 密钥页面创建一个密钥。H3 的三个入口共享同一个密钥。
  2. 阅读模型页面上的字段说明。参数参考和复制粘贴代码位于每个入口点上:文本到视频图片到视频参考到视频。三者接受不同的输入,因此不要混淆它们的请求体。
  3. 发送第一个请求。一个端点和一种调用约定即可到达平台上的所有模型,因此从其他视频模型切换到 H3 只需将 model 字段更改为相应的 H3 入口点。认证、轮询和结果检索保持不变。

除了 H3,同一个密钥还可以访问您可以组合的视频、图像、音频和语言模型,一个 API 和一张账单,因此制作一个成品作品无需在不同供应商之间传输资产和发票。

常见问题

什么是 MiniMax H3?

MiniMax H3 是 MiniMax 的多模态视频生成模型,在 Atlas Cloud 上通过三个入口点提供:文本到视频、图片到视频和参考到视频。它将文本、图像、视频和音频作为单一上下文读取,并在单次通过中返回一个带有同步声音的完整 2K 片段。

MiniMax H3 的成本是多少?

MiniMax H3 按视频每秒时长收费。2026 年 7 月在模型页面上验证,原生 2K(2560×1440)为每秒 0.14 美元,768p 为每秒 0.10 美元。因此,一个 8 秒的 2K 片段成本为 1.12 美元。当时 H3 没有促销折扣。

MiniMax H3 是生成音频,还是仅生成视频?

两者同时生成。展示片段从 MiniMax H3 输出时已带有同步立体声音轨,与画面在同一过程中生成,而非单独步骤。提示词可以指导声音,描述音乐、音效和时机,与视觉内容一同指定。

三个 MiniMax H3 入口点有什么区别?

文本到视频仅凭提示词工作。图片到视频将首帧(可选的末帧)动画化。参考到视频使用最多九个混合参考素材(图像、视频片段和一条音轨)来保持主体一致。三者共享同一个 API 密钥和调用约定。

MiniMax H3 支持什么分辨率和片段长度?

MiniMax H3 渲染原生 2K(2560×1440,24 帧每秒),并在定价表上提供更便宜的 768p 层级。片段长度约为 5 到 15 秒,宽高比包括自适应、21:9、16:9、4:3、1:1、3:4 和 9:16。

最新模型

一个 API,畅享全模态 AI。

探索全部模型