仅限两周 | Seedream 5.0 Pro 立享 8 折!

2026 年 MiniMax H3 API 定价:每秒 0.13 美元、一个无人列出的第三档,以及决定账单的 6 个限制

MiniMax H3 API 定价详解:2K 每秒 0.13 美元,768P 每秒 0.08 美元,一个无人列出的每秒 0.05 美元档位,并发 2 vs 15,i2v/r2v 互斥,64MB 上限,以及一张真实账单。

你已经决定接入 API。你想知道两个数字:每秒成本,以及一次能同时跑多少个任务。

前八条搜索结果会给你第一个数字。其中大多数把 768P 档位写错了。没有一个会给你第二个数字,因为并发限制不利于转化。

这件事还有时间压力。OpenAI 将在 2026 年 9 月 24 日移除 Videos API 和所有 Sora 2 别名(OpenAI Deprecations,2026 年 3 月)。如果你正在从它迁移出来,大约只剩七周时间来选择替代方案并上线。

所以这里是完整价目表、真正会卡住你的限制,以及一个真实 10 秒广告片逐项拆开的账单。为写这篇文章,我们在 2026 年 8 月 3 日花了 9.23 美元,其中包括两个我们故意弄坏的请求。

要点速览

  • 2K 输出:每秒 0.13 美元。 官方按量付费价格。一个 10 秒片段是 1.30 美元。
  • 768P 输出:每秒 0.08 美元,不是 0.09 美元,官方页面上也没有 beta 标签。
  • 还有第三个档位: 768P 到 2K 的再生成,每秒 0.05 美元。几乎没人列出来。
  • 0.08 美元 + 0.05 美元 = 0.13 美元。 先低价打样再升级,成本与直接生成 2K 完全相同。
  • 免费档并发为 2,付费档并发为 15。 这是并发任务数,不是每分钟请求数。
  • duration 有两个不同默认值。 UI 报价 8 秒 1.12 美元;API 省略 duration 时,按 5 秒计费 0.70 美元。
  • 硬性上限: 请求体总计 64MB、9 张参考图、回调 challenge 3 秒窗口。

一张放在木质桌面上的账单,旁边有一支笔和一杯柠檬水

一张打印的明细账单放在深色胡桃木桌面上,旁边是一杯带冷凝水的柑橘汽水,自动铅笔横放在一排排美元金额上

在看表格之前,先看这些表格对应的东西。一个 10 秒饮料广告片,2560x1440,原生立体声音频,由单张锁定画面做 image-to-video 生成。

装满冰块并带一片青柠的高玻璃杯

最终交付的广告片。在 Atlas Cloud 上计费 1.40 美元,按 MiniMax 标价为 1.30 美元,时长 10.13 秒,24fps,立体声 AAC。生成它的每一次调用都在本文底部逐项列出。

MiniMax H3 API 定价:所有费率一张表看完

MiniMax 按输出秒数对 H3 计费,根据你的请求内容分为三种不同费率。其中两种被广泛引用。第三种才有意思。

T1. 完整价目表MiniMax 按量付费定价,2026 年 8 月):

计费项目费率
标准生成,2K 输出$0.13 / 秒
标准生成,768P 输出$0.08 / 秒
再生成,768P 升级到 2K$0.05 / 秒
参考音频免费
参考图像前 5 张免费,之后每张 $0.04(再生成时 $0.025)
参考视频输入时长按输出分辨率费率计费
H3-Context-IR tokens$0.90 / M 输入,$3.60 / M 输出

有两个值得记住的修正,因为它们会改变你的预算。

768P 档位是 0.08 美元,不是 0.09 美元。 官方页面列的是 768P | Billed per second | $0.08 / second,并且没有 beta 标记。在各种汇总文章和转售商页面流传的 0.09 美元和 0.10 美元,是互相复制的二手数字。如果你按 0.09 美元做预算,其实有 12.5% 的余量你自己都不知道。

还有一个没人列出来的第三档。 MiniMax-H3-Regeneration 可以把已完成的 768P 渲染升级到 2K,按每秒 0.05 美元计费。它只作为 MiniMax direct 上的独立端点存在,所以每一次照抄规格表的工作都会漏掉它。

T2. 每条片段价格(你会截图的那张表):

时长2K,官方768P,官方768P 后升级Atlas Cloud 上的 2K
4s$0.52$0.32$0.52未开放
5s$0.65$0.40$0.65$0.70
10s$1.30$0.80$1.30$1.40
15s$1.95$1.20$1.95$2.10

看第四列。打样每秒 0.08 美元,加上升级每秒 0.05 美元,合计每秒 0.13 美元,精确到美分都等于直接生成 2K 的价格。低价打样路径不会为你保留的片段省钱。它只会为你丢弃的片段省钱,每丢弃一秒正好省 0.05 美元。丢掉一个 5 秒 take,你省了 0.25 美元。一个都不丢,你付了一样的钱,还等了两遍。

本次测试在哪里运行,以及每个端点的成本

三个 H3 端点和一个图像模型完成了全部工作,而且它们都在同一个浏览器标签页里,所以静帧和视频步骤之间不需要来回切换 key。

这个广告片中的任务模型费率
锁定构图(一张静帧)GPT Image 21280x720 实测 $0.11861,2048x1152 报价 $0.1745,quality high
测试 take 和交付 takeMiniMax H3 Image-to-Video$0.14 / 秒
第二种视觉语言,无基础帧MiniMax H3 Text-to-Video$0.14 / 秒
风格迁移,以及互斥测试MiniMax H3 Reference-to-Video$0.14 / 秒

要诚实看待这笔权衡。Atlas Cloud 上 H3 标价每秒 0.14 美元,而 MiniMax 是 0.13 美元,所以一个 10 秒片段贵 0.10 美元。作为交换,你跳过免费档并发阶梯,用一个 key 和一个余额同时跑图像模型和三个视频端点,而且提交时被拒绝的请求不收费。截至 2026 年 8 月,这三个 H3 端点都没有折扣。Atlas 也只开放 2K,所以不能走先打样再升级的路径。请按你自己的用量算账。

T4. 用于对比的每秒速率,均已于 2026 年 8 月在 Atlas model list 上核实:

模型每秒原生音频备注
MiniMax H3, 2K$0.14是,立体声最长 15s
HappyHorse-1.1$0.14i2v, t2v, r2v
Wan 2.7$0.10i2v, r2v
Youchuan V8.2$0.086i2v
Seedance 2.0 Mini~$0.056列表中每秒最便宜

单看每秒价格是很糟糕的比较方式。H3 每秒 0.14 美元会在同一次调用中直接交付内嵌的原生立体声音轨。如果一个 0.056 美元的片段之后还需要单独做声音,差距会很快缩小。

为什么你的 MiniMax H3 API 定价估算会偏低

有五件事会让账单超过 seconds x rate。这五件事都在 2026 年 8 月 3 日实测过。

陷阱 1:duration 有两个不同默认值。 打开 playground,不动时长滑块:它停在 8,Run 按钮报价 1.12 美元。调用 API 并完全省略 duration:我们的任务回来按 0.70 美元计费,也就是 5 秒。同一个模型、同一天,根据你走哪扇门进入,每条片段价格相差 60%。每一次调用都要显式传入 duration,否则你的预测永远对不上账单。

陷阱 2:坏掉的参考图不会失败,但会计费。 我们把 image_url 指向一个返回 404 的 URL 并提交。任务没有报错。它报告 completed,照样渲染了视频,并收取完整的 0.70 美元。响应里没有任何字段提示你的参考图从未加载。花钱之前先验证 URL 是否可访问。

陷阱 3:参考视频会被计费两次。 输入视频按输入时长、以输出分辨率费率计费。输入一个 5 秒参考片段来生成一个 5 秒 2K 输出,你要为输入付 0.65 美元,再为输出付 0.65 美元。一个 5 秒交付物就是 1.30 美元。

陷阱 4:第六张图开始要收费。 前五张参考图免费,之后每张 0.04 美元。跑满九张会让每次调用增加 0.16 美元。在再生成档位,额外图片降到 0.025 美元。

陷阱 5:先打样再升级有一个盈亏平衡点。 上面已经讲过,但值得重复,因为这个算术结果违反直觉:省下的钱只来自你丢弃的素材,每秒 0.05 美元;保留的素材省 0。

唯一的好消息。 提交时被拒绝的请求确实不收费。我们发送了一个无效的 ratio 值,拿到 HTTP 400,记录里 outputs: null 且完全没有 price 字段。把验证前置,失败就是免费的。真正收费的是那些表面上成功了的错误请求。

没人公开的 MiniMax H3 API 定价限制

这是转售商页面会跳过的部分,因为这些内容不会帮助他们成交。但每一条都会决定你的架构能不能跑。

T3. 所有重要限制,来自 MiniMax API referencerate limits page(2026 年 8 月):

限制文档怎么说你要付出的代价
并发Video Generation V2 | MiniMax-H3CONN(最大并发任务数)21530 个片段意味着免费档要 15 个顺序波次,付费档要 2 个。并发任务,不是 RPM。
i2v vs r2v互斥:如果出现任何 reference_image / reference_video / reference_audio,则 first_frame / last_frame 不得出现,反之亦然API 不强制执行。它会向你收费,然后丢掉其中一个输入。见步骤 5。
仅音频"audio alone is not allowed, at least one reference video or image is required"仅音频参考请求会被拒绝。给它配视频或图像,否则就会丢失。
请求体总计低于 64MB;单张图片低于 30MB,视频低于 50MB,音频低于 15MBBase64 会让载荷膨胀约三分之一,所以 64MB 请求体大约只等于 48MB 真实文件。使用公开 URL。
参考数量最多 9 张图片、3 个视频、3 个音频第 6 到第 9 张图片可计费。
图像约束JPG, JPEG, PNG, WEBP, HEIC, HEIF;边长 256 到 5760 px;宽高比 0.4 到 2.59:21 裁切的宽高比是 0.43,勉强通过。上传前验证。
回调在 3 秒内原样返回 challenge 值冷启动的 serverless function 会错过这个窗口。先回应 challenge,之后再做工作。
duration enum官方参考接受 4 到 15托管 schema 通常从 5 开始。不要假设 4 在任何地方都可用。

还有一件只有当你在此之上构建计费系统时才会遇到的事:price 字段填充得很晚。 轮询到任务报告 completed 时,经常还完全没有价格。几秒后再次按任务 ID 查询,才能拿到真实费用。第二次查询是构建与账单一致的发票的唯一方式,也是本文底部那张表的组装方式。

关于并发要提醒一句:日常行为很嘈杂。我们见过六个重叠的 H3 任务顺利完成,也见过单个任务拿到 429。按公开的 2 和 15 来设计,然后在上线前用两个重叠请求实测你自己的账号。

教程:构建广告片,并观察 MiniMax H3 API 定价如何累加

每一步都可复现。设置保持不变:resolution: 2Kratio: 16:9,并且始终显式传入 duration。在 text-to-video 上,ratio 是必填项,adaptive 会直接被拒绝,错误为 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive'

步骤 1. 用一张静帧锁定构图。 一张 0.12 美元的图片大约比重拍一个 1.40 美元的片段便宜十倍,所以在这里买确定性是定价决策,不是审美决策。使用 GPT Image 2,quality high,16:9。

text
1A tall glass of ice-cold citrus soda on a wet black stone bar top, condensation
2beading and sliding down the glass, a single lime wheel on the rim, backlit by a
3warm amber pendant lamp with deep shadows behind, shallow depth of field,
4commercial beverage photography, crisp macro detail on the water droplets,
516:9, photorealistic
6

AI 图像生成器界面,包含文本提示词和生成的饮料图片

Atlas Cloud 上的 GPT Image 2 playground,已输入饮料提示词,quality 设为 high,16:9、2048x1152,输出面板中显示生成的基础帧

GPT Image 2,quality high,16:9。Run 按钮在 2048x1152 下报价 0.1745 美元。同一个提示词在 1280x720 下向我们计费 0.11861 美元。

步骤 1 在 1280x720 下的输出。这一张单帧是步骤 2、3 和 5 的输入。

步骤 2. 先买一个便宜的测试 take。 五秒,不是十秒。在投入完整时长之前,你要检查冷凝水和冰块的物理效果是否站得住。端点:H3 image-to-video,image 设为步骤 1 的画面,duration: 5resolution: 2Kratio: 16:9

text
1The condensation droplets slide down the glass, ice cubes shift and settle with a
2soft clink, the lime wheel trembles slightly, warm amber light flickers across the
3wet stone surface, slow subtle push-in, ambient bar room tone with a faint fizz of
4carbonation
5

一杯冒着冷凝水的冰水,带一片青柠

0.70 美元的测试 take。价格只有交付片段的一半,并且它回答了这个阶段唯一重要的问题。

步骤 3. 拍交付 take。 同一个端点、同一个基础帧,duration: 10。计费 1.40 美元。这就是文章开头的片段。

text
1Slow cinematic push-in on the citrus soda glass, condensation runs down in three
2distinct rivulets, ice cubes rotate and settle, carbonation bubbles rise in
3continuous streams, the lime wheel catches a specular highlight as the camera
4drifts, warm amber key light with cool rim light from the left, ambient bar tone
5with a crisp carbonation fizz building through the shot
6

AI 视频生成器界面,显示输入和输出的编号步骤

MiniMax H3 image-to-video playground,已上传基础帧,分辨率 2K,时长滑块未触碰,Run 按钮显示 1.12 美元报价,输出面板中显示已完成片段

这一帧完整展示了陷阱 1。没人碰 Duration 滑块,所以它停在 8,报价显示 0:08 结果为 1.12 美元。我们对交付片段的 API 调用传入了 duration: 10,计费 1.40 美元;同一次调用省略 duration 时计费 0.70 美元。

步骤 4. 证明这个费率买到的不止一种视觉风格。 同样每秒 0.14 美元,完全不同的视觉语言,完全没有基础帧。端点:H3 text-to-video,显式设置 duration: 5resolution: 2Kratio: 16:9

text
1Neon-lit late-night ramen counter in heavy rain, steam curling off a fresh bowl,
2a chef's hands dusting scallions in slow motion, reflections of pink and cyan
3signage rippling in a puddle on the counter, handheld documentary feel, shallow
4focus, rain hiss and sizzling broth ambience
5

AI 视频生成器界面,显示提示词设置和已完成的视频输出

MiniMax H3 text-to-video playground,包含拉面提示词,宽高比显式设为 16:9,分辨率 2K,生成的片段正在输出面板中播放

H3 text-to-video。这里必须显式设置 Ratio。保持 adaptive 会让请求在产生任何费用前被拒绝。

一碗汤面在木质吧台上冒着热气

Text-to-video,5 秒,0.70 美元。和步骤 2 相同费率,但视觉上毫无共同点。

步骤 5. 故意触发互斥规则。 两次运行,因为单独一次说明不了问题。先做对照:reference-to-video 只传 refers,不传 first frame,5 秒,0.70 美元。

霓虹招牌下湿漉漉吧台上的一碗冒热气拉面

一个被霓虹照亮、带雨痕的拉面吧台,粉色和青色招牌倒影交织;这张静图用作风格参考

通过 refers 传入的风格参考。

text
1A tall glass of citrus soda on a wet bar top, rendered in the neon-and-rain colour
2language of the reference: pink and cyan rim light, rain-streaked reflections on the
3stone, steam drifting behind the glass, slow push-in, ambient rain and carbonation fizz
4

一杯带柠檬片的冰饮放在霓虹照亮的吧台上

对照运行。refers 生效:粉色和青色边缘光、湿润的霓虹吧台、提示词中的柑橘汽水。0.70 美元。

现在是被禁止的请求。同一个端点,但同时发送步骤 1 的 first-frame image 和同一个 refers 风格参考,文档说二者不能共存。duration: 10ratio: 16:9

text
1The soda glass on the wet bar top, rendered in the neon-and-rain colour language
2of the reference: pink and cyan rim light, rain-streaked reflections on the stone,
3steam drifting behind the glass, slow push-in, ambient rain and carbonation fizz
4

一杯冰可乐放在带霓虹倒影的湿吧台上

HTTP 200,completed,按完整 1.40 美元计费。霓虹参考生效了,但锁定的 first frame 没有生效:高脚杯中浅色的柑橘汽水变成了短杯里的深色饮料。两个输入中的一个被悄悄丢弃,而响应对此只字未提。

这就是整个实验的重点。文档写明了规则;API 不强制执行。把检查放进你自己的客户端,因为上游不会阻止你为一条被丢弃的指令付费。这个步骤没有 playground 截图:reference-to-video 页面默认宽高比为 adaptive,并且在我们的运行中不接受覆盖,所以它是直接通过 API 执行的。

会改变 MiniMax H3 API 定价的变量

一个 15 秒片段,还是三个 5 秒片段。 官方同样是 1.95 美元,Atlas 上同样是 2.10 美元。但重试风险完全不同。一次被拒绝的 15 秒渲染会烧掉 2.10 美元。一次被拒绝的 5 秒渲染只会烧掉 0.70 美元。如果你的提示词还没验证过,先拍短,再剪辑。

Text-to-video 还是 image-to-video。 Text-to-video 省掉基础帧成本。Image-to-video 增加约 0.12 美元,换来锁定构图,而这是影响重试率的最大杠杆。避免一次 10 秒重试,就足够支付十一张基础帧。

用 reference-to-video 做风格或角色一致性。 成本是输出秒数,加上第五张之后每张参考图 0.04 美元。很便宜,前提是你记得它与 first-frame 和 last-frame 输入互斥,而且 API 不会提醒你。

自托管。 H3 权重是公开的,但本地推理生成 768p,若要 2K 还需要单独跑 H3-Regenerate-2K。投入工程师之前,先把 GPU 和存储账单与每秒 0.13 美元做个比较。

这个广告片的真实 MiniMax H3 API 定价账单

每一次调用都在这里,包括我们故意弄坏的两个请求,以及截图背后的调用。费用是 price 字段稳定后 API 报告的数值。

T5. 逐项账单,2026 年 8 月 3 日,Atlas Cloud 费率:

#端点设置状态收费
1GPT Image 2, text-to-image1280x720, quality high, x3 framescompleted$0.35583
2GPT Image 2, text-to-image1024x1792 vertical variant, quality highcompleted$0.15689
3GPT Image 2, text-to-image2048x1152, quality high (playground run)completed$0.17450
4H3 image-to-videoduration: 5, 2K (test take)completed$0.70
5H3 image-to-videoduration: 10, 2K (delivered spot)completed$1.40
6H3 text-to-videoduration: 5, 2K, 16:9completed$0.70
7H3 reference-to-videoduration: 5, 2K, refers onlycompleted$0.70
8H3 reference-to-videoduration: 10, 2K, image + refers, first frame droppedcompleted$1.40
9H3 image-to-videoduration omitted, 2K (came back as 5s)completed$0.70
10H3 image-to-videoimage_url returning 404, duration: 5, 2Kcompleted$0.70
11H3 image-to-videoinvalid ratio valuerejected at submit$0.00
12H3 image-to-videodefault 8s, 2K (playground run)completed$1.12
13H3 text-to-videodefault 8s, 2K (playground run)completed$1.12
Total$9.23

一个交付的 10 秒 2K 原生音频广告片、一个测试 take、第二个创意方向、一次成功的风格迁移,以及四个实验,总计 9.23 美元。去掉实验后,再多交付一个 10 秒广告片的边际成本是 1.40 美元加一张基础帧,约 1.52 美元。

每月 30 条广告片,渲染成本大约是 46 美元。并发决定的是这 30 条需要两波完成,还是十五波完成。

如果你自托管,注意许可。 MiniMax Community License 于 2026 年 8 月 2 日生效,而且比多数人预期更严格。Excluded Territories 覆盖欧盟、英国、韩国和美国。禁止在许可地区之外使用 Works 及其 Outputs,年收入超过 2000 万美元的组织需要书面授权,UI 必须显示 "MiniMax H3",输出不得用于训练其他模型,并且适用香港法律。仓库自己的 license Q&A 将地区列表表述为尚未开放,而不是永久关闭。关键是,所有这些只约束可下载权重。调用托管 API 不在其范围内。

MiniMax H3 API 定价:常见问题

10 秒 MiniMax H3 视频要多少钱?

按 MiniMax 官方 2K 费率每秒 0.13 美元计算是 1.30 美元;按 768P 费率每秒 0.08 美元计算是 0.80 美元。在只开放 2K、每秒 0.14 美元的 Atlas Cloud 上,同一个片段向我们精确计费 1.40 美元。第五张之后的参考图每张额外 0.04 美元。

MiniMax H3 API 定价在 768P 档位真的更便宜吗?

如果你交付 768P,那么每秒 0.08 美元确实更便宜。但把 768P 渲染升级到 2K 需要每秒 0.05 美元,而 0.08 美元加 0.05 美元正好等于直接生成 2K 的 0.13 美元费率。低价打样只会在你丢弃 take 时省钱,每丢弃一秒省 0.05 美元。

我可以并行运行多少个 MiniMax H3 请求?

免费档是两个并发任务,付费档是十五个。这是 CONN,也就是最大并发任务数,不是每分钟请求数。三十个片段意味着免费档要十五个顺序波次,付费档要两个。实际行为每天会有波动,所以用两个重叠请求实测你自己的账号。

失败请求会计入 MiniMax H3 API 定价吗?

提交时被拒绝的请求免费:无效参数返回 HTTP 400,记录里没有价格。但一个只是“错了”的请求仍会全额计费。我们的请求指向一个 404 图片 URL,报告 completed,仍然渲染,并收取 0.70 美元。

我能同时发送 first-frame 图片和参考材料吗?

文档说二者互斥。实际中,API 接受了两者,返回 200,收取完整 1.40 美元,并在遵循参考的同时悄悄忽略了 first frame。请在你自己的客户端强制执行这条规则,因为 API 不会替你执行。

自托管会比 MiniMax H3 API 定价更便宜吗?

只有在相当大的规模下才可能,而且有附加条件。本地推理生成 768p,若要 2K 需要单独的再生成流程;Community License 的 Excluded Territories 包括美国、欧盟、英国和韩国。托管 API 不受该条款约束。

最新模型

一个 API,畅享全模态 AI。

探索全部模型