Seedance 2.0 Mini & Fast API 全球最低价 —— 比官方定价最高低 68%
Hero background 1Hero background 2

MiniMax H3 Multimodal Video API

MiniMax H3 是 MiniMax 的视频模型系列,支持文本、图像和参考图驱动的生成。创建 5 至 15 秒的视频片段,使用可选的末帧引导运动,保留参考图像中的主体;如果生成音频符合工作流,也可以选择 H3 Developer。Atlas Cloud 将 H3、H3 Fast、H3 Max 和 H3 Developer 纳入统一的 API 工作流,标准价格从 $0.038/秒起。立即开始构建。

MiniMax H3 由 MiniMax 开发。Atlas Cloud(由 Atlas Cloud AI LLC 运营)仅提供接入服务,并不拥有该模型。所有商标均归其各自所有者所有。

探索领先模型

Atlas Cloud 为您提供最新的行业领先创意模型。

比较 MiniMax H3 视频生成端点

根据分辨率、时长、音频能力、宽高比和标准价格,将 MiniMax H3、H3 Fast、H3 Max 和 H3 Developer 端点与文本、图像或参考输入进行匹配。

模态描述
MiniMax H3 Max T2V API (Text to Video)输入文本提示词,即可生成 480P 或 768P 的电影感视频,时长为 5 至 15 秒。支持 16:9、9:16、1:1 或自适应画面,适用于广告、预告片和社交媒体内容,标准价格为每秒 $0.05。
MiniMax H3 Max I2V API (Image to Video)以首帧图像开始,通过文本提示词控制动画,也可选用末帧来控制最终构图。输出分辨率为 480P 或 768P,时长为 5 至 15 秒,适合产品动态展示、主视觉动画和分镜过渡,价格为每秒 $0.05。
MiniMax H3 Fast T2V API (Text to Video)针对文本驱动的 480P 制作,MiniMax H3 Fast 可生成时长为 5 至 15 秒的电影感片段。16:9、9:16、1:1 和自适应选项支持快速制作概念视频及适配不同平台的内容,标准价格为每秒 $0.046。
MiniMax H3 Fast I2V API (Image to Video)通过提示词控制运动,为提供的首帧图像添加动画;当结尾需要视觉引导时,还可添加可选的末帧。该端点支持 480P、5 至 15 秒输出,适合产品演示、艺术作品动画和短篇社交媒体素材,价格为每秒 $0.046。
MiniMax H3 Fast Reference to Video API保留参考图像中的主体,同时由文本提示词定义生成的 480P 视频。该 5 至 15 秒的端点适合制作连续出现的角色、具有辨识度的产品和风格一致的营销视觉内容,标准价格为每秒 $0.046。
MiniMax H3 Developer T2V API (Text to Video)通过自托管的 MiniMax H3 Developer 端点,将文本提示词转换为带生成音频的视频。支持选择 480P、768P 或 2K 输出,并提供 16:9、9:16 或 1:1 画面比例,适用于叙事概念、营销预览和社交媒体制作,价格为每秒 $0.05。
MiniMax H3 Developer I2V API (Image to Video)提供开场图像、可选的末帧和文本提示词,即可创建带生成音频的动态内容。480P、768P 和 2K 输出选项使这一自托管端点适合制作主视觉动画、产品场景和分镜序列,价格为每秒 $0.05。
MiniMax H3 Developer Reference to Video API当内容连续性依赖现有媒体时,可使用一张或多张参考图像或视频,在新的视频提示词引导下保留主体,并生成带音频的视频。支持 480P、768P 或 2K 输出,适用于连续角色和相互衔接的品牌序列,标准价格为每秒 $0.05。
MiniMax H3 T2V API (Text to Video)将文本提示词转换为电影感 2K 视频,时长可选择 5 至 15 秒。每个结果都可设置为 16:9、9:16、1:1 或自适应宽高比,适用于精致的预告片、竖屏故事和营销素材,价格为每秒 $0.038。
MiniMax H3 I2V API (Image to Video)将首帧图像与文本提示词结合,并可按需添加可选的末帧,以 2K 分辨率赋予画面生命。5 至 15 秒的输出时长适合产品展示、角色动画和经过规划的视觉过渡,标准价格为每秒 $0.038。
MiniMax H3 Reference to Video API参考图像引导的生成会保留输入图像中的主体,同时由提示词控制最终的 2K 视频。片段时长为 5 至 15 秒,适合角色聚焦场景和风格一致的产品视觉内容,价格为每秒 $0.038。

一 次 MiniMax H3 API 调用,视听与剪辑一体化

MiniMax H3 API 返回的每段视频最长可达 15 秒、分辨率为 1440p,并原生支持立体声;它可以混合使用文本、图像、视频和声音参考生成内容,同一次调用还能够编辑现有素材中的角色、场景和对白。

12 个参考文件,一次 MiniMax H3 API 调用

一次 MiniMax H3 API 请求最多可接收 9 张参考图像、3 段视频和 3 条音轨,总数上限为 12 个文件。模型不会把它们视为彼此独立的输入槽位,而是将文本、画面与声音整合为一个上下文:从照片中提取角色,从视频片段中提取镜头运动,再从音轨中提取情绪,并将这些元素融入同一场景。对于已有素材的团队来说,这提供了直达成片镜头的路径。

每段视频均原生支持立体声

每个生成结果都自带声音。对白、环境音和音乐会与画面一起,在 24 帧每秒的渲染过程中以原生立体声生成,无需事后配乐或配音。由于节奏在镜头生成时就已确定,脚步声、对白和剪辑都能与动作保持同步。短广告和社交媒体视频生成后即可发布。

通过 MiniMax H3 API 进行提示词级编辑

想把猫换成狗、替换绿幕,或重写一句对白?MiniMax H3 API 可以对你提供的视频执行这类编辑,涵盖角色、物体、背景、光照和特效;对于未提及的部分,则尽量保持原样。提示词最多支持 7000 个字符,因此可以在一次处理中叠加十几项修改,让已获批准版本的迭代变得切实可行。

声音音色迁移与对白替换

将声音样本与图像或视频素材一同发送,生成角色就会使用该音色进行说话。每次请求最多允许 3 条声音参考,每条时长为 2 至 15 秒;声音必须始终与视觉输入一起提供,不能单独提交。现有对白也可以替换,并调整表演以实现匹配。对于系列内容制作,这有助于让每一集都保持统一且易于识别的声音。

MiniMax H3 API 支持 1440p 和 6 种画幅比例

视频时长为 5 至 15 秒;在 1440p 模式下,短边可在 16:9 至 9:16 之间达到 1440 像素,较宽画幅(例如 21:9 的 2976 × 1248)约为 3.7 百万像素。可选画幅比例共有 6 种,从电影感的 21:9 到竖屏 9:16 均可覆盖,MiniMax H3 API 也能为你自动选择。无需切换模型,就能满足预告片、产品循环视频和竖屏剧集等不同需求。

直接输入制作格式,无需转换

如果源文件直接来自摄像机或剪辑时间线,可以按原格式提交:H.264 和 H.265 视频,JPG、PNG、WEBP、HEIC 和 HEIF 静态图像,以及 WAV 和 MP3 音频。单文件限制分别为视频 50MB、图像 30MB、音频 15MB;通过 URL 传递素材则可将请求控制在 64MB 的请求体限制内。在 Atlas Cloud 上,整套素材只需通过一个 OpenAI 兼容密钥处理,并按用量计费。

同一提示词,三款引擎:MiniMax H3 API 正面对比

这一组中的每个片段都来自同一个提示词,分别发送给 MiniMax H3 API 以及托管在 Atlas Cloud 上的另外两个视频模型,因此可以在不改动任何一个词的情况下,对比运动表现、声音效果和指令遵循度。

提示词

15 秒,16:9 横屏短视频。深夜自助洗衣店的真人实拍画面,融合手绘发光动画,形成混合媒介影像。一间小型自助洗衣店,荧光灯微微闪烁;店内有正在运转的洗衣机、塑料洗衣篮和一张旧长椅,地板上躺着一只袜子。整个空间很安静,带着淡淡的怀旧情绪。画面具有单手手持手机拍摄的质感,能明显感到镜头晃动;白色荧光灯让曝光在明暗之间波动;玻璃表面带有环境反光;镜头靠近物体时会出现对焦滞后。画面不应像商业广告那样精致、有序——整体感觉应像真实的纪录片式抓拍,仿佛你深夜偶然闯入这里,在追逐某种奇异而梦幻的景象时随手拍下了这一幕。

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

提示词

第一人称视角 · 眼平高度 · 手持游戏镜头 场景:镜头模拟玩家操作一款现代战争题材 FPS game,双手持突击步枪,沿着军事基地外围缓慢推进。玩家沿掩体旁的道路向前移动,准星扫过前方通道;短暂停顿后,朝远处目标点开火数发,然后继续向前推进——就像一名普通玩家的实机游玩画面。 光照:现代军事基地的冷色自然光与烟雾、枪口火光交织。画面真实清晰,金属武器以及战场上的尘土和薄雾都带有 AAA-game 质感。 镜头运动:玩家移动时,镜头带有轻微的手持晃动——先是缓慢前进,随后小幅左右扫视观察;开火时有细微的后坐力抖动,最后继续稳定向前推进。

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

为每份视频简报匹配合适的 MiniMax H3 路由

从使用 MiniMax H3 Fast 制作的 480P 草稿,推进到 2K 宣传片镜头和由 H3 Developer 支持音频的创意概念;MiniMax H3 系列覆盖产品动态、社交媒体变体、系列角色和分镜预览,并支持通过文本、图像或参考内容生成。

使用 MiniMax H3 Fast 制作社交媒体草稿

MiniMax H3 Fast 可将文本提示词转换为时长 5 到 15 秒的 480P 视频片段。社交媒体团队可以先测试宣传活动的吸引点、节奏和画幅比例,再决定是否投入更高分辨率的制作。

基于已批准静帧制作产品动态

通过图像路由为首帧添加动画,还可以选择使用尾帧引导结尾。商品运营团队可以基于已批准的静帧制作产品展示、目录动态内容和发布素材。

使用 MiniMax H3 制作 2K 宣传片镜头

当宣传活动需要高分辨率输出时,选择 2K MiniMax H3 路由。代理机构可以通过文本或图像制作精致的主视觉镜头、电影感产品瞬间和高分辨率社交媒体素材。

基于参考内容打造系列角色

提供一张参考图像,在由提示词指导新视频片段的同时,保持主体的辨识度。工作室可以制作系列角色短片、连贯的宣传内容和品牌产品场景,获得更强的视觉连续性。

多画幅分镜预览

需要根据一份简报生成横屏、方形和竖屏预览?文本生成支持 16:9、1:1、9:16 或自适应构图,帮助创意团队为多个投放位置准备分镜方案,而无需切换模型系列。

使用 MiniMax H3 Developer 制作音频创意

使用 MiniMax H3 Developer,根据文本提示词或源图像生成带音频的视频。创意团队可以设计提案片段、角色瞬间和宣传活动概念,让画面与声音在同一工作流中协同完成。

MiniMax H3 在视频 API 核心指标方面的比较

对比 MiniMax H3 文生视频变体与其他 Atlas Cloud 模型在最高分辨率、片段时长、宽高比和标示标准价格方面的表现。

模型最高分辨率片段时长宽高比标示基础价格
MiniMax H3 Text-to-Video2K5 至 15 秒16:9、9:16、1:1、自适应每秒 $0.038
MiniMax H3 Fast Text-to-Video480P5 至 15 秒16:9、9:16、1:1、自适应每秒 $0.046
MiniMax H3 Max Text-to-Video768P5 至 15 秒16:9、9:16、1:1、自适应每秒 $0.05
MiniMax H3-Developer Text-to-Video2K-16:9、9:16、1:1每秒 $0.05
Kling V3.0 Turbo Text-to-Video1080p3 至 15 秒16:9、9:16、1:1$0.112
Veo 3.1 Lite Text-to-video1080p4、6 或 8 秒16:9、9:16$0.05

如何在 Atlas Cloud 上使用 MiniMax H3

几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。

创建 Atlas Cloud 账户

在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。

为何在 Atlas Cloud 使用 MiniMax H3

将先进的 MiniMax H3 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。

性能与灵活性

低延迟:
GPU 优化推理,实现实时响应。

统一 API:
一次集成,畅用 MiniMax H3、GPT、Gemini 和 DeepSeek。

透明定价:
按 Token 计费,支持 Serverless 模式。

企业与规模

开发者体验:
SDK、数据分析、微调工具和模板一应俱全。

可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。

安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。

MiniMax H3 API 模型、定价与设置

MiniMax H3 是 MiniMax 的视频模型系列,可根据文本、图像和参考媒体生成视频片段。在 Atlas Cloud 上,该系列包含标准 H3、H3 Fast、H3 Max 和 H3 Developer,支持文生视频、图生视频以及部分参考生视频路线。根据所选模型的不同,可用输出规格范围为 480P 至 2K。

你可以从文本提示词开始生成视频,使用首帧并可选添加尾帧来控制动画效果,或通过支持的参考生视频路线保持主体一致。H3 Developer 还可以随视频生成音频,而每个变体都有各自的路线、分辨率和参数限制。

创建 Atlas Cloud 账户和 API 密钥,然后选择准确的模型 ID,并查看该模型当前的参数结构。通过 Atlas Cloud 兼容 OpenAI 的 API 发送请求,并在应用中处理返回的视频。立即开始构建。

MiniMax H3 Fast 提供 480P 的文生视频、图生视频和参考生视频路线,可生成时长为 5 至 15 秒的视频片段。标准价格为每生成 1 秒 $0.046,图像路线接受首帧,并可选添加尾帧。当你的项目需要 480P 输出,并且需要支持这三种输入工作流时,可以选择它。

当工作流需要 2K 输出时,选择标准 H3。480P 文本、图像或参考输入请选择 H3 Fast;480P 或 768P 的文本和图像生成请选择 H3 Max;需要 480P、768P 或 2K 工作流并生成音频时,选择 H3 Developer。

图生视频路线接受首帧,也可以选择尾帧来引导结尾效果。标准 H3、H3 Fast 和 H3 Developer 均支持参考生视频,但支持的参考输入会因 endpoint 而异。目前,H3 Max 在 Atlas Cloud 上提供文本和图像路线。

标准 H3 输出时长为 5 至 15 秒的 2K 视频片段;H3 Fast 在相同的时长范围内支持 480P;H3 Max 支持 480P 或 768P,时长同样为 5 至 15 秒。在文生视频场景中,这三个变体支持 16:9、9:16、1:1 和自适应画幅,而 H3 Developer 支持 16:9、9:16 和 1:1。请检查所选 endpoint 的结构,因为图像和参考路线可能提供不同的控制参数。

计费依据是每次生成的视频秒数。标准价格为:H3 每秒 $0.038,H3 Fast 每秒 $0.046,H3 Max 或 H3 Developer 每秒 $0.05。你可以将所选路线的标准费率乘以输出时长,估算一次请求的费用。

不会。经过验证的 Atlas Cloud 配置明确包含 H3 Developer 文本、图像和参考路线的音频生成功能,但没有说明标准 H3、H3 Fast 或 H3 Max 支持音频。当音频必须属于文档明确支持的输出时,请选择 H3 Developer。

首先确认模型 ID 与预期的文本、图像或参考路线匹配。根据该 endpoint 当前的结构验证所有必填字段,尤其是提示词、媒体输入、分辨率、时长和宽高比。如果请求仍然失败,请先检查返回的错误信息,再进行重试,不要重复提交相同的无效负载。

探索更多系列

Seedance 2.5

Seedance 2.5 API 现已在 Atlas Cloud 上线!它为开发者提供了 ByteDance 最新的视频模型。该模型可通过文本、单张图像或多达 50 个多模态参考,一次性生成长达 30 秒的原生视频,并包含同步音频和画面内的多语言文本。在 Atlas Cloud 上,您可以通过单个密钥访问它,其主体一致性和改进的物理特性能够保持长镜头的连贯性。

查看系列

Wan 3.0

Wan 3.0 API 是阿里巴巴 Wan 视频系列的下一代产品,旨在将长视频生成、多参考控制和音视频质量推向新的高度。Atlas Cloud 已经托管了 Wan 2.7、2.6 和 2.5,而 Wan 3.0 使用相同的统一密钥运行,无需额外设置。立即开始构建吧。向下滚动至展示区,查看 Wan 3.0 的创作能力。

查看系列

MiniMax H3

MiniMax H3 是 MiniMax 的视频模型系列,支持文本、图像和参考图驱动的生成。创建 5 至 15 秒的视频片段,使用可选的末帧引导运动,保留参考图像中的主体;如果生成音频符合工作流,也可以选择 H3 Developer。Atlas Cloud 将 H3、H3 Fast、H3 Max 和 H3 Developer 纳入统一的 API 工作流,标准价格从 $0.038/秒起。立即开始构建。

查看系列

Seedream 5.0 Pro

Seedream 5.0 Pro API 为开发者在 Atlas Cloud 上提供了字节跳动的可控图像编辑模型。它通过锚点和坐标精确定位编辑,将图像分离为可编辑图层,融合多个参考,并精准匹配颜色和材质,支持 2K 和 3K 分辨率的多语言文本。在 Atlas Cloud 上,您只需一个密钥即可访问!

查看系列

Seedance 2.0

Seedance 2.0 API 为您提供 ByteDance 多模态视频模型的生产级访问权限——支持四模态输入(文本、图像、视频、音频),以及行业领先的“Universal Reference”(通用参考)系统,可在不同镜头间锁定构图、运镜和角色动作。只需一次 API 调用即可集成导演级控制,固定费率为 $0.09/秒,即时获取密钥,无需排队——由企业级正常运行时间和合规性提供保障。Seedance 2.0 原生 4K 现已上线!

查看系列

GPT Image 2.5

OpenAI 的 GPT Image 2.5 系列为开发者在生产图像工作流中提供了 Flare 和 Sunburst 两种选择。支持高达 3840x2160 的任意分辨率渲染,并可从包含 xhigh 和 max 的五个质量等级中进行选择,以满足特定的输出要求。Atlas Cloud 提供即用型的 REST 推理服务,无冷启动,标准定价为每次生成 0.004 美元起。立即开始构建吧。

查看系列

GPT Image 2

GPT Image 2 API 为开发者提供了访问 OpenAI 最新图像模型的途径,它是 GPT Image 1.5 的继任者。该模型可生成和编辑图像,能够在拉丁和 CJK 文字上实现准确的文本渲染,并在海报、样机和信息图表方面具备强大的排版能力。在 Atlas Cloud 上,您可以通过一个统一的 API 与 300 多个模型一起访问它,并享受免费额度、99.99% 的正常运行时间,且无需 OpenAI 组织验证。

查看系列

Gemini Omni Flash

gemini omni API 将 Google DeepMind 原生多模态的 Gemini Omni Flash 系列(包括 Gemini Omni 1.1 Flash)带给开发者。创建带同步原生音频的电影级视频,使用精确的起始帧和结束帧控制为静态图像制作动画,或通过文本引导式编辑修改现有视频,同时保留未编辑的内容。Atlas Cloud 提供一个 OpenAI 兼容密钥、统一访问能力以及透明的按量付费定价。立即开始构建。

查看系列

Grok Imagine

Grok Imagine API 涵盖 xAI 的图像、视频和语音模型,包括 Image 2.0、Video 1.5 和 xAI TTS v1。支持生成跨 14 种宽高比的 1K 或 2K 静帧、生成最长 15 秒的 1080p 视频、通过最多 7 张参考图像引导镜头、或用 20 种语言进行配音。Atlas Cloud 在单一端点上运行所有功能,采用按量计费,起价为每张图像 $0.02、每秒 $0.05。立即开始使用。

查看系列

Google

Google最强大的创意模型现已在Atlas Cloud上全面可用。Veo 3.1提供电影级别的视频生成,Nano Banana 2支持高保真图像创建,而Gemini为每个工作流带来多模态智能。通过单一API key即可访问完整的Google模型套件,提供Day-0可用性和按需付费(pay-as-you-go)定价。

查看系列

Seedance 2.0 Mini

Seedance 2.0 Mini 将 ByteDance 的多模态视频生成技术引入到对速度和成本要求极高的工作流中。它以更轻量的占用空间提供 Seedance 2.0 的核心能力——更快的生成速度、更低的单条视频成本,并且使用您现有的同款 API 集成。对于运行高吞吐量流水线或进行大规模原型设计的团队来说,Mini 是最实用的默认选择。

查看系列

ByteDance

从电影级视频生成到高保真图像创建,ByteDance 最强大的模型现已在 Atlas Cloud 上线。以最低的推理定价和零基础设施开销,大规模运行 Seedance 和 Seedream。

查看系列

一个 API,畅享全模态 AI。

探索全部模型