仅限两周 | Seedream 5.0 Pro 立享 8 折!

MiniMax H3 提示指南:我读完了全部45个官方提示,然后把This Is Fine Dog给烧了。

一份基于MiniMax全部45个示例提示构建的MiniMax H3提示指南:六块结构、end_image技巧、原生音频提示和乱码文本修复。

你已经知道如何给视频模型写提示词了。"电影级布光,慢推镜头,4K。" 这套词汇你用了两年。

然后你把它粘贴进 MiniMax H3,得到一段自带音轨的 2K 片段。画面看起来不错,节奏却是一团糟。标题里有两个字母拼错了。音频是模型随机挑选的某种环境音。

问题不在模型。你给了它一句话,它想要的是一份时间表。

所以我读完了 MiniMax 随 H3 发布的所有 45 个官方示例提示词,以及它们附带的成品片段,并把每一帧拆开来看。官方提示词不是描述。好的提示词是贴在背面的分镜表加配乐提示单。下面是结构、当前实际暴露的参数,以及一个你可以在大约二十分钟内复现的演示。

关键要点

  • H3 提示词是时间线,不是描述。最强的官方示例直接使用 [0s-2s]、[2s-4s] 标记来切割片段,成片精确命中每个节拍。
  • 声音和画面来源于同一次生成,因此音频必须写入提示词正文。官方提示词为音频提供了独立段落,详细到"6 秒处爵士贝斯律动进入"。
  • 你拼写出来的文字能正确呈现。你没拼写出来的文字会变成字母形状的噪点。 我从一个官方片段中截取了帧,同时证明了这两种情况。
  • image-to-video 接受一个end_image。给出第一帧和最后一帧,情感弧线在计算开始前就被固定了。
  • 提示词长度不是优点。当参考图像承担描述任务时,短的官方提示词也能奏效。长度反映了你拒绝交给参考图完成的工作量。

左边是《This Is Fine》的狗,右边是经过 MiniMax H3 10 秒输出后燃烧的样子

左右两边是同一张图。左边是 KC Green 的原始漫画,未作修改。右边是一次 image-to-video 调用的结果:输入第一帧、最后一帧、十秒输出,火焰噼啪声和那声平淡的"this is fine"都是模型自己的音轨。没有人配乐。本指南中的所有内容都旨在帮助你达到那后半部分的效果。

MiniMax H3 提示词实际上长什么样(我读完了全部 45 个样例)

目前搜索首页上的每个"MiniMax H3 提示词指南"都是一份规格表:2K、24fps、5 到 15 秒、原生音频。那是模型卡,不是提示词。

下面是一个真实的例子。这是 MiniMax 黑色电影片头序列官方提示词的一部分(从中文原文翻译而来),大约占其完整长度的三分之一:

生成一段 15 秒 16:9 的轻悬疑犯罪电影片头序列。整体风格参考以下图像的视觉语言:复古日式动漫标题卡、硬边剪影、漫画拼贴、不对称分屏、强烈的几何色块、英文演职员表、少量日文片假名装饰、爵士犯罪感。情绪基调 60% 悬疑,40% 爵士:神秘、酷、灵动、都市犯罪,不要恐怖,不要沉重,也不要变成欢快的爵士 MV。

[...] 英文演职员表必须清晰可读 [...] 不要添加中文,不要产生乱码文字,不要拼错英文。整片规则:每个英文演职员表和职位名称只出现一次。不要重复职位名称,不要重复人名,不要给同一个人多个头衔。

转场必须多样:圆形黑胶唱片遮罩、垂直车门划像、人物长影扫过屏幕、红线切、大型英文字母遮罩、分屏构图重组、硬色块切、面板逐块粘贴。所有转场落在鼓点上:清脆、悬疑、灵动、漫画拼贴。不要软溶解,不要流畅转场。

BGM:原创 15 秒片头音乐,60% 悬疑,40% 爵士。由持续低音、紧张的拨弦弦乐、冷合成器脉冲、底鼓、稀疏的爵士刷子、行走贝斯片段、短促的上低音萨克斯句和简短铜管刺音构成。前 2 秒用低频和镲片建立悬疑,3 秒低鼓进入,6 秒爵士贝斯律动加入,10 秒出现短萨克斯/铜管即兴,最后 2 秒用紧张和弦与鼓点锁定。

看看文字用在了哪里。几乎没有一句用在"美丽"或"电影感"上。它们用在了否定列表转场列表逐秒配乐提示单上。这就是任务的样子。 Noir anime banner featuring a silhouetted figure on a subway train MiniMax H3 官方黑色电影片头序列:MIDNIGHT LINE,带有清晰的 STARRING 演职员表

看那个片段里的演职员表。MIDNIGHT LINE、STARRING、MAYA CROSS、REN KATO、LENA WARD、DIRECTED BY NOAH VOSS。拼写正确,没有重复使用职位名称,片假名装饰按要求放在指定位置。提示词没有说"做好看的标题"。它要求了不重复、不拼错、不添加中文,并从五个不同角度命名了美学风格。 Five cinematic noir panels featuring silhouetted characters in blue and orange 与黑色电影片头提示词一起提供给 MiniMax H3 的五张风格参考板

那五张板子与文字一起输入。五张图片加上一篇长提示词,一次生成。这就是现在这项工作的工作方式。

而 45 个提示词中很多都很短的原因,就在这张图里。在整个集合中,提示词长度的中位数约为 130 个中文字符,但最长的两个分别达到 657 和 858 个字符。短的提示词之所以短,是因为参考板承担了描述任务。长的提示词之所以长,是因为没有其他东西能承担这个任务。

为什么大多数 MiniMax H3 提示词生成的结果平淡无奇,以及乱码文字的修复方法

三个问题,它们都是缺失而非错误。

没有时间线。 你要求十秒但只描述了一个时刻,所以你得到的是一个慢推镜头拉伸了十秒。模型在第七秒无事可做。

没有音频块。 声音与画面在同一次生成中产生。如果你什么都不说,模型仍然会输出一条音轨。它只是随机选一个。

没有否定列表。 如果不加干预,模型会使用软溶解,凭空生成额外的屏幕文字,并添加没人要求的字幕条。

最明确的证据是官方游戏 UI 提示词,它由六个带时间戳的节拍组成:[0s-2s] 菜单,[2s-4s] 右臂面板,[4s-7s] 武器网格,[7s-8.5s] 确认,[8.5s-10s] 加载条,[10s-15s] 世界加载完成。成品片段按顺序、准时地命中了所有六个。 Game menu showing selection of a robotic Phantom Grip arm MiniMax H3 游戏 UI 片段:菜单、装备面板、加载条、世界加载

现在来看同一片段中诚实的一面,以完整的 2560x1440 分辨率显示。 Comparison of legible game UI text and garbled AI text 左侧:提示词中拼写出来的文字清晰呈现。右侧:未拼写出来的文字呈现为字母形状的噪点

左侧,提示词实际打出的每个字符串:RIGHT ARM EQUIPMENT、PHANTOM GRIP、CHRONOS CLAW。清晰、正确,字距调整得像真正的游戏菜单。

右侧,最终街景镜头中的 HUD,提示词中只称其为"HUD 元素"。它显示为 ETR METNO CITFEP。装备图标上方,提示词什么都没说的地方,你得到了 MNALEαIN IAMG。这不是渲染错误。模型正在绘制英文的纹理,因为它从未被赋予那个字符串。

所以修复方法不是设置,而是一种习惯:

如果一个词需要可读,就打出这个词。 然后加上一行否定:不要拼错,不要添加其他文字,不要添加字幕。

以下是每个强官方提示词都会共享的六块结构。

包含内容来自官方提示词的示例跳过它你会得到
1. 风格契约媒介、质感、调色板、时代、不可丢失的外观"复古日式动漫标题卡、硬边剪影、漫画拼贴、强烈的几何色块"第六秒开始漂移的通用光泽渲染
2. 时间线带有具体动作的字面时间切片[2s-4s] 平滑推近至她的右臂。UI 面板从右侧滑入一个想法拉伸到整个时长
3. 摄像机运动,或明确拒绝运动"锁定机位、静态广角、无推近、无剪切"你没要求的默认慢推
4. 音频每个声音及其进入时间"6 秒处爵士贝斯律动加入,最后 2 秒用紧张和弦锁定"模型今天喜欢的任何环境音
5. 文字,拼写出来带引号字面字符串"THIS IS FINE." / CONFIRM CONFIG字母形状的噪点,如上所示
6. 否定列表要拒绝的转场、对象和陈词滥调"无软溶解、无流畅转场、不添加中文、不重复职位名称"软溶解、凭空生成的文字、诡异漂移

块 5 和 6 是免费的。它们不增加任何额外生成成本,而且质量的大部分都来自这里。

MiniMax H3 提示词工作流程:你的提示词属于哪个端点

同样的密钥、同样的提交并轮询形式,三个入口。你选择哪一个决定了你的提示词仍需完成的任务。

端点你提供什么它为你锁定什么值得知道的参数何时使用它计费
minimax/h3/text-to-video仅提示词无。文本承担一切时长 5-10(默认 8)、分辨率 2K、必须明确设置比例在投入之前测试某个外观或声音设计按输出秒数计费,当前费率见模型页面
minimax/h3/image-to-video提示词 + 图像(第一帧),可选 end_image片段起始位置,以及可选的目标位置end_image、时长 5-10(默认 8)、比例默认自适应你有艺术作品并希望它动起来而不被重绘按输出秒数计费
minimax/h3/reference-to-video提示词 + refers[]主体身份和风格,跨你创造的场景refers[] 混合数组、时长 5-15、比例最高 21:9相同角色或产品,新环境按输出秒数计费

refers[] 是目前在野外真正缺乏文档的那个,所以下面是它期望的形状:

json
1"refers": [
2  { "url": "https://.../subject.png", "type": "image" },
3  { "url": "https://.../style-board.png" },
4  { "url": "https://.../motion-ref.mp4", "type": "video" },
5  { "url": "https://.../beat.mp3",       "type": "audio" }
6]
7

四个规则,每个都能为你节省一次浪费的生成:

  1. 音频不能单独存在。 数组中至少需要一张图像或一个视频。仅凭节拍音轨会被拒绝。
  2. type 是可选的。 它从 URL 推断,但当扩展名模棱两可时仍应声明。
  3. 上限是真实的。 最多 9 张图像、3 个视频和 3 个音频片段,共 12 个文件,参考视频和音频各 2 到 15 秒(MiniMax API 文档,2026 年 7 月)。
  4. 在提示词文本中为每个参考图分配一个任务。 这是本列表中杠杆最高的习惯。官方提示词以类似"图像 1 是整体情绪和风格参考,图像 2 是主角参考"的句子开头。没有这句话,模型必须猜测每块板子代表什么。 Large black text reading BASS HITS over a smiling woman MiniMax H3 暗黑流行音乐视频:CUT BACK、ONE LOOK、DETONATE 排版 Three women in grunge fashion next to a bold typographic poster 暗黑流行音乐视频背后的两张排版参考板

那个片段是规则 4 的论据。它的提示词从未描述过一个字母形状。它说"文字包装风格和纹理参考图像",并交出了两块板子。布局之所以出现,是因为它被展示出来,而不是被描述出来。

再多一张表,因为模型卡和 API 目前说的并不一致,而差距正是人们浪费一个下午的地方。

事项MiniMax 自己的文档端点当前实际接受的内容这对你的提示词意味着什么
时长4 到 15 秒,仅整数text-to-video 和 image-to-video:5 到 10,默认 8。reference-to-video:5 到 15,默认 815 秒的分镜表目前仅适用于 reference-to-video。将较长的板子重写为 10 秒内
分辨率2K分辨率默认为 2K,且 2K 是目前唯一运行的数值。768p 任务会返回模型 MiniMax-H3 不支持分辨率 768P,支持的分辨率:2K,尽管 768p 出现在定价表中按 1440px 短边编写。你要求的细节实际上会保留
宽高比常见比例或自适应image-to-video 和 reference-to-video 默认自适应。纯文本拒绝自适应并返回其允许的集合:16:9、4:3、1:1、3:4、9:16、21:9在 text-to-video 上,必须明确设置比例,否则任务将验证失败
混合参考9 张图像,3 个视频,3 个音频,12 个文件,音频不能单独存在refers[] 接受 {url, type},类型为 image、video 或 audio,至少一个图像或视频你确实可以将运动与提供的节拍同步。只是你不能只提供节拍
原生音频同一次生成中的立体声音频我探测的九个官方片段中每一个:2560x1440、24fps、AAC 立体声 32kHz音频块不是装饰。它是交付物的一半

以上所有内容均在 Atlas Cloud 上运行,所有三个 H3 端点共享一个密钥和一个提交并轮询循环,因此在它们之间切换只需更改模型字符串,其他无需改变。

MiniMax H3 提示词教程:让《This Is Fine》的狗着火并带上声音

以下是完整流程。这个笑话之所以有效,是因为狗什么都没做。将这种克制延伸为十秒的真实时间,加上真实的火焰,让最后两秒走向原漫画实际去的地方,它变得更有趣,对你来说也更糟糕了一点。大多数人只见过前两个画格。

步骤 1:下载原始漫画。不要让 AI 重绘它。

这条漫画是六格,两列三行,600x887。我们只需要画格 2 和画格 6。

bash
1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png
2# 600x887, 6 格, 2 列 x 3 行
3
4# 裁剪画格 2("THIS IS FINE." 画格):x 302-584, y 20-293
5# 裁剪画格 6(融化的狗):x 302-584, y 595-868
6# 使用 Lanczos 将每个放大 4 倍 -> 1128x1092
7

直白地说:不要要求图像模型绘制"看起来像《This Is Fine》的狗"。 AI 重绘会在半秒内被识破是假的,笑话当场死亡。水彩晕染、颤抖的手写体文字和纸张纹理是整个契约。4 倍 Lanczos 放大只是为了让 282 像素的源图更厚实;它给模型提供真实的像素来抓住,而无需凭空创造任何东西。 Two panels of the This is Fine dog melting in fire 原始漫画的画格 2 和画格 6,标记为第一帧和结束图像输入

步骤 2:使用 end_image 在 image-to-video 上运行。

模型:minimax/h3/image-to-video。设置:resolution 为 2K,image = 画格 2,end_image = 画格 6,ratio 为 1:1 以匹配近似方形的源图。将 duration 设置为 10;滑块默认在 8,所以拖动它。

text
1手绘 2D 网络漫画画格,赋予生命。保持每一帧中原始的水彩纹理、可见的墨水轮廓、错位的纸张纹理和平坦的漫画调色板。
2不要平滑,不要以 3D 重新渲染,不要清理线条,不要添加新物体,不要添加新文字。
3
4[0s-3s] 几乎没有任何移动。狗完全静止地坐着,握着杯子,眼睛直视前方。只有他身后的火焰在移动:缓慢的橙色火舌爬上墙壁,一颗火星飘起。写着 "THIS IS FINE." 的气泡保持原位,完全清晰可读,未改变,手写体。
5
6[3s-6s] 狗举起杯子,小小地、平静地啜饮一口。啜饮后气泡淡出。火焰变亮。他身后的墙壁开始因热量而扭曲。他的帽子边缘开始冒烟。
7
8[6s-8.5s] 热量波及到他。他的耳朵下垂,轮廓变软并开始像湿油漆一样向下流淌。他仍然没有移动目光。杯子仍在他的爪子里。
9
10[8.5s-10s] 完全融化。脸部扭曲,一只眼睛滑落,牙齿露出固定的咧嘴笑,皮毛变成红色和橙色。他保持这个姿势。在最后半秒定格在最终画面。
11
12摄像机:锁定机位,单一静态广角镜头,无推近,无手持,无剪切。画面从不移动。这是在一个漫画画格内的一次连续拍摄。
13
14音频:全程室内火焰环境音 - 低沉的噼啪声,偶尔的木头燃烧爆裂声,隐约的结构吱嘎声。在 3 秒处,一个陶瓷杯碰到牙齿和一次小吞咽。一个平静、平淡、不受打扰的男性声音准确地说出:"This is fine." - 面无表情,毫无感情,稍微过于放松。从 6 秒开始,噼啪声变大,环境音变厚;最后 2 秒增加一个低沉的次低音膨胀。没有音乐,没有罐头笑声,没有此列表之外的声音效果。
15
16不要添加字幕。不要添加水印。不要拼写图像中已有的词语之外的任何词。不要改变 "THIS IS FINE."。不要切走。
17

那个提示词就是结构表的活体。第一段是风格契证。四个带括号的切片是时间线。然后是摄像机、音频、否定列表。其中没有任何装饰性内容。 Screenshot of AI video generator showing the This is fine meme Atlas Cloud 上的 MiniMax H3 image-to-video:第一帧和结束图像已加载,10 秒 2K,输出面板中的完成片段

步骤 3:像 QA 检查一样对待输出。

四次检查,每次测试提示词的不同块。

  1. 气泡中的 THIS IS FINE. 是否仍然清晰可读且拼写正确?测试块 5。
  2. 线条是否保留,或者有什么东西把它"改进"成了干净的 3D?测试块 1。
  3. 音频是否只包含你列出的声音?探测容器:它应该返回 h264 加 AAC 立体声。
  4. 最终画面是否落在画格 6 的姿势上?测试 end_image。
bash
1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \
2        -of default=noprint_wrappers=1 output.mp4
3

我的输出为 1472x1440、24fps、h264 加 AAC 立体声、10.13 秒。值得注意的是:我要求了 ratio: 1:1,得到了 1472x1440,因此在 image-to-video 上,源帧的形状胜出。将你的两个画格匹配到你实际想要的形状。 Cartoon dog says this is fine then melts in a fire 完成片段在 0s、3s、6.5s 和 10s 的四帧,匹配提示词中的四个时间切片

步骤 4:使用 reference-to-video 将狗移到新地方。

相同角色,新房间。模型:minimax/h3/reference-to-video。设置:refers[] = 画格 2 作为 image,duration 8,resolution 2K,ratio 16:9。

text
1图像 1 是角色和艺术风格参考:保持这种精确的手绘 2D 网络漫画外观,相同的水彩纹理,相同的墨水轮廓粗细,相同的狗,相同的小帽子,相同的杯子。不要以 3D 重新绘制他,不要改变他的比例,不要清理线条。
2
3把他放在一个不同的房间里,保持他的镇定。一个狭窄的开放式办公室,夜间,荧光灯管闪烁,一面墙的显示器全部显示红色错误状态,打印机纸从画面中飘落,角落里有一个小型电气火灾。他坐在画面中央的办公椅上,爪子里握着杯子,直视镜头,完全放松。
4
5摄像机:锁定机位,静态广角镜头。无推近,无剪切。
6
7音频:荧光灯嗡嗡声,打印机摩擦声,每两秒重复一次的柔和警报声,远处电气噼啪声,4 秒处一次平静的啜饮。没有音乐。没有声音。
8
9不要添加任何屏幕文字。不要添加字幕。不要添加其他角色。
10

可迁移的规则:refers[] 承载身份和风格,文字承载场景。 这种分工是角色一致性的全部技巧,也是提示词第一行存在的原因。 Let's try: "Cartoon dog holding coffee cup amidst red screens and a burning printer 同一只网络漫画狗被转移到夜间燃烧的开放式办公室,由 MiniMax H3 reference-to-video 生成

相同的帽子、相同的杯子、相同的墨水粗细、新房间。一张参考图像完成了所有这些。

另外三个值得借鉴的 MiniMax H3 提示词模式

模式 1:动态海报,布局不得移动。 Cartoon character running forward against a solid pink background MiniMax H3 动态海报:POPUP! 布局在动画,而画框和排版保持锁定 Cartoon boy in pink monster hoodie reaching out with giant claw 提供给 MiniMax H3 的原始静态海报

整个提示词只有两行:保持画廊白色画框、内框、红白黑色调、3D 人物感觉和布局结构不变,并在文字进入时放一个灵动的音效。规则:点名那些必须存活的部分。 "保持布局"不是风格说明,而是一个约束,模型会将其视为约束。

模式 2:界面演示,动词胜过形容词。 Mint green Nike ZoomX running shoe with a pink gradient sole MiniMax H3 着陆页演示:产品页面上的滚动、悬停、颜色反转 Light blue Nike running shoe with green and pink accents 着陆页片段背后的单个产品参考图像

那个提示词要求向下滚动页面、悬停状态、强烈放大和颜色反转。四个动词。它从未说过"现代"或" sleek"。交互是动作,所以把它们写成动作。 超大的斜体字和碳纤维编织背景来自形容词;使它读起来像真实页面的是动词。

模式 3:实景加手绘,由拒绝支撑。 Animated glowing green sprout growing in an open hand MiniMax H3 片段,融合了手机拍摄的厨房实景与手绘发光生物

这是一个手机拍摄的傍晚厨房,里面有小小的发光手绘生物,它之所以保持迷人而不是变成恐怖短片,是因为一系列禁令:没有大眼睛、没有裂口、没有獠牙、没有威胁性姿势、没有扑冲、没有突然切黑、没有跳跃惊吓。否定列表是主要的风格控制,而非补丁。 它也是你编码品味的地方。 Four panels showing a woman in a dark tunnel with text 官方科幻预告片中的四帧:THE STARS WERE LISTENING Poster for The Stars Were Listening and character design sheet 预告片背后的情绪板和角色参考

上面的预告片将两个想法闭环。提示词详细拼写了一个标题 THE STARS WERE LISTENING:极窄、粗体、全大写、深红色混合铁锈色、轻微颗粒感和雾化边缘。这一个完全按订单返回。两张参考板处理情绪和主角,因此文字永远不必描述一张脸。分工,一直到底。

运行这些 MiniMax H3 提示词的成本

H3 按生成视频的秒数计费,按分辨率,因此成本模型出乎意料地简单:一个 15 秒的镜头成本大约相当于三次 5 秒的尝试。其他一切由此而来。

  • 以 5 秒迭代,以 10 或 15 秒交付。 构图、调色板和声音设计都能在 5 秒内确定。关于锁定镜头,没有任何东西需要完整时长来告诉你它错了。
  • end_image 是一个成本工具,而不仅仅是创意工具。 大多数重试是因为结局漂移。固定最后一帧在你付费之前就消除了这个故障模式。
  • 否定列表和拼写出来的文字是免费的。 它们向提示词添加字符,而提示词是按秒计费,而非按 token。大量使用它们。
  • 在编写之前将 duration 与端点匹配。 构建一个 15 秒的分镜表,然后发现你的端点上限是 10,这不仅仅是一次重试,而是重写一次。

一件目前还不能规划的事情:定价表列出了更便宜的 768p 层级,但截至本文撰写时,768p 任务会被直接拒绝,2K 是唯一运行的分辨率。预算时假设每秒都是 2K 秒。当前每秒费率在模型页面上,该页面也是 768p 层级开放后显示的地方。

MiniMax H3 提示词、梗图与版权

这只狗并非公共领域。《This Is Fine》来自 KC Green 的网络漫画《Gunshow》第 648 期,发表于 2013 年 1 月 9 日,只有前两个画格走红(Know Your Meme,2013 年 1 月)。Green 曾公开地、相当疲惫地谈到看到这张图片被永远重复使用,包括被他政治上不认同的人使用(NPR,2023 年 1 月)。

本演练是评论和教学,而非素材库。如果你想商业发布任何东西,请绘制自己的帧或获得所用素材的许可。在客户项目之前运行你自己的政策检查:H3 对可识别的真实人物和知名 IP 应用内容规则,在截止日期中途发现这一点并不有趣。

常见问题

MiniMax H3 是生成音频,还是我之后添加?

同一次生成。画面和声音一起输出,这正是为什么音频必须写入提示词正文而不是之后附加。给它一个独立的 Audio: 块,并说明每个声音进入的时间。我探测的九个官方片段中的每一个都返回了 AAC 立体声 32kHz 以及 2560x1440、24fps 的视频流。

MiniMax H3 提示词可以有多长?

根据 MiniMax 文档,最多 7,000 个字符。实际上,官方示例跨度很大,中位数约为 130 个中文字符,最长的两个分别为 657 和 858。当参考图像承担描述任务时,短提示词效果很好。如果没有参考,预计需要编写分镜表。

为什么我的 MiniMax H3 视频中文字会乱码?

因为你不是打出来的。在提示词中字面出现的字符串会清晰渲染;你笼统提及的任何内容("HUD 元素"、"一些标签")都会作为字母形状的纹理返回。拼写出每个需要可读的单词,然后添加 不要拼错、不要添加其他文字、不要添加字幕。

一个 MiniMax H3 提示词可以使用多少参考图像、视频和音频剪辑?

9 张图像、3 个视频和 3 个音频剪辑,共 12 个文件,参考视频和音频各 2 到 15 秒。音频不能是唯一的参考。注意,模型能力与特定端点暴露的内容是两回事,因此请查看模型页面以获取当前输入列表。

MiniMax H3 提示词能否控制片段的结束方式,而不仅仅是开始方式?

可以,在 image-to-video 上,通过可选的 end_image 参数。给出第一帧和最后一帧,片段会在它们之间插值。上面的演示正是如此:漫画画格 2 进入,画格 6 输出。保持两张图像宽高比相似,否则过渡会变得难看。

我现在实际能获得什么时长和分辨率?

2K,且仅 2K。768p 任务目前会被拒绝,提示 supported resolutions: 2K,尽管 768p 出现在定价表中。时长因端点而异:text-to-video 和 image-to-video 接受 5 到 10 秒,默认 8;而 reference-to-video 接受 5 到 15。还有一个陷阱:在纯文本生成上,API 拒绝 adaptive 并要求明确的 ratio。

最新模型

一个 API,畅享全模态 AI。

探索全部模型