Seedance 2.5 现已上线 — 首发 Atlas Cloud

MiniMax H3 2K vs 768P:我两次运行相同的提示,得到了两个不同的影片

测量日期 2026-08-05:MiniMax H3 2K 与 768P 对比,返回 1344x768 与 2560x1440,价格 $0.40 与 $0.56。为什么便宜的草稿不是最终效果的预览,以及修复方法。

Two printed photos of cold brew bottles on a wooden table

两张同一瓶冷萃咖啡的打印照片,一张柔和一张锐利,躺在咖啡馆柜台上,中间夹着一张收据

同一张照片的两张打印件,一张柔和一张锐利。在MiniMax H3上,这个差距不是质量滑块。由 openai/gpt-image-2/text-to-image 生成。

我提交了两次相同的提示词。唯一改变的是一个下拉菜单:先是768P,然后是2K。

第一次运行花费0.40美元,130秒后返回。第二次花费0.56美元,耗时181秒。然后我把两帧并排放置,感觉不对劲。瓶子还在。标签还在,小字也都在。但柜台从暖色木头变成了浅色石材,背景中咖啡师身后出现了一个架子,玻璃上的冷凝水突然到处都是,光线颜色也变了。

我并没有在草稿上省钱。我拍了两部不同的电影。

这不是一个bug。这就是H3上"2K"的实际含义,一旦你理解了它,大家给出的标准建议——先草稿便宜再精修昂贵——就悄然失效了。以下是该测试的所有数字,以及让廉价草稿生效的一个改变。

关键要点(所有数据在 Atlas Cloud 上测量,2026-08-05)

  • 768P 输出 1344x768,2K 输出 2560x1440(16:9请求)。像素量是3.6倍,视频比特率也是3.6倍。
  • 4秒片段计费为 $0.40 vs $0.56,即 $0.10/s vs $0.14/s。768P 每秒便宜29%,而非半价。
  • 768P 在文生视频对中 快28%(130s vs 181s),在图生视频对中快17%(194s vs 234s)。
  • 同一提示词下,768P 和 2K 的文生视频产生了 两个不同的版本,而非一个版本的两个质量。单纯的768P草稿并不能预览你的2K最终版。
  • 用图生视频锁定第一帧,漂移就停止了。相同的场景、相同的构图、相同的标签位置,2K将其额外像素精确地用在MiniMax所说的地方:小字上。
  • 768P 没有门槛。截至2026-08-05,两个档次都在分辨率枚举中,并可在下拉菜单中直接选择,无论旧版汇总文章如何说。

MiniMax H3 2K vs 768P:768P 仍在封闭测试阶段吗?

不,这个问题值得尽早澄清,因为它在发布后几天内撰写的大多数定价汇总中仍被反复提及。

我今天拉取了所有三个H3端点的实时输入模式。resolution 字段显示为 enum: ["768P", "2K"],默认值为 "2K",适用于文生视频、图生视频和参考生视频;duration 在所有三个端点上支持从4到15的整秒。没有标志、没有门槛、没有销售表单。然后我在两个不同的端点上提交了768P任务,两者都已完成并按较低费率计费。如果某篇文章告诉你需要联系销售才能使用768P,那篇文章描述的是发布的第一周,而非本周。

MiniMax H3 2K vs 768P,同一提示词,并排对比

左侧是768P。右侧是2K。相同的提示词、相同的 duration=4、相同的 ratio=16:9,背靠背提交给 minimax/h3/text-to-video

Side-by-side comparison of image resolution showing a cold brew bottle

MiniMax H3 2K vs 768P 分屏对比,来自相同的文生视频提示词,并嵌入了分辨率、价格和墙钟时间

同一提示词,两次运行。左:768P,1344x768,$0.40,130s。右:2K,2560x1440,$0.56,181s。以无声GIF展示;两个交付文件都带有32 kHz立体声音频。在 Atlas Cloud 上测量,2026-08-05。

看看实际差异在哪里。不是清晰度。而是电影本身。不同的柜台材料、不同的背景装饰、不同的冷凝水程度、不同的相机高度、不同的色温,标签在瓶子上也处于不同的位置。提示词中没有任何内容要求这些改变。

现在来看大家通常认为相反的部分。以下是两个版本中标签区域的裁剪图,从原始文件中截取并放大到相同宽度,因此768P的裁剪图放大的比例比2K的更大。

Comparison of 768p and 2K resolution on a cold brew label

MiniMax H3 768P 和 2K 版本标签裁剪对比,两者的小字成分行都可读

小字行 "single origin ethiopia guji / 250ml / roasted 04.08.2026" 在768P下幸存。它更柔和,字间距有摆动,但没有任何内容无法辨认。这里768P的真正代价不是模糊的文字,而是不同的构图。

所以,MiniMax H3 2K vs 768P 的诚实框架不是"清晰与模糊"。而是"这个版本与另一个版本,再加上细节润色"。

MiniMax H3 2K vs 768P 规格表,实测数据

下表中的所有数据来自交付文件的 ffmpeg -i 输出和已完成预测的 price 字段,而非文档页面。

在交付文件上测量768P2K比率
交付分辨率(16:9请求)1344x7682560x14403.6倍像素
视频比特率998 kb/s3,624 kb/s3.6倍
文件大小,4.46秒片段620 KB2.00 MB3.3倍
帧率24 fps24 fps相同
音轨AAC 立体声,32,000 Hz,131 kb/sAAC 立体声,32,000 Hz,127 kb/s相同
容器时长(duration=4)4.46s4.46s相同
提交到完成,墙钟时间130s181s1.39倍
实际计费$0.40$0.561.4倍
有效费率$0.10/s$0.14/s便宜29%

两个脚注让我花了不少钱才学到。首先,两个档次都为 duration=4 的请求交付了4.46秒,且都按4秒计费,所以你可以免费获得多余的0.46秒,但无法围绕它来规划剪辑。其次,音频在两个档次之间完全相同。如果你的片段依赖对话或音乐同步,2K在关键方面对你毫无帮助。

为什么 MiniMax H3 2K vs 768P 会绊倒所有人

因为H3上的2K并非升频步骤。它是第二次生成。

MiniMax 直接描述了该机制:"对于H3的2K输出,我们不是使用传统的专用超分辨率模块,而是让H3基础模型在上下文中重新生成自己的低分辨率输出。"他们还解释了为什么这样构建:上下文内方法"让它再次利用原始的多模态上下文来生成高分辨率输出,恢复传统超分辨率只能'猜测'且通常无法恢复的细节,如小文本和精细细节"(MiniMax,2026年7月)。

请用生产视角再读一遍。2K 过程返回你的原始上下文并再次生成。当你的上下文只是一个文本提示词时,"再次生成"意味着"再次掷骰子"。这正是我的两个版本所展示的。模型从未被告知要重现768P版本,因为它从未见过768P版本。

在实际应用中,这会在三个方面造成困扰:

  1. 你在文生视频上以768P滚动廉价草稿,选出一个优胜者,然后以2K重新运行。 你得到一个陌生人。提示词被尊重了,但电影是新的。这就是本页顶部的测试。
  2. 你按每秒便宜29%来预算,认为整体预算也便宜29%。 事实并非如此,因为最终版是任何真实批次中最昂贵的部分,而一次浪费的2K重跑就抵消了多次草稿节省的费用。
  3. 你假设便宜的升级路径就在那里。 我今天查看了 Atlas Cloud 上的完整目录:452个模型,三个H3端点,其中没有H3重生成端点。当只有三个生成端点被暴露时,"将此片段升级到2K"意味着要么重新运行它,要么在其上运行一个单独的升频器。两者都要花钱,而且买到的不是同一个东西。

值得说明的是,为什么值得围绕这个模型进行工程改造而不是换模型。发布时的主打卖点是"高达2K分辨率、最长15秒片段、原生立体声音频"(DataNorth AI,2026年8月),并且评分支持了这一点:H3 目前在 Artificial Analysis 视频编辑 Elo 排行榜上以1130分位居榜首,领先 Gemini Omni Flash 的1122分,比 Dreamina Seedance 2.0 720p 的1037分高出93分(Artificial Analysis,2026年8月)。质量值得一个工作流程。这个工作流程只需要尊重2K是如何产生的。

本 MiniMax H3 2K vs 768P 测试背后的四个模型,一张表

整个测试涉及四个模型、一个API密钥、一张账单。我在 Atlas Cloud 上运行,因为否则在图像模型、两个H3端点和升频器之间切换意味着三个账户和月底需要核对三张发票。

本测试中的任务模型2026年8月价格我实际支付的费用
锁定第一帧openai/gpt-image-2/text-to-image从$0.009/图像起(其上有 token 层级)一张2048x1152,高质量,$0.1745
草稿和最终版,锁定帧minimax/h3/image-to-video2K $0.14/s,768P $0.10/s每段4秒分别 $0.40 和 $0.56
裸对照对minimax/h3/text-to-video相同两个档次每段4秒分别 $0.40 和 $0.56
保留版本,提升像素atlascloud/video-upscaler到1080p $0.018/s,到2K $0.024/s,5秒最低4.46秒片段 $0.12

复制数字之前有两个注意事项。H3端点都发布一个统一的标价 $0.14/s,这是2K档次;768P 费率出现在账单中,而不是在列表中,所以请自己测量一次。而且这四个模型目前都没有折扣。如果你想削减帧锁定步骤,openai/gpt-image-2-developer/text-to-image 目前正在五折优惠(从 $0.009 降至 $0.004),且它是执行相同任务的同一系列。

如何自己运行 MiniMax H3 2K vs 768P 测试

五个步骤,$2.21 的信用额度,大约15分钟的总墙钟时间。下面的每个提示词都是我发送的精确字符串。

首先三个参数注意事项,因为每个都可能悄悄让你多跑一次:

  • 在文生视频上,字段是 ratio,不是 aspect_ratio,其默认值是 1:1,枚举中没有 adaptive 选项。请自己传递 16:9,否则你会得到一个方形片段。在图生视频上,枚举只有 adaptive,因为你的第一帧决定了形状。
  • 始终显式发送 duration,而不是依赖文档中默认的8。你被计费的金额取决于实际交付的内容,而不是你假设的。
  • 每个H3任务都会超过正常的 inline 超时时间,因此请异步提交并轮询。price 字段也填充得较晚:当 status 变为 completed 时,它通常仍为空,你需要再轮询一次预测 ID 才能获得真实数字。没有这第二次轮询,你就无法构建一个诚实的成本表。

步骤1:用 GPT Image 2 锁定帧

这一步将草稿从彩票变成预览。将完成的构图生成为静态图像,它将成为两个视频运行的不可变部分。

text
1Macro product photograph of a matte black cold-brew coffee bottle standing on a wet slate slab, morning window light raking across it from the right. A cream paper label wraps the bottle, sharply legible: bold uppercase title "NORTHBOUND COLD BREW" on one line, and directly beneath it in small type "single origin ethiopia guji / 250ml / roasted 04.08.2026". Condensation beads on the glass, an espresso machine and a barista in a denim shirt softly out of focus in the background. Cinematic, shallow depth of field, warm neutral grade, photoreal, 16:9.
2

设置:高质量,尺寸 2048x1152。在此不要省钱。你想要2K过程保护的每一个细节都必须首先存在于这个帧中。

A bottle of Northbound Cold Brew coffee on a cafe counter

用 GPT Image 2 生成的锁定第一帧,2048x1152,显示冷萃咖啡瓶及其可读的小字

openai/gpt-image-2/text-to-image 生成,高质量,2048x1152。计费 $0.1745,146秒后返回。

Screenshot of an AI image generator interface with numbered steps

Atlas Cloud 上的 GPT Image 2 工作区,填充了帧提示词,输出面板中显示了生成的瓶子

Atlas Cloud 上的 GPT Image 2:质量设置为高,16:9,右侧渲染了锁定的帧。

步骤2:以768P草稿

与你将用于最终版本的端点相同。仅分辨率在此步骤和步骤4之间不同。

text
1Slow macro dolly-in on the bottle. Condensation beads slide down the glass. The label stays perfectly still and legible. In the soft background the barista wipes the counter once. Natural cafe room tone, a faint espresso machine hiss. No camera shake.
2

minimax/h3/image-to-video 上的设置:第一帧 = 你的步骤1输出,resolution=768Pduration=4ratio=adaptive

A bottle of Northbound Cold Brew coffee on a cafe counter

MiniMax H3 768P 草稿片段,慢速推近冷萃咖啡瓶

768P 草稿:1344x768,计费 $0.40,194秒后返回。以无声GIF展示;文件本身带有32 kHz立体声。注意标签上抹下的四条浓重水渍。

AI video generator interface with prompt and generated cold brew video

Atlas Cloud 上的 MiniMax H3 图生视频工作区,上传了锁定帧,键入了提示词,输出面板中显示了完成的片段

图生视频表单,已加载锁定帧。分辨率和持续时间是区分此步骤与步骤4的唯一两个字段,且两个档次都在同一个列表中,没有任何门槛。此截图保留了默认的2K和8秒,因此"运行"按钮报价 $1.12;将分辨率切换为768P,持续时间切换为4,该报价将降至 $0.40。

步骤3:基于正确标准评判 MiniMax H3 2K vs 768P 草稿

草稿是排练,不是证明。根据我的两对测试,以下是它可靠告诉你的内容以及不可靠的内容。

可以信任的方面:提示词措辞、动作是否可读、相机运动量、四秒内的节奏以及音频底噪。所有这些都干净地转移了。

不可信任的方面:精细表面纹理、产品上最小的字体,或它发明的任何瑕疵。在我的768P草稿中,标签上出现了四条浓重的棕色水渍,而2K运行中没有产生,并且小字行塌缩成了糊状。如果我因为看起来脏而拒绝那个草稿,我就会拒绝一个本来有效的提示词。

这就是真正的分工。768P回答"这是否是正确的镜头",2K回答"这是否可交付"。

步骤4:切换一个字段,以2K完成

相同的端点、相同的第一帧、相同的提示词字符串。将 resolution 改为 2K,其他什么都不改。

A bottle of Northbound Cold Brew coffee on a cafe counter

来自相同锁定第一帧的 MiniMax H3 2K 最终片段,标签干净,小字可读

2K 最终版:2560x1440,计费 $0.56,234秒后返回。与草稿相同的石板、相同的咖啡机、相同的植物、相同的咖啡师、相同的标签位置。

这是本文旨在测试的问题的答案,结果是好的。锁定第一帧后,漂移停止了。场景、构图、相机高度和排版位置在768P草稿和2K最终版之间都保持不变。差异仅限于细节:2K过程将抹下的水渍清理成一条细流,解析了纸张纹理,并将小字行从噪声变回文字。这正是MiniMax声称的上下文内重生成行为,也是本测试中第一次2K看起来像一个质量档次,而不是一次重跑。

作为对比,对照组。这是裸文生视频在2K下的运行,正是产生了本页顶部那个陌生人的那个。相同的提示词内容,没有第一帧,因此没有任何东西固定构图。

11 words

Atlas Cloud 上的 MiniMax H3 文生视频工作区,2K,输出面板中显示了完成的对照组片段

Atlas Cloud 上的 MiniMax H3 文生视频:无第一帧,分辨率2K,宽高比16:9,输出面板中显示完成的片段。这次生成没有任何问题。只是它不是768P运行产生的同一部电影。

步骤5:或者跳过 MiniMax H3 2K vs 768P 重跑,直接升频

有时768P版本已经是想要的那个。表演到位了,时机对了,你不希望重生成可能带来不同的结果。那么就不要重跑它。将确切的文件通过升频器处理。

atlascloud/video-upscaler 上的设置:video = 你的768P输出URL,target_resolution=2k。输入上限为2K时是23秒和690帧,输入fps必须为30或更低,因此H3的24 fps片段轻松通过。

Bottle of Northbound Cold Brew coffee on a cafe counter

通过 Atlas Cloud 视频升频器升频到2K的768P版本,相同素材以更高分辨率呈现

升频后的版本:2540x1452,计费 $0.12,40秒后返回。相同的四条水渍,其他一切相同。这是同一部电影,不是新的。

AI video generator interface showing input and completed output video

Atlas Cloud 视频升频器工作区,加载了768P片段,输出面板中显示了2K结果

Atlas Cloud 上的视频升频器,加载了768P H3片段,右侧播放了升频后的结果。此截图保留在1080p默认值,因此"运行"按钮标价为 $0.09(任何低于5秒最低的片段)。将目标分辨率切换到2k,你就进入了 $0.024/s 的档次,即我自己的运行被计费的 $0.12。

这是没有人应该跳过的结论,所有三个标签裁剪图来自相同的锁定帧,以相同的放大倍数展示。

Three-panel comparison of cold brew bottle labels at different resolutions

三向标签裁剪对比:原生768P、该片段升频到2K、原生2K,显示只有原生2K恢复了小字

原生768P、同一片段升频后、原生2K。升频器很好地锐化了纸张纹理和大标题,并保留了确切的版本。它无法做到的是恢复小字行,因为那个信息从未存在于768P文件中。重生成过程可以做到,因为它回到上下文而不是像素。

所以这两条路线不是竞争对手。它们回答不同的问题。升频保留表演。重生成恢复细节。根据你的片段不能失去哪个来选择。

值得在 MiniMax H3 2K vs 768P 上测试的变体

  • 竖屏。 我的16:9测试输出为1344x768,因此短边是档次所固定的。9:16 请求应基于相同逻辑落在 768x1344,但在构建竖屏批次之前最好先测量一次。在图生视频上,你通过第一帧设置形状,而不是与 adaptive 枚举抗争。
  • 说话头部。 这是我会完全跳过草稿直接进入2K的场景。面部、牙齿和视线正是重生成过程存在的精细细节类别,而768P草稿会误导你对这三者的判断。
  • 长片段。 在15秒时,差距扩大到 $1.50 对 $2.10,且墙钟时间随之延长。规划队列,而不仅仅是预算。
  • 产品文字和多语言工作。 H3在帧内稳定的文字及其原生多语言音频是人们首先选择它用于商业包装的原因。两者在768P下都能幸存,这使得768P成为社交裁剪的真正可用交付档次,而不仅仅是排练室。

MiniMax H3 2K vs 768P 每个可用片段的真实成本

首先,达到2K可交付物的三条路线,按8秒片段计算,基于我实际被计费的费率。

达到2K片段的路线使用的费率一个8秒片段的成本保留相同的版本恢复小文字
直接2K$0.14/s$1.12不适用
768P草稿,然后锁定帧后2K重跑$0.10/s 然后 $0.14/s$0.80 + $1.12 = $1.92是,如果第一帧已锁定
768P最终版,然后升频到2K$0.10/s 然后 $0.024/s$0.80 + $0.192 = $0.99是,完全保留

现在来看决定你一个月的数字。假设一个现实混合:10次4秒草稿来找到镜头,然后两个完成的8秒片段。

10次草稿 + 2次最终版的批次草稿最终版帧锁定总计
全部2K10 x 4s x $0.14 = $5.602 x 8s x $0.14 = $2.24$7.84
768P草稿,2K最终版,锁定帧10 x 4s x $0.10 = $4.00$2.24$0.17$6.41(少18%)
768P草稿,768P最终版,升频$4.002 x ($0.80 + $0.192) = $1.98$0.17$6.15(少22%)

诚实地阅读中间行。每秒节省是29%,但每批次节省是18%,因为你的最终版仍然是最终版。只有当草稿占主导时,节省才接近29%:如果是20次8秒草稿而不是10次短草稿,路线二大约比全部2K低25%。而每一分钱都依赖于锁定帧,因为没有它,那十次廉价草稿就是十部你不会发布的电影。

第二个红利是时间,它可能更重要。在文生视频对中,768P返回快28%,并且在两对中从未花费更长时间。在4秒片段和那些墙钟时间下,这意味着大约每小时27次草稿运行,而不是20次。当你还在寻找正确的提示词时,多七次试探比省下的1.60美元更重要。

一个法律注意事项,如果你计划通过自托管来规避所有这些问题。Hugging Face 上的开放权重是 H3-Base,它生成的是768短边。2K过程存在于API端,因此开放权重让你得到草稿档次,而不是最终档次。社区许可证还包含排除区域,覆盖欧盟、英国、韩国和美国,并有一个单独的授权渠道开放,因此在本地 checkout 上构建商业管道之前,请先阅读许可证。要更广泛地了解已发布权重包含和不包含的内容,请参阅我们的 MiniMax H3 评测,以及完整模型目录,如果你想将H3与当前视频领域的其他模型进行价格比较。

常见问题

在 MiniMax H3 2K vs 768P 中,768P 每个片段真的更便宜吗?

是的。我为一个4秒的768P片段支付了 $0.40,而相同请求的2K版本支付了 $0.56,因此 $0.10/s 对 $0.14/s,每秒节省29%。问题是,只有当廉价运行教会你一些关于昂贵运行的东西时,节省才有效,这需要锁定第一帧。裸文生视频的768P草稿是另一部电影,花在上面的钱不是节省的钱。

在 MiniMax H3 2K vs 768P 中,2K 只是768P输出的升频吗?

不是。MiniMax 让基础模型在上下文中重新生成自己的低分辨率输出,而不是运行专用的超分辨率模块,这就是为什么2K可以恢复小文本和精细表面细节,而升频器只能近似。我的三向标签裁剪图精确展示了这一点:升频后的768P片段锐化了纸张纹理,但小字行仍然是不可读的噪声,而原生2K运行将其变回文字。

我的 MiniMax H3 768P 草稿会看起来像我的2K最终版吗?

只有当你锁定第一帧时才会。在裸文生视频上,两个档次给了我不同的场景布置、不同的相机高度、不同的冷凝水和不同的标签位置,来自相同的提示词。在具有固定第一帧的图生视频上,构图、取景和排版在两个档次之间保持不变,唯一的变化在于细节和纹理。

我仍然需要联系销售才能使用 MiniMax H3 768P 吗?

不需要,截至2026-08-05。所有三个H3端点的实时模式将 resolution 列为 enum: ["768P", "2K"],工作区在一个下拉菜单中显示两者,并且我的768P任务在两个不同端点上完成并按较低费率计费。封闭测试的说法来自于发布后最初几天内撰写的报道。

在 MiniMax H3 2K vs 768P 中,2K 慢多少?

在我的4秒对中,慢1.2倍到1.4倍:文生视频上181s对130s,图生视频上234s对194s,从提交到完成测量。在架构上,2K是对同一上下文的第二次生成过程,因此预计在更长的片段上绝对差距会扩大,而不是保持不变。

我可以在不重跑的情况下将768P片段升级到2K吗?

你可以通过视频升频器在不改变版本的情况下提高分辨率,这花费了我 $0.12 用于一个4.46秒片段,在2K档次下($0.024/s,5秒最低),40秒后返回。这逐帧保留了表演。它不会做的是恢复从未被捕获的细节,因此如果去2K的目的是可读的小字体,你需要重生成过程,而不是升频器。

最新模型

一个 API,畅享全模态 AI。

探索全部模型