在往下刷到下面的片段之前,先戴上耳机。在这个类别里,这真的很重要。
一把刀切向一颗由红宝石玻璃雕成的石榴。外壳裂开,发出水晶般的脆裂声,随后几十颗玻璃籽滚落到潮湿的石板上。这里和你今年刷到的几乎所有 AI ASMR 片段都不同:没有人后期加上这些声音。没有音效库,没有剪辑师,没有时间线。画面和音频来自同一次生成、同一次调用。
过去一年里,AI ASMR 看起来很解压,听起来却总有点不对,而问题从来不在视觉上。问题出在流程的最后一步。把音频贴到无声片段上一直是手工活,每一次都要人工完成。这个品类围绕这个缺口增长得太快,以至于出现了一小批专门的 AI ASMR generator 网站,纯粹用来自动完成拼接,其中一个甚至把「binaural 3D audio」直接写在首页主打位置。需求早就被验证了,只是一直靠组装来满足。
所以我认真跑了一遍。一个可复现的工作流,六个片段,然后做了这个类别里几乎没人会做的事:我用 ffmpeg 把左右声道拆开并进行了测量。有些结果和我预期的不一样,而这恰恰成了本文最有用的部分。
核心要点
- H3 会在同一次生成中渲染 24 fps 画面和一条 32 kHz AAC 立体声音轨。音频是生成出来的,不是事后配上的。
- 这个立体声确实是真立体声,不是披着立体声外衣的双单声道。但**你无法用提示词控制声像平移。**我要求一个从左到右的强烈扫动,结果只得到 1.9 dB 的差异,基本等于没有。
- 立体声宽度来自内容本身,不是来自你的措辞。雨声片段里我完全没要求方向,结果反而生成了真正宽阔的声场。
- 锁定首帧可以让不同分辨率下的镜头保持一致,但 **768P 和 2K 仍然是两条不同的 take。**草稿能预览观感和音频规格,不能预览精确动作编排。
- 一个 5 秒 768P 片段计费 $0.50。同一个片段 2K 计费 $0.70。整篇文章总成本 $4.27。
先听:一条一次生成完成的 MiniMax H3 ASMR 视频
五秒,2K,24 fps,32 kHz 立体声,一次生成,$0.70\。打开声音:刀刃咬入时的吱响、裂开的脆声,然后是籽粒滚落。没有任何声音是后期添加的。使用 minimax/h3/image-to-video 生成。
一个提示词。一个模型。一次调用。下面全部内容,就是这个片段如何制作、花了多少钱,以及哪些营销说法经得起波形图的检验。
AI ASMR 为什么爆红,以及为什么大多数都过不了耳机测试
这股趋势有一个明确的生日。AI ASMR 从 2025 年 6 月开始扩散,就在 Veo 3 发布之后,几天内这种形式就彻底爆了。@asmraiworks 的一个熔岩吃播在一周内获得超过 1130 万次观看;一个玻璃切割片段在十一天内达到 530 万次观看(Know Your Meme,2025)。新闻媒体也把它当作猎奇现象报道,超现实视觉和用筷子吃熔岩承担了大部分吸引力(The Express Tribune,2025)。
然后人们戴上耳机,氛围就变了。TechRadar 的作者看了一堆爆款之后,形容它们带着一层人工感,"lacking the errors and imprecision that are the hallmark of human-made ASMR"(TechRadar,2025 年 6 月)。文中引用的粉丝说,触发酥麻感的元素技术上都在,但它仍然不一样。
这里有一个机械层面的原因,并不神秘。ASMR 是唯一一个内容本身就是声音的类别。在别的地方,音频只是点缀;在这里,音频就是产品。而主流工作流是:
- 用视频模型生成一个无声片段,
- 去音效库里找裂声、脆响、雨声底噪,
- 在剪辑软件里把声音和画面对齐,
- 如果你在意,就手动做声像和平衡混音,而大规模生产时几乎没人会这么做,
- 导出。
第 3 步就是它失败的地方。一个罐头裂声晚了两帧触发,你还没来得及解释原因,大脑已经判断它是假的了。再乘以每日发布的节奏,错误会不断叠加,因为每一次对齐都要由人工重新做一遍。
这正是整个 AI ASMR generator 小产业存在的原因。至少有三个站点正在积极营销自己,其中一个把 binaural 3D audio 作为标题级功能。它们不是在解决一个伪问题,而是在补一个真实漏洞:它们底层的视频模型不会生成声音。
这也让一个榜单分裂值得一看。在 Artificial Analysis 的视频编辑榜单上,也就是那个把音频计入评分的榜单里,MiniMax H3 以 1,126 Elo 排名第一,领先 1,119 的 Gemini Omni Flash,并且比 1,027 的 Dreamina Seedance 2.0 高出约一百分(Artificial Analysis,2026 年 8 月)。而在 image-to-video 榜单上,音频并不是评分项,这些模型中有几个只差几分。差距是在声音被计入时拉开的。对 ASMR 来说,声音就是全部。
MiniMax H3 ASMR 视频工作流,以及每一步的成本
三个端点,一个浏览器标签页。本文所有内容都在 Atlas Cloud 上运行,所以以下每个数字都来自账单,而不是价格表。
| 本文中的任务 | 模型 | 费率 |
|---|---|---|
| 展示片段的首帧 | OpenAI GPT Image 2 (text-to-image) | 标价从 $0.009/image 起,高质量、2048x1152 实际计费 $0.1745 |
| 草稿与保留版 | MiniMax H3 Image-to-Video | 768P 为 $0.10/s,2K 为 $0.14/s |
| 输入真实录音 | MiniMax H3 Reference-to-Video | 同样两个档位 |
| 三个模板 | MiniMax H3 Text-to-Video | 同样两个档位 |
| 老方法,只算音频部分 | ByteDance Seed Audio 1.0 | $0.143/min |
列表页在三个 H3 端点上都显示 "From $0.1/SEC"。这是 768P 的底价。2K 按 $0.14/s 计费,而这个数字除了你的发票外不会出现在任何地方,所以要按你实际请求的档位来规划。
表 1:一次生成 vs 拼接流程。
| MiniMax H3,原生音频 | 无声模型加后期音频 | |
|---|---|---|
| 完成一个片段所需步骤 | 1 | 4 到 5 |
| 涉及工具 | 1 | 视频模型 + 音效库 + 剪辑器 + 导出 |
| 画面和声音如何保持同步 | 同一次生成,同一条时间线 | 你手动拖到看起来对为止 |
| 谁来混音和做声像 | 没有人,你接受模型给出的结果 | 你,每个声音都要手动处理 |
| 每条片段的人力时间 | 提示词之后基本为零 | 老实说,15 到 40 分钟 |
| 每个 5s 片段的计算成本 | 768P 为 $0.50 | 视频模型 + $0.143/min 的音频生成 |
我有意不引用竞争视频平台的每秒费率,因为差异不在算力上。音频生成是每分钟 $0.143,也就是几分钱。拼接流程的真正成本,是每条片段 20 分钟的人类注意力,而这个成本不会随着规模扩大而下降。它会成倍增加。一个每日更新的无露脸账号,正是那种每条 20 分钟会悄悄吞掉整个商业模式的场景。
公平地说,手工拼接的好处是控制力。你可以把一个声音放到立体声场的任意位置,并把它修到精确帧。H3 免费给你同步,但正如下方测量所示,它不会把那种控制权还给你。
表 2:三个 H3 端点,以及真正重要的参数。
| image-to-video | text-to-video | reference-to-video | |
|---|---|---|---|
| 主要输入 | image(首帧) | 仅 prompt | refers[] |
| resolution | 768P / 2K,默认 2K | 相同 | 相同 |
| duration | 4 到 15 之间的任意整数秒,默认 8 | 相同 | 相同 |
| ratio | 由首帧决定 | 必须显式设置,adaptive 会被拒绝 | 由参考素材决定 |
| refers 限制 | 不与 image 同时使用 | 不使用 | 最多 9 张图片、3 个视频、3 段音频 |
| 交付的 16:9 输出 | 768P 为 1344x768,2K 为 2560x1440 | 相同 | 相同 |
| 音轨 | 24 fps 视频上的 AAC 立体声 32 kHz | 相同 | 相同 |
有两个参数陷阱值得写在手上。参数名是 ratio,不是 aspect_ratio,用错 key 会让它保持未设置状态,于是 text-to-video 会拒绝请求。而 image 和 refers 放在同一次调用里不会报错:它会完成、全额计费,然后静默丢掉其中一个输入。
MiniMax H3 ASMR 视频教程:切开一颗玻璃石榴
切玻璃水果是所有人都认得的格式,所以读者一眼就知道自己在看什么。不过玻璃苹果和玻璃芒果已经被做烂了。石榴更好,原因很具体:外壳裂开时,会有几百颗玻璃籽洒出并滚动,所以声音有持续时间和结构,而不是一次居中的撞击。如果一个模型在假装生成音频,散落声最容易露馅。
第 1 步:用 GPT Image 2 构建基础帧
在把钱花到视频上之前,先锁定构图。设置:quality: high,size: 2048x1152(16:9),output_format: png。
Plain1Extreme close-up macro photograph of a whole pomegranate carved entirely from thick 2translucent ruby-red glass, resting on a wet black slate slab. The glass shell is 8mm 3thick with visible internal bubbles and chipped facets; hundreds of tiny glass seeds 4glow inside like garnet crystals. A polished Japanese santoku knife lies at the left 5edge of the frame, blade tip just touching the glass skin. One hard key light from the 6upper right rakes across the slab and throws sharp red caustics onto the wet stone. 7100mm macro, f/2.8, shallow depth of field, dark moody background. 8No hands, no text, no watermark, no logo.

Atlas Cloud 上的 GPT Image 2 playground,quality 设置为 high,尺寸为 16:9 2048x1152,玻璃石榴渲染在 OUTPUT 面板中
真实运行结果。Quality high ,2048x1152,页面报价 $0.1745,后来发票上也是这个数。

生成的基础帧:一颗由厚红宝石玻璃雕成的石榴放在潮湿的黑色石板上,一把 santoku 刀从左侧边缘切入
交给 H3 的这一帧。使用 openai/gpt-image-2/text-to-image 生成。
第 2 步:编写 MiniMax H3 ASMR 视频提示词中的声音部分
大多数人写 ASMR 提示词时,只是在画面描述前面硬加上 "ASMR",然后纳闷为什么模型给它配了低保真钢琴。只要你给出音频方向,H3 会认真对待。把音频部分拆成五个槽位:
- **材质。**是什么在发声。玻璃、蜡、熔岩、玻璃上的水。具体说明厚度和湿度,它们会改变音色。
- **动作及其时间形状。**不要只写「切开」,而要写「以一个缓慢连续的动作向下压」。模型会用它来放置声音事件。
- 麦克风视角。
close-mic、intimate、录音距离线索。这会决定声音听起来有多干、多近,而且效果很好。 - **拟声词序列。**按顺序把声音事件写出来:吱响,然后裂开,然后几十个小撞击,然后静音。这是最起作用的槽位。
- 负面约束。
no music, no voice, no narration, no room reverb, no ambience bed。不加这些,H3 会热心地加上一段配乐,因为它训练数据里的大多数视频都有配乐。
我也在第 4 个槽位里写了声道方向,要求裂声出现在左声道,籽粒从左滚到右。继续往下看,实际结果是什么。
第 3 步:运行 768P 草稿
用 768P 做草稿。两个档位的音轨规格相同,所以整个创意判断,也就是 ASMR 里最重要的听感判断,都可以在便宜档位完成。
minimax/h3/image-to-video 上的设置:image = 第 1 步输出,resolution: 768P,duration: 5。比例来自首帧,所以不用管。
Plain1The santoku blade enters from the left and presses down through the glass pomegranate 2in one slow continuous stroke, travelling left to right across the frame. The shell 3splits with a bright crystalline crack and a spray of tiny glass seeds tumbles onto the 4wet slate, scattering toward the right edge. Camera locked off, macro, single take, no cuts. 5 6Audio: ASMR, close-mic, intimate, no music, no voice, no narration, no room reverb. 7A dry sustained glass squeak as the edge bites in, then one sharp high crack panned to 8the LEFT channel, followed by dozens of small tinkling seed impacts rolling from the 9LEFT channel across to the RIGHT channel as they scatter. A faint blade-on-stone scrape 10at the very end, then silence. No ambience bed, no hum, no background music.

Atlas Cloud 上的 MiniMax H3 image-to-video playground,已加载基础帧,duration 为 5,OUTPUT 面板中显示完成的片段
image-to-video 运行:首帧已加载,duration 为 5,OUTPUT 已完成。注意 Resolution 选择器停留在 页面默认 的 2K。草稿时要切到 768P,下面这个片段就是用 768P 渲染的。
768P 草稿,$0.50\。画面比主片段更软,但音频规格相同。所有决策都是基于这一条 take 做出的。
第 4 步:在相信立体声之前先测量它
不要相信我的耳朵,也不要相信模型的说法。把声道拆开来看。这是本地 ffmpeg,没有 API 调用,没有成本:
Bash1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \ 2 -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \ 3 -frames:v 1 stereo-proof.png

四面板波形分析,对比玻璃石榴片段和雨声片段,显示每个片段的左右声道以及侧声道
两个片段的左声道叠在右声道上,下面是匹配增益后的侧声道(左减右)。整篇论证都在这张图里。
返回结果如下,其中一部分并不是我预期的。
**立体声是真的。**我生成的每个片段里,侧声道都不是空的。如果只是伪装成立体声的双单声道,那里应该什么都没有。这里确实有内容。
**但你不能用提示词控制声像平移。**我用大写字母要求裂声在 LEFT 声道,籽粒从 LEFT 滚到 RIGHT。测量结果:声道相关性 0.97,侧声道比中声道低 17.7 dB,任意四分之一秒窗口里的最大左右电平差只有 1.9 dB。这不是声像平移。这是一个居中的声像,带一点自然宽度。刀在画面中横向移动,声音却待在原地。
**宽度来自内容本身,不来自你的措辞。**下一节的雨声片段里,我完全没有要求方向,结果得到的相关性是 0.32,侧声道只比中声道低 2.9 dB。那是一个真正宽阔、去相关的声场。弥散氛围会自动获得宽度。离散撞击无论你怎么写,都接近中心。
所以,对这个模型诚实的说法不是空间上的,而是时间上的。你得到的是和画面一起生成、并且落在应有帧上的声音,免费、永久、无需剪辑师。如果你的格式真的需要强烈声像平移,你仍然必须在后期自己做,而且你应该停止在提示词里写声道名称,因为它们没有效果。
现在重新运行保留版:同一个端点、同一个首帧、同一个提示词,只把一个字段改成 resolution: 2K。在你以为草稿就是预览之前,还有一件事值得知道。

两行各五帧,对比 768P 和 2K 运行在相同时间戳下的画面,帧 0 完全一致,约 2.5 秒后开始分化
同一个首帧,同一个提示词,两个档位。第 0 帧完全匹配。到 2.5s 时,外壳以不同方式破裂,两条片段已经变成不同的 take。
锁定首帧可以让两个档位下的构图、取景、光线和颜色保持一致,这就是为什么你应该总是用 image-to-video,而不是 text-to-video 来做这个。它不会给你同一条 take。2K 运行会重新抽取动作。把草稿当作观感和声音的预览,而不是精确动作编排的预览。
第 5 步:把真实录音作为 MiniMax H3 ASMR 视频参考加入
如果你有一个真正想要的声音,把它交给模型。reference-to-video 最多接受 9 张图片、3 个视频和 3 段音频,并且会从音频参考里提取音色和房间特征,而不是完全凭提示词发明。我使用了 Wikimedia Commons 上 Gravity Sound 的一段适合公有领域使用的玻璃破碎录音(CC BY 4.0),把三条 take 拼接成 4.5 秒。
三条规则,后两条是我通过请求被拒才摸出来的:
- **音频不能单独提交。**端点写得很清楚:至少需要一张图片或一个视频,不能只提交音频。把它和一帧画面配对。
- **音频参考必须为 2 到 15 秒。**我第一次用了一个 1.49 秒的片段,返回
audio duration 1486 ms, expected [2000, 15000] ms。这个范围没有写在模型页面上。 - **文件格式会被检查。**一个声明为
audio/mpeg的 base64 payload 被拒绝,提示audio format ".mpeg" not allowed。.wavpayload 可以通过。被拒绝的请求不会计费,但会浪费一次往返。
设置:refers: [{url: <base frame>, type: "image"}, {url: <a 2 to 15s recording>, type: "audio"}],resolution: 768P,duration: 5。
Plain1Same locked-off macro shot: the blade slices the glass pomegranate from left to right 2and the seeds scatter. Match the timbre, brightness and room character of the reference 3audio, same recording distance, same dryness. ASMR close-mic, no music, no voice.

Atlas Cloud 上的 MiniMax H3 reference-to-video playground,已加载两个参考素材,slot 1 中是音频文件,slot 2 中是基础帧
Reference Materials 同时带着音频文件和图片,已使用 9 个名额中的 2 个。去掉图片,请求根本不会运行。
参考引导的 take,$0.50\。同一个镜头,音色由真实录音引导,而不是由提示词凭空发明。音频参考:Gravity Sound 的 Glass breaking,CC BY 4.0。
三个 MiniMax H3 ASMR 视频模板:切割、咀嚼、雨声
三个格式覆盖了这个类别里大多数表现好的内容。每个都是完整的粘贴即跑提示词,附带设置和生成片段。下面刻意不再出现玻璃、红色或石板:如果你账号上的每个片段看起来都一样,算法也会把它们当成同一个片段。
表 3:同样五个槽位,三种不同任务。
| 槽位 | 模板 1,切割 | 模板 2,咀嚼 | 模板 3,雨声 |
|---|---|---|---|
| 材质 | 滴落的蜂巢,热钢刀片 | 发光的熔岩,石碗 | 汽车窗玻璃上的雨 |
| 动作形状 | 刀刃从前向后压入,蜂蜜向下拉丝 | 筷子夹起,然后两口咬下 | 没有主体动作,只有水滴 |
| 麦克风视角 | close-mic,非常干,没有房间声 | 极近距离,亲密 | 玻璃外侧,车舱内略闷 |
| 声音序列 | 蜡质裂开,蜂蜜拉伸,滴到盘子上 | 熔融滋滋声,湿润咀嚼,玻璃般脆响,呼气 | 稳定雨声底噪,水滴撞击,远处轮胎嘶声 |
| 负面约束 | no music, no voice, no room reverb | no words, no music, no narration | no music, no thunder, no voice, no wipers |
**模板 1,切割。**蜂巢,琥珀与金色,9:16,768P,6 秒,ratio: "9:16"。
Plain1Extreme macro, locked-off overhead shot of a thick slab of golden honeycomb on a pale 2ceramic plate, honey already pooling around it. A hot steel blade lowers into the wax 3and sinks through it front to back in one slow continuous press; the cut faces slump 4and a heavy thread of honey stretches and drips onto the plate. Warm amber key light 5from the left, shallow depth of field, single take, no cuts, no hands in frame. 6 7Audio: ASMR, close-mic, very dry, no room reverb, no music, no voice, no narration. 8A soft crackling of wax splitting under the blade, then a thick low stretching pull as 9the honey lengthens, then two heavy wet drips landing on the ceramic plate. Nothing else.
模板 1,$0.60\。蜡裂声、蜂蜜拉丝、滴落。使用 minimax/h3/text-to-video 生成。
**模板 2,咀嚼。**熔岩吃播,也就是一周获得 1130 万次观看的格式,9:16,768P,8 秒,ratio: "9:16"。
Plain1Vertical close-up: a pair of black lacquer chopsticks lifts a glowing clump of molten 2orange lava out of a dark stone bowl and carries it toward the camera, out of frame at 3the bottom. The lava is self-illuminating, casting orange light on everything around it; 4the rest of the room is almost black. Steam curls off the surface. Locked-off camera, 5single take, no cuts. 6 7Audio: ASMR, extremely close-mic, intimate, no words, no music, no narration, no room tone. 8A low molten sizzle and bubbling as the lava is lifted, then a soft wet chew, then a 9brighter glassy crunch on the second bite, then one slow satisfied exhale. No speech.
模板 2,$0.80\。滋滋声、咀嚼、脆响、呼气,而且一句话都没有。使用 minimax/h3/text-to-video 生成。
**模板 3,雨声。**夜晚车窗,冷蓝与霓虹,16:9,768P,10 秒,ratio: "16:9"。
这是三个模板里唯一一个没有主体动作的,也最能说明负面约束的重要性。画面上没有事件发生时,H3 会倾向于加一层音乐底噪,除非你明确禁止。它也是返回结果中立体声场最宽的片段,尽管我并没有要求。面向睡眠的内容需要更长时长,所以这条接近可用时长范围的上限。
Plain1Macro shot through the inside of a car window at night, heavy rain running down the 2outside of the glass. Individual droplets hit, hesitate, then streak downward and merge. 3Beyond the glass, out-of-focus neon signage breaks into cold blue and magenta bokeh. 4No wipers, no people, no movement inside the car. Camera locked off, single continuous 5take, shallow depth of field, no cuts. 6 7Audio: ASMR, close-mic on the outside of the glass, cabin slightly muffled. 8A steady even rain bed with clearly separated individual droplet impacts on the glass, 9plus a faint distant hiss of tyres on a wet road. No music, no thunder, no voice, 10no narration, no wiper noise.
模板 3,$1.00\。十秒纯氛围,没有配乐,因为提示词禁止了它。使用 minimax/h3/text-to-video 生成。
一条 MiniMax H3 ASMR 视频到底多少钱
这是本文的收据,不是估算。
| 项目 | 数量 | 计费 |
|---|---|---|
| GPT Image 2 基础帧,high,2048x1152 | 1 | $0.17 |
| 2K 保留版,5s,image-to-video | 1 | $0.70 |
| 768P 草稿,5s,image-to-video | 1 | $0.50 |
| 768P reference-to-video,5s | 1 | $0.50 |
| 768P 模板片段,6s + 8s + 10s | 3 | $2.40 |
| 被拒绝的 reference 请求 | 2 | $0.00 |
| 总计 | $4.27 |
六条可发布片段和一张基础帧。按发布计划放大:每天一条 8 秒竖屏 768P 片段是 $0.80,所以一个每日更新的无露脸账号,计算成本大约是每月 $24,这还没算你在剪辑软件里花的一分钟。
两条计费说明。GPT Image 2 标出的 $0.009 是 token 档位底价;一次高质量 2048x1152 渲染会落到 $0.1745,接近它的二十倍,所以要按你实际使用的档位做预算。另外 H3 的 price 字段会延迟回填:轮询到 status 为 completed 时,它常常仍然是 undefined。稍等片刻后再用 prediction id 轮询一次,才能拿到真实数字。第二次轮询是生成像本文这样的收据,而不是猜测的唯一办法。
关于 ASMR 音频和权利的一点诚实说明
不要把别人的 ASMR 录音作为 refers 音频文件上传。参考音频确实会把音色迁移到输出中,而把一段录音跑进模型并不会改变它的所有权。本文使用的参考是 CC BY 4.0,并已在上文署名,找到它大约花了两分钟。
不要围绕某个可识别真人的声音制作 ASMR。本文所有模板都刻意无声人声,这既是该类型的惯例,也是最少麻烦的路径。
通过 API 调用 H3 不受开放权重所附社区许可的影响。该许可覆盖的是自托管,目前排除了欧盟、英国、韩国和美国,并且这些地区有正式授权通道。值得知道,但如果你只是调用端点,就不值得担心。
MiniMax H3 ASMR 视频:常见问题
MiniMax H3 ASMR 视频会生成自己的声音,还是需要我后期添加?
模型会生成声音。画面和音频来自同一次生成:交付文件中是 24 fps 视频,并带有 32 kHz AAC 立体声音轨。没有单独的音频步骤,没有音效库,也没有对齐工作,这正是这个端点对 ASMR 特别有意思的全部原因。
我能让 MiniMax H3 ASMR 视频从左到右做声像平移吗?
不能靠提示词实现。我在提示词里写了明确的声道方向,并测量了结果:声道相关性 0.97,任意四分之一秒窗口内最大电平差 1.9 dB,完全不是声像平移。音轨确实是真立体声,像雨这种弥散内容会返回宽阔声场,但离散撞击无论怎么写都保持居中。如果你的格式需要强烈声像平移,请在后期完成。
我可以上传自己的录音作为 MiniMax H3 ASMR 视频参考吗?
可以,通过 reference-to-video,它最多接受 3 段音频参考,同时还可带最多 9 张图片和 3 个视频。音频不能单独提交,所以至少要搭配一张图片或一个视频。音频还必须在 2 到 15 秒之间,并且格式会被验证:.wav payload 可以通过,而 audio/mpeg 被拒绝。被拒绝的请求不会计费。
768P MiniMax H3 ASMR 视频的音频会比 2K 差吗?
不会。两个档位交付相同的 AAC 立体声 32 kHz 规格。变化的只有画面,而且差异很大:16:9 在 768P 下返回 1344x768,在 2K 下返回 2560x1440。既然 ASMR 的创意判断本质上是听感判断,就用 $0.10/s 做草稿,再用 $0.14/s 重新跑保留版。只要记住,2K 运行是一条新的 take,不是草稿的 upscale。
MiniMax H3 ASMR 视频应该多长、用什么画幅比例?
时长接受 4 到 15 之间的任意整数秒。切割和咀嚼片段适合 5 到 8 秒,因为高潮就是一个事件;面向睡眠的氛围内容需要 10 秒或更长。Shorts、Reels 和 TikTok 使用 9:16,并记住 text-to-video 要求显式设置 ratio,且会拒绝 adaptive。在 image-to-video 中,首帧会替你决定画面形状。
一条 MiniMax H3 ASMR 视频多少钱?
一个 5 秒片段在 768P 下计费 $0.50,在 2K 下计费 $0.70。一个 8 秒竖屏 768P 片段是 $0.80\。每天发布一条,大约是每月 $24 的计算成本,这才是应该拿来和拼接流程中每条片段 20 分钟剪辑时间比较的数字。
为什么我的 MiniMax H3 ASMR 视频会出现我从没要求的背景音乐?
因为你没有禁止它。任何模型训练数据里的大多数视频都有音乐底噪,所以默认行为就是加上一段,尤其是画面上没有事件发生时。把负面约束明确写进提示词的音频部分:no music, no voice, no narration, no room reverb, no ambience bed。氛围类模板比动作类模板更需要这一点。






