Seedance 2.5 現已上線 — 首發於 Atlas Cloud

MiniMax H3 ASMR 影片:我切開了一顆玻璃石榴,然後測量立體聲是否真實

大多數 AI ASMR 將庫存音效貼到無聲影片上。MiniMax H3 的 ASMR 影片能一次處理 32 kHz 立體聲。我測量了聲道,包含提示詞與成本。

戴上耳機再往下滑。這種類別,聲音真的重要。

一把刀切開一顆紅寶石玻璃雕刻的石榴。外殼裂開,發出水晶般的碎裂聲,接著幾十顆玻璃種子滾落在濕板岩上。接下來這一段,跟今年你滑過的任何AI ASMR片段都不一樣:沒有人後製這些聲音。沒有音效庫、沒有剪輯軟體、沒有時間軸。畫面跟音訊是從一次生成、一次呼叫中同時產出的。

過去一年,AI ASMR看起來很療癒,聽起來卻不太對勁,原因從來不是畫面。問題出在流程的最後一步:把音訊黏到無聲片段上,一直都是手動完成的,每一次都是。這個類別成長得太快,以至於圍繞這個缺口,出現了一整個專門的自動化AI ASMR生成網站產業,其中一個甚至直接在首頁主打「雙耳3D音訊」。需求早就被證實了,只是以前靠組裝線來滿足。

所以我正確地跑了一次。一個可重現的工作流程、六個片段,然後做了這個類別裡從來沒有人做的事:用ffmpeg把左右聲道拆開來測量。有些我原本預期的結果是錯的,而這正是這篇文章最有用的部分。

關鍵重點

  • H3在同一趟渲染中同時產出24fps的畫面以及32 kHz AAC立體聲音軌。音訊是生成的,不是事後配音的。
  • 立體聲是真的立體聲,不是穿著立體聲外衣的雙單聲道。但你無法透過提示詞來控制聲像平移。我要求一個從左到右的硬掃,結果只得到1.9 dB的差異,幾乎等於零。
  • 立體聲的寬度來自內容本身,而不是你的文字描述。下雨片段中我完全沒有指定方向,結果卻產出了真正寬廣的聲場。
  • 鎖定第一幀可以在不同解析度間保持畫面構圖,但768P和2K仍然是兩個不同的拍攝版本。草稿預覽的是視覺風格和音訊規格,不是精確的動作編排。
  • 一個5秒的768P片段收費**$0.50**。同樣的片段在2K收費**$0.70**。整篇文章總共花費$4.27。

先聽再說:一次生成的MiniMax H3 ASMR影片

w7ZRR7bo3KI

五秒、2K、24fps、32 kHz立體聲、一次生成、$0.70。開聲音:刀刃切入的吱嘎聲、碎裂聲、然後是種子聲。沒有一項是後加的。以minimax/h3/image-to-video生成。

一個提示詞、一個模型、一次呼叫。以下就是這個片段如何製作的、成本多少、以及行銷故事中有哪些部分經得起波形檢驗。

為什麼AI ASMR爆紅,但大部分經不起耳機測試

這個趨勢有個生日。AI ASMR在2025年6月開始擴散,就在Veo 3上線後,幾天內就病毒式傳播。@asmraiworks 的一個熔岩吃播吸引了超過1130萬次觀看;一個玻璃切割片段在11天內達到530萬次觀看(Know Your Meme,2025)。新聞媒體把它當作新奇事物報導,超現實的畫面和用筷子吃熔岩的畫面成了主要賣點(The Express Tribune,2025)。

然後人們戴上耳機,氣氛就變了。TechRadar的記者看了一堆病毒片段後,描述了一種人工感,「缺乏人類ASMR特有的錯誤和不精確」(TechRadar,2025年6月)。該報導引用的粉絲說,觸發感官的要素在技術上都存在,但感覺就是不一樣。

這背後有機械性的原因,並不神秘。ASMR是唯一一種「內容就是聲音」的內容類別。其他地方音訊都是配菜,但在這裡,聲音就是產品。而主流的工作流程是:

  1. 用影片模型生成一段無聲片段,
  2. 從音效庫中找尋碎裂聲、嘎吱聲、雨聲背景,
  3. 在剪輯軟體中把聲音對齊畫面,
  4. 如果你在乎的話(但大量產出時幾乎沒人做),手動調整聲像和混音,
  5. 輸出。

第三步就是問題所在。一個預製的碎裂聲如果晚了兩幀,聽起來就是假的,而且你還沒辦法解釋為什麼。乘以每天發布的頻率,錯誤會不斷累積,因為對齊工作每次都是人工重新做。

這個缺口正是整個AI ASMR生成網站產業存在的原因。至少有三個正在積極行銷,其中一個甚至把雙耳3D音訊作為主打功能。它們解決的不是假問題,而是填補一個真正的洞:底層的影片模型不產生聲音。

這讓某個排行榜上的差異值得一看。在Artificial Analysis的影片編輯排行榜上,評分包含音訊的那個,MiniMax H3以1126 Elo排名第一,領先Gemini Omni Flash的1119,並比Dreamina Seedance 2.0的1027高出約一百分(Artificial Analysis,2026年8月)。在圖片轉影片的排行榜上(音訊不計分),這幾個模型的分數相差不大。當聲音被計入時,差距就出現了。而對ASMR來說,聲音就是一切。

MiniMax H3 ASMR影片工作流程,以及每個步驟的成本

三個端點,一個瀏覽器分頁。這篇文章中的所有內容都是在Atlas Cloud上跑的,所以以下每一個數字都來自帳單,而不是牌價表。

本文中的工作模型費率
展示用的第一幀OpenAI GPT Image 2 (文字轉圖片)標示從$0.009/張起,實際以高品質及2048x1152收費$0.1745
草稿和最終成品MiniMax H3 圖片轉影片768P: $0.10/秒,2K: $0.14/秒
餵入真實錄音MiniMax H3 參考素材轉影片同上兩個價位
三個範本MiniMax H3 文字轉影片同上兩個價位
舊方式,僅音訊部分ByteDance Seed Audio 1.0$0.143/分鐘

列表顯示H3三個端點都是「從$0.1/秒起」。這是768P的底價。2K收費$0.14/秒,而這個數字只出現在你的帳單上,所以請根據你實際要求的等級來規劃預算。

表1:一次生成 vs. 拼接流程。

 MiniMax H3,原生音訊無聲模型 + 後製音訊
完成一個片段所需的步驟14 到 5
涉及的工具1影片模型 + 音效庫 + 剪輯軟體 + 輸出
畫面和聲音如何同步同一次生成,同一條時間軸你手動拖曳直到看起來對齊
誰負責混音和聲像沒有人,模型給你什麼就是什麼你,手動,每個聲音都要處理
每個片段的人工時間提示詞後幾乎為零15 到 40 分鐘,老實說
每個5秒片段的運算成本$0.50 (768P)影片模型 + $0.143/分鐘的音訊生成

我刻意不引用其他影片平台的每秒費率,因為運算成本不是關鍵差異。音訊生成每分鐘$0.143,幾乎是零頭。拼接流程真正的成本是每個片段20分鐘的人力投入,而且這個成本不會隨著規模擴大而下降,只會倍增。一個每天發布的無臉帳號,就是這種每個片段20分鐘的流程會悄悄吃掉整個商業模式的地方。

老實說公平一點:手動拼接讓你擁有控制權。你可以把聲音放在立體聲場的任何位置,並精確到每一幀。H3免費給你同步,但如下方的測量所示,它不會把控制權還給你。

表2:三個H3端點,真正重要的參數。

 圖片轉影片文字轉影片參考素材轉影片
主要輸入圖片(第一幀)僅提示詞refers[]
解析度768P / 2K,預設2K相同相同
時長任何整數秒,4到15,預設8相同相同
比例由第一幀決定必須明確設定,adaptive會被拒絕由參考素材決定
refers限制不能與圖片同時使用不使用最多9張圖片、3個影片、3個音訊
輸出的16:9畫面768P: 1344x768,2K: 2560x1440相同相同
音軌AAC立體聲32 kHz,24fps影片相同相同

兩個參數陷阱值得寫在手心上。參數名稱是ratio,不是aspect_ratio,用錯鍵會讓文字轉影片拒絕請求。另外,在同一次呼叫中同時使用imagerefers不會報錯:它會完成、全額收費,然後默默地丟掉其中一個輸入。

MiniMax H3 ASMR影片教學:切玻璃石榴

玻璃水果切割是大家都認得的格式,所以讀者一眼就知道在看什麼。玻璃蘋果和玻璃芒果已經被玩爛了。石榴比較好,原因很具體:當外殼裂開時,數百顆玻璃種子會灑出來並滾動,因此聲音有持續時間和結構,而不只是一個中心點撞擊。如果模型是在偽造音訊,散射場景就會露出破綻。

步驟1:用GPT Image 2建立基礎圖框

在花錢做影片之前先鎖定構圖。設定:quality: highsize: 2048x1152(16:9),output_format: png

plaintext
1極近距離巨觀照片,一整顆用厚半透明紅寶石玻璃雕刻而成的石榴,放在濕黑色板岩板上。玻璃外殼厚8mm,內部有可見氣泡和切面;數百顆微小玻璃種子在內部像石榴石晶體般發光。一把拋光日本三德刀位於畫面左側,刀尖剛好觸碰玻璃表皮。一道從右上角打來的硬光划過石板,在濕石頭上投射出銳利的紅色焦散光。100mm微距鏡頭,f/2.8,淺景深,暗色調背景。沒有手,沒有文字,沒有浮水印,沒有標誌。

AI圖片生成器介面,顯示文字提示和生成的圖片

Atlas Cloud上的GPT Image 2操作區,品質設為high,尺寸16:9 2048x1152,玻璃石榴呈現在OUTPUT面板中

實際執行。品質high,尺寸2048x1152,頁面顯示$0.1745,帳單也是這個數字。

刀刃切開深色石頭上的半透明紅色玻璃石榴

生成的基礎圖框:厚紅寶石玻璃雕刻的石榴放在濕黑色板岩上,三德刀從左側切入

交給H3的圖框。以openai/gpt-image-2/text-to-image生成。

步驟2:撰寫MiniMax H3 ASMR影片提示詞的聲音部分

大多數人寫ASMR提示詞時,只是把「ASMR」一詞貼在畫面描述前面,然後奇怪為什麼模型配上鋼琴背景音樂。H3會認真對待音訊方向,只要你給它。把聲音部分結構化成五個區塊:

  1. 材質。 什麼東西發出聲音。玻璃、蠟、熔岩、水在玻璃上。要具體說明厚度和濕潤度,它們會改變音色。
  2. 動作及其時間形狀。 不只是「切」,而是「以一個緩慢連續的動作壓下去」。模型會用這個來安排事件時間點。
  3. 麥克風視角。close-micintimate、錄音距離提示。這會設定聲音的乾燥度和接近感,效果很好。
  4. 擬聲詞序列。 按順序拼出聲音事件:吱嘎聲、然後碎裂聲、然後幾十個小撞擊聲、然後靜音。這個區塊作用最大。
  5. 負面描述。no music, no voice, no narration, no room reverb, no ambience bed。沒有這些,H3會好心加上配樂,因為訓練資料中的大部分影片都有配樂。

我也在區塊4裡寫了聲道方向,要求碎裂聲在左聲道,種子從左滾到右。繼續看下去,看看實際產出了什麼。

步驟3:跑768P草稿

用768P跑草稿。兩個等級的音軌規格相同,所以整個創意判斷(在ASMR中就是聽覺判斷)可以在便宜的費率下完成。

minimax/h3/image-to-video上的設定:image = 步驟1的輸出,resolution: 768Pduration: 5。比例由第一幀決定,所以不要動它。

plaintext
1三德刀從左側進入,以一個緩慢連續的動作壓過玻璃石榴,從左向右橫越畫面。外殼裂開,發出明亮的晶體碎裂聲,一陣細小的玻璃種子灑落在濕板岩上,向右側散開。相機固定,巨觀,單次拍攝,無剪接。
2
3音訊:ASMR,close-mic,親密感,無音樂,無人聲,無旁白,無房間殘響。
4一個乾燥持續的玻璃吱嘎聲,刀刃切入時,然後一個尖銳的高音碎裂聲,定位在LEFT聲道,接著幾十個細小的叮噹種子撞擊聲,從LEFT聲道滾向右側RIGHT聲道,散開。最後極輕微的刀刃擦石聲,然後靜音。無環境背景聲,無雜訊,無背景音樂。

AI影片生成器介面,顯示玻璃石榴影片

Atlas Cloud上的MiniMax H3圖片轉影片操作區,載入基礎圖框,時長5,OUTPUT面板中已完成片段

圖片轉影片執行:載入第一幀,時長5,OUTPUT完成。注意解析度選擇器停留在頁面預設的2K。草稿時請切換到768P,以下片段就是用768P渲染的。

xkolGEKI7UI

768P草稿,$0.50。畫面比最終成品柔和,音訊規格相同。這個版本就是所有決策依據的來源。

步驟4:在信任之前先測量立體聲

不要相信我的話,也不要相信模型的話。把聲道拆開來看。這是本機ffmpeg,不需要API呼叫,不花錢:

plaintext
1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \
2  -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \
3  -frames:v 1 stereo-proof.png

兩個ASMR音訊片段的立體聲道分離波形比較

四面板波形分析,比較玻璃石榴片段和下雨片段,顯示左右聲道以及各自的下方側聲道

兩個片段的左聲道疊在右聲道上方,加上下方以相同增益顯示的側聲道(左減右)。這張圖就是整個論點。

以下是回傳的結果,其中一部分出乎我的意料。

立體聲是真的。 我生成的任何片段中,側聲道都不是空的。如果是偽裝成立體聲的雙單聲道檔案,側聲道會是空的。這個有內容。

但你無法透過提示詞控制聲像。 我用大寫字母要求碎裂聲在LEFT聲道,種子從LEFT滾到RIGHT。測量結果:聲道相關性0.97,側聲道比中聲道低17.7 dB,任何四分之一秒視窗內的最大左右聲道電平差是1.9 dB。這不是聲像平移,這是中心點影像帶有一點自然寬度。刀刃橫越畫面,但聲音位置不動。

寬度來自內容本身,而不是你的文字。 下一節的下雨片段,我完全沒有指定方向,結果相關性為0.32,側聲道僅比中聲道低2.9 dB。這是真正的寬廣、去相關聲場。擴散環境音會自動獲得寬度,而離散撞擊聲無論你寫什麼都會停留在中心附近。

所以這個模型老實說,它的強項不是空間定位,而是時間定位。你得到的是與畫面同時生成、且準確落在對應幀上的聲音,免費、永遠、不需要剪輯軟體。如果你的格式真的需要硬聲像平移,你還是得在後製中自己處理,而且你應該停止在提示詞中寫聲道名稱,因為它們沒有效果。

現在重新跑最終成品:同一個端點、同一張第一幀、同一個提示詞,把一個欄位改成resolution: 2K。在假設草稿是預覽之前,還有一件事值得知道。

兩種解析度切割玻璃石榴的比較

兩排五幀,比較768P和2K版本在相同時間點的畫面,在第零幀完全相同,從約2.5秒開始分歧

同一張第一幀、同一個提示詞、兩個等級。第零幀完全一致。到2.5秒時,外殼破裂的方式不同,兩個片段變成了不同的版本。

鎖定第一幀可以保持兩個等級的構圖、取景、光線和顏色一致,這就是為什麼你應該總是使用圖片轉影片而不是文字轉影片。但這不會給你相同的版本。2K版本會重新擲骰動作。請把草稿當作對視覺風格和聲音的預覽,而不是對精確動作編排的預覽。

步驟5:加入真實錄音作為MiniMax H3 ASMR影片參考素材

如果你有想要的聲音,直接交給它。reference-to-video可以接受最多9張圖片、3個影片和3個音訊片段,它會從音訊參考中提取音色和空間特性,而不是自己憑空產生。我使用了Gravity Sound在Wikimedia Commons上發布的公共領域玻璃破裂錄音(CC BY 4.0),三個片段拼接成4.5秒。

三個規則,其中最後兩個是我在請求被拒絕時才學到的:

  • 音訊不能單獨使用。 端點明確說明:至少需要一張圖片或一個影片,音訊不能單獨存在。必須搭配一個圖框。
  • 音訊參考必須在2到15秒之間。 我第一次嘗試用了1.49秒的片段,結果回傳audio duration 1486 ms, expected [2000, 15000] ms。這個範圍不在模型頁面上。
  • 檔案格式會驗證。 一個宣告為audio/mpeg的base64負載被拒絕,顯示audio format ".mpeg" not allowed.wav負載則通過。被拒絕的請求不會收費,但會浪費一次往返。

設定:refers: [{url: <基礎圖框>, type: "image"}, {url: <一個2到15秒的錄音>, type: "audio"}]resolution: 768Pduration: 5

plaintext
1同樣的固定巨觀畫面:刀刃從左到右切開玻璃石榴,種子散開。匹配參考音訊的音色、亮度和空間特性,同樣的錄音距離、同樣的乾燥度。ASMR close-mic,無音樂,無人聲。

AI影片生成器介面,顯示提示詞輸入和生成的石榴影片

Atlas Cloud上的MiniMax H3參考素材轉影片操作區,載入了兩個參考素材,音訊檔案在位置1,基礎圖框在位置2

參考素材同時載入音訊檔案和圖片,已使用2/9。若移除圖片,請求將完全無法執行。

mY1VrOfM3cM

參考素材引導的版本,$0.50。同樣的畫面,音色由真實錄音引導,而非從提示詞憑空產生。音訊參考:Glass breaking by Gravity Sound,CC BY 4.0。

三個MiniMax H3 ASMR影片範本:切割、咀嚼、雨聲

三個格式涵蓋了這個類別中大部分表現良好的內容。每個都是完整可複製貼上的提示詞,附上設定和產出的片段。刻意不包含玻璃、紅色或石板:如果你的帳號中每個片段看起來都一樣,演算法會把它們當作同一個片段。

表3:相同的五個區塊,三個不同的工作。

區塊範本1:切割範本2:咀嚼範本3:雨聲
材質滴蜜的蜂巢,熱鋼刀片發光的熔岩,石碗車窗玻璃上的雨
動作形狀刀片從前到後沉入,蜂蜜往下拉筷子夾起,咬兩口無主體動作,只有水滴
麥克風視角close-mic,非常乾,無空間極近距離,親密感玻璃外,車廂內悶聲
聲音序列蠟裂聲,蜂蜜拉伸聲,滴在盤子上熔岩嘶嘶聲,濕潤咀嚼聲,玻璃脆響,呼氣穩定雨聲背景,水滴撞擊聲,遠處輪胎水聲
負面描述無音樂,無人聲,無房間殘響無語言,無音樂,無旁白無音樂,無雷聲,無人聲,無雨刷

範本1:切割。 蜂巢,琥珀色與金色,9:16,768P,6秒,ratio: "9:16"

plaintext
1極近距離巨觀,固定俯拍,厚金色蜂巢放在淺色陶瓷盤上,蜂蜜已在周圍流淌。一把熱鋼刀片降低到蠟中,以一個緩慢連續的壓力從前到後沉入;切面塌陷,一股濃稠的蜂蜜拉長並滴落盤中。暖琥珀色主光從左側打來,淺景深,單次拍攝,無剪接,畫面中無手。
2
3音訊:ASMR,close-mic,非常乾燥,無房間殘響,無音樂,無人聲,無旁白。刀刃下蠟分裂的輕微劈啪聲,然後蜂蜜拉長時低沉緩慢的拉伸聲,然後兩滴濃重濕潤的滴落聲落在陶瓷盤上。無其他聲音。

ZsVmf9AhPnw

範本1,$0.60。蠟裂聲、蜂蜜拉伸聲、滴落聲。以minimax/h3/text-to-video生成。

範本2:咀嚼。 熔岩吃播,這個格式一周內吸引了1130萬次觀看,9:16,768P,8秒,ratio: "9:16"

plaintext
1垂直近距離:一雙黑漆筷子夾起一團發光的橙色熔岩,從深色石碗中提起,朝相機方向移動,在畫面底部消失。熔岩自發光,在周圍投射出橙色光線;房間其餘部分幾乎全黑。蒸氣從表面升起。相機固定,單次拍攝,無剪接。
2
3音訊:ASMR,極近距離麥克風,親密感,無語言,無音樂,無旁白,無房間音。熔岩被提起時低沉嘶嘶聲和冒泡聲,然後柔軟濕潤的咀嚼聲,然後第二口時較明亮的玻璃脆響,然後緩慢滿足的呼氣聲。無說話聲。

UJhEsTnKkZI

範本2,$0.80。嘶嘶聲、咀嚼聲、脆響、呼氣,沒有一個字。以minimax/h3/text-to-video生成。

範本3:雨聲。 夜間車窗,冷藍色與霓虹光,16:9,768P,10秒,ratio: "16:9"

這是三個範本中唯一沒有主體動作的,也最能說明負面描述的重要性。當畫面上沒有事情發生時,H3會主動加上背景音樂,除非你明確禁止。這也是回傳立體聲場最寬廣的片段,完全沒有被要求。助眠類內容需要長度,所以這個片段接近有用時長的上限。

plaintext
1從車內透過車窗的巨觀鏡頭,夜間,大雨在玻璃外側流淌。個別水滴撞擊、停滯、然後向下流淌並合併。玻璃之外,失焦的霓虹招牌散成冷藍色和洋紅色散景。無雨刷,無人,無車內移動。相機固定,單次連續拍攝,淺景深,無剪接。
2
3音訊:ASMR,close-mic在玻璃外側,車廂內輕微悶聲。穩定均勻的雨聲背景,帶有清晰分離的個別水滴撞擊玻璃聲,加上遠處微弱的輪胎在濕路上的嘶嘶聲。無音樂,無雷聲,無人聲,無旁白,無雨刷聲。

bUKr5V6wbdM

範本3,$1.00。十秒純環境音,沒有配樂因為提示詞禁止了。以minimax/h3/text-to-video生成。

MiniMax H3 ASMR影片實際成本

以下是這篇文章的收據,不是估算。

項目數量收費
GPT Image 2基礎圖框,高品質,2048x11521$0.17
2K最終成品,5秒,圖片轉影片1$0.70
768P草稿,5秒,圖片轉影片1$0.50
768P參考素材轉影片,5秒1$0.50
範本片段(768P,6秒+8秒+10秒)3$2.40
被拒絕的參考素材請求2$0.00
總計 $4.27

六個可發布的片段和一個基礎圖框。擴展到每日發布排程:一個8秒直式片段,768P,每天$0.80,所以一個每天發布的無臉帳號大約每月$24,還沒算上在剪輯軟體中花的時間。

兩個帳單注意事項。GPT Image 2標示的$0.009是令牌等級的底價,高品質2048x1152渲染實際收費$0.1745,將近20倍,所以請根據你實際使用的等級來預算。另外,H3的price欄位會延遲回填:輪詢直到status變成completed,它常常還是undefined。稍等片刻再輪詢一次預測ID,才能拿到真實數字。第二次輪詢是唯一能像這樣建立收據而不是猜測的方法。

關於ASMR音訊與版權的一點誠實提醒

不要上傳別人的ASMR錄音作為refers音訊檔案。參考素材確實會將音色遷移到輸出中,而且把錄音丟進模型並不會改變所有權。這裡使用的參考素材是CC BY 4.0,並已在上方標註出處,大約花了兩分鐘找到。

不要圍繞可辨識的真人人聲來建立ASMR。這篇文章中的每個範本都刻意沒有人聲,這既是類別慣例,也是最簡單的路徑。

透過API呼叫H3不受開放權重附帶的社群授權影響。那個授權涵蓋自託管,目前排除歐盟、英國、韓國和美國,並為這些地區開放了正式授權管道。如果你只是呼叫端點,知道就好,不必擔心。

MiniMax H3 ASMR影片:常見問題

MiniMax H3 ASMR影片是自己產生聲音,還是我需要事後加入?

模型會產生聲音。畫面和音訊來自同一次渲染:24fps影片,內含AAC立體聲32 kHz音軌。沒有獨立的音訊步驟、沒有音效庫、沒有對齊工作,這正是這個端點對ASMR特別有趣的原因。

我可以讓MiniMax H3 ASMR影片從左到右聲像平移嗎?

靠提示詞不行。我在提示詞中明確寫了聲道方向,並測量了結果:聲道相關性0.97,任何四分之一秒視窗內的最大電平差為1.9 dB,完全不是平移。音軌是真正的立體聲,像下雨這樣的擴散內容會回傳寬廣的聲場,但離散撞擊聲無論你怎麼寫都會停留在中心。如果你的格式需要硬聲像平移,請在後製中處理。

我可以上傳自己的錄音作為MiniMax H3 ASMR影片的參考素材嗎?

可以,透過reference-to-video,它最多接受3個音訊參考素材,同時最多9張圖片和3個影片。音訊不能單獨提交,所以必須搭配至少一張圖片或一個影片。音訊長度必須在2到15秒之間,且格式會驗證:.wav負載可行,而audio/mpeg會被拒絕。被拒絕的請求不會收費。

768P MiniMax H3 ASMR影片的音訊比2K差嗎?

不會。兩個等級都提供相同的AAC立體聲32 kHz規格。只有畫面不同,而且差異很大:16:9在768P回傳1344x768,在2K回傳2560x1440。既然ASMR的創意判斷是聽覺判斷,請以$0.10/秒跑草稿,再以$0.14/秒跑最終成品。但請記住,2K版本是新的拍攝,而不是草稿的放大版。

MiniMax H3 ASMR影片應該多長?什麼寬高比?

時長接受4到15秒的任何整數。切割和咀嚼類片段適合5到8秒,因為重點是一個事件;助眠類環境音則需要10秒或更多。對於Shorts、Reels和TikTok,請使用9:16,並記住文字轉影片需要明確設定ratio,且不接受adaptive。在圖片轉影片中,第一幀會決定比例。

一個MiniMax H3 ASMR影片要花多少錢?

一個5秒片段收費$0.50(768P)和$0.70(2K)。一個8秒直式片段(768P)是$0.80。每天發布一個這樣的片段,每月運算成本約$24,這個數字值得與拼接流程中每個片段剪輯軟體需要的20分鐘人力成本相比較。

為什麼我的MiniMax H3 ASMR影片出現了我不想要的背景音樂?

因為你沒有禁止它。任何模型的訓練資料中,大部分影片都有背景音樂,所以預設行為是加一個,尤其是當畫面上沒有發生什麼事的時候。請在提示詞的音訊部分明確寫出負面描述:no music, no voice, no narration, no room reverb, no ambience bed。環境音範本比動作範本更需要這個。

最新模型

一個 API,暢享全模態 AI。

探索全部模型