Seedance 2.0 Mini & Fast API 全球最低價 —— 比官方定價最高低 68%

創作者報價875美元 vs 3.16美元:五個MiniMax H3 UGC廣告,按秒計價

五個視覺上不同的 MiniMax H3 UGC 廣告,分別基於五個基本框架:實際每秒計費、15槽並發上限,以及品牌文字斷點。

會議室螢幕上放著二十支影片。客戶看了十一秒,停在那支男生把瓶子推向鏡頭的片子上,問標籤上寫的是什麼。

沒人看得出來。那四個字母在他的手和鏡頭之間的某處糊成了一團。那支影片花了五十美分,價值卻是零。

這篇文章就是那五十美分的完整帳本。五張基礎影格、五種完全不同的鏡頭、一次朝著官方文件寫明的 15 個並發上限打出去的 20 個任務,以及原生解析度的裁切圖,精確呈現品牌文字在哪裡撐得住、在哪裡開始發糊。以下每一個數字都來自本週真實的帳單,而不是價目頁。

品牌名是刻意虛構的,這點文末會再說明。

重點摘要

  1. 五支完成的 MiniMax H3 UGC 廣告,出自五張不同的基礎影格,全部成本合計 $3.16。換成五位真人 UGC 創作者,以市場中位數計算,在使用授權金之前就要 $875(Influee,2026)。
  2. 同一個端點上,768P 計費 $0.10/秒,2K 計費 $0.14/秒。在靜態片尾卡上,兩者都把品牌名拼對了。768P 崩掉的時機,是產品朝鏡頭移動的時候。
  3. H3 的計量方式是 CONN,最大並發任務數:免費方案 2 個、付費方案 15 個(MiniMax Docs,2026)。我一口氣送出的 20 個任務全部完成,從頭到尾 4 分 13 秒。
  4. resolution 和 duration 是必填欄位,不是選填。漏掉它們,你就是在不知不覺中買下 2K。
  5. 兩個檔位輸出的都是 32 kHz 的 AAC 立體聲。音訊不會隨解析度變好,所以多付錢買 2K,買到的只有像素,沒有別的。

五支 MiniMax H3 UGC 廣告,來自五種完全不同的鏡頭

先看成果。一個虛構的保養品牌 ORVA,五種長相完全不同的原型:有人入鏡的浴室鏡子自拍、不露臉的微距滴液測試、換成另一個人的黃金時刻街頭見證、只有雙手入鏡的俯拍桌面開箱,以及一張排版式片尾卡。

五支完成的廣告,硬切成一支合輯。記得開聲音:對白、室內環境音和紙張的窸窣聲,全都是和畫面在同一次生成中一起產出的,不是後製疊上去的。使用 minimax/h3/image-to-video 生成。

這裡縮圖比合輯更重要,因為整件事的重點就是:這五支看起來不像同一場拍攝套上五份不同的腳本:

ORVA 保養品的五種不同廣告形式

五種 MiniMax H3 UGC 廣告原型並排呈現,標註畫面比例與單支影片價格

從每支完成的廣告中各取一格,標註其畫面比例,以及那支影片實際花了多少錢。

五種畫面比例,沒有一種要多付錢。H3 的 image-to-video 端點的 ratio 只接受 adaptive,聽起來像是限制,直到你意識到這代表首格影像決定了畫面形狀。畫面比例只買一次,用影像的價格,在步驟 1 就買好了。


為什麼大多數 MiniMax H3 UGC 廣告永遠進不了廣告帳戶

從"我做了一支影片"到"我把它投進了正在跑的廣告帳戶",這中間的落差幾乎葬送了每一次 AI UGC 實驗。三個具體的攔路石,依照它們通常出手的順序排列。

攔路石它實際上讓你付出什麼代價
免費的消費者版本:浮水印加上解析度上限檔案無法當作交付物。你不可能把一個角落浮水印交給客戶,而把它去掉又違反你同意過的條款。
以點數計費的工具你可以向老闆報告一個月費數字,但你報不出每支可用影片的成本,而那才是投放人員唯一能拿來做決策的數字。
一次只能跑一個任務二十個鉤子變成一個過夜的大工程。測試不再是一個週二下午的事,而變成衝刺看板上的一張票。

第一個是產品邊界,不是 bug。免費的消費者 App 和 API 是兩種產品,適用不同條款。只要交付物會離開你的公司,你就得走付費路線,沒有例外。

第二個比較安靜,但更糟。大多數 ai ugc 影片生成器產品賣的是月費訂閱,並用點數來計量工作,而點數不是任何人能在預算審查中站得住腳的單位。去問一位成效行銷人員,單次 5 秒鉤子測試要多少錢,你只會得到一個聳肩,或是一道除法題。這篇文章之所以一律以每秒計價,就是因為每秒是唯一能撐過試算表檢驗的單位。

第三個是大家最後才發現的。批次生成正是 AI 創意的全部價值主張。你不是在做一支完美的廣告,而是在做二十個平庸的鉤子,好讓演算法找出其中能跑的那兩個。這意味著並發數是一項一等重要的規格,而幾乎沒有人公布自己的數字。

還有一種完全沒有人替它算過成本的失敗模式:

手拿著手機,旁邊貼著一張寫有 Rejected Wrong Name 的便利貼

一支手機顯示 AI 生成的 UGC 廣告畫面,產品字標拼錯了,旁邊貼著一張退件便條

沒有人會編列預算的退件。燈光沒問題,表演沒問題,瓶身上的四個字母錯了,這支廣告就一文不值。

這正是 MiniMax 挑來開戰的戰場。他們的發表文章宣稱 H3 擅長"指令遵循、精準的文字與品牌渲染",並說這個模型是"為廣告、品牌、電商而生"(MiniMax,2026 年 7 月)。這是一個可以驗證的說法,而步驟 4 就在驗證它。

這件事之所以重要,是因為可讀性才是真正撬動成效的變數。一項針對 Taboola 平台資料、涵蓋超過 5 億次曝光與 300 萬次點擊的研究中,來自哥倫比亞大學、哈佛大學、慕尼黑工業大學與卡內基美隆大學的研究人員發現,AI 生成廣告的平均點擊率為 0.76%,真人製作廣告為 0.65%,而一旦套用嚴格的統計控制,兩者基本上打平(Taboola,2026 年 1 月)。單一最強的預測因子既不是"由 AI 製作"也不是"由真人製作",而是這則創意有沒有一張大而清晰的人臉、看起來夠不夠真誠。沒有人會信任一瓶標籤拼錯字的產品。


MiniMax H3 UGC 廣告的工作流程,以及每一秒的成本

這條鏈有三個環節。影像模型把鏡頭定下來,並把畫面比例買好。影片模型在那張影格之上買秒數。另一個標價幾乎相同的競品模型負責當對照組,這樣比較就不只是我單方面引用某一家廠商的說法。

這三者都在 Atlas Cloud 的同一份模型目錄裡,這也是我選擇這樣跑的唯一實際理由:一把金鑰、一張帳單,而且每秒費率在帳單上和在模型卡上是同一個數字。

鏈條步驟模型價格是否有折扣?
五張基礎影格google/nano-banana-2/text-to-image每張影像 1k $0.08 / 2k $0.12 / 4k $0.16否
草稿與成片minimax/h3/image-to-video768P $0.10/秒,2K $0.14/秒否
完全不用基礎影格minimax/h3/text-to-video同樣兩個檔位否
整個系列維持同一張臉minimax/h3/reference-to-video同樣兩個檔位;refers 可接受影像、影片與音訊的任意組合否
對照模型bytedance/seedance-2.5/image-to-video標價 $0.134/秒起,上限 720p,4 到 30 秒。用這個數字編預算前,先讀變化方案那一節否
便宜的鉤子測試檔位bytedance/seedance-2.0-mini/image-to-video$0.039/秒,自 $0.056 調降是,2026 年 8 月起 7 折
保留這一條,補上像素atlascloud/video-upscaler升到 1080p $0.018/秒,升到 2K $0.024/秒,最低計費 5 秒否

網頁介面顯示三張 MiniMax H3 影片生成模型卡

Atlas Cloud 模型目錄中的三個 MiniMax H3 端點,每一個都顯示"每秒 $0.10 起"的價格卡

目錄中的三個 H3 端點。卡片上的價格是下限,也就是 768P 檔位的每秒 $0.10;同一個端點上的 2K 是每秒 $0.14。

在有人來查證之前,先誠實補上一條註腳:MiniMax 自家的隨用隨付頁面標示 2K 為 $0.13/秒、768P 為 $0.08/秒,所以直接跟他們買,每秒會便宜一兩美分。這裡多付的那一兩美分買到的是:影像模型、兩個影片模型和升頻模型都在同一把金鑰後面,而這正是一套工作流程和四套工作流程的差別。


如何製作 MiniMax H3 UGC 廣告:四個步驟

四個步驟。以下每一段提示詞都是我實際貼上去的字串,每一項設定也都是我實際選的設定。

步驟 1:做出五張不同的基礎影格,而不是從一張衍生五個鉤子

這篇文章的核心論點就在這裡。常見的失敗是一張產品照配六份不同腳本,結果做出五支視覺上一模一樣的影片,還有一位看到打呵欠的讀者。換個做法:花 $0.60 買下五個真正不同的鏡頭:有臉和沒臉、室內和室外、平視和俯拍、兩個不同的人。

模型:google/nano-banana-2/text-to-image,resolution: 2k,每張 $0.12。我沒有選通用的照片模型,理由只有一個:這個階段唯一的驗收標準,是瓶身上那四個字母有沒有拼對。把文字渲染最強的模型放在最前面,你就能用 $0.12 修好拼字,而不是用 $0.70。

往下走之前,每張影格都要檢查三件事。字標拼對了。沒有手擋住字標。上下留白夠多,字幕和平台介面不會壓在產品上。

A. 鏡子前的晨間保養(aspect_ratio: 9:16)

text
1Vertical phone photo shot in a small bathroom mirror: a 29-year-old woman with damp hair and
2no makeup holds a 30 ml amber glass dropper bottle up beside her cheek, looking at her own
3reflection. The bottle's front label reads "ORVA" in bold cream sans-serif, with a smaller
4line "10% NIACINAMIDE · 30 ML" beneath it. Warm tungsten vanity light from above, slightly
5steamy mirror edge, white tile, a toothbrush cup and a folded grey towel in frame.
6Photoreal, handheld, imperfect exposure, no on-screen text overlay, no watermark,
7no logo other than the bottle label.
8

B. 微距滴液測試(aspect_ratio: 1:1)

text
1Extreme macro photograph, no face in frame: a hand squeezes a glass dropper and one clear
2viscous drop is about to fall onto the back of the other hand. Cool north-window daylight,
3shallow depth of field, visible skin texture and fine hairs, the amber "ORVA" bottle
4standing softly out of focus behind. Clean pale-grey background. Photoreal product macro,
5no text overlay, no watermark.
6

C. 黃金時刻街頭見證(aspect_ratio: 9:16)

text
1Vertical handheld selfie video still, front camera: a 34-year-old man with short beard and a
2navy crewneck walks along a city sidewalk holding the small amber "ORVA" dropper bottle up
3toward the lens, talking to camera. Strong golden-hour backlight with lens flare, blurred
4shopfronts and parked bicycles behind him, slight motion blur at the frame edges.
5Photoreal, natural skin, no colour grading, no text overlay, no watermark.
6

D. 俯拍桌面開箱(aspect_ratio: 16:9)

text
1Straight top-down flat-lay photo, hands only, no face: two hands lift a small amber dropper
2bottle out of an open kraft-paper box lined with cream tissue paper, on a pale oak desk.
3The box's inner lid is printed with "ORVA" in cream sans-serif and a smaller line
4"NIACINAMIDE SERUM · MADE IN SPAIN". A folded card, scissors and a linen cloth sit beside it.
5Soft diffused daylight from the left, real shadows. Photoreal e-commerce unboxing,
6no text overlay, no watermark.
7

E. 片尾卡靜態畫面(aspect_ratio: 9:16)

text
1Vertical product still: the 30 ml amber "ORVA" dropper bottle standing centred on a seamless
2warm-sand backdrop, single soft key light from camera right, long clean shadow.
3Typographic layout in the lower third: "ORVA" in bold cream sans-serif, under it
4"20% OFF YOUR FIRST BOTTLE" in a lighter weight, and at the very bottom "orvaskin.com".
5Crisp letter edges, generous spacing, no clutter, no extra logos, no watermark.
6

這個步驟要揭露一件事。為了這篇文章,我試了三次想在 Nano Banana 2 的 playground 執行到一半時截圖,三次都因為測試環境上模型供應商回傳的上游連線錯誤而失敗,所以這裡沒有瀏覽器截圖。下面這五張影格改為透過 API 產生,設定相同,價格也是 playground 標示的每張 $0.12。

ORVA 保養品的五種不同廣告素材方案

五張 ORVA 基礎影格並排呈現,每張都標註畫面比例與 $0.12 的成本

五張基礎影格全在這裡。五種畫面比例,總共 $0.60,而影片步驟會免費繼承這些畫面形狀。使用 google/nano-banana-2/text-to-image 生成。

步驟 2:買下秒數,把每張影格變成 768P 草稿

現在讓每張影格動起來。模型:minimax/h3/image-to-video。真正重要的設定:

  • image:步驟 1 中對應的基礎影格,可以是 URL 或 base64 data URL。
  • 草稿用 resolution: "768P"。這是必填欄位。預設值是 2K,而兩個檔位的每秒費率差 40%。
  • duration: 5。同樣是必填。漏掉它並不會讓你免費得到一支短片。
  • ratio:忽略它。這個端點的列舉值只有 adaptive,畫面形狀由首格影像決定。

這兩個必填欄位,是整個工作流程中弄錯代價最高的地方。用預設值送出的一波 20 個任務,就是 20 支 2K、8 秒的影片,也就是 $22.40 而不是 $10.00,而這些還只是你本來就打算丟掉的草稿。

text
1A: Handheld vertical phone video in the mirror. She tilts the bottle so the label faces the
2mirror, then looks back at her own eyes and says, in a dry, slightly amused tone:
3"Two weeks in. My skin is boring now. That's the whole review." Bathroom room tone, a faint
4extractor fan hum, no music. One continuous take, no cuts. Keep the bottle label sharp and
5unchanged.
6
7B: Locked-off macro shot, no camera move. The drop detaches from the dropper, falls, and
8spreads slowly on the back of the hand; the fingers tilt to catch the light. No speech.
9Only sound design: a soft liquid touch, a faint room tone. One continuous take.
10
11C: Handheld walking selfie video, natural bounce. He keeps eye contact with the lens, glances
12down at the bottle once, and says in a casual American accent: "I have never had a skincare
13routine. I have one step now. This is the step." Street ambience, distant traffic, wind on
14the mic, no music. One continuous take, no cuts.
15
16D: Locked-off top-down shot. The hands finish lifting the bottle clear of the box, set it
17upright on the oak desk, then fold the tissue paper back down. No speech. Paper rustle,
18a soft glass-on-wood tap, quiet room tone. Keep the printed text on the box lid sharp,
19still and unchanged.
20

AI 影片生成器介面截圖,顯示輸入與輸出

Atlas Cloud 上的 MiniMax H3 圖像轉影片 playground,已載入基礎影格,輸出面板正在播放完成的影片

MiniMax H3 圖像轉影片 playground,提示詞已貼上、基礎影格已載入,完成的影片就在 OUTPUT 裡。這張截圖刻意保留未經改動的預設值,而 Run 按鈕會直接幫你算好價格:2K、8 秒是 $1.12\。本教學裡的草稿是 768P、5 秒,也就是 $0.50\。這個差距,就是這兩個欄位被標為必填的全部理由。

這次執行交付出來的實際尺寸,直接從檔案讀出來。768P 把 768 像素放在短邊:直式 768x1376、橫式 1376x768、方形 768x768。2K 在短邊放 1440:直式 1440x2560、方形 1440x1440。兩者都是 24 fps,都帶有 32 kHz 的 AAC 立體聲。音訊規格不會隨檔位改變,所以每秒多付的那四美分,買到的只有像素,沒有別的。

步驟 3:把整波任務打進 15 個並發上限

不要一支一支慢慢迭代。這個習慣是從一次只能做一件事的工具遺留下來的,也是大家覺得 AI 創意很慢的原因。

H3 不像較舊的 Hailuo 模型那樣以每分鐘請求數計量。它的計量方式是 CONN,最大並發任務數:免費方案 2 個、付費方案 15 個(MiniMax Docs,2026)。照文件上寫的,這會導出一個很具體的結果:15 就是你的批次寬度,而第 16 個任務會排隊等候,而不是直接報錯。

所以我一口氣送出 20 個任務,並替每一個都打上時間戳。四支原型廣告、兩種解析度的片尾卡,以及 14 個只更動台詞、手勢或運鏡的變體。二十個裡有十八個是 768P、5 秒;兩個片尾卡任務是 4 秒,一個 2K、一個 768P。

text
1Variant recipe: keep the base frame and the shot identical, change exactly one thing.
2- Swap the spoken line only (same framing, same gesture): 4 variants off A and C.
3- Swap the gesture only (same line, same framing): 3 variants off A and D.
4- Swap the camera move only (locked-off to slow push, or handheld to steadier):
5  3 variants off B and D.
6- Swap the closing beat only (bottle lowered, bottle set down, cut on the smile):
7  4 variants off A, C and D.
8Submit all of them in one loop. Do not await one before submitting the next.
9

二十個 MiniMax H3 任務完成時間的水平長條圖

一口氣送出的 20 個 MiniMax H3 任務時間軸,每一條長條都是從送出到完成的時間

每一條長條代表一個任務,從我送出請求算到狀態變成完成。20 個全部在 8.1 秒內送出,20 個也全部回來了。

回來的結果,和那個上限讓我預期的並不一樣。

20 次送出全部在 8.1 秒內回傳 HTTP 200。20 個任務全部完成。最快的 114.3 秒落地,中位數 175.6 秒,最慢的 253.0 秒。二十個裡有十八個落在 114 到 196 秒這個很緊的區間內。2K 片尾卡花了 222.7 秒,這和我測過這個模型 2K 的其他結果一致:比較慢,但沒有慢得誇張。剛好有一個 768P 任務,也就是鏡子場景的台詞變體,耗時 253 秒,是圖表中唯一一條看起來排過隊的長條。

從頭到尾,二十支 5 秒 UGC 影片,4 分 13 秒,$9.96\。這才是要記住的數字:一波過去得跑一整晚的鉤子測試,現在比一次喝咖啡的休息時間還短。

這件事證明了什麼、又沒證明什麼。它沒有證明 15 個並發上限是虛構的,因為經過路由的供應商可以用單一直連帳戶做不到的方式匯集算力,而某個下午的一波任務也只是一個資料點。它證明的是:實際可用的批次寬度已經夠高,你可以別再寫循序迴圈了。把整波送出去,然後去讀點別的東西。

提醒一句,因為我在好幾個不同的日子測過這個端點:並發行為並不是固定的。有一次執行中,六個重疊的任務全部乾淨完成;另一次,一個重疊的任務回傳了 429 rate limit exceeded (task concurrency)。請把上面的數字當成我那一波在那一天的表現,在你要以它為基礎寫排程器之前,先自己測一次。

步驟 4:片尾卡,MiniMax H3 UGC 廣告在文字上的生死關

片尾卡就是考試。一個字標、一行優惠文案、一個網址,全都得在一臂之遙的手機上看得清楚,而其中一個還是網域,只要錯一個字元,點擊就哪裡都到不了。

用完全相同的基礎影格和完全相同的提示詞跑兩次:一次用 resolution: "2K", duration: 4,一次用 resolution: "768P", duration: 4。

text
1The bottle rotates about 12 degrees to camera right while every letter stays perfectly still:
2letter shapes locked, no warping, no flicker, no re-lettering. One soft specular highlight
3travels across the glass. Silence for three seconds, then one short clean UI chime.
4

在這裡鎖定首格影像不是可選項,而這也是整個工作流程中最不直覺的一點。H3 的 2K 檔位是脈絡內重新生成,不是升頻。如果不給基礎影格,只用同一段文字提示詞跑兩個檔位,你會拿回兩支不同的片子,場景陳設不同、標籤位置也不同,什麼都說明不了。把兩次執行都釘在同一張首格影像上,剩下唯一能有差異的就只有細節。這樣比較才有意義。

Orva 廣告在不同影片解析度下的並排比較

片尾卡並排比較,左邊 768P、右邊 2K,首格影像與提示詞完全相同

相同的基礎影格、相同的提示詞,各四秒。左邊 768P,右邊 2K。這裡以無聲 GIF 呈現;兩個交付檔案都帶有 32 kHz 的 AAC 立體聲。

而真正一槌定音的是這張:

來比比看:"768P 與 2K 影片解析度的並排比較

ORVA 字標、成分行與網址在 768P 與 2K 下的像素級裁切比較

上排是瓶身標籤,下排是片尾卡的文字區塊。原生裁切在 768P 下是 292x220 與 691x372 像素,在 2K 下則是 547x410 與 1296x691;兩者以相同的顯示寬度呈現,也就是手機實際渲染出來的樣子。

以下是誠實的結果,而且不是我原本預期會寫下的那個。

768P 沒有拼錯任何東西。 ORVA、20% OFF YOUR FIRST BOTTLE 和 orvaskin.com 在兩個檔位上都正確、穩定且清晰可讀。沒有閃爍、沒有重新排字、瓶身旋轉時也沒有變形。在近乎靜態的片尾卡上,MiniMax 所說的"精準的文字與品牌渲染"在便宜檔位上站得住腳。

768P 輸掉的是邊緣品質。看看 O 和 R 內部的字懷,以及標籤上的 10% NIACINAMIDE / 30 ML。2K 的字形邊緣乾淨俐落;768P 則偏糊,瓶身上那行小字幾乎要靠猜。在一臂之遙的手機上,兩者你大概都會放行。但在平板上、在客戶審片會上,或是只要有人按下暫停放大,768P 版本看起來就是廉價的算圖。

768P 真正崩掉的地方是動態,不是解析度。 在那一波任務裡,有一個街頭變體的結尾是把瓶子推向鏡頭。當瓶子佔滿更多畫面並傾斜時,那四個字母化成一團糊,看起來像另一種字母系統。同樣的檔位、同樣的模型、同樣的品牌,影片直接不能用。這才是真正的規則:文字在小、平、靜的時候撐得住,在畫面中快速移動時就會崩掉。買 2K 救不了一個要求模型在移動途中替旋轉標籤重新排字的鏡頭。把鏡頭設計好才救得了。


MiniMax H3 UGC 廣告 vs 同樣標價下最好的廣告 AI 影片生成器

任何在挑最好的廣告 AI 影片生成器的人,最後都會拿這兩個來比,因為在模型目錄上,它們的每秒價格只差不到半美分。所以我拿基礎影格 B,也就是這組裡小字最難處理的微距滴液測試,用完全相同的提示詞分別跑過兩個模型,然後把兩張帳單都讀了一遍。

兩張對比影像:滴管把精華液滴到手上

同一張基礎影格,左邊由 MiniMax H3 以 2K 生成,右邊由 Seedance 2.5 以 720p 生成

完全相同的首格影像、完全相同的提示詞,各五秒。左邊是 2K 的 MiniMax H3,右邊是 720p 的 Seedance 2.5。兩支影片都來自 API:Seedance 的 playground 執行在三次截圖嘗試後仍顯示"In progress",所以這個步驟同樣沒有瀏覽器截圖。

使用 minimax/h3/image-to-video 與 bytedance/seedance-2.5/image-to-video 生成。

MiniMax H3(圖像轉影片)Seedance 2.5(圖像轉影片)
標價2K $0.14/秒,768P $0.10/秒$0.134/秒起
這支 5 秒影片實際的計費金額$0.70(2K,1440x1440)$1.51(720p,960x960)
解析度上限2K,短邊 1440720p,這個方形來源下就是 960x960
影片長度4 到 15 秒4 到 30 秒
參考素材影像、影片與音訊的任意組合最多 30 張影像,僅限影像
原生音訊有,32 kHz 立體聲,與畫面一起生成有
這次執行中標籤上的小字2K 下字標與成分行都可讀字標可讀,成分行偏糊
這支影片的延遲190.5 秒224.7 秒

把前兩列放在一起讀,因為意外全在這裡。標價幾乎一模一樣,帳單卻不是。

H3 兩次都完全照標價計費:2K 五秒 $0.70,768P 五秒 $0.50,沒有進位、沒有意外。Seedance 2.5 在 720p 下五秒收了 $1.5148,換算大約每秒 $0.30,而不是 $0.134\。所以我去查了原因,把同一個鏡頭改用 480p 再跑一次:四秒 $0.5397,也就是每秒 $0.1349,和標價幾乎分毫不差。

這就解釋得通了。目錄上的數字是 480p 的費率,而方形來源在 720p 下是 960x960,相對於 640x640,像素多了 2.25 倍,在我的帳單上價格也正好是 2.25 倍。標示"起"價並沒有什麼不誠實,但那個"起"字在那句話裡真的很賣力,而且這種事你通常是在發票上發現,而不是在比較表上。

這讓決策整個翻轉。在這次執行中,H3 用 $0.70 交付了短邊 1440 像素,Seedance 2.5 交付 960 卻要 $1.51\。如果你的廣告只是一個人在講話、畫面上沒有任何字需要被讀,Seedance 2.5 仍然值得留著:它最長可到 30 秒,H3 只有 15 秒,這對比較長的敘事型廣告有意義,而且它能接受多得多的參考影像。但只要有字標、優惠文案或網址必須在手機螢幕上撐住,H3 就同時是更銳利也更便宜的選項,而且差距不小。

這個通則比這兩個模型都活得久:在你把每秒費率填進試算表之前,先用你真正的設定跑一支影片,然後去讀真實的帳單。

三個值得知道的省錢變化方案,都是本月在模型目錄上核對過的:

**把預算拆開買。**做鉤子測試時,兩支 5 秒影片勝過一支 10 秒影片,因為你拿到的是兩個開場而不是一個。一樣的錢,兩倍的漏斗頂端。

**草稿用便宜檔位。**如果只是純粹的鉤子測試、畫面上沒有任何字要讀,bytedance/seedance-2.0-mini/image-to-video 是 $0.039/秒,截至 2026 年 8 月,目前比 $0.056 的標價打了 7 折\。這樣一個 5 秒鉤子大約 20 美分,便宜到可以隨便揮霍。

**用 reference-to-video 鎖住同一張臉。**把同一組參考影像餵給 minimax/h3/reference-to-video,可以讓同一位主講人在不同場景間保持一致,這就是你如何用一個角色做出一整個月的內容,而不是每週換一個陌生人。它的計費同樣分成那兩個檔位。我沒有為這篇文章實際跑過它,所以我不會拿一個我沒有的結果給你看。

**保留表演,補上像素。**當一條 768P 的素材表演完美、只有解析度不對時,atlascloud/video-upscaler 能以每秒 $0.024 把那一條原封不動地升到 2K,最低計費 5 秒。它沒辦法憑空生出來源根本沒解析出來的文字,所以它救得了好的表演,救不了壞掉的標籤。


MiniMax H3 UGC 廣告每支可用影片的成本

先看標價,再看真正重要的那個數字。

項目這次執行真人 UGC 創作者對應成本
五張基礎影格,2k5 x $0.12 = $0.60已包含在拍攝費中
四支廣告,768P,各 5 秒4 x $0.50 = $2.004 x $175 = $700
片尾卡,2K,4 秒$0.56$175
五支可交付的廣告$3.16$875,尚未計入使用授權金
付費廣告使用授權已包含+30% 到 +50%,也就是 $1,138 到 $1,313
證明了這個論點的 768P 片尾卡對照組$0.40這種東西買不到
整波 20 個任務的鉤子測試$9.96這種東西買不到

創作者那一欄採用每支影片約 $175 的市場中位數,典型區間為 $150 到 $212,付費投放權利還要在此之上再加 30% 到 50%(Influee,2026)。

現在講誠實的部分,因為標價的前提是每支影片都能用,而實際上從來沒有一支影片是這樣的。

我把那一波的 20 支影片全部看過,淘汰了三支。一支在瓶子靠近鏡頭時字標糊掉。一支從頭到尾主講人的手指都橫在標籤上。還有一支畫面飄移太多,導致印著字的盒蓋,也就是那個鏡頭的全部重點,跑出了畫面。

也就是 20 支裡有 17 支可用,命中率 85%,總花費 $9.96。每支可用影片的成本是 $0.59,而平均標價是 $0.50。

關於這個數字有兩件事值得說。第一,85% 算高,我不會保證在更難的需求上還撐得住;動作更快、包裝文字更密的一波,失敗率會更高。第二,那三支被淘汰的影片,每一支都是我在提示詞裡就能避免的構圖問題,不是模型的缺陷。淘汰是設計稅,不是渲染稅。

這才是要放進簡報的數字:每支可用影片的成本,而不是每支影片的成本。而且要等整波跑完、你把它們全部看過,才會知道這個數字。任何人給你一個沒有附上可用率的單支影片報價,都只是在報這道算式裡比較便宜的那一半。

有件事值得直說:這不會讓真人創作者被淘汰。它讓_測試_階段變便宜。花幾美元找出真正有效的那兩個鉤子,然後把 $875 花在真正要投放預算的那個版本上,用一個觀眾願意追隨的真人臉孔。


MiniMax H3 UGC 廣告的揭露與品牌規範

三件事,沒有一件是可選的,也都很短。

**要揭露。**Meta 和 TikTok 都要求廣告主標示 AI 生成或經過大幅 AI 修改的創意,兩者也都有自動偵測機制,包括許多生成工具嵌入檔案中的 C2PA 內容憑證。由 AI 製作不是退件理由,沒有揭露才是。政策措辭改動的頻率高到唯一合理的建議是:上線前去自己的廣告管理員裡讀當下的條文,而不是讀某篇部落格文章的摘要。

**不要把真實商標寫進提示詞。**這就是 ORVA 之所以是虛構的原因。MiniMax 的 API 條款中有一條抗辯與賠償條款,涵蓋模型輸出所引發的專利與著作權主張,但不延伸到商標或肖像。所以在生成品牌濃度很高的廣告時,你最希望被涵蓋的那一類風險,恰恰就是沒有被涵蓋的那一類。請使用你自己有權使用的商標,或是虛構的商標。

**開放權重不是繞過管轄權的辦法。**H3-Base 確實可以下載,而且是真正的 33B 版本,不是閹割過的展示品。但社群授權目前排除歐盟、英國、南韓與美國,這些地區另有正式的授權管道。而且自行部署只能跑短邊 768 像素,Context-IR 與 Regenerate-2K 兩個階段仍留在 API 端。所以本地部署這條路,交付不了這篇文章證明你需要、用來讓品牌文字可讀的那一樣東西。


MiniMax H3 UGC 廣告:常見問題

一支 MiniMax H3 UGC 廣告要多少錢?

在 minimax/h3/image-to-video 上,一支 5 秒的直式廣告在 768P 是 $0.50、在 2K 是 $0.70,如果你還要生成基礎影格,再加 $0.12。2K 的 4 秒片尾卡是 $0.56\。直接跟 MiniMax 買每秒會稍微便宜一點,他們的隨用隨付頁面上 2K 是 $0.13/秒、768P 是 $0.08/秒,這裡則是 $0.14 和 $0.10。

我一次可以生成幾支 MiniMax H3 UGC 廣告?

H3 是以並發任務數計量,而不是每分鐘請求數:免費方案 2 個同時進行的任務,付費方案 15 個。送出更多不會報錯,而是排隊。在我的測試中,一口氣送出的 20 個任務全部完成,中位數 175.6 秒,整波 4 分 13 秒。照這個速度,一個工作天就是好幾百支 5 秒影片,遠超過任何團隊實際看得完的創意量。在你要以它為基礎寫排程器之前,先測一次自己的批次,因為並發行為會變動。

MiniMax H3 UGC 廣告產出的檔案會有浮水印嗎?

透過 API 不會。我把交付的檔案逐格看過,沒有在任何一支上找到角落標記。免費的消費者 App 是另一個產品,帶有浮水印、解析度上限,條款也禁止移除標記。如果檔案是要交給客戶的,就走 API 這條路。

MiniMax H3 會正確渲染我的品牌名稱和 CTA 文案嗎?

大多數情況下會,但有一個明確的前提。在近乎靜態的片尾卡上,768P 和 2K 都正確渲染出 ORVA、一行折扣文案和 orvaskin.com,並在整個鏡頭中保持穩定;2K 多買到的只是更銳利的字形邊緣,以及瓶身上可讀的小字。在我的測試中失手的地方是動態:當產品被推向鏡頭並傾斜時,字標在 768P 下糊成一團看不懂的東西。這次測試中真正起作用的三條規則:把關鍵文字放在近乎靜態的片尾卡上,而不是放在移動的鏡頭裡;絕不讓鏡頭橫越過那些字;在花任何一分錢做影片之前,先在基礎影格上確認沒有手或手指橫過字標。

MiniMax H3 是最好的廣告 AI 影片生成器嗎?還是更便宜的就夠用了?

如果只是純粹的講話頭像鉤子測試、畫面上沒有任何字要讀,便宜的檔位真的就夠了:bytedance/seedance-2.0-mini/image-to-video 是 $0.039/秒,截至 2026 年 8 月目前比 $0.056 的標價打 7 折,一個 5 秒鉤子大約 20 美分。但只要字標、優惠文案或網址必須清晰可讀,2K 檔位每秒多出的那四美分,在第一次不用被退件重做時就回本了。

Meta 或 TikTok 會退掉 AI 生成的 UGC 廣告嗎?

不會因為它是 AI 生成而退件。兩個平台都要求廣告主揭露 AI 生成或經過大幅 AI 修改的創意,也都有包含 C2PA 內容憑證在內的自動偵測。退件風險在於沒有揭露,而不在於技術本身。請到自己的廣告管理員裡查看當下確切的措辭,因為兩個平台都經常修訂這段文字。

最新模型

一個 API,暢享全模態 AI。

探索全部模型