MiniMax 在週五推出了 H3。不到二十四小時,Seedance 2.5 就到了使用者手中,時間線縮成了一句話:30 秒、原生 4K、50 個參考輸入。H3 的發表貼文靜靜躺在下方,幾乎沒人拿它跑過真正的測試。
我明白為什麼。30 秒是個漂亮的數字,適合放在標題裡。
但如果你真的在製作垂直短劇,你就知道真正毀掉你夜晚的不是第 30 秒,而是第 4 個鏡頭。男主角的下巴線條偏移了半公分,他的領巾少了一道褶,觀眾在鉤子落地之前就滑走了。沒有人因為片段是 15 秒而不是 30 秒而流失。他們流失,是因為特寫裡那個人不是全景裡的那個人。
所以我跳過了規格表對決。我建立了一張角色轉向表、一塊六格場景板,寫了一段 15 秒的哥德式短劇提示詞,然後把同樣的素材包寄給兩邊。接著我盯著那張臉看。
關鍵要點
- 兩者都是真的,但可達性不同。 H3 的三個端點(文字、圖片與參考轉影片)目前已上線且可呼叫。Seedance 2.5 的 API 在字節跳動端已推出,但在我用來測試的多模型平台上,它仍是一個 Day-0 頁面,因此我對決中的 Seedance 方是 Seedance 2.0 參考轉影片。我在所有相關處都標註了這一點。
- 規格明顯區分。 Seedance 2.5 = 單次生成最長 30 秒、原生 4K、最多 50 個多模態參考、區域級編輯。H3 = 5 到 15 秒、原生 2K 24fps、9 張圖片 + 3 段影片 + 3 段音訊(最多 12 個檔案)、每個輸出附帶立體聲、整段指令編輯。
- 角色穩定性是包裝問題,不是模型生成問題。 使用一張複合轉向表加上一塊打光板,兩個模型都保持了相同的臉孔與服裝。不是生成次數決定鏡頭好壞,而是素材包決定的。
- 那個沒人測試的模型已經排在第三。 在 Artificial Analysis 的圖片轉影片競技場上,H3 以 1,185 Elo 落後於 Seedance 2.0 的 1,196。Seedance 2.5 尚未出現在榜上。
- 兩者都自行生成音訊。 H3 還能接受最多三個音訊參考來為角色綁定聲音,這就省掉了短劇流程中一整段 TTS 與同步的環節。
- 要問的是每幀像素,而不是秒數。 相同參考包、相同運行時間:H3 的參考轉影片回傳 1440p,Seedance 2.0 的參考轉影片回傳 720p。這重新定義了整個成本問題。
Seedance 2.5 自己的配對數據尚未出爐。我將在端點在我測試平台上開放的那天補上。
Seedance 2.5 對決 MiniMax H3 的結果,在理論之前
在理論之前,先看工作流程產出的結果。以下是從一段完成的 15 秒垂直片段中抽出的四個鏡頭,並排呈現。這是 MiniMax 自己的 H3 參考運行,使用你將在步驟 1 和步驟 2 中看到的角色表與場景板,原生 1440x2560。我自己使用相同素材包的運行結果會在教學中出現,並顯示遊樂場狀態。
XSnfiquLLMk
她抵達雕花門(場景板的第 4 格),接著是走廊對峙、他的緊密特寫,然後是雙人鏡頭。他的髮際線在側面和特寫中分得一致。她的半盤編髮冠在滿面特寫中存活下來——這正是大多數模型會悄悄重建臉孔的關鍵時刻。奶油色蕾絲緊身胸衣從第一幀到最後一幀保持相同的領口與袖口。
這就是整個測試。不是 30 秒。四個鏡頭與一條下顎線。
為何 Seedance 2.5 與 MiniMax H3 在同一週打破框架,以及為何大多數角色測試毫無用處
MiniMax 於 7 月 30 日發布了 H3,這是一個通用多模態影片模型,可讀取文字、圖片、影片與音訊作為一個上下文,並回傳 5 到 15 秒的片段,解析度最高 2K,附帶原生立體聲。它還能編輯現有影片,並將動作從一個片段轉移到另一個片段,MiniMax 表示權重將在幾天內跟進(Reuters,2026 年 7 月)。
Seedance 2.5 在同一時間窗口內登場,帶來更響亮的數字:單次生成 30 秒、原生 4K,以及單次作業最多 50 個多模態參考輸入(The Next Web,2026 年 7 月)。其 API 已交到開發者手中,具備區域化編輯(可重繪部分畫面,同時保留表演、光線與攝影機行為)、參考轉影片(可接受綠幕板或 3D 白模塊)、十一種語言,以及實驗性長影片模式可達 180 秒(CineD,2026 年 7 月)。
9HprrI3lQK4
注意力差距是耐人尋味的部分。幾乎所有我找到的貼文都是 2.5 的片段。與此同時,公開競技場的數字說明了另一回事:在 Artificial Analysis 的圖片轉影片排行榜上,720p 的 Seedance 2.0 以 1,196 Elo 領先,Gemini Omni Flash 以 1,195 緊追在後,而 MiniMax H3 在上線僅四天後就以 1,185 位居第三。Seedance 2.5 在那裡尚無評分(Artificial Analysis,2026 年 7 月)。討論最少的模型,其分數與注意力之間的比值卻最高。
現在,來談談真正決定你輸出的部分——因為它幾乎與你選擇哪個 Logo 無關。
大多數角色一致性測試在模型介入之前就失敗了。四種失敗模式,全部由你來修正:
| 失敗模式 | 輸出中看到的現象 | 修正方法 |
|---|---|---|
| 多視角參考以獨立檔案送出 | 每個鏡頭的臉孔「幾乎正確」,但彼此不一致 | 將視角合成為一張圖片,然後在提示詞中指定角色(「左邊的男人」、「右邊的女人」) |
| 每個鏡頭重新撰寫角色描述 | 服裝與配件逐鏡頭漂移 | 一次性寫好身分區塊,逐字重複使用;每個鏡頭只改變攝影機與動作 |
| 讓光線隨場景移動 | 臉孔在新光線下被結構性重建 | 建立獨立的場景板,鎖定光線方向、霧氣與地板反射,並作為參考輸入 |
| 將最大時長視為品質指標 | 30 秒內的任何一次漂移毀掉整個 30 秒 | 剪到你可以重做的粒度,然後再談論長度 |
第一列是人們最常搞錯的。送出六張單視角圖片,模型會將它們視為六個候選人並平均值。送出一張乾淨的合成圖,模型會將其視為從三個角度的同一個人。同樣的像素,完全不同的結果。
2jp1CC7nfUM
Seedance 2.5 對決 MiniMax H3 規格表,以及你今天實際能呼叫的內容
將能力與可用性分開來看,緊張關係就很明顯。在原始能力上,Seedance 2.5 在時長、解析度上限、參考數量與編輯粒度上領先。在可用性上,H3 是這週在通用模型平台上擁有三個即時端點的那一個。如果你正在為 2026 年規劃做 AI 影片模型比較,第二欄和第一欄同樣重要。
| MiniMax H3 | Seedance 2.5 | Seedance 2.0 參考轉影片(我實際執行的版本) | |
|---|---|---|---|
| 單次生成最長時長 | 5 到 15 秒 | 最長 30 秒,無須拼接(測試版模式可達 180 秒,實驗性) | 短片段選單,請參閱模型頁面 |
| 解析度 | 原生 2K,16:9 至 9:16 時短邊為 1440p;另有 768p 層級標示為即將推出 | 原生 4K,10-bit 色彩 | 此端點最長達 720p |
| 幀率 | 24 fps | 未單獨公布 | 未單獨公布 |
| 參考輸入 | 9 張圖片 + 3 段影片 + 3 段音訊,總共 12 個檔案 | 最多 50 個多模態參考 | 9 張圖片 + 3 段影片 + 3 段音訊 |
| 原生音訊 | 是,每個輸出皆附帶立體聲 | 是,另加 11 種字幕與語音語言 | 是 |
| 編輯粒度 | 整段指令編輯(更換角色、背景、光線、對白) | 區域級編輯,可重繪畫面部分 | 整段指令編輯 |
| 提示詞上限 | 7,000 個字元 | 未公布 | 未公布 |
| 開放權重 | 宣布於發布後數天內開放 | 未宣布 | 未宣布 |
| Artificial Analysis I2V Elo,2026 年 7 月 31 日 | 1,185(第 3 名) | 尚未評分 | 1,196(第 1 名,Dreamina 720p 項目) |
| 在我測試的平台上可呼叫 | 是,3 個端點 | 尚未,Day-0 頁面 | 是 |
測試設定的完整揭露。 我執行此測試時,Seedance 2.5 在我的平台上尚未開放,因此 Seedance 方使用的是 Seedance 2.0 參考轉影片,這是同一個產品系列中目前出貨的成員,具有相同的四模態參考系統。在 2.5 會改變答案的地方,我會明確說明。Seedance 2.5 頁面目前是 Day-0 公告。
以下所有操作都在一個瀏覽器分頁中,使用一把金鑰,總共三個模型:
| 步驟 | 模型 | 產出內容 | 關鍵設定 | 成本驅動因素 |
|---|---|---|---|---|
| 1 | OpenAI GPT Image 2 文字轉圖片 | 角色轉向表 | quality high, 16:9 | 每張圖片,按用量付費,當前費率見模型頁面 |
| 2 | 相同模型,第二次執行 | 六格場景與打光板 | quality high, 16:9 | 每張圖片,按用量付費 |
| 3 | MiniMax H3 參考轉影片 | 9:16 片段,附帶原生音訊 | 9:16, 2K, 時長:測試用 5 秒,實際剪輯用 15 秒 | 秒數 x 解析度,按秒計費 |
| 4 | Seedance 2.0 參考轉影片 | 控制組運行,相同輸入 | 9:16, 最高可用解析度,相同時長 | 秒數 x 解析度,按秒計費 |
| 5 | H3 參考轉影片,以片段作為輸入 | 固定一個鏡頭,無需重新生成整個片段 | 相同解析度,短時長 | 秒數 x 解析度,按秒計費 |
H3 也有文字轉影片與圖片轉影片端點,如果你想要純文字基線或首尾幀控制的話。
在規劃批次之前,還有一件事值得知道:螢幕文字。這段 15 秒的 H3 片頭字幕在八次硬切中保持英文拼寫完全正確,沒有出現任何拼寫錯誤,這是生成影片中最難保持穩定的項目之一。
hwooYYPRW5o
Seedance 2.5 對決 MiniMax H3 短劇工作流程,逐步說明
五個步驟。請完全按照提示詞輸入,包括那些看起來不美觀的部分。我沒有為了文章而清理它們,你也不應該為了模型而清理它們。
步驟 1:使用 GPT Image 2 建立角色表
在製作任何影片之前,先建立參考素材包。一張圖片、兩個角色、每個角色三個視角、純白無縫背景、均勻的棚內打光。這樣就消除了所有模糊空間,只留下你關心的那個問題:這個人長什麼樣子。
plaintext1一張全身角色轉向參考表,純白無縫背景,兩個角色並排,總共六個人形,均勻中性的棚內打光,地板上無陰影,無文字、無標籤、無浮水印。 2 3左半邊:男主角,三個視角排成一列——正面、右側面、背面。二十多歲,蒼白膚色,深色波浪中長髮,尖銳下顎線。穿著拖地黑色天鵝絨禮服大衣,翻領與袖口有細微的同色刺繡,黑色錦緞背心,黑色絲綢領巾,直筒黑色長褲,亮面黑色德比鞋。雙臂自然垂於兩側,中性表情。 4 5右半邊:女主角,三個視角排成一列——正面、右側面、背面。二十出頭,白皙膚色,長波浪栗色頭髮,半盤編髮冠。穿著奶油色維多利亞棉質蕾絲洋裝,長袖帶蕾絲袖口,合身緊身胸衣飾有小紐扣,全長及踝裙,奶油色踝帶低跟鞋。雙臂自然垂於兩側,中性表情。 6 7攝影寫實風格,所有六個人形比例一致,腳部對齊在同一基線上,全畫面銳利對焦。
設定: 模型 OpenAI GPT Image 2 Text-to-Image,品質 high,比例 16:9,其餘預設。
Atlas Cloud 上的 GPT Image 2 Text-to-Image,執行完成:左側是轉向提示詞,OUTPUT 面板中六個人形在一張白色底板上。
這是目標形狀。六個人形、一條基線、背景沒有任何可爭論的細節:
驅動示範片段的參考素材包:男主角穿黑色天鵝絨,女主角穿奶油色維多利亞蕾絲,每人三個視角,單一檔案。
我自己對步驟 1 提示詞的 GPT Image 2 執行結果,供與上方參考對比。
步驟 2:用六格場景板鎖定場景
你已經固定了臉孔。但光線仍會背叛你。第二張參考圖片鎖定了六個攝影機位置、月光的方向、空氣中的霧氣量以及地板的潮濕程度。你是在告訴模型這部電影只有一套打光設定。
plaintext1一塊六格電影場景板,2 行 3 列,面板之間有細黑間隔,每個面板底部以小寫優雅白色全大寫字母間距字體標註說明。主題:廢棄哥德式城堡內部,夜晚。冷藍色月光、飄動的低層霧氣、潮濕反光的石頭地板、高聳彩繪玻璃窗、鐵製燭台帶小小溫暖火焰、深層去飽和黑色、厚重天鵝絨窗簾。所有面板中均無人物。 2 3面板 1,說明「全景建立鏡頭 - 走廊」:長柱廊向遠處延伸至一扇透光的彩繪玻璃窗。 4面板 2,說明「低角度 - 月光掠過地板」:低角度攝影機,一道月光斜照在潮濕的石板上。 5面板 3,說明「門口與樓梯構圖」:拱形門口框住一座曲線石梯。 6面板 4,說明「近景細節 - 雕花門」:緊密拍攝一扇厚重的雕花木門,帶有鐵製把手。 7面板 5,說明「窗邊視角 - 霧氣與窗簾」:高窗,霧氣湧入,前景有窗簾邊緣。 8面板 6,說明「最終海報畫面 - 空大廳」:對稱空大廳,圖案地毯通往窗戶。 9 10攝影寫實、電影感、底片顆粒、所有六個面板色調一致。
設定: 相同模型,品質 high,比例 16:9。
驅動示範片段的場景板:六個哥德式城堡內部,同一色調,說明文字可讀。
我自己對步驟 2 場景板提示詞的 GPT Image 2 執行結果。
步驟 3:使用 MiniMax H3 參考轉影片生成鏡頭
兩張參考圖片加上一個提示詞,內含攝影機位置與音訊方向。聲音在同一趟生成中產出,因此沒有獨立的語音或配樂步驟。調整時保持短時長,然後在實際剪輯時拉長至 15 秒。
plaintext1參考圖片 1 是角色表:左邊的男人是男主角,右邊的女人是女主角。保持兩者的身分完全如圖所示:他的下顎線、深色波浪髮、黑色天鵝絨禮服大衣、黑色錦緞背心與黑色絲綢領巾;她的栗色半盤編髮與奶油色維多利亞蕾絲洋裝。參考圖片 2 是場景與打光板:比對其冷藍色月光、飄動霧氣、潮濕反光石地板與去飽和黑色調。 2 39:16 垂直,優質真人短劇風格,淺景深,電影對比,無字幕,無螢幕文字,無浮水印。 4 5鏡頭 1:中近景,攝影機緩慢推近。女主角站在月光照亮的走廊中,呼吸淺淺,目光緊盯著畫面右側外某處。霧氣在她膝蓋高度飄過。 6鏡頭 2:硬切。從她背後越肩鏡頭,男主角從黑暗拱門步出,進入月光,大衣捕捉光線,表情冰冷而好奇。 7鏡頭 3:他的臉部緊密特寫,半邊被窗戶照亮,接著是她的對應特寫,她拒絕移開視線。 8 9音訊:低持續低音嗡嗡聲,遙遠石頭回音,她不穩的呼吸,他踏入光線時的一次沉重腳步聲,最後一次切換時一聲柔和的弦樂漸強。
設定: 模型 MiniMax H3 Reference-to-Video,解析度 2K,時長 8(滑桿預設值;實際剪輯時推至 15),比例 adaptive,並在參考素材中放置兩個檔案。面板將其計為 9 張中的 2 張,因此你之後還有空間加入服裝或道具板。
值得注意比例的情況。我將比例設為 adaptive,只在提示詞中寫了「9:16 垂直」。H3 仍然回傳了垂直畫面,因此它是從文字中讀取構圖,而不需要依賴表單欄位。
Atlas Cloud 上的 MiniMax H3 Reference-to-Video,執行完成:兩個參考檔案已載入為 9 張中的 2 張,解析度 2K,生成的垂直片段正在 OUTPUT 面板中播放。
第一幀是女主角穿著奶油色蕾絲緊身胸衣,站在場景板面板 1 的走廊中,膝蓋高度有霧氣,月光照在潮濕地板上,位置與場景板完全一致。兩張參考圖片都成功落地。
步驟 4:使用相同素材包運行 Seedance 2.5 對決 MiniMax H3 的控制組
不要改變任何一個字。相同的兩張參考圖片、相同的提示詞、不同的模型。我讓每個頁面自己的時長預設值保持不變,而不強制匹配,並且我會在下方說明每個結果。為了「另一個模型」而改寫提示詞,正是比較開始說謊的方式。
plaintext1與步驟 3 相同的提示詞,逐字不變。不要為了另一個模型而改寫它。
設定: 模型 Seedance 2.0 Reference-to-Video,解析度 720p,相同的兩張參考圖片放在「參考圖片」中(同樣是 9 張中的 2 張,另有獨立欄位可放最多 3 段參考影片與 3 個參考音訊檔案)。時長保持頁面預設值,結果回傳為一段 10 秒片段。
Atlas Cloud 上的 Seedance 2.0 Reference-to-Video,執行完成,使用與步驟 3 完全相同的參考素材包與提示詞,OUTPUT 面板中顯示 10 秒結果。
以下是兩個 OUTPUT 面板實際顯示的內容,我將如實報導,而不選出贏家。
兩次運行都保持了角色。相同的奶油色蕾絲洋裝,相同領口與袖口,相同栗色頭髮,相同從場景板取出的霧氣與月光走廊。兩者都沒有創造出不同的女人。參考素材包在兩邊都完成了這項工作,這是我最關心的發現。
差異在於形式,而非臉孔。這個 Seedance 端點傳回 720p;H3 在相同輸入下傳回 2K。而構圖出現了分歧:H3 直接從提示詞文字中讀取「9:16 垂直」並回傳垂直畫面,而 Seedance 運行回傳了 16:9,因為該頁面有自己的比例控制,且僅靠提示詞文字並未覆蓋它。如果你在為 TikTok 剪輯,那第一次忘記填寫表單欄位時,這種差異就會讓你多花一次運行成本。Seedance 2.5 很可能會改變解析度這部分,並加入區域級重做,而我不會假裝我測量過那個。
步驟 5:修正一個鏡頭,無需重新生成整個片段
短劇的真正成本不是第一次生成,而是第七次修改。H3 接受現有片段作為輸入,並根據指令進行編輯,保留你未提及的部分。Seedance 2.5 在這裡的賣點更精細:重繪畫面的某個區域,同時保留表演、光線與攝影機行為。
plaintext1使用提供的片段:保持兩個角色、他們的服裝、攝影機移動與剪輯節奏完全不變。僅改變環境,將月光石頭走廊替換為同一城堡的舞廳,高聳拱形窗戶、亮著的吊燈,以及溫暖的燭光,並重新打亮兩個角色,使他們的關鍵光來自畫面左側的吊燈而非窗戶。將她唯一的台詞改為「你從來就沒睡著過,對吧。」保持她表演的節奏在相同的拍點上。
設定: MiniMax H3 Reference-to-Video,使用步驟 3 的片段作為參考輸入,時長 5,解析度 2K。
zAxBQmHOR5I
超越 Seedance 2.5 對決 MiniMax H3 測試:四種推動參考素材包的方法
同一角色,下一集。 將步驟 1 的表單儲存為資產,在提示詞中只改變鏡頭清單與故事區塊。身分來自檔案,而非你對上週二如何措辭的記憶。
oH2bSNhK0mY
固定聲音。 H3 可接受最多三個音訊參考,每個 2 到 15 秒,且必須與圖片或影片輸入一同提交。給它一個聲音樣本,角色就會以該音色說話,這樣你就不需要在集與集之間更換配音演員。
plQ9q6xxoVE
在付費渲染之前先鎖定攝影機。 Seedance 2.5 的參考轉影片可接受 3D 白模塊與綠幕板,因此你可以在灰色幾何體上鎖定構圖,然後再投入最終外觀。這個範例是在 Seedance 2.1 上運行的,這是該產品系列較早的成員,但工作流程的形狀是一樣的。
6RKQROBa9a0
在地化一個主剪輯,而非重新拍攝。 區域級替換可以更換臉孔、產品或口語語言,同時保持攝影機、節奏與嘴唇時長不變。此處,一個主美容剪輯被重新選角並重新配音為西班牙語、韓語與印地語,房間、構圖與嘴唇時長保持不變。
IcR9nWHqLnU
而因為總會有人問當你不再保持理智時,動作轉移會是什麼樣子:三個穿西裝的男人,被替換為三隻寫實水豚,完全按照原始片段的動作路徑移動,直到它們堆疊成一座金字塔。
pzG58od4W1c
還有這一切的樸素版本,那個沒有人會貼出來的版本:一張靜態海報變成動態海報,且佈局保持不變。
靜態來源海報。將其餵給參考轉影片,加上「保持畫面、調色盤與佈局,將文字動畫化」,你就會得到相同設計的動態版本。
Seedance 2.5 對決 MiniMax H3 短片的實際成本
這裡沒有數字,因為數字會變動,但結構不會變。兩個家族都以秒計費,按用量付費,無座位費與訂閱費。這留下了三個變數:秒數、解析度層級與重做次數。
第三個是整個帳單的關鍵。一次就成功的 15 秒片段只收一次費用。同一個片段失敗七次,就收七次。因此省錢的動作不是選擇較便宜的每秒模型,而是在你生成任何東西之前先搞定參考素材包。步驟 1 和步驟 2 的那兩次圖片呼叫是整個管線中最便宜的項目,卻決定了你將進行多少次影片呼叫。整個鏈條中投資報酬率最高的一環,差距懸殊。
然後修正每秒的直覺。相同參考素材包、相同運行時間:H3 的參考轉影片回傳 1440p,這個 Seedance 參考轉影片端點回傳 720p。每秒是錯誤的單位。每幀像素數,以及你是否需要另外付費進行獨立的升頻處理,才是正確的單位。
音訊也應該納入計算中。兩邊都在同一趟生成中產出原生同步聲音。如果你目前的管線是影片模型加 TTS 再加編輯器對齊音軌,那麼你省下的就是兩次 API 呼叫與一個人的下午,而這筆節省不會出現在任何報價單上。
哪個模型適合哪種工作:
| 工作 | 選擇 | 原因 | 注意事項 |
|---|---|---|---|
| 垂直短劇,9:16,TikTok 或 ReelShort | MiniMax H3 | 1440p 垂直畫面,附帶原生立體聲,現在即可呼叫,15 秒就是完整的鉤子 | 你需要在 15 秒處剪輯,因此請相應規劃節拍 |
| 一段連續 30 秒的品牌影片 | Seedance 2.5 | 單次生成,無須拼接,原生 4K | 先確認你的平台上的可用性 |
| 在已批准的剪輯中修正一個鏡頭 | Seedance 2.5 | 區域級重繪,其餘部分保持不變 | H3 的整段剪輯編輯目前可以滿足大部分需求 |
| 產品與電子商務剪輯 | 兩者皆可 | 兩者都能良好保持螢幕文字與品牌標誌 | 在你出貨的解析度下驗證文字 |
| 遊戲或介面展示 | MiniMax H3 | 2K 下的 UI 與字型穩定性很強 | 單次通過的上限為 15 秒 |
| 一個主剪輯的多語言版本 | Seedance 2.5 | 區域替換加上多語言語音 | 在地化品質仍需母語使用者檢查 |
| 今晚就要出貨 | MiniMax H3 | 三個端點現已上線,加上整個 Seedance 2.0 系列 | Seedance 2.5 的存取權限因平台而異 |
在出貨之前。 MiniMax 表示 H3 的權重將在發布後數天內跟進,而開放權重與商業授權不同,因此在你自行託管之前請閱讀條款。浮水印與商業使用政策在消費者應用程式與 API 存取之間也各有不同,我在撰寫本文時無法從主要條款頁面確認其中任何一項,因此請查閱提供者的條款,而非相信我的話。而且,任何模型授權都不涵蓋肖像權或商標。如果你的參考素材包中包含真實人物、真實品牌或他人的智慧財產權,那是獨立的法律問題,模型的條款無法回答。
上表中所有模型都使用同一把金鑰執行,而模型頁面載有當前費率加上複製貼上的程式碼,包括本週 Seedance 系列可能正在進行的任何促銷活動。
常見問題
Seedance 2.5 在角色一致性上比 MiniMax H3 好嗎?
理論上應該如此,因為它最多可接受 50 個多模態參考,而 H3 為 12 個檔案,再加上區域級重做。但截至 2026 年 7 月 31 日,我找不到任何配對的公開測試,且 Seedance 2.5 尚無競技場評分。在我實際能進行的執行中,決定身分穩定性的變數是參考素材包的結構,而非模型生成:使用一張複合轉向表加上一塊打光板,兩邊都保持了角色。在花時間比較模型之前,先搞定素材包。
我現在就能使用 Seedance 2.5 嗎?還是必須等待?
其 API 在字節跳動端已經上線。在第三方模型平台上的可用性不平均,在我測試的那個平台上,它仍是一個 Day-0 公告。如果你今晚就需要輸出,可呼叫的選項是 MiniMax H3 的三個端點以及整個出貨中的 Seedance 2.0 系列。
MiniMax H3 真的能做到 30 秒影片嗎?
不。規格是每次生成 5 到 15 秒,24fps。任何更長的內容都是延伸或拼接,那是不同的東西,帶有不同的漂移風險。30 秒單次生成屬於 Seedance 2.5。不要讓這兩個宣稱混淆。
兩個模型都會生成音訊嗎?我能在集與集之間保持同一個聲音嗎?
兩者都在同一趟生成中產出原生同步音訊,且 H3 在每個結果上輸出立體聲。對於持續的聲音,H3 可接受最多三個音訊參考,每個 2 到 15 秒,必須與圖片或影片輸入一同提交,而非單獨提交。
我實際上應該送出多少張參考圖片?
比你認為的少,但結構要更好。一張精心構圖的合成圖通常勝過六張零散的裁切,因為獨立的檔案會讓模型將它們平均成一個不存在的人。給它兩個明確的工作:身分與光線,且不要包含互相衝突的風格樣本。
我應該使用哪個模型來製作 TikTok 或 ReelShort 風格的垂直短劇?
本週出貨,使用 9:16、高解析度、聲音已混音:MiniMax H3。若計畫製作一段 30 秒的連續場景,且期望重做單個區域而非整個片段:針對 Seedance 2.5 建置,並確認你的平台何時開放它。






