僅限兩週 | Seedream 5.0 Pro 立享 8 折!

Seedance 2.5 與 MiniMax H3:大家都測試了30-Second Flex。沒有人測試Shot 4。

Seedance 2.5 vs MiniMax H3,相同的角色設定表,相同的提示詞。真實規格、可複製貼上的 5 步驟短劇工作流程,以及哪一個能在四個鏡頭中維持臉部一致性。

MiniMax 在週五推出了 H3。不到二十四小時,Seedance 2.5 就到了使用者手中,時間線縮成了一句話:30 秒、原生 4K、50 個參考輸入。H3 的發表貼文靜靜躺在下方,幾乎沒人拿它跑過真正的測試。

我明白為什麼。30 秒是個漂亮的數字,適合放在標題裡。

但如果你真的在製作垂直短劇,你就知道真正毀掉你夜晚的不是第 30 秒,而是第 4 個鏡頭。男主角的下巴線條偏移了半公分,他的領巾少了一道褶,觀眾在鉤子落地之前就滑走了。沒有人因為片段是 15 秒而不是 30 秒而流失。他們流失,是因為特寫裡那個人不是全景裡的那個人。

所以我跳過了規格表對決。我建立了一張角色轉向表、一塊六格場景板,寫了一段 15 秒的哥德式短劇提示詞,然後把同樣的素材包寄給兩邊。接著我盯著那張臉看。

關鍵要點

  • 兩者都是真的,但可達性不同。 H3 的三個端點(文字、圖片與參考轉影片)目前已上線且可呼叫。Seedance 2.5 的 API 在字節跳動端已推出,但在我用來測試的多模型平台上,它仍是一個 Day-0 頁面,因此我對決中的 Seedance 方是 Seedance 2.0 參考轉影片。我在所有相關處都標註了這一點。
  • 規格明顯區分。 Seedance 2.5 = 單次生成最長 30 秒、原生 4K、最多 50 個多模態參考、區域級編輯。H3 = 5 到 15 秒、原生 2K 24fps、9 張圖片 + 3 段影片 + 3 段音訊(最多 12 個檔案)、每個輸出附帶立體聲、整段指令編輯。
  • 角色穩定性是包裝問題,不是模型生成問題。 使用一張複合轉向表加上一塊打光板,兩個模型都保持了相同的臉孔與服裝。不是生成次數決定鏡頭好壞,而是素材包決定的。
  • 那個沒人測試的模型已經排在第三。 在 Artificial Analysis 的圖片轉影片競技場上,H3 以 1,185 Elo 落後於 Seedance 2.0 的 1,196。Seedance 2.5 尚未出現在榜上。
  • 兩者都自行生成音訊。 H3 還能接受最多三個音訊參考來為角色綁定聲音,這就省掉了短劇流程中一整段 TTS 與同步的環節。
  • 要問的是每幀像素,而不是秒數。 相同參考包、相同運行時間:H3 的參考轉影片回傳 1440p,Seedance 2.0 的參考轉影片回傳 720p。這重新定義了整個成本問題。

Seedance 2.5 自己的配對數據尚未出爐。我將在端點在我測試平台上開放的那天補上。

Seedance 2.5 對決 MiniMax H3 的結果,在理論之前

在理論之前,先看工作流程產出的結果。以下是從一段完成的 15 秒垂直片段中抽出的四個鏡頭,並排呈現。這是 MiniMax 自己的 H3 參考運行,使用你將在步驟 1 和步驟 2 中看到的角色表與場景板,原生 1440x2560。我自己使用相同素材包的運行結果會在教學中出現,並顯示遊樂場狀態。

 

XSnfiquLLMk

 

她抵達雕花門(場景板的第 4 格),接著是走廊對峙、他的緊密特寫,然後是雙人鏡頭。他的髮際線在側面和特寫中分得一致。她的半盤編髮冠在滿面特寫中存活下來——這正是大多數模型會悄悄重建臉孔的關鍵時刻。奶油色蕾絲緊身胸衣從第一幀到最後一幀保持相同的領口與袖口。

這就是整個測試。不是 30 秒。四個鏡頭與一條下顎線。

為何 Seedance 2.5 與 MiniMax H3 在同一週打破框架,以及為何大多數角色測試毫無用處

MiniMax 於 7 月 30 日發布了 H3,這是一個通用多模態影片模型,可讀取文字、圖片、影片與音訊作為一個上下文,並回傳 5 到 15 秒的片段,解析度最高 2K,附帶原生立體聲。它還能編輯現有影片,並將動作從一個片段轉移到另一個片段,MiniMax 表示權重將在幾天內跟進(Reuters,2026 年 7 月)。

Seedance 2.5 在同一時間窗口內登場,帶來更響亮的數字:單次生成 30 秒、原生 4K,以及單次作業最多 50 個多模態參考輸入(The Next Web,2026 年 7 月)。其 API 已交到開發者手中,具備區域化編輯(可重繪部分畫面,同時保留表演、光線與攝影機行為)、參考轉影片(可接受綠幕板或 3D 白模塊)、十一種語言,以及實驗性長影片模式可達 180 秒(CineD,2026 年 7 月)。

 

9HprrI3lQK4

 

注意力差距是耐人尋味的部分。幾乎所有我找到的貼文都是 2.5 的片段。與此同時,公開競技場的數字說明了另一回事:在 Artificial Analysis 的圖片轉影片排行榜上,720p 的 Seedance 2.0 以 1,196 Elo 領先,Gemini Omni Flash 以 1,195 緊追在後,而 MiniMax H3 在上線僅四天後就以 1,185 位居第三。Seedance 2.5 在那裡尚無評分(Artificial Analysis,2026 年 7 月)。討論最少的模型,其分數與注意力之間的比值卻最高。

現在,來談談真正決定你輸出的部分——因為它幾乎與你選擇哪個 Logo 無關。

大多數角色一致性測試在模型介入之前就失敗了。四種失敗模式,全部由你來修正:

失敗模式輸出中看到的現象修正方法
多視角參考以獨立檔案送出每個鏡頭的臉孔「幾乎正確」,但彼此不一致將視角合成為一張圖片,然後在提示詞中指定角色(「左邊的男人」、「右邊的女人」)
每個鏡頭重新撰寫角色描述服裝與配件逐鏡頭漂移一次性寫好身分區塊,逐字重複使用;每個鏡頭只改變攝影機與動作
讓光線隨場景移動臉孔在新光線下被結構性重建建立獨立的場景板,鎖定光線方向、霧氣與地板反射,並作為參考輸入
將最大時長視為品質指標30 秒內的任何一次漂移毀掉整個 30 秒剪到你可以重做的粒度,然後再談論長度

第一列是人們最常搞錯的。送出六張單視角圖片,模型會將它們視為六個候選人並平均值。送出一張乾淨的合成圖,模型會將其視為從三個角度的同一個人。同樣的像素,完全不同的結果。

 

2jp1CC7nfUM

 

Seedance 2.5 對決 MiniMax H3 規格表,以及你今天實際能呼叫的內容

將能力與可用性分開來看,緊張關係就很明顯。在原始能力上,Seedance 2.5 在時長、解析度上限、參考數量與編輯粒度上領先。在可用性上,H3 是這週在通用模型平台上擁有三個即時端點的那一個。如果你正在為 2026 年規劃做 AI 影片模型比較,第二欄和第一欄同樣重要。

 MiniMax H3Seedance 2.5Seedance 2.0 參考轉影片(我實際執行的版本)
單次生成最長時長5 到 15 秒最長 30 秒,無須拼接(測試版模式可達 180 秒,實驗性)短片段選單,請參閱模型頁面
解析度原生 2K,16:9 至 9:16 時短邊為 1440p;另有 768p 層級標示為即將推出原生 4K,10-bit 色彩此端點最長達 720p
幀率24 fps未單獨公布未單獨公布
參考輸入9 張圖片 + 3 段影片 + 3 段音訊,總共 12 個檔案最多 50 個多模態參考9 張圖片 + 3 段影片 + 3 段音訊
原生音訊是,每個輸出皆附帶立體聲是,另加 11 種字幕與語音語言
編輯粒度整段指令編輯(更換角色、背景、光線、對白)區域級編輯,可重繪畫面部分整段指令編輯
提示詞上限7,000 個字元未公布未公布
開放權重宣布於發布後數天內開放未宣布未宣布
Artificial Analysis I2V Elo,2026 年 7 月 31 日1,185(第 3 名)尚未評分1,196(第 1 名,Dreamina 720p 項目)
在我測試的平台上可呼叫是,3 個端點尚未,Day-0 頁面

測試設定的完整揭露。 我執行此測試時,Seedance 2.5 在我的平台上尚未開放,因此 Seedance 方使用的是 Seedance 2.0 參考轉影片,這是同一個產品系列中目前出貨的成員,具有相同的四模態參考系統。在 2.5 會改變答案的地方,我會明確說明。Seedance 2.5 頁面目前是 Day-0 公告。

以下所有操作都在一個瀏覽器分頁中,使用一把金鑰,總共三個模型:

步驟模型產出內容關鍵設定成本驅動因素
1OpenAI GPT Image 2 文字轉圖片角色轉向表quality high, 16:9每張圖片,按用量付費,當前費率見模型頁面
2相同模型,第二次執行六格場景與打光板quality high, 16:9每張圖片,按用量付費
3MiniMax H3 參考轉影片9:16 片段,附帶原生音訊9:16, 2K, 時長:測試用 5 秒,實際剪輯用 15 秒秒數 x 解析度,按秒計費
4Seedance 2.0 參考轉影片控制組運行,相同輸入9:16, 最高可用解析度,相同時長秒數 x 解析度,按秒計費
5H3 參考轉影片,以片段作為輸入固定一個鏡頭,無需重新生成整個片段相同解析度,短時長秒數 x 解析度,按秒計費

H3 也有文字轉影片圖片轉影片端點,如果你想要純文字基線或首尾幀控制的話。

在規劃批次之前,還有一件事值得知道:螢幕文字。這段 15 秒的 H3 片頭字幕在八次硬切中保持英文拼寫完全正確,沒有出現任何拼寫錯誤,這是生成影片中最難保持穩定的項目之一。

 

hwooYYPRW5o

 

Seedance 2.5 對決 MiniMax H3 短劇工作流程,逐步說明

五個步驟。請完全按照提示詞輸入,包括那些看起來不美觀的部分。我沒有為了文章而清理它們,你也不應該為了模型而清理它們。

步驟 1:使用 GPT Image 2 建立角色表

在製作任何影片之前,先建立參考素材包。一張圖片、兩個角色、每個角色三個視角、純白無縫背景、均勻的棚內打光。這樣就消除了所有模糊空間,只留下你關心的那個問題:這個人長什麼樣子。

plaintext
1一張全身角色轉向參考表,純白無縫背景,兩個角色並排,總共六個人形,均勻中性的棚內打光,地板上無陰影,無文字、無標籤、無浮水印。
2
3左半邊:男主角,三個視角排成一列——正面、右側面、背面。二十多歲,蒼白膚色,深色波浪中長髮,尖銳下顎線。穿著拖地黑色天鵝絨禮服大衣,翻領與袖口有細微的同色刺繡,黑色錦緞背心,黑色絲綢領巾,直筒黑色長褲,亮面黑色德比鞋。雙臂自然垂於兩側,中性表情。
4
5右半邊:女主角,三個視角排成一列——正面、右側面、背面。二十出頭,白皙膚色,長波浪栗色頭髮,半盤編髮冠。穿著奶油色維多利亞棉質蕾絲洋裝,長袖帶蕾絲袖口,合身緊身胸衣飾有小紐扣,全長及踝裙,奶油色踝帶低跟鞋。雙臂自然垂於兩側,中性表情。
6
7攝影寫實風格,所有六個人形比例一致,腳部對齊在同一基線上,全畫面銳利對焦。

設定: 模型 OpenAI GPT Image 2 Text-to-Image,品質 high,比例 16:9,其餘預設。 總共 11 個字。完美。AI 圖片生成器介面顯示提示詞輸入與產生的角色 Atlas Cloud 上的 GPT Image 2 Text-to-Image,執行完成:左側是轉向提示詞,OUTPUT 面板中六個人形在一張白色底板上。

這是目標形狀。六個人形、一條基線、背景沒有任何可爭論的細節: 讓我們 驅動示範片段的參考素材包:男主角穿黑色天鵝絨,女主角穿奶油色維多利亞蕾絲,每人三個視角,單一檔案。 維多利亞風格黑色與奶油色服裝的正面、側面與背面視角 我自己對步驟 1 提示詞的 GPT Image 2 執行結果,供與上方參考對比。

步驟 2:用六格場景板鎖定場景

你已經固定了臉孔。但光線仍會背叛你。第二張參考圖片鎖定了六個攝影機位置、月光的方向、空氣中的霧氣量以及地板的潮濕程度。你是在告訴模型這部電影只有一套打光設定。

plaintext
1一塊六格電影場景板,2 行 3 列,面板之間有細黑間隔,每個面板底部以小寫優雅白色全大寫字母間距字體標註說明。主題:廢棄哥德式城堡內部,夜晚。冷藍色月光、飄動的低層霧氣、潮濕反光的石頭地板、高聳彩繪玻璃窗、鐵製燭台帶小小溫暖火焰、深層去飽和黑色、厚重天鵝絨窗簾。所有面板中均無人物。
2
3面板 1,說明「全景建立鏡頭 - 走廊」:長柱廊向遠處延伸至一扇透光的彩繪玻璃窗。
4面板 2,說明「低角度 - 月光掠過地板」:低角度攝影機,一道月光斜照在潮濕的石板上。
5面板 3,說明「門口與樓梯構圖」:拱形門口框住一座曲線石梯。
6面板 4,說明「近景細節 - 雕花門」:緊密拍攝一扇厚重的雕花木門,帶有鐵製把手。
7面板 5,說明「窗邊視角 - 霧氣與窗簾」:高窗,霧氣湧入,前景有窗簾邊緣。
8面板 6,說明「最終海報畫面 - 空大廳」:對稱空大廳,圖案地毯通往窗戶。
9
10攝影寫實、電影感、底片顆粒、所有六個面板色調一致。

設定: 相同模型,品質 high,比例 16:9。 六個黑暗哥德式城堡內部的分鏡板,帶有月光 驅動示範片段的場景板:六個哥德式城堡內部,同一色調,說明文字可讀。 黑暗哥德式城堡內部的六個電影攝影機角度 我自己對步驟 2 場景板提示詞的 GPT Image 2 執行結果。

步驟 3:使用 MiniMax H3 參考轉影片生成鏡頭

兩張參考圖片加上一個提示詞,內含攝影機位置與音訊方向。聲音在同一趟生成中產出,因此沒有獨立的語音或配樂步驟。調整時保持短時長,然後在實際剪輯時拉長至 15 秒。

plaintext
1參考圖片 1 是角色表:左邊的男人是男主角,右邊的女人是女主角。保持兩者的身分完全如圖所示:他的下顎線、深色波浪髮、黑色天鵝絨禮服大衣、黑色錦緞背心與黑色絲綢領巾;她的栗色半盤編髮與奶油色維多利亞蕾絲洋裝。參考圖片 2 是場景與打光板:比對其冷藍色月光、飄動霧氣、潮濕反光石地板與去飽和黑色調。
2
39:16 垂直,優質真人短劇風格,淺景深,電影對比,無字幕,無螢幕文字,無浮水印。
4
5鏡頭 1:中近景,攝影機緩慢推近。女主角站在月光照亮的走廊中,呼吸淺淺,目光緊盯著畫面右側外某處。霧氣在她膝蓋高度飄過。
6鏡頭 2:硬切。從她背後越肩鏡頭,男主角從黑暗拱門步出,進入月光,大衣捕捉光線,表情冰冷而好奇。
7鏡頭 3:他的臉部緊密特寫,半邊被窗戶照亮,接著是她的對應特寫,她拒絕移開視線。
8
9音訊:低持續低音嗡嗡聲,遙遠石頭回音,她不穩的呼吸,他踏入光線時的一次沉重腳步聲,最後一次切換時一聲柔和的弦樂漸強。

設定: 模型 MiniMax H3 Reference-to-Video,解析度 2K,時長 8(滑桿預設值;實際剪輯時推至 15),比例 adaptive,並在參考素材中放置兩個檔案。面板將其計為 9 張中的 2 張,因此你之後還有空間加入服裝或道具板。

值得注意比例的情況。我將比例設為 adaptive,只在提示詞中寫了「9:16 垂直」。H3 仍然回傳了垂直畫面,因此它是從文字中讀取構圖,而不需要依賴表單欄位。 AI 影片生成器介面顯示文字提示詞與完成的影片預覽 Atlas Cloud 上的 MiniMax H3 Reference-to-Video,執行完成:兩個參考檔案已載入為 9 張中的 2 張,解析度 2K,生成的垂直片段正在 OUTPUT 面板中播放。

第一幀是女主角穿著奶油色蕾絲緊身胸衣,站在場景板面板 1 的走廊中,膝蓋高度有霧氣,月光照在潮濕地板上,位置與場景板完全一致。兩張參考圖片都成功落地。

步驟 4:使用相同素材包運行 Seedance 2.5 對決 MiniMax H3 的控制組

不要改變任何一個字。相同的兩張參考圖片、相同的提示詞、不同的模型。我讓每個頁面自己的時長預設值保持不變,而不強制匹配,並且我會在下方說明每個結果。為了「另一個模型」而改寫提示詞,正是比較開始說謊的方式。

plaintext
1與步驟 3 相同的提示詞,逐字不變。不要為了另一個模型而改寫它。

設定: 模型 Seedance 2.0 Reference-to-Video,解析度 720p,相同的兩張參考圖片放在「參考圖片」中(同樣是 9 張中的 2 張,另有獨立欄位可放最多 3 段參考影片與 3 個參考音訊檔案)。時長保持頁面預設值,結果回傳為一段 10 秒片段。 AI 影片生成介面顯示文字提示詞與完成的影片 Atlas Cloud 上的 Seedance 2.0 Reference-to-Video,執行完成,使用與步驟 3 完全相同的參考素材包與提示詞,OUTPUT 面板中顯示 10 秒結果。

以下是兩個 OUTPUT 面板實際顯示的內容,我將如實報導,而不選出贏家。

兩次運行都保持了角色。相同的奶油色蕾絲洋裝,相同領口與袖口,相同栗色頭髮,相同從場景板取出的霧氣與月光走廊。兩者都沒有創造出不同的女人。參考素材包在兩邊都完成了這項工作,這是我最關心的發現。

差異在於形式,而非臉孔。這個 Seedance 端點傳回 720p;H3 在相同輸入下傳回 2K。而構圖出現了分歧:H3 直接從提示詞文字中讀取「9:16 垂直」並回傳垂直畫面,而 Seedance 運行回傳了 16:9,因為該頁面有自己的比例控制,且僅靠提示詞文字並未覆蓋它。如果你在為 TikTok 剪輯,那第一次忘記填寫表單欄位時,這種差異就會讓你多花一次運行成本。Seedance 2.5 很可能會改變解析度這部分,並加入區域級重做,而我不會假裝我測量過那個。

步驟 5:修正一個鏡頭,無需重新生成整個片段

短劇的真正成本不是第一次生成,而是第七次修改。H3 接受現有片段作為輸入,並根據指令進行編輯,保留你未提及的部分。Seedance 2.5 在這裡的賣點更精細:重繪畫面的某個區域,同時保留表演、光線與攝影機行為。

plaintext
1使用提供的片段:保持兩個角色、他們的服裝、攝影機移動與剪輯節奏完全不變。僅改變環境,將月光石頭走廊替換為同一城堡的舞廳,高聳拱形窗戶、亮著的吊燈,以及溫暖的燭光,並重新打亮兩個角色,使他們的關鍵光來自畫面左側的吊燈而非窗戶。將她唯一的台詞改為「你從來就沒睡著過,對吧。」保持她表演的節奏在相同的拍點上。

設定: MiniMax H3 Reference-to-Video,使用步驟 3 的片段作為參考輸入,時長 5,解析度 2K。

 

zAxBQmHOR5I

 

超越 Seedance 2.5 對決 MiniMax H3 測試:四種推動參考素材包的方法

同一角色,下一集。 將步驟 1 的表單儲存為資產,在提示詞中只改變鏡頭清單與故事區塊。身分來自檔案,而非你對上週二如何措辭的記憶。

 

oH2bSNhK0mY

 

固定聲音。 H3 可接受最多三個音訊參考,每個 2 到 15 秒,且必須與圖片或影片輸入一同提交。給它一個聲音樣本,角色就會以該音色說話,這樣你就不需要在集與集之間更換配音演員。

 

plQ9q6xxoVE

 

在付費渲染之前先鎖定攝影機。 Seedance 2.5 的參考轉影片可接受 3D 白模塊與綠幕板,因此你可以在灰色幾何體上鎖定構圖,然後再投入最終外觀。這個範例是在 Seedance 2.1 上運行的,這是該產品系列較早的成員,但工作流程的形狀是一樣的。

 

6RKQROBa9a0

 

在地化一個主剪輯,而非重新拍攝。 區域級替換可以更換臉孔、產品或口語語言,同時保持攝影機、節奏與嘴唇時長不變。此處,一個主美容剪輯被重新選角並重新配音為西班牙語、韓語與印地語,房間、構圖與嘴唇時長保持不變。

 

IcR9nWHqLnU

 

而因為總會有人問當你不再保持理智時,動作轉移會是什麼樣子:三個穿西裝的男人,被替換為三隻寫實水豚,完全按照原始片段的動作路徑移動,直到它們堆疊成一座金字塔。

 

pzG58od4W1c

 

還有這一切的樸素版本,那個沒有人會貼出來的版本:一張靜態海報變成動態海報,且佈局保持不變。 穿粉色恐龍連帽衫的卡通男孩向前伸手,帶著巨大爪子 靜態來源海報。將其餵給參考轉影片,加上「保持畫面、調色盤與佈局,將文字動畫化」,你就會得到相同設計的動態版本。

Seedance 2.5 對決 MiniMax H3 短片的實際成本

這裡沒有數字,因為數字會變動,但結構不會變。兩個家族都以秒計費,按用量付費,無座位費與訂閱費。這留下了三個變數:秒數、解析度層級與重做次數。

第三個是整個帳單的關鍵。一次就成功的 15 秒片段只收一次費用。同一個片段失敗七次,就收七次。因此省錢的動作不是選擇較便宜的每秒模型,而是在你生成任何東西之前先搞定參考素材包。步驟 1 和步驟 2 的那兩次圖片呼叫是整個管線中最便宜的項目,卻決定了你將進行多少次影片呼叫。整個鏈條中投資報酬率最高的一環,差距懸殊。

然後修正每秒的直覺。相同參考素材包、相同運行時間:H3 的參考轉影片回傳 1440p,這個 Seedance 參考轉影片端點回傳 720p。每秒是錯誤的單位。每幀像素數,以及你是否需要另外付費進行獨立的升頻處理,才是正確的單位。

音訊也應該納入計算中。兩邊都在同一趟生成中產出原生同步聲音。如果你目前的管線是影片模型加 TTS 再加編輯器對齊音軌,那麼你省下的就是兩次 API 呼叫與一個人的下午,而這筆節省不會出現在任何報價單上。

哪個模型適合哪種工作:

工作選擇原因注意事項
垂直短劇,9:16,TikTok 或 ReelShortMiniMax H31440p 垂直畫面,附帶原生立體聲,現在即可呼叫,15 秒就是完整的鉤子你需要在 15 秒處剪輯,因此請相應規劃節拍
一段連續 30 秒的品牌影片Seedance 2.5單次生成,無須拼接,原生 4K先確認你的平台上的可用性
在已批准的剪輯中修正一個鏡頭Seedance 2.5區域級重繪,其餘部分保持不變H3 的整段剪輯編輯目前可以滿足大部分需求
產品與電子商務剪輯兩者皆可兩者都能良好保持螢幕文字與品牌標誌在你出貨的解析度下驗證文字
遊戲或介面展示MiniMax H32K 下的 UI 與字型穩定性很強單次通過的上限為 15 秒
一個主剪輯的多語言版本Seedance 2.5區域替換加上多語言語音在地化品質仍需母語使用者檢查
今晚就要出貨MiniMax H3三個端點現已上線,加上整個 Seedance 2.0 系列Seedance 2.5 的存取權限因平台而異

在出貨之前。 MiniMax 表示 H3 的權重將在發布後數天內跟進,而開放權重與商業授權不同,因此在你自行託管之前請閱讀條款。浮水印與商業使用政策在消費者應用程式與 API 存取之間也各有不同,我在撰寫本文時無法從主要條款頁面確認其中任何一項,因此請查閱提供者的條款,而非相信我的話。而且,任何模型授權都不涵蓋肖像權或商標。如果你的參考素材包中包含真實人物、真實品牌或他人的智慧財產權,那是獨立的法律問題,模型的條款無法回答。

上表中所有模型都使用同一把金鑰執行,而模型頁面載有當前費率加上複製貼上的程式碼,包括本週 Seedance 系列可能正在進行的任何促銷活動。

常見問題

Seedance 2.5 在角色一致性上比 MiniMax H3 好嗎?

理論上應該如此,因為它最多可接受 50 個多模態參考,而 H3 為 12 個檔案,再加上區域級重做。但截至 2026 年 7 月 31 日,我找不到任何配對的公開測試,且 Seedance 2.5 尚無競技場評分。在我實際能進行的執行中,決定身分穩定性的變數是參考素材包的結構,而非模型生成:使用一張複合轉向表加上一塊打光板,兩邊都保持了角色。在花時間比較模型之前,先搞定素材包。

我現在就能使用 Seedance 2.5 嗎?還是必須等待?

其 API 在字節跳動端已經上線。在第三方模型平台上的可用性不平均,在我測試的那個平台上,它仍是一個 Day-0 公告。如果你今晚就需要輸出,可呼叫的選項是 MiniMax H3 的三個端點以及整個出貨中的 Seedance 2.0 系列。

MiniMax H3 真的能做到 30 秒影片嗎?

不。規格是每次生成 5 到 15 秒,24fps。任何更長的內容都是延伸或拼接,那是不同的東西,帶有不同的漂移風險。30 秒單次生成屬於 Seedance 2.5。不要讓這兩個宣稱混淆。

兩個模型都會生成音訊嗎?我能在集與集之間保持同一個聲音嗎?

兩者都在同一趟生成中產出原生同步音訊,且 H3 在每個結果上輸出立體聲。對於持續的聲音,H3 可接受最多三個音訊參考,每個 2 到 15 秒,必須與圖片或影片輸入一同提交,而非單獨提交。

我實際上應該送出多少張參考圖片?

比你認為的少,但結構要更好。一張精心構圖的合成圖通常勝過六張零散的裁切,因為獨立的檔案會讓模型將它們平均成一個不存在的人。給它兩個明確的工作:身分與光線,且不要包含互相衝突的風格樣本。

我應該使用哪個模型來製作 TikTok 或 ReelShort 風格的垂直短劇?

本週出貨,使用 9:16、高解析度、聲音已混音:MiniMax H3。若計畫製作一段 30 秒的連續場景,且期望重做單個區域而非整個片段:針對 Seedance 2.5 建置,並確認你的平台何時開放它。

最新模型

一個 API,暢享全模態 AI。

探索全部模型