我盯著三個 Artificial Analysis 排行榜看了十分鐘,想弄清楚到底誰贏了。
文字轉影片:Gemini Omni Flash 領先 5 分。圖片轉影片:Gemini 領先 2 分。影片編輯:MiniMax H3 領先 9 分。
然後我看了看信賴區間那一欄。正負 7。正負 9。正負 10。
三個排行榜,三個差距,每一個都落在自己的誤差範圍內。在盲測投票中,這兩個模型根本是同一回事。
於是我關掉排行榜,改打開下拉選單。那個差距根本不是 5 分。那個差距是整整一個解析度等級。
重點摘要
- 三個 Artificial Analysis 差距(+5、+2、+9,數據取自 2026 年 8 月 6 日)都落在 ±7 到 ±10 的信賴區間內。就原始品質而言,這是平手,不是勝利。
- H3 支援 2K、最長 15 秒,以及六種畫面比例。Gemini Omni Flash 的 API 上限是 720p、10 秒,以及兩種畫面比例。這些是枚舉值,不是意見。
- H3 接受音訊作為輸入。Gemini 則否。Gemini 有
seed和thinking_level。H3 兩者都沒有。 - Gemini 有專用的
video-edit端點,可直接修改你的原始片段。H3 的修改路徑是reference-to-video,以你的片段為參考重新生成。兩者不是同一種操作,第二輪測試證明了這一點。 - 兩者之中只有一個有可下載的權重,而那個不是 Google 的。

MiniMax H3 vs Gemini Omni Flash 測試的第一輪,兩個模型都從相同的首幀開始動畫,並排顯示
第一輪:相同的首幀、相同的提示詞、相同的持續時間。左邊是 MiniMax H3 以 2K 輸出,右邊是 Gemini Omni Flash 以 720p 輸出。此處以無聲 GIF 顯示;兩個交付檔案都包含原生音訊,並在下方嵌入為可播放影片。這就是問題所在。它們兩個都很棒。
為什麼 MiniMax H3 vs Gemini Omni Flash 的排行榜差距常被誤讀
你找到的幾乎每一篇 MiniMax H3 vs Gemini Omni Flash 文章,都只引用一個排行榜和一個價格。這兩個習慣都會導出錯誤的答案。
以下是全部三個 Artificial Analysis 排行榜,包含那個大家都跳過的欄位。
表 A:MiniMax H3 vs Gemini Omni Flash 橫跨三個 Artificial Analysis 排行榜(含音訊),數據取自 2026 年 8 月 6 日
| 排行榜 | Gemini Omni Flash | MiniMax H3 | 差距 | 是否落在誤差範圍內? |
|---|---|---|---|---|
| 文字轉影片 | 1,243 (#1) ±7, 11,842 票 | 1,238 (#2) ±9, 6,830 票 | Gemini +5 | 是 |
| 圖片轉影片 | 1,191 (#2) ±9, 6,506 票 | 1,189 (#3) ±10, 5,545 票 | Gemini +2 | 是 |
| 影片編輯 | 1,123 (#2) ±5, 11,706 票 | 1,132 (#1) ±6, 9,128 票 | H3 +9 | 是,勉強 |
Elo 分數來自 Artificial Analysis 影片競技場(Artificial Analysis,2026 年 8 月)。圖片轉影片排行榜由 Dreamina Seedance 2.0 720p 以 1,197 分領先,所以這兩個模型都沒有拿下那個冠軍。這些是滾動的群眾投票分數,分數會變動,這正是為什麼 5 分的差距不能當作定論。
一個 5 分的領先,配上 ±9 的信賴區間,意味著排名可能在下週就因為投票雜訊而翻轉。這不是「Gemini 在文字轉影片方面比較好」,而是附有記分板的擲硬幣。
還有三件事人們常搞錯:
每分鐘成本欄位並不是你實際支付的費用。 Artificial Analysis 列出 Gemini 為 $6.00/分鐘,H3 為 $7.80/分鐘。這個欄位是將成本標準化為一分鐘 1080p 預設設定的影片。Gemini Omni Flash 根本無法產生 1080p。所以這個數字是模擬估計值,不是實際帳單。比較的是最終交付成品,而不是秒數。
單一排行榜不代表整個模型。 H3 在三個排行榜中分別位居第二、第三和第一。Gemini 則分別位居第一、第二和第二。只引用其中一個,你就能證明你原本就相信的任何結論。
「Omni」並不代表「什麼都能吃」。 這是個好名字,但也很誤導人。這兩個模型中,有一個接受音訊檔作為輸入,而那個名字裡沒有「omni」這個字。
沒人列印的 MiniMax H3 vs Gemini Omni Flash 規格表
如果 Elo 分數無法區分它們,那麼限制條件表就可以。我直接從兩個模型的即時輸入架構中擷取資料,而不是相信任何發佈文章,而這些差異並不微小。
表 B:MiniMax H3 vs Gemini Omni Flash 硬性限制條件,取自 2026 年 8 月 6 日的即時 API 架構
| 限制條件 | MiniMax H3 | Gemini Omni Flash |
|---|---|---|
| 解析度 | 768P 或 2K | 720p,而且這是枚舉中唯一的值 |
| 持續時間 | 4 到 15 秒 | 3 到 10 秒 |
| 畫面比例 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 僅 16:9 和 9:16 |
| 修改路徑 | reference-to-video(以參考素材重新生成) | 專用 video-edit 端點(直接修改你的原始片段) |
| 最終幀控制 | 支援 end_image | 不支援 |
| 參考素材限制 | ≤9 張圖片,≤3 個影片,≤3 個音訊,總共 12 個檔案 | 1 到 10 張圖片 |
| 音訊輸入 | 是 | 否 |
| seed 可重現性 | 否 | 是 |
| thinking_level | 否 | 是(預設 / 高 / 低) |
| 開放權重 | 是,在 Hugging Face 上 | 否 |
老實讀這張表,Gemini 在三個項目上完全勝出。如果你要建立一個必須能重複生成相同幀的流程,可重現的 seed 就很重要。真正的 video-edit 端點,是與參考條件重新生成截然不同的工具。而 thinking_level 提供了一個 H3 完全沒有的品質調整旋鈕。
H3 在五個項目上勝出,而這些項目正是決定你是否能交付客戶要求的檔案的那幾個。
我在 Atlas Cloud 上執行以下所有測試,因為兩個模型都在同一個 /api/v1/model/generateVideo 端點後面,這意味著只需要一個輪詢迴圈和一個驗證標頭。切換模型只是改變 model 字串。這個細節正是為什麼「兩個都用」是現實的答案,而不是推託之詞。
表 C:此測試中每個端點的成本,根據 2026 年 8 月 6 日的即時價格表驗證
| 端點 | 價格 | 此測試的 10 秒片段 |
|---|---|---|
| openai/gpt-image-2/text-to-image | $0.009 / 張圖片 | $0.01 |
| minimax/h3/image-to-video | $0.14 / 秒 | $1.40 |
| minimax/h3/reference-to-video | $0.14 / 秒 | $1.40 |
| google/gemini-omni-flash/image-to-video | $0.13 / 秒 | $1.30 |
| google/gemini-omni-flash/video-edit | $0.14 / 秒 | $1.40 |
| google/gemini-omni-flash/text-to-video | $0.125 / 秒 | 未使用 |
| minimax/h3/text-to-video | $0.14 / 秒 | 未使用 |
這兩個模型這個月都沒有折扣。Gemini 還提供了一個更便宜的開發者層級(文字轉影片和圖片轉影片為 $0.112/秒,reference-to-video 為 $0.12/秒);H3 沒有對應的層級。
開放權重這條線,Gemini Omni Flash 跨不過去。 H3 的權重已發佈在 Hugging Face 上(MiniMax,2026 年 8 月):一個 33B 密集單流 Omni Transformer,加上 Qwen3-VL-32B 文字編碼器、一個視覺 VAE 和一個音訊 VAE。有兩個警告比下載大小更重要。首先,你自行架設的版本以 768 像素短邊運作;Context-IR 前處理階段和 Regenerate-2K 模組不在發佈內容中,2K 輸出來自這兩個部分。其次,社群授權目前不涵蓋歐盟、英國、南韓或美國,這些地區需要單獨的申請表。在用它建立產品之前,請先閱讀授權。Gemini Omni Flash 沒有類似的對話,因為沒有檔案可以下載。
這個開放權重的定位,加上積極的定價,就是這次發佈的整體策略故事(南華早報,2026 年 8 月)。
親手執行 MiniMax H3 vs Gemini Omni Flash 修改測試
以下是沒人測試過的部分。每個人都只測試第一次生成。但沒人測試第二次。
真正的工作不是一個提示詞。真正的工作是你已經喜歡的片段,加上客戶回覆說「很喜歡,可以讓招牌寫 24H,她的圍裙改成紅色嗎」。那句話正是這兩個模型不再能互換的關鍵,而它恰好就是影片編輯排行榜所衡量的任務。
場景刻意設得很殘酷:一個雨夜麵攤,老闆娘直視鏡頭說話,身後有一塊手繪招牌,字跡清晰可辨,湯鍋冒著蒸氣,雨落在棚頂上。一個畫面同時考驗脣形同步、畫面上文字穩定性、流暢的動態和分層的環境音效。
兩個模型都使用相同的首幀、相同的提示詞和相同的修改指示。以下每次執行都是 10 秒,這是 Gemini Omni Flash 的上限,也在 H3 的能力範圍內。
步驟 1:用 GPT Image 2 鎖定首幀
兩個模型必須從同一張圖片開始,否則第一輪測量的是構圖運氣,而不是模型本身。開啟 GPT Image 2 遊樂場,將品質設為 高,比例設為 16:9,然後貼上以下內容:
Plain1Photoreal night street-food stall in heavy rain, shot on a 35mm lens at f/2.0. A woman in her late thirties in an indigo canvas apron stands behind a steaming noodle counter, looking straight into the lens, mid-sentence. Behind her a hand-painted tin light-box sign glows warm amber with the words "OPEN LATE" in clean bold sans-serif capitals. Rain streaks through the sodium streetlight, steam rises off the broth pot, wet asphalt reflects red and green neon from across the street. Shallow depth of field, practical lighting only, slight lens haze, natural skin texture, no text anywhere else in the frame. 16:9.

Atlas Cloud 上的 GPT Image 2 遊樂場,左側是麵攤提示詞,輸出面板中是生成的圖片
Atlas Cloud 上的 GPT Image 2:左側是提示詞,OUTPUT 中是共享的首幀。 此步驟成本 為 _ $0.009。

生成的首幀:一名穿著靛藍色圍裙的女子,在雨夜站在冒著熱氣的麵攤後方,身後有塊手繪的「OPEN LATE」招牌在發光
兩個模型收到的單一輸入。請注意修改將針對的兩個目標:「OPEN LATE」招牌和靛藍色圍裙。使用 openai/gpt-image-2/text-to-image 生成。
步驟 2:在 MiniMax H3 上進行第一輪
前往 MiniMax H3 遊樂場,選擇 image-to-video 任務,上傳步驟 1 的圖片,然後將 resolution 設為 2K,duration 設為 10,ratio 設為 adaptive(圖片轉影片的枚舉中只有 adaptive)。提示詞:
Plain1The vendor looks into the lens and says, in a warm tired voice: "Broth's been on since four this morning. Sit down, it's still raining." She lifts the ladle as she speaks. Steam curls up across the frame. Rain keeps falling on the awning behind her. The camera holds still, no push, no pan. Ambient audio: rain on canvas, broth simmering, distant traffic, her voice close and dry.

Atlas Cloud 上的 MiniMax H3 圖片轉影片遊樂場,已選擇 2K 解析度,完成的片段在輸出面板中播放
Atlas Cloud 上的 MiniMax H3 圖片轉影片:已選擇 2K,OUTPUT 中是完成的片段。此截圖使用遊樂場的 8 秒預設值執行,成本為 $1.12;用於比較的 10 秒版本嵌入在下方,成本為 $1.40。
MiniMax H3,第一輪,2K,10 秒。開啟音效:對話、雨聲和湯汁沸騰聲都是在同一次處理中生成的,而非事後疊加。
步驟 3:在 Gemini Omni Flash 上進行第一輪,相同的圖片,相同的文字
開啟 Gemini Omni Flash 遊樂場,選擇 image-to-video,上傳相同的步驟 1 圖片,然後貼上步驟 2 的提示詞,不要修改任何字元。設定:resolution 720p,duration 10,aspect_ratio 16:9,thinking_level default,seed -1。
在該表單中要注意兩件事,因為它們正是這篇文章的縮影。resolution 下拉選單只有一個選項。duration 欄位最多只能到 10。我不是選擇 720p 而不是更好的選項;而是根本沒有其他選項可選。
關於此處缺少的內容:我無法為 Gemini 的任一步驟擷取到執行完成的遊樂場截圖。我用來擷取截圖的測試環境,三次都從 Google 端回傳 403 PERMISSION_DENIED,所以我唯一擁有的 Gemini 截圖顯示的是失敗的 OUTPUT 面板,我不會把它偽裝成成功執行。下面的影片是真實的,透過生產環境 API 以所列出的設定生成。H3 的兩個步驟確實有乾淨擷取到,那些截圖是真實的。
Gemini Omni Flash,第一輪,720p,10 秒,相同的輸入。直接在 H3 影片之後播放,自行判斷音訊品質。
步驟 4:第二輪,將修改指示發送給 Gemini Omni Flash
這才是關鍵的一輪。在同一個 Gemini 模型頁面上切換到 video-edit 任務,上傳 Gemini 在步驟 3 中自己產生的片段 作為 video 輸入,將 resolution 設為 720p,thinking_level 設為 high(一個兩部分的編輯指令正是這個旋鈕適用的複雜情況)。完全按照客戶可能會寫的方式貼上這段指示:
Plain1Keep this exact shot: same camera position, same woman, same face, same rain, same lighting, same audio. Change the hand-painted sign so it reads "OPEN 24H" instead of "OPEN LATE", in the same painted style and the same amber glow. Change her apron from indigo blue to deep crimson. Change nothing else in the frame.
Gemini Omni Flash 在修改指示之後。注意招牌,然後是圍裙,再檢查其他部分是否有所變動。
步驟 5:第二輪,將相同的修改指示發送給 MiniMax H3
這裡是誠實的結構性差異,你應該在閱讀結果之前先了解。H3 沒有 video-edit 端點。它的修改路徑是 reference-to-video:你將原始片段作為參考素材交給它,它會根據該參考產生一個新的影片。這不是編輯你的檔案,而是製作一個應該看起來像你的檔案的新影片。
在 MiniMax H3 頁面上,選擇 reference-to-video 任務,將 H3 在步驟 2 中產生的片段 加入 refers 作為影片參考,然後將 resolution 設為 2K,duration 設為 10,ratio 設為 adaptive。貼上步驟 4 的提示詞,完全不做任何修改。
此步驟也沒有遊樂場截圖,原因不同且更無聊:我用來擷取畫面的無頭瀏覽器,在載入影片參考時崩潰了三次。實際執行透過 API 順利完成,沒有抱怨。
MiniMax H3 在收到相同的修改指示後,透過 reference-to-video 以 2K 輸出。

第二輪並排比較:左邊是 Gemini Omni Flash 的 video-edit 結果,右邊是 MiniMax H3 的 reference-to-video 結果,兩者都來自相同的修改指示
第二輪並排比較,無聲 GIF。左邊是 Gemini Omni Flash 透過 video-edit,右邊是 MiniMax H3 透過 reference-to-video。兩者都必須處理相同的句子。
第二輪實際發生的情況。 我原本預期 H3 會在這輪落敗。參考條件重新生成是比真正的編輯端點更粗糙的工具,而「重新生成整個片段,希望它落在同一個地方」正是你會得到不同臉孔、鏡頭偏移,以及客戶問「畫面怎麼了」的原因。
但回傳的結果並非如此。兩個模型都完成了任務,而且都做得很乾淨。
Gemini 的 video-edit 行為完全符合預期。招牌上顯示的是「OPEN 24H」,字體風格、琥珀色光芒和鐵皮上的風化效果都相同。圍裙是深紅色。其他一切都沒變:同一張臉、同一個表情、同一個湯杓角度、同一形狀的蒸氣、同樣的雨、背景中同樣的尾燈。看起來就像原始檔案只做了兩個像素級的修正,因為本質上確實如此。
H3 的 reference-to-video 產生了相同的兩個改變,而且畫面穩定性遠比其架構所暗示的要好。招牌變了,圍裙變了,而且在整個 10 秒內,構圖、湯杓流出的湯汁、蒸氣柱和她的臉部都與第一輪片段保持一致。如果存在偏差,我逐幀檢查也無法發現。
所以第二輪是第三個統計上的平手,我不會為了讓故事更乾淨而假裝不是。區分這兩個輸出的不是編輯品質,而是 H3 回傳了 2560x1440 搭配 32 kHz 立體聲軌道,而 Gemini 回傳了 1280x720。相同的指示、相同的成功、不同的交付成品。
一個誠實的方法論警告:這只是針對單一片段的單次修改,不是受控研究。對招牌和服裝進行兩部分的改變,算是相當友善的編輯。更困難的案例(移除鏡頭移過的物體、改變被主體遮擋的物件、疊加四輪修改意見)才是專用編輯端點應該勝出的地方,也是重新生成開始不穩定的地方。在做出決定之前,請先自行測試。
值得測試的三個更多 MiniMax H3 vs Gemini Omni Flash 差異點
第二輪是改變交付成果的關鍵。還有三個差異點值得你花二十分鐘和自己的額度來測試。
餵給它一個音訊檔。 H3 的 reference-to-video 最多接受三個音訊剪輯,每個長度 2 到 15 秒,前提是至少有一個圖片或影片參考素材一起提供。這表示你可以交給它一段真實的人聲錄音,讓角色表演出來。Gemini Omni Flash 在其四個端點上都沒有音訊輸入欄位,因此根本無法進行這個比較。這對 Google 來說不是分數上的損失;這是一種根本不存在的功能。
要求 21:9。 H3 的 reference-to-video 比例枚舉包含 21:9、16:9、4:3、1:1、3:4 和 9:16。Gemini 的 aspect_ratio 枚舉只包含 16:9 和 9:16。如果你的交付成果是寬銀幕片頭或 1:1 的社群媒體剪輯,那麼這兩個模型中有一個根本不在討論範圍內。
鎖定一個 seed 並重新執行。 這個反過來。Gemini 提供了 seed;H3 在任何端點上都沒有提供。如果你要建立一個流程,要求相同的請求在星期二回傳的幀數必須與星期一相同,那麼 Gemini 給了你一個把手,而 H3 什麼也沒給。對於迴歸測試、A/B 文案變體或任何自動化渲染農場來說,這是一個真正的優勢,應該記在 Google 的帳上。
一次 MiniMax H3 vs Gemini Omni Flash 測試的實際成本
上述整個實驗,包含四次影片生成和一張圖片,總共花費約 $5.51。一張首幀 $0.009,兩個 10 秒的第一輪片段各 $1.40 和 $1.30,兩個 10 秒的第二輪片段各 $1.40。
以每秒計算,Gemini 較便宜:$0.125 到 $0.14,對比 H3 的固定 $0.14,依端點不同大約便宜 7% 到 11%。這個數字是真的,但單獨來看幾乎沒有用處。
原因如下。假設交付成果是一個 15 秒的 21:9 電影級開場,解析度為 2K。H3 可以一次生成一個片段。Gemini 根本無法生成:解析度不行、長度不行、畫面比例也不行。你得拼接一個 10 秒和一個 5 秒的 16:9 片段,裁切來偽裝寬銀幕,然後輸出 720p。你無法交付的東西,它的每秒價格就不是省錢。
反過來說。假設交付成果是一個 16:9 的社群媒體剪輯,預計要經過四輪客戶修改意見,而且三週後法務團隊要求重新渲染時,必須回傳完全相同的位元組。Gemini 的 video-edit 加上 seed 正是為這種循環而設計的,而且在執行時的每秒成本還更低。
表 D:哪種 MiniMax H3 vs Gemini Omni Flash 工作該交給誰
| 你面對的工作 | 交給 |
|---|---|
| 2K 交付 | MiniMax H3 |
| 單一片段長度超過 10 秒 | MiniMax H3 |
| 21:9、4:3、1:1 或 3:4 構圖 | MiniMax H3 |
| 餵入真實音軌 | MiniMax H3 |
| 在自己的 GPU 上自行架設 | MiniMax H3 |
| 停在特定的最終幀 | MiniMax H3 |
| 對話式的多輪修改 | Gemini Omni Flash |
| 保留片段中未修改的部分 | Gemini Omni Flash |
| 透過 seed 實現可重現的渲染 | Gemini Omni Flash |
| 一般的 16:9 短格式,追求最低每秒成本 | Gemini Omni Flash |
這篇文章的結論就是那張表,而不是一個分數。如果一個基準測試無法以超過其自身誤差範圍的差距來區分兩個模型,那麼這個基準測試已經告訴了你它知道的一切,接下來就由規格表接手。
如果想更廣泛了解 H3 在整個領域中的定位,MiniMax H3 替代方案分析涵蓋了在它不領先的排行榜上擊敗它的模型。
常見問題
MiniMax H3 比 Gemini Omni Flash 好嗎?
盲測無法區分它們。在三個 Artificial Analysis 排行榜上,差距分別是 5、2 和 9 Elo 分,而且每一個都落在 ±7 到 ±10 的信賴區間內。根據規格選擇,而不是排名。解析度上限、持續時間限制和畫面比例列表會改變你的交付成果;5 Elo 分則不會。
MiniMax H3 和 Gemini Omni Flash 哪個比較便宜?
以每秒計算,Gemini 較便宜。在 Atlas Cloud 上,它的價格是 $0.125 到 $0.14/秒,而 H3 是固定的 $0.14/秒,此外 Gemini 還有開發者層級 $0.112/秒,H3 沒有對應層級。但 Gemini 上限為 720p、10 秒和兩種畫面比例,所以對於許多交付成果來說,你比較的並不是相同的產品。為最終剪輯定價,而不是為秒數定價。
Gemini Omni Flash 能否生成 1080p、2K 或 15 秒的影片?
不能。其 API 的 resolution 參數只有一個合法值 720p,duration 接受 3 到 10 秒。MiniMax H3 提供 768P 或 2K,以及 4 到 15 秒。這些是從 2026 年 8 月 6 日的即時架構中讀取的枚舉限制,並非編輯意見,Google 日後可能會放寬。
我能像自行架設 MiniMax H3 一樣自行架設 Gemini Omni Flash 嗎?
不能。H3 的權重在 Hugging Face 上,可以在本地以 768 像素短邊執行。產生 2K 輸出的 Context-IR 階段和 Regenerate-2K 模組不在發佈內容中,保留在 API 端。另外請檢查授權:它目前不涵蓋歐盟、英國、南韓或美國,除非有單獨的申請。
我必須只選一個嗎?
不,上面的工作分配表是更好的答案。兩個模型在 Atlas Cloud 上都在同一個 generateVideo 端點後面,所以同時使用兩者意味著一個輪詢迴圈和不同的 model 字串,而不是兩個整合。根據交付成果來路由,勝過賭在一個每週變動的排行榜上。






