你已經知道如何提示影片模型了。「電影級光線、慢推、4K。」這些詞彙你用了兩年。
然後你把它貼進 MiniMax H3,拿到一段 2K 的片段,而且它自帶音軌。畫面看起來很棒,節奏卻一團糟。標題裡有兩個字母拼錯了。音訊是模型隨機選的環境音。
問題不在模型。你只給了一句話,它要的是一份時間表。
於是我去讀了 MiniMax 隨 H3 附上的全部 45 個範例提示詞,以及它們產出的成品片段,然後把畫格一個個拆開來看。官方提示詞不是描述。好的提示詞是附了一張音樂提示表的拍攝清單。以下是結構、目前實際開放的參數,以及一個你可以在二十分鐘內重現的示範。
重點摘要
- H3 提示詞是時間線,不是描述。最強的官方範例直接用 [0s-2s]、[2s-4s] 標記來切割片段,而成品影片也確實打中了每一個節拍。
- 聲音和畫面來自同一次生成,所以音訊必須寫在提示詞主體裡。官方提示詞會給它獨立區塊,甚至精確到「6 秒時加入爵士貝斯律動」。
- **你拼寫出來的字會正確呈現;你沒拼寫出來的字會變成字母形狀的雜訊。**我有一份官方片段的畫格裁切,同時證明了這兩種情況。
- image-to-video 接受一個 end_image。給它第一幀和最後一幀,情感弧線在你花費任何算力之前就已經固定了。
- 提示詞長度不是優點。當參考圖片承擔了描述工作時,短的官方提示詞就能運作得很好。長度反映的是你拒絕交給參考圖片的任務有多少。
左邊是 KC Green 的原作漫畫,未經修改。右邊是一次 image-to-video 呼叫的結果:輸入第一幀、輸入最後一幀、十秒輸出,火焰的劈啪聲和那句平淡的「this is fine」是模型自己產生的音軌。沒有人為它配樂。本指南的一切目標,都是為了讓你達到右邊那半。
MiniMax H3 提示詞實際長什麼樣子(我讀了全部 45 個)
目前搜尋結果第一頁的每一篇「MiniMax H3 提示詞指南」都是一張規格表:2K、24fps、5 到 15 秒、原生音訊。那是模型卡,不是提示詞。
這是一個真實的範例。這是 MiniMax 黑色電影片頭序列的官方提示詞的一部分,從中文原文翻譯而來,大約只有完整長度的三分之一:
生成一段 15 秒 16:9 的輕懸疑犯罪片片頭。整體風格參考這些圖片的視覺語言:復古日式動畫片頭卡、銳利剪影、漫畫拼貼、不對稱分割畫面、強烈幾何色塊、英文片頭字幕、少許日文片假名裝飾、爵士犯罪感。氛圍 60% 懸疑、40% 爵士:神秘、冷酷、靈巧、都會犯罪,不是恐怖,不是沉重,也不要變成歡樂的爵士 MV。
[...] 英文片頭字幕必須清晰可讀 [...] 不要加入中文,不要產生亂碼,不要拼錯英文。整段規則:每個英文片頭和職稱只出現一次。不要重複職稱,不要重複名字,不要給同一個人多個頭銜。
轉場必須多樣化:圓形黑膠唱片遮罩、垂直車門擦拭、人物長影橫掃畫面、紅線剪接、巨型英文字母遮罩、分割畫面重新構圖、硬色塊剪接、區塊逐塊貼上面板。所有轉場都要落在鼓點上:清脆、懸疑、靈巧、漫畫拼貼。不要軟溶解,不要流暢轉場。
背景音樂:原創 15 秒片頭音樂,60% 懸疑、40% 爵士。由持續的低音、緊張的撥弦弦樂、冰冷的合成器脈衝、大鼓、稀疏的爵士鼓刷、一段行走貝斯、短暫的男中音薩克斯風樂句和簡短的銅管刺擊組成。前 2 秒以低頻和鈸建立懸疑,3 秒時低音鼓加入,6 秒時爵士貝斯律動加入,10 秒時出現短暫的薩克斯風/銅管樂句,最後 2 秒以緊張的和弦和鼓點結束。
看看文字都用在哪些地方了。幾乎沒有一個字用在「美麗」或「電影感」上。它們都用在負面清單、轉場清單和逐秒音樂提示表上。這就是任務的形狀。
MiniMax H3 官方黑色片頭序列:MIDNIGHT LINE,帶有清晰的 STARRING 字幕
看看那個片段裡的片頭字幕。MIDNIGHT LINE、STARRING、MAYA CROSS、REN KATO、LENA WARD、DIRECTED BY NOAH VOSS。拼寫正確,沒有重複使用職稱,片假名裝飾放在它被要求放的位置。提示詞沒有說「做出漂亮的標題」。它說的是不要重複、不要拼錯、不要中文,並用五種不同方式命名了美學風格。
與黑色片頭提示詞一起提供給 MiniMax H3 的五張風格參考板
這五張板子與文字一起輸入。五張圖片加上一段長提示,一次生成。這就是現在這項工作的模樣。
而這麼多官方提示詞之所以短的原因就在圖片裡。在全部 45 個提示詞中,中位數長度約為 130 個中文字,但最長的兩個分別是 657 和 858 個字。短的提示詞之所以短,是因為參考板承擔了描述工作。長的提示詞之所以長,是因為沒有其他東西能承擔它。
為什麼大多數 MiniMax H3 提示詞的結果平淡無奇,以及亂碼文字的修正方法
會出錯的地方有三個,而且都是「欠缺」而不是「錯誤」。
沒有時間線。 你要求十秒,卻只描述了一個瞬間,所以你得到一個慢推鏡頭,硬撐了十秒。模型在第七秒沒事可做。
沒有音訊區塊。 聲音與畫面在同一次生成中產生。如果你什麼都不說,模型還是會給你一條音軌,只是它自己選一個。
沒有負面清單。 如果不加限制,模型會傾向於使用軟溶解、憑空創造畫面上的文字,並加入沒人要求的字幕條。
最明確的證據是官方遊戲 UI 提示詞,它由六個時間戳記的節拍組成:[0s-2s] 選單、[2s-4s] 右臂面板、[4s-7s] 武器網格、[7s-8.5s] 確認、[8.5s-10s] 載入條、[10s-15s] 世界載入完成。成品片段準確地依序擊中了所有六個節拍。
MiniMax H3 遊戲 UI 片段:選單、裝備面板、載入條、世界載入
現在來看誠實的一面,來自同一個片段,全解析度 2560x1440。
左:提示詞中拼寫出的文字渲染清晰。右:未拼寫的文字渲染成字母形狀的雜訊
左邊,提示詞實際打出的每個字串:RIGHT ARM EQUIPMENT、PHANTOM GRIP、CHRONOS CLAW。清晰、正確、字距像真實遊戲選單一樣。
右邊,最後街景鏡頭的 HUD,提示詞只稱之為「HUD 元素」。它顯示為 ETR METNO CITFEP。在裝備圖示上方,由於提示詞沒說,你得到的是 MNALEαIN IAMG。這不是渲染錯誤。模型正在畫英文的紋理,因為它從未被賦予實際字串。
所以修正方法不是一個設定,而是一個習慣:
如果一個字需要可讀,就把那個字打出來。 然後加上一行負面指示:不要拼錯,不要加入其他文字,不要加入字幕。
以下是每一個強烈官方提示詞都會共享的六區塊結構。
| 區塊 | 內容 | 官方提示詞範例 | 跳過它你會得到 |
|---|---|---|---|
| 1. 風格合約 | 媒介、質感、色調、時代、不能失去的視覺感 | 「復古日式動畫片頭卡、銳利剪影、漫畫拼貼、強烈幾何色塊」 | 到第六秒就漂移的通用光澤渲染 |
| 2. 時間線 | 明確的時間片段,每個片段有動作 | [2s-4s] 平滑縮放至她的右臂。UI 面板從右側滑入 | 一個想法硬撐整個時長 |
| 3. 鏡頭 | 運鏡,或明確拒絕運鏡 | 「鎖定,靜態廣角,無推進,無切換」 | 你沒要求的預設慢推軌道 |
| 4. 音訊 | 每個聲音,以及何時出現 | 「6 秒時爵士貝斯律動加入,最後 2 秒以緊張和弦鎖定」 | 模型今天喜歡的任何環境音 |
| 5. 文字,拼寫出來 | 實際字串,用引號標註 | 「THIS IS FINE.」/ CONFIRM CONFIG | 如上所述的字母形狀雜訊 |
| 6. 負面清單 | 要拒絕的轉場、物件和陳腔濫調 | 「不要軟溶解,不要流暢轉場,不要加入中文,不要重複職稱」 | 軟溶解、創造的文字、詭異漂移 |
區塊 5 和 6 是免費的。它們不會增加額外生成成本,而品質大多來自這裡。
MiniMax H3 提示詞工作流程:你的提示詞屬於哪個端點
同樣的 API 金鑰,同樣的提交並輪詢模式,但有三個入口。你選擇哪一個決定了你的提示詞還需要做什麼。
| 端點 | 你提供什麼 | 它為你鎖定什麼 | 值得知道的參數 | 何時使用 | 計費方式 |
|---|---|---|---|---|---|
| minimax/h3/text-to-video | 僅提示詞 | 無。文字承擔一切 | duration 5-10(預設 8),解析度 2K,比例必須明確設定 | 在投入之前測試視覺或聲音設計 | 依輸出秒數計費,當前費率見模型頁面 |
| minimax/h3/image-to-video | 提示詞 + 圖片(第一幀),可選 end_image | 片段從哪裡開始,以及可選的結束位置 | end_image、duration 5-10(預設 8)、比例預設自適應 | 你有美術作品,希望它動起來而不被重繪 | 依輸出秒數計費 |
| minimax/h3/reference-to-video | 提示詞 + refers[] | 主體身份與風格,在你創造的場景中 | refers[] 混合陣列、duration 5-15、比例最高 21:9 | 相同角色或產品,新環境 | 依輸出秒數計費 |
refers[] 是目前在野外真正被低估的參數,以下是它需要的格式:
json1"refers": [ 2 { "url": "https://.../subject.png", "type": "image" }, 3 { "url": "https://.../style-board.png" }, 4 { "url": "https://.../motion-ref.mp4", "type": "video" }, 5 { "url": "https://.../beat.mp3", "type": "audio" } 6] 7
四條規則,每一條都能幫你省下一次浪費的生成:
- 音訊不能單獨存在。 陣列中至少需要一張圖片或影片。只有節拍軌會被拒絕。
- type 是可選的。 它會從 URL 推斷,但當副檔名不明確時,還是要明確指定。
- 上限是真實的。 最多 9 張圖片、3 個影片和 3 個音訊片段,總共 12 個檔案,參考影片和音訊長度各為 2 到 15 秒(MiniMax API 文件,2026 年 7 月)。
- 在提示詞文字中為每個參考賦予一個任務。 這是這份清單中槓桿最高的習慣。官方提示詞會以「圖片 1 是整體氛圍和風格參考,圖片 2 是主角參考」開頭。沒有那句話,模型就必須猜測每張板子代表什麼。
MiniMax H3 黑暗流行音樂錄影帶:CUT BACK、ONE LOOK、DETONATE 字體
黑暗流行片段背後的兩張字體參考板
那個片段正是規則 4 的論證。它的提示詞從未描述任何一個字母形式。它說「文字包裝樣式和質感參考圖片」,然後提供了兩張板子。佈局之所以出現,是因為它被展示而不是被描述。
再來一張表格,因為模型卡和 API 目前說的並不完全一致,而這個差距正是人們會浪費一個下午的地方。
| 項目 | MiniMax 自家文件 | 端點目前實際接受的內容 | 這對你的提示詞意味著什麼 |
|---|---|---|---|
| 時長 | 4 到 15 秒,僅整數 | text-to-video 和 image-to-video:5 到 10,預設 8。reference-to-video:5 到 15,預設 8 | 15 秒的拍攝清單目前只適合 reference-to-video。將較長的板子改寫成 10 秒 |
| 解析度 | 2K | 解析度預設為 2K,且目前 2K 是唯一能運行的值。768p 的任務會回傳「MiniMax-H3 不支援解析度 768P,支援的解析度:2K」,即使 768p 出現在定價表中 | 以 1440px 短邊為目標。你要求的細節才會真正存活 |
| 畫面比例 | 常見比例或自適應 | image-to-video 和 reference-to-video 預設為自適應。純文字不接受自適應,並回傳其允許的集合:16:9、4:3、1:1、3:4、9:16、21:9 | 在 text-to-video 上必須明確設定比例,否則任務會驗證失敗 |
| 混合參考 | 9 張圖片、3 個影片、3 個音訊、12 個檔案、音訊不能單獨 | refers[] 接受 {url, type},可為 image、video 或 audio,至少需要一個 image 或 video | 你確實可以將動作同步到提供的節拍,只是不能只提供節拍 |
| 原生音訊 | 同一次生成中的立體聲音訊 | 我探測的九個官方片段中,每個都是:2560x1440、24fps、AAC 立體聲 32kHz | 音訊區塊不是裝飾品,它是交付物的一半 |
以上所有內容都在 Atlas Cloud 上執行,那裡三個 H3 端點共用同一組金鑰和同一個提交輪詢迴圈,因此在它們之間切換只是改變模型字串,沒有其他差別。
MiniMax H3 提示詞教學:讓 This Is Fine 狗在火中燃燒,並附帶音效
以下是完整的一步一步流程。這個笑話之所以有效,是因為狗什麼都沒做。把那種拒絕拉長到十秒的真實時間,加上真正的火焰,讓最後兩秒走向原作漫畫實際的結局,它會變得更好笑,同時對你來說也有點糟。大多數人只看過前兩個畫格。
步驟 1:下載原作漫畫。不要讓 AI 重新繪製它。
這條漫畫有六個畫格,兩列三行,600x887。我們只需要畫格 2 和畫格 6。
bash1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png 2# 600x887, 6 panels, 2 cols x 3 rows 3 4# crop panel 2 (the "THIS IS FINE." panel): x 302-584, y 20-293 5# crop panel 6 (the melting dog): x 302-584, y 595-868 6# upscale each 4x with Lanczos -> 1128x1092 7
說清楚:不要要求影像模型畫「一隻看起來像 This Is Fine 的狗」。 AI 重製的版本在半秒內就會被識破是假的,笑點當場死亡。水彩渲染、歪斜的手寫字體和紙張紋理是整個合約的全部。4x Lanczos 放大只是因為原始 282px 的來源太薄;它能給模型一些真實的像素來抓住,而不必創造任何新東西。
原作漫畫的畫格 2 和畫格 6,標示為第一幀和結束圖像輸入
步驟 2:在 image-to-video 上使用 end_image 執行。
模型:minimax/h3/image-to-video。設定:resolution 2K、image = 畫格 2、end_image = 畫格 6、ratio 1:1 以配合接近方形的來源。將 duration 設為 10;滑桿預設在 8,所以要拖動它。
text1手繪 2D 網路漫畫畫格,賦予生命。保留原始水彩紋理、可見的墨水輪廓、未對位的紙張肌理和平面漫畫色調,在每一幀中都保持。不要平滑化,不要用 3D 重新渲染,不要清理線條,不要加入新物件,不要加入新文字。 2 3[0s-3s] 幾乎沒有東西移動。狗狗靜止不動,握著杯子,眼睛直視前方。只有他身後的火焰在移動:緩慢的橙色火舌爬上牆壁,一顆餘燼飄起。對話框中的「THIS IS FINE.」文字完全保持原樣、完全可讀、不變,手寫字體。 4 5[3s-6s] 狗狗舉起杯子,小小地、平靜地喝了一口。對話框在喝下後淡出。火焰變亮。他身後的牆壁開始因熱度而扭曲。他的帽子帽緣開始冒煙。 6 7[6s-8.5s] 熱度蔓延到他身上。他的耳朵下垂,輪廓變得模糊,開始像濕油漆一樣向下流動。他的眼睛仍然沒有移動。杯子仍在他爪子裡。 8 9[8.5s-10s] 完全融化。臉部扭曲,一隻眼睛滑落,牙齒露出僵硬的咧嘴笑,皮毛變成紅色和橙色。他保持姿勢。最後半秒停留在最終畫格上。 10 11鏡頭:鎖定,單一靜態廣角,無推進,無手持,無切換。畫面從不移動。這是一個單一連續鏡頭,在一個漫畫畫格內。 12 13音訊:全程室內火災環境音 - 低微的劈啪聲、偶爾的木材燃燒爆裂聲、微弱的結構吱嘎聲。3 秒時,陶瓷杯子碰到牙齒和一聲小吞嚥。一個平靜、平坦、不受打擾的男性聲音精確地說出:「This is fine.」- 面無表情,沒有情緒,稍微太過放鬆。從 6 秒開始,劈啪聲變大,環境音變厚;最後 2 秒加入低沉的低音膨脹。沒有音樂,沒有罐頭笑聲,沒有本清單以外的音效。 14 15不要加入字幕。不要加入浮水印。不要拼寫圖像中已有的文字以外的任何單字。不要改變「THIS IS FINE.」。不要切開。 16
那個提示詞就是結構表格的活體版本。第一段是風格合約。四個括號片段是時間線。然後是鏡頭、音訊、負面清單。裡面沒有任何裝飾性文字。
在 Atlas Cloud 上的 MiniMax H3 image-to-video:已載入第一幀和結束圖像,10 秒 2K,輸出面板中的完成片段
步驟 3:像 QA 檢查一樣閱讀輸出。
四個檢查點,每個測試提示詞的不同區塊。
- 對話框中的 THIS IS FINE. 是否仍然可讀且拼寫正確?測試區塊 5。
- 線條是否存活,還是某些東西把它「改善」成乾淨的 3D?測試區塊 1。
- 音訊是否只包含你列出的聲音?檢查容器:應該回傳 h264 加上 AAC 立體聲。
- 最終幀是否落在畫格 6 的姿勢上?測試 end_image。
bash1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \ 2 -of default=noprint_wrappers=1 output.mp4 3
我的回傳結果是 1472x1440、24fps、h264 加上 AAC 立體聲,10.13 秒。值得注意:我要求 ratio: 1:1,但得到了 1472x1440,所以在 image-to-video 上,來源幀的形狀會勝出。將你的兩個畫格調整為你實際想要的形狀。
成品片段中的四個幀,分別在 0s、3s、6.5s 和 10s,與提示詞中的四個時間片段相符
步驟 4:用 reference-to-video 把狗移到新地方。
相同角色,新房間。模型:minimax/h3/reference-to-video。設定:refers[] = 畫格 2 作為 image、duration 8、resolution 2K、ratio 16:9。
text1圖片 1 是角色和美術風格參考:保持這個精確的手繪 2D 網路漫畫外觀,相同的水彩紋理,相同的墨水輪廓粗細,相同的狗,相同的小帽子,相同的杯子。不要用 3D 重新繪製他,不要改變他的比例,不要清理線條。 2 3把他放在一個不同的房間,並保持他的冷靜。夜間一個狹窄的開放式辦公室,螢光燈管閃爍,一面牆的螢幕全部顯示紅色錯誤狀態,印表機紙張從畫面中飄落,角落有一個小小的電氣火災。他坐在畫面中央的辦公椅上,杯子在爪子裡,直視鏡頭,完全放鬆。 4 5鏡頭:鎖定,靜態廣角。無推進,無切換。 6 7音訊:螢光燈嗡嗡聲、印表機運轉聲、每隔兩秒重複一次柔和的警報聲、遠處的電氣劈啪聲、4 秒時一聲平靜的啜飲。沒有音樂。沒有語音。 8 9不要加入任何畫面上的文字。不要加入字幕。不要加入其他角色。 10
可轉移的規則:refers[] 承載身份和風格,文字承載場景。 這個分割是角色一致性的全部技巧,也是提示詞第一行之所以存在的理由。
同一隻網路漫畫狗被搬到夜間燃燒的開放式辦公室,由 MiniMax H3 reference-to-video 生成
相同的帽子、相同的杯子、相同的墨水粗細、新的房間。一張參考圖片就完成了所有這些。
另三個值得偷學的 MiniMax H3 提示詞模式
模式 1:動態海報,佈局必須不移動。
MiniMax H3 動態海報:POPUP! 佈局動畫,而畫框和字體保持鎖定
提供給 MiniMax H3 的原始靜態海報
整個提示詞只有兩行:保持畫廊白色畫框、內框、紅白黑色調、3D 人物感和佈局結構不變,並在文字進入時加入靈巧的音效。規則:說出必須存活的部件。「保持佈局」不是風格說明,而是一個約束,模型會把它當作約束來處理。
模式 2:介面示範,動詞勝過形容詞。
MiniMax H3 登陸頁面示範:產品頁面上的滾動、懸停、顏色反轉
登陸頁面片段背後的單一產品參考圖片
那個提示詞要求向下滾動頁面、懸停狀態、強烈放大和顏色反轉。四個動詞。它從未說「現代」或「時尚」。互動是動作,所以把它們寫成動作。 超大的斜體字和碳纖維編織背景來自形容詞;讓它看起來像真實頁面的東西來自動詞。
模式 3:真人實拍加上手繪,靠拒絕清單維持。
MiniMax H3 片段融合了真人實拍的廚房畫面與手繪發光生物
這是一個手機拍攝的傍晚廚房,裡面有小小的發光手繪生物,而它之所以能保持迷人而不是變成恐怖短片,是因為有一串禁止清單:沒有大眼睛、沒有裂開的嘴巴、沒有尖牙、沒有威脅姿勢、沒有撲擊、沒有突然切到黑畫面、沒有驚嚇。負面清單是主要的風格控制,不是一個修補補丁。 它也是你編碼品味的地方。
官方科幻預告片的四個幀:THE STARS WERE LISTENING
預告片背後的氛圍板與角色參考
上面的預告片將這兩個想法串聯起來。提示詞詳細拼寫了一個標題 THE STARS WERE LISTENING:極窄、粗體、全大寫、暗紅色混鐵鏽色、輕微顆粒和霧化邊緣。這個標題完全按照指示呈現。兩張參考板處理氛圍和主角,所以文字從不需要描述一張臉。分工,一路向下。
執行這些 MiniMax H3 提示詞要花多少錢
H3 按生成的影片秒數計費,按解析度區分,所以成本模型簡單得令人耳目一新:一段 15 秒的片段大約花費三次 5 秒嘗試的費用。其他一切都由此衍生。
- 在 5 秒時迭代,在 10 或 15 秒時交付。 構圖、色調和聲音設計在 5 秒時都能確定。鎖定鏡頭沒有任何部分需要完整時長才能告訴你它錯了。
- end_image 不僅是創意工具,也是成本工具。 大多數重跑是因為結尾漂移了。在付費之前鎖定最後一幀,就消除了那個失敗模式。
- 負面清單和拼寫出來的文字是免費的。 它們會增加提示詞的字元數,但提示詞是按秒數計費,而不是按 token 計費。大量使用它們。
- 在寫提示詞之前,先將 duration 匹配到端點。 建立一個 15 秒的拍攝清單,然後發現你的端點上限是 10 秒,會讓你成本重寫而不只是重新執行。
有一件事暫時還不能規劃:定價表列出一個較便宜的 768p 層級,但截至本文撰寫時,768p 的任務會被直接拒絕,2K 是唯一能運行的解析度。預算時假設每一秒都是 2K 秒。當前每秒費率在模型頁面上,一旦 768p 層級開放,也會在那裡顯示。
MiniMax H3 提示詞、迷因與版權
這隻狗並非公共領域。This Is Fine 來自 KC Green 的網路漫畫 Gunshow #648,於 2013 年 1 月 9 日發表,而且只有前兩個畫格曾經爆紅(Know Your Meme,2013 年 1 月)。Green 曾公開、相當疲憊地談論看著這個圖像被不斷重複使用,包括被政治立場與他不同的人使用(NPR,2023 年 1 月)。
這個逐步解說是評論與教學,不是素材庫。如果你想商業化出貨,請自己繪製畫格或授權使用。在客戶專案之前,執行你自己的政策檢查:H3 對可識別的真人與知名 IP 套用內容規則,而截止期限前發現這點並不有趣。
常見問題
MiniMax H3 會產生音訊嗎,還是我之後再添加?
同一次生成。畫面與聲音一起產出,這正是為什麼音訊必須寫在提示詞主體中,而不是之後才附加。給它一個獨立的 Audio: 區塊,並說明每個聲音何時出現。我探測的九個官方片段中,每個都以 AAC 立體聲 32kHz 返回,同時伴隨 2560x1440、24fps 的影片串流。
MiniMax H3 提示詞可以多長?
最多 7,000 個字元,根據 MiniMax 文件。實際上官方範例的長度範圍很廣,中位數約為 130 個中文字,最長的兩個分別是 657 和 858 個字。當參考圖片承擔描述工作時,短的提示詞就能運作良好。如果你沒有參考,預期需要寫一份拍攝清單。
為什麼我的 MiniMax H3 影片中文字會出現亂碼?
因為你沒有把它打出來。在提示詞中實際出現的字串會清晰渲染;你泛泛地指代的東西(「HUD 元素」、「一些標籤」)會以字母形狀的紋理返回。把每個需要可讀的字都拼寫出來,然後加上「不要拼錯,不要加入其他文字,不要加入字幕」。
一個 MiniMax H3 提示詞可以使用多少參考圖片、影片和音訊片段?
九張圖片、三個影片和三個音訊片段,總共十二個檔案,參考影片和音訊長度各為 2 到 15 秒。音訊不能是唯一的參考。請注意,模型能力與特定端點暴露的內容是兩回事,所以請查看模型頁面以了解目前的輸入清單。
MiniMax H3 提示詞可以控制片段的結尾,而不只是開頭嗎?
可以,在 image-to-video 上,透過可選的 end_image 參數。給它第一幀和最後一幀,片段就會在它們之間插值。上面的示範正是如此:輸入漫畫畫格 2,輸出漫畫畫格 6。保持兩張圖片的長寬比相近,否則轉場會變得很難看。
我目前實際上可以得到哪些時長和解析度?
2K,而且只有 2K。768p 的任務目前會被拒絕,回傳「支援的解析度:2K」,即使 768p 出現在定價表中。時長因端點而異:text-to-video 和 image-to-video 接受 5 到 10 秒,預設為 8;reference-to-video 接受 5 到 15 秒。另一個陷阱:在純文字生成時,API 會拒絕 adaptive 並要求明確的 ratio。






