2025年12月,YouTube 終止了 Screen Culture 和 KH Studio 兩個頻道。這兩個頻道合計擁有超過兩百萬訂閱者、超過十億觀看次數。它們將官方影片與 AI 生成的圖片拼接,製作成看似官方版本的電影預告片。Screen Culture 在三月前曾為一部《驚奇4超人》預告片推出 23 個版本,其中有些版本在搜尋結果中的排名甚至高於真正的官方預告(Deadline,2025 年 12 月)。
它們被禁並非因為使用 AI,而是因為垃圾內容和誤導性中繼資料:將他人的電影冒充為官方發行素材。
但十億觀看次數證明了另一件事:預告片是電影行銷中槓桿效應最高的 15 秒。格式從來不是問題,歸屬才是。
所以,這個實驗的有用版本是:將同樣的格式用在你自己的電影上。一個 15 秒的預告片,2K 解析度、原生立體聲、一句旁白、一段配樂、一個片名字卡。一次生成。沒有剪輯時間線、沒有錄音室、沒有音樂授權、沒有 After Effects 後製。
關鍵要點
- 預告片是你要求影片模型產出的最密集內容:多個鏡頭、旁白、配樂、音效設計和螢幕文字全部疊加。H3 目前在 Artificial Analysis 的「含音頻影片編輯」排行榜上排名第一,而電影片頭序列是 MiniMax 自己官方列出的使用案例之一。
- 15 秒是 H3 的硬上限。這不是戲院版預告片(那些通常長 30 到 60 秒),但這正是社交媒體剪輯的精確長度,而這類剪輯承擔了大部分實際工作。
- 提示詞要寫成帶有時間碼的提示表,而不是一堆形容詞。鋪陳、衝突、高潮、片名字卡。四個節拍。
- API 中沒有任何音頻參數。如果你不透過文字指令來安排配樂、旁白和音效,模型就會隨意生成。
- Atlas Cloud 的真實價格:768p 草稿 $1.50,2K 成品 $2.10,加上開場畫面約 $0.17。一個完成的預告片花費在 $2.03 到 $3.77 之間。

GPT Image 2 生成的開場畫面,鎖定了電影的視覺風格:1970 年代鋼製潛水鐘內部,一名女子穿著磨損的橘色潛水服,琥珀色儀器燈和聲納綠光交織。這個畫面是所有其他內容的基礎。使用 openai/gpt-image-2/text-to-image 生成,品質 high,尺寸 2048x1152。這張圖片確保了 768p 草稿和 2K 成品不會變成兩部不同的電影。
我一次生成就完成的 MiniMax H3 電影預告片
先看成品,再做任何理論分析。一個原創深海驚悚片預告片,名為《SALVAGE》。一次 API 呼叫,之後沒有額外剪輯。
《SALVAGE》,15 秒,一次生成,使用 minimax/h3/image-to-video。請開啟音效:船體低鳴、聲納脈衝聲、弦樂集群和那句旁白,全部來自同一次呼叫,與畫面一同產出。帳單顯示 $2.10。
這個檔案中包含哪些內容,以及每個部分來自哪裡:
- 四個不同的鏡頭,硬切,無溶解轉場。一次生成。
- 24 fps,AAC 立體聲,32 kHz。並非後製加入。
- 一句女性旁白,根據提示詞設定,落在 5 到 7.5 秒之間。
- 一個片名字卡,在最後兩秒完全靜止。
這將傳統的五個後製環節濃縮為一個。這正是預告片成為此模型壓力測試的好項目,而對大多數其他模型來說則是糟糕選擇的原因。
為什麼大多數 MiniMax H3 電影預告片嘗試在第九秒左右失敗
預告片是最難偽造的類別,因為你無法隱藏任何弱點。如果文字晃動,你一眼就能看出。如果唇形同步偏移,你立刻就能聽出來。如果配樂沒有落在剪接點上,整個感覺就像加了音樂的幻燈片。
這大致就是 H3 排名如此高的原因。在 Artificial Analysis 的「含音頻影片編輯」排行榜上,它以 8,249 票、1,130 Elo 評分位居第一,領先 Gemini Omni Flash 9 分,領先 Dreamina Seedance 2.0 93 分,並且是該頂尖群組中唯一標記為「開放權重」的模型(Artificial Analysis,2026 年 8 月)。MiniMax 自己的發布資料中,將電影片頭序列列為第一方使用案例,與動畫海報和角色一致的遊戲過場動畫並列(MarkTechPost,2026 年 8 月)。
以下是該發布組中的官方 15 秒科幻開場,讓你親耳聽聽「原生音頻」的含義,然後再花錢:
《THE LAST FLEET LEFT EARTH》,來自 MiniMax 官方 H3 展示組。輸出解析度 2560x1440,24 fps,AAC 立體聲 32 kHz。注意移動鏡頭中跟拍的片名字卡,以及預告片中段的「SHE KNEW WHY」字卡在攝影機持續移動時保持靜止。
現在是失敗清單。以下每一項都是實際發生過的問題,在通往本文頂部影片的過程中出現過。
- 試圖在一次呼叫中塞入 60 秒預告片。 15 秒是硬上限。要求一個完整預告片的故事量,結果會是一團糊,因為模型會將八個節拍壓縮成四個。寫一個預告片就好。
- 寫形容詞而不是提示表。 「史詩級電影預告片、戲劇性、高張力」只會給出一種氛圍,而不是結構。時間碼才能給出結構。
- 模糊的片名字卡。 如果你沒有在提示詞中寫入確切的文字字串、沒有說明文字應如何處理、沒有加上明確的「穩定」指令,你得到的會是近似字母。超過三行的文字就開始出問題。
- 得到無聲檔案,或你從未要求的配樂。 文字轉影片、圖片轉影片或參考轉影片都沒有
audio參數。音頻必須在提示詞中以散文形式指令,否則就不會有。 - 在純文字轉影片上便宜地打草稿。 沒有鎖定第一幀,768p 和 2K 會產生兩部不同的電影,因為 2K 版本是上下文再生,而不是放大。便宜的草稿無法讓你預測昂貴的成品。
- 未發送
duration參數。 架構文件預設為 8,但省略它可能會以 5 秒作業計費,並返回 5 秒的檔案。你的預告片會在衝突節拍處被截斷。 - 假設 HTTP 200 表示一切正常。 輸入真實的知名系列名稱,輸入篩選會在幾秒內拒絕該作業。其他提示詞可能會被悄悄截斷,並以正常方式計費。
第 4、5 和 6 點是花費較高的項目,而且這些都沒有寫在文件裡。
MiniMax H3 電影預告片生成器工作流程,以及每個步驟的費用
五個步驟、五個模型、一個瀏覽器分頁和一個 API 金鑰。以下價格是今天各模型頁面上的即時每秒費率,而非部落格數字。
| 步驟 | 模型 | 功能 | 今日價格(2026 年 8 月) |
|---|---|---|---|
| 鎖定開場畫面 | GPT Image 2(文字轉圖片) | 一張固定演員、服裝和色調的畫面 | 以 token 計費。2048x1152 高品質實測 $0.1745 |
| 草稿與完成預告片 | MiniMax H3 圖片轉影片 | 15 秒預告片本身,包含畫面與聲音 | 2K $0.14/秒,768p $0.10/秒 |
| 純文字變體 | MiniMax H3 文字轉影片 | 相同節拍表,但未鎖定畫面 | 相同費率 |
| 直式剪輯、角色鎖定 | MiniMax H3 參考轉影片 | 9:16 社交版本,最多 9 張參考圖片 | 相同費率 |
| 拯救 768p 的保留作品 | Atlas Cloud 影片放大工具 | 提升你喜歡的草稿,而不是重新執行 | 1080p $0.018/秒,2K $0.024/秒,最低 5 秒 |
Atlas Cloud 模型目錄中的三個 H3 端點。文字轉影片、圖片轉影片和參考轉影片是同一金鑰上的不同路徑,這就是為什麼下面的整個鏈條從不離開一個分頁。
值得寫在手上的參數事實,全部根據今天的即時架構檢查,而非 readme:resolution 為 768P 或 2K,預設為 2K。duration 為 4 到 15 之間的任意整數。該欄位名為 ratio,而非 aspect_ratio,而在圖片轉影片中,此欄位會被完全忽略,因為輸出形狀繼承自你的輸入畫面。文字轉影片和參考轉影片接受 21:9 到 9:16。所有作業均為非同步:先 POST /api/v1/model/generateVideo,然後輪詢 /api/v1/model/prediction/{id}。
MiniMax H3 電影預告片教學:15 秒、四個節拍、一次生成
這部電影是原創深海驚悚片。片名一個單字,讓文字有呼吸空間。一句旁白。直接複製提示詞,並將名詞替換成你自己的專案。
步驟 1:用 GPT Image 2 鎖定開場畫面
不要從影片模型開始。一張畫面大約花費十七美分,而一個 15 秒的 2K 生成花費 $2.10,所以你希望以一個數量級更低的成本確定視覺風格。更重要的是,鎖定的第一幀是唯一能讓你的 768p 草稿預測 2K 成品的因素。
Plain1電影劇照風格,變形鏡頭效果,16:9 畫面內:1970 年代鋼製潛水鐘內部,正在下沉至黑色海水中,越過一名身穿磨損橘色潛水服女子的肩膀拍攝。她的臉僅由一盞琥珀色儀器燈和聲納螢幕的淡綠色光芒照亮。厚舷窗玻璃上凝結著水珠;窗外是絕對的黑暗,只有一縷微弱的顆粒漂浮。濃重的 35mm 底片顆粒感,深沉的黑色,青橙調色板,淺景深,僅使用實用光源。 2無鏡頭光暈,無文字,無標誌,無浮水印,無字幕。
設定:品質 high,尺寸 2048x1152,輸出格式 png。這裡的品質 high 不是可選項,因為底片顆粒感和深沉的黑色是影片模型將在十五秒內延續的元素。

Atlas Cloud 上的 GPT Image 2 遊樂場,已載入潛水鐘提示詞,輸出面板中顯示完成的開場畫面_Atlas Cloud 上的 GPT Image 2,執行完成:左側為上述提示詞,右側為成為本文主圖的畫面。_
步驟 2:撰寫 15 秒預告片節拍表(鋪陳、衝突、高潮、片名字卡)
這是所有「最佳預告片生成器」評比中不會給你的部分。預告片提示詞是一份提示表。畫面有時間碼,音頻有時間碼,旁白有時間窗口,片名字卡有它確切的文字字串。
以下是獨立出來的結構,方便你填入自己的電影:
| 節拍 | 時間窗口 | 畫面 | 剪輯方式 | 音頻提示 |
|---|---|---|---|---|
| 鋪陳 | 0.0-4.0 秒 | 主角在其世界中緩慢移動 | 無剪輯,單一推鏡或跟拍 | 環境音、一個標誌性聲音、低沉背景音 |
| 衝突 | 4.0-8.0 秒 | 廣角鏡頭顯示問題規模,然後回到細節 | 兩個硬切 | 背景音收緊、一個金屬撞擊聲、弦樂進入 |
| 高潮 | 8.0-12.0 秒 | 三個快速細節,然後黑畫面 | 三個硬切,然後六幀黑畫面 | 上升的弦樂集群、一個衝擊聲、然後靜默 |
| 片名字卡 | 12.0-15.0 秒 | 片名淡入,完全靜止兩秒 | 完全無移動 | 一個低頻衝擊聲,然後緩慢衰減的殘響 |
以下是填入內容後的結構,準備好貼入圖片轉影片,並附上步驟 1 的畫面:
Plain115 秒 16:9 預告片,原創深海驚悚片。從提供的首幀畫面精確延續:同一位女性、同一件橘色潛水服、同一種琥珀色與聲納綠色燈光、同一種濃重底片顆粒感。四個節拍,硬切,無溶解轉場。 2 30.0-4.0 秒 鋪陳。緩慢推鏡越過她的肩膀朝向舷窗。灰塵微粒漂浮。聲納螢幕掃描一次。她呼吸;呼氣在玻璃上形成霧氣。 44.0-8.0 秒 衝突。硬切至低角度廣角鏡頭:潛水鐘在黑色懸崖峭壁前顯得渺小,纜繩在其上方繃緊。硬切回她的手正按下開關。儀器燈閃爍。一個形體經過舷窗,失焦,無法辨識。 58.0-12.0 秒 高潮。三個快速剪接:眼睛極特寫,捕捉到紅色過載燈;舷窗玻璃彎曲,出現一條細微裂紋;六幀完全黑畫面。 612.0-15.0 秒 片名字卡。從黑畫面淡入一個片名,居中,最後兩秒完全靜止:《SALVAGE》 7字距極寬,粗體壓縮襯線字體,刷舊冷鋼質感,帶有淡鏽邊緣和內斂的內發光,非純白色。其下方,一半大小的小型大寫字母:NOTHING DOWN HERE STAYS LOST 8兩行文字均穩定不動:無抖動、無扭曲、無漂移、無幀間重新渲染。 9 10音頻,原生生成,請勿輸出靜音軌道: 110.0-4.0 秒 低沉的船體低鳴約 40 Hz,1.5 秒處一聲聲納脈衝,帶有長尾音,遠處壓力嘶嘶聲。 124.0-8.0 秒 嘶嘶聲收緊;6.2 秒處單一金屬撞擊聲;弦樂以一個持續低音進入。 138.0-12.0 秒 上升的弦樂集群,10.5 秒處一聲鉚釘爆裂聲,然後 11.8 秒處硬靜默。 1412.0-15.0 秒 片名字卡上一個深沉的低頻衝擊聲,然後在安靜的聲納聲上緩慢衰減的殘響尾音。 15旁白,僅一句,女性聲音,低沉從容,混在音樂下方,在 5.0 至 7.5 秒之間說出:「Nothing down here stays lost.」 16 17負面提示:除了兩行片名文字外,無任何螢幕文字;無字幕、無說明文字、無浮水印、無工作室標誌、無鏡頭光暈、無快速搖攝、無超出緩慢手持晃動範圍的攝影機抖動、無日光、無可見生物、無血腥、無血液。
其中有三個地方比看起來更重要。AUDIO(音頻)區塊的存在是因為沒有可設定的音頻參數。「rock-steady」(穩定不動)這行字存在是因為文字穩定性是預告片最常見的失敗原因。而 11.8 秒處的六幀黑畫面,讓片名字卡感覺像個片名字卡,而不是另一個鏡頭。

從完成的《SALVAGE》預告片中截取的四幀畫面,標示為鋪陳、衝突、高潮和片名字卡,顯示節拍表實際渲染後的樣子_從 2K 檔案中擷取的相同四個節拍。從左到右:2 秒時的推鏡、5 秒時的低角度廣角、10 秒時的過載燈、14 秒時的片名字卡。_
步驟 3:以 $1.50 的價格在 768p 下製作 MiniMax H3 電影預告片草稿
相同畫面、相同提示詞,resolution: "768P",duration: 15。務必明確發送 duration。省略它可能會以 5 秒作業計費。你得到 1344x768、24 fps、AAC 立體聲,帳單為 $1.50。
768p 草稿。由於第一幀已鎖定,結構上與 2K 成品相同。片名字卡中的小字是你可以看到解析度差距的地方。
僅根據以下四點來判斷,忽略銳利度:
- 剪接是否落在節拍上,還是某個節拍吞噬了另一個?
- 旁白是否存在,且落在 5 到 7.5 秒的窗口內?
- 片名字卡是否靜止不動,還是會蠕動?
- 配樂是否在 12 秒處擊中衝擊點?
如果其中任何一項失敗,修正提示詞並以 $1.50 重新製作草稿。不要在 $2.10 的價格下修正。
步驟 4:以 2K 解析度完成 MiniMax H3 電影預告片
只更改一個欄位。相同 image,相同提示詞,resolution: "2K"。輸出為 2560x1440,帳單為 $2.10。
由於第一幀已鎖定,兩個版本在細節上有所不同,而非內容上。誠實地說:大字在 768p 下也能讀,但第二行文字只有在 2K 下才能解析出實際的字母形狀。

100% 比例下的片名字卡裁切,左側為 768p,右側為 2K,顯示副標題行只有在 2K 下才能解析為可讀字母_相同秒數、相同畫面,100% 裁切。寬字距的《SALVAGE》在兩者中都能存活。其下方一半大小的行是為何你需要在 2K 下完成的原因。_

Atlas Cloud 上的 MiniMax H3 圖片轉影片遊樂場,已載入潛水鐘畫面,輸出面板中顯示完成的片段_Atlas Cloud 上的 MiniMax H3 圖片轉影片,執行完成。此截圖中遊樂場的解析度和持續時間選擇器保留為預設值,因此 OUTPUT 中的片段是比上述 15 秒呼叫更短的運行,而非完成的預告片。_
有一個更便宜的完成方式。如果 768p 的成品已經很理想,將它送至影片放大工具,以每秒 $0.024 的價格放大至 2K,15 秒為 $0.36。這可以保護你已經喜歡的成品,但無法憑空創造出來源中沒有的字母形狀細節,而且 2K 路線最多只能處理 23 秒的輸入。
步驟 5:使用參考轉影片剪出直式 MiniMax H3 電影預告片
16:9 的檔案是給網站用的。9:16 的檔案才是真正被觀看的。參考轉影片最多可接受九張參考圖片加上參考影片和音頻,因此你可以將相同的角色和相同的色調鎖定在直式重構中,而不是碰運氣。
發送 refers 作為陣列,包含步驟 1 的畫面加上一張參考圖板,ratio: "9:16",duration: 15,resolution: "2K"。提示詞是相同的節拍表,但使用直式鏡位:衝突節拍變成單一的中景,而不是低角度廣角,而片名字卡的字體更大,副標題分成兩行。
一個會花錢但從不報錯的陷阱:不要在相同的請求中同時發送 image 和 refers。它們是互斥的,API 會接受兩者,但其中一個會被靜默丟棄。
來自 minimax/h3/reference-to-video 的直式剪輯,相同角色、相同色調,為手機螢幕重新構圖。

Atlas Cloud 上的 MiniMax H3 參考轉影片遊樂場,已載入參考素材,輸出面板中顯示完成的片段_Atlas Cloud 上的 MiniMax H3 參考轉影片,執行完成,參考欄位已填入。解析度和持續時間再次為遊樂場預設值。_
MiniMax H3 電影預告片提示詞的四種變體
相同的節拍表,四種不同的交付成果。
寬銀幕格式。 在文字轉影片或參考轉影片中將 ratio 更改為 21:9。相同的提示表,更寬的遮幅,片名字卡會明顯有更多字距空間。
僅片名片頭。 刪除節拍一至三,僅保留片名字卡,設定 duration: 4。這在 2K 下為 $0.56,可獲得一個帶有低頻衝擊聲的標誌動畫。在電影領域之外也很有用,因為「預告片」通常也適用於遊戲、書籍或 podcast。
另一種語言。 H3 原生支援多種語言的旁白,因此相同的節拍表,將旁白行改寫為日語,即可獲得本地化的預告片,無需單獨的音軌。
另一種類型。 直式劇情預告片是相同的四個節拍,但使用對話而非旁白。這是 H3 展示組中的一個官方 9:16 範例:十五秒、八個鏡頭、一個角色在所有鏡頭中保持一致,並有口語台詞而非旁白。
官方 MiniMax H3 直式預告片,1440x2560,15 秒,八個鏡頭,AAC 立體聲含對話。相同的節拍結構,針對短劇觀眾。
想要 30 秒的預告片?將片段一的最後一幀作為片段二的第一幀。詳細資訊請參閱我們的 MiniMax H3 影片長度指南。
MiniMax H3 電影預告片的實際成本
完成一個 15 秒 2K 預告片的四種誠實路徑。畫面成本為 GPT Image 2 在 high 品質、2048x1152 下的實測 $0.1745。
| 路徑 | 費用項目 | 總計 |
|---|---|---|
| 直接到 2K | 畫面 $0.1745 + 2K $2.10 | $2.27 |
| 草稿後完成(建議) | 畫面 $0.1745 + 768p $1.50 + 2K $2.10 | $3.77 |
| 草稿後放大 | 畫面 $0.1745 + 768p $1.50 + 放大 $0.36 | $2.03 |
| 實際工作階段,三次草稿 | 畫面 $0.1745 + 3 x $1.50 + 2K $2.10 | $6.77 |
| 加上直式剪輯 | + $2.10 | — |
MiniMax 自己的直接定價略低於 Atlas 的費率,因此你可能在其他地方看到 15 秒 2K 片段報價 $1.95。在 Atlas 上,費率為每秒 $0.14,即 $2.10,本文中的所有帳單均使用此數字。
以下是這 $2.10 取代了什麼,以誠實的方式評分:
| 傳統後製環節 | 通常由誰完成 | H3 是否能一次執行完成? | 表現如何(以實際測量為準) |
|---|---|---|---|
| 多鏡頭組裝 | 剪輯師 | 是 | 四個節拍維持;剪接點落在書面時間碼上 |
| 旁白錄製 | 配音員加錄音室 | 是 | 落在書面指定的 5 至 7.5 秒窗口內 |
| 配樂 | 作曲家或圖書館授權 | 是 | 音域弧線和 12 秒衝擊點均存在 |
| 音效設計 | 音效設計師 | 是,但有前提 | 音效提示落在節拍上,但未精確到命名的時間碼 |
| 片名字卡動畫 | 動態設計師 | 是 | 2K 下穩定;768p 下的一半大小文字較模糊 |
如果你想逐行比較 H3 端點與其他模型的價格,MiniMax H3 API 定價細分中有每次呼叫的算術,而上述三個端點在同一個模型目錄中使用同一金鑰,如果你想自己執行這個鏈條。
粉絲預告片、真實電影,以及導致十億觀看次數被刪除的中繼資料
值得準確說明那些頻道到底發生了什麼事,因為教訓不是「不要用 AI 製作預告片」。
兩個頻道都被暫停、進行修正、重新加入合作夥伴計畫,然後回復原狀,並根據 YouTube 的垃圾內容和誤導性中繼資料政策被終止。問題在於呈現方式:標題和縮圖讓它們看起來像是那些尚未有此類預告片的電影的官方素材。如果你正在為現有作品製作概念片,請在標題、縮圖和描述中標明,不要讓中繼資料暗示它來自工作室。
H3 在 API 層面也對此進行了限制。在提示詞中提及真實的系列或特定電影,作業會在幾秒內在輸入篩選階段失敗,而不是生成一些你之後必須思考如何處理的內容。這是一個粗糙的過濾器,偶爾會誤傷無辜的提示詞,但這是一個有用的信號,說明了界線在哪裡。
如果你是自行託管而非呼叫 API,還有一點需要注意:發布的權重根據 MiniMax H3 社群授權協議提供,而產生 2K 版本的 H3-Context-IR 和 H3-Regenerate-2K 模組並非開放版本的一部分,它們保留在 API 端。我們的商業使用與授權指南涵蓋了條款;本文使用的 API 路線均不適用這些條款。
常見問題
MiniMax H3 電影預告片生成器可以製作完整的預告片,還是只能製作 15 秒?
每次生成硬上限為 15 秒。戲院版預告片通常為 30 到 60 秒,而完整預告片為 90 秒到三分鐘(Beverly Boy,2026 年),因此一次呼叫只能提供社交媒體剪輯,而非戲院版本。如需更長時間,請將一個片段的最后一幀作為下一個片段的第一幀,進行鏈式生成。
MiniMax H3 是否會生成預告片旁白和音樂,還是需要我在後製中加入?
原生生成,與畫面同一次呼叫,輸出為 AAC 立體聲 32 kHz,與 24 fps 影片一同交付。但是,三個端點上都沒有任何音頻參數。你必須在提示詞中以散文形式、附帶時間碼來指令配樂、旁白和音效。跳過該部分,你將獲得一個你未選擇的原聲帶。
螢幕上的片名字卡文字是否真的可以讀取?
可以,只要你寫入確切的文字字串、描述文字應如何處理,並加入明確的穩定性指令,例如「穩定不動,無抖動,無扭曲」。保持最多兩行。寬字距的大字可以在 768p 下存活;較小的副標題行只有在 2K 下才能正確解析。
一個 MiniMax H3 電影預告片要花多少錢?
在 Atlas Cloud 上,15 秒 2K 為 $2.10(每秒 $0.14),相同長度 768p 為 $1.50(每秒 $0.10)。加上開場畫面約 $0.17。一個完成的預告片花費 $2.03 到 $3.77,取決於你是放大草稿還是在 2K 下重新執行。務必明確發送 duration。
我可以為真實的現有電影製作預告片嗎?
技術上,輸入篩選會封鎖知名系列,因此模型會在收費前拒絕。實際上,YouTube 已經因這類內容的誤導性中繼資料終止了擁有十億觀看次數的頻道。請製作原創內容,或明確在標題和描述中標明為概念片或粉絲作品。
我能否在更長的預告片中保持相同的角色?
使用參考轉影片,它最多可接受九張參考圖片加上參考影片和音頻,並在那裡鎖定你的角色,而不是指望純文字能保持一致性。不要在相同的請求中同時發送 image 和 refers:它們是互斥的,API 不會抱怨,但其中一個會被靜默丟棄而不告知你。






