Wan 系列已經是網路上分支最多的開放影片家族。Wan 2.2 和 Wan 2.1 的程式庫各自擁有約 17,000 顆星(GitHub,2026 年 8 月),而 Wan-AI 頁面每個月在其檢查點上處理數十萬次下載(Hugging Face,2026 年 8 月)。因此,當 Wan 3.0 以原生 30 秒生成、最多 20 個參考輸入、以及影像與音訊同步生成的功能進入早期存取時,第一個問題不是人們會不會用它。而是有沒有人知道該如何為它編寫提示詞。
因為一段 30 秒的單次生成,並不是 5 秒片段放大版。它是一個截然不同的寫作問題。5 秒的提示詞描述一張會動的圖片。30 秒的提示詞則是在指揮時間:誰在何時改變、在哪個鏡頭切換、底下搭配什麼聲音。
隨早期存取一起發布的 Wan 3.0 創作者手冊,內含十九個官方提示詞與成果案例。我研究了全部十九個,然後挑出三個最能傳授可轉移技巧的案例,逐一拆解:提示詞實際控制什麼、為什麼這樣建構、以及如何將它的骨架重複運用到你自己的鏡頭中。下方每個影片都是該案例討論的真實未編輯輸出。原始案例提示詞為中文;這裡的骨架是英文重述其結構,而 Wan 系列接受兩種語言的提示詞。
重點摘要
- 較長的 Wan 3.0 提示詞共享同一架構:先放參考綁定、再放全局規則、最後是帶時間戳的鏡頭列表。短測試提示詞可以省略層級,但製作提示詞不該省略。
- 將表演寫成一連串可見動作,絕不使用情緒標籤。「焦慮」是一種期望。「咀嚼速度變慢、眉毛皺起、視線落到手上」才是指令。
- 聲音是提示詞的一部分,不是後製步驟。對話放在大括號 {} 中,特效與音樂各自用句子描述,而沉默需要明確要求。
- 官方案例會重複其最重要的限制,並禁止它們預期會出的錯。手冊中一個提示詞用了三種不同措辭禁止「平滑滑動」,因為模型預設就是平滑。
- 動作可以量化:每次爆發的幀數、每次衝刺佔畫面寬度的百分比、重複次數。下方蜻蜓案例就是證明。
一次生成,30 秒,十個編號的分鏡節拍,以及寫入單一提示詞中的完整配樂弧線:一艘漁船、一場暴風雨、以及一隻準時浮出海面的海怪。官方 Wan 3.0 手冊案例,此處為未編輯輸出。
什麼讓 Wan 3.0 提示詞寫作與眾不同
三項能力改變了這項工作,每一項都增加了一項較短模型從未要求的寫作技巧。
原生 30 秒意味著結構。 當模型生成 5 秒時,一個提示詞可以是單句密集描述。到了 30 秒,無結構的提示詞就會漂移:角色互換衣服、攝影機忘記規則、結尾與開頭無關。手冊中每個長案例都用同樣的方式對抗漂移:明確的階段與結束狀態。這個結構正是本指南的核心。
聯合音訊意味著聲音指導。 Wan 3.0 與影像同時生成配樂。對話、特效、環境音與音樂都可透過提示詞指定,這也意味著未經撰寫的配樂就是即興發揮。官方案例對待音訊的紀律與光線相同:明確說明、限定範圍、有時刻意保持沉默。
最多 20 個參考意味著綁定語法。 臉部、服裝、地點、聲音甚至分鏡圖都可以固定在已上傳的素材上。手冊案例會將每個參考綁定到一個命名主體一次,然後在後續每個鏡頭中重複使用該名稱。如果你已經在當前世代測試過同樣的紀律,例如在 Wan 2.7 參考轉影片 上,那麼 3.0 版本會讓你覺得熟悉而非陌生。
這些都不需要每次都寫成一篇小說。手冊中最短的優質案例只是一個單句,描述一隻 UFO 以手繪風格偷走一頭牛。技巧在於知道你的鏡頭需要哪些層級,這正是下方三個案例的目的。
Wan 3.0 提示詞堆疊:每個長案例共享的三層結構
將十九個官方案例剝到骨頭,較長的案例全都是相同的三層堆疊。
第 1 層:參考綁定。 每個上傳素材一行,說明它是什麼以及可以從中提取什麼。將圖像 1 中的女性定義為主體 1。只從圖像 2 提取服裝。主體 2 的聲音跟隨音訊 1。綁定一次,之後永久用名稱引用。像「這些圖像定義了角色」這樣的模糊複數正是這一層要避免的。
第 2 層:全局規則。 在寫任何動作之前,先寫下整個片段必須保持不變的所有事項:視覺風格及其參考點、指定的色彩系統、光線行為、攝影機語法、表演紀律、音訊紀律,以及禁止的失敗列表。這一層是手冊案例中最積極的部分。一個武術案例將慢動作限制在兩次、每次不到一秒,禁止螢幕上的字幕,完全禁止背景音樂,並禁止攝影機靜止超過 1.5 秒。
第 3 層:時間線。 帶時間戳或編號的節拍,每個節拍包含一個主要事件與一個可見的結束狀態。不是「他們打了一陣子」,而是「0 到 1.5 秒:他站在蘆葦線旁,背光,風吹動他的外套,說出他的一句台詞」。結束狀態能讓第 15 秒與第 5 秒保持一致。
一個有用的記憶方式:第 1 層是選角,第 2 層是規則手冊,第 3 層是鏡頭列表。接下來三個案例各自最強調其中一層。
案例 1:如何為 Wan 3.0 撰寫表演提示詞,一張臉持續 30 秒
手冊中最不花俏的案例,卻是最多人應該優先研究的:一個單一固定特寫鏡頭,一位年輕女性穿著藍色畢業袍,持續整整 30 秒,她說話、憂慮、最後低頭看著自己的雙手。
三十秒,一個鏡頭,無剪輯。畢業袍告訴你場景,眉頭告訴你緊張程度,視線落下的位置正好是提示詞所指定的。官方手冊案例,未編輯輸出。
以下是官方提示詞的逐步動作,用我自己的話而非原文:
- 攝影機先於主體。 它開頭鎖定畫面:正面特寫、頭部與上半身,以及一個刻意的瑕疵:左邊緣有一個完全失焦的第二人物。你命名然後模糊的背景,就是模型不會在中段突然變清晰的背景。
- 服裝作為敘事背景。 一件藍色畢業袍取代了整段場景描述。模型推斷出典禮、人群、那一天。選擇一件能暗示整個世界的服裝或道具,然後跳過描述那個世界。
- 情緒作為一連串可見動作。 提示詞從未要求「焦慮」。它寫出她說話時嘴巴在動、眉頭微皺、表情嚴肅。每一項都是攝影機可以驗證的。情緒標籤是期望;肌肉動作是指令。
- 推動真實感的小動作。 兩個細節比所有其他細節加起來更有用:攝影機保持輕微手持呼吸感,以及她的視線沿著指定軌跡從前方移到自己的手上。在任何長鏡頭中給出一個這樣緩慢、刻意的變化,鏡頭就會看起來像是導演過的,而非生成的。
可重複使用的骨架,英文,結構與案例相同:
Plain1正面[鏡頭尺寸]拍攝[主體],[畫面細節]。一個[失焦元素]位於畫面[邊緣]。[主體]穿著[一件能暗示整個場景的服裝]。[主體]正在[動作],嘴巴動著,[眉頭/眼睛/下巴細節]。光線從[方向]落下,保持[皮膚/布料質感描述]。攝影機鎖定但帶有輕微手持呼吸感。在整個鏡頭中,[一個緩慢的可見變化:視線軌跡、姿勢轉變、物體放下]。
在觸碰 30 秒史詩級作品之前,先用你自己的主體填入這個模板。如果那張臉能撐住三十秒,你的結構就是穩固的。
案例 2:如何像導演一樣建構 30 秒的 Wan 3.0 提示詞
手冊中荒謬的短篇是整個文件中最佳的結構教學素材:一位女牛仔騎著真馬來到孤獨的 66 號公路加油站,拿起油槍,卻給她的馬加了新鮮牧草,而加油員的世界觀悄然崩潰。
三十秒的面無表情鋪陳與一個完美的視覺笑點。喜劇效果寫在結構中:固定的觀察性取景,然後在荒謬事件發生時突然來一個極端特寫。官方手冊案例,未編輯輸出。
它的提示詞由五個命名模組組成,而這個模組列表本身就是課程:
- 一句劇情摘要。 兩句話說明發生什麼事、笑點在哪。不是視覺,而是故事。先寫這個,強迫你弄清楚這 30 秒的目的是什麼。
- 一個命名色彩系統。 不是「色彩繽紛」,而是一條兩色法則:青色天空與橙色大地,然後每個主要物體都分配到其中一邊:褪色的紅色油泵、橙色圍巾、陶土色山脈。命名系統,然後分配它。AI 影片的一致性通常先是色彩問題,然後才是角色問題。
- 附帶敘事任務的角色列表。 每個角色有兩到三個可見特徵,而且關鍵的是,一個功能:加油員明確被指定為整部片的反應鏡頭承載者。指定任務告訴模型在該角色出現的每個節拍中,攝影機的注意力應該放在哪裡。
- 一個命名攝影機哲學。 這個案例發明了一條規則並用一句話定義:冷靜觀察加荒謬特寫,意思是固定中景與慢速平移為預設,只有在荒謬事件觸發時才打破規則,使用突然的極端特寫。命名你的攝影機規則然後在後續引用它,比在每個節拍中重新描述攝影機動作更好。這也是整個喜劇機制的核心:平直的凝視讓草料油槍的特寫更具衝擊力。
- 一個四幕時間線與結束狀態。 鋪陳、升級、笑點、後果,每幕都有時間範圍、一個主要事件、以及一個凍結的最終畫面,甚至到最後一幕加油員嘴裡的牙籤終於掉下來。
這個可轉移的模型比喜劇更廣。劇情摘要、色彩法則、附帶任務的角色、一個命名攝影機規則、四幕帶結束狀態:這就是一份製作簡報,而 Wan 3.0 是這個家族中第一個擁有足夠跑道(三十秒)來讓簡報變得重要的世代。本文最上方的海怪展示就是同一骨架的十節拍版本,帶有配樂弧線,以同樣的方式撰寫:每個節拍一個事件,每個節拍一個可見結束狀態。
案例 3:將運動物理學寫入 Wan 3.0 提示詞
從任何影片模型中最難獲得的是不平滑的運動。模型傾向於溫和、連續的移動,這就是為什麼每個 AI 仙女都像慢速氣球一樣飄浮。手冊中的仙女不飄浮。她像蜻蜓一樣移動:靜止懸停、瞬間衝刺、急停、新方向。

懸停、衝刺、急停。每次爆發中間的模糊只有一兩幀寬,完全符合提示詞的預算。官方手冊案例,以靜態 GIF 展示;實際交付的片段自帶環境音。
這個提示詞透過四種你可以直接搬運的技巧取勝:
- 優先宣告放在最前面。 第一行在描述任何場景之前,就宣布最高優先級的要求:蜻蜓運動法則。注意力是預算。把開頭的 token 花在決定成功與否的規則上,而不是地毯顏色。
- 一個真實世界的物理錨點。 與其使用「快速靈活」這類形容詞,提示詞直接命名一種動物,其運動特徵模型已經見過數千次:定點懸停、爆發式啟動、完全停止、銳利轉向。一個熟悉的錨點勝過十個抽象副詞。
- 用數字取代模糊形容詞。 衝刺必須在 3 到 5 幀內跨越畫面寬度的 60% 到 90%。停止必須維持 2 到 4 幀。前八秒內至少發生六次清晰分離的爆發。殘留運動模糊預算為 1 到 2 幀。此時你寫的不是詩,而是規格,而模型會遵循它。看看下方的條狀圖:衝刺中的那一幀完全是模糊的條紋,前後兩幀則銳利無比。
- 禁止預設行為。 提示詞明確禁止它預測的失敗,以多種措辭表達:沒有緩慢的仙女飄浮、沒有均速巡航、沒有連續平滑滑行,然後用一句修正句說明運動不是什麼:「不是連續飛行路徑,而是短暫、銳利、幾乎跳幀的位移」。當你知道模型在自動駕駛時會做什麼,就把自動駕駛寫出鏡頭。

蜻蜓案例的四個連續靜止幀:在泰迪熊旁懸停、衝刺中的運動模糊、抵達積木上方、靜止懸停
上方輸出的四個幀。銳利、模糊、銳利、銳利:提示詞中的模糊預算,逐幀可見。
同樣的四個動作適用於任何運動問題:不能變成剪輯的甩鏡、需要重量感的撞擊、不能變成有機的機械運動。錨定、量化、優先排序、禁止預設。
Wan 3.0 提示詞中的對話、聲音與參考語法
以上三個案例對讓 Wan 3.0 提示詞「說話」的機制保持沉默,所以這裡是從手冊其他案例彙編的語法層。
對話放在大括號 {} 中。 口語台詞包裹成 {今天練哪塊肌肉},而不是留在開放式散文中,這樣可以避免模型把你的對話當作字幕敘述。台詞會對上嘴型,而對話場景寫成交替的動作與括號台詞,完全像劇本。
聲音可以被指定。 參考語法擴展到音訊:將圖像 1 中的女性定義為主體 1,然後說明主體 1 的聲音跟隨音訊 1。臉部來自一個檔案,聲音來自另一個檔案,兩者在整個片段中鎖定。
音訊需要紀律聲明。 最強的案例像宣告色彩調色盤一樣宣告其聲音景觀。一個動畫案例開頭就說明其音訊類型:只有環境音與音樂,沒有說話。武術案例更進一步,完全禁止背景音樂,只保留呼吸、布料摩擦、打擊聲與風聲,而它確實得到了這些。當需要音樂時,它被寫成一個跨時間線的弧線,從低沉的恐懼無人機音透過弦樂升級到銅管撞擊與一個長長的末日音符,對應到它必須擊中的節拍。
沉默也需要請求。 未經提示時,模型會填滿音軌。如果你的鏡頭只需要空間音與一個音效事件,請明確說明。Wan 3.0 中的聲音指導不是裝飾。它是媒介的另一半。
今天在哪裡練習 Wan 3.0 提示詞公式
Wan 3.0 仍在路上,使用者目前無法使用。但上述結構現在仍然可以累積,因為沒有任何部分是版本鎖定的:綁定、全局規則、時間線、括號對話與禁止預設,所有這些都在當前的 Wan 世代上運作。
整個當前家族在 Atlas Cloud 上活躍,包括 Wan 2.7 文字轉影片、影像轉影片、參考轉影片與 影片編輯,使用單一金鑰,每次執行前顯示價格。一個實用的練習:拿案例 1 的骨架,填入你自己的主體,然後在 Wan 2.7 文字轉影片上以短片段執行。如果表演鏈在那裡成立,同樣的檔案就是你 Wan 3.0 的第一天草稿,只需調整時長而非重寫。Atlas Cloud 在這個家族更新時習慣提供 Day-0 存取,所以練習環境與目的地很可能就是同一個頁面。
常見問題
Wan 3.0 提示詞應該多長?
只要鏡頭需要,而且不超過。官方手冊的範圍從一句話(手繪 UFO 笑話)到超過一千字、描述十節拍怪獸電影的提示詞。決定變數是時長與角色數量:5 秒的單一主體測試需要一個密集句子;30 秒的多角色故事需要所有三層:綁定、全局規則與時間線。
Wan 3.0 會從提示詞生成聲音嗎?
會,音訊與影像在同一階段生成。對話寫在大括號 {} 中,會對上嘴型;音效與環境音寫成散文;音樂可以作為跨時間線的弧線來指導。這個紀律是雙向的:如果你想要接近沉默,或只有環境音而沒有配樂,你必須說出來,否則模型會自行填滿音軌。
Wan 3.0 提示詞中的大括號語法是什麼?
大括號標記角色口中說出的詞語,例如 {終點線見}。將對話放在大括號內可以將它與場景描述分開,這樣模型就會執行台詞而不是插圖。對於多語言作品,請在台詞前說明語言,並附上表達風格。
如何在 30 秒的 Wan 3.0 影片中保持角色一致?
將角色綁定到一個參考,並設定範圍:將圖像 1 中的人定義為主體 1,只取臉部、頭髮與服裝。然後在他們出現的每個時間線節拍中重複主體的名稱,並在任何高風險時刻(例如服裝相關動作或光線變化)重新陳述那兩三個鎖定的特徵。手冊中的打鬥場景案例甚至在每個模組中重新陳述特徵鎖定,這是最保險的版本。
在獲得存取權之前,我可以練習 Wan 3.0 提示詞寫作嗎?
可以,而且你應該這麼做。三層結構、括號對話、參考綁定與禁止預設技巧,今天都在當前家族上運作。Atlas Cloud 上的 Wan 2.7 涵蓋文字轉影片、影像轉影片、參考轉影片與影片編輯,使用單一金鑰,所以在那裡驗證過的模板轉移到 3.0 時只需改變時長,無需重寫。
結論
十九個官方案例以三種不同方式說著同一件事:Wan 3.0 提示詞是一份製作文件,而不是一個標題。指定你的參考、制定你的風格、排程你的節拍、並將聲音視為影像的一半。從畢業生特寫骨架開始,進階到五模組簡報,然後將幀預算的運動規格留給需要它的鏡頭。模型會不斷改變。但撰寫時間而非描述畫面的紀律,是你永遠保有的部分。






