生成長篇 AI 編舞時,通常到了第八秒左右四肢開始液化,最終令人沮喪。對 Wan 3.0 原生輸出的實際測試顯示,動作保留能力大幅躍進,能在 30 秒連續生成的畫面中保持身體解剖結構與角色身份不變。
在此 Wan 3.0 舞蹈基準測試中,我們在嚴格的零剪輯條件下評估兩種延伸舞蹈風格,測試模型如何平衡複雜服裝物理、多主體追蹤與原生鏡頭穩定性,最終獲得平均 4.2 / 5 的分數。
| 舞蹈 | 分數 | 時間穩定性 | 主要偽影 |
| 肚皮舞紗巾測試 | 4.6 / 5 | 高面部身份保留度與乾淨的 360° 紗巾物理 | 第 24 秒後出現輕微地板摩擦損失與手指柔化 |
| 傳統雙人舞 | 3.8 / 5 | 完全遮擋下仍完美鎖定雙角色身份 | 非提示的跳剪導致畫面閃爍與燈光突變 |
測試證實,Wan 3.0 在長篇生成過程中能抵抗嚴重的 AI 影片動作衰減。舊一代影片生成器會讓複雜關節動作融化,而 Wan 3.0 能在完整的 30 秒 AI 舞蹈影片中保持結構對齊、面部身份與服裝動態。
測試方法:評估連續動作邏輯與解剖結構保留
多數 AI 影片基準測試都將高失敗率隱藏在三秒修剪片段與多次拍攝的倖存者偏差背後。為了評估真實的物理穩定性,我們的 Wan 3.0 舞蹈測試方法採用嚴格的零剪輯協議。本測試評估的每個輸出都是使用原始的單鏡頭影片生成,橫跨完整 30 秒,且無任何後製修復。
標準化生成限制
我們鎖定所有執行參數,以隔離核心模型物理:
- 解析度與速度: 1080p 原生輸出,以每秒 24 幀渲染。
- 種子控制: 比較提示詞運行時使用固定種子值。
- 動作控制: 基準動作強度設定維持在預設值 0.50。
- 後製處理: 零時間剪切、拼接或速度調整。
主要評估支柱
- 解剖完整性: 在快速轉動中追蹤手指數量、手腕關節活動與面部幾何結構。
- 物理與動量: 測量流動服裝(如絲綢衣袖與肚皮舞紗巾)上的重量轉移與重力反應。
- 空間連續性: 在 360 度旋轉與多主體遮擋中評估動作中的身份一致性。
此框架建立了一個可重複的 AI 舞蹈生成基準測試,能將真正的時間推理與短暫的視覺花招區分開來。
測試案例 1:肚皮舞流暢度、軀幹孤立與布料物理
在舊版影片模型中,提示長幅垂墜布料與慢動作布料操作,通常會導致布料撕裂、手部網格穿模,或透明織物後的面部扭曲。執行我們的 Wan 3.0 肚皮舞測試後,揭示了模型在 30 秒連續時間軸上,如何有效管理連續紗巾堆疊、手部與面部遮擋,以及旋轉服裝動量。
**注意:**所有影片片段皆為原始未剪輯輸出,透過Atlas Cloud 的 Wan 3.0 圖生影片以 1080p、30 秒生成,每次渲染 $4.80。
我們影片的首幀影像:

我們設計的提示詞:

影片輸出:
評估動作真實感與紗巾遮擋
模型並非依賴快速鏡頭切換,而是透過刻意、慢節奏的編舞與全身旋轉來維持畫面穩定。此測試凸顯了 Wan 3.0 如何處理多層透明織物與近距離手指追蹤,而不產生視覺偽影。
| 動作元素 | 觀察到的動作行為 | 分數 |
| 基準姿勢與畫面保留 | 初始姿勢堅如磐石,保持寬廣紗巾展開,背景零閃爍 | 4.9 / 5 |
| 手部幾何與面部遮擋 | 緩慢的蛇形手臂波動在將紗巾層疊到臉部時,仍保留五根清晰手指 | 4.4 / 5 |
| 旋轉布料物理 | 輕薄絲綢紗巾在完整的 360 度旋轉中,對角動量做出準確反應 | 4.6 / 5 |
服裝動態與碰撞行為
我們 30 秒連續渲染中的關鍵物理觀察包括:
- 靜態基準鎖定(0 至 13 秒): 模型在舞台聚光燈下穩固地錨定開場的雙臂展開姿勢,保持 bedlah 服裝上的珠飾紋理清晰,無微閃爍或姿勢漂移。
- 手指完整性與分層遮擋(14 至 23 秒): 當舞者將輕薄藍色紗巾包裹過臉部與胸口時,個別手指關節仍保持活動。高追蹤穩定性防止手部幾何結構融合進面部網格,或溶解於布料紋理中。
- 離心服裝動量(24 至 29 秒): 絲綢紗巾在完整的 360 度旋轉中,於真實離心力作用下向外展開時,不會穿過皮膚或頭髮,並在停止時平滑地垂落在肩上。
這些乾淨的布料包裹與穩定的面部追蹤,證實了 Wan 3.0 能處理多層織物動作,而不會出現長篇 AI 渲染常見的畫面撕裂問題。
測試案例 2:傳統雙人舞、雙人肢體接觸與空間遮擋
在單一鏡頭中渲染兩位舞者,通常會在幾秒內讓 AI 影片模型崩潰,導致肢體融合,或在旋轉時其中一位表演者的服裝跑到另一位身上。測試以傳統雙人舞為特色的 Wan 3.0 雙人舞,揭示了模型如何處理複雜的空間互動、服裝重疊與多主體追蹤。
我們影片的首幀影像:

我們設計的提示詞:

影片輸出:
多主體追蹤與空間遮擋效能
在我們對傳統 國風 AI 舞蹈影片的測試中,兩名表演者分別穿著對比的紅色與藍色漢服,在 30 秒的連續拍攝中執行同步旋轉與水袖動作。
| 多人指標 | 觀察到的模型行為 | 分數 |
| 雙角色身份鎖定 | 紅色與藍色漢服細節在所有鏡頭切換中仍保持分明 | 4.7 / 5 |
| 空間遮擋恢復 | 紅衣舞者背面轉向(12s–17s)後,背景舞者乾淨地恢復 | 4.3 / 5 |
| 鏡頭連續性與轉場 | 頻繁的原生跳剪引發突然的構圖跳動與輕微燈光閃爍 | 3.2 / 5 |
服裝交錯與時間性瑕疵
- 遮擋中的身份鎖定(00s 至 17s): 當紅衣舞者轉身並完全遮住藍衣舞者(12s–16s)時,模型無縫恢復被隱藏的舞者,保留其精確的面部幾何、髮飾與藍色漢服滾邊。
- 水袖動態與分離(18s 至 23s): 重疊的水袖掠過胸口線條,不會出現紋理融合、布料撕裂或顏色浸染。
- 原生跳剪與燈光突變(01s、11s、23s): Wan 3.0 傾向在鏡頭角度之間快速切換,而非維持單一連續拍攝,例如在第 11 秒強制切入緊湊的背面鏡頭。這些突然的轉變會打斷節奏,並引發短暫的燈光突變與畫面卡頓。
**創作者備註:**雖然 Wan 3.0 在多主體身份鎖定方面表現出色,但要鎖定連續構圖,需要明確的負面提示詞,例如 camera jump cuts、sudden scene switch、lighting pops,以防止非預期的角度切換。
30 秒時間衰減時間軸:追蹤第 0 到第 30 秒的解剖完整性
生成 30 秒 AI 舞蹈片段時,通常會在第 20 秒左右顯現潛在衰減,腳部失去與地板之間的摩擦力,手指也逐漸模糊。分析我們的測試渲染結果,可看出 Wan 3.0 如何在延伸時間軸上管理衰減。
0 至 10 秒:基準鎖定與靜態穩定性
在最初的十秒內,Wan 3.0 提供銳利的邊緣定義,並在低速度姿勢中實現零漂移。
- 足部錨定: 在靜態站姿與細微的手部動作中,腳部與舞台地板之間保持穩固的摩擦力。
- 服裝銳利度: 金屬流蘇、絲綢垂墜與髮飾保持清晰的高頻細節,無微閃爍。
- 解剖完整性: 面部特徵與手指數量保持 100% 鎖定。
10 至 20 秒:微衰減與構圖切換
在第 10 到 20 秒之間,核心身體力學保持穩固,不過模型生成的鏡頭跳動會引入短暫的轉場偽影。
- 遮擋表現: 在緩慢的面部與胸口紗巾包裹動作中(肚皮舞測試),手指幾何結構保持完整。
- 非提示的構圖切換: 突然的視角切換(例如雙人舞測試中第 11 秒的背面鏡頭剪切)會造成瞬間燈光突變,但角色身份仍保持鎖定。
20 至 30 秒:極限邊界與地板摩擦力損失
最後的十秒揭露了 Wan 3.0 動作預算的邊界。
- 旋轉時的在地板上滑動(24s–28s): 在全身旋轉與雙角色轉動期間,腳部與木質舞台之間的機械摩擦力喪失,導致輕微的「溜冰式」地板滑動。
- 身份隔離: 儘管出現地板滑動與鏡頭切換,面部幾何仍與第一幀完全相同。
雖然 Wan 3.0 並非完全免疫於後期動作衰減,特別是在第 20 秒後的地板摩擦力損失,但其能將面部身份與物理漂移隔離的能力,標誌著真正的世代飛躍。對創作者而言,這代表長篇渲染仍可用於成品製作,只要接近第 25 秒的全身旋轉透過中景構圖或簡短後製剪切來管理即可。
可直接複製貼上的提示詞配方:在 Wan 3.0 中穩定生成 AI 舞蹈
在 Wan 3.0 中輸入「woman dancing」這類簡單請求,通常會導致混亂的鏡頭搖擺與無錨點的四肢旋轉。要實現可預測的 30 秒動作連續性,需要結構化的空間線索、精確的解剖動作描述詞,以及建立在完整 Wan 3.0 提示詞工程原則之上的鏡頭約束語法。
這份 Wan 3.0 舞蹈提示詞指南提供了經過測試、專為單鏡頭生成最佳化的 AI 舞蹈影片提示詞配方。
微孤立動作配方:肚皮舞參數
在提示胸部孤立或臀部抖動等微動作時,請先指定鏡頭距離,以防止非預期的全身旋轉。
-
正向提示詞範本:
中景、視線高度拍攝,靜態鎖定構圖。一位專業女舞者,深色頭髮梳成低髮髻,身穿綴滿寶石的皇家藍 bedlah 舞裙,飾以垂墜的銀色硬幣流蘇。她在深色木質舞台上表演一段連續的肚皮舞,雙腳牢牢固定於地板表面。她執行受控的軀幹孤立動作、細微的胸部波浪,以及流暢的蛇形手臂波動,同時舞動一條輕薄的皇家藍絲綢紗巾。自然的布料動量、淺景深、溫暖的容積式舞台聚光燈、連續 30 秒不間斷拍攝,無視角切換。
-
關鍵執行要點: 在肚皮舞提示詞參數中使用精確的動作術語,例如「torso isolation(軀幹孤立)」與「rhythmic hip shimmy(節奏性臀部抖動)」,以強制注意力機制聚焦於核心軀幹網格座標,而非大範圍的四肢動作。
多主體編舞配方:國風雙人舞
當提示詞描述將兩個主體混雜在單一詞組中,雙角色生成就會失敗。請依照服裝顏色與明確的空間位置來區分表演者。
-
正向提示詞範本:
全身鏡頭,廣角。兩位女舞者在木質舞台上表演傳統中國國風雙人舞。左邊舞者身穿紅色漢服,配長寬袖;右邊舞者身穿藍色漢服。同步水袖旋轉、緩慢的牽手轉身、優雅的重心轉移,以及流暢的舞步。平滑的鏡頭跟拍,跟隨她們的圓形移動。豐富的舞台燈光、清晰的空間縱深、連續 30 秒長鏡頭、照片級寫實。
-
關鍵執行要點: 這個國風舞蹈提示詞範例以明確的顏色編碼服裝來錨定每位表演者,在空間交叉轉身期間鎖定身份一致性。
舞蹈穩定性的必備負面提示詞
為了防止快速速度變化期間的物理扭曲,請套用這些針對性的 Wan 3.0 舞蹈負面提示詞:
| 目標偽影 | 建議的負面關鍵字字串 |
| 肢體與關節扭曲 | merged limbs, extra arms, floating feet, joint dislocation, melted hands, fused fingers |
| 時間不穩定性 | jittery frame interpolation, sudden camera cuts, morphing clothing, flickering fabric |
| 動作偽影 | floor sliding, ice skating feet, sudden motion blur, unnatural body warping |
使用這些結構化配方,可確保 Wan 3.0 將動作預算分配給節奏性動作,而非鏡頭抖動。
創作者工作流程:何時使用原生 30 秒 vs. 多段剪輯
花了好幾個小時渲染 30 秒的音樂片段,卻在第 22 秒發現表演者的腳部失去地板摩擦力,這在數位影片管線中仍是令人頭痛的大問題。要選擇不間斷的長鏡頭還是模組化剪輯,取決於你的目標平台與動作節奏。
策略性管線選擇:原生 30 秒 vs. 多段剪輯 AI 舞蹈
了解原生 30 秒 vs. 多段剪輯 AI 舞蹈策略中的取捨,有助於在維持短影片格式視覺品質的同時,最佳化 GPU 渲染預算。
| 製作方式 | 最適合的內容格式 | 主要技術優勢 | 已知限制 |
| 原生 30 秒長鏡頭 | 氛圍型國風舞蹈短片、電影感長鏡頭、個人秀 | 不間斷的空間連續性、同步原生音訊、零剪輯 | 第 25 秒附近出現輕微地板滑動與手指模糊 |
| 模組化 8 至 12 秒剪輯 | 高節奏舞蹈對決、快速舞步短片、多角度音樂影片 | 消除時間衰減、提升視覺節奏、允許動態鏡頭切換 | 需要後製時間軸剪輯 |
部署原生 30 秒生成
單鏡頭渲染特別適合氛圍型國風展示,因為這類內容以流暢的水袖動作與不間斷的鏡頭跟拍為優先。運用 Wan 3.0 的原生視聽同步功能,可讓連續編舞與配樂節拍對齊,無需手動對嘴或外部音訊拼接。
部署短版模組化剪輯
快節奏的 TikTok 與 Shorts 最適合 8 到 12 秒的快速剪輯。短鏡頭能保持明快的節奏,在畫面漂移出現前清空模型記憶體,並為剪輯師提供廣角鏡頭與面部追蹤之間乾淨的剪輯點。
AI 舞蹈創作者的實用製作管線
要實現高效的 Wan 3.0 短影片創作者工作流程,需要在按下渲染前先建立結構化的輸入:
- 鎖定參考影像: 將角色照片輸入 Wan 3.0 多模態參考輸入,以在複雜旋轉中保留面部幾何。
- 套用音訊引導: 將參考音軌直接輸入模型,以利用內建的視聽對齊功能。
- 設定構圖限制: 結合中廣角鏡頭標籤與明確的負面提示詞,將空間動作限制在有效鏡頭範圍內。
這種系統化方法為 AI 舞蹈影片製作帶來一致的品質控制。我們的實務 Wan 3.0 建議是:使用原生 30 秒單次生成來處理連續的獨舞編排,並保留 8 秒的多角度剪輯給快節奏的群舞編舞。







