歌手不存在。歌曲不是你熟悉的語言。但你依然感受到那份情感。
這是創作者 Cia0 於 2026 年 7 月 19 日在 X 平台分享 的影片底下的反應:十五秒的歌唱角色片段,被標榜為「即使聽不懂一個字也能感受到的歌曲」。標題用一句話點出整個技術棧:Seedream 5.0 Pro 生成影像,Seedance 2.0 生成影片,並在 CapCut 上運作。真正打動人的是細節處理:嘴唇對上人聲、頭髮如真髮般飄動、臉部表情傳達情緒而非只是擺姿勢。
本指南逐步重建這套流程:哪個模型負責什麼、在影像到影片的轉換過程中,承載情緒的提示詞如何撰寫,以及一支完成的 MV 實際成本為何。

重點摘要
- 工作流程以影像優先:用 Seedream 5.0 Pro 以 $0.045 的價格美術指導關鍵幀,只有在畫面確定後才支付影片生成費用。在靜態圖中修正臉部,成本約為重新生成影片的二十分之一。
- Seedance 2.0 影像轉影片接受第一幀與可選的最後一幀,每次生成 4 到 15 秒,內建原生音訊,並可返回最後一幀以便下一段片段接續拍攝。
- 將角色對嘴到自己的音軌,使用參考轉影片端點:最多 9 張圖片、3 段影片、3 段音訊作為參考,並在提示詞中使用 @-提及。
- 一支 40 秒、720p 的直式 MV,在 2026 年 7 月的折扣價格下約為 $10 美元,其中只有你的配樂成本不計入。
值得複製的 Seedream + Seedance MV
兩天內的三篇貼文,加上稍早的對嘴測試,大致勾勒出這組模型所能涵蓋的領域。沒有一篇是實驗室展示。每篇都列出了使用的工具。
| 創作者 | 發表日期 | 影片內容 | 工具鏈 |
|---|---|---|---|
| @Cia0_exe | 2026 年 7 月 19 日 | 15 秒抒情歌表演:對嘴、頭髮物理、情感的維持 | Seedream 5.0 Pro + Seedance 2.0,在 CapCut 上執行(依標題所述) |
| @Cia0_exe | 2026 年 7 月 20 日 | 15 秒「頂級 2.5D 動畫動作」,那種「工作室要花數年」才能製作的類型 | 同組模型,在第三方應用程式上執行 |
| @tjb_shizuka | 2026 年 7 月 20 日 | 30 秒「眼藥水扭曲」旅遊迷因,設定在瑞士湖邊,並開放複製格式 | Seedream 靜態圖、Seedance 2.0 動態、Mureka V9 配樂、OpenShot 剪輯 |
| @CuriousRefuge | 2026 年 5 月 5 日 | 多說話者對嘴測試,涵蓋真人與動畫 | 參考影像、音訊檔案、攝影機與對話提示詞 |

這四篇貼文中有兩件事重複出現。首先,影像模型與影片模型被視為獨立的工作:選角在 Seedream 中進行,表演在 Seedance 中進行。其次,影片模型只是整個技術棧的中間環節。每篇標題都點出了圍繞它的部分:執行的應用程式、配樂來源、剪輯軟體。Cia0 的兩篇貼文都承諾在回覆中提供「中文」提示詞,而日文貼文則在標題中直接列出了四個工具的組裝流程。
為什麼 Seedream 優先的工作流程勝過純文字轉影片
Seedance 2.0 有一個相當不錯的文字轉影片模式。但上述影片的創作者都跳過了它,原因在於算術與控制力。
在 Atlas Cloud 上,一張 Seedream 5.0 Pro 靜態圖成本為 $0.045。一段 5 秒、720p 的 Seedance 2.0 影片,在目前折扣下約為 $0.97。你在靜態圖階段發現的每一個錯誤臉部、錯誤服裝或錯誤構圖,只需要一張靜態圖的成本來修正。你在影片階段發現的每一個錯誤,則需要以約 20 倍的價格完整重新生成,還要加上等待時間。
| 直接文字轉影片 | 先 Seedream 關鍵幀 | |
|---|---|---|
| 修正錯誤臉部的成本 | 每 5 秒重新生成約 $0.97 | 每張靜態圖 $0.045 |
| 跨鏡頭的選角一致性 | 每段影片都是新的隨機生成 | 相同角色區塊、相同臉部 |
| 構圖控制 | 靠提示詞與運氣 | 你先核准確切構圖 |
| 錯誤出現的環節 | 在成本高昂的步驟中 | 在成本低廉的步驟中 |
一致性點對 MV 來說最為重要。一部音樂錄影帶會重複出現同一張臉八到十次。文字轉影片每次生成都會重新創造角色。關鍵幀流程則以兩種方式維持身份:將已核准的靜態圖作為每段影片的第一幀,或是在每次生成時都餵入相同的參考影像。你只需進行一次美術指導,然後將影片預算花在動畫化你已經滿意的決定上。
在 Atlas Cloud 上執行 Seedream + Seedance 工作流程
管線的兩個部分都在同一個地方執行。Atlas Cloud 託管了完整的 ByteDance 模型家族,因此 Seedream 5.0 Pro(2026 年 7 月 8 日起提供公開 API)與 Seedance 2.0(2026 年 2 月 12 日推出)位於同一個帳戶、使用相同的點數與相同的 API 格式。有兩種工作方式:透過 Playground 點擊操作,或是在程式碼中串接端點。
方法一:在 Playground 中生成你的 MV 鏡頭
步驟 1:在 Seedream 中選角。 開啟 Seedream 5.0 Pro playground,撰寫關鍵幀提示詞(完整的配方在下方兩節)。現在就將長寬比設定為你的最終輸出格式:9:16 給 Shorts 和 TikTok,16:9 給 YouTube。每次生成回傳一張圖片,成本 $0.045,因此請反覆調整直到臉部、服裝與光線完全正確。

步驟 2:將靜態圖載入 Seedance。 開啟 Seedance 2.0 image-to-video playground。表單接受一張必填影像(你已核准的關鍵幀),以及一個可選的最後一幀影像(如果你希望鏡頭結束在特定構圖上)。
步驟 3:撰寫動態提示詞並設定片段。 持續時間可設定為 4 到 15 秒,或設為 Auto 讓模型選擇。選擇與關鍵幀相符的長寬比,或保持 Auto。解析度預設為 720p。
步驟 4:檢查三個切換開關。「Generate audio」為片段提供原生音效。「Watermark」保持關閉以獲得乾淨的母帶。「Return last frame」會將結尾幀作為獨立圖片回傳給你;將它作為下一段生成的第一幀餵入,新片段就會從此處接續。這個切換開關是區分四段不連續片段與一段連續表演的關鍵。
步驟 5:查看價格,然後執行。 執行按鈕會在確認前顯示你確切設定的成本。截至 2026 年 7 月 21 日,一段 5 秒的 720p 片段,在平台 20% 限時折扣後顯示約 $0.97(原價約 $1.21)。
方法二:透過單一 API 串接 Seedream 與 Seedance
步驟 1:取得你的 API 金鑰。 在 Atlas Cloud 控制台建立一個金鑰,並將其設為環境變數。不要放在客戶端程式碼中。


步驟 2:查閱 API 文件。 端點、參數與輪詢行為位於 API 文件 中。整個管線是兩個 submit-and-poll 循環。
步驟 3:進行兩次呼叫。 首先是關鍵幀:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateImage \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedream-v5.0-pro/text-to-image", 6 "prompt": "<你的關鍵幀提示詞>", 7 "size": "1152*2048" 8 }'
輪詢 GET /api/v1/model/prediction/ 直到任務完成,從輸出中取得託管圖片 URL,然後直接傳入影片呼叫:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedance-2.0/image-to-video", 6 "prompt": "<動態與表演提示詞>", 7 "image": "<Seedream 輸出 URL>", 8 "duration": 10, 9 "resolution": "720p", 10 "ratio": "adaptive", 11 "generate_audio": true, 12 "return_last_frame": true 13 }'
image 接受 URL、Base64 或資產參考;duration 接受 -1 讓模型選擇。watermark 預設為 false。設定 return_last_frame 後,完成的預測會包含最終幀作為圖片,因此腳本可以循環:生成片段、取得最後一幀、提交下一段片段。這個循環就是整個 MV 管線,大約三十行程式碼。
兩次呼叫使用相同的基礎 URL、相同的 bearer 標頭、相同的預測輪詢。這就是單一 API 設計的實際好處:你的 Seedream 整合與 Seedance 整合只差在模型字串和幾個欄位,而 ByteDance 的下一個版本發佈時,也能無縫接入相同的程式碼。
MV 關鍵幀的 Seedream 5.0 Pro 提示詞配方
MV 關鍵幀是一個選角決定,因此提示詞的首要任務是定義一個你可以再次召喚的人。可行的模式是角色區塊:一句話,40 到 60 字,鎖定臉部、頭髮與服裝。在整個專案的每個關鍵幀提示詞中,這段文字會原封不動地重複使用。改一個字就可能召喚出一個陌生人。
以下是一個完整關鍵幀提示詞的範例:
一位年輕女性,及腰黑髮、柔和圓潤的五官、戴著銀色垂墜耳環,身穿一件 oversized 奶油色針織毛衣。她獨自站在黃昏時分濕漉漉的屋頂上,以平視角度從肩膀以上取景。雙眸水潤,嘴唇微啟像要唱歌,視線略過鏡頭。身後是冰冷的藍色城市光暈,臉頰上有一道溫暖的邊緣光,淺景深,電影感靜止畫面,柔和顆粒感,9:16。
第一句是角色區塊。之後的內容會根據每個鏡頭變動。一部 MV 需要的不是一張圖片,而是一套涵蓋基本鏡位的小型組合:
| 鏡頭 | 目的 | 提示詞中改變的部分 | 保持不變的部分 |
|---|---|---|---|
| 廣角 | 建立場景與氛圍 | 地點細節、全身取景 | 角色區塊、光線方向 |
| 中景 | 主歌表演 | 腰部以上取景,一個動作 | 角色區塊 |
| 特寫 | 副歌情感高潮 | 肩膀以上,臉部細節 | 角色區塊 |
兩個 Seedream 特定注意事項。將情感寫成物理證據,而非標籤:「雙眼水潤、下顎緊繃、屏住呼吸」在後續動畫中會更有效,而「悲傷」則會變成僵化的表情。另外,在尺寸選擇器中設定長寬比,而不只是在提示詞中描述,因為參數會優先。有關提示詞更深入的結構,包括排除模式與模型已知問題,請參閱我們的 Seedream 5.0 Pro 提示詞指南。
用於對嘴、物理與情感的 Seedance 2.0 提示詞
關鍵幀為 Seedance 2.0 提供了一張值得動畫化的臉。動態提示詞則決定了這個片段是在表演,還是只是在動。Seedance 2.0 原生生成雙聲道音訊,並根據 ByteDance 的推出文章所述,在八種以上語言中進行音素級別的對嘴。因此,提示詞的任務是告訴模型:表演的內容是什麼、由誰表演、以及攝影機如何處理。
有兩種途徑可以讓角色唱歌。
途徑 A,生成歌曲: 停留在影像轉影片功能,開啟「Generate audio」開關,並在提示詞中描述人聲。模型會自行創作音樂,並將嘴唇同步到自己的音軌。這是達到 Cia0 風格表演片段最快的方法。
途徑 B,你自己的音軌: 切換到 參考轉影片,每次生成可接受最多 9 張參考圖片、3 段參考影片與 3 段參考音訊。上傳你的歌曲段落作為音訊參考,加入你的關鍵幀作為圖片參考,並在提示詞中使用 @-提及來將角色與動作綁定。這就是 Curious Refuge 在 5 月驗證 的多說話者對嘴配方:「一張參考圖片」、「一段黑畫面影片加上音訊或音訊檔案」,以及「一段提示詞(攝影機運動 + 旁白/對話)」。在上傳前將音訊修剪到與片段長度相同;計費代幣會計算輸入長度加上輸出長度,因此留白會花費實際金錢。

將表演與螢幕保護程式區分開來的關鍵提示:
| 你想要的效果 | 有效的提示詞提示 | 為什麼有效 |
|---|---|---|
| 可讀的對嘴 | 指名語言與人聲風格:「她用中文演唱一首慢板抒情歌,輕柔的氣音」 | 音素級別同步需要知道唱的是什麼 |
| 頭髮與布料物理 | 為力量給出原因:「一陣風吹起她的頭髮,毛衣隨之飄動」 | 物理效果遵循明確說明的力量,而非形容詞 |
| 可見的情感 | 附帶時間點的物理跡象:「她在長音上閉上雙眼,外眼角流下一滴淚」 | 模型對動作的動畫效果遠優於對情緒的動畫 |
| 攝影機感覺 | 每個片段一個動作:「從中景緩慢推進到特寫」 | 堆疊的攝影機運動在 15 秒內會互相衝突 |
| 多鏡頭戲劇 | 按順序描述序列:「開場是城市天際線,切到她的臉部,此時人聲進入」 | Seedance 2.0 原生支援單次生成中的多鏡頭序列 |
任何超過 15 秒的內容都是串接工作:使用設定章節中的返回最後一幀技巧,並在每個新提示詞中加入歌曲的下一句。在你的動態提示詞中也保留 Seedream 提示詞中的角色區塊措辭。冗餘是身份維持的廉價保險。
從 Seedance 片段到完成 MV:剪輯與預算
日文「眼藥水扭曲」貼文最清楚地描繪了後製階段,因為創作者在標題中列出了整個組裝流程:Seedream 生成靜態圖、Seedance 2.0 生成動態、Mureka V9 生成配樂,以及 OpenShot(一款免費的桌面編輯器)進行剪輯。Cia0 的片段則將 CapCut 列為其平台。無論你選擇哪種編輯器,剪輯工作本身都相同:先鋪好完整音軌,在節拍上修剪片段,並從頭到尾保持一致的長寬比。

關於 CapCut 路線的注意事項。在 CapCut 內部,Seedance 2.0 以 Dreamina Seedance 2.0 的形式運作,自 2026 年 4 月 7 日起在美國可用,並且根據 CapCut 的官方公告,它附帶限制,包括禁止從包含真實人臉的圖片生成影片,以及輸出帶有可見浮水印。這對迷因來說沒問題,但對於乾淨的 MV 母帶則有限制。API 和 Playground 路線預設不開啟浮水印,並且接受你生成的任何關鍵幀。
在 2026 年 7 月 Atlas Cloud 的折扣價格下,整個流程的成本:
| 階段 | 模型或工具 | 數量 | 成本 |
|---|---|---|---|
| 關鍵幀 | Seedream 5.0 Pro | 10 張靜態圖,每張 $0.045 | $0.45 |
| 動態草稿 | Seedance 2.0 Mini 影像轉影片 | 4 段片段 × 10 秒,每秒 $0.045 | $1.80 |
| 最終片段 | Seedance 2.0 影像轉影片,720p | 4 段片段 × 10 秒,每秒約 $0.1935 | ≈$7.74 |
| 配樂 | 你自己的音軌,或 AI 音樂模型 | 1 首歌 | 視情況而定 |
| 剪輯 | CapCut 或 OpenShot | 1 次剪輯作業 | $0 |
| 總計 | 約 40 秒完成 MV | ≈$10 |
草稿階段是人們常跳過但不該跳過的。Seedance 2.0 Mini 使用相同的第一幀加提示詞工作流程,每秒 $0.045(原價 $0.056),約為旗艦版 720p 費率的四分之一,因此可以在最終渲染前以低成本調試運鏡、攝影機運動與物理效果。如果沒有折扣,相同的預算在牌價下約為 $12.40,仍然低於大多數素材庫訂閱每月收取的費用。
常見問題
Seedance 2.0 可以讓角色對嘴到我自己創作的歌曲嗎?
可以。使用參考轉影片端點,每次生成可接受最多 3 段音訊,以及 9 張圖片和 3 段影片。將歌曲段落作為音訊參考上傳,加入你的 Seedream 關鍵幀作為圖片參考,在提示詞中 @-提及它,並描述表演與攝影機。先將音訊修剪到與片段長度相同,因為計費代幣會計算輸入加上輸出長度。
Seedream 和 Seedance 的提示詞必須用中文嗎?
不需要。Cia0 分享的提示詞是中文,而且圍繞 ByteDance 模型的中文提示詞文化很強,但兩個模型都接受英文提示詞,而 Seedance 2.0 的對嘴功能在八種以上語言中以音素級別運作。重要的是在提示詞中指明人聲的語言,以便嘴巴形狀符合音軌。
一段 Seedance 2.0 生成可以有多長?
每次運行 4 到 15 秒,可在該時間範圍內支援多鏡頭序列,或將持續時間設為 -1 讓模型選擇。對於完整的 MV,請串接生成:啟用「return last frame」並從上一段片段的結尾幀開始下一段片段,以保持表演的連續性。
我的 MV 片段會有浮水印嗎?
API 和 Playground 預設不會:watermark 參數預設為 false,因此母帶是乾淨的。CapCut 消費者版本則不同。Dreamina Seedance 2.0 會加上可見浮水印,並禁止從包含真實人臉的圖片生成影片,這是它在 2026 年重新推出時所附帶的防護措施的一部分。
一套完整的 Seedream + Seedance MV 成本是多少?
在 2026 年 7 月的折扣價格下,一支 40 秒、720p 的直式影片約為 $10 美元:關鍵幀 $0.45、Mini 草稿 $1.80、最終 720p 片段約 $7.74,剪輯在 CapCut 或 OpenShot 中免費。在牌價下,相同的製作約為 $12.40。關鍵幀階段是讓這個數字保持在這麼低的原因,因為外觀決策是在 $0.045 的階段做出,而不是在每次重新生成約 $0.97 的階段。
結論
這個月流傳的片段並非某個秘密功能的作用。它們是分工的結果:Seedream 5.0 Pro 決定誰在螢幕上以及畫面氛圍,Seedance 2.0 決定他們如何移動與發聲,而免費的編輯器將片段轉變為一首有臉孔的歌曲。每個步驟都可檢視,每個錯誤都在最便宜的環節被抓到。
偷學這個操作順序。鎖定一個角色區塊,用 $0.045 的代價購買你的錯誤,只動畫化你已經核准的內容,讓一段片段的結尾幀成為下一段的開頭。工具是新的。但紀律只是電影製作。






