第一張圖片是一個關閉的珠寶盒。第二張圖片中,同一個盒子打開並發出光芒。按下生成,PixVerse 就會填滿兩者之間的每一幀。這就是 PixVerse AI 轉場 的整個訣竅:你固定好影片的起點,固定好影片的終點,然後模型就會建立連接它們的動態。
這聽起來像是一個噱頭,直到你意識到固定最後一幀能帶來什麼好處。一般的圖片轉影片會帶你的照片隨意漂移,模型決定去哪裡。轉場生成則不能漂移。它必須抵達你的第二張圖片,這使得它成為實現服裝更換、場景變化、產品展示以及那些在短影音平台上不斷湧現的真人轉動漫變形效果中,最可控的方式。

重點摘要
- PixVerse AI 轉場(首尾幀功能)會根據文字提示,在兩張上傳的圖片之間生成一段影片。從 v3.5 到 V6 及 C1 的所有模型都支援此功能(PixVerse 平台文件)。
- 在 V6 和 C1 上,轉場片段可以設定為 1 到 15 秒之間的任意長度,包含 1080p。舊版本則固定為 5、8 或 10 秒。
- 同一個端點在 Atlas Cloud 上以 Start-End-to-Video 的形式託管,按秒計費,V6 為 $0.025 起,C1 為 $0.03 起,無浮水印,適用標準定價(截至 2026 年 7 月無任何有效折扣)。
- PixVerse 將其 C1 定位為動畫製作,這使得轉場加上動漫風格的最後一幀,成為可靠的 pixverse ai 動漫工作流程。
什麼是 PixVerse AI 轉場?
PixVerse 稱之為轉場(或首尾幀)功能。你提供兩張圖片。第一張成為你影片的第一幀,第二張成為最後一幀,然後用文字提示描述中間發生的事情(轉場文件)。在 PixVerse 應用程式中,它作為獨立的「首尾幀」模式存在於創作面板中。
API 參考資料 顯示了其支援範圍有多廣。每一代模型都接受轉場任務,但不同版本之間的上限差異很大:
| 模型版本 | 轉場持續時間選項 | 音訊 |
|---|---|---|
| v3.5, v4, v4.5, v5 | 5 或 8 秒 | 僅限音效附加功能 |
| v5.5, v5.6 | 5、8 或 10 秒(1080p 下無 10 秒) | 原生音訊開關 |
| V6, C1 | 任意長度,1 到 15 秒 | 原生音訊開關 |
依模型版本的持續時間與音訊支援,取自 PixVerse 轉場生成 API 參考資料,擷取於 2026-07-24。
在規劃鏡頭前,有兩個限制需要注意。所有版本的解析度範圍皆為 360p 到 1080p。此外,轉場任務沒有長寬比設定;輸出會跟隨你的輸入圖片,因此在上傳任何內容之前,請先將兩張靜態圖片裁切至最終的長寬比。不匹配的影格是導致變形結果的最快途徑。
原生平台還有另一個特點:PixVerse 自己的 API 只透過其上傳端點接受圖片,格式為 form-data。文件指出「目前不支援基於 URL 的圖片上傳」。如果你直接連接,請記住這一點,因為它會為每對影格增加一次來回上傳。
在 Atlas Cloud 上執行 PixVerse 轉場
應用程式是嘗試轉場最簡單的地方,但它會透過點數來計量,並為免費匯出加上浮水印。Atlas Cloud 以計量 API 端點的形式,從 PixVerse 系列 託管相同功能,名為 Start-End-to-Video,提供 V6 和 C1 兩種版本,無需訂閱且無浮水印。兩種使用方式:
方法 1:在 Playground 中使用 PixVerse 轉場
開啟 V6 Start-End-to-Video playground 並在瀏覽器中執行。添加你的開始圖片,添加你的結束圖片(這裡兩者都接受純 URL,無需上傳 API 的繁瑣步驟),撰寫提示,選擇品質和持續時間,然後按下執行。預設配置為 5 秒、720p、開啟音訊,每次執行費用為 $0.30。

方法 2:透過 API 使用 PixVerse 轉場
1. 取得你的 API 金鑰。 在控制台儀表板中建立一個並複製它。


2. 查看 API 文件。 Atlas Cloud API 文件 涵蓋了端點、參數和驗證,全部集中在一處。
3. 發出你的第一個請求。 提交包含兩個影格的任務:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "pixverse/v6/start-end-to-video", 6 "prompt": "盒子蓋子緩緩升起,溫暖的光芒溢出,鏡頭隨著閃爍的光芒向前推進", 7 "image": "https://example.com/box-closed.jpg", 8 "end_image": "https://example.com/box-open.jpg", 9 "duration": 5, 10 "quality": "720p", 11 "sound": true 12 }'
輪詢傳回的預測 ID,直到它完成:
plaintext1curl https://api.atlascloud.ai/api/v1/model/prediction/<prediction_id> \ 2 -H "Authorization: Bearer $ATLASCLOUD_API_KEY"
Atlas Cloud 在每個託管模型上執行同一個 API。同一個金鑰、同一個標頭、同一個提交與輪詢迴圈。切換到 C1,或未來推出的任何模型,只需更改模型字串,其他都不用動。
計費方式是按輸出秒數計算。兩個端點均採用標準定價,截至 2026 年 7 月無任何有效折扣:
| 品質 | V6 無音訊 | V6 含音訊 | C1 無音訊 | C1 含音訊 |
|---|---|---|---|---|
| 360p | $0.025/s | $0.035/s | $0.030/s | $0.040/s |
| 540p | $0.035/s | $0.045/s | $0.040/s | $0.050/s |
| 720p | $0.045/s | $0.060/s | $0.050/s | $0.065/s |
| 1080p | $0.090/s | $0.115/s | $0.095/s | $0.120/s |
Atlas Cloud Start-End-to-Video 定價,已於 2026-07-24 在 V6 和 C1 模型頁面上驗證。C1 在每個層級都比 V6 稍貴。
因此,一個 5 秒 720p 無音訊的變形效果,在 V6 上費用為 $0.225,在 C1 上為 $0.25。一個最大化的 15 秒 1080p 含音訊的片段,在 V6 上費用為 $1.725。請注意音訊預設值:Atlas 會啟用音效,除非你關閉它;而 PixVerse 的原生 API 預設則為關閉。如果你的成本估算一直偏高,通常就是這個開關造成的。
引導中間過程的 PixVerse 轉場提示
兩個端點都固定了,唯一需要引導的就是轉變過程,而提示詞掌握了這一點。Atlas Cloud 針對該端點自己的指引建議明確描述中間的動態,這個建議是正確的:一個模糊的提示詞只會得到一個淡入淡出效果,一個具體的提示詞則會得到一個鏡頭。
PixVerse 將提示詞限制在 5,000 個字元,但沒有人需要這麼長。有效的做法是使用一兩句話涵蓋三件事:什麼在移動、攝影機如何運作、以及節奏如何。
| 目標 | 提示詞骨架 | 重要的細節 |
|---|---|---|
| 服裝更換 | "她轉了一圈,裙子隨著她的轉身飄逸成一件紅色晚禮服" | 指出隱藏變化的實際動作 |
| 白天到黑夜 | "雲朵在天空中奔馳,陰影拉長,窗戶一一亮起" | 給模型提供時間標記來製作動畫 |
| 產品展示 | "蓋子打開,鏡頭向前推進,光線從內部溢出" | 將物體動作與鏡頭移動配對 |
| 真人轉動漫 | "她的五官柔和成動漫風格陰影,頭髮獲得賽璐珞風格高光,背景變成手繪色調" | 將風格轉變描述為可見的變化 |
| 場景跳轉 | "鏡頭向右急甩,形成動態模糊,然後在新的街道上穩定下來" | 要求模糊或甩鏡來銜接不相關的場景 |
PixVerse 轉場任務的提示詞模式。每個模式都指出了變化的機制,讓模型去製作動畫,而不是在影格之間溶解。
影格準備工作完成了一半的功勞。在兩張圖片中保持主體位置相似,匹配光線,那麼變形效果就會看起來像是一個連續的鏡頭。如果餵給它兩張光線和構圖衝突的影格,就會得到一個刺眼的溶解效果。
當你接近目標時,重複使用種子。端點接受一個固定的種子,所以你可以鎖定你喜歡的動態,只對提示詞的措辭進行迭代。
PixVerse AI 動畫影片生成器:真人轉動漫變形
這是最能體現固定最後一幀價值的用例。從真實照片變形為同一場景的動漫版本,本質上就是一個轉場任務:輸入真實影格,輸出風格化影格。
PixVerse 明確定位了其動畫功能。其自身的 C1 評測說得很清楚:「如果你是一位動畫導演、一個漫畫工作室、一個短劇團隊,或者任何製作涉及角色互相毆打、施展魔法或快速移動的內容的人,PixVerse C1 就是為你打造的」(PixVerse 部落格,2026 年 4 月)。同一頁面確認 C1 接受提示詞加上首尾影格的轉場輸入。該應用程式在模板方面也講述了同樣的故事,直到 2026 年 7 月 26 日都在運行像《足球小將翼》系列這樣的授權動畫 IP。
一個能產生乾淨 pixverse 動畫影片的工作流程需要三個素材:
- 你的原始照片,已裁切至最終長寬比。
- 該照片的動漫風格版本。使用任何圖像模型生成,保持姿勢、構圖和佈局盡可能接近原始照片。
- 一個描述風格變化為動態的提示詞,例如上方表格中的「真人轉動漫」骨架。
透過轉場端點執行它,模型就會將風格化效果橫掃整個影格進行動畫化。你的兩個構圖匹配得越緊密,看起來就越像世界本身正在被重繪。

一個在 Atlas Cloud V6 Start-End-to-Video 端點上生成的真人照片轉動漫 PixVerse 轉場:7 秒,720p,開啟音訊,每次執行 $0.42。提示詞遵循上方表格中的真人轉動漫骨架。
有一點需要準確說明,因為教學資源經常搞錯。目前的 V6 API 沒有風格參數。在生成呼叫中沒有可以切換的動漫開關。風格完全存在於你的結束影格和提示詞中,這正是轉場路線在這一點上勝過一般圖片轉影片的原因:圖片轉影片只能用文字輕推朝向動漫,而建立在轉場上的 pixverse ai 動漫影片生成器工作流程,則交給模型一張目標風格的實際圖片。當片段涉及打鬥、法術效果或快速角色動作時,選擇 C1 而非 V6,因為這正是 PixVerse 為其打造的具體領域。
PixVerse 多重轉場鏈:最多七個關鍵影格
兩個影格構成一個瞬間。序列需要更多,而 PixVerse 提供了一個獨立的多重轉場功能,正是為此設計:一個由 2 到 7 個關鍵影格組成的鏈,渲染為一個最長 30 秒的連續影片,在整個過程中保持風格和角色的一致性。
鏈中的每個關鍵影格都有自己的持續時間和可選的提示詞,因此你可以逐張圖片地分鏡影片:
| 多重轉場規格 | 值 |
|---|---|
| 每個任務的關鍵影格 | 2 到 7 |
| 總影片長度 | 1 到 30 秒 |
| 每段持續時間 | 1 到 8 秒(三個或更多關鍵影格時為 1 到 5 秒) |
| 每個關鍵影格提示詞 | 可選,每個段落一個 |
| 品質 | 360p 到 1080p |
| 支援的模型 | v3.5, v4, v4.5, v5 |
多重轉場限制,取自 PixVerse 平台文件和生成 API 參考資料,擷取於 2026-07-24。
再讀一遍最後一行。多重轉場最高只到 v5。最新的模型 V6 和 C1 僅處理單一的從首到尾轉場,而 V6 文件也確認轉場任務無法使用多重片段開關。因此,目前的取捨是真實的:在較舊的模型上鏈接七個關鍵影格,或者以 V6 品質一次兩個影格,然後在編輯器中拼接片段。對於一個分鏡好的動畫序列,你可以結合兩者,使用多重轉場起草整個流程,然後在 C1 上重新生成關鍵鏡頭。
常見問題
哪些 PixVerse 模型支援轉場生成?
所有模型都支援。轉場 API 接受 v3.5、v4、v4.5、v5、v5.5、v5.6、V6 和 C1,每個版本都可從 360p 到 1080p。區別它們的是持續時間範圍和音訊支援,在這方面 V6 和 C1 大幅領先。
PixVerse 轉場影片可以有多長?
在 V6 或 C1 上最長可達 15 秒,支援任何解析度包括 1080p。如果你需要在單次生成中獲得更多,多重轉場可以在最多 7 個關鍵影格上達到 30 秒,但僅限於 v5 代及更舊的模型。
PixVerse 可以將普通照片轉換成動畫影片嗎?
可以,而轉場是最乾淨的做法。準備一張與你的照片構圖匹配的動漫風格複製品,將原始照片設為第一幀,風格化複製品設為最後一幀,然後在提示詞中描述轉變。PixVerse 特別將 C1 定位於動漫和漫畫製作。
PixVerse 轉場 AI 會生成音訊嗎?
在 v5.5 及更新版本上,可以,透過原生音訊開關。舊版本僅提供音效附加功能。在 Atlas Cloud 上,啟用音訊會根據解析度每秒增加 $0.010 到 $0.025 的費用。
在 Atlas Cloud 上,轉場影片比文字轉影片更貴嗎?
不。Start-End-to-Video 採用與 V6 文字轉影片和圖片轉影片完全相同的每秒計費矩陣,無音訊時從 $0.025 每秒起。提供兩個影格而不是單獨一個提示詞不會產生附加費。
PixVerse 轉場的圖片要求是什麼?
在 Atlas Cloud 上:PNG、JPEG、JPG 或 WebP,每張圖片最大 10MB,且需要兩個影格。PixVerse 的原生 API 額外要求每張圖片必須先通過其上傳端點。無論你選擇哪條路徑,請在生成前匹配兩個影格的長寬比。
結論
PixVerse AI 轉場消除了影片生成中最大的不確定性。你自己決定最終影格,模型只需要找出如何到達那裡。這使得它成為最終狀態不可協商時的正確工具:產品必須打開、服裝必須更換、照片最後必須變成動漫。
從一個影格對和預設的 5 秒執行開始,在 Playground 中嘗試。當一種格式可行時,API 會將其轉變為一個管線,每個 5 秒 720p 無音訊片段只需 $0.225。兩個影像和一句話,對於一個完全按照你要求結束的鏡頭來說,是一個很小的代價。






