Seedance 2.0 Mini & Fast API 全球最低價 —— 比官方定價最高低 68%
Grok Imagine Video with Reference Guidance

Grok Imagine Video with Reference Guidance

Grok Imagine Video 讓開發者能使用 xAI 的影片模型系列,建立、動畫化、延展及編輯影片片段。只要輸入提示詞,即可生成 1 至 15 秒的影片;搭配最多 7 張參考圖片,引導人物、物件或風格,並支援 480p 或 720p。Atlas Cloud 透過與 OpenAI 相容的端點,整合這些功能,並提供透明的按用量計費方案。立即開始建置。

Grok Imagine Video 由 xAI 開發。Atlas Cloud(由 Atlas Cloud AI LLC 營運)僅提供接取服務,並不擁有該模型。所有商標均歸其各自所有者所有。

比較 Grok Imagine Video 的模式與工作流程

選擇符合來源素材、所需轉換效果與製作工作流程的 Grok Imagine Video 端點。

模態描述
Grok Imagine Video T2V API (Text To Video)將自然語言提示詞轉換為長度 1 至 15 秒、解析度為 480p 或 720p 的影片。此端點適合概念視覺化、社群短片,以及不使用來源媒體建立的場景。
Grok Imagine Video I2V API (Image To Video)以提供的圖片為基礎,套用自然語言動作提示詞,產生解析度為 480p 或 720p 的影片。可用於製作動畫化作品、產品圖片、角色畫格或行銷活動視覺素材。
Grok Imagine Video R2V API (Reference To Video)使用代表人物、物件或視覺風格的 1 至 7 張參考圖片,引導影片生成。輸出最長可達 10 秒,解析度為 480p 或 720p,支援以參考素材為導向的創意製作。
Grok Imagine Video Extend API (Video Extension)提供現有的 2 至 15 秒 MP4,並透過提示詞指示延伸內容,產生長度 2 至 10 秒的延伸片段。輸出格式會與輸入一致,解析度上限為 720p,適合延長既有鏡頭。
Grok Imagine Video Edit API (Video Editing)提供 MP4 與自然語言指示,以修改影片的視覺內容,同時保留來源影片的長度。輸出上限為 8.7 秒,適合對短片進行精準修訂與以提示詞為基礎的轉換。

Grok Imagine Video:涵蓋五種創意工作流程

Grok Imagine Video 能將文字、起始畫格與最多七張參考圖轉換為短片,接著透過 Atlas Cloud 統一的隨用隨付 API 延伸或編輯現有的 MP4 影片。

Grok Imagine Video:從文字生成

撰寫自然語言提示詞,即可生成 1 到 15 秒、480p 或 720p 的影片。七種長寬比(包括 16:9、1:1 與 9:16)讓每個鏡頭都能符合預定畫布。直接在提示詞中控制主體、動作、鏡頭運動與氛圍。這是製作故事節拍、行銷活動概念與社群影片的彈性起點。

讓起始畫格動起來

將提供的起始畫格圖片轉換為 1 到 15 秒、480p 或 720p 的影片。圖片建立開場構圖,自然語言動作提示詞則引導運動與場景發展。需要不同輸出形狀時,可從七種長寬比中選擇。這項工作流程適合產品鏡頭、插畫場景與需要動態效果、卻不必重新製作開場畫格的藝術指導概念。

Grok Imagine Video:參考圖控制

使用 1 到 7 張代表人物、物件或視覺風格的參考圖來引導影片生成。在提示詞中指定個別輸入,接著即可使用七種支援的長寬比,生成最長 10 秒、480p 或 720p 的影片。參考圖能塑造場景,而不只是作為起始畫格,因此創作者可以更精準地控制反覆出現的視覺元素。適合角色主導的場景、產品敘事或重視風格一致性的行銷活動。

延伸故事線

透過提示詞驅動的延伸功能,為現有 2 到 15 秒的 MP4 影片續接一段 2 到 10 秒的新內容。Grok Imagine Video 會從最後一格接續,並回傳原始片段與新增片段;輸出解析度會與輸入一致,最高支援 720p。以自然語言描述下一個動作、揭示內容或鏡頭移動。如此一來,突兀的結尾更容易轉化為完整的敘事節拍。

使用 Grok Imagine Video 編輯影片片段

提供 MP4 與自然語言指示,讓 Grok Imagine Video 在保留原始片段時長的情況下轉換影片內容。輸入影片最長可達 8.7 秒,計費則依輸入影片長度計算。你可以要求變更視覺效果、轉換氛圍或修改整個場景,而不必從頭重建片段。這非常適合製作短篇創意變體,以及進行可控的生成後微調。

五種工作流程,一個 API

透過一個統一的 API,在文字轉影片、圖片轉影片、參考圖引導生成、影片延伸與編輯之間靈活切換。根據可用的來源素材選擇相應端點,並透過非同步預測流程提交每項工作。讓整個工作流程維持一致的驗證與整合模式。隨用隨付的存取方式支援實驗與可重複的製作管線。開發者能以更低的整合負擔,打造更完整的影片工具。

一個提示詞,三種視野:Grok Imagine Video 比較

看看 Grok Imagine Video 與兩個領先替代方案,如何透過動態、連貫性、鏡頭控制、光線與視覺敘事,詮釋完全相同的提示詞。

提示詞

一段 8–10 秒、超寫實的戶外冒險電影場景,背景設定在一場暴雨過後、翠綠如翡翠的峽谷中。一名身穿鈷藍色防水衣與橘紅色救生衣的泛舟者,從第一幀到最後一幀都在洶湧的白浪中高速前進。開場採用超低水線追蹤鏡頭,貼著獨木舟高速並行;槳葉劃入急流,將清晰的水花濺向鏡頭。獨木舟衝上陡峭的浪尖並騰空而起。快速甩鏡切入泛舟者的第一人稱 POV,船身在一棵倒下的樹木下方側向翻滾,穿越半透明的水幕,驚險閃過參差濕滑的岩石;即使經歷水花飛濺與短暫遮擋,雙手、船槳與鈷藍色船頭仍須保持物理一致。泛舟者將槳抵住急流,以緊湊的反彈轉向沿著峽谷岩壁切出,再次落入激流。高潮時,鏡頭轉為從懸崖頂端俯衝的無人機視角,快速下降並繞行泛舟者,捕捉其落水瞬間;船頭以令人信服的衝擊力撞上一只漂浮的木箱,將其撞破——接著突然以俏皮的反轉揭曉:一串彼此相連、完好無缺的彩色紙燈籠從木箱中彈出、展開,並在冰冷湍急的水面上溫暖地搖曳漂浮,而獨木舟繼續向前疾馳。動作必須持續且符合人體解剖結構,呈現真實的獨木舟慣性、槳的阻力、碰撞、湍流體力學、布料運動、水滴、鏡頭水霧,以及每次遮擋後都不變的主體身分;不要慢動作,不要空泛的建立鏡頭,不要切換至螢幕、介面、儀表板、進度條、圖表、字幕、標誌或說明文字。陰冷的青色陰天日光、被雨水染深的翡翠色岩壁、鮮明的橘紅色救生衣、溫暖多彩的燈籠光,以強調速度的電影級寬銀幕對角線構圖、高對比、自然動態模糊,營造沉浸式寫實動作運動攝影。同步音效:轟鳴的急流、清脆的槳擊聲、木頭裂開的聲音、吃力的喘息、流水撞擊船身的聲音,以及燈籠迸出時明亮的打擊樂點綴。16:9 畫面比例。

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Seedance 2.5 Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

提示詞

一段 8–10 秒、持續動作的電影級場景,發生在暴雨即將傾盆而下前的露天夜市:一名戴著眼罩的拉麵師傅,自信地穿梭於擁擠的攤位迷宮中,同時不間斷地在雙手之間拉伸一條銀白色麵條。開場採用完全垂直的鳥瞰視角,接著從高空快速俯衝進霓虹燈照亮的市場迷宮;第一批厚重雨滴開始打在遮雨棚與濕滑地面上。鎖定飛舞的麵條,讓鏡頭貼著它高速掠過;麵條甩過發光的炭火爐、受驚的食客、滋滋作響的烤架,以及在風中猛然張開的雨傘。保留無縫的人體動作、可信的麵條彈性物理效果、複雜的前景遮擋、飛濺的雨水、火花與濃密蒸氣。快速甩鏡切至師傅跨越低矮木箱,步伐絲毫不停;接著以快速 360-degree 環繞鏡頭拍攝他,他扭身並以精準的動量將麵條向後甩出。麵條乾淨俐落地劃出弧線,落入他身後劇烈沸騰的銅鍋中——就在勝利時刻,一隻淘氣的橘色虎斑貓從攤位下方跳出,用嘴叼走一半垂下的麵條後飛奔而去,形成俐落的視覺笑點,而師傅仍毫不知情地繼續奔跑。霓虹黑色電影風格的超寫實效果,青綠與洋紅色倒影映照在雨水浸潤的地面上,以溫暖的熔爐橘色火光作為節奏感鮮明的視覺點綴,具觸感的蒸氣與雨水、穩定的動作編排、銳利的電影級細節、充滿能量的即時節奏;不要慢動作,不要破壞空間或角色連貫性的剪接。音效:逐漸逼近的雷聲、夜市喧鬧聲、急促腳步聲、雨傘啪地張開的聲音、炭火滋滋聲、沸水聲,以及與鏡頭移動同步的麵條呼嘯聲;最後以明亮逗趣的貓叫聲與銅鍋濺水聲收尾。不要螢幕、使用者介面、儀表板、進度條、圖表、字幕、標誌、浮水印或說明文字。16:9 畫面比例。

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Seedance 2.5 Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

Grok Imagine Video 涵蓋每個創意階段

Grok Imagine Video 可將提示詞、靜態影像、參考素材與現有 MP4 檔案,轉化為適用於社群短片、產品視覺、品牌故事、較長片段、指定編輯與創作者工具的實用方案。

Grok Imagine Video 社群短片

Grok Imagine Video 可將自然語言提示詞轉換成 480p 或 720p 的短片。無須事先準備來源影片,即可用於製作社群預告、行銷活動概念與快速視覺草稿。

讓產品靜態影像動起來

從產品圖片開始,image to video endpoint 可在 480p 或 720p 下,依照提示詞加入指定動態。品牌可以將型錄中的靜態影像轉化為產品揭幕、上市素材與電商平台視覺內容。

以參考素材引導品牌故事

使用一至七張圖片,reference to video 可將人物、物件或風格引導至全新短片中。創意團隊可以根據提供的視覺素材,發展品牌故事、角色概念與產品場景。

Grok Imagine Video 故事延伸

透過 2 至 10 秒、由提示詞驅動的延伸片段,延續現有 MP4,同時保留輸入解析度,最高支援 720p。這適合用於延長分鏡節奏、製作連續劇式轉場,以及從核准影片延伸後續片段。

以自然語言編輯影片

透過自然語言指示編輯 MP4,同時保留來源影片時長,輸出上限為 8.7 秒。團隊可以製作不同視覺風格、在地化行銷活動版本或重新調整的視覺呈現。

使用 Grok Imagine Video 建構工具

圍繞 Grok Imagine Video 的五種模式——生成、動畫、參考素材、延伸與編輯——建構由提示詞驅動的影片工具。開發者可以使用同一系列模型支援創作者工作流程,並選擇 480p 或 720p 輸出。

Grok Imagine Video 在各影片模型中的定位

比較 Grok Imagine Video 與精選 Atlas Cloud 替代方案在輸入方式、片段長度、最高解析度及標準價格方面的工作流程。

模型輸入工作流程片段或區段長度最高解析度標準價格
Grok Imagine Video Text-to-Video文字提示詞1–15s720p$0.05/sec
Grok Imagine Video Image-to-Video起始影像 + 文字提示詞1–15s720p$0.05/sec
Grok Imagine Video Reference-to-Video1–7 張參考影像 + 文字提示詞1–10s720p$0.05/sec
Grok Imagine Video Extend2–15s MP4 + 文字提示詞2–10s 延伸片段與輸入相同,最高 720p$0.07/sec
Grok Imagine Video EditMP4 + 文字指示與輸入相同,最高 8.7s-$0.07/輸入秒數
MiniMax H3 Text-to-Video文字提示詞4–15s2K$0.038/sec
Seedance 2.0 Image-to-Video起始影像 + 文字,可選最後一幀4–15s原生 4K$0.112/sec
Vidu Q3-Mix Reference to Video1–4 張參考影像 + 文字提示詞1–16s1440p SR,原生最高 1080p$0.125/run
Wan-2.7 Video-edit來源影片 + 文字,可選影像或音訊-1080p$0.10/run

如何在 Atlas Cloud 上使用 Grok Imagine Video

幾分鐘即可上手 — 按照以下簡單步驟,透過 Atlas Cloud 平台整合和部署模型。

建立 Atlas Cloud 帳戶

在 atlascloud.ai 註冊並完成驗證。新用戶可獲得免費額度,用於探索平台和測試模型。

為何在 Atlas Cloud 使用 Grok Imagine Video

將先進的 Grok Imagine Video 模型與 Atlas Cloud 的 GPU 加速平台相結合,提供無與倫比的效能、可擴展性和開發體驗。

效能與靈活性

低延遲:
GPU 最佳化推理,實現即時回應。

統一 API:
一次整合,暢用 Grok Imagine Video、GPT、Gemini 和 DeepSeek。

透明定價:
按 Token 計費,支援 Serverless 模式。

企業與規模

開發者體驗:
SDK、資料分析、微調工具和模板一應俱全。

可靠性:
99.99% 可用性、RBAC 權限控制、合規日誌。

安全與合規:
SOC 2 Type II 認證、HIPAA 合規、美國資料主權。

Grok Imagine Video API 問題解答

Grok Imagine Video 是 xAI 用於建立、動畫化、延伸及編輯短片的影片生成模型系列。Atlas Cloud 為文字、影像、參考素材、延伸及編輯工作流程提供獨立的 API endpoint。

Grok Imagine Video 可以根據文字生成短片、將起始影像動畫化,或使用最多 7 張參考影像來引導人物、物件及風格。獨立的 endpoint 也能延續現有短片,或透過自然語言指令編輯 MP4。

建立 Atlas Cloud API key,並向 /api/v1/model/generateVideo 發送經過驗證的 POST 請求。指定必要的 model ID、prompt,以及該路由所需的任何影像或影片輸入。回應會包含 request ID、狀態及輸出欄位。

如果場景從 prompt 開始,請選擇 text-to-video;如果提供的影像必須作為起始畫面,請選擇 image-to-video。reference-to-video 可透過多張影像提供更廣泛的引導,而 extend-video 和 edit-video 則用於處理現有的 MP4 檔案。

Text-to-video 和 image-to-video 支援 1 至 15 秒、480p 或 720p 的短片。Reference-to-video 支援 1 至 10 秒、相同解析度的短片;常見長寬比包括 16:9、9:16、1:1、4:3、3:4、3:2 和 2:3。延伸及編輯路由則遵循各自的輸入限制。

會。xAI 的文件指出,原生音訊生成是 Grok Imagine 影片工作流程的一部分,因此可以同步產生聲音與畫面。Atlas Cloud 為這些路由發布的 schema 未提供獨立的音訊開關。

透過 reference-to-video endpoint 提供 1 至 7 個公開的 HTTPS 影像 URL 或 base64 data URI。像 <IMAGE_0> 這類標籤可以將個別參考影像對應至 prompt 中描述的人物、物件或風格。此路由會回傳最長 10 秒、480p 或 720p 的短片。

使用 extend-video 搭配 2 至 15 秒的 MP4,並要求根據 prompt 指定的動作額外生成 2 至 10 秒。若要進行特定修改,edit-video 接受不超過 8.7 秒的 MP4,並保留原有時長。兩個路由的輸出解析度上限皆為 720p。

Atlas Cloud 的標準定價為 text-to-video、image-to-video 及 reference-to-video 每秒 $0.05。Extend-video 和 edit-video 的標準費率為每秒 $0.07。由於輸出會保留輸入影片的時長,編輯功能會按照輸入影片時長計費。

首先確認所選 endpoint 符合輸入類型,並確認所有必要的 prompt、影像 URL 或影片 URL 都已提供。重新提交前,檢查該路由的時長、解析度、長寬比、參考影像數量及 MP4 限制。如果請求成功但場景不準確,請改寫 prompt,明確描述主體動作、攝影機運動、節奏及視覺細節。

探索更多系列

Seedance 2.5

Seedance 2.5 API 現已在 Atlas Cloud 上線!它為開發者提供了 ByteDance 最新的影片模型。該模型可透過文本、單張影像或多達 50 個多模態參考,一次性生成長達 30 秒的原生影片,並包含同步音訊和畫面內的多語言文本。在 Atlas Cloud 上,您可以透過單個金鑰存取它,其主體一致性和改進的物理特性可保持長鏡頭的連貫性。

檢視系列

Wan 3.0

Wan 3.0 API 是阿里巴巴 Wan 影片系列的下一代產品,旨在將長影片生成、多參考控制和影音品質推向新的高度。Atlas Cloud 已經代管了 Wan 2.7、2.6 和 2.5,而 Wan 3.0 透過相同的統一金鑰運行,無需額外設定。立即開始建置吧。向下捲動至展示區,查看 Wan 3.0 的創作能力。

檢視系列

MiniMax H3

MiniMax H3 是 MiniMax 的多模態影片系列,支援文字、影像與參考素材引導創作。在支援的路由中,它能保留參考媒體中的主體、提供彈性的長寬比,並透過 H3 Developer 將生成的聲音與畫面配對;輸出設定檔則依端點選定。Atlas Cloud 以一組 OpenAI-compatible 金鑰統一整個系列,並提供透明的隨用隨付定價,標準費率為每秒 $0.038。立即開始打造。

檢視系列

Seedream 5.0 Pro

Seedream 5.0 Pro API 為開發者在 Atlas Cloud 上提供了字節跳動的可控圖像編輯模型。它透過錨點和座標精確定位編輯,將圖像分離為可編輯圖層,融合多個參考,並精準匹配顏色和材質,支援 2K 和 3K 解析度的多語言文本。在 Atlas Cloud 上,您只需一個金鑰即可存取!

檢視系列

Seedance 2.0

Seedance 2.0 是 ByteDance 為精準鏡頭創作打造的生產級影片模型。將提示詞轉換為影片、使用可選的末幀引導讓首幀圖片動起來,或搭配參考媒體與可選的網路搜尋塑造成果。Atlas Cloud 將這些工作流程整合至統一的 API,提供透明的按用量計費方案,以及一組相容於 OpenAI 的金鑰。立即開始打造。

檢視系列

GPT Image 2.5

OpenAI 的 gpt-image-2.5 系列讓開發者可在正式環境的影像工作流程中選擇 Flare 與 Sunburst。支援最高 3840x2160 的任意解析度渲染,並提供五個品質等級(包括 xhigh 與 max),滿足特定的輸出需求。Atlas Cloud 提供可立即使用的 REST 推論服務,無冷啟動問題,標準價格每次生成最低 $0.004。立即開始建構。

檢視系列

GPT Image 2

GPT Image 2 API 為開發者提供了訪問 OpenAI 最新圖像模型的途徑,它是 GPT Image 1.5 的繼任者。該模型可生成和編輯圖像,能夠在拉丁和 CJK 文字上實現準確的文本渲染,並在海報、樣機和資訊圖表方面具備強大的排版能力。在 Atlas Cloud 上,您可以透過一個統一的 API 與 300 多個模型一起訪問它,並享受免費額度、99.99% 的正常運行時間,且無需 OpenAI 組織驗證。

檢視系列

Gemini Omni Flash

gemini omni API 將 Google DeepMind 原生多模態的 Gemini Omni Flash 系列(包括 Gemini Omni 1.1 Flash)帶給開發者。您可以建立具同步原生音訊的電影級影片、以精確的起始與結束影格控制讓靜態圖片動起來,或透過文字引導的編輯修改現有影片,同時保留未修改的內容。Atlas Cloud 提供單一 OpenAI 相容金鑰、統一存取,以及透明的隨用隨付定價。立即開始建置。

檢視系列

Grok Imagine

Grok Imagine API 涵蓋 xAI 的圖像、影片和語音模型,從 Image 2.0 到 Video 1.5 和 xAI TTS v1。在 14 種寬高比下生成 1K 或 2K 靜止畫面,將場景擴展為 15 秒的 1080p 動態影像,使用高達 7 張參考圖像操控鏡頭,或用 20 種語言配音。Atlas Cloud 在單一端點運行所有模式,按使用量付費定價,從每張圖像 $0.02 和每秒 $0.05 起。立即開始建置。

檢視系列

Google

Google最強大的創意模型現已在Atlas Cloud上全面可用。Veo 3.1提供電影等級的影片生成,Nano Banana 2支援高保真圖像建立,而Gemini為每個工作流程帶來多模態智慧。透過單一API key即可存取完整的Google模型套件,提供Day-0可用性和隨用隨付(pay-as-you-go)定價。

檢視系列

Seedance 2.0 Mini

Seedance 2.0 Mini 將 ByteDance 的多模態影片生成技術引入到對速度和成本要求極高的工作流程中。它以更輕量的佔用空間提供 Seedance 2.0 的核心能力——更快的生成速度、更低的單支影片成本,並且使用您現有的同款 API 整合。對於運行高吞吐量流水線或進行大規模原型設計的團隊來說,Mini 是最實用的預設選擇。

檢視系列

ByteDance

從電影級影片生成到高保真影像建立,ByteDance 最強大的模型現已在 Atlas Cloud 上線。以最低的推論定價和零基礎設施開銷,大規模執行 Seedance 和 Seedream。

檢視系列

一個 API,暢享全模態 AI。

探索全部模型