
Grok Imagine Video 讓開發者能使用 xAI 的影片模型系列,建立、動畫化、延展及編輯影片片段。只要輸入提示詞,即可生成 1 至 15 秒的影片;搭配最多 7 張參考圖片,引導人物、物件或風格,並支援 480p 或 720p。Atlas Cloud 透過與 OpenAI 相容的端點,整合這些功能,並提供透明的按用量計費方案。立即開始建置。
Grok Imagine Video 由 xAI 開發。Atlas Cloud(由 Atlas Cloud AI LLC 營運)僅提供接取服務,並不擁有該模型。所有商標均歸其各自所有者所有。
選擇符合來源素材、所需轉換效果與製作工作流程的 Grok Imagine Video 端點。
| 模態 | 描述 |
|---|---|
| Grok Imagine Video T2V API (Text To Video) | 將自然語言提示詞轉換為長度 1 至 15 秒、解析度為 480p 或 720p 的影片。此端點適合概念視覺化、社群短片,以及不使用來源媒體建立的場景。 |
| Grok Imagine Video I2V API (Image To Video) | 以提供的圖片為基礎,套用自然語言動作提示詞,產生解析度為 480p 或 720p 的影片。可用於製作動畫化作品、產品圖片、角色畫格或行銷活動視覺素材。 |
| Grok Imagine Video R2V API (Reference To Video) | 使用代表人物、物件或視覺風格的 1 至 7 張參考圖片,引導影片生成。輸出最長可達 10 秒,解析度為 480p 或 720p,支援以參考素材為導向的創意製作。 |
| Grok Imagine Video Extend API (Video Extension) | 提供現有的 2 至 15 秒 MP4,並透過提示詞指示延伸內容,產生長度 2 至 10 秒的延伸片段。輸出格式會與輸入一致,解析度上限為 720p,適合延長既有鏡頭。 |
| Grok Imagine Video Edit API (Video Editing) | 提供 MP4 與自然語言指示,以修改影片的視覺內容,同時保留來源影片的長度。輸出上限為 8.7 秒,適合對短片進行精準修訂與以提示詞為基礎的轉換。 |
Grok Imagine Video 能將文字、起始畫格與最多七張參考圖轉換為短片,接著透過 Atlas Cloud 統一的隨用隨付 API 延伸或編輯現有的 MP4 影片。
撰寫自然語言提示詞,即可生成 1 到 15 秒、480p 或 720p 的影片。七種長寬比(包括 16:9、1:1 與 9:16)讓每個鏡頭都能符合預定畫布。直接在提示詞中控制主體、動作、鏡頭運動與氛圍。這是製作故事節拍、行銷活動概念與社群影片的彈性起點。
將提供的起始畫格圖片轉換為 1 到 15 秒、480p 或 720p 的影片。圖片建立開場構圖,自然語言動作提示詞則引導運動與場景發展。需要不同輸出形狀時,可從七種長寬比中選擇。這項工作流程適合產品鏡頭、插畫場景與需要動態效果、卻不必重新製作開場畫格的藝術指導概念。
使用 1 到 7 張代表人物、物件或視覺風格的參考圖來引導影片生成。在提示詞中指定個別輸入,接著即可使用七種支援的長寬比,生成最長 10 秒、480p 或 720p 的影片。參考圖能塑造場景,而不只是作為起始畫格,因此創作者可以更精準地控制反覆出現的視覺元素。適合角色主導的場景、產品敘事或重視風格一致性的行銷活動。
透過提示詞驅動的延伸功能,為現有 2 到 15 秒的 MP4 影片續接一段 2 到 10 秒的新內容。Grok Imagine Video 會從最後一格接續,並回傳原始片段與新增片段;輸出解析度會與輸入一致,最高支援 720p。以自然語言描述下一個動作、揭示內容或鏡頭移動。如此一來,突兀的結尾更容易轉化為完整的敘事節拍。
提供 MP4 與自然語言指示,讓 Grok Imagine Video 在保留原始片段時長的情況下轉換影片內容。輸入影片最長可達 8.7 秒,計費則依輸入影片長度計算。你可以要求變更視覺效果、轉換氛圍或修改整個場景,而不必從頭重建片段。這非常適合製作短篇創意變體,以及進行可控的生成後微調。
透過一個統一的 API,在文字轉影片、圖片轉影片、參考圖引導生成、影片延伸與編輯之間靈活切換。根據可用的來源素材選擇相應端點,並透過非同步預測流程提交每項工作。讓整個工作流程維持一致的驗證與整合模式。隨用隨付的存取方式支援實驗與可重複的製作管線。開發者能以更低的整合負擔,打造更完整的影片工具。
看看 Grok Imagine Video 與兩個領先替代方案,如何透過動態、連貫性、鏡頭控制、光線與視覺敘事,詮釋完全相同的提示詞。
一段 8–10 秒、超寫實的戶外冒險電影場景,背景設定在一場暴雨過後、翠綠如翡翠的峽谷中。一名身穿鈷藍色防水衣與橘紅色救生衣的泛舟者,從第一幀到最後一幀都在洶湧的白浪中高速前進。開場採用超低水線追蹤鏡頭,貼著獨木舟高速並行;槳葉劃入急流,將清晰的水花濺向鏡頭。獨木舟衝上陡峭的浪尖並騰空而起。快速甩鏡切入泛舟者的第一人稱 POV,船身在一棵倒下的樹木下方側向翻滾,穿越半透明的水幕,驚險閃過參差濕滑的岩石;即使經歷水花飛濺與短暫遮擋,雙手、船槳與鈷藍色船頭仍須保持物理一致。泛舟者將槳抵住急流,以緊湊的反彈轉向沿著峽谷岩壁切出,再次落入激流。高潮時,鏡頭轉為從懸崖頂端俯衝的無人機視角,快速下降並繞行泛舟者,捕捉其落水瞬間;船頭以令人信服的衝擊力撞上一只漂浮的木箱,將其撞破——接著突然以俏皮的反轉揭曉:一串彼此相連、完好無缺的彩色紙燈籠從木箱中彈出、展開,並在冰冷湍急的水面上溫暖地搖曳漂浮,而獨木舟繼續向前疾馳。動作必須持續且符合人體解剖結構,呈現真實的獨木舟慣性、槳的阻力、碰撞、湍流體力學、布料運動、水滴、鏡頭水霧,以及每次遮擋後都不變的主體身分;不要慢動作,不要空泛的建立鏡頭,不要切換至螢幕、介面、儀表板、進度條、圖表、字幕、標誌或說明文字。陰冷的青色陰天日光、被雨水染深的翡翠色岩壁、鮮明的橘紅色救生衣、溫暖多彩的燈籠光,以強調速度的電影級寬銀幕對角線構圖、高對比、自然動態模糊,營造沉浸式寫實動作運動攝影。同步音效:轟鳴的急流、清脆的槳擊聲、木頭裂開的聲音、吃力的喘息、流水撞擊船身的聲音,以及燈籠迸出時明亮的打擊樂點綴。16:9 畫面比例。
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
一段 8–10 秒、持續動作的電影級場景,發生在暴雨即將傾盆而下前的露天夜市:一名戴著眼罩的拉麵師傅,自信地穿梭於擁擠的攤位迷宮中,同時不間斷地在雙手之間拉伸一條銀白色麵條。開場採用完全垂直的鳥瞰視角,接著從高空快速俯衝進霓虹燈照亮的市場迷宮;第一批厚重雨滴開始打在遮雨棚與濕滑地面上。鎖定飛舞的麵條,讓鏡頭貼著它高速掠過;麵條甩過發光的炭火爐、受驚的食客、滋滋作響的烤架,以及在風中猛然張開的雨傘。保留無縫的人體動作、可信的麵條彈性物理效果、複雜的前景遮擋、飛濺的雨水、火花與濃密蒸氣。快速甩鏡切至師傅跨越低矮木箱,步伐絲毫不停;接著以快速 360-degree 環繞鏡頭拍攝他,他扭身並以精準的動量將麵條向後甩出。麵條乾淨俐落地劃出弧線,落入他身後劇烈沸騰的銅鍋中——就在勝利時刻,一隻淘氣的橘色虎斑貓從攤位下方跳出,用嘴叼走一半垂下的麵條後飛奔而去,形成俐落的視覺笑點,而師傅仍毫不知情地繼續奔跑。霓虹黑色電影風格的超寫實效果,青綠與洋紅色倒影映照在雨水浸潤的地面上,以溫暖的熔爐橘色火光作為節奏感鮮明的視覺點綴,具觸感的蒸氣與雨水、穩定的動作編排、銳利的電影級細節、充滿能量的即時節奏;不要慢動作,不要破壞空間或角色連貫性的剪接。音效:逐漸逼近的雷聲、夜市喧鬧聲、急促腳步聲、雨傘啪地張開的聲音、炭火滋滋聲、沸水聲,以及與鏡頭移動同步的麵條呼嘯聲;最後以明亮逗趣的貓叫聲與銅鍋濺水聲收尾。不要螢幕、使用者介面、儀表板、進度條、圖表、字幕、標誌、浮水印或說明文字。16:9 畫面比例。
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video 可將提示詞、靜態影像、參考素材與現有 MP4 檔案,轉化為適用於社群短片、產品視覺、品牌故事、較長片段、指定編輯與創作者工具的實用方案。
Grok Imagine Video 可將自然語言提示詞轉換成 480p 或 720p 的短片。無須事先準備來源影片,即可用於製作社群預告、行銷活動概念與快速視覺草稿。
從產品圖片開始,image to video endpoint 可在 480p 或 720p 下,依照提示詞加入指定動態。品牌可以將型錄中的靜態影像轉化為產品揭幕、上市素材與電商平台視覺內容。
使用一至七張圖片,reference to video 可將人物、物件或風格引導至全新短片中。創意團隊可以根據提供的視覺素材,發展品牌故事、角色概念與產品場景。
透過 2 至 10 秒、由提示詞驅動的延伸片段,延續現有 MP4,同時保留輸入解析度,最高支援 720p。這適合用於延長分鏡節奏、製作連續劇式轉場,以及從核准影片延伸後續片段。
透過自然語言指示編輯 MP4,同時保留來源影片時長,輸出上限為 8.7 秒。團隊可以製作不同視覺風格、在地化行銷活動版本或重新調整的視覺呈現。
圍繞 Grok Imagine Video 的五種模式——生成、動畫、參考素材、延伸與編輯——建構由提示詞驅動的影片工具。開發者可以使用同一系列模型支援創作者工作流程,並選擇 480p 或 720p 輸出。
比較 Grok Imagine Video 與精選 Atlas Cloud 替代方案在輸入方式、片段長度、最高解析度及標準價格方面的工作流程。
| 模型 | 輸入工作流程 | 片段或區段長度 | 最高解析度 | 標準價格 |
|---|---|---|---|---|
| Grok Imagine Video Text-to-Video | 文字提示詞 | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Image-to-Video | 起始影像 + 文字提示詞 | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Reference-to-Video | 1–7 張參考影像 + 文字提示詞 | 1–10s | 720p | $0.05/sec |
| Grok Imagine Video Extend | 2–15s MP4 + 文字提示詞 | 2–10s 延伸片段 | 與輸入相同,最高 720p | $0.07/sec |
| Grok Imagine Video Edit | MP4 + 文字指示 | 與輸入相同,最高 8.7s | - | $0.07/輸入秒數 |
| MiniMax H3 Text-to-Video | 文字提示詞 | 4–15s | 2K | $0.038/sec |
| Seedance 2.0 Image-to-Video | 起始影像 + 文字,可選最後一幀 | 4–15s | 原生 4K | $0.112/sec |
| Vidu Q3-Mix Reference to Video | 1–4 張參考影像 + 文字提示詞 | 1–16s | 1440p SR,原生最高 1080p | $0.125/run |
| Wan-2.7 Video-edit | 來源影片 + 文字,可選影像或音訊 | - | 1080p | $0.10/run |
幾分鐘即可上手 — 按照以下簡單步驟,透過 Atlas Cloud 平台整合和部署模型。
在 atlascloud.ai 註冊並完成驗證。新用戶可獲得免費額度,用於探索平台和測試模型。
將先進的 Grok Imagine Video 模型與 Atlas Cloud 的 GPU 加速平台相結合,提供無與倫比的效能、可擴展性和開發體驗。
低延遲:
GPU 最佳化推理,實現即時回應。
統一 API:
一次整合,暢用 Grok Imagine Video、GPT、Gemini 和 DeepSeek。
透明定價:
按 Token 計費,支援 Serverless 模式。
開發者體驗:
SDK、資料分析、微調工具和模板一應俱全。
可靠性:
99.99% 可用性、RBAC 權限控制、合規日誌。
安全與合規:
SOC 2 Type II 認證、HIPAA 合規、美國資料主權。
Grok Imagine Video 是 xAI 用於建立、動畫化、延伸及編輯短片的影片生成模型系列。Atlas Cloud 為文字、影像、參考素材、延伸及編輯工作流程提供獨立的 API endpoint。
Grok Imagine Video 可以根據文字生成短片、將起始影像動畫化,或使用最多 7 張參考影像來引導人物、物件及風格。獨立的 endpoint 也能延續現有短片,或透過自然語言指令編輯 MP4。
建立 Atlas Cloud API key,並向 /api/v1/model/generateVideo 發送經過驗證的 POST 請求。指定必要的 model ID、prompt,以及該路由所需的任何影像或影片輸入。回應會包含 request ID、狀態及輸出欄位。
如果場景從 prompt 開始,請選擇 text-to-video;如果提供的影像必須作為起始畫面,請選擇 image-to-video。reference-to-video 可透過多張影像提供更廣泛的引導,而 extend-video 和 edit-video 則用於處理現有的 MP4 檔案。
Text-to-video 和 image-to-video 支援 1 至 15 秒、480p 或 720p 的短片。Reference-to-video 支援 1 至 10 秒、相同解析度的短片;常見長寬比包括 16:9、9:16、1:1、4:3、3:4、3:2 和 2:3。延伸及編輯路由則遵循各自的輸入限制。
會。xAI 的文件指出,原生音訊生成是 Grok Imagine 影片工作流程的一部分,因此可以同步產生聲音與畫面。Atlas Cloud 為這些路由發布的 schema 未提供獨立的音訊開關。
透過 reference-to-video endpoint 提供 1 至 7 個公開的 HTTPS 影像 URL 或 base64 data URI。像 <IMAGE_0> 這類標籤可以將個別參考影像對應至 prompt 中描述的人物、物件或風格。此路由會回傳最長 10 秒、480p 或 720p 的短片。
使用 extend-video 搭配 2 至 15 秒的 MP4,並要求根據 prompt 指定的動作額外生成 2 至 10 秒。若要進行特定修改,edit-video 接受不超過 8.7 秒的 MP4,並保留原有時長。兩個路由的輸出解析度上限皆為 720p。
Atlas Cloud 的標準定價為 text-to-video、image-to-video 及 reference-to-video 每秒 $0.05。Extend-video 和 edit-video 的標準費率為每秒 $0.07。由於輸出會保留輸入影片的時長,編輯功能會按照輸入影片時長計費。
首先確認所選 endpoint 符合輸入類型,並確認所有必要的 prompt、影像 URL 或影片 URL 都已提供。重新提交前,檢查該路由的時長、解析度、長寬比、參考影像數量及 MP4 限制。如果請求成功但場景不準確,請改寫 prompt,明確描述主體動作、攝影機運動、節奏及視覺細節。
指南、教學與產品動態,助你充分發揮 Atlas Cloud 的價值。