
Grok Imagine Video 1.5 是 xAI 為需要透過提示詞與視覺輸入控制動態效果的開發者打造的影片生成系列。使用自然語言動作指令讓起始影格動起來,為參考工作流程選擇 480p 或 720p,並加入選用的參考語音來引導生成結果。透過單一相容 OpenAI 的 Atlas Cloud 金鑰,即可存取支援的模式,並享有透明的隨用隨付定價。立即開始建置。
Grok Imagine Video 1.5 由 xAI 開發。Atlas Cloud(由 Atlas Cloud AI LLC 營運)僅提供接取服務,並不擁有該模型。所有商標均歸其各自所有者所有。
探索六個可將文字、起始影格或參考素材轉換為影片的 endpoint,涵蓋開發者與標準工作流程。
| 模態 | 說明 |
|---|---|
| Grok Imagine Video 1.5 Developer Reference-to-Video API | 使用 1 至 7 張參考圖片和選用的參考聲音,生成具原生同步音訊的影片。輸出影片最長可達 15 秒,解析度支援 480p 或 720p。此 endpoint 適合參考導向的場景,以及需要多張來源圖片的視覺概念。 |
| Grok Imagine Video 1.5 Reference-to-Video API | 此 endpoint 以 1 至 7 張參考圖片為依據,生成具原生同步音訊的影片,也可接受選用的參考聲音。支援最長 15 秒、480p 或 720p 的影片。適合多參考影片製作與聲音引導的連續場景。 |
| Grok Imagine Video 1.5 Developer Text-to-Video API | 只需提供文字提示,即可透過此開發者 endpoint 生成具原生同步音訊的影片。可建立最長 15 秒、解析度為 480p、720p 或 1080p 的片段。適合提示詞導向的概念、分鏡腳本與短影音製作。 |
| Grok Imagine Video 1.5 Text-to-Video API | 直接根據文字提示建立影片,同時原生生成同步音訊。輸出選項包括 480p、720p 與 1080p,最長片長為 15 秒。適合腳本化場景、行銷活動概念或社群影片素材。 |
| Grok Imagine Video 1.5 Developer Image-to-Video API | 以一張圖片為起點,此開發者 endpoint 會套用自然語言的動態指示,產生動畫影片。解析度選項包括 480p、720p 與 1080p。適合讓插畫、產品視覺與準備好的開場影格動起來。 |
| Grok Imagine Video 1.5 Image-to-Video API | 以自然語言描述所需動作,讓起始影格圖片產生動畫。產出的影片可使用 480p、720p 或 1080p 生成。此工作流程適合動態研究、視覺敘事與以圖片為主的創意製作。 |
Grok Imagine Video 1.5 將文字、起始影像,以及 1 至 7 張參考影像工作流程整合在一起,提供原生同步音訊、最高 1080p 輸出,以及在文字或參考模式下最長 15 秒的影片片段;Atlas Cloud 則提供單一 API 與透明的隨用隨付定價。
從文字提示開始,在 480p、720p 或 1080p 下生成最長 15 秒的影片片段。原生同步音訊會隨影片在同一次生成中一併產出。當沒有來源影像時,完全透過文字指令塑造場景與動作。這種方式適合概念影片、電影感實驗,以及由提示驅動的內容製作流程。
透過自然語言動態提示,將單張起始畫面轉化為動態序列。影像負責建立開場構圖,同時可選擇 480p、720p 或 1080p 輸出。在提示中指定主體與場景的動態,再讓模型以該視覺錨點為基礎向前延展動畫。適合產品鏡頭、角色片段,以及需要加入動態效果的藝術指導靜態影像。
使用 1 至 7 張參考影像,以及選用的參考聲音來引導 Grok Imagine Video 1.5。參考模式可生成最長 15 秒、解析度為 480p 或 720p 的影片片段,並提供原生同步音訊。利用這些輸入,將生成場景引導至既定的視覺方向。適合以既有創意參考為基礎打造的行銷活動與故事。
影片與聲音會一同生成,因此每個影片片段都能直接包含原生同步音訊,不需要額外的音訊處理。以可見動作為場景核心,並透過搭配的音訊軌強化時間節奏。對於重視同步效果的片段,這種整合式生成方式能減少視覺創作與聲音製作之間的交接。特別適合表演類與富含氛圍感的影像素材。
讓完整的視覺段落延展至最長 15 秒的文字或參考影片片段,不必停留在短迴圈。可用時長足以在單一生成序列中完成鋪陳、動作與明確的收束。搭配變化的攝影機視角與連續動作,打造更完整的片刻。這個時長非常適合短篇廣告、敘事揭示,以及社群影片場景。
透過單一 Atlas Cloud API,在文字、起始影像與參考影像生成流程之間切換,並採用透明的隨用隨付定價。依照每項素材的需求選擇相應工作流程,不必讓所有創意都受限於同一種輸入類型。同一套整合即可讓開發者使用列出的 6 個 Grok Imagine Video v1.5 Endpoint,包括標準與 Developer 路由。這能簡化不同影片任務的實驗與製作規劃。
看看 Grok Imagine Video 1.5 與兩個 Atlas Cloud 替代方案,如何在電影感動作與風格化奇幻場景中詮釋完全相同的提示詞。
一部 9 秒、一鏡到底的水下巴洛克奇幻電影,場景位於一座遭遺棄且完全淹沒的歌劇院內:一名秀麗、長髮飄逸、戴著發光珍珠面具的自由潛水者,追逐一隻叼著華麗黃銅鑰匙、色彩鮮明的珊瑚紅章魚,穿梭於漂浮的天鵝絨帷幕之間。從破裂舞台地板內部開始,以戲劇性的低角度仰拍呈現她翻身後頭朝下穿過裂縫;接著轉入緊湊的橫向跟拍,她穿梭於翻倒的劇院座椅之間,頭髮與服裝隨水流自然擺動,帷幕鼓起,氣泡穿過層疊拱門留下軌跡;隨後環繞她旋轉並向上升鏡,此時水壓將頭頂的水晶吊燈扯落。高潮時,她在最後一刻側身翻轉避開墜落的吊燈,水晶彼此碰撞並逼真地四散飛落;同時章魚以複雜蜷曲的觸手靈巧接住翻滾中的鑰匙,莊嚴地停頓片刻,再將鑰匙放回她攤開的手掌中。動作持續流暢,具備清晰的開始—追逐—收束結構;角色與珍珠面具保持一致;水阻力、浮力、布料、頭髮、氣泡、觸手變形、撞擊與避碰效果皆符合物理。破碎天窗透入的冷青色光束穿過黑暗的水下觀眾席;珊瑚紅是唯一高度飽和的色彩,引導視線穿越深邃的拱門、帷幕、懸浮碎片與氣泡。寫實電影感水下攝影,帶有細微油畫質感、優雅的巴洛克宏偉氣勢、體積光焦散、高細節;不得出現文字、介面或以靜格偽裝的剪接。沉浸式音效:低沉的水下隆隆聲、湍急水流、布料 flutter、氣泡聲、水晶碰撞聲,以及緊張的管弦脈動;當鑰匙被歸還時,音樂以一個細緻的豎琴音解決。16:9 長寬比。
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
一支 9 秒的荒誕動作喜劇廣告,場景位於黎明時分、一間細節 meticulously detailed 的 1950 年代理髮店內。一隻脾氣暴躁、毛髮蓬亂的古代英國牧羊犬,全身沾滿厚厚的白色肥皂泡沫,衝破大門並在店內疾奔,沿途甩得到處都是泡沫;受驚的理髮師跳上一張旋轉椅追趕牠,快速剪下飛舞的狗毛,每一下清脆的剪刀聲都與強勁爵士鼓點精準同步。從極低的地面視角開始,鏡頭貼著濕漉漉的爪子高速跟拍;爪子在光亮的黑白棋盤格磁磚上打滑,將逼真的水滴與泡沫濺向鏡頭;接著快速向上甩鏡,轉入高速環繞跟拍,利用三面大型鏡子,透過複雜且準確的反射,持續展現並維持狗與理髮師不斷變化的位置關係;然後快速推近,最後散落在空中的毛髮碎屑翻滾、旋轉,並完美落在狗頭上,形成誇張高聳的龐巴度髮型。狗停下來,以一秒鐘近似定格的英雄姿態得意地擺 pose;接著突然爆發式打噴嚏,泡沫與毛髮一同炸開,而爵士樂以一記俐落的喜劇邊鼓聲結束。溫暖的鎢絲燈實景光穿透窗外清冷的藍綠色晨霧;採用濃郁的酒紅、奶油色、拋光黃銅與深色木材復古調色;高級真人廣告電影攝影,無縫連續的高速編舞,角色與空間連續性保持一致;濕毛、肥皂泡沫、散落毛髮、反射、椅子旋轉、慣性與碰撞皆符合物理,具備觸感鮮明的寫實細節與清晰的動態表現;不得使用慢動作,不得出現空洞的建立鏡頭、螢幕、軟體介面、儀表板、進度列、圖表、字幕、解說文字、標誌或浮水印。16:9 長寬比。
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video 1.5 可將提示詞、來源影格與最多 7 張參考圖片,轉換成含同步音訊的短片,適用於行銷活動、產品展示、角色故事、社群內容與快速視覺原型製作。
透過自然語言動作提示詞與同步音訊,讓產品靜態圖像動起來。製作適合店面、活動頁面、上市素材或付費社群版位的短篇展示影片,解析度最高可達 1080p。
使用 1 至 7 個角色參考圖,以及可選的參考音色來引導場景。此設定支援固定演員反覆登場、對話片段,以及具原生同步音訊的短篇敘事影片。
從文字提示詞開始,生成含原生同步音訊的完整影片。行銷團隊無須準備來源圖片,即可探索活動概念、氛圍影片與上市預告。
使用自然語言指示,將單一起始影格轉化為動態影片,解析度最高可達 1080p。製作適合動態消息、上市頁面、活動公告、產品更新與創作者主導貼文的精簡活動素材。
透過提示詞導向的動態,讓核准的分鏡影格栩栩如生,同時保留它作為起始圖片。導演與設計師可製作含同步音訊的短篇預視鏡頭,用於審閱。
結合產品視角、角色肖像、服裝細節與場景參考,最多可使用 7 張圖片。品牌團隊可運用同步音效指導短篇宣傳場景,並以提供的視覺素材作為每次生成的基礎。
比較 Grok Imagine Video 1.5 與主流 reference-to-video 模型在支援的輸入類型、影片長度、解析度、同步音訊及標準每秒價格方面的差異。
| 模型 | 輸入類型 | 影片長度 | 最高解析度 | 原生音訊 | 標準價格 |
|---|---|---|---|---|---|
| Grok Imagine Video v1.5 | 文字、圖片、參考圖片、語音 | 最長 15 秒 | 1080p | √ | $0.08/秒 |
| Seedance 2.0 Reference-to-Video | 文字、圖片、影片、音訊 | 4 至 15 秒 | 4K | √ | $0.112/秒 |
| MiniMax H3 Reference-to-Video | 文字、圖片、影片、音訊 | 4 至 15 秒 | 2K | √ | $0.038/秒 |
| Wan-2.7 Reference-to-video | 文字、圖片、影片、音訊 | 2 至 10 秒 | 1080p | √ | $0.10/秒 |
幾分鐘即可上手 — 按照以下簡單步驟,透過 Atlas Cloud 平台整合和部署模型。
在 atlascloud.ai 註冊並完成驗證。新用戶可獲得免費額度,用於探索平台和測試模型。
將先進的 Grok Imagine Video 1.5 模型與 Atlas Cloud 的 GPU 加速平台相結合,提供無與倫比的效能、可擴展性和開發體驗。
低延遲:
GPU 最佳化推理,實現即時回應。
統一 API:
一次整合,暢用 Grok Imagine Video 1.5、GPT、Gemini 和 DeepSeek。
透明定價:
按 Token 計費,支援 Serverless 模式。
開發者體驗:
SDK、資料分析、微調工具和模板一應俱全。
可靠性:
99.99% 可用性、RBAC 權限控制、合規日誌。
安全與合規:
SOC 2 Type II 認證、HIPAA 合規、美國資料主權。
Grok Imagine Video 1.5 是 xAI 的影片生成模型系列,可從文字、起始影像或多張參考影像建立影片片段。透過 Atlas Cloud,開發者可針對各種生成模式使用不同的 endpoint。
共有三種模式:text-to-video、image-to-video 和 reference-to-video。若要從零建立場景,請選擇文字;若要讓起始畫面產生動態,請選擇影像;若要透過多張影像引導主體、物件和風格,請選擇 reference 模式。
建立 Atlas Cloud API 金鑰,並使用適當的模型 ID,向影片生成 endpoint 傳送經過驗證的請求。使用回傳的工作 ID 查詢生成狀態,並取得完成影片的 URL。
text-to-video 需要自然語言提示詞,而 image-to-video 另外需要一張起始畫面影像。reference-to-video 接受提示詞和 1 到 7 張參考影像,也可選擇提供預設語音 ID 來生成對白。
Atlas Cloud 提供的 schema 支援 1 到 15 秒的影片片段。text-to-video 和 image-to-video 提供 480p、720p 或 1080p 輸出,而 reference-to-video 支援 480p 或 720p。
會。text-to-video 會根據提示詞生成原生同步音訊,而 reference-to-video 可將生成的音訊與選用的預設語音結合,用於對白。
Atlas Cloud 列出的標準基本價格為每個此模型系列頁面涵蓋的 endpoint $0.08。部署前請確認所選 endpoint 的最新計費詳情,因為提供的價格資料未指定計費單位。
透過 reference-to-video endpoint 提供 1 到 7 張影像。在提示詞中使用 <IMAGE_0> 和 <IMAGE_1> 等標籤指定特定素材,讓模型將每張參考影像與預期的主體或場景元素建立關聯。
目前提供的 Atlas Cloud schema 沒有專用的最後一幀參數。image-to-video 使用一張影像作為起始畫面,而 reference-to-video 使用 1 到 7 張影像作為視覺引導,並不保證這些影像會成為第一幀和最後一幀。
當需要使用多張影像來引導新場景中的人物、物件或視覺風格時,請選擇 reference-to-video。當一張現有影像應作為開場畫面,且其動態應遵循自然語言提示詞時,請使用 image-to-video。
指南、教學與產品動態,助你充分發揮 Atlas Cloud 的價值。