Seedance 2.0 Mini & Fast API 全球最低價 —— 比官方定價最高低 68%
Grok Imagine Video 1.5 Motion Prompting

Grok Imagine Video 1.5 Motion Prompting

Grok Imagine Video 1.5 是 xAI 為需要透過提示詞與視覺輸入控制動態效果的開發者打造的影片生成系列。使用自然語言動作指令讓起始影格動起來,為參考工作流程選擇 480p 或 720p,並加入選用的參考語音來引導生成結果。透過單一相容 OpenAI 的 Atlas Cloud 金鑰,即可存取支援的模式,並享有透明的隨用隨付定價。立即開始建置。

Grok Imagine Video 1.5 由 xAI 開發。Atlas Cloud(由 Atlas Cloud AI LLC 營運)僅提供接取服務,並不擁有該模型。所有商標均歸其各自所有者所有。

比較 Grok Imagine Video 1.5 的輸入模態

探索六個可將文字、起始影格或參考素材轉換為影片的 endpoint,涵蓋開發者與標準工作流程。

模態說明
Grok Imagine Video 1.5 Developer Reference-to-Video API使用 1 至 7 張參考圖片和選用的參考聲音,生成具原生同步音訊的影片。輸出影片最長可達 15 秒,解析度支援 480p 或 720p。此 endpoint 適合參考導向的場景,以及需要多張來源圖片的視覺概念。
Grok Imagine Video 1.5 Reference-to-Video API此 endpoint 以 1 至 7 張參考圖片為依據,生成具原生同步音訊的影片,也可接受選用的參考聲音。支援最長 15 秒、480p 或 720p 的影片。適合多參考影片製作與聲音引導的連續場景。
Grok Imagine Video 1.5 Developer Text-to-Video API只需提供文字提示,即可透過此開發者 endpoint 生成具原生同步音訊的影片。可建立最長 15 秒、解析度為 480p、720p 或 1080p 的片段。適合提示詞導向的概念、分鏡腳本與短影音製作。
Grok Imagine Video 1.5 Text-to-Video API直接根據文字提示建立影片,同時原生生成同步音訊。輸出選項包括 480p、720p 與 1080p,最長片長為 15 秒。適合腳本化場景、行銷活動概念或社群影片素材。
Grok Imagine Video 1.5 Developer Image-to-Video API以一張圖片為起點,此開發者 endpoint 會套用自然語言的動態指示,產生動畫影片。解析度選項包括 480p、720p 與 1080p。適合讓插畫、產品視覺與準備好的開場影格動起來。
Grok Imagine Video 1.5 Image-to-Video API以自然語言描述所需動作,讓起始影格圖片產生動畫。產出的影片可使用 480p、720p 或 1080p 生成。此工作流程適合動態研究、視覺敘事與以圖片為主的創意製作。

深入解析 Grok Imagine Video 1.5 創意引擎

Grok Imagine Video 1.5 將文字、起始影像,以及 1 至 7 張參考影像工作流程整合在一起,提供原生同步音訊、最高 1080p 輸出,以及在文字或參考模式下最長 15 秒的影片片段;Atlas Cloud 則提供單一 API 與透明的隨用隨付定價。

Grok Imagine Video 1.5 文字生成

從文字提示開始,在 480p、720p 或 1080p 下生成最長 15 秒的影片片段。原生同步音訊會隨影片在同一次生成中一併產出。當沒有來源影像時,完全透過文字指令塑造場景與動作。這種方式適合概念影片、電影感實驗,以及由提示驅動的內容製作流程。

以影像引導動態

透過自然語言動態提示,將單張起始畫面轉化為動態序列。影像負責建立開場構圖,同時可選擇 480p、720p 或 1080p 輸出。在提示中指定主體與場景的動態,再讓模型以該視覺錨點為基礎向前延展動畫。適合產品鏡頭、角色片段,以及需要加入動態效果的藝術指導靜態影像。

Grok Imagine Video 1.5 參考影像導向

使用 1 至 7 張參考影像,以及選用的參考聲音來引導 Grok Imagine Video 1.5。參考模式可生成最長 15 秒、解析度為 480p 或 720p 的影片片段,並提供原生同步音訊。利用這些輸入,將生成場景引導至既定的視覺方向。適合以既有創意參考為基礎打造的行銷活動與故事。

原生同步音訊

影片與聲音會一同生成,因此每個影片片段都能直接包含原生同步音訊,不需要額外的音訊處理。以可見動作為場景核心,並透過搭配的音訊軌強化時間節奏。對於重視同步效果的片段,這種整合式生成方式能減少視覺創作與聲音製作之間的交接。特別適合表演類與富含氛圍感的影像素材。

15 秒故事弧線

讓完整的視覺段落延展至最長 15 秒的文字或參考影片片段,不必停留在短迴圈。可用時長足以在單一生成序列中完成鋪陳、動作與明確的收束。搭配變化的攝影機視角與連續動作,打造更完整的片刻。這個時長非常適合短篇廣告、敘事揭示,以及社群影片場景。

一個 API、6 個 Endpoint

透過單一 Atlas Cloud API,在文字、起始影像與參考影像生成流程之間切換,並採用透明的隨用隨付定價。依照每項素材的需求選擇相應工作流程,不必讓所有創意都受限於同一種輸入類型。同一套整合即可讓開發者使用列出的 6 個 Grok Imagine Video v1.5 Endpoint,包括標準與 Developer 路由。這能簡化不同影片任務的實驗與製作規劃。

Grok Imagine Video 1.5 單一提示詞模型對決

看看 Grok Imagine Video 1.5 與兩個 Atlas Cloud 替代方案,如何在電影感動作與風格化奇幻場景中詮釋完全相同的提示詞。

提示詞

一部 9 秒、一鏡到底的水下巴洛克奇幻電影,場景位於一座遭遺棄且完全淹沒的歌劇院內:一名秀麗、長髮飄逸、戴著發光珍珠面具的自由潛水者,追逐一隻叼著華麗黃銅鑰匙、色彩鮮明的珊瑚紅章魚,穿梭於漂浮的天鵝絨帷幕之間。從破裂舞台地板內部開始,以戲劇性的低角度仰拍呈現她翻身後頭朝下穿過裂縫;接著轉入緊湊的橫向跟拍,她穿梭於翻倒的劇院座椅之間,頭髮與服裝隨水流自然擺動,帷幕鼓起,氣泡穿過層疊拱門留下軌跡;隨後環繞她旋轉並向上升鏡,此時水壓將頭頂的水晶吊燈扯落。高潮時,她在最後一刻側身翻轉避開墜落的吊燈,水晶彼此碰撞並逼真地四散飛落;同時章魚以複雜蜷曲的觸手靈巧接住翻滾中的鑰匙,莊嚴地停頓片刻,再將鑰匙放回她攤開的手掌中。動作持續流暢,具備清晰的開始—追逐—收束結構;角色與珍珠面具保持一致;水阻力、浮力、布料、頭髮、氣泡、觸手變形、撞擊與避碰效果皆符合物理。破碎天窗透入的冷青色光束穿過黑暗的水下觀眾席;珊瑚紅是唯一高度飽和的色彩,引導視線穿越深邃的拱門、帷幕、懸浮碎片與氣泡。寫實電影感水下攝影,帶有細微油畫質感、優雅的巴洛克宏偉氣勢、體積光焦散、高細節;不得出現文字、介面或以靜格偽裝的剪接。沉浸式音效:低沉的水下隆隆聲、湍急水流、布料 flutter、氣泡聲、水晶碰撞聲,以及緊張的管弦脈動;當鑰匙被歸還時,音樂以一個細緻的豎琴音解決。16:9 長寬比。

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

提示詞

一支 9 秒的荒誕動作喜劇廣告,場景位於黎明時分、一間細節 meticulously detailed 的 1950 年代理髮店內。一隻脾氣暴躁、毛髮蓬亂的古代英國牧羊犬,全身沾滿厚厚的白色肥皂泡沫,衝破大門並在店內疾奔,沿途甩得到處都是泡沫;受驚的理髮師跳上一張旋轉椅追趕牠,快速剪下飛舞的狗毛,每一下清脆的剪刀聲都與強勁爵士鼓點精準同步。從極低的地面視角開始,鏡頭貼著濕漉漉的爪子高速跟拍;爪子在光亮的黑白棋盤格磁磚上打滑,將逼真的水滴與泡沫濺向鏡頭;接著快速向上甩鏡,轉入高速環繞跟拍,利用三面大型鏡子,透過複雜且準確的反射,持續展現並維持狗與理髮師不斷變化的位置關係;然後快速推近,最後散落在空中的毛髮碎屑翻滾、旋轉,並完美落在狗頭上,形成誇張高聳的龐巴度髮型。狗停下來,以一秒鐘近似定格的英雄姿態得意地擺 pose;接著突然爆發式打噴嚏,泡沫與毛髮一同炸開,而爵士樂以一記俐落的喜劇邊鼓聲結束。溫暖的鎢絲燈實景光穿透窗外清冷的藍綠色晨霧;採用濃郁的酒紅、奶油色、拋光黃銅與深色木材復古調色;高級真人廣告電影攝影,無縫連續的高速編舞,角色與空間連續性保持一致;濕毛、肥皂泡沫、散落毛髮、反射、椅子旋轉、慣性與碰撞皆符合物理,具備觸感鮮明的寫實細節與清晰的動態表現;不得使用慢動作,不得出現空洞的建立鏡頭、螢幕、軟體介面、儀表板、進度列、圖表、字幕、解說文字、標誌或浮水印。16:9 長寬比。

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

Grok Imagine Video 1.5 橫跨創意流程

Grok Imagine Video 1.5 可將提示詞、來源影格與最多 7 張參考圖片,轉換成含同步音訊的短片,適用於行銷活動、產品展示、角色故事、社群內容與快速視覺原型製作。

Grok Imagine Video 1.5 產品短片

透過自然語言動作提示詞與同步音訊,讓產品靜態圖像動起來。製作適合店面、活動頁面、上市素材或付費社群版位的短篇展示影片,解析度最高可達 1080p。

參考圖引導的角色故事

使用 1 至 7 個角色參考圖,以及可選的參考音色來引導場景。此設定支援固定演員反覆登場、對話片段,以及具原生同步音訊的短篇敘事影片。

提示詞優先的活動概念

從文字提示詞開始,生成含原生同步音訊的完整影片。行銷團隊無須準備來源圖片,即可探索活動概念、氛圍影片與上市預告。

Grok Imagine Video 1.5 社群短片

使用自然語言指示,將單一起始影格轉化為動態影片,解析度最高可達 1080p。製作適合動態消息、上市頁面、活動公告、產品更新與創作者主導貼文的精簡活動素材。

分鏡影格動畫

透過提示詞導向的動態,讓核准的分鏡影格栩栩如生,同時保留它作為起始圖片。導演與設計師可製作含同步音訊的短篇預視鏡頭,用於審閱。

Grok Imagine Video 1.5 品牌活動

結合產品視角、角色肖像、服裝細節與場景參考,最多可使用 7 張圖片。品牌團隊可運用同步音效指導短篇宣傳場景,並以提供的視覺素材作為每次生成的基礎。

Grok Imagine Video 1.5 在多模態影片領域中的表現

比較 Grok Imagine Video 1.5 與主流 reference-to-video 模型在支援的輸入類型、影片長度、解析度、同步音訊及標準每秒價格方面的差異。

模型輸入類型影片長度最高解析度原生音訊標準價格
Grok Imagine Video v1.5文字、圖片、參考圖片、語音最長 15 秒1080p√$0.08/秒
Seedance 2.0 Reference-to-Video文字、圖片、影片、音訊4 至 15 秒4K√$0.112/秒
MiniMax H3 Reference-to-Video文字、圖片、影片、音訊4 至 15 秒2K√$0.038/秒
Wan-2.7 Reference-to-video文字、圖片、影片、音訊2 至 10 秒1080p√$0.10/秒

如何在 Atlas Cloud 上使用 Grok Imagine Video 1.5

幾分鐘即可上手 — 按照以下簡單步驟,透過 Atlas Cloud 平台整合和部署模型。

建立 Atlas Cloud 帳戶

在 atlascloud.ai 註冊並完成驗證。新用戶可獲得免費額度,用於探索平台和測試模型。

為何在 Atlas Cloud 使用 Grok Imagine Video 1.5

將先進的 Grok Imagine Video 1.5 模型與 Atlas Cloud 的 GPU 加速平台相結合,提供無與倫比的效能、可擴展性和開發體驗。

效能與靈活性

低延遲:
GPU 最佳化推理,實現即時回應。

統一 API:
一次整合,暢用 Grok Imagine Video 1.5、GPT、Gemini 和 DeepSeek。

透明定價:
按 Token 計費,支援 Serverless 模式。

企業與規模

開發者體驗:
SDK、資料分析、微調工具和模板一應俱全。

可靠性:
99.99% 可用性、RBAC 權限控制、合規日誌。

安全與合規:
SOC 2 Type II 認證、HIPAA 合規、美國資料主權。

Grok Imagine Video 1.5 API 常見問題

Grok Imagine Video 1.5 是 xAI 的影片生成模型系列,可從文字、起始影像或多張參考影像建立影片片段。透過 Atlas Cloud,開發者可針對各種生成模式使用不同的 endpoint。

共有三種模式:text-to-video、image-to-video 和 reference-to-video。若要從零建立場景,請選擇文字;若要讓起始畫面產生動態,請選擇影像;若要透過多張影像引導主體、物件和風格,請選擇 reference 模式。

建立 Atlas Cloud API 金鑰,並使用適當的模型 ID,向影片生成 endpoint 傳送經過驗證的請求。使用回傳的工作 ID 查詢生成狀態,並取得完成影片的 URL。

text-to-video 需要自然語言提示詞,而 image-to-video 另外需要一張起始畫面影像。reference-to-video 接受提示詞和 1 到 7 張參考影像,也可選擇提供預設語音 ID 來生成對白。

Atlas Cloud 提供的 schema 支援 1 到 15 秒的影片片段。text-to-video 和 image-to-video 提供 480p、720p 或 1080p 輸出,而 reference-to-video 支援 480p 或 720p。

會。text-to-video 會根據提示詞生成原生同步音訊,而 reference-to-video 可將生成的音訊與選用的預設語音結合,用於對白。

Atlas Cloud 列出的標準基本價格為每個此模型系列頁面涵蓋的 endpoint $0.08。部署前請確認所選 endpoint 的最新計費詳情,因為提供的價格資料未指定計費單位。

透過 reference-to-video endpoint 提供 1 到 7 張影像。在提示詞中使用 <IMAGE_0> 和 <IMAGE_1> 等標籤指定特定素材,讓模型將每張參考影像與預期的主體或場景元素建立關聯。

目前提供的 Atlas Cloud schema 沒有專用的最後一幀參數。image-to-video 使用一張影像作為起始畫面,而 reference-to-video 使用 1 到 7 張影像作為視覺引導,並不保證這些影像會成為第一幀和最後一幀。

當需要使用多張影像來引導新場景中的人物、物件或視覺風格時,請選擇 reference-to-video。當一張現有影像應作為開場畫面,且其動態應遵循自然語言提示詞時,請使用 image-to-video。

探索更多系列

Seedance 2.5

Seedance 2.5 API 現已在 Atlas Cloud 上線!它為開發者提供了 ByteDance 最新的影片模型。該模型可透過文本、單張影像或多達 50 個多模態參考,一次性生成長達 30 秒的原生影片,並包含同步音訊和畫面內的多語言文本。在 Atlas Cloud 上,您可以透過單個金鑰存取它,其主體一致性和改進的物理特性可保持長鏡頭的連貫性。

檢視系列

Wan 3.0

Wan 3.0 API 是阿里巴巴 Wan 影片系列的下一代產品,旨在將長影片生成、多參考控制和影音品質推向新的高度。Atlas Cloud 已經代管了 Wan 2.7、2.6 和 2.5,而 Wan 3.0 透過相同的統一金鑰運行,無需額外設定。立即開始建置吧。向下捲動至展示區,查看 Wan 3.0 的創作能力。

檢視系列

MiniMax H3

MiniMax H3 是 MiniMax 的多模態影片系列,支援文字、影像與參考素材引導創作。在支援的路由中,它能保留參考媒體中的主體、提供彈性的長寬比,並透過 H3 Developer 將生成的聲音與畫面配對;輸出設定檔則依端點選定。Atlas Cloud 以一組 OpenAI-compatible 金鑰統一整個系列,並提供透明的隨用隨付定價,標準費率為每秒 $0.038。立即開始打造。

檢視系列

Seedream 5.0 Pro

Seedream 5.0 Pro API 為開發者在 Atlas Cloud 上提供了字節跳動的可控圖像編輯模型。它透過錨點和座標精確定位編輯,將圖像分離為可編輯圖層,融合多個參考,並精準匹配顏色和材質,支援 2K 和 3K 解析度的多語言文本。在 Atlas Cloud 上,您只需一個金鑰即可存取!

檢視系列

Seedance 2.0

Seedance 2.0 是 ByteDance 為精準鏡頭創作打造的生產級影片模型。將提示詞轉換為影片、使用可選的末幀引導讓首幀圖片動起來,或搭配參考媒體與可選的網路搜尋塑造成果。Atlas Cloud 將這些工作流程整合至統一的 API,提供透明的按用量計費方案,以及一組相容於 OpenAI 的金鑰。立即開始打造。

檢視系列

GPT Image 2.5

OpenAI 的 gpt-image-2.5 系列讓開發者可在正式環境的影像工作流程中選擇 Flare 與 Sunburst。支援最高 3840x2160 的任意解析度渲染,並提供五個品質等級(包括 xhigh 與 max),滿足特定的輸出需求。Atlas Cloud 提供可立即使用的 REST 推論服務,無冷啟動問題,標準價格每次生成最低 $0.004。立即開始建構。

檢視系列

GPT Image 2

GPT Image 2 API 為開發者提供了訪問 OpenAI 最新圖像模型的途徑,它是 GPT Image 1.5 的繼任者。該模型可生成和編輯圖像,能夠在拉丁和 CJK 文字上實現準確的文本渲染,並在海報、樣機和資訊圖表方面具備強大的排版能力。在 Atlas Cloud 上,您可以透過一個統一的 API 與 300 多個模型一起訪問它,並享受免費額度、99.99% 的正常運行時間,且無需 OpenAI 組織驗證。

檢視系列

Gemini Omni Flash

gemini omni API 將 Google DeepMind 原生多模態的 Gemini Omni Flash 系列(包括 Gemini Omni 1.1 Flash)帶給開發者。您可以建立具同步原生音訊的電影級影片、以精確的起始與結束影格控制讓靜態圖片動起來,或透過文字引導的編輯修改現有影片,同時保留未修改的內容。Atlas Cloud 提供單一 OpenAI 相容金鑰、統一存取,以及透明的隨用隨付定價。立即開始建置。

檢視系列

Grok Imagine

Grok Imagine API 涵蓋 xAI 的圖像、影片和語音模型,從 Image 2.0 到 Video 1.5 和 xAI TTS v1。在 14 種寬高比下生成 1K 或 2K 靜止畫面,將場景擴展為 15 秒的 1080p 動態影像,使用高達 7 張參考圖像操控鏡頭,或用 20 種語言配音。Atlas Cloud 在單一端點運行所有模式,按使用量付費定價,從每張圖像 $0.02 和每秒 $0.05 起。立即開始建置。

檢視系列

Google

Google最強大的創意模型現已在Atlas Cloud上全面可用。Veo 3.1提供電影等級的影片生成,Nano Banana 2支援高保真圖像建立,而Gemini為每個工作流程帶來多模態智慧。透過單一API key即可存取完整的Google模型套件,提供Day-0可用性和隨用隨付(pay-as-you-go)定價。

檢視系列

Seedance 2.0 Mini

Seedance 2.0 Mini 將 ByteDance 的多模態影片生成技術引入到對速度和成本要求極高的工作流程中。它以更輕量的佔用空間提供 Seedance 2.0 的核心能力——更快的生成速度、更低的單支影片成本,並且使用您現有的同款 API 整合。對於運行高吞吐量流水線或進行大規模原型設計的團隊來說,Mini 是最實用的預設選擇。

檢視系列

ByteDance

從電影級影片生成到高保真影像建立,ByteDance 最強大的模型現已在 Atlas Cloud 上線。以最低的推論定價和零基礎設施開銷,大規模執行 Seedance 和 Seedream。

檢視系列

一個 API,暢享全模態 AI。

探索全部模型