
由 xAI 打造的 Grok Imagine Image 2.0,結合精緻的文字轉圖像生成與自然語言編輯功能,適用於以參考圖為基礎的工作流程。可產生 1K 或 2K 輸出,從提示詞快速完成視覺作品,並透過直接指令精修現有圖像。Atlas Cloud 以單一 OpenAI-compatible API 金鑰整合所有支援的 endpoint,提供透明的隨用隨付定價與簡易整合方式。立即開始建置。
Grok Imagine Image 2.0 由 xAI 開發。Atlas Cloud(由 Atlas Cloud AI LLC 營運)僅提供接取服務,並不擁有該模型。所有商標均歸其各自所有者所有。
在基於提示詞的生成與參考圖引導編輯之間進行選擇,涵蓋標準端點與開發者端點。
| 模態 | 描述 |
|---|---|
| Grok Imagine Image 2.0 Developer Edit API (Image Editing) | 使用自然語言編輯指示轉換最多三張參考圖像。可選擇 1K 或 2K 解析度,以及低或中品質,適合產品優化、創意變化與反覆視覺更新。 |
| Grok Imagine Image 2.0 Developer Text-to-Image API | 透過自然語言提示詞生成精緻圖像,支援 1K 或 2K 解析度。14 種長寬比與低或中品質等級,可滿足行銷圖像、概念藝術、社群內容及其他特定格式素材的需求。 |
| Grok Imagine Image 2.0 Text-to-Image API | 直接透過自然語言提示詞建立精緻視覺內容,輸出支援 1K 或 2K。14 種長寬比與可選的低或中品質等級,適用於行銷活動、設計探索、插畫及適合各平台使用的圖像。 |
| Grok Imagine Image 2.0 Edit API (Image Editing) | 上傳最多三張參考圖像,以自然語言描述所需變更,即可取得編輯後的圖像輸出。1K 與 2K 解析度搭配低或中品質,適合素材修訂、視覺調整與內容迭代。 |
Grok Imagine Image 2.0 可將詳細提示詞與最多 3 張參考圖片轉換為精緻的 1K 或 2K 視覺內容,提供彈性的構圖方式、可選的品質層級,以及用於生成與編輯的單一 Atlas Cloud API。

Grok Imagine Image 2.0 可將自然語言提示詞轉換為 1K 或 2K 解析度的精緻視覺內容。透過一次請求中的詳細指示,即可協調主體、環境、構圖、風格與排版。提供 14 種長寬比選項,從方形產品視覺到超寬幅宣傳素材都能靈活構圖。這項控制能力適合用於打造設計工具、內容流程與提示詞驅動的創意產品。

排版會被規劃為構圖的一部分,讓密集且包含多個元素的視覺內容保持一致,也讓小字維持清晰。只需透過單一提示詞,就能指定文字內容、層級、圖像與版面配置。在 2K 解析度下,細小文字與材質紋理有更多空間呈現細節。適合用於寬幅宣傳圖、產品包裝概念、編輯版面與資訊圖表風格素材。

只需在一次請求中使用自然語言指示,即可編輯最多 3 張參考圖片。將每個來源標示為 <IMAGE_0>、<IMAGE_1> 或 <IMAGE_2>,再描述要合併或變更的元素。輸出可使用 1K 或 2K 解析度,並選擇低或中品質。這套流程適合產品變體、藝術指導與需要保留可辨識來源素材的合成概念。

選擇低品質以加快探索,或選擇中品質以取得模型的最佳輸出,再依每次請求選擇 1K 或 2K 解析度。生成與編輯都提供相同的品質與解析度控制項。當提示詞需要不同方案時,最多可產生 4 個輸出。這種彈性支援從草稿到定稿的工作流程,無需切換模型或重新建置整合。

Atlas Cloud 將文字生成與影像編輯整合在單一影像生成端點與 API 金鑰之後。標準隨用隨付價格從每張輸出影像 $0.04 起,每張來源圖片則收費 $0.01。可回傳影像 URL,或要求以 Base64 格式輸出,方便應用程式直接處理。對於需要清楚掌握成本並減少整合數量的正式環境流程而言,這是實用的基礎。
看看 Grok Imagine Image 2.0 與兩個 Atlas Cloud 替代方案,如何詮釋相同提示詞,呈現編輯攝影與細節豐富的靜物作品。
一名年輕時裝模特兒身穿寶石藍合身西裝,快步穿過陽光灑落的地中海火車站;一列正在離站的火車將散落的票根捲入空中,而畫面捕捉她轉身面向鏡頭、髮絲隨風飛揚的決定性瞬間。大膽的黃金時刻側逆光沿著她的髮絲勾勒出明亮輪廓,並在月台上投下銳利的對角陰影。以重複拱門構成框中框,前景行李柔焦處理,強烈的引導線向火車方向延伸。克制的藍色與琥珀色調,自然肌理,清晰的羊毛織物質感,風化石材,細微顆粒感,編輯時裝攝影,85mm 鏡頭,飛舞紙張帶有輕微動態模糊,寬幅 16:9 畫面比例,全幅出血。

Generated with Grok Imagine Image 2.0 Developer Text-to-Image on Atlas Cloud

Generated with Seedream v5.0 Pro Text-to-Image on Atlas Cloud

Generated with Grok Imagine Image Quality Text-to-Image on Atlas Cloud
一張午後校園屋頂上高中管樂團排練的自然紀實照片,捕捉突如其來的強風吹起整疊樂譜、將其撕散至空中的精準喜劇瞬間;數十張有摺痕的白色紙頁像受驚的鳥群般橫掃畫面,其中一名少女踮起腳尖,拚命伸手試圖抓住一頁,制服裙與頭髮在風中飛舞;她身旁的男孩仍專注地吹奏,鼓起雙頰,手中的銅管樂器拋光彎曲喇叭口清楚映照出其他學生追趕四散樂譜的身影。多名年輕樂手自然地做出驚訝、大笑與尷尬的半動態姿勢反應;他們的樂器保有可信的機械複雜度,包括指法、按鍵、活塞、管路與空間關係。日式過曝類比底片攝影,自發性的決定性瞬間敘事,略帶低角度的水平抓拍;屋頂欄杆與繃緊的曬衣線形成兩條強烈的匯聚引導線,而穿越近景的大幅失焦樂譜則營造分層景深與局部遮擋。正午的定向硬光在混凝土地面上切出清晰、具圖像感的陰影,天空呈大膽過曝的淡色,並帶有明亮高光。嚴格限定三色調:晴朗天空藍、校服白與溫暖黃銅金。保留細小汗珠、逼真的肌理、皺褶棉質制服、紙張纖維與摺痕、風化屋頂混凝土、細微顆粒感、輕微鏡頭泛光,以及飛舞紙頁、頭髮與伸出的手所帶的克制動態模糊。充滿活力、混亂、幽默、青春氣息與觀察感,完全未經擺拍;自然肌膚,乾淨的色彩分離,不要油膩的過度渲染,不要 HDR,不要塑膠感肌膚,不要混濁色彩,不要人工光暈,不要電影史詩效果。35mm 底片相機,28mm 廣角鏡頭,快速抓拍快門搭配選擇性動態模糊,高調曝光,寬幅橫向構圖,寬幅 16:9 畫面比例,全幅出血。

Generated with Grok Imagine Image 2.0 Developer Text-to-Image on Atlas Cloud

Generated with Seedream v5.0 Pro Text-to-Image on Atlas Cloud

Generated with Grok Imagine Image Quality Text-to-Image on Atlas Cloud
從行銷活動概念與產品變體,到編輯藝術與多格式素材,Grok Imagine Image 2.0 能將自然語言提示和最多三張參考圖片,轉化為精緻的 1K 或 2K 視覺內容,支援 14 種長寬比。
透過自然語言提示,以 1K 或 2K 解析度生成精緻的行銷活動視覺。從 14 種長寬比中選擇,為不同版位準備橫幅、登陸頁面主視覺和社群素材。
使用自然語言指示和最多三張參考圖片編輯產品圖像。為電商團隊和自動化目錄工作流程建立色彩變體、季節性場景或適合市集平台的構圖。
生成適合不同螢幕形狀的視覺素材時,可從 14 種長寬比中選擇。為社群動態、行動版面、展示版位和編輯出版工作流程製作 1K 草稿或 2K 交付素材。
透過 text to image endpoint 將文字概念轉化為精緻的 1K 或 2K 圖像。支援編輯插圖、提案視覺、情緒板,以及產品團隊在早期階段的創意探索。
提供最多三張參考圖片,再以自然語言描述所需的編輯內容。開發者可以為創作者、商品企劃團隊和設計審查建立引導式轉換工具,以及可重複使用的內容管線。
隨著每張圖片從探索階段進入交付階段,在低品質與中品質層級之間切換。任一層級皆可搭配 1K 或 2K 輸出,用於原型製作、審查迭代和可直接投入生產的素材。
依供應商、最高解析度、畫面比例控制項與標準單張定價,比較 Grok Imagine Image 2.0 與 Atlas Cloud 的三個替代方案。
| 模型 | 供應商 | 最高解析度 | 畫面比例控制 | 標準價格 |
|---|---|---|---|---|
| Grok Imagine Image 2.0 Developer Text-to-Image | xAI | 2K | 14 個預設比例 | 每張影像 $0.04 |
| Qwen Image 2.0 Text-to-image | Qwen | 2048 × 2048 | 7 個預設比例,另可自訂尺寸 | 每張影像 $0.035 |
| Nano Banana 2 Lite Text-to-image | 1K | 14 個預設比例 | 每張影像 $0.04 | |
| MAI-Image-2.5-Flash Text-to-image | Microsoft | 每邊最高 1360 px | 自訂尺寸 | 每張影像 $0.03 |
幾分鐘即可上手 — 按照以下簡單步驟,透過 Atlas Cloud 平台整合和部署模型。
在 atlascloud.ai 註冊並完成驗證。新用戶可獲得免費額度,用於探索平台和測試模型。
將先進的 Grok Imagine Image 2.0 模型與 Atlas Cloud 的 GPU 加速平台相結合,提供無與倫比的效能、可擴展性和開發體驗。
低延遲:
GPU 最佳化推理,實現即時回應。
統一 API:
一次整合,暢用 Grok Imagine Image 2.0、GPT、Gemini 和 DeepSeek。
透明定價:
按 Token 計費,支援 Serverless 模式。
開發者體驗:
SDK、資料分析、微調工具和模板一應俱全。
可靠性:
99.99% 可用性、RBAC 權限控制、合規日誌。
安全與合規:
SOC 2 Type II 認證、HIPAA 合規、美國資料主權。
Grok Imagine Image 2.0 是 xAI 的影像模型,可透過自然語言生成及編輯視覺內容。Atlas Cloud 提供獨立的文字轉圖片與編輯 endpoint,支援 1K 或 2K 輸出,以及可選的低或中品質。
您可以根據文字提示建立精緻的視覺內容,也可以透過自然語言指令修改現有圖片。文字轉圖片生成支援 14 種長寬比,而編輯流程最多可使用三張參考圖片。
若要建立全新的視覺內容,請選擇文字轉圖片 endpoint;若要使用參考圖片,請選擇編輯 endpoint。請根據對應的 Atlas Cloud schema,提交包含必要解析度、品質與長寬比設定的提示詞。
兩種流程都支援 1K 和 2K 解析度,以及低或中品質等級。文字轉圖片 endpoint 包含 14 種長寬比,讓開發者能產生正方形、直向、橫向及其他版面配置。
編輯 endpoint 在單一請求中最多接受三張參考圖片。請說明每張參考圖片的預期用途,並指出哪些視覺元素應該變更或保持一致。
Atlas Cloud 列出的可用生成與編輯 endpoint 標準基本價格為每張 $0.04。使用量採隨用隨付計價,因此費用會隨請求數量增加。
如果輸出內容應完全根據提示詞建立,請使用文字轉圖片 endpoint。如果需要轉換、合成或精修提供的參考圖片,請選擇編輯 endpoint。
不會,此 family page 涵蓋的 endpoint 只會產生圖片。影片生成需要使用獨立的 Grok Imagine video model,而不是這些影像路由。
請將要求的變更,以及必須保持不變的元素,分別列為明確指令。進行多圖片編輯時,請說明每張參考圖片的作用,並先測試一項主要變更,再合併多個轉換。
指南、教學與產品動態,助你充分發揮 Atlas Cloud 的價值。