
由 xAI 构建的 Grok Imagine Image 2.0 将精致的文生图能力与自然语言编辑相结合,适用于基于参考图的工作流。生成 1K 或 2K 输出,从提示词快速产出成品视觉内容,并通过直接指令优化现有图像。Atlas Cloud 通过一个 OpenAI-compatible API 密钥,将所有受支持的 endpoint 纳入统一服务,并提供透明的按量付费价格与简单集成方式。立即开始构建。
Grok Imagine Image 2.0 由 xAI 开发。Atlas Cloud(由 Atlas Cloud AI LLC 运营)仅提供接入服务,并不拥有该模型。所有商标均归其各自所有者所有。
在标准端点和开发者端点中,选择基于提示词的生成方式,或参考图引导的编辑方式。
| 模态 | 描述 |
|---|---|
| Grok Imagine Image 2.0 Developer Edit API (Image Editing) | 使用自然语言编辑指令转换最多 3 张参考图像。可选择 1K 或 2K 分辨率,以及低或中等质量,适用于产品优化、创意变体和迭代式视觉更新。 |
| Grok Imagine Image 2.0 Developer Text-to-Image API | 通过自然语言提示词生成精美图像,支持 1K 或 2K 分辨率。14 种宽高比以及低或中等质量档位,可满足营销图形、概念艺术、社交媒体内容和其他特定格式素材的需求。 |
| Grok Imagine Image 2.0 Text-to-Image API | 直接根据自然语言提示词创建精美视觉内容,输出支持 1K 或 2K 分辨率。其 14 种宽高比和可选的低或中等质量档位,适用于营销活动、设计探索、插画和适配平台的图像内容。 |
| Grok Imagine Image 2.0 Edit API (Image Editing) | 上传最多 3 张参考图像,用自然语言描述所需修改,即可获得编辑后的图像输出。1K 和 2K 分辨率,以及低或中等质量选项,适用于素材修订、视觉改编和内容迭代。 |
Grok Imagine Image 2.0 可将详细提示词和最多 3 张参考图转化为精致的 1K 或 2K 视觉内容,并提供灵活的画面构图、可选的质量档位,以及用于生成和编辑的一体化 Atlas Cloud API。

Grok Imagine Image 2.0 可将自然语言提示词转化为 1K 或 2K 分辨率的精致视觉内容。通过详细指令,开发者可以在一次请求中协调主体、环境、构图、风格和排版。提供 14 种宽高比选项,可适配从方形产品图到超宽幅广告活动的各种画面。此类控制能力适合用于构建设计工具、内容流水线和提示词驱动的创意产品。

排版会作为构图的一部分进行规划,帮助内容密集、包含多个组成部分的视觉画面保持协调,并让小字号文字更加清晰。通过单条提示词即可指定文案、层级、图像和布局。在 2K 分辨率下,细小文字和材质纹理拥有更充足的呈现空间。适用于宽幅广告图、产品包装概念图、编辑版式和信息图风格素材。

通过一次请求中的自然语言指令,可编辑最多 3 张参考图。将每个来源标记为 <IMAGE_0>、<IMAGE_1> 或 <IMAGE_2>,然后描述需要组合或修改的元素。输出可采用 1K 或 2K 分辨率,并选择低或中质量。此工作流适用于产品变体、艺术指导和需要保留可识别源素材的合成概念。

选择低质量以更快进行探索,或选择中质量以获得模型的最佳输出,然后针对每次请求选择 1K 或 2K 分辨率。生成和编辑都提供相同的质量与分辨率控制选项。当提示词需要多个方案时,最多可生成 4 个输出。这种灵活性支持从草稿到成稿的工作流,无需切换模型或重建集成。

Atlas Cloud 通过一个图像生成 endpoint 和 API key,统一提供文本生成与图像编辑能力。标准按量付费价格为每张输出图像 $0.04 起,每张源图像的费用为 $0.01。可返回图像 URL,也可请求 Base64 输出,以便应用直接处理。对于需要清晰成本和更少集成环节的生产流水线而言,这是一个实用的基础方案。
看看 Grok Imagine Image 2.0 与 Atlas Cloud 的两个替代方案,如何在编辑摄影与纹理丰富的静物摄影中诠释相同的提示词。
一位年轻时装模特身穿钴蓝色修身西装,疾步穿过阳光明媚的地中海火车站;一列正在驶离的列车将散落的车票卷入空中,她恰好在转身面向镜头的决定性瞬间被捕捉,头发被风吹起。大胆的黄金时刻侧逆光沿她的发丝勾勒出明亮的轮廓光,并在站台上投下锐利的对角线阴影。利用重复的拱门构成框中框,前景行李箱柔和虚化,强烈的引导线向远处的列车延伸。克制的蓝色与琥珀色调,自然的皮肤纹理,清晰的羊毛面料质感,风化石材,细腻的胶片颗粒,编辑时尚摄影,85mm 镜头,飞舞纸张带有轻微动态模糊,宽幅 16:9 画面比例,满版构图

Generated with Grok Imagine Image 2.0 Developer Text-to-Image on Atlas Cloud

Generated with Seedream v5.0 Pro Text-to-Image on Atlas Cloud

Generated with Grok Imagine Image Quality Text-to-Image on Atlas Cloud
一张自然抓拍的青年纪实摄影作品:下午,一支高中管乐团正在校园屋顶排练;画面定格在一个极具喜剧性的瞬间——突如其来的强风将整叠乐谱撕扯到空中,数十张折痕斑斑的白纸像受惊的鸟群般横扫画面。一名少女踮起脚尖,拼命伸手去抓其中一页,校服裙摆和头发在风中飞扬;她身旁的男孩仍在认真演奏,鼓起双颊,黄铜号角弧形而光亮的喇叭口清晰映出其他学生追赶失控乐谱的身影。多名年轻乐手自然地表现出惊讶、笑声与笨拙的动态姿势;他们的乐器保留可信的机械复杂度,包括指法、按键、阀门、管路及空间关系。日式过曝模拟胶片摄影,自发的决定性瞬间叙事,略低机位的横向抓拍;屋顶栏杆与绷紧的晾衣线形成两条强烈的汇聚式引导线,而大幅失焦的乐谱穿过近景前景,营造层次感并形成局部遮挡。正午的定向硬光在混凝土上切出清晰、图形化的阴影,天空呈大胆过曝的浅色,亮部明亮。严格限定三色调:晴空蓝、校服白与温暖的黄铜金。保留细小的汗珠、真实的皮肤纹理、褶皱的棉质校服、纸张纤维与折痕、风化的屋顶混凝土、细腻的胶片颗粒、轻微的镜头泛光,以及飞舞纸张、头发和伸出的手部上克制的动态模糊。充满活力、混乱、幽默、青春气息与观察感,完全没有摆拍痕迹;自然肤色,干净的色彩分离,不要油腻的过度渲染,不要 HDR,不要塑料感皮肤,不要浑浊色彩,不要人造光晕,不要电影史诗般的特效。35mm 胶片相机,28mm 广角镜头,快速抓拍快门并结合选择性动态模糊,高调曝光,宽幅横向构图,宽幅 16:9 画面比例,满版构图。

Generated with Grok Imagine Image 2.0 Developer Text-to-Image on Atlas Cloud

Generated with Seedream v5.0 Pro Text-to-Image on Atlas Cloud

Generated with Grok Imagine Image Quality Text-to-Image on Atlas Cloud
从营销活动概念和产品变体,到编辑艺术和多格式素材,Grok Imagine Image 2.0 可将自然语言提示词和最多三张参考图转化为精美的 1K 或 2K 视觉内容,并支持 14 种宽高比。
根据自然语言提示词生成精美的营销活动视觉内容,支持 1K 或 2K 分辨率。可从 14 种宽高比中进行选择,为不同展示位置制作横幅、落地页视觉和社交媒体创意素材。
使用自然语言指令和最多三张参考图编辑产品图片。为电商团队和自动化目录工作流创建不同配色、季节性场景或适合电商平台发布的构图。
生成适配不同屏幕形态的视觉素材时,可从 14 种宽高比中进行选择。为社交媒体信息流、移动端布局、展示广告位和编辑发布工作流制作 1K 草稿或 2K 成品。
通过文生图 endpoint 将文字概念转化为精美的 1K 或 2K 图像,为产品团队提供编辑插图、提案视觉、情绪板以及早期创意探索支持。
提供最多三张参考图,然后使用自然语言描述所需的编辑效果。开发者可以为创作者、商品运营团队和设计评审构建引导式变换工具,并搭建可复用的内容流水线。
随着图像从探索阶段逐步进入交付阶段,在低质量和中质量档位之间切换。任一档位均可搭配 1K 或 2K 输出,用于原型制作、评审迭代和生产就绪素材。
按提供商、最大分辨率、画幅控制和标准单张图像价格,对比 Grok Imagine Image 2.0 与 Atlas Cloud 的三种替代方案。
| 模型 | 提供商 | 最大分辨率 | 宽高比控制 | 标准价格 |
|---|---|---|---|---|
| Grok Imagine Image 2.0 Developer Text-to-Image | xAI | 2K | 14 个预设 | $0.04/张图像 |
| Qwen Image 2.0 Text-to-image | Qwen | 2048 × 2048 | 7 个预设,另支持自定义尺寸 | $0.035/张图像 |
| Nano Banana 2 Lite Text-to-image | 1K | 14 个预设 | $0.04/张图像 | |
| MAI-Image-2.5-Flash Text-to-image | Microsoft | 每边最高 1360 px | 自定义尺寸 | $0.03/张图像 |
几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。
在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。
将先进的 Grok Imagine Image 2.0 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。
低延迟:
GPU 优化推理,实现实时响应。
统一 API:
一次集成,畅用 Grok Imagine Image 2.0、GPT、Gemini 和 DeepSeek。
透明定价:
按 Token 计费,支持 Serverless 模式。
开发者体验:
SDK、数据分析、微调工具和模板一应俱全。
可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。
安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。
Grok Imagine Image 2.0 是一款由 xAI 开发的图像模型,可通过自然语言生成和编辑视觉内容。Atlas Cloud 提供独立的文生图和图像编辑端点,支持 1K 或 2K 输出,并可选择低或中等质量。
通过文字提示词创建精美视觉内容,或使用自然语言指令修改现有图像。文生图支持 14 种宽高比,编辑流程最多可使用三张参考图像。
创建新视觉内容时选择文生图端点,使用参考图像时选择编辑端点。根据对应的 Atlas Cloud schema,提交包含所需分辨率、质量和宽高比设置的提示词。
两种工作流都支持 1K 和 2K 分辨率,以及低或中等质量等级。文生图端点包含 14 种宽高比,开发者可以生成正方形、纵向、横向及其他布局的图像。
编辑端点单次请求最多接受三张参考图像。请说明每张参考图像的预期作用,并明确哪些视觉元素应发生变化或保持一致。
Atlas Cloud 标示可用生成和编辑端点的标准基础价格为每张图像 $0.04。用量采用按用付费模式,因此费用会随请求数量增加而增加。
如果输出内容应完全根据提示词创建,请使用文生图端点。如果需要转换、组合或优化提供的参考图像,请选择编辑端点。
不能,这个系列页面介绍的端点只生成图像。视频生成需要使用独立的 Grok Imagine 视频模型,而不是这些图像路由。
将所需修改内容与必须保持不变的元素分别列为明确、具体的指令。进行多图编辑时,请说明每张参考图像的作用,并先测试一项主要修改,再组合多项变换。
指南、教程与产品动态,助你充分发挥 Atlas Cloud 的价值。