Hero background 1Hero background 2Hero background 3

Nano Banana 2.1 Pro Quality at Flash Speed

Nano Banana 2.1 是 Google 基于 Gemini 3.6 Flash 打造的图像模型系列。它以 Flash 级速度提供 Pro 级生成与编辑能力,支持通过自然语言对 1 到 14 张输入图像进行编辑和融合,并可保持最多 4 个角色和 10 个对象的一致性。通过 Atlas Cloud,开发者只需使用一个 OpenAI-compatible 密钥,即可访问该系列模型,享受可靠的运行时间保障和 Day-0 可用性。立即开始构建。

Nano Banana 2.1 由 Google 开发。Atlas Cloud(由 Atlas Cloud AI LLC 运营)仅提供接入服务,并不拥有该模型。所有商标均归其各自所有者所有。

探索领先模型

Atlas Cloud 为您提供最新的行业领先创意模型。

对比六个 Nano Banana 2.1 图像端点

了解 Nano Banana 2.1 如何通过六个端点处理文本生成、多图编辑和视频引导的静态图像创建。

模态描述
Nano Banana 2.1 Developer Reference-to-Image API向此端点提供一个源视频片段、可选的参考图像和提示词,即可生成新的静态图像。其 Pro 级画质与 Flash 级速度相结合,适用于缩略图、海报和摘要信息图。
Nano Banana 2.1 Developer Edit API通过自然语言指令,此端点可以编辑、重塑风格或合并 1 到 14 张输入图像,生成修改后的图像。基于蒙版的区域编辑,以及对最多 4 个角色和 10 个物体的一致性支持,适合制作营销活动变体、角色场景和多物体构图。
Nano Banana 2.1 Developer Text-to-Image API此端点从文本提示词出发,生成构图良好的 1K 至 4K 图像。精准的多语言文本渲染、可调节的思考能力以及可选的 Google Search grounding,使其适用于海报、产品视觉和信息丰富的图形。
Nano Banana 2.1 Reference-to-Image API当视频中包含你需要的关键瞬间时,此端点可以结合一个源视频片段、可选的参考图像和提示词来创建静态图像。其 Pro 级画质与 Flash 级速度适用于缩略图、海报或视觉摘要。
Nano Banana 2.1 Edit API对于复杂合成,此端点可根据自然语言指令编辑、重塑风格或合并 1 到 14 张源图像。它支持基于蒙版的区域修改,同时保持最多 4 个角色和 10 个物体的一致性,适合品牌素材、场景调整和群像作品。
Nano Banana 2.1 Text-to-Image API只用文本也能生成精致的作品?此端点可生成构图良好的 1K 至 4K 图像,并支持精准的多语言文本渲染。可调节的思考能力和可选的 Google Search grounding,适合本地化广告、文字排版占比高的设计以及基于可靠信息的视觉内容。

Nano Banana 2.1:Pro 级质量,Flash 级速度

Nano Banana 2.1 将 Pro 级 1K 至 4K 生成、基于蒙版的编辑、最多融合 14 张参考图、多语言文本、可调节思考级别、Google Search grounding,以及视频引导的静帧创建整合到一个 Atlas Cloud API 中。

Nano Banana 2.1 生成 4K 图像

Nano Banana 2.1 基于 Gemini 3.6 Flash 构建,以 Flash 级速度生成 Pro 级视觉内容,支持 1K、2K 和 4K。更强的提示词遵循能力,可帮助复杂构图在各种高要求视觉格式中准确符合创意简报。选择适合快速迭代或精细生产交付的分辨率。适用于营销活动视觉、产品图像和精致的编辑内容。

14 张参考图,构成一个场景

通过编辑工作流组合 1 至 14 张输入图像,再使用自然语言指令引导构图。Nano Banana 2.1 可在融合人物、产品、道具和风格的同时,保持最多 4 个角色和 10 个物体的一致性。这为故事团队和商业工具提供了构建连贯多主体场景的实用路径。

Nano Banana 2.1 蒙版编辑

需要修改某个区域,而不想重新设计整个画面?基于蒙版的区域编辑功能可让 Nano Banana 2.1 通过自然语言指令定位并修改选定细节。同一个编辑 endpoint 还可在保护角色和物体一致性的同时,对源图像进行重新风格化或融合。可将其用于产品精修、服装更换,或以生产级速度制作受控的营销活动变体。

精准的多语言排版

精准的多语言文本渲染,让文字成为构图中可靠的一部分,而不是装饰性噪声。Nano Banana 2.1 可在 1K 至 4K 图像中放置清晰易读的文字,并支持结构化的信息图布局。将明确的文案指引与有力的视觉简报结合起来,即可创建横幅、标牌、菜单和信息图,供不同市场与地区审核。

从视频片段生成静态图像

将一个源视频片段、可选的参考图像和提示词转换为新的静态图像。参考图到图像工作流会将视觉上下文浓缩为缩略图、海报或摘要信息图,同时以 Flash 级速度保持 Pro 级质量。当团队需要从现有素材中快速获得可发布的主视觉时,这项功能尤其有用。

支持 Thinking 和 Search 的 Nano Banana 2.1

当创意简报依赖更深入的推理或最新上下文时,可调节思考级别,并选择启用 Google Search grounding。Nano Banana 2.1 将这些控制项与文本生成、编辑和视频引导静帧创建功能统一起来。Atlas Cloud 通过一个 OpenAI 兼容密钥整合整个模型系列,并按照经验证的标准费率提供透明的按量付费定价,每次调用 $0.05。

Nano Banana 2.1 对决:一个提示词,三种模型

看看 Nano Banana 2.1 与两种 Atlas Cloud 替代方案如何针对排版、构图、光线、动感和真实质感,解读相同的提示词。

提示词

一张捕捉决定性瞬间的纪实照片,场景位于一座迷失于 1990 年代的铁路总站失物招领办公室内:年轻的女职员刚刚将木柄日期印章按在认领表格上,留下清晰鲜红的日期印记。这时,一台老式吊扇突然将几十张纸质认领标签吹向空中;每张标签上都写有清晰可辨的唯一编号、地点名称和简短的手写失物描述。与此同时,一只活泼的雪貂从半开的、有擦痕的皮革手提箱中钻出,嘴里叼着一把刮花的黄铜钥匙飞奔而去;受到惊吓的女职员伸手越过长长的服务柜台试图拦住它,表情真实震惊,双手符合解剖结构、自然,并定格在动作之中。柜台形成一条强烈的对角线引导线,指向雪貂;她身后密集排列的方形储物格,里面塞满各式行李和包裹,构成层层叠叠的框中框;几张飞行中的标签从镜头前极近处掠过,形成柔和的失焦前景遮挡,营造出纵深和受控的混乱感。近距离直射机顶闪光灯将女职员、雪貂、钥匙和最近的标签冻结在画面中,呈现清晰而富有触感的细节;与此同时,右侧百叶窗射入几束清冷的晨光,斜切过房间,照亮空气中的尘埃、纸张边缘和毛发;选择性运动模糊拖出旋转吊扇和更远处标签的运动轨迹。严格限定色彩为陈旧薄荷绿、烟草棕和印章鲜红,色调分离干净,不出现浑浊色彩。强调纸张纤维、卷曲的标签边角、印泥压力痕迹、磨损的皮革纹理、掉漆的木材、雪貂毛发、刮花的金属和细微的模拟胶片颗粒。真实的 1990 年代新闻摄影风格,捕捉自然的人际互动;手、动物、钥匙、手提箱、柜台与空中纸张之间的空间关系不完美却可信。35mm 胶片相机,28mm 广角镜头,近距离视角,f/5.6,克制的对比度,真实的皮肤纹理,轻微的闪光灯衰减;不要油腻过度渲染,不要 HDR,不要塑料质感皮肤,不要过度微细节,不要全局光晕,不要电影式“史诗”效果,不要奇幻氛围;宽幅横向构图,16:9 宽高比,满版出血。

Generated with Nano Banana 2.1 Text-to-Image on Atlas Cloud

Generated with Seedream v5.0 Pro Text-to-Image on Atlas Cloud

Generated with Nano Banana 2 Text-to-Image on Atlas Cloud

提示词

一张复古超现实主义广告摄影作品,场景位于正午明亮的机场行李提取大厅,捕捉这样一个决定性瞬间:传送带弯道处,正好二十个一模一样的番茄红硬壳行李箱中的一个突然弹开;一群折叠纸制候鸟向外爆发,带有轻微运动模糊,而一整片真实比例的滚动绿草、根系、土屑和被风吹弯的草叶,竟从箱子里不可能地倾泻而出。旁边,一位留着银灰色短发、穿着时髦的年轻旅客伸出解剖结构准确的手,接住飞到半空中的护照;她双眼因惊讶而睁大,嘴唇努力压住笑意,皮肤纹理自然,身体语言随性真实。使用极低机位拍摄,镜头几乎贴着移动的传送带;利用传送带强烈的椭圆形引导线、二十个行李箱的节奏性重复,以及航站楼玻璃中的层叠反射,营造深邃而精准的空间透视。来自头顶天窗的清晰定向正午硬光,在拉丝金属和抛光地面上投下干净而修长的阴影。严格限定色彩为番茄红、机场蓝灰和鲜艳草绿;不得出现其他主导色。保留真实的金属划痕、橡胶传送带磨损、折叠贴纸边缘、行李箱压印纹理、细微胶片颗粒和克制的运动模糊。每个行李箱都贴有实体连接、方向正确且清晰可辨的白色行李标签,字体统一干净,其中包括清晰可读的文字“航班 208 • 登机口 C12 • 行李 019”,不得出现乱码或漂浮标签。以摄影写实主义呈现超现实尺度,融合成熟的 1970s–1980s 旅行广告美学、干涩的视觉幽默、受控高光、真实反射,以及连贯的手部、重复物体、阴影和透视;不要油腻过度渲染,不要 HDR 质感,不要过度微细节,不要塑料质感皮肤,不要浑浊色彩,不要无处不在的光晕,不要廉价的史诗氛围,不要黑暗的水下或太空废墟画面。电影感 28mm 广角镜头,低机位,焦平面清晰落在旅客的手和打开的行李箱周围,轻微模拟颗粒,高级编辑级色彩分离,宽幅横向 16:9 宽高比,边到边满版构图。

Generated with Nano Banana 2.1 Text-to-Image on Atlas Cloud

Generated with Seedream v5.0 Pro Text-to-Image on Atlas Cloud

Generated with Nano Banana 2 Text-to-Image on Atlas Cloud

Nano Banana 2.1 覆盖生产工作流

在产品、媒体和编辑工作流中,Nano Banana 2.1 可将提示词、图像或源视频转化为精致的静态图,支持多语言排版和可控编辑,并保持反复出现的主体一致。

Nano Banana 2.1 用于本地化营销活动

Nano Banana 2.1 可根据自然语言提示词,在精心制作的营销视觉中准确渲染多语言文本。无需手动重建每个构图,即可为全球受众创建本地化海报、发布宣传图和社交广告。

多参考图产品场景

最多组合 14 张参考图,同时保持最多 4 个角色和 10 个物体的一致性。产品团队可以利用现有视觉资产,组装目录场景、季节性变体和品牌化构图。

Nano Banana 2.1 角色世界

通过引导式编辑,在更换服装、场景或风格的同时,让最多 4 个角色保持清晰可辨。故事应用、游戏团队和系列化营销活动可在众多相关资产中维持统一的视觉角色阵容。

面向生产的精确编辑

标记某个区域并描述所需更改,即可进行聚焦编辑,同时保留周围内容。无需从头重建整张图像,即可修饰产品照片、替换独立物体或调整创意资产。

将视频帧转化为营销资产

结合一段源视频片段、可选参考图和提示词,生成新的静态图。面向创作者、出版商和媒体自动化工具,可规模化制作缩略图、宣传海报或摘要信息图。

基于事实的编辑图形

结合可选的 Google Search grounding 和精准文本渲染,创建由最新信息支持的时效性视觉内容。开发者可以为新闻编辑室、教育工作者或内容平台构建编辑图形、活动解读图和主题信息图。

Nano Banana 2.1 图像编辑对比

根据输出分辨率、参考图像数量上限和标准单张定价,对比 Nano Banana 2.1 与其他图像编辑模型。

模型最大输出分辨率最多参考图像数量标准基础价格
Nano Banana 2.1 Edit4K14起价 $0.05/张
Qwen Image 3.0 Edit2K3起价 $0.03/张
Grok Imagine Image 2.0 Edit2K3起价 $0.04/张

如何在 Atlas Cloud 上使用 Nano Banana 2.1

几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。

创建 Atlas Cloud 账户

在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。

为何在 Atlas Cloud 使用 Nano Banana 2.1

将先进的 Nano Banana 2.1 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。

性能与灵活性

低延迟:
GPU 优化推理,实现实时响应。

统一 API:
一次集成,畅用 Nano Banana 2.1、GPT、Gemini 和 DeepSeek。

透明定价:
按 Token 计费,支持 Serverless 模式。

企业与规模

开发者体验:
SDK、数据分析、微调工具和模板一应俱全。

可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。

安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。

Nano Banana 2.1 API 常见问题

Nano Banana 2.1 是 Google 基于 Gemini 3.6 Flash 构建的图像生成与对话式编辑模型。Atlas Cloud 提供六个 endpoint,涵盖 text-to-image、图像编辑和 reference-to-image 工作流。

通过文本提示词创建 1K 至 4K 分辨率的构图图像,包括需要多语言文本的设计。现有图像可以在保留最多四个角色和十个对象的同时进行编辑、重绘风格或合并。另有一种独立工作流,可将源视频片段、可选参考图像和提示词转换为静态图像。

选择与您的 text-to-image、编辑或 reference-to-image 工作流匹配的 endpoint。通过 Atlas Cloud 的 OpenAI-compatible API,使用列出的 model ID 发送所需的提示词和媒体输入。添加可选控制项前,请先查看 endpoint schema。

如果从文字提示词开始,请使用 text-to-image;如果要转换、重绘风格或合并现有图像,请使用 edit。当需要使用视频片段引导新静态图像的构图时,请选择 reference-to-image。每种工作流都提供 Developer 和标准 endpoint 变体。

对于 text-to-image 请求,模型支持 1K 至 4K 输出、可调节的 thinking、多语言文本渲染以及可选的 Google Search grounding。编辑功能支持 1 至 14 张图像,并支持基于 mask 的区域修改。Reference-to-image 以一个源视频片段开始,也可以使用参考图像。

Atlas Cloud 列出的六个可用 endpoint 的标准基础价格均为每次调用 $0.05。该价格适用于两种列出的变体中的 text-to-image、edit 和 reference-to-image 工作流。

Google 表示,与 Nano Banana 2 相比,Nano Banana 2.1 在视觉质量、提示词遵循度、多语言文本渲染以及多次编辑中的一致性方面均有所提升。Nano Banana 2.1 定位为 Nano Banana Pro 的高效版本,将 Pro 级图像能力与 Flash 级速度相结合。在替换现有成熟工作流前,请先使用具有代表性的生产提示词进行测试。

如果某项指令被忽略,请将关键要求放在最前面,对任何精确文本使用引号,并明确说明哪些元素必须保持不变。进行编辑时,一次只处理一个主要变更,并清楚标明目标区域。发布结果前,请检查文本、人物身份以及未修改区域。

不能,现有 endpoint 返回的是静态图像,而不是视频。Reference-to-image 工作流使用一个源视频片段作为上下文,用于创建缩略图、海报、摘要信息图或其他静态构图。

探索更多系列

Seedance 2.5

Seedance 2.5 API 现已在 Atlas Cloud 上线!它为开发者提供了 ByteDance 最新的视频模型。该模型可通过文本、单张图像或多达 50 个多模态参考,一次性生成长达 30 秒的原生视频,并包含同步音频和画面内的多语言文本。在 Atlas Cloud 上,您可以通过单个密钥访问它,其主体一致性和改进的物理特性能够保持长镜头的连贯性。

查看系列

Wan 3.0

Wan 3.0 API 是阿里巴巴 Wan 视频系列的下一代产品,旨在将长视频生成、多参考控制和音视频质量推向新的高度。Atlas Cloud 已经托管了 Wan 2.7、2.6 和 2.5,而 Wan 3.0 使用相同的统一密钥运行,无需额外设置。立即开始构建吧。向下滚动至展示区,查看 Wan 3.0 的创作能力。

查看系列

MiniMax H3

MiniMax H3 是 MiniMax 的多模态视频系列,支持文本、图像和参考内容引导创作。在支持的路由中,它能够保留参考媒体中的主体,提供灵活的宽高比,并通过 H3 Developer 将生成的声音与画面结合;输出配置则由 endpoint 选择。Atlas Cloud 通过一个 OpenAI 兼容密钥统一接入整个系列,并提供透明的按量付费定价,标准费率为每秒 $0.038。立即开始构建。

查看系列

Seedream 5.0 Pro

Seedream 5.0 Pro API 为开发者在 Atlas Cloud 上提供了字节跳动的可控图像编辑模型。它通过锚点和坐标精确定位编辑,将图像分离为可编辑图层,融合多个参考,并精准匹配颜色和材质,支持 2K 和 3K 分辨率的多语言文本。在 Atlas Cloud 上,您只需一个密钥即可访问!

查看系列

Seedance 2.0

Seedance 2.0 是 ByteDance 面向生产环境的视频模型,专用于精准镜头创作。将提示词转换为视频,使用首帧图像生成动画并可选用尾帧引导,或结合参考媒体和可选的联网搜索来塑造结果。Atlas Cloud 将这些工作流整合到统一的 API 中,提供透明的按量付费定价和一个兼容 OpenAI 的密钥。立即开始构建。

查看系列

GPT Image 2.5

OpenAI 的 gpt-image-2.5 系列为开发者提供 Flare 和 Sunburst 两种选择,满足生产级图像工作流需求。支持最高 3840x2160 的任意分辨率渲染,并提供包括 xhigh 和 max 在内的五档质量等级,以匹配特定的输出要求。Atlas Cloud 提供开箱即用的 REST 推理服务,无冷启动,每次生成起价 $0.004,采用标准定价。立即开始构建。

查看系列

GPT Image 2

GPT Image 2 API 为开发者提供了访问 OpenAI 最新图像模型的途径,它是 GPT Image 1.5 的继任者。该模型可生成和编辑图像,能够在拉丁和 CJK 文字上实现准确的文本渲染,并在海报、样机和信息图表方面具备强大的排版能力。在 Atlas Cloud 上,您可以通过一个统一的 API 与 300 多个模型一起访问它,并享受免费额度、99.99% 的正常运行时间,且无需 OpenAI 组织验证。

查看系列

Gemini Omni Flash

gemini omni API 将 Google DeepMind 原生多模态的 Gemini Omni Flash 系列(包括 Gemini Omni 1.1 Flash)带给开发者。创建带同步原生音频的电影级视频,使用精确的起始帧和结束帧控制为静态图像制作动画,或通过文本引导式编辑修改现有视频,同时保留未编辑的内容。Atlas Cloud 提供一个 OpenAI 兼容密钥、统一访问能力以及透明的按量付费定价。立即开始构建。

查看系列

Grok Imagine

Grok Imagine API 涵盖 xAI 的图像、视频和语音模型,包括 Image 2.0、Video 1.5 和 xAI TTS v1。支持生成跨 14 种宽高比的 1K 或 2K 静帧、生成最长 15 秒的 1080p 视频、通过最多 7 张参考图像引导镜头、或用 20 种语言进行配音。Atlas Cloud 在单一端点上运行所有功能,采用按量计费,起价为每张图像 $0.02、每秒 $0.05。立即开始使用。

查看系列

Google

Google最强大的创意模型现已在Atlas Cloud上全面可用。Veo 3.1提供电影级别的视频生成,Nano Banana 2支持高保真图像创建,而Gemini为每个工作流带来多模态智能。通过单一API key即可访问完整的Google模型套件,提供Day-0可用性和按需付费(pay-as-you-go)定价。

查看系列

Seedance 2.0 Mini

Seedance 2.0 Mini 将 ByteDance 的多模态视频生成技术引入到对速度和成本要求极高的工作流中。它以更轻量的占用空间提供 Seedance 2.0 的核心能力——更快的生成速度、更低的单条视频成本,并且使用您现有的同款 API 集成。对于运行高吞吐量流水线或进行大规模原型设计的团队来说,Mini 是最实用的默认选择。

查看系列

ByteDance

从电影级视频生成到高保真图像创建,ByteDance 最强大的模型现已在 Atlas Cloud 上线。以最低的推理定价和零基础设施开销,大规模运行 Seedance 和 Seedream。

查看系列

一个 API,畅享全模态 AI。

探索全部模型