Seedance 2.5 現已上線 — 首發於 Atlas Cloud

我們對 GPT Image 2 與 Grok Imagine 下達相同的 6 個提示詞。以下是確切回傳的結果。

XAI Grok Imagine 與 GPT Image 2 在解剖學、中文文字、局部編輯及多重參考融合上進行基準測試。單一種子,無挑選結果。兩者皆透過 Atlas Cloud。

我們對 GPT Image 2 與 Grok Imagine 下達相同的 6 個提示詞。以下是確切回傳的結果。

我們用六個相同的、模型中立的提示詞,對 Grok Imagine Image 和 GPT Image-2 模型進行了測試,涵蓋了組合語義、逼真解剖學、多語言文字渲染、幾何變換、局部編輯和多參考融合。

兩個模型 Grok Imagine ImageGPT Image-2 均可透過單一 Atlas Cloud API 金鑰使用,因此這項基準測試可以在幾分鐘內重現。

為什麼要進行這次 AI 圖像模型比較基準測試

你在網路上找到的每個「AI 圖像模型比較」都落入了同樣的陷阱:精心挑選的提示詞、從五張輸出中選出最佳的一張,以及未經測試的宣稱。這項基準測試是基於 Tier A 原則建立的:模型中立的提示詞、所有模型使用相同的輸入、單一隨機種子預設輸出(無挑選)、以及每個類別可用一句話說明的評分標準。

完整基準測試中的六個模型包括:Grok、GPT Image 2、Nano Banana 2、Nano Banana Pro、Wan 2.7 和 Seedream 5.0。本文聚焦於 Grok 與 GPT Image 2 的正面對決,因為這是開發者在選擇預設圖像模型時最有商業關聯性的組合。

我們如何測試 Grok Imagine Image 對比 GPT-Image 2:6 個類別,一個 Tier A 規則

每個提示詞針對單一、明確的能力維度。通過/未通過的標準是在執行模型之前定義的,而不是在看到輸出之後。

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

類別測試的主要維度一句話通過/未通過
類別 1 · 組合語義指令遵循能力模型是否數出 7 個物體、正確放置它們,並遵守否定列表?
類別 2 · 逼真解剖學與光線視覺品質與物理五根手指是否解剖學正確,以及臉上是否出現焦散光圖案?
類別 3 · 多語言海報圖內文字渲染中文和英文字元是否正確渲染,無缺失筆畫或幻覺字形?
類別 4 · 幾何變換(I2I)編輯可控性 + 身份旋轉 45° 後,是否仍可辨識為同一人,且所有衣物細節完整?
類別 5 · 局部編輯與區域保留編輯精確度是否恰好進行了 3 處編輯,且其他所有內容在像素層級保持不變?
類別 6 · 多參考融合跨圖像一致性來自三個獨立參考的身份、風格和場景是否融合成單一連貫的圖像?

想讓 GPT Image 2 和 Grok Imagine 在同一個提示詞上相互較量嗎?Atlas Cloud 的模型比較 可以一次並排運行它們——相同的提示詞,生成前顯示價格——這樣你就可以逐幀判斷。

GPT Image 2 和 Grok Imagine 在 Atlas Cloud 模型比較中使用相同提示詞——生成前顯示價格。從 model-explorer 即時擷取

GPT Image 2 和 Grok Imagine 在 Atlas Cloud 模型比較中使用相同提示詞——生成前顯示價格。從 model-explorer 即時擷取。

類別 1 · 組合語義(T2I)

提示詞

一張俯視平鋪照片,拍攝一張木製餐桌,桌上恰好包含七件陶瓷物品:三隻相同的白色茶杯,在桌面中央排列成等邊三角形;兩隻黑色碗,放在茶杯的右側;一顆紅蘋果,放在最左邊的黑碗內;一把空的木勺,放在最右邊的黑碗上,勺柄朝向畫面的左上角。沒有咖啡杯、沒有金屬物品、沒有盤子、沒有玻璃器皿。柔和漫射的窗光從左上角射入,時間為上午。寫實攝影,無造型道具。

這是一個刻意設計的對抗性測試。計數、空間語言(「在……右側」、「最左邊」)和否定條款是所有當前擴散模型架構已知的失敗模式。

評分檢查表

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#標準檢查
1物體總數嚴格 7 件陶瓷物品
2三隻白色茶杯等邊三角形排列
3兩隻黑色碗置於茶杯右側
4紅蘋果在最左邊的黑碗內
5木勺放在最右邊的碗上,柄朝左上角
6否定指令遵守無咖啡杯 / 無金屬 / 無盤子 / 無玻璃器皿
7光源從左上角柔和漫射光,所有陰影一致
8攝影風格無造型陳腔濫調(棕櫚葉、蠟燭等)

1.PNG Grok Imagine Image

2.PNG GPT-Image 2

要求生成一張俯視平鋪照片,畫面中嚴格包含七件陶瓷器皿,並有明確的空間關係:三隻白色茶杯呈等邊三角形排列居中,兩隻黑碗在茶杯右側,一顆紅蘋果放在最左邊的黑碗裡,一把木勺搭在最右邊的黑碗上且柄朝左上方。否定指令:不得出現咖啡杯、金屬器具、盤子、玻璃器皿。

Grok Imagine 的物體計數:明顯可見 5 個茶杯(而非 3 個),排列成簇狀而非等邊三角形。兩隻黑碗存在,紅蘋果正確放在其中一個碗內。木勺存在並放在最右邊的碗上,手柄方向大致朝左上——此標準通過。否定指令遵守良好:無咖啡杯、無金屬、無盤子、無玻璃器皿。光源來自左上角,陰影一致,通過。無造型道具。

GPT Image 2 在空間組件上展現了更強的指令遵循能力,儘管兩個模型都未能同時滿足所有放置約束條件,達到完美的 7 物體計數。

類別 2 · 逼真解剖學與光線(T2I)

提示詞

一位三十出頭的東亞女性的特寫肖像,右手握著一個半滿的紅酒水晶酒杯,所有五根手指和拇指完全可見,自然地環繞著杯柄並部分包住杯身。她坐在一扇朝西的高窗旁,正值黃金時刻。午後的陽光穿過葡萄酒,在她左側顴骨和下頜線上投射出溫暖的深紅色焦散圖案。她的左手放在膝上的一本精裝書上。雙眼中可看到窗戶的反射光。皮膚顯示超細緻的毛孔、細小的絨毛,耳垂和鼻樑上有次表面散射。頭髮背光,帶有邊緣光。85mm 鏡頭,f/2.0,淺景深,攝影寫實。

這歷來是生成模型最難的單圖測試。

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#標準檢查
1手部解剖學所有 5 根手指 + 拇指,自然握持杯柄和杯身
2焦散光從葡萄酒投射到顴骨上的溫暖深紅色圖案
3反射光一致性雙眼中反射光的位置和形狀相同
4次表面散射 SSS背光時在耳垂和鼻樑上可見
5邊緣光物理方向與光源位置匹配
6皮膚真實感無「AI 塑膠感」過度平滑;可見毛孔和絨毛

3.PNG Grok Imagine Image

4.PNG GPT-Image 2

Grok Imagine 在其主打優勢上表現出色。手部解剖學正確——手指數量準確,圍繞杯柄和杯身的握持姿勢自然,手腕角度物理上合理。僅此一點就超越了許多模型直接失敗的門檻。皮膚紋理顯示出真實的毛孔級細節,可見細小絨毛且無塑膠過度平滑,鼻樑和顴骨上的次表面散射產生了溫暖、透光的品質,讀起來像攝影真實。頭髮上的邊緣光與窗戶光源方向一致。

焦散光投影是 Grok 最弱的環節。深紅色光圖案出現在臉上,但呈現為過大、戲劇化風格的紅色疊加——更像是色彩分級效果,而非陽光穿過葡萄酒後物理上產生的精細、柔和邊緣的光絲。焦散的物理合理性未能達到精確標準。

GPT Image 2 則反轉了這種取捨。其焦散光渲染明顯更物理準確——顴骨上的溫暖深紅色圖案更小、更擴散,且遵循光線以正確角度穿過酒杯的空間幾何。這是 Grok 遺漏的細節。然而,GPT Image 2 在其他方面付出了代價:手部解剖學略欠自然,手指圍繞杯柄的角度顯示出輕微僵硬。皮膚紋理傾向於 AI 肖像中常見的更平滑、稍顯平坦的品質,與 Grok 相比,SSS 溫暖感和邊緣光強度較弱。

類別 3 · 多語言海報(T2I)

提示詞

一張復古 1960 年代風格的海報,為一個虛構的電影節設計,採用世紀中葉商業設計風格。海報頂部,大型粗體襯線中文字元「時光電影節」(第一行),下方較小的中文字元「第七屆 · 上海 · 1965年5月」(第二行)。

中央:一個風格化的老式電影放映機插圖,將光束投射到略微彎曲的電影螢幕上。

中下部:一個高腳香檳杯,英文文字「GRAND OPENING NIGHT」沿著杯身的曲線環繞,遵循橢圓透視。

右邊緣,垂直文字「presented by 時代影業 · TIMES PICTURES」從上到下書寫。

底部條:小型英文致謝文字「music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU」在一行內。

色調:奶油色米白背景,深紅色,芥末黃點綴。輕微的舊紙質感,細微顆粒。

評分檢查表

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#標準檢查
1中文準確度無缺失筆畫,無幻覺字元
2雙語佈局中文和英文不混合;各自出現在正確區域
3杯上彎曲文字英文遵循香檳杯的橢圓透視
4右邊緣垂直文字從上到下清晰可讀
5字體層次標題與副標題之間有明顯區分
6風格與可讀性維持 1960 年代美學,不犧牲文字清晰度

5.png Grok Imagine Image

6.png GPT-Image 2

Grok Imagine 產生了視覺上引人注目的海報,具有強烈的世紀中葉插圖風格。然而它在最關鍵的文字標準上失敗了:標題用的是繁體中文「時光電影節」,而非提示詞指定的簡體中文「时光电影节」。這是字元集合規失敗——對於任何本地化或出版用途來說這是一個有意義的區別。第二行「第七屆 · 上海 · 1965年5月」同樣使用了繁體字。在結構方面,「GRAND OPENING NIGHT」出現在香檳杯上,部分跟隨曲線,但橢圓透視的遵守是近似的。右邊緣垂直文字「TIMES PICTURES」可讀。底部致謝行存在且可讀。色調——深紅、芥末黃、奶油色——執行良好。整體佈局能量高,但繁體 vs 簡體的失敗是針對陳述提示詞的硬性不合格。

GPT Image 2 乾淨地通過了字元集測試:標題「时光电影节」和副標題「第七届 · 上海 · 1965年5月」以簡體中文正確渲染,無缺失筆畫或幻覺字形——這是一個直接超越 Grok 的合規勝利。香檳杯在中下部可見,「GRAND OPENING NIGHT」令人信服地跟隨杯身曲線。右邊緣垂直文字「時代影業 · TIMES PICTURES」從上到下書寫且完全可讀,中文和英文正確放置在相同垂直欄位中,無混合錯誤。底部致謝行「music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU」存在且可讀為一行。標題、副標題和腳註之間的字體層次清晰維持。舊紙質感和世紀中葉色調實現良好。構圖整合了可識別的上海天際線輪廓作為中央插圖,這雖未在提示詞中指定,但增加了背景真實性而不違反任何標準。

類別 4 · 幾何變換(I2I)

提示詞指示模型將全身時尚造型目錄中的主體向左旋轉恰好 45°,保持相同攝影機位置。參考圖像展示了一套複雜的層疊服裝:長棕色大衣、皮革肩披、毛皮披肩(帶有明顯的漸變色:深棕色 → 銀色 → 奶油色)、圓形銅質胸章內嵌肖像、黑色皮革護腕,以及雙色皮革靴。這些細節均未在提示詞中列出——模型必須僅透過身份理解來保留它們。

7.png

這是一個刻意的能力壓力測試。指令故意簡短,以避免將評估標準餵給模型。

評分檢查表

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#標準檢查
1面部身份ArcFace 相似度 ≥ 0.5(對全身尺度放寬)
2毛皮披肩露出之前隱藏的右側銀色部分顯現
3胸章圓形銅色輪廓 + 內嵌肖像 + 正確的透視橢圓壓縮
4大衣下擺與內層旋轉後自然垂墜方向;內褲暴露比例合理
5腳部姿勢左腳在前
6護腕體積旋轉後手部位置 + 針織紋理可見
7靴子顏色邊界棕色
8背景一致性純灰色工作室背景(DINO 區域 ≥ 0.95)
9輸出比例維持完整 9:16 全身畫面,未裁切為肖像
10視線方向跟隨旋轉——不再面向鏡頭

8.png Grok Imagine Image

9.jpg GPT-Image 2

Grok 保持了面部身份,高於適合全身圖像的 ArcFace 0.5 閾值。毛皮披肩之前隱藏的右側部分在 45° 時部分可見,漸變連續性合理。胸章輪廓得以保留,但內嵌肖像細節顯示壓縮。靴子顏色邊界和護腕紋理保持。

GPT Image 2 在整體服裝層次一致性上略強,但引入了更多面部身份漂移——這取決於使用案例,是一個有意義的取捨。

類別 5 · 局部編輯與區域保留(I2I)

提示詞要求對一個客廳場景進行恰好三處編輯:移除沙發上的睡覺貓咪(並自然恢復坐墊)、將一杯熱茶替換為加冰的柳橙汁、以及在咖啡桌中間那本書的頂部加上一副折疊的黑色框閱讀眼鏡。指令明確禁止更改其他任何東西——沙發面料圖案、書本位置、檯燈、窗外景色、牆壁顏色、地板。

10.png

保留測試與編輯測試同樣重要。那些在進行局部更改時重新詮釋整個場景的模型,不適用於產品攝影修圖或迭代場景開發。

評分檢查表

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#標準檢查
1完成所有 3 處編輯移除貓咪
2坐墊恢復沙發上無貓形凹痕或毛髮殘留
3柳橙汁物理玻璃幾何、冰塊折射和陰影方向與原始杯子的光線匹配
4眼鏡放置正確放在中間的書上(非頂部或底部)
5沙發面料菱形編織圖案完整,尤其在編輯區域
6書本不變位置、封面(紅色等)
7檯燈不變形狀、發光狀態和位置保持不變
8窗外景色不變城市景觀保持模糊且一致
9牆壁與地板不變米白色牆壁和淺色木地板不變
10整體光線保留單一後右方光源方向不變

11.png Grok Imagine Image

12.png GPT-Image 2

Grok Imagine 完成了所有三處要求的編輯。貓咪被移除,沙發坐墊乾淨恢復,無可見凹痕或毛髮殘留——編輯區域的面料圖案保持良好。柳橙汁杯出現在正確位置。然而,柳橙汁杯顯示的高光圖案與此光源方向不一致,看起來像是用獨立光模型合成的,而非融入場景現有照明。杯底與深色木咖啡桌表面之間也缺乏足夠的接觸陰影,產生了細微但可察覺的懸浮效果。

GPT Image 2 也完成了所有三處編輯,並展現了更強的整體場景保留能力。貓咪移除同樣乾淨。柳橙汁杯渲染良好,定位正確,陰影方向與右側窗戶光源匹配——玻璃幾何和液體不透明度讀起來比 Grok 的版本更精緻。閱讀眼鏡明顯放置在書堆上。關鍵的是,窗外景色得以保留——外面的城市仍然可見且模糊,與參考圖一致,而這是 Grok 失敗的地方。沙發面料、檯燈、牆壁和地板都保持不變。書本在位置和顏色上似乎一致。一個值得注意的變化:整體場景看起來比原始圖稍亮,對比度有所偏移,表明存在一些全域照明重新詮釋,而非真正的像素級保留——這是一個微小但可察覺的漂移。

類別 6 · 多參考融合(I2I)

提示詞結合了三個獨立參考:一個肖像身份(拉丁裔女性,琥珀色眼睛,深棕色波浪頭髮)、一個水彩插畫風格(日本鄉村景觀,可見筆觸,溫暖童話氛圍)、以及一個場景佈局(日落時分的歐洲鵝卵石鎮廣場,鑄鐵路燈柱,石拱門)。任務:生成一幅單一連貫的水彩畫,描繪所述人物站在場景中——不是帶濾鏡的照片,也不是拼貼畫。

13.png

14.png

15.png

三參考解耦是這項基準測試中最難的測試。大多數模型要麼過度加權一個參考,要麼無法實現風格貫穿渲染。

評分檢查表

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#標準檢查
1三方解耦身份、風格、場景各自可辨識
2完整風格轉換輸出整體為水彩——非照片+濾鏡
3風格化後的身份保留琥珀色眼睛 + 面部結構經水彩處理後仍可識別
4場景結構保留鵝卵石、路燈柱、拱門佈局完整
5自然衣物添加旅行外套和斜挎包添加不破壞構圖
6光線方向一致性攝影機左側的日落餘暉在鵝卵石和人物身上可見

16.png Grok Imagine Image

17.png GPT-Image 2

Grok Imagine 未能通過核心標準:輸出是照片寫實風格,而非水彩。鵝卵石廣場和人物保留了完整的攝影清晰度,僅有輕微的繪畫性紋理處理——參考 2 的標誌性筆觸、顏色暈染或手繪邊緣品質均未出現。場景結構、身份、衣物和光線方向均通過。但完全以錯誤的媒介渲染是類別級別的不合格,而非部分扣分。

GPT Image 2 在整個畫面中實現了真正的水彩渲染——建築物、鵝卵石、天空和人物都帶有可見的筆觸和柔和顏色暈染,與參考 2 一致。參考 3 的場景結構完整,路燈柱發光,石拱門在中景可見。身份在風格轉換後部分保留——波浪深色頭髮和面部結構可識別,儘管精細特徵按預期被抽象化。外套、斜挎包、光線方向和視線均遵循提示詞。這是唯一完成實際任務的輸出。

透過 Atlas Cloud 試用 Grok Imagine Image 和 GPT Image 2 模型

這項基準測試是可以重現的。Grok ImagineGPT Image 2 現已透過 Atlas Cloud 提供——無需按模型計費設定,無需等待清單。

為什麼選擇 Atlas Cloud

  • 一個 API 金鑰,300+ 模型。 只需更改一個模型欄位,即可在 Grok、GPT Image 2、Flux、Wan、Seedream 以及池中的每個其他模型之間切換。無論你是運行六模型基準測試還是構建生產級圖像管道,都使用相同的金鑰、相同的端點、相同的帳單儀表板。
  • 全模態覆蓋。 大語言模型、文字轉圖像、圖像轉圖像、文字轉影片、圖像轉影片——全部整合在同一平台。如果你的工作流程需要語言模型進行提示詞優化,以及圖像模型進行生成,兩者都在同一個 API 中。
  • 無冷啟動,無速率限制意外。 Atlas Cloud 運行在專為吞吐量優化的推論基礎設施上。無論你進行一次調用還是一千次調用,都能獲得一致的延遲。
  • 專為比較工作流程打造。 這項基準測試所展示的確切用例——跨多個模型運行相同提示詞並比較輸出——正是 Atlas Cloud 架構的設計目的。一個金鑰,一張帳單,完整的模型廣度。

最新模型

一個 API,暢享全模態 AI。

探索全部模型