Seedance 2.5 đã chính thức ra mắt — Có mặt đầu tiên trên Atlas Cloud

Chúng tôi đã đưa cho GPT Image 2 và Grok Imagine cùng 6 prompt. Đây chính xác là những gì đã trả về.

XAI Grok Imagine so với GPT Image 2 được đánh giá trên giải phẫu học, văn bản tiếng Trung, chỉnh sửa cục bộ và kết hợp nhiều tham chiếu. Single-seed, không cherry-picking. Cả hai qua Atlas Cloud.

Chúng tôi đã đưa cho GPT Image 2 và Grok Imagine cùng 6 prompt. Đây chính xác là những gì đã trả về.

Chúng tôi đã chạy các mô hình Grok Imagine Image và GPT Image-2 qua 6 prompt giống hệt nhau, trung lập với mô hình, bao gồm ngữ nghĩa bố cục, giải phẫu chân thực, hiển thị văn bản đa ngôn ngữ, biến đổi hình học, chỉnh sửa cục bộ và kết hợp đa tham chiếu.

Cả hai mô hình Grok Imagine ImageGPT Image-2 đều có sẵn qua một khóa API Atlas Cloud duy nhất, giúp điểm chuẩn chính xác này có thể tái lập trong vài phút.

Tại Sao Điểm Chuẩn So Sánh Mô Hình Tạo Ảnh AI Này Tồn Tại

Mọi "so sánh mô hình tạo ảnh AI" bạn tìm thấy trên mạng đều rơi vào cùng một cái bẫy: prompt được chọn lọc, chọn đầu ra tốt nhất trong năm lần, và những tuyên bố chưa được kiểm chứng. Điểm chuẩn này được xây dựng dựa trên nguyên tắc Bậc A: prompt trung lập với mô hình, đầu vào giống hệt nhau cho tất cả các mô hình, đầu ra mặc định một seed duy nhất (không chọn lọc), và tiêu chí chấm điểm có thể được nêu trong một câu cho mỗi hạng mục.

Sáu mô hình trong điểm chuẩn đầy đủ: Grok, GPT Image 2, Nano Banana 2, Nano Banana Pro, Wan 2.7 và Seedream 5.0. Bài viết này tập trung vào so sánh trực tiếp Grok và GPT Image 2, vì đây là cặp đôi phù hợp nhất về mặt thương mại cho các nhà phát triển chọn mô hình tạo ảnh mặc định. 

Cách Chúng Tôi Kiểm Tra Grok Imagine Image VS GPT-Image 2: 6 Hạng Mục, Một Nguyên Tắc Bậc A

Mỗi prompt nhắm vào một khả năng duy nhất, được nêu rõ ràng. Tiêu chí đạt/không đạt được xác định trước khi chạy mô hình, chứ không phải sau khi xem đầu ra.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

Hạng mục Khía cạnh chính được kiểm tra Đạt/Không đạt trong một câu 
Hạng mục 1 · Ngữ nghĩa bố cụcĐộ chính xác làm theo hướng dẫnMô hình có đếm đúng 7 đối tượng, đặt chúng đúng vị trí và tuân theo danh sách phủ định không?
Hạng mục 2 · Giải phẫu chân thực & Ánh sángChất lượng hình ảnh & vật lýCả 5 ngón tay có đúng giải phẫu không, và các hoa văn ánh sáng khúc xạ có xuất hiện trên khuôn mặt không?
Hạng mục 3 · Poster đa ngôn ngữHiển thị văn bản trong ảnhCác ký tự tiếng Trung và tiếng Anh có được hiển thị chính xác, không thiếu nét hoặc ký tự ảo không?
Hạng mục 4 · Biến đổi hình học (I2I)Khả năng kiểm soát chỉnh sửa + nhận dạngSau khi xoay 45°, có còn nhận ra cùng một người với tất cả chi tiết quần áo còn nguyên vẹn không?
Hạng mục 5 · Chỉnh sửa cục bộ & Bảo toàn vùngĐộ chính xác chỉnh sửaCó đúng 3 chỉnh sửa được thực hiện, mọi thứ khác không thay đổi ở cấp độ pixel không?
Hạng mục 6 · Kết hợp đa tham chiếuTính nhất quán xuyên ảnhDanh tính, phong cách và bối cảnh từ 3 tham chiếu riêng biệt có kết hợp thành một hình ảnh duy nhất mạch lạc không?

Muốn tự mình đặt GPT Image 2 và Grok Imagine trên cùng một prompt? Công cụ so sánh mô hình của Atlas Cloud chạy chúng song song trong một lần — cùng một prompt, giá hiển thị trước khi bạn tạo — để bạn có thể đánh giá từng khung hình.

GPT Image 2 và Grok Imagine trên cùng một prompt trong công cụ so sánh mô hình của Atlas Cloud — cùng prompt, giá hiển thị trước khi bạn tạo. Chụp trực tiếp trên model-explorer

GPT Image 2 và Grok Imagine trên cùng một prompt trong công cụ so sánh mô hình của Atlas Cloud — cùng prompt, giá hiển thị trước khi bạn tạo. Chụp trực tiếp trên model-explorer.

Hạng mục 1 · Ngữ nghĩa bố cục (T2I)

Prompt

Ảnh chụp từ trên xuống (flat-lay) của một bàn ăn gỗ có chính xác bảy đồ gốm sứ: ba chiếc tách trà trắng giống hệt nhau xếp thành tam giác đều ở giữa, hai chiếc bát đen đặt bên phải các tách trà, một quả táo đỏ nằm bên trong chiếc bát đen bên trái nhất, và một chiếc thìa gỗ rỗng đặt trên chiếc bát đen bên phải nhất, tay cầm hướng về góc trên bên trái của khung hình. Không có cốc cà phê, không có đồ kim loại, không có đĩa, không có đồ thủy tinh. Ánh sáng cửa sổ khuếch tán dịu nhẹ từ phía trên bên trái, giữa buổi sáng. Nhiếp ảnh chân thực, không có đạo cụ tạo kiểu.

Đây là một bài kiểm tra mang tính thách thức có chủ đích. Đếm số lượng, ngôn ngữ không gian ("bên phải", "bên trái nhất") và mệnh đề phủ định là những điểm yếu đã biết của tất cả các kiến trúc khuếch tán hiện tại.

Danh sách chấm điểm

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#Tiêu chíKiểm tra 
1Tổng số đối tượngChính xác 7 đồ gốm sứ
2Ba tách trà trắngSắp xếp hình tam giác đều
3Hai bát đenĐặt bên phải các tách trà
4Táo đỏBên trong bát đen bên trái nhất
5Thìa gỗĐặt trên bát bên phải nhất, tay cầm hướng lên trên bên trái
6Tuân thủ phủ địnhKhông cốc cà phê / không kim loại / không đĩa / không thủy tinh
7Nguồn sángÁnh sáng khuếch tán dịu từ trên trái, tất cả bóng nhất quán
8Phong cách nhiếp ảnhKhông có yếu tố tạo kiểu sáo rỗng (lá cọ, nến, v.v.)

1.PNGGrok Imagine Image

2.PNGGPT-Image 2

Yêu cầu tạo ảnh chụp từ trên xuống, trong đó có chính xác bảy đồ gốm sứ với các mối quan hệ không gian rõ ràng: ba tách trà trắng xếp hình tam giác đều ở giữa, hai bát đen ở bên phải tách trà, một quả táo đỏ đặt trong bát đen bên trái nhất, một thìa gỗ đặt trên bát đen bên phải nhất, tay cầm hướng lên trên bên trái. Lệnh phủ định: không được có cốc cà phê, đồ kim loại, đĩa, đồ thủy tinh.

Grok Imagine đếm đối tượng: thấy rõ 5 tách trà (không phải 3), xếp thành cụm chứ không phải tam giác đều. Hai bát đen có mặt, quả táo đỏ nằm đúng bên trong một trong hai bát. Có thìa gỗ và đặt trên bát bên phải nhất, hướng tay cầm gần như lên trên bên trái — tiêu chí này đạt. Tuân thủ phủ định tốt: không có cốc cà phê, không kim loại, không đĩa, không thủy tinh. Nguồn sáng từ trên trái với bóng nhất quán đạt. Không có đạo cụ tạo kiểu.

GPT Image 2 thể hiện khả năng làm theo hướng dẫn mạnh mẽ hơn về các thành phần không gian, mặc dù không mô hình nào đạt được số lượng 7 đối tượng hoàn hảo với tất cả các ràng buộc về vị trí cùng lúc.

Hạng mục 2 · Giải phẫu chân thực & Ánh sáng (T2I)

Prompt

Chân dung cận cảnh của một phụ nữ Đông Á khoảng ba mươi tuổi, tay phải cầm một ly rượu vang đỏ pha lê còn một nửa, tất cả năm ngón tay và ngón cái hiện rõ, quấn tự nhiên quanh thân ly và một phần quanh bầu ly. Cô ấy ngồi cạnh một cửa sổ cao hướng Tây vào giờ vàng. Ánh nắng cuối buổi chiếu xuyên qua ly rượu tạo ra các hoa văn màu đỏ thẫm (caustic) trên xương gò má và xương hàm bên trái của cô. Tay trái cô đặt trên một cuốn sách bìa cứng đang mở trên đùi. Cả hai mắt đều có ánh phản chiếu từ cửa sổ. Da hiển thị lỗ chân lông siêu chi tiết, lông tơ mịn, tán xạ dưới bề mặt (SSS) trên dái tai và sống mũi. Tóc được chiếu sáng ngược với viền sáng. Ống kính 85mm, khẩu độ f/2.0, độ sâu trường ảnh nông, chân thực nhiếp ảnh.

Đây là bài kiểm tra hình ảnh đơn khó nhất trong lịch sử đối với các mô hình sinh.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#Tiêu chíKiểm tra
1Giải phẫu bàn tayCả 5 ngón tay + ngón cái, nắm tự nhiên vào thân và bầu ly
2Ánh sáng khúc xạ (caustic)Các hoa văn đỏ thẫm từ rượu chiếu lên xương gò má
3Nhất quán ánh phản chiếu (catchlight)Cùng vị trí và hình dạng trong cả hai mắt
4Tán xạ dưới bề mặt (SSS)Nhìn thấy trên dái tai và sống mũi khi chiếu ngược
5Vật lý ánh sáng viền (rim light)Hướng khớp với vị trí nguồn sáng
6Chân thực daKhông làm mịn quá mức kiểu "AI nhựa"; lỗ chân lông và lông tơ có thể thấy rõ

 

3.PNGGrok Imagine Image

4.PNGGPT-Image 2

Grok Imagine thể hiện ưu thế nổi bật. Giải phẫu bàn tay chính xác — số ngón tay đúng, tư thế nắm tự nhiên quanh cả thân và bầu ly, góc cổ tay hợp lý về mặt vật lý. Riêng điều này đã vượt qua một rào cản mà nhiều mô hình thất bại hoàn toàn. Kết cấu da cho thấy chi tiết lỗ chân lông thực sự với lông tơ mịn có thể thấy rõ, không bị làm mịn quá mức kiểu nhựa, và tán xạ dưới bề mặt trên sống mũi và xương gò má tạo ra chất lượng ấm áp, thấu quang, đọc được là ảnh thật. Ánh sáng viền trên tóc theo hướng cửa sổ một cách mạch lạc.

Ánh sáng khúc xạ (caustic) là điểm yếu nhất của Grok. Các hoa văn ánh sáng đỏ xuất hiện trên mặt, nhưng được thể hiện dưới dạng một lớp phủ đỏ quá khổ, cách điệu mạnh — giống hiệu ứng chỉnh màu hơn là các sợi ánh sáng mềm, cạnh mịn thực sự do ánh sáng mặt trời xuyên qua rượu tạo ra. Tính hợp lý vật lý của caustic không đạt tiêu chuẩn chính xác.

GPT Image 2 đảo ngược sự đánh đổi. Ánh sáng khúc xạ của nó chính xác hơn đáng kể về mặt vật lý — các hoa văn đỏ thẫm trên xương gò má nhỏ hơn, khuếch tán hơn và theo đúng hình học không gian của ánh sáng xuyên qua ly rượu ở góc chính xác. Đây là chi tiết Grok đã bỏ lỡ. Tuy nhiên, GPT Image 2 phải trả giá cho điều này ở nơi khác: giải phẫu bàn tay kém tự nhiên hơn một chút, với các góc ngón tay quanh thân ly hơi cứng. Kết cấu da nghiêng về chất lượng mịn hơn, hơi phẳng hơn thường thấy trong các chân dung AI, với độ ấm SSS ít thấy hơn và cường độ ánh sáng viền yếu hơn so với Grok.

Hạng mục 3 · Poster đa ngôn ngữ (T2I)

Prompt

Một poster du lịch phong cách những năm 1960 của một liên hoan phim giả tưởng, được minh họa theo phong cách thiết kế thương mại giữa thế kỷ. Phía trên poster, chữ Trung Quốc lớn, in đậm có serif "时光电影节" (dòng 1), và bên dưới là chữ Trung Quốc nhỏ hơn "第七届 · 上海 · 1965年5月" (dòng 2). 

Trung tâm: một hình minh họa cách điệu của một máy chiếu phim cũ đang chiếu một chùm sáng lên một màn hình chiếu phim hơi cong.

Dưới trung tâm: một ly champagne coupe cao với dòng chữ tiếng Anh "GRAND OPENING NIGHT" uốn cong theo độ cong của bầu ly, tuân theo phối cảnh hình elip.

Cạnh phải, chữ dọc "presented by 时代影业 · TIMES PICTURES" chạy từ trên xuống dưới.

Dải dưới cùng: dòng chữ tín dụng nhỏ bằng tiếng Anh "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" trong một dòng duy nhất.

Bảng màu: nền kem trắng ngà, đỏ thẫm đậm, điểm nhấn màu vàng mù tạt. Kết cấu giấy cũ nhẹ, hạt mịn.

Danh sách chấm điểm

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#Tiêu chíKiểm tra
1Độ chính xác tiếng TrungKhông thiếu nét, không có ký tự ảo trong
2Bố cục song ngữTiếng Trung và tiếng Anh không lẫn lộn; mỗi thứ xuất hiện đúng vùng
3Chữ cong trên lyTiếng Anh theo phối cảnh hình elip của ly champagne coupe
4Chữ dọc cạnh phảiCó thể đọc được từ trên xuống dưới
5Phân cấp kiểu chữPhân biệt rõ ràng giữa tiêu đề chính
6Phong cách vs. dễ đọcDuy trì thẩm mỹ những năm 1960 mà không hy sinh độ rõ của văn bản

5.pngGrok Imagine Image

6.pngGPT-Image 2

Grok Imagine tạo ra một poster ấn tượng về mặt thị giác với năng lượng minh họa giữa thế kỷ mạnh mẽ. Tuy nhiên, nó thất bại ở tiêu chí văn bản quan trọng nhất: tiêu đề đọc là "時光電影節" bằng chữ Phồn thể, không phải chữ Giản thể "时光电影节" như được chỉ định trong prompt. Đây là một lỗi tuân thủ bộ ký tự — một sự khác biệt có ý nghĩa đối với bất kỳ trường hợp sử dụng bản địa hóa hoặc xuất bản nào. Dòng thứ hai "第七屆 · 上海 · 1965年5月" cũng sử dụng chữ Phồn thể. Về mặt cấu trúc, "GRAND OPENING NIGHT" xuất hiện trên ly champagne với một phần đường cong theo, mặc dù việc tuân theo phối cảnh hình elip chỉ là gần đúng. Chữ dọc cạnh phải "TIMES PICTURES" có thể đọc được. Dòng tín dụng phía dưới có mặt và có thể đọc được. Bảng màu — đỏ thẫm, mù tạt, kem — được thực hiện tốt. Bố cục tổng thể có năng lượng cao, nhưng lỗi Phồn thể so với Giản thể là một yếu tố loại trừ cứng đối với prompt đã nêu.

GPT Image 2 vượt qua bài kiểm tra bộ ký tự một cách sạch sẽ: tiêu đề "时光电影节" và phụ đề "第七届 · 上海 · 1965年5月" được hiển thị chính xác bằng chữ Giản thể không thiếu nét hoặc ký tự ảo — một chiến thắng tuân thủ trực tiếp so với Grok. Ly champagne coupe có thể nhìn thấy ở vị trí dưới trung tâm với dòng chữ "GRAND OPENING NIGHT" theo độ cong của ly một cách thuyết phục. Chữ dọc cạnh phải "时代影业 · TIMES PICTURES" chạy từ trên xuống dưới và hoàn toàn dễ đọc, với cả tiếng Trung và tiếng Anh được đặt chính xác trong cùng một cột dọc mà không có lỗi lẫn lộn. Dòng tín dụng phía dưới — "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" — có mặt và có thể đọc được dưới dạng một dòng. Phân cấp kiểu chữ giữa tiêu đề, phụ đề và chú thích cuối được duy trì rõ ràng. Kết cấu giấy cũ và bảng màu giữa thế kỷ được thể hiện tốt. Bố cục tích hợp một hình bóng đường chân trời Thượng Hải dễ nhận biết làm hình minh họa trung tâm, điều này không được chỉ định trong prompt nhưng bổ sung tính xác thực theo ngữ cảnh mà không vi phạm bất kỳ tiêu chí nào.

Hạng mục 4 · Biến đổi hình học (I2I)

Prompt yêu cầu mô hình xoay một người mẫu trong lookbook thời trang toàn thân chính xác 45° sang bên trái của người mẫu, giữ nguyên vị trí máy ảnh. Hình ảnh tham chiếu có một bộ trang phục nhiều lớp phức tạp: áo khoác dài màu nâu, áo choàng da đeo vai, khăn choàng lông với gradient có thể nhìn thấy (nâu đậm → bạc → kem), huy hiệu ngực bằng đồng tròn có chân dung khảm, găng tay da đen và giày boots hai tông màu da. Không có chi tiết nào trong số này được liệt kê trong prompt — mô hình phải bảo toàn chúng thông qua hiểu biết về danh tính.

7.png

Đây là một bài kiểm tra sức chịu đựng có chủ đích. Hướng dẫn được cố tình ngắn để tránh cung cấp cho mô hình tiêu chí đánh giá của chính nó.

Danh sách chấm điểm

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#Tiêu chíKiểm tra
1Danh tính khuôn mặtĐộ tương đồng ArcFace ≥ 0.5 (nới lỏng cho tỷ lệ toàn thân)
2Phần lộ ra của khăn choàng lôngPhần bạc bên phải trước đây bị ẩn
3Huy hiệu ngựcĐường viền đồng tròn + chân dung khảm + nén phối cảnh hình elip chính xác
4Gấu áo khoác & lớp bên trongHướng rủ tự nhiên sau khi xoay; tỷ lệ lộ quần bên trong hợp lý
5Tư thế chânChân trái phía trước
6Thể tích găng tayVị trí tay + kết cấu dệt kim có thể nhìn thấy sau khi xoay
7Ranh giới màu giày bootsMàu nâu
8Nhất quán nềnNền studio xám nguyên chất (vùng DINO ≥ 0.95)
9Tỷ lệ đầu raKhung hình toàn thân 9:16 được duy trì, không bị cắt thành chân dung
10Hướng nhìnTheo hướng xoay — không tiếp tục nhìn thẳng vào máy ảnh

8.pngGrok Imagine Image

9.jpgGPT-Image 2

Grok duy trì danh tính khuôn mặt trên ngưỡng ArcFace 0.5 phù hợp với ảnh toàn thân. Phần bên phải trước đây bị ẩn của khăn choàng lông trở nên có thể nhìn thấy một phần ở góc 45°, với độ liên tục gradient hợp lý. Đường viền huy hiệu ngực được bảo toàn, mặc dù chi tiết chân dung khảm bị nén. Ranh giới màu giày boots và kết cấu găng tay được giữ vững.

GPT Image 2 cho thấy sự liên kết lớp quần áo tổng thể mạnh hơn một chút, nhưng lại gây ra sự trôi dạt danh tính khuôn mặt nhiều hơn — một sự đánh đổi có ý nghĩa tùy thuộc vào trường hợp sử dụng.

Hạng mục 5 · Chỉnh sửa cục bộ & Bảo toàn vùng (I2I)

Prompt yêu cầu chính xác ba chỉnh sửa cho một cảnh phòng khách: loại bỏ một con mèo đang ngủ trên ghế sofa (và khôi phục đệm một cách tự nhiên), thay thế một tách trà nóng bằng một ly nước cam có đá, và thêm một cặp kính đọc sách gập khung đen lên trên cuốn sách ở giữa trên bàn cà phê. Hướng dẫn rõ ràng cấm thay đổi bất cứ thứ gì khác — hoa văn vải sofa, vị trí sách, đèn, khung cảnh cửa sổ, màu tường, sàn nhà.

10.png

Bài kiểm tra bảo toàn quan trọng ngang bằng bài kiểm tra chỉnh sửa. Các mô hình diễn giải lại toàn bộ cảnh trong khi thực hiện các thay đổi cục bộ là không thể sử dụng được cho việc chỉnh sửa ảnh sản phẩm hoặc phát triển cảnh lặp đi lặp lại.

Danh sách chấm điểm

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;} 

#Tiêu chíKiểm tra
1Cả 3 chỉnh sửa hoàn thànhMèo đã bị loại bỏ
2Khôi phục đệmKhông có vết lõm hình mèo hoặc lông trên ghế sofa
3Vật lý của nước camHình dạng ly, khúc xạ đá và hướng bóng khớp với ánh sáng của tách trà gốc
4Vị trí kínhChính xác trên cuốn sách ở giữa (không phải trên cùng hoặc dưới cùng)
5Vải sofaHoa văn dệt kim cương còn nguyên vẹn, đặc biệt ở vùng đã chỉnh sửa
6Sách không thay đổiVị trí, bìa (đỏ
7Đèn không thay đổiHình dạng, trạng thái phát sáng và vị trí được giữ nguyên
8Khung cảnh cửa sổ không thay đổiCảnh thành phố vẫn mờ và nhất quán
9Tường & sàn không thay đổiTường trắng ngà và sàn gỗ sáng không bị thay đổi
10Ánh sáng tổng thể được giữ nguyênHướng nguồn sáng phía sau bên phải không thay đổi

11.pngGrok Imagine Image

12.pngGPT-Image 2

Grok Imagine đã hoàn thành cả ba chỉnh sửa được yêu cầu. Con mèo bị loại bỏ và đệm sofa được khôi phục sạch sẽ, không có vết lõm hoặc lông có thể nhìn thấy — hoa văn vải trong vùng đã chỉnh sửa được giữ tốt. Ly nước cam xuất hiện đúng vị trí. Tuy nhiên, ly nước cam hiển thị một hoa văn sáng không khớp với hướng nguồn sáng này, trông như thể nó được ghép với một mô hình ánh sáng độc lập thay vì được tích hợp vào ánh sáng hiện có của cảnh. Phần đáy ly cũng cho thấy bóng tiếp xúc không đủ với mặt bàn cà phê gỗ tối, tạo ra hiệu ứng lơ lửng tinh tế nhưng có thể phát hiện được.

GPT Image 2 cũng hoàn thành cả ba chỉnh sửa và thể hiện khả năng bảo toàn cảnh tổng thể mạnh mẽ hơn. Việc loại bỏ mèo cũng sạch sẽ. Ly nước cam được thể hiện tốt với vị trí chính xác và hướng bóng khớp với nguồn sáng từ cửa sổ bên phải — hình dạng ly và độ trong suốt của chất lỏng trông tinh tế hơn phiên bản của Grok. Kính đọc sách được đặt rõ ràng trên chồng sách. Quan trọng nhất, khung cảnh cửa sổ được bảo toàn — thành phố bên ngoài vẫn hiện rõ và mờ, nhất quán với tham chiếu, đây là điểm Grok thất bại. Vải sofa, đèn, tường và sàn đều được giữ nguyên. Sách có vẻ nhất quán về vị trí và màu sắc. Một thay đổi đáng chú ý: tổng thể cảnh có vẻ sáng hơn một chút và tương phản hơn so với bản gốc, cho thấy một số diễn giải lại ánh sáng toàn cầu thay vì bảo toàn cấp độ pixel thực sự — một sự trôi dạt nhỏ nhưng có thể phát hiện được.

Hạng mục 6 · Kết hợp đa tham chiếu (I2I)

Prompt kết hợp ba tham chiếu độc lập: một danh tính chân dung (phụ nữ Latinh, mắt hổ phách, tóc xoăn nâu đậm), một phong cách minh họa màu nước (phong cảnh nông thôn Nhật Bản, nét cọ có thể nhìn thấy, bầu không khí cổ tích ấm áp) và một bố cục cảnh (quảng trường thành phố lát đá cuội châu Âu vào hoàng hôn, cột đèn gang, vòm đá). Nhiệm vụ: tạo ra một bức tranh màu nước mạch lạc duy nhất về người được xác định đang đứng trong cảnh — không phải ảnh với bộ lọc, không phải ảnh ghép.

13.png

14.png

15.png

Tách rời ba tham chiếu là bài kiểm tra khó nhất trong điểm chuẩn này. Hầu hết các mô hình hoặc là quá chú trọng vào một tham chiếu hoặc không đạt được kết xuất xuyên suốt phong cách.

Danh sách chấm điểm

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#Tiêu chíKiểm tra
1Tách rời ba chiềuDanh tính
2Chuyển giao phong cách đầy đủĐầu ra là màu nước xuyên suốt — không phải ảnh + bộ lọc
3Giữ lại danh tính sau chuyển giao phong cáchMắt hổ phách + cấu trúc khuôn mặt có thể nhận ra qua xử lý màu nước
4Cấu trúc cảnh được bảo toànBố cục đá cuội, cột đèn và vòm đá còn nguyên vẹn
5Thêm quần áo tự nhiênÁo khoác du lịch và túi đeo chéo được thêm vào mà không phá vỡ bố cục
6Nhất quán hướng ánh sángÁnh hoàng hôn từ bên trái máy ảnh có thể nhìn thấy trên đá cuội và hình người

16.pngGrok Imagine Image

17.pngGPT-Image 2

Grok Imagine thất bại ở tiêu chí cốt lõi: đầu ra là chân thực, không phải màu nước. Quảng trường đá cuội và hình người giữ nguyên độ sắc nét nhiếp ảnh đầy đủ chỉ với một lớp kết cấu hội họa nhẹ — không có nét cọ đặc trưng, sự chảy màu hoặc chất lượng cạnh vẽ tay của Tham chiếu 2. Cấu trúc cảnh, danh tính, quần áo và hướng ánh sáng đều đạt. Nhưng hiển thị sai phương tiện hoàn toàn là một sự loại trừ ở cấp độ hạng mục, chứ không phải là một khoản khấu trừ một phần.

GPT Image 2 đạt được kết xuất màu nước thực sự trên toàn bộ khung hình — các tòa nhà, đá cuội, bầu trời và hình người đều mang nét cọ có thể nhìn thấy và sự chảy màu mềm mại nhất quán với Tham chiếu 2. Cấu trúc cảnh từ Tham chiếu 3 còn nguyên vẹn, cột đèn được thắp sáng và vòm đá có thể nhìn thấy ở trung cảnh. Danh tính được giữ lại một phần qua quá trình chuyển đổi phong cách — tóc xoăn sẫm màu và cấu trúc khuôn mặt có thể nhận ra, mặc dù các đặc điểm tinh tế được trừu tượng hóa như mong đợi. Áo khoác, túi đeo chéo, hướng ánh sáng và hướng nhìn đều tuân theo prompt. Đây là đầu ra duy nhất hoàn thành nhiệm vụ thực tế.

Dùng thử Mô hình Grok Imagine Image và GPT Image 2 qua Atlas Cloud

Điểm chuẩn có thể tái lập. Cả Grok ImagineGPT Image 2 hiện đã có sẵn qua Atlas Cloud — không cần thiết lập thanh toán theo từng mô hình, không có danh sách chờ.

Tại sao chọn Atlas Cloud

  • Một khóa API, 300+ mô hình. Chuyển đổi giữa Grok, GPT Image 2, Flux, Wan, Seedream và mọi mô hình khác trong nhóm bằng cách thay đổi một trường mô hình duy nhất. Cùng một khóa, cùng một endpoint, cùng một bảng điều khiển thanh toán — cho dù bạn đang chạy điểm chuẩn sáu mô hình hay xây dựng một pipeline tạo ảnh sản xuất.
  • Phạm vi bao phủ đa phương thức toàn diện. LLM, văn bản thành hình ảnh, hình ảnh thành hình ảnh, văn bản thành video, hình ảnh thành video — tất cả dưới một mái nhà. Nếu quy trình làm việc của bạn cần một mô hình ngôn ngữ để tinh chỉnh prompt và một mô hình tạo ảnh để sinh, cả hai đều nằm trong cùng một API.
  • Không khởi động nguội, không bất ngờ về giới hạn tốc độ. Atlas Cloud chạy trên cơ sở hạ tầng suy luận được tối ưu hóa được xây dựng có mục đích cho thông lượng. Bạn có được độ trễ nhất quán cho dù bạn thực hiện một cuộc gọi hay một nghìn cuộc gọi.
  • Được xây dựng cho quy trình so sánh. Trường hợp sử dụng chính xác mà điểm chuẩn này chứng minh — chạy các prompt giống hệt nhau trên nhiều mô hình và so sánh đầu ra — là những gì kiến trúc của Atlas Cloud được thiết kế để thực hiện. Một khóa, một hóa đơn, toàn bộ bề rộng mô hình.

Mô hình mới nhất

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình