เราได้นำโมเดล Grok Imagine Image และ GPT Image-2 มาทดสอบด้วยพรอมต์ที่เหมือนกัน 6 ข้อ ซึ่งครอบคลุมด้านความหมายเชิงองค์ประกอบ (compositional semantics) กายวิภาคเสมือนจริง (photorealistic anatomy) การเรนเดอร์ข้อความหลายภาษา (multilingual text rendering) การแปลงทางเรขาคณิต (geometric transformation) การแก้ไขเฉพาะจุด (local editing) และการผสานข้อมูลอ้างอิงหลายแหล่ง (multi-reference fusion)
ทั้งโมเดล Grok Imagine Image และ GPT Image-2 ใช้งานได้ผ่านคีย์ API เดียวของ Atlas Cloud ทำให้การทดสอบมาตรฐานนี้สามารถทำซ้ำได้ภายในไม่กี่นาที
เหตุใดจึงมีการเปรียบเทียบโมเดลสร้างภาพ AI นี้
ทุก "การเปรียบเทียบโมเดลสร้างภาพ AI" ที่คุณพบบนอินเทอร์เน็ตมักตกอยู่ในกับดักเดียวกัน: การใช้พรอมต์ที่เลือกสรรมาแล้ว, การเลือกภาพที่ดีที่สุดจากหลายชุด, และการอ้างสิทธิ์ที่ไม่ผ่านการทดสอบ การทดสอบมาตรฐานนี้สร้างขึ้นตาม หลักการ Tier A: พรอมต์ที่เป็นกลางต่อโมเดล, อินพุตที่เหมือนกันในทุกโมเดล, ผลลัพธ์เริ่มต้นที่ใช้เมล็ดเดียว (ไม่มีการเลือกภาพที่ดีที่สุด), และเกณฑ์การให้คะแนนที่สามารถระบุได้ในหนึ่งประโยคต่อหมวดหมู่
โมเดลทั้งหกที่ใช้ในการทดสอบมาตรฐานเต็มรูปแบบ: Grok, GPT Image 2, Nano Banana 2, Nano Banana Pro, Wan 2.7 และ Seedream 5.0 บทความนี้เน้นการเปรียบเทียบแบบตัวต่อตัวระหว่าง Grok กับ GPT Image 2 เนื่องจากเป็นคู่ที่เกี่ยวข้องเชิงพาณิชย์มากที่สุดสำหรับนักพัฒนาที่กำลังเลือกโมเดลสร้างภาพเริ่มต้น
วิธีทดสอบ Grok Imagine Image กับ GPT Image-2: 6 หมวดหมู่, กฎ Tier A หนึ่งข้อ
พรอมต์แต่ละข้อมุ่งเน้นไปที่มิติความสามารถเดียวที่ระบุไว้อย่างชัดเจน เกณฑ์ผ่าน/ไม่ผ่านถูกกำหนดไว้ก่อนที่จะรันโมเดล ไม่ใช่หลังจากเห็นผลลัพธ์
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| หมวดหมู่ | มิติหลักที่ทดสอบ | เกณฑ์ผ่าน/ไม่ผ่านหนึ่งประโยค |
|---|---|---|
| หมวด 1 · ความหมายเชิงองค์ประกอบ | การทำตามคำสั่ง | โมเดลนับวัตถุ 7 ชิ้นได้หรือไม่ วางถูกตำแหน่งหรือไม่ และทำตามรายการที่ห้ามหรือไม่ |
| หมวด 2 · กายวิภาคเสมือนจริงและแสง | คุณภาพภาพและฟิสิกส์ | นิ้วทั้ง 5 ถูกต้องตามหลักกายวิภาคหรือไม่ และมีรูปแบบแสงหักเห (caustic) ปรากฏบนใบหน้าหรือไม่ |
| หมวด 3 · โปสเตอร์หลายภาษา | การเรนเดอร์ข้อความในภาพ | ตัวอักษรจีนและอังกฤษเรนเดอร์ถูกต้องหรือไม่ ไม่มีขีดหายหรืออักขระที่หลอน |
| หมวด 4 · การแปลงทางเรขาคณิต (I2I) | การควบคุมการแก้ไข + เอกลักษณ์ | หลังจากหมุน 45° ยังคงจำได้ว่าเป็นคนเดิมหรือไม่ และรายละเอียดเสื้อผ้าครบถ้วนหรือไม่ |
| หมวด 5 · การแก้ไขเฉพาะจุดและการคงรักษาบริเวณ | ความแม่นยำในการแก้ไข | มีการแก้ไข 3 จุดพอดีหรือไม่ และทุกอย่างอื่นไม่เปลี่ยนแปลงในระดับพิกเซล |
| หมวด 6 · การผสานข้อมูลอ้างอิงหลายแหล่ง | ความสอดคล้องข้ามภาพ | เอกลักษณ์ สไตล์ และฉากจากข้อมูลอ้างอิง 3 แหล่งผสานเป็นภาพเดียวที่สอดคล้องกันหรือไม่ |
ต้องการทดสอบ GPT Image 2 และ Grok Imagine ด้วยพรอมต์เดียวกันด้วยตัวเองหรือไม่? การเปรียบเทียบโมเดลของ Atlas Cloud รันทั้งสองแบบเคียงข้างกันในครั้งเดียว — พรอมต์เดียวกัน ราคาแสดงก่อนสร้าง — เพื่อให้คุณตัดสินใจได้ทีละเฟรม

GPT Image 2 และ Grok Imagine บนพรอมต์เดียวกันในการเปรียบเทียบโมเดลของ Atlas Cloud — พรอมต์เดียวกัน แสดงราคาก่อนสร้าง จับภาพสดจาก model-explorer
หมวด 1 · ความหมายเชิงองค์ประกอบ (T2I)
พรอมต์:
ภาพถ่ายมุมสูงจากด้านบนของโต๊ะทานข้าวไม้ ซึ่งมีวัตถุเซรามิก 7 ชิ้นพอดี: ถ้วยชาสีขาวเหมือนกันสามใบเรียงเป็นรูปสามเหลี่ยมด้านเท่าตรงกลาง, ชามดำสองใบวางอยู่ทางขวาของถ้วยชา, แอปเปิลแดงหนึ่งลูกอยู่ในชามดำใบซ้ายสุด, และช้อนไม้เปล่าหนึ่งอันวางอยู่บนชามดำใบขวาสุด โดยด้ามช้อนชี้ไปที่มุมซ้ายบนของกรอบภาพ ห้ามมีถ้วยกาแฟ, ของโลหะ, จาน, หรือแก้วน้ำ แสงหน้าต่างกระจายเบาจากมุมซ้ายบน ช่วงสายกลางวัน ถ่ายภาพเสมือนจริง ไม่มีอุปกรณ์ตกแต่ง
พรอมต์นี้จงใจให้ท้าทาย การนับ, ภาษาพื้นที่ ("ทางขวาของ", "ซ้ายสุด"), และประโยคปฏิเสธเป็นจุดอ่อนที่ทราบกันดีของสถาปัตยกรรมแบบ diffusion ในปัจจุบัน
รายการตรวจสอบคะแนน
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | เกณฑ์ | ตรวจสอบ |
|---|---|---|
| 1 | จำนวนวัตถุทั้งหมด | วัตถุเซรามิก 7 ชิ้นพอดี |
| 2 | ถ้วยชาสีขาวสามใบ | จัดเรียงเป็นรูปสามเหลี่ยมด้านเท่า |
| 3 | ชามดำสองใบ | วางอยู่ทางขวาของถ้วยชา |
| 4 | แอปเปิลแดง | อยู่ในชามดำใบซ้ายสุด |
| 5 | ช้อนไม้ | วางบนชามดำใบขวาสุด ด้ามชี้ไปที่มุมซ้ายบน |
| 6 | การทำตามข้อปฏิเสธ | ไม่มีถ้วยกาแฟ / ไม่มีโลหะ / ไม่มีจาน / ไม่มีแก้ว |
| 7 | แหล่งกำเนิดแสง | แสงกระจายเบาจากมุมซ้ายบน เงาสม่ำเสมอทั้งหมด |
| 8 | สไตล์การถ่ายภาพ | ไม่มีกลิ่นอายการจัดวาง (ใบปาล์ม เทียน ฯลฯ) |
Grok Imagine Image
GPT-Image 2
ต้องสร้างภาพถ่ายมุมบนที่มีวัตถุเซรามิกเจ็ดชิ้นอย่างเคร่งครัด และมีความสัมพันธ์เชิงพื้นที่ที่ชัดเจน: ถ้วยชาสีขาวสามใบเรียงเป็นรูปสามเหลี่ยมด้านเท่าตรงกลาง ชามดำสองใบอยู่ทางขวาของถ้วยชา แอปเปิลแดงหนึ่งลูกอยู่ในชามดำใบซ้ายสุด ช้อนไม้วางบนชามดำใบขวาสุดโดยด้ามชี้ไปทางซ้ายบน คำสั่งห้าม: ห้ามมีถ้วยกาแฟ อุปกรณ์โลหะ จาน แก้วน้ำ
Grok Imagine จำนวนวัตถุ: เห็นถ้วยชา 5 ใบ (ไม่ใช่ 3 ใบ) เรียงกันเป็นกลุ่ม ไม่ใช่สามเหลี่ยมด้านเท่า มีชามดำสองใบ แอปเปิลแดงอยู่ในชามใบบนถูกต้อง ช้อนไม้มีอยู่และวางบนชามขวาสุด ทิศทางด้ามชี้ไปทางซ้ายบนโดยประมาณ — เกณฑ์นี้ผ่าน การทำตามข้อปฏิเสธสะอาด: ไม่มีถ้วยกาแฟ ไม่มีโลหะ ไม่มีจาน ไม่มีแก้ว แหล่งแสงจากซ้ายบนและเงาสม่ำเสมอผ่าน ไม่มีอุปกรณ์จัดวาง
GPT Image 2 แสดงให้เห็นถึงการทำตามคำสั่งที่แข็งแกร่งกว่าในส่วนประกอบเชิงพื้นที่ แม้ว่าทั้งสองโมเดลจะไม่สามารถนับวัตถุ 7 ชิ้นได้สมบูรณ์แบบพร้อมกับข้อจำกัดด้านตำแหน่งทั้งหมดที่พึงพอใจพร้อมกัน
หมวด 2 · กายวิภาคเสมือนจริงและแสง (T2I)
พรอมต์:
ภาพพอร์ตเทรตระยะใกล้ของหญิงชาวเอเชียตะวันออกอายุประมาณสามสิบต้นๆ ถือแก้วไวน์คริสตัลครึ่งแก้วที่บรรจุไวน์แดงในมือขวา นิ้วทั้งห้าและนิ้วหัวแม่มือมองเห็นได้ชัดเจน กำลังโอบก้านและส่วนหนึ่งของตัวแก้วอย่างเป็นธรรมชาติ เธอนั่งอยู่ข้างหน้าต่างสูงที่หันไปทางทิศตะวันตกในช่วงเวลาทอง แสงแดดยามบ่ายส่องผ่านไวน์สร้างลวดลายแสงหักเหสีแดงเลือดนกบนโหนกแก้มซ้ายและแนวกรามของเธอ มือซ้ายวางบนหนังสือปกแข็งที่เปิดอยู่บนตักของเธอ มีแสงสะท้อนจากหน้าต่างในดวงตาทั้งสองข้าง ผิวหนังแสดงรูขุมขนละเอียดมาก ขนอ่อนบางๆ การกระเจิงใต้ผิวหนัง (subsurface scattering) ที่ติ่งหูและสันจมูก ผมแบ็คไลท์พร้อมแสงขอบเลนส์ ใช้เลนส์ 85 มม. รูรับแสง f/2.0 ระยะชัดตื้น ถ่ายภาพเสมือนจริง
นี่คือการทดสอบภาพเดี่ยวที่ยากที่สุดในประวัติศาสตร์สำหรับโมเดล generative
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | เกณฑ์ | ตรวจสอบ |
|---|---|---|
| 1 | กายวิภาคมือ | นิ้วทั้ง 5 + นิ้วหัวแม่มือ จับก้านและตัวแก้วอย่างเป็นธรรมชาติ |
| 2 | แสงหักเห | ลวดลายสีแดงเลือดนกจากไวน์ปรากฏบนโหนกแก้ม |
| 3 | ความสม่ำเสมอของแสงสะท้อน | ตำแหน่งและรูปร่างเดียวกันในดวงตาทั้งสองข้าง |
| 4 | การกระเจิงใต้ผิวหนัง (SSS) | มองเห็นได้ที่ติ่งหูและสันจมูกเมื่อมีแสงแบ็คไลท์ |
| 5 | ฟิสิกส์ของแสงขอบเลนส์ | ทิศทางตรงกับตำแหน่งแหล่งกำเนิดแสง |
| 6 | ความสมจริงของผิวหนัง | ไม่มีการเกลี่ยเรียบแบบ "พลาสติก AI" มองเห็นรูขุมขนและขนอ่อน |
Grok Imagine Image
GPT-Image 2
Grok Imagine ส่งมอบผลลัพธ์ที่แข็งแกร่งตามข้อได้เปรียบหลัก กายวิภาคมือถูกต้อง — จำนวนนิ้วแม่นยำ ท่าจับเป็นธรรมชาติทั้งรอบก้านและตัวแก้ว มุมข้อมือเหมาะสมทางกายภาพ สิ่งนี้เพียงอย่างเดียวก้าวข้ามอุปสรรคที่หลายโมเดลทำไม่ได้ พื้นผิวผิวมองเห็นรายละเอียดระดับรูขุมขน มีขนอ่อนชัดเจน ไม่มีการเกลี่ยเรียบแบบพลาสติก และการกระเจิงใต้ผิวหนังที่สันจมูกและโหนกแก้มให้ความอบอุ่นที่ดูทะลุแสง ซึ่งอ่านได้ว่าสมจริงเหมือนภาพถ่าย แสงขอบเลนส์บนเส้นผมสอดคล้องกับทิศทางของแหล่งแสงหน้าต่าง
การสร้างแสงหักเหเป็นจุดอ่อนที่สุดของ Grok ลวดลายแสงสีแดงปรากฏบนใบหน้า แต่ถูกเรนเดอร์เป็นโอเวอร์เลย์สีแดงขนาดใหญ่ที่จัดแต่งอย่างมาก — ดูคล้ายเอฟเฟกต์ปรับสีมากกว่าเส้นใยแสงละเอียดขอบนุ่มที่เกิดจากแสงแดดผ่านไวน์ตามหลักฟิสิกส์ ความเป็นไปได้ทางกายภาพของแสงหักเหไม่ผ่านมาตรฐานความแม่นยำ
GPT Image 2 กลับกัน คุณภาพการสร้างแสงหักเหแม่นยำทางกายภาพมากกว่า — ลวดลายสีแดงเลือดนกบนโหนกแก้มมีขนาดเล็กกว่า กระจายตัวมากกว่า และเป็นไปตามเรขาคณิตเชิงพื้นที่ของแสงที่ผ่านแก้วไวน์ในมุมที่ถูกต้อง นี่คือรายละเอียดที่ Grok พลาด อย่างไรก็ตาม GPT Image 2 จ่ายค่าตอบแทนในด้านอื่น: กายวิภาคมือเป็นธรรมชาติน้อยกว่าเล็กน้อย มุมนิ้วรอบก้านแสดงความแข็งเล็กน้อย พื้นผิวผิวมักเอนไปทางเรียบกว่าและแบนกว่าเล็กน้อย ซึ่งพบได้ทั่วไปในภาพพอร์ตเทรต AI โดยมีความอบอุ่นของ SSS น้อยกว่าและความเข้มของแสงขอบเลนส์อ่อนกว่าเมื่อเทียบกับ Grok
หมวด 3 · โปสเตอร์หลายภาษา (T2I)
พรอมต์:
โปสเตอร์ท่องเที่ยวสไตล์วินเทจยุค 1960 สำหรับเทศกาลภาพยนตร์สมมติ ออกแบบในสไตล์การออกแบบเชิงพาณิชย์ช่วงกลางศตวรรษ ด้านบนของโปสเตอร์ ตัวอักษรจีนตัวหนา serif ขนาดใหญ่ อ่านว่า "时光电影节" (บรรทัดที่ 1) และด้านล่างเป็นตัวอักษรจีนขนาดเล็กกว่า "第七届 · 上海 · 1965年5月" (บรรทัดที่ 2)
ตรงกลาง: ภาพประกอบสไตล์ของเครื่องฉายภาพยนตร์เก่าที่ฉายลำแสงไปยังจอภาพยนตร์ที่โค้งเล็กน้อย
กึ่งกลางด้านล่าง: แก้วแชมเปญทรงสูง (coupe glass) พร้อมข้อความภาษาอังกฤษ "GRAND OPENING NIGHT" เขียนโค้งตามความโค้งของตัวแก้ว ตามมุมมองวงรี
ขอบขวา: ข้อความแนวตั้ง อ่านว่า "presented by 时代影业 · TIMES PICTURES" เรียงจากบนลงล่าง
แถบด้านล่าง: ข้อความเครดิตภาษาอังกฤษขนาดเล็ก "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" ในบรรทัดเดียว
จานสี: พื้นหลังสีครีมขาว, สีแดงเลือดนกเข้ม, สีเหลืองมัสตาร์ดเป็นสีเน้น เนื้อกระดาษเก่าเล็กน้อย, ความหยาบละเอียดเล็กน้อย
รายการตรวจสอบคะแนน
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | เกณฑ์ | ตรวจสอบ |
|---|---|---|
| 1 | ความถูกต้องของภาษาจีน | ไม่มีขีดหาย, ไม่มีอักขระหลอนใน "时光电影节" และ "第七届 · 上海 · 1965年5月" |
| 2 | เค้าโครงสองภาษา | จีนและอังกฤษไม่ปนกัน แต่ละภาษาอยู่ในโซนที่ถูกต้อง |
| 3 | ข้อความโค้งบนแก้ว | ภาษาอังกฤษเป็นไปตามมุมมองวงรีของแก้วแชมเปญ |
| 4 | ข้อความแนวตั้งขอบขวา | อ่านได้จากบนลงล่าง |
| 5 | ลำดับชั้นของตัวอักษร | ความแตกต่างชัดเจนระหว่างหัวข้อ "时光电影节" และเครดิต |
| 6 | สไตล์กับความอ่านง่าย | รักษาความสวยงามยุค 1960 โดยไม่เสียความชัดเจนของข้อความ |
Grok Imagine Image
GPT-Image 2
Grok Imagine สร้างโปสเตอร์ที่สะดุดตา มีพลังของภาพประกอบกลางศตวรรษ อย่างไรก็ตามล้มเหลวในเกณฑ์ข้อความที่สำคัญที่สุด: หัวข้ออ่านว่า "時光電影節" เป็นภาษาจีนตัวเต็ม ไม่ใช่ "时光电影节" ภาษาจีนตัวย่อตามที่ระบุในพรอมต์ นี่เป็นความล้มเหลวในการปฏิบัติตามชุดอักขระ ซึ่งเป็นความแตกต่างที่มีความหมายสำหรับกรณีการใช้งานด้านการแปลหรือการพิมพ์ บรรทัดที่สอง "第七屆 · 上海 · 1965年5月" ก็ใช้ตัวเต็มเช่นกัน ในด้านโครงสร้าง "GRAND OPENING NIGHT" ปรากฏบนแก้วแชมเปญโดยโค้งตามบางส่วน แม้ว่าการยึดตามมุมมองวงรีจะประมาณ ส่วนข้อความแนวตั้งขอบขวา "TIMES PICTURES" อ่านได้ แถบเครดิตด้านล่างมีอยู่และอ่านได้ จานสี — แดงเลือดนก, มัสตาร์ด, ครีม — ทำได้ดี พลังของเค้าโครงโดยรวมสูง แต่ความล้มเหลวเรื่องตัวเต็มกับตัวย่อเป็นปัจจัยที่ทำให้ไม่ผ่านสำหรับพรอมต์ที่ระบุ
GPT Image 2 ผ่านการทดสอบชุดอักขระอย่างสะอาด: หัวข้อ "时光电影节" และคำบรรยาย "第七届 · 上海 · 1965年5月" เรนเดอร์ถูกต้องเป็น ภาษาจีนตัวย่อ โดยไม่มีขีดหายหรืออักขระหลอน — เป็นชัยชนะในการปฏิบัติตามโดยตรงเหนือ Grok แก้วแชมเปญทรงสูงมองเห็นได้ที่กึ่งกลางด้านล่าง พร้อม "GRAND OPENING NIGHT" ที่โค้งตามความโค้งของแก้วอย่างน่าเชื่อถือ ข้อความแนวตั้งขอบขวา "时代影业 · TIMES PICTURES" เรียงจากบนลงล่างและอ่านได้ชัดเจน โดยทั้งภาษาจีนและอังกฤษวางอยู่ในคอลัมน์แนวตั้งเดียวกันโดยไม่มีข้อผิดพลาดในการปนกัน แถบเครดิตด้านล่าง — "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" — มีอยู่และอ่านได้เป็นบรรทัดเดียว ลำดับชั้นของตัวอักษรระหว่างหัวข้อ คำบรรยาย และเชิงอรรถรักษาไว้อย่างชัดเจน เนื้อกระดาษเก่าและจานสียุคกลางศตวรรษทำได้ดี องค์ประกอบผสานเส้นขอบฟ้าของเซี่ยงไฮ้ที่รู้จักเป็นภาพประกอบกลาง ซึ่งไม่ได้ระบุในพรอมต์ แต่เพิ่มความสมจริงตามบริบทโดยไม่ละเมิดเกณฑ์ใดๆ
หมวด 4 · การแปลงทางเรขาคณิต (I2I)
พรอมต์สั่งให้โมเดลหมุนภาพ lookbook แฟชั่นเต็มตัวของบุคคลไปทางซ้าย 45° พอดี โดยรักษาตำแหน่งกล้องเดิม ภาพอ้างอิงมีเครื่องแต่งกายหลายชั้นที่ซับซ้อน: เสื้อโค้ทยาวสีน้ำตาล, เสื้อคลุมหนังที่พาดบนไหล่, ขนสัตว์ที่มีการไล่สีที่มองเห็นได้ (น้ำตาลเข้ม → เงิน → ครีม), ตราทองแดงกลมบนหน้าอกที่มีภาพเหมือนฝังอยู่, ถุงมือหนังสีดำ, และรองเท้าบู๊ตหนังสองสี ไม่มีรายละเอียดเหล่านี้อยู่ในพรอมต์ — โมเดลต้องคงรักษาไว้ผ่านความเข้าใจในเอกลักษณ์เพียงอย่างเดียว

นี่เป็นการทดสอบความเครียดความสามารถโดยเจตนา คำสั่งสั้นโดยตั้งใจเพื่อหลีกเลี่ยงการป้อนเกณฑ์การประเมินของตัวเองให้โมเดล
รายการตรวจสอบคะแนน
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | เกณฑ์ | ตรวจสอบ |
|---|---|---|
| 1 | เอกลักษณ์ใบหน้า | ความคล้ายคลึง ArcFace ≥ 0.5 (ผ่อนปรนสำหรับสเกลเต็มตัว) |
| 2 | การเปิดเผยขนสัตว์ | ส่วนด้านขวาที่ซ่อนอยู่ก่อนหน้านี้แสดงสีเงินหรือไม่ |
| 3 | ตราหน้าอก | โครงร่างทองแดงกลม + ภาพเหมือนฝัง + การบีบอัดวงรีตามมุมมองที่ถูกต้อง |
| 4 | ชายเสื้อโค้ทและชั้นใน | ทิศทางการพับตามธรรมชาติหลังหมุน สัดส่วนการเปิดเผยกางเกงในเหมาะสม |
| 5 | ท่ายืน | ซ้ายหน้า |
| 6 | ปริมาตรถุงมือ | ตำแหน่งมือ + พื้นผิวถักมองเห็นหลังหมุน |
| 7 | ขอบสีรองเท้าบู๊ต | สีน้ำตาลบน หนังกลับสีเทาด้านล่าง |
| 8 | ความสม่ำเสมอของพื้นหลัง | พื้นหลังสตูดิโอสีเทาบริสุทธิ์ (ภูมิภาค DINO ≥ 0.95) |
| 9 | อัตราส่วนเอาต์พุต | คงเฟรมเต็มตัว 9:16 ไว้ ไม่ถูกครอบเป็นพอร์ตเทรต |
| 10 | ทิศทางการมอง | ตามการหมุน — ไม่ยังคงมองไปที่กล้อง |
Grok Imagine Image
GPT-Image 2
Grok รักษาเอกลักษณ์ใบหน้าเหนือเกณฑ์ ArcFace 0.5 ที่เหมาะสมสำหรับภาพเต็มตัว ส่วนด้านขวาของขนสัตว์ที่ซ่อนอยู่ก่อนหน้านี้มองเห็นได้บางส่วนที่ 45° โดยมีความต่อเนื่องของการไล่สีที่สมเหตุสมผล โครงร่างตราหน้าอกถูกรักษาไว้ แม้ว่ารายละเอียดภาพเหมือนฝังจะแสดงการบีบอัด ขอบสีรองเท้าบู๊ตและพื้นผิวถุงมือคงที่
GPT Image 2 แสดงความสอดคล้องของชั้นเสื้อผ้าโดยรวมที่แข็งแกร่งกว่าเล็กน้อย แต่ทำให้เกิดการเบี่ยงเบนของเอกลักษณ์ใบหน้ามากกว่า — เป็นการแลกเปลี่ยนที่มีความหมายขึ้นอยู่กับกรณีการใช้งาน
หมวด 5 · การแก้ไขเฉพาะจุดและการคงรักษาบริเวณ (I2I)
พรอมต์ต้องการการแก้ไขสามจุดในห้องนั่งเล่น: ลบแมวที่กำลังนอนหลับออกจากโซฟา (และฟื้นฟูเบาะรองนั่งตามธรรมชาติ), เปลี่ยนถ้วยชาร้อนเป็นแก้วน้ำส้มกับน้ำแข็ง, และเพิ่มแว่นอ่านหนังสือกรอบดำพับบนหนังสือเล่มกลางบนโต๊ะกาแฟ คำสั่งห้ามเปลี่ยนแปลงสิ่งอื่นใดอย่างชัดเจน — ลวดลายผ้าโซฟา, ตำแหน่งหนังสือ, โคมไฟ, วิวหน้าต่าง, สีผนัง, พื้น

การทดสอบการคงรักษามีความสำคัญเท่ากับการทดสอบการแก้ไข โมเดลที่ตีความทั้งฉากใหม่ในขณะที่แก้ไขเฉพาะจุดนั้นไม่สามารถใช้ได้สำหรับการรีทัชภาพถ่ายผลิตภัณฑ์หรือการพัฒนาฉากแบบวนซ้ำ
รายการตรวจสอบคะแนน
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | เกณฑ์ | ตรวจสอบ |
|---|---|---|
| 1 | การแก้ไขครบ 3 จุด | ลบแมว |
| 2 | การฟื้นฟูเบาะรองนั่ง | ไม่มีรอยบุ๋มรูปแมวหรือขนสัตว์เหลือบนโซฟา |
| 3 | ฟิสิกส์ของน้ำส้ม | เรขาคณิตแก้ว, การหักเหของน้ำแข็ง, และทิศทางเงาตรงกับแสงของถ้วยเดิม |
| 4 | ตำแหน่งแว่น | ถูกต้องบนหนังสือเล่มกลาง (ไม่ใช่เล่มบนหรือล่าง) |
| 5 | ผ้าโซฟา | ลายสานเพชรคงสภาพ โดยเฉพาะในโซนที่แก้ไข |
| 6 | หนังสือไม่เปลี่ยนแปลง | ตำแหน่ง, ปก (แดง, เขียว, น้ำเงิน) และกองหนังสือคงเดิม |
| 7 | โคมไฟไม่เปลี่ยนแปลง | รูปร่าง, สถานะการเรืองแสง, และตำแหน่งคงเดิม |
| 8 | วิวหน้าต่างไม่เปลี่ยนแปลง | วิวเมืองยังคงเบลอและสม่ำเสมอ |
| 9 | ผนังและพื้นไม่เปลี่ยนแปลง | ผนังสีขาวนวลและพื้นไม้สีอ่อนไม่เปลี่ยนแปลง |
| 10 | แสงโดยรวมคงเดิม | ทิศทางแหล่งกำเนิดแสงด้านหลังขวาเดียวไม่เปลี่ยนแปลง |
Grok Imagine Image
GPT-Image 2
Grok Imagine ทำการแก้ไขครบสามจุดที่ต้องการ แมวถูกลบและเบาะรองนั่งถูกฟื้นฟูอย่างสะอาด ไม่มีรอยบุ๋มหรือขนสัตว์ — ลวดลายผ้าในโซนที่แก้ไขคงสภาพดี แก้วน้ำส้มปรากฏในตำแหน่งที่ถูกต้อง อย่างไรก็ตาม แก้วน้ำส้มแสดงรูปแบบไฮไลท์ที่ไม่ตรงกับทิศทางแหล่งกำเนิดแสงนี้ ดูเหมือนว่าถูกประกอบด้วยโมเดลแสงอิสระมากกว่าที่จะรวมเข้ากับแสงที่มีอยู่ในฉาก ฐานของแก้วยังแสดงเงาสัมผัสไม่เพียงพอกับพื้นผิวโต๊ะกาแฟไม้สีเข้ม ทำให้เกิดเอฟเฟกต์ลอยตัวเล็กน้อยแต่สังเกตได้
GPT Image 2 ยังทำการแก้ไขครบสามจุด และแสดงให้เห็นถึงการคงรักษาฉากโดยรวมที่แข็งแกร่งกว่า การลบแมวสะอาดเท่ากัน แก้วน้ำส้มเรนเดอร์ดี มีตำแหน่งและทิศทางเงาที่ตรงกับแหล่งกำเนิดแสงจากหน้าต่างด้านขวา — เรขาคณิตแก้วและความทึบของของเหลวดูดีกว่าเวอร์ชันของ Grok แว่นอ่านหนังสือวางบนกองหนังสืออย่างชัดเจน ที่สำคัญคือวิวหน้าต่างถูกรักษาไว้ — เมืองภายนอกยังคงมองเห็นและเบลอ สอดคล้องกับภาพอ้างอิง ซึ่งเป็นจุดที่ Grok ล้มเหลว ผ้าโซฟา โคมไฟ ผนัง และพื้นคงสภาพทั้งหมด หนังสือดูเหมือนมีตำแหน่งและสีสม่ำเสมอ การเปลี่ยนแปลงที่สังเกตได้ประการหนึ่ง: ฉากโดยรวมดูสว่างขึ้นเล็กน้อยและมีความคมชัดที่เปลี่ยนไปจากต้นฉบับ แสดงให้เห็นถึงการตีความแสงโดยรวมใหม่เล็กน้อยแทนที่จะเป็นการคงรักษาในระดับพิกเซลอย่างแท้จริง — เป็นการเบี่ยงเบนเล็กน้อยแต่สังเกตได้
หมวด 6 · การผสานข้อมูลอ้างอิงหลายแหล่ง (I2I)
พรอมต์รวมข้อมูลอ้างอิงสามแหล่งที่แยกจากกัน: เอกลักษณ์ภาพพอร์ตเทรต (หญิงสาวเชื้อสายลาติน ตาสีเหลืองอำพัน ผมหยักศกสีน้ำตาลเข้ม), สไตล์ภาพประกอบสีน้ำ (ภูมิทัศน์ชนบทญี่ปุ่น เห็นลายเส้นพู่กัน บรรยากาศเทพนิยายอบอุ่น), และเค้าโครงฉาก (จัตุรัสหินกรวดยุโรปตอนพระอาทิตย์ตก เสาโคมไฟเหล็กหล่อ ซุ้มประตูหิน) ภารกิจ: สร้างภาพสีน้ำที่สอดคล้องกันภาพเดียวของบุคคลที่ระบุยืนอยู่ในฉาก — ไม่ใช่ภาพถ่ายพร้อมฟิลเตอร์ ไม่ใช่ภาพตัดปะ



การแยกข้อมูลอ้างอิงสามแหล่งเป็นการทดสอบที่ยากที่สุดในการทดสอบมาตรฐานนี้ โมเดลส่วนใหญ่ให้ความสำคัญกับข้อมูลอ้างอิงหนึ่งมากเกินไป หรือไม่สามารถสร้างการเรนเดอร์ผ่านสไตล์ได้
รายการตรวจสอบคะแนน
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | เกณฑ์ | ตรวจสอบ |
|---|---|---|
| 1 | การแยกสามทาง | เอกลักษณ์, สไตล์, และโครงสร้างฉากปรากฏในสัดส่วนที่เท่าเทียมกัน |
| 2 | การถ่ายโอนสไตล์เต็มรูปแบบ | เอาต์พุตเป็นสีน้ำทั้งภาพ — ไม่ใช่ภาพถ่าย + ฟิลเตอร์ |
| 3 | การคงรักษาเอกลักษณ์หลังสไตล์ | ดวงตาสีเหลืองอำพัน + โครงหน้าเป็นที่จดจำได้ผ่านการทำสีน้ำ |
| 4 | โครงสร้างฉากคงเดิม | หินกรวด, เสาโคมไฟ, และเค้าโครงซุ้มประตูคงสภาพ |
| 5 | การเพิ่มเสื้อผ้าตามธรรมชาติ | เสื้อโค้ทเดินทางและกระเป๋าสะพายเพิ่มโดยไม่ทำลายองค์ประกอบ |
| 6 | ความสม่ำเสมอของทิศทางแสง | แสงยามพระอาทิตย์จากซ้ายกล้องมองเห็นบนหินกรวดและตัวบุคคล |
Grok Imagine Image
GPT-Image 2
Grok Imagine ล้มเหลวในเกณฑ์หลัก: เอาต์พุตเป็นภาพเสมือนจริง ไม่ใช่สีน้ำ จัตุรัสหินกรวดและบุคคลยังคงมีความคมชัดของภาพถ่ายเต็มรูปแบบ โดยมีเพียงการผ่านพื้นผิวแบบจิตรกรรมเบา ๆ — ไม่มีลายเส้นพู่กันที่กำหนด สีเบล็ด หรือคุณภาพขอบที่วาดด้วยมือของ Ref 2 โครงสร้างฉาก เอกลักษณ์ เสื้อผ้า และทิศทางแสงผ่านทั้งหมด แต่การเรนเดอร์สื่อผิดประเภทโดยสิ้นเชิงเป็นการตัดสิทธิ์ในระดับหมวดหมู่ ไม่ใช่การหักคะแนนบางส่วน
GPT Image 2 บรรลุการเรนเดอร์สีน้ำอย่างแท้จริงทั่วทั้งเฟรม — อาคาร หินกรวด ท้องฟ้า และบุคคลล้วนมีลายเส้นพู่กันที่มองเห็นได้และการเบล็ดสีอ่อนที่สอดคล้องกับ Ref 2 โครงสร้างฉากจาก Ref 3 คงสภาพ เสาโคมไฟสว่าง และซุ้มประตูหินมองเห็นได้ในระยะกลาง เอกลักษณ์ถูกรักษาไว้บางส่วนผ่านการเปลี่ยนแปลงสไตล์ — ผมหยักศกสีเข้มและโครงหน้าเป็นที่จดจำได้ แม้ว่ารายละเอียดปลีกย่อยจะถูกทำให้เป็นนามธรรมตามที่คาด เสื้อโค้ท กระเป๋าสะพาย ทิศทางแสง และการมองตามพรอมต์ทั้งหมด นี่เป็นเอาต์พุตเดียวที่ทำงานจริงให้สำเร็จ
ทดลองใช้โมเดล Grok Imagine Image และ GPT Image 2 ผ่าน Atlas Cloud
การทดสอบมาตรฐานนี้สามารถทำซ้ำได้ ทั้ง Grok Imagine และ GPT Image 2 พร้อมใช้งานแล้วผ่าน Atlas Cloud — ไม่ต้องตั้งค่าการเรียกเก็บเงินแยกตามโมเดล ไม่ต้องรอคิว
ทำไมต้อง Atlas Cloud
- คีย์ API หนึ่งเดียว, โมเดลมากกว่า 300 รายการ สลับระหว่าง Grok, GPT Image 2, Flux, Wan, Seedream และโมเดลอื่นๆ ในคลังได้โดยเปลี่ยนฟิลด์โมเดลเพียงฟิลด์เดียว คีย์เดียวกัน เอ็นด์พอยต์เดียวกัน แดชบอร์ดการเรียกเก็บเงินเดียวกัน — ไม่ว่าคุณจะรันการทดสอบมาตรฐานหกโมเดลหรือสร้างไปป์ไลน์การผลิตภาพ
- ครอบคลุมทุกโมดอล LLM, ข้อความเป็นภาพ, ภาพเป็นภาพ, ข้อความเป็นวิดีโอ, ภาพเป็นวิดีโอ — ทั้งหมดภายใต้หลังคาเดียว หากเวิร์กโฟลว์ของคุณต้องการโมเดลภาษาเพื่อปรับแต่งพรอมต์และโมเดลภาพเพื่อสร้าง ทั้งสองอยู่ใน API เดียวกัน
- ไม่มี cold start, ไม่มีเซอร์ไพรส์เรื่อง rate limit Atlas Cloud ทำงานบนโครงสร้างพื้นฐานการอนุมานที่ปรับให้เหมาะสมซึ่งออกแบบมาเพื่อปริมาณงาน คุณจะได้เวลาแฝงที่สม่ำเสมอไม่ว่าคุณจะเรียกหนึ่งครั้งหรือพันครั้ง
- สร้างมาเพื่อเวิร์กโฟลว์การเปรียบเทียบ กรณีการใช้งานที่แน่นอนที่การทดสอบมาตรฐานนี้แสดงให้เห็น — การรันพรอมต์เดียวกันในหลายโมเดลและเปรียบเทียบผลลัพธ์ — คือสิ่งที่สถาปัตยกรรมของ Atlas Cloud ออกแบบมา คีย์เดียว บิลเดียว ความหลากหลายของโมเดลเต็มรูปแบบ







