Seedance 2.5 ใช้งานได้แล้ววันนี้ — ที่แรกบน Atlas Cloud

เราให้ GPT Image 2 และ Grok Imagine ใช้โพรอมต์เดียวกัน 6 ข้อ นี่คือสิ่งที่ได้กลับมา

XAI Grok Imagine เทียบกับ GPT Image 2 ในการเปรียบเทียบสมรรถภาพด้านกายวิภาคศาสตร์ ข้อความภาษาจีน การแก้ไขเฉพาะจุด และการหลอมรวมหลายแหล่งอ้างอิง ใช้ซิงเกิลซีด ไม่มีการเลือกตัวอย่างที่เอื้อประโยชน์ ทั้งสองผ่าน Atlas Cloud

เราให้ GPT Image 2 และ Grok Imagine ใช้โพรอมต์เดียวกัน 6 ข้อ นี่คือสิ่งที่ได้กลับมา

เราได้นำโมเดล Grok Imagine Image และ GPT Image-2 มาทดสอบด้วยพรอมต์ที่เหมือนกัน 6 ข้อ ซึ่งครอบคลุมด้านความหมายเชิงองค์ประกอบ (compositional semantics) กายวิภาคเสมือนจริง (photorealistic anatomy) การเรนเดอร์ข้อความหลายภาษา (multilingual text rendering) การแปลงทางเรขาคณิต (geometric transformation) การแก้ไขเฉพาะจุด (local editing) และการผสานข้อมูลอ้างอิงหลายแหล่ง (multi-reference fusion)

ทั้งโมเดล Grok Imagine Image และ GPT Image-2 ใช้งานได้ผ่านคีย์ API เดียวของ Atlas Cloud ทำให้การทดสอบมาตรฐานนี้สามารถทำซ้ำได้ภายในไม่กี่นาที

เหตุใดจึงมีการเปรียบเทียบโมเดลสร้างภาพ AI นี้

ทุก "การเปรียบเทียบโมเดลสร้างภาพ AI" ที่คุณพบบนอินเทอร์เน็ตมักตกอยู่ในกับดักเดียวกัน: การใช้พรอมต์ที่เลือกสรรมาแล้ว, การเลือกภาพที่ดีที่สุดจากหลายชุด, และการอ้างสิทธิ์ที่ไม่ผ่านการทดสอบ การทดสอบมาตรฐานนี้สร้างขึ้นตาม หลักการ Tier A: พรอมต์ที่เป็นกลางต่อโมเดล, อินพุตที่เหมือนกันในทุกโมเดล, ผลลัพธ์เริ่มต้นที่ใช้เมล็ดเดียว (ไม่มีการเลือกภาพที่ดีที่สุด), และเกณฑ์การให้คะแนนที่สามารถระบุได้ในหนึ่งประโยคต่อหมวดหมู่

โมเดลทั้งหกที่ใช้ในการทดสอบมาตรฐานเต็มรูปแบบ: Grok, GPT Image 2, Nano Banana 2, Nano Banana Pro, Wan 2.7 และ Seedream 5.0 บทความนี้เน้นการเปรียบเทียบแบบตัวต่อตัวระหว่าง Grok กับ GPT Image 2 เนื่องจากเป็นคู่ที่เกี่ยวข้องเชิงพาณิชย์มากที่สุดสำหรับนักพัฒนาที่กำลังเลือกโมเดลสร้างภาพเริ่มต้น

วิธีทดสอบ Grok Imagine Image กับ GPT Image-2: 6 หมวดหมู่, กฎ Tier A หนึ่งข้อ

พรอมต์แต่ละข้อมุ่งเน้นไปที่มิติความสามารถเดียวที่ระบุไว้อย่างชัดเจน เกณฑ์ผ่าน/ไม่ผ่านถูกกำหนดไว้ก่อนที่จะรันโมเดล ไม่ใช่หลังจากเห็นผลลัพธ์

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

หมวดหมู่มิติหลักที่ทดสอบเกณฑ์ผ่าน/ไม่ผ่านหนึ่งประโยค
หมวด 1 · ความหมายเชิงองค์ประกอบการทำตามคำสั่งโมเดลนับวัตถุ 7 ชิ้นได้หรือไม่ วางถูกตำแหน่งหรือไม่ และทำตามรายการที่ห้ามหรือไม่
หมวด 2 · กายวิภาคเสมือนจริงและแสงคุณภาพภาพและฟิสิกส์นิ้วทั้ง 5 ถูกต้องตามหลักกายวิภาคหรือไม่ และมีรูปแบบแสงหักเห (caustic) ปรากฏบนใบหน้าหรือไม่
หมวด 3 · โปสเตอร์หลายภาษาการเรนเดอร์ข้อความในภาพตัวอักษรจีนและอังกฤษเรนเดอร์ถูกต้องหรือไม่ ไม่มีขีดหายหรืออักขระที่หลอน
หมวด 4 · การแปลงทางเรขาคณิต (I2I)การควบคุมการแก้ไข + เอกลักษณ์หลังจากหมุน 45° ยังคงจำได้ว่าเป็นคนเดิมหรือไม่ และรายละเอียดเสื้อผ้าครบถ้วนหรือไม่
หมวด 5 · การแก้ไขเฉพาะจุดและการคงรักษาบริเวณความแม่นยำในการแก้ไขมีการแก้ไข 3 จุดพอดีหรือไม่ และทุกอย่างอื่นไม่เปลี่ยนแปลงในระดับพิกเซล
หมวด 6 · การผสานข้อมูลอ้างอิงหลายแหล่งความสอดคล้องข้ามภาพเอกลักษณ์ สไตล์ และฉากจากข้อมูลอ้างอิง 3 แหล่งผสานเป็นภาพเดียวที่สอดคล้องกันหรือไม่

ต้องการทดสอบ GPT Image 2 และ Grok Imagine ด้วยพรอมต์เดียวกันด้วยตัวเองหรือไม่? การเปรียบเทียบโมเดลของ Atlas Cloud รันทั้งสองแบบเคียงข้างกันในครั้งเดียว — พรอมต์เดียวกัน ราคาแสดงก่อนสร้าง — เพื่อให้คุณตัดสินใจได้ทีละเฟรม

GPT Image 2 และ Grok Imagine บนพรอมต์เดียวกันในการเปรียบเทียบโมเดลของ Atlas Cloud — พรอมต์เดียวกัน แสดงราคาก่อนสร้าง จับภาพสดจาก model-explorer

GPT Image 2 และ Grok Imagine บนพรอมต์เดียวกันในการเปรียบเทียบโมเดลของ Atlas Cloud — พรอมต์เดียวกัน แสดงราคาก่อนสร้าง จับภาพสดจาก model-explorer

หมวด 1 · ความหมายเชิงองค์ประกอบ (T2I)

พรอมต์:

ภาพถ่ายมุมสูงจากด้านบนของโต๊ะทานข้าวไม้ ซึ่งมีวัตถุเซรามิก 7 ชิ้นพอดี: ถ้วยชาสีขาวเหมือนกันสามใบเรียงเป็นรูปสามเหลี่ยมด้านเท่าตรงกลาง, ชามดำสองใบวางอยู่ทางขวาของถ้วยชา, แอปเปิลแดงหนึ่งลูกอยู่ในชามดำใบซ้ายสุด, และช้อนไม้เปล่าหนึ่งอันวางอยู่บนชามดำใบขวาสุด โดยด้ามช้อนชี้ไปที่มุมซ้ายบนของกรอบภาพ ห้ามมีถ้วยกาแฟ, ของโลหะ, จาน, หรือแก้วน้ำ แสงหน้าต่างกระจายเบาจากมุมซ้ายบน ช่วงสายกลางวัน ถ่ายภาพเสมือนจริง ไม่มีอุปกรณ์ตกแต่ง

พรอมต์นี้จงใจให้ท้าทาย การนับ, ภาษาพื้นที่ ("ทางขวาของ", "ซ้ายสุด"), และประโยคปฏิเสธเป็นจุดอ่อนที่ทราบกันดีของสถาปัตยกรรมแบบ diffusion ในปัจจุบัน

รายการตรวจสอบคะแนน

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#เกณฑ์ตรวจสอบ
1จำนวนวัตถุทั้งหมดวัตถุเซรามิก 7 ชิ้นพอดี
2ถ้วยชาสีขาวสามใบจัดเรียงเป็นรูปสามเหลี่ยมด้านเท่า
3ชามดำสองใบวางอยู่ทางขวาของถ้วยชา
4แอปเปิลแดงอยู่ในชามดำใบซ้ายสุด
5ช้อนไม้วางบนชามดำใบขวาสุด ด้ามชี้ไปที่มุมซ้ายบน
6การทำตามข้อปฏิเสธไม่มีถ้วยกาแฟ / ไม่มีโลหะ / ไม่มีจาน / ไม่มีแก้ว
7แหล่งกำเนิดแสงแสงกระจายเบาจากมุมซ้ายบน เงาสม่ำเสมอทั้งหมด
8สไตล์การถ่ายภาพไม่มีกลิ่นอายการจัดวาง (ใบปาล์ม เทียน ฯลฯ)

1.PNG Grok Imagine Image

2.PNG GPT-Image 2

ต้องสร้างภาพถ่ายมุมบนที่มีวัตถุเซรามิกเจ็ดชิ้นอย่างเคร่งครัด และมีความสัมพันธ์เชิงพื้นที่ที่ชัดเจน: ถ้วยชาสีขาวสามใบเรียงเป็นรูปสามเหลี่ยมด้านเท่าตรงกลาง ชามดำสองใบอยู่ทางขวาของถ้วยชา แอปเปิลแดงหนึ่งลูกอยู่ในชามดำใบซ้ายสุด ช้อนไม้วางบนชามดำใบขวาสุดโดยด้ามชี้ไปทางซ้ายบน คำสั่งห้าม: ห้ามมีถ้วยกาแฟ อุปกรณ์โลหะ จาน แก้วน้ำ

Grok Imagine จำนวนวัตถุ: เห็นถ้วยชา 5 ใบ (ไม่ใช่ 3 ใบ) เรียงกันเป็นกลุ่ม ไม่ใช่สามเหลี่ยมด้านเท่า มีชามดำสองใบ แอปเปิลแดงอยู่ในชามใบบนถูกต้อง ช้อนไม้มีอยู่และวางบนชามขวาสุด ทิศทางด้ามชี้ไปทางซ้ายบนโดยประมาณ — เกณฑ์นี้ผ่าน การทำตามข้อปฏิเสธสะอาด: ไม่มีถ้วยกาแฟ ไม่มีโลหะ ไม่มีจาน ไม่มีแก้ว แหล่งแสงจากซ้ายบนและเงาสม่ำเสมอผ่าน ไม่มีอุปกรณ์จัดวาง

GPT Image 2 แสดงให้เห็นถึงการทำตามคำสั่งที่แข็งแกร่งกว่าในส่วนประกอบเชิงพื้นที่ แม้ว่าทั้งสองโมเดลจะไม่สามารถนับวัตถุ 7 ชิ้นได้สมบูรณ์แบบพร้อมกับข้อจำกัดด้านตำแหน่งทั้งหมดที่พึงพอใจพร้อมกัน

หมวด 2 · กายวิภาคเสมือนจริงและแสง (T2I)

พรอมต์:

ภาพพอร์ตเทรตระยะใกล้ของหญิงชาวเอเชียตะวันออกอายุประมาณสามสิบต้นๆ ถือแก้วไวน์คริสตัลครึ่งแก้วที่บรรจุไวน์แดงในมือขวา นิ้วทั้งห้าและนิ้วหัวแม่มือมองเห็นได้ชัดเจน กำลังโอบก้านและส่วนหนึ่งของตัวแก้วอย่างเป็นธรรมชาติ เธอนั่งอยู่ข้างหน้าต่างสูงที่หันไปทางทิศตะวันตกในช่วงเวลาทอง แสงแดดยามบ่ายส่องผ่านไวน์สร้างลวดลายแสงหักเหสีแดงเลือดนกบนโหนกแก้มซ้ายและแนวกรามของเธอ มือซ้ายวางบนหนังสือปกแข็งที่เปิดอยู่บนตักของเธอ มีแสงสะท้อนจากหน้าต่างในดวงตาทั้งสองข้าง ผิวหนังแสดงรูขุมขนละเอียดมาก ขนอ่อนบางๆ การกระเจิงใต้ผิวหนัง (subsurface scattering) ที่ติ่งหูและสันจมูก ผมแบ็คไลท์พร้อมแสงขอบเลนส์ ใช้เลนส์ 85 มม. รูรับแสง f/2.0 ระยะชัดตื้น ถ่ายภาพเสมือนจริง

นี่คือการทดสอบภาพเดี่ยวที่ยากที่สุดในประวัติศาสตร์สำหรับโมเดล generative

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#เกณฑ์ตรวจสอบ
1กายวิภาคมือนิ้วทั้ง 5 + นิ้วหัวแม่มือ จับก้านและตัวแก้วอย่างเป็นธรรมชาติ
2แสงหักเหลวดลายสีแดงเลือดนกจากไวน์ปรากฏบนโหนกแก้ม
3ความสม่ำเสมอของแสงสะท้อนตำแหน่งและรูปร่างเดียวกันในดวงตาทั้งสองข้าง
4การกระเจิงใต้ผิวหนัง (SSS)มองเห็นได้ที่ติ่งหูและสันจมูกเมื่อมีแสงแบ็คไลท์
5ฟิสิกส์ของแสงขอบเลนส์ทิศทางตรงกับตำแหน่งแหล่งกำเนิดแสง
6ความสมจริงของผิวหนังไม่มีการเกลี่ยเรียบแบบ "พลาสติก AI" มองเห็นรูขุมขนและขนอ่อน

3.PNG Grok Imagine Image

4.PNG GPT-Image 2

Grok Imagine ส่งมอบผลลัพธ์ที่แข็งแกร่งตามข้อได้เปรียบหลัก กายวิภาคมือถูกต้อง — จำนวนนิ้วแม่นยำ ท่าจับเป็นธรรมชาติทั้งรอบก้านและตัวแก้ว มุมข้อมือเหมาะสมทางกายภาพ สิ่งนี้เพียงอย่างเดียวก้าวข้ามอุปสรรคที่หลายโมเดลทำไม่ได้ พื้นผิวผิวมองเห็นรายละเอียดระดับรูขุมขน มีขนอ่อนชัดเจน ไม่มีการเกลี่ยเรียบแบบพลาสติก และการกระเจิงใต้ผิวหนังที่สันจมูกและโหนกแก้มให้ความอบอุ่นที่ดูทะลุแสง ซึ่งอ่านได้ว่าสมจริงเหมือนภาพถ่าย แสงขอบเลนส์บนเส้นผมสอดคล้องกับทิศทางของแหล่งแสงหน้าต่าง

การสร้างแสงหักเหเป็นจุดอ่อนที่สุดของ Grok ลวดลายแสงสีแดงปรากฏบนใบหน้า แต่ถูกเรนเดอร์เป็นโอเวอร์เลย์สีแดงขนาดใหญ่ที่จัดแต่งอย่างมาก — ดูคล้ายเอฟเฟกต์ปรับสีมากกว่าเส้นใยแสงละเอียดขอบนุ่มที่เกิดจากแสงแดดผ่านไวน์ตามหลักฟิสิกส์ ความเป็นไปได้ทางกายภาพของแสงหักเหไม่ผ่านมาตรฐานความแม่นยำ

GPT Image 2 กลับกัน คุณภาพการสร้างแสงหักเหแม่นยำทางกายภาพมากกว่า — ลวดลายสีแดงเลือดนกบนโหนกแก้มมีขนาดเล็กกว่า กระจายตัวมากกว่า และเป็นไปตามเรขาคณิตเชิงพื้นที่ของแสงที่ผ่านแก้วไวน์ในมุมที่ถูกต้อง นี่คือรายละเอียดที่ Grok พลาด อย่างไรก็ตาม GPT Image 2 จ่ายค่าตอบแทนในด้านอื่น: กายวิภาคมือเป็นธรรมชาติน้อยกว่าเล็กน้อย มุมนิ้วรอบก้านแสดงความแข็งเล็กน้อย พื้นผิวผิวมักเอนไปทางเรียบกว่าและแบนกว่าเล็กน้อย ซึ่งพบได้ทั่วไปในภาพพอร์ตเทรต AI โดยมีความอบอุ่นของ SSS น้อยกว่าและความเข้มของแสงขอบเลนส์อ่อนกว่าเมื่อเทียบกับ Grok

หมวด 3 · โปสเตอร์หลายภาษา (T2I)

พรอมต์:

โปสเตอร์ท่องเที่ยวสไตล์วินเทจยุค 1960 สำหรับเทศกาลภาพยนตร์สมมติ ออกแบบในสไตล์การออกแบบเชิงพาณิชย์ช่วงกลางศตวรรษ ด้านบนของโปสเตอร์ ตัวอักษรจีนตัวหนา serif ขนาดใหญ่ อ่านว่า "时光电影节" (บรรทัดที่ 1) และด้านล่างเป็นตัวอักษรจีนขนาดเล็กกว่า "第七届 · 上海 · 1965年5月" (บรรทัดที่ 2)

ตรงกลาง: ภาพประกอบสไตล์ของเครื่องฉายภาพยนตร์เก่าที่ฉายลำแสงไปยังจอภาพยนตร์ที่โค้งเล็กน้อย

กึ่งกลางด้านล่าง: แก้วแชมเปญทรงสูง (coupe glass) พร้อมข้อความภาษาอังกฤษ "GRAND OPENING NIGHT" เขียนโค้งตามความโค้งของตัวแก้ว ตามมุมมองวงรี

ขอบขวา: ข้อความแนวตั้ง อ่านว่า "presented by 时代影业 · TIMES PICTURES" เรียงจากบนลงล่าง

แถบด้านล่าง: ข้อความเครดิตภาษาอังกฤษขนาดเล็ก "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" ในบรรทัดเดียว

จานสี: พื้นหลังสีครีมขาว, สีแดงเลือดนกเข้ม, สีเหลืองมัสตาร์ดเป็นสีเน้น เนื้อกระดาษเก่าเล็กน้อย, ความหยาบละเอียดเล็กน้อย

รายการตรวจสอบคะแนน

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#เกณฑ์ตรวจสอบ
1ความถูกต้องของภาษาจีนไม่มีขีดหาย, ไม่มีอักขระหลอนใน "时光电影节" และ "第七届 · 上海 · 1965年5月"
2เค้าโครงสองภาษาจีนและอังกฤษไม่ปนกัน แต่ละภาษาอยู่ในโซนที่ถูกต้อง
3ข้อความโค้งบนแก้วภาษาอังกฤษเป็นไปตามมุมมองวงรีของแก้วแชมเปญ
4ข้อความแนวตั้งขอบขวาอ่านได้จากบนลงล่าง
5ลำดับชั้นของตัวอักษรความแตกต่างชัดเจนระหว่างหัวข้อ "时光电影节" และเครดิต
6สไตล์กับความอ่านง่ายรักษาความสวยงามยุค 1960 โดยไม่เสียความชัดเจนของข้อความ

5.png Grok Imagine Image

6.png GPT-Image 2

Grok Imagine สร้างโปสเตอร์ที่สะดุดตา มีพลังของภาพประกอบกลางศตวรรษ อย่างไรก็ตามล้มเหลวในเกณฑ์ข้อความที่สำคัญที่สุด: หัวข้ออ่านว่า "時光電影節" เป็นภาษาจีนตัวเต็ม ไม่ใช่ "时光电影节" ภาษาจีนตัวย่อตามที่ระบุในพรอมต์ นี่เป็นความล้มเหลวในการปฏิบัติตามชุดอักขระ ซึ่งเป็นความแตกต่างที่มีความหมายสำหรับกรณีการใช้งานด้านการแปลหรือการพิมพ์ บรรทัดที่สอง "第七屆 · 上海 · 1965年5月" ก็ใช้ตัวเต็มเช่นกัน ในด้านโครงสร้าง "GRAND OPENING NIGHT" ปรากฏบนแก้วแชมเปญโดยโค้งตามบางส่วน แม้ว่าการยึดตามมุมมองวงรีจะประมาณ ส่วนข้อความแนวตั้งขอบขวา "TIMES PICTURES" อ่านได้ แถบเครดิตด้านล่างมีอยู่และอ่านได้ จานสี — แดงเลือดนก, มัสตาร์ด, ครีม — ทำได้ดี พลังของเค้าโครงโดยรวมสูง แต่ความล้มเหลวเรื่องตัวเต็มกับตัวย่อเป็นปัจจัยที่ทำให้ไม่ผ่านสำหรับพรอมต์ที่ระบุ

GPT Image 2 ผ่านการทดสอบชุดอักขระอย่างสะอาด: หัวข้อ "时光电影节" และคำบรรยาย "第七届 · 上海 · 1965年5月" เรนเดอร์ถูกต้องเป็น ภาษาจีนตัวย่อ โดยไม่มีขีดหายหรืออักขระหลอน — เป็นชัยชนะในการปฏิบัติตามโดยตรงเหนือ Grok แก้วแชมเปญทรงสูงมองเห็นได้ที่กึ่งกลางด้านล่าง พร้อม "GRAND OPENING NIGHT" ที่โค้งตามความโค้งของแก้วอย่างน่าเชื่อถือ ข้อความแนวตั้งขอบขวา "时代影业 · TIMES PICTURES" เรียงจากบนลงล่างและอ่านได้ชัดเจน โดยทั้งภาษาจีนและอังกฤษวางอยู่ในคอลัมน์แนวตั้งเดียวกันโดยไม่มีข้อผิดพลาดในการปนกัน แถบเครดิตด้านล่าง — "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" — มีอยู่และอ่านได้เป็นบรรทัดเดียว ลำดับชั้นของตัวอักษรระหว่างหัวข้อ คำบรรยาย และเชิงอรรถรักษาไว้อย่างชัดเจน เนื้อกระดาษเก่าและจานสียุคกลางศตวรรษทำได้ดี องค์ประกอบผสานเส้นขอบฟ้าของเซี่ยงไฮ้ที่รู้จักเป็นภาพประกอบกลาง ซึ่งไม่ได้ระบุในพรอมต์ แต่เพิ่มความสมจริงตามบริบทโดยไม่ละเมิดเกณฑ์ใดๆ

หมวด 4 · การแปลงทางเรขาคณิต (I2I)

พรอมต์สั่งให้โมเดลหมุนภาพ lookbook แฟชั่นเต็มตัวของบุคคลไปทางซ้าย 45° พอดี โดยรักษาตำแหน่งกล้องเดิม ภาพอ้างอิงมีเครื่องแต่งกายหลายชั้นที่ซับซ้อน: เสื้อโค้ทยาวสีน้ำตาล, เสื้อคลุมหนังที่พาดบนไหล่, ขนสัตว์ที่มีการไล่สีที่มองเห็นได้ (น้ำตาลเข้ม → เงิน → ครีม), ตราทองแดงกลมบนหน้าอกที่มีภาพเหมือนฝังอยู่, ถุงมือหนังสีดำ, และรองเท้าบู๊ตหนังสองสี ไม่มีรายละเอียดเหล่านี้อยู่ในพรอมต์ — โมเดลต้องคงรักษาไว้ผ่านความเข้าใจในเอกลักษณ์เพียงอย่างเดียว

7.png

นี่เป็นการทดสอบความเครียดความสามารถโดยเจตนา คำสั่งสั้นโดยตั้งใจเพื่อหลีกเลี่ยงการป้อนเกณฑ์การประเมินของตัวเองให้โมเดล

รายการตรวจสอบคะแนน

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#เกณฑ์ตรวจสอบ
1เอกลักษณ์ใบหน้าความคล้ายคลึง ArcFace ≥ 0.5 (ผ่อนปรนสำหรับสเกลเต็มตัว)
2การเปิดเผยขนสัตว์ส่วนด้านขวาที่ซ่อนอยู่ก่อนหน้านี้แสดงสีเงินหรือไม่
3ตราหน้าอกโครงร่างทองแดงกลม + ภาพเหมือนฝัง + การบีบอัดวงรีตามมุมมองที่ถูกต้อง
4ชายเสื้อโค้ทและชั้นในทิศทางการพับตามธรรมชาติหลังหมุน สัดส่วนการเปิดเผยกางเกงในเหมาะสม
5ท่ายืนซ้ายหน้า
6ปริมาตรถุงมือตำแหน่งมือ + พื้นผิวถักมองเห็นหลังหมุน
7ขอบสีรองเท้าบู๊ตสีน้ำตาลบน หนังกลับสีเทาด้านล่าง
8ความสม่ำเสมอของพื้นหลังพื้นหลังสตูดิโอสีเทาบริสุทธิ์ (ภูมิภาค DINO ≥ 0.95)
9อัตราส่วนเอาต์พุตคงเฟรมเต็มตัว 9:16 ไว้ ไม่ถูกครอบเป็นพอร์ตเทรต
10ทิศทางการมองตามการหมุน — ไม่ยังคงมองไปที่กล้อง

8.png Grok Imagine Image

9.jpg GPT-Image 2

Grok รักษาเอกลักษณ์ใบหน้าเหนือเกณฑ์ ArcFace 0.5 ที่เหมาะสมสำหรับภาพเต็มตัว ส่วนด้านขวาของขนสัตว์ที่ซ่อนอยู่ก่อนหน้านี้มองเห็นได้บางส่วนที่ 45° โดยมีความต่อเนื่องของการไล่สีที่สมเหตุสมผล โครงร่างตราหน้าอกถูกรักษาไว้ แม้ว่ารายละเอียดภาพเหมือนฝังจะแสดงการบีบอัด ขอบสีรองเท้าบู๊ตและพื้นผิวถุงมือคงที่

GPT Image 2 แสดงความสอดคล้องของชั้นเสื้อผ้าโดยรวมที่แข็งแกร่งกว่าเล็กน้อย แต่ทำให้เกิดการเบี่ยงเบนของเอกลักษณ์ใบหน้ามากกว่า — เป็นการแลกเปลี่ยนที่มีความหมายขึ้นอยู่กับกรณีการใช้งาน

หมวด 5 · การแก้ไขเฉพาะจุดและการคงรักษาบริเวณ (I2I)

พรอมต์ต้องการการแก้ไขสามจุดในห้องนั่งเล่น: ลบแมวที่กำลังนอนหลับออกจากโซฟา (และฟื้นฟูเบาะรองนั่งตามธรรมชาติ), เปลี่ยนถ้วยชาร้อนเป็นแก้วน้ำส้มกับน้ำแข็ง, และเพิ่มแว่นอ่านหนังสือกรอบดำพับบนหนังสือเล่มกลางบนโต๊ะกาแฟ คำสั่งห้ามเปลี่ยนแปลงสิ่งอื่นใดอย่างชัดเจน — ลวดลายผ้าโซฟา, ตำแหน่งหนังสือ, โคมไฟ, วิวหน้าต่าง, สีผนัง, พื้น

10.png

การทดสอบการคงรักษามีความสำคัญเท่ากับการทดสอบการแก้ไข โมเดลที่ตีความทั้งฉากใหม่ในขณะที่แก้ไขเฉพาะจุดนั้นไม่สามารถใช้ได้สำหรับการรีทัชภาพถ่ายผลิตภัณฑ์หรือการพัฒนาฉากแบบวนซ้ำ

รายการตรวจสอบคะแนน

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#เกณฑ์ตรวจสอบ
1การแก้ไขครบ 3 จุดลบแมว
2การฟื้นฟูเบาะรองนั่งไม่มีรอยบุ๋มรูปแมวหรือขนสัตว์เหลือบนโซฟา
3ฟิสิกส์ของน้ำส้มเรขาคณิตแก้ว, การหักเหของน้ำแข็ง, และทิศทางเงาตรงกับแสงของถ้วยเดิม
4ตำแหน่งแว่นถูกต้องบนหนังสือเล่มกลาง (ไม่ใช่เล่มบนหรือล่าง)
5ผ้าโซฟาลายสานเพชรคงสภาพ โดยเฉพาะในโซนที่แก้ไข
6หนังสือไม่เปลี่ยนแปลงตำแหน่ง, ปก (แดง, เขียว, น้ำเงิน) และกองหนังสือคงเดิม
7โคมไฟไม่เปลี่ยนแปลงรูปร่าง, สถานะการเรืองแสง, และตำแหน่งคงเดิม
8วิวหน้าต่างไม่เปลี่ยนแปลงวิวเมืองยังคงเบลอและสม่ำเสมอ
9ผนังและพื้นไม่เปลี่ยนแปลงผนังสีขาวนวลและพื้นไม้สีอ่อนไม่เปลี่ยนแปลง
10แสงโดยรวมคงเดิมทิศทางแหล่งกำเนิดแสงด้านหลังขวาเดียวไม่เปลี่ยนแปลง

11.png Grok Imagine Image

12.png GPT-Image 2

Grok Imagine ทำการแก้ไขครบสามจุดที่ต้องการ แมวถูกลบและเบาะรองนั่งถูกฟื้นฟูอย่างสะอาด ไม่มีรอยบุ๋มหรือขนสัตว์ — ลวดลายผ้าในโซนที่แก้ไขคงสภาพดี แก้วน้ำส้มปรากฏในตำแหน่งที่ถูกต้อง อย่างไรก็ตาม แก้วน้ำส้มแสดงรูปแบบไฮไลท์ที่ไม่ตรงกับทิศทางแหล่งกำเนิดแสงนี้ ดูเหมือนว่าถูกประกอบด้วยโมเดลแสงอิสระมากกว่าที่จะรวมเข้ากับแสงที่มีอยู่ในฉาก ฐานของแก้วยังแสดงเงาสัมผัสไม่เพียงพอกับพื้นผิวโต๊ะกาแฟไม้สีเข้ม ทำให้เกิดเอฟเฟกต์ลอยตัวเล็กน้อยแต่สังเกตได้

GPT Image 2 ยังทำการแก้ไขครบสามจุด และแสดงให้เห็นถึงการคงรักษาฉากโดยรวมที่แข็งแกร่งกว่า การลบแมวสะอาดเท่ากัน แก้วน้ำส้มเรนเดอร์ดี มีตำแหน่งและทิศทางเงาที่ตรงกับแหล่งกำเนิดแสงจากหน้าต่างด้านขวา — เรขาคณิตแก้วและความทึบของของเหลวดูดีกว่าเวอร์ชันของ Grok แว่นอ่านหนังสือวางบนกองหนังสืออย่างชัดเจน ที่สำคัญคือวิวหน้าต่างถูกรักษาไว้ — เมืองภายนอกยังคงมองเห็นและเบลอ สอดคล้องกับภาพอ้างอิง ซึ่งเป็นจุดที่ Grok ล้มเหลว ผ้าโซฟา โคมไฟ ผนัง และพื้นคงสภาพทั้งหมด หนังสือดูเหมือนมีตำแหน่งและสีสม่ำเสมอ การเปลี่ยนแปลงที่สังเกตได้ประการหนึ่ง: ฉากโดยรวมดูสว่างขึ้นเล็กน้อยและมีความคมชัดที่เปลี่ยนไปจากต้นฉบับ แสดงให้เห็นถึงการตีความแสงโดยรวมใหม่เล็กน้อยแทนที่จะเป็นการคงรักษาในระดับพิกเซลอย่างแท้จริง — เป็นการเบี่ยงเบนเล็กน้อยแต่สังเกตได้

หมวด 6 · การผสานข้อมูลอ้างอิงหลายแหล่ง (I2I)

พรอมต์รวมข้อมูลอ้างอิงสามแหล่งที่แยกจากกัน: เอกลักษณ์ภาพพอร์ตเทรต (หญิงสาวเชื้อสายลาติน ตาสีเหลืองอำพัน ผมหยักศกสีน้ำตาลเข้ม), สไตล์ภาพประกอบสีน้ำ (ภูมิทัศน์ชนบทญี่ปุ่น เห็นลายเส้นพู่กัน บรรยากาศเทพนิยายอบอุ่น), และเค้าโครงฉาก (จัตุรัสหินกรวดยุโรปตอนพระอาทิตย์ตก เสาโคมไฟเหล็กหล่อ ซุ้มประตูหิน) ภารกิจ: สร้างภาพสีน้ำที่สอดคล้องกันภาพเดียวของบุคคลที่ระบุยืนอยู่ในฉาก — ไม่ใช่ภาพถ่ายพร้อมฟิลเตอร์ ไม่ใช่ภาพตัดปะ

13.png

14.png

15.png

การแยกข้อมูลอ้างอิงสามแหล่งเป็นการทดสอบที่ยากที่สุดในการทดสอบมาตรฐานนี้ โมเดลส่วนใหญ่ให้ความสำคัญกับข้อมูลอ้างอิงหนึ่งมากเกินไป หรือไม่สามารถสร้างการเรนเดอร์ผ่านสไตล์ได้

รายการตรวจสอบคะแนน

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#เกณฑ์ตรวจสอบ
1การแยกสามทางเอกลักษณ์, สไตล์, และโครงสร้างฉากปรากฏในสัดส่วนที่เท่าเทียมกัน
2การถ่ายโอนสไตล์เต็มรูปแบบเอาต์พุตเป็นสีน้ำทั้งภาพ — ไม่ใช่ภาพถ่าย + ฟิลเตอร์
3การคงรักษาเอกลักษณ์หลังสไตล์ดวงตาสีเหลืองอำพัน + โครงหน้าเป็นที่จดจำได้ผ่านการทำสีน้ำ
4โครงสร้างฉากคงเดิมหินกรวด, เสาโคมไฟ, และเค้าโครงซุ้มประตูคงสภาพ
5การเพิ่มเสื้อผ้าตามธรรมชาติเสื้อโค้ทเดินทางและกระเป๋าสะพายเพิ่มโดยไม่ทำลายองค์ประกอบ
6ความสม่ำเสมอของทิศทางแสงแสงยามพระอาทิตย์จากซ้ายกล้องมองเห็นบนหินกรวดและตัวบุคคล

16.png Grok Imagine Image

17.png GPT-Image 2

Grok Imagine ล้มเหลวในเกณฑ์หลัก: เอาต์พุตเป็นภาพเสมือนจริง ไม่ใช่สีน้ำ จัตุรัสหินกรวดและบุคคลยังคงมีความคมชัดของภาพถ่ายเต็มรูปแบบ โดยมีเพียงการผ่านพื้นผิวแบบจิตรกรรมเบา ๆ — ไม่มีลายเส้นพู่กันที่กำหนด สีเบล็ด หรือคุณภาพขอบที่วาดด้วยมือของ Ref 2 โครงสร้างฉาก เอกลักษณ์ เสื้อผ้า และทิศทางแสงผ่านทั้งหมด แต่การเรนเดอร์สื่อผิดประเภทโดยสิ้นเชิงเป็นการตัดสิทธิ์ในระดับหมวดหมู่ ไม่ใช่การหักคะแนนบางส่วน

GPT Image 2 บรรลุการเรนเดอร์สีน้ำอย่างแท้จริงทั่วทั้งเฟรม — อาคาร หินกรวด ท้องฟ้า และบุคคลล้วนมีลายเส้นพู่กันที่มองเห็นได้และการเบล็ดสีอ่อนที่สอดคล้องกับ Ref 2 โครงสร้างฉากจาก Ref 3 คงสภาพ เสาโคมไฟสว่าง และซุ้มประตูหินมองเห็นได้ในระยะกลาง เอกลักษณ์ถูกรักษาไว้บางส่วนผ่านการเปลี่ยนแปลงสไตล์ — ผมหยักศกสีเข้มและโครงหน้าเป็นที่จดจำได้ แม้ว่ารายละเอียดปลีกย่อยจะถูกทำให้เป็นนามธรรมตามที่คาด เสื้อโค้ท กระเป๋าสะพาย ทิศทางแสง และการมองตามพรอมต์ทั้งหมด นี่เป็นเอาต์พุตเดียวที่ทำงานจริงให้สำเร็จ

ทดลองใช้โมเดล Grok Imagine Image และ GPT Image 2 ผ่าน Atlas Cloud

การทดสอบมาตรฐานนี้สามารถทำซ้ำได้ ทั้ง Grok Imagine และ GPT Image 2 พร้อมใช้งานแล้วผ่าน Atlas Cloud — ไม่ต้องตั้งค่าการเรียกเก็บเงินแยกตามโมเดล ไม่ต้องรอคิว

ทำไมต้อง Atlas Cloud

  • คีย์ API หนึ่งเดียว, โมเดลมากกว่า 300 รายการ สลับระหว่าง Grok, GPT Image 2, Flux, Wan, Seedream และโมเดลอื่นๆ ในคลังได้โดยเปลี่ยนฟิลด์โมเดลเพียงฟิลด์เดียว คีย์เดียวกัน เอ็นด์พอยต์เดียวกัน แดชบอร์ดการเรียกเก็บเงินเดียวกัน — ไม่ว่าคุณจะรันการทดสอบมาตรฐานหกโมเดลหรือสร้างไปป์ไลน์การผลิตภาพ
  • ครอบคลุมทุกโมดอล LLM, ข้อความเป็นภาพ, ภาพเป็นภาพ, ข้อความเป็นวิดีโอ, ภาพเป็นวิดีโอ — ทั้งหมดภายใต้หลังคาเดียว หากเวิร์กโฟลว์ของคุณต้องการโมเดลภาษาเพื่อปรับแต่งพรอมต์และโมเดลภาพเพื่อสร้าง ทั้งสองอยู่ใน API เดียวกัน
  • ไม่มี cold start, ไม่มีเซอร์ไพรส์เรื่อง rate limit Atlas Cloud ทำงานบนโครงสร้างพื้นฐานการอนุมานที่ปรับให้เหมาะสมซึ่งออกแบบมาเพื่อปริมาณงาน คุณจะได้เวลาแฝงที่สม่ำเสมอไม่ว่าคุณจะเรียกหนึ่งครั้งหรือพันครั้ง
  • สร้างมาเพื่อเวิร์กโฟลว์การเปรียบเทียบ กรณีการใช้งานที่แน่นอนที่การทดสอบมาตรฐานนี้แสดงให้เห็น — การรันพรอมต์เดียวกันในหลายโมเดลและเปรียบเทียบผลลัพธ์ — คือสิ่งที่สถาปัตยกรรมของ Atlas Cloud ออกแบบมา คีย์เดียว บิลเดียว ความหลากหลายของโมเดลเต็มรูปแบบ

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด