ผู้สร้างส่วนใหญ่มักเลือกโมเดลรูปภาพจากตารางอันดับ Arena แบบคงที่ แล้วต้องพบกับปัญหาภาพบุคคลที่ดูสมจริงพังทลายลงหลังจากแก้ไขเพียงสามรอบ ในบททดสอบเชิงปฏิบัติจริงนี้ระหว่าง GPT Image 2.5 กับ Qwen Image 2.1 นั้น OpenAI ชนะในด้านความสมจริงแบบ zero-shot ขณะที่ Qwen 2.1 นำในด้านความเสถียรเชิงโครงสร้างของฉากหลังตลอดการแก้ไขซ้ำหลายรอบ
สรุปผลการทดสอบเชิงประจักษ์
| ตัวชี้วัดเชิงประจักษ์ | GPT Image 2.5 | คะแนน | Qwen Image 2.1 | คะแนน |
| ความสมจริง Zero-Shot | ผิวหนังสมจริง & แสงแบบ RAW ธรรมชาติ | ★★★★☆ (4.5) | รายละเอียดคมชัด; ผิวเนียน/มันเล็กน้อย | ★★★☆☆ (3.0) |
| ความเสถียรหลายรอบ | สัญญาณรบกวนทั่วภาพ & สัดส่วนเปลี่ยนไปเมื่อถึงรอบที่ 5 | ★★★☆☆ (3.5) | ฉากหลังถูกล็อก; ไม่มีการเสื่อมโครงสร้างเลย | ★★★★☆ (4.0) |
| การรักษาเนื้อวัสดุ | ผ้าขนสัตว์สีเข้มและพื้นผิวเงาสมจริง | ★★★★☆ (4.5) | คอนทราสต์สูง; เสี่ยงต่อการกลายเป็นมัน/พลาสติก | ★★★☆☆ (3.0) |
| การควบคุมการแก้ไข | จุดระบุตำแหน่งภาพ; เข้ารหัสใหม่ทั้งแคนวาส | ★★★★☆ (4.0) | มาสก์แบบระบาย & RGBA โปร่งใสแบบเนทีฟ | ★★★★☆ (4.5) |
| เหมาะที่สุดสำหรับ | สินทรัพย์เชิงพาณิชย์ระดับไฮเอนด์แบบครั้งเดียว | 4.1 / 5 | เวิร์กโฟลว์แบบโฮสต์เอง & แก้ไขฉากหลังแบบล็อก | 3.6 / 5 |
ประเด็นสำคัญ
- GPT Image 2.5 ทำความสมจริงแบบครั้งเดียวได้ยอดเยี่ยม ให้ผลลัพธ์ความโปร่งแสงของผิวหนังที่สมจริงและช่วงไดนามิกแบบ RAW ในการเรนเดอร์ครั้งเดียว อย่างไรก็ตาม การเข้ารหัสใหม่ทั้งแคนวาสทำให้เกิดการสะสมของสัญญาณรบกวนทั่วภาพและการย่อสัดส่วนทางกายวิภาคเมื่อถึงรอบที่ 5
- Qwen Image 2.1 ใช้ DiT 32 เลเยอร์พร้อมการล็อก KV cache เพื่อรักษาเรขาคณิตของฉากหลังให้ปราศจากอาร์ติแฟกต์โดยสมบูรณ์ตลอดการแก้ไขหลายรอบ ข้อแลกเปลี่ยนอยู่ที่การประมวลผลเฉพาะจุด: การแก้ไขมาสก์เป้าหมายซ้ำๆ มักทำให้ไฮไลต์แบบ specular อิ่มตัวเกินไป เปลี่ยนผิวธรรมชาติให้กลายเป็นมันและผ้าแมตต์ให้กลายเป็นมันวาว
เลือก GPT Image 2.5 เมื่อสิ่งสำคัญอันดับแรกของคุณคือความสมจริงแบบครั้งเดียวที่สมบูรณ์แบบ เลือก Qwen Image 2.1 หากไปป์ไลน์ของคุณต้องการการควบคุมแบบโฮสต์เอง การแก้ไขฉากหลังแบบล็อก หรือการตัดภาพ RGBA แบบเนทีฟ
ความสมจริงจากพรอมต์เดียว: ฟิสิกส์ของแสง พื้นผิวผิวหนัง และความเที่ยงตรงของวัสดุ
ผู้สร้างที่ใช้ prompt engineering มักใช้เวลาหลายชั่วโมงในการปรับพรอมต์แสงอย่างละเอียด แต่กลับพบว่าข้อบกพร่องทางภาพนั้นมีต้นตอจากการเรนเดอร์พื้นฐานมากกว่าการแก้ไขซ้ำ การทดสอบความเที่ยงตรงทางภาพแบบ zero-shot ก่อนออกคำสั่งแก้ไขจะสร้างเส้นฐานควบคุมที่จำเป็น ช่วยให้ช่างภาพแยกข้อจำกัดของโมเดลที่มีอยู่เดิมออกจากการเสื่อมสภาพจากการแก้ไขหลายรอบที่แท้จริง
การทดสอบที่ 1: รายละเอียดจุลภาคของผิวหนังมนุษย์ภายใต้แสงตรงที่รุนแรง
เพื่อประเมินกลไกการเรนเดอร์ดิบภายใต้สภาวะกดดัน ทั้งสองโมเดลได้รับการทดสอบด้วยพรอมต์ภาพระยะใกล้แบบไม่แต่งเติมที่มาพร้อมแสงแดดตอนเที่ยงวันอันเข้มข้น ความแปรผันของพื้นผิวผิวหนัง และไมโครเอกซ์เพรสชันทางกายวิภาค

ข้อสังเกตทางภาพที่สำคัญ & รายละเอียดโดยละเอียด:
- การกระเจิงใต้ผิวหนัง & การเปลี่ยนผ่านของเงา (GPT Image 2.5 ชนะ):
GPT Image 2.5 จำลองฟิสิกส์เชิงแสงได้อย่างแม่นยำสูง ในการตั้งค่าภาพบุคคลด้วยเลนส์ 85 มม. แสงกระจายอย่างเป็นธรรมชาติทั่วแก้มและหน้าผากเพื่อสร้างการกระเจิงใต้ผิวหนังที่สมจริง พร้อมการลดทอนเงาที่ราบรื่นรอบดวงตาและสันจมูก
- การปฏิบัติตามพรอมต์อย่างตรงตัว vs. ความเป็นพลาสติก (ข้อแลกเปลี่ยนของ Qwen Image 2.1):
Qwen Image 2.1 ตอบสนองต่อพรอมต์ที่มีรายละเอียดได้อย่างใกล้ชิด เรนเดอร์ขนอ่อนบนใบหน้าและความไม่สม่ำเสมอของเม็ดสีที่แก้มได้อย่างแม่นยำ อย่างไรก็ตาม ไฮไลต์แบบ specular อาจดูรุนแรงเกินไป ทำให้เกิดความมันวาวแบบประดิษฐ์ทั่วจมูกและหน้าผาก
- ไมโครเอกซ์เพรสชัน & ความแม่นยำทางกายวิภาค:
GPT Image 2.5 เรนเดอร์กล้ามเนื้อใบหน้าที่ผ่อนคลายอย่างน่าทึ่ง พร้อมริ้วรอยรอบดวงตาและรอยพับริมฝีปากที่แม่นยำทางกายวิภาค ขณะที่ Qwen 2.1 บรรลุความคมชัดของพื้นผิวสูง แต่พื้นผิวผิวหนังแสดงการซ้ำของรูปแบบจุลภาคเมื่อซูมเข้า เผยให้เห็นรากฐานการแพร่กระจายแบบสังเคราะห์เมื่อเจอกับแสงที่มีคอนทราสต์สูง
การทดสอบที่ 2: ความเที่ยงตรงของผ้า & วัสดุ (ความหยาบของผ้าขนสัตว์ vs. ไฮไลต์ขอบ)
การเข้าใจปฏิสัมพันธ์ทางกายภาพของวัสดุ เช่น การดูดซับแสงบนผ้าขนสัตว์แบบแมตต์ เทียบกับพื้นผิวเส้นด้ายที่ไม่สม่ำเสมอบนผ้าลินินทอ มีความสำคัญอย่างยิ่งต่อเวิร์กโฟลว์อีคอมเมิร์ซและแฟชั่นเชิงพาณิชย์

ข้อสังเกตทางภาพที่สำคัญ & การตอบสนองของวัสดุ:
- การแยกผ้าสีเข้ม & ความลึกของเงา (GPT Image 2.5 ชนะ):
GPT Image 2.5 จัดการโทนสีเข้มความถี่ต่ำได้โดยไม่สูญเสียรายละเอียด รอยพับ การเย็บปก และเงาจุลภาคที่ละเอียดอ่อนยังคงมองเห็นได้บนเสื้อแจ็คเก็ตผ้าขนสัตว์สีดำ สมดุลด้วยพื้นผิวการทอที่สมจริงและรอยตึงของกระดุมบนเสื้อผ้าลินินสีขาว
- การแยกขอบ & ความแม่นยำของแสงขอบ (จุดแข็งของ Qwen Image 2.1):
Qwen Image 2.1 แสดงการควบคุมแสงทิศทางตรงได้อย่างโดดเด่น แสงขอบที่จับขอบของเสื้อโค้ทสีเข้มเน้นเส้นใยขนสัตว์ระดับจุลภาคตามไหล่และแขนได้อย่างชัดเจน
- ความหนาแน่นของวัสดุ & การบีบอัดเงา (ข้อจำกัดของ Qwen Image 2.1):
แม้ Qwen 2.1 จะสร้างเส้นรอบนอกที่คมชัดเป็นพิเศษ แต่การเรนเดอร์ผ้าขนสัตว์สีเข้มมีแนวโน้มไปทางการบีบอัดเงาที่บดขยี้สีดำในพื้นที่ที่ไม่มีแสงสว่าง รอยพับด้านในของแจ็คเก็ตสูญเสียรูปแบบการทอที่ละเอียดอ่อนเมื่อเทียบกับระดับ Sunburst ของ OpenAI ส่งผลให้การตอบสนองของวัสดุโดยรวมแบนราบลงภายใต้เงา
การทดสอบที่ 3: การถ่ายภาพสินค้า พื้นผิวโลหะขัด & การสะท้อนแบบ Specular
การประเมินไฮไลต์แบบ specular บนโลหะ การหักเหของแก้ว และการสะท้อนของสภาพแวดล้อม เผยให้เห็นว่าโมเดลปฏิบัติตามไปป์ไลน์การเรนเดอร์ PBR ได้อย่างซื่อสัตย์เพียงใดในการถ่ายภาพสินค้าเชิงพาณิชย์

ข้อสังเกตทางภาพที่สำคัญ & ฟิสิกส์เชิงแสง:
- ฟิสิกส์พื้นผิวโลหะ & การสะท้อนแบบแอนไอโซทรอปิก (GPT Image 2.5 ชนะ):
GPT Image 2.5 จัดการอะลูมิเนียมขัดได้อย่างแม่นยำสูง ลายเส้นแนวนอนบนขอบล่างสะท้อนไฮไลต์แบบ specular ตามพื้นผิวอย่างเป็นธรรมชาติ หลีกเลี่ยงลักษณะแบนของโลหะทาสี นอกจากนี้ยังจัดวางองค์ประกอบ UI ที่คมชัดและอ่านได้อย่างสะอาดตาภายใต้การสะท้อนของแก้วที่สมจริง
- ไฮไลต์ขอบแบบ Specular ที่คมกริบ & รอยเปื้อนบนแก้ว (จุดแข็งของ Qwen Image 2.1):
ตามสมมติฐานสำหรับSubjects ด้านการออกแบบอุตสาหกรรม Qwen Image 2.1 โดดเด่นในการเรนเดอร์การสะท้อนแบบ specular ที่มีคอนทราสต์สูง การสะท้อนแสงซอฟต์บ็อกซ์โดยตรงบนพื้นผิวแก้วมีเรขาคณิตขอบเขตที่สะอาดและคมชัด อีกทั้งยังปฏิบัติตามคำขอรอยนิ้วมือเปื้อนอย่างเคร่งครัด เก็บรายละเอียดความไม่สมบูรณ์ระดับจุลภาคบนแก้วได้อย่างมีพลังทางสายตา
- การลดทอนการสะท้อนบนโต๊ะ & การแยกความแตกต่างของวัสดุ:
แม้ Qwen 2.1 จะเรนเดอร์ขอบไฮไลต์ที่สะดุดตา แต่กรอบโลหะมีแนวโน้มไปทางพลาสติกสีเงินเนียนในพื้นที่ที่มีเงา ในทางกลับกัน GPT Image 2.5 รักษาความแตกต่างของวัสดุที่ชัดเจนระหว่างด้านหน้าอะลูมิเนียมขัด ด้านหลังพลาสติกแมตต์สีเข้ม และจอแก้วมันวาว พร้อมรักษาการลดทอนของ specular ตามธรรมชาติบนโต๊ะสีเข้ม
การทดสอบที่ 4: สภาพแวดล้อม HDR ที่ซับซ้อน ช่วงไดนามิก & หมอกบรรยากาศ
สภาพแวดล้อมที่มีคอนทราสต์สูง เช่น ถนนหลังฝนที่มีแสงย้อน พร้อมพื้นเปียกสะท้อนแสงและเงาที่หนักหน่วง เผยให้เห็นข้อจำกัดของความแม่นยำในการเปิดรับแสงของโมเดลได้อย่างชัดเจน

ข้อสังเกตทางภาพที่สำคัญ & กลไกการเปิดรับแสง:
- ช่วงไดนามิกที่กว้าง & การรักษารายละเอียดในเงา (GPT Image 2.5 ชนะ):
GPT Image 2.5 แสดงการเลียนแบบเซ็นเซอร์กล้องที่เหนือกว่า เลียนแบบการเปิดรับแสงแบบ RAW ฟูลเฟรม แม้มีแสงแดดช่วงโกลเดนอาวร์สาดตรงผ่านสถาปัตยกรรมฉากหลัง ก็ยังรักษารายละเอียดในเงาใต้รถบัสสองชั้นและแท็กซี่สีดำทางซ้ายได้อย่างน่าทึ่ง เรนเดอร์ข้อความป้ายทะเบียนและโครงยางได้ชัดเจนโดยไม่ทำให้ไฮไลต์สว่างในท้องฟ้าเบิร์นเอาต์
- ความชัดเจนของการสะท้อนบนพื้น & ความคมชัดของขอบ (จุดแข็งของ Qwen Image 2.1):
Qwen Image 2.1 โดดเด่นในการเรนเดอร์การสะท้อนของสภาพแวดล้อมที่คมชัด แอสฟัลต์เปียกในฉากหน้ากักเก็บการสะท้อนแบบกระจกที่คมกริบของคนเดินเท้าและอาคารหินสูง ความชัดเจนทางเรขาคณิตโดยรวมของหน้าต่างอาคารที่ซับซ้อนยังคงสะอาดตาเป็นพิเศษ
- การตัดไฮไลต์ & การลดทอนของบรรยากาศ:
แม้ Qwen 2.1 จะเรนเดอร์ริ้วแสงแบบ specular ที่สะดุดตาบนพื้นเปียก แต่เอนจินการเปิดรับแสงของมันมีปัญหาการตัดไฮไลต์เล็กน้อยในโซนแสงย้อนที่รุนแรง ส่งผลให้เกิดแสงแฟลร์สีขาวบริสุทธิ์ในจุดที่ดวงอาทิตย์บรรจบเส้นขอบฟ้า ในทางกลับกัน GPT Image 2.5 จัดการหมอกเชิงปริมาตรและการลดทอนแสงสีทองที่ละเอียดอ่อนได้อย่างแม่นยำทางแสงสูงกว่ามาก หลีกเลี่ยงอาร์ติแฟกต์การตัดไฮไลต์ที่รุนแรง
สรุปคะแนน: การทดสอบความสมจริง (การทดสอบที่ 1–4)
เพื่อสังเคราะห์ผลการค้นพบของเราจากการทดสอบความสมจริงที่เข้มงวดทั้งสี่ ตารางด้านล่างเน้นจุดที่แต่ละโมเดลโดดเด่นในตัวชี้วัดความเที่ยงตรงทางภาพที่สำคัญแปดประการ
| หมวดหมู่ | GPT Image 2.5 | Qwen Image 2.1 | ความแตกต่างทางแสงหลัก |
| รูขุมขนผิว | ✓ | GPT 2.5 เรนเดอร์พื้นผิวจุลภาคผิวหนังที่สมจริงและรูขุมขนที่ละเอียดอ่อนโดยไม่มีการแต่งผิวแบบ AI | |
| ไมโครเอกซ์เพรสชัน | ✓ | GPT 2.5 จับความตึงของกล้ามเนื้อใบหน้าและความอบอุ่นแบบอินทรีย์ หลีกเลี่ยงสีหน้าแข็งทื่อ | |
| ความลึกของเงา | ✓ | GPT 2.5 รักษารายละเอียดเงามืดใต้ยานพาหนะและอาคารด้วยช่วงไดนามิกแบบ RAW เต็มรูปแบบ | |
| พื้นผิวผ้า | ✓ | GPT 2.5 เรนเดอร์ลายทอผ้าขนสัตว์ธรรมชาติและขุยเส้นใยอินทรีย์ที่สัมผัสได้โดยไม่คมเกินไป | |
| ไฮไลต์แบบ Specular | ✓ | Qwen 2.1 สร้างการสะท้อนแบบ specular ที่คมชัดและมีคอนทราสต์สูงบนพื้นเปียกและพื้นผิวโลหะ | |
| วัสดุสินค้า | ✓ | GPT 2.5 บรรลุความสมดุลระหว่างการแพร่กระจาย/specular ที่แม่นยำทางกายภาพทั่วพื้นผิวแมตต์และมันวาว | |
| ขอบสะอาด | ✓ | Qwen 2.1 โดดเด่นในเส้นเรขาคณิตที่คมกริบ สถาปัตยกรรมพื้นผิวแข็ง และการกำหนดขอบที่ชัดเจน | |
| ความสมจริงตามธรรมชาติ | ✓ | GPT 2.5 มอบลุคกล้องสไตล์สารคดีที่ไม่ผ่านการแต่ง ให้ความรู้สึกปราศจาก "ความเงาแบบ AI" |
ประเด็นสำคัญจากการทดสอบพรอมต์เดียว:
- GPT Image 2.5 ผู้ชนะโดยรวมสำหรับความสมจริงแบบสารคดี: ครองตลาดในด้านฟิสิกส์ของมนุษย์อินทรีย์ ผิว/สีหน้า ความลึกของเงาที่ซับซ้อน และวิทยาศาสตร์สีที่เป็นธรรมชาติ หลีกเลี่ยงการตัดไฮไลต์ในฉากคอนทราสต์สูง ทำให้เป็นตัวเลือกที่ต้องการสำหรับการถ่ายภาพบุคคลเชิงพาณิชย์ การถ่ายภาพถนนสมจริง และการออกแบบบรรณาธิการ
- Qwen Image 2.1 เหมาะที่สุดสำหรับสถาปัตยกรรมที่คมชัด & พื้นผิวแข็ง: แสดงพลังทางสายตาที่ยอดเยี่ยมผ่านขอบที่สะอาดเป็นพิเศษ ไฮไลต์แบบ specular ที่คมชัด และความแม่นยำทางสถาปัตยกรรม แม้จะเน้นคอนทราสต์ทางแสงที่สูงกว่าพร้อมการตัดไฮไลต์เป็นครั้งคราว
การทดสอบแบบ Stress Test การแก้ไขซ้ำหลายรอบ: การทดสอบการเสื่อมสภาพ 5 รอบ
ผู้กำกับฝ่ายสร้างสรรค์มักเห็นภาพบุคคล AI ที่สมบูรณ์แบบกลายเป็นโคลนพิกเซลหลังจากการแก้ไขพรอมต์ต่อเนื่องเพียงสามครั้ง เพื่อประเมินความเที่ยงตรงของพรอมต์หลายขั้นตอนโดยไม่พึ่งพาคำกล่าวอ้างทางการตลาดของผู้ขาย ทั้งสองระบบได้รับการทดสอบความเครียดการแก้ไข 5 รอบมาตรฐาน
วิธีการทดสอบ 5 ขั้นตอน
การทดสอบความเครียดวัดการรักษาประธาน การรักษาการสลับฉากหลัง และการสูญเสียคุณภาพทีละรอบตลอดห้าคำสั่งแก้ไขต่อเนื่อง:
- รอบที่ 1 (ฐาน): ภาพบุคคลสมจริงรายละเอียดสูงในฉากสตูดิโอ
- รอบที่ 2 (แก้ไขประธาน): เปลี่ยนสีเสื้อผ้าและวัสดุแจ็คเก็ตโดยรักษาอัตลักษณ์ใบหน้า
- รอบที่ 3 (สลับฉากหลัง): ย้ายประธานจากสตูดิโอไปยังถนนในเมืองกลางแจ้งตอนพระอาทิตย์ตก
- รอบที่ 4 (ปรับแสง): เปลี่ยนแหล่งกำเนิดแสงแวดล้อมเป็นแสงสะท้อนนีออนกลางคืนคอนทราสต์สูง
- รอบที่ 5 (เพิ่มรายละเอียดจุลภาค): เพิ่มหยดน้ำฝนสมจริงและการสะท้อนน้ำบนผิวหนัง
ประสิทธิภาพของโมเดลตลอดรอบแก้ไขซ้ำ
การประเมินทั้งสองเอนจินทางภาพทีละรอบเน้นความแตกต่างเชิงสถาปัตยกรรมที่สำคัญในวิธีที่สัญญาณรบกวนใน latent space สะสมระหว่างการแก้ไขหลายรอบ
| รอบการแก้ไข | ประสิทธิภาพ GPT Image 2.5 | ประสิทธิภาพ Qwen Image 2.1 |
| รอบที่ 1–2 | การรักษาประธานและปรับพื้นผิวเสื้อผ้าอย่างไร้ที่ติ; แสงขอบช่วงโกลเดนอาวร์ห่อหุ้มอย่างเป็นธรรมชาติระหว่างการสลับฉากหลังรอบที่ 2 | การรักษาใบหน้าที่คมชัดในรอบที่ 1; เปลี่ยนฉากหลังได้อย่างมีประสิทธิภาพในรอบที่ 2 แม้การห่อหุ้มแสงแวดล้อมและการเบลอฉากหลังจะดูไม่เป็นธรรมชาติเท่า GPT 2.5 |
| รอบที่ 3 | การปรับแสงนีออนและฉากหลังอย่างราบรื่นด้วยโทนผิวสมจริงและการเรืองแสงแวดล้อมที่ละเอียดอ่อน | ไฮไลต์นีออนอิ่มตัวเกินไป สร้างพื้นผิวผิวหนังที่มันและเป็นพลาสติกอย่างไม่เป็นธรรมชาติ |
| รอบที่ 4 | ปรับแสงโครงหน้าได้อย่างสะอาด; รักษาพื้นผิวเสื้อโค้ทผ้าฝ้ายแมตต์พร้อมความชื้นบนพื้นผิวที่ละเอียดอ่อน | การสลายวัสดุอย่างรุนแรง: เสื้อโค้ทแมตต์กลายเป็นเสื้อกันฝนไวนิล/พลาสติกมันวาวผิดธรรมชาติ |
| รอบที่ 5 | ขยายเป็นเต็มตัว แต่ให้สัดส่วนร่างกายที่ดูแปลกตาและการย่อสัดส่วนที่ไม่เป็นธรรมชาติ | กรอบสัดส่วนที่ดี: เรนเดอร์ท่าเดินเต็มตัวที่แม่นยำทางกายวิภาค แม้การสะท้อนผิวหนังมัน persistent จะลดความสมจริงโดยรวม |
ความก้าวหน้าของการทำซ้ำทางภาพ (การทดสอบ 5 รอบ

ลำดับการทำซ้ำหลายรอบของ GPT Image 2.5 แผงที่ 1–6 และภาพแรกคือภาพฐาน
ระหว่างการแก้ไขซ้ำของ GPT Image 2.5 โมเดล Sunburst รักษาอัตลักษณ์ใบหน้าที่แข็งแกร่งและการห่อหุ้มแสงที่สมจริงตลอดทุกรอบ ผสานแสงย้อนสภาพแวดล้อมที่ซับซ้อนอย่างเป็นธรรมชาติระหว่างการสลับฉากหลังและปรับแสง (รอบที่ 2 & 3) ผสมผสานประธานเข้ากับสภาพแวดล้อมนีออนและโกลเดนอาวร์ได้อย่างไร้รอยต่อโดยไม่มีอาร์ติแฟกต์จากการคอมโพสิตหรือการสลายพื้นผิวผ้า อย่างไรก็ตาม ระหว่างการขยายเป็นเต็มตัวในรอบที่ 5 มันสร้างสัดส่วนร่างกายที่บิดเบี้ยวเล็กน้อยและการย่อสัดส่วนที่ดูแปลกตา

ลำดับการทำซ้ำหลายรอบของ Qwen Image 2.1 แผงที่ 1–6 และภาพแรกคือภาพฐาน
ในทางกลับกัน Qwen Image 2.1 จัดการการรักษาประธานและการวางฉากหลังในช่วงแรกได้ดี แต่แสดงการเลื่อนของ latent ที่เห็นได้ชัดเมื่อการแก้ไขสะสม แม้การสลับฉากหลังในรอบที่ 2 จะมั่นคงเชิงโครงสร้าง แต่การผสานแสงของมันละเอียดอ่อนน้อยกว่า GPT การปรับแสงและเพิ่มฝนในรอบต่อมา (รอบที่ 3 & 4) ทำให้เกิดการเปลี่ยนวัสดุ เปลี่ยนพื้นผิวผ้าฝ้ายของเครื่องแต่งกายให้กลายเป็นเสื้อกันฝนพลาสติกมันวาว พร้อมไฮไลต์ผิวหนังที่อิ่มตัวเกินไป
ปรากฏการณ์อาร์ติแฟกต์แบบ "Blocky": ทำไมการแก้ไขรูปภาพซ้ำจึงลดคุณภาพ
การแก้ไขพรอมต์ซ้ำๆ มักกัดกร่อนพื้นผิวจุลภาค เปลี่ยนเส้นผมที่ละเอียดอ่อนให้กลายเป็นอาร์ติแฟกต์แบบบล็อก ทำให้การสะท้อนผิวหนังอิ่มตัวเกินไป และกลายพันธุ์ผ้าแมตต์ให้เป็นพลาสติกมันวาว** **Rูปแบบนี้เกิดขึ้นโดยตรงจากความแตกต่างเชิงสถาปัตยกรรมพื้นฐานในวิธีที่เอนจินทางภาพจัดการการแปลง latent space ตลอดการแก้ไขต่อเนื่อง
กลไกทางสถาปัตยกรรม vs. การเสื่อมสภาพของพิกเซล
| พารามิเตอร์ทางเทคนิค | ไปป์ไลน์ OpenAI GPT Image 2.5 | กรอบ DiT ของ Qwen Image 2.1 |
| วิธีการเข้ารหัสใหม่ | การเข้ารหัส VAE ใหม่ทั้งแคนวาส | การใช้ KV cache แบบ Prefix ซ้ำ & การมาสก์แบบชังก์ |
| การสะสมของสัญญาณรบกวน | การเลื่อนของ latent space ทั่วไป | จำกัดเฉพาะมาสก์การแก้ไขเฉพาะจุด |
| ผลที่สังเกตได้ในการทดสอบ 5 รอบ | การผสานแสงแวดล้อมอย่างเป็นธรรมชาติ; การสะสมสัญญาณรบกวนทั่วภาพเล็กน้อยและการเปลี่ยนสัดส่วน/กายวิภาคในรอบหลังๆ | ความแข็งเกร็งเชิงโครงสร้างของฉากหลังสูง; การประมวลผล latent เฉพาะจุดทำให้ specular อิ่มตัว (ผิวหนังมัน) และวัสดุสลาย (ผ้าฝ้ายเป็นไวนิล) |
| กลยุทธ์แก้ไข | การสุ่มตัวอย่างแบบขยาย (โหมด Sunburst) | ความสนใจแบบผสมความละเอียด & การแยกมาสก์ |
เชื่อมโยงสถาปัตยกรรมกับสิ่งที่พบในการทดสอบ
การเข้าใจว่าการเลือกสถาปัตยกรรมส่งผลต่อการเสื่อมสภาพของพิกเซลหลายรอบอย่างไร อธิบายผลการทดสอบความเครียด 5 รอบของเราได้โดยตรง:
- การเข้ารหัส Latent ใหม่ทั้งหมด (GPT Image 2.5):
ในเวิร์กโฟลว์ฟูลเฟรม GPT Image 2.5 เข้ารหัสแคนวาส latent ทั้งหมดใหม่ในแต่ละรอบการแก้ไข ตามที่แสดงในการทดสอบ ความสมจริงจากพรอมต์เดียว ของเรา วิธีแบบทั่วทั้งภาพนี้โดดเด่นในการคำนวณปฏิสัมพันธ์ทางแสงที่ซับซ้อน เช่น การคำนวณแสงขอบโกลเดนอาวร์ตามธรรมชาติทั่วผมและผิวหนังในรอบที่ 2 อย่างไรก็ตาม เนื่องจากทุกครั้งประมวลผลทั้งแคนวาส สัญญาณรบกวนการแพร่กระจายจึงสะสมทั่วภาพตลอดหลายรอบ เมื่อถึงรอบที่ 4 และ 5 สิ่งนี้สร้างการสูญเสียรายละเอียดความถี่สูงที่ละเอียดอ่อน การควอนไทซ์แบบมาโครพิกเซลในเงา และการย่อสัดส่วนทางกายวิภาคระหว่างการขยายกรอบเต็มตัว
- การมาสก์เฉพาะจุด & การใช้ Cache ซ้ำ (Qwen Image 2.1):
สถาปัตยกรรม Single-Stream DiT 32 เลเยอร์ของ Qwen 2.1 ใช้การมาสก์ระดับชังก์และการใช้ KV cache แบบ Prefix ซ้ำ การคำนวณบริบทแบบคงที่ล็อกพื้นที่ที่ยังไม่แก้ไขระหว่างขั้นตอน denoising ขจัดความสูญเสียจากการเข้ารหัสใหม่ทั่วพิกเซลฉากหลังและรักษาเส้นสถาปัตยกรรมที่คมกริบ อย่างไรก็ตาม เนื่องจากการอัปเดตเชิงสร้างสรรค์ถูกจำกัดและประมวลผลอย่างหนักภายในมาสก์เฉพาะจุด การประมวลผลซ้ำบนพื้นที่ย่อยเดียวกันจึงมักทำให้ไฮไลต์แบบ specular อิ่มตัวเกินไป อธิบายการเปลี่ยนไปสู่การสะท้อนผิวหนังมันในรอบที่ 3 และการเปลี่ยนวัสดุของเสื้อโค้ทจากผ้าฝ้ายแมตต์เป็นไวนิลมันวาวในรอบที่ 4
แม้โหมด Sunburst ของ GPT Image 2.5 จะใช้การสุ่มตัวอย่างแบบขยายเพื่อรักษาฟิสิกส์แสงและพื้นผิวผิวหนังอินทรีย์ที่เหนือกว่าตลอดรอบแรกๆ แต่การประมวลผลทั่วทั้งภาพของมันก็ทำให้เกิดการเลื่อนทั่วแคนวาสที่ละเอียดอ่อนในที่สุด ในทางกลับกัน Qwen Image 2.1 ป้องกันการเสื่อมสภาพของเรขาคณิตฉากหลังโดยการล็อกโทเคนที่ยังไม่แก้ไขผ่าน KV cache แต่ต้องจัดการพรอมต์อย่างระมัดระวังเพื่อหลีกเลี่ยงการอิ่มตัวของไฮไลต์เฉพาะจุดในสายการแก้ไขที่ยาวนาน
กลไกการแก้ไขและการควบคุมเวิร์กโฟลว์: ไฮไลต์ความคิดเห็น vs การมาสก์เฉพาะจุด
การพรอมต์โมเดล AI ให้เปลี่ยนแจ็คเก็ตของนางแบบมักส่งผลให้ระบบออกแบบฉากหลังใหม่หรือเปลี่ยนลักษณะใบหน้า กลไกการป้อนข้อมูลที่แม่นยำกำหนดว่าการอัปเดตจะอยู่เฉพาะจุดหรือทำให้ส่วนที่เหลือขององค์ประกอบเสียหายระหว่างการแก้ไขซ้ำ
การเปรียบเทียบ GPT Image 2.5 กับ Qwen Image 2.1 เผยให้เห็นกรอบการดำเนินงานที่แตกต่างกันสองแบบสำหรับการรักษาความเที่ยงตรงของพรอมต์หลายขั้นตอน
อินเทอร์เฟซการควบคุม & กลไกการป้อนข้อมูล
| ความสามารถของคุณสมบัติ | เครื่องมือ Canvas ของ GPT Image 2.5 | ระบบแก้ไขของ Qwen Image 2.1 |
| การเลือกเป้าหมายเฉพาะจุด | หมุดพิกัด & เส้นเวกเตอร์ | คำอธิบายแบบระบาย วงกลม หรือไฟล์ไบนารีมาสก์ |
| การยึดภาพอ้างอิง | รองรับภาพอ้างอิงสูงสุด 16 ภาพ | รองรับภาพอ้างอิงสูงสุด 10 ภาพ |
| การแยกพิกเซล | การเข้ารหัส latent ใหม่ทั้งเฟรม | KV cache แบบ Prefix พร้อมการล็อกมาสก์ระดับชังก์ |
| ตัวเลือกเอาต์พุตเลเยอร์ | เอาต์พุต RGB มาตรฐาน | การสร้าง RGBA โปร่งใสแบบเนทีฟ |
คำอธิบายแบบหมุดเทียบกับการผูกมาสก์
OpenAI อาศัยหมุดพิกัดและเส้นเวกเตอร์วาดมือภายในอินเทอร์เฟซ ChatGPT การวางหมุดพิกัดผ่านฟีเจอร์แก้ไขด้วยความคิดเห็นของ ChatGPT ส่งสัญญาณการอัปเดตข้อความเชิงความหมายไปยังโซนเป้าหมาย ขณะที่เวิร์กโฟลว์แบบร่างนำทางใช้เส้นเวกเตอร์ที่วาดเพื่อกำหนดทิศทางเรขาคณิตเลย์เอาต์ การผสมการยึดภาพอ้างอิงกับภาพอินพุตสูงสุด 16 ภาพช่วยให้สไตล์ประธานสอดคล้องกันตลอดความแปรผัน อย่างไรก็ตาม เนื่องจากโมเดลพื้นฐานเข้ารหัสแคนวาสภาพทั้งหมดใหม่ อาจเกิดการไหลของพิกเซลเล็กน้อยเกินขอบเขตพิกัดหมุดได้
ในทางกลับกัน Qwen Image 2.1 บังคับใช้การแก้ไขมาสก์เฉพาะจุดอย่างเข้มงวดโดยให้ผู้ใช้วาดคำอธิบาย วาดวงกลมสีรอบเป้าหมายการแก้ไขหลายจุด หรือจัดหาไฟล์ไบนารีมาสก์แยกต่างหาก ความสามารถที่โดดเด่นคือการสร้าง RGBA โปร่งใสแบบเนทีฟ ช่วยให้ผู้สร้างสร้างหรือแก้ไขการตัดภาพโปร่งใสโดยตรงด้วยช่องอัลฟาจริง ข้ามเครื่องมือลบฉากหลังแบบโพสต์โปรเซสซิง แม้การยึดภาพอ้างอิงจะรองรับภาพอินพุตสูงสุด 10 ภาพ การล็อกพิกเซลที่ยังไม่แก้ไขไว้หลังขอบเขตมาสก์ที่ชัดเจนให้ความแม่นยำตามเจตนาของผู้ใช้ที่สูงกว่าและป้องกันการเลื่อนทั่วภาพที่ไม่ต้องการ
วิธีแก้ปัญหาเชิงปฏิบัติเพื่อป้องกันการสะสมของอาร์ติแฟกต์ระหว่างการแก้ไข AI หลายรอบ
การเห็นภาพคอมโพสิตเชิงพาณิชย์ที่ขัดเกลาแล้วเสื่อมสภาพเป็นพิกเซลเบลอเมื่อถึงการแก้ไขพรอมต์ครั้งที่สี่ บังคับให้ทีมโปรดักชันต้องโยนงานแก้ไขหลายชั่วโมงทิ้ง การนำวิธีแก้ปัญหาเชิงโครงสร้างสำหรับการแก้ไขหลายรอบมาใช้ช่วยให้ผู้สร้างรักษาความคมชัดของภาพและหลีกเลี่ยงการเสื่อมสภาพของพิกเซลในเวิร์กโฟลว์การแก้ไขที่ซับซ้อน
กลยุทธ์การผลิตสำหรับการแก้ไขภาพ AI ที่สะอาด
การใช้เทคนิคการผลิตแบบตรงเป้าหมายสี่ประการช่วยให้ทีมป้องกันการเสื่อมสภาพของภาพ AI ระหว่างการสร้างหลายรอบ:
- การยึดอ้างอิงใหม่: การใส่ภาพสร้างฐานรอบที่ 1 ดั้งเดิมกลับเข้าไปเป็นภาพอ้างอิงที่ชัดเจนพร้อมกับพรอมต์แก้ไขล่าสุด บังคับให้โมเดลจัดสัดส่วนใบหน้าและเวกเตอร์แสงฉากหลังใหม่ เทคนิคการยึดภาพอ้างอิงใหม่นี้ช่วยรีเซ็ตการเลื่อนของ latent ตลอดการสร้างต่อเนื่อง
- การเลือกระดับความแม่นยำอย่างมีกลยุทธ์: การสร้างแบบร่างทางภาพอย่างรวดเร็วบน GPT Image 2.5 Flare ลดความหน่วงลง 50% เมื่อเทียบกับโมเดลก่อนหน้า การสลับไปใช้ระดับคุณภาพ Sunburst (
xhighหรือmax) สำหรับการแก้ไขครั้งสุดท้ายใช้เวลาสุ่มตัวอย่างแบบขยายที่รักษารายละเอียดซับซ้อนและจำกัดสัญญาณรบกวนจากการเข้ารหัสใหม่ - การมาสก์เฉพาะจุดแบบแยก: การใช้การแก้ไขแบบผูกมาสก์ของ Qwen Image 2.1 จำกัดการอัปเดตเชิงสร้างสรรค์ไว้ภายในขอบเขตเป้าหมายอย่างเคร่งครัด การจัดหาไบนารีมาสก์ที่ชัดเจนหรือคำอธิบายแบบระบายทำให้พิกเซลฉากหลังที่ยังไม่แก้ไขข้ามไปป์ไลน์ denoising ทั้งหมด รักษาความคมชัดของภาพต้นฉบับ
- การพรอมต์แบบผสมในครั้งเดียว: การรวมคำขอแก้ไขเล็กๆ หลายรายการเป็นคำสั่งเดียวที่รวมกัน หลีกเลี่ยงการเสื่อมคุณภาพหลายรอบ การฝึกพรอมต์แบบผสมเพื่อเปลี่ยนสีแจ็คเก็ต สภาพแวดล้อมฉากหลัง และมุมแสงในขั้นตอนเดียวช่วยลดรอบการเข้ารหัสใหม่ทั้งหมด
การปฏิบัติตามเคล็ดลับการแก้ไข GPT Image 2.5 เหล่านี้ช่วยให้นักออกแบบส่งมอบการแก้ไขภาพ AI ที่สะอาดซึ่งทนทานต่อการตรวจสอบอย่างใกล้ชิดในโปรเจกต์เชิงพาณิชย์หลายขั้นตอน
คู่มือการตัดสินใจขั้นสุดท้าย: คุณควรเลือกโมเดลใดสำหรับเวิร์กโฟลว์ของคุณ?
การเลือกแพลตฟอร์มสร้างภาพโดยอาศัยคะแนนจากตารางอันดับแบบคงที่เพียงอย่างเดียว มักนำไปสู่คอขวดในการผลิตเมื่อการแก้ไขที่ซับซ้อนจากลูกค้ามาถึง การเลือกโมเดล AI สร้างภาพที่ดีที่สุดสำหรับการแก้ไขขึ้นอยู่กับว่าทีมสร้างสรรค์ของคุณให้ความสำคัญกับความสมบูรณ์แบบเชิงพาณิชย์แบบ zero-shot หรือความยืดหยุ่นของ open-weights ในไปป์ไลน์การแก้ไขซ้ำ
ตารางเปรียบเทียบสำหรับการผลิต
| ความต้องการของเวิร์กโฟลว์ | GPT Image 2.5 (Sunburst / Flare) | Qwen Image 2.1 (7B DiT) |
| การติดตั้งหลัก | API แบบจัดการ & UI ChatGPT | โอเพนเวตส์โฮสต์เอง |
| ความละเอียดสูงสุดแบบเนทีฟ | เอาต์พุต 4K API (สูงสุด 3840px) | เอาต์พุตเนทีฟ 2K (2048px+) |
| การมาสก์ & ความโปร่งใส | ความคิดเห็นแบบหมุดทางภาพ | สติกเกอร์โปร่งใสแบบเนทีฟ (RGBA) |
| การควบคุมต้นทุนหลายรอบ | ราคา API ตามการใช้งานต่อการสร้าง | รันในเครื่องฟรีบน GPU สำหรับผู้ใช้ทั่วไป |
การเลือกตามไปป์ไลน์การผลิต
การตั้งค่าทางเทคนิคเฉพาะของคุณกำหนดว่าโมเดลใดให้ประสิทธิภาพสูงกว่า:
- เลือก GPT Image 2.5 หาก: ทีมของคุณจัดการไปป์ไลน์เวิร์กโฟลว์ความสมจริงเชิงพาณิชย์ที่ต้องการรายละเอียด zero-shot ระดับสูงสุด เอาต์พุต 4K API และการเรนเดอร์ข้อความที่ซับซ้อน ออกแบบมาสำหรับการสร้างแบรนด์ระดับไฮเอนด์ โปสเตอร์โฆษณา และการใช้งานเว็บอย่างไร้รอยต่อ ระดับคุณภาพ Sunburst มอบแสงที่สะอาดและโครงสร้างกายวิภาคที่แม่นยำโดยตรงผ่านอินเทอร์เฟซ ChatGPT หรือเอนด์พอยต์แบบจัดการ
- เลือก Qwen Image 2.1 หาก: คุณต้องการโมเดลสร้างภาพแบบโฮสต์เองที่รันในเครื่องบนฮาร์ดแวร์สำหรับผู้ใช้ทั่วไปโดยไม่มีค่าใช้จ่าย API ต่อการสร้าง ทำงานเป็นสถาปัตยกรรมโอเพนเวตส์ มอบความเป็นส่วนตัวของข้อมูลทั้งหมดแก่นักพัฒนา สติกเกอร์โปร่งใสแบบเนทีฟผ่านการสร้าง RGBA 64 ช่องสัญญาณ และการคอมโพสิตหลายการอ้างอิงที่คุ้มค่าด้วยขอบเขตมาสก์ที่ชัดเจน
การประเมิน GPT Image 2.5 กับ Qwen Image 2.1 เทียบกับโครงสร้างพื้นฐานของสตูดิโอของคุณ ช่วยให้คุณสร้างสมดุลระหว่างความเที่ยงตรงทางภาพเริ่มต้นกับต้นทุนการดำเนินงานระยะยาว







