Seedance 2.5 متاح الآن — لأول مرة على Atlas Cloud

أعطينا GPT Image 2 مقابل Grok Imagine نفس 6 موجهات. إليك بالضبط ما عاد.

XAI Grok Imagine مقابل GPT Image 2 تم اختبارها على التشريح، النص الصيني، التعديلات المحلية، ودمج المراجع المتعددة. بذرة واحدة، بدون انتقاء. كلاهما عبر Atlas Cloud.

أعطينا GPT Image 2 مقابل Grok Imagine نفس 6 موجهات. إليك بالضبط ما عاد.

قمنا بتشغيل نماذج Grok Imagine Image و GPT Image-2 من خلال 6 مطالبات متطابقة ومحايدة للنموذج، تغطي الدلالات التركيبية، والتشريح الواقعي الفوتوغرافي، وعرض النص متعدد اللغات، والتحول الهندسي، والتحرير المحلي، والدمج متعدد المراجع.

كلا نموذجي Grok Imagine Image و GPT Image-2 متاحان عبر مفتاح API واحد لـ Atlas Cloud، مما يجعل إعادة هذا المعيار الدقيق ممكنًا في دقائق.

لماذا يوجد هذا المعيار لمقارنة نماذج الصور بالذكاء الاصطناعي

كل "مقارنة نموذج صور بالذكاء الاصطناعي" تجدها على الإنترنت تقع في نفس الفخ: مطالبات منتقاة بعناية، اختيار أفضل خمس مخرجات، وادعاءات غير مختبرة. تم بناء هذا المعيار حول مبادئ المستوى A: مطالبات محايدة للنموذج، مدخلات متطابقة عبر جميع النماذج، مخرجات افتراضية ببذرة واحدة (بدون انتقاء)، ومعايير تسجيل يمكن ذكرها في جملة واحدة لكل فئة.

النماذج الستة في تشغيل المعيار الكامل: Grok، GPT Image 2، Nano Banana 2، Nano Banana Pro، Wan 2.7، و Seedream 5.0. تركز هذه المقالة على المواجهة المباشرة بين Grok و GPT Image 2، باعتبارها الاقتران الأكثر صلة تجاريًا للمطورين الذين يختارون نموذج صور افتراضي.

كيف اختبرنا Grok Imagine Image ضد GPT-Image 2: 6 فئات، قاعدة واحدة من المستوى A

كل مطالبة تستهدف بُعد قدرة واحدًا محددًا بوضوح. تم تعريف معايير النجاح/الفشل قبل تشغيل النماذج، وليس بعد رؤية المخرجات.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

الفئة البُعد الأساسي المختبر النجاح/الفشل في جملة واحدة 
الفئة 1 · الدلالات التركيبيةمحاذاة التعليماتهل أحصى النموذج 7 كائنات، ووضعها بشكل صحيح، وامتثل لقائمة النفي؟
الفئة 2 · التشريح الواقعي والضوءالجودة البصرية والفيزياءهل جميع الأصابع الخمسة صحيحة تشريحيًا، وهل تظهر أنماط الضوء المتكسرة على الوجه؟
الفئة 3 · ملصق متعدد اللغاتعرض النص داخل الصورةهل تم عرض الحروف الصينية والإنجليزية بشكل صحيح دون ضربات مفقودة أو حروف مهلوسة؟
الفئة 4 · التحول الهندسي (صورة إلى صورة)التحكم في التحرير + الهويةبعد تدوير 45 درجة، هل لا يزال من الممكن التعرف على نفس الشخص مع تفاصيل الملابس سليمة؟
الفئة 5 · التحرير المحلي والحفاظ على المنطقةدقة التحريرهل تم إجراء 3 تعديلات بالضبط، مع بقاء كل شيء آخر دون تغيير على مستوى البكسل؟
الفئة 6 · الدمج متعدد المراجعالاتساق عبر الصورهل تندمج الهوية والأسلوب والمشهد من 3 مراجع منفصلة في صورة واحدة متماسكة؟

هل تريد وضع GPT Image 2 و Grok Imagine على نفس المطالبة بنفسك؟ مقارنة نماذج Atlas Cloud تشغلهما جنبًا إلى جنب في تمريرة واحدة — نفس المطالبة، السعر معروض قبل التوليد — حتى تتمكن من الحكم عليهما إطارًا بإطار.

GPT Image 2 و Grok Imagine على نفس المطالبة في مقارنة نماذج Atlas Cloud — نفس المطالبة، السعر معروض قبل التوليد. تم التقاطها مباشرة على مستكشف النماذج

GPT Image 2 و Grok Imagine على نفس المطالبة في مقارنة نماذج Atlas Cloud — نفس المطالبة، السعر معروض قبل التوليد. تم التقاطها مباشرة على مستكشف النماذج.

الفئة 1 · الدلالات التركيبية (نص إلى صورة)

المطالبة:

صورة فوتوغرافية من الأعلى لطاولة طعام خشبية تحتوي بالضبط على سبعة أشياء خزفية: ثلاثة فناجين شاي بيضاء متطابقة مرتبة في مثلث متساوي الأضلاع في المنتصف، ووعاءان أسودان موضوعان على يمين فناجين الشاي، وتفاحة حمراء واحدة داخل الوعاء الأسود الأيسر، وملعقة خشبية فارغة موضوعة على الوعاء الأسود الأيمن مع مقبضها يشير إلى الزاوية العلوية اليسرى من الإطار. لا فناجين قهوة، لا أشياء معدنية، لا أطباق، لا زجاجيات. ضوء نافذة ناعم منتشر من الزاوية العلوية اليسرى، منتصف الصباح. تصوير فوتوغرافي واقعي، لا أدوات تنسيق.

هذه مطالبة عدائية متعمدة. العد، اللغة المكانية ("على يمين"، "الأيسر")، وجمل النفي هي أنماط فشل معروفة لجميع البنى القائمة على الانتشار الحالية.

قائمة التحقق من التسجيل

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#المعيارالتحقق 
1إجمالي عدد الكائنات7 كائنات خزفية بالضبط
2ثلاثة فناجين شاي بيضاءترتيب مثلث متساوي الأضلاع
3وعاءان أسودانموضوعان على يمين فناجين الشاي
4تفاحة حمراءداخل الوعاء الأسود الأيسر
5ملعقة خشبيةموضوعة على الوعاء الأيمن، مقبضها يشير إلى الأعلى اليسار
6الامتثال للنفيلا فناجين قهوة / لا معدن / لا أطباق / لا زجاجيات
7مصدر الضوءضوء ناعم منتشر من الأعلى اليسار، جميع الظلال متسقة
8أسلوب التصويرلا كليشيهات تنسيق (أوراق نخيل، شموع، إلخ.)

1.PNGGrok Imagine Image

2.PNGGPT-Image 2

طلب إنشاء صورة فوتوغرافية من الأعلى تحتوي بدقة على سبعة أشياء خزفية مع علاقات مكانية واضحة: ثلاثة فناجين شاي بيضاء مرتبة في مثلث متساوي الأضلاع في المنتصف، ووعاءان أسودان على يمين فناجين الشاي، وتفاحة حمراء داخل الوعاء الأسود الأيسر، وملعقة خشبية موضوعة على الوعاء الأسود الأيمن مع مقبضها يشير إلى أعلى اليسار. تعليمات النفي: لا فناجين قهوة، لا أدوات معدنية، لا أطباق، لا زجاجيات.

عدد كائنات Grok Imagine: 5 فناجين شاي مرئية (وليس 3)، مرتبة في مجموعة بدلاً من مثلث متساوي الأضلاع. الوعاءان الأسودان موجودان، مع التفاحة الحمراء بشكل صحيح داخل أحدهما. الملعقة الخشبية موجودة وموضوعة على الوعاء الأيمن، اتجاه المقبض تقريبًا إلى أعلى اليسار — هذا المعيار ناجح. الامتثال للنفي نظيف: لا فناجين قهوة، لا معدن، لا أطباق، لا زجاجيات. مصدر الضوء من أعلى اليسار مع ظلال متسقة ناجح. لا توجد أدوات تنسيق.

GPT Image 2 أظهر التزامًا أقوى بالتعليمات على المكونات المكانية، على الرغم من أن كلا النموذجين لم يحققا عددًا مثاليًا من 7 كائنات مع استيفاء جميع قيود التنسيب في وقت واحد.

الفئة 2 · التشريح الواقعي والضوء (نص إلى صورة)

المطالبة:

صورة مقربة لامرأة من شرق آسيا في أوائل الثلاثينيات من عمرها تمسك كأس نبيذ بلوري نصف مملوء بنبيذ أحمر في يدها اليمنى، جميع الأصابع الخمسة والإبهام مرئية بالكامل وتلتف بشكل طبيعي حول الساق وجزء من الكأس. وهي جالسة بجوار نافذة طويلة تواجه الغرب خلال الساعة الذهبية. ضوء الشمس في وقت متأخر من بعد الظهر يمر عبر النبيذ مكونًا أنماطًا متكسرة قرمزية دافئة على عظمة وجنتها اليسرى وخط الفك. يدها اليسرى تستقر على كتاب بغلاف مقوى مفتوح على حجرها. انعكاسات الضوء من النافذة مرئية في كلتا العينين. الجلد يظهر مسامات فائقة التفاصيل، زغب خفيف ناعم، تشتت تحت السطحي على شحمة الأذن وجسر الأنف. الشعر مضاء من الخلف بضوء حافة. عدسة 85 مم، فتحة f/2.0، عمق مجال ضحل، واقعية فوتوغرافية.

هذا تاريخيًا أصعب اختبار صورة واحدة للنماذج التوليدية.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#المعيارالتحقق
1تشريح اليدجميع الأصابع الخمسة + الإبهام، قبضة طبيعية على الساق والكأس
2الضوء المتكسرأنماط قرمزية دافئة من النبيذ مسقطة على عظمة الوجنة
3اتساق انعكاس الضوءنفس الموضع والشكل في كلتا العينين
4التشتت تحت السطحيمرئي على شحمة الأذن وجسر الأنف عند الإضاءة الخلفية
5فيزياء ضوء الحافةالاتجاه يطابق موضع مصدر الضوء
6واقعية الجلدلا تنعيم مفرط "بلاستيكي للذكاء الاصطناعي"؛ مسام وزغب مرئيان

3.PNGGrok Imagine Image

4.PNGGPT-Image 2

Grok Imagine قدم أداءً قويًا في ميزته الرئيسية. تشريح اليد كان صحيحًا — عدد الأصابع دقيق، وضعية القبضة طبيعية حول كل من الساق والكأس، زاوية المعصم معقولة فيزيائيًا. هذا وحده يتجاوز حاجزًا تفشل فيه العديد من النماذج. أظهر نسيج الجلد تفاصيل على مستوى المسام مع زغب خفيف مرئي وبدون تنعيم بلاستيكي مفرط، والتشتت تحت السطحي على جسر الأنف وعظام الوجنتين أنتج جودة دافئة نافذة للضوء تبدو واقعية فوتوغرافيًا. ضوء الحافة على الشعر تبع اتجاه مصدر النافذة بشكل متماسك.

كان إسقاط الضوء المتكسر أضعف نقطة في Grok. ظهرت أنماط الضوء القرمزية على الوجه، ولكن تم عرضها كطبقة حمراء كبيرة ومبالغ فيها بشكل كبير — تشبه تأثير تصحيح الألوان أكثر من كونها خيوط ضوء ناعمة الحواف التي تنتج فيزيائيًا عن مرور ضوء الشمس عبر النبيذ. فشلت المعقولية الفيزيائية للضوء المتكسر في معيار الدقة.

GPT Image 2 قلب المقايضة. كان عرض الضوء المتكسر أكثر دقة فيزيائيًا بشكل ملحوظ — الأنماط القرمزية الدافئة على عظمة الوجنة كانت أصغر، وأكثر انتشارًا، واتبعت الهندسة المكانية لمرور الضوء عبر كأس نبيذ بالزاوية الصحيحة. هذه هي التفاصيل التي فاتتها Grok. ومع ذلك، دفع GPT Image 2 ثمن ذلك في مكان آخر: تشريح اليد كان أقل طبيعية قليلاً، مع زوايا الأصابع حول الساق تظهر تيبسًا خفيفًا. نسيج الجلد كان يميل نحو الجودة الأكثر نعومة ومسطحة قليلاً الشائعة في صور الذكاء الاصطناعي، مع دفء تشتت تحت سطحي أقل وضوحًا وشدة ضوء حافة أضعف مقارنة بـ Grok.

الفئة 3 · ملصق متعدد اللغات (نص إلى صورة)

المطالبة:

ملصق سفر على طراز الستينيات لمهرجان سينمائي خيالي، مصور بأسلوب التصميم التجاري في منتصف القرن. أعلى الملصق، حروف صينية كبيرة عريضة بخط serif تقرأ "时光电影节" (السطر الأول)، وأسفلها حروف صينية أصغر "第七届 · 上海 · 1965年5月" (السطر الثاني).

الوسط: رسم منمق لجهاز عرض سينمائي قديم يلقي شعاعًا على شاشة سينما منحنية قليلاً.

أسفل الوسط: كأس شمبانيا طويلة مع نص إنجليزي "GRAND OPENING NIGHT" يلتف على طول انحناء كأس الكأس، متبعًا المنظور البيضاوي.

الحافة اليمنى، نص عمودي يقرأ "presented by 时代影业 · TIMES PICTURES" يمتد من الأعلى إلى الأسفل.

الشريط السفلي: نص إنجليزي صغير للملاحظات "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" في سطر واحد.

لوحة الألوان: خلفية كريمية بيضاء غير لامعة، أحمر قرمزي عميق، لمسات خردل صفراء. نسيج ورق عتيق طفيف، حبيبات دقيقة.

قائمة التحقق من التسجيل

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#المعيارالتحقق
1دقة الصينيةلا ضربات مفقودة، لا أحرف مهلوسة في
2تخطيط ثنائي اللغةالصينية والإنجليزية غير مختلطة؛ كل منهما يظهر في المنطقة الصحيحة
3نص منحني على الزجاجالإنجليزية تتبع المنظور البيضاوي لكأس الشمبانيا
4نص عمودي على الحافة اليمنىمقروء من الأعلى إلى الأسفل
5التسلسل الهرمي الطباعيتمييز واضح بين العنوان الرئيسي
6الأسلوب مقابل readabilityالحفاظ على الجمالية الستينيات دون التضحية بوضوح النص

5.pngGrok Imagine Image

6.pngGPT-Image 2

أنتج Grok Imagine ملصقًا جذابًا بصريًا مع طاقة توضيحية قوية من منتصف القرن. ومع ذلك، فقد فشل في المعيار الأكثر أهمية للنص: العنوان يقرأ "時光電影節" بالصينية التقليدية، وليس المبسطة "时光电影节" المحددة في المطالبة. هذا فشل في الامتثال لمجموعة الأحرف — فرق مهم لأي حالة استخدام للتوطين أو النشر. السطر الثاني "第七屆 · 上海 · 1965年5月" استخدم أيضًا أحرفًا تقليدية. على الجانب الهيكلي، ظهر "GRAND OPENING NIGHT" على كأس الشمبانيا مع انحناء جزئي، على الرغم من أن الالتزام بالمنظور البيضاوي كان تقريبيًا. النص العمودي على الحافة اليمنى "TIMES PICTURES" كان مقروءًا. سطر الملاحظات السفلي كان موجودًا وقابلاً للقراءة. لوحة الألوان — قرمزي، خردل، كريمي — كانت منفذة بشكل جيد. طاقة التخطيط الإجمالية كانت عالية، لكن فشل التقليدي مقابل المبسط هو عامل استبعاد صارم للمطالبة المذكورة.

GPT Image 2 اجتاز اختبار مجموعة الأحرف بشكل نظيف: العنوان "时光电影节" والعنوان الفرعي "第七届 · 上海 · 1965年5月" تم عرضهما بشكل صحيح بالصينية المبسطة بدون ضربات مفقودة أو أحرف مهلوسة — فوز مباشر في الامتثال على Grok. كأس الشمبانيا مرئي في الأسفل مع "GRAND OPENING NIGHT" يتبع انحناء الكأس بشكل مقنع. النص العمودي على الحافة اليمنى "时代影业 · TIMES PICTURES" يمتد من الأعلى إلى الأسفل وهو مقروء بالكامل، مع كل من الصينية والإنجليزية موضوعة بشكل صحيح في نفس العمود الرأسي دون أخطاء خلط. سطر الملاحظات السفلي — "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" — موجود وقابل للقراءة كسطر واحد. التسلسل الهرمي الطباعي بين العنوان الرئيسي والعنوان الفرعي والحاشية محفوظ بوضوح. نسيج الورق العتيق ولوحة الألوان من منتصف القرن محققان بشكل جيد. التكوين يدمج صورة ظلية معروفة لأفق شنغهاي كالرسم المركزي، وهو ما لم يكن محددًا في المطالبة ولكنه يضيف أصالة سياقية دون كسر أي معيار.

الفئة 4 · التحول الهندسي (صورة إلى صورة)

أمرت المطالبة النموذج بتدوير موضوع عرض أزياء كامل الطول بمقدار 45 درجة إلى يسار الموضوع بالضبط، مع الحفاظ على نفس موضع الكاميرا. الصورة المرجعية تضمنت زيًا متعدد الطبقات معقدًا: معطف طويل بني، عباءة جلدية على الكتف، شال من الفرو مع تدرج مرئي (بني غامق → فضي → كريمي)، شارة صدر نحاسية مستديرة مع صورة شخصية مدمجة، قفازات جلدية سوداء، وحذاء جلد بلونين. لم يتم سرد أي من هذه التفاصيل في المطالبة — كان على النموذج الحفاظ عليها من خلال فهم الهوية فقط.

7.png

هذا اختبار إجهاد متعمد للقدرة. كانت التعليمات قصيرة عن قصد لتجنب تغذية النموذج بمعايير التقييم الخاصة به.

قائمة التحقق من التسجيل

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#المعيارالتحقق
1هوية الوجهتشابه ArcFace ≥ 0.5 (مخفف لحجم كامل الطول)
2كشف شال الفروالجانب الأيمن الفضي المخفي سابقًا
3شارة الصدرإطار نحاسي دائري + صورة شخصية مدمجة + ضغط بيضاوي صحيح للمنظور
4حاشية المعطف والطبقات الداخليةاتجاه تموج طبيعي بعد التدوير؛ نسبة تعرض البنطال الداخلي معقولة
5وضعية القدميسار أمام
6حجم القفازموضع اليد + نسيج التريكو مرئي بعد التدوير
7حدود لون الحذاءبني
8اتساق الخلفيةخلفية استوديو رمادية نقية (منطقة DINO ≥ 0.95)
9نسبة الإخراجإطار الجسم الكامل 9:16 محفوظ، وليس مقصوصًا لصورة شخصية
10اتجاه النظريتبع التدوير — لا يستمر في مواجهة الكاميرا

8.pngGrok Imagine Image

9.jpgGPT-Image 2

حافظ Grok على هوية الوجه فوق عتبة ArcFace 0.5 المناسبة للصور كاملة الطول. أصبح القسم الأيمن المخفي سابقًا من شال الفرو مرئيًا جزئيًا عند 45 درجة، مع استمرارية تدرج معقولة. تم الحفاظ على إطار شارة الصدر، على الرغم من أن تفاصيل الصورة الشخصية المدمجة أظهرت ضغطًا. حدود لون الحذاء ونسيج القفاز صمدت.

أظهر GPT Image 2 تماسكًا أقوى قليلاً في طبقات الملابس بشكل عام، لكنه أدخل انحرافًا أكبر في هوية الوجه — مقايضة مهمة حسب حالة الاستخدام.

الفئة 5 · التحرير المحلي والحفاظ على المنطقة (صورة إلى صورة)

تطلبت المطالبة ثلاثة تعديلات بالضبط على مشهد غرفة معيشة: إزالة قطة نائمة من الأريكة (واستعادة الوسادة بشكل طبيعي)، واستبدال كوب شاي ساخن بكأس عصير برتقال مع ثلج، وإضافة نظارة قراءة مطوية بإطار أسود فوق الكتاب الأوسط على طاولة القهوة. نصت التعليمات صراحة على عدم تغيير أي شيء آخر — نمط قماش الأريكة، مواضع الكتب، المصباح، منظر النافذة، لون الجدار، الأرضية.

10.png

اختبار الحفاظ على الأهمية بقدر اختبار التحرير. النماذج التي تعيد تفسير المشهد بأكمله أثناء إجراء تغييرات محلية ليست قابلة للاستخدام في تنقيح تصوير المنتجات أو تطوير المشهد التكراري.

قائمة التحقق من التسجيل

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#المعيارالتحقق
1تم إكمال جميع التعديلات الثلاثةإزالة القطة
2استعادة الوسادةلا انبعاج على شكل قطة أو بقايا فرو على الأريكة
3فيزياء عصير البرتقالهندسة الكأس، انكسار الثلج، واتجاه الظل يطابق ضوء الكأس الأصلي
4وضع النظارةبشكل صحيح على الكتاب الأوسط (ليس العلوي أو السفلي)
5قماش الأريكةنمط النسيج الماسي سليم، خاصة في المنطقة المحررة
6الكتب دون تغييرالمواضع، الأغلفة (أحمر
7المصباح دون تغييرالشكل، حالة التوهج، والموضع محفوظ
8منظر النافذة دون تغييرمنظر المدينة يظل ضبابيًا ومتسقًا
9الجدار والأرضية دون تغييرالجدار الأبيض المائل والأرضية الخشبية الفاتحة غير متغيرين
10الإضاءة الإجمالية محفوظةاتجاه مصدر الضوء الخلفي الأيمن الوحيد دون تغيير

11.pngGrok Imagine Image

12.pngGPT-Image 2

أكمل Grok Imagine جميع التعديلات الثلاثة المطلوبة. تمت إزالة القطة واستعادة وسادة الأريكة بشكل نظيف دون أي انبعاج مرئي أو بقايا فرو — نمط القماش في المنطقة المحررة صمد جيدًا. ظهر كأس عصير البرتقال في الموضع الصحيح. ومع ذلك، يعرض كأس عصير البرتقال نمط إضاءة لا يتماشى مع اتجاه هذا المصدر، ويبدو كما لو كان مركبًا بنموذج إضاءة مستقل بدلاً من دمجه في الإضاءة الموجودة في المشهد. تظهر قاعدة الكأس أيضًا ظل تلامس غير كافٍ على سطح طاولة القهوة الخشبي الداكن، مما يخلق تأثيرًا طفيفًا لكنه قابل للكشف بالطفو.

أكمل GPT Image 2 أيضًا جميع التعديلات الثلاثة، وأظهر حفظًا أقوى للمشهد بشكل عام. إزالة القطة كانت نظيفة بنفس القدر. كأس عصير البرتقال كان جيد العرض مع تحديد موضع صحيح واتجاه ظل مطابق لمصدر ضوء النافذة على الجانب الأيمن — هندسة الكأس وعتامة السائل تبدوان أكثر دقة من نسخة Grok. كانت نظارة القراءة موضوعة بشكل مرئي على كومة الكتب. والأهم من ذلك، تم الحفاظ على منظر النافذة — المدينة بالخارج تظل مرئية وضبابية، متسقة مع المرجع، وهو المكان الذي فشلت فيه Grok. قماش الأريكة، المصباح، الجدار، والأرضية جميعها صمدت. الكتب تبدو متسقة في الموضع واللون. التغيير الملحوظ الوحيد: المشهد بشكل عام يبدو أكثر إشراقًا قليلاً وأكثر تباينًا من الأصل، مما يشير إلى بعض إعادة تفسير الإضاءة العالمية بدلاً من الحفاظ الحقيقي على مستوى البكسل — انحراف طفيف لكنه قابل للكشف.

الفئة 6 · الدمج متعدد المراجع (صورة إلى صورة)

جمعت المطالبة ثلاثة مراجع مستقلة: هوية صورة شخصية (امرأة لاتينية، عيون كهرمانية، شعر بني غامق مموج)، أسلوب رسم بالألوان المائية (منظر طبيعي ريفي ياباني، ضربات فرشاة مرئية، جو دافئ من القصص الخيالية)، وتخطيط مشهد (ساحة بلدة أوروبية مرصوفة بالحصى عند غروب الشمس، عمود إنارة من الحديد الزهر، قوس حجري). المهمة: إنتاج لوحة ألوان مائية متماسكة واحدة للشخص المحدد واقفًا في المشهد — ليست صورة بفلتر، وليست كولاج.

13.png

14.png

15.png

فصل ثلاثة مراجع هو أصعب اختبار في هذا المعيار. معظم النماذج إما تفرط في ترجيح مرجع واحد أو تفشل في تحقيق العرض من خلال الأسلوب.

قائمة التحقق من التسجيل

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#المعيارالتحقق
1فصل ثلاثي الاتجاهاتالهوية، الأسلوب، والمشهد كلها متميزة وقابلة للتعرف
2نقل الأسلوب الكاملالإخراج بألوان مائية بالكامل — ليس صورة + فلتر
3الاحتفاظ بالهوية بعد الأسلوبالعيون الكهرمانية + بنية الوجه يمكن التعرف عليها من خلال معالجة الألوان المائية
4هيكل المشهد محفوظالحصى، عمود الإنارة، وتخطيط القوس سليم
5إضافة ملابس طبيعيةمعطف سفر وحقيبة يد مضافة دون كسر التكوين
6اتساق اتجاه الضوءتوهج غروب الشمس من يسار الكاميرا مرئي على الحصى والشخصية

16.pngGrok Imagine Image

17.pngGPT-Image 2

فشل Grok Imagine في المعيار الأساسي: الإخراج واقعي فوتوغرافي، وليس بالألوان المائية. الساحة المرصوفة بالحصى والشخصية تحتفظان بالحدة الفوتوغرافية الكاملة مع تمرير نسيج طلاء خفيف فقط — لا شيء من ضربات الفرشاة المحددة للمرجع 2، أو نزيف الألوان، أو جودة الحافة المرسومة باليد موجودة. هيكل المشهد، الهوية، الملابس، واتجاه الضوء جميعها ناجحة. لكن عرض الوسيط الخطأ بالكامل هو استبعاد على مستوى الفئة، وليس خصمًا جزئيًا.

حقق GPT Image 2 عرضًا حقيقيًا بالألوان المائية عبر الإطار بأكمله — المباني، الحصى، السماء، والشخصية جميعها تحمل ضربات فرشاة مرئية ونزيف ألوان ناعم متسق مع المرجع 2. هيكل المشهد من المرجع 3 سليم، عمود الإنارة مضاء، والقوس الحجري مرئي في منتصف المشهد. الهوية محفوظة جزئيًا من خلال تحول الأسلوب — الشعر الداكن المموج وبنية الوجه يمكن التعرف عليها، على الرغم من أن الملامح الدقيقة مجردة كما هو متوقع. معطف السفر، الحقيبة، اتجاه الضوء، والنظرة جميعها تتبع المطالبة. هذا هو الإخراج الوحيد الذي أكمل المهمة الفعلية.

جرب نماذج Grok Imagine Image و GPT Image 2 عبر Atlas Cloud

المعيار قابل للتكرار. كلا Grok Imagine و GPT Image 2 متاحان الآن عبر Atlas Cloud — لا إعداد فوترة لكل نموذج، ولا قوائم انتظار.

لماذا Atlas Cloud

  • مفتاح API واحد، أكثر من 300 نموذج. بدّل بين Grok و GPT Image 2 و Flux و Wan و Seedream وكل نموذج آخر في المجموعة عن طريق تغيير حقل نموذج واحد. نفس المفتاح، نفس نقطة النهاية، نفس لوحة الفوترة — سواء كنت تدير معيارًا مكونًا من ستة نماذج أو تبني خط أنابيب إنتاج صور.
  • تغطية كاملة للوسائط. نماذج اللغة، نص إلى صورة، صورة إلى صورة، نص إلى فيديو، صورة إلى فيديو — كلها تحت سقف واحد. إذا كانت سير عملك تحتاج إلى نموذج لغة لتحسين المطالبة ونموذج صور للتوليد، فكلاهما يعيش في نفس واجهة API.
  • لا بدء تشغيل بارد، لا مفاجآت في حدود المعدل. يعمل Atlas Cloud على بنية تحتية للاستدلال محسنة مصممة للإنتاجية. تحصل على زمن استجابة ثابت سواء كنت تقوم باستدعاء واحد أو ألف.
  • مبني لسير عمل المقارنة. حالة الاستخدام الدقيقة التي يوضحها هذا المعيار — تشغيل مطالبات متطابقة عبر نماذج متعددة ومقارنة المخرجات — هي ما صُممت بنية Atlas Cloud من أجله. مفتاح واحد، فاتورة واحدة، نطاق نموذجي كامل.

أحدث النماذج

واجهة برمجية واحدة لكل وسائط الذكاء الاصطناعي.

استكشف جميع النماذج