لماذا تبدو الوجوه المرممة بالذكاء الاصطناعي كشخصيات ألعاب فيديو
قد تجعل نماذج ترميم الوجوه وجهًا من صورة تالفة يبدو كتصيير من لعبة فيديو قديمة: بشرة بلاستيكية، وعيون مرسومة، ووجه حاد لكنه ليس الشخص تمامًا. قسنا ثمانية أنواع من التصيير على 11 صورة فوتوغرافية في الملك العام لعزل الأسباب: هناك ثلاثة، وهي قابلة للفصل، ولا يُصلح أيًا منها «نموذج أفضل». تضيف هذه المراجعة ما افتقر إليه الاختبار الأصلي: الأرقام. إعادة قياس التصيير المختار بتضمين للتعرف على الوجوه[4] تؤكد كميًا الاختيار الذي تم بالعين (كل مقبض من التصيير «الطبيعي» يشتري هوية قابلة للقياس، ويقلص ضريبة الهوية التي يدفعها الترميم إلى النصف)، ومسح كامل لمقبض الأمانة يبين لماذا يُطرح عند 0.7 مع أن كل منحنى رتيب نحو 1.0.
كل رقم في هذه الملاحظة قيس على كود خط الإنتاج: النماذج نفسها، والحسابات نفسها. السجلات الخام لكل صورة: e2v2_face.json · e2_face.json.
قبل
بعد1 · الأسباب الثلاثة
1. الاستبدال الكلي. يلصق الخط القياسي مخرجات النموذج فوق الوجه الأصلي بعتامة 100%، فيكون كل وجه مرمم مرسومًا بالكامل بواسطة النموذج. تنتهي حبيبات الصورة وملمس الورق وطابع العدسة عند حد بيضاوي غير مرئي حول كل وجه.
2. انحراف الألوان. يُخرج نموذج الوجوه ألوانه هو، لا ألوان الصورة. وقد قسنا على منصتنا أنه اخترع عيونًا زرقاء في صورة أمبروتايب من سنوات الـ1850، وفتّح لون البشرة في صورة استوديو من القرن التاسع عشر لشخص أسود، وهو نمط فشل معروف في نماذج الوجوه المدربة على مجموعات صور حديثة يغلب عليها ذوو البشرة الفاتحة[2]. وأي خط يحتفظ بكروما النموذج يرث تحيزاته.
3. الوجوه الصغيرة هلوسات. الوجه الذي يشغل أقل من نحو 100 px يصل إلى نموذج وجوه بحجم 512 px كتكبير خطي مزدوج بمعامل 5–13×، أي لطخة. فيخترع النموذج عندئذٍ وجهًا معقولًا بدلًا من استعادة الوجه الحقيقي. هذا حد فيزيائي لا حد نموذج: يمكن جعل وجه بحجم 40 px ناعمًا لكنه بشري، ولا يمكن أبدًا جعله حادًا وأمينًا.
2 · تشريح إصلاح وجه
لترى أين تقع المقابض، تتبّع وجهًا واحدًا عبر الخط. يعطي الكشف (SCRFD، مع بوابة المعقولية) خمسة معالم. تحل المحاذاة تحويل التشابه بطريقة المربعات الصغرى (تحجيم s، ودوران θ، وإزاحة t) الذي يرسم نقاط العينين والفم المكتشفة pi على قالب FFHQ الثابت[5] qi:
فيدخل كل وجه إلى الشبكة بحجم 512×512 والعينان والفم في الموضع القانوني. ينتج النموذج، وهو CodeFormer افتراضيًا[1]، والذي يرمم عبر البحث عن الوجوه في كتاب رموز متعلَّم بدلًا من انحدار البكسلات، ويكشف وزن أمانة w ∈ [0, 1] يوجّه بين معرفته المسبقة (0) ومدخلك (1)، قصاصة مرممة. ثم يأتي الجزء الذي تدور حوله هذه الملاحظة: إعادة اللصق. تركّب الوصفة الكلاسيكية تلك القصاصة بعتامة كاملة وبألوان النموذج نفسه. أما وصفتنا فتعيدها إلى موضعها تحت قناع تدرج شعاعي m وتركّب كل بكسل على النحو
حيث blend = 0.75، وتعني faceL⊕photoab أن النموذج يسهم بالنصوع فقط (L في فضاء Lab) بينما تحتفظ الصورة بكروماها هي، وهو المرآة الدقيقة لمُلوِّننا، الذي يسهم بالكروما فقط ويحتفظ بنصوع الصورة. تحصل الوجوه الصغيرة على مرور مخصص للدقة الفائقة بمعامل ×4 على مساحتها المصدرية قبل الترميم، فيرى النموذج تفاصيل مستعادة بدلًا من لطخة خطية مزدوجة.
3 · الاختبار البصري الذي اختار النوع H
ثمانية أنواع، كل منها تشغيل كامل للخط على المجموعة، مع تغيير وزن الأمانة، وعتامة إعادة اللصق، ومصدر الألوان، والدقة الفائقة للوجوه الصغيرة. قورنت المخرجات جنبًا إلى جنب مع الأصول بتكبير 100%:
| النوع | الوزن | إعادة اللصق | مصدر الألوان | دقة فائقة للوجوه الصغيرة |
|---|---|---|---|---|
| A (المعتمد آنذاك) | 0.70 | 100% | النموذج | – |
| B | 0.90 | 100% | النموذج | – |
| C | 0.70 | 70% | النموذج | – |
| D | 0.70 | 100% | الصورة | – |
| E | 0.70 | 75% | الصورة | – |
| F | 0.85 | 75% | الصورة | – |
| G | 0.70 | 50% | الصورة | – |
| H (المختار) | 0.70 | 75% | الصورة | نعم |
طُرح H بوصفه التصيير الافتراضي. تضيف إعادة اللصق بالنصوع فقط أقل من نصف ثانية لكل صورة؛ ويضيف مرور الوجوه الصغيرة ثانية إلى ثانيتين لكل وجه مؤهل فقط. وقد أقرّ قسم القيود الأصلي بنقطة الضعف الواضحة: كان الاختيار بحكم بشري جنبًا إلى جنب على 35 وجهًا، لا بمقياس. لذلك بنينا الاختبار المتري.
4 · جديد: دراسة الحذف، مقيسة كميًا
رقم واحد يؤطر كل شيء: المدخل المتدهور نفسه يسجل هوية 0.950 مقابل الأصل. دُرِّب ArcFace تحت تعزيز كثيف، فهو يرى عبر الضبابية والضوضاء؛ ولذلك لا يحصل الترميم على أي رصيد لكونه حادًا؛ بل يُخصم منه فقط حين يغيّر من في الصورة. كل مُصيِّر يدفع شيئًا من ضريبة الهوية تلك. والسؤال هو: كم؟
| التصيير (الكل عند w = 0.7) | PSNR (dB) | هوية ArcFace | ضريبة الهوية | نسبة Tenengrad |
|---|---|---|---|---|
| المدخل المتدهور (خط الأساس) | 27.32 | 0.950 | – | 0.217 |
| Classic v2 (100% paste, model colour) | 26.68 | 0.868 | −0.082 | 0.373 |
| + luma-only (photo keeps its chroma) | 26.72 | 0.882 | −0.068 | 0.376 |
| + 75% blend (grain shows through) | 27.06 | 0.901 | −0.049 | 0.304 |
| Natural (shipped: both + small-face SR) | 27.09 | 0.909 | −0.041 | 0.307 |
يتفق الاختبار المتري مع العين، مقبضًا بعد مقبض. الاحتفاظ بكروما الصورة يشتري +0.014 من الهوية (كان انحراف الألوان حقيقيًا، وقابلًا للقياس). ويشتري المزج بنسبة 75% +0.019 أخرى ومعظم PSNR: السماح لربع الوجه الحقيقي بالظهور يساوي تقريبًا ما يساويه إعداد الأمانة في نموذج الوجوه بأكمله. معًا يقلصان ضريبة الهوية إلى النصف، من −0.082 إلى −0.041، مع بقاء الحدة نحو 1.4× حدة المدخل. التكلفة الصادقة الوحيدة: التصيير الكلاسيكي «أحدّ» بمقياس Tenengrad (0.373 مقابل 0.307)، وهي حدة ينفق جزءًا منها على ملمس ليس من الصورة. تلك هي مفاضلة الإدراك والتشويه[6] وقد انتقلت إلى التصيير، ونحن ننفقها على الهوية.


5 · مقبض الأمانة، ممسوحًا من طرف إلى طرف
يوجّه وزن w في CodeFormer بين المعرفة المسبقة لكتاب الرموز (0) والانحياز إلى مدخلك (1)[1]. مسحناه في إحدى عشرة خطوة تحت المُصيِّر الطبيعي:
دخلنا نتوقع منحنى مفاضلة له أمثل داخلي يبرر 0.7 بوصفه «الركبة». لكن البيانات رفضت: بالأرقام، w = 1.0 يهيمن، عند كل شدة:
فلماذا نطرح 0.7 بدلًا من 1.0؟ لأن المقاييس ضرورية لا كافية. يقيس ArcFace من؛ وهو شبه أعمى عن العمر والملمس؛ والتدريب نفسه الذي يجعله متينًا أمام الضبابية يجعله متسامحًا مع التنعيم. تقف ملاحظة الاختبار الأصلية على دليلها الخاص: عند 0.5 المعتاد للنموذج، تلين تجاعيد العينين بوضوح في الأم المهاجرة: كانت فلورنس أوينز طومسون في الثانية والثلاثين وتحمل الكساد الكبير في وجهها، والمعرفة المسبقة تفضّل ألا تحمله. وعند w = 1.0 ينحاز كتاب الرموز إلى مدخل مخرَّب إلى حد أن نفايات الضغط تبدأ في النجاة. يحتفظ 0.7 بكل قيمة المقياس تقريبًا (0.909 مقابل 0.932) بينما تحتفظ الصور بعمرها. واللوحة s8 أدناه هي الحجة لعدم السماح أبدًا لـ w بالاقتراب من 0 في صور التراث التالفة:

6 · النماذج الأخرى، المُصيِّر نفسه
| نموذج الوجوه | PSNR (dB) | هوية ArcFace | نسبة Tenengrad | ms / وجه* |
|---|---|---|---|---|
| CodeFormer (w = 0.7, default) | 27.09 | 0.909 | 0.307 | 7200 |
| GFPGAN 1.4 | 27.13 | 0.910 | 0.328 | 6046 |
| GPEN-BFR-256 | 26.68 | 0.927 | 0.322 | 2633 |
*وسيط الزمن الفعلي للمرور الكامل (شاملًا الكشف) على صندوق الاختبار ذي 2 vCPU. تحت المُصيِّر الطبيعي تتقارب النماذج الثلاثة[1][2][3] إلى ما دون 0.02 من الهوية بين بعضها: المُصيِّر، لا النموذج، هو الآن الحد المهيمن، وهذه نتيجة في حد ذاتها: لم يكن مظهر «لعبة الفيديو» يومًا متعلقًا حقًا بأي شبكة تشغّل. يبقى CodeFormer الخيار الافتراضي لمتانته أمام التلف الشديد وللمقبض الذي أمضت هذه الملاحظة قسمين فيه؛ ويبقى GPEN خيار السرعة عند 2.6 ثانية لكل وجه.
7 · القيود
- الاختبار البصري 35 وجهًا؛ والاختبار المتري 4 صور شخصية × 120 تشغيلًا. صمدت الأشكال الرتيبة على كل صورة شخصية على حدة؛ وذلك هو الادعاء الذي نعتمد عليه؛ أما القيم المطلقة فستنحرف بحسب الشخص والمسح الضوئي.
- ArcFace حكم واحد، وهو الحكم القياسي، مع تحفظ تحمّل الضبابية الذي نستغله كخط أساس. الدراسة الإدراكية البشرية على آلاف الوجوه هي الأداة الناقصة، وملاحظة خط العمر تستند إلى العيون لا إلى التضمينات.
- تدهور اصطناعي. يضيف تلف صندوق الأحذية الحقيقي خدوشًا وتفضضًا لا تنمذجهما حزمة التلف؛ ومرحلة التلف تتعامل معهما على حدة.
- حد الوجوه الصغيرة قائم: تحت نحو 40 px من الوجه، لا ينتج أي إعداد وجهًا حادًا أمينًا، والمخرج الصادق هو وجه ناعم.
المراجع
- Zhou, S., Chan, K. C. K., Li, C., & Loy, C. C. (2022). Towards Robust Blind Face Restoration with Codebook Lookup Transformer. NeurIPS 35. arXiv:2206.11253. arxiv.org
- Wang, X., Li, Y., Zhang, H., & Shan, Y. (2021). Towards Real-World Blind Face Restoration with Generative Facial Prior. CVPR. arXiv:2101.04061. arxiv.org
- Yang, T., Ren, P., Xie, X., & Zhang, L. (2021). GAN Prior Embedded Network for Blind Face Restoration in the Wild. CVPR. arXiv:2105.06070. arxiv.org
- Deng, J., Guo, J., Xue, N., & Zafeiriou, S. (2019). ArcFace: Additive Angular Margin Loss for Deep Face Recognition. CVPR. arXiv:1801.07698. arxiv.org
- Karras, T., Laine, S., & Aila, T. (2019). A Style-Based Generator Architecture for Generative Adversarial Networks (the FFHQ alignment template). CVPR. arXiv:1812.04948. arxiv.org
- Blau, Y., & Michaeli, T. (2018). The Perception-Distortion Tradeoff. CVPR. arXiv:1711.06077. arxiv.org
- FaceFusion (open-source face processing platform): the reference implementation our SCRFD decode and model preprocessing are ported from, 1:1. github.com
- Lange, D. (1936). “Migrant Mother” (Destitute pea pickers in California), Farm Security Administration. Public domain, via Wikimedia Commons. commons.wikimedia.org
- Gardner, A. (1863). Abraham Lincoln, portrait O-77. Public domain, via Wikimedia Commons. commons.wikimedia.org
- ONNX Runtime: the inference engine both our server (CPU) and in-browser (WebGPU/WASM) engines run on. onnxruntime.ai