كاشف وجوه رمّم ذات مرة بنطال طفل صغير
أثناء الاختبارات المبكرة، أبلغ كاشف الوجوه عن كشف واثق في لقطة عائلية، و«رمّمه» الخط بإخلاص، غير أن ما اكتُشف كان بنطال طفل صغير من قماش الكوردروي. قرأ الكاشف طيات القماش على أنها وجه، ثم أعاد نموذج الوجوه رسمها وجهًا. علّمنا هذا الفشل أن ثقة الكاشف وحدها ليست إشارة صالحة للاستخدام في الصور القديمة، وأنتج البوابة الهندسية التي يجب أن يمر بها الآن كل وجه مرشح. تضيف هذه المراجعة النصف الآخر من القصة، مقيسًا: ما أصغر وجه يستطيع الكاشف العثور عليه أصلًا. يقع الحد الأدنى بين 14 و20 بكسلًا داخل الإطار، وصورة مؤتمر سولفاي الشهيرة لعام 1927، التي تقف وجوهها التسعة والعشرون عند 21–27 px، تجتازه مع العثور على كل حاضر فيها دون استثناء.
كل رقم في هذه الملاحظة قيس على كود خط الإنتاج: النماذج نفسها، والحسابات نفسها. السجلات الخام لكل صورة: e5_detect.json.
1 · لماذا تُربك الصور القديمة كواشف الوجوه
تُدرَّب الكواشف في الغالب على صور حديثة جيدة التعريض. أما المسوحات القديمة فتقدم ملامس نادرًا ما تحتويها مجموعة التدريب: نسيج الأقمشة، والدانتيل، وأوراق الشجر، وأضرار الماء، والحبيبات، وكلها قادرة على إنتاج كشوف كاذبة عالية الثقة. وتقدم أيضًا المشكلة المعاكسة: وجوه حقيقية صغيرة وباهتة ومنخفضة التباين. لا تستطيع عتبة ثقة وحدها الفصل بين الاثنين، لأن الإيجابيات الكاذبة كثيرًا ما تسجل درجة أعلى من الوجوه الصغيرة الحقيقية. كاشفنا هو SCRFD-2.5G[1]، مفكك 1:1 من التنفيذ المرجعي في FaceFusion[2]: تُؤطَّر الصورة في مدخل 640×640، ويعود كل مرشح بصندوق، وخمسة معالم، ودرجة ثقة.
2 · البوابة
بدلًا من الوثوق بالدرجة، نختبر ما إذا كانت معالم الكشف مرتبة كوجه: حساب رخيص على نقاط العينين والفم:
| القاعدة | العتبة | ما ترفضه |
|---|---|---|
| ثقة الكاشف | ≥ 0.55 | الكشوف الهامشية التي لا تستحق مزيدًا من الاختبار. |
| تباعد العينين نسبةً إلى عرض الصندوق | 0.25 – 0.75 | عناقيد معالم أضيق أو أوسع من أن تكون عينين في صندوق بحجم وجه: الهندسة المعتادة للإيجابيات الكاذبة من طيات القماش. |
| الفم تحت العينين | بمقدار ≥ 0.2 × مسافة العينين | ترتيبات المعالم المقلوبة والمبعثرة. |
العتبات متساهلة عمدًا: فهي تصف أي وجه بشري معقول، بما في ذلك الوجوه المائلة وذات الزاوية ثلاثة أرباع، بينما تستبعد الترتيبات التي لا يمكن لأي وجه أن يتخذها. ومنذ طرح البوابة، لم يتكرر فشل من فئة البنطال على صور اختبارنا.
3 · جديد: حد الكشف الأدنى، مقيسًا

تقع نتيجة سولفاي تمامًا حيث يتنبأ السلّم، على الجانب الجيد: اكتُشف 29 من 29 حاضرًا على مقياس الإطار الكامل، بثقة 0.734–0.864، وكل واحد منهم يجتاز البوابة الهندسية. وتجربة ضبط تستحق النشر لأنها مخالفة للحدس: تبليط الصورة نفسها بسذاجة 2×2 (بكسلات أكثر لكل وجه) لا يجد سوى 27 من 29. وجهان يمتدان عبر حدود البلاطات ولا تراهما أي بلاطة كاملين؛ وشبكة 3×3 تصادف أن تقطع في مواضع أخرى فتستعيد الـ29 كلها. هذا اللاتماثل هو سبب أن مرور الوجوه الصغيرة في محرك المتصفح يكشف على الإطار الكامل وعلى أرباع متداخلة، ويدمج المرشحين بحسب التقاطع على الاتحاد: الكشف بالتبليط يحتاج إلى تداخل، لا إلى دقة فقط.
القراءة العملية للصور الجماعية: الوجه الأصغر من نحو 3% من الضلع الطويل للصورة غير مرئي للكاشف. قصّ الصورة أضيق قبل الترميم (تعود البكسلات نفسها عبر الإطار أكبر، على الجانب الآمن من الهاوية) وانظر ملاحظة تصيير الوجوه لما يحدث للوجوه الصغيرة بعد الكشف.
4 · القيود
لا تستطيع بوابة هندسية سوى رفض الترتيبات المستحيلة. فالإيجابي الكاذب الذي يصادف أن يكون على شكل وجه (دمية، تمثال، صورة شخصية على جدار) يمر، ويمكن القول إنه ينبغي أن يمر، لأن ترميمه غير ضار. مهمة البوابة ضيقة: ألا يُعاد أبدًا رسم ملابس أحدهم وجهًا. قياسات الحد الأدنى هي صورة شخصية واحدة وصورة جماعية واحدة: تكفي لتحديد موضع الهاوية بين 14 و20 px، لا لرسم شكلها الدقيق عبر الوضعيات والإضاءات؛ والثقة بين 20 و28 px أكثر تذبذبًا بوضوح مما فوقها، لذا ينبغي اعتبار الوجوه في ذلك النطاق معرضة للخطر لا آمنة.
المراجع
- Guo, J., Deng, J., Lattas, A., & Zafeiriou, S. (2021). Sample and Computation Redistribution for Efficient Face Detection. arXiv:2105.04714. arxiv.org
- FaceFusion (open-source face processing platform): the reference implementation our SCRFD decode and model preprocessing are ported from, 1:1. github.com
- Couprie, B. (1927). Photograph of the Fifth Solvay International Conference: 29 attendees, the densest concentration of physics Nobel laureates ever photographed. Public domain, via Wikimedia Commons. commons.wikimedia.org
- Lange, D. (1936). “Migrant Mother” (Destitute pea pickers in California), Farm Security Administration. Public domain, via Wikimedia Commons. commons.wikimedia.org
- ONNX Runtime: the inference engine both our server (CPU) and in-browser (WebGPU/WASM) engines run on. onnxruntime.ai