Bir yüz dedektörü bir keresinde bir bebeğin pantolonunu restore etti
Erken testler sırasında yüz dedektörü bir aile fotoğrafında kendinden emin bir tespit bildirdi ve hat görevine sadık biçimde onu “restore etti”; tek sorun, tespitin bir bebeğin kadife pantolonu olmasıydı. Kumaş kıvrımları dedektöre yüz gibi göründü ve yüz modeli de onları bir yüz olarak yeniden boyadı. Bu hata bize eski fotoğraflarda dedektör güveninin tek başına kullanılabilir bir sinyal olmadığını öğretti ve artık her aday yüzün geçmek zorunda olduğu geometrik kapıyı doğurdu. Bu revizyon hikâyenin diğer yarısını ölçülmüş olarak ekliyor: dedektör en fazla ne kadar küçük bir yüzü bulabilir. Taban, letterbox'lanmış 14 ile 20 piksel arasında duruyor ve 29 yüzü 21–27 px boyunda olan ünlü 1927 Solvay Konferansı fotoğrafı, her bir katılımcı bulunarak bu tabanı geçiyor.
Bu nottaki her sayı üretim hattının kodunda ölçüldü: aynı modeller, aynı matematik. Görüntü başına ham kayıtlar: e5_detect.json.
1 · Eski fotoğraflar yüz dedektörlerini neden bozar
Dedektörler çoğunlukla modern, iyi pozlanmış görüntülerle eğitilir. Eski taramalar eğitim setinin nadiren içerdiği dokular sunar: kumaş dokusu, dantel, yapraklar, su hasarı ve gren; hepsi yüksek güvenli yanlış tespitler üretebilir. Tam tersi sorunu da sunarlar: küçük, solmuş ve düşük kontrastlı gerçek yüzler. Tek başına bir güven eşiği ikisini ayıramaz, çünkü yanlış pozitifler sık sık gerçek küçük yüzlerden daha yüksek puan alır. Dedektörümüz SCRFD-2.5G[1], FaceFusion referans uygulamasından[2] birebir çözülmüş: fotoğraf 640×640'lık bir girişe letterbox'lanır ve her aday bir kutu, beş nirengi noktası ve bir güven puanıyla geri döner.
2 · Kapı
Puana güvenmek yerine tespitin nirengi noktalarının bir yüz gibi dizilip dizilmediğini test ediyoruz: göz ve ağız noktaları üzerinde ucuz aritmetik:
| Kural | Eşik | Neyi reddeder |
|---|---|---|
| Dedektör güveni | ≥ 0.55 | Daha fazla test etmeye değmeyecek marjinal tespitler. |
| Göz aralığı / kutu genişliği | 0.25 – 0.75 | Yüz boyutunda bir kutuda iki göz olamayacak kadar sıkışık ya da geniş nirengi kümeleri: kumaş kıvrımı yanlış pozitiflerinin tipik geometrisi. |
| Ağız gözlerin altında | ≥ 0.2 × göz uzaklığı kadar | Baş aşağı ve karışmış nirengi dizilimleri. |
Eşikler kasıtlı olarak gevşek: eğik ve dörtte üç profil dahil her makul insan yüzünü tarif ederken hiçbir yüzün sahip olamayacağı dizilimleri dışlıyorlar. Kapı yayınlandığından beri pantolon sınıfı hata test fotoğraflarımızda tekrar etmedi.
3 · Yeni: tespit tabanı, ölçülmüş

Solvay sonucu tam olarak merdivenin öngördüğü yere, iyi tarafa düşüyor: 29 katılımcının 29'u tam kare ölçeğinde tespit edildi, güven 0.734–0.864, her biri geometrik kapıdan geçti. Ve sezgiye aykırı olduğu için yayımlamaya değer bir kontrol: aynı fotoğrafı naif biçimde 2×2 karolamak (yüz başına daha fazla piksel) 29 yüzün yalnızca 27'sini buluyor. İki yüz karo sınırlarına denk geliyor ve iki karodan hiçbiri onları bütün olarak görmüyor; 3×3 ızgara tesadüfen başka yerden kesiyor ve 29'un tamamını buluyor. Bu asimetri, tarayıcı motorunun küçük yüz geçişinin neden tam kare ve örtüşen çeyrekler üzerinde tespit yaptığını ve adayları kesişim-birleşim oranıyla birleştirdiğini açıklıyor: karolu tespitin çözünürlüğe değil, örtüşmeye ihtiyacı var.
Grup fotoğrafları için pratik okuma: fotoğrafın uzun kenarının kabaca %3'ünden küçük bir yüz dedektöre görünmez. Restore etmeden önce daha sıkı kırp (aynı pikseller letterbox'tan daha büyük, uçurumun güvenli tarafında geri gelir) ve tespitten sonra küçük yüzlere ne olduğu için yüz render notuna bak.
4 · Sınırlamalar
Geometrik bir kapı yalnızca imkânsız dizilimleri reddedebilir. Tesadüfen yüz biçiminde olan bir yanlış pozitif (bir oyuncak bebek, bir heykel, duvardaki bir portre) geçer ve muhtemelen geçmeli de, çünkü onu restore etmek zararsızdır. Kapının işi dar: birinin giysisini bir daha asla yüz olarak boyamamak. Taban ölçümleri bir portre ve bir grup fotoğrafından ibaret: uçurumu 14 ile 20 px arasında konumlandırmaya yetiyor, pozlar ve ışıklandırmalar boyunca tam şeklini haritalamaya değil; ayrıca 20 ile 28 px arasındaki güven, üstündekinden belirgin biçimde daha gürültülü, bu yüzden o banttaki yüzler güvenli değil, riskli sayılmalı.
Kaynaklar
- Guo, J., Deng, J., Lattas, A., & Zafeiriou, S. (2021). Sample and Computation Redistribution for Efficient Face Detection. arXiv:2105.04714. arxiv.org
- FaceFusion (open-source face processing platform): the reference implementation our SCRFD decode and model preprocessing are ported from, 1:1. github.com
- Couprie, B. (1927). Photograph of the Fifth Solvay International Conference: 29 attendees, the densest concentration of physics Nobel laureates ever photographed. Public domain, via Wikimedia Commons. commons.wikimedia.org
- Lange, D. (1936). “Migrant Mother” (Destitute pea pickers in California), Farm Security Administration. Public domain, via Wikimedia Commons. commons.wikimedia.org
- ONNX Runtime: the inference engine both our server (CPU) and in-browser (WebGPU/WASM) engines run on. onnxruntime.ai