Powiększanie AI kontra bikubiczne: test na 28 obrazach
Każde narzędzie do zdjęć obiecuje dziś „ulepszanie”. Nasze używa Real-ESRGAN[1], więc byliśmy winni odpowiedź na niewygodne pytanie: gdy mierzysz tak, jak mierzy literatura przetwarzania obrazów, czy AI naprawdę bije zwykłą interpolację bikubiczną? Wynik jest odpowiedzią najciekawszego rodzaju (nie, a zarazem zdecydowanie tak), a rozdźwięk między tymi dwiema odpowiedziami ma w literaturze nazwę: kompromis percepcja–zniekształcenie[3]. Ta notatka pokazuje pełny test, łącznie z przypadkiem, w którym AI przegrywa z kretesem (ziarno filmu), i tłumaczy, czemu mimo to wdrażamy model, który przegrywa klasyczny test.
Każda liczba w tej notatce została zmierzona na kodzie produkcyjnego potoku: te same modele, ta sama matematyka. Surowe rekordy dla każdego obrazu: e1_sr.json.
1 · Metoda
Korpus to 24-obrazowy zestaw Kodak Lossless True Color Suite[4] (zbiór referencyjny 768×512, na którym literatura kompresji i superrozdzielczości opiera się od trzech dekad), plus cztery wycinki 768×512 ze skanów historycznych fotografii w wysokiej rozdzielczości, w tym Migrant Mother Dorothei Lange z 1936 roku[5], bo ta strona istnieje dla starych zdjęć, a stare zdjęcia mają ziarno filmu. To rozróżnienie rozstrzyga Sekcję 3.
Oceniamy trzy rzeczy. Wierność, jako szczytowy stosunek sygnału do szumu po RGB:
podobieństwo strukturalne (SSIM[2], luminancja, standardowe okno Gaussa 11×11, σ = 1,5, K₁ = 0,01, K₂ = 0,03):
oraz ostrość jako miarę Tenengrada (średni kwadrat wielkości gradientu Sobela), podawaną jako wskaźnik przywrócenia, Tenengrad(wyjście) ÷ Tenengrad(wzorzec). Wskaźnik 1,0 oznaczałby, że rekonstrukcja niesie tyle samo energii krawędzi co oryginalna fotografia.
2 · Wyniki: kompromis na żywo
Na metryce, którą raportują wszyscy, klasyczna drabinka zachowuje się dokładnie tak, jak przewiduje teoria próbkowania (każde lepsze jądro kupuje ułamek decybela), a Real-ESRGAN jest przedostatni:
| Metoda | PSNR (dB) | σ | SSIM | wskaźnik Tenengrada | ms / obraz* |
|---|---|---|---|---|---|
| Najbliższy sąsiad | 25.42 | ±3.42 | 0.673 | 0.382 | 8 |
| Biliniowa | 25.88 | ±3.62 | 0.687 | 0.152 | 236 |
| Bikubiczna (Catmull-Rom) | 26.29 | ±3.68 | 0.705 | 0.196 | 343 |
| Lanczos-3 | 26.45 | ±3.71 | 0.711 | 0.216 | 876 |
| Real-ESRGAN ×4 (nasz) | 25.38 | ±3.16 | 0.711 | 0.676 | 462 |
*Wejście 192×128, sprzęt klasy kontenerowej 2 vCPU; proporcje się przenoszą, milisekundy nie. Gdyby PSNR było całą historią, wdrożylibyśmy Lanczos-3 i skasowali 4,9 MB sieci neuronowej. Ale nanieś każdą metodę na oś wierności wobec osi ostrości, a stawka rozpada się na dwa gatunki:
SSIM (zaprojektowany, by śledzić postrzeganą strukturę zamiast surowego błędu[2]) rozstrzyga pośrodku i staje, nieznacznie, po stronie modelu: najlepsza średnia w całej stawce i wyraźniejsze 0,704 wobec 0,694 na podzbiorze Kodak, gdzie dominuje drobna faktura. Czemu interpolacja nie może konkurować na ostrości? Bo każde klasyczne jądro jest operatorem liniowym i niezmienniczym względem przesunięć: może tylko przerozdzielić częstotliwości, które przetrwały zmniejszenie, nigdy stworzyć tych, które nie przetrwały. Granica Nyquista to nie sugestia. Prior GAN omija tę granicę, zmieniając pytanie: z „jaki sygnał wytworzył te próbki?” (bez odpowiedzi) na „która ze wszystkich naturalnych fotografii, które zmniejszyłyby się do tego, jest najbardziej wiarygodna?”[1] Dokładnie tam też mieszka jego ryzyko: wiarygodne to nie prawdziwe.

3 · Problem ziarna filmu, w liczbach
Średnie ukrywają najbardziej użyteczne odkrycie. Podziel korpus, a różnice PSNR na obraz (Real-ESRGAN − Lanczos-3) są ostro dwumodalne: na czystych współczesnych kadrach model mieści się w granicach decybela (na jednym bije Lanczosa wprost, +0,15 dB); na czterech historycznych skanach filmu przegrywa katastrofalnie: średnie podzbiorów to 28,75 wobec 32,12 dB:

Pod lupą liczby stają się oczywiste: skan wzorcowy to ściana uczciwego ziarna, a model zwraca porcelanę. Na Migrant Mother traci 1,71 dB i 0,064 SSIM, a część widzów i tak będzie wolała czyste wyjście. Metryki to nie gust; to umowa co do tego, który gust optymalizujesz. Ten pomiar jest powodem, dla którego etap ulepszania pomija zdjęcia już bliskie jego celu rozdzielczości (archiwalny skan w wysokiej rozdzielczości zachowuje swoje natywne piksele i swoje ziarno), i dla którego nasze renderowanie twarzy wtapia własne ziarno fotografii z powrotem na odnowione twarze, zamiast oddawać porcelanę modelu.
4 · Ograniczenia
- Brak wyuczonej metryki percepcyjnej. LPIPS lub DISTS wyostrzyłyby oś percepcji; Tenengrad to uczciwe, ale prostsze przybliżenie. Surowe rekordy są opublikowane, więc każdy może przeliczyć wyniki.
- Jedna degradacja. Bikubiczne ×4 to standardowy protokół i najłaskawszy przypadek; prawdziwe skany dodają jądra rozmycia, JPEG i szum (notatka o twarzach używa pełnego stosu zniekształceń).
- N = 28: dość dla tych wielkości efektu (kolejność jest stabilna przy odrzucaniu po jednym), mało dla twierdzeń o podgrupach poza podziałem na ziarno.
5 · Wniosek
Mierzona jako rekonstrukcja sygnału, superrozdzielczość AI jest gorszym interpolatorem niż Lanczos-3: tutaj o 1,07 dB gorszym, dokładnie jak przewiduje kompromis percepcja–zniekształcenie[3]. Mierzona jako rekonstrukcja fotografii (struktura, energia krawędzi i Twoje oczy) nie ma sobie równych, w drugą stronę. Praktyczny wniosek dla Twojego pudełka po butach: dla zdjęć, które będą oglądać ludzie, model jest właściwym domyślnym wyborem; dla masterów archiwalnych, gdzie każde ziarenko jest dowodem, zachowaj też surowy skan. Narzędzie do renowacji jest zbudowane dokładnie wokół tego podziału.
Źródła
- Wang, X., Xie, L., Dong, C., & Shan, Y. (2021). Real-ESRGAN: Training Real-World Blind Super-Resolution with Pure Synthetic Data. ICCV Workshops. arXiv:2107.10833. arxiv.org
- Wang, Z., Bovik, A. C., Sheikh, H. R., & Simoncelli, E. P. (2004). Image Quality Assessment: From Error Visibility to Structural Similarity. IEEE Transactions on Image Processing, 13(4), 600–612. doi.org
- Blau, Y., & Michaeli, T. (2018). The Perception-Distortion Tradeoff. CVPR. arXiv:1711.06077. arxiv.org
- Kodak Lossless True Color Image Suite: 24 uncompressed 768×512 PhotoCD reference images, the classic image-quality test set. r0k.us
- Lange, D. (1936). “Migrant Mother” (Destitute pea pickers in California), Farm Security Administration. Public domain, via Wikimedia Commons. commons.wikimedia.org
- ONNX Runtime: the inference engine both our server (CPU) and in-browser (WebGPU/WASM) engines run on. onnxruntime.ai