Blog / Ingeniería

Ampliación con IA vs bicúbica: un benchmark de 28 imágenes

· informe de experimento · corpus: Kodak-24 + 4 escaneos históricos · 5 métodos de reconstrucción · 140 ejecuciones

Toda herramienta de fotos promete ahora “mejorar”. La nuestra ejecuta Real-ESRGAN[1], así que le debíamos una respuesta a una pregunta incómoda: cuando mides como mide la literatura de procesamiento de imágenes, ¿la IA supera de verdad a la simple interpolación bicúbica? El resultado es el tipo de respuesta más interesante (no, y también rotundamente sí), y la división entre esas dos respuestas tiene nombre en la literatura: el compromiso percepción–distorsión[3]. Esta nota muestra el benchmark completo, incluido el caso en que la IA pierde estrepitosamente (el grano de película), y por qué publicamos de todos modos el modelo que pierde el benchmark clásico.

28imágenes de pruebasuite Kodak + 4 escaneos históricos
−1.07 dBPSNR de Real-ESRGAN frente a Lanczos-3la IA pierde la métrica de fidelidad…
3.1×más energía de bordes restaurada…y gana la de nitidez
0.711mejor SSIM media del conjuntola estructura se pone del lado del modelo

Cada cifra de esta nota se midió con el código del pipeline de producción: los mismos modelos, las mismas matemáticas. Registros brutos por imagen: e1_sr.json.

1 · Método

El corpus es la Kodak Lossless True Color Suite de 24 imágenes[4] (el conjunto de referencia de 768×512 en el que la literatura de compresión y superresolución se ha apoyado durante tres décadas), más cuatro recortes de 768×512 de escaneos de alta resolución de fotografías históricas, incluida Madre migrante de Dorothea Lange, de 1936[5], porque este sitio existe para fotos antiguas y las fotos antiguas tienen grano de película. Esa distinción decide la Sección 3.

Puntuamos tres cosas. Fidelidad, como relación señal-ruido de pico sobre RGB:

PSNR = 10 · log10( 255² / MSE ) dB(1)

similitud estructural (SSIM[2], luma, la ventana gaussiana estándar de 11×11, σ = 1.5, K₁ = 0.01, K₂ = 0.03):

SSIM = (2μxμy + C₁)(2σxy + C₂) / (μx² + μy² + C₁)(σx² + σy² + C₂)(2)

y nitidez como la medida Tenengrad (magnitud media al cuadrado del gradiente de Sobel), expresada como cociente de restauración, Tenengrad(salida) ÷ Tenengrad(verdad de referencia). Un cociente de 1.0 significaría que la reconstrucción lleva tanta energía de bordes como la fotografía original.

2 · Resultados: el compromiso, en vivo

En la métrica que todo el mundo publica, la escalera clásica se comporta exactamente como predice la teoría del muestreo (cada núcleo mejor compra una fracción de decibelio), y Real-ESRGAN queda penúltimo:

MétodoPSNR (dB)σSSIMcociente Tenengradms / imagen*
Vecino más cercano25.42±3.420.6730.3828
Bilineal25.88±3.620.6870.152236
Bicúbica (Catmull-Rom)26.29±3.680.7050.196343
Lanczos-326.45±3.710.7110.216876
Real-ESRGAN ×4 (el nuestro)25.38±3.160.7110.676462

*Entrada de 192×128, hardware de clase contenedor de 2 vCPU; los cocientes se trasladan, los milisegundos no. Si el PSNR fuera toda la historia, publicaríamos Lanczos-3 y borraríamos 4.9 MB de red neuronal. Pero traza cada método en el eje de fidelidad contra el eje de nitidez y el conjunto se divide en dos especies:

Interpolación clásicaReal-ESRGAN (producción)
00.20.40.60.825.425.826.226.6PSNR (dB): más alto es más fielcociente Tenengrad
Figura 1. El plano percepción–distorsión, un punto por método. Los interpoladores clásicos se agrupan abajo a la derecha: alta fidelidad, casi ninguna energía de bordes restaurada (0.15–0.22 de la del original). Real-ESRGAN está solo en 0.68, pagando ~1 dB de distorsión medida por ello: precisamente el compromiso del que Blau y Michaeli demostraron que ningún algoritmo escapa.

SSIM (diseñado para seguir la estructura percibida y no el error bruto[2]) parte la diferencia y se pone, por poco, del lado del modelo: la mejor media del conjunto en general, y un 0.704 frente a 0.694 más claro en el subconjunto Kodak, donde domina la textura fina. ¿Por qué la interpolación no puede competir en nitidez? Porque todo núcleo clásico es un operador lineal e invariante al desplazamiento: solo puede redistribuir las frecuencias que sobrevivieron a la reducción, nunca crear las que no. El límite de Nyquist no es una sugerencia. Un prior GAN esquiva el límite cambiando la pregunta: de “¿qué señal produjo estas muestras?” (incontestable) a “de todas las imágenes naturales que se reducirían a esto, ¿cuál es la más plausible?”[1] Y ahí vive exactamente también su riesgo: plausible no es verdadero.

Cuatro paneles del mismo detalle de una motocicleta: entrada reducida pixelada, ampliación bicúbica borrosa, reconstrucción nítida con Real-ESRGAN y la verdad de referencia
Figura 2. Qué aspecto tienen los números. Kodak kodim05, detalle de 240 px, de izquierda a derecha: la entrada reducida ×4 (mostrada con vecino más cercano), reconstrucción bicúbica, Real-ESRGAN a través de nuestra ruta de teselas de producción, verdad de referencia. Los radios y los cables que el panel bicúbico apenas sugiere, el modelo los vuelve a dibujar.

3 · El problema del grano de película, cuantificado

Los promedios esconden el hallazgo más útil. Divide el corpus y los deltas de PSNR por imagen (Real-ESRGAN − Lanczos-3) son claramente bimodales: en fotogramas modernos limpios el modelo está a menos de un decibelio (supera a Lanczos directamente en uno, +0.15 dB); en los cuatro escaneos históricos de película pierde catastróficamente: las medias del subconjunto son 28.75 frente a 32.12 dB:

Douglass 1879 · escaneoLincoln 1863 · escaneoProkudin 1911 · escaneokodim15 · retratoMadre migrante · escaneo
-5-4-3-2-10delta de PSNR (dB), negativo: la IA pierdeempate
Figura 3. Los cinco peores deltas por imagen. Cuatro de los cinco son los escaneos históricos. El mecanismo: el grano de película es de alta frecuencia, espacialmente decorrelacionado y parte de la verdad de referencia; el PSNR cobra como error cada partícula de grano borrada, y Real-ESRGAN, entrenado para leer el ruido de alta frecuencia como daño, lo borra todo.
Cuatro paneles de un detalle de la boca de Madre migrante: entrada reducida, bicúbica, Real-ESRGAN con el grano suavizado y la verdad de referencia granulada
Figura 4. Madre migrante (Lange, 1936), detalle de boca y barbilla a resolución de escaneo. La verdad de referencia (derecha) es un muro de grano de película honesto; Real-ESRGAN (tercero) devuelve porcelana. Cada partícula de grano borrada se cobra como error de PSNR, y algunos espectadores seguirán prefiriendo el panel limpio. Las métricas no son gusto.

Bajo una lupa los números se vuelven obvios: el escaneo de referencia es un muro de grano honesto, y el modelo devuelve porcelana. En Madre migrante cae 1.71 dB y 0.064 de SSIM, y algunos espectadores seguirán prefiriendo la salida limpia. Las métricas no son gusto; son un contrato sobre qué gusto estás optimizando. Esta medición es la razón por la que la etapa de mejora omite las fotos ya cercanas a su objetivo de resolución (un escaneo de archivo de alta resolución conserva sus píxeles nativos y su grano), y por la que nuestro renderizado facial vuelve a mezclar el grano propio de la fotografía sobre las caras restauradas en lugar de entregar la porcelana del modelo.

4 · Limitaciones

  • Sin métrica perceptual aprendida. LPIPS o DISTS afinarían el eje de percepción; Tenengrad es un sustituto honesto pero más simple. Los registros brutos están publicados para que cualquiera pueda volver a puntuar.
  • Una sola degradación. La bicúbica ×4 es el protocolo estándar y el caso más amable; los escaneos reales añaden núcleos de desenfoque, JPEG y ruido (la nota facial usa la pila de corrupción completa).
  • N = 28: de sobra para estos tamaños de efecto (el orden es estable bajo leave-one-out), poco para afirmaciones por subgrupos más allá de la división por grano.

5 · Conclusión

Medida como reconstrucción de señal, la superresolución con IA es un interpolador peor que Lanczos-3: 1.07 dB peor aquí, exactamente como predice el compromiso percepción–distorsión[3]. Medida como reconstrucción de una fotografía (estructura, energía de bordes y tus ojos) no hay comparación, en la otra dirección. La lectura práctica para tu caja de zapatos: para las fotos que van a ver personas, el modelo es la opción por defecto correcta; para los másteres de archivo, donde cada partícula de grano es evidencia, conserva también el escaneo en bruto. La herramienta de restauración está construida exactamente en torno a esa división.

Referencias

  1. Wang, X., Xie, L., Dong, C., & Shan, Y. (2021). Real-ESRGAN: Training Real-World Blind Super-Resolution with Pure Synthetic Data. ICCV Workshops. arXiv:2107.10833. arxiv.org
  2. Wang, Z., Bovik, A. C., Sheikh, H. R., & Simoncelli, E. P. (2004). Image Quality Assessment: From Error Visibility to Structural Similarity. IEEE Transactions on Image Processing, 13(4), 600–612. doi.org
  3. Blau, Y., & Michaeli, T. (2018). The Perception-Distortion Tradeoff. CVPR. arXiv:1711.06077. arxiv.org
  4. Kodak Lossless True Color Image Suite: 24 uncompressed 768×512 PhotoCD reference images, the classic image-quality test set. r0k.us
  5. Lange, D. (1936). “Migrant Mother” (Destitute pea pickers in California), Farm Security Administration. Public domain, via Wikimedia Commons. commons.wikimedia.org
  6. ONNX Runtime: the inference engine both our server (CPU) and in-browser (WebGPU/WASM) engines run on. onnxruntime.ai