¿Los colores son reales? Colorización con IA solo de croma
La preocupación más común sobre la colorización con IA es que el modelo esté repintando la fotografía: que la cara de la abuela sea ahora en parte una invención. En este pipeline eso queda descartado por construcción, no por promesa: al colorizador[1] solo se le permite aportar color, nunca detalle. Esta nota explica el mecanismo; después (nuevo en esta revisión) evalúa las 40 líneas de aritmética que deciden cuándo se ejecuta la colorización, sobre 115 fotografías etiquetadas: escaneos reales en blanco y negro, una copia a la albúmina real de 1867, tres familias de copias viradas químicamente, color real y color desvaído sintéticamente. El detector es perfecto en todas las familias monocromas, un 88% en color real, y en color desvaído se desploma al 8%, por una razón que ningún umbral puede arreglar: un color suficientemente desvaído es monocromo, matemáticamente.
Cada cifra de esta nota se midió con el código del pipeline de producción: los mismos modelos, las mismas matemáticas. Registros brutos por imagen: e4_mono.json.
1 · El mecanismo: la luminancia es intocable
Toda imagen se separa en luminancia (la estructura en blanco y negro: bordes, textura, caras, luz) y croma (el color colocado encima). Coloreamos en el espacio CIELAB, que hace explícita la separación: la fotografía conserva su propio canal L, bit a bit, y el modelo aporta solo los dos canales de color (a y b). Recombina y obtienes la foto original vestida con color estimado. Si el modelo de color tiene un mal día, el fallo es un tinte equivocado, nunca una cara cambiada, un borde desplazado o una textura inventada.
Antes
Después2 · ¿Cuándo se ejecuta? Las matemáticas de “¿esto es sepia?”
La colorización se ejecuta automáticamente solo cuando se mide que la foto es monocroma, y el sepia es lo que hace que eso no sea obvio. La prueba ingenua (r ≈ g ≈ b en todas partes) atrapa el blanco y negro neutro y nada más. Pero una copia sepia es rotundamente cromática: cada píxel lleva color. Lo que la hace monocroma es que todo su color apunta en la misma dirección: la química vira una copia con un solo compuesto, así que el matiz es constante mientras el croma escala con la densidad. La dirección, no la magnitud, es la huella.
Así que el detector muestrea hasta 20 000 píxeles en el espacio Lab y conserva tres estadísticos: la fracción cromática (proporción de píxeles con croma por encima de un suelo de ruido de 2 unidades), el croma medio C̄ y el interesante, la concentración de matiz, que es la longitud resultante media de los vectores unitarios de matiz, sacada directamente de la estadística direccional[2]:
R̄ vive en [0, 1]: exactamente 1 significa que todos los píxeles cromáticos coinciden en el matiz (un tinte perfecto); cerca de 0 significa que los matices se cancelan alrededor del círculo (la piel discutiendo con el cielo: una fotografía en color). La regla de producción tiene dos cláusulas:
3 · La evaluación con 115 fotos

| Grupo | n | correctas | tasa |
|---|---|---|---|
| Real B&W scans | 5 | 5 | 100% |
| Real albumen print (1867) | 1 | 1 | 100% |
| Synthetic neutral grayscale | 6 | 6 | 100% |
| Sepia tints (×3 strengths) | 18 | 18 | 100% |
| Selenium tints | 18 | 18 | 100% |
| Cyanotype tints | 18 | 18 | 100% |
| Real color photos | 25 | 22 | 88% |
| Faded color (synthetic) | 24 | 2 | 8% |
Todas las familias monocromas se clasifican perfectamente, incluida la única copia auténtica del siglo XIX, que cae en R̄ = 0.946, C̄ = 8.0, cómodamente dentro de la región. El diagrama de dispersión muestra todo el corpus a la vez, con la región de decisión sombreada:
Los tres falsos positivos en color real merecen nombrarse, porque no son ruido; son fotografías de escenas monocromáticas: el arroyo del bosque de Kodak (R̄ 0.93), el avión estacionado (R̄ 0.96), un barco al anochecer. El estadístico está haciendo su trabajo; esas escenas realmente concentran su matiz. El fallo es semántico, no matemático, y precisamente por eso el tratamiento Colorear es un interruptor visible y desmarcable en lugar de una decisión silenciosa.
4 · La región donde ningún umbral puede ganar
Ahora los puntos dorados. Desvae una foto en color y ocurren dos cosas a la vez: C̄ se encoge (los tintes se están muriendo) y R̄ sube: lo que sobrevive al desvaído no es una muestra justa de los matices originales, sino el residuo más la dominante de la copia, y una dominante es direccional por definición. Al 50% de desvaído nuestro corpus promedia R̄ ≈ 0.95; al 82%, R̄ ≈ 0.98 con C̄ ≈ 9. Compara con la Ec. 2: eso es la firma del tinte. Una foto en color muy desvaída no se ha acercado a la clase sepia; se ha unido a ella.
Así que el umbral es una elección de valores disfrazada de número. Sube R̄ a 0.98 y la puntuación del corpus gana diez puntos, mientras el clasificador empieza a fallar silenciosamente justo con los artefactos para los que existe la función: copias viradas reales, cuya química centenaria se desvía en matiz mucho más que cualquier tinte sintético. Producción se queda en 0.92 para conservar margen para la química real, acepta la región desvaída como genuinamente ambigua y te pregunta a ti, porque una foto que ha perdido el 82% de su color es una que su dueño bien puede querer recolorear. La tabla de arriba llama “incorrectas” a esas 22 fotos; sus dueños llamarían a la mitad “por favor, hazlo”.
5 · Lo que la colorización honestamente es
Una estimación. El modelo ha visto suficientes fotografías para saber que la hierba es verde y que los abrigos de lana de la década de 1860 suelen ser azul oscuro, pero no puede saber que el vestido de tu abuela era rojo y no verde. Donde un color es históricamente conocible, la estimación suele ser convincente; donde no lo es, el modelo elige algo plausible. Por eso el encuadre honesto es “color natural, añadido” y no “los colores originales, recuperados”, y por eso existe la opción de conservar una foto en blanco y negro. La estructura (las caras, la luz, el momento) es siempre la propia de la fotografía, por el mecanismo de la Sección 1. El mismo truco del espacio Lab funciona a la inversa en nuestro renderizado facial, donde el modelo facial aporta solo luminancia y la fotografía conserva su croma.
6 · Limitaciones
- Una sola copia virada real. El Herschel a la albúmina ancla el argumento del realismo, pero es una única muestra; un corpus datado de ferrotipos, albúminas y cianotipias es la continuación evidente.
- El desvaído sintético es amable con el detector. El desvaído cromogénico real es selectivo por tinte (el cian muere primero; por eso las copias de los 70 se vuelven rojas), lo que empuja R̄ hacia arriba aún más rápido que nuestro modelo uniforme.
- Sesgo de muestreo, por diseño: los detalles coloreados diminutos (un broche rojo solitario en un retrato sepia) pueden esconderse bajo el radar de la fracción cromática. El sesgo es deliberadamente hacia conservar los tintes.
Referencias
- Antic, J. (2019). DeOldify: A Deep Learning based project for colorizing and restoring old images. Open-source software. github.com
- Mardia, K. V., & Jupp, P. E. (2000). Directional Statistics. Wiley. (The mean resultant length R̄ behind our hue-concentration statistic.) onlinelibrary.wiley.com
- Kodak Lossless True Color Image Suite: 24 uncompressed 768×512 PhotoCD reference images, the classic image-quality test set. r0k.us
- Cameron, J. M. (1867). Portrait of Sir John Herschel, a real albumen print with genuine chemical toning. Public domain, via Wikimedia Commons. commons.wikimedia.org
- Lange, D. (1936). “Migrant Mother” (Destitute pea pickers in California), Farm Security Administration. Public domain, via Wikimedia Commons. commons.wikimedia.org
- ONNX Runtime: the inference engine both our server (CPU) and in-browser (WebGPU/WASM) engines run on. onnxruntime.ai