المدونة / هندسة

التكبير بالذكاء الاصطناعي مقابل التكعيبي: قياس على 28 صورة

· تقرير تجربة · المجموعة: Kodak-24 + 4 مسوحات تاريخية · 5 طرق إعادة بناء · 140 تشغيلًا

كل أداة صور تعد الآن بـ«التحسين». أداتنا تشغّل Real-ESRGAN[1]، لذا كنا مدينين بجواب لسؤال غير مريح: حين تقيس بالطريقة التي تقيس بها أدبيات معالجة الصور، هل يتفوق الذكاء الاصطناعي فعلًا على الاستيفاء التكعيبي المزدوج البسيط؟ النتيجة من أكثر أنواع الأجوبة إثارة للاهتمام (لا، وأيضًا نعم بشكل قاطع)، وللانقسام بين هذين الجوابين اسم في الأدبيات: مفاضلة الإدراك والتشويه[3]. تعرض هذه الملاحظة القياس المعياري كاملًا، بما في ذلك الحالة التي يخسر فيها الذكاء الاصطناعي بشدة (حبيبات الفيلم)، ولماذا نطرح النموذج الذي يخسر القياس الكلاسيكي رغم ذلك.

28صورة اختبارمجموعة Kodak + 4 مسوحات تاريخية
−1.07 dBPSNR لـ Real-ESRGAN مقابل Lanczos-3يخسر الذكاء الاصطناعي مقياس الأمانة…
3.1×طاقة حواف مستعادة أكثر…ويفوز بمقياس الحدة
0.711أفضل متوسط SSIM في الميدانالبنية تنحاز إلى النموذج

كل رقم في هذه الملاحظة قيس على كود خط الإنتاج: النماذج نفسها، والحسابات نفسها. السجلات الخام لكل صورة: e1_sr.json.

1 · الطريقة

المجموعة هي مجموعة Kodak Lossless True Color Suite المكونة من 24 صورة[4] (المجموعة المرجعية بأبعاد 768×512 التي اتكأت عليها أدبيات الضغط والدقة الفائقة ثلاثة عقود)، إضافة إلى أربع قصاصات بأبعاد 768×512 من مسوحات عالية الدقة لصور تاريخية، بينها الأم المهاجرة لدوروثيا لانغ من عام 1936[5]، لأن هذا الموقع موجود من أجل الصور القديمة، والصور القديمة فيها حبيبات فيلم. وذلك التمييز يحسم القسم 3.

نقيس ثلاثة أشياء. الأمانة، بوصفها نسبة ذروة الإشارة إلى الضوضاء على RGB:

PSNR = 10 · log10( 255² / MSE )  dB(1)

والتشابه البنيوي (SSIM[2]، على اللوما، بالنافذة الغاوسية القياسية 11×11، σ = 1.5، K₁ = 0.01، K₂ = 0.03):

SSIM = (2μxμy + C₁)(2σxy + C₂) / (μx² + μy² + C₁)(σx² + σy² + C₂)(2)

والحدة بوصفها مقياس Tenengrad (متوسط مربع مقدار تدرج Sobel)، مبلَّغًا عنه بوصفه نسبة استعادة، Tenengrad(المخرج) ÷ Tenengrad(الصورة المرجعية). نسبة 1.0 تعني أن إعادة البناء تحمل من طاقة الحواف بقدر ما تحمله الصورة الأصلية.

2 · النتائج: المفاضلة، مباشرة

على المقياس الذي يبلّغ عنه الجميع، يتصرف السلّم الكلاسيكي تمامًا كما تتنبأ نظرية أخذ العينات (كل نواة أفضل تشتري كسرًا من الديسيبل)، ويأتي Real-ESRGAN في المرتبة قبل الأخيرة:

الطريقةPSNR (dB)σSSIMنسبة Tenengradms / صورة*
الجار الأقرب25.42±3.420.6730.3828
الخطي المزدوج25.88±3.620.6870.152236
التكعيبي المزدوج (Catmull-Rom)26.29±3.680.7050.196343
Lanczos-326.45±3.710.7110.216876
Real-ESRGAN ×4 (نموذجنا)25.38±3.160.7110.676462

*مدخل 192×128، عتاد من فئة الحاويات ذات 2 vCPU؛ النسب قابلة للنقل، والميلي ثوانٍ ليست كذلك. لو كان PSNR هو القصة كلها لطرحنا Lanczos-3 وحذفنا 4.9 MB من الشبكة العصبية. لكن ارسم كل طريقة على محور الأمانة مقابل محور الحدة فينقسم الميدان إلى نوعين:

الاستيفاء الكلاسيكيReal-ESRGAN (الإنتاج)
00.20.40.60.825.425.826.226.6PSNR (dB): الأعلى أكثر أمانةنسبة Tenengrad
الشكل 1. مستوى الإدراك والتشويه، نقطة لكل طريقة. تتجمع أدوات الاستيفاء الكلاسيكية في الأسفل يمينًا: أمانة عالية، وشبه انعدام لطاقة الحواف المستعادة (0.15–0.22 من طاقة الأصل). يقف Real-ESRGAN وحده عند 0.68، دافعًا نحو 1 dB من التشويه المقيس ثمنًا لذلك: تحديدًا المفاضلة التي أثبت Blau وMichaeli أن لا خوارزمية تفلت منها.

SSIM (المصمم لتتبع البنية المدركة لا الخطأ الخام[2]) يقسم الفرق وينحاز، بفارق ضئيل، إلى النموذج: أفضل متوسط في الميدان إجمالًا، و0.704 مقابل 0.694 بوضوح أكبر على مجموعة Kodak الفرعية حيث يهيمن الملمس الدقيق. لماذا لا يستطيع الاستيفاء المنافسة على الحدة؟ لأن كل نواة كلاسيكية مؤثر خطي ثابت الإزاحة: لا يستطيع سوى إعادة توزيع الترددات التي نجت من التصغير، ولا يخلق أبدًا تلك التي لم تنجُ. حد نايكويست ليس اقتراحًا. تتحايل المعرفة المسبقة لشبكة GAN على الحد بتغيير السؤال: من «أي إشارة أنتجت هذه العينات؟» (لا جواب له) إلى «من بين كل الصور الطبيعية التي ستُصغَّر إلى هذا، أيها الأكثر معقولية؟»[1] وهناك بالضبط يكمن خطرها أيضًا: المعقول ليس الحقيقي.

أربع لوحات لتفصيل الدراجة النارية نفسه: مدخل مصغَّر مبكسل، وتكبير تكعيبي مزدوج ضبابي، وإعادة بناء حادة بـReal-ESRGAN، والصورة المرجعية
الشكل 2. كيف تبدو الأرقام. Kodak kodim05، تفصيل 240 px، من اليسار إلى اليمين: المدخل المصغَّر ×4 (معروض بالجار الأقرب)، وإعادة البناء التكعيبية المزدوجة، وReal-ESRGAN عبر مسار البلاطات الإنتاجي لدينا، والصورة المرجعية. الأسلاك ومسارات الكابلات التي لا تفعل اللوحة التكعيبية المزدوجة سوى الإيحاء بها، يعيد النموذج رسمها.

3 · مشكلة حبيبات الفيلم، مقيسة كميًا

تخفي المتوسطات النتيجة الأكثر فائدة. قسّم المجموعة فتجد فروق PSNR لكل صورة (Real-ESRGAN − Lanczos-3) ثنائية النمط بحدة: على الإطارات الحديثة النظيفة يبقى النموذج ضمن ديسيبل واحد (بل يتفوق على Lanczos صراحة في واحدة، +0.15 dB)؛ وعلى مسوحات الأفلام التاريخية الأربعة يخسر خسارة كارثية: متوسطا المجموعتين الفرعيتين 28.75 مقابل 32.12 dB:

دوغلاس 1879 · مسحلينكولن 1863 · مسحبروكودين 1911 · مسحkodim15 · صورة شخصيةالأم المهاجرة · مسح
-5-4-3-2-10فرق PSNR (dB)، السالب: يخسر الذكاء الاصطناعيتعادل
الشكل 3. أسوأ خمسة فروق لكل صورة. أربعة من الخمسة هي المسوحات التاريخية. الآلية: حبيبات الفيلم عالية التردد، وغير مترابطة مكانيًا، وجزء من الصورة المرجعية؛ يحاسب PSNR كل حبيبة مُحيت بوصفها خطأً، وReal-ESRGAN، المدرَّب على قراءة الضوضاء عالية التردد على أنها تلف، يمحوها كلها.
أربع لوحات لتفصيل فم من الأم المهاجرة: مدخل مصغَّر، وتكعيبي مزدوج، وReal-ESRGAN بحبيبات منعّمة، وصورة مرجعية محببة
الشكل 4. الأم المهاجرة (لانغ 1936)، تفصيل الفم والذقن بدقة المسح. الصورة المرجعية (يمينًا) جدار من حبيبات الفيلم الصادقة؛ ويعيد Real-ESRGAN (الثالث) بورسلينًا. كل حبيبة مُحيت تُحاسب خطأً في PSNR، وسيظل بعض المشاهدين يفضلون اللوحة النظيفة. المقاييس ليست ذوقًا.

تحت عدسة مكبرة تصبح الأرقام بديهية: مسح الصورة المرجعية جدار من الحبيبات الصادقة، ويعيد النموذج بورسلينًا. على الأم المهاجرة يهبط 1.71 dB و0.064 SSIM، وسيظل بعض المشاهدين يفضلون المخرج النظيف. المقاييس ليست ذوقًا؛ إنها عقد بشأن أي ذوق تحسّنه. هذا القياس هو سبب تخطي مرحلة التحسين للصور القريبة أصلًا من هدف دقتها (يحتفظ المسح الأرشيفي عالي الدقة ببكسلاته الأصلية وحبيباته)، وسبب أن تصيير الوجوه لدينا يمزج حبيبات الصورة نفسها فوق الوجوه المرممة بدلًا من طرح بورسلين النموذج.

4 · القيود

  • لا مقياس إدراكي متعلَّم. كان LPIPS أو DISTS سيشحذ محور الإدراك؛ وTenengrad بديل صادق لكنه أبسط. السجلات الخام منشورة ليتمكن أي شخص من إعادة التقييم.
  • تدهور واحد. التكعيبي المزدوج ×4 هو البروتوكول القياسي والحالة الأرحم؛ تضيف المسوحات الحقيقية نوى ضبابية وJPEG وضوضاء (ملاحظة الوجوه تستخدم حزمة التلف كاملة).
  • N = 28: كثير لأحجام الأثر هذه (الترتيب مستقر تحت ترك واحد خارجًا)، وقليل لادعاءات المجموعات الفرعية فيما يتجاوز انقسام الحبيبات.

5 · الخلاصة

مقيسةً بوصفها إعادة بناء للإشارة، الدقة الفائقة بالذكاء الاصطناعي أداة استيفاء أسوأ من Lanczos-3: أسوأ بمقدار 1.07 dB هنا، تمامًا كما تتنبأ مفاضلة الإدراك والتشويه[3]. ومقيسةً بوصفها إعادة بناء للصورة الفوتوغرافية (البنية، وطاقة الحواف، وعيناك) فالمسافة ليست قريبة، في الاتجاه الآخر. القراءة العملية لصندوق أحذيتك: للصور التي سيشاهدها الناس، النموذج هو الخيار الافتراضي الصحيح؛ وللأصول الأرشيفية حيث كل حبيبة دليل، احتفظ بالمسح الخام أيضًا. أداة الترميم مبنية حول ذلك الانقسام تحديدًا.

المراجع

  1. Wang, X., Xie, L., Dong, C., & Shan, Y. (2021). Real-ESRGAN: Training Real-World Blind Super-Resolution with Pure Synthetic Data. ICCV Workshops. arXiv:2107.10833. arxiv.org
  2. Wang, Z., Bovik, A. C., Sheikh, H. R., & Simoncelli, E. P. (2004). Image Quality Assessment: From Error Visibility to Structural Similarity. IEEE Transactions on Image Processing, 13(4), 600–612. doi.org
  3. Blau, Y., & Michaeli, T. (2018). The Perception-Distortion Tradeoff. CVPR. arXiv:1711.06077. arxiv.org
  4. Kodak Lossless True Color Image Suite: 24 uncompressed 768×512 PhotoCD reference images, the classic image-quality test set. r0k.us
  5. Lange, D. (1936). “Migrant Mother” (Destitute pea pickers in California), Farm Security Administration. Public domain, via Wikimedia Commons. commons.wikimedia.org
  6. ONNX Runtime: the inference engine both our server (CPU) and in-browser (WebGPU/WASM) engines run on. onnxruntime.ai