Skip to content
← Blog

التحيز الخفي لأجهزة الالتقاط في معيار التعرف الضوئي على الحروف: ما يقيسه VeriCam عبر الأجهزة

Based on: VeriCam: A Verification Baseline for the Classification of Unknown Data — Lucas Wojcik, Gabriel E. Lima, Sergio M. Silva, Eduil Nascimento, David Menotti

نموذج PARSeq-tiny المُدرَّب مسبقًا في ورقة VeriCam حقق دقة لوحة كاملة بنسبة 95.98٪ في تقييم LPLCv2 داخل الجهاز. على اللوحات "المثالية"، وصل إلى 99.01٪؛ وعلى اللوحات "غير مقروءة"، 68.18٪.

في تقييم عبر الأجهزة في الورقة، حيث لم تكن أجهزة الالتقاط الاختبارية موجودة أثناء التدريب، تغيرت هذه الأرقام. كانت دقة اللوحة الإجمالية 94.26٪، بينما كان الأداء على اللوحات غير مقروءة 50.76٪: فرق بنسبة 17.42 نقطة مئوية عن النتيجة داخل الجهاز.

هذه التجارب ليست اختبار نشر إنتاجي، والورقة لا تعزل الإشارات البصرية الدقيقة المسؤولة عن الفجوة. لكنها تدعم تحذير المؤلفين المركزي: يمكن أن يؤدي تلوث جهاز الالتقاط إلى تحيز التقييم في مجموعات بيانات OCR لمراقبة حركة المرور.

ورقة من جامعة بارانا الاتحادية (UFPR) وشرطة بارانا العسكرية، بعنوان VeriCam: خط أساس للتحقق لتصنيف البيانات المجهولة (arXiv:2608.31107، مقبولة في SIBGRAPI WIP 2026)، تدرس هذه القضية مباشرة. يجادل المؤلفون Lucas Wojcik وGabriel E. Lima وSergio M. Silva Jr. وEduil Nascimento Jr. وDavid Menotti بأن LPLCv2 يحمل تحيزًا جوهريًا لجهاز الالتقاط يشكل تحديًا للتعميم عبر الأجهزة للمهام اللاحقة لالتفاتة لوحة الترخيص، بما في ذلك OCR.

يقترح خط أنابيب VeriCam تدريب نموذج تحقق لمقارنة أزواج الصور، ثم بناء رسم بياني وتجميع فئات أجهزة الالتقاط المجهولة دون الحاجة إلى تسميات فئات وقت الاختبار. في السيناريو عبر الأجهزة، تبلغ الورقة عن درجة F1 قدرها 93.45 للتحقق. يبلغ الجدول V عن V-Measure قدره 80.14 لإعداد التجميع Leiden الخاص به دون تسميات معروفة.

traffic surveillance camera highway gantry

تحيز أجهزة الالتقاط داخل مجموعات بيانات المراقبة

تستند الورقة إلى أعمال سابقة قام بها لاروكا وآخرون، والتي وجدت أن شبكة عصبية تلافية صغيرة جداً (CNN) يمكنها تحديد مجموعة البيانات التي جاءت منها صورة مرورية في مهمة تصنيف قياسية. تبحث VeriCam في مشكلة ذات صلة داخل مجموعة بيانات واحدة: تلوث أجهزة الالتقاط بين التقسيمات.

عندما يضع تقسيم على مستوى الصور صوراً من نفس جهاز الالتقاط في مجموعات التدريب والتحقق والاختبار، فإن التقييم يختبر صوراً غير مرئية من أجهزة معروفة. بدلاً من ذلك، يحتفظ تقسيم على مستوى الأجهزة بأجهزة الالتقاط كاملةً خارج المجموعة، مما يجعل صور التحقق والاختبار تأتي من أجهزة غير معروفة.

يستخدم المؤلفون LPLCv2، وهي مجموعة بيانات لمراقبة المرور تتكون من 37,099 صورة. من بين هذه الصور، تم تسمية 34,760 صورة بمعرفات الكاميرا. بعد الاحتفاظ بالأجهزة المرتبطة بعشر صور على الأقل، تحتوي مجموعة البيانات العاملة على 33,668 صورة عبر 612 جهازاً.

مجموعة البيانات غير متوازنة بشكل كبير:

  • التركيز: حوالي 50% من مجموعة البيانات العاملة، أو 16,644 صورة، تأتي من 15% من فئاتها: 90 جهازاً.
  • الذيل الطويل: تمتلك 158 جهازاً ما بين 10 إلى 19 صورة لكل منها، بينما تمتلك 62 جهازاً 100 صورة أو أكثر.

الهدف من الورقة هو تحديد مجموعات أجهزة الالتقاط ديناميكياً، مما يتيح معياراً أكثر انفصالاً بين الأجهزة دون الحاجة إلى تسميات أجهزة الالتقاط في وقت الاستدلال.

لماذا تصنيف التسميات الثابتة واكتشاف OOD غير كافيين

يُصاغ البحث مشكلته على أنها تصنيف عندما يكون عدد الفئات المستهدفة غير معروف وغير ثابت مسبقاً.

  1. للتصنيف ذو التسميات الثابتة مساحة إخراج ثابتة: تقوم المصنفات القياسية بتعيين المدخلات إلى عدد محدد مسبقاً من الفئات. ولا تُعين العينات مباشرةً إلى فئات غير معروفة سابقاً.

  2. اكتشاف OOD لا يكتشف الفئات المجهولة: يمكن لطرق OOD توسيع مشكلة ذات (N) فئة إلى إعداد (N+1) من خلال تحديد العينات خارج الفئات المعروفة. لكن اكتشاف عينة غير معروفة يختلف عن تجميع عينات غير معروفة متعددة في فئاتها الأساسية.

  3. يبقى الفصل الدقيق صعباً: يجادل المؤلفون بأن نماذج الأساس للصورة والنص، بالإضافة إلى الهجينة البصرية-النصية، قد تفتقر إلى القوة التمثيلية المتخصصة المطلوبة عندما تختلف الفئات المتشابهة بصرياً في التفاصيل الدقيقة.

قد تنقل أساليب أخرى من نوع zero-shot ميزات مشتركة أو تستخدم نماذج أولية للفئات. أما VeriCam فيعيد صياغة المهمة على أنها تحقق زوجي محلي يتبعه تجميع.

إعادة صياغة التصنيف من خلال التحقق

بدلاً من مطالبة النموذج باختيار فئة واحدة لأجهزة الالتقاط من قائمة ثابتة، يقوم VeriCam بتقدير ما إذا كانت صورتان تنتميان إلى نفس الفئة الكامنة.

يستند هذا النهج إلى تعلم الميزات القائم على التحقق المستخدم في التعرف على الوجوه. يستخدم VeriCam محول الرؤية (Vision Transformer) كوصف للميزات، ويقدر العلاقات الزوجية، ويحول هذه العلاقات إلى رسم بياني.

[ صور مرور غير مرئية ]
           │
           ▼
[ نموذج التحقق ViT-B/16 ]
           │
      (متجهات الميزات)
           │
           ▼
[ تشابه جيب التمام الزوجي ]
           │
      (رسم بياني للتقارب)
           │
           ▼
[ تجميع Naive أو Leiden ]
           │
           ▼
[ فئات أجهزة الالتقاط المكتشفة ]

العمود الفقري لتعلم المقاييس

يدرب المؤلفون بنية ViT-B/16 من الصفر على مهمة التحقق باستخدام خسارة الثلاثي (triplet loss) وثلاثيات تدريب وتحقق مولدة ديناميكيًا.

يتم تغيير حجم الصور لتناسب مربعًا بحجم (224 \times 224) مع الحفاظ على نسبة العرض إلى الارتفاع، ثم تتم توسيطها وملء الفراغات بالبكسلات الرمادية.

يعرف الورق المسافة الجيبية (cosine distance) بين متجهات الميزات على النحو التالي:

$$\text{CosDist}(V_1, V_2) = 1 - \text{CosSim}(V_1, V_2) = 1 - \frac{V_1 \cdot V_2}{|V_1| |V_2|}$$

يتراوح تشابه جيب التمام من (-1) إلى (1)؛ بينما تتراوح المسافة الجيبية المقابلة من 0 للمتجهات المتساوية إلى 2 للمتجهات المختلفة تمامًا.

تشمل إعدادات التدريب المبلغ عنها ما يلي:

  • الحد الأقصى للتكرارات (Epochs): 1,000.
  • الدفعات لكل تكرار: 120.
  • التوقف المبكر: صبر لمدة 40 تكرارًا، مع المراقبة من خلال دقة التحقق.
  • المُحسِّن (Optimizer): Adam.
  • معدل التعلم الأولي: (1\times10^{-4})، مع عامل تقليل بنسبة 0.75 بعد خمسة تكرارات من الصبر، وحد أدنى قدره (1\times10^{-6}).
  • الحوسبة: وحدة معالجة الرسومات NVIDIA RTX 6000.

من التشابهات الزوجية إلى الرسوم البيانية

بعد استخراج الميزات، يمثل VeriCam مجموعة الصور كرسم بياني غير موجه (G=(V,E)). يمثل كل رأس صورة، وتمثل أوزان الحواف التشابه الجيبي (cosine similarity) بين أزواج الصور المتصلة.

يلاحظ المؤلفون أن التجميع الطيفي يبدو مكلفاً بشكل غير مقبول لمجموعات الاختبار الخاصة بهم، والتي تحتوي على أكثر من 6,000 صورة. لذلك، يقيمان نهجين.

1. الخوارزمية الساذجة

تعالج الخوارزمية الساذجة الحالات بشكل تسلسلي.

  1. تقارن كل صورة جديدة بالصور الموجودة في المجموعة المعروفة.
  2. تحسب متوسط التشابه بين تلك الصورة وكل فئة معروفة.
  3. إذا كان متوسط كل فئة أقل من العتبة، فإن الصورة تهيئة فئة جديدة.
  4. وإلا، يتم تعيينها إلى الفئة ذات أعلى متوسط تشابه.

تم ضبط العتبة على 0.6. يمكن للخوارزمية أن تبدأ بأمثلة وعلامات معروفة أو بدون معلومات مسبقة عن الفئات.

2. تجميع الرسم البياني باستخدام Leiden

يستخدم النهج الثاني خوارزمية Leiden لتجميع الرسوم البيانية. يستخدم الورق دالة جودة Constant Potts Model مع معلمة دقة تبلغ 0.8.

اختار المؤلفون هذا الإعداد لأنهم يتوقعون مجتمعات متصلة بإحكام عندما تكون دقة التحقق عالية. وكما هو الحال مع الطريقة الساذجة، يتم التعامل مع المهمة كتجميع غير حساس للعلامات.

الإعداد التجريبي: التقسيم على مستوى الصورة مقابل التقسيم على مستوى الجهاز

تم تقسيم الصور الـ 33,668 العاملة باستخدام نسب 60/20/20 للتدريب، والتحقق، والاختبار.

السيناريو التقسيم عدد العينات عدد الأجهزة
داخل الجهاز التدريب 20,200 612
التحقق 6,734 612
الاختبار 6,734 612
عبر الأجهزة التدريب 20,914 368
التحقق 6,477 122
الاختبار 6,277 122

في سيناريو داخل الجهاز، يتم تقسيم صور كل جهاز عبر التقسيمات الثلاثة. تكون الصور غير مرئية أثناء الاختبار، لكن الأجهزة معروفة.

في سيناريو عبر الأجهزة، يحدث التقسيم على مستوى الجهاز. الأجهزة الموجودة في التحقق والاختبار غير موجودة في التدريب، لذا تحتوي تلك التقسيمات على أجهزة التقاط غير معروفة.

weathered vehicle license plate crop

الأرقام: تجانس عالٍ، اكتمال أقل

تم تقييم نموذج التحقق على مجموعة ثابتة مكونة من 50,000 زوج عشوائي من صور الاختبار، متوازنة بين الأزواج الحقيقية والأزواج المغشوشة.

نتائج خط الأساس للتحقق

السيناريو الدقة (%) الدقة الإيجابية (%) الاستدعاء (%) درجة F1
داخل الجهاز 98.13 98.87 97.36 98.11
عبر الأجهزة 93.79 97.83 89.52 93.45

انخفض استدعاء عبر الأجهزة من 97.36% إلى 89.52%. يحدد الورقة العلمية أن السلبيات الكاذبة الناتجة تمثل قيداً مهماً: يتم رفض الأزواج الحقيقية من نفس الجهاز بشكل أكثر تكراراً عندما لم يتم مواجهة تلك الأجهزة أثناء التدريب.

أداء الخوارزمية الساذجة

السيناريو وضع التهيئة مقياس V (%) النسبة المئوية للتعريفات الصحيحة
داخل الجهاز لا يوجد 89.68 64.52
مجموعة التدريب 92.30 82.09
عبر الأجهزة لا يوجد 73.45 43.10
مجموعة التدريب 72.51 33.90

بالنسبة للأجهزة المعروفة في السيناريو داخل الجهاز، حسّنت معلومات التهيئة الأولية نتائج الخوارزمية الساذجة. في السيناريو عبر الأجهزة، قللت نفس التهيئة من كلٍ من مقياس V والتعريفات الصحيحة. يعزو المؤلفون هذا إلى أن توزيع الاختبار يقع خارج نطاق مجموعة التدريب.

أداء خوارزمية Leiden

السيناريو التسميات المعروفة المقدمة التجانس (%) الاكتمال (%) مقياس V (%)
داخل الجهاز لا يوجد 99.22 81.11 89.25
مجموعة التدريب 99.26 81.17 89.31
عبر الأجهزة لا يوجد 99.18 67.23 80.14
مجموعة التدريب 95.34 63.66 76.35

في إعداد عبر الأجهزة دون معلومات مسبقة، يتفوق نتيجة Leiden على النتيجة الساذجة: 80.14 مقابل 73.45 في مقياس V.

الفارق بين التجانس والاكتمال هو أمر جوهري. كانت مجموعات Leiden عبر الأجهزة متجانسة للغاية: نادراً ما خلطت بين صور من فئات أجهزة التقاط مختلفة. لكن الاكتمال كان أقل، مما يعني أن الصور من نفس الجهاز كانت غالباً ما تُقسّم بين مجموعات متعددة.

يربط التحليل النوعي للورقة العلمية هذا التجزئة مع السلبيات الكاذبة في مرحلة التحقق. إن العلاقات المفقودة داخل نفس الفئة تترك الفئات مقسمة إلى مجموعات منفصلة، حتى عندما تظل تلك المجموعات نقية داخلياً.

اختبار ضغط التعرف الضوئي على الحروف مع PARSeq

قام المؤلفون أيضاً بتقييم نموذج PARSeq-tiny على مجموعة LPLCv2. قاموا بتدريب كلا النسختين، سواء المُدرَّبة من الصفر أو المُسبقة التدريب، لحالتي التشغيل داخل الجهاز نفسه وعبر أجهزة مختلفة، ثم أبلغوا عن دقة التعرف على اللوحات والأحرف عبر تسميات قابلية القراءة الخاصة بكل لوحة في مجموعة البيانات.

التقييم الكامل للتعرف الضوئي على الحروف باستخدام PARSeq-tiny

الإعداد فئة قابلية القراءة من الصفر: لوحة (%) من الصفر: حرف (%) مسبقة التدريب: لوحة (%) مسبقة التدريب: حرف (%)
داخل الجهاز مثالية 98.73 99.72 99.01 99.78
جيدة 94.43 98.72 95.17 98.96
ضعيفة 84.82 97.21 87.12 97.63
غير مقروءة 65.91 91.02 68.18 91.34
الإجمالي 95.29 99.00 95.98 99.15
عبر الأجهزة مثالية 98.72 99.78 99.08 99.84
جيدة 94.29 98.94 96.16 99.25
ضعيفة 84.52 97.06 85.60 97.38
غير مقروءة 56.06 85.61 50.76 82.90
الإجمالي 93.41 98.66 94.26 98.80

تبرز ثلاثة أنماط مُبلَّغ عنها:

  1. لم تتغير اللوحات المثالية بشكل كبير عبر السيناريوهات: كانت دقة التعرف على اللوحات 98.73% مقابل 98.72% للنموذج المُدرَّب من الصفر، و99.01% مقابل 99.08% للنموذج المسبق التدريب.

  2. انخفضت دقة التعرف الإجمالية على اللوحات عبر الأجهزة: انخفض النموذج المُدرَّب من الصفر بمقدار 1.88 نقطة مئوية، من 95.29% إلى 93.41%. وانخفض النموذج المسبق التدريب بمقدار 1.72 نقطة، من 95.98% إلى 94.26%.

  3. تأثرت اللوحات غير المقروءة أكثر من غيرها: انخفض النموذج المُدرَّب من الصفر بمقدار 9.85 نقطة، من 65.91% إلى 56.06%. وانخفض النموذج المسبق التدريب بمقدار 17.42 نقطة، من 68.18% إلى 50.76%.

يُشير المؤلفون تحديداً إلى أن اللوحات منخفضة الدقة والضعيفة القراءة كانت المجموعة الأكثر تأثراً. تقيس دراستهم الفروق الناتجة في الأداء؛ ولا تحدد السمات البصرية المحددة المسؤولة عنها.

ماذا تقول الدراسة — وما لا تقوله — حول معايير تقييم التعرف الضوئي على الحروف (OCR)

تتناول الأدلة المباشرة التي قدمتها VeriCam صور المراقبة المرورية في مجموعة بيانات LPLCv2 ومجموعة PARSeq-tiny الخاصة بالتعرف على لوحات السيارات. ولم تقم الدراسة بتقييم فواتير الشراء، أو الفواتير، أو وثائق الهوية، أو واجهات برمجة التطبيقات التجارية للتعرف الضوئي على الحروف، أو أجهزة مسح المستندات.

ومع ذلك، وفي نطاقها المحدد، تضع الدراسة عدة ملاحظات مفيدة لتصميم معايير التقييم.

1. تغيير بروتوكول التقسيم يغير ما يتم قياسه

اختبار التقسيم داخل الجهاز (intra-device split) يختبر صورًا جديدة من أجهزة تم تمثيلها بالفعل في التدريب. بينما يختبر التقسيم عبر الأجهزة (cross-device split) أجهزة التقاط غير معروفة.

في تجربة التعرف الضوئي على الحروف الخاصة بـ LPLCv2، أنتج هذان البروتوكولان نتائج مختلفة في التعرف على اللوحات، لا سيما بالنسبة للمجموعة غير المقروءة (Illegible subset). وتقدم الورقة البحثية التعرف الديناميكي على الأجهزة كخطوة نحو بناء معايير تقييم أكثر عدالة وأقل تلوثًا.

2. يمكن اكتشاف مجموعات أجهزة التقاط غير معروفة دون الحاجة إلى تسميات الاختبار

تستخدم خط أنابيب VeriCam تدريبًا إشرافيًا للتحقق، ثم تقوم بتجميع الصور المستهدفة بطريقة غير حساسة للتسميات. في إعداد الاختبار عبر الأجهزة الذي تم اختباره، حقق تجميع Leiden تجانسًا عاليًا ولكن اكتمالًا أقل.

هذا النتيجة لا تثبت حلًا عامًا لكل مجموعة بيانات للتعرف الضوئي على الحروف. لكنها تظهر، في هذا السياق الخاص بالمراقبة المرورية، أن خط أنابيب التحقق والتجميع يمكنه استعادة بنية مفيدة لأجهزة التقاط دون الحاجة إلى معرفة الفئات المستهدفة مسبقًا.

3. مقاييس اللوحات والأحرف تخبرنا بأجزاء مختلفة من القصة

بالنسبة لنتائج PARSeq المدربة مسبقًا عبر الأجهزة، ظلت دقة الأحرف الإجمالية عند 98.80% بينما كانت دقة اللوحات الإجمالية 94.26%. أما بالنسبة للوحات غير المقروءة، فكانت القيم المقابلة هي 82.90% لدقة الأحرف و50.76% لدقة اللوحات.

لذلك، يوضح الجدول سبب أهمية كل من مقاييس مستوى الأحرف ومقاييس السلسلة الكاملة عند تفسير هذا التقييم المحدد للتعرف الضوئي على الحروف.

القيود الصارمة والطريق أمامنا

يوضح الورقة البحثية قيودها الحالية بوضوح:

  • تفتت التجمعات بسبب انخفاض الاستدعاء (Recall): في إعداد Leiden عبر الأجهزة، بلغت نسبة الاكتمال 67.23% على الرغم من تجانس بنسبة 99.18%. غالباً ما كانت الصور من نفس الجهاز مقسمة بين عدة تجمعات.

  • الحساسية تجاه الفئات غير الممثلة تمثيلاً كافياً: يبلغ المؤلفون أن الفئات الأقل تمثيلاً تظل صعبة حتى بعد تقييد مجموعة البيانات بالأجهزة التي تحتوي على عشرة صور على الأقل.

  • الحاجة إلى تصحيح القرارات السابقة: يشمل العمل المستقبلي تحسين النهج الساذج بحيث يمكنه استخدام معلومات وقت الاختبار الواردة لتصحيح الأخطاء السابقة.

  • نطاق التحقق المحدود: تم التحقق من الطريقة في مجال المراقبة الشوارع على LPLCv2. يحدد المؤلفون التوسع إلى ميزات جديدة ومجموعات بيانات أخرى كعمل مستقبلي.

قام المؤلفون بفتح مصدر تنفيذهم على github.com/lmlwojcik/VeriCam.

أفكار ختامية

لا يثبت VeriCam أن كل فشل في التعرف الضوئي على الحروف ناتج عن تحيز جهاز الالتقاط، ولا يختبر أحمال عمل الذكاء الاصطناعي المستندة إلى المستندات خارج نطاق التعرف على لوحات الترخيص. إن نتيجته أضيق نطاقاً لكنها لا تزال مهمة: على مجموعة بيانات LPLCv2، ينتج التقييم المنفصل للأجهزة دقة لوحة PARSeq أقل من التقسيم على مستوى الصورة، مع ظهور أكبر الفروقات في اللوحات الصعبة.

تكمن مساهمة الورقة البحثية في توفير خط أساس قائم على التحقق لتجميع الفئات غير المعروفة، إلى جانب طريقة مستقلة عن التسميات لتحديد مجموعات أجهزة الالتقاط. وفي سياق مراقبة حركة المرور، يوفر ذلك مساراً ملموساً للاختبار لمعرفة ما إذا كانت مجموعة المعيار تقيس التعميم على أجهزة الالتقاط غير المرئية بدلاً من قياس الأداء فقط على صور جديدة من أجهزة معروفة.