El sesgo oculto del dispositivo de captura en un benchmark de OCR: lo que mide VeriCam entre dispositivos
Based on: VeriCam: A Verification Baseline for the Classification of Unknown Data — Lucas Wojcik, Gabriel E. Lima, Sergio M. Silva, Eduil Nascimento, David Menotti
VeriCam: una línea base de verificación para la clasificación de datos desconocidos
Un modelo PARSeq-tiny preentrenado en el artículo de VeriCam alcanzó una precisión de placa completa del 95,98 % en su evaluación intra-dispositivo de LPLCv2. En las placas “Perfectas”, alcanzó el 99,01 %; en las placas “Ilegibles”, el 68,18 %.
En la evaluación cruzada entre dispositivos del artículo, donde los dispositivos de captura de prueba no estaban presentes durante el entrenamiento, esas cifras cambiaron. La precisión general de la placa fue del 94,26 %, mientras que el rendimiento en placas Ilegibles fue del 50,76 %: una diferencia de 17,42 puntos porcentuales respecto al resultado intra-dispositivo.
Esos experimentos no son una prueba de despliegue en producción, y el artículo no aísla las pistas visuales precisas responsables de la brecha. Pero sí respaldan la advertencia central de los autores: la contaminación por dispositivos de captura puede sesgar la evaluación en conjuntos de datos de OCR de vigilancia de tráfico.
Un artículo de la Universidad Federal de Paraná (UFPR) y la Policía Militar de Paraná, titulado VeriCam: A Verification Baseline for the Classification of Unknown Data (arXiv:2608.31107, aceptado en SIBGRAPI WIP 2026), estudia este problema directamente. Los autores Lucas Wojcik, Gabriel E. Lima, Sergio M. Silva Jr., Eduil Nascimento Jr. y David Menotti argumentan que LPLCv2 tiene un sesgo inherente del dispositivo de captura que plantea un desafío de generalización cruzada entre dispositivos para tareas posteriores de reconocimiento de matrículas, incluido el OCR.
Su pipeline propuesto, VeriCam, entrena un modelo de verificación para comparar pares de imágenes, luego construye un grafo y agrupa clases de dispositivos de captura desconocidos sin requerir etiquetas de clase en tiempo de prueba. En el escenario cruzado entre dispositivos, el artículo informa una puntuación F1 de 93,45 para la verificación. La Tabla V informa una V-Measure de 80,14 para su configuración de agrupamiento Leiden sin etiquetas conocidas.

Sesgo del dispositivo de captura en conjuntos de datos de vigilancia
El artículo se basa en trabajos previos de Laroca et al., que encontraron que una CNN muy pequeña podía identificar de qué conjunto de datos provenía una imagen de tráfico en una tarea de clasificación estándar. VeriCam examina un problema relacionado dentro de un solo conjunto de datos: la contaminación por dispositivos de captura entre particiones.
Cuando una división a nivel de imagen coloca imágenes del mismo dispositivo de captura en entrenamiento, validación y prueba, la evaluación prueba imágenes no vistas de dispositivos conocidos. Una división a nivel de dispositivo, en cambio, excluye por completo los dispositivos de captura, haciendo que las imágenes de validación y prueba provengan de dispositivos desconocidos.
Los autores utilizan LPLCv2, un conjunto de datos de vigilancia de tráfico con 37.099 imágenes. De esas, 34.760 están anotadas con IDs de cámara. Tras retener los dispositivos asociados con al menos diez imágenes, su conjunto de datos de trabajo contiene 33.668 imágenes en 612 dispositivos.
El conjunto de datos está sustancialmente desequilibrado:
- Concentración: Alrededor del 50% del conjunto de datos de trabajo, o 16.644 imágenes, proviene del 15% de sus clases: 90 dispositivos.
- Cola larga: 158 dispositivos tienen entre 10 y 19 imágenes cada uno, mientras que 62 dispositivos tienen 100 o más imágenes.
El objetivo del artículo es identificar dinámicamente grupos de dispositivos de captura, permitiendo un punto de referencia más disjunto por dispositivo sin requerir etiquetas de dispositivo de captura en el momento de la inferencia.
Por qué la clasificación con etiquetas fijas y la detección OOD son insuficientes
El artículo plantea su problema como una clasificación en la que el número de clases objetivo es desconocido y no se fija de antemano.
-
La clasificación con etiquetas fijas tiene un espacio de salida fijo: Los clasificadores estándar asignan entradas a un número predefinido de clases. No asignan directamente las muestras a clases previamente desconocidas.
-
La detección OOD no descubre clases desconocidas: Los métodos OOD pueden extender un problema de (N) clases a un escenario de (N+1) señalando las muestras que se encuentran fuera de las clases conocidas. Pero detectar una muestra desconocida es diferente de agrupar múltiples muestras desconocidas en sus clases subyacentes.
-
La separación de grano fino sigue siendo difícil: Los autores argumentan que los modelos fundacionales de imagen y texto, así como los híbridos visión-texto, pueden carecer de la capacidad representacional especializada necesaria cuando clases visualmente similares difieren en detalles de grano fino.
Otros enfoques de cero disparos (zero-shot) pueden transferir características compartidas o utilizar prototipos de clase. VeriCam, en cambio, reformula la tarea como una verificación par a par local seguida de un agrupamiento (clustering).
Replanteando la clasificación mediante verificación
En lugar de pedirle a un modelo que seleccione una clase de dispositivo de captura de una lista fija, VeriCam estima si dos imágenes pertenecen a la misma clase latente.
El enfoque se basa en el aprendizaje de características basado en verificación utilizado en el reconocimiento facial. VeriCam utiliza un Vision Transformer como descriptor de características, estima las relaciones por pares y convierte esas relaciones en un grafo.
[ Imágenes de Tráfico No Vistas ]
│
▼
[ Modelo de Verificación ViT-B/16 ]
│
(Vectores de Características)
│
▼
[ Similitud Coseno por Pares ]
│
(Grafo de Afinidad)
│
▼
[ Agrupamiento Naive o Leiden ]
│
▼
[ Clases de Dispositivos de Captura Descubiertas ]
El núcleo de aprendizaje métrico
Los autores entrenan una arquitectura ViT-B/16 desde cero en la tarea de verificación utilizando pérdida por tripletes (triplet loss) y tripletes de entrenamiento y validación generados dinámicamente.
Las imágenes se redimensionan para caber en un cuadrado de (224 \times 224) manteniendo la relación de aspecto, se centran y se rellenan con píxeles grises.
El artículo define la distancia coseno entre vectores de características como:
$$\text{CosDist}(V_1, V_2) = 1 - \text{CosSim}(V_1, V_2) = 1 - \frac{V_1 \cdot V_2}{|V_1| |V_2|}$$
La similitud coseno varía de (-1) a (1); la distancia coseno correspondiente varía de 0 para vectores iguales a 2 para vectores completamente diferentes.
La configuración de entrenamiento reportada incluye:
- Épocas máximas: 1,000.
- Lotes por época: 120.
- Parada anticipada: Paciencia de 40 épocas, monitoreada por la precisión de validación.
- Optimizador: Adam.
- Tasa de aprendizaje inicial: (1\times10^{-4}), con un factor de reducción de 0.75 después de cinco épocas de paciencia y un mínimo de (1\times10^{-6}).
- Cómputo: GPU NVIDIA RTX 6000.
De similitudes por pares a grafos
Tras la extracción de características, VeriCam representa el conjunto de imágenes como un grafo no dirigido (G=(V,E)). Cada vértice representa una imagen, y los pesos de las aristas representan la similitud coseno entre pares de imágenes conectadas.
Los autores señalan que el agrupamiento espectral resulta prohibitivamente costoso para sus conjuntos de prueba, que contienen más de 6.000 imágenes. Por lo tanto, evalúan dos enfoques.
1. El algoritmo ingenuo
El algoritmo ingenuo procesa las instancias de forma secuencial.
- Compara cada nueva imagen con las imágenes del conjunto conocido.
- Calcula la similitud media entre esa imagen y cada clase conocida.
- Si la media de cada clase está por debajo del umbral, la imagen inicializa una nueva clase.
- De lo contrario, se asigna a la clase con la mayor similitud media.
El umbral se establece en 0.6. El algoritmo puede comenzar con instancias y etiquetas conocidas o sin información previa de clases.
2. Agrupamiento de grafos Leiden
El segundo enfoque utiliza el algoritmo Leiden para el agrupamiento de grafos. El artículo emplea la función de calidad del Modelo de Potts Constante con un parámetro de resolución de 0.8.
Los autores seleccionaron esta configuración porque esperan comunidades estrechamente conectadas cuando la precisión de verificación es alta. Al igual que con el método ingenuo, la tarea se trata como un agrupamiento agnóstico a las etiquetas.
La configuración experimental: divisiones a nivel de imagen versus a nivel de dispositivo
Las 33,668 imágenes funcionales se dividen utilizando particiones de entrenamiento, validación y prueba en una proporción de 60/20/20.
| Escenario | Partición | Cantidad de instancias | Cantidad de dispositivos |
|---|---|---|---|
| Intra-dispositivo | Entrenamiento | 20,200 | 612 |
| Validación | 6,734 | 612 | |
| Prueba | 6,734 | 612 | |
| Inter-dispositivo | Entrenamiento | 20,914 | 368 |
| Validación | 6,477 | 122 | |
| Prueba | 6,277 | 122 |
En el escenario intra-dispositivo, las imágenes de cada dispositivo se distribuyen entre las tres particiones. Las imágenes son nuevas en el momento de la prueba, pero los dispositivos son conocidos.
En el escenario inter-dispositivo, la división se realiza a nivel de dispositivo. Los dispositivos en las particiones de validación y prueba no están presentes en el entrenamiento, por lo que esas particiones contienen dispositivos de captura desconocidos.

Los números: alta homogeneidad, menor exhaustividad
El modelo de verificación fue evaluado en un conjunto estático de 50.000 pares de imágenes de prueba aleatorios, equilibrados entre pares genuinos y pares de impostores.
Resultados de la línea base de verificación
| Escenario | Precisión (%) | Exactitud (%) | Recall (%) | Puntuación F1 |
|---|---|---|---|---|
| Intra-Dispositivo | 98,13 | 98,87 | 97,36 | 98,11 |
| Inter-Dispositivo | 93,79 | 97,83 | 89,52 | 93,45 |
El recall inter-dispositivo cayó del 97,36 % al 89,52 %. El artículo identifica los falsos negativos resultantes como una limitación importante: los pares genuinos del mismo dispositivo se rechazan con mayor frecuencia cuando esos dispositivos no se encontraron durante el entrenamiento.
Rendimiento del algoritmo ingenuo
| Escenario | Modo de inicialización | V-Measure (%) | Atribuciones correctas (%) |
|---|---|---|---|
| Intra-Dispositivo | Ninguno | 89,68 | 64,52 |
| Conjunto de entrenamiento | 92,30 | 82,09 | |
| Inter-Dispositivo | Ninguno | 73,45 | 43,10 |
| Conjunto de entrenamiento | 72,51 | 33,90 |
Para los dispositivos conocidos en el escenario intra-dispositivo, la información inicial de entrenamiento mejoró los resultados del algoritmo ingenuo. En el escenario inter-dispositivo, la misma inicialización redujo tanto la V-Measure como las atribuciones correctas. Los autores atribuyen esto a que la distribución de prueba cae fuera del rango del conjunto de entrenamiento.
Rendimiento del algoritmo Leiden
| Escenario | Etiquetas conocidas proporcionadas | Homogeneidad (%) | Exhaustividad (%) | V-Measure (%) |
|---|---|---|---|---|
| Intra-Dispositivo | Ninguno | 99,22 | 81,11 | 89,25 |
| Conjunto de entrenamiento | 99,26 | 81,17 | 89,31 | |
| Inter-Dispositivo | Ninguno | 99,18 | 67,23 | 80,14 |
| Conjunto de entrenamiento | 95,34 | 63,66 | 76,35 |
En el escenario inter-dispositivo sin información previa, el resultado de Leiden supera al del algoritmo ingenuo: 80,14 frente a 73,45 en V-Measure.
La diferencia entre homogeneidad y exhaustividad es fundamental. Los clústeres de Leiden inter-dispositivo fueron altamente homogéneos: rara vez mezclaban imágenes de diferentes clases de dispositivos de captura. Pero la exhaustividad fue menor, lo que significa que las imágenes del mismo dispositivo a menudo se dividían entre múltiples clústeres.
El análisis cualitativo del artículo conecta esta fragmentación con los falsos negativos en la etapa de verificación. Las relaciones faltantes dentro de la misma clase dejan las clases divididas en grupos separados, incluso cuando esos grupos permanecen internamente puros.
La prueba de estrés de OCR con PARSeq
Los autores también evalúan PARSeq-tiny en LPLCv2. Entrenan versiones tanto desde cero como preentrenadas para los escenarios intra-dispositivo e inter-dispositivo, y luego informan la precisión de matrículas y caracteres a través de las etiquetas de legibilidad por matrícula del conjunto de datos.
Evaluación completa de OCR con PARSeq-tiny
| Configuración | Nivel de legibilidad | Desde cero: Matrícula (%) | Desde cero: Carácter (%) | Preentrenado: Matrícula (%) | Preentrenado: Carácter (%) |
|---|---|---|---|---|---|
| Intra-dispositivo | Perfecta | 98.73 | 99.72 | 99.01 | 99.78 |
| Buena | 94.43 | 98.72 | 95.17 | 98.96 | |
| Pobre | 84.82 | 97.21 | 87.12 | 97.63 | |
| Ilegible | 65.91 | 91.02 | 68.18 | 91.34 | |
| General | 95.29 | 99.00 | 95.98 | 99.15 | |
| Inter-dispositivo | Perfecta | 98.72 | 99.78 | 99.08 | 99.84 |
| Buena | 94.29 | 98.94 | 96.16 | 99.25 | |
| Pobre | 84.52 | 97.06 | 85.60 | 97.38 | |
| Ilegible | 56.06 | 85.61 | 50.76 | 82.90 | |
| General | 93.41 | 98.66 | 94.26 | 98.80 |
Destacan tres patrones reportados:
-
Las matrículas perfectas cambiaron poco entre escenarios: La precisión de matrículas fue del 98,73 % frente al 98,72 % para el modelo entrenado desde cero, y del 99,01 % frente al 99,08 % para el modelo preentrenado.
-
La precisión general de matrículas disminuyó entre dispositivos: El modelo entrenado desde cero cayó 1,88 puntos porcentuales, del 95,29 % al 93,41 %. El modelo preentrenado cayó 1,72 puntos, del 95,98 % al 94,26 %.
-
Las matrículas ilegibles fueron las más afectadas: El modelo entrenado desde cero cayó 9,85 puntos, del 65,91 % al 56,06 %. El modelo preentrenado cayó 17,42 puntos, del 68,18 % al 50,76 %.
Los autores señalan específicamente que las matrículas de baja resolución y difícil lectura fueron el grupo más afectado. Su estudio mide las diferencias de rendimiento resultantes; no identifica las características visuales particulares responsables de ellas.
Lo que el estudio dice —y no dice— sobre los benchmarks de OCR
La evidencia directa de VeriCam se centra en imágenes de vigilancia de tráfico en LPLCv2 y en el reconocimiento de matrículas de PARSeq-tiny. No evalúa recibos, facturas, documentos de identidad, APIs comerciales de OCR ni hardware de escaneo de documentos.
Sin embargo, dentro de su alcance declarado, establece varias observaciones útiles sobre el diseño de benchmarks.
1. El protocolo de división cambia lo que se está midiendo
Una división intra-dispositivo prueba nuevas imágenes de dispositivos ya representados en el entrenamiento. Una división inter-dispositivo prueba dispositivos de captura desconocidos.
Para el experimento de OCR en LPLCv2, esos dos protocolos produjeron resultados diferentes en el reconocimiento de matrículas, particularmente para el subconjunto Illegible. El artículo presenta el reconocimiento dinámico de dispositivos como un paso hacia la construcción de benchmarks más justos y menos contaminados.
2. Los grupos de dispositivos de captura desconocidos pueden descubrirse sin etiquetas de prueba
El pipeline de VeriCam utiliza entrenamiento de verificación supervisado y luego agrupa las imágenes objetivo de manera agnóstica a las etiquetas. En la configuración inter-dispositivo probada, el clustering Leiden logró una alta homogeneidad pero una menor completitud.
Ese resultado no establece una solución general para cada corpus de OCR. Sin embargo, muestra, en este entorno de vigilancia de tráfico, que un pipeline de verificación y clustering puede recuperar una estructura útil de dispositivos de captura sin requerir que las clases objetivo sean conocidas de antemano.
3. Las métricas de matrículas y caracteres cuentan diferentes partes de la historia
Para el resultado de PARSeq pre-entrenado en la configuración inter-dispositivo, la precisión general de caracteres se mantuvo en 98,80 %, mientras que la precisión general de matrículas fue del 94,26 %. En las matrículas Illegible, los valores correspondientes fueron 82,90 % de precisión de caracteres y 50,76 % de precisión de matrículas.
Por lo tanto, la tabla muestra por qué tanto las métricas a nivel de carácter como las de cadena completa son relevantes al interpretar esta evaluación de OCR en particular.
Limitaciones importantes y el camino a seguir
El artículo es explícito sobre sus limitaciones actuales:
-
Fragmentación de clústeres por menor recall: En la configuración Leiden entre dispositivos, la completitud fue del 67,23 % a pesar de una homogeneidad del 99,18 %. Las imágenes del mismo dispositivo se dividían a menudo entre varios clústeres.
-
Sensibilidad a clases poco representadas: Los autores informan que las clases menos representadas siguen siendo difíciles incluso después de restringir el conjunto de datos a dispositivos con al menos diez imágenes.
-
Necesidad de corregir decisiones pasadas: El trabajo futuro incluye mejorar el enfoque ingenuo para que pueda utilizar la información de prueba entrante para corregir errores anteriores.
-
Alcance de validación limitado: El método se valida en el dominio de vigilancia callejera en LPLCv2. Los autores identifican la expansión a nuevas características y otros conjuntos de datos como trabajo futuro.
Los autores han publicado su implementación de código abierto en github.com/lmlwojcik/VeriCam.
Reflexiones finales
VeriCam no establece que cada fallo de OCR sea causado por el sesgo del dispositivo de captura, ni evalúa cargas de trabajo de IA para documentos más allá del reconocimiento de matrículas. Su resultado es más específico y, aun así, importante: en LPLCv2, la evaluación con dispositivos disjuntos produce una precisión de placa PARSeq inferior a la división a nivel de imagen, con las diferencias más marcadas en las matrículas difíciles.
La contribución del artículo es una línea base basada en verificación para agrupar clases desconocidas, junto con un método agnóstico a las etiquetas para identificar grupos de dispositivos de captura. Para su entorno de vigilancia de tráfico, esto proporciona una ruta concreta para probar si un benchmark mide la generalización a dispositivos de captura no vistos, en lugar de solo el rendimiento en nuevas imágenes de dispositivos conocidos.