OCR基准测试中隐藏的捕获设备偏差:VeriCam跨设备测量的内容
Based on: VeriCam: A Verification Baseline for the Classification of Unknown Data — Lucas Wojcik, Gabriel E. Lima, Sergio M. Silva, Eduil Nascimento, David Menotti
VeriCam: 未知数据分类的验证基线
在 VeriCam 论文中,一个预训练的 PARSeq-tiny 模型在其设备内 LPLCv2 评估中达到了 95.98% 的全车牌准确率。在“完美”车牌上,准确率达到 99.01%;而在“难以辨认”的车牌上,准确率为 68.18%。
在论文的设备间评估中,由于测试采集设备未参与训练,这些指标发生了变化。整体车牌准确率为 94.26%,而在难以辨认车牌上的性能降至 50.76%:与设备内结果相差 17.42 个百分点。
这些实验并非生产环境部署测试,且论文并未孤立出导致这一差距的具体视觉线索。但它们确实支持了作者的核心警告:采集设备的污染可能会扭曲交通监控 OCR 数据集的评估结果。
来自巴拉那联邦大学(UFPR)和巴拉那州军事警察的一篇题为 VeriCam: A Verification Baseline for the Classification of Unknown Data(arXiv:2608.31107,已被 SIBGRAPI WIP 2026 接收)的论文直接研究了这一问题。作者 Lucas Wojcik、Gabriel E. Lima、Sergio M. Silva Jr.、Eduil Nascimento Jr. 和 David Menotti 认为,LPLCv2 存在固有的采集设备偏差,这给下游车牌识别任务(包括 OCR)带来了设备间泛化的挑战。
他们提出的 VeriCam 流水线训练一个验证模型来比较图像对,然后构建图并聚类未知的采集设备类别,而无需测试时的类别标签。在设备间场景下,论文报告验证的 F1 分数为 93.45。表 V 报告了其 Leiden 聚类设置(无已知标签)的 V-Measure 为 80.14。

监控数据集中的捕获设备偏差
该论文建立在 Laroca 等人先前工作的基础上,后者发现一个非常小的 CNN 可以在标准分类任务中识别交通图像来自哪个数据集。VeriCam 研究了同一数据集中一个相关的问题:分区之间的捕获设备污染。
当图像级划分将来自同一捕获设备的图像放置在训练、验证和测试集中时,评估测试的是来自已知设备的未见图像。而设备级划分则完全留出捕获设备,使得验证和测试图像来自未知设备。
作者使用了 LPLCv2,这是一个包含 37,099 张图像的交通监控数据集。其中,34,760 张图像标注了摄像头 ID。在保留与至少十张图像相关联的设备后,他们的工作数据集包含 612 个设备上的 33,668 张图像。
该数据集存在严重的不平衡现象:
- 集中度: 工作数据集中约 50% 的图像(即 16,644 张)来自其 15% 的类别:90 个设备。
- 长尾分布: 158 个设备各有 10–19 张图像,而 62 个设备各有 100 张或更多图像。
该论文的目标是动态识别捕获设备组,从而启用一个更设备不相交的基准,而无需在推理时提供捕获设备标签。
为什么固定标签分类和 OOD 检测是不够的
本文将问题设定为在目标类别数量未知且未预先固定的情况下进行分类。
-
固定标签分类具有固定的输出空间: 标准分类器将输入映射到预定义的类别数量。它们不会直接将样本分配给以前未知的类别。
-
OOD 检测无法发现未知类别: OOD 方法可以通过标记已知类别之外的样本,将 (N) 类问题扩展为 (N+1) 设置。但是,检测未知样本与将多个未知样本分组到其底层类别是不同的。
-
细粒度分离仍然困难: 作者认为,图像和文本基础模型以及视觉-文本混合模型可能缺乏在视觉上相似的类别在细粒度细节上存在差异时所需的专门表征能力。
其他零样本方法可能会转移共享特征或使用类别原型。VeriCam 则将任务重新定义为局部成对验证,随后进行聚类。
通过验证重构分类
VeriCam 不再要求模型从固定列表中选择一个捕获设备类别,而是估计两张图像是否属于同一潜在类别。
该方法借鉴了人脸识别中基于验证的特征学习。VeriCam 使用视觉 Transformer(Vision Transformer)作为特征描述符,估计成对关系,并将这些关系转化为图结构。
[ Unseen Traffic Images ]
│
▼
[ ViT-B/16 Verification Model ]
│
(Feature Vectors)
│
▼
[ Pairwise Cosine Similarity ]
│
(Affinity Graph)
│
▼
[ Naive or Leiden Clustering ]
│
▼
[ Discovered Capture-Device Classes ]
度量学习骨干网络
作者使用三元组损失(triplet loss)和动态生成的训练及验证三元组,从头训练 ViT-B/16 架构以执行验证任务。
图像被调整大小以适配 (224 \times 224) 的正方形,同时保持宽高比,居中放置,并用灰色像素填充。
论文将特征向量之间的余弦距离定义为:
$$\text{CosDist}(V_1, V_2) = 1 - \text{CosSim}(V_1, V_2) = 1 - \frac{V_1 \cdot V_2}{|V_1| |V_2|}$$
余弦相似度的范围从 (-1) 到 (1);相应的余弦距离范围从相等向量的 0 到完全不同向量的 2。
报告的训练配置包括:
- 最大轮数(epochs): 1,000。
- 每轮批次(batches): 120。
- 早停(Early stopping): 耐心值(patience)为 40 轮,通过验证准确率进行监控。
- 优化器: Adam。
- 初始学习率: (1\times10^{-4}),在耐心值为 5 轮后以 0.75 的因子进行衰减,最小值为 (1\times10^{-6})。
- 计算资源: NVIDIA RTX 6000 GPU。
从成对相似度到图
在特征提取之后,VeriCam 将图像集表示为一个无向图 (G=(V,E))。每个顶点代表一张图像,而边的权重表示相连图像对之间的余弦相似度。
作者指出,对于包含超过 6,000 张图像的测试集,谱聚类(spectral clustering)的计算成本过高,难以承受。因此,他们评估了两种方法。
1. 朴素算法
朴素算法按顺序处理实例。
- 它将每张新图像与已知集中的图像进行比较。
- 它计算该图像与每个已知类别之间的平均相似度。
- 如果所有类别的平均相似度均低于阈值,则该图像初始化一个新类别。
- 否则,将其分配给平均相似度最高的类别。
阈值设置为 0.6。该算法可以从已知的实例和标签开始,也可以在没有先验类别信息的情况下开始。
2. Leiden 图聚类
第二种方法使用 Leiden 算法进行图聚类。该论文使用了分辨率为 0.8 的 Constant Potts Model 质量函数。
作者选择此配置是因为他们期望在验证准确率较高时出现紧密连接的社区。与朴素方法一样,该任务被视为与标签无关的聚类。
实验设置:图像级与设备级划分
33,668 张有效图像按照 60/20/20 的比例划分为训练集、验证集和测试集。
| 场景 | 划分 | 样本数量 | 设备数量 |
|---|---|---|---|
| 设备内(Intra-Device) | 训练集 | 20,200 | 612 |
| 验证集 | 6,734 | 612 | |
| 测试集 | 6,734 | 612 | |
| 跨设备(Cross-Device) | 训练集 | 20,914 | 368 |
| 验证集 | 6,477 | 122 | |
| 测试集 | 6,277 | 122 |
在设备内场景中,每个设备的图像被分配到三个划分中。测试时的图像是未见过的,但设备是已知的。
在跨设备场景中,划分是在设备级别进行的。验证集和测试集中的设备不出现在训练集中,因此这些划分包含未知的捕获设备。

数据表现:高同质性,较低完整性
验证模型在一组包含 50,000 对随机测试图像的静态数据集上进行了评估,其中真实配对(genuine pairs)和伪造配对(impostor pairs)数量均衡。
验证基线结果
| 场景 | 准确率 (%) | 精确率 (%) | 召回率 (%) | F1 分数 |
|---|---|---|---|---|
| 设备内 | 98.13 | 98.87 | 97.36 | 98.11 |
| 跨设备 | 93.79 | 97.83 | 89.52 | 93.45 |
跨设备召回率从 97.36% 下降至 89.52%。论文指出,由此产生的假阴性(false negatives)是一个重要的局限性:当训练过程中未遇到这些设备时,来自同一设备的真实配对更常被拒绝。
朴素算法性能
| 场景 | 初始化模式 | V-Measure (%) | 正确归因率 (%) |
|---|---|---|---|
| 设备内 | 无 | 89.68 | 64.52 |
| 训练集 | 92.30 | 82.09 | |
| 跨设备 | 无 | 73.45 | 43.10 |
| 训练集 | 72.51 | 33.90 |
在设备内场景中,对于已知设备,初始训练信息提升了朴素算法的结果。而在跨设备场景中,相同的初始化方式反而降低了 V-Measure 和正确归因率。作者将此归因于测试数据的分布超出了训练集的范围。
Leiden 算法性能
| 场景 | 是否提供已知标签 | 同质性 (%) | 完整性 (%) | V-Measure (%) |
|---|---|---|---|---|
| 设备内 | 无 | 99.22 | 81.11 | 89.25 |
| 训练集 | 99.26 | 81.17 | 89.31 | |
| 跨设备 | 无 | 99.18 | 67.23 | 80.14 |
| 训练集 | 95.34 | 63.66 | 76.35 |
在跨设备且无先验信息的设置下,Leiden 算法的结果优于朴素算法:V-Measure 为 80.14,而朴素算法为 73.45。
同质性与完整性之间的差异是核心所在。跨设备的 Leiden 聚类具有高度同质性:它们很少混合来自不同捕获设备类别的图像。但完整性较低,这意味着来自同一设备的图像经常被分割到多个聚类中。
论文的定性分析将这种碎片化与验证阶段的假阴性联系起来。缺失同类关系导致类别被划分为独立的组,即使这些组在内部保持纯净。
使用 PARSeq 进行的 OCR 压力测试
作者还在 LPLCv2 上评估了 PARSeq-tiny。他们针对设备内(intra-device)和设备间(cross-device)场景分别训练了从头训练(from-scratch)和预训练版本,然后报告了数据集按车牌可读性标签划分的车牌准确率和字符准确率。
完整的 PARSeq-tiny OCR 评估
| 设置 | 可读性等级 | 从头训练:车牌 (%) | 从头训练:字符 (%) | 预训练:车牌 (%) | 预训练:字符 (%) |
|---|---|---|---|---|---|
| 设备内 | 完美 | 98.73 | 99.72 | 99.01 | 99.78 |
| 良好 | 94.43 | 98.72 | 95.17 | 98.96 | |
| 较差 | 84.82 | 97.21 | 87.12 | 97.63 | |
| 不可读 | 65.91 | 91.02 | 68.18 | 91.34 | |
| 总体 | 95.29 | 99.00 | 95.98 | 99.15 | |
| 设备间 | 完美 | 98.72 | 99.78 | 99.08 | 99.84 |
| 良好 | 94.29 | 98.94 | 96.16 | 99.25 | |
| 较差 | 84.52 | 97.06 | 85.60 | 97.38 | |
| 不可读 | 56.06 | 85.61 | 50.76 | 82.90 | |
| 总体 | 93.41 | 98.66 | 94.26 | 98.80 |
三个报告的模式尤为突出:
-
完美车牌在不同场景下变化不大: 从头训练模型的车牌准确率为 98.73% 对比 98.72%,预训练模型为 99.01% 对比 99.08%。
-
总体车牌准确率跨设备下降: 从头训练模型下降了 1.88 个百分点,从 95.29% 降至 93.41%。预训练模型下降了 1.72 个百分点,从 95.98% 降至 94.26%。
-
不可读车牌受影响最大: 从头训练模型下降了 9.85 个百分点,从 65.91% 降至 56.06%。预训练模型下降了 17.42 个百分点,从 68.18% 降至 50.76%。
作者特别指出,低分辨率、难以辨认的车牌是受影响最大的群体。他们的研究测量了由此产生的性能差异;并未确定导致这些差异的具体视觉特征。
该研究关于 OCR 基准测试说了什么——以及没说什么
VeriCam 的直接证据涉及 LPLCv2 和 PARSeq-tiny 中的交通监控图像车牌识别。它并未评估收据、发票、身份证件、商业 OCR API 或文档扫描硬件。
然而,在其声明的范围内,它确立了几项有用的基准设计观察结果。
1. 划分协议改变了被测量的内容
设备内划分(intra-device split)测试来自训练中已包含的设备的新图像。跨设备划分(cross-device split)测试未知的捕获设备。
对于 LPLCv2 OCR 实验,这两种协议产生了不同的车牌识别结果,特别是在不可读(Illegible)子集中。该论文将动态设备识别作为构建更公平、污染更少基准测试的一步。
2. 无需测试标签即可发现未知捕获设备组
VeriCam 的流水线使用监督验证训练,然后以与标签无关的方式对目标图像进行聚类。在测试的跨设备设置中,Leiden 聚类实现了高同质性但较低的完整性。
该结果并未为每个 OCR 语料库建立通用解决方案。它确实表明,在这种交通监控设置中,验证和聚类流水线可以在不需要预先知道目标类的情况下恢复有用的捕获设备结构。
3. 车牌和字符指标讲述了故事的不同部分
对于跨设备预训练 PARSeq 结果,整体字符准确率保持在 98.80%,而整体车牌准确率为 94.26%。在不可读车牌上,相应的值分别为 82.90% 的字符准确率和 50.76% 的车牌准确率。
因此,该表说明了为什么在解释此特定 OCR 评估时,字符级和完整字符串指标都相关。
当前局限与未来方向
论文明确指出了其当前的局限性:
-
低召回率导致的聚类碎片化: 在跨设备 Leiden 设置中,尽管同质性达到 99.18%,但完整性仅为 67.23%。同一设备的图像经常被划分到多个不同的聚类中。
-
对长尾类别的敏感性: 作者报告称,即使将数据集限制为至少包含十张图像的设备,那些样本较少的类别仍然难以处理。
-
需要纠正过往决策: 未来的工作包括改进当前的朴素方法,使其能够利用测试时传入的信息来纠正之前的错误。
-
验证范围有限: 该方法仅在 LPLCv2 数据集的街道监控领域进行了验证。作者指出,扩展到新颖特征和其他数据集是未来的研究方向。
作者已在 github.com/lmlwojcik/VeriCam 开源了其实现代码。
最后思考
VeriCam 并没有证明所有的 OCR 失败都是由采集设备偏差引起的,也没有测试车牌识别之外的文档 AI 工作负载。其结果范围更窄,但仍然很重要:在 LPLCv2 上,设备不相交评估产生的 PARSeq 车牌准确率低于图像级划分,在困难车牌上的差异最大。
该论文的贡献在于提供了一个基于验证的基线,用于对未知类别进行分组,以及一种与标签无关的方法,用于识别采集设备组。对于其交通监控场景,这提供了一条具体的途径,用于测试基准是在衡量对未见采集设备的泛化能力,还是仅仅衡量对已知设备新图像的性能。