OCRベンチマークにおける隠れたキャプチャデバイスのバイアス:VeriCamがデバイス間で測定するもの
Based on: VeriCam: A Verification Baseline for the Classification of Unknown Data — Lucas Wojcik, Gabriel E. Lima, Sergio M. Silva, Eduil Nascimento, David Menotti
VeriCam論文で報告されている事前学習済みPARSeq-tinyモデルは、デバイス内LPLCv2評価において95.98%のプレート全体精度を達成しました。「Perfect(完全)」プレートでは99.01%、「Illegible(判読不能)」プレートでは68.18%の精度を示しました。
テスト用撮影デバイスが訓練時に含まれていない同論文のデバイス間評価では、これらの数値は変化しました。プレート全体の精度は94.26%となり、Illegibleプレートでの性能は50.76%でした。これはデバイス内評価の結果と比較して17.42ポイントの差となります。
これらの実験は本番環境でのデプロイテストではなく、論文は精度のギャップを引き起こす正確な視覚的特徴を特定していません。しかし、これらは著者たちの中心的な警告を裏付けています。つまり、撮影デバイスの混入(コンタミネーション)は、交通監視OCRデータセットの評価に歪みをもたらす可能性があります。
パラナ連邦大学(UFPR)とパラナ州警察による論文『VeriCam: A Verification Baseline for the Classification of Unknown Data』(arXiv:2608.31107、SIBGRAPI WIP 2026で受理)は、この問題に直接取り組んでいます。Lucas Wojcik、Gabriel E. Lima、Sergio M. Silva Jr.、Eduil Nascimento Jr.、David Menottiの著者らは、LPLCv2には固有の撮影デバイスバイアスが含まれており、OCRを含む下流のナンバープレート認識タスクにおいてデバイス間汎化の課題を引き起こすと主張しています。
彼らが提案したパイプラインVeriCamは、画像ペアを比較するための検証モデルを訓練し、テスト時のクラスラベルを必要とせずにグラフを構築し、未知の撮影デバイスクラスをクラスタリングします。デバイス間シナリオにおいて、論文は検証のF1スコアを93.45と報告しています。表Vは、既知のラベルなしのLeidenクラスタリング設定におけるV-Measureを80.14と報告しています。

監視データセット内の撮影デバイスバイアス
本論文は、Larocaらによる先行研究を基盤としています。同研究では、標準的な分類タスクにおいて、非常に小さなCNNが交通画像がどのデータセットに由来するものを識別できることが示されていました。VeriCamは、1つのデータセット内における関連する問題、すなわちパーティション間の撮影デバイス汚染を調査します。
画像レベルの分割では、同じ撮影デバイスからの画像が学習、検証、テストに配置されるため、評価は既知のデバイスからの未知の画像を対象とします。一方、デバイスレベルの分割では、撮影デバイスを完全に除外するため、検証およびテストの画像は未知のデバイスから提供されます。
著者らは、37,099枚の画像を含む交通監視データセットであるLPLCv2を使用しました。そのうち34,760枚にはカメラIDが注釈付けされています。少なくとも10枚の画像に関連するデバイスを保持した後、作業用データセットは612台のデバイスにわたる33,668枚の画像を含みます。
このデータセットは著しく不均衡です:
- 集中度: 作業用データセットの約50%、つまり16,644枚の画像が、そのクラスの15%(90台のデバイス)から由来しています。
- ロングテール: 158台のデバイスにはそれぞれ10〜19枚の画像があり、62台のデバイスには100枚以上の画像があります。
本論文の目的は、推論時に撮影デバイスのラベルを必要とせずに、よりデバイスが重複しないベンチマークを可能にするために、撮影デバイスグループを動的に識別することです。
固定ラベル分類とOOD検出が不十分な理由
本論文は、ターゲットクラス数が事前に固定されておらず不明である状況下での分類問題を枠組みとしています。
-
固定ラベル分類は出力空間が固定されている: 標準的な分類器は、入力データを事前に定義されたクラス数にマッピングします。これらは、以前に未知であったクラスにサンプルを直接割り当てることはできません。
-
OOD検出は未知のクラスを発見しない: OOD手法は、既知のクラス外のサンプルをフラグ付けすることで、(N)クラスの問題を(N+1)の設定に拡張することができます。しかし、未知のサンプルを検出することは、複数の未知のサンプルをその潜在的なクラスにグループ化することとは異なります。
-
細粒度な分離は依然として困難: 著者らは、画像やテキストのファウンデーションモデル、およびビジョンテキストハイブリッドモデルは、視覚的に類似したクラスが細粒度な詳細で異なる場合に必要な専門的な表現力に欠ける可能性があると考えています。
他のゼロショットアプローチは、共有特徴を転送したり、クラスプロトタイプを使用したりする場合があります。VeriCamは代わりに、タスクを局所的なペアごとの検証とそれに続くクラスタリングとして再定義します。
検証を通じた分類の再定義
VeriCamは、モデルに固定リストから1つのキャプチャデバイスクラスを選ばせるのではなく、2つの画像が同じ潜在クラスに属するかどうかを推定します。
このアプローチは、顔認識で使用される検証ベースの特徴学習に基づいています。VeriCamはビジョントランスフォーマーを特徴記述子として使用し、ペアごとの関係を推定し、それらの関係をグラフに変換します。
[ 未見の交通画像 ]
│
▼
[ ViT-B/16 検証モデル ]
│
(特徴ベクトル)
│
▼
[ ペアごとのコサイン類似度 ]
│
(アフィニティグラフ)
│
▼
[ ナイーブまたはLeidenクラスタリング ]
│
▼
[ 発見されたキャプチャデバイスクラス ]
メトリック学習のバックボーン
著者らは、トリプレット損失と動的に生成された学習・検証トリプレットを使用して、検証タスクのためにViT-B/16アーキテクチャを一から学習させます。
画像は、アスペクト比を維持しながら (224 \times 224) の正方形にリサイズされ、中央に配置され、灰色のピクセルでパディングされます。
論文では、特徴ベクトル間のコサイン距離を以下のように定義しています。
$$\text{CosDist}(V_1, V_2) = 1 - \text{CosSim}(V_1, V_2) = 1 - \frac{V_1 \cdot V_2}{|V_1| |V_2|}$$
コサイン類似度は (-1) から (1) の範囲を取り、対応するコサイン距離は、等しいベクトルで0、完全に異なるベクトルで2の範囲を取ります。
報告されている学習設定は以下の通りです。
- 最大エポック数: 1,000。
- エポックあたりのバッチ数: 120。
- 早期終了: 検証精度を監視し、忍耐値(patience)は40エポック。
- 最適化アルゴリズム: Adam。
- 初期学習率: (1\times10^{-4})、忍耐値5エポック後に0.75の減少係数を適用し、最小値は (1\times10^{-6})。
- 計算環境: NVIDIA RTX 6000 GPU。
類似度行列からグラフへ
特徴抽出後、VeriCamは画像セットを非定向グラフ (G=(V,E)) として表現する。各頂点は画像を表し、エッジの重みは接続された画像ペア間のコサイン類似度を表す。
著者らは、6,000枚以上の画像を含むテストセットに対してスペクトルクラスタリングは計算コストが高すぎると指摘している。そのため、2つの手法を評価した。
1. ナイーブアルゴリズム
ナイーブアルゴリズムはインスタンスを順次処理する。
- 新しい画像を既知のセット内の画像と比較する。
- その画像と各既知クラスとの平均類似度を計算する。
- すべてのクラスの平均が閾値を下回る場合、その画像は新しいクラスを初期化する。
- それ以外の場合、平均類似度が最も高いクラスに割り当てられる。
閾値は 0.6 に設定される。このアルゴリズムは、既知のインスタンスとラベルから開始することも、事前のクラス情報なしで開始することもできる。
2. Leidenグラフクラスタリング
2つ目の手法は、グラフクラスタリングのためのLeidenアルゴリズムを使用する。本論文では、解像度パラメータが 0.8 のConstant Potts Model品質関数を使用している。
著者らは、検証精度が高い場合に密に接続されたコミュニティが期待されるため、この設定を選択した。ナイーブ手法と同様に、このタスクはラベル非依存のクラスタリングとして扱われる。
実験設定:画像レベル分割とデバイスレベル分割
33,668枚の正常な画像は、60/20/20の比率でトレーニング、バリデーション、テストの3つのパーティションに分割されます。
| シナリオ | パーティション | インスタンス数 | デバイス数 |
|---|---|---|---|
| デバイス内 (Intra-Device) | トレーニング | 20,200 | 612 |
| バリデーション | 6,734 | 612 | |
| テスト | 6,734 | 612 | |
| デバイス間 (Cross-Device) | トレーニング | 20,914 | 368 |
| バリデーション | 6,477 | 122 | |
| テスト | 6,277 | 122 |
デバイス内 (Intra-Device) シナリオでは、各デバイスの画像が3つのパーティションに分割されます。テスト時には画像は未見ですが、デバイスは既知です。
デバイス間 (Cross-Device) シナリオでは、分割はデバイスレベルで行われます。バリデーションとテストに含まれるデバイスはトレーニングには含まれていないため、これらのパーティションには未知の撮影デバイスが含まれます。

数値:高い一様性、低い完全性
検証モデルは、本物ペアと偽造ペアがバランスよく含まれる50,000組のランダムなテスト画像ペアの静的セットで評価されました。
検証のベースライン結果
| シナリオ | 精度 (%) | 適合率 (%) | 再現率 (%) | F1スコア |
|---|---|---|---|---|
| デバイス内 | 98.13 | 98.87 | 97.36 | 98.11 |
| デバイス間 | 93.79 | 97.83 | 89.52 | 93.45 |
デバイス間の再現率は97.36%から89.52%に低下しました。論文では、この結果生じた偽陰性(False Negatives)が重要な制限要因であると指摘しています。具体的には、同じデバイスからの本物ペアでも、そのデバイスが学習段階で遭遇していなかった場合、より頻繁に拒否されることが示されています。
ナイーブアルゴリズムのパフォーマンス
| シナリオ | 初期化モード | V-Measure (%) | 正帰属率 (%) |
|---|---|---|---|
| デバイス内 | なし | 89.68 | 64.52 |
| 学習セット | 92.30 | 82.09 | |
| デバイス間 | なし | 73.45 | 43.10 |
| 学習セット | 72.51 | 33.90 |
デバイス内のシナリオにおいて既知のデバイスについては、初期の学習情報がナイーブアルゴリズムの結果を改善しました。一方、デバイス間のシナリオでは、同じ初期化によりV-Measureと正帰属率の両方が低下しました。著者らは、この原因をテストデータの分布が学習セットの範囲外に存在することに起因すると説明しています。
Leidenアルゴリズムのパフォーマンス
| シナリオ | 提供された既知のラベル | 一様性 (%) | 完全性 (%) | V-Measure (%) |
|---|---|---|---|---|
| デバイス内 | なし | 99.22 | 81.11 | 89.25 |
| 学習セット | 99.26 | 81.17 | 89.31 | |
| デバイス間 | なし | 99.18 | 67.23 | 80.14 |
| 学習セット | 95.34 | 63.66 | 76.35 |
デバイス間で事前情報なしの設定において、Leidenの結果はナイーブアルゴリズムの結果を上回りました(V-Measureで80.14対73.45)。
一様性と完全性の差が中心的な問題です。デバイス間のLeidenクラスターは非常に高い一様性を示しており、異なるキャプチャデバイスクラスの画像が混在することは稀でした。しかし、完全性は低く、同じデバイスからの画像が複数のクラスターに分割されることが多かったです。
論文の定性分析では、この断片化が検証段階での偽陰性と関連付けられています。同じクラスの関係が欠落しているため、グループ内部が純粋であっても、クラスは別々のグループに分割されてしまいます。
PARSeqによるOCRストレステスト
著者らは、LPLCv2データセットを用いてPARSeq-tinyの評価も実施している。デバイス内(intra-device)およびデバイス間(cross-device)のシナリオそれぞれに対して、ゼロから学習させたモデルと事前学習済みモデルの両方を訓練し、データセットのプレートごとの判読性ラベルに基づいて、プレート単位および文字単位の精度を報告している。
PARSeq-tinyのOCR評価全体像
| 設定 | 判読性カテゴリ | ゼロから学習: プレート (%) | ゼロから学習: 文字 (%) | 事前学習済み: プレート (%) | 事前学習済み: 文字 (%) |
|---|---|---|---|---|---|
| デバイス内 | 完璧 | 98.73 | 99.72 | 99.01 | 99.78 |
| 良好 | 94.43 | 98.72 | 95.17 | 98.96 | |
| 不良 | 84.82 | 97.21 | 87.12 | 97.63 | |
| 判読不能 | 65.91 | 91.02 | 68.18 | 91.34 | |
| 全体 | 95.29 | 99.00 | 95.98 | 99.15 | |
| デバイス間 | 完璧 | 98.72 | 99.78 | 99.08 | 99.84 |
| 良好 | 94.29 | 98.94 | 96.16 | 99.25 | |
| 不良 | 84.52 | 97.06 | 85.60 | 97.38 | |
| 判読不能 | 56.06 | 85.61 | 50.76 | 82.90 | |
| 全体 | 93.41 | 98.66 | 94.26 | 98.80 |
報告されたパターンの中で、特に顕著な点が3つある。
-
完璧なプレートの精度はシナリオ間でほぼ変化しなかった: ゼロから学習させたモデルのプレート精度は98.73%対98.72%、事前学習済みモデルは99.01%対99.08%であった。
-
デバイス間で全体のプレート精度が低下した: ゼロから学習させたモデルは95.29%から93.41%へ1.88ポイント低下した。事前学習済みモデルは95.98%から94.26%へ1.72ポイント低下した。
-
判読不能なプレートへの影響が最も大きかった: ゼロから学習させたモデルは65.91%から56.06%へ9.85ポイント低下した。事前学習済みモデルは68.18%から50.76%へ17.42ポイント低下した。
著者らは、解像度が低く判読性の悪いプレートが最も大きな影響を受けたグループであることを特に指摘している。本研究は、その結果として生じる性能差を測定するものであり、それらを引き起こす特定の視覚的特徴を特定するものではない。
本研究がOCRベンチマークについて述べていること、そして述べていないこと
VeriCamの直接的な証拠は、LPLCv2およびPARSeq-tinyにおける交通監視画像のナンバープレート認識に関するものです。レシート、請求書、身分証明書、商用OCR API、またはドキュメントスキャンハードウェアの評価は行われていません。
しかし、その明示された範囲内では、いくつかの有用なベンチマーク設計に関する観察結果を確立しています。
1. 分割プロトコルが測定対象を変更する
デバイス内(intra-device)分割は、訓練データに既に含まれているデバイスからの新しい画像をテストします。デバイス間(cross-device)分割は、未知の撮影デバイスをテストします。
LPLCv2のOCR実験では、これらの2つのプロトコルが異なるプレート認識結果を生み出し、特にIllegible(判読不能)サブセットで顕著でした。論文は、より公平で汚染の少ないベンチマークを構築するための一歩として、動的デバイス認識を提示しています。
2. テストラベルなしで未知の撮影デバイスグループを発見できる
VeriCamのパイプラインは、教師あり検証訓練を使用し、その後ラベルに依存しない方法でターゲット画像をクラスタリングします。テストされたデバイス間セットアップでは、Leidenクラスタリングは高い均一性(homogeneity)を達成しましたが、完全性(completeness)は低かったです。
この結果は、すべてのOCRコーパスに対する一般的な解決策を確立するものではありません。しかし、この交通監視の文脈では、ターゲットクラスを事前に知らなくても、検証とクラスタリングのパイプラインが有用な撮影デバイス構造を回復できることを示しています。
3. プレート指標と文字指標は異なる側面を示す
デバイス間の事前学習済みPARSeqの結果では、全体文字精度は98.80%を維持しましたが、全体プレート精度は94.26%でした。Illegibleプレートでは、対応する値は文字精度82.90%、プレート精度50.76%でした。
したがって、この表は、この特定のOCR評価を解釈する際に、文字レベルの指標と完全文字列の指標の両方が関連する理由を示しています。
現在の限界と今後の展望
論文では、現在の限界について明確に述べられています。
-
低い再現性によるクラスターの断片化: クロスデバイスLeiden設定では、完全性(completeness)は99.18%の一様性(homogeneity)にもかかわらず67.23%にとどまりました。同じデバイス上の画像が複数のクラスターに分割されることが多かったです。
-
少数クラスへの感受性: 著者らは、データセットを10枚以上の画像を持つデバイスに制限しても、少数派のクラスは依然として困難であることを報告しています。
-
過去の決定の修正の必要性: 将来の作業には、テスト時の情報を使用して以前のミスを修正できるように、ナイーブなアプローチを改善することが含まれます。
-
限られた検証範囲: この手法はLPLCv2のストリート監視ドメインで検証されています。著者らは、新しい機能や他のデータセットへの拡張を将来の作業として特定しています。
著者らは、その実装をgithub.com/lmlwojcik/VeriCamでオープンソース化しています。
最終的な考察
VeriCamは、すべてのOCR失敗がキャプチャデバイスのバイアスによって引き起こされることを証明するものではなく、ナンバープレート認識以外のドキュメントAIワークロードもテストしていません。その結果は狭い範囲に限定されていますが、依然として重要です。LPLCv2において、デバイス disjoint な評価は、画像レベルの分割よりも低いPARSeqプレート精度を示し、その差は困難なプレートで最も大きくなります。
本論文の貢献は、未知のクラスをグループ化する検証ベースのベースラインと、キャプチャデバイスグループを特定するためのラベル非依存手法です。交通監視の文脈において、これはベンチマークが既知のデバイスの新しい画像でのパフォーマンスだけでなく、未見のキャプチャデバイスへの一般化を測定しているかどうかをテストするための具体的な道筋を提供します。