OCRテキストが異なるのは、カメラ写真では形状や照明が変動するのに対し、フラットベッドスキャナーでは通常、より平坦で均一な文字形状になるためです。
机の上に置いたレシートを撮影すると、中央は鮮明でも、端に近づくにつれて歪みや影、湾曲が生じることがあります。フラットベッドスキャナーでは、ページを一定の距離に保ち、制御された経路に沿って照明します。そのため、印刷されたページが同一で、認識設定も同じ条件で比較していても、OCRが受け取る画像の分布は異なります。
撮影時の幾何学的条件が文字形状を変える
カメラは、3次元のシーンをセンサー上に投影します。傾きによって台形歪みが生じ、ページの湾曲によって文字行が曲がり、レンズの歪みによってフレーム全体で倍率が変化します。OCRのセグメンテーションでは、文字や行を認識する前に、それらがどこにあるかを推定しなければなりません。
カメラで撮影した文書に関する調査では、ぼけ、低解像度、遠近歪み、複雑なレイアウトが特徴的な課題として挙げられています。フラットベッドでの撮影では、これらの変数のいくつかが排除または安定化されます。
補正処理によって撮影したページを長方形に見せることはできますが、補間によって線が再サンプリングされます。細い句読点が消えたり、隣接する文字が結合したりすることがあります。幾何補正はレイアウトを改善する一方で、認識器が個々の字形に利用する画素を変えてしまう場合があります。
照明と焦点が線の情報を変える
フラットベッドスキャナーは、用紙の近くで一貫した照明を提供します。カメラ写真には、影、反射、ホワイトバランスの変化、被写界深度、手ぶれ、センサー・ノイズが入り込みます。適応的な二値化では、ある領域の影を背景として扱う一方、別の領域では薄い印刷を消してしまうことがあります。
モバイル文書撮影に関する実験研究では、文書画像を撮影する際にユーザーがスマートフォンをどのように配置し、向きを調整するかを調べています。これは、取得方法そのものがOCRの品質の一部であることを示しています。
圧縮も別の違いを生みます。スマートフォンの処理パイプラインでは、OCRが画像を見る前に、輪郭を強調したり、テクスチャのノイズを除去したり、JPEGブロックとしてエンコードしたりすることがあります。こうした補正は大きな文字には有効でも、小さな文字、とりわけ小数点、シリアル番号、低コントラストの印に悪影響を与えることがあります。
撮影装置が原因ではない場合
きれいに切り出した画像と高解像度スキャンで同じ単語に繰り返し誤りが生じる場合、撮影条件の違いだけでは説明できません。特殊なフォント、言語、手書き文字、文書レイアウトは、カメラの幾何学的条件に関係なく、認識器の学習範囲を超えることがあります。
文書画像の品質に関する研究では、制御された劣化を用いて、画像品質と認識能力を分けて評価しています。すべてのトークンの違いを装置のせいにする前に、このような制御が必要です。
また、写真にはクラウドOCR、スキャンにはローカルOCRを使うなど、入力ごとに異なる後続処理経路を通る場合、この仕組みは当てはまりません。向きの検出、言語設定、後処理用の辞書が異なると、撮影後のテキストが変わることがあります。ハードウェアを評価する前に、ソフトウェアの処理経路を揃えてください。
1つのOCRパイプラインで撮影条件を比較する
同じページをフラットベッドスキャナーとカメラで撮影し、さらにカメラ画像について、傾き、影、動き、距離を変えたバリエーションを作成します。元画像と正規化した切り出し画像を、同じOCRエンジン、言語パック、解像度、後処理に通します。領域別、記号クラス別に文字誤りを比較してください。
ペア画像と文字起こし結果は、ローカルファーストのOCRワークフローに保存すると、機密性の高いページをアップロードせずに、前処理のバージョンを追跡できます。自動補正を行う前に、カメラの元ファイルを保存してください。
補正によって差が縮まるなら、主な原因は幾何学的条件です。暗い領域や光沢のある領域に誤りが集中するなら、主な原因は照明です。スキャンと正規化した写真の両方で同じ用語を認識できないなら、モデルの対応範囲や文書レイアウトを調べてください。類似した単語誤り率でも実用上のリスクが高くなることがあるため、数字と句読点は分けて評価しましょう。
テック&AIハブ
もっと読む

ローカルRAGの検索品質を測定し、再現率・適合率・引用カバレッジを解釈する方法
ローカルRAGのテストセットを構築し、主要な検索指標を算出し、それらのトレードオフを解釈し、回答の主張が引用された根拠によって裏付けられているかを監査する。

サンプリングレートが同じ場合、センサー数の増加に伴ってスマートホームの機能計算がより重要になるのはなぜですか?
デバイス数の増加に伴うセンサーごとおよびセンサー間の計算処理を追跡し、非線形な融合コストを特定して、自動化処理に遅延が生じる前に特徴量パイプラインのベンチマークを実施します。

同じクエリ量でも、ドキュメントライブラリが拡大するとRAG評価コストが重要になるのはなぜか?
ユーザークエリを増やさずにコーパスの拡大がRAG評価の工数を増加させる理由と、層別テストによってコストをリスクに応じて抑えられる仕組みを理解する。

