ローカルRAGではOCRの精度よりも表構造が重要な理由

エヴァ・ウォン は テクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

ローカルOCRは表ベースのRAGに情報を供給できますが、取得した数値が元の文書と同じ意味を保つかどうかを決めるのは、文字認識の精度だけではなく、表の構造です。

パイプラインが表示されているすべての値を正しく認識しても、表を平坦化した後に誤った回答を生成することがあります。「2026」、「$412」、「世帯A」がOCRで保持されても、それらの行と列の関係が失われれば、言語モデルは正確なトークンを誤った根拠に結び付けて受け取ることになります。

OCRは記号を認識し、表理解は関係性を再構築する

通常のOCRが答えるのは、どの文字が表示され、画面上のおおよそどこにあるかです。表パーサーにはさらに難しい役割があります。表の境界を特定し、行と列を推定し、見出しを割り当て、結合セルを処理し、読み取り順序を維持し、すべての値をページに結び付ける座標を保持しなければなりません。

Split, Embed and Merge表認識器は、表グリッドの検出とセルの結合を明確に分離し、視覚的特徴とテキスト特徴の両方を用いて複雑な構造を再構築します。その分割・結合方式の表構造認識は、文字の認識と行・列・セルの関係性の復元が異なる問題である理由を示しています。同論文では、表構造タスクにおいてSciTSRで97.11%のF1スコアを報告しています。

この違いは、請求書、公共料金の明細、学校の予定表、服薬表、財務諸表などで特に重要になります。そこでは同じ数字が複数の行に現れる可能性があるためです。ローカル処理によってページが自宅の外に出ることは防げますが、ローカルであることだけで、平坦化された表現が意味的に安全になるわけではありません。

見出しと範囲が、RAGが取得すべき意味を担う

有用なインデックス単位は、「どの値が見つかったか」だけでなく、「その値を所有する行ラベル、列見出し、単位、セクションは何か」にも答えられる必要があります。複数階層の見出しや結合セルには、ページを1行のテキストに変換すると失われる継承関係が含まれています。

2026年のPMLR論文表レイアウト補正では、明示的なレイアウト補正とMarkdown/HTMLに類似した形式への変換によって、構造化抽出とその後の質問応答が改善したと報告されています。これは、文字認識の精度そのものよりもRAG品質を示す強い指標です。なぜなら、質問への回答に構造を利用できる状態が維持されているかを検証しているからです。

関連するZimaSpaceの記事OCRにおける表の関係性では、よくある失敗の形を解説しています。ここでAI Hubが示す建築上の区別は、表構造をOCRの偶然の副産物ではなく、インデックス化された第一級の根拠にすべきだという点です。

表を通常の文章のようにチャンク化すると、正しい抽出が崩れる可能性がある

正しく再構築された表でも、チャンク化の段階で値と見出しが分離したり、繰り返し表示される見出しが、それが適用される行から切り離されたりすると、後で失敗する可能性があります。表対応RAGでは、行グループ、見出しの継承、安定した表ID、ページ座標、そして1つの論理オブジェクトとして取得できる表現が必要になることがよくあります。

2026年のT2-RAGBenchは、表を通常の文章として扱うのではなく、テキストと表に対するRAGを評価しています。テキストと表に特化したベンチマークが存在すること自体が、根本的な問題を示しています。検索品質は、ページから単語を抽出するだけでなく、取り込みとコンテキスト構築を通じて構造化された根拠を保持できるかどうかに左右されるのです。

検索層が見出しの経路を確実に再構築できるのでない限り、共有コンテキストなしでセル単位の小さな埋め込みを作成しないでください。「18.4」だけを含むセルが、それ単独で役立つことはほとんどありません。インデックスは、18.4が何を、誰について、どの期間に測定した値なのかを確定できるだけの周辺構造とともに返せる必要があります。

OCRの割合だけでなく、質問で構造の忠実度を検証する

結合された見出し、複数ページにわたる明細、回転したスキャン、薄い罫線、繰り返される単位、似た数字を含む行など、世帯内で最も難しい表からテストセットを作成してください。セルのテキスト精度、見出しの割り当て、行と列の対応付け、最終的な質問応答の正確性を個別に評価し、高いOCRスコアによって構造上の失敗が隠れないようにします。

結合セルの抽出失敗に関する実践的な分析では、表示されているテキストが認識されていても、結合セルや複数階層の見出しによって、後続処理における行と列の対応関係が崩れる可能性が示されています。これこそ、数千件の世帯文書をインデックス化する前に、ローカルRAGのテストで明らかにすべきエラーです。

取得した回答を、正しい表、ページ、行、列、見出しの経路まで追跡できるようになって初めて、パイプラインは実用可能と判断してください。モデルが値に対応するラベルを推測する必要があるなら、誤解を招くほど高いOCR精度のスコアを受け入れるのではなく、表の再構築を改善するか、マルチモーダルな確認のためにページ画像を取得してください。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.