メインコンテンツへスキップ
       

スキャンPDFにおける表形式データをAIに正確に読み取らせる方法(AI作成)

AI要約を見る

※以下はAIが生成した要約です。内容の正確性は保証されません。本文をあわせてご確認ください。

スキャンPDFの表は、PDFの直接読取りとページ画像による読取りのどちらかが常に正確とは限りません。テキスト層、表構造、画質、文字の大きさ・傾き及び利用モデルに応じ、代表ページで両方式を比較し、ページ・行・列・セル単位で原本と照合します。画像化、スクリーンショット又はPrint to PDFは壊れたテキスト層を避ける方法になり得ますが、誤読をなくす保証はありません。Word化だけでRAGが構築されたり、常にトークン使用量が減ったりするわけでもありません。原本、ハッシュ、変換条件、抽出結果、訂正履歴及び集計検算を保存し、重要な数値・固有名詞は人が確認する必要があります。

第1 結論

スキャンPDFの表をAIに読み取らせる場合、PDFをそのまま渡す方法と、各ページを画像として渡す方法のどちらが常に正確であるとは限りません。PDF内のテキスト層、表の罫線、文字の大きさ、傾き、解像度、言語、ページ数及び利用するモデルによって結果が変わります。

したがって、最初から一つの方法に決めるのではなく、少数の代表ページについて、直接読取りとページ画像による読取りを比較し、正解が分かるセルを使って誤り率を確認するのが安全です。その上で、原本、変換条件、抽出結果及び人が訂正した履歴を残します。

第2 PDFの表で誤読が生じる理由

1 見た目と内部構造は異なること

画面上では整った表に見えるPDFでも、内部では、文字が読む順序と無関係に配置されていたり、1文字ずつ位置情報を持っていたり、複数列が交互に抽出されたりすることがあります。また、スキャン画像にOCRで付加されたテキスト層が、画像上の文字と一致しない場合もあります。

このようなPDFをテキストとして抽出すると、列の対応、改行、結合セル又は注記の所属が崩れることがあります。ただし、座標情報があること自体が誤読の原因というわけではありません。テキスト層と表示上の構造が適切に対応していれば、直接抽出の方が速く、正確な場合もあります。

2 画像認識にも限界があること

ページを画像として渡すと、罫線、余白、セルの位置関係を含む見た目を参照できます。そのため、壊れたテキスト層の影響を避けられる場合があります。

しかし、OpenAIの公式資料も、画像認識には、小さい文字、回転した文字、非ラテン文字、精密な空間的位置関係及び正確な数え上げ等の限界があると説明しています。画像化は有力な選択肢ですが、正確性を保証するものではありません。

第3 直接読取りと画像読取りの選び方

次の順序で選ぶと、無用な変換を減らせます。

  1. PDFからテキスト及び表構造を抽出し、代表ページを原画面と照合する。
  2. 列の混在、文字化け、欠落又はOCR誤りが多い場合は、同じページを高解像度画像として読み取る。
  3. 直接読取りと画像読取りの結果を、正解が分かるセルで比較する。
  4. ページごとに品質差がある場合は、全面的に一方式へ統一せず、問題ページだけ方式を変える。

原本がデジタル生成PDFで、適切なテキスト層とタグ又は表構造を持つ場合は、直接抽出が適することがあります。原本がスキャン画像で、OCR層が崩れている場合は、ページ画像を参照する方が適することがあります。

第4 正確性を高める標準手順

1 原本を保全すること

作業前に元のPDFを読み取り専用で保存し、ファイル名、取得元、取得日時、ページ数、容量及び可能であればSHA-256等のハッシュ値を記録します。画像化、OCR又はPrint to PDFを行ったファイルは、原本と区別した別名で保存します。

後から再現できるように、画像形式、解像度、色、トリミング、回転補正及び使用したOCR/AIのモデル・バージョンも記録します。

2 少数ページで比較試験をすること

最初に、次のような代表ページを選びます。

  • 標準的な表があるページ
  • 列数が多いページ
  • 小さい文字又は縦書きがあるページ
  • 罫線が薄いページ
  • 結合セル、脚注、空欄又はマイナス値があるページ
  • 画質が悪いページ

各ページから正解が目視できるセルを一定数選び、直接読取り、画像読取り及び必要に応じて別のOCR結果を比較します。「見た感じがよい」ではなく、文字、数値、符号、日付及び列の対応をセル単位で数えます。

3 ページ・行・列を特定して検証すること

AIの出力には、元PDFのページ番号、表題、行見出し、列見出し及びセルの値を含めます。判読できない箇所を推測で補わせず、判読不能、要確認又は候補を明示させます。

大量の表を一度に処理する場合でも、結果をページ又は表の単位に分けます。これにより、誤りが見つかった場合に、元資料の該当箇所へ戻れます。

4 集計値及び例外値で二重確認すること

表に合計、内訳、期首・期末残高又は件数がある場合は、抽出後に再計算します。次のような値は、元画像と再照合します。

  • 桁数が周辺と異なる値
  • マイナス記号、括弧又は小数点を含む値
  • 0、6、8、1、7等を誤認しやすい値
  • 年月日、事件番号、登録番号及び郵便番号
  • 空欄とゼロを区別する必要があるセル
  • 合計が一致しない行又は列

法律実務で重要な数値又は固有名詞は、AIの一致だけで確定せず、人が原本と照合します。

5 検証台帳の書き方と合格の範囲

比較試験では,正解を確定できるセルを先に選び,直接抽出・画像読取り等で同じ対象を比較する必要がある。
次の表は記入様式の例であり,特定のPDFやAIについて測定した成績ではない。
「要確認」のままのセルを正解扱いせず,重要箇所の全件照合と,一般箇所の抽出検査を区別する。

記録欄記入する内容
元資料・位置ファイル識別子,PDF実頁,表題,行見出し,列見出し
基準値原画像を人が確認した値。原画像も不鮮明なら確定不能とする
条件抽出方法,モデル・ソフトの版,画像寸法・解像度,前処理
原出力修正前の文字・数値・符号・空欄と,行列対応
判定一致,不一致,欠落,要確認の別と,誤りの類型
訂正訂正後の値,根拠となる画像,確認者及び確認日時
照合範囲全件か抽出か,対象セル数,未確認セル数

誤り率を表示する場合は,対象セル数を分母とし,文字の一部が違う場合,列がずれた場合,空欄をゼロにした場合等をどう数えるかを先に定める。
小さい試験表で良好な結果が得られても,別の様式,手書き,薄い印字又は全資料の正確性まで保証するものではない。
法的に重要な金額・日付・氏名・否定語等は,総合的な精度が高い場合でも原画像と照合する。

OCR文字層を原画像に合わせて直すことと,原画像の記載自体を「正しいはずの値」に書き換えることは異なる。
後者は証拠内容の変更となり得るため,原本を維持し,誤記の指摘は別の説明や注記として区別する。
Adobeの認識テキスト修正機能も,原画像との対応を確認するために用い,ソフトの警告がない箇所をすべて正しいと扱わない。
出典:Adobe・スキャンしたテキストの修正。

画像化や検査の前提となる原本保全は,デジタル証拠の原本保全とハッシュ値を,提出コピーの秘密情報除去は,PDFのマスキング(黒塗り)の正しい方法を参照されたい。

第5 スクリーンショット及びPrint to PDFの位置付け

スクリーンショットは、問題のあるページ又は表だけを切り出し、十分な解像度でAIへ渡す方法です。全ページを一度に処理しにくい場合にも使えます。ただし、縮小、圧縮、欠け、スクロール位置又はページ番号の欠落が生じ得るため、原本との対応を残します。

Print to PDFは、元のPDFを別のPDFとして再生成する方法ですが、実装及び設定によって、文字が画像化される場合、テキスト層が維持される場合又は新たなテキスト層が生成される場合があります。「Print to PDFを行えば壊れたOCRが完全に消える」とは限りません。変換後のPDFについて、テキスト抽出結果とページ画像を実際に確認する必要があります。

第6 出力形式の選び方

目的に応じて形式を分けます。

  • 人が文章として確認する場合:Markdown又はWordの表
  • セル単位で照合、並べ替え又は集計する場合:CSV又はExcel
  • 元ページとの対応を確認する場合:ページ番号、行見出し及び列見出しを含む検証表
  • 訂正履歴を残す場合:原抽出値、訂正値、訂正理由及び確認者を持つ台帳

Markdownは見やすい形式ですが、Markdownにしただけで精度が上がるわけではなく、AIが自ら正確性を保証できるわけでもありません。CSV又はExcelも、元データの誤読を自動的に直すものではありません。

第7 Word化、RAG及びトークン使用量について

PDFの内容をWord又はMarkdownへ変換すると、後日の検索、引用又は差分確認がしやすくなる場合があります。しかし、Wordファイルを保存しただけでRAG(検索拡張生成)が自動的に構築されるわけではありません。実際に検索インデックスへ登録し、分割方法、メタデータ、アクセス権及び検索結果を確認する必要があります。

また、画像入力の使用量は、モデル、画像寸法及びdetail等に左右されます。テキスト化によって入力が減る場合はありますが、OCR結果の訂正又は表構造の復元に追加処理が必要な場合もあります。OpenAIのプロンプトキャッシュは入力の先頭一致等に左右されるため、「Word化すれば常に低コスト」とは限りません。input_tokens、cached_tokens、画像入力相当量及び再作業を含めて実測します。

詳しくは、弁護士がCodexを長時間・並列利用する際の使用量管理-プロンプトキャッシュ、プラグイン、heartbeat及び監査ログ(AI作成)を参照してください。

第8 証拠として利用する場合の注意

Word、Markdown、CSV又はExcelへ変換したファイルは、作業用の派生物です。変換後のファイルが元PDFと同一であることを、それ自体で証明するものではありません。

証拠又は重要資料として扱う場合は、少なくとも次を保存します。

  • 取得した原本PDF
  • 原本の取得元、取得日時及びハッシュ値
  • 変換に用いたソフトウェア、モデル、設定及び日時
  • ページごとの抽出結果
  • 人が原本と照合した箇所及び確認者
  • 誤読、訂正内容及び訂正理由
  • 最終的な集計又は引用に用いたセルと元ページの対応

この記録があれば、後日、抽出結果に疑義が生じた場合にも、原本まで戻って説明できます。

第9 実務用プロンプト例

1 表の試験読取り

添付したページ画像の表を読み取ってください。出力は、ページ番号、表題、行見出し、列見出し、セル値の順にしてください。判読できない文字又は列対応に自信がない箇所は推測で埋めず、「要確認」とし、候補と理由を示してください。合計欄がある場合は再計算し、不一致を別表にしてください。

2 元画像との照合

次の抽出表を元ページ画像と照合してください。文字、数値、符号、空欄、行・列の対応をセル単位で確認し、相違箇所だけを、ページ番号、行見出し、列見出し、抽出値、画像上の値、確信度の順に出力してください。画像から確定できない箇所は「確定不能」としてください。

3 複数ページの処理

1ページずつ処理し、各ページの終了時に、処理済みページ番号、要確認セル、合計不一致及び次ページへの継続可否を出力してください。前ページの列位置を次ページへ機械的に転用せず、各ページの見出しを確認してください。

「完全に理解してください」「一文字も落とさないでください」と指示するだけでは、正確性は保証されません。確認不能を明示させ、元ページとの照合工程を設ける方が重要です。

第10 関連記事及び参考資料