OCR (G検定)

OCR

1. 定義と概要

OCRとは、紙面や画像上の文字をコンピュータが読み取り、編集や検索が可能なテキストデータに変換する技術です。身近な例としては、スキャンした紙の書類やレシートの画像から文字情報を読み取ったり、名刺に印字された氏名や住所をテキスト化したりする場面が挙げられます。

従来、活字(印刷された標準的なフォント)の認識には、あらかじめ用意した文字の型と画像を照合するパターンマッチング(あらかじめ用意した文字の型と画像を照らし合わせて一致するものを探す方法)を中心とした手法が使われてきました。活字は形が一定なので比較的高精度に認識できた一方、書き手ごとに形が異なる手書き文字への対応は長年の課題でした。

この差を埋めたのが、ディープラーニングを組み込んだAI-OCR(機械学習やディープラーニングを組み込み、手書き文字にも対応できるようにしたOCR)の登場です。文字の型をあらかじめ人が用意するのではなく、大量の文字画像から特徴そのものを学び取る方式に変わりました。手書き文字や崩れたレイアウト、多様な帳票様式にも対応できるよう、認識精度は段階的に向上してきました。

2. 試験対策ポイント

まず整理したいのは、OCRの処理が前処理から後処理まで一連の段階を経て進む点です。とくに中核にあたるのが、文字のある場所を見つけるレイアウト解析(文書のどこに文字や表があるかを見分ける処理)と、そこを1文字ずつに切り分けるセグメンテーション(画像を1文字ずつの領域に分割する処理)です。画像を取り込んでからテキストが仕上がるまでの流れは、次の5段階に整理できます。

段階 処理の内容
前処理 ノイズ除去や二値化(画像を白と黒の2色だけに変換し、文字と背景をくっきり分ける処理)、傾きの補正を行う
レイアウト解析 文書のどこに文字や表があるかを見分け、文字領域を検出する
セグメンテーション 検出した領域を1文字ずつの領域に分割する
文字認識 特徴抽出(文字の形を線やカーブなどの特徴に分解して取り出す処理)を経て、照合により文字を判定する
後処理 辞書照合(読み取った文字列を単語辞書と照らし合わせて誤りを補正する処理)などで仕上げる

この5段階がOCRの処理の柱で、どの段階が欠けても最終的な読み取り精度は落ちます。前半の段階が画像を整えて文字を切り出す役目、後半の段階が文字を判定して誤りを均す役目という分担です。

活字と手書きの精度差は、この一連の処理のうちとくに文字認識の段階で表れます。活字は定型フォントとの照合で高精度に認識できる一方、手書きは筆跡のばらつきが大きく、従来のパターンマッチングだけでは対応が難しい領域でした。

この差を埋めた仕組みを指すのがAI-OCRという呼び方です。機械学習やディープラーニングを組み込み、手書き文字や崩れたレイアウト、多様な帳票様式にも対応できるようにしたOCRの総称で、パターンマッチング中心の従来型OCRとの対比で使われます。学習済みのモデルを使って文字を判定するこの処理は、推論(学習済みモデルを使って答えを出す処理)にあたります。

歴史的な事例として挙げられるのが、LeNet(手書き数字の認識のために開発された初期の畳み込みニューラルネットワーク)です。畳み込みニューラルネットワーク(画像の特徴を段階的にとらえて認識するディープラーニングのモデル)を用いたこの仕組みは、郵便番号や小切手の数字認識に使われてきました。LeNetそのものの構造は、別のテーマとして扱われます。

3. 関連概念との比較・相違点

パターン認識との最大の違いは、包括的な枠組みか個別の応用技術かという関係にある点です。パターン認識は画像・音声・文字などを対象とする総称で、OCRはそのうち文字認識に特化した応用技術の一つに位置づけられます。「パターン認識」という大きな括りの中に、画像認識や音声認識、そしてOCRのような文字認識が個別の応用として並ぶという位置関係です。パターン認識そのものの理論的な広がりやアルゴリズムの詳細については、ここでは立ち入らず別のテーマとして扱います。

同じパターン認識の応用にあたる音声認識との違いは、対象とするメディアそのものにあります。入力・処理・出力の3点で並べると、共通点と相違点が見えやすくなります。

項目 OCR 音声認識
入力するデータ 画像に写った文字 音声波形
処理の流れ 前処理を経て文字の特徴を取り出し、パターンとの照合で判定する 音の波形から特徴を取り出し、パターンとの照合を経る
出力するもの テキストデータ テキストデータ

このように、音声認識もOCRの前処理から認識に至る流れと構造的に似た組み立てです。入力するデータの種類が画像か音声かという違いはあっても、処理の骨格には対応関係があり、最終的に認識結果をテキストデータへ変換する点は共通しています。

4. ビジネス・実務での活用シナリオ

経理・バックオフィスの分野では、請求書や領収書といった紙の帳票をOCRで読み取り、金額や日付などの項目を自動でデータ化する運用が広がっています。手入力に頼っていた作業をOCRに置き換えることで、入力にかかる時間だけでなく、転記ミスによる後戻り作業も減らせる点が実務上の効果です。

RPA(人がパソコンで行っていた定型作業を自動化する仕組み)と連携する業務では、OCRで読み取ったデータをそのままRPAに渡し、会計システムへの入力まで一連の処理を自動化する運用が一般的です。読み取りから入力までを人手を介さずつなげることで、月次処理のような繰り返し作業の所要時間を大きく圧縮できます。

行政・自治体の窓口業務で進んでいるのが、住民から提出される紙の申請書をAI-OCRで読み取り、手書きの記入項目を含めてデータ化する取り組みです。手書き文字にも対応できるAI-OCRのしくみが、定型フォーマットに沿わない申請書のデータ化を可能にし、窓口や後方事務にかかる処理時間の短縮につながります。

5. 要点まとめ

  • OCRは紙面や画像上の文字をテキストデータに変換する技術で、処理は前処理→文字領域の検出→切り出し→認識→後処理という流れをたどります。
  • 活字は従来型のパターンマッチングでも高精度に認識できる一方、手書きの認識精度はディープラーニングを組み込んだAI-OCRの登場で向上しました。
  • 帳票処理・RPA連携・行政の申請書処理など、業務のデータ化と自動化を支える技術として活用が広がっています。

6. 確認問題

問1OCRとは、紙や画像に含まれる文字情報を読み取り、編集や検索が可能なテキストデータに変換する技術である。

解答・解説をみる

○ 正しい

OCR(Optical Character Recognition)の基本的な定義そのものです。スキャンした書類やレシート画像からの文字抽出が代表例にあたります。

問2従来型のOCRは、あらかじめ用意した文字の型と画像を照合するパターンマッチングを中心とした手法であり、手書き文字の認識でも活字と同等の精度を発揮する。

解答・解説をみる

× 誤り

正しくは、従来型のパターンマッチングは活字の認識には強い一方、書き手ごとに形が異なる手書き文字への対応は難しいという関係にあります。手書きの認識精度を高めたのはディープラーニングを組み込んだAI-OCRの登場であり、活字と手書きを同列に扱う記述は誤りです。

問3AI-OCRとは、機械学習やディープラーニングを組み込み、手書き文字や多様なレイアウトにも対応できるようにしたOCRの総称である。

解答・解説をみる

○ 正しい

パターンマッチング中心の従来型OCRとの対比で使われる呼び方で、認識対象の幅と精度の高さが特徴にあたります。