スキャンしたPDFをOCRする方法|検索・コピーできるように
FreePDFチーム ·
スキャンしたPDFは、要するに.pdfという拡張子で保存されたページの写真にすぎません。 検索はできず、コピーしたい一文を選ぶこともできず、スクリーンリーダーも読み上げ られません。OCR(光学文字認識)は、画像の中の文字を読み取って裏側に加え直すことで、 これを解決します。
OCRが実際に変えるもの
スキャンそのものには手を付けません。レイアウトも手書きも、コーヒーのシミがあれば それも、そのままです。加わるのは、画像の文字のちょうど真後ろに置かれる、目に 見えない本物の選択できるテキスト層です。だからページは見た目がまったく同じまま、 普通の文書のように振る舞うようになります。
OCRを実行する
- PDF OCR ツールを開き、スキャンしたファイルをアップロードします。
- 各ページの文字を認識し、その下に検索できるテキスト層として加えます。
- 検索できるPDFをダウンロードします。
これが本当に必要になるとき
- 長いスキャンの契約書や報告書を1ページずつ読む代わりに、ある条項だけ検索したいとき。
- スキャンから段落を手で打ち直す代わりに、コピーして取り出したいとき。
- 古いスキャン文書を、スクリーンリーダーで読めるようにしたいとき。
- さらに別の変換に備えてスキャンを下ごしらえするとき。表やテキストの抽出は、 読み取れる本物の文字があって初めて働きます。
正確な結果を得るには
OCRの精度は、スキャンの品質にそのまま比例します。
- 鮮明でまっすぐ、明るく照らされたスキャンは、ほぼ完璧に読み取れます。
- 解像度の低い写真、大きな傾き、手書きは、確実に認識するのが難しくなります。 最初の結果が今ひとつなら、平らに、明るくして撮り直してください。
- 英語のテキスト向けに調整されているため、ほかの言語ではエラーが増えることがあります。
よくある質問
処理のあと、ページの見た目は変わりますか?
変わりません。元の画像はまったくそのまま残ります。OCRはその裏に見えないテキスト 層を加えるだけで、ページを描き直したり置き換えたりはしません。
そのあとWordやExcelに変換できますか?
できますし、むしろそれが狙いであることも多いです。先にOCRをかけて下地に本物の テキストや表データをそろえてから、いつもどおりWord・Excel・プレーンテキストへ 変換してください。