PDFからテキストを抽出する方法|スキャンPDFもOCRで対応
FreePDFチーム ·
PDFから一段落コピーしたいだけなのに、文字をうまく選択できないことがあります。これは、PDFが文字を2通りの形で持てるためです。通常のデジタルPDFには選択できる文字データが入っていますが、スキャンPDFにあるのは文字が写ったページ画像です。見た目は同じでも、前者はそのまま抽出でき、後者は先にOCRで画像を読み取る必要があります。
PDFからテキストをTXTファイルに抽出する
- PDFテキスト抽出ツールを開き、PDFをアップロードします。
- OCRは必要な場合だけ使うオプションで、初期設定ではオフです。通常のデジタルPDFではそのままにし、スキャンや写真から作ったPDFで文字を選択できないときだけオンにします。
- 全ページの文字が1つにまとまったプレーンテキストの
.txtファイルをダウンロードします。
OCRが必要か見分ける方法
PDFを開き、試しに一文を選択してみてください。文字列を選択してコピーできるなら、PDF内にテキストデータが含まれているためOCRは不要です。OCRを使わずに抽出するほうが速く、元の文字を誤認識する心配もありません。
ドラッグするとページ全体が画像のように選ばれる、または何も選べない場合は、OCRをオンにします。ページ画像から文字を認識してからテキストファイルを作るため、鮮明でまっすぐ、濃淡のはっきりした原稿ほど正確です。ぼやけた写真、手書き、かすれた印刷、特殊な書体では誤認識が増えます。
プレーンテキスト、Word、Markdownの使い分け
- プレーンテキストは文字だけが必要なときに最適です。文書内の検索、別のアプリへの貼り付け、スクリプトでの処理、AIツールへの入力に向いています。その代わり、フォントや画像、段組み、表は残りません。
- Wordは、元のレイアウトをできるだけ保ちながら文書を編集したいときに向いています。
- Markdownは両者の中間です。プレーンテキストとして読みやすいまま、見出し、箇条書き、リンク、簡単な表といった構造を残せます。
抽出した文字がきれいに並ばない理由
PDFは文書の読み順を記録するのではなく、ページ上の座標を指定して内容を配置する形式です。そのため、2段組みの報告書では左右の段のテキストが交互に混ざったり、ヘッダーが段落の途中に入ったり、印刷上の1行ごとに改行されたりすることがあります。プレーンテキストでは紙面のレイアウトを再現できません。構造も残したい場合は、WordやMarkdownのほうが適しています。
よくある質問
必要なページだけテキストを抽出できますか?
できます。先に必要なページだけを別のPDFに抽出し、そのPDFをテキスト抽出ツールにかけてください。対象ページだけのテキストファイルになり、あとの作業もしやすくなります。
テキストを抽出すると元のPDFは変わりますか?
変わりません。ツールはPDFを読み取り、別の.txtファイルを作ってダウンロードします。アップロードしたPDFを編集・上書きせず、元のPDFにOCRのテキスト層を追加する処理でもありません。