FreePDF logoFreePDF

PDF 텍스트 추출: 스캔본까지 .txt로 저장하는 법

FreePDF 팀 작성 ·

눈에는 똑같이 글자로 보여도 PDF 안쪽은 전혀 다를 수 있습니다. 문서에서 바로 만든 PDF에는 선택 가능한 실제 글자가 들어 있지만, 스캔본에는 글자를 찍은 이미지뿐이죠. 일반 PDF는 글자를 그대로 뽑아내면 되고, 스캔본은 OCR로 이미지를 읽은 다음 텍스트로 바꿔야 합니다.

PDF에서 텍스트를 .txt 파일로 추출하기

  1. PDF 텍스트 추출 도구를 열고 파일을 올리세요.
  2. 일반 PDF라면 기본값대로 OCR을 끄세요. 글자를 선택할 수 없는 스캔본이나 이미지로만 된 PDF일 때만 켜면 됩니다.
  3. 모든 페이지의 글자가 담긴 별도의 .txt 파일 하나를 다운로드하세요.

OCR이 필요한지 10초 만에 확인하기

PDF를 열어 문장 하나를 마우스로 긁어 보세요. 단어가 하나씩 선택되고 복사된다면 이미 검색 가능한 텍스트 레이어가 있는 파일입니다. 이때는 OCR을 꺼 두는 편이 더 빠르고, 원래 글자를 괜히 다시 추측해 잘못 읽을 일도 없습니다.

반대로 페이지 전체가 사진처럼 잡히거나 아무것도 선택되지 않는다면 OCR을 켜세요. 글자 이미지밖에 없는 스캔본을 먼저 읽고 나서 텍스트 파일을 만듭니다. 선명하고 반듯하며 명암이 뚜렷한 페이지일수록 정확하고, 흐린 사진이나 손글씨, 빛바랜 인쇄물, 특이한 글꼴은 오류가 늘 수 있습니다.

여기서 OCR은 .txt 결과를 만들기 위한 읽기 단계입니다. 원본 PDF에 검색 가능한 OCR 텍스트 레이어를 덧붙여 새 PDF로 만드는 작업과는 다릅니다.

TXT, Word, Markdown 중 무엇을 고를까

  • TXT(순수 텍스트)는 글자만 필요할 때 가장 간단합니다. 문서 검색, 다른 앱에 붙여 넣기, 스크립트 처리, AI 도구 입력에 잘 맞는 대신 글꼴, 이미지, 단, 표 같은 레이아웃은 일부러 버립니다.
  • Word는 원래 문서 모양을 최대한 살리면서 내용을 편집해야 할 때 알맞습니다.
  • Markdown은 둘의 중간쯤입니다. 순수 텍스트처럼 가볍게 읽히면서 제목, 목록, 링크, 단순한 표 같은 기본 구조는 남겨 둡니다.

줄바꿈과 읽는 순서가 어색한 이유

PDF는 문서를 읽는 순서를 설명하는 형식이 아니라, 페이지의 정확한 좌표에 내용을 배치하는 형식입니다. 그래서 2단 보고서에서는 양쪽 단의 텍스트가 번갈아 섞이고, 머리글이 문단 한가운데 끼거나, 인쇄된 줄마다 텍스트 파일에 줄바꿈이 생길 수 있죠. 순수 텍스트로는 원래 지면 구성을 재현할 수 없습니다. 구조가 중요하다면 Word나 Markdown이 더 나은 선택입니다.

자주 묻는 질문

몇 페이지만 골라서 텍스트를 추출할 수 있나요?

네. 먼저 필요한 페이지만 분할하거나 추출해 별도 PDF로 만든 다음, 그 PDF를 텍스트 추출 도구에 올리세요. 결과 .txt 파일에는 선택한 페이지만 담겨 있어 다루기도 편합니다.

텍스트를 추출하면 원본 PDF도 바뀌나요?

아니요. 도구는 PDF를 읽고 별도의 .txt 파일을 만듭니다. 업로드한 PDF를 덮어쓰거나 수정하지 않으며, 원본에 OCR 텍스트 레이어를 추가하지도 않습니다.

관련 무료 도구