Cara Mengekstrak Teks dari PDF (dengan atau tanpa OCR)
Oleh tim FreePDF ·
Menyalin satu paragraf dari PDF mestinya mudah. Masalahnya, dua PDF yang terlihat sama di layar bisa menyimpan tulisan dengan cara yang sama sekali berbeda. PDF digital berisi karakter asli yang bisa dipilih, sedangkan PDF hasil pindai hanya berisi gambar huruf. Yang pertama bisa langsung diekstrak; yang kedua perlu dibaca dengan OCR terlebih dahulu.
Ekstrak teksnya menjadi file .txt
- Unggah PDF Anda ke alat PDF ke Teks.
- Biarkan OCR nonaktif untuk PDF digital biasa. Aktifkan hanya jika filenya berupa hasil pindai atau foto dan tulisannya tidak bisa dipilih.
- Unduh satu file
.txtberisi teks biasa dari seluruh halaman.
Cara tahu apakah Anda perlu OCR
Buka PDF lalu coba sorot satu kalimat. Kalau tiap katanya bisa dipilih dan disalin, file itu sudah punya lapisan teks. Biarkan OCR tetap mati: ekstraksi langsung lebih cepat dan mempertahankan karakter aslinya, alih-alih menebak huruf dari gambar.
Kalau menyeret kursor malah memilih seluruh halaman seperti gambar—atau tidak memilih apa pun—barulah nyalakan OCR. Fitur ini mengenali huruf dari gambar halaman sebelum membuat file teks. Halaman yang jernih, lurus, dan memiliki kontras tinggi memberi hasil terbaik; foto buram, tulisan tangan, cetakan pudar, dan jenis huruf tak lazim lebih rentan salah dikenali.
Pilih teks biasa, Word, atau Markdown
- Teks biasa paling pas kalau Anda cuma membutuhkan kata-katanya: untuk mencari isi dokumen, menempelkan kutipan ke aplikasi lain, memasukkannya ke skrip, atau menyiapkan bahan untuk alat AI. Format ini memang membuang font, gambar, kolom, dan tabel.
- Word lebih cocok kalau dokumennya ingin diedit sambil mempertahankan sebanyak mungkin tata letak asli.
- Markdown ada di tengah-tengah. File-nya tetap mudah dibaca sebagai teks biasa, tetapi struktur ringan seperti judul, daftar, tautan, dan tabel sederhana tetap tersimpan.
Kenapa teks hasil ekstraksi kadang berantakan
PDF dibuat untuk menaruh isi di koordinat yang tepat pada halaman, bukan untuk menjelaskan urutan bacanya. Akibatnya, laporan dua kolom bisa terbaca selang-seling, kepala halaman bisa nyasar ke tengah paragraf, atau setiap baris cetak menjadi baris terpisah di file teks. Teks biasa memang tidak bisa meniru tata letak halaman. Kalau strukturnya penting, Word atau Markdown biasanya lebih cocok.
Pertanyaan umum
Bisakah saya mengekstrak teks dari beberapa halaman saja?
Bisa. Pisahkan atau ekstrak dulu halaman yang dibutuhkan menjadi PDF yang lebih kecil, lalu proses file tersebut dengan alat PDF ke Teks. File teks hasilnya hanya akan memuat halaman tersebut sehingga lebih mudah diolah.
Apakah ekstraksi teks mengubah PDF asli?
Tidak. Alat ini membaca PDF lalu menghasilkan file .txt terpisah untuk diunduh. PDF yang Anda unggah tidak diedit, ditimpa, ataupun diberi lapisan OCR.