Come estrarre il testo da un PDF (con OCR solo quando serve)
Dal team di FreePDF ·
Copiare un paragrafo da un PDF sembra un'operazione banale, finché il cursore non si rifiuta di selezionare le parole. Il motivo è semplice: un PDF digitale contiene caratteri veri, mentre una scansione contiene soltanto l'immagine di quei caratteri. Dal primo il testo si estrae direttamente; per il secondo serve l'OCR, che legge le parole nell'immagine.
Estrarre il testo in un file .txt
- Carica il PDF nello strumento PDF in testo.
- Per un normale PDF digitale, lascia l'OCR disattivato: è l'impostazione predefinita. Attivalo solo se il documento è una scansione, una foto o un PDF composto esclusivamente da immagini, quindi senza testo selezionabile.
- Scarica un unico file
.txtin formato testo semplice con il contenuto di tutte le pagine.
Come capire se serve l'OCR
Apri il PDF e prova a evidenziare una frase. Se puoi selezionare e copiare le singole parole, il documento ha già un livello di testo: lascia l'OCR disattivato. L'estrazione diretta è più veloce e conserva i caratteri originali senza doverli riconoscere di nuovo.
Se invece, trascinando il cursore, selezioni l'intera pagina come se fosse una foto oppure non selezioni nulla, attiva l'OCR. Prima di creare il file di testo, lo strumento riconoscerà le lettere nell'immagine. Scansioni nitide, dritte e con un buon contrasto danno i risultati migliori; foto sfocate, scrittura a mano, stampe sbiadite e font insoliti aumentano gli errori.
Meglio testo semplice, Word o Markdown?
- Il testo semplice è la scelta più pulita quando servono solo le parole: per cercare nel documento, incollarle in un'altra app, darle in pasto a uno script o prepararle per uno strumento di AI. Per sua natura elimina font, immagini, colonne e tabelle.
- Word è più adatto se vuoi modificare il documento conservando il più possibile l'impaginazione originale.
- Markdown sta nel mezzo: resta leggibile come testo semplice, ma mantiene una struttura leggera fatta di titoli, elenchi, link e tabelle essenziali.
Perché il testo estratto a volte è disordinato
Un PDF sa dove collocare ogni elemento sulla pagina, ma non sempre sa in quale ordine vada letto. Per questo, in un report a due colonne, le righe possono alternarsi da una colonna all'altra; un'intestazione può finire in mezzo a un paragrafo; ogni riga stampata può diventare una riga separata nel file di testo. Il testo semplice non può riprodurre l'impaginazione di una pagina: se quella struttura è importante, conviene scegliere Word o Markdown.
Domande frequenti
Posso estrarre il testo solo da alcune pagine?
Sì. Per prima cosa, estrai le pagine che ti interessano in un nuovo PDF oppure dividi il documento in file più piccoli; poi converti il PDF ottenuto con lo strumento PDF in testo. Il file risultante conterrà solo quelle pagine e sarà più facile da gestire.
L'estrazione modifica il PDF originale?
No. Lo strumento legge il PDF e crea un file .txt separato da scaricare. Non modifica né sovrascrive il documento sorgente e non vi aggiunge un livello OCR.