FreePDF logoFreePDF

Tekst uit een PDF halen (ook uit scans met OCR)

Door het team van FreePDF ·

Een alinea uit een PDF vissen klinkt als een klus van twee seconden — totdat kopiëren ineens niets oplevert. Onder de motorkap bestaan er namelijk twee soorten PDF's. In een digitaal gemaakte PDF staan echte letters die je kunt selecteren. Een scan bewaart alleen pixels die eruitzien als letters. De eerste soort lees je rechtstreeks uit; bij de tweede moet OCR eerst de tekst in de pagina-afbeelding herkennen.

Tekst opslaan als .txt-bestand

  1. Open de tool PDF naar tekst en upload je bestand.
  2. Laat OCR standaard uitstaan. Zet de optionele OCR alleen aan bij een scan, foto of PDF met alleen afbeeldingen waarvan je de woorden niet kunt selecteren.
  3. Download één eenvoudig .txt-bestand met de tekst van alle pagina's.

OCR nodig? Doe de selectietest

Open de PDF en probeer één zin te markeren. Kun je losse woorden selecteren en kopiëren, dan zit er al een tekstlaag in het bestand en laat je OCR uit. Rechtstreeks uitlezen is sneller en neemt de bestaande tekens over, zonder opnieuw te hoeven raden wat er staat.

Selecteer je bij het slepen de hele pagina als afbeelding, of helemaal niets, dan heb je te maken met een scan of een PDF die alleen uit afbeeldingen bestaat. Daarvoor zet je OCR aan. Die herkent eerst de letters in het paginabeeld en maakt daarna het tekstbestand. Heldere, rechte scans met flink contrast geven het beste resultaat; wazige foto's, handschrift, verbleekte afdrukken en ongebruikelijke lettertypen leveren sneller fouten op.

Wanneer kies je .txt, Word of Markdown?

  • Platte tekst is de eenvoudigste keuze als je alleen de inhoud nodig hebt, bijvoorbeeld om in een document te zoeken, tekst in een andere app te plakken, die met een script te verwerken of als invoer voor een AI-tool te gebruiken. Lettertypen, afbeeldingen, kolommen en tabellen worden bewust niet meegenomen.
  • Word past beter als je verder wilt bewerken en zo veel mogelijk van de oorspronkelijke lay-out wilt behouden.
  • Markdown zit ertussenin. Het blijft leesbare platte tekst, maar behoudt structuur, zoals koppen, lijsten, links en eenvoudige tabellen.

Waarom staat geëxtraheerde tekst soms door elkaar?

Een PDF legt vooral vast waar iets op een pagina staat, niet per se in welke volgorde je het moet lezen. Daardoor kunnen de twee kolommen van een rapport om en om in het tekstbestand belanden, kan een kopregel midden in een alinea opduiken of krijgt elke gedrukte regel een eigen regel in het bestand. Platte tekst kan een paginalay-out niet nabouwen. Is die structuur belangrijk, dan is Word of Markdown meestal handiger.

Veelgestelde vragen

Kan ik alleen tekst uit een paar pagina's halen?

Ja. Haal de gewenste pagina's eerst uit de PDF of splits de PDF op, zodat je een kleiner bestand overhoudt. Zet daarna dat bestand om naar tekst; zo bevat de download alleen de pagina's die je nodig hebt.

Verandert dit de PDF of krijgt die een OCR-tekstlaag?

Nee. PDF naar tekst leest het bronbestand en maakt een los .txt-bestand om te downloaden. De geüploade PDF wordt niet aangepast of overschreven. Wil je juist een scan doorzoekbaar maken binnen de PDF zelf, dan heb je de tool PDF OCR nodig: die voegt een onzichtbare OCR-tekstlaag toe en levert weer een PDF op.

Gerelateerde gratis tools