Afbeeldingen uit een PDF halen (geen schermafbeeldingen van pagina's)
Door het team van FreePDF ·
Een leverancier stuurt een catalogus van 40 pagina's en jij hebt alleen de productfoto's nodig. Er stuk voor stuk een schermafbeelding van maken gooit resolutie weg, en de PDF naar JPG omzetten levert hele pagina's op met de tekst erin gebakken. Wat je wilt zijn de afbeeldingen zelf: de bestanden die iemand in het document sleepte voordat het geëxporteerd werd.
Afbeeldingen extraheren is geen pagina's omzetten
Dit zijn twee verschillende klussen en de namen van de tools lijken te veel op elkaar, dus even duidelijk welke je nodig hebt.
- PDF naar JPG rendert elke pagina als één platte afbeelding: tekst, foto's, paginanummers en al, op de resolutie die je vraagt.
- Afbeeldingen extraheren gaat het bestand in en haalt elke ingesloten afbeelding er los uit, op precies de resolutie waarop hij is opgeslagen.
Onderweg wordt niets opnieuw gecodeerd. Een foto van 3000×2000 komt terug als 3000×2000, ook al stond hij in de opmaak als miniatuur, want de PDF bewaarde de volledige afbeelding en toonde hem alleen klein. Dat is vaak een prettige verrassing: de foto's zijn groter dan ze op de pagina leken.
Wat er in de ZIP zit
Alles komt terug in één ZIP, zodat je niet 60 keer op downloaden hoeft te klikken. Elk bestand is vernoemd naar de pagina waar het vandaan komt, in volgorde van verschijnen, dus page7_23_Im4.png is het vierde afbeeldingsobject op pagina 7. Sorteer je de map op naam, dan staan de afbeeldingen in leesvolgorde, wat het terugkoppelen aan het document makkelijk maakt.
De formaten zijn wat de PDF opsloeg, meestal PNG of JPG. Er kunnen meer bestanden uitkomen dan je verwacht: een pagina-achtergrond, een logo dat in de kop van elke pagina terugkomt, een haarlijntje dat als afbeelding van twee pixels is bewaard. Doorloop en verwijder, in plaats van aan te nemen dat elk bestand een foto is.
Als de afbeelding die je wilt er niet uit komt
De tool vindt alleen rasterafbeeldingen, die uit pixels bestaan. Sommige dingen die op de pagina op een afbeelding lijken, zijn niet zo opgeslagen:
- Logo's, pictogrammen en grafieken die als vector zijn getekend. Een grafiek uit Illustrator of uit een rapportagetool is vaak een reeks tekeninstructies, geen afbeelding. Er is geen afbeeldingsobject om eruit te halen, en de tool meldt dat er niets gevonden is.
- Foto's die in stroken zijn gesneden. Sommige opmaakprogramma's hakken een grote afbeelding in horizontale banen bij het schrijven van de PDF. Je krijgt de banen, in de goede volgorde, en mag ze zelf weer aan elkaar zetten.
- Afbeeldingen die in de opmaak zijn bijgesneden. Het bijsnijden is een weergave-instructie, dus je krijgt de volledige originele afbeelding terug, inclusief het deel dat op de pagina verborgen was.
Voor alles uit het eerste punt render je in plaats daarvan de pagina en snijd je het resultaat bij. De oorspronkelijke resolutie ben je kwijt, maar een op 300 dpi gerenderde pagina van een vectorgrafiek is scherp genoeg voor een presentatie of een document.
Gescande documenten gedragen zich anders
Komt de PDF uit een scanner of een scan-app op je telefoon, dan is elke pagina één grote afbeelding. Extraheren geeft je precies dat: één foto per pagina, de scan zelf, op de resolutie waarop hij gescand is. Erg handig als je de ruwe scans terug wilt uit een bundel die iemand heeft samengevoegd, en nutteloos als je hoopte een figuur op de pagina te isoleren. Voor zo'n figuur haal je de pagina-afbeelding eruit en snijd je die bij.
Veelgestelde vragen
Zijn de geëxtraheerde afbeeldingen minder goed dan in de PDF?
Nee. De ingesloten afbeeldingsgegevens worden er ongewijzigd uit gekopieerd in plaats van opnieuw opgeslagen, dus er is geen tweede compressieronde. Was een foto bij het maken van het document al platgeslagen naar 72 dpi, dan is dat wat je terugkrijgt. Het extraheren maakt het niet slechter, maar kan ook geen detail terughalen dat de PDF nooit bevatte.
Kan ik de afbeeldingen van één pagina eruit halen?
Niet direct, maar het zijn twee stappen: haal die pagina eerst als eigen PDF eruit en laat daar de afbeeldingsextractie op los. Bij een lang document is dat meestal sneller dan graven in een ZIP vol kopteksten en lijntjes, en de bestandsnamen blijven overzichtelijk.