FreePDF logoFreePDF

Extraire les images d'un PDF (pas des captures de pages)

Par l'équipe FreePDF ·

Un fournisseur envoie un catalogue de 40 pages et vous ne voulez que les photos des produits. Les capturer une par une gâche la résolution, et convertir le PDF en JPG rend des pages entières avec le texte incrusté. Ce que vous voulez, ce sont les images elles-mêmes : les fichiers que quelqu'un a glissés dans le document avant de l'exporter.

Extraire des images, ce n'est pas convertir des pages

Ce sont deux opérations différentes et les noms des outils se ressemblent beaucoup, autant être précis sur celle dont vous avez besoin.

  • PDF en JPG restitue chaque page sous forme d'une seule image aplatie : texte, photos, numéros de page compris, à la résolution que vous demandez.
  • Extraire les images va chercher à l'intérieur du fichier et en sort chaque image intégrée séparément, à la résolution exacte à laquelle elle a été enregistrée.

Rien n'est réencodé au passage. Une photo de 3000×2000 revient en 3000×2000 même si la mise en page la réduisait à une vignette, parce que le PDF a conservé l'image entière et se contentait de l'afficher petite. C'est souvent une bonne surprise : les photos sont plus grandes qu'elles n'en avaient l'air.

Ce que contient le ZIP

Tout revient dans une seule archive ZIP, pour vous éviter 60 téléchargements. Chaque fichier porte le nom de la page dont il provient, dans l'ordre d'apparition : page7_23_Im4.png est donc le quatrième objet image de la page 7. En triant le dossier par nom, vous obtenez les images dans l'ordre de lecture, ce qui facilite le rapprochement avec le document.

Les formats sont ceux qu'a stockés le PDF, en général PNG ou JPG. Il peut y avoir plus de fichiers que prévu : un fond de page, un logo répété dans l'en-tête de chaque page, un filet fin enregistré comme une image de deux pixels. Parcourez et supprimez plutôt que de supposer que chaque fichier est une photo.

Quand l'image voulue ne sort pas

L'outil ne trouve que les images matricielles, celles faites de pixels. Certaines choses qui ressemblent à des images sur la page ne sont pas stockées ainsi :

  • Logos, icônes et graphiques dessinés en vectoriel. Un graphique exporté d'Illustrator ou produit par un outil de reporting est souvent une suite d'instructions de tracé, pas une image. Il n'y a aucun objet image à extraire, et l'outil vous dira qu'il n'en a trouvé aucune.
  • Photos découpées en bandes. Certains logiciels de mise en page tranchent une grande image en bandes horizontales au moment d'écrire le PDF. Vous récupérez les bandes, dans l'ordre, et il faut les recoller.
  • Images recadrées dans la mise en page. Le recadrage est une consigne d'affichage : vous récupérez donc l'image d'origine entière, y compris la partie masquée sur la page.

Pour tout ce qui relève du premier cas, restituez plutôt la page et recadrez le résultat. Vous perdez la résolution d'origine, mais une page rendue à 300 ppp d'un graphique vectoriel reste nette dans une présentation ou un document.

Les documents numérisés se comportent autrement

Si le PDF sort d'un scanner ou d'une application de numérisation, chaque page est une seule grande image. L'extraction vous donne exactement cela : une photo par page, le scan lui-même, à la résolution de numérisation. C'est très utile pour récupérer les scans bruts d'un lot que quelqu'un a fusionné, et sans intérêt si vous espériez isoler une figure imprimée sur la page. Dans ce cas, extrayez l'image de la page et recadrez-la.

Questions fréquentes

Les images extraites seront-elles de moins bonne qualité ?

Non. Les données de l'image intégrée sont recopiées telles quelles au lieu d'être réenregistrées, il n'y a donc pas de deuxième compression. Si une photo avait déjà été écrasée à 72 ppp lors de la création du document, c'est ce que vous récupérez. L'extraction ne dégrade rien, mais elle ne peut pas inventer un détail que le PDF n'a jamais contenu.

Puis-je extraire les images d'une seule page ?

Pas directement, mais cela tient en deux étapes : extrayez d'abord cette page dans son propre PDF, puis lancez l'extraction d'images dessus. Sur un long document, c'est souvent plus rapide que de fouiller un ZIP rempli d'en-têtes et de filets, et les noms de fichiers restent lisibles.

Outils gratuits à découvrir