FreePDF logoFreePDF

Comment extraire le texte d'un PDF, même scanné

Par l'équipe FreePDF ·

Un PDF peut contenir des mots de deux façons très différentes. Dans un document numérique classique, ce sont de vrais caractères que vous pouvez sélectionner. Dans un scan, ce ne sont que des images de caractères, même si la page ressemble parfaitement à du texte. Le contenu du premier s'extrait directement ; le second doit d'abord être lu par reconnaissance optique de caractères (OCR).

Extraire le contenu dans un fichier .txt

  1. Ouvrez l'outil PDF en texte et importez votre fichier.
  2. Pour un PDF numérique, laissez l'OCR désactivée : c'est le réglage par défaut. Activez-la uniquement si le document est un scan, une photo ou un PDF composé d'images dont les mots ne se sélectionnent pas.
  3. Téléchargez un fichier .txt distinct contenant le texte de toutes les pages.

Faut-il activer l'OCR ?

Ouvrez le PDF et essayez de sélectionner une phrase. Si vous pouvez surligner puis copier les mots un par un, le fichier possède déjà une couche de texte : inutile d'activer l'OCR. L'extraction directe est plus rapide et récupère les caractères d'origine sans tenter de les deviner.

Si toute la page se sélectionne comme une seule image — ou si rien ne se sélectionne — activez l'OCR. Elle déchiffre alors les lettres dans l'image avant de créer le fichier texte. Les pages nettes, droites et bien contrastées donnent les meilleurs résultats ; les photos floues, l'écriture manuscrite, l'encre pâlie et les polices inhabituelles entraînent davantage d'erreurs.

Texte brut, Word ou Markdown : quel format choisir ?

  • Le texte brut va à l'essentiel : il convient pour effectuer une recherche, coller le contenu dans une autre application, alimenter un script ou préparer du texte pour un outil d'IA. En contrepartie, il abandonne volontairement polices, images, colonnes et tableaux.
  • Word est plus adapté si vous souhaitez modifier le document tout en conservant au mieux sa mise en page.
  • Markdown offre un juste milieu : le fichier reste lisible comme du texte brut, mais garde une structure légère — titres, listes, liens et tableaux simples.

Pourquoi le texte extrait paraît parfois désordonné

Un PDF place les éléments à des coordonnées précises sur une page ; il ne décrit pas forcément l'ordre dans lequel il faut les lire. Dans un rapport en deux colonnes, le texte peut donc passer de l'une à l'autre, un en-tête se glisser au milieu d'un paragraphe ou chaque ligne imprimée devenir une ligne séparée dans le fichier. Le texte brut ne peut pas reproduire une mise en page. Si cette structure compte, Word ou Markdown sera généralement plus approprié.

Questions fréquentes

Puis-je n'extraire que quelques pages ?

Oui. Commencez par extraire les pages voulues dans un PDF plus court, puis passez ce nouveau fichier dans l'outil PDF en texte. Le fichier texte final ne contiendra que ces pages et sera plus simple à exploiter.

L'extraction modifie-t-elle le PDF d'origine ?

Non. L'outil lit votre PDF et génère un fichier .txt distinct à télécharger. Il ne modifie ni ne remplace le PDF envoyé et, même lorsque l'OCR est activée, il n'ajoute aucune couche OCR au fichier source.

Outils gratuits à découvrir