PDF scanné ou PDF texte ? Pourquoi le texte ne se copie pas — et comment y remédier

Mis à jour le 24 septembre 2026

Deux sortes de PDF qui se ressemblent

Un PDF enregistré depuis Word, un site web ou un logiciel de comptabilité contient ses mots sous forme de texte : chaque lettre est un caractère que l’ordinateur connaît. Un PDF produit par un scanner ou l’appareil photo d’un téléphone contient une image de la page. À l’écran, impossible de les distinguer ; pour l’ordinateur, le second ne contient pas un seul mot.

Le savoir en dix secondes

Certains PDF sont mixtes — des pages saisies au clavier avec une page de signature scannée ou un certificat joint —, alors vérifiez la page dont vous avez réellement besoin.

  • Essayez de sélectionner un seul mot. Si c’est un cadre bleu qui recouvre toute la page, c’est une image.
  • Recherchez un mot que vous voyez à l’écran (Ctrl+F, ou ⌘F sur Mac). Dans un scan, la recherche ne trouve rien.
  • Zoomez fortement. Le texte reste net à n’importe quel niveau de zoom ; un scan devient flou ou pixelisé.
  • Regardez le poids. Dix pages de texte pèsent en général quelques centaines de kilooctets ; dix pages scannées font souvent plusieurs mégaoctets.

Pourquoi c’est important

Avec un PDF scanné, impossible de copier un paragraphe, de rechercher un nom ou de le faire lire à voix haute par un lecteur d’écran. Le convertir en Word donne un document qui contient une image de chaque page, puisqu’il n’y a aucun texte à y mettre. Et les scans sont lourds : ce sont eux qui font dépasser les limites de poids des portails.

Extraire les mots : la reconnaissance de texte (OCR)

L’OCR — reconnaissance optique de caractères — examine l’image de chaque page et détermine quelles lettres s’y trouvent. OCR pour PDF le fait pour un PDF scanné, et Image en texte pour une photo ou une capture d’écran ; les deux fonctionnent dans votre navigateur et lisent quinze langues, dont l’arabe, le chinois, l’hindi et le bengali.

La reconnaissance est excellente sur des pages imprimées nettes, mais jamais parfaite. Elle lit ce qu’elle voit : c’est la qualité du scan qui fait la qualité du résultat :

  • Scannez à 300 DPI pour les petits caractères ; 200 DPI suffisent pour un texte de taille normale.
  • Gardez la page à plat et droite, sous une lumière uniforme, sans l’ombre de votre main ou de votre téléphone.
  • Choisissez la bonne langue. Une page lue dans la mauvaise langue ressort avec les lettres les plus ressemblantes de la langue choisie.
  • L’écriture manuscrite est mal reconnue par tous les moteurs d’OCR ; attendez-vous à la saisir vous-même.
  • Vérifiez toujours à l’œil les noms, les chiffres et les dates. Un 0 lu comme un O ou un 1 lu comme un l est l’erreur la plus fréquente, et c’est sur un formulaire officiel qu’elle pèse le plus.

Quel outil pour quel PDF

Autres guides

Cette page dans d’autres langues: English · العربية · বাংলা · Deutsch · Español · فارسی · עברית · हिन्दी · Bahasa Indonesia · Português · Русский · Türkçe · اردو · 中文