Mis à jour le 24 septembre 2026
Un PDF enregistré depuis Word, un site web ou un logiciel de comptabilité contient ses mots sous forme de texte : chaque lettre est un caractère que l’ordinateur connaît. Un PDF produit par un scanner ou l’appareil photo d’un téléphone contient une image de la page. À l’écran, impossible de les distinguer ; pour l’ordinateur, le second ne contient pas un seul mot.
Certains PDF sont mixtes — des pages saisies au clavier avec une page de signature scannée ou un certificat joint —, alors vérifiez la page dont vous avez réellement besoin.
Avec un PDF scanné, impossible de copier un paragraphe, de rechercher un nom ou de le faire lire à voix haute par un lecteur d’écran. Le convertir en Word donne un document qui contient une image de chaque page, puisqu’il n’y a aucun texte à y mettre. Et les scans sont lourds : ce sont eux qui font dépasser les limites de poids des portails.
L’OCR — reconnaissance optique de caractères — examine l’image de chaque page et détermine quelles lettres s’y trouvent. OCR pour PDF le fait pour un PDF scanné, et Image en texte pour une photo ou une capture d’écran ; les deux fonctionnent dans votre navigateur et lisent quinze langues, dont l’arabe, le chinois, l’hindi et le bengali.
La reconnaissance est excellente sur des pages imprimées nettes, mais jamais parfaite. Elle lit ce qu’elle voit : c’est la qualité du scan qui fait la qualité du résultat :
Cette page dans d’autres langues: English · العربية · বাংলা · Deutsch · Español · فارسی · עברית · हिन्दी · Bahasa Indonesia · Português · Русский · Türkçe · اردو · 中文