Vous recevez un contrat, un relevé, un vieux courrier numérisé. Le PDF scanné s'ouvre, tout est lisible à l'écran, mais le texte n'est pas sélectionnable : impossible d'attraper une ligne à la souris. Ctrl+F ne trouve rien, même un mot que vous voyez en gras. Le fichier n'est pas corrompu : il ne contient aucun texte.
Pourquoi le texte d'un PDF scanné ne se sélectionne pas
Un PDF est un conteneur. Il peut renfermer du vrai texte — des caractères, avec leur police et leur position — ou de simples images. Quand un document sort d'un scanner, d'un photocopieur ou d'un smartphone, chaque page est enregistrée comme une photographie. À l'écran, la différence est invisible. Pour l'ordinateur, elle est totale.
Le test qui tranche tient en deux raccourcis. Faites Ctrl+F et cherchez un mot bien visible à l'écran : si le lecteur ne le trouve pas, il n'y a pas de texte. Ctrl+A confirme — dans un PDF natif les lignes se surlignent en bleu, sur une page scannée rien ne se surligne. Attention au cas mixte : certains fichiers mélangent pages natives et pages scannées, typiquement un contrat imprimé, signé, puis renumérisé.
Les outils gratuits copient du texte dans le presse-papiers, mais ils ne fabriquent pas un PDF consultable page après page, avec choix de la langue et correction des passages douteux. C'est exactement ce que fait un éditeur PDF dédié.
La reconnaissance optique de caractères, concrètement
La reconnaissance optique de caractères, ou OCR pour optical character recognition, analyse l'image d'une page pour en déduire les lettres. Le logiciel isole les blocs de texte, découpe les lignes puis les caractères, et propose pour chacun la lettre la plus probable en s'appuyant sur un modèle de langue. D'où l'importance du réglage de langue : un moteur calé sur l'anglais massacrera les accents d'un document français.
Deux résultats très différents sont possibles — et c'est là qu'on se trompe d'outil.
- Du texte brut dans le presse-papiers. Vous sélectionnez une zone à l'écran, le texte reconnu est copié, vous le collez dans Word ou dans un mail. Le PDF d'origine, lui, n'a pas bougé.
- Un PDF consultable. Le logiciel repasse sur toutes les pages et glisse le texte reconnu sous l'image, invisible mais présent. Le document garde son apparence et devient sélectionnable et cherchable dans votre lecteur PDF. C'est ce qu'on veut pour archiver. Attention : la recherche de Windows n'indexe pas le contenu des PDF sans filtre dédié — Adobe Acrobat Reader en installe un.

Les outils gratuits qui suffisent dans la plupart des cas
Inutile de sortir la carte bancaire pour trois lignes : Windows embarque de quoi faire, et Microsoft distribue un outil gratuit très pratique.
PowerToys Text Extractor est notre premier réflexe. PowerToys est une suite d'utilitaires gratuite publiée par Microsoft, installable depuis le Microsoft Store ou son dépôt GitHub. Une fois le module Text Extractor activé, le raccourci Win + Maj + T assombrit l'écran ; vous tracez un rectangle autour du passage voulu et le texte atterrit dans le presse-papiers. Ça marche sur un PDF, mais aussi sur une vidéo en pause ou une application qui interdit la copie.
L'Outil Capture d'écran de Windows 11 joue dans le même registre : après une capture, le bouton Actions de texte lance la reconnaissance et permet de copier le contenu.
Google Drive traite un document entier gratuitement : déposez le PDF, clic droit, Ouvrir avec > Google Docs, et Google renvoie le texte reconnu. La qualité est bonne, mais la mise en page saute souvent. Surtout, disons-le franchement : envoyer un bulletin de salaire, un contrat ou une pièce d'identité vers un service en ligne est une mauvaise idée. Pour un document confidentiel, restez en local.
Côté logiciel libre, Tesseract et son compagnon OCRmyPDF produisent d'excellents PDF consultables, en local et sans rien payer. Le ticket d'entrée est une ligne de commande : parfait avec un terminal, rédhibitoire sans.
| Solution | Résultat | Traitement local | Pour qui |
|---|---|---|---|
| PowerToys Text Extractor | Texte dans le presse-papiers | Oui | Un extrait, une adresse, un numéro |
| Outil Capture (Windows 11) | Texte dans le presse-papiers | Oui | Dépannage sans installation |
| Google Drive / Google Docs | Document texte éditable | Non (envoi en ligne) | Documents non sensibles |
| Tesseract / OCRmyPDF | PDF consultable | Oui | À l'aise en ligne de commande |
| Éditeur PDF payant | PDF consultable + export Word | Oui | Volume régulier, archivage, usage pro |
Quand un logiciel PDF payant devient rentable
Le calcul est simple : pour dépanner, le gratuit gagne. Le rapport s'inverse dès que vous traitez des dizaines de pages par mois, que la mise en page doit être conservée, ou que le texte doit repartir en Word.
Un éditeur comme Ashampoo PDF Pro couvre ce terrain : reconnaissance de caractères avec choix de la langue, correction manuelle des passages douteux, puis export vers Word, RTF, HTML ou EPUB. Il assure aussi le quotidien du PDF — fusionner, découper, annoter, remplir un formulaire, signer. Nous avons détaillé ses forces et ses limites dans notre avis complet sur Ashampoo PDF Pro. Adobe Acrobat Pro et ABBYY FineReader PDF restent des références sur les documents difficiles, mais à un tarif d'un autre ordre.
Une idée reçue à écarter au passage : Word ouvre bien un PDF et le convertit en document modifiable, mais seulement si ce PDF contient déjà du texte. Sur une page scannée, Word insère l'image et s'arrête là : il ne fait pas de reconnaissance de caractères. Dans la suite Office, c'est OneNote qui sait copier le texte d'une image. La reconnaissance se fait donc en amont, avec un autre outil. Si vous hésitez sur votre suite bureautique, nos guides sur les alternatives gratuites à Office et sur la version d'Office à choisir font le tri.
Ça ne marche toujours pas : les cinq causes d'échec
La reconnaissance a tourné, et le résultat est illisible ou vide. La cause figure le plus souvent dans cette liste.
- La page est de travers. Quelques degrés d'inclinaison suffisent à faire chuter la précision. Redressez l'image : la plupart des logiciels PDF proposent une rotation fine ou un redressement automatique.
- La résolution est trop basse. En dessous de 300 points par pouce, les petits caractères se bouchent. Renumérisez à 300 dpi en niveaux de gris plutôt qu'en couleur : sur du texte imprimé, c'est souvent le réglage qui change le plus le résultat.
- C'est de l'écriture manuscrite. Les moteurs grand public visent le texte imprimé. Sur une note manuscrite, attendez-vous à un résultat inutilisable : c'est un problème distinct, bien plus difficile.
- Des tampons ou des signatures recouvrent le texte. Un cachet par-dessus une ligne, un paraphe qui traverse un montant : le moteur abandonne la zone. Pas de remède miracle, seulement une ressaisie manuelle.
- La langue ou la mise en page perturbent l'analyse. Langue mal réglée, fond coloré, filigrane, deux colonnes, tableaux imbriqués : le texte ressort mélangé. Vérifiez le réglage de langue en premier, c'est le plus souvent oublié.
Dernier réflexe : une photo au smartphone, nette et prise à plat, vaut souvent mieux qu'un vieux fax. Le logiciel rattrape un scan moyen, rarement un original trop pâle ou trop flou : mieux vaut alors refaire la numérisation.
Scan de travers, résolution trop basse, tampons par-dessus le texte : les documents difficiles demandent un logiciel qui redresse, reconnaît et exporte sans abonnement.
Voir les 3 offresRelisez les chiffres, systématiquement
La reconnaissance de caractères ne garantit aucun taux de réussite : elle propose la lettre la plus probable. Sur du texte courant, une erreur se repère à la lecture. Sur un chiffre, elle ne se voit pas et se propage.
Les confusions classiques sont bien identifiées : le 0 et la lettre O, le 1 avec l et I, le 5 avec S, le 8 avec B, le 6 avec G. Ajoutez les séparateurs de milliers et les virgules décimales, qui disparaissent ou se déplacent. Un IBAN, un montant, un SIRET, une date d'échéance : contrôlez-les caractère par caractère contre l'original. Aucun moteur, gratuit ou payant, ne dispense de cette relecture.
Le meilleur PDF scanné est celui qu'on n'a pas à scanner
Un PDF scanné dont le texte n'est pas sélectionnable trahit presque toujours un document né sur papier alors qu'il aurait pu rester numérique. Chaque fois que c'est possible, exportez directement en PDF depuis Word, Excel ou votre logiciel de facturation : le texte est conservé et la question ne se pose plus.
Pour le reste — courriers reçus, archives, documents signés — installez une chaîne qui tient : numérisation à 300 dpi, reconnaissance de caractères dans la foulée, PDF consultable rangé au bon endroit. PowerToys Text Extractor traite les urgences, un éditeur PDF s'occupe du volume. Nos utilitaires PC regroupent les logiciels qui font ce travail sans abonnement.
Les manipulations décrites plus haut sont plus rapides avec le bon logiciel — et il coûte le prix d'un dîner.
Voir Ashampoo PDF Pro → Licence livrée par e-mail · support en français · paiement sécuriséQuestions fréquentes
Pourquoi le texte d'un PDF scanné n'est-il pas sélectionnable ?
Parce que ce n'est pas du texte : c'est une photographie de la page. Le scanner a enregistré une image, sans jamais interpréter les lettres qu'elle contient.
Qu'est-ce que l'OCR exactement ?
La reconnaissance optique de caractères : un traitement qui analyse l'image, identifie les lettres et ajoute une couche de texte invisible par-dessus. Le document devient alors sélectionnable et consultable par recherche.
La reconnaissance est-elle fiable ?
Elle dépend entièrement de la qualité du scan. Un document net et droit donne un excellent résultat. Une photo prise de travers, un fax ou une écriture manuscrite produisent des erreurs qu'il faut relire.
Peut-on faire de l'OCR gratuitement ?
Oui, avec des limites de volume ou de taille selon les outils. Pour traiter des documents régulièrement, ou des pièces que vous ne souhaitez pas envoyer sur un service en ligne, un logiciel installé sur le poste est plus adapté.

