Un PDF qui ressemble à l’image mais se lit comme du texte
Placer une photo seule dans un PDF vous donne une image de mots. Vous pouvez la regarder, mais pas la rechercher, ni sélectionner une phrase, ni en copier un numéro de compte. Un PDF interrogeable conserve l’image sur chaque page et y ajoute le texte reconnu sous forme de couche invisible, alignée dessus. La page montre toujours votre image ; c’est le texte en dessous qui la rend consultable par recherche.
Si vous vouliez simplement mettre quelques JPG dans un PDF, l’outil le fait aussi. La couche de texte vient en prime, sans travail supplémentaire.
À quoi sert la couche de texte cachée
- Retrouver une information. Appuyez sur Ctrl+F (ou ⌘F) dans votre lecteur PDF et allez directement à un nom, une date ou un numéro de référence, au lieu de faire défiler des pages de scans.
- Copier. Sélectionnez un paragraphe, une adresse ou un numéro de commande et collez-le ailleurs sans le retaper.
- Archiver le papier. Les lettres, contrats, notices et dossiers scannés sont plus faciles à retrouver ensuite, car les outils de recherche qui indexent le texte des PDF voient leur contenu.
- Les bases de l’accessibilité. Les lecteurs d’écran et les outils de lecture à voix haute ont besoin de vrai texte, et un PDF composé uniquement d’images ne leur donne rien. Une couche de texte est un premier pas utile, même si ce n’est pas l’équivalent d’un PDF entièrement accessible, avec des titres balisés et un ordre de lecture défini.
Transformer une pile d’images en un seul PDF
Ajoutez toutes les images d’un coup, qu’il s’agisse de photos d’une lettre de plusieurs pages prises au téléphone, d’un dossier de scans ou d’une série de captures d’écran. Chaque image devient une page. Faites glisser les pages dans le bon ordre, supprimez celles dont vous n’avez pas besoin, et relancez la lecture d’une page si le résultat est médiocre.
La vue Document complet affiche toutes les pages ensemble, dans votre ordre, avec une recherche dans l’ensemble, et exporte un seul PDF. Un TIFF multipage importe toutes ses pages, ce qui permet d’utiliser directement les fichiers de scanner dans ce format. Un espace de travail contient jusqu’à 50 images, et chaque fichier peut peser jusqu’à 25 Mo.
PDF interrogeable ou PDF texte seul
Il existe deux téléchargements PDF, qui ne servent pas à la même chose :
- Le PDF interrogeable conserve l’aspect d’origine. Signatures, tampons, annotations en marge, logos et photos restent tels quels. Choisissez-le pour les archives, les formulaires, les tickets de caisse et tout ce dont l’apparence compte.
- Le PDF contient uniquement le texte reconnu, sans l’image. Pratique quand seuls les mots comptent, par exemple pour imprimer ou partager une copie propre. Comme l’original n’est pas là pour comparer, un mot mal lu est exactement ce que verra le lecteur : vérifiez donc le texte d’abord.
Si vous devez modifier la formulation et pas seulement faire des recherches, image en Word vous donne plutôt un .docx modifiable.
Obtenir une meilleure couche de texte
La couche de texte ne vaut que ce que vaut la reconnaissance qui la produit. Comme les mots sont invisibles, une erreur ne se verra pas sur la page, mais elle empêchera une recherche d’aboutir. Quelqu’un qui cherche « Henderson » ne trouvera pas une page où le nom a été lu « Hendersen ».
Les pages imprimées nettes sont généralement lues avec une grande précision, et quelques habitudes aident pour le reste :
- Recadrez pour éliminer les bords du bureau, les doigts et les pages voisines.
- Redressez les pages photographiées en biais pour que les lignes soient horizontales.
- Laissez l’Amélioration auto activée pour atténuer les ombres et renforcer le contraste, et consultez la liste des étapes effectuées.
- Choisissez la bonne langue, ou plusieurs, si la page n’est pas en anglais.
Pour aller plus loin, lisez comment obtenir des résultats d’OCR précis. Si vous partez d’un PDF scanné et voulez seulement en extraire les mots, PDF en texte est la voie la plus rapide.