Extraire le texte d’un PDF peut recouvrir deux tâches bien différentes, selon la façon dont le PDF a été créé. Image to Text App gère les deux, et décide page par page : vous n’avez pas besoin de le savoir à l’avance.
PDF numériques et PDF scannés
Un PDF numérique a été créé par un logiciel : exporté depuis Word, enregistré depuis une page web ou généré par un logiciel de facturation. Ses pages contiennent du vrai texte, et vous pouvez généralement sélectionner des mots dans une visionneuse PDF. Quand Image to Text App trouve une page de ce type, il reprend le texte directement, sans OCR. Résultat : aucune erreur de reconnaissance, et c’est rapide.
Un PDF scanné est un ensemble d’images de pages papier, issues d’un scanner de bureau, d’une appli de numérisation sur téléphone ou d’un fax converti en fichier. Il ne contient pas de texte, seulement des images qui ressemblent à du texte. Image to Text App lit ces pages par OCR, l’une après l’autre, et la progression indique où il en est.
Beaucoup de PDF mélangent les deux : un contrat dont la dernière page, signée, a été scannée, ou un rapport avec quelques annexes scannées. Comme chaque page est examinée séparément, les pages numériques sont reprises à l’identique et seules les pages scannées passent par l’OCR.
Un piège : certains PDF numériques ont une couche de texte défectueuse. Vous pouvez sélectionner le texte, mais en le copiant vous obtenez du charabia ou des lettres manquantes, généralement à cause de la façon dont les polices ont été intégrées. Comme ce texte est repris tel quel, le résultat présentera le même problème. La solution consiste à faire une capture d’écran de la page et à la coller ici, pour qu’elle soit lue comme une image.
Obtenir un bon texte à partir de pages scannées
La qualité du scan détermine l’essentiel du résultat. Si vous scannez le papier vous-même :
- Scannez à une résolution adaptée aux documents. 300 dpi est un choix courant pour le texte, et des réglages bien plus bas rendent les petits caractères difficiles à lire.
- Choisissez les niveaux de gris ou le noir et blanc pour les documents texte simples. La couleur alourdit le fichier sans améliorer la reconnaissance.
- Posez les pages bien à plat et droites. L’Amélioration auto corrige une légère inclinaison, et vous pouvez faire pivoter une page passée à l’envers.
Les vieilles photocopies et les fax présentent souvent des taches et des traits pâlis. Réduire le bruit aide contre les taches, et augmenter le contraste aide pour le texte pâle. Chaque page peut être ajustée et relue séparément sans toucher aux autres.
Travailler avec de longs documents
Chaque page du PDF apparaît comme une page distincte dans l’espace de travail. Vous pouvez réordonner les pages, en relire une, la supprimer, ou la copier et la télécharger seule.
La vue Document complet réunit toutes les pages dans l’ordre, avec une recherche dans l’ensemble. Cliquez sur une ligne de texte et son emplacement s’illumine sur l’image de la page : c’est le moyen le plus rapide de vérifier un chiffre ou un nom.
Le mode Document réunit les lignes en paragraphes et conserve les titres et les listes. Il existe aussi des options pour joindre les lignes coupées et recoller les mots coupés par un trait d’union en fin de ligne, très fréquents dans les livres et rapports scannés. Les en-têtes, pieds de page et numéros de page apparaîtront sur chaque page ; « Rechercher et remplacer » permet de les supprimer rapidement.
Choisir un format de sortie
- Word (.docx) est le format par défaut ici, prêt à être modifié. Voir image en Word pour en savoir plus sur les documents modifiables.
- Le PDF interrogeable garde le scan exactement tel qu’il était et ajoute une couche de texte invisible et sélectionnable. C’est le bon choix pour l’archivage : le fichier ressemble toujours à l’original, mais vous pouvez y faire des recherches avec Ctrl+F dans n’importe quel lecteur PDF.
- TXT, Markdown, HTML et JSON sont aussi disponibles, en un fichier combiné ou en ZIP de fichiers séparés.
Si le PDF contient un tableau dont vous avez besoin dans un tableur, passez cette page en mode Tableau et consultez image en Excel.
Les limites à connaître
Les scans imprimés nets sont généralement lus avec une grande précision. Les annotations manuscrites dans les marges, les formulaires remplis et les signatures sont bien plus difficiles. Les tampons et filigranes posés sur le texte provoquent des erreurs, et les mises en page sur plusieurs colonnes peuvent demander un peu de nettoyage là où les colonnes se rejoignent. Les équations simples imprimées peuvent être lues en mode Maths, mais tout ce qui est complexe demande généralement des corrections à la main.
Pour en savoir plus sur la qualité des scans et ce à quoi vous attendre, lisez comment extraire le texte de documents scannés.