PDF en texte

Déposez un PDF et récupérez le texte de toutes ses pages. Les pages qui contiennent déjà du texte sont reprises telles quelles, et les pages scannées sont lues par OCR, le tout sur votre propre appareil.

Drop images here, or paste with Ctrl V

JPG, PNG, WebP, HEIC, GIF, BMP, TIFF or PDF, up to 25 MB each. Add up to 50 at once.

Read on your device. Your images aren't uploaded. How this works

No image to hand? Try a sample:

Mode d'emploi

  1. Glissez votre PDF sur la page ou ouvrez-le avec Ctrl+O (⌘O sur Mac) : toutes les pages sont ajoutées dans l'ordre.
  2. Laissez Image to Text App lire les pages scannées une par une ; la progression indique quelle page est en cours de lecture.
  3. Ouvrez la vue Document complet pour lire et rechercher dans toutes les pages à la fois, et corrigez les mots à vérifier.
  4. Téléchargez le tout en un seul fichier Word ou en PDF interrogeable, ou en ZIP de fichiers séparés.

Extraire le texte d’un PDF peut recouvrir deux tâches bien différentes, selon la façon dont le PDF a été créé. Image to Text App gère les deux, et décide page par page : vous n’avez pas besoin de le savoir à l’avance.

PDF numériques et PDF scannés

Un PDF numérique a été créé par un logiciel : exporté depuis Word, enregistré depuis une page web ou généré par un logiciel de facturation. Ses pages contiennent du vrai texte, et vous pouvez généralement sélectionner des mots dans une visionneuse PDF. Quand Image to Text App trouve une page de ce type, il reprend le texte directement, sans OCR. Résultat : aucune erreur de reconnaissance, et c’est rapide.

Un PDF scanné est un ensemble d’images de pages papier, issues d’un scanner de bureau, d’une appli de numérisation sur téléphone ou d’un fax converti en fichier. Il ne contient pas de texte, seulement des images qui ressemblent à du texte. Image to Text App lit ces pages par OCR, l’une après l’autre, et la progression indique où il en est.

Beaucoup de PDF mélangent les deux : un contrat dont la dernière page, signée, a été scannée, ou un rapport avec quelques annexes scannées. Comme chaque page est examinée séparément, les pages numériques sont reprises à l’identique et seules les pages scannées passent par l’OCR.

Un piège : certains PDF numériques ont une couche de texte défectueuse. Vous pouvez sélectionner le texte, mais en le copiant vous obtenez du charabia ou des lettres manquantes, généralement à cause de la façon dont les polices ont été intégrées. Comme ce texte est repris tel quel, le résultat présentera le même problème. La solution consiste à faire une capture d’écran de la page et à la coller ici, pour qu’elle soit lue comme une image.

Obtenir un bon texte à partir de pages scannées

La qualité du scan détermine l’essentiel du résultat. Si vous scannez le papier vous-même :

  • Scannez à une résolution adaptée aux documents. 300 dpi est un choix courant pour le texte, et des réglages bien plus bas rendent les petits caractères difficiles à lire.
  • Choisissez les niveaux de gris ou le noir et blanc pour les documents texte simples. La couleur alourdit le fichier sans améliorer la reconnaissance.
  • Posez les pages bien à plat et droites. L’Amélioration auto corrige une légère inclinaison, et vous pouvez faire pivoter une page passée à l’envers.

Les vieilles photocopies et les fax présentent souvent des taches et des traits pâlis. Réduire le bruit aide contre les taches, et augmenter le contraste aide pour le texte pâle. Chaque page peut être ajustée et relue séparément sans toucher aux autres.

Travailler avec de longs documents

Chaque page du PDF apparaît comme une page distincte dans l’espace de travail. Vous pouvez réordonner les pages, en relire une, la supprimer, ou la copier et la télécharger seule.

La vue Document complet réunit toutes les pages dans l’ordre, avec une recherche dans l’ensemble. Cliquez sur une ligne de texte et son emplacement s’illumine sur l’image de la page : c’est le moyen le plus rapide de vérifier un chiffre ou un nom.

Le mode Document réunit les lignes en paragraphes et conserve les titres et les listes. Il existe aussi des options pour joindre les lignes coupées et recoller les mots coupés par un trait d’union en fin de ligne, très fréquents dans les livres et rapports scannés. Les en-têtes, pieds de page et numéros de page apparaîtront sur chaque page ; « Rechercher et remplacer » permet de les supprimer rapidement.

Choisir un format de sortie

  • Word (.docx) est le format par défaut ici, prêt à être modifié. Voir image en Word pour en savoir plus sur les documents modifiables.
  • Le PDF interrogeable garde le scan exactement tel qu’il était et ajoute une couche de texte invisible et sélectionnable. C’est le bon choix pour l’archivage : le fichier ressemble toujours à l’original, mais vous pouvez y faire des recherches avec Ctrl+F dans n’importe quel lecteur PDF.
  • TXT, Markdown, HTML et JSON sont aussi disponibles, en un fichier combiné ou en ZIP de fichiers séparés.

Si le PDF contient un tableau dont vous avez besoin dans un tableur, passez cette page en mode Tableau et consultez image en Excel.

Les limites à connaître

Les scans imprimés nets sont généralement lus avec une grande précision. Les annotations manuscrites dans les marges, les formulaires remplis et les signatures sont bien plus difficiles. Les tampons et filigranes posés sur le texte provoquent des erreurs, et les mises en page sur plusieurs colonnes peuvent demander un peu de nettoyage là où les colonnes se rejoignent. Les équations simples imprimées peuvent être lues en mode Maths, mais tout ce qui est complexe demande généralement des corrections à la main.

Pour en savoir plus sur la qualité des scans et ce à quoi vous attendre, lisez comment extraire le texte de documents scannés.

Questions fréquentes

Est-ce que ça marche avec les PDF scannés ?

Oui. Les pages scannées sont des images : chacune est donc lue par OCR, page par page. Les pages qui contiennent déjà du texte sélectionnable sont reprises directement.

Comment savoir si mon PDF est scanné ou numérique ?

Ouvrez-le dans n'importe quelle visionneuse PDF et essayez de sélectionner un seul mot. S'il se surligne, la page contient du vrai texte ; si vous ne pouvez que tracer un cadre sur une image, elle est scannée.

Le texte d'un PDF numérique passe-t-il par l'OCR ?

Non. Si une page contient déjà du texte sélectionnable, Image to Text App reprend directement ce texte : il n'est donc pas touché par les erreurs de reconnaissance.

Puis-je rendre un PDF scanné consultable par recherche ?

Oui. Téléchargez le résultat en PDF interrogeable. Il conserve l'image d'origine de chaque page et ajoute une couche de texte invisible, pour rechercher, sélectionner et copier du texte dans n'importe quel lecteur PDF.

Puis-je obtenir un seul document Word à partir d'un long PDF ?

Oui. La vue Document complet réunit toutes les pages dans l'ordre et les exporte en un seul fichier. Vous pouvez aussi télécharger un ZIP de fichiers séparés.

Quelle taille de PDF puis-je utiliser ?

Chaque fichier peut peser jusqu'à 25 Mo. Si un scan est plus lourd, découpez-le en plusieurs parties dans un outil PDF et ajoutez-les dans l'ordre.

Mon PDF est-il envoyé sur un serveur ?

Non. Les pages sont lues dans votre navigateur, sur votre appareil. C'est important pour les contrats, les relevés et les autres documents que vous préférez n'envoyer nulle part.