PDF in testo

Trascina un PDF e ottieni il testo di ogni pagina. Le pagine che contengono già testo vengono prese così come sono, quelle scansionate vengono lette con l'OCR, tutto sul tuo dispositivo.

Drop images here, or paste with Ctrl V

JPG, PNG, WebP, HEIC, GIF, BMP, TIFF or PDF, up to 25 MB each. Add up to 50 at once.

Read on your device. Your images aren't uploaded. How this works

No image to hand? Try a sample:

Come si usa

  1. Trascina il PDF sulla pagina o aprilo con Ctrl+O (⌘O su Mac): ogni pagina viene aggiunta nel suo ordine.
  2. Lascia che Image to Text App elabori le pagine scansionate una alla volta; l'avanzamento mostra quale pagina sta leggendo.
  3. Apri la vista Documento intero per leggere e cercare in tutte le pagine insieme e correggere le parole da controllare.
  4. Scarica tutto come un unico file Word o un PDF ricercabile, oppure come ZIP di file separati.

Estrarre il testo da un PDF può voler dire due lavori molto diversi, a seconda di come è stato creato il PDF. Image to Text App li gestisce entrambi e decide pagina per pagina, quindi non devi saperlo in anticipo.

PDF digitali e PDF scansionati

Un PDF digitale è stato creato da un software: esportato da Word, salvato da una pagina web o generato da un sistema di fatturazione. Le sue pagine contengono testo vero, e di solito puoi selezionare le parole in un lettore PDF. Quando Image to Text App trova una pagina così, prende il testo direttamente, senza OCR. Niente errori di riconoscimento, e in più è veloce.

Un PDF scansionato è una serie di immagini di pagine di carta, prodotte da uno scanner d’ufficio, da un’app di scansione sul telefono o da un fax trasformato in file. Dentro non c’è testo, solo immagini che sembrano testo. Image to Text App legge queste pagine con l’OCR, una dopo l’altra, e l’avanzamento mostra a che punto è arrivato.

Molti PDF sono un misto dei due: un contratto con l’ultima pagina firmata e scansionata, o un report con qualche allegato scansionato. Poiché ogni pagina viene controllata separatamente, le pagine digitali arrivano esatte e solo quelle scansionate vengono lette con l’OCR.

Un’avvertenza: alcuni PDF digitali hanno un livello di testo danneggiato. Puoi selezionare il testo, ma quando lo copi ottieni caratteri senza senso o lettere mancanti, di solito per il modo in cui sono stati incorporati i font. Visto che quel testo viene preso così com’è, il risultato avrà lo stesso problema. La soluzione è fare uno screenshot della pagina e incollarlo qui, così viene letto come immagine.

Ottenere un buon testo dalle pagine scansionate

La qualità della scansione determina gran parte del risultato. Se scansioni tu i fogli:

  • Scansiona a una risoluzione pensata per i documenti. 300 dpi è una scelta comune per il testo, e impostazioni molto più basse rendono difficile leggere i caratteri piccoli.
  • Scegli scala di grigi o bianco e nero per i documenti di solo testo. Il colore aumenta le dimensioni del file senza aiutare il riconoscimento.
  • Appoggia le pagine piatte e dritte. Il Miglioramento automatico corregge una leggera inclinazione, e puoi ruotare una pagina finita al contrario.

Le vecchie fotocopie e i fax hanno spesso puntini e tratti sbiaditi. Riduci rumore aiuta con i puntini, e aumentare il contrasto aiuta con il testo debole. Ogni pagina può essere regolata e riletta da sola, senza toccare le altre.

Lavorare con documenti lunghi

Ogni pagina del PDF compare come pagina a sé nello spazio di lavoro. Puoi riordinare le pagine, rileggerne una, rimuoverla, oppure copiarla e scaricarla da sola.

La vista Documento intero mette insieme tutte le pagine in ordine, con la ricerca in tutte. Fai clic su una riga di testo e il punto corrispondente si illumina sull’immagine della pagina: è il modo più rapido per verificare una cifra o un nome.

La modalità Documento unisce le righe in paragrafi e mantiene titoli ed elenchi. Ci sono anche opzioni per unire le righe spezzate e per riunire le parole divise da un trattino a fine riga, di cui libri e report scansionati sono pieni. Intestazioni, piè di pagina e numeri di pagina compariranno su ogni pagina; con Trova e sostituisci li elimini in fretta.

Scegliere il formato di uscita

  • Word (.docx) è il formato predefinito qui, pronto da modificare. Vedi immagine in Word per saperne di più sui documenti modificabili.
  • PDF ricercabile mantiene la scansione esattamente com’era e aggiunge un livello di testo invisibile e selezionabile. È la scelta giusta per archiviare: il file ha ancora l’aspetto dell’originale, ma puoi cercarci dentro con Ctrl+F in qualsiasi lettore PDF.
  • TXT, Markdown, HTML e JSON sono disponibili anche loro, come unico file combinato o come ZIP di file separati.

Se il PDF contiene una tabella che ti serve in un foglio di calcolo, passa quella pagina alla modalità Tabella e vedi immagine in Excel.

Limiti da conoscere

Le scansioni stampate e chiare di solito vengono lette con grande precisione. Note scritte a mano a margine, moduli compilati e firme sono molto più difficili. Timbri e filigrane sopra il testo causano errori, e i layout a più colonne possono richiedere qualche ritocco dove le colonne si incontrano. Le equazioni stampate semplici si possono leggere in modalità Matematica, ma quelle complesse di solito vanno corrette a mano.

Per saperne di più sulla qualità della scansione e su cosa aspettarti, leggi come estrarre il testo da documenti scansionati.

Domande frequenti

Funziona con i PDF scansionati?

Sì. Le pagine scansionate sono immagini, quindi ognuna viene letta con l'OCR, pagina per pagina. Le pagine che contengono già testo selezionabile vengono invece prese direttamente.

Come faccio a capire se il mio PDF è scansionato o digitale?

Aprilo con un qualsiasi lettore PDF e prova a selezionare una sola parola. Se si evidenzia, la pagina contiene testo vero; se riesci solo a tracciare un riquadro sopra un'immagine, è scansionata.

Il testo di un PDF digitale passa dall'OCR?

No. Se una pagina contiene già testo selezionabile, Image to Text App lo prende direttamente, quindi non risente degli errori di riconoscimento.

Posso rendere ricercabile un PDF scansionato?

Sì. Scarica il risultato come PDF ricercabile. Mantiene l'immagine originale di ogni pagina e aggiunge un livello di testo invisibile, così puoi cercare, selezionare e copiare il testo con qualsiasi lettore PDF.

Posso ottenere un unico documento Word da un PDF lungo?

Sì. La vista Documento intero combina tutte le pagine nel loro ordine e le esporta in un unico file. In alternativa puoi scaricare uno ZIP di file separati.

Quanto può essere grande il PDF?

Ogni file può arrivare a 25 MB. Se una scansione è più grande, dividila in parti con un programma per PDF e aggiungi le parti in ordine.

Il mio PDF viene caricato?

No. Le pagine vengono lette nel tuo browser, sul tuo dispositivo. Una differenza importante per contratti, estratti conto e altri documenti che preferiresti non inviare a nessuno.