Un PDF che si vede come l’immagine ma si legge come testo
Mettere semplicemente una foto in un PDF ti dà un’immagine di parole. Puoi guardarla, ma non puoi cercarci dentro, selezionare una frase o copiarne un numero di conto. Un PDF ricercabile mantiene l’immagine su ogni pagina e aggiunge il testo riconosciuto come livello invisibile, allineato all’immagine. La pagina mostra ancora la tua immagine; il testo sottostante è ciò che la rende ricercabile.
Se volevi solo mettere qualche JPG in un PDF, fa anche questo. Il livello di testo arriva senza alcun lavoro in più.
A cosa serve il livello di testo nascosto
- Trovare le cose. Premi Ctrl+F (o ⌘F) nel tuo lettore PDF e salta direttamente a un nome, una data o un numero di riferimento invece di scorrere pagine e pagine di scansioni.
- Copiare. Seleziona un paragrafo, un indirizzo o un numero d’ordine e incollalo altrove senza ribatterlo.
- Archiviare la carta. Lettere, contratti, manuali e documenti scansionati sono più facili da ritrovare in seguito, perché gli strumenti di ricerca che indicizzano il testo dei PDF possono vedere cosa contengono.
- Accessibilità di base. Gli screen reader e gli strumenti di lettura ad alta voce hanno bisogno di testo vero, e un PDF fatto solo di immagini non dà loro nulla. Un livello di testo è un primo passo utile, anche se non equivale a un PDF pienamente accessibile, con titoli taggati e un ordine di lettura definito.
Trasformare una pila di immagini in un unico PDF
Aggiungi tutte le immagini in una volta, che siano foto di una lettera di più pagine scattate con il telefono, una cartella di scansioni o una serie di screenshot. Ogni immagine diventa una pagina. Trascina le pagine nell’ordine giusto, rimuovi quelle che non ti servono e rileggi una pagina se il risultato non è buono.
La vista Documento intero mostra tutte le pagine insieme, nel tuo ordine, con la ricerca in tutte, ed esporta un unico PDF. Un TIFF multipagina porta dentro ogni pagina, quindi i file prodotti dagli scanner in quel formato funzionano direttamente. Uno spazio di lavoro contiene fino a 50 immagini, e ogni file può arrivare a 25 MB.
PDF ricercabile o PDF di solo testo
Ci sono due download in PDF, e fanno cose diverse:
- PDF ricercabile mantiene l’aspetto originale. Firme, timbri, note a margine, loghi e foto restano com’erano. Sceglilo per documenti da archiviare, moduli, scontrini e tutto ciò in cui l’aspetto conta.
- PDF contiene solo il testo riconosciuto, senza l’immagine. È comodo quando contano solo le parole, ad esempio per stampare o condividere una copia pulita. Visto che l’originale non c’è per fare il confronto, ogni parola letta male è esattamente ciò che vedrà chi legge, quindi controlla prima il testo.
Se devi cambiare il testo e non solo cercarlo, immagine in Word ti dà invece un .docx modificabile.
Ottenere un livello di testo migliore
Il livello di testo è buono quanto il riconoscimento che c’è dietro. Siccome le parole sono invisibili, un errore non si vede sulla pagina, ma impedisce alla ricerca di trovare la corrispondenza. Chi cerca «Henderson» non troverà una pagina in cui il nome è stato letto come «Hendersen».
Le pagine stampate e chiare di solito vengono lette con grande precisione, e qualche abitudine aiuta con il resto:
- Ritaglia i bordi della scrivania, le dita e le pagine vicine.
- Raddrizza le pagine fotografate di sbieco, così le righe tornano orizzontali.
- Lascia attivo il Miglioramento automatico per uniformare le ombre e aumentare il contrasto, e controlla l’elenco dei passaggi che ha fatto.
- Scegli la lingua giusta, o più di una, se la pagina non è in inglese o nella lingua del tuo browser.
Trovi altri consigli in come ottenere risultati OCR precisi. Se parti da un PDF scansionato e vuoi solo estrarne le parole, PDF in testo è la strada più rapida.