Um PDF com cara de imagem que se lê como texto
Colocar uma foto num PDF, por si só, gera apenas a imagem de algumas palavras. Dá para olhar, mas não dá para pesquisar, selecionar uma frase ou copiar um número de conta. Um PDF pesquisável mantém a imagem em cada página e acrescenta o texto reconhecido como uma camada invisível, alinhada com ela. A página continua mostrando sua imagem; é o texto por baixo que permite a busca.
Se você só queria colocar alguns JPGs num PDF, a ferramenta faz isso também. A camada de texto vem junto, sem nenhum trabalho extra.
Para que serve a camada de texto oculta
- Encontrar as coisas. Pressione Ctrl+F (ou ⌘F) no leitor de PDF e vá direto a um nome, uma data ou um número de referência, em vez de rolar por páginas e páginas de digitalizações.
- Copiar. Selecione um parágrafo, um endereço ou um número de pedido e cole em outro lugar sem digitar de novo.
- Arquivar papéis. Cartas, contratos, manuais e registros digitalizados ficam mais fáceis de encontrar depois, já que as ferramentas de busca que indexam o texto de PDFs conseguem ver o que tem dentro deles.
- Acessibilidade básica. Leitores de tela e ferramentas de leitura em voz alta precisam de texto de verdade para funcionar, e um PDF só de imagens não oferece nada. Uma camada de texto é um primeiro passo útil, embora não seja o mesmo que um PDF totalmente acessível, com títulos marcados e uma ordem de leitura definida.
Como transformar uma pilha de imagens em um só PDF
Adicione todas as imagens de uma vez, sejam fotos de celular de uma carta com várias páginas, uma pasta de digitalizações ou um conjunto de prints. Cada imagem vira uma página. Arraste as páginas para a ordem certa, remova as que não precisar e leia a página de novo se o resultado não ficar bom.
A visualização Documento inteiro mostra todas as páginas juntas, na sua ordem, com busca em todas elas, e exporta um único PDF. Um TIFF com várias páginas traz todas elas, então o que sai do scanner nesse formato funciona direto. Um espaço de trabalho comporta até 50 imagens, e cada arquivo pode ter até 25 MB.
PDF pesquisável ou PDF só com texto
Há dois downloads em PDF, e cada um tem uma função:
- PDF pesquisável mantém a aparência original. Assinaturas, carimbos, anotações na margem, logotipos e fotos continuam como estavam. Escolha esse para registros, formulários, recibos e tudo em que a aparência importa.
- PDF contém só o texto reconhecido, sem a imagem. É prático quando só as palavras importam, por exemplo para imprimir ou compartilhar uma cópia limpa. Como o original não está ali para comparação, qualquer palavra lida errado é exatamente o que o leitor vai ver, então confira o texto antes.
Se você precisa mudar o texto, e não só pesquisá-lo, imagem para Word entrega um .docx editável.
Como conseguir uma camada de texto melhor
A camada de texto é tão boa quanto o reconhecimento por trás dela. Como as palavras são invisíveis, um erro não aparece na página, mas impede que a busca encontre o termo. Quem procurar por “Henderson” não vai achar uma página em que o nome foi lido como “Hendersen”.
Páginas impressas nítidas costumam ser lidas com muita precisão, e alguns hábitos ajudam no resto:
- Recorte as bordas da mesa, os dedos e as páginas vizinhas.
- Endireite as páginas fotografadas em ângulo para que as linhas fiquem retas.
- Deixe a Melhoria automática ligada para uniformizar sombras e reforçar o contraste, e confira a lista de ajustes que ela fez.
- Escolha o idioma certo, ou vários, se a página não estiver em inglês.
Há mais dicas em como obter resultados de OCR precisos. Se você está começando com um PDF digitalizado e só quer as palavras, PDF para texto é o caminho mais rápido.