Tirar o texto de um PDF pode significar duas tarefas bem diferentes, dependendo de como o PDF foi criado. O Image to Text App cuida das duas e decide página por página, então você não precisa saber de antemão.
PDFs digitais e PDFs digitalizados
Um PDF digital foi criado por um programa: exportado do Word, salvo a partir de uma página da web ou gerado por um sistema de cobrança. As páginas contêm texto de verdade, e normalmente dá para selecionar as palavras num leitor de PDF. Quando o Image to Text App encontra uma página assim, ele aproveita o texto diretamente, sem OCR. Isso significa nenhum erro de reconhecimento, e é rápido.
Um PDF digitalizado é um conjunto de imagens de páginas de papel, vindas de um scanner de escritório, de um aplicativo de digitalização no celular ou de um fax transformado em arquivo. Não há texto dentro dele, só imagens que parecem texto. O Image to Text App lê essas páginas com OCR, uma depois da outra, e o progresso mostra até onde já chegou.
Muitos PDFs misturam os dois: um contrato com a última página assinada e digitalizada, ou um relatório com alguns anexos digitalizados. Como cada página é verificada separadamente, as páginas digitais saem exatamente como são e só as digitalizadas são lidas com OCR.
Um porém: alguns PDFs digitais têm a camada de texto corrompida. Você consegue selecionar o texto, mas ao copiar recebe caracteres sem sentido ou letras faltando, geralmente por causa da forma como as fontes foram incorporadas. Como esse texto é aproveitado do jeito que está, o resultado vai mostrar o mesmo problema. A saída é tirar um print da página e colar aqui, para que ela seja lida como imagem.
Como extrair um bom texto de páginas digitalizadas
A qualidade da digitalização decide a maior parte do resultado. Se você mesmo vai digitalizar o papel:
- Digitalize numa resolução própria para documentos. 300 dpi é uma escolha comum para texto, e configurações bem mais baixas deixam letras pequenas difíceis de ler.
- Escolha tons de cinza ou preto e branco para documentos só com texto. A cor aumenta o tamanho do arquivo sem ajudar no reconhecimento.
- Coloque as páginas planas e retas. A Melhoria automática corrige uma leve inclinação, e você pode girar uma página que entrou de cabeça para baixo.
Fotocópias antigas e faxes costumam ter pontinhos e traços apagados. Reduzir ruído ajuda com os pontinhos, e aumentar o contraste ajuda com o texto fraco. Cada página pode ser ajustada e lida de novo separadamente, sem mexer no resto.
Trabalhando com documentos longos
Cada página do PDF aparece como uma página própria no espaço de trabalho. Você pode reordenar as páginas, ler uma de novo, remover, ou copiar e baixar uma página sozinha.
A visualização Documento inteiro junta todas as páginas em ordem, com busca em todas elas. Clique numa linha do texto e o lugar dela se destaca na imagem da página, que é o jeito mais rápido de conferir um valor ou um nome.
O modo Documento junta as linhas em parágrafos e mantém títulos e listas. Também há opções para unir linhas quebradas e para juntar de novo palavras separadas por hífen no fim da linha, algo que livros e relatórios digitalizados têm de sobra. Cabeçalhos, rodapés e números de página vão aparecer em todas as páginas; o recurso de localizar e substituir permite removê-los rapidinho.
Escolhendo o formato de saída
- Word (.docx) é o padrão aqui, pronto para editar. Veja imagem para Word para saber mais sobre documentos editáveis.
- PDF pesquisável mantém a digitalização exatamente com a mesma aparência e acrescenta uma camada de texto invisível e selecionável. É a escolha certa para arquivar: o arquivo continua parecendo o original, mas você pode pesquisar nele com Ctrl+F em qualquer leitor de PDF.
- TXT, Markdown, HTML e JSON também estão disponíveis, como um único arquivo combinado ou um ZIP com arquivos separados.
Se o PDF tiver uma tabela que você precisa numa planilha, mude essa página para o modo Tabela e veja imagem para Excel.
Limites que vale conhecer
Digitalizações nítidas de texto impresso costumam ser lidas com muita precisão. Anotações à mão nas margens, formulários preenchidos e assinaturas são bem mais difíceis. Carimbos e marcas d’água sobre o texto causam erros, e layouts com várias colunas podem precisar de alguns ajustes onde as colunas se encontram. Equações impressas simples podem ser lidas no modo Matemática, mas qualquer coisa complexa geralmente precisa ser corrigida à mão.
Para saber mais sobre a qualidade da digitalização e o que esperar, leia como extrair texto de documentos digitalizados.