PDF para texto

Solte um PDF e receba o texto de todas as páginas. Páginas que já contêm texto são aproveitadas como estão, e as digitalizadas são lidas com OCR, tudo no seu próprio dispositivo.

Solte imagens aqui ou cole com Ctrl V

JPG, PNG, WebP, HEIC, GIF, BMP, TIFF ou PDF, com até 25 MB cada. Adicione até 50 de uma vez.

A leitura é feita no seu dispositivo. Suas imagens não são enviadas. Como funciona

Está sem uma imagem à mão? Experimente um exemplo:

Como usar

  1. Arraste seu PDF para a página ou abra com Ctrl+O (⌘O no Mac), e todas as páginas são adicionadas em ordem.
  2. Deixe o Image to Text App ler as páginas digitalizadas uma de cada vez, com o progresso mostrando qual página está sendo lida.
  3. Abra a visualização Documento inteiro para ler e pesquisar todas as páginas juntas e corrigir as palavras a conferir.
  4. Baixe tudo como um único arquivo Word ou um PDF pesquisável, ou como um ZIP com arquivos separados.

Tirar o texto de um PDF pode significar duas tarefas bem diferentes, dependendo de como o PDF foi criado. O Image to Text App cuida das duas e decide página por página, então você não precisa saber de antemão.

PDFs digitais e PDFs digitalizados

Um PDF digital foi criado por um programa: exportado do Word, salvo a partir de uma página da web ou gerado por um sistema de cobrança. As páginas contêm texto de verdade, e normalmente dá para selecionar as palavras num leitor de PDF. Quando o Image to Text App encontra uma página assim, ele aproveita o texto diretamente, sem OCR. Isso significa nenhum erro de reconhecimento, e é rápido.

Um PDF digitalizado é um conjunto de imagens de páginas de papel, vindas de um scanner de escritório, de um aplicativo de digitalização no celular ou de um fax transformado em arquivo. Não há texto dentro dele, só imagens que parecem texto. O Image to Text App lê essas páginas com OCR, uma depois da outra, e o progresso mostra até onde já chegou.

Muitos PDFs misturam os dois: um contrato com a última página assinada e digitalizada, ou um relatório com alguns anexos digitalizados. Como cada página é verificada separadamente, as páginas digitais saem exatamente como são e só as digitalizadas são lidas com OCR.

Um porém: alguns PDFs digitais têm a camada de texto corrompida. Você consegue selecionar o texto, mas ao copiar recebe caracteres sem sentido ou letras faltando, geralmente por causa da forma como as fontes foram incorporadas. Como esse texto é aproveitado do jeito que está, o resultado vai mostrar o mesmo problema. A saída é tirar um print da página e colar aqui, para que ela seja lida como imagem.

Como extrair um bom texto de páginas digitalizadas

A qualidade da digitalização decide a maior parte do resultado. Se você mesmo vai digitalizar o papel:

  • Digitalize numa resolução própria para documentos. 300 dpi é uma escolha comum para texto, e configurações bem mais baixas deixam letras pequenas difíceis de ler.
  • Escolha tons de cinza ou preto e branco para documentos só com texto. A cor aumenta o tamanho do arquivo sem ajudar no reconhecimento.
  • Coloque as páginas planas e retas. A Melhoria automática corrige uma leve inclinação, e você pode girar uma página que entrou de cabeça para baixo.

Fotocópias antigas e faxes costumam ter pontinhos e traços apagados. Reduzir ruído ajuda com os pontinhos, e aumentar o contraste ajuda com o texto fraco. Cada página pode ser ajustada e lida de novo separadamente, sem mexer no resto.

Trabalhando com documentos longos

Cada página do PDF aparece como uma página própria no espaço de trabalho. Você pode reordenar as páginas, ler uma de novo, remover, ou copiar e baixar uma página sozinha.

A visualização Documento inteiro junta todas as páginas em ordem, com busca em todas elas. Clique numa linha do texto e o lugar dela se destaca na imagem da página, que é o jeito mais rápido de conferir um valor ou um nome.

O modo Documento junta as linhas em parágrafos e mantém títulos e listas. Também há opções para unir linhas quebradas e para juntar de novo palavras separadas por hífen no fim da linha, algo que livros e relatórios digitalizados têm de sobra. Cabeçalhos, rodapés e números de página vão aparecer em todas as páginas; o recurso de localizar e substituir permite removê-los rapidinho.

Escolhendo o formato de saída

  • Word (.docx) é o padrão aqui, pronto para editar. Veja imagem para Word para saber mais sobre documentos editáveis.
  • PDF pesquisável mantém a digitalização exatamente com a mesma aparência e acrescenta uma camada de texto invisível e selecionável. É a escolha certa para arquivar: o arquivo continua parecendo o original, mas você pode pesquisar nele com Ctrl+F em qualquer leitor de PDF.
  • TXT, Markdown, HTML e JSON também estão disponíveis, como um único arquivo combinado ou um ZIP com arquivos separados.

Se o PDF tiver uma tabela que você precisa numa planilha, mude essa página para o modo Tabela e veja imagem para Excel.

Limites que vale conhecer

Digitalizações nítidas de texto impresso costumam ser lidas com muita precisão. Anotações à mão nas margens, formulários preenchidos e assinaturas são bem mais difíceis. Carimbos e marcas d’água sobre o texto causam erros, e layouts com várias colunas podem precisar de alguns ajustes onde as colunas se encontram. Equações impressas simples podem ser lidas no modo Matemática, mas qualquer coisa complexa geralmente precisa ser corrigida à mão.

Para saber mais sobre a qualidade da digitalização e o que esperar, leia como extrair texto de documentos digitalizados.

Perguntas frequentes

Funciona com PDFs digitalizados?

Sim. Páginas digitalizadas são imagens, então cada uma é lida com OCR, página por página. Páginas que já contêm texto selecionável são aproveitadas diretamente.

Como saber se meu PDF é digitalizado ou digital?

Abra o arquivo em qualquer leitor de PDF e tente selecionar uma única palavra. Se ela ficar destacada, a página tem texto de verdade; se você só consegue desenhar um retângulo sobre uma imagem, ela é digitalizada.

O texto de um PDF digital passa pelo OCR?

Não. Se uma página já contém texto selecionável, o Image to Text App aproveita esse texto diretamente, então ele não sofre com erros de reconhecimento.

Dá para tornar pesquisável um PDF digitalizado?

Sim. Baixe o resultado como PDF pesquisável. Ele mantém a imagem original de cada página e acrescenta uma camada de texto invisível, para você pesquisar, selecionar e copiar o texto em qualquer leitor de PDF.

Consigo um único documento Word a partir de um PDF longo?

Sim. A visualização Documento inteiro junta todas as páginas em ordem e exporta tudo como um único arquivo. Se preferir, você também pode baixar um ZIP com arquivos separados.

Qual o tamanho máximo do PDF?

Cada arquivo pode ter até 25 MB. Se uma digitalização for maior, divida o arquivo em partes com uma ferramenta de PDF e adicione as partes em ordem.

Meu PDF é enviado para algum servidor?

Não. As páginas são lidas no seu navegador, no seu dispositivo. Isso faz diferença para contratos, extratos e outros documentos que você prefere não mandar para lugar nenhum.