Convertir PDF a texto

Suelta un PDF y obtén el texto de todas sus páginas. Las páginas que ya contienen texto se toman tal cual y las escaneadas se leen con OCR, todo en tu propio dispositivo.

Suelta imágenes aquí o pega con Ctrl V

JPG, PNG, WebP, HEIC, GIF, BMP, TIFF o PDF, de hasta 25 MB cada uno. Añade hasta 50 a la vez.

Se lee en tu dispositivo. Tus imágenes no se suben. Cómo funciona

¿No tienes una imagen a mano? Prueba con un ejemplo:

Cómo usarlo

  1. Arrastra tu PDF a la página o ábrelo con Ctrl+O (⌘O en Mac), y todas las páginas se añaden en orden.
  2. Deja que Image to Text App procese las páginas escaneadas una a una; el progreso muestra qué página está leyendo.
  3. Abre la vista Documento completo para leer y buscar en todas las páginas a la vez y corregir las palabras por revisar.
  4. Descárgalo todo como un único archivo de Word o un PDF con texto buscable, o como un ZIP con archivos separados.

Sacar el texto de un PDF puede ser dos tareas muy distintas, según cómo se creó el PDF. Image to Text App resuelve las dos, y decide página a página, así que no necesitas saberlo de antemano.

PDF digitales y PDF escaneados

Un PDF digital lo ha creado un programa: exportado desde Word, guardado desde una página web o generado por un sistema de facturación. Sus páginas contienen texto real, y normalmente puedes seleccionar palabras en un visor de PDF. Cuando Image to Text App encuentra una página así, toma el texto directamente, sin OCR. Eso significa que no hay errores de reconocimiento y que es rápido.

Un PDF escaneado es un conjunto de imágenes de páginas en papel, procedentes de un escáner de oficina, una app de escaneo del teléfono o un fax convertido en archivo. No hay texto dentro, solo imágenes que parecen texto. Image to Text App lee estas páginas con OCR, una tras otra, y el progreso muestra por dónde va.

Muchos PDF son una mezcla de los dos: un contrato con la última página firmada y escaneada, o un informe con algunos anexos escaneados. Como cada página se comprueba por separado, las páginas digitales salen exactas y solo las escaneadas se leen con OCR.

Un detalle: algunos PDF digitales tienen la capa de texto dañada. Puedes seleccionar el texto, pero al copiarlo obtienes caracteres sin sentido o letras que faltan, normalmente por cómo se incrustaron las fuentes. Como ese texto se toma tal cual, el resultado mostrará el mismo problema. La solución es hacer una captura de pantalla de la página y pegarla aquí, para que se lea como imagen.

Cómo obtener buen texto de las páginas escaneadas

La calidad del escaneo determina casi todo el resultado. Si escaneas tú el papel:

  • Escanea con una resolución pensada para documentos. 300 ppp es una opción habitual para texto, y con ajustes mucho más bajos la letra pequeña cuesta de leer.
  • Elige escala de grises o blanco y negro para documentos de solo texto. El color aumenta el tamaño del archivo sin ayudar al reconocimiento.
  • Coloca las páginas planas y rectas. La Mejora automática corrige una ligera inclinación, y puedes girar una página que haya entrado al revés.

Las fotocopias antiguas y los faxes suelen tener motas y trazos desvaídos. Reducir ruido ayuda con las motas, y subir el contraste ayuda con el texto tenue. Cada página se puede ajustar y volver a leer por separado sin tocar el resto.

Trabajar con documentos largos

Cada página del PDF aparece como una página propia en el espacio de trabajo. Puedes reordenar las páginas, volver a leer una, quitarla, o copiarla y descargarla por separado.

La vista Documento completo junta todas las páginas en orden, con búsqueda en todas ellas. Haz clic en una línea del texto y su lugar se ilumina en la imagen de la página, que es la forma más rápida de comprobar una cifra o un nombre.

El modo Documento une las líneas en párrafos y conserva los títulos y las listas. También hay opciones para unir líneas cortadas y volver a juntar las palabras partidas con guion al final de una línea, algo muy frecuente en libros e informes escaneados. Los encabezados, pies y números de página aparecerán en cada página; buscar y reemplazar permite quitarlos rápido.

Elegir un formato de salida

  • Word (.docx) es el formato predeterminado aquí, listo para editar. Consulta imagen a Word para saber más sobre documentos editables.
  • PDF con texto buscable mantiene el escaneo exactamente como estaba y añade una capa de texto invisible y seleccionable. Es la opción adecuada para archivar: el archivo sigue pareciendo el original, pero puedes buscar en él con Ctrl+F en cualquier lector de PDF.
  • TXT, Markdown, HTML y JSON también están disponibles, como un único archivo combinado o como un ZIP con archivos separados.

Si el PDF contiene una tabla que necesitas en una hoja de cálculo, cambia esa página al modo Tabla y consulta imagen a Excel.

Límites que conviene conocer

Los escaneos impresos claros suelen leerse con mucha precisión. Las notas a mano en los márgenes, los formularios rellenados y las firmas son mucho más difíciles. Los sellos y las marcas de agua sobre el texto provocan errores, y los diseños de varias columnas pueden necesitar algún retoque donde se juntan las columnas. Las ecuaciones impresas sencillas se pueden leer en el modo Matemáticas, pero cualquier cosa compleja suele necesitar correcciones a mano.

Para saber más sobre la calidad del escaneo y qué esperar, lee cómo extraer texto de documentos escaneados.

Preguntas frecuentes

¿Funciona con PDF escaneados?

Sí. Las páginas escaneadas son imágenes, así que cada una se lee con OCR, página a página. Las páginas que ya contienen texto seleccionable se toman directamente.

¿Cómo sé si mi PDF es escaneado o digital?

Ábrelo en cualquier visor de PDF e intenta seleccionar una sola palabra. Si se resalta, la página tiene texto real; si solo puedes dibujar un recuadro sobre una imagen, está escaneada.

¿El texto de un PDF digital pasa por OCR?

No. Si una página ya contiene texto seleccionable, Image to Text App toma ese texto directamente, así que no le afectan los errores de reconocimiento.

¿Puedo hacer que un PDF escaneado permita buscar texto?

Sí. Descarga el resultado como PDF con texto buscable. Conserva la imagen original de cada página y añade una capa de texto invisible, para que puedas buscar, seleccionar y copiar texto en cualquier lector de PDF.

¿Puedo obtener un solo documento de Word de un PDF largo?

Sí. La vista Documento completo combina todas las páginas en orden y las exporta como un único archivo. También puedes descargar un ZIP con archivos separados.

¿Qué tamaño de PDF puedo usar?

Los archivos pueden tener hasta 25 MB cada uno. Si un escaneo es más grande, divídelo en partes con una herramienta de PDF y añade las partes en orden.

¿Se sube mi PDF?

No. Las páginas se leen en tu navegador, en tu dispositivo. Eso importa con contratos, extractos y otros documentos que prefieres no enviar a ningún sitio.