Cómo convertir imágenes en documentos editables de Word o Google Docs

Qué se conserva cuando una imagen pasa a Word o Google Docs, qué tendrás que rehacer a mano y una rutina de limpieza para llegar rápido a un documento terminado.

Actualizado

Convertir la imagen de una página en un documento que puedas editar requiere dos cosas: OCR para leer las palabras y algo de reconstrucción para volver a convertir esas palabras en párrafos, títulos, listas y tablas. Las palabras suelen salir bien. El aspecto de la página, en general, no.

Saber de antemano qué se conserva y qué tendrás que rehacer te permite elegir el camino más rápido y evitar pelearte con el formato después.

Qué se conserva

Una buena conversión mantiene la estructura del documento, las partes que le dan sentido:

  • Párrafos. Las líneas cortadas en la imagen se vuelven a unir en párrafos continuos, así que el texto se recoloca al editarlo.
  • Títulos. Las líneas que destacan como títulos pueden convertirse en estilos de título de verdad en lugar de texto en negrita.
  • Listas. Los elementos con viñetas y numerados se convierten en listas de verdad que se renumeran solas cuando añades un elemento.
  • Tablas. Las filas y columnas pueden llegar como una tabla real en lugar de texto separado por espacios.
  • Orden de lectura. En las páginas de una sola columna, el orden del texto coincide con el de la página.

En Image to Text App, el modo Documento une los párrafos y conserva los títulos y las listas con viñetas y numeradas. Las tablas se conservan cuando usas el modo Tabla para esa parte de la página.

Qué no se conserva

El OCR identifica caracteres, no diseño. Cuenta con perder o rehacer lo siguiente:

  • Fuentes y tamaños. El texto adopta el estilo predeterminado del documento en el que lo pegas.
  • Énfasis dentro del texto. Las palabras en negrita, cursiva o subrayadas dentro de una frase suelen perderse.
  • Colores del texto, de los resaltados y de los fondos.
  • Diseños de varias columnas, cuadros de texto y barras laterales. Se convierten en una única secuencia de párrafos, y el texto de los recuadros puede acabar en un sitio poco adecuado.
  • Imágenes, logotipos, gráficos y firmas. No son texto, así que se descartan, o un logotipo se convierte en unos cuantos caracteres sueltos.
  • Encabezados, pies y números de página. Llegan como líneas de texto normales, repetidas en cada página.
  • Notas al pie. El texto de la nota aparece como un párrafo normal, y los pequeños números de referencia se convierten en dígitos normales pegados al final de una palabra.
  • Campos de formulario. Las líneas en blanco y las casillas de un formulario no se convierten en campos rellenables.
  • Espaciado, sangría y saltos de línea exactos, salvo en el código, donde un modo pensado para código conserva la sangría.

¿Copia enriquecida, .docx u otra cosa?

Hay varias formas de llevar el resultado a un documento, y cada una encaja en una situación distinta.

La copia enriquecida es la mejor opción cuando el texto va a un documento que ya existe. Copia y pega en Word o Google Docs, y los títulos, las listas y las tablas llegan con formato de verdad. Como el texto no tiene una fuente propia, adopta los estilos del destino, así que al pegarlo en una plantilla de empresa los títulos coinciden con esa plantilla.

Un archivo .docx es lo mejor cuando quieres un documento independiente para enviar, editar o guardar. Se abre en Microsoft Word y en la mayoría de los procesadores de texto. Para trabajar con él en Google Docs, súbelo a Google Drive y ábrelo desde allí.

Markdown va bien para apps de notas, wikis y cualquier cosa que se publique en la web. Los títulos y las listas se conservan como un marcado de texto sencillo, fácil de editar en cualquier sitio. La herramienta imagen a Markdown está preparada para ello.

El texto sin formato es la opción correcta cuando de todos modos vas a volver a dar formato a todo y no quieres que una estructura sobrante te estorbe.

Un método de limpieza que ahorra tiempo

Aquí el orden importa. Corregir los problemas pronto, mientras tienes la imagen delante, es mucho más rápido que encontrarlos más tarde en un documento largo.

  1. Prepara la imagen. Recorta todo lo que no forme parte del documento, como el borde de la página siguiente, y endereza las fotos tomadas en ángulo. Cómo obtener resultados de OCR precisos lo explica en detalle.
  2. Lee en el modo adecuado. Usa el modo Documento para el texto corrido. Si una página tiene una tabla, lee esa parte como tabla.
  3. Corrige las palabras antes de exportar. Revisa las palabras marcadas con la imagen al lado. Es mucho más rápido aquí, donde al hacer clic en una línea ves su lugar en la imagen, que en Word con la imagen en otra ventana.
  4. Quita los elementos repetidos de la página. Borra los encabezados, pies y números de página repetidos. Buscar y reemplazar se encarga de un encabezado que se repite en cada página.
  5. Pega o exporta. Usa la copia enriquecida o el archivo .docx, como se explica arriba.
  6. Aplica los estilos adecuados. Usa los estilos Título 1, Título 2 y Normal en lugar de negritas y tamaños de fuente. Así tendrás el panel de navegación en Word, el esquema del documento en Google Docs y una tabla de contenido automática. Para quitar antes el formato sobrante, selecciona el texto y presiona Ctrl+Espacio en Word, o Ctrl+\ en Google Docs (⌘+\ en Mac).
  7. Rehaz lo que el OCR no puede. Inserta imágenes y logotipos recortados del original, y vuelve a crear las columnas con Disposición > Columnas en Word o Formato > Columnas en Google Docs.
  8. Revisa el texto. El corrector ortográfico detecta palabras que no existen, como «cnsa». No detectará una palabra real en el sitio equivocado, como «caso» en lugar de «casa», así que compara con el original los números, los nombres y las fechas.

Documentos de varias páginas

Para un documento fotografiado o escaneado página a página, añade todas las páginas a la vez y ordénalas. En Image to Text App, la vista Documento completo combina todas las páginas, te permite buscar en todas y exporta el conjunto como un solo archivo.

Revisa las uniones entre páginas. Un párrafo que va del final de una página al principio de la siguiente normalmente quedará partido en dos, porque cada página se lee por separado. Únelos a mano.

Si partes de PDF escaneados y no de fotos, cómo extraer texto de documentos escaneados explica los ajustes del escáner y los PDF con texto buscable, que quizá te convengan más que un archivo editable. Las tablas tienen su propia guía: cómo extraer tablas de imágenes.

Cuándo rehacer en lugar de convertir

La conversión funciona mejor con documentos con mucho texto, como cartas, informes, artículos y notas. Con páginas muy diseñadas, como folletos, carteles, menús y certificados, extrae el texto y vuélcalo en una plantilla nueva. Es más rápido que intentar reconstruir un diseño exacto a partir del resultado del OCR.

Para formularios que necesitas reutilizar, vuelve a crear el formulario como es debido en tu procesador de textos y copia las etiquetas. Y si el documento te lo envió alguien que todavía tiene el archivo original, pedírselo es mejor que cualquier conversión.

Cuando estés listo, la herramienta imagen a Word está preparada justo para esto, con copia enriquecida para pegar y descarga en .docx.

Más guías