画像を編集できるWord・Google ドキュメントに変換する方法

画像をWordやGoogle ドキュメントに変換したときに残るもの、手作業で作り直すもの、そして完成した文書まで最短でたどり着くための仕上げの手順を紹介します。

更新日

ページを写した画像を編集できる文書に変えるには、2つのことが必要です。単語を読み取るOCRと、その単語を段落、見出し、リスト、表に組み立て直す作業です。単語はたいていきちんと読み取れます。一方で、ページの見た目はほとんど引き継がれません。

何が引き継がれ、何を作り直すことになるのかを前もって知っておけば、いちばん早い方法を選べますし、あとで書式と格闘せずに済みます。

引き継がれるもの

うまく変換できれば、文書の構造、つまり意味を担う部分が保たれます。

  • 段落。 画像の中で折り返されていた行は、ひと続きの段落に結合されます。そのため、編集すると文章が自然に流れ直します。
  • 見出し。 見出しとして目立つ行は、太字のテキストではなく、本物の見出しスタイルにできます。
  • リスト。 箇条書きや番号付きの項目は本物のリストになり、項目を追加すると番号が自動で振り直されます。
  • 表。 行と列は、スペースで区切られたテキストではなく、実際の表として取り込めます。
  • 読む順番。 1段組みのページなら、テキストの順番はページと一致します。

Image to Text Appでは、ドキュメントモードが段落を結合し、見出しと箇条書き・番号付きリストを保ちます。表は、ページのその部分を表モードで読み取れば取り込めます。

引き継がれないもの

OCRが識別するのは文字であって、デザインではありません。次のものは失われるか、やり直しになると考えてください。

  • フォントとサイズ。 テキストは、貼り付け先の文書の標準スタイルになります。
  • 文中の強調。 文の中の太字、斜体、下線の付いた単語は、たいてい失われます。
  • 色。 文字、マーカー、背景の色です。
  • 段組み、テキストボックス、サイドバー。 これらは1本の段落の流れになり、囲みのテキストが妙な位置に入り込むことがあります。
  • 画像、ロゴ、グラフ、署名。 テキストではないので取り除かれるか、ロゴがいくつかの無関係な文字になります。
  • ヘッダー、フッター、ページ番号。 普通のテキスト行として、ページごとに繰り返し出てきます。
  • 脚注。 注の本文は普通の段落として現れ、小さな参照番号は単語の末尾にくっついた普通の数字になります。
  • フォームの入力欄。 申込書などの空欄やチェックボックスは、入力できるフィールドにはなりません。
  • 正確な間隔、インデント、改行。 ただしコードは例外で、コードに対応したモードならインデントが保たれます。

書式付きコピー、.docx、それともほかの形式?

結果を文書に移す方法はいくつかあり、それぞれ向いている場面が違います。

書式付きコピーは、すでにある文書にテキストを入れるときに最適です。コピーしてWordやGoogle ドキュメントに貼り付ければ、見出し、リスト、表が本物の書式として入ります。テキスト自体にはフォントがないため、貼り付け先のスタイルが適用されます。会社のテンプレートに貼り付ければ、見出しもそのテンプレートに合った見た目になります。

.docxファイルは、送ったり、編集したり、保存したりする独立した文書がほしいときに最適です。Microsoft Wordをはじめ、ほとんどのワープロソフトで開けます。Google ドキュメントで作業するなら、Google ドライブにアップロードしてそこで開いてください。

Markdownは、メモアプリ、Wiki、Webに公開するものに向いています。見出しやリストが簡単なテキスト記法で保たれ、どこでも手軽に編集できます。画像をMarkdownに変換ツールはこの用途向けに設定されています。

プレーンテキストは、どうせすべて書式を整え直すつもりで、余計な構造にじゃまされたくないときに適しています。

時間を節約できる仕上げの手順

ここでは順番が大切です。画像が目の前にあるうちに早めに問題を直すほうが、長い文書の中であとから探すよりずっと早く済みます。

  1. 画像を整えます。 隣のページの端など、文書の一部ではないものはトリミングし、斜めから撮った写真はまっすぐにします。詳しくはOCRの精度を上げる方法で紹介しています。
  2. 適切なモードで読み取ります。 普通の文章にはドキュメントモードを使います。ページに表がある場合は、その部分を表として読み取ります。
  3. 書き出す前に単語を直します。 印の付いた単語を、画像と並べて確認します。行をクリックすると画像の該当箇所がわかるこの画面のほうが、別のウィンドウに画像を開いてWordで作業するよりずっと早く済みます。
  4. ページの付属要素を取り除きます。 繰り返し出てくるヘッダー、フッター、ページ番号を削除します。ページごとに繰り返されるヘッダーは、検索と置換でまとめて処理できます。
  5. 貼り付けるか書き出します。 上で紹介したとおり、書式付きコピーか.docxファイルを使います。
  6. 正しいスタイルを適用します。 太字やフォントサイズではなく、「見出し 1」「見出し 2」「標準」のスタイルを使いましょう。そうすれば、Wordのナビゲーションウィンドウ、Google ドキュメントのドキュメントの概要、自動の目次が使えるようになります。先に余計な書式を消したいときは、テキストを選択して、WordならCtrl+Space、Google ドキュメントならCtrl+\(Macは⌘+\)を押します。
  7. OCRで再現できないものを作り直します。 元の画像から切り出した画像やロゴを挿入し、段組みはWordの「レイアウト」>「段組み」、Google ドキュメントの「表示形式」>「段組み」で作り直します。
  8. 校正します。 スペルチェックは「tbe」のような存在しない単語を見つけてくれます。しかし、「from」が「form」になるような、正しい単語が間違った場所にある誤りは見つけられません。数字、名前、日付は元の画像と照らし合わせて読みましょう。

複数ページの文書

1ページずつ撮影またはスキャンした文書は、すべてのページを一度に追加して順番に並べます。Image to Text Appでは、「ドキュメント全体」表示ですべてのページを結合し、全ページを横断して検索し、まとめて1つのファイルとして書き出せます。

ページのつなぎ目を確認してください。各ページは個別に読み取られるため、あるページの下から次のページへ続く段落は、たいてい2つに分かれてしまいます。手作業でつなげましょう。

写真ではなくスキャンしたPDFから始める場合は、スキャンした文書から文字を抽出する方法でスキャナーの設定や検索可能なPDFについて紹介しています。編集できるファイルより、そちらのほうが合っているかもしれません。表については、画像から表を抽出する方法という専用のガイドがあります。

変換せずに作り直すべきとき

変換がもっとも効果を発揮するのは、手紙、報告書、記事、メモなど、文章が中心の文書です。パンフレット、ポスター、メニュー、賞状のようにデザイン性の高いページは、テキストを抽出してから新しいテンプレートに流し込みましょう。OCRの結果から元のレイアウトを正確に再現しようとするより早く済みます。

繰り返し使う申込書などのフォームは、ワープロソフトできちんと作り直し、項目名だけをコピーしましょう。そして、元のファイルを持っている人から届いた文書なら、どんな変換よりも、元のファイルを頼むのがいちばんです。

準備ができたら、画像をWordに変換ツールをお使いください。まさにこの作業のために、貼り付け用の書式付きコピーと.docxのダウンロードを用意しています。

その他のガイド