スキャンした書類・PDFを文字起こしする方法

スキャンからテキストを取り出す方法。重要な設定、複数ページのコツ、画像だけのPDFの見分け方、紙の書類を検索できるアーカイブにする方法を紹介します。

更新日

スキャナーは、ページの写真を撮る機械です。その写真をPDFとして保存しても、ページは画像のまま(いわゆる画像PDF)で、OCRで読み取るまでは文字を選択・検索・コピーできません。スキャンからきれいなテキストを得るための勝負はスキャナーの前で始まっていて、そこで選んだ設定はあとから取り消すのが困難です。

このガイドでは、スキャナーの設定、複数ページの文書、手元のPDFの種類の見分け方、検索できるアーカイブの作り方を紹介します。

スキャンしたPDFか、デジタルのPDFか

すべてのPDFにOCRが必要なわけではありません。Wordから書き出したPDFやWebページから保存したPDFには本物のテキストが含まれていて、コピーすれば正確に取り出せます。次の簡単なチェックで、どちらの種類かがわかります。

  • 単語を選択してみる。 単語を1つずつハイライトできれば、そのページにはテキストレイヤーがあります。ページ全体が1つのブロックとしてハイライトされたり、何も起きなかったりする場合は画像です。
  • 見えている単語を検索する。 Ctrl+F(Macは⌘F)で何も見つからなければ、使えるテキストはありません。
  • 大きく拡大する。 デジタルの文字はどれだけ拡大してもくっきりしたままです。スキャンした文字はぼやけたり、ギザギザになったりします。

混在したPDFにも注意しましょう。入力された文字のページのあとに署名入りのスキャンページが続く契約書や、付録だけがスキャンされた報告書などがあります。

テキストレイヤーの質が悪いこともあります。何年も前にOCRにかけられたPDFには、不正確な透明テキストが含まれていることがあり、コピーすると文字化けした単語が出てきます。フォントの関係で、コピーすると意味不明な文字になるPDFもあります。そうした場合は、ページを画像として扱いましょう。PDFビューアーからページを画像として書き出し、それを読み取ります。

Image to Text AppはPDFの全ページを読み取ります。すでに選択できるテキストがあるページはOCRを使わずにそのまま取り込み、画像のページだけを読み取るので、混在した文書もできるかぎり正確に変換されます。PDFの文字起こしのページは、この用途向けの設定になっています。

OCRに効くスキャナーの設定

解像度

文字には300dpiが一般的な標準で、Tesseractのドキュメントでも最低ラインとして推奨されています。脚注、契約書の細かい条項、薬の説明書など、とても小さな文字は400〜600dpiでスキャンしましょう。通常の大きさの文字でそれ以上にしても、ファイルが大きくなるだけで、結果はほとんど良くなりません。

カラーモード

白黒ではなくグレースケールを選びましょう。スキャナーの白黒モードは、スキャンする瞬間に1つの固定されたしきい値を当てはめます。そのため薄い文字はかすれて途切れ、太い文字はつぶれてしまい、失われた細部は二度と取り戻せません。グレースケールならその情報が残るので、OCRソフトがインクと紙の境目を判断できます。

色に意味がある場合はカラーを使いましょう。マーカーを引いた箇所、色付きの印鑑やスタンプ、色分けされた記入欄のある書類、残しておきたい写真が載ったページなどです。特に蛍光ペンは、白黒スキャンだと濃いグレーの塊になり、印を付けたはずの文字そのものを隠してしまうことがあります。

ファイル形式

複数ページの文書にはPDFやTIFF、1ページだけならPNGが適しています。強く圧縮されたJPEGでの保存は避けましょう。スキャナーの「小さいファイル」プリセットではこれが使われていることがあります。JPEGの圧縮は文字の輪郭のまわりににじんだノイズを残し、小さな文字ほど影響を受けます。

物理的な準備

スキャナーのガラス面はきれいにしておきましょう。小さな汚れ1つが全ページに写り込みます。両面に印刷された薄い紙は、裏に黒い紙を1枚当てると、裏面の文字が透けるのを防げます。

スマートフォンをスキャナー代わりにする

たまにスキャンする程度なら、スマートフォンでも十分です。iPhoneには「メモ」アプリと「ファイル」アプリに書類スキャナーが組み込まれており、多くのAndroidスマートフォンでもカメラや文書アプリにスキャン機能があります。これらのモードはページの輪郭を見つけ、遠近の歪みを補正してPDFとして保存してくれるので、普通に写真を撮るよりたいていきれいに仕上がります。光、角度、ピントなど撮影面のコツは、OCRの精度を上げる方法をご覧ください。

複数ページの文書をスキャンする

  • バラの用紙は自動給紙(ADF)を使う。 ホチキスの針やクリップを外し、紙同士がくっつかないようにさばいてから、両面原稿なら両面スキャンをオンにします。
  • ページ数を数える。 自動給紙では、たまにページを飛ばしたり2枚同時に送ったりします。紙を片付ける前に、スキャンのページ数と原本を比べましょう。
  • 本はフラットベッドでスキャンする。 綴じ目付近の行が曲がらないように背の部分を押さえ、内側の余白に影が出ることは想定しておきましょう。明るさの補正で影はならせますが、曲がった行をまっすぐにすることはできません。
  • 並び順が崩れないファイル名を付ける。 ページを別々の画像としてスキャンする場合は、1、2、3ではなく001、002、003と番号を付けます。そうしないと、10ページ目が2ページ目より前に並んでしまいます。

Image to Text Appでは、PDFや複数ページのTIFFの各ページが、ワークスペースのページになります。ドラッグでページを並べ替えたり、どのページでも読み取り直したりでき、「ドキュメント全体」表示で全ページを横断検索して、結果を1つのファイルとして書き出せます。

検索可能なPDFを作る

検索可能なPDFとは、元のスキャン画像の文字の位置にぴったり重なるように、透明なテキストレイヤーを配置したものです。見た目はスキャンとまったく同じですが、検索したり、文字を選択してコピーしたりできます。パソコンのファイル検索や多くのクラウドストレージでも、中身の文字で見つけられるようになります。

文書を保管するには、これが最適な形式であることが多いです。署名、印鑑、レイアウトなど紙に写っていたものをすべて残しつつ、中の単語で探し出せるからです。テキストを編集する必要がある場合は、代わりにWordやプレーンテキストで書き出しましょう。画像をPDFに変換ツールで、画像から検索可能なPDFを作成できます。

注意点が1つあります。透明なレイヤーにあるOCRの誤りは目に見えません。名前が読み間違えられていると、その名前で検索してもそのページは見つかりません。重要な検索では、名字の最初の数文字など短めの語で検索してみましょう。1文字の読み間違いがあっても引っかかりやすくなります。

紙の書類をアーカイブする

いくつかの習慣を守るだけで、スキャンしたアーカイブを何年も役立てられます。

  • ファイル名を日付で始める。 2026-03-14 Electricity bill March.pdfのような名前にすれば、どのフォルダでも自動的に日付順に並びます。
  • フォルダの階層は浅くする。 「家庭」「税金」「医療」「仕事」のような大まかなフォルダをいくつか作るほうが、深い階層よりも探しやすくなります。
  • 長期保存にはPDF/Aを検討する。 PDF/Aは、長期保存のためにISOで標準化されたPDFの一種です。フォントなど表示に必要なものをすべて埋め込むので、何年たっても正しく開ける見込みが高くなります。多くのスキャナーソフトやPDFツールでこの形式で保存できます。
  • バックアップを取る。 よく知られた目安は、2種類の異なる記録媒体に3つのコピーを持ち、そのうち1つを別の場所に保管することです。
  • 紙が重要な場合は紙も残す。 遺言書、権利証、公証された書類、一部の税務・法律関係の記録は、原本での保管が必要な場合があります。ルールは国や書類によって異なるので、大切なものをシュレッダーにかける前に確認してください。

スキャンした書類は、身分証明書、銀行の明細、医療関係の手紙など、手元にあるファイルの中でも特に機密性の高いものになりがちです。オンラインのツールにかける前に、オンラインOCRは安全かで確認すべきポイントを読んでおきましょう。

その他のガイド