見た目は画像、中身はテキストのPDF
写真をそのままPDFに入れただけでは、文字が写った画像にすぎません。見ることはできても、検索したり、文章を選択したり、口座番号をコピーしたりはできません。検索可能なPDFは、各ページに画像を残したまま、認識したテキストを画像に重ねて見えないレイヤーとして加えます。ページには画像が表示され、その下にあるテキストのおかげで検索できるようになるのです。
JPGをPDFにまとめたいだけの場合にも使えます。テキストレイヤーは手間をかけずに自動で付いてきます。
隠れたテキストレイヤーが役立つ場面
- 探す。 PDFリーダーでCtrl+F(または⌘F)を押せば、スキャンしたページをスクロールして探さなくても、名前、日付、参照番号にすぐ移動できます。
- コピーする。 段落、住所、注文番号を選択して、打ち直さずにほかの場所に貼り付けられます。
- 紙をアーカイブする。 スキャンした手紙、契約書、マニュアル、記録を、あとから見つけやすくなります。PDFのテキストをインデックス化する検索ツールが、中身を認識できるからです。
- 基本的なアクセシビリティ。 スクリーンリーダーや読み上げツールには本物のテキストが必要で、画像だけのPDFでは何も読み上げられません。テキストレイヤーは有用な第一歩ですが、見出しのタグ付けや読み上げ順序の定義がされた、完全にアクセシブルなPDFと同じではありません。
画像の束を1つのPDFに
複数ページの手紙をスマートフォンで撮った写真、スキャンしたフォルダー、スクリーンショットの一式など、すべての画像をまとめて追加します。各画像がページになります。ドラッグで正しい順番に並べ、不要なページは削除し、うまく読み取れなかったページは読み取り直してください。
「ドキュメント全体」表示では、すべてのページが指定した順に並び、全ページを横断して検索でき、1つのPDFとして書き出せます。複数ページのTIFFは全ページが取り込まれるので、その形式で出力するスキャナーのファイルもそのまま使えます。1つのワークスペースには最大50枚の画像を追加でき、1ファイルは25MBまでです。
検索可能なPDFか、テキストのみのPDFか
PDFのダウンロードは2種類あり、それぞれ役割が違います。
- 検索可能なPDF は、元の見た目を保ちます。署名、スタンプ、余白のメモ、ロゴ、写真もすべてそのままです。記録、申込書、レシートなど、見た目が重要なものに選びましょう。
- PDF は、画像を含まず、認識したテキストだけが入ります。文字だけが必要なとき、たとえばきれいな形で印刷・共有したいときに便利です。照らし合わせる元の画像がないので、読み間違えた単語はそのまま読み手に伝わります。先にテキストを確認しておきましょう。
検索だけでなく文章を書き換えたい場合は、画像をWordに変換で編集できる.docxを作れます。
より良いテキストレイヤーにするために
テキストレイヤーの品質は、その元になる認識の品質で決まります。文字は見えないので、間違いがあってもページ上には現れませんが、検索でヒットしなくなります。「Henderson」を検索しても、その名前が「Hendersen」と読み取られたページは見つかりません。
はっきり印刷されたページなら、通常は非常に正確に読み取れます。それ以外のページでは、次の習慣が役立ちます。
- 机の端、指、隣のページをトリミングで取り除く。
- 斜めから撮ったページは、行が水平になるようにまっすぐにする。
- 自動補正はオンのままにして影を整え、コントラストを高め、行われた処理の一覧を確認する。
- ページが英語でない場合は、正しい言語を(必要なら複数)選ぶ。
詳しくはOCRの精度を上げる方法をご覧ください。スキャンしたPDFから文字だけを取り出したい場合は、PDFの文字起こしのほうが近道です。