PDFの文字起こし

PDFをドロップすれば、全ページのテキストを取り出せます。すでにテキストを含むページはそのまま取り込み、スキャンしたページはOCRで読み取ります。処理はすべてお使いの端末上で行われます。

ここに画像をドロップ、または Ctrl V で貼り付け

JPG、PNG、WebP、HEIC、GIF、BMP、TIFF、PDFに対応(1ファイル25MBまで)。一度に50件まで追加できます。

端末内で読み取ります。画像はアップロードされません。 仕組み

手元に画像がありませんか?サンプルで試せます:

使い方

  1. PDFをページにドラッグするか、Ctrl+O(Macは⌘O)で開きます。すべてのページが順番どおりに追加されます。
  2. Image to Text Appがスキャンしたページを1ページずつ読み取るのを待ちます。進行状況でどのページを読み取り中かがわかります。
  3. 「ドキュメント全体」表示を開いて全ページをまとめて読み・検索し、要確認の単語を修正します。
  4. すべてを1つのWordファイルまたは検索可能なPDFとして、あるいは個別ファイルのZIPとしてダウンロードします。

PDFからテキストを取り出すといっても、PDFの作られ方によって、まったく異なる2つの作業があります。Image to Text Appはその両方に対応し、ページごとに判断するので、事前に知っておく必要はありません。

デジタルPDFとスキャンPDF

デジタルPDFは、ソフトウェアで作られたPDFです。Wordから書き出したもの、Webページを保存したもの、請求システムが生成したものなどがあります。ページには本物のテキストが含まれており、たいていはPDFビューアーで単語を選択できます。Image to Text Appはこのようなページを見つけると、OCRを使わずにテキストを直接取り込みます。そのため認識ミスがなく、処理も速く済みます。

スキャンPDFは、オフィスのスキャナー、スマートフォンのスキャンアプリ、ファイル化されたFAXなどで作られた、紙のページの画像の集まりです。中にテキストはなく、文字のように見える画像があるだけです。Image to Text AppはこれらのページをOCRで1ページずつ読み取り、どこまで進んだかを進行状況で表示します。

両方が混ざったPDFもたくさんあります。最終ページだけ署名してスキャンした契約書や、付録の一部がスキャンされた報告書などです。ページごとに個別に判定するので、デジタルのページは正確にそのまま取り込まれ、スキャンしたページだけがOCRで読み取られます。

一つ注意点があります。デジタルPDFの中には、テキストレイヤーが壊れているものがあります。テキストは選択できるのに、コピーすると意味不明な文字列になったり文字が抜けたりするもので、たいていはフォントの埋め込み方が原因です。そのテキストはそのまま取り込まれるため、結果にも同じ問題が出ます。対処法は、そのページのスクリーンショットを撮ってここに貼り付け、画像として読み取らせることです。

スキャンしたページからきれいなテキストを得る

結果の大部分は、スキャンの品質で決まります。自分で紙をスキャンする場合は、次の点に気をつけましょう。

  • 文書向けの解像度でスキャンする。文字には300dpiがよく使われ、それよりかなり低い設定では小さな文字が読みにくくなります。
  • 文字だけの文書なら、グレースケールか白黒を選ぶ。カラーはファイルサイズが増えるだけで、認識の助けにはなりません。
  • ページを平らにまっすぐ置く。わずかな傾きは自動補正で直り、上下逆さまになったページは回転できます。

古いコピーやFAXには、細かな点やかすれた線がよくあります。点には「ノイズ除去」が、薄い文字にはコントラストを上げるのが効果的です。各ページはほかのページに影響を与えずに、個別に調整して読み取り直せます。

長い文書を扱う

PDFの各ページは、ワークスペース内でそれぞれ1つのページとして表示されます。ページの並べ替え、読み取り直し、削除のほか、1ページだけをコピー・ダウンロードすることもできます。

「ドキュメント全体」表示では全ページが順番どおりに並び、すべてのページを横断して検索できます。テキストの行をクリックするとページ画像の該当箇所が光るので、数値や名前を確認するのに最も手早い方法です。

ドキュメントモードは行をつなげて段落にし、見出しやリストを保ちます。折り返された行を結合するオプションや、行末のハイフンで分割された単語を結合するオプションもあり、こうした分割が多いスキャンした洋書や英文レポートに役立ちます。ヘッダー、フッター、ページ番号は毎ページに出てきますが、検索と置換を使えばすぐに削除できます。

出力形式を選ぶ

  • Word(.docx) はこのページの標準で、すぐに編集できます。編集できる文書について詳しくは画像をWordに変換をご覧ください。
  • 検索可能なPDF は、スキャンの見た目をそのまま残し、見えない選択可能なテキストレイヤーを加えます。保管用に最適です。見た目は元のままなのに、どのPDFリーダーでもCtrl+Fで検索できます。
  • TXT、Markdown、HTML、JSON も、1つにまとめたファイルまたは個別ファイルのZIPとして利用できます。

PDFにスプレッドシートで使いたい表がある場合は、そのページを表モードに切り替えて、画像をExcelに変換をご覧ください。

知っておきたい限界

はっきり印刷されたスキャンなら、通常は非常に正確に読み取れます。余白の手書きメモ、記入済みの申込書、署名はかなり難しくなります。文字に重なったスタンプや透かしは間違いの原因になり、段組みのレイアウトでは段の境目で多少の手直しが必要になることがあります。印刷された簡単な数式は数式モードで読み取れますが、複雑なものはたいてい手作業での修正が必要です。

スキャンの品質と期待できる結果について詳しくは、スキャンした文書から文字を抽出する方法をご覧ください。

よくある質問

スキャンしたPDFにも対応していますか?

はい。スキャンしたページは画像なので、1ページずつOCRで読み取ります。すでに選択できるテキストを含むページは、代わりにそのテキストを直接取り込みます。

PDFがスキャンかデジタルかを見分けるには?

PDFビューアーで開き、単語を1つ選択してみてください。ハイライトされればそのページには本物のテキストがあります。画像の上に枠を描くことしかできなければ、スキャンされたものです。

デジタルPDFのテキストもOCRにかけられるのですか?

いいえ。すでに選択できるテキストを含むページなら、Image to Text Appはそのテキストを直接取り込むので、認識ミスの影響を受けません。

スキャンしたPDFを検索可能にできますか?

はい。結果を検索可能なPDFとしてダウンロードしてください。各ページの元の画像を残したまま見えないテキストレイヤーを加えるので、どのPDFリーダーでも検索、選択、コピーができます。

長いPDFから1つのWord文書を作れますか?

はい。「ドキュメント全体」表示で全ページを順番どおりに結合し、1つのファイルとして書き出せます。個別ファイルのZIPでダウンロードすることもできます。

どのくらいの大きさのPDFまで使えますか?

1ファイル25MBまでです。それより大きいスキャンは、PDFツールでいくつかに分割し、順番に追加してください。

PDFはアップロードされますか?

いいえ。ページはお使いの端末のブラウザ内で読み取られます。契約書や明細書など、どこにも送りたくない書類では重要なポイントです。