PDF 텍스트 추출

PDF를 넣으면 모든 페이지의 텍스트를 가져옵니다. 이미 텍스트가 들어 있는 페이지는 그대로 가져오고 스캔한 페이지는 OCR로 인식하며, 모든 과정이 내 기기에서 이루어집니다.

이미지를 여기에 끌어다 놓거나 Ctrl V로 붙여 넣으세요

JPG, PNG, WebP, HEIC, GIF, BMP, TIFF, PDF 지원, 파일당 최대 25 MB. 한 번에 최대 50개까지 추가할 수 있습니다.

내 기기에서 인식합니다. 이미지는 업로드되지 않습니다. 작동 방식

이미지가 없나요? 샘플로 해 보세요:

사용 방법

  1. PDF를 페이지로 끌어다 놓거나 Ctrl+O(Mac은 ⌘O)로 열면 모든 페이지가 순서대로 추가됩니다.
  2. Image to Text App이 스캔한 페이지를 한 장씩 처리하는 동안 기다리세요. 진행 표시에서 지금 어느 페이지를 읽는지 볼 수 있습니다.
  3. 전체 문서 보기를 열어 모든 페이지를 함께 읽고 검색하며 확인할 단어를 고치세요.
  4. 전체를 Word 파일 하나나 검색 가능한 PDF로 다운로드하거나, 개별 파일을 묶은 ZIP으로 받으세요.

PDF에서 텍스트를 추출하는 일은 PDF가 어떻게 만들어졌느냐에 따라 전혀 다른 두 가지 작업이 될 수 있습니다. Image to Text App은 두 가지를 모두 처리하며 페이지마다 판단하므로 미리 알아 둘 필요가 없습니다.

디지털 PDF와 스캔 PDF

디지털 PDF는 소프트웨어로 만든 PDF입니다. Word에서 내보냈거나, 웹 페이지를 저장했거나, 청구 시스템이 생성한 파일이죠. 페이지에 실제 텍스트가 들어 있어서 보통 PDF 뷰어에서 단어를 선택할 수 있습니다. Image to Text App은 이런 페이지를 발견하면 OCR 없이 텍스트를 바로 가져옵니다. 그래서 인식 오류가 없고 빠릅니다.

스캔 PDF는 종이 페이지를 찍은 그림의 묶음입니다. 사무실 스캐너, 휴대폰 스캔 앱, 파일로 바뀐 팩스 등에서 나옵니다. 안에 텍스트는 없고 텍스트처럼 보이는 이미지만 있습니다. Image to Text App은 이런 페이지를 하나씩 차례로 OCR로 인식하며, 진행 표시로 어디까지 했는지 보여 줍니다.

두 가지가 섞인 PDF도 많습니다. 마지막 페이지만 서명 후 스캔한 계약서나 부록 몇 장이 스캔본인 보고서처럼요. 페이지마다 따로 확인하기 때문에 디지털 페이지는 정확히 그대로 가져오고 스캔한 페이지만 OCR로 인식합니다.

주의할 점이 하나 있습니다. 일부 디지털 PDF는 텍스트 레이어가 깨져 있습니다. 텍스트를 선택할 수는 있지만 복사하면 알아볼 수 없는 문자가 나오거나 글자가 빠지는데, 보통 글꼴이 포함된 방식 때문입니다. 이런 텍스트는 그대로 가져오기 때문에 결과에도 같은 문제가 나타납니다. 해결 방법은 해당 페이지의 스크린샷을 찍어 여기에 붙여 넣는 것입니다. 그러면 이미지로 인식됩니다.

스캔한 페이지에서 깔끔한 텍스트 얻기

결과는 대부분 스캔 품질이 결정합니다. 종이를 직접 스캔한다면:

  • 문서용 해상도로 스캔하세요. 텍스트에는 300 dpi가 흔히 쓰이며, 이보다 훨씬 낮으면 작은 글씨를 읽기 어렵습니다.
  • 일반 텍스트 문서라면 회색조나 흑백을 고르세요. 컬러는 인식에 도움이 되지 않고 파일 크기만 늘립니다.
  • 페이지를 평평하고 반듯하게 놓으세요. 자동 보정이 약간 기운 것을 바로잡고, 거꾸로 들어간 페이지는 회전할 수 있습니다.

오래된 복사본과 팩스에는 잡티와 바랜 획이 많습니다. 잡티에는 노이즈 제거가, 희미한 글씨에는 대비 높이기가 도움이 됩니다. 각 페이지는 나머지 페이지에 영향을 주지 않고 따로 조정하고 다시 인식할 수 있습니다.

긴 문서 다루기

PDF의 모든 페이지가 작업 공간에 각각의 페이지로 나타납니다. 페이지 순서를 바꾸거나, 다시 인식하거나, 삭제하거나, 한 페이지만 따로 복사하고 다운로드할 수 있습니다.

전체 문서 보기는 모든 페이지를 순서대로 모아 보여 주며 모든 페이지를 한 번에 검색할 수 있습니다. 텍스트의 한 줄을 클릭하면 페이지 이미지에서 그 위치가 강조되는데, 숫자나 이름을 확인하는 가장 빠른 방법입니다.

문서 모드는 줄을 문단으로 합치고 제목과 목록을 유지합니다. 줄바꿈된 줄을 합치는 옵션과 줄 끝에서 하이픈으로 나뉜 단어를 다시 잇는 옵션도 있는데, 스캔한 책과 보고서에는 이런 경우가 아주 많습니다. 머리글, 바닥글, 쪽 번호는 모든 페이지에 반복해서 나타나므로 찾아 바꾸기로 빠르게 지우세요.

출력 형식 고르기

  • Word(.docx) 파일이 이 페이지의 기본값이며 바로 편집할 수 있습니다. 편집 가능한 문서에 대해서는 이미지 워드 변환을 참고하세요.
  • 검색 가능한 PDF는 스캔본의 모습을 그대로 유지하면서 보이지 않는 선택 가능한 텍스트 레이어를 더합니다. 보관용으로 알맞습니다. 파일은 원본과 똑같아 보이지만 어떤 PDF 리더에서든 Ctrl+F로 검색할 수 있습니다.
  • TXT, Markdown, HTML, JSON으로도 받을 수 있으며, 하나로 합친 파일이나 개별 파일을 묶은 ZIP 중에서 고를 수 있습니다.

PDF에 스프레드시트로 옮겨야 할 표가 있다면 해당 페이지를 표 모드로 바꾸고 이미지 엑셀 변환을 참고하세요.

알아 두면 좋은 한계

선명하게 인쇄된 스캔본은 보통 매우 정확하게 읽힙니다. 여백의 손글씨 메모, 작성된 양식, 서명은 훨씬 어렵습니다. 텍스트 위의 도장과 워터마크는 오류를 일으키고, 다단 레이아웃은 단이 만나는 부분을 조금 정리해야 할 수 있습니다. 간단한 인쇄 수식은 수식 모드로 읽을 수 있지만, 복잡한 수식은 대개 직접 고쳐야 합니다.

스캔 품질과 기대할 수 있는 결과에 대해서는 스캔한 문서에서 텍스트를 추출하는 방법을 읽어 보세요.

자주 묻는 질문

스캔한 PDF도 되나요?

네. 스캔한 페이지는 이미지이므로 한 페이지씩 OCR로 인식합니다. 이미 선택 가능한 텍스트가 있는 페이지는 그 텍스트를 바로 가져옵니다.

PDF가 스캔본인지 디지털 PDF인지 어떻게 알 수 있나요?

아무 PDF 뷰어에서 열고 단어 하나를 선택해 보세요. 단어가 선택되면 실제 텍스트가 있는 페이지이고, 그림 위에 상자만 그려진다면 스캔본입니다.

디지털 PDF의 텍스트도 OCR을 거치나요?

아니요. 페이지에 이미 선택 가능한 텍스트가 있으면 Image to Text App이 그 텍스트를 그대로 가져오므로 인식 오류의 영향을 받지 않습니다.

스캔한 PDF를 검색 가능하게 만들 수 있나요?

네. 결과를 검색 가능한 PDF로 다운로드하세요. 각 페이지의 원본 이미지는 그대로 두고 보이지 않는 텍스트 레이어를 더하므로, 어떤 PDF 리더에서든 텍스트를 검색하고 선택하고 복사할 수 있습니다.

긴 PDF를 Word 문서 하나로 받을 수 있나요?

네. 전체 문서 보기에서 모든 페이지를 순서대로 합쳐 하나의 파일로 내보냅니다. 개별 파일을 묶은 ZIP으로 받을 수도 있습니다.

PDF는 얼마나 큰 것까지 쓸 수 있나요?

파일당 최대 25 MB까지 가능합니다. 스캔본이 더 크다면 PDF 도구로 여러 부분으로 나눈 뒤 순서대로 추가하세요.

PDF가 업로드되나요?

아니요. 페이지는 내 기기의 브라우저 안에서 인식됩니다. 계약서, 명세서처럼 어디에도 보내고 싶지 않은 문서라면 이 점이 중요합니다.