이미지처럼 보이지만 텍스트처럼 읽히는 PDF
사진을 그냥 PDF에 넣으면 글자가 찍힌 그림이 될 뿐입니다. 볼 수는 있지만 검색하거나, 문장을 선택하거나, 계좌번호를 복사할 수는 없습니다. 검색 가능한 PDF는 각 페이지에 그림을 그대로 두고, 인식한 텍스트를 그림과 위치를 맞춘 보이지 않는 레이어로 더합니다. 페이지에는 여전히 내 이미지가 보이고, 그 아래의 텍스트 덕분에 검색이 됩니다.
JPG 몇 장을 PDF로 묶기만 하면 되는 경우에도 이 기능을 쓰면 됩니다. 텍스트 레이어는 따로 손대지 않아도 함께 들어갑니다.
숨겨진 텍스트 레이어의 쓸모
- 찾기. PDF 리더에서 Ctrl+F(또는 ⌘F)를 누르면 스캔한 페이지를 일일이 넘기지 않고 이름, 날짜, 참조 번호로 바로 이동할 수 있습니다.
- 복사. 문단, 주소, 주문 번호를 선택해 다시 타이핑하지 않고 다른 곳에 붙여 넣을 수 있습니다.
- 종이 문서 보관. PDF 텍스트를 색인하는 검색 도구가 내용을 볼 수 있으므로, 스캔한 편지, 계약서, 설명서, 기록을 나중에 찾기 쉬워집니다.
- 기본적인 접근성. 화면 낭독기와 소리 내어 읽기 도구는 실제 텍스트가 있어야 작동하며, 이미지로만 된 PDF에서는 아무것도 읽을 수 없습니다. 텍스트 레이어는 유용한 첫걸음이지만, 제목 태그와 읽기 순서가 정의된 완전한 접근성 PDF와 같지는 않습니다.
이미지 여러 장을 PDF 하나로
여러 페이지짜리 편지를 휴대폰으로 찍은 사진이든, 스캔 파일이 담긴 폴더든, 스크린샷 묶음이든 모든 이미지를 한꺼번에 추가하세요. 각 이미지가 페이지가 됩니다. 끌어서 페이지 순서를 맞추고, 필요 없는 페이지는 삭제하고, 결과가 좋지 않은 페이지는 다시 인식하세요.
전체 문서 보기는 모든 페이지를 원하는 순서대로 함께 보여 주고 모든 페이지를 검색할 수 있게 하며, PDF 하나로 내보냅니다. 여러 페이지 TIFF는 모든 페이지를 가져오므로 그 형식으로 나온 스캐너 결과물도 바로 쓸 수 있습니다. 작업 공간 하나에 이미지를 최대 50개까지 담을 수 있고, 파일당 최대 25 MB입니다.
검색 가능한 PDF와 텍스트만 있는 PDF
PDF 다운로드는 두 가지이며, 용도가 다릅니다.
- 검색 가능한 PDF는 원본의 모습을 유지합니다. 서명, 도장, 여백의 메모, 로고, 사진이 모두 그대로 남습니다. 기록, 양식, 영수증처럼 겉모습이 중요한 문서에 고르세요.
- PDF는 이미지 없이 인식한 텍스트만 담습니다. 깔끔한 사본을 인쇄하거나 공유할 때처럼 글자만 중요할 때 편리합니다. 비교할 원본이 없으므로 잘못 읽힌 단어가 그대로 독자에게 보입니다. 먼저 텍스트를 확인하세요.
검색만이 아니라 문구를 고쳐야 한다면 이미지 워드 변환으로 편집 가능한 .docx를 받으세요.
더 나은 텍스트 레이어 만들기
텍스트 레이어는 그 바탕이 된 인식 결과만큼만 좋습니다. 글자가 보이지 않기 때문에 잘못 읽힌 부분이 페이지에 드러나지 않지만, 검색에는 걸리지 않게 됩니다. “Henderson”을 검색하는 사람은 그 이름이 “Hendersen”으로 읽힌 페이지를 찾지 못합니다.
선명하게 인쇄된 페이지는 보통 매우 정확하게 읽히며, 나머지 경우에는 몇 가지 습관이 도움이 됩니다.
- 책상 가장자리, 손가락, 옆 페이지는 잘라 내세요.
- 비스듬히 찍은 페이지는 줄이 수평이 되도록 반듯하게 펴세요.
- 자동 보정을 켜 두어 그림자를 고르게 하고 대비를 높이세요. 어떤 단계를 거쳤는지 목록도 확인하세요.
- 페이지가 영어가 아니라면 알맞은 언어를 고르거나 여러 개를 고르세요.
자세한 내용은 정확한 OCR 결과를 얻는 방법에 있습니다. 스캔한 PDF에서 글자만 뽑고 싶다면 PDF 텍스트 추출이 더 빠릅니다.