스캔해서 만든 PDF나 사진을 그대로 PDF로 옮긴 문서는 겉보기엔 글자가 있어도 마우스로 선택하거나 검색할 수 없는 경우가 많습니다. 아래 도구는 파일을 어디에도 업로드하지 않고, 지금 보고 있는 이 브라우저 화면 안에서 페이지 속 글자를 인식(OCR)한 뒤, 원본 모습은 그대로 유지한 채 눈에 보이지 않는 글자 레이어만 겹쳐서 선택/검색이 가능한 PDF로 만들어 드립니다. 한국어와 영어 문서를 지원하며, 문서 안의 글자를 인식하는 과정이라 페이지 수에 따라 다소 시간이 걸릴 수 있습니다.
PDF 텍스트 인식(OCR)
스캔한 이미지처럼 글자를 선택할 수 없는 PDF 파일을 올리면, 브라우저 안에서 글자를 인식해 선택/검색이 가능한 PDF로 만들어 드립니다.
인식된 글자는 화면에 보이지 않는 투명한 레이어로 추가되어, 원본과 겉모습은 같지만 이제 선택하거나 검색할 수 있습니다.
파일은 서버로 전송되지 않고 이 브라우저 안에서만 처리됩니다. 페이지를 새로고침하거나 닫으면 선택한 파일과 결과물은 사라집니다. 다만 OCR 엔진과 언어 데이터 파일은 최초 실행 시 별도의 CDN에서 내려받습니다.
이용 방법
- 위 상자를 클릭하거나, 텍스트를 인식하고 싶은 PDF 파일 1개를 끌어다 놓습니다.
- 업로드하면 첫 페이지 미리보기와 전체 페이지 수가 표시됩니다. 🔍 아이콘으로 크게 볼 수 있습니다.
- "텍스트 인식 실행"을 누르면 브라우저 안에서 각 페이지를 렌더링하고 글자를 인식합니다. 화면에 몇 페이지째인지, 인식 진행률이 표시됩니다.
- 완료되면 처리한 페이지 수, 인식된 단어 수, 평균 인식률과 함께 다운로드 버튼이 나타납니다. 결과 PDF는 겉모습은 원본과 같지만 글자를 선택하거나 검색할 수 있습니다.
자주 묻는 질문
파일이 서버에 저장되나요?
아니요. 선택한 PDF는 어디로도 전송되지 않고, 지금 보고 있는 브라우저 안에서만 처리됩니다. 다만 OCR 엔진(Tesseract.js)과 언어 데이터 파일은 최초 실행 시 별도의 CDN에서 내려받으며, 여기에는 방문자의 문서 내용이 전혀 포함되지 않습니다.
어떤 언어를 인식할 수 있나요?
한국어와 영어만 지원합니다(한국어+영어 혼용 문서도 인식 가능). 이 두 언어 외의 문자(중국어, 일본어, 아랍어 등)가 포함된 문서는 지원하지 않으며, 억지로 시도하면 엉뚱한 글자로 인식될 수 있습니다.
정확하게 인식되나요?
스캔 품질, 해상도, 글자가 기울어진 정도, 배경의 잡음 등에 따라 인식률이 크게 달라집니다. 선명하고 반듯하게 스캔된 문서일수록 정확도가 높고, 손글씨는 인식률이 매우 낮으니 참고해 주세요. 결과 화면의 "평균 인식률"은 Tesseract.js가 보고하는 신뢰도 점수의 평균으로, 실제 정확도와 정확히 일치하지 않을 수 있습니다.
시간이 얼마나 걸리나요?
문서 안의 글자를 실제로 인식하는 과정이라 페이지당 수 초에서 수십 초까지 걸릴 수 있으며, 모두 방문자의 브라우저 안에서(별도 서버 없이) 처리되므로 페이지 수가 많은 문서는 시간이 오래 걸리고 컴퓨터 자원을 많이 사용할 수 있습니다. 처리 중에는 창을 닫지 말고 기다려 주세요.
이미 글자가 있는(선택되는) PDF에 사용하면 어떻게 되나요?
이 도구는 페이지에 기존 텍스트 레이어가 있는지 미리 확인하지 않고 항상 새로 인식한 글자를 추가로 겹쳐 그립니다. 이미 선택 가능한 PDF에 사용하면 보이지 않는 글자 레이어가 중복으로 하나 더 생기지만, 화면에 보이지 않으므로 눈에 띄는 문제는 없습니다. 다만 불필요한 처리이니 이미 텍스트가 선택되는 문서에는 사용하지 않는 것을 권장합니다.
비밀번호로 잠긴 PDF도 가능한가요?
비밀번호가 걸린 PDF는 지원하지 않습니다. 먼저 잠금을 해제한 뒤 이용해 주세요.
결과 PDF를 열었을 때 원본과 다르게 보이나요?
아니요. 인식된 글자는 눈에 보이지 않는 투명한 상태로 원본 페이지 위에 정확한 위치에 겹쳐지므로, 화면에 보이는 모습은 원본과 동일합니다. 다만 인식이 완벽하지 않을 수 있어 실제로 마우스로 드래그해 보면 글자 상자의 위치나 크기가 원래 글자와 조금 차이 날 수 있습니다.