PDF 문자 인식
스캔한 PDF에서 텍스트를 추출하고 검색 가능하게 만듭니다. 문서 언어를 자동으로 감지합니다. 100% 로컬 처리 — 업로드 없음.
스캔한 PDF에서 텍스트를 추출하고 검색 가능하게 만듭니다. 문서 언어를 자동으로 감지합니다. 100% 로컬 처리 — 업로드 없음.
스캔한 PDF에서 텍스트를 추출하고 검색 가능하게 만들고 내용을 복사하세요 — 브라우저에서 OCR(광학 문자 인식)을 사용해 바로 처리합니다. 소프트웨어 설치도, 계정도 필요 없으며 파일은 기기를 절대 벗어나지 않습니다.
PDFree는 OCR을 실행하기 전에 문서의 언어를 자동으로 감지하므로 추측할 필요가 없습니다. 스캔한 계약서, 교과서, 청구서, 보관 문서 등 수십 개 언어와 문자 체계에서 작동합니다.
파일을 끌어다 놓거나 "PDF 선택"을 클릭하세요. PDFree는 PDF에 이미 텍스트 레이어가 있는지, 아니면 순수한 스캔 이미지인지 자동으로 감지합니다.
스캔한 PDF의 경우: OCR 엔진 설치를 클릭해 Tesseract.js(약 17MB, 최초 1회 다운로드)를 불러옵니다. PDFree는 페이지를 분석해 문서 언어를 자동으로 제안합니다. 필요하면 드롭다운에서 변경할 수 있습니다. 텍스트 레이어가 있는 PDF는 이 단계를 건너뜁니다.
문자 인식 엔진이 각 페이지를 로컬에서 처리합니다 — 업로드되는 것은 없습니다. 진행률 표시줄에 예상 남은 시간이 표시됩니다.
텍스트 인식이 끝나면 PDF가 자동으로 다운로드됩니다. 원본 모습은 변하지 않으며, 보이지 않는 텍스트 레이어만 추가되어 어떤 PDF 리더에서도 검색·선택·복사가 가능해집니다.
이미지 형태의 문서를 가지고 있고 그 안의 텍스트로 작업해야 할 때 OCR이 유용합니다:
PDFree는 어떤 종류의 PDF인지 자동으로 감지합니다. 텍스트 레이어가 있는 PDF(Word, Google Docs 등 최신 앱에서 디지털로 만든 대부분의 PDF)는 이미 기계가 읽을 수 있는 텍스트를 포함하고 있어 OCR 엔진 없이 즉시 추출됩니다. 스캔한 PDF(페이지 사진, 팩스, 오래된 보관 스캔본)는 이미지만 포함하고 있어 픽셀을 선택·검색 가능한 텍스트로 변환하려면 OCR이 필요합니다.
대부분의 OCR 도구는 문서 언어를 미리 선택하게 하며, 잘못 선택하면 조용히 정확도가 떨어집니다. PDFree는 대신 페이지 내용을 분석해 올바른 언어를 자동으로 제안합니다 — 정말 독특한 기능입니다. 인식 엔진은 PDFree의 6개 인터페이스 언어 중 어떤 것을 사용하든 독립적으로 작동하기 때문입니다. 한국어 인터페이스를 사용하면서 러시아어, 일본어, 터키어 스캔본을 읽고 있나요? 감지 기능은 여전히 문서의 실제 언어를 찾아냅니다. 언제든지 제안을 수동으로 변경할 수 있습니다.
PDFree는 선도적인 오픈소스 텍스트 인식 엔진인 Tesseract.js를 사용하며 18개 언어를 지원합니다: 영어, 프랑스어, 독일어, 스페인어, 이탈리아어, 포르투갈어, 러시아어, 우즈베크어, 네덜란드어, 폴란드어, 터키어(유럽 문자) 및 아랍어, 일본어, 중국어 간체, 중국어 번체, 한국어, 힌디어, 태국어(복잡한 문자).
검색 가능한 PDF는 원본 스캔 이미지를 정확히 그대로 유지하면서 그 위에 보이지 않는 텍스트 레이어를 추가합니다 — 보관, PDF 리더 내 검색, 공유에 유용합니다. .txt 파일은 페이지 구분자가 있는 추출된 일반 텍스트만 포함합니다 — Word에서 편집하거나 다른 도구로 가져오는 데 유용합니다. ".txt 사본도 다운로드" 옵션을 켜면 두 파일을 한 번에 받을 수 있습니다.
스캔한 문서에는 계약서, 의료 기록, 개인 편지, 세금 서류 등 민감한 내용이 담긴 경우가 많습니다. PDFree에서는 아무것도 업로드되지 않습니다. OCR 엔진(Tesseract.js)은 한 번만 다운로드된 뒤 브라우저 탭 안에서 완전히 실행됩니다. 파일을 받는 서버도, 클라우드 저장소도, 어떤 종류의 데이터 수집도 없습니다. 처리 중에 개발자 도구 → 네트워크 탭을 열어 직접 확인해 보세요: 업로드가 전혀 없습니다.
처음 OCR을 실행할 때 Tesseract.js 엔진(약 17MB, 브라우저에 캐시됨)이 다운로드되고 나면 PDFree OCR은 완전히 오프라인으로 작동합니다. 이후 문서를 처리할 때는 인터넷 연결이 필요 없습니다 — 법률 사무소, 의료 시설, 기밀 문서 검토처럼 네트워크 접근이 제한된 환경에 적합합니다.
스캔한 PDF를 편집 가능한 텍스트로 변환하려면 PDFree를 두 단계로 사용하세요: 먼저 OCR을 실행해 검색 가능한 PDF를 만들고(위 참조), 그 결과를 PDF를 Word로 변환에서 엽니다 — 이 도구는 내장된 텍스트 레이어를 완전히 편집 가능한 .docx 문서로 변환합니다. 전체 과정은 로컬에서 실행되며 문서는 어디로도 업로드되지 않습니다.
네, 완전히 무료입니다. 구독도, 프리미엄 등급도, 파일당 요금도 없습니다. OCR 엔진(Tesseract.js)은 오픈소스이며 브라우저에서 완전히 실행됩니다.
아니요. PDFree에는 파일을 받는 백엔드 서버가 없으므로 어떤 것도 저장, 기록, 보관될 수 없습니다. PDF와 인식된 텍스트는 세션 동안 브라우저 메모리에만 존재하며 탭을 닫으면 지워집니다.
절대 아닙니다. 모든 처리는 브라우저 탭 안에서 이루어집니다. PDF 파일은 기기를 절대 벗어나지 않으며 어떤 서버도 받지 않습니다. Tesseract.js 엔진은 CDN에서 한 번만 다운로드되어 캐시되며, 이후에는 완전히 오프라인으로 작동합니다.
PDFree는 스캔한 페이지에서 텍스트를 분석해 OCR을 실행하기 전에 가장 가능성 높은 문서 언어를 제안합니다 — 미리 알 필요가 없습니다. 이는 사이트의 인터페이스 언어와 무관하게 작동합니다. 언제든지 드롭다운에서 제안을 변경할 수 있습니다.
18개 언어: 영어, 프랑스어, 독일어, 스페인어, 이탈리아어, 포르투갈어, 러시아어, 우즈베크어, 네덜란드어, 폴란드어, 터키어, 아랍어, 일본어, 중국어(간체·번체), 한국어, 힌디어, 태국어.
아니요. PDFree는 원본 스캔 페이지 위에 보이지 않는 텍스트 레이어만 추가합니다. 모습은 변하지 않습니다 — 이미지, 레이아웃, 서식이 정확히 그대로 유지됩니다.
OCR 정확도는 원본 스캔 품질에 따라 달라집니다. 낮은 해상도(150 DPI 미만), 흐리거나 기울어진 페이지, 색깔 있는 배경, 손글씨는 모두 신뢰도 점수를 낮춥니다. 최상의 결과를 위해서는 300 DPI 이상, 좋은 조명으로 스캔하세요.
PDFree OCR은 최대 200MB까지 파일을 지원합니다. 모바일(iOS/iPadOS)에서는 메모리 문제를 방지하기 위해 처음 30페이지만 처리됩니다 — 나머지를 처리하려면 먼저 PDF를 분할하세요. 데스크톱 브라우저에는 제한이 없습니다.
네. 처음 OCR을 실행할 때 Tesseract.js 엔진이 다운로드되고 나면 PDFree는 프로그레시브 웹 앱으로서 완전히 오프라인으로 작동합니다.