스캔 PDF 텍스트 추출 (PDF OCR)
브라우저 안에서만 처리됩니다. 입력한 내용과 선택한 파일은 서버로 전송되지 않습니다. 익명 방문 통계만 집계합니다.
파일을 여기에 끌어다 놓거나 클릭해서 선택하세요.
선택한 파일은 브라우저 안에서만 처리됩니다.
PDF 를 그리는 데 pdf.js, 글자 인식에 tesseract.js (둘 다 Apache-2.0)를 씁니다. 인식 엔진과 한국어·영어 언어 데이터를 이 사이트가 직접 제공하므로, 인식 때문에 외부로 나가는 요청은 없습니다.
사용법
- 스캔한 PDF 를 끌어다 놓거나 클릭해서 선택합니다(키보드로는 Tab 으로 상자에 가서 Enter). 파일은 서버로 전송되지 않고 이 브라우저 안에서만 처리됩니다.
- 파일을 열면 쪽마다 글자 정보가 이미 들어 있는지 먼저 확인해 알려 드립니다. 모든 쪽에 글자 정보가 있다면 OCR 보다 "PDF 텍스트 추출" 이 빠르고 정확합니다.
- 인식 언어(한국어+영어, 한국어만, 영어만)와 인식할 쪽을 고릅니다. 쪽 칸을 비우면 전체이고, 한 번에 최대 100쪽까지 인식합니다.
- "텍스트 인식 시작" 을 누릅니다. 처음 한 번은 인식 엔진과 언어 데이터(한국어+영어 약 22MB)를 받느라 시간이 걸리고, 이후에는 쪽마다 진행률이 보입니다. 도중에 "취소" 를 누르면 그때까지 인식한 쪽은 남습니다.
- 쪽마다 원본 쪽과 인식 결과가 나란히 나옵니다. "원본 크게 보기" 로 대조해 본 뒤 전체를 복사하거나 .txt 파일로 내려받습니다. 쪽 구분선(--- 3쪽 ---)을 넣을지 고를 수 있습니다.
자주 묻는 질문
"PDF 텍스트 추출" 과 무엇이 다른가요?
PDF 에는 두 종류가 있습니다. 워드·한글에서 PDF 로 저장한 문서는 글자 자체가 파일에 들어 있어서 그대로 꺼내면 됩니다(PDF 텍스트 추출). 종이를 스캐너나 휴대폰으로 찍어 만든 PDF 는 쪽마다 사진 한 장이 들어 있을 뿐 글자 정보가 없습니다. 이 도구는 그 사진을 읽어 글자를 추정합니다(OCR). 추정이라 틀릴 수 있고 쪽마다 몇 초씩 걸립니다. 그래서 파일을 열면 글자 정보가 이미 있는지 먼저 확인해, 있으면 PDF 텍스트 추출을 쓰라고 알려 드립니다.
글자 정보가 있다는데 왜 OCR 을 할 수 있게 두나요?
글자 정보가 있어도 뽑아 보면 글자가 깨져 나오는 PDF 가 있습니다. 글꼴 안의 글자 모양과 실제 문자를 잇는 대응표가 빠진 채 만들어진 파일이 그렇습니다. 그런 문서는 화면에 보이는 모양을 읽는 OCR 이 오히려 맞는 방법이라 막지 않습니다. 스캔본 위에 다른 프로그램이 이미 OCR 결과를 보이지 않는 글자로 얹어 둔 파일도 있는데, 그 품질이 나쁘면 다시 인식하는 편이 낫습니다.
결과에 틀린 글자가 섞여 나옵니다. 왜 그런가요?
OCR 은 픽셀 모양에서 가장 그럴듯한 글자를 고르는 추정입니다. 이 도구를 만들며 두 가지로 시험했습니다. 컴퓨터로 글자를 그림으로 그린 시험 이미지 26쪽(8~12pt, 200~300dpi, 조금 기울거나 잡음을 넣은 것 포함)과, 실제 공개 문서를 사무실 스캔·휴대폰 촬영처럼 흐리게 만든 시험 이미지 21쪽입니다. 진짜 종이를 스캔한 것은 아닙니다. 본문 위주 쪽은 공백을 뺀 100자 중 대체로 15자 이하가 틀렸지만, 서식·표가 많은 쪽은 19~31자가 틀렸습니다. 자주 나온 오류는 모양이 비슷한 글자(정→성, 층→증), 가운뎃점(·)이 빠지는 것, 숫자·기호가 바뀌는 것(부가세(10%)→(1096), 20260915→22260915), 한글 낱말이 영문 글자로 읽히는 것(전자문서→EXIM)입니다. 금액·날짜·번호는 반드시 원본과 대조하세요. 쪽마다 인식기가 스스로 매긴 신뢰도를 보여 드리고 80% 미만이면 따로 표시하지만, 이 값은 정답과 비교한 정확도가 아닙니다 — 시험에서 100자 중 31자가 틀린 서식 쪽이 신뢰도 86%였고, 단이 둘인 쪽은 순서가 뒤섞였는데도 92%였습니다.
띄어쓰기는 어떻게 처리하나요? 공백이 여러 칸 들어간 곳이 있습니다.
인식 엔진의 한국어 모델은 기본 설정 그대로 쓰면 "대 한 민 국" 처럼 음절마다 공백을 넣는 일이 잦습니다. 이 도구는 종이 위 글자 사이의 실제 간격을 재서 그만큼만 공백을 넣도록 설정해 두었습니다. 그래서 띄어쓰기는 종이에 보이는 대로 나오지만, 간격이 넓은 자리(표의 칸 사이, 양쪽 정렬로 벌어진 자리)에는 공백이 여러 칸 들어갑니다. 한 칸으로 줄이고 싶다면 붙여 넣은 뒤 편집기의 바꾸기 기능을 쓰세요.
표나 단이 둘인 문서는 어떻게 나오나요?
이 도구는 쪽을 위에서 아래로 놓인 글줄의 한 단으로 읽습니다. 선으로 칸을 나눈 표를 시험했을 때 행마다 한 줄로, 칸 사이는 공백 여러 칸으로 나왔습니다 — 칸 경계 정보 자체는 결과에 없습니다. 단이 둘인 문서는 왼쪽 단과 오른쪽 단의 같은 높이 줄이 한 줄로 이어져 나옵니다. 단을 자동으로 나눠 읽는 방식도 시험했지만 평범한 한국어 문단까지 조각내 순서를 뒤섞어서 쓰지 않았습니다. 단이 둘인 문서는 "PDF를 이미지로" 로 바꾼 뒤 "이미지 자르기" 로 단마다 잘라 "이미지 텍스트 추출" 에 넣는 방법이 있습니다.
기울거나 옆으로 누운 쪽은요?
조금 기운 스캔은 인식 전에 기울기를 재서 바로 세운 뒤 읽습니다 — 2°와 5° 기울인 시험 스캔(각 3쪽)을 세 쪽 합계로 공백을 뺀 100자 중 2~3자 오류로 읽었습니다. 90°로 누운 쪽은 세우지 못해 시험에서 글자를 하나도 찾지 못했습니다. PDF 안에 회전 정보가 적혀 있어 화면에 바로 보이는 쪽은 보이는 방향 그대로 읽습니다. 누운 쪽은 "PDF 회전" 도구로 바로 세운 뒤 다시 넣어 주세요.
손글씨도 읽나요?
보장하지 못합니다. 여기서 쓰는 인식 엔진(Tesseract)의 공식 언어 데이터는 여러 글꼴로 찍은 글줄로 학습되었습니다. 손글씨풍 글꼴로 쓴 시험 쪽은 100자 중 6자 정도가 틀렸지만, 글꼴은 같은 글자를 늘 같은 모양으로 그리는 반면 실제 손글씨는 사람마다, 글자마다 모양이 달라 이보다 훨씬 많이 틀릴 수 있습니다. 도장·서명 같은 그림 글씨는 엉뚱한 글자로 나올 수 있습니다.
얼마나 걸리나요? 왜 한 번에 100쪽까지인가요?
쪽을 300dpi 그림으로 그린 뒤 기울기를 재고 글자를 읽습니다. 걸리는 시간은 쪽에 든 글자 양에 따라 달라집니다. 컴퓨터 크롬에서 잰 값으로 글자가 빽빽한 A4(1,100자 남짓)는 쪽당 10초 안팎, 글자가 적은 쪽(200자 안팎)은 3초 안팎이었고, 섞인 문서 30쪽은 평균 8초였습니다. 엔진을 처음 띄울 때는 데이터를 받고 준비하는 시간이 더 걸리고, 휴대폰처럼 느린 기기에서는 더 오래 걸립니다. 100쪽이면 십수 분이 걸리는데, 그보다 길게 돌리면 도중에 탭을 닫거나 화면이 꺼져 결과를 전부 잃기 쉽습니다. 더 긴 문서는 쪽 범위를 1-100, 101-200 처럼 나눠 여러 번 돌리세요. 결과에 쪽 번호가 붙어 있어 이어 붙이기 쉽습니다.
인식 언어는 무엇을 고르면 되나요?
기본값인 한국어+영어가 가장 무난합니다. 인터넷 주소·전자우편·영어 문장이 섞인 문서에서는 한국어+영어가 훨씬 정확했습니다(시험 문서에서 100자당 틀린 글자 11자 대 29자). 반대로 한글만 있는 문서는 "한국어만" 이 더 정확하게 나오기도 했습니다(시험 문서 두 개에서 10~11자 → 5~7자). 한글만 있는 문서에서 한글 낱말이 영문 글자로 바뀌어 나온다면 "한국어만" 으로 다시 인식해 보세요.
처음에 받는 데이터가 얼마나 되나요?
인식 엔진과 언어 데이터를 합쳐 한국어+영어는 약 22MB, 한국어만은 약 11MB, 영어만은 약 15MB 입니다. "텍스트 인식 시작" 을 누를 때 처음 받으며, 페이지를 열기만 해서는 받지 않습니다. 언어 데이터는 브라우저 저장소에 남아 다음 방문 때는 다시 받지 않습니다. 모바일 데이터를 아끼려면 영어가 없는 문서는 "한국어만" 을 고르세요.
한자도 읽나요?
읽지 못합니다. 한국어 언어 데이터는 한자를 읽을 때 중국어(번체) 데이터를 함께 불러오도록 설정되어 있는데, 이 도구는 그 데이터를 싣지 않았습니다. 시험에서 한자가 섞인 문장("大韓民國 憲法 第1條…", "株式會社 代表理事…")은 공백을 뺀 100자 중 90자 가까이 틀렸습니다. 등기부등본·법령·옛 문서처럼 한자가 섞인 문서는 한자 부분이 엉뚱한 한글·기호로 나오니 원본을 보고 고쳐 주세요.
암호가 걸린 PDF 도 되나요?
열람 암호가 걸린 PDF 는 열지 못하고, 이 도구는 암호를 풀어 주지 않습니다. 암호를 아는 프로그램에서 암호를 해제한 사본을 만든 뒤 넣어 주세요. 열람 암호 없이 열리는 PDF(인쇄·복사 제한만 걸린 파일)는 그대로 열립니다.
결과를 검색 가능한 PDF 로 저장할 수 있나요?
지금은 텍스트(.txt)로만 드립니다. 인식한 글자를 원본 PDF 위에 보이지 않는 글자로 겹쳐 넣어 검색·복사가 되는 PDF 를 만드는 기능은 이 도구에 없습니다.
파일이 서버로 올라가나요?
올라가지 않습니다. PDF 를 여는 것, 쪽을 그림으로 그리는 것, 글자를 인식하는 것이 모두 이 브라우저 안에서 일어납니다. 인식 엔진과 언어 데이터도 외부 CDN 이 아니라 이 사이트가 직접 제공합니다.