HWP 텍스트 추출

브라우저 안에서만 처리됩니다. 입력한 내용과 선택한 파일은 서버로 전송되지 않습니다. 익명 방문 통계만 집계합니다.

파일을 여기에 끌어다 놓거나 클릭해서 선택하세요.

선택한 파일은 브라우저 안에서만 처리됩니다.

본 제품은 한컴의 HWP 문서 파일(.hwp) 공개 문서를 참고하여 개발하였습니다. 문서 해석:rhwp(MIT 라이선스). "한글", "한컴", "HWP", "HWPX"는 한글과컴퓨터의 등록 상표이며, 이 도구는 한글과컴퓨터와 관계가 없습니다.

사용법

  1. HWP 또는 HWPX 파일을 끌어다 놓거나 클릭해서 선택합니다. 처음 한 번은 문서를 읽는 프로그램(한/글 해석기, 약 9.5 MB)을 내려받습니다 — 문서가 올라가는 것이 아니라 프로그램이 내려오는 것입니다.
  2. 암호가 걸린 문서라면 암호를 넣는 칸이 나옵니다. 문서를 만든 사람에게 받은 암호를 넣고 "열기"를 누릅니다.
  3. 모양을 고릅니다 — "문단 단위"는 문단 하나를 한 줄로, 표는 한 행을 한 줄로 만들고 칸 사이에 탭을 넣습니다. "보이는 줄 그대로"는 화면에 보이는 줄을 그대로 옮깁니다.
  4. 필요하면 쪽 범위(예: 1-3, 7)를 좁히고, 쪽마다 "--- 1쪽 ---" 같은 구분선을 넣을지 정합니다.
  5. 옆의 원본 쪽과 결과를 비교해 보고, "복사"를 누르거나 .txt 파일(UTF-8)로 내려받습니다.

자주 묻는 질문

표 안의 글자도 나오나요?

나옵니다. 이 도구가 쓰는 해석기에는 "쪽의 글"을 바로 돌려주는 기능이 있지만, 그 기능은 본문 문단만 돌려주고 표 안의 글자를 빼먹습니다 — 법령 서식 한 쪽에 써 보니 제목 두 줄만 나오고 표의 항목과 서명란이 전부 빠졌습니다. 공문서와 서식은 대부분 표라서 그 방식으로는 쓸 수가 없습니다. 그래서 이 도구는 쪽에 그려진 글자 조각을 전부 모으고, 조각마다 붙어 있는 "어느 문단·어느 표의 몇 행 몇 열 칸" 정보로 다시 묶습니다. 표는 한 행을 한 줄로, 칸 사이는 탭으로 나누므로 엑셀·구글 시트에 붙여 넣으면 칸이 맞습니다. 칸 안에 또 표가 있으면 그 칸 안의 글은 빈칸으로 이어 한 칸에 넣습니다. 글상자(테두리 있는 상자)는 표가 아니라 작은 본문으로 보고, 안의 문단은 한 줄씩, 안에 든 표는 행 단위로 뽑습니다.

줄바꿈이 한/글 화면과 다릅니다. 왜 그런가요?

"문단 단위" 모양은 일부러 화면의 줄바꿈을 없앱니다. 한/글 화면의 줄바꿈은 종이 폭 때문에 생긴 것이라, 그대로 옮기면 다른 곳에 붙여 넣을 때 문장 중간마다 줄바꿈을 지워야 합니다. PDF와 달리 한/글 문서에는 문단 경계가 정확히 들어 있어서 짐작하지 않고 문단 그대로 잇습니다. 화면과 같은 줄이 필요하면 "보이는 줄 그대로"를 고르세요. 다만 그 모양에서는 세로 가운데 정렬된 표 칸의 글자가 옆 칸의 둘째 줄과 같은 높이에 놓여 줄이 엇갈려 보일 수 있습니다 — 화면에 실제로 그렇게 놓여 있기 때문입니다.

한/글이 만드는 텍스트와 똑같은가요?

글자는 빠짐없이 나오지만 순서와 줄 나눔은 조금 다를 수 있습니다. 한/글은 파일 안에 앞부분의 미리보기 글(PrvText)을 함께 저장하는데, 공문서·서식 등 42개 문서에서 그 글을 934조각으로 나눠 대조했을 때 모든 조각이 이 도구의 결과에 들어 있었습니다. 다른 점은 이렇습니다. 칸이 여러 행에 걸쳐 합쳐진 표에서 한/글은 여러 행을 한 줄로 몰아 쓰고 이 도구는 행마다 나눕니다. 글머리표(❏·❍)와 각주 번호는 문단 앞에 붙여 남깁니다(한/글 미리보기 글에는 글머리표가 없습니다). 표가 어떤 문단에 딸려 있으면 그 문단의 글을 표 앞에 둡니다. 칸 앞뒤의 빈칸은 떼고, 고정폭 빈칸·묶음 빈칸은 보통 빈칸으로 바꾸며, 보이지 않는 줄 끝 하이픈 표시는 지웁니다.

순서가 어긋나는 경우도 있나요?

있습니다. 이 도구는 쪽마다 글자를 모으기 때문에 두 쪽에 걸친 문단은 쪽마다 따로 나옵니다(쪽 구분선을 켜면 그 자리가 보입니다). 쪽 위 아무 데나 떠 있는 글상자·표는 화면 위치가 아니라 딸린 문단의 자리에 나옵니다. 머리말·꼬리말·쪽 번호와 각주는 화면에 그려진 차례대로 나옵니다. 순서가 중요하면 옆의 원본 쪽과 비교해 보세요.

그림 속 글자나 스캔한 문서의 글자도 뽑히나요?

뽑히지 않습니다. 흔한 오해인데, 한/글 문서 안에 그림으로 붙인 표·도장·스캔 이미지의 글자는 글자 정보가 아니라 그림의 점일 뿐입니다. 이런 쪽은 결과에 "글자가 없는 쪽"으로 표시하고, 옆에 원본 쪽을 보여 드리니 그림인지 눈으로 확인할 수 있습니다. 그림에서 글자를 읽으려면 글자 인식(OCR)이 필요합니다.

배포용 문서도 추출되나요?

작성자가 복사를 막지 않았으면 됩니다. 한/글에서 "배포용 문서로 저장"을 할 때 작성자는 복사 제한을 고를 수 있고(한컴 도움말), 그 설정은 파일 안에 들어 있습니다(한컴이 공개한 배포용 문서 형식). 글자를 뽑아 내는 것은 복사와 같은 일이라, 이 도구는 그 설정을 읽어 복사 제한이 걸린 문서에서는 추출하지 않습니다. 설정을 읽지 못하면 추출하지 않는 쪽을 택합니다. 화면으로 보기만 할 거라면 HWP 뷰어에서 열 수 있습니다.

암호가 걸린 문서도 되나요?

암호를 알고 있으면 됩니다. 최근 한/글에서 건 암호(HWP·HWPX)와 일부 한/글 3.0 문서의 암호를 지원합니다. 넣은 암호는 이 브라우저 안에서 문서를 여는 데만 쓰고 저장하거나 보내지 않습니다. 회사·기관의 문서 보안(DRM) 프로그램으로 잠긴 파일은 열 수 없습니다.

어떤 파일은 열리지 않습니다.

공공기관 누리집에서 받은 ".hwp" 파일이 실제로는 PDF이거나 오류 안내 웹 페이지(HTML)인 경우가 실제로 있고, 이 도구는 그런 파일을 알아보고 무엇인지 알려 드립니다. 내려받기가 끊겨 끝이 잘린 파일도 열지 않습니다 — 잘린 채로 열면 앞부분만 읽혀서 문서가 원래 그만큼인 것처럼 보이기 때문입니다. 형식으로는 HWP 5.x(한/글 2002 이후)와 HWPX가 열리고, HWP 3.0(한/글 3.0~97)은 일부만 열리며, 한/글 2.x 이하와 50 MB가 넘는 파일은 열 수 없습니다. 안쪽 구조가 망가진 파일은 "손상됐다"고 따로 알려 드립니다.

파일이 서버로 올라가나요?

올라가지 않습니다. 파일을 읽고 글자를 모으는 모든 과정이 이 브라우저 안에서 끝납니다. 내려받는 것은 문서를 읽는 프로그램뿐이고, 문서 내용은 어디로도 보내지 않습니다. 문서 안에 들어 있을 수 있는 매크로(스크립트)는 실행하지 않습니다.