PDF 텍스트 추출
PDF 안에 든 글자를 텍스트로 꺼냅니다.
파일이 서버에 올라가지 않습니다. 선택한 파일은 이 기기를 벗어나지 않고 브라우저 안에서 처리됩니다. 페이지를 닫으면 사라지며, 저장되거나 전송되는 기록이 없습니다.
도구를 불러오는 중입니다.
사용 방법
- PDF 파일 하나를 선택합니다.
- 쪽 구분을 유지할지 고릅니다.
- 추출을 누르면 텍스트가 나오고, 복사하거나 txt로 저장할 수 있습니다.
PDF 텍스트 추출 자세한 설명 보기 입력 요령, 한계, 막힐 때 대처법을 정리해 두었습니다. · PDF 다루기 주제 전체 보기
자주 묻는 질문
- 글자가 하나도 안 나옵니다.
- 스캔한 이미지 PDF일 가능성이 큽니다. 종이를 찍은 사진이 들어 있을 뿐 문자 정보가 없는 파일이라, 문자 인식(OCR)을 거쳐야 텍스트를 얻을 수 있습니다.
- 줄바꿈이 이상하게 됩니다.
- PDF는 글자의 위치 좌표만 갖고 있어서 문단 구조를 정확히 복원하기 어렵습니다. 특히 표나 다단 편집 문서는 읽는 순서가 원본과 달라질 수 있습니다.
- 한글이 깨져 나옵니다.
- PDF를 만들 때 글꼴을 특수한 방식으로 넣으면 글자 정보가 유실되는 경우가 있습니다. 원본 문서가 있다면 그쪽에서 복사하는 편이 정확합니다.
이 도구를 다룬 글
글자만 뽑습니다
서식과 배치는 버리고 글자만 가져옵니다. 내용을 옮겨 적거나 검색할 때 씁니다.
워드로 바꾸는 것보다 결과가 예측 가능합니다. 서식을 흉내 내려다 어긋나는 일이 없기 때문입니다.
스캔본은 안 됩니다
⚠️ 사진으로 찍거나 스캔한 PDF 는 그림 한 장이라 뽑을 글자가 없습니다. 결과가 비어 나옵니다.
글자를 드래그해 보세요
→ 네모로 잡히면 그림
→ 글자로 잡히면 텍스트
그림이라면 OCR 이 필요한데, 이 도구는 하지 않습니다.
줄이 끊겨 나온다면
PDF 는 화면에 보이는 줄마다 끊어 저장하는 경우가 많습니다. 뽑으면 문장 중간에서 줄이 바뀝니다.
문단 합치기 도구로 이어 붙이면 읽기 좋아집니다. 한국어 종결어미를 알아보고 문장 단위로 붙입니다.
글자가 깨져 나온다면
뷁뷁뷁 같은 게 나온다면 글꼴을 넣은 방식 때문입니다.
PDF 에 글꼴을 넣을 때 실제 글자 코드가 아니라 글꼴 안의 순번으로 저장되는 경우가 있습니다. 되돌릴 정보가 없어 복구가 어렵습니다.
이때는 스캔본처럼 다뤄야 합니다.
표는 어떻게 되나
표의 칸이 순서대로 나열됩니다. 표 모양은 사라집니다.
표가 중요하다면 엑셀로 뽑는 도구를 쓰시거나, 뽑은 뒤 표 만들기 도구로 다시 짜시면 됩니다.