PDF 텍스트 추출
PDF 내부에 삽입된 텍스트를 그대로 뽑아옵니다. 이미지만 있는 스캔본 PDF는 텍스트가 없을 수 있어요.
PDF 텍스트 추출이 하는 일
PDF 안의 글자를 텍스트로 꺼냅니다. 복사 붙여넣기가 안 되는 PDF, 페이지가 많아 일일이 복사하기 힘든 PDF에서 본문을 한 번에 가져올 때 씁니다. 결과는 텍스트 파일로 저장하거나 바로 복사할 수 있습니다.
되는 PDF와 안 되는 PDF
- 됩니다 — 워드·한글·구글독스에서 저장한 PDF, 웹페이지를 인쇄한 PDF, 전자 문서. 글자가 텍스트 레이어로 들어 있는 경우
- 안 됩니다 — 종이를 스캔한 PDF, 사진으로 만든 PDF. 글자가 이미지라서 텍스트가 없습니다
구분하는 법: PDF 뷰어에서 글자를 드래그해 선택이 되면 텍스트 레이어가 있는 겁니다. 선택이 안 되면 스캔본이라 OCR이 필요합니다.
사용법
- PDF 파일을 올립니다. 브라우저 안에서 처리되고 서버로 전송되지 않습니다.
- 전체 또는 페이지 범위를 정합니다. 예: 3-7
- 추출된 텍스트가 페이지 구분과 함께 나옵니다.
- 복사하거나 .txt로 저장합니다.
결과가 이상할 때
- 단어가 붙어 나옴 — PDF가 글자 위치만 저장하고 띄어쓰기 정보가 없는 경우. 원본 문서에서 다시 내보내는 게 낫습니다
- 순서가 뒤섞임 — 2단 편집 문서는 왼쪽 단과 오른쪽 단이 줄 단위로 섞일 수 있습니다
- 글자가 깨짐 — 폰트가 임베드되지 않았거나 특수 인코딩. 다른 PDF 뷰어에서 저장한 뒤 다시 시도
- 표가 무너짐 — 표는 텍스트로 꺼내면 열 구분이 사라집니다. 표 데이터는 CSV 변환으로 따로 정리하세요
관련 도구
자주 묻는 질문
Q. 암호 걸린 PDF도 되나요?
열람 암호가 있으면 먼저 풀어야 합니다. 암호를 아시면 뷰어에서 열어 암호 없이 다시 저장하세요.
Q. 용량 제한이 있나요?
브라우저 메모리 안에서 처리하므로 수십 MB까지는 됩니다. 수백 페이지짜리는 범위를 나눠 처리하세요.
Q. 스캔본은 어떻게 하나요?
OCR(광학 문자 인식)이 필요합니다. 이 도구는 OCR을 하지 않습니다.
파일은 브라우저 안에서만 처리됩니다. 계약서나 내부 문서를 올려도 서버에 남지 않습니다.