PDF 텍스트 추출
PDF에서 글자를 꺼내 페이지별로 복사하거나 텍스트 파일로 저장해요.
파일과 입력값은 이 브라우저 밖으로 나가지 않아요.
50MB 이하 PDF를 열 수 있어요. 스캔 문서는 이미지 글자 인식을 이용해 주세요.
PDF 텍스트 추출 소개
PDF 안에 들어 있는 글자를 꺼내 전체 또는 페이지별로 복사하고 TXT 파일로 저장해요. 필요한 페이지 범위를 지정하면 일부만 처리할 수도 있어요. 문서의 텍스트 정보를 읽는 방식이므로 사진으로만 이루어진 스캔 PDF와는 다르며, 파일은 외부로 전송하지 않고 기기 안에서 열어요.
텍스트 PDF와 스캔 PDF의 차이
문서 프로그램에서 만든 PDF는 글자의 내용과 위치를 포함하는 경우가 많아요. 이 도구는 그 정보를 읽어 텍스트로 모아요. 반면 종이를 촬영하거나 스캔해 만든 문서는 페이지가 이미지일 수 있어 글자를 추출해도 결과가 비어 있을 수 있어요.
빈 결과가 나오면 문서에서 글자를 선택할 수 있는지 확인해 보세요. 이미지뿐인 문서는 PDF → 이미지 도구로 페이지를 저장한 다음 이미지 글자 인식 도구를 이용할 수 있어요. 이 페이지는 자동 OCR이나 번역을 수행하지 않아요.
읽는 순서와 줄바꿈 확인하기
PDF의 글자 저장 순서는 화면에서 사람이 읽는 순서와 다를 수 있어요. 특히 여러 단으로 나뉜 문서, 표, 각주가 많은 페이지는 문장이 섞여 보일 수 있어요. 추출 결과는 원문의 내용을 확인하는 보조 수단으로 보고 필요한 부분을 직접 정리해 주세요.
글자 묶음 사이에 공백을 넣고 문서가 제공하는 줄 끝 정보를 반영해요. 글꼴, 색, 표의 테두리 같은 시각적 서식은 TXT에 담기지 않아요. 전체 저장은 페이지 사이를 빈 줄로 구분하며 페이지별 결과는 각각 따로 복사하거나 저장할 수 있어요.
PDF 텍스트 추출 사용 방법
- 50MB 이하 PDF 파일을 열어요.
- 페이지 범위를 적거나 비워 전체를 선택한 뒤 텍스트 추출을 눌러요.
- 전체 결과와 페이지별 결과를 살펴보고 필요한 글을 복사하거나 저장해요.
자주 묻는 질문
- 암호가 걸린 PDF도 되나요?
- 암호 입력 기능은 없어요. 권한이 있는 문서를 암호 없이 열 수 있는 상태로 준비해 주세요.
- 일부 페이지만 추출할 수 있나요?
- 1-3,5처럼 범위를 적을 수 있어요. 입력란을 비우면 전체 페이지를 처리해요.
- 페이지에 글자가 있는데 결과가 비어요.
- 스캔 이미지이거나 PDF에 문자 정보가 없을 수 있어요. 이미지 글자 인식 도구로 확인해 주세요.
- 표와 글꼴도 함께 저장되나요?
- 이 도구는 텍스트만 추출해요. 표 모양이나 글꼴과 같은 서식은 저장하지 않아요.
- 추출을 중간에 멈출 수 있나요?
- 처리 중 취소 버튼을 누를 수 있어요. 취소된 작업의 일부 결과는 저장하지 않고 다시 시작할 수 있어요.
알아 두면 좋은 점
- 원문과 추출 결과를 비교해 글자 누락이나 읽기 순서를 확인해 주세요. 기기 성능과 문서 구조에 따라 처리 시간이 달라져요.