PDF 텍스트 추출
브라우저 안에서만 처리됩니다. 입력한 내용과 선택한 파일은 서버로 전송되지 않습니다.
파일을 여기에 끌어다 놓거나 클릭해서 선택하세요.
선택한 파일은 브라우저 안에서만 처리됩니다.
사용법
- PDF 파일을 끌어다 놓거나 클릭해서 선택합니다. 파일은 서버로 전송되지 않고 이 브라우저 안에서만 처리됩니다.
- 줄바꿈 방식을 고릅니다 — "보이는 그대로"는 표나 코드처럼 줄이 의미를 갖는 문서에, "문단으로 이어 붙이기"는 다른 문서에 옮겨 쓸 때 맞습니다.
- 필요하면 쪽 범위를 좁히고, 쪽 구분선을 넣을지 정합니다.
- 결과를 복사하거나 .txt 파일로 내려받습니다.
자주 묻는 질문
PDF 에서 복사한 글이 이상하게 붙거나 줄이 끊깁니다.
PDF 안에는 "줄"이나 "문단"이라는 것이 없습니다. 좌표에 놓인 글자 조각만 있고, 한 줄이 글꼴이 바뀌는 자리마다 여러 조각으로 쪼개져 있습니다. 그래서 그냥 순서대로 이으면 글이 뒤죽박죽 됩니다. 이 도구는 조각의 좌표를 보고 같은 줄을 다시 묶고, 조각 사이가 벌어진 자리에는 공백을 넣고, 줄 간격이 갑자기 넓어지는 자리를 문단 경계로 판단합니다.
"문단으로 이어 붙이기"는 무엇을 하나요?
PDF 는 화면 폭에 맞춰 문장 가운데에서 줄을 바꿉니다. 그대로 복사해 문서에 붙이면 문장마다 줄바꿈이 박혀 있어 다시 지워야 합니다. 이 모드는 한 문단 안의 줄바꿈을 없애 한 줄로 잇습니다. 한글끼리는 붙여서, 라틴 문자 사이에는 공백을 넣어서 이으며, 앞 줄이 하이픈으로 끝나면 낱말을 쪼갠 하이픈으로 보고 떼어 냅니다.
글자가 하나도 안 나옵니다.
스캔한 종이를 사진으로 담은 PDF 입니다. 이런 파일에는 글자 정보가 아예 없고 그림만 있어서 뽑을 것이 없습니다. 화면에도 그 사실을 알려드립니다. 그림에서 글자를 읽으려면 OCR 이 필요합니다 — 이미지 도구 모음의 이미지 글자 인식(OCR)을 쓰거나, PDF 를 이미지로 바꿔 넣으세요.
일부 쪽만 비어 있습니다.
그 쪽만 그림으로 되어 있는 경우입니다. 문서 안에 표나 도면을 그림으로 넣은 문서에서 흔합니다. 비어 있는 쪽 번호를 결과에 표시하므로 어느 쪽을 따로 처리해야 하는지 알 수 있습니다.
표가 제대로 안 나옵니다.
PDF 의 표는 선과 글자가 각각 따로 놓인 것이라 "칸" 정보가 없습니다. 이 도구는 같은 줄에 있는 글자를 왼쪽부터 이어 붙이므로 표의 한 행이 한 줄로 나옵니다. 칸 경계는 공백으로만 구분되니 "보이는 그대로" 모드를 쓰고 결과를 손으로 정리하는 편이 낫습니다.
암호가 걸린 PDF 도 되나요?
되지 않습니다. 열지 못하면 그 사실을 알려드립니다.
파일이 서버로 올라가나요?
올라가지 않습니다. PDF 를 읽고 글자를 뽑는 모든 과정이 브라우저 안에서 끝납니다. 네트워크를 끊고도 동작합니다.