PDF 텍스트 추출

브라우저 안에서만 처리됩니다. 입력한 내용과 선택한 파일은 서버로 전송되지 않습니다.

파일을 여기에 끌어다 놓거나 클릭해서 선택하세요.

선택한 파일은 브라우저 안에서만 처리됩니다.

사용법

  1. PDF 파일을 끌어다 놓거나 클릭해서 선택합니다. 파일은 서버로 전송되지 않고 이 브라우저 안에서만 처리됩니다.
  2. 줄바꿈 방식을 고릅니다 — "보이는 그대로"는 표나 코드처럼 줄이 의미를 갖는 문서에, "문단으로 이어 붙이기"는 다른 문서에 옮겨 쓸 때 맞습니다.
  3. 필요하면 쪽 범위를 좁히고, 쪽 구분선을 넣을지 정합니다.
  4. 결과를 복사하거나 .txt 파일로 내려받습니다.

자주 묻는 질문

PDF 에서 복사한 글이 이상하게 붙거나 줄이 끊깁니다.

PDF 안에는 "줄"이나 "문단"이라는 것이 없습니다. 좌표에 놓인 글자 조각만 있고, 한 줄이 글꼴이 바뀌는 자리마다 여러 조각으로 쪼개져 있습니다. 그래서 그냥 순서대로 이으면 글이 뒤죽박죽 됩니다. 이 도구는 조각의 좌표를 보고 같은 줄을 다시 묶고, 조각 사이가 벌어진 자리에는 공백을 넣고, 줄 간격이 갑자기 넓어지는 자리를 문단 경계로 판단합니다.

"문단으로 이어 붙이기"는 무엇을 하나요?

PDF 는 화면 폭에 맞춰 문장 가운데에서 줄을 바꿉니다. 그대로 복사해 문서에 붙이면 문장마다 줄바꿈이 박혀 있어 다시 지워야 합니다. 이 모드는 한 문단 안의 줄바꿈을 없애 한 줄로 잇습니다. 한글끼리는 붙여서, 라틴 문자 사이에는 공백을 넣어서 이으며, 앞 줄이 하이픈으로 끝나면 낱말을 쪼갠 하이픈으로 보고 떼어 냅니다.

글자가 하나도 안 나옵니다.

스캔한 종이를 사진으로 담은 PDF 입니다. 이런 파일에는 글자 정보가 아예 없고 그림만 있어서 뽑을 것이 없습니다. 화면에도 그 사실을 알려드립니다. 그림에서 글자를 읽으려면 OCR 이 필요합니다 — 이미지 도구 모음의 이미지 글자 인식(OCR)을 쓰거나, PDF 를 이미지로 바꿔 넣으세요.

일부 쪽만 비어 있습니다.

그 쪽만 그림으로 되어 있는 경우입니다. 문서 안에 표나 도면을 그림으로 넣은 문서에서 흔합니다. 비어 있는 쪽 번호를 결과에 표시하므로 어느 쪽을 따로 처리해야 하는지 알 수 있습니다.

표가 제대로 안 나옵니다.

PDF 의 표는 선과 글자가 각각 따로 놓인 것이라 "칸" 정보가 없습니다. 이 도구는 같은 줄에 있는 글자를 왼쪽부터 이어 붙이므로 표의 한 행이 한 줄로 나옵니다. 칸 경계는 공백으로만 구분되니 "보이는 그대로" 모드를 쓰고 결과를 손으로 정리하는 편이 낫습니다.

암호가 걸린 PDF 도 되나요?

되지 않습니다. 열지 못하면 그 사실을 알려드립니다.

파일이 서버로 올라가나요?

올라가지 않습니다. PDF 를 읽고 글자를 뽑는 모든 과정이 브라우저 안에서 끝납니다. 네트워크를 끊고도 동작합니다.