guide·pdfty 팀··13 분 소요

PDF를 텍스트로 변환하는 방법 (편집·분석용 날 텍스트 추출)

어떤 PDF에서든 날 텍스트를 .txt 파일로 추출해 편집·스크립트·분석에 쓰세요 — 무료, 가입 없음. PDF가 스캔본일 때의 해법까지.

PDF에서 날 텍스트를 일반 텍스트 파일로 추출
PDF를 넣으면 → 날것의 편집 가능한 텍스트

가끔은 PDF가 정확히 틀린 그릇입니다. 글꼴도, 여백도, 2단 레이아웃도 필요 없고 — 원하는 건 원재료로서의 단어들입니다: 편집기에 붙여넣고, 스크립트에 흘려보내고, 세고, 번역하고, 가로질러 검색하고, 분석에 먹이려고요. PDF를 일반 텍스트로 변환하면 내용만 남기고 전부 벗겨내는데, 그게 바로 핵심입니다.

사람들이 이걸 하는 전형적인 이유:

  • 편집 — PDF 편집기와 씨름하지 않고 계약서 상용구나 보고서 텍스트를 재작업.
  • 스크립트와 분석 — grep, 단어 빈도, 데이터 파이프라인, 일반 텍스트를 먹는 도구에 문서 공급.
  • 번역 — 대부분의 번역 워크플로는 스타일 입힌 문서가 아니라 깨끗한 텍스트를 원합니다.
  • 접근성과 이식성 — .txt는 30년 된 기계까지, 무엇에서든 열립니다.

시작 전에 한 가지: pdfty의 텍스트 추출 은 같은 엔진입니다 — 둘 다 PDF에 내장된 텍스트를 꺼냅니다. 어느 쪽을 먼저 집어도 같은 단어를 얻습니다; PDF → TXT는 그것을 내려받을 수 있는 .txt 파일로 돌려줍니다.

PDF를 텍스트로 변환하는 방법 — 단계별

1

도구 열기

pdfty.com/ko/tools/pdf-to-txt 로 이동하세요. 20 MB·50페이지까지 무료, 계정 불필요.

Drop PDF here
2

PDF 업로드

끌어 넣으세요. 비밀번호가 걸려 있다면 먼저 잠금 해제 하세요.

Drop PDF here
3

변환

모든 페이지의 내장 텍스트 레이어가 순서대로 읽혀 나옵니다. 몇 초입니다.

Compressing…69%~2 seconds remaining
4

.txt 내려받기

문서의 전체 텍스트가 담긴 일반 텍스트 파일 하나. 업로드는 1시간 후 자동 삭제됩니다.

contract_draft.pdfDownload
5

결과 확인

한 번 훑어보세요. 비어 있거나 알 수 없는 문자라면 PDF가 스캔본입니다 — 아래 OCR 섹션을 보세요.

All done — file readyAuto-deleted in 1 hour
🔒 pdfty.com/en/tools/pdf-to-txt
pdfty PDF → TXT 도구
pdfty PDF → TXT: 문서의 단어들, 그 외에는 아무것도

스캔 문제: 추출할 텍스트가 없을 때

PDF 텍스트 추출에서 단연 가장 흔한 반전입니다. PDF는 텍스트를 완전히 다른 두 방식으로 담을 수 있습니다:

  1. 디지털 PDF(Word, 웹사이트, 인보이스 시스템에서 내보낸 것)는 진짜 텍스트 레이어를 갖고 있습니다. 추출은 즉각적이고 정확합니다.
  2. 스캔된 PDF(스캐너나 휴대폰 카메라에서 나온 것)에는 텍스트의 그림만 들어 있습니다. 말 그대로 추출할 것이 없습니다 — 출력은 빈 파일이 됩니다.

스캔본의 해법은 OCR — 광학 문자 인식 — 입니다. 픽셀을 읽어 텍스트 레이어를 만듭니다. 스캔본을 먼저 OCR 에 돌린 뒤, 그 결과를 텍스트로 변환하세요. 정확도는 스캔 품질에 달려 있습니다.

일반 텍스트 vs Word vs HTML — 구조가 얼마나 필요한가?

일반 텍스트는 스펙트럼의 한쪽 끝입니다. 어디에 내릴지 의도를 갖고 고르세요:

필요한 것맞는 도구살아남는 것
스크립트·편집용으로 단어만PDF → TXT모든 텍스트가 읽기 순서대로 — 레이아웃 제로, 스타일 제로
서식이 있는 편집 가능한 문서PDF → Word[PDF → Word](/ko/tools/pdf-to-word) 가 문단·글꼴·표를 유지
제목과 링크가 있는 웹용 마크업PDF → HTML[PDF → HTML](/ko/tools/pdf-to-html) 이 콘텐츠를 구조화
계산에 쓸 표PDF → Excel[PDF → Excel](/ko/tools/pdf-to-excel) 은 표 데이터를 겨냥한 도구

경험칙: 내용을 읽거나 처리할 거라면 TXT. 사람이 서식을 봐야 한다면 Word나 HTML.

무료 로컬 대안

일회성 작업에는 브라우저가 가장 빠르지만, 추출이 일상 도구라면 — 혹은 문서가 컴퓨터를 떠날 수 없다면 — 이 로컬 루트들이 탄탄합니다:

pdftotext(poppler-utils — 무료, 전 플랫폼). 명령줄 추출의 황금 표준:

pdftotext input.pdf output.txt

-layout 을 붙이면 원래 열 위치를 공백으로 근사합니다 — 표 형식 텍스트에 진짜로 유용합니다. macOS는 Homebrew, Linux는 패키지 관리자로 설치합니다.

뷰어에서 복사-붙여넣기. 한두 페이지라면 PDF 뷰어에서 전체 선택해 편집기에 붙여넣는 것으로 충분합니다. 줄바꿈 정리와 가끔 뒤섞인 열 정리는 각오하세요.

Microsoft Word. Word는 PDF를 열어 편집 가능한 문서로 변환하고, 거기서 .txt로 저장할 수 있습니다. 느리고, 지나가는 길에 문서를 다시 흘려 배치합니다 — 날 텍스트만 원할 때는 과잉입니다.

실전에서 걸리는 것들

  • 레이아웃은 사라집니다 — 설계상. 다단 페이지는 일렬 텍스트로 나오고, 표는 줄로 무너지고, 텍스트 상자는 콘텐츠 스트림에서 떨어지는 자리에 놓입니다. 열이 심하게 뒤섞이면 pdftotext -layout 이나 PDF → Word 가 복잡한 레이아웃을 더 잘 다룹니다.
  • 머리글·바닥글·페이지 번호가 반복됩니다. 반복 머리글이 출력에 페이지마다 한 번씩 나타납니다. 빠른 찾아-삭제 한 번(또는 한 줄짜리 스크립트)이면 정리됩니다.
  • 하이픈 분리. 양쪽 정렬 텍스트에서 줄 끝에 쪼개진 단어("docu- ment")는 쪼개진 채로 남습니다. "- " 뒤에 소문자가 오는 패턴을 찾아 바꾸면 됩니다 — 완벽하진 않지만 빠릅니다.
  • 합자와 기호. 멋 부린 타이포그래피(fi, fl, 둥근 따옴표)는 PDF가 실제로 인코딩한 문자로 나옵니다 — UTF-8에서는 대개 괜찮지만, 분석 전에 정규화 한 번 할 가치가 있을 때도 있습니다.
  • 빈 출력이나 깨진 출력은 거의 항상 스캔본(OCR부터)이거나, 드물게는 글꼴 인코딩을 의도적으로 난독화한 PDF입니다. 후자에도 아이러니하게 OCR이 해법입니다: 픽셀을 읽는 거니까요.

자주 묻는 질문

출력 파일이 왜 비어 있나요?

PDF가 거의 확실히 스캔본입니다 — 텍스트 레이어 없는 페이지 그림들이요. 먼저 OCR 을 돌린 뒤 추출하세요. 5초 테스트: PDF 뷰어에서 텍스트가 선택되지 않으면 텍스트가 없는 겁니다.

출력에 굵게, 제목, 글꼴이 유지되나요?

아니요 — .txt 파일은 서식을 아예 표현할 수 없어서 순수한 문자만 얻습니다. 그게 장점입니다: 편집하거나 스크립트를 짤 때 씨름할 것이 없습니다. 서식이 필요하면 PDF → Word 를 쓰세요.

표는 어떻게 되나요?

일반 줄로 평평해지고 열 정렬은 대체로 사라집니다. 작업할 표가 필요하면 PDF → Excel 이 정확히 그 용도로 만들어졌습니다.

텍스트 추출 도구와 같은 건가요?

네 — 텍스트 추출 은 같은 엔진으로 돌아갑니다. 둘 다 문서의 텍스트를 꺼냅니다; 먼저 찾은 쪽을 쓰세요.

몇 페이지에서만 텍스트를 추출할 수 있나요?

먼저 분할 로 필요한 페이지만 잘라낸 뒤 변환하세요. 출력도 집중되고 무료 50페이지 한도 안에도 들어옵니다.

비밀번호가 걸린 PDF에서도 되나요?

먼저 잠금 해제 로 비밀번호를 제거한 뒤(비밀번호를 알고 있어야 합니다) 평소처럼 변환하세요.

문서는 안전한가요?

업로드는 HTTPS 전용이고, 계정이 없으며, 파일은 1시간 후 자동 삭제됩니다. 업로드할 수 없는 문서라면 pdftotext 가 완전히 오프라인으로 돌아갑니다.

무료 한도는 어떻게 되나요?

파일당 20 MB·50페이지, 하루 10회 — 가입 없음, 워터마크 없음. Pro($9/월)가 상한을 없앱니다.

pdfty 팀

pdfty 팀은 개인정보를 중시하는 온라인 PDF 도구(압축, 변환, OCR, 서명, 보호)를 만듭니다. 파일은 1시간 이내에 삭제됩니다. 회사 소개 →

관련 글