guide·Команда pdfty··6 мин чтения

Как конвертировать PDF в текст (вытащить сырой текст для правки и анализа)

Извлеките сырой текст из любого PDF в обычный .txt для правки, скриптов или анализа — бесплатно, без регистрации. Плюс что делать, если PDF — это скан.

Извлечение сырого текста из PDF в обычный текстовый файл
PDF на входе → сырой редактируемый текст на выходе

Иногда PDF — ровно неподходящий контейнер. Вам не нужны шрифты, поля или двухколоночная вёрстка — вам нужны слова как сырьё: вставить в редактор, прогнать через скрипт, посчитать, перевести, поискать по ним, отправить в анализ. Конвертация PDF в простой текст сдирает всё, кроме содержимого, — и в этом весь смысл.

Типичные причины так делать:

  • Правка — переработка шаблонных кусков договора или текста отчёта без борьбы с PDF-редакторами.
  • Скрипты и анализ — grep, частоты слов, конвейеры данных, подача документов в инструменты, которые едят простой текст.
  • Перевод — большинству переводческих процессов нужен чистый текст, а не стилизованный документ.
  • Доступность и переносимость — .txt откроется на чём угодно, вплоть до машины тридцатилетней давности.

Одно замечание до старта: Извлечь текст на pdfty — тот же движок: оба инструмента вытаскивают встроенный текст из PDF. Какой бы вы ни открыли первым, слова будут те же; PDF в TXT отдаёт их скачиваемым .txt-файлом.

Как конвертировать PDF в текст — пошагово

1

Откройте инструмент

Перейдите на pdfty.com/ru/tools/pdf-to-txt. Бесплатно до 20 МБ и 50 страниц, без аккаунта.

Drop PDF here
2

Загрузите PDF

Перетащите его. Если файл под паролем, сначала снимите пароль.

Drop PDF here
3

Конвертируйте

Встроенный текстовый слой считывается с каждой страницы по порядку. Несколько секунд.

Compressing…69%~2 seconds remaining
4

Скачайте .txt

Один текстовый файл с полным текстом документа. Загрузки автоматически удаляются через 1 час.

contract_draft.pdfDownload
5

Проверьте результат

Пробегитесь по нему один раз. Если он пустой или абракадабра, ваш PDF — скан: смотрите раздел про OCR ниже.

All done — file readyAuto-deleted in 1 hour
🔒 pdfty.com/en/tools/pdf-to-txt
Инструмент PDF в TXT от pdfty
PDF в TXT от pdfty: слова документа и ничего больше

Проблема скана: когда извлекать нечего

Это самый частый сюрприз при извлечении текста из PDF. PDF может хранить текст двумя совершенно разными способами:

  1. Цифровые PDF (экспорт из Word, с сайта, из биллинговой системы) несут настоящий текстовый слой. Извлечение мгновенно и точно.
  2. Сканированные PDF (со сканера или камеры телефона) содержат только картинки текста. Извлекать буквально нечего — на выходе будет пусто.

Лекарство для сканов — OCR, оптическое распознавание символов: оно читает пиксели и строит текстовый слой. Сначала прогоните скан через OCR, затем конвертируйте результат в текст. Точность зависит от качества скана.

Простой текст, Word или HTML — сколько структуры вам нужно?

Простой текст — один край спектра. Выбирайте точку приземления осознанно:

Вам нужноПравильный инструментЧто выживает
Только слова — для скриптов или правкиPDF в TXTВесь текст в порядке чтения — ноль вёрстки, ноль стилей
Редактируемый документ с форматированиемPDF в Word[PDF в Word](/ru/tools/pdf-to-word) сохраняет абзацы, шрифты, таблицы
Готовая для веба разметка с заголовками и ссылкамиPDF в HTML[PDF в HTML](/ru/tools/pdf-to-html) структурирует содержимое
Таблицы, с которыми будете считатьPDF в Excel[PDF в Excel](/ru/tools/pdf-to-excel) заточен именно под табличные данные

Правило: собираетесь читать или обрабатывать содержимое — берите TXT. Человеку нужно видеть форматирование — берите Word или HTML.

Бесплатные локальные альтернативы

Для разовых задач браузер быстрее всего, но если извлечение — часть вашего ежедневного набора, или документы не могут покидать вашу машину, эти локальные пути надёжны:

pdftotext (poppler-utils — бесплатно, все платформы). Золотой стандарт извлечения из командной строки:

pdftotext input.pdf output.txt

Добавьте -layout, чтобы приблизить исходные позиции колонок пробелами — по-настоящему полезно для табличного текста. Ставится через Homebrew на macOS или пакетный менеджер на Linux.

Копипаст из просмотрщика. Для одной-двух страниц сработает «выделить всё» в PDF-просмотрщике и вставка в редактор. Готовьтесь чистить переносы строк и изредка перемешанные колонки.

Microsoft Word. Word открывает PDF и конвертирует их в редактируемые документы, откуда можно сохранить .txt. Медленнее, и по пути документ переверстывается — перебор, когда нужен просто сырой текст.

Практические подводные камни

  • Вёрстка исчезает — так задумано. Многоколоночные страницы выходят линейным текстом, таблицы схлопываются в строки, а текстовые блоки встают туда, где оказались в потоке содержимого. Если колонки перемешиваются совсем плохо, pdftotext -layout или PDF в Word лучше справляются со сложной вёрсткой.
  • Шапки, подвалы и номера страниц повторяются. Сквозные колонтитулы появляются в выводе по разу на страницу. Быстрый проход «найти и удалить» (или однострочный скрипт) их вычищает.
  • Переносы. Слова, разорванные переносом в выключенном тексте («доку- мент»), остаются разорванными. Чинится поиском-заменой по «- » плюс строчная буква — неидеально, но быстро.
  • Лигатуры и символы. Красивая типографика (fi, fl, «умные» кавычки) приходит теми символами, которые PDF реально кодирует, — в UTF-8 обычно нормально, но перед анализом иногда стоит прогнать нормализацию.
  • Пустой или искажённый вывод почти всегда означает скан (сначала OCR) или, редко, PDF с намеренно запутанными кодировками шрифтов. Для второго OCR, по иронии, тоже лекарство: растеризовать и прочитать пиксели.

Частые вопросы

Почему мой файл на выходе пустой?

Почти наверняка ваш PDF — скан: картинки страниц без текстового слоя. Сначала прогоните через OCR, потом извлекайте. Тест за 5 секунд: если в просмотрщике нельзя выделить текст — текста нет.

Сохранятся ли жирный, заголовки и шрифты?

Нет — .txt вообще не умеет представлять форматирование, вы получаете чистые символы. Это и есть фича: не с чем бороться при правке и в скриптах. Для форматирования — PDF в Word.

Что происходит с таблицами?

Они расплющиваются в обычные строки, выравнивание колонок в целом теряется. Для таблиц, с которыми нужно работать, создан PDF в Excel.

Это то же самое, что инструмент «Извлечь текст»?

Да — Извлечь текст работает на том же движке. Оба вытаскивают текст документа; пользуйтесь тем, который нашли первым.

Можно извлечь текст только с нескольких страниц?

Сначала разделите PDF до нужных страниц, затем конвертируйте. Вывод будет сфокусированным и уложится в бесплатный лимит 50 страниц.

Сработает ли на PDF под паролем?

Сначала снимите пароль через Снять пароль (пароль нужно знать), затем конвертируйте как обычно.

Мой документ в безопасности?

Загрузка только по HTTPS, аккаунта нет, файлы автоматически удаляются через 1 час. Для документов, которые нельзя загружать, pdftotext работает полностью офлайн.

Какие бесплатные лимиты?

20 МБ на файл, 50 страниц, 10 операций в день — без регистрации и водяных знаков. Pro ($9/мес) снимает ограничения.

Команда pdfty

Команда pdfty — приватные онлайн-инструменты для PDF: сжатие, конвертация, OCR, подпись и защита. Файлы удаляются через 1 час. О нас →

Читайте также