Как конвертировать PDF в текст (вытащить сырой текст для правки и анализа)
Извлеките сырой текст из любого PDF в обычный .txt для правки, скриптов или анализа — бесплатно, без регистрации. Плюс что делать, если PDF — это скан.

Иногда PDF — ровно неподходящий контейнер. Вам не нужны шрифты, поля или двухколоночная вёрстка — вам нужны слова как сырьё: вставить в редактор, прогнать через скрипт, посчитать, перевести, поискать по ним, отправить в анализ. Конвертация PDF в простой текст сдирает всё, кроме содержимого, — и в этом весь смысл.
Типичные причины так делать:
- Правка — переработка шаблонных кусков договора или текста отчёта без борьбы с PDF-редакторами.
- Скрипты и анализ — grep, частоты слов, конвейеры данных, подача документов в инструменты, которые едят простой текст.
- Перевод — большинству переводческих процессов нужен чистый текст, а не стилизованный документ.
- Доступность и переносимость — .txt откроется на чём угодно, вплоть до машины тридцатилетней давности.
Одно замечание до старта: Извлечь текст на pdfty — тот же движок: оба инструмента вытаскивают встроенный текст из PDF. Какой бы вы ни открыли первым, слова будут те же; PDF в TXT отдаёт их скачиваемым .txt-файлом.
Как конвертировать PDF в текст — пошагово
Откройте инструмент
Перейдите на pdfty.com/ru/tools/pdf-to-txt. Бесплатно до 20 МБ и 50 страниц, без аккаунта.
Загрузите PDF
Перетащите его. Если файл под паролем, сначала снимите пароль.
Конвертируйте
Встроенный текстовый слой считывается с каждой страницы по порядку. Несколько секунд.
Скачайте .txt
Один текстовый файл с полным текстом документа. Загрузки автоматически удаляются через 1 час.
Проверьте результат
Пробегитесь по нему один раз. Если он пустой или абракадабра, ваш PDF — скан: смотрите раздел про OCR ниже.

Проблема скана: когда извлекать нечего
Это самый частый сюрприз при извлечении текста из PDF. PDF может хранить текст двумя совершенно разными способами:
- Цифровые PDF (экспорт из Word, с сайта, из биллинговой системы) несут настоящий текстовый слой. Извлечение мгновенно и точно.
- Сканированные PDF (со сканера или камеры телефона) содержат только картинки текста. Извлекать буквально нечего — на выходе будет пусто.
Лекарство для сканов — OCR, оптическое распознавание символов: оно читает пиксели и строит текстовый слой. Сначала прогоните скан через OCR, затем конвертируйте результат в текст. Точность зависит от качества скана.
Простой текст, Word или HTML — сколько структуры вам нужно?
Простой текст — один край спектра. Выбирайте точку приземления осознанно:
| Вам нужно | Правильный инструмент | Что выживает |
|---|---|---|
| Только слова — для скриптов или правки | PDF в TXT | Весь текст в порядке чтения — ноль вёрстки, ноль стилей |
| Редактируемый документ с форматированием | PDF в Word | [PDF в Word](/ru/tools/pdf-to-word) сохраняет абзацы, шрифты, таблицы |
| Готовая для веба разметка с заголовками и ссылками | PDF в HTML | [PDF в HTML](/ru/tools/pdf-to-html) структурирует содержимое |
| Таблицы, с которыми будете считать | PDF в Excel | [PDF в Excel](/ru/tools/pdf-to-excel) заточен именно под табличные данные |
Правило: собираетесь читать или обрабатывать содержимое — берите TXT. Человеку нужно видеть форматирование — берите Word или HTML.
Бесплатные локальные альтернативы
Для разовых задач браузер быстрее всего, но если извлечение — часть вашего ежедневного набора, или документы не могут покидать вашу машину, эти локальные пути надёжны:
pdftotext (poppler-utils — бесплатно, все платформы). Золотой стандарт извлечения из командной строки:
pdftotext input.pdf output.txt
Добавьте -layout, чтобы приблизить исходные позиции колонок
пробелами — по-настоящему полезно для табличного текста. Ставится
через Homebrew на macOS или пакетный менеджер на Linux.
Копипаст из просмотрщика. Для одной-двух страниц сработает «выделить всё» в PDF-просмотрщике и вставка в редактор. Готовьтесь чистить переносы строк и изредка перемешанные колонки.
Microsoft Word. Word открывает PDF и конвертирует их в редактируемые документы, откуда можно сохранить .txt. Медленнее, и по пути документ переверстывается — перебор, когда нужен просто сырой текст.
Практические подводные камни
- Вёрстка исчезает — так задумано. Многоколоночные страницы
выходят линейным текстом, таблицы схлопываются в строки, а текстовые
блоки встают туда, где оказались в потоке содержимого. Если колонки
перемешиваются совсем плохо,
pdftotext -layoutили PDF в Word лучше справляются со сложной вёрсткой. - Шапки, подвалы и номера страниц повторяются. Сквозные колонтитулы появляются в выводе по разу на страницу. Быстрый проход «найти и удалить» (или однострочный скрипт) их вычищает.
- Переносы. Слова, разорванные переносом в выключенном тексте («доку- мент»), остаются разорванными. Чинится поиском-заменой по «- » плюс строчная буква — неидеально, но быстро.
- Лигатуры и символы. Красивая типографика (fi, fl, «умные» кавычки) приходит теми символами, которые PDF реально кодирует, — в UTF-8 обычно нормально, но перед анализом иногда стоит прогнать нормализацию.
- Пустой или искажённый вывод почти всегда означает скан (сначала OCR) или, редко, PDF с намеренно запутанными кодировками шрифтов. Для второго OCR, по иронии, тоже лекарство: растеризовать и прочитать пиксели.
Частые вопросы
Почему мой файл на выходе пустой?
Почти наверняка ваш PDF — скан: картинки страниц без текстового слоя. Сначала прогоните через OCR, потом извлекайте. Тест за 5 секунд: если в просмотрщике нельзя выделить текст — текста нет.
Сохранятся ли жирный, заголовки и шрифты?
Нет — .txt вообще не умеет представлять форматирование, вы получаете чистые символы. Это и есть фича: не с чем бороться при правке и в скриптах. Для форматирования — PDF в Word.
Что происходит с таблицами?
Они расплющиваются в обычные строки, выравнивание колонок в целом теряется. Для таблиц, с которыми нужно работать, создан PDF в Excel.
Это то же самое, что инструмент «Извлечь текст»?
Да — Извлечь текст работает на том же движке. Оба вытаскивают текст документа; пользуйтесь тем, который нашли первым.
Можно извлечь текст только с нескольких страниц?
Сначала разделите PDF до нужных страниц, затем конвертируйте. Вывод будет сфокусированным и уложится в бесплатный лимит 50 страниц.
Сработает ли на PDF под паролем?
Сначала снимите пароль через Снять пароль (пароль нужно знать), затем конвертируйте как обычно.
Мой документ в безопасности?
Загрузка только по HTTPS, аккаунта нет, файлы автоматически удаляются
через 1 час. Для документов, которые нельзя загружать, pdftotext
работает полностью офлайн.
Какие бесплатные лимиты?
20 МБ на файл, 50 страниц, 10 операций в день — без регистрации и водяных знаков. Pro ($9/мес) снимает ограничения.
Команда pdfty — приватные онлайн-инструменты для PDF: сжатие, конвертация, OCR, подпись и защита. Файлы удаляются через 1 час. О нас →