Cómo convertir PDF a texto (extrae texto en bruto para editar y analizar)
Extrae el texto en bruto de cualquier PDF a un .txt para editar, programar o analizar — gratis, sin registro. Y qué hacer cuando el PDF es un escaneo.

A veces un PDF es exactamente el contenedor equivocado. No quieres las fuentes, los márgenes ni la maquetación a dos columnas — quieres las palabras, como materia prima: para pegarlas en un editor, pasarlas por un script, contarlas, traducirlas, buscar en ellas, meterlas en un análisis. Convertir PDF a texto plano despoja todo excepto el contenido, y ese es precisamente el objetivo.
Razones típicas para hacerlo:
- Editar — retrabajar cláusulas tipo de un contrato o el texto de un informe sin pelearse con editores de PDF.
- Scripts y análisis — grep, frecuencias de palabras, tuberías de datos, alimentar documentos a herramientas que comen texto plano.
- Traducción — la mayoría de flujos de traducción quieren texto limpio, no un documento con estilos.
- Accesibilidad y portabilidad — un .txt se abre en cualquier cosa, hasta en una máquina de hace 30 años.
Una nota antes de empezar: Extraer texto en pdfty es el mismo motor — ambos sacan el texto incrustado del PDF. Cualquiera de los dos que encuentres primero te dará las mismas palabras; PDF a TXT te las devuelve como un archivo .txt descargable.
Cómo convertir PDF a texto — paso a paso
Abre la herramienta
Ve a pdfty.com/es/tools/pdf-to-txt. Gratis hasta 20 MB y 50 páginas, sin cuenta.
Sube tu PDF
Arrástralo. Si está protegido con contraseña, pásalo antes por Desbloquear.
Convierte
La capa de texto incrustada se lee de cada página, en orden. Unos segundos.
Descarga el .txt
Un archivo de texto plano con el texto completo del documento. Las subidas se eliminan automáticamente tras 1 hora.
Revisa la salida
Échale un vistazo rápido. Si está vacía o es un galimatías, tu PDF es un escaneo — mira la sección de OCR de abajo.

El problema del escaneo: cuando no hay texto que extraer
Esta es la sorpresa más común en la extracción de texto de PDF. Un PDF puede contener su texto de dos maneras completamente distintas:
- PDF digitales (exportados de Word, de una web, de un sistema de facturación) llevan una capa de texto real. La extracción es instantánea y precisa.
- PDF escaneados (de un escáner o de la cámara del móvil) contienen solo fotos de texto. Literalmente no hay nada que extraer — la salida quedará vacía.
El arreglo para los escaneos es el OCR — reconocimiento óptico de caracteres — que lee los píxeles y construye una capa de texto. Pasa tu escaneo por OCR primero y luego convierte el resultado a texto. La precisión depende de la calidad del escaneo.
Texto plano vs Word vs HTML — ¿cuánta estructura necesitas?
El texto plano es un extremo del espectro. Decide con intención dónde aterrizas:
| Necesitas | Herramienta correcta | Qué sobrevive |
|---|---|---|
| Solo las palabras, para scripts o edición | PDF a TXT | Todo el texto, en orden de lectura — cero maquetación, cero estilos |
| Un documento editable con formato | PDF a Word | [PDF a Word](/es/tools/pdf-to-word) conserva párrafos, fuentes y tablas |
| Marcado listo para la web con títulos y enlaces | PDF a HTML | [PDF a HTML](/es/tools/pdf-to-html) estructura el contenido |
| Tablas sobre las que calcular | PDF a Excel | [PDF a Excel](/es/tools/pdf-to-excel) apunta específicamente a los datos tabulares |
Regla práctica: si vas a leer o procesar el contenido, llévate TXT. Si un humano necesita ver el formato, llévate Word o HTML.
Alternativas locales gratuitas
Para trabajos puntuales el navegador es lo más rápido, pero si la extracción forma parte de tu caja de herramientas diaria — o los documentos no pueden salir de tu máquina — estas vías locales son sólidas:
pdftotext (poppler-utils — gratis, todas las plataformas). El patrón oro de la extracción por línea de comandos:
pdftotext input.pdf output.txt
Añade -layout para aproximar con espacios las posiciones de columna
originales — genuinamente útil para texto tabular. Se instala vía
Homebrew en macOS o con tu gestor de paquetes en Linux.
Copiar y pegar desde un visor. Para una página o dos, seleccionar todo en tu visor de PDF y pegarlo en un editor funciona. Cuenta con limpiar saltos de línea y alguna columna revuelta.
Microsoft Word. Word abre PDF y los convierte en documentos editables, desde los que puedes guardar como .txt. Más lento, y refluye el documento por el camino — matar moscas a cañonazos cuando solo quieres texto en bruto.
Detalles prácticos a tener en cuenta
- La maquetación desaparece — por diseño. Las páginas multicolumna
salen como texto lineal, las tablas se aplastan en líneas y los
cuadros de texto caen donde les toque en el flujo de contenido. Si
las columnas se entrelazan mal,
pdftotext -layouto PDF a Word manejan mejor las maquetaciones complejas. - Encabezados, pies y números de página se repiten. Los encabezados corridos aparecen una vez por página en la salida. Una pasada rápida de buscar-y-borrar (o un script de una línea) los limpia.
- Guionado. Las palabras partidas entre líneas en texto justificado («docu- mento») siguen partidas. Se arregla con buscar-y-reemplazar sobre «- » seguido de minúscula — imperfecto pero rápido.
- Ligaduras y símbolos. La tipografía fina (fi, fl, comillas tipográficas) sale como los caracteres que el PDF codifica realmente — normalmente bien en UTF-8, a veces merece una pasada de normalización antes de analizar.
- Una salida vacía o corrupta casi siempre significa un escaneo (OCR primero) o, rara vez, un PDF con codificaciones de fuente deliberadamente ofuscadas. Para lo segundo, el OCR es irónicamente también el arreglo: rasteriza mentalmente y lee los píxeles.
Preguntas frecuentes
¿Por qué mi archivo de salida está vacío?
Tu PDF es casi con seguridad un escaneo — fotos de páginas, sin capa de texto. Pásalo antes por OCR y luego extrae. La prueba de los 5 segundos: si no puedes seleccionar texto en un visor de PDF, no hay texto.
¿La salida conserva negritas, títulos y fuentes?
No — los archivos .txt no pueden representar formato en absoluto, así que obtienes caracteres puros. Esa es la gracia: nada con lo que pelear al editar o programar. Para formato, usa PDF a Word.
¿Qué pasa con las tablas?
Se aplanan en líneas simples, y la alineación de columnas generalmente se pierde. Para tablas con las que necesitas trabajar, PDF a Excel está hecho exactamente para eso.
¿Es lo mismo que la herramienta Extraer texto?
Sí — Extraer texto ejecuta el mismo motor. Ambas sacan el texto del documento; usa la que encuentres primero.
¿Puedo extraer texto de solo unas páginas?
Pasa antes el PDF por Dividir hasta quedarte con las páginas que necesitas, y luego convierte. Mantiene la salida enfocada y dentro del límite gratuito de 50 páginas.
¿Funcionará con un PDF protegido con contraseña?
Quita primero la contraseña con Desbloquear (necesitas conocerla) y luego convierte con normalidad.
¿Mi documento está seguro?
Las subidas van solo por HTTPS, no hay cuenta y los archivos se eliminan
automáticamente tras 1 hora. Para documentos que no puedas subir,
pdftotext funciona totalmente sin conexión.
¿Cuáles son los límites gratuitos?
20 MB por archivo, 50 páginas, 10 operaciones al día — sin registro, sin marca de agua. Pro (9 $/mes) elimina los topes.
El equipo de pdfty crea herramientas PDF en línea que respetan tu privacidad: comprimir, convertir, OCR, firmar y proteger. Archivos eliminados en 1 hora. Sobre nosotros →