PDF को Text में कैसे बदलें (एडिटिंग और एनालिसिस के लिए कच्चा टेक्स्ट)
किसी भी PDF से कच्चा टेक्स्ट सादी .txt फ़ाइल में निकालिए — एडिटिंग, स्क्रिप्टिंग या एनालिसिस के लिए, फ्री, बिना साइन-अप। PDF स्कैन हो तो क्या करें, यह भी।

कभी-कभी PDF बिल्कुल ग़लत डिब्बा होती है। आपको न फ़ॉन्ट चाहिए, न मार्जिन, न दो-कॉलम का लेआउट — चाहिए शब्द, कच्चे माल के रूप में: एडिटर में चिपकाने को, स्क्रिप्ट से गुज़ारने को, गिनने को, अनुवाद करने को, आर-पार खोजने को, एनालिसिस में झोंकने को। PDF को सादे टेक्स्ट में बदलना कंटेंट छोड़कर बाक़ी सब उतार फेंकता है, और मक़सद ठीक यही है।
लोग यह आमतौर पर इसलिए करते हैं:
- एडिटिंग — PDF एडिटरों से लड़े बिना कॉन्ट्रैक्ट का boilerplate या रिपोर्ट का टेक्स्ट नए सिरे से गढ़ना।
- स्क्रिप्टिंग और एनालिसिस — grep, शब्द-आवृत्तियाँ, डेटा पाइपलाइन, सादा टेक्स्ट खाने वाले टूलिंग को दस्तावेज़ खिलाना।
- अनुवाद — ज़्यादातर अनुवाद वर्कफ़्लो को सजा हुआ दस्तावेज़ नहीं, साफ़ टेक्स्ट चाहिए।
- पहुँच और पोर्टेबिलिटी — .txt हर चीज़ पर खुलती है, 30 साल पुरानी मशीन तक पर।
शुरू करने से पहले एक नोट: pdfty का Extract text वही इंजन है — दोनों PDF में एम्बेडेड टेक्स्ट निकालते हैं। जो भी पहले हाथ लगे, शब्द वही मिलेंगे; PDF to TXT उन्हें डाउनलोड होने वाली .txt फ़ाइल में लौटाता है।
PDF को text में कैसे बदलें — स्टेप बाय स्टेप
टूल खोलिए
pdfty.com/hi/tools/pdf-to-txt पर जाइए। 20 MB और 50 पेज तक फ्री, बिना अकाउंट।
अपनी PDF अपलोड कीजिए
खींचकर डालिए। पासवर्ड से सुरक्षित है तो पहले Unlock कीजिए।
बदलिए
हर पेज की एम्बेडेड टेक्स्ट लेयर क्रम से पढ़ी जाती है। चंद सेकंड।
.txt डाउनलोड कीजिए
दस्तावेज़ के पूरे टेक्स्ट वाली एक सादी टेक्स्ट फ़ाइल। अपलोड 1 घंटे बाद अपने आप डिलीट हो जाते हैं।
आउटपुट पर नज़र डालिए
एक बार सरसरी निगाह मारिए। खाली है या बेमतलब अक्षर हैं, तो आपकी PDF स्कैन है — नीचे OCR वाला हिस्सा देखिए।

स्कैन की समस्या: जब निकालने को टेक्स्ट ही न हो
PDF टेक्स्ट निकालने में यही सबसे आम झटका है। PDF अपना टेक्स्ट दो बिल्कुल अलग तरीक़ों से रख सकती है:
- डिजिटल PDF (Word, वेबसाइट या इनवॉइस सिस्टम से एक्सपोर्ट हुईं) में असली टेक्स्ट लेयर होती है। निकासी फ़ौरन और सटीक होती है।
- स्कैन की हुई PDF (स्कैनर या फ़ोन कैमरे से) में सिर्फ़ टेक्स्ट की तस्वीरें हैं। निकालने को सचमुच कुछ नहीं — आउटपुट खाली आएगा।
स्कैन का इलाज OCR है — optical character recognition — जो पिक्सेल पढ़कर टेक्स्ट लेयर बनाता है। अपने स्कैन को पहले OCR से गुज़ारिए, फिर नतीजे को टेक्स्ट में बदलिए। सटीकता स्कैन की क्वालिटी पर निर्भर करती है।
सादा टेक्स्ट बनाम Word बनाम HTML — कितनी संरचना चाहिए?
सादा टेक्स्ट एक सिरे पर है। कहाँ उतरना है, सोच-समझकर तय कीजिए:
| आपको चाहिए | सही टूल | क्या बचता है |
|---|---|---|
| बस शब्द, स्क्रिप्ट या एडिटिंग के लिए | PDF to TXT | पूरा टेक्स्ट, पढ़ने के क्रम में — शून्य लेआउट, शून्य स्टाइल |
| फ़ॉर्मैटिंग वाला एडिट होने लायक़ दस्तावेज़ | PDF to Word | [PDF to Word](/hi/tools/pdf-to-word) पैराग्राफ़, फ़ॉन्ट, टेबल रखता है |
| Headings और लिंक वाला वेब-रेडी मार्कअप | PDF to HTML | [PDF to HTML](/hi/tools/pdf-to-html) कंटेंट को संरचना देता है |
| टेबल जिन पर गणना करनी है | PDF to Excel | [PDF to Excel](/hi/tools/pdf-to-excel) ख़ासतौर पर tabular डेटा साधता है |
अंगूठे का नियम: कंटेंट को पढ़ना या प्रोसेस करना है तो TXT लीजिए। किसी इंसान को फ़ॉर्मैटिंग देखनी है तो Word या HTML।
फ्री लोकल विकल्प
एक-आध बार के काम में ब्राउज़र सबसे तेज़ है, पर निकासी आपके रोज़ के औज़ारों में है — या दस्तावेज़ मशीन छोड़ नहीं सकते — तो ये लोकल रास्ते पक्के हैं:
pdftotext (poppler-utils — फ्री, सब प्लैटफ़ॉर्म)। कमांड-लाइन निकासी का सोने जैसा मानक:
pdftotext input.pdf output.txt
-layout जोड़ने पर मूल कॉलम की जगहें spaces से मिलती-जुलती बनती हैं —
tabular टेक्स्ट के लिए सचमुच काम का। macOS पर Homebrew से, Linux पर
पैकेज मैनेजर से इंस्टॉल होता है।
व्यूअर से कॉपी-पेस्ट। एक-दो पेज के लिए PDF व्यूअर में सब चुनकर एडिटर में चिपकाना चल जाता है। लाइन ब्रेक और कभी-कभार गड्डमड्ड कॉलम साफ़ करने की तैयारी रखिए।
Microsoft Word। Word PDF खोलकर एडिट होने लायक़ दस्तावेज़ बनाता है, जिसे .txt में सेव किया जा सकता है। धीमा, और रास्ते में दस्तावेज़ को reflow करता है — जब सिर्फ़ कच्चा टेक्स्ट चाहिए तो हद से ज़्यादा।
व्यावहारिक पेच
- लेआउट ग़ायब है — जान-बूझकर। कई कॉलम वाले पेज सीधी-सपाट लाइनों
में आते हैं, टेबल लाइनों में ढह जाती हैं, और टेक्स्ट बॉक्स content
stream में जहाँ पड़ते हैं वहीं उतरते हैं। कॉलम बुरी तरह गुँथ जाएँ तो
pdftotext -layoutया PDF to Word जटिल लेआउट बेहतर सँभालते हैं। - हेडर, फ़ुटर और पेज नंबर दोहराए जाते हैं। चलते हेडर आउटपुट में हर पेज पर एक बार आते हैं। झटपट find-and-delete (या एक-लाइन की स्क्रिप्ट) उन्हें साफ़ कर देती है।
- Hyphenation। Justified टेक्स्ट में लाइनों के आर-पार टूटे शब्द ("docu- ment") टूटे ही रहते हैं। "- " और उसके बाद छोटे अक्षर पर find-and-replace से सुधर जाता है — अधूरा पर तेज़।
- Ligatures और चिह्न। सजीली टाइपोग्राफ़ी (fi, fl, smart quotes) उन्हीं अक्षरों में आती है जो PDF असल में एनकोड करती है — UTF-8 में आमतौर पर ठीक, एनालिसिस से पहले कभी-कभार normalization का एक दौर काम का।
- खाली या बिगड़ा आउटपुट लगभग हमेशा स्कैन का मतलब है (पहले OCR) या, कभी-कभार, जान-बूझकर उलझाई गई फ़ॉन्ट एनकोडिंग वाली PDF का। दूसरे मामले में भी इलाज विडंबना से OCR ही है: पिक्सेल पढ़ लो।
अक्सर पूछे जाने वाले प्रश्न
मेरी आउटपुट फ़ाइल खाली क्यों है?
आपकी PDF लगभग पक्का स्कैन है — पेजों की तस्वीरें, बिना टेक्स्ट लेयर। पहले उसे OCR से गुज़ारिए, फिर निकालिए। 5 सेकंड का टेस्ट: PDF व्यूअर में टेक्स्ट चुना नहीं जा सकता, तो टेक्स्ट है ही नहीं।
क्या आउटपुट में bold, headings और फ़ॉन्ट बचते हैं?
नहीं — .txt फ़ाइलें फ़ॉर्मैटिंग जता ही नहीं सकतीं, तो शुद्ध अक्षर मिलते हैं। यही तो ख़ूबी है: एडिटिंग या स्क्रिप्टिंग में लड़ने को कुछ नहीं। फ़ॉर्मैटिंग के लिए PDF to Word।
टेबल का क्या होता है?
वे सादी लाइनों में चपटी हो जाती हैं, और कॉलम की क़तार आमतौर पर खो जाती है। जिन टेबल के साथ काम करना है, उनके लिए PDF to Excel ठीक इसी के लिए बना है।
क्या यह Extract text टूल जैसा ही है?
हाँ — Extract text वही इंजन चलाता है। दोनों दस्तावेज़ का टेक्स्ट निकालते हैं; जो पहले मिले वही इस्तेमाल कीजिए।
क्या सिर्फ़ कुछ पेजों से टेक्स्ट निकाल सकता हूँ?
पहले PDF को ज़रूरी पेजों तक Split कीजिए, फिर बदलिए। आउटपुट केंद्रित रहता है और 50 पेज की फ्री लिमिट में समाता है।
क्या पासवर्ड वाली PDF पर चलेगा?
पहले Unlock से पासवर्ड हटाइए (पासवर्ड आपको पता होना चाहिए), फिर सामान्य ढंग से बदलिए।
क्या मेरा दस्तावेज़ सुरक्षित है?
अपलोड सिर्फ़ HTTPS पर, कोई अकाउंट नहीं, और फ़ाइलें 1 घंटे बाद अपने आप
डिलीट। जो दस्तावेज़ अपलोड नहीं हो सकते, उनके लिए pdftotext पूरी तरह
ऑफ़लाइन चलता है।
फ्री लिमिट क्या हैं?
प्रति फ़ाइल 20 MB, 50 पेज, दिन में 10 ऑपरेशन — बिना साइन-अप, बिना वॉटरमार्क। Pro ($9/माह) सीमाएँ हटा देता है।
pdfty टीम प्राइवेसी-फर्स्ट ऑनलाइन PDF टूल बनाती है — कंप्रेस, कन्वर्ट, OCR, साइन और प्रोटेक्ट। फ़ाइलें 1 घंटे में हट जाती हैं। हमारे बारे में →