PDF OCR — स्कैन की गई PDF को searchable कैसे बनाएँ (फ्री)
स्कैन की हुई PDF में टेक्स्ट search या copy नहीं होता? OCR से 1 मिनट में searchable बनाएँ — हिंदी सहित दर्जनों भाषाएँ।

आपके पास 40 पेज का स्कैन किया हुआ एग्रीमेंट है और आपको उसमें एक नाम ढूँढना है। Ctrl+F दबाते हैं — कुछ नहीं मिलता। टेक्स्ट कॉपी करने की कोशिश करते हैं — कुछ select ही नहीं होता। ऐसा इसलिए, क्योंकि स्कैनर ने टेक्स्ट नहीं, तस्वीर सेव की है। कंप्यूटर के लिए वह पेज एक फोटो है, दस्तावेज़ नहीं। OCR (Optical Character Recognition) यही बदलता है — और इसमें 1 मिनट से ज़्यादा नहीं लगता।
OCR असल में करता क्या है
OCR इंजन पेज की इमेज को पढ़कर हर अक्षर को पहचानता है, फिर पहचाना गया टेक्स्ट स्कैन के ठीक ऊपर एक अदृश्य परत के रूप में जोड़ देता है। नतीजा:
- फ़ाइल दिखने में हूबहू पहले जैसी रहती है — मुहरें, हस्ताक्षर, लेआउट सब जस का तस।
- लेकिन अब search (Ctrl+F), copy-paste और text select — तीनों काम करते हैं।
- स्क्रीन-रीडर भी दस्तावेज़ पढ़ पाते हैं, यानी accessibility भी बेहतर।
हम इसके लिए Tesseract इस्तेमाल करते हैं — दुनिया का सबसे लोकप्रिय ओपन-सोर्स OCR इंजन, जिसे Google ने वर्षों तक विकसित किया। साफ़ स्कैन पर छपे हुए टेक्स्ट की पहचान बहुत भरोसेमंद होती है।
स्टेप बाय स्टेप
OCR टूल खोलें
pdfty.com/tools/ocr पर जाएँ। बिना साइन-अप, 20 MB तक मुफ़्त, किसी भी ब्राउज़र में।
स्कैन की गई PDF डालें
फ़ाइल को अपलोड बॉक्स में खींचें। फ़ोन से खींची गई फोटो वाली PDF भी चलेगी।
भाषा चुनें
दस्तावेज़ की भाषा चुनें — हिंदी, English या दोनों। सही भाषा चुनने से पहचान की सटीकता काफ़ी बढ़ जाती है।
प्रोसेसिंग पूरी होने दें
Tesseract हर पेज पढ़कर अदृश्य टेक्स्ट-परत जोड़ता है। पेजों की संख्या के हिसाब से कुछ सेकंड से एक-दो मिनट।
डाउनलोड करें — हो गया
अब Ctrl+F से खोलकर आज़माएँ — search चलेगा। फ़ाइलें 1 घंटे में हमारे सर्वर से हट जाती हैं।
बेहतर नतीजों के लिए टिप्स
- साफ़ स्कैन = बेहतर पहचान। 300 DPI का सीधा स्कैन सबसे अच्छा काम करता है; तिरछी, धुंधली या कम रोशनी वाली फोटो पर गलतियाँ बढ़ती हैं।
- हस्तलिखित टेक्स्ट से उम्मीद कम रखें। मुफ़्त OCR इंजन (Tesseract समेत) हाथ की लिखावट को खराब पहचानते हैं — छपे हुए टेक्स्ट के लिए बने हैं। हस्तलिखित नोट्स के लिए नतीजे अधूरे ही मिलेंगे।
- OCR के बाद फ़ाइल थोड़ी बड़ी हो सकती है — टेक्स्ट-परत जुड़ती है। भेजने से पहले उसे compress कर लें, साइज़ काफ़ी घट जाएगा।
अक्सर पूछे जाने वाले प्रश्न
क्या OCR के बाद मेरी PDF दिखने में बदल जाएगी?
नहीं। टेक्स्ट-परत अदृश्य होती है और स्कैन के ठीक ऊपर बैठती है — पेज पिक्सेल-दर-पिक्सेल पहले जैसा दिखता है। फ़र्क़ सिर्फ़ यह है कि अब search, copy और select काम करते हैं।
क्या हिंदी दस्तावेज़ों पर OCR ठीक चलता है?
हाँ — Tesseract देवनागरी को अच्छी तरह सपोर्ट करता है। साफ़ छपे हिंदी टेक्स्ट पर सटीकता ऊँची रहती है। हिंदी-अंग्रेज़ी मिश्रित दस्तावेज़ के लिए दोनों भाषाएँ चुनें।
हाथ से लिखे नोट्स पहचान में क्यों नहीं आते?
मुफ़्त OCR इंजन छपे हुए, एकसमान अक्षरों पर प्रशिक्षित होते हैं। हर इंसान की लिखावट अलग होती है, इसलिए हस्तलिखित टेक्स्ट की पहचान कमज़ोर रहती है — यह Tesseract समेत सभी free इंजनों की सीमा है, हमारी सेवा की नहीं।
pdfty टीम प्राइवेसी-फर्स्ट ऑनलाइन PDF टूल बनाती है — कंप्रेस, कन्वर्ट, OCR, साइन और प्रोटेक्ट। फ़ाइलें 1 घंटे में हट जाती हैं। हमारे बारे में →
