guide·pdfty टीम··4 मिनट में पढ़ें

PDF OCR — स्कैन की गई PDF को searchable कैसे बनाएँ (फ्री)

स्कैन की हुई PDF में टेक्स्ट search या copy नहीं होता? OCR से 1 मिनट में searchable बनाएँ — हिंदी सहित दर्जनों भाषाएँ।

OCR — स्कैन की गई PDF से पहचाना जाता टेक्स्ट
स्कैन वही दिखता है — लेकिन अब search, copy, select सब चलता है

आपके पास 40 पेज का स्कैन किया हुआ एग्रीमेंट है और आपको उसमें एक नाम ढूँढना है। Ctrl+F दबाते हैं — कुछ नहीं मिलता। टेक्स्ट कॉपी करने की कोशिश करते हैं — कुछ select ही नहीं होता। ऐसा इसलिए, क्योंकि स्कैनर ने टेक्स्ट नहीं, तस्वीर सेव की है। कंप्यूटर के लिए वह पेज एक फोटो है, दस्तावेज़ नहीं। OCR (Optical Character Recognition) यही बदलता है — और इसमें 1 मिनट से ज़्यादा नहीं लगता।

OCR असल में करता क्या है

OCR इंजन पेज की इमेज को पढ़कर हर अक्षर को पहचानता है, फिर पहचाना गया टेक्स्ट स्कैन के ठीक ऊपर एक अदृश्य परत के रूप में जोड़ देता है। नतीजा:

  • फ़ाइल दिखने में हूबहू पहले जैसी रहती है — मुहरें, हस्ताक्षर, लेआउट सब जस का तस।
  • लेकिन अब search (Ctrl+F), copy-paste और text select — तीनों काम करते हैं।
  • स्क्रीन-रीडर भी दस्तावेज़ पढ़ पाते हैं, यानी accessibility भी बेहतर।

हम इसके लिए Tesseract इस्तेमाल करते हैं — दुनिया का सबसे लोकप्रिय ओपन-सोर्स OCR इंजन, जिसे Google ने वर्षों तक विकसित किया। साफ़ स्कैन पर छपे हुए टेक्स्ट की पहचान बहुत भरोसेमंद होती है।

स्टेप बाय स्टेप

1

OCR टूल खोलें

pdfty.com/tools/ocr पर जाएँ। बिना साइन-अप, 20 MB तक मुफ़्त, किसी भी ब्राउज़र में।

Drop PDF here
2

स्कैन की गई PDF डालें

फ़ाइल को अपलोड बॉक्स में खींचें। फ़ोन से खींची गई फोटो वाली PDF भी चलेगी।

Drop PDF here
3

भाषा चुनें

दस्तावेज़ की भाषा चुनें — हिंदी, English या दोनों। सही भाषा चुनने से पहचान की सटीकता काफ़ी बढ़ जाती है।

▾WebPrintPrepress
4

प्रोसेसिंग पूरी होने दें

Tesseract हर पेज पढ़कर अदृश्य टेक्स्ट-परत जोड़ता है। पेजों की संख्या के हिसाब से कुछ सेकंड से एक-दो मिनट।

Compressing…69%~2 seconds remaining
5

डाउनलोड करें — हो गया

अब Ctrl+F से खोलकर आज़माएँ — search चलेगा। फ़ाइलें 1 घंटे में हमारे सर्वर से हट जाती हैं।

All done — file readyAuto-deleted in 1 hour

बेहतर नतीजों के लिए टिप्स

  • साफ़ स्कैन = बेहतर पहचान। 300 DPI का सीधा स्कैन सबसे अच्छा काम करता है; तिरछी, धुंधली या कम रोशनी वाली फोटो पर गलतियाँ बढ़ती हैं।
  • हस्तलिखित टेक्स्ट से उम्मीद कम रखें। मुफ़्त OCR इंजन (Tesseract समेत) हाथ की लिखावट को खराब पहचानते हैं — छपे हुए टेक्स्ट के लिए बने हैं। हस्तलिखित नोट्स के लिए नतीजे अधूरे ही मिलेंगे।
  • OCR के बाद फ़ाइल थोड़ी बड़ी हो सकती है — टेक्स्ट-परत जुड़ती है। भेजने से पहले उसे compress कर लें, साइज़ काफ़ी घट जाएगा।
Tesseract
ओपन-सोर्स OCR इंजन
100+
समर्थित भाषाएँ, हिंदी सहित
100%
मूल लेआउट जस का तस
1 घंटा
फ़ाइल हटने तक का समय

अक्सर पूछे जाने वाले प्रश्न

क्या OCR के बाद मेरी PDF दिखने में बदल जाएगी?

नहीं। टेक्स्ट-परत अदृश्य होती है और स्कैन के ठीक ऊपर बैठती है — पेज पिक्सेल-दर-पिक्सेल पहले जैसा दिखता है। फ़र्क़ सिर्फ़ यह है कि अब search, copy और select काम करते हैं।

क्या हिंदी दस्तावेज़ों पर OCR ठीक चलता है?

हाँ — Tesseract देवनागरी को अच्छी तरह सपोर्ट करता है। साफ़ छपे हिंदी टेक्स्ट पर सटीकता ऊँची रहती है। हिंदी-अंग्रेज़ी मिश्रित दस्तावेज़ के लिए दोनों भाषाएँ चुनें।

हाथ से लिखे नोट्स पहचान में क्यों नहीं आते?

मुफ़्त OCR इंजन छपे हुए, एकसमान अक्षरों पर प्रशिक्षित होते हैं। हर इंसान की लिखावट अलग होती है, इसलिए हस्तलिखित टेक्स्ट की पहचान कमज़ोर रहती है — यह Tesseract समेत सभी free इंजनों की सीमा है, हमारी सेवा की नहीं।

pdfty टीम

pdfty टीम प्राइवेसी-फर्स्ट ऑनलाइन PDF टूल बनाती है — कंप्रेस, कन्वर्ट, OCR, साइन और प्रोटेक्ट। फ़ाइलें 1 घंटे में हट जाती हैं। हमारे बारे में →

संबंधित लेख