स्कैन PDF या टेक्स्ट PDF? टेक्स्ट कॉपी क्यों नहीं होता — और इसका हल

अंतिम अपडेट: 24 सितंबर 2026

दो तरह के PDF जो एक जैसे दिखते हैं

Word, किसी वेबसाइट या अकाउंटिंग सॉफ़्टवेयर से सेव किया गया PDF अपने शब्दों को टेक्स्ट के रूप में रखता है: हर अक्षर एक ऐसा कैरेक्टर है जिसे कंप्यूटर पहचानता है। स्कैनर या फ़ोन कैमरे से बना PDF पन्ने की एक तस्वीर रखता है। स्क्रीन पर दोनों में कोई फ़र्क़ नहीं दिखता; पर कंप्यूटर के लिए दूसरे में एक भी शब्द नहीं है।

दस सेकंड में पहचानिए

कुछ PDF मिले-जुले होते हैं — टाइप किए पन्ने, साथ में हस्ताक्षर वाला स्कैन पन्ना या लगाया हुआ सर्टिफ़िकेट — इसलिए उसी पन्ने को जाँचिए जिसकी आपको सच में ज़रूरत है।

  • कोई एक शब्द सिलेक्ट करने की कोशिश कीजिए। अगर नीला बॉक्स पूरे पन्ने पर छा जाए, तो वह तस्वीर है।
  • कोई ऐसा शब्द सर्च कीजिए जो आपको दिख रहा है (Ctrl+F, या Mac पर ⌘F)। स्कैन में कुछ नहीं मिलता।
  • ख़ूब ज़ूम कीजिए। टेक्स्ट हर ज़ूम पर साफ़ रहता है; स्कैन धुँधला या चौकोर-चौकोर दानेदार हो जाता है।
  • साइज़ देखिए। टेक्स्ट के दस पन्ने आमतौर पर कुछ सौ KB के होते हैं; स्कैन किए दस पन्ने अक्सर कई MB के।

इससे क्या फ़र्क़ पड़ता है

स्कैन किए PDF से आप कोई पैराग्राफ़ कॉपी नहीं कर सकते, कोई नाम सर्च नहीं कर सकते, और स्क्रीन रीडर से उसे पढ़वा नहीं सकते। उसे Word में बदलने पर ऐसा डॉक्यूमेंट बनता है जिसमें हर पन्ने की बस एक तस्वीर होती है, क्योंकि डॉक्यूमेंट में डालने को कोई टेक्स्ट है ही नहीं। और स्कैन भारी होते हैं — इसीलिए अपलोड की सीमा अक्सर इन्हीं फ़ाइलों पर टूटती है।

शब्द बाहर निकालना: टेक्स्ट पहचान (OCR)

OCR — ऑप्टिकल कैरेक्टर रिकग्निशन — हर पन्ने की तस्वीर देखकर पता लगाता है कि उस पर कौन-से अक्षर हैं। स्कैन किए PDF के लिए यह काम PDF OCR करता है, और फ़ोटो या स्क्रीनशॉट के लिए इमेज से टेक्स्ट; दोनों आपके ब्राउज़र में चलते हैं और पंद्रह भाषाएँ पढ़ते हैं, जिनमें अरबी, चीनी, हिन्दी और बांग्ला शामिल हैं।

साफ़ छपे पन्नों पर पहचान बहुत अच्छी होती है, पर कभी पूरी तरह सही नहीं। वह जो देखता है वही पढ़ता है, इसलिए स्कैन की क्वालिटी ही नतीजे की क्वालिटी तय करती है:

  • छोटे अक्षरों के लिए 300 DPI पर स्कैन कीजिए; सामान्य आकार के टेक्स्ट के लिए 200 DPI काफ़ी है।
  • पन्ना सपाट और सीधा रखिए, बराबर रोशनी में, हाथ या फ़ोन की परछाईं के बिना।
  • सही भाषा चुनिए। ग़लत भाषा में पढ़ा गया पन्ना चुनी गई भाषा के सबसे मिलते-जुलते अक्षरों में निकलता है।
  • हाथ की लिखावट हर OCR इंजन कमज़ोर पहचानता है; उसे ख़ुद टाइप करने के लिए तैयार रहिए।
  • बाद में नाम, संख्याएँ और तारीख़ें हमेशा आँख से जाँचिए। 0 को O या 1 को l पढ़ लेना सबसे आम ग़लती है, और किसी आधिकारिक फ़ॉर्म पर यही सबसे ज़्यादा मायने रखती है।

किस PDF के लिए कौन-सा टूल

और गाइड

यह पेज अन्य भाषाओं में: English · العربية · বাংলা · Deutsch · Español · فارسی · Français · עברית · Bahasa Indonesia · Português · Русский · Türkçe · اردو · 中文