अंतिम अपडेट: 24 सितंबर 2026
Word, किसी वेबसाइट या अकाउंटिंग सॉफ़्टवेयर से सेव किया गया PDF अपने शब्दों को टेक्स्ट के रूप में रखता है: हर अक्षर एक ऐसा कैरेक्टर है जिसे कंप्यूटर पहचानता है। स्कैनर या फ़ोन कैमरे से बना PDF पन्ने की एक तस्वीर रखता है। स्क्रीन पर दोनों में कोई फ़र्क़ नहीं दिखता; पर कंप्यूटर के लिए दूसरे में एक भी शब्द नहीं है।
कुछ PDF मिले-जुले होते हैं — टाइप किए पन्ने, साथ में हस्ताक्षर वाला स्कैन पन्ना या लगाया हुआ सर्टिफ़िकेट — इसलिए उसी पन्ने को जाँचिए जिसकी आपको सच में ज़रूरत है।
स्कैन किए PDF से आप कोई पैराग्राफ़ कॉपी नहीं कर सकते, कोई नाम सर्च नहीं कर सकते, और स्क्रीन रीडर से उसे पढ़वा नहीं सकते। उसे Word में बदलने पर ऐसा डॉक्यूमेंट बनता है जिसमें हर पन्ने की बस एक तस्वीर होती है, क्योंकि डॉक्यूमेंट में डालने को कोई टेक्स्ट है ही नहीं। और स्कैन भारी होते हैं — इसीलिए अपलोड की सीमा अक्सर इन्हीं फ़ाइलों पर टूटती है।
OCR — ऑप्टिकल कैरेक्टर रिकग्निशन — हर पन्ने की तस्वीर देखकर पता लगाता है कि उस पर कौन-से अक्षर हैं। स्कैन किए PDF के लिए यह काम PDF OCR करता है, और फ़ोटो या स्क्रीनशॉट के लिए इमेज से टेक्स्ट; दोनों आपके ब्राउज़र में चलते हैं और पंद्रह भाषाएँ पढ़ते हैं, जिनमें अरबी, चीनी, हिन्दी और बांग्ला शामिल हैं।
साफ़ छपे पन्नों पर पहचान बहुत अच्छी होती है, पर कभी पूरी तरह सही नहीं। वह जो देखता है वही पढ़ता है, इसलिए स्कैन की क्वालिटी ही नतीजे की क्वालिटी तय करती है:
यह पेज अन्य भाषाओं में: English · العربية · বাংলা · Deutsch · Español · فارسی · Français · עברית · Bahasa Indonesia · Português · Русский · Türkçe · اردو · 中文