آخری تازہ کاری: 24 ستمبر 2026
Word، کسی ویب سائٹ یا اکاؤنٹنگ سافٹ ویئر سے محفوظ کی گئی PDF اپنے الفاظ متن کی صورت میں رکھتی ہے: ہر حرف ایک ایسا کیریکٹر ہے جسے کمپیوٹر پہچانتا ہے۔ اسکینر یا موبائل کیمرے سے بنی PDF صفحے کی ایک تصویر رکھتی ہے۔ اسکرین پر دونوں میں کوئی فرق نظر نہیں آتا؛ مگر کمپیوٹر کے لیے دوسری میں ایک لفظ بھی نہیں۔
کچھ PDF ملی جلی ہوتی ہیں — ٹائپ شدہ صفحات کے ساتھ دستخط والا اسکین صفحہ یا منسلک سرٹیفکیٹ — اس لیے وہی صفحہ جانچیں جس کی آپ کو واقعی ضرورت ہے۔
اسکین شدہ PDF سے آپ نہ کوئی پیراگراف کاپی کر سکتے ہیں، نہ کوئی نام تلاش کر سکتے ہیں، نہ اسکرین ریڈر سے اسے سن سکتے ہیں۔ اسے Word میں تبدیل کریں تو ایسی دستاویز بنتی ہے جس کے ہر صفحے پر بس اسی صفحے کی تصویر ہوتی ہے، کیونکہ دستاویز میں ڈالنے کو کوئی متن ہے ہی نہیں۔ اور اسکین بھاری ہوتے ہیں، اسی لیے یہی فائلیں اپ لوڈ کی حدیں توڑتی ہیں۔
OCR — یعنی آپٹیکل کیریکٹر ریکگنیشن — ہر صفحے کی تصویر دیکھ کر پہچانتا ہے کہ اس میں کون سے حروف ہیں۔ PDF OCR یہ کام اسکین شدہ PDF کے لیے کرتا ہے اور تصویر سے متن کسی تصویر یا اسکرین شاٹ کے لیے؛ دونوں آپ کے براؤزر میں چلتے ہیں اور پندرہ زبانیں پڑھتے ہیں، جن میں اردو، عربی، چینی، ہندی اور بنگلہ شامل ہیں۔
صاف چھپے ہوئے صفحات پر پہچان بہت اچھی ہوتی ہے، مگر کبھی مکمل نہیں۔ یہ وہی پڑھتی ہے جو اسے نظر آتا ہے، اس لیے اسکین کا معیار ہی نتیجے کا معیار طے کرتا ہے:
یہ صفحہ دوسری زبانوں میں: English · العربية · বাংলা · Deutsch · Español · فارسی · Français · עברית · हिन्दी · Bahasa Indonesia · Português · Русский · Türkçe · 中文