اسکین شدہ PDF یا متن والی PDF؟ متن کاپی کیوں نہیں ہوتا — اور حل

آخری تازہ کاری: 24 ستمبر 2026

دو قسم کی PDF جو ایک جیسی دکھتی ہیں

Word، کسی ویب سائٹ یا اکاؤنٹنگ سافٹ ویئر سے محفوظ کی گئی PDF اپنے الفاظ متن کی صورت میں رکھتی ہے: ہر حرف ایک ایسا کیریکٹر ہے جسے کمپیوٹر پہچانتا ہے۔ اسکینر یا موبائل کیمرے سے بنی PDF صفحے کی ایک تصویر رکھتی ہے۔ اسکرین پر دونوں میں کوئی فرق نظر نہیں آتا؛ مگر کمپیوٹر کے لیے دوسری میں ایک لفظ بھی نہیں۔

دس سیکنڈ میں کیسے پہچانیں

کچھ PDF ملی جلی ہوتی ہیں — ٹائپ شدہ صفحات کے ساتھ دستخط والا اسکین صفحہ یا منسلک سرٹیفکیٹ — اس لیے وہی صفحہ جانچیں جس کی آپ کو واقعی ضرورت ہے۔

  • صرف ایک لفظ منتخب کرنے کی کوشش کریں۔ اگر اس کے بجائے پورا صفحہ نیلے خانے میں آ جائے تو یہ تصویر ہے۔
  • کوئی نظر آنے والا لفظ تلاش کریں (Ctrl+F، یا Mac پر ⌘F)۔ اسکین میں کچھ نہیں ملتا۔
  • بہت زیادہ زوم کریں۔ متن ہر زوم پر تیز رہتا ہے؛ اسکین دھندلا یا خانے دار ہو جاتا ہے۔
  • سائز دیکھیں۔ دس صفحے کا متن عموماً چند سو کلوبائٹ ہوتا ہے؛ دس اسکین شدہ صفحے اکثر کئی میگابائٹ۔

یہ کیوں اہم ہے

اسکین شدہ PDF سے آپ نہ کوئی پیراگراف کاپی کر سکتے ہیں، نہ کوئی نام تلاش کر سکتے ہیں، نہ اسکرین ریڈر سے اسے سن سکتے ہیں۔ اسے Word میں تبدیل کریں تو ایسی دستاویز بنتی ہے جس کے ہر صفحے پر بس اسی صفحے کی تصویر ہوتی ہے، کیونکہ دستاویز میں ڈالنے کو کوئی متن ہے ہی نہیں۔ اور اسکین بھاری ہوتے ہیں، اسی لیے یہی فائلیں اپ لوڈ کی حدیں توڑتی ہیں۔

الفاظ باہر نکالنا: متن شناخت (OCR)

OCR — یعنی آپٹیکل کیریکٹر ریکگنیشن — ہر صفحے کی تصویر دیکھ کر پہچانتا ہے کہ اس میں کون سے حروف ہیں۔ PDF OCR یہ کام اسکین شدہ PDF کے لیے کرتا ہے اور تصویر سے متن کسی تصویر یا اسکرین شاٹ کے لیے؛ دونوں آپ کے براؤزر میں چلتے ہیں اور پندرہ زبانیں پڑھتے ہیں، جن میں اردو، عربی، چینی، ہندی اور بنگلہ شامل ہیں۔

صاف چھپے ہوئے صفحات پر پہچان بہت اچھی ہوتی ہے، مگر کبھی مکمل نہیں۔ یہ وہی پڑھتی ہے جو اسے نظر آتا ہے، اس لیے اسکین کا معیار ہی نتیجے کا معیار طے کرتا ہے:

  • باریک چھپائی کے لیے 300 DPI پر اسکین کریں؛ عام سائز کے متن کے لیے 200 DPI کافی ہے۔
  • صفحہ ہموار اور سیدھا رکھیں، یکساں روشنی میں، ہاتھ یا فون کے سائے کے بغیر۔
  • درست زبان چنیں۔ جو صفحہ غلط زبان کے طور پر پڑھا جائے وہ چنی ہوئی زبان کے سب سے ملتے جلتے حروف کی صورت میں نکلتا ہے۔
  • ہاتھ کی لکھائی کو ہر OCR انجن کمزور ہی پہچانتا ہے؛ توقع رکھیں کہ اسے خود ٹائپ کرنا پڑے گا۔
  • نام، اعداد اور تاریخیں بعد میں ہمیشہ آنکھ سے جانچیں۔ سب سے عام غلطی 0 کو O یا 1 کو l پڑھ لینا ہے، اور سرکاری فارم پر یہی سب سے زیادہ معنی رکھتی ہے۔

کون سی PDF کے لیے کون سا ٹول

مزید رہنما مضامین

یہ صفحہ دوسری زبانوں میں: English · العربية · বাংলা · Deutsch · Español · فارسی · Français · עברית · हिन्दी · Bahasa Indonesia · Português · Русский · Türkçe · 中文