PDF اسکن‌شده یا متنی؟ چرا متنش کپی نمی‌شود — و راه‌حل

آخرین به‌روزرسانی: ۲۴ سپتامبر ۲۰۲۶

دو نوع PDF که شبیه هم‌اند

PDFی که از Word، یک وب‌سایت یا نرم‌افزار حسابداری ذخیره شده، واژه‌هایش را به‌صورت متن نگه می‌دارد: هر حرف نویسه‌ای است که رایانه آن را می‌شناسد. PDFی که با اسکنر یا دوربین گوشی ساخته شده، تصویری از صفحه را نگه می‌دارد. روی صفحهٔ نمایش این دو را نمی‌شود از هم تشخیص داد؛ اما از نگاه رایانه، دومی اصلاً هیچ واژه‌ای ندارد.

چطور در ده ثانیه بفهمید

برخی PDFها ترکیبی‌اند — صفحه‌های تایپی به‌همراه یک صفحهٔ امضای اسکن‌شده یا گواهی پیوست — پس همان صفحه‌ای را بررسی کنید که واقعاً لازمش دارید.

  • سعی کنید فقط یک واژه را انتخاب کنید. اگر به‌جایش کادری آبی کل صفحه را پوشاند، با تصویر طرفید.
  • واژه‌ای را که می‌بینید جست‌وجو کنید (Ctrl+F، یا ⌘F در مک). در اسکن چیزی پیدا نمی‌شود.
  • خیلی بزرگ‌نمایی کنید. متن در هر بزرگ‌نمایی تیز می‌ماند؛ اسکن تار یا شطرنجی می‌شود.
  • به حجم نگاه کنید. ده صفحه متن معمولاً چند صد کیلوبایت است؛ ده صفحهٔ اسکن‌شده اغلب چند مگابایت.

چرا اهمیت دارد

از PDF اسکن‌شده نمی‌توانید بندی را کپی کنید، نامی را جست‌وجو کنید یا آن را با صفحه‌خوان بشنوید. تبدیلش به Word سندی می‌سازد که هر صفحه‌اش فقط تصویر همان صفحه است، چون متنی وجود ندارد که در سند قرار بگیرد. و اسکن‌ها حجیم‌اند؛ برای همین همان فایل‌هایی هستند که از سقف حجم سامانه‌ها رد می‌شوند.

بیرون کشیدن واژه‌ها: تشخیص متن (OCR)

OCR — تشخیص نوری نویسه‌ها — به تصویر هر صفحه نگاه می‌کند و تشخیص می‌دهد چه حروفی در آن است. OCR برای PDF این کار را برای PDF اسکن‌شده انجام می‌دهد و تبدیل عکس به متن برای عکس یا اسکرین‌شات؛ هر دو در مرورگر شما اجرا می‌شوند و پانزده زبان را می‌خوانند، از جمله فارسی، عربی، چینی، هندی و بنگالی.

تشخیص روی صفحه‌های چاپی تمیز بسیار خوب است، اما هیچ‌وقت بی‌نقص نیست. همان چیزی را می‌خواند که می‌بیند؛ پس کیفیت اسکن، کیفیت نتیجه را تعیین می‌کند:

  • برای حروف ریز با ۳۰۰ DPI اسکن کنید؛ برای متن با اندازهٔ معمولی ۲۰۰ DPI کافی است.
  • صفحه را صاف و مستقیم، در نور یکنواخت و بدون سایهٔ دست یا گوشی نگه دارید.
  • زبان درست را انتخاب کنید. صفحه‌ای که با زبان اشتباه خوانده شود، به شکل شبیه‌ترین حروفِ زبانِ انتخاب‌شده درمی‌آید.
  • هیچ موتور OCRی دست‌خط را خوب تشخیص نمی‌دهد؛ انتظار داشته باشید آن را خودتان تایپ کنید.
  • نام‌ها، عددها و تاریخ‌ها را بعد از تشخیص همیشه با چشم بررسی کنید. رایج‌ترین خطا این است که 0 به‌صورت O یا 1 به‌صورت l خوانده شود، و در یک فرم رسمی همین خطا از همه مهم‌تر است.

کدام ابزار برای کدام PDF

راهنماهای دیگر

این صفحه به زبان‌های دیگر: English · العربية · বাংলা · Deutsch · Español · Français · עברית · हिन्दी · Bahasa Indonesia · Português · Русский · Türkçe · اردو · 中文