آخرین بهروزرسانی: ۲۴ سپتامبر ۲۰۲۶
PDFی که از Word، یک وبسایت یا نرمافزار حسابداری ذخیره شده، واژههایش را بهصورت متن نگه میدارد: هر حرف نویسهای است که رایانه آن را میشناسد. PDFی که با اسکنر یا دوربین گوشی ساخته شده، تصویری از صفحه را نگه میدارد. روی صفحهٔ نمایش این دو را نمیشود از هم تشخیص داد؛ اما از نگاه رایانه، دومی اصلاً هیچ واژهای ندارد.
برخی PDFها ترکیبیاند — صفحههای تایپی بههمراه یک صفحهٔ امضای اسکنشده یا گواهی پیوست — پس همان صفحهای را بررسی کنید که واقعاً لازمش دارید.
از PDF اسکنشده نمیتوانید بندی را کپی کنید، نامی را جستوجو کنید یا آن را با صفحهخوان بشنوید. تبدیلش به Word سندی میسازد که هر صفحهاش فقط تصویر همان صفحه است، چون متنی وجود ندارد که در سند قرار بگیرد. و اسکنها حجیماند؛ برای همین همان فایلهایی هستند که از سقف حجم سامانهها رد میشوند.
OCR — تشخیص نوری نویسهها — به تصویر هر صفحه نگاه میکند و تشخیص میدهد چه حروفی در آن است. OCR برای PDF این کار را برای PDF اسکنشده انجام میدهد و تبدیل عکس به متن برای عکس یا اسکرینشات؛ هر دو در مرورگر شما اجرا میشوند و پانزده زبان را میخوانند، از جمله فارسی، عربی، چینی، هندی و بنگالی.
تشخیص روی صفحههای چاپی تمیز بسیار خوب است، اما هیچوقت بینقص نیست. همان چیزی را میخواند که میبیند؛ پس کیفیت اسکن، کیفیت نتیجه را تعیین میکند:
این صفحه به زبانهای دیگر: English · العربية · বাংলা · Deutsch · Español · Français · עברית · हिन्दी · Bahasa Indonesia · Português · Русский · Türkçe · اردو · 中文