সর্বশেষ হালনাগাদ ২৪ সেপ্টেম্বর ২০২৬
Word, কোনো ওয়েবসাইট বা হিসাবের সফটওয়্যার থেকে সেভ করা PDF তার শব্দগুলো রাখে লেখা হিসেবে: প্রতিটা অক্ষর কম্পিউটারের চেনা একেকটা ক্যারেক্টার। স্ক্যানার বা ফোনের ক্যামেরা দিয়ে বানানো PDF রাখে পাতার একটা ছবি। স্ক্রিনে দুটো আলাদা করা যায় না; কিন্তু কম্পিউটারের কাছে দ্বিতীয়টায় একটা শব্দও নেই।
কিছু PDF মেশানো — টাইপ করা পাতার সঙ্গে স্ক্যান করা সইয়ের পাতা বা জুড়ে দেওয়া সার্টিফিকেট — তাই যে পাতাটা আপনার আসলে দরকার, সেটাই যাচাই করুন।
স্ক্যান করা PDF থেকে একটা অনুচ্ছেদ কপি করা যায় না, কোনো নাম সার্চ করা যায় না, স্ক্রিন রিডার দিয়ে পড়িয়ে শোনানোও যায় না। Word-এ কনভার্ট করলে এমন একটা ডকুমেন্ট হয় যার প্রতিটা পাতায় শুধু একটা ছবি, কারণ ডকুমেন্টে বসানোর মতো কোনো লেখাই নেই। আর স্ক্যান ফাইল বড় হয় — সেজন্যই আপলোডের সীমা ভাঙে সাধারণত এগুলোই।
OCR (optical character recognition) প্রতিটা পাতার ছবি দেখে বের করে সেখানে কোন কোন অক্ষর আছে। PDF OCR এটা করে স্ক্যান করা PDF-এর জন্য, আর ছবি থেকে লেখা করে ফটো বা স্ক্রিনশটের জন্য; দুটোই চলে আপনার ব্রাউজারে, আর পনেরোটা ভাষা পড়তে পারে — বাংলা, আরবি, চীনা আর হিন্দিসহ।
পরিষ্কার ছাপা পাতায় চেনার মান খুব ভালো, তবে কখনো নিখুঁত নয়। OCR যা দেখে তা-ই পড়ে, তাই স্ক্যানের মানই ফলের মান ঠিক করে দেয়:
এই পাতা অন্য ভাষায়: English · العربية · Deutsch · Español · فارسی · Français · עברית · हिन्दी · Bahasa Indonesia · Português · Русский · Türkçe · اردو · 中文