স্ক্যান করা PDF না টেক্সট PDF? লেখা কেন কপি হয় না — আর কীভাবে ঠিক করবেন

সর্বশেষ হালনাগাদ ২৪ সেপ্টেম্বর ২০২৬

দেখতে এক রকম, আসলে দুই রকম PDF

Word, কোনো ওয়েবসাইট বা হিসাবের সফটওয়্যার থেকে সেভ করা PDF তার শব্দগুলো রাখে লেখা হিসেবে: প্রতিটা অক্ষর কম্পিউটারের চেনা একেকটা ক্যারেক্টার। স্ক্যানার বা ফোনের ক্যামেরা দিয়ে বানানো PDF রাখে পাতার একটা ছবি। স্ক্রিনে দুটো আলাদা করা যায় না; কিন্তু কম্পিউটারের কাছে দ্বিতীয়টায় একটা শব্দও নেই।

দশ সেকেন্ডে কীভাবে বুঝবেন

কিছু PDF মেশানো — টাইপ করা পাতার সঙ্গে স্ক্যান করা সইয়ের পাতা বা জুড়ে দেওয়া সার্টিফিকেট — তাই যে পাতাটা আপনার আসলে দরকার, সেটাই যাচাই করুন।

  • একটা শব্দ সিলেক্ট করার চেষ্টা করুন। শব্দের বদলে পুরো পাতা জুড়ে নীল বাক্স পড়লে, ওটা ছবি।
  • স্ক্রিনে দেখা যাচ্ছে এমন একটা শব্দ সার্চ করুন (Ctrl+F, Mac-এ ⌘F)। স্ক্যানে কিছুই পাওয়া যায় না।
  • অনেকখানি জুম করুন। লেখা যত জুমই হোক ঝকঝকে থাকে; স্ক্যান ঝাপসা বা খোপ খোপ হয়ে যায়।
  • সাইজ দেখুন। দশ পাতার লেখা সাধারণত কয়েকশো কিলোবাইট; দশ পাতার স্ক্যান প্রায়ই কয়েক মেগাবাইট।

কেন এটা জরুরি

স্ক্যান করা PDF থেকে একটা অনুচ্ছেদ কপি করা যায় না, কোনো নাম সার্চ করা যায় না, স্ক্রিন রিডার দিয়ে পড়িয়ে শোনানোও যায় না। Word-এ কনভার্ট করলে এমন একটা ডকুমেন্ট হয় যার প্রতিটা পাতায় শুধু একটা ছবি, কারণ ডকুমেন্টে বসানোর মতো কোনো লেখাই নেই। আর স্ক্যান ফাইল বড় হয় — সেজন্যই আপলোডের সীমা ভাঙে সাধারণত এগুলোই।

লেখা বের করা: লেখা চেনার প্রযুক্তি (OCR)

OCR (optical character recognition) প্রতিটা পাতার ছবি দেখে বের করে সেখানে কোন কোন অক্ষর আছে। PDF OCR এটা করে স্ক্যান করা PDF-এর জন্য, আর ছবি থেকে লেখা করে ফটো বা স্ক্রিনশটের জন্য; দুটোই চলে আপনার ব্রাউজারে, আর পনেরোটা ভাষা পড়তে পারে — বাংলা, আরবি, চীনা আর হিন্দিসহ।

পরিষ্কার ছাপা পাতায় চেনার মান খুব ভালো, তবে কখনো নিখুঁত নয়। OCR যা দেখে তা-ই পড়ে, তাই স্ক্যানের মানই ফলের মান ঠিক করে দেয়:

  • ছোট ছাপার জন্য 300 DPI-তে স্ক্যান করুন; সাধারণ আকারের লেখার জন্য 200 DPI যথেষ্ট।
  • পাতা সমান আর সোজা রাখুন, আলো যেন সব জায়গায় সমান থাকে, হাত বা ফোনের ছায়া যেন না পড়ে।
  • সঠিক ভাষা বেছে নিন। ভুল ভাষা বেছে পড়ালে পাতাটা বেরিয়ে আসে বেছে নেওয়া ভাষার সবচেয়ে কাছাকাছি দেখতে অক্ষরে।
  • হাতের লেখা কোনো OCR ইঞ্জিনই ভালো চেনে না; ওটা নিজে টাইপ করতে হবে বলে ধরে নিন।
  • পরে নাম, সংখ্যা আর তারিখ সবসময় নিজের চোখে মিলিয়ে নিন। শূন্য (0)-কে ইংরেজি O, বা 1-কে ছোট হাতের l পড়াই সবচেয়ে সাধারণ ভুল — আর সরকারি ফরমে ঠিক এখানেই ভুলের দাম সবচেয়ে বেশি।

কোন PDF-এর জন্য কোন টুল

আরও গাইড

এই পাতা অন্য ভাষায়: English · العربية · Deutsch · Español · فارسی · Français · עברית · हिन्दी · Bahasa Indonesia · Português · Русский · Türkçe · اردو · 中文