Скан или текстовый PDF? Почему текст не копируется — и как это исправить
Обновлено 24 сентября 2026 г.
Два вида PDF, которые выглядят одинаково
PDF, сохранённый из Word, с сайта или из бухгалтерской программы, хранит слова как текст: каждая буква — это символ, известный компьютеру. PDF, созданный сканером или камерой телефона, хранит картинку страницы. На экране их не отличить, но для компьютера во втором нет ни одного слова.
Как отличить за десять секунд
Бывают и смешанные PDF — напечатанные страницы плюс отсканированная страница с подписью или приложенный сертификат, — так что проверяйте именно ту страницу, которая вам нужна.
- Попробуйте выделить одно слово. Если вместо этого синяя рамка закрывает всю страницу — перед вами картинка.
- Поищите слово, которое видите на странице (Ctrl+F или ⌘F на Mac). В скане поиск ничего не найдёт.
- Сильно увеличьте масштаб. Текст остаётся чётким при любом увеличении, а скан расплывается или рассыпается на квадратики.
- Посмотрите на размер. Десять страниц текста обычно занимают несколько сотен килобайт, десять отсканированных страниц — часто несколько мегабайт.
Почему это важно
Из отсканированного PDF нельзя скопировать абзац, в нём не найти фамилию, и программа экранного доступа не прочитает его вслух. При преобразовании в Word получится документ с картинкой каждой страницы — ведь текста, который можно было бы туда перенести, нет. К тому же сканы большие, поэтому именно они и не проходят по лимитам загрузки.
Как достать слова: распознавание текста (OCR)
OCR — оптическое распознавание символов — смотрит на картинку каждой страницы и определяет, какие на ней буквы. PDF OCR делает это для отсканированного PDF, а распознавание текста с изображения — для фото или скриншота. Оба работают в браузере и читают пятнадцать языков, в том числе русский, арабский, китайский, хинди и бенгальский.
С чистыми печатными страницами распознавание справляется очень хорошо, но идеальным не бывает никогда. Оно читает то, что видит, поэтому качество скана определяет качество результата:
- Мелкий шрифт сканируйте с разрешением 300 DPI; для текста обычного размера достаточно 200 DPI.
- Страница должна лежать ровно и прямо, при равномерном свете, без тени от руки или телефона.
- Выберите правильный язык. Страница, прочитанная как другой язык, превращается в самые похожие на вид буквы выбранного языка.
- Рукописный текст плохо распознаёт любая система OCR — будьте готовы набрать его сами.
- Всегда проверяйте глазами имена, числа и даты. Ноль, прочитанный как буква O, или единица, прочитанная как l, — самые частые ошибки, и в официальной анкете они важнее всего.
Какой инструмент для какого PDF
- Текстовый PDF, который нужно отредактировать: PDF в Word или PDF в текст, если нужны только слова.
- Отсканированный PDF, в котором нужно искать или из которого нужно копировать: PDF OCR.
- Отсканированный PDF, который слишком велик для отправки: сожмите PDF до размера, который просит портал, — а что делает сканы такими большими, объясняет руководство почему портал не принимает файл.
Другие руководства
Эта страница на других языках: English · العربية · বাংলা · Deutsch · Español · فارسی · Français · עברית · हिन्दी · Bahasa Indonesia · Português · Türkçe · اردو · 中文