Запрос PDF в Word онлайн обычно означает одно из двух: нужно перенести обычный текстовый файл в редактор или извлечь данные из скана. Эти задачи выглядят одинаково, но решаются по-разному. Если PDF состоит из изображений страниц, обычный конвертер перенесёт в Word картинки, а не буквы. В таком случае сначала требуется OCR — распознавание текста. На 2Text «PDF в текст» можно обработать скан и подготовить текст к редактированию.
Почему PDF не всегда можно скопировать
Текстовый PDF создаётся из Word, бухгалтерской программы или редактора макетов. В нём символы существуют как текст: их можно выделить курсором, найти поиском и вставить в документ. Такой файл обычно достаточно открыть в конвертере или скопировать нужный фрагмент вручную.
Скан PDF устроен иначе. Каждая страница — фотография или отсканированное изображение, упакованное в формат PDF. Визуально это тот же договор, акт или заявление, но компьютер видит только картинку. Запрос «пдф в текст» в этом случае требует оптического распознавания символов.
Как отличить текстовый PDF от скана
Проверка занимает несколько секунд. Откройте документ и попробуйте выделить одно слово. Если выделяется только прямоугольная область страницы, перед вами скан PDF. Если можно выделить буквы, скопировать фразу и вставить её в заметки, текстовый слой уже есть.
Дополнительный признак — поиск внутри файла. Введите редкое слово из документа. Отсутствие результата не всегда означает скан, но вместе с невозможностью выделить символы это надёжный сигнал, что потребуется OCR. Большой размер файла также часто указывает на изображения, особенно у многостраничных чёрно-белых документов.
Когда нужен OCR, а когда — конвертер
Обычный конвертер подойдёт для экспортированного из редактора PDF, если важнее быстро получить редактируемые абзацы. При сложной вёрстке всё равно может потребоваться ручная доводка заголовков, переносов и таблиц.
OCR выбирают для архивных сканов, подписанных бумажных договоров, документов из МФУ, старых инструкций и PDF из мобильного сканера. Распознавание сначала определяет буквы на каждой странице, затем формирует текст. После этого его можно вставить в Word, систему учёта или таблицу.
Как перевести скан PDF в текст
- Откройте страницу распознавания PDF.
- Загрузите исходный файл целиком, сохранив порядок страниц.
- После обработки проверьте полученный текст по оригиналу.
- Уточните числа, даты, фамилии, номера договоров и реквизиты.
- Скопируйте готовый материал в Word или другой редактор.
Не нужно предварительно распечатывать PDF или делать снимки экрана. Исходный файл обычно даёт более чёткие страницы, чем повторная фотография. Если документ прислан отдельными изображениями, воспользуйтесь разделом «Фото в текст».
Как улучшить качество распознавания
Для нового скана выставляйте разрешение около 300 dpi: его обычно достаточно для печатного текста и мелких реквизитов. Выравнивайте страницу, обрезайте широкие пустые поля и следите, чтобы крышка сканера была чистой. Пыль, полосы и тени иногда превращаются в лишние символы.
- не пересохраняйте страницу несколько раз в JPG — сжатие ухудшает контуры букв;
- для текстового документа подойдёт чёрно-белый или серый скан;
- сохраняйте цвет, если важны пометки, печати или цветовые маркеры;
- проверяйте страницы, снятые под углом мобильной камерой;
- не смешивайте в одном файле развороты и одиночные страницы без порядка.
Если ошибок слишком много, лучше пересканировать проблемный лист, чем исправлять его вручную. Подробный порядок проверки описан в материале об ошибках OCR.
Что делать с таблицами и смешанными файлами
Табличные документы требуют повышенного внимания. OCR может верно распознать цифры, но объединить соседние колонки или изменить перенос строки. После переноса в Word или Excel сверяйте названия столбцов, итоговые строки, единицы измерения и суммы.
В одном PDF иногда встречаются и текстовые страницы, и сканы приложений. Такой файл стоит проверять постранично: копируемый текст можно извлечь напрямую, а изображения отправить на распознавание. Сохраняйте исходник до завершения правок — он нужен для контрольной сверки.
FAQ
Можно ли сразу получить идеально оформленный документ Word?
Текст обычно готов к редактированию, но сложные таблицы, колонтитулы и необычная вёрстка могут потребовать ручной настройки. OCR экономит набор, а не отменяет проверку оформления.
Подойдёт ли парольный PDF?
Обрабатывайте только файлы, к которым у вас есть законный доступ. Если документ защищён, сначала используйте пароль или разрешённый способ открыть его.
Где посмотреть актуальные условия обработки?
Текущие ограничения и стоимость указаны на странице тарифов 2Text.
Получите редактируемый текст из PDF
Проверьте, выделяются ли буквы в файле. Если нет, загрузите скан PDF на 2text.ru/pdf-v-tekst, сверяйте важные данные с оригиналом и переносите готовый текст в Word без перепечатки.