Блог

Ошибка OCR: как проверить и исправить текст после распознавания

Даже качественное распознавание не освобождает от проверки: у скана могут быть тени, у фото — блики, а в таблице — слишком мелкие цифры. Ошибка OCR обычно возникает не из-за одного «плохого» символа, а из сочетания качества исходника и особенностей документа. Правильная проверка занимает несколько минут и предотвращает ошибки в реквизитах, суммах и датах.

Какие ошибки встречаются чаще всего

OCR может спутать визуально похожие знаки: «О» и «0», «З» и «3», «1», «l» и «I». В старом скане появляются лишние символы от пыли и печатей, а переносы слов в книге превращаются в разрывы строки. В таблицах иногда слипаются соседние ячейки.

Такие неточности не одинаково опасны. Опечатка в обычном абзаце заметна при чтении, но неверная цифра в сумме, дате или номере договора может повлиять на решение. Поэтому проверяйте материал по степени риска, а не только по общему впечатлению от текста.

Предотвратите проблему до распознавания

Лучший способ исправить ошибку OCR — не создавать её. Для скана используйте ровное положение страницы и достаточное разрешение, обычно около 300 dpi. Для фотографии обеспечьте свет без бликов, держите камеру параллельно листу и убедитесь, что текст резкий. Не пересохраняйте изображения много раз с сильным сжатием.

Скан PDF удобнее загрузить через «PDF в текст», а отдельное изображение — через «Фото в текст». Для данных из интерфейса используйте распознавание скриншота: цифровой снимок обычно чище фотографии монитора.

Проверяйте текст в правильном порядке

Не начинайте с исправления каждой запятой. Сначала сверяйте поля, где ошибка критична: номер документа, дату, сумму, ИНН, банковские реквизиты, адрес, фамилию и срок. Затем проверьте заголовки, нумерацию пунктов и итоговые строки таблиц. После этого можно исправлять переносы, пробелы и стили.

  1. Откройте исходник и распознанный текст рядом.
  2. Сверьте все числа и именованные поля.
  3. Проверьте начало, конец и переходы между страницами.
  4. Убедитесь, что строки таблицы не смешались.
  5. Только потом применяйте массовые исправления.

Как исправлять типовые неточности

Поиск и замена экономят время, если ошибка повторяется одинаково. Но нельзя бездумно менять все «О» на нули или наоборот: в словах и реквизитах эти символы имеют разный смысл. Сначала найдите несколько примеров, убедитесь в закономерности и ограничьте замену нужным участком.

Орфографическая проверка полезна для обычного русского текста, но не распознаёт неверный номер счёта или фамилию. В Excel после переноса таблицы отдельно проверьте формат ячеек, десятичные разделители и значения в строке «Итого». В договоре сравните не только цифры, но и сумму прописью.

Когда лучше пересканировать страницу

Если на листе много случайных символов, строки перекошены или мелкий текст стал нечитаемым, ручная правка может занять дольше повторной съёмки. Пересканируйте проблемную страницу, расправьте её, уберите тени и загрузите улучшенную версию. Не нужно заново обрабатывать весь архив, если ошибка локальна.

Системные трудности возникают с рукописными пометками, печатями поверх текста, фактурной бумагой и повреждёнными копиями. В таких случаях сохраняйте фрагмент изображения рядом с вычитанным текстом и при необходимости перепроверяйте смысл вручную.

Контроль качества для команды

В документообороте полезен короткий единый чек-лист. Один сотрудник готовит черновик, другой сверяет критичные поля по оригиналу. Такой порядок особенно важен перед отправкой контрагенту, внесением данных в учётную систему или публикацией на сайте.

Храните исходный файл и финальную версию с понятными именами: «договор_исходник.pdf» и «договор_проверен.docx». Это упрощает аудит и позволяет доказать, что в тексте исправляли ошибки распознавания, а не меняли содержание документа.

FAQ

Почему OCR путает букву «О» и цифру «0»?

Они похожи визуально, особенно в мелком или размытом шрифте. Проверяйте их по контексту: в слове обычно нужна буква, в цифровом реквизите — цифра.

Можно ли полностью доверять результату?

Нет, если в документе есть важные данные. Распознавание ускоряет работу, но финальную ответственность за проверку несёт пользователь.

Что делать, если ошибок слишком много?

Улучшите исходник и повторите обработку. При работе с PDF начните с страницы распознавания PDF.

Превратите черновик в надёжный текст

Загрузите качественный исходник на 2text.ru, затем сверяйте критичные поля с оригиналом. Такой подход позволяет быстро устранить ошибку OCR и использовать распознанный текст без ручного набора с нуля.

← К блогу