Обычный OCR распознает символы, но не обязан понимать, какие слова относятся к одной строке и где проходят границы столбцов.
Для таблиц нужен отдельный layout-анализ и контроль структуры, особенно если в документе есть сканы, объединенные ячейки или слабые линии.
Как именно теряется структура таблицы
Важно отделить ошибку распознавания текста от ошибки восстановления расположения.
- Значения всех столбцов объединяются в один текстовый поток.
- Часть строк пропускается или меняется местами.
- Заголовок связывается не с тем столбцом.
- Объединенные ячейки создают сдвиг остальных данных.
Почему возникает проблема
PDF может содержать готовый текстовый слой, изображение страницы или смесь обоих вариантов.
- Скан имеет низкое разрешение, перекос, шум или неравномерный фон.
- Используется текстовый OCR без модели таблиц и координат.
- Тонкие или отсутствующие линии не позволяют определить границы ячеек.
- Порядок чтения PDF отличается от визуального расположения.
- Предобработка обрезает крайние столбцы или уменьшает мелкий шрифт.
Пошаговая диагностика
Начните с классификации страниц и измеримого примера ожидаемого результата.
- Проверьте, есть ли в PDF извлекаемый текст и координаты символов.
- Отрендерите проблемную страницу в достаточном разрешении без лишнего сжатия.
- Сравните OCR-текст, bounding boxes и визуальные границы таблицы.
- Отметьте merged cells, повторяющиеся заголовки и продолжения на следующей странице.
- Соберите контрольный набор таблиц с ручной разметкой строк и столбцов.
Комбинируйте текстовый слой и анализ макета
Если PDF уже содержит качественный текст, повторный OCR может только ухудшить результат.
- Текст извлекается напрямую, когда он доступен и корректен.
- OCR применяется только к сканированным или поврежденным областям.
- Координаты слов группируются по строкам, столбцам и ячейкам.
- Структура проверяется бизнес-правилами, а не только уверенностью модели.
Как исправить проблему
Постройте конвейер, который сохраняет координаты и отдельно восстанавливает таблицу.
- Исправьте поворот, перспективу, контраст и разрешение изображения страницы.
- Используйте модель layout или table recognition вместе с OCR.
- Сопоставляйте слова с ячейками по координатам и допустимым пересечениям.
- Обрабатывайте объединенные ячейки и многострочные значения отдельными правилами.
- Сохраняйте исходную страницу и координаты для последующей проверки спорных полей.
Как проверить результат
- Количество строк и ключевых столбцов совпадает с исходником.
- Суммы по таблице сходятся с итогами документа.
- Заголовки и единицы измерения привязаны к правильным данным.
- Поля с низкой уверенностью отправляются на ручную проверку.
Типичные ошибки
- Передавать весь PDF в простой OCR и ждать готовый Excel.
- Оценивать качество только по наличию распознанных слов.
- Удалять координаты после распознавания.
- Не учитывать продолжение таблицы на следующей странице.
Как предотвратить повторение
- Храните эталонный набор разных типов PDF и таблиц.
- Измеряйте точность по ячейкам и критичным полям.
- Версионируйте настройки рендера, OCR и layout-моделей.
- Добавьте автоматическую проверку итогов, дат и числовых форматов.
Когда нужна помощь
Если OCR теряет таблицы в ваших PDF, я разберу типы документов, настрою извлечение текста и layout-анализ, добавлю проверку структуры и подготовлю надежный экспорт данных.