OCR (оптическое распознавание символов)
Определение
OCR преобразует сканы, фотографии и PDF-файлы в машиночитаемый текст. Это первый шаг автоматизации документооборота, дающий на выходе только символы — смысл, проверка и логика проводки добавляются на уровнях выше.
Современный OCR надёжно обрабатывает макет, таблицы и смешанные языки, но качество всё равно зависит от исходника: разрешения, контраста и ориентации скана.
Результат OCR следует рассматривать как сырьё, требующее проверки, а не как подтверждённое значение.
На практике
- Качество зависит от разрешения и макета исходника
- Результат требует проверки перед использованием в проводках
- Один из строительных блоков интеллектуальной обработки документов
Смежные термины
- Интеллектуальная обработка документов (IDP)Интеллектуальная обработка документов извлекает структурированные данные из счетов, накладных, договоров или форм, проверяет их по базовым данным и записывает в целевую систему. Она сочетает OCR для распознавания, модели для интерпретации и правила для проверки.
- API-интеграцияAPI-интеграция соединяет две системы через их программные интерфейсы, чтобы данные передавались автоматически и надёжно. Это стабильная альтернатива ручному вводу, обмену CSV-файлами и роботам интерфейса, и она составляет основу любой серьёзной автоматизации.