OCR (reconnaissance optique de caractères)
Définition
L'OCR convertit des scans, photos et PDF en texte exploitable par une machine. C'est l'étape d'entrée de l'automatisation documentaire et elle ne livre que des caractères — le sens, la validation et la logique d'enregistrement sont ajoutés par les couches supérieures.
L'OCR moderne gère la mise en page, les tableaux et les langues mixtes de manière fiable, mais la qualité dépend toujours de la source : résolution, contraste et orientation du scan.
Il faut traiter la sortie de l'OCR comme une matière brute à valider, jamais comme une valeur vérifiée.
En pratique
- La qualité dépend de la résolution et de la mise en page de la source
- La sortie doit être validée avant tout enregistrement
- Un des composants du traitement intelligent des documents
Termes liés
- Traitement intelligent des documents (IDP)Le traitement intelligent des documents extrait des données structurées des factures, bons de livraison, contrats ou formulaires, les valide par rapport aux données de référence et les enregistre dans le système cible. Il combine l'OCR pour la lecture, des modèles pour l'interprétation et des règles pour la vérification.
- Intégration APIUne intégration API relie deux systèmes via leurs interfaces de programmation afin que les données circulent automatiquement et de façon fiable. C'est l'alternative stable à la ressaisie manuelle, à l'échange de fichiers CSV et aux robots d'interface, et c'est l'ossature de toute automatisation sérieuse.