Revenir au sommaire du lexique intelligence artificielle

Retrouvez les définitions clés pour cadrer un projet IA en PME et relier facilement les notions entre elles.

Retour au sommaire

Définition

L'OCR (Optical Character Recognition, reconnaissance optique de caractères) convertit le contenu visuel d'un document — scan, photo, PDF image — en texte numérique manipulable. C'est une brique clé pour ingérer des archives papier dans un pipeline IA.

À retenir

L'OCR est souvent la première étape pour faire lire des documents papier ou scannés par une IA.

Erreur fréquente

Supposer une extraction parfaite : un scan de mauvaise qualité produit des erreurs qu'il faut contrôler.

À quoi cela sert

  • Rendre exploitables des contrats, factures ou courriers scannés.
  • Alimenter un moteur de recherche ou un RAG avec des documents non natifs.
  • Automatiser la saisie à partir de pièces reçues en image.

Exemple concret

Pour qu'une IA puisse répondre à partir d'archives juridiques papier, on passe d'abord chaque document à l'OCR (Tesseract, AWS Textract) afin d'en extraire le texte avant vectorisation.

Bonnes pratiques

  • Vérifier la qualité des scans en amont (résolution, contraste).
  • Prévoir un contrôle sur les champs critiques (montants, dates, noms).
  • Choisir un moteur OCR adapté à la langue et à la mise en page.

Pourquoi ce terme compte

Comprendre cette notion aide à mieux cadrer un outil IA, à poser les bonnes questions à un éditeur ou à un prestataire, et à distinguer les promesses marketing des usages réellement utiles pour une PME.

Continuer votre lecture

Revenez au sommaire du lexique IA ou poursuivez avec les autres ressources du site.

Voir tous les lexiques
Retour en haut de page