← Retour à l'animation

Étape 1 — Des documents scannés à un texte que l'on peut chercher

Tout commence avec des documents anciens : registres paroissiaux, photographies, bulletins religieux, journaux, cartes postales... Ces documents sont d'abord scannés, c'est-à-dire transformés en images numériques.

Mais une image seule ne suffit pas : un ordinateur ne « comprend » pas ce qui est écrit dessus. C'est là qu'intervient la reconnaissance optique de caractères, plus connue sous son sigle anglais OCR.

Qu'est-ce que l'OCR ?

C'est un logiciel qui « lit » automatiquement le texte présent sur une image, exactement comme le ferait un œil humain, puis le transforme en texte véritable — celui-là même que l'on peut copier, chercher, ou faire apparaître dans un moteur de recherche.

Cette étape se déroule sur l'un des trois petits ordinateurs du site, dédié spécifiquement à cette tâche. Il vérifie régulièrement s'il y a de nouveaux documents déposés, et traite automatiquement chacun d'eux.

Pourquoi c'est important ?

  • Sans l'OCR, il faudrait retaper à la main le contenu de chaque document — un travail énorme.
  • Grâce à l'OCR, on peut taper un mot dans la recherche du site et retrouver instantanément tous les documents qui le mentionnent.
  • Le document original (l'image ou le PDF) reste toujours consultable tel quel, à côté du texte extrait.

Résultat : une simple photo d'un vieux registre devient une ressource que chacun peut explorer et consulter en quelques secondes.