Tout commence avec des documents anciens : registres paroissiaux, photographies, bulletins religieux, journaux, cartes postales... Ces documents sont d'abord scannés, c'est-à-dire transformés en images numériques.
Mais une image seule ne suffit pas : un ordinateur ne « comprend » pas ce qui est écrit dessus. C'est là qu'intervient la reconnaissance optique de caractères, plus connue sous son sigle anglais OCR.
Qu'est-ce que l'OCR ?
C'est un logiciel qui « lit » automatiquement le texte présent sur une image, exactement comme le ferait un œil humain, puis le transforme en texte véritable — celui-là même que l'on peut copier, chercher, ou faire apparaître dans un moteur de recherche.
Cette étape se déroule sur l'un des trois petits ordinateurs du site, dédié spécifiquement à cette tâche. Il vérifie régulièrement s'il y a de nouveaux documents déposés, et traite automatiquement chacun d'eux.
Pourquoi c'est important ?
- Sans l'OCR, il faudrait retaper à la main le contenu de chaque document — un travail énorme.
- Grâce à l'OCR, on peut taper un mot dans la recherche du site et retrouver instantanément tous les documents qui le mentionnent.
- Le document original (l'image ou le PDF) reste toujours consultable tel quel, à côté du texte extrait.
Résultat : une simple photo d'un vieux registre devient une ressource que chacun peut explorer et consulter en quelques secondes.