Numériser quarante ans d’archives papier
Une chaîne d’extraction pour plusieurs millions de pages numérisées de qualité inégale, dactylographiées et manuscrites, en deux langues.
- Secteur
- Secteur public
- Année
- 2025
- Durée
- 5 mois
- Filtrer par discipline
- Intelligence documentaire
Résultats
Le défi
Des décennies de dossiers n’existaient que sous forme de numérisations de qualité variable — pages de travers, copies carbone effacées, annotations et tampons. Toute recherche exigeait une consultation physique de plusieurs jours, et aucune partie du fonds n’était interrogeable.
Notre approche
Nous avons d’abord mesuré le processus de recherche existant, puis construit une chaîne d’extraction tenant compte de la mise en page, avec score de confiance par champ. Tout élément sous le seuil convenu est orienté vers une file de revue humaine plutôt qu’accepté en silence : le taux d’erreur est ainsi borné par conception et non par espoir.
Le résultat
Le fonds est devenu entièrement interrogeable, chaque champ extrait portant un niveau de confiance documenté, avec une file de revue qui se réduit à mesure que les modèles progressent.
Avant
Demande de consultation physique, trois jours ouvrés en moyenne, aucune recherche plein texte, aucune possibilité de répondre à une question globale sur le fonds.
Après
Recherche plein texte et structurée en quelques secondes, restitution agrégée sur l’ensemble du fonds, et un score de confiance attaché à chaque champ.