Aller au contenu
Intelligence documentaire

Numériser quarante ans d’archives papier

Une chaîne d’extraction pour plusieurs millions de pages numérisées de qualité inégale, dactylographiées et manuscrites, en deux langues.

Client sous accord de confidentialitéExemple
Secteur
Secteur public
Année
2025
Durée
5 mois
Filtrer par discipline
Intelligence documentaire

Résultats

3 jours → 2 minDélai médian de recherche
97,4 %Précision au niveau du champMesurée sur un jeu de validation de 5 000 pages annotées par des humains.
11 %Orientés vers revue humaine

Le défi

Des décennies de dossiers n’existaient que sous forme de numérisations de qualité variable — pages de travers, copies carbone effacées, annotations et tampons. Toute recherche exigeait une consultation physique de plusieurs jours, et aucune partie du fonds n’était interrogeable.

Notre approche

Nous avons d’abord mesuré le processus de recherche existant, puis construit une chaîne d’extraction tenant compte de la mise en page, avec score de confiance par champ. Tout élément sous le seuil convenu est orienté vers une file de revue humaine plutôt qu’accepté en silence : le taux d’erreur est ainsi borné par conception et non par espoir.

Le résultat

Le fonds est devenu entièrement interrogeable, chaque champ extrait portant un niveau de confiance documenté, avec une file de revue qui se réduit à mesure que les modèles progressent.

Avant

Demande de consultation physique, trois jours ouvrés en moyenne, aucune recherche plein texte, aucune possibilité de répondre à une question globale sur le fonds.

Après

Recherche plein texte et structurée en quelques secondes, restitution agrégée sur l’ensemble du fonds, et un score de confiance attaché à chaque champ.