Table of Contents

Introduction : La valeur des données cartographiques historiques

Les cartes et plans historiques sont des documents irremplaçables des environnements passés, des plans urbains et des réalisations en génie.Les chercheurs en histoire urbaine, en sciences de l'environnement et en archéologie utilisent ces documents pour suivre le changement du paysage, reconstruire les caractéristiques perdues et valider les modèles spatiaux. Pourtant, l'information verrouillée dans l'encre fondue, le papier fragile et le parchemin déformé ne peut pas être facilement utilisée dans la recherche numérique.

Préparation et numérisation

La numérisation de haute qualité est le fondement de chaque projet d'extraction réussi. La numérisation de mauvais résultats introduit des artefacts qui dégradent l'interprétation humaine et le traitement automatisé. Commencez par évaluer l'état du document : déchirures de note, plis, taches, décoloration, et réparations antérieures.

Sélection du matériel pour les documents fragiles

Pour les documents plats de taille A3, un scanner à plat avec une résolution optique de 600 à 1200 DPI est préféré. Les plans plus grands et les cartes murales nécessitent un scanner planétaire (système de caméra de tête) pour éviter de plier des supports fragiles. Pour les pages très fragiles, considérez un scanner à berceau de livre avec une pression minimale sur la colonne vertébrale.

Gestion de l'éclairage et des couleurs

Pour les documents à forte courbure ou pliage des ombres, un bras lumineux flexible permet un éclairage ciblé. Inclure une cible de calibrage de couleur (par exemple, X-Rite ColorChecker) dans une image séparée de chaque feuille pour permettre une correction de couleur précise pendant le post-traitement. Stockez les scans bruts dans un format sans perte : TIFF avec 16 bits d'échelle grise pour les documents monochromes, ou couleur 48 bits pour les cartes multicolores.

Contrôles et manipulations environnementales

Travaillez dans un environnement propre et contrôlé par le climat : humidité relative entre 35 et 50% et température 18 à 21°C. Portez des gants de coton ou de nitrile sans lintes lors de la manipulation des originaux. Pour les cartes avec pigment fragile (p. ex. lavages à l'eau coloré à la main), évitez tout contact direct avec la zone colorée.

Métadonnées et organisation des fichiers

Créer une convention de nommage structurée : . Stocker les images maîtresses sur un stockage d'archives sécurisé avec sauvegardes redondantes (suivre la règle 3-2-1 : trois copies, deux types de médias, une hors site). Enregistrer les métadonnées détaillées en utilisant des normes établies telles que Dublin Core ou ISO 19115 pour les ressources géospatiales. Inclure l'institution source, le créateur, la date de publication, l'échelle, la projection (si connue) et les notes de condition.

Techniques d'amélioration de l'image

Les scans bruts contiennent souvent du bruit, un éclairage inégal et des caractéristiques effacées. L'amélioration clarifie les limites, améliore la lisibilité des annotations et prépare les images pour les outils d'extraction automatisés.

Contraste expansion et péréquation locale

Pour les documents avec éclairage inégal (par exemple, à partir d'une courbure de page), appliquer Contrast Limited Adaptive Histogramme Equalization (CLAHE) avec une taille de carrelage de 8×8 pixels. Cela révèle des détails fins dans les coins sombres sans amplifier le bruit dans les zones lumineuses. Pour les plans avec des fonds cyanotypes, augmenter le contraste en tirant la courbe du canal bleu tout en laissant rouge/vert presque plat.

Suppression du bruit et élimination de la poussière

Pour obtenir des résultats de qualité supérieure, appliquer des moyens non locaux qui dénouent avec une fenêtre de recherche de 21 pixels et une surface de 7 pixels. Supprimer les taches de poussière et les rayures à l'aide d'une brosse de guérison ponctuelle dans un logiciel de montage d'images ou des filtres de déséclecte automatisés dans des pipelines de traitement par lots. Préserver la texture intentionnelle (p. ex., lignes de papier couché, chaînes de chaînes) car ils peuvent fournir des indices de provenance ou de datation.

Transformation géométrique et rectification

Les cartes et plans anciens souffrent souvent de rétrécissement du papier, de distorsion ou de balayage inégal. Appliquer une perspective transformée pour corriger les bordures irrégulières. Pour les cartes avec des caractéristiques de contrôle connues (p. ex., lignes de grille, bordures), utiliser une transformation polynôme (ordre 1–3) pour corriger la distorsion systématique. Si le document a un déformage local sévère dû aux replis, envisager d'utiliser une interpolation à attelle mince avec des points de liaison sélectionnés manuellement.

Amélioration avancée des documents dégradés

Pour les documents avec une coloration étendue ou un effusion d'encre, utilisez des outils d'inpeinture (p. ex., OpenCV ) pour remplir les zones de fond endommagées avant l'extraction de la fonctionnalité. Pour les cartes avec des écrasements transparents (p. ex., annotations ultérieures au crayon), séparez les couches en utilisant la déconvolution de couleur dans ImageJ ou un script personnalisé.

Géoréférence des cartes historiques

L'attribution de coordonnées du monde réel à une carte numérisée permet de superposer des couches SIG modernes, ce qui permet aux chercheurs de comparer les caractéristiques historiques avec les limites actuelles, l'infrastructure ou l'utilisation des terres.

Sélection de points de contrôle au sol stables (PGC)

Choisissez des éléments qui sont demeurés inchangés depuis la création de la carte : les flèches, les sommets de colline, les promontoires côtiers, les intersections de routes qui persistent dans le réseau routier moderne. Les établissements historiques réoccupaient souvent les mêmes positions, donc vérifiez si les églises, les places de la ville ou les fortifications qui existent encore. Distribuez au moins 10 à 15 GCP uniformément sur la carte – sans regrouper dans un seul quadrant. Pour les cartes avec une grille, utilisez les intersections de grille comme GCP secondaires après avoir vérifié leur précision géodésique. N'utilisez jamais des caractéristiques temporaires comme des ponts en bois ou des clôtures en bois qui ont pu se déplacer ou se désintégrer.

Méthodes de transformation et évaluation des erreurs

Pour les cartes plus anciennes avec un rétrécissement important du papier ou une projection incurvée, utilisez une méthode de polynôme de deuxième ordre ou une méthode d'interpolation locale telle que l'asphalte à plaques minces. Inspectez toujours les erreurs résiduelles après la transformation : un GCP avec une erreur carrée moyenne de racine élevée (RMSE) doit être vérifié ou enlevé. Gardez la RMSE globale sous la moitié de la résolution de sortie prévue (p. ex., < 0,5 mètre pour un ensemble de données de résolution de 1 m). Dans le QGIS, le plugin Georeferencer fournit des traces résiduelles; dans ArcGIS Pro, la table Point montre des erreurs individuelles.

Traitement des projections inconnues

Dans de tels cas, notez la projection de la carte originale à partir de sa légende (si elle est présente) et utilisez une transformation personnalisée. Si la projection est inconnue, traitez la géoréférenciation comme un alignement optimal et étiquettez la sortie comme « non projetée » dans les métadonnées. Utilisez un système de référence mondial moderne comme WGS84 (EPSG:4326) pour la vectorisation si la projection à la volée est nécessaire plus tard.

Géoréférence par lots pour les séries de cartes

Pour les grandes collections de feuilles de cartes (p. ex., cartes topographiques historiques), utilisez l'outil MapAnalyst[ qui automatise des parties du flux de travail en détectant des lignes de grille. Ecrivez aussi un script Python avec GDAL=2 et pour appliquer des fichiers mondiaux ([) dérivés de points de contrôle connus. Le traitement par lots réduit le temps, mais exige toujours la validation manuelle de chaque feuille.

Vectorisation manuelle : précision grâce à un traçage expert

Pour les documents complexes ou fortement dégradés, l'extraction automatisée peut produire des erreurs inacceptables. La numérisation manuelle, effectuée avec soin par un chercheur qualifié, demeure la norme d'or pour la précision. Elle est particulièrement utile pour des caractéristiques comme les empreintes complexes de construction, les limites de parcelles ou les contours d'altitude où les petites erreurs changent les résultats d'analyse.

Mise en place d'un environnement de vectorisation

Dans le QGIS, permettre de faire des sauts aux sommets et aux segments avec une tolérance de 1 à 2 pixels. Pour les empreintes de construction, tracer les murs extérieurs au niveau du sol comme déduit de la symbolique de la carte (p. ex., des lignes noires solides indiquent les murs). Pour les caractéristiques linéaires comme les routes, échantillonner des points à des changements de direction importants – ne pas numériser chaque pixel d'une courbe. Maintenir une table d'attributs avec les champs : , (haut/moyen/faible), , et . Liener chaque caractéristique à un extrait d'image recadré de la carte source pour une vérification future.

Faire face à l'ambiguïté et à l'incertitude

Les cartes historiques montrent souvent des caractéristiques qui n'existent plus ou qui diffèrent des références modernes. Utilisez un schéma normalisé : enregistrez les caractéristiques numérisées comme « probable » ou « incertaine » dans le tableau des attributs. Par exemple, une ligne en tirets évanouie peut indiquer une limite de propriété qui ne peut être confirmée – la qualifier de « limite probable » avec un niveau de confiance. Évitez la tentation de « corriger » la carte; documentez plutôt l'interprétation.

Protocoles de contrôle de la qualité

Après la numérisation, superposez la couche vectorielle sur l'image source géoréférencée à 100% zoom. Inspectez chaque fonction pour les erreurs topologiques : les nœuds de bardage en lignes, les limites polygonales qui se chevauchent ou les petites lacunes près des sommets. Utilisez le plugin QGIS="Topology Checker" pour automatiser la détection.

Techniques semi-automatisées d'extraction

La numérisation manuelle ne s'adapte pas bien aux grandes collections. Les méthodes semi-automatisées réduisent le travail en conciliant le jugement humain avec la détection algorithmique. Ces approches fonctionnent mieux lorsque les images sources sont relativement propres et les caractéristiques suivent des modèles prévisibles.

Reconnaissance optique des caractères (OCR) pour le texte historique

Appliquer OCR pour extraire les noms de lieux, légendes, annotations et barres d'échelle. Les moteurs OCR standard (par exemple, Tesseract) échouent souvent avec des polices historiques, serif-lourdes, cassées ou effacées. Améliorer les résultats par des régions de texte prétraitement : seuilr l'image en binaire (en utilisant la méthode Otsu), haut de gamme 2–3x, et des lignes individuelles de bureau. Pour Tesseract, former un modèle de langue personnalisé sur un échantillon de texte de la même époque. Pour les étiquettes manuscrites sur des plans, utiliser Transtribus (]Transtribus) avec un modèle formé sur l'écriture à la main cursive ou sur plaque de cuivre. Toujours après le traitement, produire OCR en comparant avec une liste connue de noms de lieux des gazetteurs.

Segmentation des couleurs et classement supervisé

Dans un SIG (p. ex., QGIS[ArcGIS Pro[], effectue une classification supervisée : collecte de 10 à 20 polygones d'entraînement par classe, puis applique un classificateur forestier aléatoire ou probable maximal. Le raster résultant peut être converti en polygones et nettoyé manuellement. Cette méthode ne fonctionne de façon fiable que lorsque la palette de couleurs est cohérente dans le document et que les couleurs de l'analyse sont étalonnées.

Détection des bords et squelettonisation

Pour les plans architecturaux et les plans techniques avec des lignes continues claires, utilisez la détection des bords de Canny pour afficher une carte des bords. Ensuite, appliquez un éclaircissement morphologique (skélétonisation) pour réduire les lignes à des squelettes à un pixel. Vectorisez-les à l'aide d'outils comme ou le module 'r.to.vec' dans GRASS GIS. Cette technique excelle pour les plans avec des lignes à haute contraste, mais se heurte à des lignes en tirets, des taches ou des documents à la main où l'épaisseur des lignes varie.

Apprentissage automatique pour la reconnaissance des caractéristiques

L'apprentissage profond, en particulier les réseaux neuronaux convolutionnels (RCN), a transformé la vitesse et la précision de l'extraction des caractéristiques à partir de l'imagerie historique. Les modèles peuvent être formés pour détecter des symboles spécifiques, des empreintes de construction, des limites de parcelles, ou même de l'écriture.

Création d'un ensemble de données de formation

Utiliser des outils d'annotation tels que ]Label Studio[ou les outils de numérisation de QGIS.Enregistrer les annotations dans des formats comme COCO JSON (pour la détection d'objets) ou les masques GeoTIF (pour la segmentation).Augmenter l'ensemble de données avec des rotations aléatoires (jusqu'à 15°), des scallings (0,8–1,2x), des changements de luminosité (±20 %) et une petite extraction de patchs (par exemple 256×256 tuiles) pour augmenter la robustesse du modèle.Pour les symboles spécifiques au domaine comme les moulins à vent, les pierres limites ou les rails, l'annotation manuelle est inévitable – le sourcing par le biais de plates-formes comme Zooniverse peut aider à répartir la charge de travail.

Architecture modèle et stratégies de formation

Pour la détection d'objets (symboles ou bâtiments), commencer par YOLOV8 ou R-CNN plus rapide avec un épine dorsale ResNet-50. Pour la segmentation sémantique (zones d'utilisation des terres ou empreintes complètes du bâtiment), utiliser U-Net ou DeepLabV3+ avec un encodeur EfficientNet. Pour la lecture du texte historique, combiner un extracteur de caractéristiques CNN avec une perte de réseau neuronal récurrent (CRNN) et de classification temporelle connectiste (CTC).

Inférence, post-traitement et validation

Examinez les prédictions comme GeoJSON ou shapefiles. Attendez-vous à de faux positifs, surtout sur les éléments décoratifs (cartouches, roses boussoles) qui ressemblent aux formes de construction. Implémentez le post-traitement : polygones de filtre par zone (supprimer les caractéristiques plus petites qu'un seuil dérivé de l'échelle de la carte), appliquez une suppression non maximale pour les détections en chevauchement et les limites de claquement sur une grille simplifiée. Calculez l'intersection sur Union (IoU) sur un ensemble d'essais en attente pour mesurer la précision; visez l'IoU > 0,7 pour les tâches de segmentation. Toujours examiner manuellement un échantillon aléatoire de 5 % des prédictions avant d'utiliser l'ensemble de données en analyse.

Ressources et plugins Open-Source

Des bibliothèques telles que PyTorch, TensorFlow et MapSeg[Paquet Python (conçu pour la segmentation de la carte historique) abaisser la barrière à l'entrée. Pour les utilisateurs sans expertise de codage, le plugin QGIS «Map Learning» fournit un enveloppage GUI pour la formation et l'inférence sur les images de cartes carrelées.

Meilleures pratiques pour la recherche reproductible

L'extraction des données à partir de documents historiques est intrinsèquement interprétative. L'adoption de normes de documentation et de gestion des données garantit que les résultats peuvent être vérifiés, réutilisés et comparés entre les études.

Tenir un journal de traitement

Enregistrez chaque étape : les noms de fichiers sources, les versions logicielles (y compris les versions de plugins et de bibliothèques), les paramètres de transformation, GCP RMSE, la précision du classificateur et la date de traitement. Utilisez un fichier texte contrôlé par version ou un carnet de notes Jupyter avec des cellules de balisage. Ce journal permet à d'autres chercheurs de reproduire ou de critiquer le flux de travail.

Combiner plusieurs méthodes dans un pipeline

Construire un pipeline hybride qui couche les étapes manuelles, semi-automatisées et d'apprentissage automatique:

  • Étape 1: Digitez et améliorez l'image source.
  • Étape 2: Géoréférence et numérisation manuelle d'un sous-ensemble de caractéristiques de base (p. ex., routes principales, hydrologie, limites).
  • Étape 3: Exécuter l'extraction semi-automatisée pour les caractéristiques secondaires (polygones de couverture terrestre, étiquettes de texte).
  • Étape 4: Appliquer l'apprentissage automatique pour détecter des motifs rares ou complexes (p. ex., limites historiques, symboles de machines industrielles, annotations manuscrites).
  • Étape 5: Validation manuelle, correction et attribution d'attributs pour la sortie combinée.

Documenter la confiance de chaque couche afin que les utilisateurs puissent filtrer par fiabilité dans leurs propres analyses.

Considérations éthiques et culturelles

Si la carte représente des terres autochtones ou des sites culturellement sensibles, consultez les communautés descendantes avant de numériser ou de publier des ensembles de données dérivés. Fournissez une attribution claire à l'établissement de détention et offrez des citations pour les données extraites. Lors du partage de données, utilisez des licences ouvertes (CC-BY 4.0 ou Creative Commons Zero) sauf si elles sont limitées par la propriété intellectuelle ou les protocoles culturels.

Conclusion

L'extraction de données structurées à partir de cartes et de plans historiques est une entreprise multidisciplinaire qui combine les meilleures pratiques d'archivage, l'expertise géospatiale et la vision informatique moderne.Le processus commence par une numérisation minutieuse qui préserve le dossier documentaire, suivie par l'amélioration de l'image et la géoréférenciation pour aligner le contenu historique sur les systèmes de coordonnées contemporains. La vectorisation manuelle demeure essentielle pour les exigences à haute précision et les caractéristiques ambiguës, tandis que les méthodes semi-automatisées comme l'OCR et la classification des couleurs permettent d'augmenter le travail des grandes collections.