Table of Contents
L'utilisation d'algorithmes d'apprentissage automatique pour détecter les incohérences dans les données historiques
Les recherches historiques ont longtemps été tributaires de l'examen minutieux des sources primaires — manuscrits, recensements, archives de journaux, correspondance diplomatique et artefacts matériels — mais même les archives les plus méticuleuses contiennent des erreurs, des omissions et des contradictions pures. Une seule personne qui a effectué un recensement a écrit une correction, une charte mal datée ou une généalogie délibérément falsifiée peut se transformer en générations de bourses, ce qui a conduit à des récits erronés et à des attributions incorrectes. Traditionnellement, les historiens se sont appuyés sur des références croisées, des paléographies et des critiques de source pour éliminer ces incohérences.
Comprendre l'apprentissage automatique dans l'analyse des données historiques
L'apprentissage automatique est un sous-ensemble d'intelligence artificielle qui permet aux systèmes d'apprendre des données sans être programmé explicitement pour chaque règle.Dans l'analyse historique, les algorithmes ML ingèrent de grands volumes de données structurées (par exemple, les champs de recensement tabulaires) et de textes non structurés (par exemple, les entrées de journaux, les testaments, les dossiers judiciaires) pour identifier des modèles qui s'écartent des normes attendues. L'idée centrale est que l'incohérence est, à bien des égards, une anomalie – un point de données qui tombe en dehors de la distribution ou de la relation typique découverte par le modèle.
Concepts de base : Caractéristiques, étiquettes et formation
Pour les enregistrements historiques, les caractéristiques peuvent comprendre des champs de date, des noms de lieux, des titres de personne, des quantités numériques (p. ex., âges, taxes) et des marqueurs linguistiques (p. ex., fréquence de vocabulaire, écriture manuelle). Si l'ensemble de données contient déjà des entrées correctes vérifiées, une approche supervisée peut utiliser les étiquettes comme étiquettes pour former un classificateur. Lorsque les étiquettes sont absentes ou trop rares, des méthodes non supervisées détectent les anomalies en mesurant les distances des groupes ou en reconstituant les entrées avec une faible erreur. Le traitement du langage naturel (NLP) ajoute une dimension supplémentaire en analysant la structure sémantique et syntaxique des textes historiques, permettant la détection de contradictions qui ne sont pas purement numériques.
Types d'incohérences L'apprentissage automatique peut attraper
Les données historiques incohérentes prennent de nombreuses formes et différentes familles d'algorithmes sont adaptées à différents problèmes :
- Concordances chromologiques : Dates qui violent des vies connues, des périodes rognales ou des séquences d'événements.
- Aberrations numériques : Âges irréalistes (p. ex., une personne de 150 ans), montants d'impôt improbables ou sauts soudains de la population.
- Anachronismes textuels: Mots ou phrases qui apparaissent avant qu'ils entrent dans la langue, ou références à des événements qui n'étaient pas encore survenus.
- Dupliquer ou presque-dupliquer des enregistrements: La même personne ou l'événement est entré plusieurs fois avec de légères variations.
- Valeurs manquantes ou remplies :[ Champs laissés en blanc et complétés par une main différente, éventuellement avec une inférence incorrecte.
- Couverture bizarrée: Sous-représentation systémique de certains groupes, que le ML peut détecter par des disparités de distribution.
Algorithmes d'apprentissage automatique en pratique
La sélection de l'algorithme approprié dépend de la nature des données historiques et du type d'incohérence visé. Ci-dessous sont les familles les plus courantes, ainsi que des cas d'utilisation illustrative.
L'apprentissage supervisé : classification et régression
Lorsque les historiens ont accès à un sous-ensemble de vérité terrestre, des registres vérifiés par des contrôles croisés des archives, des modèles supervisés peuvent apprendre à classer de nouveaux documents comme étant cohérents. . Les forêts de random[ et les arbres à gradients sont populaires parce qu'ils manipulent des types de données mixtes (nombres, catégories, dates) et fournissent des notes d'importance caractéristiques montrant quels attributs ont le plus influencé un drapeau. Par exemple, un projet de l'Institut de recherche historique a utilisé un classificateur de forêt aléatoire pour détecter des discours parlementaires mal attribués par des années de transcriptions vérifiées; le modèle a obtenu plus de 90 % d'exactitude dans les discours de localisation contenant des références de date incompatibles avec les mandats connus des conférenciers. Les machines vectorielles de soutien (SVMs) ont également été utilisées lorsque la limite de décision entre des documents cohérents et incohérents, telles que des falsifications subtiles dans
Apprentissage sans supervision: Clustering and Anomalie Detection
La plupart des ensembles de données historiques ne sont pas entièrement vérifiés, les incohérences que les chercheurs veulent trouver sont inconnues. Les méthodes non supervisées brillent dans ce cadre. K-means clustering et DBSCAN groupent des enregistrements similaires; les enregistrements qui se trouvent loin de tout centroïde de cluster sont des anomalies probables. Par exemple, une étude des premiers registres paroissiaux anglais modernes a utilisé DBSCAN pour regrouper les entrées de baptême et d'enterrement par lieu et par date. Un petit groupe de sépultures en une seule semaine géographiquement dispersé s'est avéré être des entrées erronées d'une paroisse différente, copiées par un commis fatigué.
Autoencoders—réseaux neuronaux qui apprennent à compresser et reconstruire les entrées—les enregistrements de drapeau qui produisent une erreur de reconstruction élevée.
Traitement des langues naturelles (NLP)
Le texte historique est riche en incohérences : orthographes de variantes, vocabulaire archaïque, abréviations scribales et changements dans le style d'écriture sur une seule durée de vie d'auteur. Les techniques NLP modernes traitent ces défis avec fermeté. La reconnaissance d'entités nommées (NER) extrait les personnes, les lieux, les dates et les organisations, puis les recoupe avec des ontologies connues. Un décalage entre la date extraite et l'entité connue déclenche une alerte. Les transformateurs de transfert de texte vers texte (T5, BART) peuvent être perfectionnés pour détecter des contradictions sémantiques, par exemple, -King John a signé Magna Carta en 1215, suivi d'un texte ultérieur indiquant que -King John est mort en 1216, mais -King John a assisté au Congrès de Vienne.
Manipulation des variations d'orthographe historiques
Un défi clé pour le NLP est que l'orthographe pré-normalisée peut faire des modèles standard traiter les formes de variantes comme des mots différents. La tokenisation sous-mot (Byte-Pair Encoding) aide, tout comme l'intégration de mots sur des corpus spécifiques à une période donnée. Certains projets, comme la ]La Faculté d'histoire d'Oxford , ont créé des modèles BERT spécialisés (par exemple, EarlyModBERT) qui préservent l'orthographe archaïque, améliorant la détection des incohérences de 15% par rapport aux modèles génériques.
Demandes de recherche historique
Les capacités théoriques décrites ci-dessus ont été déployées dans un nombre croissant d'enquêtes historiques concrètes. Les sous-sections suivantes illustrent comment la détection d'incohérences induite par le ML est en train de remodeler la bourse.
Détecter les dates conflictuelles dans les Chroniques royales
Une équipe de l'Institut Max Planck pour l'histoire de la science a construit un modèle supervisé formé sur un corpus de 50 000 événements datés de chroniques européennes (900–1500 CE). Le modèle utilisé est des caractéristiques telles que des références saisonnières, des jours saint et des phénomènes astronomiques (éclipses, comètes) pour estimer une plage probable de dates. Lorsqu'une date chronique tombe en dehors de la plage modélisée, l'algorithme l'a signalé. Cette approche corrige des erreurs chronologiques de longue date dans la Chronique anglo-saxonne, en résolvant un écart de trois ans dans la date signalée du couronnement du roi Æthelred.
Identifier les différences dans les données du recensement
Les recensements historiques sont de riches sources de recherche démographique, mais ils sont notoirement incohérents. Les noms sont mal orthographiés, les âges arrondis, les professions enregistrées de façon incohérente et les familles divisées en pages. Le regroupement non supervisé des dossiers de recensement des ménages peut identifier des compositions improbables. Par exemple, le Northwest Data Hub (un projet reliant les données du recensement du Royaume-Uni de 1841 à 1911) a appliqué le DBSCAN aux ménages en fonction des écarts d'âge entre les parents et les enfants.
Analyse de l'écriture et de l'utilisation du langage pour vérifier l'authenticité
La reconnaissance de l'écriture (HWR) les modèles formés sur des scripts d'époque peuvent comparer le canal (le flux de coups) à travers un ensemble de documents attribués au même scribe. Une incohérence dans la façon dont une lettre particulière est formée – l'angle de l'ascension, l'espacement des lifts de nib – peut indiquer une autre main. Les Archives nationales des États-Unis ont utilisé un réseau neuronal convolutionnel (CNN) pour analyser l'écriture dans un lot de lettres de George Washington. Le réseau a détecté que la lettre --p-p- dans une lettre s'écartait significativement du modèle des descendants connus de Washington; la lettre a ensuite été confirmée comme une falsification du XIXe siècle.
Dévoilement de dossiers biaisés ou incomplets
Les données historiques reflètent souvent les biais de leurs créateurs, par exemple, les registres officiels peuvent systématiquement sous-estimer les femmes, les minorités ou les pauvres. L'apprentissage automatique peut révéler ces lacunes non pas en trouvant des erreurs explicites, mais en exposant des modèles d'omission. L'exploitation minière des règles d'association peut découvrir que certaines combinaisons d'attributs (p. ex., -female , + - propriétaire de terres) sont beaucoup moins fréquentes que prévu, même après avoir contrôlé les lois sur l'héritage sexiste connues. De même, modèles génériques peuvent imputer des valeurs plausibles manquantes et comparer la distribution imputée à celle enregistrée.
Défis et considérations éthiques
Malgré la promesse de détection d'incohérences induite par le ML, le chemin est parsemé d'obstacles. Certains sont techniques, d'autres éthiques; tous nécessitent une navigation attentive.
Qualité des données et rareté
Les modèles d'apprentissage automatique sont peu nombreux. Les ensembles de données historiques, bien que souvent importants, sont aussi bruyants, fragmentaires et biaisés de manière à induire en erreur les modèles. Un modèle supervisé formé sur quelques centaines d'enregistrements vérifiés peut se généraliser mal au corpus complet. De plus, les données historiques manquent souvent du volume nécessaire pour un apprentissage profond : un modèle NLP qui fonctionne bien sur des articles d'actualité modernes peut échouer sur un journal du 17e siècle parce que le vocabulaire et la syntaxe sont trop différents.
Amplification des préjugés
Si les données historiques sont biaisées, par exemple, sous-représentées par les femmes, un modèle de ML formé à ces données apprendra que les femmes sont ----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
Interprétation et transparence
Les modèles complexes — en particulier les réseaux neuronaux — fonctionnent comme des boîtes noires. Un historien doit savoir pourquoi un enregistrement particulier a été signalé: était-ce la date, le nom, la langue? Sans interprétation, le chercheur ne peut pas décider s'il faut faire confiance au drapeau. Les techniques de l'IA (XAI) explicables, comme SHAP (SHapley Additive exPlanations) et LIME (Local Interpretable Model‐agnostic Explications), peuvent fournir des explications de caractère. Par exemple, un diagramme SHAP pourrait montrer que le drapeau d'incohérence d'âge était principalement dirigé par le champ de l'année de naissance, avec une contribution secondaire de -"occupation.
Traitement éthique des données sensibles
Les documents historiques contiennent souvent des renseignements personnels sur des personnes qui peuvent encore avoir des descendants vivants ou qui peuvent avoir trait à des groupes opprimés (p. ex., registres d'esclaves, données de recensement coloniales). L'utilisation du ML pour signaler des incohérences dans de telles données peut par inadvertance renforcer les stéréotypes ou causer la détresse.Les chercheurs doivent consulter les communautés descendantes et suivre les meilleures pratiques pour la gestion des données.L'Association a publié des lignes directrices pour encourager la transparence sur les méthodes algorithmiques et le droit des communautés de refuser la publication des résultats tirés de leurs ancêtres.
Coût et expertise informatiques
Les projets de collaboration entre historiens et informaticiens sont de plus en plus courants, mais ils nécessitent du temps, du financement et une compréhension mutuelle.Les outils open-source (voir Transtribus[ pour la reconnaissance de l'écriture, [Hugging Face[ pour NLP) réduisent la barrière, mais le besoin de modélisation personnalisée persiste.Le domaine Digital Humanities[ a fait des progrès dans la formation des étudiants diplômés en histoire et en sciences des données, mais de nombreux établissements n'ont toujours pas l'infrastructure nécessaire pour soutenir les projets mus par ML à l'échelle.
Orientations et implications futures
L'apprentissage automatique n'est pas une balle d'argent pour la détection historique des incohérences, mais il devient rapidement une partie indispensable de la boîte à outils de l'historien.
Modèles multimodals
Les systèmes futurs combineront le texte, l'image (écriture, sceaux, filigranes) et même les données spatiales (coordonnées GIS) en un seul cadre. Un transformateur qui code conjointement un texte latin et son image de sceau pourrait détecter un sceau falsifié apposé à un acte authentique – une fraude médiévale commune.
Apprentissage actif et humain dans le milieu
Plutôt que d'accepter passivement les drapeaux d'un modèle, les chercheurs adoptent un apprentissage actif où le modèle interroge l'historien pour obtenir des étiquettes sur les cas les plus incertains. Ce processus itératif améliore la précision du modèle tout en gardant l'historien en contrôle. Des systèmes comme Prodigy[ pour les NLP permettent de tels flux de travail, et leur application aux données historiques est en croissance.
L'IA éthique par conception
À mesure que le domaine mûrit, les historiens et les informaticiens co-conçoivent des outils qui se côtoient dès le départ en considérations éthiques, notamment des modules de transparence qui obligent le modèle à produire des explications, des contraintes d'équité qui empêchent l'amplification des biais historiques et des cadres de consentement pour les données sensibles à la culture. Le Cologne Digital Humanities Lab, par exemple, a développé un tableau de bord -definition pour l'analyse démographique historique qui permet de visualiser les variations de la performance du modèle entre les groupes sociaux.
Modèles génériques pour la reconstruction historique
Au-delà de la détection, l'IA générative peut aider correcte des incohérences en suggérant des alternatives plausibles. Par exemple, un modèle peut être formé pour générer une plage de dates plausible manquante pour une inscription endommagée dans le registre paroissial. Cependant, cela soulève sa propre série de questions éthiques: les historiens devraient-ils toujours remplir - dans un passé perdu? La plupart soutiennent que les extrants générateurs ne devraient jamais être fusionnés dans l'ensemble de données original sans annotation claire, et ils sont mieux utilisés comme hypothèses pour la recherche archivistique ultérieure plutôt que comme corrections définitives.
Conclusion
L'utilisation d'algorithmes d'apprentissage automatique pour détecter les incohérences dans les données historiques est un domaine qui avance rapidement et qui possède un potentiel immense. En surmontant automatiquement les contradictions chronologiques, les aberrations numériques, les anachronismes textuels et les biais systémiques, les outils ML permettent aux historiens de travailler avec des ensembles de données plus vastes et plus complexes que jamais, découvrant des erreurs qui prendraient des vies pour trouver manuellement. Pourtant, la puissance de ces algorithmes doit être maniée avec prudence. Les questions de qualité des données, les biais inhérents, les exigences en matière d'interprétation et les obligations éthiques exigent que l'apprentissage automatique soit traité comme un collaborateur, et non comme un oracle.