Table of Contents
Le changement de paradigme dans la recherche historique
Pendant des siècles, les historiens se sont appuyés sur une lecture manuelle et une annotation minutieuses pour extraire le sens des documents d'archives. La révolution numérique a fondamentalement modifié ce paysage. Avec des millions de pages de journaux historiques, de correspondance personnelle, de documents gouvernementaux et d'oeuvres littéraires maintenant disponibles sous forme numérique, le machine learning (ML) offre des outils qui peuvent traiter et analyser ces collections à une échelle et à une vitesse impossibles pour les seuls chercheurs humains.
Les algorithmes d'apprentissage automatique permettent de détecter les tendances, les relations et les tendances dans d'énormes corps, révélant tout, de l'évolution de la rhétorique politique à l'évolution du sentiment public en temps de guerre. En automatisant des tâches comme la classification, le regroupement et l'extraction, le ML permet aux chercheurs de se concentrer sur l'interprétation et la compréhension contextuelle.
De la surcharge de données à la découverte de données
Un des plus grands défis auxquels les historiens sont confrontés aujourd'hui n'est pas un manque de données, mais son abondance écrasante. Une archive unique bien numérisée peut contenir des dizaines de milliers de livres ou des millions d'articles de journaux. Lire même une fraction de ce matériel est peu pratique. L'apprentissage automatique fournit le pont entre le texte numérisé brut et la perspicacité historique actionnable. Par exemple, les techniques d'apprentissage non supervisées peuvent automatiquement regrouper des documents par sujet, langue, ou sentiment, donnant aux chercheurs une carte de haut niveau du corpus avant qu'ils ne plongent dans la lecture étroite.
La bibliothèque numérique HathiTrust détient plus de 18 millions de volumes. Chronicling America offre plus de 20 millions de pages de journaux. Europeana regroupe plus de 58 millions d'objets du patrimoine culturel. Sans l'apprentissage automatique, explorer ces ensembles de données à l'échelle est comme chercher une aiguille dans une botte de foin, tandis que les yeux bandés.
Techniques d'apprentissage de base dans l'analyse textuelle historique
L'application de la LM à des textes historiques s'appuie sur plusieurs méthodes établies. Modélisation topique, comme Latent Dirichlet Allocation (LDA), identifie des groupes de mots co-occupés qui représentent des thèmes dans une collection.Cette technique a été utilisée pour suivre la montée du nationalisme dans les journaux du XIXe siècle ou l'orientation changeante des publications scientifiques au fil des décennies. Contrairement aux simples recherches par mots-clés, la modélisation topique recouvre les structures latentes du texte, le regroupement des documents en «thèmes» sur la base de la distribution statistique des mots.
La classification textuelle attribue des catégories prédéfinies à des documents, permettant des enquêtes à grande échelle sur les résultats littéraires ou politiques. Par exemple, un historien pourrait former un classificateur pour distinguer la propagande et les reportages objectifs dans les journaux de guerre. Le classificateur apprend des exemples marqués et applique ensuite les mêmes règles à des millions de documents non marqués.Cette technique a été utilisée pour identifier des auteurs anonymes, dater des manuscrits non datés et trier la correspondance par sentiment ou urgence.
Clustering regroupe des textes similaires sans étiquettes prédéfinies, aidant les chercheurs à découvrir des affinités inattendues entre des œuvres séparées par le temps et la géographie. Le regroupement hiérarchique de brochures du XVIIIe siècle pourrait révéler que les arguments sur la fiscalité à Boston ont partagé des éléments plus formels avec des brochures londoniennes que ceux de Philadelphie, contestant des hypothèses sur l'isolement intellectuel régional.
La reconnaissance d'entités nommées (NER)[ extrait les noms propres des personnes, des lieux, des organisations et des dates des textes historiques. Lorsqu'elle est appliquée à la correspondance ou aux documents administratifs, le RNE peut révéler les réseaux sociaux, les schémas migratoires ou la propagation des idées. Par exemple, le traitement du RNE de la base de données Transatlantic Slave Voyages [ permet aux chercheurs de retracer le mouvement des personnes esclaves à travers les ports, en reliant les noms aux navires, aux capitaines et aux acheteurs.
En appliquant les lexiques sentimentaux aux périodiques historiques, les chercheurs ont tracé l'opinion publique avant et après des événements majeurs comme la Révolution française ou la guerre civile américaine, trouvant souvent que les récits officiels divergeaient fortement du sentiment populaire. Cependant, adapter l'analyse sentimentale aux textes historiques nécessite un travail lexicographique attentif. Le Thésaurus historique de l'anglais et le OED fournissent des sens historiques de mots qui peuvent être utilisés pour créer des dictionnaires de sentiments spécifiques à une période, assurant qu'un usage de mots comme « artificiel » (ce qui signifie habilement conçu) du XVIIe siècle ne soit pas mal interprété comme négatif.
Études de cas : L'apprentissage automatique en action
Plusieurs projets de recherche importants illustrent la puissance du ML dans les études historiques. Le projet Chronicling America à la Bibliothèque du Congrès utilise le ML pour améliorer l'OCR pour les journaux historiques, tout en permettant la recherche de sujets et de mots clés sur des millions de pages. De même, le projet ESTC (Catalogue anglais de titres abrégés) a utilisé des algorithmes de regroupement pour détecter des éditions de livres imprimés anciens, révélant la circulation de textes avant l'existence des lois sur le droit d'auteur.
Une étude historique a utilisé l'analyse des sentiments sur les discours parlementaires britanniques de 1800 à 2000 pour suivre la valeur émotionnelle du débat législatif, en concluant que le ton est devenu plus négatif et polarisé pendant les périodes de stress économique.Les chercheurs ont utilisé une version du dictionnaire Linguistic Inquiry and Word Count (LIWC)[ adapté pour l'anglais historique, puis corrélé les scores de sentiment avec la croissance du PIB, les taux de chômage et les pertes en guerre.
Un autre projet a appliqué la modélisation de sujets aux thèses de doctorat américaines de 1861 à 2000, montrant comment les priorités de recherche ont évolué des sujets religieux vers les sciences sociales puis vers les domaines STEM. L'ensemble de données ] ProQuest comprend plus de 5 millions de mémoires, et la modélisation de sujets a révélé que la proportion de mémoires portant sur des thèmes religieux est passée de 34 % dans les années 1890 à 6 % dans les années 1980, tandis que celles axées sur la technologie et l'ingénierie sont passées de 2 % à 28 %.
Pour une plongée plus profonde dans le volet technique de ces méthodes, voir ce panorama dans Nature de la façon dont ML est utilisé dans les humanités. Le blog Directus offre également des conseils pratiques sur les systèmes de construction qui combinent ML avec la gestion du contenu pour la recherche archivistique.
Surmonter les obstacles : qualité des données, langue et interprétation
Bien que le potentiel soit énorme, l'application de la ML à des textes historiques est difficile. Le problème le plus courant est erreurs OCR[. Les projets de numérisation précoce produisent souvent du texte avec un taux d'erreur de 10 à 20 % en raison d'une impression effacée, de polices inhabituelles ou de dommages à la page. Ces erreurs peuvent jeter des modèles de sujets et des analyseurs de sentiment. Un exemple commun est le mot «rn» rendu comme «m» dans de nombreuses sorties OCR, de sorte que «bom» peut apparaître au lieu de «born», ou «pattern» peut devenir «pattem».
Les chercheurs doivent aussi affronter la langue archaïque—les variations orthographiques, les mots obsolètes et les significations changeantes.Par exemple, le mot «gay» avait une connotation très différente au XVIIe siècle qu'aujourd'hui. Les lexiques et les ancrages de mots doivent être adaptés aux corps historiques, une tâche qui exige à la fois des compétences informatiques et une expertise de domaine.
Les données de formation de nombreux modèles de ML proviennent de textes modernes, de sorte que les algorithmes peuvent mal classer ou mal interpréter les documents historiques qui utilisent différemment le langage, les rôles de genre ou les distinctions de classe, qui sont chargés de façon raciale. Un modèle formé sur les journaux du XXe siècle pourrait qualifier un éditorial du XIXe siècle sur la « sphère des femmes » comme appuyant l'égalité entre les sexes, alors qu'en fait, il renforce l'idéologie des sphères distinctes.
Un autre biais subtil est le déséquilibre genre. Le bilan historique est dominé par des textes produits par des élites—gouvernements, des individus riches, des écrivains masculins. Si un modèle thématique est formé exclusivement aux discours parlementaires, il peut manquer entièrement les expériences des femmes, des paysans ou des peuples colonisés. Des techniques comme échantillonnage stratifié[ et supersample des genres sous-représentés peuvent atténuer cela, mais ils exigent des chercheurs de traiter activement leurs données, pas seulement jeter chaque document disponible dans un algorithme.
Considérations éthiques dans l'histoire algorithmique
Les textes historiques numérisés contiennent souvent des renseignements personnels sur des personnes qui n'avaient pas de raison d'être. ML peut réidentifier des données anonymes ou exposer des détails de correspondance privée. Les chercheurs doivent appliquer les principes de protection des données et examiner si leur analyse pourrait nuire aux communautés descendantes. Par exemple, les bases de données généalogiques construites à partir des registres du recensement du 19e siècle peuvent révéler par inadvertance les relations génétiques ou les divorces que les descendants vivants n'ont pas rendus publics.
Par exemple, un système de reconnaissance d'entités nommé pourrait ne pas reconnaître les auteurs féminins si les données de formation sous-représentent les femmes. Dans une étude de 2018, un système NER largement utilisé n'a pas reconnu la moitié des auteurs féminins dans un corpus de romans du XIXe siècle, identifiant correctement Jane Austen mais manquant Isabella Bird, Mary Wollstonecraft Shelley, et d'autres. De telles erreurs se sont accumulées au fil du temps, conduisant à un dossier historique encore plus biaisé que les archives originales.
Le Numeric Humanities Quarterly offre un forum pour de telles discussions, avec de nombreux articles explorant l'utilisation éthique du ML dans la recherche historique.Les Principes pour les humanités numériques publiés par l'Alliance des organisations de l'humanité numérique soulignent que l'analyse algorithmique doit être accompagnée d'une documentation claire sur la provenance des données, les décisions préalables au traitement et les limites du modèle.
Étapes pratiques pour la mise en oeuvre de la LM dans les projets historiques
Pour les historiens qui envisagent d'adopter le ML, un workflow pratique commence par nettoyage des données[.Le texte doit être corrigé par l'OCR à l'aide d'outils comme Tesseract avec des modèles de langage affinés pour les polices historiques. OpenRefine[ est un autre outil utile pour le nettoyage et la normalisation des métadonnées, comme la normalisation des noms d'auteur ou des noms de lieux géographiques.
Pour les collections de petites à moyennes dimensions (jusqu'à 100 000 documents), les bibliothèques Python comme ou fonctionnent bien. Pour les plus grands corpus, les services cloud ou les plateformes dédiées d'humanités numériques comme Les outils de voix[ ou Palladio[ peuvent s'étendre plus facilement. Les outils de voix[ ne nécessitent aucune programmation et fournissent des visualisations interactives des fréquences de mots, de la collocation et des modèles thématiques. Palladio se spécialise dans l'analyse de réseaux et la cartographie géospatiale, ce qui le rend idéal pour les projets impliquant des réseaux de correspondance ou des itinéraires de migration.
Il est crucial de valider les résultats[. Un modèle thématique peut produire des sujets cohérents qui sont en fait des artefacts d'erreurs OCR ou des mots-stop communs. L'inspection manuelle d'un échantillon aléatoire de documents dans chaque groupe thématique est une étape minimale de validation. Plus rigoureuse, la validation consiste à comparer les catégories générées par ML avec des catégories codées par des humains, à l'aide de mesures comme le kappa de Cohen. La collaboration avec un data savant ou l'intégration d'un dépôt comme Eulder Tree[—une plateforme pour les projets d'histoire numérique—peut aider à éviter les pièges communs.
Choisir les bons outils pour la Corpora historique
Les outils ML ne sont pas tous créés à égalité pour le travail historique. Les embarquations de mots pré-formées (comme Word2Vec ou GloVe) sont basées sur des corpus modernes et ne peuvent pas saisir des usages historiques. Les chercheurs devraient envisager de former leurs propres embarquations sur des collections de textes historiques, comme COHA (Corpus of Historical American English). COHA contient plus de 400 millions de mots de textes publiés entre 1810 et 2009, et la formation embarquée sur ce corpus produit des vecteurs qui reflètent les sens des mots du XIXe siècle. Par exemple, «docteur» en 1870 embarquations pourrait être plus étroitement associé à «clérgeur» qu'à «chirurgien», ce qui reflète la réalité historique selon laquelle de nombreux médecins communautaires étaient également des figures religieuses.
Une étude de 2023 a révélé que le GPT-4, lorsqu'il a été demandé de résumer les brochures du XVIIIe siècle sur la Loi sur le timbre, a inventé des réunions de villes et des débats imaginaires qui n'ont jamais eu lieu. Pour l'analyse, il est plus sûr d'utiliser des modèles interprétables comme la régression logistique ou les arbres de décision, ce qui permet aux chercheurs de voir exactement quelles caractéristiques conduisent à la classification. LIME[ et SHAP sont deux bibliothèques qui peuvent expliquer les prédictions de tout modèle de boîte noire, fournissant des intervalles de confiance et des notes d'importance qui aident les historiens à évaluer la fiabilité des extrants de ML.
L'avenir : analyse en temps réel et intégration multimodale
La prochaine frontière implique une analyse en temps réel des textes nouvellement numérisés. Comme les archives ajoutent continuellement du matériel, les pipelines ML peuvent automatiquement classer, résumer et relier de nouveaux textes à ceux existants, créant un graphique dynamique des connaissances des événements historiques. Le projet Archives Unleashed, par exemple, traite les archives Web en temps réel, extrait des entités nommées et génère des graphiques de réseau d'hyperliens entre des sources historiques en ligne. L'intégration avec des données spatiales et temporelles permettra aux historiens de cartographier la propagation d'idées ou de maladies à travers la géographie et le temps.
Les progrès dans le traitement du langage naturel (NLP)[ adapté au langage historique – comme les modèles formés sur l'anglais du XVIIIe siècle – réduiront l'écart entre l'usage moderne et historique. Les OED (Oxford English Dictionary) et WordNet[ sont mis à jour avec des sens de mots historiques, fournissant de meilleures ressources pour les lexiques sentimentaux. Le projet Historical WordNet à l'Université de Waikato a déjà mapisé 50 000 mots à leurs sens historiques, et cet ensemble de données s'intègre directement à et .
De plus, le ML multimodal qui combine le texte avec des images (cartes, photographies, manuscrits manuscrits) déverrouillera des sources qui ont été difficiles à analyser automatiquement, comme les scrapbooks ou les marginalia. Le cadre visuel NLP développé par IBM Research peut extraire du texte des documents manuscrits, le faire correspondre à des transcriptions dactylographiées, puis effectuer une analyse de sentiment sur les notes marginales.
Collaboration entre l'apprentissage automatique et les bourses traditionnelles
L'avenir le plus prometteur ne consiste pas à remplacer les historiens par des algorithmes, mais à approfondir la collaboration.L'apprentissage automatique peut gérer la «personnalité» du traitement des données, tandis que les historiens apportent des connaissances de domaine pour poser de meilleures questions et interpréter les résultats.Les programmes de fin d'études en histoire numérique sont maintenant courants et de nombreux départements d'histoire offrent des diplômes conjoints avec l'informatique.
On peut s'attendre à voir des équipes interdisciplinaires plus nombreuses s'attaquer à de grandes questions historiques, telles que l'évolution à long terme de la démocratie, l'impact du climat sur les sociétés passées ou la propagation des mouvements religieux.L'Unité de recherche climatique de l'Université d'East Anglia s'est associée avec des historiens pour appliquer le ML aux journaux météorologiques des XVIIIe et XIXe siècles, en extrayant les données de température et de précipitations des entrées quotidiennes pour reconstruire les modèles climatiques avant que les données météorologiques officielles ne commencent.
Conclusion : Un nouvel âge de la découverte historique
L'apprentissage automatique n'est pas une balle magique, mais c'est un objectif puissant qui révèle des structures et des motifs invisibles à l'œil nu. La numérisation de textes historiques a créé un trésor de données, et ML fournit les outils pour l'explorer de façon responsable. En combinant la rigueur computationnelle avec l'interprétation humaniste, les chercheurs peuvent comprendre le passé avec plus de profondeur que jamais. La clé est de rester conscient des limites — erreurs OCR, langage archaïque, biais algorithmique — et d'utiliser la technologie comme moyen, pas une fin.
Pour de plus amples informations sur la mise en œuvre pratique de ces méthodes, la plateforme Directus offre des solutions CMS sans tête qui peuvent servir de base aux projets d'histoire numérique, intégrant les pipelines ML à la gestion des métadonnées d'archives. À mesure que la technologie mûrira, la frontière entre l'historien et le data savant continuera de s'estomper, ouvrant ainsi un riche champ interdisciplinaire qui promet de remodeler notre compréhension de l'histoire humaine.Le blog Directus fournit des mises à jour régulières sur la façon dont les systèmes de gestion du contenu évoluent pour soutenir ces flux de travail analytiques avancés, ce qui facilite l'adoption par les chercheurs en humanités de l'apprentissage automatique sans une expertise technique profonde.