Présentation

L'intersection de la science des données et de l'enquête historique a donné lieu à une nouvelle discipline souvent appelée histoire numérique ou histoire informatique.En appliquant l'analyse des données massives – outils conçus à l'origine pour le commerce électronique, les médias sociaux et la recherche scientifique – les historiens peuvent maintenant traiter et analyser de vastes dépôts de sources numérisées, notamment des registres paroissiaux séculaires et des recensements qui reviennent à des millions de pages de journaux, des débats parlementaires et même des archives des médias sociaux des deux dernières décennies.

L'augmentation des données massives dans la recherche historique

Les grandes données dans un contexte historique se rapportent à des ensembles de données numériques si importants ou complexes qu'elles ne peuvent être facilement traitées avec des outils traditionnels de tableur ou de base de données.Les sources sont diverses : la reconnaissance optique des caractères (OCR) a permis la numérisation de millions de livres, de revues et de journaux; les gouvernements et les institutions ont publié des données de recensement lisibles par machine, des registres des naissances et des décès et des procédures parlementaires; et le Web a fourni des quantités sans précédent de correspondance personnelle, de discours publics et d'ephemera.

Le volume de données — par exemple, la British Library détient plus de 40 millions de pages de journaux du XVIIe au XXe siècle — signifie que même un seul chercheur peut, avec les bons outils, évaluer les modèles au fil des siècles plutôt que se limiter à quelques archives. Ce changement a été comparé à l'invention du télescope en astronomie : il ne remplace pas la lecture rapprochée, mais révèle des structures invisibles à l'œil nu. Cependant, l'adoption des mégadonnées dans l'histoire n'a pas été sans controverse.

Méthodes analytiques clés pour les données massives historiques

Pour extraire des modèles significatifs de données historiques, les chercheurs utilisent une série de méthodes informatiques adaptées à l'informatique, aux statistiques et aux humanités numériques. Ci-dessous sont les techniques les plus importantes, chacune adaptée à différents types de questions.

Extraction de textes et traitement des langues naturelles (NLP)

L'extraction de texte implique la conversion de texte non structuré en données structurées pouvant être quantifiées et analysées. Les tâches communes de NLP appliquées aux textes historiques comprennent la modélisation de sujets, qui identifie automatiquement des thèmes à travers un corpus; la reconnaissance d'entités nommées (NER), qui extrait des noms de personnes, lieux, organisations et dates; et l'analyse de sentiments, qui mesure le ton émotionnel des passages. Par exemple, en effectuant une analyse de sentiment sur des décennies d'éditorials de journaux, les chercheurs peuvent tracer l'opinion publique autour d'événements clés tels que le déclenchement de la guerre ou l'adoption de lois majeures.

Analyse de réseau

L'analyse des réseaux permet de cartographier les relations entre les entités, les personnes, les organisations, les idées, voire les lieux. Dans la recherche historique, elle est particulièrement puissante pour comprendre les structures sociales, les alliances politiques, les collaborations scientifiques et les réseaux commerciaux. En construisant un réseau de lettres, par exemple, on peut identifier les figures qui ont agi comme courtiers d'influence pendant les Lumières ou la Révolution américaine. Le mathématicien et historien William Playfair a dit une fois, -Quand il y a une nation, il y a un réseau, - et des outils modernes comme Gephi ou Cytoscape permettent de visualiser ces connexions à l'échelle Playfair n'aurait pas pu imaginer.

Analyse spatiale et systèmes d'information géographique (SIG)

Le SIG permet aux historiens de placer des données sur les cartes et d'analyser les modèles spatiaux au fil du temps. Cette méthode a été utilisée pour reconstruire la propagation de la Mort Noire en Europe, pour cartographier les itinéraires du Chemin de fer souterrain, et pour analyser la répartition des schémas électoraux lors des élections américaines du XIXe siècle. L'analyse spatiale peut également combiner plusieurs couches – par exemple, superposer les données de recensement avec des cartes des ressources naturelles pour expliquer l'emplacement des villes industrielles.

Apprentissage automatique pour la détection de motifs

Au-delà des méthodes statistiques simples, les algorithmes d'apprentissage automatique peuvent identifier des modèles complexes et non évidents dans les données historiques. Les algorithmes de regroupement regroupent des événements historiques ou des documents similaires sans étiquette préalable, utiles pour détecter des catégories de manifestations sociales ou littéraires qui n'étaient pas reconnues auparavant. La détection d'anomalies peut identifier des valeurs aberrantes, comme des pics de prix inhabituels sur les marchés céréaliers médiévaux qui coïncident avec des famines ou des révoltes.

Études de cas sur la découverte de modèles cachés

Les exemples suivants illustrent comment les méthodes de big data ont révélé des modèles que l'historiographie traditionnelle aurait pu manquer ou seulement laissé entendre.

Révèler les changements dans le sentiment public par le biais des archives de journaux

L'un des domaines les plus productifs a été l'analyse de grands corpus de journaux. Les Archives de journaux britanniques, par exemple, contient plus de 40 millions de pages couvrant trois siècles. Les chercheurs de l'Université de Sussex ont utilisé la modélisation thématique et l'analyse des sentiments sur les journaux irlandais de 1790 à 1900 pour suivre l'évolution des attitudes à l'égard de l'émigration. Ils ont découvert que la langue a passé de la description de l'émigration comme forme d'exil au début du 19ème siècle à une décision économique calculée des années 1880 – une transition qui a eu lieu plus tôt que les récits historiques conventionnels suggérés.

Cartographie des réseaux sociaux de figures historiques

Le projet -Six degrés de Francis Bacon- , qui fait référence au fameux concept de six degrés de séparation, a utilisé l'analyse de réseau pour reconstruire les liens sociaux des premiers intellectuels anglais modernes. Par des lettres d'extraction, des dévouements et des listes d'adhésion de la Société royale, le projet a révélé que Margaret Cavendish, philosophe et écrivaine du XVIIe siècle, était beaucoup plus liée aux penseurs de premier plan qu'auparavant, remettant en question sa réputation d'excentrique isolée.

Analyse des données économiques à long terme

Les historiens économiques ont travaillé depuis longtemps avec des données quantitatives, mais les données massives ont élargi leur portée.Le Groupe Global Price and Income History a rassemblé une base de données sur les salaires et les prix sur 600 ans dans des dizaines de villes. En appliquant les données de regroupement et d'analyse de séries chronologiques, les chercheurs ont identifié la période --la petite divergence -entre 1500 et 1800 lorsque l'Europe du Nord-Ouest a commencé à s'éloigner économiquement du sud et de l'est. Ce schéma n'était pas visible dans aucune ville unique records, mais a émergé seulement lorsque toutes les données ont été combinées et examinées pour des points communs.

Reconstruire les éclosions de maladies à partir des dossiers historiques

En 2020, une équipe d'historiens et de data savants a numérisé des milliers de dossiers d'enterrement provenant des paroisses londoniennes du XVIIe siècle et a utilisé le SIG pour cartographier la propagation de la Grande Plague de 1665. Ils ont découvert que l'infection ne se déplaçait pas uniformément du centre-ville vers l'extérieur; au contraire, elle sautait de paroisse en paroisse le long des routes commerciales, certains quartiers agissant comme des centres de concentration d'auberges et de marchés - superplage. Cette analyse non seulement a corrigé des cartes antérieures basées sur des comptes anecdotiques, mais a également fourni des indications qui pourraient éclairer la préparation moderne à la pandémie.

Défis et limites

Malgré sa promesse, l'utilisation de données massives dans l'histoire est remplie de défis méthodologiques et éthiques. Premièrement, la qualité des données est rarement parfaite. Les erreurs de l'OCR peuvent fausser les résultats de l'extraction de texte; par exemple, un seul personnage entaché d'un article de journal pourrait changer le score sentimental d'un corpus d'une année entière. Les historiens doivent soigneusement nettoyer et valider leurs ensembles de données, exigeant souvent des vérifications manuelles sur un échantillon.

Troisièmement, la corrélation n'est pas une cause. Les données massives peuvent révéler que deux tendances se déplacent ensemble – par exemple, une augmentation des réformes de l'orthographe et un déclin des références religieuses – mais une explication exige un contexte historique. Sans elle, l'analyse risque de devenir un artefact minier de données qui surpasse les modèles au bruit. Enfin, des préoccupations de confidentialité se posent lorsqu'on traite de données personnelles du 20e siècle.

L'avenir des mégadonnées dans l'histoire

En ce qui concerne l'avenir, l'intégration des mégadonnées avec l'apprentissage automatique, en particulier les grands modèles de langage (LLM) comme le GPT, offre des possibilités de tantisation. Les LLM peuvent résumer des textes historiques, générer des hypothèses, voire simuler des scénarios historiques -contre-faituels en étant formés à de grands corpus de déclarations conditionnelles.

La fusion des données historiques avec d'autres domaines scientifiques est une autre frontière, la climatologie historique, par exemple, combine les données sur les arbres, les carottes de glace et les journaux météorologiques historiques pour reconstruire les climats passés. En les fusionnant avec des données économiques, les chercheurs peuvent modéliser comment les chocs climatiques ont déclenché des famines ou des migrations. L'archéologie devient aussi une donnée : la numérisation lidar a révélé des villes mayas entières cachées sous des canopées de jungle, tandis que la datation du carbone et l'analyse de l'ADN sont intégrées dans des modèles statistiques de mouvements de population.

À mesure que ces outils deviennent plus accessibles, on peut voir une démocratisation de la recherche historique, où les généalogistes amateurs ou les sociétés d'histoire locales peuvent appliquer les mêmes algorithmes utilisés par les universités. Le risque, cependant, est une nouvelle forme de fracture numérique entre ceux qui ont les compétences techniques et les ressources informatiques et ceux qui n'en ont pas.

Conclusion

L'application des données massives à la recherche historique n'est pas un substitut à l'artisanat traditionnel de l'historien, c'est une extension. En révélant des modèles cachés dans le sentiment, les réseaux, l'espace et le temps, elle nous permet de poser de nouvelles questions et de confirmer ou de contester de vieux récits. Les exemples discutés ici — du passage de la rhétorique irlandaise de l'émigration à la propagation de la peste à Londres — démontrent que des modèles invisibles pour le chercheur individuel peuvent émerger du poids collectif des données.