La pratique de l'histoire est en pleine transformation structurelle. Lorsque les historiens se sont autrefois entièrement appuyés sur des archives physiques, ils font maintenant face à un paysage riche en sources numérisées, outils algorithmiques et plateformes interactives.Cette convergence des méthodes quantitatives et des recherches humanistes est généralement classée sous deux cadres qui se chevauchent : l'histoire computationnelle et les humanités numériques (DH). Bien que d'origine distincte, ces domaines sont de plus en plus interdépendants. L'histoire computationnelle fournit le moteur analytique pour la détection des motifs à grande échelle, tandis que les projets DH construisent l'infrastructure numérique, les normes et les pratiques de collaboration qui rendent possible cette analyse.

Histoire computationnelle: formaliser l'étude du passé

L'histoire computationnelle applique des techniques de modélisation quantitatives, algorithmiques et formelles à la recherche historique. Elle transforme l'archive en un ensemble de données et le récit en une hypothèse testable.Cette approche permet aux historiens de poser des questions à une échelle impossible à aborder en lisant seule de près. Un chercheur peut retracer la diffusion d'idées scientifiques à travers des siècles de correspondance, mesurer l'impact des conditions météorologiques sur les rendements des cultures à l'aide de registres paroissiaux, ou simuler l'effondrement d'une chaîne d'approvisionnement en temps de guerre.

Les historiens informatiques modernes utilisent régulièrement le traitement du langage naturel (NLP) pour analyser le sentiment dans les archives de journaux, l'analyse de réseaux pour étudier les groupes de lobbying dans les dossiers parlementaires et la modélisation par des agents pour comprendre les tendances migratoires. Un engagement méthodologique clé est reproductibilité—les scholars devraient publier leur code et leurs données en même temps que leurs constatations, permettant à d'autres de vérifier les résultats ou d'appliquer la même méthode à un cas différent.

Cependant, l'histoire computationnelle n'est pas un positivisme naïf. Le meilleur travail dans le domaine reste profondément critique de ses propres sources. Les données ne sont jamais brutes; elles sont recueillies, nettoyées et étiquetées selon des choix spécifiques qui intègrent des visions du monde particulières. Comme les chercheurs du projet Mining the Dispatch le modèle thématique peut révéler des préoccupations changeantes du public dans la guerre civile Richmond – mais seulement si les archives de journaux sous-jacentes sont comprises comme des produits de biais éditorials spécifiques, de technologies d'impression et de taux de survie. L'historien computationnel doit toujours maintenir une vision double : voir à la fois le modèle dans les données et les conditions historiques qui ont généré ces données.

Humanités numériques : Infrastructure, accès et interprétation

Les humanités numériques sont un domaine plus vaste et plus hétérogène. Elles englobent la création d'archives numériques, le développement d'outils de montage scientifique, la cartographie géospatiale, l'encodage de texte et les expositions d'histoire publique. Bien que l'histoire computationnelle tende à se concentrer sur l'analyse, DH met fortement l'accent sur l'infrastructure et l'accès[.Des projets comme Europeana[ regroupent des millions d'objets provenant d'institutions du patrimoine culturel, fournissant un point d'accès unifié.D'autres, comme Old Bailey Online, offrent des données profondément structurées – des transcriptions encodées par TEI – qui peuvent soutenir à la fois une navigation occasionnelle et une requête SQL complexe.

Un projet typique implique des historiens, bibliothécaires, développeurs de logiciels, concepteurs de logiciels et intervenants communautaires.Cette approche en équipe reflète la complexité de la construction de ressources numériques durables.Les choix faits au sujet des schémas de métadonnées, des formats de fichiers et de la conception d'interfaces ont des implications durables sur la façon dont le matériel historique peut être utilisé.Une archive mal conçue peut résister à l'analyse computationnelle pendant des décennies; une archive bien conçue devient un laboratoire de recherche future.Les lignes directrices Initiative d'encodage de texte (TEI), par exemple, offrent une façon normalisée de marquer les fonctionnalités textuelles, permettant aux lecteurs humains et aux processus de machine de naviguer dans des éditions complexes.

Le projet Mapping the Republic of Letters à Stanford ne se contentait pas de visualiser les réseaux de correspondance; il a conçu des interfaces interactives qui permettaient aux chercheurs de filtrer par date, correspondant et emplacement, transformant une archive statique en un environnement exploratoire. Ce mélange de profondeur scientifique et de conception centrée sur l'utilisateur est une caractéristique de la pratique avancée de la DH. De même, le projet Stanford Spatial History a produit des cartes numériques stratifiées qui intègrent des données démographiques, économiques et environnementales, permettant aux historiens d'examiner le changement dans le temps avec une granularité sans précédent.

L'intersection productive

La recherche la plus passionnante d'aujourd'hui vit à l'intersection de l'histoire computationnelle et de DH. Les projets qui combinent une infrastructure robuste avec des algorithmes rigoureux peuvent répondre à des questions que ni l'un ni l'autre domaine ne pourrait aborder seul.

Mines de textes à grande échelle et linguistique Corpus

L'histoire informatique repose sur de grands corpus de textes; DH fournit les normes de numérisation et les métadonnées qui rendent ces corpus utilisables. Le projet Textes virtuels de l'Université du Nord-Est a utilisé des algorithmes de détection de réutilisation de texte pour suivre comment les journaux du XIXe siècle ont copié et diffusé du contenu dans les États-Unis. Cette recherche n'a été possible que parce que la Bibliothèque du Congrès et NEH avaient déjà construit le corpus Chronicling America de journaux numérisés. L'infrastructure DH a permis l'analyse computationnelle.

Modélisation spatiale et temporelle

Les projets de DH comme Grande-Bretagne Les GIS historiques rassemblent de grandes quantités de données de recensement, de données sur l'utilisation des terres et de changements de limites. Les historiens calculateurs appliquent ensuite la régression spatiale, l'estimation de la densité du noyau et l'analyse des séries chronologiques à ces couches. Cette combinaison permet aux chercheurs de tester les théories géographiques du développement économique ou de la propagation de la maladie avec rigueur empirique.

Étude de cas : La pandémie de grippe de 1918

En reliant les dossiers hospitaliers numérisés (un produit de DH) à des modèles statistiques spatiaux (une méthode d'histoire computationnelle), les chercheurs ont pu retracer l'impact des interventions en santé publique pendant la pandémie de 1918.Les résultats ont montré que les interventions non pharmaceutiques – fermetures d'écoles, interdictions de rassemblement public – ont réduit significativement la mortalité, mais seulement si elles sont mises en œuvre tôt et en couches.Ce type de recherche a une pertinence politique directe aujourd'hui, démontrant la puissance pratique de combiner la structure archivistique avec l'analyse computationnelle.

Analyse des réseaux des communautés sociales et intellectuelles

Les projets DH fournissent souvent les données brutes : qui a écrit à qui, quand et d'où. Des projets comme Six degrés de Francis Bacon ont utilisé la visualisation du réseau pour reconstruire les réseaux sociaux des premiers intellectuels britanniques modernes. En calculant les paramètres de centralité, les historiens peuvent identifier les courtiers de connaissances, les clients informels et les voix isolées. Le réseau n'est pas seulement une visualisation; il s'agit d'un modèle formel de structure sociale qui peut être testé, mesuré et comparé au fil des temps.

Défis durables à l'intersection

Malgré la promesse, combiner l'histoire computationnelle et les humanités numériques présente des obstacles importants que le domaine apprend encore à naviguer.Ces défis ne sont pas seulement techniques; ils sont épistémologiques, institutionnels et éthiques.

Qualité des données, partialité et provenance

Les sources numérisées ne sont pas propres, complètes ou neutres. La reconnaissance optique des caractères (OCR) introduit des erreurs qui varient selon les polices, les langues et les pages. Un corpus qui est précis à 80% peut être suffisant pour une recherche en texte intégral mais désastreux pour une analyse NLP à grain fin comme la reconnaissance d'entités nommées. De plus, les efforts de numérisation ont historiquement accordé la priorité aux matériaux occidentaux, aux élite et aux matériaux produits par l'État. Une analyse computationnelle des tendances historiques « mondiales » manque souvent de cultures non écrites, de populations rurales ou de documents dans des langues non dominantes.

Bias algorithmique

Même si les données sont propres, les algorithmes portent leurs propres biais. Les modèles d'intégration de mots formés sur les journaux historiques reproduireont fidèlement les préjugés raciaux, sexuels et de classe de ces sources. Une analyse naïve pourrait confondre biais historiques et fait objectif. Les historiens computationnels doivent constamment valider leurs modèles en fonction de contextes historiques connus et être transparents sur les limites de leurs méthodes. Le travail responsable exige une documentation agressive et une position critique à la fois envers les données et les outils. L'utilisation des cartes modèles et des déclarations de données dans les NLP, initialement développés pour l'apprentissage automatique, est maintenant adaptée aux contextes historiques pour documenter la provenance et l'utilisation prévue des ensembles de données et des algorithmes.

Durabilité des infrastructures numériques

Un historien computationnel qui construit une analyse de réseau sur une base de données spécifique de DH peut trouver la base de données hors ligne ou cassée en une décennie. Des organismes comme Alliance des organisations de sciences humaines numériques[ (ADHO) travaillent à établir des pratiques exemplaires pour la préservation à long terme, mais le problème exige un engagement institutionnel de la part des bibliothèques et des universités. Les organismes de financement exigent de plus en plus des plans de durabilité, mais l'application de la loi demeure inégale. Certains projets ont adopté des plateformes de ressources ouvertes et la conteneurisation (p. ex. Docker) pour atténuer cette situation, tandis que d'autres partenaires avec des bibliothèques nationales qui s'engagent à assurer la maintenance continue.

Crédit, travail et culture académique

Les chercheurs qui construisent l'infrastructure — les bibliothécaires des métadonnées, les développeurs de logiciels, les gestionnaires de projets — reçoivent souvent moins de reconnaissance académique que les historiens qui utilisent les données pour produire des articles. Ce déséquilibre de travail menace la durabilité du domaine. Les universités commencent à s'attaquer à cela en créant des pistes de tenure pour la bourse numérique, mais les progrès sont lents. Pour l'intersection de l'histoire computationnelle et de DH pour prospérer, les institutions doivent reconnaître la construction d'infrastructures comme une contribution scientifique légitime et précieuse.

Communication interdisciplinaire

Les historiens de la comptabilité peuvent manquer de formation en science de la bibliothèque, tandis que les praticiens de la DH ne comprennent pas les hypothèses statistiques qui sous-tendent un modèle de calcul. Construire une véritable intersection exige une collaboration intentionnelle, souvent par le biais d'ateliers conjoints, de cours co-taughts et de vocabulaires partagés. La revue Digital Humanities Quarterly a présenté des questions particulières conçues spécifiquement pour combler ces lacunes, publiant des articles qui expliquent les choix méthodologiques en langage simple tout en maintenant la rigueur.

Trajectoires futures

La prochaine vague d'innovation approfondira l'intégration entre l'analyse computationnelle et l'infrastructure humaniste. Plusieurs tendances émergentes promettent de remodeler le paysage au cours de la prochaine décennie.

L'IA et la sensibilisation herméneutique

Les grands modèles linguistiques (LLM) offrent de nouvelles capacités puissantes. Ils peuvent résumer des documents, traduire des langues archaïques et extraire des données structurées de textes non structurés. Des outils de reconnaissance textuelle manuscrite (HTR) comme Transtribus font des millions de pages manuscrites auparavant inaccessibles des recherches. Cependant, ces modèles présentent de profonds défis. Ils sont sujets à l'hallucination et à l'anachronisme. Il incombera aux historiens de computeral de développer des protocoles de validation – tester les sorties du modèle en fonction des données de vérité terrestre et de l'expertise du domaine. L'avenir appartiendra aux chercheurs qui traitent l'IA comme un assistant de recherche puissant mais profondément failli, non comme un oracle. Certains projets expérimentent déjà la génération de récupération (RAG) des systèmes qui produisent des LLM dans des sources d'archives spécifiques, réduisant le risque de fabrication.

Liens entre les données ouvertes et le Web sémantique

À mesure que les projets de DH arrivent à maturité, la tendance est à une plus grande interopérabilité.Les données ouvertes liées (LOD) permettent à une personne mentionnée dans un registre de recensement d'être automatiquement liée à sa correspondance dans une archive épistolaire.Les plateformes comme Wikidata[ servent de plaque tournante pour la réconciliation des entités.Pour les historiens calculateurs, cela signifie moins de temps pour nettoyer les données et plus de temps pour les analyser.Pour les conservateurs de DH, cela signifie que leurs collections peuvent être découvertes dans un réseau mondial de connaissances.

Humanités numériques mondiales et participatives

L'avenir du domaine doit être global.Une grande partie de l'infrastructure DH a été construite en Europe et en Amérique du Nord, mais les sources d'archives les plus riches sont distribuées dans le monde entier. Des projets comme Mukurtu habilitent les communautés autochtones à gérer leur patrimoine culturel selon leurs propres modalités, en intégrant des protocoles d'accès et d'utilisation qui respectent les savoirs traditionnels.Les projets de transcription et d'annotation de source publique invitent le public à participer au processus de recherche.La plateforme Zooniverse a accueilli de nombreux projets historiques, allant de la transcription des journaux de navires à la classification des artefacts archéologiques.

Conclusion

L'histoire informatique démontre à son tour la valeur de cette infrastructure en produisant de nouvelles idées sur le passé. Les chercheurs les plus réussis de la génération à venir seront ceux qui pourront se déplacer de façon fluide entre ces domaines, savoir construire une base de données et comment la interroger, comment concevoir une interface et comment interpréter les modèles qu'elle révèle. L'avenir de la recherche historique n'est ni purement quantitatif ni purement narratif. C'est une pratique hybride, fondée sur l'interaction rigoureuse et créative des données et de l'interprétation. À mesure que les archives grandissent et que les algorithmes s'améliorent, l'intersection de l'histoire informatique et des humanités numériques restera un terrain fertile de découverte, à condition que nous restions attentifs aux biais, aux limites et aux responsabilités éthiques qui viennent avec ces outils puissants.