Table of Contents
Combler l'histoire et la science des données
L'étude des mouvements de population historiques s'est traditionnellement appuyée sur des preuves fragmentaires : rouleaux de recensement, manifestes de navires, registres fiscaux et lettres. Les historiens et archéologues assemblent ces ardues pour reconstruire le flux et le flux des sociétés humaines. Cependant, le volume des enregistrements historiques numérisés et la complexité du comportement humain ont ouvert la porte à des approches computationnelles. L'apprentissage automatique (ML) offre un moyen de détecter des modèles à travers de vastes ensembles de données qui submergeraient un seul chercheur.
La numérisation des archives historiques s'est considérablement accélérée au cours de la dernière décennie. Des millions de pages de rapports de recensement, de registres paroissiaux et de rouleaux d'impôts sont maintenant lisibles par machine. Pourtant, les données brutes ne constituent pas à elles seules des connaissances. Les modèles de mobilité humaine sont profondément non linéaires : une famine pourrait déclencher un exode massif dans une région alors que les zones voisines restent stables grâce aux réseaux de parenté ou à l'accès au commerce.
Cet article explore comment l'apprentissage automatique est appliqué pour prédire les mouvements démographiques historiques, les données et techniques en jeu, les défis auxquels les chercheurs sont confrontés et le potentiel de transformation de la science historique et de la politique contemporaine.
Pourquoi apprendre automatiquement pour les données démographiques historiques?
L'histoire démographique traditionnelle repose souvent sur l'analyse narrative et les corrélations statistiques de base. L'apprentissage automatique étend ces capacités en manipulant des relations non linéaires et des interactions à haute dimension. Par exemple, la décision de migrer peut dépendre d'une combinaison de rendements des cultures, d'instabilité politique, de fardeau fiscal et de réseaux de parenté. Un modèle de régression linéaire pourrait avoir du mal à saisir de telles interactions, mais un arbre à gradient ou un réseau neural peut les apprendre à partir de données.
Une étude de 2020 réalisée par des chercheurs de l'Université de Cambridge a utilisé des forêts aléatoires pour prédire les emplacements des colonies néolithiques en Europe avec 80% de précision, en se basant uniquement sur des variables environnementales. Une autre équipe de l'Institut Max Planck a appliqué l'apprentissage profond aux données de naufrage de l'ère romaine pour déduire les routes commerciales et la redistribution de la population à travers la Méditerranée. Ces succès démontrent que ML n'est pas un gimmick mais un véritable outil pour la génération d'hypothèses et les tests.
Au-delà de la prédiction, le ML offre quelque chose de plus précieux pour les historiens : la capacité de quantifier l'incertitude.Les arguments historiques sont souvent probabilistes – « il est probable que la population se soit déplacée vers l'ouest en raison de l'épuisement du sol » – mais ils fixent rarement des intervalles de confiance explicites.
Les enjeux économiques et humanitaires sont également importants : comprendre les facteurs de la migration historique peut éclairer la politique moderne en matière de réfugiés climatiques, d'urbanisme et de réaction aux catastrophes. Par exemple, si les modèles montrent que les migrations historiques ont été précédées de façon constante par une combinaison de sécheresse et de perturbation des routes commerciales, les systèmes d'alerte rapide peuvent être conçus pour détecter ces précurseurs aujourd'hui.
L'évolution de la science des données historiques
Les premiers efforts entrepris dans les années 1960 et 1970 ont porté sur l'histoire quantitative, à l'aide de cartes à perforation et d'ordinateurs centraux pour analyser les données du recensement. La logistique, comme on l'appelait, a été confrontée à la résistance des historiens traditionnels qui considéraient la quantification comme un réducteur. L'essor des systèmes d'information géographique (SIG) dans les années 1990 a ajouté une dimension spatiale, permettant aux chercheurs de cartographier les changements démographiques au fil du temps.
L'apprentissage automatique représente la prochaine étape logique. Là où le SIG répond « où », ML répond « pourquoi » et « si ». La disponibilité de l'informatique en nuage, des bibliothèques open-source comme scikit-learn et TensorFlow, et des formats de données normalisés a réduit la barrière à l'entrée. Les historiens n'ont plus besoin d'être des programmeurs professionnels pour appliquer ces techniques; ils peuvent collaborer avec des informaticiens ou utiliser des plateformes conviviales.
Sources de données : La matière première de la prévision
Pour les mouvements de population historiques, les chercheurs doivent compiler des ensembles de données hétérogènes provenant de disciplines multiples. Les sources les plus courantes sont les suivantes :
- Census nationaux, registres paroissiaux, listes de recensements, listes de conscriptions militaires, qui fournissent des dénombrements de population, des répartitions d'âge et des structures de ménages à des moments précis.
- Logs de migration:[ Listes des passagers des navires, dossiers de passage des frontières et systèmes de passeport interne. Ces registres permettent de saisir les mouvements individuels et peuvent être agrégés aux matrices de flux.
- Archives environnementales: Chronologies des arbres, carottes de glace, relevés des sédiments du lac et sorties de modèles paléoclimatiques.
- Données archéologiques : Emplacements, dates de radiocarbone, typologies de poterie et échantillons d'ascendance ancienne de l'ADN.Ces données fournissent des preuves de mouvements qui datent d'avant les enregistrements écrits.
- GIS historique: Cartes numérisées des routes historiques, des ports et des centres urbains.
Les données historiques contiennent souvent des incohérences dans la désignation des conventions, les formats de date et les unités géographiques. Par exemple, un nom de village peut avoir changé d'orthographe au cours de siècles, ou un recensement peut avoir omis certains groupes ethniques. Le nettoyage des données implique la normalisation des noms de lieux à l'aide de gazetteurs, l'imputation des dates manquantes et l'encodage de variables catégoriques telles que « occupation » ou « groupe de peau » en caractéristiques numériques.
Traitement des erreurs et des données manquantes
Les données historiques sont rarement complètes.Les populations illettrées, nomades ou marginalisées sont souvent sous-représentées.Un modèle d'apprentissage automatique formé uniquement sur les données officielles du recensement pourrait surestimer les mouvements des riches propriétaires fonciers, sans migration des esclaves ou des travailleurs saisonniers.Les chercheurs doivent expliquer ces biais en pondérant les données, en utilisant de multiples techniques d'imputation ou en intégrant des variables de substitution.Par exemple, la présence d'un certain type de poterie céramique peut servir de substitut pour le mouvement d'un groupe culturel spécifique même en l'absence de documents écrits. Une étude du PNAS de 2022] a montré que l'inclusion de la distance génétique entre les populations comme caractéristique a amélioré de façon significative les prévisions de la migration interrégionale en Europe pendant l'âge du bronze.
Les données historiques s'agrégent souvent au fil des décennies ou même des siècles, alors que les événements de migration réels peuvent se produire en courtes périodes. Un recensement effectué tous les dix ans peut manquer une vague de migration qui s'est produite entre les deux. Les chercheurs peuvent s'attaquer à cette question en utilisant des techniques d'interpolation ou en se concentrant sur des événements à résolution temporelle plus élevée, comme les listes de passagers de navires ou les inscriptions de camps de réfugiés.
Ingénierie de la fonction pour la migration historique
L'ingénierie des caractéristiques est le processus de transformation des données brutes en variables qu'un modèle d'apprentissage automatique peut utiliser efficacement. Pour les mouvements de population historiques, cela nécessite des connaissances sur ce qui a conduit à la migration dans différentes époques et régions.
- Indices de stress environnemental:[ Combiner la température, les précipitations et la qualité du sol en une seule mesure de viabilité agricole. Un indice de sécheresse, par exemple, peut être calculé à partir de données sur les arbres.
- Facteurs économiques de la poussée :[ Écarts de salaires entre l'origine et la destination, les prix des terres, les taux d'imposition et la disponibilité des terres communes.
- Variables de réseau social:[ La présence de migrants antérieurs du même village à la destination, la similitude linguistique et les institutions religieuses partagées, qui reflètent le phénomène bien documenté de la migration en chaîne.
- Les facteurs politiques et institutionnels:[ Les changements aux frontières, les lois de conscription, la persécution religieuse et les règles d'héritage.
- Distance et accessibilité: Distance euclidienne, temps de déplacement le long des routes historiques, accès au port et présence de rivières navigables.
Avec des dizaines ou des centaines de prédicteurs potentiels, le surajustement est un danger réel. Les techniques comme l'élimination des caractéristiques récursives, la régression LASSO et les scores d'importance des caractéristiques des modèles basés sur les arbres aident à identifier les variables les plus informatives. L'objectif n'est pas d'inclure tout, mais de capturer les moteurs clés tout en maintenant l'interpretation.
Techniques d'apprentissage automatique adaptées à l'histoire
Tous les algorithmes ML ne sont pas aussi adaptés aux données historiques. Le choix dépend du type de prédiction (classification des épisodes de migration par rapport à la régression des dénombrements de population), de la taille de l'ensemble de données et du besoin d'interprétation.
L'apprentissage supervisé : apprendre des migrations connues
Lorsque les chercheurs ont des exemples historiques clairs de migration (p. ex. la migration de la pomme de terre irlandaise, la Grande migration aux États-Unis), ils peuvent utiliser l'apprentissage supervisé.Le modèle est formé sur des caractéristiques telles que la distance, les anomalies climatiques et les indices économiques, la variable cible étant de savoir si un événement migratoire s'est produit.Les forêts de rando[ et XGBoost sont populaires parce qu'elles gèrent bien les données tabulaires et fournissent des scores d'importance, aidant les historiens à comprendre quels facteurs ont le plus d'influence.
Les réseaux neuronaux, en particulier les perceptrons multicouches, peuvent capter des interactions encore plus complexes, mais au prix de l'interprétation. Ils conviennent mieux aux grands ensembles de données avec de nombreuses caractéristiques. Les réseaux neuronaux convolutionnels (RNC) ont été appliqués aux images cartographiques historiques pour extraire les modèles de peuplement, tandis que les réseaux neuronaux récurrents (RNN) peuvent modéliser des séquences temporelles de flux migratoires.
Apprendre sans surveillance: découvrir des modèles cachés
Lorsqu'il n'existe pas d'événements de migration marqués, l'apprentissage non supervisé peut regrouper des populations en fonction de caractéristiques partagées – familles linguistiques, pratiques d'enterrement ou marqueurs génétiques. Les moyennes K se regroupent et DBSCAN ont été utilisées pour identifier les «points chauds» migratoires dans l'ancienne Méditerranée. Une application particulièrement novatrice est analyse de réseau combinée avec le regroupement : traiter les colonies comme des nœuds et des itinéraires commerciaux comme des bords, les algorithmes de détection communautaire peuvent révéler comment les populations se redistribuent le long des réseaux.
Les techniques de réduction de dimensionnalité comme l'analyse des composantes principales (APC) et le T-SNE sont également utiles pour visualiser des données historiques à haute dimension. Par exemple, le PCA appliqué aux échantillons d'ADN anciens peut révéler des grappes correspondant aux ondes de migration, tandis que le T-SNE peut montrer comment différentes populations se rapportent les unes aux autres dans l'espace génétique.
Apprentissage du renforcement : Simulation de mouvements basés sur des agents
En RL, un « agent » (représentant un groupe de personnes) apprend une politique pour savoir quand se déplacer en fonction des récompenses environnementales (disponibilité alimentaire, sécurité, liens sociaux). En simulant des milliers d'agents sur plusieurs générations, les chercheurs peuvent tester des hypothèses sur les facteurs de poussée et de traction. Par exemple, un modèle RL peut montrer comment un petit changement de température moyenne peut causer une cascade de délocalisations.
L'avantage de RL par rapport aux modèles traditionnels basés sur les agents est que les agents apprennent des stratégies optimales plutôt que de suivre des règles fixes.Cela permet un comportement émergent qui peut être comparé à des preuves archéologiques. Si la distribution de population simulée correspond au dossier archéologique, il suggère que la structure de récompense intégrée dans le modèle capture le processus de prise de décision réel des personnes historiques.
Étude de cas : Prévoir la migration à partir du bol de poussière
Le American Dust Bowl des années 1930 offre un événement historique bien documenté que ML peut modéliser. À l'aide des données de recensements, des cartes d'érosion des sols et des relevés climatiques des comtés, les chercheurs ont formé un classificateur à gradient pour prédire quels comtés connaîtraient une migration nette. Le modèle a obtenu plus de 85 % de précision sur un ensemble d'essais en attente.
Le cas du Dust Bowl illustre également l'importance de la dynamique temporelle. La migration n'a pas eu lieu tous à la fois mais en vagues correspondant à des échecs successifs des cultures. Un modèle de séries chronologiques qui intègre des variables décalées – comme les précipitations de l'année dernière et l'émigration de l'année précédente – se produit mieux qu'un modèle statique.
Étude de cas: Expansion néolithique vers l'Europe
La propagation de l'agriculture du Proche-Orient en Europe, il y a environ 8 000 ans, est l'un des mouvements de population les plus étudiés en archéologie. Traditionnellement, elle était considérée comme une migration de personnes (diffusion endémique) ou une adoption d'idées (diffusion culturelle).L'apprentissage automatique a fourni de nouvelles preuves pour le modèle de diffusion démicale.
Le modèle a également identifié des régions où l'expansion a ralenti ou inversé, comme les Alpes et la côte de la Baltique.Ces « goulots d'étranglement » correspondaient à des régions où les sols sont pauvres ou où les climats sont rudes, ce qui laisse croire que les facteurs environnementaux étaient plus importants que la résistance culturelle.L'étude 2022 du PNAS[ a mentionné des données génétiques ajoutées précédemment au modèle, montrant que l'arrivée des agriculteurs dans une région était associée à un changement important dans le bassin génique local.
Défis et limites : La grotte de l'historien
Malgré sa promesse, l'application de la LM aux mouvements historiques de population est embarrassée. La première est l'exhaustivité des données et les biais, déjà mentionnés. La seconde est l'agrégation temporelle: les données historiques sont souvent des migrations en bloc au cours de décennies, tandis que les modèles de LM fonctionnent habituellement sur des échelles de temps annuelles ou mensuelles. Une migration qui s'est produite sur dix ans pourrait être mal modélisée en un seul événement.
Un autre problème majeur est l'interprétation[.Un réseau neuronal profond qui prédit la migration avec une précision de 90% pourrait être une boîte noire.Les historiens doivent comprendre pourquoi une prédiction a été faite pour lui faire confiance.Des techniques comme SHAP (explications additives Shapley) et LIME (explications modélisées-agnostiques locales) sont adoptées pour décomposer les prédictions en contributions de caractéristiques.
Les modèles d'apprentissage automatique sont formés sur les données historiques actuelles ou récentes, mais les facteurs qui ont conduit à la migration dans un passé lointain peuvent avoir été fondamentalement différents. Par exemple, la migration moderne est fortement influencée par les frontières de l'État-nation et les systèmes de passeport, qui n'existaient pas dans la période médiévale. Un modèle formé sur les données du XXe siècle ne se généralise peut-être pas au XIVe siècle. Les chercheurs doivent veiller à sélectionner des caractéristiques qui sont historiquement appropriées et à valider des modèles sur des périodes hors échantillon.
Considérations éthiques
L'utilisation de l'apprentissage automatique pour étudier les mouvements de population historiques soulève également des questions éthiques.Les modèles prédictifs peuvent être utilisés de façon abusive pour justifier des politiques restrictives d'immigration ou pour stigmatiser certains groupes comme étant « historiquement migrateurs ». Les historiens ont la responsabilité de communiquer leurs constatations avec nuance et de souligner que la corrélation n'est pas égale à la causalité.
Le danger du présentisme est aussi réel. Il est tentant d'utiliser des modèles historiques de ML pour faire des prédictions sur les migrations futures, mais le passé n'est pas un guide parfait. Le changement climatique, le changement technologique et les changements géopolitiques créent des conditions nouvelles qui ne peuvent pas avoir de précédents historiques. L'utilisation la plus responsable de ces modèles n'est pas de prédire l'avenir mais de comprendre le passé selon ses propres termes, tout en tirant des leçons prudentes pour le présent.
Orientations futures : une approche plus intégrée
L'avenir du ML en démographie historique réside dans plusieurs tendances convergentes. Premièrement, la numérisation des archives continue à un rythme rapide : la base de données FamilySearch détient maintenant plus de 5 milliards d'enregistrements numérisés, dont beaucoup sont dotés de données géographiques intégrées. Deuxièmement, la télédétection (LiDAR, images satellitaires) révèle des modèles de peuplement cachés dans des endroits comme l'Amazonie et l'Asie centrale, fournissant de nouvelles données pour les modèles ML. Troisièmement, des équipes interdisciplinaires – dont des historiens, des informaticiens, des géographes et des archéologues – forment des partenariats pour construire des outils d'outils en libre-service partagés.
Un autre développement passionnant est l'utilisation de modèles de fondation[, de grands modèles pré-formés qui peuvent être adaptés pour des tâches historiques spécifiques. Par exemple, un modèle linguistique formé sur des millions de documents historiques pourrait être adapté pour extraire des informations liées à la migration de textes non structurés. De même, un modèle de vision formé sur des cartes historiques pourrait automatiquement détecter des implantations, des routes et des limites de terrain.
Enfin, il y a la possibilité excitante de faire face à l'histoire par l'intermédiaire du ML. En formant un modèle sur les données historiques et en modifiant une entrée (par exemple, si la Route de la soie n'avait pas décliné?), les chercheurs peuvent générer d'autres scénarios.
L'intégration de la technologie ML avec la technologie numérique jumelle est également à l'horizon. Un jumeau numérique d'une région historique, combinant démographie, économie, environnement et infrastructure, pourrait être utilisé pour simuler les mouvements de population dans différents scénarios. Cela permettrait aux historiens de mener des expériences virtuelles impossibles dans le monde réel.
En conclusion, l'apprentissage automatique ne consiste pas à remplacer les historiens par des algorithmes. Il s'agit d'un complément puissant, qui permet d'élargir la perception humaine à travers les siècles et les continents. Lorsqu'il est appliqué avec soin, il peut révéler des modèles toujours présents dans les données mais invisibles à l'œil nu. La prédiction des mouvements de population historiques est l'une des frontières les plus prometteuses de cette nouvelle histoire numérique, et le travail ne fait que commencer.