study-guides-and-learning-resources
L'application des algorithmes d'apprentissage automatique aux ensembles de données économiques historiques
Table of Contents
Ces techniques avancées permettent aux chercheurs de découvrir des modèles et des idées qui étaient auparavant difficiles à détecter en utilisant des méthodes statistiques traditionnelles, en ouvrant des voies entièrement nouvelles pour comprendre les économies passées, les réseaux commerciaux et les politiques fiscales.En tirant parti du pouvoir de calcul, les chercheurs peuvent maintenant traiter de vastes archives de documents historiques, allant des registres d'impôts anciens aux indices de prix du XIXe siècle, et en tirer des interprétations quantitatives et qualitatives qui étaient autrefois impossibles.
Introduction à l'apprentissage automatique en économie historique
Lorsqu'ils sont appliqués à des données économiques historiques, comme les indices de salaire réels, les volumes de commerce, les prix des produits de base ou les statistiques démographiques, ces algorithmes permettent d'identifier les tendances à long terme, de prévoir les mouvements futurs en fonction des tendances passées et de comprendre l'interaction complexe de facteurs qui ont entraîné des changements économiques au cours des siècles. Contrairement aux modèles économétriques conventionnels qui reposent sur des équations et des hypothèses pré-précisées sur la distribution des données, les algorithmes ML apprennent automatiquement les relations à partir des données elles-mêmes, les rendant particulièrement adaptés aux ensembles de données messeuses, non linéaires et souvent incomplètes qui caractérisent les dossiers économiques historiques.
L'économie historique s'est traditionnellement appuyée sur l'analyse narrative, les régressions simples ou les statistiques descriptives. L'avènement des archives numérisées et de l'informatique à haute performance a toutefois créé une occasion d'appliquer des outils analytiques plus sophistiqués.Les premiers efforts dans les années 1990 ont porté sur l'utilisation des réseaux neuronaux pour prévoir les prix des stocks à l'aide de séries chronologiques historiques. Aujourd'hui, les chercheurs adaptent les systèmes d'apprentissage profond, les forêts aléatoires et supportent les machines vectorielles à des questions aussi diverses que l'impact économique de la Mort noire, l'efficacité des systèmes d'irrigation prémodernes et les moteurs de la croissance de la révolution industrielle.
Types d'algorithmes d'apprentissage automatique utilisés
Enseignement supervisé
Dans l'économie historique, on utilise couramment ces algorithmes pour prédire les indicateurs économiques. Par exemple, à l'aide des données du recensement du 19e siècle sur la propriété foncière, la densité de population et l'infrastructure de transport, un modèle supervisé peut prédire les niveaux de revenu régionaux ou la production agricole. Les algorithmes populaires comprennent la régression linéaire, les arbres de décision, les forêts aléatoires et les machines de stimulation des gradients.
Apprentissage sans supervision
Dans l'économie historique, cette technique est inestimable pour identifier les zones économiques régionales, les blocs commerciaux ou les périodes d'instabilité financière sans hypothèses préalables. Par exemple, les algorithmes de regroupement (p. ex., les moyennes k, les regroupements hiérarchiques) appliqués aux données de distribution des amphores romaines peuvent révéler des régions de marché distinctes à travers la Méditerranée. Les méthodes de réduction de dimensionnalité comme l'analyse des composantes principales (APC) aident à visualiser des données économiques multidimensionnelles complexes, comme l'interaction entre les tarifs, les réformes monétaires et la production industrielle au XIXe siècle.
Renforcement de l'apprentissage
Bien que moins répandus dans l'économie historique, les RL sont de plus en plus souvent appliqués à des processus de prise de décision économique modèles. Par exemple, les chercheurs simulent comment un marchand médiéval pourrait ajuster les routes commerciales en réponse aux fluctuations des tarifs, aux menaces pirates et à la demande. Les agents RL peuvent «apprendre» des stratégies qui reflètent les comportements historiques, fournissant des indications sur la rationalité (ou la rationalité limitée) des acteurs économiques passés. Cette approche a été utilisée pour étudier la dynamique de l'économie transatlantique moderne des premiers temps.
Applications dans l'analyse économique historique
Prédiction de la tendance économique
Les algorithmes formés à l'aide de données économiques historiques peuvent prévoir les conditions futures, mais ils sont aussi utilisés rétroactivement, en prédictant ce qui se serait passé dans des scénarios contrefactuels.En formant des modèles sur des décennies de données sur les prix provenant de différentes régions, les économistes peuvent évaluer si la Grande Dépression était inévitable ou si d'autres politiques auraient pu atténuer sa gravité. Une étude de 2019 dans American Economic Review[ a employé l'apprentissage automatique pour prédire les défaillances bancaires dans les années 1930, démontrant que les indicateurs d'alerte précoce auraient pu être glanés à partir de bilans avec beaucoup plus de précision que les modèles de régression traditionnels.
Reconnaissance du modèle
Les cycles économiques à long terme, comme les vagues de Kondratiev (cycles de 50 à 60 ans) ou les cycles jugliers (7 à 11 ans), peuvent être identifiés automatiquement à partir des séries salariales et des prix. Les algorithmes ML permettent également de repérer des irrégularités qui pourraient indiquer des erreurs de saisie de données, des fraudes ou des événements historiques importants (p. ex., une flambée soudaine des prix due à la guerre). Par exemple, les réseaux neuronaux convolutionnels appliqués aux tableaux numérisés des transactions foncières anglaises du XVIIIe siècle peuvent signaler des ventes anormales qui se corrélent avec des actes d'enclos.
Reconstruction des données
Les données historiques sont souvent incomplètes en raison de la perte d'archives, de documents endommagés ou de conventions d'enregistrement incohérentes. L'apprentissage automatique fournit des outils puissants pour combler les lacunes par la modélisation prédictive. Une technique courante consiste à utiliser un modèle formé sur des régions ou des périodes avec des données complètes pour imputer les valeurs manquantes dans d'autres domaines. Par exemple, étant donné le lien connu entre la densité de population, le climat et les recettes fiscales, un modèle ML peut estimer les recettes fiscales pour des années avec des données manquantes.
Problèmes liés au prétraitement des données
Les données historiques arrivent rarement dans un format propre et prêt à la machine. Le prétraitement est souvent la partie la plus exigeante en main-d'oeuvre d'un projet.
- Qualité des données: Les données historiques peuvent être incomplètes, incohérentes ou biaisées. Par exemple, les données de recensement des époques coloniales sous-estiment souvent certaines populations.Les valeurs manquantes, les entrées en double et les erreurs de transcription sont fréquentes.
- Dépendances temporelles:[ Les données économiques dépendent intrinsèquement du temps. Les modèles standard ML supposent des données indépendantes et distribuées de façon identique (i.e.d.) – une hypothèse violée par des séries chronologiques.
- Unité d'analyse:[ Les documents historiques utilisent différentes devises, pondérations et mesures. Les unités de standardisation (p. ex., conversion de toutes les valeurs monétaires en une monnaie commune à l'aide d'ajustements à l'inflation) sont essentielles, mais elles sont assorties d'hypothèses sur le pouvoir d'achat relatif.
- Normalisation et calibrage :[ Les caractéristiques doivent être écalées pour éviter que les modèles ne soient dominés par des variables à plus grandes plages numériques. La standardisation Z-score ou l'échelle min-max sont typiques, mais le choix peut affecter l'interprétation des modèles.
Études de cas
L'apprentissage automatique et la grande dépression
L'une des applications les plus étudiées est l'analyse de la Grande Dépression (1929-1941).Les chercheurs ont appliqué des forêts aléatoires pour prédire les défaillances bancaires à l'aide des données du bilan recueillies par la Réserve fédérale.Le modèle a identifié les ratios de levier et les concentrations de dépôts comme les caractéristiques les plus prédictives – dépassant l'analyse discriminante linéaire traditionnelle.Ceci non seulement valide les comptes historiques, mais fournit également des preuves quantitatives pour les recommandations stratégiques. Un document 2022 publié dans le Quarterly Journal of Economics] a utilisé des machines de stimulation des gradients pour classer les comtés américains par leur vitesse de récupération, révélant que la diversification agricole antérieure était un facteur de prédiction plus important que les dépenses du Nouveau pacte, ce qui remet en question les récits historiques classiques.
Modéliser l'économie romaine
L'économie romaine, qui s'étend sur plusieurs siècles et sur une vaste zone géographique, offre un ensemble de données riche mais notoirement peu abondante. L'apprentissage automatique a été utilisé pour estimer le PIB par habitant en utilisant des variables de substitution comme les nombres de naufrages, les inscriptions de bâtiments et les niveaux de pollution par le plomb des carottes de glace. Une étude historique a utilisé la régression du processus gaussien pour interpoler ces approximations dans le temps et dans l'espace, produisant les premières estimations annuelles du PIB pour l'Empire romain à l'échelle continentale de 200 à 500 °C. Le modèle a révélé un pic d'activité économique vers la fin du 2e siècle CE, plus tôt que prévu, et un déclin rapide pendant la crise du 3e siècle.
Découverte du modèle commercial médiéval
L'apprentissage non supervisé a été utilisé pour analyser des milliers de disques de la Ligue hanséatique (XIIIe-XVIIe siècles). Les algorithmes de regroupement appliqués aux registres douaniers et aux lettres de marchand décelaient automatiquement des blocs commerciaux, tels que l'association entre Lübeck, Hambourg et les villes baltes. Les regroupements de l'algorithme correspondaient étroitement aux comptes historiques, ce qui valide la méthode. Plus intéressant encore, le modèle a identifié une route commerciale précédemment négligée reliant les Pays-Bas à Novgorod via la Vistula River, qui n'avait pas été importante dans la littérature secondaire.
Considérations éthiques et contexte historique
Par exemple, si les registres fiscaux sous-estiment systématiquement l'activité économique des femmes ou des personnes asservises, les modèles ML « apprendront » que ces groupes ont moins contribué à renforcer des récits historiques inexacts. L'interpretation est une autre préoccupation majeure. Les modèles complexes comme les réseaux neuraux profonds sont souvent des « boîtes noires », ce qui rend difficile de comprendre pourquoi une prédiction particulière a été faite.
Les modèles surconfiance peuvent produire des corrélations fallacieuses, comme l'établissement d'un lien entre la croissance économique de l'Angleterre du XVIIIe siècle et le nombre de frappes éclair, qui sont statistiquement significatives mais n'ont pas de sens historique. La validation croisée rigoureuse, les essais hors échantillon et l'incorporation de sources auxiliaires (p. ex., preuves archéologiques) sont nécessaires pour atténuer ces risques. De plus, la dimension éthique de l'histoire algorithmique de la « réécriture » doit être prise en considération. Comme le soutient Hilary Davidson ]Histoire algorithmique, nous devons éviter de traiter les extrants de ML comme définitifs; ils sont des outils pour générer des hypothèses, non pour les confirmer sans jugement humain.
Orientations futures
Les progrès dans le domaine de la puissance informatique, de la numérisation et des techniques algorithmiques promettent d'améliorer encore l'application de l'apprentissage automatique en économie historique.La disponibilité croissante de ensembles de données à grande échelle, liés, comme l'initiative ], permettra aux chercheurs de former des modèles sur des milliers de variables au fil des siècles.
Les méthodes d'analyse des impacts (XAI) explicables, comme SHAP (SHapley Additive exPlanations) et LIME (Local Interpretable Model-agnostic Explications), gagnent en traction, permettant aux historiens de comprendre quelles caractéristiques conduisent à des prédictions, ce qui est essentiel pour établir la confiance et permettre une interprétation critique.
Conclusion
L'apprentissage automatique n'est pas une baguette magique qui résoudra tous les problèmes de l'économie historique, mais elle est un complément puissant à la trousse de l'historien. Appliquées avec soin – en tenant compte de la qualité des données, de l'interprétation des modèles et de la collaboration entre disciplines – elle peut révéler des corrélations, générer de nouvelles hypothèses et enrichir notre compréhension des systèmes économiques passés. Les études citées dans cet article illustrent l'ampleur des applications, de la prédiction des défaillances bancaires pendant la Grande Dépression à la reconstruction du PIB romain et à la découverte des itinéraires commerciaux médiévaux perdus.