historical-analysis-and-study-techniques
Les défis de la rareté des données et de la qualité dans la recherche en matière de climatologie
Table of Contents
La recherche cliométrique – l'application de méthodes quantitatives à l'histoire économique – a révolutionné notre compréhension du développement économique à long terme, du changement institutionnel et des racines de la prospérité moderne. En coutant ensemble des siècles de séries de prix, de recensements, de registres commerciaux et de rouleaux fiscaux, les cliométries testent des hypothèses que les historiens qualitatifs ne peuvent débattre que. Pourtant, sous les élégantes régressions et simulations contrefactuelles se trouve un défi persistant et souvent sous-estimé : les deux problèmes de rareté de données et qualité de données[. Sans données historiques fiables, même les modèles économétriques les plus sophistiqués produisent des inférences trompeuses.
La nature de la rareté des données dans la recherche économique historique
La rareté des données en cliométrie n'est pas seulement une question de petite taille, mais aussi de l'incomplétude fondamentale des données historiques : les gouvernements ne recueillaient pas toujours les statistiques dont nous avons besoin, les guerres, les incendies et la désintégration bureaucratique détruisaient les archives, et les conventions d'enregistrement étaient inégales entre les régions et les époques.
Sources de la rareté
- Perte physique : La Bibliothèque d'Alexandrie n'est que l'exemple le plus célèbre. Des milliers de registres paroissiaux, de registres marchands et de documents d'État ont péri par le feu, l'inondation, la négligence ou la destruction délibérée (p. ex., le bombardement de 1943 de Naples a détruit des siècles de données commerciales médiévales).
- Survie sélective: Les registres qui survivent favorisent souvent les alphabétisés, les riches, les urbains et les hommes. Les paysans, les femmes et les populations indigènes ne semblent que de façon intermittente – voire intermittente – créer des écarts systématiques qui peuvent biaiser les analyses économiques du bien-être ou de l'inégalité.
- Modifications des limites administratives :[ Une municipalité qui fusionne, divise ou change de nom au fil des siècles rend les panneaux longitudinaux presque impossibles sans référence géoscientifique et harmonisation.
- Faible fréquence de mesure:[ La plupart des statistiques prémodernes ont été recueillies à intervalles irréguliers – parfois toutes les décennies, parfois une fois par siècle.
Ces cicatrices forcent les cliométriques à adopter ce qu'on pourrait appeler une épistémologie pragmatique : travailler avec les meilleures preuves disponibles tout en reconnaissant ouvertement ses lacunes. Les ensembles de données résultantes sont souvent des panneaux déséquilibrés ou des sections transversales avec de nombreuses cellules manquantes, ce qui complique l'utilisation de techniques économétriques standard.
Conséquences de la rareté des modèles économiques
Lorsque des variables manquent, les chercheurs peuvent recourir à variables de proxy[ qui ne reflètent que faiblement le concept d'intérêt. Par exemple, en utilisant le nombre de gares comme substitut de l'intégration du marché, ils ignorent le transport routier et fluvial. Ils peuvent aussi laisser tomber les observations avec des données manquantes, en réduisant la taille de l'échantillon et en introduisant potentiellement un biais de sélection.
Les chercheurs supposent souvent que les données manquantes sont manquantes au hasard, sous réserve de l'existence de données observables, une revendication rarement défendable dans des contextes historiques. Le résultat est que de nombreuses découvertes cliométriques viennent avec de larges intervalles de confiance et une grande sensibilité aux spécifications – un fait que les historiens non techniques se trompent parfois pour la faiblesse méthodologique plutôt que pour l'incertitude honnête.
La dimension qualité : erreur, partialité et incompatibilité
Même lorsque les données historiques survivent, leur qualité est loin d'être garantie. La qualité des données englobe l'exactitude, la cohérence, l'exhaustivité et l'absence de biais systématiques. Des sources historiques ont été créées à des fins administratives, fiscales ou juridiques, et non à des fins d'analyse scientifique moderne.
Formes communes de mauvaise qualité des données
- Erreurs de transcription: Les livres manuscrits sont sujets à une mauvaise lecture; une étude a révélé que les commis des usines britanniques du XIXe siècle ont mal compté la production de 5 à 10 %. Lorsqu'ils sont numérisés par reconnaissance optique de caractères (OCR), les polices historiques introduisent d'autres erreurs – par exemple, -1642 , devient - 164Z , .
- Des définitions changeantes:[ La catégorie -urban , peut avoir changé de 2000 habitants en 1800 à 10 000 en 1900. -Les prix du blé pourraient exclure les coûts de transport dans une archive mais les inclure dans une autre. De telles incohérences peuvent générer des ruptures structurelles fantômes.
- L'accumulation et l'accumulation:[ L'accumulation d'âge – la tendance à signaler l'âge se terminant en 0 ou 5 – est notoire dans les données de recensement du XIXe siècle, en biaisant les estimations démographiques.
- Pratice de sélection:[ Les tribunaux ont enregistré des crimes, mais pas des infractions non déclarées. Les évaluations fiscales ont omis les ménages les plus pauvres.Les journaux couvraient des événements dramatiques, pas le commerce quotidien.
- Unités de mesure: Un --bushel variait selon la marchandise et la région; --livres sterling , changé en teneur en argent au cours des siècles. Sans conversion métrologique soigneuse, les séries de prix deviennent non comparables.
L'effet cumulatif de ces questions de qualité est erreur de mesure[, qui biaise les coefficients de régression vers zéro (erreurs classiques dans les variables) ou dans des directions imprévisibles (erreur non classique). Par exemple, les estimations du revenu par habitant basées sur des données sur les salaires en grande partie urbains surestimeront le revenu national si le secteur rural est sous-représenté.
Les préjugés dans le domaine du maintien des dossiers historiques
Les administrateurs coloniaux, par exemple, ont souvent déclaré des recettes fiscales gonflées pour plaire à leurs supérieurs. L'enregistrement des terres dans de nombreuses sociétés excluait les femmes ou la propriété communautaire, rendant impossible la reconstruction d'une véritable distribution des actifs. Les inspecteurs des usines du XIXe siècle se sont concentrés sur les grandes usines, ignorant les petits ateliers. Ces biais ne sont pas aléatoires; ils sont corrélés avec les phénomènes économiques très précis que les cliométriques souhaitent étudier, comme l'inégalité, la capacité d'État et l'industrialisation.
L'exemple classique est le débat --Grande divergence : les premières estimations cliométriques du PIB chinois d'avant 1800 étaient basées sur des données de prix standard européens, mais les travaux ultérieurs utilisant les rouleaux d'impôts de la dynastie Ming ont révélé des niveaux beaucoup plus élevés de productivité agricole, remettant en question le récit d'une économie asiatique stagnante. La qualité des données, en ce sens, n'est pas seulement un problème technique mais une question historiographique.
Stratégies pour atténuer les problèmes de rareté et de qualité
Les cliométriques ont développé une riche trousse d'outils pour relever ces défis. Le choix de la stratégie dépend de la nature de la carence ou de l'erreur et de la question de recherche.
Imputation des données et imputation multiple
Lorsque les points de données sont manquants mais que le patron est aléatoirement conditionnel aux observations observables, l'imputation peut combler les lacunes. L'imputation unique (par exemple, en remplaçant les valeurs manquantes par la moyenne ou la dernière observation) est simple mais réduit artificiellement la variance. La cliométrie moderne utilise de plus en plus l'imputation multiple (MI)[, qui crée plusieurs ensembles de données terminés plausibles, effectue des analyses sur chacun et combine des estimations avec les règles Rubin=s. L'IM est bien adapté aux panneaux historiques où la disparition est monotonique (p. ex., un pays= PIB non enregistré avant 1820).
Vérification croisée et triangulation
Avant toute correction statistique, les chercheurs devraient procéder à une vérification croisée des données par rapport à des sources indépendantes. Par exemple, une série de prix provenant d'un grand livre marchand peut être vérifiée par rapport aux registres municipaux du marché, aux rapports de journaux et même aux manifestes de navires. La triangulation révèle des erreurs de transcription, expose des biais locaux et parfois découvre des points de données entièrement nouveaux.
Modèles statistiques robustes
Certaines techniques économétriques sont intrinsèquement robustes aux imperfections des données. Les variables instrumentales (IV) peuvent corriger pour l'erreur de mesure dans un régresseur clé, à condition qu'un instrument valide existe. ]Les effets fixes absorbent des erreurs inobservables dans le temps (p. ex., biais persistants de collecte de données dans un village donné). Les erreurs standard de bootstrap et Les estimations bayesiennes permettent aux chercheurs d'incorporer l'incertitude quant à la non-perception dans les intervalles de confiance.
Apprentissage automatique et progrès de la numérisation
La reconnaissance optique des caractères (OCR) est devenue plus précise pour les polices historiques, et la reconnaissance de la rédaction (HTR)[ peut maintenant transcrire des manuscrits cursifs avec des taux d'erreur inférieurs à 10%, permettant la numérisation de masse des rapports de recensement et des registres paroissiaux. [Le traitement des langues naturelles (NLP)[] extrait des données structurées de textes historiques non structurés (p. ex., citations de prix provenant de journaux). Les algorithmes de couplage des enregistrements[[ – basés sur l'apprentissage automatique – peuvent correspondre à des individus à travers les recensements, créant des panneaux longitudinaux à partir de sections transversales répétées.Ces outils réduisent la rareté (en déverroulant des archives auparavant inaccessibles) et la qualité (en standardisant des sources hétérogènes).
Analyse de sensibilité et réplication
Compte tenu de la fragilité des données historiques, l'analyse de sensibilité[ doit être obligatoire. Les chercheurs peuvent tester comment les résultats changent lorsque les valeurs manquantes sont imputées à différents algorithmes, lorsque les valeurs aberrantes sont parés, ou lorsque l'échantillon est limité à des sous-ensembles de haute qualité. La déclaration de plusieurs spécifications – une approche -multi-modèles – permet aux lecteurs de mesurer la robustesse des conclusions. Le mouvement de la réplication en cliométrie a également amélioré la qualité : de nombreuses revues exigent maintenant des dépôts de données et de codes, permettant à d'autres chercheurs de découvrir des erreurs ou de tester d'autres hypothèses.
Étude de cas: Reconstruire la croissance du PIB dans les premières années de l'Angleterre moderne
Pour voir ces défis et ces stratégies en action, envisagez la reconstruction du PIB anglais de 1600 à 1800. Les premiers travaux cliométriques de W. A. Cole et Phyllis Deane ont puisé dans des données douanières dispersées, des estimations de la production agricole et des données salariales, mais ont été confrontés à une grave pénurie : il n'existait pas de comptes nationaux systématiques avant 1855.
- Numérisation de milliers d'inscriptions de registres paroissiaux pour la production agricole (en utilisant le HTR pour l'écriture).
- Données de production industrielle croisées provenant des dossiers d'affaires Quaker (de haute qualité) avec déclarations de taxe d'accise (systémiques mais éventuellement éludées).
- Utiliser plusieurs imputations pour combler les lacunes au cours des années où les dossiers portuaires de Londres ont été détruits dans le Grand Feu de 1666.
- Appliquer des modèles de facteurs dynamiques bayésiens pour lisser les séries de prix erratiques.
L'ensemble de données qui en résulte révèle que la croissance du PIB par habitant de l'anglais a été régulière mais modeste (~0,3 % par an) au cours du XVIIe siècle, et non la stagnation qu'on avait supposée.
Orientations futures
En ce qui concerne les données, trois évolutions promettent de réduire la rareté des données et les charges de qualité en cliométrie. Premièrement, des initiatives de numérisation à grande échelle – comme la plateforme Transtribus[ des manuscrits historiques – rendent les sources rares lisibles par machine à une échelle sans précédent. Deuxièmement, des liens d'enregistrement probabilistes et des algorithmes de résolution d'entité[ permettront aux chercheurs de fusionner des ensembles de données entre les régions et les siècles, créant des panneaux plus riches.
Pourtant, la technologie ne peut à elle seule se substituer aux connaissances [ du domaine[. Comprendre pourquoi une archive particulière a été créée – qui l'a financée, quelles pressions politiques existaient, quels groupes étaient exclus – reste essentiel pour évaluer la qualité des données.
Conclusion
La rareté des données et la qualité des données ne sont pas des nuisances périphériques dans la recherche cliométrique; elles sont au cœur de la validité de toutes les allégations sur l'histoire économique. La rareté oblige les chercheurs à travailler avec des échantillons incomplets et non aléatoires; les problèmes de qualité introduisent des erreurs et des biais qui peuvent renverser les conclusions. En adoptant des techniques d'imputation rigoureuses, des sources de vérification croisée, en exploitant des méthodes statistiques robustes et en tirant parti de nouveaux outils de numérisation, les cliométriques peuvent atténuer ces problèmes – mais ne jamais les éliminer.