Machine learning algoritmes zijn de manier waarop historici en economen analyseren historische economische gegevens. Deze geavanceerde technieken stellen onderzoekers in staat om patronen en inzichten die voorheen moeilijk te detecteren waren met behulp van traditionele statistische methoden te ontdekken, het openen van volledig nieuwe wegen voor het begrijpen van vroegere economieën, handelsnetwerken en fiscale beleid. Door het benutten van rekenkracht, kunnen wetenschappers nu enorme archieven van historische records verwerken die variëren van oude belastingboeken tot 19e-eeuwse prijsindexen en leiden kwantitatieve en kwalitatieve interpretaties die ooit onmogelijk waren. Dit artikel onderzoekt de toepassingen, methoden, uitdagingen en het toekomstige potentieel van machine learning in historische economie, het verstrekken van een uitgebreid overzicht voor onderzoekers, onderwijsers en studenten.

Inleiding tot Machine learning in Historische Economie

Machine learning (ML) is een subset van kunstmatige intelligentie die trainingsalgoritmen omvat om patronen binnen grote datasets te herkennen. Wanneer toegepast op historische economische gegevens zoals reële loonindices, handelsvolumes, grondstoffenprijzen of demografische statistieken helpen deze algoritmes bij het identificeren van langetermijntrends, voorspellen toekomstige bewegingen op basis van verleden patronen, en begrijpen van de complexe samenspel van factoren die economische veranderingen door eeuwen heen gedreven. In tegenstelling tot conventionele econometrische modellen die vertrouwen op vooraf gespecificeerde vergelijkingen en aannames over gegevensdistributie, ML algoritmen automatisch leren relaties van de gegevens zelf, waardoor ze bijzonder geschikt voor de rommelige, niet-lineaire, en vaak onvolledige datasets die karakteriseren historische economische records.

Historische economie heeft traditioneel gebaseerd op narratieve analyse, eenvoudige regressies of beschrijvende statistieken. De komst van gedigitaliseerde archieven en high-performance computing heeft echter een kans gecreëerd om meer geavanceerde analytische instrumenten toe te passen. Vroeg in de jaren negentig waren de inspanningen gericht op het gebruik van neurale netwerken om aandelenprijzen te voorspellen met behulp van historische tijdreeksen. Vandaag passen onderzoekers diep leren, willekeurige bossen aan en ondersteunen vectormachines om vragen te stellen die zo divers zijn als de economische impact van de Zwarte Dood, de efficiëntie van premoderne irrigatiesystemen en de drijvende krachten van industriële revolutiegroei. Zie voor een overzicht van het bredere gebied van de computergeschiedenis het werk van ] Digital humanities academicis op Nature[].

Types van machine learning algoritmen gebruikt

Leren onder toezicht

In de historische economie wordt dit vaak gebruikt voor het voorspellen van economische indicatoren. Bijvoorbeeld, met behulp van 19e-eeuwse volkstellingsgegevens over grondbezit, bevolkingsdichtheid en vervoersinfrastructuur, kan een gecontroleerd model regionale inkomensniveaus of landbouwoutput voorspellen. Populaire algoritmen omvatten lineaire regressie, beslissingsbomen, willekeurige bossen en gradiëntstimulansmachines. Een opmerkelijk geval is het gebruik van historische weers- en oogstgegevens om graanprijsschommelingen in middeleeuws Europa te voorspellen.

Niet-gesuperviseerde leren

Onbeheerste leer vindt verborgen structuren of clusters binnen datasets waar geen labels worden verstrekt. In historische economie is deze techniek van onschatbare waarde voor het identificeren van regionale economische zones, handelsblokken, of perioden van financiële instabiliteit zonder voorafgaande aannames. Bijvoorbeeld, clustering algoritmes (bijv. k-means, hiërarchische clustering) toegepast op Romeinse amfora distributie gegevens kunnen onderscheiden marktregio's in de Middellandse Zee onthullen. Dimensionaliteit reductie methoden zoals belangrijkste component analyse (PCA) helpen visualiseren complexe multi-dimensionale economische gegevens, zoals het samenspel tussen tarieven, valuta hervormingen en industriële output in de 19e eeuw. Recente werkzaamheden door economen bij PNAS[] heeft onbeheerd leren gebruikt om handelsnetwerken te reconstrueren van oude scheepswrak vracht manifesten.

Versterking van het leren

Bij het versterken van het leren (RL) is een agent betrokken die optimale acties leert door middel van trial en error door het maximaliseren van cumulatieve beloning. Hoewel minder gebruikelijk in de historische economie, wordt RL steeds vaker toegepast op het model van economische besluitvormingsprocessen. Zo simuleren onderzoekers hoe een middeleeuwse handelaar handelsroutes kan aanpassen in reactie op fluctuerende tarieven, piratendreigingen en vraag. RL-agenten kunnen strategieën "leren" die historisch gedrag weerspiegelen, wat inzicht geeft in de rationaliteit (of begrensde rationaliteit) van vroegere economische actoren. Deze aanpak is gebruikt om de dynamiek van de vroege moderne trans-Atlantische economie te bestuderen.

Toepassingen in de historische economische analyse

Algoritmes die zijn opgeleid op historische economische gegevens kunnen toekomstige omstandigheden voorspellen, maar ze worden ook gebruikt zonder vooruit te lopen op wat er zou zijn gebeurd onder contra-invloed scenario's. Door modellen te trainen op tientallen jaren prijsgegevens uit verschillende regio's, kunnen economen beoordelen of de Grote Depressie onvermijdelijk was of of alternatieve beleidsmaatregelen de ernst ervan zouden kunnen hebben verminderd. [Een 2019 studie in de Amerikaanse Economische Review[] ] gebruikte machine leren bankfaillissementen te voorspellen in de jaren '30, waaruit blijkt dat vroege waarschuwingsindicatoren uit balansen met veel hogere nauwkeurigheid dan traditionele regressiemodellen konden zijn uitgevonden.

Patroonherkenning

Het detecteren van cycli, schokken of anomalieën in historische gegevenssets is een kernkracht van ML. Lange termijn economische cycli . . zoals de Kondratiev golven (50.060 jaar cycli) of Juglar cycli (7.011 jaar) . .kan automatisch worden geïdentificeerd uit loon en prijs series . ML algoritmen ook onregelmatigheden die kunnen wijzen op gegevensinvoer fouten , fraude , of significante historische gebeurtenissen (bijv . een plotselinge prijs piek als gevolg van oorlog . Bijvoorbeeld , convolutionaire neurale netwerken toegepast op gedigitaliseerde tabellen van 18e-eeuwse Engelse land transacties kunnen vlag anomanous verkoop die te maken met behuizing handelingen . In het gebied van macro-economische , onbeheerde leren heeft geholpen wetenschappers date bedrijfscycli terug naar de 16e eeuw .

Gegevensreconstructie

Historische records zijn vaak onvolledig als gevolg van verloren archieven, beschadigde documenten, of inconsistente registratie conventies. Machine learning biedt krachtige instrumenten voor het vullen van hiaten door voorspellende modellering. Een gemeenschappelijke techniek is om een model te gebruiken dat is opgeleid op regio's of perioden met volledige gegevens om ontbrekende waarden op andere gebieden toe te rekenen. Bijvoorbeeld, gezien de bekende relatie tussen bevolkingsdichtheid, klimaat, en belastinginkomsten, een ML-model kan belastinginkomsten voor jaren met ontbrekende records schatten. Diepe leermethoden, zoals generatieve adversariale netwerken (GAN's), zijn voorgesteld voor het reconstrueren van continue tijdreeksen uit schaarse observaties. Dit proces verrijkt niet alleen datasets, maar maakt ook robuuste statistische interpretatie mogelijk. Echter, onderzoekers moeten voorzichtig zijn om te voorkomen dat het invoeren van artefacts een punt besproken in de uitdagingen hieronder.

Voorverwerkingsuitdagingen

Historische gegevens komen zelden in een schoon, machine-klaar formaat. Voorbewerking is vaak het meest arbeidsintensieve deel van een project. Belangrijkste uitdagingen zijn:

  • Gegevenskwaliteit: Historische gegevens kunnen onvolledig, inconsistent of bevooroordeeld zijn. Bijvoorbeeld, tellingsrecords uit koloniale tijdperken vaak ondertellen bepaalde populaties. Ontbrekende waarden, dubbele vermeldingen, en transcriptie fouten zijn gebruikelijk. Robuuste voorverwerking pijpleidingen moeten deze problemen behandelen, vaak door middel van een combinatie van domeinkennis en geautomatiseerde reinigingstechnieken.
  • Temporele afhankelijkheden: Economische gegevens zijn inherent tijdafhankelijk. Standaard ML-modellen veronderstellen onafhankelijke en identieke gedistribueerde (i.i.d.) gegevens die door tijdreeksen geschonden worden. Gespecialiseerde architecturen zoals lange korte termijn geheugen (LSTM) netwerken of transformatoren zijn vereist om autocorrelatie en seizoensgebondenheid te vangen.
  • Eenheid van analyse: Historische gegevens gebruiken verschillende valuta's, gewichten en maten. Standaardiserende eenheden (bijvoorbeeld, het omzetten van alle monetaire waarden in een gemeenschappelijke valuta met behulp van inflatieaanpassingen) is essentieel, maar vol met aannames over relatieve koopkracht.
  • Normalisatie en Scaleling: Eigenschappen moeten worden geschaald om te voorkomen dat modellen worden gedomineerd door variabelen met grotere numerieke bereiken. Z-score standaardisatie of min-max schaalverdeling zijn typisch, maar de keuze kan de interpreteerbaarheid van het model beïnvloeden.

Case studies

Machine learning en de Grote Depressie

Een van de meest intensief bestudeerde toepassingen is de analyse van de Grote Depressie (1929/1941). Onderzoekers hebben willekeurige bossen toegepast om bankfaillissementen te voorspellen met behulp van balansgegevens verzameld door de Federal Reserve. Het model identificeerde hefboomratio's en depositoconcentraties als de meest voorspellende kenmerken die de traditionele lineaire discriminerende analyse uitvoeren. Dit valideert niet alleen historische rekeningen maar biedt ook kwantitatieve bewijzen voor beleidsaanbevelingen. Een 2022-papier in de ]Quarterly Journal of Economics[] gebruikt gradiënt stimulerende machines om de Amerikaanse provincies te classificeren door hun herstelsnelheid, waaruit blijkt dat voorafgaande agrarische diversificatie een sterkere voorspeler was dan New Deal uitgaven.

Modellering van de Romeinse economie

De Romeinse economie, die een aantal eeuwen en een uitgestrekt geografisch gebied beslaat, biedt een rijke maar beruchte schaarse dataset. Machine learning is gebruikt om het BBP per hoofd van de bevolking te schatten met behulp van proxy variabelen zoals scheepswraktellingen, bouwinscripties en loodvervuilingsniveaus van ijskernen. Een landmark studie gebruikte Gaussiaanse proces regressie om deze proxies interpoleren in tijd en ruimte, produceren van de eerste continent-brede jaarlijkse BBP schattingen voor het Romeinse Rijk van 200 voor Christus tot 500 voor Christus. Het model onthulde een piek in de economische activiteit rond de late 2e eeuw CE . Eerder dan eerder veronderstelde . en een snelle daling tijdens de Crisis van de Derde Centurie. Deze toepassing toont hoe ML kan nieuwe empirische bewijs uit fragmentaire records genereren, hoewel de onzekerheid intervallen blijven breed.

Middeleeuwse handelspatroon Ontdekking

Het onbeheersbare leren is gebruikt om duizenden records uit de Hanzetijdse Liga te analyseren (13e 17e eeuw). Het clusteren van algoritmes toegepast op douaneboeken en handelsbrieven ontdekte automatisch handelsblokken, zoals de associatie tussen Lübeck, Hamburg en Baltische steden. De clusters van het algoritme nauw afgestemd historische accounts, de validering van de methode. Interessanter, het model identificeerde een eerder over het hoofd geziene handelsroute die Nederland met Novgorod via de Vistula rivier, die niet prominent in de secundaire literatuur was geweest. Follow-up archiefonderzoek bevestigde het bestaan van een kleine maar actieve handelscorridor. Dit geval benadrukt het vermogen van ML om nieuwe historische inzichten uit grootschalige digitale archieven te boven te brengen.

Ethische overwegingen en historische context

Het toepassen van machine learning op de geschiedenis is niet zonder valkuilen. Modellen kunnen blijven vooringenomenheden aanwezig in de brongegevens. Bijvoorbeeld, als belastinggegevens systematisch onder de melding van de economische activiteit van vrouwen of tot slaaf gemaakt mensen, ML modellen zullen "leren" dat deze groepen bijgedragen minder aan het herstellen van onjuiste historische verhalen. Vertolking is een andere belangrijke zorg. Complexe modellen zoals diepe neurale netwerken zijn vaak "zwarte dozen," waardoor het moeilijk te begrijpen waarom een bepaalde voorspelling werd gemaakt. Voor historisch onderzoek, verklarende macht is net zo belangrijk als voorspellende nauwkeurigheid. Domain experts moeten nauw samenwerken met data wetenschappers om ervoor te zorgen dat modellen uit te stemmen met historische kennis en dat eventuele verrassende resultaten kritisch worden geëvalueerd.

Overpassen is een constant risico, vooral bij het gebruik van kleine historische datasets. Overmoedige modellen kunnen leiden tot ongewenste correlaties. Zoals het koppelen van economische groei in 18e-eeuwse Engeland aan het aantal blikseminslagen .Die statistisch significant maar historisch zinloos zijn. Relaxerende kruisvalidatie, out-of-sample testen, en de integratie van hulpbronnen (bijvoorbeeld archeologisch bewijs) zijn noodzakelijk om deze risico's te beperken. Daarnaast moet de ethische dimensie van algoritmische "herschrijven" geschiedenis worden overwogen. Zoals Hilary Davidson stelt in ]Algoritmische geschiedenis[, moeten we voorkomen dat ML-outputs als definitief worden behandeld; ze zijn instrumenten voor het genereren van hypothesen, niet voor het bevestigen ervan zonder menselijk oordeel.

Toekomstige aanwijzingen

Vooruitgang in rekenkracht, digitalisering en algoritmische technieken beloven de toepassing van machine learning in historische economie verder te verbeteren. De groeiende beschikbaarheid van grootschalige, gekoppelde sets zoals het Global Historical Datasets initiatief zal onderzoekers toelaten om modellen te trainen op duizenden variabelen door de eeuwen heen. We verwachten ook dat de integratie van ML met natuurlijke taalverwerking (NLP) gestructureerde economische gegevens uit ongestructureerde teksten (bijvoorbeeld koopbrieven, parlementaire debatten, kranten) zal extraheren. Dit zou bijvoorbeeld automatisch sentimentsindices van het bedrijfsvertrouwen kunnen opbouwen uit 18e-eeuwse Londense kranten.

Uitlegbare AI (XAI) methoden, zoals SHAP (SHapley Additive exPlanations) en LIME (Lokale Interpretable Model-agnostische Uitleg) krijgen tractie, waardoor historici kunnen begrijpen welke functies aandrijfvoorspellingen. Dit is essentieel voor het opbouwen van vertrouwen en het mogelijk maken van kritische interpretatie. Versterking leren in combinatie met agent-gebaseerde modellen kunnen wetenschappers toelaten om "wat als" scenario's te simuleren, zoals hoe verschillende monetaire beleid zou kunnen hebben veranderd de koers van de Romeinse inflatiecrisis. Ten slotte, de opkomst van digitale geesteswetenschappen afdelingen en cross-disciplinair trainingsprogramma's zorgt ervoor dat toekomstige historici zal worden uitgerust met zowel ML vaardigheden en traditionele archivale expertise.

Conclusie

Machine learning is geen toverstaf die alle problemen in de historische economie zal oplossen, maar het is een krachtige toevoeging aan de toolkit van de historicus. Wanneer toegepast doordacht . Met aandacht voor datakwaliteit, modelinterpreteerbaarheid en samenwerking tussen disciplines . het kan correlaties ontdekken , nieuwe hypothesen genereren en verrijken ons begrip van vroegere economische systemen . De studies genoemd in dit artikel illustreren de breedte van toepassingen , van het voorspellen bank mislukkingen tijdens de Grote Depressie tot het reconstrueren van het Romeinse bbp en het ontdekken van verloren middeleeuwse handelsroutes . Naarmate datasets groeien en algoritmes verbeteren , zal het potentieel om onze kennis van historische economische dynamiek te verdiepen zal alleen toenemen . Onderwijsers en studenten kunnen profiteren van het begrijpen hoe deze technologieën het veld te hervormen , het bieden van nieuwe perspectieven en onderzoekskansen die de kwantitatieve en kwalitatieve te overbruggen . De toekomst van historische economie ligt niet in het vervangen van traditionele methoden maar in het vergroten van hen met de analytische kracht van machine learning .