Study Guides & Lernressourcen
Die Anwendung von Algorithmen des maschinellen Lernens auf historische Wirtschaftsdatensätze
Table of Contents
Machine-Learning-Algorithmen verändern die Art und Weise, wie Historiker und Ökonomen historische Wirtschaftsdaten analysieren. Diese fortschrittlichen Techniken ermöglichen es Forschern, Muster und Erkenntnisse aufzudecken, die zuvor mit traditionellen statistischen Methoden schwer zu erkennen waren, und eröffnen völlig neue Wege zum Verständnis vergangener Volkswirtschaften, Handelsnetzwerke und Steuerpolitik. Durch die Nutzung von Rechenleistung können Wissenschaftler nun riesige Archive historischer Aufzeichnungen verarbeiten - von alten Steuerbüchern bis hin zu Preisindizes des 19. Jahrhunderts - und quantitative und qualitative Interpretationen ableiten, die einst unmöglich waren. Dieser Artikel untersucht die Anwendungen, Methoden, Herausforderungen und das zukünftige Potenzial des maschinellen Lernens in der historischen Ökonomie und bietet einen umfassenden Überblick für Forscher, Pädagogen und Studenten gleichermaßen.
Einführung in das maschinelle Lernen in der historischen Ökonomie
Machine Learning (ML) ist eine Teilmenge künstlicher Intelligenz, die Algorithmen dazu trainiert, Muster in großen Datensätzen zu erkennen. Wenn sie auf historische Wirtschaftsdaten wie Reallohnindizes, Handelsvolumina, Rohstoffpreise oder demografische Statistiken angewendet werden, helfen diese Algorithmen, langfristige Trends zu identifizieren, zukünftige Bewegungen basierend auf vergangenen Mustern vorherzusagen und das komplexe Zusammenspiel von Faktoren zu verstehen, die wirtschaftliche Veränderungen über Jahrhunderte hinweg angetrieben haben. Im Gegensatz zu herkömmlichen ökonometrischen Modellen, die auf vordefinierten Gleichungen und Annahmen über die Datenverteilung beruhen, lernen ML-Algorithmen automatisch Beziehungen aus den Daten selbst, wodurch sie besonders gut geeignet sind für die chaotischen, nichtlinearen und oft unvollständigen Datensätze, die historische Wirtschaftsaufzeichnungen charakterisieren.
Historische Ökonomie hat sich traditionell auf narrative Analysen, einfache Regressionen oder deskriptive Statistiken gestützt. Das Aufkommen digitalisierter Archive und Hochleistungsrechnen hat jedoch die Möglichkeit geschaffen, ausgefeiltere analytische Werkzeuge anzuwenden. Frühe Bemühungen in den 1990er Jahren konzentrierten sich auf die Verwendung neuronaler Netzwerke zur Vorhersage von Aktienkursen mit historischen Zeitreihen. Heute passen Forscher Deep Learning, zufällige Wälder und unterstützen Vektormaschinen an so unterschiedliche Fragen wie die wirtschaftlichen Auswirkungen des Schwarzen Todes, die Effizienz vormoderner Bewässerungssysteme und die Treiber des Wachstums der industriellen Revolution an. Einen Überblick über das breitere Feld der Computergeschichte finden Sie in der Arbeit von Digital Humanities scholars at Nature.
Arten von Machine Learning Algorithmen verwendet
Beaufsichtigtes Lernen
In der historischen Ökonomie wird dies üblicherweise zur Vorhersage von Wirtschaftsindikatoren verwendet. Zum Beispiel kann ein überwachtes Modell unter Verwendung von Daten aus dem 19. Jahrhundert zu Landbesitz, Bevölkerungsdichte und Transportinfrastruktur regionale Einkommensniveaus oder landwirtschaftliche Produktion vorhersagen. Beliebte Algorithmen umfassen lineare Regression, Entscheidungsbäume, zufällige Wälder und Gradientenverstärkungsmaschinen. Ein bemerkenswerter Fall ist die Verwendung historischer Wetter- und Ernteaufzeichnungen, um Getreidepreisschwankungen im mittelalterlichen Europa vorherzusagen.
Unüberwachtes Lernen
Unüberwachtes Lernen findet versteckte Strukturen oder Cluster innerhalb von Datensätzen, in denen keine Etiketten zur Verfügung gestellt werden. In der historischen Ökonomie ist diese Technik von unschätzbarem Wert, um regionale Wirtschaftszonen, Handelsblöcke oder Perioden finanzieller Instabilität ohne vorherige Annahmen zu identifizieren. Zum Beispiel können Clustering-Algorithmen (z. B. k-Means, hierarchisches Clustering), die auf römische Amphorenverteilungsdaten angewendet werden, unterschiedliche Marktregionen im gesamten Mittelmeerraum aufdecken. Dimensionalitätsreduktionsmethoden wie die Hauptkomponentenanalyse (Primary Component Analysis, PCA) helfen, komplexe multidimensionale Wirtschaftsdaten zu visualisieren, wie das Zusammenspiel zwischen Zöllen, Währungsreformen und Industrieproduktion im 19. Jahrhundert. Jüngste Arbeiten von Ökonomen bei PNAS hat unüberwachtes Lernen verwendet, um Handelsnetzwerke aus alten Schiffswrack-Frachtmanifestationen zu rekonstruieren.
Verstärkung des Lernens
Verstärkungslernen (reinforcement learning, RL) beinhaltet, dass ein Agent optimale Aktionen durch Versuch und Irrtum lernt, indem er die kumulative Belohnung maximiert. Obwohl RL in der historischen Ökonomie weniger verbreitet ist, wird es zunehmend auf modellhafte wirtschaftliche Entscheidungsprozesse angewendet. Zum Beispiel simulieren Forscher, wie ein mittelalterlicher Händler Handelsrouten als Reaktion auf schwankende Zölle, Piratenbedrohungen und Nachfrage anpassen könnte. RL-Agenten können Strategien "lernen", die historische Verhaltensweisen widerspiegeln und Einblicke in die Rationalität (oder begrenzte Rationalität) vergangener Wirtschaftsakteure liefern. Dieser Ansatz wurde verwendet, um die Dynamik der frühen modernen transatlantischen Wirtschaft zu untersuchen.
Anwendungen in der historischen Wirtschaftsanalyse
Prognose der wirtschaftlichen Entwicklung
Algorithmen, die auf historischen Wirtschaftsdaten trainiert sind, können zukünftige Bedingungen vorhersagen, werden aber auch rückwirkend verwendet, um vorherzusagen, was unter kontrafaktischen Szenarien geschehen wäre. Durch das Training von Modellen zu jahrzehntelangen Preisdaten aus verschiedenen Regionen können Ökonomen beurteilen, ob die Weltwirtschaftskrise unvermeidlich war oder ob alternative Strategien ihre Schwere gemindert haben könnten. Eine Studie aus dem Jahr 2019 in der ] American Economic Review setzte maschinelles Lernen ein, um Bankausfälle in den 1930er Jahren vorherzusagen, was zeigt, dass Frühwarnindikatoren aus den Bilanzen mit viel höherer Genauigkeit hätten entnommen werden können als traditionelle Regressionsmodelle.
Mustererkennung
Die Erkennung von Zyklen, Schocks oder Anomalien in historischen Datensätzen ist eine Kernstärke von ML. Langfristige Wirtschaftszyklen wie die Kondratiev-Wellen (50-60-Jahreszyklen) oder Juglar-Zyklen (7-11 Jahre) können automatisch aus Lohn- und Preisreihen identifiziert werden. ML-Algorithmen erkennen auch Unregelmäßigkeiten, die auf Dateneingabefehler, Betrug oder signifikante historische Ereignisse hinweisen könnten (z. B. eine plötzliche Preisspitze aufgrund von Krieg). Zum Beispiel können konvolutionale neuronale Netzwerke, die auf digitalisierte Tabellen englischer Landtransaktionen aus dem 18. Jahrhundert angewendet werden, anomale Verkäufe kennzeichnen, die mit Einschließungshandlungen korrelieren. Im Bereich der Makroökonomie hat unüberwachtes Lernen den Wissenschaftlern geholfen, Geschäftszyklen zu datieren, die bis ins 16. Jahrhundert zurückreichen.
Datenrekonstruktion
Historische Aufzeichnungen sind oft unvollständig, weil Archive verloren gehen, beschädigte Dokumente oder inkonsistente Aufzeichnungskonventionen. Maschinelles Lernen bietet leistungsfähige Werkzeuge, um Lücken durch prädiktive Modellierung zu füllen. Eine gängige Technik ist es, ein Modell zu verwenden, das auf Regionen oder Perioden mit vollständigen Daten trainiert ist, um fehlende Werte in anderen Bereichen zu imputieren. Zum Beispiel kann ein ML-Modell aufgrund der bekannten Beziehung zwischen Bevölkerungsdichte, Klima und Steuereinnahmen Steuereinnahmen für Jahre mit fehlenden Aufzeichnungen schätzen. Deep Learning-Methoden, wie generative gegnerische Netzwerke (GANs), wurden vorgeschlagen, um kontinuierliche Zeitreihen aus spärlichen Beobachtungen zu rekonstruieren. Dieser Prozess bereichert nicht nur Datensätze, sondern ermöglicht auch robustere statistische Inferenzen. Die Forscher müssen jedoch vorsichtig sein, um die Einführung von Artefakten zu vermeiden - ein Punkt, der im Abschnitt Herausforderungen unten diskutiert wird.
Herausforderungen bei der Datenvorverarbeitung
Historische Daten kommen selten in einem sauberen, maschinenfertigen Format an. Die Vorverarbeitung ist oft der arbeitsintensivste Teil eines Projekts.
- Datenqualität: Historische Daten können unvollständig, inkonsistent oder verzerrt sein. Zum Beispiel unterschätzen Volkszählungsaufzeichnungen aus Kolonialzeitaltern oft bestimmte Populationen. Fehlende Werte, doppelte Einträge und Transkriptionsfehler sind häufig. Robuste Vorverarbeitungspipelines müssen diese Probleme behandeln, oft durch eine Kombination von Domänenwissen und automatisierten Reinigungstechniken.
- Temporale Abhängigkeiten: Wirtschaftliche Daten sind von Natur aus zeitabhängig. Standard-ML-Modelle nehmen unabhängige und identisch verteilte (i.i.d.) Daten an - eine Annahme, die durch Zeitreihen verletzt wird. Spezialisierte Architekturen wie lange Kurzzeitspeicher (LSTM) Netzwerke oder Transformatoren sind erforderlich, um Autokorrelation und Saisonalität zu erfassen.
- Einheit der Analyse: Historische Aufzeichnungen verwenden unterschiedliche Währungen, Gewichte und Maße. Einheiten zu standardisieren (z. B. Umrechnung aller Geldwerte in eine gemeinsame Währung mit Inflationsanpassungen) ist wichtig, aber mit Annahmen über die relative Kaufkraft behaftet.
- Normalisierung und Skalierung: Features müssen skaliert werden, um zu verhindern, dass Modelle von Variablen mit größeren numerischen Bereichen dominiert werden. Z-Score-Standardisierung oder Min-Max-Skalierung sind typisch, aber die Auswahl kann die Modellinterpretationsfähigkeit beeinflussen.
Fallstudien
Machine Learning und die Große Depression
Eine der am intensivsten untersuchten Anwendungen ist die Analyse der Großen Depression (1929–1941). Forscher haben zufällige Wälder angewendet, um Bankausfälle mithilfe von Bilanzdaten der Federal Reserve vorherzusagen. Das Modell identifizierte Leverage Ratios und Einlagenkonzentrationen als die prädiktivsten Merkmale - die traditionelle lineare Diskriminanzanalyse übertreffen. Dies validiert nicht nur historische Konten, sondern liefert auch quantitative Beweise für politische Empfehlungen. A 2022 Papier in der Quartal Journal of Economics verwendete Gradientenverstärkermaschinen, um die US-Landkreise nach ihrer Erholungsgeschwindigkeit zu klassifizieren, was zeigt, dass die vorangegangene landwirtschaftliche Diversifizierung ein stärkerer Prädiktor war als New Deal Ausgaben - ein Ergebnis, das konventionelle historische Narrative herausfordert.
Modellierung der römischen Wirtschaft
Die römische Wirtschaft, die sich über mehrere Jahrhunderte und ein riesiges geografisches Gebiet erstreckt, bietet einen reichen, aber notorisch spärlichen Datensatz. Maschinelles Lernen wurde eingesetzt, um das BIP pro Kopf mithilfe von Proxyvariablen wie Schiffswrackzahlen, Gebäudeinschriften und Bleiverschmutzungspegeln von Eisbohrkernen zu schätzen. Eine wegweisende Studie verwendete Gauß-Prozessregression, um diese Proxies über Zeit und Raum zu interpolieren und die ersten kontinentalen jährlichen BIP-Schätzungen für das Römische Reich von 200 v. Chr. bis 500 v. Chr. zu erzeugen. Das Modell zeigte einen Höhepunkt der wirtschaftlichen Aktivität um das Ende des 2. Jahrhunderts CE - früher als bisher angenommen - und einen schnellen Rückgang während der Krise des Dritten Jahrhunderts. Diese Anwendung zeigt, wie ML neue empirische Beweise aus fragmentarischen Aufzeichnungen generieren kann, obwohl die Unsicherheitsintervalle weit bleiben.
Mittelalterliche Handelsmuster Entdeckung
Unüberwachtes Lernen wurde verwendet, um Tausende von Aufzeichnungen aus der Hanse (13. bis 17. Jahrhundert) zu analysieren. Clustering-Algorithmen, die auf Zollbücher und Kaufbriefe angewendet wurden, erkannten automatisch Handelsblöcke, wie die Verbindung zwischen Lübeck, Hamburg und baltischen Städten. Die Cluster des Algorithmus stimmten eng mit historischen Berichten überein, wodurch die Methode validiert wurde. Interessanterweise identifizierte das Modell eine zuvor übersehene Handelsroute, die die Niederlande über die Weichsel mit Nowgorod verbindet, die in der Sekundärliteratur nicht prominent war. Folgearchivforschung bestätigte die Existenz eines kleinen, aber aktiven Handelskorridors. Dieser Fall unterstreicht die Fähigkeit von ML, neue historische Erkenntnisse aus großen digitalen Archiven zu gewinnen.
Ethische Überlegungen und historischer Kontext
Die Anwendung von maschinellem Lernen auf die Geschichte ist nicht ohne Fallstricke. Modelle können Vorurteile in den Quelldaten verewigen. Wenn Steuerunterlagen systematisch die wirtschaftliche Aktivität von Frauen oder versklavten Menschen unterschätzen, werden ML-Modelle "lernen", dass diese Gruppen weniger beigetragen haben - was ungenaue historische Narrative verstärkt. Die Interpretierbarkeit ist ein weiteres wichtiges Anliegen. Komplexe Modelle wie tiefe neuronale Netzwerke sind oft "Black Boxes", was es schwierig macht zu verstehen, warum eine bestimmte Vorhersage gemacht wurde. Für die historische Forschung ist Erklärungskraft ebenso wichtig wie prädiktive Genauigkeit. Domänenexperten müssen eng mit Datenwissenschaftlern zusammenarbeiten, um sicherzustellen, dass Modelle mit historischem Wissen übereinstimmen und dass alle überraschenden Ergebnisse kritisch bewertet werden.
Überanpassung ist ein konstantes Risiko, besonders wenn man kleine historische Datensätze verwendet. Überbewusste Modelle können falsche Korrelationen erzeugen – wie die Verknüpfung des Wirtschaftswachstums im England des 18. Jahrhunderts mit der Anzahl der Blitzeinschläge – die statistisch signifikant, aber historisch bedeutungslos sind. Strenge Kreuzvalidierung, Tests außerhalb der Stichprobe und die Einbeziehung von Hilfsquellen (z. B. archäologische Beweise) sind notwendig, um diese Risiken zu mindern. Darüber hinaus muss die ethische Dimension des algorithmisch "Umschreibens" der Geschichte berücksichtigt werden. Wie Hilary Davidson in FLT:0 argumentiert , Algorithmische Geschichte , müssen wir vermeiden, ML-Ausgänge als endgültig zu behandeln; sie sind Werkzeuge, um Hypothesen zu erstellen, nicht um sie ohne menschliches Urteil zu bestätigen.
Zukünftige Richtungen
Fortschritte in Rechenleistung, Digitalisierung und algorithmischen Techniken versprechen, die Anwendung des maschinellen Lernens in der historischen Ökonomie weiter zu verbessern. Die wachsende Verfügbarkeit von groß angelegten, verknüpften Datensätzen wie der Initiative Global Historical Datasets wird es Forschern ermöglichen, Modelle zu Tausenden von Variablen über Jahrhunderte hinweg zu trainieren. Wir erwarten auch die Integration von ML mit Natural Language Processing (NLP), um strukturierte Wirtschaftsdaten aus unstrukturierten Texten zu extrahieren (z. B. Handelsbriefe, Parlamentsdebatten, Zeitungen). Dies könnte zum Beispiel automatisch Stimmungsindizes für das Vertrauen der Unternehmen aus Londoner Zeitungen des 18. Jahrhunderts aufbauen.
Erklärbare KI-Methoden (XAI) wie SHAP (SHapley Additive exPlanations) und LIME (Local Interpretable Model-agnostic Explanations) gewinnen an Zugkraft und ermöglichen Historikern zu verstehen, welche Merkmale Vorhersagen antreiben. Dies ist wichtig für den Aufbau von Vertrauen und die Ermöglichung kritischer Interpretationen. Verstärkungslernen in Kombination mit agentenbasierten Modellen kann es Wissenschaftlern ermöglichen, "Was wäre wenn"-Szenarien zu simulieren, wie zum Beispiel, wie unterschiedliche Geldpolitik den Verlauf der römischen Inflationskrise verändert haben könnte. Schließlich stellt der Aufstieg der Abteilungen für digitale Geisteswissenschaften und interdisziplinäre Ausbildungsprogramme sicher, dass zukünftige Historiker sowohl mit ML-Fähigkeiten als auch mit traditionellem Archivwissen ausgestattet werden.
Schlussfolgerung
Maschinelles Lernen ist kein Zauberstab, der alle Probleme der historischen Ökonomie lösen wird, aber es ist eine mächtige Ergänzung des Werkzeugkastens des Historikers. Wenn es nachdenklich angewendet wird – mit Aufmerksamkeit für Datenqualität, Modellinterpretationsfähigkeit und die Zusammenarbeit zwischen Disziplinen – kann es Korrelationen aufdecken, neue Hypothesen generieren und unser Verständnis vergangener Wirtschaftssysteme bereichern. Die in diesem Artikel zitierten Studien veranschaulichen die Breite der Anwendungen, von der Vorhersage von Bankausfällen während der Weltwirtschaftskrise bis hin zur Rekonstruktion des römischen BIP und der Entdeckung verlorener mittelalterlicher Handelswege. Wenn Datensätze wachsen und Algorithmen sich verbessern, wird das Potenzial, unser Wissen über historische Wirtschaftsdynamiken zu vertiefen, nur zunehmen. Pädagogen und Studenten können gleichermaßen davon profitieren zu verstehen, wie diese Technologien das Feld umgestalten, neue Perspektiven und Forschungsmöglichkeiten bieten, die die quantitative und qualitative Brücke schlagen. Die Zukunft der historischen Ökonomie liegt nicht darin, traditionelle Methoden zu ersetzen, sondern sie mit der analytischen Kraft des maschinellen Lernens zu erweitern.