Die kliometrische Forschung – die Anwendung quantitativer Methoden auf die Wirtschaftsgeschichte – hat unser Verständnis der langfristigen wirtschaftlichen Entwicklung, des institutionellen Wandels und der Wurzeln des modernen Wohlstands revolutioniert. Indem sie Jahrhunderte von Preisreihen, Volkszählungsaufzeichnungen, Handelsbüchern und Steuerlisten zusammenführt, testen die Kliometrier Hypothesen, die qualitative Historiker nur diskutieren können. Doch unter den eleganten Regressionen und kontrafaktischen Simulationen liegt eine anhaltende und oft unterschätzte Herausforderung: die Zwillingsprobleme der Datenknappheit und der Datenqualität). Ohne zuverlässige historische Daten produzieren selbst die anspruchsvollsten ökonometrischen Modelle irreführende Inferenzen. Dieser Artikel untersucht die Quellen, Konsequenzen und Minderungsstrategien für diese Datenherausforderungen, wobei er auf Erkenntnisse aus Jahrzehnten der cliometrischen Praxis und den jüngsten Fortschritten bei Computermethoden zurückgreift.

Die Natur der Datenknappheit in der historischen Wirtschaftsforschung

Die Datenknappheit in der Cliometrie ist nicht nur eine Frage kleiner Stichprobengrößen, sondern spiegelt die grundlegende Unvollständigkeit historischer Aufzeichnungen wider: Regierungen haben nicht immer die Statistiken gesammelt, die wir jetzt brauchen; Kriege, Brände und bürokratischer Verfall zerstörten Archive; und die Aufzeichnungskonventionen waren regional und jahrhundertelang ungleichmäßig; für das frühe moderne Europa gibt es beispielsweise keine systematischen nationalen Einkommenskonten vor dem 19. Jahrhundert; Forscher müssen Proxies aus Zehnten-Datensätzen, Handelsstatistiken und städtischen Steuerregistern zusammenstellen; im vorkolonialen Afrika oder Amerika vor dem Kontakt fehlen oft schriftliche Aufzeichnungen, was die Abhängigkeit von archäologischen Proxies, kolonialen Volkszählungen oder mündlichen Traditionen mit jeweils eigenen Grenzen erzwingt.

Quellen der Knappheit

  • Physischer Verlust: Die Bibliothek von Alexandria ist nur das berühmteste Beispiel. Tausende von Gemeinderegistern, Handelsbüchern und Staatspapieren sind durch Feuer, Überschwemmung, Vernachlässigung oder absichtliche Zerstörung umgekommen (z. B. die Bombardierung von Neapel 1943 zerstörte Jahrhunderte mittelalterlicher Handelsdaten).
  • Selektives Überleben: Datensätze, die überleben, begünstigen oft die Literaten, die Reichen, die Stadtbewohner und die männlichen. Landwirtinnen, Frauen und indigene Bevölkerungen erscheinen nur zeitweise – wenn überhaupt – und schaffen systematische Lücken, die wirtschaftliche Analysen von Wohlfahrt oder Ungleichheit beeinflussen können.
  • Änderungen in den Verwaltungsgrenzen: Eine Gemeinde, die sich über Jahrhunderte hinweg zusammenschloss, spaltete oder änderte, macht Längstafeln fast unmöglich, ohne sorgfältige Georeferenzierung und Harmonisierung.
  • Niedrige Messhäufigkeit: Die meisten vormodernen Statistiken wurden in unregelmäßigen Abständen gesammelt - manchmal jedes Jahrzehnt, manchmal einmal im Jahrhundert.

Diese Knappheiten zwingen die Cliometriker dazu, eine sogenannte „pragmatische Erkenntnistheorie zu übernehmen: mit den besten verfügbaren Beweisen zu arbeiten und gleichzeitig ihre Lücken offen anzuerkennen. Die resultierenden Datensätze sind oft unausgewogene Panels oder Querschnitte mit vielen fehlenden Zellen, was die Verwendung von Standard-Ökonometrischen Techniken erschwert.

Folgen der Knappheit für Wirtschaftsmodelle

Wenn Variablen fehlen, können Forscher auf proxy-Variablen zurückgreifen, die das Konzept von Interesse nur schwach erfassen. Zum Beispiel ignoriert die Verwendung der Anzahl von Bahnhöfen als Proxy für die Marktintegration den Straßen- und Flussverkehr. Alternativ könnten sie Beobachtungen mit fehlenden Daten fallen lassen, die Stichprobengröße verkleinern und möglicherweise eine Selektionsverzerrung einführen. Wenn die fehlenden Eigenschaften mit unbeobachteten Eigenschaften korreliert (z. B. ärmere Regionen haben schlechtere Aufzeichnungen geführt), sind die resultierenden Schätzungen inkonsistent. Zeitreihenanalysen werden besonders fragil: Ein einzelner fehlender Datenpunkt in einem autoregressiven Modell kann die dynamische Struktur durchbrechen.

Vielleicht heimtückischer ist die Tendenz, sich auf starke Annahmen über datengenerierende Prozesse zu verlassen. Forscher gehen oft davon aus, dass fehlende Daten unter bestimmten Bedingungen auf Observablen “fehlen”, eine Behauptung, die in historischen Umgebungen selten vertretbar ist. Das Ergebnis ist, dass viele cliometrische Ergebnisse mit breiten Vertrauensintervallen und einer hohen Empfindlichkeit gegenüber Spezifikation einhergehen - eine Tatsache, die nicht-technische Historiker manchmal für methodologische Schwäche halten und nicht für ehrliche Unsicherheit.

Die Qualitätsdimension: Fehler, Vorurteile und Inkonsistenz

Selbst wenn historische Daten überleben, ist ihre Qualität bei weitem nicht garantiert. Die Datenqualität umfasst Genauigkeit, Konsistenz, Vollständigkeit und Freiheit von systematischen Vorurteilen. Historische Quellen wurden für administrative, steuerliche oder rechtliche Zwecke geschaffen, nicht für moderne wissenschaftliche Analysen.

Allgemeine Formen der schlechten Datenqualität

  • Transkriptionsfehler: Handgeschriebene Bücher sind anfällig für Fehlinterpretation; eine Studie ergab, dass Angestellte in britischen Fabriken des 19. Jahrhunderts die Produktion um 5-10% falsch gezählt haben. Wenn sie über optische Zeichenerkennung (OCR) digitalisiert werden, führen historische Schriftarten weitere Fehler ein - z. B. "1642" wird "164Z".
  • Ändernde Definitionen: Die Kategorie “urban” könnte sich von 2.000 Einwohnern im Jahr 1800 auf 10.000 im Jahr 1900 verschoben haben. “Weizenpreise” könnten Transportkosten in einem Archiv ausschließen, sie aber in einem anderen einschließen. Solche Inkonsistenzen können zu Phantomstrukturbrüchen führen.
  • Runding und Heaping: Age Heaping – die Tendenz, Alter bis zu 0 oder 5 Jahre zu melden – ist in Volkszählungsdaten aus dem 19. Jahrhundert berüchtigt, was demografische Schätzungen verzerrt.
  • Auswahlvorurteile: Gerichte haben Verbrechen, aber keine nicht gemeldeten Straftaten registriert. Steuerbescheide haben die ärmsten Haushalte ausgelassen. Zeitungen berichteten über dramatische Ereignisse, nicht über den täglichen Handel. Die Verwendung solcher Quellen ohne Korrektur ergibt ein verzerrtes Bild der wirtschaftlichen Aktivität.
  • Messeinheiten: Ein “Bushel”, variiert nach Ware und Region; “Pfund Sterling” veränderte sich im Silbergehalt über Jahrhunderte.

Der kumulative Effekt dieser Qualitätsprobleme ist Messfehler, der Regressionskoeffizienten in Richtung Null (klassische Fehler in Variablen) oder in unvorhersehbare Richtungen (nicht-klassischer Fehler) verzerrt. So werden beispielsweise Schätzungen des Pro-Kopf-Einkommens, die auf weitgehend städtischen Gehaltsdaten basieren, das Nationaleinkommen überschätzen, wenn der ländliche Sektor unterrepräsentiert ist. Fehlgemessene Wachstumsraten können falsche „Armutsfallen“ oder „Starts“ erzeugen.

Bias in Historische Rekord-Keeping

Ein besonders ärgerliches Qualitätsproblem ist systematische Voreingenommenheit, die durch den politischen, sozialen oder wirtschaftlichen Kontext der Rekorderstellung eingeführt wird. Kolonialadministratoren zum Beispiel berichteten oft überhöhte Steuereinnahmen, um ihren Vorgesetzten zu gefallen. Landregistrierung in vielen Gesellschaften schloss Frauen oder Gemeinschaftseigentum aus, was es unmöglich machte, die wahre Vermögensverteilung zu rekonstruieren. Fabrikinspektoren des 19. Jahrhunderts konzentrierten sich auf große Mühlen und ignorierten kleine Werkstätten. Diese Vorurteile sind nicht zufällig; sie korrelieren mit den sehr wirtschaftlichen Phänomenen, die die Cliometriker untersuchen möchten, wie Ungleichheit, staatliche Kapazität und Industrialisierung.

Wenn man diese Verzerrungen nicht berücksichtigt, kann dies zu veröffentlichten empirischen Erkenntnissen führen, die späteren Archiventdeckungen widersprechen. Das klassische Beispiel ist die Debatte der „Großen Divergenz: Frühe cliometrische Schätzungen des chinesischen BIP vor 1800 basierten auf europäischen Standardpreisdaten, aber spätere Arbeiten mit Steuerlisten der Ming-Dynastie zeigten ein viel höheres Niveau der landwirtschaftlichen Produktivität, was die Erzählung einer stagnierenden asiatischen Wirtschaft in Frage stellt. Datenqualität ist in diesem Sinne nicht nur ein technisches Problem, sondern ein historiographisches.

Strategien zur Minderung von Knappheits- und Qualitätsproblemen

Die Auswahl der Strategie hängt von der Art der Fehlheit oder des Fehlers und der Forschungsfrage ab. Im Folgenden untersuchen wir die wichtigsten Ansätze, die von einfach bis anspruchsvoll gehen.

Datenimputation und Mehrfachimputation

Wenn Datenpunkte fehlen, das Muster aber plausibel zufällig ist, kann die imputation die Lücken füllen. Einzelne Imputation (z. B. das Ersetzen fehlender Werte durch den Mittelwert oder die letzte Beobachtung) ist einfach, reduziert aber künstlich die Varianz. Moderne Cliometrik verwendet zunehmend multiple Imputation (MI), die mehrere plausible abgeschlossene Datensätze erstellt, Analysen für jeden ausführt und Schätzungen mit Rubins Regeln kombiniert. MI ist gut geeignet für historische Panels, in denen die Fehlfunktion monoton ist (z. B. das BIP eines Landes, das vor 1820 nicht erfasst wurde). MI geht jedoch davon aus, dass die Variablen, die die Fehlfunktion vorhersagen, in das Imputationsmodell einbezogen werden - eine starke Anforderung, wenn unbeobachtete historische Schocks Datenverlust verursachen.

Cross-Verifizierung und Triangulation

Vor jeder statistischen Korrektur sollten die Forscher Daten mit unabhängigen Quellen vergleichen. Zum Beispiel kann eine Preisreihe aus einem Händlerbuch mit kommunalen Marktregistern, Zeitungsberichten und sogar Schiffsmanifesten verglichen werden. Triangulation zeigt Transkriptionsfehler auf, deckt lokale Verzerrungen auf und deckt manchmal völlig neue Datenpunkte auf. Die FLT:2 Cliometric Society unterhält Datenbanken, die eine solche Multi-Source-Validierung fördern, aber der Prozess bleibt arbeitsintensiv und domänenspezifisch.

Robuste statistische Modelle

Einige ökonometrische Techniken sind von Natur aus robust gegenüber Datenunvollkommenheiten. Instrumentale Variablen (IV) können den Messfehler in einem Schlüsselregressor korrigieren, sofern ein gültiges Instrument existiert. Fixed effects absorbieren zeitinvariante Unbeobachtbare (z. B. persistente Datenerfassungsfehler in einem bestimmten Dorf). Bootstrap Standard Error und Bayessche Schätzung erlauben es Forschern, Unsicherheit über die Fehlfunktion in Konfidenzintervalle zu integrieren. Zum Beispiel können Bayessche strukturelle Zeitreihenmodelle unregelmäßig beabstandete historische Beobachtungen verarbeiten, indem sie frühere Verteilungen über fehlende Perioden angeben.

Machine Learning und Digitalisierungsfortschritte

In den letzten Jahren gab es einen Anstieg der ]computational-Ansätze an historische Daten. ]Die optische Zeichenerkennung (OCR) ist für historische Schriftarten genauer geworden und kann nun kursive Manuskripte mit Fehlerraten unter 10% transkribieren, was die Massendigitalisierung von Volkszählungsrückgaben und Gemeinderegistern ermöglicht. ]Die natürliche Sprachverarbeitung (NLP) extrahiert strukturierte Daten aus unstrukturierten historischen Texten (z. B. Preisangebote aus Zeitungen). ]Die Aufzeichnungsverbindungsalgorithmen - basierend auf maschinellem Lernen - können Individuen über Volkszählungen hinweg zusammenführen und Längstafeln aus wiederholten Querschnitten erstellen. Diese Werkzeuge reduzieren sowohl die Knappheit (durch die Freischaltung von zuvor unzugänglichen Archiven) als auch die Qualität (durch die Standardisierung heterogener Quellen). Ein bemerkenswertes Projekt ist Historische Daten

Sensitivitätsanalyse und Replikation

Angesichts der Fragilität historischer Daten sollte eine Sensitivitätsanalyse obligatorisch sein. Forscher können testen, wie sich die Ergebnisse ändern, wenn fehlende Werte mit verschiedenen Algorithmen zugeschrieben werden, wenn Ausreißer zugeschnitten werden oder wenn die Stichprobe auf qualitativ hochwertige Teilmengen beschränkt ist. Die Berichterstattung über mehrere Spezifikationen – ein „Multi-Modell-Ansatz – ermöglicht es den Lesern, die Robustheit der Schlussfolgerungen zu beurteilen. Die Replikationsbewegung in der Cliometrie hat auch die Qualität verbessert: Viele Zeitschriften benötigen jetzt Daten- und Codeablagerungen, so dass andere Forscher Fehler aufdecken oder alternative Annahmen testen können. Die ]Economic History Association unterhält ein Repository, das diese Transparenz erleichtert.

Fallstudie: Rekonstruktion des BIP-Wachstums im frühen modernen England

Um diese Herausforderungen und Strategien in Aktion zu sehen, betrachten Sie die Rekonstruktion des englischen BIP von 1600 bis 1800. Frühe cliometrische Arbeiten von W. A. Cole und Phyllis Deane stützten sich auf verstreute Zollaufzeichnungen, Schätzungen der landwirtschaftlichen Produktion und Lohndaten, waren jedoch mit einer schweren Knappheit konfrontiert: Vor 1855 gab es keine systematischen Volkswirtschaftlichen Gesamtrechnungen. Spätere Forscher wie Stephen Broadberry und Kollegen (2015) befassten sich mit der Datenqualität durch:

  • Digitalisierung von Tausenden von Gemeinderegistereinträgen für landwirtschaftliche Produktion (mit HTR für Handschrift).
  • Verifizierung von Daten zur industriellen Produktion aus Quaker-Geschäftsunterlagen (hohe Qualität) mit Verbrauchsteuererklärungen (systematisch, aber möglicherweise umgangen).
  • Mehrfache Anrechnung, um Lücken in Jahren zu füllen, in denen Londoner Hafenaufzeichnungen beim Großen Brand von 1666 zerstört wurden.
  • Anwendung von Bayes-Dynamikfaktormodellen zur Glättung erratischer Preisreihen.

Der daraus resultierende Datensatz zeigt, dass das BIP-Wachstum in England im 17. Jahrhundert stetig, aber bescheiden (~0,3% pro Jahr) war, nicht die bisher angenommene Stagnation. Ohne sorgfältige Verwaltung von Knappheit und Qualität hätte die frühere "Stagnation" -Erzählung anhalten können - ein Beweis für die Bedeutung dieser methodischen Korrekturen.

Zukünftige Richtungen

Mit Blick auf die Zukunft versprechen drei Entwicklungen, die Datenknappheit und die Qualitätsbelastung in der Cliometrik zu verringern. Erstens, groß angelegte Digitalisierungsinitiativen – wie die Transkribus Plattform für historische Manuskripte – machen seltene Quellen in beispiellosem Maßstab maschinenlesbar. Zweitens, probabilistische Datenverknüpfung und Entitätsauflösung Algorithmen werden es Forschern ermöglichen, Datensätze über Regionen und Jahrhunderte hinweg zusammenzuführen und reichere Panels zu erstellen. Drittens, ]kausale Inferenzmethoden (z. B. Differenzen mit synthetischen Kontrollen) werden an Einstellungen mit fehlenden Vorbehandlungsdaten angepasst und bieten robustere Tests historischer Hypothesen.

Doch Technologie allein kann Domänenwissen nicht ersetzen. Zu verstehen, warum ein bestimmtes Archiv geschaffen wurde – wer es finanziert hat, welcher politische Druck bestand, welche Gruppen ausgeschlossen wurden – bleibt für die Bewertung der Datenqualität unerlässlich. Die beste cliometrische Forschung kombiniert Rechenmuskeln mit historischem Tieflesen, wobei Datenknappheit und -qualität nicht als Ärgernis, sondern als eigenständige Untersuchungsobjekte behandelt werden.

Schlussfolgerung

Datenknappheit und Datenqualität sind keine peripheren Belästigungen in der cliometrischen Forschung; sie sind von zentraler Bedeutung für die Gültigkeit jeder Behauptung über die Wirtschaftsgeschichte. Knappheit zwingt Forscher, mit unvollständigen, nicht zufälligen Proben zu arbeiten; Qualitätsprobleme führen zu Fehlern und Verzerrungen, die Schlussfolgerungen umkehren können. Durch die Einführung strenger Imputationstechniken, die Querverifizierung von Quellen, die Nutzung robuster statistischer Methoden und die Nutzung neuer Digitalisierungswerkzeuge können Cliometrier diese Probleme mildern - aber niemals beseitigen. Die Zukunft des Feldes liegt in transparenter Berichterstattung, Replikation und der Bereitschaft, die Unsicherheit zu quantifizieren, die historische Distanz auferlegt. Nur wenn sie sich diesen Herausforderungen stellen können direkt kann Cliometrie sein Versprechen erfüllen, eine quantitative Grundlage für unser Verständnis der Vergangenheit zu liefern.