Table of Contents
Die Grundlage des Text Mining in der Geschichte
Der Historiker, der mit digitalen Archiven arbeitet, steht vor einem Paradoxon der Fülle. Millionen von Büchern, Zeitungen und persönlichen Briefen sind jetzt mit einem einzigen Klick verfügbar, aber die menschliche Fähigkeit, sie zu lesen und zu synthetisieren, bleibt endlich. Natural Language Processing (NLP) bietet einen Weg durch diese Fülle. Durch die Anwendung von Rechenmethoden zur Analyse historischer Texte können Forscher Muster identifizieren, sprachliche Verschiebungen verfolgen und Hypothesen über massive Datensätze testen, die in einem einzigen Leben unmöglich zu lesen wären.
Natural Language Processing ist ein Zweig der künstlichen Intelligenz, der sich auf die Interaktion zwischen Computern und menschlicher Sprache konzentriert. Sein primäres Ziel ist es, Maschinen zu lehren, Text zu lesen, zu interpretieren und Bedeutungen daraus zu ziehen, und zwar auf eine Weise, die sowohl statistisch robust als auch kontextabhängig ist. Im Kontext der historischen Forschung bedeutet dies, dass fragile, laute und hochvariable Dokumente – von mittelalterlichen Manuskripten bis hin zu Telegrammen des 20. Jahrhunderts – in strukturierte Daten umgewandelt werden, die abgefragt und quantifiziert werden können.
Traditionelle historische Methoden beruhen stark auf nahem Lesen: eine tiefe, interpretative Analyse einer kleinen Anzahl von Dokumenten. Dieser Ansatz erzeugt reiche, kontextualisierte Einsichten, leidet aber unter Skalierbarkeitsproblemen. Der Historiker kann nur so viele Seiten lesen. NLP führt das Konzept des fernen Lesens ein, ein Begriff, der vom Literaturwissenschaftler Franco Moretti populär gemacht wird. Fernlesen behandelt Tausende von Texten als eine einzige Datenlandschaft, analysiert sie durch statistische Aggregate.
Dies ersetzt nicht das nahe Lesen; es ergänzt es durch eine Makroebene, die eine tiefere Untersuchung leiten kann. Zum Beispiel könnte ein Gelehrter, der politische Rhetorik des achtzehnten Jahrhunderts studiert, Fernlesen verwenden, um einen plötzlichen Anstieg der Verwendung des Wortes "Repräsentation" in Dutzenden von Broschüren zu identifizieren, dann kehren Sie zum nahen Lesen zurück, um diese spezifischen Texte im Kontext zu interpretieren.
Kernkomponenten einer NLP-Pipeline für die Geschichte
Um zu verstehen, wie NLP an historischen Dokumenten arbeitet, ist es hilfreich, die Standardverarbeitungspipeline aufzuschlüsseln.
- Tokenization: Splitting einen Textstrom in einzelne Wörter, Satzzeichen oder Sätze. Das klingt einfach, aber historische Texte mit unregelmäßigen Abständen, archaische Interpunktion und die Verwendung des langen 's' Zeichens (das einem 'f' ähnelt) können moderne Tokenizer auslösen. Ausgeklügelte Tokenizer ermöglichen es dem Forscher, benutzerdefinierte Regeln für den Umgang mit diesen Anomalien zu definieren.
- Teil-Sprache (POS) Tagging: Beschriftung jedes Wortes mit seiner grammatischen Rolle (Substantiv, Verb, Adjektiv, Adverb). Dies ist wichtig für die Zweideutigkeit. Das Wort "Licht" kann beispielsweise ein Substantiv (eine Beleuchtungsquelle) oder ein Adjektiv (nicht schwer) sein. POS-Tagging ermöglicht es Algorithmen, diese Verwendungen zu unterscheiden, was für Aufgaben wie Themenmodellierung oder Stimmungsanalyse von entscheidender Bedeutung ist.
- Lemmatisierung und Stemming: Wörter auf ihre Basis- oder Wörterbuchform reduzieren. “Laufen” wird “run”; “besser” wird “good”. Für historische Texte hilft dies, Varianten eines Wortes über einen Korpus zu aggregieren. Ein Lemmatisierer, der auf modernem Englisch trainiert wird, kann jedoch archaische Formen wie “doth” (does) oder “hath” (hat) nicht erkennen, so dass benutzerdefinierte Wörterbücher oder manuelle Korrektur oft erforderlich sind.
- Named Entity Recognition (NER): Identifizieren und Klassifizieren von Eigennamen in vordefinierte Kategorien wie Personennamen, Organisationen, Orte, Daten und monetäre Werte. Dies ist eines der unmittelbar nützlichsten Werkzeuge für Historiker. Ein Forscher, der ein Jahrhundert diplomatischer Korrespondenz analysiert, kann NER verwenden, um jede Erwähnung eines Außenministers, einer Hauptstadt oder eines Vertrags zu extrahieren und diese Entitäten dann über Zeit und Raum zu kartieren.
Schlüsselanwendungen in der historischen Forschung
Die Anwendung von NLP auf historische Materialien verändert mehrere Forschungsbereiche. Forscher sind nicht mehr darauf beschränkt, einfache Fragen zu den Texten zu stellen; sie können jetzt komplexe Fragen darüber stellen, wie Sprache über Zeit und Raum hinweg funktioniert.
Fernlesen und Makroanalyse
Das Fernlesen ermöglicht es Wissenschaftlern, Trends über ein Jahrhundert des Publizierens an einem einzigen Nachmittag zu analysieren. Durch die Berechnung der Häufigkeit bestimmter Wörter oder Themen im Laufe der Zeit können Forscher den Aufstieg und Fall von Ideen verfolgen. Zum Beispiel bietet die Verfolgung der Verwendung von Begriffen wie "Freiheit", "Empire" oder "Republik" in Zeitungen des 18. Jahrhunderts ein quantitatives Maß für den öffentlichen Diskurs. Tools wie Google Ngram Viewer bieten eine einfache, öffentlich zugängliche Version davon, aber robustere akademische Forschung stützt sich auf kuratierte Korpora und angepasste Skripte, die Rechtschreibvariationen und OCR-Fehler berücksichtigen.
Eine wegweisende Studie des Stanford Literary Lab verwendete Fernlesen, um zu zeigen, wie das Vokabular von Romanen im 19. Jahrhundert weniger vielfältig wurde, was eine Standardisierung der Literatursprache widerspiegelt.
Thema Modellierung
Thema Modellierung ist eine unbeaufsichtigte Technik des maschinellen Lernens, die eine Sammlung von Dokumenten scannt und automatisch Cluster von Wörtern entdeckt, die häufig zusammen erscheinen. Diese Cluster oder "Themen" stellen latente Themen im Korpus dar. Ein Historiker, der mit viktorianischen Parlamentsreden arbeitet, könnte Themenmodellierung verwenden, um herauszufinden, dass ein Thema Wörter wie "Eisenbahn", "Dampf", "Motor" und "Güter" konsistent gruppiert, während ein anderes Thema "Sanitär", "Cholera", "Näher" und "Gesundheit" gruppiert. Dieses computergestützte Clustering liefert eine datengesteuerte Karte der intellektuellen Landschaft der Zeit. Wichtig ist, dass die Themenmodellierung kein Label zuweist; Der Forscher muss interpretieren, was jedes Thema darstellt, indem er Rechenergebnisse mit Domänenwissen kombiniert.
Stylometrie und Autorschaftszuweisung
Stylometry verwendet statistische Analyse, um den einzigartigen Schreibstil eines Autors zu quantifizieren. Durch die Messung von Merkmalen wie Satzlänge, Wortschatzreichtum und Häufigkeit von Funktionswörtern (z. B. "das", "und", "von") können Forscher zwischen Autoren mit hoher Genauigkeit unterscheiden. Dies ist besonders nützlich für die Lösung von Fragen umstrittener Autorenschaft in historischen Dokumenten, von den Federalist Papers bis zu Renaissancestücken. In einem berühmten Fall bestätigte die stylometrische Analyse, dass das zwölfte Buch des epischen Gedichts Alexiad wahrscheinlich von einem anderen Autor geschrieben wurde als die vorhergehenden Bücher, eine Erkenntnis, die traditionellen Philologen seit Jahrzehnten entgangen war. Computational Stylometry kann oft Verschiebungen im Stil erkennen, die für das menschliche Auge unsichtbar sind und starke, reproduzierbare Beweise für oder gegen eine bestimmte Zuordnung liefern.
Sentimentanalyse und emotionale Arcs
Sentimentanalyse versucht, den emotionalen Ton oder die Polarität eines Textes (positiv, negativ, neutral) zu messen. Bei Anwendung auf historische Texte erfordert dies eine sorgfältige Kalibrierung. Die Anwendung eines modernen Gefühlslexikons auf einen Roman des 19. Jahrhunderts würde wahrscheinlich irreführende Ergebnisse liefern, weil sich die Bedeutungen von Wörtern ändern. Wenn Forscher jedoch periodenspezifische Lexikons erstellen, die aus zeitgenössischen Wörterbüchern stammen oder von Experten kommentiert wurden, können sie emotionale Bögen in einer Erzählung verfolgen oder die öffentliche Moral durch Kriegskorrespondenz verfolgen.
Zum Beispiel verwendete eine Studie der Briefe von Unionssoldaten während des amerikanischen Bürgerkriegs ein benutzerdefiniertes Gefühlsmodell, um zu zeigen, dass die Moral in den Wintermonaten tendenziell absinkt und nach großen Siegen ansteigt, was ein Muster bestätigt, das von Historikern lange vermutet wurde, aber nie in großem Maßstab quantifiziert wurde.
Netzwerkanalyse historischer Figuren
Durch die Extraktion benannter Entitäten aus einem Korpus von Briefen oder diplomatischen Aufzeichnungen können Forscher komplexe Netzwerke von Beziehungen aufbauen. Dies wird als historische Netzwerkanalyse bezeichnet. Zum Beispiel könnte eine NLP-Pipeline jede Person extrahieren, die in der Korrespondenz von John Adams erwähnt wird. Ein Historiker könnte dann abbilden, mit wem er am häufigsten korrespondierte, wer als Einfluss zitiert wurde und wie sich diese Netzwerke im Laufe seiner Karriere veränderten. Das verwandelt statischen Text in eine dynamische soziale Karte.
Netzwerkmetriken wie Zentralität und Dichte ermöglichen es Forschern, wichtige Informationsvermittler, isolierte Zahlen oder Verschiebungen in Allianzmustern über Jahrzehnte zu identifizieren.
Geoparsing und Spatial History
Ein wachsendes Teilgebiet des historischen NLP ist geoparsing: die Extraktion und Zweideutigkeit von Ortsnamen aus Text. In Kombination mit geografischen Informationssystemen (GIS) ermöglicht Geoparsing Historikern, die räumlichen Dimensionen historischer Ereignisse und Diskurse abzubilden. Zum Beispiel könnte ein Forscher, der die Ausbreitung des Schwarzen Todes untersucht, Geoparsing auf zeitgenössischen Chroniken verwenden, um die Sequenz der gemeldeten Ausbrüche zu zeichnen, und diese Daten dann mit modernen epidemiologischen Modellen vergleichen. In ähnlicher Weise zeigt die Verfolgung, wie oft bestimmte Orte in einer Reihe von Reiseerzählungen erwähnt werden, welche Regionen als zentral oder marginal für die Weltanschauung des Autors angesehen wurden. Geoparsing steht vor Herausforderungen historischer Toponyme (z. B. "Konstantinopel" vs. "Istanbul") und mehrdeutige Ortsnamen, aber spezialisierte Gazetteers und Disambiguation Algorithmen verbessern weiterhin die Genauigkeit.
Konfrontation mit den Herausforderungen historischer Daten
Die Anwendung von NLP auf zeitgenössische Nachrichtenartikel ist schwierig genug. Die Anwendung auf jahrhundertealte Manuskripte führt zu einer Reihe von technischen und interpretativen Herausforderungen, die angegangen werden müssen, damit die Ergebnisse gültig sind. Das Ignorieren dieser Herausforderungen kann zu falschen Korrelationen und ungültigen historischen Behauptungen führen.
Fehler bei der optischen Zeichenerkennung (OCR)
Die meisten digitalen historischen Texte werden durch Scannen von physischen Seiten und Ausführen durch die OCR-Software (Optical Character Recognition) erstellt. Historisch gesehen kämpfte OCR-Software mit archaischen Schriftarten (wie den Long-s), verblasster Tinte, defektem Typ und engen Bindungen, die den Text in der Nähe des Rückgrats verdunkeln. Die resultierende Ausgabe wird oft verstümmelt. Ein Wort wie "Geschichte" könnte zu "Geschichte", "Hiftory" oder sogar "hlstory" werden. Dieses FLT:0)OCR-Rauschen führt zu signifikanten Fehlern in die quantitative Analyse.
Forscher müssen Zeit in Post-Korrektur-Pipelines investieren - entweder manuell oder automatisiert - oder OCR-Modelle verwenden, die speziell auf historische Schriftarten trainiert wurden, wie sie von der FLT:2 entwickelt wurden OCR-D Initiative in Deutschland. Selbst mit Korrektur ist es ratsam, Sensitivitätsanalysen durchzuführen: Wiederholung von Schlüsselberechnungen auf einer Teilmenge manuell korrigierter Texte, um sicherzustellen, dass das Rauschen die Ergebnisse nicht
Historische Schreibweise Variation
Vor der Standardisierung der englischen Rechtschreibung im späten achtzehnten Jahrhundert schrieben Autoren oft Wörter phonetisch oder nach regionalen Konventionen. „Glorious“ könnte als „glorious“, „glorius“, „gloyrius“ oder „gloriouse“ erscheinen. Ein modernes NLP-Tool wird diese als völlig unterschiedliche Wörter behandeln. Um dies zu erreichen, verwenden Forscher Techniken wie , regelmäßige Ausdrucksabgleiche (z. B. das Muster erfasst mehrere Varianten) oder phonetische Kodierungsalgorithmen wie Soundex oder Metaphone, die ähnlich klingen. Fortgeschrittene Methoden beinhalten den Aufbau einer „historischen Variantentabelle“, die jede bekannte Rechtschreibung einer kanonischen Form zuordnet und auf Ressourcen wie den historischen Thesaurus des Englischen zurückgreift. Für nicht-englische Sprachen gilt das gleiche Prinzip: Frühneuzeitliches Französisch, Deutsch und Spanisch zeigen alle erhebliche orthographische Variationen, die vor der Analyse normalisiert werden müssen.
Semantische Verschiebung und Anachronismus
Worte sind keine stabilen Einheiten; ihre Bedeutungen driften mit der Zeit. Das Wort „schwul“ in den 1830er Jahren bedeutete unbeschwert und sorglos; „schrecklich“ bedeutete voller Ehrfurcht; „Herstellung“ bedeutete ursprünglich von Hand gemacht. Die Anwendung eines modernen Gefühlslexikons auf einen historischen Text wird zu erheblichen Interpretationsfehlern führen. Forscher müssen sich der semantischen Veränderung bewusst sein. Forscher müssen entweder periodenspezifische Wörterbücher erstellen oder Algorithmen verwenden, die Verschiebungen der Wortbedeutung im Laufe der Zeit erkennen.
Word-Einbettungsmodelle - wie sie von word2vec oder GloVe erzeugt werden - bieten eine leistungsstarke Lösung: Durch das Training separater Einbettungen in Texte aus verschiedenen Zeiträumen können Wissenschaftler verfolgen, wie sich die nächsten Nachbarn eines Wortes ändern. Zum Beispiel zeigte eine Studie mit dieser Methode, dass das Wort „Zelle“ sich von Wörtern wie „Kloster“ und „Gefängnis“ im späten 20. Jahrhundert zu „Biologie“ und „Membran“ verschoben hat im späten 20. Jahrhundert, was den Aufstieg der Zellbiologie widerspiegelt.
Datensparität und Fragmentierung
Im Gegensatz zu modernen Datensätzen sind historische Korpora oft unvollständig. Nur ein Bruchteil dessen, was geschrieben wurde, ist bis heute erhalten geblieben, und ein noch kleinerer Bruchteil wurde digitalisiert. Dies erzeugt eine Überlebensverzerrung, die Ergebnisse verzerren kann. Eine NLP-Analyse von Langzeittrends muss die Tatsache berücksichtigen, dass Daten aus dem 19. Jahrhundert viel zahlreicher sind als Daten aus dem 16.
Jahrhundert. Statistische Modelle müssen robust genug sein, um diese spärliche Situation zu bewältigen, ohne falsche Schlüsse aus fehlenden Daten zu ziehen. Techniken wie Bootstrapping, Cross-Validation und sorgfältige Probenahme können helfen. Darüber hinaus sollten Historiker immer dokumentieren, was fehlt: welche Archive nicht digitalisiert wurden, welche Genres ausgeschlossen wurden und welche Zeiträume Lücken haben. Transparenz über Datenbeschränkungen ist ein Kennzeichen vertrauenswürdiger digitaler Geschichte.
Praktische Workflows und Tools für Historiker
Historiker müssen keine fachkundigen Programmierer sein, um NLP in ihre Forschung zu integrieren. Es gibt ein Spektrum von Werkzeugen, von hochkarätigen grafischen Schnittstellen bis hin zu niedrigkarätigen Programmierbibliotheken. Die Wahl hängt vom technischen Komfort des Forschers und der Komplexität der gestellten Fragen ab.
GUI-basierte Tools für die schnelle Analyse
Für Forscher, die schnell ohne das Schreiben von Code beginnen möchten, sind mehrere robuste Textanalyseplattformen verfügbar. Voyant Tools ist eine webbasierte Anwendung, mit der Benutzer Text hochladen und sofort Wortwolken, Frequenzlisten, Collocation-Graphen und Themenmodelle generieren können. Es ist kostenlos und erfordert keine Installation, was es ideal für die Verwendung im Klassenzimmer oder die explorative Analyse macht. AntConc ist ein Freeware-Corpusanalyse-Toolkit für Windows, Mac und Linux, das Konkordanz-, Cluster- und Wordlist-Analyse unterstützt, zusammen mit erweiterten Funktionen wie Keyword-Listen und n-Gramm-Extraktion. Beide Tools werden in digitalen Geisteswissenschaften verwendet Zentren und verfügen über umfangreiche Dokumentation.
Programmierung mit Python und R
Für eine strengere, reproduzierbare und maßgeschneiderte Forschung wenden sich Historiker zunehmend Skriptsprachen zu. Python ist die dominierende Sprache für NLP, mit Bibliotheken wie Natural Language Toolkit (NLTK), spaCy und Gensim bietet vorgefertigte Funktionen für alles von Tokenisierung bis hin zur Themenmodellierung. R ist eine statistische Computerumgebung, die die und Pakete für Textanalyse bietet, zusammen mit für die Integration in das tidyverse Ökosystem. Skript lernen ermöglicht es einem Forscher, eine transparente, wiederholbare Pipeline zu erstellen, die geteilt und kritisiert werden kann. Jupyter Notebooks sind besonders beliebt, um Code, Visualisierungen und interpretative Notizen in einem einzigen Dokument zu mischen, was die Zusammenarbeit und die Peer-Review erleichtert.
Aufbau eines Corpus
Der erste Schritt in einem NLP-Projekt ist der Aufbau eines hochwertigen Korpus. Die Beschaffung von Texten aus zuverlässigen digitalen Archiven ist von entscheidender Bedeutung.
- HathiTrust Digital Library: Ein riesiges Repository digitalisierter Bücher aus großen Forschungsbibliotheken, das Volltextsuche und Download für gemeinfreie Werke anbietet.
- Chronisch Aufzeichnen Amerikas: Eine durchsuchbare Datenbank historischer amerikanischer Zeitungen von 1777 bis 1963, bereitgestellt von der Library of Congress.
- Old Bailey Online: Eine vollständig durchsuchbare Ausgabe des Verfahrens des Central Criminal Court in London, die sich von 1674 bis 1913 erstreckt.
- Projekt Gutenberg: Ein freiwilliger Versuch, kulturelle Werke zu digitalisieren und zu archivieren, weitgehend auf gemeinfreie Texte beschränkt.
Sobald ein Korpus zusammengebaut ist, muss er gereinigt und vorverarbeitet werden. Dazu gehören das Entfernen von Metadaten-Headern und -Fußzeilen, das Standardisieren von Linienumbrüchen, das Konvertieren von Ligaturen (z. B. „Fi“ in „Fi“) und das Anbringen notwendiger Korrekturen am Text. Schon eine geringe Menge an Reinigung kann die Genauigkeit von nachgelagerten NLP-Aufgaben erheblich verbessern.
Zukünftige Richtungen: Große Sprachmodelle und Digitalgeschichte
Die jüngste Explosion von Large Language Models (LLMs) – wie GPT-4, Claude und Open-Source-Alternativen wie Llama und Mistral – stellt einen Paradigmenwechsel für die Textanalyse dar. Diese Modelle können Text von menschlicher Qualität zusammenfassen, übersetzen und erzeugen. Für Historiker bieten LLMs die verlockende Möglichkeit, ein Archiv in natürlicher Sprache abzufragen. Anstatt ein komplexes Themenmodellierungsskript zu schreiben, könnte ein Forscher einfach fragen: "Zusammenfassen Sie die wirtschaftlichen Argumente in diesen fünfzig Broschüren" oder "Extrahieren Sie alle Erwähnungen des Begriffs 'Naturrechte' und gruppieren Sie sie nach Jahrzehnten."
LLMs bergen jedoch erhebliche Risiken für die historische Forschung. Sie sind anfällig für halluzination, was bedeutet, dass sie selbstbewusst falsche Informationen erzeugen werden – Zitate erfinden, Zitate falsch zuordnen oder Ereignisse fabrizieren. Sie werden auch auf massiven, unkuratierten Datensätzen trainiert, denen der historische Kontext fehlt. Ein LLM könnte einen modernen ideologischen Rahmen auf einen historischen Text auferlegen und eine anachronistische Zusammenfassung erzeugen, die Vorurteile des 21. Jahrhunderts und nicht Realitäten des 18.
Jahrhunderts widerspiegelt. Daher können LLMs zwar leistungsfähige Werkzeuge für die Erforschung und Textgenerierung bieten, können sie daher nicht die strengen, hypothetisch gesteuerten Methoden des traditionellen NLP ersetzen. Ihre Ergebnisse müssen als Ausgangspunkt für die Analyse behandelt werden, keine maßgebliche Schlussfolgerung. Forscher, die LLMs verwenden, sollten immer die Ergebnisse mit Primärquellen verifizieren und ihre Eingabeaufforderungen und Modellversionen dokumentieren, um die Reproduzierbarkeit zu gewährleisten.
Die Rolle der multimodalen Analyse
Die Zukunft der historischen Textanalyse liegt darin, über reinen Text hinauszugehen. Historische Dokumente sind nicht nur Worte; sie sind physische Objekte mit Layout, Illustrationen, Marginalien und Bindung. Multimodale Analyse kombiniert NLP mit Computer Vision, um den Text und das Bild gleichzeitig zu analysieren. Dies ermöglicht es Forschern, die Beziehung zwischen einem Text und seinen Illustrationen zu untersuchen, handschriftliche Anmerkungen neben dem gedruckten Text eines Buches zu analysieren oder manuelle Manuskript-Randialien zu transkribieren und zu indizieren. Zum Beispiel könnte ein Projekt, das frühe moderne alchemistische Abhandlungen untersucht, optische Zeichenerkennung auf den Haupttext verwenden, während Computer Vision angewendet wird, um die komplizierten Zeichnungen von Alembics und Öfen zu identifizieren und zu klassifizieren, die die Anweisungen begleiten.
Dieser integrierte Ansatz bietet eine viel reichere Sicht auf das historische Objekt als Ganzes und eröffnet neue Fragen über das Zusammenspiel von Wort und Bild in der Wissensproduktion.
Humanistische Fragen, Computational Tools
Bei der Integration von Natural Language Processing in die historische Forschung geht es nicht darum, den Historiker aus seiner Arbeit zu automatisieren. Es geht darum, den Umfang dessen zu erweitern, was Historiker wissen können. Rohe Rechenergebnisse sind kein fertiges historisches Argument; es ist ein Beweisstück, das kritische Interpretation erfordert. Der Historiker muss sich fragen: Warum ist dieses Muster entstanden? Was können die Daten nicht erfassen?
Welche Vorurteile sind in das Quellenmaterial oder den Algorithmus eingebettet?
Durch die Beherrschung dieser Werkzeuge können Wissenschaftler die riesigen digitalen Archive des 21. Jahrhunderts mit Zuversicht navigieren. Sie können Hypothesen in großem Maßstab testen, versteckte Einflussmuster aufdecken und differenzierte Fragen über Sprache, Kultur und Macht im Laufe der Zeit stellen. Die digitale Transformation der Geschichte ist keine Bedrohung für die Disziplin; es ist eine Gelegenheit, unsere Methoden zu verfeinern und unser Verständnis der Vergangenheit zu vertiefen. Die überzeugendsten digitalen Geschichten werden immer diejenigen sein, die computergestützte Beweise mit humanistischen Einsichten kombinieren und die Algorithmen nicht als Orakel, sondern als Instrumente der Untersuchung behandeln.