Die Anwendung der Sentimentanalyse auf die historische persönliche Korrespondenz

Sentiment Analysis, ein Zweig der Verarbeitung natürlicher Sprache (NLP), ist zu einem wertvollen Werkzeug für Historiker geworden, die persönliche Korrespondenz aus der Vergangenheit studieren. Durch die Analyse des emotionalen Tons von Briefen und Tagebüchern können Forscher Einblicke in individuelle Erfahrungen und gesellschaftliche Stimmungen in bestimmten historischen Perioden gewinnen. In den letzten zehn Jahren hat die Schnittstelle von Computerlinguistik und historischer Forschung neue Wege eröffnet, um zu verstehen, wie Menschen in früheren Epochen Freude, Trauer, Angst oder Hoffnung ausgedrückt haben. Dieser Artikel bietet einen eingehenden Einblick in die Anwendung der Sentimentanalyse auf historische persönliche Korrespondenz, die damit verbundenen technischen und methodischen Herausforderungen, illustrative Fallstudien und die Zukunft dieses aufstrebenden Feldes.

Die Ursprünge und Evolution der Sentimentanalyse

Sentimentanalyse, auch bekannt als Opinion Mining, entstand in den frühen 2000er Jahren als Teilfeld von NLP, das darauf abzielte, automatisch Emotionen zu erkennen und zu quantifizieren, die in Text ausgedrückt werden. Frühe Systeme stützten sich auf lexikalische Ansätze - Wörterbücher von Wörtern, die mit emotionaler Wertigkeit (positiv oder negativ) und Intensität gekennzeichnet sind. Zum Beispiel würde ein Wort wie "fröhlich" eine hohe positive Punktzahl haben, während "Verzweiflung" stark negativ wäre. Spätere Methoden beinhalteten maschinelle Lernklassifikatoren, die auf kommentierten Korpora trainiert wurden, und moderne Systeme verwenden heute Deep Learning-Modelle wie BERT und GPT, die Kontext und Nuancen erfassen.

Wenn sie auf historische Texte angewendet wird, muss die Stimmungsanalyse mit einer Sprache umgehen, die sich signifikant entwickelt hat. Ein Wort, das im 18. Jahrhundert eine neutrale Konnotation hatte, könnte jetzt ein anderes emotionales Gewicht haben. Zum Beispiel bedeutete der Begriff "schrecklich" ursprünglich "voller Ehrfurcht" (potenziell positiv), bevor er zu einer negativen Bedeutung wechselte. Um solche Verschiebungen zu bewältigen, bauen Forscher oft benutzerdefinierte Lexikone, die den historischen Gebrauch oder Feinabstimmungsmodelle auf periodenspezifischen Trainingsdaten widerspiegeln. Projekte wie der Corpus des historischen amerikanischen Englisch (COHA) haben Linguisten ermöglicht, semantische Veränderungen im Laufe der Zeit zu verfolgen, eine Ressource, die Gefühlsanalytiker nutzen können.

Technische Ansätze: Vom Lexikon zum Deep Learning

Lexikonbasierte Methoden

Die einfachste Form der Sentimentanalyse verwendet ein vordefiniertes Wörterbuch von Wörtern und ihren Sentiment-Scores. Tools wie VADER (Valence Aware Dictionary and sEntiment Reasoner) sind für soziale Medien konzipiert, wurden aber für historische Texte angepasst. In einer Studie von Die Briefe der Soldaten des Bürgerkriegs verwendeten die Forscher ein modifiziertes Lexikon, das Slang- und Regionalausdrücke des 19. Jahrhunderts enthielt. Die Ergebnisse zeigten deutliche Rückgänge in der Stimmung um große Schlachten, gefolgt von vorsichtigem Optimismus während der Pausen im Kampf.

Klassifikatoren für maschinelles Lernen

Machine Learning-Ansätze trainieren ein Modell (z. B. unterstützende Vektormaschinen, zufällige Wälder) auf einem beschrifteten Datensatz historischer Buchstaben. Annotatoren codieren manuell eine Stichprobe von Buchstaben für die Gesamtstimmung (positiv, negativ, neutral) und oft für spezifische Emotionen (Angst, Traurigkeit, Wut, Überraschung). Das Modell lernt dann Muster - nicht nur Wortpräsenz, sondern auch Wortordnung und Interpunktion. Zum Beispiel korrelieren häufige Ausrufezeichen in viktorianischen Buchstaben oft mit erhöhten Emotionen. Eine 2022-Studie von Benoît und Kollegen analysierte 10.000 Briefe aus dem 18. Jahrhundert Frankreich mit einer Genauigkeit von 82% bei der Identifizierung negativer Gefühle während Jahren schlechter Ernten.

Deep Learning und Transformers

Transformer wie BERT (Bidirektionale Encoder-Repräsentationen von Transformern) haben die Stimmungsanalyse revolutioniert, indem sie den Kontext bidirektional verstehen. Für historische Texte verwenden Forscher oft Modelle, die auf großen historischen Korpora vortrainiert sind, wie Historischer BERT (trainiert auf Texten von 1500-1900). Die Feinabstimmung dieser Modelle auf einem kleinen Satz kommentierter historischer Buchstaben liefert starke Ergebnisse. Eine Studie von Holocaust-Testimonies verwendete ein fein abgestimmtes BERT-Modell, um Emotionen in Überlebensbriefen zu verfolgen, die während und nach dem Zweiten Weltkrieg geschrieben wurden, um eine Verschiebung von Verzweiflung zu bewachter Hoffnung zu identifizieren, die bekannte historische Ereignisse widerspiegelte.

Herausforderungen der Sentimentanalyse für historische Korrespondenz

Trotz seines Versprechens stellt die Anwendung der Sentimentanalyse auf historische persönliche Korrespondenz einzigartige Schwierigkeiten dar, die eine sorgfältige methodische Aufmerksamkeit erfordern.

Archaische Sprache und semantische Drift

Wortbedeutungen ändern sich im Laufe der Zeit. „Nice“ bedeutete einst „töricht“ (13. Jahrhundert), bevor es seinen modernen positiven Sinn annahm. „Silly“ bedeutete ursprünglich „gesegnet“ oder „unschuldig“. Ein Gefühlsanalysator, der sich solcher Verschiebungen nicht bewusst ist, kann irreführende Ergebnisse liefern. Forscher mildern dies ab, indem sie benutzerdefinierte Lexikone aus historischen Wörterbüchern erstellen oder Worteinbettungen verwenden, die auf periodenspezifischen Texten trainiert werden. Das Projekt Stanford Historical Word Vectors bietet Einbettungen für mehrere Jahrhunderte, so dass Modelle wechselnde Wortbedeutungen erfassen können.

Schreibvarianten und Handschrift

Persönliche Briefe aus der Zeit vor dem 20. Jahrhundert enthalten oft inkonsistente Rechtschreibung, sogar vom selben Autor. "Würde" könnte als "wou'd" erscheinen, "Freude" als "joy" und "empfangen" als "empfangen". Standard-Rechtschreibung wurde nicht durchgesetzt, und viele Autoren verwendeten phonetische Rechtschreibungen, die von regionalen Dialekten beeinflusst wurden. Optische Zeichenerkennung (OCR) führt häufig zu Fehlern, indem sie "Hoffnung" in "Houh" oder "glücklich" in "happp" verwandelt. Diese Fehler verschlechtern die Stimmungsklassifizierung. Eine Lösung ist die Verwendung moderner OCR-Engines, die auf historischen Schriftarten trainiert werden, oder manuell korrigieren eine Teilmenge. Für maschinelles Lernen können Modelle auf lautem Text trainiert werden, aber die Genauigkeit nimmt oft ab.

Kontext und subtile Emotionen

Gefühlsanalysen vereinfachen Emotionen oft in positive/negative oder grundlegende Kategorien, aber historische Briefe vermitteln komplexe Gefühle. Ein Brief kann Trauer über ein krankes Kind ausdrücken und gleichzeitig Dankbarkeit für die Unterstützung eines Freundes ausdrücken. Gemischte Emotionen sind üblich. Darüber hinaus unterschieden sich emotionale Normen über Zeit und Kultur. Im 18. Jahrhundert wurde das Ausdrücken starker Emotionen in Briefen oft als unpassend angesehen, so dass Gefühle unterschätzt werden können. Forscher müssen dies durch die Verwendung feinkörniger Emotionskategorien (z. B. Plutchiks acht primäre Emotionen) und durch die Berücksichtigung der rhetorischen Konventionen des Briefschreibens in dieser Zeit angehen.

Datensparten und Repräsentativität

Die Briefe der Reichen und Literaten sind überrepräsentiert; die der Armen, Frauen und marginalisierten Gruppen sind seltener. Sentimentanalyseergebnisse, die auf überlebenden Briefen basieren, können das emotionale Leben der Privilegierten widerspiegeln, nicht die allgemeine Bevölkerung. Forscher müssen diese Voreingenommenheit anerkennen und, wenn möglich, durch Tagebücher, Memoiren oder andere Aufzeichnungen ergänzen. Zum Beispiel verwendete eine Studie von Einwandererbriefen von Ellis Island (1900-1920) Briefe aus einer Reihe sozioökonomischer Hintergründe, indem sie auf ethnische Zeitungen abzielte, die Immigranten-Narrative veröffentlichten.

Fallstudien: Sentimentanalyse in der historischen Forschung

Bürgerkriegsbriefe und Soldatenmoral

Eine der am weitesten untersuchten Körper der persönlichen Korrespondenz sind die Briefe von amerikanischen Bürgerkriegssoldaten. In einer wegweisenden Studie verwendeten Historiker eine Kombination aus Lexikon-basierten und maschinellen Lernmethoden, um über 20.000 Unions- und Konföderiertenbriefe zu analysieren. Sie fanden heraus, dass die Moral für beide Seiten nach 1863 stetig abnahm, wobei die konföderierten Schriftsteller nach der Schlacht von Gettysburg deutlich negativere Gefühle ausdrückten Interessanterweise zeigten Briefe von afroamerikanischen Soldaten nach Emanzipationsankündigungen positive Gefühle, auch wenn ihre materiellen Bedingungen hart blieben.

Viktorianische Ära Emotionen und soziale Konventionen

Das viktorianische Schreiben folgte starren Konventionen der Etikette, die echte Gefühle maskieren konnten. Ein Brief könnte mit "Ich bin traurig, ..." als Formel beginnen, auch wenn der Autor wenig Emotionen verspürte. Die Gefühlsanalyse mit BERT, das auf einem Korpus von 5.000 viktorianischen Briefen (1850-1900) aus dem Vereinigten Königreich fein abgestimmt war, konnte formelhafte Ausdrücke von echten emotionalen Inhalten durch die Analyse des umgebenden Kontexts unterscheiden. Das Modell identifizierte, dass Ausdrücke von Trauer authentischer waren, wenn sie von Erwähnungen bestimmter Erinnerungen oder Aufgaben begleitet wurden (z. B. "Ich besuchte sein Grab heute"). Dies ermöglichte es den Forschern, authentische Trauerereignisse über die viktorianische Lebensdauer hinweg abzubilden und Spitzenwerte in der Korrespondenz nach der Säuglingssterblichkeit und während des Krimkrieges zu finden.

Holocaust-Überlebende Briefe und Trauma

Briefe, die von Holocaust-Überlebenden unmittelbar nach der Befreiung geschrieben wurden, bieten ein einzigartiges Fenster in posttraumatische Emotionen. Ein Gemeinschaftsprojekt zwischen Historikern und Informatikern analysierte 2.000 Briefe aus den Archiven des United States Holocaust Memorial Museum. Mit einem Deep Learning-Modell, das auf Zeugnissen von Überlebenden trainiert wurde, verfolgten sie die Stimmung im Laufe der Zeit. Briefe von 1945-1946 zeigten ein hohes Maß an Wut und Verzweiflung, aber 1948, als Überlebende emigrierten oder Familien wieder aufbauten, stieg die positive Stimmung allmählich an. Das Modell kennzeichnete jedoch auch viele Briefe mit neutraler Stimmung, die nach menschlicher Überprüfung eine stoische Unterdrückung von Emotionen zeigten - ein Überlebensmechanismus. Dies hob die Notwendigkeit hervor, Computeranalysen mit genauer Lektüre zu kombinieren.

Vorteile der Sentimentanalyse für die historische Forschung

Bei sorgfältiger Anwendung bietet die Sentimentanalyse mehrere konkrete Vorteile:

  • Skalierbarkeit: Forscher können Millionen von Buchstaben in Stunden verarbeiten und breite emotionale Muster identifizieren, die jahrelanges manuelles Lesen erfordern würden.
  • Temporale Granularität: Durch die Analyse der Stimmung pro Monat oder sogar pro Tag können Historiker emotionale Verschiebungen mit bestimmten Ereignissen (z. B. Schlachten, wirtschaftliche Depressionen, Feiertage) korrelieren.
  • Hypothesen-Generierung: Unerwartete Muster – wie ein Anstieg der positiven Stimmung während einer Hungersnot – können neue Forschungsfragen und tiefere Archivuntersuchungen auslösen.
  • Vergleichende Analyse: Sentimentprofile können über verschiedene Populationen (Gender, Klasse, Nationalität) verglichen werden, um unterschiedliche Erfahrungen des gleichen historischen Ereignisses zu offenbaren.

Ethische Überlegungen und historische Verantwortung

Die Anwendung automatisierter Werkzeuge auf zutiefst persönliche Dokumente wirft ethische Fragen auf. Historische Briefe wurden oft mit der Erwartung der Privatsphäre geschrieben. Während die meisten jetzt in öffentlichen Archiven sind, können Familien immer noch Sensibilitäten haben. Forscher müssen die Würde der Schriftsteller respektieren und vermeiden, ihr Leben auf Statistiken zu reduzieren. Darüber hinaus kann die Stimmungsanalyse reduktiv sein; ein Etikett von "negativ" erfasst nicht den Reichtum der Liebe eines trauernden Elternteils oder der Angst eines Soldaten, gemischt mit Stolz. Die beste Praxis ist es, die Stimmungsanalyse als eine Ebene von Beweisen darzustellen, die immer im historischen Kontext basieren und durch qualitative Analyse ergänzt werden.

Ein weiterer Grund zur Sorge ist algorithmische Verzerrung. Ein Klassifikator, der in modernem Englisch ausgebildet ist, kann historische Briefe aus nichtwestlichen Kulturen falsch einschätzen. Zum Beispiel können Briefe aus dem Japan des 19. Jahrhunderts (wenn übersetzt) höfliche Formulierungen verwenden, die negative Gefühle maskieren. Forscher sollten Modelle auf kulturspezifischen Testsets validieren und, wenn möglich, Historiker einbeziehen, die mit der Periode und Region vertraut sind in Training und Bewertung.

Zukünftige Richtungen

Das Feld der historischen Sentimentanalyse entwickelt sich rasant.

Multimodale Analyse

Persönliche Korrespondenz enthält oft visuelle Elemente: Handschrift schräg, Tintenfarbe, Unterstreichen, eingefügte Zeichnungen. Modernes Computersehen kann Merkmale aus digitalisierten Buchstaben extrahieren (z. B. Druckintensität, Zeilenabstand) und sie mit emotionalen Zuständen korrelieren. Ein verängstigter Autor könnte mit stärkerem Druck oder größeren Buchstaben schreiben. Die Integration dieser visuellen Hinweise in Textstimmung könnte nuanciertere Lesungen erzeugen.

Sprach- und Kulturübergreifende Modelle

Die meisten Instrumente zur Sentimentanalyse sind für Englisch konzipiert. Die Erweiterung auf andere Sprachen (Französisch, Deutsch, Chinesisch, Arabisch) ist für die Weltgeschichte von entscheidender Bedeutung. Bei mehrsprachigen historischen Briefsammlungen (z. B. aus Kolonialverwaltungen) müssen Modelle mit Codewechsel und Übersetzungen umgehen. Der Transfer von Lerndaten aus großen mehrsprachigen Modellen wie XLM-RoBERTa bietet einen Weg nach vorne.

Erklärbare KI für Historiker

Historiker mögen sich vor Blackbox-Modellen hüten. Neue Erklärbarkeitstechniken (SHAP, LIME) können hervorheben, welche Wörter oder Phrasen einen Sentiment-Score ausgelöst haben, so dass Forscher nach anachronistischen Interpretationen suchen können. Werkzeuge, die visuelle Erklärungen liefern - wie eine Heatmap emotionaler Schlüsselwörter in einem Brief - können Vertrauen aufbauen und eine genauere Lektüre erleichtern.

Integration mit Geodaten und demografischen Daten

Die Kombination von Stimmungsanalysen mit GIS-Mappings, in denen Briefe geschrieben wurden, und demografischen Metadaten über Schriftsteller (Alter, Geschlecht, Beruf) kann zeigen, wie sich der emotionale Ausdruck je nach Standort und sozialer Gruppe unterscheidet.

Schlussfolgerung

Sentimentanalyse der historischen persönlichen Korrespondenz ist eine mächtige Ergänzung des Werkzeugkastens des Historikers. Sie ermöglicht eine groß angelegte, quantitative Untersuchung des emotionalen Ausdrucks im Laufe der Zeit, die Aufschluss darüber gibt, wie gewöhnliche Menschen ihr inneres Leben erlebt und kommuniziert haben. Die Methode ist jedoch kein Ersatz für traditionelle Gelehrsamkeit. Sie funktioniert am besten, wenn sie mit tiefem Kontextwissen, sorgfältiger Aufmerksamkeit für den sprachlichen Wandel und einer ethischen Verpflichtung für die Menschlichkeit der Schriftsteller kombiniert wird. Da die Werkzeuge anspruchsvoller und zugänglicher werden, können wir ein reicheres, differenzierteres Verständnis der Vergangenheit erwarten - eines, das nicht nur auf öffentliche Erklärungen und offizielle Aufzeichnungen hört, sondern auch auf die ruhigen Stimmen in persönlichen Briefen.

Für weitere Lektüre zu computergestützten Ansätzen für historische Texte bietet die Debates in the Digital Humanities series hervorragende methodische Übersichten. Die Linguistic Society of America bietet Anleitungen zum Sprachwechsel, die für den Aufbau historischer Gefühlslexika nützlich sind. Für diejenigen, die sich für die technische Seite interessieren, enthält die ACL Anthology viele relevante Artikel zur Gefühlsanalyse für historische Domänen.