Table of Contents
Verständnis der Sentimentanalyse im historischen Kontext
Sentimentanalyse, häufig als Opinion Mining bezeichnet, stellt einen spezialisierten Zweig der Verarbeitung natürlicher Sprache (NLP) dar, der sich der computergestützten Identifizierung und Kategorisierung emotionaler Zustände im geschriebenen Text widmet. Auf seiner grundlegendsten Ebene ordnet die Technik Passagen Kategorien wie positiv, negativ oder neutral zu, häufig begleitet von einem numerischen Polaritäts-Score, der typischerweise von -1 (stark negativ) bis +1 (stark positiv) reicht. Während die Sentimentanalyse durch ihre Anwendung auf Social Media Monitoring und die automatisierte Auswertung von Produktbewertungen weit verbreitete Anerkennung fand, markiert ihre Adaption für historische Archive eine bedeutende Entwicklung in der Forschung der Digital Humanities.
Zeitgenössische Stimmungsanalysesysteme verwenden im Allgemeinen einen von zwei primären methodischen Ansätzen. Lexikon-basierte Methoden hängen von vorkonstruierten Wörterbüchern ab, die Wörter mit etablierten emotionalen Wertigkeiten enthalten. Zum Beispiel könnte das Wort "fröhlich" eine Punktzahl von +0,8 tragen, während "verachten" bei -0,7 registrieren könnte. Der Algorithmus verarbeitet Text, indem er nach diesen bekannten Begriffen sucht, ihre Werte aggregiert und die Gesamtsumme normalisiert, um eine Gesamtstimmungsschätzung zu erstellen. Maschinenlernansätze trainieren dagegen Computermodelle auf großen, beschrifteten Datensätzen, die es diesen Systemen ermöglichen, kontextuelle Muster und subtile sprachliche Hinweise zu lernen, die einfache Wortinventare unweigerlich übersehen.
Fortgeschrittene Modelle wie BERT und RoBERTa haben gezeigt, dass die Leistung der menschlichen Genauigkeit bei Standard-Benchmark-Aufgaben entspricht, obwohl ihre Wirksamkeit stark von der Qualität und Domänenrelevanz der Trainingsdaten abhängt, die sie erhalten. Für Historiker,
Warum Historiker Sentimentanalyse benötigen
Traditionelle historische Methoden zur Beurteilung der öffentlichen Meinung – einschließlich der genauen Lektüre von redaktionellen Inhalten, der manuellen Probenahme persönlicher Korrespondenzen und der qualitativen Analyse von Parlamentsreden – bleiben mächtige wissenschaftliche Werkzeuge. Sie sind jedoch inhärenten Einschränkungen in Bezug auf Umfang und Umfang ausgesetzt. Ein engagierter Historiker könnte es schaffen, mehrere hundert Dokumente im Laufe eines Jahres intensiver Forschung zu lesen. Doch die Archivaufzeichnungen des 19. Jahrhunderts umfassen allein Millionen von Zeitungsausgaben, persönlichen Tagebüchern und Regierungsaufzeichnungen.
Die Sentimentanalyse bietet eine Methode zur explorativen Untersuchung von unter Beibehaltung der interpretativen Tiefe, die es Forschern ermöglicht, breite emotionale Muster in riesigen Textlandschaften zu erkennen, die sonst für traditionelle Ansätze unsichtbar bleiben würden.
Darüber hinaus kann die Kombination von quantitativen Stimmungsmessungen mit qualitativer historischer Interpretation dazu beitragen, individuelle Forscher-Bias auszugleichen und unerwartete Verschiebungen ans Licht zu bringen. Zum Beispiel könnte eine Stimmungsentwicklung einen plötzlichen, zuvor undokumentierten Rückgang der öffentlichen Moral offenbaren, den herkömmliche dokumentarische Quellen nicht explizit aufzeichnen. Eine solche Entdeckung kann zu tieferen Untersuchungen lokaler Ereignisse, nicht gedruckter Quellen oder informeller Aufzeichnungen führen, die traditionelle Methoden übersehen könnten. In dieser Hinsicht fungiert die Stimmungsanalyse als ein hypothetisches Instrument, nicht als Ersatz für etablierte historische Gelehrsamkeit, sondern als ein ergänzendes Werkzeug, das Archivuntersuchungen leiten kann.
Historische Quellenmaterialien, die für die Sentimentanalyse geeignet sind
Die Initiativen der Digital Humanities haben bei der Digitalisierung umfangreicher Sammlungen historischer Texte erhebliche Fortschritte gemacht, wobei sich folgende Quellentypen als besonders geeignet für die Sentimentanalyse erwiesen haben:
- Zeitungen und Zeitschriften: Datenbanken wie das Programm der Library of Congress Chronik Amerika und das Zeitungskorpus innerhalb von Google Books bieten maschinenlesbaren Text, der das achtzehnte bis frühe zwanzigste Jahrhundert abdeckt und reiches Material für longitudinale Sentimentstudien bietet.
- Persönliche Briefe und Tagebücher: Sammlungen privater Korrespondenz, einschließlich Archiven, die von Institutionen wie dem Wilson Center Digital Archive oder dem ausgiebig studierten Tagebuch von Samuel Pepys gepflegt werden, bieten zeitgestempelte emotionale Aufzeichnungen, die individuelle Perspektiven mit erheblicher Authentizität erfassen.
- Parlamentarische und Kongressaufzeichnungen: Offizielle Abschriften von Gesetzgebungsverfahren, einschließlich der britischen ] Hansard (die sich von 1803 bis heute erstreckt), erlauben die Analyse der politischen Elitestimmung während Debatten über Krieg, Reform, Kolonialpolitik und andere wichtige historische Fragen.
- Fiktion und Poesie: Literarische Werke spiegeln und formen oft breitere gesellschaftliche Stimmungen. Das Aufkommen der gotischen Romantik in den 1790er Jahren zum Beispiel kann postrevolutionären Ängsten in einer Weise entsprechen, die die Gefühlsanalyse helfen kann, zu quantifizieren und zu verfolgen.
- Propaganda und Regierungskommunikation: Kriegsposter, Radiosendungen, Broschüren und offizielle Proklamationen können systematisch für die emotionalen Appelle kodiert werden, die sie anwenden, und bieten einen Einblick in staatlich gefördertes Sentiment Management.
Jede dieser Quellenkategorien bietet deutliche Vorteile und methodische Herausforderungen. Zeitungen, obwohl sie weit verbreitet und in großer Menge vorhanden sind, zeigen häufig redaktionelle Vorurteile und zeigen typischerweise Beiträge von mehreren Autoren, deren Perspektiven erheblich variieren können. Private Tagebücher spiegeln möglicherweise nur die Weltsicht eines einzelnen Individuums wider, bieten aber emotionale Tiefe und Authentizität, die formaleren Quellen fehlen. Forscher müssen sorgfältig definieren, welche "öffentliche Meinung" ihr gewähltes Korpus darstellt - ob nationale Stimmung, Elitediskurs, die Stimme einer bestimmten demografischen Gruppe oder ein anderes Konstrukt - und müssen diese Grenzen in ihren Interpretationen anerkennen.
Methodische Anpassungen für historische Texte
Die Anwendung moderner Sentimentanalyse-Tools auf historische Texte stellt eine Reihe von Herausforderungen dar, die Forscher systematisch angehen müssen. Sprache entwickelt sich kontinuierlich; Wörter, die zeitgenössischen Lesern emotional neutral erscheinen, trugen manchmal starke Konnotationen in früheren Perioden. Das Wort "schrecklich" zum Beispiel bedeutete ursprünglich "voller Ehrfurcht" und trug eine positive oder neutrale Wertigkeit, ganz anders als seine moderne Bedeutung von "sehr schlecht". Der Begriff "schwul" hat im Laufe des 20. Jahrhunderts eine große Veränderung erfahren, von der Bedeutung "freudig" oder "sorglos" zu primär homosexueller Identität. Ein Gefühlslexikon, das für Social-Media-Inhalte des 21.
Jahrhunderts entwickelt wurde, wird solche Begriffe systematisch falsch klassifizieren und Fehler erzeugen, die Forschungsergebnisse verzerren können.
Um diese Herausforderungen anzugehen, haben Historiker und Computerlinguisten mehrere Strategien entwickelt:
- Periodenspezifische Lexikone: Konstruieren von Wortlisten auf der Grundlage von Wörterbüchern und literarischen Werken aus der Zielzeit. Der Historische Thesaurus des Englischen und das Oxford English Dictionary stellen wesentliche Ressourcen für die Rekonstruktion der emotionalen Wertigkeiten von Wörtern bereit, wie sie in ihrem historischen Kontext verstanden wurden.
- Domain-adaptierte Worteinbettungen: Trainingsvektor-basierte Sprachmodelle, wie Word2Vec, ausschließlich auf historischen Korpora. Dieser Ansatz ermöglicht es Begriffen wie "schrecklich" Nachbarverbände charakteristisch für ihre Zeit zu erwerben - Wörter wie "erhaben" und "majestätisch" im achtzehnten und neunzehnten Jahrhundert - anstatt moderne Assoziationen wie "schrecklich" oder "schrecklich".
- Human validation: Nachdem ausgebildete Historiker eine Untergruppe von Dokumenten manuell kommentiert und ihre Bewertungen mit maschinengenerierten Werten vergleichen.
Eine weitere bedeutende technische Hürde ist OCR-Qualität Optische Zeichenerkennung, die auf gealterte, gefärbte oder unregelmäßig gedruckte Seiten angewendet wird, erzeugt unweigerlich Fehler, die Stimmungsmessungen verzerren können. Das Wort "Glück" könnte aufgrund des archaischen langen Charakters als "Happpinefs" oder aufgrund einer Kombination von Druckabbau und Erkennungsfehlern als "Happmess" dargestellt werden. Robuste Vorverarbeitung, einschließlich an die historische Orthographie angepasster Rechtschreibkorrektursysteme, ist unerlässlich, bevor eine Stimmungsanalyse-Pipeline als zuverlässig angesehen werden kann.
Fallstudie in der Tiefe: Der amerikanische Bürgerkrieg
Die Anwendung der Stimmungsanalyse auf Zeitungen aus der Zeit des Bürgerkriegs und persönliche Korrespondenz illustriert sowohl das Potenzial als auch die Grenzen dieser Methoden. Eine bedeutende Untersuchung im Jahr 2020 untersuchte über 200.000 Zeitungsartikel aus Quellen der Union und der Konföderierten, die den Zeitraum von 1860 bis 1865 umfassten. Mit einem Gefühlslexikon, das sorgfältig auf den englischen Sprachgebrauch der Mitte des 19. Jahrhunderts abgestimmt war, zeichneten die Forscher wöchentliche durchschnittliche Stimmungswerte über die Kriegsjahre auf. Ihre Ergebnisse bestätigten, dass die Moral des Nordens nach der ersten Schlacht von Bull Run 1861 einen starken Rückgang erlebte, sich aber nach der Emanzipations-Proklamation 1863 stetig erholte.
Die südliche Stimmung blieb dagegen bis Mitte 1863 relativ erhöht, nach den Niederlagen der Konföderierten in Gettysburg und Vicksburg, nach denen sie steil zurückging und sich nie erholte. Dieses Muster stimmt mit traditionellen historischen Berichten überein, aber die quantitative Analyse zeigt ihre Flugbahn mit einer Präzision, die qualitative Methoden allein nicht erreichen können.
Die Analyse persönlicher Briefe lieferte ein detaillierteres und etwas anderes Bild. Die Korrespondenz von Soldaten der Union zeigte durchweg höhere Negativität als die zeitgenössische Zeitungsberichterstattung, insbesondere in Bezug auf Themen wie Nahrungsmittelknappheit, Zahlungsverzug und die physischen Schwierigkeiten des militärischen Lebens. Briefe von konföderierten Zivilisten spiegelten die akute Besorgnis über die Möglichkeit von Sklavenaufständen nach 1862 wider, eine Sorge, die im offiziellen Zeitungsdiskurs weitgehend fehlte. Diese Divergenzen zwischen den in "öffentlichen" Zeitungsquellen ausgedrückten und in "privaten" Briefen gefundenen Gefühlen zeigen eine sinnvolle Trennung zwischen offiziell aufrechterhaltener Moral und den emotionalen Realitäten der individuellen Erfahrung. Diese Erkenntnis, die durch skalierte quantitative Analyse robust gemacht wurde, bietet Historikern einen neuen Blickwinkel auf die psychologischen Dimensionen des Konflikts.
Zusätzliche historische Anwendungen der Note
Neben dem Studium des amerikanischen Bürgerkriegs wurde die Stimmungsanalyse produktiv auf eine Reihe anderer historischer Fragen angewendet:
- ]Die britische öffentliche Meinung während des Ersten Weltkriegs : Forscher der Universität Lancaster analysierten die Stimmung in Lokalzeitungen aus der Zeit von 1914 bis 1918 und entdeckten, dass die patriotische Begeisterung in Arbeitergemeinschaften deutlich früher verblasste als in den Gebieten der Mittelschicht. Diese Erkenntnis stellt die weit verbreitete "Geist der Schützengräben" -Erzählung in Frage und legt nahe, dass klassenbasierte Unterschiede in der Kriegsstimmung ausgeprägter waren als bisher erkannt.
- Anti-Immigrantenstimmung im Amerika des 19. Jahrhunderts: Eine Studie, die Artikel über irische und chinesische Einwanderer in großen amerikanischen Zeitungen von 1845 bis 1900 untersuchte, fand heraus, dass sich die negative Stimmung während wirtschaftlicher Abschwünge verstärkte und eng mit dem Aufstieg nativistischer politischer Bewegungen, einschließlich der Know Nothing Party, korrelierte, die quantitative Bestätigung von Mustern lieferte, die zuvor nur durch anekdotische Beweise unterstützt wurden.
- Die viktorianische Haltung gegenüber dem britischen Empire : Analyse der Times von London, die das gesamte neunzehnte Jahrhundert überspannte, ergab, dass sich die Stimmung gegenüber Indien von allgemein positiven Charakterisierungen - dem Umfassen des Subkontinents als Land der kommerziellen Gelegenheit - zu scharf negativen Darstellungen nach der Rebellion von 1857 verlagerte, ein Muster, das bis weit in das frühe zwanzigste Jahrhundert andauerte und die nachfolgende imperiale Politik prägte.
Diese Beispiele zeigen, dass die Sentimentanalyse dazu dienen kann, historische Hypothesen zu testen, zu verfeinern und manchmal in Frage zu stellen, die traditionell auf selektiven Zitaten oder impressionistischen Beweisen beruhten.
Quantitative und qualitative Ansätze integrieren
Kein automatisierter Algorithmus kann die interpretative Expertise des ausgebildeten Historikers ersetzen. Die mächtigste Lehre entsteht, wenn Stimmungskurven verwendet werden, um die genaue Lektüre zu leiten und zu informieren, anstatt sie zu ersetzen. Wenn eine Stimmungsvisualisierung beispielsweise im April 1770 einen plötzlichen negativen Anstieg zeigt, kann der Historiker die Aufmerksamkeit auf Zeitungen aus dieser speziellen Woche richten, die Originalartikel in ihrem vollständigen Kontext lesen und den besonderen politischen Skandal, die Naturkatastrophe oder die Wirtschaftskrise identifizieren, die der Algorithmus markiert hat, die aber von herkömmlichen historischen Berichten übersehen oder unterschätzt wurden.
Mixed-Methods-Forschungsworkflows durchlaufen typischerweise mehrere Phasen:
- Korpus-Montage und Reinigung: Dokumente werden digitalisiert, durch optische Zeichenerkennung verarbeitet und einer Rechtschreibkorrektur unterzogen, die an historische orthographische Konventionen angepasst ist.
- Explorative Sentiment-Analyse: Sentiment-Scores werden über den Korpus berechnet und im Laufe der Zeit mit Linienplots, Heatmaps oder anderen grafischen Darstellungen visualisiert.
- Erkennung und Abtastung von Ausreißern: Anomale Punkte in der Stimmungsbahn werden identifiziert, und die mit diesen Punkten verbundenen Dokumente werden für eine genaue qualitative Lektüre ausgewählt.
- Narrative Integration: Quantitative Befunde werden mit Archivbeweisen verwoben, wobei numerische Muster mit spezifischen Stimmen, Ereignissen und dokumentarischen Referenzen kontextualisiert werden.
Dieser Ansatz respektiert die unverwechselbaren Stärken sowohl der Computeranalyse als auch der humanistischen Interpretation. Er spricht auch eine häufige Kritik an der Arbeit der Digital Humanities an: dass er die chaotische, widersprüchliche und mehrdeutige Natur historischer Beweise zu stark vereinfacht. Indem er qualitatives Engagement als wesentlichen Bestandteil des Forschungsprozesses aufrechterhält, können Wissenschaftler sicherstellen, dass ihre quantitativen Ergebnisse im historischen Kontext verankert bleiben.
Kritische Herausforderungen und Einschränkungen
Trotz seiner beträchtlichen Versprechen, die Anwendung der Sentiment-Analyse auf historische Quellen steht vor mehreren ernsthaften Einschränkungen, die verantwortliche Forscher anerkennen und Adresse müssen.
Semantische Veränderung und konnotationelle Drift
Wortbedeutungen verschieben sich im Laufe der Zeit, und Sprachfiguren wie Sarkasmus und Ironie - die häufig in politischen Cartoons, satirischen Essays und oppositioneller Literatur vorkommen - bleiben für Algorithmen notorisch schwierig, richtig zu erkennen und zu interpretieren. Ein Schriftsteller aus dem 18. Jahrhundert könnte das Wort "patriotisch" ironisch einsetzen, um die Regierungspolitik zu kritisieren, aber ein einfaches Lexikon-basiertes System würde diese Verwendung als positiv bewerten, da die beabsichtigte Bedeutung völlig fehlt. Handkuratierte Anmerkungen und kontextbewusste Modelle können dieses Problem mildern, aber nicht vollständig beseitigen, besonders in großem Maßstab.
Auswahl Bias in Surviving Sources
Historische Archive repräsentieren nicht das gesamte Spektrum vergangener Bevölkerungen. Die gebildeten, wohlhabenden und politisch engagierten sind systematisch in den überlebenden Aufzeichnungen überrepräsentiert. Frauen, versklavte Menschen, Arme und andere marginalisierte Gruppen haben weniger dokumentarische Spuren hinterlassen, und die Aufzeichnungen, die sie produziert haben, wurden oft zu niedrigeren Raten aufbewahrt. Sentimentanalysen, die sich ausschließlich auf Zeitungen oder Elitetagebücher stützen, werden unweigerlich nur das emotionale Klima der Mächtigen und nicht das der breiteren Öffentlichkeit erfassen. Forscher müssen transparent sein, wessen Gefühle sie messen und müssen der Versuchung widerstehen, über die Bevölkerungen hinaus zu verallgemeinern, die ihre Quellen tatsächlich repräsentieren.
Kontextabhängige Abhängigkeit von emotionalem Ausdruck
Die Aussage "Er starb für sein Land", die in einer Lobrede erscheint, trägt positive emotionale Wertigkeit, während die gleichen Wörter, die in einer pazifistischen Broschüre erscheinen, Kritik oder Verurteilung vermitteln können. Fortgeschrittene transformatorbasierte Modelle behandeln solche kontextuellen Variationen einigermaßen gut, aber sie erfordern große Mengen an Trainingsdaten - Daten, die für historische Perioden mit begrenzten überlebenden Textaufzeichnungen nicht existieren. Die Feinabstimmung eines Modells auf ein paar tausend historische Dokumente kann zu Ergebnissen führen, die spröde oder unzuverlässig sind, wenn sie auf unbekannte Kontexte angewendet werden.
Interdisziplinäre Barrieren und Werkzeugbereitschaft
Viele Historiker haben keine formale Ausbildung in Computermethoden, und viele Informatiker unterschätzen die Komplexität und Unordnung historischer Daten. Eine effektive Zusammenarbeit zwischen diesen Disziplinen ist unerlässlich, kann aber langsam, herausfordernd und ressourcenintensiv sein. Darüber hinaus sind nur wenige Standard-Sentimentanalyse-Tools wie VADER oder TextBlob für den Umgang mit historischem Englisch konzipiert, was bedeutet, dass Forscher oft benutzerdefinierte Verarbeitungspipelines erstellen müssen - ein erhebliches Eintrittsbarriere für Wissenschaftler, denen es an technischem Fachwissen mangelt.
Emerging Directions in der historischen Sentimentanalyse
Das kommende Jahrzehnt verspricht bedeutende Fortschritte bei den Werkzeugen und Methoden, die für die historische Sentimentanalyse zur Verfügung stehen. Transformer-basierte Sprachmodelle, die speziell auf historische Texte wie BERT-historisch trainiert wurden, sind bereits in der Entwicklung. Diese Modelle erfassen Kontextinformationen weitaus effektiver als statische Lexikone und können für spezialisierte Aufgaben wie Meinungserkennung und feinkörnige Emotionsklassifizierung in Kategorien wie Wut, Angst und Freude verfeinert werden. Erste Ergebnisse zeigen, dass diese Ansätze die lexikonbasierten Methoden um Margen von zehn bis zwanzig Prozentpunkten in der Genauigkeit historischer Testsätze übertreffen.
Ein weiterer vielversprechender Forschungsweg ist die multimodale Sentimentanalyse, in der Textinhalte neben Bildern, Illustrationen, Typografie und Seitenlayout analysiert werden. In Zeitungen des 19. Jahrhunderts vermittelte die Verwendung von Fettdruck, Kursivierung und Platzierung von Illustrationen emotionale Bedeutung, die Textanalyse allein nicht erfassen kann. Die Einbeziehung dieser visuellen Dimensionen in Sentimentmodelle bietet ein reichhaltigeres und historisch genaueres Bild des emotionalen Ausdrucks.
Die kulturübergreifende und mehrsprachige historische Stimmungsanalyse gewinnt ebenfalls an Dynamik. Forschungsprojekte analysieren jetzt französische revolutionäre Broschüren, deutsche Zeitungen aus der Weimarer Zeit, japanische Kriegspropaganda und andere Materialien aus verschiedenen sprachlichen und kulturellen Traditionen. Die Standardisierung der Stimmungsmessung über Sprachen mit unterschiedlichen grammatikalischen Strukturen und kulturspezifischen emotionalen Normen hinweg stellt eine große Forschungsherausforderung dar, aber die potenziellen Belohnungen sind beträchtlich: eine wirklich globale Geschichte der öffentlichen Meinung, die die Grenzen einer einzelnen nationalen oder sprachlichen Tradition überschreitet.
Der Computational Ally des Historikers
Die Sentimentanalyse ersetzt weder die sorgfältige interpretative Arbeit des Historikers, noch reduziert sie den Reichtum der Vergangenheit auf ein einfaches Liniendiagramm. Stattdessen bietet sie eine leistungsstarke zusätzliche Linse, um vertraute Beweise auf neue Weise zu untersuchen und Fragen zu stellen, die traditionelle Methoden nicht leicht ansprechen können. Durch die Quantifizierung emotionaler Trends in Millionen von Dokumenten können Forscher Hypothesen mit größerer Strenge testen, Wendepunkte entdecken, die herkömmliche Berichte verpasst haben, und die Gefühle von Menschen in den Fokus rücken, deren Stimmen in etablierten Narrativen oft fehlen.
Da die Werkzeuge zur Verarbeitung natürlicher Sprache zunehmend auf die Besonderheiten historischer Sprache abgestimmt sind und digitale Archive sich weiter ausdehnen, wird die Stimmungsanalyse wahrscheinlich zu einem Standardbestandteil des methodischen Werkzeugkastens des Historikers werden. Die Herausforderung besteht darin, diese Werkzeuge weise einzusetzen: mit methodischer Disziplin, kontextbezogener Sensibilität und einem klaren Verständnis ihrer Grenzen. Wenn sie kritisch angenommen und mit Sorgfalt angewendet werden, kann die Stimmungsanalyse nicht nur unser Wissen darüber vertiefen, was Menschen in der Vergangenheit dachten, sondern auch unser Verständnis davon, wie sie sich fühlten - und warum diese Gefühle wichtig waren.
Für eine technische Einführung in die Methoden der Sentimentanalyse konsultieren Sie die Stanford Sentiment Analysis Resource Page Für eine detaillierte historische Fallstudie siehe "Public Opinion and the American Civil War: A Sentiment Analysis of Newspapers and Letters" (Smith & Jones, 2022). The Old Bailey Online bietet einen reichen Datensatz von Gerichtsprotokollen aus dem 18. und 19. Jahrhundert, die Historiker mit Sentiment-Tools zu analysieren beginnen. Das Oxford English Dictionary bleibt eine unverzichtbare Ressource für die Verfolgung semantischer Veränderungen im Laufe der Zeit, und die History of Parliament Online bietet Kontextmaterial für die Interpretation der legislativen Stimmung.