Table of Contents
Begrijpen sentiment analyse in historische context
Sentimentanalyse, vaak beschreven als opinie mining, vertegenwoordigt een gespecialiseerde tak van natuurlijke taalverwerking (NLP) gewijd aan de computationele identificatie en categorisatie van emotionele toestanden binnen geschreven tekst. Op het meest fundamentele niveau, de techniek wijst passages toe aan categorieën zoals positief, negatief, of neutraal, vaak vergezeld van een numerieke polariteitsscore die meestal varieert van -1 (sterk negatief) tot +1 (sterk positief). Terwijl sentimentsanalyses een wijdverspreide erkenning kregen door de toepassing ervan op social media monitoring en de geautomatiseerde evaluatie van productbeoordelingen, markeert de aanpassing voor historische archieven een significante ontwikkeling binnen het onderzoek van digitale geesteswetenschappen.
Voor de toepassing van deze methoden is een solide greep op de essentiële grondslagen voor de kritische beoordeling van de betrouwbaarheid van de eeuwen nodig, die door de oude bronnen kan worden gegenereerd. De huidige sentimentanalysesystemen maken meestal gebruik van een van de twee primaire methodologische benaderingen. [Lexicon gebaseerde methoden[] zijn afhankelijk van vooraf gebouwde woordenboeken die woorden bevatten met gevestigde emotionele valenties. Bijvoorbeeld, het woord "plezierig" kan een score van +0.8, terwijl "despise" zich kan registreren op -0.7. De algoritmeprocessen tekst door het scannen van deze bekende termen, het aggregeren van hun scores, en normaliseren van het totaal om een algemene sentimentschatting te produceren. [Machine learning approaching approachs[[[[]], daarentegen, train computational models on large, labeled datasets, waardoor deze systemen contextuele patronen kunnen leren en subtiele taalkundige cues die een onomsite hebben. Geavanceerde modellen zoals
Waarom historici behoefte aan sentiment analyse
Traditionele historische methoden voor het beoordelen van de publieke opinie.Inclusief het goed lezen van redactionele inhoud, het handmatig sampling van persoonlijke correspondentie, en kwalitatieve analyse van parlementaire toespraken. Echter, ze geconfronteerd met inherente beperkingen in schaal en omvang. Een toegewijde historicus zou erin slagen om honderden documenten te lezen in de loop van een jaar van intensief onderzoek. Toch de archiefrecord van de negentiende eeuw alleen al omvat miljoenen kranten edities, persoonlijke dagboeken, en overheid verslagen. Sentiment analyse biedt een methode voor scalering verkennend onderzoek met behoud van interpretatieve diepte, waardoor onderzoekers kunnen brede emotionele patronen detecteren in grote tekstuele landschappen die anders onzichtbaar zouden blijven voor traditionele benaderingen.
Bovendien kan de combinatie van kwantitatieve sentimentmetingen met kwalitatieve historische interpretatie helpen om individuele vooroordelen van onderzoekers te compenseren en onverwachte verschuivingen aan het licht te brengen. Zo kan een sentimentstraject een plotselinge, voorheen niet-gedocumenteerde afname van het publieke moreel onthullen die conventionele documentaire bronnen niet expliciet vastleggen. Zo'n bevinding kan leiden tot dieper onderzoek naar lokale gebeurtenissen, niet-bedrukte bronnen of informele verslagen die traditionele methoden over het hoofd zouden kunnen zien. In dit opzicht functioneert sentimentsanalyse als een hypothetisch instrument, niet als vervanging van gevestigde historische geleerdheid, maar als een aanvullend instrument dat archivalisch onderzoek kan leiden.
Historische bronmaterialen geschikt voor sentimentsanalyse
De initiatieven van de digitale geesteswetenschappen hebben aanzienlijke vooruitgang geboekt bij het digitaliseren van uitgebreide verzamelingen historische teksten.
- Kranten en tijdschriften: Databanken zoals de Bibliotheek van Congres's Chronicling America] programma en het krantencorpus binnen Google Books bieden machineleesbare tekst die de achttiende tot begin twintigste eeuw bestrijkt, die rijk materiaal voor longitudinale sentimentstudies levert.
- Persoonlijke brieven en dagboeken: Verzamelingen van privé-correspondentie, waaronder archieven die worden bijgehouden door instellingen zoals het Wilson Center Digital Archive of het uitgebreid bestudeerde dagboek van Samuel Pepys, bieden tijdgestempelde emotionele records die individuele perspectieven met aanzienlijke authenticiteit vastleggen.
- Parlementaire en congresstukken: Officiële transcripties van wetgevende procedures, waaronder de Britten Hansard (die zich uitstrekt van 1803 tot het heden), laat analyse van elite politiek sentiment tijdens debatten over oorlog, hervorming, koloniaal beleid, en andere belangrijke historische vragen toe.
- Fiectie en poëzie: Literaire werken weerspiegelen en vormen vaak bredere maatschappelijke stemmingen. De opkomst van Gotische romantiek in bijvoorbeeld de jaren 1790 kan overeenkomen met postrevolutionaire angsten op manieren die sentimentsanalyse kan helpen kwantificeren en volgen.
- Propaganda en overheidscommunicatie: Affiches uit oorlogstijd, radio-uitzendingen, pamfletten en officiële proclamaties kunnen systematisch gecodeerd worden voor de emotionele beroepen die ze gebruiken, en bieden inzicht in door de staat gesponsord sentiment management.
Elk van deze broncategorieën biedt duidelijke voordelen en methodologische uitdagingen. Kranten, terwijl wijd en zijd beschikbaar en overvloedig in kwantiteit, vaak vertonen redactionele vooroordelen en typisch bijdragen van meerdere auteurs waarvan de perspectieven kunnen variëren aanzienlijk. Privé dagboeken kunnen slechts een individuele wereldbeeld weerspiegelen, maar ze bieden emotionele diepte en authenticiteit die meer formele bronnen ontbreken. Onderzoekers moeten zorgvuldig definiëren wat "publieke mening" hun gekozen enthousiasme vertegenwoordigt ..of nationaal sentiment, elite discours, de stem van een specifieke demografische groep, of een andere construct ..en moet deze grenzen in hun interpretaties erkennen.
Methodologische aanpassingen voor historische teksten
Het toepassen van moderne sentimentsanalysetools op historische teksten biedt een reeks uitdagingen die onderzoekers systematisch moeten aanpakken. Taal ontwikkelt zich voortdurend; woorden die emotioneel neutraal lijken voor hedendaagse lezers dragen soms krachtige connotaties in eerdere periodes. Het woord "verschrikkelijk," bijvoorbeeld, oorspronkelijk betekende "vol ontzag" en droeg een positieve of neutrale valentie, heel anders dan de moderne betekenis van "zeer slecht." De term "homo" onderging een grote verschuiving in de loop van de twintigste eeuw, die van de betekenis "vrolijk" of "zorgeloos" naar voornamelijk het denoteren van homoseksuele identiteit. Een sentiment lexicon ontwikkeld voor een 21ste-eeuwse sociale media inhoud zal systematisch verkeerde termen produceren, fouten die de onderzoeksresultaten kunnen verstoren.
Om deze uitdagingen aan te gaan hebben historici en computationele taalkundigen verschillende strategieën ontwikkeld:
- Periodespecifieke lexicons: Het construeren van woordenlijsten op basis van woordenboeken en literaire werken uit het doeltijdperk.De Historische Thesaurus van het Engels en het Oxford Engelse woordenboek] leveren essentiële middelen voor het reconstrueren van de emotionele valentie van woorden zoals ze in hun historische context werden begrepen.
- Domein-aangepast woord inbeddingen: Training vector-gebaseerde taalmodellen, zoals Word2Vec, uitsluitend op historische corpora. Deze benadering laat termen als "afschuwelijk" toe om naaste associaties te verwerven die kenmerkend zijn voor hun periode.Words zoals "sublime" en "majestic" in de achttiende en negentiende eeuw in plaats van moderne associaties zoals "verschrikkelijk" of "horrible."
- Menselijke validatie: Historici hebben getraind om een deel van documenten handmatig te annoteren en hun beoordelingen te vergelijken met machine-gegenereerde scores. Discreties tussen menselijke en algoritmische oordelen tonen aan waar modellen falen en iteratieve verfijning van de analysepijplijn informeren.
Een andere belangrijke technische hindernis is OCR-kwaliteit. Optische karakterherkenning toegepast op verouderde, bevlekte of onregelmatig gedrukte pagina's leidt onvermijdelijk tot fouten die sentimentsmetingen kunnen verstoren. Het woord "geluk" kan worden weergegeven als "happinefs" vanwege het archaïsche lange 's' karakter, of als "happmess" als gevolg van een combinatie van drukafbraak en herkenningsfouten. Robuuste voorbewerking, inclusief spellingcorrectiesystemen aangepast aan historische orthografie, is essentieel voordat een sentimentanalysepijplijn als betrouwbaar kan worden beschouwd.
Case Study in Depth: De Amerikaanse Burgeroorlog
De toepassing van sentimentsanalyse op kranten en persoonlijke correspondentie van de burgeroorlog illustreert zowel het potentieel als de beperkingen van deze methoden. Een significant onderzoek in 2020 onderzocht meer dan 200.000 krantenartikelen uit zowel Union als Confederate bronnen over de periode van 1860 tot 1865. Met behulp van een sentiment lexicon zorgvuldig gekalibreerd tot midden negentiende-eeuwse Engels gebruik, de onderzoekers gepland wekelijkse gemiddelde sentiment scores over de oorlog jaar. Hun resultaten bevestigden dat Noordelijke moreel ervaren een scherpe daling na de eerste slag van Bull Run in 1861, maar hersteld gestaag na de Emancipation Proclamatie in 1863. Zuidelijk sentiment, daarentegen, bleef relatief verhoogd tot midden 1863, na de Confederate nederlagen in Gettysburg en Vicksburg, waarna het sterk daalde en nooit hersteld. Dit patroon sluit aan op traditionele historische accounts, maar de kwantitatieve analyse onthult haar traject met een precisie die kwalitatieve methoden alleen niet kunnen bereiken.
De analyse van persoonlijke brieven gaf een meer gedetailleerd en enigszins ander beeld. De correspondentie van Uniesoldaten toonde consequent hogere niveaus van negativiteit dan de hedendaagse krantenrapportage, vooral met betrekking tot kwesties zoals voedseltekorten, vertraagde betaling en de fysieke ontberingen van het militaire leven. Brieven van Confederatieburgers weerspiegelden acute angst over de mogelijkheid van slavenopstand na 1862, een zorg die grotendeels ontbrak aan de officiële krantendiscours. Deze verschillen tussen het sentiment uitgedrukt in "publieke" krantenbronnen en die gevonden in "private" brieven tonen een betekenisvolle splitsing tussen officieel gehandhaafde moreel en de emotionele realiteit van individuele ervaring. Deze bevinding, robuust gemaakt door schaalvergrotingsanalyse, biedt historici een nieuw uitkijkpunt op de psychologische dimensies van het conflict.
Aanvullende historische toepassingen van de noot
Naast de studie van de Amerikaanse Burgeroorlog is sentimentsanalyse productief toegepast op een reeks andere historische vragen:
- De Britse publieke opinie tijdens de Eerste Wereldoorlog: Onderzoekers aan de Universiteit van Lancaster analyseerden het lokale krantensentiment uit de periode 1914 tot 1918 en ontdekten dat patriottisch enthousiasme aanzienlijk eerder vervaagde in arbeidersgemeenschappen dan in middenklassegebieden. Deze bevinding daagt het wijdverbreide "geest van de loopgraven" verhaal uit en suggereert dat klassenmatige verschillen in oorlogssentiment meer uitgesproken waren dan eerder erkend.
- Anti-immigrantensentiment in negentiende-eeuwse Amerika: Een studie naar artikelen in verband met Ierse en Chinese immigranten in grote Amerikaanse kranten van 1845 tot 1900 vond dat negatieve sentiment versterkt tijdens economische neergangen en nauw samenhangt met de opkomst van nativistische politieke bewegingen, waaronder de Know Nothing Party, het verstrekken van kwantitatieve bevestiging van patronen die eerder alleen ondersteund door anekdotisch bewijs.
- Victoriaanse houding ten opzichte van het Britse Rijk: Analyse van de Tijden] van Londen die de hele negentiende eeuw beslaat, onthulde dat het gevoel naar India verschoven was van over het algemeen positieve karakterisaties die het subcontinent als een land van commerciële opportuniteiten beschoren waren tot scherp negatieve beelden na de 1857 rebellie, een patroon dat ver in de vroege twintigste eeuw bleef bestaan en een latere keizerlijke politiek vormde.
Deze voorbeelden tonen aan dat sentimentsanalyse kan dienen om historische hypothesen te testen, verfijnen en soms uitdagen die traditioneel zijn gebaseerd op selectief citaat of impressionistisch bewijs.
Integratie van kwantitatieve en kwalitatieve benaderingen
Geen geautomatiseerd algoritme kan de interpretatieve expertise van de getrainde historicus vervangen. De meest krachtige beurs komt naar voren wanneer sentimentcurves worden gebruikt om te leiden en te informeren in plaats van het te vervangen. Als een sentiment visualisatie een plotselinge negatieve piek onthult in april 1770, bijvoorbeeld, kan de historicus de aandacht richten op kranten uit die specifieke week, lees de originele artikelen in hun volledige context, en identificeren van het specifieke politieke schandaal, natuurramp, of economische crisis die het algoritme gemarkeerd, maar dat conventionele historische accounts kan hebben over het hoofd gezien of ondergewaardeerd.
De gemengde methoden voor onderzoek vinden doorgaans in verschillende fasen plaats:
- Corpus montage en reiniging: Documenten worden gedigitaliseerd, verwerkt door optische karakterherkenning, en onderworpen aan spellingcorrectie aangepast aan historische orthografische conventies.
- Verkennende sentimentsanalyse: Sentimentscores worden over het corpus berekend en gevisualiseerd met behulp van lijnploegen, warmtekaarten of andere grafische voorstellingen.
- Uitgaande detectie en bemonstering: Anomalous punten in het sentiment traject worden geïdentificeerd, en de documenten die met deze punten worden geassocieerd worden geselecteerd voor nauwe kwalitatieve lezing.
- Narratieve integratie: Kwantitatieve bevindingen worden verweven met archief-bewijs, contextualiserende numerieke patronen met specifieke stemmen, gebeurtenissen en documentaire referenties.
Deze benadering respecteert de onderscheidende sterke punten van zowel computationele analyse als humanistische interpretatie. Ook wordt een veel voorkomende kritiek op het werk van digitale geesteswetenschappen aangepakt: dat het risico loopt de slordige, tegenstrijdige en dubbelzinnige aard van historisch bewijs te oversimpelen. Door kwalitatieve betrokkenheid als essentieel onderdeel van het onderzoeksproces te behouden, kunnen wetenschappers ervoor zorgen dat hun kwantitatieve bevindingen gegrond blijven in historische context.
Kritieke uitdagingen en beperkingen
Ondanks de aanzienlijke belofte van de Commissie, wordt de toepassing van sentimentsanalyse op historische bronnen geconfronteerd met een aantal ernstige beperkingen die de verantwoordelijke onderzoekers moeten erkennen en aanpakken.
Semantische verandering en connotatie Drift
Woord betekenissen verschuiven in de tijd, en spraakfiguren zoals sarcasme en ironie vaak aangetroffen in politieke cartoons, satirische essays, en oppositie-literatuur ..overbekend moeilijk voor algoritmen om correct te detecteren en te interpreteren . Een achttiende-eeuwse schrijver zou het woord "patriottisch" ironisch om het overheidsbeleid te bekritiseren , maar een eenvoudig op lexicon gebaseerde systeem zou dit gebruik als positief te beoordelen , het missen van de beoogde betekenis volledig . Hand-curated annotaties en context-bewuste modellen kunnen dit probleem te verzachten maar kan niet volledig elimineren , vooral op schaal .
Selectie Bias in overlevende bronnen
Historische archieven vertegenwoordigen niet het volledige spectrum van vroegere populaties. De geletterde, rijke en politiek betrokken zijn systematisch oververtegenwoordigd in het overlevende record. Vrouwen, slaven, armen en andere gemarginaliseerde groepen lieten minder documentaire sporen na, en de platen die ze produceerden werden vaak tegen lagere tarieven bewaard. Sentimentsanalyse die uitsluitend gebaseerd is op kranten of elite dagboeken zal onvermijdelijk alleen het emotionele klimaat van de machtigen in beslag nemen in plaats van dat van het bredere publiek. Onderzoekers moeten transparant zijn over wiens sentiment ze meten en moeten de verleiding weerstaan om verder te generaliseren dan de bevolkingen hun bronnen eigenlijk vertegenwoordigen.
Contextuele afhankelijkheid van emotionele expressie
Sentiment is vaak contextafhankelijk op manieren die algoritmes worstelen om vast te leggen. De verklaring "Hij stierf voor zijn land" verschijnen in een grafrede draagt positieve emotionele valentie, terwijl dezelfde woorden verschijnen in een pacifistische pamflet kan kritiek of veroordeling uit te dragen. Geavanceerde transformator-gebaseerde modellen omgaan met dergelijke contextuele variatie redelijk goed, maar ze vereisen grote hoeveelheden trainingsgegevens die niet bestaan voor historische perioden met beperkte overlevende tekstuele records. Fine-tuning van een model op een paar duizend historische documenten kan resultaten die broos of onbetrouwbaar zijn wanneer toegepast op onbekende contexten.
Interdisciplinaire belemmeringen en gereedschapsgereedheid
Veel historici missen formele training in computationele methoden, en veel computerwetenschappers onderschatten de complexiteit en de rommeligheid van historische gegevens. Effectieve samenwerking tussen deze disciplines is essentieel, maar kan traag, uitdagend en resource-intensief zijn. Bovendien zijn weinig off-the-shelf sentiment analyse tools zoals VADER of TextBlob ontworpen om historisch Engels te verwerken, wat betekent dat onderzoekers vaak moeten bouwen aangepaste verwerking pijpleidingen een belangrijke barrière voor toegang voor wetenschappers die niet technische expertise.
Opkomende aanwijzingen in Historische sentimentsanalyse
Het komende decennium belooft aanzienlijke vooruitgang in de instrumenten en methoden die beschikbaar zijn voor historische sentimentsanalyse. Transformer-gebaseerde taalmodellen die specifiek op historische teksten zijn getraind, zoals BERT-historische, worden al ontwikkeld. Deze modellen vangen contextuele informatie veel effectiever dan statische lexicons op en kunnen worden afgestemd op gespecialiseerde taken zoals opiniedetectie en fijnkorrelige emotieclassificatie over categorieën zoals woede, angst en vreugde. Vroege resultaten geven aan dat deze methoden beter zijn dan op lexicon gebaseerde methoden door marges van tien tot twintig procentpunten in nauwkeurigheid op historische testsets.
Een andere veelbelovende manier van onderzoek is multimodal sentiment analyse, waarin tekstuele inhoud wordt geanalyseerd naast beelden, illustraties, typografie en pagina-indeling. In negentiende-eeuwse kranten, het gebruik van gedurfde type, cursivering en illustratie plaatsing overgebracht emotionele betekenis die tekstuele analyse alleen niet kan vangen. Het opnemen van deze visuele dimensies in sentiment modellen biedt een rijker en historisch nauwkeuriger beeld van emotionele expressie.
De analyse van het culturele en meertalige historische sentiment[ wint ook aan dynamiek. Onderzoeksprojecten analyseren nu Franse revolutionaire pamfletten, Duitse kranten uit de Weimar-periode, Japanse oorlogspropaganda en andere materialen uit diverse taalkundige en culturele tradities. Het standaardiseren van sentimentmeting in verschillende talen met verschillende grammaticale structuren en cultureel specifieke emotionele normen vormt een grote onderzoeksuitdaging, maar de potentiële beloningen zijn aanzienlijk: een echte wereldwijde geschiedenis van publieke opinie die de grenzen van enige nationale of taalkundige traditie overstijgt.
De computational ally van de historicus
Sentimentanalyse vervangt niet het zorgvuldige interpretatieve werk van de historicus, noch vermindert het de rijkdom van het verleden tot een eenvoudige lijngrafiek. In plaats daarvan biedt het een krachtige extra lens om vertrouwd bewijs op nieuwe manieren te onderzoeken en vragen te stellen die traditionele methoden niet gemakkelijk kunnen aanpakken. Door emotionele trends in miljoenen documenten te kwantificeren, kunnen onderzoekers hypothesen met grotere rigor testen, keerpunten ontdekken die conventionele accounts hebben gemist, en de aandacht vestigen op de gevoelens van mensen wier stemmen vaak afwezig zijn in gevestigde verhalen.
Naarmate natuurlijke taalverwerkingsinstrumenten steeds meer worden afgestemd op de eigenaardigheden van historische taal en als digitale archieven blijven uitbreiden, zal sentimentsanalyse waarschijnlijk een standaardcomponent van de methodologische toolkit van de historicus worden. De uitdaging ligt in het verstandig gebruik van deze tools: met methodologische discipline, contextuele gevoeligheid en een helder-gezicht begrip van hun beperkingen. Wanneer ze kritisch worden omarmd en met zorg worden toegepast, kan sentimentsanalyse niet alleen onze kennis verdiepen van wat mensen in het verleden dachten, maar ook ons begrip van hoe ze zich voelden en waarom die gevoelens ertoe doen.
Voor een technische inleiding tot sentimentanalysemethoden, raadpleeg de Stanford Sentiment Analysis resource page. Voor een gedetailleerde historische casestudy, zie "Public Opinion and the American Civil War: A Sentiment Analysis of Newspapers and Letters" (Smith & Jones, 2022).De ]Old Bailey Online[] levert een rijke dataset van achttiende- en negentiende-eeuwse rechtbank transcripten die historici beginnen te analyseren met sentimenttools.De ]Oxford Engels woordenboek[ blijft een onmisbare bron voor het volgen van semantische veranderingen in de tijd, en de History of Parliament Online) biedt contextueel materiaal voor het interpreteren van wetgevingssentiment.[]]