Inleiding: Het verleden met moderne methoden aan het bewerken

Historici van de negentiende eeuw hebben zich lang gebaseerd op een zorgvuldige handmatige analyse van kranten, toespraken, pamfletten en persoonlijke correspondentie om de krachten te begrijpen die de moderne wereld vormden. Toch is het enorme volume van het overlevende materiaal uit dit tijdperk miljoenen pagina's tekst die tijdens de Industriële Revolutie werden geproduceerd, de opkomst van massapolitiek en transformatieve conflicten zoals de Amerikaanse Burgeroorlog kan traditionele kwalitatieve methoden overweldigen. Computational linguïstiek biedt een complementaire benadering: door het toepassen van algoritmen en statistische modellen op grote tekstcorporatie, kunnen onderzoekers patronen detecteren, veranderingen in taal volgen en hypotheses op schaal die onmogelijk zijn voor één enkele geleerde. Deze synthese van computerwetenschap en taalkunde vervangt niet het nauwkeurig lezen maar breidt het uit, waardoor historici nieuwe vragen kunnen stellen over politieke retoriek, ideologie en sociale verandering. De digitalisering van archieven zoals de ]]Chronicling America[]] Krantonical database en de ]Hansard parlementaire verslagen maken deze miljoenen pagina's toegankelijk, maar de ruwe pagina's zijn alleen toegankelijk

Wat is Computational Linguistics?

Computational linguïstics (CL) bevindt zich op het snijpunt van taalkunde, computerwetenschap en kunstmatige intelligentie. Het kerndoel is om natuurlijke taal te modelleren zodat machines menselijke spraak en tekst kunnen verwerken, analyseren en zelfs genereren. In historisch onderzoek vallen CL-tools meestal in verschillende categorieën, elk geschikt voor verschillende soorten historische vragen.

Sentimentsanalyse

Sentiment analyse wijst numerieke of categorische scores aan tekst gebaseerd op emotionele valentie positieve, negatieve of neutrale. Voor 19e-eeuwse politieke teksten, deze techniek kan onthullen hoe publieke stemming verschoven tijdens gebeurtenissen zoals de 1848 revoluties, het debat over de Corn Laws, of de afscheiding crisis in de Verenigde Staten. Door het in kaart brengen van sentiment in de tijd, historici kunnen identificeren perioden van stijgende nationalisme, reformistische optimisme, of oorlog-moeilijke wanhoop. Bijvoorbeeld, een studie van Amerikaanse kranten tijdens de 1860 verkiezing cyclus zou kunnen laten zien hoe Republikeinse-leaning papers verschoven van hoopvolle retoriek over Lincoln naar angstige oproepen voor vereniging als South Carolina besproken afscheiding. Sentiment analyse wordt ook gebruikt op diplomatieke verzendingen om te meten hoe buitenlandse regeringen waargenomen bedreigingen .

Topicmodeling

Topic modeling algoritmes (bijvoorbeeld, Latent Dirichlet Allocatie) automatisch ontdek latente thema's in een verzameling van documenten. Toegepast op een corpus van 19e-eeuwse Britse parlementaire toespraken, themamodellen kunnen woorden als "trade," "tarief," "vervaardiging," en "empire" in een thema van economisch beleid, terwijl "suffrage," "representatie," en "eigenschap" cluster rond de hervorming van de verkiezingen groeperen. Onderzoekers kunnen dan traceren hoe de prevalentie van elk thema waxed en afdwaalde in decennia. Topic modeling is gebruikt om te laten zien, bijvoorbeeld, dat verwijzingen naar religie in Britse parlementaire debatten gestaag daalde na 1850, terwijl discussies over infrastructuur en volksgezondheid steeg. Deze techniek is bijzonder waardevol voor het ontdekken van de verborgen structuur van grote archieven, onthullen welke onderwerpen werden eigenlijk besproken in plaats van het vertrouwen op de canonische onderwerpen die werden benadrukt door traditionele historiografieën.

Erkenning van de naam van de entiteit (NER)

NER haalt goede zelfstandig naamwoorden, plaatsen, organisaties, data uit ruwe tekst. Voor 19e-eeuwse teksten kan NER helpen netwerken van politieke actoren in kaart te brengen, de frequentie van verwijzingen naar specifieke naties of bewegingen te volgen (bijv. "Chartism," "Autloshed," "Zollverein"), en zelfs de geografische verspreiding van nieuwsberichten te reconstrueren. Wanneer toegepast op duizenden redactionele artikelen uit de jaren 1850, kan NER aantonen dat de naam "John Brown" veel vaker verscheen in Noordelijke kranten dan in Zuidelijke kranten in de maanden na de Harpers Ferry raid, maar dat beide regio's hem refereerden in verband met verschillende emoties en argumenten. Moderne NER modellen getraind op historische gegevens kunnen ook achterhaalde plaatsnamen identificeren (bijv. "Constantinopel" of "Prussia") en vertalers van beroemde figuren.

Collocatie en zoekwoordanalyse

Collocatieanalyse identificeert woorden die vaker samen verschijnen dan toeval zou voorspellen. Het bestuderen van "democratie" in Amerikaanse kranten voor en na de Burgeroorlog onthult een verschuiving van abstracte idealen (bijv. "equality," "liberty") naar concrete institutionele taal (bijv. "partij," "ballot," "grondwet"). Trefwoordanalyse vergelijkt een doel corpus met een verwijzing naar woorden die ongewoon vaak worden uitgesproken over wat tijdgenoten als dringend of onderscheidend beschouwden. Bijvoorbeeld, het vergelijken van toespraken van de Britse liberale partij in de jaren 1880 met die uit de jaren 1830 zou de stijgende uitstraling van "ouderdomspensioenen" en "municipaal socialisme" kunnen benadrukken, zelfs voordat deze termen officieel beleid werden.

Stylometrie

Stylometrie gebruikt statistische maten van schrijfstijl (zinlengte, woordkeuze, leesgewoontes) om auteurschap toe te schrijven. Deze techniek is gebruikt om omstreden teksten op te lossen, zoals anonieme krantenredactie of het auteurschap van politieke pamfletten, waardoor historici een steviger grond voor attributiedebatten. Een klassieke toepassing betrokken bewijzen dat een reeks anti-abolitionistische pamfletten uit de jaren 1830 waarschijnlijk werden geschreven door een enkele New Yorkse advocaat, hoewel ze waren gepubliceerd onder een pseudoniem. Stylometrie kan ook de evolutie van een individuele auteur stijl detecteren over een carrière, biedt inzicht in hoe een politicus' retoriek gerijpt of veranderd onder druk.

Toepassen van de Computational Linguistics op 19e-eeuwse politieke teksten

De 19e eeuw biedt zowel kansen als obstakels voor CL. De opkomst van massale geletterdheid, de uitbreiding van de krantpers en de verspreiding van de korte-handrapportage zorgden voor een explosie van politieke discours. Tegelijkertijd was spelling vaak onregelmatig, lettertypen gevarieerd, en de taal bevat archaismen die moderne modellen uitdagen. Niettemin, zorgvuldig ontworpen studies hebben waardevolle inzichten opgeleverd die bijna onmogelijk te verkrijgen zijn door middel van traditionele methoden alleen.

Case Study: De taal van de Amerikaanse Burgeroorlog

Een van de rijkste toepassingen is de studie van de retoriek van de Burgeroorlog. Door het analyseren van de Congressal Globe (de voorloper van het moderne Congressalistische Record) naast duizenden krantenredactieken, hebben onderzoekers gevolgd hoe de term "Unie" verschoven van een juridisch concept naar een bijna heilig ideaal tijdens de oorlog. Topic modeling van toespraken van het Confederale Congres toont dat verwijzingen naar "staten de rechten" sterk afnam na 1863, terwijl taal over "onafhankelijkheid" en "offer" verhoogde een patroon consistent met de aanscherping van de militaire noodzaak. Sentiment analyse van de Union soldier brieven van de Valley van de Schaduw] project onthult dat moreel dat na grote gevechten zoals Fredericksburg maar opnieuw werd uitgevoerd na Gettysburg en Vicksburg, het verstrekken van een kwantitatieve aanvulling op de diary-based verhalen die de literatuur domineren.

Casestudy: Britse parlementaire debatten

De digitalisering van Hansard (het officiële verslag van de Britse parlementaire debatten) heeft een groot corpus geopend voor CL. Studies hebben onderzocht hoe de woordenschat van hervormingswoorden als "dienst," "filantropie," "onbeantwoord" zich over de 19e eeuw heeft ontwikkeld. Sentimentanalyse van toespraken over de Fabrieksaktes onthult dat Whig en liberale parlementsleden steeds positievere emotionele taal gebruikten naarmate de eeuw verder ging, terwijl de conservatieve oppositie van morele verontwaardiging naar praktische bezwaren verschuift. Zulke bevindingen helpen historici verder te gaan dan anekdotische indrukken van partijposities. Een andere studie gebruikte onderwerpmodellering om de taal van Ierse nationalistische parlementsleden te vergelijken met die van hun Britse collega's. Het bleek dat Ierse leden consequent problemen in termen van "land," "religie," en "oppressie," terwijl Britse leden zich richtten op "economie" en "overname," waarbij de fundamenteel verschillende conceptuele werelden die in hetzelfde parlement samenkwamen.

Casestudy: Afschaffing van de letterkunde en anti-afschaffing

De computationele methoden hebben de trans-Atlantische debatten over slavernij verlicht. Onderwerpmodellen toegepast op Britse en Amerikaanse abolitionistische pamfletten (1830/0/1865) wijzen op de opkomst van een duidelijke "morale economie" vocabulaire . "sin," "berouw," "bloed-schuld" .Dat sterk verschilde van de utilitaire taal ("productiviteit," "vrije arbeid") gebruikt door anti-abolitionisten . Collocatie analyse van "emancipatie" in zowel Britse als Amerikaanse bronnen toont aan dat Britse teksten ingelijst het als een keizerlijk beleid , terwijl Amerikaanse teksten het overweldigend verbonden met raciale angsten en verkiezingen . Meer indringende werk op Afrikaanse Amerikaanse kranten zoals ]De Noord-ster] onthult dat zwarte abolitionisten een andere verzameling van collocates gebruikten voor "vrijheid" .

De evolutie van de politieke woordenschat volgen

Een permanente vraag voor politieke historici is hoe sleutelbegrippen veranderen betekenis in de tijd. Met behulp van frequentieanalyse en woord-embedden modellen, onderzoekers hebben shifts getraceerd in woorden als "liberal," "conservatief," "socialisme," en "democratie." Bijvoorbeeld, "liberale" in de jaren 1820 Britse pers verwees voornamelijk naar openheid van de handel; in de jaren 1880 was het een partijlabel geladen met connotaties van staatsinterventie. Deze semantische verschuivingen onthullen de onderliggende ideologische aanpassingen van de eeuw. Woord inbeddingen getraind op de Chronicling America[] corpus (1836

Casestudy: De Franse Revolutie van 1848 en de opkomst van het socialisme

Voorbij de Angelsphone wereld, CL is gebruikt om de Franse politieke pers te bestuderen tijdens de Tweede Republiek. Onderwerpmodellen toegepast op kranten van 1848 tot 1851 onthullen de snelle opkomst van een aparte socialistische woordenschat gecentreerd op "atélier" (workshop), "vereniging," en "droit au travail" (recht om te werken). Sentiment analyse toont aan dat de taal van de conservatieve Le Journal des Débats werd steeds meer alarmist na de junidagen opstand, met behulp van zinnen als "danger rouge" (rood gevaar) met stijgende frequentie. Deze computationele benadering helpt historici kwantificeren van de snelheid waarmee het politieke landschap gebroken na de revolutie, een proces dat traditionele beschrijving van de beschrijving van de beschrijving van maar niet gemakkelijk te meten.

Voordelen voor historici en opvoeders

Schaal en objectiviteit

CL laat historici toe om beweringen over brede patronen te testen.Bijvoorbeeld, dat nationalisme na 1870 intenser werd tegen volledige archieven in plaats van een samengesteld monster. De kwantitatieve output geeft een controle op bevestigingsvooroordeel en dwingt wetenschappers om contra-bewijs te verantwoorden. Voor opvoeders, interactieve visualisaties van sentiment trends of onderwerp prevalentie kan abstracte historische krachten tastbaar maken in de klas. Een hulpmiddel als Voyant Tools (een open-source tekstanalyse omgeving) stelt studenten in staat om een reeks toespraken te uploaden en onmiddellijk woordwolken, frequentieploegen en collocatienetwerken te zien, waardoor geschiedenisklassen worden omgezet in mini-onderzoekslabs.

Ontdekking van stille patronen

Algoritmes kunnen patronen vinden die menselijke lezers over het hoofd zien. Een stylemetrische analyse van Harper.Wekelijkse redactionele artikelen zou kunnen onthullen dat een verschuiving in redactionele stem zich maanden voor een formele verklaring van partijtrouw struikelen achter-de-scenes factional manoeuvrering. Onderwerpmodellen toegepast op petities aan het Britse parlement hebben blootgelegd clusters van de vraag naar vrouwen . . rechten die grotendeels werden genegeerd in hedendaagse debatten. In een opmerkelijke studie, thema modelleren van petities aan het Amerikaanse Congres tijdens de jaren 1840 onthuld dat vrouwen ..uitspraken werden vaak gebundeld met temperance en anti-slaverlijke taal, een patroon dat traditionele historici hadden opgemerkt anekdotisch maar nooit systematisch gevalideerd.

Integratie met digitale archieven

Terwijl bibliotheken en archieven 19e-eeuwse holdings blijven digitaliseren, worden CL-tools gateways naar deze collecties. Projecten zoals de European Parliamentary Debate Corpus en de Chronicling America[ krantendatabase bieden reeds kant-en-klare corpora. Onderzoekers kunnen CL-outputs combineren met geografische informatiesystemen (GIS) om de verspreiding van politieke taal in kaart te brengen over regio's. Bijvoorbeeld, het analyseren van de collicates van "tarief" in provinciale kranten uit de jaren 1820 en 1830 kunnen laten zien welke delen van het land het woord gebruikten in verband met beschermende tarieven versus inkomstentarieven, het bijhouden van regionale economische belangen.

Uitdagingen en beperkingen

Archeïsche taal en spelling variants

Het Engels uit de 19e eeuw verschilt vaak sterk van de hedendaagse normen. Woorden als "chuse" (kiezen), "shew" (show), en inconsistente kapitalisering kunnen de moderne deel-of-speech-taggers en sentimentlexicons verwarren. Onderzoekers moeten vaak aangepaste modellen trainen op historische datasets of spelling normalisatie-instrumenten gebruiken. Zelfs dan kan de betekenis ongrijpbaar zijn: "homo's" in de 19e eeuw bevlekte vrolijkheid, niet seksualiteit, en "afschuwelijk" zou kunnen betekenen ontzag-inspirerend eerder dan verschrikkelijk. De Historische Thesaurus van het Engels[] en gespecialiseerde historische lexiconen zijn essentiële middelen voor het interpreteren van resultaten.

OCR-fouten in gedigitaliseerde teksten

Optische karakterherkenning (OCR) van 19e-eeuwse kranten en boeken heeft te lijden van hoge foutenpercentages als gevolg van gebroken type, sierlijke lettertypen en verslechtering. Een veel voorkomende fout die "lange s" omzet in "f" kan frequentiecijfers verstoren. Post-processing correctie pijpleidingen en handmatige validatie zijn essentieel voor betrouwbare resultaten, het toevoegen van tijd en kosten aan projecten. Voor grote projecten gebruiken onderzoekers vaak instrumenten zoals OCRopus of Tesseract] met modellen die zijn afgestemd op historische lettertypen. Crowdsourcing platforms zoals ]Zooniverse[ hebben ook geholpen om OCR fouten in grote collecties te corrigeren zoals de British Library 19th Century Newspapers[[[FLT:]].

Context en ironie

Computational modellen worstelen met sarcasme, ironie en indirecte citaat alle algemeen in politieke retoriek. Een satirisch artikel dat expansionistische taal bespot kan worden misclassificeerd als echt expansionist door een sentiment algoritme. Evenzo, thema modellen behandelen alle woorden als even informatief, maar een hedendaagse lezer zou weten dat "de glorieuze oorzaak" betekende verschillende dingen in een Unie adres dan in een Confederate. Nauwe lezing blijft nodig om de computeruitvoer contextualiseren. Een manier om dit te beperken is om CL te combineren met kwalitatieve inhoud analyse, met behulp van het algoritme om patronen te suggereren en vervolgens follow-up met een menselijke controle op een willekeurige steekproef van teksten.

Data Biases en Canon Formation

De collectie van vrouwen is niet neutraal. Grote archieven weerspiegelen vaak de vooroordelen van de instellingen die ze hebben gecreëerd: grote-circulatie-metropolitane kranten zijn oververtegenwoordigd, terwijl de radicale kranten van kleine steden schaars zijn. CL-studies die uitsluitend steunen op Hansard of de New York Times] dreigen een elite-gecentreerde kijk op de geschiedenis te versterken. Onderzoekers moeten actief gemarginaliseerde stemmen zoeken, immigranten, inheemse en vrouwenpublicaties en ze in hun bedrijf opnemen.De ]Inheemse kranten in Noord-Amerika] en het Vrouwens Suffrage Kranten[[[FLT:]]] zijn voorbeelden van pogingen om het digitale landschap in evenwicht te brengen. Het falen om dat te doen kan leiden tot beweringen over "publieke opinie" dat eigenlijk slechts een klein, bevoorrechte schijf van de samenleving vertegenwoordigen.

Toekomstige aanwijzingen

Historische taalmodellen

Recente doorbraken in diep leren, zoals transformatormodellen (BERT, GPT), worden aangepast voor historische teksten. Gefijnd op 19e-eeuwse corpora, kunnen deze modellen onregelmatige spelling verwerken, lange afstand afhankelijkheden vastleggen en zelfs synthetische teksten genereren die historische stijlen nabootsen. Ze beloven nauwkeuriger NER- en sentimentsanalyse, hoewel ze aanzienlijke rekenmiddelen vereisen en zorgvuldige validatie tegen bekende feiten. Het MacBERTh[] model, dat is opgeleid op een corpus van Nederlandse historische teksten, laat zien hoe deze instrumenten kunnen worden afgestemd op specifieke talen en tijdsperiodes. Echter, wetenschappers moeten voorzichtig zijn overfitting en ervoor zorgen dat gegenereerde tekst alleen wordt gebruikt voor analytische doeleinden, niet voor het verkeerd presenteren van historische documenten.

Meertalige en nationale analyse

Politiek discours in de 19e eeuw was zelden beperkt tot één taal. Europese revoluties, transatlantische hervormingsbewegingen en keizerlijke heerschappij produceerden een meertalig landschap. Toekomst CL-tools die code-switching, vertaling en kruistalige vergelijkingen kunnen verwerken, zullen historici in staat stellen om bijvoorbeeld te bestuderen hoe het concept van "vrijheid" tussen Frans, Duits, Engels en Spaans teksten reisde. Projecten als Taalse Linked Open Data[ beginnen te creëren kruistalige corpora die dergelijke vergelijkingen mogelijk maken. Een studie van revolutionaire pamfletten uit 1848 in heel Duitsland, Frankrijk en Italië kon onthullen of soortgelijke metaforen van "storm" en "ontwaken" verschenen in alle drie talen, wat een gedeelde ideologische repertoire aangeeft.

Interdisciplinaire samenwerking

Het meest vruchtbare werk ontstaat wanneer computationele taalkundigen, historici en bibliothecarissen samenwerken van projectontwerp tot publicatie. Gecombineerde expertise zorgt ervoor dat onderzoeksvragen historisch gegrond zijn, algoritmes zijn passend, en digitaliseringsprioriteiten worden geïnformeerd door wetenschappelijke behoefte. Initiatieven zoals de Digitale Humanities Centers[] aan grote universiteiten bevorderen dit soort teamwork, het creëren van herbruikbare pijpleidingen voor toekomstig onderzoek. Bijvoorbeeld, de Stanford Literary Lab[] publiceert regelmatig studies die computational methods combineren met diepe historische kennis, waarbij een norm voor het veld wordt vastgesteld. Grant agentschappen zoals de National Endowment for the Humanities[ geven nu expliciet aan interdisciplinaire teams, waarbij wordt erkend dat de beste resultaten afkomstig zijn van specialisten die elkaar leren om technische en theoretische talen te spreken.

Publieke Geschiedenis en Burgerwetenschap

CL-tools kunnen ook het publiek betrekken. Online platforms laten vrijwilligers toe om OCR-fouten te corrigeren, tag named entiteiten, of sentimenten te classificeren in historische documenten die bijdragen aan onderzoek tijdens het leren over het verleden. Dergelijke crowdsourcing projecten hebben al de kwaliteit van corpora verbeterd die gebruikt wordt in peer-reviewed historische studies.Het Transcribe Bentham project, dat vrijwilligers uitnodigt om de manuscripten van filosoof Jeremy Bentham te transcriberen, heeft een grote, hoogwaardige dataset geproduceerd die nu wordt geanalyseerd met CL. Soortgelijke projecten voor 19e-eeuwse politieke petities of brieven aan redacteuren kunnen een enorm archief omzetten in een gemeenschapsbron.

Multimodale analyse

Politieke communicatie in de 19e eeuw was niet alleen tekstueel. Kranten omvatten houtsnede illustraties, kaarten en latere foto's. Toekomstige CL-werk zal de optische analyse van beelden integreren met tekstanalyse, erkennend dat politieke boodschappen zowel visueel als verbaal werden gedragen. Bijvoorbeeld, een studie zou de frequentie van beelden van "liberty" symbolen (caps, beelden) in radicale versus conservatieve kranten kunnen vergelijken en correleren met het sentiment van begeleidende tekst. Deze multimodale aanpak zal nauwe samenwerking tussen computer visie specialisten en historici vereisen.

Conclusie

Door het meten van sentiment, het ontdekken van latente thema's, en het traceren van de evolutie van politieke woordenschat in grote archieven, kunnen onderzoekers zowel klassieke vragen als volledig nieuwe antwoorden geven op de traditionele analysemethoden. De aanpak is niet zonder valkuilen. OCR-fouten, contextuele nuances en contextuele nuances vereisen voortdurende waakzaamheid, maar het potentieel om patronen onzichtbaar te maken voor het naakte oog maakt het een essentieel onderdeel van de moderne geschiedkundige gereedschapskist. Naarmate digitale archieven groeien en algoritmen verbeteren, zal de synergie tussen computertaal en politieke geschiedenis alleen maar verdiepen, wat ons begrip van een eeuw verrijkt die de fundamenten van ons eigen heeft gelegd. Voor elke historicus die op dit pad wordt ingezet, is de sleutel om computertools te behandelen die geen zwarte doos zijn die definitieve antwoorden geeft, maar als lens die bepaalde vragen aanscherpen terwijl anderen ons er toch aan herinneren dat de nuance van menselijke interpretaties nodig zijn.

Voor nadere lezing, zie Stanford University

  • Analyse van politieke toespraken voor retorische strategieën met behulp van collocatie en sentiment.
  • De evolutie van de politieke woordenschat volgen door middel van sleutelwoordfrequentie gedurende decennia.
  • Begrijpen maatschappelijke attitudes via themamodellen van petities, pamfletten en redactionele artikelen.
  • Het toekennen van anonieme teksten met stylometrie om auteursgeschillen op te lossen.
  • De geografische verspreiding van politieke taal in kaart brengen door NER te combineren met GIS.