Table of Contents
Van Inkten tot Algoritmen: Hoe Computational Tekstanalyse verlicht de verspreiding van Literatuur
Het verhaal van geletterdheid is niet alleen een verhaal van meer mensen leren lezen en schrijven. Het is een complex, ongelijk proces gevormd door economie, religie, politiek en technologie. Gedurende eeuwen, historici vertrouwden op proxies .school inschrijfgegevens, boek eigendom inventarissen, en anekdotal rekeningen . om te schatten wanneer en waar geletterdheid nam greep. Deze methoden leverde waardevolle maar versnipperde standpunten. Vandaag de dag, een nieuwe reeks van instrumenten is het veld transformeren . Computational tekst analyse laat onderzoekers om miljoenen pagina's van historische schrijven , detectie van patronen onzichtbaar voor het menselijk oog . Door het meten van veranderingen in de woordenschat , syntaxis en genre , kunnen geleerden traceren de verspreiding van geletterdheid met ongekende precisie .
Dit artikel legt uit hoe computationele tekstanalyse werkt, waarom het belangrijk is om de geschiedenis van geletterdheid te begrijpen, en wat de bevindingen ervan onthullen over de beweging van lees- en schrijfvaardigheden in tijd en ruimte. Het onderzoekt ook de methode van beperkingen en de kritische vragen die het oproept voor toekomstig onderzoek.
Wat is Computational Text Analysis?
Computational text analysis (CTA) verwijst naar een reeks technieken die algoritmen gebruiken om grote verzamelingen geschreven teksten te verwerken, te kwantificeren en te interpreteren. In tegenstelling tot het lezen van een document of een klein corpus, werkt CTA op schaal, waarbij statistische patronen worden geïdentificeerd over duizenden of miljoenen werken. Kernmethoden zijn:
- Frequentieanalyse . . te tellen hoe vaak woorden of zinnen verschijnen in de tijd om thematische verschuivingen te volgen.
- Topische modellering . . een machine learning techniek die woorden in groepen groepeert in clusters (topics) gebaseerd op co-occurrence patronen, latente thema's in een corpus onthullen.
- Sentimentanalyse . . meten van de emotionele toon van teksten om de publieke stemming of gezagshouding te meten.
- Stijlvolle metrische analyse . . . Het vergelijken van leesbaarheidsscores, zinslengte en vocabulairerijkheid als proxies voor publiek verfijning.
- Geoparsing en naam-identiteit herkenning . . . extractie van locaties, mensen en organisaties om ruimtelijke patronen van discours in kaart te brengen.
Deze methoden zijn afhankelijk van gedigitaliseerde teksten. In de afgelopen twee decennia, massale digitale bibliotheken zoals Google Books, de HathiTrust Digitale Bibliotheek, en de Britse Krantenarchief hebben honderden miljarden woorden beschikbaar gemaakt voor onderzoekers. Wanneer gekoppeld met computerkracht, deze corporatie worden laboratoria voor het bestuderen van culturele evolutie.
Waarom Literatuur laat een digitale spoor
Literatuur is niet alleen een vaardigheid; het is een sociale praktijk die ingebed is in de productie van teksten. Naarmate meer mensen geletterd worden, neemt het volume van het schrijven toe, verandert de taal en het publiek. Computationale analyse legt deze transformaties vast op ten minste drie manieren:
Ten eerste, woordenschatuitbreiding.[ Nieuw geletterde populaties nemen vaak vereenvoudigde grammaticale structuren en meer concrete woordenschat aan voordat ze naar abstractie gaan. Door de frequentie van functiewoorden (artikelen, voorposities) te volgen versus inhoudwoorden (naamwoorden, werkwoorden), kunnen onderzoekers veranderingen in genre en publiek aan de hand doen.
Tweede, genreproliferatie. Terwijl geletterdheid zich verspreidt, ontstaan nieuwe teksttypen: almanakken, pamfletten, persoonlijke brieven, dagboeken en uiteindelijk kranten en romans. Computationale methoden kunnen documenten automatisch classificeren door genre, waardoor historici kunnen zien wanneer en waar bepaalde vormen gemeenschappelijk werden.
Ter derde, geografische verspreiding. Met metagegevens over de plaats van publicatie of auteurschap kunnen onderzoekers in kaart brengen hoe lexicale innovaties zoals nieuwe woorden of spellingconventies zich langs handelsroutes, spoorlijnen of postnetwerken verplaatsen. Deze patronen correleren vaak met de uitbreiding van onderwijs en boekdistributie.
Vroege toepassingen: De opkomst van Vernaculaire Talen
Van Latijn naar de Volkstoon
Een van de vroegste toepassingen van CTA op geletterdheid geschiedenis was het traceren van de verschuiving van Latijns naar taaltalen in Europa. In de Middeleeuwen werd literaire productie gedomineerd door Latijn, alleen toegankelijk voor geestelijken en een dunne elite. In de zestiende eeuw, print maakte de massaproductie van boeken in het Duits, Frans, Engels en Italiaans. Computationele analyses van de Vroeger Engels Boeken Online corpus tonen aan dat het aandeel Engels-talige publicaties steeg van minder dan 10% in 1500 naar meer dan 80% door 1700. Deze verschuiving was niet uniform; het vond eerder plaats in Protestantse regio's waar vernaculaire Bijbels werden aangemoedigd, en later in katholieke gebieden waar het Latijn liturgische gezag behouden.
Meting van leesbaarheid als een Literacy Proxy
Onderzoekers hebben ook gebruik gemaakt van leesbaarheid formules .Ontwikkeld voor modern onderwijs .De Flesch Reading Ease score , wanneer toegepast op achttiende-eeuwse Britse pamfletten , onthult een gestage daling van complexiteit als printers gericht op lager opgeleide lezers . Teksten gericht op .common readers gebruikt kortere zinnen , minder lettergrepen per woord , en meer concrete referenties . Dit patroon correspondeert met perioden van snelle schooluitbreiding , zoals de groei van de zondag scholen in Engeland na 1780 .
Case Studies in de computergeletterdheid
1. Europa uit de negentiende eeuw: De Literatuur Boom van de Stad
Het oorspronkelijke artikel noemde deze casestudy. Laten we het uitbreiden met rekenwerk detail. Met behulp van de Chronicling America krantendatabase (Library of Congress), historici hebben de explosie van lokale kranten in de Verenigde Staten en Europa onderzocht. In Pruisen, bijvoorbeeld, de kranten per hoofd verdubbelde tussen 1820 en 1860. Topic modeling van deze kranten onthult een verschuiving van religieuze en agrarische inhoud naar politieke nieuws en advertenties die een lezing publiek met basisletters en burger belang veronderstelt. Geoparsing toont aan dat de verspreiding van krantenlezerschap nauw gevolgd spoorwegopeningen, die ook schoolonderwijzers en schoolboeken naar landelijke gebieden droegen.
Sentimentanalyse van brieven aan de uitgever in Franse provinciale kranten van 1830 tot 1870 duidt op een correlatie tussen alfabetiseringspercentages en de frequentie van complexe politieke argumenten. In regio's met hogere schoolinschrijving gebruikten brieven meer subjunctieve stemming en abstracte zelfstandig naamwoorden, wat suggereert dat geletterdheid lezers in staat stelde om zich te bemoeien met abstracte concepten zoals democratie en rechten.
2. Vroegmodern Engeland: De Print Revolutie
De eerste massale geletterdheid campagne in de Angelsphone wereld vond plaats in Engeland tijdens de zestiende en zeventiende eeuw, gedreven door protestantse Reformatie nadruk op het lezen van de Bijbel. Computationele analyse van de Engelse Korte Titel Catalogus (ESTC) toont aan dat tussen 1550 en 1640, het aantal publicaties gepubliceerd per decennium steeg met een factor tien. Een belangrijke verschuiving was de opkomst van ..goedkope print . . .breedside balladen, almanakken, en chapbooks . . waarvan eenvoudige syntaxis en repetitieve structuren geven aan dat uitgevers verwachtte een semi-geletterd publiek.
Een studie gebruikte onderwerp modelleren op 20.000 Engelse pamfletten uit 1600 1700. Het model onthulde een aparte ..instructional .. onderwerp cluster met woorden zoals .read, . .spell, ..catechism, ..en ..kind. Het aandeel van teksten in dit onderwerp piekte in de jaren 1640 en 1650, een periode van revolutionaire onrust toen het Parlement bevorderd geletterdheid onder soldaten en burgers. De geografische verspreiding van deze pamfletten, getraceerd door imprint locaties, toont aan dat geletterdheid onderwijsmaterialen verplaatst naar buiten Londen naar marktsteden, dan naar dorpen een patroon herhaald een eeuw later in koloniale Amerika.
3. Koloniale en post-koloniale contexten
Computational tekst analyse wordt nu toegepast op de verspreiding van geletterdheid in gekoloniseerde samenlevingen. Onderzoekers aan de Universiteit van Helsinki gebruikt n-gram analyse op negentiende-eeuwse negentiende-eeuwse Indiase kranten in het Engels en regionale talen. Ze vonden dat het gebruik van Engelse woorden in de taal kranten snel steeg na 1857, wat aangeeft dat een tweetalige geletterde klasse was ontstaan. Sentiment analyse van redactionele artikelen in Bengaalse kranten van 1860, 1900 toont een verschuiving van de dedentiële taal naar assertieve nationalistische retorica, die een lezersschap comfortabel met complexe politieke argument zou hebben vereist .
In Afrika ten zuiden van de Sahara bieden missionaris-geproduceerde teksten het vroegst geschreven materiaal in vele talen. Computational stylometrie (vergelijkende ordners) suggereert dat vroege vertalingen van de Bijbel in Yoruba en Xhosa vereenvoudigde native grammaticale structuren om het leesniveau van nieuw geletterde conversies te vergelijken. Dit had blijvende gevolgen voor de ontwikkeling van deze geschreven talen.
Methodologische innovaties: Hoe onderzoekers signalen uitpakken
N-Gramanalyse
Misschien is de eenvoudigste rekentool is de n-gram, een aaneengesloten reeks van n woorden. Google Books . Ngram Viewer populariseerde de mogelijkheid om de frequentie van zinnen in te plotten door eeuwen heen. Voor geletterdheid studies, n-grams onthullen de aanneming van nieuwe woorden . . .telegraph . . of .nieuwsbrief . die aangeven dat het uitbreiden van informatienetwerken. Een studie van Brits Engels n-grams van 1700 .1900 vond dat de zin . . te lezen . verhoogde in frequentie met 400% tussen 1750 en 1850, terwijl de zin . . te schrijven ..maar sneller na 1830, suggereert dat het schrijven vaardigheden later verspreid dan het lezen van vaardigheden.
Topic Modeling in de loop van de tijd
Topic modeling, met behulp van algoritmes zoals Latent Dirichlet Allocatie (LDA), clusters vocabulaire in onderwerpen die de mens kan interpreteren. Toegepast op de Achttiende Centurie Collecties Online[ (ECCO) corpus, topic modeling identificeerde een duidelijke overgang van volumes gedomineerd door religieuze en klassieke onderwerpen naar die gedomineerd door wetenschap, handel en fictie na 1760. Deze transitie sluit aan bij de opkomst van het lezende publiek, een demografische verschuiving mogelijk gemaakt door uitgebreide leesvaardigheid. Wanneer onderzoekers topic modellen voor teksten gepubliceerd in Londen vergelijken met die van provinciale steden, ze vinden dat Londen onderwerpen veranderd sneller .
Stilometrische leesbaarheid Metrics
Naast de inhoud, rekeninstrumenten meten de leesbaarheid van teksten. De Coleman-Liau index, oorspronkelijk ontworpen voor modern Engels, kan worden aangepast aan historische teksten door aanpassing voor spelling veranderingen. Toegepast op een corpus van 10.000 Amerikaanse romans uit 1770
Voordelen van de Computational Analysis voor de Literatuurgeschiedenis
- Schaal: CTA kan miljoenen teksten verwerken in uren, onmogelijk voor één geleerde.
- Objectiviteit: Kwantitatieve maatregelen verminderen het risico van kersen-picking-bewijs ter ondersteuning van een reeds bestaand verhaal.
- Vergelijkbaarheid: Dezelfde methoden kunnen worden toegepast op verschillende talen, regio's en perioden, waardoor cross-culturele analyse mogelijk is.
- Visualisatie: Grafieken en kaarten maken trends direct zichtbaar, wat zowel onderzoek als openbare communicatie helpt.
- Hypothesegeneratie: Onverwachte patronen in de gegevens kunnen onderzoekers ertoe brengen nieuwe vragen te stellen over causaliteit.
Zo bleek een themamodel van Duitstalige kranten uit 1848/1950 onverwachts een scherpe daling van de vocabulaire diversiteit in conservatieve publicaties, terwijl liberale publicaties hun eigen. Dat hintde op censuur onderdrukkende expressie onder conservatieve schrijvers.Maar aangezien conservatieven aan de macht waren, dat leek paradoxaal. Verder onderzoek toonde aan dat conservatieve kranten werden gesloten, waardoor de verscheidenheid van stemmen. Dit inzicht leidde tot een herzien begrip van geletterdheid politieke rol tijdens revolutionaire periodes.
Uitdagingen en beperkingen
Digitalisering Bias
Niet alle historische teksten overleven, en degenen die niet gelijk worden gedigitaliseerd. Europese archieven hebben voorrang gegeven aan overheidsrecords en canonieke literatuur over efemera zoals trade cards of persoonlijke brieven. Als gevolg daarvan kunnen computationele analyses overrepresenteren elite mannelijke perspectieven. Bibliotheken in het wereldwijde Zuiden zijn vaak ondergedigitaliseerd, met ons beeld van geletterdheid .
OCR-kwaliteit
Optische karakterherkenning (OCR) software worstelt vaak met historische lettertypen, vervaagde inkt en onregelmatige lay-out. Fouten kunnen oplopen tot 30% voor vroege moderne teksten. Als onderzoeker niet schoon de gegevens, frequentietellingen onbetrouwbaar worden. Gereedschappen zoals OCR-D verbeteren de nauwkeurigheid maar vereisen expertise.
Taalcomplexiteit
Talen met complexe morfologie (Finse, Arabische, Quechua) presenteren uitdagingen voor tokensization. Ook, historische spelling was niet gestandaardiseerd; . Read .. kan verschijnen als ..rede, ..reade, ..of ..reed. . .Onderzoekers moeten ofwel de spelling te moderniseren of gebruik te maken van karakter-niveau modellen die meer rekenkosten.
Tolkenopzicht
Concordantietabel is geen oorzaak. Een stijging van het woord
Vaardigheidsbarrières
Computational text analysis vereist programmeervaardigheden (Python, R) en vertrouwdheid met statistieken. Veel geschiedenisafdelingen hebben nog steeds geen training op deze gebieden, hoewel digitale geesteswetenschappen centra groeien. Open-source platforms zoals Voyant Tools verlagen de barrière voor beginners.
Ethische en Epistemologische vragen
Zoals met elke digitale methode, CTA roept vragen op over wat telt als bewijs. Meten woordfrequenties echt geletterdheid, of alleen maar de belangen van uitgevers? Doet een onderwerp model onthullen auteur intentie of alleen de beperkingen van genre? Het veld is nog steeds debatteren over deze kwesties. Een opkomende beste praktijk is om computeranalyse te combineren met kwalitatieve nauwe lezing van representatieve teksten ..door de zogenaamde ..veraflezen en .close reading .
Een andere zorg is algoritmische vooroordelen. Onderwerpmodellen worden getraind op welke teksten er ook beschikbaar zijn; als een corpus 90% mannelijk-geauthoriseerd is, zullen de onderwerpen mannelijke zorgen weerspiegelen. Onderzoekers moeten actief proberen om vrouwen te schrijven, koloniale literatuur, en andere gemarginaliseerde stemmen. Projecten zoals Het Women... Print History Project bouwen meer inclusieve corpora voor precies dit doel.
Toekomstige aanwijzingen
Meertalige en cross-script analyse
De meeste CTA-werk is op Engels. Maar geletterdheid verspreid was vaak meertalig mensen gelezen in twee of meer talen. Nieuwe modellen zoals meertalige BERT toestaan onderzoekers om teksten in meerdere talen tegelijkertijd te analyseren, onthullen hoe ideeën en woorden verplaatst over taalgrenzen. Bijvoorbeeld, voorlopige werk aan de mediterrane wereld toont aan dat geletterdheid in het Arabisch, Spaans en Catalaans naast elkaar in de vroege moderne Valencia, met computationele analyse tonen lexicale leenpatronen die religieuze en commerciële contact weerspiegelen.
Kleine gegevens en infrastructuur
Niet alle onderzoek vereist miljoenen teksten. .Kleine data . Computational methods . Toegepast op een paar honderd zorgvuldig samengesteld documenten .Kan inzichten over specifieke gemeenschappen opleveren . De opkomst van digitale geestescentra in Afrika, Azië en Latijns-Amerika betekent dat meer lokale actoren kunnen vertellen hun eigen geletterdheid geschiedenis met behulp van computationele tools.
Machine learning en handgeschreven tekstherkenning
Tot voor kort was de analyse van de computationele tekst beperkt tot gedrukte teksten.Maar handgeschreven tekstherkenning (HTR) verbetert snel, waardoor wetenschappers dagboeken, persoonlijke brieven en administratieve documenten kunnen analyseren.De documenten die vaak het eerste bewijs waren van geletterdheid voor gewone mensen. Projecten als Transkribus behandelen al historische handschriften met meer dan 95% nauwkeurigheid voor sommige scripts. Dit zal een enorme nieuwe archieven openen voor alfabetiseringsonderzoek.
Conclusie
Door miljarden woorden in kwantificeerbare patronen te veranderen, laat het historici toe om de trage, ongelijke verspreiding van geletterdheid te zien, omdat het eigenlijk gebeurde als een gladde curve, maar als een reeks van golven, plateaus en omkeringen gevormd door oorlog, religie, handel en beleid. De methode heeft aangetoond dat vernacularisering vooraf ging aan geletterdheid in vele contexten, dat leesbaarheid verminderde als geletterdheid uitgebreid, en dat afdruknetwerken van cruciaal belang waren voor de verspreiding van leesvaardigheden.
Toch kunnen de belangrijkste lessen gaan over de grenzen van het bewijs. Wat computationele tekstanalyse onthult is grotendeels de geletterdheid van degenen die zich konden veroorloven om teksten te printen en opslaan. De echt marginale mensen die geen geschreven spoor achterlieten ... verborgen. Maar door deze nieuwe tools te combineren met traditionele archiefwerk, kunnen onderzoekers beter luisteren naar de stemmen die overleefden, en betere vragen stellen over de geletterdheid van het verleden.
Naarmate meer teksten gedigitaliseerd worden en algoritmes verfijnder worden, zal ons begrip van hoe lezen en schrijven zich alleen maar verdiepen. Voor nu, staat het veld op een veelbelovende drempel, waar de oude en de nieuwe inkt en het algoritme samenwerken om een van de meest doorlopende ontwikkelingen in de menselijke geschiedenis te verlichten.