Inleiding

Het snijpunt van datawetenschap en historisch onderzoek heeft geleid tot een nieuwe discipline, vaak digitale geschiedenis of computationele geschiedenis genoemd. Door het toepassen van big data analytics tools oorspronkelijk ontworpen voor e-commerce, sociale media, en wetenschappelijk onderzoek . Historici kunnen nu verwerken en analyseren en enorme repositories van gedigitaliseerde bronnen. Deze omvatten alles van eeuwenoude parochie registers en volkstelling terugkeert naar miljoenen krantenpagina's, parlementaire debatten, en zelfs sociale media archieven van de laatste twee decennia. De schaal en snelheid van deze analyses kunnen onderzoekers patronen, trends en correlaties die onzichtbaar waren voor eerdere generaties van geleerden die afhankelijk waren van handmatig lezen en monsternames te detecteren. Dit artikel onderzoekt de methoden, case studies en implicaties van het gebruik van grote gegevens om verborgen patronen in historische gebeurtenissen te ontdekken.

De opkomst van big data in historisch onderzoek

Big data in een historische context verwijst naar digitale datasets die zo groot of complex zijn dat ze niet gemakkelijk kunnen worden verwerkt met traditionele spreadsheet- of databasetools. De bronnen zijn divers: optische karakterherkenning (OCR) heeft de digitalisering van miljoenen boeken, tijdschriften en kranten mogelijk gemaakt; overheden en instellingen hebben machineleesbare volkstellingsgegevens, geboorte- en overlijdensregisters en parlementaire procedures vrijgegeven; en het web heeft ongekende hoeveelheden persoonlijke correspondentie, publieke discoursen en efemera opgeleverd. Projecten als Google Books Ngram Viewer[] bieden een glimp op hoe frequenties over decennia heen verschuiven, terwijl meer gespecialiseerde inspanningen zoals het Mapping the Republic of Letters[] project aan de Stanford Universiteit visualiseren van de correspondentienetwerken van Enlightenment intellectuelen.

De enorme hoeveelheid data die bijvoorbeeld de Britse Bibliotheek bevat, bevat meer dan 40 miljoen krantenpagina's van de 17e tot de 20e eeuw. Dit betekent dat zelfs één enkele onderzoeker met de juiste instrumenten patronen kan evalueren in plaats van beperkt te zijn tot een paar archieven. Deze verschuiving is vergeleken met de uitvinding van de telescoop in de astronomie: het vervangt niet de nauwe lezing, maar het onthult structuren onzichtbaar voor het blote oog. Echter, de goedkeuring van big data in de geschiedenis is niet zonder controverse geweest. Critici zorgen over het verlies van context, het risico van het verminderen van menselijke ervaring tot aantallen, en de mogelijkheid voor algoritmen om vooringenomenheden te versterken ingebed in historische records.

Belangrijkste analysemethoden voor historische big data

Om zinvolle patronen uit historische big data te halen, gebruiken onderzoekers een reeks van rekenmethoden aangepast aan computerwetenschap, statistieken en de digitale geesteswetenschappen. Hieronder staan de meest prominente technieken, elk aangepast aan verschillende soorten vragen.

Tekst Mijnbouw en Natuurlijke Taalverwerking (NLP)

Tekstmijnbouw omvat het omzetten van ongestructureerde tekst in gestructureerde gegevens die gekwantificeerd en geanalyseerd kunnen worden. Gemeenschappelijke NLP-taken die toegepast worden op historische teksten omvatten topic modeling, die thema's automatisch identificeert over een corpus; benoemde entiteitserkenning (NER), die namen van mensen, plaatsen, organisaties en data uitdeelt; en sentimentsanalyse, die de emotionele toon van passages meet. Bijvoorbeeld, door sentimentsanalyse uit te voeren op tientallen krantenredactieken, kunnen onderzoekers publieke opinie in kaart brengen rond belangrijke gebeurtenissen zoals het uitbreken van oorlog of de passage van belangrijke wetgeving. Onderwerpmodellering is gebruikt om de opkomst van nationalisme in Europese parlementaire debatten te traceren, of om verschuivingen in medische discourse in medische tijdschriften vanaf de 18e eeuw te identificeren.

Netwerkanalyse

Netwerkanalyse kaarten de relaties tussen entiteiten . mensen, organisaties, ideeën, of zelfs plaatsen. In historisch onderzoek, het is vooral krachtig voor het begrijpen van sociale structuren, politieke allianties, wetenschappelijke samenwerkingen, en handelsnetwerken. Door het opbouwen van een netwerk van brieven, bijvoorbeeld, kan men identificeren welke figuren optraden als makelaars van invloed tijdens de Verlichting of de Amerikaanse Revolutie. De wiskundige en historicus William Playfair eens gezegd, .Waar er een natie, er is een netwerk, . . en moderne tools zoals Gephi of outrescape maken het mogelijk om deze verbindingen op een schaal Playfair kon niet hebben voorgesteld. Netwerkanalyse onthult ook .Hidden knooppunten .. personen die misschien weinig bekend vandaag maar waarvan de centrale in een historisch netwerk suggereert dat ze werden gedraaid op het moment.

Ruimtelijke analyse en geografische informatiesystemen (GIS)

GIS stelt historici in staat om gegevens op kaarten te plaatsen en ruimtelijke patronen te analyseren. Deze methode is gebruikt om de verspreiding van de Zwarte Dood over Europa te reconstrueren, om de routes van de ondergrondse spoorweg in kaart te brengen, en om de verdeling van stempatronen in 19e-eeuwse verkiezingen te analyseren. Ruimtelijke analyse kan ook meerdere lagen combineren. Bijvoorbeeld, het overleggen van volkstellingsgegevens met kaarten van natuurlijke hulpbronnen om de locatie van industriële steden uit te leggen. De Digitale Atlas van Romeinse en Middeleeuwse beschavingen integreert archeologische gegevens met oude tekstverwijzingen om te laten zien hoe nederzettingen evolueerden door eeuwen heen.

Machine learning voor patroondetectie

Naast eenvoudige statistische methoden, machine learning algoritmes kunnen complexe, niet-duidelijke patronen in historische gegevens identificeren. Clustering algoritmen groep soortgelijke historische gebeurtenissen of documenten zonder voorafgaande labels nuttig voor het detecteren van eerder niet herkende categorieën van sociale protest of literaire genres. Anomaal detectie kan uitschieters, zoals ongebruikelijke prijspieken in middeleeuwse graanmarkten die samenvallen met hongersnood of opstanden. Meer geavanceerde benaderingen, zoals diep leren, worden nu toegepast op handgeschreven tekstherkenning (HTR) om manuscripten te digitaliseren die OCR te weerstaan, het openen van collecties van vroege moderne brieven, dagboeken en kerkrecords die eerder alleen toegankelijk waren voor paleografen.

Case studies van het ontdekken van verborgen patronen

De volgende voorbeelden illustreren hoe big data methoden patronen hebben aan het licht gebracht die de traditionele geschiedschrijving misschien gemist heeft of alleen maar getipt heeft.

Onthullen Shifts in Public Sentiment via Krantenarchief

Een van de meest productieve gebieden is de analyse van grote krantencorporatie. Het Britse Krantenarchief, bijvoorbeeld, bevat meer dan 40 miljoen pagina's over drie eeuwen. Onderzoekers aan de Universiteit van Sussex gebruikten topic modelleren en sentiment analyse op Ierse kranten van 1790 tot 1900 om veranderende houdingen ten opzichte van emigratie te volgen. Ze ontdekten dat de taal verschoven van het beschrijven van emigratie als een vorm van ballingschap in het begin van de 19e eeuw naar een berekende economische beslissing door de 1880s een overgang die eerder dan conventionele historische accounts gesuggereerd. Ook een studie van Amerikaanse kranten tijdens de Burgeroorlog vond dat de taal van woede en wanhoop pieken in grensstaten maanden voordat gelijkwaardige pieken verscheen in het diepe zuiden, met een meer korrelige kijk op hoe lokale omstandigheden gevormd nationale stemming.

Sociale netwerken van historische figuren in kaart brengen

Het project .Zes graden van Francis Bacon . (een naam refererend aan de beroemde .zes graden van scheiding . concept) gebruikt netwerkanalyse om de sociale verbindingen van de vroege moderne Engelse intellectuelen te reconstrueren . Door het mijnbouw brieven , toewijding , en lidmaatschap lijsten van de Royal Society , het project onthulde dat Margaret Cavendish , een 17e-eeuwse filosoof en schrijver , was veel meer verbonden met toonaangevende denkers dan eerder erkend , uitdagend haar reputatie als een geïsoleerde excentrieke . Een ander netwerk analyse van de ondertekenaars van de Verklaring van Onafhankelijkheid , toonde aan dat , terwijl Thomas Jefferson was niet de meest centrale knooppunt in correspondentienetwerken , hij diende als een brug tussen zuidelijke en noordelijke kolonies . een positie die zijn rol in het opstellen van de Verklaring zou kunnen hebben beïnvloed .

Analyse van economische gegevens op lange termijn

Economische historici hebben lang gewerkt met kwantitatieve gegevens, maar big data heeft hun toepassingsgebied uitgebreid. De Global Price and Income History Group heeft een database samengesteld van lonen en prijzen over 600 jaar uit tientallen steden. Door het toepassen van clustering en tijd-serie analyse, onderzoekers hebben geïdentificeerd de .Little Di entree de periode tussen 1500 en 1800 toen Noordwest-Europa begon economisch weg te trekken uit het zuiden en oosten. Dit patroon was niet zichtbaar in een enkele stad . maar kwam alleen toen alle gegevens werden gecombineerd en onderzocht voor de gemeenschappelijke. Evenzo, een studie van middeleeuwse Engelse manorial records (nu gedigitaliseerd) gebruikt machine leren om honderdduizenden items op graanopbrengsten te classificeren, onthullen dat gewas mislukkingen vaak werden geclusterd in specifieke jaren die correspondeerden met vulkanische uitbarsten opgenomen in ijskernen .

Reconstructie van ziekteuitbraken uit historische dossiers

Epidemiologie is een natuurlijke partner voor historische big data. In 2020, een team van historici en data wetenschappers digitaliseerde duizenden begrafenisrecords van 17e-eeuwse Londen parochies en gebruikt GIS om de verspreiding van de Grote Plague van 1665 in kaart te brengen. Ze ontdekten dat de infectie niet gelijkmatig van het centrum naar buiten verplaatste; in plaats daarvan sprong het van parochie naar parochie langs handelsroutes, met bepaalde buurten die als superspreader hubs optreden vanwege hun concentratie van herbergen en markten. Deze analyse niet alleen gecorrigeerd eerdere kaarten op basis van anekdotische accounts, maar bood ook inzichten die moderne pandemie bereidheid kon informeren. Een ander project geanalyseerd overlijdenscertificaten uit de 1918 influenza pandemie in 30 U.S. steden en, door clustering, geïdentificeerd dat steden met eerdere niet-farmaceutische interventies (zoals schoolsluitingen) had een aanzienlijk ander sterfte patroon dat is aangehaald in recente publieke gezondheidsdebatten.

Uitdagingen en beperkingen

Ondanks de belofte, het gebruik van big data in de geschiedenis is vol methodologische en ethische uitdagingen. Ten eerste, de kwaliteit van de gegevens is zelden perfect. OCR fouten kunnen de resultaten van tekst mijnbouw verstoren; bijvoorbeeld, een enkel vervormd karakter in een krantenartikel kan de sentiment score van een heel jaar veranderen . Historici moeten zorgvuldig schoon en valideren hun datasets, vaak vereist handmatige controles op een steekproef. Ten tweede, de beschikbare gegevens worden vaak scheefgetrokken: wat is gedigitaliseerd en prioriteit gegeven de neiging om de belangen van rijke instellingen, koloniale machten, of de huidige politieke mode weerspiegelen. Bijvoorbeeld, Europese archieven zijn veel meer gedigitaliseerd dan Afrikaanse of Aziatische, die kunnen leiden tot een bevooroordeelde wereldwijde vertelling.

Ten derde, correlatie is geen oorzaak. Big data kan aantonen dat twee trends samen bewegen, zeggen een stijging van spelling hervormingen en een daling van religieuze referenties .Maar uitleg vereist historische context . Zonder het , de analyse risico's uitgegroeid tot een .data mining artefact . dat patronen overfitst tot lawaai . Tenslotte , privacy problemen ontstaan bij het omgaan met persoonsgegevens uit de 20e eeuw . Historische sociale media archieven , bijvoorbeeld , kan bevatten informatie over levende individuen of hun directe afstammelingen . Onderzoekers moeten navigeren ethische beoordeling boards en anonimisering protocollen , het balanceren van de waarde van open gegevens met respect voor privacy .

De toekomst van Big Data in de geschiedenis

Vooruitkijkend, de integratie van big data met machine learning .. vooral grote taalmodellen (LLM's) zoals GPT . LLM's biedt mogelijkheden boeiend. LLM's kunnen historische teksten samenvatten, hypotheses genereren, of zelfs simuleren ..counter .. historische scenario's door te worden opgeleid op grote corpora van voorwaardelijke verklaringen . Echter , deze modellen ook versterken bestaande vooroordelen en kunnen produceren plausibel klinkende maar valse verhalen , zodat historici zal nodig hebben om een kritische houding te handhaven .

Een andere grens is de fusie van historische gegevens met andere wetenschappelijke gebieden. Historische klimatologie, bijvoorbeeld, combineert boom-ring gegevens, ijskernen, en historische weer dagboeken om verleden klimaten te reconstrueren. Door deze samen te voegen met economische gegevens, kunnen onderzoekers modelleren hoe klimaatschokken veroorzaakt hongersnood of migraties. Archeologie ook wordt data-gedreven: lidar scanning heeft hele Maya steden onthuld die verborgen zijn onder jungle canopies, terwijl koolstofdatering en DNA-analyse worden geïntegreerd in statistische modellen van populatiebeweging.

Naarmate deze hulpmiddelen toegankelijker worden, zien we misschien een democratisering van historisch onderzoek, waar amateur genealogici of lokale geschiedenis samenlevingen dezelfde algoritmen kunnen toepassen die door universiteiten worden gebruikt. Het risico is echter een nieuwe vorm van digitale kloof .. tussen degenen met de technische vaardigheden en computationele middelen en degenen zonder. Om ervoor te zorgen dat big data verrijken in plaats van ons begrip van het verleden te verstoren, moeten historici betrokken blijven bij de ethische, epistemologische en praktische dimensies van hun werk.

Conclusie

De toepassing van big data op historisch onderzoek is geen vervanging voor de traditionele historicus . Het is een uitbreiding. Door het onthullen van verborgen patronen in sentiment, netwerken, ruimte en tijd, het stelt ons in staat om nieuwe vragen te stellen en om oude verhalen te bevestigen of uitdagen. De voorbeelden die hier besproken worden van het verschuiven van Ierse emigratie retoriek naar de verspreiding van de plaag in Londen .Demonstrate dat patronen onzichtbaar voor de individuele onderzoeker kan ontstaan uit het collectieve gewicht van gegevens . Naarmate technologie vooruitgang , de dialoog tussen kwantitatieve methoden en kwalitatieve interpretatie zal alleen maar belangrijker worden . Het doel is niet om algoritmen ons te laten vertellen wat er gebeurd , maar om historici te machtigen om verbindingen te zien die zijn wachten , soms eeuwen , om ontdekt te worden . Verantwoord gebruik van grote gegevens , gecombineerd met zorgvuldige historische redenering , belooft om ons begrip van het menselijke verhaal te herschrijven op een moment .