historical-analysis-and-study-techniques
Utilizzo di Linguistica computazionale per analizzare i testi storici
Table of Contents
Per secoli, gli storici hanno scrupolosamente pettinato attraverso gli archivi, lettera di lettura per lettera, pagina per pagina, per mettere insieme la narrazione dell'esperienza umana. Mentre questo approccio manuale ha fornito intuizioni preziose, il volume puro dei documenti storici digitalizzati ora disponibili - milioni di libri, algoritmi, diari e registri governativi - richiede nuovi metodi.
Cos'è la linguistica computazionale?
La linguistica computazionale non è solo una scrittura di software per contare le parole. Esso comprende il design di modelli formali di linguaggio che le macchine possono eseguire, coprendo tutto da fonetica e morfologia a sintassi, semantica e pragmatica.
Nel contesto dei testi storici, la linguistica computazionale diventa una sorta di macchina del tempo. Le lingue si evolvono: l'ortografia standardizza, le nuove parole emergono, i vecchi diventano arcaici, e i turni di grammatica. Un modello computazionale formato sull'inglese moderno lotta con un opuscolo del XVII secolo. Pertanto, i ricercatori devono adattare questi strumenti -creando corpora storica, sviluppando modelli specializzati e perfezionati per soddisfare la diversità linguistica dei dati.
Analisi dei testi storici con la tecnologia
Digitizzazione del testo e OCR
Ogni analisi computazionale inizia con la conversione di documenti fisici o scansionati in testo leggibile dalla macchina. Il riconoscimento ottico dei caratteri (OCR) è la tecnologia primaria per questo compito. I sistemi OCR primi erano notoriamente inaccurati con caratteri storici, inchiostro sbiadito e layout di pagina irregolari.
Una volta digitalizzato, il testo entra in una pipeline di preprocessing: tokenization (splitting in parole o token), normalizzazione (standardizzando ortografia, trattando caratteri varianti come il lungo 's'), e markup (aggiungendo tag strutturali per paragrafi, interruzioni di pagina, o marginalia).
Corpus Costruzione e Annotazione
Un corpus storico è più di una semplice scarica di testo. È accuratamente curato per bilanciare i fattori come il periodo di tempo, il genere, il dialetto e l'autore. Progetti come il Corpus di inglese storico (COHA) e il Helsinki Corpus secoli di testi inglesi forniscono dati strutturati, annotag.
Tecniche computazionali chiave per i testi storici
Analisi della frequenza e Estrazione Parola chiave
Per esempio, un forte aumento di parole come “guerra”, “redo”, e “nemico” in inglese del XVII secolo potrebbe correlare con la guerra civile inglese.
Modelli epici
La modellazione topica è un metodo di apprendimento automatico non supervisionato che scopre temi latenti attraverso una raccolta di documenti. L'algoritmo più comune, Latent Dirichlet Allocation (LDA), tratta ogni documento come una miscela di argomenti, e ogni argomento come una distribuzione sulle parole. Per un corpus di romanzi vittoriani, modellazione di argomenti potrebbe raggruppare parole come “giardino,” “campo,” “passeggiare,” e “spore” cera” in un argomento macchina.
Analisi del sentimento
L’analisi del sentimento va oltre le frequenze delle parole per misurare il tono emotivo dei testi – positivi, negativi o neutrali. I primi metodi si basano sui lessico del sentimento (le liste delle parole pre-assegnate a un punteggio di valenza), ma gli approcci moderni usano modelli di apprendimento profondi formati su dataset etichettati.
Riconoscimento di Entità (NER)
NER identifica e classifica i nomi propri di persone, luoghi, organizzazioni, date, ecc. – nel testo. L'NER storico è particolarmente impegnativo perché le entità possono essere scritte in ortografia variante (ad esempio, "Shakspere" vs. "Shakespeare"), o si riferiscono a istituzioni visive a lungo termine.
Stilometria e Attribuzione di Autorizzazioni
Stylometry applica analisi statistiche per scrivere stile - caratteristiche come lunghezza frase, distribuzioni di frequenza di parola e uso di parola-funzione (ad esempio, "il," e, "di") - per identificare o verificare gli autori. Il principio è che ogni scrittore ha una sottile, inconscio di impronte digitali stilistiche.
Rilevamento del cambiamento lessicale e spostamento semantico
Le parole cambiano significato nel tempo. Gli approcci computazionali come ] embeddings (ad esempio, allineando i vettori di parola da un secolo all'altro) permettono ai ricercatori di quantificare la deriva semantica. Ad esempio, la parola "gay" nel 1900 si riferisce alla felicità, ma dagli anni '70 grana è stata prevalentemente associata con l'omosessualità.
Studi sui casi e applicazioni reali
Tracciare il linguaggio della democrazia
I ricercatori delle istituzioni come il Digital Humanities Center hanno usato l'analisi di modellismo e sentimento di argomento per esaminare il linguaggio degli opuscoli politici americani dal 1750 al 1800. Hanno trovato un drammatico cambiamento dal discorso di lealtà coloniale verso la retorica rivoluzionaria, con parole come “libertà,” “diritti,” e “tassi” che si spostano dall'uso generale a 1775 cluster polarizzati.
Ricostruire l'antica Autorita'
Gli studiosi che studiano le opere attribuite a Platone hanno usato analisi stylometrica per distinguere i suoi dialoghi primi, medi e tardivi basati sui cambiamenti nell'uso delle particelle greche e delle terminazioni delle frasi.
Mapping emozione storica
L'analisi del sentimento su un corpus di lettere del XIX secolo da migranti all'Occidente americano rivela un modello: le prime lettere sono ottimistiche, con alti punteggi di sentimenti positivi, ma dopo il primo inverno duro, le punte di negatività.
Sfide in linguistica storica computazionale
Nonostante la sua promessa, l'applicazione della linguistica computazionale ai testi storici è piena di difficoltà.
Errori OCR e dati rumorosi
L'OCR storico produce spesso un testo in granito: "long" diventa "Iong" (il lungo 's' male riconosciuto), "vecchio" diventa "oid", e le linee di testo possono essere unite o divise arbitrariamente. Questi errori si propagano attraverso l'analisi a valle, i conteggi di frequenza di schewing e i modelli di NER confondenti.
Variazione e Cambiamento linguistico
L’ortografia standardizzata è un fenomeno moderno. Prima del XIX secolo, l’ortografia inglese era altamente variabile: “Shakespeare” potrebbe apparire come “Shakspeare”, “Shagspere”, o “Shaxberd”. La lemmatizzazione (ridurre le parole alla loro forma base) richiede di mappare queste varianti a una forma canonica, un processo che richiede ampi algoritmi di lexicon e accoppiamento flessibile.
Scarsità e adattamento dei domini
Mentre gli archivi digitalizzati sono enormi, spesso non equilibrati. Alcuni dialetti, periodi di tempo o tipi di testo sono sovrarappresentati, mentre altri (ad esempio, lettere private di donne, lingue indigene) sono scarse. I modelli di apprendimento automatico formati su dati moderni abbondanti non trasferiscono bene a domini storici radi.
Ambiguità e interpretazione
Il significato di qualsiasi testo è in parte un prodotto del suo contesto. I metodi computazionali possono identificare i modelli, ma l’interpretazione di tali modelli richiede una profonda conoscenza storica. Un improvviso aumento dei riferimenti all’epidemica potrebbe essere dovuto a un vero e proprio focolaio, ma potrebbe anche riflettere un cambiamento nella terminologia medica o un nuovo regolamento che richiede la segnalazione delle malattie.
Istruzioni future: AI e Modelli di lingua grande
L'esplosione recente di Modelli di Lingua Grande (LLMs) come GPT-4, Llama e BERT ha aperto nuove possibilità per l'analisi di testo storico. A differenza dei modelli precedenti limitati per contare le parole, LLMs può eseguire compiti come ] traduzione automatica] di lingua arcaica in inglese moderno, domanda corpo risponde
Tuttavia, i LLM sono in grado di fornire i propri rischi, possono riflettere le polarizzazioni moderne e non catturare fedelmente il contesto storico. I ricercatori devono utilizzarle con cautela, verificando le uscite contro le fonti originali.
Strumenti e risorse per i ricercatori
Per coloro che desiderano iniziare la propria analisi storica computazionale, sono disponibili diversi strumenti aperti e commerciali:
- Attrezzi vocali:[] Una piattaforma di analisi del testo web che non richiede programmazione. Offre liste di frequenza, nuvole di parole e modellazione semplice dell'argomento.
- Le biblioteche di Python:[] NLTK, spaCy e scikit-learn forniscono funzioni robuste per la tokenizzazione, NER e la classificazione.
- TEI (Text Encoding Initiative):[] Uno standard per la marcatura dei documenti storici in XML, che consente l'analisi strutturata in progetti.
- Stanford CoreNLP:[ Offre condotte pre-trainate per diverse lingue, con opzioni per ripercorrere sui dati storici.
- Piattaforme OCR storiche:[] Transkribus e OCR4all sono specializzati in scansioni storiche, fornendo un modello personalizzato di formazione per caratteri e script specifici.
Conclusioni
La linguistica computazionale non è una sostituzione per l'attenta lettura critica dei testi storici; è una forte allargamento. Permettendo l'analisi di un corpo massiccio, identificando i modelli sottili e testando ipotesi in scala, permette agli storici di porre domande che erano in precedenza insoddisfacenti. Il campo è ancora in fase di maturazione, con sfide nella qualità dei dati, adattamento del dominio e interpretazione rimanente alto nell'agenda della ricerca.