historical-analysis-and-study-techniques
Come Utilizzare Dati statistici Storici nella Tua Ricerca
Table of Contents
Comprendere Dati statistici storici in Ricerca
I dati statistici storici della ricerca trasformano un argomento dalla speculazione all'analisi basata sulle prove. I dati numerici del passato, come i conteggi del censimento, i registri commerciali e le tabelle di mortalità, permettono agli studiosi di monitorare i cambiamenti demografici, le fluttuazioni economiche e le trasformazioni sociali con precisione.
Cos'è Dati statistici storici?
I dati statistici storici si riferiscono a qualsiasi informazione quantitativa registrata in passato che può essere utilizzata per l'analisi contemporanea, che comprende:
- Censimenti di popolazione[[] – conti decennali di residenti, spesso suddivisi per età, sesso, razza, occupazione e stato civile.
- Indicatori economici[[] – stime del PIL, tassi di inflazione, saldi commerciali e indici dei prezzi ricostruiti dagli storici economici, che richiedono spesso degli aggiustamenti per cambiare valuta e potere d'acquisto.
- Statistiche sociali[[] – tassi di criminalità, iscrizione all’istruzione, metriche di salute pubblica (ad esempio, tabelle di mortalità, incidenza delle malattie).
- Registrazioni politiche[[] – risultati elettorali, chiamate legislative, relazioni di spesa governative.
- dati geospaziali e ambientali[[[] – mappe storiche, record climatologici, indagini sull'uso del suolo. Ad esempio, i datasets della Paleoclimatologia offrono secoli di dati sull'albero e sul ghiaccio-core.
Questi registri esistono in formati diversi come quelli scritti a mano, rapporti governativi stampati e database digitalizzati. La chiave è capire che i dati storici sono raramente puliti o coerenti come dati di indagine moderni. Le definizioni cambiano nel tempo (ad esempio, ciò che costituisce la “disoccupazione” nel 1900 contro oggi), i metodi di raccolta differiscono, e le lacune sono comuni.
Perché utilizzare dati statistici storici?
I ricercatori si rivolgono a dati storici per diversi motivi convincenti:
- Identificare modelli a lungo termine[[[] – Analizzando 150 anni di record di temperatura per studiare il cambiamento climatico, o tracciare tassi di criminalità in un secolo per comprendere gli effetti dell’urbanizzazione.
- Test teorie contro gli eventi passati[[[] – Gli storici economici utilizzano i dati storici del commercio per valutare l'impatto delle politiche tariffarie, delle guerre o delle pandemie.
- Providere il contesto per le questioni attuali[[] – Comprendere tendenze storiche di disuguaglianza informa i dibattiti politici moderni sulla distribuzione della ricchezza e la mobilità sociale.
- Credere lacune dove fonti qualitative sono silenziose[[ – I registri del censimento possono rivelare cambiamenti demografici che gli scrittori contemporanei trascurati o respinti.
- Aumenta la credibilità della ricerca[[] – Combinando le prove quantitative con fonti narrative rafforza gli argomenti e consente la riproducibilità.
Sottolineando il vostro lavoro in dati empirici, si sposta oltre aneddoto e offre risultati che altri studiosi possono replicare o sfidare. Le statistiche storiche permettono anche connessioni interdisciplinari, collegando la storia con economia, sociologia, scienza politica e salute pubblica.
Passi per incorporare dati statistici storici nella tua ricerca
1. Identificare le fonti affidabili
Gli archivi governativi, i servizi di dati universitari e le organizzazioni di ricerca rispettate sono le vostre migliori scommesse.
- U.S. National Archives and Records Administration (NARA) – detiene i dati del censimento federale, i registri militari e le statistiche economiche. Esplore alle aziende statistiche di NARA[.
- ICPSR (Consorzio interuniversitario per la ricerca politica e sociale)[ – il più grande archivio di dati scientifici sociali del mondo, compresi gli studi storici. Visitare ICPSR].
- UK Data Archive[]] – ospita i dati del censimento del Regno Unito dal 1801 in poi ] UK Data Service.
- Statistiche storiche degli Stati Uniti (HSUS)[] – un compendio di dati degli Stati Uniti dai tempi coloniali al presente. Access HSUS.
- Catalogo dati Banca Mondiale[[]] – include indicatori economici storici per la maggior parte dei paesi. [ Dati aperti Banca Mondiale[].
- Statistiche storiche europee] – compilato da Brian Mitchell, disponibile in stampa e online attraverso molte biblioteche universitarie.
Per quale scopo? C'è documentazione (codici) che spiega le definizioni variabili? I repository reputabili forniscono questi metadati. Verificare anche il processo di digitalizzazione: erano tabelle manualmente chiave o OCR’d? Il keying manuale tende ad essere più accurato per le fonti pre-20th secolo.
2. Capire il Contesto della Raccolta dei Dati
I dati storici sono un prodotto del suo tempo. Un censimento del XIX secolo potrebbe essere stato preso da enumeratori che camminano porta a porta; in seguito censimenti si affidavano a forme mailed. Leggi, tecnologie e norme sociali hanno plasmato le domande e come le persone hanno risposto. Ad esempio, il 1850 Stati Uniti censimento era il primo a registrare il nome di ogni individuo libero, ma schiavisti erano considerati solo come proprietà.
- Leggere le istruzioni originali date ai data collector (molti sono disponibili nei codebook di archivio).
- Le modifiche dei confini geografici (ad esempio, linee di contea, confini nazionali). National Historical Geographic Information System (NHGIS)] fornisce i file di confine per gli anni del censimento degli Stati Uniti.
- Ricercare le definizioni legali in uso (ad esempio, "non occupati" significava qualcosa di diverso prima dell'assicurazione contro la disoccupazione; "agricoltore" potrebbe includere inquilini e lavoratori).
- Essere consapevoli di sottoconti o di overcount derivanti dalla manipolazione politica, sfide logistiche, o resistenza da popolazioni difficoltose di governo.
Il Contesto non è facoltativo; è fondamentale per un'analisi valida. Investire tempo nella letteratura secondaria che discute la creazione del vostro set di dati.
3. Pulire e pretrattare i dati
I set di dati storici contengono spesso valori mancanti, codici inconsistenti o errori di trascrizione.
- Formati standard[[[] – convertire la valuta da libbre vecchie a equivalenti moderni, unificare i formati di data (ad esempio, Julian a calendari Gregorian), armonizzare le categorie di razza / etnia in decenni.
- I valori mancanti [] – utilizzano tecniche come interpolazione lineare, imputazione multipla o massima probabilità, ma documentano chiaramente le vostre ipotesi in un registro di preelaborazione.
- Controllo per gli outliers[[ – un punto improvviso potrebbe essere un errore di dati (ad esempio, errore di trascrizione erroneo) o un evento reale (ad esempio, fallimento del raccolto, guerra).
- Create derivate variabili[[] – ad esempio, calcolare i tassi pro capite dai totali della popolazione, o generare tassi di crescita dagli indici dei prezzi.
- Cerca con i identificativi di paese/regione mancanti[[] – i confini storici cambiano (ad esempio, Prussia, Austria-Ungheria), quindi potrebbe essere necessario mappare le unità moderne agli equivalenti storici.
Software come R (con pacchetti come tidyverse, zoo e histor) o Python (pandas, numpy) possono gestire la pulizia in scala. La chiave è di mantenere un registro trasparente di ogni cambiamento in modo che gli altri possano replicare il vostro lavoro.
4. Analizzare tendenze e modelli
Inizia con statistiche descrittive: quali sono i mezzi, i mediani e gli intervalli? Trama variabili nel tempo per cercare tendenze, cicli o rotture strutturali.
- Regressione della serie temporale[[[]] – modellare l'influenza di una variabile su un'altra mentre controlla le tendenze del tempo.
- Difference-in-differences[[]] – confronta un gruppo colpito da un evento storico (ad esempio, cambiamento di politica, disastro naturale) a un gruppo di controllo prima e dopo l'evento.
- L'analisi del vettore[[] – riduce molti indicatori storici nelle dimensioni sottostanti (ad esempio, un indice di “modernizzazione” dall'urbanizzazione, dall'alfabetizzazione e dall'uscita industriale).
- Analisi cluster[[] – regioni di gruppo o periodi con profili statistici simili per identificare le tipologie di sviluppo.
- L'analisi della storia dell'evento[[] – utile per studiare le durate (ad esempio, il tempo fino a quando una città adotta una nuova tecnologia).
Tenere sempre a mente dimensioni e qualità dei dati del campione. Un piccolo numero di punti di dati non può supportare modelli sofisticati.Rispondete alle risorse come [Inferenza calorosa per la sociologia storica] per metodi su misura per i dati storici.Per una guida più generale della serie temporale, Forecasting: Principi e pratica da Hyndman e Athanasopoulos[[[
5. Utilizzare le visualizzazioni effettive
I dati storici spesso durano lunghi periodi, rendendo le visualizzazioni essenziali. I buoni grafici possono rivelare i modelli invisibili nelle tabelle.
- Utilizzare i grafici delle linee per la serie di tempo[[[] – il formato più intuitivo per le tendenze. Considerare l'utilizzo di più linee per le sottocategorie (ad esempio, la mortalità maschile e femminile).
- Aggiungi un annotazione per eventi importanti[[[]] – segnare guerre, cambiamenti politici, crisi economiche o eventi climatici sulla linea temporale, che fornisce un contesto narrativo storico immediato.
- Le scale sono coerenti[[]] attraverso più grafici per consentire il confronto, ma utilizzare scale di registro se i dati coprono ordini di grandezza (ad esempio, il PIL nel corso dei secoli).
- Le tavolozze colorblind-friendly[] – evitano i contrasti rosso-verde. Usa ColorBrewer[ o palette viridis.
- Includi gli intervalli di fiducia[[] quando l'aggregazione dei dati introduce l'incertezza (ad esempio, dall'imputazione o dal campionamento).
- Assicurare la leggibilità[[]] – utilizzare un carattere chiaro, evitare gli effetti 3D eccessivi, e etichettare gli assi direttamente piuttosto che affidarsi alle leggende se possibile.
, ], ], e Python Matplotlib] gestire grandi set di dati bene. Per mappe storiche interattive, considerare kepler.gl
6. Cross-Verify con sorgenti multiple
La triangolazione – confrontando la stessa misura da diverse collezioni – rafforza la fiducia. Ad esempio, il conteggio del censimento degli Stati Uniti di immigrati può essere controllato contro le liste dei passeggeri delle navi o i record di livello statale. Se due fonti affidabili non sono d'accordo, indagare perché: errori, differenze di copertura o cambiamenti di definizione.
Superare le cadute comuni
Anachronismo
Un “farmer” del XIX secolo potrebbe essere stato un operaio senza terra, un piccolo proprietario o un proprietario di piantagione – tutti pieni di codice professionale. Evitare di inserire numeri storici in scatole contemporanee a meno che non si abbia una forte prova di continuità.
Sopravvivenza Bias
Sono disponibili solo dati che sopravvivono al presente, spesso orientati verso società più ricche, più ricche, più o più amministrate, ad esempio le statistiche del commercio medievale provengono principalmente dai porti europei; i registri africani e asiatici sono scarti.
Fallimento ecologico
I dati aggregati (ad esempio, reddito medio per contea) non possono essere utilizzati per dedurre il comportamento individuale. Una tendenza a livello di gruppo non può tenere per nessuna persona particolare in quel gruppo. Se la tua domanda di ricerca è sugli individui, cercare microdati – record anonimi di persone o famiglie – piuttosto che summari. Molti campioni di censimento (come IPUMS) forniscono microdati per gli Stati Uniti dal 1850 in poi.
Ignorando errore di misurazione
I censimenti possono mancare popolazioni senzatetto; i dati commerciali possono omettere contrabbando; le stime del PIL si basano su ipotesi sull'economia informale.
Selezione Bias in Dataset digitalizzati
I progetti di digitalizzazione spesso privilegiano collezioni ben note e facilmente accessibili, che possono creare una concentrazione artificiale su alcune regioni, periodi temporali o argomenti. Chiedere sempre: quale percentuale dei record originali sono stati digitalizzati? La selezione è stata casuale?
Strumenti e tecniche per analisi avanzata
Estrazione dati da documenti storici
Molti dataset storici esistono solo come tabelle stampate o pagine scandite. Il riconoscimento ottico dei caratteri (OCR) è migliorato drammaticamente, ma lotta ancora con caratteri vecchi, inchiostro smudged e layout multi-colonna.
- Transkribus[[] – una piattaforma a motore AI per il riconoscimento del testo scritto a mano, spesso utilizzata per i documenti d'archiviazione del XVII-XVII secolo.
- Tabula] – estrae i dati da tabelle PDF, particolarmente utili per i rapporti governativi in formato PDF.
- Tesseract OCR[[[] – motore OCR open-source con supporto per molte lingue; può essere addestrato su font storici.
- DH tool[] – come le offerte del Consorzio Linguistico per OCR storico ([]LDC[]]]).
Per le variabili critiche, prendere in considerazione la doppia entrata da parte di due ricercatori indipendenti e riconciliare le discrepanze.
Collegamento di Datasets nel tempo
La creazione di dati longitudinali richiede spesso il collegamento di record da diversi punti – ad esempio, il tracciamento di individui attraverso censimenti multipli. Questo viene fatto utilizzando il collegamento di record probabilistico (chiamato anche corrispondente a fuzzy). Software come ]] nomi di emergenza] o il ] Strumenti di collegamento AEI] può aiutare. Tuttavia, i gruppi di collegamento più difficile introvazione introduce la selezione di alcuni gruppi di selezione di uso di persone
Utilizzo del GIS storico
I sistemi informativi geografici (GIS) consentono di mappare i dati storici sui confini storici o moderni. Il Sistema informativo geografico nazionale (NHGIS)[ fornisce dati censi e file di confine del 1790 in poi. Per altri paesi, provare ] I GIS storici d'Europa o gli archivi nazionali rivelano le risorse regionali
Scegliere i metodi statistici giusti per i dati storici
Poiché i dati storici spesso violano le ipotesi di regressione standard (ad esempio, variazione costante, indipendenza), considerano metodi specializzati:
- Esecuzioni standard Newey-West[ – regolano per la correzione automatica e l'eteroskedasticità nella serie temporale.
- modelli diARIMA[] – per la previsione o la sperimentazione di impatti causali di shock storici.
- Regressione quantile[[]] – esamina gli effetti attraverso la distribuzione, utile quando i mezzi sono fuorvianti (ad esempio, la disuguaglianza della ricchezza).
- Bootstrapping[] – per stima dell'incertezza con campioni piccoli o disordinati.
Il metodo migliore dipende dalla struttura dei dati e dalla domanda di ricerca. Priorizzare la robustezza sulla complessità; una semplice differenza di reddito con intervalli di fiducia degli scarponi può essere più credibile di un modello di equazione strutturale difettoso.
Integrazione delle prove quantitative e qualitative
I numeri da soli non possono raccontare tutta la storia. Abbinano i tuoi risultati statistici con lettere, diari, articoli di giornale o dibattiti legislativi. Fonti qualitative spiegano i meccanismi dietro schemi quantitativi. Ad esempio, se osservate un calo dei prezzi dei cereali dopo il 1846, i registri parlamentari potrebbero rivelare che il abrogare delle leggi mais ha causato il cambiamento.
Quando si scrive, si intrecciano i due tipi di prove. Un paragrafo potrebbe aprire con “Il record statistico mostra un calo del 12%”, quindi continuare con “che gli osservatori contemporanei attribuiti a...” e citare un diario di un contadino. Questo equilibrio rende il vostro argomento più ricco e più convincente.
Considerazioni etiche
I dati storici spesso comportano popolazioni vulnerabili – schiavi, rifugiati, poveri – che non avevano alcun controllo su come le loro informazioni sono state registrate o utilizzate. Anche quando i record sono secoli, evitare di presentare individui in modo disumanizzante. Focus sui modelli strutturali piuttosto che casi isolati a meno che la narrazione individuale non sia essenziale. Inoltre, riconoscere che l'estrazione e l'analisi dei dati possono riprodurre ipotesi coloniali o razzistetiche se non gestite criticamente.
Se stai analizzando i dati storici su una comunità a cui non appartieni, consulta con gli esperti di quella comunità o almeno leggendo opere di studiosi che lo fanno. La ricerca storica etica non riguarda solo l'accuratezza, ma il rispetto e la responsabilità.
Conclusioni
I dati statistici storici sono uno strumento potente per i ricercatori che si avvicinano a rigore e umiltà. Selezionando attentamente le fonti, comprendendo il loro contesto, pulizia e analisi dei dati, e riconoscendo i limiti, è possibile produrre ricerche che non solo descrive il passato ma illumina le forze sociali ed economiche durature. La migliore borsa di studio combina numeri con la narrazione, la cautela con l'ambizione.