Table of Contents

Понимание исторических статистических данных в исследованиях

Включение исторических статистических данных в исследования превращает аргумент из спекуляций в анализ, подкрепленный доказательствами. Численные записи из прошлого - такие как подсчеты переписей, торговые книги и таблицы смертности - позволяют ученым точно отслеживать демографические сдвиги, экономические колебания и социальные преобразования. При правильном использовании эти данные обеспечивают конкретную основу для проверки гипотез, выявления долгосрочных тенденций и сопоставления временных периодов. Однако работа с историческими данными требует больше, чем извлечение таблицы из архива. Вы должны понимать контекст, в котором были собраны данные, признавать ограничения и применять аналитические методы, подходящие для несовершенных записей. Это расширенное руководство охватывает все от поиска надежных исторических наборов данных до предотвращения общих ошибок, обеспечения того, что ваши исследования получают доверие и глубину. Следующие разделы предлагают пошаговую основу для включения исторической статистики в вашу работу, в комплекте с примерами, инструментами и передовой практикой.

Что такое исторические статистические данные?

Исторические статистические данные относятся к любой количественной информации, записанной в прошлом, которая может быть использована для современного анализа.

  • Переписи населения — десятилетние подсчеты жителей, часто разбитые по возрасту, полу, расе, роду занятий и семейному положению. Ранние переписи иногда регистрировали только глав домохозяйств; современные захватывают каждого человека.
  • Экономические показатели (FLT:0) — оценки ВВП, темпы инфляции, торговые балансы и индексы цен, реконструированные экономическими историками. Они часто требуют корректировки для изменения валют и покупательной способности.
  • Социальная статистика — уровень преступности, уровень образования, показатели общественного здравоохранения (например, таблицы смертности, заболеваемость). Определения «преступлений» резко изменились на протяжении веков.
  • Политические записи — результаты выборов, законодательные списки, отчеты о государственных расходах.Исторические данные о выборах могут использовать различные избирательные системы или границы, заведенные под герримандер.
  • Геопространственные и экологические данные — исторические карты, климатологические записи, обследования землепользования. Например, наборы данных палеоклиматологии NOAA предлагают данные о древесных кольцах и ледяных ядрах за столетия.

Эти записи существуют в таких разнообразных форматах, как рукописные книги, печатные правительственные отчеты и оцифрованные базы данных. Ключом является понимание того, что исторические данные редко бывают такими же чистыми или последовательными, как современные данные опроса. Определения меняются с течением времени (например, что составляет «безработицу» в 1900 году по сравнению с сегодняшним днем), методы сбора различаются, и пробелы являются общими. Признание этих недостатков является первым шагом к строгому анализу.

Зачем использовать исторические статистические данные?

Исследователи обращаются к историческим данным по нескольким веским причинам:

  • Определить долгосрочные закономерности (FLT:0) — Анализ 150-летних температурных рекордов для изучения изменения климата или отслеживания уровня преступности в течение столетия, чтобы понять последствия урбанизации.
  • Тестовые теории против прошлых событий — экономические историки используют исторические торговые данные для оценки влияния тарифной политики, войн или пандемий.
  • Предварительный контекст для текущих проблем – Понимание исторических тенденций неравенства информирует современные политические дебаты о распределении богатства и социальной мобильности.
  • Заполните пробелы, где качественные источники молчат (FLT: 1) — записи переписи могут выявить демографические изменения, которые современные авторы упустили из виду или отвергли.
  • Повышение доверия к исследованиям — Сочетание количественных данных с нарративными источниками усиливает аргументы и позволяет воспроизводимость.

Закрепляя свою работу эмпирическими данными, вы выходите за рамки анекдота и предлагаете результаты, которые другие ученые могут воспроизвести или оспорить. Историческая статистика также позволяет междисциплинарные связи, связывая историю с экономикой, социологией, политологией и общественным здравоохранением.

Шаги по включению исторических статистических данных в ваши исследования

1.Определить надежные источники

Начните с поиска авторитетных хранилищ. Государственные архивы, университетские службы данных и уважаемые исследовательские организации - ваши лучшие ставки. Ключевые ресурсы включают:

  • Национальное управление архивов и документации США (NARA) — содержит федеральные данные переписи, военные записи и экономическую статистику. Исследуйте статистические запасы NARA .
  • ICPSR (Межуниверситетский консорциум политических и социальных исследований) — крупнейший в мире архив данных социальных наук, включая исторические исследования.Посетить ICPSR.
  • UK Data Archive — хостинг данных переписи населения Великобритании с 1801 года.UK Data Service.
  • Историческая статистика США (HSUS) — сборник данных США с колониальных времён до наших дней.Доступ к HSUS.
  • Каталог данных Всемирного банка — включает исторические экономические показатели для большинства стран. Всемирный банк Открытые данные.
  • Европейская историческая статистика (FLT:0) — составлена Брайаном Митчеллом, доступна в печатном виде и в Интернете через многие университетские библиотеки.

При использовании любого источника проверьте его происхождение. Кто собрал данные? Для чего? Есть ли документация (кодовые книги), объясняющая переменные определения? Репутационные хранилища предоставляют эти метаданные. Также проверьте процесс оцифровки: были ли таблицы вручную закодированы или OCR'd? Ручная кейлинг имеет тенденцию быть более точной для источников до 20-го века.

2. понимать контекст сбора данных

Исторические данные — это продукт своего времени. Перепись 19-го века могла быть проведена счетчиками, идущими от двери к двери; более поздние переписи основывались на отправленных по почте формах. Законы, технологии и социальные нормы формировали, какие вопросы задавались и как люди реагировали. Например, перепись 1850 года в США была первой, которая зарегистрировала имя каждого свободного человека, но порабощенные люди считались только собственностью под именем своего поработителя. Аналогичным образом, историческая статистика преступности часто отражает приоритеты полиции, а не фактическую заболеваемость. Чтобы избежать неправильного толкования:

  • Прочитайте оригинальные инструкции, данные сборщикам данных (многие из них доступны в архивных кодовых книгах).
  • Примечание изменения в географических границах (например, линии графства, национальные границы). Национальная историческая географическая информационная система (NHGIS) предоставляет пограничные файлы для переписи населения США.
  • Исследуйте используемые юридические определения (например, «безработный» означает что-то другое до страхования от безработицы; «фермер» может включать арендаторов и рабочих).
  • Будьте в курсе недосчетов или пересчетов, возникающих в результате политических манипуляций, логистических проблем или сопротивления со стороны населения, настороженно относящегося к правительству.

Контекст не является факультативным; он является основополагающим для достоверного анализа.Инвестируйте время во вторичную литературу, которая обсуждает создание вашего набора данных.

3. Очистка и предварительная обработка данных

Исторические наборы данных часто содержат недостающие значения, непоследовательные коды или ошибки транскрипции.

  • Стандартизируйте форматы (FLT:0) — конвертируйте валюту из старых фунтов в современные эквиваленты, унифицируйте форматы дат (например, юлианский к григорианскому календарю), гармонизируйте категории расы / этнической принадлежности в течение десятилетий.
  • Зафиксируйте недостающие значения — используйте методы, такие как линейная интерполяция, множественные вычисления или максимальная вероятность, но четко документируйте свои предположения в журнале предварительной обработки.
  • Проверка на наличие выпадающих — внезапный всплеск может быть ошибкой данных (например, неуместной десятичной, ошибкой транскрипции) или реальным событием (например, неурожай, война).
  • Создать производные переменные — например, рассчитать ставки на душу населения по совокупным показателям населения или генерировать темпы роста по индексам цен.
  • Сделайте с отсутствующими идентификаторами страны/региона — исторические границы меняются (например, Пруссия, Австро-Венгрия), поэтому вам может потребоваться сопоставить современные единицы с историческими эквивалентами.

Программное обеспечение, такое как R (с пакетами, такими как tidyverse, Zoo и Histor) или Python (pandas, numpy), может обрабатывать очистку в масштабе. Ключ заключается в том, чтобы хранить прозрачный журнал каждого изменения, чтобы другие могли реплицировать вашу работу. Рассмотрите возможность использования контроля версий (например, Git) для ваших сценариев обработки данных.

4. Анализ тенденций и моделей

Как только данные будут чистыми, изучите их. Начните с описательной статистики: каковы средства, медианы и диапазоны? Переменные графика с течением времени для поиска тенденций, циклов или структурных разрывов. Общие аналитические подходы включают:

  • Регрессия временнóй серии — моделирование влияния одной переменной на другую при контроле временных тенденций.Помните об автокорреляции и стационарности (при необходимости используйте сначала дифференциацию).
  • Различия в различиях — сравнивают группу, пострадавшую от исторического события (например, изменения политики, стихийного бедствия) с контрольной группой до и после события.
  • Анализ факторов — сведение многих исторических показателей к базовым измерениям (например, индекс «модернизации» от урбанизации, грамотности и промышленного производства).
  • Кластерный анализ — группы регионов или периодов с аналогичными статистическими профилями для выявления типологий развития.
  • Анализ истории событий — полезен для изучения длительности (например, времени до того, как город примет новую технологию).

Всегда помните о размерах выборки и качестве данных. Небольшое количество точек данных может не поддерживать сложные модели. Консультируйтесь с такими ресурсами, как Causal Inference for Historical Sociology для методов, адаптированных к историческим данным. Для более общего руководства по временным рядам Прогнозирование: принципы и практика Хайндмана и Атанасопулоса предлагает бесплатные онлайн-главы.

5.Используйте эффективные визуализации

Исторические данные часто охватывают длительные периоды, что делает визуализацию необходимой. Хорошие графики могут выявить невидимые в таблицах закономерности. Следуйте этим лучшим практикам:

  • Использовать линейные диаграммы для временных рядов — наиболее интуитивный формат для трендов. Рассмотрим использование нескольких линий для подкатегорий (например, мужская и женская смертность).
  • Добавить аннотацию к важным событиям — обозначить войны, изменения в политике, экономические кризисы или климатические события на временной шкале.
  • Поддерживайте согласованность масштабов на нескольких графиках, чтобы обеспечить сравнение, но используйте шкалы журналов, если данные охватывают порядки величины (например, ВВП на протяжении веков).
  • Выберите палитры, удобные для цветовой слепоты — избегайте красно-зеленых контрастов.ColorBrewer или палитры viridis.
  • Включите доверительные интервалы , когда агрегация данных вводит неопределенность (например, от вычисления или выборки).
  • Обеспечить читаемость — использовать четкий шрифт, избегать чрезмерных 3D-эффектов и маркировать топоры напрямую, а не полагаться на легенды, если это возможно.

Такие инструменты, как Tableau, ggplot2 в R и PythonMatplotlib, хорошо обрабатывают большие наборы данных.kepler.gl или Leaflet для веб-дисплеев.

6. перекрестная проверка с несколькими источниками

Триангуляция - сравнение одной и той же меры из разных коллекций - укрепляет доверие. Например, количество иммигрантов в переписи США можно проверить по спискам пассажиров судна или записям на государственном уровне. Если два надежных источника не согласны, выясните, почему: ошибки, различия в охвате или изменения в определении. В вашей записи сообщите о расхождениях честно и объясните, как вы с ними обращались. Анализ чувствительности может показать, как выводы содержатся в разных предположениях о качестве данных.

Преодоление общих подводных камней

Анахронизм

Самая большая опасность заключается в навязывании современных категорий прошлым данным. "фермер" 19-го века мог быть безземельным рабочим, мелким фермером или владельцем плантации - все они объединены в один профессиональный кодекс. Избегайте включения исторических чисел в современные коробки, если у вас нет убедительных доказательств непрерывности. По возможности используйте дезагрегированные микроданные или реконструируйте категории из оригинальных классификаций.

Предвзятое отношение к выживанию

Доступны только данные, которые сохранились до наших дней. Это часто перекос в сторону более богатых, грамотных или централизованно управляемых обществ. Например, средневековая торговая статистика в основном поступает из европейских портов; африканские и азиатские записи редки. Признайте эти пробелы и подумайте, систематически ли они искажают ваши выводы. Используйте архивные руководства и исторические библиографии, чтобы определить, чего может не хватать.

Экологическая ошибка

Совокупные данные (например, средний доход на округ) не могут использоваться для вывода об индивидуальном поведении. Тенденция на уровне группы может не иметь место для какого-либо конкретного человека в этой группе. Если ваш вопрос исследования касается отдельных лиц, ищите микроданные - анонимные записи отдельных людей или домашних хозяйств - а не резюме. Многие образцы переписи (например, IPUMS) предоставляют микроданные для США с 1850 года и далее.

Игнорирование ошибки измерения

Исторические данные пронизаны преднамеренными и случайными ошибками. Переписи могут пропустить бездомное население; торговые показатели могут опустить контрабанду; оценки ВВП основаны на предположениях о неформальной экономике. Обсудите ошибку измерения явно и, если возможно, проверьте чувствительность ваших результатов к правдоподобным диапазонам ошибок. Например, повторите свои регрессии, предполагая 10%-ную скорость неправильной классификации в ключевой переменной.

Предпочтения выбора в оцифрованных наборах данных

Проекты оцифровки часто отдают приоритет известным, легкодоступным коллекциям. Это может создать искусственную концентрацию на определенных регионах, временных периодах или темах. Всегда спрашивайте: какая доля оригинальных записей была оцифрована? Был ли отбор случайным? Если нет, ваш анализ может непреднамеренно отражать приоритеты архивистов, а не историческую реальность.

Инструменты и методы для расширенного анализа

Вывод данных из исторических документов

Многие исторические наборы данных существуют только в виде печатных таблиц или отсканированных страниц. Оптическая распознавание символов (OCR) значительно улучшилась, но все еще борется со старыми шрифтами, мазками чернил и многоколонными макетами. Для сложных документов исследователи используют:

  • Transkribus — платформа с искусственным интеллектом для распознавания рукописного текста, часто используемая для архивных документов 17-19 веков.
  • Tabula — извлекает данные из таблиц PDF, особенно полезных для правительственных отчётов в формате PDF.
  • Tesseract OCR — OCR-движок с открытым исходным кодом с поддержкой многих языков; может быть обучен на исторических шрифтах.
  • DH инструменты — как предложения Консорциума лингвистических данных для исторического OCR LDC.

Всегда вручную проверяйте образец автоматически извлекаемых данных для оценки частоты ошибок. Для критических переменных рассмотрите двойную запись двух независимых исследователей и устраните несоответствия.

Связывание наборов данных с течением времени

Для создания продольных данных часто требуется связывать записи с разных точек - например, отслеживать людей по нескольким переписям. Это делается с использованием вероятностной связи записей (также называемой нечетким сопоставлением). Программное обеспечение, такое как , может помочь. Однако связь вводит смещения выбора, если определенные группы (мобильные, бедные) труднее сопоставить. Используйте блокировку на переменных, таких как место рождения или возраст, чтобы повысить точность.

Использование исторической ГИС

Географические информационные системы (ГИС) позволяют отображать исторические данные на исторические или современные границы. Национальная историческая географическая информационная система (НГИС) предоставляет данные переписи населения США и пограничные файлы с 1790 года. Для других стран попробуйте [ФЛТ: 2] Исторические ГИС Европы [ФЛТ: 3] или национальные архивы. Пространственный анализ может выявить региональные различия в богатстве, здоровье или политическом поведении, которые агрегируют национальную статистику. Будьте осторожны с изменяемыми проблемами ареальных единиц: изменение размеров границ влияет на результаты.

Выбор правильных статистических методов для исторических данных

Поскольку исторические данные часто нарушают стандартные регрессионные допущения (например, постоянная дисперсия, независимость), рассмотрим специализированные методы:

  • Нью-Уэст стандартные ошибки — корректировка на автокорреляцию и гетероскедастичность во временных рядах.
  • ARIMA-модели — для прогнозирования или тестирования причинных воздействий исторических потрясений.
  • Количественная регрессия — исследует эффекты по всему распределению, полезные, когда средства вводят в заблуждение (например, неравенство в богатстве).
  • Ботстраппинг — для оценки неопределенности с небольшими или грязными выборками.

Лучший метод зависит от структуры данных и исследовательского вопроса. Приоритет надежности над сложностью; простая разница в средствах с доверительными интервалами бутстрапа может быть более надежной, чем неправильная модель структурного уравнения.

Интеграция количественных и качественных доказательств

Одни только цифры не могут рассказать всю историю. Совместите свои статистические данные с современными письмами, дневниками, газетными статьями или законодательными дебатами. Качественные источники объясняют механизмы, лежащие в основе количественных моделей. Например, если вы наблюдаете падение цен на зерно после 1846 года, парламентские записи могут показать, что отмена законов о зерне вызвала изменение. И наоборот, качественные источники могут предупредить вас о проблемах с данными: редакционная статья газеты, жалующаяся на недосчет переписи в конкретном районе, предполагает, что официальный подсчет ненадежен для этой области.

При написании статьи, переплетайте два типа доказательств. Параграф может открыться словами «Статистическая запись показывает снижение на 12%», затем продолжить «которым современные наблюдатели приписывают...» и процитировать дневник фермера. Этот баланс делает ваш аргумент богаче и убедительнее. Используйте блокквоты экономно для особенно раскрытия первичных источников, но в основном перефразируйте для поддержания потока.

Этические соображения

Исторические данные часто включают уязвимые группы населения - порабощенных людей, беженцев, бедных - которые не имели никакого контроля над тем, как их информация была записана или использована. Даже когда записи вековые, избегайте представления людей дегуманизирующим образом. Сосредоточьтесь на структурных моделях, а не на отдельных случаях, если индивидуальное повествование не является существенным. Кроме того, признайте, что извлечение данных и анализ могут воспроизводить колониальные или расистские предположения, если не обрабатывать критически. Подумайте, чья перспектива отсутствует из числа (женщины, меньшинства, неграмотные группы) и обратитесь к этим молчаниям в вашей дискуссии. При использовании данных из колонизированных районов, признайте динамику власти, которая сформировала сбор и сохранение данных.

Также будьте прозрачны в отношении собственной позиционности. Если вы анализируете исторические данные об сообществе, к которому вы не принадлежите, проконсультируйтесь с экспертами из этого сообщества или хотя бы прочитайте работы ученых, которые это делают. Этические исторические исследования - это не только точность, но и уважение и подотчетность.

Заключение

Исторические статистические данные являются мощным инструментом для исследователей, которые подходят к ним с строгостью и смирением. Тщательно выбирая источники, понимая их контекст, очищая и анализируя данные и признавая ограничения, вы можете производить исследования, которые не только описывают прошлое, но и освещают устойчивые социальные и экономические силы. Лучшая стипендия сочетает в себе цифры с повествованием, осторожностью с амбициями. Когда вы начинаете свой следующий проект, помните, что каждый исторический набор данных является человеческим артефактом - несовершенным, частичным, но если обрабатывать его с осторожностью, чрезвычайно показательным. Примените шаги, изложенные здесь, перекрестно проверьте свои выводы, и ваша работа будет стоять в качестве надежного вклада в научный разговор. Изучаете ли вы распространение индустриализации, влияние пандемий или эволюцию демократии, историческая статистика предлагает путь к основанному на фактических данных пониманию, которое может информировать как академические дебаты, так и реальные решения.