historical-analysis-and-study-techniques
Применение статистических методов для анализа исторических данных о преступности
Table of Contents
Понимание исторических данных о преступности
Исторические данные о преступности предлагают уникальную возможность изучить социальную, экономическую и правовую структуру прошлых обществ. В отличие от современной статистики преступности, которая извлекает выгоду из стандартизированных протоколов отчетности и цифровых баз данных, исторические записи являются неоднородными, неполными и часто предвзятыми. Исследователи должны ориентироваться в источниках, начиная от рукописных полицейских регистров до сенсационных газетных колонок, каждая со своим происхождением и ограничениями. Наиболее распространенные первичные источники включают:
- Регистры полицейских участков и констебльные отчеты — Часто рукописные и локально поддерживаемые, эти рекордные инциденты сообщаются властям, но могут отражать приоритеты отчетности, а не фактическое преступление.
- Судебные расшифровки и обвинительные акты — Предоставьте подробную информацию об обвинениях, приговорах и приговорах, хотя они охватывают только случаи, которые достигли официального судебного преследования, а не все правонарушения.
- Газетные колонки преступлений — Предлагают богатые детали повествования, но, как правило, подчеркивают насильственные или необычные преступления, игнорируя мелкие правонарушения, а редакционная предвзятость может искажать представление.
- Парламентские документы и статистические тезисы — Начиная с 19-го века, правительства составляли национальные таблицы преступлений, используя все более стандартизированные категории, что позволяло проводить межрегиональные сравнения.
- Расследования коронеров и тюремные реестры — Дополнительные данные о медицинской причине смерти и демографическая информация о правонарушителях, часто включая возраст, род занятий и грамотность.
Оцифровка стала преобразующим шагом, разблокировав архивы, которые ранее были доступны только через физические посещения. Такие проекты, как Old Bailey Online и Отчеты о преступлениях Национальных архивов Великобритании , делают тысячи страниц доступными для поиска и машинного чтения. Однако качество данных сильно варьируется. Разборчивость почерка, непоследовательная категоризация по юрисдикциям и недостающие записи требуют статистических методов для вывода, импичмента или исправления. Понимание этих ограничений имеет решающее значение перед применением любого метода, поскольку плохое качество данных может распространять ошибки даже через самые сложные модели.
Общие проблемы с данными в исторических записях преступлений
- Недостаточная отчетность — Многие преступления никогда не сообщались из-за страха, недоверия к властям, тривиализации или незаконности сообщения о некоторых действиях (например, домашнее насилие в эпохи, когда оно было законно оправдано). Статистические модели с использованием методов захвата-захвата могут оценить истинную частоту, сравнивая два независимых источника (например, полицейские записи и госпитализации).
- Изменение правовых определений — То, что составляло «кража» в 1800 году, отличается от современной классификации краж. Преступления, такие как «колдовство» или «содомия», исчезли из законов, в то время как появились новые преступления, такие как «кража автомобилей». Исследователи должны гармонизировать категории на протяжении десятилетий, а иногда и через национальные границы.
- Слабое правоприменение — Полиция и суды исторически нацеливались на определенные этнические группы, социально-экономические классы или политических диссидентов. Исторический уровень преступности может поэтому отражать модели правоприменения больше, чем фактическое оскорбительное поведение. Например, нарушения общественного порядка в Лондоне 19-го века непропорционально затронули ирландских иммигрантов и бедных.
- Пробелы в охвате — Войны, административные реорганизации или уничтожение записей оставляют временные дыры. Интерполяция временны́х рядов, множественные вычисления или байесовское сглаживание могут решить эту проблему, но исследователи должны документировать предположения, лежащие в основе каждой техники.
- Ошибка измерения в ключевых переменных — Возраст может быть неправильно запомнен, адреса неверны, а имена неправильно написаны. Вероятностная связь записей может объединять записи между источниками с количественными показателями ошибок.
Ключевые статистические методы анализа исторических преступлений
Описательная статистика: обобщая прошлое
Описательная статистика составляет основу любого количественного исторического анализа. Расчет средств, медиан, стандартных отклонений и процентилей количества преступлений в год, в каждом регионе или в каждом типе преступления обеспечивает быстрый обзор и помогает выявить проблемы качества данных. Например, исследователь, изучающий кражи в викторианском Лондоне, может обнаружить, что среднее число зарегистрированных краж в месяц было 120 в 1860 году, но распределение было сильно искажено из-за сезонных всплесков вокруг праздников и крупных общественных мероприятий. Гистограммы и сквозняки выявляют выбросы, такие как внезапный рост карманных краж во время Великой выставки 1851 года, которые требуют последующего расследования.
В Англии 19-го века преобладали имущественные преступления (около 80% преступлений, подлежащих обвинению), в то время как насильственные преступления были небольшой частью, но это соотношение изменилось с урбанизацией и изменением юридических определений нападения. Описательная статистика может быть представлена с доверительными интервалами для учета ошибки выборки, когда данные взяты из частичных архивов, и размеры эффекта, такие как Коэн d, могут контекстуализировать различия между регионами или периодами.
Современные подходы включают использование оценок плотности ядра для сглаживания временных тенденций без навязывания параметрических предположений и создание панелей инструментов с интерактивными визуализациями (например, с использованием R или Python ), которые позволяют историкам динамически исследовать шаблоны.
Анализ временных рядов: выявление тенденций и сезонности
Исторические данные о преступности почти всегда собираются с течением времени, что делает анализ временных рядов существенным. Такие методы, как скользящие средние, сезонное разложение с использованием STL (сезонно-тенденциозное разложение с использованием LOESS) и модели ауторегрессивной интегрированной скользящей средней (ARIMA), помогают отделить тенденцию от шума и определить поворотные моменты. Например, анализ ежемесячных отчетов о преступности из Парижа между 1825 и 1850 годами может выявить долгосрочную тенденцию к росту населения и индустриализации, перенасыщенную сезонным всплеском каждое лето, когда сельские мигранты прибывают в поисках работы. Простая линейная регрессия во времени может количественно оценить годовое процентное изменение, но более надежные модели учитывают автокорреляцию, гетероскедастичность и резкие сдвиги.
Исследователи также должны скорректировать изменения в практике записи. Если новый комиссар полиции в 1840 году потребовал более строгого освещения мелких краж, кажущаяся «волна преступности» может быть артефактом политики, а не реальным увеличением. Анализ вмешательства (форма прерванных временных рядов) может проверить, могут ли политические сдвиги значительно изменить зарегистрированные показатели, используя такие методы, как тесты Чоу или байесовские структурные временные ряды (BSTS). Внешние ссылки, такие как Журнал междисциплинарной истории специальный выпуск по истории преступности , предоставляют тематические исследования с использованием этих методов, чтобы отделить политические эффекты от основных тенденций.
Регрессионный анализ: исследование корреляций
Множественная регрессия позволяет историкам исследовать отношения между уровнем преступности и экономическими, демографическими или социальными переменными, контролируя при этом вмешивающихся. Например, исследование городов США в 1920-х годах может моделировать уровень убийств как функцию безработицы, потребления алкоголя (после введения запрета), плотности населения и доли молодых людей. Обычные наименьшие квадраты распространены, когда уровень преступности является непрерывным (например, зарегистрированный для нормализации), но поскольку данные о преступности часто основаны на подсчетах (положительные целые числа) и чрезмерно рассеяны, отрицательная биномиальная регрессия часто предпочтительна. Модели Пуассона могут использоваться, когда дисперсия равна среднему, хотя исторические данные редко соответствуют этому условию.
Коэффициенты эластичности могут указывать на то, что 10%-ный рост безработицы был связан с 5%-ным ростом кражи, сохраняя при этом другие факторы постоянными. Однако корреляция не подразумевает причинно-следственную связь; опущенные переменные (например, интенсивность полиции или готовность общественности сообщать) могут искажать результаты. Инструментальные переменные подходы, когда существует действительный инструмент (например, изменения в строительстве железных дорог, влияющие на местные экономические условия или погодные потрясения, влияющие на урожайность), помогают решать эндогенность. Исследователи всегда должны обсуждать предположения идентификации прозрачно и рассматривать использование анализов чувствительности, таких как границы Розенбаума для наблюдательных исследований.
Геопространственный анализ: картирование горячих точек преступности
Геопространственный анализ произвел революцию в исторической криминологии, раскрыв пространственные измерения преступности. Геокодируя адреса из старых судебных записей, полицейских бюллетеней или газетных отчетов, ученые могут создавать точечные карты и поверхности плотности ядра. Такие инструменты, как QGIS или R's и , позволяют исследовать пространственные модели в масштабах от отдельных улиц до целых городов. Например, исследование Нью-Йорка 19-го века может обнаружить, что горячие точки преступности сгруппированы вблизи набережной и жилых районов, в соответствии с картами бедности, созданными Джейкобом Риисом и Обществом благотворительной организации.
Статистические тесты Моран I для глобальной пространственной автокорреляции — окружены ли районы с высоким уровнем преступности другими областями с высоким уровнем преступности. Местные показатели пространственной ассоциации (LISA) могут идентифицировать конкретные кластеры. Географически взвешенная регрессия (GWR) моделирует, как связь между преступностью и социально-экономическими условиями варьируется в пространстве, показывая, что эффект бедности может отличаться между коммерческими и жилыми районами. Исторические слои ГИС, такие как слои из Национальной исторической географической информационной системы , обеспечивают границы переписи и демографические данные за предыдущие десятилетия, что позволяет интегрировать пространственные данные с другими статистическими анализами.
Продвинутые методы: машинное обучение и причинный вывод
Помимо традиционной регрессии, методы машинного обучения все чаще применяются к историческим данным о преступности. Случайные леса и модели повышения градиента могут захватывать нелинейные отношения и взаимодействия без сильных параметрических предположений, полезных для прогнозирования отсутствующих значений преступности или вменения неизвестных географических координат. Однако интерпретируемость остается проблемой; такие методы, как значения SHAP (SHapley Additive exPlanations), могут помочь объяснить, какие функции приводили к предсказаниям.
В случае причинно-следственных вопросов (например, сократило ли введение профессиональной полиции преступность?), в рамках проектов "различия в различиях" сравниваются изменения в показателях преступности между юрисдикциями, которые приняли реформы, и теми, которые не приняли, до и после изменения политики. Методы синтетического контроля создают контрфактную структуру из взвешенной комбинации блоков контроля, полезной, когда вмешательство было осуществлено только одним или несколькими субъектами. Эти подходы требуют тщательного отбора контрольных групп и проверки на наличие параллельных тенденций в период до вмешательства.
Практический рабочий процесс: от архива к анализу
Систематический рабочий процесс обеспечивает воспроизводимость и минимизирует ошибки во всем процессе исследования. Следующие шаги описывают типичный подход с уделением внимания документации и прозрачности:
- Сбор и транскрипция данных — Фотографирование или сканирование оригинальных документов в высоком разрешении.Использовать оптическое распознавание символов (OCR) с ручной коррекцией для рукописных записей; такие инструменты, как Tesseract или Transkribus (специализированные на историческом почерке) могут ускорить процесс, но все же требуют проверки человеком. Для табличных данных из печатных источников рекомендуется двойной ввод данных с проверками надежности между ратерами.
- Очистка и гармонизация данных — Стандартизовать даты в последовательный календарь (например, ISO 8601), геокодировать местоположения с использованием исторических бюллетеней и создать единую систему классификации преступлений. Используйте существующие таксономии, такие как ICPSR классификации преступлений в качестве базы и картировать исторические категории на них. Обработка недостающих значений с помощью множественных вычислений (используя прогностическое среднее соответствие) или анализ чувствительности для оценки воздействия различных механизмов недостающего.
- Исследовательский анализ данных (EDA) — Генерировать сводную статистику, графики времени и корреляционные матрицы. Выявлять выбросы и потенциальные аномалии записи (например, шипы, совпадающие с известными событиями). Используйте визуализацию для проверки структурных разрывов или изменений дисперсии с течением времени.
- Метод отбора и предварительной регистрации — На основе вопросов исследования (например, обнаружения тренда, причинно-следственного вывода, кластеризации) выберите подходящие модели. Предварительно зарегистрируйте план анализа на таких платформах, как Open Science Framework, чтобы избежать p-взлома и повысить доверие, даже к историческим исследованиям.
- Модельная аттестация и валидация — Фит-модели, проверяйте остаточные значения на нормальность, гомоскедастичность и автокорреляцию. Для байесовских подходов проверяйте задние прогностические распределения и используйте WAIC или перекрестную валидацию для сравнения моделей. Для машинного обучения используйте k-кратную перекрестную валидацию и внепробное тестирование.
- Толкование в историческом контексте — Статистический вывод должен интерпретироваться наряду с качественными доказательствами: письмами, мемуарами, газетными передовиками и правовыми изменениями.Это предохраняет от анахронических выводов и помогает отличать статистические закономерности от реальных исторических процессов.
Тема: Анализ краж в Лондоне 19-го века
Чтобы проиллюстрировать интеграцию нескольких методов, рассмотрим гипотетическое, но репрезентативное исследование кражи в Лондоне с 1830 по 1870 гг. Исследователь собирает данные из Old Bailey Online и британских парламентских документов, оцифровывая 20 000 обвинительных заключений о краже. Данные включают дату, местоположение (улица и приход), стоимость украденных товаров, тип жертвы (физическое лицо, бизнес или учреждение), и был ли осужден преступник. Вторичные данные о плотности населения, средней заработной плате, местах расположения полицейских участков и улучшении общественного освещения извлекаются из записей переписи и исторических опросов.
Описательные находки
Описательная статистика показывает, что кражи достигли максимума в 1840-х годах со средним значением 120 в месяц и стандартным отклонением 35. Средняя украденная стоимость составляла 2 фунта стерлингов (приблизительно 200 фунтов стерлингов в 2025 году покупательная способность), но распределение было правосторонним, потому что некоторые кражи включали ценные ювелирные изделия или наличные деньги. Большинство преступников были молодыми мужчинами (85% случаев), и уровень осуждения колебался около 60%, хотя это варьировалось по типу кражи (карманные кражи имели более низкие показатели осуждения, чем ломка дома). Распределение краж по приходам было очень неравномерным: Ист-Энд (Витехапел, Бетнал Грин) составлял 40% всех случаев, несмотря на то, что имел только 20% населения города.
Анализ временных рядов
Модель ARIMA (1,1,0) с сезонным компонентом (отставание 12) показывает 3% ежегодное снижение зарегистрированных краж после 1856 года, совпадающее с введением детективного отделения столичной полиции. Анализ вмешательства с использованием сегментированной регрессии подтверждает статистически значимое падение (p < 0,01) после 1856 года, даже после контроля роста населения и изменений в количестве полицейских. Однако дальнейшее разложение показывает, что снижение было полностью обусловлено сокращением мелких краж (предметы менее 1 фунта стерлингов), в то время как крупное воровство оставалось стабильным - предполагая, что новое детективное отделение, возможно, сосредоточилось на профессиональных преступниках, а не случайных преступниках.
Регрессионный анализ
Отрицательная биномиальная регрессия предсказывает количество краж в каждом районе (приход) в зависимости от плотности населения, среднего дохода (оцениваемого из налоговых отчетов), количества полицейских участков, расстояния до ближайшего рынка и манекена для присутствия железнодорожной станции. Результаты показывают, что удвоение плотности населения связано с увеличением краж на 40% (отношение коэффициента заболеваемости = 1,40, 95% ДИ: 1,25-1,58), в то время как увеличение среднего дохода на один стандарт отклонения связано с уменьшением на 15% (IRR = 0,85, 95% ДИ: 0,78-0,93). Наличие полицейского участка не показывает значительного эффекта (IRR = 1,02, р = 0,45) - предполагая, что правоприменение было реактивным, а не профилактическим. Модель объясняет 55% дисперсии между приходами, включая значительное взаимодействие между плотностью и доходом.
Геопространственный анализ
Картирование мест кражи (геокодированных на пересечениях улиц) показывает явную точку доступа в Ист-Энде (вокруг Уайтчепел-Роуд) и вдоль реки Темзы, особенно вблизи доков и причалов, где перевозились товары. Пространственная регрессия с использованием географически взвешенной регрессии указывает на то, что отрицательная связь между доходом и кражей сильнее в Вест-Энде (богатые приходы), где богатые районы испытывали очень низкие показатели кражи. Напротив, отношения слабее в Ист-Энде, где даже относительно более обеспеченные районы имели умеренные показатели кражи - предполагая, что другие факторы (социальная дезорганизация, переходное население) приводили к преступности там. Моран I для остатков составляет 0,12 (р = 0,03), что указывает на небольшую оставшуюся пространственную автокорреляцию, которая может быть решена с пространственной моделью отставания.
Качественная интеграция
Статистические модели совпадают с современными описаниями.В 1850-х годах в редакционных статьях The Times жаловались на «профессиональных воров», работающих в пеших прогулках Сент-Джайлс и Семи Диалов. Судя по записям, 30% правонарушителей были ранее арестованы, многие из тех же районов.Дневники комиссаров полиции отмечают, что детективное отделение сосредоточилось на известных заборах и получателях украденных товаров, что согласуется с падением мелкой краж.Сочетание количественных и качественных доказательств укрепляет вывод о том, что экономическое неравенство и целевые реформы полиции сформировали модели краж, и что очевидное снижение после 1856 года частично реально и частично является артефактом изменяющейся правоприменительной практики.
Проблемы и смягчения
Помимо уже отмеченных проблем с данными, исследователи должны решить несколько методологических проблем, которые могут подорвать статистические данные:
- Экологическая ошибка — Совокупный уровень преступности может не отражать индивидуальное оскорбительное поведение. Использование данных индивидуального уровня в многоуровневых моделях (например, иерархических линейных моделях со случайными эффектами для районов) помогает преодолеть микро- и макроуровни.
- Ошибка измерения в ключевых переменных — имена, возраст и адреса могут быть записаны неточно. Вероятностная связь записи (например, с использованием пакета в R) объединяет записи из разных источников с количественными показателями ошибок, а анализ чувствительности имитирует различные уровни ошибок для оценки надежности.
- Предвзятость выбора — В записях фигурируют только преступления, дошедшие до суда; многие не фигурировали. Коррекция Хекмана или взвешивание баллов склонности могут корректироваться под отбор, но только в том случае, если прослеживаются корреляты отчётности. Например, исследование сексуального насилия в XIX веке должно учитывать тот факт, что отчётность зависела от социального статуса и пола жертвы.
- Временная нестабильность — Взаимосвязи между переменными (например, безработица и кража) могут меняться в течение десятилетий из-за эволюционирующих социальных норм или экономических структур.Регрессия качения или модели пространства-состояния (например, динамические линейные модели) захватывают изменяющиеся во времени параметры, предоставляя оценки того, как эволюционируют коэффициенты.
- Предвзятость и воспроизводимость публикации — Исторические исследования редко реплицируются из-за уникальности наборов данных. Исследователи всегда должны публиковать код репликации и анонимные данные (где позволяет конфиденциальность) для того, чтобы другие могли проверить результаты.Сеть данных об исторических преступлениях предлагает рекомендации по документации, обмену данными и этическим соображениям при работе с историческими записями об аресте, которые содержат личную информацию.
Интеграция качественного контекста
Одни только статистические методы не могут объяснить, почему в викторианском Лондоне снизилось число преступлений или почему некоторые группы были представлены слишком широко. Чтение первичных источников — дневников комиссаров полиции, парламентских дебатов, газетных сообщений о преступлениях — обеспечивает причинно-следственные связи и контекстуализирует статистические закономерности. Например, снижение краж после 1856 года может быть частично связано с улучшением уличного освещения (физическая мера профилактики, задокументированная записями городского совета об установке газовых ламп) или изменением общественной терпимости к имущественным преступлениям по мере роста экономики (отражается в руководящих принципах вынесения приговоров в суде, которые стали менее карательными за мелкие кражи). Ни один эффект не отражается непосредственно в регрессии, но качественные доказательства помогают интерпретировать статистические ассоциации.
Подходы, основанные на смешанных методах, становятся все более распространенными. Ученые могут использовать статистику для выявления аномалий (например, всплеск арестов за «разгул» в 1839 году), а затем обратиться к качественным архивам (минуты городского совета, газетные передовицы) для расследования этих случаев. Скачок может быть прослежен до нового бродячего постановления, а не реального увеличения подозрительного поведения. Этот итеративный диалог между числами и повествованиями обогащает историческое понимание, гарантируя, что статистические данные остаются основанными на живых реалиях прошлых обществ. Исследователи также должны рассмотреть возможность включения устных историй (где они доступны), визуальных доказательств (карты, фотографии) и исследований материальной культуры для триангуляции результатов.
Будущие направления и этические соображения
В перспективе проекты по цифровой истории продолжат расширять имеющиеся наборы данных. Текстовый анализ судебных стенограмм с использованием обработки естественного языка (NLP) может извлечь из повествовательных полей отношения жертвы-нарушителя, типы оружия и способы работы. Тематическое моделирование освещения преступлений в газетах показывает сдвиг общественных проблем с течением времени. Сетевой анализ преступных ассоциаций (с использованием данных о соаресте) может отображать сети организованной преступности и их эволюцию. Эти методы требуют тщательного внимания к провенансу данных и вычислительной воспроизводимости.
Этические соображения также возникают при работе с историческими записями преступлений. Пока люди давно мертвы, их потомки могут по-прежнему испытывать клеймо от причастности семьи к преступлению. Исследователи должны анонимизировать данные при публикации и учитывать потенциальный вред от связи исторических арестов с современными сообществами. Кроме того, чрезмерная зависимость от полицейских записей может увековечить исторические предубеждения, изображая определенные группы как по своей сути преступные, игнорируя структурное неравенство. Статистические методы должны использоваться не только для описания моделей, но и для критики систем, которые их произвели.
Заключение
Применение статистических методов к историческим данным о преступности превращает разрозненные, несовершенные записи в строгие доказательства о прошлых обществах. Описательная статистика, временные ряды, регрессия и геопространственный анализ каждый предлагает отдельную линзу, и в сочетании с тщательным обращением с отсутствующими данными, методами причинного вывода и качественным контекстом они раскрывают закономерности, которые формируют наше понимание социальных изменений. Проблемы - сообщение о предвзятости, сдвигах в определении, экологической ошибке, ошибке измерения - преодолимы с помощью прозрачной методологии и скептического чтения результатов. Предварительная регистрация, код репликации и анализ чувствительности помогают обеспечить, чтобы результаты были надежными, а не артефактами выбора аналитика.
Прошлое сохраняет свою сложность, но статистический анализ помогает нам считать, составлять карты и интерпретировать его повторяющиеся измерения. По мере роста цифровых архивов и развития вычислительных инструментов у историков появляется беспрецедентная возможность задавать более широкие вопросы о взаимосвязи между преступностью, обществом и управлением во времени. Поддерживая критическую позицию по отношению к источникам данных и диалогу с качественными доказательствами, исследователи могут создавать достоверные и тонкие отчеты, которые выдерживают проверку как историками, так и статистками. Область исторической криминологии готова внести свой вклад не только в наше понимание прошлого, но и в современные дебаты о полиции, неравенстве и справедливости, которые остаются глубоко актуальными сегодня.