Comprender datos históricos sobre el crimen

Los datos históricos sobre la delincuencia ofrecen un objetivo único para examinar el tejido social, económico y jurídico de sociedades pasadas. A diferencia de las estadísticas modernas sobre la delincuencia, que se benefician de protocolos de presentación de informes estandarizados y bases de datos digitales, los registros históricos son heterogéneos, incompletos y a menudo sesgados.Los investigadores deben navegar por fuentes que van desde los libros de la policía manuscritos hasta columnas de periódicos sensacionalizados, cada unas con sus propias fuentes primarias.

  • Língers de la estación de policía e informes contables] – A menudo mantenidos a mano y mantenidos localmente, estos incidentes registrados denunciaron a las autoridades pero pueden reflejar prioridades de presentación de informes en lugar de delitos reales.
  • Transcripciones de corrales y rollos de acusación] – Proporcione detalles sobre cargos, veredictos y sentencias, aunque sólo capturan casos que alcanzaron el procesamiento formal, no todos los delitos.
  • Columnas de delitos de periódico – Ofrecer detalles narrativos ricos pero tienden a enfatizar crímenes violentos o inusuales al ignorar delitos menores, y el sesgo editorial puede distorsionar la representación.
  • Documentos parlamentarios y resúmenes estadísticos – A partir del siglo XIX, los gobiernos compilaron tablas nacionales de delincuencia utilizando categorías cada vez más estandarizadas, permitiendo comparaciones interregionales.
  • Inquisición de los delincuentes y registro de prisiones – Datos complementarios con causa médica de muerte e información demográfica sobre los delincuentes, a menudo incluyendo edad, ocupación y alfabetización.

La digitalización ha sido un paso transformador, desbloqueando archivos que antes eran accesibles sólo a través de visitas físicas. Proyectos como el Old Bailey Online y el UK National Archives’ crime records hacen que miles de páginas sean buscables y legibles por máquina. Sin embargo, la calidad de los datos varía enormemente.

Problemas de datos comunes en registros históricos de crímenes

  • ]Informing – Muchos crímenes nunca fueron denunciados por temor, desconfianza de las autoridades, trivialización o ilegalidad de reportar ciertos actos (por ejemplo, violencia doméstica en épocas en que fue legalmente condonado). Los modelos estadísticos que utilizan métodos de captura-recaptura pueden estimar la verdadera incidencia comparando dos fuentes independientes (por ejemplo, registros policiales y admisiones hospitalarias).
  • El cambio de definiciones legales] – Lo que constituye “larcenía” en 1800 difiere de la clasificación actual del robo. Los crímenes como “witchcraft” o “sodomy” desaparecieron de los estatutos, mientras que surgieron nuevos delitos como “techo de vehículos motorizados”. Los investigadores deben armonizar categorías a través de décadas y a veces a través de las fronteras nacionales.
  • La policía y los tribunales han dirigido históricamente a ciertos grupos étnicos, clases socioeconómicas o disidentes políticos. Por lo tanto, las tasas de delincuencia histórica pueden reflejar patrones de ejecución más que el comportamiento delictivo real. Por ejemplo, los delitos de orden público en el siglo XIX en Londres afectaron de manera desproporcionada a los inmigrantes irlandeses y a los pobres.
  • Los juegos en cobertura] – Guerras, reorganizaciones administrativas o destrucción récord dejan agujeros temporales. La interpolación de las series temporales, la imputación múltiple o el lijado de Bayesian pueden abordar esto, pero los investigadores deben documentar las suposiciones detrás de cada técnica.
  • Error de medición en variables clave – Las edades podrían ser mal recordadas, direcciones incorrectas y nombres mal escritos. La conexión de registro probabilístico puede combinar registros entre fuentes con tasas de error cuantificables.

Principales métodos estadísticos para el análisis histórico del delito

Estadísticas descriptivas: Summarizando el pasado

Las estadísticas descriptivas forman la base de cualquier análisis histórico cuantitativo. Calcular medios, medianas, desviaciones estándar y percentiles de los cargos de crimen por año, por región o por tipo de delito proporciona una visión rápida y ayuda a identificar problemas de calidad de datos.Por ejemplo, un investigador que examina el robo en Victorian London podría encontrar que el número medio de robos registrados por mes fue 120 en 1860, pero la distribución fue muy escalorada por temporada

Las proporciones son también informativas: ¿qué parte de los delitos denunciados fueron violentos contra la propiedad? En Inglaterra del siglo XIX, los delitos de propiedad dominados (alrededor del 80% de los delitos indicables), mientras que los delitos violentos fueron una pequeña fracción, pero esa proporción cambió de urbanización y cambia las definiciones legales de asalto. Las estadísticas descriptivas pueden presentarse con intervalos de confianza para contabilizar errores de muestreo cuando los datos se extraen de archivos parciales, y los tamaños tales como las regiones de contextos.

Los enfoques modernos incluyen el uso de estimaciones de densidad del núcleo para paliar las tendencias temporales sin imponer hipótesis paramétricas, y crear paneles con visualizaciones interactivas (por ejemplo, utilizando R’s o Python’s ) que permiten a los historiadores explorar dinámicamente los patrones.

Análisis de la serie de tiempo: detección de tendencias y estacionalidad

Los datos históricos sobre el crimen se recogen casi siempre con el tiempo, haciendo que el análisis de series temporales sea esencial. Técnicas como promedios móviles, descomposición estacional utilizando STL (descomposición de secuencias-Trend usando LOESS), y modelos de movimiento integrados de autoregresivo (ARIMA) ayudan a separar la tendencia del ruido e identificar los puntos de inflexión.

Los investigadores también deben ajustarse para los cambios en las prácticas de grabación. Si un nuevo comisionado de policía en 1840 encargó un informe más estricto de los robos menores, la aparente “ola ola de crimen” puede ser un artefacto de la política en lugar de un aumento real. Análisis de la intervención (una forma de series temporales interrumpidas) puede probar si cambios de políticas alteran significativamente las tasas registradas, utilizando técnicas como las pruebas de Chow o series de tiempo estructural Bayes.

Análisis de regresión: Explorando Correlatos

La regresión múltiple permite a los historiadores examinar las relaciones entre las tasas de delincuencia y las variables económicas, demográficas o sociales mientras controlan a los confundadores. Por ejemplo, un estudio de las ciudades estadounidenses en los años 20 podría modelar las tasas de homicidio como función del desempleo, el consumo de alcohol (pos-ejecución de la prohibición), la densidad de población y la proporción de hombres jóvenes.

Los coeficientes de elasticidad pueden indicar que un aumento del 10% en el desempleo se asoció con un aumento del 5% en el robo, manteniendo constantes otros factores. Sin embargo, la correlación no implica causalidad; variables omitidas (como la intensidad de la policía o la voluntad pública de informar) pueden tener resultados parciales.

Geospatial Analysis: Mapping Crime Hotspots

El análisis geoespacial ha revolucionado la criminología histórica revelando las dimensiones espaciales del crimen. Mediante la geocodificación de direcciones de viejos registros judiciales, bloques de policía o informes periódicos, los académicos pueden crear mapas de puntos y superficies de densidad del núcleo. Herramientas como QGIS o R y cúmulos] permiten la exploración de patrones espaciales en escalas que van desde calles individuales hasta ciudades enteras un ejemplo.

Los análisis estadísticos de Moran I para la autocorrelación espacial global—ya sean áreas de alto nivel están rodeadas de otras áreas de alto nivel. Los indicadores locales de asociación espacial (LISA) pueden identificar grupos específicos. La regresión geográfica (GWR) modela cómo la relación entre el crimen y las condiciones socioeconómicas varía en todo el espacio, revelando que el efecto de la pobreza puede diferir entre los distritos comerciales y residenciales.

Métodos avanzados: Aprendizaje de Máquinas e Inferencia Causal

Más allá de la regresión tradicional, las técnicas de aprendizaje automático se aplican cada vez más a los datos históricos del crimen. Los bosques aleatorios y los modelos de impulso gradiente pueden captar relaciones e interacciones no lineales sin fuertes suposiciones paramétricas, útiles para predecir los valores de falta de delincuencia o imputing coordenadas geográficas desconocidas. Sin embargo, la interpretabilidad sigue siendo un desafío; métodos como los valores SHAP (ExPlanaciones de Aditivos Aditivos SHAP) pueden ayudar a explicar qué características impulsar las predicciones.

Para las preguntas causales (por ejemplo, ¿la introducción de una fuerza de policía profesional reduje la delincuencia?), los diseños de diferencias en diferencias comparan los cambios en las tasas de delincuencia entre jurisdicciones que adoptaron reformas y las que no, antes y después del cambio de política. Los métodos de control sintéticos construyen una contrafactual de una combinación ponderada de unidades de control, útiles cuando sólo una o pocas entidades experimentaron una intervención.

Flujo de trabajo práctico: Del archivo al análisis

Un flujo de trabajo sistemático garantiza la reproducibilidad y minimiza los errores en todo el proceso de investigación. Los siguientes pasos describen un enfoque típico, con atención a la documentación y transparencia:

  1. ]Colección y transcripción de datos – Fotografía o escanear documentos originales en alta resolución. Use reconocimiento de caracteres ópticos (OCR) con corrección manual para registros manuscritos; herramientas como Tesseract o Transkribus (especialización en escritura histórica) pueden acelerar el proceso pero aún requieren verificación humana. Para datos tabulares de fuentes impresas, se recomienda la entrada de dobles datos con cheques de fiabilidad entre emisores.
  2. Limpieza y armonización de datos – Normalizar las fechas en un calendario consistente (por ejemplo, ISO 8601), ubicaciones de geocódigos usando miradores históricos, y crear un sistema de clasificación de crimen unificado. Usar taxonomías existentes como las clasificaciones de crímenes ICPSR como una base y mapa de categorías históricas sobre ellos.
  3. Análisis de datos descriptivos (EDA)] – Genera estadísticas de resumen, diagramas de tiempo y matrices de correlación. Identifica los outliers y anomalías potenciales de grabación (por ejemplo, los picos coinciden con eventos conocidos).Usa visualización para comprobar las interrupciones estructurales o cambios de la varianza con el tiempo.
  4. Selección de metodos y pre-registración] – Basado en preguntas de investigación (por ejemplo, detección de tendencias, inferencia causal, agrupación), elige modelos apropiados. Pre-registre el plan de análisis sobre plataformas como el Marco de Ciencia Abierto para evitar el atraque y aumentar la credibilidad, incluso para la investigación histórica.
  5. Modalidad y validación] – Modelos de ajuste, comprobación de residuos para la normalidad, la homoscedasticidad y la autocorrelación. Para enfoques Bayesianos, inspeccionar distribuciones predictivas posteriores y utilizar WAIC o validación cruzada para la comparación de modelos. Para el aprendizaje automático, utilice la validación cruzada de doble k y pruebas fuera de muestreo.
  6. Interpretación en contexto histórico] – La producción estadística debe interpretarse junto con pruebas cualitativas: letras, memorias, editoriales de periódicos y cambios legales, que protegen contra conclusiones anacrónicas y ayudan a distinguir patrones estadísticos de procesos históricos reales.

Estudio de caso: Analizar robo en Londres de 19o-Century

Para ilustrar la integración de múltiples métodos, considere un estudio hipotético pero representativo del robo en Londres de 1830 a 1870. El investigador reúne datos de Old Bailey Online] y los documentos parlamentarios del Reino Unido, digitalizando 20.000 acusaciones de robo. Los datos incluyen fecha, ubicación (street y parroquia), valor de los bienes robados, tipo de víctima (individual, registro de la densidad de negocio, registro de la información

Descriptivo Findings

Las estadísticas descriptivas muestran que los robos alcanzaron su máximo en los años 1840, con una media de 120 por mes y una desviación estándar de 35. El valor medio robado fue de 2 libras (aproximadamente 200 libras en 2025 poder adquisitivo), pero la distribución fue despreocupada porque algunos robos implicaban joyas valiosas o efectivo. La mayoría de los delincuentes eran hombres jóvenes (85% de los casos), y las tasas de condena se des superaron alrededor del 60%.

Análisis de la serie de tiempo

Un modelo ARIMA(1,1,0) con un componente estacional (lag 12) revela una disminución anual del 3% en los robos registrados después de 1856, coincidiendo con la introducción de la rama de detectives de la Policía Metropolitana. Un análisis de intervención mediante una regresión segmentada confirma una caída estadísticamente significativa (p < 0.01) después de 1856, incluso después de controlar el crecimiento de la población y cambios en el número de oficiales de policía.

Análisis de regresión

Un efecto binomio negativo predice el recuento de robo por distrito (parish) como función de densidad de población, ingreso medio (estimado de los registros fiscales), número de estaciones de policía, distancia al mercado más cercano, y un rebote para la presencia de una estación de ferrocarril. Los resultados muestran que la densidad de población duplicada está asociada con un aumento del 40% del hurto ( ratio de incidencia = 1,40, IC del 95%: 1,25–1,58)

Geospatial Analysis

El cambio de ubicación del robo (geocoded to street intersections) revela un punto de inflexión claro en el East End (en torno a Whitechapel Road) y a lo largo del río Támesis, particularmente cerca de muelles y muelles donde se transfirieron mercancías. Una regresión espacial mediante regresión geográfica indica que la relación negativa entre el ingreso y el robo es más fuerte en el West End (encocesas), donde las zonas de alta experiencia

Integración cualitativa

Los patrones estadísticos se alinean con las descripciones contemporáneas. Los editoriales Times en los años 1850 se quejaron de “ ladrones profesionales” que operan en las listas de St. Giles y los Siete Dials. Los registros judiciales muestran que el 30% de los delincuentes tenían arrestos previos, muchos de los mismos barrios. Los diarios de los comisionados de policía notan que los ladrones de la desigualdad se centraban en los objetos robados

Desafíos y mitigación

Más allá de los problemas de datos ya señalados, los investigadores deben enfrentarse a varios desafíos metodológicos que pueden socavar las conclusiones estadísticas:

  • falacia ecológica] – Las tasas de delincuencia aglomeradas no pueden reflejar el comportamiento de la ofensa individual. Usar datos de nivel individual dentro de modelos multinivel (por ejemplo, modelos lineales jerárquicos con efectos aleatorios para los distritos) ayuda a puentear los niveles micro y macro.
  • ] Error de medición en variables clave] – Los nombres, edades y direcciones pueden ser registrados de forma inexacta. La conexión de registro probabilístico (por ejemplo, utilizando el paquete en R) fusiona registros de diferentes fuentes con tasas de error cuantificables, y análisis de sensibilidad simulan diferentes niveles de error para evaluar la robustez.
  • Selección] – Sólo los crímenes que llegaron a los tribunales aparecen en registros; muchos no lo hicieron. El peso de la correccional de Heckman o de la propensión puede ajustarse para la selección, pero sólo si se observan correlaciones de reportaje. Por ejemplo, un estudio de agresión sexual en el siglo XIX debe explicar el hecho de que la presentación de informes dependía del estado social y el género de la víctima.
  • Inestablecimiento temporal] – Las relaciones entre variables (por ejemplo, desempleo y robo) pueden cambiar durante décadas debido a la evolución de las normas sociales o estructuras económicas. La regresión de rodillos o modelos de espacio-estado (por ejemplo, modelos lineales dinámicos) captan parámetros de tiempo-varía, proporcionando estimaciones de cómo evolucionan los coeficientes.
  • Sesgo de publicación y replicabilidad – Los estudios históricos son raramente replicados debido a la singularidad de los conjuntos de datos. Los investigadores siempre deben publicar código de replicación y datos anónimos (donde la privacidad permite) para permitir a otros verificar los resultados. La Red histórica de datos sobre delitos ofrece directrices para la documentación, el intercambio de datos y la consideración ética.

Integrando el contexto cualitativo

Los métodos estadísticos no pueden explicar por qué el crimen disminuyó en Londres victoriano o por qué algunos grupos estaban sobrerepresentados. La lectura de fuentes primarias —diarios de comisionados policiales, debates parlamentarios, informes de crímenes de periódicos— da lugar a narraciones causales y contextualiza patrones estadísticos. Por ejemplo, la disminución del robo después de 1856 podría ser en parte debido a una mejor iluminación de la calle (una medida de prevención física, documentada por registros municipales de instalación de la lámpara de gas) o a delitos menores de delitos de inflexión

Los estudios de la cultura de los pasados son cada vez más comunes. Los académicos pueden utilizar estadísticas para identificar anomalías (por ejemplo, un aumento de las detenciones para “reunión” en 1839) y luego recurrir a archivos cualitativos (a minutos del consejo municipal, editoriales de periódicos) para investigar esos casos. El pico podría ser rastreado a una nueva ordenanza de vagancia en lugar de un aumento real de comportamiento sospechoso.

Futuros orientaciones y consideraciones éticas

En espera de que los proyectos de historia digital sigan ampliando los conjuntos de datos disponibles. La extracción de textos de las transcripciones de los tribunales mediante el procesamiento de idiomas naturales (NLP) puede extraer relaciones entre víctimas y delincuentes, tipos de armas y modus operandi de campos narrativos. La modelización de la cobertura de los periódicos revela cambios de las preocupaciones públicas con el tiempo. El análisis de redes de asociaciones de delincuentes (utilizando datos de arresto) puede mapear redes de delincuencia organizadas reproduciendo y su evolución.

También surgen consideraciones éticas cuando trabajan con registros históricos de crímenes. Mientras que los individuos están muertos por mucho tiempo, sus descendientes pueden experimentar estigmas por la participación familiar en el delito. Los investigadores deben anonimato datos al publicar y considerar el daño potencial de vincular las detenciones históricas a las comunidades modernas. Además, la dependencia excesiva de los registros policiales puede perpetuar prejuicios históricos, retratando a ciertos grupos como inherentemente criminales al ignorar las desigualdades estructurales.

Conclusión

Aplicar métodos estadísticos a datos históricos de crimen transforma registros dispersos e imperfectos en evidencias rigurosas sobre sociedades pasadas. Estadísticas descriptivas, series temporales, regresión y análisis geoespaciales cada una ofrece un objetivo distinto, y cuando se combina con cuidadoso manejo de datos perdidos, técnicas de inferencia causal y contexto cualitativo, revelan patrones que dan forma a nuestra comprensión del cambio social.

El pasado conserva su complejidad, pero el análisis estadístico nos ayuda a contar, mapear e interpretar sus dimensiones recurrentes. A medida que crecen los archivos digitales y avanzan las herramientas computacionales, los historiadores tienen una oportunidad sin precedentes de hacer preguntas más grandes sobre la relación entre el crimen, la sociedad y la gobernanza a lo largo del tiempo. Manteniendo una posición crítica hacia las fuentes de datos y un diálogo con evidencia cualitativa, los investigadores pueden producir cuentas creíbles y matizadas que resisten a la desigualdad de los historiadores.