La investigación liométrica – la aplicación de métodos cuantitativos a la historia económica – ha revolucionado nuestro entendimiento del desarrollo económico de larga duración, el cambio institucional y las raíces de la prosperidad moderna. Al coser juntos siglos de series de precios, registros censales, libros de comercio y rollos de impuestos, los citométricos prueban hipótesis que los historiadores cualitativos pueden debatir solamente.

La naturaleza de la escasez de datos en la investigación económica histórica

La escasez de datos en cílidos no es meramente una cuestión de tamaños de muestras pequeños. Refleja la incomplesión fundamental de registros históricos: los gobiernos no siempre recopilan las estadísticas que necesitamos; guerras, incendios y decadencia burocrática destruidos archivos; y registro de convenciones eran desiguales en regiones y épocas. Para la Europa moderna temprana, por ejemplo, las cuentas de renta nacional sistemáticas no existen antes del siglo XIX.

Fuentes de escasez

  • PHISTERIA: La Biblioteca de Alejandría es sólo el ejemplo más famoso. Miles de registros parroquiales, libros mercantiles y periódicos estatales han perecido a través del fuego, la inundación, el abandono o la destrucción deliberada (por ejemplo, el bombardeo de Nápoles de 1943 destruyó siglos de datos del comercio medieval).
  • Sobrevivencia selectiva: Los registros que sobreviven a menudo favorecen al al alfabeto, a los ricos, a los urbanos y a los hombres. Los campesinos, las mujeres y las poblaciones indígenas rurales sólo aparecen intermitentemente – si en absoluto – creando brechas sistemáticas que pueden sesgar análisis económicos del bienestar o la desigualdad.
  • Cambios en los límites administrativos: Un municipio que fusionó, dividió o cambió de nombre a través de siglos hace que los paneles longitudinales sean casi imposibles sin una georreferencia y armonización atroces.
  • Frecuencia mínima de medición: La mayoría de las estadísticas premodernas se recogieron a intervalos irregulares, a veces cada década, a veces una vez al siglo. Los datos transversales pueden faltar para generaciones enteras.

Estas cicatrices obligan a los cíoloméros a adoptar lo que se podría llamar una " epistemología práctica": trabajar con las mejores pruebas disponibles mientras reconoce abiertamente sus lagunas. Los conjuntos de datos resultantes son a menudo paneles no equilibrados] o secciones transversales con muchas células faltantes

Consecuencias de la escasez de modelos económicos

Cuando las variables no se encuentran, los investigadores pueden recurrir a variables indirectas ] que sólo captan débilmente el concepto de interés. Por ejemplo, el uso del número de estaciones de ferrocarril como un proxy para la integración del mercado ignora el transporte por carretera y por río. Alternativamente, pueden dejar de lado las observaciones con datos perdidos, reduciendo el tamaño de la muestra y introduciendo potencialmente sesgos de selección.

Quizás más insidiosa es la tendencia a confiar en supuestos fuertes] sobre procesos generadores de datos. Los investigadores a menudo suponen que los datos perdidos están "perdiendo al azar" condicionalmente en los observables, una reclamación raramente defensible en los contextos históricos. La subida es que muchos hallazgos liométricos vienen con amplios intervalos de confianza y una alta sensibilidad a la especificación – un error metodológico que no técnico- un error que no técnico-.

La dimensión de calidad: Error, Bias e Inconsistencia

Incluso cuando los datos históricos sobreviven, su calidad está lejos de garantizarse. La calidad de los datos abarca la exactitud, la consistencia, la integridad y la libertad de parcialidad sistemática. Fuentes históricas fueron creadas para fines administrativos, fiscales o legales, no para el análisis científico moderno.

Formas comunes de calidad de los datos pobres

  • ] Errores de inscripción:] Los libros manuscritos son propensos a malinterpretar; un estudio encontró que los clerks en fábricas británicas del siglo XIX malcurecieron la producción en un 5–10%. Cuando se digitaliza mediante reconocimiento óptico de caracteres (OCR), las fuentes históricas introducen nuevos errores – por ejemplo, “1642” se convierte en “164Z”.
  • Definiciones de cambio: La categoría “urbana” podría haber pasado de 2.000 habitantes en 1800 a 10.000 en 1900. “Precios de calor” podrían excluir los costos de transporte en un archivo pero incluirlos en otro. Tales inconsistencias pueden generar rupturas estructurales fantasma.
  • Rounding and heaping: El acaparamiento de la edad – la tendencia a reportar edades que terminan en 0 o 5 – es notoria en los datos censales del siglo XIX, sesgadas estimaciones demográficas. Los precios se redondearon a menudo a la estribación más cercana o a la peseta, suprimiendo la varia.
  • Selección: Los tribunales registraron delitos, pero no delitos no denunciados. Las evaluaciones fiscales omitieron a los hogares más pobres. Los periódicos cubrieron acontecimientos dramáticos, no el comercio cotidiano. Usando tales fuentes sin corrección produce una imagen distorsionada de la actividad económica.
  • Unidades de medición: Un “bushel” variado por mercancía y región; “sonidos esterlinas” cambió en contenido de plata durante siglos. Sin una conversión metrológica cuidadosa, la serie de precios se vuelve incomparable.

El efecto acumulativo de estas cuestiones de calidad es error de medición], que sesgos coe los coeficientes de regresión hacia cero (errores clásicos-in-variables) o en direcciones impredecibles (error no clásico). Por ejemplo, las estimaciones de ingresos per cápita basadas en datos de sueldos en gran parte urbanos sobresalen los ingresos nacionales si el sector rural está subrepresentado.

Bias en Grabación Histórica

Un tema de calidad particularmente vexante es sesgo sistemático] introducido por el contexto político, social o económico de la creación de registros. Los administradores coloniales, por ejemplo, a menudo reportan ingresos fiscales inflados para complacer a sus superiores. Registro de tierras en muchas sociedades excluidas mujeres o propiedad comunitaria, lo que hace imposible reconstruir la verdadera distribución de activos corintimos del siglo XIX.

El no tener en cuenta este prejuicio puede llevar a conclusiones empíricas publicadas que contradicen los descubrimientos posteriores de archivos. El ejemplo clásico es el debate de la “Gran Divergencia”: las estimaciones cliométricas tempranas del PIB chino pre-1800 se basaron en datos de precios europeos estándar, pero luego trabajar con rollos de impuestos de la dinastía Ming revelaron niveles narrativos mucho más exigentes de productividad agrícola.

Estrategias para mitigar problemas de escasez y calidad

Los liométricos han desarrollado un rico conjunto de herramientas para abordar estos desafíos. La elección de la estrategia depende de la naturaleza de la falta o error y de la pregunta de investigación. A continuación, se estudian los enfoques más importantes, pasando de simple a sofisticado.

Imputación de datos e imputación múltiple

Cuando faltan puntos de datos, pero el patrón es plausible aleatorio condicional en los observables, la imagen puede llenar las brechas. La imputación única (por ejemplo, la sustitución de los valores perdidos por la media o última observación) es simple pero reduce artificialmente la variabilidad.

Cross-Verification and Triangulation

Antes de cualquier corrección estadística, los investigadores deben datos cruzados contra fuentes independientes. Por ejemplo, una serie de precios de un libro mayor puede ser verificada contra registros de mercado municipales, informes de periódicos e incluso manifiestos de buques. La triangulación revela errores de transcripción, expone los prejuicios locales, y a veces descubre los datos completamente nuevos.

Modelos estadísticos robustos

Algunas técnicas econométricas son inherentemente robustas a las imperfecciones de datos. Las variables instrumentales (IV) pueden corregir el error de medición en un regresión clave, siempre que exista un instrumento válido. Efectos fijos absorber los invariables de tiempo (por ejemplo, los persistentes bisedios de recopilación de datos en un LLT)

Avances de aprendizaje y de la digitización de la máquina

Los datos de la serie HLT [LT:0] se han incrementado en los datos históricos .El reconocimiento de caracteres ópticos (OCR) se ha vuelto más preciso para las fuentes históricas, y [[FLT: 4] el reconocimiento de la escritura (HTR) puede ahora transcribir los manuscritos cursivos con tasas de error 10%

Análisis de sensibilidad y replicación

La fragilidad de los datos históricos, análisis de sensibilidad] debe ser obligatoria. Los investigadores pueden probar cómo los resultados cambian cuando los valores perdidos se imputizan con diferentes algoritmos, cuando los outliers se recortan, o cuando la muestra se limita a subconjuntos de alta calidad.

Estudio de caso: Reconstrucción del crecimiento del PIB en la Inglaterra moderna temprana

Para ver estos desafíos y estrategias en acción, considere la reconstrucción del PIB inglés de 1600 a 1800. Trabajo cíliométrico temprano de W. A. Cole y Phyllis Deane se basaron en registros aduaneros dispersos, estimaciones de productos agrícolas y datos salariales, pero se enfrentaron a una grave escasez: no existían cuentas nacionales sistemáticas antes de 1855. Investigadores más tarde como Stephen Broadberry y colegas (2015) abordaron la calidad de los datos:

  • Digitizing thousands of parroquia register entries for agricultural output (using HTR for handwriting).
  • Datos de producción industrial de la industria de la industria de la industria de Quaker (alta calidad) con rendimientos fiscales (sistemas pero posiblemente evadidos).
  • Usando múltiples acusaciones para llenar las brechas en años en los que los registros portuarios de Londres fueron destruidos en el Gran Fuego de 1666.
  • Aplicando modelos de factor dinámico Bayesian para suavizar series de precios erráticos.

El conjunto de datos resultante revela que el crecimiento del PIB per cápita inglés era estable pero modesto (~0,3% por año) en todo el siglo XVII, no el estancamiento que se había asumido anteriormente. Sin una cuidadosa gestión de la escasez y la calidad, la anterior narrativa de “estañado” habría persistido – un testimonio de la importancia de estas correcciones metodológicas.

Future Directions

Los controles de la solución más robusta, que se han desviado en los tiempos más avanzados, permiten la creación de datos más sólidos, que se han de utilizar en los siguientes ámbitos: ] [FLT]] [FLT4]]

Sin embargo, la tecnología no puede sustituir conocimiento de dominio]. Entendiendo por qué se creó un archivo particular, que lo financiaba, qué presiones políticas existían, qué grupos fueron excluidos, sigue siendo esencial para evaluar la calidad de los datos.La mejor investigación cílimétrica combina el músculo computacional con la lectura profunda histórica, tratando la escasez de datos y la calidad no como elementos de investigación en su propio derecho.

Conclusión

La escasez de datos y la calidad de los datos no son molestias periféricas en la investigación cílica; son centrales para la validez de cada reclamación sobre la historia económica. La escasez obliga a los investigadores a trabajar con muestras incompletas y no raras; problemas de calidad introducen errores y parciales que pueden revocar las conclusiones.