Клиометрические исследования - применение количественных методов к экономической истории - произвели революцию в нашем понимании долгосрочного экономического развития, институциональных изменений и корней современного процветания. Сшивая воедино многовековые ценовые ряды, записи переписей, торговые книги и налоговые списки, климатометристы проверяют гипотезы, которые качественные историки могут только обсуждать. Тем не менее, под элегантными регрессиями и контрфактическими симуляциями лежит постоянная и часто недооцененная проблема: двойные проблемы нехватки данных и качества данных . Без надежных исторических данных даже самые сложные эконометрические модели производят вводящие в заблуждение выводы. В этой статье рассматриваются источники, последствия и стратегии смягчения этих проблем данных, опираясь на идеи десятилетий климатической практики и последних достижений в вычислительных методах.

Природа дефицита данных в исторических экономических исследованиях

Дефицит данных в климате — это не просто вопрос небольших размеров выборки. Он отражает фундаментальную неполноту исторических записей: правительства не всегда собирали необходимую нам сейчас статистику; войны, пожары и бюрократический упадок уничтожали архивы; и конвенции о регистрации были неравномерными по регионам и эпохам. Для ранней современной Европы, например, систематические счета национального дохода не существовали до XIX века. Исследователи должны собирать доверенные данные из десятинных записей, торговой статистики и городских налоговых регистров. В доколониальной Африке или доконтактной Америке письменные записи часто вообще отсутствуют, вынуждая полагаться на археологические доверенные лица, колониальные переписи или устные традиции, каждая со своими ограничениями.

Источники дефицита

  • Физические потери:] Александрийская библиотека — лишь самый известный пример. Тысячи приходских регистров, торговых книг и государственных бумаг погибли в результате пожара, наводнения, пренебрежения или преднамеренного разрушения (например, бомбардировка Неаполя в 1943 году уничтожила средневековые торговые данные).
  • Избирательное выживание: Записи, которые выживают, часто благоприятствуют грамотным, богатым, городским и мужским. Сельские крестьяне, женщины и коренное население появляются только периодически — если вообще появляются — создавая систематические пробелы, которые могут смещать экономический анализ благосостояния или неравенства.
  • Изменения в административных границах: муниципалитет, который слился, раскололся или изменил название на протяжении веков, делает продольные панели почти невозможными без кропотливой гео-референции и гармонизации.
  • Низкая частота измерений: Большинство досовременных статистических данных собирались с нерегулярными интервалами — иногда каждые десять лет, иногда раз в столетие.

Эти недостатки вынуждают климатологов принять то, что можно назвать «прагматической эпистемологией»: работать с лучшими доступными доказательствами, открыто признавая их пробелы. Полученные наборы данных часто являются несбалансированными панелями или перекрестными сечениями со многими отсутствующими клетками , что усложняет использование стандартных эконометрических методов.

Последствия дефицита для экономических моделей

Когда переменные отсутствуют, исследователи могут прибегнуть к прокси-вариантам , которые лишь слабо захватывают концепцию интереса. Например, использование числа железнодорожных станций в качестве прокси для интеграции рынка игнорирует автомобильный и речной транспорт. Альтернативно, они могут отбросить наблюдения с недостающими данными, уменьшающимися размерами выборки и потенциально вводящими предвзятость выбора. Если пропущенность коррелирует с ненаблюдаемыми характеристиками (например, более бедные регионы держат худшие записи), полученные оценки непоследовательны. Анализы временных рядов становятся особенно хрупкими: одна недостающая точка данных в авторегрессивной модели может нарушить динамическую структуру.

Возможно, более коварной является тенденция полагаться на сильные предположения о процессах генерации данных. Исследователи часто предполагают, что недостающие данные «пропадают наугад» условно на наблюдаемых, утверждение редко оправдано в исторических условиях. Результатом является то, что многие климатометрические результаты приходят с широкими доверительными интервалами и высокой чувствительностью к спецификации - факт, что нетехнические историки иногда ошибочно принимают за методологическую слабость, а не честную неопределенность.

Качество измерения: ошибки, предвзятость и непоследовательность

Даже когда исторические данные выживают, их качество далеко не гарантировано. Качество данных включает в себя точность, последовательность, полноту и свободу от систематического уклона. Исторические источники создавались для административных, фискальных или юридических целей, а не для современного научного анализа. В результате они несут отпечатки мотивов и ограничений своих создателей.

Общие формы плохого качества данных

  • Ошибки транскрипции:] Рукописные книги склонны к неправильному прочтению; одно исследование показало, что клерки на британских заводах XIX века неправильно подсчитали производство на 5-10%. При оцифровке с помощью оптического распознавания символов (OCR) исторические шрифты вводят дальнейшие ошибки — например, «1642» становится «164Z».
  • Изменение определений: Категория «городской» могла бы сместиться с 2000 жителей в 1800 году до 10 000 в 1900 году. «Пшеничные цены» могли бы исключить транспортные расходы в одном архиве, но включить их в другой. Такие несоответствия могут генерировать фантомные структурные разрывы.
  • Кружение и нагромождение:] Нагромождение возраста — тенденция сообщать о возрастах, заканчивающихся на 0 или 5 — печально известна в данных переписи XIX века, предвзятых демографических оценках.Цены часто округлялись до ближайшего шиллинга или песеты, подавляя дисперсию.
  • Предвзятость выбора: Суды фиксировали преступления, но не незарегистрированные правонарушения. Налоговые оценки опускали беднейшие домохозяйства. Газеты освещали драматические события, а не повседневную торговлю. Использование таких источников без коррекции дает искаженную картину экономической деятельности.
  • Измерительные единицы: «бушель» варьировался по товару и региону; «фунты стерлингов» менялись в содержании серебра на протяжении веков. Без тщательной метрологической конверсии ценовые ряды становятся несравнимыми.

Совокупный эффект этих проблем качества заключается в погрешности измерения , которая смещает коэффициенты регрессии к нулю (классические ошибки в переменных) или в непредсказуемых направлениях (неклассическая ошибка). Например, оценки дохода на душу населения, основанные на в основном данных о заработной плате в городах, преувеличивают национальный доход, если сельский сектор недопредставлен. Неизмеренные темпы роста могут привести к ложным «ловушкам бедности» или «взятиям».

Предвзятость в историческом хранении записей

Особенно неприятной проблемой качества является системная предвзятость, вносимая политическим, социальным или экономическим контекстом создания записей. Например, колониальные администраторы часто сообщали о завышенных налоговых поступлениях, чтобы угодить своим начальникам. Регистрация земли во многих обществах исключала женщин или общинную собственность, что делало невозможным реконструкцию истинного распределения активов. Инспекторы фабрик XIX века сосредоточились на крупных мельницах, игнорируя небольшие мастерские. Эти предубеждения не случайны; они коррелируют с теми самыми экономическими явлениями, которые хотят изучать климатометристы, такими как неравенство, государственный потенциал и индустриализация.

Неспособность объяснить такую предвзятость может привести к опубликованным эмпирическим выводам, которые противоречат более поздним архивным открытиям. Классическим примером является дискуссия о «Великой дивергенции»: ранние климатометрические оценки ВВП Китая до 1800 года были основаны на данных о ценах европейского стандарта, но более поздняя работа с использованием налоговых списков династии Мин выявила гораздо более высокие уровни сельскохозяйственной производительности, бросая вызов повествованию о застойной азиатской экономике. Качество данных в этом смысле является не только технической проблемой, но и историографической.

Стратегии для смягчения проблем дефицита и качества

Клиометрики разработали богатый инструментарий для решения этих задач. Выбор стратегии зависит от характера промаха или ошибки и исследовательского вопроса. Ниже мы рассмотрим наиболее важные подходы, переходя от простых к изощренным.

Вычисление данных и множественные вычисления

Когда точки данных отсутствуют, но закономерность является вероятно случайным условием для наблюдаемых, вычисления могут заполнить пробелы. Однократное вычисление (например, замена отсутствующих значений средним или последним наблюдением) просто, но искусственно уменьшает дисперсию. Современная климатометрия все чаще использует множественные вычисления (MI) , что создает несколько правдоподобных завершенных наборов данных, выполняет анализы по каждому и объединяет оценки с правилами Рубина. MI хорошо подходит для исторических панелей, где пропущенность монотонна (например, ВВП страны не зарегистрирован до 1820 года). Однако MI предполагает, что переменные, предсказывающие пропущенность, включены в модель вычисления - сильное требование, когда ненаблюдаемые исторические потрясения вызывают потерю данных.

Перекрестная проверка и триангуляция

Перед любой статистической коррекцией исследователи должны перекрестно проверять данные по независимым источникам. Например, ценовой ряд из торгового реестра можно проверить по муниципальным регистрам рынка, газетным отчетам и даже судовым манифестам. Триангуляция выявляет ошибки транскрипции, выявляет локальные предубеждения, а иногда и раскрывает совершенно новые точки данных. Клиометрическое общество поддерживает базы данных, которые поощряют такую многоисточниковую валидацию, но процесс остается трудоемким и специфичным для домена.

Надежные статистические модели

Некоторые эконометрические методы по своей сути устойчивы к несовершенствам данных. Инструментальные переменные (IV) могут исправлять ошибку измерения в ключевом регрессоре при условии существования действительного инструмента. Фиксированные эффекты поглощают ненаблюдаемые во времени инвариантные (например, постоянные предубеждения сбора данных в данной деревне. Стандартные ошибки Bootstrap и Байесовская оценка по методу байесовской структуры позволяют исследователям включать неопределенность в отношении пропущенности в доверительные интервалы. Например, байесовские модели структурных временных рядов могут обрабатывать нерегулярно расставленные исторические наблюдения, определяя предыдущие распределения в течение отсутствующих периодов.

Достижения в области машинного обучения и цифровизации

В последние годы наблюдается всплеск вычислительных подходов к историческим данным. Оптическое распознавание символов (OCR) стало более точным для исторических шрифтов, и распознавание рукописного текста (HTR) теперь может транскрибировать рукописи с частотой ошибок ниже 10%, что позволяет массовую оцифровку отчетов о переписи и приходских регистров. Обработка естественного языка (NLP) извлекает структурированные данные из неструктурированных исторических текстов (например, FLT:8]] Алгоритмы связи записей — на основе машинного обучения — могут сопоставлять людей по переписям, создавая продольные панели из повторяющихся поперечных сечений. Эти инструменты уменьшают как дефицит (разблокируя ранее недоступные архивы), так и качество (путем стандартизации гетерогенных источников). Заметным проектом является

Анализ чувствительности и репликация

Учитывая хрупкость исторических данных, анализ чувствительности должен быть обязательным. Исследователи могут проверить, как изменяются результаты, когда недостающие значения вменяются в различные алгоритмы, когда выбросы обрезаются, или когда выборка ограничена высококачественными подмножествами. Отчетность о нескольких спецификациях — подход «многомодельный» — позволяет читателям оценить надежность выводов. движение репликации в климате также улучшило качество: многие журналы теперь требуют данных и отложений кода, что позволяет другим исследователям обнаруживать ошибки или тестировать альтернативные предположения. Ассоциация экономической истории поддерживает хранилище, которое облегчает такую прозрачность.

Тема: Реконструкция роста ВВП в ранней современной Англии

Чтобы увидеть эти проблемы и стратегии в действии, рассмотрим реконструкцию английского ВВП с 1600 по 1800 гг. Ранние климатометрические работы У. А. Коула и Филлис Дин опирались на разрозненные таможенные записи, оценки сельскохозяйственного производства и данные о заработной плате, но столкнулись с серьезным дефицитом: до 1855 года не существовало систематических национальных счетов. Более поздние исследователи, такие как Стивен Бродберри и его коллеги (2015), занимались качеством данных:

  • Оцифровка тысяч приходских записей для сельскохозяйственной продукции (с использованием HTR для почерка).
  • Перекрестная проверка данных о промышленном производстве из бизнес-записей квакеров (высококачественные) с акцизными декларациями (систематические, но, возможно, уклоняющиеся).
  • Использование нескольких вычислений для заполнения пробелов в годах, когда записи лондонского порта были уничтожены в Великом пожаре 1666 года.
  • Применение байесовских динамических моделей для сглаживания неустойчивых ценовых рядов.

Полученный набор данных показывает, что рост ВВП на душу населения в Англии был устойчивым, но скромным (~0,3% в год) в течение семнадцатого века, а не стагнация, как предполагалось ранее. Без тщательного управления дефицитом и качеством более раннее повествование о «застойности» сохранилось бы - свидетельство важности этих методологических поправок.

Будущие направления

Заглядывая вперед, три разработки обещают облегчить дефицит данных и бремя качества в климате. Во-первых, крупномасштабные инициативы по оцифровке — такие как Транскрибус Платформа для исторических рукописей — делают редкие источники машиночитаемыми в беспрецедентном масштабе. Во-вторых, вероятностная связь записей и разрешение сущности алгоритмы позволят исследователям объединять наборы данных в разных регионах и веках, создавая более богатые панели. В-третьих, методы причинного вывода адаптируются к настройкам с отсутствующими данными предварительной обработки, предлагая более надежные тесты исторических гипотез.

Однако одна только технология не может заменить знания в области . Понимание того, почему был создан конкретный архив, кто его финансировал, какое политическое давление существовало, какие группы были исключены, остается важным для оценки качества данных. Лучшие климатические исследования сочетают вычислительную мускулатуру с историческим глубоким чтением, рассматривая дефицит и качество данных не как неприятности, а как объекты исследования сами по себе.

Заключение

Дефицит данных и качество данных не являются периферийными неприятностями в климатометрических исследованиях; они являются центральными для обоснованности каждого утверждения об экономической истории. Дефицит заставляет исследователей работать с неполными, неслучайными выборками; проблемы качества вводят ошибки и предубеждения, которые могут опровергнуть выводы. Применяя строгие методы вычисления, перекрестные источники проверки, используя надежные статистические методы и используя новые инструменты оцифровки, климатометры могут смягчить эти проблемы - но никогда не устранять их. Будущее области заключается в прозрачной отчетности, репликации и готовности количественно оценить неопределенность, которую налагает историческое расстояние. Только столкнувшись с этими проблемами напрямую, климатометрия может выполнить свое обещание обеспечить количественную основу для нашего понимания прошлого.