Преодоление истории и науки о данных

Изучение исторических движений населения традиционно опиралось на фрагментарные доказательства — переписные листы, судовые манифесты, налоговые записи и письма. Историки и археологи собирают эти осколки, чтобы восстановить приливы и отливы человеческих обществ. Однако огромный объем оцифрованных исторических записей и сложность человеческого поведения открыли двери для вычислительных подходов. Машинное обучение (ML) предлагает способ обнаружить закономерности в огромных наборах данных, которые будут подавлять одного исследователя. Обучая алгоритмы известных миграций и экологических данных, исследователи теперь могут предсказать, где и почему популяции перемещались в прошлом с точностью, которая ранее была недостижимой. Это слияние истории и искусственного интеллекта является не просто академическим упражнением; оно имеет последствия для понимания современных движений беженцев, планирования устойчивых городов и даже прогнозирования климатических перемещений.

За последнее десятилетие значительно ускорилась оцифровка исторических архивов. Миллионы страниц переписных листов, приходских регистров и налоговых чеков теперь машиночитаемы. Однако одни только необработанные данные не являются знаниями. Модели мобильности человека глубоко нелинейны: голод может спровоцировать массовый исход в одном регионе, в то время как соседние районы остаются стабильными из-за сетей родства или торгового доступа. Традиционные статистические методы часто не в состоянии уловить эти сложности. Машинное обучение, с его способностью моделировать высокоразмерные взаимодействия и обнаруживать тонкие сигналы, заполняет этот пробел. Это позволяет историкам выходить за рамки описательных счетов к прогнозным и контрфактическим рассуждениям.

В этой статье рассматривается, как машинное обучение применяется для прогнозирования исторических движений населения, связанных с ними данных и методов, проблем, с которыми сталкиваются исследователи, и преобразующего потенциала как для исторической науки, так и для современной политики. Мы изучаем реальные тематические исследования, от неолитической экспансии в Европу до миграции в Американскую пыльную чашу, и предоставляем действенные идеи для исследователей, желающих принять эти методы.

Почему машинное обучение для исторической демографии?

Традиционная демографическая история часто опирается на повествовательный анализ и основные статистические корреляции. Машинное обучение расширяет эти возможности, обрабатывая нелинейные отношения и высокоразмерные взаимодействия. Например, решение о миграции может зависеть от комбинации урожайности сельскохозяйственных культур, политической нестабильности, налогового бремени и сетей родства. Модель линейной регрессии будет бороться за захват таких взаимодействий, но дерево с градиентным повышением или нейронная сеть могут изучать их из данных. Более того, модели ML могут быть прогнозными — они могут прогнозировать потоки населения на основе неполных или шумных входных данных, что именно та ситуация, с которой сталкиваются историки с древними записями.

Ранние последователи ML в истории показали, что эти модели могут превзойти традиционные методы. Исследование 2020 года, проведенное исследователями из Кембриджского университета, использовало случайные леса для прогнозирования местоположения неолитических поселений в Европе с точностью 80%, полагаясь исключительно на переменные окружающей среды. Другая команда в Институте Макса Планка применила глубокое обучение к данным кораблекрушения римской эпохи, чтобы вывести торговые пути и перераспределение населения по Средиземноморью. Эти успехи демонстрируют, что ML не уловка, а настоящий инструмент для генерации гипотез и тестирования.

Помимо предсказания, ML предлагает нечто, возможно, еще более ценное для историков: способность количественно оценивать неопределенность. Исторические аргументы часто вероятностны - «вероятно, что население двинулось на запад из-за истощения почвы» - но редко прикрепляют явные доверительные интервалы. Модели машинного обучения выдают вероятности и оценки уверенности, заставляя исследователей быть точными в том, что они знают и чего не делают. Этот вероятностный образ мышления является здоровым исправлением иногда чрезмерно уверенных повествований традиционной историографии.

Экономические и гуманитарные ставки также значительны. Понимание движущих сил исторической миграции может информировать современную политику в отношении климатических беженцев, городского планирования и реагирования на стихийные бедствия. Например, если модели показывают, что исторической миграции последовательно предшествовала комбинация засухи и нарушения торговых путей, то системы раннего предупреждения могут быть разработаны для обнаружения этих предшественников сегодня. Прошлое в этом смысле становится лабораторией для проверки причинных теорий, которые применимы к настоящему.

Эволюция исторической науки о данных

Ранние усилия в 1960-х и 1970-х годах были сосредоточены на количественной истории — с использованием перфокарт и мэйнфреймов для анализа данных переписи. Клиометрия, как ее называли, столкнулась с сопротивлением со стороны традиционных историков, которые рассматривали количественную оценку как редукционистскую. Рост географических информационных систем (ГИС) в 1990-х годах добавил пространственное измерение, позволив исследователям отображать изменения населения с течением времени. Но ГИС одна описательная; она показывает, куда люди перемещались, но не то, почему или при каких условиях они могут снова перемещаться.

Машинное обучение представляет собой следующий логический шаг. Где ГИС отвечает «где», ML отвечает «почему» и «что если». Доступность облачных вычислений, библиотек с открытым исходным кодом, таких как scikit-learn и TensorFlow, и стандартизированных форматов данных снизила барьер для входа. Историкам больше не нужно быть профессиональными программистами для применения этих методов; они могут сотрудничать с компьютерными учеными или использовать удобные для пользователя платформы. Результатом является растущее поле, которое сочетает в себе экспертизу историков в области вычислительной мощности современного ИИ.

Источники данных: Сырье прогнозирования

Любой проект машинного обучения хорош лишь в той мере, в какой хороши его данные. Для исторических движений населения исследователи должны составлять гетерогенные наборы данных из нескольких дисциплин. Наиболее распространенными источниками являются:

  • Демографические записи: Национальные переписи, приходские реестры, налоговые списки и списки воинской повинности. Они обеспечивают подсчет населения, распределение по возрасту и структуры домохозяйств в определенные моменты времени.
  • Миграционные журналы: Перечни пассажиров судов, записи о пересечении границы и внутренние паспортные системы. Они фиксируют отдельные перемещения и могут быть агрегированы в матрицы потока.
  • Экологические архивы:] Хронология колец деревьев, ледяные керны, записи осадков озер и результаты палеоклиматической модели. Эти реконструируют температуру, осадки и производительность сельского хозяйства.
  • Археологические данные: Местоположение, радиоуглеродные даты, типологии керамики и образцы древней родословной ДНК. Они предоставляют доказательства движений, которые предшествовали письменным записям.
  • Исторические ГИС: Оцифрованные карты исторических дорог, портов и городских центров. Они определяют физическую инфраструктуру, которая формировала мобильность.

Подготовка данных имеет решающее значение. Исторические записи часто содержат несоответствия в соглашениях об именах, форматах дат и географических единицах. Например, название деревни могло изменить правописание на протяжении веков, или перепись могла опустить определенные этнические группы. Очистка данных включает в себя стандартизацию топонимов с использованием газетчиков, вменение отсутствующих дат и кодирование категориальных переменных, таких как «оккупация» или «родственная группа» в численные особенности. Один многообещающий подход заключается в использовании обработки естественного языка (NLP) для извлечения структурированной информации из неструктурированного текста, такого как записи в дневнике или правительственные отчеты. База данных [FLT: 0]HistPop [FLT: 1]] из Кембриджского университета является хорошим примером очищенного, открытого ресурса, который объединяет данные переписи с геопространственными слоями.

Обработка предвзятости и недостающих данных

Исторические записи редко бывают полными. Популяции, которые были неграмотными, кочевыми или маргинализированными, часто недопредставлены. Модель машинного обучения, обученная только официальным данным переписи, может перепрогнозировать движения среди богатых землевладельцев, пропуская миграцию порабощенных народов или сезонных рабочих. Исследователи должны учитывать эти предубеждения, взвешивая данные, используя несколько методов вычисления или включая прокси-варианты. Например, наличие определенного типа керамической керамики может служить прокси для движения определенной культурной группы даже при отсутствии письменных записей. Исследование PNAS 2022 года показало, что включение генетического расстояния между популяциями как особенность значительно улучшило прогнозы межрегиональной миграции в Европе в бронзовый век.

Другим критическим аспектом является временная гранулярность. Исторические данные часто объединяются в течение десятилетий или даже столетий, в то время как фактические миграционные события, возможно, происходили короткими всплесками. Перепись, проводимая каждые десять лет, может пропустить волну миграции, которая происходила между ними. Исследователи могут решить эту проблему, используя методы интерполяции или сосредоточившись на событиях с более высоким временным разрешением, таких как списки пассажиров судна или регистрации лагерей беженцев. Ключ должен быть прозрачным в отношении ограничений и проверить, являются ли результаты надежными для различных временных агрегации.

Особенности инженерии для исторической миграции

Инжиниринг функций - это процесс преобразования исходных данных в переменные, которые модель машинного обучения может эффективно использовать. Для исторических движений населения это требует знания домена о том, что стимулировало миграцию в разные эпохи и регионы. Общие функции включают:

  • Индексы экологического стресса: Сочетание температуры, осадков и качества почвы в единый показатель жизнеспособности сельского хозяйства. Например, индекс засухи можно рассчитать по данным о кольцах деревьев.
  • Экономические факторы, влияющие на рост заработной платы: различия в заработной плате между местом происхождения и местом назначения, цены на землю, налоговые ставки и наличие общих земель. Они могут быть восстановлены из исторических реестров и ценовых рядов.
  • Переменные социальной сети: Присутствие предыдущих мигрантов из одной деревни в пункте назначения, лингвистическое сходство и общие религиозные институты.
  • Политические и институциональные факторы: Изменения границ, законы о призыве на военную службу, религиозные преследования и правила наследования. Они часто категоричны и требуют тщательного кодирования.
  • Расстояние и доступность: Расстояние и доступность: Расстояние до Евклида, время в пути по историческим дорогам, доступ к портам и наличие судоходных рек. Эти факторы определяют стоимость перемещения.

Не менее важен выбор функций. С десятками или сотнями потенциальных предикторов переобучение представляет реальную опасность. Такие методы, как рекурсивная устранение признаков, регрессия LASSO и оценки важности функций из моделей на основе деревьев, помогают определить наиболее информативные переменные. Цель состоит не в том, чтобы включать все, а в том, чтобы захватить ключевые драйверы при сохранении интерпретируемости.

Методы машинного обучения, адаптированные к истории

Не все алгоритмы МО одинаково подходят к историческим данным. Выбор зависит от типа прогнозирования (классификация эпизодов миграции против регрессии численности населения), размера набора данных и необходимости интерпретируемости.

Надзорное обучение: обучение на основе известных миграций

Когда исследователи имеют четкие исторические примеры миграции (например, миграция ирландского картофеля, Великая миграция в США), они могут использовать контролируемое обучение. Модель обучена по таким признакам, как расстояние, климатические аномалии и экономические индексы, с целевой переменной, являющейся ли событие миграции. Рэндомские леса и XGBoost популярны, потому что они хорошо обрабатывают табличные данные и обеспечивают показатели важности признаков, помогая историкам понять, какие факторы были наиболее влиятельными. Например, модель может показать, что 10%-е падение урожайности зерна было самым сильным предиктором миграции из сельской местности в город в Швеции 19-го века.

Нейронные сети, в частности многослойные перцептроны, могут захватывать еще более сложные взаимодействия, но ценой интерпретируемости. Они лучше всего подходят для больших наборов данных со многими особенностями. Свёрточные нейронные сети (CNN) были применены к историческим картографическим изображениям для извлечения схем поселений, в то время как рекуррентные нейронные сети (RNN) могут моделировать временные последовательности миграционных потоков. Выбор между этими архитектурами зависит от формата данных и исследовательского вопроса.

Неконтролируемое обучение: обнаружение скрытых шаблонов

Когда не существует никаких обозначенных событий миграции, неконтролируемое обучение может кластеризировать популяции на основе общих характеристик — языковых семей, похоронных практик или генетических маркеров. K-средства кластеризации и DBSCAN были использованы для идентификации «горячих точек» миграции в древнем Средиземноморье. Особенно инновационным приложением является сетевой анализ в сочетании с кластеризацией: рассматривая поселения как узлы и торговые пути как края, алгоритмы обнаружения сообществ могут показать, как популяции перераспределяются по сетям. Научная работа по «Мобильности Римской империи» использовала такие методы, чтобы показать, что миграция на большие расстояния была намного выше, чем предполагалось ранее.

Методы уменьшения размерности, такие как анализ основных компонентов (PCA) и t-SNE, также ценны для визуализации высокоразмерных исторических данных. Например, PCA, применяемый к древним образцам ДНК, может выявить кластеры, соответствующие миграционным волнам, в то время как t-SNE может показать, как разные популяции относятся друг к другу в генетическом пространстве. Эти визуализации часто генерируют гипотезы, которые можно проверить более строгими методами.

Обучение с подкреплением: моделирование агентно-ориентированных движений

Усиление обучения (RL) встречается реже, но набирает обороты. В RL «агент» (представляющий группу людей) узнает политику, когда нужно двигаться, основываясь на экологических наградах (доступность продуктов питания, безопасность, социальные связи). Симулируя тысячи агентов в течение нескольких поколений, исследователи могут проверить гипотезы о факторах толчка и тяги. Например, модель RL может показать, как небольшое изменение средней температуры может вызвать каскад переселений. Это особенно полезно для доисторических обществ, где письменные записи отсутствуют.

Преимущество RL перед традиционными моделями на основе агентов заключается в том, что агенты изучают оптимальные стратегии, а не следуют фиксированным правилам. Это позволяет проводить эмерджентное поведение, которое можно сравнить с археологическими данными. Если смоделированное распределение населения соответствует археологической записи, это предполагает, что структура вознаграждения, встроенная в модель, фиксирует фактический процесс принятия решений историческими людьми. База данных FamilySearch предоставляет богатый источник генеалогических данных, которые могут быть использованы для проверки таких симуляций.

Тема: Предсказание миграции из пыльной чаши

Американская пыльная чаша 1930-х годов предоставляет хорошо документированное историческое событие, которое может моделировать ML. Используя данные переписи на уровне графств, карты эрозии почв и климатические записи, исследователи обучили классификатор, повышающий градиент, чтобы предсказать, какие округа будут испытывать чистую миграцию. Модель достигла более 85% точности на затянувшемся тестовом наборе. Важно отметить, что, хотя засуха была основным драйвером, доступ к железным дорогам и присутствие существующих сообществ мигрантов значительно увеличили вероятность переселения. Такой вид понимания может информировать современное планирование бедствий: если голод ударит по региону сегодня, какие города назначения получат наибольшее количество мигрантов?

Случай с пылью также иллюстрирует важность временной динамики. Миграция происходила не сразу, а волнами, соответствующими последовательным неурожаям. Модель временнóго ряда, которая включает отстающие переменные, такие как прошлогодние осадки и прошлогодняя миграция, работает лучше, чем статическая модель. Это предполагает, что историческая миграция зависит от пути: прошлые движения формируют будущие через создание сетей мигрантов и истощение местных ресурсов. Игнорирование этой динамики может привести к вводящим в заблуждение прогнозам.

Тема: Неолитическая экспансия в Европу

Распространение сельского хозяйства с Ближнего Востока в Европу около 8000 лет назад является одним из наиболее изученных движений населения в археологии. Традиционно это рассматривалось либо как миграция людей (демическая диффузия), либо как принятие идей (культурная диффузия). Машинное обучение предоставило новые доказательства для модели демической диффузии. Обучая случайный лес на радиоуглеродных датах, типах почв и реконструкции климата, исследователи обнаружили, что скорость распространения соответствовала модели волны прогресса, обусловленной ростом населения и пропускной способностью окружающей среды.

Модель также определила регионы, где расширение застопорилось или обратилось вспять, такие как Альпы и Балтийское побережье. Эти «узкие места» соответствовали районам с плохими почвами или суровым климатом, предполагая, что факторы окружающей среды были более важными, чем культурное сопротивление. В исследовании PNAS 2222 года упоминались ранее добавленные генетические данные к модели, показывающие, что прибытие фермеров в регион было связано со значительным сдвигом в местном генофонде. Этот вид многопрокси-подхода является тем, где действительно сияет ML: интеграция данных археологии, генетики и палеоклиматологии в единую прогностическую структуру.

Вызовы и ограничения: Пещера историка

Несмотря на свое обещание, применение ОД к историческим перемещениям населения чревато подводными камнями. Первая из них полнота данных и предвзятость, уже упоминавшаяся. Вторая — временная агрегация: исторические записи часто комбинируют миграции в течение десятилетий, в то время как модели ОД обычно работают на годовых или месячных временных масштабах. Миграция, которая произошла в течение десяти лет, может быть неправильно смоделирована как одно событие. В-третьих, существует проблема , смешивающих факторы. Модель может приписывать перемещение населения изменению климата, когда на самом деле оно было вызвано войной, которая совпала с засухой. Методы причинного вывода — такие как инструментальные переменные или двойное машинное обучение — могут помочь, но они требуют сильных предположений.

Другой важный вопрос — интерпретируемость . Глубокая нейронная сеть, которая предсказывает миграцию с точностью 90%, может быть черным ящиком. Историкам необходимо понять , почему предсказание было сделано, чтобы доверять ему. Такие методы, как SHAP (Шепли аддитивные объяснения) и LIME (локальные интерпретируемые модели-агностические объяснения), принимаются для разложения предсказаний на вклады функций. Книга по интерпретируемому машинному обучению Кристоф Молнар является ценным ресурсом для историков, входящих в эту область.

Существует также риск анахронизма . Модели машинного обучения обучаются на современных или недавних исторических данных, но факторы, которые стимулировали миграцию в далеком прошлом, возможно, были принципиально разными. Например, на современную миграцию сильно влияют границы национальных государств и паспортные системы, которых не существовало в средневековый период. Модель, обученная на данных 20-го века, может не обобщать до 14-го века. Исследователи должны быть осторожны, чтобы выбрать функции, которые исторически уместны и проверить модели на внеобразцовые периоды времени.

Этические соображения

Использование машинного обучения для изучения исторических движений населения также поднимает этические вопросы. Предсказательные модели могут быть использованы для оправдания ограничительной иммиграционной политики или для стигматизации определенных групп как «исторически мигрирующих». Историки несут ответственность за донесение своих выводов с нюансами и подчеркивание того, что корреляция не равна причинности. Кроме того, конфиденциальность данных является проблемой при работе с недавними историческими записями, которые могут содержать информацию о живых людях или их близких родственниках. Исследователи должны следовать этическим руководящим принципам для обмена данными и анонимизации.

Опасность презентативности также реальна. Заманчиво использовать исторические модели МО для предсказаний будущих миграций, но прошлое не является идеальным ориентиром. Изменение климата, технологические изменения и геополитические сдвиги создают новые условия, которые могут не иметь исторических прецедентов. Наиболее ответственное использование этих моделей заключается не в том, чтобы предсказывать будущее, а в том, чтобы понимать прошлое на своих собственных условиях, при этом извлекая осторожные уроки для настоящего.

Будущие направления: более комплексный подход

Будущее ML в исторической демографии заключается в нескольких сходящихся тенденциях. Во-первых, оцифровка архивов продолжается быстрыми темпами: база данных FamilySearch в настоящее время содержит более 5 миллиардов оцифрованных записей, многие из которых имеют встроенные географические данные. Во-вторых, дистанционное зондирование (LiDAR, спутниковые снимки) раскрывает скрытые модели поселений в таких местах, как Амазонка и Центральная Азия, предоставляя новые данные для моделей ML. В-третьих, междисциплинарные группы — включая историков, компьютерных ученых, географов и археологов — формируют партнерские отношения для создания общих инструментов с открытым исходным кодом. Проект Histo.fyi является одной из таких инициатив, направленных на создание стандартизированного трубопровода для анализа исторических данных с ML.

Еще одним интересным событием является использование моделей основания — больших предварительно обученных моделей, которые могут быть настроены для конкретных исторических задач. Например, языковая модель, обученная миллионам исторических документов, может быть адаптирована для извлечения информации, связанной с миграцией, из неструктурированного текста. Аналогично, модель видения, обученная на исторических картах, может автоматически обнаруживать поселения, дороги и границы поля. Эти модели фундамента могут значительно сократить время и опыт, необходимые для подготовки исторических данных для анализа ML.

Наконец, есть захватывающая возможность контрфактной истории через ML. Обучая модель на исторических данных, а затем изменяя вход (например, что, если бы Шелковый путь не уменьшился?), исследователи могут генерировать альтернативные сценарии. Хотя, очевидно, спекулятивные, эти упражнения могут подчеркнуть причинные связи и проверить надежность исторических теорий. Они также имеют педагогическую ценность, помогая студентам понять, что история не является неизбежной, но формируется непредвиденными обстоятельствами.

Интеграция ML с технологией цифрового двойника также находится на горизонте. Цифровой двойник исторического региона — сочетающий демографию, экономику, окружающую среду и инфраструктуру — может быть использован для моделирования движений населения при различных сценариях. Это позволило бы историкам проводить виртуальные эксперименты, которые невозможны в реальном мире. Этические и эпистемологические последствия глубоки, но потенциал для понимания одинаково велик.

В заключение, машинное обучение не означает замену историков алгоритмами. Это мощное дополнение — способ масштабирования человеческого понимания на протяжении веков и континентов. При продуманном применении оно может выявить закономерности, которые всегда присутствовали в данных, но невидимы невооруженным глазом. Прогнозирование исторических движений населения является одним из самых многообещающих рубежей этой новой цифровой истории, и работа только начинается. Ключ заключается в том, чтобы сохранить критическую перспективу: принять силу ML, оставаясь в курсе его ограничений, предубеждений и этических последствий. С этим балансом историки могут открыть новые понимания человеческой мобильности, которые обогащают как науку, так и общество.